MemGPT: Towards LLMs as Operating Systems

这篇论文作用是解决内存爆炸问题,引入操作系统的分页管理

Efficient Streaming Language Models with Attention Sinks

注意力下沉,softmax函数的原因导致大模型会将无用的分数扔给第一个,就导致第一个无用但是却不可以删除。本论文的核心就是恒定保留前几个token,来保持模型的平稳

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐