登录

模型


分类

记忆

1、在LLM的发展和应用过程中,,随着应用场景向长周期智能体(Long-HorizonAgents)和终身学习(LifelongLearning)演进,模型记忆的局限性逐渐显现,并受到学界与工业界越来越多的关注。
文章

模型记忆研究也由「保存更多历史信息」逐渐延伸至「信息如何进入模型、如何更新,以及能够持续影响多久」。
文章

权重

3、尽管外部存储和长上下文窗口在事实查询方面具有实用性,但在涉及深度逻辑推理及隐式知识内化时存在局限,促使业界同样在探讨将经验直接编码并存储在模型权重(即内部参数)中的可行性。
文章

①斯坦福大学、加州大学圣地亚哥分校等机构的研究者于2024年提出TTTLayers,将小型模型的权重用作隐藏状态,并在处理输入时持续更新,以利用更长序列中的信息。
文章

尝试

同时,基础模型尝试在骨干网络中维持一个持久的参数化记忆状态
文章

多久

③在信息能够影响模型多久的问题上,KVCache主要服务于当前推理;
文章

其它

大模型为什么开始把记忆写进模型内部?
文章