Agent走向长线协作的关键一战:AML首期揭榜,谁将引领下一代记忆范式革命
图源 AML 官方社交媒体账号 值得关注的是,技术讨论的焦点不仅停留在分数与名次本身,更延伸至行业评测范式的建构逻辑 —— 评测契约的标准化、评测流程的公正性、评测数据的完整性等 。社区不再只是围观名次,而是在认真审视评测机制本身的长期价值。一个首期发布的榜单,能同时收获现象级流量与范式级讨论,印证了两点:其一,Agent 记忆已经走向舞台中央;其二,行业对一套可信、公正的记忆度量衡,已经渴求已久。
为什么是 AML
三重隔离,打造一把丈量记忆的权威标尺
AML 的诞生,源于一个日渐清晰的行业共识 —— 大模型的上下文窗口越开越大,但 Agent 的长期记忆能力并未随之水涨船高。 过去,行业评价一个 Agent 记性好不好,往往没有统一的数据集、回答模型、提示词(Prompt) 和判别模型(Judge)。最终的高分可能只是因为使用了更强的下游生成模型,或是针对特定 Prompt 做了过拟合优化,不同记忆系统之间极难进行直接、客观的横向对比。
为了解决这一真实痛点,AML 凭借三大硬核设计,建立了目前业界最为严苛且公正的记忆评测体系:
隔离接口边界,让记忆归记忆,生成归生成 :AML 将参评系统的职责严格收敛到 Add(写入)与 Search(检索)两类接口 —— 记忆系统只负责接收长周期历史,并在问题到来时返回相关记忆证据;Answer 与 Eval 则由平台以统一的模型、流程和聚合规则完成。只有固定了回答与评分的条件,成绩差异才能最大程度上归因于记忆系统本身。
隔离单一数据集的偶然性 —— 多源数据,能力重构 :AML 整合 PersonaMem、LoCoMo-Refined、BEAM 等 10 余个业界主流基准与平台私有测试集,覆盖超过 1500 个对话与任务、约 1.5 亿字符的长程历史、近 5000 道评测题目。更关键的是,所有题目经人工重构,被映射到统一的记忆能力维度。参评者最终得到的不只是一个名次,而是一张可诊断的能力剖面图。
隔离人为操作空间,可复核、可追溯的评测治理 :一个具有行业公信力的榜单,必须对评测契约的可复现性与防刷机制给出透明的工程答复。AML 评分环节采用多评审系统(Multi-Agent Judging System),以保证评测结果准确度和一致性;平台统一封装模型、参数与日志,完整保留检索证据、平台答案与评审记录,配合私有测试集与人工标注校准,刷榜与过拟合的空间被压至最低。
统一的接口链路保证 公平比较 ,多源的数据映射保证 完整剖面 ,透明的治理机制保证 长期可信 ——AML 正朝着成为全行业公认的 Agent 记忆能力统一标尺的方向迈进。
榜单深度解读
工业榜单:MemoraX 断层领跑,MemOS 稳居第二,网易 MEMORY-SMART 成为黑马
根据 AML 官网,在工业榜中,前十名中既有头部大模型厂商的闭源产品,也有多家记忆领域创业公司的 API 服务。
其中, MemoraX 以 58.0 分 的总成绩位列第一,在全部七个能力维度中均排名第一,写入、检索效率也稳居第一梯队 。公开报道显示,与传统向量数据库相似度检索的路线不同,MemoraX AI 构建了以 “可学习记忆策略引擎、记忆基模、自演进 Agent Harness” 为核心的 Agent 记忆技术体系。前者更像是给 Agent 配了一本可搜索的笔记本,而 MemoraX 强调的是记忆的持续自进化、动态更新和跨场景复用。这一技术体系的核心目标是解决大模型在长周期、海量级个性化碎片信息处理中的局限性,通过内化记忆能力,解决大模型失忆症痛点,为 AI 智能体提供原生长效记忆能力。