建立AI时代“度量衡”:OPPO联合OpenKG推出首个端侧AI记忆评测基准MobileMem

随着终端AI从“回答问题”走向长期理解用户和主动任务执行,记忆能力正成为决定AI个性化与主动服务水平的关键基础能力。
近日,OPPO联合中文开放知识图谱(OpenKG)社区,推出行业首个面向端侧AI记忆能力的评测基准MobileMem。同时携手浙江大学、同济大学、东南大学等高校专家团队共同建设。通过构建统一、开放的评测“标尺”, MobileMem让不同技术路线在同一标准下实现可比较、可迭代,加速端侧AI记忆技术发展。
这也意味着OPPO端侧AI记忆的持续投入,正从自身产品能力建设,进一步延伸至行业公共能力建设,积极推动技术开放合作与生态发展。
构建端侧AI “记忆”的“度量衡”
近年来,长期记忆和长程智能体能力评测已取得大量研究进展,但针对移动端长期个性化、多模态生活场景的系统性评测仍相对不足。
与云端智能体相比,端侧AI需要在有限算力、有限存储和隐私保护等约束下,持续积累、更新和利用用户长期记忆,其能力边界和优化目标具有明显差异。
缺乏统一、开放的评测参考,使端侧Agent开发者难以开展有效的A/B测试和性能回归,研究者也难以在一致的任务和评价协议下客观比较不同方案,进而制约了相关技术的持续迭代与生态发展。
OPPO携手中文开放知识图谱(OpenKG)社区,联合浙江大学、同济大学、东南大学等主流高校专家教授团队,基于前沿研究与实际端侧场景实践,共同推出端侧AI记忆评测基准——端侧AI记忆Benchmark ‘MobileMem’,为行业提供开放的评测参考。
该基准评测数据集累计历史上下文规模达百万词元,用于模拟真实用户长期使用过程。在充分借鉴长期记忆、长上下文、多模态智能体等已有研究工作的基础上,MobileMem聚焦端侧AI的真实使用场景与长期个性化需求,主要包括三大核心技术维度:
长期事件建模与检索:覆盖跨时间、跨应用、跨模态事件的记忆存储、更新与检索能力。
跨模态关联与推理:覆盖文本、图像等多模态信息之间的关联理解与推理能力,包括时序推理、关系推理和问答。
持续演化与个性化适应:覆盖用户偏好、社交关系和事件状态随时间变化后的持续更新能力。
举个例子,‘个人生活伴侣’场景中。一个家庭正在计划今年的假期旅行,用户问:“你能帮我规划一次和去年我们喜欢的那次类似的旅行吗?”助手不是生成通用的旅行推荐,而是基于长期记忆,推荐一份反映用户历史偏好、旅行习惯和消费模式的个性化行程,同时避免之前已发现的不便之处。
该场景体现了 MobileMem 对复杂个人记忆任务的综合处理能力,涵盖长期偏好建模、时间维度的信息聚合、多模态推理、记忆关联和个性化决策等关键能力。
MobileMem:从“贡献数据”到“共建生态”
主题:长期记忆