刚刚,Anthropic报告泄露Model 2,比Mythos 5更强的内部模型
编辑|Panda
刚刚,Anthropic 发布了自家的第二份《 风 险报 告(Risk Report) 》,共 186 页,信息量巨大。

其中最惹眼的一个关键词是 Model 2 ,这是一个能力超过 Claude Mythos 5、尚未向公众开放,却已经在 Anthropic 公司内部大量使用的模型。

Anthropic 表示, Model 2 已被大量用于编码、数据生成 和其他智能 体任务,也广泛参与研究与工程工作 ,既有人机交互式使用,也有持续运行的智能体部署。它与 Mythos 5 并列为公司截至 7 月 15 日能力最强、内部使用最多的两个模型。
但我们能知道的也仅止于此。报告没有公布 Model 2 的参数规模、训练成本、上下文长度和架构,没有解释它与 Mythos 5 是否共享权重或训练路线,甚至没有说明「Model 2」究竟是内部真实代号还是临时标签。能够确定的是,报告把它归为「Mythos-class model」,称它 在部分领域强于 Mythos 5、部分领域稍弱,但总体略强 。
Anthropic 目前「没有对外发布它的计划」。这句话也明示了一种正在形成的新常态:前沿模型的真正能力边界,可能先存在于实验室内部,深度参与下一代模型的研发,却不再与面向消费者的产品线重合。
下面我就来具体看看这份报告的内容。

报告地址:https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf
Model 2 到底有多强?
Anthropic 对 Model 2 的定性比较克制。报告称,它在许多与内部工作有关的任务上,相比 Mythos 5 是一次「明显改进」,但进步幅度没有从 Claude Opus 4.6 跳到 Mythos Preview 时那么大。由于它没有完成通常面向外部部署的全套评估,Anthropic 也承认,对其能力判断的信心低于公开模型。
Anthropic 在报告中给出了两个内部指标,应该值得一看。
第一个是 CoBench。这是一套由 449 个真实 Anthropic 研发问题组成的内部评测:模型被放回某个历史时间点,只能查看当时的代码库、日志、内部消息和文档,然后寻找后来由工程师解决的问题的根因。

Model 2 得分 62.8%,高于 Mythos 5 的 50.3%和 Mythos Preview 的 54.8%。Anthropic 估计,一个真正能够全面替代公司技术人员的系统至少应达到 85%。换言之, Model 2 依然无法「替代研究员」 ,但它已把上一代最强内部模型甩开十多个百分点。
第二个是 Anthropic 版 Epoch Capability Index,即 AECI。
Anthropic 的内部能力指数显示,2026 年的 Mythos 系列明显偏离此前趋势线;Model 2 未显示在图中,报告称其约比 Mythos 5 再高 1.5 分,但误差较大。
有限数据表明,Model 2 比 Mythos 5 高约 1.5 分,不过误差区间很大,而且这个增幅小于 Mythos Preview 到 Mythos 5 的提升。
它已经被应用了吗?答案是肯定的,而且范围不小。
报告称, Model 2 完成了 Anthropic 新设的「内部部署前审查」 。
审查由对齐训练、对齐测试、控制、安全、可解释性和压力测试等团队参与。Anthropic 还首次对它试行分阶段部署:先在带有更强危险行为阻断控制的内部界面上使用,以较低风险收集真实工作数据,再开放到限制更少的内部部署环境。报告称, 它的内部 使用 量与 Mythos 5 相近 。
这也带来一个微妙的不对称:公司一方面认为 Model 2 足以进入研发生产线,另一方面又承认没有完成惯常的全部部署前测试。
Anthropic 的解释是,内部部署前审查本来就比完整对齐审计耗时更短、投入人力更少;审查时看到的往往还是训练中的模型,而非最后部署快照,也不可能提前获得真实使用证据。对普通软件来说,「内部使用」常被理解为风险较低的试运行;但当模型可以写生产代码、访问工具并生成子智能体时,公司内部本身就是高风险部署面。
一个模型正在帮助制造下一个模型
Model 2 的意义还在于,它 已经嵌入 Anthropic 的自我研发循环 。
报告披露,Mythos 5 和 Model 2 被广泛用于研究与工程,Claude 现在编写了合入公司生产代码库的「大多数」代码。Anthropic 判断,AI 已显著加快内部研发,但整体速度尚未达到没有 AI 时的两倍——这是其《负责任扩展政策》设置的预警线之一。
这里出现了一组看似矛盾的数字。此前针对 Mythos Preview 的内部调查中,受访研究人员自报的个人生产率提升几何平均值约为 4 倍;但 18 人中只有 1 人认为模型已经可以直接替代一名初级研究科学家或工程师。
Anthropic 解释,研究者更愿意把适合 AI 的任务交给模型, 个人任务变快也不等于整个研发流程同比加速 。模型仍不擅长管理持续一周的模糊任务、理解组织优先级、核验结果,以及形成研究「品味」。
公司给出的结论仍是「低风险」,但信心正在下降。它承认,最具体的一批任务评测已经「饱和」,难以继续反映能力增长;内部先行指标又存在滞后,可能看不到最新一轮加速。
报告把 高 风险场景 描述为一种复利循环: AI 加快 AI 研发,新模型再加快下一轮研发 。Anthropic 认为这个循环尚未越过门槛,但 Model 2 已经让它不再只是理论问题。