「自验证」框架让开源模型反超Fable 5,冲上GitHub热榜
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「 自验 证 」,可以在 Terminal-Bench 2.1 上 超越 Cla ude Fable 5 ,同时整体 成本低约 11 倍 。
GitHub 代码:https://github.com/llm-as-a-verifier/llm-as-a-verifier
具体来说,团队首先让 DeepSeek V4 Flash 针对同一个任务生成 5 条候选 Agent 轨迹。随后,不引入任何能力更强的闭源模型,而是继续使用同一个 DeepSeek V4 Flash,通过 LLM-as-a-Verifier 验证框架对这些候选结果进行验证、打分和排序。最终,DeepSeek V4 Flash 在 Terminal-Bench 2.1 上的任务成功率从: 79% → 88% 。
值得注意的是,这里的成本并不只是验证成本,而是同时包含两部分:生成 5 个候选方案的成本,以及使用 DeepSeek V4 Flash 进行验证和筛选的成本。「自验证」确实会消耗更多 Token,但由于开源模型的 Token 成本足够低,即使加入额外的采样和验证, 整体单任务成本依然显著低于闭源前沿模型 。并且,上述成本已经按照 DeepSeek 涨价后的最新价格计算。
在延迟方面,自验证也不意味着需要串行等待 5 次完整生成。多个候选方案可以 并行生成 ,大部分验证过程同样可以并行执行。在并发资源充足的情况下,整体延迟大致相当于:耗时最长的一次 Agent rollout + 少数几轮验证。因此,候选数量增加并不会让端到端延迟按比例增长。