刷屏了!前OpenAI研究员做的Jev,大家为啥抢着用?
最近,AI 圈又冒出了一个新名字:Jev。
https://typesafe.ai/blog/introducing-system-one-models-and-jev
过去几天里,Jev 在 X、GitHub 和 Agent 开发者社区迅速刷屏。有人拿它在 40 秒内分析 724 条实时广告,有人把它接进 Claude Code 清理上下文,有人用它给 AI Agent 做任务验收,还有开发者把 Jev 接入浏览器 Agent,用它决定下一步该点哪个按钮、进入哪个页面。
LangChain 也很快跟进,在 9 月 20 日发布了一项 Jev-as-a-Judge 实验,测试它作为 Agent 评估器的表现。

连 OpenAI「重置之神」Tibo 也为 Jev 宣传。

Jev 到底是什么?
简单来说,它是一种专门处理「判断题」的 AI。
9 月 15 日,TypeSafe AI 正式发布 Jev,并将这类模型称为「System One Models」。按照 TypeSafe 的定义,这类模型接收一段程序状态或文本信息,然后快速返回结构化判断结果以及对应概率。
Jev 刚发布时, 我们就报道过它 。几天过去,它的热度又上了一个台阶, 相关推文已有 3700 万人围观。

举个例子,假设一个客服系统收到一封邮件,开发者可以让 Jev 同时判断:「这是销售线索吗?」「用户情绪是否激烈?」「是否需要人工介入?」「属于账单、技术还是销售问题?」
Jev 返回的可能是一组概率:销售线索:0.91;需要人工介入:0.12;技术问题:0.83。应用程序可以立刻根据这些数字进入下一步流程。
Wasp 联合创始人兼 CEO Matija Sosic 也在 X 上发布了一段 45 秒的 Jev 解读视频。

目前 Jev 提供三类核心判断形式:Noul、Choice 和 Score。Noul 负责 Yes/No 类型判断,Choice 从给定选项中选择答案,Score 根据预设标准进行评分。每个结果都会附带概率或置信度,多道问题还可以围绕同一份输入同时进行判断。
这套设计让 Jev 很快找到了一个爆发式增长的应用场景:给 Agent 当「裁判」。
今天的 AI Agent 经常需要连续完成几十甚至几百个步骤。写代码、调用工具、搜索网页、修改文件之后,系统还需要判断任务是否已经完成。这类问题恰好符合 Jev 的工作方式。
开发者可以把 Agent 的执行记录交给 Jev,然后询问:「目标是否完成?」「结果是否符合要求?」「是否存在遗漏?」「当前结果质量属于哪个等级?」
LangChain 最新公布的实验就采用了类似思路。他们让 Jev、GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 对固定的 Agent 输出反复评分。在这组规模较小的实验中,Jev 平均每次调用耗时约 0.44 秒,成本约 0.00035 美元,同时在连续评分的一致性上表现突出。LangChain 也强调,这仍属于早期、小规模测试,后续还需要在更多 Agent 和真实生产任务中验证。
Jev 在广告分析上的一组数据,则让它进一步出圈。
开发者 Matthew Berman 分享的一次实验中,系统使用 Jev 分析了来自 37 个品牌的 724 条实时广告,对广告的 Hook、形式、Offer、CTA、用户认知阶段以及广告与落地页的一致性进行分类,总共产生 8724 次判断。

根据开发者公布的数据,这批任务大约 40 秒完成,Token 成本约 9 美分,每条广告的中位处理时间约 216 毫秒。相关案例已经被收录进 Jev 社区案例库。
另一个在开发者圈传播很快的项目叫 fast-jev-compaction。
这个 Claude Code 插件把大量工具调用和终端输出交给 Jev 评分,由 Jev 判断哪些内容仍然与当前任务相关,再根据结果压缩发送给模型的上下文。项目上线后迅速获得大量关注,并出现多个移植版本。

https://github.com/tamaratran/fast-jev-compaction
浏览器 Agent 也成为 Jev 的热门实验场。
目前已经有多个开源项目采用「浏览器读取页面—生成候选动作—Jev 选择动作—浏览器执行」的循环。一个公开的航班搜索 Demo 中,开发者报告整个搜索过程大约耗时 7 秒,成本约 0.004 美元。

这类应用很好地解释了 Jev 为什么突然受到 Agent 开发者关注。
很多 Agent 步骤本质上都属于高频决策:该点击哪个按钮、该调用哪个工具、这条信息是否相关、当前任务是否结束、某个结果是否通过验收。当这些判断每天出现几十万甚至几百万次时,延迟和成本很快就会成为系统设计的一部分。
TypeSafe 在自己的 workflow benchmark 中宣称,Jev 在部分任务上最高达到约 193.6 倍速度提升和 444.6 倍成本优势。TypeSafe 同时说明,这些结果处于他们预计实际收益的高端区间,测试集也由公司模型能力团队制作,因此这些数字更适合作为技术路线的早期参考。
Jev 的命名也透露了 TypeSafe 的野心。
「System One」来自 Daniel Kahneman 在《Thinking, Fast and Slow》中提出的 System 1 概念,即快速、直觉式的判断系统;「Jev」则来自经济学家 William Stanley Jevons。TypeSafe 借用了「杰文斯悖论」的含义:当一种资源的使用效率大幅提高,其总体使用量反而可能迅速增长。
放在 AI 上,这个含义非常明显。当一次智能判断的价格下降几个数量级,开发者会开始在以前根本舍不得调用模型的地方加入 AI。
一条日志是否重要,一封邮件属于什么类型,一个 Agent 是否完成任务,一条广告处于什么认知阶段,一个网页动作该选择哪个按钮——这些微小判断组合起来,可能形成下一代 Agent 系统里非常庞大的调用量。
Jev 目前仍处于 early access 阶段,社区围绕它的浏览器、代码 Agent、广告分析、评估器和上下文管理实验才刚刚开始。
但它已经提出了一个很有意思的问题:在未来的 AI 应用里,真正消耗最多智能算力的,也许会是成千上万个隐藏在软件流程中的小判断。
而 Jev 想成为的,正是这些「智能 if 语句」背后的基础设施。
大家尝试 Jev 了吗,觉得如何?