「说Harness会被淘汰的,肯定没做过工程」,Kimi前CLI负责人戳破了AI圈最大的误解
只有那些真正在一线写过CLI、调过 Agent Swarm 的人才会知道:模型不能解决一切。
作者丨 高允毅
编辑丨 岑 峰
最近 AI 编程圈挺有意思的,正在两极分化。
比如最近爆火的 Pi 走的是“极简Agent派”路线,Prompt 不到 1000 Token,就给 4 个基础工具,主张不折腾、省钱,让模型自己发挥;但另一边,大家又在做 Agent Swarm 和多智能体协作,系统越做越复杂。
这就带来一个圈内都在吵的问题: 底层的 Harness 到底会不会消失?
很多人觉得 Pi 的爆火证明了“模型派”是对的,觉得大模型越来越强,外部的 Harness 迟早得消失。
但 前 Kimi CLI 负责人、Raft 创始人 stdrc(Richard Qian) 提了一个挺反常识的观点: 模型越强,Harness 反而越厚。
只是这个“厚度”变了。以前 Harness 厚,是为了帮模型擦屁股、补能力,比如塞一堆 Prompt 和工具;以后 Harness 厚,是因为模型变强后要干复杂的脏活、累活,得靠它去解决多智能体之间的协作和上层管控。
简单来说 ,复杂度从“能力层”转移到“协作层”了。
01
被误解的 Harness
要看清 Harness 的演化逻辑,必须先破除行业内普遍存在的两层误解。
▎ 误解一:Harness 终将被训进模型,彻底消失
很多人有个误区,觉得大模型以后无敌了,Harness迟早会被训进模型里,彻底消失。
但只要你真正干过工程,就会发现这完全是倒果为因。stdrc 对此直接表示: “说 harness 会被训到模型里的人,肯定是没做过 harness 的。”
他从一线开发的角度拆了三点来解释这一问题:
首先,不是模型变强了淘汰 Harness,而是 Harness 先把路铺好了,模型才知道怎么学。 就像人类社会,得先有了分工制度,大家才学会怎么协作。Harness 是模型的训练场,没有这个外部框架,模型根本没地方去练协作能力。
其次,智能越高,需要的工具反而越复杂。 人类大脑进化了,没退化成原始人,反而搞出了法律和互联网。模型能力在变强,但它解锁的真实世界场景也越来越变态,底层能力被内化了,上层又会冒出更复杂的、需要 Harness 来管的新场景。
还有一点是单任务可以靠模型,复杂业务根本不现实。 在面对长流程、多智能体、随时要看状态的真实业务时,纯靠大模型的脑子去记,必然会出现漏掉、搞错、甚至打架的情况。这不是模型聪不聪明的问题,而是系统工程问题,本来就不该让单个模型去硬扛。
▎ 误解二:模型越强,Harness 就会越薄
还有个流传很广的说法:模型越强,Harness就会越薄。
这个观点看起来挺对的,因为大家发现现在的底层提示词确实在变少,很多以前复杂的工具封装也没必要做了。
stdrc 认为这个观点 “情有可原,但缺乏想象力”。它的问题在于,只看到了底层 Harness 的减法,没看到上层 Harness 的加法。
不可否认,随着模型基础能力提升,大量 “补丁式 Harness” 会逐步退场:比如以前为了防止模型格式输出报错做的强制约束、为了教模型用工具写的长篇大论的 Prompt、还有各种死板的报错重试机制…… 这些为了弥补模型缺陷而存在的底层设计,确实会越来越薄,甚至完全消失。
但这 并非 Harness 的 消亡,而是复杂度的向上迁移。
当模型不需要人类程序员“擦屁股”时,它需要的,是要求你为它建立一套新的法则—— 更强的模型会解锁更复杂的任务场景,进而催生出新的Harness 需求:
比如怎么让好几个 Agent 互相打配合?跨会话的状态怎么同步?怎么做主动的记忆管理?动态权限和不同系统的对接标准怎么定?…… 这些需求在弱模型时代根本不会出现,自然也不会被纳入大家对 Harness 的认知里。
02
重新理解 Harness:
一场“阴阳共生”的动态演化
纠正这些误解后,我们需要回到核心问题:如何定义真正的 Harness?
大众常把 Harness 窄化为“System Prompt + 工具调用封装”。从完整的工程定义来看, Harness 是包裹在模型外层的运行时工程管控层 ,核心解决的是“模型如何稳定、持续、可控地与真实世界交互”的问题。它由四个核心要素构成:Agent 执行循环、上下文与状态管理、工具与资源调度、以及安全与边界治理。
而且 Harness 的范围一直在变大。从早期的模型弱,Harness 只管拼装简单提示词;到中期的模型变强,Harness 演化出多工具并行、子智能体调度;再到现在模型极强,Harness 开始搞智能体集群、跨系统状态同步、多 Agent 任务交接。
stdrc 将模型与 Harness 的关系比作 “阴与阳” 。这是一种此消彼长、共同进化的动态关系。
▎ 局部功能的“内化”,是阴的扩张。
当模型基础能力增强,一部分底层 Harness 会被模型取代。例如在 Kimi CLI 的实践中,stdrc 曾计划移除专用的 subagent 调度机制,改为由模型直接通过 bash 终端实现子任务拆分;同时移除原生的并行工具调用,改为由模型生成工具调用脚本来实现并行。
这是模型能力向外扩张的必然结果,也是外界感知到“Harness 变薄”的真实原因。
▎ 上层需求的“生长”,是阳的延伸。
模型能力每上一个台阶,就会解锁更复杂的业务场景,从而催生出更上层的 Harness 需求。单任务能力成熟后,催生了多智能体协作需求;单会话能力成熟后,催生了跨会话记忆与主动上下文回溯需求。 在这场阴阳博弈中,智能水平越高,它与现实世界的摩擦力就越大。
这个过程没有终点。如同人类大脑比猿类更发达,于是,人类发明了语言、文字、计算机、互联网等更复杂的交互系统。智能水平越高,与世界的交互方式越复杂。Harness 就是 Agent 智能的"交互基础设施",只会随智能升级而持续向外延伸。