贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness
在很多人的印象里,AOE Tech Labs 是一家以产品创新见长的公司。
2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。三次发布,三个此前市面上没有的东西,全部围绕真实办公场景。
但这三件事没有一件是界面创新。 外界看到的是产品形态,每一次底下动的都是 Ha rness。
8 月 7 日,他们把这层底座直接摆上了榜单 ——Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash,成绩超过了一众海外顶尖模型。 前面三次,这层技术是以产品形态交付的;这一次,它自己上场接受计量。
完整报告链接: https://floatboat.ai/news/harness-benchmark
这件事之所以值得单独看,是因为它填的是行业里一块公认重要、却长期没人报数的空白。
大家早就承认那个等式:
Model + Harness = Agent。
加号左半边被反复计量,每次模型发布都附一张榜单。加号右半边 —— 模型之外的那半个系统,包括模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里 —— 从来没有一把尺子。
这份数据要回答的,就是右半边到底值多少分。而它给出的答案,可以用四个字概括: 多快好省 。
一、先看「好」:
$0.175 打 $10,五项全部超越
Floatboat 这次的测试底座是 DeepSeek-V4-Flash,官方 API 谁都能调,输入 $0.14 / 百万 token、输出 $0.28。按 Agent 场景典型的 3:1 输入输出比折算,混合价 $0.175/M。
对面是 Claude Opus 4.8,$5 / $25,混合价 $10/M—— 贵 57.1 倍 。
图 1|$0.175 的底座,五项全部超过 $10 的旗舰 左:混合单价对比,DeepSeek-V4-Flash $0.175/M 对 Claude Opus 4.8 $10/M,贵 57.1 倍(线性轴,不作对数压缩)。右:零线即 Opus 4.8 的位置,五项全部落在其右侧,条长为相对领先幅度,小字为两套系统原始得分(Floatboat : Opus 4.8)。这些领先幅度要和左图一起读 —— 又好,又便宜,成本只有对手的 1/57。
五项全部超越。
「好」在 Agent 这件事上是硬门槛 —— 一个工作台如果交付不了真实任务,再便宜也不会有人每天打开它。而过去这道门槛只能用钱换:能干活的太贵,敢放开用的干不动活。
这份数据要说的是,这个交换可以被取消。而取消它的不是模型。
二、这不是一次「便宜模型真香」
这种价格反差的第一反应通常是低价模型追上旗舰的老故事。但这次的数据自己把这个读法否掉了。
同一个 DeepSeek-V4-Flash,跑在 DeepSeek 官方自己的 Harness 上,DeepSWE 只有 54.4,低于 Opus 4.8 的 58.0。放到 Floatboat 上,它跑到了 67.25。
更完整的一组对照更能说明问题:在 Terminal Bench 2.1 上,DeepSeek 官方 Harness 与 Opus 4.8 打成平手(82.7 : 82.7),其余四项全部落后。
也就是说, 同一个模型在模型厂自己的系统里,对 Opus 4.8 一项没赢;接入 Floatboat 之后,五项全胜。
模型权重没变,单位成本没变。变量只有一个。
三、一次刻意用
最便宜模型做的单变量实验
值得先把方法学摆完整,因为整个结论的合法性都压在「单一变量」这四个字上。
Floatboat 公布的对照配置是:
双方统一使用 DeepSeek-V4-Flash 0731 模型底座;
DeepSeek 官方公开基准中的 Code Agent 任务使用 DeepSeek Harness(即将发布)的极简模式 ,配置为 max 档位、top_p=0.95、temperature=1.0;
Floatboat 侧统一在 Floatboat Evaluation Harness 下执行,大部分基准的模型推理由 DeepSeek 官方 API 提供;
所有任务在完全隔离、开箱即用的物理沙盒环境中独立运行,输入参数完全一致。
这里有一个容易被读漏的细节: 对 照组不 是「裸模型 API」,而是模型厂自己的 Harness 。54.4、73.2、82.7、25.1、70.7 这五个数字是 DeepSeek 官方系统的成绩,模型厂的工程能力也在场。
这让对照比「产品对裸 API」严格得多,也让差值更难被解释成「对手没认真配」。
还有一个刻意保守的选择:对照取 0731 正式版,而不是更早的 Preview checkpoint。如果用 Preview,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%—— 一个漂亮得多的数字。但那里面混进了模型自身后训练的迭代,不能归给 Harness。这一行数据在官方总表里也在,Floatboat 没有拿它做宣传口径。
至于为什么选最便宜的模型,理由是反过来的: 用顶级模型跑榜会得到「高分 + 归因不清」 ,没人能判断分数来自模型还是 Harness。锁死同一个最便宜的底座,一边接官方 Harness,一边接 Floatboat Harness,差值就只能落在 Harness 上。这是更严苛的证明条件,不是更容易的那个。
产品本身模型中立,支持接入各家主流模型,本次单一底座只是评测方法论的要求。
四、真正的信息在排列顺序里
如果只看「五项都赢了」,这还只是一次跑分。有信息量的是增益的分布。
把同底座的 Harness 增量单独拉出来:
图 2|模型不变,只换 Harness:任务越长程,Harness 增益越大 左:同一个 DeepSeek-V4-Flash 0731 底座,两端分别为模型厂官方 Harness 与 Floatboat Harness。右:按程长从短到长排列,1.9%(短)→ 9.6%(中)→ 12.6%(中长)→ 19.9%(中长)→ 23.6%(长),五项全部具备官方 Harness 对照,程长分档非递减、增益单调递增,无例外项。Toolathlon 与 BrowseComp 同属中长程档,同档内按增益排序。
1.9% → 9.6% → 12.6% → 19.9% → 23.6%。
五项全部有官方 Harness 对照,按任务程长从短到长排下来,程长分档非递减、增益单调递增,没有例外项。 任务越长程,Harness 的增益越大,一路涨到 23.6%。
五项里只有 BrowseComp 官方未披露平均步数,它的「中长程」是依任务设计判断的结论 —— 多跳检索、搜索引擎首屏无法直接回答,检索链长度事前不可知,需跨源证据交叉验证,单次任务的检索与核验轮次与 Toolathlon 同量级。它与 Toolathlon 同属中长程档,同档内按增益排序,两者先后不代表程长差异。
任务链条越长、环节越多、越依赖跨步骤的状态维持与自我修正,Harness 的增益越大;任务越短、越单点、越接近一次性问答,增益越小。
而真实工作恰好是长程的那一类。 用户日常要处理的不是一条命令,是跨文件、跨应用、跨很多步、中途还要改主意的活儿。这条规律指向的,正是 Harness 在真实工作里的作用域。
五、五套题都不是自己出的
上面所有数字的分量,取决于题目是谁出的。
图 3|五项基准的出品方与关键设计 没有一项是自家出的题,其中 BrowseComp 出自 OpenAI 官方。 在这张 OpenAI 自己出的榜上,Floatboat 的 87.80 超过了 GPT-5.6 Terra(87.5,贵 25.7×)、Claude Sonnet 5(84.7,贵 22.9×)、Opus 4.8(84.3,贵 57.1×)和 GPT-5.6 Luna(83.3)。
「113 个完全未泄漏的代码库,平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点,还混着陈旧数据」—— 这类任务过不去提示词技巧那一关。 它要求真实的文件存取、多步排错、跨应用状态维持,以及在错了之后自己发现并纠正。
这也解释了增益为什么集中在长程任务上:短程任务考模型的单次输出质量,长程任务考的是整个执行系统。
六、HLR:给 Harness 装一把尺子
Floatboat 给 Harness 划的边界是这么一句:
「 Floatboat 正在把前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。 」
配套提出的指标叫 HLR(Harness Leverage Ratio,Harness 杠杆率) 。它问的其实是一个很朴素的问题: 同一笔预算,花在换模型上,还是花在换执行系统上,哪边更值? (价格只用来决定拿哪个模型当参照,不进入公式本身 —— 分子分母都是同一项基准上的分数差。)
写成一个人人能看懂的分式:
HLR = 换 Harness 的收益/换模型的收益
分子是模型不动、只把 Harness 换掉,成绩涨了多少;分母是 Harness 不动、把模型升级到一个更强的参照系统,公开成绩涨了多少。
所以 HLR > 1 的含义很直接:只换 Harness 拿到的增量,已经超过升级到那个参照模型所代表的整段公开性能跨度。
以 DeepSWE 代入:
DeepSeek 官方系统:54.4
Claude Opus 4.8 公布成绩:58.0,两个公开系统之间只差 3.6 分
同一个 DeepSeek 模型放到 Floatboat 上:67.25,多拿 12.85 分
不换模型、只换 Harness,拿到了 3.6 倍于「升级到贵 57.1 倍的 Opus 4.8」所代表的公开性能跨度。
(给需要精确定义的读者,完整形式为 :B 为同一项 Benchmark,SB (M,H) 为模型 M 与 Harness H 组合后的系统成绩,M 是保持不变的底座模型,H0、H1 分别为基线 Harness 与待测 Harness,(Mr,Hr) 是用来标定模型跃迁幅度的参照模型系统。要求所有成绩来自同一评价口径,按 Benchmark 分别计算,不跨基准求平均。)
参照系统的选法有一条先声明的规则,这点决定了指标能不能被采信:主参照统一用 Claude Opus 4.8;如果它在某一项上不比基线系统更高,那一项就没有发生模型跃迁,改取该项 最便宜的有效参照 ;取最便宜的而不是分数最高的,是因为分母要衡量的是 一次真实的、代价最小的模型升级 —— 理性用户真会选的那条路 。规则先定,再取数。
图 4|HLR:换 Harness 的收益 ÷ 换模型的收益 柱内为分子(Harness 增量)与分母(基线到参照系统的公开差距)。虚线为 HLR = 1,此线以上意味着只换 Harness 的增量已超过升级到参照模型所代表的整段公开性能跨度。Terminal Bench 一项的参照按规则兜底为 GPT-5.6 Luna,该项全部候选参照的 HLR 区间为 0.26×~1.42×。
0.78× → 1.14× → 1.32× → 1.62× → 3.57×。 序列与程长规律一致,按程长从短到长排列,分档非递减、HLR 单调递增,没有例外项: 越长程,Harness 的杠杆越高。
† 这一项换了参照系统,而换参照的原因本身就是个结论: Opus 4.8 在 Terminal Bench 上是 82.7,与 DeepSeek 官方 Harness 一模一样。 把模型换成贵 57.1 倍的旗舰,这一项公开成绩一分没涨;模型不变、只换 Harness,涨了 1.56 分。既然没有发生模型跃迁,它在这一项就不能当参照。按规则改取最便宜的有效参照 GPT-5.6 Luna(84.7,贵 2.6×),得 1.56 / 2.00 = 0.78×。若改取 Claude Opus 5(83.8)可以算出 1.42×,Floatboat 没有采用 —— 规则事先就固定了唯一取值,不允许在候选里择优。这一项全部有效参照的 HLR 区间是 0.26×~1.42×(Sol 0.26× | Terra 0.33× | Qwen3.8-Max 0.40× | Luna 0.78× | Opus 5 1.42×),Floatboat 把整个区间也一并公开了。
HLR 是本次提出的新指标,不是行业标准,换参照系统数值会变。但它的分子分母全部是第三方基准的公开分数,参照选择规则也公开, 任何人都可以自己重算,也可以反过来用它核算 Floatboat。
七、12.85 分从哪来:
长程任务到底是怎么失败的
提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值,得先回答一个更基本的问题。
Floatboat 的答案是:长程任务的失败,通常不是「某一步答错了」,而是循环没有收敛 —— 它与真正的交付标准越走越远。
走远有两个成因,一个在人这一侧,一个在模型这一侧。
一是交付标准在任务开始时并没有被完整说出来。 真实工作不是标准答案题:人的意图往往随着中间产物逐渐清晰,许多关键标准 —— 语气是否准确、方案能否落地、结构是否符合真实决策流程、结果是否足以直接交付 —— 在第一句话里根本不存在。
二是模型自身的偏移,在长程任务里会被逐轮放大。 这是概率生成的固有属性:每一轮的输出都带一点点偏差,而下一轮又要把上一轮的产物当作前提。短程任务里这点偏差看不见,二十步之后它会累积成方向性的错误 —— 上下文里最初那句要求被逐渐挤出、稀释、改写,模型带着一个已经变形的目标继续往前跑,而且跑得很自信。 偏移不需要出错就能致命:每一步看起来都合理,合起来却不是要交付的那个东西。
这两件事叠在一起,就是长程任务的真实处境:目标本身是模糊的、会变的,而承接目标的模型又在持续漂移。 没有一个系统层持续把它拽回来,跑得越久,离交付标准越远。
这是他们对「Proactive」的定义所指向的地方。
今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。按 Floatboat 的说法,那只是 触发器的主动 ,不是 Agent 的主动。真正的 Proactive Agent OS,不在于系统能否在没人点按钮时开始工作,而在于: 当用户只说出一个模糊目标、甚至自己也还不完全知道什么才算好时,Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。
用他们的原话:
主动性的高级形态,不是替用户定时执行,而是帮助用户发现自己真正要什么,并把它做到。
这条判断也解释了那组按程长排列的数字: 任务越长,未被说明的标准越多,被放大的模型偏移也越多,「持续逼近」的价值就越大;任务短到只有一次问答,既没有可逼近的空间,也没有足够的步数让偏移累积起来。 23.6% 与 1.9% 的差距,量的就是这件事。
为什么这要求整个栈都在自己手里
「持续逼近交付标准」听起来像设计理念,落地却需要四层能力同时成立。在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候,AOE Tech Labs 选择自研 Runtime、Agent Loop、Tools、Infra ,以及 FloatSail (Evolution System) 。这条路慢得多、重得多,在当时看不到回报。
而这四层各自决定了什么,恰好对应长程任务的四种死法:
Runtime 决定 Agent 能碰到什么 —— 进程、文件系统、权限、沙盒边界。DeepSWE 要平均修改 7 个文件、新增 668 行代码,AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行,这些任务的前提是真实的读写权和执行权,不是把文本递进去再取出来。
Agent Loop 决定长程任务能否收敛。它不是让模型机械地多跑几轮,而是让每一轮探索都缩短当前结果与交付标准之间的距离:从执行中获得新信息,从观察中发现偏差,从失败中修正路径,从中间产物里反推用户没明说的要求;该回退时回退,该追问时追问。
前面说的两种走远,都要在这一层被按住。 对模糊目标,它负责把标准逐轮问出来、试出来;对模型偏移,它负责不让偏差过夜。 这意味着每一轮的目标锚点要被重新对齐,而不是任其在上下文里被稀释 —— 什么信息必须原样留在窗口里、什么可以压缩、什么该丢,判断错了偏移就开始累积;也意味着系统要能对自己的中间产物做校验,在偏差还只是偏差的时候把它按回去,而不是等它长成方向性错误。 一个只会往前跑的循环,跑得越久错得越远; 一个会回头核对的循环,才可能在第 20 步还朝着最初那个目标。
上面说的那种「主动」,物理上就住在这一层。
Tools 决定模型能否正确消费结果。工具的粒度、返回结构、错误语义 —— 一个把失败包装成空字符串的工具,会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见,在 20 步任务里是致命的。
Infra 决定失败能否被发现。状态持久化、并发、可观测性 —— 如果一次长程执行的中间状态无法回溯,那连「哪一步坏了」都不知道,优化就无从下手。
四层里任意一层是别人的,上限 就是 别人的上限。 当 SDK 的 Agent Loop 在第 20 步丢了上下文,套壳者能做的只有换个提示词绕一绕,自研者可以直接改循环。这是「能不能修」的差别,不是「修得好不好」的差别。
FloatSail (Evolution System) 解决的是时间维度和个性化的问题:模型多、更新快,任务越来越复杂。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进,并在新模型出现时延续已经形成的系统能力。
「技术上,只有自己完全可控的系统,才能驾驭高度不可控的模型,实现最大化模型的智能。」 —— AOE Tech Labs 团队
回到开头那个判断 —— 为什么每一次产品形态创新,底下动的都是 Harness:这个技术判断与团队构成直接相关。创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验;两位技术合伙人中,一位拥有模型训练经验,另一位具备 OS 底层技术栈经验。 模型训练、操作系统底层与亿级产品工程三类能力汇合,团队自然会把 Agent 当成系统工程问题,而不是提示词问题。
产品见长和技术见长在这里不是两件事: 能把「用起来舒服」做到位的团队,本来就得先把 Runtime 和 Loop 攥在自己手里。
八、再看「多」:
榜单跑的是一个被削薄的环境
这份成绩单还有一个反直觉的注脚: 它比用户真实拿到的环境弱 。
评测为了可复现而剔除变量,产品为了能干活而叠加能力,两者本来不是同一个东西。
用户实际使用的 Floatboat 客户端,把文件管理器、文件编辑器、浏览器原生集成进了产品本身,并接入 3000 多个在线服务和各类多模态模型 。市面上的 Agent 产品几乎千篇一律:进去就是对话框,选一个固定文件夹作项目入口,AI 生成的文档要去别处打开编辑,AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成,不需要打开文件选择器上传,不需要决定下载到哪里,拖拽即可。
对 Agent 而言,这些不是界面,是 可调用的工具面 :更多可用工具、更短的环境往返、更完整的执行闭环。AOE Tech Labs 确认,完整客户端环境下运行同一批基准,成绩高于本文公布的数字,具体分数后续披露。
「产品设计上,只有让人用的舒服,才能最大化人的潜力。」 —— AOE Tech Labs 团队
顺着那条程长规律看,这件事是自洽的: 工具面越宽,人用得越舒服,隐性知识越多,长程任务的增益越大。 而真实工作全是长程任务。所以榜单上的数字是保守下限。
那个待披露的差值,可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」,这个差值将回答下一个问题: 优秀的人机交互设计值多少分。
九、「快」和「省」:
便宜到不需要掂量,
Agent 才会被真的用起来
最后回到成本这一侧,它的意义不只是省钱。
这五项基准全部是任务完成质量, 材料中没有延迟或耗时数据,因此这里不对推理速度作任何数据声称。
「省」是明账。混合价 $0.175/M 对 $10/M,五项全胜的对手贵 57.1 倍。往上看整张价目表,更贵却分数更低的参评系统在 AutomationBench 上是 9/9、Toolathlon 4/4、BrowseComp 6/8、DeepSWE 5/8、Terminal Bench 5/9。
而「快」指的是这个价格带来的使用方式改变。一个长程任务的成本可以忽略,跑歪了重跑一次,代价同样可以忽略。Opus 4.8 贵 57.1 倍,很多团队用它时要先掂量这一趟值不值。 当成本低到不需要掂量,Agent 才会被真的用起来,而不是被珍惜着用。
「快」的另一半在人这一侧:客户端省掉的那些找文件、上传、下载、切应用的往返。所谓总周转时间,从来不只是首 token 延迟 —— 找到文件要多久,Agent 能不能直接读写保存,浏览器和在线服务是否在同一个执行环境里,中途失败能不能回退而不是从头再来,用户改了要求能不能沿用已有上下文继续。这几件事合起来,才是「快」在这份材料里的确切含义。
多、快、好、省,四件事在这份数据里第一次同时落地: 提升任务种类更多,环境往返更快,五项基准更好,成本还便宜 57.1 倍。
又快又好,AI Agent 工作台才能真正进入日常工作。 能干活的太贵、敢放开用的干不动活 ——Agent 长期卡在演示阶段,卡的就是这里。这份数据要说明的是,这个交换可以被取消,而取消它的不是模型,是 Harness。
十、现在就能自己跑一遍
上面所有数字都可以复算。
验证路径很短:用同一个模型,对比它在别处和在 Floatboat 里的表现差距。同模型、不同 Harness,差值就是答案。
建议直接拿长程任务试,因为那是杠杆最大的一段,也是日常真正在干的活:让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告,或者把一个模糊的想法交给它,看它能不能帮你把标准先想清楚。