拆解WorkBuddy、千问办公和豆包工作,它们其实不是同一种产品
活是 AI 干的,锅是人背的。
作者丨Reah
编辑丨李娜 岑峰
我们以职场牛马的身份,把同一份脏活同时交给了三家办公 Agent:WorkBuddy、千问办公和豆包工作。本来想试试能不能为自己省出半天时间,结果半天没省出来,先被三个总额问住了。
这份脏活是一张销售流水表,混着不同日期格式、退款、跨季度订单、部门缺失和异常金额,平时谁看了都头疼。
同一份 脏销售流水 和同一句提示词,交给 WorkBuddy、千问办公、豆包工作。 三家都交了 Excel、PPT 和摘要,算出的三个季度总额,最高比最低却多出 57.7%。
除了脏流水,我们还让它们核查五项近期公开信息,又给了一份实际不存在的内部文件;随后拆开三个 macOS 安装包,看它们为 Agent 准备了什么执行环境。
彼得·德鲁克 1999 年谈知识工作者生产力,说这是 21 世纪管理最重要的挑战,同时强调知识工作的质量至少和数量同等重要。 问题恰恰在这儿:数量容易统计,质量依赖判断。职场没法量化产出,自然也量化不了减负。 AI 帮你省了多少时间,你证明不了;老板觉得你还能再快,你也反驳不了。
腾讯、阿里、字节都开始让 AI 进办公室干活了。三款产品都能处理表格、找资料、生成 PPT、调用工具,甚至操作电脑。但用下来最大的感受是:AI 确实能干活,干完之后的核对、判断和背锅,一样没少。Agent 完成任务,不等于人获得减负。省下的时间,可能只是被新的任务迅速填满。
说到底,我们想弄清楚的是:AI 把执行接走之后,判断、核对和背锅到底落在谁头上?省下来的时间又还给了谁?
01
三家三条路线,但没人帮你背锅
押注的分别 是平 台、入口和企业上下文
把三家放在一起看大概能发现虽然都是办公 Agent,但还是有略微侧重。
腾讯想把 WorkBuddy 做成 Agent 时代的平台底座,它开放 Skill、Expert 和 Connector,To B 路线最重;阿里把千问办公嵌进钉钉,用组织入口和多模型供给建立优势;字节的豆包工作则依托飞书企业上下文,以独立客户端和手机远程操控电脑形成差异。表面上都是办公 Agent,背后押注的其实分别是平台、入口与企业上下文。至于计费是否透明、权限是否可控、真实任务能不能完成,则要留到后续实测里回答。
对了,这张表里真正值得看的,其实不只是横向差异,还有它出现的时间。
2026 年夏天前后,三家公司先后对内部办公 AI 做了一轮“组织手术”。阿里将钉钉、MuleRun、CoderWork 与千问办公纳入同一负责人体系,并从多个团队抽取能力搭建千问办公;字节把分散在飞书、TRAE Work、扣子中的相关能力向豆包体系集中,最终推出豆包工作;腾讯则在 9 月 2 日上线开放平台,把 WorkBuddy 从桌面工具推向更完整的平台底座。
三家公司做的第一件大事,都不只是换模型、加功能,而是先重新划定团队、产品和生态的边界。
原因并不难理解。办公 Agent 要接住的不是一次聊天,而是一个人的文件、账号、权限、记忆和任务状态。如果同一家公司内部同时有四个产品在争夺同一个用户,就会出现四份上下文、四套授权和四个互不相认的“你”。
谁不能先整合自己内部的山头,谁就很难承诺替用户整合工作流。
很多人把办公 Agent 理解成 coding Agent 向白领市场的自然下沉。但腾讯保留 CodeBuddy 与 WorkBuddy,阿里分开 Qoder 与千问办公,字节也把 TRAE 编程线与豆包工作线区分开来。三家公司共同做出的选择是:
下沉的是技术,分家的是产品。
编程 Agent 生长在一个有编译器、有测试、有明确报错的世界里;办公室没有这样的裁判。公式可以验证,某笔异常订单该不该计入却无法“编译”。技术可以把执行框架搬进办公室,但业务事实、组织口径和最后的签名责任搬不过来。办公 Agent 不是 coding Agent 换了一层 Office 皮肤,它面对的是另一份人与机器之间的合同。
如果再把国内外放在一起看,还能看到一条更深的路线分野:可以粗略概括为,海外在连接 SaaS,国内在占据桌面。 海外产品更容易从 Slack、Google Workspace 等标准化服务入口接入;中国真实的工作流却大量散落在即时通信、审批系统、本地 Excel 和各家互不相通的文档生态里。只活在一个网页里的 Agent,很难真正把活干完。它必须进入电脑,接触文件、浏览器和 Office,甚至跨进另一家公司的生态。
这也解释了一个很具体的数字:本次测试的三个 macOS 客户端安装后合计占用约 3.5GB。它们不是三个更大的聊天框,而是三家公司分别在用户电脑里,为 Agent 建造一副能够执行工作的身体。至于这三副身体究竟有什么不同,后面拆开安装包再讲。
执行能力被打包成了完整产品,价格却失去了共同的尺子。至少腾讯和阿里都把消耗单位叫作“积分”,但两个积分没有共同汇率,也不能直接换算成“一份报告多少钱”。厂商公布了积分的有效期、扣减顺序和消耗机制,却没有公布具体任务的价目表。
名字统一了,价值没有统一;规则公布了,价目表没有。这就是办公 Agent 当下所处的位置:它已经越过能不能替人做事的基础门槛,开始争夺谁能成为工作的执行层;但用户仍然缺少一套共同的标准,去比较一次执行究竟花了多少钱、替自己做了哪些决定,又留下了多少检查工作。
于是,我把同一份工作、同一句提示词,同时交给了三家;然后,又拆开了三个 macOS 安装包。
实测回答它们做出了什么,逆向回答它们准备怎样做。