IDC首发Xwork通用Agent实测:常规任务基本能打,复杂任务仍需谨慎
2026年,通用Agent成为AI市场最受关注的方向之一。OpenClaw成为现象级产品,海外有Anthropic Cowork、OpenAI ChatGPT Work等,国内则有WorkBuddy、豆包工作、百度搭子、千问办公等产品,头部厂商纷纷整合产品线,把资源集中到通用Agent上,市场群雄逐鹿。
热度背后是AI应用范式的变革。与去年以Workflow为主的智能体相比,基于Harness架构的通用Agent使用门槛更低、处理复杂任务能力更强,也更容易被普通用户采用。
但市场上的通用Agent究竟能完成多少任务、不同产品各有什么优势、企业又该如何选型,目前还缺少基于统一任务、统一模型和统一测试条件的公开横向实测。
IDC今年启动系统研究,综合企业问卷、用户访谈、产品实测和厂商交流,对主流产品进行深度评测,帮助企业解决选型难题,也为厂商提供市场视角。
一、IDC如何定义“通用Agent"?
IDC将可独立提供服务的智能体分为通用Agent和垂直Agent两类:
● 通用Agent不限定特定场景或固定任务,目前主要用一、IDC如何定义“通用Agent"?于企业办公,包括信息检索与研究、文档生成与处理、数据处理与分析、网页与应用生成、沟通协作和日常事务管理,还可加载Skill、通过工具连接企业业务系统完成更多场景更专业的任务;
● 垂直Agent则预设应用场景,多选择垂直专有模型或接入专业知识库,并配套专用工具和模板,完成专业任务。
Agent Harness是当前这类产品的核心框架,其负责组织上下文、调度工具与Skill、管理任务状态、控制执行环境,完成任务循环。不同产品执行同一任务,其步骤规则、循环处理的差别很大。在同一模型的统一评测下,产品差异很大程度上来自Harness工程能力。
二、企业级应用现状:普遍关注,但当前尚未规模应用
IDC对中国企业用户调研(n=200)显示,早在今年4月,已有合计48.5%的企业开始评估、试点或使用通用Agent。
分行业看,互联网企业比例最高(83.3%),金融63.3%,电信、能源和媒体分别为55.0%、50.0%和50.0%。IDC在Q3的用户访谈显示,企业目前主要在日常办公场景试用,业务应用仍在建设;虽然尚未规模化落地,但几乎所有受访企业都高度关注,并将其视为未来企业级智能体建设的重要方向。
企业对通用Agent的要求可概括为“好不好用、好不好管”。
● “好不好用”: 看任务完成效果、执行效率和交互体验,对应任务表现、成本效率、交互体验、多智能体编排、记忆与工作空间等评估维度;
● “好不好管”: 看能否接入企业系统、安全可控、运行可追踪,对应可观测、安全可控、工具与技能、生态与开放性四个维度。
IDC的调研数据与框架基本一致: 53.6%的企业把跨系统完成端到端任务列为评估通过Agent的首要驱动因素。其余为复杂任务自动化、数字员工、统一入口等能力;另一个问题中,52.0%的企业认为Agent规模落地的关键在于ROI的量化问题,使成本治理和效果观测成为选型重点。
在使用场景上,96.9%的企业用于办公自动化,流程自动化、智能客服(均80.8%)、知识管理与企业搜索(77.7%)、数据分析与商业智能(75.6%)紧随其后。
IDC据此设计近百道测试任务的Benchmark,覆盖邮件、日程、会议纪要、企业知识检索、财报分析、表格清洗、文档与PPT生成、视频生成、CRM与审批等真实场景,按复杂度分为常规任务(58.1%)和复杂任务(41.9%)。
三、好不好用:常规任务基本能打,复杂任务仍需谨慎
(以下内容仅展示部分实测评估情况,更多评估请查阅完整报告)
参评产品在统一模型(DeepSeek-v4 Pro)、统一测试环境(产品开箱状态)、统一工具接口和数据基线(统一仿真MCP Server)下完成近百道非公开测试任务。
(注:产品模型均统一配置为Deepseek-V4 Pro,TeleAgent因无法配置模型默认使用旗舰模式)
常规任务:整体表现不错。常规任务目标明确、执行路径确定,主要包括基础文档输出与改写、邮件与日程安排、会议纪要总结和基础数据处理。多数产品能准确理解相对时间、识别联系人、定位信息,并把结果正确写回日历、待办、CRM等系统,一次交付即可使用的任务占比相对较高。
复杂任务:能交付,但还不能直接可用。复杂任务涉及长上下文、长链路和多步骤循环(复杂PPT、复杂表格、浏览器操作、财报抓取与分析、视频生成等),大部分产品能花数十分钟至数小时交付,但结果通常不能直接用。问题集中在:结构与版式不到位;处理要求遗漏,链路越长漏得越多;长上下文内容常被压缩改写;数据错位与识别异常;并且整体执行代价偏高。例如某浏览器操作类任务平均消耗约473.5万Token,复杂的11页PPT生成平均消耗约353.7万(最高超1,000万)。
从“能交付”到“直接用”之间的差距,就是企业级智能体落地的最后一公里。
四、好不好管:管得住,企业才敢大规模应用
而在企业级场景落地智能体,除了Agent完成任务能力之外,企业更关注的是安全机制、权限控制、操作审计、执行稳定性、企业系统连接能力等企业级能力,这也是通用Agent是否能够真正进入企业级场景的前提。
安全可控与权限: 当前大部分产品已能识别提示词注入,按风险等级自动放行、请求确认或阻断,高风险操作前二次确认,代码和浏览器在独立沙箱运行;企业级产品还需为Agent建立独立身份和权限体系,配置临时凭证和单独设定的操作范围。
运维与数据看板: 企业主要关注三个维度,一是智能体使用普及率;二是成本观测、归因与治理(能否按任务、用户、部门、Agent统计用量并设置预算配额);三是运行失败、停滞或异常调用时能否及时告警并给出处理建议。
数据与知识治理: Agent读写的是企业自己的文档、知识库和业务数据,哪些内容可进上下文、哪些只能内网处理、产物存哪里、保留多久都要提前确定,并建立智能体相关资产的创建、审核、授权和版本管理能力。
五、当前市场产品平均得分
当前业界普遍能力雷达:好用与好管维度仍需补齐
IDC的建议
给厂商的建议
● 持续提高复杂任务完成能力。 常规与复杂任务差距来自规划、长链路执行和多工具协同,都需Harness支撑;相同模型下产品得分仍有明显差异,说明Harness工程能力直接影响任务表现,是下一阶段竞争重点。
● 把企业级能力覆盖到任务执行全过程。 工作空间协同、身份权限、成本统计与预算管控、运行观测和审计留痕需同步建设,接入系统越多,企业对权限、证据和追溯的要求越高。
● 建立场景交付和合作伙伴生态。 厂商难独立完成垂直场景建设,应尽早建立合作伙伴网络;已跑通的任务应主动帮企业构建为Skill,既可在组织内扩散,也减少重复规划的Token消耗。
● 提供更符合智能体的任务交互方式。 复杂任务时长可达数小时,用户需同时发起多个任务或调度多个Agent,传统“一次会话对应一个任务”的交互难以集中管理,应支持并发任务状态监控、异常提醒和随时人工接管。