任务
分类
能力
GPT-6Astra进一步提高了计算机操作的准确性和执行效率,增强了智能体处理复杂任务的能力,也为智能体进入更多接口受限的长尾场景创造了条件。
文章
基座模型厂商:需要同步提升工具调用、长流程规划和环境交互能力,持续增强模型执行复杂任务的能力。
文章
耗时
OpenAI公布的评测显示,Astra完成特定场景专业任务时,相比其他旗舰模型的耗时与输出Token消耗有所降低,例如在OSWorld2.0离线评测的延迟模拟中,单任务耗时比Sol下降约47%;
文章
技术层面,此次变化主要体现在定位准确率提升,单任务耗时和Token消耗下降。
文章
界面元素定位准确率从前代GPT-5.6Sol的76.9%升至92.7%,真实软件任务、终端任务与业务自动化基准的得分均有提升,特定专业任务的耗时和输出Token消耗也有所下降。
文章
把验收标准换成任务级指标:一次通过率、人工介入比例、单任务耗时与成本,试点阶段先把基线立起来;
文章
成本
随着模型Computeruse定位准确率超过九成,单任务成本和耗时同时下降,智能体可以像人一样操作软件,处理难以预先定义的动态场景。
文章
场景
但需要注意的是,虽然模型定位准确率已具备较高的可用度,但Agent的任务级完成效果仍然依赖意图理解、任务规划、上下文处理、工具调用、任务执行等各个环节的表现,在长链路多步骤复杂任务场景下,仍需要Harness层的工程优化来充分发挥模型的能力,这也是当前应用层厂商的差异化竞争的空间。
文章
效果
OpenAI公布的评测显示,Astra完成特定场景专业任务时,相比其他旗舰模型的耗时与输出Token消耗有所降低,例如在OSWorld2.0离线评测的延迟模拟中,单任务耗时比Sol下降约47%;
文章