登录

AGI时代来了?GPT-6发布:称目前智能水平最高模型


速读:OpenAICEO山姆·奥特曼(SamAltman)发文表示,希望Astra能够开启“新一代的创业、科学发现与创造”,并认为Astra在电脑操作、专业工作、科学研究、编程、网络安全等诸多领域,都是“最强的模型”。 游戏开发公司Playco则使用Astra进行游戏原型开发。
2026年09月04日 11:06

GPT-6 Astra来了。

当地时间9月3日,OpenAI正式发布GPT-6 Astra,并将其定义为“新一代智能”。Astra在拉丁语中意为“星辰、群星”。ChatGPT官方在发布前曾预告:“The stars are almost aligned(星星几乎排列好了)。”

OpenAI称,Astra是“当今世界智能水平最高、对齐表现最好的模型”,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域实现进一步突破。

OpenAI CEO山姆·奥特曼(Sam Altman)发文表示,希望Astra能够开启“新一代的创业、科学发现与创造”,并认为Astra在电脑操作、专业工作、科学研究、编程、网络安全等诸多领域,都是“最强的模型”。

OpenAI总裁格雷格·布罗克曼(Greg Brockman)更进一步表示,人们未来或许会回头将这个时间、这个模型视为AGI(通用人工智能)到来的节点,并称:“欢迎进入AGI时代。”

星星排列好了,GPT-6 Astra正式发布。

“能干活”

据介绍,在电脑操作方面,Astra可以自主填写网络表单、更新CRM客户记录、整理日历,也可以进行网络搜索、在邮件或文档编辑器中撰写总结;还可以分析科学数据、生成图表、创建网站,并运行前端质量测试。对于软件开发任务,Astra可以自主安装和测试软件,并根据屏幕上出现的问题进行排查。

与传统聊天机器人不同,用户可以向其直接给出一个目标。例如,“帮我整理一份财务分析并做成演示文稿”,或者“开发一个游戏原型并测试它是否能正常运行”。模型需要自己拆解任务、调用不同工具、持续执行,再把最终结果交付出来。

在OSWorld 2.0测试中,Astra得分72.6%,GPT-5.6 Sol为65.7%;在延迟模拟环境下,Astra完成一项任务平均约需40分钟,而GPT-5.6 Sol约需75分钟,OpenAI据此称Astra完成任务所需时间约减少47%。

在Mind2Web测试中,结合更新后的Codex harness后,Astra的任务完成速度达到当前GPT-5.6 Sol体验的1.9倍。

在OSWorld 2.0测试中,Astra得分72.6%。

奥特曼在接受外媒采访时表示,Astra在主观体验上与此前任何模型都非常不同,这是第一个让他觉得可以放心让用户直接“试一试”的模型。用户可以让Astra构建复杂互动软件、开发电脑游戏、进行DIY电子工程、运行科学模拟,甚至制作财务模型并同步生成PPT演示文稿。

OpenAI表示,Astra将复杂推理与多步骤工作流结合起来,可以直接生成和处理文档、电子表格和演示文稿,并能够遵循已有模板、调整页面布局,同时尽可能只提取与任务相关的信息。

OpenAI公布的Professional评测中,Astra在AutomationBench取得41.4%,GPT-5.6 Sol为18.1%;在BenchCAD中分别为95.9%和83.3%;在BrowseComp中分别为91.5%和90.4%。

这些指标分别覆盖自动化任务、计算机辅助设计以及网络信息检索等不同工作场景。其中,AutomationBench的差距尤其明显。Astra的成绩达到41.4%,GPT-5.6 Sol为18.1%。

OpenAI公布的企业案例也显示,Astra正在被用于更加接近真实生产流程的任务。

法律科技公司Legora使用Astra进行财务报表审阅,在其相关基准中,Astra带来约40%的提升,并在一次Agent运行中用几分钟审阅41份文件,同时发现了人为埋设的4处错误。游戏开发公司Playco则使用Astra进行游戏原型开发。在其测试中,人工修复工作减少50%,并从一个灰盒基础原型制作出3个不同主题的游戏原型。

科学研究也是此次GPT-6升级的重要方向。

OpenAI称,Astra在数学和科学领域取得新的纪录。在FrontierMath Tier 4(v2)中,Astra得分97.6%。在ARC-AGI-3中,OpenAI给出的成绩为99.9%;在GPQA Diamond中为96.0%。在科学和健康相关评测中,Astra在GeneBench Pro中取得37.8%,MedChemBench为49.3%,LifeSciBench为60.3%,HealthBench Professional为63.4%。

OpenAI还强调,Astra可以将科学推理和电脑操作结合起来,直接进入专业软件检查数据、探索结果,帮助研究人员分析证据,并决定下一步值得研究什么。

OpenAI称,Astra已经帮助解决一些长期存在的数学开放问题,并公布了关于质数间隔的新结果。

Coding依然是核心战场

编程能力仍然是GPT-6 Astra的重要卖点。

OpenAI称,Astra是其迄今为止“最强的软件工程模型”。在Terminal-Bench 4.0中,Astra得分57.7%,GPT-5.6 Sol为37.3%;在DeepSWE v1.1中,Astra为74.1%,GPT-5.6 Sol为72.7%;在FrontierCode 1.1 Extended中,Astra为64.5%,GPT-5.6 Sol为60.6%;在内部数据库迁移任务中,Astra为63.9%,GPT-5.6 Sol为42.7%。

主题:模型|任务|GPT-6Astra