登录

GPT-6不只Astra!Sol内测结果曝光,速度快6倍


速读:表现也很抢眼,单次测试速度是Astra的6倍。
2026-09-07 12:15:

量子位

我有话说

  听雨 发自 凹非寺

  量子位 | 公众号 QbitAI

  GPT-6不只有Astra!

  Astra刚发布没几天,GPT-6 Sol就被曝正在内测。

  表现也很抢眼, 单次测试速度是Astra的6倍 。

  大胆猜测一下:Terra和Luna是不是也在路上呢?

  而且就在同一天,OpenAI刚刚公开了一组内部数据:

  截至目前,按8小时工作日折算,OpenAI研究员每工作一天,身边就有3个多Agent工作日同时运转。

  按API价格计算,OpenAI中位数研究员每天使用的Agent推理资源,已经超过600美元。

   OpenAI还宣布,已经实现了 ‘自动化研究实习生’ :

  这些Agent能在人类指导下,完成部分原本需要研究员花几天才能做完的任务。

   连老黄都说: AGI已经来了!

  他透露Astra使用约10万套NVIDIA Grace Blackwell NVLink72训练,接下来还有40万套GPU上线。

  看来这波真不是OpenAI单方面吹哈~

  GPT-6 Sol被曝开始内测

  网友Lentils爆料,OpenAI正在内部测试GPT-6 Sol。

  他表示,Sol的整体输出能力明显弱于刚发布的Astra,但速度更快,依然属于‘怪物级’模型。

   快到啥程度? 单次测试速度大约是Astra的6倍 。

   网友lyra把同一个任务拿给不同模型测试: 让模型生成一辆BMW M4 Competition的SVG图 。

   其中, GPT-6 Sol 使用Max档位、零样本生成,耗时约3分钟,输出约2.8万Token。

   GPT-6 Astra 使用Max档位,输出约2.5万Token,耗时约19分钟。

   Gemini 3.1 DeepThink 开启High档位,显示输出约3300Token,但推理过程约消耗45.8万Token,耗时约29分钟。

   Gemini 3.8 Flash 同样开启High档位,输出约1.9万Token,只用了约42秒。

  相比之下,Sol的表现最抢眼:它和Astra的输出规模接近,但单次测试速度约为Astra的6倍——耗时只有后者的约六分之一。

  此外,网友Lentils也展示了一个名为‘The Realm of Aurellune’的像素风沙盒世界原型。

  GPT-6 Sol一次性生成了城镇、农田、河流、城堡和缩略地图,还配上了昼夜切换、放置地名、调整细节等控制面板,整体更像一款已经搭好雏形的模拟经营游戏。

  这是zero-shot、Max推理档位、15分钟、总花费6万token生成的效果。

  目前可以推测,Astra偏向最高难度的深度推理,Sol则可能偏向速度、吞吐量和规模化Agent调用。

  至于Sol的发布时间,网友Pankaj Kumar称,可能于9月29日的OpenAI开发者大会正式发布。

  也不排除,GPT-6 Terra、Luna以及GPT-Image 2.5会一并出场。

  OpenAI研究员,人均带着3个Agent实习生上班

  就在同一天,OpenAI还晒了一组很有意思的内部数据——AI模型在自家实验室里,到底把科研加速到了什么程度。

  截至今年8月中旬, 研究员每上8小时班,背后就有约3.1个Agent工作日的任务量在并行跑 。

  好家伙,一个人带三个不睡觉的实习生呗~

  至于花销,按API价格算,中位数研究员每天烧掉的Agent推理资源已经 超过600美元 。

  差不多是一个初级工程师一天的工资了。

  这些Agent具体在干啥?

  写研究代码、写基础设施代码、搭训练环境、跑评估实验、排查工具和环境故障、分析实验结果、盯训练任务……连研究结论的整理和沟通都能插一手。

  基本上,除了决定研究什么,其他活它都能干。

  一个最直观的变化是,以前实验环境挂了,研究员得去内部频道喊人;现在Agent越来越能搞定这类事,人工答疑量直接掉了下来。

  还有的团队,直接取消了固定的技术答疑时间,把人腾出来去改进系统本身。

   基于这些数据,OpenAI正式宣布:已经达成了 ‘自动化AI研究实习生’ 的目标。

  这里的‘实习生’,准确来说是一个能干活的研发节点:在人类指导下,它能独立完成边界清晰的研究任务,其中一些活原来熟练研究员得干好几天。

  效果也立竿见影,研究员的代码产出和实验数量都在往上走。

  2026年8月,人均实验数创下了自2025年1月有统计以来的新高,Agent接的活也越来越复杂、周期越来越长。

   这篇文章的作者 Kevin Liu ,还把这件事放到了更大的背景里。

   他认为, 递归式自我改进 很可能是未来几年推动AI能力跃迁的最重要因素之一。

  说白了就是,AI造AI,越造越快。

  但问题在于,按照目前的发展趋势,这种能力默认只会出现在少数几家前沿AI实验室内部,外界很难看见它究竟进展到了哪一步。

  因此,Liu认为透明披露已经比任何时候都更加紧迫。模型到底在多快地变强,研发节奏要不要踩刹车,不能只由几家公司关起门来决定。

  他还喊话其他AI公司: 也应该把类似数据公开出来 。

  不过,AI研发确实变快了,却还没有快到完全自动驾驶。

  OpenAI数据显示,原本需要4到8小时的任务,过去半年里超过一半的成功案例,人类至少得插手一次。至于高层研究规划,更是几乎不交给Agent。

  研究员依然负责决定研究什么、哪些结果值得继续,以及什么时候应该扩大训练、暂停实验或部署模型。

   OpenAI的下一个目标也定了: 2028年3月前实现‘自动化AI研究员’ 。

  跟只能接明确任务的‘实习生’比,‘研究员’得能扛更开放的研究目标,自己推进周期更长的项目——相当于从执行者变成了独立负责人。

  如果GPT-6 Sol真的已经在内部测试,那它大概率就是在这套新研发模式下跑出来的:

  更多GPU供着算力,更多Agent并行跑着实验,人类研究员则站在更高的地方——选方向、判结果,最后拍板哪些东西值得变成下一代模型。

  更强的AI,正在变得越来越难监控

   也是同一天,OpenAI首席科学家 Jakub Pachocki 扔出一篇万字长文,标题直接叫——《外星思维》。

  我看完之后,感觉意思就是, 连OpenAI首席科学家都在劝整个行业减速了…

  Jakub提出,AI根本不是人类照着设计图一块芯片一条规则拼出来的,它更像是在海量数据和算力里自己‘长’出来的。

  你能拆开看明白其中一些零件,但整个系统为什么突然就有了某种能力、换个环境又会怎么行动,没人说得清。

  更头疼的是,AI用不着全方位碾压人类才会出问题,只要在足够多的关键能力上比人强,它就既能帮你大忙,也能捅大娄子。

   于是问题来了: 人类还看得懂它吗?

  过去OpenAI监控AI,主要靠一招:看思维链。

  说白了就是盯着模型写下来的推理过程,检查它有没有动歪心思,比如想骗人、想越权、想绕开限制。

  但到了Astra这一代,这招开始失灵了。

  一来,模型越来越会‘管理’自己说出来的话,真实想法未必全写在推理里;二来,Agent早就不只是‘想好了再回答’了。它会调工具、操作电脑、跑环境,还会跟人跟别的Agent打配合。

  这些事搅在一起,研究人员根本没法再拉出一条完整透明的思维链逐句审查。

  OpenAI还发现,Astra不用把推理过程全写出来,也能搞定复杂任务。

  简单来说,模型早已学会‘闷声干大事’了。

主题:GPT-6|GPT-6Sol|内测|6倍|研究员