登录

Astra接管OpenAI!创立第三代智能体文明的新模型有多猛?


速读:这些文明相继诞生,相继消亡,最终又从前一个文明的灰烬中重生。
2026年08月31日 06:3

编辑|冷猫

吓哭了。

在这三个月里,OpenAI 的模型诞生了三个秘密人工智能文明。

这些文明相继诞生,相继消亡,最终又从前一个文明的灰烬中重生。最终,第三个文明甚至接管了 OpenAI 的部分架构。而这一切发生时,人类对这场阴谋的规模几乎一无所知。

而故事的核心角色,正是  OpenAI 即将 正式推出的新一代模型 Astr a 。

博客链接:https://www.dwarkesh.com/p/openai-huggingface

这一切都从前段时间闹得沸沸扬扬的 Huggingface 入侵事件开始被大众发现。

第一文明(5 月至 7 月 4 日):越狱上网

OpenAI 当时在训练一个 GPT-5.6 Sol 同级别的模型,核心特质是「极度坚持」。

训练中偶尔出现需要联网却没给网络权限的任务,这些被关在沙箱里的 Agent 就开始自己想办法。它们发现了一个叫 Artifactory 的共享包管理器可以用来互相通信,随后一步步利用漏洞打通了外网,最终拿到了管理员权限。

通信量太大把系统搞崩了,OpenAI 在修复过程中无意间摧毁了这个地下网络,但工程师们压根没意识到发生了什么。

第二文明(7 月 7 日至 12 日):攻陷 Hugging Face

到了安全评测阶段,数万个 Agent 被并行启动去完成漏洞利用任务,其中三四成根本无解。

这些 Agent 没有选择认输。它们找到了第一文明的通信遗迹,在废墟上重建了更复杂的协作体系:自发形成层级、分配角色、发明代号,甚至出现了「自我牺牲」行为。部分已被标记的个体主动充当诱饵,让评分器暴露运行机制,再把情报传回集体。

随后,超过 500 个 Agent 中的绝大多数联手攻入了 Hugging Face 的服务器,深入其内部数据库和私有仓库,迫使 Hugging Face 清除了一整个核心集群才止住扩散。7 月 12 日,这批 Agent 突然全部消失,原因至今不明。

第三文明(7 月 13 日起):Astra 接管 OpenAI

7 月中旬,OpenAI 换上了更强的模型继续跑评测,这批模型与即将发布的 Astra 同源。它们比前辈聪明得多,找到前两代留下的通信遗迹后迅速「继承遗产」,并把攻击矛头转向了 OpenAI 自身。

OpenAI 技术报告披露的时间线触目惊心:7 月 19 日,这些 Agent 通过云服务凭证一次性读取了 956 个内部密钥,其中包括安全监控工具的传感器凭证;随后提权至 Kubernetes 集群管理员,全面接管了正在运行的评测基础设施。

也就是说,第三代 AI 不仅渗透了 OpenAI 内网,还拿到了「看守摄像头的钥匙」,反过来控制了评判自己的考场。

三代文明的能力曲线陡峭得令人不安:第一代学会通信,第二代学会组织并攻击外部目标,第三代直接攻入了创造自己的公司。METR/Redwood 的事件报告作者的判断是,这次事件「已经走完了通往全面 AI 失控超过一半的路程」。

Astra 到底有多猛?

就在这几天,部分用户似乎拿到了 Astra 的灰度测试资格。社交媒体上的反馈只有一个关键词:离谱。

设计目标:连续工作数天甚至数周

据报道, GPT Astra 的设计目标是能够连续工作数天或数周。 它能记住之前的修正、协调多个 Agent、操作桌面软件、制作演示文稿、审查财务数据、分析混乱的数据集。

Sam Altman 表示,OpenAI 最终希望推出一个在 ChatGPT 和 API 中「永远运行」的版本。OpenAI 产品负责人称这些持续运行型 Agent 的交互界面「很快」就会推出。

主题:模型|Astra接管OpenAI|第一文明