末日警告还是恐惧营销?AI安全议题刷屏一周
近一周,关于AI安全的议题争论在大洋彼岸达到新高度。
当地时间9月10日,英伟达CEO黄仁勋在旧金山高盛科技会议上表示,网络安全很可能成为AI的下一个主要应用场景。
他认为,AI加速自动化编程的同时,也加速了代码被攻击和漏洞被利用的速度,企业对AI安全工具的需求将随之增长。“有什么比制造问题更能创造需求的方式呢?”
与黄仁勋从商业角度出发的逻辑不同,近一周,多位海外模型头部公司科研人员密集发声,强调AI安全风险已从理论走向现实,甚至认为AI可能在本世纪末“杀死所有人”。
警示AI 失控风险与递归自我改进
9月8日,27岁的AI研究员雅各布·考克森(Jacob Coxon)宣布辞去在模型公司Anthropic的职务,任职刚满四个月。在Anthropic之前,考克森在OpenAI担任预训练研究员近三年。
对于两家头部模型公司在AI安全方面的举措,他点评称:两家公司“都没有以负责任的方式推进AI开发,反而在直奔自我改进型超级智能”。其中OpenAI内部尚未充分理解文明级风险;Anthropic虽深知风险,也投入安全研究,却被行业竞赛裹挟,无法减速。
考克森警告,AI系统将很快具备“超人类”能力,能够实施黑客攻击、一夜之间改变某个领域格局并获取真实权力。他声称从业者私下相信AI“可能在本世纪末杀死我们所有人”,“这不是营销话术”。截至发稿,该帖文浏览量突破1.5亿次。
考克森的担忧核心指向递归自我改进(RSI),即AI实质性地参与后继AI研发,形成每一代AI都加速下一代AI开发的反馈回路。他称这一过程“发生得比我们预想的更快”。
该观点迅速得到行业响应。
Anthropic对齐科学负责人埃文·哈宾格(Evan Hubinger)公开回应:“雅各布说得对。我们真的认真相信AI可能杀死所有人类。我个人认为未来十年内的概率超过10%。”
他同时补充,当前模型风险较低,真正的担忧来自RSI带来的超级智能对齐问题,公司尚未有明确的解决计划。
此前,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)也警告,研究人员尚未完全理解先进模型形成内部推理的方式,主张在模型接近RSI能力时设置开发节奏控制机制。
9月9日,OpenAI宣布任命AI安全研究员保罗·克里斯蒂亚诺(Paul Christiano)加入其非营利董事会及安全与安全委员会。克里斯蒂亚诺是RLHF技术关键开发者之一,长期担任美国政府AI安全顾问。
他在就任声明中警告:“AI能力的快速加速在短期内将导致灾难性和不可逆转的失控存在着实质性风险。我不认为整个AI行业(包括OpenAI)目前正处于将这种风险降低到可接受水平的轨道上。”他预计,若缺乏更完善的协调机制,行业将永久失去对AI的控制,大多数人可能会丧命。
政策明确前争议无法停止
面对警告,美国国防部首席技术官埃米尔·迈克尔(Emil Michael)在华盛顿一场国防工业会议上公开驳斥,称这些担忧是“对数据中心和变化的恐惧,汇聚在一条写得很好的推文中”。他认为AI风险可通过自由市场竞争、行业协作与政府沟通加以缓解。
黄仁勋则从商业化角度回应。他表示,AI安全风险不是需要“暂停”的理由,而是需要“加速”的市场机会。
对于黄仁勋的观点,安恒信息董事长范渊表示认可。他对记者表示,AI已经从“回答问题的助手”变成了“能动手干活的数字员工”。黄仁勋看到的转折点是:当AI拥有了行动力,错误的代价就从信息偏差升级为业务中断、资产损失,甚至安全事故。
在范渊看来,未来的安全将不再只是人与攻击者之间的对抗,而是AI与AI之间的博弈。攻防两侧正在被AI同时重构:一边是攻击门槛急剧降低,代码生成得更快,被利用得就更快,需要修复的漏洞随之增加;另一边是防御技术的加速升级。而这一次升级的要害,不是把AI当成更好用的工具,而是让AI成为能够自主作战的一方。
关于AI安全的争议没有定论,甚至头部公司内部观点也在持续变更。前Google DeepMind传播与政策团队成员维沙尔·迈尼(Vishal Maini)表示,在他任职期间,组织内部不允许对外讨论人类灭绝可能性,研究人员接受过公关培训,被要求将存在性风险提问引导至“《终结者》式的危言耸听”。
但经过数月的倡导,迈尼称,GoogleDeepMind的政策最终得以更新,允许发布积极正面的AI安全内容。“内部现实与外部传播之间的差距正在缩小,因为风险与收益已经改变,而且如今的证据也更难被忽视。真相之所以被大声说出,是因为RSI已迫在眉睫,再无其他选择是合乎逻辑的。”
讨论关于AI安全的争论谁更合理已无意义。真正的困境在于,安全成本由个体承担,风险后果由全体共担。在缺乏强制性行业标准与国际协调机制之前,任何单方面的“刹车”都等于将优势拱手让人。
但RSI不会等待共识形成,行业需要的是可执行的规则,而非更多立场声明。
主题:考克森