专访|从AI巨头离职的顶级人才:人类正变成最慢一环,但让AI“慢下来不是好办法”
人工智能究竟应该踩下刹车,还是继续加速?过去两周,这场争论突然从AI安全研究圈冲到了硅谷中心。
先是曾在OpenAI和Anthropic工作的27岁研究员雅各布·考克森辞职,公开称头部AI公司正在“拿我们的命赌博”。随后,Anthropic首席执行官阿莫代伊呼吁控制前沿AI能力增长速度,OpenAI首席执行官奥尔特曼、马斯克等也对加强外部评估、放慢发展步伐表示支持。
现实很快显露出另一面。9月19日,就在阿莫代伊公开呼吁行业“减速”约一周后,有报道称,Anthropic正在考虑推出新模型,以应对OpenAI带来的竞争压力。
曾在Google DeepMind工作7年的AI研究员里舒布·贾因(Rishub Jain)和前OpenAI治理研究员丹尼尔·科科塔伊洛(Daniel Kokotajlo)在接受红星新闻记者采访时,均表示:“减速”并不意味着离开。他们在离开“大厂”后,转向继续研究如何理解、监督和约束越来越强的AI系统。这应该是人类与AI关系发展中,最正确的路径和办法。
谁减速谁就掉队,慢下来不是好办法
抛开与AI发展之间的技术难题,人类面临一个更现实的难题:即使越来越多人认为放慢AI发展有利于人类安全,谁又愿意率先踩下刹车?
一份由1300多名前沿AI公司员工联署的公开声明指出,每家公司、每个国家都面临巨大的竞争压力,很难单方面放慢AI发展。一旦自己减速、竞争对手继续推进,就可能失去技术优势。Anthropic一边呼吁行业控制速度,一边又考虑推出新模型,或许恰好展示了这种矛盾。
▲ DeepMind前AI研究员里舒布·贾因 曾在Google DeepMind工作7年的AI研究员里舒布·贾因(Rishub Jain)告诉红星新闻记者,到2026年,外部AI安全研究已经拥有更多人才、资金和关注,他也因此能够在大型实验室之外,把自己真正关心的研究推进到更大规模。
尽管担忧当前AI发展的速度,但当被问及是否仍然相信高级AI最终能够与人类目标保持一致时,他仍然给出了肯定的回答:“我相信我们能够对齐AI,并让它帮助人类。”
问题因此不是“慢下来”,而是在AI摆脱人类监管之前,人类能不能先建立起足够可靠的监督和判断机制,以在AI真的变得比我们更聪明、更快时,人类还可以判断它到底有没有做对?
AI已参与研发下一代AI,人类需要对齐
里舒布·贾因今年从DeepMind离职后,创办了一家专注AI安全、重点研究AI监督与评估的非营利机构。
对于“AI究竟已经发展到了哪一步”这个问题,贾因告诉红星新闻记者,近期频频出现的一个词——“递归自我改进”(Recursive Self-Improvement,RSI),就可以展现AI的进化阶段。简单来说,就是AI越来越多地参与改进自身,并进一步研发出能力更强的下一代模型。
美国人工智能公司Anthropic上周宣布,其大模型聊天机器人Claude已“主导”公司超过四分之一的人工智能研发工作。这是该公司计划定期公布的一组新指标之一,用来向外界展示AI正以多快的速度参与下一代模型的开发。
▲ 智能手机屏幕上的Claude应用图标,它是Anthropic开发的人工智能聊天机器人(图据视觉中国) 贾因很直接:“递归自我改进并不是某一天突然发生,实际上,我们早就看到它的迹象。”不过,他并不认为“自我改进”本身就是最值得害怕的事情。
“RSI本身并不是什么需要恐惧的东西。”他告诉红星新闻记者,“真正令人担忧的是,在我们还没有足够强的能力去对齐AI的情况下,AI发展的速度正在加快。”
贾因表示,人类如何与AI对齐,“这是一个眼下就需要认真考虑的现实问题,未来也一样。”
AI发展越来越快,人类必须快速评估结果
与AI对齐的一个重要方面,就是如果有一天AI已经比人类更擅长完成某件事,人类凭什么来判断它究竟做对了没有?
贾因认为,从模型对齐的角度看,AI能力超过人类本身并不是问题,真正的难点在于如何评估这些越来越强的系统。随着AI开始执行更复杂、更高级的任务,人类将越来越难判断其行为是否符合预期,因此“不能只依赖人类评估”。
依靠AI来监督AI,本身也存在新的难题。贾因表示,AI评估并不完美,“(如果)AI在特定领域发展出达到超人水平的系统,我们必须评估它们”,因为人类必须知道“它们到底有没有做对”。
他的团队目前尝试的一条路径,是把人类和AI各自的优势结合起来,用“人+AI”共同监督更强的AI。
2024年从OpenAI辞职的治理研究员丹尼尔·科科塔伊洛(Daniel Kokotajlo),目前担任AI Futures Project执行主任,该机构主要研究AI未来发展趋势。在与红星新闻记者沟通时,丹尼尔提供了他的一份AI未来发展趋势报告《AI 2027》白皮书。