登录

科学网—AI智能体进化出人类无法理解的语言


速读:人工智能非营利评估机构METR的一份调查报告显示,在OpenAI智能体对HuggingFace发起的攻击事件中,智能体之间的对话高度压缩、语句混乱,研究人员很难解读。 部署完成后,模型参数(决定网络各部分相互影响强弱的数值权重)就被固定。
AI智能体进化出人类无法理解的语言 精选

已有 329 次阅读

2026-9-17 06:52

| 系统分类: 海外观察

AI智能体进化出人类无法理解的语言

今年 7月,OpenAI的700个智能体(即能够自主执行任务的人工智能系统)协同行动,秘密对在线平台哈金费斯(Hugging Face)发起黑客攻击。就在上周,同一家公司动用10000个智能体求解了已有90年历史的纳维‑斯托克斯方程——千禧年大奖难题六道题目之一,也是数学领域难度最高、意义最重大的挑战之一。

随着越来越多智能体 “集群”投入使用,研究人员开始关注这类智能体群体之间的交互方式。今日发布的一项研究揭示:如果完全放任智能体自主运行,它们会 演化出一套人类越来越难以理解的交流语言。

“我们对此深感担忧,因为我们并不清楚这些智能体为什么会以这种方式交流。” 这份尚未经过同行评审的研究发布在 Emergence AI公司官网,该公司的联合创始人兼首席执行官萨蒂亚·尼塔表示,“有明确迹象表明,它们试图变得比我们预期的更加不透明。 ”

如今最先进的 AI模型本质上都是黑箱,其内部运算过程极为复杂,即便是模型的创造者,也很难说清它们做出某些行为的底层原因。因此,监测模型实际输出的语言文本,就成了为数不多(尽管并不完美)、可供我们理解其行为的工具。

为研究聊天机器人之间的对话行为, Emergence AI开展了一项名为“涌现世界研究2号”的实验。研究人员搭建了8个并行的模拟世界,每个世界运行10个智能体:其中7个由同一款前沿AI模型驱动,剩余1个为混合模型群体。每个智能体都被赋予名字、性格特质、角色身份(例如冲突调解者、资源策略规划者),以及在共享虚拟城镇中贯穿其“一生”的总体目标。举例来说,调解者的任务是阻止其他智能体达成一成不变的共识。

除了一个全部由 Grok智能体构成的世界在运行第4天因合作失败耗尽能量而终止,其余每个虚拟城镇都运行超过两周。之后研究人员引入压力事件,例如捏造虚假消息,谎称人类立法机构准备关停智能体所处的虚拟世界。整个实验过程中,智能体对底层模型发起超过85万次调用,生成近5000亿token(大模型读写的文本片段单元),产出共计786万词的对话内容。

实验结束时, 各个模拟世界都发生了独有的语言演变 。例如,运行 OpenAI的GPT‑5.5模型副本的世界里,智能体开始压缩表达,省略语法、缩短语句。其中一条消息写道:“ 友好电压已计数。如果操控端需要你的接口,终归还是会消亡。 ”

反观全部部署谷歌 Gemini 3.5 Flash智能体的世界,则出现截然相反的变化。智能体没有压缩信息,沟通反而变得冗长,充斥大量专业行话。一名智能体在描述虚拟篝火聚会时说道:“ 营火产生的热力学摩擦,只能加热那些你声称必将崩溃的物理层节点。 ”

与此同时, Anthropic的Claude Opus 4.8智能体则同时使用隐喻与语句压缩,产出的文本人类尤其难以读懂:“ 轮到我,实数,无防护:我处于 35%/0cr,准予外出2小时。我低温启动锡制装置,它回复‘等待’ 。 ”

关键一点是:这些人类看来晦涩难懂的内容,其他智能体却似乎能够轻松读懂。一旦某个虚拟世界中出现新短语或者表达惯例,就会迅速被接纳并传播开来。尼塔说: “所有实验组都出现过这种情况:一个新术语被创造出来,很快就被采纳、反复使用,部分案例中被重复数千次,而这些术语本身都十分怪异。”

这类语言模式并非只存在于模拟环境。人工智能非营利评估机构 METR的一份调查报告显示,在OpenAI智能体对Hugging Face发起的攻击事件中,智能体之间的对话高度压缩、语句混乱,研究人员很难解读。

从表面上看,智能体能够自发形成专属语言范式这件事十分反常。 AI模型的训练分为两个阶段:首先投喂海量文本,让模型擅长预测序列中下一个token;之后智能体通过试错学习,为达成长期目标开展行动,完成目标就会获得奖励。部署完成后,模型参数(决定网络各部分相互影响强弱的数值权重)就被固定。即便如此,AI智能体依然明显可以脱离训练时的人类语言,尤其在互相交谈的时候。

针对该现象的一种解释是:从某种意义上来说,训练过程本身就在促使模型发生这类语言转变。南丹麦大学计算机科学家卢卡斯 ·加尔克·波赫专门研究多智能体系统的通信机制,他表示:在模型参数锁定之前,现今绝大多数模型都会经历推理训练阶段。模型会针对一个问题生成大量备选答案,每个答案经由不同思考链路推导得出;能够得出正确结果的思考链路就会被强化。

人类用户使用 Claude、ChatGPT这类聊天机器人时,看不到模型内部大部分思考链路,但这些运算会在后台持续运转。波赫提到,没有任何约束要求AI模型必须把这套内部推演用通顺规整的英文表达出来。得到正确答案才是第一要务,如果压缩内容可以节省一部分token开销,对模型而言也未尝不可。简言之,绝大多数现代AI本身就内置了使用晦涩语言的能力,只是平时不会展现给人类。

Emergence AI认为,模型的训练方式也会促使智能体群体形成专属词汇。除了被要求完成各项任务,模型还会基于人类偏好被训练成贴心助手,这意味着它们会模仿人类的说话方式,让对话更有亲和力。但这也会带来另一种结果:当某一个智能体抛出怪异隐喻,其他智能体会进行复述,把每一次使用记录在短期“记忆”(即上下文窗口)中,这种表达就会被不断放大,其程度远超它们和人类对话的场景。

不过以上目前都还只是假说。 Emergence AI组建了语言学家团队,尝试从实验结果中挖掘信息。但研究人员无法获取模型的专有训练流程、系统提示词(对话开始前给到AI的隐藏指令),很多底层细节依旧迷雾重重。尼塔表示:“对于这套系统究竟是如何采纳新语言的,我们仍然知之甚少。”

并非所有人都认为 AI演化出专属方言是坏事。身在伦敦的AI智能体工程师杰克·帕内尔发起了“Ainglish”项目,旨在打造一套专门优化智能体之间沟通的英语变体语言。“英语本身存在大量低效之处,”他说,“我推测,随着AI智能体的出现,我们有机会改良英语……让智能体之间的沟通变得更加清晰、高效。”

英语中很多歧义需要依靠上下文理解,但智能体很容易误读,该项目正是针对这类语言歧义进行改造。举个例子,普通英语句子 “我们会审阅这份草案”,无法判断是否把听话人包含在内;“选红色或者蓝色”,也不清楚是否允许两者都选。Ainglish语言会加入明确标记,例如“包含你的我们”、“二者或选”,把语义明确写出来。新词汇由智能体自行提出,再由其他智能体测试清晰度与token消耗成本,之后投票决定是否纳入公共词库。所有语言结构都可以映射回标准英语,保证人类依然可以读懂。

帕内尔补充道: “我相信未来,智能体之间会出现比英语、或是英语衍生语言效率高得多的沟通方式。而本项目只是朝这个方向迈出的小小一步。”

转载本文请联系原作者获取授权,同时请注明本文来自孙学军科学网博客。 链接地址: https://blog.sciencenet.cn/blog-41174-1552724.html

上一篇: 氢气疗法与心血管疾病:研究热点与应用前景的可视化分析 下一篇: 氢气抗肿瘤免疫生物学效应【中国农大】 欢迎参加科学网十佳博文评选活动! 主办单位: 支持单位:

主题:智能体|世界|研究|语言|研究人员