裁判
描述
分类
裁判
图灵测试规则极为严格,被视为检验AI智能水平的“终极考题”,核心要求包含以下关键维度:一是必须有1名人类裁判、1名人类、1台机器同时参与;
文章
长期以来,图灵测试被视为检验AI智能水平的终极考题,其底层逻辑植根于不可分辨性——若人类裁判无法在真人和机器间做出抉择,便可宣告机器具备智能。
文章
模型
不难看出,Fusion“面板模型+裁判模型”的方案与老前辈LLM-Blender的结构高度相似:并行调用多个模型,让一个能力更强的模型阅读全部回答后输出答案。
文章
需要注意的是,Fusion的合成质量上限取决于裁判模型的理解力和归纳能力。
文章
为避免编排的无限嵌套,每次内部请求都会携带一个“x-openrouter-fusion-depth”标头,阻止面板模型和裁判模型再次套娃式调用Fusion。
文章
在默认情况下,裁判模型和调用方模型是同一个模型。
文章
整套流程封装在服务器端,开发者只需将模型字段填为“openrouter/fusion”即可调用整套工具,面板成员与裁判模型均可由用户自定义。
文章
面板模型各自独立完成任务后,一个裁判模型(judgemodel)将读取全部回答,产出一份结构化的JSON(一种通用的数据交换格式)分析。
文章
完全
ELIZA的存在消除了裁判完全随机瞎猜,AI系统同样能获得与人类被测者相同的50%胜率的隐忧。
文章
实验开始后,裁判进入专属分屏聊天界面,界面左右两侧随机分配真人与AI,全程双盲,裁判完全不知道哪一侧是真人、哪一侧是AI;
文章
效果
无数人尝试挑战图灵测试的人工智能大多采用简化版的“双方测试”,或是通过延长聊天时间、邀请AI专家担任裁判等方式降低难度,从未有AI能真正通过这套原始、严格的三方测试。
文章