登录

科学网—道高一尺:区分人与AI生成文本的AI技术越来越强


速读:道高一尺:区分人与AI生成文本的AI技术越来越强道高一尺:区分人与AI生成文本的AI技术越来越强精选。 过去各类检测工具的效果一直不尽如人意,而如今多家企业宣称,现有软件已经可以可靠区分AI生成文本与人类撰写文本。 独立分析人士表示:尽管没有工具能够做到完美,但这类AI检测器确实可以几乎全部正确识别纯人类撰写的内容。 斯佩罗和埃米2024年一项尚未经过同行评审的研究²报告,模型假阳性率低至0.02%,也就是极少把人类写作标记为AI。
道高一尺:区分人与AI生成文本的AI技术越来越强 精选

已有 325 次阅读

2026-8-29 05:11

| 系统分类: 海外观察

区分人与 AI 生成 文本 的 AI技术越来越强

当丹尼尔 ·埃万科询问一位科研人员是否使用人工智能撰写同行评审报告时,他没料到对方会直接承认。美国癌症研究协会(AACR)期刊运营总监埃万科表示:大多数研究者不会透露自己借助过人工智能。

图片5.png

但这次情况有所不同。审稿人回复写道: “哇,你们真厉害!”,并坦言因为时间不够,自己使用了大语言模型(LLM)完成评审意见。

埃万科手里有一件秘密武器。由于担心旗下期刊收到大量未按出版方政策申报、疑似由 AI生成的同行评审报告,他和AACR部署了一款名为Pangram的商用AI检测工具。

过去各类检测工具的效果一直不尽如人意,而如今多家企业宣称,现有软件已经可以可靠区分 AI生成文本与人类撰写文本。总部位于纽约的初创企业Pangram Labs就开发了Pangram工具。该公司在官网宣称:“检测AI生成内容准确率可达99.98%。”

不少科研人员与科研机构都在使用该工具查找文本中的 AI痕迹。Pangram的一项研究在今年1月发布¹,据其统计,去年八分之一的生物医学论文含有部分AI生成文本。6月,顶级计算机学术会议NeurIPS宣布,借助Pangram筛查后,拒稿比例达到18%。预印本平台arXiv的用户现在可以访问部署了该工具的镜像站点alphaXiv,查询平台上任意文章的Pangram检测结果。伊利诺伊州的芝加哥大学也表示,已经启用该工具审核学生课程作业。

Pangram联合创始人马克斯·斯佩罗称,他希望帮助所有人识别文本是否由AI生成。“如果指出有人用AI写作这件事变成一种忌讳,那么会有更多人敷衍本职工作,让AI替代自己。我们正处在建立行业规范的关键时期。”斯佩罗本人曾公开点名一些被Pangram判定使用AI写作的新闻记者,有一次甚至把教皇的社交媒体帖子标记为AI生成。今年7月,Pangram完成对热门博客平台Substack的全面接入,读者可以查看平台判定帖子是否为AI生成。

并非只有 Pangram一家公司宣称检测效果出众。同样位于纽约的竞品GPTZero称,自身检测准确率可达99%,能够提供“市面上最精准、最可靠的AI检测结果”。该公司首席技术官崔亚历克斯介绍,目前已有五场计算机学术会议以及三所高校签约使用,还有其他机构正在开展试点。

独立分析人士表示: 尽管没有工具能够做到完美,但这类 AI检测器确实可以几乎全部正确识别纯人类撰写的内容 。纽约大学朗格尼医学中心研究科学传播的蒂姆 ·雷夸思评价,它们“适合筛选那些粗制滥造的AI垃圾文稿”。

但工具依旧会出现误判,因此只能作为调查工作的起点;对于 AI润色改写的文稿,检测结果参考价值很低——这类文本人类撰写内容和AI文本互相交织,很难界定问题边界。《自然》杂志实测多款工具,并采访多位专家,评估它们在不同场景的表现,厘清其优势与短板。

如何区分 AI撰写文本

加拿大本拿比西蒙弗雷泽大学计算机科学家玛尔泽娜 ·卡尔平斯卡对多款AI检测工具做过独立评测,她表示:在Pangram这类产品问世之前,AI检测软件的可靠性一直饱受诟病。过去绝大多数软件会分析文本统计特征:AI生成文本往往困惑度(perplexity)更高(代表句子每个后续词语的可预测程度),而突发度(burstiness)更低(衡量全文句子长短、句式结构的波动变化)。部分工具还会捕捉AI写作的行文套路,例如频繁使用“不是X,而是Y”这类句式。

但这套方法经常把人类写的文章错误判定为 AI生成。 卡尔平斯卡说: “我们过去对检测工具基本没有信心。”不少高校受够了检测工具反复无常的误判,最后禁止或不鼓励教职工使用这类软件。

2024年初,曾同在加州斯坦福大学求学、之后任职多家科技企业的两位计算机科学家斯佩罗与布拉德利·埃米,提出了一套全新检测思路。

他们收集数百万份人类撰写文本,再让大语言模型生成这些文本的 “镜像文稿”:例如,生成标题、篇幅、语气都和人类范文保持一致的文章。之后训练机器学习模型区分人类原文和AI镜像文稿,不断把最难分辨的样本重新喂入模型迭代优化性能。和许多同类模型一样,最终成品属于黑盒模型:它能够捕捉AI写作细微特征(很多特征是特定大模型独有的),但人类很难用语言清晰描述这些特征究竟是什么。

斯佩罗和埃米 2024年一项尚未经过同行评审的研究²报告,模型假阳性率低至0.02%,也就是极少把人类写作标记为AI。卡尔平斯卡以及其他独立科研人员对该模型开展测试³,她讲道:“我们非常意外,它效果真的很好。不管我们输入什么样本,它的检测表现都十分出色。”

今年 7月,加州旧金山的研究机构Epoch AI发布测试:495篇人类撰写文本输入Pangram,假阳性结果为零。Pangram自己最新技术论文显示,英文文本假阳性率仅0.0041%,上百种其他语言同样维持极低假阳性率⁴。该研究测试同时表明,它不会把非英语母语写作者的文章误判,而这正是早期检测工具存在的一大问题。

就在 Pangram早期成果公开前后,GPTZero也放弃了困惑度、突发度的传统思路,改用同类机器学习方案。在卡尔平斯卡的测试中它同样表现优异,Epoch AI的测试里假阳性也是零。GPTZero在2月宣传内部测试假阳性率0.08%,但它的技术论文⁵表述更为保守:全部写作场景下“低于1%”。

AI军备竞赛

这类工具可以精准识别纯人类文稿,但也存在取舍。为了避免把人类文本标记成 AI,两家产品都接受更高的假阴性率,也就是把一部分AI生成文本错误判定为人类写作。Epoch AI测试发现:面对普通提示词生成的AI段落,Pangram和GPTZero几乎都可以识别;但如果让AI刻意模仿特定作者文风,大约8%的AI片段会蒙混过关,被判定为人写的。

卡尔平斯卡还测试过一类 “AI人文改写工具”,专门改写AI生成文字,抹除AI写作痕迹。实验发现,检测器在区分人类原文与经过改写的AI文本时,假阴性、假阳性都会上升。

不过企业表示,上述测试样本已经过时。举例来说,卡尔平斯卡测试发现 OpenAI刚发布的o1大模型可以骗过旧版Pangram。如今两款工具均已迭代新版本;每当新的大语言模型发布,AI检测厂商就会持续更新自家模型。

过去一年, GPTZero就完成23次模型更新。与此同时,Pangram Labs在7月推出下一代产品Pangram 4,宣称相比旧版本实现巨大提升,包括识别经过人文改写的AI文稿;官方公布其假阴性率现在仅0.34%;在模仿文风的Epoch测试场景中,假阴性率下降至2.9%。但和所有模型一样,如果输入片段很短(不足50词),检测性能会下滑。

由此带来的现实是:只有厂商自己内部测试公布的准确率才代表最新状态,但这些数据没有第三方核验。雷夸思评价: “第三方评估永远会落后于最新版检测工具。”

AI混合文稿带来的难题

Pangram与GPTZero均采用订阅制收费,面向高频次使用,同时开放有限额度免费检测。两者还开发浏览器插件,可检测社交媒体、网页、谷歌文档内的文本是否含有AI生成内容。

越来越多写作者遭遇工具误标记,大家逐渐意识到, 最大的现实难题该如何看待 AI辅助写作——这类文稿如今越来越普遍。 一些使用 AI的撰稿人向《自然》表示,需要划清界限: 用 AI润色、打磨人类写完的初稿,大多可以接受;但完全靠AI生成初稿再人工改写润色,则是另一回事。

Pangram和GPTZero都会把文本切分成片段,尝试标注文稿属于轻度AI润色、深度AI辅助还是完全AI生成(详见“两款AI检测器结果展示方式对比”)。但实际使用中,工具并不总能清晰区分上述情形。

> AI检测工具对比:Pangram会按文本片段输出AI、人类、混合内容占比;GPTZero输出整篇文本的AI置信分数,并高亮对判定结果影响最大的句子。

图片4.png

> 图源:上图来自Pangram,下图来自GPTZero。

举个例子,总部位于瑞士洛桑的出版机构 Frontiers研究诚信主管埃琳娜·维卡里奥6月在学术出版资讯网站The Scholarly Kitchen发表文章,提出AI可以用于辅助同行评审。《自然》7月初把该文章输入Pangram,检测结果显示100%为AI生成;Pangram 4上线后,结果更新为96% AI生成。

但维卡里奥表示, 文章初稿以及全部核心观点 “完全出自人类构思”,AI只是用来润色文字,“这本身就是合理工作方式”。The Scholarly Kitchen编辑补充,稿件还经过网站二次人工编辑,不可能整篇都来自AI。

斯佩罗解释: Pangram标记一篇文稿为100%AI,并不代表文中每一个词都是AI写的。工具会把全文切割成多个片段,分别判断每个片段大概率为AI生成、人类撰写,还是“混合文本”,再依据各片段占比给出整体得分。标记100%AI,只代表每一个片段都被判定大概率来自AI,哪怕片段内部仍含有人类撰写内容。

斯佩罗补充,这种分块检测机制还会出现一种现象:单独看某一段落可能判定为人写的,但和其他文字合并为一个分析片段后,结果就会变成 AI。这就解释了为什么有时候把文章某句话单独拿出来检测,和放在全文里检测,结果并不一样。

维卡里奥说: “如果编辑或者作者只是在修改阶段用AI理顺个别句子、厘清论证逻辑,我们并不认为这是问题。”

今年 7月发布的Pangram 4,一部分改进就来自更细粒度的文本切分。旧版本分析单元大约200‑300词,一篇1000词的文章只会拆成3个片段;新版本最小分析单元可以缩小到30‑40词。

斯佩罗称, Pangram 4可以更好区分轻度AI润色(通常会判定为人类撰写)和大幅度AI改写。“只有出现整句完全由AI产出、大规模重写这类深度介入,才会触发Pangram 4的AI标记。”

GPTZero的分析逻辑略有差异。同样切分文本,但最后输出整篇文章的综合置信分数,而不是展示每个片段分项结果⁵。付费用户可以看到哪些句子对判定“大概率人类/AI/混合”贡献最大。针对维卡里奥那篇文章,GPTZero给出100%AI置信度,释义为“软件高度确信该文本由AI生成”。

《自然》介入核实此事之后, The Scholarly Kitchen编辑在该文章页面标注:本文使用AI作为编辑辅助工具。

本次报道撰写过程中还出现另一桩案例:斯佩罗发来 Pangram对《自然》官网文章的检测报告。他使用Pangram3.3版本检测,《自然‑印度》、《自然‑非洲》部分抽样文章被判定为AI‑人类混合文本,部分甚至标记为100%AI。

网站编辑团队核查发现:被标记的部分文章,是其他稿件的 AI辅助翻译版本,或是明确借助AI生成再经人工编辑的研究短讯;但也有一部分是撰稿人原创稿件,撰稿人表示AI仅用来转录采访记录、整理笔记、润色初稿,全部稿件均经过多轮人工编审。

旧版工具标记为完全 AI生成的部分文章,用Pangram4重新检测后,结果修正为人类‑AI混合文本。但新版本依旧把两篇包含一手采访、原创信息的新闻报道标记为100%AI。按照《自然》系列出版物规范:大规模改写、撰写内容需要申报AI使用,仅语言润色无需申报,但鼓励保持透明;这两个站点允许在人工监督下使用AI。核查完Pangram检测报告之后,网站编辑在部分文章上补充标注AI辅助说明。

总而言之,和 The Scholarly Kitchen案例类似,软件确实识别出AI参与痕迹;但Pangram与GPTZero经常对同一篇文章给出不同评级,高亮的可疑片段也并不一致。以上实例说明,标记为100%或接近100%AI的文稿,依旧可以包含大量人类撰写、编辑的文字。

斯佩罗承认, Pangram擅长识别“人类文本中间整段插入纯AI段落”的场景;但现实中AI和人类文字高度交织混杂的文稿,“还有很大提升空间”。例如,对这类文稿做少量文字修改,Pangram整体分数就会发生剧烈波动,业内称为“抖动(jitter)”。Pangram技术论文也提到一项测试:用消费级AI对学生的人类原创作文做“大幅度改写”,模型依旧有41%概率把改写后的文稿判定为完全人类撰写。

雷夸思表示,对于存在 AI辅助改写的文本,他不会采信检测器输出的精确百分比,更不会纠结到个别句子、短片段是不是AI生成。

GPTZero的崔亚历克斯认为,AI检测器首要任务是识别完全AI生成文稿,“这才是大家真正想要排查的对象”;想要判断一篇文稿当中AI辅助占了多大比重,“是难度更高的问题”。

转载本文请联系原作者获取授权,同时请注明本文来自孙学军科学网博客。 链接地址: https://blog.sciencenet.cn/blog-41174-1549559.html

上一篇: 《生命与地球》携手演绎的演化史诗 下一篇: AI 智能体让科研核验自动化 欢迎参加科学网十佳博文评选活动! 主办单位: 支持单位:

主题:AI生成|AI技术越来越强|区分人与AI生成文本|道高一尺