AI语料短缺瓶颈凸显数据基建新机遇有望释放
AI语料短缺瓶颈凸显 数据基建新机遇有望释放
2026年08月17日 02:13
AI发展的又一个关键瓶颈浮出水面——高质量、高可信度的数据,正成为AI竞争的胜负手。这也为 出版 、新闻等传统内容服务商向 AI语料 供应商转型创造了机遇,相关企业的商业价值有望迎来重估。
科技公司加码内容资源布局
近日,A股 AI语料 板块走强, 读客文化 、 中信出版 、 利欧股份 、 中国出版 、 海天瑞声 等股价显著上涨。
有消息称, 苹果 正与多家 出版 商洽谈新的合作协议,希望使用它们的内容来提供最新的新闻和信息,这是 苹果 升级AI驱动版Siri语音助手计划的重要一部分。 苹果 还计划采用灵活付费模式,当合作 出版 商的内容被Siri用户使用时,再支付相应的版权费用。
据悉,苹果此前已与部分出版商达成协议,向出版商支付费用,以获取相关内容以及用于AI模型训练方面的使用权。
Anthropic等科技公司也在加码布局内容资源。今年7月,一份解封的法庭文件显示,Anthropic通过代号为“巴拿马计划”的项目,斥资数千万美元批量采购数百万册2022年前出版的纸质书,完成高速扫描用于AI训练后,将这些书籍粉碎销毁,该行为被舆论称之为“AI焚书”。
科技公司为何纷纷盯上了传统媒体的内容资源?在AI大模型快速发展的初期,行业训练大模型所用语料主要来自互联网上公开的信息,这些语料信息的合法性、准确度长期未得到充分重视。更为重要的是,在生成式AI爆发后,大量AI生成内容、合成数据也涌入互联网,再度回流成为大模型训练素材。但是,若持续使用AI生成内容迭代训练模型,将引发模型退化,出现“模型坍缩”现象。
为获取未被AI生成内容污染的原生语料,硅谷科技巨头开始挖掘传统媒体文稿与纸质书籍价值。这类原生内容能够保障模型输出的准确度,支撑模型能力持续迭代提升。
数据基建新机遇有望释放
AI产业发展应具备能源、算力、数据、模型和应用五大核心要素。数据是AI大模型的“燃料”,其质量与安全性直接决定了模型价值的上限。
据2026 机器人 全产业链接会披露信息,GPT-2、GPT-3对应的训练数据时长分别约为79万小时、1100万小时,想要实现具备实用能力的具身智能,至少需要1000万小时量级多模态数据。叠加多场景适配、多模态类型、数据良率等因素,产业实际所需多模态数据集规模将远超1000万小时。
当前,高质量语料短缺已成为制约 人工智能 大模型发展的核心瓶颈,据Epoch AI预测,人类公开的高质量文本数据可能在2026年至2032年间被完全耗尽。在此背景下,高质量、高可信度的数据资源正在成为“稀缺”资源,重要性持续提升。多位接近出版社、图片版权机构等传统内容企业的人士向记者透露,国内也已经有AI公司开始向传统内容机构采购合规数据集。
复旦大学计算与智能创新学院特聘教授、北电数智首席科学家窦德景认为,谁能掌握高质量、高可信度的行业数据,谁就能在AI竞争中占据先机。上述接近传统内容企业人士表示,传统媒体沉淀的大量优质原创内容,恰好是AI大模型所需的优质“燃料”,不仅具备高度准确、数据可信等优势,还能够规避“模型坍缩”风险。
高质量内容数据的“语料价值”持续提升下,传统版权资产价值迎来重新评估窗口。 兴业证券 研报认为,数据集建设重估版权语料价值, AI应用 打开IP商业化空间,网文、出版企业有望从传统内容提供商转变为合规AI训练语料供给方,自有版权文本数据稀缺性上升,资产价值具备重估空间。
国金证券 分析称,当前,数据采集已经成为物理AI发展的最大短板之一,数据基础设施加快建设有望带动数采产业链持续扩容。
(文章来源:上海证券报)