数据价值释放之年:词元催化行业全链条“焕新”
数据价值释放之年:词元催化行业全链条“焕新”
2026年09月05日 02:46
作者:
许璐 郑瑜
随着全国数据市场逐步实现一体化,进一步增强数据、算力、模型三者的耦合性成为行业共识。
在近期举行的2026中国国际 大数据 产业博览会(以下简称“数博会”)上,国家发展改革委党组成员,国家数据局党组书记、局长刘烈宏提出“三个全新”:一是数据赋能 人工智能 发展迈入全新阶段;二是 人工智能 技术成为激活 数据要素 潜能、开发利用数据资源的全新利器;三是词元正开辟 数据要素 价值释放的全新路径……并在此基础上形成“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的良性循环。
《中国经营报》记者在采访中发现,围绕上述循环,产业探索正在转向全链条协同。即具身智能及其他新场景牵引数据供给,可信数据空间和高质量数据集建设提升数据开发利用效率,词元计量、计价与交易推动模型调用能力转化为可交易、可结算的服务。数据价值释放之年,供给方式、开发机制和商业模式正在同步“焕新”。
场景激活数据新供给
《全国数据资源调查报告(2025年)》显示,2025年我国用于 人工智能 训练和推理的数据总量达到199.48艾字节,同比增长42.86%。其中,推理数据量为101.34艾字节,首次超过训练数据量的98.14艾字节。具身智能领域的数据生产量同比增长477.78%。
这显示,人工智能进入产业应用阶段后,数据供给的重点正从扩大规模转向满足特定场景和任务的需求。
记者注意到,该变化在具身智能领域表现较为明显。例如, 机器人 在制造、康养等现实环境中执行任务,不仅需要识别物体,还要理解物理规律、动作顺序以及人与环境之间的关系。与语言模型主要依托文本、图片等互联网数据不同,具身智能训练需要大量带有物理属性和动作反馈的数据,但真实场景采集往往面临成本高、周期 长和 极端样本不足、场景有限等问题。
对此,跨维智能贵阳区域总经理陈泓向记者表示,生产企业一条产线可能价值两三千万元,让 机器人 直接在产线上进行两至三个月的实训并不现实。相比之下,可以在虚拟环境中搭建产线,让 机器人 以仿真形式完成序列任务,经过上千次乃至上万次训练后,再将相关数据用于 机器人 本体训练。
人工智能进入产业应用阶段后,数据供给的重点正从扩大规模转向满足特定场景和任务的需求。
上海理工大学机器智能研究院执行院长、上海卓益得 机器人 有限公司创始人李清都将人工智能分为物理人工智能与社会人工智能两类。他表示,当前具身智能企业积累的数据主要集中于 机器人 执行具体任务中,而机器人与人交互过程中产生的眼神、表情和肢体动作等社交数据大量缺失。
一家具身智能企业高管告诉记者,行业正面临四个瓶颈:一是缺乏高质量数据,二是难以跨场景泛化,三是决策“大脑”与动作控制“小脑”之间存在割裂,四是模型能否自主进化。其中缺乏高质量数据排在第一位。
不同应用场景需要的数据类型不同,也使数据采集和加工从相对通用的流程转向以任务为导向。
山东数据集团副总经理张帆向记者表示,同一组数据用于金融征信与用于医疗、消费分析、旅游场景,清洗方式和最终形成的数据集并不相同。因此,企业应从自身研发场景出发提出数据要求,再由数据加工成词元、供模型训练、模型反哺应用并产生新数据,形成闭环。
智能技术嵌入开发链条
场景激活数据新需求的同时,如何将分散的数据加工为模型可用的高质量数据集,并在跨主体使用过程中保障安全与权益,成为数据供给和模型应用的中间环节。
在2026数博会开幕式上,刘烈宏披露,截至2026年8月,全国累计建成高质量数据集超过12.6万个,数据总体量超过1815PB,较3月增长超过89%。
从产业实践看,高质量数据集建设并非简单汇集原始数据,而是需要经过采集、清洗、标注、质量评测等环节。与此同时,人工智能技术也开始进入数据处理环节,用于自动识别、预标注等环节,减少部分重复性人工操作。
此外,人工智能正与模型行业实现深度融合。
“我们做了一个工业质检的行业大模型,用DeepSeek微调,因为要把15G的数据送到大模型微调,通过互联网大概要4小时,但通过确定性网络只需22秒。大模型训练完以后再传回企业,互联网要2小时,通过确定性网络只需2秒。”中国工程院院士、紫金山实验室首席科学家刘韵洁在数博会上介绍。
记者注意到,高质量数据来自政府、企业和个人等不同主体,部分数据包含个人隐私、商业秘密等信息,难以通过直接复制和交付的方式流通。可信数据空间由此成为数据进入加工、训练和应用环节的基础设施之一。
零数科技创始人兼CEO林乐向记者表示,在“数据—模型—Token—应用”链条中,可信数据空间承担数据流通利用枢纽的作用,数据供需双方可依托可信数据空间进行多方接入、权限管控、合规确权和存证审计。“没有可信数据空间提供的可信流通底座,原始数据就无法安全、合规地输送给数据集加工环节,后续模型训练、词元生产、业务应用就变成无源之水。”
相较于传统的数据流通链条,安全要求正在由防止数据泄露进一步扩展至保护数据使用过程。
安恒信息 (688023.SH)CTO刘博表示,可信数据空间和高质量数据集涉及较多隐私数据,即使不存在攻击者的恶意行为,数据持有方也可能不愿让其他主体直接看到原始数据,因此需要实现数据“可用不可见”和“可用不可得”。
词元计价催生新服务模式
数据经过加工进入模型后,如何计量模型调用和智能服务,成为数据、算力、模型与应用形成价值循环的又一环节。
2025年,我国全年词元调用量约21100万亿,日均调用量由年初超过1万亿增长至年末100万亿。词元调用量增长的同时,围绕模型接入、算力调度、调用管理和统一结算的服务需求开始出现。
刘烈宏在2026数博会“词元—— 数据要素 价值释放新路径”交流活动上指出,词元为人工智能服务的计量、定价、交易和结算提供了重要标尺,打通了数据、模型、算力之间的价值传导链路。
北京交通大学信息管理理论与技术国际研究中心特聘教授张向宏提出,数据资源开发利用面临三个瓶颈:一是制度瓶颈,二是技术瓶颈,三是基础设施瓶颈。词元为破解上述三个瓶颈提供了一条新路径。
国家数据发展研究院院长胡坚波认为,词元产业分为生产端、流通端、消费端,核心在于生产与流通。生产端以数据为原料、算力为底座、模型为中枢,关键是压降生产成本;流通端实现调用即流通、计费即结算,关注应用效果。当前算力、大模型快速迭代,算力服务商、大模型厂商、数商、聚合平台等主体都在寻找定位,词元产业生态持续演进。
随着企业采购和使用Token,新的服务需求也在形成。贵州数据宝网络科技有限公司董事长汤寒林告诉记者,当前国内词元经济仍处于起步阶段,市场竞争主要集中于通用Token的价格、稳定性和供给能力。企业员工分散购买Token后,还会产生用途难以掌握、报销管理成本增加等问题,由此带来统一采购、调用留痕和集中结算等需求。
值得注意的是,模型进一步进入医疗、工业等专业领域,市场关注点也将由通用Token的价格和供给逐步延伸至应用效果。汤寒林认为,下一阶段的竞争将转向场景Token,其形成取决于企业能否获得合规的高价值数据,并用于模型二次开发和解决具体问题。
(文章来源:中国经营网)