登录

世界模型决赛圈会拼什么,昆仑万维董事长方汉有七个判断



速读:方汉判断,具身智能世界模型能否迎来“ChatGPT时刻”,关键在于能否投喂足够多的训练数据,门槛大约是“1000万小时”,再往上则是“1亿小时”。 数据中心。
世界模型决赛圈会拼什么,昆仑万维董事长方汉有七个判断 _ 东方财富网

世界模型决赛圈会拼什么,昆仑万维董事长方汉有七个判断

2026年07月23日 13:51

K图 300418_0

  近期,在世界 人工智能 大会期间的一场媒体沟通会上, 昆仑万维 董事长兼CEO方汉对记者谈及世界模型的数据成本、行业竞争格局、内容行业门槛变化,以及一些他自己也承认“太技术细节”的话题。

   ① 世界模型的核心瓶颈是数据量级,而非算法。

  方汉判断,具身智能世界模型能否迎来“ChatGPT时刻”,关键在于能否投喂足够多的训练数据,门槛大约是“1000万小时”,再往上则是“1亿小时”。这个数字对应着一笔具体的成本账:他说手套这类采集硬件“原来的成本都是十几万,今年才降到一万多”,而单位小时的UMI数据和真机数据采集成本“原来最低约500元人民币,贵的能达到一两千元”。按此换算,1000万小时真机数据至少需50亿元,1亿小时需500亿元。他的结论是:“这个谁都扛不住,我觉得没有一家公司能负担得起这笔费用。”

   ② 异构数据将取代真机数据,成为预训练的主要来源。

  正因真机数据太贵,方汉认为用手机、胸挂摄像头拍摄的人手操作数据会成为主流。他给出的现状是采购成本“不到50元,销售价约在50元左右”,并预测“今年到明年”能降到“10元一小时”,这样“1000万小时可能只要1亿元”。他还提到, 昆仑万维 自有的Riemann-1.0模型在加入大量异构数据后,即使是叠衣服这类原本认为只靠真机数据就够的任务,其完成效果也出现了明显提升,“这使得我们的Riemann-1.0在RoboCasa 365这个特别复杂的任务上,能够比之前的方法高出8个百分点”。

   ③ 谁会赢,取决于融资能力和中国的硬件供应链。

  被问及哪家公司更有可能率先达到1000万小时时,方汉的回答很直接:“这个大家都有可能吧,说实话,就看大家的融资能力。”但他随即补充,数据采集设备的生产将集中在中国,理由是“中国是数据采集硬件的产地”,同时拥有“全世界最全的工业门类”以及人口规模带来的家政和 快递 服务业数据优势。他据此预测,到今年底“应该没有厂商能达到千万小时,但应该有厂商能达到百万小时”,明年底“可能有厂商能达到千万”,而亿小时级别则需“3到5年之后”。

   ④ 只做应用层是危险的,创业者应反过来找模型。

  对于今年首发产品中应用层比重上升是否意味着重心从模型层转移这一观点,方汉并不认同,理由是应用层的能力随时可能被大模型内化。他举了Scale AI的例子,称各行业专家写的Skills“把自己行业最有价值的流程全部送给了大模型厂商去训练,大模型厂商一分钱不花就能获得这些能力”。他给创业者的建议是:“还是要拿着钉子找锤子,而不是拿着锤子找钉子”——即先厘清行业最真实的需求,再倒推需要什么样的模型能力。

   ⑤ 大厂不必然赢,团队和算法迭代速度更重要。

  在被问及大厂是否会凭资金优势垄断大模型训练时,方汉判断:“我们也看到现在中国最好的模型似乎也不是大厂出的,而是创业公司。”他认为关键变量在于团队人才厚度和算法迭代速度,而非资金规模,“大厂再有钱,模型训不出来就是训不出来,这是很实际的问题。”

   ⑥ 免费模式会赢,但要等Token成本降下来。

  关于订阅制和免费模式,方汉认为二者的分野取决于发达程度而非地域,“订阅制肯定是在发达国家更普遍,这严格与人均GDP相关。”至于免费模式能否最终胜出,他把关键归结为推理成本:“当Token成本下降到更低时,免费一定会实现,到那时才能成为普惠服务。”

   ⑦ 视频创作门槛下降将带来创作者规模跃升,但游戏世界模型商业化尚早。

  方汉认为,在特定产品中,AI视频已能做到接近真人效果,并将AI视频普及的趋势类比于网络文学作者规模的扩张——中国现有“接近600万网络小说作者,日更6000字”,判断视频门槛降低后也会出现类似的创作者规模扩张。但他对游戏世界模型的商业化落地更为谨慎,认为“可能还要3~5年”,理由是端到端游戏世界模型的推理速度和成本效率目前均远不及3D引擎渲染。

(文章来源:21世纪经济报道)

主题:基金|新股|美股