科学网—大模型之后:AI为什么正在从语言走向物理
精选
已有 303 次阅读
2026-10-5 12:10
| 系统分类: 科研笔记
从 Token、Action、World Model 到 Physical AI 与 Neural Operator
过去几年,AI 最显眼的进步发生在语言。但更值得关注的变化是:AI 的输出正在从 Token 变成 Action,它不仅要“回答”,还要“行动”;不仅要描述世界,还要预测行动会怎样改变世界,并最终面对真实的物理约束。
如果把这条技术路线压缩成一句话,就是: Token → Action → World → Physics。 这并不意味着大语言模型结束了,而是意味着 LLM 正在从单一模型变成更大智能系统的认知内核。
一、从 Token 到 Action :模型正在变成系统 语言模型擅长在符号空间中理解和生成内容。当模型开始调用浏览器、API、代码环境和外部工具,并围绕一个目标持续执行时,问题就发生了变化:输出不再只是“下一段文字”,而是会改变环境的行动。
Agent 的核心不是给 LLM 换一个名字,而是把模型放入“推理—计划—执行—观察—修正”的反馈回路。于是评价标准也从“单次回答是否正确”,转向“多步任务能否可靠完成”。一次回答不错,不等于连续一百步都可靠;局部错误会累积,失败后的识别、回退和恢复也成为系统能力的一部分。
图 1 AI 学习对象的扩展:Token → Action → World → Physics
二、 World Model : AI 必须学会预测 “ 做了之后会发生什么 ” 当 AI 开始行动,仅靠语言知识已经不够。真正关键的问题从“下一个 Token 是什么”,变成“如果采取这个动作,接下来世界会怎样变化”。这就是 World Model 重新重要起来的原因。
世界模型可以被理解为某种“内部模拟器”:先观察环境,再在内部想象未来,评估不同选择,形成计划,然后行动。它让行动第一次拥有可计算的反事实。对于机器人、自动驾驶和复杂软件 Agent 来说,这种能力比单纯增加知识量更接近真实任务的瓶颈。
三、 World Model 还不够:看起来合理,不等于物理上可实现 生成模型可以产生非常逼真的海浪、烟雾或机器人运动,但视觉上的真实感并不保证物理上的正确性。Pixel Fidelity 不等于 Physical Fidelity。
World Model 更擅长场景语义、对象运动和多模态预测;Physics Model 更关心守恒律、边界条件、稳定性、能量与耗散、时延、接触、摩擦以及安全约束。当 AI 进入流体、声学、结构、热、机器人和控制系统时,这条分界线会越来越重要。
图 2 World Model 与 Physics Model 的关注点并不相同
四、 Physical AI :真正的门槛是闭环,而不是 Demo Physical AI 不应被简单理解成“机器人接上大模型”。一个能够进入真实世界的智能系统,至少需要把感知、状态估计、任务推理、世界与物理预测、规划控制、执行和反馈连成闭环。
进入真实系统后,平均精度也不再是唯一指标。更重要的是:系统能否稳定运行,约束是否被违反,尾部延迟有多大,失败后能否恢复,必要时能否进入安全模式。一个错误 Token 可能只是答错;一个错误 Action,可能就是一次真实的碰撞。
五、 Neural Operator :从 “ 学习样本 ” 走向 “ 学习物理映射 ” 很多科学与工程问题,本质上并不是固定维度的“输入一个向量、输出一个标签”。输入可能是几何、材料、初始条件和边界条件,输出则是一整个随时间和空间变化的速度场、压力场、温度场或声场。
Neural Operator 的目标,是学习 Function → Function 的映射。这使它天然适合连接机器学习与 PDE、仿真和数字孪生。但更现实的方向并不是“AI 取代传统求解器”,而是 Solver × AI:成熟数值方法负责守恒、稳定性、边界条件和验证体系,可学习算子负责快速近似、跨参数复用和在线适配。
六、下一代 AI ,可能不是 “ 一个更大的模型 ” 如果把这些线索放在一起,下一代智能系统的结构正在逐渐清楚:语言模型回答“我知道什么”,世界模型回答“可能发生什么”,物理模型回答“必须发生什么”,行动模型回答“应该做什么”,最后由真实世界给出反馈。
于是核心循环可以概括为:Know → Imagine → Constrain → Act。LLM 不会消失,它仍然可能是知识、推理与交互的认知内核;真正变化的是它的外围——Memory、Agent、World Model、Physics Model、Control 与 Verification 将逐渐组成一个更大的闭环系统。
图 3 下一代物理智能:Language + World + Physics + Action
结语: AI 的下一步,是读懂现实世界 过去十年,我们让机器越来越擅长阅读和生成语言。接下来的问题,是它能否理解另一种更难的“语言”:时间、空间、物质、能量、因果、约束与反馈。
真正困难的下一步,可能不是让机器“说得越来越像人”,而是让它逐渐理解世界为什么这样运行,并在约束之下预测、规划和行动。换句话说,下一阶段的 AI 不只是生成世界,而是理解、预测并安全地改变世界。