对话商汤林达华:多模态是Coding之后的下一个战场
能交付商用才是真生产力
作者丨 高允毅
编辑丨 马晓宁
7月18日,在2026年WAIC大会上,商汤科技承办的“基座大模型架构创新与生态合作论坛”如期举行。大会之前,在喧嚣的会场之外,《AI科技评论》拜访了商汤科技首席科学家林达华。
当被问到“大语言模型已经发展到如今高度后,下一个决胜负战场在哪”时,林达华没有罗列复杂的Benchmark,他指向办公室内的一盆矮脚绿植说“你能用语言向我描述清楚这盆盆景每一片叶子的精确位置吗?”
接着他说:“这对我来说很困难,大量的感知细节是无法用语言穷尽的。人眼能一瞬看清的感知,语言却往往无法说清楚。”
这记“盆景之问”,恰恰击中了当下大语言模型面对真实物理世界时的那道隐形的边界。
从设计中的高级审美,到城市空间的三维布局,再到自动驾驶、具身智能与现实世界的交互——凡是需要理解物理空间的场景,都离不开真正的“视觉”能力。
人类的大脑本就是语言与视觉的深度融合的产物。从这一第一性原理出发, 商汤押注的下一个战场,正是多模态。
过去一年,从 OpenAI 等国际巨头到国内的Kimi、DeepSeek、字节、阿里,重金砸向多模态的玩家不在少数。然而,在视觉领域深耕多年的商汤,选择了一条更难、也更接近本质的“硬核”道路:从底层融合语言和视觉基座。并在今年3月推出 原生统一多模态架构 NEO-unify 。
4 月,商汤正式发布并开源了基于原生统一架构的多模态模型 SenseNova U1(简称U1),切入设计赛道 。 而在大会当天,商汤选择迈入商用的深水区,推出 可交付级别的 旗舰模型—— SenseNova U1 Pro(简称U1 Pro) 。 作为全球首个以“理解、生成、行动”原生统一为内核的多模态工具,它具备内生的“图文交错思维”,能直接输出高达原生 8K 顶级画质成片,在设计领域正面对标全球顶尖的如 GPT-Image-2等模型。
借此契机,我们与林达华进行了一场 关于多模态的终极形态 与商汤技术底牌的深度对话。
01
为什么多模态
是Coding之后的下一个战场
当前,AI Coding 是头部 AI 厂商疯狂内卷的行业高地,Anthropic等公司也因此实现飞升。外界疑惑的是, 商汤为何在此时不急于跟风抢夺红利,反而大谈特谈多模态?
在林达华看来,AI Coding 确实是目前商业化最成熟的赛道,但纯文本语言的天花板也已经清晰显现。
“你用任何一款代码模型写前端网页,一眼就能看出来是 AI 生成的。它和具备‘苹果级’质感的现代产品界面,有着非常明显的差距。” 林达华指出, 高级的设计感与空间美学,纯靠代码逻辑根本实现不了,这是纯文本 Coding 天然的盲区。
行业中最敏锐的巨头早已开始悄悄转向。以编程能力见长的 Anthropic,在Opus 4.8 版本中重点强化多模态元素。
这意味着, 当后端逻辑代码的能力逐步趋同、价格战愈演愈烈,前端体验、视觉交互自然成了下一阶段的竞争高地。 这也正是商汤切入AI Coding战场的机会,与其在纯文本领域硬卷,不如发挥自身在视觉上的积累和绝对优势。
在业内有一种观点认为:未来的 AI Agent 都会以纯文本命令行(CLI)交互,多模态的价值没有想象中那么高。 林达华并不认同,他认为只要人和 AI 持续共存,在人机交互上,视觉交互就是不可替代的核心载体, “ 因 为CLI是面向机器的,而视觉才是面向人类体验 的。 ”
无论是写办公汇报、海报设计,还是游戏开发、影视制作,这些更高频的大众场景,其本质都离不开视觉。
"想要打造能在物理世界中思考、行动的‘全能智能’,就必须打破壁垒,让视觉与语言在底层大脑中融为一体。"林达华强调,这正是商汤自研 NEO-unify 原生统一架构的核心初衷。
但这并非易事。语音和文本属于同构模态,语音可以直接映射为文字,仅多了语气、停顿等少量维度;但视觉与语言是完全异构模态,像素无法简单对应文字词元, 攻克异构模态融合,一直是多模态领域长期发展的核心难点 。
02
U1 Pro的打怪升级路径
长期以来,多模态大模型领域的主流技术路线是 “拼接式架构” ,即在成熟的语言大模型之外,外挂一个独立的视觉编码器(VE)等模块。这种方式的本质,是先将图像“翻译”成文本,再交由语言模型去处理。
拼接方案的工程门槛低、训练速度快,但其技术上天花板也相对较低。因为这种翻译的过程,会损耗大量精细化空间和感知细节信息,导致 视觉与语言的融合效率很低, 并非"真正看见"。
林达华带领的商汤团队很早就看到了拼接架构的局限,并一直在寻找一种原生统一模型架构的可能性。 他们认为, 多模态的终极形态应当是让不同的AI模态拥有共同的语言和表征 , 从而能够像人类大脑一样,顺畅无阻地深度沟。
“我们很早就看到了拼接架构的局限性。 多模态的终极形态 , 应当是让不同的模态拥有共同的内核语言和统一表征, 能够像人类大脑一样,顺畅无阻地深度沟通 。”林达华透露,OpenAI和谷歌同样意识到了这一点并秘而不宣,而商汤选择走得更公开、更彻底。
这是一场坚守长期主义的漫长探索:
2025年中,林达华团队联合南洋理工大学S-Lab,率先在小规模数据上验证了原生融合的设想。同年9月,团队发表论文Towards Native Vision-Language Primitives at Scale,在学术界首次系统阐述了彻底移除视觉编码器、建立深层融合的原生多模态NEO架构。
2026年3月,商汤进一步发布升级框架版—— 原生统一架构NEO-unify 和论文 NEO-unify: Building Native Multimodal Unified Models End to End 系统阐述了打造端到端原生统一模型的宏大设想。
在NEO-unify架构中, 商汤彻底移除了主流大模型普遍依赖的视觉编码器和变分自编码器,让模型不再需要"翻译器",而是直接从像素和文字中学习。
支撑其运转的是一套自研的 Mixture-of-Transformers(MoT) 架构。该架构的独特之处在于,它让语言和视觉信息在模型的每一层计算中完成深度交融。对于多模态领域,这种从架构层面的重构,意义堪比Transformer之于大语言模型。
那这套架构效果好不好呢?其实效率惊人, NEO-unify架构仅需3.9亿图像文本示例(仅为业界同等性能模型约1/10的数据量),就涌现出了顶尖的视觉感知和推理能力 。
开源版本的SenseNova U1正是这套架构的结果,它拥有真正的“图文交错思维链”,可以在同一个上下文里边写字边插图,确保图像和文字在风格与内在逻辑上具备极高的一致性。值得一提的是,在同量级开源模型中,仅以 8B 体量起步的 U1 直接斩获 SOTA 性能,部分表现甚至跨代直逼主流大型闭源模型。
随后,研发团队敏锐地锁定了 “信息图”(infographic)赛道,并且针对这一极具商业价值的场景,该系列正以惊人的速度高频迭代:
infographic-V1:在底层算力架构上进行了全面重构,让信息图生成的信息密度与排版质感迎来了显著跨越;
infographic-V2:彻底攻克了行业顽疾,针对以往“字数一多画面就糊、甚至连字错字”的痛点,大幅提升了小字清晰度与排版精度,视觉表现直接向专业设计师看齐。
infographic-V3:重磅引入“可编辑功能”,让用户可以随时点选、直接修改画面。