登录

多模态迎来「架构换代」:商汤连出两张牌,划定大一统基座新标准


速读:U1Pro最核心的价值,在于它将行业对视觉模型的评价标准,从「抽卡式的单张画面惊艳度」,拉升到了「复杂长程任务的稳定完成度」。 信息图、科普图解、PPT页面、装配说明等任务,对模型的要求远高于一般意义上的图像生成,要组织视觉元素,还要梳理信息关系、维持版式秩序,并尽可能降低文字渲染错误。 所有视觉任务的输出没有强行被压缩成单一格式,保留了文本和图像各自擅长的表达空间。 SenseNova-Vision提出了颠覆性的解法:系统性地将多类异构视觉任务,表述为原生多模态生成问题。 类别、坐标、OCR结果等符号化答案,通过文本生成表达;
2026年07月21日 17:43

编辑|杜伟

刚刚结束的 2026 年世界人工智能大会(WAIC) ,具身智能与 AI 终端占据了最显眼的位置,人形机器人、灵巧手和各类智能硬件吸引了大量目光。

展台上的热闹之外, 模型架构的演进 构成了大会的另一条技术线。

在备受关注的多模态模型领域,行业长期陷入「 搭积木」式的困境:理解、生成、编辑和行动往往分散在不同的专家模块中。 这种拼接架构带来了严重的「 信息衰减」 —— 任务链越长,信息传递时的损耗和误差就越大,最终演变成「 听懂了但画不对」、「 改了局部破坏全局」的行业痛点。

这类架构问题被摆上了台面,业界急需新的解题思路。

近日,商汤科技在 WAIC 2026 发布了日日新  SenseNova U1 Pro (以下简称 U1 Pro),这款面向长程任务的交付级原生多模态智能体基座模型,将理解、生成和行动纳入统一的能力框架。

而在 WAIC 召开前夕,商汤还开源了日日新  SenseNova-Vision  视觉大模型,将目标检测、图像分割、深度预测和三维重建等经典计算机视觉任务,直接沉淀为通用大模型的原生能力。

这连续两次出手,并非孤立的技术发布。如果说 U1 Pro 代表了商汤在「 上层复杂视觉创作与交付」上的原生突破,那么 SenseNova-Vision 则回答了「 底层物理世界感知与几何物理表达 」如何统一进通用大模型的终极命题。 两者的交汇,标志着商汤已率先卡位下一代原生统一多模态基座 。

「单次生成」到「长程创作」

探索视觉内容系统化交付

要实现商汤科技董事长兼 CEO 徐立提出的「Agentic Creation 智能体创作」范式,模型需要围绕复杂目标持续理解、规划、生成、检查和修正,最终交付可以直接使用的结果。

这对模型底层架构提出了更高要求。U1 Pro 的技术基石 ——NEO-unify 原生统一架构,正是商汤给出的答案。

NEO-unify 让理解、生成和编辑共享同一套表征空间:其核心设计包括支持输入与输出的近乎无损视觉接口,采用原生 Mixture-of-Transformer(MoT)架构协同视觉理解与生成,并在统一学习框架中,分别以自回归交叉熵训练文本、以像素流匹配训练视觉。

SenseNova U1 Pro 官网:https://www.sensenova.cn/u1-pro

这套架构大幅降低了跨模态交互时的信息损耗。基于此, U1 Pro 展现出面向真实产业场景的交付能力 :

首先是 设计美感的突破 。对于商业海报、品牌视觉、知识信息图这类真实创作任务,审美不只是锦上添花,它本身就是交付的一部分。U1 Pro 侧重构图、色彩、版式和视觉层级等更接近专业设计语言的维度,让模型能够理解「好看」背后的设计逻辑。

其次是  8K 原生超清输出 。 超长画幅和高信息密度图片放大之后很容易出现文字变形、线条断裂和模块错位等问题。U1 Pro 在大尺寸下依然能够保持文字、图标和版式关系的清晰稳定,提高了高密度视觉任务的工程可用性。

第三是 图文与细节控制能力 。信息图、科普图解、PPT 页面、装配说明等任务,对模型的要求远高于一般意义上的图像生成,要组织视觉元素,还要梳理信息关系、维持版式秩序,并尽可能降低文字渲染错误。U1 Pro 在这部分强化的,本质上是图像生成与信息表达之间的耦合能力。

最后是 长程 Agentic 闭环思维 。它支持围绕复杂目标进行数十轮 Agentic Generation Loop,在图文交错的任务过程中思考、校验和修正,并实现整体风格与局部文本的同步精准编辑。

就像在「 预测美加墨世界杯」中,商汤展现出的从「 一次性灵感工具」到「 长程交付者」的进化:先通过 Skills 自动搜集和分析战术数据,再将晋级路径、球员对位、战术体系、传球网络和触球热力图等内容组织成可视化报告,自动组织成逻辑严密、排版精美的可视化报告,完美实现「 搜集 — 推理 — 视觉交付」的全链路闭环。

U1 Pro 最核心的价值,在于 它将行业对视觉模型的评价标准,从「 抽卡式的单张画面惊艳度」,拉升到了「 复杂长程任务的稳定完成度」 。

视觉创作的竞争,也由单次结果的惊艳程度,延伸到一整条任务链的稳定运行。当然,系统级交付仍需接受更多开放环境检验,比如长程任务成功率、错误恢复能力、多轮运行成本以及跨场景稳定性。

重写经典视觉底层范式

视觉任务即多模态生成

如果说 U1 Pro 关注的是如何把复杂信息图转化为直接交付成果, SenseNova-Vision 则在更底层的维度切入,解答了经典视觉任务如何融入通用多模态基座体系的问题。

过去数十载,经典计算机视觉一直依赖「 专家分工」系统,检测、分割、深度估计、三维重建各套模型拥有各自的预测头(Task-Specific Heads)、损失函数、解码规则与评测协议。这套体系非常成熟,也支撑了大量产业应用,但结构性代价同样明显。数据割裂在独立管线中,能力无法跨任务复用,每增加一种新需求,系统就需要接入新的模型或专用模块。任务越多,系统越重。

SenseNova-Vision 提出了颠覆性的解法:系统性地将多类异构视觉任务,表述为原生多模态生成问题 。

它彻底摒弃了繁复的 Task-Specific Heads,在同一个共享的表征空间内,对文本、像素、语义信息和几何特征进行端到端统一建模: 

类别、坐标、OCR 结果等 符号化答案 ,通过文本生成表达;

分割掩码、深度图、表面法线等与空间对齐的 密集预测 ,通过图像生成表达;

复杂场景则直接采用 图文交错混合输出 。

所有视觉任务的输出没有强行被压缩成单一格式,保留了文本和图像各自擅长的表达空间 。

主题:商汤|交付|生成|U1Pro