登录

商汤科技开源8 B轻量多模态大模型:原生4 K输出、全能视觉编辑


速读:作为一款参数量为8B的轻量化模型,它在多项核心视觉任务中展现出了超越同量级模型的实力,甚至在部分复杂排版与文字渲染上达到了媲美超大规模商业模型的交付水平。 其次是更可靠的原生图像编辑能力,增强了对主体身份、空间结构、版式关系以及非编辑区域的保持度,同时全面提升了局部修改、元素替换、文字精修和多参考图编辑的综合表现。
2026-08-21 14:17

商汤科技正式宣布开源全新的轻量级、原生统一多模态大模型 SenseNova U1.5Lite。作为一款参数量为8B 的轻量化模型,它在多项核心视觉任务中展现出了超越同量级模型的实力,甚至在部分复杂排版与文字渲染上达到了媲美超大规模商业模型的交付水平。

image.png

SenseNova U1.5Lite 原生支持3至4K 的上下文长度,能够同时处理主体、数量、空间关系、文字、布局以及风格等多重约束,从而显著提升复杂视觉任务执行时的稳定性。

在具体功能特性方面,该模型带来了多项核心升级。首先是更高质量的视觉生成,显著改善了整体构图、色彩、材质、光影、真实感和局部细节,有效避免了传统模型常见的局部正确但整体完成度不足的问题。其次是更可靠的原生图像编辑能力,增强了对主体身份、空间结构、版式关系以及非编辑区域的保持度,同时全面提升了局部修改、元素替换、文字精修和多参考图编辑的综合表现。

image.png

此外,该模型在文字与复杂布局的处理上同样表现亮眼,加强了中英文文字、海报、信息图、品牌视觉及多文本排版能力,推动生成内容向完整的视觉表达迈进。在视觉控制上,它支持 Bounding Box、Visual Marker 以及单图、多图参考等多种方式,能够对指定区域和对象进行更精确的编辑。更值得一提的是,它实现了原生4K 高分辨率输出,在高分辨率生成中能够兼顾整体宏观构图与极精细的肌理、微小文字以及光影折射效果。

项目地址:https://github.com/OpenSenseNova/SenseNova-U1

主题:文字|编辑