小鹏集团发布TuringViT,宣称重构视觉大模型训练范式
2026年07月21日 12:23
IT之家 7 月 21 日消息,小鹏集团今日发布 TuringViT 高效视觉编码器 ,面向 VLM / VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。
小鹏集团表示, TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景 ,同时为行业提供了一条可复现、低成本训练 SOTA 级(State-of-the-Art,最新技术水平)视觉 Transformer 的技术路径,推动先进视觉大模型从“头部团队专属”走向“行业普惠”。
据介绍,TuringViT 从架构、数据、训练三个维度同步突破,打造了“线性注意力主导 + 高质量数据治理 + 原生动态分辨率”的完整技术体系,实现了效果、效率与落地性的三重提升。
TuringViT 共推出两个规格版本:
实测数据显示,随着输入分辨率提升,TuringViT 的延迟增长曲线远平缓于标准 softmax ViT,高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下,TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,相比 SigLIP2-ViT-L 提升 2.16 倍,为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。
不同于行业“堆数据规模”的粗放路线, TuringViT 打造了 VISTA-Curation 多模态数据治理流水线 ,通过提升单样本的监督价值实现数据效率的量级提升,从“用更多数据”转向“用更优质的监督”。
针对图文数据,流水线通过三步精细化筛选实现质量升级:
主题:小鹏集团