成果三年两登Nature封面,这支清华团队想让AI换个方式看世界
如果打开 Nature 官网,在 AI 和芯片两个领域,中国大陆机构以第一完成单位登上封面的论文,到目前为止一共有三篇:2019 年的天机芯论文、2024 年的天眸芯论文和 2025 年的 DeepSeek-R1 论文。清华大学类脑计算研究中心一个团队占了其中两篇。
清华博士毕业生、晰见科技创始人杨哲宇先后参与了天机芯和天眸芯两项工作,也是天眸芯论文的共同第一作者。2025 年夏初,由清华大学类脑计算研究中心孵化的晰见科技正式成立,承接并持续推进天眸芯类脑视觉技术的产业化。 这家公司做的事情,简言之就是重新做一款给 AI 用的眼睛。
已有摄像头本就不是为 AI 而来
摄像头的工作原理是这样的:光线进入镜头后,传感器将光信号转换成数字信号,按照固定频率生成一帧帧图像,再经后端处理和编码,形成可以存储和播放的视频。这套以帧为单位记录世界的方式,从 CCD 和 CMOS 图像传感器出现以来,已经沿用了近半个世纪。
(来源:资料图) 传统摄像头最初是为人观看而设计的,核心目标是尽可能完整地还原画面的细节和色彩,代价则是庞大的数据量。 哪怕是一个普通的监控摄像头,一天连续录制的视频数据多达几十个 GB;一辆装有十几个摄像头的自动驾驶测试车,一天产生的 Raw data 往往以 TB 计算。
但当摄像头成为机器人、自动驾驶等实时感知物理世界的入口,这套范式的问题开始显现:如何减少对相似画面的重复处理,同时又不遗漏关键变化?传统摄像头通常以固定帧率采集完整画面,相邻帧中的天空、路面和护栏往往高度相似,而前车突然减速、行人进入道路或光照骤变等关键信息,可能只出现在短暂时刻和局部区域。前者提供道路结构、目标外观和空间关系,后者关系到快速响应;两类信息都不可或缺,却不必始终以相同频率和数据量被采集、传输和处理。
换句话说, AI 需要的并不是简单舍弃静态信息,而是一种更适合机器理解的信息组织方式。 这样一套高效的视觉机制,其实早已存在于人类身上。
杨哲宇在清华类脑中心读博的时候,实验室里有一句流传很广的话:“大脑是一个 20 瓦功耗的通用智能系统。”20 瓦大约是一个节能灯泡的功率,人类用如此低的功耗完成视觉感知、空间定位、决策规划和运动控制,依靠的并不是像摄像头那样,以相同方式完整处理每一帧画面。
人类视网膜中有上亿个感光细胞,最终仅通过百万量级的视神经纤维将信息传向大脑,相当于在感知前端完成了百倍以上的信息压缩和编码。 这并不是简单地“把变化的部分传上去、静止的部分不上传”,而是通过不同类型的细胞与通路,对颜色、空间结构和时间变化等视觉信息进行拆解、重组,再以互补的方式传递。
天眸芯做的事情,就是把上述机制做成了芯片。
把视觉拆成原语,再组成两条互补通路
天眸芯与传统图像传感器最大的不同,不是简单地增加了几路输出,实际上是先把视觉信息拆解为 RGB、时间差分(TD,Temporal Difference)和空间差分(SD,Spatial Difference)三类视觉原语,再将它们组织成两条互补通路:认知导向通路保留完整的 RGB 信息,动作导向通路则同时捕捉高速、稀疏的时间差分和空间差分信息。
这套架构并不是让 AI 在三个通道中选择一个,其实是让三种信息彼此补位:RGB 记录颜色和外观,空间差分突出边缘与结构,时间差分捕捉运动与变化。当 RGB 画面因为过曝或运动模糊而失真时,另外两路信号仍可能保留部分结构和变化信息。
基于这套原语表示与互补通路,天眸芯能够在传输带宽降低 90% 的同时,实现每秒 10,000 帧的高速感知、10 位精度和 130 分贝的高动态范围。传统图像传感器中相互牵制的帧率、精度、动态范围和带宽,在这一架构下获得了新的平衡。
那么,这些指标意味着什么?以车辆进出隧道时的剧烈光线变化为例,传统 RGB 画面可能瞬间过曝或者欠曝;在天眸芯中,空间差分仍可能保留部分边缘和结构信息,时间差分则能够记录快速变化。即使其中一路信号受到影响,另外两路也有机会保留可供后续算法使用的线索。
2024 年 5 月,相关论文登上 Nature 封面。封面上,一颗芯片被拆解成不同颜色的光束,每一束光线代表着一种视觉原语。
(来源: Nature ) 但芯片只是把互补信息采集了下来。真正困难的是,当高速运动、过曝、频闪等视觉退化叠加出现,不同通路提供的信息也可能彼此冲突,算法如何判断哪些线索更可靠,并把它们融合成能够用于识别和决策的视觉表示?围绕这个问题,团队此后又研究了两年。
无完美画面之时,AI 如何学会看世界?
全球做视觉算法的团队普遍面临着同一个困境:视觉算法通常依赖大量带有标准答案的数据,也就是所谓的真值。在正常光照、低速运动等条件下,研究者较容易获得清晰画面和准确标注;然而在高速运动、强光过曝、频闪干扰和暴雨大雾等场景中,图像本身就可能出现结构失真或信息缺失,现实世界里往往不存在一张同时拍下的“完美画面”作为参照。这些真实退化数据因此很难进入传统监督学习流程,也容易成为 AI 训练中的盲区。
围绕这个问题,杨哲宇所在的天眸芯团队走了一条不同的路。他们借鉴了人类视觉系统形成内部模型的机制:人并不需要为看到的每一帧画面配备一个外部“标准答案”,视觉系统会利用不同线索之间的关系进行预测、校验,并在持续交互中形成对世界的内部表征。
他们把这套机制搬到了算法里。团队首先利用天眸芯采集的互补数据构造出几组中间表征:一组适应光照的快速变化,一组补偿高速运动带来的模糊,另一组处理过曝和欠曝区域。这些表征各有所长,也各有缺陷。随后,团队设计了一套自监督学习框架,让它们彼此预测、相互校验,并根据不同场景判断哪些信息更加可靠。
结果发现,算法可以在没有真实完美画面作为参照的条件下,从多种不完整的信息中形成更完整的视觉表示,并进一步解码出一张尽可能清晰、高动态范围且时空对齐的画面。 论文把它称作“估计视觉真值”。团队将其用于后续的单目深度估计和视频实例分割任务,效果相比直接使用原始 RGB 数据有了明显提升。 2026 年 8 月,相关论文登上 Nature 旗下首本传感领域专刊 Nature Sensors 封面,距离天眸芯封面论文恰好两年。
光子到 Token,是物理 AI 的必经之路
2025 年博士毕业后,杨哲宇没有选择高校教职。面对国内外多所高校递来的教职邀请,他都一一婉拒。他告诉 DeepTech:“我的字典里,创业就是 All in。”教职对于当时的他来说可能是枷锁而不是帮助。
创业之后,杨哲宇为公司组建了一支科研骨干领衔、兼具国际大厂量产经验的年轻化工程团队。首席科学家赵蓉教授长期负责清华大学类脑计算研究中心的感知研究方向;CTO 王韬毅博士长期参与天眸芯研发,曾获全国中学生物理竞赛金牌,已在 Nature 等顶刊发表论文 13 篇。
公司研发团队中博士、硕士占比超过 80%,核心工程成员拥有 10 至 20 年的图像传感器与芯片从业经验,曾任职于索尼、英伟达、安森美及国内头部 CIS 企业;产业化与市场团队成员则深耕行业 20 余年,曾负责年规模数亿美元的相关业务。团队能力由此贯穿原创研究、芯片设计、工程量产和市场落地。
目前,天眸芯一代芯片已成功点亮,面向量产的二代芯片也已完成流片。按照设计指标, 二代芯片的分辨率将从 20 万像素提升至 500 万像素,功耗较传统传感器降低约 80%;同时可在感知前端直接提取供大模型使用的高信息密度视觉 Token,并将首 Token 延迟控制在几十毫秒以内。