登录

端侧大模型成了刚需,芯片准备好了吗?


速读:法律、金融这些垂直行业的需求尤其具体,对数据隐私和计算延迟要求更高,对生产力工具迭代的嗅觉也更敏锐。 这个数字说明了一件事:大量智能体的工作流程,本地算力完全可以承载,而且无论是终端设备还是更好的AI芯片,客户购置本地算力都只需要一次性消费,云端的token账单却要按用量、按月计费。 一个会聊天的模型,只要云端的算力和数据就够了,而一个会做事的模型,由于推理频次和持续性大幅上升,带来了更显著的成本和安全问题,必须往安全、灵活、可控的端边走,所以端边的比例只会越来越大。
2026年07月18日 17:0

端边芯片的竞争,才刚开始。

文| 晓曦

在2026 WAIC现场,我们观察到: 大模型的能力,正在从互联网和聊天框里走出来。

两年前,行业对大模型的所有想象几乎都在云端:参数越大越好,集群越强越好,谁在数据中心里堆的GPU多,谁就是赢家。其实,这套逻辑到今天也没有错,但它只讲对了故事的一半。

至于另一半,在云端之外,正在安静地发生。

Agent到来以后,人们发现,推理任务开始离开数据中心,沉淀到了PC本地、手机本地、机器人的大脑里,以及更多叫不出名字的终端设备中。终端形态各异, 面对的是同一个“不可能三角”:功耗只有几瓦,成本卡在几十美金,客户却要求它们跑得动几十亿甚至上百亿参数的模型。

芯片行业过去十年没解过这种题,因为云端的规则是推高天花板,算力强者通吃。而端边要做的是,在物理规则的铁笼子里,把大模型推理的效率逼到极致。

这道题,重写了端边AI芯片的竞争规则。

大模型,正在走向端边

为什么端边大模型“一夜之间”就成为了大势所趋?

最近一段时间,黄仁勋反复在讲一个判断:推理算力需求大约要增长一万倍,Token会成为新的计量单位。

数字本身不是重点,量级的变化才是。推理一旦变成如此高频、持续、与账单直接关联的行为,全走云端在成本上也就会越来越荒谬。一次推理调用花不了几个钱,但一天几亿次会是一笔很惊人的账。

新的推理量级造就的成本压力,会把越来越多的计算推向端边。

中国市场对这件事的反应比海外更快,大量应用方案公司已经在找芯片厂商,要求做本地加云端的混合方案。法律、金融这些垂直行业的需求尤其具体,对数据隐私和计算延迟要求更高,对生产力工具迭代的嗅觉也更敏锐。

相比验证概念,市场更需要的是能跑通、能量产的交付级产品。而站在芯片公司的视角下,水温的变化正在于此:适配端边大模型的AI芯片,很快就会成为一批批真实的订单。

一家深圳公司提供了一个样本,他们搭了一个端云混合的Agent平台,上面跑着各行业的智能体,用于日常运营,用一套算法动态分配任务,实时判断哪些走本地,哪些上云端。系统跑了一段时间之后,结论是:80%左右的任务在本地完成,只有20%走云端,平台还会自动统计客户省下了多少Token费用。

这个数字说明了一件事:大量智能体的工作流程,本地算力完全可以承载,而且无论是终端设备还是更好的AI芯片,客户购置本地算力都只需要一次性消费,云端的token账单却要按用量、按月计费。

经济账一旦跑通,迁移就是不可逆的。

成本只是第一层,延迟是第二层。端侧推理能做到毫秒级响应,云端推理则要受制于网络环境,对于需要实时交互的Agent来说,延迟是会破坏任务的硬伤。

隐私是第三层让端边大模型走向舞台中心的因素,数据即资产的认知越来越普遍,本地处理意味着照片、文件、视频数据始终留在本地设备里,不但安全,而且离线可用。

也就是说,端边大模型可以联网获取外部信息,但本地数据和处理能力是留在本地的,断网也能跑。对于不少需要在网络死角运行的工业设备和移动终端来说,安全可离线是数字化的生死线。

几层变量叠加在一起,揭开了端边大模型价值升维的真正原因:大模型的价值锚点,正在从知识密度转向行动密度。

一个会聊天的模型,只要云端的算力和数据就够了,而一个会做事的模型,由于推理频次和持续性大幅上升,带来了更显著的成本和安全问题,必须往安全、灵活、可控的端边走,所以端边的比例只会越来越大。

未来,主流解决方案的端云比例具体是多少不重要,但背后的逻辑很清楚:本地推理能满足的场景,肯定先用本地;本地做不了的,再上云端。

与此同时,端边化的趋势也给硬件端抛出了一道新难题: 云端芯片比的是一力降十会,算力即正义,而端边的游戏,竞争规则不一样,比的是另一种本事。

走向端边大模型的AI芯片,逃不开的一个入局门槛是,如何解开那个“不可能三角“:即能力要求越来越高,要跑更大的模型、更快地处理任务,功耗却只有几瓦,成本卡在几十美金。

性能、成本、功耗,三个约束彼此咬合,放弃任何一个,都会让端边大模型失去实用的魅力。

主题:本地|端边大模型