趋境科技艾智远:Token的需求已经从单次调用发展到规模化生产
专题:中国国际服务贸易交易会-2026中国AIGC创新应用交流会
服贸会专题活动“2026中国AIGC创新应用交流会”于9月10日在北京举办,主题为“智启未来 应用无界——从模型创新到场景落地”,趋境科技创始人兼CEO艾智远出席并演讲。

以下为演讲实录:尊敬的各位领导、各位嘉宾、各位同仁,大家上午好!
非常荣幸能有这个机会跟大家一起分享趋境科技这两年在整个AI Token或者推理领域的一些实际的进展。趋境科技是一家领先的高品质的AI Token生产服务商,今天重点跟大家分析分享一下国产集群如何来构建高品质的AI Token的整体生产。我们公司也是从清华大学计算机系孵化的一家公司,公司成立的时间不是很长,大概有两年半的时间,但是在推理技术的引领和商业化的进展来讲,还是非常迅速。
当前来讲Token的需求已经从单次调用到规模化生产,因为我们也在服务目前大家主流的各大模型公司,还有互联网客户,我们现在有一个很大的感知,去年的时候虽然DeepSeek在2月份火了一把,但是应用并没有走向真正落地的环节,它呈现了一个断崖式的流量下跌。AI这一次爆发的点是出现在去年的年底和今年的年初,标志性的是两大模型,是Kimi和智谱的5系列,和Kimi的2.6和2.7系列,它翻过了实用性的门槛。所以今年一共有两个半的场景在蓬勃发展,第一个场景是以Seedance为主的文生视频型场景。第二个场景是AI Coding,半个场景是前半年比较火,这半年又开始起量的AI办公类的场景,比如像现在的腾讯WorkBuddy。在当前来讲,全国日均的Token消耗量大概超过500万亿的规模,比国家公布的数字还要高。那占据比较大的,超过50%的是Seedance和可灵这一类的Token,大概日均在200多万亿以上。剩下的就是以办公,比如像seed,还有大家使用的一些线上的Token。第三个就是AI Coding,而商业化进展比较好的就是以Seedance这一类的文生视频,有AI漫剧的整个行业的闭环,第二个就是AI Coding程序员可以花很多钱。我们公司每个人1个月在Token上的花费大概是1000多块钱以上的量级。所以AI的使用量在大量的爆发。
第二个点就是Token使用的单次规模变得非常大,去年大家都是ChatBot,大概输入在几百个Token的上下文,但是今年年初智谱的5.1大概是平均30K的上下文,5.2和5.3就翻到了平均100K到200K的上。上下文下文带来的很大的点就是如果没有很好的优化,基本上大家的使用成本10以十倍的量级在升,所以今年为什么在AI Infra或者推理领域比较火的原因,就是能把单位的算力成本转化成Token的量,成为了大家要解决的很关键的问题。
企业的真正需求到底是什么?去年的时候AI并没有进入到生产环境内,所以大家能够用得上就可以。但是今年AI开始进入到生产环境,如果企业去买Coding,大家就会关心我买了1000块钱,一个人每个月的花费,我到底给公司带来了超过30%还是40%的营收的增长还是效率的增长,大家开始关心这个指标。所以开始从能用到用得好的转变。在当前的市面上,有很多人在提供整个Token服务,也比较鱼龙混杂,有的提供一折、两折、三折的Token,基本会出现反应慢、经常断联,或者是处理延迟比较长。趋境这边提供的是高品质的Token,这里边有一些显著的特点,它要求整个Token的生产速度极快,比如说我们日产的Token速度可能达到50-60,甚至100 Token每秒的生成速度,要比Kimi、DeepSeek或者大家买的Coding Plan快数倍以上的量级,包括整个推理延迟,可能我们扔进去一个10万字的上下文的文字,可能3秒钟或者5秒钟就要返回第一个字,这就是对高品质的Token的要求。
现在很多人都在提供整个Token服务,大家有一个误区,我买了一个算力,比如我构建了一个算力中心,上面去搭建一套所谓的开源软件就可以提供Token服务,实际上并不是这个样子的,我们今年年初和很多的厂商都做过交流,我们拿同样的算力,哪怕是国际上最先进的算力,如果没有经过很好的优化和整合服务,大概能够差3-6倍的Token产能。同样拿一块集群,有的人能够做出亏损,有的人能够做到盈利。如果盈利,能盈利多大的规模呢?如果按照Token不打折,利用率足够高的情况下,可能Token的整体营收相对于租金成本来讲,能够有3-5倍的量级,比如说一台机器一个月租金是20多万,如果做得好的情况下,不打折的情况下能够做到80到100万的产出,现在Token的市场也很卷,大家把价格已经卷到白菜价的逻辑了,所以也很痛苦。趋境做的Token服务,不只是在整个算力的基座上,我们因为有一大串的中间的软件层的总体优化,包括市面上大家了解的各种各样的推理的领域和推理的软件,基本上是从我们这边技术的开源和开放出去的技术。
相对来讲,我们做的叫企业专属或者生产专属级的高品质的AI Token服务,我们坚持的路线是少模型、深优化,这里有两个对比,一种路线是我在云上构建一个模型超市,提供上百款模型,提供通用的Token的服务,我们经过了大概1年的时间就发现,这一次整体的AI它还是由超大模型构建的整个AI的能力。比如说去年Token产量没有今年的高,是因为今年的模型,比如说像智谱的7000多亿参数,以及Kimi的2.8T的参数下才达到了越过国际上领先的AI能力线,大家的使用才会增大,基本上有90%多的模型很少提供服务,提供服务的大部分是千亿级、万亿级的模型。但这些模型的核心问题是我怎么让Token的价格一降再降,比如说现在在智谱的模型下,官方定价,百万的输入是8块钱,百万的输出是28块钱,这个价格还是挺贵的,一天大概一个人用1个亿的Token是很正常的,1个亿的Token价格就需要几百块钱人民币的消耗。
所以怎么解决成本的问题?我们就基于少量的模型,特别是像DeepSeek、智谱、Kimi,包括像MiniMax、千问等等这种高质量的模型,我怎么能够在极低时延的要求下,比如说万亿级参数,输入在1万到10万文本的情况下,能达到1秒到3秒钟的延迟,99%的稳定性,还是能达到每秒钟50Token以上,相当于折合60-70个汉字的生成速度,还能达到一个非常低的成本的条件下,我能不能做到非常高效的生产服务,就是要压榨算力最后的成本,1P算力能够转化成到底100万Token,还是200万Token,这就是趋境科技要做的事情。
我们也不只是在做的相关的技术,我们也是第一个把技术拿出去开源,辐射于整个市场化的。我们去年的时候做得比较有名的,就是做所谓的端测去跑超大号模型。去年2月份我们发布了KTransformers开源引擎,当时是能够在10万元的级别硬件上去运行DeepSeek的671B模型和Kimi 1万亿参数的模型,通过做AF分离,叫Attention和FFN分离,然后让Attention用4090去跑,让FFN用CPU+内存去跑,能够达到单个10万元级别硬件上跑出30 Token以上的生成速度、700多Token的处理速度。换句话说,当时清华校长的办公室里就可以放一台工作站,10万块钱,然后运行一个万亿级别参数的模型去处理他自己的私密化公文,所以去年也是因为这个原因,趋境的整个开源项目蓬勃的发展,包括DeepSeek的官方论文引用,包括产业界所有主流的GPU、CPU厂商均参与了整体的共建。今年的情况下,整个Token大量的爆发,我们就把另外的一个开源项目推动起来,就是Mooncake,Mooncake是Kimi的底座,2024年帮助Kimi节省了超过线上75%以上的整体吞吐,目前超过60%国内的互联网厂商、模型公司的底座均采用我们的开源引擎。
趋镜借助于我们整体构建的ATaaS AI Token的生产平台,我们在做Token的快速复制。首先我们会去做Token的运营和生产,其次就是我们还会和合作伙伴做Token的共运营,比如说它有算力,我可以把我的服务构建上去之后,帮它提供整个Token的生产能力,把Token再售给模型公司、大型客户等等。刚刚郭总讲了非国产异构的事情,我们因为借助于我们的Mooncake,当时也是第一个把PD的分离推向整个工业界的整体方案,我们在国产化的实践过程中就发现,当前的国产卡受限的最主要能力并不是计算,像最先进的S5000和S6000,还有包括华为的950等等相关,他们的计算能力是可以使用的,但是关键问题是受限于HBM。我们这一代的HBM是HBM2E,实际上像国际上先进的卡,HBM已经达到了8TB,甚至更大的带宽,相当于我们在用USB2.0跟USB3.0,甚至是USB4.0进行一个对比,直观的感受是整个Token的生成速度会倍数级别的降低。基于这样的方式,现在目前国产卡去提供高品质的Token,去跟国际上先进算力进行对比的时候,往往都是亏钱的,所以大家就有一个账,是拿国产卡很难算得过来账的一个核心的问题。
那我们在研究了大概大半年的时间之后,我们发现怎么能让国产卡真正生产的Token,能被这些模型公司和互联网公司去购买,我们做了一个详细的优化,就叫做国产异构的整个PD的方案。本质上来讲,我们可以让国产的摩尔和沐曦,还有包括一些新的卡去做计算节点,让国际上先进的卡去做生成节点。大家可能觉得什么样的比例,如果我掺沙子掺得比较多,还是国外的卡,整个生产成本还是比较高。但我们可以做到一台先进的Decode的节点,外挂40多台国产卡节点来做到高效的生产能力。换句话说,在当前被海外技术垄断的情况下,我们通过这种方案能达到综合的性价比超越国际上最领先算力的整体性价比。也就是说我们国产卡可以算过来账了,原来的情况下,我们投入1个亿,能够收回来5000万就不错了。但是我们现在投1个亿能收回1个亿,甚至收回1.5个亿,那更有利于整个推理的产能。我们已经落地了多个国产和非国产的整体异构方案,大概有上千卡,可能到下半年有上万卡的整个国产卡去推进整体的服务。
相对来讲,趋境也是走过了一两年的路,我们整个业务发展也很快,相对于今年春节,我们单台算力Token的生产效率提升了3倍以上,整个Token整体的生产的量大概提升了30倍以上。日均Token的生产量,在这种万亿级别参数模型下,大概能拿到日均数万亿级别的整体的产能,我们已经建成了日均万亿级、千亿级的高品质的AI Token的工厂,不管是北京、上海、杭州,还有郑州等等,遍布在全国的各个地方,可能到今年年底的时候,我们整个Token的产能也会有更大量的提升。
以上就是介绍,谢谢大家!