DeepSeek融资会议实录:梁文锋拆解下的大模型技术与商业哲学
2026-07-23 13:57
·上海
·界面新闻官方网易号
0
界面新闻记者 | 伍洋宇 界面新闻编辑 | 文姝琪
一个月前,DeepSeek完成首轮外部融资,募资总额超过500亿元人民币(约74亿美元),投后估值突破500亿美元(约3380亿元人民币)。
这一轮融资中,创始人梁文锋出资约200亿元,为最大单一出资方。此外,腾讯出资约100亿元;宁德时代体系出资约50亿元,其中包括宁德时代及溥泉资本;网易、京东、Monolith砺思资本、IDG资本分别出资约30亿元;正心谷投资、拾象科技分别出资约15亿元。
这随即成为AI领域一级市场的讨论焦点。行业人士关心为何一家一度远离资本市场的头部模型厂商,决定接下投资人们的橄榄枝。更吸引人的是,除了承袭已久的光环, 梁文锋 真实拆解下的DeepSeek,其技术路径和商业哲学究竟具备什么分量?
近期,一份Deepseek融资期间的会议实录流出,事无巨细呈现了梁文锋所理解的这家公司、这项技术乃至这个行业走向的完整图谱,其中包含大量有关组织文化、技术路径、商业博弈以及算力基建的核心观点,足以让人理解这家公司过往那些反直觉但最终也许正确的克制决策。
打开网易新闻 查看精彩图片
一份Deepseek融资期间的会议实录流出 资料图
以下为会议实录摘要,经界面新闻整理编辑: 人才、组织与公司愿景
1、我们一开始来做这个公司,初衷是没有想到说我最后要赚多少钱,要到资本市场上去。最开始的几十个人完全没有这么想过,如果这么想,他就不会来。
总体讲,我们是怀着一个对世界非常大的善意来做这个事情,觉得这是对人类有用的,是一个金钱以外的事情。
2、管理一个大公司,靠的不是你的规章制度,靠的是愿景。愿景不是挂在墙上的标语,愿景是你怎么做,不是怎么说,是你实际怎么运行。
所以,我们没有组织,就是靠愿景驱动、靠一个愿景组织起来的。我们并不是以一个“我要实现什么 KPI、要怎么考核”的方式来做,我们只有愿景。
3、AGI是更大的愿景,这个愿景能够凝聚起更多优秀的人,它有更强的凝聚力。所以在组织上我们有优势,然后利用这个优势……它就是一种降维打击。
但如果你是一个纯粹的商业公司,你的愿景如果只是服务好C端用户,那你在产品、流量上会有优势,但在技术上很难有优势。而现在最有利的形势是,模型技术才是最核心、最重要的。
4、在很多方面我们都要非常克制,但是我们的核心利益是什么?其实只有一点:我们最大的、甚至可以认为是唯一的核心利益,就是要保持团队的稳定性。
只要我能够保持团队的稳定性,我一定能做成,一定能做成AGI。无非是早一点、晚一点,如果遇到挫折大家都不走,那我就可以继续做下去。
5、我们一直非常克制,不愿意跟任何一家互联网大厂或者小厂成为对手。我希望能够给大家赋能,或者协助大家去做这个事情。在这个前提下,我们是很愿意协助、帮助任何人,甚至我们的竞争对手,包括阿里、智谱、月之暗面,去做得更好。
因为我们并不损失什么东西,我们本来就是开源的,你如果复现不了,你讲,我告诉你怎么复现。这本来就是开源的一部分,不会因为你是竞争对手就怎么样。
6、我们公司的管理其实是两条线:一条线是从上到下,一条是从下到上。从下而上就是每个人自己想做什么,自己做,没有人管他,没有 KPI。从上到下就是正式的项目,我们需要集体做一个事情,需要全公司配合,比如发 V4。
我们希望这部分正式的工作不要占用员工所有时间的一半,剩下的一半时间是不被安排的,他想探索什么就去探索,公司只要算力能支持,他不需要来协调。
7、我们一般也不太加班。加班有两个原因:第一,做研究需要一个比较松弛的环境。你如果逼得很紧,大家就没法做研究。既然做研究要靠你自己的兴趣,平时自己去琢磨这些问题,就必须在一个松弛的环境里。第二,我们非常聚焦。
因为克制,所以很多事情我们选择不做。我要做的事情少了,每个人分到的工作就少了。你看到我们的产品很多都不完善,但我们也没有急着去补它,这也是我们的一种文化。
8、大家目前面临的问题可能是人才不够,但我认为这种短缺是阶段性的,在每个行业发展的初期都是这样。以前做网站、做互联网服务端,刚开始人都极缺,但这种人才短缺非常快就会被解决,也就两三年,因为会培养出大量的人。
9、我们没有模仿的对象,每一步都是根据实际情况、实事求是地分析利弊做决策,并不是去模仿谁。我觉得我们跟贝尔实验室(Bell Labs)还是不一样的,因为它明确是不需要有商业化的,但是我们明确是要有商业化的。
我们最终还是要能活下去,我们毕竟是一个公司,政府不会给我一分钱。我们归根结底要考虑怎么活着。很多公司做得很伟大,是因为它有一种利润以外的追求,但那个追求最后不但没有影响商业化,反而让它商业化得更好。
大模型技术路径与AGI
1、从技术路线上面来看,其实AGI这条路线图是比较清晰的。AI的发展,我们可以理解成它是一个阶梯。去年走的阶梯是CoT(思维链),我们发现通过思维链的方式,可以让智能达到一个更高的水平,让上限更高。
今年的阶梯就是Agent,因为我们发现,用Agent的方式,AI的能力范围会更大,智能上限会更高。为什么是阶梯?因为后面的每一步都是基于前面的基础之上的,Agent要用到CoT,CoT也要用到前面的语言模型,没有一步是白走的。
国内以⽬前的情况来看的话,我觉得最合理的做法应该是全⼒做通⽤Agent,其他的Agent优先级应该更低,包括⾦融、医⽣这些Agent。要先做Coding,因为Coding Agent能够做到很多。
2、但是在Agent之后,它还是替代不了人类员工。因为AI还差一个地方,叫持续学习。人能持续学习,你招一个员工,他花两个月熟悉公司的环境和工作,就能上手,你说“叫小王来”他知道小王是谁。但如果AI没有这两个月的学习,你就必须把小王是谁、什么职务、在哪等所有上下文都给它,这不现实。
所以我们在Agent之后能看到的下一个瓶颈,也是必须解决的问题,就是怎么让模型可以持续地学习。
3、持续学习之后,我们可能就会来到一个奇点。这个奇点是:当这个模型能够持续学习之后,它已经能够做人类能做的所有事情了。
它能自己开发自己的版本,自己做研究去开发下一个更强的人工智能模型,实现自我迭代。这一步走完之后,我觉得才是具身智能。到具身智能之后,它就走进现实世界,可以给你做家务,可以给你养老。这是我们的推测。
4、多模态布局我们一直在做,对C端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。多 模态 我们肯定会做,后续版本也会支持原生的多模态,但我们不把它当作智能本身,它的主线跟搜索一样,搜索是一个组件,多模态也是一个组件。
5、AI领域很广泛,有很多东西我们觉得它不在智能的主线上面。比如说3D、视频生成,我觉得跟智能的主线没有太大的关系,我们不会去做。像世界模型,我们觉得现在跟智能的上限提高也没有太大的关系,所以我们也不会去做。
像Sora出来之后所有大公司、小公司都做,但小公司后来都把它砍掉了。它在商业上是个好生意,但跟智能没有什么关系,我们只会因为它是智能路线图上的东西才会去做。
6、我们是信Scaling的,肯定是规模越大,效果越好,能够解锁更多的功能。阻止我们Scaling的其实就是算力,并不是我们不想Scaling,是我们没有那么多的算力去做。
我们现在没有触摸到这个上限在哪里。硅谷在说Scaling到头的时候,那是对硅谷来说;对中国人来讲,我们离那个还远得很,我们根本就没有Scaling到那个程度。所以我们也会不遗余力地去推进Scaling的上限。
7、在标数据方面,这跟我们的资本投入有关。以我们这个资本投入的结构,支撑不起像美国那么高的高质量数据标注成本,因为太贵了,不管外包还是自己标。
所以我们现在基本上是两条腿走路,先标成本低的。但解决AI这个问题,在现在这个阶段,靠的就是标数据。你可以认为,现在我们公司有一半的核心研究员,最重要的人,有一半在标数据。我们就集中在标数据。
8、现在我们内部比较看重这样一个叙事:训练我们的下一版模型,我们希望它能够帮助我们自己的开发,提升DeepSeek的效率。
我们做的模型,第一目标不是大家用得好用,而是我们自己用得好用。如果先解决了持续学习这个问题,那么通用智能问题就不在话下了,有了AI持续学习的辅助,它能够非常大地提升我们自己研究的效率。
开源、商业化与低成本战略
1、在开源这件事情上面,我们一开始就想得非常清楚。第一是愿景,第二是我们认为要把AI在商业上做成,开源是有好处的。
AI这个事情足够大,最终它可能占掉人类社会GDP的百分之十。这么大的数字,一个人是不可能独占的,你一定得跟别人分享,否则你肯定活不下来。这跟之前开源一个普通的软件是不一样的,因为那个市场没那么大。
如果说我们想独占这个利益,那么一定是要被历史抛弃的。这需要克制,你必须有一套机制确保自己获得的利益是有限的,才有可能做成。
2、你越克制,你越有可能做成这件事。克制是一种战略,在于有时候你可以舍弃一些,来换更多其他的东西。AI这个事情太大了,利益太大了。只要能够做成,最后的利益都会非常大,你随便分一点,就已经很足够了。
所以我们之前说,我们只赚取一个合理的利润,只看你的意愿,而不是利润之大,这和普通的商业思维是不一样的。
3、我们API定价觉得一个合理的利润,大概是我们到市场上买一批设备回来,十个月收回成本,我觉得这就是合理的。
这个成本,十个月回本,我们自己能做到,其他家做不到。像阿里或者腾讯,由于他们没有我们这样的优化,他们的成本应该是要比这个高好几倍的,这里有非常多的优化工作。
4、在这个价格区间,用户的需求是没有弹性的,就是价格再抬高一倍,token的消耗量区别不大的,如果贵一倍,我们的总收入接近翻倍。但一开始我们担心需求太多,把模型价格定高了,团队里大家不是很高兴。后来我把价格降下来,降到四分之一,大家就很开心。
我觉得这个才是我们真实的想法。在赚到合理利润的情况下,让大家都用得起。我们降价的时候,公司群里很多人在欢呼,因为这是我们花了这么多精力把模型做好、能让大家充分去用的目的。
5、去年春节我们用户突然很多,但我们并没有去追求留住这些用户,或者拿去变现,没有在用户上面去抢商业利益,但我们很努力把用户服务好。
我们没有想法说要做成下一个超级App,然后去跟谁竞争,去做成下一个字节、下一个腾讯。我不跟你去争这个东西,因为后面还有西瓜,前面的可能都是一些小芝麻,不应该什么芝麻都抢。
6、去年的C端、今年的B端,我觉得这事要做,要把它做好,但这不是我们的目标。我们公司大部分人不认为这是一个跟AGI同等重要的问题。
C端和B端都是我们做AGI路线上的副产物,是一个中间产出。我并不是为了做C端或者为了做B端而去做它,而是我们为了做AGI,刚好能产出这个东西,我就把它拿来做商业化了。
7、开源对我们的商业模式是没有任何影响的。我也不担心别人部署我们的模型来跟我们竞争,一点都不担心。我只担心他部署不起来,有些细节没做对,效果变差了,或者他的成本会比较高。这里是没有冲突的。
8、半年前大家讨论的商业化是什么?一定是我要去广告、去做电商,或者要在产品里面植入电商,然后跟本地生活搞在一起,肯定没用的,因为变化太快了。你这个产品,去花很多时间做商业化考虑、商业化路径,它的生命周期会很短。
我觉得还没有到这个时候。在过去三年,任何一个时候你跟我说商业化路径、产品线,都是浪费时间,因为你并不能够预测未来。在任何一个时候你聚焦在产品上都太早了,最大的还是技术的延伸。
算力、中美差距与底层基建
1、我们跟美国的差距主要在资源上面,人上面差距是不大的。因为就是同一批人,可能是中国人,有一些留国内,有一些去国外,去国外的人也并没有说更聪明,它是比较随机的。
而且我们的基数大,每年有那么多人的补充。人才不是瓶颈,资源是最大的瓶颈。资源首先影响到人才培养,因为算力少,我们能做的实验机会比较少,所以我们的人才整体上比美国有差距。人才的差距,本质上也是因为算力的差距。
2、国内现在做基模的东西太多了,美国可能就三家做,资源只集中在这三家,而中国资源分得很散,每一家拿到的资源就更少,我觉得这肯定是要收敛的,某种程度上也比较浪费。不需要那么多家,现在可能大家觉得做这个事情利润率高,所以一定要自己做。
但当他发现这个事情没有那么高利润的时候,可能就不做了。我不相信有暴利,因为这不符合客观规律。中国最后有个三四家竞争,价格绝对已经够打价格战了,可能就已经比较够了。
3、 大模型 竞争,终局的差距应该体现在三方面:一方面成本,一方面时间,一方面用户体验。除此以外,可能是没有什么差距的。
成本肯定是一个差异,我觉得可能成本是排在第一位的区别。然后第二个就是时间,你什么时候能够做到,你早几个月、晚几个月,它就不一样了。第三个可能是体验,中间会有一些用户粘性,但它可能不本质。
4、英伟达CUDA的护城河在快速地被瓦解,原因可能是有三方面。一方面是现在有了AI,要建立起这个生态比以前容易很多了,因为AI可以写代码。
第二,有一些新的技术,比如我们出了一个技术叫TileLang,是一种高级语言。用这个高级语言来写CUDA的算子,可以很快地把英伟达的整套生态全部都写一遍,再结合 AI,这看起来没有什么障碍。
还有一点就是,计算卡的市场已经比游戏卡大了,以后计算芯片都不再和CUDA 耦合,都是专用芯片了。在这个背景下,原来英伟达生态的作用就大幅度减少了。
5、国产AI芯片替代现在是有个历史性机会的。我们认为,未来一年之内,国产芯片的生态完全没有问题这件事情能够被验证。之前认为是有问题的,认为用不起来、不好用,但是未来我觉得一年之内,我们能够用事实来扭转这些认知。
国产AI芯片的硬件和生态都没有问题,唯一有问题的是产能不够。国产卡适配这一点没有障碍,英伟达挡不住。在英伟达的卡买不到的情况下,所有人迫于无奈,都必须去做国产芯片。在这个背景下,国产卡的适配是没有任何障碍的,但还需要时间。
6、华为给我们的大概是一万六千张卡的产能,互联网大厂可能是十几万张。一万六千卡的华为950,只相当于四千卡的英伟达B系列。所以说这不是一个很大的量,意义不是很大,它只够训我们现在这一代模型,不够训下一代。
华为卡生命周期肯定是会短一点,因为它本来就已经比英伟达晚两年了。华为950今年能用还挺好的,明年用我觉得还可以,后面再用我觉得可能就真的太费电了。但我对国产算力是比较乐观的,英伟达是在掘自己的坟墓。
7、AGI还需要多久?国内硬件在这个时间能追上吗?我觉得在AI这个事情上,应该国内⼀两年是能够做到跟国外差不多的,或者可能今年就能做到平替国外的模型。所以今年应该就能做到的,但它还不是AGI。
华为的950超节点,在性能和价格上可以完全平替英伟达的GB200、GB300。价格肯定要贵,但贵得有限,比如贵百分之一百,我觉得已经可以在价格上认为平替了,所有GB300能做的任务,华为超节点都能做。
8、我们算力落后是一个事实。这个事实通过三方面来消解。第一方面是我们承受模型落后,我们只能够用比他们更小的模型。但这落后有一个好处,落后意味着你有更多的时间,你有一定的技术,你就可以用巧妙的方法。
所以我们跟美国的差距可能是落后12到18个月。简单说,就是落后美国两年,然后只用美国二十分之一的算力把这个事情做出来。那么未来我们要把这个叙事改写,就是我们用它几分之一的算力,但是把这个时间缩得更短,缩到6个月、3个月。
9、关于公司重大战略、技术业务决定的流程和决策机制。我们公司整体上是建立在共识的基础上的。我并不是说我一个人决定所有事情,而是我要寻求共识。我在公司内的权威以及影响力,是建立在共识之上的。
比如说我要做一个事情,我肯定是先看大家的共识是什么,大家想不想做。然后有可能我会进行一些引导或者倾向,但是这引导的作用是非常有限的,必须建立在共识的基础上,我才能够推得下去。