2026年7月25日星期六

梁文峰不像圣人像商人,DeepSeek 最会挣钱


最近一篇 42 页的梁文峰投资者交流会录音文字稿流出,里面含有大量珍贵大模型商业部分内容,我觉得非常值得分享。

1. 听下来,梁文峰跟圣人不沾边,而是非常有头脑的商人。大家说梁文峰克制主要是因为 DeepSeek V4 定价低,对利润诉求不强,梁文峰觉得如果要价太高,竞争对手就会多很多。另外,DeepSeek 选择开源是因为梁文峰觉得 AI 市场很大,能占 GDP 的 10%,一家公司想吃这个独食,一定会遇到多方阻力。这么大市场,只要能活下去,未来哪怕只吃一点,都会有巨大商业价值。

2. 梁文峰追求的是 AGI,觉得 C 端应用(如豆包)都是芝麻,AGI 才是西瓜,捡西瓜的同时顺手捡捡芝麻就行,认为 DeepSeek 没有刻意追求 C 端和 B 端,但也做得不错。

另外觉得 C 端用户没啥用,是纯成本支出。高质量 coding 用户是有用的,模型公司可以拿他们轨迹数据去反哺模型训练。但 C 端 chatbot 那种聊天语料没用。

3. 最牛逼的一点来了,DeepSeek 的巨大成本优势。梁文峰说开源也可以有商业模式,因为 DeepSeek 自己卖 API 和阿里腾讯部署 DeepSeek 开源模型卖 API,成本上个存在几倍的差异。这其实也证明了腾讯阿里自研基模的重要性。

DeepSeek V4 如此低的定价,梁文峰说还能在 10 个月内收回设备成本,而且说有 6 倍利润。我理解的意思是定价是单位设备成本的 6 倍,那加上运维成本啥的,毛利率可能高达 70%,比 Anthropic 还高。

此外梁文峰说 10 亿美金 ARR,DeepSeek 就能覆盖所有人员和设备成本,现金流转正。估计是现金流转正所需 ARR 最低的大模型公司。

4. 总结下来,大模型核心三要素:人、算力和数据。人,梁文峰说稳定性最重要,“只要最重要、最老的员工不走,其他人都不会太走了”,DeepSeek 这几次融资也是为了搞股权激励,把人留下来。反观某问团队,人才流失就非常严重,导致某问 2.5 达口碑巅峰之后,后面产品总差点意思。

算力,海外大模型都是训激活参数(不是总参数)几百个 B 的模型,这需要 5 万张 GB 300 或者 20 万张昇腾 950,而且只是训练,还不算实验。国内的算力资源只能训激活参数几十个 B 的模型。

数据是指高质量数据标注,严格来说国内是最近半年才开始做,目前 DeepSeek 核心研究员一半是在标数据。

5. 感觉梁文峰非常看好国产算力,有点看空英伟达。英伟达壁垒有二,硬件和 CUDA 软件生态。梁文峰认为 CUDA 软件生态在被瓦解,原话是:

“第一,AI 来构建这个⽣态,就可以把跟英伟达⼀模⼀样的⽣态构建出来。第⼆,有⼀些新的技术。⽐如说,我们家出了⼀个技术,叫 TileLang,是⼀种⾼级语⾔。⽤这个⾼级语⾔来写 CUDA 的算⼦,可以很快地把英伟达的整套⽣态全部都写⼀遍,再结合 AI,这个看起来没有什么障碍。但是现在还没有完成,还没有做完,不过这个技术路线看起来是没有什么障碍的。”

梁文峰说,DeepSeek V3 训练时,就没有用英伟达生态了,是自己写的 TileLang 生态,只是用了英伟达的卡。另外,梁文峰认为英伟达是游戏卡进化而来,算力需求之前占比较小。未来 ASIC 这种专用芯片市场会扩大。梁文峰认为昇腾 950 超节点在性能上能平替 GB200、300,但四张卡才能顶英伟达 1 张卡,用华为肯定要更贵。

国产卡目前主要是产能不够,但梁文峰认为 5 年后,产能不会是问题。

算力需求。chatbot 到今年 agent,带动了一波算力需求,下一波可能是持续学习。人是能够持续学习然后提升能力,DeepSeek 在研究如何让 agent 自己去持续学习提升能力,这会消耗更多 token。

6. 梁文峰认为,中国做基模的公司太多了,未来一定会收敛,可能就只剩 3-4 家,也许是 2 大 2 小。算力本来就紧张,基模公司越多,每家分到的算力就越少。那么离训练激活几百个 B 的基模时间节点就越远。

最后,我觉得这篇文字稿这个时间点流出有点奇怪,刚好朋友圈还有朋友在卖 DeepSeek 的份额。

来源:卓哥投研日记

没有评论:

发表评论