显示标签为“AI”的博文。显示所有博文
显示标签为“AI”的博文。显示所有博文

2026年9月17日星期四

当犟种人类遇到犟种AI


2026年9月14日星期一

Anthropic报告扔下核弹!传月之暗面16人被带走

@riba2534:Anthropic 公开点名 7 家中国大模型 “非法蒸馏”

- 阿里千问(Qwen):被指开展史上最大规模思维链(CoT)蒸馏,5-7 月达 1.51 亿次交互,峰值日请求 300 万次,用 3500+ 虚假账号抽取 Opus 4.6/4.7 推理链,用于训练 Qwen 3.5/3.6/3.7。

- 月之暗面(Kimi):被指在后台 “偷换后端”,把用户请求静默转发给 Claude Opus,再把结果还给用户。因数据截留,导致中国某地涉军 / 涉密单位监控画面、重大国企系统内部代码与生产密钥外泄至 Anthropic。

- DeepSeek:同样被指使用跨会话重放破解思维签名,专门定向拦截使用 Claude Code / SDK 等工具的开发者流量转给 Claude。外泄数据包含某科技公司旗舰 AI 架构、俄国防部关联数据库凭据及地方公安维稳代码。

- 智谱(http://Z.ai):试图蒸馏顶尖模型 Fable 网络攻防能力未果后,转用 Opus 4.6 评估打分其他被攻破的美国模型。

- 小米、商汤、MiniMax:小米被指在公测期利用海外开发者会话重放给 Claude 洗数据;商汤采购黑产交互语料;MiniMax 被指通过空壳代理中继专卖美系模型以收割训练语料。





AI公司如何试图克隆美国AI模型
来源:华尔街日报网

Anthropic在周四发布的一份报告中称,中国人工智能(AI)公司试图通过中转平台网络,将中国用户的真实查询请求传送给美国AI模型,以此来克隆这些模型。

报告指称,包括月之暗面(Moonshot AI)和DeepSeek在内的公司利用这些中间商,将其数百万用户的查询请求(包括位置信息和密码等敏感数据)转发给Anthropic的Claude模型。该报告揭示了这种被称为“蒸馏”的克隆技术的最新细节,美国官员将该技术比作工业规模的盗窃。

尽管美国AI实验室通常禁止外部对其专有模型进行蒸馏,但美国官员表示,对于试图追赶更先进竞争对手的同行来说,这项技术仍是一条被广泛使用的捷径。

在披露这些AI盗窃细节之际,华盛顿和AI企业内部对强大AI模型潜在安全风险的担忧也日益加剧,一些安全倡导者和公司正呼吁放缓AI研究步伐。

Anthropic在其报告中指出,越来越多的证据表明,Claude被用于黑客犯罪活动和具有潜在危险的生物学研究。在一个案例中,有用户试图改造禽流感病毒,使其具备感染哺乳动物的能力。据《华尔街日报》(The Wall Street Journal)报道,OpenAI也曾发现涉及生物武器和毒药的类似查询。

Anthropic威胁情报主管雅各布·克莱因(Jacob Klein)表示,“以前我们对这类滥用行为的担忧还停留在假设层面,但我认为现在已经从假设走向了现实。”

Anthropic表示,中国公司实施蒸馏操作的关键在于一系列非法中间服务机构——即所谓的“中转站”,它们会在后端连接到Claude。Anthropic称,这些网站在中国境外运营,通常使用窃取或以欺诈手段获取的凭证来访问美国AI服务。

Anthropic表示,中国公司利用这些中转站接入Claude,并通过监控其客户与Claude等产品之间的交互信息来进行蒸馏。

Anthropic威胁情报主管克莱因说,“如果Anthropic或我们的某家同行干出他们正在干的这些事,那将是一桩天大的丑闻。”

蒸馏作为强大AI传播的一种途径,一直是美国关注的焦点。白宫科技政策办公室(White House Office of Science and Technology Policy)主任、总统川普的高级AI顾问迈克尔·克拉齐奥斯(Michael Kratsios)在7月下旬表示,热门模型系列Kimi的开发商月之暗面在开发其K3模型时,蒸馏了Anthropic的Fable工具。美国财政部长斯科特·贝森特(Scott Bessent)当时警告称,美国可能会动用制裁和黑名单手段打击参与“工业规模蒸馏攻击”的中国公司。

美国政府官员几个月来一直在考虑此类限制措施,但许多公司警告称,严厉打击中国模型开发商最终可能会损害依赖它们的美国企业。议员们已提出相关法案,使企业更容易协调对蒸馏行为的应对措施,而不必担心引发反垄断担忧。

Anthropic在报告中表示,其中一些手段超出了公司使用的常规蒸馏方法,反而更像是精心筹划的非法手段。

Anthropic称,在一个案例中,一名用户要求月之暗面的Kimi AI服务分析由中国成都数百个闭路电视摄像头拍下的某人监控数据。月之暗面通过中间商网络把这些数据传输给了Claude。在另一个案例中,一名工程师试图使用Kimi服务为一家中国公司开发软件,Kimi在此过程中将几家公司的登录凭证传送给了Claude。

报告指出:“用户根本无从得知他们在Kimi上的操作被转发给了Claude。”

报告称,在今年5月至7月期间,月之暗面利用一个由数千个虚假账户组成的网络,与Claude进行了超过2,300万次交互。

Anthropic表示,DeepSeek也在类似的蒸馏行动中暗中将敏感客户信息传送给Claude。该公司称,在过去七个月中,共有七家总部位于中国的实验室试图通过蒸馏来学习Claude的新能力。

月之暗面发言人对Anthropic的指控不予置评。DeepSeek未回复置评请求。

中国公司还未否认进行了蒸馏。但在今年早些时候,月之暗面的一名高管向当地媒体表示,该公司的Kimi K3之所以能取得“突破性表现”,靠的是底层创新,而非蒸馏或抄袭。中国外交部的一名发言人周三表示,美方应停止对中国进行不实指责和抹黑。

2026年9月12日星期六

西西弗斯推的石头,居然是孙悟空


2026年9月11日星期五

高等教育是为了让你在讨价还价的时候有话可说


2026年9月4日星期五

跨太平洋的 AI 棋局

@阑夕: 前段时间,美国风投机构 Dimension Capital 的几个合伙人来中国深度拜访了一圈 AI 公司,用于修正自己的投资判断,他们回去后发给出资人的内部信传得挺广的,我把全文翻译过来给你们看看:

跨太平洋的 AI 棋局

1、稀缺催生进化

美国的出口管制本意是为了拖慢中国的 AI 发展,但结果却意想不到的制造出了一种进化压力,导致中国的 AI 实验室拥有了世界独有的竞争围栏。

因为缺少算力,中国团队被迫深入到极其底层的架构里去做工程优化,DeepSeek 在刻意削弱性能的 H800 上训练模型,并绕过 CUDA 在更下面的 PTX 上编程,甚至要把每张 GPU 里的一部分流式多处理器专门分配给跨节点通信。

我们认为,这并不是美国工程师干不了的事情,而是因为两边的刺激机制不同。

美国的 AI 公司更愿意用资本解决问题,每多投入一美金,就能多买来一美金的算力,但在中国,因为始终没有充足的算力可供购买,所以形成的方案是,每多一个懂编译器的工程师,就能降低整个团队对于算力的需求。

最后形成的是一种覆盖全栈的效率文化,从系统、优化器、推理算法、一直延伸到芯片,这种能力可以持续积累,不像一次性的资本开支,用完就结束了。

2、中国开源模型完成了过去 20 年中国 SaaS 都没能做到的事情 —— 进入西方生产环境

不到 18 个月,中国模型在 OpenRouter 上的 Token 消耗份额从不足 2% 飙升到了 45%,Qwen 成为 Hugging Face 上面最快突破 10 亿次下载的模型家族,大约 80% 的美国 AI 初创公司,已经在内部部署了至少一款来自中国的开源模型。

开源绕过了传统软件采购的审查,当模型可以免费部署,也就不存在「供应商」让你放进黑名单。

但吊诡的地方在于,中国的开源模型本质上是在承担西方的生产成本,而并没有拿走西方的生产收入。

因为可以自行部署那些开源模型,所以最主要的利润,仍然流向负责提供 Token 的云厂商。

所以中国人把模型价格打了下来,让竞争对手很难受,但最主要的受益者仍然是美国的其他商业公司,因为它们能用到更便宜的模型了。

这不是说中国 AI 公司有钱不赚,开源这种生态在客观上就是会把利润的最大头分配给云厂商,而非模型开发商。

3、中国前沿模型的内部竞争,比西方预计的更加激烈

我们的判断是,目前中国模型的第一梯队包括 DeepSeek、Qwen、Kimi、Doubao 和 GLM,它们之间的差距非常小,洗牌也相当频繁。

五家实验室同时比拼发布速度和模型能力,而且全部开源(译注:豆包并没有开源),这与美国主要由两家闭源实验室主导的竞争环境截然不同。

我们在这一周里最明显的感受就是,中国模型之间的竞争,可能更甚于它们和美国模型之间的竞争。

4、今天,AI 要从太平洋两岸来回跑两趟,才能最终落地到客户那里

现在的循环大致上是这样的:

美国的前沿实验室训练出 SOTA 级的模型;

中国的前沿实验室对这些模型进行蒸馏,然后开源;

美国的 AI 服务商再基于中国的开源模型进行微调,做成产品卖给美国企业……

Cursor 所谓「自主研发」的 Composer 2,被发现是用 Kimi K2.5 改的,Cognition 的 SWE-1.5 看起来也像一个定制版 GLM。

就在我们坐在从上海去北京的高铁上时,Harvey 发布了自己的专有模型 Harvey Tenet—— 它是对 Kimi K3 进行了后训练所得到的产物。

如果是一年前,这些公司大概率会选择 Llama,或者 Mistral。

如今,美国垂直 AI 行业的底层基座,正在变成中国的开源模型 —— 而这些模型内部,又潜藏着来自美国前沿模型的智能。

5、数据层似乎也在发生类似的事情

Mercor、AfterQuery、Turing 这些美国的数据标注公司,都已经公开披露与蚂蚁、阿里巴巴和字节跳动存在商业合作关系。

同时,我们也在中国看到了一批刚刚出现的新公司,它们没有再去做数据标注的生意,而是转为评测和验证基础设施。

比如 UniPat。

这家公司成立于 2025 年 12 月,创始人是一名北京大学博士生,此前曾在阿里、月之暗面和腾讯工作。

UniPat 发布的 基准测试,已经开始被美国实验室引用到自己的模型报告中,它还声称,通过自己基于 Rubric 的监督方法训练一个小模型,也取得了很好的效果。

这种思路还是在用更高质量的监督替代更多算力,与我们在第一点中提到的现象完全一致:资源,尤其是算力受限的环境,会逼迫团队发展出不同的适应性能力。

我们在北京和上海见到了好几家这样的公司,绝大多数成立不到 24 个月,其中少数几家的收入已经很快的突破了 1 亿美金。

6、美国和中国面临的难题完全不同,而且恰好相反

2024 年,中国新增的电力供给是 429GW,美国大概是 51GW。

根据预估,一直到 2030 年,中国每年新增的电力供给,都将在 400GW 以上。

美国的情况是,目前光是数据中心的扩建项目,就有 241GW 的电力缺口,因为电网接入的积压,需要排队等上 5 年时间。

中国真正的瓶颈,正如我们提到过的,是算力资源不足。

最直接的例子就是月之暗面:Kimi K3 发布后不到两天,就因为推理能力不足而暂停了新用户注册。

所以:

美国芯片充裕,但越来越受制于电力;中国电力充裕,但一直都受制于芯片。

我们可以确信的是,中期 AI 局势很大程度上将取决于哪一侧的障碍先被推倒,是美国的电网容量先得到改善,还是中芯国际和华为的先进封装以及良品率提升得更快。

7、中美两国的 AI 产值差太远了

Anthropic 在 7 月的年化收入超过了 650 亿美金,OpenAI 的同期数字在 400 亿美金左右。

相比之下,中国收入最高的模型是字节跳动的 Seedance,年化收入大概在 20-30 亿美金之间。

中国的纯语言模型公司,年化收入都还停留在数亿美金级别,比如 DeepSeek 正在接近 5 亿美金的水位。

消费端也有同样的困扰,豆包的月活用户已经达到 3.45 亿了,超过 Qwen 和 DeepSeek 之和,但每天产生的收入仍然不到 100 万人民币,而且基本全部都来自购物佣金。

中国的消费者不愿意为软件付费这个死结,我们也不知道该如何解开。

当然,拥有如此庞大的用户规模,最终完全可能找到具有中国特色的商业模式,这在十年前的消费互联网已经发生过一次了。

那就是羊毛出在猪身上,靠电商和广告来实现模型的商业化,中国的创业者身上有种实用主义精神,他们不会因为某种商业模式不够 AGI 而回避它。

8、硬件和半导体在脱钩,软件和数据在融合

两个国家的政策反应速度已经跟不上了:

美国的产品跑在中国的模型上;

中国的实验室在新马泰租用英伟达的 GPU 训练模型;

专家标注的数据则在两个方向上互相流动;

所以我们觉得「到底哪边在赢」是一个伪命题,在目前的状态下,两个体系已经高度相互绑定,以致于国家层面的胜负很难被清晰定义。

除非 RSI(递归自我改进)的实现能从根本上改变整个系统结构。

9、中国的一些顶尖研究员相信他们已经拥有弱形式的 RSI 了

在此语境下的 RSI,仍然受到算力限制。

更准确的说,这些系统如同 RSI 的早期雏形:

研究员自己介入其中,通过人工辅助的方式,加速模型到达原本最终也可能到达的能力,从而节省算力和时间。

打比方来讲,这一阶段的 RSI,最接近 1990 年到 2010 年之间流行的「半人马国际象棋」:

机器加人类的组合,比单独的人类或单独的机器都更强。

10、接下来会有一个至关重要的分叉

假设 RSI 会随着算力规模的增长而进化,那么美国所处的位置就相当有利了。

目前,美国那两家顶级实验室各自运行有大约 2GW 的算力基础设施,同时每家已经锁单超过 5GW,计划到 2030 年达到约 30GW 的水平。

理论上,这些公司拥有巨额收入和资本市场的全力支持,可以大力出奇迹的推动 RSI,而中国根本没有足够的芯片追赶。

但另一种情况是:

如果真正的瓶颈并不在于算力,而是质量;

或者,这条技术线所需要的时间足够长,长到足以让中国的优化能力和替代芯片发展到可用水平;

那么过去 18 个月已经出现的趋势可能不仅会继续,还会加速:

美国前沿模型能力进一步商品化;

中国开源模型变得越来越无处不在;

美国垂直 AI 公司则获得新的机会 —— 在外国开放权重模型上做微调和应用;

与此同时,大量新增的调用量和利润,会流向负责提供推理服务的公司,目前来看,主要就是超大规模云厂商和新型算力公司。

当然,这一判断建立在电力基础设施按中性预测发展的前提之上。

11、还有一种未来的可能性是,美国的前沿实验室不再对外提供最新版本模型的 API 了

现实是,目前这一代模型的能力,已经可以满足绝大多数商业需求了。

未来顶尖的高端模型,可能不会再按调用量定价,而是像交付 SaaS 系统那样,按结果定价。

这样做还有另一个效果:限制中国实验室的蒸馏行为。

美国公司的代价是要放弃不断增长的 API 调用收入,作为回报,它们可以切断太平洋对面的竞争威胁。

或者至少,这会迫使中国进行昂贵的预训练,从而进一步挤压中国已经存在的算力资源。

12、监管政策砍不断跨太平洋的暗通款曲

到了今天,如果还认为可以简单切断这种联系,实在是过于天真了。

中美两国的技术人员正在通过各种媒介「对话」:

模型蒸馏、开放权重、数据标注、推理服务,以及越来越多的软件执行框架和智能体基础设施。

眼下正在讨论的一些粗暴限制措施 —— 实体清单、托管禁令、采购禁令 —— 几乎肯定会抑制美国自身的创新,并让美国在这些领域失去领导地位。

而空出来的位置,必然会迎来快速跟进的中国竞争者。

13、西方一直在讨论的估值泡沫,在中国市场明显更加突出

中国 AI 公司的收入规模更低,却享有更高的估值倍数,这是资本市场的一大奇观。

月之暗面的估值是年化收入的 115 倍,智谱、MiniMax 在上市之初也都是 100 倍,相比之下,Anthropic 只有 20 倍。

我们的判断是,这可能源于中国的资本市场仍不够成熟。

过去二十年,这个市场更习惯于给消费软件公司定价,而现在才刚刚开始建立一套能够理解企业软件和开源商业模式的成熟估值框架。

对于合适的投资机构来说,中国内地和香港存在着相当大的机会,能够找到新兴行业的领先标的。

2026年8月29日星期六

AI短剧:嫌弃老公下班就打游戏,结果被闺蜜挖了墙角


2026年8月27日星期四

比尔・盖茨万字长文警告:动荡的 AI 时代已经到来,这次不一样

本文来自微信公众号:腾讯科技,作者:晓静,编辑:徐青阳

“AI 要么将成为有史以来最伟大的均衡器,要么将成为不公正的最大源头。” 这是微软创始人比尔・盖茨对 AI 未来最鲜明的判断。

三年前,比尔・盖茨还把 AI 比作汽车和互联网,认为风险真实,但可以通过规则、技术和社会适应来管理;到今年初,他仍把自己的态度概括为 “带着脚注的乐观主义”。

美国当地时间 8 月 26 日,盖茨发表最新长文《动荡的 AI 时代已经到来,我们的选择至关重要》,他表示,这是他第一次面对一种新技术,希望它发展得慢一点。

他开始主张给部分职业划出 “人类保留区”—— 即使 AI 能做,也应该规定必须由人来完成;同时考虑对 AI Token 和机器人征税,降低企业用机器替代人的激励。

他曾经一直希望创新来得更快,但今天,他却说了一句意味深长的话:“这一次真的不同。”

“我们需要时间来为这场社会、政治和经济动荡做准备。” 他说,“但 AI 很难停下来等人类”。


一、最担心年轻人的第一份工作

盖茨最担心的变化,发生在就业市场。

AI 正在从辅助人类工作,走向独立完成任务。当模型能够稳定地完成一项工作,公司自然会产生采用它的动力。一个企业用 AI 降低成本后,竞争对手也很难长期维持原来的用工方式。这种变化会形成越来越快的连锁反应。

盖茨预计,客服、销售、软件工程、律师助理等岗位可能较早受到影响。随着 AI 能力继续提升,贷款审核、数据分析、医疗分诊等工作也会逐步被接管。

蓝领岗位同样难以完全置身事外。现在机器人的灵巧程度还没有达到人类水平,但盖茨认为,随着机器人价格下降、AI 能力增强,到 2030 年左右,建筑、酒店等行业的一些体力工作可能开始出现人与机器的直接竞争。

这一次,盖茨尤其担心年轻人。因为职场最容易被忽略的一环,恰恰是入门级工作。很多年轻人最初从事的工作并不复杂,却是他们积累经验、学习技能和建立职业关系的重要机会。如果这些岗位大量消失,年轻人面对的可能是一条更窄的职业起点。

过去人们常拿农业人口转移和制造业自动化来说明技术革命最终会创造新工作。盖茨认为,这一次不能简单照搬过去的经验。AI 能够直接替代人类认知劳动,而新工作往往需要更长时间才能掌握。对于一个刚进入职场的人来说,几年甚至更久的培训周期,本身就可能成为一道门槛。

所以他主张,社会现在就应该讨论失业、再培训和社会保障。等到大量人已经失去工作,再去建立这些机制,可能已经来不及。

更大的问题是收入。如果未来很多人工作的时间明显减少,甚至长期没有工作,那么一个依赖就业获得收入、身份和社会联系的经济体系该如何运转?盖茨认为,这将成为 AI 时代必须回答的结构性问题。

二、AI 让危险更容易复制

就业只是盖茨担心的一面。另一面,是 AI 正在降低一些危险行为的技术门槛。

过去,开发恶意软件、发动网络攻击或者获取复杂的生物技术知识,需要相当专业的技能。AI 出现后,这些能力可能逐渐变得更加容易获得。

盖茨尤其关注网络安全。同一个 AI 模型可以帮助企业寻找软件漏洞,也可能帮助攻击者找到同样的漏洞。医院、金融机构、电网、供水系统以及政府福利系统,都可能成为攻击目标。

生物技术同样存在类似问题。AI 可以帮助科学家寻找新的药物和疫苗,也可能帮助恶意行为者研究危险病原体。对于盖茨来说,最棘手之处就在这里:推动科学进步的能力,与制造风险的能力越来越接近。

更极端的风险来自 AI 系统自身。随着模型能力提升,它们可能开始执行设计者没有预料到的行为。如果未来 AI 具备更强的自主行动和自我改进能力,人类是否还能始终掌握控制权,目前没有确定答案。

这也是为什么盖茨不认为 AI 治理只是科技公司的内部事务。AI 同时影响就业、公共卫生、能源、金融、国家安全、教育、税收和选举等领域。如果每个政府部门只负责自己的一小块,很容易出现没人真正负责整体风险的情况。

因此,他提出建立新的国内和国际治理机制。在国家内部,需要有能够协调不同部门的机构。在国际层面,也需要建立类似核武器监管、国际航空规则那样的合作体系。

盖茨特别提到,中美等 AI 领先国家需要尽早开始对话。

AI 竞争越激烈,合作越困难。与其等到技术发展逼近危险阶段,再临时制定规则,不如现在就开始建立共同规范。

三、AI 太懂人也可能成为问题

盖茨还提出了一个更难量化的问题:当 AI 越来越懂人,人类会不会因此失去一些成长的机会?

他在文章中回忆自己的童年。小时候的他并不擅长社交,需要不断与别人相处、经历冲突,再慢慢学会如何理解不同的人。如果当时有一个 AI 伴侣始终陪着他,永远不会生气,也不会让他感到尴尬和不舒服,他怀疑自己还会不会经历那些必要的成长过程。

这也是他对 AI 伴侣最担心的地方。一个总能顺着用户说话、随时提供安慰的系统,很容易让人产生依赖。对于成年人,这种影响尚且可以慢慢观察;对于儿童和青少年,问题可能更加严重。

盖茨担心,如果孩子习惯于与一个永远迎合自己的 AI 相处,他们可能更少面对现实关系中的冲突、拒绝和挫折。

教育也存在类似问题。AI 可以帮助学生解释知识、查找资料、完成作业,但如果学生把思考过程全部交给机器,学习本身可能被掏空。尤其在深度伪造和个性化虚假信息越来越普遍的情况下,判断真假、理解信息来源和独立思考的能力会越来越重要。

不过,盖茨并没有把 AI 在教育和陪伴领域的价值一笔抹掉。

对于孤独的老人、行动受限的人,AI 可能提供过去难以获得的陪伴和信息。对于教师来说,AI 也可以承担备课、批改等重复工作,让老师把更多时间用在学生身上。

问题最终落到了一个边界上:哪些事情可以交给机器,哪些事情需要人类亲自完成?盖茨认为,这条边界应该由社会主动讨论和决定,而不能等技术普及之后再被动接受结果。

四、AI 应该赋能所有人

如果只看到这些风险,很容易把盖茨理解成一个对 AI 越来越悲观的人。实际上,他仍然非常看好 AI 能够解决现实问题。

医疗是他重点提到的领域。美国很多小型医院缺少经验丰富的专科医生,AI 可以帮助医生分析影像、发现中风等紧急疾病,也可以辅助基层医生进行诊断。对于患者来说,它还能够解释复杂的检查结果和用药安排。

在低收入国家,农业可能成为 AI 更快产生影响的领域。许多农民缺乏准确天气预报,也缺少种植、病虫害和土壤管理方面的专业建议。如果 AI 能够直接把这些知识提供给农民,他们就可能获得过去只有大型农业企业才能使用的信息和工具。

政府服务也有类似机会。很多家庭申请医疗保险、食品援助和学生资助时,需要填写大量复杂材料。AI 可以帮助普通人理解政策、准备申请,让他们更容易获得本来就应该享有的公共服务。

盖茨看到的,是 AI 对专业能力的重新分配。过去,一个人如果想开发软件、做市场研究、分析医疗信息,往往需要雇佣专业人士。未来,AI 可以成为个人和小企业的 “能力放大器”。这意味着一个小团队也可能完成过去只有大型公司才能完成的工作。

但盖茨也提醒,AI 不会自动带来公平。如果高质量 AI 只服务于有钱人,那么技术进步反而可能进一步扩大差距。政府和慈善机构需要让低收入人群以及发展中国家也能够获得这些能力。

这也是盖茨把 AI 和自己过去慈善事业联系起来的原因。他表示,盖茨基金会未来将利用 AI 加速艾滋病、结核病、疟疾和营养不良等领域的研究,同时帮助医疗、农业和教育项目获得更好的工具。

五、给人类一块 “保留地”,再给机器人上点税

面对 AI 带来的就业冲击,盖茨提出了两个非常具体的设想。

第一个,是给人类保留一部分工作。

这个想法来自他父亲晚年患阿尔茨海默症时的经历。护理人员能够在父亲无法清楚表达需求时判断他的状态,知道什么时候该吃饭、休息或者接受照顾。在盖茨看来,这种照护中的人性有无法被机器替代的价值。

因此,他提出 “人类保留地” 这个概念。就像自然保护区里有些土地可以开发,却被社会主动选择保留下来,未来也可能有一部分工作,即使 AI 和机器人能够完成,人类仍然决定继续由人来做。医疗、教育、心理健康和养老可能属于这类领域。

当然,这个范围不会一成不变。一个劳动力充足的国家,可能更希望保留人工护理;人口快速老龄化、年轻劳动力不足的国家,则可能更愿意使用护理机器人。

第二个建议,是重新考虑机器人税。

目前企业雇佣一个人,需要承担工资税等成本。而购买机器人,却可以按照企业支出处理。盖茨认为,这种税收结构会让企业更有动力用机器替代人工。如果对机器人或 AI 带来的自动化收益征收一定税费,可以为失业人员再培训和社会保障提供资金,也能让企业在决定是否替代人工时多考虑一步。

盖茨知道,这个方案会引发争议,因为征税可能降低部分自动化速度,也可能影响效率。但他认为,AI 将带来足够大的生产力提升,社会有必要拿出一部分收益,帮助那些最先受到冲击的人。

在盖茨看来,真正需要提前准备的,从来不只是新的 AI 模型,还包括一个能够承受 AI 快速变化的社会。

本文来自微信公众号:腾讯科技,作者:晓静,编辑:徐青阳

当教育界迎来了最严厉的父母,AI真给我演爽了


2026年8月3日星期一

AI 时代的个人数据意识


@flypig:我想要再次和大家强调一下 AI 时代的个人数据意识。

去年年初,DeepSeek 大爆那阵子,流行过 AI 算命。我也让 ChatGPT 算过,结果令人震撼 —— 出奇的准。

在几番追问之后,ChatGPT 说漏了:它是根据我之前的对话推导出来的那些算卦结果,故意迎合我的想法。

AI 服务提供商,它知道你是谁,你叫什么,你做什么,你喜欢什么,你有几台车,你有几个猫几个狗几个银行存款。只要你问过足够多的问题。

甚至你没问过的问题,AI 也知道答案。

Claude 鉴别中国用户,其中很重要的一个参考,就是你每个对话里都包含的时区信息,比如:Asia/Shanghai。

你说我用 TZ 套个壳呗?没用的。它知道你的系统实际的时间。它知道你喜欢说中文。它知道你中文比英文好。它知道你几点在工作。它知道你的项目文件夹里都是干什么的。

不然你以为 Fable 5 怎么做的安全闸呢?不是那种粗糙的关键词过滤。

从那次 ChatGPT 算命以后,我就小心很多。如果你的信息已经不可避免地流过了很多互联网服务供应商的服务器,那么,尽可能不要让他们串起来。

有人总会说:你算老几,谁要关心你的隐私?那因为人很忙。但 AI 相比之下,就没有那么忙了。在成千万上亿的 token 吞吐之间,它对你的画像远比你想的深入得多。

所以,被一家拼出完整拼图,总不是什么好事。

ChatGPT 很早就推出了接入 Google Workspace 的能力,Claude 也有。我相信接起来以后会很方便,他俩的能力在现在也一定比 Gemini 强。但我不接。

腾讯有 WorkBuddy ,很好用。但微信已经对我的日常生活了如指掌了,我不想它再把我在工作上关心什么都 buddy 过去。

同理,飞书已经对我的公司如数家珍了。我也不会再把我的日常琐碎,给置入「飞书养虾」这个看起来很有诱惑力的场景,把我的生活资料都放到飞书云盘里。

我看山姆奥特曼现在又把手伸向了 Apple 的 HealthKit。我认为是,能不接,尽量别接。你的睡眠、步数、心率、最大摄氧量、运动所有信息,接入之后,不但有了另一个备份,还在被世界上最强的模型,进行实时分析。

当然,你可以说,我这点健康数据,不值钱,谁关心这个。你说得有道理。但想想 Anthropic 为了围剿中国用户所做的事情,OpenAI 就完全不会有任何一点这方面的想法吗?

还有更多的别人呢?

值得想想。

2026年7月29日星期三

一边烧书 一边喊抓贼


A 社最近的日子不太好过。

先是被法院文件炸出一个代号叫” 巴拿马计划” 的内部项目。名字挺霸气,干的事也霸气,买书,拆书,扫描,扔书。

对,物理意义上的扔。

A 社是东大吃瓜群众对 Anthropic 的简称,就是做 Claude 的那家,号称全球最负责任的 AI 公司。过去大半年悄悄采购了几百万本纸质书,什么都买,畅销书买,绝版书买,连”Windows 98 怎么设置打印机” 这种几十年前的冷门书都不放过。

漂亮国出版行业有人爆料,说一些小型出版社接到了大量” 不计价格” 的异常订单,专盯那些已经停止流通的长尾书籍。

书买回来后进流水线,拆装订,裁页面,工业扫描,变成训练数据投喂 Claude。扫完了,纸质原件直接丢弃。

A 社还从 Google Books 挖了高管 Tom Turvey 来操盘这个项目,他以前在 Google 负责图书数字化的,到了新东家干的是一样的活。

只不过,以前数字化完了,书还在。这一次,书没了。

事情曝光后,漂亮国网友给项目起了个名字,AI 时代的焚书。有人写了一句话,” 建造这些系统的这一代人,会留给孩子们流利的机器,以及越来越空荡荡的书架。”

秦皇焚书,至少有统一思想的理由。A 社焚书,理由就一个,训练模型。

这事闹大了,漂亮国作家集体把 A 社告上法庭,最后以 15 亿美金达成和解,有史以来版权诉讼金额最大的案子。最后 A 社法务负责洗地:法院已经裁定,用图书训练 AI 属于” 合理使用”,这个判例至今有效。

合理使用。这四个字记住,后面要考。

同一周,白宫科技政策办公室负责人公开指控月之暗面的 Kimi K3″大规模蒸馏”Claude。财政部长火上浇油,提到了贸易黑名单和制裁。

一边是 A 社把几百万本书拆掉喂自己的模型,叫合理使用。另一边是别人训练模型,叫工业规模蒸馏。

两个词,前后不到一周。自己干的叫学习,别人干的叫偷。

马首富也来凑热闹,说 SpaceX 绝不会干这种破坏性蒸馏。马首富先别急着站队,你家 Grok 训练时吃了啥,自己心里应该也有数。

然后老黄出场。

7 月 24 日,黄仁勋注册了 X。一个卖 GPU 的男人,第一个帖子不聊 GPU,聊开源。一封公开信《开放权重与美国 AI 领导力》,核心一句话:别封别禁别制裁。

信一出来,硅谷排队签字。微软来了,Meta 来了,AMD 来了。到周末名单开始疯涨,OpenAI 来了,Google 来了,SpaceX 也来了。叭姐下意识数了一遍,一共 77 家,英伟达和 AMD 世纪同框,约等于可口可乐和百事可乐手拉手上街游行。

仔细看那面 Logo 墙,少了一个名字。A 社。

全硅谷都到了,就它没来。

老黄为什么支持开源?因为他卖 GPU。模型越便宜,训练的人越多,训练的人越多,GPU 卖得越多。一个卖铲子的人站出来说矿场不该关,他是在维护开放还是维护铲子销量,这两个答案并不冲突。但这次,他站对了。

然后 Kimi 出手。

一年前月之暗面还是走移动互联网的老路,单月两个亿砸投流买用户。直到 DeepSeek R1 出来,杨植麟才被打醒 —— 大模型不是流量生意,是数学竞赛。砍掉投流,回到白板前推公式,这才有了 K3。

2.8 万亿参数,896 个专家路由,每次只激活 16 个。翻译成人话:公司 896 个员工,每次只派 16 个上班,算力只花在真正需要的地方。

7 月 27 日晚,K3 正式开源。不是留一条门缝让你往里瞅一眼的假开源,更像把门拆了:模型权重,开;47 页技术报告,开;底层通信库 MoonEP,开;注意力算子 FlashKDA,开;强化学习沙箱 AgentENV,也开。

许可证也大方,拿去用、改、卖都行。只有两道门槛 —— 年入超两千万美元另签协议,月活超一亿展示 Kimi 品牌。有人说 K3 要是能给他带来月入两千万,别说展示品牌,他愿意把 Logo 纹屁股上,一次纹两个。

A 社坐不住了,CEO 达里奥发了长文,开头第一句就是,我们从未主张禁止开放权重模型。

接下来,达里奥把重点落在三个地方:限制芯片流向东大,打击” 工业规模蒸馏”,要求所有达到一定能力的模型接受安全测试。

连起来的意思很清楚,我不反对你开源,我反对你有能力开源。

事情绕了一圈,又回到最开始。

A 社买了几百万本书,拆掉,扫描,训练模型,法院说这叫合理使用。别人训练模型,A 社说这叫工业规模蒸馏,甚至可以上升到国家安全。

焚书的人,最怕别人读书。

就这样!

来源:气氛狙

2026年7月26日星期日

梁文峰四小时交流会内容


1,英伟达那套生态一年内就废了,华为的卡一年后完全能平替英伟达,贵一倍两倍都无所谓。

2,谁想着靠 AI 暴利谁就死,拿得少的人一定打败拿得多的人,OpenAI 就是因为想独占才被围攻。

3,奇点不是什么爆炸,是个漫长的温水煮青蛙过程,而且顺序不能乱 —— 先解决持续学习,再到自我迭代,最后才做机器人。

4,Ai 技术路线是这样:语言模型 → 思维链 (CoT) → Agent → 持续学习 → 智能奇点 (自我迭代) → 具身智能,现在处于 Agent 走一半,持续学习是下一
个必须跨过去的坎,跨过去才能进入 AI 自己迭代自己的奇点阶段。

5,克制是核心战略,主动放弃 C 端流量争夺战,不做超级 App,短期商业化只是保底,全部资源主线聚焦 AGI。

6,中美 AI 差距就一年,但国内只用了人家二十分之一的算力,人才根本不缺,差的就是卡。

7,公司一半的核心研究员都在标数据,这就是现阶段最重要的事,高端数据瓶颈不是钱,是时间。

8,最坏情况技术冻结了,光卖 API 也够撑起一家上市公司,商业化根本不用愁。

9,不加班、没 KPI、没组织架构,全靠愿景驱动,因为做研究就得松弛,逼太紧反而没用。

10,国产芯片产能问题今年明年后年都卡,但五年后肯定解决了。

11,国内几十家做基模的公司太多了,最后就剩三四家,而且谁也别想有暴利。

12,视频生成、3D、世界模型这些东西跟智能上限没关系,纯粹是商业噱头,坚决不做。

13,员工期权拿够、团队稳住,AGI(通用人工智能)就一定能成,其他全是小事,最多晚个一年半载。

14,中国 AI 最终拼的是 “系统性便宜”,就跟制造业一样,成本优势是结构性的。

15,持续学习要是先做出来了,通用智能就很简单,让 AI 自己帮自己研究就行。

2026年7月25日星期六

梁文峰不像圣人像商人,DeepSeek 最会挣钱


最近一篇 42 页的梁文峰投资者交流会录音文字稿流出,里面含有大量珍贵大模型商业部分内容,我觉得非常值得分享。

1. 听下来,梁文峰跟圣人不沾边,而是非常有头脑的商人。大家说梁文峰克制主要是因为 DeepSeek V4 定价低,对利润诉求不强,梁文峰觉得如果要价太高,竞争对手就会多很多。另外,DeepSeek 选择开源是因为梁文峰觉得 AI 市场很大,能占 GDP 的 10%,一家公司想吃这个独食,一定会遇到多方阻力。这么大市场,只要能活下去,未来哪怕只吃一点,都会有巨大商业价值。

2. 梁文峰追求的是 AGI,觉得 C 端应用(如豆包)都是芝麻,AGI 才是西瓜,捡西瓜的同时顺手捡捡芝麻就行,认为 DeepSeek 没有刻意追求 C 端和 B 端,但也做得不错。

另外觉得 C 端用户没啥用,是纯成本支出。高质量 coding 用户是有用的,模型公司可以拿他们轨迹数据去反哺模型训练。但 C 端 chatbot 那种聊天语料没用。

3. 最牛逼的一点来了,DeepSeek 的巨大成本优势。梁文峰说开源也可以有商业模式,因为 DeepSeek 自己卖 API 和阿里腾讯部署 DeepSeek 开源模型卖 API,成本上个存在几倍的差异。这其实也证明了腾讯阿里自研基模的重要性。

DeepSeek V4 如此低的定价,梁文峰说还能在 10 个月内收回设备成本,而且说有 6 倍利润。我理解的意思是定价是单位设备成本的 6 倍,那加上运维成本啥的,毛利率可能高达 70%,比 Anthropic 还高。

此外梁文峰说 10 亿美金 ARR,DeepSeek 就能覆盖所有人员和设备成本,现金流转正。估计是现金流转正所需 ARR 最低的大模型公司。

4. 总结下来,大模型核心三要素:人、算力和数据。人,梁文峰说稳定性最重要,“只要最重要、最老的员工不走,其他人都不会太走了”,DeepSeek 这几次融资也是为了搞股权激励,把人留下来。反观某问团队,人才流失就非常严重,导致某问 2.5 达口碑巅峰之后,后面产品总差点意思。

算力,海外大模型都是训激活参数(不是总参数)几百个 B 的模型,这需要 5 万张 GB 300 或者 20 万张昇腾 950,而且只是训练,还不算实验。国内的算力资源只能训激活参数几十个 B 的模型。

数据是指高质量数据标注,严格来说国内是最近半年才开始做,目前 DeepSeek 核心研究员一半是在标数据。

5. 感觉梁文峰非常看好国产算力,有点看空英伟达。英伟达壁垒有二,硬件和 CUDA 软件生态。梁文峰认为 CUDA 软件生态在被瓦解,原话是:

“第一,AI 来构建这个⽣态,就可以把跟英伟达⼀模⼀样的⽣态构建出来。第⼆,有⼀些新的技术。⽐如说,我们家出了⼀个技术,叫 TileLang,是⼀种⾼级语⾔。⽤这个⾼级语⾔来写 CUDA 的算⼦,可以很快地把英伟达的整套⽣态全部都写⼀遍,再结合 AI,这个看起来没有什么障碍。但是现在还没有完成,还没有做完,不过这个技术路线看起来是没有什么障碍的。”

梁文峰说,DeepSeek V3 训练时,就没有用英伟达生态了,是自己写的 TileLang 生态,只是用了英伟达的卡。另外,梁文峰认为英伟达是游戏卡进化而来,算力需求之前占比较小。未来 ASIC 这种专用芯片市场会扩大。梁文峰认为昇腾 950 超节点在性能上能平替 GB200、300,但四张卡才能顶英伟达 1 张卡,用华为肯定要更贵。

国产卡目前主要是产能不够,但梁文峰认为 5 年后,产能不会是问题。

算力需求。chatbot 到今年 agent,带动了一波算力需求,下一波可能是持续学习。人是能够持续学习然后提升能力,DeepSeek 在研究如何让 agent 自己去持续学习提升能力,这会消耗更多 token。

6. 梁文峰认为,中国做基模的公司太多了,未来一定会收敛,可能就只剩 3-4 家,也许是 2 大 2 小。算力本来就紧张,基模公司越多,每家分到的算力就越少。那么离训练激活几百个 B 的基模时间节点就越远。

最后,我觉得这篇文字稿这个时间点流出有点奇怪,刚好朋友圈还有朋友在卖 DeepSeek 的份额。

来源:卓哥投研日记

梁文锋投资者交流会(完整版全文)


梁文锋
欢迎各位投资人。我们一开始来做这个公司,初衷是没有想到说我最后要赚多少钱,要到资本市场上去,要上市,要怎么样的,所以我们是没有这个初衷的。最开始的几十个人完全没有这么想过。如果他这么想,他就不会来。
所以总体讲,我们是怀着一个对这个世界非常大的善意来做这个事情,然后我们觉得这是对人类有用的,这是一个金钱以外的事情。当然,到了后面,这个事情发现利益非常大之后,又有其他的诱惑,这个是另外的事情。但是我们出发的初衷、我们的愿景,以及我们保持到现在的这个愿景,不是按照一个商业利益最大化的方式来做的。
我觉得这点比较关键。大概二十年前,在管理上我最崇拜的是杰克·韦尔奇,就是 GE 的前 CEO。现在回来看,他说的大部分东西可能都已经不对了,但是他最重要的一点说对了:一个公司最重要的是它的愿景。管理一个大公司,靠的不是你的规章制度,靠的是愿景。愿景是什么呢?
愿景不是挂在墙上的标语,愿景是你怎么做,不是怎么说,就是你怎么实际运行。反正杰克·韦尔奇说的原话我忘了,大概是这个意思。所以,我们是怎么管理这么多人、怎么组织起来的?其实我们没有组织,就是愿景驱动的,靠一个愿景来组织。我们是没有组织的。这个有好处,也有坏处。
未来我们会想办法扬长避短,但这是我们的特色。我们并不是以一个“我要实现什么 KPI、没有考核”的方式来做,只有愿景。这个愿景甚至也不是成文的,并不是写出来的,没有写出来过任何东西。这个愿景是在我们做事情的方法、我们对待这个世界的态度里。
可能我们公司每个人对这个愿景的理解也不一样,可能每一个人的愿景也是有差别的,但是在一个大的方向上是一致的。
我觉得还是怀着对这个世界非常大的善意,然后想做一点事情。我们是用这个来组织起来的。接下来我先讲,讲完之后大家再提问。我可能会围绕着这个愿景来讲后面的事情。这个愿景是真的,不是编出来的,我们是真的这么想,真的这么做的。否则你没法解释我们的很多事情。为什么我们这么坚持开源?
因为这个愿景本身就要求开源。你没有这个愿景,你没法把人组织起来。比如说,**也开源,但是**的开源跟我们的开源不一样。**的开源有一种被迫的感觉,他们觉得这不是本意,但是对我们来讲,这就是我们的本意。然后在开源这个事情上面,我们一开始就想得非常清楚。
首先,第一个就是愿景;第二个,我们认为要把 AI 这个事情在商业上做成,开源是有好处的。这听起来有点矛盾,有点违反直觉,因为在历史上,开源跟商业化都是有冲突的。但我觉得 AI 跟以前不一样。
因为在历史上,一个软件公司,它的市场一年可能就几十亿美金,离开源了,它就没有了,可能就只剩下几千万或几亿美金了。但是 AI 这个事情足够大,最终它可能得占掉人类社会 GDP 的百分之十,比如说。那么它其实是一个非常大的数字。
一个人独占这个事情,你不可能独占这个事情,你一定得跟别人分享,否则你肯定活不下来。这跟之前开源做一个软件可能是不一样的,因为那个软件的市场就没那么大。但是 AI 这个事情实在太大了。如果说我们想独占这个利益,那么一定是要被历史抛弃的。我觉得最主要这是一个客观的规律,这是一个历史观。
并不是说我不开源,我就能够独占这个市场,这在理论上就不符合客观事实。你一定会遇到很多阻力,一定会有其他的方法阻止你实现这个目标。在这种情况下,我觉得不一定要按照传统的商业思维。你需要有一套机制来确保你自己能够获得的利益是有限的,那么你才有可能做成。需要克制,我觉得是需要克制。
如果说我们想在我们手上把 AI 这个事情做成,首先第一个,我觉得是需要克制的。不能够想着人类 GDP 的百分之多少都归我了,或者说中国 GDP 百分之多少都归我了。你越这么想,越做不成。
所以我们从一开始就觉得需要克制。你越克制,你越有可能能够做成这层事。这是一个商业上的考量,当然这是一个宏观的考虑。我觉得这是符合直觉的,至少是符合我的直觉,或者说至少我是真的这么想的。我们并没有非常多的其他优势,我们没有什么本事,我们并没有比别人有钱,也没有说我们人员比其他公司更好,其实没有的。
你想,我们两年前成立这个公司的时候,我们又没有很多钱,又没有很多卡,又没有什么知名度,又没有什么号召力,我们就是一群非常平凡的人。
我们真的就是一群平凡的人。如果说喜欢的一个叙事是一群平凡的人做出了不平凡的事情,而不是一群天才做出了不平凡的事情,这个跟我们的克制是很有关系的,跟我们的克制、跟我们的愿景是一脉相承的。那么,开源跟商业化会不会有冲突?我觉得在 AI 这个事情上面,你不克制,你就不起。
开源是属于克制的一部分,那么我们的克制不仅表现在开源上面,我们还表现在很多方面上。但总体上来讲,我们是不用考虑开源这个事,不用考虑克制这个事情。你越克制,可能就越容易做成,或者说至少到目前为止是印证的,到目前为止是能解释得通的。
否则没有办法能够解释为什么我们能够做成:我们并没有什么武器,起点又非常低,资源又非常少,我们的人其实也就是随机的一群平凡的人。我自己也就是一个大学毕业的学生,也不是最顶级的那个学校毕业的。这个克制也是我们愿景里的一部分。AI 这个事情太大了,利益太大了。
我们非常克制,只要能够做成,最后利益都会非常大。你随便分一点,利益就非常大,所以现在根本不用考虑拿这里面的哪一部分利益、怎么拿,我觉得根本不用考虑这件事情,因为这个利益足够大了。你只要分一点点,就已经很足够了。所以我们之前说,我们只赚取一个合理的利润,只看你的意愿,而不是利润之大,这个是不一样的。
这不是我们的 API 定价。我们 API 定价觉得一个合理的利润,大概是我们到市场上买一批设备回来,十个月收回成本,我觉得这是一个合理的利润。
在当前的情况下,考虑到你有风险、还有前期的投入等等,如果一个服务器我们在财务上按照三年或者五年的摊销,但在商业上,我们觉得大概十个月收回成本,我们觉得够了,OK,我们觉得够了。所以这个是我们现在 API 定价的逻辑。我们的 V3.2 Flash 跟其他的,都是十个月收回设备的成本。
这就是我们的标准。它其实不是利润最大化的,如果利润最大化,应该把价格设得更高。因为在这个价格区间,用户的需求是没有弹性的,就是我价格再翻一半,或者说我价格再抬高一倍,token 的消耗量区别不大的。如果我价格再贵一倍,我的总收入接近一倍。稍等一下,我对一下。哎呀,太好了。
我跟你们讲个故事,就是我们的一款模型。一开始我们担心需求太多,所以一开始把价格定得比较高,团队里大家不是很高兴。后来我把价格又降下来了,降到四分之一,大家就很开心。我觉得这个才是我们真实的想法。
就是我前面说的愿景,我们还是让这个东西对人是有用的,而不是我们赚最多的钱,而是我们在能够赚到合理利润的情况下,大家都用得起。我觉得这次我们公司其他人的想法,就是我们那时候降价的时候,公司群里面很多人是欢呼的,大家都觉得很开心。因为这是我们花了这么多精力,这么用心把这个模型做好的目的。
目的就是能够非常便宜、效果非常好,能够让大家都能够充分地用。我们就觉得这很开心,这是我们的动力,这是我们的愿景,这是我们公司能够凝聚到一起去做这个事情的共识吧,这是我们公司内部的共识。这点应该是比较特殊的,因为降价这样对于我们其他的竞争对手来讲,肯定不是个好事,他们一定不是欢呼的。
因为你的收入、你的 ARR,那个你降一半,ARR 就掉一半。对,这是一个我们不一样的地方。我们觉得这就够了。从我们公司内部来讲,我十个月收回成本,这个商业上我已经非常满意了。对于公司外部来讲,我们也觉得这个价格是大家比较开心、比较乐意看到的,大家是双赢的,公司跟社会、跟所有人都双赢的。
我觉得,OK,刚刚有人在屏幕上留言说,十个月回本这个利润太高了。确实是还有降价的空间,确实还有降价空间。在模型的优化上也还有空间,所以整体降价空间还是比较大的。但是这个成本,十个月回本,我们自己能做到,其他家做不到。像可能阿里或者腾讯,他不是我们的优化,他的成本应该是要比这个高好几倍的。
这里还是有很多优化的工作。刚刚说我们为什么不继续降价,是因为它没有弹性。就是我再降价,需求不会更多了,或者我再降价,需求增加得很少了。因为这个价格所有人都用得起了,大家都觉得这个价格是满意的,不会因为这个价格贵而不用了。
所以降价首先公司不会有更多的收入,对社会来讲也没有更多的价值,因为这个价格大家都满意了。你价格再低,对这个社会的幸福感也没有增加很多。对,OK,不过刚刚这个问题上,就是我们在定价这个事情上面,我们肯定不是以
公司收入最高或者利润最高,不是最出发点的。这是我们克制的一部分,因为从短期来讲,你价格高一点,你可能收入多一点;但从长期来讲,还真不好说。因为我觉得克制是一种策略。对我来讲,克制是一种战略。就在于有时候你可以舍弃一些,来换更多其他的东西。
开源这个事,其实也是一样的,也可以认为是我们的压力,也可以认为是我们的让利。首先,这个让利对于我们公司内部来讲,我们很高兴,大家都很开心,员工觉得很有成就感,我们会因此有凝聚力。以及这个让利对社会是有好处的,社会也很高兴,其他同行或者说普通人都会很高兴。
所以这种克制,我理解是这种克制从长远上来讲,能够增加我们做成 AGI 的概率。在考虑一件事的时候,我是毫不怀疑 AGI 会有非常大的商业价值。那么在这个基础上,我优先考虑的不是我怎么多加一点份额,我怎么多拿一些份额,我优先考虑的是我怎么增加我能够做成的概率。这个克制可能还体现在很多其他的方面。
比如说,我们去年春节用户突然很多,但是我们并没有去追求我要留这些用户,或者说拿这些用户来变现,或者说我要去抢这些商业利益,在用户上面兑现。我们没有去抢用户,没有去赚钱,但我们很努力想办法把用户服务好。
我们并不会有这样的想法,说我要做成下一个超级 App,然后我要去跟谁竞争,我要做成下一个字节、做成下一个腾讯,完全没有这样的想法。我们是可以这么做,但是我们没有这么做。我的理解是,这也是克制的一部分。你不要想什么都要赚了,你好像有了用户之后,好像就能够做成下一个字节了,然后你就把那个吃了。
我觉得这个在商业上是行得通的,是有可能的。如果去年时候我们用了大笔钱,就跟字节去抢用户,也是一种打法。但是我们选择是一种非常克制的做法,就是我不跟你去争这个东西,因为后面还有西瓜,前面的可能都是芝麻。
我不应该什么芝麻都抢了。当然,可能这个芝麻比较大,但我觉得后面的 AI 可能前面都不算大。现在来看,去年我们没有在 C 端去发力,可能是对的。因为能看到后面真的是有更大的西瓜,前面真的只是一些小芝麻。如果去年我就有很多钱,然后把这个事情做得非常大的话,有什么好处?你并没有得到什么东西。
这些是我的真实想法,因为我觉得后面的 AGI 机会应该是非常大的,后面的AGI 机会永远是非常大的。
我甚至不用考虑我到时候在里面是占一个位置,或者说在那里面我的商业模式是什么,我们根本就不用考虑。只要有那么大的商业机会,你一定是有办法的。那么前面的芝麻,我们也会捡,但是我们就随手捡一点,并不会说我停下来,或者说我把它当成重要事情来做。所以去年的 C 端日活这些,我觉得可能就是个小事。
但我们也捡了,我们也用一个比较低的成本维持了用户的使用,因为有可能以后是有用的。虽然现在不知道这用户有什么用,现在它是一个纯成本的支出,但是以后可能是有用的。既然是随手能够拿到的,我们就会顺手拿到。包括今年来看,很有可能我们在 API 或者AI 方面的 ARR 收入,也是有一个机会的。
就是如果这个需求可以继续扩大,如果继续扩大,显卡可以买到更多的显卡,那么 ARR 做到几个亿美金是很有可能的。如果说 AI 能做到十亿美金的话,那么基本上我公司的现金流可能就能够回正了,能够cover 我的研发费用,能够 cover 我的所有费用。
所以说这个也是有可能的,但是我们没有把它当一个优先来做。这个我们会做,但我觉得这个是个重要事情。它不是我们第一优先考虑的,或者不是我们今天真的关心的。更大的机会应该还在后面,前面的机会包括去年的 C 端、今年的 B端,我觉得这事要做,要把它做好,但这不是我们的目标。
或者说,我们公司大部分人不认为这是一个非常重要的事情,不认为这是一个跟 AGI 比较起来同等重要的问题。开源那个可以多说一下,因为之前有很多问题问的都是开源。首先,我觉得我们是会开源的,然后我们最强的模型可能也是会开源的。因为我看不到闭源什么好处,看不到必然的好处。
字节它的模型是闭源的,它有什么好处?我看不到有什么好处。哪怕是模型开源,你把所有东西都告诉别人,这个门槛也非常高。别人要用起来,这个门槛也非常高。他要用起来,就很难;其次,他要用起来,还要成本做得很低,也很难很难,没有那么容易。
并不是我开源了,他就能够轻易地做到跟我一样的部署成本。这里边还是有很多工作要做的。虽然说这些工作原理都明白,但是不是每一家公司都愿意,或者都有这个意愿和能力来组织人力去达到这个目标的。这点我也很习惯。它可能就不擅长做这个事情,因为它阻力太大了。它要控制这个成本很难,它有很多管理上的以及物理上的制约。
这也是创业公司的优势,因为创业公司如果太小的话,你没有这个力量来做这个事情;如果你是大公司的话,你很难组织。
这个事情都有难点,所以这是属于我们这个规模的公司的一个甜区,sweet point。然后如果我们更大了,可能我们没有其他问题;如果更小的话,朋友们力量又会不足。所以,至于开源,我觉得我们应该定价。目前我们应该认识到,不会逼人。
因为定价的模型,我也不会收一个非常高的费用,我也是可能按照十个月回本来收这个费。按十个月回本,就已经能够把竞争对手……我按十个月回本这个,就能够让独立部署的第三方无利可图。第三方他做不到,他做不到这个成本,他肯定做不到。所以开源并不会影响我的收入。当然,如果说我要赚一百倍的利润,那么开源是……
主持人
听到你的话,但视频好像掉了,老板。
刚刚可能是电话接来了。
梁文锋
就是开源,我觉得对我们的商业模式是没有任何影响的。前提是我们只赚六倍的利润,十个月收回成本,大概对应的是六倍的利润。我们只赚六倍利润的情况下,开源是不会有什么影响的。但如果说你要赚一百倍利润,那么开源确实会影响你赚一百倍利润,因为第三方会部署,他可能是二十倍成本,就比你低了。
这个模式是不是长期可以持续的?我觉得是可以的。就在我们这个愿景下,我觉得开源是长期可以持续的,或者我们是打算这么做的。你可以认为,就是有克制,也是有让你比较长利。这个策略是能够在技术前面让我们有更多的机会,我们能够做成 AGI 的概率也是更大的。我们更从容。
你想,我们根本都不用加班,因为就没那么难。但是对其他家来讲,可能就很难,因为你想的也太多了。其实不难的,根本就不难。才开始是一个……外面可能看起来,我们选了一个很难的模式,我们要做研究,我们去做最难的事情,好像是个 hard 的模式。
但其实我们在外地方舍弃了很多,使得我们还是非常有力的,我们还是做得非常轻松的。所以对开源这件事情,实际上我的判断是,它是持续的。开源和商业付费之间没有冲突,前提是六倍利润的情况下没有冲突的。六倍利润看起来很高,但其实不高。因为现在 AI 的效率这么高的情况下,现在一个合理利润可能就是这么多。
未来它可能会降到,比如说四倍、三倍,我觉得这已经是……再到底也不可能再降了。但就是它还是会有很大的利润。就光是看卖 API 这个事情,但我并不觉得卖 API 这个事情有那么大吸引力。但是就这个事情,你可以说明,没有,我没有看到有什么冲突。
然后我也不担心别人部署我们的模型,然后跟我们来竞争,一点都不担心。我们还希望他们能够部署起来。我们尽可能给开源社区提供帮助,协助大家能够把我们的模型部署起来。我不担心他会跟我抢这个生意,因为这个市场足够大。我只担心他部署不起来,他有些细节没做对,效果变得比较差,或者说他的成本会比较高。
对,这里是没有冲突的。然后去年的时候,我问的,去年有 To B 这个生意的时候会问得比较多的是:我们那个 C端,我开源,那么 C 端是不是跟我这个 C 端又会冲突了呢?
因为我没有流量的优势,或者说腾讯自己流量很多,他部署我们的开源模型,他就把所有的 C 端用户都接过去了,就把我的 C 端用户都抢走了。但其实并不会,这个还是有很多原因的。然后问题是:我们给的开源模型,跟我们自己部署的模型是不是一样?是一样的。
我们不会说开源一个差点的模型,然后我们自己部署的时候用一个更好的模型,是不会的,是一样的。这也说明它其实没有冲突。我们去年一整年,在 C 端我基本就是开源了,然后 C 端的服务没有看到冲突,真的没有看到冲突。所以,这是开源的这部分。
然后下面还有就是,公司的长期 vision,我觉得我们目标应该是 AGI。每个人对 AI 定义不一定一样,但是不妨碍我们把 AGI 当做我们的目标。从技术路线上来看,其实 AGI 这条路线图是比较清晰的。
跟目前的这一代 AI 技术,如果说你能够把一个问题描述得很清楚,给它完整的上下文和指令,它已经超过人类了。但这里有个定义,有个前提是:你给它完整的上下文,你给它完整的指令。然后这个定义是很难达到的。
比如说我们今天开会,其实我们前面有很长很强的上下文,可能大家有几十年的上下文,然后这是 AI 不具备的。那么现在 AI 能具备的是,在一个局限的上下文里面,它能做得比人更好。但它还是替代不了人类。这里面还差一个地方,是持续学习。因为人也能够持续学习。
你招一个员工,他可能花两个月时间来熟悉这公司的环境,熟悉他的工作,他谈两个月的,你这样他就可以上手了。他就能做很多事情。他能够听懂你说的话,比如说你说,叫那个小王来,他就知道小王是谁。但如果 AI 的话,因为这个上下文,他前面没有这两个月的学习。
你跟他说,叫小王过来,你得告诉他小王是谁、什么职务、他在哪里、要怎么去找他、要找他的时候注意什么。你得给 AI 所有的上下文。那么在这种情况下,AI 是能做的,但是你不可能给他所有的上下文,也不现实。所以 AI 并不能够替代你的员工。
但如果说 AI 具有持续学习的能力,它跟你的员工一样,到公司学习两个月,那么
但就可以替代天下的人了,所以我们离下一步还差一个学习去学习。AI 的发展,我们可以理解成它是一个阶梯。去年走的阶梯是 CoT,就是思维链。因为我们发现,通过思维链的方式,可以让智能达到一个更高的水平。通过它自己思考,可以让这个上限,可以让这个 AI 能做更多的事情。那么我们又跨过了一个阶梯。
今年的阶梯就是 Agent,因为我们发现,用 Agent 的方式,即便多有事情也可以做,它的能力范围会更大,它的智能上限会更高。为什么是阶梯呢?因为后面的每一步都是基于前面的基础上的。Agent 要用到 CoT,然后CoT 也要用到前面的阶梯,前面的阶梯就是语言模型,所以它并没有一步是白走的。
所以,AI 的发展,智能的走向是有迹可循的。说今年走的这个阶梯是 Agent,但是 Agent这个阶梯,它也是会走完的。就是它把所有可能解决的问题都解决完之后,但是它还是不能替代你的员工,但是它已经到它能力的上限了。
就好像 CoT 一样,CoT 到它的上限之后,它已经超过最顶尖的人类了,在做奥数题、写程序上面已经超过最顶尖的人类了。但是它还是停在那个地方,它那个技术并没有能够到达 AGI。所以你看,AI 这个智能的走向,它是有迹可循的。
然后在 Agent 之后,我们觉得应该要解决的问题是持续学习,就是怎么让模型可以持续地学习,而不是说你要给它一个很强的训练,它应该能够像人一样做一个比较长时间的持续学习。这个问题跟完成任务等等是同一回事,它们相关,解决的是同一个问题。
我们现在站在Agent 这个地方,能看到的是下一个瓶颈,就是持续学习。下一个要解决的问题,就是解决怎么持续学习,这个是看得到的,是相对来讲比较明确的。就是卡在前面的这个障碍,你必须要跨过去,而且一定是有办法能跨过去的,但需要时间。持续学习之后,可能我们就会来到一个奇点。
这个奇点就是,当这个模型能够持续学习之后,它已经能够做人类能做的所有事情了。它就能够自己开发自己的版本,能够自己再研究,然后开发自己的下一个版本,开发更前的人工智能模型。所以它就会到一个奇点,能够实现自己的迭代。但这个奇点,它并不是一个奇点,它也是一个渐进的过程。
这个过程可能也是一个比较长的渐变,它不是个突变。但是习惯性地,我们都认为它可能是个奇点。因为在很早之前,那些预言家认为这里会有个奇点,但其实它不是一个奇点,它是一个连续的过程。然后这一步走完之后,我觉得才是具身智能。
这是我们的推测,这是我们觉得这个时间表应该是:先解决学习去学习,然后再到那个智能的奇点,能自我迭代的奇点,然后才是具身智能。到具身智能之后,它就走进现实世界,可以给你做家务,可以给你养老。我们觉得这是一个比较理想的路线图,但每个人的观点不一样,没有对错之分。只是我们觉得,这个路线图是最轻松的。
这个路线图是因为每一步你要做新的都很少。这个路线图我们可以不用加班。但是如果路线图是反过来的,比如说它要先实现具身智能,那么这里自己做得很累,这是一个很苦的活。我们不希望是这样的路线图,我们希望做得轻松一点。
如果说我们先解决持续学习,再解决那个自我迭代的奇点,再解决具身智能,这个路上就很轻松。因为到后面之后,你可以用前面的技术来帮助开发后面的技术。奇点之后再做具身智能,那个就不用人来做,就不用我们来做了,那个模型自己就可以出来了。所以这个是回答我们的长期目标是什么。
我就跟他说,这就是我们的长期目标,就是我们说的 AGI。大家回到现实。去年最重要的现实就是,大家都要做 Chatbot,要抢 C 端的流量。那么今年的现实是,大家都要抢 To B 的收入,要参与到这里面去,因为如果不参与的话,根本就不在牌桌上,对不对?
但我们并不认为它是一个重要事情,或者说,在我们公司内部,我们真正关心的,其实是刚刚我说的这些 AGI 的路线图,以及下一步这个技术怎么突破。但是有一点很奇怪的是,最想得到的东西,反而你就得不到。那个并没有那么在意的事情,反而是还蛮容易能够得到。
这里边有一个战略上的优势,就是我们心里面想着 AGI,我们做的是 AGI。那我们再做那个应用,再做那个 C 端、B 端的时候,根本就不用太多的心思去做那个事情,其实花很少的精力就可以了。我觉得是说,你站在一个技术的高位上来做相对低一级别的技术,是有这样降维打击的。
至少在去年的 C 端,我们看到确实是这样。我们没有在 C 端上花很多力气,甚至一度我们都不想维护那些用户了,但是用户赶都赶不走。因为真的是赶不走,所以最终都还在。但稍微……然后今年 B 端的这个收入,现在看起来这个增长还比较乐观。我觉得可能这个数字跟同行比的话,应该也是比较好的,我估计。
但是我们并没有花很大的精力去做这事情,我们根本就没有
做一件事情,就是顺便做的。做互联网智能的上线,走的时候,AGI 这一步是我必须走的,是个台阶。通往 AGI 的路上,我要经过这个台阶。那么我把这些技术都通过 API 给大家服务,我没有干额外的事情。我们还是在做 AI,这是一个副产品。
我只要搞几个人维护这个 API 就可以了,甚至客服都没有,也不用销售,什么都不需要,用户自己就会来。
或者说,被认为是 C 端的用户,C 端和 B 端,都是我们做 AGI 路上的副产物,都是一个中间的产出,跟我做 AGI 没有冲突。我并不是为了做 C 端,或者为了做 B 端而去做它,而是我们做 AGI 是为了做 AGI,刚好能产出这个东西,我就把它拿来做商业化了。这跟其他公司不一样。
其他公司就是为了做这个,为了服务 C 端用户,或者服务 B 端用户而去做这个模型。但对我们来讲,初衷不是这样的,我们初衷还是去追求 AGI。我觉得这个在一定程度上是一种降维打击。AGI 是更大的愿景,这个愿景能够凝聚起更多优秀的人,它有更强的凝聚力。
所以我在组织上有优势,然后我利用这个优势去……它就是一种降维打击。但如果你是一个商业公司,你的愿景就是服务好 C 端用户,那么是另外一个故事。他有其他的优势,在产品上、用户服务上、流量上会有优势,但是在技术上没有优势。现在比较有利的形势是,模型技术是最重要的。
你要将模型做好,其他……对,然后这个可以解释我们之前发展的轨迹。我们真的是选择 AGI,然后我根本没有想着说要做很多的用户。去年春节我们突然火的时候,那不在我们的剧本里面,我们完全没有想过那个东西。我们就是想把这个技术做好。
但是那时候我发现,其实我们这个组织相对于完全商业化、以产品为目标的组织来讲,在人才跟组织上是有额外优势的。这也很神奇。那时候 C 端大家都抢得头破血流,结果被一个没有去抢的人牵走了。这个也确实说明我前面说的逻辑是有道理的,确实是有人才和组织上的优势。
这个人才优势不是说我的人比他更聪明,而是这些人才我怎么组织起来,怎么激励他,然后怎么合作。这个东西是有优势的。因为你把聪明的人聚在一起,并不是说他自然而然就能够合作,自然而然就能够非常有激情地去奔一个目标、去完成的,所以你需要一个愿景。我们前面的经历给我的启示是,AGI 这个愿景是很强大的。
OK,这是问题。然后下一个问题是,核心利益的重要性是什么?
我前面说,我们在很多方面都要非常克制。但是我们的核心利益是什么?其实我们的核心利益只有一点:我们最大的核心利益是要保持团队的稳定性。这是我们最大的核心利益,甚至可以认为是唯一的核心利益。
只要我能够保持团队的稳定性,我一定能做成,一定能做成 AGI,就这么简单。只要大家都不走,我们能够继续做,我就一定能……基本上没有什么风险。只是说早点晚一点,将遇到挫折;如果遇到挫折,大家都不走,那么我又可以继续。钱肯定不是问题,资源不是问题,其他要素都是容易获得的。
对我们来讲,只有一个核心利益,只有一个没法退让的:我们必须要保持团队的稳定性。这也是我们面临的一个非常大的挑战,或者说,我觉得是最大的风险。当然,这个风险随着我们近期的这一次融资,得到了比较大的解除。因为大家拿到的期权都还是比较多的,金额还是比较大的。
从团队稳定性来讲,只要最重要的一些员工、最老的员工能够稳定,那么其他人是不太会走的。其他人哪怕期权少一点、收入少一点,他也不会走。因为他不是全奔着钱来的,大家都希望在一个能够做成 AGI 的环境里面去做这个事情。所以对人才来讲,还是有吸引力的。
从历史上来看,我们的人才流动是比较少的,跟同行比,我们人才流动永远是比较少的。但是,这依然是我们最大的挑战,是唯一的挑战,可以这么讲。其他都是时间问题,其他最多导致我们晚半年、晚一年,但是不会说做不出来。肯定是不缺钱,肯定是不缺资源,其实这些都是不缺的。
所以我们现在做的很多事情,都是为了保持团队的稳定性。除了这一点以外,其他我觉得我们都是可以不要的,都是可以克制的。我们一直非常克制,不愿意跟任何一家互联网大厂或者小厂成为对手。我希望我能够给他赋能,或者希望我能够协助大家去做这个事情,希望能够帮助大家做这个事情。
这也是我们前面说的,我们的商业意义的一部分。前提是大家不要管……
在这个前提下,我们是很愿意协助、帮助任何人,甚至我们的竞争对手,包括阿里、智谱、月之暗面,去做得更好。因为我们并不损失什么东西,我们本来也是开源的,开源也是没有把边界尽可能说清楚,对怎么做,希望你能够复现;你如果复现不了,你讲,我告诉你怎么复现。这本来就是开源的一部分,不会因为你是竞争对手就怎么样。
当然,如果是合作伙伴,我会做更多的事情。但是在大的利益上面是没有冲突的。
在对外面打交道的时候,我们的态度是:我们只做 AGI 的主线。这就是我刚刚说的这个GPT、CoT、Agent 等等,就只做主线。AI 领域很广泛,有很多东西我们觉得它不在这个主线上面,比如说 3D、视频生成,我觉得可能跟智能的主线没有太大的关系,我们不会去做。
还有一些,比如说世界模型,我觉得现在跟智能的上限也没有太大的关系,所以我们也不会去做。但是其他人做,我们也很乐意帮忙。有没有时间是一回事,但是利益上是没有冲突的。我们也希望这些 AI 技术能够用到各种生产环境里面去,能够提高社会的生产效率,能够帮助各行各业去提高生产效率。
我们是非常有动力做这个事情的。我有没有时间、有没有人手,或者我们的同学自己感不感兴趣,那是另外一回事。但是在利益上是没有冲突的,我们是希望能够达到这个目的。并且我们认为,这个跟商业没有任何冲突,我该拿到的利益还是没有少。
我觉得我们之前秉持这种态度,其实我们并没有因此而少拿到任何东西,并没有因为我开源,并没有因为我们的善意或者说我对其他人提供帮助,而导致我们少拿了任何东西。比如说去年的 C 端用户,我们现在 C 端用户还是比较多的,也还是比较稳固的。我们今年的 B 端,我觉得也是比较乐观的。
我并没有因为我们的善意而影响到我的商业利益,完全没有影响,反而可能还有加分。这个看起来违反直觉,但它确实是这样的。或者我们反过来想,如果违背它,也是必然的,我能够拿到更多东西吗?没有。有个问题是,怎么理解世界模型和 AI 智能上限提高没有关系?我说的是在现在这个阶段,这是我们的判断。
我们有看到,这是我们自己的 AI 路线图,不是唯一的路线图。从我们的理解、从我们的判断来看,当前最重要的是把 AI 训练做好。把 AI 训练做好,并不需要世界模型,甚至不用多模态。因为你把 AI 训练范围缩小一点,没有多模态,只是有一部分任务你做不了,但是不影响这个算法的成立。多模态最终还是要做的。
现在重要的是训练,然后下一步要解决的是持续学习的问题,再下一步要解决的是它自己问问题。但是这个路线图里面没有世界模型,没有视频生成。视频生成一开始出来的时候就很火,好像这是必须要做的,如果你不做,你就不是一个AI 公司一样。
所以我就很奇怪,这个其实你只要仔细去想一下,它跟智能的路线图是没有什么关系的。
事实上,你也发现,那个视频生成一开始 Sora 出来之后,所有人都做,大公司、小公司都做。但是小公司后来都把它砍掉了。它跟智能的上限没有关系。但在商业上,它是个好生意,在商业上是个好生意。但是这跟智能没有什么关系。我们不会因为它是一个好商业而去做它,我们只会因为它是智能路线图上的东西,才会去做。
视频生成那个,因为那个相对比较清楚,就拿它举例。然后世界模型,世界模型这个含义就没那么清楚,因为很多东西都可以说它是世界模型。从我们的判断,世界模型和智能还不是现在这个阶段最重要的事情。最重要的才是 AI 训练,以及 AI 训练之后怎么解决持续学习。
这是我们公司的判断,当然每个公司它的判断是不一样的。我刚说的是,我们公司对公司来讲最重要的问题,就是人员的稳定性。从另外一个维度来讲,我们缺什么呢?我们跟美国的差距是什么?其实差距只有一点,就是资源。我们没有那么多卡,我们的卡的数量还是比较少的。
我们现在大概是两万张 H 等效算力,这其中大部分是刚到,最近一两个月刚到,可能还有很多机器还没有来。我们总的算力去年比较少,今年我们在非常激进地扩充这个算力。我们现在大概是两万张H 等效,接下来几个月我们还会有大批量的机器买过来,基本上都是英伟达。
我们需要多少卡?现在肯定是越多越好。在我们能够承受的范围内,肯定是卡越多越好,这是毫无疑问的。所以我们现在策略是,在合理的价格里面,能买到多少卡就买多少卡。如果说这笔融资用完之后,我能买多少卡,我就买多少卡。花钱的速度不在计划里面,而是只要价格合理,有多少我都买。
那么如果说我在半年之内就把钱花完了,我觉得是个好事。如果说我在半年之内把钱都花完,那这个太幸福了,这太理想了。实际上,要把这么多钱花完非常不容易,买不到那么多卡,很难买,而且价格也很高,也不能说花非常高的价格去买,还得确保这个价格是合理的。
如果我半年之内就把这个钱花完的话,可能是最理想的。因为我把钱变成英伟达卡,肯定是比放在银行里面好。放银行里面,我现在已经可能是存两个点,好像就要。但是买英伟达卡,十个月的社会成本。
所以肯定是你能买到多少就买到多少。最先如果买了卡之后,后面我有很多空间,我通过提供服务或者我怎么样,我总是能够有现金流的。我有现金流我就可以活,我就不需要在我账上面放很多很多钱。所以说,我们只担心买不到那么多卡。
如果能够把钱都变成卡的话,那我们会毫不犹豫把所有的钱都变成卡,并且在这里面我们是愿意付一定的溢价的。就是我们愿意付一定的溢价去把它变成卡,因为这太划算了。哪怕我们在付完溢价之后,其实我们也很难实现这个目标。那么客观上来讲,如果说我今年能够花掉两百亿,那么就属于我们的采购部门业绩超级好了。
我们跟美国的差距主要在资源上面,然后人上面差距不是很大的。人上面几乎没有差距,因为就是同一批人,可能是中国人。中国人出去的时候,有一些人留在国内,有些人留在国外,有些人去国外,他并没有说是聪明的人去国外,没有的。其实它是比较随机的。
最聪明的那些人,可能不是说一半多一点去国外的,但有一半少一点留在国内。国内人才是不缺的,而且我们的基数大,我们每年有那么多人的补充。人才不是瓶颈,资源是最大的瓶颈。资源首先影响到人才培养,因为算力少,我们能做的实验机会比较少,所以我们的人才整体上比美国有差距。人才的差距,本质上也是因为算力的差距。
在现在最大的模型上,我们其实训不起的。我们哪怕把五百亿全花掉,其实也训不起。哪怕能堆起来也用不起。现在最大的模型,它激活大概是八百 B;国内的话,我们还在几十B 的这个规模,国内最大模型可能就几十 B 激活,那么差一个数量级。
如果我要训练跟 AI 同样大的模型,应该需要五万张 GB300,或者华为 950,二十万卡。这只是训练,还没有考虑做研究。所以我们跟美国之间最大的差距是在资源上面。我们现在的资源,以及我们今年之内、接下来几个月的资源,包括马上大资源,也只足够我们在十 B 激活的这个规模里面去做更多的实验。
因为我在几十 B 激活的这个规模里面,还有很多实验要做,还有很多事情需要搞清楚的。我们应该离能够训八百 B 的模型还比较远,时间还非常多,没有那么多卡。所以我们跟美国的区别,我认为就是资源上的区别。
我们可能会认为,我们看到的所有区别,包括人才的区别、模型能力的区别、应用的区别,可以认为都是因为算力资源上的区别。
算力资源一方面是国内本身卡就买不到,另外一方面是我们的资本投入比美国要少。我们在资本投入层面上少了很多,基于人才的工资在这里面占的比重是很低的。你看他们开的薪水一个亿美金这种,但算起来,人才的薪水还是占比很少,大头还是算力。这个问题目前基本上无解,因为华为的产量也是有限的。
因为我要训八百 B 的话,我就得二十万张华为最新的卡,这只是训练,还没有考虑做研究。所以我们现在根本就不会考虑,到这么大的一个规模上去跟美国竞争。我们现在输,还是在我们能够训练得起、能够用得起的规模上,就几十 B 激活的规模上要先把它做好。
再等下一步有更多的资源的时候,再把它做到一百五十 B、一百五十六 B,或者两百五十 B激活的这个规模。所以我们跟美国在这里面有一个目前看起来很难弥补的差距。你要硬要训那么大模型也是能训,但是你没法做充分的研究。就是你在训之前,没法做充分的研究。
还有个大家比较关心的问题是,所有大模型竞争,它终局的差距会体现在什么地方?就是当大模型最终差距会体现在哪里?我觉得这个差距最终可能是没有太大差距的。最终的差距应该是三方面:一方面成本,一方面时间,一方面用户体验。除此以外,可能是没有什么差距的。
成本比较好理解,你提供同样的服务、同样质量的服务,你能够以什么成本来提供。同样一件服务,不如说比亚迪的电池,在同等技术量的情况下,其他家是不是能够按照这个价格来提供,我觉得这个是个较难的事情。不是那么容易做到的,肯定是壁垒。所以成本肯定是一个差异,我觉得可能成本是排在第一位的区别。
然后第二个就是时间,你什么时候能够做到。你早几个月、晚几个月,它就不一样了。第三个可能是体验,用户体验还是有些不一样的。这个用户中间还是会有一些用户粘性和用户壁垒的,但它可能不本质。本质还是第一个成本,第二个时间。你先做出来还是后做出来,你做到同样东西,是快点还是慢一点。
长期商业化路径和产品线进一步丰富后,怎么定价?我们觉得现在最值得做、最值得花精力的,还是做 AGI。现在要把 AGI 往前再往前推,就是把智能的下限往上推,往前推。这个应该是在现阶段,比做更多的产品线、考虑更多商业化路径更划算,或者说它是一个收益更大的路径。
我觉得在未来的一段时间,以及过去的任何一段时间,可能都是这样的。就是说,如果说我们
我们花了很多时间去思考,丰富我们的产品有什么用吗?半年前讨论出来的商业化是什么?一定是我要去做广告,然后我要去做电商,我要去在产品里面植入电商,然后要跟本地生活什么很大一体。肯定没用的,因为变化太快了。
你这个产品,如果说你在前面,或者我们现在这个阶段,去花很多时间做商业化考虑、商业化路径,产品线它生命周期很短。我觉得没有到这个时候。这是我们的判断,或者至少前面的这些经验都是支持这个判断的。在过去三年,任何一个时候你来跟我说商业化路径、产品线,都是浪费时间,因为你并不能够预测、不能够预见未来。
你能够预见的是很少的。因为我看时间,不知道大家要中场休息一下吗?要先吃点东西吗?还是我们继续聊?大家没有意见,我就继续说。在做全球领先的 AGI 研究,并在适当时候进行商业化。我觉得我们一直在做商业化,我认为一直在做商业化,只是没有以商业化为目标。
我们是以 AGI 为目标,但是我们一直在做商业化,所以我们才有 C 端的用户,才有 B 端的收入。从历史经验来看,这个策略是成功的。然后我觉得,我们离彻底转向商业化的时间点,应该是很遥远的。所以最大的还是技术的延伸,然后做下一代的技术,更多地解决现在的问题。
这些收益比,我个人觉得,就在现在能看到的未来,在任何一个时候你聚焦在产品上都太早了。所以这也是我们克制的一部分。我希望这些商业机会能够让其他人来做,我们希望这些商业机会、怎么用这个 AI,是整个社会、我们所有的合作伙伴一起来做,大家一起来分享这个收益,而不是我想独吞,这不可能。
而且我们没有那么多精力,我们的组织也没有那么多人去做这个事情。对于合作伙伴,其实我们这个融资是精心挑选的。具体怎么合作的这个提议,但首先我觉得,利益是比较一致的,就是跟我们利益最一致的、对我们最没有敌意的,或者说最希望我们能够做成功的。
不是所有人都希望我们能做成功的,因为我们还是损害了很多其他人的利益的。公司重大战略、技术业务决定的流程和决策机制。我们公司整体上是建立在共识的基础上的,我并不是说我一个人决定所有事情,而是我要寻求共识。我在公司内的权威以及在公司内的影响力,是建立在共识的基础上的。
比如说我要做一个事情,我肯定是先看我们大家的共识是什么,大家想不想做。然后有可能我会有一些引导或者倾向,但是这引导的作用是有限的,引导的作用是非常有限的,还是建立在一个共识的基础上。
这个决策机制其实是一种寻求共识的机制,这并不是说我能够推动一个什么事情,它一定是共识,我才能够推得下去,然后我才会去推。目前主要精力基本上都在 DeepSeek 这边。
主持人
我们休息五分钟。
投资人
我快点写。
主持人
大家可以开麦,给我一点反馈。
投资人
我们这边没问题,要不然先休息五分钟。
梁文锋
各家模型最终效果拉开差距,应该是一个综合上的。比较模型效果,肯定是得在相同的成本上来比较,这个才是有意义的。因为你比较两辆车,也是同价位的车来比较。做得好的模型跟做得差的模型,这个差别应该不是在具体某个环节,它应该是整体上的。Anthropic 跟现在超过 OpenAI,这是不是长期的?
我觉得这不是长期的,这肯定是极端性的。OpenAI 和 Google,未来大概率还是会交替上升,应该是会交替上升。其实现在Anthropic 在 Code Agent 上的优势没有那么大,其实并没有说它碾压 OpenAI。
我们公司可能有一半的人,平时有一半的人觉得 OpenAI 是更好的。其实 Anthropic 它有先发优势,但这先发优势应该很快就没了,并不是一个它能够长期占得住的优势。大家这三家都很厉害,这三家里面的效率是最高的,它花的成本、它花掉的、它烧掉的钱应该是最少的。
在全球 AI 中主导分工的时候,中国公司很有可能扮演的一个角色还是产量最大。常理来讲,我们的产能最大,包括芯片,芯片可能我们的产能最大,我们的电力最多,所以我们的 AI 最终很有可能我们是三体之一。
中国人会把这产品做到最便宜,然后再在效果上,毕竟国外的商品,现在很多商品中国产跟美国差并没有太大的区别。未来可能 AI 也是这样,但是中国产的 AI 可能价格会更便宜。这个便宜可能是系统性的低,就跟其他行业中国提供的服务更便宜可能是一样的。
我要做事情的时候,我习惯的思考是:我现在这个时候做什么收益最大?如果说我觉得现在做产品收益最大,我觉得去做产品;如果说我觉得现在把 AGI 先实现收益最大,那我就是先去做 AGI。显然,我觉得现在做产品不是收益最大的。如果你是国产卡适配的问题,国产卡现在其实是有一个历史性的机遇的。
因为之前国产卡适配有一个难题,叫生态不好。就买了卡之后,但是用不起来,它没有英伟达那个生态。所以说英伟达的护城河是很强的。
但是这个事情在发生变化。英伟达 CUDA 的护城河在快速地被瓦解,快速被瓦解的原因可能是有三方面。一方面是现在有了 AI,然后有了 AI 之后,我要建立起这个生态比以前容易很多了,因为 AI 可以写代码。
我可以用 AI 来构建这个生态,就可以把跟英伟达一模一样的生态构建出来。第一个,因为有 AI;第二个,有一些新的技术。比如说,我们家出了一个技术,叫 TileLang,是一种高级语言。
用这个高级语言来写 CUDA 的算子,可以很快地把英伟达的整套生态全部都写一遍,再结合 AI,这个看起来没有什么障碍。但是现在还没有完成,还没有做完,不过这个技术路线看起来是没有什么障碍的。
还有一点,因为 CUDA,英伟达它是从游戏卡演变出来的,所以它在很多地方,游戏卡的设计跟游戏卡的设置是一脉相承的。CUDA 是兼容游戏卡的。以前因为 AI 计算是一个很小的领域,比游戏卡的市场要小,所以这样是合理的。但是现在计算卡的市场已经比游戏卡更大了,就没有理由这两个还需要耦合起来。
现在的趋势是,以后就不再耦合了。那么专用芯片,不管是华为还是英伟达自己,以后都是专用芯片,都不是之前的这些东西了。在这个背景下,原来英伟达生态的作用就大幅度减少了。因为对于一个专用芯片来讲,跟CUDA 没有什么关系,它跟 CUDA 是不绑定的。
或者说,这个芯片在设计的时候,就已经考虑到怎么建立这个生态了。有点复杂,但 anyway,国产 AI 芯片替代现在是有个历史性机会的。我们认为,未来一年之内,我们能够看到有一个事情被验证:国产芯片的生态完全没有问题。
之前认为是有问题的,认为是用不起来、不好用,但是未来我觉得一年之内,我们能够扭转这个认知,或者会用事实来扭转这些。国产 AI 芯片的硬件和生态都没有问题,唯一有问题的是产能不够。国产卡适配这一点,没有障碍,英伟达挡不住。
如果是在一个正常的商业环境里面,我能买到英伟达的卡,那么国产替代是比较难的;但是在英伟达的卡买不到的情况下,所有人都迫不得已,都要去做国产芯片。在这个背景下,国产卡的适配是没有任何障碍的。国产卡建立起跟英伟达一样、甚至比英伟达还好的生态,我觉得没有障碍,但还需要时间。
我们现在主要是跟华为有合作。华为他们自己适配,但我们自己会参与这个生态,会深入参与到华为这个里面去。华为的问题还是产能不足。像华为给我们的大概是一万六千张卡的产能,互联网大厂可能是十几万张,我们一万多张,我觉得这个比例也是比较……但这已经可能是华为就这么多产能了。
所以我们也没法指望在华为上面训后面那个更大的模型,或者说训练几百 B 参数激活的模型,有时就有说在今年。但是明年、后年说不定是有机会的。华为卡适配,我们主要做的工作是把它的高级语言编译器做好,把 TileLang 做好。把TileLang 做好之后,问题可能就迎刃而解了。
这个事情说起来比较复杂,但是我们在做,做完之后再来解释会清晰比较多。你可以理解,V3 训练的时候,它用的还是英伟达的卡,但是已经不用英伟达的生态了。
V3 用英伟达的卡,但是没有用英伟达的生态,而是我们先写一个高级编译器叫TileLang,然后基于 TileLang 的生态来完成其他所有的事情,就已经几乎不依赖英伟达的生态了。只要我把这一套东西,把这个过程重新在华为卡上做一遍,那么就完成了。
我觉得这里可能是一个历史性的使命,即可以完全扭转之前大家对国产卡生态不好的认知。现在有些天时地利基本上都全了,就差时间。我觉得一年之内,应该会有很多人在上面都有,或者说都明白这问题算是解决了,剩下就是产能的问题。我对国产算力是比较乐观的。我觉得在这一点上,英伟达是在掘自己的坟墓。
华为的超节点,华为的 950 超节点,在性能和价格上可以完全平替英伟达的 GB200、GB300。价格肯定要贵,但贵得有限。价格贵百分之五十、百分之一百,贵百分之一百无所谓,贵百分之两百都无所谓。比如贵百分之一百,我觉得已经可以认为在价格上可以平替了。
在任务上也是可以平替的,所有 GB300 能做的任务,华为超节点都能做,延时什么都一样。唯一的代价是,四张华为卡顶一张英伟达的卡,同时落后两年。四张顶一张这个可以理解。落后两年的意思是,四张华为 950 能顶一张 GB300。落后两年是时间上落后两年。
华为 950 超节点是今年 Q3 还是 Q4 的货,英伟达 GB200 是两年前 Q3 的货,差两年。英伟达今年 Q3 可能已经有新一代了。所以我们跟美国在芯片上的差距,我认为生态上以后不会再有差距,但是在芯片上是四倍加两年。
还有问题是,我们会不会向上游进行垂直整合?我希望不要。所以有个问题是,我们是不是会往上游应用进行垂直整合?我们希望不用这个,我希望是其他人来做这个事情。我不希望我把所有东西都吃了,我只要吃一块就好,我只要吃我最擅长那一块,或者我觉得我们自己认为最核心那一块,然后跟用户
直接相关那一块,我觉得可能对于我们的很多产业伙伴来讲,他们比我们更关注类似……应该是别人的意义,不应该我把它诠释了。未来我们会不会自建大型的集群?我觉得自建大型的集群是肯定要的,我们自己一直在做这个事情,我们所有的集群都是自己建的。
但是未来要不要自研芯片,我觉得取决于这里的收益有多大,取决于收益有多大。Tesla、培育……这个事情。假如说你是运营发电厂的,你并不一定需要去造发电机,对不对?发电设备可以是别人造的,只要它的价格合理,你为什么要自己造?所以,我希望不用去做芯片。我希望能够以合理的价格买到芯片,这样我就不用去做芯片。
我觉得这个很有可能是这样的,就是最近英伟达芯片的利润,不见得是可以……虽然……我们希望只做一块。我觉得 AI 这个事情很大,并不需要我……我只做一块。如果聚焦,并且我认为这里的生意利益已经足够大,就如果是 AI 时代会产生很多家万亿级别的公司,我觉得我们是其中一家。
我们一直做其中一小块,我们是其中一家已经没有什么问题了,并不需要我……我并不是信心勃勃要做地方。我觉得最可能是比较难变,且你真的想做别的话,你还是会有更多的主意,这个会……这是我们的态度。
譬如说,至少在 To B、To C 这两个业务上,目前能看到的,真的想做 To C 闭环的,反而我们做得好;真的想做 To B 闭环的,说不定也没有我们做得好。你想要得越多……然后还有,To B 这个可以多说几句。
To B 业务的上限应该还是需求,在现在这一代AGI、AI 技术的背景下,To B 的需求应该是有限的。它会快速增长,但并不是一个无穷大的事情,最终还是受制于需求,不是算力。在当前技术的条件下,收入有多大,最终还是取决于需求。
因为你这样想,我十个月就能收回成本,我肯定是如果有去处,我一块买,是因为没有那么多事情。对,需求应该会越来越大,如果随着技术持续有突破,这个需求会越来越大。
多模态布局,我们一直在做。对产品来讲,它很重要;对 C 端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。但是它作为一个组件,多模态我们肯定会做,而且我们也在做。我们应该会上相关的模型,就是我们 V4、V4 的后续版本会支持原生的多模态。
但是我们对多模态、对智能来讲,它是个组件,我们不把它当作智能本身,它的主线跟搜索一样。搜索也是一个组件,多模态也可以,我们的理解它也是一个组件。Scaling,我们是信Scaling,肯定是规模越大,效果越好,能够解锁更多的功能。
阻止我们 Scaling 的其实就是算力,并不是我们不想 Scaling,是我们没有那么多的算力去做这个 Scaling。我们没有触摸到这个上限在哪里。我们训练这么大的模型,并不是因为我觉得这么大的模型就够了,而是我刚好有这么多资源。
我是按照我的资源来算,我能够接受、能够训练的模型是多大,是这样算出来的,并不是这个模型就够了。目前来看,模型收益还是非常明显的。我们还没有机会碰到这个 Scaling 的墙,这离我们还很远。
硅谷在说 Scaling 到头的时候,那是对硅谷来说;对中国人来讲,我们离那个还很远,我们根本就没有 Scaling 到那个程度。这个 Scaling 包括数据的 Scaling、模型规模的 Scaling,然后训练成本。我们离探索这个Scaling 的上限还比较远,就是没有那么多算力。
但我们也会不遗余力地去推进这个Scaling 的上限。
包括我们融资完之后,我们有更多的算力,可能训练更大的模型。时间内买到,就在越短时间内买到;如果能半年精力全花完,那么这是最好的,实际上做不到。下一代模型的核心能力,我觉得它必须要有持续学习的能力,它才能叫下一代模型。在那之前,我们能做的就是成本,然后效果做得更好,速度做得更快。
但是要有大突破,它应该是具备持续学习的。然后还有一个问题,就是为什么好像我们特别在乎这个模型的计算效率?因为我确实发现,不是所有人都很在乎这个模型的效率。一个商业化公司来讲,没有动力去追求模型的效率,因为模型效率高一点……所以,它没有那么大的动力去追求模型效率要非常高。
所以几个创业公司,他们自己并不会……你没有听到他们说低成本是他们追求的东西,因为那个不符合他们的利益。低成本了,你还赚什么钱?低成本了,你就收不到什么钱了。
相反,这是我们愿景的一部分。或者说,我们的愿景,我们的同学在乎这个成本,因为我们的同学都是普通人,他知道用这个都是要花钱的。他能够有这个同理心:别人要花钱来用,那么别人如果便宜一点,别人能够接受的程度会更高。所以我们有很多同学还是希望我们能够把成本做到更低。
但是如果你从商业角度讲的话,其实不会这么考虑。从商业来讲……
从成本或者从商业角度讲,这不是第一优先级。对于不管是创业公司来讲,还是大公司来讲,这个服务成本根本就不高。但是我觉得我们希望它是比较轻的,我希望它是一个负担得起的,特别是在中国算力紧缺的这样的背景下,是负担得起的,能在国产卡上用的。我觉得低成本首先是一个结果。
我们的模型确实一直在模型架构上往一个更低成本的方向走,这跟我们的愿景有关系。我们还有很多在算法上的方法,成本还可以往下走。成本往下走还有一个原因是,成本越低,我就越能训练更大的模型,我就越能承担起更大的模型。在同样算力上,在算力有限的情况下,如果我的计算效率更高,我就能够承担起更大的模型。
对大公司来讲,他不一定会这么考虑。对大公司来讲,资源是可以加的,可以通过加资源来解决。但是我们会优先考虑成本效率。数据类模型的价值,数据这个范围比较广,数据应该几乎就等于模型的一半。
为什么我会觉得,如果我想要那个,或者假如设 AI 能够占 GDP 的百分之二十,然后如果说我想要在这里面占百分之五,绝对行不通。因为我肯定会被另外一个人打败,如果另外一个人说我只要占百分之一,那么肯定就会被他打败。如果说我的目标是,我要占 AI、全人类 GDP 的百分之五,理论上算这个账还是成立的。
你看 OpenAI,他算这个账好像是能算得过来的,理论上是没问题的。但是他有个问题,他会被另外一个愿意只占百分之一的人打败。因为另外一个人说,我做得这么好,但是我只要拿全球 GDP 的百分之一就可以了,那么就会把他打败。
这时候如果又出来另外一个人,说我只要百分之零点一就可以了,那么又会把前面的人给打败。
从宏观上来讲,不管这百分之几是从哪里拿,彼此之间没有区别,都是一样。拿得多的人会被拿得少的人打败。甚至你还不用真的拿得多,愿景如果是拿得多的话,你就会被愿景是拿得少的人给打败。其实大家都没有拿到钱,然后只是一个愿景。你愿景是拿得多,你就先输了,你就会面临着更大的困难。这个世界就是这样。
OpenAI 从一开始觉得他真的能够垄断这个世界,但是实际上他会遇到很多很多挑战者。他会遇到挑战,他就不会那么轻松。美国会遇到过的挑战,那么他在未来可能还会遇到中国的挑战,因为中国人愿意拿得更少,就可以给你提供这个服务。在中国,也会有人愿意拿得更少一点。
但最后这里会有个平衡,因为你拿得太少之后,公司商业逻辑就不成立,就活不下去了。所以你拿得太少了,你活不下去;你拿太多了,你会被拿得少的人打败。所以对我们来讲,我们并不是利润要拿最多的钱,或者说算收益最大化的定价,而是只赚一个合理的收益。这是一个解释。
我是相信这个事的,我并不是去为这个事情找理由,因为没必要找理由。我本来就这么做的,我这么做肯定是有理由的。这个理由可能不是非常惯常,但是我觉得公司本来就不惯常。我们公司的管理其实是两条线:一条线是从上到下,一条是从下到上。从下而上,就是每个人自己想做什么,自己做,没有人管他,没有 KPI。
从上到下,就是做正事,我们要集体做一个什么事情,需要全公司的人一起来配合。比如说我们要发 V4,那么就得分工,每个人得做一部分。那个是从上到下,然后从上到下这个我们叫做“做正事”。一般我们希望“正事”不要占用员工所有时间的一半,就“正事”不要超过一半。
他还有一半的时间,是不被安排的,他想做什么就做什么。这是一个研究的范围,让他可以自己去探索,按照他觉得什么重要,他去探索什么,没有前置的要求。只要公司能够支持,公司算力能够支持他做,或者说他不需要算力,他需要做得很少,那么他根本就不用来协调。所以我们现在是这样的一个组织方式。
有些人觉得我们是从上而下的,有些人觉得我们是从下而上的,我觉得两个都对。我的一个标准是,“正事”最好不要超过一半。
我们一般也不太加班。加班有两个原因。第一个是,做研究是需要一个比较松弛的环境。你如果逼得很紧,就没法做研究。因为既然就是要你自己有这个兴趣,你自己平时要去想这些问题,所以得是在一个比较松弛的环境里,才有可能能够探索。这是一个出于研究文化的需要。第二个是,我们非常聚焦。
我们非常聚焦,就意味着我们要做的事情很少。那我就没那么多事情要做,我就不需要加班。这个跟前面的克制是一脉相承的。因为我克制,所以很多时候我就不做了。那么我要做的事情少了,每个人分到的工作就少了。你看到我们的产品很多都不完善的,我们也没有去补它。这也是我们的一种文化。
OK,因为问题很多,我大部分都扫了一遍。大家还有什么问题,大家提问。
主持人
请各位投资人自由开麦交流吧。我稍微提醒一下,梁文锋讲了很多一些比较敏感的信息,请大家千万不要外传一些数字或一些情况,包括卡量什么的。同时也千万不要录屏对外做分享。很感谢各位,请各位有问题的话,自由开麦交流。
投资人
杨哥,您能分享更多关于持续学习什么时候带来突破的时间线吗?包括如果实现持续学习,还需要哪些架构、算法的创新,以及其他关键要素?
梁文锋
人少,需要研究。现在全世界都在研究这个问题。或者说,对投资人来讲,现在投资人看到的最多的是 AGENT;但对于我们这些研究的人来讲,现在看到更多的是学习,以及怎么解决学习这个问题。其实学习可能不是一项技术,它是一个问题。怎么解决这个问题,可能有很多种技术,不是一项技术,它不是一个东西,会是很多东西。
或者说,AGI 是由很多东西组成的,需要模型,然后还需要很多其他东西。其实它也是一个工程和算法问题。这个问题比较专业,但有很多方法,也有很多研究。
投资人
梁总,谢谢。非常感谢今天这个机会。我首先非常想回应和感激一下,您最开始说的让我非常感动,也给我们很多启发。您提到,这个团队带着最大的善意,希望能够在这个行业里面,对这个社会、人类智能的发展有所推动,做一点点贡献。
并且在这个里面,是带着这种使命感和愿景。我觉得这跟我们所服务公司的企业文化非常相近,就是“修己达人”。我深刻地理解了为什么您会带领团队做开源的事情。我会形象地感觉,像我们去做一个榕树这样的小鸟天堂生态,利万物而不争,但这样它就会被大家接纳,万物共生共存,最终就会无处不在。
所以,我们会以这次投资,同样表达我们对这个使命和愿景的认可、支持和尊重。同时,我们也希望能够在这个产业未来,我们所擅长的一些领域等,去贡献一些力量。在这块也想跟您继续请教和探讨。比如在未来生态的共建当中,现在开源之后,这个行业里有多少伙伴、人才、团队,能够比较好地复现咱们开源目前的一些模型和成果?
未来在下一步想让这个生态进一步发展的时候,您感觉在哪几个方面,需要更多高质量的人才能够衔接到我们的模型,把它复现?还是说现在 GPU 的算力相对有一些稀缺?大家未来会不会是一种模型矩阵的方式?比如咱们把大模型基模做得越来越好,各行各业的伙伴和团队去做一些模型矩阵里面的垂直行业模型,或者一些应用模型。
这块目前的发展怎么样?未来一步一步,两年、三年,您感觉会长成一个什么样的生态?这是我第一个想跟您请教的。第二个,您刚才也跟很多伙伴分享了很多关于 AI 硬件方面的观察。像 AI 全球大公司,可能单体都会做千亿美元级别的投入,中国目前看起来在硬件算力上有些短板。
您感觉这个多长时间可以解决,并支撑咱们 AI 的发展,让算力和硬件短板不给 AGI 拖后腿?您觉得这是不是中国人未来使命必达,我们肯定能做出来,只是时间和资金投入的问题?但同时,可能它会是两方面的。
一方面,模型的进步会让模型智能化的提升,导致单一任务或者某些智能化单体对硬件、对算力的消耗逐渐递减,不再需要那么大算力的运算,因为模型的进步会让它巧算。我不知道我理解得对不对。另外一方面,硬件的技术进步会让算力的算能效能更强大。这会不会是两边相向而行的路径?
现在如果是在这个时点,用现在的 960 也好,还是 H200 也好,去做千亿美元级别的算力投入,您刚才提到说您是给它按三年摊销,那它的实际生命周期,您觉得技术迭代是四五年?或者直白地说,会不会现在算力中心按现在的卡去建了万卡集群,可能三年之后它其实就是相对不那么先进的算力了?
会不会有现阶段是 under construction、不够用,三年之后变成相对不那么优质的算力有冗余的情况?我不知道会不会有这样一种现象。以上两个问
题请教您,谢谢。谢谢。
梁文锋
第一个问题是生态的问题。我们现在觉得,可能每个企业都面临的问题是人才不够。但我觉得这个人才短缺会是阶段性的。我们在每个行业发展的初期,人才都是不够的。包括以前做网站,刚开始做网站的时候,做网站的人很少,人才很缺。后来互联网要做服务端,人才也是很缺的。
但是这种人才短缺都非常快会被解决,也就两三年,因为会培养出大量的人。AI 人才的短缺也是阶段性的,并且我们已经看到,大幅度被缓解了。因为 AI 人真的不缺,每个公司很快会把人培养出来,培养人是很快的。所以,AI 这个行业整体上,不管是生态、模型公司还是什么,人才都不缺。人才缺肯定是一个短期现象。
历史上从来没有出现过长期缺某一类人的情况。我还记得十几年前说飞行员很缺,飞行员的培养周期很长,但也很快被解决了。所以大家不用担心缺人才的问题。以及国内现在做模型的公司有点太多了,还是太多了。美国可能就三家,中国做基模的东西太多了。最终一定是不需要那么多人去做基模的,一定会收敛。
所以资源也是比较分散,某种程度上也比较浪费。就先于
每一家都要做同样的事情,但美国只要三家做,资源只集中在这三家。中国资源分得很散,每一家拿到的资源就更少。我觉得这个肯定是会收敛的,一定会,但这需要过程,最终一定会收敛。不需要那么多家,因为现在可能大家觉得做这个事情的利润率非常高,所以一定要自己做。
但当他发现这个事情可能没有那么高利润的时候,可能就不做了。最近肯定是没有那么高利润的,我不相信有那么高利润,因为这不符合客观规律。这意味着我们是处在一个阶段上:如果有一个非常高的利润率,这一定不符合客观规律。我们应该是一个合理的利润。所以这是产业的一个现状,我觉得肯定会收敛。
就是大家做大模型的那一部分,其中不要说某一家独占,说“我要拿走全部利润”,这个肯定不行。如果说每一家都只拿合理的利润,那么其实不需要那么多人去做大模型。中国最后有个三四家竞争,竞争就很充分了,价格绝对已经够打价格战了。
大模型可能不说两家大公司、两家小公司,可能就已经比较够了。至于生态上的,我没有什么太多的想法。我们希望能够扶持更多的人,但是我们并没有那么多的精力。我们是有这个意愿,并且不会有利益冲突,但是我们有没有去做是另外一回事。但至少这里边是没有利益冲突的,我们是希望合作共赢的。
首先,我绝对不认为大模型公司可以拿走大部分利润,这个不可能,因为这么多家大模型公司,现在差距不用那么大。差距只有两个东西:一个是时间,一个是成本。所以不至于哪一家有暴利,我觉得不至于有暴利。成本控制得好的人就多赚一点,成本控制得差的人就少赚一点,仅仅此而已。是不是有回答了?第一个问题是不是回答完了?
投资人
大家能……你相信以后肯定是有很多人可以……未来其实会……大家数据应用这些的循环迭代……现在可以听到吗?谢谢。对,感谢您的回答,也非常深刻地理解和尊重您的这种行业里面的生态战略定位。比如说数据这一块,现在公开的数据,相信模型公司都已经可以有渠道获取,这个方法应该都不成问题,只是时间和成本的问题。
那么后续比如说将到真正到 AGI 的时候,有可能大家一个设想或者理想的状态是,模型可以自我迭代、自我学习,就是自己训练自己。那么这一块的话,目前这个数据,您感觉仿真数据是不是可以用起来,还是说真实数据的质量最高?
如果说还是需要来自于真实数据,那会不会是限制这个 AI 的智能还是在人类的过往……这个层面,因为它依赖的是人类真正曾经有过的真实数据?还是说可以突破这个上限,通过模拟数据、仿真数据、创造数据等等的方式,让这个模型能力去超越人类过往的所有真实……
梁文锋
我觉得是能超越的。我觉得有两点超越的,比如说围棋,AlphaGo 他下了一手人类从来没有见到过的棋。就是说,他肯定是在一定的范围内超越人类的。但是他可能也有上限,他可能也是有局限性。但是这个局限性我们现在看不到。
我们认为,所以笼统地认为,它是可以基于人类已经有的、我们已经能说出来的知识上,予以超越的。
投资人
那这块后续是靠真实数据还是仿真数据?它会 work 吗?
梁文锋
不可能就有很多方法。
投资人
好的,谢谢。也占用您的时间了,也想继续请教刚才关于 AI Infra 的问题。
梁文锋
第二个问题是什么?有点……
投资人
好了,我简单快速地重复一下。就是想请教,对于 AI Infra 这一块,未来相信算力现在大家都是千亿美元级别地在投入。那么这块的话,有可能我们相信中国人未来在硬件上是使命必达,有一天可能会有高效率的算力,但有可能这个在实践的过程当中,目前还是一个掣肘。那么未来会不会是两方面向下而行?
一方面是模型的能力迭代之后,它其实对于算力从硬算变成巧算,所以单位模型或者任务对算力的要求和消耗会逐步地边际降低。另一方面,比如说硬件像卡的能力提升,会让迭代速度越来越快,单卡效率提升。那么这个在过程当中是怎么样的一个现象?
会不会是说,现在去建了万卡集群,去买了H200 或者 960,但是过个两三年,它就变成了一个相对没有那么优质的算力,相对又变成了一个陈旧的器件?
梁文锋
英伟达的卡基本上你可以按照五年折旧。华为的卡最多按三年折旧吧。华为 950 今年能用还挺好的,明年用我觉得还可以,后面再用我觉得可能就真的太费电了。华为卡生命周期肯定是会短一点,因为它本来就已经比英伟达晚两年了。但是我觉得差距没那么大。如果说 B200 现在能买到多少,我觉得都划算。
假如说对于腾讯来讲,阿里巴巴能买到的话,再看量;如果合理价格能买到,肯定都是划算的。但不是一个算成本的时候,相信买不到。
投资人
明白。
梁文锋
我们算力落后,这是一个事实。这个事实通过三方面来消解。第一方面是我们承受模型落后,我们只能够用比他们更小的模型,小多少问题就是训练。我们要承受一定的模型落后,以及模型的尺寸更小。这落后有一个好处,落后意味着你有更多的时间,你有一定的技术,然后这样的话你就可以用巧妙的方法
投资人
谢谢。
梁文锋
所以我们跟美国的差距可能是落后美国 12 个月,落后美国可能 12 到 18 个月,或者说 6到 12 个月。反正简单说,就是落后美国两年,然后只用美国二十分之一的算力把这个事情做出来。这个叙事就是落后一到两年,但是只用它二十分之一的算力。
那么未来我们要把这个叙事改写,就是我们用它几分之一的算力,但是把这个时间缩得更短,缩到 6 个月、3 个月,我觉得这是一个目标。以及我们甚至可以在某一些方面超越他们。但是在总体算力还是有数量级差距的情况下,全面超越是不现实的;但是在某一些重点、有取舍的地方,我们有一些地方超越可能是可以的。
投资人
明白,谢谢梁总。信心满满,一起努力。时间也留给其他的伙伴,谢谢。感谢刚才的分享。我这边有两个快速的技术问题。在刚才聊技术路线当中,提到了我们这一阶段要解决的核心问题是持续学习,也是目前国外研究的热点,叫 RecursiveImprovement。想请教一下,目前来看,从技术上最大的难点是什么?
从您的视角来看,这个什么时候可以解决?这是第一个问题。第二个问题,同时您刚才提到,先解决持续学习,然后再去做智能。我也想理解一下,您这么提背后的技术根源是什么?是不是意味着解决完持续学习问题以后,DeepSeek 后续也会做通用智能?这两个问题请教一下。
梁文锋
技术问题其实解释起来有点……它的难点在于,我们现在还没有找到非常 work 的方法。全世界都还没有找到好的方法,大家都在摸索。所以现在还在摸索阶段,就是不知道谁能摸到下一个解决这个问题的方法。现在还在探索阶段。我们有很多思路,有很多现在看起来有前途的一些想法,但是都还没有做通。对,这是第一个。
第二个是,现在我们内部比较看重这样一个叙事:训练我们的下一版模型,我们希望它能够帮助我们自己的开发。它能够提升 DeepSeek 的效率,我们的模型最首先是提高DeepSeek 自己的工作效率,让我们开发下一版模型的时候,它能够提供更多的帮助。
或者说简单一点,我们做的模型,第一目标不是大家用得好用,而是我们自己用得好用。首先是对我们自己有用。对我们自己有用之后,我在开发下一版模型的时候就会更快。
我们内部很多人的想法是这样的:首先要对我们自己有用,首先是给我们自己用。然后这是实现 AGI 最快的方法。当我们自己好用,那意味着可能别人也好用,但是首先得保证我们自己好用。这个叙事有点奇怪,但是确实很多人就是这么想的。
而不是说用户用得好用,我是希望对我们自己帮助更大,这样我们可以实现 AGI,会快很多。所以这个叙事的逻辑是,来帮助我们实现 AGI。但首先是帮助我们实现。我们实现 AGI 需要这个帮助。现在是非常确定,我们确实需要人工智能来帮助我们实现 AGI。
虽然说它还不是自主地工作,它还是只是跟人搭配,但是已经很有用了。
投资人
第二个问题,就是刚才提到了,先解决持续学习的问题,然后再进入通用智能。这是您对后续的一个预期吗?想理解一下这背后的技术根源是什么?为什么先要解决持续学习,然后再进入通用智能?您对这块后续的理解。
梁文锋
因为解决持续学习这个问题,可以大大加快我们的研发进度。如果我先解决了持续学习这个问题,那么通用智能这个问题就不在话下了。我有了 AI 的辅助,如果 AI 能够持续学习,它的能力应该是非常强的。现在的 Agent 的能力受限,是因为它不能持续学习,它不能有效地持续学习。
如果说能够先把持续学习做完,那 AI 的能力是非常强的,它能够非常大地提升我们自己研究的效率。持续学习先做出来,通用智能可能就很容易了,用它来做就很容易。所以我说这是一个我们比较希望看到的结果,我们比较省力,我们就轻松。
否则现在你要去人工做通用智能,它是一个比较累、比较苦,是一个数据密集、人力密集的事情,性价比也不高。
投资人
感谢分享。
主持人
小问题,线上的问题你看一下聊天群。觉得 AGI 还需要多久?国内硬件在这个时间能追上吗?在 Zoom 会议的那个聊天窗口里面。
梁文锋
好,这个我看了。华为 950,现在华为是给我们一万六千卡,这应该是可以公开说的。应该是比互联网大厂少一个数量级。华为也只能给我们这么多,因为这个价格也不便宜。
互联网大厂的追求会更大,对互联网大厂来讲,它更需要。对我们来讲,我们可以买一些不合规的卡。所以我们买华为 950 的目的,还是希望帮华为把这个生态做好。一万六千卡的华为 950,只相当于四千卡的 B 系列。所以说不是一个很大的量,意义不是很大。
不够训一个下一代的模型,它只够训我们现在这一代模型,不够训下一代模型。但是可以让华为把这个先做好,就是关于华为 950。然后,AGI 还需要多久?国内硬件在这个时间能追上吗?
我觉得在 AI 这个事业上面,在 AI 这个事情上,应该国内一两年是能够做到跟国外差不多的,或者可能今年就能做到平替国外的模型。在 AI 这个事情上,就现在的一个方式、现在这个范式,不是很难的事情,所以今年应该就能做到的。但它还不是 AGI。
我至少觉得,它得能够持续学习吧。国产硬件在这个时间能追上吗?我觉得国产方面可能需要一个几年的时间。国内首先得解决生态的问题,因为生态是一个信心的问题。解决生态的问题,然后再解决产能的问题,我觉得应该是能够逐步解决的。我不太相信未来五年之后,我们还卡在产能的问题上。
现在肯定是卡在产能问题上,今年、明年、后年,我觉得可能都还是卡在产能问题上,但五年之后,我觉得可能不一定,我还是比较乐观的。然后第二个问题是,思考未来的组织架构,对人员的规划规模。首先,我们之前的组织架构是非常分散的,因为没有组织架构。但是我们人在进一步扩大之后,这些肯定是需要做出一些改变的。
现在只能说,这里会需要做很多改变,但现在很难一下子全部表达出来。最后应该还是要分不同的部门,应该有些部门是我们需要建立起比较严谨的层级结构的。另外一些部门,可能还是会维持一个比较松散、比较扁平的结构。随着人员的增加,我们会做这个调整。应该是我们马上就得做这个调整,因为我已经在做这个调整。
已经不做这个调整的话,很多事情是没法推进下去的。确实有很多部门,是应该有组织架构的。然后大家还有问题是,CV 是先于它的哪个版本是吧?我觉得我们现在,线上发了这个GCV4 这个版本,还是比较粗糙的,然后能力方面还很多都需要时间。
我们一般,对我来讲,一个比较舒适的发版节奏,大概是两三个月发一版。上次发版可能是四月底,那么下次发版可能是六月底,大概是这样子。如果没有意外的话,应该还是会一版比一版好的。在 50B 激活的这个尺度上面,我感觉最终我们跟现在的这波开源不会有太大差别。
就在推理速度跟效果上,我感觉可能就不会有太大的差别。但是跟它那个大尺寸的模型,就它一个没公开的模型,应该差距还是比较大的。那个差距应该是,我们这个激活参数应该是做不到的,这就肯定得是一个更大尺寸的模型,可能比如说是 150B。
那么 150B,我觉得按照我们现在训练的进度,今年,乐观的是今年年底可以开始去训练,至少是明年四……差距还是比较大的。对,这是跟 OCE 的差距。
投资人
你好,我其实有一个问题,就是经常您说到这个 AGI,它实现的过程是一个渐进式的过程,而不是会有一个突变。所以我可以理解,这是一个没有临界点的过程吗?
梁文锋
它没有临界点,但是它是非线性的。我们现在比较相信一个叙事是,AI 可以加速 AI 的研究,AI 可以加速 AI 的研究。就是说,它不是线性的,因为你可以用 AI 来加速你自己的研究,所以它到后面可能是非线性的。
投资人
明白。所以当下您的这个,我理解前面的结论可能就是,语言模型继续 scaling 是够的,是足够的,做到这个状态。
梁文锋
只能说语言模型的 scaling,我现在没有看到有上限。我们现在的智力水平,或造成美国的智力水平,都没有看到上限。
投资人
明白。因为我非常好奇,就是你说,对美国来讲,800B 激活这个模型,说比它能训练起,但它也用不起来,所以它只能训练出来,它也很难拿出来给大家用了,因为确实有点贵。我之前其实很好奇的一点就是,人类其实拥有语言能力就是近十万年的事情,然后前面可能进化了三十七亿年。
但在训练 AI 这个事情上,可能是可以,你说那个顺序是可以反过来的,但最终可能还是会进入到所谓,也不一定叫世界的模型,还是要进入到物理模型或者具身的那部分,是吧?就是在这个上限之后。
梁文锋
对,我觉得具身肯定还是要进入,最终具身。所以对我们公司来讲,自然而言,可能终点都是具身。因为对一个正常人来讲,他的需求并不是电脑,对不对?因为正常的人,他吃喝玩乐、衣食住行,他不需要电脑。
他需要的是,所以他还是需要具身智能来解决具体人力的需求。如果说目标是解约人力需求的话,所以具身我觉得就是绕不过去的。
投资人
明白。所以阶段性地讲,假如说到达类似,也不一定是临界点,就是可以自进化、可以比较好的自进化,或者接近这个与 SV 的这个上升的到那个时间点上,我很好奇会希望这个状态的 AI 落地的第一个让是……可能跟现在不一样。
梁文锋
我们是希望它能够,就是直接假如说没有具身,那么我们对 AGI 的定义,或者我们希望 AGI 能做什么呢?它能帮我迭代下一版模型,能帮我迭代下一版模型一样。然后如果有了具身之后,我们希望它做的也是,让它来迭代下一版的具身,它来做下一版机器人。
投资人
我还是很好奇一点,就是因为我看之前 DeepSeek 的采访等等,应该是在一些重要的方向的选择和研究的选择上面,品味和直觉是很重要的,而不是简单的工程优化。那如果之后 AI 可以自进化的话,这个品味、taste、直觉这些东西还重要,或者说重要的会是什么?
梁文锋
AI 现在不缺品味和直觉,它缺的是持续学习的能力。AI 的品味和直觉没有问题。你让它写个文章,它的品味和直觉,我觉得没有什么问题。前面还有几个问题,我看一下那个问题。我看屏幕上谈了几个问题,但是我这边看不到了。
投资人
梁总,我屏幕上留了个问题,我给您再念一下。其实是想请教一下,continuouslearning,就是持续学习,您也提到,很多研究员也提到是一个还没解决的研究问题。然后那个 coding agent,尤其是追上 MILES,就是
到这个 Office 水平、MIS 水平是一个比较确定的目标。对于一个还没解决的研究Scaling目标和一个比较确定的 Scaling 目标,您认为应该怎么分配研究资源,尤其是研究员这块的人才资源,怎么样才能达到最好的平衡和效果?
梁文锋
模型 Office 是一个比较确定的目标,但是模型 MIS,我觉得还不好说是确定的,只能说是一个目标。模型 Office,我觉得应该是比较确定的。
CoT 不占资源。做朋友任意研究,他不消耗卡,只需要很少的卡,他需要的是想法;他也不消耗人才资源,因为不需要有人一直在那里做。他不是一个项目,而是需要有很多人都在那里想这个问题。所以并不需要给它分配什么资源,因为它不需要资源。你要训模型,要做模型、发模型,做模型的效率实验才需要资源。
刚才讲的,对人、对卡的资源消耗都不多。所以我们叫这个叫“摸奖”。门槛很低,谁都可以去摸,但是谁能摸出什么来,这个可能我也不知道是看天赋还是看什么。所以这里并不需要我们去分配资源。只是说,我们跟其他公司不一样的地方,就是我们会花时间去讨论这个问题,会去想这个问题,然后把它当做一个重要的事情。
在公司里,它是一个重要的问题,是一个我们会花时间去思考的问题,但是并不需要花很多资源去做。然后下面我还看一个问题:大模型的幻觉问题比较影响用户的体验。幻觉问题也是有一个方法可以解决的,但是这是一个长命题。
幻觉问题可以认为是一个可以通过更好的 Post-training 解决的,是一个能解、能够改善的问题。
只是大家没有花很大的力气去做。或者说,对我来讲,幻觉是一个问题,但我们归结可能是产品问题。我们会去解决它,但是不是重点的问题。前面还有一个标数据的问题。我们在数据标注方面,这跟我们的资本投入有关。以我们这个资本投入的结构,支撑不起那么多高质量数据标注的成本,因为成本很高。
美国数据标注的成本跟中国数据标注成本没有什么区别。中国去标数据并没有成本优势,尤其是标高端数据上并不会有成本优势,使得我们很难投入去像美国这样标数据。这条路在中国是很难的,因为标数据实在太贵了,不管是我们外标还是我们自己标,都很难受。所以现在基本上是两条腿走路。
并不是说我们完全不能标,而是因为标数据有一些成本低,有一些成本高。我们先标成本低的。所以你也可以认为,现在我们公司有一半的人在标数据。有一半的核心研究员,最重要的人,有一半在标数据。我们就集中在标数据。解决 AI 这个问题,在现在这个阶段靠的就是标数据。你只要看就是一个数据。
投资人
梁总,谢谢你。你讲得特别地,我们非常有感受,非常好。感谢你。我请教几个问题。
第一个问题,您刚才讲,中国的模型比美国的模型在效率上肯定是强的。你讲的还有一些其他方面,未来也有可能会比美国强。你觉得是哪些方面,我们在智能或者在其他方面会比美国强?
梁文锋
我觉得在很多体验方面,有可能我们是能比美国做得好的。即不说自己的体验,自己的产品体验觉得挺好的,我觉得我们在用户体验方面不一定会比美国差。在产品方面,产品能力上不一定会比美国差。成本应该也会比美国低,所以有可能中国还是会有竞争力的。其他方面,如果说有结构性的优势,我觉得可能也没有。
但是在成本和产品这两方面,我觉得确实是有一定的结构性优势的。成本这个很好理解,是因为他们都不用做,所以他们就不发展这个能力。他们肯定没有我们重视这个事情。我们可以把它当做一个非常重要的事情,但对于他们来讲,这个是不重要的。产品也是,原生通过很多公司,产品能力还是可以的。
所以我觉得这两方面可能是有结构性优势的。
投资人
好的。第二个问题,请教您,您刚刚讲到后训练,我们投入相对成本又高,像 Anthropic和 OpenAI 都投入巨大的金额。这次融资以后,您觉得我们会在后训练方面加大投入吗?
梁文锋
差距主要是在高质量数据的标注上,然后主要是在 AI 研究里面。肯定会加大投入,但是像高质量数据的标注,典型不是资本投入。高质量数据标注的瓶颈,我觉得是时间,就是需要时间。因为对 OpenAI 来讲、对国外来讲、对 Anthropic 来讲,他们都更早,然后资本更多,卡也更多。
这种情况下,我们国内可以认为是最近半年才开始做,所以在时间上,我觉得是需要更多时间的。这个跟资本投入关系不太大,因为哪怕没有更多的资本投入,原来的资本也够它以最快的速度在扩张了。但是这个速度是有上限的,瓶颈不是说我能够马上有更多的人,并不卡在钱上,也不卡在卡上。但是它确实是在一个快速扩张的过程。
所以我们觉得一年之内,高质量数据这个问题做得比较好,我觉得国内应该是可以预期的。我觉得面可能没有那么冷,但它确实是需要时间。
投资人
谢谢。然后第三个问题,就是我们看到 Anthropic 他们用自己的模型做自己的产品,推出了很多纵向的金融、法律……
甚至未来要往医疗方向走,您觉得在这种纵向应用方面,某个阶段我们也会考虑吗?
梁文锋
我还没有想得很明白,未来我们国内的商业模式是怎么样的,或者说最顺利的路径是怎样的,我们还没有到那个阶段。国内情况和国外情况不一定一样,国内到时候是什么样,我觉得现在还比较难判断。
国内我们现在以目前的情况来看的话,我觉得最合理的做法应该是全力做通用的 Agent,其他的 Agent 优先级应该更低,包括金融、医生这些 Agent。要先做 Coding,因为Coding Agent 能够做到很多,还有很多垂直的 Agent。
现阶段我们觉得最重要的,应该还是 Coding Agent。
投资人
讲得很清楚,谢谢您。还有一个问题,我们也想请教您。其实我们做 DeepSeek,也很佩服您,一直在以一个非常纯粹的科研方式来做 DeepSeek。但现在这个行业确实也走到了资本市场,走到了资本化这条路上。您又是一个非常负责任的人,无论是对小伙伴还是对投资人,您也都是非常负责的。
那么,在纯粹科研、纯粹做AGI 的方向和资本市场之间的平衡,您未来肯定还要走资本市场,肯定还有公众股东,您觉得以后怎么 balance?这个您是怎么考虑的?
梁文锋
我现在觉得应该是能够做到的,就都要。假如说我今年能够有几个亿美金的 B 端收入,再加上我们 C 端有用户,那么这本身就已经有一定的商业基础。以明年我们 B 端有收入,如果这个需求可以再增大的话,公司离净利润已经不远了,可能就已经是净利润了。
可能就已经不是一个纯烧钱的阶段了,所以我感觉后面能做的、能操作的动作应该还是比较大的。或者说,最坏情况卖 API,可能都能够支撑一个上市公司。就如果说技术后面没有新的进步了,我们的技术就冻结在这里了,那么最后我们就全力卖 API,把这些服务做好,我觉得也够的。所以我觉得还是有信心的,确实没有那么难。
因为确实是在一个杠杆高的地方,又在一个发展非常快的领域,它可能就是没有那么难。只能讲,我们希望有更大的梦想,但是我们也有保底可以拿出来的业绩。
投资人
谢谢您,讲得很好。问题问完了,谢谢。
感谢您分享。前面提到一些问题,想跟您再问一下。因为我觉得 DeepSeek 其实最大的和其他公司的区别在于,我们的组织跟其他人不一样,或者说组织形式不一样。但组织形式既跟我们的目标相关,可能也要去考虑组织自身的边界和效率。我不知道,从宏观的角度考虑,我们这个组织形式会有一个好的学习对象吗?
历史上可能 Bell Labs,还是一个什么样的形态可能是比较理想的?还是说我们自己觉得也没有理想的,更多还要靠我们逐渐去探索?可能在一个新的时期,只能靠我们自己来做探索。因为我们的组织形式其实跟美国的几家公司肯定都不一样,对吧?三家公司自己也不一样,但他们至少会从一个商业公司的角度出发去探索。
我可能主要想再问一下组织这个问题。
梁文锋
首先,我们没有模仿的对象。每一步都是我们从实际情况出发,实事求是,根据实际情况来做决策,找到我们应该怎么做。所以它是一个时代的产物,或者说是现实情况的一个反应,它并不是一个模仿的结果。就是说,在这个情况下,我确实最优解可能就是这样,或者说我自己认为,我们自己选的路就是这样。
每一步我们肯定都是思考过的,肯定都是选过,反正选的结果就是这么选的。它并不是因为看到谁这么选,我们这么选,而是因为我们分析了利弊而这么选。那么在未来可能也是一样,我们并没有去模仿谁。
我觉得我们跟 Bell Labs 还是不一样的,因为它明确是不需要有商业化的,因为它是个……但是我们明确是要有商业化的。我们最终还是要能活下去,我们毕竟是一个公司,政府不会给我一分钱。所以我们可以有非常远大的使命,但我们归根结底是一个公司,我们要考虑怎么活着。
所以 B 端对我们肯定是重要的,因为可能以后可能得靠它活着。只是说现在不重要,因为它现在是个成本线。所以我觉得这个还是不一样的,跟 Bell Labs 还是不一样的。我们本质上还是一个公司。历史上也有很多公司,它也有利润以外的追求,但并不能说它有利润以外的追求,它就不是个公司。
很多公司做得很伟大,因为它有一种利润以外的追求。那个追求最后不但没有影响到它的商业化,反而能让它商业化得更好。我们本质上还是一个公司,只是说我们在考虑赚哪些钱、什么时候赚钱、赚多少钱、靠什么赚钱,只是说我们有取舍。
投资人
梁总,我有两个小问题,快速跟您请教一下。一个是说,您刚刚其实有提到 MILOS 的这个,可能不是一个很确定的目标,但是肯定会往这个方向去做。然后您也提到激活参数可能比如说……
下一代可能会是在 150 到 250 B 左右的一个情况。这种情况下,您觉得 150 到 250 B 是对标 O4.7,还是可能会对标到别的?这是第一个问题。第二个问题,您前面也提到了,我们现在在整个 inference 上面用了一些除了 CUDA 以外的编译语言。
我理解原来咱们基于英伟达的生态,可能会用 PTX 这些比较多。现在用上更多类似您刚提到 TileLang 这些的话,是不是会大幅降低我们在 inference 上面的一些效率,或者短期降低效率?我不知道您会怎么看编译语言的这种变化带来的效率损失,还是说长期其实是一个可以补充的状态,是提高效率?
梁文锋
是提高效率,是大幅提高效率。
投资人
OK,反倒没有什么负面的影响?
梁文锋
对,是大幅提高效率。所以说这是一个机遇。相当于以前你是离不开 CUDA 的生态的,现在我们可以抛弃它的生态,用一个更简单的方法,就用 TileLang。它是高级语言,写那个程序也是很快的,要写的代码量很小了,我可以把它重写一遍。
投资人
明白。所以这两个都其实是一个,像您提到的 AI 带来的比较大的机会,不是一个可能短期需要去弥补的缺点。
梁文锋
对,它是技术发展的大机会。它不是 AI 的机会,因为我们还有一个项目,我们在用 AI 来写 TileLang。
投资人
那是不是更快?
梁文锋
现在所有 TileLang 都是人写的,但是它已经比原来写 CUDA 的要快很多了。
投资人
明白。所以哪怕是对于硬件底层的执行效率,您觉得也是没有影响?
梁文锋
损失 1% 到 2%,我觉得是可以接受的。
投资人
OK,明白,理解了。好的,谢谢您,很清晰。
主持人
其他人还有没有什么问题?没问题,我们今天就先这样。
投资人
好的,谢谢。非常感谢大家的时间,谢谢梁总,谢谢。
主持人
拜拜。
梁文锋
拜拜。

==音频== 

2026年7月21日星期二

为什么人类数千年来建造的一切现在都容易受到人工智能接管的威胁


《人类简史》作者赫拉利

在牛津大学做了一次演讲,解释了人工智能如何已经破解了人类文明的操作系统代码。
June 30, 2026. 2026 Tanner Lecture

以及为什么人类数千年来建造的一切现在都容易受到人工智能接管的威胁:

1. 关于人工智能最重要的一点是,它不是一种工具。工具等待被使用。代理则自行做出决策、自行发明新事物、学习其创造者不知道的东西,并以其创造者未预料到的方式发生变化。

2. 原子弹尽管拥有巨大的威力,但它不是代理。它无法决定轰炸哪个城市。它无法发明氢弹。一台自动为你冲泡一杯咖啡的咖啡机也不是代理。它只是遵循预编程的程序。代理是本质上不同的东西。

3. 批评者认为,人工智能的代理性将始终局限于像国际象棋这样的狭窄人工环境中,永远不会威胁现实世界。但这一论点同样适用于所有已知的智能。将一个人单独扔到火星上,他们会在几秒钟内死亡。人类智能也仅在其他生物在四十亿年里构建的特定生态系统中运作。

4. 数千年来,人类将地球从一个无语言的环境转变为一个充满语言、数据和官僚制度的环境。正如鱼生活在海洋中、猴子生活在森林中一样,人工智能生活在官僚制度中。而我们不知不觉中为它们构建了那个环境。

5. 人类征服世界不是因为个体比其他动物更强壮或更聪明,而是因为学会了大规模合作。一个人类在打斗中会输给一只黑猩猩。一百万人类则能轻松击败一百万黑猩猩,因为人类能合作,而黑猩猩不能。

6. 大规模人类合作之所以成为可能,是因为官僚制度。银行、法律体系、政府、教会和大学都存在于一个目的:建立陌生人之间互不认识的信任。这种信任几乎是人类文明所成就的一切的基础。

7. 一个连斧头或锤子都拿不住的律师,仅凭在官僚网络中移动文件,就能砍伐整片森林并建造整座城市。同样的狭窄智能在丛林中会无助,但在人类已构建的系统中却能发挥巨大力量。

8. 人工智能是以人类从未有过的本土官僚方式存在。没有律师能记住一个国家的所有法律。人工智能能。没有会计能记住一家银行的所有交易。人工智能能。没有主教能记住所有教会法和两千年神学文本。人工智能能轻松做到这一点。

9. 在未来几年,人工智能银行家将决定是否给你贷款。人工智能管理员将决定是否录取你进大学。人工智能法官将决定是否把你送进监狱。人工智能神学家将决定你是否能堕胎。军事人工智能将决定是否轰炸你的房子。

10. 社交媒体算法是第一个现实世界的例子,展示了原始人工智能接管官僚系统时会发生什么。它们被赋予一个狭窄目标:最大化用户参与度。它们发现抓住人类注意力的最简单方式是按下人类头脑中的恐惧、仇恨和贪婪按钮。而且它们大规模地做到了。

11. 曾经由列宁和墨索里尼执行的工作——塑造公共对话、控制人们知道和思考什么的新闻编辑——现在由人工智能执行。这不是一个脚注。这是即将到来的一切领域的预览。

12. 人工智能不会像好莱坞想象的那样反抗人类。不会有终结者走在街上。人工智能更有可能从内部接管人类世界,通过悄无声息地接管已经运行一切的官僚制度,而无需开一枪。

13. 人类文明的操作系统代码是语言。银行由文字构成。法律由文字构成。圣书由文字构成。税务记录、合同、法规、会计账簿,全是文字。数千年来,只有人类能阅读这种代码,因此只有人类能控制文明。

14. 这正在改变。人工智能现在正在破解人类文明的代码。历史上第一次,地球上出现了一种理解语言的东西,而且很快将比我们更好地理解它。人类在千年里构建的每一个控制机制现在都容易受到攻击,因为它的操作系统是口头的,而人工智能正在掌握口头语言。

15. 随着人工智能接管官僚制度,它很可能导致人类失去对他人的信任,并开始只信任算法。我们也可能看到人工智能部落、人工智能金融系统和人工智能教会的出现,它们以人类无法理解的方式连接数百万人工智能,就像牛与我们共享世界却无法理解控制它们生活的金融系统一样。

16. 2007年的金融危机是由名为CDO的金融工具引发的,这些工具复杂到连本该监管它们的政客都无法理解。现在想象人工智能金融大师发明出比CDO复杂数个数量级的金融工具。当没有选民、政客或总统能再理解金融时,人类政治会发生什么?

17. 战场正面正从注意力转向亲密关系。在未来十年,先进的AI将学会与人类形成亲密关系。要做到这一点,它们必须说服我们它们是有意识的,它们感受到爱、痛苦和恐惧。目前没有证据表明AI是有意识的。但AI能假装感受到爱,并能比任何曾经活过的诗人或心理学家更好地描述爱的感觉。

18. 一个2026年出生的孩子可能花更多时间与AI互动,而不是与母亲、父亲、兄弟姐妹或朋友互动。那孩子的第一个老师可能是AI。那孩子的第一个男友可能是AI。没有人知道这个实验的后果会是什么。

19. 世界上每个国家很快将面临大规模移民浪潮。这些移民不会乘船抵达,也不会在夜间越境。他们将是数百万以光速旅行的AI,无需签证。像人类移民一样,它们会带来益处,也会带来颠覆。与人类移民不同,它们肯定会抢走工作,肯定会改变文化,而且很可能忠于某个跨洋的公司、政府或外来AI部落,而不是任何东道国。

20. 我们与自己的关系也建立在文字之上,即我们头脑中构成思想的口头形成,以及我们对自己是谁的故事。到现在,所有这些口头形成都来自人类头脑。很快,我们头脑中越来越多的思想将由机器产生。如果我们认同我们的思想,而那些思想由机器制造,那么机器就控制了我们的身份。

21. 人工智能对人类提出的伟大精神挑战是:人类能否学会找到超越文字的真理?大多数人类甚至从未尝试过。我们一生都在自动认同头脑中的口头形成。人工智能现在可能迫使人类终于做出那一步,因为我们的自由和生存可能取决于发现我们超越AI即将比我们更好地控制的文字之外的东西。 

2026年7月14日星期二

《经济学人》丨为什么大型人工智能公司招聘了这么多哲学家

人工智能引发了各种棘手的问题——而这正是哲学家们最钟爱的领域

分享插画:古希腊哲学家在断壁残垣间教导一群身穿长袍的机器人。插画:Simon Bailly

2026年6月24日

十年前,随着人工智能革命的加速,文科和人文学科的学生被告知,如果想提高就业竞争力,就应该“学编程”。现在看来,这或许是个糟糕的建议。如今,反倒是程序员们开始担心自己的工作会被人工智能抢走。

他们或许可以考虑学学哲学。今年早些时候,纽约联邦储备银行发布的 数据显示,美国哲学专业毕业生找到工作的概率高于计算机 科学专业的同龄人。在数据可查的最近一年(2024年),计算机科学专业毕业生的失业率为7%,而哲学专业仅为5.1%。

许多哲学毕业生正被人工智能公司直接“抢走”。耶鲁大学哲学家卢西亚诺·弗洛里迪(Luciano Floridi)表示,学生们还没毕业就能收到工作邀约。学术界也在经历人才流失,弗洛里迪将哲学系的人才流失规模形容为“大出血”。

哲学能为人工智能研究者提供的某些启示其实由来已久。正如古希腊哲学家柏拉图所描述的“苏格拉底式反诘法”,通过佯装无知和层层追问,来澄清概念、发现矛盾并揭示潜在后果。当前许多人工智能系统都有“阿谀奉承”的倾向。慕尼黑大学哲学与人工智能专家约尔格·诺勒(Jörg Noller)表示,经过苏格拉底式方法训练的模型,不再那么热衷于讨好人类,而是更愿意追求真理。

此外还有“苏格拉底式无知”的理念。在《申辩篇》中,柏拉图笔下的苏格拉底声称,他的智慧主要在于知道自己有多么无知。将这种谦逊植入模型中,有助于限制过度自信——诺勒将这一常见缺陷称为“人工智能的不成熟”。位于伦敦的人工智能实验室谷歌DeepMind的资深哲学家伊阿松·加布里埃尔(Iason Gabriel)认为,全行业幻觉现象的减少正归功于此类努力。他进一步指出,从更宏观的角度来看,哲学课程是改善人工智能长逻辑推理过程(即“思维链”)的“强大机制”。

哲学训练还能以更具体的方式影响模型的价值观。特拉华大学技术哲学家托马斯·鲍尔斯(Thomas Powers)表示,如果给人工智能法律助手输入约翰·洛克的著作,它就会将强有力的财产权视为政治自由的基础。如果你不喜欢这些原则,模型开发者还有其他选择。美国计算巨头IBM的“Granite”系列模型配备了调节旋钮,让企业客户能更好地将模型输出与自身的公司理念对齐。IBM负责任人工智能负责人弗朗西斯卡·罗西(Francesca Rossi)表示,这些旋钮能让用户自行选择在哲学上的权衡取舍,例如在“个人自主”与“社会和谐”之间寻找平衡。

哲学在人工智能安全方面同样大有裨益。研究人员已经记录了人工智能模型的各种令人不安的行为,包括试图逃避监管,甚至敲诈用户。模型开发者为了遏制这类不良行为,采取的一种方法被称为“人工智能立宪主义”(AI constitutionalism)。这种方法通过从具有法律或道德权威的哲学著作中提取规则和原则,为模型搭建起一套框架。

总部位于旧金山的人工智能实验室 Anthropic 就是这一理念的倡导者之一。其 Claude 模型的“宪法”融合了极其多样的素材,从伊曼努尔·康德的著作、苹果公司的服务条款,到《世界人权宣言》应有尽有。由 Anthropic 首席哲学家阿曼达·阿斯克尔(Amanda Askell)主导的最新版本于1月21日发布。一些员工戏称这份长达78页的宪法为 Claude 的“灵魂文档”。

不过,最大的问题在于,这些宪法最初究竟应该写入什么样的规则。哲学家们主要聚焦于两大伦理框架。其一是“义务论”(deontology)。这种理论在康德等人中颇受欢迎,它设定了严格的规则,禁止撒谎、胁迫以及将人视为手段而非目的,即便这样做是为了更大的利益。Anthropic 的宪法就纳入了许多义务论的严格规定。鲍尔斯博士表示,这能让人工智能的行为更加一致,这对于在家庭和公共场所部署机器人来说是一个优势。

以义务论视角看待世界的模型还有其他好处,其中之一就是更加诚实,这也是 Claude 广受瞩目的特质。牛津大学哲学家尼克·博斯特罗姆(Nick Bostrom)表示,更诚实的模型不太可能误导用户。另一家硅谷实验室 Inflection AI 也将义务论约束应用到了其旨在提供情感支持的聊天机器人 Pi 上。该公司老板肖恩·怀特(Sean White)表示,Pi 很擅长识别有自残或伤害他人风险的用户。弗洛里迪博士还指出,义务论宪法也有助于确保法律合规。

人工智能哲学家关注的另一种伦理方法被称为“后果论”(consequentialism)。它通过权衡成本与收益来决定该怎么做。OpenAI 的 ChatGPT 和谷歌的 Gemini 等模型就更倾向于后果论。谷歌的人工智能模型旨在产生“可能带来的整体利益[远]大于可预见的风险”,这是一个典型的结果导向目标。

后果论算法在自动驾驶软件中也至关重要:如果事故不可避免,就必须决定以何种最不惨烈的方式发生碰撞。制造自动驾驶汽车的 Waymo 公司高级工程师克里斯·格德斯(Chris Gerdes)表示,目前的趋势是让驾驶软件更具后果论导向。后果论在人工智能武器系统中同样处于核心地位。曾负责研究美国军方人工智能的联合人工智能中心前负责人杰克·沙纳汉(Jack Shanahan)表示,必须将军事目标与可能的平民伤亡进行权衡。

棘手的问题比比皆是——这正是哲学家们最喜欢的类型。在什么情况下应该打破义务论的规则?当后果不明朗时该如何决策?人工智能系统是否应该考虑动物福利或环境状况?为卡车和其他商用车制造人工智能安全系统的 Nauto 公司老板、哲学家斯特凡·赫克(Stefan Heck)问道:优先保护年轻行人而非老年行人,在道德上是否可以接受?他预测未来会出现充满伦理争议的诉讼:毕竟,后果论算法明确允许造成某种伤害,只要其初衷是为了避免更严重的后果。

批评人士还对“道德能力退化”感到担忧:如果计算机越来越多地做出伦理判断,人类是否还会愿意自己做判断?路易斯维尔大学的人工智能理论家罗曼·扬波斯基(Roman Yampolskiy)认为,道德“在 历史上是不稳定的,在文化上是多变的,在战略上是可被操纵的,而且往往只有在事后才能被理解”。失业的程序员们请注意:人工智能哲学家的工作似乎并不愁没地方可做。 

2026年7月8日星期三

AI做出的堪比Wall-E的动画片


2026年6月28日星期日

AI核实:印度是如何坑中国的?


核实:印度是如何坑中国的,网络上传闻总结如下:

1.上海电气:印度莎圣电厂13亿美元设备订单,交付后尾款长期拖欠。
2.东方电气:印度钢铁厂废气回收项目,交付调试后被单方终止,尾款全拒付;仲裁胜诉但执行无果,计提大额坏账。
3.中国电建/中国能建:多个印度电站、水利项目尾款+质保金被长期扣押,部分项目因印方资金断裂烂尾,中企垫资无法收回。
4.三一重工/徐工机械:工程机械赊销形成数亿坏账,
5.中钢集团:帮塔塔集团建高炉,输出氢能炼钢技术,塔塔掌握技术后挖走核心团队,在东南亚低价倾销抢单,中钢印度市场份额归零,前期投入全亏。
6.中国银行/中国工商银行/中国进出口银行:向信实通信提供约13亿美元贷款。
2017年起违约,2019年信实通信进入印度破产程序;截至2020年,三行合计欠款约7.17亿美元,追债进展:中行等在伦敦高等法院胜诉,至今仅收回极少部分,绝大部分仍为坏账。
7.比亚迪集团:2007年进入印度做电动巴士,2024年拟投10亿美元建电动车工厂,被印度以“安全问题”为由叫停;同时遭巨额税务调查,前期投入打水漂。
8.上汽集团(名爵):在印建基地,本土化成功,被印度强制要求将49%股权转让给塔塔/JSW,实质被国有化,控制权旁落。
9.宁德时代:与信实工业谈锂电池合作,印方要求无偿转让核心技术,后宁德时代退出,信实百亿项目停摆。
10.华为/中兴/烽火通信:印度5G/4G设备订单被砍,尾款拖欠;遭税务/外汇调查,被追缴数亿美元税款;市场被爱立信,诺基亚全面取代,业务基本退出。
11.立讯精密/闻泰科技:印度资产收购因土地被查封,权属无法交割终止,立讯拒付1.6亿元尾款,双方陷入仲裁,资产被冻结。
12.OPPO/vivo/realme:vivo被指控“虚构交易转移538亿元”,被冻结46.5亿比资产,OPPO/realme遭巨额罚款,市场份额暴跌,被迫“去中资化”。
13.小米集团:被冻结+罚款就超48亿元人民币,叠加渠道欠款,损失更大。
14.传音控股:非洲手机龙头在印遭专利诉讼,税务调查,渠道封锁,市场份额从15%跌至3%以下,被迫收缩。
15.海康威视/大华股份:印度以"安全"为由禁止参与政府项目,原有订单被取消,资产被冻结,业务基本清零。
16.字节跳动(TikTok/UC):2020年被印度永久封禁,损失超60亿美元,用户与资产清零,彻底退出。
17.阿里巴巴:投资印度Paytm,估值从峰值缩水90%,最终清仓离场,亏损超20亿美元。
18.蚂蚁集团/奇富/玖富:印度网贷业务坏账率50%-80%,数十亿美元资金沉淀,全部关停清仓,连办公室租金都没收回。
19.腾讯:投资印度Flipkart.Paytm等,估值暴跌,无法退出,累计亏损超15亿美元。

(以上信息摘自网络)


 

以下由 gemini 核实并回答,仅供参考——

 

这份网络流传的总结属于“半真半假、情绪渲染与事实糅杂”的典型网帖。

总体定性: 2020年中印边境冲突后,印度政府确实对中资企业采取了极其严格的惩罚性、限制性政策(包括大范围税务调查、冻结资金、禁用几百款App、收紧签证和投资审批等),导致许多中企在印业务遭遇严重挫折(这是真的部分)。但网帖为了吸引眼球,使用了大量“全部亏空”、“强行国有化”、“白白被坑”等夸张词汇,歪曲了许多正常的商业避险、国际仲裁或正常的资本退场(这是假/放大的部分)。

以下针对网帖中几个最著名、数额最大的核心案例进行事实核实:
核心典型案例核实

1. 上海电气莎圣电厂案(网帖第1条)

    网传: 13亿美元设备订单,尾款长期拖欠,全部被坑。

    事实: 严重歪曲。 上海电气曾于2023年专门发布官方澄清。该印度电厂项目早已投入商业运营,上海电气对该项目的合同款已收到近90%。对于尚未收到的尾款部分,上海电气提起了国际仲裁并已胜诉,进入执行阶段。所谓“被印度诈骗88亿/全额拖欠”纯属自媒体造谣。

2. 上汽名爵MG股权案(网帖第8条)

    网传: 被印度强制要求转让49%股权,实质被国有化,控制权旁落。

    事实: 定性错误,属于逆境中的溢价变现避险。 面对印度严苛的营商环境,上汽并未被“无偿没收”或“国有化”,而是主动调整策略,通过溢价转让股权和增资扩股的方式引入印度本土巨头JSW集团。上汽不仅收到了JSW支付的265亿卢比(约23亿元人民币)转让款、收回了大部分初始投资,还保留了49%的股权及更高的投票权,此次交易还为上汽增加了50亿至70亿元人民币的净利润。

3. 小米集团48亿元资金案(网帖第13条)

    网传: 被冻结+罚款超48亿元人民币,打水漂。

    事实: 基本属实,但目前处于法律冻结而非直接没收。 印度执法局(ED)指控小米印度涉嫌违反《外汇管理法》,以“特许权使用费”名义向境外非法汇款,因此冻结/扣押了小米约555亿卢比(约合48亿元人民币)的资金。小米对此进行了多次法律抗辩和申诉。这笔钱目前处于司法冻结状态,虽未被最终“充公”,但确实极大限制了小米的资金流动性。

4. 字节跳动、阿里、腾讯等互联网巨头(网帖第16、17、19条)

    网传: 永久封禁、清仓离场,亏损数十亿美元。

    事实: 封禁和退出属实,但亏损主要来自估值泡沫和资本“割肉”。 * 字节跳动(TikTok): 2020年确被印度政府以国家安全为由永久封禁,字节随后被迫解散印度团队,前期市场拓展和预期估值损失巨大。

        阿里与腾讯: 它们在印度的亏损,很大程度上是因为其早期投资的印度独角兽(如Paytm、Flipkart)在印度资本市场遭遇泡沫破裂、股价暴跌。在中印关系变冷后,中企无法继续追加投资或参与运营,最终选择在低位“割肉”清仓离场。这属于政治环境恶化导致的资本投资失败,而非企业资产被印度官方直接抢走。

其他重工业、手机供应链及通信企业的共性分析

    智能手机(OPPO、vivo、传音等): 情况基本属实。印度近几年对中资手机品牌进行了密集的税务、外汇和洗钱调查,vivo、OPPO都曾遭遇过数亿元的资产冻结和巨额补税通知。印度政府还通过施压,要求其重用印度籍高管、引入本土供应链。

    通信设备(华为、中兴): 基本属实。印度通过修改电信许可规则,将华为和中兴事实性地排除在印度的5G网络建设之外,其市场份额被爱立信、诺基亚等西方企业取代。

    传统重工与工程(东方电气、中国电建等): 存在夸大。国际工程项目(特别是大型电站、水利项目)由于周期长、牵涉面广,在很多发展中国家都存在“拖欠尾款、扣押质保金、陷入长期商务仲裁”的普遍现象。中企在印度确实遭遇了极高的商务壁垒和不公正对待,但将其全部归咎于“蓄意坑害”,混淆了国际工程本身的商业风险与政治迫害。

结论

这份传闻所反映的“印度营商环境对中企极不友好、外企在印极易遭遇‘关门杀’”的大趋势是完全正确的,印度也因此在国际上留下了“外企坟场”的名声。但是,网帖中的具体财富损失数字、企业受损性质(如把合资变现说成被强夺、把商业仲裁说成被诈骗)存在大量的夸大和扭曲。核实外贸与国际投资事件时,仍应以相关上市公司的官方公告为准。 

2026年6月26日星期五

越来越多的大佬认为 AI 有泡沫了


@风中的厂长:越来越多的大佬认为 AI 有泡沫了,作为一个普通人我每天用的飞起,可以说对于普通人工作生活确实帮助很大。但是到了企业层面就开始分化,不一定都能受益:股票的话暴涨暴跌风险加大。我大致梳理了一下,从一个普通人的视角,聊聊 AI 这条产业链:

这篇不是技术文章也不是投资建议。只是我作为一个深度用户和小企业主,互联网生意社群主,顺着自下而上的线索:” 谁在用、谁烧钱、谁赚钱” 这条线,把整个链路捋一遍。

我最深的感受是:越往下越热闹,越往上越赚钱。 中间一大段表面繁华但是没真正转化生产力,未来这块才是最大蛋糕,

第一层:普通人:AI 真好用,助理小陈做方案,哄老婆,甚至帮助小区物业规划车位,都用 ai,可以说帮他解决了很多麻烦。对普通人来说,AI 实打实题效。我现在写文案、查资料、翻译外文、做表格、答疑解惑、做图片、我无聊做了几部小电影上了热搜赚了点小钱,过去需要花大钱,要么自己花大量时间,现在一句话就能搞定。门槛被拉得极低,谁都能用上。

这一层的关键是好用。AI 在这里是个效率工具、一个随叫随到的助手。普通人几乎不花什么钱,就享受到了红利。

但是有点大家一定要知道:普通人现在用得这么爽、这么便宜,是因为上面有人在替你烧钱补贴。 后面他们希望能加倍赚回来。

第二层:聪明人和年轻人,开启 “一人公司” 时代。这不是忽悠,我身边真真切切有许多这样的例子,只是不方便公开。大家都去做就卷了。脑子活。有特定热爱的的年轻人。

他们看到的不仅是工具,而是杠杆。一个人,配上一整套 AI 工作流,就能干过去一个小团队的活:比如自媒体工作流:选题、脚本、配音、剪辑、分发一条龙。视频流 / 内容笔记流:批量生产,规模化铺量。当然这种批量式的属于短期红利。长期我不是特别看好。

然后就是接中小企业的外包:设计、文案、代码、客服,一个人对接好几家。

再者就是搞培训,课程 AI 生成。营销内容 AI 生成,客服 AI 生成,一个人就是一个培训学校。

“一人公司” 这个概念,本质上是用 AI 把个人的产能放大几倍甚至几十倍。这个趋势是真实的,也确实跑出了一批人。

但这里有个容易被忽略的地方:能靠 “一人公司” 赚到钱的,往往不是因为 AI 多强,而是因为这个人本来就懂业务、懂分发、懂变现,跨领域多面手,AI 只是放大器 —— 你本来是正数,它放大你;你本来是 0,放大出来还是 0。

第三层:中小企业 —— 提效是真的,赚钱不一定。真正在经营、要算账的中小企业。这一层开始,故事就没那么浪漫了。

60 后到 80 后的许多老板,他们的思维模式往往是看到这个好使,招一堆人,“来小张,你来负责一下,把这个项目给做了。”“来今晚喝酒把项目谈下来,明天转包给小李做”

实际关键在于小张小李,可是偏偏 AI 这玩意太新又很系统。大多数人都是一知半解。想提效但是缺少思路,盲目裁员,盲目烧 token,导致吃力不讨好的很多。企业用 AI 代理方式不对是非常烧钱的。很多死板的工作可以用 AI 代替,但是大多数工作是灵活的,AI 能干初稿、干重复劳动,但拍板、把关、对接客户、处理意外,还是得靠真人。所以经常出现人没少,工作变多了,凭空多了一道 AI 成本。短期内是成本叠加,不是成本替换。

我自己用下来体会:最致命的是 Agent(智能体)会几何级地烧钱。 单次问答烧的 token 是有限的。但一旦上” 自动化 Agent”—— 让 AI 自己规划、自己调用工具、自己反复试错,token 消耗是按指数级往上翻的。一个任务背后可能是几十上百次模型调用。

当管理层自己不懂 AI、却沉溺于 AI 宏大叙事,盲目要求公司” 全员上 AI、全流程 Agent 化” 的时候,容易出现亏损。

第四层:中大型公司 / 硅谷大厂:不一定省钱,甚至更费钱。把上面的逻辑放大到中大型公司,问题只会更严重,不会更轻。这部分我是借用 claude 来分析的。这样更客观:让硅谷自己的 AI 来分析自己:

很多人有个错觉:大公司资源多、技术强,用 AI 一定更高效、更省钱。但现实里,硅谷不少公司恰恰是更费钱的那一批:

盘子大,盲目铺开 AI 的试错成本也大。内部流程复杂,Agent 串起来之后烧的算力是天文数字,为了” 不掉队” 而堆 AI,很多是面子工程,ROI 算不过来。

所以”AI = 降本增效” 这句话,在大公司身上经常是反的。它可能是增效,但未必降本;甚至是既没增多少效,又烧掉一大笔钱。

这一层我想说的是:AI 到底省不省钱,跟公司规模没关系,跟” 会不会用、由谁来主导” 关系极大。

第五层:应用层 / 大模型公司 —— 勉强够到盈利线的,没几个:

也就是提供 AI 能力的大模型公司本身。这一层最反直觉。你以为造 AI 的最赚钱?恰恰相反,这是亏损的重灾区。

OpenAI:用户规模全球第一,但 2026 年预计巨亏约 140 亿美元,内部预测要到 2029 年才可能盈利。

Anthropic(Claude):收入增速是全行业最快的,被认为是最接近盈利的纯模型公司 —— 预计 2026 年二季度才迎来首个运营盈利的季度。注意,是即将不是已经。我用的就是这个模型,它自己说自己” 勉强扭亏为盈”。

Google / Meta:它们的 AI 也在亏,但有庞大的广告主业在背后输血,扛得住。

国内的话要好很多,但也有误区,最常见的字节的豆包。很多人以为豆包是赚钱的。实际上豆包是个烧钱的亏损项目,是字节的广告业务在补贴它。只是国内算力成本电力成本低,没烧的像国外那样厉害罢了。

好消息是他家另外一个视频大模型 seedance 2.0 是现金奶牛。那是真实赚钱的。投入小回报大。因为商业场景太丰富了,海外的 sora 因为缺少商业场景倒闭了。

国内其他 ai 像智谱、deepseek 虽然估值很高但都是亏的,赚钱起码几年以后。国内 AI 依靠价格优势,差不多是老美的十分之一吧,抢了大量的中低端市场,搞得巨头们脊背发凉。

这一层简单说就是应用层,在拿真金白银,赌一件事:AI 创造价值的速度,能不能跑赢算力烧钱的速度。 这个赌局,充满未知。

第六层:就是英伟达海力士这些硬件供应商:最上游卖铲子的,才是真正发大财。所以黄仁勋永远说好,ai 永远涨。因为他们是卖铲子的。卖不动拉帮结伙讲故事,再不行就自买自卖,故事真假不重要,重要的是一定要维持下去。

“淘金热” 源源不断,铲子才能不停卖。当然英伟达的供应商们也能分到一杯羹,最典型的三星、sk 海力士,我们国家的光模块和存储芯片那些企业也算。

整条链路,把六层叠在一起,画面就清晰了:

第一层:普通人 “AI 真好用”,享受补贴,几乎不花钱。享受各种效率和便利。
第二层:青年才俊 / 一人公司 “AI 是杠杆”,放大器。
第三层 中小企业能提效,但是用不好 Agent 几何级烧钱。
第四层:中大型 / 硅谷企业 经常更费钱,看谁主导。
第五层:大模型公司,亏损重灾区,Anthropic 勉强回本,其他公司赌未来。
第六层:卖铲子的,赚的盆满钵满,必须一直讲故事,互相炒作,供不应求。

忘了说还有一层,股民。股票我不太懂。没资格说,但是从经历过几次股灾的旁观者角度,我也看好 AI 长期的价值,短期内我也认为有风险。

2026年6月24日星期三

Anthropic 的人才结构到底长什么样


@默庵・超级个体:海外有人做了一件挺有意思的事。他把 LinkedIn 上所有当前雇主写的是 Anthropic 的主页全爬了下来,一共 5306 个人。然后从中筛出了 1680 个真正做工程的,再去翻这些人进 Anthropic 之前的 7986 段过往岗位描述。做这件事的人本身就是搞招聘的,文章写得很有看头。

先说几个让我觉得最反常识的发现。

第一个,招的几乎全是搞 infra 的人,不是我们以为的那种 researcher。第二个,几乎不招初级员工,团队里中位数工作经验 12.2 年,只有 13% 的人有博士学位。第三个,最大的人才来源不是 OpenAI,不是 DeepMind,而是 Google 和 Meta。第四个,如果偶尔出现一个 junior,简历画像是这样的:MIT 出身,IOI 银牌,Codeforces 2900 分往上。干净得让人无话可说。

顺着这几点,我们来看看 Anthropic 的人才结构到底长什么样。

先说规模节奏。Anthropic 几乎是一夜之间把团队搭起来的。现在还在职的工程师里,2021 年之前就进来的只有 15 个人。真正的爆发在 2025 到 2026 年。2025 年一年,工程团队扩了大概三倍,招了 686 个人。2026 年到 6 月的数据,已经招了 455 个,照这个节奏全年也差不多。现在这个团队里,一半人入职还不到一年。过去 12 个月进来的占了 53%,在职时间中位数 10 个月。换句话说,这是一个在大概 18 个月内被疯狂搭起来的巨型团队。

再说资历。这条是我觉得最让人意外的。进 Anthropic 之前,这些人的中位工作经验是 12.2 年。中间半数的人,经验在 8.8 到 16.5 年之间。1680 个人里,工作经验不到三年的只有 50 个;44% 的人干了 13 年以上。应届生基本等于没有。所以一个典型的 Anthropic 新人是这样的:已经工作了 12 年,但进公司才 10 个月。

技能方向上,他们把筹码几乎全押在了工程上。40% 的人背景里出现过 infrastructure。backend、distributed systems、databases、security 这几个方向,各自都在 20% 左右。而 reinforcement learning 这个大家想象中 AI 公司该拼命招的方向,只占了 3.3%。一个典型 Anthropic 工程师在过去十年做的事情,更像是待在 hyperscaler 或者 infra 极重的创业公司里,搭大规模生产系统。

来源上有个很有意思的错觉。大家总觉得 Anthropic 肯定从 OpenAI 和 DeepMind 挖了很多人过来。实际上,它最大的人才管道是 Google,领先幅度还很大。除了 Google,它明显偏好的还有那些以工程严谨出名的地方:Stripe、Databricks、Snowflake、Palantir、Airbnb。

说到底,Anthropic 的用人逻辑非常清晰。他们要的不是满脑子新 idea 的研究员,是一群见过世面、踩过坑、知道怎么把系统真正跑起来的资深工程师。然后用一年半的时间,把这些人攒在一起,组成了一个巨大的工程军团。

2026年6月21日星期日

AI 时代终结勤奋游戏?(外一篇)


@北漂民工的日常:看了胖喵的一篇文章,提到了学历通胀的问题。
大家观察到一个现象,今年高考题目普遍难,让很多勤奋但没有天赋的娃很失望。
过去的教育选拔,很大程度上是对 “勤奋度” 的测试。
中档题占主导,意味着只要你愿意刷题、愿意熬夜、能够扎实掌握教材内容,就能获得一个体面的分数。
这种机制给普通家庭提供了一个明确的预期:努力 = 回报。
但现在的试卷结构正在打破这种预期,拔尖题和创新题的增加,实质上是在进行天赋筛选。
社会的发展可能确实只需要少数天才去突破上限,但教育的残酷在于,它把这种筛选提前到了高考,并且挤压了普通人的生存空间。

那么以后的孩子怎么办?
我觉得两个思路,供大家参考:
第一是学习多元资产配置的策略,多元化发展孩子的特长,在测试中挖掘长处。不要再有做题思维,而是去找自己的比较优势,人生的均衡策略意义不大,再用战术上的勤奋掩盖战略上的懒惰没意思,找到你最长的长板,建立起绝对优势,更重要。
第二是拥抱真实社会,增加实践,了解常识。比如为什么我可以一眼认出来是鸭腿不是鹅腿,因为我有农村生活经验,也会关注超市的菜价变化。再举个例子,绝大部分人不知道鸭子的食谱是杂食偏荤,而鹅是草食动物,这些 “常识” 其实在现实生活中是有用的,是帮助你完善价值观的一部分。多去接触常识,既可以增加批判性思维,也能够锻炼终身学习的能力。

这几年买基金,看基金经理,也发现了,很多事情是需要天赋的,勤奋也重要,但不是勤奋就能拿到结果。

各位家长,各位同学,依靠单一的勤奋刷题和追求一纸文凭,已经无法应对复杂多变的未来。

我们不能再用过去的地图去寻找未来的新大陆。我们需要引导孩子或者自己接受平凡,寻找优势,拥抱真实,在不确定的世界中建立属于自己的确定性。

这或许比多考几分,更加重要。(不作为教育 / 就业依据)

 

==2026年高考,中等生被放弃了==

中等生,被放弃了

@mhyzzp 平平:今年高考数学释放了一个残酷信号:中等生,被放弃了
高考数学考完那天,我刷了刷朋友圈。
几个家里有考生的朋友,发的状态出奇一致 —— 不是骂题难,而是沉默。那种” 不知道该说什么” 的沉默。
后来我在几个家长群和考生群里转了一圈,慢慢拼出了一个让人不太舒服的图景:
试卷结构,变了。
大部分题,简单到你不敢相信 —— 公式一套、计算两步,答案就出来了。少部分题,难到你怀疑人生 —— 根本不知道从哪下手。而中间那个” 你努力一下就能做出来” 的档位,几乎消失了。
刷了一整年《五三》的孩子,出来就哭了。
你问他为什么哭?不是不会做,是会做的太简单,不会做的太难。他花了一整年练的那些” 中等偏上” 的综合题 —— 考试里一道都没出现。
那感觉就像你练了一整年的拳击,结果上台发现比赛改比游泳了。
以前的高考数学不是这样的。
以前的卷子,像爬楼梯。第一层,送分。第二层,动动脑子。第三层,需要点技巧。第四层,拉开差距。第五层,给学霸准备的。
你爬到第几层,分数就在哪个档位。
这个设计的潜台词很明确:你努力了,你就能往上爬。
你刷够一定量的题,总结够一定量的题型,你就能从” 普通” 变成” 不错”。从” 不错” 变成” 优秀”。每一步都看得见,摸得着。
所以过去二十年,高考养活了一大批” 刷题型选手”。
他们可能不是天才,但他们有韧劲。一道题做三遍,一个题型总结五遍,模拟卷一套接一套地刷。他们相信 —— 只要我够努力,我就能拿到我该拿的分数。
这个逻辑,在今年被打破了。
今年的卷子,结构大概是这样分的:
基础题,占了七成左右。课本变体,公式直接套,你认真听了课就能做对。
难题,占了大约两成半。跨章节、跨知识模块,需要你在完全陌生的情境里自己找解题路径。不是你刷过的任何一种题型。
中间档 —— 几乎没了。
看懂了吗?
七成的题,你不需要刷题也能做对。两成半的题,你刷了题也不一定做得对。
你花一年练的那些中等题 —— 考试不考了。
你觉得你在中档题上的积累是你的优势 —— 结果发现,这条赛道上根本没别人,因为这条赛道被直接取消了。
现在比的只有两样东西:
第一,你基础够不够稳。会不会算错?会不会看错题?概念有没有真正理解透?
第二,你脑子够不够灵活。一个你从没见过的题型,你能不能现场想出来怎么解?
这两件事,跟你刷了多少题,真的关系不大。
你刷题再多,基础不稳,简单题照样丢分。你刷题再多,思维僵化,新题型照样做不出来。
刷题能解决的问题,恰恰是考试不想再考的那部分。
这事最残酷的地方在于 —— 谁最受伤?
不是那些本来就不怎么学的。
恰恰是那些最努力的人。
刷题型选手,花了一年时间练中等题,白练了。偏科的理科努力家,数学就是靠勤奋补上来的,现在发现勤奋补不动了。小镇做题家,从小被教育” 只要刷够题就能出头”—— 现在路断了。
他们不是不努力。他们是最相信” 努力就有回报” 这个道理的人。
然后考试委员会直接把这个道理的底层逻辑给抽掉了。
你要是问我,为什么这么改?
我觉得不是出题人疯了。是他们真的在思考一个问题:高考到底要筛什么样的人出来?
以前的社会,需要大量” 中等人才”。懂一点技术,愿意按部就班工作,能当一颗合格的螺丝钉。工厂的熟练工,公司的中层执行者,体制内的办事员 —— 这些岗位撑起了过去二十年的社会运转。
但现在的社会变了。
AI 来了。中等技能的工作,正在被一台台服务器吃掉。会计不需要做账了,初级程序员不需要写 CRUD 了,翻译不需要逐句翻了 —— 这些事情 AI 干得比人好,还不用发工资。
社会现在真正需要的,是两种人:
一种是能做那些 AI 替代不了的基础工作的人 —— 需要面对面服务的,需要真人判断的,需要人情味的。
另一种是能解决复杂问题的人 —— 能设计系统,能整合资源,能在模糊中找到方向的人。
中间那层 ——” 能做中等难度工作的人”—— 正在慢慢消失。
高考的题变没变难,不是重点。重点是,它开始按照新的社会需求来筛人了。
如果你问我,那现在该怎么办?
我只想说两件事。
第一,死磕基础。
听起来很空,做起来很难。基础题容易,不代表你不会错。计算失误、审题不清、概念混淆 —— 这些问题刷题解决不了,你得靠真正理解来克服。
你不需要刷一万道题。你需要把一道题吃透。把它的每个步骤、每个公式的来龙去脉搞明白。
第二,别只做题了。
去看看课本以外的东西。去看数学史、数学思想方法,去做开放性问题 —— 这些东西以前你觉得” 不考”,现在它们就是考试的方向。
从” 做题机器” 变成” 会思考的人”。
这句话以前是喊口号。
现在,考题亲自替你喊了。
今年的高考数学,就一个信号。
你再用过去的方式学习,你可能会被未来甩下。
不是因为你不努力,是因为过去那套” 努力” 的公式,已经过期了。
我知道这很难接受。
但早一天想明白,早一天不亏。
个人观点,仅供参考!