反贼网
번역 준비 중 · 아래는 중국어 원문입니다

【妖妖酱】中国AI追平美国?Kimi K3背后的算力账单,黄仁勋他站哪边?

1층 · 글쓴이 작성자:中美对标 게시일:2026-08-02 01:45 답글:0 조회:15 이 글의 링크:fanzei.net/d_222542

本期视频深入分析了中国AI模型Kimi K3的崛起及其在中美AI竞赛中的意义。视频指出,Kimi K3在部分测试中表现优异,但其成功并非意味着中国AI已全面超越美国。文章剖析了Kimi K3的混合专家架构、长文本处理能力和智能体表现,并探讨了排行榜的局限性、开源模型的真实含义以及运行大型模型所需的巨大算力成本。同时,视频分析了月之暗面、北京、美国媒体、华盛顿政策制定者以及英伟达CEO黄仁勋等各方在Kimi K3事件中的利益诉求和叙事策略,强调了算力、先进芯片制造能力和持续探索能力仍是中美AI差距的关键所在。

视频链接:

完整文本:

哈罗大家好 我是妖妖酱。过去两周,一个来自北京的AI模型Kimi K3突然震动硅谷。美国媒体宣称中国抹去了美国的AI领先,白宫科技顾问警告美国可能输掉AI竞赛。黄仁勋则说中国的开放模型非常优秀,美国企业应当大胆使用。与此同时,中国媒体把Kimi与Deepseek传承了一条故事线:芯片封锁失败了,中国AI即将全面赶超美国。听起来,华盛顿、硅谷和北京似乎得出了同一个结论,但他们真的在描述同一件事儿吗?还是不同利益集团出于自己不同的目的,共同放大了同一种焦虑?今天,我们不靠外国口号,也不靠反向宣传,我们将深入分析Kimi K3的排行榜,所谓的开源低价神话、硬件账单和训练算力,追踪每一种说法背后的利益,回答以下三个问题:Kimi究竟强在哪儿?中国真正受制于什么?一个模型追上美国是否等于中国AI即将全面超越美国?

这轮引发中美双方焦虑的主角叫Kimi K3,研发者是北京的月之暗面。7月16号,Kimi K3正式发布,月沾面公布的数字相当惊人,模型总规模达到2.8万亿,参数每次回答问题会激活其中的大约1040亿参数。它可以同时处理文字和图像,最多容纳100万token,也就是能够一次读非常长的文档和大型代码库。公司随后又公布了模型权重和技术报告,让外部开发者可以下载和部署。真正点燃舆论的是排行榜,在Arena的前端编程测试中,Kimi K3冲到榜首。在若干智能体、软件工程和综合能力测试里,他也进入了全球第一梯队。他的API价格又低于美国最强的商业模型。消息一出,美国科技媒体迅速使用了一个极具冲击力的标题:中国抹去了美国的AI领先。白宫科技顾问戴维萨克斯警告美国,如果不能继续扩大基础设施、能源和技术出口,就有可能输掉AI竞赛。

英伟达CEO黄仁勋说,华尔街在Deepseek出现时误判了一次,现在面对Kimi又误判了。他认为中国的开放模型非常优秀,美国公司当然应该使用。中国媒体更不会放过这个机会了,Deepseek的故事刚刚退潮,Kimi又接了上去。美国封锁先进芯片,中国却用更少的资源做出世界级的模型。美国模型贵封闭,中国模型便宜开放,让这个速度发展下去,全面超越似乎只是时间问题。这里有一个必须先说清楚的事实:Kimi K3既不是骗局,也不是靠宣传堆出来的纸老虎。一个2.8万亿参数的混合专家模型,要在训练通信、长文本和智能体任务上正常工作,需要相当强的算法能力和系统工程能力。Kimi在部分测试中取得领先,也说明中国AI团队已经能够在世界第一梯队竞争了。但承认Kimi很强,与接受中国即将全面超越美国,那是两回事儿。一名中国运动员在几场比赛里战胜了美国选手,可以证明这名运动员达到了世界级水平,但不能自动证明中国已经在体育、科研、训练体系、场馆、商业联赛和所有项目上全面超过美国。

模型排行榜测量的是某个版本的模型在一组规定任务中的表现,他不测量先进芯片的制造能力,不测量全国拥有多少算力,也不测量谁有能力承担下一轮成千上万次的实验。从Kimi赢下了几次测试,跳到中国抹去的领先,中间缺少的正是我们今天要调查的部分。那么要看清这个跳跃是怎么发生的,我们首先要问谁需要这个故事?这个新闻可不是几个人在密室中合谋的结果,更常见也更有力量的情况是,几股力量各自从自己的利益出发,最后合流成了一股诡异的热带风暴。第一股力量来自月之暗面和北京。月之暗面是一家需要资本、人才、客户和开发者的商业公司,训练Kimi K3这样的模型要投入巨额的资金,公司必须证明自己不是Deepseek之后的又一个跟随者,而是能够建立全球技术生态的领跑者。排行榜越高,媒体越震惊,国际开发者下载的越多,它在融资和市场竞争中就越有竞争力。

对中共来说,拼命还有另一层价值。美国从2022年开始不断限制先进AI芯片、半导体设备和高带宽内存流向中国,北京最需要证明的不只是中国公司做出了好的产品,而是美国封锁失败了。只要一个中国模型接近美国前沿,北京就可以把企业的技术成绩改写成制度胜利。西方围堵得越,中国创新越强,美国模型封闭且贵,中国则把技术免费送给世界。因此,月之暗面需要一个商业成功的故事,而北京则需要一个国家崛起的故事。两者并不完全相同,却在放大Kimi K3的意义上高度一致。第二股力量来自美国媒体。Kimi K3在一些公开测试中达到领先水平,但不同测试存在方法差异,这是准确的标题,却很少有人会变态。中国抹去了美国的AI领先,这样的一个标题才像是一个历史转折吗?媒体喜欢把复杂的技术竞争翻译成赛马,谁第一,谁第二,差几时,何时反超排行榜呢?

又恰好提供了看似客观的数据。但数字一旦离开了测试条件,就很容易被滥用。模型公司可以选择最有利的项目,测试框架会影响成绩,允许使用多少推理时间也会改变结果。更重要的是,榜单比较的是已经公开的产品,而不是两个国家的全部能力。为了检验,这不是我们的偏见,我对过去1年纽约时报、经济学人、还有BBC以及彭博社做了同口径的抽样调查,逐月检索中国经济与科技报道,每家媒体每月最多随机抽取十条,共编码374个标题,只判断标题,把中国描写成能力上升、问题恶化还是中性,又或者是正反面相结合。结果其实并不是西方媒体都在吹。中国在213个经济标题中,负面的有八十八条,正面的是二十八条,批判性报道的超过是正面报道三倍之多。真正反常的其实是AI和高科技方面的报道,在127个标题中,正面能力叙事的是四十条,负面的只有二十五条。

差异又高度集中在彭博社对中美AI和高科技正负面报道之比是十八比九,经济学人呢?是十二比四,BBC是七比八,纽约时报是三比四。换句话说,这股中国科技即将取代美国的风潮,不是四家媒体整齐划一的制造,而是商业、财经媒体和经济学人放得更大。在被社交媒体剪掉问号和前提,变成了全网的焦虑情绪。第三股力量呢,则是来自华盛顿。美国的政策派别彼此争论是非常激烈的,但中国逼近这个论调几乎对所有的派别都有用。主张放松监管的人可以说不能再用繁琐的规则束缚美国公司了,而主张扩建能源和数据中心的人可以说中国可不会等待美国的审批程序。主张产业补贴的人可以要求政府投入更多的资金,而主张加强管制的人则可以要求进一步的封锁芯片和模型。他们提出的政策未必是错误的,中国的挑战确实存在,但必须看见其中的激励措施,也就是如果把中国的威胁说得越迫切、越紧急,那么这些政策主张就越容易获得预算和支持。

于是,中国有一个很强的模型,这样的说法自然就会被升级成美国可能会失去未来。第四股力量则是来自黄仁勋和他的英伟达。黄仁勋一方面不断强调中国工程师很优秀,中国只落后美国很短的时间,另一方面又反对把中国排除在美国的技术生态之外。他的理由是,如果美国不向世界提供芯片和平台,中国就会建立自己的替代体系,最终让CUDA和美国的技术失去全球影响力。这个判断有战略道理,但也与应伟达的商业利益完全重合。英伟达卖的不是聊天机器人,而是运行聊天机器人的计算机。世界越相信AI的竞争激烈,各国要建设数据中心,开放模型越流行,越多企业会购买自己的GPU。中国越显得接近美国,解除对华芯片限制就显得越紧迫。所以,眼前的这场浪潮不是简单的中国宣传欺骗了美国,事实更有意思:北京需要一次突破封锁的胜利,月之暗面需要全球升降,美国媒体需要戏剧性,华盛顿需要危机动员,英伟达需要不断增长的计算需求。

不同的人说着相似的话,却在追求完全不同的目标。理解了这点,我们才能回到技术本身。那么,这个Kimi究竟赢了什么?他又没有赢什么?我们先来看看Kimi真正值得重视的地方。传统大模型像一家公司,每处理一个问题,几乎所有的员工都要同时开会。模型越大,这种做法越贵。Kimi K3采用的是混合专家架构,可以把它想象成一家拥有很多专业部门的公司,法律问题交给法律组,编程问题交给工程组,图像问题还有另一组专家。所以整个模型有两2.8万亿的参数,但每次激活呢?只大约1040亿。这并不代表其余的参数都毫无用处,恰恰相反,庞大的专家库提供了容量,而选择性激活则降低了每次计算的负担。要把这么多的专家分配到不同的芯片上,又让他们迅速地交换信息,是一项困难的系统工程。Kimi的第二个亮点是上下文,100万Token可不是简单的把一本书塞进聊天窗口,而是要求模型在几场材料中找到有关信息,保持任务目标,并与外部工具协作。

这对分析代码库、法律文件和研究资料很有吸引力。第三个亮点是智能体的能力。今天最受关注的AI已经不只是回答问题了,而是接受一个目标,自己阅读文件、调用工具、编写代码,测试结果,再根据错误继续修改。Kimi已在前端编程和部分智能体的测试中取得了好成绩,说明他在把事情做完这条赛道上有着真实的竞争力。但排行榜的局限也从这里开始。第一,排行榜测量的是选定任务异常。前端的编程测试可以告诉我们模型能否按照要求制作网页页面,却不能告诉我们他在科学推理、网络安全、生物研究、机器人控制和军事规划中同样领先。就像一辆车在城市道路可以油耗最低,但不能证明它在赛道、雪地或者重载运输中也能表现最好。第二,榜单上的成绩不只来自模型。KimiK3测试中搭配的是Kimi code,OpenAI搭配的是Codex,Anthropic模型搭配的是Claude Code。

这些工具会决定模型能够读取哪些文件,如何搜索,什么时候执行,代码失败后又如何重视。最后的分数是底层模型、软件框架、提示词、计算、预算,还有安全规则共同产生的结果。美国模型有的时候会因为网络安全或危险任务而拒绝回答,拒绝就有可能让它在某些能力测试中丢分,却不一定说明它不会。反过来,一个几乎从来不拒绝的模型可能分数更高,也可能会带来更大的风险。不同的测试,如果不把这些条件统一起来,排名就很难被解释成纯粹的智力差距。第三,模型公司公布的测试天然是具有选择性的。这不是中国公司独有的问题,美国公司发布新模型时,同样会挑选表现最好的指标。真正可靠的判断必须观察多个独立测试、真实的用户体验,和一段时间后的稳定表现,而不只是看发布会的一张表。第四,公开产品不等于国家的全部技术储备。我们不知道OpenAI、Google和月之暗面实验室内部尚未发布的模型究竟达到什么程度,所以不能靠想象宣称美国一定藏着什么更强的东西。

但同样不能拿公开榜单宣布中国已经消灭美国的所有领先。我们能够比较的只是某一天摆到柜台上的商品。因此,Kimi的成绩能够支持三个结论:中国拥有世界级的AI人才,中国团队掌握了训练超大型混合专家模型的能力,中国模型已经可以在若干重要任务上与美国公开产品正面竞争。但它不能支持另外三个结论:中国已经掌握全球最强的先进芯片,中国拥有与美国相当的总算力,中国已经取得下一代AAA研究的全面主导权。这正是这场舆论操作最关键的偷换,它把产品层的接近包装成整个体系的超越。而这种偷换之所以容易成功,还因为一个极有吸引力的词:开源。Kimi和Deepseek经常被称为开源模型,这个叫法已经深入,新闻标题却并不准确。普通软件的源代码就像一套完整的食谱,你可以看到每一个步骤,知道加入了哪些原料,怎样加工,也可以按照自己的需要修改,然后重新制作。

AI模型不同,训练开始时,系统里有数千亿甚至数万亿个尚未形成能力的参数,它阅读大量数据,通过一次又一次计算调整这些参数,最后得到的数字集合就是模型权重。权重更像是一个已经做好的蛋糕,你可以把蛋糕带回家,切开装饰,甚至在它的基础上做出新的产品。但仅仅拿到蛋糕并不等于你知道面粉从哪儿来,厨房用了什么设备,失败过多少次,也不等于你能够重建同样的生产线。Kimi K3确实公开了非常有价值的东西:模型权重、技术报告、架构说明和部分的运行工具。开发者可以下载权重,在许可范围内进行修改、量化和部署。这比只能通过公司API调用的封闭模型当然要开放得多。但月之暗面没有公开足以完整重建Kimi的训练数据、全部数据处理流程,以及每次实验的记录和完整的训练流水线。外界可以研究它做出来的模型,却无法从头复制月之暗面怎样做出这个模型。

Deepseek可也是类似的情况,他公开了权重论文和一部分推理代码,在工程透明度上值得肯定,但他也没有把全部的训练数据和完整生产过程交给世界。所以更准确的名称其实是开放权重模型。这不是文字游戏。开放权重带来三种真正重要的自由:第一,数据可以留在本地,医院、银行、政府和企业不必把敏感的资料发送到外国公司的服务器上。第二,开发者可以调整模型,它还可以被微调成法律助手、编程工具,或者是本地的语言模型,也可以改变内容限制。第三,一个国家不必永远依赖某一家美国公司的API,即使商业关系或国际政治发生变化,只要已经取得了权重,理论上仍然还能够继续运行。但开放权重并没有提供另外三样东西:它没有让外界知道全部的训练材料,因此很难彻底审计模型是否使用了受版权保护内容,或者是否大量吸收了其他模型的输出,也就是大家天天说的模型蒸馏。

它没有公开完整的训练过程,因此第三方无法判断哪些技术来自原创,哪些来自反复的试错。最重要的是,它没有把训练同等级模型所需的芯片、数据中心和资金一同送给下载者。开放权重使中国可以把模型的使用权迅速传播到全球,却不会让其他国家自动获得中国的研发能力。这也是北京喜欢这种战略的原因,它能建立依赖中国模型的开发者生态,扩大技术影响力,同时保留最有价值的训练秘密。但这套战略还有一个经常被忽略的受益者,因为模型文件虽然可以免费下载,但让它真正运转起来的机器却一点儿也不便宜。

让Kimi真正运转起来的机器到底有多贵呢?我们来算笔账。Kimi K3有2.8万亿个参数,可以把参数理解成为模型训练后留下来的经验记录。即使经过高度压缩,每项记录只占半个字节,整个模型也需要大约1.4TB的空间,相当于将近300部的高清电影。但文件能够存进硬盘,不等于模型能够正常工作。硬盘就像地下仓库,容量大,价格……

让Kimi真正运转起来的机器到底有多贵呢?我们来算笔账。Kimi K3有2.8万亿个参数,可以把参数理解成为模型训练后留下来的经验记录。即使经过高度压缩,每项记录只占半个字节,整个模型也需要大约1.4TB的空间,相当于将近300部的高清电影。但文件能够存进硬盘,不等于模型能够正常工作。硬盘就像地下仓库,容量大,价格便宜,搬东西却比较慢。显卡上的高速内存则像厨师手边的操作台,空间贵,但模型马上要用的材料必须放在那儿。如果模型的大部分内容留在硬盘里,每生成几个字都要停下来搬运一次,它虽然能够启动,却会慢到失去实用价值。何况模型还要记住正在进行的谈话,你上传的文件越长,同时交给他的任务越多,他需要的高速内存就越大。Kimi号称可以处理100万token。然而,如果真的要发挥这种能力,硬件压力还会继续上升。

有人会问,拼命每次回答问题只激活大约1041个参数,为什么还要装下整个2.8万亿的参数呢?我们可以把它想象成啊一家拥有几百个专业部门的公司,解决一个问题时,真正工作的可能只有十几个部门。但在问题出现以前,系统并不知道这次需要编程不?图像不?还是数学不?因此,所有部门的资料都必须放在能够迅速跳动的位置上。这就是为什么成功启动模型,和像GPT一样顺畅使用是两回事。网上有人用普通电脑运行过DPC,甚至是TIME。技术上可能是真的,办法通常是进一步的压缩模型,或者把部分内容放在硬盘里慢慢搬运。最后,模型确实说话了,但速度较慢,能够处理的材料更短,也无法与商业网站的使用体验相媲美。而且,个人电脑上运行的很多并不是新闻中那个完整的6711参数的旗舰模型,而是从大模型中提炼出来的较小版本。这就像汽车公司把某几项赛车技术用在了家用车上,家用车确实获得了部分赛车性能,却不等于你用家用车的价格买了一台专业赛车呀。

如果要正常运行完整的模型,硬件账单会完全不同。因为打展示的完整的DPC和高性能方案,是一台装有八张约200高端显卡的服务器。DPC早期公布的另外一套方案,则使用了两台机器总计十六张的高端显卡。仅显卡和服务器就可能要花费数百万元。再加上高速网络存储、供电散热,300万人民币并不夸张。Kimi快三的整体规模比DPC的旗舰版更大。他虽然通过每次只调用部分参数来节省计算,但如果想在本地达到GBT的回答速度,实际投入很可能更高。因此,我们把300万当成一个非常保守的起点。现在把这笔钱换算成普通人熟悉的订阅费。ChenGPTPlus和ClaudePro目前都是每月$20的订阅费。按照$1兑换6.76人民币的计算,每月大约是¥135。¥300万够一个人订阅多少年呢?1800多年。300万只是买机器的起步价,以后呢?

还要继续支付电费和维修费用。所以对普通人来说,为了获得类似GPT或者是快乐的的日常体验,花300万把完整的Timmy搬回家是一个亏本的买卖。当然,也不是每个人都能拿出这300万。这就像有人免费送给你一家大型客机的设计图图纸,确实是不要钱,但你不能坐在图纸上飞行啊。你还要购买发动机,还要制造机身,租用机库,还要负责维修。订阅GPT或者是CLUB的,则像是购买了机票。你不需要拥有飞机,却只需要支付一张机票的钱,就能够使用航空公司已经建好的整套系统。所谓的开源开放权重,提供的是自己制造飞机的权利,不是免费送给你一架能够立即起飞的飞机。所以中国把世界级A三免费送给所有人,只说对了一半。免费的是模型文件,不是运行模型的计算能力。可以下载的是训练成果,不能下载的是显卡、机房和电力。但是只要政府、银行和大型机构为了数据安全,决定把模型搬回自己的机房,他们就必须购买更多的显卡和服务器。

于是,一个看似矛盾的结果出现了:中国公司把模型免费开放,全球需要购买的计算设备反而可能更多。跃至暗面免费送出的是模型权重,英伟达出售的则是让这些权重真正运转起来的机器。现在我们再回头看华人为什么如此热衷,就比较容易理解了。拼命发布之后,部分投资者担心因伟达会受到冲击。如果中国公司用较少资源做出便宜模型,是不是意味着未来不再需要那么多贵的支配?Deepak出现的时候,市场就已经产生过同样的恐慌。然而,仁兄的回答却是:你们把因果关系搞反了。一件商品的使用成本下降,总需求有时候不会减少,反而会增加。照明就是一个经典的例子。灯泡越来越节能,并没有让人减少照明的使用,因为使用成本下降之后,城市道路、商店、家庭反而安装了更多的灯。AP也可能如此,一次推理便宜了十倍,企业不会满足于节省为原来的账单,而是会把API装进更多的服务里,比如说客服、编程、设计、医疗、汽车、机器人。

最后使用的总计算能量可能更大。对OpenAIPack和挚爱面来说,模型通常是产品。对英伟达来说,模型首先是耸立的需求。闭源API把计算集中在少数的云端巨头,开放权重则把部署冲动扩散到了每一个希望掌握自己数据的组织。政府要主权,爱爱?银行要本地服务器,医院不愿上传病人的病历,军方更不会把文件交给外国公司。每一个这样的决定都可能转化成一批GPU、网络设备和企业软件的订单呢?拼命尤其符合英伟达的利益。他有2.8万亿参数和100万偷看上下文强调编程与智能体服务。模型权重虽然免费,但它越受欢迎,全球用于运行他的高端硬件就可能越多。因为达2026财年的数据中心收入同比增长68%,公司的利润核心已经不是游戏显卡,而是计算平台。他不仅出售GPU,还出售高速互联服务器系统和软件生态。华人主张开放模型,当然有技术理念,但也等于主张一个由更多模型、更多数据中心和更多耸立消费组成的世界。

他主张继续向中国销售美国芯片,也有同样的双重逻辑。战略上,他认为,如果中国开发者继续使用哭喊和英伟达平台,美国技术就能保持全球标准。如果美国彻底退出,中国会被迫扶植华为等替代者。商业上,中国原本就是一个可能价值数百亿美元的市场。解除限制技能,维护美国生态也能为英伟达恢复收入。因此,人们强调中国只落后一点,中国模型非常优秀,不能被当成一个中立的技术商家所给出的终审判决。他观察的比多数人确实是深入,但他也有清晰的利益方向。这不等于说他说的话都是假的。开放权重确实可以降低软件垄断,保护本地数据,推动研究和竞争。中国工程师也确实优秀。问题不在于华人学说了假话,而在于他反复强调的那部分真相,恰好通向英伟达最希望出来的未来。OpenAI希望全世界继续购买他的智能,而英伟达则希望每一个想拥有智能的人都购买一座计算工厂。

当我们看清这一点,因为达西也承认中国即将超越,就不再是一条决定性的证据了。它只说明中国模型已经强大到足以制造全球计算需求,而这正是因为达的生意。不过,支持中国超越论的人,还有一张更有力的牌。Time的API价格低于美国的领先模型。DPC可更曾经以低价震动市场,这是中国API的真实竞争优势。但偏移这个词里至少藏着四笔不同的账。第一笔是用户看到的API价格,也就是生成一定数量文字要付多少钱。第二笔是模型每运行一次的直接成本,包括GPU、电力和服务器折旧。第三笔是把一个模型训练出来的成本。第四比是找到正确的技术路线。之前所有的失败实验、人才、数据和基础设施的总成本。发布会上最容易宣传的第一笔,有时会公布第三笔。但真正决定一家实验室能够持续创新的往往是第四名。一家新的餐厅为了抢顾客,可以把百元成本的菜暂时卖六十块,也可以由投资人补贴,还可能只在最优势的菜品上低价菜单。

价格是真实的,顾客确实是少数了钱,但它不能证明厨房真的只花了六十人中国爱国公司采用低价有多种可能同时存在。混合专家架构降低了每次的运算量,量化减少了内存压力,工程优化提高了效率。中国市场竞争激烈,公司愿意接受更低的利润,投资人可能补贴价格,企业也可能利用低价争夺开发者,建立生态之后再寻找收入。所以拼命便宜可以证明它有产品竞争力,却不能单独证明其全部成本都低于美国。第四块的低成本故事也经历过类似误读。公司曾公布V三正式训练阶段使用约20078:008万和800只啤酒小时。媒体把这一阶段折算成数百万美元,然后写成了DPC只花了几百万美元就复制了OpenAI。但这个数字并不是一个公司的全部投入。它不包括早期研究、失败实验、数据准备、既有的服务器采购、人员成本,也不能代表从零建立前沿实验室所需要的代价。

它真正证明的是,DPC可以很高的工程效率完成了一次重要训练,而不是前沿API可以脱离大规模的力。Time同样如此。2.8万亿参数、常上下文和大规模的强化学习不可能凭空产生。技术进步可以提高每张支配的产出,却不会让训练机器消失。这里还有个更敏感的问题:蒸馏。所谓的蒸馏,就是让一个模型学习另一个强模型的输出。可以把它想象成学生反复阅读名师解题示范,在训练出自己的解题习惯。行业普遍使用蒸馏,它本身并不是一种邪术。争议在于学生是否违反了服务条款,大规模地获取答案,是否复制了受保护的成果,以及发布时是否隐瞒来源。美国政府已经指控越战暗线可能利用了可模型输出训练梯米,并调查其中是否涉及违规。目前,公开材料还不足以把这项指控写成定案,但它揭示了追赶者的一种优势。开路者支付了探索无人区的成本,后来者则可以沿着论文、模型输出和公开工具更快跟进。

这种能力当然也值得尊重,却与独立推进全部技术前沿不是同一个概念。一个学生可以用较少时间掌握老师花费10年建立的知识体系,这证明学生聪明,也证明知识传播的有效。但它不能证明老师最初的10年探索已经不需要了。因此,算法效率与算力并不是二选一。更好的算法让每次实验更有价值,更多萨利让实验室可以同时尝试更多方向。中国擅长用较少资源追赶,美国则仍有能力支付更多的探索失败。要判断这项差距是否真实存在,最值得听的不是公开舞台上的胜利宣言,而是中国前沿实验室自己怎么描述这个平静的。2026年5月,据称DPC的创始人闻风与潜在投资人进行了一场近四个小时的闭门交流。会议记录后来流出,DPC可没有正式确认其真实性。但其中对技术和经营细节的讨论那是相当具体。在公开舆论里,DPC经常被用来证明算力不再重要,而这份记录传达的却是相反信息。

按照记录中的说法,DPC可与美国最前沿水平大约相差2年,希望能把差距缩短到半年至1年。公司的算力规模大约只有美国头部实验室的20分之1。真正的瓶颈不是中国没有优秀人才,而是研究人员缺少足够的计算资源去验证自己的想法。那么,为什么算力会限制创新呢?因为训练前沿模型不是照着一张成熟图纸生产。研究人员可能有十种新架构、二十种数据方案、几十套的训练参数。大多数尝试不会成功。有充足算力的实验室就可以同时进行实验,迅速淘汰失败路线,再把资源投入到最有希望的方向。耸立不足的团队则必须更谨慎地选择,甚至因为承担不起一次失败而放弃高风险方案。这就像药物研发,科学家的聪明程度当然重要,但如果一家企业只能进行十次实验,而另一家企业可以进行200次实验,后者发现有效药物的概率就会更高。梁文峰面对投资人也有理由强调资金和算力需求,但正因为投资人最终要决定是否掏钱,他不能只重复中国已经全面领先的宣传。

投资人关心的是下一步还缺什么,企业为什么需要这么多的钱。这份记录最有价值的地方不是2年这个数字,A一发展太快,任何固定时间差都可能在一次模型发布后改变。真正重要的是,文峰承认了一种结构工程效率能够缓解算力短缺,却不能取消算力。国产芯片能够承担部分任务,却还没有完全替代英伟达在前沿训练中的位置。这也解释了为什么Time三的成功不能证明美国芯片管制已经失效。管制从来不可能让中国突然停止训练模型。中国在限制实施前就已经拥有大量的因为达支配了,还可以通过第三国云端和灰色渠道获取部分设备。中国团队也会用软件优化提高旧的芯片的效率。管制真正要做的是让中国获得下一代的芯片更困难,建设超大集群更昂贵,并减少它可以同时进行的前沿实验的数量。中国仍然做出机敏说明管制不是一张密不透风的墙,但它不说明墙完全不存在。

如果连IPSec的创始人的内部判断都已经把算力视为主要约束的话,那么把一次模型发布解释成为中国已经绕过了芯片差距,就不是技术判断,而是政治宣传了。接下来要看的就是这项约束究竟有多大。根据Apple II对于公开集群的统计,截至2025年5月,美国大约占全球GPS集群计算能力的4分之3,中国约占15%。由于很多企业和军事设施不公开,这不可能是一张完整的地图,但它揭示的数量级差距与两国数据中心和芯片供应情况基本一致。美国的优势不是只是一家公司或者一款芯片,它拥有OpeningPack、GoogleMeta、西医等多家相互竞争的前沿实验室,拥有微软、亚马逊和谷歌的大型云平台,拥有英伟达和AMD的芯片设计能力,还有大和高速的互联生态。中国当然也有自己的优势:工程师数量庞大,国内竞争激烈,制造业场景丰富,政府能够集中投入,企业运用较低的价格争夺市场。

华为芯片和国产软件生态也都在进步。但国产替代不是一句口号,而是要同时解决先进制度、良率、高带宽内存封装、芯片建通信软件兼容和大规模的集群稳定性。某一张芯片在纸面算力上接近,不等于几万张芯片连在一起也能达到相同效率。前沿AR越来越像一项国家级的工业工程,芯片只是发动机,数据中心是辆汽车,还需要电力、冷却、网络软件和能够长期维护系统的人。这就是为什么公开模型能力差距可以很小,国家专利差距却仍然很大。追赶者可以集中资源训练一款明星模型,在公开测试上与领先者并跑。领先者则可以同时训练语言、视频、机器人、科学、生物和国防模型,并让多家公司探索不同路线。前者可以赢得一场重要的比赛,后者则拥有举办多场比赛的能力。当然,美国也并非高枕无忧。中国已经证明它可以迅速吸收公开研究,把有限硬件使用得更有效率,并通过开放权重争夺全球开发者。

如果美国把领先浪费在内部监管混乱、能源建设迟缓和对盟友的技术封锁上,结构性优势当然可能会缩小。但可能失去领先与即将全面被超越并不是一句话。截至今天,Kimi证明中国具备前沿产品能力,Deepak证明中国具备出色的算法与系统优化能力,千万等模型证明中国的开放权重生态已经形成规模。它们共同构成严肃挑战,却没有证明中国已经拥有与美国相当的前沿算力、先进芯片供应链和多路线的探索能力。现在我们可以做出最后裁决了。中国II到底落后美国多久?如果一定要把答案压缩成一个数字的话,这个节目反而会重复它正在批评的错误。在公开语言模型和编程能力上,中国不是落后几年。Timmy和千万已经进入世界第一梯队,部分任务可以并跑,甚至是短暂领先。整体的产品差距很可能以月计算。在价格、工程效率和开放权重传播上,中国不仅是追赶者,在一些方面已经取得了主动。

美国公司如果继续只提供贵的封闭模型,确实可能会把大量全球开发者让给中国。但在总算里,先进的GPU、大型集群、半导体制造设备和同时探索多条前沿线路的能力上,美国仍有明显的结构性优势。这不是一张排行榜可以抹掉的差距,也不是把模型文件上传到网上就能填平的差距。所以,拼命快三证明的不是中国已经全面超过美国,而是中国已经能够用有限耸立开放权重和激烈竞争把某些A三产品推进世界第一梯队。这值得美国警惕,却不值得恐慌。一张排行榜测量的是今天公开的一场比赛,国家依然实力决定的是谁有能力不断地举办下一场比赛,承担更多失败,制造更先进的芯片,并探索尚不存在的技术路线。中国已经学会用较少的筹码打出一手好牌,但美国仍然拥有更多筹码、更大牌桌,也仍然控制着制造大部分高端筹码的机器。中国也还很强,是真的,美国不能自满也是真的。

但从这两句话跳到中国即将全面超越美国,不是技术分析,而是把北京的宣传、硅谷的利益和媒体的焦虑包装成了一个并不存在的必然结局。我们的立场很清楚:不能因为反对中共就低估中国的工程师,也不能因为梯米赢了几场比赛就替中共宣布一场尚未发生的全面胜利。真正能够解除焦虑的,不是另外一套自我安慰的宣传,而是看清现实。美国的领先正在受到挑战,却远没有被抹去。中国已经追到产品前线,却仍没有控制决定下一代AR的整条工业底座。模型可以下载,算力不能下载。排行榜可以追平,制造排行榜背后的那座机器的能力仍然没有追平。这才是Kimi快三浪潮背后的真相。好,今天我们就聊到。如果这些节目对你有价值,请点赞,打开小铃铛,转发,也欢迎订阅本频道。有条件的朋友们可以加入会员支持我们这个小频道的发展。我是来自考中逻辑的妖精,我们下期再见!

주요 사건 연표 · 엄선한 관련 항목
2026년 5월
据称DPC创始人闻风与投资人闭门交流,透露公司算力规模为美国头部实验室的20%
一份流出的会议记录显示,DPC创始人承认公司算力规模仅为美国头部实验室的20%,并认为算力是限制创新的主要瓶颈,但可以通过工程效率缓解。
2026년 7월 16일
北京月之暗面发布Kimi K3模型
北京月之暗面公司发布了Kimi K3模型,模型总规模达2.8万亿参数,可处理100万token,并在Arena等测试中取得领先。
2022년
美国开始限制先进AI芯片、半导体设备和高带宽内存流向中国
美国自2022年起逐步实施对中国在先进AI芯片、半导体设备和高带宽内存等方面的出口限制。
2026년 8월 2일
视频发布,分析Kimi K3与中美AI差距
视频发布,深入分析Kimi K3模型及其在中美AI竞赛中的意义,探讨算力、技术和各方利益。
관련 토픽 미중 관계 과학기술 냉전 엔비디아 AI模型 算力
전체 답글 (0)

아직 답글이 없습니다. 첫 의견을 남겨 주세요

답글 쓰기