反賊網

【妖妖醬】中國AI追平美國?Kimi K3背後的算力賬單,黃仁勳他站哪邊?

1樓 · 樓主 作者:中美對標 釋出於:2026-08-02 01:45 回覆:0 瀏覽:14 本文連結:fanzei.net/d_222542

本期影片深入分析了中國AI模型Kimi K3的崛起及其在中美AI競賽中的意義。影片指出,Kimi K3在部分測試中表現優異,但其成功並非意味著中國AI已全面超越美國。文章剖析了Kimi K3的混合專家架構、長文字處理能力和智慧體表現,並探討了排行榜的侷限性、開源模型的真實含義以及執行大型模型所需的巨大算力成本。同時,影片分析了月之暗面、北京、美國媒體、華盛頓政策制定者以及英偉達CEO黃仁勳等各方在Kimi K3事件中的利益訴求和敘事策略,強調了算力、先進晶片製造能力和持續探索能力仍是中美AI差距的關鍵所在。

影片連結:

完整文字:

哈羅大家好 我是妖妖醬。過去兩週,一個來自北京的AI模型Kimi K3突然震動矽谷。美國媒體宣稱中國抹去了美國的AI領先,白宮科技顧問警告美國可能輸掉AI競賽。黃仁勳則說中國的開放模型非常優秀,美國企業應當大膽使用。與此同時,中國媒體把Kimi與Deepseek傳承了一條故事線:晶片封鎖失敗了,中國AI即將全面趕超美國。聽起來,華盛頓、矽谷和北京似乎得出了同一個結論,但他們真的在描述同一件事兒嗎?還是不同利益集團出於自己不同的目的,共同放大了同一種焦慮?今天,我們不靠外國口號,也不靠反向宣傳,我們將深入分析Kimi K3的排行榜,所謂的開源低價神話、硬體賬單和訓練算力,追蹤每一種說法背後的利益,回答以下三個問題:Kimi究竟強在哪兒?中國真正受制於什麼?一個模型追上美國是否等於中國AI即將全面超越美國?

這輪引發中美雙方焦慮的主角叫Kimi K3,研發者是北京的月之暗面。7月16號,Kimi K3正式釋出,月沾面公佈的數字相當驚人,模型總規模達到2.8萬億,引數每次回答問題會啟用其中的大約1040億引數。它可以同時處理文字和影象,最多容納100萬token,也就是能夠一次讀非常長的文件和大型程式碼庫。公司隨後又公佈了模型權重和技術報告,讓外部開發者可以下載和部署。真正點燃輿論的是排行榜,在Arena的前端程式設計測試中,Kimi K3衝到榜首。在若干智慧體、軟體工程和綜合能力測試裡,他也進入了全球第一梯隊。他的API價格又低於美國最強的商業模型。訊息一出,美國科技媒體迅速使用了一個極具衝擊力的標題:中國抹去了美國的AI領先。白宮科技顧問戴維薩克斯警告美國,如果不能繼續擴大基礎設施、能源和技術出口,就有可能輸掉AI競賽。

英偉達CEO黃仁勳說,華爾街在Deepseek出現時誤判了一次,現在面對Kimi又誤判了。他認為中國的開放模型非常優秀,美國公司當然應該使用。中國媒體更不會放過這個機會了,Deepseek的故事剛剛退潮,Kimi又接了上去。美國封鎖先進晶片,中國卻用更少的資源做出世界級的模型。美國模型貴封閉,中國模型便宜開放,讓這個速度發展下去,全面超越似乎只是時間問題。這裡有一個必須先說清楚的事實:Kimi K3既不是騙局,也不是靠宣傳堆出來的紙老虎。一個2.8萬億引數的混合專家模型,要在訓練通訊、長文字和智慧體任務上正常工作,需要相當強的演算法能力和系統工程能力。Kimi在部分測試中取得領先,也說明中國AI團隊已經能夠在世界第一梯隊競爭了。但承認Kimi很強,與接受中國即將全面超越美國,那是兩回事兒。一名中國運動員在幾場比賽裡戰勝了美國選手,可以證明這名運動員達到了世界級水平,但不能自動證明中國已經在體育、科研、訓練體系、場館、商業聯賽和所有專案上全面超過美國。

模型排行榜測量的是某個版本的模型在一組規定任務中的表現,他不測量先進晶片的製造能力,不測量全國擁有多少算力,也不測量誰有能力承擔下一輪成千上萬次的實驗。從Kimi贏下了幾次測試,跳到中國抹去的領先,中間缺少的正是我們今天要調查的部分。那麼要看清這個跳躍是怎麼發生的,我們首先要問誰需要這個故事?這個新聞可不是幾個人在密室中合謀的結果,更常見也更有力量的情況是,幾股力量各自從自己的利益出發,最後合流成了一股詭異的熱帶風暴。第一股力量來自月之暗面和北京。月之暗面是一家需要資本、人才、客戶和開發者的商業公司,訓練Kimi K3這樣的模型要投入鉅額的資金,公司必須證明自己不是Deepseek之後的又一個跟隨者,而是能夠建立全球技術生態的領跑者。排行榜越高,媒體越震驚,國際開發者下載的越多,它在融資和市場競爭中就越有競爭力。

對中共來說,拼命還有另一層價值。美國從2022年開始不斷限制先進AI晶片、半導體裝置和高頻寬記憶體流向中國,北京最需要證明的不只是中國公司做出了好的產品,而是美國封鎖失敗了。只要一箇中國模型接近美國前沿,北京就可以把企業的技術成績改寫成制度勝利。西方圍堵得越,中國創新越強,美國模型封閉且貴,中國則把技術免費送給世界。因此,月之暗面需要一個商業成功的故事,而北京則需要一個國家崛起的故事。兩者並不完全相同,卻在放大Kimi K3的意義上高度一致。第二股力量來自美國媒體。Kimi K3在一些公開測試中達到領先水平,但不同測試存在方法差異,這是準確的標題,卻很少有人會變態。中國抹去了美國的AI領先,這樣的一個標題才像是一個歷史轉折嗎?媒體喜歡把複雜的技術競爭翻譯成賽馬,誰第一,誰第二,差幾時,何時反超排行榜呢?

又恰好提供了看似客觀的資料。但數字一旦離開了測試條件,就很容易被濫用。模型公司可以選擇最有利的專案,測試框架會影響成績,允許使用多少推理時間也會改變結果。更重要的是,榜單比較的是已經公開的產品,而不是兩個國家的全部能力。為了檢驗,這不是我們的偏見,我對過去1年紐約時報、經濟學人、還有BBC以及彭博社做了同口徑的抽樣調查,逐月檢索中國經濟與科技報道,每家媒體每月最多隨機抽取十條,共編碼374個標題,只判斷標題,把中國描寫成能力上升、問題惡化還是中性,又或者是正反面相結合。結果其實並不是西方媒體都在吹。中國在213個經濟標題中,負面的有八十八條,正面的是二十八條,批判性報道的超過是正面報道三倍之多。真正反常的其實是AI和高科技方面的報道,在127個標題中,正面能力敘事的是四十條,負面的只有二十五條。

差異又高度集中在彭博社對中美AI和高科技正負面報道之比是十八比九,經濟學人呢?是十二比四,BBC是七比八,紐約時報是三比四。換句話說,這股中國科技即將取代美國的風潮,不是四家媒體整齊劃一的製造,而是商業、財經媒體和經濟學人放得更大。在被社交媒體剪掉問號和前提,變成了全網的焦慮情緒。第三股力量呢,則是來自華盛頓。美國的政策派別彼此爭論是非常激烈的,但中國逼近這個論調幾乎對所有的派別都有用。主張放鬆監管的人可以說不能再用繁瑣的規則束縛美國公司了,而主張擴建能源和資料中心的人可以說中國可不會等待美國的審批程式。主張產業補貼的人可以要求政府投入更多的資金,而主張加強管制的人則可以要求進一步的封鎖晶片和模型。他們提出的政策未必是錯誤的,中國的挑戰確實存在,但必須看見其中的激勵措施,也就是如果把中國的威脅說得越迫切、越緊急,那麼這些政策主張就越容易獲得預算和支援。

於是,中國有一個很強的模型,這樣的說法自然就會被升級成美國可能會失去未來。第四股力量則是來自黃仁勳和他的英偉達。黃仁勳一方面不斷強調中國工程師很優秀,中國只落後美國很短的時間,另一方面又反對把中國排除在美國的技術生態之外。他的理由是,如果美國不向世界提供晶片和平臺,中國就會建立自己的替代體系,最終讓CUDA和美國的技術失去全球影響力。這個判斷有戰略道理,但也與應偉達的商業利益完全重合。英偉達賣的不是聊天機器人,而是執行聊天機器人的計算機。世界越相信AI的競爭激烈,各國要建設資料中心,開放模型越流行,越多企業會購買自己的GPU。中國越顯得接近美國,解除對華晶片限制就顯得越緊迫。所以,眼前的這場浪潮不是簡單的中國宣傳欺騙了美國,事實更有意思:北京需要一次突破封鎖的勝利,月之暗面需要全球升降,美國媒體需要戲劇性,華盛頓需要危機動員,英偉達需要不斷增長的計算需求。

不同的人說著相似的話,卻在追求完全不同的目標。理解了這點,我們才能回到技術本身。那麼,這個Kimi究竟贏了什麼?他又沒有贏什麼?我們先來看看Kimi真正值得重視的地方。傳統大模型像一家公司,每處理一個問題,幾乎所有的員工都要同時開會。模型越大,這種做法越貴。Kimi K3採用的是混合專家架構,可以把它想象成一家擁有很多專業部門的公司,法律問題交給法律組,程式設計問題交給工程組,影象問題還有另一組專家。所以整個模型有兩2.8萬億的引數,但每次啟用呢?只大約1040億。這並不代表其餘的引數都毫無用處,恰恰相反,龐大的專家庫提供了容量,而選擇性啟用則降低了每次計算的負擔。要把這麼多的專家分配到不同的晶片上,又讓他們迅速地交換資訊,是一項困難的系統工程。Kimi的第二個亮點是上下文,100萬Token可不是簡單的把一本書塞進聊天視窗,而是要求模型在幾場材料中找到有關資訊,保持任務目標,並與外部工具協作。

這對分析程式碼庫、法律檔案和研究資料很有吸引力。第三個亮點是智慧體的能力。今天最受關注的AI已經不只是回答問題了,而是接受一個目標,自己閱讀檔案、呼叫工具、編寫程式碼,測試結果,再根據錯誤繼續修改。Kimi已在前端程式設計和部分智慧體的測試中取得了好成績,說明他在把事情做完這條賽道上有著真實的競爭力。但排行榜的侷限也從這裡開始。第一,排行榜測量的是選定任務異常。前端的程式設計測試可以告訴我們模型能否按照要求製作網頁頁面,卻不能告訴我們他在科學推理、網路安全、生物研究、機器人控制和軍事規劃中同樣領先。就像一輛車在城市道路可以油耗最低,但不能證明它在賽道、雪地或者過載運輸中也能表現最好。第二,榜單上的成績不只來自模型。KimiK3測試中搭配的是Kimi code,OpenAI搭配的是Codex,Anthropic模型搭配的是Claude Code。

這些工具會決定模型能夠讀取哪些檔案,如何搜尋,什麼時候執行,程式碼失敗後又如何重視。最後的分數是底層模型、軟體框架、提示詞、計算、預算,還有安全規則共同產生的結果。美國模型有的時候會因為網路安全或危險任務而拒絕回答,拒絕就有可能讓它在某些能力測試中丟分,卻不一定說明它不會。反過來,一個幾乎從來不拒絕的模型可能分數更高,也可能會帶來更大的風險。不同的測試,如果不把這些條件統一起來,排名就很難被解釋成純粹的智力差距。第三,模型公司公佈的測試天然是具有選擇性的。這不是中國公司獨有的問題,美國公司釋出新模型時,同樣會挑選表現最好的指標。真正可靠的判斷必須觀察多個獨立測試、真實的使用者體驗,和一段時間後的穩定表現,而不只是看釋出會的一張表。第四,公開產品不等於國家的全部技術儲備。我們不知道OpenAI、Google和月之暗面實驗室內部尚未釋出的模型究竟達到什麼程度,所以不能靠想象宣稱美國一定藏著什麼更強的東西。

但同樣不能拿公開榜單宣佈中國已經消滅美國的所有領先。我們能夠比較的只是某一天擺到櫃檯上的商品。因此,Kimi的成績能夠支援三個結論:中國擁有世界級的AI人才,中國團隊掌握了訓練超大型混合專家模型的能力,中國模型已經可以在若干重要任務上與美國公開產品正面競爭。但它不能支援另外三個結論:中國已經掌握全球最強的先進晶片,中國擁有與美國相當的總算力,中國已經取得下一代AAA研究的全面主導權。這正是這場輿論操作最關鍵的偷換,它把產品層的接近包裝成整個體系的超越。而這種偷換之所以容易成功,還因為一個極有吸引力的詞:開源。Kimi和Deepseek經常被稱為開源模型,這個叫法已經深入,新聞標題卻並不準確。普通軟體的原始碼就像一套完整的食譜,你可以看到每一個步驟,知道加入了哪些原料,怎樣加工,也可以按照自己的需要修改,然後重新制作。

AI模型不同,訓練開始時,系統裡有數千億甚至數萬億個尚未形成能力的引數,它閱讀大量資料,透過一次又一次計算調整這些引數,最後得到的數字集合就是模型權重。權重更像是一個已經做好的蛋糕,你可以把蛋糕帶回家,切開裝飾,甚至在它的基礎上做出新的產品。但僅僅拿到蛋糕並不等於你知道麵粉從哪兒來,廚房用了什麼裝置,失敗過多少次,也不等於你能夠重建同樣的生產線。Kimi K3確實公開了非常有價值的東西:模型權重、技術報告、架構說明和部分的執行工具。開發者可以下載權重,在許可範圍內進行修改、量化和部署。這比只能透過公司API呼叫的封閉模型當然要開放得多。但月之暗面沒有公開足以完整重建Kimi的訓練資料、全部資料處理流程,以及每次實驗的記錄和完整的訓練流水線。外界可以研究它做出來的模型,卻無法從頭複製月之暗面怎樣做出這個模型。

Deepseek可也是類似的情況,他公開了權重論文和一部分推理程式碼,在工程透明度上值得肯定,但他也沒有把全部的訓練資料和完整生產過程交給世界。所以更準確的名稱其實是開放權重模型。這不是文字遊戲。開放權重帶來三種真正重要的自由:第一,資料可以留在本地,醫院、銀行、政府和企業不必把敏感的資料傳送到外國公司的伺服器上。第二,開發者可以調整模型,它還可以被微調成法律助手、程式設計工具,或者是本地的語言模型,也可以改變內容限制。第三,一個國家不必永遠依賴某一家美國公司的API,即使商業關係或國際政治發生變化,只要已經取得了權重,理論上仍然還能夠繼續執行。但開放權重並沒有提供另外三樣東西:它沒有讓外界知道全部的訓練材料,因此很難徹底審計模型是否使用了受版權保護內容,或者是否大量吸收了其他模型的輸出,也就是大家天天說的模型蒸餾。

它沒有公開完整的訓練過程,因此第三方無法判斷哪些技術來自原創,哪些來自反覆的試錯。最重要的是,它沒有把訓練同等級模型所需的晶片、資料中心和資金一同送給下載者。開放權重使中國可以把模型的使用權迅速傳播到全球,卻不會讓其他國家自動獲得中國的研發能力。這也是北京喜歡這種戰略的原因,它能建立依賴中國模型的開發者生態,擴大技術影響力,同時保留最有價值的訓練秘密。但這套戰略還有一個經常被忽略的受益者,因為模型檔案雖然可以免費下載,但讓它真正運轉起來的機器卻一點兒也不便宜。

讓Kimi真正運轉起來的機器到底有多貴呢?我們來算筆賬。Kimi K3有2.8萬億個引數,可以把引數理解成為模型訓練後留下來的經驗記錄。即使經過高度壓縮,每項記錄只佔半個位元組,整個模型也需要大約1.4TB的空間,相當於將近300部的高畫質電影。但檔案能夠存進硬碟,不等於模型能夠正常工作。硬碟就像地下倉庫,容量大,價格……

讓Kimi真正運轉起來的機器到底有多貴呢?我們來算筆賬。Kimi K3有2.8萬億個引數,可以把引數理解成為模型訓練後留下來的經驗記錄。即使經過高度壓縮,每項記錄只佔半個位元組,整個模型也需要大約1.4TB的空間,相當於將近300部的高畫質電影。但檔案能夠存進硬碟,不等於模型能夠正常工作。硬碟就像地下倉庫,容量大,價格便宜,搬東西卻比較慢。顯示卡上的高速記憶體則像廚師手邊的操作檯,空間貴,但模型馬上要用的材料必須放在那兒。如果模型的大部分內容留在硬碟裡,每生成幾個字都要停下來搬運一次,它雖然能夠啟動,卻會慢到失去實用價值。何況模型還要記住正在進行的談話,你上傳的檔案越長,同時交給他的任務越多,他需要的高速記憶體就越大。Kimi號稱可以處理100萬token。然而,如果真的要發揮這種能力,硬體壓力還會繼續上升。

有人會問,拼命每次回答問題只啟用大約1041個引數,為什麼還要裝下整個2.8萬億的引數呢?我們可以把它想象成啊一家擁有幾百個專業部門的公司,解決一個問題時,真正工作的可能只有十幾個部門。但在問題出現以前,系統並不知道這次需要程式設計不?影象不?還是數學不?因此,所有部門的資料都必須放在能夠迅速跳動的位置上。這就是為什麼成功啟動模型,和像GPT一樣順暢使用是兩回事。網上有人用普通電腦執行過DPC,甚至是TIME。技術上可能是真的,辦法通常是進一步的壓縮模型,或者把部分內容放在硬碟裡慢慢搬運。最後,模型確實說話了,但速度較慢,能夠處理的材料更短,也無法與商業網站的使用體驗相媲美。而且,個人電腦上執行的很多並不是新聞中那個完整的6711引數的旗艦模型,而是從大模型中提煉出來的較小版本。這就像汽車公司把某幾項賽車技術用在了家用車上,家用車確實獲得了部分賽車效能,卻不等於你用家用車的價格買了一臺專業賽車呀。

如果要正常執行完整的模型,硬體賬單會完全不同。因為打展示的完整的DPC和高效能方案,是一臺裝有八張約200高階顯示卡的伺服器。DPC早期公佈的另外一套方案,則使用了兩臺機器總計十六張的高階顯示卡。僅顯示卡和伺服器就可能要花費數百萬元。再加上高速網路儲存、供電散熱,300萬人民幣並不誇張。Kimi快三的整體規模比DPC的旗艦版更大。他雖然透過每次只呼叫部分引數來節省計算,但如果想在本地達到GBT的回答速度,實際投入很可能更高。因此,我們把300萬當成一個非常保守的起點。現在把這筆錢換算成普通人熟悉的訂閱費。ChenGPTPlus和ClaudePro目前都是每月$20的訂閱費。按照$1兌換6.76人民幣的計算,每月大約是¥135。¥300萬夠一個人訂閱多少年呢?1800多年。300萬隻是買機器的起步價,以後呢?

還要繼續支付電費和維修費用。所以對普通人來說,為了獲得類似GPT或者是快樂的的日常體驗,花300萬把完整的Timmy搬回家是一個虧本的買賣。當然,也不是每個人都能拿出這300萬。這就像有人免費送給你一家大型客機的設計圖圖紙,確實是不要錢,但你不能坐在圖紙上飛行啊。你還要購買發動機,還要製造機身,租用機庫,還要負責維修。訂閱GPT或者是CLUB的,則像是購買了機票。你不需要擁有飛機,卻只需要支付一張機票的錢,就能夠使用航空公司已經建好的整套系統。所謂的開源開放權重,提供的是自己製造飛機的權利,不是免費送給你一架能夠立即起飛的飛機。所以中國把世界級A三免費送給所有人,只說對了一半。免費的是模型檔案,不是執行模型的計算能力。可以下載的是訓練成果,不能下載的是顯示卡、機房和電力。但是隻要政府、銀行和大型機構為了資料安全,決定把模型搬回自己的機房,他們就必須購買更多的顯示卡和伺服器。

於是,一個看似矛盾的結果出現了:中國公司把模型免費開放,全球需要購買的計算裝置反而可能更多。躍至暗面免費送出的是模型權重,英偉達出售的則是讓這些權重真正運轉起來的機器。現在我們再回頭看華人為什麼如此熱衷,就比較容易理解了。拼命釋出之後,部分投資者擔心因偉達會受到衝擊。如果中國公司用較少資源做出便宜模型,是不是意味著未來不再需要那麼多貴的支配?Deepak出現的時候,市場就已經產生過同樣的恐慌。然而,仁兄的回答卻是:你們把因果關係搞反了。一件商品的使用成本下降,總需求有時候不會減少,反而會增加。照明就是一個經典的例子。燈泡越來越節能,並沒有讓人減少照明的使用,因為使用成本下降之後,城市道路、商店、家庭反而安裝了更多的燈。AP也可能如此,一次推理便宜了十倍,企業不會滿足於節省為原來的賬單,而是會把API裝進更多的服務裡,比如說客服、程式設計、設計、醫療、汽車、機器人。

最後使用的總計算能量可能更大。對OpenAIPack和摯愛面來說,模型通常是產品。對英偉達來說,模型首先是聳立的需求。閉源API把計算集中在少數的雲端巨頭,開放權重則把部署衝動擴散到了每一個希望掌握自己資料的組織。政府要主權,愛愛?銀行要本地伺服器,醫院不願上傳病人的病歷,軍方更不會把檔案交給外國公司。每一個這樣的決定都可能轉化成一批GPU、網路裝置和企業軟體的訂單呢?拼命尤其符合英偉達的利益。他有2.8萬億引數和100萬偷看上下文強調程式設計與智慧體服務。模型權重雖然免費,但它越受歡迎,全球用於執行他的高階硬體就可能越多。因為達2026財年的資料中心收入同比增長68%,公司的利潤核心已經不是遊戲顯示卡,而是計算平臺。他不僅出售GPU,還出售高速互聯伺服器系統和軟體生態。華人主張開放模型,當然有技術理念,但也等於主張一個由更多模型、更多資料中心和更多聳立消費組成的世界。

他主張繼續向中國銷售美國晶片,也有同樣的雙重邏輯。戰略上,他認為,如果中國開發者繼續使用哭喊和英偉達平臺,美國技術就能保持全球標準。如果美國徹底退出,中國會被迫扶植華為等替代者。商業上,中國原本就是一個可能價值數百億美元的市場。解除限制技能,維護美國生態也能為英偉達恢復收入。因此,人們強調中國只落後一點,中國模型非常優秀,不能被當成一箇中立的技術商家所給出的終審判決。他觀察的比多數人確實是深入,但他也有清晰的利益方向。這不等於說他說的話都是假的。開放權重確實可以降低軟體壟斷,保護本地資料,推動研究和競爭。中國工程師也確實優秀。問題不在於華人學說了假話,而在於他反覆強調的那部分真相,恰好通向英偉達最希望出來的未來。OpenAI希望全世界繼續購買他的智慧,而英偉達則希望每一個想擁有智慧的人都購買一座計算工廠。

當我們看清這一點,因為達西也承認中國即將超越,就不再是一條決定性的證據了。它只說明中國模型已經強大到足以製造全球計算需求,而這正是因為達的生意。不過,支援中國超越論的人,還有一張更有力的牌。Time的API價格低於美國的領先模型。DPC可更曾經以低價震動市場,這是中國API的真實競爭優勢。但偏移這個詞裡至少藏著四筆不同的賬。第一筆是使用者看到的API價格,也就是生成一定數量文字要付多少錢。第二筆是模型每執行一次的直接成本,包括GPU、電力和伺服器折舊。第三筆是把一個模型訓練出來的成本。第四比是找到正確的技術路線。之前所有的失敗實驗、人才、資料和基礎設施的總成本。釋出會上最容易宣傳的第一筆,有時會公佈第三筆。但真正決定一家實驗室能夠持續創新的往往是第四名。一家新的餐廳為了搶顧客,可以把百元成本的菜暫時賣六十塊,也可以由投資人補貼,還可能只在最優勢的菜品上低價選單。

價格是真實的,顧客確實是少數了錢,但它不能證明廚房真的只花了六十人中國愛國公司採用低價有多種可能同時存在。混合專家架構降低了每次的運算量,量化減少了記憶體壓力,工程最佳化提高了效率。中國市場競爭激烈,公司願意接受更低的利潤,投資人可能補貼價格,企業也可能利用低價爭奪開發者,建立生態之後再尋找收入。所以拼命便宜可以證明它有產品競爭力,卻不能單獨證明其全部成本都低於美國。第四塊的低成本故事也經歷過類似誤讀。公司曾公佈V三正式訓練階段使用約20078:008萬和800只啤酒小時。媒體把這一階段折算成數百萬美元,然後寫成了DPC只花了幾百萬美元就複製了OpenAI。但這個數字並不是一個公司的全部投入。它不包括早期研究、失敗實驗、資料準備、既有的伺服器採購、人員成本,也不能代表從零建立前沿實驗室所需要的代價。

它真正證明的是,DPC可以很高的工程效率完成了一次重要訓練,而不是前沿API可以脫離大規模的力。Time同樣如此。2.8萬億引數、常上下文和大規模的強化學習不可能憑空產生。技術進步可以提高每張支配的產出,卻不會讓訓練機器消失。這裡還有個更敏感的問題:蒸餾。所謂的蒸餾,就是讓一個模型學習另一個強模型的輸出。可以把它想象成學生反覆閱讀名師解題示範,在訓練出自己的解題習慣。行業普遍使用蒸餾,它本身並不是一種邪術。爭議在於學生是否違反了服務條款,大規模地獲取答案,是否複製了受保護的成果,以及釋出時是否隱瞞來源。美國政府已經指控越戰暗線可能利用了可模型輸出訓練梯米,並調查其中是否涉及違規。目前,公開材料還不足以把這項指控寫成定案,但它揭示了追趕者的一種優勢。開路者支付了探索無人區的成本,後來者則可以沿著論文、模型輸出和公開工具更快跟進。

這種能力當然也值得尊重,卻與獨立推進全部技術前沿不是同一個概念。一個學生可以用較少時間掌握老師花費10年建立的知識體系,這證明學生聰明,也證明知識傳播的有效。但它不能證明老師最初的10年探索已經不需要了。因此,演算法效率與算力並不是二選一。更好的演算法讓每次實驗更有價值,更多薩利讓實驗室可以同時嘗試更多方向。中國擅長用較少資源追趕,美國則仍有能力支付更多的探索失敗。要判斷這項差距是否真實存在,最值得聽的不是公開舞臺上的勝利宣言,而是中國前沿實驗室自己怎麼描述這個平靜的。2026年5月,據稱DPC的創始人聞風與潛在投資人進行了一場近四個小時的閉門交流。會議記錄後來流出,DPC可沒有正式確認其真實性。但其中對技術和經營細節的討論那是相當具體。在公開輿論裡,DPC經常被用來證明算力不再重要,而這份記錄傳達的卻是相反資訊。

按照記錄中的說法,DPC可與美國最前沿水平大約相差2年,希望能把差距縮短到半年至1年。公司的算力規模大約只有美國頭部實驗室的20分之1。真正的瓶頸不是中國沒有優秀人才,而是研究人員缺少足夠的計算資源去驗證自己的想法。那麼,為什麼算力會限制創新呢?因為訓練前沿模型不是照著一張成熟圖紙生產。研究人員可能有十種新架構、二十種資料方案、幾十套的訓練引數。大多數嘗試不會成功。有充足算力的實驗室就可以同時進行實驗,迅速淘汰失敗路線,再把資源投入到最有希望的方向。聳立不足的團隊則必須更謹慎地選擇,甚至因為承擔不起一次失敗而放棄高風險方案。這就像藥物研發,科學家的聰明程度當然重要,但如果一家企業只能進行十次實驗,而另一家企業可以進行200次實驗,後者發現有效藥物的機率就會更高。梁文峰面對投資人也有理由強調資金和算力需求,但正因為投資人最終要決定是否掏錢,他不能只重複中國已經全面領先的宣傳。

投資人關心的是下一步還缺什麼,企業為什麼需要這麼多的錢。這份記錄最有價值的地方不是2年這個數字,A一發展太快,任何固定時間差都可能在一次模型釋出後改變。真正重要的是,文峰承認了一種結構工程效率能夠緩解算力短缺,卻不能取消算力。國產晶片能夠承擔部分任務,卻還沒有完全替代英偉達在前沿訓練中的位置。這也解釋了為什麼Time三的成功不能證明美國晶片管制已經失效。管制從來不可能讓中國突然停止訓練模型。中國在限制實施前就已經擁有大量的因為達支配了,還可以透過第三國雲端和灰色渠道獲取部分裝置。中國團隊也會用軟體最佳化提高舊的晶片的效率。管制真正要做的是讓中國獲得下一代的晶片更困難,建設超大叢集更昂貴,並減少它可以同時進行的前沿實驗的數量。中國仍然做出機敏說明管制不是一張密不透風的牆,但它不說明牆完全不存在。

如果連IPSec的創始人的內部判斷都已經把算力視為主要約束的話,那麼把一次模型釋出解釋成為中國已經繞過了晶片差距,就不是技術判斷,而是政治宣傳了。接下來要看的就是這項約束究竟有多大。根據Apple II對於公開叢集的統計,截至2025年5月,美國大約佔全球GPS叢集計算能力的4分之3,中國約佔15%。由於很多企業和軍事設施不公開,這不可能是一張完整的地圖,但它揭示的數量級差距與兩國資料中心和晶片供應情況基本一致。美國的優勢不是隻是一家公司或者一款晶片,它擁有OpeningPack、GoogleMeta、西醫等多家相互競爭的前沿實驗室,擁有微軟、亞馬遜和谷歌的大型雲平臺,擁有英偉達和AMD的晶片設計能力,還有大和高速的互聯生態。中國當然也有自己的優勢:工程師數量龐大,國內競爭激烈,製造業場景豐富,政府能夠集中投入,企業運用較低的價格爭奪市場。

華為晶片和國產軟體生態也都在進步。但國產替代不是一句口號,而是要同時解決先進位制度、良率、高頻寬記憶體封裝、晶片建通訊軟體相容和大規模的叢集穩定性。某一張晶片在紙面算力上接近,不等於幾萬張晶片連在一起也能達到相同效率。前沿AR越來越像一項國家級的工業工程,晶片只是發動機,資料中心是輛汽車,還需要電力、冷卻、網路軟體和能夠長期維護系統的人。這就是為什麼公開模型能力差距可以很小,國家專利差距卻仍然很大。追趕者可以集中資源訓練一款明星模型,在公開測試上與領先者並跑。領先者則可以同時訓練語言、影片、機器人、科學、生物和國防模型,並讓多家公司探索不同路線。前者可以贏得一場重要的比賽,後者則擁有舉辦多場比賽的能力。當然,美國也並非高枕無憂。中國已經證明它可以迅速吸收公開研究,把有限硬體使用得更有效率,並透過開放權重爭奪全球開發者。

如果美國把領先浪費在內部監管混亂、能源建設遲緩和對盟友的技術封鎖上,結構性優勢當然可能會縮小。但可能失去領先與即將全面被超越並不是一句話。截至今天,Kimi證明中國具備前沿產品能力,Deepak證明中國具備出色的演算法與系統最佳化能力,千萬等模型證明中國的開放權重生態已經形成規模。它們共同構成嚴肅挑戰,卻沒有證明中國已經擁有與美國相當的前沿算力、先進晶片供應鏈和多路線的探索能力。現在我們可以做出最後裁決了。中國II到底落後美國多久?如果一定要把答案壓縮成一個數字的話,這個節目反而會重複它正在批評的錯誤。在公開語言模型和程式設計能力上,中國不是落後幾年。Timmy和千萬已經進入世界第一梯隊,部分任務可以並跑,甚至是短暫領先。整體的產品差距很可能以月計算。在價格、工程效率和開放權重傳播上,中國不僅是追趕者,在一些方面已經取得了主動。

美國公司如果繼續只提供貴的封閉模型,確實可能會把大量全球開發者讓給中國。但在總算裡,先進的GPU、大型叢集、半導體制造裝置和同時探索多條前沿線路的能力上,美國仍有明顯的結構性優勢。這不是一張排行榜可以抹掉的差距,也不是把模型檔案上傳到網上就能填平的差距。所以,拼命快三證明的不是中國已經全面超過美國,而是中國已經能夠用有限聳立開放權重和激烈競爭把某些A三產品推進世界第一梯隊。這值得美國警惕,卻不值得恐慌。一張排行榜測量的是今天公開的一場比賽,國家依然實力決定的是誰有能力不斷地舉辦下一場比賽,承擔更多失敗,製造更先進的晶片,並探索尚不存在的技術路線。中國已經學會用較少的籌碼打出一手好牌,但美國仍然擁有更多籌碼、更大牌桌,也仍然控制著製造大部分高階籌碼的機器。中國也還很強,是真的,美國不能自滿也是真的。

但從這兩句話跳到中國即將全面超越美國,不是技術分析,而是把北京的宣傳、矽谷的利益和媒體的焦慮包裝成了一個並不存在的必然結局。我們的立場很清楚:不能因為反對中共就低估中國的工程師,也不能因為梯米贏了幾場比賽就替中共宣佈一場尚未發生的全面勝利。真正能夠解除焦慮的,不是另外一套自我安慰的宣傳,而是看清現實。美國的領先正在受到挑戰,卻遠沒有被抹去。中國已經追到產品前線,卻仍沒有控制決定下一代AR的整條工業底座。模型可以下載,算力不能下載。排行榜可以追平,製造排行榜背後的那座機器的能力仍然沒有追平。這才是Kimi快三浪潮背後的真相。好,今天我們就聊到。如果這些節目對你有價值,請點贊,開啟小鈴鐺,轉發,也歡迎訂閱本頻道。有條件的朋友們可以加入會員支援我們這個小頻道的發展。我是來自考中邏輯的妖精,我們下期再見!

關鍵事件時間線 · 精選關聯節點
2026年5月
據稱DPC創始人聞風與投資人閉門交流,透露公司算力規模為美國頭部實驗室的20%
一份流出的會議記錄顯示,DPC創始人承認公司算力規模僅為美國頭部實驗室的20%,並認為算力是限制創新的主要瓶頸,但可以透過工程效率緩解。
2026年7月16日
北京月之暗面釋出Kimi K3模型
北京月之暗面公司釋出了Kimi K3模型,模型總規模達2.8萬億引數,可處理100萬token,並在Arena等測試中取得領先。
2022年
美國開始限制先進AI晶片、半導體裝置和高頻寬記憶體流向中國
美國自2022年起逐步實施對中國在先進AI晶片、半導體裝置和高頻寬記憶體等方面的出口限制。
2026年8月2日
影片釋出,分析Kimi K3與中美AI差距
影片釋出,深入分析Kimi K3模型及其在中美AI競賽中的意義,探討算力、技術和各方利益。
關聯專題 中美關係 科技冷戰 英偉達 AI模型 算力
逐字稿 · 帶時間點
哈羅大家好 我是妖妖醬
過去兩週 一個來自北京的AI模型Kimi K3突然震動矽谷
美國媒體宣稱中國抹去了美國的AI領先
白宮科技顧問警告美國可能輸掉AI競賽
黃仁勳則說中國的開放模型
非常優秀 美國企業應當大膽使用
與此同時 中國媒體把Kimi與Deepseek傳承了一條故事線
晶片封鎖失敗了 中國A I即將全面趕超美國
聽起來 華盛頓、矽谷和北京似乎得出了
同一個結論 但他們真的在描述同一件事兒嗎?
還是不同利益集團出於自己不同的目的 共同放大了同一種焦慮?
今天 我們不靠外國口號 也不靠反向宣傳
我們將深入分析Kimi K3的排行榜 所謂的開源低價
神話、硬體賬單和訓練算力 追蹤每一種說法背後的利益
回答以下三個問題Kimi究竟強在哪兒?
中國真正受制於什麼?
一個模型追上美國是否等於中國
AI即將全面超越美國?
這輪引發中美雙方焦慮的主角
叫KimiK3 研發者是北京的月之暗面
7月16號 KimiK3正式釋出 月沾面公佈的數字
相當驚人 模型總規模達到2.8萬億
引數每次回答問題會啟用其中的大約1040億引數
它可以同時處理文字和影象 最多容納100萬token
也就是能夠一次讀非常長的文件和大型程式碼庫
公司隨後又公佈了模型權重和技術報告
讓外部開發者可以下載和部署
真正點燃輿論的是排行榜
在Arena的前端程式設計測試中 Kimi K3衝到榜首
在若干智慧體、軟體工程和綜合能力測試裡 他也進入了全球第一梯隊
他的API價格又低於美國最強的商業模型
訊息一出 美國科技媒體迅速使用了一個極具
衝擊力的標題中國抹去了美國的AI領先
白宮科技顧問戴維薩克斯警告美國
如果不能繼續擴大基礎設施、能源和技術出口 就有可能輸掉AI競賽
英偉達CEO黃仁勳說 華爾街在Deepseek出現時誤判了一次
現在面對Kimi又誤判了
他認為中國的開放模型非常優秀 美國公司
當然應該使用中國媒體更不會放過這個機會了
Deepseek的故事剛剛退潮 Kimi又接了上去
美國封鎖先進晶片 中國卻用更少的資源做出世界級的模型
美國模型貴封閉 中國模型 便宜開放
讓這個速度發展下去 全面超越似乎只是時間問題
這裡有一個必須先說清楚的事實Kimi K3
既不是騙局 也不是靠宣傳堆出來的紙老虎
一個2.8萬億引數的混合專家模型 要在訓練通訊、
長文字和智慧體任務上正常工作 需要相當強的演算法能力和系統工程能力
Kimi在部分測試中取得領先 也說明中國AI
團隊已經能夠在世界第一梯隊競爭了
但承認Kimi很強 與接受中國
即將全面超越美國 那是兩回事兒
一名中國運動員在幾場比賽裡戰勝了美國選手
可以證明這名運動員達到了世界級水平 但不能自動
證明中國已經在體育、科研、訓練體系、場館、商業
聯賽和所有專案上全面超過美國
模型排行榜測量的是某個版本的模型在一組規定任務中的表現
他不測量先進晶片的製造能力 不測量全國擁有多少算力 也不測量
誰有能力承擔下一輪成千上萬次的實驗
從Kimi贏下了幾次測試 跳到中國抹去的領先
中間缺少的正是我們今天要調查的部分
那麼要看清這個跳躍是怎麼發生的 我們
首先要問誰需要這個故事?
這個新聞可不是幾個人在密室中合謀的結果
更常見也更有力量的情況是 幾股力量各自從自己的利益出發
最後合流成了一股詭異的熱帶風暴
第一股力量來自月之暗面和北京
月之暗面是一家需要資本、人才、客戶和開發者的商業公司 訓練
Kimi K3這樣的模型要投入鉅額的資金 公司必須證明自己不是Deepseek之後的
又一個跟隨者 而是能夠建立全球技術生態的領跑者
排行榜越高 媒體越震驚 國際開發者下載的越多
它在融資和市場競爭中就越有競爭力
對中共來說 拼命還有另一層價值
美國從2022年開始不斷限制先進
AI晶片、半導體裝置和高頻寬記憶體流向中國
北京最需要證明的不只是中國公司做出了
好的產品 而是美國封鎖失敗了
只要一箇中國模型接近美國前沿 北京
就可以把企業的技術成績改寫成制度勝利
西方圍堵得越 中國創新越強 美國模型
封閉且貴 中國則把技術免費送給世界
因此 月之暗面需要一個商業成功的故事
而北京則需要一個國家崛起的故事
兩者並不完全相同 卻在放大Kimi K3的意義上高度一致
第二股力量來自美國媒體 Kimi K3在一些公開測試中達到領先水平
但不同測試存在方法差異 這是準確的標題 卻很少有人會變態
中國抹去了美國的AI領先
這樣的一個標題才像是一個歷史轉折嗎?
媒體喜歡把複雜的技術競爭翻譯成賽馬
誰第一 誰第二 差幾時 何時反超排行榜呢?
又恰好提供了看似客觀的資料
但數字一旦離開了測試條件 就很容易被濫用
模型公司可以選擇最有利的專案
測試框架會影響成績 允許使用多少推理時間也會改變結果
更重要的是 榜單比較的是已經公開的產品
而不是兩個國家的全部能力
為了檢驗 這不是我們的偏見 我對過去1年紐約時報、經濟學人
還有BBC以及彭博社做了同口徑的抽樣調查
逐月檢索中國經濟與科技報道 每家媒體每月
最多隨機抽取十條 共編碼374個標題
只判斷標題 把中國描寫成能力上升問題
惡化還是中性 又或者是正反面相結合
結果其實並不是西方媒體都在吹
中國在213個經濟標題中 負面的有八十八條 正面的
是二十八條 批判性報道的超過是正面報道三倍之多
真正反常的其實是AI和高科技方面的報道
在127個標題中 正面能力敘事的是四十條 負面的只有二十五條
差異又高度集中在彭博社對中美AI
和高科技正負面報道之比是十八比九
經濟學人呢?
是十二比四 BBC是七比八 紐約時報是三比四
換句話說 這股中國科技即將取代
美國的風潮 不是四家媒體整齊劃一的製造
而是商業、財經媒體和經濟學人放得更大
在被社交媒體剪掉問號和前提 變成了全網的焦慮情緒
第三股力量呢 則是來自華盛頓、
美國的政策派別彼此爭論是非常激烈的
但中國逼近這個論調幾乎對所有的派別都有用
主張放鬆監管的人可以說不能再用繁瑣的規則束縛美國公司了
而主張擴建能源和資料中心的人 可以說
中國可不會等待美國的審批程式
主張產業補貼的人可以要求政府投入更多的資金
而主張加強管制的人則可以要求進一步的封鎖晶片和模型
他們提出的政策未必是錯誤的
中國的挑戰
確實存在 但必須看見其中的激勵措施
也就是如果把中國的威脅說得越迫切、越緊急
那麼這些政策主張就越容易獲得預算和支援
於是 中國有一個很強的模型 這樣的說法
自然就會被升級成美國 可能會失去未來
第四股力量則是來自黃仁勳和他的英偉達
黃仁勳一方面不斷強調中國工程師很優秀 中國只落後美國很短的時間
另一方面又反對把中國排除在美國的技術生態之外
他的理由是 如果美國不向世界提供晶片和平臺
中國就會建立自己的替代體系 最終讓CUDA和美國的技術失去全球影響力
這個判斷有戰略道理 但也與應偉達的商業利益完全重合
英偉達賣的不是聊天機器人 而是執行聊天機器人的計算機
世界越相信AI的競爭激烈
各國要建設資料中心 開放模型越流行 越多企業會購買自己的GPU
中國越顯得接近美國 解除對華晶片限制就顯得越緊迫
所以 眼前的這場浪潮不是簡單的 中國宣傳欺騙了美國
事實更有意思 北京需要一次
突破封鎖的勝利 月之暗面需要全球升降 美國媒體需要戲劇性
華盛頓需要危機動員 英偉達需要不斷增長的計算需求
不同的人說著相似的話 卻在追求完全不同的目標
理解了這點 我們才能回到技術本身
那麼 這個Kimi究竟贏了什麼?他又沒有贏什麼
我們先來看看Kimi真正值得重視的地方
傳統大模型像一家公司 每處理一個問題 幾乎所有的員工都要同時開會
模型越大 這種做法越貴
Kimi K3採用的是混合專家架構
可以把它想象成一家擁有很多專業部門的公司
法律問題交給法律組 程式設計問題交給工程組 影象問題還有另一組專家
所以整個模型有兩2.8萬億的引數 但每次啟用呢?
只大約1040億 這並不代表其餘的引數都毫無用處
恰恰相反 龐大的專家庫提供了容量
而選擇性啟用則降低了每次計算的負擔
要把這麼多的專家分配到不同的晶片上
又讓他們迅速地交換資訊 是一項困難的系統工程
Kimi的第二個亮點是上下文
100萬Token可不是簡單的把一本書塞進聊天視窗 而是要求模型
在幾場材料中找到有關資訊 保持任務目標 並與外部工具協作
這對分析程式碼庫、法律檔案和研究資料很有吸引力
第三個亮點是智慧體的能力
今天最受關注的AI已經不只是回答問題了 而是接受一個目標自己
閱讀檔案、呼叫工具、編寫程式碼
測試結果 再根據錯誤繼續修改
Kimi已在前端程式設計和部分智慧體的測試中取得了好成績 說明
他在把事情做完這條賽道上有著真實的競爭力
但排行榜的侷限也從這裡開始
第一排行榜測量的是選定任務異常
前端的程式設計測試可以告訴我們模型能否按照
要求製作網頁頁面 卻不能告訴我們他在科學推理、網路安全、生物
研究、機器人控制和軍事規劃中同樣領先
就像一輛車在城市道路可以油耗最低
但不能證明它在賽道、雪地或者過載運輸中也能表現最好
第二 榜單上的成績不只來自模型
KimiK3測試中搭配的是Kimi code OpenAI搭配的是Codex
Anthropic模型搭配的是Claude Code
這些工具會決定模型能夠讀取哪些檔案 如何搜尋
什麼時候執行 程式碼失敗後又如何重視
最後的分數是底層模型、軟體框架、提示詞
計算、預算 還有安全規則共同產生的結果
美國模型有的時候會因為網路安全或危險任務而拒絕回答
拒絕就有可能讓它在某些能力測試中丟分
卻不一定說明它不會 反過來
一個幾乎從來不拒絕的模型可能分數更高
也可能會帶來更大的風險
不同的測試 如果不把這些條件統一起來
排名就很難被解釋成純粹的智力差距
第三 模型公司公佈的測試
天然是具有選擇性的 這不是中國公司獨有的問題
美國公司釋出新模型時 同樣會挑選表現最好的指標
真正可靠的判斷必須觀察多個獨立測試、真實的使用者體驗
和一段時間後的穩定表現 而不只是看釋出會的一張表
第四 公開產品不等於國家的全部技術儲備
我們不知道OpenAI、Google和月之暗面實驗室
內部尚未釋出的模型究竟達到什麼程度
所以不能靠想象宣稱美國一定藏著什麼更強的東西
但同樣不能拿公開榜單宣佈中國已經消滅美國的所有領先
我們能夠比較的只是某一天擺到櫃檯上的商品
因此Kimi的成績能夠支援三個結論:中國擁有世界級的AI人才
中國團隊掌握了訓練超大型混合專家模型的能力
中國模型已經可以在若干重要任務上與美國公開產品正面競爭
但它不能支援另外三個結論:中國已經掌握全球
最強的先進晶片 中國擁有與美國相當的總算力
中國已經取得下一代AAA研究的全面主導權
這正是這場輿論操作最關鍵的偷換
它把產品層的接近包裝成整個體系的超越
而這種偷換之所以容易成功 還因為
一個極有吸引力的詞開源
Kimi和Deepseek
經常被稱為開源模型 這個叫法已經深入 新聞標題卻並不準確
普通軟體的原始碼就像一套完整的食譜 你可以看到每一個步驟
知道加入了哪些原料 怎樣加工 也可以
按照自己的需要修改 然後重新制作
AI模型不同 訓練開始時 系統裡有數千億
甚至數萬億個尚未形成能力的引數 它閱讀大量資料 透過一次
又一次計算調整這些引數 最後得到的數字集合就是模型權重
權重更像是一個已經做好的蛋糕
你可以把蛋糕帶回家 切開裝飾
甚至在它的基礎上做出新的產品
但僅僅拿到蛋糕並不等於你知道麵粉
從哪兒來 廚房用了什麼裝置 失敗過多少次
也不等於你能夠重建同樣的生產線
Kimi K3確實公開了非常有價值的東西
模型權重、技術報告、架構說明和部分的執行工具
開發者可以下載權重 在許可範圍內進行修改、量化和部署
這比只能透過公司API呼叫的封閉模型當然要開放得多
但月之暗面沒有公開足以完整重建Kimi的訓練資料、全部資料處理流程
以及每次實驗的記錄和完整的訓練流水線
外界可以研究它做出來的模型 卻無法從頭複製月之暗面
怎樣做出這個模型 Deepseek可也是類似的情況
他公開了權重論文和一部分推理程式碼 在工程透明度上值得肯定
但他也沒有把全部的訓練資料和完整生產過程交給世界
所以更準確的名稱其實是開放權重模型
這不是文字遊戲
開放權重帶來三種真正重要的自由
第一 資料可以留在本地醫院、銀行、
政府和企業 不必把敏感的資料傳送到外國公司的伺服器上
第二 開發者可以調整模型
它還可以被微調成法律助手、程式設計工具
或者是本地的語言模型 也可以改變內容限制
第三 一個國家不必永遠依賴某一家美國公司的API
即使商業關係或國際政治發生變化 只要已經取得了權重
理論上仍然還能夠繼續執行
但開放權重並沒有提供另外三樣東西
它沒有讓外界知道全部的訓練材料
因此很難徹底審計模型是否使用了受版權保護內容
或者是否大量吸收了其他模型的輸出 也就是大家天天說的模型蒸餾
它沒有公開完整的訓練過程 因此第三方無法
判斷哪些技術來自原創 哪些來自反覆的試錯
最重要的是 它沒有把訓練同等級模型
所需的晶片、資料中心和資金一同送給下載者
開放權重使中國可以把模型的使用權迅速傳播到全球
卻不會讓其他國家自動獲得中國的研發能力
這也是北京喜歡這種戰略的原因
它能建立依賴中國模型的開發者生態 擴大技術
影響力 同時保留最有價值的訓練秘密
但這套戰略還有一個經常被忽略的受益者
因為模型檔案雖然可以免費下載 但讓它真正運轉起來的機器卻一點兒也不便宜
讓Kimi真正運轉起來的機器到底有多貴呢?
我們來算筆賬 Kimi K3有2.8萬億個引數
可以把引數理解成為模型訓練後留下來的經驗記錄
即使經過高度壓縮 每項記錄只佔半個位元組 整個模型
也需要大約1.4TB的空間 相當於將近300部的高畫質電影
但檔案能夠存進硬碟
不等於模型能夠正常工作
硬碟就像地下倉庫 容量大 價格便宜 搬東西卻比較慢
顯示卡上的高速記憶體則像廚師手邊的操作檯
空間貴 但模型馬上要用的材料必須放在那兒
如果模型的大部分內容留在硬碟裡 每生成幾個字都要停下來
搬運一次 它雖然能夠啟動 卻會慢到失去實用價值
何況模型還要記住正在進行的談話你上傳的檔案越長
同時交給他的任務越多 他需要的高速記憶體就越大
Kimi號稱可以處理100萬token
然而如果真的要發揮這種能力 硬體壓力還會繼續上升
有人會問 拼命每次回答問題只啟用大約1041個引數
為什麼還要裝下整個2 8萬億的引數呢?
我們可以把它想象成啊 一家擁有幾百個專業部門的公司
解決一個問題時 真正工作的可能只有十幾個部門
但在問題出現以前 系統並不知道這次需要程式設計不 影象不還是數學不
因此 所有部門的資料都必須放在能夠迅速跳動的位置上
這就是為什麼成功啟動模型
和像GPT一樣順暢使用是兩回事
網上有人用普通電腦執行過DPC
甚至是TIME 技術上可能是真的
辦法通常是進一步的壓縮模型 或者把部分內容放在硬碟裡慢慢搬運
最後 模型確實說話了 但速度較慢
能夠處理的材料更短 也無法與商業網站的使用體驗相媲美
而且 個人電腦上執行的很多並不是新聞中
那個完整的6711引數的旗艦模型
而是從大模型中提煉出來的較小版本
這就像汽車公司把某幾項賽車技術用在了家用車上
家用車確實獲得了部分賽車效能 卻不等於
你用家用車的價格買了一臺專業賽車呀
如果要正常執行完整的模型 硬體賬單會完全不同
因為打展示的完整的DPC和高效能方案
是一臺裝有八張約200高階顯示卡的伺服器
DPC早期公佈的另外一套方案則使用了
兩臺機器總計十六張的高階顯示卡 僅顯示卡和伺服器就可能要花費
數百萬元 再加上高速網路儲存、
供電散熱¥300萬人民幣並不誇張
Kimi快三的整體規模比DPC的旗艦版更大
他雖然透過每次只呼叫部分引數來節省計算
但如果想在本地達到GBt的回答速度 實際投入很可能更高
因此 我們把300萬當成一個非常保守的起點
現在把這筆錢換算成普通人熟悉的訂閱費
ChenGPTPlus和ClaudePro目前都是每月$20的
訂閱費 按照$1兌換6 76人民幣的計算 每月大約是¥135
¥300萬夠一個人訂閱多少年呢?
1800多年300萬隻是買機器的起步價
以後呢 還要繼續支付電費和維修費用
所以對普通人來說 為了獲得類似GPT
或者是快樂的的日常體驗 花300萬
把完整的Timmy搬回家是一個虧本的買賣
當然 也不是每個人都能拿出這300萬 這就像有人免費送給你一家
大型客機的設計圖圖紙確實是不要錢 但你不能坐在圖紙上飛行啊
你還要購買發動機 還要製造機身 租用機庫 還要負責維修
訂閱GPT或者是CLUB的則像是購買了機票
你不需要擁有飛機 卻只需要支付一張機票的錢
就能夠使用航空公司已經建好的整套系統
所謂的開源開放權重 提供的是自己製造飛機的權利
不是免費送給你一架能夠立即起飛的飛機
所以中國把世界級A三免費送給所有人 只說對了一半
免費的是模型檔案 不是執行模型的計算能力
可以下載的是訓練成果 不能下載的
是顯示卡、機房和電力
但是隻要政府、銀行和大型機構為了資料安全 決定
把模型搬回自己的機房 他們就必須購買更多的顯示卡和伺服器
於是 一個看似矛盾的結果出現了中國公司
把模型免費開放 全球需要購買的計算裝置反而可能更多
躍至暗面免費送出的是模型權重 英偉達出售的則
是讓這些權重真正運轉起來的機器
現在我們再回頭看華人為什麼如此熱衷 就比較容易理解了
拼命釋出之後 部分投資者擔心因偉達會受到衝擊
如果中國公司用較少資源做出便宜模型
是不是意味著未來不再需要那麼多貴的支配?
Deepak出現的時候 市場就已經產生過同樣的恐慌
然而 仁兄的回答卻是你們把因果關係搞反了
一件商品的使用成本下降 總需求有時候不會減少 反而會增加
照明就是一個經典的例子
燈泡越來越節能 並沒有讓人減少照明的使用
因為使用成本下降之後 城市道路、商店、家庭反而安裝了更多的燈
AP也可能如此 一次推理便宜了十倍
企業不會滿足於節省為原來的賬單
而是會把API裝進更多的服務裡 比如說客服、程式設計、
設計、醫療、汽車、機器人 最後使用的總計算能量可能更大
對OpenAIPack和摯愛面來說 模型通常是產品
對英偉達來說 模型首先是聳立的需求
閉源API把計算集中在少數的雲端巨頭開放權重則
把部署衝動擴散到了每一個希望掌握自己資料的組織
政府要主權愛愛 銀行要本地伺服器
醫院不願上傳病人的病歷 軍方更不會把檔案交給外國公司
每一個這樣的決定都可能轉化成一批GPU、
網路裝置和企業軟體的訂單呢?
拼命尤其符合英偉達的利益
他有2 8萬億引數和100萬
偷看上下文強調程式設計與智慧體服務模型權重雖然免費
但它越受歡迎 全球用於執行他的高階硬體就可能越多
因為達2026財年的資料中心收入同比增長68%
公司的利潤核心已經不是遊戲顯示卡 而是計算平臺
他不僅出售GPU 還出售高速互聯伺服器系統和軟體生態
華人主張開放模型 當然有技術理念
但也等於主張一個由更多模型、更多
資料中心和更多聳立消費組成的世界
他主張繼續向中國銷售美國晶片 也有同樣的雙重邏輯
戰略上 他認為 如果中國開發者繼續使用
哭喊和英偉達平臺 美國技術就能保持全球標準
如果美國徹底退出 中國會被迫扶植華為等替代者
商業上 中國原本就是一個可能價值數百億美元的市場
解除限制技能 維護美國生態也能為英偉達恢復收入
因此 人們強調中國只落後一點 中國模型非常優秀
不能被當成一箇中立的技術商家所給出的終審判決
他觀察的比多數人確實是深入
但他也有清晰的利益方向
這不等於說他說的話都是假的
開放權重確實可以降低軟體壟斷 保護本地資料 推動研究和競爭
中國工程師也確實優秀
問題不在於華人學說了假話 而在於他反覆強調的
那部分真相恰好通向英偉達最希望出來的未來
OpenAI希望全世界繼續購買他的智慧 而英
偉達則希望每一個想擁有智慧的人都購買一座計算工廠
當我們看清這一點 因為達西也承認中國
即將超越就不再是一條決定性的證據了
它只說明中國模型已經強大到足以製造
全球計算需求 而這正是因為達的生意
不過 支援中國超越論的人
還有一張更有力的牌Time的API價格低於美國的領先模型
DPC可更曾經以低價震動市場 這是中國API的真實競爭優勢
但偏移這個詞裡至少藏著四筆不同的賬
第一筆是使用者看到的API價格 也就是生成一定數量文字要付多少錢
第二筆是模型每執行一次的直接成本
包括GPU、電力和伺服器折舊
第三筆是把一個模型訓練出來的成本
第四比是找到正確的技術路線
之前所有的失敗實驗人才資料和基礎設施的總成本
釋出會上最容易宣傳的第一筆有時會公佈第三筆
但真正決定一家實驗室能夠持續創新的往往是第四名
一家新的餐廳為了搶顧客 可以把百元成本的菜暫時賣六十塊
也可以由投資人補貼 還可能只在最優勢的菜品上低價選單
價格是真實的 顧客確實是少數了
錢 但它不能證明廚房真的只花了六十人
中國愛國公司採用低價有多種可能同時存在
混合專家架構降低了每次的運算量 量化
減少了記憶體壓力 工程最佳化提高了效率
中國市場競爭激烈 公司願意接受更低的利潤 投資人可能補貼
價格 企業也可能利用低價爭奪開發者 建立生態之後再尋找收入
所以拼命便宜可以證明它有產品競爭力
卻不能單獨證明其全部成本都低於美國
第四塊的低成本故事也經歷過類似誤讀
公司曾公佈V三正式訓練階段使用約
20078:008萬和800只啤酒小時
媒體把這一階段折算成數百萬美元
然後寫成了DPC 只花了幾百萬美元就複製了OpenAI
但這個數字並不是一個公司的全部投入
它不包括早期研究失敗實驗資料準備既有的伺服器採購人員
成本也不能代表從零建立前沿實驗室所需要的代價
它真正證明的是 DPC可以很高的工程效率完成了一次重要訓練
而不是前沿API可以脫離大規模的力
Time同樣如此
2 8萬億引數常上下文和大規模的強化學習不可能憑空產生
技術進步可以提高每張支配的產出 卻不會讓訓練機器消失
這裡還有個更敏感的問題蒸餾
所謂的蒸餾 就是讓一個模型學習另一個強模型的輸出
可以把它想象成學生反覆閱讀名師
解題示範 在訓練出自己的解題習慣
行業普遍使用蒸餾 它本身並不是一種邪術 爭議
在於學生是否違反了服務條款 大規模地獲取答案
是否複製了受保護的成果 以及釋出時是否隱瞞來源
美國政府已經指控越戰暗線可能利用了
可模型輸出訓練梯米 並調查其中是否涉及違規
目前 公開材料還不足以把這項指控寫成定案 但它揭示了追趕者的一種優勢
開路者支付了探索無人區的成本 後來者則
可以沿著論文模型輸出和公開工具更快跟進
這種能力當然也值得尊重 卻與獨立
推進全部技術前沿不是同一個概念
一個學生可以用較少時間掌握老師花費10年建立的知識體系
這證明學生聰明 也證明知識傳播的有效
但它不能證明老師最初的10年探索已經不需要了
因此 演算法效率與算力並不是二選
一 更好的演算法讓每次實驗更有價值
更多薩利讓實驗室可以同時嘗試更多方向
中國擅長用較少資源追趕 美國則仍有能力支付更多的探索失敗
要判斷這項差距是否真實存在
最值得聽的不是公開舞臺上的勝利宣言
而是中國前沿實驗室自己怎麼描述這個平靜的
2026年5月 據稱 DPC的創始人
聞風與潛在投資人進行了一場近四個小時的閉門交流
會議記錄後來流出 DPC可沒有正式確認其真實性
但其中對技術和經營細節的討論那是相當具體
在公開輿論裡 DPC經常被用來證明算力
不再重要 而這份記錄傳達的卻是相反資訊
按照記錄中的說法 DPC可與美國最前沿水平大約相差2年
希望能把差距縮短到半年至1年
公司的算力規模大約只有美國頭部實驗室的20分之1
真正的瓶頸不是中國沒有優秀人才 而是研究人員
缺少足夠的計算資源去驗證自己的想法
那麼 為什麼算力會限制創新呢?
因為訓練前沿模型不是照著一張成熟圖紙生產
研究人員可能有十種新架構、二十種資料方案、幾十套的訓練引數
大多數嘗試不會成功
有充足算力的實驗室就可以同時進行實驗 迅速淘汰
失敗路線 再把資源投入到最有希望的方向
聳立不足的團隊則必須更謹慎地選擇
甚至因為承擔不起一次失敗而放棄高風險方案
這就像藥物研發 科學家的聰明程度當然重要
但如果一家企業只能進行十次實驗 而另一家企業可以進行
200次實驗 後者發現有效藥物的機率就會更高
梁文峰面對投資人也有理由強調資金和算力需求
但正因為投資人最終要決定是否掏錢
他不能只重複中國已經全面領先的宣傳
投資人關心的是下一步還缺什麼 企業為什麼需要這麼多的錢
這份記錄最有價值的地方不是2年
這個數字A一發展太快 任何固定
時間差都可能在一次模型釋出後改變
真正重要的是 文峰承認了一種結構工程
效率能夠緩解算力短缺 卻不能取消算力
國產晶片能夠承擔部分任務 卻還沒有
完全替代英偉達在前沿訓練中的位置
這也解釋了為什麼Time三的成功不能證明美國晶片管制已經失效
管制從來不可能讓中國突然停止訓練模型
中國在限制實施前就已經擁有大量的因為達支配了
還可以透過第三國雲端和灰色渠道獲取部分裝置
中國團隊也會用軟體最佳化提高舊的晶片的效率
管制真正要做的是讓中國獲得下一代的晶片更困難
建設超大叢集更昂貴 並減少
它可以同時進行的前沿實驗的數量
中國仍然做出機敏說明管制
不是一張密不透風的牆 但它不說明牆完全不存在
如果連IPSec的創始人的內部
判斷都已經把算力視為主要約束的話
那麼把一次模型釋出解釋成為中國已經繞過了晶片
差距就不是技術判斷 而是政治宣傳了
接下來要看的就是這項約束究竟有多大
根據Apple
II對於公開叢集的統計 截至2025年5月 美國大約佔全球GPS
叢集計算能力的4分之3 中國約佔15%
由於很多企業和軍事設施不公開 這不可能是一張完整的地圖
但它揭示的數量級差距與兩國資料中心和晶片供應情況基本一致
美國的優勢不是隻是一家公司或者一款晶片
它擁有OpeningPack、GoogleMeta、
西醫等多家相互競爭的前沿實驗室
擁有微軟、亞馬遜和谷歌的大型雲平臺 擁有英偉達
和AMD的晶片設計能力 還有大和高速的互聯生態
中國當然也有自己的優勢 工程師數量龐大 國內競爭激烈 製造業場景
豐富 政府能夠集中投入 企業運用較低的價格爭奪市場
華為晶片和國產軟體生態也都在進步
但國產替代不是一句口號 而是要同時解決先進位制度
良率、高頻寬記憶體封裝、晶片建
通訊軟體相容和大規模的叢集穩定性
某一張晶片在紙面算力上接近 不等於幾萬張晶片
連在一起也能達到相同效率
前沿AR越來越像一項國家級的工業工程 晶片只是發動機 資料中心
是輛汽車 還需要電力、冷卻、網路軟體和能夠長期維護系統的人
這就是為什麼公開模型能力差距可以很小 國家專利差距卻仍然很大
追趕者可以集中資源訓練一款明星模型 在公開測試上與領先者並跑
領先者則可以同時訓練語言、影片、機器人、科學、
生物和國防模型 並讓多家公司探索不同路線
前者可以贏得一場重要的比賽 後者則擁有舉辦多場比賽的能力
當然 美國也並非高枕無憂
中國已經證明它可以迅速吸收公開研究
把有限硬體使用得更有效率 並透過開放權重爭奪全球開發者
如果美國把領先浪費在內部監管混亂、能源建設遲緩
和對盟友的技術封鎖上 結構性優勢當然可能會縮小
但可能失去領先與即將全面被超越並不是一句話
截至今天 Kimi證明中國具備前沿產品
能力 Deepak證明中國具備出色的演算法與系統最佳化能力
千萬等模型證明中國的開放權重生態已經形成規模
它們共同構成嚴肅挑戰 卻沒有證明中國
已經擁有與美國相當的前沿算力、先進晶片
供應鏈和多路線的探索能力
現在我們可以做出最後裁決了
中國II到底落後美國多久?
如果一定要把答案壓縮成一個數字的話
這個節目反而會重複它正在批評的錯誤
在公開語言模型和程式設計能力上 中國不是落後幾年
Timmy和千萬已經進入世界第一梯隊 部分任務可以並跑
甚至是短暫領先 整體的產品差距很可能以月計算
在價格、工程效率和開放權重傳播上 中國
不僅是追趕者在一些方面已經取得了主動
美國公司如果繼續只提供貴的封閉模型
確實可能會把大量全球開發者讓給中國
但在總算裡 先進的GPU大型叢集半導體制造裝置
和同時探索多條前沿線路的能力上 美國仍有明顯的結構性優勢
這不是一張排行榜可以抹掉的差距
也不是把模型檔案上傳到網上就能填平的差距
所以 拼命快三證明的不是中國已經全面超過美國
而是中國已經能夠用有限聳立、開放權重和激烈競爭
把某些A三產品推進世界第一梯隊
這值得美國警惕 卻不值得恐慌
一張排行榜測量的是今天公開的一場比賽 國家
依然實力決定的是誰有能力不斷地舉辦下一場比賽
承擔更多失敗 製造更先進的晶片
並探索尚不存在的技術路線
中國已經學會用較少的籌碼打出一手好牌
但美國仍然擁有更多籌碼、更大牌桌
也仍然控制著製造大部分高階籌碼的機器
中國也還很強 是真的 美國不能自滿也是真的
但從這兩句話跳到中國即將全面超越美國 不是技術分析
而是把北京的宣傳、矽谷的利益和媒體的焦慮
包裝成了一個並不存在的必然結局
我們的立場很清楚 不能因為反對中共就低估中國的工程師 也不能
因為梯米贏了幾場比賽就替中共宣佈一場尚未發生的全面勝利
真正能夠解除焦慮的 不是另外一套自我安慰的宣傳 而是看清現實
美國的領先正在受到挑戰 卻遠沒有被抹去
中國已經追到產品前線 卻
仍沒有控制決定下一代AR的整條工業底座
模型可以下載 算力不能下載排行榜
可以追平製造排行榜背後的那座機器的能力仍然沒有追平
這才是Kimi快三浪潮背後的真相
好 今天我們就聊到 如果這些節目對你有價值 請點贊
開啟小鈴鐺轉發 也歡迎訂閱本頻道
有條件的朋友們可以加入會員支援我們這個小頻道的發展
我是來自考中邏輯的妖精 我們下期再見!
全部回覆 (0)

暫無回覆,快來發表第一條觀點吧

發表觀點與回覆