周三(7月23日),歐美權威智庫在進行初步測試後發現,中國初創公司月之暗面(Moonshot AI)的最新模型Kimi K3,性能顯著低於美國領先的前沿AI模型。
月之暗面於7月16日發布Kimi K3,並計劃於同月27日發布開源版本。在美中人工智慧競爭激烈的背景下,該模型因在一些行業基準測試中的表現優於多家美國AI公司,已引發全球關注。
英國人工智慧安全研究所(UK AISI)和美國人工智慧標準與創新中心(CAISI)對Kimi K3進行聯合評估後指出,在初步網絡能力評估中,Kimi K3的網絡能力顯著低於美國最新前沿模型,尤其是在穩定性和成功率上遠低於後者。
評估重點考察兩部分,一個是通過ExploitBench測試其對41個V8漏洞進行崩潰復現、任意讀寫、控制流劫持和代碼執行的能力;另一個是通過模擬企業網絡測試其自主完成多步驟攻擊鏈的水平,並觀察安全護欄是否會阻止攻擊行為。
結果顯示,Kimi K3明顯強於GLM-5.2等中國模型,甚至能偶爾完成完整攻擊鏈,但在穩定實現任意代碼執行、攻擊成功率和綜合能力上仍落後於美國最先進的閉源模型。GLM-5.2是智譜AI(Zhipu AI)發布的旗艦級大型語言模型。
在開發漏洞利用程序上,Kimi K3的性能顯著低於美國最新的前沿網絡模型。美國頂尖模型在約一半樣本中能夠構建完整漏洞利用鏈,而Kimi K3和GLM-5.2雖然能發現和復現不少漏洞,卻沒有完成從漏洞到任意代碼執行的完整閉環。
具體而言,Kimi K3平均僅完成了32個步驟攻擊路徑中的第17個步驟,而美國最強大的網絡模型平均完成了28.5個步驟。GLM-5.2平均只能達到第11步。
此外,美國頂尖模型的綜合成績也顯著領先,分別比Kimi K3高約44個百分點,比GLM-5.2高約51.8個百分點。
在攻擊成功率上,在10次嘗試中,Kimi K3有一次在1億代幣的限制下成功完成了「The Last Ones」(TLO)網絡攻擊範圍的測試。
這表明,在獲得初始網絡訪問權限並被賦予指令後,Kimi K3已能夠自主攻擊小型、防禦薄弱且易受攻擊的企業系統。

2026年7月18日,在上海舉行的世界人工智慧大會(WAIC)上,月之暗面(Moonshot AI)攤位上展示了Kimi的標誌和Kimi K3模型。(Hector Retamal/AFP via Getty Images)
但能夠解決TLO問題已不是少數模型的專屬能力。智庫指出,在之前的測試中,已有四個公開發布的閉權重模型(Closed-Weight Model,也常被稱為閉源模型)解決了TLO問題,性能最佳者在10次嘗試中成功率能達到6至7次。Kimi K3在標準的1億代幣限制下,僅在10次嘗試中成功了一次。
美國商務部長盧特尼克(Howard Lutnick)周三在社交媒體X上發帖說,「CAISI的最新報告顯示,Kimi K3仍然落後於美國領先的前沿人工智慧模型。」
「美國之所以能夠在前沿人工智慧領域保持領先地位,是因為我們擁有世界上最偉大的創新者和技術專家。」他寫道。
美國中央情報局(CIA)局長拉特克利夫(John Ratcliffe)7月中旬出席賓夕法尼亞州國防與創新峰會時也表示,美國在體制上比中共治下的中國更有優勢,因為在中共體制下,個人只能聽命於黨國。
「他們竊取、複製,還有用國家補貼。這就是他們的『成功』模式。」他說。
中情局局長表示,美國不能失去在高端技術上對北京的領先優勢,而保持這種優勢的唯一方法就是不要陷入政治正確的窠臼。















