# 影片筆記:Claude Code最强平替来了:Kimi K3超越Opus 4.8,登榜史上最大开源模型! ## 一句話總結 月之暗面(Moonshot AI)於 7 月 16 日正式開放參數高達 2.8 萬億的 KIMI K3 模型,該模型在 GPTWALL 評測中獲得全球第三名,並引入 KDA 技術將上下文長度提升至 100 萬 Token;然而實測顯示其生成耗時極長(10-20 分鐘),且低階會員面臨嚴格的用量限制與上下文長度限制,目前權重尚未開源,個人本地運行難度極高。 ## 核心重點 1. **發布與技術規格**:KIMI K3 於 7 月 16 日晚間正式上線,參數規模達 2.8 萬億,超越此前開源最大模型 Deepseek(1.6 萬億)。 2. **架構創新**: * 引入 **KDA (KIMI Delta Tension 混合線性注意力)** 技術,解決傳統注意力計算量隨上下文平方級上漲的問題。 * 採用混合專家系統(MoE),總共 896 個專家,每次推理僅激活 16 個。 * 引入注意力殘差技術,提升訓練效率至 KIMI K2 的 2.5 倍。 * 上下文長度從 K2 的 256K 提升至 **100 萬 Token**。 3. **評測成績**: * 在 GPTWALL 評測中得分 1687 分,全球排名第三(僅次於 Cloud5 和 GPT5.6 瘦)。 * 在 GP2A Diamond 和 BlowComp 評測中均取得當時公開成績最高或前列。 4. **實測問題**: * **耗時極長**:生成 PPT 或開發遊戲任務需 10-20 分鐘,遠超預期。 * **用量限制嚴格**:99 元/月會員在 KIMI Code 中使用 K3,僅完成少量步驟即達 5 小時用量限制,且週用量佔比高。 * **上下文限制**:第二等級會員(99 元/月)不支持 100 萬上下文,僅支持 256K(需 200 元/月會員才支持 100 萬上下文)。 5. **價格與開源現狀**: * 輸入價格 3 美元/100 萬 Token,輸出 15 美元/100 萬 Token,緩存命中後輸入僅 3 毛。 * 官方承諾 7 月 27 日前開放權重,但 2.8 萬億參數屬於數據中心級別,個人本地難以運行。 ## 詳細大綱 ### 1. 發布背景與時間線 * **時間點**:7 月 15 日促銷頁面泄露,7 月 16 日晚間正式上線。 * **發布渠道**:KIMI APP 及 KIMI Code。 * **商業背景**:正值上海世界人工智能大會前,月之暗面正在談新一輪融資,估值約 315 億美元。 ### 2. 技術規格與架構創新 * **參數規模**:2.8 萬億參數,是此前開源最大模型 Deepseek(1.6 萬億)的兩倍。 * **KDA (KIMI Delta Tension 混合線性注意力)**: * 每四層中,三層使用線性注意力,一層使用全注意力。 * 換取 100 萬 Token 上下文長度(K2 為 256K,翻 4 倍)。 * **注意力殘差**:讓深層網絡直接接力淺層注意力信息。 * **混合專家系統 (MoE)**:總共 896 個專家,每次推理僅激活 16 個。 * **訓練效率**:整體訓練效率達到 KIMI K2 的 2.5 倍。 ### 3. 評測成績單 * **GPTWALL**(44 個職業真實工作任務評測): * K3 得分 1687 分,全球第三。 * 第一名:Cloud5。 * 第二名:GPT5.6 瘦。 * 注:Cloud 的 OPUS4.8 被擠到後面一名。 * **GP2A Diamond**(研究生級別科學題): * 得分 93.5%,為所有看源模型最高。 * **BlowComp**(網上檢索問題答案): * 得分 91.2%,為當時公開成績最高。 ### 4. 實測案例與問題 * **案例一:生成 PPT** * 任務:根據官方報導及整理文件,生成不低於 12 頁的 PPT 幻燈片,並以網頁形式展現。 * 結果:版面佈局、參數提取、配色、架構拆解圖表設計一次性完成,無明顯錯誤,可直接使用。 * 問題:耗時極長(十幾分鐘),遠超預期(以往 GPT 或 Cloud 通常在 10 分鐘內)。 * **案例二:體感消消樂遊戲開發** * 任務:基於現有體感監視器框架,增加體感消消樂遊戲。 * 問題 1:耗時極久(10-20 分鐘未完成)。 * 問題 2:用量限制嚴格。 * 99 元/月會員(第二等級)在 KIMI Code 中使用 K3。 * 僅完成第一條 To-Do 步驟,5 小時用量限制即達標。 * 週用量達到 20%。 * 第二等級會員不支持 100 萬上下文,僅支持 256K(需 200 元/月會員才支持 100 萬上下文)。 ### 5. 價格與開源意義 * **價格**: * 輸入:3 美元 / 100 萬 Token。 * 輸出:15 美元 / 100 萬 Token。 * 緩存命中:輸入僅 3 毛。 * **開源現狀**: * 目前僅為「期貨」,權重未開放。 * 官方承諾 7 月 27 日前放出完整權重和技術報告。 * **本地運行難度**: * 2.8 萬億參數屬於數據中心級別。 * 即使擁有 1.5TB 內存的 MGDO 集群也難以運行。 * 開源意義在於讓第三方平台便宜運行,而非個人本地下載運行。 ## 工具 / 模型 / 名詞整理 * **KIMI K3**:月之暗面推出的模型,參數 2.8 萬億。 * **Deepseek**:開源模型,參數 1.6 萬億。 * **Cloud5**:評測第一名。 * **GPT5.6 瘦**:評測第二名。 * **OPUS4.8**:Cloud 旗下模型,被 K3 擠到後面。 * **KIMI APP**:月之暗面推出的應用程式。 * **KIMI Code**:月之暗面推出的代碼工具。 * **KIMI K2**:前代模型,上下文 256K。 * **KDA (KIMI Delta Tension 混合線性注意力)**:K3 引入的注意力技術。 * **GPTWALL**:評測項目,職業真實工作任務。 * **GP2A Diamond**:評測項目,研究生級別科學題。 * **BlowComp**:評測項目,網上檢索問題答案。 * **KitaHub**:代碼開運平台(疑似 GitHub 聽寫錯誤)。 * **MGDO 集群**:提及擁有 1.5TB 內存的集群(疑似 H100/A100 或特定顯存集群聽寫錯誤)。 * **GPT**:提及作為對比。 * **Fibre5**:提及作為對比(疑似 Llama 或其他模型聽寫錯誤)。 ## 操作流程整理 1. **訪問與使用**: * 用戶通過 KIMI APP 或 KIMI Code 訪問 KIMI K3 模型。 2. **任務執行實測**: * **PPT 生成任務**: 1. 輸入官方報導及整理文件。 2. 要求生成不低於 12 頁的 PPT 幻燈片,並以網頁形式展現。 3. 觀察結果:版面佈局、參數提取、配色、架構拆解圖表設計一次性完成。 4. 記錄耗時:發現耗時極長(十幾分鐘)。 * **遊戲開發任務**: 1. 基於現有體感監視器框架,要求增加體感消消樂遊戲。 2. 觀察結果:耗時極久(10-20 分鐘未完成)。 3. 檢查用量:發現 99 元/月會員僅完成第一條 To-Do 步驟,5 小時用量限制即達標,週用量達到 20%。 4. 檢查上下文支持:確認第二等級會員不支持 100 萬上下文,僅支持 256K。 3. **價格與開源查詢**: * 查詢輸入價格(3 美元/100 萬 Token)、輸出價格(15 美元/100 萬 Token)及緩存命中價格(輸入僅 3 毛)。 * 確認開源承諾時間為 7 月 27 日前。 ## 值得注意的限制或風險 1. **性能與效率風險**: * 生成任務耗時極長(10-20 分鐘),遠超預期,可能影響生產力。 * 對於低階會員(99 元/月),用量限制嚴格,僅完成少量步驟即達上限。 2. **功能限制風險**: * 第二等級會員(99 元/月)不支持 100 萬上下文,僅支持 256K,需升級至 200 元/月會員才支持 100 萬上下文。 3. **本地運行風險**: * 2.8 萬億參數屬於數據中心級別,即使擁有 1.5TB 內存的 MGDO 集群也難以運行,個人本地運行難度極高。 4. **開源不確定性**: * 目前權重未開放,僅為「期貨」,官方承諾 7 月 27 日前放出完整權重和技術報告,但實際開源情況尚待確認。 ## 逐字稿辨識疑點 * **月資暗面**:應為「月之暗面」(Moonshot AI 的中文名稱)。 * **Cloud5**:常見模型命名中較少見,需查證是否為特定評測中的代號或筆誤。 * **GPT5.6 瘦**:需查證是否為特定版本或聽寫錯誤(如 GPT-4o, GPT-4.5 等)。 * **B原刺**:語意不通,疑似「原生旗艦」或「閉源旗艦」的聽寫錯誤。 * **恒**:語境為「價格又有多恒」,疑似「低」或「貴」的聽寫錯誤。 * **KDA, KIMI Delta Tension**:需查證此縮寫與全稱是否為官方正式命名。 * **Planter**:語境為「發了一個簡單的報告,以及一個 Planter」,疑似「Prompt」的聽寫錯誤。 * **幻燈篇**:疑似「幻燈片」的聽寫錯誤。 * **Scale**:語境為「沒有創建任何 Scale」,疑似「Scale」指代規模或特定設置,或為「Cache」等詞的誤聽。 * **KitaHub**:疑似「GitHub」的聽寫錯誤。 * **GPT5.64**:疑似「GPT-4」或「GPT-4o」的聽寫錯誤。 * **Fibre5**:疑似「Llama 3」或其他模型名稱的聽寫錯誤。 * **MGDO**:疑似「H100」、「A100」或「GPU」集群的聽寫錯誤。 * **看源模型**:疑似「開源模型」的聽寫錯誤。 * **冷餘**:語境為「步驟設計的有點過於冷餘」,疑似「冗餘」的聽寫錯誤。 * **一個多的任務**:語境為「僅僅只是完成了一個多的任務」,疑似「一個多」或「一個」的語病或聽寫錯誤。 ## 可延伸追問 1. KIMI K3 的 KDA 技術具體如何實現線性注意力與全注意力的混合?其對模型精確度的影響為何? 2. GPTWALL 評測中 Cloud5 和 GPT5.6 瘦的具體技術架構為何?K3 為何在生成速度上表現較慢? 3. 月之暗面 315 億美元的估值依據為何?新一輪融資將如何影響 KIMI K3 的後續開發與定價策略? 4. 2.8 萬億參數的模型在數據中心級別的具體硬件需求為何?第三方平台將如何分攤運行成本? 5. 99 元/月會員的用量限制具體計算方式為何?為何僅完成第一條 To-Do 步驟即達 5 小時限制?