# 影片筆記:Claude Code最强平替来了:Kimi K3超越Opus 4.8,登榜史上最大开源模型! ## 一句話總結 月之暗面(Moonshot AI)正式開放 KIMI K3 模型,以 2.8 萬億參數刷新開源記錄並在多項評測中超越閉源大廠模型,但實測顯示其生成耗時極長、上下文長度受限且價格對開發者殺傷力大,目前權重尚未開放,僅為雲端服務狀態。 ## 核心重點 1. **發布與規格**:KIMI K3 於 7 月 16 日晚正式上線,擁有 2.8 萬億參數,採用 KDA(混合線性注意力)技術與 MoE(混合專家系統),官方宣稱支援 100 萬 Token 上下文。 2. **評測表現優異**:在 GPTWALL 真實工作任務評測中排名全球第三(僅次於 Cloud5 和 GPT5.6 瘦),並在 GP2A Diamond 科學題與 BlowComp 檢索任務中取得開源模型最高分,被視為開源模型首次站到大廠旗艦模型前面。 3. **實測問題顯著**: * **耗時極長**:生成 PPT 或開發遊戲等任務需耗時十幾分鐘至二十分鐘,遠慢於 GPT 或 Cloud 系列。 * **限制嚴格**:高階會員套餐仍受限於 256K 上下文(100 萬需更高階套餐),且用量限制嚴格(如五小時用量限制、週用量達 20%)。 * **價格與開源現狀**:輸入 3 美元/百萬 Token,輸出 15 美元/百萬 Token;權重未開放(承諾 7 月 27 日前放出),因參數龐大個人本地電腦無法運行,主要依賴雲端服務。 ## 詳細大綱 ### 一、 KIMI K3 發布背景與規格 * **發布時間與渠道**: * 7 月 15 日促銷頁面泄露,7 月 16 日晚正式上線。 * 可在 KIMI APP 及 KIMI Code 中使用。 * 發布時機緊鄰上海世界人工智能大會,且公司處於新一輪融資談判中(估值約 315 億美元)。 * **核心規格**: * **參數量**:2.8 萬億(約為前開源最大模型 Deepseek 的 1.6 萬億的兩倍)。 * **技術創新**: * **KDA (KIMI Delta Tension 混合線性注意力)**:每四層中三層使用線性注意力,一層使用全注意力,解決上下文長度平方級計算量上漲問題。 * **注意力殘差**:讓深層網絡接力淺層注意力信息。 * **訓練效率**:官方宣稱達到 KIMI K2 的 2.5 倍。 * **上下文長度**:官方宣稱支援 100 萬 Token(此前 K2 為 256K)。 * **混合專家系統 (MoE)**:總共 896 個專家,每次推理僅激活 16 個。 ### 二、 評測成績單 * **GPTWALL 評測**: * 內容:44 個職業真實工作任務(非做題)。 * 成績:1687 分,全球第三名。 * 排名:第一名 Cloud5,第二名 GPT5.6 瘦,OPUS4.8 被擠至後面。 * 意義:開源模型首次站到大廠旗艦模型前面。 * **GP2A Diamond 評測**: * 內容:研究生級別科學題。 * 成績:93.5%,目前所有開源模型中得分最高。 * **BlowComp 評測**: * 內容:網上檢索問題答案。 * 成績:91.2%,當時公開成績中最高。 ### 三、 實測案例與問題 * **案例一:生成 PPT 幻燈片** * **任務**:根據官方報導及整理文件,生成不低於 12 頁的 PPT,並以網頁形式展現。 * **結果**: * 版面佈局、配色、數據提取、架構拆解圖表設計一次性完成,無明顯錯誤,達到直接使用水平。 * 未創建任何 Skill,僅發送報告和 Planter 即可完成。 * **問題**:耗時極長,花費十幾分鐘(以往 GPT 或 Cloud 完成此類任務通常在 10 分鐘內)。 * **案例二:體感消消樂遊戲開發** * **任務**:基於現有體感監視器框架,增加「體感消消樂」遊戲。 * **結果**: * 耗時極長,運行十幾二十分鐘未完成。 * To-Do 步驟設計過於繁瑣。 * 僅完成第一條 To-Do,五小時用量限制即達標,週用量達 20%。 * **會員限制問題**: * 第二等級套餐(99 元/月)無法使用 KESA 模型(需更高等級?註:原文語意模糊,僅提及第二等級可用但受限)。 * 第二等級套餐不支援 100 萬上下文,僅支援 256K。 * 需開通 200 元/月套餐方可享受 100 萬上下文長度。 * **感受**:誠意不足,可能因算力或用戶過多導致使用量限制嚴格。 ### 四、 價格與開源現狀 * **價格**: * 輸入:3 美元 / 100 萬 Token。 * 輸出:15 美元 / 100 萬 Token。 * 緩存命中:輸入僅 3 毛(KIMI 的優勢)。 * **開源現狀(潑冷水)**: * **權重未開放**:目前僅為「期貨」,承諾 7 月 27 日前放出完整權重和技術報告。 * **本地無法運行**:2.8 萬億參數為數據中心級別,即使擁有 1.5TB 內存的 Magic Dodo 集群也跑不動。 * **開源意義**:主要讓第三方平台能便宜地跑起來,而非個人下載本地運行。 ## 工具 / 模型 / 名詞整理 * **模型/產品**: * KIMI K3 * KIMI K2 * KIMI APP * KIMI Code * Deepseek (參數 1.6 萬億) * Cloud5 * GPT5.6 瘦 * OPUS4.8 * KESA (模型名稱,出現在會員套餐描述中) * Magic Dodo (提及的集群名稱) * **評測/平台**: * GPTWALL (評測名稱) * GP2A Diamond (評測名稱) * BlowComp (評測名稱) * KitaHub (代碼託管平台) * **技術/概念**: * KDA (KIMI Delta Tension 混合線性注意力) * 注意力殘差 * 混合專家系統 (MoE) * Token (上下文長度單位) * Skill (技能/插件) * Planter (提示詞/指令,原文用詞) * To-Do (任務列表) ## 操作流程整理 1. **訪問與使用**: * 通過 KIMI APP 或 KIMI Code 訪問 KIMI K3 模型。 2. **任務執行(以 PPT 生成為例)**: * 準備官方報導及整理文件。 * 發送報告和 Planter(指令)給模型。 * 等待模型生成不低於 12 頁的 PPT 網頁版(耗時約十幾分鐘)。 * 確認版面佈局、配色、數據提取及架構拆解圖表設計無誤。 3. **任務執行(以遊戲開發為例)**: * 基於現有體感監視器框架,提出增加「體感消消樂」遊戲的需求。 * 模型生成 To-Do 步驟。 * 執行 To-Do 步驟(耗時極長,可能超過五小時用量限制)。 4. **會員與套餐選擇**: * 若需 100 萬上下文長度,需開通 200 元/月套餐。 * 第二等級套餐(99 元/月)僅支援 256K 上下文,且可能受限於特定模型(如 KESA)的使用。 ## 值得注意的限制或風險 1. **生成效率低**:相比 GPT 或 Cloud 系列,KIMI K3 在生成複雜任務(如 PPT、遊戲開發)時耗時極長(十幾分鐘至二十分鐘)。 2. **上下文長度限制**:官方宣稱支援 100 萬 Token,但高階會員套餐(第二等級)僅支援 256K,需更高階套餐才能享受 100 萬上下文。 3. **用量限制嚴格**:存在五小時用量限制及週用量限制(如達 20%),可能影響連續開發體驗。 4. **本地運行不可行**:2.8 萬億參數規模龐大,個人電腦無法運行,必須依賴雲端服務。 5. **權重未開放**:目前僅為「期貨」狀態,完整權重和技術報告承諾於 7 月 27 日前放出,當前無法進行本地部署或二次開發。 6. **價格成本**:輸入 3 美元/百萬 Token,輸出 15 美元/百萬 Token,對開發者而言成本較高。 ## 逐字稿辨識疑點 * **月資暗面**:原文用詞,疑為「月之暗面」(Moonshot AI)的聽寫錯誤。 * **Cloud5**:原文用詞,疑為某特定模型或評測版本名稱,需查證是否為常見模型變體。 * **GPT5.6 瘦**:原文用詞,疑為模型版本或特定壓縮/精簡版名稱。 * **B原刺**:原文用詞,疑為「大廠」或「閉源」的聽寫錯誤(結合上下文「開源模型第一次站到了...前面」)。 * **B月**:原文用詞,疑為「大廠」或「閉源」的聽寫錯誤(結合上下文「摸到了...門檻」)。 * **恒**:原文「價格又有多恒」,疑為「多低」或「多貴」的聽寫錯誤。 * **KDA**:原文解釋為「KIMI Delta Tension 混合線性注意力」,需查證該縮寫是否為官方正式命名。 * **GPTWALL**:評測名稱,需查證是否為標準評測基準名稱。 * **GP2A Diamond**:評測名稱,需查證是否為標準評測基準名稱。 * **BlowComp**:評測名稱,需查證是否為標準評測基準名稱。 * **Planter**:原文指代輸入的報告或指令,疑為「Prompt」或「Plan」的聽寫錯誤。 * **KitaHub**:原文指代代碼託管平台,疑為「GitHub」的聽寫錯誤。 * **Magic Dodo**:原文指代集群,需查證是否為特定硬體或集群名稱。 * **KESA**:原文在會員套餐描述中出現,疑為「KIMI」或特定模型代號的聽寫錯誤。 * **冷餘**:原文「步驟是設計的有點過於冷餘」,疑為「繁瑣」或「冗餘」的聽寫錯誤。 * **開用**:原文「全球最大開用模型」,疑為「開源」的聽寫錯誤。 ## 可延伸追問 1. KIMI K3 的 KDA(混合線性注意力)技術具體如何運作,與傳統注意力機制相比有何優勢? 2. GPTWALL、GP2A Diamond、BlowComp 等評測基準的具體評分標準是什麼? 3. 7 月 27 日放出的完整權重和技術報告將包含哪些內容?是否會開放給公眾下載? 4. KIMI K3 的 MoE(混合專家系統)架構中,896 個專家與 16 個激活專家的具體分工是什麼? 5. 針對開發者殺傷力大的價格策略,未來是否有調整計劃或更優惠的套餐?