# 影片筆記:中国开源模型的强劲对手来了? 拆解Inkling:美国AI的开源反击 ## 一句話總結 Thinking Machines 公司發布的首個開放權重模型 **Inkling**,透過「可控思考努力」機制與工程模組化趨勢,在成本與效能間取得平衡,並展現 Agentic 自我微調能力,被視為美國開放權重陣營對抗中國模型(如 Kimi、GLM)的重要戰略佈局。 ## 核心重點 1. **地緣與格局競爭**:Inkling 作為美國開放權重陣營的代表,與中國模型(Kimi、GLM)形成競爭與互補。儘管中國模型表現搶眼,Inkling 被評價為「中國以外最好的開放權重模型」及「目前最強的美國開放權重模型」,推動全球 AI 生態多樣化。 2. **工程優化與模組化**:Hugging Face 團隊僅透過替換兩行底層代碼(`Causal Con v1D` 與 `Flash Attention- 4`),即實現約 15% 的推理吞吐量提升。這展現了 AI 工程「樂高化」與模組化的趨勢,降低優化門檻。 3. **效率與落地能力**: * **可控思考努力**:引入類似「油門踏板」的機制,允許用戶在成本與效能間取得平衡。在 Terminal Bench 2.1 測試中,以約三分之一的平均生成 token 達到與 Nemotron 3 Ultra 相同的分數。 * **自我微調閉環**:展示模型在工具支持下(OpenCode 與 Tinker 權限)完成「自我微調」的能力,標誌著評估標準從單純跑分轉向真實場景與可定制性。 4. **未來趨勢預測**:AI 基礎設施正走向標準化與模組化。未來應用模式將從「大模型 + 簡單提示詞」轉變為「小型定制模型 + 複雜工程系統」,企業將更傾向維護基於開放權重基座的定制模型以控制敏感數據。 ## 詳細大綱 ### 一、 Inkling 基本盤與市場反響 * **發布背景**: * 發布公司:Thinking Machines(由前 OpenAI CTO Mira Murati 創辦)。 * 發布時間:7月15日。 * 模型名稱:Inkling(X上被簡稱為 Thinky)。 * **技術規格**: * 架構:混合專家架構(MoE)的 Transformer 模型。 * 參數:總參數 975B(接近 1T),激活參數 41B。 * 輸入:原生支持文本、圖像和音頻。 * 數據:使用 45 萬億(45 trillion)token 數據訓練。 * 授權:Apache-2.0,允許研究、微調及一般商業集成(需遵守使用政策)。 * **市場評價**: * 被 Menlo Ventures 合伙人 Deedy Das 評價為「中國以外最好的開放權重模型」。 * Nathan Lambert 稱其為「目前最強的美國開放權重模型」。 * 在 Design Arena 的 Agentic Web App Arena 中,Elo 排名第 9,與 Claude Opus 4.6 處於同一分數區間。 ### 二、 三大核心視角解析 #### 1. 地緣與格局:開放權重模型的生態博弈 * **中美競爭現狀**:過去半年中國開放權重模型(Kimi 系列、智譜 GLM 系列)表現搶眼。 * **Inkling 的定位**:為美國開放權重陣營提供了一款有競爭力的大型原生多模態模型。 * **實測對比**: * Mantic AI 在未公開方法的預測評測中,Inkling 超過 Kimi K2.6。 * Inkling 輸出 token 約為 Kimi K2.6 的一半。 * **戰略意義**:開放權重不僅是技術選擇,更是生態戰略,旨在擴大模型使用生態。 #### 2. 工程視角:優化的「樂高化」 * **Hugging Face 的優化案例**: * 首席開源官 Lysandre Debut 僅替換兩個底層實現。 * **步驟一**:將 `Causal Con v1D` 替換為開源內核 `causal-conv 1d`,增加 4% 吞吐量。 * **步驟二**:將注意力機制換為 `Flash Attention- 4`,增加 11% 吞吐量。 * **結果**:合計提升約 15% 推理吞吐量,且未觸及最複雜的 MOE 層。 * **工程民主化**: * 內核開發者卷底層算子,模型開發者像改配置文件一樣插入最佳內核。 * 降低優化門檻,工程師可通過組合開源內核構建高效 AI 系統。 * 仍需驗證兼容性、數值正確性和真實負載表現。 #### 3. 落地與效率:可控思考的降維打擊 * **核心機制**:Controllable Thinking Effort(可控思考努力)。 * 類比為「油門踏板」,等級可從 0.2 調整至 0.99。 * **效能表現**: * 在 Terminal Bench 2.1 測試中,Inkling 用約三分之一的平均生成 token,達到與 Nemotron 3 Ultra 相同的分數。 * 優勢:減少生成 token 有助於縮短延遲及降低按 token 計費費用。 * **自我微調閉環演示**: * 在人類給定目標(如「訓練成不使用字母 e 的模型」)及 OpenCode 與 Tinker 權限下。 * Inkling 自行編寫訓練任務、運行微調、評估結果並切換新權重。 * 意義:展現 Agentic 任務承擔能力,超越單純的「做題家」模型。 * **評估標準轉變**: * 從 Benchmark 跑分轉向真實場景表現、可定制性與工程化程度。 * 官方承認非最強,但追求「平衡」與「可定制性」。 * 視覺能力 MMMU Pro 測試約 73.5%,低於 Kimi K2.6 的 79%,但團隊認為這非唯一指標。 ### 三、 未來趨勢與啟示 * **AI 基礎設施樂高化時代來臨**: * 從多模態輸入表示到推理內核,環節正被標準化和模組化。 * 競爭力在於熟練使用開源社區的「零件」。 * **開發者新技能樹**: * 掌握 Tinker 等平台,用業務數據微調基座模型。 * 算力決定下限,工程實踐決定上限。 * **企業落地挑戰**: * 開放權重降低定制門檻,但未消除工程成本(數據治理、評測、部署、安全)。 * 目前仍難在普通企業服務器輕鬆本地運行,需高端多卡服務器或第三方 API。 * **預測**: * 未來應用模式將從「大模型 + 簡單提示詞」轉變為「小型定制模型 + 複雜工程系統」。 * 更多公司將維護基於 Inkling 等權重基座的定制模型,以控制敏感數據。 * 多模態模型將成為能完成複雜任務的數字協作者(Agentic Web 開發、長流程編碼)。 ## 工具 / 模型 / 名詞整理 * **模型/產品名稱**: * **Inkling**(Thinking Machines 發布的首個模型,X上簡稱為 **Thinky**) * **Kimi**(提及 Kimi K2.6) * **GLM**(智譜系列) * **Nemotron 3 Ultra** * **Claude Opus 4.6** * **OpenAI** * **Thinking Machines**(公司名) * **OpenCode** * **Tinker**(平台名,文中亦出現 **Tinker平台**) * **Mantic AI** * **Design Arena** * **Agentic Web App Arena** * **Terminal Bench 2.1** * **MMMU Pro** * **技術/架構/內核名稱**: * **MoE**(混合專家架構) * **Transformer** * **Causal Con v1D** * **causal-conv 1d** * **Flash Attention- 4** * **CUDA** * **NV FP4**(量化權重格式) * **Apache-2.0**(授權協議) * **Elo**(評分系統) * **Agentic Web App** * **Agentic Web 開發** * **組織/機構名稱**: * **OpenAI** * **Hugging Face** * **Menlo Ventures** * **智譜** * **人物名稱**: * **Mira Murati**(前 OpenAI CTO,Thinking Machines CEO) * **Nathan Lambert** * **Lysandre Debut**(Hugging Face 首席開源官,文中亦寫作 **Lys andre**) * **Deedy Das**(Menlo Ventures 合伙人) * **为什么叫QQ**(講者) ## 操作流程整理 1. **Inkling 模型發布與評估**: * Thinking Machines 發布 Inkling 模型(MoE 架構,975B 總參數)。 * 市場反響:被評價為美國最強開放權重模型,在 Design Arena 排名靠前。 2. **工程優化流程(Hugging Face 案例)**: * 識別底層實現瓶頸。 * 替換 `Causal Con v1D` 為開源內核 `causal-conv 1d`(提升 4% 吞吐量)。 * 替換注意力機制為 `Flash Attention- 4`(提升 11% 吞吐量)。 * 驗證兼容性與數值正確性,實現總體約 15% 的推理吞吐量提升。 3. **可控思考努力應用流程**: * 用戶設定「可控思考努力」等級(0.2 至 0.99)。 * 模型根據設定調整生成 token 數量與計算資源投入。 * 在 Terminal Bench 2.1 等測試中,以較少 token 達成與高性能模型(Nemotron 3 Ultra)相當的分數。 4. **自我微調閉環演示流程**: * 人類給定目標(例如:訓練成不使用字母 e 的模型)。 * 授予 Inkling OpenCode 與 Tinker 權限。 * Inkling 自行編寫訓練任務。 * 運行微調程序。 * 評估結果並切換新權重。 ## 值得注意的限制或風險 * **本地運行難度**:目前仍難在普通企業服務器輕鬆本地運行,需高端多卡服務器或第三方 API。 * **工程成本未消除**:開放權重雖降低定制門檻,但未消除數據治理、評測、部署及安全等工程成本。 * **視覺能力差距**:視覺能力 MMMU Pro 測試約 73.5%,低於 Kimi K2.6 的 79%。 * **兼容性與數值驗證**:模組化優化仍需驗證兼容性、數值正確性和真實負載表現。 * **官方定位**:官方承認 Inkling 並非當前最強模型,追求的是「平衡」與「可定制性」。 ## 逐字稿辨識疑點 * **Lys andre Debut**:逐字稿中出現兩次,一次為「Lys andre Debut」,一次為「Lysandre」。疑點:人名拼寫可能為聽寫錯誤,通常 Hugging Face 首席開源官為 Lysandre Debut 或類似拼寫,但依規則僅標註為疑點,不更正。 * **Causal Con v1D**:疑點:技術術語拼寫疑似錯誤,可能指 `Causal Conv 1D` 或相關卷積層名稱,但依規則保留原樣。 * **Flash Attention- 4**:疑點:技術術語中間有空格,疑點:可能為 `Flash Attention-2` 或 `Flash Attention 4` 的聽寫差異,依規則保留原樣。 * **45 萬億個 token**:疑點:數字單位「萬億」在中文語境下通常指 $10^{14}$,但需查證該模型實際訓練數據量級是否為此數值,或為口誤。 * **Terminal Bench 2.1**:疑點:Benchmark 名稱及版本號需查證是否存在此特定版本。 * **MMMU Pro**:疑點:Benchmark 名稱,疑點:通常為 MMMU,需查證是否有 Pro 版本。 * **Kimi K2.6**:疑點:Kimi 模型版本號,疑點:需查證是否存在 K2.6 版本。 * **Nemotron 3 Ultra**:疑點:模型名稱,疑點:需查證是否存在此特定版本或型號。 * **Design Arena**:疑點:平台或排行榜名稱,疑點:需查證是否為特定評測平台。 * **Agentic Web App Arena**:疑點:排行榜名稱,疑點:需查證是否為特定評測平台。 * **Thinky**:疑點:Inkling 在 X 上的簡稱,疑點:需查證是否為社區通用簡稱。 * **为什么叫QQ**:疑點:講者自稱,疑點:可能為暱稱或筆誤,依規則保留原樣。 ## 可延伸追問 1. Inkling 的「可控思考努力」機制在實際商業應用中,如何精確量化成本與效能的邊際效益? 2. Hugging Face 的模組化優化案例是否可複製到其他 MoE 架構模型?其兼容性驗證標準為何? 3. 面對中國模型(Kimi、GLM)的競爭,美國開放權重陣營在生態建設上是否有具體的聯合策略? 4. Inkling 在「自我微調」閉環中,如何確保訓練數據的安全性與隱私保護? 5. 企業在導入 Inkling 等開放權重模型時,應如何評估並平衡「高端多卡服務器」的硬體投入與 API 調用成本?