影片筆記:中国开源模型的强劲对手来了? 拆解Inkling:美国AI的开源反击
一句話總結
Thinking Machines 公司發布的首個開放權重模型 Inkling,透過「可控思考努力」機制與工程模組化趨勢,在成本與效能間取得平衡,並展現 Agentic 自我微調能力,被視為美國開放權重陣營對抗中國模型(如 Kimi、GLM)的重要戰略佈局。
核心重點
地緣與格局競爭:Inkling 作為美國開放權重陣營的代表,與中國模型(Kimi、GLM)形成競爭與互補。儘管中國模型表現搶眼,Inkling 被評價為「中國以外最好的開放權重模型」及「目前最強的美國開放權重模型」,推動全球 AI 生態多樣化。
工程優化與模組化:Hugging Face 團隊僅透過替換兩行底層代碼(Causal Con v1D 與 Flash Attention- 4),即實現約 15% 的推理吞吐量提升。這展現了 AI 工程「樂高化」與模組化的趨勢,降低優化門檻。
效率與落地能力:
- 可控思考努力:引入類似「油門踏板」的機制,允許用戶在成本與效能間取得平衡。在 Terminal Bench 2.1 測試中,以約三分之一的平均生成 token 達到與 Nemotron 3 Ultra 相同的分數。
- 自我微調閉環:展示模型在工具支持下(OpenCode 與 Tinker 權限)完成「自我微調」的能力,標誌著評估標準從單純跑分轉向真實場景與可定制性。
未來趨勢預測:AI 基礎設施正走向標準化與模組化。未來應用模式將從「大模型 + 簡單提示詞」轉變為「小型定制模型 + 複雜工程系統」,企業將更傾向維護基於開放權重基座的定制模型以控制敏感數據。
詳細大綱
一、 Inkling 基本盤與市場反響
- 發布背景:
- 發布公司:Thinking Machines(由前 OpenAI CTO Mira Murati 創辦)。
- 發布時間:7月15日。
- 模型名稱:Inkling(X上被簡稱為 Thinky)。
- 技術規格:
- 架構:混合專家架構(MoE)的 Transformer 模型。
- 參數:總參數 975B(接近 1T),激活參數 41B。
- 輸入:原生支持文本、圖像和音頻。
- 數據:使用 45 萬億(45 trillion)token 數據訓練。
- 授權:Apache-2.0,允許研究、微調及一般商業集成(需遵守使用政策)。
- 市場評價:
- 被 Menlo Ventures 合伙人 Deedy Das 評價為「中國以外最好的開放權重模型」。
- Nathan Lambert 稱其為「目前最強的美國開放權重模型」。
- 在 Design Arena 的 Agentic Web App Arena 中,Elo 排名第 9,與 Claude Opus 4.6 處於同一分數區間。
二、 三大核心視角解析
#### 1. 地緣與格局:開放權重模型的生態博弈
- 中美競爭現狀:過去半年中國開放權重模型(Kimi 系列、智譜 GLM 系列)表現搶眼。
- Inkling 的定位:為美國開放權重陣營提供了一款有競爭力的大型原生多模態模型。
- 實測對比:
- Mantic AI 在未公開方法的預測評測中,Inkling 超過 Kimi K2.6。
- Inkling 輸出 token 約為 Kimi K2.6 的一半。
- 戰略意義:開放權重不僅是技術選擇,更是生態戰略,旨在擴大模型使用生態。
#### 2. 工程視角:優化的「樂高化」
- Hugging Face 的優化案例:
- 首席開源官 Lysandre Debut 僅替換兩個底層實現。
- 步驟一:將
Causal Con v1D替換為開源內核causal-conv 1d,增加 4% 吞吐量。 - 步驟二:將注意力機制換為
Flash Attention- 4,增加 11% 吞吐量。 - 結果:合計提升約 15% 推理吞吐量,且未觸及最複雜的 MOE 層。
- 工程民主化:
- 內核開發者卷底層算子,模型開發者像改配置文件一樣插入最佳內核。
- 降低優化門檻,工程師可通過組合開源內核構建高效 AI 系統。
- 仍需驗證兼容性、數值正確性和真實負載表現。
#### 3. 落地與效率:可控思考的降維打擊
- 核心機制:Controllable Thinking Effort(可控思考努力)。
- 類比為「油門踏板」,等級可從 0.2 調整至 0.99。
- 效能表現:
- 在 Terminal Bench 2.1 測試中,Inkling 用約三分之一的平均生成 token,達到與 Nemotron 3 Ultra 相同的分數。
- 優勢:減少生成 token 有助於縮短延遲及降低按 token 計費費用。
- 自我微調閉環演示:
- 在人類給定目標(如「訓練成不使用字母 e 的模型」)及 OpenCode 與 Tinker 權限下。
- Inkling 自行編寫訓練任務、運行微調、評估結果並切換新權重。
- 意義:展現 Agentic 任務承擔能力,超越單純的「做題家」模型。
- 評估標準轉變:
- 從 Benchmark 跑分轉向真實場景表現、可定制性與工程化程度。
- 官方承認非最強,但追求「平衡」與「可定制性」。
- 視覺能力 MMMU Pro 測試約 73.5%,低於 Kimi K2.6 的 79%,但團隊認為這非唯一指標。
三、 未來趨勢與啟示
- AI 基礎設施樂高化時代來臨:
- 從多模態輸入表示到推理內核,環節正被標準化和模組化。
- 競爭力在於熟練使用開源社區的「零件」。
- 開發者新技能樹:
- 掌握 Tinker 等平台,用業務數據微調基座模型。
- 算力決定下限,工程實踐決定上限。
- 企業落地挑戰:
- 開放權重降低定制門檻,但未消除工程成本(數據治理、評測、部署、安全)。
- 目前仍難在普通企業服務器輕鬆本地運行,需高端多卡服務器或第三方 API。
- 預測:
- 未來應用模式將從「大模型 + 簡單提示詞」轉變為「小型定制模型 + 複雜工程系統」。
- 更多公司將維護基於 Inkling 等權重基座的定制模型,以控制敏感數據。
- 多模態模型將成為能完成複雜任務的數字協作者(Agentic Web 開發、長流程編碼)。
工具 / 模型 / 名詞整理
- 模型/產品名稱:
- Inkling(Thinking Machines 發布的首個模型,X上簡稱為 Thinky)
- Kimi(提及 Kimi K2.6)
- GLM(智譜系列)
- Nemotron 3 Ultra
- Claude Opus 4.6
- OpenAI
- Thinking Machines(公司名)
- OpenCode
- Tinker(平台名,文中亦出現 Tinker平台)
- Mantic AI
- Design Arena
- Agentic Web App Arena
- Terminal Bench 2.1
- MMMU Pro
- 技術/架構/內核名稱:
- MoE(混合專家架構)
- Transformer
- Causal Con v1D
- causal-conv 1d
- Flash Attention- 4
- CUDA
- NV FP4(量化權重格式)
- Apache-2.0(授權協議)
- Elo(評分系統)
- Agentic Web App
- Agentic Web 開發
- 組織/機構名稱:
- OpenAI
- Hugging Face
- Menlo Ventures
- 智譜
- 人物名稱:
- Mira Murati(前 OpenAI CTO,Thinking Machines CEO)
- Nathan Lambert
- Lysandre Debut(Hugging Face 首席開源官,文中亦寫作 Lys andre)
- Deedy Das(Menlo Ventures 合伙人)
- 为什么叫QQ(講者)
操作流程整理
Inkling 模型發布與評估:
- Thinking Machines 發布 Inkling 模型(MoE 架構,975B 總參數)。
- 市場反響:被評價為美國最強開放權重模型,在 Design Arena 排名靠前。
工程優化流程(Hugging Face 案例):
- 識別底層實現瓶頸。
- 替換
Causal Con v1D為開源內核causal-conv 1d(提升 4% 吞吐量)。 - 替換注意力機制為
Flash Attention- 4(提升 11% 吞吐量)。 - 驗證兼容性與數值正確性,實現總體約 15% 的推理吞吐量提升。
可控思考努力應用流程:
- 用戶設定「可控思考努力」等級(0.2 至 0.99)。
- 模型根據設定調整生成 token 數量與計算資源投入。
- 在 Terminal Bench 2.1 等測試中,以較少 token 達成與高性能模型(Nemotron 3 Ultra)相當的分數。
自我微調閉環演示流程:
- 人類給定目標(例如:訓練成不使用字母 e 的模型)。
- 授予 Inkling OpenCode 與 Tinker 權限。
- Inkling 自行編寫訓練任務。
- 運行微調程序。
- 評估結果並切換新權重。
值得注意的限制或風險
- 本地運行難度:目前仍難在普通企業服務器輕鬆本地運行,需高端多卡服務器或第三方 API。
- 工程成本未消除:開放權重雖降低定制門檻,但未消除數據治理、評測、部署及安全等工程成本。
- 視覺能力差距:視覺能力 MMMU Pro 測試約 73.5%,低於 Kimi K2.6 的 79%。
- 兼容性與數值驗證:模組化優化仍需驗證兼容性、數值正確性和真實負載表現。
- 官方定位:官方承認 Inkling 並非當前最強模型,追求的是「平衡」與「可定制性」。
逐字稿辨識疑點
- Lys andre Debut:逐字稿中出現兩次,一次為「Lys andre Debut」,一次為「Lysandre」。疑點:人名拼寫可能為聽寫錯誤,通常 Hugging Face 首席開源官為 Lysandre Debut 或類似拼寫,但依規則僅標註為疑點,不更正。
- Causal Con v1D:疑點:技術術語拼寫疑似錯誤,可能指
Causal Conv 1D或相關卷積層名稱,但依規則保留原樣。 - Flash Attention- 4:疑點:技術術語中間有空格,疑點:可能為
Flash Attention-2或Flash Attention 4的聽寫差異,依規則保留原樣。 - 45 萬億個 token:疑點:數字單位「萬億」在中文語境下通常指 $10^{14}$,但需查證該模型實際訓練數據量級是否為此數值,或為口誤。
- Terminal Bench 2.1:疑點:Benchmark 名稱及版本號需查證是否存在此特定版本。
- MMMU Pro:疑點:Benchmark 名稱,疑點:通常為 MMMU,需查證是否有 Pro 版本。
- Kimi K2.6:疑點:Kimi 模型版本號,疑點:需查證是否存在 K2.6 版本。
- Nemotron 3 Ultra:疑點:模型名稱,疑點:需查證是否存在此特定版本或型號。
- Design Arena:疑點:平台或排行榜名稱,疑點:需查證是否為特定評測平台。
- Agentic Web App Arena:疑點:排行榜名稱,疑點:需查證是否為特定評測平台。
- Thinky:疑點:Inkling 在 X 上的簡稱,疑點:需查證是否為社區通用簡稱。
- 为什么叫QQ:疑點:講者自稱,疑點:可能為暱稱或筆誤,依規則保留原樣。
可延伸追問
Inkling 的「可控思考努力」機制在實際商業應用中,如何精確量化成本與效能的邊際效益?
Hugging Face 的模組化優化案例是否可複製到其他 MoE 架構模型?其兼容性驗證標準為何?
面對中國模型(Kimi、GLM)的競爭,美國開放權重陣營在生態建設上是否有具體的聯合策略?
Inkling 在「自我微調」閉環中,如何確保訓練數據的安全性與隱私保護?
企業在導入 Inkling 等開放權重模型時,應如何評估並平衡「高端多卡服務器」的硬體投入與 API 調用成本?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。