# 影片筆記:Sakana AI跑分登顶,真让日本AI追上了吗? ## 一句話總結 日本公司 Sakana AI 發布的「河豚(Fugu)」系統在 SWE-bench Pro 編程榜上取得高分,超越多家大廠模型,但講者指出其本質為「多模型編排系統」而非獨立大模型,缺乏底層技術護城河,最終可能被大廠收購以獲取日本市場渠道。 ## 核心重點 1. **跑分現象**:Sakana AI 的「河豚」系統在 SWE-bench Pro 榜單獲得 73.7 分,宣稱超越 Anthropic 的 Claude Opus 4.8(69.2 分)及 OpenAI 的 GPT-5.5(58.6 分),引發市場對日本 AI 追趕中美兩強的看法。 2. **技術本質**:Sakana AI 並未從零訓練大模型,而是採用「多模型編排系統」(Loop Agent/循環智能體),組合調度現有的第三方模型(如 GPT-5.5、Claude、DeepSeek 等)。 3. **產品線解析**: * **鯰魚(Nemuro)**:基於 DeepSeek V3.1 Terminus 後訓練的日語大模型,旨在降低日本政治歷史敏感問題的拒答率。 * **槍魚(Tuna)**:自主研發的 Agent,可長時間運行生成戰略報告。 * **河豚(Fugu)**:多模型編排系統,內部使用千問 2.5 7B 作為指揮模型進行後訓練,負責循環調度。 4. **商業模式缺陷**:純編排模式缺乏護城河,底層模型、定價權和 API 接口均掌握在 Google、OpenAI、Anthropic 等大廠手中,隨時面臨被封禁或價格調整的風險。 5. **團隊與結局預測**:Sakana AI 的核心價值在於其頂尖團隊背景(Transformer 論文作者)及日本本土政企關係(COO 出身外務省)。講者預測其最終極可能是被大廠收購以獲取日本市場渠道,而非成為獨立的競爭對手。 ## 詳細大綱 ### I. 事件背景與表面現象 * **發布時間與公司**:6月22日,日本公司 Sakana AI(薩卡納/魚 AI)發布新產品。 * **跑分表現**: * 在 SWE-bench Pro 編程榜上獲得 73.7 分。 * 超越 Anthropic 的 Claude Opus 4.8(69.2 分)及 OpenAI 的 GPT-5.5(58.6 分)。 * 宣稱部分超越自家禁用的 Mythos 和 Fable 模型。 * **市場反應**:網民歡呼日本在 AI 領域追上中美,不再是兩強遊戲。 ### II. Sakana AI 公司與產品線解析 * **公司背景**: * 2023年成立於東京。 * 核心策略:不從零打造大模型,而是重新組合編排現有模型。 * **產品線**: 1. **鯰魚(Nemuro)**:3月24日發布,日語大模型,搭配免費 Sakana Chat。 2. **槍魚(Tuna)**:6月15日發布,自主研發 Agent,可連續運行8小時生成60-100頁戰略報告(瞄準 Manus 類產品)。 3. **河豚(Fugu)**:6月22日發布,多模型編排系統。 * **創始團隊**: * **CEO David Ha**:華裔,出生於香港,加拿大多倫多大學本科,東京大學博士,曾任 Stability AI 研究負責人。 * **CTO 里昂·瓊斯(Leon Jones)**:英國人,伯明翰大學出身,Transformer 論文「Attention Is All You Need」八位作者之一,曾在谷歌工作12年。 * **COO 伊藤**:東京大學法學、紐約大學法學院,曾任日本獨角獸企業全球化市場負責人,出身日本外務省,負責政府與政企關係。 ### III. 「河豚」系統技術原理 * **本質定義**:不是單一模型,而是 AI 工作流編排系統(Loop Agent/循環智能體)。 * **運作機制**: * 打破傳統順序執行,採用循環調度。 * 多個大模型承擔不同角色:拆解任務、執行、檢查結果。 * 若檢查不滿意,則重新循環,直到滿意為止。 * **模型組成疑點**: * 不公開內部具體使用的模型清單。 * 排除自家禁用的 Fable 5 和 Mythos 5。 * 推測內部混用 GPT-5.5、Gemini 3、DeepSeek、Claude Opus 4.8 等公開模型。 * **指揮模型**:使用千問 2.5 7B 進行後訓練,負責任務拆解與循環調度。 * **鯰魚模型技術細節**: * 基於 DeepSeek V3.1 Terminus 進行後訓練。 * 參考 Llama 3.1 405B 開源底座。 * **本土化價值**:通過日語數據後訓練,將 DeepSeek 原版對日本政治歷史敏感問題的拒答率(72%)降至幾乎為零。 ### IV. 商業模式與護城河分析 * **編排無門檻**: * 多模型編排是公開的工程手段,非獨門秘技。 * 對比案例:OpenRouter 於6月12日發布「Fusion」系統,同樣將最多8個模型編排,由裁判模型融合答案,成本僅為 Fable 5 的一半。 * OpenRouter 數據顯示:75% 的提升來自裁判融合,僅 25% 來自模型多樣性。 * **缺乏護城河**: * **底層依賴**:必須使用大廠已發布的模型,無法接觸大廠未發布的最新模型。 * **定價權缺失**:利潤空間取決於大廠的 TOKEN 價格和套餐策略(如 OpenAI Plus 套餐與 API 價格差異)。 * **隨時被封禁風險**:大廠可隨時調整價格、限制用量或封禁 API 接口。 * **歷史類比**: * 類似互聯網早期的廣告優化小平台(如投放、競價、歸因優化系統)。 * 最終結局:被谷歌、Meta、蘋果、X、騰訊、字節跳動等大廠收購或消滅。 * 收購目的:獲取用戶、流量及政企關係,而非技術本身。 ### V. Sakana AI 的未來定位與結論 * **真實價值**: * 頂尖團隊(Transformer 論文作者)。 * 日本本土落地渠道與政企關係(外務省背景 COO)。 * 對 DeepSeek 模型的本土化調優能力。 * **最終結局預測**: * 不會成為獨立的大廠競爭者。 * 最大概率被谷歌日本、OpenAI 日本、Anthropic 日本或字節跳動收購。 * 收購目的:獲取日本市場渠道和關係,技術由大廠內部解決。 * **對不同群體的啟示**: * **創業者**:無底層模型時,純編排系統天花板低,僅有被收購或價格戰清洗兩條路;需擁有底層模型、獨家數據或不可替代的本地市場位置。 * **普通用戶**:盡量使用原廠模型,避免使用不透明底層的第三方編排系統,因為無法驗證結果且存在先天缺陷。 * **投資者**:評估編排層公司時,應按「被收購可能性」估值,而非「下一個 OpenAI」;警惕借來的跑分,護城河必須是自己的。 * **總結論點**: * 表面是日本 AI 追趕中美,實則是一家無底層模型的編排公司重演互聯網廣告小平台的老路。 * Sakana AI 不會變成大海裡的鯊魚,而是變成日本自家魚缸裡最貴的錦鯉,游不出那個缸,對整個 AI 行業無實質變化。 ## 工具 / 模型 / 名詞整理 * **公司/組織**: * Sakana AI(薩卡納 AI / 魚 AI) * Anthropic * OpenAI * Google(谷歌) * Stability AI * OpenRouter * DeepSeek * JVC(日本勝利公司) * 日本雅虎(Yahoo Japan) * LINE * LY Corporation * 獵豹移動 * 美國電氣公司(General Electric,歷史背景提及) * 日本外務省 * **模型/產品**: * **Sakana AI 產品**: * Fugu(河豚):多模型編排系統。 * Nemuro(鯰魚):日語大模型。 * Tuna(槍魚):自主研發 Agent。 * Sakana Chat:免費聊天工具。 * Mythos:Sakana AI 自家模型(已禁用)。 * Fable:Sakana AI 自家模型(已禁用)。 * **競爭對手/第三方模型**: * Claude Opus 4.8 * GPT-5.5 * Fable 5 * Mythos 5 * Gemini 3 * DeepSeek V3.1 Terminus * Llama 3.1 405B * 千問 2.5 7B(Qwen 2.5 7B,用於河豚系統的指揮模型後訓練) * **技術/概念**: * SWE-bench Pro:編程榜。 * Loop Agent:循環智能體。 * Fusion:OpenRouter 發布的模型聚合系統。 * Attention Is All You Need:Transformer 論文。 * API 接口。 * TOKEN:計費單位。 ## 操作流程整理 **河豚(Fugu)系統運作流程:** 1. **任務輸入**:用戶提出編程或複雜任務需求。 2. **指揮模型調度**:系統內部使用千問 2.5 7B(經後訓練)作為指揮模型,負責任務拆解與循環調度。 3. **多模型協作**: * 將任務拆解並分配給多個第三方大模型(推測包含 GPT-5.5、Gemini 3、DeepSeek、Claude Opus 4.8 等)。 * 不同模型承擔不同角色:拆解任務、執行代碼、檢查結果。 4. **循環檢查(Loop)**: * 若檢查結果不滿意,系統重新循環,調整策略或調用其他模型。 * 重複上述步驟,直到結果滿意為止。 5. **輸出結果**:生成最終答案或代碼。 **鯰魚(Nemuro)模型訓練流程:** 1. **底座選擇**:參考 Llama 3.1 405B 開源底座。 2. **基礎模型**:基於 DeepSeek V3.1 Terminus。 3. **後訓練(Post-training)**:使用日語數據進行後訓練。 4. **目標**:降低 DeepSeek 原版對日本政治歷史敏感問題的拒答率(從 72% 降至幾乎為零)。 ## 值得注意的限制或風險 1. **底層依賴風險**:Sakana AI 必須使用大廠已發布的模型,無法接觸大廠未發布的最新模型。 2. **定價權缺失**:利潤空間取決於大廠的 TOKEN 價格和套餐策略(如 OpenAI Plus 套餐與 API 價格差異),Sakana AI 無定價權。 3. **封禁風險**:大廠(Google、OpenAI、Anthropic 等)可隨時調整價格、限制用量或封禁 API 接口,導致服務中斷。 4. **數據不透明**:Sakana AI 不公開內部具體使用的模型清單,用戶無法驗證結果來源。 5. **跑分驗證問題**:Sakana AI 宣稱超越自家禁用的 Mythos 和 Fable 模型,但這兩款模型因美國商務部要求對非美國公民禁用,無法拿出獨立第三方評測數據,跑分真實性存疑。 6. **護城河薄弱**:多模型編排是公開的工程手段,缺乏獨門秘技,易被競爭對手(如 OpenRouter 的 Fusion 系統)複製。 ## 逐字稿辨識疑點 * **Mythos 和 Fable 的禁用狀態**:逐字稿提到這兩個模型是薩卡納自己宣布的口徑,且因美國商務部要求對非美國公民禁用,因此無法拿出獨立第三方評測數據。 * **David Ha 的姓氏**:講者根據廣東拼音推斷 "Ha" 可能對應姓氏「夏」,但僅為推測,未確認其正式中文姓名。 * **模型版本號**: * 逐字稿中多次出現「Claude Opus 4.8」、「GPT-5.5」、「Gemini 3」、「DeepSeek V3.1 Terminus」、「Llama 3.1 405B」、「千問 2.5 7B」。 * 講者宣稱的跑分數據(如 SWE-bench Pro 73.7 分)及超越具體模型分數(Claude 69.2, GPT 58.6)為逐字稿內容,未提供獨立驗證來源。 * **OpenRouter Fusion 系統**:逐字稿稱 OpenRouter 於 6月12日上线 Fusion 系統,將最多 8 個模型編排,由裁判模型融合答案。 * **JVC 歷史描述**:逐字稿稱 JVC 源自美國電氣公司(General Electric)在 1920 年代於日本建立的分公司,後因戰爭分離。此為逐字稿內容,未查證其歷史準確性。 * **日本雅虎與 LINE 合併**:逐字稿稱日本雅虎與 LINE 合併,母公司為 LY Corporation,但仍以日本雅虎底子為主。 ## 可延伸追問 1. Sakana AI 的「河豚」系統具體使用了哪些第三方模型的 API?是否有官方公開的模型清單? 2. SWE-bench Pro 榜單的評分標準是什麼?73.7 分的具體計算方式為何? 3. 若大廠(如 OpenAI 或 Google)調整 API 價格或限制用量,Sakana AI 的商業模式將如何應對? 4. 日本外務省背景對 Sakana AI 獲取政府合約或市場渠道具體有何幫助? 5. OpenRouter 的 Fusion 系統與 Sakana AI 的河豚系統在技術架構上有何具體差異? 6. 鯰魚(Nemuro)模型在日語數據後訓練中,具體使用了哪些類型的數據集?