影片筆記:Sakana AI跑分登顶,真让日本AI追上了吗?
一句話總結
日本公司 Sakana AI 發布的「河豚(Fugu)」系統在 SWE-bench Pro 編程榜上取得高分,超越多家大廠模型,但講者指出其本質為「多模型編排系統」而非獨立大模型,缺乏底層技術護城河,最終可能被大廠收購以獲取日本市場渠道。
核心重點
跑分現象:Sakana AI 的「河豚」系統在 SWE-bench Pro 榜單獲得 73.7 分,宣稱超越 Anthropic 的 Claude Opus 4.8(69.2 分)及 OpenAI 的 GPT-5.5(58.6 分),引發市場對日本 AI 追趕中美兩強的看法。
技術本質:Sakana AI 並未從零訓練大模型,而是採用「多模型編排系統」(Loop Agent/循環智能體),組合調度現有的第三方模型(如 GPT-5.5、Claude、DeepSeek 等)。
產品線解析:
- 鯰魚(Nemuro):基於 DeepSeek V3.1 Terminus 後訓練的日語大模型,旨在降低日本政治歷史敏感問題的拒答率。
- 槍魚(Tuna):自主研發的 Agent,可長時間運行生成戰略報告。
- 河豚(Fugu):多模型編排系統,內部使用千問 2.5 7B 作為指揮模型進行後訓練,負責循環調度。
商業模式缺陷:純編排模式缺乏護城河,底層模型、定價權和 API 接口均掌握在 Google、OpenAI、Anthropic 等大廠手中,隨時面臨被封禁或價格調整的風險。
團隊與結局預測:Sakana AI 的核心價值在於其頂尖團隊背景(Transformer 論文作者)及日本本土政企關係(COO 出身外務省)。講者預測其最終極可能是被大廠收購以獲取日本市場渠道,而非成為獨立的競爭對手。
詳細大綱
I. 事件背景與表面現象
- 發布時間與公司:6月22日,日本公司 Sakana AI(薩卡納/魚 AI)發布新產品。
- 跑分表現:
- 在 SWE-bench Pro 編程榜上獲得 73.7 分。
- 超越 Anthropic 的 Claude Opus 4.8(69.2 分)及 OpenAI 的 GPT-5.5(58.6 分)。
- 宣稱部分超越自家禁用的 Mythos 和 Fable 模型。
- 市場反應:網民歡呼日本在 AI 領域追上中美,不再是兩強遊戲。
II. Sakana AI 公司與產品線解析
- 公司背景:
- 2023年成立於東京。
- 核心策略:不從零打造大模型,而是重新組合編排現有模型。
- 產品線:
鯰魚(Nemuro):3月24日發布,日語大模型,搭配免費 Sakana Chat。
槍魚(Tuna):6月15日發布,自主研發 Agent,可連續運行8小時生成60-100頁戰略報告(瞄準 Manus 類產品)。
河豚(Fugu):6月22日發布,多模型編排系統。
- 創始團隊:
- CEO David Ha:華裔,出生於香港,加拿大多倫多大學本科,東京大學博士,曾任 Stability AI 研究負責人。
- CTO 里昂·瓊斯(Leon Jones):英國人,伯明翰大學出身,Transformer 論文「Attention Is All You Need」八位作者之一,曾在谷歌工作12年。
- COO 伊藤:東京大學法學、紐約大學法學院,曾任日本獨角獸企業全球化市場負責人,出身日本外務省,負責政府與政企關係。
III. 「河豚」系統技術原理
- 本質定義:不是單一模型,而是 AI 工作流編排系統(Loop Agent/循環智能體)。
- 運作機制:
- 打破傳統順序執行,採用循環調度。
- 多個大模型承擔不同角色:拆解任務、執行、檢查結果。
- 若檢查不滿意,則重新循環,直到滿意為止。
- 模型組成疑點:
- 不公開內部具體使用的模型清單。
- 排除自家禁用的 Fable 5 和 Mythos 5。
- 推測內部混用 GPT-5.5、Gemini 3、DeepSeek、Claude Opus 4.8 等公開模型。
- 指揮模型:使用千問 2.5 7B 進行後訓練,負責任務拆解與循環調度。
- 鯰魚模型技術細節:
- 基於 DeepSeek V3.1 Terminus 進行後訓練。
- 參考 Llama 3.1 405B 開源底座。
- 本土化價值:通過日語數據後訓練,將 DeepSeek 原版對日本政治歷史敏感問題的拒答率(72%)降至幾乎為零。
IV. 商業模式與護城河分析
- 編排無門檻:
- 多模型編排是公開的工程手段,非獨門秘技。
- 對比案例:OpenRouter 於6月12日發布「Fusion」系統,同樣將最多8個模型編排,由裁判模型融合答案,成本僅為 Fable 5 的一半。
- OpenRouter 數據顯示:75% 的提升來自裁判融合,僅 25% 來自模型多樣性。
- 缺乏護城河:
- 底層依賴:必須使用大廠已發布的模型,無法接觸大廠未發布的最新模型。
- 定價權缺失:利潤空間取決於大廠的 TOKEN 價格和套餐策略(如 OpenAI Plus 套餐與 API 價格差異)。
- 隨時被封禁風險:大廠可隨時調整價格、限制用量或封禁 API 接口。
- 歷史類比:
- 類似互聯網早期的廣告優化小平台(如投放、競價、歸因優化系統)。
- 最終結局:被谷歌、Meta、蘋果、X、騰訊、字節跳動等大廠收購或消滅。
- 收購目的:獲取用戶、流量及政企關係,而非技術本身。
V. Sakana AI 的未來定位與結論
- 真實價值:
- 頂尖團隊(Transformer 論文作者)。
- 日本本土落地渠道與政企關係(外務省背景 COO)。
- 對 DeepSeek 模型的本土化調優能力。
- 最終結局預測:
- 不會成為獨立的大廠競爭者。
- 最大概率被谷歌日本、OpenAI 日本、Anthropic 日本或字節跳動收購。
- 收購目的:獲取日本市場渠道和關係,技術由大廠內部解決。
- 對不同群體的啟示:
- 創業者:無底層模型時,純編排系統天花板低,僅有被收購或價格戰清洗兩條路;需擁有底層模型、獨家數據或不可替代的本地市場位置。
- 普通用戶:盡量使用原廠模型,避免使用不透明底層的第三方編排系統,因為無法驗證結果且存在先天缺陷。
- 投資者:評估編排層公司時,應按「被收購可能性」估值,而非「下一個 OpenAI」;警惕借來的跑分,護城河必須是自己的。
- 總結論點:
- 表面是日本 AI 追趕中美,實則是一家無底層模型的編排公司重演互聯網廣告小平台的老路。
- Sakana AI 不會變成大海裡的鯊魚,而是變成日本自家魚缸裡最貴的錦鯉,游不出那個缸,對整個 AI 行業無實質變化。
工具 / 模型 / 名詞整理
- 公司/組織:
- Sakana AI(薩卡納 AI / 魚 AI)
- Anthropic
- OpenAI
- Google(谷歌)
- Stability AI
- OpenRouter
- DeepSeek
- JVC(日本勝利公司)
- 日本雅虎(Yahoo Japan)
- LINE
- LY Corporation
- 獵豹移動
- 美國電氣公司(General Electric,歷史背景提及)
- 日本外務省
- 模型/產品:
- Sakana AI 產品:
- Fugu(河豚):多模型編排系統。
- Nemuro(鯰魚):日語大模型。
- Tuna(槍魚):自主研發 Agent。
- Sakana Chat:免費聊天工具。
- Mythos:Sakana AI 自家模型(已禁用)。
- Fable:Sakana AI 自家模型(已禁用)。
- 競爭對手/第三方模型:
- Claude Opus 4.8
- GPT-5.5
- Fable 5
- Mythos 5
- Gemini 3
- DeepSeek V3.1 Terminus
- Llama 3.1 405B
- 千問 2.5 7B(Qwen 2.5 7B,用於河豚系統的指揮模型後訓練)
- 技術/概念:
- SWE-bench Pro:編程榜。
- Loop Agent:循環智能體。
- Fusion:OpenRouter 發布的模型聚合系統。
- Attention Is All You Need:Transformer 論文。
- API 接口。
- TOKEN:計費單位。
操作流程整理
河豚(Fugu)系統運作流程:
任務輸入:用戶提出編程或複雜任務需求。
指揮模型調度:系統內部使用千問 2.5 7B(經後訓練)作為指揮模型,負責任務拆解與循環調度。
多模型協作:
- 將任務拆解並分配給多個第三方大模型(推測包含 GPT-5.5、Gemini 3、DeepSeek、Claude Opus 4.8 等)。
- 不同模型承擔不同角色:拆解任務、執行代碼、檢查結果。
循環檢查(Loop):
- 若檢查結果不滿意,系統重新循環,調整策略或調用其他模型。
- 重複上述步驟,直到結果滿意為止。
輸出結果:生成最終答案或代碼。
鯰魚(Nemuro)模型訓練流程:
底座選擇:參考 Llama 3.1 405B 開源底座。
基礎模型:基於 DeepSeek V3.1 Terminus。
後訓練(Post-training):使用日語數據進行後訓練。
目標:降低 DeepSeek 原版對日本政治歷史敏感問題的拒答率(從 72% 降至幾乎為零)。
值得注意的限制或風險
底層依賴風險:Sakana AI 必須使用大廠已發布的模型,無法接觸大廠未發布的最新模型。
定價權缺失:利潤空間取決於大廠的 TOKEN 價格和套餐策略(如 OpenAI Plus 套餐與 API 價格差異),Sakana AI 無定價權。
封禁風險:大廠(Google、OpenAI、Anthropic 等)可隨時調整價格、限制用量或封禁 API 接口,導致服務中斷。
數據不透明:Sakana AI 不公開內部具體使用的模型清單,用戶無法驗證結果來源。
跑分驗證問題:Sakana AI 宣稱超越自家禁用的 Mythos 和 Fable 模型,但這兩款模型因美國商務部要求對非美國公民禁用,無法拿出獨立第三方評測數據,跑分真實性存疑。
護城河薄弱:多模型編排是公開的工程手段,缺乏獨門秘技,易被競爭對手(如 OpenRouter 的 Fusion 系統)複製。
逐字稿辨識疑點
- Mythos 和 Fable 的禁用狀態:逐字稿提到這兩個模型是薩卡納自己宣布的口徑,且因美國商務部要求對非美國公民禁用,因此無法拿出獨立第三方評測數據。
- David Ha 的姓氏:講者根據廣東拼音推斷 "Ha" 可能對應姓氏「夏」,但僅為推測,未確認其正式中文姓名。
- 模型版本號:
- 逐字稿中多次出現「Claude Opus 4.8」、「GPT-5.5」、「Gemini 3」、「DeepSeek V3.1 Terminus」、「Llama 3.1 405B」、「千問 2.5 7B」。
- 講者宣稱的跑分數據(如 SWE-bench Pro 73.7 分)及超越具體模型分數(Claude 69.2, GPT 58.6)為逐字稿內容,未提供獨立驗證來源。
- OpenRouter Fusion 系統:逐字稿稱 OpenRouter 於 6月12日上线 Fusion 系統,將最多 8 個模型編排,由裁判模型融合答案。
- JVC 歷史描述:逐字稿稱 JVC 源自美國電氣公司(General Electric)在 1920 年代於日本建立的分公司,後因戰爭分離。此為逐字稿內容,未查證其歷史準確性。
- 日本雅虎與 LINE 合併:逐字稿稱日本雅虎與 LINE 合併,母公司為 LY Corporation,但仍以日本雅虎底子為主。
可延伸追問
Sakana AI 的「河豚」系統具體使用了哪些第三方模型的 API?是否有官方公開的模型清單?
SWE-bench Pro 榜單的評分標準是什麼?73.7 分的具體計算方式為何?
若大廠(如 OpenAI 或 Google)調整 API 價格或限制用量,Sakana AI 的商業模式將如何應對?
日本外務省背景對 Sakana AI 獲取政府合約或市場渠道具體有何幫助?
OpenRouter 的 Fusion 系統與 Sakana AI 的河豚系統在技術架構上有何具體差異?
鯰魚(Nemuro)模型在日語數據後訓練中,具體使用了哪些類型的數據集?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。