大家好 我是為什麼叫QQ 最近 Sakana AI發佈了Fugu 這是一個很特殊的模型: 它不是另一個超大的單體模型 而是一個"模型編排器" 你可以理解成:Fugu是一個輕量級的協調器 它會根據你的任務 動態地調度其他大模型來幫你完成工作 結果呢? 在代碼審查 論文復現 安全評估這些複雜任務上 Fugu Ultra的表現已經接近或超越了Fable 5 這就很離譜了 一個參數量只有0.6B的輕量級協調器 憑什麼能管住那些百億 千億參數的大模型? 看到這裏你可能會想 這不就是簡單的投票機制嗎? 三個臭皮匠頂個諸葛亮 這種老掉牙的套路也能在AI時代大放異彩? 事情沒那麼簡單 如果只是簡單的算平均分 模型組合早就爛大街了 為什麼直到現在 多模型編排才真正展現出 能打敗單體巨獸的實力? 這背後到底藏着什麼黑科技? 今天 我們就來硬核拆解兩個 最近爆火的多模型編排方案: Sakana AI的Fugu和OpenRouter的Fusion 看看它們到底在底層動了什麼手腳 憑什麼能達到Fable 5的級別 先説個Sakana AI是誰 這是一家不太為人所知的日本AI公司 但幕後的人物很不一般 創始人中有Llion Jones 很多人可能沒聽過這個名字 但在AI圈子中他是個傳奇 他是著名論文《Attention is All You Need》 的主要作者之一 這篇論文提出了Transformer架構 直接打開了今天整個大模型時代的大門 業界稱他為"Transformer八子"之一 就是這樣一個上一代頂會的研究者 現在在日本搞模型編排 前段時間 美國政府對Anthropic的 Fable 5和Mythos 5實施了出口管制 這意味着什麼? 意味着對很多公司來説 這個地表最強模型 突然就不能用了 這下圈子裏爆鍋了 大家突然意識到 把身家性命綁在一個閉源模型上 風險太大了 你需要一個備胎 或者説 你需要一個不依賴單一廠商的解決方案 就在這個節骨眼上 兩個方案几乎同時放了出來 6月13日 OpenRouter推出了Fusion API 緊接着 6月22日 Sakana AI發佈了Fugu 這兩個方案的思路出奇的一致: 別死磕單個大模型了 搞個模型團隊吧 Open Router用了Perplexity 的DRACO基準測試來驗證Fusion 這個測試不考腦筋急轉彎 專門考深度研究——寫學術報告 做財務分析 全是大長篇的硬核任務 結果就是剛才説的 Fusion預算面板64.7分 Fable 5單獨65.3分 但這裏要説清楚一點:DRACO測的是深度研究能力 不包括長期自治任務 Fable 5在那種任務上可能還有優勢 那Fugu呢? Sakana用的是另一套基準——SWE Bench Pro Terminal Bench LiveCodeBench這些工程和推理類的任務 兩個方案用的評測標準不一樣 但都展示了多模型編排的威力 它們到底是怎麼做到的?我們一層一層來扒 先看Sakana AI的Fugu 第一層: Fugu的編排策略 (輕量級協調器如何調度大模型) Fugu的研究基礎包括兩篇ICLR 2026論文: Trinity和Conductor Trinity論文證明了一個關鍵觀點: 輕量級協調器可以有效調度大模型 具體怎麼做?通過角色分配 Trinity把任務分給三種角色: Thinker(思考者) Worker (工作者)和Verifier(驗證者) 你可能會想 這麼小的協調器怎麼管得住百億 千億參數的大傢伙? 秘密在於它不需要自己懂所有領域 它只需要知道 遇到代碼題 該把哪個模型叫出來當Worker; 遇到需要驗證的地方 該誰來當Verifier 它通過隱狀態表示 把豐富的上下文塞給這些大模型 但Trinity論文最硬核的地方 是它用什麼方法訓練協調器 現在大家訓練模型 動不動就是強化學習(RL) Trinity的作者偏不 他們用的是進化策略 具體來説是sep-CMA-ES (可分離的協方差矩陣自適應進化策略) 為什麼這個選擇很關鍵? 因為在協調多個模型時 維度太高了 而且計算預算卡得很死 強化學習在這種高維度 嚴約束的場景下 很容易陷入局部最優 而sep- CMA- ES能利用一種叫做塊- epsilon-可分離性的數學特性 在龐大的搜索空間裏 更高效地找出最優的協調策略 現在 Fugu產品本身的 訓練方式包含了大規模微調 進化算法和強化學習的組合 這説明Sakana在Trinity的研究基礎上 做了更復雜的工程優化 這就好比你讓一個眼光毒辣的HR去管一羣頂尖程序員 HR不需要自己會寫代碼 只要知道誰適合幹什麼活 這個團隊就能起飛 在代碼審查這種髒活累活上 早期用户反饋説 Fugu Ultra找出的bug比GPT-5.5多了好幾倍 這就是專業分工的降維打擊 第二層: Fusion的結構化合成 (為什麼"投票"能超越單模型) 再來看看OpenRouter的Fusion 它的思路更直接粗暴 Fusion沒有用什麼複雜的進化算法 它走的是一條非常工程化的路子:服務端管道 它分三步走 第一步 並行分發 你扔個問題過去 它同時派發給1到8個不同的模型 每個模型都配了聯網搜索的工具 第二步 判官分析 這是最關鍵的一步 它不是簡單地把大家的答案拼起來 它用一個判官模型 把所有人的答案看一遍 然後做個結構化分析 它要找出什麼?找共識 大家都同意的 置信度就高 找矛盾 模型之間打架的地方 説明有爭議 還要找盲點 也就是大家都忽略了什麼 第三步 合成 最後讓一個大哥(比如Opus 4.8) 拿着這份詳盡的分析報告 寫出最終答案 你猜怎麼着? 哪怕是Opus 4.8自己和自己組合 經過這套流程 分數也能硬生生拔高6.7個百分點 這意味着什麼?意味着Fusion提升成績 一大半功勞要歸結於這個"判官+合成"的機制 而不是模型本身變聰明了 你讓一個人做一道題做兩遍 可能還是錯的 但你讓他做兩遍 然後自己給自己挑刺 最後再總結 那質量絕對上一個台階 這就是Fusion的底層邏輯 第三層:兩種方案的第一性原理對比 好 現在我們把Fugu和Fusion放在一起比一比 你會發現 這是兩種完全不同的流派 Fugu的研究基礎強調進化算法和學習式協調 它認為在資源受限的情況下 可以通過進化策略讓協調器 自己學到最優的分配策略 這是一種"黑盒"的 基於學習的協調 Fusion走的是工程學派 它的第一性原理是"多視角綜合" 它模仿的是人類團隊開會 大家先各自調研 然後彙總意見 找出分歧 最後由leader拍板 這是一種"白盒"的 基於規則的協調 誰更好? 看場景 如果你要做長期 多步的複雜任務 比如讓AI自己去復現一篇論文 Fugu這種學習式的協調更靈活 容錯率更高 但如果你要做深度的研究報告 需要查閲大量資料 做對比分析 Fusion這種結構化的合成方式 在DRACO基準上表現出色 而且成本控制得極好 但不管走哪條路 它們都證明了一件事: 在深度研究 代碼驗證 多步驟問題這類任務上 模型編排正在成為一條新的性能擴展路線 説到這裏 事情開始變得有意思了 很多人潛意識裏覺得 搞多模型編排 是因為買不起Fable 5這種頂級模型 所以搞個平替湊合用 以前我們總是追求一個無所不能的"超級大腦" 但你想想 人類社會是靠一個超級天才運轉的嗎? 不是 人類社會是靠分工協作運轉的 Fugu和Fusion的成功告訴我們: 在深度研究 代碼驗證 多步驟問題這類任務上 模型編排正在展現出新的競爭力 它不是説單體模型已經結束了 而是説明:有些問題 分工協作確實更高效 特別是在現在這個大環境下 美國政府對Fable 5的出口 管制就是個活生生的例子 Anthropic因合規壓力 對所有客户臨時關閉了這兩個模型 如果你把所有的業務邏輯都綁死在一個模型上 那無異於在火山口上建房子 多模型編排 本質上是在做風險對沖 它把對單一廠商的依賴 變成了一個可以隨時插拔的代理池 這才是真正的AI主權 那麼 作為一個工程師或者產品經理 我們能從中學到什麼? 我總結了一個多模型編排的思維框架 下次你要設計AI架構時 可以套用一下 第一 必須有模型多樣性 如果你把三個一模一樣的模型拼在一起 那不叫編排 那叫浪費算力 你需要不同的知識結構 不同的推理風格 比如一個擅長寫代碼 一個擅長找邏輯漏洞 第二 需要智能的協調機制 不要自己手寫幾百個if-else來分發任務 學學Fusion 用結構化的方式去提取共識和矛盾; 或者學學Fugu 用小模型去調度大模型 把協調的工作交給AI去做 第三 高質量的合成是靈魂 多模型系統的成敗 往往取決於最後那一下合成 不能簡單拼接 必須有"判官"的角色去審視所有的中間結果 記住 複雜問題只能通過分解來解決 讓不同的模型幹自己最擅長的事 這才是工程實踐的真諦 最後 我們來聊聊未來 單體超級模型的時代 可能真的要結束了 未來的API 不會只是調用一個模型 而是調用一個編排網絡 你輸入一個prompt 背後可能是一羣模型在瘋狂開會 隨着開源模型越來越強 比如DeepSeek V4這種 預算模型的組合能力會越來越恐怖 你可以想象一下 一年後 你可能只需要花幾十分之一的成本 就能自己搭建一個超越現在Fable 5級別的AI團隊 更重要的是 地緣政治的摩擦不會停止 供應鏈多元化會成為所有科技公司的戰略必需 多模型編排 就是在這種不確定性下 保持靈活性的一條路 一句話總結今天的內容: 這不是單體模型已經結束 而是説明:在深度研究等特定任務上 模型編排正在成為一條新的性能擴展路線 架構的力量 有時候比單純的規模更重要 那麼問題來了: 你的團隊現在在用什麼AI架構? 如果能用一半的成本在某些任務上達到頂級模型的水平 你會考慮試試多模型編排嗎? 把你的看法打在公屏上 如果你覺得這期硬核拆解對你有啓發 別忘了點贊 投幣 收藏 一鍵三連支持一下 我是 為什麼叫QQ 我們下期見!