# 影片筆記:EP348 - 日本模型空降AI前段班?Sakana Fugu 評測超越 Mythos!?單一模型時代結束了?如何用多代理協調系統,讓 AI 效能翻倍成長? ## 一句話總結 影片探討了 AI 競爭焦點從「單一模型能力」轉向「系統架構與多代理協調」的趨勢,重點分析了 Sakana AI 的 Fugu Ultra 系統如何透過協調多個模型在基準測試中超越單一頂尖模型,但指出其在實際軟體工程任務中面臨高昂成本與延遲的問題,同時披露了 Anthropic 與 OpenAI 最新模型的洩漏資訊與能力升級。 ## 核心重點 1. **Sakana AI 的 Fugu Ultra 系統**: * 這是一個多代理協調系統,而非單一基礎模型。它透過「AI 經理人」機制,協調 GPT-55、Opus 48、Gemini 31 Pro 等現有模型進行分工(思想家、製造者、驗證者)。 * 在基準測試(如 SWE Bench Pro、盲棋、魔方)中表現優異,甚至超越單一頂尖模型。 * 但在實際軟體工程任務中,其時間與成本效率遠低於直接使用單一頂尖模型(如 Opus 48)。 2. **Anthropic 的模型動態**: * **Claude Sonnet 5**:洩漏資訊顯示其採用新分詞器(Tokenizer),換取更高的推理與多模態能力,但可能增加 Token 消耗。 * **Mythos 6**:被限制的 Fable 5 架構可能已轉為訓練更強大的內部模型 Mythos 6,用於長週期推理與程式碼庫遷移,目前僅限內部使用。 3. **OpenAI 的新功能與模型**: * **新模型(Kindle Alpha / GPT-46 或 GPT-56 Pro)**:展現了強大的自主生成完整 3D 環境能力,能生成單一 HTML 檔案的完整可遊玩第一人称 3D 室內房屋。 * **GPT-BDI 1 語音模型**:具備即時雙向互動與語音處理能力,支援自然打斷與即時調整回應。 4. **未來趨勢**: * AI 競爭焦點正從「撰寫提示詞」轉向「系統架構設計」與「模型協調策略」。 * 開發者需學會如何分配任務以平衡成本與效率,工程師角色可能轉變為系統協調者。 ## 詳細大綱 ### 一、 Sakana AI 與 Fugu Ultra 系統解析 * **公司背景**:日本新創公司 Sakana AI,共同創辦人包含 Attention Is All You Need 論文作者 Llion Jones。 * **核心概念**: * 非單一超強基礎模型,而是「多代理協調系統」。 * 透過單一 API 呼叫,內部由「AI 經理人」指揮。 * 架構類似管絃樂團指揮,負責拆解任務並分派給預先串接的頂尖模型(如 GPT-55、Opus 48、Gemini 31 Pro)。 * **技術原理**: * 基於兩篇論文:一篇提出小模型扮演經理人分配角色(思想家 Thinker、製造者 Maker、驗證者 Verifier);另一篇利用演化演算法與強化學習自動最佳化提示詞(Prompt)。 * AI 經理人透過試錯學習如何與其他 AI 溝通,保留有效方法,淘汰無效方法。 * **效能評估**: * **優勢**:在基準測試中表現驚人。 * SWE Bench Pro:737 分(超越 Opus 48 的 692 分)。 * LiveCodeBench:932 分。 * 盲棋測試:連續擊敗頂尖模型與 Stockfish 引擎(2100 ELO)。 * Rubiks cube:解決 300 個謎題,其他模型零分。 * **劣勢(現實情境)**: * 協調負擔大:時間與成本高昂。 * 對比 Opus 48:Fugu 完成任務時間多 4.5 倍,成本高 5 倍。 * 案例:即時交易臺開發,Fugu 耗費 22,000 Token($0.51),Opus 48 耗費 16,000 Token($0.31)。若僅需前端設計,GLM 52 或 Chinchilla 52 成本僅約 $0.03。 * 案例:複製遊戲 Crossy Road,Opus 48 耗費 $37,Fugu 耗費 $7.32 但成品有操作反向、攝影機問題及缺音效。 * **應用價值**: * 展示未來 IDE 與本地環境趨勢:工程師轉變為系統協調者。 * 地緣政治避險:分散單一美國模型 API 停用的風險,透過協調器繞過限制。 * 結論:目前對單打獨鬥創業者或資深開發者而言,手動協調(如 GPT-55 處理邏輯、GLM 52 生成介面、Opus 48 規劃架構)可能更具成本效益,但需持續關注其延遲優化。 ### 二、 Anthropic 的模型發展與審查現狀 * **Claude Sonnet 5 洩漏**: * 在合作夥伴系統中出現,預示即將推出。 * 預期具備 1-2 百萬 Token 脈絡長度(Context Window)。 * 顯著提升視覺能力與對介面設計稿、架構圖的理解。 * **新分詞器(Tokenizer)權衡**: * 可能比舊模型多消耗高達 30% 的 Token。 * 代價換取更強大的推理能力與多模態理解,提高一次成功率(Zero-shot success),減少高成本的修改迴圈。 * 演示:僅憑單一提示詞生成高度詳細的 Nintendo Switch 2 SVG 圖檔。 * **Fable 5 與 Mythos 6**: * Fable 5 因審查問題停用公開 API 存取。 * 停用的運算資源轉用於訓練內部模型。 * 洩漏顯示新架構 **Mythos 6** 已訓練完成,能力超越 Fable 5,具備高層次長週期推理、多步驟規劃及大規模程式碼庫遷移能力。 * 目前僅限內部使用,用於生成合成資料或加速訓練。 ### 三、 OpenAI 的新模型與語音升級 * **新模型洩漏(Kindle Alpha / GPT-56 Pro)**: * 版本號爭議:來源稱 GPT-46 或 GPT-56 Pro。 * 能力展示:生成完整可遊玩的第一人稱 3D 室內房屋(連貫平面圖、詳細房間、流暢移動系統)。 * 技術亮點:單一 700KB HTML 檔案完成,耗時約 40 分鐘運算,無偷懶、無佔位符,展現目標導向的自主執行能力。 * **GPT-BDI 1 語音模型**: * 知識截止日期更新至 2025 年 8 月。 * 即時雙向互動:支援自然打斷,模型能即時調整回應。 * 演示:即時聆聽並計算冗長故事中的食物數量,準確捕捉細節。 * 影響:推動本地代理作業系統從終端機打字轉向持續即時的語音對話。 ### 四、 總結與未來趨勢 * **競爭核心轉移**:從「寫出最好的提示詞」轉向「系統架構設計」。 * **關鍵能力**: * 決定任務分配給哪個模型。 * 管理代幣經濟(Token Economy)與成本。 * 選擇合適的模型組合(如便宜快速的 Chinchilla 52 用於簡單介面,複雜的 Fugu 協調器用於多步驟推理)。 * 防止自主代理在無監督下導致成本失控。 ## 工具 / 模型 / 名詞整理 * **公司/組織**: * Sakana AI(日本新創公司) * Anthropic * OpenAI * Apple Podcast * FBIGThreads(社群平台) * **模型/產品**: * **Fugu Ultra**:Sakana AI 推出的多代理協調系統。 * **Fable 5**:Anthropic 被限制的模型架構。 * **Mythos / Mythos 6**:Anthropic 內部訓練的新一代模型架構。 * **Claude Sonnet 5**:Anthropic 洩漏的中階主力模型。 * **Opus 48**:Anthropic 的高階架構規劃模型。 * **GPT-55**:Sakana 系統中調用的模型之一。 * **GPT-46**:OpenAI 新模型的洩漏名稱之一。 * **GPT-56 Pro**:OpenAI 新模型的洩漏名稱之二。 * **Kindle Alpha**:OpenAI 新模型的內部代號。 * **GPT-BDI 1**:OpenAI 推出的語音模型。 * **GPT-4 Omni**:提及的舊版語音助理模型。 * **GLM 52**:用於生成便宜前端介面的模型。 * **Chinchilla 52**:用於簡單介面的便宜快速模型。 * **Gemini 31 Pro**:Sakana 系統中調用的模型之一。 * **測試/基準**: * **SWE Bench Pro**:軟體工程任務黃金標準測試。 * **LiveCodeBench**:程式碼測試基準。 * **Stockfish**:國際象棋引擎(提及 2100 ELO 等級)。 * **其他專有名詞**: * **Attention Is All You Need**:傳奇論文。 * **React 元件**:前端開發框架元件。 * **SVG 圖檔**:向量圖形格式。 * **Nintendo Switch 2**:遊戲主機。 * **Crossy Road**:遊戲名稱。 * **GDPR**:歐盟數據保護法規。 * **IDE**:整合開發環境。 * **Tokenizer**:分詞器。 * **Context Window**:脈絡長度。 * **Zero-shot success**:一次成功率。 ## 操作流程整理 1. **Sakana Fugu 系統運作流程**: * 使用者透過單一 API 呼叫提交任務。 * 內部「AI 經理人」接收任務,並拆解為子任務。 * 經理人根據子任務性質,分派給預先串接的頂尖模型(如 GPT-55、Opus 48、Gemini 31 Pro)。 * 模型分工扮演不同角色:思想家(Thinker)、製造者(Maker)、驗證者(Verifier)。 * 經理人透過試錯學習如何與其他 AI 溝通,保留有效方法,淘汰無效方法。 2. **Claude Sonnet 5 新分詞器應用流程**: * 使用新分詞器處理輸入,可能增加 Token 消耗(高達 30%)。 * 換取更高的推理能力與多模態理解。 * 提高一次成功率(Zero-shot success),減少高成本的修改迴圈。 * 演示:僅憑單一提示詞生成高度詳細的 Nintendo Switch 2 SVG 圖檔。 3. **OpenAI 新模型 3D 生成流程**: * 輸入生成指令。 * 模型自主生成完整可遊玩的第一人稱 3D 室內房屋。 * 輸出單一 700KB HTML 檔案,包含連貫平面圖、詳細房間、流暢移動系統。 * 耗時約 40 分鐘運算,無偷懶、無佔位符。 4. **GPT-BDI 1 語音互動流程**: * 知識截止日期更新至 2025 年 8 月。 * 進行即時雙向互動,支援自然打斷。 * 模型能即時調整回應。 * 演示:即時聆聽並計算冗長故事中的食物數量,準確捕捉細節。 ## 值得注意的限制或風險 1. **Sakana Fugu 的成本與效率問題**: * 在實際軟體工程任務中,時間與成本效率遠低於直接使用單一頂尖模型(如 Opus 48)。 * 協調負擔大:Fugu 完成任務時間多 4.5 倍,成本高 5 倍。 * 案例:即時交易臺開發,Fugu 耗費 22,000 Token($0.51),Opus 48 耗費 16,000 Token($0.31)。 * 案例:複製遊戲 Crossy Road,Opus 48 耗費 $37,Fugu 耗費 $7.32 但成品有操作反向、攝影機問題及缺音效。 2. **Claude Sonnet 5 的 Token 消耗**: * 新分詞器可能比舊模型多消耗高達 30% 的 Token。 3. **Mythos 6 的可用性**: * 目前僅限內部使用,用於生成合成資料或加速訓練,尚未公開。 4. **OpenAI 新模型的技術挑戰**: * 生成完整 3D 環境需耗時約 40 分鐘運算,且為單一 700KB HTML 檔案,技術實現難度極高。 5. **自主代理的成本失控風險**: * 若無監督,自主代理可能導致成本失控,需管理代幣經濟(Token Economy)與成本。 ## 逐字稿辨識疑點 * **Fugu Ultra 官方宣稱超越的模型**:逐字稿提及超越 "Fable 5" 和 "Mythos",後續又提到超越 "Opus 48"。需查證 "Fable 5" 是否為 Anthropic 模型名稱之聽寫錯誤(通常為 Claude 系列),或是否為 Sakana 內部特定模型名稱。 * **Opus 48**:逐字稿多次提及 "Opus 48" 與 "Claude Opus 48"。需查證 Anthropic 是否已發布此版本號,或是否為聽寫錯誤(常見為 Opus 1 或特定內部版本)。 * **GPT-55**:逐字稿提及 "GPT-55Opus 48" 及單獨的 "GPT-55"。需查證 OpenAI 是否發布此版本,或是否為 "GPT-4o" 或 "GPT-5" 的聽寫錯誤。 * **Gemini 31 Pro**:逐字稿提及 "Gemini 31 Pro"。需查證 Google 是否發布此版本,或是否為 "Gemini 1.5 Pro" 或 "Gemini Ultra" 的聽寫錯誤。 * **GLM 52**:逐字稿提及 "GLM 52"。需查證是否為特定模型名稱,或是否為聽寫錯誤。 * **Chinchilla 52**:逐字稿提及 "Chinchilla 52"。需查證是否為特定模型名稱,或是否為聽寫錯誤(Chinchilla 通常指代論文或特定參數量模型)。 * **GPT-46 / GPT-56 Pro**:逐字稿提及 "GPT-46" 與 "GPT-56 Pro"。需查證 OpenAI 是否發布此版本號,或是否為 "GPT-4" 系列或 "GPT-5" 系列的聽寫錯誤。 * **GPT-BDI 1**:逐字稿提及此語音模型名稱。需查證 OpenAI 是否發布此名稱,或是否為 "GPT-4o" 語音功能的特定代號或聽寫錯誤。 * **Sakana AI 共同創辦人 Llion Jones**:逐字稿稱其為 "Attention Is All You Need" 作者之一。需查證 Llion Jones 是否確實為該論文作者(該論文主要作者為 Ashish Vaswani 等,需確認 Llion Jones 的具體貢獻或是否為聽寫錯誤)。 * **Fugu Ultra 的 "Fugu"**:逐字稿中系統名稱為 "Fugu Ultra",但後文有時僅稱 "Fugu" 或 "Sakana Fugu"。需確認正式產品名稱是否包含 "Ultra"。 * **基準測試分數**:SWE Bench Pro 737 分、LiveCodeBench 932 分等具體數值,需查證是否為官方發布數據或影片中的口誤。 * **成本數據**:Fugu 開發交易臺成本 $0.51、Opus 48 成本 $0.31;Crossy Road 遊戲 Opus 48 成本 $37、Fugu 成本 $7.32 等具體金額,需查證是否為影片中的