# 影片筆記:Muse Spark 1.1 (Fully Tested): Okay, it's SO GOOD! ## 一句話總結 Meta 發布多模態推理模型 **MuseSpark 1.1**,專為代理任務(Agentic tasks)與工具使用設計,在自定義基準測試中表現優異於部分競爭對手,但在純編碼與文件一致性上仍存在顯著限制。 ## 核心重點 * **模型定位**:Meta 推出的前沿多模態推理模型,專為代理任務(Agentic tasks)設計,支援 100 萬 token 上下文窗口,具備主動管理上下文與協調多代理系統的能力。 * **基準測試表現**: * **優勢**:在工具使用(MCP Atlas, JawBench)與代理任務上表現強勁;在作者自定義的 KingBench 測試中總分 48/70(68.57%),排名第六。 * **劣勢**:在純編碼基準(TerminalBench)表現較弱(59 分),且存在文件覆蓋(clobber files)與缺乏文件感知能力的一致性問題。 * **定價策略**:輸入 $125/百萬 token,輸出 $425/百萬 token,被評價為價格合理且比 Sonnet 便宜。 * **實際應用建議**:UI 設計視覺效果好但邏輯常有誤,建議搭配其他模型進行實現;目前尚無法取代 Fable 5 或 Opus 4.8 進行高難度編碼工作。 ## 詳細大綱 ### 1. Meta 新模型發布與技術規格 * **發布背景**:Meta 正式進入前沿模型競賽,由超級智能實驗室(superintelligence labs)發布 MuseSpark 1.1。 * **API 服務**: * 首次透過品牌全新的 Meta 模型 API 提供付費服務。 * 由 Zuckerberg 回歸 X 平台進行發布。 * **技術特性**: * 多模態推理模型,結合推理、編碼、電腦使用與多模態理解。 * 擁有 100 萬 token 上下文窗口,能主動管理上下文(記憶動作、檢索早期資訊、壓縮關鍵步驟)。 * 訓練用於協調多代理系統(可作為主代理規劃委派,或作為子代理執行任務並升級報告)。 ### 2. 官方基準測試數據 * **工具使用表現**: * MCP Atlas:88.1 分(測試擴展工具使用)。 * JawBench 及其他工具使用基準測試中領先。 * 對比對象:Opus 4.8 與 GPT 5.5 約為 80 分。 * **編碼表現**: * TerminalBench:僅得 59 分。 * 對比對象:GPT 5.5 約為 83 分。 * **結論**:在工具使用與代理任務上強勁,但在純編碼上並非主導地位。 ### 3. 定價與優惠 * **價格結構**: * 輸入價格:每百萬輸入 token $125。 * 輸出價格:每百萬輸出 token $425。 * **評價**:價格合理,比 Sonnet 便宜。 * **優惠**:註冊 API 預覽可獲得 $20 免費額度。 ### 4. 作者自定義基準測試(KingBench)結果 * **測試範圍**:7 個問題,涵蓋 UI 生成、3JS、SVG、數學、代理任務。每題滿分 10 分。 * **題目 1:電梯模擬(HTML/CSS/JS)** * 要求:生成多層樓人員,三部電梯(每部限一人),隨機目標樓層,懸停提示,動畫良好。 * 結果:視覺不錯,但邏輯錯誤(未遵守一人規則,多人生成時隊列崩潰,動畫卡頓)。 * 評分:**3/10**(失敗)。 * 對比:Opus 4.8 得 10/10。 * **題目 2:3JS 隱形眼鏡盒 3D 模型** * 要求:明顯的 L/R 蓋子,點擊打開互動。 * 結果:渲染與材質良好,但點擊打開互動僅部分工作(一個蓋子打開時會穿模)。 * 評分:**5/10**(部分通過)。 * **題目 3:3JS 折疊桌與滑桿** * 要求:滑桿控制折疊/展開,無縫動畫,3D。 * 結果:折疊與展開運作良好,動畫平滑,極端幾何形狀略顯奇怪。 * 評分:**7/10**。 * **題目 4(原文標為第五):SVG 熊貓吃漢堡** * 要求:代碼可視化,無需視覺參考。 * 結果:熊貓可識別,漢堡可辨認,表現中等。 * 評分:**5/10**。 * **題目 5(原文標為第五):弓箭模擬器遊戲** * 要求:4 個目標,基於最低時間的排行榜。 * 結果:弓箭機制運作正常,目標註冊命中,排行榜更新正確,視覺乾淨。 * 評分:**8/10**。 * **題目 6:困難數學題** * 要求:網格有序對的排列計數問題,答案應為 20460。 * 結果:GPT 5.5, Opus 4.7, Gemini 3.5 flash 均得 0 分;MuseSpark 1.1 得出 2460(正確答案)。 * 評分:**10/10**。 * **題目 7:代理任務** * 要求:生成熊貓事實數據集,在本地對 Finitune, Gemma, 2B 模型進行微調(Finituning),並提供 Web UI,每次刷新生成新熊貓事實。 * 結果:完整執行數據集生成、微調設置、運行及 Web UI 工作。 * 評分:**10/10**。 * **總分與排名**: * 總分:48/70(68.57%)。 * 排名:第六名。 * 勝過:GPT 5.6 Terra, Opus 4.7, Sonnet 5。 * 落後於:Grok 4.5, GPT 5.6 Sol, GLM 5.2, Opus 4.8, Fable 5。 ### 5. 實際使用觀察與結論 * **UI 設計能力**: * 即使邏輯有誤,生成的設計視覺效果很好。 * 建議工作流:使用 Open Design 生成設計,再交給 GPT 5.6 進行實際實現。 * **代理任務的怪異之處**: * 缺乏文件感知能力:寫入新文件前不檢查現有文件。 * 並行任務問題:多個代理 sessions 會互相覆蓋文件(clobber files),不尊重其他 session 的文件。 * **一致性問題**: * 在特定領域(代理、工具使用、數學)表現良好,但整體一致性不足,無法預測每次輸出的版本品質。 * **最終評價**: * Meta 的首次前沿嘗試相當穩健。 * 定價不錯,代理能力真實,UI 設計是驚喜。 * 目前無法取代 Fable 5 或 Opus 4.8 進行編碼。 * 若修復文件感知與一致性問題,下一版本可能成為有力競爭者。 ## 工具 / 模型 / 名詞整理 * **Meta 相關**: * MuseSpark 1.1(多模態推理模型) * Meta 模型 API * Meta 超級智能實驗室(superintelligence labs) * **競爭對手模型**: * Opus 4.8 * GPT 5.5 * GPT 5.6 Terra * GPT 5.6 Sol * Sonnet * Grok 4.5 * GLM 5.2 * Fable 5 * Opus 4.7 * Gemini 3.5 flash * **測試與基準工具**: * MCP Atlas * JawBench * TerminalBench * KingBench(作者自定義基準) * **技術與框架**: * HTML, CSS, JS * 3JS(3D 建模相關) * SVG * Finitune(疑點:可能指 Fine-tuning 或特定工具名) * Gemma, 2B 模型 * Open Design(疑點:可能指特定設計工具或概念) * **平台**: * X(前 Twitter) ## 操作流程整理 1. **獲取 API**:透過 Meta 模型 API 註冊預覽,獲得 $20 免費額度。 2. **執行基準測試**: * 運行官方基準測試(MCP Atlas, JawBench, TerminalBench)。 * 運行作者自定義的 KingBench 測試(涵蓋 UI、3D、數學、代理任務)。 3. **評估結果**: * 比較 MuseSpark 1.1 與其他模型(如 Opus 4.8, GPT 5.5)的分數。 * 分析代理任務中的文件覆蓋問題與一致性。 4. **應用建議**: * 對於 UI 設計任務,可先用 MuseSpark 生成視覺設計,再轉交其他模型實現邏輯。 * 對於高難度編碼任務,目前不建議直接取代 Fable 5 或 Opus 4.8。 ## 值得注意的限制或風險 * **文件一致性問題**:在並行任務中,多個代理 sessions 會互相覆蓋文件(clobber files),缺乏對現有文件的感知能力。 * **邏輯與視覺脫節**:UI 生成視覺效果好,但常出現邏輯錯誤(如電梯模擬中的隊列崩潰)。 * **純編碼能力不足**:在 TerminalBench 等純編碼基準上表現較弱,無法取代頂級編碼模型。 * **預測不穩定**:整體一致性不足,無法預測每次輸出的版本品質。 ## 逐字稿辨識疑點 * **MuseSpark 1.1**:逐字稿中提及 "MuseSpark",需確認是否為正確模型名稱(疑點:需查證)。 * **Finitune**:逐字稿中提及 "Finitune, Gemma, 2B model","Finitune" 疑似為 "Fine-tuning" 的聽寫錯誤或特定產品名(疑點:需查證)。 * **Open Design**:逐字稿中提及 "Open Design",需確認是否為特定軟體名稱(疑點:需查證)。 * **GPT 5.5 / GPT 5.6**:逐字稿中多次出現 "GPT 5.5" 與 "GPT 5.6",需確認是否為模型版本號的準確表述(疑點:需查證)。 * **Opus 4.8 / Opus 4.7**:逐字稿中出現不同版本的 Opus,需確認是否為準確版本號(疑點:需查證)。 * **KingBench**:作者自定義的基準測試名稱,需確認是否為通用標準或作者自創(疑點:需查證)。 * **TerminalBench 分數**:逐字稿稱 MuseSpark 得 59 分,GPT 5.5 約 83 分,需確認數據來源(疑點:需查證)。 * **MCP Atlas 分數**:逐字稿稱 MuseSpark 得 88.1 分,Opus 4.8 與 GPT 5.5 約 80 分,需確認數據來源(疑點:需查證)。 * **數學題答案**:逐字稿稱正確答案為 20460,MuseSpark 得出 2460 被視為正確,需確認題目與答案邏輯(疑點:需查證)。 * **Zuckerberg 回歸 X**:逐字稿稱 Zuckerberg 回歸 X 平台發布此 API,需確認時間點與事實(疑點:需查證)。 ## 可延伸追問 * Meta 模型 API 的長期定價策略與可用性如何? * KingBench 的具體測試題目與評分標準是否公開? * 如何解決 MuseSpark 1.1 在並行代理任務中的文件覆蓋問題? * 未來版本是否會針對純編碼能力進行專門優化?