# 影片筆記:Google Shipped Gemini 3.7 Flash And OpenAI Made GPT-5.6 14x Faster! ## 一句話總結 Google DeepMind 發布了定位為「智能工作馬」的 Gemini 3.7 Flash,在代碼與自動化基準測試中表現優異,但定價策略與部分性能仍落後於競爭對手;同時 OpenAI 透過 Cerebras 晶片推出 GPT 5.6 的「超快模式」,實現每秒 750 個 token 的生成速度,主要針對即時語音與商業場景。 ## 核心重點 1. **Gemini 3.7 Flash 發布與定位**: * 在 Gemini 3.6 Flash 發布僅 3 週後推出。 * Google DeepMind 官方定位為「最智能的工作馬(most intelligent workhorse model)」。 * 開發動機基於開發者反饋與演算法創新。 * 講者推測 Google 計劃取消 Gemini 3.5 Pro,專注開發 Gemini 4,而 3.7 Flash 整合了 Pro 級的改進,性能優於 3.5 Pro。 * 不建議將其與 Opus 5 或 GPT 5 等頂級 Pro 模型直接比較,因其屬於 Flash 等級。 2. **性能基準測試(Benchmarks)表現**: * **代碼質量**:Gemini 3.7 Flash (43.6) 優於 Sonet 5 (42.7) 與 Terra 模型 (41.3)。 * **長視角軟體工程**:略落後於 GPT 5.6 Terra (69.6 vs 65.3)。 * **網頁開發**:ELO 分數 1588,在中階模型中排名第一,排名從第 19 躍升至第 8,但仍落後於 Opus 5、Kim K3 Quinn 3.8 Max Cloud 等頂級模型。 * **自動化基準測試**:表現優於其他 Flash 模型 (30.4 vs GPT 5.6 Terra 23.6)。 * **長影片理解與長上下文**:表現優異,分別為 85.4 和 97。 * **Deepware Engineering 基準測試**:落後於 GPT 5.6 Luna,且成本約為後者的三倍。 3. **定價策略**: * **短期優惠(至 2026 年底)**:輸入 token $0.75/百萬,輸出 token $3.75/百萬。 * **長期定價(2027 年 1 月起)**:輸入 token $1.50/百萬,輸出 token $7.50/百萬。 * 相比其他前沿實驗室仍屬便宜,但不如 Muse Spark 或 Deepseek Version 4 Flash 便宜。 4. **OpenAI GPT 5.6 超快模式(Ultra Fast Mode)**: * 透過 Cerebras 晶片運行,發布 GPT 5.6 的權重列表。 * 性能指標:每秒生成高達 750 個輸出 token,速度約為標準模式的 14 倍。 * 應用場景:即時或近生產負載,包括即時語音支援、商務、金融研究、安全、事件回應與可靠性。 * 目前尚未公布定價資訊,存取權限也不確定。 5. **贊助商 Arcade 介紹**: * 定位為 AI Agent 的運行時(Runtime),讓 Agent 能實際執行動作。 * 核心功能包括權限管理(無需共用單一登入資訊)、內建數千個工具整合(Gmail, Slack, Salesforce 等)、行為記錄追蹤。 * 支援任何模型、框架、雲端,費用免費開始使用。 ## 詳細大綱 ### A. Gemini 3.7 Flash 發布與定位 * **發布時間點**:緊接在 Gemini 3.6 Flash 之後,僅相隔 3 週。 * **官方定位**:Google DeepMind 稱其為「最智能的工作馬(most intelligent workhorse model)」。 * **開發動機**:基於開發者反饋與演算法創新。 * **內部策略推測**: * 講者推測 Google 計劃完全取消 Gemini 3.5 Pro,並專注開發 Gemini 4。 * 3.7 Flash 可能整合了原本屬於 Pro 模型的改進,因此性能優於 3.5 Pro。 * 目前不將其與 Opus 5 或 GPT 5 等頂級 Pro 模型直接比較,因為它屬於 Flash 等級。 ### B. 性能基準測試(Benchmarks)分析 * **代碼質量(Code Quality)**: * Gemini 3.7 Flash:43.6 * Sonet 5:42.7 * Terra 模型:41.3 * 舊版 Flash 模型:34.4 * 結論:在生產代碼質量上表現優於其他 Flash 模型。 * **長視角軟體工程(Long Horizon Software Engineering)**: * GPT 5.6 Terra:69.6 * Gemini 3.7 Flash:65.3 * 舊版 Flash 模型(3.6):48.6 * Sonet 5:53.8 * Muse Spark 1.2:54.9(首次出現在基準測試中,Meta 的新玩家) * 結論:略落後於 GPT 5.6 Terra。 * **網頁開發(Web Development)**: * ELO 分數:1588(舊版為 1538)。 * 結論:在中階模型中排名第一,擊敗所有其他中階模型,但仍落後於 Opus 5、Kim K3 Quinn 3.8 Max Cloud、Opus 5 Gro 4.6 6、Fable 5 等頂級模型。排名從第 19 名躍升至第 8 名。 * **自動化基準測試(Automation Bench)**: * Gemini 3.7 Flash:30.4 * GPT 5.6 Terra:23.6 * 結論:強於其他 Flash 模型。 * **長影片理解(Long Video Understanding)**: * Gemini 3.7 Flash:85.4 * Terra 模型:78.9 * 舊版模型:84.2 * 結論:表現優異。 * **長上下文性能(Long Context Performance)**: * Gemini 3.7 Flash:97 * GPT 6 Terra:93.5 * 結論:表現優異。 * **Deepware Engineering 基準測試**: * Gemini 3.7 Flash 表現落後於 GPT 5.6 Luna,且成本約為後者的三倍。 ### C. 定價策略 * **短期優惠(至 2026 年底)**: * 輸入 token:每 100 萬個 $0.75 * 輸出 token:每 100 萬個 $3.75 * 註:此價格僅持續 6 個月。 * **長期定價(2027 年 1 月起)**: * 輸入 token:每 100 萬個 $1.50 * 輸出 token:每 100 萬個 $7.50 * **競爭力評估**: * 相比其他前沿實驗室(Frontier Labs)仍屬便宜,但不如 Muse Spark 或 Deepseek Version 4 Flash 便宜。 * 講者認為 Google 未將 Opus、Soul、Fable 列入基準測試是合理的,因為這是 Flash 模型,應等待 Gemini 4 發布後再進行頂級比較。 ### D. OpenAI GPT 5.6 超快模式(Ultra Fast Mode) * **發布內容**:OpenAI 發布 GPT 5.6 的權重列表,透過 Cerebras 晶片運行。 * **性能指標**: * 每秒生成高達 750 個輸出 token。 * 速度約為標準模式的 14 倍。 * **應用場景**: * 即時或近生產負載(Live or near production workloads)。 * 即時語音支援、商務、金融研究、安全、事件回應與可靠性。 * **不確定性**: * 尚未公布定價資訊。 * 尚未確定有多少人能獲得存取權限。 ### E. 贊助商資訊:Arcade * **產品定位**:AI Agent 的運行時(Runtime),讓 Agent 能實際執行動作而非僅是討論。 * **核心功能**: * **權限管理**:解決 Agent 代表特定用戶在特定帳戶中行動的權限問題,無需共用單一登入資訊。 * **工具整合**:內建數千個工具,支援 Gmail、Google Drive、Slack、Notion、Salesforce 等應用。 * **記錄追蹤**:記錄 Agent 的行為、對象與地點。 * **兼容性**:支援任何模型、框架、雲端、Cursor、Chat、GPT。 * **費用**:免費開始使用。 ## 工具 / 模型 / 名詞整理 * **Google DeepMind / Google** * Gemini 3.7 Flash * Gemini 3.6 Flash * Gemini 3.5 Pro * Gemini 4 (預計未來發布) * Gemini 4 Pro (預計未來發布) * **OpenAI** * GPT 5.6 * GPT 5.6 Terra * GPT 5.6 Luna * GPT 5.6 6o (Ultra Fast Mode) * GPT 5.6 Soul (提及於基準測試比較中) * **其他模型與實驗室** * Opus 5 * Sonet 5 * Terra 模型 * Deepseek Version 4 Flash * Muse Spark 1.2 (Meta) * Kim K3 Quinn 3.8 Max Cloud * Opus 5 Gro 4.6 6 * Fable 5 * Fable 5.6.6 Sol * Deepware Engineering (基準測試名稱) * **基礎設施與平台** * Cerebras (晶片供應商) * Arcade (贊助商,AI Agent Runtime) * Gmail, Google Drive, Slack, Notion, Salesforce (Arcade 支援的應用) * Cursor, Chat (開發工具) * **其他提及** * SpaceX (與 Fable 相關) * Universe of AI (頻道名稱) * World of AI (頻道名稱) * Universe-of-ai.beehiiv.com (新聞通訊訂閱連結) * X (社群平台) ## 操作流程整理 1. **評估 Gemini 3.7 Flash 性能**: * 查看代碼質量基準測試(43.6分)。 * 查看長視角軟體工程基準測試(65.3分)。 * 查看網頁開發 ELO 分數(1588分)。 * 查看自動化基準測試(30.4分)。 * 查看長影片理解(85.4分)與長上下文性能(97分)。 * 對比 Deepware Engineering 基準測試結果。 2. **確認定價策略**: * 確認短期優惠價格(至 2026 年底):輸入 $0.75/百萬,輸出 $3.75/百萬。 * 確認長期定價(2027 年 1 月起):輸入 $1.50/百萬,輸出 $7.50/百萬。 3. **了解 OpenAI GPT 5.6 超快模式**: * 確認透過 Cerebras 晶片運行。 * 確認性能指標:每秒 750 個輸出 token,速度為標準模式 14 倍。 * 確認應用場景:即時語音支援、商務、金融研究等。 4. **使用 Arcade 運行 AI Agent**: * 設定權限管理,避免共用單一登入資訊。 * 整合工具(Gmail, Slack, Salesforce 等)。 * 記錄 Agent 行為與對象。 * 確保兼容性(支援任何模型、框架、雲端)。 ## 值得注意的限制或風險 1. **Gemini 3.7 Flash 的定價與成本**: * 長期定價(2027 年起)可能較高,且在某些基準測試(如 Deepware Engineering)中成本約為競爭對手(GPT 5.6 Luna)的三倍。 2. **OpenAI GPT 5.6 超快模式的存取與定價**: * 尚未公布定價資訊。 * 尚未確定有多少人能獲得存取權限。 3. **模型性能落後**: * Gemini 3.7 Flash 在長視角軟體工程與 Deepware Engineering 基準測試中落後於 GPT 5.6 Terra 或 Luna。 4. **Arcade 的權限管理**: * 雖然解決了權限問題,但需確保 Agent 在特定帳戶中行動的準確性與安全性。 ## 逐字稿辨識疑點 * **模型名稱拼寫與版本混淆**: * 逐字稿中多次出現 **"Soul"**、**"Sol"**、**"6 Soul"**、**"6.6 Sol"**,可能指代 OpenAI 的某個模型變體或聽寫錯誤,無法確定具體對應何種官方名稱。 * **"Sonet 5"**:可能為 "Sonnet 5" (Anthropic 模型) 的聽寫錯誤,但依規則標為疑點。 * **"Kim K3 Quinn 3.8 Max Cloud"**:此名稱極不尋常,可能是多個模型名稱的混合或聽寫錯誤(如 Kimi, Claude 等),無法查證。 * **"Opus 5 Gro 4.6 6"**:名稱結構混亂,可能為 "Opus 4" 或 "Grok 4" 等的混合聽寫。 * **"Fable 5"**、**"Fable 5.6.6 Sol"**:目前市場上無知名模型名為 "Fable",可能為聽寫錯誤或極小眾模型。 * **"Deepware Engineering"**:作為基準測試名稱出現,可能為 "Software Engineering" 的聽寫錯誤,但依規則標為疑點。 * **"GPT 5.6 6o"**:版本號與模型名稱混合,通常 OpenAI 模型為 GPT-4o 或 GPT-4.5 等,此處 "5.6 6o" 結構不明。 * **"GPT 6 Terra"**:在長上下文性能部分出現,前文多為 "GPT 5.6 Terra",此處 "GPT 6" 可能為口誤或聽寫錯誤。 * **價格數值疑點**: * 逐字稿提到 "75 per 1 million input tokens",後文修正為 "0.75",但中間有 "75" 的表述,需確認是否為口誤。 * 定價部分提到 "end of 2026" 和 "January of 2027",時間點與當前時間關係需查證,但依規則僅記錄原文。 * **其他名詞**: * **"Partit"**:在 Arcade 介紹中出現 "that's the partit actually handles for you",疑為 "part that" 的連讀或聽寫錯誤。 * **"Weight list"**:OpenAI 發布 "weight list for 5.6",通常為 "weights" (權重) 或 "waitlist" (等候名單),此處用詞模糊。 ## 可延伸追問 1. Gemini 3.7 Flash 的「智能工作馬」定位具體意味著哪些開發場景? 2. OpenAI GPT 5.6 超快模式的定價策略何時會公布? 3. Arcade 如何確保 AI Agent 在執行動作時的權限安全? 4. Google 計劃何時發布 Gemini 4? 5. Muse Spark 1.2 作為 Meta 的新玩家,其技術架構與優勢為何?