# 影片筆記:Google Gemini Explained: 80% of Google Gemini You Never Use (2026 Guide) ## 一句話總結 Google Gemini 在 2026 年已從單一聊天機器人演變為覆蓋底層模型與上層應用介面的完整生態平台,透過深度整合 Android、Google Workspace 及搜尋服務,並結合 Deep Research 與 Spark 等 Agent 功能,旨在取代傳統工作流並提供全域 AI 體驗。 ## 核心重點 1. **平台而非單一產品**:Gemini 是 Google 的「傘狀名稱」,包含底層模型(Models)與上層互動介面/模式(Modes)。 2. **模型分層策略**: * **Flash 系列**:強調速度、編碼與高吞吐量(如 3.7 Flash, 3.6 Flash, 3.5 Flash)。 * **Pro 系列**:強調深度推理與邏輯效能(如 3.1 Pro, 3.5 Pro)。 * **專用模型**:針對影像(Nano Banana 2)、影片(VIO 3.1)、音樂(Lyra 3.5)及即時翻譯(Gemini Audio)進行優化。 3. **多模態與自動路由**:使用者無需手動選擇底層模型,系統會根據意圖自動路由至適當模型處理文字、程式碼、影像、影片及音訊。 4. **生態系深度整合**:Gemini 已內建於 Google 搜尋(AI Mode)、Gmail、Docs、Sheets、Slides、Chrome 及 Android 語音助理中,目標是讓用戶在任何 Google 產品中都能觸及 AI。 5. **Agent 功能演進**:從單純問答轉向執行多步驟任務,代表功能包括 Deep Research(深度研究)、Deep Think(深度思考)及 Gemini Spark(背景個人智能體)。 ## 詳細大綱 ### 1. Gemini 的核心概念與市場現狀 * **架構分層**: * **底層**:模型本身(如 Gemini 3.6 Flash, 3.1 Pro),針對不同任務優化。 * **頂層**:使用者實際點擊的產品介面(Gemini App, 搜尋 AI Mode, Gmail/Docs 內建功能)。 * **市場數據**: * Gemini App 月活躍用戶超過 6.5 億。 * 美國僅約 1/5 的企業在營運中使用 AI,使用 Gemini 的企業已領先競爭對手。 ### 2. 當前模型陣容(Model Lineup)詳解 * **Gemini 3.7 Flash**: * 發布日期:2026年8月13日。 * 定位:最新 Flash 模型,編碼與 AI Agent 的主力。 * 優勢:軟體工程、網頁開發、複雜多步驟工作流。 * **Gemini 3.6 Flash**: * 發布日期:2026年7月21日。 * 定位:目前旗艦(Flagship),工作馬(Workhorse)。 * 優勢:編碼、知識工作、多模態任務。 * 效率:平均比前代少使用 17 fewer tokens(註:原文表述,疑點見後)。 * **Gemini 3.5 Flash**: * 發布日期:2026年5月。 * 定位:搜尋 AI Mode 驅動者,極致速度。 * 優勢:輸出吞吐量約為當時其他頂級模型的 4 倍。 * **Gemini 3.5 Flashlight**: * 發布日期:2026年7月。 * 定位:高吞吐量、簡化版(stripped down)。 * 效能:約 350 tokens/秒,用於背景任務與 Agent 管線。 * **Gemini 3.1 Pro**: * 發布日期:2026年2月。 * 定位:推理專家(Reasoning Specialist)。 * 優勢:邏輯效能約為早期 Gemini 3 Pro 的兩倍。 * **定價參考(API)**: * 3.6 Flash:輸入約 $1.50/百萬 tokens,輸出約 $7.50/百萬 tokens。 * 對比:文中稱其比 GPT 5.6 Luna 的輸出價格(約 $6/百萬 tokens)更具競爭力(註:數值邏輯疑點見後)。 ### 3. 專用模型(Specialty Models) * **Nano Banana 2**:影像生成與編輯,取代 Imagen 系列(Imagen 將於 2026年8月17日關閉)。有 Light 變體追求速度與低成本。 * **VIO 3.1**:影片生成模型(Beta 階段),文字轉短片(含音訊)。 * **Gemini Audio 3.5 Live Translate**:即時語音對語音翻譯,支援 70+ 語言,內建於 Google Meet 與 Android。 * **3.5 Flash Cyber**:安全專用變體,配合漏洞掃描工具。 * **Lyra 3.5**:音樂模型,可生成長達 3 分鐘的曲目。 ### 4. 使用者互動模式(Modes) * **AI Mode (Google Search)**:由 Gemini 3.5 Flash 驅動,將搜尋欄轉為對話,提供完整句子答案及即時互動小工具,無需訂閱。 * **Deep Think**:Gemini App 的「額外努力」版本,分配更多運算進行逐步推理,限 Google AI Ultra 訂閱。 * **Deep Research**:從聊天機器人轉變為助理,規劃研究策略、開啟網頁、閱讀內容,若授權可讀取 Gmail 和 Drive,輸出為 Gemini Canvas 中的多頁完整報告。 * **Gemini Live**:語音與相機模式,免持對話、相機即時識別與提問。 * **Canvas**:工作區模式,一次性生成程式碼、介面與內容並可直接編輯。 * **Gemini Spark**:個人 Agent(I/O 2026 宣布),背景持續運行(如排程),僅限早期 Ultra 測試者。 ### 5. 多模態實務應用(Multimodal in Practice) * **核心哲學**:使用者只需表達意圖,系統自動路由至適當模型。 * **具體應用場景**: * **影像**:Nano Banana 處理圖片標題或編輯。 * **音訊**:Gemini Audio 模型即時生成帶有語調控制的語音。 * **影片**:VIO 生成短片;Gemini Omni 進行逐幀編輯(如換天空、改風格)。 * **文書處理**:Docs/Sheets 從會議筆記起草文件或建立試算表;Slides 將要點轉換為簡報版面。 * **即時翻譯**:透過 Live 相機模式,對菜單進行即時翻譯疊加。 ### 6. 生態系整合與 Agent 戰略 * **全域整合**: * **Drive**:搜尋並總結文件。 * **Google Meet**:進行即時字幕翻譯。 * **Android (特別是 Pixel)**:內建於語音助手中。 * **Chrome**:透過擴充功能將頁面內容直接發送給 Gemini 提問。 * **開發者工具**: * 透過 **Google AI Studio** 與 **Gemini API** 開放。 * 新增平台 **Antigravity** 用於構建多智能體工作流。 * **核心戰略**:不爭奪「最佳獨立聊天機器人」的論述,目標是讓用戶在任何 Google 裝置或應用中,距離 Gemini 不超過一個產品的距離。 * **Agent 功能演進**: * **Deep Research**:已上線,具備規劃、瀏覽、綜合、撰寫能力。 * **Spark**:早期且受限的嘗試,旨在作為在背景持續運行的個人智能體。 * **Antigravity**:讓企業構建協調的子智能體團隊。 * **實際場景對比**:從「詢問去日本前該知道什麼」轉向「規劃我的日本行程」,檢查航班、比較酒店、生成行程表。 ### 7. 競爭優勢與未來發展 * **優勢 (Edges)**: 1. **數據整合能力**:可從即時搜尋結果、Maps、Gmail、Drive 提取數據。 2. **分發範圍 (Reach)**:每部 Android 手機都是潛在客戶,每個 Workspace 商業帳戶已內建。 3. **基準測試表現**:**Gemini 3 Pro** 登上 **LM Arena** 排行榜頂端。 * **劣勢/爭議點**: 1. **發布策略保守**:Deep Think 與 Spark 仍受限於 Ultra 訂閱或有限測試。 2. **定價結構複雜**:免費、Pro、Ultra、API 定價結構可能比競爭對手更令人困惑。 * **未來發展**: * **確認事項**:Gemini 3.5 Pro 處於合作夥伴測試階段;Gemini 4 已開始訓練(2026年7月公告);Workspace AI 持續擴展。 * **猜測事項**:針對未來 Pixel 手機的專用裝置端 AI 晶片;DeepMind 關於 3D 化身與世界模擬的實驗性研究。 ## 工具 / 模型 / 名詞整理 * **Gemini 系列模型**: * Gemini 3.7 Flash * Gemini 3.6 Flash * Gemini 3.5 Flash * Gemini 3.5 Flashlight * Gemini 3.1 Pro * Gemini 3 Pro (提及為早期版本) * 3.5 Flash Cyber (安全專用變體) * **專用模型**: * Nano Banana 2 (含 Light 變體) * Imagen (即將關閉) * VIO 3.1 * Gemini Audio 3.5 Live Translate * Lyra 3.5 * Gemini Omni (用於影片逐幀編輯) * **產品與功能介面**: * Gemini App * AI Mode (Google Search) * Deep Think * Deep Research * Gemini Canvas * Gemini Live * Gemini Spark * Google AI Studio * Gemini API * Anti Gravity Platform (或 Antigravity) * Vertex AI * Google Meet * Android * Gmail (Smart Compose) * Google Docs * Google Sheets * Google Slides * Chrome * Google Drive * Maps * Workspace * **競爭對手產品**: * GPT 5.6 Luna ## 操作流程整理 1. **日常搜尋與對話**: * 在 Google 搜尋中使用 **AI Mode**,系統自動路由至 Gemini 3.5 Flash 提供對話式答案。 2. **深度工作與研究**: * 訂閱 Google AI Ultra 後,在 Gemini App 中使用 **Deep Think** 進行複雜推理。 * 使用 **Deep Research** 規劃研究策略,系統自動瀏覽網頁、閱讀內容(若授權可讀取 Gmail/Drive),並在 **Canvas** 中生成多頁報告。 3. **多模態內容生成**: * 輸入意圖(如生成影像、影片或音樂),系統自動路由至對應專用模型(如 Nano Banana 2, VIO 3.1, Lyra 3.5)。 * 使用 **Gemini Live** 進行語音對話或透過相機進行即時翻譯與識別。 4. **生態系整合應用**: * 在 **Gmail** 中使用 Smart Compose 撰寫郵件。 * 在 **Docs/Sheets/Slides** 中利用 Gemini 起草文字、建立公式或設計簡報。 * 在 **Chrome** 中透過擴充功能將頁面內容發送給 Gemini 提問。 * 在 **Android/Pixel** 手機上使用內建語音助理呼叫 Gemini。 5. **開發者與企業應用**: * 透過 **Gemini API** 或 **Google AI Studio** 接入模型。 * 企業使用 **Antigravity** 平台構建多智能體工作流,協調子智能體團隊執行並行任務。 ## 值得注意的限制或風險 1. **訂閱與發布限制**:部分高級功能(如 Deep Think, Spark)僅限 Google AI Ultra 訂閱者或早期測試者,發布策略相對保守。 2. **定價結構複雜**:免費、Pro、Ultra 及 API 定價結構可能比競爭對手的單一訂閱更令人困惑。 3. **模型依賴與路由**:使用者雖無需手動選擇模型,但依賴系統自動路由,若路由錯誤可能影響體驗(儘管影片強調系統能自動處理)。 4. **授權與隱私**:Deep Research 等功能若需讀取 Gmail 和 Drive,需用戶明確授權,涉及隱私與數據存取權限問題。 5. **技術成熟度**:部分專用模型(如 VIO 3.1)仍處於 Beta 階段;Spark 僅限早期測試,尚未全面開放。 ## 逐字稿辨識疑點 * **定價邏輯矛盾**:逐字稿提到 3.6 Flash 輸出價格為 $7.50/百萬 tokens,並稱其比 GPT 5.6 Luna 的 $6/百萬 tokens "noticeably cheaper"(明顯更便宜)。數值上 7.50 大於 6,與 "cheaper" 描述矛盾,需查證原文數據或語意。 * **Token 數量描述**:原文提到 3.6 Flash "does the job using about 17 fewer tokens"。未明確說明是絕對數量減少 17 個(對於複雜任務不合理)還是百分比減少(如 17%),或為聽寫錯誤。 * **產品名稱拼寫**: * "Nano Banana":此名稱在現有 AI 領域較不常見,疑似為 "Nano Banana" 的正確名稱或聽寫錯誤(可能為 "Nano Banana" 或其他代號),需查證。 * "Anti gravity platform" / "Antigravity":Google 是否有名為 "Anti gravity" 或 "Antigravity" 的平台?疑似為 "Android" 或其他產品名的聽寫錯誤,或為特定內部代號。 * "VIO 3.1":Google 是否有名為 "VIO" 的影片生成模型?疑似為 "Video" 或其他產品名的聽寫錯誤。 * **日期與版本**:文中多次提及 2026 年的發布日期(如 3.7 Flash 於 2026年8月13日發布),若當前時間早於 2026 年,則為未來預測或影片設定在未來時間點,需確認影片發布時間背景。 * **GPT 5.6 Luna**:Google 提及的競爭對手 "GPT 5.6 Luna" 名稱需查證是否為真實存在的產品名稱,或為聽寫錯誤(如 GPT-4o, GPT-5 等)。 * **Gemini 3 Pro**:逐字稿提及此名稱並稱其登上 LM Arena 排行榜頂端,需查證該版本名稱是否準確或為聽寫錯誤。 * **LM Arena**:需查證該排行榜的完整名稱或準確拼寫。 ## 可延伸追問 1. Gemini 3.6 Flash 的 "17 fewer tokens" 具體是指絕對數量還是百分比?這對成本計算有何影響? 2. "Nano Banana 2" 和 "VIO 3.1" 的正式產品名稱為何?它們與現有的 Imagen 和 Video AI 模型有何具體區別? 3. "Antigravity" 平台目前對開發者的開放程度如何?它與 Vertex AI 的關係為何? 4. Gemini Spark 作為背景個人智能體,其數據隱私保護機制為何?它如何處理用戶的敏感資訊? 5. 隨著 Gemini 4 的訓練開始,預計會對現有的 Flash 和 Pro 系列模型產生何種替代或升級影響?