# 影片筆記:哪個 AI 最強?我全都要 — 讓 Claude 當大腦,指揮 Gemini 與 Codex 一起工作 ## 一句話總結 講者 Dustin 主張在當前激烈的 AI 競爭下,不應單一依賴某一家模型,而應採取「多模型協作」策略:以 **Claude** 為大腦中樞與程式主力,搭配 **Gemini** 處理多模態與長文本,並利用 **OpenAI (Codex)** 作為備用與生圖專家,透過 Plugin 與 Agent 機制實現無縫協作。 ## 核心重點 1. **拒絕扁平化選擇**:模型迭代快速(如 Claude 剛過一歲生日),單一依賴某家模型是不成熟的做法,應了解各家強弱項並搭配使用。 2. **Claude 的定位(大腦中樞)**: * 擅長寫程式、長任務處理及工具呼叫,穩定性高。 * 等級選擇策略:Opus 用於高智力/複雜任務;Sonnet 用於日常簡單任務(講者主力);Haiku 用於簡單查詢。 * 短板:缺乏對音訊、影片等多模態輸入的原生支援,需依賴工具截圖,效率較低。 3. **Gemini 的定位(價效比與多模態之王)**: * 擅長長文本處理、資料清洗、音訊/影片原生輸入及影像辨識。 * 優勢:語音轉逐字稿速度快且準確;影片內容分析可直接標註時間點;影像辨識支援中文書籍數位化、座標回傳等。 * 劣勢:呼叫任務與寫程式表現不如 Claude 穩定,易產生幻覺(改 A 壞了 B)。 4. **OpenAI (GPT/Codex) 的定位(備用大腦與生圖專家)**: * 優勢:額度政策目前比 Claude 大方;GPT-5.5 與 Claude Opus 在長任務處理上不相上下;GPT Image 2 生圖能力斷崖式領先。 * 用途:當 Claude 額度用盡、伺服器不穩定或遇到解不開的問題時,作為備用或評審(避免球員兼裁判)。 5. **多模型協作實作**: * 透過 **Plugin (外掛)** 與 **Agent (代理人)** 機制,讓主力模型(Claude)在內部直接呼叫其他模型(Codex 或 Gemini)。 * 避免使用者頻繁切換介面,實現「小孩子才做選擇,我全都要」的協作模式。 ## 詳細大綱 ### 一、 模型選擇的心態:拒絕扁平化 * **社群常見問題**:該選 ChatGPT、Codex、Claude、Gemini 還是 DeepSeek? * **觀點**:不應只跟定一家,因為模型迭代快,未來最強工具可能改變。 * **建議**:採用搭配使用,了解各家強弱項。 ### 二、 主流模型強弱項分析 #### 1. Claude (Anthropic) * **定位**:大腦中樞 (Brain Hub)。 * **優勢**: * 寫程式能力強。 * 長時間複雜任務處理佳。 * 工具呼叫穩定,不易斷線或卡關。 * **等級選擇策略**: * **Opus**:用於不確定任務、複雜架構、高智力邏輯推論。耗費額度最多,但最聰明。 * **Sonnet**:用於日常簡單任務(如寫信、套用模板)。適合額度緊縮時使用,講者目前主要使用此等級。 * **Haiku**:用於簡單查詢(如上網查資料)。最省額度,講者因方案額度充足較少切換,但建議低額度用戶(如 $20 Pro)精細切換以達 CP 值。 * **短板**: * 無法直接處理文字檔案以外的輸入(如音訊、影片、音樂)。 * 無法直接聽音樂、讀影片或抓影片畫面,需依賴工具截圖,效率低且耗 Token。 #### 2. Gemini (Google) * **定位**:價效比之王、多模態之王。 * **優勢**: * **長文本與資料清洗**:處理幾十萬字摘要、API 費用便宜;適合改錯字、標記情緒、新聞關鍵字標籤等大量資料處理。 * **原生多模態支援**: * 支援輸入聲音與影片。 * 可區分多個講者、辨識語氣、聽懂音樂旋律(頻率、過門)。 * 語音轉逐字稿速度極快(30分鐘語音約30秒開始產出,3分鐘內完成),準確度高。 * 影片內容分析:可直接讀懂影片內容,標註家人、路人、風景片段時間點,便於後續剪輯。 * 影像辨識準確:支援中文書籍數位化、複圖辨識、回傳小圖座標(便於程式摳圖)、檢查排版問題(邊界超出、溢位、孤行、文字疊合)。 * **劣勢**: * 呼叫任務與寫程式表現不如 Claude 穩定,易有幻覺(改 A 壞了 B,修好 A 又壞了 C)。 * **備註**:講者曾嫌棄 Gemini,但發現其特定 Use Case 後重新評估。 #### 3. OpenAI (GPT / Codex) * **定位**:備用大腦、生圖專家。 * **工具**:Codex (Agentic AI 工具,類似終端機介面)。 * **優勢**: * **額度政策**:目前訂閱方案給的額度比 Claude 大方(政策可能變動)。 * **長任務處理**:GPT-5.5 與 Claude Opus 在長任務處理上不相上下,可信任。 * **備用機制**:當 Claude 額度用盡、伺服器不穩定或遇到解不開的問題時,可切換至 GPT/Codex 救援或評審(避免球員兼裁判)。 * **生圖能力**:GPT Image 2 模型目前生圖能力斷崖式領先,Claude 無生圖模型,Gemini 亦有差距。 * **講者未將其設為主力的原因**: * 習慣使用 Claude Code。 * 規則與環境設定(如 CLAUDE.md, rules, hooks)已建立在 Claude Code 環境中。 ### 三、 多模型協作實作方法 * **核心概念**:主力模型(Claude)作為入口,透過工具呼叫其他模型,避免使用者頻繁切換介面。 * **方法一:使用 Plugin (外掛)** * **Codex Plugin**:OpenAI GitHub 專案。安裝於 Claude Code 後,可透過指令(如 `/codex`)邀請 Codex 進來審查程式碼、救場或進行對抗式審查。 * **實作案例**:講者設計 `Codex image` 指令,讓 Claude 直接呼叫 Codex 生成客製化圖卡(如 Instagram 分享圖),無需離開 Claude 介面。 * **方法二:使用 Agent (代理人)** * **Gemini Agent**:將 Gemini 封裝為常態角色。 * **專用 Agent**:規範好 API、檔案傳輸、模型選擇,用於語音轉文字等常見任務。 * **通用 Agent**:呼叫電腦內的 Gemini CLI 工具,根據任務智力需求分配模型(如長文本摘要使用 Flash 模型以節省成本)。 * **流程**:Claude 接收需求 -> 呼叫對應 Agent/Plugin -> 其他模型執行任務 -> 結果回傳 Claude -> Claude 進行下一步整合。 ### 四、 總結建議 * 建議使用者親自嘗試各模型,根據自身生涯階段、任務需求及 AI 滲透率調整主力模型。 * 心態:小孩子才做選擇,我全都要(多模型協作)。 ## 工具 / 模型 / 名詞整理 * **模型/產品**: * OpenAI * ChatGPT * Codex (OpenAI 的 Agentic AI 工具) * Claude (Anthropic) * Opus (Claude 等級) * Sonnet (Claude 等級) * Haiku (Claude 等級) * Gemini (Google) * Gemini Flash Lite * Gemini 3.5 Flash * DeepSeek * GPT-5.5 * GPT Image 2 * Claude Code * Whisper (模型) * Claude.md * Rules * Hooks * Codex Plugin (OpenAI GitHub 專案) * Codex image (講者自訂指令) * Gemini CLI 工具 * Agent / Skill (概念) * Reddit (論壇) * IG / Instagram (平台) ## 操作流程整理 1. **需求分析**:使用者提出需求,Claude 作為大腦中樞進行初步判斷。 2. **任務分流**: * 若為程式開發、複雜邏輯或工具呼叫:由 Claude (Sonnet/Opus) 直接處理。 * 若為多模態輸入(音訊、影片、圖片)或長文本資料清洗:Claude 呼叫 **Gemini Agent** 或相關工具。 * 若需生成圖片:Claude 呼叫 **Codex Plugin** 中的 `Codex image` 指令,調用 GPT Image 2。 * 若遇 Claude 額度用盡、伺服器不穩定或無法解決的問題:切換至 **GPT/Codex** 進行救援或評審。 3. **結果整合**:其他模型執行任務後,結果回傳至 Claude。 4. **最終輸出**:Claude 整合所有結果,進行下一步操作或輸出最終答案。 ## 值得注意的限制或風險 1. **Claude 的多模態限制**:無法直接處理音訊、影片,需依賴工具截圖,效率低且耗 Token。 2. **Gemini 的穩定性**:在呼叫任務與寫程式表現上不如 Claude 穩定,易產生幻覺(修好 A 又壞了 C)。 3. **政策變動風險**:OpenAI 的額度政策目前比 Claude 大方,但講者註明「政策可能變動」。 4. **模型迭代速度**:模型迭代快速(如 Claude 剛過一歲生日),當前最強工具未來可能改變,單一依賴風險高。 ## 逐字稿辨識疑點 * **Haiku 切換頻率**:講者提到「也不太會好玩」,語意不明,疑為口誤或聽寫錯誤,可能意指「不太會換」或「不太會玩」。 * **Geminate**:逐字稿中出現「但是 geminate 可以做到」,應為 Gemini 的口誤或聽寫錯誤。 * **Nano Banana**:講者提到「Gemini 的 Nano Banana」,疑為 Gemini 某個模型名稱的聽寫錯誤(如 Nano、Banana 等詞彙組合),需查證。 * **GPT-5.5**:講者提到「GPT-5.5 現在跟 Claude Opus 是不相上下」,需查證目前 OpenAI 是否已發布此版本名稱。 * **2026年中**:講者提到「我們 2026年中」,若影片非於 2026 年錄製,此時間點可能為口誤或預測性說法,需確認實際時間背景。 * **VCR V8**:講者提到「出去玩拍的 VCR V8」,V8 疑為口誤或特定格式/設備名稱,需查證。