影片筆記:哪個 AI 最強?我全都要 — 讓 Claude 當大腦,指揮 Gemini 與 Codex 一起工作
YouTube 影片框會固定在左上方;點擊右側逐字稿時間戳可跳到對應時間。
一句話總結
講者 Dustin 主張在當前激烈的 AI 競爭下,不應單一依賴某一家模型,而應採取「多模型協作」策略:以 Claude 為大腦中樞與程式主力,搭配 Gemini 處理多模態與長文本,並利用 OpenAI (Codex) 作為備用與生圖專家,透過 Plugin 與 Agent 機制實現無縫協作。
核心重點
拒絕扁平化選擇:模型迭代快速(如 Claude 剛過一歲生日),單一依賴某家模型是不成熟的做法,應了解各家強弱項並搭配使用。
Claude 的定位(大腦中樞):
- 擅長寫程式、長任務處理及工具呼叫,穩定性高。
- 等級選擇策略:Opus 用於高智力/複雜任務;Sonnet 用於日常簡單任務(講者主力);Haiku 用於簡單查詢。
- 短板:缺乏對音訊、影片等多模態輸入的原生支援,需依賴工具截圖,效率較低。
Gemini 的定位(價效比與多模態之王):
- 擅長長文本處理、資料清洗、音訊/影片原生輸入及影像辨識。
- 優勢:語音轉逐字稿速度快且準確;影片內容分析可直接標註時間點;影像辨識支援中文書籍數位化、座標回傳等。
- 劣勢:呼叫任務與寫程式表現不如 Claude 穩定,易產生幻覺(改 A 壞了 B)。
OpenAI (GPT/Codex) 的定位(備用大腦與生圖專家):
- 優勢:額度政策目前比 Claude 大方;GPT-5.5 與 Claude Opus 在長任務處理上不相上下;GPT Image 2 生圖能力斷崖式領先。
- 用途:當 Claude 額度用盡、伺服器不穩定或遇到解不開的問題時,作為備用或評審(避免球員兼裁判)。
多模型協作實作:
- 透過 Plugin (外掛) 與 Agent (代理人) 機制,讓主力模型(Claude)在內部直接呼叫其他模型(Codex 或 Gemini)。
- 避免使用者頻繁切換介面,實現「小孩子才做選擇,我全都要」的協作模式。
詳細大綱
一、 模型選擇的心態:拒絕扁平化
- 社群常見問題:該選 ChatGPT、Codex、Claude、Gemini 還是 DeepSeek?
- 觀點:不應只跟定一家,因為模型迭代快,未來最強工具可能改變。
- 建議:採用搭配使用,了解各家強弱項。
二、 主流模型強弱項分析
#### 1. Claude (Anthropic)
- 定位:大腦中樞 (Brain Hub)。
- 優勢:
- 寫程式能力強。
- 長時間複雜任務處理佳。
- 工具呼叫穩定,不易斷線或卡關。
- 等級選擇策略:
- Opus:用於不確定任務、複雜架構、高智力邏輯推論。耗費額度最多,但最聰明。
- Sonnet:用於日常簡單任務(如寫信、套用模板)。適合額度緊縮時使用,講者目前主要使用此等級。
- Haiku:用於簡單查詢(如上網查資料)。最省額度,講者因方案額度充足較少切換,但建議低額度用戶(如 $20 Pro)精細切換以達 CP 值。
- 短板:
- 無法直接處理文字檔案以外的輸入(如音訊、影片、音樂)。
- 無法直接聽音樂、讀影片或抓影片畫面,需依賴工具截圖,效率低且耗 Token。
#### 2. Gemini (Google)
- 定位:價效比之王、多模態之王。
- 優勢:
- 長文本與資料清洗:處理幾十萬字摘要、API 費用便宜;適合改錯字、標記情緒、新聞關鍵字標籤等大量資料處理。
- 原生多模態支援:
- 支援輸入聲音與影片。
- 可區分多個講者、辨識語氣、聽懂音樂旋律(頻率、過門)。
- 語音轉逐字稿速度極快(30分鐘語音約30秒開始產出,3分鐘內完成),準確度高。
- 影片內容分析:可直接讀懂影片內容,標註家人、路人、風景片段時間點,便於後續剪輯。
- 影像辨識準確:支援中文書籍數位化、複圖辨識、回傳小圖座標(便於程式摳圖)、檢查排版問題(邊界超出、溢位、孤行、文字疊合)。
- 劣勢:
- 呼叫任務與寫程式表現不如 Claude 穩定,易有幻覺(改 A 壞了 B,修好 A 又壞了 C)。
- 備註:講者曾嫌棄 Gemini,但發現其特定 Use Case 後重新評估。
#### 3. OpenAI (GPT / Codex)
- 定位:備用大腦、生圖專家。
- 工具:Codex (Agentic AI 工具,類似終端機介面)。
- 優勢:
- 額度政策:目前訂閱方案給的額度比 Claude 大方(政策可能變動)。
- 長任務處理:GPT-5.5 與 Claude Opus 在長任務處理上不相上下,可信任。
- 備用機制:當 Claude 額度用盡、伺服器不穩定或遇到解不開的問題時,可切換至 GPT/Codex 救援或評審(避免球員兼裁判)。
- 生圖能力:GPT Image 2 模型目前生圖能力斷崖式領先,Claude 無生圖模型,Gemini 亦有差距。
- 講者未將其設為主力的原因:
- 習慣使用 Claude Code。
- 規則與環境設定(如 CLAUDE.md, rules, hooks)已建立在 Claude Code 環境中。
三、 多模型協作實作方法
- 核心概念:主力模型(Claude)作為入口,透過工具呼叫其他模型,避免使用者頻繁切換介面。
- 方法一:使用 Plugin (外掛)
- Codex Plugin:OpenAI GitHub 專案。安裝於 Claude Code 後,可透過指令(如
/codex)邀請 Codex 進來審查程式碼、救場或進行對抗式審查。 - 實作案例:講者設計
Codex image指令,讓 Claude 直接呼叫 Codex 生成客製化圖卡(如 Instagram 分享圖),無需離開 Claude 介面。 - 方法二:使用 Agent (代理人)
- Gemini Agent:將 Gemini 封裝為常態角色。
- 專用 Agent:規範好 API、檔案傳輸、模型選擇,用於語音轉文字等常見任務。
- 通用 Agent:呼叫電腦內的 Gemini CLI 工具,根據任務智力需求分配模型(如長文本摘要使用 Flash 模型以節省成本)。
- 流程:Claude 接收需求 -> 呼叫對應 Agent/Plugin -> 其他模型執行任務 -> 結果回傳 Claude -> Claude 進行下一步整合。
四、 總結建議
- 建議使用者親自嘗試各模型,根據自身生涯階段、任務需求及 AI 滲透率調整主力模型。
- 心態:小孩子才做選擇,我全都要(多模型協作)。
工具 / 模型 / 名詞整理
- 模型/產品:
- OpenAI
- ChatGPT
- Codex (OpenAI 的 Agentic AI 工具)
- Claude (Anthropic)
- Opus (Claude 等級)
- Sonnet (Claude 等級)
- Haiku (Claude 等級)
- Gemini (Google)
- Gemini Flash Lite
- Gemini 3.5 Flash
- DeepSeek
- GPT-5.5
- GPT Image 2
- Claude Code
- Whisper (模型)
- Claude.md
- Rules
- Hooks
- Codex Plugin (OpenAI GitHub 專案)
- Codex image (講者自訂指令)
- Gemini CLI 工具
- Agent / Skill (概念)
- Reddit (論壇)
- IG / Instagram (平台)
操作流程整理
需求分析:使用者提出需求,Claude 作為大腦中樞進行初步判斷。
任務分流:
- 若為程式開發、複雜邏輯或工具呼叫:由 Claude (Sonnet/Opus) 直接處理。
- 若為多模態輸入(音訊、影片、圖片)或長文本資料清洗:Claude 呼叫 Gemini Agent 或相關工具。
- 若需生成圖片:Claude 呼叫 Codex Plugin 中的
Codex image指令,調用 GPT Image 2。 - 若遇 Claude 額度用盡、伺服器不穩定或無法解決的問題:切換至 GPT/Codex 進行救援或評審。
結果整合:其他模型執行任務後,結果回傳至 Claude。
最終輸出:Claude 整合所有結果,進行下一步操作或輸出最終答案。
值得注意的限制或風險
Claude 的多模態限制:無法直接處理音訊、影片,需依賴工具截圖,效率低且耗 Token。
Gemini 的穩定性:在呼叫任務與寫程式表現上不如 Claude 穩定,易產生幻覺(修好 A 又壞了 C)。
政策變動風險:OpenAI 的額度政策目前比 Claude 大方,但講者註明「政策可能變動」。
模型迭代速度:模型迭代快速(如 Claude 剛過一歲生日),當前最強工具未來可能改變,單一依賴風險高。
逐字稿辨識疑點
- Haiku 切換頻率:講者提到「也不太會好玩」,語意不明,疑為口誤或聽寫錯誤,可能意指「不太會換」或「不太會玩」。
- Geminate:逐字稿中出現「但是 geminate 可以做到」,應為 Gemini 的口誤或聽寫錯誤。
- Nano Banana:講者提到「Gemini 的 Nano Banana」,疑為 Gemini 某個模型名稱的聽寫錯誤(如 Nano、Banana 等詞彙組合),需查證。
- GPT-5.5:講者提到「GPT-5.5 現在跟 Claude Opus 是不相上下」,需查證目前 OpenAI 是否已發布此版本名稱。
- 2026年中:講者提到「我們 2026年中」,若影片非於 2026 年錄製,此時間點可能為口誤或預測性說法,需確認實際時間背景。
- VCR V8:講者提到「出去玩拍的 VCR V8」,V8 疑為口誤或特定格式/設備名稱,需查證。
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。
00:00:00.000 → 00:00:01.000
各位朋友大家好
00:00:01.066 → 00:00:02.266
我是 Dustin
00:00:02.300 → 00:00:03.066
那我今天這一集
00:00:03.100 → 00:00:05.600
想要跟大家聊一聊模型的選擇
00:00:05.633 → 00:00:07.633
我們可以看到像這樣的留言
00:00:07.700 → 00:00:10.133
在社群上面其實一直在被討論
00:00:10.166 → 00:00:14.200
比如說到底我要選擇 OpenAI 的 ChatGPT、Codex
00:00:14.266 → 00:00:15.966
還是說我要選擇 Claude
00:00:16.033 → 00:00:17.733
還是說我要選擇 Gemini
00:00:17.766 → 00:00:20.466
或者像是我要不要去接入 DeepSeek,像
00:00:21.266 → 00:00:21.933
那麼這些問題
00:00:21.966 → 00:00:24.233
其實對我來說
00:00:24.300 → 00:00:27.400
我覺得不應該被扁平化
00:00:27.433 → 00:00:28.866
什麼叫扁平化
00:00:28.933 → 00:00:31.666
不應該說好像我們就只跟定一家模型
00:00:31.700 → 00:00:33.533
其他的我們就不跟了
00:00:33.600 → 00:00:38.566
因為我們都知道各家模型商之間的競爭是非常激烈的
00:00:38.600 → 00:00:40.766
那往往一家發了新模型
00:00:40.800 → 00:00:43.300
另外一家就會更迭代
00:00:43.366 → 00:00:46.166
而且我們現在在用的這個 Claude
00:00:46.200 → 00:00:49.100
它其實也才剛過一歲生日而已
00:00:49.166 → 00:00:50.600
我們也無法去預知
00:00:50.966 → 00:00:54.033
搞不好明年最強的工具就不是這個了
00:00:54.333 → 00:00:59.300
我覺得比較成熟的心態應該是搭配使用
00:00:59.333 → 00:01:04.500
所以今天我想來跟你先講解在我個人的想法裡面
00:01:04.533 → 00:01:07.733
主流模型的強弱項分別是什麼
00:01:07.766 → 00:01:11.000
那當然因為主流模型也是蠻多的
00:01:11.466 → 00:01:15.200
我會以我自己常常在使用的為主
00:01:15.633 → 00:01:20.200
我們會聊一聊我是怎麼配置讓這些模型可以放在一起協作的
00:01:20.233 → 00:01:20.900
那我們就開始
00:01:20.966 → 00:01:22.966
首先第一個當然是 Claude
00:01:23.000 → 00:01:26.733
Claude 他們家的模型被我當做是大腦中樞
00:01:28.233 → 00:01:39.233
第一個原因是因為 Claude 模型在寫程式上面以及在長時間複雜任務的處理跟工具呼叫上面做的是最好的
00:01:39.300 → 00:01:44.466
不會說做一做就斷掉或者是做到卡關就停下來
00:01:44.733 → 00:01:47.066
我選擇用 Claude 做我的大腦模型
00:01:47.100 → 00:01:48.533
也就是我通常都是
00:01:48.566 → 00:01:50.366
用 Claude 的模型去互動
00:01:50.433 → 00:01:52.100
讓他去幫我執行任務
00:01:52.133 → 00:01:55.133
那麼 Claude 模型也有分好幾個等級
00:01:55.166 → 00:01:58.133
比如說 Opus、Sonnet 跟 Haiku
00:01:58.166 → 00:01:58.933
我會怎麼去分
00:01:58.966 → 00:02:02.166
如果是要做一些我不確定的任務
00:02:04.133 → 00:02:07.333
或者是真的比較需要智力邏輯推論的任務
00:02:07.366 → 00:02:08.766
我就會用 Opus
00:02:08.833 → 00:02:10.533
或者是如果當中我的額
00:02:10.566 → 00:02:11.566
度太多沒有燒完
00:02:11.633 → 00:02:14.133
我就會給他用 Opus 狂燒
00:02:16.866 → 00:02:17.800
那如果我當中額
00:02:18.800 → 00:02:23.200
或者是我在處理的任務就是一個步驟比較簡單
00:02:23.233 → 00:02:25.433
不會用到太多智力的任務
00:02:25.466 → 00:02:27.233
那我就會用 Sonnet
00:02:27.266 → 00:02:30.566
比如說寫信回信套既有的模板
00:02:30.633 → 00:02:33.300
那 Sonnet 是最適合我們日常使用的任務
00:02:33.333 → 00:02:37.466
我自己也沒有感覺到 Sonnet 有什麼太大的阻礙
00:02:37.500 → 00:02:39.466
那如果還有一些東西
00:02:39.533 → 00:02:42.800
比如說像是隻是上網查個資料
00:02:42.833 → 00:02:44.933
那我就會用 Haiku
00:02:45.000 → 00:02:46.300
因為這個模型是最省額
00:02:47.200 → 00:02:49.033
其實 Haiku 我不常切
00:02:49.100 → 00:02:51.266
是因為我自己的方案
00:02:51.300 → 00:02:53.866
目前是 100 美元的方案
00:02:53.900 → 00:02:56.466
我不用特別去切 Haiku
00:02:56.533 → 00:02:58.033
我一直用 Sonnet
00:02:58.100 → 00:02:59.200
也不太會好玩
00:03:00.500 → 00:03:02.066
量跟頻率來講
00:03:02.500 → 00:03:04.400
我就沒有特別去切 Haiku
00:03:04.433 → 00:03:06.666
但是如果你今天用的是 20 美元的 Pro 的話
00:03:06.733 → 00:03:10.766
那可能你的切換就會更精細來達到最好的 CP 值
00:03:10.800 → 00:03:12.000
所以這個是 Claude
00:03:12.033 → 00:03:13.966
但是 Claude 也有它的短板
00:03:14.000 → 00:03:17.700
他雖然最強的是寫程式跟任務的呼叫
00:03:17.733 → 00:03:23.966
但他的短板就是他無法去吃文字檔案以外的 input
00:03:24.000 → 00:03:28.466
比如說你想要讓它去轉錄一段語音成為文字檔
00:03:28.533 → 00:03:31.833
你想要讓它去聽音樂
00:03:31.900 → 00:03:34.100
瞭解這個音樂哪裡是過門
00:03:34.133 → 00:03:37.433
你想讓他去讀影片
00:03:37.500 → 00:03:39.066
去幫你對影片做摘要
00:03:39.100 → 00:03:42.533
甚至是抓影片裡面的某一幕的畫面
00:03:42.566 → 00:03:45.066
那麼 Claude 在做這件事上面是比較困難
00:03:45.100 → 00:03:46.400
甚至有可能會做不到
00:03:46.466 → 00:03:51.466
那麼這個時候我們就要來講到第二家被人廣為使用的模型了
00:03:51.533 → 00:03:53.066
叫做 Gemini
00:03:53.100 → 00:03:54.733
我想一定不少人都有用過
00:03:54.800 → 00:03:58.033
只是大部分人用的應該都是網頁版的 Gemini,對不對
00:03:58.066 → 00:04:00.733
那網頁版的 Gemini 當然量大管飽
00:04:00.800 → 00:04:02.033
可以很好的去
00:04:02.066 → 00:04:03.433
滿足我們的需求
00:04:03.466 → 00:04:06.900
還有就是 Google 官方也用他們的生態系的優勢
00:04:06.966 → 00:04:09.833
把 Gemini 嵌到了很多 Google 的服務裡面
00:04:09.866 → 00:04:12.533
所以你可以在很多地方用到它
00:04:12.600 → 00:04:14.666
那我之前還沒有用 Claude 之前
00:04:14.700 → 00:04:17.066
我其實也蠻常用 Gemini
00:04:17.100 → 00:04:19.866
甚至會讓它去做寫程式
00:04:22.333 → 00:04:25.633
但是很快的我就發現好像跟 Claude 一比
00:04:25.700 → 00:04:28.966
Gemini 在呼叫任務跟寫程式上面表現的不太好
00:04:29.966 → 00:04:31.866
常常會有幻覺
00:04:31.900 → 00:04:34.533
或者是今天我要他改 a
00:04:35.600 → 00:04:38.966
他改了 a 的同時也把 b 改壞了
00:04:39.000 → 00:04:40.733
我再叫他把 a 跟 b 一起修好
00:04:40.800 → 00:04:43.800
結果他修好了之後又把 c 改掉了
00:04:43.833 → 00:04:48.200
那所以這就是為什麼 Gemini 後來被慢慢被我不用的原因
00:04:48.266 → 00:04:51.900
甚至我有一段時間是嫌棄 Gemini 的
00:04:51.933 → 00:04:54.166
但是我現在要跟你分享
00:04:54.233 → 00:04:57.466
你聽到有人在嫌棄某家模型的時候
00:04:57.500 → 00:05:01.300
其實代表是他們看到的 use case 不夠多
00:05:01.333 → 00:05:05.733
因為當我後來慢慢地接觸到不同的 use case 使用情境
00:05:05.800 → 00:05:09.100
AI 對我生活的滲透率越來越高
00:05:09.133 → 00:05:11.033
以及我的學員們
00:05:11.100 → 00:05:13.233
他們有各種不同的需求的時候
00:05:13.266 → 00:05:16.466
我慢慢又發現了 Gemini 的好處
00:05:16.500 → 00:05:17.900
所以我又寫了一篇文章
00:05:17.966 → 00:05:20.433
那在這邊跟大家也官宣
00:05:20.466 → 00:05:23.533
工商一下我自己的部落格
00:05:23.566 → 00:05:25.966
我會把 blog 放在下面的說明欄
00:05:26.033 → 00:05:30.166
在這個裡面我會每週更新大量的文章
00:05:30.200 → 00:05:32.266
分享我對 AI 的感悟
00:05:33.233 → 00:05:35.066
那這邊我有寫了 Gemini
00:05:35.133 → 00:05:37.133
我曾經也貶低過他
00:05:37.166 → 00:05:41.166
但是後來我發現他有 4 個其他家目前打不過的 use case
00:05:42.966 → 00:05:47.233
它在處理長文本以及大量資料的清洗的時候
00:05:47.300 → 00:05:48.733
它是價效比之王
00:05:49.333 → 00:05:51.533
比如說幾十萬字去做摘要
00:05:51.566 → 00:05:53.200
它的 API 是最便宜的
00:05:53.233 → 00:05:54.733
相較於其他家的
00:05:56.133 → 00:05:58.500
這種或者是資料清洗
00:05:58.533 → 00:06:00.433
比如說改錯字
00:06:00.500 → 00:06:02.133
比如說幫每一個
00:06:02.166 → 00:06:04.800
貼文去標上情緒的標籤
00:06:04.866 → 00:06:06.300
是負面還是中性
00:06:06.333 → 00:06:11.166
把每一則新聞的短訊標上這個新聞跟什麼關鍵字有關係
00:06:12.433 → 00:06:14.600
資料清洗跟標記
00:06:14.633 → 00:06:16.433
它是價效比最高的
00:06:16.466 → 00:06:19.266
那當然價效比更高的也是有
00:06:19.300 → 00:06:21.833
來自中國的模型
00:06:21.900 → 00:06:22.700
不過這些模型
00:06:22.733 → 00:06:24.200
如果你用他們的端點
00:06:24.266 → 00:06:26.733
很多時候那個 Server 就在中國
00:06:26.800 → 00:06:32.400
所以如果你對一些個人資料安全隱私有疑慮的時候
00:06:32.433 → 00:06:34.933
那當然就不會是一個好選擇
00:06:35.000 → 00:06:37.533
那 Google 算是一個相對比較好的選擇
00:06:37.566 → 00:06:41.400
當然最好的選擇肯定是開源模型在自己內部自架
00:06:41.766 → 00:06:44.166
不過自架這個也需要有硬體的限制
00:06:44.233 → 00:06:45.700
不是所有人都辦得到的
00:06:45.733 → 00:06:47.100
所以權衡之下
00:06:48.533 → 00:06:49.666
與效能的平衡
00:06:49.733 → 00:06:54.500
我覺得 Gemini Flash Lite 是大量資料清洗的價效比之王
00:06:54.533 → 00:07:00.600
再來第二個就是它原生支援輸入聲音跟影片
00:07:00.633 → 00:07:05.233
那我目前試到的是它可以去處理有多個講者在同一個語音裡面
00:07:05.300 → 00:07:07.266
它可以分得清楚誰是誰
00:07:08.166 → 00:07:10.200
他可以去辨識語氣
00:07:10.233 → 00:07:12.466
他也可以去聽懂音樂旋律
00:07:12.533 → 00:07:14.933
因為我有去玩一些音樂的專案
00:07:14.966 → 00:07:18.066
那我需要去收集音樂素材來編歌
00:07:18.133 → 00:07:20.200
那我就需要知道每個音樂的
00:07:23.000 → 00:07:25.433
那這個 Claude 跟 GPT 做的都不是很好
00:07:25.466 → 00:07:26.566
甚至 Claude 是不能做的
00:07:26.633 → 00:07:29.366
因為它不能去讀聲音
00:07:29.400 → 00:07:30.900
但是 geminate 可以做到
00:07:30.933 → 00:07:32.300
而且做的非常的準
00:07:32.333 → 00:07:34.333
還有就是最近的新版好
00:07:34.633 → 00:07:36.266
在我這個影片錄的當下
00:07:36.300 → 00:07:38.333
Gemini 3.5 Flash
00:07:38.400 → 00:07:44.166
它處理語音轉摘要、轉逐字稿的速度超級快
00:07:44.833 → 00:07:47.433
一段 30 分鐘的語音
00:07:47.466 → 00:07:50.733
它大概 30 秒就開始啪啪啪啪啪產出字稿
00:07:50.800 → 00:07:53.666
然後 3 分鐘之內馬上轉錄成文字
00:07:55.266 → 00:07:59.033
你想以前我們用 Whisper 的模型都還要花時間
00:07:59.100 → 00:08:00.933
還要試你電腦的效能
00:08:00.966 → 00:08:03.833
但是 Gemini 它可以做的又快又好
00:08:05.400 → 00:08:08.566
他的需求是他家裡有大量家族出遊的影片
00:08:08.633 → 00:08:10.966
這個在我另外一部影片有講到要把所有
00:08:11.000 → 00:08:12.466
有家人的片段撈出來
00:08:12.533 → 00:08:14.533
捨棄純風景跟路人的部分
00:08:14.566 → 00:08:16.866
就他小時候家裡拍的影片
00:08:16.933 → 00:08:19.000
出去玩拍的 VCR V8
00:08:19.033 → 00:08:19.500
那 Claude
00:08:19.533 → 00:08:21.400
因為它無法直接讀取影片
00:08:21.466 → 00:08:23.233
它只能去用工具去影片裡面
00:08:23.266 → 00:08:25.500
可能每 5 秒每 10 秒去截一張圖
00:08:26.666 → 00:08:28.466
那這個就很耗 token
00:08:28.500 → 00:08:29.900
又累又不是一步到位
00:08:30.800 → 00:08:31.366
但是 Gemini
00:08:31.400 → 00:08:32.800
你只要把影片送進去
00:08:32.866 → 00:08:34.766
它可以直接讀懂影片的內容
00:08:34.800 → 00:08:37.000
告訴你幾分幾秒是家人
00:08:37.066 → 00:08:38.533
幾分幾秒有可能是路人
00:08:38.600 → 00:08:39.633
幾分幾秒沒有人
00:08:41.300 → 00:08:42.966
那這些幾分幾秒回傳之後
00:08:43.033 → 00:08:45.633
我們就可以用工具來做快速的剪輯
00:08:45.666 → 00:08:47.866
這一點是 Claude 本身辦不到的
00:08:47.900 → 00:08:52.300
還有就是他對影像的辨識也非常的準確
00:08:52.366 → 00:08:57.466
有個學員他的需求是要把掃描的書籍數位化
00:08:57.933 → 00:09:00.200
Claude 好像只能處理拉丁字母
00:09:00.233 → 00:09:02.600
那中文書就不太行了
00:09:02.633 → 00:09:04.066
辨識常常會錯誤
00:09:04.133 → 00:09:06.366
還需要事後的去猜測跟修正
00:09:06.400 → 00:09:08.900
還有如果圖裡面有
00:09:09.466 → 00:09:12.566
那 Claude 對複圖的辨識也不太好
00:09:12.633 → 00:09:14.866
但是 Gemini 可以完全準確地辨識
00:09:14.900 → 00:09:18.966
而且還可以去回傳這張圖裡面小圖的座標在什麼地方
00:09:19.033 → 00:09:20.200
那這個座標傳回來之後
00:09:20.233 → 00:09:25.033
我們可以再另外用程式把那個圖從另外一張圖裡面摳出來
00:09:25.066 → 00:09:26.566
這個是非常的實用的
00:09:26.600 → 00:09:31.066
甚至 Gemini 可以拿來去讀一些我們產出檔案的排版
00:09:31.133 → 00:09:34.733
然後可以準確地辨認出來哪些地方排版怪怪的
00:09:34.766 → 00:09:36.566
有邊界超出的
00:09:38.133 → 00:09:39.700
有孤行的問題
00:09:39.733 → 00:09:42.100
有文字疊合的問題
00:09:42.133 → 00:09:44.266
準確地回傳需要修整的地方
00:09:45.300 → 00:09:48.433
Gemini 就是御三家裡面的價效比之王
00:09:48.466 → 00:09:50.166
它也是多模態之王
00:09:50.200 → 00:09:51.133
它跟 Claude 相比
00:09:51.200 → 00:09:55.666
雖然處理任務連續工具呼叫的能力沒那麼好
00:09:55.700 → 00:09:57.366
但是它有它自己的擅長
00:09:57.433 → 00:09:59.366
那 open AI 的 GPT 呢
00:09:59.400 → 00:10:04.133
OpenAI 的 GPT 如果用在像是 Agentic AI 的工具裡面
00:10:04.166 → 00:10:06.433
他們家原生的工具叫做 Codex
00:10:06.500 → 00:10:09.000
那麼 Codex 我可以開啟來給大家看一下
00:10:09.033 → 00:10:11.266
它長得就像是這樣子一樣
00:10:11.300 → 00:10:13.166
有沒有很像 Claude Code
00:10:14.500 → 00:10:16.333
其實 Gemini 他們家也有類似的
00:10:16.400 → 00:10:19.133
都是 Agentic AI 的工具
00:10:19.200 → 00:10:23.033
在終端機裡面就是它本身後面接的是 GPT 的模型
00:10:23.066 → 00:10:25.633
那麼 Codex 它的好處是這樣子的
00:10:27.733 → 00:10:29.800
第一個目前來說
00:10:29.866 → 00:10:33.233
花同樣的錢買同樣的訂閱方案
00:10:34.033 → 00:10:35.900
度給的比 Claude 大方
00:10:36.166 → 00:10:37.266
這個是屬於政策面
00:10:37.333 → 00:10:40.266
所以也許你過了兩年回來看我這部影片
00:10:40.300 → 00:10:42.500
或許 OpenAI 變得更摳了
00:10:42.566 → 00:10:43.666
Anthropic 變得更大方
00:10:46.000 → 00:10:47.766
OpenAI 他們給的比較大方
00:10:47.833 → 00:10:51.600
可以用的比較久來長任務的處理方面
00:10:51.633 → 00:10:56.733
我認為 GPT-5.5 現在跟 Claude Opus 是不相上下
00:10:56.766 → 00:10:59.033
我都可以信任他們去幫我做場任務
00:11:00.500 → 00:11:05.100
我目前用 Codex 主要的原因是因為我要把它當備用大腦
00:11:05.666 → 00:11:08.033
如果我的 Claude 它額
00:11:08.100 → 00:11:09.000
度被我用爆了
00:11:09.066 → 00:11:10.766
但我那個禮拜還是要工作
00:11:10.833 → 00:11:12.833
或者是我的 Claude shut down 了
00:11:12.866 → 00:11:14.966
他們伺服器常常不穩定
00:11:15.033 → 00:11:17.300
那我就會馬上轉來 GPT
00:11:17.333 → 00:11:20.266
轉來 Codex 繼續做我的工作
00:11:20.333 → 00:11:21.366
不會整個停擺
00:11:21.400 → 00:11:26.133
或者是如果我的 Claude 它有一些問題解不掉
00:11:26.200 → 00:11:28.600
那我會讓 GPT 過來救援
00:11:29.566 → 00:11:30.933
有些問題 Claude 解不掉的
00:11:31.000 → 00:11:32.633
GPT 反而就可以解掉
00:11:32.666 → 00:11:34.433
或者是拿來當評審
00:11:34.466 → 00:11:36.700
用不同模型的角度去做審查
00:11:36.733 → 00:11:38.633
避免球員兼裁判的問題
00:11:39.500 → 00:11:42.366
他們家有一個非常重要的特色
00:11:42.433 → 00:11:44.100
就是目前為止
00:11:44.133 → 00:11:45.600
我們 2026年中
00:11:45.666 → 00:11:49.700
GPT 的 Image 2 模型是生圖最強的模型
00:11:49.766 → 00:11:52.133
這個其他家都打不過
00:11:52.166 → 00:11:52.866
Claude 就不用講了
00:11:52.900 → 00:11:55.600
他們根本沒有生圖的模型
00:11:55.666 → 00:11:56.966
Gemini 的 Nano Banana
00:11:57.033 → 00:11:58.266
目前跟它有一段
00:11:59.400 → 00:12:04.433
目前的 GPT Image 2 的生圖是斷崖式的領先
00:12:04.933 → 00:12:06.333
我需要生圖的時候
00:12:06.400 → 00:12:07.966
我就會使用 GPT
00:12:08.000 → 00:12:08.833
那你說 Dustin
00:12:08.900 → 00:12:12.866
那這樣聽起來好像你用 Codex 當主力也可以
00:12:12.900 → 00:12:14.933
為什麼你不用 Codex 當主力
00:12:15.000 → 00:12:16.133
你把 GPT 當備用
00:12:16.166 → 00:12:18.300
原因就是比較個人的
00:12:18.366 → 00:12:21.300
因為第一個我先用慣了 Claude Code
00:12:21.333 → 00:12:27.966
第二個則是因為我的 Harness 就是我的規則和環境這些東西都在 Claude Code 這個地方
00:12:28.366 → 00:12:31.000
在這邊工作起來同樣厲害的模型
00:12:31.066 → 00:12:32.300
有一個好的環境
00:12:32.333 → 00:12:33.800
跑起來是最順的
00:12:33.866 → 00:12:36.400
像是 CLAUDE.md
00:12:36.466 → 00:12:37.933
像是 rules
00:12:37.966 → 00:12:38.833
像是 hooks
00:12:38.900 → 00:12:40.866
那我另外一部影片有在講
00:12:40.933 → 00:12:43.033
如果你想要兩邊都跑得很順
00:12:43.066 → 00:12:44.300
可以怎麼同步
00:12:44.366 → 00:12:45.700
你可以參考那部影片
00:12:45.733 → 00:12:48.300
所以我們剛剛講了這些家的優劣勢之後
00:12:49.166 → 00:12:50.033
你可能會想說
00:12:50.066 → 00:12:52.300
那 Dustin,那我自己該怎麼搭配
00:12:52.366 → 00:12:54.700
那當然我都會先建議各位都試看看
00:12:54.733 → 00:13:00.333
來想看看哪一個適合你的主力溝通的模型要當你的秘書長
00:13:00.366 → 00:13:02.433
那誰適合做什麼任務
00:13:02.466 → 00:13:03.533
你都試過一次之後
00:13:03.566 → 00:13:05.700
慢慢會感覺在你的角度
00:13:05.766 → 00:13:08.233
你覺得哪些模型適合做什麼事情
00:13:08.266 → 00:13:11.133
而且這個就算是同一個人也會改變的
00:13:11.200 → 00:13:14.666
因為你的任務有可能會隨著你的生涯而不同
00:13:14.700 → 00:13:19.200
有可能會隨著你讓 AI 跟你協作的滲透率的不同
00:13:19.233 → 00:13:24.200
還有就是這些家模型未來各家的發展也可能不一樣
00:13:24.233 → 00:13:26.133
所以你要不斷的去嘗試
00:13:27.133 → 00:13:28.266
這是你的心態
00:13:28.300 → 00:13:31.000
最後我想要跟你來分享
00:13:31.033 → 00:13:33.733
那你要怎麼樣讓它們結合在一起
00:13:33.800 → 00:13:40.900
也就是你要怎麼樣讓你的這個主力模型能夠去順利地呼叫別家的模型去幫你做事
00:13:40.966 → 00:13:44.133
這樣你就不用再一直切去對不對
00:13:45.866 → 00:13:47.733
我們來分享兩個東西
00:13:47.800 → 00:13:54.666
第一個就是你還記得我們之前的影片有講到一個東西叫做 agent 嗎
00:13:54.700 → 00:13:56.033
還有一個東西叫 skill
00:13:56.100 → 00:13:58.200
Skill 就是一個技能
00:13:58.266 → 00:14:00.433
agent 就是一個代理人
00:14:00.466 → 00:14:06.533
這些 skill 跟 agent 我們都可以去指定讓模型做什麼樣的任務
00:14:06.566 → 00:14:10.766
那如果你想要讓你的 Claude 去呼叫 Codex 幫你做事
00:14:10.800 → 00:14:13.733
你不用自己親自切到 Codex
00:14:13.800 → 00:14:15.466
這個官方已經幫你搞好了
00:14:15.533 → 00:14:16.766
我也覺得很神奇
00:14:16.800 → 00:14:19.566
你可以去到這個地方 OpenAI
00:14:19.600 → 00:14:21.633
他們自己的 GitHub 賬號
00:14:21.700 → 00:14:25.400
他們有一個專案叫做 Codex Plugin
00:14:25.433 → 00:14:27.266
把這個網址丟給 Claude Code
00:14:27.333 → 00:14:29.400
把它安裝進去
00:14:29.433 → 00:14:30.400
安裝進去之後
00:14:30.466 → 00:14:32.766
你打斜線 Codex
00:14:32.833 → 00:14:40.233
你就會發現這邊有一連串的指令可以讓你用它可以讓你使用 Codex 去做各種各樣的任務
00:14:40.266 → 00:14:44.900
比如說這個指令就是可以讓模型邀請 Codex 的模型
00:14:44.933 → 00:14:50.966
就是 GPT 的模型進來審查你目前的程式碼或者是內容
00:14:51.033 → 00:14:55.900
比如說這個就是當你今天在 Claude Code 卡關的時候
00:14:55.933 → 00:14:58.600
你可以邀請 Codex 進來救場
00:14:58.666 → 00:14:59.866
我也覺得很好笑
00:14:59.900 → 00:15:03.433
比如說這個就是對抗式審查
00:15:03.500 → 00:15:06.366
你可以邀請進來毒舌審查
00:15:06.400 → 00:15:08.600
那我自己也根據了這些 prompt
00:15:08.633 → 00:15:12.133
我請 Claude 幫我創造了一個叫 Codex image
00:15:12.200 → 00:15:16.900
這個指令的用途就是邀請 Codex 進來幫我做圖片
00:15:16.933 → 00:15:19.100
這樣我就不用再去切到 Codex 去用了
00:15:20.733 → 00:15:22.500
那實際上做法像什麼樣子
00:15:24.466 → 00:15:27.500
我先上網抓了一些在 Reddit
00:15:27.533 → 00:15:32.900
就是國外論壇上面 24 小時之內討論 AI 的熱點的內容
00:15:33.233 → 00:15:34.200
我自己看完之後
00:15:34.233 → 00:15:36.466
我覺得這個挺好的
00:15:36.500 → 00:15:39.633
我想要分享到 i g 上面給大家看
00:15:39.700 → 00:15:41.900
而且我要用圖卡的方式
00:15:42.433 → 00:15:44.733
Claude 可以直接去做圖嗎
00:15:44.766 → 00:15:49.500
它好像只能去做類似像 HTML 網頁風格的圖片,對不對
00:15:49.533 → 00:15:52.833
但是能不能夠像 GPT 的生圖模型一樣
00:15:52.866 → 00:15:56.300
可以幫我生出非常客製化又非常精美的圖卡
00:15:56.933 → 00:16:00.566
所以我想要讓 GPT 也就是 Codex 幫我做圖
00:16:00.600 → 00:16:04.566
我就直接用我所設計的指令 Codex image
00:16:04.600 → 00:16:10.800
後面寫用日式簡約風格為以上摘要產出 Instagram 分享圖卡
00:16:11.766 → 00:16:16.533
這個時候你可以看到這個模型本身就直接去呼叫了 Codex
00:16:16.566 → 00:16:18.766
用 Codex 的工具
00:16:19.400 → 00:16:21.300
當然我會事先登入
00:16:21.366 → 00:16:23.233
所以它吃的是我的訂閱制的額
00:16:25.000 → 00:16:27.966
你看這裡面就有 Codex 怎麼回應的
00:16:28.100 → 00:16:30.200
接下來過了一系列之後
00:16:30.266 → 00:16:31.233
這邊都是 Claude
00:16:31.266 → 00:16:34.433
他跟我講目前 Codex 的進度是什麼
00:16:34.500 → 00:16:37.000
最後完成了我要的圖片
00:16:37.066 → 00:16:39.766
幫我放在指定的位置
00:16:39.833 → 00:16:41.500
像是這個樣子
00:16:42.466 → 00:16:44.000
這個不像是日式簡約
00:16:44.033 → 00:16:45.100
但這只是一個示範
00:16:45.166 → 00:16:47.800
所以等一下我應該會再請他改一下
00:16:50.633 → 00:16:53.233
剛剛我們這樣講是用 Plug in 的形式
00:16:53.300 → 00:16:54.766
Codex 官方有 Plugin
00:16:55.400 → 00:16:57.133
那 Gemini 有沒有類似的
00:16:57.800 → 00:17:00.466
你也可以請 Claude 上去
00:17:00.533 → 00:17:07.133
去幫你找有沒有可以讓你在 Claude Code 裡面去呼叫 Gemini 的 plugin
00:17:07.166 → 00:17:09.266
不過我自己是用另外一種形式
00:17:09.300 → 00:17:11.800
我是直接把 Gemini 做成一個 agent
00:17:13.300 → 00:17:16.000
我們在之前的影片裡面講過
00:17:16.066 → 00:17:18.933
agent 就是一個常態的角色
00:17:18.966 → 00:17:22.066
所以我有做了一個 agent 在這個地方
00:17:22.133 → 00:17:23.666
因為這個任務很常見
00:17:23.700 → 00:17:31.933
我就說這個 agent 它本身的功能就是用我的 Gemini 的 API 去做到語音轉文字
00:17:31.966 → 00:17:35.933
做的形式、怎麼去傳檔案
00:17:36.000 → 00:17:37.300
檔案大了怎麼辦
00:17:37.333 → 00:17:41.166
Default 用什麼模型都在這個 agent 檔裡面規範好
00:17:41.200 → 00:17:42.133
那麼你可以看到
00:17:42.200 → 00:17:44.366
當我今天把 Email 送進去
00:17:44.400 → 00:17:47.866
我說用 Gemini 轉錄成逐字稿的時候
00:17:47.933 → 00:17:53.800
它就會直接派出這個 agent 去呼叫 Gemini 過來幫我處理
00:17:54.766 → 00:17:57.800
最後幫我放入一個檔案
00:17:57.833 → 00:18:00.433
我們來看檔案像這個樣子
00:18:00.500 → 00:18:01.866
完美完成了任務
00:18:02.333 → 00:18:06.200
我的 agent 裡面我也有單獨做了一個 Gemini 的 agent
00:18:06.233 → 00:18:09.200
這個就不是專門為語音辨識而做了
00:18:09.233 → 00:18:10.733
這個 agent 比較通用
00:18:10.766 → 00:18:15.933
它可以直接呼叫你電腦裡面安裝的 Gemini CLI 工具
00:18:15.966 → 00:18:21.266
然後呢根據你的各種不同任務去分配不同智力等級的模型
00:18:21.333 → 00:18:22.666
然後把結果回傳
00:18:24.433 → 00:18:26.633
我有一段 200 多頁的 PDF
00:18:26.666 → 00:18:28.533
我不想讓 Claude 幫我直接去讀
00:18:28.566 → 00:18:30.966
因為 Claude 比較貴
00:18:31.033 → 00:18:34.100
那長文本的價效比之王是 Gemini
00:18:34.133 → 00:18:37.033
我希望 Gemini 讀完之後給我摘要
00:18:37.100 → 00:18:39.433
我就會告訴我的 Claude 說
00:18:39.466 → 00:18:42.533
請你用 Gemini agent 幫我去讀這個東西
00:18:43.500 → 00:18:44.666
那麼這種時候
00:18:44.733 → 00:18:46.166
他就會先辨認
00:18:46.566 → 00:18:49.400
這個任務應該就只是單純的摘要
00:18:49.700 → 00:18:52.033
就不用用到那麼貴的 Pro 的模型
00:18:52.066 → 00:18:53.466
就用 Flash 的模型
00:18:53.533 → 00:18:56.200
幫我把這本書送去給 Gemini
00:18:56.233 → 00:18:57.333
做完摘要之後
00:18:57.400 → 00:19:01.133
那個 agent 把結果回傳給 Claude,再幫我做整合
00:19:01.533 → 00:19:04.233
我主要的對話都不離開 Claude
00:19:04.266 → 00:19:04.533
Claude
00:19:04.600 → 00:19:07.066
我讓我的需求跟 Claude 講
00:19:07.100 → 00:19:11.866
然後給他能夠 call out to 其他模型的管道
00:19:11.900 → 00:19:14.533
比如說幫他裝好 Codex 的工具
00:19:14.600 → 00:19:15.700
幫他裝好 Plug in
00:19:15.733 → 00:19:17.833
幫他裝好 Gemini 的工具
00:19:17.900 → 00:19:19.800
幫他設計好 Gemini agent
00:19:19.833 → 00:19:25.500
他就會自動的幫我把任務分配給最適合的模型
00:19:25.533 → 00:19:27.100
模型把任務完成之後
00:19:27.133 → 00:19:31.600
他再去撈完成後的結果去做接下來的事情
00:19:31.666 → 00:19:36.833
這個就是我認為你應該可以學習的多模型協作的方式
00:19:37.200 → 00:19:40.266
當下次有人跟你吵說哪一家模型好
00:19:40.333 → 00:19:42.033
哪一家模型不好的時候
00:19:42.066 → 00:19:45.566
你就應該回他一句小孩子才做選擇
00:19:48.100 → 00:19:48.800
我是 Dustin