各位朋友大家好 我是 Dustin 那我今天這一集 想要跟大家聊一聊模型的選擇 我們可以看到像這樣的留言 在社群上面其實一直在被討論 比如說到底我要選擇 OpenAI 的 ChatGPT、Codex 還是說我要選擇 Claude 還是說我要選擇 Gemini 或者像是我要不要去接入 DeepSeek,像 這樣的問題 那麼這些問題 其實對我來說 我覺得不應該被扁平化 什麼叫扁平化 不應該說好像我們就只跟定一家模型 其他的我們就不跟了 因為我們都知道各家模型商之間的競爭是非常激烈的 那往往一家發了新模型 另外一家就會更迭代 而且我們現在在用的這個 Claude 它其實也才剛過一歲生日而已 我們也無法去預知 說 搞不好明年最強的工具就不是這個了 所以 我覺得比較成熟的心態應該是搭配使用 所以今天我想來跟你先講解在我個人的想法裡面 主流模型的強弱項分別是什麼 那當然因為主流模型也是蠻多的 所以 我會以我自己常常在使用的為主 接下來 我們會聊一聊我是怎麼配置讓這些模型可以放在一起協作的 那我們就開始 首先第一個當然是 Claude Claude 他們家的模型被我當做是大腦中樞 有幾個原因 第一個原因是因為 Claude 模型在寫程式上面以及在長時間複雜任務的處理跟工具呼叫上面做的是最好的 不會說做一做就斷掉或者是做到卡關就停下來 所以 我選擇用 Claude 做我的大腦模型 也就是我通常都是 用 Claude 的模型去互動 讓他去幫我執行任務 那麼 Claude 模型也有分好幾個等級 比如說 Opus、Sonnet 跟 Haiku 我會怎麼去分 如果是要做一些我不確定的任務 複雜的架構 或者是真的比較需要智力邏輯推論的任務 我就會用 Opus 或者是如果當中我的額 度太多沒有燒完 我就會給他用 Opus 狂燒 他最聰明 但他的額 度消耗最多 那如果我當中額 度比較緊 或者是我在處理的任務就是一個步驟比較簡單 不會用到太多智力的任務 那我就會用 Sonnet 比如說寫信回信套既有的模板 那 Sonnet 是最適合我們日常使用的任務 我自己也沒有感覺到 Sonnet 有什麼太大的阻礙 那如果還有一些東西 比如說像是隻是上網查個資料 那我就會用 Haiku 因為這個模型是最省額 度的 不過啦 其實 Haiku 我不常切 是因為我自己的方案 目前是 100 美元的方案 我不用特別去切 Haiku 我一直用 Sonnet 也不太會好玩 以我的工作 量跟頻率來講 所以 我就沒有特別去切 Haiku 但是如果你今天用的是 20 美元的 Pro 的話 那可能你的切換就會更精細來達到最好的 CP 值 所以這個是 Claude 但是 Claude 也有它的短板 他雖然最強的是寫程式跟任務的呼叫 但他的短板就是他無法去吃文字檔案以外的 input 比如說你想要讓它去轉錄一段語音成為文字檔 你想要讓它去聽音樂 瞭解這個音樂哪裡是過門 你想讓他去讀影片 去幫你對影片做摘要 甚至是抓影片裡面的某一幕的畫面 那麼 Claude 在做這件事上面是比較困難 甚至有可能會做不到 那麼這個時候我們就要來講到第二家被人廣為使用的模型了 叫做 Gemini 我想一定不少人都有用過 只是大部分人用的應該都是網頁版的 Gemini,對不對 那網頁版的 Gemini 當然量大管飽 可以很好的去 滿足我們的需求 還有就是 Google 官方也用他們的生態系的優勢 把 Gemini 嵌到了很多 Google 的服務裡面 所以你可以在很多地方用到它 那我之前還沒有用 Claude 之前 我其實也蠻常用 Gemini 甚至會讓它去做寫程式 去呼叫任務 但是很快的我就發現好像跟 Claude 一比 Gemini 在呼叫任務跟寫程式上面表現的不太好 不太穩定 常常會有幻覺 或者是今天我要他改 a A 是壞的 他改了 a 的同時也把 b 改壞了 我再叫他把 a 跟 b 一起修好 結果他修好了之後又把 c 改掉了 那所以這就是為什麼 Gemini 後來被慢慢被我不用的原因 甚至我有一段時間是嫌棄 Gemini 的 但是我現在要跟你分享 你聽到有人在嫌棄某家模型的時候 其實代表是他們看到的 use case 不夠多 因為當我後來慢慢地接觸到不同的 use case 使用情境 AI 對我生活的滲透率越來越高 以及我的學員們 他們有各種不同的需求的時候 我慢慢又發現了 Gemini 的好處 所以我又寫了一篇文章 那在這邊跟大家也官宣 工商一下我自己的部落格 我會把 blog 放在下面的說明欄 在這個裡面我會每週更新大量的文章 分享我對 AI 的感悟 好 那這邊我有寫了 Gemini 我曾經也貶低過他 但是後來我發現他有 4 個其他家目前打不過的 use case 第一個 它在處理長文本以及大量資料的清洗的時候 它是價效比之王 長文本 比如說幾十萬字去做摘要 它的 API 是最便宜的 相較於其他家的 三家的模型 這種或者是資料清洗 比如說改錯字 比如說幫每一個 貼文去標上情緒的標籤 是負面還是中性 把每一則新聞的短訊標上這個新聞跟什麼關鍵字有關係 這種上標籤 資料清洗跟標記 它是價效比最高的 那當然價效比更高的也是有 來自中國的模型 不過這些模型 如果你用他們的端點 很多時候那個 Server 就在中國 所以如果你對一些個人資料安全隱私有疑慮的時候 那當然就不會是一個好選擇 那 Google 算是一個相對比較好的選擇 當然最好的選擇肯定是開源模型在自己內部自架 對不對 不過自架這個也需要有硬體的限制 不是所有人都辦得到的 所以權衡之下 安全與方便 與效能的平衡 我覺得 Gemini Flash Lite 是大量資料清洗的價效比之王 再來第二個就是它原生支援輸入聲音跟影片 那我目前試到的是它可以去處理有多個講者在同一個語音裡面 它可以分得清楚誰是誰 它聽得懂 他可以去辨識語氣 他也可以去聽懂音樂旋律 因為我有去玩一些音樂的專案 那我需要去收集音樂素材來編歌 那我就需要知道每個音樂的 頻率是什麼 過門是什麼 那這個 Claude 跟 GPT 做的都不是很好 甚至 Claude 是不能做的 因為它不能去讀聲音 但是 geminate 可以做到 而且做的非常的準 還有就是最近的新版好 當然 在我這個影片錄的當下 Gemini 3.5 Flash 它處理語音轉摘要、轉逐字稿的速度超級快 比如說 一段 30 分鐘的語音 它大概 30 秒就開始啪啪啪啪啪產出字稿 然後 3 分鐘之內馬上轉錄成文字 非常的準 不會漏掉 你想以前我們用 Whisper 的模型都還要花時間 還要試你電腦的效能 但是 Gemini 它可以做的又快又好 還有 有個學員 他的需求是他家裡有大量家族出遊的影片 這個在我另外一部影片有講到要把所有 有家人的片段撈出來 捨棄純風景跟路人的部分 就他小時候家裡拍的影片 出去玩拍的 VCR V8 那 Claude 因為它無法直接讀取影片 它只能去用工具去影片裡面 可能每 5 秒每 10 秒去截一張圖 去辨識 那這個就很耗 token 又累又不是一步到位 對不對 但是 Gemini 你只要把影片送進去 它可以直接讀懂影片的內容 告訴你幾分幾秒是家人 幾分幾秒有可能是路人 幾分幾秒沒有人 只是風景 那這些幾分幾秒回傳之後 我們就可以用工具來做快速的剪輯 這一點是 Claude 本身辦不到的 還有就是他對影像的辨識也非常的準確 有個學員他的需求是要把掃描的書籍數位化 但是 Claude 好像只能處理拉丁字母 那中文書就不太行了 辨識常常會錯誤 還需要事後的去猜測跟修正 還有如果圖裡面有 複圖 那 Claude 對複圖的辨識也不太好 但是 Gemini 可以完全準確地辨識 而且還可以去回傳這張圖裡面小圖的座標在什麼地方 那這個座標傳回來之後 我們可以再另外用程式把那個圖從另外一張圖裡面摳出來 這個是非常的實用的 甚至 Gemini 可以拿來去讀一些我們產出檔案的排版 然後可以準確地辨認出來哪些地方排版怪怪的 有邊界超出的 溢位的問題 有孤行的問題 有文字疊合的問題 準確地回傳需要修整的地方 簡單來說 Gemini 就是御三家裡面的價效比之王 它也是多模態之王 它跟 Claude 相比 雖然處理任務連續工具呼叫的能力沒那麼好 但是它有它自己的擅長 那 open AI 的 GPT 呢 OpenAI 的 GPT 如果用在像是 Agentic AI 的工具裡面 他們家原生的工具叫做 Codex 那麼 Codex 我可以開啟來給大家看一下 它長得就像是這樣子一樣 有沒有很像 Claude Code 對不對 好 其實 Gemini 他們家也有類似的 都是 Agentic AI 的工具 在終端機裡面就是它本身後面接的是 GPT 的模型 那麼 Codex 它的好處是這樣子的 我個人覺得 第一個目前來說 花同樣的錢買同樣的訂閱方案 他們家的額 度給的比 Claude 大方 當然 這個是屬於政策面 所以也許你過了兩年回來看我這部影片 或許 OpenAI 變得更摳了 Anthropic 變得更大方 也不一定 但目前為止 OpenAI 他們給的比較大方 可以用的比較久來長任務的處理方面 我認為 GPT-5.5 現在跟 Claude Opus 是不相上下 我都可以信任他們去幫我做場任務 不會斷掉 那所以 我目前用 Codex 主要的原因是因為我要把它當備用大腦 什麼意思 如果我的 Claude 它額 度被我用爆了 但我那個禮拜還是要工作 或者是我的 Claude shut down 了 他們伺服器常常不穩定 那我就會馬上轉來 GPT 轉來 Codex 繼續做我的工作 不會整個停擺 或者是如果我的 Claude 它有一些問題解不掉 那我會讓 GPT 過來救援 嘿 這個很神奇 有些問題 Claude 解不掉的 GPT 反而就可以解掉 或者是拿來當評審 用不同模型的角度去做審查 避免球員兼裁判的問題 還有 他們家有一個非常重要的特色 就是目前為止 我們 2026年中 GPT 的 Image 2 模型是生圖最強的模型 這個其他家都打不過 Claude 就不用講了 他們根本沒有生圖的模型 Gemini 的 Nano Banana 目前跟它有一段 不小的差距 目前的 GPT Image 2 的生圖是斷崖式的領先 所以 我需要生圖的時候 我就會使用 GPT 那你說 Dustin 那這樣聽起來好像你用 Codex 當主力也可以 為什麼你不用 Codex 當主力 你把 GPT 當備用 原因就是比較個人的 因為第一個我先用慣了 Claude Code 第二個則是因為我的 Harness 就是我的規則和環境這些東西都在 Claude Code 這個地方 所以 在這邊工作起來同樣厲害的模型 有一個好的環境 跑起來是最順的 像是 CLAUDE.md 像是 rules 像是 hooks 那我另外一部影片有在講 如果你想要兩邊都跑得很順 可以怎麼同步 你可以參考那部影片 所以我們剛剛講了這些家的優劣勢之後 對不對 你可能會想說 那 Dustin,那我自己該怎麼搭配 那當然我都會先建議各位都試看看 來想看看哪一個適合你的主力溝通的模型要當你的秘書長 那誰適合做什麼任務 你都試過一次之後 慢慢會感覺在你的角度 你覺得哪些模型適合做什麼事情 而且這個就算是同一個人也會改變的 因為你的任務有可能會隨著你的生涯而不同 有可能會隨著你讓 AI 跟你協作的滲透率的不同 還有就是這些家模型未來各家的發展也可能不一樣 所以你要不斷的去嘗試 精進研究 這是你的心態 最後我想要跟你來分享 那你要怎麼樣讓它們結合在一起 也就是你要怎麼樣讓你的這個主力模型能夠去順利地呼叫別家的模型去幫你做事 這樣你就不用再一直切去對不對 好 我們來分享兩個東西 第一個就是你還記得我們之前的影片有講到一個東西叫做 agent 嗎 還有一個東西叫 skill Skill 就是一個技能 agent 就是一個代理人 這些 skill 跟 agent 我們都可以去指定讓模型做什麼樣的任務 那如果你想要讓你的 Claude 去呼叫 Codex 幫你做事 你不用自己親自切到 Codex 這個官方已經幫你搞好了 我也覺得很神奇 你可以去到這個地方 OpenAI 他們自己的 GitHub 賬號 他們有一個專案叫做 Codex Plugin 把這個網址丟給 Claude Code 把它安裝進去 安裝進去之後 你打斜線 Codex 你就會發現這邊有一連串的指令可以讓你用它可以讓你使用 Codex 去做各種各樣的任務 比如說這個指令就是可以讓模型邀請 Codex 的模型 就是 GPT 的模型進來審查你目前的程式碼或者是內容 比如說這個就是當你今天在 Claude Code 卡關的時候 你可以邀請 Codex 進來救場 我也覺得很好笑 比如說這個就是對抗式審查 你可以邀請進來毒舌審查 那我自己也根據了這些 prompt 我請 Claude 幫我創造了一個叫 Codex image 這個指令的用途就是邀請 Codex 進來幫我做圖片 這樣我就不用再去切到 Codex 去用了 對不對 好 那實際上做法像什麼樣子 比如說 舉個例子 現在 我先上網抓了一些在 Reddit 就是國外論壇上面 24 小時之內討論 AI 的熱點的內容 好 我自己看完之後 我覺得這個挺好的 我想要分享到 i g 上面給大家看 而且我要用圖卡的方式 那你想 Claude 可以直接去做圖嗎 它好像只能去做類似像 HTML 網頁風格的圖片,對不對 但是能不能夠像 GPT 的生圖模型一樣 可以幫我生出非常客製化又非常精美的圖卡 不行 所以我想要讓 GPT 也就是 Codex 幫我做圖 我就直接用我所設計的指令 Codex image 後面寫用日式簡約風格為以上摘要產出 Instagram 分享圖卡 好 這個時候你可以看到這個模型本身就直接去呼叫了 Codex 用 Codex 的工具 好這個工具 當然我會事先登入 所以它吃的是我的訂閱制的額 度 送進指令 你看這裡面就有 Codex 怎麼回應的 嗯 接下來過了一系列之後 這邊都是 Claude 他跟我講目前 Codex 的進度是什麼 最後完成了我要的圖片 幫我放在指定的位置 像是這個樣子 這樣 我自己覺得 這個不像是日式簡約 但這只是一個示範 所以等一下我應該會再請他改一下 這哪來日式 好 那再來 剛剛我們這樣講是用 Plug in 的形式 Codex 官方有 Plugin 對不對 那 Gemini 有沒有類似的 也有 你也可以請 Claude 上去 去幫你找有沒有可以讓你在 Claude Code 裡面去呼叫 Gemini 的 plugin 不過我自己是用另外一種形式 我是直接把 Gemini 做成一個 agent 什麼意思 我們在之前的影片裡面講過 agent 就是一個常態的角色 所以我有做了一個 agent 在這個地方 因為這個任務很常見 我就說這個 agent 它本身的功能就是用我的 Gemini 的 API 去做到語音轉文字 做的形式、怎麼去傳檔案 檔案大了怎麼辦 Default 用什麼模型都在這個 agent 檔裡面規範好 那麼你可以看到 當我今天把 Email 送進去 我說用 Gemini 轉錄成逐字稿的時候 它就會直接派出這個 agent 去呼叫 Gemini 過來幫我處理 處理完之後 最後幫我放入一個檔案 我們來看檔案像這個樣子 完美完成了任務 那當然 我的 agent 裡面我也有單獨做了一個 Gemini 的 agent 這個就不是專門為語音辨識而做了 這個 agent 比較通用 它可以直接呼叫你電腦裡面安裝的 Gemini CLI 工具 然後呢根據你的各種不同任務去分配不同智力等級的模型 然後把結果回傳 比如說 我有一段 200 多頁的 PDF 我不想讓 Claude 幫我直接去讀 因為 Claude 比較貴 那長文本的價效比之王是 Gemini 我希望 Gemini 讀完之後給我摘要 我就會告訴我的 Claude 說 請你用 Gemini agent 幫我去讀這個東西 給我摘要 那麼這種時候 他就會先辨認 OK 這個任務應該就只是單純的摘要 所以 就不用用到那麼貴的 Pro 的模型 就用 Flash 的模型 幫我把這本書送去給 Gemini 做完摘要之後 那個 agent 把結果回傳給 Claude,再幫我做整合 所以 我主要的對話都不離開 Claude Claude 我讓我的需求跟 Claude 講 然後給他能夠 call out to 其他模型的管道 比如說幫他裝好 Codex 的工具 幫他裝好 Plug in 幫他裝好 Gemini 的工具 幫他設計好 Gemini agent 他就會自動的幫我把任務分配給最適合的模型 模型把任務完成之後 他再去撈完成後的結果去做接下來的事情 這個就是我認為你應該可以學習的多模型協作的方式 所以 當下次有人跟你吵說哪一家模型好 哪一家模型不好的時候 你就應該回他一句小孩子才做選擇 我全都要 我是 Dustin 我們下次見 拜拜