WEBVTT
Kind: captions
Language: zh-TW

00:00:00.000 --> 00:00:01.000
各位朋友大家好

00:00:01.066 --> 00:00:02.266
我是 Dustin 

00:00:02.300 --> 00:00:03.066
那我今天這一集

00:00:03.100 --> 00:00:05.600
想要跟大家聊一聊模型的選擇

00:00:05.633 --> 00:00:07.633
我們可以看到像這樣的留言

00:00:07.700 --> 00:00:10.133
在社群上面其實一直在被討論

00:00:10.166 --> 00:00:14.200
比如說到底我要選擇 OpenAI 的 ChatGPT、Codex 

00:00:14.266 --> 00:00:15.966
還是說我要選擇 Claude 

00:00:16.033 --> 00:00:17.733
還是說我要選擇 Gemini 

00:00:17.766 --> 00:00:20.466
或者像是我要不要去接入 DeepSeek，像

00:00:20.500 --> 00:00:21.233
這樣的問題

00:00:21.266 --> 00:00:21.933
那麼這些問題

00:00:21.966 --> 00:00:24.233
其實對我來說

00:00:24.300 --> 00:00:27.400
我覺得不應該被扁平化

00:00:27.433 --> 00:00:28.866
什麼叫扁平化

00:00:28.933 --> 00:00:31.666
不應該說好像我們就只跟定一家模型

00:00:31.700 --> 00:00:33.533
其他的我們就不跟了

00:00:33.600 --> 00:00:38.566
因為我們都知道各家模型商之間的競爭是非常激烈的

00:00:38.600 --> 00:00:40.766
那往往一家發了新模型

00:00:40.800 --> 00:00:43.300
另外一家就會更迭代

00:00:43.366 --> 00:00:46.166
而且我們現在在用的這個 Claude 

00:00:46.200 --> 00:00:49.100
它其實也才剛過一歲生日而已

00:00:49.166 --> 00:00:50.600
我們也無法去預知

00:00:50.633 --> 00:00:50.900
說

00:00:50.966 --> 00:00:54.033
搞不好明年最強的工具就不是這個了

00:00:54.066 --> 00:00:54.300
所以

00:00:54.333 --> 00:00:59.300
我覺得比較成熟的心態應該是搭配使用

00:00:59.333 --> 00:01:04.500
所以今天我想來跟你先講解在我個人的想法裡面

00:01:04.533 --> 00:01:07.733
主流模型的強弱項分別是什麼

00:01:07.766 --> 00:01:11.000
那當然因為主流模型也是蠻多的

00:01:11.066 --> 00:01:11.433
所以

00:01:11.466 --> 00:01:15.200
我會以我自己常常在使用的為主

00:01:15.233 --> 00:01:15.600
接下來

00:01:15.633 --> 00:01:20.200
我們會聊一聊我是怎麼配置讓這些模型可以放在一起協作的

00:01:20.233 --> 00:01:20.900
那我們就開始

00:01:20.966 --> 00:01:22.966
首先第一個當然是 Claude 

00:01:23.000 --> 00:01:26.733
Claude 他們家的模型被我當做是大腦中樞

00:01:26.766 --> 00:01:28.200
有幾個原因

00:01:28.233 --> 00:01:39.233
第一個原因是因為 Claude 模型在寫程式上面以及在長時間複雜任務的處理跟工具呼叫上面做的是最好的

00:01:39.300 --> 00:01:44.466
不會說做一做就斷掉或者是做到卡關就停下來

00:01:44.500 --> 00:01:44.700
所以

00:01:44.733 --> 00:01:47.066
我選擇用 Claude 做我的大腦模型

00:01:47.100 --> 00:01:48.533
也就是我通常都是

00:01:48.566 --> 00:01:50.366
用 Claude 的模型去互動

00:01:50.433 --> 00:01:52.100
讓他去幫我執行任務

00:01:52.133 --> 00:01:55.133
那麼 Claude 模型也有分好幾個等級

00:01:55.166 --> 00:01:58.133
比如說 Opus、Sonnet 跟 Haiku

00:01:58.166 --> 00:01:58.933
我會怎麼去分

00:01:58.966 --> 00:02:02.166
如果是要做一些我不確定的任務

00:02:02.233 --> 00:02:04.100
複雜的架構

00:02:04.133 --> 00:02:07.333
或者是真的比較需要智力邏輯推論的任務

00:02:07.366 --> 00:02:08.766
我就會用 Opus 

00:02:08.833 --> 00:02:10.533
或者是如果當中我的額

00:02:10.566 --> 00:02:11.566
度太多沒有燒完

00:02:11.633 --> 00:02:14.133
我就會給他用 Opus 狂燒

00:02:14.166 --> 00:02:14.866
他最聰明

00:02:14.933 --> 00:02:15.733
但他的額

00:02:15.766 --> 00:02:16.800
度消耗最多

00:02:16.866 --> 00:02:17.800
那如果我當中額

00:02:17.866 --> 00:02:18.733
度比較緊

00:02:18.800 --> 00:02:23.200
或者是我在處理的任務就是一個步驟比較簡單

00:02:23.233 --> 00:02:25.433
不會用到太多智力的任務

00:02:25.466 --> 00:02:27.233
那我就會用 Sonnet

00:02:27.266 --> 00:02:30.566
比如說寫信回信套既有的模板

00:02:30.633 --> 00:02:33.300
那 Sonnet 是最適合我們日常使用的任務

00:02:33.333 --> 00:02:37.466
我自己也沒有感覺到 Sonnet 有什麼太大的阻礙

00:02:37.500 --> 00:02:39.466
那如果還有一些東西

00:02:39.533 --> 00:02:42.800
比如說像是隻是上網查個資料

00:02:42.833 --> 00:02:44.933
那我就會用 Haiku 

00:02:45.000 --> 00:02:46.300
因為這個模型是最省額

00:02:46.366 --> 00:02:46.833
度的

00:02:46.866 --> 00:02:47.166
不過啦

00:02:47.200 --> 00:02:49.033
其實 Haiku 我不常切

00:02:49.100 --> 00:02:51.266
是因為我自己的方案

00:02:51.300 --> 00:02:53.866
目前是 100 美元的方案

00:02:53.900 --> 00:02:56.466
我不用特別去切 Haiku

00:02:56.533 --> 00:02:58.033
我一直用 Sonnet

00:02:58.100 --> 00:02:59.200
也不太會好玩

00:02:59.233 --> 00:03:00.466
以我的工作

00:03:00.500 --> 00:03:02.066
量跟頻率來講

00:03:02.100 --> 00:03:02.433
所以

00:03:02.500 --> 00:03:04.400
我就沒有特別去切 Haiku

00:03:04.433 --> 00:03:06.666
但是如果你今天用的是 20 美元的 Pro 的話

00:03:06.733 --> 00:03:10.766
那可能你的切換就會更精細來達到最好的 CP 值

00:03:10.800 --> 00:03:12.000
所以這個是 Claude

00:03:12.033 --> 00:03:13.966
但是 Claude 也有它的短板

00:03:14.000 --> 00:03:17.700
他雖然最強的是寫程式跟任務的呼叫

00:03:17.733 --> 00:03:23.966
但他的短板就是他無法去吃文字檔案以外的 input 

00:03:24.000 --> 00:03:28.466
比如說你想要讓它去轉錄一段語音成為文字檔

00:03:28.533 --> 00:03:31.833
你想要讓它去聽音樂

00:03:31.900 --> 00:03:34.100
瞭解這個音樂哪裡是過門

00:03:34.133 --> 00:03:37.433
你想讓他去讀影片

00:03:37.500 --> 00:03:39.066
去幫你對影片做摘要

00:03:39.100 --> 00:03:42.533
甚至是抓影片裡面的某一幕的畫面

00:03:42.566 --> 00:03:45.066
那麼 Claude 在做這件事上面是比較困難

00:03:45.100 --> 00:03:46.400
甚至有可能會做不到

00:03:46.466 --> 00:03:51.466
那麼這個時候我們就要來講到第二家被人廣為使用的模型了

00:03:51.533 --> 00:03:53.066
叫做 Gemini

00:03:53.100 --> 00:03:54.733
我想一定不少人都有用過

00:03:54.800 --> 00:03:58.033
只是大部分人用的應該都是網頁版的 Gemini，對不對

00:03:58.066 --> 00:04:00.733
那網頁版的 Gemini 當然量大管飽

00:04:00.800 --> 00:04:02.033
可以很好的去

00:04:02.066 --> 00:04:03.433
滿足我們的需求

00:04:03.466 --> 00:04:06.900
還有就是 Google 官方也用他們的生態系的優勢

00:04:06.966 --> 00:04:09.833
把 Gemini 嵌到了很多 Google 的服務裡面

00:04:09.866 --> 00:04:12.533
所以你可以在很多地方用到它

00:04:12.600 --> 00:04:14.666
那我之前還沒有用 Claude 之前

00:04:14.700 --> 00:04:17.066
我其實也蠻常用 Gemini 

00:04:17.100 --> 00:04:19.866
甚至會讓它去做寫程式

00:04:19.900 --> 00:04:22.300
去呼叫任務

00:04:22.333 --> 00:04:25.633
但是很快的我就發現好像跟 Claude 一比

00:04:25.700 --> 00:04:28.966
Gemini 在呼叫任務跟寫程式上面表現的不太好

00:04:29.033 --> 00:04:29.933
不太穩定

00:04:29.966 --> 00:04:31.866
常常會有幻覺

00:04:31.900 --> 00:04:34.533
或者是今天我要他改 a 

00:04:34.600 --> 00:04:35.566
A 是壞的

00:04:35.600 --> 00:04:38.966
他改了 a 的同時也把 b 改壞了

00:04:39.000 --> 00:04:40.733
我再叫他把 a 跟 b 一起修好

00:04:40.800 --> 00:04:43.800
結果他修好了之後又把 c 改掉了

00:04:43.833 --> 00:04:48.200
那所以這就是為什麼 Gemini 後來被慢慢被我不用的原因

00:04:48.266 --> 00:04:51.900
甚至我有一段時間是嫌棄 Gemini 的

00:04:51.933 --> 00:04:54.166
但是我現在要跟你分享

00:04:54.233 --> 00:04:57.466
你聽到有人在嫌棄某家模型的時候

00:04:57.500 --> 00:05:01.300
其實代表是他們看到的 use case 不夠多

00:05:01.333 --> 00:05:05.733
因為當我後來慢慢地接觸到不同的 use case 使用情境

00:05:05.800 --> 00:05:09.100
AI 對我生活的滲透率越來越高

00:05:09.133 --> 00:05:11.033
以及我的學員們

00:05:11.100 --> 00:05:13.233
他們有各種不同的需求的時候

00:05:13.266 --> 00:05:16.466
我慢慢又發現了 Gemini 的好處

00:05:16.500 --> 00:05:17.900
所以我又寫了一篇文章

00:05:17.966 --> 00:05:20.433
那在這邊跟大家也官宣

00:05:20.466 --> 00:05:23.533
工商一下我自己的部落格

00:05:23.566 --> 00:05:25.966
我會把 blog 放在下面的說明欄

00:05:26.033 --> 00:05:30.166
在這個裡面我會每週更新大量的文章

00:05:30.200 --> 00:05:32.266
分享我對 AI 的感悟

00:05:32.333 --> 00:05:33.166
好

00:05:33.233 --> 00:05:35.066
那這邊我有寫了 Gemini 

00:05:35.133 --> 00:05:37.133
我曾經也貶低過他

00:05:37.166 --> 00:05:41.166
但是後來我發現他有 4 個其他家目前打不過的 use case

00:05:41.200 --> 00:05:42.933
第一個

00:05:42.966 --> 00:05:47.233
它在處理長文本以及大量資料的清洗的時候

00:05:47.300 --> 00:05:48.733
它是價效比之王

00:05:48.766 --> 00:05:49.266
長文本

00:05:49.333 --> 00:05:51.533
比如說幾十萬字去做摘要

00:05:51.566 --> 00:05:53.200
它的 API 是最便宜的

00:05:53.233 --> 00:05:54.733
相較於其他家的

00:05:54.766 --> 00:05:56.066
三家的模型

00:05:56.133 --> 00:05:58.500
這種或者是資料清洗

00:05:58.533 --> 00:06:00.433
比如說改錯字

00:06:00.500 --> 00:06:02.133
比如說幫每一個

00:06:02.166 --> 00:06:04.800
貼文去標上情緒的標籤

00:06:04.866 --> 00:06:06.300
是負面還是中性

00:06:06.333 --> 00:06:11.166
把每一則新聞的短訊標上這個新聞跟什麼關鍵字有關係

00:06:11.233 --> 00:06:12.400
這種上標籤

00:06:12.433 --> 00:06:14.600
資料清洗跟標記

00:06:14.633 --> 00:06:16.433
它是價效比最高的

00:06:16.466 --> 00:06:19.266
那當然價效比更高的也是有

00:06:19.300 --> 00:06:21.833
來自中國的模型

00:06:21.900 --> 00:06:22.700
不過這些模型

00:06:22.733 --> 00:06:24.200
如果你用他們的端點

00:06:24.266 --> 00:06:26.733
很多時候那個 Server 就在中國

00:06:26.800 --> 00:06:32.400
所以如果你對一些個人資料安全隱私有疑慮的時候

00:06:32.433 --> 00:06:34.933
那當然就不會是一個好選擇

00:06:35.000 --> 00:06:37.533
那 Google 算是一個相對比較好的選擇

00:06:37.566 --> 00:06:41.400
當然最好的選擇肯定是開源模型在自己內部自架

00:06:41.466 --> 00:06:41.733
對不對

00:06:41.766 --> 00:06:44.166
不過自架這個也需要有硬體的限制

00:06:44.233 --> 00:06:45.700
不是所有人都辦得到的

00:06:45.733 --> 00:06:47.100
所以權衡之下

00:06:47.133 --> 00:06:48.500
安全與方便

00:06:48.533 --> 00:06:49.666
與效能的平衡

00:06:49.733 --> 00:06:54.500
我覺得 Gemini Flash Lite 是大量資料清洗的價效比之王

00:06:54.533 --> 00:07:00.600
再來第二個就是它原生支援輸入聲音跟影片

00:07:00.633 --> 00:07:05.233
那我目前試到的是它可以去處理有多個講者在同一個語音裡面

00:07:05.300 --> 00:07:07.266
它可以分得清楚誰是誰

00:07:07.300 --> 00:07:08.133
它聽得懂

00:07:08.166 --> 00:07:10.200
他可以去辨識語氣

00:07:10.233 --> 00:07:12.466
他也可以去聽懂音樂旋律

00:07:12.533 --> 00:07:14.933
因為我有去玩一些音樂的專案

00:07:14.966 --> 00:07:18.066
那我需要去收集音樂素材來編歌

00:07:18.133 --> 00:07:20.200
那我就需要知道每個音樂的

00:07:20.233 --> 00:07:20.966
頻率是什麼

00:07:21.033 --> 00:07:22.933
過門是什麼

00:07:23.000 --> 00:07:25.433
那這個 Claude 跟 GPT 做的都不是很好

00:07:25.466 --> 00:07:26.566
甚至 Claude 是不能做的

00:07:26.633 --> 00:07:29.366
因為它不能去讀聲音

00:07:29.400 --> 00:07:30.900
但是 geminate 可以做到

00:07:30.933 --> 00:07:32.300
而且做的非常的準

00:07:32.333 --> 00:07:34.333
還有就是最近的新版好

00:07:34.400 --> 00:07:34.600
當然

00:07:34.633 --> 00:07:36.266
在我這個影片錄的當下

00:07:36.300 --> 00:07:38.333
Gemini 3.5 Flash

00:07:38.400 --> 00:07:44.166
它處理語音轉摘要、轉逐字稿的速度超級快

00:07:44.233 --> 00:07:44.800
比如說

00:07:44.833 --> 00:07:47.433
一段 30 分鐘的語音

00:07:47.466 --> 00:07:50.733
它大概 30 秒就開始啪啪啪啪啪產出字稿

00:07:50.800 --> 00:07:53.666
然後 3 分鐘之內馬上轉錄成文字

00:07:53.733 --> 00:07:54.400
非常的準

00:07:54.433 --> 00:07:55.200
不會漏掉

00:07:55.266 --> 00:07:59.033
你想以前我們用 Whisper 的模型都還要花時間

00:07:59.100 --> 00:08:00.933
還要試你電腦的效能

00:08:00.966 --> 00:08:03.833
但是 Gemini 它可以做的又快又好

00:08:03.900 --> 00:08:04.433
還有

00:08:04.466 --> 00:08:05.333
有個學員

00:08:05.400 --> 00:08:08.566
他的需求是他家裡有大量家族出遊的影片

00:08:08.633 --> 00:08:10.966
這個在我另外一部影片有講到要把所有

00:08:11.000 --> 00:08:12.466
有家人的片段撈出來

00:08:12.533 --> 00:08:14.533
捨棄純風景跟路人的部分

00:08:14.566 --> 00:08:16.866
就他小時候家裡拍的影片

00:08:16.933 --> 00:08:19.000
出去玩拍的 VCR V8 

00:08:19.033 --> 00:08:19.500
那 Claude

00:08:19.533 --> 00:08:21.400
因為它無法直接讀取影片

00:08:21.466 --> 00:08:23.233
它只能去用工具去影片裡面

00:08:23.266 --> 00:08:25.500
可能每 5 秒每 10 秒去截一張圖

00:08:25.533 --> 00:08:26.600
去辨識

00:08:26.666 --> 00:08:28.466
那這個就很耗 token

00:08:28.500 --> 00:08:29.900
又累又不是一步到位

00:08:29.933 --> 00:08:30.766
對不對

00:08:30.800 --> 00:08:31.366
但是 Gemini 

00:08:31.400 --> 00:08:32.800
你只要把影片送進去

00:08:32.866 --> 00:08:34.766
它可以直接讀懂影片的內容

00:08:34.800 --> 00:08:37.000
告訴你幾分幾秒是家人

00:08:37.066 --> 00:08:38.533
幾分幾秒有可能是路人

00:08:38.600 --> 00:08:39.633
幾分幾秒沒有人

00:08:39.666 --> 00:08:41.266
只是風景

00:08:41.300 --> 00:08:42.966
那這些幾分幾秒回傳之後

00:08:43.033 --> 00:08:45.633
我們就可以用工具來做快速的剪輯

00:08:45.666 --> 00:08:47.866
這一點是 Claude 本身辦不到的

00:08:47.900 --> 00:08:52.300
還有就是他對影像的辨識也非常的準確

00:08:52.366 --> 00:08:57.466
有個學員他的需求是要把掃描的書籍數位化

00:08:57.500 --> 00:08:57.866
但是

00:08:57.933 --> 00:09:00.200
Claude 好像只能處理拉丁字母

00:09:00.233 --> 00:09:02.600
那中文書就不太行了

00:09:02.633 --> 00:09:04.066
辨識常常會錯誤

00:09:04.133 --> 00:09:06.366
還需要事後的去猜測跟修正

00:09:06.400 --> 00:09:08.900
還有如果圖裡面有

00:09:08.933 --> 00:09:09.433
複圖

00:09:09.466 --> 00:09:12.566
那 Claude 對複圖的辨識也不太好

00:09:12.633 --> 00:09:14.866
但是 Gemini 可以完全準確地辨識

00:09:14.900 --> 00:09:18.966
而且還可以去回傳這張圖裡面小圖的座標在什麼地方

00:09:19.033 --> 00:09:20.200
那這個座標傳回來之後

00:09:20.233 --> 00:09:25.033
我們可以再另外用程式把那個圖從另外一張圖裡面摳出來

00:09:25.066 --> 00:09:26.566
這個是非常的實用的

00:09:26.600 --> 00:09:31.066
甚至 Gemini 可以拿來去讀一些我們產出檔案的排版

00:09:31.133 --> 00:09:34.733
然後可以準確地辨認出來哪些地方排版怪怪的

00:09:34.766 --> 00:09:36.566
有邊界超出的

00:09:36.600 --> 00:09:38.066
溢位的問題

00:09:38.133 --> 00:09:39.700
有孤行的問題

00:09:39.733 --> 00:09:42.100
有文字疊合的問題

00:09:42.133 --> 00:09:44.266
準確地回傳需要修整的地方

00:09:44.300 --> 00:09:45.233
簡單來說

00:09:45.300 --> 00:09:48.433
Gemini 就是御三家裡面的價效比之王

00:09:48.466 --> 00:09:50.166
它也是多模態之王

00:09:50.200 --> 00:09:51.133
它跟 Claude 相比

00:09:51.200 --> 00:09:55.666
雖然處理任務連續工具呼叫的能力沒那麼好

00:09:55.700 --> 00:09:57.366
但是它有它自己的擅長

00:09:57.433 --> 00:09:59.366
那 open AI 的 GPT 呢

00:09:59.400 --> 00:10:04.133
OpenAI 的 GPT 如果用在像是 Agentic AI 的工具裡面

00:10:04.166 --> 00:10:06.433
他們家原生的工具叫做 Codex 

00:10:06.500 --> 00:10:09.000
那麼 Codex 我可以開啟來給大家看一下

00:10:09.033 --> 00:10:11.266
它長得就像是這樣子一樣

00:10:11.300 --> 00:10:13.166
有沒有很像 Claude Code

00:10:13.233 --> 00:10:14.300
對不對

00:10:14.366 --> 00:10:14.466
好

00:10:14.500 --> 00:10:16.333
其實 Gemini 他們家也有類似的

00:10:16.400 --> 00:10:19.133
都是 Agentic AI 的工具

00:10:19.200 --> 00:10:23.033
在終端機裡面就是它本身後面接的是 GPT 的模型

00:10:23.066 --> 00:10:25.633
那麼 Codex 它的好處是這樣子的

00:10:25.666 --> 00:10:27.700
我個人覺得

00:10:27.733 --> 00:10:29.800
第一個目前來說

00:10:29.866 --> 00:10:33.233
花同樣的錢買同樣的訂閱方案

00:10:33.300 --> 00:10:33.966
他們家的額

00:10:34.033 --> 00:10:35.900
度給的比 Claude 大方

00:10:35.933 --> 00:10:36.133
當然

00:10:36.166 --> 00:10:37.266
這個是屬於政策面

00:10:37.333 --> 00:10:40.266
所以也許你過了兩年回來看我這部影片

00:10:40.300 --> 00:10:42.500
或許 OpenAI 變得更摳了

00:10:42.566 --> 00:10:43.666
Anthropic 變得更大方

00:10:43.733 --> 00:10:44.533
也不一定

00:10:44.566 --> 00:10:45.966
但目前為止

00:10:46.000 --> 00:10:47.766
OpenAI 他們給的比較大方

00:10:47.833 --> 00:10:51.600
可以用的比較久來長任務的處理方面

00:10:51.633 --> 00:10:56.733
我認為 GPT-5.5 現在跟 Claude Opus 是不相上下

00:10:56.766 --> 00:10:59.033
我都可以信任他們去幫我做場任務

00:10:59.100 --> 00:10:59.933
不會斷掉

00:10:59.966 --> 00:11:00.466
那所以

00:11:00.500 --> 00:11:05.100
我目前用 Codex 主要的原因是因為我要把它當備用大腦

00:11:05.133 --> 00:11:05.633
什麼意思

00:11:05.666 --> 00:11:08.033
如果我的 Claude 它額

00:11:08.100 --> 00:11:09.000
度被我用爆了

00:11:09.066 --> 00:11:10.766
但我那個禮拜還是要工作

00:11:10.833 --> 00:11:12.833
或者是我的 Claude shut down 了

00:11:12.866 --> 00:11:14.966
他們伺服器常常不穩定

00:11:15.033 --> 00:11:17.300
那我就會馬上轉來 GPT 

00:11:17.333 --> 00:11:20.266
轉來 Codex 繼續做我的工作

00:11:20.333 --> 00:11:21.366
不會整個停擺

00:11:21.400 --> 00:11:26.133
或者是如果我的 Claude 它有一些問題解不掉

00:11:26.200 --> 00:11:28.600
那我會讓 GPT 過來救援

00:11:28.633 --> 00:11:28.700
嘿

00:11:28.733 --> 00:11:29.500
這個很神奇

00:11:29.566 --> 00:11:30.933
有些問題 Claude 解不掉的

00:11:31.000 --> 00:11:32.633
GPT 反而就可以解掉

00:11:32.666 --> 00:11:34.433
或者是拿來當評審

00:11:34.466 --> 00:11:36.700
用不同模型的角度去做審查

00:11:36.733 --> 00:11:38.633
避免球員兼裁判的問題

00:11:38.700 --> 00:11:39.466
還有

00:11:39.500 --> 00:11:42.366
他們家有一個非常重要的特色

00:11:42.433 --> 00:11:44.100
就是目前為止

00:11:44.133 --> 00:11:45.600
我們 2026年中

00:11:45.666 --> 00:11:49.700
GPT 的 Image 2 模型是生圖最強的模型

00:11:49.766 --> 00:11:52.133
這個其他家都打不過

00:11:52.166 --> 00:11:52.866
Claude 就不用講了

00:11:52.900 --> 00:11:55.600
他們根本沒有生圖的模型

00:11:55.666 --> 00:11:56.966
Gemini 的 Nano Banana 

00:11:57.033 --> 00:11:58.266
目前跟它有一段

00:11:58.300 --> 00:11:59.366
不小的差距

00:11:59.400 --> 00:12:04.433
目前的 GPT Image 2 的生圖是斷崖式的領先

00:12:04.500 --> 00:12:04.900
所以

00:12:04.933 --> 00:12:06.333
我需要生圖的時候

00:12:06.400 --> 00:12:07.966
我就會使用 GPT

00:12:08.000 --> 00:12:08.833
那你說 Dustin 

00:12:08.900 --> 00:12:12.866
那這樣聽起來好像你用 Codex 當主力也可以

00:12:12.900 --> 00:12:14.933
為什麼你不用 Codex 當主力

00:12:15.000 --> 00:12:16.133
你把 GPT 當備用

00:12:16.166 --> 00:12:18.300
原因就是比較個人的

00:12:18.366 --> 00:12:21.300
因為第一個我先用慣了 Claude Code 

00:12:21.333 --> 00:12:27.966
第二個則是因為我的 Harness 就是我的規則和環境這些東西都在 Claude Code 這個地方

00:12:28.000 --> 00:12:28.333
所以

00:12:28.366 --> 00:12:31.000
在這邊工作起來同樣厲害的模型

00:12:31.066 --> 00:12:32.300
有一個好的環境

00:12:32.333 --> 00:12:33.800
跑起來是最順的

00:12:33.866 --> 00:12:36.400
像是 CLAUDE.md

00:12:36.466 --> 00:12:37.933
像是 rules 

00:12:37.966 --> 00:12:38.833
像是 hooks

00:12:38.900 --> 00:12:40.866
那我另外一部影片有在講

00:12:40.933 --> 00:12:43.033
如果你想要兩邊都跑得很順

00:12:43.066 --> 00:12:44.300
可以怎麼同步

00:12:44.366 --> 00:12:45.700
你可以參考那部影片

00:12:45.733 --> 00:12:48.300
所以我們剛剛講了這些家的優劣勢之後

00:12:48.366 --> 00:12:49.133
對不對

00:12:49.166 --> 00:12:50.033
你可能會想說

00:12:50.066 --> 00:12:52.300
那 Dustin，那我自己該怎麼搭配

00:12:52.366 --> 00:12:54.700
那當然我都會先建議各位都試看看

00:12:54.733 --> 00:13:00.333
來想看看哪一個適合你的主力溝通的模型要當你的秘書長

00:13:00.366 --> 00:13:02.433
那誰適合做什麼任務

00:13:02.466 --> 00:13:03.533
你都試過一次之後

00:13:03.566 --> 00:13:05.700
慢慢會感覺在你的角度

00:13:05.766 --> 00:13:08.233
你覺得哪些模型適合做什麼事情

00:13:08.266 --> 00:13:11.133
而且這個就算是同一個人也會改變的

00:13:11.200 --> 00:13:14.666
因為你的任務有可能會隨著你的生涯而不同

00:13:14.700 --> 00:13:19.200
有可能會隨著你讓 AI 跟你協作的滲透率的不同

00:13:19.233 --> 00:13:24.200
還有就是這些家模型未來各家的發展也可能不一樣

00:13:24.233 --> 00:13:26.133
所以你要不斷的去嘗試

00:13:26.200 --> 00:13:27.066
精進研究

00:13:27.133 --> 00:13:28.266
這是你的心態

00:13:28.300 --> 00:13:31.000
最後我想要跟你來分享

00:13:31.033 --> 00:13:33.733
那你要怎麼樣讓它們結合在一起

00:13:33.800 --> 00:13:40.900
也就是你要怎麼樣讓你的這個主力模型能夠去順利地呼叫別家的模型去幫你做事

00:13:40.966 --> 00:13:44.133
這樣你就不用再一直切去對不對

00:13:44.166 --> 00:13:45.833
好

00:13:45.866 --> 00:13:47.733
我們來分享兩個東西

00:13:47.800 --> 00:13:54.666
第一個就是你還記得我們之前的影片有講到一個東西叫做 agent 嗎

00:13:54.700 --> 00:13:56.033
還有一個東西叫 skill 

00:13:56.100 --> 00:13:58.200
Skill 就是一個技能

00:13:58.266 --> 00:14:00.433
agent 就是一個代理人

00:14:00.466 --> 00:14:06.533
這些 skill 跟 agent 我們都可以去指定讓模型做什麼樣的任務

00:14:06.566 --> 00:14:10.766
那如果你想要讓你的 Claude 去呼叫 Codex 幫你做事

00:14:10.800 --> 00:14:13.733
你不用自己親自切到 Codex 

00:14:13.800 --> 00:14:15.466
這個官方已經幫你搞好了

00:14:15.533 --> 00:14:16.766
我也覺得很神奇

00:14:16.800 --> 00:14:19.566
你可以去到這個地方 OpenAI

00:14:19.600 --> 00:14:21.633
他們自己的 GitHub 賬號

00:14:21.700 --> 00:14:25.400
他們有一個專案叫做 Codex Plugin 

00:14:25.433 --> 00:14:27.266
把這個網址丟給 Claude Code

00:14:27.333 --> 00:14:29.400
把它安裝進去

00:14:29.433 --> 00:14:30.400
安裝進去之後

00:14:30.466 --> 00:14:32.766
你打斜線 Codex 

00:14:32.833 --> 00:14:40.233
你就會發現這邊有一連串的指令可以讓你用它可以讓你使用 Codex 去做各種各樣的任務

00:14:40.266 --> 00:14:44.900
比如說這個指令就是可以讓模型邀請 Codex 的模型

00:14:44.933 --> 00:14:50.966
就是 GPT 的模型進來審查你目前的程式碼或者是內容

00:14:51.033 --> 00:14:55.900
比如說這個就是當你今天在 Claude Code 卡關的時候

00:14:55.933 --> 00:14:58.600
你可以邀請 Codex 進來救場

00:14:58.666 --> 00:14:59.866
我也覺得很好笑

00:14:59.900 --> 00:15:03.433
比如說這個就是對抗式審查

00:15:03.500 --> 00:15:06.366
你可以邀請進來毒舌審查

00:15:06.400 --> 00:15:08.600
那我自己也根據了這些 prompt

00:15:08.633 --> 00:15:12.133
我請 Claude 幫我創造了一個叫 Codex image 

00:15:12.200 --> 00:15:16.900
這個指令的用途就是邀請 Codex 進來幫我做圖片

00:15:16.933 --> 00:15:19.100
這樣我就不用再去切到 Codex 去用了

00:15:19.133 --> 00:15:19.866
對不對

00:15:19.933 --> 00:15:20.700
好

00:15:20.733 --> 00:15:22.500
那實際上做法像什麼樣子

00:15:22.533 --> 00:15:23.000
比如說

00:15:23.033 --> 00:15:24.000
舉個例子

00:15:24.033 --> 00:15:24.400
現在

00:15:24.466 --> 00:15:27.500
我先上網抓了一些在 Reddit 

00:15:27.533 --> 00:15:32.900
就是國外論壇上面 24 小時之內討論 AI 的熱點的內容

00:15:32.966 --> 00:15:33.200
好

00:15:33.233 --> 00:15:34.200
我自己看完之後

00:15:34.233 --> 00:15:36.466
我覺得這個挺好的

00:15:36.500 --> 00:15:39.633
我想要分享到 i g 上面給大家看

00:15:39.700 --> 00:15:41.900
而且我要用圖卡的方式

00:15:41.933 --> 00:15:42.366
那你想

00:15:42.433 --> 00:15:44.733
Claude 可以直接去做圖嗎

00:15:44.766 --> 00:15:49.500
它好像只能去做類似像 HTML 網頁風格的圖片，對不對

00:15:49.533 --> 00:15:52.833
但是能不能夠像 GPT 的生圖模型一樣

00:15:52.866 --> 00:15:56.300
可以幫我生出非常客製化又非常精美的圖卡

00:15:56.366 --> 00:15:56.900
不行

00:15:56.933 --> 00:16:00.566
所以我想要讓 GPT 也就是 Codex 幫我做圖

00:16:00.600 --> 00:16:04.566
我就直接用我所設計的指令 Codex image 

00:16:04.600 --> 00:16:10.800
後面寫用日式簡約風格為以上摘要產出 Instagram 分享圖卡

00:16:10.833 --> 00:16:11.700
好

00:16:11.766 --> 00:16:16.533
這個時候你可以看到這個模型本身就直接去呼叫了 Codex 

00:16:16.566 --> 00:16:18.766
用 Codex 的工具

00:16:18.800 --> 00:16:19.366
好這個工具

00:16:19.400 --> 00:16:21.300
當然我會事先登入

00:16:21.366 --> 00:16:23.233
所以它吃的是我的訂閱制的額

00:16:23.266 --> 00:16:23.700
度

00:16:23.766 --> 00:16:24.966
送進指令

00:16:25.000 --> 00:16:27.966
你看這裡面就有 Codex 怎麼回應的

00:16:28.000 --> 00:16:28.066
嗯

00:16:28.100 --> 00:16:30.200
接下來過了一系列之後

00:16:30.266 --> 00:16:31.233
這邊都是 Claude

00:16:31.266 --> 00:16:34.433
他跟我講目前 Codex 的進度是什麼

00:16:34.500 --> 00:16:37.000
最後完成了我要的圖片

00:16:37.066 --> 00:16:39.766
幫我放在指定的位置

00:16:39.833 --> 00:16:41.500
像是這個樣子

00:16:41.533 --> 00:16:41.633
這樣

00:16:41.666 --> 00:16:42.400
我自己覺得

00:16:42.466 --> 00:16:44.000
這個不像是日式簡約

00:16:44.033 --> 00:16:45.100
但這只是一個示範

00:16:45.166 --> 00:16:47.800
所以等一下我應該會再請他改一下

00:16:47.833 --> 00:16:48.966
這哪來日式

00:16:49.033 --> 00:16:49.800
好

00:16:49.833 --> 00:16:50.600
那再來

00:16:50.633 --> 00:16:53.233
剛剛我們這樣講是用 Plug in 的形式

00:16:53.300 --> 00:16:54.766
Codex 官方有 Plugin

00:16:54.800 --> 00:16:55.333
對不對

00:16:55.400 --> 00:16:57.133
那 Gemini 有沒有類似的

00:16:57.166 --> 00:16:57.766
也有

00:16:57.800 --> 00:17:00.466
你也可以請 Claude 上去

00:17:00.533 --> 00:17:07.133
去幫你找有沒有可以讓你在 Claude Code 裡面去呼叫 Gemini 的 plugin

00:17:07.166 --> 00:17:09.266
不過我自己是用另外一種形式

00:17:09.300 --> 00:17:11.800
我是直接把 Gemini 做成一個 agent 

00:17:11.866 --> 00:17:13.233
什麼意思

00:17:13.300 --> 00:17:16.000
我們在之前的影片裡面講過

00:17:16.066 --> 00:17:18.933
agent 就是一個常態的角色

00:17:18.966 --> 00:17:22.066
所以我有做了一個 agent 在這個地方

00:17:22.133 --> 00:17:23.666
因為這個任務很常見

00:17:23.700 --> 00:17:31.933
我就說這個 agent 它本身的功能就是用我的 Gemini 的 API 去做到語音轉文字

00:17:31.966 --> 00:17:35.933
做的形式、怎麼去傳檔案

00:17:36.000 --> 00:17:37.300
檔案大了怎麼辦

00:17:37.333 --> 00:17:41.166
Default 用什麼模型都在這個 agent 檔裡面規範好

00:17:41.200 --> 00:17:42.133
那麼你可以看到

00:17:42.200 --> 00:17:44.366
當我今天把 Email 送進去

00:17:44.400 --> 00:17:47.866
我說用 Gemini 轉錄成逐字稿的時候

00:17:47.933 --> 00:17:53.800
它就會直接派出這個 agent 去呼叫 Gemini 過來幫我處理

00:17:53.866 --> 00:17:54.733
處理完之後

00:17:54.766 --> 00:17:57.800
最後幫我放入一個檔案

00:17:57.833 --> 00:18:00.433
我們來看檔案像這個樣子

00:18:00.500 --> 00:18:01.866
完美完成了任務

00:18:01.900 --> 00:18:02.300
那當然

00:18:02.333 --> 00:18:06.200
我的 agent 裡面我也有單獨做了一個 Gemini 的 agent 

00:18:06.233 --> 00:18:09.200
這個就不是專門為語音辨識而做了

00:18:09.233 --> 00:18:10.733
這個 agent 比較通用

00:18:10.766 --> 00:18:15.933
它可以直接呼叫你電腦裡面安裝的 Gemini CLI 工具

00:18:15.966 --> 00:18:21.266
然後呢根據你的各種不同任務去分配不同智力等級的模型

00:18:21.333 --> 00:18:22.666
然後把結果回傳

00:18:22.700 --> 00:18:24.366
比如說

00:18:24.433 --> 00:18:26.633
我有一段 200 多頁的 PDF 

00:18:26.666 --> 00:18:28.533
我不想讓 Claude 幫我直接去讀

00:18:28.566 --> 00:18:30.966
因為 Claude 比較貴

00:18:31.033 --> 00:18:34.100
那長文本的價效比之王是 Gemini

00:18:34.133 --> 00:18:37.033
我希望 Gemini 讀完之後給我摘要

00:18:37.100 --> 00:18:39.433
我就會告訴我的 Claude 說

00:18:39.466 --> 00:18:42.533
請你用 Gemini agent 幫我去讀這個東西

00:18:42.600 --> 00:18:43.466
給我摘要

00:18:43.500 --> 00:18:44.666
那麼這種時候

00:18:44.733 --> 00:18:46.166
他就會先辨認

00:18:46.200 --> 00:18:46.500
OK 

00:18:46.566 --> 00:18:49.400
這個任務應該就只是單純的摘要

00:18:49.433 --> 00:18:49.666
所以

00:18:49.700 --> 00:18:52.033
就不用用到那麼貴的 Pro 的模型

00:18:52.066 --> 00:18:53.466
就用 Flash 的模型

00:18:53.533 --> 00:18:56.200
幫我把這本書送去給 Gemini

00:18:56.233 --> 00:18:57.333
做完摘要之後

00:18:57.400 --> 00:19:01.133
那個 agent 把結果回傳給 Claude，再幫我做整合

00:19:01.200 --> 00:19:01.500
所以

00:19:01.533 --> 00:19:04.233
我主要的對話都不離開 Claude

00:19:04.266 --> 00:19:04.533
Claude

00:19:04.600 --> 00:19:07.066
我讓我的需求跟 Claude 講

00:19:07.100 --> 00:19:11.866
然後給他能夠 call out to 其他模型的管道

00:19:11.900 --> 00:19:14.533
比如說幫他裝好 Codex 的工具

00:19:14.600 --> 00:19:15.700
幫他裝好 Plug in 

00:19:15.733 --> 00:19:17.833
幫他裝好 Gemini 的工具

00:19:17.900 --> 00:19:19.800
幫他設計好 Gemini agent 

00:19:19.833 --> 00:19:25.500
他就會自動的幫我把任務分配給最適合的模型

00:19:25.533 --> 00:19:27.100
模型把任務完成之後

00:19:27.133 --> 00:19:31.600
他再去撈完成後的結果去做接下來的事情

00:19:31.666 --> 00:19:36.833
這個就是我認為你應該可以學習的多模型協作的方式

00:19:36.866 --> 00:19:37.166
所以

00:19:37.200 --> 00:19:40.266
當下次有人跟你吵說哪一家模型好

00:19:40.333 --> 00:19:42.033
哪一家模型不好的時候

00:19:42.066 --> 00:19:45.566
你就應該回他一句小孩子才做選擇

00:19:45.633 --> 00:19:48.066
我全都要

00:19:48.100 --> 00:19:48.800
我是 Dustin 

00:19:48.866 --> 00:19:49.766
我們下次見

00:19:49.833 --> 00:19:50.433
拜拜

