實際影片長度:13:17.000。原文、繁中、雙語可點擊句子跳轉影片。
0:02.966–0:04.566
嗨,大家好
0:04.566–0:07.933
平常如果我們想要用 AI 來生成圖片或影片
0:07.933–0:11.600
最常見的方式就是訂閱各種線上的 AI 平臺
0:11.600–0:15.866
不過這些服務每個月可能都要固定支付 10 至 15 美元以上
0:15.866–0:18.233
部分進階的方案甚至更貴
0:18.233–0:19.766
這對於只是偶爾使用
0:19.766–0:22.400
或是單純想要體驗 AI 創作的使用者來說
0:22.400–0:24.300
是一個不小的負擔
0:24.300–0:28.066
因此今天我要向大家介紹一個更具彈性的方式
0:28.066–0:29.866
就是在自己的 AI 助理
0:29.866–0:33.933
像是 ChatGPT 或 Claude 安裝一個 Skill (技能)
0:33.933–0:37.500
讓 AI 助理能以非常低廉的成本來生成圖片和影片
0:37.500–0:40.266
不需要繫結任何的訂閱方案
0:40.266–0:44.833
好,那這邊我們首先要下載 Claude 或 ChatGPT 的桌面版軟體
0:44.833–0:48.100
因為後續我們需要讓 AI 助理讀取參考圖片
0:48.100–0:51.466
並且將生成好的檔案儲存到指定的位置
0:51.466–0:53.733
而如果你習慣使用 ChatGPT
0:53.733–0:57.633
你也可以在它的官網首頁來下載它的桌面版軟體
0:57.633–0:59.533
好,那我以 Claude 為例
0:59.533–1:01.333
下載並安裝完成後
1:01.333–1:04.133
你可以直接把桌面版的軟體開啟
1:04.133–1:05.833
而這邊我們需要在電腦中
1:05.833–1:08.200
先建立一個專案資料夾
1:08.200–1:10.233
你可以隨意找一個位置
1:10.233–1:12.733
利用滑鼠右鍵執行「新增」
1:12.733–1:15.600
並取一個自己容易記住的名字
1:15.600–1:16.600
建立好後
1:16.600–1:20.033
我們對著資料夾雙擊滑鼠左鍵來將它開啟
1:20.033–1:21.566
並且重複剛才的步驟
1:21.566–1:23.500
另外建立兩個資料夾
1:23.500–1:25.800
分別是「完成檔」和「參考圖」
1:25.800–1:28.100
之後我們會使用到
1:28.100–1:29.666
資料夾準備好之後
1:29.666–1:31.866
你就可以回到桌面版的軟體
1:31.866–1:34.166
來將目前的專案指定到剛建立的資料夾
1:34.166–1:36.966
點選「開啟」
1:36.966–1:39.566
再按下「信任此工作區」
1:39.566–1:41.666
而如果你使用的是 ChatGPT
1:41.666–1:43.566
方式也大同小異
1:43.566–1:45.233
你只要把來源資料夾
1:45.233–1:48.166
同樣指定到剛才的位置就 OK 了
1:48.166–1:51.733
好,那接下來我們要來到一個叫做 FAL 的平臺
1:51.733–1:54.466
它的優點是提供的 AI 模型非常地多
1:54.466–1:56.966
且計費方式非常地透明
1:56.966–2:00.533
你可以用自己的 Gmail 信箱先註冊一個帳號
2:00.533–2:01.433
登入之後
2:01.433–2:04.666
我們要取得一個叫做 API Key 的金鑰
2:04.666–2:08.700
系統會使用這把金鑰來辨識你是哪一位使用者
2:08.700–2:11.066
好,所以我們到右上角點選「新增金鑰」
2:11.066–2:13.766
點選「建立」
2:13.766–2:16.966
然後你就可以把螢幕上顯示的金鑰密碼複製下來
2:16.966–2:19.533
妥善儲存在自己的電腦
2:19.533–2:22.133
那 FAL 不需要你支付固定的月費
2:22.133–2:25.700
而是按照你實際生成的圖片數量來計算費用
2:25.700–2:28.766
因此我們必須先繫結一張信用卡
2:28.766–2:29.833
繫結完成後
2:29.833–2:32.333
切換到 Credits 的頁面
2:32.333–2:34.833
那一開始其實不需要儲值太多
2:34.833–2:36.633
你可以等熟悉操作之後
2:36.633–2:39.400
再視自己的需求來增加額度
2:39.400–2:42.200
而要檢視 FAL 有提供哪些 AI 模型
2:42.200–2:44.633
你可以到左上角點選「探索」(Explore)
2:44.633–2:48.433
如此你就能在頁面左側看到所有的模型分類
2:48.433–2:52.833
例如 Text to Image 就是所謂的「由文字生成圖片」
2:52.833–2:54.866
那目前「文生圖」的 AI 模型
2:54.866–2:56.633
其中最受歡迎的一個
2:56.633–2:59.400
是由 Google 推出的 Nano Banana 2
2:59.400–3:02.500
那這個頁面有提供了一個簡單的範例
3:02.500–3:06.100
左側的 Prompt 欄位是這張圖使用的提示詞
3:06.100–3:09.233
然後下面有一個寬高比的下拉選單
3:09.233–3:11.733
再下來是影像的解析度
3:11.733–3:14.466
而在旁邊有一個進階設定的按鈕
3:14.466–3:17.633
你可以在這個區塊指定生成圖片的數量
3:17.633–3:20.800
以及圖檔要採用哪一種儲存格式
3:20.800–3:23.600
最後在右欄有一項很重要的資訊
3:23.600–3:25.966
就是在使用 Nano Banana 2 的時候
3:25.966–3:27.966
費用是如何計算的
3:27.966–3:30.166
你可以把這些資訊做個複製
3:30.166–3:32.733
來跟其它 AI 模型做個比較
3:32.733–3:36.833
譬如目前另一個很熱門的 AI 模型是 GPT Image 2
3:36.833–3:38.666
你可以進入它的頁面之後
3:38.666–3:40.600
同樣找到它的計價方式
3:40.600–3:42.500
把它複製下來
3:42.500–3:46.300
然後我們就可以在 ChatGPT 把兩個模型的價目表貼上去
3:46.300–3:47.966
請它來做個分析
3:47.966–3:50.133
看看哪個比較划算
3:50.133–3:51.766
好,那分析的結果
3:51.766–3:56.133
ChatGPT 認為使用 Nano Banana 2 來生成圖片會比較省錢
3:56.133–3:59.066
所以我打算把它當成主力的模型
3:59.066–4:01.366
接著再回到 FAL 的官網
4:01.366–4:04.500
將 Nano Banana 2 的模型 ID 做個複製
4:04.500–4:06.666
那這邊有個要注意的地方
4:06.666–4:08.266
就是 FAL 提醒我們
4:08.266–4:10.566
一個模型可能會使用不同的介面 (Endpoints)
4:10.566–4:12.166
來執行不同的任務
4:12.166–4:13.766
以 Nano Banana 來說
4:13.766–4:15.266
它有兩個介面
4:15.266–4:17.466
一個是「文字生成圖片」
4:17.466–4:20.300
而另一個是「修改現有的圖片」
4:20.300–4:23.100
至於 GPT Image 2 這邊也是一樣的
4:23.100–4:25.600
總共有兩個不同的介面
4:25.600–4:28.333
好,取得了 API 金鑰和模型的 ID 之後
4:28.333–4:31.833
我們可以回到 Claude 準備來建立一個 Skill (技能)
4:31.833–4:32.933
所謂「技能」
4:32.933–4:36.533
你可以把它當成是一個讓 AI 助理閱讀的操作手冊
4:36.533–4:40.100
讓它知道在執行任務時要遵守哪些要點
4:40.100–4:40.933
舉例來說
4:40.933–4:42.433
我們可以告訴 Claude
4:42.433–4:44.733
只要我們請它生成或編輯圖片
4:44.733–4:46.766
就要啟用這個技能
4:46.766–4:51.000
使用的模型包含了 Nano Banana 2 和 GPT Image 2
4:51.000–4:53.266
同時要提醒它必須依照任務的類型
4:53.266–4:55.333
來選擇正確的介面
4:55.333–4:57.533
那這邊還有一點要特別注意
4:57.533–5:01.066
就是我們剛才取得的 API 金鑰不要直接貼給 Claude
5:01.066–5:02.333
因為這有可能會讓金鑰
5:02.333–5:05.733
隨著對話內容一同曝光到網路上
5:05.733–5:07.100
比較合適的做法
5:07.100–5:08.800
是把這型別的機密資訊
5:08.800–5:11.333
儲存在一個叫做 .env 的檔案
5:11.333–5:14.333
讓程式在執行時自動讀取
5:14.333–5:16.800
那最後我們也要在提示詞中說明
5:16.800–5:19.433
如果生成的任務需要用到參考圖
5:19.433–5:23.300
AI 助理可以到「參考圖」資料夾內來存取這些檔案
5:23.300–5:27.133
至於生成好的圖片則統一放到「完成檔」資料夾
5:27.133–5:31.000
並且以模型名稱加上日期時間來作為檔名
5:31.000–5:33.966
好,那我把這個提示詞貼到輸入框內
5:33.966–5:36.166
並且按下 Enter 鍵送出
5:36.166–5:38.566
Claude 有可能會在建立技能的過程中
5:38.566–5:40.600
向我們詢問一些問題
5:40.600–5:43.266
你可以依照自己的需求來進行作答
5:43.266–5:46.033
也可以直接採用它提供的建議
5:46.033–5:47.733
等技能建立完成後
5:47.733–5:51.333
你就可以開啟 Claude 替我們準備好的 .env 檔案
5:51.333–5:54.000
讓它顯示在電腦的資料夾內
5:54.000–5:57.333
接著再將這個檔案使用一般的記事本開啟
5:57.333–6:01.133
來把先前我們取得的 API 金鑰貼到指定的位置
6:01.133–6:04.600
最後再按下 Ctrl +S 執行儲存
6:04.600–6:07.633
好,那我們就來測試一下建立好的技能吧
6:07.633–6:09.600
我請 Claude 生成一張圖片
6:09.600–6:13.266
主題是一個在古羅馬競技場奮戰的角鬥士
6:13.266–6:15.466
然後將提示詞送出
6:15.466–6:17.833
過程中如果跳出授權的對話方塊
6:17.833–6:19.833
就直接按下「允許」
6:19.833–6:21.533
於是過了一會兒之後
6:21.533–6:25.200
一張手持劍盾的角鬥士圖片就生成完畢了
6:25.200–6:29.433
而且圖片也已自動儲存到先前我們指定的資料夾
6:29.433–6:31.633
OK,那接著我們來試試看
6:31.633–6:34.000
讓 AI 修改現有的圖片
6:34.000–6:34.866
舉例來說
6:34.866–6:37.066
這裡我有一張獅子的圖片
6:37.066–6:39.800
我想要讓牠穿上一套金色的鎧甲
6:39.800–6:42.266
而要讓 Claude 能取得這張圖片
6:42.266–6:44.766
我們必須先把圖檔複製起來
6:44.766–6:47.600
進入到專案中的「參考圖」資料夾
6:47.600–6:50.766
然後按下 Ctrl +V 來將圖檔貼上
6:50.766–6:52.566
參考圖放到定位之後
6:52.566–6:56.133
你可以回到 Claude 來撰寫生成圖片的提示詞
6:56.133–6:57.066
如有需要
6:57.066–7:00.866
你甚至可以請 Claude 使用不同的模型各生成一張圖片
7:00.866–7:04.400
方便我們對照兩個模型輸出圖片的風格特色
7:04.400–7:06.700
好,我們將提示詞送出
7:06.700–7:07.900
稍待片刻後
7:07.900–7:10.833
Claude 便回傳了兩張生成好的獅子圖片
7:10.833–7:14.900
甚至還貼心說明瞭兩個作品在細節上的差異喔
7:14.900–7:17.500
好,當我們在撰寫圖片提示詞時
7:17.500–7:19.200
常會遇到一個瓶頸
7:19.200–7:22.533
就是我們不知道該如何描述畫面中的細節
7:22.533–7:24.766
像是場景該如何鋪陳
7:24.766–7:27.100
鏡頭視角該如何拿捏等
7:27.100–7:29.433
而這種需要專業知識的任務
7:29.433–7:32.233
其實我們也可以交給 AI 助理來代勞
7:32.233–7:34.700
就是把原來的技能做個改寫
7:34.700–7:36.366
請它在生成圖片時
7:36.366–7:40.233
先依據我們提供的主題自動補充更豐富的細節
7:40.233–7:42.966
而且修改好後要先讓我們過目
7:42.966–7:45.800
確認沒有問題之後才能送出
7:45.800–7:47.766
OK,技能修改完成後
7:47.766–7:49.900
我們來驗收一下成果
7:49.900–7:51.433
譬如我請 Claude 生成一張
7:51.433–7:55.166
「蘇格拉底在雅典街頭與別人辯論」的圖片
7:55.166–7:57.266
然後將提示詞送出
7:57.266–7:59.733
而這一次 Claude 並沒有直接動工
7:59.733–8:01.033
而是先把這個主題
8:01.033–8:03.666
擴展成一段內容詳盡的提示詞
8:03.666–8:05.366
包含了人物的神態
8:05.366–8:06.600
周圍的建築
8:06.600–8:10.000
乃至於鏡頭的焦段等全都描述得一清二楚
8:10.000–8:12.300
而我們看過覺得沒有什麼問題的話
8:12.300–8:14.200
就可以請 Claude 送出
8:14.200–8:15.400
於是很快地
8:15.400–8:20.266
一張生動地蘇格拉底辯論的場景就呈現在我們的眼前囉
8:20.266–8:23.433
OK,那這個技能不光可用來生成圖片
8:23.433–8:26.566
如果想要生成影片也沒有任何問題
8:26.566–8:28.900
我們一樣可以回到 FAL 的網站
8:28.900–8:32.266
在左側的分類中勾選 Text to Video (文字生成影片)
8:32.266–8:33.400
以目前來說
8:33.400–8:37.833
生成影片效果最出色的模型首推 Seedance 2.0
8:37.833–8:42.766
而旁邊的 Minimax H3 則是前幾天才剛亮相的新模型
8:42.766–8:43.600
除此之外
8:43.600–8:47.633
下面還有一個價效比很不錯的選擇是 Kling V3
8:47.633–8:48.666
那同樣地
8:48.666–8:51.200
你可以逐一進入這幾個模型的頁面
8:51.200–8:53.700
把它們的計價資訊拷貝下來 一同交給 AI 來進行分析和比較
8:53.700–8:56.833
一同交給 AI 來進行分析和比較
8:56.833–8:59.333
等你選定好中意的主力模型之後
8:59.333–9:01.300
你就可以寫一段提示詞
9:01.300–9:03.366
請 Claude 把影片生成的功能
9:03.366–9:05.933
一併加入到原有的技能之中
9:05.933–9:08.166
而由於影片的設定參數較多
9:08.166–9:10.800
而且每個模型的數值都不太一樣
9:10.800–9:13.666
因此這邊我讓 Claude 採用一問一答的方式
9:13.666–9:16.033
協助我們來進行設定
9:16.033–9:18.066
好,我將提示詞送出
9:18.066–9:19.566
功能一切就緒之後
9:19.566–9:21.866
就可以立即來做個測試
9:21.866–9:24.900
例如我指定用 Kling 3.0 生成一段影片
9:24.900–9:27.833
讓一位穿著時尚的男子朝著鏡頭走過來
9:27.833–9:30.633
然後拿出一條巧克力棒咬了一口
9:30.633–9:32.866
接著按下 Enter 鍵送出
9:32.866–9:33.566
同樣地
9:33.566–9:37.033
Claude 會根據這個主題先進行提示詞的最佳化
9:37.033–9:38.733
我們看過沒有問題之後
9:38.733–9:42.033
Claude 就會開始逐一詢問影片參數的細節
9:42.033–9:43.800
包含影片的秒數
9:43.800–9:47.866
寬高比要設為多少、以及是否要生成音訊
9:47.866–9:49.300
全部確認完畢後
9:49.300–9:52.333
Claude 就會開始進行影片的生成
9:52.333–9:54.466
好,我們來看一下生成好的作品
10:04.766–10:08.200
OK,那在生成影片時有一個很常見的技巧
10:08.200–10:12.166
就是我們先提供一張靜態的圖片作為初始影格
10:12.166–10:15.300
然後請 AI 將這張圖片動起來
10:15.300–10:17.200
那我們來看一個例子
10:17.200–10:18.866
譬如這裡有一張圖片
10:18.866–10:22.566
是一名女子將臉頰貼在一條巨大的飛龍頭上
10:22.566–10:25.966
而我想讓 AI 延伸出後續的畫面
10:25.966–10:26.766
同樣地
10:26.766–10:29.233
我們要先把這張圖片做個複製
10:29.233–10:31.233
進入到「參考圖」資料夾
10:31.233–10:33.800
按下 Ctrl +V 來將它貼上
10:33.800–10:37.366
然後我們再回到 Claude 的介面來撰寫提示詞
10:37.366–10:40.566
譬如這一次我改用 MiniMax H3 的模型
10:40.566–10:44.100
讓女子抬起頭跟飛龍一同看向相機的鏡頭
10:44.100–10:46.266
並且將鏡頭逐漸拉遠
10:46.266–10:48.500
然後按下 Enter 鍵送出
10:48.500–10:51.800
那 Claude 同樣會先替我們最佳化提示詞的內容
10:51.800–10:53.933
來擴充套件影片中的細節
10:53.933–10:57.033
接著再向我們逐一確認影片的各項引數
10:57.033–10:58.966
包含長度要設為幾秒
10:58.966–11:01.233
解析度要設為多高
11:01.233–11:02.200
確認完畢後
11:02.200–11:04.933
Claude 就開始執行影片生成的任務
11:04.933–11:06.433
於是片刻之後
11:06.433–11:09.733
一段充滿史詩感的奇幻短片就成功產生囉
11:13.266–11:17.733
OK,最後如果你想讓生成圖片和影片的流程更加順手
11:17.733–11:19.866
我們甚至還可以更進一步
11:19.866–11:23.633
請 Claude 把這個技能改造成一個桌面版的 App
11:23.633–11:25.666
由於這是一個比較大的任務
11:25.666–11:28.900
所以你可以把 Claude 先切換成「計畫」(Plan) 模式
11:28.900–11:32.566
接著再來描述我們心目中理想的 App 樣貌
11:32.566–11:34.766
像是視窗版面的佈局
11:34.766–11:37.233
想要走什麼樣的設計風格
11:37.233–11:40.033
面板內應該有哪些欄位和按鈕
11:40.033–11:43.133
以及生成好的作品要如何呈現和管理等
11:43.133–11:45.000
把這些想法送出之後
11:45.000–11:46.600
Claude 會詢問我們一些問題
11:46.600–11:48.700
來確認實作的細節
11:48.700–11:51.366
如果你對於技術層面的術語不太熟悉
11:51.366–11:54.300
可以直接採用它給的建議就 OK 了
11:54.300–11:56.066
細節都確認完畢之後
11:56.066–11:58.866
Claude 會先寫一份計畫的提案
11:58.866–12:00.800
看過之後如果沒有問題
12:00.800–12:03.466
Claude 就會開始著手實作
12:03.466–12:05.966
好,那 App 目前已製作完成
12:05.966–12:09.100
我們可以把它開啟實際來測試一下
12:09.100–12:11.066
首先 API 金鑰的部分
12:11.066–12:13.000
你只要開啟「設定」對話方塊
12:13.000–12:16.666
就能把金鑰貼到欄位裡面來做妥善的儲存
12:16.666–12:18.400
而在介面的左上角
12:18.400–12:21.866
我們可以自由切換「圖片」和「影片」兩個分頁
12:21.866–12:24.400
至於要使用哪一個 AI 模型
12:24.400–12:27.500
則可透過底下的下拉選單來做挑選
12:27.500–12:30.666
由於這個 App 目前還缺少一個專屬的圖示
12:30.666–12:32.833
所以我們不妨藉著這個機會
12:32.833–12:34.700
讓 App 自己來生成
12:34.700–12:37.500
例如我想要生成一個抽象幾何風格
12:37.500–12:40.033
帶有圓角造型的白色圖示
12:40.033–12:42.433
寬高比的話可以設成 1:1
12:42.433–12:44.633
然後按下「生成」按鈕
12:44.633–12:46.166
圖示生成完畢後
12:46.166–12:48.600
我們就把它儲存到電腦資料夾
12:48.600–12:50.933
並且將它命名為 Icon
12:50.933–12:52.533
那最後我們就讓 Claude
12:52.533–12:55.700
把這個 App 的外觀套用剛製作好的圖示
12:55.700–12:59.133
並且將 App 安裝到「應用程式」資料夾
12:59.133–12:59.900
如此一來
12:59.900–13:02.833
之後當我們想要生成圖片或影片的時候
13:02.833–13:05.866
只要在電腦內開啟這個 App 就能立即使用
13:05.866–13:08.166
是不是非常地方便呢?
13:08.166–13:12.000
OK,那今天關於 Claude 生成圖片和影片技能的介紹
13:12.000–13:13.433
我們就聊到這邊
13:13.433–13:15.100
我們下回再見
13:15.100–13:16.000
拜拜
0:02.966–0:04.566
嗨,大家好
0:04.566–0:07.933
平常如果我們想要用 AI 來生成圖片或影片
0:07.933–0:11.600
最常見的方式就是訂閱各種線上的 AI 平臺
0:11.600–0:15.866
不過這些服務每個月可能都要固定支付 10 至 15 美元以上
0:15.866–0:18.233
部分進階的方案甚至更貴
0:18.233–0:19.766
這對於只是偶爾使用
0:19.766–0:22.400
或是單純想要體驗 AI 創作的使用者來說
0:22.400–0:24.300
是一個不小的負擔
0:24.300–0:28.066
因此今天我要向大家介紹一個更具彈性的方式
0:28.066–0:29.866
就是在自己的 AI 助理
0:29.866–0:33.933
像是 ChatGPT 或 Claude 安裝一個 Skill (技能)
0:33.933–0:37.500
讓 AI 助理能以非常低廉的成本來生成圖片和影片
0:37.500–0:40.266
不需要繫結任何的訂閱方案
0:40.266–0:44.833
好,那這邊我們首先要下載 Claude 或 ChatGPT 的桌面版軟體
0:44.833–0:48.100
因為後續我們需要讓 AI 助理讀取參考圖片
0:48.100–0:51.466
並且將生成好的檔案儲存到指定的位置
0:51.466–0:53.733
而如果你習慣使用 ChatGPT
0:53.733–0:57.633
你也可以在它的官網首頁來下載它的桌面版軟體
0:57.633–0:59.533
好,那我以 Claude 為例
0:59.533–1:01.333
下載並安裝完成後
1:01.333–1:04.133
你可以直接把桌面版的軟體開啟
1:04.133–1:05.833
而這邊我們需要在電腦中
1:05.833–1:08.200
先建立一個專案資料夾
1:08.200–1:10.233
你可以隨意找一個位置
1:10.233–1:12.733
利用滑鼠右鍵執行「新增」
1:12.733–1:15.600
並取一個自己容易記住的名字
1:15.600–1:16.600
建立好後
1:16.600–1:20.033
我們對著資料夾雙擊滑鼠左鍵來將它開啟
1:20.033–1:21.566
並且重複剛才的步驟
1:21.566–1:23.500
另外建立兩個資料夾
1:23.500–1:25.800
分別是「完成檔」和「參考圖」
1:25.800–1:28.100
之後我們會使用到
1:28.100–1:29.666
資料夾準備好之後
1:29.666–1:31.866
你就可以回到桌面版的軟體
1:31.866–1:34.166
來將目前的專案指定到剛建立的資料夾
1:34.166–1:36.966
點選「開啟」
1:36.966–1:39.566
再按下「信任此工作區」
1:39.566–1:41.666
而如果你使用的是 ChatGPT
1:41.666–1:43.566
方式也大同小異
1:43.566–1:45.233
你只要把來源資料夾
1:45.233–1:48.166
同樣指定到剛才的位置就 OK 了
1:48.166–1:51.733
好,那接下來我們要來到一個叫做 FAL 的平臺
1:51.733–1:54.466
它的優點是提供的 AI 模型非常地多
1:54.466–1:56.966
且計費方式非常地透明
1:56.966–2:00.533
你可以用自己的 Gmail 信箱先註冊一個帳號
2:00.533–2:01.433
登入之後
2:01.433–2:04.666
我們要取得一個叫做 API Key 的金鑰
2:04.666–2:08.700
系統會使用這把金鑰來辨識你是哪一位使用者
2:08.700–2:11.066
好,所以我們到右上角點選「新增金鑰」
2:11.066–2:13.766
點選「建立」
2:13.766–2:16.966
然後你就可以把螢幕上顯示的金鑰密碼複製下來
2:16.966–2:19.533
妥善儲存在自己的電腦
2:19.533–2:22.133
那 FAL 不需要你支付固定的月費
2:22.133–2:25.700
而是按照你實際生成的圖片數量來計算費用
2:25.700–2:28.766
因此我們必須先繫結一張信用卡
2:28.766–2:29.833
繫結完成後
2:29.833–2:32.333
切換到 Credits 的頁面
2:32.333–2:34.833
那一開始其實不需要儲值太多
2:34.833–2:36.633
你可以等熟悉操作之後
2:36.633–2:39.400
再視自己的需求來增加額度
2:39.400–2:42.200
而要檢視 FAL 有提供哪些 AI 模型
2:42.200–2:44.633
你可以到左上角點選「探索」(Explore)
2:44.633–2:48.433
如此你就能在頁面左側看到所有的模型分類
2:48.433–2:52.833
例如 Text to Image 就是所謂的「由文字生成圖片」
2:52.833–2:54.866
那目前「文生圖」的 AI 模型
2:54.866–2:56.633
其中最受歡迎的一個
2:56.633–2:59.400
是由 Google 推出的 Nano Banana 2
2:59.400–3:02.500
那這個頁面有提供了一個簡單的範例
3:02.500–3:06.100
左側的 Prompt 欄位是這張圖使用的提示詞
3:06.100–3:09.233
然後下面有一個寬高比的下拉選單
3:09.233–3:11.733
再下來是影像的解析度
3:11.733–3:14.466
而在旁邊有一個進階設定的按鈕
3:14.466–3:17.633
你可以在這個區塊指定生成圖片的數量
3:17.633–3:20.800
以及圖檔要採用哪一種儲存格式
3:20.800–3:23.600
最後在右欄有一項很重要的資訊
3:23.600–3:25.966
就是在使用 Nano Banana 2 的時候
3:25.966–3:27.966
費用是如何計算的
3:27.966–3:30.166
你可以把這些資訊做個複製
3:30.166–3:32.733
來跟其它 AI 模型做個比較
3:32.733–3:36.833
譬如目前另一個很熱門的 AI 模型是 GPT Image 2
3:36.833–3:38.666
你可以進入它的頁面之後
3:38.666–3:40.600
同樣找到它的計價方式
3:40.600–3:42.500
把它複製下來
3:42.500–3:46.300
然後我們就可以在 ChatGPT 把兩個模型的價目表貼上去
3:46.300–3:47.966
請它來做個分析
3:47.966–3:50.133
看看哪個比較划算
3:50.133–3:51.766
好,那分析的結果
3:51.766–3:56.133
ChatGPT 認為使用 Nano Banana 2 來生成圖片會比較省錢
3:56.133–3:59.066
所以我打算把它當成主力的模型
3:59.066–4:01.366
接著再回到 FAL 的官網
4:01.366–4:04.500
將 Nano Banana 2 的模型 ID 做個複製
4:04.500–4:06.666
那這邊有個要注意的地方
4:06.666–4:08.266
就是 FAL 提醒我們
4:08.266–4:10.566
一個模型可能會使用不同的介面 (Endpoints)
4:10.566–4:12.166
來執行不同的任務
4:12.166–4:13.766
以 Nano Banana 來說
4:13.766–4:15.266
它有兩個介面
4:15.266–4:17.466
一個是「文字生成圖片」
4:17.466–4:20.300
而另一個是「修改現有的圖片」
4:20.300–4:23.100
至於 GPT Image 2 這邊也是一樣的
4:23.100–4:25.600
總共有兩個不同的介面
4:25.600–4:28.333
好,取得了 API 金鑰和模型的 ID 之後
4:28.333–4:31.833
我們可以回到 Claude 準備來建立一個 Skill (技能)
4:31.833–4:32.933
所謂「技能」
4:32.933–4:36.533
你可以把它當成是一個讓 AI 助理閱讀的操作手冊
4:36.533–4:40.100
讓它知道在執行任務時要遵守哪些要點
4:40.100–4:40.933
舉例來說
4:40.933–4:42.433
我們可以告訴 Claude
4:42.433–4:44.733
只要我們請它生成或編輯圖片
4:44.733–4:46.766
就要啟用這個技能
4:46.766–4:51.000
使用的模型包含了 Nano Banana 2 和 GPT Image 2
4:51.000–4:53.266
同時要提醒它必須依照任務的類型
4:53.266–4:55.333
來選擇正確的介面
4:55.333–4:57.533
那這邊還有一點要特別注意
4:57.533–5:01.066
就是我們剛才取得的 API 金鑰不要直接貼給 Claude
5:01.066–5:02.333
因為這有可能會讓金鑰
5:02.333–5:05.733
隨著對話內容一同曝光到網路上
5:05.733–5:07.100
比較合適的做法
5:07.100–5:08.800
是把這型別的機密資訊
5:08.800–5:11.333
儲存在一個叫做 .env 的檔案
5:11.333–5:14.333
讓程式在執行時自動讀取
5:14.333–5:16.800
那最後我們也要在提示詞中說明
5:16.800–5:19.433
如果生成的任務需要用到參考圖
5:19.433–5:23.300
AI 助理可以到「參考圖」資料夾內來存取這些檔案
5:23.300–5:27.133
至於生成好的圖片則統一放到「完成檔」資料夾
5:27.133–5:31.000
並且以模型名稱加上日期時間來作為檔名
5:31.000–5:33.966
好,那我把這個提示詞貼到輸入框內
5:33.966–5:36.166
並且按下 Enter 鍵送出
5:36.166–5:38.566
Claude 有可能會在建立技能的過程中
5:38.566–5:40.600
向我們詢問一些問題
5:40.600–5:43.266
你可以依照自己的需求來進行作答
5:43.266–5:46.033
也可以直接採用它提供的建議
5:46.033–5:47.733
等技能建立完成後
5:47.733–5:51.333
你就可以開啟 Claude 替我們準備好的 .env 檔案
5:51.333–5:54.000
讓它顯示在電腦的資料夾內
5:54.000–5:57.333
接著再將這個檔案使用一般的記事本開啟
5:57.333–6:01.133
來把先前我們取得的 API 金鑰貼到指定的位置
6:01.133–6:04.600
最後再按下 Ctrl +S 執行儲存
6:04.600–6:07.633
好,那我們就來測試一下建立好的技能吧
6:07.633–6:09.600
我請 Claude 生成一張圖片
6:09.600–6:13.266
主題是一個在古羅馬競技場奮戰的角鬥士
6:13.266–6:15.466
然後將提示詞送出
6:15.466–6:17.833
過程中如果跳出授權的對話方塊
6:17.833–6:19.833
就直接按下「允許」
6:19.833–6:21.533
於是過了一會兒之後
6:21.533–6:25.200
一張手持劍盾的角鬥士圖片就生成完畢了
6:25.200–6:29.433
而且圖片也已自動儲存到先前我們指定的資料夾
6:29.433–6:31.633
OK,那接著我們來試試看
6:31.633–6:34.000
讓 AI 修改現有的圖片
6:34.000–6:34.866
舉例來說
6:34.866–6:37.066
這裡我有一張獅子的圖片
6:37.066–6:39.800
我想要讓牠穿上一套金色的鎧甲
6:39.800–6:42.266
而要讓 Claude 能取得這張圖片
6:42.266–6:44.766
我們必須先把圖檔複製起來
6:44.766–6:47.600
進入到專案中的「參考圖」資料夾
6:47.600–6:50.766
然後按下 Ctrl +V 來將圖檔貼上
6:50.766–6:52.566
參考圖放到定位之後
6:52.566–6:56.133
你可以回到 Claude 來撰寫生成圖片的提示詞
6:56.133–6:57.066
如有需要
6:57.066–7:00.866
你甚至可以請 Claude 使用不同的模型各生成一張圖片
7:00.866–7:04.400
方便我們對照兩個模型輸出圖片的風格特色
7:04.400–7:06.700
好,我們將提示詞送出
7:06.700–7:07.900
稍待片刻後
7:07.900–7:10.833
Claude 便回傳了兩張生成好的獅子圖片
7:10.833–7:14.900
甚至還貼心說明瞭兩個作品在細節上的差異喔
7:14.900–7:17.500
好,當我們在撰寫圖片提示詞時
7:17.500–7:19.200
常會遇到一個瓶頸
7:19.200–7:22.533
就是我們不知道該如何描述畫面中的細節
7:22.533–7:24.766
像是場景該如何鋪陳
7:24.766–7:27.100
鏡頭視角該如何拿捏等
7:27.100–7:29.433
而這種需要專業知識的任務
7:29.433–7:32.233
其實我們也可以交給 AI 助理來代勞
7:32.233–7:34.700
就是把原來的技能做個改寫
7:34.700–7:36.366
請它在生成圖片時
7:36.366–7:40.233
先依據我們提供的主題自動補充更豐富的細節
7:40.233–7:42.966
而且修改好後要先讓我們過目
7:42.966–7:45.800
確認沒有問題之後才能送出
7:45.800–7:47.766
OK,技能修改完成後
7:47.766–7:49.900
我們來驗收一下成果
7:49.900–7:51.433
譬如我請 Claude 生成一張
7:51.433–7:55.166
「蘇格拉底在雅典街頭與別人辯論」的圖片
7:55.166–7:57.266
然後將提示詞送出
7:57.266–7:59.733
而這一次 Claude 並沒有直接動工
7:59.733–8:01.033
而是先把這個主題
8:01.033–8:03.666
擴展成一段內容詳盡的提示詞
8:03.666–8:05.366
包含了人物的神態
8:05.366–8:06.600
周圍的建築
8:06.600–8:10.000
乃至於鏡頭的焦段等全都描述得一清二楚
8:10.000–8:12.300
而我們看過覺得沒有什麼問題的話
8:12.300–8:14.200
就可以請 Claude 送出
8:14.200–8:15.400
於是很快地
8:15.400–8:20.266
一張生動地蘇格拉底辯論的場景就呈現在我們的眼前囉
8:20.266–8:23.433
OK,那這個技能不光可用來生成圖片
8:23.433–8:26.566
如果想要生成影片也沒有任何問題
8:26.566–8:28.900
我們一樣可以回到 FAL 的網站
8:28.900–8:32.266
在左側的分類中勾選 Text to Video (文字生成影片)
8:32.266–8:33.400
以目前來說
8:33.400–8:37.833
生成影片效果最出色的模型首推 Seedance 2.0
8:37.833–8:42.766
而旁邊的 Minimax H3 則是前幾天才剛亮相的新模型
8:42.766–8:43.600
除此之外
8:43.600–8:47.633
下面還有一個價效比很不錯的選擇是 Kling V3
8:47.633–8:48.666
那同樣地
8:48.666–8:51.200
你可以逐一進入這幾個模型的頁面
8:51.200–8:53.700
把它們的計價資訊拷貝下來 一同交給 AI 來進行分析和比較
8:53.700–8:56.833
一同交給 AI 來進行分析和比較
8:56.833–8:59.333
等你選定好中意的主力模型之後
8:59.333–9:01.300
你就可以寫一段提示詞
9:01.300–9:03.366
請 Claude 把影片生成的功能
9:03.366–9:05.933
一併加入到原有的技能之中
9:05.933–9:08.166
而由於影片的設定參數較多
9:08.166–9:10.800
而且每個模型的數值都不太一樣
9:10.800–9:13.666
因此這邊我讓 Claude 採用一問一答的方式
9:13.666–9:16.033
協助我們來進行設定
9:16.033–9:18.066
好,我將提示詞送出
9:18.066–9:19.566
功能一切就緒之後
9:19.566–9:21.866
就可以立即來做個測試
9:21.866–9:24.900
例如我指定用 Kling 3.0 生成一段影片
9:24.900–9:27.833
讓一位穿著時尚的男子朝著鏡頭走過來
9:27.833–9:30.633
然後拿出一條巧克力棒咬了一口
9:30.633–9:32.866
接著按下 Enter 鍵送出
9:32.866–9:33.566
同樣地
9:33.566–9:37.033
Claude 會根據這個主題先進行提示詞的最佳化
9:37.033–9:38.733
我們看過沒有問題之後
9:38.733–9:42.033
Claude 就會開始逐一詢問影片參數的細節
9:42.033–9:43.800
包含影片的秒數
9:43.800–9:47.866
寬高比要設為多少、以及是否要生成音訊
9:47.866–9:49.300
全部確認完畢後
9:49.300–9:52.333
Claude 就會開始進行影片的生成
9:52.333–9:54.466
好,我們來看一下生成好的作品
10:04.766–10:08.200
OK,那在生成影片時有一個很常見的技巧
10:08.200–10:12.166
就是我們先提供一張靜態的圖片作為初始影格
10:12.166–10:15.300
然後請 AI 將這張圖片動起來
10:15.300–10:17.200
那我們來看一個例子
10:17.200–10:18.866
譬如這裡有一張圖片
10:18.866–10:22.566
是一名女子將臉頰貼在一條巨大的飛龍頭上
10:22.566–10:25.966
而我想讓 AI 延伸出後續的畫面
10:25.966–10:26.766
同樣地
10:26.766–10:29.233
我們要先把這張圖片做個複製
10:29.233–10:31.233
進入到「參考圖」資料夾
10:31.233–10:33.800
按下 Ctrl +V 來將它貼上
10:33.800–10:37.366
然後我們再回到 Claude 的介面來撰寫提示詞
10:37.366–10:40.566
譬如這一次我改用 MiniMax H3 的模型
10:40.566–10:44.100
讓女子抬起頭跟飛龍一同看向相機的鏡頭
10:44.100–10:46.266
並且將鏡頭逐漸拉遠
10:46.266–10:48.500
然後按下 Enter 鍵送出
10:48.500–10:51.800
那 Claude 同樣會先替我們最佳化提示詞的內容
10:51.800–10:53.933
來擴充套件影片中的細節
10:53.933–10:57.033
接著再向我們逐一確認影片的各項引數
10:57.033–10:58.966
包含長度要設為幾秒
10:58.966–11:01.233
解析度要設為多高
11:01.233–11:02.200
確認完畢後
11:02.200–11:04.933
Claude 就開始執行影片生成的任務
11:04.933–11:06.433
於是片刻之後
11:06.433–11:09.733
一段充滿史詩感的奇幻短片就成功產生囉
11:13.266–11:17.733
OK,最後如果你想讓生成圖片和影片的流程更加順手
11:17.733–11:19.866
我們甚至還可以更進一步
11:19.866–11:23.633
請 Claude 把這個技能改造成一個桌面版的 App
11:23.633–11:25.666
由於這是一個比較大的任務
11:25.666–11:28.900
所以你可以把 Claude 先切換成「計畫」(Plan) 模式
11:28.900–11:32.566
接著再來描述我們心目中理想的 App 樣貌
11:32.566–11:34.766
像是視窗版面的佈局
11:34.766–11:37.233
想要走什麼樣的設計風格
11:37.233–11:40.033
面板內應該有哪些欄位和按鈕
11:40.033–11:43.133
以及生成好的作品要如何呈現和管理等
11:43.133–11:45.000
把這些想法送出之後
11:45.000–11:46.600
Claude 會詢問我們一些問題
11:46.600–11:48.700
來確認實作的細節
11:48.700–11:51.366
如果你對於技術層面的術語不太熟悉
11:51.366–11:54.300
可以直接採用它給的建議就 OK 了
11:54.300–11:56.066
細節都確認完畢之後
11:56.066–11:58.866
Claude 會先寫一份計畫的提案
11:58.866–12:00.800
看過之後如果沒有問題
12:00.800–12:03.466
Claude 就會開始著手實作
12:03.466–12:05.966
好,那 App 目前已製作完成
12:05.966–12:09.100
我們可以把它開啟實際來測試一下
12:09.100–12:11.066
首先 API 金鑰的部分
12:11.066–12:13.000
你只要開啟「設定」對話方塊
12:13.000–12:16.666
就能把金鑰貼到欄位裡面來做妥善的儲存
12:16.666–12:18.400
而在介面的左上角
12:18.400–12:21.866
我們可以自由切換「圖片」和「影片」兩個分頁
12:21.866–12:24.400
至於要使用哪一個 AI 模型
12:24.400–12:27.500
則可透過底下的下拉選單來做挑選
12:27.500–12:30.666
由於這個 App 目前還缺少一個專屬的圖示
12:30.666–12:32.833
所以我們不妨藉著這個機會
12:32.833–12:34.700
讓 App 自己來生成
12:34.700–12:37.500
例如我想要生成一個抽象幾何風格
12:37.500–12:40.033
帶有圓角造型的白色圖示
12:40.033–12:42.433
寬高比的話可以設成 1:1
12:42.433–12:44.633
然後按下「生成」按鈕
12:44.633–12:46.166
圖示生成完畢後
12:46.166–12:48.600
我們就把它儲存到電腦資料夾
12:48.600–12:50.933
並且將它命名為 Icon
12:50.933–12:52.533
那最後我們就讓 Claude
12:52.533–12:55.700
把這個 App 的外觀套用剛製作好的圖示
12:55.700–12:59.133
並且將 App 安裝到「應用程式」資料夾
12:59.133–12:59.900
如此一來
12:59.900–13:02.833
之後當我們想要生成圖片或影片的時候
13:02.833–13:05.866
只要在電腦內開啟這個 App 就能立即使用
13:05.866–13:08.166
是不是非常地方便呢?
13:08.166–13:12.000
OK,那今天關於 Claude 生成圖片和影片技能的介紹
13:12.000–13:13.433
我們就聊到這邊
13:13.433–13:15.100
我們下回再見
13:15.100–13:16.000
拜拜
0:02.966–0:04.566
嗨,大家好
嗨,大家好
0:04.566–0:07.933
平常如果我們想要用 AI 來生成圖片或影片
平常如果我們想要用 AI 來生成圖片或影片
0:07.933–0:11.600
最常見的方式就是訂閱各種線上的 AI 平臺
最常見的方式就是訂閱各種線上的 AI 平臺
0:11.600–0:15.866
不過這些服務每個月可能都要固定支付 10 至 15 美元以上
不過這些服務每個月可能都要固定支付 10 至 15 美元以上
0:15.866–0:18.233
部分進階的方案甚至更貴
部分進階的方案甚至更貴
0:18.233–0:19.766
這對於只是偶爾使用
這對於只是偶爾使用
0:19.766–0:22.400
或是單純想要體驗 AI 創作的使用者來說
或是單純想要體驗 AI 創作的使用者來說
0:22.400–0:24.300
是一個不小的負擔
是一個不小的負擔
0:24.300–0:28.066
因此今天我要向大家介紹一個更具彈性的方式
因此今天我要向大家介紹一個更具彈性的方式
0:28.066–0:29.866
就是在自己的 AI 助理
就是在自己的 AI 助理
0:29.866–0:33.933
像是 ChatGPT 或 Claude 安裝一個 Skill (技能)
像是 ChatGPT 或 Claude 安裝一個 Skill (技能)
0:33.933–0:37.500
讓 AI 助理能以非常低廉的成本來生成圖片和影片
讓 AI 助理能以非常低廉的成本來生成圖片和影片
0:37.500–0:40.266
不需要繫結任何的訂閱方案
不需要繫結任何的訂閱方案
0:40.266–0:44.833
好,那這邊我們首先要下載 Claude 或 ChatGPT 的桌面版軟體
好,那這邊我們首先要下載 Claude 或 ChatGPT 的桌面版軟體
0:44.833–0:48.100
因為後續我們需要讓 AI 助理讀取參考圖片
因為後續我們需要讓 AI 助理讀取參考圖片
0:48.100–0:51.466
並且將生成好的檔案儲存到指定的位置
並且將生成好的檔案儲存到指定的位置
0:51.466–0:53.733
而如果你習慣使用 ChatGPT
而如果你習慣使用 ChatGPT
0:53.733–0:57.633
你也可以在它的官網首頁來下載它的桌面版軟體
你也可以在它的官網首頁來下載它的桌面版軟體
0:57.633–0:59.533
好,那我以 Claude 為例
好,那我以 Claude 為例
0:59.533–1:01.333
下載並安裝完成後
下載並安裝完成後
1:01.333–1:04.133
你可以直接把桌面版的軟體開啟
你可以直接把桌面版的軟體開啟
1:04.133–1:05.833
而這邊我們需要在電腦中
而這邊我們需要在電腦中
1:05.833–1:08.200
先建立一個專案資料夾
先建立一個專案資料夾
1:08.200–1:10.233
你可以隨意找一個位置
你可以隨意找一個位置
1:10.233–1:12.733
利用滑鼠右鍵執行「新增」
利用滑鼠右鍵執行「新增」
1:12.733–1:15.600
並取一個自己容易記住的名字
並取一個自己容易記住的名字
1:15.600–1:16.600
建立好後
建立好後
1:16.600–1:20.033
我們對著資料夾雙擊滑鼠左鍵來將它開啟
我們對著資料夾雙擊滑鼠左鍵來將它開啟
1:20.033–1:21.566
並且重複剛才的步驟
並且重複剛才的步驟
1:21.566–1:23.500
另外建立兩個資料夾
另外建立兩個資料夾
1:23.500–1:25.800
分別是「完成檔」和「參考圖」
分別是「完成檔」和「參考圖」
1:25.800–1:28.100
之後我們會使用到
之後我們會使用到
1:28.100–1:29.666
資料夾準備好之後
資料夾準備好之後
1:29.666–1:31.866
你就可以回到桌面版的軟體
你就可以回到桌面版的軟體
1:31.866–1:34.166
來將目前的專案指定到剛建立的資料夾
來將目前的專案指定到剛建立的資料夾
1:34.166–1:36.966
點選「開啟」
點選「開啟」
1:36.966–1:39.566
再按下「信任此工作區」
再按下「信任此工作區」
1:39.566–1:41.666
而如果你使用的是 ChatGPT
而如果你使用的是 ChatGPT
1:41.666–1:43.566
方式也大同小異
方式也大同小異
1:43.566–1:45.233
你只要把來源資料夾
你只要把來源資料夾
1:45.233–1:48.166
同樣指定到剛才的位置就 OK 了
同樣指定到剛才的位置就 OK 了
1:48.166–1:51.733
好,那接下來我們要來到一個叫做 FAL 的平臺
好,那接下來我們要來到一個叫做 FAL 的平臺
1:51.733–1:54.466
它的優點是提供的 AI 模型非常地多
它的優點是提供的 AI 模型非常地多
1:54.466–1:56.966
且計費方式非常地透明
且計費方式非常地透明
1:56.966–2:00.533
你可以用自己的 Gmail 信箱先註冊一個帳號
你可以用自己的 Gmail 信箱先註冊一個帳號
2:00.533–2:01.433
登入之後
登入之後
2:01.433–2:04.666
我們要取得一個叫做 API Key 的金鑰
我們要取得一個叫做 API Key 的金鑰
2:04.666–2:08.700
系統會使用這把金鑰來辨識你是哪一位使用者
系統會使用這把金鑰來辨識你是哪一位使用者
2:08.700–2:11.066
好,所以我們到右上角點選「新增金鑰」
好,所以我們到右上角點選「新增金鑰」
2:11.066–2:13.766
點選「建立」
點選「建立」
2:13.766–2:16.966
然後你就可以把螢幕上顯示的金鑰密碼複製下來
然後你就可以把螢幕上顯示的金鑰密碼複製下來
2:16.966–2:19.533
妥善儲存在自己的電腦
妥善儲存在自己的電腦
2:19.533–2:22.133
那 FAL 不需要你支付固定的月費
那 FAL 不需要你支付固定的月費
2:22.133–2:25.700
而是按照你實際生成的圖片數量來計算費用
而是按照你實際生成的圖片數量來計算費用
2:25.700–2:28.766
因此我們必須先繫結一張信用卡
因此我們必須先繫結一張信用卡
2:28.766–2:29.833
繫結完成後
繫結完成後
2:29.833–2:32.333
切換到 Credits 的頁面
切換到 Credits 的頁面
2:32.333–2:34.833
那一開始其實不需要儲值太多
那一開始其實不需要儲值太多
2:34.833–2:36.633
你可以等熟悉操作之後
你可以等熟悉操作之後
2:36.633–2:39.400
再視自己的需求來增加額度
再視自己的需求來增加額度
2:39.400–2:42.200
而要檢視 FAL 有提供哪些 AI 模型
而要檢視 FAL 有提供哪些 AI 模型
2:42.200–2:44.633
你可以到左上角點選「探索」(Explore)
你可以到左上角點選「探索」(Explore)
2:44.633–2:48.433
如此你就能在頁面左側看到所有的模型分類
如此你就能在頁面左側看到所有的模型分類
2:48.433–2:52.833
例如 Text to Image 就是所謂的「由文字生成圖片」
例如 Text to Image 就是所謂的「由文字生成圖片」
2:52.833–2:54.866
那目前「文生圖」的 AI 模型
那目前「文生圖」的 AI 模型
2:54.866–2:56.633
其中最受歡迎的一個
其中最受歡迎的一個
2:56.633–2:59.400
是由 Google 推出的 Nano Banana 2
是由 Google 推出的 Nano Banana 2
2:59.400–3:02.500
那這個頁面有提供了一個簡單的範例
那這個頁面有提供了一個簡單的範例
3:02.500–3:06.100
左側的 Prompt 欄位是這張圖使用的提示詞
左側的 Prompt 欄位是這張圖使用的提示詞
3:06.100–3:09.233
然後下面有一個寬高比的下拉選單
然後下面有一個寬高比的下拉選單
3:09.233–3:11.733
再下來是影像的解析度
再下來是影像的解析度
3:11.733–3:14.466
而在旁邊有一個進階設定的按鈕
而在旁邊有一個進階設定的按鈕
3:14.466–3:17.633
你可以在這個區塊指定生成圖片的數量
你可以在這個區塊指定生成圖片的數量
3:17.633–3:20.800
以及圖檔要採用哪一種儲存格式
以及圖檔要採用哪一種儲存格式
3:20.800–3:23.600
最後在右欄有一項很重要的資訊
最後在右欄有一項很重要的資訊
3:23.600–3:25.966
就是在使用 Nano Banana 2 的時候
就是在使用 Nano Banana 2 的時候
3:25.966–3:27.966
費用是如何計算的
費用是如何計算的
3:27.966–3:30.166
你可以把這些資訊做個複製
你可以把這些資訊做個複製
3:30.166–3:32.733
來跟其它 AI 模型做個比較
來跟其它 AI 模型做個比較
3:32.733–3:36.833
譬如目前另一個很熱門的 AI 模型是 GPT Image 2
譬如目前另一個很熱門的 AI 模型是 GPT Image 2
3:36.833–3:38.666
你可以進入它的頁面之後
你可以進入它的頁面之後
3:38.666–3:40.600
同樣找到它的計價方式
同樣找到它的計價方式
3:40.600–3:42.500
把它複製下來
把它複製下來
3:42.500–3:46.300
然後我們就可以在 ChatGPT 把兩個模型的價目表貼上去
然後我們就可以在 ChatGPT 把兩個模型的價目表貼上去
3:46.300–3:47.966
請它來做個分析
請它來做個分析
3:47.966–3:50.133
看看哪個比較划算
看看哪個比較划算
3:50.133–3:51.766
好,那分析的結果
好,那分析的結果
3:51.766–3:56.133
ChatGPT 認為使用 Nano Banana 2 來生成圖片會比較省錢
ChatGPT 認為使用 Nano Banana 2 來生成圖片會比較省錢
3:56.133–3:59.066
所以我打算把它當成主力的模型
所以我打算把它當成主力的模型
3:59.066–4:01.366
接著再回到 FAL 的官網
接著再回到 FAL 的官網
4:01.366–4:04.500
將 Nano Banana 2 的模型 ID 做個複製
將 Nano Banana 2 的模型 ID 做個複製
4:04.500–4:06.666
那這邊有個要注意的地方
那這邊有個要注意的地方
4:06.666–4:08.266
就是 FAL 提醒我們
就是 FAL 提醒我們
4:08.266–4:10.566
一個模型可能會使用不同的介面 (Endpoints)
一個模型可能會使用不同的介面 (Endpoints)
4:10.566–4:12.166
來執行不同的任務
來執行不同的任務
4:12.166–4:13.766
以 Nano Banana 來說
以 Nano Banana 來說
4:13.766–4:15.266
它有兩個介面
它有兩個介面
4:15.266–4:17.466
一個是「文字生成圖片」
一個是「文字生成圖片」
4:17.466–4:20.300
而另一個是「修改現有的圖片」
而另一個是「修改現有的圖片」
4:20.300–4:23.100
至於 GPT Image 2 這邊也是一樣的
至於 GPT Image 2 這邊也是一樣的
4:23.100–4:25.600
總共有兩個不同的介面
總共有兩個不同的介面
4:25.600–4:28.333
好,取得了 API 金鑰和模型的 ID 之後
好,取得了 API 金鑰和模型的 ID 之後
4:28.333–4:31.833
我們可以回到 Claude 準備來建立一個 Skill (技能)
我們可以回到 Claude 準備來建立一個 Skill (技能)
4:31.833–4:32.933
所謂「技能」
所謂「技能」
4:32.933–4:36.533
你可以把它當成是一個讓 AI 助理閱讀的操作手冊
你可以把它當成是一個讓 AI 助理閱讀的操作手冊
4:36.533–4:40.100
讓它知道在執行任務時要遵守哪些要點
讓它知道在執行任務時要遵守哪些要點
4:40.100–4:40.933
舉例來說
舉例來說
4:40.933–4:42.433
我們可以告訴 Claude
我們可以告訴 Claude
4:42.433–4:44.733
只要我們請它生成或編輯圖片
只要我們請它生成或編輯圖片
4:44.733–4:46.766
就要啟用這個技能
就要啟用這個技能
4:46.766–4:51.000
使用的模型包含了 Nano Banana 2 和 GPT Image 2
使用的模型包含了 Nano Banana 2 和 GPT Image 2
4:51.000–4:53.266
同時要提醒它必須依照任務的類型
同時要提醒它必須依照任務的類型
4:53.266–4:55.333
來選擇正確的介面
來選擇正確的介面
4:55.333–4:57.533
那這邊還有一點要特別注意
那這邊還有一點要特別注意
4:57.533–5:01.066
就是我們剛才取得的 API 金鑰不要直接貼給 Claude
就是我們剛才取得的 API 金鑰不要直接貼給 Claude
5:01.066–5:02.333
因為這有可能會讓金鑰
因為這有可能會讓金鑰
5:02.333–5:05.733
隨著對話內容一同曝光到網路上
隨著對話內容一同曝光到網路上
5:05.733–5:07.100
比較合適的做法
比較合適的做法
5:07.100–5:08.800
是把這型別的機密資訊
是把這型別的機密資訊
5:08.800–5:11.333
儲存在一個叫做 .env 的檔案
儲存在一個叫做 .env 的檔案
5:11.333–5:14.333
讓程式在執行時自動讀取
讓程式在執行時自動讀取
5:14.333–5:16.800
那最後我們也要在提示詞中說明
那最後我們也要在提示詞中說明
5:16.800–5:19.433
如果生成的任務需要用到參考圖
如果生成的任務需要用到參考圖
5:19.433–5:23.300
AI 助理可以到「參考圖」資料夾內來存取這些檔案
AI 助理可以到「參考圖」資料夾內來存取這些檔案
5:23.300–5:27.133
至於生成好的圖片則統一放到「完成檔」資料夾
至於生成好的圖片則統一放到「完成檔」資料夾
5:27.133–5:31.000
並且以模型名稱加上日期時間來作為檔名
並且以模型名稱加上日期時間來作為檔名
5:31.000–5:33.966
好,那我把這個提示詞貼到輸入框內
好,那我把這個提示詞貼到輸入框內
5:33.966–5:36.166
並且按下 Enter 鍵送出
並且按下 Enter 鍵送出
5:36.166–5:38.566
Claude 有可能會在建立技能的過程中
Claude 有可能會在建立技能的過程中
5:38.566–5:40.600
向我們詢問一些問題
向我們詢問一些問題
5:40.600–5:43.266
你可以依照自己的需求來進行作答
你可以依照自己的需求來進行作答
5:43.266–5:46.033
也可以直接採用它提供的建議
也可以直接採用它提供的建議
5:46.033–5:47.733
等技能建立完成後
等技能建立完成後
5:47.733–5:51.333
你就可以開啟 Claude 替我們準備好的 .env 檔案
你就可以開啟 Claude 替我們準備好的 .env 檔案
5:51.333–5:54.000
讓它顯示在電腦的資料夾內
讓它顯示在電腦的資料夾內
5:54.000–5:57.333
接著再將這個檔案使用一般的記事本開啟
接著再將這個檔案使用一般的記事本開啟
5:57.333–6:01.133
來把先前我們取得的 API 金鑰貼到指定的位置
來把先前我們取得的 API 金鑰貼到指定的位置
6:01.133–6:04.600
最後再按下 Ctrl +S 執行儲存
最後再按下 Ctrl +S 執行儲存
6:04.600–6:07.633
好,那我們就來測試一下建立好的技能吧
好,那我們就來測試一下建立好的技能吧
6:07.633–6:09.600
我請 Claude 生成一張圖片
我請 Claude 生成一張圖片
6:09.600–6:13.266
主題是一個在古羅馬競技場奮戰的角鬥士
主題是一個在古羅馬競技場奮戰的角鬥士
6:13.266–6:15.466
然後將提示詞送出
然後將提示詞送出
6:15.466–6:17.833
過程中如果跳出授權的對話方塊
過程中如果跳出授權的對話方塊
6:17.833–6:19.833
就直接按下「允許」
就直接按下「允許」
6:19.833–6:21.533
於是過了一會兒之後
於是過了一會兒之後
6:21.533–6:25.200
一張手持劍盾的角鬥士圖片就生成完畢了
一張手持劍盾的角鬥士圖片就生成完畢了
6:25.200–6:29.433
而且圖片也已自動儲存到先前我們指定的資料夾
而且圖片也已自動儲存到先前我們指定的資料夾
6:29.433–6:31.633
OK,那接著我們來試試看
OK,那接著我們來試試看
6:31.633–6:34.000
讓 AI 修改現有的圖片
讓 AI 修改現有的圖片
6:34.000–6:34.866
舉例來說
舉例來說
6:34.866–6:37.066
這裡我有一張獅子的圖片
這裡我有一張獅子的圖片
6:37.066–6:39.800
我想要讓牠穿上一套金色的鎧甲
我想要讓牠穿上一套金色的鎧甲
6:39.800–6:42.266
而要讓 Claude 能取得這張圖片
而要讓 Claude 能取得這張圖片
6:42.266–6:44.766
我們必須先把圖檔複製起來
我們必須先把圖檔複製起來
6:44.766–6:47.600
進入到專案中的「參考圖」資料夾
進入到專案中的「參考圖」資料夾
6:47.600–6:50.766
然後按下 Ctrl +V 來將圖檔貼上
然後按下 Ctrl +V 來將圖檔貼上
6:50.766–6:52.566
參考圖放到定位之後
參考圖放到定位之後
6:52.566–6:56.133
你可以回到 Claude 來撰寫生成圖片的提示詞
你可以回到 Claude 來撰寫生成圖片的提示詞
6:56.133–6:57.066
如有需要
如有需要
6:57.066–7:00.866
你甚至可以請 Claude 使用不同的模型各生成一張圖片
你甚至可以請 Claude 使用不同的模型各生成一張圖片
7:00.866–7:04.400
方便我們對照兩個模型輸出圖片的風格特色
方便我們對照兩個模型輸出圖片的風格特色
7:04.400–7:06.700
好,我們將提示詞送出
好,我們將提示詞送出
7:06.700–7:07.900
稍待片刻後
稍待片刻後
7:07.900–7:10.833
Claude 便回傳了兩張生成好的獅子圖片
Claude 便回傳了兩張生成好的獅子圖片
7:10.833–7:14.900
甚至還貼心說明瞭兩個作品在細節上的差異喔
甚至還貼心說明瞭兩個作品在細節上的差異喔
7:14.900–7:17.500
好,當我們在撰寫圖片提示詞時
好,當我們在撰寫圖片提示詞時
7:17.500–7:19.200
常會遇到一個瓶頸
常會遇到一個瓶頸
7:19.200–7:22.533
就是我們不知道該如何描述畫面中的細節
就是我們不知道該如何描述畫面中的細節
7:22.533–7:24.766
像是場景該如何鋪陳
像是場景該如何鋪陳
7:24.766–7:27.100
鏡頭視角該如何拿捏等
鏡頭視角該如何拿捏等
7:27.100–7:29.433
而這種需要專業知識的任務
而這種需要專業知識的任務
7:29.433–7:32.233
其實我們也可以交給 AI 助理來代勞
其實我們也可以交給 AI 助理來代勞
7:32.233–7:34.700
就是把原來的技能做個改寫
就是把原來的技能做個改寫
7:34.700–7:36.366
請它在生成圖片時
請它在生成圖片時
7:36.366–7:40.233
先依據我們提供的主題自動補充更豐富的細節
先依據我們提供的主題自動補充更豐富的細節
7:40.233–7:42.966
而且修改好後要先讓我們過目
而且修改好後要先讓我們過目
7:42.966–7:45.800
確認沒有問題之後才能送出
確認沒有問題之後才能送出
7:45.800–7:47.766
OK,技能修改完成後
OK,技能修改完成後
7:47.766–7:49.900
我們來驗收一下成果
我們來驗收一下成果
7:49.900–7:51.433
譬如我請 Claude 生成一張
譬如我請 Claude 生成一張
7:51.433–7:55.166
「蘇格拉底在雅典街頭與別人辯論」的圖片
「蘇格拉底在雅典街頭與別人辯論」的圖片
7:55.166–7:57.266
然後將提示詞送出
然後將提示詞送出
7:57.266–7:59.733
而這一次 Claude 並沒有直接動工
而這一次 Claude 並沒有直接動工
7:59.733–8:01.033
而是先把這個主題
而是先把這個主題
8:01.033–8:03.666
擴展成一段內容詳盡的提示詞
擴展成一段內容詳盡的提示詞
8:03.666–8:05.366
包含了人物的神態
包含了人物的神態
8:05.366–8:06.600
周圍的建築
周圍的建築
8:06.600–8:10.000
乃至於鏡頭的焦段等全都描述得一清二楚
乃至於鏡頭的焦段等全都描述得一清二楚
8:10.000–8:12.300
而我們看過覺得沒有什麼問題的話
而我們看過覺得沒有什麼問題的話
8:12.300–8:14.200
就可以請 Claude 送出
就可以請 Claude 送出
8:14.200–8:15.400
於是很快地
於是很快地
8:15.400–8:20.266
一張生動地蘇格拉底辯論的場景就呈現在我們的眼前囉
一張生動地蘇格拉底辯論的場景就呈現在我們的眼前囉
8:20.266–8:23.433
OK,那這個技能不光可用來生成圖片
OK,那這個技能不光可用來生成圖片
8:23.433–8:26.566
如果想要生成影片也沒有任何問題
如果想要生成影片也沒有任何問題
8:26.566–8:28.900
我們一樣可以回到 FAL 的網站
我們一樣可以回到 FAL 的網站
8:28.900–8:32.266
在左側的分類中勾選 Text to Video (文字生成影片)
在左側的分類中勾選 Text to Video (文字生成影片)
8:32.266–8:33.400
以目前來說
以目前來說
8:33.400–8:37.833
生成影片效果最出色的模型首推 Seedance 2.0
生成影片效果最出色的模型首推 Seedance 2.0
8:37.833–8:42.766
而旁邊的 Minimax H3 則是前幾天才剛亮相的新模型
而旁邊的 Minimax H3 則是前幾天才剛亮相的新模型
8:42.766–8:43.600
除此之外
除此之外
8:43.600–8:47.633
下面還有一個價效比很不錯的選擇是 Kling V3
下面還有一個價效比很不錯的選擇是 Kling V3
8:47.633–8:48.666
那同樣地
那同樣地
8:48.666–8:51.200
你可以逐一進入這幾個模型的頁面
你可以逐一進入這幾個模型的頁面
8:51.200–8:53.700
把它們的計價資訊拷貝下來 一同交給 AI 來進行分析和比較
把它們的計價資訊拷貝下來 一同交給 AI 來進行分析和比較
8:53.700–8:56.833
一同交給 AI 來進行分析和比較
一同交給 AI 來進行分析和比較
8:56.833–8:59.333
等你選定好中意的主力模型之後
等你選定好中意的主力模型之後
8:59.333–9:01.300
你就可以寫一段提示詞
你就可以寫一段提示詞
9:01.300–9:03.366
請 Claude 把影片生成的功能
請 Claude 把影片生成的功能
9:03.366–9:05.933
一併加入到原有的技能之中
一併加入到原有的技能之中
9:05.933–9:08.166
而由於影片的設定參數較多
而由於影片的設定參數較多
9:08.166–9:10.800
而且每個模型的數值都不太一樣
而且每個模型的數值都不太一樣
9:10.800–9:13.666
因此這邊我讓 Claude 採用一問一答的方式
因此這邊我讓 Claude 採用一問一答的方式
9:13.666–9:16.033
協助我們來進行設定
協助我們來進行設定
9:16.033–9:18.066
好,我將提示詞送出
好,我將提示詞送出
9:18.066–9:19.566
功能一切就緒之後
功能一切就緒之後
9:19.566–9:21.866
就可以立即來做個測試
就可以立即來做個測試
9:21.866–9:24.900
例如我指定用 Kling 3.0 生成一段影片
例如我指定用 Kling 3.0 生成一段影片
9:24.900–9:27.833
讓一位穿著時尚的男子朝著鏡頭走過來
讓一位穿著時尚的男子朝著鏡頭走過來
9:27.833–9:30.633
然後拿出一條巧克力棒咬了一口
然後拿出一條巧克力棒咬了一口
9:30.633–9:32.866
接著按下 Enter 鍵送出
接著按下 Enter 鍵送出
9:32.866–9:33.566
同樣地
同樣地
9:33.566–9:37.033
Claude 會根據這個主題先進行提示詞的最佳化
Claude 會根據這個主題先進行提示詞的最佳化
9:37.033–9:38.733
我們看過沒有問題之後
我們看過沒有問題之後
9:38.733–9:42.033
Claude 就會開始逐一詢問影片參數的細節
Claude 就會開始逐一詢問影片參數的細節
9:42.033–9:43.800
包含影片的秒數
包含影片的秒數
9:43.800–9:47.866
寬高比要設為多少、以及是否要生成音訊
寬高比要設為多少、以及是否要生成音訊
9:47.866–9:49.300
全部確認完畢後
全部確認完畢後
9:49.300–9:52.333
Claude 就會開始進行影片的生成
Claude 就會開始進行影片的生成
9:52.333–9:54.466
好,我們來看一下生成好的作品
好,我們來看一下生成好的作品
10:04.766–10:08.200
OK,那在生成影片時有一個很常見的技巧
OK,那在生成影片時有一個很常見的技巧
10:08.200–10:12.166
就是我們先提供一張靜態的圖片作為初始影格
就是我們先提供一張靜態的圖片作為初始影格
10:12.166–10:15.300
然後請 AI 將這張圖片動起來
然後請 AI 將這張圖片動起來
10:15.300–10:17.200
那我們來看一個例子
那我們來看一個例子
10:17.200–10:18.866
譬如這裡有一張圖片
譬如這裡有一張圖片
10:18.866–10:22.566
是一名女子將臉頰貼在一條巨大的飛龍頭上
是一名女子將臉頰貼在一條巨大的飛龍頭上
10:22.566–10:25.966
而我想讓 AI 延伸出後續的畫面
而我想讓 AI 延伸出後續的畫面
10:25.966–10:26.766
同樣地
同樣地
10:26.766–10:29.233
我們要先把這張圖片做個複製
我們要先把這張圖片做個複製
10:29.233–10:31.233
進入到「參考圖」資料夾
進入到「參考圖」資料夾
10:31.233–10:33.800
按下 Ctrl +V 來將它貼上
按下 Ctrl +V 來將它貼上
10:33.800–10:37.366
然後我們再回到 Claude 的介面來撰寫提示詞
然後我們再回到 Claude 的介面來撰寫提示詞
10:37.366–10:40.566
譬如這一次我改用 MiniMax H3 的模型
譬如這一次我改用 MiniMax H3 的模型
10:40.566–10:44.100
讓女子抬起頭跟飛龍一同看向相機的鏡頭
讓女子抬起頭跟飛龍一同看向相機的鏡頭
10:44.100–10:46.266
並且將鏡頭逐漸拉遠
並且將鏡頭逐漸拉遠
10:46.266–10:48.500
然後按下 Enter 鍵送出
然後按下 Enter 鍵送出
10:48.500–10:51.800
那 Claude 同樣會先替我們最佳化提示詞的內容
那 Claude 同樣會先替我們最佳化提示詞的內容
10:51.800–10:53.933
來擴充套件影片中的細節
來擴充套件影片中的細節
10:53.933–10:57.033
接著再向我們逐一確認影片的各項引數
接著再向我們逐一確認影片的各項引數
10:57.033–10:58.966
包含長度要設為幾秒
包含長度要設為幾秒
10:58.966–11:01.233
解析度要設為多高
解析度要設為多高
11:01.233–11:02.200
確認完畢後
確認完畢後
11:02.200–11:04.933
Claude 就開始執行影片生成的任務
Claude 就開始執行影片生成的任務
11:04.933–11:06.433
於是片刻之後
於是片刻之後
11:06.433–11:09.733
一段充滿史詩感的奇幻短片就成功產生囉
一段充滿史詩感的奇幻短片就成功產生囉
11:13.266–11:17.733
OK,最後如果你想讓生成圖片和影片的流程更加順手
OK,最後如果你想讓生成圖片和影片的流程更加順手
11:17.733–11:19.866
我們甚至還可以更進一步
我們甚至還可以更進一步
11:19.866–11:23.633
請 Claude 把這個技能改造成一個桌面版的 App
請 Claude 把這個技能改造成一個桌面版的 App
11:23.633–11:25.666
由於這是一個比較大的任務
由於這是一個比較大的任務
11:25.666–11:28.900
所以你可以把 Claude 先切換成「計畫」(Plan) 模式
所以你可以把 Claude 先切換成「計畫」(Plan) 模式
11:28.900–11:32.566
接著再來描述我們心目中理想的 App 樣貌
接著再來描述我們心目中理想的 App 樣貌
11:32.566–11:34.766
像是視窗版面的佈局
像是視窗版面的佈局
11:34.766–11:37.233
想要走什麼樣的設計風格
想要走什麼樣的設計風格
11:37.233–11:40.033
面板內應該有哪些欄位和按鈕
面板內應該有哪些欄位和按鈕
11:40.033–11:43.133
以及生成好的作品要如何呈現和管理等
以及生成好的作品要如何呈現和管理等
11:43.133–11:45.000
把這些想法送出之後
把這些想法送出之後
11:45.000–11:46.600
Claude 會詢問我們一些問題
Claude 會詢問我們一些問題
11:46.600–11:48.700
來確認實作的細節
來確認實作的細節
11:48.700–11:51.366
如果你對於技術層面的術語不太熟悉
如果你對於技術層面的術語不太熟悉
11:51.366–11:54.300
可以直接採用它給的建議就 OK 了
可以直接採用它給的建議就 OK 了
11:54.300–11:56.066
細節都確認完畢之後
細節都確認完畢之後
11:56.066–11:58.866
Claude 會先寫一份計畫的提案
Claude 會先寫一份計畫的提案
11:58.866–12:00.800
看過之後如果沒有問題
看過之後如果沒有問題
12:00.800–12:03.466
Claude 就會開始著手實作
Claude 就會開始著手實作
12:03.466–12:05.966
好,那 App 目前已製作完成
好,那 App 目前已製作完成
12:05.966–12:09.100
我們可以把它開啟實際來測試一下
我們可以把它開啟實際來測試一下
12:09.100–12:11.066
首先 API 金鑰的部分
首先 API 金鑰的部分
12:11.066–12:13.000
你只要開啟「設定」對話方塊
你只要開啟「設定」對話方塊
12:13.000–12:16.666
就能把金鑰貼到欄位裡面來做妥善的儲存
就能把金鑰貼到欄位裡面來做妥善的儲存
12:16.666–12:18.400
而在介面的左上角
而在介面的左上角
12:18.400–12:21.866
我們可以自由切換「圖片」和「影片」兩個分頁
我們可以自由切換「圖片」和「影片」兩個分頁
12:21.866–12:24.400
至於要使用哪一個 AI 模型
至於要使用哪一個 AI 模型
12:24.400–12:27.500
則可透過底下的下拉選單來做挑選
則可透過底下的下拉選單來做挑選
12:27.500–12:30.666
由於這個 App 目前還缺少一個專屬的圖示
由於這個 App 目前還缺少一個專屬的圖示
12:30.666–12:32.833
所以我們不妨藉著這個機會
所以我們不妨藉著這個機會
12:32.833–12:34.700
讓 App 自己來生成
讓 App 自己來生成
12:34.700–12:37.500
例如我想要生成一個抽象幾何風格
例如我想要生成一個抽象幾何風格
12:37.500–12:40.033
帶有圓角造型的白色圖示
帶有圓角造型的白色圖示
12:40.033–12:42.433
寬高比的話可以設成 1:1
寬高比的話可以設成 1:1
12:42.433–12:44.633
然後按下「生成」按鈕
然後按下「生成」按鈕
12:44.633–12:46.166
圖示生成完畢後
圖示生成完畢後
12:46.166–12:48.600
我們就把它儲存到電腦資料夾
我們就把它儲存到電腦資料夾
12:48.600–12:50.933
並且將它命名為 Icon
並且將它命名為 Icon
12:50.933–12:52.533
那最後我們就讓 Claude
那最後我們就讓 Claude
12:52.533–12:55.700
把這個 App 的外觀套用剛製作好的圖示
把這個 App 的外觀套用剛製作好的圖示
12:55.700–12:59.133
並且將 App 安裝到「應用程式」資料夾
並且將 App 安裝到「應用程式」資料夾
12:59.133–12:59.900
如此一來
如此一來
12:59.900–13:02.833
之後當我們想要生成圖片或影片的時候
之後當我們想要生成圖片或影片的時候
13:02.833–13:05.866
只要在電腦內開啟這個 App 就能立即使用
只要在電腦內開啟這個 App 就能立即使用
13:05.866–13:08.166
是不是非常地方便呢?
是不是非常地方便呢?
13:08.166–13:12.000
OK,那今天關於 Claude 生成圖片和影片技能的介紹
OK,那今天關於 Claude 生成圖片和影片技能的介紹
13:12.000–13:13.433
我們就聊到這邊
我們就聊到這邊
13:13.433–13:15.100
我們下回再見
我們下回再見
13:15.100–13:16.000
拜拜
拜拜

影片筆記:我用一個 Claude Skill (技能) 省下了所有生成圖片和影片的訂閱費用!每個月現省上千元!

一句話總結

影片介紹如何在本地電腦的桌面版 AI 助理(如 Claude 或 ChatGPT)中安裝「Skill(技能)」,並串接 FAL 平台的 API,透過極低廉的按量計費方式,取代昂貴的月度訂閱方案,實現低成本生成圖片與影片,甚至可進一步封裝為專屬桌面 App。

核心重點

  1. 成本優勢:傳統 AI 圖片/影片服務需每月支付 10-15 美元以上進階方案費用,本方法採用 FAL 平台 API 按實際生成數量計費,無需固定月費,適合偶爾使用者。
  2. 本地化操作:利用桌面版 AI 助理(Claude/ChatGPT)的「Skill」功能,將操作邏輯、模型選擇、路徑指引編寫為操作手冊,實現本地化低成本生成。
  3. 流程自動化:透過建立專案資料夾結構(完成檔、參考圖)、設定 .env 檔案儲存 API Key,並撰寫提示詞讓 AI 自動執行生成、儲存與命名流程。
  4. 功能擴展:不僅支援文生圖(Text to Image)與圖生圖(Image Modification),還擴展至文生影片(Text to Video)及靜態圖轉動態影片,並可封裝為具備圖示與分頁功能的桌面 App。

詳細大綱

一、 背景與解決方案概述

  • 現狀痛點:常見 AI 圖片/影片生成服務需每月支付 10-15 美元以上進階方案費用,對偶爾使用者負擔較重。
  • 解決方案:在本地 AI 助理(Claude 或 ChatGPT)安裝 Skill(技能),以極低成本生成內容,無需綁定訂閱方案。

二、 環境準備與專案設定

  • 軟體下載:下載並安裝 Claude 或 ChatGPT 的桌面版軟體(需支援讀取參考圖片及儲存檔案至指定位置)。
  • 資料夾結構建立
  • 建立專案資料夾。
  • 專案內建立兩個子資料夾:
  • 「完成檔」:儲存生成好的檔案。
  • 「參考圖」:存放用於生成或修改的參考圖片。
  • 專案指定:在桌面版軟體中開啟專案資料夾,並點擊「信任此工作區」(ChatGPT 則為指定來源資料夾)。

三、 FAL 平台設定與模型比較

  • FAL 平台介紹:提供多種 AI 模型,計費透明,按實際生成數量計費,無需固定月費。
  • 帳號與金鑰設定
  • 使用 Gmail 註冊帳號。
  • 建立並複製 API Key(用於辨識使用者身份)。
  • 繫結信用卡以支付費用。
  • 初期不需大量儲值,熟悉操作後再視需求增加額度。
  • 模型探索與比較
  • 透過「探索」(Explore) 查看模型分類(如 Text to Image)。
  • 模型對比
  • Nano Banana 2:Google 推出的熱門文生圖模型。
  • GPT Image 2:另一個熱門模型。
  • 計費分析:複製模型頁面中的計價方式,交由 ChatGPT 分析比較哪個模型更划算。
  • 結論:ChatGPT 分析認為使用 Nano Banana 2 生成圖片較省錢,故選定為主模型。
  • 模型介面 (Endpoints) 注意
  • 同一模型可能有多個介面執行不同任務(例如:文字生成圖片、修改現有圖片)。
  • 需複製對應任務的模型 ID。

四、 建立 Claude Skill(技能)

  • 技能定義:作為 AI 助理的操作手冊,規範執行任務時的要點。
  • 技能內容設定
  • 觸發條件:當請求生成或編輯圖片時啟用。
  • 指定模型:包含 Nano Banana 2 和 GPT Image 2。
  • 介面選擇:依據任務類型選擇正確介面。
  • 機密資訊處理:API Key 不應直接貼在提示詞中,應儲存於 .env 檔案讓程式自動讀取。
  • 路徑指引:提示詞需說明參考圖存放於「參考圖」資料夾,生成檔案存放於「完成檔」資料夾,檔名格式為「模型名稱+日期時間」。
  • 技能建立流程
  • 將提示詞貼入輸入框送出。
  • 依 Claude 詢問回答或採用建議。
  • 建立 .env 檔案,將 API Key 貼入並儲存。

五、 圖片生成與修改測試

  • 生成圖片測試
  • 範例:生成「古羅馬競技場奮戰的角鬥士」。
  • 過程:送出提示詞 -> 授權對話方塊點擊「允許」 -> 生成完成並自動儲存至指定資料夾。
  • 修改現有圖片測試
  • 範例:將獅子圖片修改為穿著金色鎧甲。
  • 操作:將參考圖複製至「參考圖」資料夾。
  • 進階功能:可請 Claude 使用不同模型各生成一張,對照風格差異。
  • 提示詞優化技能
  • 針對不擅長描述細節(場景、鏡頭視角)的使用者。
  • 改寫技能:請 AI 先依據主題自動補充豐富細節,經使用者確認無誤後再送出生成。
  • 範例:生成「蘇格拉底在雅典街頭辯論」,AI 先擴展提示詞(包含神態、建築、焦段等),確認後生成。

六、 影片生成功能擴展

  • FAL 影片模型選擇
  • 分類:Text to Video (文字生成影片)。
  • 推薦模型:
  • Seedance 2.0:目前效果最出色。
  • Minimax H3:新亮相模型。
  • Kling V3:價效比不錯。
  • 操作:複製各模型計價資訊,交由 AI 分析比較後選定主力模型。
  • 技能擴展
  • 撰寫提示詞將影片生成功能加入原有技能。
  • 由於參數複雜,建議採用一問一答方式協助設定。
  • 影片生成測試
  • 範例:使用 Kling 3.0 生成「穿著時尚男子吃巧克力棒」影片。
  • 流程:提示詞優化 -> 確認參數(秒數、寬高比、音訊) -> 生成。
  • 靜態圖轉動態影片技巧
  • 提供靜態圖片作為初始影格,請 AI 延伸後續畫面。
  • 範例:使用 MiniMax H3,將「女子貼臉飛龍」圖片動起來,鏡頭拉遠。
  • 流程:參考圖放入「參考圖」資料夾 -> 撰寫提示詞 -> AI 優化提示詞 -> 確認參數 -> 生成史詩感奇幻短片。

七、 進階:封裝為桌面 App

  • 目標:將生成流程順手化,打造專屬桌面 App。
  • 實作流程
  • 切換 Claude 至「計畫」(Plan) 模式。
  • 描述理想 App 樣貌:視窗佈局、設計風格、欄位按鈕、作品呈現方式。
  • Claude 詢問實作細節 -> 撰寫計畫提案 -> 實作。
  • App 功能與測試
  • 設定:在「設定」對話方塊儲存 API 金鑰。
  • 介面:左上角切換「圖片」與「影片」分頁;底部下拉選單挑選模型。
  • 圖示生成
  • 請 App 生成專屬圖示(例如:抽象幾何風格、圓角白色圖示,寬高比 1:1)。
  • 儲存為 Icon 並命名。
  • 安裝:套用圖示並安裝至「應用程式」資料夾。
  • 使用:開啟 App 即可立即使用,無需額外操作。

工具 / 模型 / 名詞整理

  • AI 助理/軟體
  • Claude (桌面版)
  • ChatGPT (桌面版)
  • AI 模型 (來自 FAL 平台)
  • Nano Banana 2 (Google 推出,用於文生圖)
  • GPT Image 2 (用於文生圖)
  • Seedance 2.0 (用於文字生成影片)
  • Minimax H3 (用於文字生成影片)
  • Kling V3 / Kling 3.0 (用於文字生成影片)
  • 平台與服務
  • FAL (AI 模型提供平台,提供 API Key 與計費服務)
  • 技術元件/檔案格式
  • API Key (應用程式介面金鑰)
  • .env (環境變數檔案,用於儲存機密資訊)
  • Skill (技能/操作手冊)
  • Endpoints (介面/端點)
  • Prompt (提示詞)
  • Icon (圖示檔案)

操作流程整理

  1. 環境建置
  • 安裝桌面版 Claude 或 ChatGPT。
  • 建立專案資料夾,內含「完成檔」與「參考圖」子資料夾。
  • 在軟體中開啟專案並點擊「信任此工作區」。
  1. FAL 平台設定
  • 使用 Gmail 註冊 FAL 帳號並繫結信用卡。
  • 建立 API Key 並複製。
  • 在 FAL 平台「探索」中查找模型,複製目標模型的計價資訊與 Model ID (Endpoints)。
  1. 建立 Skill (技能)
  • 撰寫提示詞,定義觸發條件、指定模型(如 Nano Banana 2)、選擇正確 Endpoints。
  • 建立 .env 檔案,將 API Key 存入,確保提示詞中不直接暴露金鑰。
  • 將提示詞與 .env 設定導入 Claude 技能系統。
  1. 執行生成任務
  • 圖片生成:輸入提示詞 -> AI 呼叫 API -> 點擊允許 -> 檔案自動儲存至「完成檔」。
  • 圖片修改:將參考圖放入「參考圖」資料夾 -> 輸入修改指令 -> AI 呼叫 API -> 儲存結果。
  • 提示詞優化:若描述簡略,AI 會先擴展細節(場景、鏡頭等),經確認後再執行生成。
  • 影片生成:選擇影片模型(如 Kling 3.0)-> 確認參數(秒數、比例、音訊)-> 生成。
  • 圖轉影片:將靜態圖放入「參考圖」-> 指令讓 AI 延伸動態 -> 生成影片。
  1. 進階:封裝桌面 App (可選)
  • 切換 Claude 至「計畫」模式。
  • 描述 App 介面需求(分頁、下拉選單、設定欄位)。
  • 由 Claude 生成程式碼與圖示。
  • 安裝圖示至應用程式資料夾,完成專屬 App 建置。

值得注意的限制或風險

  • 模型名稱準確性:影片中提及的模型名稱(如 Nano Banana 2, GPT Image 2, Seedance 2.0, Minimax H3)需查證是否為實際存在的官方名稱,可能存在聽寫錯誤或暱稱。
  • API 計費與信用卡綁定:需綁定信用卡支付費用,初期雖不需大量儲值,但仍需留意帳戶餘額與扣款情況。
  • 本地軟體依賴:此方法依賴桌面版 Claude 或 ChatGPT 的特定功能(如讀取參考圖、儲存檔案、Skill 支援),需確保軟體版本支援這些功能。
  • 技能維護:若 FAL 平台更新模型 ID 或計費方式,需手動更新 Skill 中的提示詞與 Endpoints。

逐字稿辨識疑點

  • Nano Banana 2:逐字稿中多次提及此模型名稱,並註明為 Google 推出。此名稱與常見之 Google 模型(如 Imagen, Gemini, Nano Banana 非標準名稱)不符,疑為聽寫錯誤或特定模型暱稱,需查證。
  • Kling 3.0:逐字稿中先提及「Kling V3」,後測試時提及「Kling 3.0」,版本編號格式不一致,需查證。
  • GPT Image 2:逐字稿中提及此模型名稱,需查證是否為實際存在的模型名稱或口誤。
  • Seedance 2.0:逐字稿中提及此模型名稱,需查證是否為實際存在的模型名稱或口誤。
  • Minimax H3:逐字稿中提及此模型名稱,需查證是否為實際存在的模型名稱或口誤。
  • FAL 平台:逐字稿中提及此平台名稱,需查證是否為實際存在的平台名稱或口誤。

可延伸追問

  • FAL 平台目前支援的所有模型列表及最新計費標準為何?
  • 若使用 ChatGPT 桌面版,其 Skill 功能與 Claude 桌面版在操作上有哪些具體差異?
  • 如何確保 .env 檔案的安全性,避免 API Key 洩露?
  • 若生成的圖片或影片不符合預期,有哪些常見的調整策略(如調整提示詞權重、更換模型)?
  • 將流程封裝為桌面 App 後,若 FAL 平台 API 發生變更,App 是否需要重新編譯或更新?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習