start	end	text
2966	4566	嗨，大家好
4566	7933	平常如果我們想要用 AI 來生成圖片或影片
7933	11600	最常見的方式就是訂閱各種線上的 AI 平台
11600	15866	不過這些服務每個月可能都要固定支付 10 至 15 美元以上
15866	18233	部分進階的方案甚至更貴
18233	19766	這對於只是偶爾使用
19766	22400	或是單純想要體驗 AI 創作的用戶來說
22400	24300	是一個不小的負擔
24300	28066	因此今天我要向大家介紹一個更具彈性的方式
28066	29866	就是在自己的 AI 助理
29866	33933	像是 ChatGPT 或 Claude 安裝一個 Skill (技能)
33933	37500	讓 AI 助理能以非常低廉的成本來生成圖片和影片
37500	40266	不需要綁定任何的訂閱方案
40266	44833	好，那這邊我們首先要下載 Claude 或 ChatGPT 的桌面版軟體
44833	48100	因為後續我們需要讓 AI 助理讀取參考圖片
48100	51466	並且將生成好的檔案儲存到指定的位置
51466	53733	而如果你習慣使用 ChatGPT
53733	57633	你也可以在它的官網首頁來下載它的桌面版軟體
57633	59533	好，那我以 Claude 為例
59533	61333	下載並安裝完成後
61333	64133	你可以直接把桌面版的軟體打開
64133	65833	而這邊我們需要在電腦中
65833	68200	先建立一個專案資料夾
68200	70233	你可以隨意找一個位置
70233	72733	利用滑鼠右鍵執行「新增」
72733	75600	並取一個自己容易記住的名字
75600	76600	建立好後
76600	80033	我們對著資料夾雙擊滑鼠左鍵來將它打開
80033	81566	並且重複剛才的步驟
81566	83500	另外建立兩個資料夾
83500	85800	分別是「完成檔」和「參考圖」
85800	88100	之後我們會使用到
88100	89666	資料夾準備好之後
89666	91866	你就可以回到桌面版的軟體
91866	94166	來將目前的專案指定到剛建立的資料夾
94166	96966	點擊「打開」
96966	99566	再按下「信任此工作區」
99566	101666	而如果你使用的是 ChatGPT
101666	103566	方式也大同小異
103566	105233	你只要把來源資料夾
105233	108166	同樣指定到剛才的位置就 OK 了
108166	111733	好，那接下來我們要來到一個叫做 FAL 的平台
111733	114466	它的優點是提供的 AI 模型非常地多
114466	116966	且計費方式非常地透明
116966	120533	你可以用自己的 Gmail 信箱先註冊一個帳號
120533	121433	登入之後
121433	124666	我們要取得一個叫做 API Key 的金鑰
124666	128700	系統會使用這把金鑰來辨識你是哪一位使用者
128700	131066	好，所以我們到右上角點擊「新增金鑰」
131066	133766	點擊「建立」
133766	136966	然後你就可以把螢幕上顯示的金鑰密碼拷貝下來
136966	139533	妥善保存在自己的電腦
139533	142133	那 FAL 不需要你支付固定的月費
142133	145700	而是按照你實際生成的圖片數量來計算費用
145700	148766	因此我們必須先綁定一張信用卡
148766	149833	綁定完成後
149833	152333	切換到 Credits 的頁面
152333	154833	那一開始其實不需要儲值太多
154833	156633	你可以等熟悉操作之後
156633	159400	再視自己的需求來增加額度
159400	162200	而要查看 FAL 有提供哪些 AI 模型
162200	164633	你可以到左上角點擊「探索」(Explore)
164633	168433	如此你就能在頁面左側看到所有的模型分類
168433	172833	例如 Text to Image 就是所謂的「由文字生成圖片」
172833	174866	那目前「文生圖」的 AI 模型
174866	176633	其中最受歡迎的一個
176633	179400	是由 Google 推出的 Nano Banana 2
179400	182500	那這個頁面有提供了一個簡單的範例
182500	186100	左側的 Prompt 欄位是這張圖使用的提示詞
186100	189233	然後下面有一個寬高比的下拉選單
189233	191733	再下來是影像的解析度
191733	194466	而在旁邊有一個進階設定的按鈕
194466	197633	你可以在這個區塊指定生成圖片的數量
197633	200800	以及圖檔要採用哪一種儲存格式
200800	203600	最後在右欄有一項很重要的資訊
203600	205966	就是在使用 Nano Banana 2 的時候
205966	207966	費用是如何計算的
207966	210166	你可以把這些資訊做個拷貝
210166	212733	來跟其它 AI 模型做個比較
212733	216833	譬如目前另一個很熱門的 AI 模型是 GPT Image 2
216833	218666	你可以進入它的頁面之後
218666	220600	同樣找到它的計價方式
220600	222500	把它拷貝下來
222500	226300	然後我們就可以在 ChatGPT 把兩個模型的價目表貼上去
226300	227966	請它來做個分析
227966	230133	看看哪個比較划算
230133	231766	好，那分析的結果
231766	236133	ChatGPT 認為使用 Nano Banana 2 來生成圖片會比較省錢
236133	239066	所以我打算把它當成主力的模型
239066	241366	接著再回到 FAL 的官網
241366	244500	將 Nano Banana 2 的模型 ID 做個複製
244500	246666	那這邊有個要注意的地方
246666	248266	就是 FAL 提醒我們
248266	250566	一個模型可能會使用不同的接口 (Endpoints)
250566	252166	來執行不同的任務
252166	253766	以 Nano Banana 來說
253766	255266	它有兩個接口
255266	257466	一個是「文字生成圖片」
257466	260300	而另一個是「修改現有的圖片」
260300	263100	至於 GPT Image 2 這邊也是一樣的
263100	265600	總共有兩個不同的接口
265600	268333	好，取得了 API 金鑰和模型的 ID 之後
268333	271833	我們可以回到 Claude 準備來建立一個 Skill (技能)
271833	272933	所謂「技能」
272933	276533	你可以把它當成是一個讓 AI 助理閱讀的操作手冊
276533	280100	讓它知道在執行任務時要遵守哪些要點
280100	280933	舉例來說
280933	282433	我們可以告訴 Claude
282433	284733	只要我們請它生成或編輯圖片
284733	286766	就要啟用這個技能
286766	291000	使用的模型包含了 Nano Banana 2 和 GPT Image 2
291000	293266	同時要提醒它必須依照任務的類型
293266	295333	來選擇正確的接口
295333	297533	那這邊還有一點要特別注意
297533	301066	就是我們剛才取得的 API 金鑰不要直接貼給 Claude
301066	302333	因為這有可能會讓金鑰
302333	305733	隨著對話內容一同曝光到網路上
305733	307100	比較合適的做法
307100	308800	是把這類型的機密資訊
308800	311333	儲存在一個叫做 .env 的檔案
311333	314333	讓程式在執行時自動讀取
314333	316800	那最後我們也要在提示詞中說明
316800	319433	如果生成的任務需要用到參考圖
319433	323300	AI 助理可以到「參考圖」資料夾內來存取這些檔案
323300	327133	至於生成好的圖片則統一放到「完成檔」資料夾
327133	331000	並且以模型名稱加上日期時間來作為檔名
331000	333966	好，那我把這個提示詞貼到輸入框內
333966	336166	並且按下 Enter 鍵送出
336166	338566	Claude 有可能會在建立技能的過程中
338566	340600	向我們詢問一些問題
340600	343266	你可以依照自己的需求來進行作答
343266	346033	也可以直接採用它提供的建議
346033	347733	等技能建立完成後
347733	351333	你就可以打開 Claude 替我們準備好的 .env 檔案
351333	354000	讓它顯示在電腦的資料夾內
354000	357333	接著再將這個檔案使用一般的記事本開啟
357333	361133	來把先前我們取得的 API 金鑰貼到指定的位置
361133	364600	最後再按下 Ctrl +S 執行儲存
364600	367633	好，那我們就來測試一下建立好的技能吧
367633	369600	我請 Claude 生成一張圖片
369600	373266	主題是一個在古羅馬競技場奮戰的角鬥士
373266	375466	然後將提示詞送出
375466	377833	過程中如果跳出授權的對話框
377833	379833	就直接按下「允許」
379833	381533	於是過了一會兒之後
381533	385200	一張手持劍盾的角鬥士圖片就生成完畢了
385200	389433	而且圖片也已自動儲存到先前我們指定的資料夾
389433	391633	OK，那接著我們來試試看
391633	394000	讓 AI 修改現有的圖片
394000	394866	舉例來說
394866	397066	這裡我有一張獅子的圖片
397066	399800	我想要讓牠穿上一套金色的鎧甲
399800	402266	而要讓 Claude 能取得這張圖片
402266	404766	我們必須先把圖檔拷貝起來
404766	407600	進入到專案中的「參考圖」資料夾
407600	410766	然後按下 Ctrl +V 來將圖檔貼上
410766	412566	參考圖放到定位之後
412566	416133	你可以回到 Claude 來撰寫生成圖片的提示詞
416133	417066	如有需要
417066	420866	你甚至可以請 Claude 使用不同的模型各生成一張圖片
420866	424400	方便我們對照兩個模型輸出圖片的風格特色
424400	426700	好，我們將提示詞送出
426700	427900	稍待片刻後
427900	430833	Claude 便回傳了兩張生成好的獅子圖片
430833	434900	甚至還貼心說明了兩個作品在細節上的差異喔
434900	437500	好，當我們在撰寫圖片提示詞時
437500	439200	常會遇到一個瓶頸
439200	442533	就是我們不知道該如何描述畫面中的細節
442533	444766	像是場景該如何鋪陳
444766	447100	鏡頭視角該如何拿捏等
447100	449433	而這種需要專業知識的任務
449433	452233	其實我們也可以交給 AI 助理來代勞
452233	454700	就是把原來的技能做個改寫
454700	456366	請它在生成圖片時
456366	460233	先依據我們提供的主題自動補充更豐富的細節
460233	462966	而且修改好後要先讓我們過目
462966	465800	確認沒有問題之後才能送出
465800	467766	OK，技能修改完成後
467766	469900	我們來驗收一下成果
469900	471433	譬如我請 Claude 生成一張
471433	475166	「蘇格拉底在雅典街頭與別人辯論」的圖片
475166	477266	然後將提示詞送出
477266	479733	而這一次 Claude 並沒有直接動工
479733	481033	而是先把這個主題
481033	483666	擴展成一段內容詳盡的提示詞
483666	485366	包含了人物的神態
485366	486600	周圍的建築
486600	490000	乃至於鏡頭的焦段等全都描述得一清二楚
490000	492300	而我們看過覺得沒有什麼問題的話
492300	494200	就可以請 Claude 送出
494200	495400	於是很快地
495400	500266	一張生動地蘇格拉底辯論的場景就呈現在我們的眼前囉
500266	503433	OK，那這個技能不光可用來生成圖片
503433	506566	如果想要生成影片也沒有任何問題
506566	508900	我們一樣可以回到 FAL 的網站
508900	512266	在左側的分類中勾選 Text to Video (文字生成影片)
512266	513400	以目前來說
513400	517833	生成影片效果最出色的模型首推 Seedance 2.0
517833	522766	而旁邊的 Minimax H3 則是前幾天才剛亮相的新模型
522766	523600	除此之外
523600	527633	下面還有一個性價比很不錯的選擇是 Kling V3
527633	528666	那同樣地
528666	531200	你可以逐一進入這幾個模型的頁面
531200	533700	把它們的計價資訊拷貝下來
533700	536833	一同交給 AI 來進行分析和比較
536833	539333	等你選定好中意的主力模型之後
539333	541300	你就可以寫一段提示詞
541300	543366	請 Claude 把影片生成的功能
543366	545933	一併加入到原有的技能之中
545933	548166	而由於影片的設定參數較多
548166	550800	而且每個模型的數值都不太一樣
550800	553666	因此這邊我讓 Claude 採用一問一答的方式
553666	556033	協助我們來進行設定
556033	558066	好，我將提示詞送出
558066	559566	功能一切就緒之後
559566	561866	就可以立即來做個測試
561866	564900	例如我指定用 Kling 3.0 生成一段影片
564900	567833	讓一位穿著時尚的男子朝著鏡頭走過來
567833	570633	然後拿出一條巧克力棒咬了一口
570633	572866	接著按下 Enter 鍵送出
572866	573566	同樣地
573566	577033	Claude 會根據這個主題先進行提示詞的優化
577033	578733	我們看過沒有問題之後
578733	582033	Claude 就會開始逐一詢問影片參數的細節
582033	583800	包含影片的秒數
583800	587866	寬高比要設為多少、以及是否要生成音訊
587866	589300	全部確認完畢後
589300	592333	Claude 就會開始進行影片的生成
592333	594466	好，我們來看一下生成好的作品
604766	608200	OK，那在生成影片時有一個很常見的技巧
608200	612166	就是我們先提供一張靜態的圖片作為初始影格
612166	615300	然後請 AI 將這張圖片動起來
615300	617200	那我們來看一個例子
617200	618866	譬如這裡有一張圖片
618866	622566	是一名女子將臉頰貼在一條巨大的飛龍頭上
622566	625966	而我想讓 AI 延伸出後續的畫面
625966	626766	同樣地
626766	629233	我們要先把這張圖片做個拷貝
629233	631233	進入到「參考圖」資料夾
631233	633800	按下 Ctrl +V 來將它貼上
633800	637366	然後我們再回到 Claude 的介面來撰寫提示詞
637366	640566	譬如這一次我改用 Minimax H3 的模型
640566	644100	讓女子抬起頭跟飛龍一同看向相機的鏡頭
644100	646266	並且將鏡頭逐漸拉遠
646266	648500	然後按下 Enter 鍵送出
648500	651800	那 Claude 同樣會先替我們優化提示詞的內容
651800	653933	來擴展影片中的細節
653933	657033	接著再向我們逐一確認影片的各項參數
657033	658966	包含長度要設為幾秒
658966	661233	解析度要設為多高
661233	662200	確認完畢後
662200	664933	Claude 就開始執行影片生成的任務
664933	666433	於是片刻之後
666433	669733	一段充滿史詩感的奇幻短片就成功產生囉
673266	677733	OK，最後如果你想讓生成圖片和影片的流程更加順手
677733	679866	我們甚至還可以更進一步
679866	683633	請 Claude 把這個技能改造成一個桌面版的 App
683633	685666	由於這是一個比較大的任務
685666	688900	所以你可以把 Claude 先切換成「計畫」(Plan) 模式
688900	692566	接著再來描述我們心目中理想的 App 樣貌
692566	694766	像是視窗版面的布局
694766	697233	想要走什麼樣的設計風格
697233	700033	面板內應該有哪些欄位和按鈕
700033	703133	以及生成好的作品要如何呈現和管理等
703133	705000	把這些想法送出之後
705000	706600	Claude 會詢問我們一些問題
706600	708700	來確認實作的細節
708700	711366	如果你對於技術層面的術語不太熟悉
711366	714300	可以直接採用它給的建議就 OK 了
714300	716066	細節都確認完畢之後
716066	718866	Claude 會先寫一份計畫的提案
718866	720800	看過之後如果沒有問題
720800	723466	Claude 就會開始著手實作
723466	725966	好，那 App 目前已製作完成
725966	729100	我們可以把它打開實際來測試一下
729100	731066	首先 API 金鑰的部分
731066	733000	你只要打開「設定」對話框
733000	736666	就能把金鑰貼到欄位裡面來做妥善的保存
736666	738400	而在介面的左上角
738400	741866	我們可以自由切換「圖片」和「影片」兩個分頁
741866	744400	至於要使用哪一個 AI 模型
744400	747500	則可透過底下的下拉選單來做挑選
747500	750666	由於這個 App 目前還缺少一個專屬的圖示
750666	752833	所以我們不妨藉著這個機會
752833	754700	讓 App 自己來生成
754700	757500	例如我想要生成一個抽象幾何風格
757500	760033	帶有圓角造型的白色圖示
760033	762433	寬高比的話可以設成 1:1
762433	764633	然後按下「生成」按鈕
764633	766166	圖示生成完畢後
766166	768600	我們就把它儲存到電腦資料夾
768600	770933	並且將它命名為 Icon
770933	772533	那最後我們就讓 Claude
772533	775700	把這個 App 的外觀套用剛製作好的圖示
775700	779133	並且將 App 安裝到「應用程式」資料夾
779133	779900	如此一來
779900	782833	之後當我們想要生成圖片或影片的時候
782833	785866	只要在電腦內打開這個 App 就能立即使用
785866	788166	是不是非常地方便呢？
788166	792000	OK，那今天關於 Claude 生成圖片和影片技能的介紹
792000	793433	我們就聊到這邊
793433	795100	我們下回再見
795100	796000	拜拜
