嗨,大家好 平常如果我們想要用 AI 來生成圖片或影片 最常見的方式就是訂閱各種線上的 AI 平台 不過這些服務每個月可能都要固定支付 10 至 15 美元以上 部分進階的方案甚至更貴 這對於只是偶爾使用 或是單純想要體驗 AI 創作的用戶來說 是一個不小的負擔 因此今天我要向大家介紹一個更具彈性的方式 就是在自己的 AI 助理 像是 ChatGPT 或 Claude 安裝一個 Skill (技能) 讓 AI 助理能以非常低廉的成本來生成圖片和影片 不需要綁定任何的訂閱方案 好,那這邊我們首先要下載 Claude 或 ChatGPT 的桌面版軟體 因為後續我們需要讓 AI 助理讀取參考圖片 並且將生成好的檔案儲存到指定的位置 而如果你習慣使用 ChatGPT 你也可以在它的官網首頁來下載它的桌面版軟體 好,那我以 Claude 為例 下載並安裝完成後 你可以直接把桌面版的軟體打開 而這邊我們需要在電腦中 先建立一個專案資料夾 你可以隨意找一個位置 利用滑鼠右鍵執行「新增」 並取一個自己容易記住的名字 建立好後 我們對著資料夾雙擊滑鼠左鍵來將它打開 並且重複剛才的步驟 另外建立兩個資料夾 分別是「完成檔」和「參考圖」 之後我們會使用到 資料夾準備好之後 你就可以回到桌面版的軟體 來將目前的專案指定到剛建立的資料夾 點擊「打開」 再按下「信任此工作區」 而如果你使用的是 ChatGPT 方式也大同小異 你只要把來源資料夾 同樣指定到剛才的位置就 OK 了 好,那接下來我們要來到一個叫做 FAL 的平台 它的優點是提供的 AI 模型非常地多 且計費方式非常地透明 你可以用自己的 Gmail 信箱先註冊一個帳號 登入之後 我們要取得一個叫做 API Key 的金鑰 系統會使用這把金鑰來辨識你是哪一位使用者 好,所以我們到右上角點擊「新增金鑰」 點擊「建立」 然後你就可以把螢幕上顯示的金鑰密碼拷貝下來 妥善保存在自己的電腦 那 FAL 不需要你支付固定的月費 而是按照你實際生成的圖片數量來計算費用 因此我們必須先綁定一張信用卡 綁定完成後 切換到 Credits 的頁面 那一開始其實不需要儲值太多 你可以等熟悉操作之後 再視自己的需求來增加額度 而要查看 FAL 有提供哪些 AI 模型 你可以到左上角點擊「探索」(Explore) 如此你就能在頁面左側看到所有的模型分類 例如 Text to Image 就是所謂的「由文字生成圖片」 那目前「文生圖」的 AI 模型 其中最受歡迎的一個 是由 Google 推出的 Nano Banana 2 那這個頁面有提供了一個簡單的範例 左側的 Prompt 欄位是這張圖使用的提示詞 然後下面有一個寬高比的下拉選單 再下來是影像的解析度 而在旁邊有一個進階設定的按鈕 你可以在這個區塊指定生成圖片的數量 以及圖檔要採用哪一種儲存格式 最後在右欄有一項很重要的資訊 就是在使用 Nano Banana 2 的時候 費用是如何計算的 你可以把這些資訊做個拷貝 來跟其它 AI 模型做個比較 譬如目前另一個很熱門的 AI 模型是 GPT Image 2 你可以進入它的頁面之後 同樣找到它的計價方式 把它拷貝下來 然後我們就可以在 ChatGPT 把兩個模型的價目表貼上去 請它來做個分析 看看哪個比較划算 好,那分析的結果 ChatGPT 認為使用 Nano Banana 2 來生成圖片會比較省錢 所以我打算把它當成主力的模型 接著再回到 FAL 的官網 將 Nano Banana 2 的模型 ID 做個複製 那這邊有個要注意的地方 就是 FAL 提醒我們 一個模型可能會使用不同的接口 (Endpoints) 來執行不同的任務 以 Nano Banana 來說 它有兩個接口 一個是「文字生成圖片」 而另一個是「修改現有的圖片」 至於 GPT Image 2 這邊也是一樣的 總共有兩個不同的接口 好,取得了 API 金鑰和模型的 ID 之後 我們可以回到 Claude 準備來建立一個 Skill (技能) 所謂「技能」 你可以把它當成是一個讓 AI 助理閱讀的操作手冊 讓它知道在執行任務時要遵守哪些要點 舉例來說 我們可以告訴 Claude 只要我們請它生成或編輯圖片 就要啟用這個技能 使用的模型包含了 Nano Banana 2 和 GPT Image 2 同時要提醒它必須依照任務的類型 來選擇正確的接口 那這邊還有一點要特別注意 就是我們剛才取得的 API 金鑰不要直接貼給 Claude 因為這有可能會讓金鑰 隨著對話內容一同曝光到網路上 比較合適的做法 是把這類型的機密資訊 儲存在一個叫做 .env 的檔案 讓程式在執行時自動讀取 那最後我們也要在提示詞中說明 如果生成的任務需要用到參考圖 AI 助理可以到「參考圖」資料夾內來存取這些檔案 至於生成好的圖片則統一放到「完成檔」資料夾 並且以模型名稱加上日期時間來作為檔名 好,那我把這個提示詞貼到輸入框內 並且按下 Enter 鍵送出 Claude 有可能會在建立技能的過程中 向我們詢問一些問題 你可以依照自己的需求來進行作答 也可以直接採用它提供的建議 等技能建立完成後 你就可以打開 Claude 替我們準備好的 .env 檔案 讓它顯示在電腦的資料夾內 接著再將這個檔案使用一般的記事本開啟 來把先前我們取得的 API 金鑰貼到指定的位置 最後再按下 Ctrl +S 執行儲存 好,那我們就來測試一下建立好的技能吧 我請 Claude 生成一張圖片 主題是一個在古羅馬競技場奮戰的角鬥士 然後將提示詞送出 過程中如果跳出授權的對話框 就直接按下「允許」 於是過了一會兒之後 一張手持劍盾的角鬥士圖片就生成完畢了 而且圖片也已自動儲存到先前我們指定的資料夾 OK,那接著我們來試試看 讓 AI 修改現有的圖片 舉例來說 這裡我有一張獅子的圖片 我想要讓牠穿上一套金色的鎧甲 而要讓 Claude 能取得這張圖片 我們必須先把圖檔拷貝起來 進入到專案中的「參考圖」資料夾 然後按下 Ctrl +V 來將圖檔貼上 參考圖放到定位之後 你可以回到 Claude 來撰寫生成圖片的提示詞 如有需要 你甚至可以請 Claude 使用不同的模型各生成一張圖片 方便我們對照兩個模型輸出圖片的風格特色 好,我們將提示詞送出 稍待片刻後 Claude 便回傳了兩張生成好的獅子圖片 甚至還貼心說明了兩個作品在細節上的差異喔 好,當我們在撰寫圖片提示詞時 常會遇到一個瓶頸 就是我們不知道該如何描述畫面中的細節 像是場景該如何鋪陳 鏡頭視角該如何拿捏等 而這種需要專業知識的任務 其實我們也可以交給 AI 助理來代勞 就是把原來的技能做個改寫 請它在生成圖片時 先依據我們提供的主題自動補充更豐富的細節 而且修改好後要先讓我們過目 確認沒有問題之後才能送出 OK,技能修改完成後 我們來驗收一下成果 譬如我請 Claude 生成一張 「蘇格拉底在雅典街頭與別人辯論」的圖片 然後將提示詞送出 而這一次 Claude 並沒有直接動工 而是先把這個主題 擴展成一段內容詳盡的提示詞 包含了人物的神態 周圍的建築 乃至於鏡頭的焦段等全都描述得一清二楚 而我們看過覺得沒有什麼問題的話 就可以請 Claude 送出 於是很快地 一張生動地蘇格拉底辯論的場景就呈現在我們的眼前囉 OK,那這個技能不光可用來生成圖片 如果想要生成影片也沒有任何問題 我們一樣可以回到 FAL 的網站 在左側的分類中勾選 Text to Video (文字生成影片) 以目前來說 生成影片效果最出色的模型首推 Seedance 2.0 而旁邊的 Minimax H3 則是前幾天才剛亮相的新模型 除此之外 下面還有一個性價比很不錯的選擇是 Kling V3 那同樣地 你可以逐一進入這幾個模型的頁面 把它們的計價資訊拷貝下來 一同交給 AI 來進行分析和比較 等你選定好中意的主力模型之後 你就可以寫一段提示詞 請 Claude 把影片生成的功能 一併加入到原有的技能之中 而由於影片的設定參數較多 而且每個模型的數值都不太一樣 因此這邊我讓 Claude 採用一問一答的方式 協助我們來進行設定 好,我將提示詞送出 功能一切就緒之後 就可以立即來做個測試 例如我指定用 Kling 3.0 生成一段影片 讓一位穿著時尚的男子朝著鏡頭走過來 然後拿出一條巧克力棒咬了一口 接著按下 Enter 鍵送出 同樣地 Claude 會根據這個主題先進行提示詞的優化 我們看過沒有問題之後 Claude 就會開始逐一詢問影片參數的細節 包含影片的秒數 寬高比要設為多少、以及是否要生成音訊 全部確認完畢後 Claude 就會開始進行影片的生成 好,我們來看一下生成好的作品 OK,那在生成影片時有一個很常見的技巧 就是我們先提供一張靜態的圖片作為初始影格 然後請 AI 將這張圖片動起來 那我們來看一個例子 譬如這裡有一張圖片 是一名女子將臉頰貼在一條巨大的飛龍頭上 而我想讓 AI 延伸出後續的畫面 同樣地 我們要先把這張圖片做個拷貝 進入到「參考圖」資料夾 按下 Ctrl +V 來將它貼上 然後我們再回到 Claude 的介面來撰寫提示詞 譬如這一次我改用 Minimax H3 的模型 讓女子抬起頭跟飛龍一同看向相機的鏡頭 並且將鏡頭逐漸拉遠 然後按下 Enter 鍵送出 那 Claude 同樣會先替我們優化提示詞的內容 來擴展影片中的細節 接著再向我們逐一確認影片的各項參數 包含長度要設為幾秒 解析度要設為多高 確認完畢後 Claude 就開始執行影片生成的任務 於是片刻之後 一段充滿史詩感的奇幻短片就成功產生囉 OK,最後如果你想讓生成圖片和影片的流程更加順手 我們甚至還可以更進一步 請 Claude 把這個技能改造成一個桌面版的 App 由於這是一個比較大的任務 所以你可以把 Claude 先切換成「計畫」(Plan) 模式 接著再來描述我們心目中理想的 App 樣貌 像是視窗版面的布局 想要走什麼樣的設計風格 面板內應該有哪些欄位和按鈕 以及生成好的作品要如何呈現和管理等 把這些想法送出之後 Claude 會詢問我們一些問題 來確認實作的細節 如果你對於技術層面的術語不太熟悉 可以直接採用它給的建議就 OK 了 細節都確認完畢之後 Claude 會先寫一份計畫的提案 看過之後如果沒有問題 Claude 就會開始著手實作 好,那 App 目前已製作完成 我們可以把它打開實際來測試一下 首先 API 金鑰的部分 你只要打開「設定」對話框 就能把金鑰貼到欄位裡面來做妥善的保存 而在介面的左上角 我們可以自由切換「圖片」和「影片」兩個分頁 至於要使用哪一個 AI 模型 則可透過底下的下拉選單來做挑選 由於這個 App 目前還缺少一個專屬的圖示 所以我們不妨藉著這個機會 讓 App 自己來生成 例如我想要生成一個抽象幾何風格 帶有圓角造型的白色圖示 寬高比的話可以設成 1:1 然後按下「生成」按鈕 圖示生成完畢後 我們就把它儲存到電腦資料夾 並且將它命名為 Icon 那最後我們就讓 Claude 把這個 App 的外觀套用剛製作好的圖示 並且將 App 安裝到「應用程式」資料夾 如此一來 之後當我們想要生成圖片或影片的時候 只要在電腦內打開這個 App 就能立即使用 是不是非常地方便呢? OK,那今天關於 Claude 生成圖片和影片技能的介紹 我們就聊到這邊 我們下回再見 拜拜