# 影片筆記:我用一個 Claude Skill (技能) 省下了所有生成圖片和影片的訂閱費用!每個月現省上千元! ## 一句話總結 影片介紹如何在本地電腦的桌面版 AI 助理(如 Claude 或 ChatGPT)中安裝「Skill(技能)」,並串接 FAL 平台的 API,透過極低廉的按量計費方式,取代昂貴的月度訂閱方案,實現低成本生成圖片與影片,甚至可進一步封裝為專屬桌面 App。 ## 核心重點 1. **成本優勢**:傳統 AI 圖片/影片服務需每月支付 10-15 美元以上進階方案費用,本方法採用 FAL 平台 API 按實際生成數量計費,無需固定月費,適合偶爾使用者。 2. **本地化操作**:利用桌面版 AI 助理(Claude/ChatGPT)的「Skill」功能,將操作邏輯、模型選擇、路徑指引編寫為操作手冊,實現本地化低成本生成。 3. **流程自動化**:透過建立專案資料夾結構(完成檔、參考圖)、設定 `.env` 檔案儲存 API Key,並撰寫提示詞讓 AI 自動執行生成、儲存與命名流程。 4. **功能擴展**:不僅支援文生圖(Text to Image)與圖生圖(Image Modification),還擴展至文生影片(Text to Video)及靜態圖轉動態影片,並可封裝為具備圖示與分頁功能的桌面 App。 ## 詳細大綱 ### 一、 背景與解決方案概述 * **現狀痛點**:常見 AI 圖片/影片生成服務需每月支付 10-15 美元以上進階方案費用,對偶爾使用者負擔較重。 * **解決方案**:在本地 AI 助理(Claude 或 ChatGPT)安裝 Skill(技能),以極低成本生成內容,無需綁定訂閱方案。 ### 二、 環境準備與專案設定 * **軟體下載**:下載並安裝 Claude 或 ChatGPT 的桌面版軟體(需支援讀取參考圖片及儲存檔案至指定位置)。 * **資料夾結構建立**: * 建立專案資料夾。 * 專案內建立兩個子資料夾: * 「完成檔」:儲存生成好的檔案。 * 「參考圖」:存放用於生成或修改的參考圖片。 * **專案指定**:在桌面版軟體中開啟專案資料夾,並點擊「信任此工作區」(ChatGPT 則為指定來源資料夾)。 ### 三、 FAL 平台設定與模型比較 * **FAL 平台介紹**:提供多種 AI 模型,計費透明,按實際生成數量計費,無需固定月費。 * **帳號與金鑰設定**: * 使用 Gmail 註冊帳號。 * 建立並複製 API Key(用於辨識使用者身份)。 * 繫結信用卡以支付費用。 * 初期不需大量儲值,熟悉操作後再視需求增加額度。 * **模型探索與比較**: * 透過「探索」(Explore) 查看模型分類(如 Text to Image)。 * **模型對比**: * **Nano Banana 2**:Google 推出的熱門文生圖模型。 * **GPT Image 2**:另一個熱門模型。 * **計費分析**:複製模型頁面中的計價方式,交由 ChatGPT 分析比較哪個模型更划算。 * **結論**:ChatGPT 分析認為使用 Nano Banana 2 生成圖片較省錢,故選定為主模型。 * **模型介面 (Endpoints) 注意**: * 同一模型可能有多個介面執行不同任務(例如:文字生成圖片、修改現有圖片)。 * 需複製對應任務的模型 ID。 ### 四、 建立 Claude Skill(技能) * **技能定義**:作為 AI 助理的操作手冊,規範執行任務時的要點。 * **技能內容設定**: * 觸發條件:當請求生成或編輯圖片時啟用。 * 指定模型:包含 Nano Banana 2 和 GPT Image 2。 * 介面選擇:依據任務類型選擇正確介面。 * **機密資訊處理**:API Key 不應直接貼在提示詞中,應儲存於 `.env` 檔案讓程式自動讀取。 * **路徑指引**:提示詞需說明參考圖存放於「參考圖」資料夾,生成檔案存放於「完成檔」資料夾,檔名格式為「模型名稱+日期時間」。 * **技能建立流程**: * 將提示詞貼入輸入框送出。 * 依 Claude 詢問回答或採用建議。 * 建立 `.env` 檔案,將 API Key 貼入並儲存。 ### 五、 圖片生成與修改測試 * **生成圖片測試**: * 範例:生成「古羅馬競技場奮戰的角鬥士」。 * 過程:送出提示詞 -> 授權對話方塊點擊「允許」 -> 生成完成並自動儲存至指定資料夾。 * **修改現有圖片測試**: * 範例:將獅子圖片修改為穿著金色鎧甲。 * 操作:將參考圖複製至「參考圖」資料夾。 * 進階功能:可請 Claude 使用不同模型各生成一張,對照風格差異。 * **提示詞優化技能**: * 針對不擅長描述細節(場景、鏡頭視角)的使用者。 * 改寫技能:請 AI 先依據主題自動補充豐富細節,經使用者確認無誤後再送出生成。 * 範例:生成「蘇格拉底在雅典街頭辯論」,AI 先擴展提示詞(包含神態、建築、焦段等),確認後生成。 ### 六、 影片生成功能擴展 * **FAL 影片模型選擇**: * 分類:Text to Video (文字生成影片)。 * 推薦模型: * **Seedance 2.0**:目前效果最出色。 * **Minimax H3**:新亮相模型。 * **Kling V3**:價效比不錯。 * 操作:複製各模型計價資訊,交由 AI 分析比較後選定主力模型。 * **技能擴展**: * 撰寫提示詞將影片生成功能加入原有技能。 * 由於參數複雜,建議採用一問一答方式協助設定。 * **影片生成測試**: * 範例:使用 Kling 3.0 生成「穿著時尚男子吃巧克力棒」影片。 * 流程:提示詞優化 -> 確認參數(秒數、寬高比、音訊) -> 生成。 * **靜態圖轉動態影片技巧**: * 提供靜態圖片作為初始影格,請 AI 延伸後續畫面。 * 範例:使用 MiniMax H3,將「女子貼臉飛龍」圖片動起來,鏡頭拉遠。 * 流程:參考圖放入「參考圖」資料夾 -> 撰寫提示詞 -> AI 優化提示詞 -> 確認參數 -> 生成史詩感奇幻短片。 ### 七、 進階:封裝為桌面 App * **目標**:將生成流程順手化,打造專屬桌面 App。 * **實作流程**: * 切換 Claude 至「計畫」(Plan) 模式。 * 描述理想 App 樣貌:視窗佈局、設計風格、欄位按鈕、作品呈現方式。 * Claude 詢問實作細節 -> 撰寫計畫提案 -> 實作。 * **App 功能與測試**: * **設定**:在「設定」對話方塊儲存 API 金鑰。 * **介面**:左上角切換「圖片」與「影片」分頁;底部下拉選單挑選模型。 * **圖示生成**: * 請 App 生成專屬圖示(例如:抽象幾何風格、圓角白色圖示,寬高比 1:1)。 * 儲存為 Icon 並命名。 * **安裝**:套用圖示並安裝至「應用程式」資料夾。 * **使用**:開啟 App 即可立即使用,無需額外操作。 ## 工具 / 模型 / 名詞整理 * **AI 助理/軟體**: * Claude (桌面版) * ChatGPT (桌面版) * **AI 模型 (來自 FAL 平台)**: * Nano Banana 2 (Google 推出,用於文生圖) * GPT Image 2 (用於文生圖) * Seedance 2.0 (用於文字生成影片) * Minimax H3 (用於文字生成影片) * Kling V3 / Kling 3.0 (用於文字生成影片) * **平台與服務**: * FAL (AI 模型提供平台,提供 API Key 與計費服務) * **技術元件/檔案格式**: * API Key (應用程式介面金鑰) * .env (環境變數檔案,用於儲存機密資訊) * Skill (技能/操作手冊) * Endpoints (介面/端點) * Prompt (提示詞) * Icon (圖示檔案) ## 操作流程整理 1. **環境建置**: * 安裝桌面版 Claude 或 ChatGPT。 * 建立專案資料夾,內含「完成檔」與「參考圖」子資料夾。 * 在軟體中開啟專案並點擊「信任此工作區」。 2. **FAL 平台設定**: * 使用 Gmail 註冊 FAL 帳號並繫結信用卡。 * 建立 API Key 並複製。 * 在 FAL 平台「探索」中查找模型,複製目標模型的計價資訊與 Model ID (Endpoints)。 3. **建立 Skill (技能)**: * 撰寫提示詞,定義觸發條件、指定模型(如 Nano Banana 2)、選擇正確 Endpoints。 * 建立 `.env` 檔案,將 API Key 存入,確保提示詞中不直接暴露金鑰。 * 將提示詞與 `.env` 設定導入 Claude 技能系統。 4. **執行生成任務**: * **圖片生成**:輸入提示詞 -> AI 呼叫 API -> 點擊允許 -> 檔案自動儲存至「完成檔」。 * **圖片修改**:將參考圖放入「參考圖」資料夾 -> 輸入修改指令 -> AI 呼叫 API -> 儲存結果。 * **提示詞優化**:若描述簡略,AI 會先擴展細節(場景、鏡頭等),經確認後再執行生成。 * **影片生成**:選擇影片模型(如 Kling 3.0)-> 確認參數(秒數、比例、音訊)-> 生成。 * **圖轉影片**:將靜態圖放入「參考圖」-> 指令讓 AI 延伸動態 -> 生成影片。 5. **進階:封裝桌面 App (可選)**: * 切換 Claude 至「計畫」模式。 * 描述 App 介面需求(分頁、下拉選單、設定欄位)。 * 由 Claude 生成程式碼與圖示。 * 安裝圖示至應用程式資料夾,完成專屬 App 建置。 ## 值得注意的限制或風險 * **模型名稱準確性**:影片中提及的模型名稱(如 Nano Banana 2, GPT Image 2, Seedance 2.0, Minimax H3)需查證是否為實際存在的官方名稱,可能存在聽寫錯誤或暱稱。 * **API 計費與信用卡綁定**:需綁定信用卡支付費用,初期雖不需大量儲值,但仍需留意帳戶餘額與扣款情況。 * **本地軟體依賴**:此方法依賴桌面版 Claude 或 ChatGPT 的特定功能(如讀取參考圖、儲存檔案、Skill 支援),需確保軟體版本支援這些功能。 * **技能維護**:若 FAL 平台更新模型 ID 或計費方式,需手動更新 Skill 中的提示詞與 Endpoints。 ## 逐字稿辨識疑點 * **Nano Banana 2**:逐字稿中多次提及此模型名稱,並註明為 Google 推出。此名稱與常見之 Google 模型(如 Imagen, Gemini, Nano Banana 非標準名稱)不符,疑為聽寫錯誤或特定模型暱稱,需查證。 * **Kling 3.0**:逐字稿中先提及「Kling V3」,後測試時提及「Kling 3.0」,版本編號格式不一致,需查證。 * **GPT Image 2**:逐字稿中提及此模型名稱,需查證是否為實際存在的模型名稱或口誤。 * **Seedance 2.0**:逐字稿中提及此模型名稱,需查證是否為實際存在的模型名稱或口誤。 * **Minimax H3**:逐字稿中提及此模型名稱,需查證是否為實際存在的模型名稱或口誤。 * **FAL 平台**:逐字稿中提及此平台名稱,需查證是否為實際存在的平台名稱或口誤。 ## 可延伸追問 * FAL 平台目前支援的所有模型列表及最新計費標準為何? * 若使用 ChatGPT 桌面版,其 Skill 功能與 Claude 桌面版在操作上有哪些具體差異? * 如何確保 `.env` 檔案的安全性,避免 API Key 洩露? * 若生成的圖片或影片不符合預期,有哪些常見的調整策略(如調整提示詞權重、更換模型)? * 將流程封裝為桌面 App 後,若 FAL 平台 API 發生變更,App 是否需要重新編譯或更新?