# 影片筆記:Codex内巨好用的生图插件 | 原生体验 支持批量 傻瓜式操作 ## 一句話總結 影片介紹了一款專為 Codex API 用戶開發的開源插件「深圖」,透過本地模型輔助生成提示詞並結合 JSON 溯源機制,解決 API 用戶無法使用原生生圖功能、手機端查看圖片不便及批量生成品質下降等痛點,提供接近原生的傻瓜式操作體驗。 ## 核心重點 1. **解決 API 用戶痛點**:針對使用 API 接口調用 Codex 的用戶,解決其無法使用 Codex 原生「深圖」插件的問題。 2. **雙版本模型支持**:提供基於 Gemini 的 Nano 模型與 GPT Image 2 模型兩個版本,GitHub 開源。 3. **本地輔助與標準化請求**:利用本地模型(如 5.6 版本)理解意圖並生成嚴謹提示詞,再標準化發送請求至圖片大模型。 4. **JSON 溯源機制**:生成的圖片伴隨 JSON 文件,記錄提示詞與請求參數,方便追溯問題、減少溝通「幻覺」並進行迭代。 5. **原生體驗模擬**:圖片直接顯示在聊天框中,而非以文件形式下載,特別解決手機遠程操作時無法查看圖片的問題。 6. **批量與並發能力**:支持圖生圖、文生圖及紙張圖,支持一次請求多張圖片(如十張),提升生成效率。 7. **會員降質問題緩解**:Plus/Pro 會員若使用官方接口批量生成易出現模型降質(線條、圓球狀),此插件可提供替代方案。 ## 詳細大綱 1. **插件背景與開發動機** * API 用戶無法調用 Codex 原生深圖插件。 * 現有第三方插件或 Scale 體驗不如原生。 * 開發目標:提供幾乎與原生無區別的使用體驗。 2. **插件版本與資源** * 版本一:基於 Gemini 的 Nano 模型。 * 版本二:基於 GPT Image 2 模型。 * 資源:GitHub 開源,可下載安裝。 3. **安裝步驟** * 進入 Codex 左上角插件選項。 * 點擊「創建」->「添加插件市場」。 * 粘貼 GitHub 地址並添加市場。 * 在「個人」標籤頁中找到並安裝插件。 4. **工作流程與邏輯** * **第一步**:使用本地當前模型(如 5.6 版本)理解用戶意圖。 * **第二步**:本地模型整理出嚴謹的目標圖片提示詞。 * **第三步**:插件標準化發送請求至圖片大模型。 * **第四步**:獲取圖片並自動保存至 C 盤 Codex 目錄,同時保存相關提示詞與 JSON 文件。 5. **實測演示(車輛漂移場景)** * **初始測試**:僅更換背景,未改變結構。 * **優化提示詞**:要求不同角度、場景、拍攝手法,生成十張圖片,質量不錯。 * **調整構圖**:指出車輛位置太刻意,要求不局限位置,重新生成。 * **處理細節**:修正倒影中的「鬼影」問題,調整車距。 * **最終效果**:實現逼真的漂移效果、人物清晰度及輪胎煙霧效果。 * **模型對比**:GPT Image 2 在細節與風格上優於 Gemini Nano,但兩者均能達到一定成功率(約 5-7 張可用)。 6. **痛點解決與優勢** * **聊天框顯示**:圖片直接出現在對話框,無需啟動本地圖片查看工具。 * **遠程友好**:解決手機遠程 Codex 時因圖片以文件形式發送而無法查看的問題。 * **迭代效率**:通過 JSON 文件追溯上一張請求的問題,避免全靠文字溝通產生的誤解。 7. **適用對象與建議** * 主要面向使用 API 接口調用 Codex 的用戶。 * Plus/Pro 會員若使用官方接口,批量生成時易出現模型降質(線條、圓球狀),可嘗試此插件。 * 可在 Codex 自定義指令中要求調用該插件。 ## 工具 / 模型 / 名詞整理 * **Codex**:對話式 AI 工具/平台。 * **深圖插件**:影片介紹的專用插件(疑似為「生圖」之聽寫)。 * **API 接口**:應用程序編程接口。 * **Scale**:被提及的現有插件類型。 * **GitHub**:開源代碼托管平台。 * **Gimini**:Google 的 AI 模型系列(逐字稿拼寫,疑為 Gemini)。 * **Nano**:Gimini 的特定模型版本。 * **GPT ImageR** / **GPT Image 2**:OpenAI 的圖片生成模型(逐字稿中出現 ImageR 及 Image 2 兩種稱呼)。 * **5.6**:指代本地使用的模型版本號。 * **C 盤**:Windows 系統磁盤。 * **Jason**:逐字稿中對 JSON 格式的聽寫錯誤。 * **Plus 會員**:Codex 的高級訂閱層級。 * **Pro 會員**:Codex 的高級訂閱層級。 * **自定義指令**:Codex 中的個性化設置選項。 * **圖神圖** / **文神圖**:疑似為「圖生圖」、「文生圖」的聽寫錯誤。 * **模型降制**:疑似為「模型降質」的聽寫錯誤。 ## 操作流程整理 1. **安裝插件**: * 打開 Codex,點擊左上角插件選項。 * 選擇「創建」->「添加插件市場」。 * 輸入 GitHub 地址並添加市場。 * 在「個人」標籤頁中找到並安裝該插件。 2. **使用插件生成圖片**: * 在對話中輸入意圖。 * 插件調用本地模型(如 5.6 版本)理解意圖。 * 本地模型生成嚴謹的提示詞。 * 插件將提示詞標準化後發送請求至圖片大模型(Gemini Nano 或 GPT Image 2)。 * 圖片直接顯示在聊天框中。 * 系統自動保存圖片至 C 盤 Codex 目錄,並生成包含提示詞與參數的 JSON 文件。 3. **迭代與優化**: * 查看生成的圖片。 * 若效果不佳,參考 JSON 文件追溯問題。 * 通過文字溝通調整提示詞(如角度、構圖、細節)。 * 重新發送請求,支持批量生成(如一次十張)。 ## 值得注意的限制或風險 1. **聽寫辨識錯誤風險**:影片逐字稿中存在大量疑似識別錯誤的名詞(如「深圖」、「Gimini」、「Jason」、「圖神圖」等),實際操作時需確認正確名稱。 2. **模型成功率限制**:即使使用該插件,Gemini Nano 與 GPT Image 2 的成功率約為 5-7 張可用,並非 100% 完美。 3. **本地模型依賴**:工作流程依賴本地模型(如 5.6 版本)來理解意圖和生成提示詞,若本地模型能力不足可能影響最終效果。 4. **API 用戶專屬性**:主要針對使用 API 接口調用 Codex 的用戶,Plus/Pro 會員使用官方接口時仍可能遇到降質問題,此插件為替代方案而非通用解決方案。 5. **文件保存路徑**:圖片自動保存至 C 盤 Codex 目錄,需注意磁盤空間。 ## 逐字稿辨識疑點 * **Gimini**:逐字稿中多次出現,疑似為 **Gemini** 的聽寫錯誤。 * **GPT ImageR**:逐字稿中出現,疑似為 **GPT Image 2** 或 **GPT-4o** 等模型的聽寫錯誤或口誤。 * **Jason**:逐字稿中出現「請求的 Jason」,疑似為 **JSON** 格式的聽寫錯誤。 * **深圖**:逐字稿中多次使用「深圖」一詞,疑似為 **生圖**(生成圖片)的聽寫錯誤或特定術語。 * **小 DAC**:逐字稿中出現「更新一些小 DAC」,疑似為 **小 Bug** 或 **小更新** 的聽寫錯誤。 * **圖神圖** / **文神圖**:逐字稿中出現,疑似為 **圖生圖**、**文生圖** 的聽寫錯誤。 * **192M3**:逐字稿中出現「192M3 的飄逸效果」,疑似為特定車型(如 **1923** 或 **911** 等)或參數的聽寫錯誤。 * **裝筒**:逐字稿中出現「裝筒的位置」,疑似為 **車頂**、**車身** 或 **車輪** 等詞彙的聽寫錯誤。 * **模型降制**:逐字稿中出現「模型降制」,疑似為 **模型降質** 的聽寫錯誤。 * **革新化**:逐字稿中出現「革新化里由自定義指令」,疑似為 **個性化** 或 **設置** 相關詞彙的聽寫錯誤。 ## 可延伸追問 1. 該插件的 GitHub 具體地址為何? 2. 本地模型 5.6 版本具體指哪一個模型?是否需要額外安裝? 3. JSON 文件的具體結構是什麼?如何用於後續的迭代修改? 4. 對於 Plus/Pro 會員,使用此插件是否會產生額外的 API 費用? 5. 除了車輛漂移場景,該插件在其他類型圖片生成(如人像、風景)上的表現如何?