# 影片筆記:最强 AI 图片模型来了!Ideogram 4 正式开源,媲美 GPT-Image / Midjourney,支持本地部署!| 零度解说 ## 一句話總結 影片介紹了被稱為「Elden Ground 4」的開源 AI 圖片生成模型,宣稱其性能媲美 GPT-Image 與 Midjourney,並詳細演示了如何在本地電腦安裝 ConfiUI 客戶端及配置模型權重,實測顯示其生成速度快、真實感強,但中文文字渲染仍有瑕疵,建議使用英文提示詞。 ## 核心重點 1. **模型發布與定位**:官方正式開源了名為 **Elden Ground 4** 的圖片生成模型,並直接提供模型權重下載。該模型被宣稱為目前最接近 GPT-Image 和 Midjourney 的開源模型,且在開源領域佔據絕對優勢。 2. **技術規格與優勢**: * 參數量為 9.3B(90 億)。 * 提供兩種精度版本:NF4 精度全重量化版(針對 N 卡)和 FP8 精度版(通用硬件)。 * 核心賣點為完全本地部署、人人可安裝,以及極佳的文本渲染效果。 * 宣稱在參數量較少的情况下,性能超越了參數量更大的「輕微 Image」(200億)、「Flash 2」(321億)及「回源 Image 數類」(800億)。 3. **本地部署流程**: * 需下載五個核心模型文件(主模型、擴散模型、WMIMI 編碼器等)。 * 安裝最新版本的 **ConfiUI** 客戶端(疑為 ComfyUI)。 * 配置 GPU 環境(自動檢測 N 卡或 A 卡),建議使用獨立版本。 * 需手動將模型文件放入指定路徑(如 AppData 下的 Combi以外資料夾)。 4. **實測表現**: * **速度**:在 24G 顯存下,生成一張圖片約需 5 秒。 * **質量**:在真實風格、動漫卡通、廣告圖生成上表現優異,細節豐富,自然度高。 * **限制**:中文文字渲染存在錯誤(如錯別字),模型對英文理解優於中文,建議使用英文提示詞以獲得最佳效果。 ## 詳細大綱 ### 一、 模型介紹與市場定位 * **名稱**:Elden Ground 4。 * **競爭對標**: * 宣稱最接近閉源模型 GPT-Image 和 Midginal(疑為 Midjourney)。 * 在所有開源圖片模型中佔據絕對優勢。 * **部署特性**:支持完全本地部署,無需雲端,人人可安裝使用。 * **版本區別**: 1. **NF4 精度全重量化版**:主要針對 NVIDIA 顯卡,支持擴張。 2. **FP8 精度版**:可在任何硬件上部署運行。 * **性能對比數據**: * 文本渲染效果最佳。 * 超越 200 億參數的「輕微 Image」。 * 超越 321 億參數的「Flash 2」。 * 超越 800 億參數量的「回源 Image 數類」。 ### 二、 本地部署安裝步驟 * **前置準備**: * 訪問官方文章下載資料(鏈接在視頻下方)。 * 下載五個模型文件:主模型、擴散模型、WMIMI 編碼器等(官方提供打包下載)。 * **安裝 ConfiUI 客戶端**: * 下載並安裝最新版本(約 150MB)。 * 老版本用戶需升級或覆蓋安裝。 * 安裝選項:選擇「本地運行」(非雲端)。 * 協議勾選:通義它俠款協議(可選勾選匿名數據分享)。 * 鏡像設置:建議中國大陸用戶啟用中國鏡像加速下載,避免翻牆;非大陸用戶可跳過。 * 配置細節: * 名稱:可自定義(如「零度」)。 * GPU 識別:自動檢測 N 卡或 A 卡。 * 安裝位置:默認 C 盤,可自定義。 * 高級選項:推薦安裝獨立版本(V0.i6.i 版本),選擇 N 卡或 CPU(CPU 速度較慢)。 * **工作流與依賴**: * 安裝過程中會詢問是否導入工作流(ZImageTourable 或 One 2.1),選擇跳過並安裝。 * 下載工作流文件(約 2GB)。 * 將工作流拖入 Combia2 客戶端(疑為 ComfyUI)。 ### 三、 模型文件配置與路徑 * **缺失模型處理**: * 客戶端提示缺少四個索引模型。 * 方法一:點擊「全部下載」按鈕在線下載(需科學上網,否則可能失敗)。 * 方法二:手動將第一步下載的五個模型文件放入對應文件夾。 * **手動放置路徑(Windows)**: * 路徑:C 盤 -> 用戶文件夾 -> [用戶名] -> 顯示隱藏項目 -> AppData -> Local -> Combi以外(疑為 ComfyUI) -> desktop -> modus -> 對應文件夾。 * 將模型文件按路徑位置放入對應文件夾。 ### 四、 實測與效果評估 * **基本操作**: * 設置寬高比(如 9:16, 16:9, 21:9)。 * 輸入提示詞並點擊運行。 * 生成速度:24G 顯存下,生成一張圖片約需 5 秒。 * **測試場景與結果**: 1. **魔法提示詞測試**: * 效果真實,細節豐富。 * 建議優化提示詞,避免關鍵詞直接明碩(疑為「明顯」或「暴露」)。 2. **動漫卡通測試**: * 功夫熊魔力的 Panda:效果與動畫片相似,一次搞定。 * 卡通式狗狗:測試成功。 3. **中文提示詞測試**: * 場景一:夜色下泡溫泉的人。 * 效果:色彩比例、打光角度、天空繁星、環境細節非常真實,像真能拍攝。 * 場景二:雪原森林中的神級天氣瓶。 * 效果:玻璃球雪花晶片、雪地反射陽光設計微妙好看。 4. **文字渲染測試(缺點)**: * 場景:西紅薯炒雞蛋步驟圖。 * 問題:第三步和第四步的中文字體出現錯誤(錯別字)。 * 結論:模型對英文理解較好,對中文製作稍缺火候。 5. **廣告圖測試**: * 場景:高端大氣的廣告圖。 * 效果:耐燒、中意且大氣。 * **總結建議**: * 相比之前模型,速度更快,圖片更自然、真實。 * 適合插畫、動畫設計、產品設計圖生成。 * **關鍵建議**:使用英文提示詞效果優於中文提示詞(與模型訓練數據有關)。 * 資料下載鏈接將放在視頻下方。 ## 工具 / 模型 / 名詞整理 * **Elden Ground 4**:影片宣稱的最強圖片生成模型,官方開源。 * **GPT Image**:被比較的閉源圖片生成模型。 * **Midginal**:被比較的閉源圖片生成模型(疑為 Midjourney 之誤聽)。 * **輕微 Image**:200 億參數的開源模型(疑為 Midjourney 或 Stable Diffusion 變體之誤聽)。 * **Flash 2**:321 億參數的開源模型。 * **回源 Image 數類**:800 億參數量的開源模型(疑為 Stable Diffusion XL 或類似大型模型之誤聽)。 * **ConfiUI / Combia2 客戶端**:影片提及的圖片生成客戶端軟件(極大機率為 **ComfyUI** 的聽寫錯誤)。 * **ZImageTourable**:工作流名稱。 * **One 2.1**:工作流名稱。 * **GateHUB**:部署平台名稱(疑為 Hugging Face 或 GitHub 之誤聽)。 * **通義它俠款協議**:安裝過程中出現的協議名稱(疑為「通義千問」或特定開源協議之誤聽)。 * **WMIMI 編碼器**:模型組件之一。 * **NF4 精度全重量化版**:針對 N 卡的模型版本。 * **FP8 精度版**:通用硬件的模型版本。 * **24G 顯存**:實測使用的顯存規格。 ## 操作流程整理 1. **下載資源**: * 訪問官方文章,下載五個核心模型文件(主模型、擴散模型、WMIMI 編碼器等)。 2. **安裝客戶端**: * 下載並安裝最新版本的 ConfiUI 客戶端(約 150MB)。 * 選擇「本地運行」,勾選協議,設置鏡像(大陸用戶建議啟用中國鏡像)。 * 配置 GPU 識別(N 卡或 A 卡)及安裝路徑。 * 選擇高級選項中的獨立版本(V0.i6.i)。 3. **配置工作流**: * 跳過安裝過程中的工作流導入詢問。 * 下載約 2GB 的工作流文件。 * 將工作流拖入 Combia2 客戶端。 4. **處理缺失模型**: * 若客戶端提示缺少索引模型,可選擇在線下載(需科學上網)或手動放置。 * 手動放置路徑:C 盤 -> 用戶文件夾 -> [用戶名] -> 顯示隱藏項目 -> AppData -> Local -> Combi以外 -> desktop -> modus -> 對應文件夾。 * 將下載的五個模型文件按路徑放入對應文件夾。 5. **生成圖片實測**: * 設置圖片寬高比(如 9:16, 16:9)。 * 輸入提示詞(建議使用英文)。 * 點擊運行,觀察生成結果(24G 顯存下約 5 秒/張)。 ## 值得注意的限制或風險 1. **中文文字渲染能力不足**:實測顯示,在生成包含中文文字的圖片(如步驟圖)時,會出現錯別字或文字錯誤。模型對英文的理解和渲染優於中文。 2. **依賴科學上網**:若選擇在線下載缺失的索引模型,可能需要科學上網,否則下載可能失敗。 3. **硬件要求**:雖然有 FP8 版本支持通用硬件,但最佳體驗(如 24G 顯存下的速度)仍依賴較高的顯存規格。CPU 運行速度較慢。 4. **名稱辨識風險**:影片中的模型名稱(Elden Ground 4)及相關工具名稱(ConfiUI, Midginal 等)與市場常見名稱存在較大差異,可能存在辨識錯誤,實際使用時需確認對應的真實工具。 ## 逐字稿辨識疑點 * **Elden Ground 4**:音譯名稱,需查證實際模型名稱(可能為 Stable Diffusion 3 或其他新模型)。 * **Midginal**:需查證,可能為 Midjourney。 * **輕微 Image**:需查證,可能為 Midjourney 或特定模型版本。 * **回源 Image 數類**:需查證,可能為 Stable Diffusion XL (SDXL) 或其他大型模型。 * **ConfiUI / Combia2**:需查證,極大機率為 **ComfyUI**。 * **WMIMI 編碼器**:需查證,可能為 VAE 或特定編碼器名稱。 * **通義它俠款協議**:需查證,可能為「通義千問」或「知識共享協議」等。 * **GateHUB**:需查證,可能為 Hugging Face 或 GitHub。 * **V0.i6.i**:需查證,可能為 ComfyUI 的版本號(如 v0.1.6 或類似)。 * **明碩**:需查證,可能為「明顯」或「暴露」。 * **西紅薯炒雞蛋**:提示詞內容,非錯誤,但作為測試案例記錄。 * **功夫熊魔力的 Panda**:提示詞內容,非錯誤。 * **神級天氣瓶**:提示詞內容,非錯誤。 * **耐燒**:形容詞,需查證語境,可能為「耐看」或「高質量」。 * **中意**:形容詞,需查證語境,可能為「滿意」或「精緻」。 * **手用的全部資料**:口誤,應為「視頻用到的全部資料」。 * **博物贊**:口誤,應為「視頻」。 * **下車**:大量重複的無意義詞彙,可能為錄音結束後的雜音或口誤重複。 ## 可延伸追問 1. 「Elden Ground 4」的真實官方名稱是什麼?其架構是否基於 Stable Diffusion 或其他基礎模型? 2. 「ConfiUI」是否確認為 ComfyUI 的變體或特定分支?其安裝包與官方 ComfyUI 有何區別? 3. 該模型的 9.3B 參數量是如何實現超越 800 億參數量模型的?其量化技術(NF4/FP8)的具體優勢何在? 4. 針對中文文字渲染的缺陷,是否有後續的更新計劃或特定的提示詞技巧可以緩解? 5. 「輕微 Image」、「Flash 2」、「回源 Image 數類」具體對應哪些現有的開源模型?