# 影片筆記:本地部署最强开源视频模型MiniMax H3,实操部署教程,再也不用担心消耗大量云端算力了! ## 一句話總結 講者「日行逆善」示範如何在本地電腦部署 MiniMax 開源的 H3 視頻模型,透過更新驅動、安裝 ComfyUI 並配置對應模型檔案,實現免費生成視頻,解決雲端算力成本高昂的問題。 ## 核心重點 * **本地部署優勢**:MiniMax H3 於 8 月 3 日開源,允許用戶在本地運行,無需消耗雲端算力(如之前使用的 Cdance 2.0),節省成本。 * **硬體門檻**:建議使用英偉達(NVIDIA)顯卡,最低配置為 RTX 3060,建議顯存 12GB 以上(8GB 可能爆顯存),記憶體建議 16GB 或更高。 * **環境搭建關鍵**: 1. 必須將英偉達顯卡驅動更新至最新版本。 2. 下載並安裝 ComfyUI 整合包(指定版本 0.30),解壓路徑不可含中文與空格。 3. 從 Model Scope 下載對應的 Diffusion Models、Text Encoders 及 VAE 模型檔案。 * **操作流程**:將模型檔案複製至 ComfyUI 對應資料夾(`Models/Diffusion Models`, `text_encoders`, `VAE`),啟動 ComfyUI 後,透過圖生視頻(Image to Video)節點上傳圖片並設定比例,即可生成視頻。 * **功能與應用**:H3 支持多模態輸入(圖片、視頻片段、音頻),具備圖生視頻、文生視頻及全能參考模式,可應用於品牌宣傳、影視短片、AI 劇情創作及電商產品宣傳。 ## 詳細大綱 ### 1. 引言與模型介紹 * MiniMax H3 於 8 月 3 日宣布開源。 * 強調本地部署的優勢:無需消耗雲端算力,解決之前使用 Cdance 2.0 算力昂貴的問題。 * 解釋為何部分模型無法本地部署(提及「B原」概念,僅開源模型可本地部署)。 ### 2. 硬體配置建議 * **GPU**:推薦英偉達顯卡,最低 RTX 3060。 * **顯存**:建議 12GB,8GB 可用但可能爆顯存,16GB 較理想。 * **記憶體**:建議 16GB 以上。 * **查看方法**:透過桌面「屬性」查看配置。 ### 3. 驅動更新 * 必須更新英偉達顯卡驅動至最新版本。 * 透過官網下載對應顯卡型號與作業系統的驅動。 * 安裝後需重新啟動電腦。 ### 4. ComfyUI 工具安裝 * 從 GitHub 官方網址下載 ComfyUI 整合包。 * **版本選擇**:0.30。 * **平台選擇**:英偉達(NVIDIA)。 * **注意事項**:解壓路徑中不可包含中文與空格。 ### 5. 模型下載與配置 * **來源**:Model Scope 官方網站。 * **模型分類**: * 前四個模型:文生視頻或圖生視頻。 * 後四個模型:全程參考視頻模型。 * **演示下載**:INT8 量化的文生/圖生視頻模型,同時下載 VAE 相關模型。 ### 6. 檔案結構部署 * 將下載的模型複製至 ComfyUI 解壓目錄下的對應資料夾: * `Models/Diffusion Models` * `text_encoders`(提及千問模型) * `VAE` * **啟動 ComfyUI**:點擊啟動文件,可創建桌面捷徑。 ### 7. 實際操作與測試 * 瀏覽器自動打開 ComfyUI 介面。 * **模板選擇**:選擇 MiniMax 圖生視頻模板。 * **節點配置**: * 上傳參考圖片(如滑鼠圖片)。 * 設定視頻比例(9:16, 4:3, 3:4 等)。 * 確認模型節點已正確載入。 * **運行測試**:點擊運行,監控任務管理器確認顯卡工作,查看控制台進度條。 * **結果**:進度達 100%,成功生成視頻。 ### 8. 功能展示與應用場景 * **多模態支持**:可上傳參考視頻片段、音頻、圖片。 * **模式**:圖生視頻、文生視頻、全能參考。 * **輸出**:音視頻同出。 * **應用案例**: * 品牌宣傳。 * 影視短片/AI 劇情創作(人物參考)。 * 短劇製作。 * 電商產品宣傳。 * 動畫類型視頻。 * **效果對比**:與 Cdance 2.0 差異不大。 ### 9. 結語與資源分享 * 提供本地部署包合集至網盤。 * 提供 H3 提示詞資料整理。 * 鼓勵觀眾本地部署並關注後續更新。 ## 工具 / 模型 / 名詞整理 * **模型名稱**: * MiniMax H3 * Cdance 2.0(提及為之前使用的雲端模型) * C-Dance 2.0(結尾提及,疑為同一模型之不同譯名或口誤) * **軟體/工具**: * ComfyUI * GitHub * Model Scope(模型下載平台) * 英偉達官網(NVIDIA Official Website) * 任務管理器(Task Manager) * 控制台(Console) * **硬體/組件**: * 英偉達顯卡(NVIDIA GPU) * RTX 3060 * RTX 4070 * 顯存(VRAM):8G, 12G, 16G * 記憶體(RAM):32G * **資料夾/路徑結構**: * `Models` * `Diffusion Models` * `text_encoders` * `VAE` * **其他專有名詞**: * INT8 量化 * 圖生視頻(Image to Video) * 文生視頻 * 全能參考 * 音視頻同出 * 多模態 ## 操作流程整理 1. **檢查與更新硬體驅動**: * 確認顯卡為英偉達(NVIDIA),建議 RTX 3060 以上,顯存 12GB+。 * 前往英偉達官網下載並安裝最新顯卡驅動。 * 重新啟動電腦。 2. **安裝 ComfyUI**: * 從 GitHub 下載 ComfyUI 整合包(版本 0.30,NVIDIA 版)。 * 解壓至不含中文與空格的路徑。 3. **下載模型檔案**: * 前往 Model Scope 網站。 * 下載 MiniMax H3 對應的模型檔案(包括 Diffusion Models、Text Encoders、VAE)。 * 若需量化版本,下載 INT8 量化模型。 4. **配置模型路徑**: * 將下載的模型檔案複製至 ComfyUI 解壓目錄下的對應資料夾: * `Models/Diffusion Models` * `text_encoders` * `VAE` 5. **啟動與運行**: * 點擊 ComfyUI 啟動文件。 * 瀏覽器打開 ComfyUI 介面。 * 選擇 MiniMax 圖生視頻模板。 * 上傳參考圖片,設定視頻比例(如 3:4)。 * 點擊運行,監控任務管理器與控制台進度。 * 等待進度達 100%,獲取生成的視頻。 ## 值得注意的限制或風險 * **硬體限制**:顯存低於 12GB(如 8GB)可能出現「爆顯存」或「標卡」情況,建議使用 16GB 顯存或更高配置。 * **路徑限制**:ComfyUI 解壓路徑中不可包含中文與空格,否則可能導致運行錯誤。 * **驅動依賴**:必須使用最新版本的英偉達顯卡驅動,否則可能無法正常運行。 * **模型選擇**:Model Scope 上有多個模型檔案,需區分「文生/圖生視頻模型」與「全程參考視頻模型」,並根據需求選擇 INT8 量化版本以節省資源。 ## 逐字稿辨識疑點 * **「B原」**:逐字稿中提到「因為它是B原的,B原是沒辦法本地部署了」,此詞彙語意不明,疑為聽寫錯誤或特定領域縮寫,需查證。 * **「Cdance 2.0」與「C-Dance 2.0」**:開頭提及「Cdance 2.0」,結尾提及「C-Dance 2.0」,兩者指涉對象可能相同,但名稱拼寫不一致。 * **「標卡」**:逐字稿中提到「8G也能用,但是就是可能會標卡」,「標卡」一詞在顯卡語境下語意不清,疑為「爆卡」或「卡頓」之聽寫錯誤。 * **「千問」**:在複製 `text_encoders` 時,講者提到「把千問的這個模型也給它添加進來」,MiniMax H3 模型通常搭配其自家編碼器,此處提及「千問」(通常指阿里通義千問)是否為口誤或特定組合需查證。 * **「0.30」版本**:ComfyUI 版本通常為小數點格式(如 0.3.0 或 1.0.0),「0.30」為非常規表述,需查證是否為特定整合包版本號。 * **「全成參考」/「全能參考」**:講者口語中出現「全成參考」,隨後修正或口誤為「全能參考」,筆記中已記錄為「全能參考」,但原始聽感存在差異。 * **「若命數如所」**:結尾詩句「若命數如所,便由我親手斬斷」,「如所」語意不通,疑為「如訴」或「如鎖」等字之聽寫錯誤。 * **「屁店屁店」**:短劇對白中出現「你哪天不是屁店屁店,給我們家做飯」,「屁店」語意不明,疑為特定方言、口誤或聽寫錯誤(可能為「劈裡啪啦」或其他擬聲詞/形容詞)。 ## 可延伸追問 * MiniMax H3 的「全能參考」模式具體如何操作?與單純的圖生視頻有何技術差異? * Model Scope 上提供的多個模型檔案中,哪些是必須的,哪些是可選的? * 對於顯存較小(如 8GB)的用戶,是否有其他優化手段或替代方案? * 「B原」一詞具體指代什麼概念?是否與版權或授權模式有關? * ComfyUI 版本 0.30 與官方最新穩定版相比,在功能或兼容性上有何特殊之處?