# 影片筆記:把你的hermes打造成满血全模态:生图+生视频+图片理解+视频理解+语音生成~ | Agnes+Minimax M3 ## 一句話總結 影片演示如何透過接入外部模型與插件,將 Hermes Agent 從單文本模型擴展為具備文本生成、圖像生成、視頻生成、視覺理解及語音生成等「接近全模態」能力的智能體,並展示了具體的配置步驟與應用場景。 ## 核心重點 1. **架構目標**:將 Hermes Agent 擴充至具備五項核心能力:文本生成、圖像生成、視頻生成、視覺理解、語音生成。 2. **模型分工**: * **Arganes**(講者口誤為 Agnus/Agnus):作為主力文本模型,並負責圖像生成(文生圖、圖生圖)與視頻生成(文生視頻、圖生視頻)。 * **MiniMax M3**:利用其原生多模態能力,負責圖像與視頻的深度理解(分析因果、時序關聯、細節拆解)。 * **MiniMax TTS**:負責語音生成(TTS),用於主動推送消息或定時匯報。 3. **配置邏輯**: * 文本模型通過 Hermes 命令行配置 Custom Endpoint 接入。 * 圖像與視頻生成通過 Skill 和插件方式接入,需指定 API Key 與模型版本(建議 2.1 版本以獲得更好效果)。 * 視覺理解與語音生成同樣通過參考對應 API 文檔並配置插件實現。 4. **應用場景**:可組合出主動資訊推送(采集->報告->語音推送)、視頻學習輔助(下載->理解提取要點->語音摘要)等複雜應用。 ## 詳細大綱 ### I. 能力總覽與架構 * **目標**:將 Hermes 擴充至接近全模態能力。 * **五大能力模組**: 1. 文本生成(主力模型) 2. 圖像生成(文生圖、圖生圖) 3. 視頻生成(文生視頻、圖生視頻) 4. 視覺理解(圖像理解、視頻理解) 5. 語音生成(TTS) * **適用對象**:Hermes 及其他類似 Agent 工具。 ### II. 文本模型接入(Arganes) * **模型選擇**:Arganes(講者口誤為 Agnus/Agnus)。 * **特點**: * 免費使用,無額度限制。 * 僅有頻率限制(約每分鐘 20 次調用)。 * 支持文本、圖像、視頻三種模態。 * **配置步驟**: 1. 獲取 API Key,建議存入 `.txt` 文件(如 `key.txt`)。 2. 在 Hermes 命令行中輸入 `HermesModel`。 3. 選擇 `custom` endpoint。 4. 填入 Arganes 的 `baseurl` 和 API Key。 5. 選擇 `autodetect`,模型編號選擇 `4`(文本模型)。 6. 命名為 `custom:Agnus` 並保存重啟。 * **驗證**:重啟後新建對話,下拉選擇該模型,確認可進行文本對話。 ### III. 圖像與視頻生成能力接入 * **核心邏輯**:通過 Skill 和插件方式實現,而非直接配置為主力模型。 * **Arganes 版本區別**: * 2.0 版本:速度更快。 * 2.1 版本:效果更好,細節更豐富。 * **配置步驟**: 1. 提示 Hermes 參考 Arganes 的生圖/生視頻 API 文檔。 2. 告知 API Key 的存放位置。 3. 選擇插件實現方式(選擇「都做」)。 4. 指定 API Key 路徑。 5. 指定模型版本(建議選 2.1)。 6. 等待 5-10 分鐘完成落地。 * **測試結果**: * **文生圖**:成功生成指定風格(如「星海生風格」)圖片。 * **圖生圖**:基於原圖增加元素(如增加男生互動),速度尚可,質量對於非專業用途足夠。 * **文生視頻**:通過先文生圖,再圖生視頻的流程實現。 * **圖生視頻**:讓靜態圖片動起來,生成短視頻(約 3 秒),速度約 2-3 分鐘。 * **應用場景**:適合內容創作、資料配圖、演示視頻,不適合高專業度漫劇製作。 ### IV. 視覺理解能力接入(MiniMax M3) * **核心邏輯**:利用 MiniMax M3 的「原生多模態」能力。 * **與傳統識別區別**: * 傳統識別:僅識別元素(如杯子、水)。 * 原生多模態:識別因果關係、細節、後果(如杯子打翻導致水漬,長期會損壞地板)。 * **生圖 vs. 視覺理解**: * 生圖(Arganes):畫師,能創造內容。 * 視覺理解(MiniMax M3):評委,能評價、分析內容,但不能直接繪畫。 * **圖像理解測試**: * 輸入樓房草圖,要求拆解局部特寫並生成 HTML。 * 結果:能識別關鍵點(如防水排水、露水高发區),雖細節未必全準,但具備參考價值。 * **視頻理解測試**: * 輸入魔術視頻,要求分析技巧。 * 結果:MiniMax M3 具備時序關聯和連續動作捕捉能力。能識別關鍵幀(如換牌細節)、觀眾反應及時間線。 * 注意:初期可能未自動調用插件,需明確提示使用 M3 視頻理解能力。 ### V. 語音生成能力接入(MiniMax TTS) * **核心邏輯**:利用 MiniMax 提供的 TTS API。 * **配置步驟**: 1. 參考 MiniMax TTS API 文檔。 2. 告知 API Key 存放位置。 3. 執行操作完成接入。 * **測試結果**: * 生成 MP3 文件。 * 支持指定音色(男/女)。 * 語音自然度優於部分免費模型。 * **應用場景**:AI 主動推送消息、定時商業情報匯報、超級秘書主動人格。 ### VI. 總結與應用組合 * **模型總結**: * **Arganes**:負責文本、生圖、生視頻。 * **MiniMax M3**:負責圖像理解、視頻理解。 * **MiniMax TTS**:負責語音生成。 * **組合應用範例**: 1. **主動資訊推送**:應用采集資訊 -> 生成報告 -> 生成語音推送。 2. **視頻學習輔助**:下載視頻 -> 視頻理解提取要點 -> 生成學習報告 -> 生成語音摘要。 * **結論**:通過自由組合,可打造具備全模態能力的靈活應用。 ## 工具 / 模型 / 名詞整理 * **Hermes**:Agent 工具名稱。 * **Arganes**(逐字稿中亦聽寫為 **Agnus**、**Agnus**、**阿根尼斯**):提供免費文本、生圖、生視頻能力的模型/API。 * **MiniMax M3**:提供原生多模態能力(圖像理解、視頻理解)的模型。 * **MiniMax TTS**:提供語音合成(Text-to-Speech)能力的 API。 * **API Key**:應用程序接口密鑰。 * **HTML**:超文本標記語言。 * **MP3**:音頻文件格式。 * **Custom Endpoint**:自定義端點。 * **Autodetect**:自動檢測。 * **Skill**:技能/插件。 * **TTS**:Text-to-Speech,文字轉語音。 ## 操作流程整理 ### 1. 接入文本模型 (Arganes/Agnus) 1. 準備 API Key 並存入 `key.txt` 文件。 2. 在 Hermes 命令行輸入 `HermesModel`。 3. 選擇 `custom` endpoint。 4. 填入 Arganes 的 `baseurl` 和 API Key。 5. 選擇 `autodetect`,模型編號選 `4`。 6. 命名為 `custom:Agnus` 並保存重啟。 7. 新建對話,下拉選擇該模型進行驗證。 ### 2. 接入圖像與視頻生成 (Arganes) 1. 提示 Hermes 參考 Arganes 的生圖/生視頻 API 文檔。 2. 告知 API Key 的存放位置。 3. 選擇插件實現方式(選擇「都做」)。 4. 指定 API Key 路徑。 5. 指定模型版本(建議選 2.1)。 6. 等待 5-10 分鐘完成落地。 7. 測試文生圖、圖生圖、文生視頻、圖生視頻功能。 ### 3. 接入視覺理解 (MiniMax M3) 1. 利用 MiniMax M3 的原生多模態能力。 2. 輸入圖片或視頻,要求進行深度分析(如拆解局部、分析時序關聯)。 3. 若未自動調用插件,需明確提示使用 M3 視頻理解能力。 ### 4. 接入語音生成 (MiniMax TTS) 1. 參考 MiniMax TTS API 文檔。 2. 告知 API Key 存放位置。 3. 執行操作完成接入。 4. 測試生成 MP3 文件及指定音色。 ## 值得注意的限制或風險 * **頻寬限制**:Arganes 模型雖免費無額度限制,但有頻率限制(約每分鐘 20 次調用)。 * **生成質量**:Arganes 生成的圖像和視頻質量對於非專業用途足夠,但不適合高專業度漫劇製作。 * **插件調用**:視覺理解能力初期可能未自動調用插件,需明確提示使用。 * **時間成本**:視頻生成(圖生視頻)速度約需 2-3 分鐘,插件落地需 5-10 分鐘。 ## 逐字稿辨識疑點 * **Arganes / Agnus / Agnus / 阿根尼斯**:逐字稿中對該模型名稱的拼寫不一致,分別出現為 "Arganes"、"Agnus"、"Agnus"、"阿根尼斯"。根據上下文推測為同一個提供免費生圖/生視頻能力的模型,但具體正確名稱需查證。 * **地盘的 key.txt**:講者口誤,疑為「一個 key.txt」或類似表述。 * **自信的方式**:講者口誤,疑為「自定義的方式」或「Custom 的方式」。 * **你 Hermes**:語法不通,疑為「你的 Hermes」。 * **生涂**:疑為「生圖」的口誤。 * **API case**:疑為「API Key」的口誤。 * **安适机制**:疑為「安全机制」的口誤。 * **大元模型**:疑為「大語言模型」或「元模型」的口誤。 * **原始动模态 / 原生多模态 / 原生冬光菜 / 原生你**:講者對 "Native Multimodal" 的翻譯或口誤不一致,疑點為「原生多模態」。 * **五岁的小孩**:講者用此比喻傳統圖像識別與原生多模態理解的區別,非產品名稱。 * **刘圈**:講者提到的魔術師或視頻來源,疑為人名或特定稱呼,需查證。 * **柴姐**:講者口誤,疑為「裝置」或「器材」,指高速攝像機。 * **千荒的音色**:疑為「千幻」或特定音色名稱,需查證。 * **Hemis**:疑為「Hermes」的口誤。 * **满血**:比喻詞,指能力完整。 ## 可延伸追問 * Arganes/Agnus 模型的正確官方名稱為何? * MiniMax M3 在視頻理解方面的具體技術細節與優勢為何? * 如何進一步優化 Arganes 生成視頻的時長與質量? * 除了 Hermes,其他 Agent 工具如何具體實現類似的插件接入邏輯?