# 影片筆記:Hermes Agent 小白别花冤枉钱!这套模型配置就够了 ## 一句話總結 針對 Hermes Agent 新手,建議採用「DeepSeek V4 Flash 作為主模型」搭配「阿里百煉千問 3.6-Flash 作為視覺補位」的低成本配置方案,利用各家雲廠商免費額度與 DeepSeek 的高緩存命中率,將日常 Agent 使用成本降至極低(單輪對話可能不到一分錢),同時區分 Flash 與 Pro 版本的適用場景。 ## 核心重點 1. **低成本核心策略**: * 主模型推薦使用 **DeepSeek V4 Flash**,因其價格極低且 V4 版本優化緩存策略,命中率可達 90% 以上。 * 透過命中緩存,輸入成本可低至約 0.02 元人民幣 / 百萬 Token,日常使用每天僅需幾元錢。 * 對比國外模型(GPT、Claude、Gemini),DeepSeek 在中文語境下具備價格與洞察力優勢。 2. **多模態(圖片識別)補位方案**: * 針對 DeepSeek V4 Flash 缺乏多模態能力(僅支援 OCR 文字提取)的問題,建議搭配 **阿里百煉(Bailian)的千問 3.6-Flash**(或更便宜的 3.5-Flash)。 * 利用阿里、騰訊、字節火山方舟等平台的免費推理額度(50 萬 -100 萬 Token),實現視覺分析功能(如識別無文字圖片、桌面佈局)。 * 單張圖片識別成本約 0.004 元人民幣。 3. **Flash 與 Pro 版本差異**: * **Flash 版本**:指令遵循能力強、速度快、便宜、穩定,適合大多數 Agent 場景(Tool Use、執行任務),被比喻為「一線執行者」。 * **Pro 版本**:思考能力強、推理鏈重,適合需要深度思考、系統框架搭建的複雜任務,但存在「過度思考」(Overthinking)風險,可能將推理結果誤認為規則導致結果跑偏。 * **建議**:日常預設為 Flash,遇到複雜任務時可通過 `/model` 命令或口語指令切換至 Pro。 4. **操作流程**: * 在 DeepSeek 官網創建 API Key,於 Hermes Agent 終端設置為 Default Model。 * 在阿里百煉創建 API Key,於 Hermes Agent Dashboard 將 Vision 模型設為 Custom,填入千問模型配置。 * 若配置錯誤,可通過 `/reset` 重新配置。 ## 詳細大綱 ### 一、 配置背景與核心理念 * **受眾對象**:剛開始使用 Hermes Agent 的新手或小白用戶。 * **核心目標**:以較低成本(甚至免費)先上車體驗,避免一上來就投入高昂成本(如 GPT Pro 或 Gemini 高級版)。 * **主要痛點**:官方 QuickStart 中模型選擇繁多,用戶容易迷失,且擔心開銷。 * **解決方案初心**:不希望用戶花冤枉錢,提倡先跑起來再評估好用與否。 ### 二、 主模型選擇:DeepSeek V4 Flash * **選擇理由**: * **價格極低**:相比 GPT、Claude 等國外模型便宜幾十倍。 * **緩存策略優化**:V4 版本優化緩存策略,命中率高達 90% 以上。 * **成本結構**: * 輸入(未命中緩存):約 1 元人民幣 / 百萬 Token。 * 輸入(命中緩存):約 0.02 元人民幣 / 百萬 Token。 * 輸出:約 2 元人民幣 / 百萬 Token。 * **實際消耗案例**:講者展示一天消耗約 1.47 元人民幣,日常使用每天僅幾元錢。 * **對比國外模型**: * GPT-5.5 輸入價格約 5 美元(約合人民幣 34 倍於 DeepSeek)。 * Claude Sonnet 輸入約 3 美元,Opus 約 5 美元。 * Kimi 輸入 6.5 元,輸出 27 元。 * DeepSeek 在中文語境下洞察力被認為優於 GPT、Claude、Gemini。 ### 三、 多模態能力補位方案 * **問題現狀**:DeepSeek V4 Flash 目前官方無多模態能力,無法識別無文字圖片(僅支援 OCR 文字提取)。 * **解決方案**:在 DeepSeek Flash 基礎上,接入一個支援圖片理解的多模態模型作為補位。 * **推薦模型**:阿里百煉(Bailian)的千問 3.6-Flash(或更便宜的 3.5-Flash)。 * **優勢**: * 雲廠商(阿里、騰訊、字節等)提供免費推理額度(如 50 萬 -100 萬 Token)。 * 支援視覺分析,能識別無文字圖片(如機械鍵盤、桌面佈局等)。 * **配置流程**: 1. 在阿里百煉創建 API Key。 2. 在 Hermes Agent Dashboard 中,將 Vision 模型設為 Custom。 3. 輸入千問 3.6-Flash 的 API Key 及配置信息。 4. 若配置錯誤(如誤配為 VL Plus),可通過 `/reset` 或重新發送指令修正。 ### 四、 成本估算與免費額度利用 * **文本對話成本**: * 利用緩存後,單輪對話成本極低(約 0.004 元人民幣或更低)。 * 20 輪對話約 1.6 元人民幣。 * **圖片識別成本**: * 假設一張圖片消耗 3000 Token。 * 千問 3.6-Flash 價格約 1.44 元 / 百萬 Token。 * 單張圖片成本約 0.004 元人民幣。 * **免費額度策略**: * 充分利用阿里、騰訊、字節火山方舟等平台的免費額度。 * 建議先耗盡免費額度,再考慮付費或切換模型。 ### 五、 DeepSeek Flash 與 Pro 的效果對比 * **Flash 版本特點**: * 指令遵循能力強,像一線執行者,按具體指令執行,不易出錯。 * 速度快、便宜、穩定。 * 適合大多數 Agent 場景(Tool Use、執行任務)。 * **Pro 版本特點**: * 思考能力強,推理鏈重,喜歡自我延伸。 * 存在「過度思考」(Overthinking)風險,可能將推理結果誤認為規則,導致結果跑偏。 * 適合需要深度思考、系統框架搭建、複雜邏輯梳理的場景。 * **切換建議**: * 日常使用預設為 Flash。 * 遇到複雜任務時,可通過 `/model` 命令或口語指令主動切換至 Pro。 ### 六、 實操演示步驟 1. **配置主模型**: * 進入 DeepSeek 官網 API 開放平台創建 API Key。 * 在 Hermes Agent 終端輸入 `Hermes Model`。 * 選擇 DeepSeek V4 Flash,輸入 API Key 並保存。 * 確認 Default Model 設為 DeepSeek V4 Flash。 2. **測試主模型**: * 發起新會話,確認模型為 DeepSeek V4 Flash。 * 測試文字對話功能。 3. **配置多模態補位**: * 在阿里百煉創建 API Key。 * 在 Hermes Agent Dashboard 中,找到 Vision 模型設置。 * 將 Vision 設為 Custom,填入千問 3.6-Flash 的 API Key 和配置參數。 * 若配置失敗,通過 `/reset` 重新配置。 4. **最終測試**: * 發送無文字圖片,確認模型能識別內容(如桌面佈局)。 * 使用 `/usage` 查看消耗情況。 ## 工具 / 模型 / 名詞整理 * **Hermes Agent**:影片討論的核心 Agent 框架。 * **DeepSeek**: * **DeepSeek V4 Flash**:推薦的主模型。 * **DeepSeek V4 Pro**:對比模型,適合深度思考。 * **DeepSeek-VL Flash**:阿里百煉中提及的視覺模型選項。 * **GPT-5.5**:作為價格對比參考。 * **Claude**: * **Claude Sonnet**:價格對比參考。 * **Claude Opus**:高價模型參考。 * **Gemini**:作為價格對比參考。 * **Kimi**:作為價格對比參考。 * **阿里百煉(Bailian)**:提供千問模型及 API 服務的平台。 * **千問 3.6-Flash**:推薦的多模態補位模型。 * **千問 3.5-Flash**:成本更低的替代選項。 * **騰訊混元**:提及的支援免費額度的雲廠商模型。 * **字節豆包**:提及的支援免費額度的雲廠商模型。 * **火山方舟**:字節跳動旗下的 AI 平台,提及支援免費推理額度。 * **知識星球**:講者開設的社群平台,名稱為「帥真 AI 实战圈」。 ## 操作流程整理 1. **準備工作**: * 前往 DeepSeek 官網 API 開放平台創建 API Key。 * 前往阿里百煉(Bailian)創建 API Key。 2. **配置主模型(DeepSeek V4 Flash)**: * 在 Hermes Agent 終端輸入指令 `Hermes Model`。 * 選擇 DeepSeek V4 Flash。 * 輸入 DeepSeek API Key 並保存。 * 確認 Default Model 設為 DeepSeek V4 Flash。 3. **配置視覺補位模型(千問 3.6-Flash)**: * 在 Hermes Agent Dashboard 中,找到 Vision 模型設置。 * 將 Vision 模型設為 Custom。 * 填入千問 3.6-Flash 的 API Key 及相關配置參數。 * *注意*:若配置錯誤(如誤配為 VL Plus),可通過 `/reset` 指令重新配置。 4. **測試與驗證**: * 發起新會話,確認模型顯示為 DeepSeek V4 Flash。 * 進行文字對話測試。 * 發送無文字圖片(如桌面佈局、機械鍵盤),確認模型能識別內容。 * 使用 `/usage` 指令查看實際消耗情況。 ## 值得注意的限制或風險 1. **DeepSeek V4 Flash 的多模態限制**:該模型目前官方無多模態能力,無法識別無文字圖片,僅支援 OCR 文字提取,因此必須搭配其他多模態模型使用。 2. **Pro 版本的過度思考風險**:使用 Pro 版本時,模型可能因推理鏈過重而產生「過度思考」(Overthinking),將推理結果誤認為規則,導致結果跑偏。 3. **免費額度的消耗**:雖然雲廠商提供免費推理額度,但用戶應注意額度限制,建議先耗盡免費額度再考慮付費或切換模型。 4. **配置錯誤風險**:在配置 Vision 模型時,若參數填寫錯誤(如誤配為 VL Plus),可能導致功能異常,需透過 `/reset` 修正。 ## 逐字稿辨識疑點 * **Hermes Model**:逐字稿中多次出現此詞,疑為 Hermes Agent 中的特定指令或設置界面名稱,需查證是否為正確指令。 * **recode**:在選擇 DeepSeek 直聯 API 時,講者提到「DeepSeek v3 recode」,疑為口誤或聽寫錯誤,實際可能指代某個具體的 API 端點或版本標識。 * **梁胜良、文风、风仙圣仙刻**:講者感謝名單中的名字,聽起來較為模糊或可能存在諧音/錯字,需查證具體人名。 * **FaceboOK**:講者提到「在 FaceboOK 上面用」,疑為口誤,實際應指 Facebook 或其他平台,但需查證是否指特定社群。 * **V4 Flash**:講者多次強調「V4 Flash」,但 DeepSeek 官方命名習慣通常為「V3」或「Plus/Pro」,需查證 DeepSeek 是否確實發布了名為「V4 Flash」的模型,或為講者自稱/口誤。 * **千问 3.7**:講者提到「最新可能有到千问 3.7」,需查證千問模型當前最新版本號。 * **1.44元100 万**:講者計算圖片成本時提到「1.44元100 万」,疑為價格單位描述,需查證千問 3.6-Flash 的實際定價單位。 * **333333**:講者計算圖片成本時除數為「333333」,疑為口誤或聽寫錯誤,實際可能為 3000 或其他數字。 * **想便宜**:講者提到 Pro 版本「越想越便宜」,疑為口誤,實際語境應為「越想越偏」或類似含義。 ## 可延伸追問 1. DeepSeek V4 Flash 的緩存命中率 90% 以上是否為穩定數據,還是特定場景下的測試結果? 2. 阿里百煉千問 3.6-Flash 的免費額度具體包含哪些限制(如 QPS、每日上限等)? 3. 若同時使用多個雲廠商的免費額度,Hermes Agent 是否支援自動切換或負載平衡? 4. DeepSeek V4 Flash 與 V3 版本在實際 Agent 任務中的具體性能差異為何? 5. 如何監控 Hermes Agent 的實際 Token 消耗,以確保成本控制在預期範圍內?