影片筆記:Hermes Agent 小白别花冤枉钱!这套模型配置就够了
一句話總結
針對 Hermes Agent 新手,建議採用「DeepSeek V4 Flash 作為主模型」搭配「阿里百煉千問 3.6-Flash 作為視覺補位」的低成本配置方案,利用各家雲廠商免費額度與 DeepSeek 的高緩存命中率,將日常 Agent 使用成本降至極低(單輪對話可能不到一分錢),同時區分 Flash 與 Pro 版本的適用場景。
核心重點
低成本核心策略:
- 主模型推薦使用 DeepSeek V4 Flash,因其價格極低且 V4 版本優化緩存策略,命中率可達 90% 以上。
- 透過命中緩存,輸入成本可低至約 0.02 元人民幣 / 百萬 Token,日常使用每天僅需幾元錢。
- 對比國外模型(GPT、Claude、Gemini),DeepSeek 在中文語境下具備價格與洞察力優勢。
多模態(圖片識別)補位方案:
- 針對 DeepSeek V4 Flash 缺乏多模態能力(僅支援 OCR 文字提取)的問題,建議搭配 阿里百煉(Bailian)的千問 3.6-Flash(或更便宜的 3.5-Flash)。
- 利用阿里、騰訊、字節火山方舟等平台的免費推理額度(50 萬 -100 萬 Token),實現視覺分析功能(如識別無文字圖片、桌面佈局)。
- 單張圖片識別成本約 0.004 元人民幣。
Flash 與 Pro 版本差異:
- Flash 版本:指令遵循能力強、速度快、便宜、穩定,適合大多數 Agent 場景(Tool Use、執行任務),被比喻為「一線執行者」。
- Pro 版本:思考能力強、推理鏈重,適合需要深度思考、系統框架搭建的複雜任務,但存在「過度思考」(Overthinking)風險,可能將推理結果誤認為規則導致結果跑偏。
- 建議:日常預設為 Flash,遇到複雜任務時可通過
/model命令或口語指令切換至 Pro。
操作流程:
- 在 DeepSeek 官網創建 API Key,於 Hermes Agent 終端設置為 Default Model。
- 在阿里百煉創建 API Key,於 Hermes Agent Dashboard 將 Vision 模型設為 Custom,填入千問模型配置。
- 若配置錯誤,可通過
/reset重新配置。
詳細大綱
一、 配置背景與核心理念
- 受眾對象:剛開始使用 Hermes Agent 的新手或小白用戶。
- 核心目標:以較低成本(甚至免費)先上車體驗,避免一上來就投入高昂成本(如 GPT Pro 或 Gemini 高級版)。
- 主要痛點:官方 QuickStart 中模型選擇繁多,用戶容易迷失,且擔心開銷。
- 解決方案初心:不希望用戶花冤枉錢,提倡先跑起來再評估好用與否。
二、 主模型選擇:DeepSeek V4 Flash
- 選擇理由:
- 價格極低:相比 GPT、Claude 等國外模型便宜幾十倍。
- 緩存策略優化:V4 版本優化緩存策略,命中率高達 90% 以上。
- 成本結構:
- 輸入(未命中緩存):約 1 元人民幣 / 百萬 Token。
- 輸入(命中緩存):約 0.02 元人民幣 / 百萬 Token。
- 輸出:約 2 元人民幣 / 百萬 Token。
- 實際消耗案例:講者展示一天消耗約 1.47 元人民幣,日常使用每天僅幾元錢。
- 對比國外模型:
- GPT-5.5 輸入價格約 5 美元(約合人民幣 34 倍於 DeepSeek)。
- Claude Sonnet 輸入約 3 美元,Opus 約 5 美元。
- Kimi 輸入 6.5 元,輸出 27 元。
- DeepSeek 在中文語境下洞察力被認為優於 GPT、Claude、Gemini。
三、 多模態能力補位方案
- 問題現狀:DeepSeek V4 Flash 目前官方無多模態能力,無法識別無文字圖片(僅支援 OCR 文字提取)。
- 解決方案:在 DeepSeek Flash 基礎上,接入一個支援圖片理解的多模態模型作為補位。
- 推薦模型:阿里百煉(Bailian)的千問 3.6-Flash(或更便宜的 3.5-Flash)。
- 優勢:
- 雲廠商(阿里、騰訊、字節等)提供免費推理額度(如 50 萬 -100 萬 Token)。
- 支援視覺分析,能識別無文字圖片(如機械鍵盤、桌面佈局等)。
- 配置流程:
在阿里百煉創建 API Key。
在 Hermes Agent Dashboard 中,將 Vision 模型設為 Custom。
輸入千問 3.6-Flash 的 API Key 及配置信息。
若配置錯誤(如誤配為 VL Plus),可通過 /reset 或重新發送指令修正。
四、 成本估算與免費額度利用
- 文本對話成本:
- 利用緩存後,單輪對話成本極低(約 0.004 元人民幣或更低)。
- 20 輪對話約 1.6 元人民幣。
- 圖片識別成本:
- 假設一張圖片消耗 3000 Token。
- 千問 3.6-Flash 價格約 1.44 元 / 百萬 Token。
- 單張圖片成本約 0.004 元人民幣。
- 免費額度策略:
- 充分利用阿里、騰訊、字節火山方舟等平台的免費額度。
- 建議先耗盡免費額度,再考慮付費或切換模型。
五、 DeepSeek Flash 與 Pro 的效果對比
- Flash 版本特點:
- 指令遵循能力強,像一線執行者,按具體指令執行,不易出錯。
- 速度快、便宜、穩定。
- 適合大多數 Agent 場景(Tool Use、執行任務)。
- Pro 版本特點:
- 思考能力強,推理鏈重,喜歡自我延伸。
- 存在「過度思考」(Overthinking)風險,可能將推理結果誤認為規則,導致結果跑偏。
- 適合需要深度思考、系統框架搭建、複雜邏輯梳理的場景。
- 切換建議:
- 日常使用預設為 Flash。
- 遇到複雜任務時,可通過
/model命令或口語指令主動切換至 Pro。
六、 實操演示步驟
配置主模型:
- 進入 DeepSeek 官網 API 開放平台創建 API Key。
- 在 Hermes Agent 終端輸入
Hermes Model。 - 選擇 DeepSeek V4 Flash,輸入 API Key 並保存。
- 確認 Default Model 設為 DeepSeek V4 Flash。
測試主模型:
- 發起新會話,確認模型為 DeepSeek V4 Flash。
- 測試文字對話功能。
配置多模態補位:
- 在阿里百煉創建 API Key。
- 在 Hermes Agent Dashboard 中,找到 Vision 模型設置。
- 將 Vision 設為 Custom,填入千問 3.6-Flash 的 API Key 和配置參數。
- 若配置失敗,通過
/reset重新配置。
最終測試:
- 發送無文字圖片,確認模型能識別內容(如桌面佈局)。
- 使用
/usage查看消耗情況。
工具 / 模型 / 名詞整理
- Hermes Agent:影片討論的核心 Agent 框架。
- DeepSeek:
- DeepSeek V4 Flash:推薦的主模型。
- DeepSeek V4 Pro:對比模型,適合深度思考。
- DeepSeek-VL Flash:阿里百煉中提及的視覺模型選項。
- GPT-5.5:作為價格對比參考。
- Claude:
- Claude Sonnet:價格對比參考。
- Claude Opus:高價模型參考。
- Gemini:作為價格對比參考。
- Kimi:作為價格對比參考。
- 阿里百煉(Bailian):提供千問模型及 API 服務的平台。
- 千問 3.6-Flash:推薦的多模態補位模型。
- 千問 3.5-Flash:成本更低的替代選項。
- 騰訊混元:提及的支援免費額度的雲廠商模型。
- 字節豆包:提及的支援免費額度的雲廠商模型。
- 火山方舟:字節跳動旗下的 AI 平台,提及支援免費推理額度。
- 知識星球:講者開設的社群平台,名稱為「帥真 AI 实战圈」。
操作流程整理
準備工作:
- 前往 DeepSeek 官網 API 開放平台創建 API Key。
- 前往阿里百煉(Bailian)創建 API Key。
配置主模型(DeepSeek V4 Flash):
- 在 Hermes Agent 終端輸入指令
Hermes Model。 - 選擇 DeepSeek V4 Flash。
- 輸入 DeepSeek API Key 並保存。
- 確認 Default Model 設為 DeepSeek V4 Flash。
配置視覺補位模型(千問 3.6-Flash):
- 在 Hermes Agent Dashboard 中,找到 Vision 模型設置。
- 將 Vision 模型設為 Custom。
- 填入千問 3.6-Flash 的 API Key 及相關配置參數。
- *注意*:若配置錯誤(如誤配為 VL Plus),可通過
/reset指令重新配置。
測試與驗證:
- 發起新會話,確認模型顯示為 DeepSeek V4 Flash。
- 進行文字對話測試。
- 發送無文字圖片(如桌面佈局、機械鍵盤),確認模型能識別內容。
- 使用
/usage指令查看實際消耗情況。
值得注意的限制或風險
DeepSeek V4 Flash 的多模態限制:該模型目前官方無多模態能力,無法識別無文字圖片,僅支援 OCR 文字提取,因此必須搭配其他多模態模型使用。
Pro 版本的過度思考風險:使用 Pro 版本時,模型可能因推理鏈過重而產生「過度思考」(Overthinking),將推理結果誤認為規則,導致結果跑偏。
免費額度的消耗:雖然雲廠商提供免費推理額度,但用戶應注意額度限制,建議先耗盡免費額度再考慮付費或切換模型。
配置錯誤風險:在配置 Vision 模型時,若參數填寫錯誤(如誤配為 VL Plus),可能導致功能異常,需透過 /reset 修正。
逐字稿辨識疑點
- Hermes Model:逐字稿中多次出現此詞,疑為 Hermes Agent 中的特定指令或設置界面名稱,需查證是否為正確指令。
- recode:在選擇 DeepSeek 直聯 API 時,講者提到「DeepSeek v3 recode」,疑為口誤或聽寫錯誤,實際可能指代某個具體的 API 端點或版本標識。
- 梁胜良、文风、风仙圣仙刻:講者感謝名單中的名字,聽起來較為模糊或可能存在諧音/錯字,需查證具體人名。
- FaceboOK:講者提到「在 FaceboOK 上面用」,疑為口誤,實際應指 Facebook 或其他平台,但需查證是否指特定社群。
- V4 Flash:講者多次強調「V4 Flash」,但 DeepSeek 官方命名習慣通常為「V3」或「Plus/Pro」,需查證 DeepSeek 是否確實發布了名為「V4 Flash」的模型,或為講者自稱/口誤。
- 千问 3.7:講者提到「最新可能有到千问 3.7」,需查證千問模型當前最新版本號。
- 1.44元100 万:講者計算圖片成本時提到「1.44元100 万」,疑為價格單位描述,需查證千問 3.6-Flash 的實際定價單位。
- 333333:講者計算圖片成本時除數為「333333」,疑為口誤或聽寫錯誤,實際可能為 3000 或其他數字。
- 想便宜:講者提到 Pro 版本「越想越便宜」,疑為口誤,實際語境應為「越想越偏」或類似含義。
可延伸追問
DeepSeek V4 Flash 的緩存命中率 90% 以上是否為穩定數據,還是特定場景下的測試結果?
阿里百煉千問 3.6-Flash 的免費額度具體包含哪些限制(如 QPS、每日上限等)?
若同時使用多個雲廠商的免費額度,Hermes Agent 是否支援自動切換或負載平衡?
DeepSeek V4 Flash 與 V3 版本在實際 Agent 任務中的具體性能差異為何?
如何監控 Hermes Agent 的實際 Token 消耗,以確保成本控制在預期範圍內?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。