# 影片筆記:四大AI Agent实测:Codex、Hermes、WorkBuddy、DeepSeek谁更能干活? ## ✅ 目前無待解決問題 本筆記已完成可閱讀的逐字稿與時間跳轉,目前沒有待修正項目。 ## 一句話總結 影片分析了 2026 年四款代表性 AI Agent 產品(DeepSeaKarnes、WorkBody、HermesAgent、OpenAI Codex)的發展路線,指出它們分別針對開發底盤、辦公效率、長期學習與工程交付不同需求,強調未來趨勢是根據控制權、便利性與成長性進行選擇,而非單純比較模型智商。 ## 核心重點 * **四種發展路線**: 1. **DeepSeaKarnes**:開放模組化底盤,強調「一切皆插件」,適合開發者構建可控、可擴展的系統。 2. **WorkBody**:開箱即用的辦公整車,強調多專家協作與低門檻,適合普通職場人員提升效率。 3. **HermesAgent**:具備閉環學習的長期員工,強調長期記憶與技能沉淀,適合希望 AI 隨時間成長的用戶。 4. **OpenAI Codex**:強調驗證與交付的工程環境,聚焦代碼執行與安全邊界,適合專業任務與嚴格驗證需求。 * **選擇關鍵**:使用者應根據「需要成品還是框架」、「看重即時效率還是長期成長」、「是否需要控制權」這三個問題來選擇合適的 Agent。 * **未來趨勢**:AI 工作系統將由不同層級、不同需求的智能體相互配合組成,成熟系統應將人類判斷集中於關鍵節點,而非完全自主運行。 ## 詳細大綱 ### I. 引言:AI 智能體的多元發展 * 2026 年 AI Agent 熱門現象。 * 核心觀點:不比較誰更聰明,而是釐清各自解決的問題、優勢及適用人群。 * 四款產品代表四種完全不同的發展路線。 ### II. DeepSeaKarnes(疑點):開放模組化的開發底盤 * **核心概念**: * 名稱含義:類似智能體的運行底座或框架(Harness)。 * 理念:「Everything is a Plugin」(一切皆插件)。 * 架構:大模型僅為大腦,需透過 Harness 提供身體、工具、記憶與工作台。 * **主要優點**: 1. **開放性與可組合性強**:可替換模型、工具、記憶系統、UI;支援混合模型策略(複雜任務用強模型,簡單任務用低成本模型,敏感數據用本地模型)。 2. **運行過程透明**:完整記錄每一步(視角、指令、工具調用、小助手派遣);支援恢復、搜索、分叉與重放(黑匣子飛行記錄),便於調試與審計。 3. **多種工作模式**:標準模式、代碼模式(寫程序組織工具調用)、最小模式(測試原始能力)、Creator 模式(設計新插件與模板)。 * **缺點與限制**: * 屬基礎設施/工具包,非終端辦公助手。 * 需自行負責模型選擇、工具接入、權限配置與數據存儲。 * 處於開發者預覽階段,生態變化快。 * **適用對象**:有開發能力的企業或團隊,需可控、可擴展 Agent 底盤者。 ### III. 腾讯 WorkBody(疑點):開箱即用的辦公整車 * **核心概念**: * 定位:已組裝好的「整車」,對比 DeepSeaKarnes 的「樂高積木」。 * 目標:讓普通職場人用大白話完成完整工作任務。 * 特點:全場景辦公、多專家協作、開箱即用。 * **主要優點**: 1. **使用門檻極低**:無需懂 Python、Docker、API 等技術;10 分鐘內即可創造價值。 2. **中文辦公與國內生態適配佳**:支援 Windows/macOS;打通即時通訊工具與微信小程序;貼近中文報告、PPT、Excel 及國內溝通習慣。 3. **複雜技術包裝**:將多智能體協作包裝為「專家團隊」概念;用戶只需描述目標,系統自動組織角色協作。 * **缺點與限制**: * 失去底層控制權,透明度、可定制度及模型選擇自由度低於其他產品。 * 在複雜代碼倉庫或嚴格軟體測試任務上,可能不如專業編碼 Agent。 * **適用對象**:希望立即提升辦公效率,不願投入時間研究部署配置的普通用戶。 ### IV. HermesAgent:具備閉環學習的長期 AI 員工 * **開發背景**:由 Nous Research 團隊開發。 * **核心理念**: * 拒絕每次對話如初次見面。 * 強調長期記憶、工作習慣掌握及成功經驗沉淀。 * **主要特點**: 1. **閉環學習(核心優勢)**: * 具備長期記憶系統(保存偏好、背景、經驗)。 * 具備技能系統(Skill):將多步驟流程保存為一鍵調用技能。 * 類比實習生:透過糾錯與指導,將經驗轉化為程序化、可復用的工作流程。 * 價值隨使用時間增長。 2. **高模型自由度**: * 可連接 OpenAI、Claude、Gemini、DeepSeek、Qianwen 等雲端模型,或本地模型。 * 記憶與技能屬於 Hermes 本身,不綁定特定大模型(可隨時更換「大腦」)。 3. **適合長期在線運行**: * 可部署於電腦或雲端服務器。 * 支援 Telegram、Discord、Slack、WhatsApp、非輸(疑點)、企業微信等渠道。 * 具備定時任務與子 Agent 能力,適合週期性報告、資料搜集等自動化任務。 * **關於「自進化」的澄清**: * 非重新訓練大語言模型神經網絡權重。 * 成長發生在技能與系統提示層面。 * 透過 Self Evolution 項目,利用執行軌跡與評估數據生成/優化技能與提示詞。 * 屬工作流程與提示系統迭代,非模型重新訓練。 * **風險與安全機制**: * 風險:可能總結錯誤經驗並固化為錯誤流程。 * 機制:提供記憶寫入與技能寫入的審批機制;建議由人類查看差異並批准,而非完全自主修改。 * 啟發:自我改進需平衡能力、回滾、審批及安全邊界。 * **適用對象**:希望培養能長期在線、逐漸熟悉個人工作方式的智能體者。 ### V. OpenAI 的 Codex:強調驗證與交付的工程環境 * **產品定位**: * 從單純編碼助手發展為包含桌面端、命令行、IDE 插件及雲端環境的完整體系。 * 通用研究、報告等功能主要歸於 ChatGPT Work,Codex 聚焦代碼、項目、工具與工程執行。 * **主要優點**: 1. **強調「做完並驗證」**: * 不僅提供建議,更執行任務。 * 讀取項目文件、搜索代碼、修改多文件、運行命令、執行測試、查看報錯並修復。 * 交付完整修改摘要、文件差異對比、測試結果及可審查的最終成果。 2. **完整的工程環境**: * 本地版:使用電腦已裝好的編譯器、測試工具與依賴。 * 雲端版:建立隔離環境,後台並行運行多任務。 * 清晰展示修改內容,支援繼續調整或提交至代碼倉庫。 3. **成熟的權限與安全邊界**: * 透過沙箱限制文件與網絡訪問。 * 高風險命令或跨越權限時請求批准。 * 謹慎設計提升可靠性。 4. **連接編碼研究與文件交付**: * 在 ChatGPT Work 環境中,能力共享於生成與檢查文檔、表格、PPT、PDF、網站及數據分析。 * 單一環境完成從資料搜集到最終文件生成的全流程。 * **缺點與限制**: * 主要圍繞 OpenAI 自家模型與 ChatGPT 服務,模型自由度低於 Hermes 或 DeepSeaKarnes。 * 雖支援技能記憶與項目規則,但不以自動修改自身為核心賣點。 * 取向保守,優先保證流程可審查、可驗證,不輕易讓 Agent 自行改變長期規則。 * **適用對象**:完成複雜代碼、工具執行及需嚴格驗證的專業任務者。 ### VI. 綜合比較與選擇建議 * **四條路線總結**: * DeepSeaKarnes:架構上的自由(開放底座)。 * WorkBody:使用的便利(成品辦公)。 * HermesAgent:長期的成長(個人員工)。 * Codex:可靠的交付(專業工程)。 * **選擇三個關鍵問題**: 1. 需要成品工具還是可自行開發的框架? 2. 更看重即時效率提升還是長期成長與陪伴? 3. 是否需要掌握對模型、數據、權限和運行環境的控制權? * **未來展望**: * Agent 競爭不僅在模型層面,更在於架構底座(工具、文件訪問、記憶、調度、恢復、透明度)。 * 自進化需脫離有效評估系統(執行記錄、客觀測試、效果比較、人類審批、回滾方案)。 * 最佳 Agent 不一定最自主;關鍵操作需暫停解釋並等待確認。 * 成熟系統應將人類判斷集中於關鍵節點,而非取消人類判斷。 * 未來趨勢:非單一超級 Agent 包攬所有工作,而是成品辦公 Agent、專業工程 Agent、長期個人 Agent 與企業開源底座相互配合。 ## 工具 / 模型 / 名詞整理 * **產品/框架名稱**: * DeepSeaKarnes(疑點,原文如此) * WorkBody(疑點,原文如此) * HermesAgent(或稱 Hermes) * OpenAI 的 Codex * ChatGPT Work * **開發團隊/組織**: * Nous Research * **雲端模型/服務**: * OpenAI * Claude * Gemini * DeepSeek * Qianwen(疑點,可能指通義千問) * **平台/渠道**: * Windows * macOS * 微信小程序 * Telegram * Discord * Slack * WhatsApp * 非輸(疑點,聽寫錯誤,可能指 Line 或其他通訊軟體) * 企業微信 * **技術概念/術語**: * AI Agent / 智能體 * Harness(疑點,原文如此) * Everything is a Plugin * Self Evolution(自我進化) * Skill(技能) * IDE 插件 * 沙箱(Sandbox) ## 操作流程整理 * **DeepSeaKarnes 操作流程**: 1. 選擇底層模型(可混合使用強/弱/本地模型)。 2. 配置工具、記憶系統與 UI 插件。 3. 選擇工作模式(標準、代碼、最小、Creator)。 4. 運行任務,系統記錄完整視角、指令與工具調用。 5. 利用黑匣子功能進行恢復、搜索、分叉與重放以進行調試或審計。 * **WorkBody 操作流程**: 1. 用戶使用自然語言描述工作目標。 2. 系統自動組織「專家團隊」角色進行協作。 3. 系統在後台處理技術細節(無需用戶懂 Python/API)。 4. 直接生成符合中文辦公習慣的結果(報告、PPT、Excel 等)。 * **HermesAgent 操作流程**: 1. 連接外部大模型(OpenAI, Claude 等)作為大腦。 2. 在長期運行中,系統記錄用戶偏好、背景與經驗至長期記憶。 3. 將重複的多步驟流程保存為「技能(Skill)」。 4. 透過 Self Evolution 項目,利用執行軌跡優化技能與提示詞。 5. 人類審批機制介入,確認記憶與技能的寫入,防止錯誤固化。 6. 部署於電腦或雲端,透過各種通訊渠道(Telegram, 企業微信等)進行定時任務或子 Agent 協作。 * **OpenAI Codex 操作流程**: 1. 用戶在本地或雲端環境中提出代碼或工程任務。 2. Agent 讀取項目文件、搜索代碼並進行修改。 3. 執行命令、運行測試並查看報錯。 4. 修復問題後,交付修改摘要、文件差異對比及測試結果。 5. 在沙箱環境中限制文件與網絡訪問,高風險操作請求人類批准。 6. 最終成果可提交至代碼倉庫或生成相關文檔。 ## 值得注意的限制或風險 * **DeepSeaKarnes**: * 屬於基礎設施/工具包,非終端辦公助手,需自行負責模型選擇、工具接入、權限配置與數據存儲。 * 處於開發者預覽階段,生態變化快。 * **WorkBody**: * 失去底層控制權,透明度、可定制度及模型選擇自由度低於其他產品。 * 在複雜代碼倉庫或嚴格軟體測試任務上,可能不如專業編碼 Agent。 * **HermesAgent**: * **風險**:可能總結錯誤經驗並固化為錯誤流程。 * **限制**:成長發生在技能與系統提示層面,非重新訓練大語言模型神經網絡權重。 * **安全機制**:需人類審批記憶與技能寫入,不能完全自主修改。 * **OpenAI Codex**: * 主要圍繞 OpenAI 自家模型與 ChatGPT 服務,模型自由度低於 Hermes 或 DeepSeaKarnes。 * 取向保守,優先保證流程可審查、可驗證,不輕易讓 Agent 自行改變長期規則。 ## 逐字稿辨識疑點 * **DeepSeaKarnes**:逐字稿中出現此名稱,可能為 DeepSeek 相關產品或框架的聽寫錯誤,但依規則保留原樣。 * **WorkBody**:逐字稿中出現此名稱,可能為騰訊相關產品(如 WeCom 或特定內部工具)的聽寫錯誤,但依規則保留原樣。 * **DeepSeaKarnes**:在後文總結時,逐字稿口誤說成「DeepSake Harness」,應指代同一產品。 * **Qianwen**:可能指代阿里雲的「通義千問」模型,但逐字稿僅顯示為「Qianwen」。 * **非輸**:在列舉通訊渠道時出現「非輸」,疑為「Line」或其他通訊軟體名稱的聽寫錯誤。 * **DeepSeaKarnes**:在開頭介紹時,逐字稿口誤說成「deepseek harness」,後文又稱「deep-sea carless」,均指代同一產品,但名稱不統一且疑似錯誤。 ## 可延伸追問 * DeepSeaKarnes 與 WorkBody 在實際部署中,如何處理數據隱私與本地化部署的需求? * HermesAgent 的「閉環學習」在面對不同用戶習慣差異時,如何避免技能衝突或記憶污染? * OpenAI Codex 的沙箱機制在處理需要訪問外部 API 或特定本地庫的複雜任務時,是否存在侷限性? * 四款 Agent 之間是否存在互補的可能性,例如使用 DeepSeaKarnes 作為底盤,整合 Hermes 的記憶功能與 Codex 的工程能力?