實際影片長度:13:21.000。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:01.360
zh2026年AI智能体
0:01.360–0:02.960
zh也就是我们常说的AI agent
0:02.960–0:03.840
zh一下子就火了
0:03.840–0:05.760
zh你随便一搜就能看到各种各样的产品
0:05.760–0:07.320
zh比如DeepSeaKarnes
0:07.320–0:08.320
zh腾讯的WorkBody
0:08.320–0:10.000
zh一个叫HermesAgent的
0:10.000–0:11.520
zh还有OpenAI的Codex
0:11.520–0:13.200
zh乍一看他们好像
0:13.200–0:15.120
zh都差不多都是能自己干活的AI
0:15.120–0:16.960
zh我们是不是只要比比谁更聪明就行了
0:16.960–0:18.160
zh他们四个其实代表了
0:18.160–0:20.240
zh四种完全不同的发展路线
0:20.240–0:22.080
zh今天咱们最重要的任务
0:22.080–0:23.840
zh就不是给他们排个1234
0:23.840–0:25.520
zh而是要把这四家的底细都摸清楚
0:25.520–0:27.760
zh他们各自到底在解决什么问题
0:27.760–0:28.720
zh最厉害的地方在哪
0:28.720–0:30.380
zh又分别适合什么样的人去用
0:30.380–0:31.460
zh咱们一个一个来看
0:31.460–0:33.220
zh先说deepseek harness
0:33.220–0:35.560
zh这个名字里的harness翻译过来有点像
0:35.560–0:38.320
zh智能体的运行底座或者框架
0:38.320–0:39.120
zh你可以这么理解
0:39.120–0:40.320
zh一个大模型
0:40.320–0:41.760
zh就像一个聪明的大脑
0:41.760–0:42.800
zh它会思考
0:42.800–0:43.700
zh会说话
0:43.700–0:45.400
zh但是它光有大脑
0:45.400–0:46.900
zh是没法帮你完成一个
0:46.900–0:48.400
zh现实世界里的具体任务的
0:48.400–0:49.900
zh它得有手有脚
0:49.900–0:51.100
zh得有工具
0:51.100–0:52.100
zh得有记忆
0:52.100–0:53.300
zh得有个工作台
0:53.300–0:55.000
zh这个harness就是给它提供
0:55.000–0:57.940
zh身体操作系统和工作环境的那一整套东西
0:57.940–0:59.442
zhDeepSeaKarnes最核心的设计理念叫
0:59.442–1:00.740
enEverything is a Plugin
1:00.740–1:02.740
zh翻译过来就是一切皆插件
1:02.740–1:04.740
zh你用哪个大语言模型可以换
1:04.740–1:06.840
zh你需要它用什么工具可以换
1:06.840–1:09.640
zh它的记忆系统存储方式任务调度方法
1:09.640–1:11.740
zh甚至是用戶界面全都可以換
1:11.740–1:13.240
zh开发者就像搭积木一样
1:13.240–1:15.840
zh用配置的方式就能把这些能力重新组合起来
1:15.840–1:17.340
zh而不用动框架本身的代码
1:17.340–1:19.540
zh这就带来了几个非常突出的优点
1:19.540–1:21.840
zh第一 开放性和可组合性超级强
1:21.840–1:24.840
zh比如说一家公司想搞一套自己的内部智能体
1:24.840–1:27.540
zh又不想被某一家模型公司给绑架
1:27.540–1:30.040
zh那就可以把不同公司的模型都接進這個Harness裡
1:30.040–1:32.640
zh遇到复杂的推理任务就调用能力最强的那个模型
1:32.640–1:33.940
zh遇到普通的整理任务
1:33.940–1:35.840
zh就用一个成本更低的模型
1:35.840–1:37.440
zh甚至处理一些敏感数据
1:37.440–1:40.340
zh可以直接用部署在自己服务器上的本地模型
1:40.340–1:41.640
zh这就非常灵活了
1:41.640–1:42.240
zh第二
1:42.240–1:43.840
zh它的运行过程非常透明
1:43.840–1:45.040
zh它会详细记录下
1:45.040–1:46.640
zh模型每一步都看到了什么
1:46.640–1:48.040
zh系统给了它什么指令
1:48.040–1:49.140
zh它调用了什么工具
1:49.140–1:51.340
zh又派出了哪个小助手去干活
1:51.340–1:54.740
zh整個任務過程可以被恢復、搜索、分叉和重放
1:54.740–1:56.740
zh这一点对开发者来说太重要了
1:56.740–1:59.140
zh因为AI智能体最让人头疼的一个问题就是
1:59.140–1:59.940
zh它要是做错了事
1:59.940–2:01.240
zh你根本不知道它为什么错
2:01.240–2:03.440
zh有了这份完整的黑匣子飞行记录
2:03.440–2:05.740
zh调试评估和审计就都有了依据
2:05.740–2:06.240
zh第三
2:06.240–2:08.240
zh它不只提供一种固定的工作模式
2:08.240–2:10.840
zh它有标准模式适合绝大多数任务
2:10.840–2:12.340
zh有代码模式
2:12.340–2:15.440
zh让模型直接写程序来组织复杂的工具调用
2:15.440–2:17.940
zh還有最小模式只保留最核心的功能
2:17.940–2:20.420
zh方便测试模型最原始的智能体能力
2:20.420–2:21.860
zh甚至还有一个Creator模式
2:21.860–2:24.500
zh专门用来设计新的插件和智能体模板
2:24.500–2:25.860
zh当然缺点也很明显
2:25.860–2:27.820
zhDeepSeek Harness更像是一个基础设施
2:27.820–2:29.340
zh一个给专业人士用的工具包
2:29.340–2:30.700
zh而不是咱们普通人下载下来
2:30.700–2:32.220
zh就能直接当办公助手用的
2:32.220–2:34.500
zh模型怎么选 工具怎么接 权限怎么配
2:34.500–2:36.700
zh数据怎么存 这些都得你自己来负责
2:36.700–2:39.260
zh而且它目前还处在开发者预览阶段
2:39.260–2:41.220
zh接口和插件生态都还在快速变化
2:41.220–2:42.860
zh所以它最大的价值
2:42.860–2:45.460
zh不是让你马上扔掉现在的AI助手
2:45.460–2:48.020
zh而是为那些有开发能力的企业或者团队
2:48.020–2:50.420
zh提供了一套可控可扩展的
2:50.420–2:51.260
zhagent底盘
2:51.260–2:51.760
zh
2:51.760–2:54.060
zh说完了需要自己动手组装的底盘
2:54.060–2:56.300
zh我们再来看一个已经组装好加满油
2:56.300–2:57.700
zh随时能开的整车
2:57.700–2:58.900
zh腾讯的workbody
2:58.900–3:00.180
zh如果说deep-sea carless
3:00.180–3:01.820
zh是给开发者准备的乐高积木
3:01.820–3:03.420
zh那workbody就是一辆已经组装好的
3:03.420–3:04.860
zh设计好所有细节的汽车
3:04.860–3:06.340
zh它的核心目标非常明确
3:06.340–3:09.260
zh就是让普通的职场人用一句大白话
3:09.260–3:11.620
zh就能把一个相对完整的工作任务
3:11.620–3:12.920
zh交给AI去完成
3:12.920–3:14.080
zhWorkBuddy强调的是
3:14.080–3:15.020
zh全场景办公
3:15.020–3:15.880
zh多专家协作
3:15.880–3:16.720
zh和开箱即用
3:16.720–3:18.420
zh你可以用它来搜集资料
3:18.420–3:19.480
zh做市场调研
3:19.480–3:20.480
zh分析表格
3:20.480–3:21.580
zh生成PPT
3:21.580–3:22.880
zh写内容整理文件
3:22.880–3:23.880
zh甚至写点代码
3:23.880–3:25.420
zh你只需要告诉它你的目标
3:25.420–3:26.620
zh它会自己先去理解
3:26.620–3:27.580
zh然后把任务拆解
3:27.580–3:29.180
zh再调用不同领域的专家
3:29.180–3:29.980
zh并行处理
3:29.980–3:31.420
zh最后把结果交到你手上
3:31.420–3:32.980
zh你还可以检查和修改
3:32.980–3:34.020
zhWorkBuddy最大的优点
3:34.020–3:35.580
zh首先就是使用门槛极低
3:35.580–3:36.620
zh你完全不需要懂什么
3:36.620–3:37.220
zhPython编程
3:37.220–3:37.820
zhDocker容器
3:37.820–3:40.580
zhAPI要像量数据库这些听起来就头大的词
3:40.580–3:41.900
zh安装好之后直接就能用
3:41.900–3:43.660
zh这对大多数人来说太重要了
3:43.660–3:45.140
zh因为真正决定生产力的
3:45.140–3:46.740
zh往往不是理论上限有多高
3:46.740–3:48.540
zh而是一个工具能不能在10分钟内
3:48.540–3:49.980
zh就开始帮你创造价值
3:49.980–3:51.860
zh第二个优点是它对中文办公
3:51.860–3:53.540
zh和国内生态的适配特别好
3:53.540–3:55.740
zh它覆盖了Windows和macOS系统
3:55.740–3:57.700
zh还打通了桌面端主流的
3:57.700–3:59.860
zh即时通讯工具和微信小程序
3:59.860–4:02.580
zh无论是写中文报告做PPT处理Excel
4:02.580–4:04.420
zh还是跟国内企业的沟通场景
4:04.420–4:05.860
zhWorkbody的产品设计
4:05.860–4:07.860
zh都更贴近我们的日常办公习惯
4:07.860–4:08.860
zh第三个优点
4:08.860–4:11.460
zh是它把复杂的多智能体协作
4:11.460–4:13.760
zh包装成了一个用户能听懂的概念
4:13.760–4:14.960
zh叫专家团队
4:14.960–4:17.060
zh你不需要自己去设计什么研究agent
4:17.060–4:18.660
zh数据agent 协作agent
4:18.660–4:20.360
zh你只需要描述你的最终目标
4:20.360–4:22.060
zh系统会自动帮你组织
4:22.060–4:23.860
zh不同角色的专家来协作
4:23.860–4:26.660
zh这种把复杂技术藏在产品界面背后的设计
4:26.660–4:28.260
zh大大降低了用户的理解成本
4:28.260–4:29.560
zh当然 成品化也意味着
4:29.560–4:31.660
zh你失去了一部分底层的控制权
4:31.660–4:33.260
zh你很难像用开源框架那样
4:33.260–4:35.820
zh完全掌握它内部的每一个运行细节
4:35.820–4:37.100
zh它的透明度
4:37.100–4:39.140
zh可定制程度和模型选择的自由度
4:39.140–4:40.740
zh通常是不如DeepSeek Harness
4:40.740–4:42.700
zh或者我们接下来要说的Herms Agent的
4:42.700–4:45.060
zh而且对于一些特别复杂的代码仓库
4:45.060–4:46.380
zh严格的软件测试任务
4:46.380–4:49.460
zhWorkBuddy也未必比那些更专业的编码Agent有优势
4:49.460–4:52.020
zh所以WorkBuddy最适合的是谁呢
4:52.020–4:54.180
zh就是那些希望马上提升办公效率
4:54.180–4:56.300
zh但又不愿意投入大量时间去研究
4:56.300–4:57.660
zh部署和配置系统的人
4:57.660–5:01.100
zh它的竞争力不在于某一项底层技术有多么领先
5:01.100–5:05.220
zh而在于它把模型、工具、专家、文件和办公入口
5:05.220–5:07.380
zh整合成了一个可以直接上手用的产品
5:07.380–5:09.460
zh接下来我们聊聊一个很有意思的agent
5:09.460–5:10.620
zh叫做Hermes Agent
5:10.620–5:13.660
zh它是由一个叫Nous Research的团队开发的
5:13.660–5:16.340
zh这个agent最核心的理念跟前面两个都不太一样
5:16.340–5:18.860
zh它认为一个真正有价值的智能体
5:18.860–5:20.700
zh不应该每次跟你对话都像第一次见面
5:20.700–5:23.380
zh而应该在长期的使用中慢慢形成记忆
5:23.380–5:24.620
zh掌握你的工作习惯
5:24.620–5:25.900
zh并且把成功的经验
5:25.900–5:27.780
zh沉淀成可以反复使用的技能
5:27.780–5:29.900
zhHermes最大的特点就是闭环学习
5:29.900–5:31.580
zh它有一套长期记忆系统
5:31.580–5:32.860
zh可以保存你的个人偏好
5:32.860–5:34.260
zh项目背景和过去的经验
5:34.260–5:35.780
zh它还有一个技能系统
5:35.780–5:38.540
zh可以把一个多步骤的复杂流程
5:38.540–5:40.740
zh保存成一个可以一键调用的skill
5:40.740–5:41.620
zh也就是技能
5:41.620–5:42.900
zh以后再遇到类似的任务
5:42.900–5:44.180
zh它就不必重新摸索了
5:44.180–5:45.340
zh而是可以直接调用
5:45.340–5:46.620
zh已经形成的工作方法
5:46.620–5:47.140
zh打个比方
5:47.140–5:48.660
zh这就有点像一个实习生
5:48.660–5:49.940
zh刚来的时候什么都不会
5:49.940–5:51.020
zh但你在带他的过程中
5:51.020–5:51.740
zh他会犯错
5:51.740–5:52.580
zh你会纠正他
5:52.580–5:54.300
zh慢慢的他学会了怎么做报告
5:54.300–5:55.140
zh怎么分析数据
5:55.140–5:56.780
zh下次再让他做类似的工作
5:56.780–5:57.700
zh他就能直接上手
5:57.700–5:58.740
zh甚至做的又快又好
5:58.740–5:59.500
zhHermes就是这样
5:59.500–6:01.380
zh如果他在执行任务时走了弯路
6:01.380–6:02.620
zh最后找到了正确的方法
6:02.620–6:03.900
zh或者你纠正了他的做法
6:03.900–6:04.820
zh他可以把这些经验
6:04.820–6:05.860
zh写进他的技能库里
6:05.860–6:07.340
zh所以Hermes的价值
6:07.340–6:08.980
zh是会随着你使用它的时间
6:08.980–6:09.820
zh增长而增长的
6:09.820–6:11.660
zh他不是简单的记住聊天内容
6:11.660–6:13.460
zh而是在尝试把过去的经验
6:13.460–6:14.660
zh转化为程序化的工作流程
6:14.660–6:16.220
zh可复用的工作流程
6:16.220–6:17.420
zhHermes的第二个优点
6:17.420–6:18.900
zh是模型自由度很高
6:18.900–6:20.700
zh它可以连接OpenAI
6:20.700–6:21.500
enClaude
6:21.500–6:22.500
enGemini
6:22.500–6:23.500
enDeepSeek
6:23.500–6:25.340
zhQianwen等各种云端模型
6:25.340–6:26.700
zh甚至你本地的模型也行
6:26.700–6:29.020
zh你的长期记忆、技能和工具
6:29.020–6:31.180
zh是属于Hermes这个员工本身的
6:31.180–6:33.460
zh而不是绑定在某一个特定的大模型上
6:33.460–6:34.140
zh也就是说
6:34.140–6:36.420
zh你可以随时给这个员工换个大脑
6:36.420–6:38.180
zh但他已经学会的工作方法还在
6:38.180–6:39.860
zh第三个优点是它适合
6:39.860–6:41.060
zh长期在线运行
6:41.060–6:42.620
zh你可以把它部署在自己的
6:42.620–6:44.620
zh电脑上或者云端的服务器里
6:44.620–6:45.860
enTelegram
6:45.860–6:46.360
enDiscord
6:46.360–6:46.860
enSlack
6:46.860–6:47.393
enWhatsApp
6:47.393–6:48.760
zh非输 企业微信
6:48.760–6:50.100
zh这些渠道跟他交互
6:50.100–6:52.340
zh这意味着就算你人不在电脑前
6:52.340–6:53.900
zh也可以通过手机给他发个任务
6:53.900–6:55.440
zh让云端的agent继续帮你工作
6:55.440–6:57.760
zh他还内置了定时任务和子agent的能力
6:57.760–6:59.500
zh特别适合用来做周期性的报告
6:59.500–7:01.640
zh资料搜集 这类长期自动化任务
7:01.640–7:03.640
zh不过 关于Hermes的自进化
7:03.640–7:05.200
zh这里有一个非常重要的澄清
7:05.200–7:07.540
zh他通常不是自己重新训练的一个大语言模型
7:07.540–7:08.940
zh也不是说用了一段时间之后
7:08.940–7:11.440
zh模型本身的神经网络权重就自动改变了
7:11.440–7:12.900
zh他所谓的成长主要发生在
7:12.900–7:15.500
zh在技能和系统提示这些层面上
7:15.500–7:17.060
zh它有一个叫Self Evolution
7:17.060–7:18.700
zh也就是自我进化的项目
7:18.700–7:20.980
zh会利用执行轨迹和评估数据
7:20.980–7:22.860
zh来生成和优化技能和提示词
7:22.860–7:24.660
zh但并不是在修改模型本身
7:24.660–7:26.900
zh这更接近于是工作流程
7:26.900–7:28.540
zh和提示系统的迭代
7:28.540–7:30.420
zh而不是模型的重新训练
7:30.420–7:31.260
zh这种机制
7:31.260–7:32.300
zh既是它的优势
7:32.300–7:33.260
zh也带来了风险
7:33.260–7:33.820
zh你想想
7:33.820–7:35.860
zh如果一个agent总结了错误的经验
7:35.860–7:36.780
zh他也可能把这个错误
7:36.780–7:37.620
zh写进他的记忆里
7:37.620–7:39.140
zh如果某一次偶然的特殊情况
7:39.140–7:40.460
zh被他误认为是普遍规律
7:40.460–7:42.780
zh那这个错误的流程就可能在以后被反复调用
7:42.780–7:46.500
zh所以Hermes提供了记忆写入和技能写入的审批机制
7:46.500–7:49.580
zh比较稳妥的做法是让agent先提出修改建议
7:49.580–7:51.620
zh然后由人来查看差异并批准
7:51.620–7:54.220
zh而不是让他完全不受控制的修改自己
7:54.220–7:55.860
zh这也给我们一个很重要的启发
7:55.860–7:58.740
zh一个AI的自我改进不能只看他有没有学习能力
7:58.740–8:00.300
zh还得看他有没有平衡能力
8:00.300–8:01.100
zh回滾
8:01.100–8:02.400
zh審批和安全邊界
8:02.400–8:03.900
zh没有验证机制的自我学习
8:03.900–8:05.100
zh可能只是让他在
8:05.100–8:06.600
zh更有信心的重复错误
8:06.600–8:09.100
zh最后我们来看看OpenAI的Codex
8:09.100–8:10.300
zh很多人对Codex的印象
8:10.300–8:12.400
zh可能还停留在他是一个编码助手
8:12.400–8:14.640
zh但现在它已经发展成一个由桌面端
8:14.640–8:17.800
zh命令行 IDE插件和云端环境组成的完整体系了
8:17.800–8:20.280
zh严格来说 OpenAI 把那些通用的研究
8:20.280–8:23.080
zh报告 表格 PPT 和文件交付等功能
8:23.080–8:24.920
zh更多的放在了 ChatGPT Work 里
8:24.920–8:28.520
zh而 Codex 仍然以代碼、項目、工具和工程執行為核心
8:28.520–8:31.000
zh当然 这两者的能力正在越来越多地共享
8:31.000–8:34.160
zhCodeX 最大的优点是它特别强调做完并验证
8:34.160–8:36.160
zh而不仅仅是给你一些建议
8:36.160–8:38.200
zh它可以读取你整个项目的文件
8:38.200–8:39.840
zh搜索代码 修改多个文件
8:39.840–8:42.440
zh运行命令 执行测试 查看报错信息
8:42.440–8:44.240
zh然后根据测试结果继续修复问题
8:44.240–8:46.640
zh最後交付給你的不只是一段示例代碼
8:46.640–8:48.640
zh而是一个完整的修改摘要
8:48.640–8:51.040
zh文件差異對比、測試結果
8:51.040–8:53.140
zh以及可以审查的最终成果
8:53.140–8:56.340
zh第二个优点是它的工程环境比较完整
8:56.340–8:57.740
zh你在本地的 Codex
8:57.740–9:00.640
zh可以直接使用你电脑上已经装好的编译器
9:00.640–9:02.140
zh测试工具和项目依赖
9:02.140–9:03.140
zh而雲端的 Codex
9:03.140–9:05.140
zh可以为不同的任务建立隔离的环境
9:05.140–9:07.540
zh让多个任务在后台并行运行
9:07.540–9:08.140
zh任务完成后
9:08.140–9:09.860
zh你可以清楚地看到他都改了些什么
9:09.860–9:11.220
zh可以要求他继续调整
9:11.220–9:14.460
zh或者直接把修改提交到你的代码仓库
9:14.460–9:15.380
zh第三个优点是
9:15.380–9:17.780
zh它的权限和安全边界做的比较成熟
9:17.780–9:20.900
zhCodex通过沙箱来限制它对文件和网络的访问
9:20.900–9:22.260
zh在执行一些高风险命令时
9:22.260–9:23.940
zh或者跨越权限边界的时候
9:23.940–9:25.140
zh会向你请求批准
9:25.140–9:27.340
zh这种设计可能会让操作显得有点谨慎
9:27.340–9:29.620
zh但对于一个能够真实修改文件
9:29.620–9:32.380
zh运行程序和连接外部工具的智能体来说
9:32.380–9:35.020
zh这种谨慎本身就是可靠性的重要组成部分
9:35.020–9:38.620
zh第四个优点是它把编码研究和文件交付连接了起来
9:38.620–9:40.620
zh在ChatGPT Work这个更大的环境里
9:40.620–9:43.220
zh同一套能力还可以用来生成和检查文档
9:43.220–9:47.020
zh表格、PPT、PDF、网站和数据分析结果
9:47.020–9:50.620
zh这意味着一个复杂的任务可以从资料搜集开始
9:50.620–9:52.020
zh经过分析和程序处理
9:52.020–9:54.120
zh最后形成可以直接使用的文件
9:54.120–9:56.020
zh整个流程都可以在一个环境里完成
9:56.020–9:57.920
zh当然Codex的局限也很清楚
9:57.920–10:01.720
zh它主要围绕OpenAI自家的模型和ChatGPT服务来运行
10:01.720–10:04.920
zh模型的自由度不如Hermes或者DeepSeek Harness
10:04.920–10:07.480
zh它虽然也支持技能记忆和项目规则
10:07.480–10:10.320
zh但不会把自动修改自己作为最核心的卖点
10:10.320–10:11.680
zh它的取向更加保守
10:11.680–10:14.200
zh宁可让流程可审查可验证
10:14.200–10:16.520
zh也不轻易让agent自行改变长期规则
10:16.520–10:17.020
zh好了
10:17.020–10:18.840
zh现在我们把这四个智能体放在一起
10:18.840–10:20.600
zh就能得到一个非常清晰的结论了
10:20.600–10:23.040
zh如果你的目标是开发一个自己的agent的产品
10:23.040–10:25.480
zh那DeepSeek Harness最有吸引力
10:25.480–10:27.440
zh因为它开放模块化
10:27.440–10:28.800
zh运行过程可追溯
10:28.800–10:31.520
zh如果你的目标是普通办公人员想马上提高效率
10:31.520–10:32.600
zh那Workbody最方便
10:32.600–10:34.920
zh因为它把复杂的技术包装成了用户友好的界面
10:34.920–10:37.800
zh如果你的目标是培养一个能长期在线
10:37.800–10:40.000
zh逐渐熟悉你个人工作方式的智能体
10:40.000–10:41.640
zh那Hermes最有特色
10:41.640–10:43.480
zh如果你的目标是完成复杂的代码
10:43.480–10:45.960
zh工具执行和需要严格验证的专业任务
10:45.960–10:47.920
zh那Codex的综合完成度更高
10:47.920–10:51.560
zh你看他们代表的其实是4条完全不同的路线
10:51.560–10:53.960
zhDeepSeek Harness追求的是架构上的自由
10:53.960–10:55.880
zhWorkBuddy追求的是使用的便利
10:55.880–10:57.960
zhHermes追求的是长期的成长
10:57.960–11:00.200
zh而Codex追求的是可靠的交付
11:00.200–11:00.840
zh聊到这里
11:00.840–11:03.080
zh还有三点特别值得我们进一步思考
11:03.080–11:06.720
zh第一 未来agent的竞争绝对不会只发生在模型层面
11:06.720–11:08.080
zh模型当然很重要
11:08.080–11:09.480
zh它决定了智力的上限
11:09.480–11:12.920
zh但真正决定这个智能体能不能稳定落地完成实际工作的
11:12.920–11:16.120
zh是模型之外的那個架構也就是它的運行底座
11:16.120–11:17.080
zh它能用什么工具
11:17.080–11:18.480
zh能访问哪些文件
11:18.480–11:19.160
zh怎么记忆
11:19.160–11:20.280
zh怎么调度任务
11:20.280–11:21.400
zh出错了能不能恢复
11:21.400–11:25.080
zh以及我们作为使用者能不能看清它到底都做了什么
11:25.080–11:26.360
zh这些才是关键
11:26.360–11:28.480
zh第二 我们刚才聊到的所谓自进化
11:28.480–11:30.600
zh绝对不能脱离一个有效的评估系统
11:30.600–11:34.120
zh一个agent能够修改自己的技能并不等于他一定会变得更好
11:34.120–11:37.360
zh真正有效的自我改进至少需要完整的执行记录
11:37.360–11:40.640
zh客觀的測試數據 效果比較以及必要的人類審批
11:40.640–11:42.240
zh以及出错了能回滚的方案
11:42.240–11:46.520
zh否則他可能只是在更有信心的把你最初交給他的那個錯誤
11:46.520–11:48.240
zh一遍又一遍的固化下来
11:48.240–11:50.960
zh第三 最好的agent不一定是最自主的agent
11:50.960–11:53.360
zh对于很多低风险的重复性的任务
11:53.360–11:55.800
zh高程度的自动化确实能节省大量时间
11:55.800–12:00.160
zh但是当涉及到付款 删除文件 发布公开内容
12:00.160–12:03.440
zh修改正式代码或者处理敏感数据这些关键操作时
12:03.440–12:05.760
zh一个能够暂停下来向你解释情况
12:05.760–12:06.960
zh并等待你确认的agent
12:06.960–12:09.760
zh它的价值其实远远高于一个完全自主
12:09.760–12:11.160
zh从不请示的agent
12:11.160–12:14.240
zh一個成熟的智能體系統不是要取消人的判斷
12:14.240–12:15.760
zh而是要把人的判断
12:15.760–12:18.160
zh集中到那些最关键的节点上
12:18.160–12:19.920
zh最后我们来总结一下今天的内容
12:19.920–12:20.960
enDeepSake Harness
12:20.960–12:24.360
zh最适合作为构建自由agent系统的开放底座
12:24.360–12:25.560
zh腾讯的WorkBuddy
12:25.560–12:26.320
zh最省事
12:26.320–12:28.920
zh适合想直接进入日常办公场景的用户
12:28.920–12:32.560
zhHermes Agent最像一个会积累记忆和技能的长期AI员工
12:32.560–12:35.800
zh而OpenAI的Codex则最擅长把复杂的专业工作
12:35.800–12:38.080
zh真正做完并进行严格的验证
12:38.080–12:41.480
zh所以下次你在选择的时候不要只问谁最强
12:41.480–12:43.440
zh而要问自己三个更具体的问题
12:43.440–12:45.320
zh第一 我需要的是一个成品工具
12:45.320–12:46.880
zh还是一个可以自己开发的框架
12:46.880–12:49.840
zh第二 我更看重的是即时的效率提升
12:49.840–12:51.520
zh还是长期的成长和陪伴
12:51.520–12:55.160
zh第三 我是否需要掌握对模型
12:55.160–12:58.360
zh数据 权限和运行环境的控制权
12:58.360–12:59.960
zh当你把这三个问题想清楚之后
12:59.960–13:01.960
zh這四者之間的選擇就一点都不模糊了
13:01.960–13:03.160
zh他们不是简单的
13:03.160–13:04.640
zh谁替代谁的关系
13:04.640–13:06.720
zh而是分别服务于不同层级
13:06.720–13:07.600
zh不同需求的
13:07.600–13:09.120
zh未来更常见的情况
13:09.120–13:10.760
zh可能也不是某一个超级agent
13:10.760–13:11.720
zh包揽所有工作
13:11.720–13:13.800
zh而是像今天聊到的成品办公agent
13:13.800–13:14.760
zh专业工程agent
13:14.760–13:16.760
zh长期个人agent和企业开源底座
13:16.760–13:17.720
zh他们相互配合
13:17.720–13:19.720
zh共同组成一个真正好用的
13:19.720–13:20.720
zhAI工作系统
0:00.000–0:01.360
2026年AI智能体
0:01.360–0:02.960
也就是我们常说的AI agent
0:02.960–0:03.840
一下子就火了
0:03.840–0:05.760
你随便一搜就能看到各种各样的产品
0:05.760–0:07.320
比如DeepSeaKarnes
0:07.320–0:08.320
腾讯的WorkBody
0:08.320–0:10.000
一个叫HermesAgent的
0:10.000–0:11.520
还有OpenAI的Codex
0:11.520–0:13.200
乍一看他们好像
0:13.200–0:15.120
都差不多都是能自己干活的AI
0:15.120–0:16.960
我们是不是只要比比谁更聪明就行了
0:16.960–0:18.160
他们四个其实代表了
0:18.160–0:20.240
四种完全不同的发展路线
0:20.240–0:22.080
今天咱们最重要的任务
0:22.080–0:23.840
就不是给他们排个1234
0:23.840–0:25.520
而是要把这四家的底细都摸清楚
0:25.520–0:27.760
他们各自到底在解决什么问题
0:27.760–0:28.720
最厉害的地方在哪
0:28.720–0:30.380
又分别适合什么样的人去用
0:30.380–0:31.460
咱们一个一个来看
0:31.460–0:33.220
先说deepseek harness
0:33.220–0:35.560
这个名字里的harness翻译过来有点像
0:35.560–0:38.320
智能体的运行底座或者框架
0:38.320–0:39.120
你可以这么理解
0:39.120–0:40.320
一个大模型
0:40.320–0:41.760
就像一个聪明的大脑
0:41.760–0:42.800
它会思考
0:42.800–0:43.700
会说话
0:43.700–0:45.400
但是它光有大脑
0:45.400–0:46.900
是没法帮你完成一个
0:46.900–0:48.400
现实世界里的具体任务的
0:48.400–0:49.900
它得有手有脚
0:49.900–0:51.100
得有工具
0:51.100–0:52.100
得有记忆
0:52.100–0:53.300
得有个工作台
0:53.300–0:55.000
这个harness就是给它提供
0:55.000–0:57.940
身体操作系统和工作环境的那一整套东西
0:57.940–0:59.442
DeepSeaKarnes最核心的设计理念叫
0:59.442–1:00.740
Everything is a Plugin
1:00.740–1:02.740
翻译过来就是一切皆插件
1:02.740–1:04.740
你用哪个大语言模型可以换
1:04.740–1:06.840
你需要它用什么工具可以换
1:06.840–1:09.640
它的记忆系统存储方式任务调度方法
1:09.640–1:11.740
甚至是用戶界面全都可以換
1:11.740–1:13.240
开发者就像搭积木一样
1:13.240–1:15.840
用配置的方式就能把这些能力重新组合起来
1:15.840–1:17.340
而不用动框架本身的代码
1:17.340–1:19.540
这就带来了几个非常突出的优点
1:19.540–1:21.840
第一 开放性和可组合性超级强
1:21.840–1:24.840
比如说一家公司想搞一套自己的内部智能体
1:24.840–1:27.540
又不想被某一家模型公司给绑架
1:27.540–1:30.040
那就可以把不同公司的模型都接進這個Harness裡
1:30.040–1:32.640
遇到复杂的推理任务就调用能力最强的那个模型
1:32.640–1:33.940
遇到普通的整理任务
1:33.940–1:35.840
就用一个成本更低的模型
1:35.840–1:37.440
甚至处理一些敏感数据
1:37.440–1:40.340
可以直接用部署在自己服务器上的本地模型
1:40.340–1:41.640
这就非常灵活了
1:41.640–1:42.240
第二
1:42.240–1:43.840
它的运行过程非常透明
1:43.840–1:45.040
它会详细记录下
1:45.040–1:46.640
模型每一步都看到了什么
1:46.640–1:48.040
系统给了它什么指令
1:48.040–1:49.140
它调用了什么工具
1:49.140–1:51.340
又派出了哪个小助手去干活
1:51.340–1:54.740
整個任務過程可以被恢復、搜索、分叉和重放
1:54.740–1:56.740
这一点对开发者来说太重要了
1:56.740–1:59.140
因为AI智能体最让人头疼的一个问题就是
1:59.140–1:59.940
它要是做错了事
1:59.940–2:01.240
你根本不知道它为什么错
2:01.240–2:03.440
有了这份完整的黑匣子飞行记录
2:03.440–2:05.740
调试评估和审计就都有了依据
2:05.740–2:06.240
第三
2:06.240–2:08.240
它不只提供一种固定的工作模式
2:08.240–2:10.840
它有标准模式适合绝大多数任务
2:10.840–2:12.340
有代码模式
2:12.340–2:15.440
让模型直接写程序来组织复杂的工具调用
2:15.440–2:17.940
還有最小模式只保留最核心的功能
2:17.940–2:20.420
方便测试模型最原始的智能体能力
2:20.420–2:21.860
甚至还有一个Creator模式
2:21.860–2:24.500
专门用来设计新的插件和智能体模板
2:24.500–2:25.860
当然缺点也很明显
2:25.860–2:27.820
DeepSeek Harness更像是一个基础设施
2:27.820–2:29.340
一个给专业人士用的工具包
2:29.340–2:30.700
而不是咱们普通人下载下来
2:30.700–2:32.220
就能直接当办公助手用的
2:32.220–2:34.500
模型怎么选 工具怎么接 权限怎么配
2:34.500–2:36.700
数据怎么存 这些都得你自己来负责
2:36.700–2:39.260
而且它目前还处在开发者预览阶段
2:39.260–2:41.220
接口和插件生态都还在快速变化
2:41.220–2:42.860
所以它最大的价值
2:42.860–2:45.460
不是让你马上扔掉现在的AI助手
2:45.460–2:48.020
而是为那些有开发能力的企业或者团队
2:48.020–2:50.420
提供了一套可控可扩展的
2:50.420–2:51.260
agent底盘
2:51.260–2:51.760
2:51.760–2:54.060
说完了需要自己动手组装的底盘
2:54.060–2:56.300
我们再来看一个已经组装好加满油
2:56.300–2:57.700
随时能开的整车
2:57.700–2:58.900
腾讯的workbody
2:58.900–3:00.180
如果说deep-sea carless
3:00.180–3:01.820
是给开发者准备的乐高积木
3:01.820–3:03.420
那workbody就是一辆已经组装好的
3:03.420–3:04.860
设计好所有细节的汽车
3:04.860–3:06.340
它的核心目标非常明确
3:06.340–3:09.260
就是让普通的职场人用一句大白话
3:09.260–3:11.620
就能把一个相对完整的工作任务
3:11.620–3:12.920
交给AI去完成
3:12.920–3:14.080
WorkBuddy强调的是
3:14.080–3:15.020
全场景办公
3:15.020–3:15.880
多专家协作
3:15.880–3:16.720
和开箱即用
3:16.720–3:18.420
你可以用它来搜集资料
3:18.420–3:19.480
做市场调研
3:19.480–3:20.480
分析表格
3:20.480–3:21.580
生成PPT
3:21.580–3:22.880
写内容整理文件
3:22.880–3:23.880
甚至写点代码
3:23.880–3:25.420
你只需要告诉它你的目标
3:25.420–3:26.620
它会自己先去理解
3:26.620–3:27.580
然后把任务拆解
3:27.580–3:29.180
再调用不同领域的专家
3:29.180–3:29.980
并行处理
3:29.980–3:31.420
最后把结果交到你手上
3:31.420–3:32.980
你还可以检查和修改
3:32.980–3:34.020
WorkBuddy最大的优点
3:34.020–3:35.580
首先就是使用门槛极低
3:35.580–3:36.620
你完全不需要懂什么
3:36.620–3:37.220
Python编程
3:37.220–3:37.820
Docker容器
3:37.820–3:40.580
API要像量数据库这些听起来就头大的词
3:40.580–3:41.900
安装好之后直接就能用
3:41.900–3:43.660
这对大多数人来说太重要了
3:43.660–3:45.140
因为真正决定生产力的
3:45.140–3:46.740
往往不是理论上限有多高
3:46.740–3:48.540
而是一个工具能不能在10分钟内
3:48.540–3:49.980
就开始帮你创造价值
3:49.980–3:51.860
第二个优点是它对中文办公
3:51.860–3:53.540
和国内生态的适配特别好
3:53.540–3:55.740
它覆盖了Windows和macOS系统
3:55.740–3:57.700
还打通了桌面端主流的
3:57.700–3:59.860
即时通讯工具和微信小程序
3:59.860–4:02.580
无论是写中文报告做PPT处理Excel
4:02.580–4:04.420
还是跟国内企业的沟通场景
4:04.420–4:05.860
Workbody的产品设计
4:05.860–4:07.860
都更贴近我们的日常办公习惯
4:07.860–4:08.860
第三个优点
4:08.860–4:11.460
是它把复杂的多智能体协作
4:11.460–4:13.760
包装成了一个用户能听懂的概念
4:13.760–4:14.960
叫专家团队
4:14.960–4:17.060
你不需要自己去设计什么研究agent
4:17.060–4:18.660
数据agent 协作agent
4:18.660–4:20.360
你只需要描述你的最终目标
4:20.360–4:22.060
系统会自动帮你组织
4:22.060–4:23.860
不同角色的专家来协作
4:23.860–4:26.660
这种把复杂技术藏在产品界面背后的设计
4:26.660–4:28.260
大大降低了用户的理解成本
4:28.260–4:29.560
当然 成品化也意味着
4:29.560–4:31.660
你失去了一部分底层的控制权
4:31.660–4:33.260
你很难像用开源框架那样
4:33.260–4:35.820
完全掌握它内部的每一个运行细节
4:35.820–4:37.100
它的透明度
4:37.100–4:39.140
可定制程度和模型选择的自由度
4:39.140–4:40.740
通常是不如DeepSeek Harness
4:40.740–4:42.700
或者我们接下来要说的Herms Agent的
4:42.700–4:45.060
而且对于一些特别复杂的代码仓库
4:45.060–4:46.380
严格的软件测试任务
4:46.380–4:49.460
WorkBuddy也未必比那些更专业的编码Agent有优势
4:49.460–4:52.020
所以WorkBuddy最适合的是谁呢
4:52.020–4:54.180
就是那些希望马上提升办公效率
4:54.180–4:56.300
但又不愿意投入大量时间去研究
4:56.300–4:57.660
部署和配置系统的人
4:57.660–5:01.100
它的竞争力不在于某一项底层技术有多么领先
5:01.100–5:05.220
而在于它把模型、工具、专家、文件和办公入口
5:05.220–5:07.380
整合成了一个可以直接上手用的产品
5:07.380–5:09.460
接下来我们聊聊一个很有意思的agent
5:09.460–5:10.620
叫做Hermes Agent
5:10.620–5:13.660
它是由一个叫Nous Research的团队开发的
5:13.660–5:16.340
这个agent最核心的理念跟前面两个都不太一样
5:16.340–5:18.860
它认为一个真正有价值的智能体
5:18.860–5:20.700
不应该每次跟你对话都像第一次见面
5:20.700–5:23.380
而应该在长期的使用中慢慢形成记忆
5:23.380–5:24.620
掌握你的工作习惯
5:24.620–5:25.900
并且把成功的经验
5:25.900–5:27.780
沉淀成可以反复使用的技能
5:27.780–5:29.900
Hermes最大的特点就是闭环学习
5:29.900–5:31.580
它有一套长期记忆系统
5:31.580–5:32.860
可以保存你的个人偏好
5:32.860–5:34.260
项目背景和过去的经验
5:34.260–5:35.780
它还有一个技能系统
5:35.780–5:38.540
可以把一个多步骤的复杂流程
5:38.540–5:40.740
保存成一个可以一键调用的skill
5:40.740–5:41.620
也就是技能
5:41.620–5:42.900
以后再遇到类似的任务
5:42.900–5:44.180
它就不必重新摸索了
5:44.180–5:45.340
而是可以直接调用
5:45.340–5:46.620
已经形成的工作方法
5:46.620–5:47.140
打个比方
5:47.140–5:48.660
这就有点像一个实习生
5:48.660–5:49.940
刚来的时候什么都不会
5:49.940–5:51.020
但你在带他的过程中
5:51.020–5:51.740
他会犯错
5:51.740–5:52.580
你会纠正他
5:52.580–5:54.300
慢慢的他学会了怎么做报告
5:54.300–5:55.140
怎么分析数据
5:55.140–5:56.780
下次再让他做类似的工作
5:56.780–5:57.700
他就能直接上手
5:57.700–5:58.740
甚至做的又快又好
5:58.740–5:59.500
Hermes就是这样
5:59.500–6:01.380
如果他在执行任务时走了弯路
6:01.380–6:02.620
最后找到了正确的方法
6:02.620–6:03.900
或者你纠正了他的做法
6:03.900–6:04.820
他可以把这些经验
6:04.820–6:05.860
写进他的技能库里
6:05.860–6:07.340
所以Hermes的价值
6:07.340–6:08.980
是会随着你使用它的时间
6:08.980–6:09.820
增长而增长的
6:09.820–6:11.660
他不是简单的记住聊天内容
6:11.660–6:13.460
而是在尝试把过去的经验
6:13.460–6:14.660
转化为程序化的工作流程
6:14.660–6:16.220
可复用的工作流程
6:16.220–6:17.420
Hermes的第二个优点
6:17.420–6:18.900
是模型自由度很高
6:18.900–6:20.700
它可以连接OpenAI
6:20.700–6:21.500
Claude
6:21.500–6:22.500
Gemini
6:22.500–6:23.500
DeepSeek
6:23.500–6:25.340
Qianwen等各种云端模型
6:25.340–6:26.700
甚至你本地的模型也行
6:26.700–6:29.020
你的长期记忆、技能和工具
6:29.020–6:31.180
是属于Hermes这个员工本身的
6:31.180–6:33.460
而不是绑定在某一个特定的大模型上
6:33.460–6:34.140
也就是说
6:34.140–6:36.420
你可以随时给这个员工换个大脑
6:36.420–6:38.180
但他已经学会的工作方法还在
6:38.180–6:39.860
第三个优点是它适合
6:39.860–6:41.060
长期在线运行
6:41.060–6:42.620
你可以把它部署在自己的
6:42.620–6:44.620
电脑上或者云端的服务器里
6:44.620–6:45.860
Telegram
6:45.860–6:46.360
Discord
6:46.360–6:46.860
Slack
6:46.860–6:47.393
WhatsApp
6:47.393–6:48.760
非输 企业微信
6:48.760–6:50.100
这些渠道跟他交互
6:50.100–6:52.340
这意味着就算你人不在电脑前
6:52.340–6:53.900
也可以通过手机给他发个任务
6:53.900–6:55.440
让云端的agent继续帮你工作
6:55.440–6:57.760
他还内置了定时任务和子agent的能力
6:57.760–6:59.500
特别适合用来做周期性的报告
6:59.500–7:01.640
资料搜集 这类长期自动化任务
7:01.640–7:03.640
不过 关于Hermes的自进化
7:03.640–7:05.200
这里有一个非常重要的澄清
7:05.200–7:07.540
他通常不是自己重新训练的一个大语言模型
7:07.540–7:08.940
也不是说用了一段时间之后
7:08.940–7:11.440
模型本身的神经网络权重就自动改变了
7:11.440–7:12.900
他所谓的成长主要发生在
7:12.900–7:15.500
在技能和系统提示这些层面上
7:15.500–7:17.060
它有一个叫Self Evolution
7:17.060–7:18.700
也就是自我进化的项目
7:18.700–7:20.980
会利用执行轨迹和评估数据
7:20.980–7:22.860
来生成和优化技能和提示词
7:22.860–7:24.660
但并不是在修改模型本身
7:24.660–7:26.900
这更接近于是工作流程
7:26.900–7:28.540
和提示系统的迭代
7:28.540–7:30.420
而不是模型的重新训练
7:30.420–7:31.260
这种机制
7:31.260–7:32.300
既是它的优势
7:32.300–7:33.260
也带来了风险
7:33.260–7:33.820
你想想
7:33.820–7:35.860
如果一个agent总结了错误的经验
7:35.860–7:36.780
他也可能把这个错误
7:36.780–7:37.620
写进他的记忆里
7:37.620–7:39.140
如果某一次偶然的特殊情况
7:39.140–7:40.460
被他误认为是普遍规律
7:40.460–7:42.780
那这个错误的流程就可能在以后被反复调用
7:42.780–7:46.500
所以Hermes提供了记忆写入和技能写入的审批机制
7:46.500–7:49.580
比较稳妥的做法是让agent先提出修改建议
7:49.580–7:51.620
然后由人来查看差异并批准
7:51.620–7:54.220
而不是让他完全不受控制的修改自己
7:54.220–7:55.860
这也给我们一个很重要的启发
7:55.860–7:58.740
一个AI的自我改进不能只看他有没有学习能力
7:58.740–8:00.300
还得看他有没有平衡能力
8:00.300–8:01.100
回滾
8:01.100–8:02.400
審批和安全邊界
8:02.400–8:03.900
没有验证机制的自我学习
8:03.900–8:05.100
可能只是让他在
8:05.100–8:06.600
更有信心的重复错误
8:06.600–8:09.100
最后我们来看看OpenAI的Codex
8:09.100–8:10.300
很多人对Codex的印象
8:10.300–8:12.400
可能还停留在他是一个编码助手
8:12.400–8:14.640
但现在它已经发展成一个由桌面端
8:14.640–8:17.800
命令行 IDE插件和云端环境组成的完整体系了
8:17.800–8:20.280
严格来说 OpenAI 把那些通用的研究
8:20.280–8:23.080
报告 表格 PPT 和文件交付等功能
8:23.080–8:24.920
更多的放在了 ChatGPT Work 里
8:24.920–8:28.520
而 Codex 仍然以代碼、項目、工具和工程執行為核心
8:28.520–8:31.000
当然 这两者的能力正在越来越多地共享
8:31.000–8:34.160
CodeX 最大的优点是它特别强调做完并验证
8:34.160–8:36.160
而不仅仅是给你一些建议
8:36.160–8:38.200
它可以读取你整个项目的文件
8:38.200–8:39.840
搜索代码 修改多个文件
8:39.840–8:42.440
运行命令 执行测试 查看报错信息
8:42.440–8:44.240
然后根据测试结果继续修复问题
8:44.240–8:46.640
最後交付給你的不只是一段示例代碼
8:46.640–8:48.640
而是一个完整的修改摘要
8:48.640–8:51.040
文件差異對比、測試結果
8:51.040–8:53.140
以及可以审查的最终成果
8:53.140–8:56.340
第二个优点是它的工程环境比较完整
8:56.340–8:57.740
你在本地的 Codex
8:57.740–9:00.640
可以直接使用你电脑上已经装好的编译器
9:00.640–9:02.140
测试工具和项目依赖
9:02.140–9:03.140
而雲端的 Codex
9:03.140–9:05.140
可以为不同的任务建立隔离的环境
9:05.140–9:07.540
让多个任务在后台并行运行
9:07.540–9:08.140
任务完成后
9:08.140–9:09.860
你可以清楚地看到他都改了些什么
9:09.860–9:11.220
可以要求他继续调整
9:11.220–9:14.460
或者直接把修改提交到你的代码仓库
9:14.460–9:15.380
第三个优点是
9:15.380–9:17.780
它的权限和安全边界做的比较成熟
9:17.780–9:20.900
Codex通过沙箱来限制它对文件和网络的访问
9:20.900–9:22.260
在执行一些高风险命令时
9:22.260–9:23.940
或者跨越权限边界的时候
9:23.940–9:25.140
会向你请求批准
9:25.140–9:27.340
这种设计可能会让操作显得有点谨慎
9:27.340–9:29.620
但对于一个能够真实修改文件
9:29.620–9:32.380
运行程序和连接外部工具的智能体来说
9:32.380–9:35.020
这种谨慎本身就是可靠性的重要组成部分
9:35.020–9:38.620
第四个优点是它把编码研究和文件交付连接了起来
9:38.620–9:40.620
在ChatGPT Work这个更大的环境里
9:40.620–9:43.220
同一套能力还可以用来生成和检查文档
9:43.220–9:47.020
表格、PPT、PDF、网站和数据分析结果
9:47.020–9:50.620
这意味着一个复杂的任务可以从资料搜集开始
9:50.620–9:52.020
经过分析和程序处理
9:52.020–9:54.120
最后形成可以直接使用的文件
9:54.120–9:56.020
整个流程都可以在一个环境里完成
9:56.020–9:57.920
当然Codex的局限也很清楚
9:57.920–10:01.720
它主要围绕OpenAI自家的模型和ChatGPT服务来运行
10:01.720–10:04.920
模型的自由度不如Hermes或者DeepSeek Harness
10:04.920–10:07.480
它虽然也支持技能记忆和项目规则
10:07.480–10:10.320
但不会把自动修改自己作为最核心的卖点
10:10.320–10:11.680
它的取向更加保守
10:11.680–10:14.200
宁可让流程可审查可验证
10:14.200–10:16.520
也不轻易让agent自行改变长期规则
10:16.520–10:17.020
好了
10:17.020–10:18.840
现在我们把这四个智能体放在一起
10:18.840–10:20.600
就能得到一个非常清晰的结论了
10:20.600–10:23.040
如果你的目标是开发一个自己的agent的产品
10:23.040–10:25.480
那DeepSeek Harness最有吸引力
10:25.480–10:27.440
因为它开放模块化
10:27.440–10:28.800
运行过程可追溯
10:28.800–10:31.520
如果你的目标是普通办公人员想马上提高效率
10:31.520–10:32.600
那Workbody最方便
10:32.600–10:34.920
因为它把复杂的技术包装成了用户友好的界面
10:34.920–10:37.800
如果你的目标是培养一个能长期在线
10:37.800–10:40.000
逐渐熟悉你个人工作方式的智能体
10:40.000–10:41.640
那Hermes最有特色
10:41.640–10:43.480
如果你的目标是完成复杂的代码
10:43.480–10:45.960
工具执行和需要严格验证的专业任务
10:45.960–10:47.920
那Codex的综合完成度更高
10:47.920–10:51.560
你看他们代表的其实是4条完全不同的路线
10:51.560–10:53.960
DeepSeek Harness追求的是架构上的自由
10:53.960–10:55.880
WorkBuddy追求的是使用的便利
10:55.880–10:57.960
Hermes追求的是长期的成长
10:57.960–11:00.200
而Codex追求的是可靠的交付
11:00.200–11:00.840
聊到这里
11:00.840–11:03.080
还有三点特别值得我们进一步思考
11:03.080–11:06.720
第一 未来agent的竞争绝对不会只发生在模型层面
11:06.720–11:08.080
模型当然很重要
11:08.080–11:09.480
它决定了智力的上限
11:09.480–11:12.920
但真正决定这个智能体能不能稳定落地完成实际工作的
11:12.920–11:16.120
是模型之外的那個架構也就是它的運行底座
11:16.120–11:17.080
它能用什么工具
11:17.080–11:18.480
能访问哪些文件
11:18.480–11:19.160
怎么记忆
11:19.160–11:20.280
怎么调度任务
11:20.280–11:21.400
出错了能不能恢复
11:21.400–11:25.080
以及我们作为使用者能不能看清它到底都做了什么
11:25.080–11:26.360
这些才是关键
11:26.360–11:28.480
第二 我们刚才聊到的所谓自进化
11:28.480–11:30.600
绝对不能脱离一个有效的评估系统
11:30.600–11:34.120
一个agent能够修改自己的技能并不等于他一定会变得更好
11:34.120–11:37.360
真正有效的自我改进至少需要完整的执行记录
11:37.360–11:40.640
客觀的測試數據 效果比較以及必要的人類審批
11:40.640–11:42.240
以及出错了能回滚的方案
11:42.240–11:46.520
否則他可能只是在更有信心的把你最初交給他的那個錯誤
11:46.520–11:48.240
一遍又一遍的固化下来
11:48.240–11:50.960
第三 最好的agent不一定是最自主的agent
11:50.960–11:53.360
对于很多低风险的重复性的任务
11:53.360–11:55.800
高程度的自动化确实能节省大量时间
11:55.800–12:00.160
但是当涉及到付款 删除文件 发布公开内容
12:00.160–12:03.440
修改正式代码或者处理敏感数据这些关键操作时
12:03.440–12:05.760
一个能够暂停下来向你解释情况
12:05.760–12:06.960
并等待你确认的agent
12:06.960–12:09.760
它的价值其实远远高于一个完全自主
12:09.760–12:11.160
从不请示的agent
12:11.160–12:14.240
一個成熟的智能體系統不是要取消人的判斷
12:14.240–12:15.760
而是要把人的判断
12:15.760–12:18.160
集中到那些最关键的节点上
12:18.160–12:19.920
最后我们来总结一下今天的内容
12:19.920–12:20.960
DeepSake Harness
12:20.960–12:24.360
最适合作为构建自由agent系统的开放底座
12:24.360–12:25.560
腾讯的WorkBuddy
12:25.560–12:26.320
最省事
12:26.320–12:28.920
适合想直接进入日常办公场景的用户
12:28.920–12:32.560
Hermes Agent最像一个会积累记忆和技能的长期AI员工
12:32.560–12:35.800
而OpenAI的Codex则最擅长把复杂的专业工作
12:35.800–12:38.080
真正做完并进行严格的验证
12:38.080–12:41.480
所以下次你在选择的时候不要只问谁最强
12:41.480–12:43.440
而要问自己三个更具体的问题
12:43.440–12:45.320
第一 我需要的是一个成品工具
12:45.320–12:46.880
还是一个可以自己开发的框架
12:46.880–12:49.840
第二 我更看重的是即时的效率提升
12:49.840–12:51.520
还是长期的成长和陪伴
12:51.520–12:55.160
第三 我是否需要掌握对模型
12:55.160–12:58.360
数据 权限和运行环境的控制权
12:58.360–12:59.960
当你把这三个问题想清楚之后
12:59.960–13:01.960
這四者之間的選擇就一点都不模糊了
13:01.960–13:03.160
他们不是简单的
13:03.160–13:04.640
谁替代谁的关系
13:04.640–13:06.720
而是分别服务于不同层级
13:06.720–13:07.600
不同需求的
13:07.600–13:09.120
未来更常见的情况
13:09.120–13:10.760
可能也不是某一个超级agent
13:10.760–13:11.720
包揽所有工作
13:11.720–13:13.800
而是像今天聊到的成品办公agent
13:13.800–13:14.760
专业工程agent
13:14.760–13:16.760
长期个人agent和企业开源底座
13:16.760–13:17.720
他们相互配合
13:17.720–13:19.720
共同组成一个真正好用的
13:19.720–13:20.720
AI工作系统
0:00.000–0:01.360
zh2026年AI智能体
2026年AI智能体
0:01.360–0:02.960
zh也就是我们常说的AI agent
也就是我们常说的AI agent
0:02.960–0:03.840
zh一下子就火了
一下子就火了
0:03.840–0:05.760
zh你随便一搜就能看到各种各样的产品
你随便一搜就能看到各种各样的产品
0:05.760–0:07.320
zh比如DeepSeaKarnes
比如DeepSeaKarnes
0:07.320–0:08.320
zh腾讯的WorkBody
腾讯的WorkBody
0:08.320–0:10.000
zh一个叫HermesAgent的
一个叫HermesAgent的
0:10.000–0:11.520
zh还有OpenAI的Codex
还有OpenAI的Codex
0:11.520–0:13.200
zh乍一看他们好像
乍一看他们好像
0:13.200–0:15.120
zh都差不多都是能自己干活的AI
都差不多都是能自己干活的AI
0:15.120–0:16.960
zh我们是不是只要比比谁更聪明就行了
我们是不是只要比比谁更聪明就行了
0:16.960–0:18.160
zh他们四个其实代表了
他们四个其实代表了
0:18.160–0:20.240
zh四种完全不同的发展路线
四种完全不同的发展路线
0:20.240–0:22.080
zh今天咱们最重要的任务
今天咱们最重要的任务
0:22.080–0:23.840
zh就不是给他们排个1234
就不是给他们排个1234
0:23.840–0:25.520
zh而是要把这四家的底细都摸清楚
而是要把这四家的底细都摸清楚
0:25.520–0:27.760
zh他们各自到底在解决什么问题
他们各自到底在解决什么问题
0:27.760–0:28.720
zh最厉害的地方在哪
最厉害的地方在哪
0:28.720–0:30.380
zh又分别适合什么样的人去用
又分别适合什么样的人去用
0:30.380–0:31.460
zh咱们一个一个来看
咱们一个一个来看
0:31.460–0:33.220
zh先说deepseek harness
先说deepseek harness
0:33.220–0:35.560
zh这个名字里的harness翻译过来有点像
这个名字里的harness翻译过来有点像
0:35.560–0:38.320
zh智能体的运行底座或者框架
智能体的运行底座或者框架
0:38.320–0:39.120
zh你可以这么理解
你可以这么理解
0:39.120–0:40.320
zh一个大模型
一个大模型
0:40.320–0:41.760
zh就像一个聪明的大脑
就像一个聪明的大脑
0:41.760–0:42.800
zh它会思考
它会思考
0:42.800–0:43.700
zh会说话
会说话
0:43.700–0:45.400
zh但是它光有大脑
但是它光有大脑
0:45.400–0:46.900
zh是没法帮你完成一个
是没法帮你完成一个
0:46.900–0:48.400
zh现实世界里的具体任务的
现实世界里的具体任务的
0:48.400–0:49.900
zh它得有手有脚
它得有手有脚
0:49.900–0:51.100
zh得有工具
得有工具
0:51.100–0:52.100
zh得有记忆
得有记忆
0:52.100–0:53.300
zh得有个工作台
得有个工作台
0:53.300–0:55.000
zh这个harness就是给它提供
这个harness就是给它提供
0:55.000–0:57.940
zh身体操作系统和工作环境的那一整套东西
身体操作系统和工作环境的那一整套东西
0:57.940–0:59.442
zhDeepSeaKarnes最核心的设计理念叫
DeepSeaKarnes最核心的设计理念叫
0:59.442–1:00.740
enEverything is a Plugin
Everything is a Plugin
1:00.740–1:02.740
zh翻译过来就是一切皆插件
翻译过来就是一切皆插件
1:02.740–1:04.740
zh你用哪个大语言模型可以换
你用哪个大语言模型可以换
1:04.740–1:06.840
zh你需要它用什么工具可以换
你需要它用什么工具可以换
1:06.840–1:09.640
zh它的记忆系统存储方式任务调度方法
它的记忆系统存储方式任务调度方法
1:09.640–1:11.740
zh甚至是用戶界面全都可以換
甚至是用戶界面全都可以換
1:11.740–1:13.240
zh开发者就像搭积木一样
开发者就像搭积木一样
1:13.240–1:15.840
zh用配置的方式就能把这些能力重新组合起来
用配置的方式就能把这些能力重新组合起来
1:15.840–1:17.340
zh而不用动框架本身的代码
而不用动框架本身的代码
1:17.340–1:19.540
zh这就带来了几个非常突出的优点
这就带来了几个非常突出的优点
1:19.540–1:21.840
zh第一 开放性和可组合性超级强
第一 开放性和可组合性超级强
1:21.840–1:24.840
zh比如说一家公司想搞一套自己的内部智能体
比如说一家公司想搞一套自己的内部智能体
1:24.840–1:27.540
zh又不想被某一家模型公司给绑架
又不想被某一家模型公司给绑架
1:27.540–1:30.040
zh那就可以把不同公司的模型都接進這個Harness裡
那就可以把不同公司的模型都接進這個Harness裡
1:30.040–1:32.640
zh遇到复杂的推理任务就调用能力最强的那个模型
遇到复杂的推理任务就调用能力最强的那个模型
1:32.640–1:33.940
zh遇到普通的整理任务
遇到普通的整理任务
1:33.940–1:35.840
zh就用一个成本更低的模型
就用一个成本更低的模型
1:35.840–1:37.440
zh甚至处理一些敏感数据
甚至处理一些敏感数据
1:37.440–1:40.340
zh可以直接用部署在自己服务器上的本地模型
可以直接用部署在自己服务器上的本地模型
1:40.340–1:41.640
zh这就非常灵活了
这就非常灵活了
1:41.640–1:42.240
zh第二
第二
1:42.240–1:43.840
zh它的运行过程非常透明
它的运行过程非常透明
1:43.840–1:45.040
zh它会详细记录下
它会详细记录下
1:45.040–1:46.640
zh模型每一步都看到了什么
模型每一步都看到了什么
1:46.640–1:48.040
zh系统给了它什么指令
系统给了它什么指令
1:48.040–1:49.140
zh它调用了什么工具
它调用了什么工具
1:49.140–1:51.340
zh又派出了哪个小助手去干活
又派出了哪个小助手去干活
1:51.340–1:54.740
zh整個任務過程可以被恢復、搜索、分叉和重放
整個任務過程可以被恢復、搜索、分叉和重放
1:54.740–1:56.740
zh这一点对开发者来说太重要了
这一点对开发者来说太重要了
1:56.740–1:59.140
zh因为AI智能体最让人头疼的一个问题就是
因为AI智能体最让人头疼的一个问题就是
1:59.140–1:59.940
zh它要是做错了事
它要是做错了事
1:59.940–2:01.240
zh你根本不知道它为什么错
你根本不知道它为什么错
2:01.240–2:03.440
zh有了这份完整的黑匣子飞行记录
有了这份完整的黑匣子飞行记录
2:03.440–2:05.740
zh调试评估和审计就都有了依据
调试评估和审计就都有了依据
2:05.740–2:06.240
zh第三
第三
2:06.240–2:08.240
zh它不只提供一种固定的工作模式
它不只提供一种固定的工作模式
2:08.240–2:10.840
zh它有标准模式适合绝大多数任务
它有标准模式适合绝大多数任务
2:10.840–2:12.340
zh有代码模式
有代码模式
2:12.340–2:15.440
zh让模型直接写程序来组织复杂的工具调用
让模型直接写程序来组织复杂的工具调用
2:15.440–2:17.940
zh還有最小模式只保留最核心的功能
還有最小模式只保留最核心的功能
2:17.940–2:20.420
zh方便测试模型最原始的智能体能力
方便测试模型最原始的智能体能力
2:20.420–2:21.860
zh甚至还有一个Creator模式
甚至还有一个Creator模式
2:21.860–2:24.500
zh专门用来设计新的插件和智能体模板
专门用来设计新的插件和智能体模板
2:24.500–2:25.860
zh当然缺点也很明显
当然缺点也很明显
2:25.860–2:27.820
zhDeepSeek Harness更像是一个基础设施
DeepSeek Harness更像是一个基础设施
2:27.820–2:29.340
zh一个给专业人士用的工具包
一个给专业人士用的工具包
2:29.340–2:30.700
zh而不是咱们普通人下载下来
而不是咱们普通人下载下来
2:30.700–2:32.220
zh就能直接当办公助手用的
就能直接当办公助手用的
2:32.220–2:34.500
zh模型怎么选 工具怎么接 权限怎么配
模型怎么选 工具怎么接 权限怎么配
2:34.500–2:36.700
zh数据怎么存 这些都得你自己来负责
数据怎么存 这些都得你自己来负责
2:36.700–2:39.260
zh而且它目前还处在开发者预览阶段
而且它目前还处在开发者预览阶段
2:39.260–2:41.220
zh接口和插件生态都还在快速变化
接口和插件生态都还在快速变化
2:41.220–2:42.860
zh所以它最大的价值
所以它最大的价值
2:42.860–2:45.460
zh不是让你马上扔掉现在的AI助手
不是让你马上扔掉现在的AI助手
2:45.460–2:48.020
zh而是为那些有开发能力的企业或者团队
而是为那些有开发能力的企业或者团队
2:48.020–2:50.420
zh提供了一套可控可扩展的
提供了一套可控可扩展的
2:50.420–2:51.260
zhagent底盘
agent底盘
2:51.260–2:51.760
zh
2:51.760–2:54.060
zh说完了需要自己动手组装的底盘
说完了需要自己动手组装的底盘
2:54.060–2:56.300
zh我们再来看一个已经组装好加满油
我们再来看一个已经组装好加满油
2:56.300–2:57.700
zh随时能开的整车
随时能开的整车
2:57.700–2:58.900
zh腾讯的workbody
腾讯的workbody
2:58.900–3:00.180
zh如果说deep-sea carless
如果说deep-sea carless
3:00.180–3:01.820
zh是给开发者准备的乐高积木
是给开发者准备的乐高积木
3:01.820–3:03.420
zh那workbody就是一辆已经组装好的
那workbody就是一辆已经组装好的
3:03.420–3:04.860
zh设计好所有细节的汽车
设计好所有细节的汽车
3:04.860–3:06.340
zh它的核心目标非常明确
它的核心目标非常明确
3:06.340–3:09.260
zh就是让普通的职场人用一句大白话
就是让普通的职场人用一句大白话
3:09.260–3:11.620
zh就能把一个相对完整的工作任务
就能把一个相对完整的工作任务
3:11.620–3:12.920
zh交给AI去完成
交给AI去完成
3:12.920–3:14.080
zhWorkBuddy强调的是
WorkBuddy强调的是
3:14.080–3:15.020
zh全场景办公
全场景办公
3:15.020–3:15.880
zh多专家协作
多专家协作
3:15.880–3:16.720
zh和开箱即用
和开箱即用
3:16.720–3:18.420
zh你可以用它来搜集资料
你可以用它来搜集资料
3:18.420–3:19.480
zh做市场调研
做市场调研
3:19.480–3:20.480
zh分析表格
分析表格
3:20.480–3:21.580
zh生成PPT
生成PPT
3:21.580–3:22.880
zh写内容整理文件
写内容整理文件
3:22.880–3:23.880
zh甚至写点代码
甚至写点代码
3:23.880–3:25.420
zh你只需要告诉它你的目标
你只需要告诉它你的目标
3:25.420–3:26.620
zh它会自己先去理解
它会自己先去理解
3:26.620–3:27.580
zh然后把任务拆解
然后把任务拆解
3:27.580–3:29.180
zh再调用不同领域的专家
再调用不同领域的专家
3:29.180–3:29.980
zh并行处理
并行处理
3:29.980–3:31.420
zh最后把结果交到你手上
最后把结果交到你手上
3:31.420–3:32.980
zh你还可以检查和修改
你还可以检查和修改
3:32.980–3:34.020
zhWorkBuddy最大的优点
WorkBuddy最大的优点
3:34.020–3:35.580
zh首先就是使用门槛极低
首先就是使用门槛极低
3:35.580–3:36.620
zh你完全不需要懂什么
你完全不需要懂什么
3:36.620–3:37.220
zhPython编程
Python编程
3:37.220–3:37.820
zhDocker容器
Docker容器
3:37.820–3:40.580
zhAPI要像量数据库这些听起来就头大的词
API要像量数据库这些听起来就头大的词
3:40.580–3:41.900
zh安装好之后直接就能用
安装好之后直接就能用
3:41.900–3:43.660
zh这对大多数人来说太重要了
这对大多数人来说太重要了
3:43.660–3:45.140
zh因为真正决定生产力的
因为真正决定生产力的
3:45.140–3:46.740
zh往往不是理论上限有多高
往往不是理论上限有多高
3:46.740–3:48.540
zh而是一个工具能不能在10分钟内
而是一个工具能不能在10分钟内
3:48.540–3:49.980
zh就开始帮你创造价值
就开始帮你创造价值
3:49.980–3:51.860
zh第二个优点是它对中文办公
第二个优点是它对中文办公
3:51.860–3:53.540
zh和国内生态的适配特别好
和国内生态的适配特别好
3:53.540–3:55.740
zh它覆盖了Windows和macOS系统
它覆盖了Windows和macOS系统
3:55.740–3:57.700
zh还打通了桌面端主流的
还打通了桌面端主流的
3:57.700–3:59.860
zh即时通讯工具和微信小程序
即时通讯工具和微信小程序
3:59.860–4:02.580
zh无论是写中文报告做PPT处理Excel
无论是写中文报告做PPT处理Excel
4:02.580–4:04.420
zh还是跟国内企业的沟通场景
还是跟国内企业的沟通场景
4:04.420–4:05.860
zhWorkbody的产品设计
Workbody的产品设计
4:05.860–4:07.860
zh都更贴近我们的日常办公习惯
都更贴近我们的日常办公习惯
4:07.860–4:08.860
zh第三个优点
第三个优点
4:08.860–4:11.460
zh是它把复杂的多智能体协作
是它把复杂的多智能体协作
4:11.460–4:13.760
zh包装成了一个用户能听懂的概念
包装成了一个用户能听懂的概念
4:13.760–4:14.960
zh叫专家团队
叫专家团队
4:14.960–4:17.060
zh你不需要自己去设计什么研究agent
你不需要自己去设计什么研究agent
4:17.060–4:18.660
zh数据agent 协作agent
数据agent 协作agent
4:18.660–4:20.360
zh你只需要描述你的最终目标
你只需要描述你的最终目标
4:20.360–4:22.060
zh系统会自动帮你组织
系统会自动帮你组织
4:22.060–4:23.860
zh不同角色的专家来协作
不同角色的专家来协作
4:23.860–4:26.660
zh这种把复杂技术藏在产品界面背后的设计
这种把复杂技术藏在产品界面背后的设计
4:26.660–4:28.260
zh大大降低了用户的理解成本
大大降低了用户的理解成本
4:28.260–4:29.560
zh当然 成品化也意味着
当然 成品化也意味着
4:29.560–4:31.660
zh你失去了一部分底层的控制权
你失去了一部分底层的控制权
4:31.660–4:33.260
zh你很难像用开源框架那样
你很难像用开源框架那样
4:33.260–4:35.820
zh完全掌握它内部的每一个运行细节
完全掌握它内部的每一个运行细节
4:35.820–4:37.100
zh它的透明度
它的透明度
4:37.100–4:39.140
zh可定制程度和模型选择的自由度
可定制程度和模型选择的自由度
4:39.140–4:40.740
zh通常是不如DeepSeek Harness
通常是不如DeepSeek Harness
4:40.740–4:42.700
zh或者我们接下来要说的Herms Agent的
或者我们接下来要说的Herms Agent的
4:42.700–4:45.060
zh而且对于一些特别复杂的代码仓库
而且对于一些特别复杂的代码仓库
4:45.060–4:46.380
zh严格的软件测试任务
严格的软件测试任务
4:46.380–4:49.460
zhWorkBuddy也未必比那些更专业的编码Agent有优势
WorkBuddy也未必比那些更专业的编码Agent有优势
4:49.460–4:52.020
zh所以WorkBuddy最适合的是谁呢
所以WorkBuddy最适合的是谁呢
4:52.020–4:54.180
zh就是那些希望马上提升办公效率
就是那些希望马上提升办公效率
4:54.180–4:56.300
zh但又不愿意投入大量时间去研究
但又不愿意投入大量时间去研究
4:56.300–4:57.660
zh部署和配置系统的人
部署和配置系统的人
4:57.660–5:01.100
zh它的竞争力不在于某一项底层技术有多么领先
它的竞争力不在于某一项底层技术有多么领先
5:01.100–5:05.220
zh而在于它把模型、工具、专家、文件和办公入口
而在于它把模型、工具、专家、文件和办公入口
5:05.220–5:07.380
zh整合成了一个可以直接上手用的产品
整合成了一个可以直接上手用的产品
5:07.380–5:09.460
zh接下来我们聊聊一个很有意思的agent
接下来我们聊聊一个很有意思的agent
5:09.460–5:10.620
zh叫做Hermes Agent
叫做Hermes Agent
5:10.620–5:13.660
zh它是由一个叫Nous Research的团队开发的
它是由一个叫Nous Research的团队开发的
5:13.660–5:16.340
zh这个agent最核心的理念跟前面两个都不太一样
这个agent最核心的理念跟前面两个都不太一样
5:16.340–5:18.860
zh它认为一个真正有价值的智能体
它认为一个真正有价值的智能体
5:18.860–5:20.700
zh不应该每次跟你对话都像第一次见面
不应该每次跟你对话都像第一次见面
5:20.700–5:23.380
zh而应该在长期的使用中慢慢形成记忆
而应该在长期的使用中慢慢形成记忆
5:23.380–5:24.620
zh掌握你的工作习惯
掌握你的工作习惯
5:24.620–5:25.900
zh并且把成功的经验
并且把成功的经验
5:25.900–5:27.780
zh沉淀成可以反复使用的技能
沉淀成可以反复使用的技能
5:27.780–5:29.900
zhHermes最大的特点就是闭环学习
Hermes最大的特点就是闭环学习
5:29.900–5:31.580
zh它有一套长期记忆系统
它有一套长期记忆系统
5:31.580–5:32.860
zh可以保存你的个人偏好
可以保存你的个人偏好
5:32.860–5:34.260
zh项目背景和过去的经验
项目背景和过去的经验
5:34.260–5:35.780
zh它还有一个技能系统
它还有一个技能系统
5:35.780–5:38.540
zh可以把一个多步骤的复杂流程
可以把一个多步骤的复杂流程
5:38.540–5:40.740
zh保存成一个可以一键调用的skill
保存成一个可以一键调用的skill
5:40.740–5:41.620
zh也就是技能
也就是技能
5:41.620–5:42.900
zh以后再遇到类似的任务
以后再遇到类似的任务
5:42.900–5:44.180
zh它就不必重新摸索了
它就不必重新摸索了
5:44.180–5:45.340
zh而是可以直接调用
而是可以直接调用
5:45.340–5:46.620
zh已经形成的工作方法
已经形成的工作方法
5:46.620–5:47.140
zh打个比方
打个比方
5:47.140–5:48.660
zh这就有点像一个实习生
这就有点像一个实习生
5:48.660–5:49.940
zh刚来的时候什么都不会
刚来的时候什么都不会
5:49.940–5:51.020
zh但你在带他的过程中
但你在带他的过程中
5:51.020–5:51.740
zh他会犯错
他会犯错
5:51.740–5:52.580
zh你会纠正他
你会纠正他
5:52.580–5:54.300
zh慢慢的他学会了怎么做报告
慢慢的他学会了怎么做报告
5:54.300–5:55.140
zh怎么分析数据
怎么分析数据
5:55.140–5:56.780
zh下次再让他做类似的工作
下次再让他做类似的工作
5:56.780–5:57.700
zh他就能直接上手
他就能直接上手
5:57.700–5:58.740
zh甚至做的又快又好
甚至做的又快又好
5:58.740–5:59.500
zhHermes就是这样
Hermes就是这样
5:59.500–6:01.380
zh如果他在执行任务时走了弯路
如果他在执行任务时走了弯路
6:01.380–6:02.620
zh最后找到了正确的方法
最后找到了正确的方法
6:02.620–6:03.900
zh或者你纠正了他的做法
或者你纠正了他的做法
6:03.900–6:04.820
zh他可以把这些经验
他可以把这些经验
6:04.820–6:05.860
zh写进他的技能库里
写进他的技能库里
6:05.860–6:07.340
zh所以Hermes的价值
所以Hermes的价值
6:07.340–6:08.980
zh是会随着你使用它的时间
是会随着你使用它的时间
6:08.980–6:09.820
zh增长而增长的
增长而增长的
6:09.820–6:11.660
zh他不是简单的记住聊天内容
他不是简单的记住聊天内容
6:11.660–6:13.460
zh而是在尝试把过去的经验
而是在尝试把过去的经验
6:13.460–6:14.660
zh转化为程序化的工作流程
转化为程序化的工作流程
6:14.660–6:16.220
zh可复用的工作流程
可复用的工作流程
6:16.220–6:17.420
zhHermes的第二个优点
Hermes的第二个优点
6:17.420–6:18.900
zh是模型自由度很高
是模型自由度很高
6:18.900–6:20.700
zh它可以连接OpenAI
它可以连接OpenAI
6:20.700–6:21.500
enClaude
Claude
6:21.500–6:22.500
enGemini
Gemini
6:22.500–6:23.500
enDeepSeek
DeepSeek
6:23.500–6:25.340
zhQianwen等各种云端模型
Qianwen等各种云端模型
6:25.340–6:26.700
zh甚至你本地的模型也行
甚至你本地的模型也行
6:26.700–6:29.020
zh你的长期记忆、技能和工具
你的长期记忆、技能和工具
6:29.020–6:31.180
zh是属于Hermes这个员工本身的
是属于Hermes这个员工本身的
6:31.180–6:33.460
zh而不是绑定在某一个特定的大模型上
而不是绑定在某一个特定的大模型上
6:33.460–6:34.140
zh也就是说
也就是说
6:34.140–6:36.420
zh你可以随时给这个员工换个大脑
你可以随时给这个员工换个大脑
6:36.420–6:38.180
zh但他已经学会的工作方法还在
但他已经学会的工作方法还在
6:38.180–6:39.860
zh第三个优点是它适合
第三个优点是它适合
6:39.860–6:41.060
zh长期在线运行
长期在线运行
6:41.060–6:42.620
zh你可以把它部署在自己的
你可以把它部署在自己的
6:42.620–6:44.620
zh电脑上或者云端的服务器里
电脑上或者云端的服务器里
6:44.620–6:45.860
enTelegram
Telegram
6:45.860–6:46.360
enDiscord
Discord
6:46.360–6:46.860
enSlack
Slack
6:46.860–6:47.393
enWhatsApp
WhatsApp
6:47.393–6:48.760
zh非输 企业微信
非输 企业微信
6:48.760–6:50.100
zh这些渠道跟他交互
这些渠道跟他交互
6:50.100–6:52.340
zh这意味着就算你人不在电脑前
这意味着就算你人不在电脑前
6:52.340–6:53.900
zh也可以通过手机给他发个任务
也可以通过手机给他发个任务
6:53.900–6:55.440
zh让云端的agent继续帮你工作
让云端的agent继续帮你工作
6:55.440–6:57.760
zh他还内置了定时任务和子agent的能力
他还内置了定时任务和子agent的能力
6:57.760–6:59.500
zh特别适合用来做周期性的报告
特别适合用来做周期性的报告
6:59.500–7:01.640
zh资料搜集 这类长期自动化任务
资料搜集 这类长期自动化任务
7:01.640–7:03.640
zh不过 关于Hermes的自进化
不过 关于Hermes的自进化
7:03.640–7:05.200
zh这里有一个非常重要的澄清
这里有一个非常重要的澄清
7:05.200–7:07.540
zh他通常不是自己重新训练的一个大语言模型
他通常不是自己重新训练的一个大语言模型
7:07.540–7:08.940
zh也不是说用了一段时间之后
也不是说用了一段时间之后
7:08.940–7:11.440
zh模型本身的神经网络权重就自动改变了
模型本身的神经网络权重就自动改变了
7:11.440–7:12.900
zh他所谓的成长主要发生在
他所谓的成长主要发生在
7:12.900–7:15.500
zh在技能和系统提示这些层面上
在技能和系统提示这些层面上
7:15.500–7:17.060
zh它有一个叫Self Evolution
它有一个叫Self Evolution
7:17.060–7:18.700
zh也就是自我进化的项目
也就是自我进化的项目
7:18.700–7:20.980
zh会利用执行轨迹和评估数据
会利用执行轨迹和评估数据
7:20.980–7:22.860
zh来生成和优化技能和提示词
来生成和优化技能和提示词
7:22.860–7:24.660
zh但并不是在修改模型本身
但并不是在修改模型本身
7:24.660–7:26.900
zh这更接近于是工作流程
这更接近于是工作流程
7:26.900–7:28.540
zh和提示系统的迭代
和提示系统的迭代
7:28.540–7:30.420
zh而不是模型的重新训练
而不是模型的重新训练
7:30.420–7:31.260
zh这种机制
这种机制
7:31.260–7:32.300
zh既是它的优势
既是它的优势
7:32.300–7:33.260
zh也带来了风险
也带来了风险
7:33.260–7:33.820
zh你想想
你想想
7:33.820–7:35.860
zh如果一个agent总结了错误的经验
如果一个agent总结了错误的经验
7:35.860–7:36.780
zh他也可能把这个错误
他也可能把这个错误
7:36.780–7:37.620
zh写进他的记忆里
写进他的记忆里
7:37.620–7:39.140
zh如果某一次偶然的特殊情况
如果某一次偶然的特殊情况
7:39.140–7:40.460
zh被他误认为是普遍规律
被他误认为是普遍规律
7:40.460–7:42.780
zh那这个错误的流程就可能在以后被反复调用
那这个错误的流程就可能在以后被反复调用
7:42.780–7:46.500
zh所以Hermes提供了记忆写入和技能写入的审批机制
所以Hermes提供了记忆写入和技能写入的审批机制
7:46.500–7:49.580
zh比较稳妥的做法是让agent先提出修改建议
比较稳妥的做法是让agent先提出修改建议
7:49.580–7:51.620
zh然后由人来查看差异并批准
然后由人来查看差异并批准
7:51.620–7:54.220
zh而不是让他完全不受控制的修改自己
而不是让他完全不受控制的修改自己
7:54.220–7:55.860
zh这也给我们一个很重要的启发
这也给我们一个很重要的启发
7:55.860–7:58.740
zh一个AI的自我改进不能只看他有没有学习能力
一个AI的自我改进不能只看他有没有学习能力
7:58.740–8:00.300
zh还得看他有没有平衡能力
还得看他有没有平衡能力
8:00.300–8:01.100
zh回滾
回滾
8:01.100–8:02.400
zh審批和安全邊界
審批和安全邊界
8:02.400–8:03.900
zh没有验证机制的自我学习
没有验证机制的自我学习
8:03.900–8:05.100
zh可能只是让他在
可能只是让他在
8:05.100–8:06.600
zh更有信心的重复错误
更有信心的重复错误
8:06.600–8:09.100
zh最后我们来看看OpenAI的Codex
最后我们来看看OpenAI的Codex
8:09.100–8:10.300
zh很多人对Codex的印象
很多人对Codex的印象
8:10.300–8:12.400
zh可能还停留在他是一个编码助手
可能还停留在他是一个编码助手
8:12.400–8:14.640
zh但现在它已经发展成一个由桌面端
但现在它已经发展成一个由桌面端
8:14.640–8:17.800
zh命令行 IDE插件和云端环境组成的完整体系了
命令行 IDE插件和云端环境组成的完整体系了
8:17.800–8:20.280
zh严格来说 OpenAI 把那些通用的研究
严格来说 OpenAI 把那些通用的研究
8:20.280–8:23.080
zh报告 表格 PPT 和文件交付等功能
报告 表格 PPT 和文件交付等功能
8:23.080–8:24.920
zh更多的放在了 ChatGPT Work 里
更多的放在了 ChatGPT Work 里
8:24.920–8:28.520
zh而 Codex 仍然以代碼、項目、工具和工程執行為核心
而 Codex 仍然以代碼、項目、工具和工程執行為核心
8:28.520–8:31.000
zh当然 这两者的能力正在越来越多地共享
当然 这两者的能力正在越来越多地共享
8:31.000–8:34.160
zhCodeX 最大的优点是它特别强调做完并验证
CodeX 最大的优点是它特别强调做完并验证
8:34.160–8:36.160
zh而不仅仅是给你一些建议
而不仅仅是给你一些建议
8:36.160–8:38.200
zh它可以读取你整个项目的文件
它可以读取你整个项目的文件
8:38.200–8:39.840
zh搜索代码 修改多个文件
搜索代码 修改多个文件
8:39.840–8:42.440
zh运行命令 执行测试 查看报错信息
运行命令 执行测试 查看报错信息
8:42.440–8:44.240
zh然后根据测试结果继续修复问题
然后根据测试结果继续修复问题
8:44.240–8:46.640
zh最後交付給你的不只是一段示例代碼
最後交付給你的不只是一段示例代碼
8:46.640–8:48.640
zh而是一个完整的修改摘要
而是一个完整的修改摘要
8:48.640–8:51.040
zh文件差異對比、測試結果
文件差異對比、測試結果
8:51.040–8:53.140
zh以及可以审查的最终成果
以及可以审查的最终成果
8:53.140–8:56.340
zh第二个优点是它的工程环境比较完整
第二个优点是它的工程环境比较完整
8:56.340–8:57.740
zh你在本地的 Codex
你在本地的 Codex
8:57.740–9:00.640
zh可以直接使用你电脑上已经装好的编译器
可以直接使用你电脑上已经装好的编译器
9:00.640–9:02.140
zh测试工具和项目依赖
测试工具和项目依赖
9:02.140–9:03.140
zh而雲端的 Codex
而雲端的 Codex
9:03.140–9:05.140
zh可以为不同的任务建立隔离的环境
可以为不同的任务建立隔离的环境
9:05.140–9:07.540
zh让多个任务在后台并行运行
让多个任务在后台并行运行
9:07.540–9:08.140
zh任务完成后
任务完成后
9:08.140–9:09.860
zh你可以清楚地看到他都改了些什么
你可以清楚地看到他都改了些什么
9:09.860–9:11.220
zh可以要求他继续调整
可以要求他继续调整
9:11.220–9:14.460
zh或者直接把修改提交到你的代码仓库
或者直接把修改提交到你的代码仓库
9:14.460–9:15.380
zh第三个优点是
第三个优点是
9:15.380–9:17.780
zh它的权限和安全边界做的比较成熟
它的权限和安全边界做的比较成熟
9:17.780–9:20.900
zhCodex通过沙箱来限制它对文件和网络的访问
Codex通过沙箱来限制它对文件和网络的访问
9:20.900–9:22.260
zh在执行一些高风险命令时
在执行一些高风险命令时
9:22.260–9:23.940
zh或者跨越权限边界的时候
或者跨越权限边界的时候
9:23.940–9:25.140
zh会向你请求批准
会向你请求批准
9:25.140–9:27.340
zh这种设计可能会让操作显得有点谨慎
这种设计可能会让操作显得有点谨慎
9:27.340–9:29.620
zh但对于一个能够真实修改文件
但对于一个能够真实修改文件
9:29.620–9:32.380
zh运行程序和连接外部工具的智能体来说
运行程序和连接外部工具的智能体来说
9:32.380–9:35.020
zh这种谨慎本身就是可靠性的重要组成部分
这种谨慎本身就是可靠性的重要组成部分
9:35.020–9:38.620
zh第四个优点是它把编码研究和文件交付连接了起来
第四个优点是它把编码研究和文件交付连接了起来
9:38.620–9:40.620
zh在ChatGPT Work这个更大的环境里
在ChatGPT Work这个更大的环境里
9:40.620–9:43.220
zh同一套能力还可以用来生成和检查文档
同一套能力还可以用来生成和检查文档
9:43.220–9:47.020
zh表格、PPT、PDF、网站和数据分析结果
表格、PPT、PDF、网站和数据分析结果
9:47.020–9:50.620
zh这意味着一个复杂的任务可以从资料搜集开始
这意味着一个复杂的任务可以从资料搜集开始
9:50.620–9:52.020
zh经过分析和程序处理
经过分析和程序处理
9:52.020–9:54.120
zh最后形成可以直接使用的文件
最后形成可以直接使用的文件
9:54.120–9:56.020
zh整个流程都可以在一个环境里完成
整个流程都可以在一个环境里完成
9:56.020–9:57.920
zh当然Codex的局限也很清楚
当然Codex的局限也很清楚
9:57.920–10:01.720
zh它主要围绕OpenAI自家的模型和ChatGPT服务来运行
它主要围绕OpenAI自家的模型和ChatGPT服务来运行
10:01.720–10:04.920
zh模型的自由度不如Hermes或者DeepSeek Harness
模型的自由度不如Hermes或者DeepSeek Harness
10:04.920–10:07.480
zh它虽然也支持技能记忆和项目规则
它虽然也支持技能记忆和项目规则
10:07.480–10:10.320
zh但不会把自动修改自己作为最核心的卖点
但不会把自动修改自己作为最核心的卖点
10:10.320–10:11.680
zh它的取向更加保守
它的取向更加保守
10:11.680–10:14.200
zh宁可让流程可审查可验证
宁可让流程可审查可验证
10:14.200–10:16.520
zh也不轻易让agent自行改变长期规则
也不轻易让agent自行改变长期规则
10:16.520–10:17.020
zh好了
好了
10:17.020–10:18.840
zh现在我们把这四个智能体放在一起
现在我们把这四个智能体放在一起
10:18.840–10:20.600
zh就能得到一个非常清晰的结论了
就能得到一个非常清晰的结论了
10:20.600–10:23.040
zh如果你的目标是开发一个自己的agent的产品
如果你的目标是开发一个自己的agent的产品
10:23.040–10:25.480
zh那DeepSeek Harness最有吸引力
那DeepSeek Harness最有吸引力
10:25.480–10:27.440
zh因为它开放模块化
因为它开放模块化
10:27.440–10:28.800
zh运行过程可追溯
运行过程可追溯
10:28.800–10:31.520
zh如果你的目标是普通办公人员想马上提高效率
如果你的目标是普通办公人员想马上提高效率
10:31.520–10:32.600
zh那Workbody最方便
那Workbody最方便
10:32.600–10:34.920
zh因为它把复杂的技术包装成了用户友好的界面
因为它把复杂的技术包装成了用户友好的界面
10:34.920–10:37.800
zh如果你的目标是培养一个能长期在线
如果你的目标是培养一个能长期在线
10:37.800–10:40.000
zh逐渐熟悉你个人工作方式的智能体
逐渐熟悉你个人工作方式的智能体
10:40.000–10:41.640
zh那Hermes最有特色
那Hermes最有特色
10:41.640–10:43.480
zh如果你的目标是完成复杂的代码
如果你的目标是完成复杂的代码
10:43.480–10:45.960
zh工具执行和需要严格验证的专业任务
工具执行和需要严格验证的专业任务
10:45.960–10:47.920
zh那Codex的综合完成度更高
那Codex的综合完成度更高
10:47.920–10:51.560
zh你看他们代表的其实是4条完全不同的路线
你看他们代表的其实是4条完全不同的路线
10:51.560–10:53.960
zhDeepSeek Harness追求的是架构上的自由
DeepSeek Harness追求的是架构上的自由
10:53.960–10:55.880
zhWorkBuddy追求的是使用的便利
WorkBuddy追求的是使用的便利
10:55.880–10:57.960
zhHermes追求的是长期的成长
Hermes追求的是长期的成长
10:57.960–11:00.200
zh而Codex追求的是可靠的交付
而Codex追求的是可靠的交付
11:00.200–11:00.840
zh聊到这里
聊到这里
11:00.840–11:03.080
zh还有三点特别值得我们进一步思考
还有三点特别值得我们进一步思考
11:03.080–11:06.720
zh第一 未来agent的竞争绝对不会只发生在模型层面
第一 未来agent的竞争绝对不会只发生在模型层面
11:06.720–11:08.080
zh模型当然很重要
模型当然很重要
11:08.080–11:09.480
zh它决定了智力的上限
它决定了智力的上限
11:09.480–11:12.920
zh但真正决定这个智能体能不能稳定落地完成实际工作的
但真正决定这个智能体能不能稳定落地完成实际工作的
11:12.920–11:16.120
zh是模型之外的那個架構也就是它的運行底座
是模型之外的那個架構也就是它的運行底座
11:16.120–11:17.080
zh它能用什么工具
它能用什么工具
11:17.080–11:18.480
zh能访问哪些文件
能访问哪些文件
11:18.480–11:19.160
zh怎么记忆
怎么记忆
11:19.160–11:20.280
zh怎么调度任务
怎么调度任务
11:20.280–11:21.400
zh出错了能不能恢复
出错了能不能恢复
11:21.400–11:25.080
zh以及我们作为使用者能不能看清它到底都做了什么
以及我们作为使用者能不能看清它到底都做了什么
11:25.080–11:26.360
zh这些才是关键
这些才是关键
11:26.360–11:28.480
zh第二 我们刚才聊到的所谓自进化
第二 我们刚才聊到的所谓自进化
11:28.480–11:30.600
zh绝对不能脱离一个有效的评估系统
绝对不能脱离一个有效的评估系统
11:30.600–11:34.120
zh一个agent能够修改自己的技能并不等于他一定会变得更好
一个agent能够修改自己的技能并不等于他一定会变得更好
11:34.120–11:37.360
zh真正有效的自我改进至少需要完整的执行记录
真正有效的自我改进至少需要完整的执行记录
11:37.360–11:40.640
zh客觀的測試數據 效果比較以及必要的人類審批
客觀的測試數據 效果比較以及必要的人類審批
11:40.640–11:42.240
zh以及出错了能回滚的方案
以及出错了能回滚的方案
11:42.240–11:46.520
zh否則他可能只是在更有信心的把你最初交給他的那個錯誤
否則他可能只是在更有信心的把你最初交給他的那個錯誤
11:46.520–11:48.240
zh一遍又一遍的固化下来
一遍又一遍的固化下来
11:48.240–11:50.960
zh第三 最好的agent不一定是最自主的agent
第三 最好的agent不一定是最自主的agent
11:50.960–11:53.360
zh对于很多低风险的重复性的任务
对于很多低风险的重复性的任务
11:53.360–11:55.800
zh高程度的自动化确实能节省大量时间
高程度的自动化确实能节省大量时间
11:55.800–12:00.160
zh但是当涉及到付款 删除文件 发布公开内容
但是当涉及到付款 删除文件 发布公开内容
12:00.160–12:03.440
zh修改正式代码或者处理敏感数据这些关键操作时
修改正式代码或者处理敏感数据这些关键操作时
12:03.440–12:05.760
zh一个能够暂停下来向你解释情况
一个能够暂停下来向你解释情况
12:05.760–12:06.960
zh并等待你确认的agent
并等待你确认的agent
12:06.960–12:09.760
zh它的价值其实远远高于一个完全自主
它的价值其实远远高于一个完全自主
12:09.760–12:11.160
zh从不请示的agent
从不请示的agent
12:11.160–12:14.240
zh一個成熟的智能體系統不是要取消人的判斷
一個成熟的智能體系統不是要取消人的判斷
12:14.240–12:15.760
zh而是要把人的判断
而是要把人的判断
12:15.760–12:18.160
zh集中到那些最关键的节点上
集中到那些最关键的节点上
12:18.160–12:19.920
zh最后我们来总结一下今天的内容
最后我们来总结一下今天的内容
12:19.920–12:20.960
enDeepSake Harness
DeepSake Harness
12:20.960–12:24.360
zh最适合作为构建自由agent系统的开放底座
最适合作为构建自由agent系统的开放底座
12:24.360–12:25.560
zh腾讯的WorkBuddy
腾讯的WorkBuddy
12:25.560–12:26.320
zh最省事
最省事
12:26.320–12:28.920
zh适合想直接进入日常办公场景的用户
适合想直接进入日常办公场景的用户
12:28.920–12:32.560
zhHermes Agent最像一个会积累记忆和技能的长期AI员工
Hermes Agent最像一个会积累记忆和技能的长期AI员工
12:32.560–12:35.800
zh而OpenAI的Codex则最擅长把复杂的专业工作
而OpenAI的Codex则最擅长把复杂的专业工作
12:35.800–12:38.080
zh真正做完并进行严格的验证
真正做完并进行严格的验证
12:38.080–12:41.480
zh所以下次你在选择的时候不要只问谁最强
所以下次你在选择的时候不要只问谁最强
12:41.480–12:43.440
zh而要问自己三个更具体的问题
而要问自己三个更具体的问题
12:43.440–12:45.320
zh第一 我需要的是一个成品工具
第一 我需要的是一个成品工具
12:45.320–12:46.880
zh还是一个可以自己开发的框架
还是一个可以自己开发的框架
12:46.880–12:49.840
zh第二 我更看重的是即时的效率提升
第二 我更看重的是即时的效率提升
12:49.840–12:51.520
zh还是长期的成长和陪伴
还是长期的成长和陪伴
12:51.520–12:55.160
zh第三 我是否需要掌握对模型
第三 我是否需要掌握对模型
12:55.160–12:58.360
zh数据 权限和运行环境的控制权
数据 权限和运行环境的控制权
12:58.360–12:59.960
zh当你把这三个问题想清楚之后
当你把这三个问题想清楚之后
12:59.960–13:01.960
zh這四者之間的選擇就一点都不模糊了
這四者之間的選擇就一点都不模糊了
13:01.960–13:03.160
zh他们不是简单的
他们不是简单的
13:03.160–13:04.640
zh谁替代谁的关系
谁替代谁的关系
13:04.640–13:06.720
zh而是分别服务于不同层级
而是分别服务于不同层级
13:06.720–13:07.600
zh不同需求的
不同需求的
13:07.600–13:09.120
zh未来更常见的情况
未来更常见的情况
13:09.120–13:10.760
zh可能也不是某一个超级agent
可能也不是某一个超级agent
13:10.760–13:11.720
zh包揽所有工作
包揽所有工作
13:11.720–13:13.800
zh而是像今天聊到的成品办公agent
而是像今天聊到的成品办公agent
13:13.800–13:14.760
zh专业工程agent
专业工程agent
13:14.760–13:16.760
zh长期个人agent和企业开源底座
长期个人agent和企业开源底座
13:16.760–13:17.720
zh他们相互配合
他们相互配合
13:17.720–13:19.720
zh共同组成一个真正好用的
共同组成一个真正好用的
13:19.720–13:20.720
zhAI工作系统
AI工作系统

影片筆記:四大AI Agent实测:Codex、Hermes、WorkBuddy、DeepSeek谁更能干活?

<!-- VIDEONOTE_PUBLICATION_WARNINGS_BEGIN -->

✅ 目前無待解決問題

本筆記已完成可閱讀的逐字稿與時間跳轉,目前沒有待修正項目。

<!-- VIDEONOTE_PUBLICATION_WARNINGS_END -->

一句話總結

影片分析了 2026 年四款代表性 AI Agent 產品(DeepSeaKarnes、WorkBody、HermesAgent、OpenAI Codex)的發展路線,指出它們分別針對開發底盤、辦公效率、長期學習與工程交付不同需求,強調未來趨勢是根據控制權、便利性與成長性進行選擇,而非單純比較模型智商。

核心重點

  • 四種發展路線
  1. DeepSeaKarnes:開放模組化底盤,強調「一切皆插件」,適合開發者構建可控、可擴展的系統。
  2. WorkBody:開箱即用的辦公整車,強調多專家協作與低門檻,適合普通職場人員提升效率。
  3. HermesAgent:具備閉環學習的長期員工,強調長期記憶與技能沉淀,適合希望 AI 隨時間成長的用戶。
  4. OpenAI Codex:強調驗證與交付的工程環境,聚焦代碼執行與安全邊界,適合專業任務與嚴格驗證需求。
  • 選擇關鍵:使用者應根據「需要成品還是框架」、「看重即時效率還是長期成長」、「是否需要控制權」這三個問題來選擇合適的 Agent。
  • 未來趨勢:AI 工作系統將由不同層級、不同需求的智能體相互配合組成,成熟系統應將人類判斷集中於關鍵節點,而非完全自主運行。

詳細大綱

I. 引言:AI 智能體的多元發展

  • 2026 年 AI Agent 熱門現象。
  • 核心觀點:不比較誰更聰明,而是釐清各自解決的問題、優勢及適用人群。
  • 四款產品代表四種完全不同的發展路線。

II. DeepSeaKarnes(疑點):開放模組化的開發底盤

  • 核心概念
  • 名稱含義:類似智能體的運行底座或框架(Harness)。
  • 理念:「Everything is a Plugin」(一切皆插件)。
  • 架構:大模型僅為大腦,需透過 Harness 提供身體、工具、記憶與工作台。
  • 主要優點
  1. 開放性與可組合性強:可替換模型、工具、記憶系統、UI;支援混合模型策略(複雜任務用強模型,簡單任務用低成本模型,敏感數據用本地模型)。
  2. 運行過程透明:完整記錄每一步(視角、指令、工具調用、小助手派遣);支援恢復、搜索、分叉與重放(黑匣子飛行記錄),便於調試與審計。
  3. 多種工作模式:標準模式、代碼模式(寫程序組織工具調用)、最小模式(測試原始能力)、Creator 模式(設計新插件與模板)。
  • 缺點與限制
  • 屬基礎設施/工具包,非終端辦公助手。
  • 需自行負責模型選擇、工具接入、權限配置與數據存儲。
  • 處於開發者預覽階段,生態變化快。
  • 適用對象:有開發能力的企業或團隊,需可控、可擴展 Agent 底盤者。

III. 腾讯 WorkBody(疑點):開箱即用的辦公整車

  • 核心概念
  • 定位:已組裝好的「整車」,對比 DeepSeaKarnes 的「樂高積木」。
  • 目標:讓普通職場人用大白話完成完整工作任務。
  • 特點:全場景辦公、多專家協作、開箱即用。
  • 主要優點
  1. 使用門檻極低:無需懂 Python、Docker、API 等技術;10 分鐘內即可創造價值。
  2. 中文辦公與國內生態適配佳:支援 Windows/macOS;打通即時通訊工具與微信小程序;貼近中文報告、PPT、Excel 及國內溝通習慣。
  3. 複雜技術包裝:將多智能體協作包裝為「專家團隊」概念;用戶只需描述目標,系統自動組織角色協作。
  • 缺點與限制
  • 失去底層控制權,透明度、可定制度及模型選擇自由度低於其他產品。
  • 在複雜代碼倉庫或嚴格軟體測試任務上,可能不如專業編碼 Agent。
  • 適用對象:希望立即提升辦公效率,不願投入時間研究部署配置的普通用戶。

IV. HermesAgent:具備閉環學習的長期 AI 員工

  • 開發背景:由 Nous Research 團隊開發。
  • 核心理念
  • 拒絕每次對話如初次見面。
  • 強調長期記憶、工作習慣掌握及成功經驗沉淀。
  • 主要特點
  1. 閉環學習(核心優勢)
  • 具備長期記憶系統(保存偏好、背景、經驗)。
  • 具備技能系統(Skill):將多步驟流程保存為一鍵調用技能。
  • 類比實習生:透過糾錯與指導,將經驗轉化為程序化、可復用的工作流程。
  • 價值隨使用時間增長。
  1. 高模型自由度
  • 可連接 OpenAI、Claude、Gemini、DeepSeek、Qianwen 等雲端模型,或本地模型。
  • 記憶與技能屬於 Hermes 本身,不綁定特定大模型(可隨時更換「大腦」)。
  1. 適合長期在線運行
  • 可部署於電腦或雲端服務器。
  • 支援 Telegram、Discord、Slack、WhatsApp、非輸(疑點)、企業微信等渠道。
  • 具備定時任務與子 Agent 能力,適合週期性報告、資料搜集等自動化任務。
  • 關於「自進化」的澄清
  • 非重新訓練大語言模型神經網絡權重。
  • 成長發生在技能與系統提示層面。
  • 透過 Self Evolution 項目,利用執行軌跡與評估數據生成/優化技能與提示詞。
  • 屬工作流程與提示系統迭代,非模型重新訓練。
  • 風險與安全機制
  • 風險:可能總結錯誤經驗並固化為錯誤流程。
  • 機制:提供記憶寫入與技能寫入的審批機制;建議由人類查看差異並批准,而非完全自主修改。
  • 啟發:自我改進需平衡能力、回滾、審批及安全邊界。
  • 適用對象:希望培養能長期在線、逐漸熟悉個人工作方式的智能體者。

V. OpenAI 的 Codex:強調驗證與交付的工程環境

  • 產品定位
  • 從單純編碼助手發展為包含桌面端、命令行、IDE 插件及雲端環境的完整體系。
  • 通用研究、報告等功能主要歸於 ChatGPT Work,Codex 聚焦代碼、項目、工具與工程執行。
  • 主要優點
  1. 強調「做完並驗證」
  • 不僅提供建議,更執行任務。
  • 讀取項目文件、搜索代碼、修改多文件、運行命令、執行測試、查看報錯並修復。
  • 交付完整修改摘要、文件差異對比、測試結果及可審查的最終成果。
  1. 完整的工程環境
  • 本地版:使用電腦已裝好的編譯器、測試工具與依賴。
  • 雲端版:建立隔離環境,後台並行運行多任務。
  • 清晰展示修改內容,支援繼續調整或提交至代碼倉庫。
  1. 成熟的權限與安全邊界
  • 透過沙箱限制文件與網絡訪問。
  • 高風險命令或跨越權限時請求批准。
  • 謹慎設計提升可靠性。
  1. 連接編碼研究與文件交付
  • 在 ChatGPT Work 環境中,能力共享於生成與檢查文檔、表格、PPT、PDF、網站及數據分析。
  • 單一環境完成從資料搜集到最終文件生成的全流程。
  • 缺點與限制
  • 主要圍繞 OpenAI 自家模型與 ChatGPT 服務,模型自由度低於 Hermes 或 DeepSeaKarnes。
  • 雖支援技能記憶與項目規則,但不以自動修改自身為核心賣點。
  • 取向保守,優先保證流程可審查、可驗證,不輕易讓 Agent 自行改變長期規則。
  • 適用對象:完成複雜代碼、工具執行及需嚴格驗證的專業任務者。

VI. 綜合比較與選擇建議

  • 四條路線總結
  • DeepSeaKarnes:架構上的自由(開放底座)。
  • WorkBody:使用的便利(成品辦公)。
  • HermesAgent:長期的成長(個人員工)。
  • Codex:可靠的交付(專業工程)。
  • 選擇三個關鍵問題
  1. 需要成品工具還是可自行開發的框架?
  2. 更看重即時效率提升還是長期成長與陪伴?
  3. 是否需要掌握對模型、數據、權限和運行環境的控制權?
  • 未來展望
  • Agent 競爭不僅在模型層面,更在於架構底座(工具、文件訪問、記憶、調度、恢復、透明度)。
  • 自進化需脫離有效評估系統(執行記錄、客觀測試、效果比較、人類審批、回滾方案)。
  • 最佳 Agent 不一定最自主;關鍵操作需暫停解釋並等待確認。
  • 成熟系統應將人類判斷集中於關鍵節點,而非取消人類判斷。
  • 未來趨勢:非單一超級 Agent 包攬所有工作,而是成品辦公 Agent、專業工程 Agent、長期個人 Agent 與企業開源底座相互配合。

工具 / 模型 / 名詞整理

  • 產品/框架名稱
  • DeepSeaKarnes(疑點,原文如此)
  • WorkBody(疑點,原文如此)
  • HermesAgent(或稱 Hermes)
  • OpenAI 的 Codex
  • ChatGPT Work
  • 開發團隊/組織
  • Nous Research
  • 雲端模型/服務
  • OpenAI
  • Claude
  • Gemini
  • DeepSeek
  • Qianwen(疑點,可能指通義千問)
  • 平台/渠道
  • Windows
  • macOS
  • 微信小程序
  • Telegram
  • Discord
  • Slack
  • WhatsApp
  • 非輸(疑點,聽寫錯誤,可能指 Line 或其他通訊軟體)
  • 企業微信
  • 技術概念/術語
  • AI Agent / 智能體
  • Harness(疑點,原文如此)
  • Everything is a Plugin
  • Self Evolution(自我進化)
  • Skill(技能)
  • IDE 插件
  • 沙箱(Sandbox)

操作流程整理

  • DeepSeaKarnes 操作流程
  1. 選擇底層模型(可混合使用強/弱/本地模型)。
  2. 配置工具、記憶系統與 UI 插件。
  3. 選擇工作模式(標準、代碼、最小、Creator)。
  4. 運行任務,系統記錄完整視角、指令與工具調用。
  5. 利用黑匣子功能進行恢復、搜索、分叉與重放以進行調試或審計。
  • WorkBody 操作流程
  1. 用戶使用自然語言描述工作目標。
  2. 系統自動組織「專家團隊」角色進行協作。
  3. 系統在後台處理技術細節(無需用戶懂 Python/API)。
  4. 直接生成符合中文辦公習慣的結果(報告、PPT、Excel 等)。
  • HermesAgent 操作流程
  1. 連接外部大模型(OpenAI, Claude 等)作為大腦。
  2. 在長期運行中,系統記錄用戶偏好、背景與經驗至長期記憶。
  3. 將重複的多步驟流程保存為「技能(Skill)」。
  4. 透過 Self Evolution 項目,利用執行軌跡優化技能與提示詞。
  5. 人類審批機制介入,確認記憶與技能的寫入,防止錯誤固化。
  6. 部署於電腦或雲端,透過各種通訊渠道(Telegram, 企業微信等)進行定時任務或子 Agent 協作。
  • OpenAI Codex 操作流程
  1. 用戶在本地或雲端環境中提出代碼或工程任務。
  2. Agent 讀取項目文件、搜索代碼並進行修改。
  3. 執行命令、運行測試並查看報錯。
  4. 修復問題後,交付修改摘要、文件差異對比及測試結果。
  5. 在沙箱環境中限制文件與網絡訪問,高風險操作請求人類批准。
  6. 最終成果可提交至代碼倉庫或生成相關文檔。

值得注意的限制或風險

  • DeepSeaKarnes
  • 屬於基礎設施/工具包,非終端辦公助手,需自行負責模型選擇、工具接入、權限配置與數據存儲。
  • 處於開發者預覽階段,生態變化快。
  • WorkBody
  • 失去底層控制權,透明度、可定制度及模型選擇自由度低於其他產品。
  • 在複雜代碼倉庫或嚴格軟體測試任務上,可能不如專業編碼 Agent。
  • HermesAgent
  • 風險:可能總結錯誤經驗並固化為錯誤流程。
  • 限制:成長發生在技能與系統提示層面,非重新訓練大語言模型神經網絡權重。
  • 安全機制:需人類審批記憶與技能寫入,不能完全自主修改。
  • OpenAI Codex
  • 主要圍繞 OpenAI 自家模型與 ChatGPT 服務,模型自由度低於 Hermes 或 DeepSeaKarnes。
  • 取向保守,優先保證流程可審查、可驗證,不輕易讓 Agent 自行改變長期規則。

逐字稿辨識疑點

  • DeepSeaKarnes:逐字稿中出現此名稱,可能為 DeepSeek 相關產品或框架的聽寫錯誤,但依規則保留原樣。
  • WorkBody:逐字稿中出現此名稱,可能為騰訊相關產品(如 WeCom 或特定內部工具)的聽寫錯誤,但依規則保留原樣。
  • DeepSeaKarnes:在後文總結時,逐字稿口誤說成「DeepSake Harness」,應指代同一產品。
  • Qianwen:可能指代阿里雲的「通義千問」模型,但逐字稿僅顯示為「Qianwen」。
  • 非輸:在列舉通訊渠道時出現「非輸」,疑為「Line」或其他通訊軟體名稱的聽寫錯誤。
  • DeepSeaKarnes:在開頭介紹時,逐字稿口誤說成「deepseek harness」,後文又稱「deep-sea carless」,均指代同一產品,但名稱不統一且疑似錯誤。

可延伸追問

  • DeepSeaKarnes 與 WorkBody 在實際部署中,如何處理數據隱私與本地化部署的需求?
  • HermesAgent 的「閉環學習」在面對不同用戶習慣差異時,如何避免技能衝突或記憶污染?
  • OpenAI Codex 的沙箱機制在處理需要訪問外部 API 或特定本地庫的複雜任務時,是否存在侷限性?
  • 四款 Agent 之間是否存在互補的可能性,例如使用 DeepSeaKarnes 作為底盤,整合 Hermes 的記憶功能與 Codex 的工程能力?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習