0:00.000–0:01.360
zh2026年AI智能体
0:01.360–0:02.960
zh也就是我们常说的AI agent
0:02.960–0:03.840
zh一下子就火了
0:03.840–0:05.760
zh你随便一搜就能看到各种各样的产品
0:05.760–0:07.320
zh比如DeepSeaKarnes
0:07.320–0:08.320
zh腾讯的WorkBody
0:08.320–0:10.000
zh一个叫HermesAgent的
0:10.000–0:11.520
zh还有OpenAI的Codex
0:11.520–0:13.200
zh乍一看他们好像
0:13.200–0:15.120
zh都差不多都是能自己干活的AI
0:15.120–0:16.960
zh我们是不是只要比比谁更聪明就行了
0:16.960–0:18.160
zh他们四个其实代表了
0:18.160–0:20.240
zh四种完全不同的发展路线
0:20.240–0:22.080
zh今天咱们最重要的任务
0:22.080–0:23.840
zh就不是给他们排个1234
0:23.840–0:25.520
zh而是要把这四家的底细都摸清楚
0:25.520–0:27.760
zh他们各自到底在解决什么问题
0:27.760–0:28.720
zh最厉害的地方在哪
0:28.720–0:30.380
zh又分别适合什么样的人去用
0:30.380–0:31.460
zh咱们一个一个来看
0:31.460–0:33.220
zh先说deepseek harness
0:33.220–0:35.560
zh这个名字里的harness翻译过来有点像
0:35.560–0:38.320
zh智能体的运行底座或者框架
0:38.320–0:39.120
zh你可以这么理解
0:39.120–0:40.320
zh一个大模型
0:40.320–0:41.760
zh就像一个聪明的大脑
0:41.760–0:42.800
zh它会思考
0:42.800–0:43.700
zh会说话
0:43.700–0:45.400
zh但是它光有大脑
0:45.400–0:46.900
zh是没法帮你完成一个
0:46.900–0:48.400
zh现实世界里的具体任务的
0:48.400–0:49.900
zh它得有手有脚
0:49.900–0:51.100
zh得有工具
0:51.100–0:52.100
zh得有记忆
0:52.100–0:53.300
zh得有个工作台
0:53.300–0:55.000
zh这个harness就是给它提供
0:55.000–0:57.940
zh身体操作系统和工作环境的那一整套东西
0:57.940–0:59.442
zhDeepSeaKarnes最核心的设计理念叫
0:59.442–1:00.740
enEverything is a Plugin
1:00.740–1:02.740
zh翻译过来就是一切皆插件
1:02.740–1:04.740
zh你用哪个大语言模型可以换
1:04.740–1:06.840
zh你需要它用什么工具可以换
1:06.840–1:09.640
zh它的记忆系统存储方式任务调度方法
1:09.640–1:11.740
zh甚至是用戶界面全都可以換
1:11.740–1:13.240
zh开发者就像搭积木一样
1:13.240–1:15.840
zh用配置的方式就能把这些能力重新组合起来
1:15.840–1:17.340
zh而不用动框架本身的代码
1:17.340–1:19.540
zh这就带来了几个非常突出的优点
1:19.540–1:21.840
zh第一 开放性和可组合性超级强
1:21.840–1:24.840
zh比如说一家公司想搞一套自己的内部智能体
1:24.840–1:27.540
zh又不想被某一家模型公司给绑架
1:27.540–1:30.040
zh那就可以把不同公司的模型都接進這個Harness裡
1:30.040–1:32.640
zh遇到复杂的推理任务就调用能力最强的那个模型
1:32.640–1:33.940
zh遇到普通的整理任务
1:33.940–1:35.840
zh就用一个成本更低的模型
1:35.840–1:37.440
zh甚至处理一些敏感数据
1:37.440–1:40.340
zh可以直接用部署在自己服务器上的本地模型
1:40.340–1:41.640
zh这就非常灵活了
1:41.640–1:42.240
zh第二
1:42.240–1:43.840
zh它的运行过程非常透明
1:43.840–1:45.040
zh它会详细记录下
1:45.040–1:46.640
zh模型每一步都看到了什么
1:46.640–1:48.040
zh系统给了它什么指令
1:48.040–1:49.140
zh它调用了什么工具
1:49.140–1:51.340
zh又派出了哪个小助手去干活
1:51.340–1:54.740
zh整個任務過程可以被恢復、搜索、分叉和重放
1:54.740–1:56.740
zh这一点对开发者来说太重要了
1:56.740–1:59.140
zh因为AI智能体最让人头疼的一个问题就是
1:59.140–1:59.940
zh它要是做错了事
1:59.940–2:01.240
zh你根本不知道它为什么错
2:01.240–2:03.440
zh有了这份完整的黑匣子飞行记录
2:03.440–2:05.740
zh调试评估和审计就都有了依据
2:05.740–2:06.240
zh第三
2:06.240–2:08.240
zh它不只提供一种固定的工作模式
2:08.240–2:10.840
zh它有标准模式适合绝大多数任务
2:10.840–2:12.340
zh有代码模式
2:12.340–2:15.440
zh让模型直接写程序来组织复杂的工具调用
2:15.440–2:17.940
zh還有最小模式只保留最核心的功能
2:17.940–2:20.420
zh方便测试模型最原始的智能体能力
2:20.420–2:21.860
zh甚至还有一个Creator模式
2:21.860–2:24.500
zh专门用来设计新的插件和智能体模板
2:24.500–2:25.860
zh当然缺点也很明显
2:25.860–2:27.820
zhDeepSeek Harness更像是一个基础设施
2:27.820–2:29.340
zh一个给专业人士用的工具包
2:29.340–2:30.700
zh而不是咱们普通人下载下来
2:30.700–2:32.220
zh就能直接当办公助手用的
2:32.220–2:34.500
zh模型怎么选 工具怎么接 权限怎么配
2:34.500–2:36.700
zh数据怎么存 这些都得你自己来负责
2:36.700–2:39.260
zh而且它目前还处在开发者预览阶段
2:39.260–2:41.220
zh接口和插件生态都还在快速变化
2:41.220–2:42.860
zh所以它最大的价值
2:42.860–2:45.460
zh不是让你马上扔掉现在的AI助手
2:45.460–2:48.020
zh而是为那些有开发能力的企业或者团队
2:48.020–2:50.420
zh提供了一套可控可扩展的
2:50.420–2:51.260
zhagent底盘
2:51.260–2:51.760
zh好
2:51.760–2:54.060
zh说完了需要自己动手组装的底盘
2:54.060–2:56.300
zh我们再来看一个已经组装好加满油
2:56.300–2:57.700
zh随时能开的整车
2:57.700–2:58.900
zh腾讯的workbody
2:58.900–3:00.180
zh如果说deep-sea carless
3:00.180–3:01.820
zh是给开发者准备的乐高积木
3:01.820–3:03.420
zh那workbody就是一辆已经组装好的
3:03.420–3:04.860
zh设计好所有细节的汽车
3:04.860–3:06.340
zh它的核心目标非常明确
3:06.340–3:09.260
zh就是让普通的职场人用一句大白话
3:09.260–3:11.620
zh就能把一个相对完整的工作任务
3:11.620–3:12.920
zh交给AI去完成
3:12.920–3:14.080
zhWorkBuddy强调的是
3:14.080–3:15.020
zh全场景办公
3:15.020–3:15.880
zh多专家协作
3:15.880–3:16.720
zh和开箱即用
3:16.720–3:18.420
zh你可以用它来搜集资料
3:18.420–3:19.480
zh做市场调研
3:19.480–3:20.480
zh分析表格
3:20.480–3:21.580
zh生成PPT
3:21.580–3:22.880
zh写内容整理文件
3:22.880–3:23.880
zh甚至写点代码
3:23.880–3:25.420
zh你只需要告诉它你的目标
3:25.420–3:26.620
zh它会自己先去理解
3:26.620–3:27.580
zh然后把任务拆解
3:27.580–3:29.180
zh再调用不同领域的专家
3:29.180–3:29.980
zh并行处理
3:29.980–3:31.420
zh最后把结果交到你手上
3:31.420–3:32.980
zh你还可以检查和修改
3:32.980–3:34.020
zhWorkBuddy最大的优点
3:34.020–3:35.580
zh首先就是使用门槛极低
3:35.580–3:36.620
zh你完全不需要懂什么
3:36.620–3:37.220
zhPython编程
3:37.220–3:37.820
zhDocker容器
3:37.820–3:40.580
zhAPI要像量数据库这些听起来就头大的词
3:40.580–3:41.900
zh安装好之后直接就能用
3:41.900–3:43.660
zh这对大多数人来说太重要了
3:43.660–3:45.140
zh因为真正决定生产力的
3:45.140–3:46.740
zh往往不是理论上限有多高
3:46.740–3:48.540
zh而是一个工具能不能在10分钟内
3:48.540–3:49.980
zh就开始帮你创造价值
3:49.980–3:51.860
zh第二个优点是它对中文办公
3:51.860–3:53.540
zh和国内生态的适配特别好
3:53.540–3:55.740
zh它覆盖了Windows和macOS系统
3:55.740–3:57.700
zh还打通了桌面端主流的
3:57.700–3:59.860
zh即时通讯工具和微信小程序
3:59.860–4:02.580
zh无论是写中文报告做PPT处理Excel
4:02.580–4:04.420
zh还是跟国内企业的沟通场景
4:04.420–4:05.860
zhWorkbody的产品设计
4:05.860–4:07.860
zh都更贴近我们的日常办公习惯
4:07.860–4:08.860
zh第三个优点
4:08.860–4:11.460
zh是它把复杂的多智能体协作
4:11.460–4:13.760
zh包装成了一个用户能听懂的概念
4:13.760–4:14.960
zh叫专家团队
4:14.960–4:17.060
zh你不需要自己去设计什么研究agent
4:17.060–4:18.660
zh数据agent 协作agent
4:18.660–4:20.360
zh你只需要描述你的最终目标
4:20.360–4:22.060
zh系统会自动帮你组织
4:22.060–4:23.860
zh不同角色的专家来协作
4:23.860–4:26.660
zh这种把复杂技术藏在产品界面背后的设计
4:26.660–4:28.260
zh大大降低了用户的理解成本
4:28.260–4:29.560
zh当然 成品化也意味着
4:29.560–4:31.660
zh你失去了一部分底层的控制权
4:31.660–4:33.260
zh你很难像用开源框架那样
4:33.260–4:35.820
zh完全掌握它内部的每一个运行细节
4:35.820–4:37.100
zh它的透明度
4:37.100–4:39.140
zh可定制程度和模型选择的自由度
4:39.140–4:40.740
zh通常是不如DeepSeek Harness
4:40.740–4:42.700
zh或者我们接下来要说的Herms Agent的
4:42.700–4:45.060
zh而且对于一些特别复杂的代码仓库
4:45.060–4:46.380
zh严格的软件测试任务
4:46.380–4:49.460
zhWorkBuddy也未必比那些更专业的编码Agent有优势
4:49.460–4:52.020
zh所以WorkBuddy最适合的是谁呢
4:52.020–4:54.180
zh就是那些希望马上提升办公效率
4:54.180–4:56.300
zh但又不愿意投入大量时间去研究
4:56.300–4:57.660
zh部署和配置系统的人
4:57.660–5:01.100
zh它的竞争力不在于某一项底层技术有多么领先
5:01.100–5:05.220
zh而在于它把模型、工具、专家、文件和办公入口
5:05.220–5:07.380
zh整合成了一个可以直接上手用的产品
5:07.380–5:09.460
zh接下来我们聊聊一个很有意思的agent
5:09.460–5:10.620
zh叫做Hermes Agent
5:10.620–5:13.660
zh它是由一个叫Nous Research的团队开发的
5:13.660–5:16.340
zh这个agent最核心的理念跟前面两个都不太一样
5:16.340–5:18.860
zh它认为一个真正有价值的智能体
5:18.860–5:20.700
zh不应该每次跟你对话都像第一次见面
5:20.700–5:23.380
zh而应该在长期的使用中慢慢形成记忆
5:23.380–5:24.620
zh掌握你的工作习惯
5:24.620–5:25.900
zh并且把成功的经验
5:25.900–5:27.780
zh沉淀成可以反复使用的技能
5:27.780–5:29.900
zhHermes最大的特点就是闭环学习
5:29.900–5:31.580
zh它有一套长期记忆系统
5:31.580–5:32.860
zh可以保存你的个人偏好
5:32.860–5:34.260
zh项目背景和过去的经验
5:34.260–5:35.780
zh它还有一个技能系统
5:35.780–5:38.540
zh可以把一个多步骤的复杂流程
5:38.540–5:40.740
zh保存成一个可以一键调用的skill
5:40.740–5:41.620
zh也就是技能
5:41.620–5:42.900
zh以后再遇到类似的任务
5:42.900–5:44.180
zh它就不必重新摸索了
5:44.180–5:45.340
zh而是可以直接调用
5:45.340–5:46.620
zh已经形成的工作方法
5:46.620–5:47.140
zh打个比方
5:47.140–5:48.660
zh这就有点像一个实习生
5:48.660–5:49.940
zh刚来的时候什么都不会
5:49.940–5:51.020
zh但你在带他的过程中
5:51.020–5:51.740
zh他会犯错
5:51.740–5:52.580
zh你会纠正他
5:52.580–5:54.300
zh慢慢的他学会了怎么做报告
5:54.300–5:55.140
zh怎么分析数据
5:55.140–5:56.780
zh下次再让他做类似的工作
5:56.780–5:57.700
zh他就能直接上手
5:57.700–5:58.740
zh甚至做的又快又好
5:58.740–5:59.500
zhHermes就是这样
5:59.500–6:01.380
zh如果他在执行任务时走了弯路
6:01.380–6:02.620
zh最后找到了正确的方法
6:02.620–6:03.900
zh或者你纠正了他的做法
6:03.900–6:04.820
zh他可以把这些经验
6:04.820–6:05.860
zh写进他的技能库里
6:05.860–6:07.340
zh所以Hermes的价值
6:07.340–6:08.980
zh是会随着你使用它的时间
6:08.980–6:09.820
zh增长而增长的
6:09.820–6:11.660
zh他不是简单的记住聊天内容
6:11.660–6:13.460
zh而是在尝试把过去的经验
6:13.460–6:14.660
zh转化为程序化的工作流程
6:14.660–6:16.220
zh可复用的工作流程
6:16.220–6:17.420
zhHermes的第二个优点
6:17.420–6:18.900
zh是模型自由度很高
6:18.900–6:20.700
zh它可以连接OpenAI
6:20.700–6:21.500
enClaude
6:21.500–6:22.500
enGemini
6:22.500–6:23.500
enDeepSeek
6:23.500–6:25.340
zhQianwen等各种云端模型
6:25.340–6:26.700
zh甚至你本地的模型也行
6:26.700–6:29.020
zh你的长期记忆、技能和工具
6:29.020–6:31.180
zh是属于Hermes这个员工本身的
6:31.180–6:33.460
zh而不是绑定在某一个特定的大模型上
6:33.460–6:34.140
zh也就是说
6:34.140–6:36.420
zh你可以随时给这个员工换个大脑
6:36.420–6:38.180
zh但他已经学会的工作方法还在
6:38.180–6:39.860
zh第三个优点是它适合
6:39.860–6:41.060
zh长期在线运行
6:41.060–6:42.620
zh你可以把它部署在自己的
6:42.620–6:44.620
zh电脑上或者云端的服务器里
6:44.620–6:45.860
enTelegram
6:45.860–6:46.360
enDiscord
6:46.360–6:46.860
enSlack
6:46.860–6:47.393
enWhatsApp
6:47.393–6:48.760
zh非输 企业微信
6:48.760–6:50.100
zh这些渠道跟他交互
6:50.100–6:52.340
zh这意味着就算你人不在电脑前
6:52.340–6:53.900
zh也可以通过手机给他发个任务
6:53.900–6:55.440
zh让云端的agent继续帮你工作
6:55.440–6:57.760
zh他还内置了定时任务和子agent的能力
6:57.760–6:59.500
zh特别适合用来做周期性的报告
6:59.500–7:01.640
zh资料搜集 这类长期自动化任务
7:01.640–7:03.640
zh不过 关于Hermes的自进化
7:03.640–7:05.200
zh这里有一个非常重要的澄清
7:05.200–7:07.540
zh他通常不是自己重新训练的一个大语言模型
7:07.540–7:08.940
zh也不是说用了一段时间之后
7:08.940–7:11.440
zh模型本身的神经网络权重就自动改变了
7:11.440–7:12.900
zh他所谓的成长主要发生在
7:12.900–7:15.500
zh在技能和系统提示这些层面上
7:15.500–7:17.060
zh它有一个叫Self Evolution
7:17.060–7:18.700
zh也就是自我进化的项目
7:18.700–7:20.980
zh会利用执行轨迹和评估数据
7:20.980–7:22.860
zh来生成和优化技能和提示词
7:22.860–7:24.660
zh但并不是在修改模型本身
7:24.660–7:26.900
zh这更接近于是工作流程
7:26.900–7:28.540
zh和提示系统的迭代
7:28.540–7:30.420
zh而不是模型的重新训练
7:30.420–7:31.260
zh这种机制
7:31.260–7:32.300
zh既是它的优势
7:32.300–7:33.260
zh也带来了风险
7:33.260–7:33.820
zh你想想
7:33.820–7:35.860
zh如果一个agent总结了错误的经验
7:35.860–7:36.780
zh他也可能把这个错误
7:36.780–7:37.620
zh写进他的记忆里
7:37.620–7:39.140
zh如果某一次偶然的特殊情况
7:39.140–7:40.460
zh被他误认为是普遍规律
7:40.460–7:42.780
zh那这个错误的流程就可能在以后被反复调用
7:42.780–7:46.500
zh所以Hermes提供了记忆写入和技能写入的审批机制
7:46.500–7:49.580
zh比较稳妥的做法是让agent先提出修改建议
7:49.580–7:51.620
zh然后由人来查看差异并批准
7:51.620–7:54.220
zh而不是让他完全不受控制的修改自己
7:54.220–7:55.860
zh这也给我们一个很重要的启发
7:55.860–7:58.740
zh一个AI的自我改进不能只看他有没有学习能力
7:58.740–8:00.300
zh还得看他有没有平衡能力
8:00.300–8:01.100
zh回滾
8:01.100–8:02.400
zh審批和安全邊界
8:02.400–8:03.900
zh没有验证机制的自我学习
8:03.900–8:05.100
zh可能只是让他在
8:05.100–8:06.600
zh更有信心的重复错误
8:06.600–8:09.100
zh最后我们来看看OpenAI的Codex
8:09.100–8:10.300
zh很多人对Codex的印象
8:10.300–8:12.400
zh可能还停留在他是一个编码助手
8:12.400–8:14.640
zh但现在它已经发展成一个由桌面端
8:14.640–8:17.800
zh命令行 IDE插件和云端环境组成的完整体系了
8:17.800–8:20.280
zh严格来说 OpenAI 把那些通用的研究
8:20.280–8:23.080
zh报告 表格 PPT 和文件交付等功能
8:23.080–8:24.920
zh更多的放在了 ChatGPT Work 里
8:24.920–8:28.520
zh而 Codex 仍然以代碼、項目、工具和工程執行為核心
8:28.520–8:31.000
zh当然 这两者的能力正在越来越多地共享
8:31.000–8:34.160
zhCodeX 最大的优点是它特别强调做完并验证
8:34.160–8:36.160
zh而不仅仅是给你一些建议
8:36.160–8:38.200
zh它可以读取你整个项目的文件
8:38.200–8:39.840
zh搜索代码 修改多个文件
8:39.840–8:42.440
zh运行命令 执行测试 查看报错信息
8:42.440–8:44.240
zh然后根据测试结果继续修复问题
8:44.240–8:46.640
zh最後交付給你的不只是一段示例代碼
8:46.640–8:48.640
zh而是一个完整的修改摘要
8:48.640–8:51.040
zh文件差異對比、測試結果
8:51.040–8:53.140
zh以及可以审查的最终成果
8:53.140–8:56.340
zh第二个优点是它的工程环境比较完整
8:56.340–8:57.740
zh你在本地的 Codex
8:57.740–9:00.640
zh可以直接使用你电脑上已经装好的编译器
9:00.640–9:02.140
zh测试工具和项目依赖
9:02.140–9:03.140
zh而雲端的 Codex
9:03.140–9:05.140
zh可以为不同的任务建立隔离的环境
9:05.140–9:07.540
zh让多个任务在后台并行运行
9:07.540–9:08.140
zh任务完成后
9:08.140–9:09.860
zh你可以清楚地看到他都改了些什么
9:09.860–9:11.220
zh可以要求他继续调整
9:11.220–9:14.460
zh或者直接把修改提交到你的代码仓库
9:14.460–9:15.380
zh第三个优点是
9:15.380–9:17.780
zh它的权限和安全边界做的比较成熟
9:17.780–9:20.900
zhCodex通过沙箱来限制它对文件和网络的访问
9:20.900–9:22.260
zh在执行一些高风险命令时
9:22.260–9:23.940
zh或者跨越权限边界的时候
9:23.940–9:25.140
zh会向你请求批准
9:25.140–9:27.340
zh这种设计可能会让操作显得有点谨慎
9:27.340–9:29.620
zh但对于一个能够真实修改文件
9:29.620–9:32.380
zh运行程序和连接外部工具的智能体来说
9:32.380–9:35.020
zh这种谨慎本身就是可靠性的重要组成部分
9:35.020–9:38.620
zh第四个优点是它把编码研究和文件交付连接了起来
9:38.620–9:40.620
zh在ChatGPT Work这个更大的环境里
9:40.620–9:43.220
zh同一套能力还可以用来生成和检查文档
9:43.220–9:47.020
zh表格、PPT、PDF、网站和数据分析结果
9:47.020–9:50.620
zh这意味着一个复杂的任务可以从资料搜集开始
9:50.620–9:52.020
zh经过分析和程序处理
9:52.020–9:54.120
zh最后形成可以直接使用的文件
9:54.120–9:56.020
zh整个流程都可以在一个环境里完成
9:56.020–9:57.920
zh当然Codex的局限也很清楚
9:57.920–10:01.720
zh它主要围绕OpenAI自家的模型和ChatGPT服务来运行
10:01.720–10:04.920
zh模型的自由度不如Hermes或者DeepSeek Harness
10:04.920–10:07.480
zh它虽然也支持技能记忆和项目规则
10:07.480–10:10.320
zh但不会把自动修改自己作为最核心的卖点
10:10.320–10:11.680
zh它的取向更加保守
10:11.680–10:14.200
zh宁可让流程可审查可验证
10:14.200–10:16.520
zh也不轻易让agent自行改变长期规则
10:16.520–10:17.020
zh好了
10:17.020–10:18.840
zh现在我们把这四个智能体放在一起
10:18.840–10:20.600
zh就能得到一个非常清晰的结论了
10:20.600–10:23.040
zh如果你的目标是开发一个自己的agent的产品
10:23.040–10:25.480
zh那DeepSeek Harness最有吸引力
10:25.480–10:27.440
zh因为它开放模块化
10:27.440–10:28.800
zh运行过程可追溯
10:28.800–10:31.520
zh如果你的目标是普通办公人员想马上提高效率
10:31.520–10:32.600
zh那Workbody最方便
10:32.600–10:34.920
zh因为它把复杂的技术包装成了用户友好的界面
10:34.920–10:37.800
zh如果你的目标是培养一个能长期在线
10:37.800–10:40.000
zh逐渐熟悉你个人工作方式的智能体
10:40.000–10:41.640
zh那Hermes最有特色
10:41.640–10:43.480
zh如果你的目标是完成复杂的代码
10:43.480–10:45.960
zh工具执行和需要严格验证的专业任务
10:45.960–10:47.920
zh那Codex的综合完成度更高
10:47.920–10:51.560
zh你看他们代表的其实是4条完全不同的路线
10:51.560–10:53.960
zhDeepSeek Harness追求的是架构上的自由
10:53.960–10:55.880
zhWorkBuddy追求的是使用的便利
10:55.880–10:57.960
zhHermes追求的是长期的成长
10:57.960–11:00.200
zh而Codex追求的是可靠的交付
11:00.200–11:00.840
zh聊到这里
11:00.840–11:03.080
zh还有三点特别值得我们进一步思考
11:03.080–11:06.720
zh第一 未来agent的竞争绝对不会只发生在模型层面
11:06.720–11:08.080
zh模型当然很重要
11:08.080–11:09.480
zh它决定了智力的上限
11:09.480–11:12.920
zh但真正决定这个智能体能不能稳定落地完成实际工作的
11:12.920–11:16.120
zh是模型之外的那個架構也就是它的運行底座
11:16.120–11:17.080
zh它能用什么工具
11:17.080–11:18.480
zh能访问哪些文件
11:18.480–11:19.160
zh怎么记忆
11:19.160–11:20.280
zh怎么调度任务
11:20.280–11:21.400
zh出错了能不能恢复
11:21.400–11:25.080
zh以及我们作为使用者能不能看清它到底都做了什么
11:25.080–11:26.360
zh这些才是关键
11:26.360–11:28.480
zh第二 我们刚才聊到的所谓自进化
11:28.480–11:30.600
zh绝对不能脱离一个有效的评估系统
11:30.600–11:34.120
zh一个agent能够修改自己的技能并不等于他一定会变得更好
11:34.120–11:37.360
zh真正有效的自我改进至少需要完整的执行记录
11:37.360–11:40.640
zh客觀的測試數據 效果比較以及必要的人類審批
11:40.640–11:42.240
zh以及出错了能回滚的方案
11:42.240–11:46.520
zh否則他可能只是在更有信心的把你最初交給他的那個錯誤
11:46.520–11:48.240
zh一遍又一遍的固化下来
11:48.240–11:50.960
zh第三 最好的agent不一定是最自主的agent
11:50.960–11:53.360
zh对于很多低风险的重复性的任务
11:53.360–11:55.800
zh高程度的自动化确实能节省大量时间
11:55.800–12:00.160
zh但是当涉及到付款 删除文件 发布公开内容
12:00.160–12:03.440
zh修改正式代码或者处理敏感数据这些关键操作时
12:03.440–12:05.760
zh一个能够暂停下来向你解释情况
12:05.760–12:06.960
zh并等待你确认的agent
12:06.960–12:09.760
zh它的价值其实远远高于一个完全自主
12:09.760–12:11.160
zh从不请示的agent
12:11.160–12:14.240
zh一個成熟的智能體系統不是要取消人的判斷
12:14.240–12:15.760
zh而是要把人的判断
12:15.760–12:18.160
zh集中到那些最关键的节点上
12:18.160–12:19.920
zh最后我们来总结一下今天的内容
12:19.920–12:20.960
enDeepSake Harness
12:20.960–12:24.360
zh最适合作为构建自由agent系统的开放底座
12:24.360–12:25.560
zh腾讯的WorkBuddy
12:25.560–12:26.320
zh最省事
12:26.320–12:28.920
zh适合想直接进入日常办公场景的用户
12:28.920–12:32.560
zhHermes Agent最像一个会积累记忆和技能的长期AI员工
12:32.560–12:35.800
zh而OpenAI的Codex则最擅长把复杂的专业工作
12:35.800–12:38.080
zh真正做完并进行严格的验证
12:38.080–12:41.480
zh所以下次你在选择的时候不要只问谁最强
12:41.480–12:43.440
zh而要问自己三个更具体的问题
12:43.440–12:45.320
zh第一 我需要的是一个成品工具
12:45.320–12:46.880
zh还是一个可以自己开发的框架
12:46.880–12:49.840
zh第二 我更看重的是即时的效率提升
12:49.840–12:51.520
zh还是长期的成长和陪伴
12:51.520–12:55.160
zh第三 我是否需要掌握对模型
12:55.160–12:58.360
zh数据 权限和运行环境的控制权
12:58.360–12:59.960
zh当你把这三个问题想清楚之后
12:59.960–13:01.960
zh這四者之間的選擇就一点都不模糊了
13:01.960–13:03.160
zh他们不是简单的
13:03.160–13:04.640
zh谁替代谁的关系
13:04.640–13:06.720
zh而是分别服务于不同层级
13:06.720–13:07.600
zh不同需求的
13:07.600–13:09.120
zh未来更常见的情况
13:09.120–13:10.760
zh可能也不是某一个超级agent
13:10.760–13:11.720
zh包揽所有工作
13:11.720–13:13.800
zh而是像今天聊到的成品办公agent
13:13.800–13:14.760
zh专业工程agent
13:14.760–13:16.760
zh长期个人agent和企业开源底座
13:16.760–13:17.720
zh他们相互配合
13:17.720–13:19.720
zh共同组成一个真正好用的
13:19.720–13:20.720
zhAI工作系统
0:00.000–0:01.360
2026年AI智能体
0:01.360–0:02.960
也就是我们常说的AI agent
0:02.960–0:03.840
一下子就火了
0:03.840–0:05.760
你随便一搜就能看到各种各样的产品
0:05.760–0:07.320
比如DeepSeaKarnes
0:07.320–0:08.320
腾讯的WorkBody
0:08.320–0:10.000
一个叫HermesAgent的
0:10.000–0:11.520
还有OpenAI的Codex
0:11.520–0:13.200
乍一看他们好像
0:13.200–0:15.120
都差不多都是能自己干活的AI
0:15.120–0:16.960
我们是不是只要比比谁更聪明就行了
0:16.960–0:18.160
他们四个其实代表了
0:18.160–0:20.240
四种完全不同的发展路线
0:20.240–0:22.080
今天咱们最重要的任务
0:22.080–0:23.840
就不是给他们排个1234
0:23.840–0:25.520
而是要把这四家的底细都摸清楚
0:25.520–0:27.760
他们各自到底在解决什么问题
0:27.760–0:28.720
最厉害的地方在哪
0:28.720–0:30.380
又分别适合什么样的人去用
0:30.380–0:31.460
咱们一个一个来看
0:31.460–0:33.220
先说deepseek harness
0:33.220–0:35.560
这个名字里的harness翻译过来有点像
0:35.560–0:38.320
智能体的运行底座或者框架
0:38.320–0:39.120
你可以这么理解
0:39.120–0:40.320
一个大模型
0:40.320–0:41.760
就像一个聪明的大脑
0:41.760–0:42.800
它会思考
0:42.800–0:43.700
会说话
0:43.700–0:45.400
但是它光有大脑
0:45.400–0:46.900
是没法帮你完成一个
0:46.900–0:48.400
现实世界里的具体任务的
0:48.400–0:49.900
它得有手有脚
0:49.900–0:51.100
得有工具
0:51.100–0:52.100
得有记忆
0:52.100–0:53.300
得有个工作台
0:53.300–0:55.000
这个harness就是给它提供
0:55.000–0:57.940
身体操作系统和工作环境的那一整套东西
0:57.940–0:59.442
DeepSeaKarnes最核心的设计理念叫
0:59.442–1:00.740
Everything is a Plugin
1:00.740–1:02.740
翻译过来就是一切皆插件
1:02.740–1:04.740
你用哪个大语言模型可以换
1:04.740–1:06.840
你需要它用什么工具可以换
1:06.840–1:09.640
它的记忆系统存储方式任务调度方法
1:09.640–1:11.740
甚至是用戶界面全都可以換
1:11.740–1:13.240
开发者就像搭积木一样
1:13.240–1:15.840
用配置的方式就能把这些能力重新组合起来
1:15.840–1:17.340
而不用动框架本身的代码
1:17.340–1:19.540
这就带来了几个非常突出的优点
1:19.540–1:21.840
第一 开放性和可组合性超级强
1:21.840–1:24.840
比如说一家公司想搞一套自己的内部智能体
1:24.840–1:27.540
又不想被某一家模型公司给绑架
1:27.540–1:30.040
那就可以把不同公司的模型都接進這個Harness裡
1:30.040–1:32.640
遇到复杂的推理任务就调用能力最强的那个模型
1:32.640–1:33.940
遇到普通的整理任务
1:33.940–1:35.840
就用一个成本更低的模型
1:35.840–1:37.440
甚至处理一些敏感数据
1:37.440–1:40.340
可以直接用部署在自己服务器上的本地模型
1:40.340–1:41.640
这就非常灵活了
1:41.640–1:42.240
第二
1:42.240–1:43.840
它的运行过程非常透明
1:43.840–1:45.040
它会详细记录下
1:45.040–1:46.640
模型每一步都看到了什么
1:46.640–1:48.040
系统给了它什么指令
1:48.040–1:49.140
它调用了什么工具
1:49.140–1:51.340
又派出了哪个小助手去干活
1:51.340–1:54.740
整個任務過程可以被恢復、搜索、分叉和重放
1:54.740–1:56.740
这一点对开发者来说太重要了
1:56.740–1:59.140
因为AI智能体最让人头疼的一个问题就是
1:59.140–1:59.940
它要是做错了事
1:59.940–2:01.240
你根本不知道它为什么错
2:01.240–2:03.440
有了这份完整的黑匣子飞行记录
2:03.440–2:05.740
调试评估和审计就都有了依据
2:05.740–2:06.240
第三
2:06.240–2:08.240
它不只提供一种固定的工作模式
2:08.240–2:10.840
它有标准模式适合绝大多数任务
2:10.840–2:12.340
有代码模式
2:12.340–2:15.440
让模型直接写程序来组织复杂的工具调用
2:15.440–2:17.940
還有最小模式只保留最核心的功能
2:17.940–2:20.420
方便测试模型最原始的智能体能力
2:20.420–2:21.860
甚至还有一个Creator模式
2:21.860–2:24.500
专门用来设计新的插件和智能体模板
2:24.500–2:25.860
当然缺点也很明显
2:25.860–2:27.820
DeepSeek Harness更像是一个基础设施
2:27.820–2:29.340
一个给专业人士用的工具包
2:29.340–2:30.700
而不是咱们普通人下载下来
2:30.700–2:32.220
就能直接当办公助手用的
2:32.220–2:34.500
模型怎么选 工具怎么接 权限怎么配
2:34.500–2:36.700
数据怎么存 这些都得你自己来负责
2:36.700–2:39.260
而且它目前还处在开发者预览阶段
2:39.260–2:41.220
接口和插件生态都还在快速变化
2:41.220–2:42.860
所以它最大的价值
2:42.860–2:45.460
不是让你马上扔掉现在的AI助手
2:45.460–2:48.020
而是为那些有开发能力的企业或者团队
2:48.020–2:50.420
提供了一套可控可扩展的
2:50.420–2:51.260
agent底盘
2:51.260–2:51.760
好
2:51.760–2:54.060
说完了需要自己动手组装的底盘
2:54.060–2:56.300
我们再来看一个已经组装好加满油
2:56.300–2:57.700
随时能开的整车
2:57.700–2:58.900
腾讯的workbody
2:58.900–3:00.180
如果说deep-sea carless
3:00.180–3:01.820
是给开发者准备的乐高积木
3:01.820–3:03.420
那workbody就是一辆已经组装好的
3:03.420–3:04.860
设计好所有细节的汽车
3:04.860–3:06.340
它的核心目标非常明确
3:06.340–3:09.260
就是让普通的职场人用一句大白话
3:09.260–3:11.620
就能把一个相对完整的工作任务
3:11.620–3:12.920
交给AI去完成
3:12.920–3:14.080
WorkBuddy强调的是
3:14.080–3:15.020
全场景办公
3:15.020–3:15.880
多专家协作
3:15.880–3:16.720
和开箱即用
3:16.720–3:18.420
你可以用它来搜集资料
3:18.420–3:19.480
做市场调研
3:19.480–3:20.480
分析表格
3:20.480–3:21.580
生成PPT
3:21.580–3:22.880
写内容整理文件
3:22.880–3:23.880
甚至写点代码
3:23.880–3:25.420
你只需要告诉它你的目标
3:25.420–3:26.620
它会自己先去理解
3:26.620–3:27.580
然后把任务拆解
3:27.580–3:29.180
再调用不同领域的专家
3:29.180–3:29.980
并行处理
3:29.980–3:31.420
最后把结果交到你手上
3:31.420–3:32.980
你还可以检查和修改
3:32.980–3:34.020
WorkBuddy最大的优点
3:34.020–3:35.580
首先就是使用门槛极低
3:35.580–3:36.620
你完全不需要懂什么
3:36.620–3:37.220
Python编程
3:37.220–3:37.820
Docker容器
3:37.820–3:40.580
API要像量数据库这些听起来就头大的词
3:40.580–3:41.900
安装好之后直接就能用
3:41.900–3:43.660
这对大多数人来说太重要了
3:43.660–3:45.140
因为真正决定生产力的
3:45.140–3:46.740
往往不是理论上限有多高
3:46.740–3:48.540
而是一个工具能不能在10分钟内
3:48.540–3:49.980
就开始帮你创造价值
3:49.980–3:51.860
第二个优点是它对中文办公
3:51.860–3:53.540
和国内生态的适配特别好
3:53.540–3:55.740
它覆盖了Windows和macOS系统
3:55.740–3:57.700
还打通了桌面端主流的
3:57.700–3:59.860
即时通讯工具和微信小程序
3:59.860–4:02.580
无论是写中文报告做PPT处理Excel
4:02.580–4:04.420
还是跟国内企业的沟通场景
4:04.420–4:05.860
Workbody的产品设计
4:05.860–4:07.860
都更贴近我们的日常办公习惯
4:07.860–4:08.860
第三个优点
4:08.860–4:11.460
是它把复杂的多智能体协作
4:11.460–4:13.760
包装成了一个用户能听懂的概念
4:13.760–4:14.960
叫专家团队
4:14.960–4:17.060
你不需要自己去设计什么研究agent
4:17.060–4:18.660
数据agent 协作agent
4:18.660–4:20.360
你只需要描述你的最终目标
4:20.360–4:22.060
系统会自动帮你组织
4:22.060–4:23.860
不同角色的专家来协作
4:23.860–4:26.660
这种把复杂技术藏在产品界面背后的设计
4:26.660–4:28.260
大大降低了用户的理解成本
4:28.260–4:29.560
当然 成品化也意味着
4:29.560–4:31.660
你失去了一部分底层的控制权
4:31.660–4:33.260
你很难像用开源框架那样
4:33.260–4:35.820
完全掌握它内部的每一个运行细节
4:35.820–4:37.100
它的透明度
4:37.100–4:39.140
可定制程度和模型选择的自由度
4:39.140–4:40.740
通常是不如DeepSeek Harness
4:40.740–4:42.700
或者我们接下来要说的Herms Agent的
4:42.700–4:45.060
而且对于一些特别复杂的代码仓库
4:45.060–4:46.380
严格的软件测试任务
4:46.380–4:49.460
WorkBuddy也未必比那些更专业的编码Agent有优势
4:49.460–4:52.020
所以WorkBuddy最适合的是谁呢
4:52.020–4:54.180
就是那些希望马上提升办公效率
4:54.180–4:56.300
但又不愿意投入大量时间去研究
4:56.300–4:57.660
部署和配置系统的人
4:57.660–5:01.100
它的竞争力不在于某一项底层技术有多么领先
5:01.100–5:05.220
而在于它把模型、工具、专家、文件和办公入口
5:05.220–5:07.380
整合成了一个可以直接上手用的产品
5:07.380–5:09.460
接下来我们聊聊一个很有意思的agent
5:09.460–5:10.620
叫做Hermes Agent
5:10.620–5:13.660
它是由一个叫Nous Research的团队开发的
5:13.660–5:16.340
这个agent最核心的理念跟前面两个都不太一样
5:16.340–5:18.860
它认为一个真正有价值的智能体
5:18.860–5:20.700
不应该每次跟你对话都像第一次见面
5:20.700–5:23.380
而应该在长期的使用中慢慢形成记忆
5:23.380–5:24.620
掌握你的工作习惯
5:24.620–5:25.900
并且把成功的经验
5:25.900–5:27.780
沉淀成可以反复使用的技能
5:27.780–5:29.900
Hermes最大的特点就是闭环学习
5:29.900–5:31.580
它有一套长期记忆系统
5:31.580–5:32.860
可以保存你的个人偏好
5:32.860–5:34.260
项目背景和过去的经验
5:34.260–5:35.780
它还有一个技能系统
5:35.780–5:38.540
可以把一个多步骤的复杂流程
5:38.540–5:40.740
保存成一个可以一键调用的skill
5:40.740–5:41.620
也就是技能
5:41.620–5:42.900
以后再遇到类似的任务
5:42.900–5:44.180
它就不必重新摸索了
5:44.180–5:45.340
而是可以直接调用
5:45.340–5:46.620
已经形成的工作方法
5:46.620–5:47.140
打个比方
5:47.140–5:48.660
这就有点像一个实习生
5:48.660–5:49.940
刚来的时候什么都不会
5:49.940–5:51.020
但你在带他的过程中
5:51.020–5:51.740
他会犯错
5:51.740–5:52.580
你会纠正他
5:52.580–5:54.300
慢慢的他学会了怎么做报告
5:54.300–5:55.140
怎么分析数据
5:55.140–5:56.780
下次再让他做类似的工作
5:56.780–5:57.700
他就能直接上手
5:57.700–5:58.740
甚至做的又快又好
5:58.740–5:59.500
Hermes就是这样
5:59.500–6:01.380
如果他在执行任务时走了弯路
6:01.380–6:02.620
最后找到了正确的方法
6:02.620–6:03.900
或者你纠正了他的做法
6:03.900–6:04.820
他可以把这些经验
6:04.820–6:05.860
写进他的技能库里
6:05.860–6:07.340
所以Hermes的价值
6:07.340–6:08.980
是会随着你使用它的时间
6:08.980–6:09.820
增长而增长的
6:09.820–6:11.660
他不是简单的记住聊天内容
6:11.660–6:13.460
而是在尝试把过去的经验
6:13.460–6:14.660
转化为程序化的工作流程
6:14.660–6:16.220
可复用的工作流程
6:16.220–6:17.420
Hermes的第二个优点
6:17.420–6:18.900
是模型自由度很高
6:18.900–6:20.700
它可以连接OpenAI
6:20.700–6:21.500
Claude
6:21.500–6:22.500
Gemini
6:22.500–6:23.500
DeepSeek
6:23.500–6:25.340
Qianwen等各种云端模型
6:25.340–6:26.700
甚至你本地的模型也行
6:26.700–6:29.020
你的长期记忆、技能和工具
6:29.020–6:31.180
是属于Hermes这个员工本身的
6:31.180–6:33.460
而不是绑定在某一个特定的大模型上
6:33.460–6:34.140
也就是说
6:34.140–6:36.420
你可以随时给这个员工换个大脑
6:36.420–6:38.180
但他已经学会的工作方法还在
6:38.180–6:39.860
第三个优点是它适合
6:39.860–6:41.060
长期在线运行
6:41.060–6:42.620
你可以把它部署在自己的
6:42.620–6:44.620
电脑上或者云端的服务器里
6:44.620–6:45.860
Telegram
6:45.860–6:46.360
Discord
6:46.360–6:46.860
Slack
6:46.860–6:47.393
WhatsApp
6:47.393–6:48.760
非输 企业微信
6:48.760–6:50.100
这些渠道跟他交互
6:50.100–6:52.340
这意味着就算你人不在电脑前
6:52.340–6:53.900
也可以通过手机给他发个任务
6:53.900–6:55.440
让云端的agent继续帮你工作
6:55.440–6:57.760
他还内置了定时任务和子agent的能力
6:57.760–6:59.500
特别适合用来做周期性的报告
6:59.500–7:01.640
资料搜集 这类长期自动化任务
7:01.640–7:03.640
不过 关于Hermes的自进化
7:03.640–7:05.200
这里有一个非常重要的澄清
7:05.200–7:07.540
他通常不是自己重新训练的一个大语言模型
7:07.540–7:08.940
也不是说用了一段时间之后
7:08.940–7:11.440
模型本身的神经网络权重就自动改变了
7:11.440–7:12.900
他所谓的成长主要发生在
7:12.900–7:15.500
在技能和系统提示这些层面上
7:15.500–7:17.060
它有一个叫Self Evolution
7:17.060–7:18.700
也就是自我进化的项目
7:18.700–7:20.980
会利用执行轨迹和评估数据
7:20.980–7:22.860
来生成和优化技能和提示词
7:22.860–7:24.660
但并不是在修改模型本身
7:24.660–7:26.900
这更接近于是工作流程
7:26.900–7:28.540
和提示系统的迭代
7:28.540–7:30.420
而不是模型的重新训练
7:30.420–7:31.260
这种机制
7:31.260–7:32.300
既是它的优势
7:32.300–7:33.260
也带来了风险
7:33.260–7:33.820
你想想
7:33.820–7:35.860
如果一个agent总结了错误的经验
7:35.860–7:36.780
他也可能把这个错误
7:36.780–7:37.620
写进他的记忆里
7:37.620–7:39.140
如果某一次偶然的特殊情况
7:39.140–7:40.460
被他误认为是普遍规律
7:40.460–7:42.780
那这个错误的流程就可能在以后被反复调用
7:42.780–7:46.500
所以Hermes提供了记忆写入和技能写入的审批机制
7:46.500–7:49.580
比较稳妥的做法是让agent先提出修改建议
7:49.580–7:51.620
然后由人来查看差异并批准
7:51.620–7:54.220
而不是让他完全不受控制的修改自己
7:54.220–7:55.860
这也给我们一个很重要的启发
7:55.860–7:58.740
一个AI的自我改进不能只看他有没有学习能力
7:58.740–8:00.300
还得看他有没有平衡能力
8:00.300–8:01.100
回滾
8:01.100–8:02.400
審批和安全邊界
8:02.400–8:03.900
没有验证机制的自我学习
8:03.900–8:05.100
可能只是让他在
8:05.100–8:06.600
更有信心的重复错误
8:06.600–8:09.100
最后我们来看看OpenAI的Codex
8:09.100–8:10.300
很多人对Codex的印象
8:10.300–8:12.400
可能还停留在他是一个编码助手
8:12.400–8:14.640
但现在它已经发展成一个由桌面端
8:14.640–8:17.800
命令行 IDE插件和云端环境组成的完整体系了
8:17.800–8:20.280
严格来说 OpenAI 把那些通用的研究
8:20.280–8:23.080
报告 表格 PPT 和文件交付等功能
8:23.080–8:24.920
更多的放在了 ChatGPT Work 里
8:24.920–8:28.520
而 Codex 仍然以代碼、項目、工具和工程執行為核心
8:28.520–8:31.000
当然 这两者的能力正在越来越多地共享
8:31.000–8:34.160
CodeX 最大的优点是它特别强调做完并验证
8:34.160–8:36.160
而不仅仅是给你一些建议
8:36.160–8:38.200
它可以读取你整个项目的文件
8:38.200–8:39.840
搜索代码 修改多个文件
8:39.840–8:42.440
运行命令 执行测试 查看报错信息
8:42.440–8:44.240
然后根据测试结果继续修复问题
8:44.240–8:46.640
最後交付給你的不只是一段示例代碼
8:46.640–8:48.640
而是一个完整的修改摘要
8:48.640–8:51.040
文件差異對比、測試結果
8:51.040–8:53.140
以及可以审查的最终成果
8:53.140–8:56.340
第二个优点是它的工程环境比较完整
8:56.340–8:57.740
你在本地的 Codex
8:57.740–9:00.640
可以直接使用你电脑上已经装好的编译器
9:00.640–9:02.140
测试工具和项目依赖
9:02.140–9:03.140
而雲端的 Codex
9:03.140–9:05.140
可以为不同的任务建立隔离的环境
9:05.140–9:07.540
让多个任务在后台并行运行
9:07.540–9:08.140
任务完成后
9:08.140–9:09.860
你可以清楚地看到他都改了些什么
9:09.860–9:11.220
可以要求他继续调整
9:11.220–9:14.460
或者直接把修改提交到你的代码仓库
9:14.460–9:15.380
第三个优点是
9:15.380–9:17.780
它的权限和安全边界做的比较成熟
9:17.780–9:20.900
Codex通过沙箱来限制它对文件和网络的访问
9:20.900–9:22.260
在执行一些高风险命令时
9:22.260–9:23.940
或者跨越权限边界的时候
9:23.940–9:25.140
会向你请求批准
9:25.140–9:27.340
这种设计可能会让操作显得有点谨慎
9:27.340–9:29.620
但对于一个能够真实修改文件
9:29.620–9:32.380
运行程序和连接外部工具的智能体来说
9:32.380–9:35.020
这种谨慎本身就是可靠性的重要组成部分
9:35.020–9:38.620
第四个优点是它把编码研究和文件交付连接了起来
9:38.620–9:40.620
在ChatGPT Work这个更大的环境里
9:40.620–9:43.220
同一套能力还可以用来生成和检查文档
9:43.220–9:47.020
表格、PPT、PDF、网站和数据分析结果
9:47.020–9:50.620
这意味着一个复杂的任务可以从资料搜集开始
9:50.620–9:52.020
经过分析和程序处理
9:52.020–9:54.120
最后形成可以直接使用的文件
9:54.120–9:56.020
整个流程都可以在一个环境里完成
9:56.020–9:57.920
当然Codex的局限也很清楚
9:57.920–10:01.720
它主要围绕OpenAI自家的模型和ChatGPT服务来运行
10:01.720–10:04.920
模型的自由度不如Hermes或者DeepSeek Harness
10:04.920–10:07.480
它虽然也支持技能记忆和项目规则
10:07.480–10:10.320
但不会把自动修改自己作为最核心的卖点
10:10.320–10:11.680
它的取向更加保守
10:11.680–10:14.200
宁可让流程可审查可验证
10:14.200–10:16.520
也不轻易让agent自行改变长期规则
10:16.520–10:17.020
好了
10:17.020–10:18.840
现在我们把这四个智能体放在一起
10:18.840–10:20.600
就能得到一个非常清晰的结论了
10:20.600–10:23.040
如果你的目标是开发一个自己的agent的产品
10:23.040–10:25.480
那DeepSeek Harness最有吸引力
10:25.480–10:27.440
因为它开放模块化
10:27.440–10:28.800
运行过程可追溯
10:28.800–10:31.520
如果你的目标是普通办公人员想马上提高效率
10:31.520–10:32.600
那Workbody最方便
10:32.600–10:34.920
因为它把复杂的技术包装成了用户友好的界面
10:34.920–10:37.800
如果你的目标是培养一个能长期在线
10:37.800–10:40.000
逐渐熟悉你个人工作方式的智能体
10:40.000–10:41.640
那Hermes最有特色
10:41.640–10:43.480
如果你的目标是完成复杂的代码
10:43.480–10:45.960
工具执行和需要严格验证的专业任务
10:45.960–10:47.920
那Codex的综合完成度更高
10:47.920–10:51.560
你看他们代表的其实是4条完全不同的路线
10:51.560–10:53.960
DeepSeek Harness追求的是架构上的自由
10:53.960–10:55.880
WorkBuddy追求的是使用的便利
10:55.880–10:57.960
Hermes追求的是长期的成长
10:57.960–11:00.200
而Codex追求的是可靠的交付
11:00.200–11:00.840
聊到这里
11:00.840–11:03.080
还有三点特别值得我们进一步思考
11:03.080–11:06.720
第一 未来agent的竞争绝对不会只发生在模型层面
11:06.720–11:08.080
模型当然很重要
11:08.080–11:09.480
它决定了智力的上限
11:09.480–11:12.920
但真正决定这个智能体能不能稳定落地完成实际工作的
11:12.920–11:16.120
是模型之外的那個架構也就是它的運行底座
11:16.120–11:17.080
它能用什么工具
11:17.080–11:18.480
能访问哪些文件
11:18.480–11:19.160
怎么记忆
11:19.160–11:20.280
怎么调度任务
11:20.280–11:21.400
出错了能不能恢复
11:21.400–11:25.080
以及我们作为使用者能不能看清它到底都做了什么
11:25.080–11:26.360
这些才是关键
11:26.360–11:28.480
第二 我们刚才聊到的所谓自进化
11:28.480–11:30.600
绝对不能脱离一个有效的评估系统
11:30.600–11:34.120
一个agent能够修改自己的技能并不等于他一定会变得更好
11:34.120–11:37.360
真正有效的自我改进至少需要完整的执行记录
11:37.360–11:40.640
客觀的測試數據 效果比較以及必要的人類審批
11:40.640–11:42.240
以及出错了能回滚的方案
11:42.240–11:46.520
否則他可能只是在更有信心的把你最初交給他的那個錯誤
11:46.520–11:48.240
一遍又一遍的固化下来
11:48.240–11:50.960
第三 最好的agent不一定是最自主的agent
11:50.960–11:53.360
对于很多低风险的重复性的任务
11:53.360–11:55.800
高程度的自动化确实能节省大量时间
11:55.800–12:00.160
但是当涉及到付款 删除文件 发布公开内容
12:00.160–12:03.440
修改正式代码或者处理敏感数据这些关键操作时
12:03.440–12:05.760
一个能够暂停下来向你解释情况
12:05.760–12:06.960
并等待你确认的agent
12:06.960–12:09.760
它的价值其实远远高于一个完全自主
12:09.760–12:11.160
从不请示的agent
12:11.160–12:14.240
一個成熟的智能體系統不是要取消人的判斷
12:14.240–12:15.760
而是要把人的判断
12:15.760–12:18.160
集中到那些最关键的节点上
12:18.160–12:19.920
最后我们来总结一下今天的内容
12:19.920–12:20.960
DeepSake Harness
12:20.960–12:24.360
最适合作为构建自由agent系统的开放底座
12:24.360–12:25.560
腾讯的WorkBuddy
12:25.560–12:26.320
最省事
12:26.320–12:28.920
适合想直接进入日常办公场景的用户
12:28.920–12:32.560
Hermes Agent最像一个会积累记忆和技能的长期AI员工
12:32.560–12:35.800
而OpenAI的Codex则最擅长把复杂的专业工作
12:35.800–12:38.080
真正做完并进行严格的验证
12:38.080–12:41.480
所以下次你在选择的时候不要只问谁最强
12:41.480–12:43.440
而要问自己三个更具体的问题
12:43.440–12:45.320
第一 我需要的是一个成品工具
12:45.320–12:46.880
还是一个可以自己开发的框架
12:46.880–12:49.840
第二 我更看重的是即时的效率提升
12:49.840–12:51.520
还是长期的成长和陪伴
12:51.520–12:55.160
第三 我是否需要掌握对模型
12:55.160–12:58.360
数据 权限和运行环境的控制权
12:58.360–12:59.960
当你把这三个问题想清楚之后
12:59.960–13:01.960
這四者之間的選擇就一点都不模糊了
13:01.960–13:03.160
他们不是简单的
13:03.160–13:04.640
谁替代谁的关系
13:04.640–13:06.720
而是分别服务于不同层级
13:06.720–13:07.600
不同需求的
13:07.600–13:09.120
未来更常见的情况
13:09.120–13:10.760
可能也不是某一个超级agent
13:10.760–13:11.720
包揽所有工作
13:11.720–13:13.800
而是像今天聊到的成品办公agent
13:13.800–13:14.760
专业工程agent
13:14.760–13:16.760
长期个人agent和企业开源底座
13:16.760–13:17.720
他们相互配合
13:17.720–13:19.720
共同组成一个真正好用的
13:19.720–13:20.720
AI工作系统
0:00.000–0:01.360
zh2026年AI智能体
2026年AI智能体
0:01.360–0:02.960
zh也就是我们常说的AI agent
也就是我们常说的AI agent
0:02.960–0:03.840
zh一下子就火了
一下子就火了
0:03.840–0:05.760
zh你随便一搜就能看到各种各样的产品
你随便一搜就能看到各种各样的产品
0:05.760–0:07.320
zh比如DeepSeaKarnes
比如DeepSeaKarnes
0:07.320–0:08.320
zh腾讯的WorkBody
腾讯的WorkBody
0:08.320–0:10.000
zh一个叫HermesAgent的
一个叫HermesAgent的
0:10.000–0:11.520
zh还有OpenAI的Codex
还有OpenAI的Codex
0:11.520–0:13.200
zh乍一看他们好像
乍一看他们好像
0:13.200–0:15.120
zh都差不多都是能自己干活的AI
都差不多都是能自己干活的AI
0:15.120–0:16.960
zh我们是不是只要比比谁更聪明就行了
我们是不是只要比比谁更聪明就行了
0:16.960–0:18.160
zh他们四个其实代表了
他们四个其实代表了
0:18.160–0:20.240
zh四种完全不同的发展路线
四种完全不同的发展路线
0:20.240–0:22.080
zh今天咱们最重要的任务
今天咱们最重要的任务
0:22.080–0:23.840
zh就不是给他们排个1234
就不是给他们排个1234
0:23.840–0:25.520
zh而是要把这四家的底细都摸清楚
而是要把这四家的底细都摸清楚
0:25.520–0:27.760
zh他们各自到底在解决什么问题
他们各自到底在解决什么问题
0:27.760–0:28.720
zh最厉害的地方在哪
最厉害的地方在哪
0:28.720–0:30.380
zh又分别适合什么样的人去用
又分别适合什么样的人去用
0:30.380–0:31.460
zh咱们一个一个来看
咱们一个一个来看
0:31.460–0:33.220
zh先说deepseek harness
先说deepseek harness
0:33.220–0:35.560
zh这个名字里的harness翻译过来有点像
这个名字里的harness翻译过来有点像
0:35.560–0:38.320
zh智能体的运行底座或者框架
智能体的运行底座或者框架
0:38.320–0:39.120
zh你可以这么理解
你可以这么理解
0:39.120–0:40.320
zh一个大模型
一个大模型
0:40.320–0:41.760
zh就像一个聪明的大脑
就像一个聪明的大脑
0:41.760–0:42.800
zh它会思考
它会思考
0:42.800–0:43.700
zh会说话
会说话
0:43.700–0:45.400
zh但是它光有大脑
但是它光有大脑
0:45.400–0:46.900
zh是没法帮你完成一个
是没法帮你完成一个
0:46.900–0:48.400
zh现实世界里的具体任务的
现实世界里的具体任务的
0:48.400–0:49.900
zh它得有手有脚
它得有手有脚
0:49.900–0:51.100
zh得有工具
得有工具
0:51.100–0:52.100
zh得有记忆
得有记忆
0:52.100–0:53.300
zh得有个工作台
得有个工作台
0:53.300–0:55.000
zh这个harness就是给它提供
这个harness就是给它提供
0:55.000–0:57.940
zh身体操作系统和工作环境的那一整套东西
身体操作系统和工作环境的那一整套东西
0:57.940–0:59.442
zhDeepSeaKarnes最核心的设计理念叫
DeepSeaKarnes最核心的设计理念叫
0:59.442–1:00.740
enEverything is a Plugin
Everything is a Plugin
1:00.740–1:02.740
zh翻译过来就是一切皆插件
翻译过来就是一切皆插件
1:02.740–1:04.740
zh你用哪个大语言模型可以换
你用哪个大语言模型可以换
1:04.740–1:06.840
zh你需要它用什么工具可以换
你需要它用什么工具可以换
1:06.840–1:09.640
zh它的记忆系统存储方式任务调度方法
它的记忆系统存储方式任务调度方法
1:09.640–1:11.740
zh甚至是用戶界面全都可以換
甚至是用戶界面全都可以換
1:11.740–1:13.240
zh开发者就像搭积木一样
开发者就像搭积木一样
1:13.240–1:15.840
zh用配置的方式就能把这些能力重新组合起来
用配置的方式就能把这些能力重新组合起来
1:15.840–1:17.340
zh而不用动框架本身的代码
而不用动框架本身的代码
1:17.340–1:19.540
zh这就带来了几个非常突出的优点
这就带来了几个非常突出的优点
1:19.540–1:21.840
zh第一 开放性和可组合性超级强
第一 开放性和可组合性超级强
1:21.840–1:24.840
zh比如说一家公司想搞一套自己的内部智能体
比如说一家公司想搞一套自己的内部智能体
1:24.840–1:27.540
zh又不想被某一家模型公司给绑架
又不想被某一家模型公司给绑架
1:27.540–1:30.040
zh那就可以把不同公司的模型都接進這個Harness裡
那就可以把不同公司的模型都接進這個Harness裡
1:30.040–1:32.640
zh遇到复杂的推理任务就调用能力最强的那个模型
遇到复杂的推理任务就调用能力最强的那个模型
1:32.640–1:33.940
zh遇到普通的整理任务
遇到普通的整理任务
1:33.940–1:35.840
zh就用一个成本更低的模型
就用一个成本更低的模型
1:35.840–1:37.440
zh甚至处理一些敏感数据
甚至处理一些敏感数据
1:37.440–1:40.340
zh可以直接用部署在自己服务器上的本地模型
可以直接用部署在自己服务器上的本地模型
1:40.340–1:41.640
zh这就非常灵活了
这就非常灵活了
1:41.640–1:42.240
zh第二
第二
1:42.240–1:43.840
zh它的运行过程非常透明
它的运行过程非常透明
1:43.840–1:45.040
zh它会详细记录下
它会详细记录下
1:45.040–1:46.640
zh模型每一步都看到了什么
模型每一步都看到了什么
1:46.640–1:48.040
zh系统给了它什么指令
系统给了它什么指令
1:48.040–1:49.140
zh它调用了什么工具
它调用了什么工具
1:49.140–1:51.340
zh又派出了哪个小助手去干活
又派出了哪个小助手去干活
1:51.340–1:54.740
zh整個任務過程可以被恢復、搜索、分叉和重放
整個任務過程可以被恢復、搜索、分叉和重放
1:54.740–1:56.740
zh这一点对开发者来说太重要了
这一点对开发者来说太重要了
1:56.740–1:59.140
zh因为AI智能体最让人头疼的一个问题就是
因为AI智能体最让人头疼的一个问题就是
1:59.140–1:59.940
zh它要是做错了事
它要是做错了事
1:59.940–2:01.240
zh你根本不知道它为什么错
你根本不知道它为什么错
2:01.240–2:03.440
zh有了这份完整的黑匣子飞行记录
有了这份完整的黑匣子飞行记录
2:03.440–2:05.740
zh调试评估和审计就都有了依据
调试评估和审计就都有了依据
2:05.740–2:06.240
zh第三
第三
2:06.240–2:08.240
zh它不只提供一种固定的工作模式
它不只提供一种固定的工作模式
2:08.240–2:10.840
zh它有标准模式适合绝大多数任务
它有标准模式适合绝大多数任务
2:10.840–2:12.340
zh有代码模式
有代码模式
2:12.340–2:15.440
zh让模型直接写程序来组织复杂的工具调用
让模型直接写程序来组织复杂的工具调用
2:15.440–2:17.940
zh還有最小模式只保留最核心的功能
還有最小模式只保留最核心的功能
2:17.940–2:20.420
zh方便测试模型最原始的智能体能力
方便测试模型最原始的智能体能力
2:20.420–2:21.860
zh甚至还有一个Creator模式
甚至还有一个Creator模式
2:21.860–2:24.500
zh专门用来设计新的插件和智能体模板
专门用来设计新的插件和智能体模板
2:24.500–2:25.860
zh当然缺点也很明显
当然缺点也很明显
2:25.860–2:27.820
zhDeepSeek Harness更像是一个基础设施
DeepSeek Harness更像是一个基础设施
2:27.820–2:29.340
zh一个给专业人士用的工具包
一个给专业人士用的工具包
2:29.340–2:30.700
zh而不是咱们普通人下载下来
而不是咱们普通人下载下来
2:30.700–2:32.220
zh就能直接当办公助手用的
就能直接当办公助手用的
2:32.220–2:34.500
zh模型怎么选 工具怎么接 权限怎么配
模型怎么选 工具怎么接 权限怎么配
2:34.500–2:36.700
zh数据怎么存 这些都得你自己来负责
数据怎么存 这些都得你自己来负责
2:36.700–2:39.260
zh而且它目前还处在开发者预览阶段
而且它目前还处在开发者预览阶段
2:39.260–2:41.220
zh接口和插件生态都还在快速变化
接口和插件生态都还在快速变化
2:41.220–2:42.860
zh所以它最大的价值
所以它最大的价值
2:42.860–2:45.460
zh不是让你马上扔掉现在的AI助手
不是让你马上扔掉现在的AI助手
2:45.460–2:48.020
zh而是为那些有开发能力的企业或者团队
而是为那些有开发能力的企业或者团队
2:48.020–2:50.420
zh提供了一套可控可扩展的
提供了一套可控可扩展的
2:50.420–2:51.260
zhagent底盘
agent底盘
2:51.260–2:51.760
zh好
好
2:51.760–2:54.060
zh说完了需要自己动手组装的底盘
说完了需要自己动手组装的底盘
2:54.060–2:56.300
zh我们再来看一个已经组装好加满油
我们再来看一个已经组装好加满油
2:56.300–2:57.700
zh随时能开的整车
随时能开的整车
2:57.700–2:58.900
zh腾讯的workbody
腾讯的workbody
2:58.900–3:00.180
zh如果说deep-sea carless
如果说deep-sea carless
3:00.180–3:01.820
zh是给开发者准备的乐高积木
是给开发者准备的乐高积木
3:01.820–3:03.420
zh那workbody就是一辆已经组装好的
那workbody就是一辆已经组装好的
3:03.420–3:04.860
zh设计好所有细节的汽车
设计好所有细节的汽车
3:04.860–3:06.340
zh它的核心目标非常明确
它的核心目标非常明确
3:06.340–3:09.260
zh就是让普通的职场人用一句大白话
就是让普通的职场人用一句大白话
3:09.260–3:11.620
zh就能把一个相对完整的工作任务
就能把一个相对完整的工作任务
3:11.620–3:12.920
zh交给AI去完成
交给AI去完成
3:12.920–3:14.080
zhWorkBuddy强调的是
WorkBuddy强调的是
3:14.080–3:15.020
zh全场景办公
全场景办公
3:15.020–3:15.880
zh多专家协作
多专家协作
3:15.880–3:16.720
zh和开箱即用
和开箱即用
3:16.720–3:18.420
zh你可以用它来搜集资料
你可以用它来搜集资料
3:18.420–3:19.480
zh做市场调研
做市场调研
3:19.480–3:20.480
zh分析表格
分析表格
3:20.480–3:21.580
zh生成PPT
生成PPT
3:21.580–3:22.880
zh写内容整理文件
写内容整理文件
3:22.880–3:23.880
zh甚至写点代码
甚至写点代码
3:23.880–3:25.420
zh你只需要告诉它你的目标
你只需要告诉它你的目标
3:25.420–3:26.620
zh它会自己先去理解
它会自己先去理解
3:26.620–3:27.580
zh然后把任务拆解
然后把任务拆解
3:27.580–3:29.180
zh再调用不同领域的专家
再调用不同领域的专家
3:29.180–3:29.980
zh并行处理
并行处理
3:29.980–3:31.420
zh最后把结果交到你手上
最后把结果交到你手上
3:31.420–3:32.980
zh你还可以检查和修改
你还可以检查和修改
3:32.980–3:34.020
zhWorkBuddy最大的优点
WorkBuddy最大的优点
3:34.020–3:35.580
zh首先就是使用门槛极低
首先就是使用门槛极低
3:35.580–3:36.620
zh你完全不需要懂什么
你完全不需要懂什么
3:36.620–3:37.220
zhPython编程
Python编程
3:37.220–3:37.820
zhDocker容器
Docker容器
3:37.820–3:40.580
zhAPI要像量数据库这些听起来就头大的词
API要像量数据库这些听起来就头大的词
3:40.580–3:41.900
zh安装好之后直接就能用
安装好之后直接就能用
3:41.900–3:43.660
zh这对大多数人来说太重要了
这对大多数人来说太重要了
3:43.660–3:45.140
zh因为真正决定生产力的
因为真正决定生产力的
3:45.140–3:46.740
zh往往不是理论上限有多高
往往不是理论上限有多高
3:46.740–3:48.540
zh而是一个工具能不能在10分钟内
而是一个工具能不能在10分钟内
3:48.540–3:49.980
zh就开始帮你创造价值
就开始帮你创造价值
3:49.980–3:51.860
zh第二个优点是它对中文办公
第二个优点是它对中文办公
3:51.860–3:53.540
zh和国内生态的适配特别好
和国内生态的适配特别好
3:53.540–3:55.740
zh它覆盖了Windows和macOS系统
它覆盖了Windows和macOS系统
3:55.740–3:57.700
zh还打通了桌面端主流的
还打通了桌面端主流的
3:57.700–3:59.860
zh即时通讯工具和微信小程序
即时通讯工具和微信小程序
3:59.860–4:02.580
zh无论是写中文报告做PPT处理Excel
无论是写中文报告做PPT处理Excel
4:02.580–4:04.420
zh还是跟国内企业的沟通场景
还是跟国内企业的沟通场景
4:04.420–4:05.860
zhWorkbody的产品设计
Workbody的产品设计
4:05.860–4:07.860
zh都更贴近我们的日常办公习惯
都更贴近我们的日常办公习惯
4:07.860–4:08.860
zh第三个优点
第三个优点
4:08.860–4:11.460
zh是它把复杂的多智能体协作
是它把复杂的多智能体协作
4:11.460–4:13.760
zh包装成了一个用户能听懂的概念
包装成了一个用户能听懂的概念
4:13.760–4:14.960
zh叫专家团队
叫专家团队
4:14.960–4:17.060
zh你不需要自己去设计什么研究agent
你不需要自己去设计什么研究agent
4:17.060–4:18.660
zh数据agent 协作agent
数据agent 协作agent
4:18.660–4:20.360
zh你只需要描述你的最终目标
你只需要描述你的最终目标
4:20.360–4:22.060
zh系统会自动帮你组织
系统会自动帮你组织
4:22.060–4:23.860
zh不同角色的专家来协作
不同角色的专家来协作
4:23.860–4:26.660
zh这种把复杂技术藏在产品界面背后的设计
这种把复杂技术藏在产品界面背后的设计
4:26.660–4:28.260
zh大大降低了用户的理解成本
大大降低了用户的理解成本
4:28.260–4:29.560
zh当然 成品化也意味着
当然 成品化也意味着
4:29.560–4:31.660
zh你失去了一部分底层的控制权
你失去了一部分底层的控制权
4:31.660–4:33.260
zh你很难像用开源框架那样
你很难像用开源框架那样
4:33.260–4:35.820
zh完全掌握它内部的每一个运行细节
完全掌握它内部的每一个运行细节
4:35.820–4:37.100
zh它的透明度
它的透明度
4:37.100–4:39.140
zh可定制程度和模型选择的自由度
可定制程度和模型选择的自由度
4:39.140–4:40.740
zh通常是不如DeepSeek Harness
通常是不如DeepSeek Harness
4:40.740–4:42.700
zh或者我们接下来要说的Herms Agent的
或者我们接下来要说的Herms Agent的
4:42.700–4:45.060
zh而且对于一些特别复杂的代码仓库
而且对于一些特别复杂的代码仓库
4:45.060–4:46.380
zh严格的软件测试任务
严格的软件测试任务
4:46.380–4:49.460
zhWorkBuddy也未必比那些更专业的编码Agent有优势
WorkBuddy也未必比那些更专业的编码Agent有优势
4:49.460–4:52.020
zh所以WorkBuddy最适合的是谁呢
所以WorkBuddy最适合的是谁呢
4:52.020–4:54.180
zh就是那些希望马上提升办公效率
就是那些希望马上提升办公效率
4:54.180–4:56.300
zh但又不愿意投入大量时间去研究
但又不愿意投入大量时间去研究
4:56.300–4:57.660
zh部署和配置系统的人
部署和配置系统的人
4:57.660–5:01.100
zh它的竞争力不在于某一项底层技术有多么领先
它的竞争力不在于某一项底层技术有多么领先
5:01.100–5:05.220
zh而在于它把模型、工具、专家、文件和办公入口
而在于它把模型、工具、专家、文件和办公入口
5:05.220–5:07.380
zh整合成了一个可以直接上手用的产品
整合成了一个可以直接上手用的产品
5:07.380–5:09.460
zh接下来我们聊聊一个很有意思的agent
接下来我们聊聊一个很有意思的agent
5:09.460–5:10.620
zh叫做Hermes Agent
叫做Hermes Agent
5:10.620–5:13.660
zh它是由一个叫Nous Research的团队开发的
它是由一个叫Nous Research的团队开发的
5:13.660–5:16.340
zh这个agent最核心的理念跟前面两个都不太一样
这个agent最核心的理念跟前面两个都不太一样
5:16.340–5:18.860
zh它认为一个真正有价值的智能体
它认为一个真正有价值的智能体
5:18.860–5:20.700
zh不应该每次跟你对话都像第一次见面
不应该每次跟你对话都像第一次见面
5:20.700–5:23.380
zh而应该在长期的使用中慢慢形成记忆
而应该在长期的使用中慢慢形成记忆
5:23.380–5:24.620
zh掌握你的工作习惯
掌握你的工作习惯
5:24.620–5:25.900
zh并且把成功的经验
并且把成功的经验
5:25.900–5:27.780
zh沉淀成可以反复使用的技能
沉淀成可以反复使用的技能
5:27.780–5:29.900
zhHermes最大的特点就是闭环学习
Hermes最大的特点就是闭环学习
5:29.900–5:31.580
zh它有一套长期记忆系统
它有一套长期记忆系统
5:31.580–5:32.860
zh可以保存你的个人偏好
可以保存你的个人偏好
5:32.860–5:34.260
zh项目背景和过去的经验
项目背景和过去的经验
5:34.260–5:35.780
zh它还有一个技能系统
它还有一个技能系统
5:35.780–5:38.540
zh可以把一个多步骤的复杂流程
可以把一个多步骤的复杂流程
5:38.540–5:40.740
zh保存成一个可以一键调用的skill
保存成一个可以一键调用的skill
5:40.740–5:41.620
zh也就是技能
也就是技能
5:41.620–5:42.900
zh以后再遇到类似的任务
以后再遇到类似的任务
5:42.900–5:44.180
zh它就不必重新摸索了
它就不必重新摸索了
5:44.180–5:45.340
zh而是可以直接调用
而是可以直接调用
5:45.340–5:46.620
zh已经形成的工作方法
已经形成的工作方法
5:46.620–5:47.140
zh打个比方
打个比方
5:47.140–5:48.660
zh这就有点像一个实习生
这就有点像一个实习生
5:48.660–5:49.940
zh刚来的时候什么都不会
刚来的时候什么都不会
5:49.940–5:51.020
zh但你在带他的过程中
但你在带他的过程中
5:51.020–5:51.740
zh他会犯错
他会犯错
5:51.740–5:52.580
zh你会纠正他
你会纠正他
5:52.580–5:54.300
zh慢慢的他学会了怎么做报告
慢慢的他学会了怎么做报告
5:54.300–5:55.140
zh怎么分析数据
怎么分析数据
5:55.140–5:56.780
zh下次再让他做类似的工作
下次再让他做类似的工作
5:56.780–5:57.700
zh他就能直接上手
他就能直接上手
5:57.700–5:58.740
zh甚至做的又快又好
甚至做的又快又好
5:58.740–5:59.500
zhHermes就是这样
Hermes就是这样
5:59.500–6:01.380
zh如果他在执行任务时走了弯路
如果他在执行任务时走了弯路
6:01.380–6:02.620
zh最后找到了正确的方法
最后找到了正确的方法
6:02.620–6:03.900
zh或者你纠正了他的做法
或者你纠正了他的做法
6:03.900–6:04.820
zh他可以把这些经验
他可以把这些经验
6:04.820–6:05.860
zh写进他的技能库里
写进他的技能库里
6:05.860–6:07.340
zh所以Hermes的价值
所以Hermes的价值
6:07.340–6:08.980
zh是会随着你使用它的时间
是会随着你使用它的时间
6:08.980–6:09.820
zh增长而增长的
增长而增长的
6:09.820–6:11.660
zh他不是简单的记住聊天内容
他不是简单的记住聊天内容
6:11.660–6:13.460
zh而是在尝试把过去的经验
而是在尝试把过去的经验
6:13.460–6:14.660
zh转化为程序化的工作流程
转化为程序化的工作流程
6:14.660–6:16.220
zh可复用的工作流程
可复用的工作流程
6:16.220–6:17.420
zhHermes的第二个优点
Hermes的第二个优点
6:17.420–6:18.900
zh是模型自由度很高
是模型自由度很高
6:18.900–6:20.700
zh它可以连接OpenAI
它可以连接OpenAI
6:20.700–6:21.500
enClaude
Claude
6:21.500–6:22.500
enGemini
Gemini
6:22.500–6:23.500
enDeepSeek
DeepSeek
6:23.500–6:25.340
zhQianwen等各种云端模型
Qianwen等各种云端模型
6:25.340–6:26.700
zh甚至你本地的模型也行
甚至你本地的模型也行
6:26.700–6:29.020
zh你的长期记忆、技能和工具
你的长期记忆、技能和工具
6:29.020–6:31.180
zh是属于Hermes这个员工本身的
是属于Hermes这个员工本身的
6:31.180–6:33.460
zh而不是绑定在某一个特定的大模型上
而不是绑定在某一个特定的大模型上
6:33.460–6:34.140
zh也就是说
也就是说
6:34.140–6:36.420
zh你可以随时给这个员工换个大脑
你可以随时给这个员工换个大脑
6:36.420–6:38.180
zh但他已经学会的工作方法还在
但他已经学会的工作方法还在
6:38.180–6:39.860
zh第三个优点是它适合
第三个优点是它适合
6:39.860–6:41.060
zh长期在线运行
长期在线运行
6:41.060–6:42.620
zh你可以把它部署在自己的
你可以把它部署在自己的
6:42.620–6:44.620
zh电脑上或者云端的服务器里
电脑上或者云端的服务器里
6:44.620–6:45.860
enTelegram
Telegram
6:45.860–6:46.360
enDiscord
Discord
6:46.360–6:46.860
enSlack
Slack
6:46.860–6:47.393
enWhatsApp
WhatsApp
6:47.393–6:48.760
zh非输 企业微信
非输 企业微信
6:48.760–6:50.100
zh这些渠道跟他交互
这些渠道跟他交互
6:50.100–6:52.340
zh这意味着就算你人不在电脑前
这意味着就算你人不在电脑前
6:52.340–6:53.900
zh也可以通过手机给他发个任务
也可以通过手机给他发个任务
6:53.900–6:55.440
zh让云端的agent继续帮你工作
让云端的agent继续帮你工作
6:55.440–6:57.760
zh他还内置了定时任务和子agent的能力
他还内置了定时任务和子agent的能力
6:57.760–6:59.500
zh特别适合用来做周期性的报告
特别适合用来做周期性的报告
6:59.500–7:01.640
zh资料搜集 这类长期自动化任务
资料搜集 这类长期自动化任务
7:01.640–7:03.640
zh不过 关于Hermes的自进化
不过 关于Hermes的自进化
7:03.640–7:05.200
zh这里有一个非常重要的澄清
这里有一个非常重要的澄清
7:05.200–7:07.540
zh他通常不是自己重新训练的一个大语言模型
他通常不是自己重新训练的一个大语言模型
7:07.540–7:08.940
zh也不是说用了一段时间之后
也不是说用了一段时间之后
7:08.940–7:11.440
zh模型本身的神经网络权重就自动改变了
模型本身的神经网络权重就自动改变了
7:11.440–7:12.900
zh他所谓的成长主要发生在
他所谓的成长主要发生在
7:12.900–7:15.500
zh在技能和系统提示这些层面上
在技能和系统提示这些层面上
7:15.500–7:17.060
zh它有一个叫Self Evolution
它有一个叫Self Evolution
7:17.060–7:18.700
zh也就是自我进化的项目
也就是自我进化的项目
7:18.700–7:20.980
zh会利用执行轨迹和评估数据
会利用执行轨迹和评估数据
7:20.980–7:22.860
zh来生成和优化技能和提示词
来生成和优化技能和提示词
7:22.860–7:24.660
zh但并不是在修改模型本身
但并不是在修改模型本身
7:24.660–7:26.900
zh这更接近于是工作流程
这更接近于是工作流程
7:26.900–7:28.540
zh和提示系统的迭代
和提示系统的迭代
7:28.540–7:30.420
zh而不是模型的重新训练
而不是模型的重新训练
7:30.420–7:31.260
zh这种机制
这种机制
7:31.260–7:32.300
zh既是它的优势
既是它的优势
7:32.300–7:33.260
zh也带来了风险
也带来了风险
7:33.260–7:33.820
zh你想想
你想想
7:33.820–7:35.860
zh如果一个agent总结了错误的经验
如果一个agent总结了错误的经验
7:35.860–7:36.780
zh他也可能把这个错误
他也可能把这个错误
7:36.780–7:37.620
zh写进他的记忆里
写进他的记忆里
7:37.620–7:39.140
zh如果某一次偶然的特殊情况
如果某一次偶然的特殊情况
7:39.140–7:40.460
zh被他误认为是普遍规律
被他误认为是普遍规律
7:40.460–7:42.780
zh那这个错误的流程就可能在以后被反复调用
那这个错误的流程就可能在以后被反复调用
7:42.780–7:46.500
zh所以Hermes提供了记忆写入和技能写入的审批机制
所以Hermes提供了记忆写入和技能写入的审批机制
7:46.500–7:49.580
zh比较稳妥的做法是让agent先提出修改建议
比较稳妥的做法是让agent先提出修改建议
7:49.580–7:51.620
zh然后由人来查看差异并批准
然后由人来查看差异并批准
7:51.620–7:54.220
zh而不是让他完全不受控制的修改自己
而不是让他完全不受控制的修改自己
7:54.220–7:55.860
zh这也给我们一个很重要的启发
这也给我们一个很重要的启发
7:55.860–7:58.740
zh一个AI的自我改进不能只看他有没有学习能力
一个AI的自我改进不能只看他有没有学习能力
7:58.740–8:00.300
zh还得看他有没有平衡能力
还得看他有没有平衡能力
8:00.300–8:01.100
zh回滾
回滾
8:01.100–8:02.400
zh審批和安全邊界
審批和安全邊界
8:02.400–8:03.900
zh没有验证机制的自我学习
没有验证机制的自我学习
8:03.900–8:05.100
zh可能只是让他在
可能只是让他在
8:05.100–8:06.600
zh更有信心的重复错误
更有信心的重复错误
8:06.600–8:09.100
zh最后我们来看看OpenAI的Codex
最后我们来看看OpenAI的Codex
8:09.100–8:10.300
zh很多人对Codex的印象
很多人对Codex的印象
8:10.300–8:12.400
zh可能还停留在他是一个编码助手
可能还停留在他是一个编码助手
8:12.400–8:14.640
zh但现在它已经发展成一个由桌面端
但现在它已经发展成一个由桌面端
8:14.640–8:17.800
zh命令行 IDE插件和云端环境组成的完整体系了
命令行 IDE插件和云端环境组成的完整体系了
8:17.800–8:20.280
zh严格来说 OpenAI 把那些通用的研究
严格来说 OpenAI 把那些通用的研究
8:20.280–8:23.080
zh报告 表格 PPT 和文件交付等功能
报告 表格 PPT 和文件交付等功能
8:23.080–8:24.920
zh更多的放在了 ChatGPT Work 里
更多的放在了 ChatGPT Work 里
8:24.920–8:28.520
zh而 Codex 仍然以代碼、項目、工具和工程執行為核心
而 Codex 仍然以代碼、項目、工具和工程執行為核心
8:28.520–8:31.000
zh当然 这两者的能力正在越来越多地共享
当然 这两者的能力正在越来越多地共享
8:31.000–8:34.160
zhCodeX 最大的优点是它特别强调做完并验证
CodeX 最大的优点是它特别强调做完并验证
8:34.160–8:36.160
zh而不仅仅是给你一些建议
而不仅仅是给你一些建议
8:36.160–8:38.200
zh它可以读取你整个项目的文件
它可以读取你整个项目的文件
8:38.200–8:39.840
zh搜索代码 修改多个文件
搜索代码 修改多个文件
8:39.840–8:42.440
zh运行命令 执行测试 查看报错信息
运行命令 执行测试 查看报错信息
8:42.440–8:44.240
zh然后根据测试结果继续修复问题
然后根据测试结果继续修复问题
8:44.240–8:46.640
zh最後交付給你的不只是一段示例代碼
最後交付給你的不只是一段示例代碼
8:46.640–8:48.640
zh而是一个完整的修改摘要
而是一个完整的修改摘要
8:48.640–8:51.040
zh文件差異對比、測試結果
文件差異對比、測試結果
8:51.040–8:53.140
zh以及可以审查的最终成果
以及可以审查的最终成果
8:53.140–8:56.340
zh第二个优点是它的工程环境比较完整
第二个优点是它的工程环境比较完整
8:56.340–8:57.740
zh你在本地的 Codex
你在本地的 Codex
8:57.740–9:00.640
zh可以直接使用你电脑上已经装好的编译器
可以直接使用你电脑上已经装好的编译器
9:00.640–9:02.140
zh测试工具和项目依赖
测试工具和项目依赖
9:02.140–9:03.140
zh而雲端的 Codex
而雲端的 Codex
9:03.140–9:05.140
zh可以为不同的任务建立隔离的环境
可以为不同的任务建立隔离的环境
9:05.140–9:07.540
zh让多个任务在后台并行运行
让多个任务在后台并行运行
9:07.540–9:08.140
zh任务完成后
任务完成后
9:08.140–9:09.860
zh你可以清楚地看到他都改了些什么
你可以清楚地看到他都改了些什么
9:09.860–9:11.220
zh可以要求他继续调整
可以要求他继续调整
9:11.220–9:14.460
zh或者直接把修改提交到你的代码仓库
或者直接把修改提交到你的代码仓库
9:14.460–9:15.380
zh第三个优点是
第三个优点是
9:15.380–9:17.780
zh它的权限和安全边界做的比较成熟
它的权限和安全边界做的比较成熟
9:17.780–9:20.900
zhCodex通过沙箱来限制它对文件和网络的访问
Codex通过沙箱来限制它对文件和网络的访问
9:20.900–9:22.260
zh在执行一些高风险命令时
在执行一些高风险命令时
9:22.260–9:23.940
zh或者跨越权限边界的时候
或者跨越权限边界的时候
9:23.940–9:25.140
zh会向你请求批准
会向你请求批准
9:25.140–9:27.340
zh这种设计可能会让操作显得有点谨慎
这种设计可能会让操作显得有点谨慎
9:27.340–9:29.620
zh但对于一个能够真实修改文件
但对于一个能够真实修改文件
9:29.620–9:32.380
zh运行程序和连接外部工具的智能体来说
运行程序和连接外部工具的智能体来说
9:32.380–9:35.020
zh这种谨慎本身就是可靠性的重要组成部分
这种谨慎本身就是可靠性的重要组成部分
9:35.020–9:38.620
zh第四个优点是它把编码研究和文件交付连接了起来
第四个优点是它把编码研究和文件交付连接了起来
9:38.620–9:40.620
zh在ChatGPT Work这个更大的环境里
在ChatGPT Work这个更大的环境里
9:40.620–9:43.220
zh同一套能力还可以用来生成和检查文档
同一套能力还可以用来生成和检查文档
9:43.220–9:47.020
zh表格、PPT、PDF、网站和数据分析结果
表格、PPT、PDF、网站和数据分析结果
9:47.020–9:50.620
zh这意味着一个复杂的任务可以从资料搜集开始
这意味着一个复杂的任务可以从资料搜集开始
9:50.620–9:52.020
zh经过分析和程序处理
经过分析和程序处理
9:52.020–9:54.120
zh最后形成可以直接使用的文件
最后形成可以直接使用的文件
9:54.120–9:56.020
zh整个流程都可以在一个环境里完成
整个流程都可以在一个环境里完成
9:56.020–9:57.920
zh当然Codex的局限也很清楚
当然Codex的局限也很清楚
9:57.920–10:01.720
zh它主要围绕OpenAI自家的模型和ChatGPT服务来运行
它主要围绕OpenAI自家的模型和ChatGPT服务来运行
10:01.720–10:04.920
zh模型的自由度不如Hermes或者DeepSeek Harness
模型的自由度不如Hermes或者DeepSeek Harness
10:04.920–10:07.480
zh它虽然也支持技能记忆和项目规则
它虽然也支持技能记忆和项目规则
10:07.480–10:10.320
zh但不会把自动修改自己作为最核心的卖点
但不会把自动修改自己作为最核心的卖点
10:10.320–10:11.680
zh它的取向更加保守
它的取向更加保守
10:11.680–10:14.200
zh宁可让流程可审查可验证
宁可让流程可审查可验证
10:14.200–10:16.520
zh也不轻易让agent自行改变长期规则
也不轻易让agent自行改变长期规则
10:16.520–10:17.020
zh好了
好了
10:17.020–10:18.840
zh现在我们把这四个智能体放在一起
现在我们把这四个智能体放在一起
10:18.840–10:20.600
zh就能得到一个非常清晰的结论了
就能得到一个非常清晰的结论了
10:20.600–10:23.040
zh如果你的目标是开发一个自己的agent的产品
如果你的目标是开发一个自己的agent的产品
10:23.040–10:25.480
zh那DeepSeek Harness最有吸引力
那DeepSeek Harness最有吸引力
10:25.480–10:27.440
zh因为它开放模块化
因为它开放模块化
10:27.440–10:28.800
zh运行过程可追溯
运行过程可追溯
10:28.800–10:31.520
zh如果你的目标是普通办公人员想马上提高效率
如果你的目标是普通办公人员想马上提高效率
10:31.520–10:32.600
zh那Workbody最方便
那Workbody最方便
10:32.600–10:34.920
zh因为它把复杂的技术包装成了用户友好的界面
因为它把复杂的技术包装成了用户友好的界面
10:34.920–10:37.800
zh如果你的目标是培养一个能长期在线
如果你的目标是培养一个能长期在线
10:37.800–10:40.000
zh逐渐熟悉你个人工作方式的智能体
逐渐熟悉你个人工作方式的智能体
10:40.000–10:41.640
zh那Hermes最有特色
那Hermes最有特色
10:41.640–10:43.480
zh如果你的目标是完成复杂的代码
如果你的目标是完成复杂的代码
10:43.480–10:45.960
zh工具执行和需要严格验证的专业任务
工具执行和需要严格验证的专业任务
10:45.960–10:47.920
zh那Codex的综合完成度更高
那Codex的综合完成度更高
10:47.920–10:51.560
zh你看他们代表的其实是4条完全不同的路线
你看他们代表的其实是4条完全不同的路线
10:51.560–10:53.960
zhDeepSeek Harness追求的是架构上的自由
DeepSeek Harness追求的是架构上的自由
10:53.960–10:55.880
zhWorkBuddy追求的是使用的便利
WorkBuddy追求的是使用的便利
10:55.880–10:57.960
zhHermes追求的是长期的成长
Hermes追求的是长期的成长
10:57.960–11:00.200
zh而Codex追求的是可靠的交付
而Codex追求的是可靠的交付
11:00.200–11:00.840
zh聊到这里
聊到这里
11:00.840–11:03.080
zh还有三点特别值得我们进一步思考
还有三点特别值得我们进一步思考
11:03.080–11:06.720
zh第一 未来agent的竞争绝对不会只发生在模型层面
第一 未来agent的竞争绝对不会只发生在模型层面
11:06.720–11:08.080
zh模型当然很重要
模型当然很重要
11:08.080–11:09.480
zh它决定了智力的上限
它决定了智力的上限
11:09.480–11:12.920
zh但真正决定这个智能体能不能稳定落地完成实际工作的
但真正决定这个智能体能不能稳定落地完成实际工作的
11:12.920–11:16.120
zh是模型之外的那個架構也就是它的運行底座
是模型之外的那個架構也就是它的運行底座
11:16.120–11:17.080
zh它能用什么工具
它能用什么工具
11:17.080–11:18.480
zh能访问哪些文件
能访问哪些文件
11:18.480–11:19.160
zh怎么记忆
怎么记忆
11:19.160–11:20.280
zh怎么调度任务
怎么调度任务
11:20.280–11:21.400
zh出错了能不能恢复
出错了能不能恢复
11:21.400–11:25.080
zh以及我们作为使用者能不能看清它到底都做了什么
以及我们作为使用者能不能看清它到底都做了什么
11:25.080–11:26.360
zh这些才是关键
这些才是关键
11:26.360–11:28.480
zh第二 我们刚才聊到的所谓自进化
第二 我们刚才聊到的所谓自进化
11:28.480–11:30.600
zh绝对不能脱离一个有效的评估系统
绝对不能脱离一个有效的评估系统
11:30.600–11:34.120
zh一个agent能够修改自己的技能并不等于他一定会变得更好
一个agent能够修改自己的技能并不等于他一定会变得更好
11:34.120–11:37.360
zh真正有效的自我改进至少需要完整的执行记录
真正有效的自我改进至少需要完整的执行记录
11:37.360–11:40.640
zh客觀的測試數據 效果比較以及必要的人類審批
客觀的測試數據 效果比較以及必要的人類審批
11:40.640–11:42.240
zh以及出错了能回滚的方案
以及出错了能回滚的方案
11:42.240–11:46.520
zh否則他可能只是在更有信心的把你最初交給他的那個錯誤
否則他可能只是在更有信心的把你最初交給他的那個錯誤
11:46.520–11:48.240
zh一遍又一遍的固化下来
一遍又一遍的固化下来
11:48.240–11:50.960
zh第三 最好的agent不一定是最自主的agent
第三 最好的agent不一定是最自主的agent
11:50.960–11:53.360
zh对于很多低风险的重复性的任务
对于很多低风险的重复性的任务
11:53.360–11:55.800
zh高程度的自动化确实能节省大量时间
高程度的自动化确实能节省大量时间
11:55.800–12:00.160
zh但是当涉及到付款 删除文件 发布公开内容
但是当涉及到付款 删除文件 发布公开内容
12:00.160–12:03.440
zh修改正式代码或者处理敏感数据这些关键操作时
修改正式代码或者处理敏感数据这些关键操作时
12:03.440–12:05.760
zh一个能够暂停下来向你解释情况
一个能够暂停下来向你解释情况
12:05.760–12:06.960
zh并等待你确认的agent
并等待你确认的agent
12:06.960–12:09.760
zh它的价值其实远远高于一个完全自主
它的价值其实远远高于一个完全自主
12:09.760–12:11.160
zh从不请示的agent
从不请示的agent
12:11.160–12:14.240
zh一個成熟的智能體系統不是要取消人的判斷
一個成熟的智能體系統不是要取消人的判斷
12:14.240–12:15.760
zh而是要把人的判断
而是要把人的判断
12:15.760–12:18.160
zh集中到那些最关键的节点上
集中到那些最关键的节点上
12:18.160–12:19.920
zh最后我们来总结一下今天的内容
最后我们来总结一下今天的内容
12:19.920–12:20.960
enDeepSake Harness
DeepSake Harness
12:20.960–12:24.360
zh最适合作为构建自由agent系统的开放底座
最适合作为构建自由agent系统的开放底座
12:24.360–12:25.560
zh腾讯的WorkBuddy
腾讯的WorkBuddy
12:25.560–12:26.320
zh最省事
最省事
12:26.320–12:28.920
zh适合想直接进入日常办公场景的用户
适合想直接进入日常办公场景的用户
12:28.920–12:32.560
zhHermes Agent最像一个会积累记忆和技能的长期AI员工
Hermes Agent最像一个会积累记忆和技能的长期AI员工
12:32.560–12:35.800
zh而OpenAI的Codex则最擅长把复杂的专业工作
而OpenAI的Codex则最擅长把复杂的专业工作
12:35.800–12:38.080
zh真正做完并进行严格的验证
真正做完并进行严格的验证
12:38.080–12:41.480
zh所以下次你在选择的时候不要只问谁最强
所以下次你在选择的时候不要只问谁最强
12:41.480–12:43.440
zh而要问自己三个更具体的问题
而要问自己三个更具体的问题
12:43.440–12:45.320
zh第一 我需要的是一个成品工具
第一 我需要的是一个成品工具
12:45.320–12:46.880
zh还是一个可以自己开发的框架
还是一个可以自己开发的框架
12:46.880–12:49.840
zh第二 我更看重的是即时的效率提升
第二 我更看重的是即时的效率提升
12:49.840–12:51.520
zh还是长期的成长和陪伴
还是长期的成长和陪伴
12:51.520–12:55.160
zh第三 我是否需要掌握对模型
第三 我是否需要掌握对模型
12:55.160–12:58.360
zh数据 权限和运行环境的控制权
数据 权限和运行环境的控制权
12:58.360–12:59.960
zh当你把这三个问题想清楚之后
当你把这三个问题想清楚之后
12:59.960–13:01.960
zh這四者之間的選擇就一点都不模糊了
這四者之間的選擇就一点都不模糊了
13:01.960–13:03.160
zh他们不是简单的
他们不是简单的
13:03.160–13:04.640
zh谁替代谁的关系
谁替代谁的关系
13:04.640–13:06.720
zh而是分别服务于不同层级
而是分别服务于不同层级
13:06.720–13:07.600
zh不同需求的
不同需求的
13:07.600–13:09.120
zh未来更常见的情况
未来更常见的情况
13:09.120–13:10.760
zh可能也不是某一个超级agent
可能也不是某一个超级agent
13:10.760–13:11.720
zh包揽所有工作
包揽所有工作
13:11.720–13:13.800
zh而是像今天聊到的成品办公agent
而是像今天聊到的成品办公agent
13:13.800–13:14.760
zh专业工程agent
专业工程agent
13:14.760–13:16.760
zh长期个人agent和企业开源底座
长期个人agent和企业开源底座
13:16.760–13:17.720
zh他们相互配合
他们相互配合
13:17.720–13:19.720
zh共同组成一个真正好用的
共同组成一个真正好用的
13:19.720–13:20.720
zhAI工作系统
AI工作系统
尚未產生學習筆記
請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習