WEBVTT

00:00:00.000 --> 00:00:02.960
2026年AI智能體也就是我們常說的AI agent

00:00:02.960 --> 00:00:03.840
一下子就火了

00:00:03.840 --> 00:00:05.760
你隨便一搜就能看到各種各樣的產品

00:00:05.760 --> 00:00:06.960
比如DeepSea Karnes

00:00:07.320 --> 00:00:08.320
騰訊的WorkBody

00:00:08.320 --> 00:00:10.000
一個叫Hermes Agent的

00:00:10.000 --> 00:00:11.520
還有OpenAI的Codex

00:00:11.520 --> 00:00:12.640
乍一看他們好像

00:00:13.200 --> 00:00:14.920
都差不多都是能自己幹活的AI嘛

00:00:14.920 --> 00:00:16.960
那我們是不是只要比比誰更聰明就行了

00:00:16.960 --> 00:00:20.280
他們四個其實代表了四種完全不同的發展路線

00:00:20.280 --> 00:00:22.040
今天咱們最重要的任務

00:00:22.040 --> 00:00:23.800
就不是給他們排個一二三四

00:00:23.800 --> 00:00:25.560
而是要把這四家的底細都摸清楚

00:00:25.560 --> 00:00:27.760
他們各自到底在解決什麼問題

00:00:27.760 --> 00:00:28.720
最厲害的地方在哪

00:00:28.720 --> 00:00:30.380
又分别适合什么样的人去用

00:00:30.380 --> 00:00:31.460
咱们一个一个来看

00:00:31.460 --> 00:00:33.220
先说deepseek harness

00:00:33.220 --> 00:00:35.560
这个名字里的harness翻译过来有点像

00:00:35.560 --> 00:00:38.320
智能体的运行底座或者框架

00:00:38.320 --> 00:00:39.120
你可以这么理解

00:00:39.120 --> 00:00:40.320
一个大模型

00:00:40.320 --> 00:00:41.760
就像一个聪明的大脑

00:00:41.760 --> 00:00:42.800
它会思考

00:00:42.800 --> 00:00:43.700
会说话

00:00:43.700 --> 00:00:45.400
但是它光有大脑

00:00:45.400 --> 00:00:46.900
是没法帮你完成一个

00:00:46.900 --> 00:00:48.400
现实世界里的具体任务的

00:00:48.400 --> 00:00:49.900
它得有手有脚

00:00:49.900 --> 00:00:51.100
得有工具

00:00:51.100 --> 00:00:52.100
得有记忆

00:00:52.100 --> 00:00:53.300
得有个工作台

00:00:53.300 --> 00:00:55.000
这个harness就是给它提供

00:00:55.000 --> 00:00:57.940
身体操作系统和工作环境的那一整套东西

00:00:57.940 --> 00:01:00.740
DeepSeaKarnes最核心的设计理念叫Everything is a Plugin

00:01:00.740 --> 00:01:02.740
翻译过来就是一切皆插件

00:01:02.740 --> 00:01:04.740
你用哪个大语言模型可以换

00:01:04.740 --> 00:01:06.840
你需要它用什么工具可以换

00:01:06.840 --> 00:01:09.640
它的记忆系统存储方式任务调度方法

00:01:09.640 --> 00:01:11.740
甚至是用户界面全都可以换

00:01:11.740 --> 00:01:13.240
开发者就像搭积木一样

00:01:13.240 --> 00:01:15.840
用配置的方式就能把这些能力重新组合起来

00:01:15.840 --> 00:01:17.340
而不用动框架本身的代码

00:01:17.340 --> 00:01:19.540
这就带来了几个非常突出的优点

00:01:19.540 --> 00:01:21.840
第一 开放性和可组合性超级强

00:01:21.840 --> 00:01:24.840
比如说一家公司想搞一套自己的内部智能体

00:01:24.840 --> 00:01:27.540
又不想被某一家模型公司给绑架

00:01:27.540 --> 00:01:30.040
那就可以把不同公司的模型都接进这个Harness里

00:01:30.040 --> 00:01:32.640
遇到复杂的推理任务就调用能力最强的那个模型

00:01:32.640 --> 00:01:33.940
遇到普通的整理任务

00:01:33.940 --> 00:01:35.840
就用一个成本更低的模型

00:01:35.840 --> 00:01:37.440
甚至处理一些敏感数据

00:01:37.440 --> 00:01:40.340
可以直接用部署在自己服务器上的本地模型

00:01:40.340 --> 00:01:41.640
这就非常灵活了

00:01:41.640 --> 00:01:42.240
第二

00:01:42.240 --> 00:01:43.840
它的运行过程非常透明

00:01:43.840 --> 00:01:45.040
它会详细记录下

00:01:45.040 --> 00:01:46.640
模型每一步都看到了什么

00:01:46.640 --> 00:01:48.040
系统给了它什么指令

00:01:48.040 --> 00:01:49.140
它调用了什么工具

00:01:49.140 --> 00:01:51.340
又派出了哪个小助手去干活

00:01:51.340 --> 00:01:54.740
整个任务过程可以被恢复搜索分叉和重放

00:01:54.740 --> 00:01:56.740
这一点对开发者来说太重要了

00:01:56.740 --> 00:01:59.140
因为AI智能体最让人头疼的一个问题就是

00:01:59.140 --> 00:01:59.940
它要是做错了事

00:01:59.940 --> 00:02:01.240
你根本不知道它为什么错

00:02:01.240 --> 00:02:03.440
有了这份完整的黑匣子飞行记录

00:02:03.440 --> 00:02:05.740
调试评估和审计就都有了依据

00:02:05.740 --> 00:02:06.240
第三

00:02:06.240 --> 00:02:08.240
它不只提供一种固定的工作模式

00:02:08.240 --> 00:02:10.840
它有标准模式适合绝大多数任务

00:02:10.840 --> 00:02:12.340
有代码模式

00:02:12.340 --> 00:02:15.440
让模型直接写程序来组织复杂的工具调用

00:02:15.440 --> 00:02:17.940
还有最小模式只保留最核心的功能

00:02:17.940 --> 00:02:20.420
方便测试模型最原始的智能体能力

00:02:20.420 --> 00:02:21.860
甚至还有一个Creator模式

00:02:21.860 --> 00:02:24.500
专门用来设计新的插件和智能体模板

00:02:24.500 --> 00:02:25.860
当然缺点也很明显

00:02:25.860 --> 00:02:27.820
DeepSeek Harness更像是一个基础设施

00:02:27.820 --> 00:02:29.340
一个给专业人士用的工具包

00:02:29.340 --> 00:02:30.700
而不是咱们普通人下载下来

00:02:30.700 --> 00:02:32.220
就能直接当办公助手用的

00:02:32.220 --> 00:02:34.500
模型怎么选 工具怎么接 权限怎么配

00:02:34.500 --> 00:02:36.700
数据怎么存 这些都得你自己来负责

00:02:36.700 --> 00:02:39.260
而且它目前还处在开发者预览阶段

00:02:39.260 --> 00:02:41.220
接口和插件生态都还在快速变化

00:02:41.220 --> 00:02:42.860
所以它最大的价值

00:02:42.860 --> 00:02:45.460
不是让你马上扔掉现在的AI助手

00:02:45.460 --> 00:02:48.020
而是为那些有开发能力的企业或者团队

00:02:48.020 --> 00:02:50.140
提供了一套可控可扩展的

00:02:50.420 --> 00:02:51.260
agent底盘

00:02:51.260 --> 00:02:51.740
好

00:02:51.740 --> 00:02:54.060
说完了需要自己动手组装的底盘

00:02:54.060 --> 00:02:56.300
我们再来看一个已经组装好加满油

00:02:56.300 --> 00:02:57.700
随时能开的整车

00:02:57.700 --> 00:02:58.900
腾讯的workbody

00:02:58.900 --> 00:03:00.180
如果说deep-sea carless

00:03:00.180 --> 00:03:01.820
是给开发者准备的乐高积木

00:03:01.820 --> 00:03:03.420
那workbody就是一辆已经组装好的

00:03:03.420 --> 00:03:04.860
设计好所有细节的汽车

00:03:04.860 --> 00:03:06.340
它的核心目标非常明确

00:03:06.340 --> 00:03:09.260
就是让普通的职场人用一句大白话

00:03:09.260 --> 00:03:11.620
就能把一个相对完整的工作任务

00:03:11.620 --> 00:03:12.920
交给AI去完成

00:03:12.920 --> 00:03:14.080
WorkBuddy强调的是

00:03:14.080 --> 00:03:15.020
全场景办公

00:03:15.020 --> 00:03:15.880
多专家协作

00:03:15.880 --> 00:03:16.720
和开箱即用

00:03:16.720 --> 00:03:18.420
你可以用它来搜集资料

00:03:18.420 --> 00:03:19.480
做市场调研

00:03:19.480 --> 00:03:20.480
分析表格

00:03:20.480 --> 00:03:21.580
生成PPT

00:03:21.580 --> 00:03:22.880
写内容整理文件

00:03:22.880 --> 00:03:23.880
甚至写点代码

00:03:23.880 --> 00:03:25.420
你只需要告诉它你的目标

00:03:25.420 --> 00:03:26.620
它会自己先去理解

00:03:26.620 --> 00:03:27.580
然后把任务拆解

00:03:27.580 --> 00:03:29.180
再调用不同领域的专家

00:03:29.180 --> 00:03:29.980
并行处理

00:03:29.980 --> 00:03:31.420
最后把结果交到你手上

00:03:31.420 --> 00:03:32.980
你还可以检查和修改

00:03:32.980 --> 00:03:34.020
WorkBuddy最大的优点

00:03:34.020 --> 00:03:35.580
首先就是使用门槛极低

00:03:35.580 --> 00:03:36.620
你完全不需要懂什么

00:03:36.620 --> 00:03:37.220
Python编程

00:03:37.220 --> 00:03:37.820
Docker容器

00:03:37.820 --> 00:03:40.580
APM要像量数据库这些听起来就头大的词

00:03:40.580 --> 00:03:41.900
翻装好之后直接就能用

00:03:41.900 --> 00:03:43.660
这对大多数人来说太重要了

00:03:43.660 --> 00:03:45.140
因为真正决定生产力的

00:03:45.140 --> 00:03:46.740
往往不是理论上限有多高

00:03:46.740 --> 00:03:48.540
而是一个工具能不能在10分钟内

00:03:48.540 --> 00:03:49.980
就开始帮你创造价值

00:03:49.980 --> 00:03:51.860
第二个优点是它对中文办公

00:03:51.860 --> 00:03:53.540
和国内生态的适配特别好

00:03:53.540 --> 00:03:55.740
它覆盖了Windows和macOS系统

00:03:55.740 --> 00:03:57.700
还打通了桌面端主流的

00:03:57.700 --> 00:03:59.860
即时通讯工具和微信小程序

00:03:59.860 --> 00:04:02.580
无论是写中文报告做PPT处理Excel

00:04:02.580 --> 00:04:04.420
还是跟国内企业的沟通场景

00:04:04.420 --> 00:04:05.860
Workbody的产品设计

00:04:05.860 --> 00:04:07.860
都更贴近我们的日常办公习惯

00:04:07.860 --> 00:04:08.860
第三个优点

00:04:08.860 --> 00:04:11.460
是它把复杂的多智能体协作

00:04:11.460 --> 00:04:13.760
包装成了一个用户能听懂的概念

00:04:13.760 --> 00:04:14.960
叫专家团队

00:04:14.960 --> 00:04:17.060
你不需要自己去设计什么研究agent

00:04:17.060 --> 00:04:18.660
数据agent 协作agent

00:04:18.660 --> 00:04:20.360
你只需要描述你的最终目标

00:04:20.360 --> 00:04:22.060
系统会自动帮你组织

00:04:22.060 --> 00:04:23.860
不同角色的专家来协作

00:04:23.860 --> 00:04:26.660
这种把复杂技术藏在产品界面背后的设计

00:04:26.660 --> 00:04:28.260
大大降低了用户的理解成本

00:04:28.260 --> 00:04:29.560
当然 成品化也意味着

00:04:29.560 --> 00:04:31.660
你失去了一部分底层的控制权

00:04:31.660 --> 00:04:33.260
你很难像用开源框架那样

00:04:33.260 --> 00:04:35.820
完全掌握它内部的每一个运行细节

00:04:35.820 --> 00:04:37.100
它的透明度

00:04:37.100 --> 00:04:39.140
可定制程度和模型选择的自由度

00:04:39.140 --> 00:04:40.740
通常是不如DeepSeek Harness

00:04:40.740 --> 00:04:42.700
或者我们接下来要说的Herms Agent的

00:04:42.700 --> 00:04:45.060
而且对于一些特别复杂的代码仓库

00:04:45.060 --> 00:04:46.380
严格的软件测试任务

00:04:46.380 --> 00:04:49.460
WorkBuddy也未必比那些更专业的编码Agent有优势

00:04:49.460 --> 00:04:52.020
所以WorkBuddy最适合的是谁呢

00:04:52.020 --> 00:04:54.180
就是那些希望马上提升办公效率

00:04:54.180 --> 00:04:56.300
但又不愿意投入大量时间去研究

00:04:56.300 --> 00:04:57.660
部署和配置系统的人

00:04:57.660 --> 00:05:01.100
它的竞争力不在于某一项底层技术有多么领先

00:05:01.100 --> 00:05:05.220
而在于它把模型、工具、专家、文件和办公入口

00:05:05.220 --> 00:05:07.380
整合成了一个可以直接上手用的产品

00:05:07.380 --> 00:05:09.460
接下来我们聊聊一个很有意思的agent

00:05:09.460 --> 00:05:10.620
叫做Hermes Agent

00:05:10.620 --> 00:05:13.660
它是由一个叫Nunz Research的团队开发的

00:05:13.660 --> 00:05:16.340
这个agent最核心的理念跟前面两个都不太一样

00:05:16.340 --> 00:05:18.860
它认为一个真正有价值的智能体

00:05:18.860 --> 00:05:20.700
不应该每次跟你对话都像第一次见面

00:05:20.700 --> 00:05:23.380
而应该在长期的使用中慢慢形成记忆

00:05:23.380 --> 00:05:24.620
掌握你的工作习惯

00:05:24.620 --> 00:05:25.900
并且把成功的经验

00:05:25.900 --> 00:05:27.780
沉淀成可以反复使用的技能

00:05:27.780 --> 00:05:29.900
Hermes最大的特点就是闭环学习

00:05:29.900 --> 00:05:31.580
它有一套长期记忆系统

00:05:31.580 --> 00:05:32.860
可以保存你的个人偏好

00:05:32.860 --> 00:05:34.260
项目背景和过去的经验

00:05:34.260 --> 00:05:35.780
它还有一个技能系统

00:05:35.780 --> 00:05:38.540
可以把一个多步骤的复杂流程

00:05:38.540 --> 00:05:40.740
保存成一个可以一键调用的skill

00:05:40.740 --> 00:05:41.620
也就是技能

00:05:41.620 --> 00:05:42.900
以后再遇到类似的任务

00:05:42.900 --> 00:05:44.180
它就不必重新摸索了

00:05:44.180 --> 00:05:45.340
而是可以直接调用

00:05:45.340 --> 00:05:46.620
已经形成的工作方法

00:05:46.620 --> 00:05:47.140
打个比方

00:05:47.140 --> 00:05:48.660
这就有点像一个实习生

00:05:48.660 --> 00:05:49.940
刚来的时候什么都不会

00:05:49.940 --> 00:05:51.020
但你在带他的过程中

00:05:51.020 --> 00:05:51.740
他会犯错

00:05:51.740 --> 00:05:52.580
你会纠正他

00:05:52.580 --> 00:05:54.300
慢慢的他学会了怎么做报告

00:05:54.300 --> 00:05:55.140
怎么分析数据

00:05:55.140 --> 00:05:56.780
下次再让他做类似的工作

00:05:56.780 --> 00:05:57.700
他就能直接上手

00:05:57.700 --> 00:05:58.740
甚至做的又快又好

00:05:58.740 --> 00:05:59.500
Hermes就是这样

00:05:59.500 --> 00:06:01.380
如果他在执行任务时走了弯路

00:06:01.380 --> 00:06:02.620
最后找到了正确的方法

00:06:02.620 --> 00:06:03.900
或者你纠正了他的做法

00:06:03.900 --> 00:06:04.820
他可以把这些经验

00:06:04.820 --> 00:06:05.860
写进他的技能库里

00:06:05.860 --> 00:06:07.340
所以Hermes的价值

00:06:07.340 --> 00:06:08.980
是会随着你使用它的时间

00:06:08.980 --> 00:06:09.820
增长而增长的

00:06:09.820 --> 00:06:11.660
他不是简单的记住聊天内容

00:06:11.660 --> 00:06:13.460
而是在尝试把过去的经验

00:06:13.460 --> 00:06:14.660
转化为程序化

00:06:14.660 --> 00:06:16.220
可附用的工作流程

00:06:16.220 --> 00:06:17.420
Hermes的第二个优点

00:06:17.420 --> 00:06:18.900
是模型自由度很高

00:06:18.900 --> 00:06:20.700
它可以连接OpenAI

00:06:20.700 --> 00:06:21.500
Cloud

00:06:21.500 --> 00:06:22.500
Gemini

00:06:22.500 --> 00:06:23.500
DeepSeek

00:06:23.500 --> 00:06:25.340
Qianwen等各种云端模型

00:06:25.340 --> 00:06:26.700
甚至你本地的模型也行

00:06:26.700 --> 00:06:29.020
你的长期记忆技能和工作入口

00:06:29.020 --> 00:06:31.180
是属于HIMES这个员工本身的

00:06:31.180 --> 00:06:33.460
而不是绑定在某一个特定的大模型上

00:06:33.460 --> 00:06:34.140
也就是说

00:06:34.140 --> 00:06:36.420
你可以随时给这个员工换个大脑

00:06:36.420 --> 00:06:38.180
但他已经学会的工作方法还在

00:06:38.180 --> 00:06:39.860
第三个优点是它适合

00:06:39.860 --> 00:06:41.060
长期在线运行

00:06:41.060 --> 00:06:42.620
你可以把它部署在自己的

00:06:42.620 --> 00:06:44.620
电脑上或者云端的服务器里

00:06:44.620 --> 00:06:45.860
甚至可以通过Telegram

00:06:45.860 --> 00:06:46.300
Discord

00:06:46.300 --> 00:06:46.660
Slack

00:06:46.660 --> 00:06:47.100
WhatsApp

00:06:47.100 --> 00:06:48.760
非输 企业微信

00:06:48.760 --> 00:06:50.100
这些渠道跟他交互

00:06:50.100 --> 00:06:52.340
这意味着就算你人不在电脑前

00:06:52.340 --> 00:06:53.900
也可以通过手机给他发个任务

00:06:53.900 --> 00:06:55.440
让云端的agent继续帮你工作

00:06:55.440 --> 00:06:57.760
他还内置了定时任务和子agent的能力

00:06:57.760 --> 00:06:59.500
特别适合用来做周期性的报告

00:06:59.500 --> 00:07:01.640
资料搜集 这类长期自动化任务

00:07:01.640 --> 00:07:03.640
不过 关于Hermes的自进化

00:07:03.640 --> 00:07:05.200
这里有一个非常重要的澄清

00:07:05.200 --> 00:07:07.540
他通常不是自己重新训练的一个大语言模型

00:07:07.540 --> 00:07:08.940
也不是说用了一段时间之后

00:07:08.940 --> 00:07:11.440
模型本身的神经网络权重就自动改变了

00:07:11.440 --> 00:07:12.900
他所谓的成长主要发生在

00:07:12.900 --> 00:07:15.500
在技能和系统提示这些层面上

00:07:15.500 --> 00:07:17.060
它有一个叫Self Evolution

00:07:17.060 --> 00:07:18.700
也就是自我进化的项目

00:07:18.700 --> 00:07:20.980
会利用执行轨迹和评估数据

00:07:20.980 --> 00:07:22.860
来生成和优化技能和提示词

00:07:22.860 --> 00:07:24.660
但并不是在修改模型本身

00:07:24.660 --> 00:07:26.900
这更接近于是工作流程

00:07:26.900 --> 00:07:28.540
和提示系统的迭代

00:07:28.540 --> 00:07:30.420
而不是模型的重新训练

00:07:30.420 --> 00:07:31.260
这种机制

00:07:31.260 --> 00:07:32.300
既是它的优势

00:07:32.300 --> 00:07:33.260
也带来了风险

00:07:33.260 --> 00:07:33.820
你想想

00:07:33.820 --> 00:07:35.860
如果一个agent总结了错误的经验

00:07:35.860 --> 00:07:36.780
他也可能把这个错误

00:07:36.780 --> 00:07:37.620
写进他的记忆里

00:07:37.620 --> 00:07:39.140
如果某一次偶然的特殊情况

00:07:39.140 --> 00:07:40.460
被他误认为是普遍规律

00:07:40.460 --> 00:07:42.780
那这个错误的流程就可能在以后被反复调用

00:07:42.780 --> 00:07:46.500
所以Hermes提供了记忆写入和技能写入的审批机制

00:07:46.500 --> 00:07:49.580
比较稳妥的做法是让agent先提出修改建议

00:07:49.580 --> 00:07:51.620
然后由人来查看差异并批准

00:07:51.620 --> 00:07:54.220
而不是让他完全不受控制的修改自己

00:07:54.220 --> 00:07:55.860
这也给我们一个很重要的启发

00:07:55.860 --> 00:07:58.740
一个AI的自我改进不能只看他有没有学习能力

00:07:58.740 --> 00:08:00.000
还得看他有没有平衡能力

00:08:00.000 --> 00:08:02.360
還得看他有沒有評估、回滾、審批和安全邊界

00:08:02.360 --> 00:08:03.960
沒有驗證機制的自我學習

00:08:03.960 --> 00:08:06.600
可能只是讓他在更有信心的重複錯誤

00:08:06.600 --> 00:08:09.080
最後我們來看看OpenAI的Codex

00:08:09.080 --> 00:08:11.080
很多人對Codex的印象可能還停留在

00:08:11.080 --> 00:08:12.360
他是一個編碼助手

00:08:12.360 --> 00:08:14.680
但現在他已經發展成一個由桌面端

00:08:14.680 --> 00:08:17.820
命令行 IDE插件和云端环境组成的完整体系了

00:08:17.820 --> 00:08:20.280
严格来说 OpenAI 把那些通用的研究

00:08:20.280 --> 00:08:23.120
报告 表格 PPT 和文件交付等功能

00:08:23.120 --> 00:08:24.960
更多的放在了 ChatGPT Work 里

00:08:24.960 --> 00:08:28.560
而 CodeX 仍然以代码 项目 工具和工程执行为核心

00:08:28.560 --> 00:08:31.060
当然 这两者的能力正在越来越多地共享

00:08:31.060 --> 00:08:34.160
CodeX 最大的优点是它特别强调做完并验证

00:08:34.160 --> 00:08:36.200
而不仅仅是给你一些建议

00:08:36.200 --> 00:08:38.240
它可以读取你整个项目的文件

00:08:38.240 --> 00:08:41.400
搜索代码 修改多个文件 运行命令 执行测试

00:08:41.400 --> 00:08:42.480
查看报错信息

00:08:42.480 --> 00:08:44.280
然后根据测试结果继续修复问题

00:08:44.280 --> 00:08:46.640
最后交付给你的不只是一几段示例代码

00:08:46.640 --> 00:08:48.680
而是一个完整的修改摘要

00:08:48.680 --> 00:08:50.080
文件差异对比

00:08:50.080 --> 00:08:53.160
测试结果以及可以审查的最终成果

00:08:53.160 --> 00:08:54.200
第二个优点是

00:08:54.200 --> 00:08:56.360
它的工程环境比较完整

00:08:56.360 --> 00:08:57.840
你在本地的Codex

00:08:57.840 --> 00:08:59.240
可以直接使用你电脑上

00:08:59.240 --> 00:09:00.680
已经装好的编译器

00:09:00.680 --> 00:09:02.120
测试工具和项目依赖

00:09:02.120 --> 00:09:03.160
而云端的Codex

00:09:03.160 --> 00:09:05.080
可以为不同的任务建立隔离的环境

00:09:05.080 --> 00:09:07.480
让多个任务在后台并行运行

00:09:07.480 --> 00:09:08.160
任务完成后

00:09:08.160 --> 00:09:09.840
你可以清楚地看到它都改了些什么

00:09:11.400 --> 00:09:14.440
或者直接把修改提交到你的代码仓库

00:09:14.440 --> 00:09:15.440
第三个优点是

00:09:15.440 --> 00:09:17.800
它的权限和安全边界做的比较成熟

00:09:17.800 --> 00:09:20.960
Codex通过杀箱来限制它对文件和网络的访问

00:09:20.960 --> 00:09:23.960
在执行一些高风险命令或者跨越权限边界的时候

00:09:23.960 --> 00:09:25.160
会向你请求批准

00:09:25.160 --> 00:09:27.360
这种设计可能会让操作显得有点紧身

00:09:27.360 --> 00:09:29.640
但对于一个能够真实修改文件

00:09:29.640 --> 00:09:32.440
运行程序和连接外部工具的智能体来说

00:09:32.440 --> 00:09:35.040
这种谨慎本身就是可靠性的重要组成部分

00:09:35.040 --> 00:09:38.760
第四个优点是它把编码研究和文件交付连接了起来

00:09:38.760 --> 00:09:40.760
在ChatGPT Work这个更大的环境里

00:09:40.760 --> 00:09:43.260
同一套能力还可以用来生成和检查文档

00:09:43.260 --> 00:09:47.060
表格PPT PDF网站和数据分析结果

00:09:47.060 --> 00:09:50.560
这意味着一个复杂的任务可以从资料搜集开始

00:09:50.560 --> 00:09:52.260
经过分析和程序处理

00:09:52.260 --> 00:09:54.160
最后形成可以直接使用的文件

00:09:54.160 --> 00:09:56.060
整个流程都可以在一个环境里完成

00:09:56.060 --> 00:09:57.960
当然 Codex的局限也很清楚

00:09:57.960 --> 00:10:01.760
它主要围绕OpenAI自家的模型和ChatGPT服务来运行

00:10:01.760 --> 00:10:04.960
模型的自由度不如Hermes或者DeepSeek Harness

00:10:04.960 --> 00:10:07.560
它虽然也支持技能记忆和项目规则

00:10:07.560 --> 00:10:10.360
但不会把自动修改自己作为最核心的卖点

00:10:10.360 --> 00:10:11.720
它的取向更加保守

00:10:11.720 --> 00:10:14.240
宁可让流程可审查可验证

00:10:14.240 --> 00:10:16.560
也不轻易让agent自行改变长期规则

00:10:16.560 --> 00:10:16.920
好了

00:10:16.920 --> 00:10:18.880
现在我们把这四个智能体放在一起

00:10:18.880 --> 00:10:20.680
就能得到一个非常清晰的结论了

00:10:20.680 --> 00:10:23.080
如果你的目标是开发一个自己的agent产品

00:10:23.080 --> 00:10:25.520
那DeepSeek Harness最有吸引力

00:10:25.520 --> 00:10:27.560
因为它开放 模块化

00:10:27.560 --> 00:10:28.840
运行过程可追速

00:10:28.840 --> 00:10:30.440
如果你的目标是普通办公人员

00:10:30.440 --> 00:10:31.560
想马上提高效率

00:10:31.560 --> 00:10:32.640
那Workbody最方便

00:10:32.640 --> 00:10:35.440
因为它把复杂的技术包装成了开箱即用的成品

00:10:35.440 --> 00:10:37.800
如果你的目标是培养一个能长期在线

00:10:37.800 --> 00:10:40.000
逐渐熟悉你个人工作方式的智能体

00:10:40.000 --> 00:10:41.640
那Hermes最有特色

00:10:41.640 --> 00:10:43.480
如果你的目标是完成复杂的代码

00:10:43.480 --> 00:10:45.960
工具执行和需要严格验证的专业任务

00:10:45.960 --> 00:10:47.920
那Codex的综合完成度更高

00:10:47.920 --> 00:10:51.600
你看他们代表的其实是四条完全不同的路线

00:10:51.600 --> 00:10:53.960
DeepSeek Harness追求的是架构上的自由

00:10:53.960 --> 00:10:55.920
WorkBuddy追求的是使用的便利

00:10:55.920 --> 00:10:57.960
Hermes追求的是长期的成长

00:10:57.960 --> 00:11:00.200
而Codex追求的是可靠的交付

00:11:00.200 --> 00:11:00.880
聊到这里

00:11:00.880 --> 00:11:03.080
还有三点特别值得我们进一步思考

00:11:03.080 --> 00:11:03.720
第一

00:11:03.720 --> 00:11:05.040
未来agent的竞争

00:11:05.040 --> 00:11:06.700
绝对不会只发生在模型层面

00:11:06.700 --> 00:11:08.040
模型当然很重要

00:11:08.040 --> 00:11:09.440
它决定了智力的上限

00:11:09.440 --> 00:11:10.940
但真正决定这个智能体

00:11:10.940 --> 00:11:12.900
能不能稳定落地完成实际工作的

00:11:12.900 --> 00:11:14.940
是模型之外的那个Harness

00:11:14.940 --> 00:11:16.100
也就是它的运行底座

00:11:16.100 --> 00:11:17.100
它能用什么工具

00:11:17.100 --> 00:11:18.440
能访问哪些文件

00:11:18.440 --> 00:11:19.200
怎么记忆

00:11:19.200 --> 00:11:20.280
怎么调度任务

00:11:20.280 --> 00:11:21.380
出错了能不能恢复

00:11:21.380 --> 00:11:23.080
以及我们作为使用者

00:11:23.080 --> 00:11:25.040
能不能看清它到底都做了什么

00:11:25.040 --> 00:11:26.340
这些才是关键

00:11:26.340 --> 00:11:26.800
第二

00:11:26.800 --> 00:11:28.480
我们刚才聊到的所谓自进化

00:11:28.480 --> 00:11:30.600
绝对不能脱离一个有效的评估系统

00:11:30.600 --> 00:11:32.440
一个agent能够修改自己的技能

00:11:32.440 --> 00:11:34.100
并不等于它一定会变得更好

00:11:34.100 --> 00:11:35.440
真正有效的自我改进

00:11:35.440 --> 00:11:37.440
至少需要完整的执行记录

00:11:37.440 --> 00:11:38.500
客观的测试数据

00:11:38.500 --> 00:11:40.700
效果比较机智必要的人类审批

00:11:40.700 --> 00:11:42.300
以及出错了能回滚的方案

00:11:42.300 --> 00:11:44.700
否则它可能只是在更有信心的

00:11:44.700 --> 00:11:46.500
把你最初交给它的那个错误

00:11:46.500 --> 00:11:48.300
一遍又一遍的固化下来

00:11:48.300 --> 00:11:49.840
第三 最好的agent

00:11:49.840 --> 00:11:50.940
不一定是最自主的agent

00:11:50.940 --> 00:11:53.340
对于很多低风险的重复性的任务

00:11:53.340 --> 00:11:54.340
高程度的自动化

00:11:54.340 --> 00:11:55.840
确实能节省大量时间

00:11:55.840 --> 00:11:59.000
但是当涉及到付款 删除文件

00:11:59.000 --> 00:12:01.200
发布公开内容 修改正式代码

00:12:01.200 --> 00:12:03.440
或者处理敏感数据这些关键操作时

00:12:03.440 --> 00:12:05.760
一个能够暂停下来向你解释情况

00:12:05.760 --> 00:12:06.960
并等待你确认的agent

00:12:06.960 --> 00:12:09.840
它的价值其实远远高于一个完全自主

00:12:09.840 --> 00:12:11.160
从不请示的agent

00:12:11.160 --> 00:12:12.560
一个成熟的智能体系统

00:12:12.560 --> 00:12:14.240
不是要取消人的判断

00:12:14.240 --> 00:12:15.800
而是要把人的判断

00:12:15.800 --> 00:12:18.200
集中到那些最关键的节点上

00:12:18.200 --> 00:12:19.920
最后我们来总结一下今天的内容

00:12:19.920 --> 00:12:21.000
DeepSake Harness

00:12:21.000 --> 00:12:24.360
最适合作为构建自有agent系统的开放底座

00:12:24.360 --> 00:12:26.320
腾讯的WorkBuddy最省事

00:12:26.320 --> 00:12:28.920
适合想直接进入日常办公场景的用户

00:12:28.920 --> 00:12:30.640
Hermes Agent最像一个会积累

00:12:30.640 --> 00:12:32.640
记忆和技能的长期AI员工

00:12:32.640 --> 00:12:34.040
而OpenAI的Codex

00:12:34.040 --> 00:12:35.800
则最擅长把复杂的专业工作

00:12:35.800 --> 00:12:36.640
真正做完

00:12:36.640 --> 00:12:38.120
并进行严格的验证

00:12:38.120 --> 00:12:38.920
所以

00:12:38.920 --> 00:12:40.080
下次你在选择的时候

00:12:40.080 --> 00:12:41.560
不要只问谁最强

00:12:41.560 --> 00:12:43.440
而要问自己三个更具体的问题

00:12:43.440 --> 00:12:43.960
第一

00:12:43.960 --> 00:12:45.360
我需要的是一个成品工具

00:12:45.360 --> 00:12:46.880
还是一个可以自己开发的框架

00:12:46.880 --> 00:12:47.320
第二

00:12:47.320 --> 00:12:48.480
我更看重的是

00:12:48.480 --> 00:12:50.000
即时的效率提升

00:12:50.000 --> 00:12:51.560
还是长期的成长和陪伴

00:12:51.560 --> 00:12:52.320
第三

00:12:52.320 --> 00:12:55.160
我是否需要掌握对模型

00:12:55.160 --> 00:12:56.120
数据

00:12:56.120 --> 00:12:58.360
权限和运行环境的控制权

00:12:58.360 --> 00:12:59.960
当你把这三个问题想清楚之后

00:12:59.960 --> 00:13:01.960
这死者之间的选择就一点都不模糊了

00:13:01.960 --> 00:13:03.160
他们不是简单的

00:13:03.160 --> 00:13:04.600
谁替代谁的关系

00:13:04.600 --> 00:13:07.560
而是分别服务于不同层级不同需求的

00:13:07.560 --> 00:13:09.120
未来更常见的情况

00:13:09.120 --> 00:13:10.720
可能也不是某一个超级agent

00:13:10.720 --> 00:13:11.680
包揽所有工作

00:13:11.680 --> 00:13:13.800
而是像今天聊到的成品办公agent

00:13:13.800 --> 00:13:14.720
专业工程agent

00:13:14.720 --> 00:13:16.720
长期个人agent和企业资金底座

00:13:16.720 --> 00:13:17.720
他们相互配合

00:13:17.720 --> 00:13:19.680
共同组成一个真正好用的

00:13:19.680 --> 00:13:20.680
AI工作系统
