1
00:00:00,000 --> 00:00:02,960
2026年AI智能體也就是我們常說的AI agent

2
00:00:02,960 --> 00:00:03,840
一下子就火了

3
00:00:03,840 --> 00:00:05,760
你隨便一搜就能看到各種各樣的產品

4
00:00:05,760 --> 00:00:06,960
比如DeepSea Karnes

5
00:00:07,320 --> 00:00:08,320
騰訊的WorkBody

6
00:00:08,320 --> 00:00:10,000
一個叫Hermes Agent的

7
00:00:10,000 --> 00:00:11,520
還有OpenAI的Codex

8
00:00:11,520 --> 00:00:12,640
乍一看他們好像

9
00:00:13,200 --> 00:00:14,920
都差不多都是能自己幹活的AI嘛

10
00:00:14,920 --> 00:00:16,960
那我們是不是只要比比誰更聰明就行了

11
00:00:16,960 --> 00:00:20,280
他們四個其實代表了四種完全不同的發展路線

12
00:00:20,280 --> 00:00:22,040
今天咱們最重要的任務

13
00:00:22,040 --> 00:00:23,800
就不是給他們排個一二三四

14
00:00:23,800 --> 00:00:25,560
而是要把這四家的底細都摸清楚

15
00:00:25,560 --> 00:00:27,760
他們各自到底在解決什麼問題

16
00:00:27,760 --> 00:00:28,720
最厲害的地方在哪

17
00:00:28,720 --> 00:00:30,380
又分别适合什么样的人去用

18
00:00:30,380 --> 00:00:31,460
咱们一个一个来看

19
00:00:31,460 --> 00:00:33,220
先说deepseek harness

20
00:00:33,220 --> 00:00:35,560
这个名字里的harness翻译过来有点像

21
00:00:35,560 --> 00:00:38,320
智能体的运行底座或者框架

22
00:00:38,320 --> 00:00:39,120
你可以这么理解

23
00:00:39,120 --> 00:00:40,320
一个大模型

24
00:00:40,320 --> 00:00:41,760
就像一个聪明的大脑

25
00:00:41,760 --> 00:00:42,800
它会思考

26
00:00:42,800 --> 00:00:43,700
会说话

27
00:00:43,700 --> 00:00:45,400
但是它光有大脑

28
00:00:45,400 --> 00:00:46,900
是没法帮你完成一个

29
00:00:46,900 --> 00:00:48,400
现实世界里的具体任务的

30
00:00:48,400 --> 00:00:49,900
它得有手有脚

31
00:00:49,900 --> 00:00:51,100
得有工具

32
00:00:51,100 --> 00:00:52,100
得有记忆

33
00:00:52,100 --> 00:00:53,300
得有个工作台

34
00:00:53,300 --> 00:00:55,000
这个harness就是给它提供

35
00:00:55,000 --> 00:00:57,940
身体操作系统和工作环境的那一整套东西

36
00:00:57,940 --> 00:01:00,740
DeepSeaKarnes最核心的设计理念叫Everything is a Plugin

37
00:01:00,740 --> 00:01:02,740
翻译过来就是一切皆插件

38
00:01:02,740 --> 00:01:04,740
你用哪个大语言模型可以换

39
00:01:04,740 --> 00:01:06,840
你需要它用什么工具可以换

40
00:01:06,840 --> 00:01:09,640
它的记忆系统存储方式任务调度方法

41
00:01:09,640 --> 00:01:11,740
甚至是用户界面全都可以换

42
00:01:11,740 --> 00:01:13,240
开发者就像搭积木一样

43
00:01:13,240 --> 00:01:15,840
用配置的方式就能把这些能力重新组合起来

44
00:01:15,840 --> 00:01:17,340
而不用动框架本身的代码

45
00:01:17,340 --> 00:01:19,540
这就带来了几个非常突出的优点

46
00:01:19,540 --> 00:01:21,840
第一 开放性和可组合性超级强

47
00:01:21,840 --> 00:01:24,840
比如说一家公司想搞一套自己的内部智能体

48
00:01:24,840 --> 00:01:27,540
又不想被某一家模型公司给绑架

49
00:01:27,540 --> 00:01:30,040
那就可以把不同公司的模型都接进这个Harness里

50
00:01:30,040 --> 00:01:32,640
遇到复杂的推理任务就调用能力最强的那个模型

51
00:01:32,640 --> 00:01:33,940
遇到普通的整理任务

52
00:01:33,940 --> 00:01:35,840
就用一个成本更低的模型

53
00:01:35,840 --> 00:01:37,440
甚至处理一些敏感数据

54
00:01:37,440 --> 00:01:40,340
可以直接用部署在自己服务器上的本地模型

55
00:01:40,340 --> 00:01:41,640
这就非常灵活了

56
00:01:41,640 --> 00:01:42,240
第二

57
00:01:42,240 --> 00:01:43,840
它的运行过程非常透明

58
00:01:43,840 --> 00:01:45,040
它会详细记录下

59
00:01:45,040 --> 00:01:46,640
模型每一步都看到了什么

60
00:01:46,640 --> 00:01:48,040
系统给了它什么指令

61
00:01:48,040 --> 00:01:49,140
它调用了什么工具

62
00:01:49,140 --> 00:01:51,340
又派出了哪个小助手去干活

63
00:01:51,340 --> 00:01:54,740
整个任务过程可以被恢复搜索分叉和重放

64
00:01:54,740 --> 00:01:56,740
这一点对开发者来说太重要了

65
00:01:56,740 --> 00:01:59,140
因为AI智能体最让人头疼的一个问题就是

66
00:01:59,140 --> 00:01:59,940
它要是做错了事

67
00:01:59,940 --> 00:02:01,240
你根本不知道它为什么错

68
00:02:01,240 --> 00:02:03,440
有了这份完整的黑匣子飞行记录

69
00:02:03,440 --> 00:02:05,740
调试评估和审计就都有了依据

70
00:02:05,740 --> 00:02:06,240
第三

71
00:02:06,240 --> 00:02:08,240
它不只提供一种固定的工作模式

72
00:02:08,240 --> 00:02:10,840
它有标准模式适合绝大多数任务

73
00:02:10,840 --> 00:02:12,340
有代码模式

74
00:02:12,340 --> 00:02:15,440
让模型直接写程序来组织复杂的工具调用

75
00:02:15,440 --> 00:02:17,940
还有最小模式只保留最核心的功能

76
00:02:17,940 --> 00:02:20,420
方便测试模型最原始的智能体能力

77
00:02:20,420 --> 00:02:21,860
甚至还有一个Creator模式

78
00:02:21,860 --> 00:02:24,500
专门用来设计新的插件和智能体模板

79
00:02:24,500 --> 00:02:25,860
当然缺点也很明显

80
00:02:25,860 --> 00:02:27,820
DeepSeek Harness更像是一个基础设施

81
00:02:27,820 --> 00:02:29,340
一个给专业人士用的工具包

82
00:02:29,340 --> 00:02:30,700
而不是咱们普通人下载下来

83
00:02:30,700 --> 00:02:32,220
就能直接当办公助手用的

84
00:02:32,220 --> 00:02:34,500
模型怎么选 工具怎么接 权限怎么配

85
00:02:34,500 --> 00:02:36,700
数据怎么存 这些都得你自己来负责

86
00:02:36,700 --> 00:02:39,260
而且它目前还处在开发者预览阶段

87
00:02:39,260 --> 00:02:41,220
接口和插件生态都还在快速变化

88
00:02:41,220 --> 00:02:42,860
所以它最大的价值

89
00:02:42,860 --> 00:02:45,460
不是让你马上扔掉现在的AI助手

90
00:02:45,460 --> 00:02:48,020
而是为那些有开发能力的企业或者团队

91
00:02:48,020 --> 00:02:50,140
提供了一套可控可扩展的

92
00:02:50,420 --> 00:02:51,260
agent底盘

93
00:02:51,260 --> 00:02:51,740
好

94
00:02:51,740 --> 00:02:54,060
说完了需要自己动手组装的底盘

95
00:02:54,060 --> 00:02:56,300
我们再来看一个已经组装好加满油

96
00:02:56,300 --> 00:02:57,700
随时能开的整车

97
00:02:57,700 --> 00:02:58,900
腾讯的workbody

98
00:02:58,900 --> 00:03:00,180
如果说deep-sea carless

99
00:03:00,180 --> 00:03:01,820
是给开发者准备的乐高积木

100
00:03:01,820 --> 00:03:03,420
那workbody就是一辆已经组装好的

101
00:03:03,420 --> 00:03:04,860
设计好所有细节的汽车

102
00:03:04,860 --> 00:03:06,340
它的核心目标非常明确

103
00:03:06,340 --> 00:03:09,260
就是让普通的职场人用一句大白话

104
00:03:09,260 --> 00:03:11,620
就能把一个相对完整的工作任务

105
00:03:11,620 --> 00:03:12,920
交给AI去完成

106
00:03:12,920 --> 00:03:14,080
WorkBuddy强调的是

107
00:03:14,080 --> 00:03:15,020
全场景办公

108
00:03:15,020 --> 00:03:15,880
多专家协作

109
00:03:15,880 --> 00:03:16,720
和开箱即用

110
00:03:16,720 --> 00:03:18,420
你可以用它来搜集资料

111
00:03:18,420 --> 00:03:19,480
做市场调研

112
00:03:19,480 --> 00:03:20,480
分析表格

113
00:03:20,480 --> 00:03:21,580
生成PPT

114
00:03:21,580 --> 00:03:22,880
写内容整理文件

115
00:03:22,880 --> 00:03:23,880
甚至写点代码

116
00:03:23,880 --> 00:03:25,420
你只需要告诉它你的目标

117
00:03:25,420 --> 00:03:26,620
它会自己先去理解

118
00:03:26,620 --> 00:03:27,580
然后把任务拆解

119
00:03:27,580 --> 00:03:29,180
再调用不同领域的专家

120
00:03:29,180 --> 00:03:29,980
并行处理

121
00:03:29,980 --> 00:03:31,420
最后把结果交到你手上

122
00:03:31,420 --> 00:03:32,980
你还可以检查和修改

123
00:03:32,980 --> 00:03:34,020
WorkBuddy最大的优点

124
00:03:34,020 --> 00:03:35,580
首先就是使用门槛极低

125
00:03:35,580 --> 00:03:36,620
你完全不需要懂什么

126
00:03:36,620 --> 00:03:37,220
Python编程

127
00:03:37,220 --> 00:03:37,820
Docker容器

128
00:03:37,820 --> 00:03:40,580
APM要像量数据库这些听起来就头大的词

129
00:03:40,580 --> 00:03:41,900
翻装好之后直接就能用

130
00:03:41,900 --> 00:03:43,660
这对大多数人来说太重要了

131
00:03:43,660 --> 00:03:45,140
因为真正决定生产力的

132
00:03:45,140 --> 00:03:46,740
往往不是理论上限有多高

133
00:03:46,740 --> 00:03:48,540
而是一个工具能不能在10分钟内

134
00:03:48,540 --> 00:03:49,980
就开始帮你创造价值

135
00:03:49,980 --> 00:03:51,860
第二个优点是它对中文办公

136
00:03:51,860 --> 00:03:53,540
和国内生态的适配特别好

137
00:03:53,540 --> 00:03:55,740
它覆盖了Windows和macOS系统

138
00:03:55,740 --> 00:03:57,700
还打通了桌面端主流的

139
00:03:57,700 --> 00:03:59,860
即时通讯工具和微信小程序

140
00:03:59,860 --> 00:04:02,580
无论是写中文报告做PPT处理Excel

141
00:04:02,580 --> 00:04:04,420
还是跟国内企业的沟通场景

142
00:04:04,420 --> 00:04:05,860
Workbody的产品设计

143
00:04:05,860 --> 00:04:07,860
都更贴近我们的日常办公习惯

144
00:04:07,860 --> 00:04:08,860
第三个优点

145
00:04:08,860 --> 00:04:11,460
是它把复杂的多智能体协作

146
00:04:11,460 --> 00:04:13,760
包装成了一个用户能听懂的概念

147
00:04:13,760 --> 00:04:14,960
叫专家团队

148
00:04:14,960 --> 00:04:17,060
你不需要自己去设计什么研究agent

149
00:04:17,060 --> 00:04:18,660
数据agent 协作agent

150
00:04:18,660 --> 00:04:20,360
你只需要描述你的最终目标

151
00:04:20,360 --> 00:04:22,060
系统会自动帮你组织

152
00:04:22,060 --> 00:04:23,860
不同角色的专家来协作

153
00:04:23,860 --> 00:04:26,660
这种把复杂技术藏在产品界面背后的设计

154
00:04:26,660 --> 00:04:28,260
大大降低了用户的理解成本

155
00:04:28,260 --> 00:04:29,560
当然 成品化也意味着

156
00:04:29,560 --> 00:04:31,660
你失去了一部分底层的控制权

157
00:04:31,660 --> 00:04:33,260
你很难像用开源框架那样

158
00:04:33,260 --> 00:04:35,820
完全掌握它内部的每一个运行细节

159
00:04:35,820 --> 00:04:37,100
它的透明度

160
00:04:37,100 --> 00:04:39,140
可定制程度和模型选择的自由度

161
00:04:39,140 --> 00:04:40,740
通常是不如DeepSeek Harness

162
00:04:40,740 --> 00:04:42,700
或者我们接下来要说的Herms Agent的

163
00:04:42,700 --> 00:04:45,060
而且对于一些特别复杂的代码仓库

164
00:04:45,060 --> 00:04:46,380
严格的软件测试任务

165
00:04:46,380 --> 00:04:49,460
WorkBuddy也未必比那些更专业的编码Agent有优势

166
00:04:49,460 --> 00:04:52,020
所以WorkBuddy最适合的是谁呢

167
00:04:52,020 --> 00:04:54,180
就是那些希望马上提升办公效率

168
00:04:54,180 --> 00:04:56,300
但又不愿意投入大量时间去研究

169
00:04:56,300 --> 00:04:57,660
部署和配置系统的人

170
00:04:57,660 --> 00:05:01,100
它的竞争力不在于某一项底层技术有多么领先

171
00:05:01,100 --> 00:05:05,220
而在于它把模型、工具、专家、文件和办公入口

172
00:05:05,220 --> 00:05:07,380
整合成了一个可以直接上手用的产品

173
00:05:07,380 --> 00:05:09,460
接下来我们聊聊一个很有意思的agent

174
00:05:09,460 --> 00:05:10,620
叫做Hermes Agent

175
00:05:10,620 --> 00:05:13,660
它是由一个叫Nunz Research的团队开发的

176
00:05:13,660 --> 00:05:16,340
这个agent最核心的理念跟前面两个都不太一样

177
00:05:16,340 --> 00:05:18,860
它认为一个真正有价值的智能体

178
00:05:18,860 --> 00:05:20,700
不应该每次跟你对话都像第一次见面

179
00:05:20,700 --> 00:05:23,380
而应该在长期的使用中慢慢形成记忆

180
00:05:23,380 --> 00:05:24,620
掌握你的工作习惯

181
00:05:24,620 --> 00:05:25,900
并且把成功的经验

182
00:05:25,900 --> 00:05:27,780
沉淀成可以反复使用的技能

183
00:05:27,780 --> 00:05:29,900
Hermes最大的特点就是闭环学习

184
00:05:29,900 --> 00:05:31,580
它有一套长期记忆系统

185
00:05:31,580 --> 00:05:32,860
可以保存你的个人偏好

186
00:05:32,860 --> 00:05:34,260
项目背景和过去的经验

187
00:05:34,260 --> 00:05:35,780
它还有一个技能系统

188
00:05:35,780 --> 00:05:38,540
可以把一个多步骤的复杂流程

189
00:05:38,540 --> 00:05:40,740
保存成一个可以一键调用的skill

190
00:05:40,740 --> 00:05:41,620
也就是技能

191
00:05:41,620 --> 00:05:42,900
以后再遇到类似的任务

192
00:05:42,900 --> 00:05:44,180
它就不必重新摸索了

193
00:05:44,180 --> 00:05:45,340
而是可以直接调用

194
00:05:45,340 --> 00:05:46,620
已经形成的工作方法

195
00:05:46,620 --> 00:05:47,140
打个比方

196
00:05:47,140 --> 00:05:48,660
这就有点像一个实习生

197
00:05:48,660 --> 00:05:49,940
刚来的时候什么都不会

198
00:05:49,940 --> 00:05:51,020
但你在带他的过程中

199
00:05:51,020 --> 00:05:51,740
他会犯错

200
00:05:51,740 --> 00:05:52,580
你会纠正他

201
00:05:52,580 --> 00:05:54,300
慢慢的他学会了怎么做报告

202
00:05:54,300 --> 00:05:55,140
怎么分析数据

203
00:05:55,140 --> 00:05:56,780
下次再让他做类似的工作

204
00:05:56,780 --> 00:05:57,700
他就能直接上手

205
00:05:57,700 --> 00:05:58,740
甚至做的又快又好

206
00:05:58,740 --> 00:05:59,500
Hermes就是这样

207
00:05:59,500 --> 00:06:01,380
如果他在执行任务时走了弯路

208
00:06:01,380 --> 00:06:02,620
最后找到了正确的方法

209
00:06:02,620 --> 00:06:03,900
或者你纠正了他的做法

210
00:06:03,900 --> 00:06:04,820
他可以把这些经验

211
00:06:04,820 --> 00:06:05,860
写进他的技能库里

212
00:06:05,860 --> 00:06:07,340
所以Hermes的价值

213
00:06:07,340 --> 00:06:08,980
是会随着你使用它的时间

214
00:06:08,980 --> 00:06:09,820
增长而增长的

215
00:06:09,820 --> 00:06:11,660
他不是简单的记住聊天内容

216
00:06:11,660 --> 00:06:13,460
而是在尝试把过去的经验

217
00:06:13,460 --> 00:06:14,660
转化为程序化

218
00:06:14,660 --> 00:06:16,220
可附用的工作流程

219
00:06:16,220 --> 00:06:17,420
Hermes的第二个优点

220
00:06:17,420 --> 00:06:18,900
是模型自由度很高

221
00:06:18,900 --> 00:06:20,700
它可以连接OpenAI

222
00:06:20,700 --> 00:06:21,500
Cloud

223
00:06:21,500 --> 00:06:22,500
Gemini

224
00:06:22,500 --> 00:06:23,500
DeepSeek

225
00:06:23,500 --> 00:06:25,340
Qianwen等各种云端模型

226
00:06:25,340 --> 00:06:26,700
甚至你本地的模型也行

227
00:06:26,700 --> 00:06:29,020
你的长期记忆技能和工作入口

228
00:06:29,020 --> 00:06:31,180
是属于HIMES这个员工本身的

229
00:06:31,180 --> 00:06:33,460
而不是绑定在某一个特定的大模型上

230
00:06:33,460 --> 00:06:34,140
也就是说

231
00:06:34,140 --> 00:06:36,420
你可以随时给这个员工换个大脑

232
00:06:36,420 --> 00:06:38,180
但他已经学会的工作方法还在

233
00:06:38,180 --> 00:06:39,860
第三个优点是它适合

234
00:06:39,860 --> 00:06:41,060
长期在线运行

235
00:06:41,060 --> 00:06:42,620
你可以把它部署在自己的

236
00:06:42,620 --> 00:06:44,620
电脑上或者云端的服务器里

237
00:06:44,620 --> 00:06:45,860
甚至可以通过Telegram

238
00:06:45,860 --> 00:06:46,300
Discord

239
00:06:46,300 --> 00:06:46,660
Slack

240
00:06:46,660 --> 00:06:47,100
WhatsApp

241
00:06:47,100 --> 00:06:48,760
非输 企业微信

242
00:06:48,760 --> 00:06:50,100
这些渠道跟他交互

243
00:06:50,100 --> 00:06:52,340
这意味着就算你人不在电脑前

244
00:06:52,340 --> 00:06:53,900
也可以通过手机给他发个任务

245
00:06:53,900 --> 00:06:55,440
让云端的agent继续帮你工作

246
00:06:55,440 --> 00:06:57,760
他还内置了定时任务和子agent的能力

247
00:06:57,760 --> 00:06:59,500
特别适合用来做周期性的报告

248
00:06:59,500 --> 00:07:01,640
资料搜集 这类长期自动化任务

249
00:07:01,640 --> 00:07:03,640
不过 关于Hermes的自进化

250
00:07:03,640 --> 00:07:05,200
这里有一个非常重要的澄清

251
00:07:05,200 --> 00:07:07,540
他通常不是自己重新训练的一个大语言模型

252
00:07:07,540 --> 00:07:08,940
也不是说用了一段时间之后

253
00:07:08,940 --> 00:07:11,440
模型本身的神经网络权重就自动改变了

254
00:07:11,440 --> 00:07:12,900
他所谓的成长主要发生在

255
00:07:12,900 --> 00:07:15,500
在技能和系统提示这些层面上

256
00:07:15,500 --> 00:07:17,060
它有一个叫Self Evolution

257
00:07:17,060 --> 00:07:18,700
也就是自我进化的项目

258
00:07:18,700 --> 00:07:20,980
会利用执行轨迹和评估数据

259
00:07:20,980 --> 00:07:22,860
来生成和优化技能和提示词

260
00:07:22,860 --> 00:07:24,660
但并不是在修改模型本身

261
00:07:24,660 --> 00:07:26,900
这更接近于是工作流程

262
00:07:26,900 --> 00:07:28,540
和提示系统的迭代

263
00:07:28,540 --> 00:07:30,420
而不是模型的重新训练

264
00:07:30,420 --> 00:07:31,260
这种机制

265
00:07:31,260 --> 00:07:32,300
既是它的优势

266
00:07:32,300 --> 00:07:33,260
也带来了风险

267
00:07:33,260 --> 00:07:33,820
你想想

268
00:07:33,820 --> 00:07:35,860
如果一个agent总结了错误的经验

269
00:07:35,860 --> 00:07:36,780
他也可能把这个错误

270
00:07:36,780 --> 00:07:37,620
写进他的记忆里

271
00:07:37,620 --> 00:07:39,140
如果某一次偶然的特殊情况

272
00:07:39,140 --> 00:07:40,460
被他误认为是普遍规律

273
00:07:40,460 --> 00:07:42,780
那这个错误的流程就可能在以后被反复调用

274
00:07:42,780 --> 00:07:46,500
所以Hermes提供了记忆写入和技能写入的审批机制

275
00:07:46,500 --> 00:07:49,580
比较稳妥的做法是让agent先提出修改建议

276
00:07:49,580 --> 00:07:51,620
然后由人来查看差异并批准

277
00:07:51,620 --> 00:07:54,220
而不是让他完全不受控制的修改自己

278
00:07:54,220 --> 00:07:55,860
这也给我们一个很重要的启发

279
00:07:55,860 --> 00:07:58,740
一个AI的自我改进不能只看他有没有学习能力

280
00:07:58,740 --> 00:08:00,000
还得看他有没有平衡能力

281
00:08:00,000 --> 00:08:02,360
還得看他有沒有評估、回滾、審批和安全邊界

282
00:08:02,360 --> 00:08:03,960
沒有驗證機制的自我學習

283
00:08:03,960 --> 00:08:06,600
可能只是讓他在更有信心的重複錯誤

284
00:08:06,600 --> 00:08:09,080
最後我們來看看OpenAI的Codex

285
00:08:09,080 --> 00:08:11,080
很多人對Codex的印象可能還停留在

286
00:08:11,080 --> 00:08:12,360
他是一個編碼助手

287
00:08:12,360 --> 00:08:14,680
但現在他已經發展成一個由桌面端

288
00:08:14,680 --> 00:08:17,820
命令行 IDE插件和云端环境组成的完整体系了

289
00:08:17,820 --> 00:08:20,280
严格来说 OpenAI 把那些通用的研究

290
00:08:20,280 --> 00:08:23,120
报告 表格 PPT 和文件交付等功能

291
00:08:23,120 --> 00:08:24,960
更多的放在了 ChatGPT Work 里

292
00:08:24,960 --> 00:08:28,560
而 CodeX 仍然以代码 项目 工具和工程执行为核心

293
00:08:28,560 --> 00:08:31,060
当然 这两者的能力正在越来越多地共享

294
00:08:31,060 --> 00:08:34,160
CodeX 最大的优点是它特别强调做完并验证

295
00:08:34,160 --> 00:08:36,200
而不仅仅是给你一些建议

296
00:08:36,200 --> 00:08:38,240
它可以读取你整个项目的文件

297
00:08:38,240 --> 00:08:41,400
搜索代码 修改多个文件 运行命令 执行测试

298
00:08:41,400 --> 00:08:42,480
查看报错信息

299
00:08:42,480 --> 00:08:44,280
然后根据测试结果继续修复问题

300
00:08:44,280 --> 00:08:46,640
最后交付给你的不只是一几段示例代码

301
00:08:46,640 --> 00:08:48,680
而是一个完整的修改摘要

302
00:08:48,680 --> 00:08:50,080
文件差异对比

303
00:08:50,080 --> 00:08:53,160
测试结果以及可以审查的最终成果

304
00:08:53,160 --> 00:08:54,200
第二个优点是

305
00:08:54,200 --> 00:08:56,360
它的工程环境比较完整

306
00:08:56,360 --> 00:08:57,840
你在本地的Codex

307
00:08:57,840 --> 00:08:59,240
可以直接使用你电脑上

308
00:08:59,240 --> 00:09:00,680
已经装好的编译器

309
00:09:00,680 --> 00:09:02,120
测试工具和项目依赖

310
00:09:02,120 --> 00:09:03,160
而云端的Codex

311
00:09:03,160 --> 00:09:05,080
可以为不同的任务建立隔离的环境

312
00:09:05,080 --> 00:09:07,480
让多个任务在后台并行运行

313
00:09:07,480 --> 00:09:08,160
任务完成后

314
00:09:08,160 --> 00:09:09,840
你可以清楚地看到它都改了些什么

315
00:09:11,400 --> 00:09:14,440
或者直接把修改提交到你的代码仓库

316
00:09:14,440 --> 00:09:15,440
第三个优点是

317
00:09:15,440 --> 00:09:17,800
它的权限和安全边界做的比较成熟

318
00:09:17,800 --> 00:09:20,960
Codex通过杀箱来限制它对文件和网络的访问

319
00:09:20,960 --> 00:09:23,960
在执行一些高风险命令或者跨越权限边界的时候

320
00:09:23,960 --> 00:09:25,160
会向你请求批准

321
00:09:25,160 --> 00:09:27,360
这种设计可能会让操作显得有点紧身

322
00:09:27,360 --> 00:09:29,640
但对于一个能够真实修改文件

323
00:09:29,640 --> 00:09:32,440
运行程序和连接外部工具的智能体来说

324
00:09:32,440 --> 00:09:35,040
这种谨慎本身就是可靠性的重要组成部分

325
00:09:35,040 --> 00:09:38,760
第四个优点是它把编码研究和文件交付连接了起来

326
00:09:38,760 --> 00:09:40,760
在ChatGPT Work这个更大的环境里

327
00:09:40,760 --> 00:09:43,260
同一套能力还可以用来生成和检查文档

328
00:09:43,260 --> 00:09:47,060
表格PPT PDF网站和数据分析结果

329
00:09:47,060 --> 00:09:50,560
这意味着一个复杂的任务可以从资料搜集开始

330
00:09:50,560 --> 00:09:52,260
经过分析和程序处理

331
00:09:52,260 --> 00:09:54,160
最后形成可以直接使用的文件

332
00:09:54,160 --> 00:09:56,060
整个流程都可以在一个环境里完成

333
00:09:56,060 --> 00:09:57,960
当然 Codex的局限也很清楚

334
00:09:57,960 --> 00:10:01,760
它主要围绕OpenAI自家的模型和ChatGPT服务来运行

335
00:10:01,760 --> 00:10:04,960
模型的自由度不如Hermes或者DeepSeek Harness

336
00:10:04,960 --> 00:10:07,560
它虽然也支持技能记忆和项目规则

337
00:10:07,560 --> 00:10:10,360
但不会把自动修改自己作为最核心的卖点

338
00:10:10,360 --> 00:10:11,720
它的取向更加保守

339
00:10:11,720 --> 00:10:14,240
宁可让流程可审查可验证

340
00:10:14,240 --> 00:10:16,560
也不轻易让agent自行改变长期规则

341
00:10:16,560 --> 00:10:16,920
好了

342
00:10:16,920 --> 00:10:18,880
现在我们把这四个智能体放在一起

343
00:10:18,880 --> 00:10:20,680
就能得到一个非常清晰的结论了

344
00:10:20,680 --> 00:10:23,080
如果你的目标是开发一个自己的agent产品

345
00:10:23,080 --> 00:10:25,520
那DeepSeek Harness最有吸引力

346
00:10:25,520 --> 00:10:27,560
因为它开放 模块化

347
00:10:27,560 --> 00:10:28,840
运行过程可追速

348
00:10:28,840 --> 00:10:30,440
如果你的目标是普通办公人员

349
00:10:30,440 --> 00:10:31,560
想马上提高效率

350
00:10:31,560 --> 00:10:32,640
那Workbody最方便

351
00:10:32,640 --> 00:10:35,440
因为它把复杂的技术包装成了开箱即用的成品

352
00:10:35,440 --> 00:10:37,800
如果你的目标是培养一个能长期在线

353
00:10:37,800 --> 00:10:40,000
逐渐熟悉你个人工作方式的智能体

354
00:10:40,000 --> 00:10:41,640
那Hermes最有特色

355
00:10:41,640 --> 00:10:43,480
如果你的目标是完成复杂的代码

356
00:10:43,480 --> 00:10:45,960
工具执行和需要严格验证的专业任务

357
00:10:45,960 --> 00:10:47,920
那Codex的综合完成度更高

358
00:10:47,920 --> 00:10:51,600
你看他们代表的其实是四条完全不同的路线

359
00:10:51,600 --> 00:10:53,960
DeepSeek Harness追求的是架构上的自由

360
00:10:53,960 --> 00:10:55,920
WorkBuddy追求的是使用的便利

361
00:10:55,920 --> 00:10:57,960
Hermes追求的是长期的成长

362
00:10:57,960 --> 00:11:00,200
而Codex追求的是可靠的交付

363
00:11:00,200 --> 00:11:00,880
聊到这里

364
00:11:00,880 --> 00:11:03,080
还有三点特别值得我们进一步思考

365
00:11:03,080 --> 00:11:03,720
第一

366
00:11:03,720 --> 00:11:05,040
未来agent的竞争

367
00:11:05,040 --> 00:11:06,700
绝对不会只发生在模型层面

368
00:11:06,700 --> 00:11:08,040
模型当然很重要

369
00:11:08,040 --> 00:11:09,440
它决定了智力的上限

370
00:11:09,440 --> 00:11:10,940
但真正决定这个智能体

371
00:11:10,940 --> 00:11:12,900
能不能稳定落地完成实际工作的

372
00:11:12,900 --> 00:11:14,940
是模型之外的那个Harness

373
00:11:14,940 --> 00:11:16,100
也就是它的运行底座

374
00:11:16,100 --> 00:11:17,100
它能用什么工具

375
00:11:17,100 --> 00:11:18,440
能访问哪些文件

376
00:11:18,440 --> 00:11:19,200
怎么记忆

377
00:11:19,200 --> 00:11:20,280
怎么调度任务

378
00:11:20,280 --> 00:11:21,380
出错了能不能恢复

379
00:11:21,380 --> 00:11:23,080
以及我们作为使用者

380
00:11:23,080 --> 00:11:25,040
能不能看清它到底都做了什么

381
00:11:25,040 --> 00:11:26,340
这些才是关键

382
00:11:26,340 --> 00:11:26,800
第二

383
00:11:26,800 --> 00:11:28,480
我们刚才聊到的所谓自进化

384
00:11:28,480 --> 00:11:30,600
绝对不能脱离一个有效的评估系统

385
00:11:30,600 --> 00:11:32,440
一个agent能够修改自己的技能

386
00:11:32,440 --> 00:11:34,100
并不等于它一定会变得更好

387
00:11:34,100 --> 00:11:35,440
真正有效的自我改进

388
00:11:35,440 --> 00:11:37,440
至少需要完整的执行记录

389
00:11:37,440 --> 00:11:38,500
客观的测试数据

390
00:11:38,500 --> 00:11:40,700
效果比较机智必要的人类审批

391
00:11:40,700 --> 00:11:42,300
以及出错了能回滚的方案

392
00:11:42,300 --> 00:11:44,700
否则它可能只是在更有信心的

393
00:11:44,700 --> 00:11:46,500
把你最初交给它的那个错误

394
00:11:46,500 --> 00:11:48,300
一遍又一遍的固化下来

395
00:11:48,300 --> 00:11:49,840
第三 最好的agent

396
00:11:49,840 --> 00:11:50,940
不一定是最自主的agent

397
00:11:50,940 --> 00:11:53,340
对于很多低风险的重复性的任务

398
00:11:53,340 --> 00:11:54,340
高程度的自动化

399
00:11:54,340 --> 00:11:55,840
确实能节省大量时间

400
00:11:55,840 --> 00:11:59,000
但是当涉及到付款 删除文件

401
00:11:59,000 --> 00:12:01,200
发布公开内容 修改正式代码

402
00:12:01,200 --> 00:12:03,440
或者处理敏感数据这些关键操作时

403
00:12:03,440 --> 00:12:05,760
一个能够暂停下来向你解释情况

404
00:12:05,760 --> 00:12:06,960
并等待你确认的agent

405
00:12:06,960 --> 00:12:09,840
它的价值其实远远高于一个完全自主

406
00:12:09,840 --> 00:12:11,160
从不请示的agent

407
00:12:11,160 --> 00:12:12,560
一个成熟的智能体系统

408
00:12:12,560 --> 00:12:14,240
不是要取消人的判断

409
00:12:14,240 --> 00:12:15,800
而是要把人的判断

410
00:12:15,800 --> 00:12:18,200
集中到那些最关键的节点上

411
00:12:18,200 --> 00:12:19,920
最后我们来总结一下今天的内容

412
00:12:19,920 --> 00:12:21,000
DeepSake Harness

413
00:12:21,000 --> 00:12:24,360
最适合作为构建自有agent系统的开放底座

414
00:12:24,360 --> 00:12:26,320
腾讯的WorkBuddy最省事

415
00:12:26,320 --> 00:12:28,920
适合想直接进入日常办公场景的用户

416
00:12:28,920 --> 00:12:30,640
Hermes Agent最像一个会积累

417
00:12:30,640 --> 00:12:32,640
记忆和技能的长期AI员工

418
00:12:32,640 --> 00:12:34,040
而OpenAI的Codex

419
00:12:34,040 --> 00:12:35,800
则最擅长把复杂的专业工作

420
00:12:35,800 --> 00:12:36,640
真正做完

421
00:12:36,640 --> 00:12:38,120
并进行严格的验证

422
00:12:38,120 --> 00:12:38,920
所以

423
00:12:38,920 --> 00:12:40,080
下次你在选择的时候

424
00:12:40,080 --> 00:12:41,560
不要只问谁最强

425
00:12:41,560 --> 00:12:43,440
而要问自己三个更具体的问题

426
00:12:43,440 --> 00:12:43,960
第一

427
00:12:43,960 --> 00:12:45,360
我需要的是一个成品工具

428
00:12:45,360 --> 00:12:46,880
还是一个可以自己开发的框架

429
00:12:46,880 --> 00:12:47,320
第二

430
00:12:47,320 --> 00:12:48,480
我更看重的是

431
00:12:48,480 --> 00:12:50,000
即时的效率提升

432
00:12:50,000 --> 00:12:51,560
还是长期的成长和陪伴

433
00:12:51,560 --> 00:12:52,320
第三

434
00:12:52,320 --> 00:12:55,160
我是否需要掌握对模型

435
00:12:55,160 --> 00:12:56,120
数据

436
00:12:56,120 --> 00:12:58,360
权限和运行环境的控制权

437
00:12:58,360 --> 00:12:59,960
当你把这三个问题想清楚之后

438
00:12:59,960 --> 00:13:01,960
这死者之间的选择就一点都不模糊了

439
00:13:01,960 --> 00:13:03,160
他们不是简单的

440
00:13:03,160 --> 00:13:04,600
谁替代谁的关系

441
00:13:04,600 --> 00:13:07,560
而是分别服务于不同层级不同需求的

442
00:13:07,560 --> 00:13:09,120
未来更常见的情况

443
00:13:09,120 --> 00:13:10,720
可能也不是某一个超级agent

444
00:13:10,720 --> 00:13:11,680
包揽所有工作

445
00:13:11,680 --> 00:13:13,800
而是像今天聊到的成品办公agent

446
00:13:13,800 --> 00:13:14,720
专业工程agent

447
00:13:14,720 --> 00:13:16,720
长期个人agent和企业资金底座

448
00:13:16,720 --> 00:13:17,720
他们相互配合

449
00:13:17,720 --> 00:13:19,680
共同组成一个真正好用的

450
00:13:19,680 --> 00:13:20,680
AI工作系统
