start	end	text
0	2960	2026年AI智能體也就是我們常說的AI agent
2960	3840	一下子就火了
3840	5760	你隨便一搜就能看到各種各樣的產品
5760	6960	比如DeepSea Karnes
7320	8320	騰訊的WorkBody
8320	10000	一個叫Hermes Agent的
10000	11520	還有OpenAI的Codex
11520	12640	乍一看他們好像
13200	14920	都差不多都是能自己幹活的AI嘛
14920	16960	那我們是不是只要比比誰更聰明就行了
16960	20280	他們四個其實代表了四種完全不同的發展路線
20280	22040	今天咱們最重要的任務
22040	23800	就不是給他們排個一二三四
23800	25560	而是要把這四家的底細都摸清楚
25560	27760	他們各自到底在解決什麼問題
27760	28720	最厲害的地方在哪
28720	30380	又分别适合什么样的人去用
30380	31460	咱们一个一个来看
31460	33220	先说deepseek harness
33220	35560	这个名字里的harness翻译过来有点像
35560	38320	智能体的运行底座或者框架
38320	39120	你可以这么理解
39120	40320	一个大模型
40320	41760	就像一个聪明的大脑
41760	42800	它会思考
42800	43700	会说话
43700	45400	但是它光有大脑
45400	46900	是没法帮你完成一个
46900	48400	现实世界里的具体任务的
48400	49900	它得有手有脚
49900	51100	得有工具
51100	52100	得有记忆
52100	53300	得有个工作台
53300	55000	这个harness就是给它提供
55000	57940	身体操作系统和工作环境的那一整套东西
57940	60740	DeepSeaKarnes最核心的设计理念叫Everything is a Plugin
60740	62740	翻译过来就是一切皆插件
62740	64740	你用哪个大语言模型可以换
64740	66840	你需要它用什么工具可以换
66840	69640	它的记忆系统存储方式任务调度方法
69640	71740	甚至是用户界面全都可以换
71740	73240	开发者就像搭积木一样
73240	75840	用配置的方式就能把这些能力重新组合起来
75840	77340	而不用动框架本身的代码
77340	79540	这就带来了几个非常突出的优点
79540	81840	第一 开放性和可组合性超级强
81840	84840	比如说一家公司想搞一套自己的内部智能体
84840	87540	又不想被某一家模型公司给绑架
87540	90040	那就可以把不同公司的模型都接进这个Harness里
90040	92640	遇到复杂的推理任务就调用能力最强的那个模型
92640	93940	遇到普通的整理任务
93940	95840	就用一个成本更低的模型
95840	97440	甚至处理一些敏感数据
97440	100340	可以直接用部署在自己服务器上的本地模型
100340	101640	这就非常灵活了
101640	102240	第二
102240	103840	它的运行过程非常透明
103840	105040	它会详细记录下
105040	106640	模型每一步都看到了什么
106640	108040	系统给了它什么指令
108040	109140	它调用了什么工具
109140	111340	又派出了哪个小助手去干活
111340	114740	整个任务过程可以被恢复搜索分叉和重放
114740	116740	这一点对开发者来说太重要了
116740	119140	因为AI智能体最让人头疼的一个问题就是
119140	119940	它要是做错了事
119940	121240	你根本不知道它为什么错
121240	123440	有了这份完整的黑匣子飞行记录
123440	125740	调试评估和审计就都有了依据
125740	126240	第三
126240	128240	它不只提供一种固定的工作模式
128240	130840	它有标准模式适合绝大多数任务
130840	132340	有代码模式
132340	135440	让模型直接写程序来组织复杂的工具调用
135440	137940	还有最小模式只保留最核心的功能
137940	140420	方便测试模型最原始的智能体能力
140420	141860	甚至还有一个Creator模式
141860	144500	专门用来设计新的插件和智能体模板
144500	145860	当然缺点也很明显
145860	147820	DeepSeek Harness更像是一个基础设施
147820	149340	一个给专业人士用的工具包
149340	150700	而不是咱们普通人下载下来
150700	152220	就能直接当办公助手用的
152220	154500	模型怎么选 工具怎么接 权限怎么配
154500	156700	数据怎么存 这些都得你自己来负责
156700	159260	而且它目前还处在开发者预览阶段
159260	161220	接口和插件生态都还在快速变化
161220	162860	所以它最大的价值
162860	165460	不是让你马上扔掉现在的AI助手
165460	168020	而是为那些有开发能力的企业或者团队
168020	170140	提供了一套可控可扩展的
170420	171260	agent底盘
171260	171740	好
171740	174060	说完了需要自己动手组装的底盘
174060	176300	我们再来看一个已经组装好加满油
176300	177700	随时能开的整车
177700	178900	腾讯的workbody
178900	180180	如果说deep-sea carless
180180	181820	是给开发者准备的乐高积木
181820	183420	那workbody就是一辆已经组装好的
183420	184860	设计好所有细节的汽车
184860	186340	它的核心目标非常明确
186340	189260	就是让普通的职场人用一句大白话
189260	191620	就能把一个相对完整的工作任务
191620	192920	交给AI去完成
192920	194080	WorkBuddy强调的是
194080	195020	全场景办公
195020	195880	多专家协作
195880	196720	和开箱即用
196720	198420	你可以用它来搜集资料
198420	199480	做市场调研
199480	200480	分析表格
200480	201580	生成PPT
201580	202880	写内容整理文件
202880	203880	甚至写点代码
203880	205420	你只需要告诉它你的目标
205420	206620	它会自己先去理解
206620	207580	然后把任务拆解
207580	209180	再调用不同领域的专家
209180	209980	并行处理
209980	211420	最后把结果交到你手上
211420	212980	你还可以检查和修改
212980	214020	WorkBuddy最大的优点
214020	215580	首先就是使用门槛极低
215580	216620	你完全不需要懂什么
216620	217220	Python编程
217220	217820	Docker容器
217820	220580	APM要像量数据库这些听起来就头大的词
220580	221900	翻装好之后直接就能用
221900	223660	这对大多数人来说太重要了
223660	225140	因为真正决定生产力的
225140	226740	往往不是理论上限有多高
226740	228540	而是一个工具能不能在10分钟内
228540	229980	就开始帮你创造价值
229980	231860	第二个优点是它对中文办公
231860	233540	和国内生态的适配特别好
233540	235740	它覆盖了Windows和macOS系统
235740	237700	还打通了桌面端主流的
237700	239860	即时通讯工具和微信小程序
239860	242580	无论是写中文报告做PPT处理Excel
242580	244420	还是跟国内企业的沟通场景
244420	245860	Workbody的产品设计
245860	247860	都更贴近我们的日常办公习惯
247860	248860	第三个优点
248860	251460	是它把复杂的多智能体协作
251460	253760	包装成了一个用户能听懂的概念
253760	254960	叫专家团队
254960	257060	你不需要自己去设计什么研究agent
257060	258660	数据agent 协作agent
258660	260360	你只需要描述你的最终目标
260360	262060	系统会自动帮你组织
262060	263860	不同角色的专家来协作
263860	266660	这种把复杂技术藏在产品界面背后的设计
266660	268260	大大降低了用户的理解成本
268260	269560	当然 成品化也意味着
269560	271660	你失去了一部分底层的控制权
271660	273260	你很难像用开源框架那样
273260	275820	完全掌握它内部的每一个运行细节
275820	277100	它的透明度
277100	279140	可定制程度和模型选择的自由度
279140	280740	通常是不如DeepSeek Harness
280740	282700	或者我们接下来要说的Herms Agent的
282700	285060	而且对于一些特别复杂的代码仓库
285060	286380	严格的软件测试任务
286380	289460	WorkBuddy也未必比那些更专业的编码Agent有优势
289460	292020	所以WorkBuddy最适合的是谁呢
292020	294180	就是那些希望马上提升办公效率
294180	296300	但又不愿意投入大量时间去研究
296300	297660	部署和配置系统的人
297660	301100	它的竞争力不在于某一项底层技术有多么领先
301100	305220	而在于它把模型、工具、专家、文件和办公入口
305220	307380	整合成了一个可以直接上手用的产品
307380	309460	接下来我们聊聊一个很有意思的agent
309460	310620	叫做Hermes Agent
310620	313660	它是由一个叫Nunz Research的团队开发的
313660	316340	这个agent最核心的理念跟前面两个都不太一样
316340	318860	它认为一个真正有价值的智能体
318860	320700	不应该每次跟你对话都像第一次见面
320700	323380	而应该在长期的使用中慢慢形成记忆
323380	324620	掌握你的工作习惯
324620	325900	并且把成功的经验
325900	327780	沉淀成可以反复使用的技能
327780	329900	Hermes最大的特点就是闭环学习
329900	331580	它有一套长期记忆系统
331580	332860	可以保存你的个人偏好
332860	334260	项目背景和过去的经验
334260	335780	它还有一个技能系统
335780	338540	可以把一个多步骤的复杂流程
338540	340740	保存成一个可以一键调用的skill
340740	341620	也就是技能
341620	342900	以后再遇到类似的任务
342900	344180	它就不必重新摸索了
344180	345340	而是可以直接调用
345340	346620	已经形成的工作方法
346620	347140	打个比方
347140	348660	这就有点像一个实习生
348660	349940	刚来的时候什么都不会
349940	351020	但你在带他的过程中
351020	351740	他会犯错
351740	352580	你会纠正他
352580	354300	慢慢的他学会了怎么做报告
354300	355140	怎么分析数据
355140	356780	下次再让他做类似的工作
356780	357700	他就能直接上手
357700	358740	甚至做的又快又好
358740	359500	Hermes就是这样
359500	361380	如果他在执行任务时走了弯路
361380	362620	最后找到了正确的方法
362620	363900	或者你纠正了他的做法
363900	364820	他可以把这些经验
364820	365860	写进他的技能库里
365860	367340	所以Hermes的价值
367340	368980	是会随着你使用它的时间
368980	369820	增长而增长的
369820	371660	他不是简单的记住聊天内容
371660	373460	而是在尝试把过去的经验
373460	374660	转化为程序化
374660	376220	可附用的工作流程
376220	377420	Hermes的第二个优点
377420	378900	是模型自由度很高
378900	380700	它可以连接OpenAI
380700	381500	Cloud
381500	382500	Gemini
382500	383500	DeepSeek
383500	385340	Qianwen等各种云端模型
385340	386700	甚至你本地的模型也行
386700	389020	你的长期记忆技能和工作入口
389020	391180	是属于HIMES这个员工本身的
391180	393460	而不是绑定在某一个特定的大模型上
393460	394140	也就是说
394140	396420	你可以随时给这个员工换个大脑
396420	398180	但他已经学会的工作方法还在
398180	399860	第三个优点是它适合
399860	401060	长期在线运行
401060	402620	你可以把它部署在自己的
402620	404620	电脑上或者云端的服务器里
404620	405860	甚至可以通过Telegram
405860	406300	Discord
406300	406660	Slack
406660	407100	WhatsApp
407100	408760	非输 企业微信
408760	410100	这些渠道跟他交互
410100	412340	这意味着就算你人不在电脑前
412340	413900	也可以通过手机给他发个任务
413900	415440	让云端的agent继续帮你工作
415440	417760	他还内置了定时任务和子agent的能力
417760	419500	特别适合用来做周期性的报告
419500	421640	资料搜集 这类长期自动化任务
421640	423640	不过 关于Hermes的自进化
423640	425200	这里有一个非常重要的澄清
425200	427540	他通常不是自己重新训练的一个大语言模型
427540	428940	也不是说用了一段时间之后
428940	431440	模型本身的神经网络权重就自动改变了
431440	432900	他所谓的成长主要发生在
432900	435500	在技能和系统提示这些层面上
435500	437060	它有一个叫Self Evolution
437060	438700	也就是自我进化的项目
438700	440980	会利用执行轨迹和评估数据
440980	442860	来生成和优化技能和提示词
442860	444660	但并不是在修改模型本身
444660	446900	这更接近于是工作流程
446900	448540	和提示系统的迭代
448540	450420	而不是模型的重新训练
450420	451260	这种机制
451260	452300	既是它的优势
452300	453260	也带来了风险
453260	453820	你想想
453820	455860	如果一个agent总结了错误的经验
455860	456780	他也可能把这个错误
456780	457620	写进他的记忆里
457620	459140	如果某一次偶然的特殊情况
459140	460460	被他误认为是普遍规律
460460	462780	那这个错误的流程就可能在以后被反复调用
462780	466500	所以Hermes提供了记忆写入和技能写入的审批机制
466500	469580	比较稳妥的做法是让agent先提出修改建议
469580	471620	然后由人来查看差异并批准
471620	474220	而不是让他完全不受控制的修改自己
474220	475860	这也给我们一个很重要的启发
475860	478740	一个AI的自我改进不能只看他有没有学习能力
478740	480000	还得看他有没有平衡能力
480000	482360	還得看他有沒有評估、回滾、審批和安全邊界
482360	483960	沒有驗證機制的自我學習
483960	486600	可能只是讓他在更有信心的重複錯誤
486600	489080	最後我們來看看OpenAI的Codex
489080	491080	很多人對Codex的印象可能還停留在
491080	492360	他是一個編碼助手
492360	494680	但現在他已經發展成一個由桌面端
494680	497820	命令行 IDE插件和云端环境组成的完整体系了
497820	500280	严格来说 OpenAI 把那些通用的研究
500280	503120	报告 表格 PPT 和文件交付等功能
503120	504960	更多的放在了 ChatGPT Work 里
504960	508560	而 CodeX 仍然以代码 项目 工具和工程执行为核心
508560	511060	当然 这两者的能力正在越来越多地共享
511060	514160	CodeX 最大的优点是它特别强调做完并验证
514160	516200	而不仅仅是给你一些建议
516200	518240	它可以读取你整个项目的文件
518240	521400	搜索代码 修改多个文件 运行命令 执行测试
521400	522480	查看报错信息
522480	524280	然后根据测试结果继续修复问题
524280	526640	最后交付给你的不只是一几段示例代码
526640	528680	而是一个完整的修改摘要
528680	530080	文件差异对比
530080	533160	测试结果以及可以审查的最终成果
533160	534200	第二个优点是
534200	536360	它的工程环境比较完整
536360	537840	你在本地的Codex
537840	539240	可以直接使用你电脑上
539240	540680	已经装好的编译器
540680	542120	测试工具和项目依赖
542120	543160	而云端的Codex
543160	545080	可以为不同的任务建立隔离的环境
545080	547480	让多个任务在后台并行运行
547480	548160	任务完成后
548160	549840	你可以清楚地看到它都改了些什么
551400	554440	或者直接把修改提交到你的代码仓库
554440	555440	第三个优点是
555440	557800	它的权限和安全边界做的比较成熟
557800	560960	Codex通过杀箱来限制它对文件和网络的访问
560960	563960	在执行一些高风险命令或者跨越权限边界的时候
563960	565160	会向你请求批准
565160	567360	这种设计可能会让操作显得有点紧身
567360	569640	但对于一个能够真实修改文件
569640	572440	运行程序和连接外部工具的智能体来说
572440	575040	这种谨慎本身就是可靠性的重要组成部分
575040	578760	第四个优点是它把编码研究和文件交付连接了起来
578760	580760	在ChatGPT Work这个更大的环境里
580760	583260	同一套能力还可以用来生成和检查文档
583260	587060	表格PPT PDF网站和数据分析结果
587060	590560	这意味着一个复杂的任务可以从资料搜集开始
590560	592260	经过分析和程序处理
592260	594160	最后形成可以直接使用的文件
594160	596060	整个流程都可以在一个环境里完成
596060	597960	当然 Codex的局限也很清楚
597960	601760	它主要围绕OpenAI自家的模型和ChatGPT服务来运行
601760	604960	模型的自由度不如Hermes或者DeepSeek Harness
604960	607560	它虽然也支持技能记忆和项目规则
607560	610360	但不会把自动修改自己作为最核心的卖点
610360	611720	它的取向更加保守
611720	614240	宁可让流程可审查可验证
614240	616560	也不轻易让agent自行改变长期规则
616560	616920	好了
616920	618880	现在我们把这四个智能体放在一起
618880	620680	就能得到一个非常清晰的结论了
620680	623080	如果你的目标是开发一个自己的agent产品
623080	625520	那DeepSeek Harness最有吸引力
625520	627560	因为它开放 模块化
627560	628840	运行过程可追速
628840	630440	如果你的目标是普通办公人员
630440	631560	想马上提高效率
631560	632640	那Workbody最方便
632640	635440	因为它把复杂的技术包装成了开箱即用的成品
635440	637800	如果你的目标是培养一个能长期在线
637800	640000	逐渐熟悉你个人工作方式的智能体
640000	641640	那Hermes最有特色
641640	643480	如果你的目标是完成复杂的代码
643480	645960	工具执行和需要严格验证的专业任务
645960	647920	那Codex的综合完成度更高
647920	651600	你看他们代表的其实是四条完全不同的路线
651600	653960	DeepSeek Harness追求的是架构上的自由
653960	655920	WorkBuddy追求的是使用的便利
655920	657960	Hermes追求的是长期的成长
657960	660200	而Codex追求的是可靠的交付
660200	660880	聊到这里
660880	663080	还有三点特别值得我们进一步思考
663080	663720	第一
663720	665040	未来agent的竞争
665040	666700	绝对不会只发生在模型层面
666700	668040	模型当然很重要
668040	669440	它决定了智力的上限
669440	670940	但真正决定这个智能体
670940	672900	能不能稳定落地完成实际工作的
672900	674940	是模型之外的那个Harness
674940	676100	也就是它的运行底座
676100	677100	它能用什么工具
677100	678440	能访问哪些文件
678440	679200	怎么记忆
679200	680280	怎么调度任务
680280	681380	出错了能不能恢复
681380	683080	以及我们作为使用者
683080	685040	能不能看清它到底都做了什么
685040	686340	这些才是关键
686340	686800	第二
686800	688480	我们刚才聊到的所谓自进化
688480	690600	绝对不能脱离一个有效的评估系统
690600	692440	一个agent能够修改自己的技能
692440	694100	并不等于它一定会变得更好
694100	695440	真正有效的自我改进
695440	697440	至少需要完整的执行记录
697440	698500	客观的测试数据
698500	700700	效果比较机智必要的人类审批
700700	702300	以及出错了能回滚的方案
702300	704700	否则它可能只是在更有信心的
704700	706500	把你最初交给它的那个错误
706500	708300	一遍又一遍的固化下来
708300	709840	第三 最好的agent
709840	710940	不一定是最自主的agent
710940	713340	对于很多低风险的重复性的任务
713340	714340	高程度的自动化
714340	715840	确实能节省大量时间
715840	719000	但是当涉及到付款 删除文件
719000	721200	发布公开内容 修改正式代码
721200	723440	或者处理敏感数据这些关键操作时
723440	725760	一个能够暂停下来向你解释情况
725760	726960	并等待你确认的agent
726960	729840	它的价值其实远远高于一个完全自主
729840	731160	从不请示的agent
731160	732560	一个成熟的智能体系统
732560	734240	不是要取消人的判断
734240	735800	而是要把人的判断
735800	738200	集中到那些最关键的节点上
738200	739920	最后我们来总结一下今天的内容
739920	741000	DeepSake Harness
741000	744360	最适合作为构建自有agent系统的开放底座
744360	746320	腾讯的WorkBuddy最省事
746320	748920	适合想直接进入日常办公场景的用户
748920	750640	Hermes Agent最像一个会积累
750640	752640	记忆和技能的长期AI员工
752640	754040	而OpenAI的Codex
754040	755800	则最擅长把复杂的专业工作
755800	756640	真正做完
756640	758120	并进行严格的验证
758120	758920	所以
758920	760080	下次你在选择的时候
760080	761560	不要只问谁最强
761560	763440	而要问自己三个更具体的问题
763440	763960	第一
763960	765360	我需要的是一个成品工具
765360	766880	还是一个可以自己开发的框架
766880	767320	第二
767320	768480	我更看重的是
768480	770000	即时的效率提升
770000	771560	还是长期的成长和陪伴
771560	772320	第三
772320	775160	我是否需要掌握对模型
775160	776120	数据
776120	778360	权限和运行环境的控制权
778360	779960	当你把这三个问题想清楚之后
779960	781960	这死者之间的选择就一点都不模糊了
781960	783160	他们不是简单的
783160	784600	谁替代谁的关系
784600	787560	而是分别服务于不同层级不同需求的
787560	789120	未来更常见的情况
789120	790720	可能也不是某一个超级agent
790720	791680	包揽所有工作
791680	793800	而是像今天聊到的成品办公agent
793800	794720	专业工程agent
794720	796720	长期个人agent和企业资金底座
796720	797720	他们相互配合
797720	799680	共同组成一个真正好用的
799680	800680	AI工作系统
