實際影片長度:9:57.000。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:02.300
zh本来前天好好休息了一下
0:02.300–0:03.820
zh黑眼圈都有所缓解
0:03.820–0:05.960
zh但是DeepSickV4又发布了
0:05.960–0:06.980
zh我又不得不熬夜
0:06.980–0:10.100
zh因为我的中英文频道都必须立刻更新
0:10.100–0:14.000
zh这个热点话题是任何做科技话题的博主都不愿意错过的
0:14.000–0:15.780
zh于是加紧测试了一下
0:15.780–0:17.320
zh那么凌晨发完英语视频
0:17.320–0:20.340
zh我又把这个Hermes接入V4 Flash给测试了一下
0:20.340–0:21.940
zh体验真的是非常好
0:21.940–0:24.380
zh所以提起精神赶紧发一些视频
0:24.380–0:27.560
zh要休息的话就只有的脑五一一放松一下了
0:27.560–0:29.700
zh可能要把英语频道给停一下
0:29.700–0:31.980
zh那么首先就是版本
0:31.980–0:35.060
zhDeepSickV4分为Flash和Pro两个版本
0:35.060–0:38.080
zh前者就是之前一直传说的Vslite版本
0:38.080–0:38.760
zh轻量版
0:38.760–0:40.380
zh284B参数
0:40.380–0:41.260
zhMOE架构
0:41.260–0:42.560
zh推理时激活16B
0:42.560–0:44.380
zh那么全量版也就是Pro
0:44.380–0:45.520
zh1.68T参数
0:45.520–0:46.980
zh也是MOE架构
0:46.980–0:48.740
zh推理时激活38B参数
0:48.740–0:50.580
zh两个模型都是一照上下文
0:50.580–0:52.900
zh那么Flash版本的API价格大概是
0:52.900–0:54.580
zhDeepSickV3.2的一半
0:54.580–0:56.140
zh甚至可能更便宜一点
0:56.140–0:57.400
zh性能是大幅提升
0:57.400–0:59.380
zh那么Pro版本的价格是
0:59.380–1:00.660
zhFlash价格的十几倍
1:00.660–1:03.100
zh但是仍然比GPT Cloud便宜很多
1:03.100–1:05.660
zh我个人认为性价比并不是很高
1:05.660–1:08.380
zh因为DeepSick我们用的一般都是
1:08.380–1:10.140
zh搞技术的一般都是批量用
1:10.140–1:13.660
zh那么社区已经被V4 Flash给刷屏
1:13.660–1:14.660
zh生产了一报表
1:14.660–1:16.380
zh然后性价比是真相
1:16.380–1:18.060
zh无论是编程还是Agent的调用
1:18.060–1:19.220
zh都是非常的顶
1:19.220–1:21.460
zh好分方面大家参照媒体报道即可
1:21.460–1:22.820
zh总之都是顶级的水准
1:22.820–1:25.380
zh跟美国的商业模型是互有胜负
1:25.380–1:26.540
zh某些方面略差一点
1:26.540–1:27.820
zh某些方面又领先一点
1:27.820–1:29.540
zh但是DeepSickV3.1上下文
1:29.540–1:31.940
zh召回成功率超过97%
1:31.940–1:33.580
zh是真正可用的生产力
1:33.580–1:37.100
zhCloud和GPT一旦上下文超过256K
1:37.100–1:39.660
zh召回准区率会跌到70%甚至50%
1:39.660–1:41.900
zh尤其是Cloud的4.7版本
1:41.900–1:43.780
zh最近可以说是差评如潮
1:43.780–1:46.340
zh他们虽然是标称两兆上下文
1:46.340–1:48.500
zh但是实际生产是非常的拉垮
1:48.500–1:49.940
zh关于Cloud的刷分
1:49.940–1:51.340
zh生产力体验降级的事
1:51.340–1:52.900
zh我会在其他视频里详聊
1:52.900–1:54.260
zh这里就一笔带过
1:54.260–1:56.540
zh毕竟本期视频的主角是DeepSickV4
1:56.540–1:59.020
zh下面我们直接上测评项目
1:59.020–1:59.740
zh老规矩
1:59.740–2:01.500
zh还是让它生成网页
2:01.500–2:02.900
zh表达中国的传统八卦
2:02.900–2:05.140
zh我们看到全量版和轻量版
2:05.140–2:06.260
zh生成的都不错
2:06.260–2:08.660
zh由于这个截图没有办法展示动态效果
2:08.660–2:10.140
zh大家就测课着看
2:10.140–2:11.860
zh我如果录屏的话
2:11.860–2:13.700
zh视频生产成本就比较高了
2:13.700–2:14.900
zh有点不太划算
2:14.900–2:16.940
zh它是带动态特效的
2:16.940–2:19.140
zh点击之后能够显示出对应的解释
2:19.140–2:20.660
zh刷新到显示区域
2:20.660–2:23.260
zh我个人认为轻量版的审美更加接近我
2:23.260–2:24.980
zh事实上这个Flash版本
2:24.980–2:26.860
zh在我测试的所有项目中
2:26.860–2:28.420
zh都表现得更好更快
2:28.420–2:30.620
zh它比这个1.6T Pro版本
2:30.620–2:31.940
zh可能主要的差距在
2:31.940–2:33.540
zh知识面的深度跟广度上
2:33.540–2:34.620
zh在干活的场景中
2:34.620–2:35.700
zh就是我们这种搞技术
2:35.700–2:37.020
zh携带马拉波Edgington
2:37.020–2:38.580
zh它或许确实是更好的
2:38.660–2:41.060
zh我昨天的视频里详细展示了
2:41.060–2:42.300
zh各种模型的生成效果
2:42.300–2:43.220
zh如果有要对比的
2:43.220–2:44.660
zh可以去看一下上期的视频
2:44.660–2:47.060
zh自己翻看一下其他模型是什么样子
2:48.820–2:49.460
zh那么接下来
2:49.460–2:51.820
zh我让它生成土机熔岩队的运行原理图
2:51.820–2:53.660
zh我们看到Pro版生成的图片
2:53.660–2:55.340
zh还是标准的
2:55.340–2:55.820
zh正确的
2:55.820–2:56.900
zh审美了也在线
2:56.900–2:57.900
zh但是很明显
2:57.900–2:59.620
zh这一轮又是Flash版本胜出
2:59.620–3:02.420
zh它的构图配色更加符合我的审美需求
3:02.700–3:03.420
zh不过必须说
3:03.420–3:05.860
zh它们都没有小米的Memo画的好
3:05.860–3:07.580
zhSVG5我认为画的很准确
3:07.580–3:08.780
zh但是缺乏温度
3:08.780–3:09.740
zh小米的Memo
3:09.740–3:10.780
zh它的轻量版
3:10.780–3:12.500
zh相对Rain就温度值更高
3:12.500–3:13.580
zh更有创造力
3:13.980–3:14.180
zh
3:14.180–3:16.020
zh接下来我们让它生成SVG图像
3:16.020–3:17.700
zh表达薛定谔的猫思想实验
3:17.700–3:19.100
zh那么旗带版的效果
3:19.100–3:20.620
zh还是非常的老成直重
3:20.780–3:21.500
zh就是画对了
3:21.500–3:22.780
zh但是一点都不经验
3:22.940–3:24.700
zh那么Flash版本则是相对Rain
3:24.700–3:26.060
zh在审美上再度领先
3:26.060–3:28.140
zh但是和小米一样
3:28.140–3:30.460
zh它们都没有全两版表达的清晰
3:30.780–3:32.060
zh总之在这个写代码
3:32.060–3:34.100
zh绘图这个网页聊天框的基本测试中
3:34.100–3:35.260
zh我认为Dipsic V4
3:35.500–3:36.860
zh具备了顶级模型的能力
3:36.860–3:37.980
zh代码质量也挺好
3:37.980–3:39.100
zh但是放在顶级模型
3:39.100–3:40.300
zh密集发布的今天
3:40.380–3:42.700
zh这确实算不上什么让人惊喜的表现
3:42.780–3:44.220
zh哪怕是比起轻温3.6
3:44.220–3:45.340
zh这样的本地小模型
3:45.580–3:47.460
zh它也没有什么特别明显的优势
3:48.020–3:49.980
zh但是当我们把它接入Hermis之后
3:49.980–3:51.740
zh它的生产力立刻就体现出来了
3:51.740–3:54.220
zh首先就是任务的执行成功率非常高
3:54.220–3:56.300
zh那么我昨天晚上的几十轮对话中
3:56.300–3:58.700
zh它执行浏览期任务没有一次是失败的
3:58.860–4:00.300
zh这是我第一次遇到
4:00.860–4:02.660
zh我的这个Hermis是原装活
4:02.660–4:04.620
zh没有对它进行任何的设置优化
4:04.620–4:06.860
zh安装任何插件或者skills
4:06.860–4:09.020
zh我就是通过一条自动安装的命令
4:09.020–4:10.460
zh就直接执行完毕了
4:10.860–4:12.860
zh那么我唯一的配置选项就是
4:12.860–4:14.140
zh设置了AI模型
4:14.140–4:15.860
zh然后本地接入了清晰3.6
4:15.860–4:17.820
zh云端接入了Deepseek Chat
4:17.820–4:19.180
zh也就是V4Flash
4:19.180–4:22.860
zh那么我在这个中端让他整理特朗普的最新动态
4:22.860–4:23.820
zh他轻松就搞定了
4:23.820–4:26.060
zh完全不会像OpenCloud那样消极代工
4:26.060–4:27.980
zh给出的结果也是非常准确的
4:27.980–4:30.140
zh那么时间的响应也非常的快
4:30.140–4:31.820
zh让他整理NBI的战报
4:31.820–4:33.260
zh他很快就能给出正确的答案
4:33.260–4:34.540
zh因为我没有配置梯子
4:34.540–4:36.380
zh他默认掉我的工具是谷歌新闻
4:36.380–4:38.780
zh还有其他的新闻RSS聚合
4:38.780–4:40.060
zh他都失效了
4:40.060–4:42.820
zh然后这个清晰3.627币会告诉我
4:42.820–4:43.420
zh他做不到
4:43.420–4:44.700
zh他尝试解释会失败
4:44.700–4:48.380
zh我就提示他使用CURL进行尝试
4:48.380–4:49.340
zh继续尝试
4:49.340–4:50.780
zh那么他最终还是会完成任务
4:50.780–4:51.820
zh但是要折腾一下
4:51.820–4:53.020
zh那么Deepseek V4
4:53.020–4:54.380
zh他是直接就成功了
4:54.860–4:58.380
zh有可能他从昨天的执行记录中
4:58.380–5:00.380
zh他可能读取了一点东西
5:00.380–5:02.940
zh因为昨天我把Hermis给重装了
5:02.940–5:05.980
zh然后这个先用的是清闻3.6跑了一遍
5:05.980–5:07.660
zh就跑了几个简单的小任务
5:07.660–5:10.660
zh那么他来尝试访问谷歌等外网工具
5:10.660–5:12.140
zh失败之后会立刻做出调整
5:12.140–5:14.780
zh用CURL从国内网站获取信息
5:14.780–5:15.660
zh并且加以整理
5:15.660–5:17.940
zh而且整理的结果是非常正确的
5:17.940–5:19.540
zh如果让他查询天启
5:19.540–5:20.660
zh这样简单的小任务
5:20.660–5:22.780
zh那么他查过一次之后
5:22.780–5:24.020
zh就完全记得这个工具了
5:24.020–5:24.940
zh我再次跟他聊天
5:24.940–5:25.820
zh他就是秒返回
5:25.820–5:26.860
zh总之呢
5:26.860–5:28.580
zh他执行浏览器任务是非常的轻松
5:28.580–5:30.780
zh未来我会加入更多深度的测试
5:30.780–5:32.500
zh我是非常喜欢Hermis的
5:32.500–5:33.900
zh他是基于Python
5:33.900–5:35.180
zh天然适配AI架构
5:35.180–5:36.340
zh因为我们的AI程序
5:36.340–5:38.700
zhAI框架基本上都是基于Python的
5:38.700–5:41.460
zh他比起使用Rod.js的OpenCloud
5:41.460–5:42.300
zh要更加的稳定
5:42.300–5:43.860
zh因为不需要使用混合架构
5:43.860–5:46.780
zh那么他的中单交互体验是非常好的
5:46.780–5:48.660
zh审美也是长在了我的点上
5:48.660–5:50.860
zh但是我还是给他安上电报
5:50.860–5:52.900
zh不然本期视频就显得不那么完整
5:52.900–5:55.140
zh因为很多人他只要一搞Agent
5:55.140–5:56.580
zh他就你怎么不安电报
5:56.580–5:57.340
zh怎么不接微信
5:57.340–5:59.660
zh我们不争论就把它接上
5:59.660–5:59.900
zh好吧
5:59.900–6:02.380
zh我们先给Ubuntu搭个梯子
6:02.380–6:04.100
zh科学上网环境大家自己搞定
6:04.100–6:05.380
zh那么搭建好之后
6:05.380–6:06.900
zh给这个中端加上环境变量
6:06.900–6:09.100
zh因为中端默认是不走梯子的
6:09.100–6:10.220
zh这里需要注意
6:10.220–6:10.980
zh设置好之后
6:10.980–6:12.740
zh要让这个Hermis自己测试一下
6:12.740–6:13.780
zh他很快就会回复
6:13.780–6:14.420
zh经过测试
6:14.420–6:16.180
zh网络环境已经是正常的
6:16.180–6:18.020
zh然后我就测试一辆新闻聚合
6:18.020–6:19.900
zh他回复就比没有梯子的时候
6:19.900–6:21.180
zh要好很多快很多
6:21.180–6:23.580
zh那么Hermis它毕竟是个国外的开源软件
6:23.580–6:25.860
zh它的很多生态是基于国际互联网的
6:25.860–6:27.300
zh大家如果想要玩的爽的话
6:27.300–6:29.340
zh尽量还是要搞好科学上网的环境
6:29.340–6:32.020
zh接下来我就问他如何配置电报
6:32.020–6:33.660
zh他给我提供了几个解决方案
6:33.660–6:36.060
zh我的选择是把我的电报机器人
6:36.060–6:36.700
zhToken复制
6:36.700–6:37.460
zh发给Hermis
6:37.460–6:38.220
zh让他自己配置
6:38.220–6:39.420
zh过程也非常简单
6:39.420–6:41.500
zh找这个电报的Boot Fuzz聊天
6:41.500–6:42.380
zh新建一个机器人
6:42.380–6:43.260
zh然后生成Token
6:43.260–6:45.180
zh复制粘贴到Hermis的聊天框
6:45.180–6:45.660
zh发给他
6:45.660–6:47.100
zh他自己很快就会配置成功
6:47.100–6:50.460
zh其他需要你给这个机器人
6:50.460–6:51.300
zh发一个测试信息
6:51.300–6:52.580
zh整个过程就是这么简单
6:52.580–6:55.180
zh很快我就在这个电报上和Hermis聊天了
6:55.180–6:57.900
zh这个体验真的是比OpenColor要好太多
6:57.900–6:59.540
zh好处一个量级都不止
6:59.540–7:01.220
zh这个提升是非常明显的
7:01.220–7:03.120
zh我打招呼之后
7:03.120–7:03.820
zh他叫我小特
7:03.820–7:04.620
zh我说你搞错了
7:04.620–7:05.140
zh我是老特
7:05.140–7:05.780
zh我是你爹
7:05.780–7:07.420
zh他立刻就记录了自己的身份
7:07.420–7:09.820
zh并且在以后的对话中保持这种关系
7:09.820–7:11.640
zh我通过电报发消息
7:11.640–7:14.260
zh和在终端聊天是一样方便的
7:14.260–7:15.560
zh他也非常的稳定
7:15.560–7:17.220
zh那么他也可以接触微信
7:17.220–7:18.140
zh也是挺方便的
7:18.140–7:19.340
zh但是我喜欢电报
7:19.340–7:21.900
zh用微信总有一种会被人窥视的感觉
7:21.900–7:25.380
zh我让他汇总一下网络上对于DeepSeek V4的评价
7:25.380–7:27.480
zh他的整理也是非常的到位
7:27.480–7:28.720
zh总之就是体验非常的好
7:28.720–7:29.360
zh非常的稳定
7:29.360–7:32.720
zh响应速度比起之前用OpenColor来说还是要好很多
7:32.720–7:36.520
zh那么一来这软件本身的效率确实要更高
7:36.520–7:38.940
zh它的设计它的架构本身要更好
7:38.940–7:41.540
zh二来就是这个DeepSeek V4 Flush
7:41.540–7:43.120
zh它的响应速度也确实是非常的快
7:43.120–7:45.040
zh以往测试OpenColor
7:45.040–7:48.060
zh我这样玩一玩大概一天需要89块钱
7:48.060–7:50.860
zh但是V4比起V3年要便宜了一半
7:50.860–7:52.580
zh应该是4块钱左右
7:52.580–7:54.340
zh我是去后台看了一下
7:54.340–7:56.620
zh不过这个Hermes本身
7:56.620–7:58.680
zh它也比这个OpenColor要更加节约一点
7:58.680–8:00.680
zh因此3块钱不到吧
8:00.680–8:02.640
zh但是即便如此便宜
8:02.640–8:05.260
zh即便是全世界顶级模型中最便宜的
8:05.260–8:07.120
zh我们也不能用它来重度生产
8:07.120–8:09.480
zh因为如果说你跑A期间的话
8:09.480–8:11.960
zh你干一天200块钱那是轻啊一举的事
8:11.960–8:13.380
zh我现在给你们跑的这些任务
8:13.380–8:14.460
zh都是非常傻逼的
8:14.460–8:15.100
zh非常简单的
8:15.100–8:16.440
zh一些日常用的小任务
8:16.440–8:18.140
zh主要是为了测试这个模型的智力
8:18.140–8:21.020
zh包括这个框架本身啊就是它的执行能力如何
8:21.020–8:22.900
zh就是它是不能用来干重活的
8:22.900–8:25.100
zh干重活几百块钱一天是绝对打不住的
8:25.100–8:28.280
zh所以说这个主力未来还是这个轻温3.6
8:28.280–8:29.780
zh27比稠米模型
8:29.780–8:31.140
zh昨天我也测试了
8:31.140–8:34.080
zh它的效果其实比这个V4幅拉西并不差多少
8:34.080–8:35.080
zh其实是非常好的
8:35.080–8:38.080
zh那么毕竟我这个409048G啊
8:38.080–8:39.960
zh这个几万块钱的卡也不能白买
8:39.960–8:41.700
zh是不是28,500金东上买的
8:41.700–8:43.580
zh要充分压了它的价值
8:43.580–8:45.740
zh最后说一下这个Agent呢
8:45.740–8:47.920
zh要具备什么能力才值得我们去折腾啊
8:47.920–8:49.340
zh所谓的本地生产力
8:49.340–8:50.020
zh第一呢
8:50.020–8:51.840
zh它一定要能够自主操控浏览器
8:51.840–8:52.420
enPlayRide
8:52.420–8:53.680
zhCurl等这个工具
8:53.680–8:56.180
zh访问互联网获取信息或者执行任务
8:56.180–8:58.640
zh那么这样就等于给大模型增加了眼镜
8:58.640–9:00.280
zh因为它可以自主获取信息
9:00.280–9:01.180
zh不需要你去干预
9:01.180–9:03.340
zh那么另外它最起码要做到
9:03.340–9:04.960
zh能够自我更新配置不崩溃
9:04.960–9:06.940
zh这是考验它的命令行执行能力
9:06.940–9:08.580
zh系统全线配置
9:08.580–9:10.900
zh我们所有的复杂任务
9:10.900–9:12.680
zh最终都是要靠这个命令行来解决
9:12.680–9:14.020
zh时髦一点的话来说就是
9:14.020–9:15.420
enCli Everything
9:15.420–9:17.900
zh这就相当于给大模型安装了合格的手
9:17.900–9:19.320
zh这个手还能够自我修复
9:19.320–9:21.160
zh那么第三就是要能够在
9:21.160–9:24.220
zh过往的任务中进行经验教训的总结
9:24.220–9:25.160
zh生成Skills
9:25.160–9:27.820
zh因为如果你是去安装Skills
9:27.820–9:28.980
zh这是没有尽头的事情
9:28.980–9:31.240
zhAgent必须要能够自己生成改进
9:31.240–9:33.320
zh才能真正解放人类成为生产力工具
9:33.320–9:36.120
zh当然现在只是小玩一玩
9:36.120–9:37.300
zh我五一休息一下
9:37.300–9:38.260
zh深入测试一下它
9:38.260–9:39.840
zh那么以后我的Agent的路线就是
9:39.840–9:42.180
zh轻微3.6加上Deepseek V4 Flush
9:42.180–9:44.420
zh主要是这个浏览器操作维护音视频
9:44.420–9:46.580
zh画图的批量生产脚本
9:46.580–9:48.460
zh我是第一次感觉到
9:48.460–9:50.380
zh本地Agent有可能从玩具
9:50.380–9:52.220
zh转变为真正实用的工具
9:52.220–9:54.100
zh能够真正成为我们的助手
9:54.100–9:55.760
zh那么本期视频就到这里
9:55.760–9:56.560
zh我们下期再见
0:00.000–0:02.300
本来前天好好休息了一下
0:02.300–0:03.820
黑眼圈都有所缓解
0:03.820–0:05.960
但是DeepSickV4又发布了
0:05.960–0:06.980
我又不得不熬夜
0:06.980–0:10.100
因为我的中英文频道都必须立刻更新
0:10.100–0:14.000
这个热点话题是任何做科技话题的博主都不愿意错过的
0:14.000–0:15.780
于是加紧测试了一下
0:15.780–0:17.320
那么凌晨发完英语视频
0:17.320–0:20.340
我又把这个Hermes接入V4 Flash给测试了一下
0:20.340–0:21.940
体验真的是非常好
0:21.940–0:24.380
所以提起精神赶紧发一些视频
0:24.380–0:27.560
要休息的话就只有的脑五一一放松一下了
0:27.560–0:29.700
可能要把英语频道给停一下
0:29.700–0:31.980
那么首先就是版本
0:31.980–0:35.060
DeepSickV4分为Flash和Pro两个版本
0:35.060–0:38.080
前者就是之前一直传说的Vslite版本
0:38.080–0:38.760
轻量版
0:38.760–0:40.380
284B参数
0:40.380–0:41.260
MOE架构
0:41.260–0:42.560
推理时激活16B
0:42.560–0:44.380
那么全量版也就是Pro
0:44.380–0:45.520
1.68T参数
0:45.520–0:46.980
也是MOE架构
0:46.980–0:48.740
推理时激活38B参数
0:48.740–0:50.580
两个模型都是一照上下文
0:50.580–0:52.900
那么Flash版本的API价格大概是
0:52.900–0:54.580
DeepSickV3.2的一半
0:54.580–0:56.140
甚至可能更便宜一点
0:56.140–0:57.400
性能是大幅提升
0:57.400–0:59.380
那么Pro版本的价格是
0:59.380–1:00.660
Flash价格的十几倍
1:00.660–1:03.100
但是仍然比GPT Cloud便宜很多
1:03.100–1:05.660
我个人认为性价比并不是很高
1:05.660–1:08.380
因为DeepSick我们用的一般都是
1:08.380–1:10.140
搞技术的一般都是批量用
1:10.140–1:13.660
那么社区已经被V4 Flash给刷屏
1:13.660–1:14.660
生产了一报表
1:14.660–1:16.380
然后性价比是真相
1:16.380–1:18.060
无论是编程还是Agent的调用
1:18.060–1:19.220
都是非常的顶
1:19.220–1:21.460
好分方面大家参照媒体报道即可
1:21.460–1:22.820
总之都是顶级的水准
1:22.820–1:25.380
跟美国的商业模型是互有胜负
1:25.380–1:26.540
某些方面略差一点
1:26.540–1:27.820
某些方面又领先一点
1:27.820–1:29.540
但是DeepSickV3.1上下文
1:29.540–1:31.940
召回成功率超过97%
1:31.940–1:33.580
是真正可用的生产力
1:33.580–1:37.100
Cloud和GPT一旦上下文超过256K
1:37.100–1:39.660
召回准区率会跌到70%甚至50%
1:39.660–1:41.900
尤其是Cloud的4.7版本
1:41.900–1:43.780
最近可以说是差评如潮
1:43.780–1:46.340
他们虽然是标称两兆上下文
1:46.340–1:48.500
但是实际生产是非常的拉垮
1:48.500–1:49.940
关于Cloud的刷分
1:49.940–1:51.340
生产力体验降级的事
1:51.340–1:52.900
我会在其他视频里详聊
1:52.900–1:54.260
这里就一笔带过
1:54.260–1:56.540
毕竟本期视频的主角是DeepSickV4
1:56.540–1:59.020
下面我们直接上测评项目
1:59.020–1:59.740
老规矩
1:59.740–2:01.500
还是让它生成网页
2:01.500–2:02.900
表达中国的传统八卦
2:02.900–2:05.140
我们看到全量版和轻量版
2:05.140–2:06.260
生成的都不错
2:06.260–2:08.660
由于这个截图没有办法展示动态效果
2:08.660–2:10.140
大家就测课着看
2:10.140–2:11.860
我如果录屏的话
2:11.860–2:13.700
视频生产成本就比较高了
2:13.700–2:14.900
有点不太划算
2:14.900–2:16.940
它是带动态特效的
2:16.940–2:19.140
点击之后能够显示出对应的解释
2:19.140–2:20.660
刷新到显示区域
2:20.660–2:23.260
我个人认为轻量版的审美更加接近我
2:23.260–2:24.980
事实上这个Flash版本
2:24.980–2:26.860
在我测试的所有项目中
2:26.860–2:28.420
都表现得更好更快
2:28.420–2:30.620
它比这个1.6T Pro版本
2:30.620–2:31.940
可能主要的差距在
2:31.940–2:33.540
知识面的深度跟广度上
2:33.540–2:34.620
在干活的场景中
2:34.620–2:35.700
就是我们这种搞技术
2:35.700–2:37.020
携带马拉波Edgington
2:37.020–2:38.580
它或许确实是更好的
2:38.660–2:41.060
我昨天的视频里详细展示了
2:41.060–2:42.300
各种模型的生成效果
2:42.300–2:43.220
如果有要对比的
2:43.220–2:44.660
可以去看一下上期的视频
2:44.660–2:47.060
自己翻看一下其他模型是什么样子
2:48.820–2:49.460
那么接下来
2:49.460–2:51.820
我让它生成土机熔岩队的运行原理图
2:51.820–2:53.660
我们看到Pro版生成的图片
2:53.660–2:55.340
还是标准的
2:55.340–2:55.820
正确的
2:55.820–2:56.900
审美了也在线
2:56.900–2:57.900
但是很明显
2:57.900–2:59.620
这一轮又是Flash版本胜出
2:59.620–3:02.420
它的构图配色更加符合我的审美需求
3:02.700–3:03.420
不过必须说
3:03.420–3:05.860
它们都没有小米的Memo画的好
3:05.860–3:07.580
SVG5我认为画的很准确
3:07.580–3:08.780
但是缺乏温度
3:08.780–3:09.740
小米的Memo
3:09.740–3:10.780
它的轻量版
3:10.780–3:12.500
相对Rain就温度值更高
3:12.500–3:13.580
更有创造力
3:13.980–3:14.180
3:14.180–3:16.020
接下来我们让它生成SVG图像
3:16.020–3:17.700
表达薛定谔的猫思想实验
3:17.700–3:19.100
那么旗带版的效果
3:19.100–3:20.620
还是非常的老成直重
3:20.780–3:21.500
就是画对了
3:21.500–3:22.780
但是一点都不经验
3:22.940–3:24.700
那么Flash版本则是相对Rain
3:24.700–3:26.060
在审美上再度领先
3:26.060–3:28.140
但是和小米一样
3:28.140–3:30.460
它们都没有全两版表达的清晰
3:30.780–3:32.060
总之在这个写代码
3:32.060–3:34.100
绘图这个网页聊天框的基本测试中
3:34.100–3:35.260
我认为Dipsic V4
3:35.500–3:36.860
具备了顶级模型的能力
3:36.860–3:37.980
代码质量也挺好
3:37.980–3:39.100
但是放在顶级模型
3:39.100–3:40.300
密集发布的今天
3:40.380–3:42.700
这确实算不上什么让人惊喜的表现
3:42.780–3:44.220
哪怕是比起轻温3.6
3:44.220–3:45.340
这样的本地小模型
3:45.580–3:47.460
它也没有什么特别明显的优势
3:48.020–3:49.980
但是当我们把它接入Hermis之后
3:49.980–3:51.740
它的生产力立刻就体现出来了
3:51.740–3:54.220
首先就是任务的执行成功率非常高
3:54.220–3:56.300
那么我昨天晚上的几十轮对话中
3:56.300–3:58.700
它执行浏览期任务没有一次是失败的
3:58.860–4:00.300
这是我第一次遇到
4:00.860–4:02.660
我的这个Hermis是原装活
4:02.660–4:04.620
没有对它进行任何的设置优化
4:04.620–4:06.860
安装任何插件或者skills
4:06.860–4:09.020
我就是通过一条自动安装的命令
4:09.020–4:10.460
就直接执行完毕了
4:10.860–4:12.860
那么我唯一的配置选项就是
4:12.860–4:14.140
设置了AI模型
4:14.140–4:15.860
然后本地接入了清晰3.6
4:15.860–4:17.820
云端接入了Deepseek Chat
4:17.820–4:19.180
也就是V4Flash
4:19.180–4:22.860
那么我在这个中端让他整理特朗普的最新动态
4:22.860–4:23.820
他轻松就搞定了
4:23.820–4:26.060
完全不会像OpenCloud那样消极代工
4:26.060–4:27.980
给出的结果也是非常准确的
4:27.980–4:30.140
那么时间的响应也非常的快
4:30.140–4:31.820
让他整理NBI的战报
4:31.820–4:33.260
他很快就能给出正确的答案
4:33.260–4:34.540
因为我没有配置梯子
4:34.540–4:36.380
他默认掉我的工具是谷歌新闻
4:36.380–4:38.780
还有其他的新闻RSS聚合
4:38.780–4:40.060
他都失效了
4:40.060–4:42.820
然后这个清晰3.627币会告诉我
4:42.820–4:43.420
他做不到
4:43.420–4:44.700
他尝试解释会失败
4:44.700–4:48.380
我就提示他使用CURL进行尝试
4:48.380–4:49.340
继续尝试
4:49.340–4:50.780
那么他最终还是会完成任务
4:50.780–4:51.820
但是要折腾一下
4:51.820–4:53.020
那么Deepseek V4
4:53.020–4:54.380
他是直接就成功了
4:54.860–4:58.380
有可能他从昨天的执行记录中
4:58.380–5:00.380
他可能读取了一点东西
5:00.380–5:02.940
因为昨天我把Hermis给重装了
5:02.940–5:05.980
然后这个先用的是清闻3.6跑了一遍
5:05.980–5:07.660
就跑了几个简单的小任务
5:07.660–5:10.660
那么他来尝试访问谷歌等外网工具
5:10.660–5:12.140
失败之后会立刻做出调整
5:12.140–5:14.780
用CURL从国内网站获取信息
5:14.780–5:15.660
并且加以整理
5:15.660–5:17.940
而且整理的结果是非常正确的
5:17.940–5:19.540
如果让他查询天启
5:19.540–5:20.660
这样简单的小任务
5:20.660–5:22.780
那么他查过一次之后
5:22.780–5:24.020
就完全记得这个工具了
5:24.020–5:24.940
我再次跟他聊天
5:24.940–5:25.820
他就是秒返回
5:25.820–5:26.860
总之呢
5:26.860–5:28.580
他执行浏览器任务是非常的轻松
5:28.580–5:30.780
未来我会加入更多深度的测试
5:30.780–5:32.500
我是非常喜欢Hermis的
5:32.500–5:33.900
他是基于Python
5:33.900–5:35.180
天然适配AI架构
5:35.180–5:36.340
因为我们的AI程序
5:36.340–5:38.700
AI框架基本上都是基于Python的
5:38.700–5:41.460
他比起使用Rod.js的OpenCloud
5:41.460–5:42.300
要更加的稳定
5:42.300–5:43.860
因为不需要使用混合架构
5:43.860–5:46.780
那么他的中单交互体验是非常好的
5:46.780–5:48.660
审美也是长在了我的点上
5:48.660–5:50.860
但是我还是给他安上电报
5:50.860–5:52.900
不然本期视频就显得不那么完整
5:52.900–5:55.140
因为很多人他只要一搞Agent
5:55.140–5:56.580
他就你怎么不安电报
5:56.580–5:57.340
怎么不接微信
5:57.340–5:59.660
我们不争论就把它接上
5:59.660–5:59.900
好吧
5:59.900–6:02.380
我们先给Ubuntu搭个梯子
6:02.380–6:04.100
科学上网环境大家自己搞定
6:04.100–6:05.380
那么搭建好之后
6:05.380–6:06.900
给这个中端加上环境变量
6:06.900–6:09.100
因为中端默认是不走梯子的
6:09.100–6:10.220
这里需要注意
6:10.220–6:10.980
设置好之后
6:10.980–6:12.740
要让这个Hermis自己测试一下
6:12.740–6:13.780
他很快就会回复
6:13.780–6:14.420
经过测试
6:14.420–6:16.180
网络环境已经是正常的
6:16.180–6:18.020
然后我就测试一辆新闻聚合
6:18.020–6:19.900
他回复就比没有梯子的时候
6:19.900–6:21.180
要好很多快很多
6:21.180–6:23.580
那么Hermis它毕竟是个国外的开源软件
6:23.580–6:25.860
它的很多生态是基于国际互联网的
6:25.860–6:27.300
大家如果想要玩的爽的话
6:27.300–6:29.340
尽量还是要搞好科学上网的环境
6:29.340–6:32.020
接下来我就问他如何配置电报
6:32.020–6:33.660
他给我提供了几个解决方案
6:33.660–6:36.060
我的选择是把我的电报机器人
6:36.060–6:36.700
Token复制
6:36.700–6:37.460
发给Hermis
6:37.460–6:38.220
让他自己配置
6:38.220–6:39.420
过程也非常简单
6:39.420–6:41.500
找这个电报的Boot Fuzz聊天
6:41.500–6:42.380
新建一个机器人
6:42.380–6:43.260
然后生成Token
6:43.260–6:45.180
复制粘贴到Hermis的聊天框
6:45.180–6:45.660
发给他
6:45.660–6:47.100
他自己很快就会配置成功
6:47.100–6:50.460
其他需要你给这个机器人
6:50.460–6:51.300
发一个测试信息
6:51.300–6:52.580
整个过程就是这么简单
6:52.580–6:55.180
很快我就在这个电报上和Hermis聊天了
6:55.180–6:57.900
这个体验真的是比OpenColor要好太多
6:57.900–6:59.540
好处一个量级都不止
6:59.540–7:01.220
这个提升是非常明显的
7:01.220–7:03.120
我打招呼之后
7:03.120–7:03.820
他叫我小特
7:03.820–7:04.620
我说你搞错了
7:04.620–7:05.140
我是老特
7:05.140–7:05.780
我是你爹
7:05.780–7:07.420
他立刻就记录了自己的身份
7:07.420–7:09.820
并且在以后的对话中保持这种关系
7:09.820–7:11.640
我通过电报发消息
7:11.640–7:14.260
和在终端聊天是一样方便的
7:14.260–7:15.560
他也非常的稳定
7:15.560–7:17.220
那么他也可以接触微信
7:17.220–7:18.140
也是挺方便的
7:18.140–7:19.340
但是我喜欢电报
7:19.340–7:21.900
用微信总有一种会被人窥视的感觉
7:21.900–7:25.380
我让他汇总一下网络上对于DeepSeek V4的评价
7:25.380–7:27.480
他的整理也是非常的到位
7:27.480–7:28.720
总之就是体验非常的好
7:28.720–7:29.360
非常的稳定
7:29.360–7:32.720
响应速度比起之前用OpenColor来说还是要好很多
7:32.720–7:36.520
那么一来这软件本身的效率确实要更高
7:36.520–7:38.940
它的设计它的架构本身要更好
7:38.940–7:41.540
二来就是这个DeepSeek V4 Flush
7:41.540–7:43.120
它的响应速度也确实是非常的快
7:43.120–7:45.040
以往测试OpenColor
7:45.040–7:48.060
我这样玩一玩大概一天需要89块钱
7:48.060–7:50.860
但是V4比起V3年要便宜了一半
7:50.860–7:52.580
应该是4块钱左右
7:52.580–7:54.340
我是去后台看了一下
7:54.340–7:56.620
不过这个Hermes本身
7:56.620–7:58.680
它也比这个OpenColor要更加节约一点
7:58.680–8:00.680
因此3块钱不到吧
8:00.680–8:02.640
但是即便如此便宜
8:02.640–8:05.260
即便是全世界顶级模型中最便宜的
8:05.260–8:07.120
我们也不能用它来重度生产
8:07.120–8:09.480
因为如果说你跑A期间的话
8:09.480–8:11.960
你干一天200块钱那是轻啊一举的事
8:11.960–8:13.380
我现在给你们跑的这些任务
8:13.380–8:14.460
都是非常傻逼的
8:14.460–8:15.100
非常简单的
8:15.100–8:16.440
一些日常用的小任务
8:16.440–8:18.140
主要是为了测试这个模型的智力
8:18.140–8:21.020
包括这个框架本身啊就是它的执行能力如何
8:21.020–8:22.900
就是它是不能用来干重活的
8:22.900–8:25.100
干重活几百块钱一天是绝对打不住的
8:25.100–8:28.280
所以说这个主力未来还是这个轻温3.6
8:28.280–8:29.780
27比稠米模型
8:29.780–8:31.140
昨天我也测试了
8:31.140–8:34.080
它的效果其实比这个V4幅拉西并不差多少
8:34.080–8:35.080
其实是非常好的
8:35.080–8:38.080
那么毕竟我这个409048G啊
8:38.080–8:39.960
这个几万块钱的卡也不能白买
8:39.960–8:41.700
是不是28,500金东上买的
8:41.700–8:43.580
要充分压了它的价值
8:43.580–8:45.740
最后说一下这个Agent呢
8:45.740–8:47.920
要具备什么能力才值得我们去折腾啊
8:47.920–8:49.340
所谓的本地生产力
8:49.340–8:50.020
第一呢
8:50.020–8:51.840
它一定要能够自主操控浏览器
8:51.840–8:52.420
PlayRide
8:52.420–8:53.680
Curl等这个工具
8:53.680–8:56.180
访问互联网获取信息或者执行任务
8:56.180–8:58.640
那么这样就等于给大模型增加了眼镜
8:58.640–9:00.280
因为它可以自主获取信息
9:00.280–9:01.180
不需要你去干预
9:01.180–9:03.340
那么另外它最起码要做到
9:03.340–9:04.960
能够自我更新配置不崩溃
9:04.960–9:06.940
这是考验它的命令行执行能力
9:06.940–9:08.580
系统全线配置
9:08.580–9:10.900
我们所有的复杂任务
9:10.900–9:12.680
最终都是要靠这个命令行来解决
9:12.680–9:14.020
时髦一点的话来说就是
9:14.020–9:15.420
Cli Everything
9:15.420–9:17.900
这就相当于给大模型安装了合格的手
9:17.900–9:19.320
这个手还能够自我修复
9:19.320–9:21.160
那么第三就是要能够在
9:21.160–9:24.220
过往的任务中进行经验教训的总结
9:24.220–9:25.160
生成Skills
9:25.160–9:27.820
因为如果你是去安装Skills
9:27.820–9:28.980
这是没有尽头的事情
9:28.980–9:31.240
Agent必须要能够自己生成改进
9:31.240–9:33.320
才能真正解放人类成为生产力工具
9:33.320–9:36.120
当然现在只是小玩一玩
9:36.120–9:37.300
我五一休息一下
9:37.300–9:38.260
深入测试一下它
9:38.260–9:39.840
那么以后我的Agent的路线就是
9:39.840–9:42.180
轻微3.6加上Deepseek V4 Flush
9:42.180–9:44.420
主要是这个浏览器操作维护音视频
9:44.420–9:46.580
画图的批量生产脚本
9:46.580–9:48.460
我是第一次感觉到
9:48.460–9:50.380
本地Agent有可能从玩具
9:50.380–9:52.220
转变为真正实用的工具
9:52.220–9:54.100
能够真正成为我们的助手
9:54.100–9:55.760
那么本期视频就到这里
9:55.760–9:56.560
我们下期再见
0:00.000–0:02.300
zh本来前天好好休息了一下
本来前天好好休息了一下
0:02.300–0:03.820
zh黑眼圈都有所缓解
黑眼圈都有所缓解
0:03.820–0:05.960
zh但是DeepSickV4又发布了
但是DeepSickV4又发布了
0:05.960–0:06.980
zh我又不得不熬夜
我又不得不熬夜
0:06.980–0:10.100
zh因为我的中英文频道都必须立刻更新
因为我的中英文频道都必须立刻更新
0:10.100–0:14.000
zh这个热点话题是任何做科技话题的博主都不愿意错过的
这个热点话题是任何做科技话题的博主都不愿意错过的
0:14.000–0:15.780
zh于是加紧测试了一下
于是加紧测试了一下
0:15.780–0:17.320
zh那么凌晨发完英语视频
那么凌晨发完英语视频
0:17.320–0:20.340
zh我又把这个Hermes接入V4 Flash给测试了一下
我又把这个Hermes接入V4 Flash给测试了一下
0:20.340–0:21.940
zh体验真的是非常好
体验真的是非常好
0:21.940–0:24.380
zh所以提起精神赶紧发一些视频
所以提起精神赶紧发一些视频
0:24.380–0:27.560
zh要休息的话就只有的脑五一一放松一下了
要休息的话就只有的脑五一一放松一下了
0:27.560–0:29.700
zh可能要把英语频道给停一下
可能要把英语频道给停一下
0:29.700–0:31.980
zh那么首先就是版本
那么首先就是版本
0:31.980–0:35.060
zhDeepSickV4分为Flash和Pro两个版本
DeepSickV4分为Flash和Pro两个版本
0:35.060–0:38.080
zh前者就是之前一直传说的Vslite版本
前者就是之前一直传说的Vslite版本
0:38.080–0:38.760
zh轻量版
轻量版
0:38.760–0:40.380
zh284B参数
284B参数
0:40.380–0:41.260
zhMOE架构
MOE架构
0:41.260–0:42.560
zh推理时激活16B
推理时激活16B
0:42.560–0:44.380
zh那么全量版也就是Pro
那么全量版也就是Pro
0:44.380–0:45.520
zh1.68T参数
1.68T参数
0:45.520–0:46.980
zh也是MOE架构
也是MOE架构
0:46.980–0:48.740
zh推理时激活38B参数
推理时激活38B参数
0:48.740–0:50.580
zh两个模型都是一照上下文
两个模型都是一照上下文
0:50.580–0:52.900
zh那么Flash版本的API价格大概是
那么Flash版本的API价格大概是
0:52.900–0:54.580
zhDeepSickV3.2的一半
DeepSickV3.2的一半
0:54.580–0:56.140
zh甚至可能更便宜一点
甚至可能更便宜一点
0:56.140–0:57.400
zh性能是大幅提升
性能是大幅提升
0:57.400–0:59.380
zh那么Pro版本的价格是
那么Pro版本的价格是
0:59.380–1:00.660
zhFlash价格的十几倍
Flash价格的十几倍
1:00.660–1:03.100
zh但是仍然比GPT Cloud便宜很多
但是仍然比GPT Cloud便宜很多
1:03.100–1:05.660
zh我个人认为性价比并不是很高
我个人认为性价比并不是很高
1:05.660–1:08.380
zh因为DeepSick我们用的一般都是
因为DeepSick我们用的一般都是
1:08.380–1:10.140
zh搞技术的一般都是批量用
搞技术的一般都是批量用
1:10.140–1:13.660
zh那么社区已经被V4 Flash给刷屏
那么社区已经被V4 Flash给刷屏
1:13.660–1:14.660
zh生产了一报表
生产了一报表
1:14.660–1:16.380
zh然后性价比是真相
然后性价比是真相
1:16.380–1:18.060
zh无论是编程还是Agent的调用
无论是编程还是Agent的调用
1:18.060–1:19.220
zh都是非常的顶
都是非常的顶
1:19.220–1:21.460
zh好分方面大家参照媒体报道即可
好分方面大家参照媒体报道即可
1:21.460–1:22.820
zh总之都是顶级的水准
总之都是顶级的水准
1:22.820–1:25.380
zh跟美国的商业模型是互有胜负
跟美国的商业模型是互有胜负
1:25.380–1:26.540
zh某些方面略差一点
某些方面略差一点
1:26.540–1:27.820
zh某些方面又领先一点
某些方面又领先一点
1:27.820–1:29.540
zh但是DeepSickV3.1上下文
但是DeepSickV3.1上下文
1:29.540–1:31.940
zh召回成功率超过97%
召回成功率超过97%
1:31.940–1:33.580
zh是真正可用的生产力
是真正可用的生产力
1:33.580–1:37.100
zhCloud和GPT一旦上下文超过256K
Cloud和GPT一旦上下文超过256K
1:37.100–1:39.660
zh召回准区率会跌到70%甚至50%
召回准区率会跌到70%甚至50%
1:39.660–1:41.900
zh尤其是Cloud的4.7版本
尤其是Cloud的4.7版本
1:41.900–1:43.780
zh最近可以说是差评如潮
最近可以说是差评如潮
1:43.780–1:46.340
zh他们虽然是标称两兆上下文
他们虽然是标称两兆上下文
1:46.340–1:48.500
zh但是实际生产是非常的拉垮
但是实际生产是非常的拉垮
1:48.500–1:49.940
zh关于Cloud的刷分
关于Cloud的刷分
1:49.940–1:51.340
zh生产力体验降级的事
生产力体验降级的事
1:51.340–1:52.900
zh我会在其他视频里详聊
我会在其他视频里详聊
1:52.900–1:54.260
zh这里就一笔带过
这里就一笔带过
1:54.260–1:56.540
zh毕竟本期视频的主角是DeepSickV4
毕竟本期视频的主角是DeepSickV4
1:56.540–1:59.020
zh下面我们直接上测评项目
下面我们直接上测评项目
1:59.020–1:59.740
zh老规矩
老规矩
1:59.740–2:01.500
zh还是让它生成网页
还是让它生成网页
2:01.500–2:02.900
zh表达中国的传统八卦
表达中国的传统八卦
2:02.900–2:05.140
zh我们看到全量版和轻量版
我们看到全量版和轻量版
2:05.140–2:06.260
zh生成的都不错
生成的都不错
2:06.260–2:08.660
zh由于这个截图没有办法展示动态效果
由于这个截图没有办法展示动态效果
2:08.660–2:10.140
zh大家就测课着看
大家就测课着看
2:10.140–2:11.860
zh我如果录屏的话
我如果录屏的话
2:11.860–2:13.700
zh视频生产成本就比较高了
视频生产成本就比较高了
2:13.700–2:14.900
zh有点不太划算
有点不太划算
2:14.900–2:16.940
zh它是带动态特效的
它是带动态特效的
2:16.940–2:19.140
zh点击之后能够显示出对应的解释
点击之后能够显示出对应的解释
2:19.140–2:20.660
zh刷新到显示区域
刷新到显示区域
2:20.660–2:23.260
zh我个人认为轻量版的审美更加接近我
我个人认为轻量版的审美更加接近我
2:23.260–2:24.980
zh事实上这个Flash版本
事实上这个Flash版本
2:24.980–2:26.860
zh在我测试的所有项目中
在我测试的所有项目中
2:26.860–2:28.420
zh都表现得更好更快
都表现得更好更快
2:28.420–2:30.620
zh它比这个1.6T Pro版本
它比这个1.6T Pro版本
2:30.620–2:31.940
zh可能主要的差距在
可能主要的差距在
2:31.940–2:33.540
zh知识面的深度跟广度上
知识面的深度跟广度上
2:33.540–2:34.620
zh在干活的场景中
在干活的场景中
2:34.620–2:35.700
zh就是我们这种搞技术
就是我们这种搞技术
2:35.700–2:37.020
zh携带马拉波Edgington
携带马拉波Edgington
2:37.020–2:38.580
zh它或许确实是更好的
它或许确实是更好的
2:38.660–2:41.060
zh我昨天的视频里详细展示了
我昨天的视频里详细展示了
2:41.060–2:42.300
zh各种模型的生成效果
各种模型的生成效果
2:42.300–2:43.220
zh如果有要对比的
如果有要对比的
2:43.220–2:44.660
zh可以去看一下上期的视频
可以去看一下上期的视频
2:44.660–2:47.060
zh自己翻看一下其他模型是什么样子
自己翻看一下其他模型是什么样子
2:48.820–2:49.460
zh那么接下来
那么接下来
2:49.460–2:51.820
zh我让它生成土机熔岩队的运行原理图
我让它生成土机熔岩队的运行原理图
2:51.820–2:53.660
zh我们看到Pro版生成的图片
我们看到Pro版生成的图片
2:53.660–2:55.340
zh还是标准的
还是标准的
2:55.340–2:55.820
zh正确的
正确的
2:55.820–2:56.900
zh审美了也在线
审美了也在线
2:56.900–2:57.900
zh但是很明显
但是很明显
2:57.900–2:59.620
zh这一轮又是Flash版本胜出
这一轮又是Flash版本胜出
2:59.620–3:02.420
zh它的构图配色更加符合我的审美需求
它的构图配色更加符合我的审美需求
3:02.700–3:03.420
zh不过必须说
不过必须说
3:03.420–3:05.860
zh它们都没有小米的Memo画的好
它们都没有小米的Memo画的好
3:05.860–3:07.580
zhSVG5我认为画的很准确
SVG5我认为画的很准确
3:07.580–3:08.780
zh但是缺乏温度
但是缺乏温度
3:08.780–3:09.740
zh小米的Memo
小米的Memo
3:09.740–3:10.780
zh它的轻量版
它的轻量版
3:10.780–3:12.500
zh相对Rain就温度值更高
相对Rain就温度值更高
3:12.500–3:13.580
zh更有创造力
更有创造力
3:13.980–3:14.180
zh
3:14.180–3:16.020
zh接下来我们让它生成SVG图像
接下来我们让它生成SVG图像
3:16.020–3:17.700
zh表达薛定谔的猫思想实验
表达薛定谔的猫思想实验
3:17.700–3:19.100
zh那么旗带版的效果
那么旗带版的效果
3:19.100–3:20.620
zh还是非常的老成直重
还是非常的老成直重
3:20.780–3:21.500
zh就是画对了
就是画对了
3:21.500–3:22.780
zh但是一点都不经验
但是一点都不经验
3:22.940–3:24.700
zh那么Flash版本则是相对Rain
那么Flash版本则是相对Rain
3:24.700–3:26.060
zh在审美上再度领先
在审美上再度领先
3:26.060–3:28.140
zh但是和小米一样
但是和小米一样
3:28.140–3:30.460
zh它们都没有全两版表达的清晰
它们都没有全两版表达的清晰
3:30.780–3:32.060
zh总之在这个写代码
总之在这个写代码
3:32.060–3:34.100
zh绘图这个网页聊天框的基本测试中
绘图这个网页聊天框的基本测试中
3:34.100–3:35.260
zh我认为Dipsic V4
我认为Dipsic V4
3:35.500–3:36.860
zh具备了顶级模型的能力
具备了顶级模型的能力
3:36.860–3:37.980
zh代码质量也挺好
代码质量也挺好
3:37.980–3:39.100
zh但是放在顶级模型
但是放在顶级模型
3:39.100–3:40.300
zh密集发布的今天
密集发布的今天
3:40.380–3:42.700
zh这确实算不上什么让人惊喜的表现
这确实算不上什么让人惊喜的表现
3:42.780–3:44.220
zh哪怕是比起轻温3.6
哪怕是比起轻温3.6
3:44.220–3:45.340
zh这样的本地小模型
这样的本地小模型
3:45.580–3:47.460
zh它也没有什么特别明显的优势
它也没有什么特别明显的优势
3:48.020–3:49.980
zh但是当我们把它接入Hermis之后
但是当我们把它接入Hermis之后
3:49.980–3:51.740
zh它的生产力立刻就体现出来了
它的生产力立刻就体现出来了
3:51.740–3:54.220
zh首先就是任务的执行成功率非常高
首先就是任务的执行成功率非常高
3:54.220–3:56.300
zh那么我昨天晚上的几十轮对话中
那么我昨天晚上的几十轮对话中
3:56.300–3:58.700
zh它执行浏览期任务没有一次是失败的
它执行浏览期任务没有一次是失败的
3:58.860–4:00.300
zh这是我第一次遇到
这是我第一次遇到
4:00.860–4:02.660
zh我的这个Hermis是原装活
我的这个Hermis是原装活
4:02.660–4:04.620
zh没有对它进行任何的设置优化
没有对它进行任何的设置优化
4:04.620–4:06.860
zh安装任何插件或者skills
安装任何插件或者skills
4:06.860–4:09.020
zh我就是通过一条自动安装的命令
我就是通过一条自动安装的命令
4:09.020–4:10.460
zh就直接执行完毕了
就直接执行完毕了
4:10.860–4:12.860
zh那么我唯一的配置选项就是
那么我唯一的配置选项就是
4:12.860–4:14.140
zh设置了AI模型
设置了AI模型
4:14.140–4:15.860
zh然后本地接入了清晰3.6
然后本地接入了清晰3.6
4:15.860–4:17.820
zh云端接入了Deepseek Chat
云端接入了Deepseek Chat
4:17.820–4:19.180
zh也就是V4Flash
也就是V4Flash
4:19.180–4:22.860
zh那么我在这个中端让他整理特朗普的最新动态
那么我在这个中端让他整理特朗普的最新动态
4:22.860–4:23.820
zh他轻松就搞定了
他轻松就搞定了
4:23.820–4:26.060
zh完全不会像OpenCloud那样消极代工
完全不会像OpenCloud那样消极代工
4:26.060–4:27.980
zh给出的结果也是非常准确的
给出的结果也是非常准确的
4:27.980–4:30.140
zh那么时间的响应也非常的快
那么时间的响应也非常的快
4:30.140–4:31.820
zh让他整理NBI的战报
让他整理NBI的战报
4:31.820–4:33.260
zh他很快就能给出正确的答案
他很快就能给出正确的答案
4:33.260–4:34.540
zh因为我没有配置梯子
因为我没有配置梯子
4:34.540–4:36.380
zh他默认掉我的工具是谷歌新闻
他默认掉我的工具是谷歌新闻
4:36.380–4:38.780
zh还有其他的新闻RSS聚合
还有其他的新闻RSS聚合
4:38.780–4:40.060
zh他都失效了
他都失效了
4:40.060–4:42.820
zh然后这个清晰3.627币会告诉我
然后这个清晰3.627币会告诉我
4:42.820–4:43.420
zh他做不到
他做不到
4:43.420–4:44.700
zh他尝试解释会失败
他尝试解释会失败
4:44.700–4:48.380
zh我就提示他使用CURL进行尝试
我就提示他使用CURL进行尝试
4:48.380–4:49.340
zh继续尝试
继续尝试
4:49.340–4:50.780
zh那么他最终还是会完成任务
那么他最终还是会完成任务
4:50.780–4:51.820
zh但是要折腾一下
但是要折腾一下
4:51.820–4:53.020
zh那么Deepseek V4
那么Deepseek V4
4:53.020–4:54.380
zh他是直接就成功了
他是直接就成功了
4:54.860–4:58.380
zh有可能他从昨天的执行记录中
有可能他从昨天的执行记录中
4:58.380–5:00.380
zh他可能读取了一点东西
他可能读取了一点东西
5:00.380–5:02.940
zh因为昨天我把Hermis给重装了
因为昨天我把Hermis给重装了
5:02.940–5:05.980
zh然后这个先用的是清闻3.6跑了一遍
然后这个先用的是清闻3.6跑了一遍
5:05.980–5:07.660
zh就跑了几个简单的小任务
就跑了几个简单的小任务
5:07.660–5:10.660
zh那么他来尝试访问谷歌等外网工具
那么他来尝试访问谷歌等外网工具
5:10.660–5:12.140
zh失败之后会立刻做出调整
失败之后会立刻做出调整
5:12.140–5:14.780
zh用CURL从国内网站获取信息
用CURL从国内网站获取信息
5:14.780–5:15.660
zh并且加以整理
并且加以整理
5:15.660–5:17.940
zh而且整理的结果是非常正确的
而且整理的结果是非常正确的
5:17.940–5:19.540
zh如果让他查询天启
如果让他查询天启
5:19.540–5:20.660
zh这样简单的小任务
这样简单的小任务
5:20.660–5:22.780
zh那么他查过一次之后
那么他查过一次之后
5:22.780–5:24.020
zh就完全记得这个工具了
就完全记得这个工具了
5:24.020–5:24.940
zh我再次跟他聊天
我再次跟他聊天
5:24.940–5:25.820
zh他就是秒返回
他就是秒返回
5:25.820–5:26.860
zh总之呢
总之呢
5:26.860–5:28.580
zh他执行浏览器任务是非常的轻松
他执行浏览器任务是非常的轻松
5:28.580–5:30.780
zh未来我会加入更多深度的测试
未来我会加入更多深度的测试
5:30.780–5:32.500
zh我是非常喜欢Hermis的
我是非常喜欢Hermis的
5:32.500–5:33.900
zh他是基于Python
他是基于Python
5:33.900–5:35.180
zh天然适配AI架构
天然适配AI架构
5:35.180–5:36.340
zh因为我们的AI程序
因为我们的AI程序
5:36.340–5:38.700
zhAI框架基本上都是基于Python的
AI框架基本上都是基于Python的
5:38.700–5:41.460
zh他比起使用Rod.js的OpenCloud
他比起使用Rod.js的OpenCloud
5:41.460–5:42.300
zh要更加的稳定
要更加的稳定
5:42.300–5:43.860
zh因为不需要使用混合架构
因为不需要使用混合架构
5:43.860–5:46.780
zh那么他的中单交互体验是非常好的
那么他的中单交互体验是非常好的
5:46.780–5:48.660
zh审美也是长在了我的点上
审美也是长在了我的点上
5:48.660–5:50.860
zh但是我还是给他安上电报
但是我还是给他安上电报
5:50.860–5:52.900
zh不然本期视频就显得不那么完整
不然本期视频就显得不那么完整
5:52.900–5:55.140
zh因为很多人他只要一搞Agent
因为很多人他只要一搞Agent
5:55.140–5:56.580
zh他就你怎么不安电报
他就你怎么不安电报
5:56.580–5:57.340
zh怎么不接微信
怎么不接微信
5:57.340–5:59.660
zh我们不争论就把它接上
我们不争论就把它接上
5:59.660–5:59.900
zh好吧
好吧
5:59.900–6:02.380
zh我们先给Ubuntu搭个梯子
我们先给Ubuntu搭个梯子
6:02.380–6:04.100
zh科学上网环境大家自己搞定
科学上网环境大家自己搞定
6:04.100–6:05.380
zh那么搭建好之后
那么搭建好之后
6:05.380–6:06.900
zh给这个中端加上环境变量
给这个中端加上环境变量
6:06.900–6:09.100
zh因为中端默认是不走梯子的
因为中端默认是不走梯子的
6:09.100–6:10.220
zh这里需要注意
这里需要注意
6:10.220–6:10.980
zh设置好之后
设置好之后
6:10.980–6:12.740
zh要让这个Hermis自己测试一下
要让这个Hermis自己测试一下
6:12.740–6:13.780
zh他很快就会回复
他很快就会回复
6:13.780–6:14.420
zh经过测试
经过测试
6:14.420–6:16.180
zh网络环境已经是正常的
网络环境已经是正常的
6:16.180–6:18.020
zh然后我就测试一辆新闻聚合
然后我就测试一辆新闻聚合
6:18.020–6:19.900
zh他回复就比没有梯子的时候
他回复就比没有梯子的时候
6:19.900–6:21.180
zh要好很多快很多
要好很多快很多
6:21.180–6:23.580
zh那么Hermis它毕竟是个国外的开源软件
那么Hermis它毕竟是个国外的开源软件
6:23.580–6:25.860
zh它的很多生态是基于国际互联网的
它的很多生态是基于国际互联网的
6:25.860–6:27.300
zh大家如果想要玩的爽的话
大家如果想要玩的爽的话
6:27.300–6:29.340
zh尽量还是要搞好科学上网的环境
尽量还是要搞好科学上网的环境
6:29.340–6:32.020
zh接下来我就问他如何配置电报
接下来我就问他如何配置电报
6:32.020–6:33.660
zh他给我提供了几个解决方案
他给我提供了几个解决方案
6:33.660–6:36.060
zh我的选择是把我的电报机器人
我的选择是把我的电报机器人
6:36.060–6:36.700
zhToken复制
Token复制
6:36.700–6:37.460
zh发给Hermis
发给Hermis
6:37.460–6:38.220
zh让他自己配置
让他自己配置
6:38.220–6:39.420
zh过程也非常简单
过程也非常简单
6:39.420–6:41.500
zh找这个电报的Boot Fuzz聊天
找这个电报的Boot Fuzz聊天
6:41.500–6:42.380
zh新建一个机器人
新建一个机器人
6:42.380–6:43.260
zh然后生成Token
然后生成Token
6:43.260–6:45.180
zh复制粘贴到Hermis的聊天框
复制粘贴到Hermis的聊天框
6:45.180–6:45.660
zh发给他
发给他
6:45.660–6:47.100
zh他自己很快就会配置成功
他自己很快就会配置成功
6:47.100–6:50.460
zh其他需要你给这个机器人
其他需要你给这个机器人
6:50.460–6:51.300
zh发一个测试信息
发一个测试信息
6:51.300–6:52.580
zh整个过程就是这么简单
整个过程就是这么简单
6:52.580–6:55.180
zh很快我就在这个电报上和Hermis聊天了
很快我就在这个电报上和Hermis聊天了
6:55.180–6:57.900
zh这个体验真的是比OpenColor要好太多
这个体验真的是比OpenColor要好太多
6:57.900–6:59.540
zh好处一个量级都不止
好处一个量级都不止
6:59.540–7:01.220
zh这个提升是非常明显的
这个提升是非常明显的
7:01.220–7:03.120
zh我打招呼之后
我打招呼之后
7:03.120–7:03.820
zh他叫我小特
他叫我小特
7:03.820–7:04.620
zh我说你搞错了
我说你搞错了
7:04.620–7:05.140
zh我是老特
我是老特
7:05.140–7:05.780
zh我是你爹
我是你爹
7:05.780–7:07.420
zh他立刻就记录了自己的身份
他立刻就记录了自己的身份
7:07.420–7:09.820
zh并且在以后的对话中保持这种关系
并且在以后的对话中保持这种关系
7:09.820–7:11.640
zh我通过电报发消息
我通过电报发消息
7:11.640–7:14.260
zh和在终端聊天是一样方便的
和在终端聊天是一样方便的
7:14.260–7:15.560
zh他也非常的稳定
他也非常的稳定
7:15.560–7:17.220
zh那么他也可以接触微信
那么他也可以接触微信
7:17.220–7:18.140
zh也是挺方便的
也是挺方便的
7:18.140–7:19.340
zh但是我喜欢电报
但是我喜欢电报
7:19.340–7:21.900
zh用微信总有一种会被人窥视的感觉
用微信总有一种会被人窥视的感觉
7:21.900–7:25.380
zh我让他汇总一下网络上对于DeepSeek V4的评价
我让他汇总一下网络上对于DeepSeek V4的评价
7:25.380–7:27.480
zh他的整理也是非常的到位
他的整理也是非常的到位
7:27.480–7:28.720
zh总之就是体验非常的好
总之就是体验非常的好
7:28.720–7:29.360
zh非常的稳定
非常的稳定
7:29.360–7:32.720
zh响应速度比起之前用OpenColor来说还是要好很多
响应速度比起之前用OpenColor来说还是要好很多
7:32.720–7:36.520
zh那么一来这软件本身的效率确实要更高
那么一来这软件本身的效率确实要更高
7:36.520–7:38.940
zh它的设计它的架构本身要更好
它的设计它的架构本身要更好
7:38.940–7:41.540
zh二来就是这个DeepSeek V4 Flush
二来就是这个DeepSeek V4 Flush
7:41.540–7:43.120
zh它的响应速度也确实是非常的快
它的响应速度也确实是非常的快
7:43.120–7:45.040
zh以往测试OpenColor
以往测试OpenColor
7:45.040–7:48.060
zh我这样玩一玩大概一天需要89块钱
我这样玩一玩大概一天需要89块钱
7:48.060–7:50.860
zh但是V4比起V3年要便宜了一半
但是V4比起V3年要便宜了一半
7:50.860–7:52.580
zh应该是4块钱左右
应该是4块钱左右
7:52.580–7:54.340
zh我是去后台看了一下
我是去后台看了一下
7:54.340–7:56.620
zh不过这个Hermes本身
不过这个Hermes本身
7:56.620–7:58.680
zh它也比这个OpenColor要更加节约一点
它也比这个OpenColor要更加节约一点
7:58.680–8:00.680
zh因此3块钱不到吧
因此3块钱不到吧
8:00.680–8:02.640
zh但是即便如此便宜
但是即便如此便宜
8:02.640–8:05.260
zh即便是全世界顶级模型中最便宜的
即便是全世界顶级模型中最便宜的
8:05.260–8:07.120
zh我们也不能用它来重度生产
我们也不能用它来重度生产
8:07.120–8:09.480
zh因为如果说你跑A期间的话
因为如果说你跑A期间的话
8:09.480–8:11.960
zh你干一天200块钱那是轻啊一举的事
你干一天200块钱那是轻啊一举的事
8:11.960–8:13.380
zh我现在给你们跑的这些任务
我现在给你们跑的这些任务
8:13.380–8:14.460
zh都是非常傻逼的
都是非常傻逼的
8:14.460–8:15.100
zh非常简单的
非常简单的
8:15.100–8:16.440
zh一些日常用的小任务
一些日常用的小任务
8:16.440–8:18.140
zh主要是为了测试这个模型的智力
主要是为了测试这个模型的智力
8:18.140–8:21.020
zh包括这个框架本身啊就是它的执行能力如何
包括这个框架本身啊就是它的执行能力如何
8:21.020–8:22.900
zh就是它是不能用来干重活的
就是它是不能用来干重活的
8:22.900–8:25.100
zh干重活几百块钱一天是绝对打不住的
干重活几百块钱一天是绝对打不住的
8:25.100–8:28.280
zh所以说这个主力未来还是这个轻温3.6
所以说这个主力未来还是这个轻温3.6
8:28.280–8:29.780
zh27比稠米模型
27比稠米模型
8:29.780–8:31.140
zh昨天我也测试了
昨天我也测试了
8:31.140–8:34.080
zh它的效果其实比这个V4幅拉西并不差多少
它的效果其实比这个V4幅拉西并不差多少
8:34.080–8:35.080
zh其实是非常好的
其实是非常好的
8:35.080–8:38.080
zh那么毕竟我这个409048G啊
那么毕竟我这个409048G啊
8:38.080–8:39.960
zh这个几万块钱的卡也不能白买
这个几万块钱的卡也不能白买
8:39.960–8:41.700
zh是不是28,500金东上买的
是不是28,500金东上买的
8:41.700–8:43.580
zh要充分压了它的价值
要充分压了它的价值
8:43.580–8:45.740
zh最后说一下这个Agent呢
最后说一下这个Agent呢
8:45.740–8:47.920
zh要具备什么能力才值得我们去折腾啊
要具备什么能力才值得我们去折腾啊
8:47.920–8:49.340
zh所谓的本地生产力
所谓的本地生产力
8:49.340–8:50.020
zh第一呢
第一呢
8:50.020–8:51.840
zh它一定要能够自主操控浏览器
它一定要能够自主操控浏览器
8:51.840–8:52.420
enPlayRide
PlayRide
8:52.420–8:53.680
zhCurl等这个工具
Curl等这个工具
8:53.680–8:56.180
zh访问互联网获取信息或者执行任务
访问互联网获取信息或者执行任务
8:56.180–8:58.640
zh那么这样就等于给大模型增加了眼镜
那么这样就等于给大模型增加了眼镜
8:58.640–9:00.280
zh因为它可以自主获取信息
因为它可以自主获取信息
9:00.280–9:01.180
zh不需要你去干预
不需要你去干预
9:01.180–9:03.340
zh那么另外它最起码要做到
那么另外它最起码要做到
9:03.340–9:04.960
zh能够自我更新配置不崩溃
能够自我更新配置不崩溃
9:04.960–9:06.940
zh这是考验它的命令行执行能力
这是考验它的命令行执行能力
9:06.940–9:08.580
zh系统全线配置
系统全线配置
9:08.580–9:10.900
zh我们所有的复杂任务
我们所有的复杂任务
9:10.900–9:12.680
zh最终都是要靠这个命令行来解决
最终都是要靠这个命令行来解决
9:12.680–9:14.020
zh时髦一点的话来说就是
时髦一点的话来说就是
9:14.020–9:15.420
enCli Everything
Cli Everything
9:15.420–9:17.900
zh这就相当于给大模型安装了合格的手
这就相当于给大模型安装了合格的手
9:17.900–9:19.320
zh这个手还能够自我修复
这个手还能够自我修复
9:19.320–9:21.160
zh那么第三就是要能够在
那么第三就是要能够在
9:21.160–9:24.220
zh过往的任务中进行经验教训的总结
过往的任务中进行经验教训的总结
9:24.220–9:25.160
zh生成Skills
生成Skills
9:25.160–9:27.820
zh因为如果你是去安装Skills
因为如果你是去安装Skills
9:27.820–9:28.980
zh这是没有尽头的事情
这是没有尽头的事情
9:28.980–9:31.240
zhAgent必须要能够自己生成改进
Agent必须要能够自己生成改进
9:31.240–9:33.320
zh才能真正解放人类成为生产力工具
才能真正解放人类成为生产力工具
9:33.320–9:36.120
zh当然现在只是小玩一玩
当然现在只是小玩一玩
9:36.120–9:37.300
zh我五一休息一下
我五一休息一下
9:37.300–9:38.260
zh深入测试一下它
深入测试一下它
9:38.260–9:39.840
zh那么以后我的Agent的路线就是
那么以后我的Agent的路线就是
9:39.840–9:42.180
zh轻微3.6加上Deepseek V4 Flush
轻微3.6加上Deepseek V4 Flush
9:42.180–9:44.420
zh主要是这个浏览器操作维护音视频
主要是这个浏览器操作维护音视频
9:44.420–9:46.580
zh画图的批量生产脚本
画图的批量生产脚本
9:46.580–9:48.460
zh我是第一次感觉到
我是第一次感觉到
9:48.460–9:50.380
zh本地Agent有可能从玩具
本地Agent有可能从玩具
9:50.380–9:52.220
zh转变为真正实用的工具
转变为真正实用的工具
9:52.220–9:54.100
zh能够真正成为我们的助手
能够真正成为我们的助手
9:54.100–9:55.760
zh那么本期视频就到这里
那么本期视频就到这里
9:55.760–9:56.560
zh我们下期再见
我们下期再见

影片筆記:DeepSeek V4 Flash/Pro编程实测,接入Hermes体验完爆OpenClaw,搭配Qwen3.6 27b稠密将成为生产力利器!接入Telegram便宜又实用!

一句話總結

本影片實測 DeepSeek V4(Flash 與 Pro 版本)在本地 Agent 框架 Hermes 中的表現,證實其結合 Qwen 3.6 與 DeepSeek V4 Flash 具有極高性價比,能透過 Telegram 實現低成本、高穩定性的瀏覽器自動化與生產力任務,被視為本地 Agent 從玩具轉向實用工具的關鍵路線。

核心重點

  1. DeepSeek V4 版本對比
  • Flash 版:284B 參數(MOE 架構,推理激活 16B),上下文處理能力強,價格極低(約為 V3.2 的一半),在編程、審美及 Agent 調用方面表現頂尖,性價比極高。
  • Pro 版:1.68T 參數(MOE 架構,推理激活 38B),價格為 Flash 的十幾倍,性價比相對較低,但在知識深度與廣度上略佔優勢。
  1. 上下文召回率優勢
  • DeepSeek V3.1 上下文召回成功率超過 97%,被視為真正可用的生產力工具。
  • 對比 Cloud 與 GPT 在超過 256K 上下文時召回率跌至 50%-70% 的表現,DeepSeek 在長上下文處理上更具優勢。
  1. Hermes 框架的生產力表現
  • Hermes 基於 Python,天然適配 AI 架構,相比使用 Rod.js 的 OpenClaw(影片口語提及 OpenColor/OpenCloud),穩定性更高,無需混合架構。
  • 在 Hermes 中執行瀏覽器任務成功率極高,數十輪對話無失敗,且無需額外設置優化或安裝插件。
  • 具備自主操控瀏覽器、自我修復配置及生成 Skills 的能力,能從「玩具」轉變為生產力工具。
  1. 成本與部署優勢
  • 接入 Telegram 後,使用 DeepSeek V4 Flash 的成本極低(約 3-4 元人民幣/天),遠低於以往測試 OpenClaw 的成本(約 89 元/天)。
  • 建議搭配本地模型 Qwen 3.6 27B 稠密模型與 4090 48G 顯卡,構建高性價比的本地生產力 Agent。
  1. 實際應用案例
  • 成功完成網頁生成、SVG 繪圖、新聞聚合整理、特朗普動態整理、NBA 戰報整理等任務。
  • 具備自動適應網絡環境的能力(如自動調整使用 CURL 從國內網站獲取信息)。

詳細大綱

一、 DeepSeek V4 版本規格與價格分析

  • Flash 版(Vslite/輕量版)
  • 參數:284B 參數,MOE 架構。
  • 推理激活:16B 參數。
  • 上下文:一照上下文(原文如此,疑為長上下文或一致上下文)。
  • 價格:約為 DeepSeek V3.2 的一半,甚至更便宜。
  • Pro 版(全量版)
  • 參數:1.68T 參數,MOE 架構。
  • 推理激活:38B 參數。
  • 價格:Flash 價格的十幾倍,但仍比 GPT Cloud 便宜。
  • 性價比評估
  • 講者認為 Pro 版性價比不高,因技術人員多批量使用。
  • 社區對 V4 Flash 評價極高,認為其在編程與 Agent 調用方面表現頂尖。
  • 與美國商業模型互有勝負,部分領先、部分略差。

二、 上下文召回率與生產力對比

  • DeepSeek V3.1:上下文召回成功率超過 97%,被視為真正可用的生產力。
  • Cloud 與 GPT
  • 上下文超過 256K 時,召回準確率跌至 70% 甚至 50%。
  • 特別指出 Cloud 4.7 版本近期差評如潮。
  • 雖標稱兩兆上下文,但實際生產表現拉垮。

三、 模型生成能力實測(網頁與繪圖)

  • 測試項目 1:生成網頁表達中國傳統八卦
  • 全量版與輕量版生成效果都不錯。
  • 輕量版(Flash)審美更接近講者,且在所有項目中表現更好、更快。
  • Pro 版主要差距在於知識面的深度與廣度。
  • 測試項目 2:生成土機熔岩隊運行原理圖
  • Pro 版生成圖片標準、正確,審美在線。
  • Flash 版在構圖配色上勝出。
  • 兩者皆不如「小米的 Memo」(疑點:模型名稱)畫得好。
  • SVG5 畫得準確但缺乏溫度;小米的 Memo 輕量版相對 Rain(疑點:模型名稱)溫度值更高、更有創造力。
  • 測試項目 3:生成 SVG 表達薛定諤的貓思想實驗
  • 旗帶版(疑點:模型名稱)效果老成直重(疑點:口誤/錯字),畫對但不經驗(疑點:口誤/錯字)。
  • Flash 版審美領先,但表達清晰度不如全兩版(疑點:模型名稱)。
  • 總結:DeepSeek V4 具備頂級模型能力,代碼質量好,但在頂級模型密集發布的今天,不算驚喜,甚至不如輕溫 3.6 等本地小模型有明顯優勢。

四、 Hermes 框架接入 DeepSeek V4 的生產力表現

  • 任務執行成功率
  • 在 Hermes 中執行瀏覽器任務成功率極高,數十輪對話無失敗。
  • Hermes 為「原裝活」,未進行設置優化或安裝插件/skills。
  • 僅通過一條自動安裝命令執行完畢。
  • 配置環境
  • 本地接入:清晰 3.6(疑點:模型名稱)。
  • 雲端接入:DeepSeek Chat(V4 Flash)。
  • 實際操作案例
  • 整理特朗普最新動態:輕鬆完成,結果準確,響應快。
  • 整理 NBI 戰報(疑點:模型名稱):快速給出正確答案。
  • 外網訪問問題
  • 未配置梯子時,預設工具為谷歌新聞及其他 RSS 聚合,均失效。
  • 清晰 3.6 會嘗試解釋失敗。
  • 講者提示使用 CURL 嘗試,最終完成任務但需折騰。
  • DeepSeek V4 直接成功,可能從昨日執行記錄中讀取經驗,自動調整使用 CURL 從國內網站獲取信息並整理,結果正確。
  • 天啟查詢(疑點:模型名稱):簡單任務,查過一次後完全記住工具,秒返回。
  • 框架優勢
  • Hermes 基於 Python,天然適配 AI 架構。
  • 相比使用 Rod.js 的 OpenCloud(疑點:產品名稱),更穩定,無需混合架構。
  • 中端交互體驗好,審美符合講者喜好。

五、 Hermes 接入 Telegram 與微信的配置

  • 網絡環境準備
  • 需為 Ubuntu 搭建梯子(科學上網環境)。
  • 為中端(疑點:口誤,應指 Hermes 或終端)加上環境變量,因為預設不走梯子。
  • 設置後需讓 Hermes 自我測試,確認網絡環境正常。
  • 測試新聞聚合,有梯子時回覆比無梯子時快很多。
  • 強調 Hermes 為國外開源軟件,生態基於國際互聯網,建議搞好科學上網環境。
  • Telegram 配置流程
  1. 找 Telegram 的 Bot Fuzz(疑點:產品名稱)聊天。
  2. 新建機器人並生成 Token。
  3. 複製 Token 發送給 Hermes 聊天框。
  4. Hermes 自動配置成功。
  5. 給機器人發送測試信息。
  • 使用體驗
  • 在 Telegram 上與 Hermes 聊天體驗遠優於 OpenColor(疑點:產品名稱)。
  • 穩定性高,響應速度快。
  • 講者測試身份識別:打招呼後稱呼講者為「小特」,講者糾正為「老特」並宣稱「我是你爹」,Hermes 立即記錄身份並在後續對話中保持該關係。
  • 也可接觸微信,但講者偏好 Telegram,認為用微信有被窺視的感覺。

六、 成本分析與未來 Agent 路線

  • 成本對比
  • 以往測試 OpenColor 玩一天約需 89 塊錢。
  • V4 比 V3 便宜一半,約 4 塊錢左右。
  • Hermes 本身比 OpenColor 更節約,總成本不到 3 塊錢。
  • 雖便宜,但不能用於重度生產(跑 AI 期間一天 200 塊錢是輕舉一舉的事)。
  • 當前測試為簡單日常小任務,非重活。
  • 主力模型選擇
  • 未來主力將是輕溫 3.6(疑點:模型名稱)加上 27 比稠米模型(疑點:模型名稱)。
  • 講者擁有 4090 48G 顯卡(疑點:規格),需充分發揮價值。
  • 本地生產力 Agent 必備能力
  1. 自主操控瀏覽器:使用 PlayRide(疑點:產品名稱)、Curl 等工具訪問互聯網獲取信息或執行任務(相當於給大模型加眼鏡)。
  2. 自我更新配置不崩潰:考驗命令行執行能力與系統全線配置(Cli Everything),相當於給大模型安裝合格且能自我修復的手。
  3. 經驗總結與 Skills 生成:在過往任務中總結經驗,生成 Skills,而非僅靠安裝 Skills,才能真正解放人類。
  • 未來路線
  • 輕溫 3.6 + DeepSeek V4 Flush(疑點:模型名稱)。
  • 主要用於瀏覽器操作、維護、音視頻、畫圖的批量生產腳本。
  • 講者首次感覺本地 Agent 可能從玩具轉變為真正實用工具。

工具 / 模型 / 名詞整理

  • 模型/產品名稱
  • DeepSeek V4(Flash 與 Pro 版本)
  • Vslite / V3.2 / V3.1
  • GPT Cloud / Cloud 4.7
  • Hermes(Agent 框架)
  • OpenCloud / OpenColor(疑點:產品名稱,講者口語混用,應指 OpenClaw)
  • Rod.js
  • 清晰 3.6 / 輕溫 3.6(疑點:模型名稱,應指 Qwen)
  • 27 比稠米模型(疑點:模型名稱,應指 Qwen 3.6 27B 稠密模型)
  • 小米的 Memo(疑點:模型名稱)
  • SVG5(疑點:模型名稱)
  • Rain(疑點:模型名稱)
  • 旗帶版(疑點:模型名稱)
  • 全兩版(疑點:模型名稱)
  • Bot Fuzz(疑點:Telegram 功能或產品名稱,應指 BotFather)
  • Telegram
  • 微信
  • PlayRide(疑點:產品名稱,應指 Playwright)
  • CURL
  • 谷歌新聞
  • RSS 聚合
  • Ubuntu
  • 4090 48G(顯卡規格)

操作流程整理

  1. 環境準備
  • 在 Ubuntu 系統中搭建梯子(科學上網環境)。
  • 為 Hermes 終端加上環境變量,確保網絡不走預設路徑。
  • 讓 Hermes 自我測試網絡環境,確認新聞聚合功能在有梯子時回覆正常。
  1. Hermes 基礎配置
  • 本地接入清晰 3.6(疑點:模型名稱)。
  • 雲端接入 DeepSeek Chat(V4 Flash)。
  • 通過一條自動安裝命令完成基礎設置,無需額外安裝插件或 skills。
  1. Telegram 接入流程
  • 在 Telegram 中與 Bot Fuzz(疑點:產品名稱)聊天。
  • 新建機器人並生成 Token。
  • 將 Token 發送給 Hermes 聊天框。
  • Hermes 自動完成配置。
  • 發送測試信息驗證連接。
  1. 生產力任務執行
  • 瀏覽器自動化:利用 PlayRide(疑點:產品名稱)或 CURL 訪問互聯網。
  • 任務範例
  • 整理特朗普最新動態。
  • 整理 NBI 戰報(疑點:模型名稱)。
  • 生成 SVG 表達思想實驗(如薛定諤的貓)。
  • 天啟查詢(疑點:模型名稱)。
  • 自我修復與適應:當預設工具(如谷歌新聞)失效時,模型能自動調整策略(如改用 CURL 從國內網站獲取信息)。
  1. 身份識別測試
  • 與 Hermes 進行對話,測試其對用戶稱呼(如「小特」糾正為「老特」)及關係(「我是你爹」)的記憶與保持能力。

值得注意的限制或風險

  1. 網絡依賴:Hermes 為國外開源軟件,生態基於國際互聯網,需確保良好的科學上網環境,否則預設工具(如谷歌新聞、RSS 聚合)可能失效。
  2. 成本限制:雖然 DeepSeek V4 Flash 成本極低(約 3-4 元/天),但講者強調此成本僅適用於簡單日常小任務,不適用於重度生產(如一天 200 元的 AI 運行成本)。
  3. 模型能力邊界
  • DeepSeek V4 Flash 在審美和速度上表現優異,但在知識深度與廣度上不如 Pro 版。
  • 在繪圖方面,Flash 版雖構圖配色勝出,但整體效果不如「小米的 Memo」(疑點:模型名稱)等特定模型。
  • 在長上下文處理上,雖優於 GPT Cloud,但仍需關注召回率問題。
  1. 本地硬件要求:講者建議搭配 4090 48G 顯卡以發揮 Qwen 3.6 27B 稠密模型的價值,對普通用戶可能存在硬件門檻。

逐字稿辨識疑點

  • DeepSickV4 / Dipsic V4:應為 DeepSeek V4。
  • Vslite:應為 V-S-Lite 或相關輕量版稱呼。
  • 一照上下文:語意不通,疑為「一致上下文」或「長上下文」之誤。
  • 真相:語境中「性价比是真相」疑為「性價比是真相」或口誤。
  • 土機熔岩隊:疑為特定名稱或聽寫錯誤,如「圖基熔岩隊」或特定遊戲/項目名稱。
  • 小米的 Memo:疑為模型名稱聽寫錯誤,如「Midjourney」或其他繪圖模型。
  • 旗帶版:疑為模型名稱聽寫錯誤。
  • 老成直重:疑為「老成持重」之誤。
  • 不經驗:疑為「不精煉」或「不精細」之誤。
  • 全兩版:疑為模型名稱聽寫錯誤。
  • Hermis:應為 Hermes。
  • 瀏覽期:應為「瀏覽器」。
  • 中端:在「中端交互體驗」及「给这个中端加上环境变量」中出現,疑為「終端」或「Hermes」之誤。
  • NBI:疑為「NBA」或特定新聞來源之誤。
  • 天啟:疑為特定查詢對象或模型名稱聽寫錯誤。
  • OpenColor / OpenCloud:講者多次提及,疑為 OpenClaw 或其他產品名稱之誤。
  • Bot Fuzz:疑為 Telegram BotFather 或相關功能的聽寫錯誤。
  • PlayRide:疑為 Playwright 之誤。
  • 27 比稠米:疑為模型名稱聽寫錯誤,如「27B 稠密模型」或特定模型名。
  • V4 幅拉西:應為 V4

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習