本来前天好好休息了一下 黑眼圈都有所缓解 但是DeepSickV4又发布了 我又不得不熬夜 因为我的中英文频道都必须立刻更新 这个热点话题是任何做科技话题的博主都不愿意错过的 于是加紧测试了一下 那么凌晨发完英语视频 我又把这个Hermes接入V4 Flash给测试了一下 体验真的是非常好 所以提起精神赶紧发一些视频 要休息的话就只有的脑五一一放松一下了 可能要把英语频道给停一下 那么首先就是版本 DeepSickV4分为Flash和Pro两个版本 前者就是之前一直传说的Vslite版本 轻量版 284B参数 MOE架构 推理时激活16B 那么全量版也就是Pro 1.68T参数 也是MOE架构 推理时激活38B参数 两个模型都是一照上下文 那么Flash版本的API价格大概是 DeepSickV3.2的一半 甚至可能更便宜一点 性能是大幅提升 那么Pro版本的价格是 Flash价格的十几倍 但是仍然比GPT Cloud便宜很多 我个人认为性价比并不是很高 因为DeepSick我们用的一般都是 搞技术的一般都是批量用 那么社区已经被V4 Flash给刷屏 生产了一报表 然后性价比是真相 无论是编程还是Agent的调用 都是非常的顶 好分方面大家参照媒体报道即可 总之都是顶级的水准 跟美国的商业模型是互有胜负 某些方面略差一点 某些方面又领先一点 但是DeepSickV3.1上下文 召回成功率超过97% 是真正可用的生产力 Cloud和GPT一旦上下文超过256K 召回准区率会跌到70%甚至50% 尤其是Cloud的4.7版本 最近可以说是差评如潮 他们虽然是标称两兆上下文 但是实际生产是非常的拉垮 关于Cloud的刷分 生产力体验降级的事 我会在其他视频里详聊 这里就一笔带过 毕竟本期视频的主角是DeepSickV4 下面我们直接上测评项目 老规矩 还是让它生成网页 表达中国的传统八卦 我们看到全量版和轻量版 生成的都不错 由于这个截图没有办法展示动态效果 大家就测课着看 我如果录屏的话 视频生产成本就比较高了 有点不太划算 它是带动态特效的 点击之后能够显示出对应的解释 刷新到显示区域 我个人认为轻量版的审美更加接近我 事实上这个Flash版本 在我测试的所有项目中 都表现得更好更快 它比这个1.6T Pro版本 可能主要的差距在 知识面的深度跟广度上 在干活的场景中 就是我们这种搞技术 携带马拉波Edgington 它或许确实是更好的 我昨天的视频里详细展示了 各种模型的生成效果 如果有要对比的 可以去看一下上期的视频 自己翻看一下其他模型是什么样子 那么接下来 我让它生成土机熔岩队的运行原理图 我们看到Pro版生成的图片 还是标准的 正确的 审美了也在线 但是很明显 这一轮又是Flash版本胜出 它的构图配色更加符合我的审美需求 不过必须说 它们都没有小米的Memo画的好 SVG5我认为画的很准确 但是缺乏温度 小米的Memo 它的轻量版 相对Rain就温度值更高 更有创造力 好 接下来我们让它生成SVG图像 表达薛定谔的猫思想实验 那么旗带版的效果 还是非常的老成直重 就是画对了 但是一点都不经验 那么Flash版本则是相对Rain 在审美上再度领先 但是和小米一样 它们都没有全两版表达的清晰 总之在这个写代码 绘图这个网页聊天框的基本测试中 我认为Dipsic V4 具备了顶级模型的能力 代码质量也挺好 但是放在顶级模型 密集发布的今天 这确实算不上什么让人惊喜的表现 哪怕是比起轻温3.6 这样的本地小模型 它也没有什么特别明显的优势 但是当我们把它接入Hermis之后 它的生产力立刻就体现出来了 首先就是任务的执行成功率非常高 那么我昨天晚上的几十轮对话中 它执行浏览期任务没有一次是失败的 这是我第一次遇到 我的这个Hermis是原装活 没有对它进行任何的设置优化 安装任何插件或者skills 我就是通过一条自动安装的命令 就直接执行完毕了 那么我唯一的配置选项就是 设置了AI模型 然后本地接入了清晰3.6 云端接入了Deepseek Chat 也就是V4Flash 那么我在这个中端让他整理特朗普的最新动态 他轻松就搞定了 完全不会像OpenCloud那样消极代工 给出的结果也是非常准确的 那么时间的响应也非常的快 让他整理NBI的战报 他很快就能给出正确的答案 因为我没有配置梯子 他默认掉我的工具是谷歌新闻 还有其他的新闻RSS聚合 他都失效了 然后这个清晰3.627币会告诉我 他做不到 他尝试解释会失败 我就提示他使用CURL进行尝试 继续尝试 那么他最终还是会完成任务 但是要折腾一下 那么Deepseek V4 他是直接就成功了 有可能他从昨天的执行记录中 他可能读取了一点东西 因为昨天我把Hermis给重装了 然后这个先用的是清闻3.6跑了一遍 就跑了几个简单的小任务 那么他来尝试访问谷歌等外网工具 失败之后会立刻做出调整 用CURL从国内网站获取信息 并且加以整理 而且整理的结果是非常正确的 如果让他查询天启 这样简单的小任务 那么他查过一次之后 就完全记得这个工具了 我再次跟他聊天 他就是秒返回 总之呢 他执行浏览器任务是非常的轻松 未来我会加入更多深度的测试 我是非常喜欢Hermis的 他是基于Python 天然适配AI架构 因为我们的AI程序 AI框架基本上都是基于Python的 他比起使用Rod.js的OpenCloud 要更加的稳定 因为不需要使用混合架构 那么他的中单交互体验是非常好的 审美也是长在了我的点上 但是我还是给他安上电报 不然本期视频就显得不那么完整 因为很多人他只要一搞Agent 他就你怎么不安电报 怎么不接微信 我们不争论就把它接上 好吧 我们先给Ubuntu搭个梯子 科学上网环境大家自己搞定 那么搭建好之后 给这个中端加上环境变量 因为中端默认是不走梯子的 这里需要注意 设置好之后 要让这个Hermis自己测试一下 他很快就会回复 经过测试 网络环境已经是正常的 然后我就测试一辆新闻聚合 他回复就比没有梯子的时候 要好很多快很多 那么Hermis它毕竟是个国外的开源软件 它的很多生态是基于国际互联网的 大家如果想要玩的爽的话 尽量还是要搞好科学上网的环境 接下来我就问他如何配置电报 他给我提供了几个解决方案 我的选择是把我的电报机器人 Token复制 发给Hermis 让他自己配置 过程也非常简单 找这个电报的Boot Fuzz聊天 新建一个机器人 然后生成Token 复制粘贴到Hermis的聊天框 发给他 他自己很快就会配置成功 其他需要你给这个机器人 发一个测试信息 整个过程就是这么简单 很快我就在这个电报上和Hermis聊天了 这个体验真的是比OpenColor要好太多 好处一个量级都不止 这个提升是非常明显的 我打招呼之后 他叫我小特 我说你搞错了 我是老特 我是你爹 他立刻就记录了自己的身份 并且在以后的对话中保持这种关系 我通过电报发消息 和在终端聊天是一样方便的 他也非常的稳定 那么他也可以接触微信 也是挺方便的 但是我喜欢电报 用微信总有一种会被人窥视的感觉 我让他汇总一下网络上对于DeepSeek V4的评价 他的整理也是非常的到位 总之就是体验非常的好 非常的稳定 响应速度比起之前用OpenColor来说还是要好很多 那么一来这软件本身的效率确实要更高 它的设计它的架构本身要更好 二来就是这个DeepSeek V4 Flush 它的响应速度也确实是非常的快 以往测试OpenColor 我这样玩一玩大概一天需要89块钱 但是V4比起V3年要便宜了一半 应该是4块钱左右 我是去后台看了一下 不过这个Hermes本身 它也比这个OpenColor要更加节约一点 因此3块钱不到吧 但是即便如此便宜 即便是全世界顶级模型中最便宜的 我们也不能用它来重度生产 因为如果说你跑A期间的话 你干一天200块钱那是轻啊一举的事 我现在给你们跑的这些任务 都是非常傻逼的 非常简单的 一些日常用的小任务 主要是为了测试这个模型的智力 包括这个框架本身啊就是它的执行能力如何 就是它是不能用来干重活的 干重活几百块钱一天是绝对打不住的 所以说这个主力未来还是这个轻温3.6 27比稠米模型 昨天我也测试了 它的效果其实比这个V4幅拉西并不差多少 其实是非常好的 那么毕竟我这个409048G啊 这个几万块钱的卡也不能白买 是不是28,500金东上买的 要充分压了它的价值 最后说一下这个Agent呢 要具备什么能力才值得我们去折腾啊 所谓的本地生产力 第一呢 它一定要能够自主操控浏览器 PlayRide Curl等这个工具 访问互联网获取信息或者执行任务 那么这样就等于给大模型增加了眼镜 因为它可以自主获取信息 不需要你去干预 那么另外它最起码要做到 能够自我更新配置不崩溃 这是考验它的命令行执行能力 系统全线配置 我们所有的复杂任务 最终都是要靠这个命令行来解决 时髦一点的话来说就是 Cli Everything 这就相当于给大模型安装了合格的手 这个手还能够自我修复 那么第三就是要能够在 过往的任务中进行经验教训的总结 生成Skills 因为如果你是去安装Skills 这是没有尽头的事情 Agent必须要能够自己生成改进 才能真正解放人类成为生产力工具 当然现在只是小玩一玩 我五一休息一下 深入测试一下它 那么以后我的Agent的路线就是 轻微3.6加上Deepseek V4 Flush 主要是这个浏览器操作维护音视频 画图的批量生产脚本 我是第一次感觉到 本地Agent有可能从玩具 转变为真正实用的工具 能够真正成为我们的助手 那么本期视频就到这里 我们下期再见