Hello 大家好,这里是王帅真 今天这一期视频呢,想跟大家分享一下Hermes Agent 的模型配置问题 在前面两期视频发布之后,就会有很多朋友在评论区私信里面来问我 包括我身边也会有一些最近才开始用Hermes Agent 的朋友 就会来问我说,那我安装完这Hermes Agent 之后 然后呢,然后我们就要选模型了嘛 就比方说我们来看一下官方的QuickStart 它第一步,Install Hermes Agent 完了之后呢,Choose a Provider,就我们要选一个模型的服务提供商 OK,然后输入Hermes Model,你就会发现,哇靠,有这么多的模型对吧,一连串 有他们官方的,然后有我们国内的模型,有国外的模型,哇,琳琅满目 就你会有点迷失了,你会不知道要选什么 你也不知道,比如说会有人问说,开销怎么样啊 怎么样的比较好用啊,这一期视频呢,就是想给大家一套方案 主要是针对于小白,或者说刚开始用的人 希望大家能以一个较低的成本的方式,甚至是白嫖的方式 先上车再说,我们先用起来,先看看好不好用嘛 不要,一上来就有人会说,啊,你就得用GPT 然后你还要开那个Pro,那肯定是不对的嘛 你这个东西你都没有尝过啥滋味 你开始就投这么大成本,去用其实是不太合理的 包括有人会说,哎呀,你要用Gemini,你要用什么什么什么 我们先从更实际的方向去考虑这个问题 主要呢,就是我不太希望看到大家去花一些冤枉钱 就本着这样一个初心,然后有了这期视频 所以这个是一个比较新手向的 OK,然后我先给出来我的方案的一个核心的公式 其实就是主模型用DeepSeek 的 Flash V4 Flash 然后再加上一个多模态的模型去进行一个补位 比如说DeepSeek它其实是自己不能闭环的 它只能生成一些文字 虽然它有开源的多模态的论文 但是目前就官方来说,确实没有多模态能力 然后我们就需要有个多模态模型来补位 那这个详细的呢,我们后面再来聊 然后我们也可以利用各家云厂商给的一些免费额度 就一些羊毛,先用起来 反正先跑,我们觉得好用再说嘛,对不对 那为什么我选择DeepSeek来做我们的主模型呢 首先DeepSeek它是非常便宜的 我们可以来看一下DeepSeek V4 Flash 跟DeepSeek V4 Pro大概的一个价格 我们直接来看下面的这个这块我们先不看缓存 百万 TOKen 输入缓存未命中的情况 一块钱100 万 TOKen 的输入 相当于你可以塞一本《红楼梦》塞一本《三体》进去 都是没问题的,就大概这么个长度 然后你要说,那我来回对话,它上下文长了怎么办呢 呃,这一部分就会走到它的缓存上面 我们就可以看到DeepSeek它每百万 TOKen的缓存命中是 两分钱,你未命中是一块钱 那DeepSeek它的缓存命中率大概能有多少呢 得益于他们V4的时候做了一个缓存策略的优化 是一个大的进步,他们的命中率能达到90% 当然是建立在你多了几轮上嘛 就是你的命中率一般就能达到90% 而且它的缓存能给你保留时间比较长 所以你整个下来的成本其实是相对比较低的 包括它百万输出也才两元 你用到Pro 的话,大概贵三倍的程度吧 其实这个是非常便宜的 跟国外的GPT Claude差了几十倍 我们后面会来看 呃,那现在我先跟你说 大概成本是差几十倍的 我们来看一下它的缓存命中情况 我的输入命中缓存的是1500 万 TOKen 输入未命中缓存的是100 万都不到 就发现它很多都走到缓存上面了其实 然后输出的话也不到100 万 就十几万的样子 也就是说它大概呢 也就是个16分之15走到了缓存上 其实就是90%多了 这个比例是非常非常高的 那这一天的消耗大概是多少钱呢 我们可以看到也就一块多 你每一天这么用 那可能你再用凶一点 三块五块 反正它不会贵的 除非你真的像我评论区里面有个人 他用的很凶啊 疯狂调教往里面加了一堆上下文啊 或者一些Hermes的东西 那可能要一二十块钱 如果你用的没那么凶 你就是日常用 那一天就是就是几块钱 那像我这一天啊 就是一块四毛七 那你去充一个 比如说什么Kimi的Plan 一个月都两百块了 而且这个还是按量付费 因为我们不可能每天都用这么凶的 这个需要大家自己实际用的时候去 这个用量信息里面 自己去点一点看一看 那这个 我们就先不过多做介绍了 反正在这里呢 就必须的给我们的梁胜良、文风 风仙圣仙刻一个 整活整活 就我们能用上这么便宜的大模型 效果还能做到不错 真的感谢 梁胜 真是梁胜了 OK 那我们现在就来实操演示一下 我们怎么先把这个主模型 DeepSeek Flash 先给配上去 OK 我们还是回到这个 DeepSeek的这个官网这边 就是deepseek.com 你用的搜索已经都给进去 OK 我们不要点这开始对话 点这个API开放平台 OK 点进来之后会看到我们前面 看到这个用量信息界面 这个时候呢 我们去点API Keys 那我这边就已经有一些 创建好的了 这边已经有了 那我没事 我给他删掉 然后我们现在重新来一遍 我带大家来一遍 我们先命名好我们的API Key 比如说我们这边是Hermes要用 那我们就给他一个Hermes OK 我们去创建 OK 然后创建好了之后呢 我们就点击这个复制 为了避免我们等我可能会配错 这个页面可以先不要关 我们就放着 OK 我们进入到终端界面 我们就输入前面 那边这官网说的嘛 Hermes Model是吧 Hermes Model OK 我只跟大家确认一下 OK 我们输入Hermes Model 看到琳琅满目的模型对吧 无论是你在Hermes Model里面去配 还是你Hermes的setup 就你第一次装那个 一样你都会到这个界面来 OK 然后我们就找到这个DeepSeek v3 recode的这个什么 直联API这边就这个 OK 然后我们敲击一下回车进来 然后他会说 No DeepSeek API Key configured 那我这边就要去输入 我的一个DeepSeek API Key 然后这边我选择一下复制 OK 然后我就把我的这个东西给贴进来了 回车 然后就save 了 他就跟你说 你的Base URL 是什么 就是你的主域名 当然这个就是直接就是官网的了 大家可以不用再去改了 直接敲回车 好 那完了之后 然后我悬问那个主要模型 那默认就会选择最新的v4 Flash 这个时候啊 就可以了 回车 OK 然后这个时候 Default Model set to DeepSeek V4 Flash via DeepSeek 这个时候我们已经成功 切换到DeepSeek上面来了 没错 就这个过程呢 就是这么快啊 然后我们来做一个测试 我们起个新会话啊 其实我们已经看到 可以看到了 他能起会话成功 他Model 已经是DeepSeek V4 Flash了 那Provider 是DeepSeek 然后Context 可以看到他就是一个 100 万 TOKen 那我们可以跟他问个好 你好 你用的是什么模型 OK 我们来测试一下 成不成功吗 OK 然后你可以看到他正常的 回复你了 那这个就是我们已经配置上了 那这个时候就会有个问题 那我们在对话里面去沟通的时候 无论是我们在FaceboOK上面用啊 在微信上面用啊 还是什么 我们有时候其实是会 想要带一些图片上去问他嘛 对吧 我们会想要去跟他有一些 比如说 我拍一下 我的哪里的一个什么照片啊 然后问他这个啥情况嘛 这都是很有可能的 就比如我昨天 我给我的房间拍了一个照片 然后问他说 我怎么整理比较好 那现在可能有点乱 对那这个时候他可能就 你用DeepSeek的话 他没有办法去做识别 给大家示范一下 比方说这个时候 我去做一个截图来演示一下 OK 那我说 你能看得见这张图片吗 我可以直接跟大家说 就这个DeepSeek 他就不是多模态模型 所以他是看不到的 你看他就说看不见 当前这个实例没有配置 图像识别能力 你需要先配置一个Vision Model Provider 就可以看到这个时候 他其实是没有这样的一个能力的 DeepSeek是没有多模态的 就包括我用官网 你可以自己去试试 你去官网给他发一个 没有文字的图片 你可能以前以前发可以 但是你会发现 他其实接的是一个OCR 的服务 如果你的图片一旦没有文字 他会直接说 未提取到文字 你们可以试试 但是主播今天剪视频的时候 发现DeepSeek官网 已经在灰度识图模式了 多模态不远了兄弟们 但API 什么时候来还不知道 所以仍然想和大家分享 多模态的方案 所以我们的解决方案呢 就是说 我们要在DeepSeek Flash的基础上 我们再去配置一个 可以支撑他图片理解 能力的一个多模态的模型 就我们主要还用DeepSeek 但是我们就图片 Vision Analyze这个部分 接入一个多模态的模型 到这一步要说明一下 我没有接任何广告 我将会用百炼里面的千问 就阿里的千问来演示 但是千问没有给我任何广告费 就这个思路是通的 你去用百炼 你去用腾讯的混元 你去用字节的豆包 都一样 并且他们都有羊毛可以好 都有免费额度 没关系随便用 OK 我们进入到百炼大模型的这个界面 我这边选的是一个视觉模型 我先给大家看一下 就是你可以在这里面去找 它有视觉能力的一些模型 那最基础的比较 最新可能有到千问3.7什么 什么 我们用不到这么好 不需要 我们可以直接 选个千问 3.6-Flash 我们就以这个来演示吧 你要是想成本更低一点的用千问 3.5-Flash 而且我们可以先不考虑成本问题 因为它这些东西都有免费额度 这个东西呢 我们可以一样把这个东西复制过来 我们就把图片贴过来 那我们呢 嗯 你能看见这样图片吗 我们可以试一下它的一个图片理解能力 你看 它马上就能夸夸夸 然后都看到了 都识别出来 我看我验证了它的一个图片能力之后呢 我们选择下面的这个用量 N费用 我们点一下之后 可以看到它有个免费额度 你用方舟 一样的 比如说我们进到方舟里面来 也基本都有免费推理额度 你去用豆包 你去用 甚至它DeepSeek Flash 你看这个也给你提供了免费额度 就这些东西你都可以去配 反正这种送你个50 万100 万的 就随便好 像阿里这些都给100 万 然后字节那边给50 万 我们作为个人用户随便去好 然后阿里可以看到它也有DeepSeek-VL Flash 就是如果你想先用起来 你就你就用这个就可以了 当然那就不是我前面的那套配置方式了 那新的配置方式呢 我们现在来讲 呃我们因为我用的是千问 3.6-Flash 我们数一下3.6 然后输 OK 呃我们来选择这个千问 3.6-Flash 我们将会用的是这一个东西 可以看到我已经用了一部分了 如果你呃比较谨慎的话 你怕多花一分钱 你一分钱不想花啊 你就点这个免费额度用完即停 当你这个用完了之后呢 你再去好别的模型 到时候你再自己去换嘛 反正这个都是很好很好都替换的 OK 那我们接下来要做的是什么呢 我们知道了要选择那个模型然后呢 呃刚才看一个额度 我们点这个 API Keys 下面的这 API Keys 在用量的下面两个格子呃 然后在这边一样 我们可以去创建 API Key啊 一样我把这个东西给删了 我们重来一遍 权限就默认全部 然后描述一样 我们写个 Hermes 确定 然后也是一样 停在这个页面 然后我们点一个复制 暂时到这里 我们先先放着 没关系呃 我们再跳到这个 Hermes Agent 在阿里云上面的一个文档 找到这个接入客户端开发工具 然后Hermes Agent这个 但这个文档到时候会贴给大家 我们直接选到这个 按量计费这一块这边来 因为我们是走的 API,API 就是用多少付多少钱嘛 然后我们刚刚不是已经 有了 key 的那一部分吗 我们可以根据这个 Hermes config 来 当然我们也可以不这么来 因为我们已经接了 DeepSeek Flash 了嘛 对吧 那我们就直接让DeepSeek 那个 Hermes Agent 帮我们配就可以了 那我们就大概把这一段话 发给他 然后让他来配 那配是会配在哪呢 我们进到 Hermes Agent 的 Dashboard 里面来 我们去看 我们这个 Main Model 已经是DeepSeek了 然后我们要去配他的一个 呃 任务模型 相对应的任务模型 OK 我可以看到 他默认的会全部都是 Auto 就你主模型用哪个 就是哪个 那我们要配的其实就是这个 vision 但是我们这边还没配上 我们会以 Custom 的方式来配 我们会 Custom 的方式来配 可以看一下他这个 config 一个典型的配置示例 就最终配完 大概是一个长这样的东西 呃 那我们就复制复制复制 全部都复制 帮我配一下 vision 的模型 key 是 就这样就可以了 你就像我这样说就行了 前面那段话全部复制下来 帮我配置一下什么什么 key 是什么什么什么 OK 发送 就可以了 呃 我们能发现他配的 好像有一点翻车 不太对不太对 没事 我们主打一个展示容错率 一 你要 我前面说的不完整啊 你要用 Custom 的方式去配置 参考啊 其实这段也是他那个弄下来的嘛 对吧 然后模型是用 千问三三点六 -Flash 啊 就说明他前面这个东西配错了 怎么能配到 VL Plus vl 他其实是一个完整的 呃 视觉模型 就他除了理解 我记得应该是还能生图的 就如果大家有生图的那种需求 然后再去另外找其他的模型 啊 就可以看到他现在就开始夸夸夸一桶配了 /reset 之后 OK 那现在应该是好了 我们先来这个看板这边看一眼吧 OK 我们可以看到他这边应该是已经有了啊 你看 Vision Custom 千问3.6 -Flash 呃 那我们现在回来啊 就说明他这边OK的嘛 那我就/new 那我们现在来把那个 消息重新再来试一遍 OK 一样的内容 问他 能不能看见这张图片 OK 我问一下 嗯 然后就能发现他这个时候就读得出来了 对吧 就我们这边是一个步骤 然后什么 这是配置和默认模型 为DeepSeek Flash 的步骤 等等 然后还反过来 我说你是想让我帮你完成这些配置吗 还是呃 只是确认我能看到这个图片 OK 就到这一步 我们已经把那个图片的也配完了 呃 然后确实我们这个流程也走完了 当然这个是 Hermes Agent 在百链上面的一个配置 如果你去用呃 腾讯的混元或者字节 火山方舟 理论上他们你也能找到他们的那个 呃文档甚至说你自己都不要去找 你直接让你的Hermes Agent 自己去找文档来配 因为他本身就自带呃Web 搜索 Web 解析的能力没关系 让他自己去找 这都没有关系 总之就是我们把这个多模态的能力 哎给接上 那我们这样的一个使用就很丝滑了嘛 那你可能会说 哎那他这个东西 好像就是一个 你会怀疑说 哎那他是不是也是OCR 我们来实验一下 OK 我这边拍一个照片 我们可以看到我拍了一张照片 然后看到能不能解析出来 就这这应该是没有文字了吧 你不能说没文字 但是这确实没什么文字啊 他基本上就是一个物体 这个可能不太好 我刚刚应该找一个完全没文字的 OK 你看他可以看出来 看到了机械键盘 加垂直鼠标的桌面setup 然后可以看出来这个什么 他他他倒是这个这个词别说 这颗字是KJZi 但大体 其实大部分都能看得出来了 那整个整个完整的闭环就是这样 那这套方案呢 大概要花多少钱 我们可以试一下 就就就这一轮 会话来说啊 我们可以这样 /usage 我们会发现啊 其实很多都走到缓存上了 然后输出的TOKen 好啊也也没多少 就我们可以用/usage 去看你的使用情况 单轮对话 你要这么算的话 比方说我就就就就拿这个来看吧 这样吧这样吧 OK 然后我们这样一下 当然这是单位要改成0.0 因为你是你的单位是 百万 TOKen嘛 然后呃 乘以0.02 啊加上没有cache 的1388 但是你得往前一0.0013啊 乘以1加上401 乘以2 但是这前面要0.0000啊 这才多少钱啊 一分钱都不到对吧 你这么聊完一分钱都不到 但你平时用的话 肯定是更频繁的 那我这边都可以 你那那那我估凶一点吧 0.004好了 然后你图片识别的话 这样我们直接在这里面去问 千问3.6 Flash的价格 怎么样 一张图片 我们精确点一张两照的图片 大概要多少 TOKen 帮我算一下成本 现在云平台都有 都有这种啊 哎呀我们反正就 灵活运用嘛 啊他这个有点蠢了 OK你3.6-Flash 的话 如果是1.44元 没百万的话 我可以直接给大家一个经验值 基本上你一张图片就是 呃可能是1000多 也可能是2000多 3000多4000多5000多 都有可能 我们假设我们一张就按3000 TOKen 来算 1.44元100 万 那我们算一下 100 万的话 100 万除以3000 也就是说我们1.44元 可以用到这么多图片 那一张图片多少钱呢 1.44除以333333 OK相当于一个图片 就是呃0.004 那我们啊 好像这个也是0.004 OK 那我们一轮下来 一分钱都不到 往上加嘛 10轮对话 8分钱 啊就是带图的 还在往上加加加加加加 20轮 1.6 那200轮 1.6 大概就 就这样嘛 当然你们可能涉及一些缓存的计算 就是文本对话 这边有一些cache 那我们再订算了 更何况这个图片识别 你可以不停的去耗羊毛 刚不是给你看了嘛 这个大模型 你就回 你看免费额度这么多 你回去那边视觉模型 这边找哪些支持 你一个一个给他耗干了再说 啊那完了之后你火山了 接着一个个好 腾讯会员的 一样 那包括其他云平台 都有这种呃免费额度 使劲好 反正我们我们 个人 就大家先把免费的用完 你大概对你怎么用的情况 有个底的啊 那你有更高的要求 比如说你能说 哎我要用Gemini 他可能识别效果更好 我要用GPT怎么样 那那再说 我们把话聊回来了 就前面有讲到这个 那我们为什么不去用贵的模型呢 就我们来看看 这个模型的价格 GPT-5.5 啊就GPT 新的输入 5 刀 DeepSeek是1 元人民币 这之前差了几倍 五 现在汇率应该6.8吧 还多的 五成一6.8 大概就是34倍啊 反正就差不多这样子 这能比吗 然后你缓存输入 OK 0.5 刀 就是十分之一嘛 0.5 刀 然后DeepSeek 那个可是2% 那个很夸张的 他这个只是十分之一 就是10% DeepSeek 可是2% 往那成本缓存成没有差几个量级 然后输出更夸张了 输出是输入的6倍 用得起吗 如果你还拿这个写代码 我之前试过用API写代码 我那天 再做一个项目的重构 写了大概两三个小时 写完了就直接跑了我一千块人民币 TOKen 量可能一亿多两亿吧 很贵的 刷不起的 包括你看Claude 的 就别说Opus了 Opus用不上现在 你就看都别说opus了 别看opus 你Claude 的 Sonnet 哪怕是Sonnet 你这个东西都要三刀 就便宜点 那你opus就是5 刀,跟这个GPT对齐吗 很贵的 用不起的 哪怕你用的是kimi 他的输入价格也要6.5 输出价格27 块 这都不是一个成本 更何况kimi的上下文窗口 还没有到百万 就我对DeepSeek是有一点偏爱的 就不仅他是国模 而且就感谢他们确实是做了很大努力 就他们能用很小的成本 来做到很不错的成果 特别是他在中文语境下 他的洞察力更好 我之前有个个人的问题 是全用中文的 然后我最后我发现 就是我发给了 御三家就GPT Claude Gemini 然后包括DeepSeek 这四个一起去用 最后洞察效果最好就DeepSeek 他在中文语境下 等能力还真的确实没得说 OK 那我们来谈一下 为什么Flash这个模型他就够用了 不仅仅是价格的问题 也不仅仅是速度的问题 而且我们要谈的是效果 就这个很很反直觉对吧 一般说Pro呢 都很牛逼吧 就专家 但其实不是的 就是Flash 的话 他的指令遵循会更强 那Pro 的话 他是thinking能力比较 思考能力比较强 Flash就好像是你给他一个指令 他就会老老实实去执行 他又快又便宜又稳定 但是Pro 的话 就人想的多嘛 那就是你懂的 他推理链就比较重 然后还喜欢自我延伸 甚至把自己推理出来的东西 当成规则来用 就这种就是 overthinking 你过度思考之后 反而他的结果不理想 就你一件事情可能 并没有这么难对吧 你要让他在那边想什么呢 还要给他这么大的思考空间 干什么呢 就大部分的Agent场景 我不是说所有 大部分的Agent场景里面 你的指令遵循 其实比你的推理深度要更重要 这个观点可能偏主观 但我就是这么认为的 就好像你在公司里面带人的话 Flash他就有点像是一线的执行者 你给他具体的指令他就照着做 他反而这样不容易出错 但是Pro 的话 他就像是一个高手一样的东西 你给他一个方向 他就自己在那边琢磨了 就一直琢磨怎么达成这个目标 他有时候确实吧 能给你很不错的结果 因为他琢磨的确实还可以 质量很高 那有的时候他就会跑偏 然后越想越偏 越想越便宜 这句话不用管他 这个应该是我掉了一个顺序 然后这边忘改了 那我们怎么做抉择呢 就他们之前怎么选呢 但主要大部分情况下 我前面说完 就你用Flash就行了 基本上你去做 tool use就调工具 然后或者你去执行一个任务 或者怎么样 就你日常情况下用Flash就够了 又便宜又快又指令遵循 why not 那Pro 的话 你可以主动的去做切换 比如你就 /model 你在这里面你就可以去 看你有哪一些模型 OK 然后你就可以按照他给你的这个 规范来去换 /model 然后什么怎么样 然后就可以换了 或者你要是实在不会换 你不可以用这个指定 你就是说 请你帮我把模型切换成 DeepSeek的Pro 也是OK的 比如说这个Pro呢 他更适合你去用他来做一些 有一定思考能力复杂度 要深度的东西 比如说你重新搭建一个系统框架 或者说你要做系统性的分析复盘 就本来就需要一些 我们深入思考的东西 或者说你去梳理一些复杂的逻辑 你需要他去想这个东西 你就请神吧 对吧 你就再请他出来 请诸葛出山 你再主动去切吧 OK 那这个视频 很跟大家分享这么多 那我们来做一个总结吧 首先就是DeepSeek Flash做主模型 然后因为他在 多模态能力上 缺失,所以我们要补一个 多模态模型的能力 然后在Agent场景下 Flash其实是不输Pro的 甚至他更加的稳定 OK 那本期视频就是这样了 如果你想看到更多 有关于AI 实战方面的东西 或者想跟我讨论 或者想在这方面能有更进一步的 思考或者怎么样的话 欢迎可以加入我最近 刚开的一个知识星球 就帅真 AI 实战圈 目前的话我每天都会在 群里面跟大家讨论 AI 相关的问题 包括星球里面 我也会做很多的内容分享 就实战方面的 包括好内容都有 然后我这里面就会有很多 很多东西 就反正这里面发了 好多好多实战相关的 就我自己的一些观点也好 实战经验也好 反正就发了很多很多 然后群也是每天都在高强度冲浪这样 好了 视频就到这吧 如果你喜欢本期视频的话 欢迎留言点赞 评论收藏 谢谢 拜拜