今天我们一起将Hermes从单文本模型直接扩染到接近全模态的能力 包括介入免费的Arganes实现生图能力 支持文生图也支持图生图 同时也介入直接生生视频的能力 同样包括文生视频和图生视频都是可以做到的 并通过介入minimax m3的原生多模态能力实现视觉理解 就比如说我给他一张楼房的草线图 他能详细理解整体的设计 甚至根据草线图自己去绘制每一个局部并进行讲解 还可以让他具备视频理解的能力 就比如我给他一段魔术的短视频 可以让他分析与提取魔术的技巧部分 就相当于给agent提供了一双眼睛 然后还可以给他加入TTS的语音生成能力 让agent定时汇报的事情 用语音来给你播播 随时随地收听AI推送给你的消息 汇总起来就是生存能力、生视频能力、图像理解能力、视频理解能力 以及语音生成能力 几乎可以达到一定程度的全模态 而且这也不限于Hermes 其他的agent工具按照接下来的讲解也可以做到这样的程度 好 接下来我们来看一下五种能力的接入和实现是怎么操作的 首先我们来说一下图片生成和视频生成能力的实现 这里主要是我们需要接入agent的这么一个模型 首先他是可以提供免费来使用的 而且是没有额度的限制 他只有一个每分钟的调用频率的限制 应该是一分钟可以调用20次 基本上也是雇用的 他同时具备了文本、图像和视频三种模态 所以说他的文本模型也可以称为你Hermes的主力模型 然后呢 生图和深视频这两个是可以免费使用 这个是非常不错的 使用很简单 你只需要去进入agent 然后去获取一个API key 文本、图像和视频也就都可以用了 这里最好呢 是新建一个tsc文文文件 把你的API key放到里面 比如说我这个是地盘的key.txt 这里我就不具体演示的 都是一些常规操作 然后呢 其实是关于这个文本模型 不是今天的重点 但是我们也可以说一下 他这个文本模型的介入 需要以自信的方式来介入 所以说这个地方你要打开命令行 通过输入HermesModel进来 然后呢 在这里去选择这个custom的endpoint 然后呢 把你的把这个地址 这是Agnus的那个baseurl给到他 然后再把你的API key付给他 好 然后选择这个autodetect 然后这里呢 给Hermes配置只能配置这个文本模型 其他的生图和生视频 是以skill和插入的方式来实现的 所以这地方你选4就可以了 这个是他的一共五个模型嘛 然后这个4是他的那个文本模型 好 输入4 完了之后呢 这个位置呢 是他是有一个要去给你输入一个名字的 大模型的名字啊 我们就输一个custom冒号 Agnus就可以了 好 然后保存 保存完了之后重启 重启之后 我们再新建一个打开一个新建绘画 你在这里下拉 你就能看到了啊 看到这个什么customagent 这么一个刚才的一个别名啊 然后呢 你再选择这个 选择这个模型啊 这个模型是个文本模型 好 请问你是用的什么大模型 我们可以看一下啊 好 他告诉你了 根据当前对话的配置信 我使用的是这个 题目上是他 对吧 他已经就是已经通过了 然后比如说 请帮我查询一下 嗯 请告诉我 李白的医生 好 我们先干干别的吧 好 整个这一步呢 其实是相当于是你把 Agnus接进来之后 你是可以用它去作为你的主力的文本模型的 然后接下来我们进入图片生成的这个环节啊 图片生成是这样的 这个地方呢 其实是它这个是提供了一个使用文档的 关于这个Agnus 而且它是2.0和2.1 它有两个版本 2.0的速度更快 2.1呢 它是效果会更好一些 细节会做的更好一些 所以说呢 你这个地方 大家可以注意一下啊 就是 是这么写的 请参考Agnus的生涂API使用文档 帮我实验图片生成能力 然后把这把这两个给到它 然后呢 你还要告诉他 你的API case在哪个 这就是刚才我们在前面说的 你的key放在这 好 好 然后呢 我过去可以切开看一下 这是刚才他去做的 你看 可以完全可以正常来使用的 就现在是这部Agnus2.0 flash嘛 这就是它的文本模型 好 接下来呢 我们再去看一下 它这个地方 你输入完这个之后呢 这是一个过程 我给大家写的一些图 就是 它会让你去做几个选择 第一就是 它这个是有个插件嘛 在Hermes里边 生图和生视频 包括视频分析 视觉分析 都是有专门的插件 这么一个存在的 但是它插件是存在一个机制 你是需要去给它实现的 所以这里呢 就是它会问你啊 这个地方 我选的其实是这个都做 选都做 第三项 然后第二个事情是什么呢 它这里是你的API key在哪里 好 我这里让它去选 也是选第三项行了 因为我写了那个文件 它这里是 现在Hermes那个桌面端是 你直接给它Key有的时候是 是不行的啊 可能做一些安适机制 那第三个呢 这里是 我让它是默认组2.1的 也是选第三项 2.1的效果更好嘛 所以说这个也是选这个就可以了 好 大概可能需要个几分钟的时间嘛 可能十分钟 5到10分钟 然后完了之后 它会告诉你生生图片的能力啊 已经落地了 然后有几种方式啊 包括这个2.1 2.0的啊 包括图生图的 文生图的就t !text image 2.1 2.0 图生图也都有了 好 接下来呢 就是包括这些东西都是正确的啊 它这里还给你生成了三张这个测试图片嘛 这三张图分为用了三种不同的方式啊 文生图的2.1 文生图的2.0 然后图生图的2.1 好 就是三张图 就是这三张图啊 意思就是这个顺序啊 这个是2.1的2.0的 然后这个是个图生图 这个图生图很明显是肯定是用了那个反光行空的那个方式啊 来做的 好 就完事了啊 然后呢 我们可以做下测试 我这里做的测试是用 是写的这么一句啊 帮我用星海生的风格生生一个女孩在教室读书的照片啊 一会儿他也是完成了 完成了之后 你看啊 他完成了之后 他是这个他试书的一个指定路径 呃 然后他还对整个过程的元素进行一些描述 然后就这张图啊 就这张图 然后图生图 接下来是我做了个图生图 我我是有联系追问的啊 可以看 大家看一看这里 这里啊 嗯 对 就这个嘛 比方帮我用星海生的风格生生一张女孩的照片 一张一个女孩在教室读书的图片 是这个位置 然后呢 我通过图是什么概念呢 在这张图片的基础上 帮我增加一个男生站在方面 两人有说有笑生生图片 对吧 也是很顺利的完成了啊 速度还可以啊 包括这男人什么姿态啊 然后什么互动感什么东西呢啊 这对 好 然后我们可以看一下啊 这个就是这张图 还不错啊 还不错 所以说这个东西 我觉得质量还可以 因为毕竟它是一个 我们现在是免费使用嘛 特别在Hermis街上这种生图和生视频能力 也不是专业去搞那个生图和生视频的 就是我们可能去做一些内容 或做一些资料 我们需要一些配图 或者需要一些配套的一些视频啊 配合演示的视频 可能就就可以了 因为如果说特别像视频这一块 你如果是你真的要去做 像类似漫剧那样的东西 你至少也是接康风 UI这样的一些专业的一种生视频的模型嘛 但是我们现在比较轻量级的 把生图和生视频 先加到Hermis里面来 而且对我们自己的电脑也没什么要求的话啊 这个方式还是很不错的 好 接下来我们再看一下关于这个生视频的这个能力啊 生视频能力的话 是类似的按照方式啊 就是让他参考阿根尼斯的生视频的这个文档啊 然后帮他实现视频的生成能力 然后API-K也告诉他 然后这个文档的这个地址啊 也告诉他 完了之后呢 也是类似的啊 这个就实现了 实现了之后 这个大概也是不到十分钟的时间啊 实现了之后呢 他这里也是做了一个 我看有没有做测试啊 对 也是做了测试 而且他测试了四段视频啊 你看就这个同一时间点 做了四段视频 然后呢 这个其中两段啊 我放进来了 可以看一下 还有还不错 嗯 一个小飞 一个指飞机啊 飞过来 这是三秒钟的一个 好 这里还有一个小猫啊 好 还可以啊 还可以啊 还可以 就是就是这个 呃 做的这个感觉也还可以啊 如果说我们做一些这种 类似配图啊 或者是做一些配合的视频 可能也是雇用的 好 这里呢 我做的这个视频测试是这样的 让他用公信性的风格 给我生成一张 一个女孩在教室读书 一个男生站在旁边 就跟上面呢 是一样的啊 人人有时候也需要生成一段视频 呃 本正来说 所有的这个 文生视频 其实还是图生视频 只不过是 他这个生图 是他自己来完成的 你看他只是先做了一个 文生图 然后图生视频 然后全天弄通了 他是你看 他是先做了这个啊 现在先做了 现在这个图 然后呢 他把这个图做成视频了 看一下 有时候有效嘛 啊 就是没有给他太多的细节啊 这个到时候大家可以自己测一下 细节方面 然后图生视频的话 就是 哎 这个我就是写了一段啊 让这张图片动起来 生成一段视频啊 就是这个 就是那个执行的过程啊 就这样图给他 然后执行的过程就是 是这样的啊 然后这张图片动起来 生成一段视频 他可以执行啊 你看完成了之后 呃 这用了大概是两分 两分 就是三分钟吧 大家加起来用三分钟 然后 这个 你看这个输出 就是地址也给到你了啊 然后呢 这是他的动效 他 他自己强 他做了什么啊 他也告诉你了 我们可以来看一下 我也是同样的 也没有给他们要求太多细节 这个大家自己做的时候 可以再去试试 好 再看一遍啊 这还不错啊 还不错 好 这样生图和生视频啊 就可以了啊 同样的就刚才我们说的 第一 如果说你把它作为一个辅助的一个大元模型啊 也是可以的 也给大家刚才演示过了 好 接下来我们再看一下 关于这个图像理解 视频理解 以及语音合成啊 这块 图像理解和视频理解 本身来说 其实都不需要 不需要单独的去安装的啊 就是你主要是接入的是minimax M3 因为minimax M3 它是个原始动模态的 原始动模态 就意味着是 它不光懂语言 它还能看得懂图片 它是有两种啊 一种是图像理解 一种是视频理解 这两个其实还有一些区别的 首先说一下啊 这个minimax的这个 其实我觉得还是很不错的啊 现在特别是 有了原始动模态这块 其实是完全是可以考虑 去使用一下这个 我因为我一直是在用这个minimax啊 特别是M3出来之后 这个我们接下来 图像理解和视频理解 都是要依赖它的 另外的话 minimax其实还提供了 这个语音合成的 这么一种能力啊 同样也是用 这个同一个coding plan 也是可以去使用的 好 我们简单说一下啊 关于这个图像理解 就是原生多摩菜里边图像理解和传统的这种图像识别是什么区别 传统的图像识别它最多是能识别出里边有哪些元素 但是原生多摩菜呢 其实不光能识别是元素能识别到很多细节啊 包括这些东西的一些相关的一些关系啊都能看到的 你比如说第一个例子啊 图中这是一个倒扣的水杯地面上有水渍 图中有杯子地面水桌子 这是传统的识别啊 然后原生多摩菜呢 是杯子不小心打翻漏水 水渍面积比较大 长期不撒会 它这反正是除了这个 这个东西发生这个事 它能知道是怎么发生的 然后呢还知道这个事的后果是什么 就特别像什么呢 像一个五岁的小孩 你去 他刚刚看到一些东西的时候 他可能只能知道这些东西是什么 也不会去反映啊 是怎么发生的件事 当然也会不会去考虑后果了 但是一个成年人就不一样了 他看到一个杯子放在这儿 一看可能就小朋友给打翻了啊 不小心给打翻了 然后要马上处理对吧 因为长衣不撒 可能会损上木地板 如果地板 这个木质的话对吧 大概就是这个逻辑 所以说这个东西 就是这个还是能能做很多事情的 然后呢我们再说一下 其实还有 大家可能有些是分不清 关于生图跟跟这个叫什么 视觉理解是什么区别啊 生图其实是是图像模型啊 是图像的模型 就是视觉理解 其实还是语言模型 就它俩什么区别呢 就是语言模型 有了原生多模态的视觉理解能力 相当于是你可以看成啊 它相当于是专业的一个评委啊 它对画面的构这种构成啊 或者审美啊 它都很不错啊 都能给你打打分 或者做个评价 但是它自己画不出来 就是说 你像minimax m3 m3啊 它就算是原生多模态 它指的是它有视觉理解能力啊 有图像和视频的理解能力 但是它做不了图 做不了视频 这就是说 为什么我们前面是用这个来 用用agnes去做生成 然后这个 生图和视频 这个好说了啊 就是 仗义理解 这边是评委 这边就是他能去 画出图啊 能就亲自去 就是画诗 能画图 能做视频的那个人啊 大家就这么理解 这里我做了一个例子啊 就是比如说我这给他了一个楼房的一个建筑草图啊 然后呢 我给他贴写是什么 帮我从进入学的视角吧 啊 帮我拆解一下 加入局部特写说明 然后写成一封HTM 啊 这个东西我给大家看一下啊 这个做的是 虽然我不是特别懂这个东西 但是感觉他做的还是好像是比较靠谱的 就是大家去理解一下 可能也不一定每个都那么准 但是什么叫视觉理解啊 嗯 这个理解绝对不是仅仅看到图片的几个东西啊 为止 而已 好 你看一下啊 这个啊 我们看一下 好 我把这个原图也放上来了 然后我们来看一下 你看他下面的拆解啊 这个屋顶防水排水 你看他把这块又给仔细化了一下 而且他给你拆解了一些关键点啊 这一块的关键点 包括什么露水高发区 也能分析出来 然后低机这块啊 也是重新画了一下低机的一块局部特写啊 这个做法要点之类的 创台是吧 你看 露梯 碰面 然后 这个什么阳台啊 什么 就是这个感觉 就是大家去理解一下这个视觉 视觉能量 但是这个东西它细节不一定对 但是有的时候可能给个参考也可以 或者说 嗯 这个可能跟原生冬光菜的理解能力的上限也有关系 但是你只要知道 原生你才能做的 而且 它不仅仅是识别个 它里边有什么东西的问题啊 好 然后我们再往下看一下 比如说这是一个视频的那个 仪仗截图 让他去看看他的 灯光是怎么布局的 对吧 大家就这个啊 你看 他这个 包括 主播被在哪儿 有个储物柜 储物柜也不后有储物柜嘛 对吧 然后大概 也不是完全准 反正你可以跟他磨一磨 有个东西能出来 就是 你看 主要我们去感受一下这种原生冬光菜 可能给我们带来的一种运用场景是什么 当我看到这个图书之后 哎 比如说我现在也想去做博主啊 做出镜的博主 那他这是怎么布局的 对吧 我想 看一看啊 所以说这个时候 他可能把这个东西拆下出来 用了什么样的灯 对吧 啊 包括设备的清单啊 包括这里怎么布局 对吧 哪些灯在哪 然后呢 这下边是大概预算是多少啊 大概就 就是 这个反正是我看了看 他做的并不是特别好 但是这个可能还是稍微复杂了一些 但是他也在努力做啊 觉得细节其实还是不太准的 好 然后呢 我们再去看一下这个视频理解啊 就首先是这个图像理解跟视频理解 你都是不用去做任何事情了 你只要把 比如说你的这个模型 你选的是这个M3就可以了 在这里选的是M3也可以了 好 然后我们再看一下这个视频理解啊 视频理解 其实本身来说 首先它是基于图像理解的 因为视频 我们就是 比如25人就一秒钟25张图嘛 但是这样的 Mini Max M3 是有视频理解的能力的 所以说 它比纯粹的 把视频切生图 来去分 注册分析 它是有区别的 因为它有时序的关联 有连续的动作捕捉 对吧 有些前一后果 才知道的 所以说 你比如说像我们这个 我们接下来做的 这个演示的这个视频 是用刘圈的一段魔术吗 我可以给大家看一下啊 接下来就是 见证奇迹的时刻了 白了 它变了一下牌 对吧 然后它后边其实是 因为它这里做了一个 其实是有一个柴姐的啊 因为它有高速摄像器 然后给拍了一下啊 所以说这个地方 但同样的啊 我告诉他用 minimax M3的视频理解能力 这个东西啊 就是 虽然刚才我们说了 你可能选上它啊 但是有的时候 它 它 它没有意识到它自己啊 特别刚开始的时候 没有意识到 它自己这个模型 已经是个 具备视频理解能力 它会去调不动插件 但是发现你的插件 没有啊 它就会乱七八糟干一顿啊 操作一顿 其实啥也没干 对吧 你看 我让它 利用M3的视频理解能力 去看一下这段视频 让它看明白 这个魔术是总变的 比真是一份 RTML 对吧 好 我们可以看一下啊 对 你看这段视频在这啊 视频原视频 我也给它放上来了 啊 这个视频的这个基本信息 对吧 然后呢 这个关键的发现啊 这里边就来了嘛 掩护动作什么东西的啊 右手内抠 它这个说的其实还挺靠谱的啊 这里也是同学们出来的 那看一下啊 刘签 好 我们看一下 对 你看 他把那个关键的图在这儿啊 找出来 哎 你看 这张又有了吗 对不对 图像中 撕牌的系 不是撕牌 就换牌的细节 然后完整的时间线 也可以拉出来了 对吧 而且标黄了 就是关键的那个几个 那个 那个三十魔术核心的那个点啊 包括观众大笑的反应 你看 不知道笑什么 就完全的视频 也相当于就是你这个人看完视频之后 你可以把里边的细节都描绘出来 因为这里边视频其实维度还挺多的 因为有画面有声音 比方说还有这个背景音之类的 对吧 你看这个分析的还是很细的 这所有的细节都分析出来了 这个东西呢 其实你可以用在很多地方啊 包括你去拆解一些 呃 学习的视频啊 就是活博者视频也是可以的 好 呃 这里的话 就是 这这两个其实是 主要你想想一想怎么去用一下了啊 这里这两个其实本身来说 你只要 用的主力模型是M3的话 基本上 你不用去做一些初始化的一些配置 最多就是你把这个 这句啊 强烈 如果他 没有主动去使用这个 视频理解能力的话 你可以视频理解和这个 图像理解能力的话 你可以给他明确加上这么一句啊 好 这样的话 图像理解和视频理解 我们都说完了 这样我们看一下语音和诚啊 语音和诚 其实是这个东西 是也是啊 同样是M3提供了一个 而且他 他提供这几个声音 相对来说 比那些免费的是要自然一些的 正好我们 用起来就比较好用 比如说我们之前说的 类似于是AI走私信的一种播报 或者是 我们每个小时 做了一些定时的商业情报的一种 搜集嘛 对吧 就是比如之前 我们说的超级秘书主动人格这样的 可以主动 当他发现对对有用的 主动给你推送了 除了文字之外 还可以给你推语音是吧 这样的话就是 方便你随时都可以听嘛 这个其实也很简单啊 就跟他是一样的 这里这波说的是 你用minimax TTS的API 使用文档 然后呢 这个参考用文档 帮帮我实现TTS的生生能力啊 就text to speech 文本转语音嘛 然后API key啊 我把那个minimax API key 同样放在一个文文件里边 对吧 完了之后也是 执行了一波操作吧 大概是完成了啊 完成了之后 你就可以啊 你就可以 你像我这个地方 做的测试是什么呢 直接使用这个minimax的TTS 这个生生对刚才视频 理解的核心结论 控制在50字里面 我这里用的就是那个 刘圈那个 就是那个刚才那个 魔术那个啊 你可以听一下 刘圈用普克牌 做静静魔术 再用千针 摄像机 慢放回放手法 嘉宾吐槽 你要毁了整个魔术行业 做笑点收尾 就是还有一些情绪 可以吧 还可以啊 他能用有 就这里我还搞了一个文档啊 到时候大家可以看一下 他一共是有一些这个 这里我是 这个文档是Hermis去使用TTS的 这个生意 就那些编码的都去掉了 所以说我们可以看一下 你比如说他这里有千荒的音色 对吧 这些音色 你可以直接 把某个音色 那个给他啊 男生 首先男生和女生 你可以给他说的 然后你可以直接指定一个音色来可以啊 默认模型的话 就是现在都是2.8了 对吧 就是啊 包括你看 怎么去触发 让他去去用这个TTS来给你生成啊 生成完了之后是得了一个MP3文件啊 也是比较简单 好 那么大概就是这些吧 大概就这些 然后 有我就使用到了两个模型啊 一个Argnes 一个是minimax的M3 Argnes的话 他是有图片生成和视频生成啊 然后他其实也带文本模型啊 也可以去 比如说你的特论不会用了 或者怎么样 或者是一开始你不打算用这个这个M3的话 你可以一个这个Argnes 基本上也可以保证你的Hermes能去使用了啊 只不过是 如果你做的事情复杂一点 他请求次数比较多的话 你可能会觉得这个他的文本模型比较慢 图片和视频无所谓啊 因为他本身就是需要时间的 然后这是一个 再一个就是minimax的这个M3 他是他是一个原 因为他是原生多模态嘛 所以说他有图像理解和视频理解的能力 另外呢 就是minimax本身 额外提供了一个这个语音合成的一个能力 可以我们也去接触使用 这样的话 就是生图生视频 然后图片理解 视频理解啊 就是这种多模态能力就有了 而且我们还加了一个语音的一个能力啊 语音生成的能力 好吧 大概就这样 然后你有了这些能力之后 你可以自由去组合去这些事情了啊 你比如说 你像我们之前这里边说的这个啊 这个AI找资讯啊 你比如说你这个整个过程 你要去呃这个 采集信息啊 你的应用采集信息 完了之后呢 就给你把这个找资讯的这个 一天外给你做出来 然后呢 你还可以生成一段语音 对吧 然后你甚至如果说 我们去做一些其他东西的话 我还可以生成配图 对吧 或者是你比如说 你给他一段视频 或者让你的应用呢 去下载了一段视频 然后他让他自己通 介入视频理解能力 然后他去 介入视频理解能力啊 然后他去把整个视频看一遍 然后他把要点给你组约出来 然后呢 再给你生成一份这个 这个视频的一个报告 或者一个学习的报告 然后再把里边关键点啊 给你做成语音 所以整个这个过程 你就非常非常的一种 可以 更多的一种 那个操作这个空间啊 就是一些灵活组合的方式 可以做出很好的体验的应用来 好吧 那今天就讲这些吧 大家可以去听一听啊 就是通过这样的方式 把你的Hemis 打造成一个接近满血的 一个全模态的一种状态 好吧