1
00:00:09,400 --> 00:00:28,450
朋友们我的显卡已经两天没合眼了 事情是这样子的 MiniMax 发布了一款开源的SOTA级别的视频 生成模型 MiniMax H3 开源前夜 我拿了一条过去的旧AI视频 丢给H3去重做 原本啊我只是想跑一条试试 结果效果一出来

2
00:00:28,450 --> 00:00:46,583
我就坐不住了 我把过去全部的都重跑了一遍 做完天都快亮了 我当时脑子里就只有一个想法 后悔我之前付给SD钱能退吗 那个时候权重还没放出来 于是我就苦等啊 等了好几天 他还跳票了好几次

3
00:00:46,783 --> 00:01:05,383
最后他终于来了 我第一时间就把这个权重 塞进了我的显卡 从那一刻起到现在 我的GPU 就没有停过 所以先下结论啊 MiniMax H3 就是开放权重视频模型的 DeepSeek 时刻 今天这期视频有点长 建议先点个收藏啊 我讲三件事

4
00:01:05,383 --> 00:01:24,700
他能干什么 他改变了什么 还有最重要的 你应该做什么 之前看我视频 跟风买了RTX Pro6000的朋友 请现在把笑哭了打在公屏上 那这个模型参数我就不念了 先说一个 它和以前所有视频模型 不太一样的地方 以前视频模型吧 你得按他的规矩来

5
00:01:25,100 --> 00:01:43,466
文生视频一个入口 图生视频一个入口 你想搞点复杂 你就得接各种工作流 对吧每个模型只干一件事 但H3不一样 他文字图片视频声音你随便组合 你扔给他 然后用大白话告诉它 你要什么 官方说法 这叫统一的多模态上下文 说人话

6
00:01:43,466 --> 00:02:02,433
他就是个会看会听会拍的创作者 他还有个名字叫迈向 更通用的多模态智能 他做的片子全部都自带声音 对白音效 BGM 一次生成 口型也能对上 11种语言都能说 你给他一段参考音频 他连音色都能给你换掉

7
00:02:02,750 --> 00:02:21,266
这事能成 是因为画面和声音 是在同一个模型里 一起长出来的 所以口型呼吸环境天然就是咬合的 虽然说单条最长是15秒 你别嫌短 因为广告啊 DEMO 啊 片头都够用了 先看一个我自己做的demo 讲个故事

8
00:02:21,266 --> 00:02:41,383
我以前是个剧本杀作者 我以前写过一个叫未接来电的本 可惜那个时候没有这种模型啊 物料全部都是手搓的 我把角色卡和主持人手册都丢给了Image2 先生成了一套风格图 然后再丢给了H3 等了不到十分钟 一条768p 的宣传片就出来了

9
00:02:41,633 --> 00:02:59,633
说实话看到成片的那一刻 我挺感慨的 当年的遗憾啊 现在十分钟就补上了 随后啊我就突发奇想 不如让AI来发挥一下创意 不断的Push这个模型的边界 于是我就给他定了一个通宵抽卡任务 看看他能做出来什么 哇早上起来时候我被惊到了

10
00:02:59,633 --> 00:03:19,266
37条作品 没有一个重复的 也没有废片 各种各样AI的奇思妙想 如果用官方的768p 最低价算两毛三分钱 这一晚上也就消耗了百来块钱 但这么高的成功率和丰富的艺术表达 在过往的开源模型上都从来没见过

11
00:03:19,266 --> 00:03:39,016
我又看了一下官方的demo 啊 那个就更惊艳了 如果你做tvc 广告 或者是电商产品游戏demo 或者是产品demo 我很想说 H3已经杀死比赛了 在这样的成本下 你很难再回归手搓了 还有一个我特别喜欢的能力 视频编辑有一次我录口播录错了

12
00:03:39,016 --> 00:03:57,216
但我录制时穿的衣服 刚丢进洗衣机 那我就直接给一段素材 再给一段重录的语音 你们看看这段 随时都可以换一身衣服 丰富的艺术表达加上这种随意的编辑 可以让每一条素材 都可以充分发挥它的价值 ok 爽片咱们放完了 咱们说点硬的

13
00:03:57,216 --> 00:04:17,383
大家肯定想知道本地跑的效果如何 以我这台Pro6000为例吧 我这边测到的极致速度是1088P的 十秒可以24分钟搞定 但是你要知道 H3刚出来那个早上啊 768p 的分辨率也要这么长时间 但是没有想到H3的社区如此热情

14
00:04:17,466 --> 00:04:35,733
很快的各种优化方案都出来了 什么Sage Attention 啊 Easy Cache FBC （First Block Cache） 我就跟着社区一路换方案 不到48小时 生成速度直接翻了一倍 而且这个优化节奏 我觉得根本不会停啊 社区太狂热了 但是啊这件事本身比速度更重要

15
00:04:35,733 --> 00:04:54,450
因为权重放出来 全世界最聪明的一群人 就开始帮你免费优化 这在闭源模型上永远都不可能会发生 对吧更厉害的是 8月3日开源的当天 各种芯片厂商推理框架都同一天宣布 适配 ComfyUI当天就能跑 于是卖课的 卖提示词的

16
00:04:54,450 --> 00:05:13,733
连夜上架玩ComfyUI的那些朋友 疯狂的持续输出 只有公认的顶级开源 才能一夜之间有这样的生态出现 所以 我们得给 MiniMax点一个大大的赞 现在视频生成这个领域 是被闭源模型垄断了 对吧像极了 ChatGPT 时刻

17
00:05:13,733 --> 00:05:32,850
刚刚发生的那段日子 大家又兴奋又焦虑对不对 而 MiniMax 他没有选择去成为 Anthropic 他选择了做 DeepSeek 把智能平权交给每一个人 把机会平权交给每一个人 所以看到这里的朋友 请把感谢打在公屏上吧 好接下来我想说的是这

18
00:05:33,066 --> 00:05:51,350
智能平权会带来多大的机会和变革 这是我们每个人都不能忽视的 大家都想在AI时代赚钱对不对 但是咱不能总盯着提效生产力 因为产品会被海量的生产出来 但传播和获客依旧是最难的 你依然需要获得注意力 而每一次内容形式的升级

19
00:05:51,350 --> 00:06:12,033
都会带来注意力的重新分配 SD 2.0 SD 2.5 解决了AI视频能不能进生产线 的问题 但它没解决另一个问题 普通人的试错成本太高了 过去几个月啊 少数付得起抽卡费的人 先掌握了这个技巧 他们的内容越来越精彩了 你刷到那些用AI参与叙事的博主

20
00:06:12,033 --> 00:06:32,100
是真的做的好 但是你们看不到的是他们背后的账单 而更多的人 是被那个恐怖的成本吓得站在了门外 而H3呢 把试错成本第一次打到了电费级别 刚才说的社区爆发就是因为这个原因 我自己就是个样本啊 我的GPU 48小时就没停 每做一条我的提示词就准一分

21
00:06:32,233 --> 00:06:52,100
我的经验就增长一分 而且这一次 经验的传播速度会比上次快的多 因为一起试错的人 多了好几个数量级 更好的镜头 更好的叙事 会一波一波的冒出来 我不敢说H3的出现 会让每个用AI做视频的人 都会变得更好 但它一定会导致注意力的重新分配

22
00:06:52,266 --> 00:07:11,433
所以为什么我最近睡眠也少 就是因为在用电力和时间 抢跑这波经验差 我的视频制作流程 其实一大半 已经被Hyperframe 这样的AI工作流接管了 如果这套H3流程跑通 那剩下的也全都交出去了 所以 我永远都是那句 得赶快行动起来啊朋友们 但是有卡的朋友们

23
00:07:11,433 --> 00:07:31,500
我先泼个冷水啊 本地部署并不是生产级内容的解法 这次MiniMax 有两个重要的模块没有开源 一个是Context-IR 就是一个云端的 更智能理解素材的中间服务 它可以返回复杂逻辑推理生成的结构化提示词 它不是简单把提示词写得更长

24
00:07:32,300 --> 00:07:51,633
而是先判断什么该保留 什么该改变 我做了一个雨夜小提琴的编辑测试（让主角换成红色雨衣） 如果只用简单提示词加原视频 衣服虽然成功变成了红色雨衣 但运镜完全变了（角色动作也变了） 我再用Context-IR重新生成提示词 看到没有 人物场景和镜头运动

25
00:07:51,633 --> 00:08:11,466
都跟原片保持一致了 还有一个是 Regenerate-2K的超分模型没开源 H3是一个原生768P的 而云端 api 是通过 Regenerate-2K的超分模型 提升到2K分辨率的 它的计算快 成本也低 本地只能说是你能输出1088P

26
00:08:11,466 --> 00:08:30,633
但细节提升是非常有限的 完全达不到云端那个效果 而且我试了其他的超分也完全不可用 而且1088P的时间成本 是768P的三倍 所以开源部署的版本 是完全没法和官方的2K比质量的 这是事实 所以本地部署的朋友 咱们把定位搞清楚 本地是用来刷经验试错

27
00:08:30,833 --> 00:08:49,200
不是用来搞生产力的 你早点跑通一条路径 产出高质量的内容 和收益挂钩才是最优先的 跑通了这个token 就是杠杆 跑不通那就是烧token交学费 我现在策略就是 一边拼命的找各种case 验证提炼工作流 另外我会本地出768p

28
00:08:49,200 --> 00:09:09,333
买api 超分到2K 按实际的用量走 等我的业务量大了 稳定了消耗的多了 我也会考虑要不要直接买MiniMax Design包月包年 直接出 包年版 简直是个价格屠夫 它输出2K 四毛钱一秒 在影视短剧漫剧之外的行业 我可以说 sd 2.5的价格是毫无竞争力

29
00:09:09,433 --> 00:09:27,633
如果你是原先就有业务 那你就直接走api 得了 用Context-IR的api 可以对复杂素材做理解 生成复杂的提示词 你甚至可以先用本地抽卡 再调用2K 超分api 来提升质量 而且api 是更灵活的 它能接入你的自动化工作流

30
00:09:27,750 --> 00:09:47,683
总之就是赶快动起来 现在MiniMax Design 上有三次的免费生成 海螺AI也能直接玩 你先得把你第一条片子做出来对吧 产品demo 或者是品牌story 或者是你就是随便想找个提示词玩玩 随便出都可以 但我的建议就是 你得早点开始建立自己的内容体系 尤其是闷头做产品的程序员朋友们

31
00:09:47,683 --> 00:10:05,900
现在是做内容门槛最低的时代了 你得早点尝试建立自己的流量 否则以后就得找博主来买流量 那我们交好学费 跑完试错后 应该进一步的提高内容的质量 因为内容生产的成本大幅的降低 试错成本也大幅降低 所以市场上的内容数量和质量

32
00:10:05,916 --> 00:10:24,350
都会水涨船高 那我们人类是会审美疲劳的 酷炫效果几天就看腻了对吧 我们最后还是会回归到更好的镜头 表达更好的叙事中 所以我认为啊 注意力的重新分配 也是有窗口期的 过了这段时间还是得内容为王 所以 我也在探索其他的产出创意的方式

33
00:10:24,366 --> 00:10:43,350
比如说更好的工具啊 能帮你快速提升内容质量的产品呀 能扮演导演和编剧的agent 除了MiniMax Design 如果大家有经常在用的 也可以在评论区告诉我 结尾我还有一个预判啊 视频生成这条路 最终还是会回到Agent指挥视频模型生成一切的

34
00:10:43,350 --> 00:11:03,900
我绝对相信马斯克说的 我们现在 已经处于技术发展的奇点时刻了 用技术加速 技术 肯定是趋势 而MiniMax 呢 有视频生成模型 有MiniMax Design这个数据平台 他们没有理由不把导演编剧的能力 训练到M系列语言模型里的 所以我坚定看好M系列的后续更新

35
00:11:03,950 --> 00:11:23,466
也许几个月半年后 我就再也不用去搞提示词了 AI就搞定一切的内容 在那之前 谁有更多的注意力 那个时刻一到来 就会更多的被技术加速 这就是指数型世界的特点 所以H3这波机会你们看懂了吗 好了以上就是本期的全部内容了

36
00:11:23,466 --> 00:11:24,016
谢谢大家
