實際影片長度:11:24.000。原文、繁中、雙語可點擊句子跳轉影片。
0:09.400–0:12.201
zh朋友们我的显卡已经两天没合眼了
0:12.201–0:13.509
zh事情是这样子的
0:13.509–0:20.419
zhMiniMax 发布了一款开源的SOTA级别的视频 生成模型 MiniMax H3
0:20.419–0:24.901
zh开源前夜 我拿了一条过去的旧AI视频 丢给H3去重做
0:24.901–0:28.450
zh原本啊我只是想跑一条试试 结果效果一出来
0:28.450–0:29.761
zh我就坐不住了
0:29.761–0:32.601
zh我把过去全部的都重跑了一遍
0:32.601–0:34.130
zh做完天都快亮了
0:34.130–0:39.810
zh我当时脑子里就只有一个想法 后悔我之前付给SD钱能退吗
0:39.810–0:46.783
zh那个时候权重还没放出来 于是我就苦等啊 等了好几天 他还跳票了好几次
0:46.783–0:48.059
zh最后他终于来了
0:48.059–0:51.342
zh我第一时间就把这个权重 塞进了我的显卡
0:51.342–0:54.624
zh从那一刻起到现在 我的GPU 就没有停过
0:54.624–1:01.371
zh所以先下结论啊 MiniMax H3 就是开放权重视频模型的 DeepSeek 时刻
1:01.371–1:04.471
zh今天这期视频有点长 建议先点个收藏啊
1:04.471–1:05.383
zh我讲三件事
1:05.383–1:09.574
zh他能干什么 他改变了什么 还有最重要的 你应该做什么
1:09.574–1:15.953
zh之前看我视频 跟风买了RTX Pro6000的朋友 请现在把笑哭了打在公屏上
1:15.953–1:18.140
zh那这个模型参数我就不念了
1:18.140–1:21.966
zh先说一个 它和以前所有视频模型 不太一样的地方
1:21.966–1:25.100
zh以前视频模型吧 你得按他的规矩来
1:25.100–1:28.129
zh文生视频一个入口 图生视频一个入口
1:28.129–1:33.052
zh你想搞点复杂 你就得接各种工作流 对吧每个模型只干一件事
1:33.052–1:36.839
zh但H3不一样 他文字图片视频声音你随便组合
1:36.839–1:40.058
zh你扔给他 然后用大白话告诉它 你要什么
1:40.058–1:42.898
zh官方说法 这叫统一的多模态上下文
1:42.898–1:43.466
zh说人话
1:43.466–1:46.483
zh他就是个会看会听会拍的创作者
1:46.483–1:50.363
zh他还有个名字叫迈向 更通用的多模态智能
1:50.363–1:56.614
zh他做的片子全部都自带声音 对白音效 BGM 一次生成 口型也能对上
1:56.614–1:58.338
zh11种语言都能说
1:58.338–2:02.750
zh你给他一段参考音频 他连音色都能给你换掉
2:02.750–2:08.159
zh这事能成 是因为画面和声音 是在同一个模型里 一起长出来的
2:08.159–2:11.280
zh所以口型呼吸环境天然就是咬合的
2:11.280–2:17.729
zh虽然说单条最长是15秒 你别嫌短 因为广告啊 DEMO 啊 片头都够用了
2:17.729–2:21.266
zh先看一个我自己做的demo 讲个故事
2:21.266–2:23.182
zh我以前是个剧本杀作者
2:23.182–2:30.079
zh我以前写过一个叫未接来电的本 可惜那个时候没有这种模型啊 物料全部都是手搓的
2:30.079–2:35.827
zh我把角色卡和主持人手册都丢给了Image2 先生成了一套风格图
2:35.827–2:41.633
zh然后再丢给了H3 等了不到十分钟 一条768p 的宣传片就出来了
2:41.633–2:47.050
zh说实话看到成片的那一刻 我挺感慨的 当年的遗憾啊 现在十分钟就补上了
2:47.050–2:53.167
zh随后啊我就突发奇想 不如让AI来发挥一下创意 不断的Push这个模型的边界
2:53.167–2:57.536
zh于是我就给他定了一个通宵抽卡任务 看看他能做出来什么
2:57.536–2:59.633
zh哇早上起来时候我被惊到了
2:59.633–3:03.301
zh37条作品 没有一个重复的 也没有废片
3:03.301–3:05.674
zh各种各样AI的奇思妙想
3:05.674–3:12.578
zh如果用官方的768p 最低价算两毛三分钱 这一晚上也就消耗了百来块钱
3:12.578–3:19.266
zh但这么高的成功率和丰富的艺术表达 在过往的开源模型上都从来没见过
3:19.266–3:23.142
zh我又看了一下官方的demo 啊 那个就更惊艳了
3:23.142–3:28.864
zh如果你做tvc 广告 或者是电商产品游戏demo 或者是产品demo
3:28.864–3:31.264
zh我很想说 H3已经杀死比赛了
3:31.264–3:34.217
zh在这样的成本下 你很难再回归手搓了
3:34.217–3:39.016
zh还有一个我特别喜欢的能力 视频编辑有一次我录口播录错了
3:39.016–3:41.746
zh但我录制时穿的衣服 刚丢进洗衣机
3:41.746–3:45.204
zh那我就直接给一段素材 再给一段重录的语音
3:45.204–3:48.116
zh你们看看这段 随时都可以换一身衣服
3:48.116–3:54.486
zh丰富的艺术表达加上这种随意的编辑 可以让每一条素材 都可以充分发挥它的价值
3:54.486–3:57.216
zhok 爽片咱们放完了 咱们说点硬的
3:57.216–4:00.182
zh大家肯定想知道本地跑的效果如何
4:00.182–4:08.288
zh以我这台Pro6000为例吧 我这边测到的极致速度是1088P的 十秒可以24分钟搞定
4:08.288–4:14.417
zh但是你要知道 H3刚出来那个早上啊 768p 的分辨率也要这么长时间
4:14.417–4:17.466
zh但是没有想到H3的社区如此热情
4:17.466–4:26.150
zh很快的各种优化方案都出来了 什么Sage Attention 啊 Easy Cache FBC (First Block Cache)
4:26.150–4:30.193
zh我就跟着社区一路换方案 不到48小时 生成速度直接翻了一倍
4:30.193–4:33.637
zh而且这个优化节奏 我觉得根本不会停啊 社区太狂热了
4:33.637–4:35.733
zh但是啊这件事本身比速度更重要
4:35.733–4:40.699
zh因为权重放出来 全世界最聪明的一群人 就开始帮你免费优化
4:40.699–4:44.137
zh这在闭源模型上永远都不可能会发生 对吧
4:44.137–4:52.540
zh更厉害的是 8月3日开源的当天 各种芯片厂商推理框架都同一天宣布 适配 ComfyUI当天就能跑
4:52.540–4:55.221
zh于是卖课的 卖提示词的 连夜上架
4:55.221–4:59.078
zh玩ComfyUI的那些朋友 疯狂的持续输出
4:59.078–5:03.513
zh只有公认的顶级开源 才能一夜之间有这样的生态出现
5:03.513–5:07.370
zh所以 我们得给 MiniMax点一个大大的赞
5:07.370–5:13.733
zh现在视频生成这个领域 是被闭源模型垄断了 对吧像极了 ChatGPT 时刻
5:13.733–5:17.241
zh刚刚发生的那段日子 大家又兴奋又焦虑对不对
5:17.241–5:23.905
zh而 MiniMax 他没有选择去成为 Anthropic 他选择了做 DeepSeek
5:23.905–5:27.764
zh把智能平权交给每一个人 把机会平权交给每一个人
5:27.764–5:31.096
zh所以看到这里的朋友 请把感谢打在公屏上吧
5:31.096–5:32.850
zh好接下来我想说的是这
5:33.066–5:35.781
zh智能平权会带来多大的机会和变革
5:35.781–5:38.135
zh这是我们每个人都不能忽视的
5:38.135–5:40.669
zh大家都想在AI时代赚钱对不对
5:40.669–5:43.023
zh但是咱不能总盯着提效生产力
5:43.023–5:45.376
zh因为产品会被海量的生产出来
5:45.376–5:47.548
zh但传播和获客依旧是最难的
5:47.548–5:49.359
zh你依然需要获得注意力
5:49.359–5:51.350
zh而每一次内容形式的升级
5:51.350–5:53.606
zh都会带来注意力的重新分配
5:53.606–5:58.119
zhSD 2.0 SD 2.5 解决了AI视频能不能进生产线
5:58.119–5:58.683
zh的问题
5:58.683–6:00.563
zh但它没解决另一个问题
6:00.563–6:02.632
zh普通人的试错成本太高了
6:02.632–6:03.760
zh过去几个月啊
6:03.760–6:05.640
zh少数付得起抽卡费的人
6:05.640–6:07.144
zh先掌握了这个技巧
6:07.144–6:09.213
zh他们的内容越来越精彩了
6:09.213–6:12.033
zh你刷到那些用AI参与叙事的博主
6:12.033–6:13.108
zh是真的做的好
6:13.108–6:15.975
zh但是你们看不到的是他们背后的账单
6:15.975–6:16.871
zh而更多的人
6:16.871–6:19.737
zh是被那个恐怖的成本吓得站在了门外
6:19.737–6:20.454
zh而H3呢
6:20.454–6:23.142
zh把试错成本第一次打到了电费级别
6:23.142–6:26.008
zh刚才说的社区爆发就是因为这个原因
6:26.008–6:27.621
zh我自己就是个样本啊
6:27.621–6:29.771
zh我的GPU 48小时就没停
6:29.771–6:32.233
zh每做一条我的提示词就准一分
6:32.233–6:33.936
zh我的经验就增长一分
6:33.936–6:34.882
zh而且这一次
6:34.882–6:37.531
zh经验的传播速度会比上次快的多
6:37.531–6:39.045
zh因为一起试错的人
6:39.045–6:40.558
zh多了好几个数量级
6:40.558–6:41.504
zh更好的镜头
6:41.504–6:42.450
zh更好的叙事
6:42.450–6:44.153
zh会一波一波的冒出来
6:44.153–6:45.856
zh我不敢说H3的出现
6:45.856–6:48.127
zh会让每个用AI做视频的人
6:48.127–6:49.262
zh都会变得更好
6:49.262–6:52.266
zh但它一定会导致注意力的重新分配
6:52.266–6:54.249
zh所以为什么我最近睡眠也少
6:54.249–6:56.066
zh就是因为在用电力和时间
6:56.066–6:57.223
zh抢跑这波经验差
6:57.223–6:58.545
zh我的视频制作流程
6:58.545–6:59.371
zh其实一大半
6:59.371–7:01.519
zh已经被Hyperframe
7:01.519–7:03.337
zh这样的AI工作流接管了
7:03.337–7:04.989
zh如果这套H3流程跑通
7:04.989–7:06.806
zh那剩下的也全都交出去了
7:06.806–7:07.137
zh所以
7:07.137–7:08.294
zh我永远都是那句
7:08.294–7:10.111
zh得赶快行动起来啊朋友们
7:10.111–7:11.433
zh但是有卡的朋友们
7:11.433–7:12.734
zh我先泼个冷水啊
7:12.734–7:15.521
zh本地部署并不是生产级内容的解法
7:15.521–7:17.193
zh这次MiniMax
7:17.193–7:19.423
zh有两个重要的模块没有开源
7:19.423–7:21.838
zh一个是Context-IR
7:21.838–7:23.139
zh就是一个云端的
7:23.139–7:25.368
zh更智能理解素材的中间服务
7:25.368–7:29.085
zh它可以返回复杂逻辑推理生成的结构化提示词
7:29.085–7:32.300
zh它不是简单把提示词写得更长
7:32.300–7:33.967
zh而是先判断什么该保留
7:33.967–7:34.800
zh什么该改变
7:34.800–7:39.133
zh我做了一个雨夜小提琴的编辑测试(让主角换成红色雨衣)
7:39.133–7:41.300
zh如果只用简单提示词加原视频
7:41.300–7:43.466
zh衣服虽然成功变成了红色雨衣
7:43.466–7:46.133
zh但运镜完全变了(角色动作也变了)
7:46.133–7:49.466
zh我再用Context-IR重新生成提示词
7:49.466–7:50.133
zh看到没有
7:50.133–7:51.633
zh人物场景和镜头运动
7:51.633–7:53.301
zh都跟原片保持一致了
7:53.301–7:54.228
zh还有一个是
7:54.228–7:58.120
zhRegenerate-2K的超分模型没开源
7:58.120–8:00.345
zhH3是一个原生768P的
8:00.345–8:00.901
zh而云端
8:00.901–8:01.457
enapi
8:01.457–8:02.013
zh是通过
8:02.013–8:05.349
zhRegenerate-2K的超分模型
8:05.349–8:07.017
zh提升到2K分辨率的
8:07.017–8:07.944
zh它的计算快
8:07.944–8:08.686
zh成本也低
8:08.686–8:11.466
zh本地只能说是你能输出1088P
8:11.466–8:13.332
zh但细节提升是非常有限的
8:13.332–8:15.198
zh完全达不到云端那个效果
8:15.198–8:17.912
zh而且我试了其他的超分也完全不可用
8:17.912–8:19.947
zh而且1088P的时间成本
8:19.947–8:21.304
zh是768P的三倍
8:21.304–8:22.831
zh所以开源部署的版本
8:22.831–8:25.375
zh是完全没法和官方的2K比质量的
8:25.375–8:26.053
zh这是事实
8:26.053–8:27.580
zh所以本地部署的朋友
8:27.580–8:28.937
zh咱们把定位搞清楚
8:28.937–8:30.833
zh本地是用来刷经验试错
8:30.833–8:32.438
zh不是用来搞生产力的
8:32.438–8:34.043
zh你早点跑通一条路径
8:34.043–8:35.469
zh产出高质量的内容
8:35.469–8:37.431
zh和收益挂钩才是最优先的
8:37.431–8:39.214
zh跑通了这个token
8:39.214–8:39.927
zh就是杠杆
8:39.927–8:42.602
zh跑不通那就是烧token交学费
8:42.602–8:43.850
zh我现在策略就是
8:43.850–8:45.990
zh一边拼命的找各种case
8:45.990–8:47.238
zh验证提炼工作流
8:47.238–8:49.200
zh另外我会本地出768p
8:49.200–8:49.906
zh买api
8:49.906–8:50.789
zh超分到2K
8:50.789–8:52.026
zh按实际的用量走
8:52.026–8:53.439
zh等我的业务量大了
8:53.439–8:54.851
zh稳定了消耗的多了
8:54.851–8:59.796
zh我也会考虑要不要直接买MiniMax Design包月包年
8:59.796–9:00.326
zh直接出
9:00.326–9:00.856
zh包年版
9:00.856–9:02.269
zh简直是个价格屠夫
9:02.269–9:03.152
zh它输出2K
9:03.152–9:04.035
zh四毛钱一秒
9:04.035–9:06.154
zh在影视短剧漫剧之外的行业
9:06.154–9:06.861
zh我可以说
9:06.861–9:09.433
zhsd 2.5的价格是毫无竞争力
9:09.433–9:11.217
zh如果你是原先就有业务
9:11.217–9:12.823
zh那你就直接走api
9:12.823–9:13.180
zh得了
9:13.180–9:15.857
zh用Context-IR的api
9:15.857–9:17.641
zh可以对复杂素材做理解
9:17.641–9:19.068
zh生成复杂的提示词
9:19.068–9:21.031
zh你甚至可以先用本地抽卡
9:21.031–9:21.923
zh再调用2K
9:21.923–9:22.815
zh超分api
9:22.815–9:23.708
zh来提升质量
9:23.708–9:24.600
zh而且api
9:24.600–9:25.492
zh是更灵活的
9:25.492–9:27.750
zh它能接入你的自动化工作流
9:27.750–9:29.109
zh总之就是赶快动起来
9:29.109–9:31.374
zh现在MiniMax Design
9:31.374–9:32.733
zh上有三次的免费生成
9:32.733–9:34.092
zh海螺AI也能直接玩
9:34.092–9:36.357
zh你先得把你第一条片子做出来对吧
9:36.357–9:37.263
zh产品demo
9:37.263–9:38.774
zh或者是品牌story
9:38.774–9:41.190
zh或者是你就是随便想找个提示词玩玩
9:41.190–9:42.096
zh随便出都可以
9:42.096–9:43.153
zh但我的建议就是
9:43.153–9:45.418
zh你得早点开始建立自己的内容体系
9:45.418–9:47.683
zh尤其是闷头做产品的程序员朋友们
9:47.683–9:50.208
zh现在是做内容门槛最低的时代了
9:50.208–9:52.553
zh你得早点尝试建立自己的流量
9:52.553–9:54.898
zh否则以后就得找博主来买流量
9:54.898–9:56.160
zh那我们交好学费
9:56.160–9:57.062
zh跑完试错后
9:57.062–9:59.407
zh应该进一步的提高内容的质量
9:59.407–10:01.932
zh因为内容生产的成本大幅的降低
10:01.932–10:03.555
zh试错成本也大幅降低
10:03.555–10:05.916
zh所以市场上的内容数量和质量
10:05.916–10:06.980
zh都会水涨船高
10:06.980–10:09.107
zh那我们人类是会审美疲劳的
10:09.107–10:11.234
zh酷炫效果几天就看腻了对吧
10:11.234–10:13.892
zh我们最后还是会回归到更好的镜头
10:13.892–10:15.310
zh表达更好的叙事中
10:15.310–10:16.374
zh所以我认为啊
10:16.374–10:17.792
zh注意力的重新分配
10:17.792–10:19.033
zh也是有窗口期的
10:19.033–10:21.337
zh过了这段时间还是得内容为王
10:21.337–10:21.691
zh所以
10:21.691–10:24.366
zh我也在探索其他的产出创意的方式
10:24.366–10:25.878
zh比如说更好的工具啊
10:25.878–10:28.398
zh能帮你快速提升内容质量的产品呀
10:28.398–10:30.750
zh能扮演导演和编剧的agent
10:30.750–10:33.270
zh除了MiniMax Design
10:33.270–10:34.950
zh如果大家有经常在用的
10:34.950–10:36.630
zh也可以在评论区告诉我
10:36.630–10:38.310
zh结尾我还有一个预判啊
10:38.310–10:39.486
zh视频生成这条路
10:39.486–10:43.350
zh最终还是会回到Agent指挥视频模型生成一切的
10:43.350–10:45.092
zh我绝对相信马斯克说的
10:45.092–10:45.788
zh我们现在
10:45.788–10:48.226
zh已经处于技术发展的奇点时刻了
10:48.226–10:49.097
zh用技术加速
10:49.097–10:49.445
zh技术
10:49.445–10:50.316
zh肯定是趋势
10:50.316–10:51.883
zh而MiniMax 呢
10:51.883–10:53.103
zh有视频生成模型
10:53.103–10:56.586
zh有MiniMax Design这个数据平台
10:56.586–10:59.198
zh他们没有理由不把导演编剧的能力
10:59.198–11:01.288
zh训练到M系列语言模型里的
11:01.288–11:03.950
zh所以我坚定看好M系列的后续更新
11:03.950–11:05.543
zh也许几个月半年后
11:05.543–11:07.933
zh我就再也不用去搞提示词了
11:07.933–11:09.924
zhAI就搞定一切的内容
11:09.924–11:10.721
zh在那之前
11:10.721–11:12.314
zh谁有更多的注意力
11:12.314–11:13.708
zh那个时刻一到来
11:13.708–11:15.699
zh就会更多的被技术加速
11:15.699–11:17.890
zh这就是指数型世界的特点
11:17.890–11:20.678
zh所以H3这波机会你们看懂了吗
11:20.678–11:23.466
zh好了以上就是本期的全部内容了
11:23.466–11:24.000
zh谢谢大家
0:09.400–0:12.201
朋友們,我的顯示卡已經兩天沒休息了
0:12.201–0:13.509
事情是這樣的
0:13.509–0:20.419
MiniMax 發布了一款開源的 SOTA 級別視頻生成模型 MiniMax H3
0:20.419–0:24.901
在開源的前一夜,我拿了一條舊的 AI 視頻交給 H3 重新生成
0:24.901–0:28.450
原本我只是想跑一條試試,結果效果一出來
0:28.450–0:29.761
我就坐不住了
0:29.761–0:32.601
我把過去所有的都重新跑了一遍
0:32.601–0:34.130
做完時天都快亮了
0:34.130–0:39.810
當時我腦子裡只有一個想法:後悔我之前付給 SD 的錢能退嗎
0:39.810–0:46.783
當時權重還沒放出來,於是我就苦等啊,等了好幾天,它還跳票了好幾次
0:46.783–0:48.059
最後它終於來了
0:48.059–0:51.342
我第一時間就把這個權重塞進了我的顯示卡
0:51.342–0:54.624
從那一刻起到現在,我的 GPU 就沒有停過
0:54.624–1:01.371
所以先下結論,MiniMax H3 就是開放權重視頻模型的 DeepSeek 時刻
1:01.371–1:04.471
今天這期視頻有點長,建議先點個收藏啊
1:04.471–1:05.383
我講三件事
1:05.383–1:09.574
它能做什麼、它改變了什麼,還有最重要的,你應該做什麼
1:09.574–1:15.953
之前看我視頻,跟風買了 RTX Pro6000 的朋友,請現在把笑哭了打在公屏上
1:15.953–1:18.140
那這個模型的參數我就不念了
1:18.140–1:21.966
先說一個,它和以前所有視頻模型不太一樣的地方
1:21.966–1:25.100
以前的影片模型啊,你得按照它的規則來操作
1:25.100–1:28.129
文字生成影片有一個入口,圖片生成影片有另一個入口
1:28.129–1:33.052
如果你想搞點複雜的,你就得接各種工作流,對吧?每個模型只做一件事
1:33.052–1:36.839
但 H3 不一樣,文字、圖片、影片、聲音你可以隨意組合
1:36.839–1:40.058
你丟給它,然後用大白話告訴它,你想要什麼
1:40.058–1:42.898
官方說法,這叫統一的多模態上下文
1:42.898–1:43.466
說人話
1:43.466–1:46.483
它就是一個會看、會聽、會拍的創作者
1:46.483–1:50.363
它還有一個名字叫邁向更通用的多模態智能
1:50.363–1:56.614
它製作的影片全都自帶聲音,對白、音效、BGM 一次生成,口型也能對上
1:56.614–1:58.338
11 種語言都能說
1:58.338–2:02.750
你給它一段參考音訊,它連音色都能給你換掉
2:02.750–2:08.159
這件事能成功,是因為畫面和聲音是在同一個模型裡一起生成的
2:08.159–2:11.280
所以口型、呼吸、環境音天然就是契合的
2:11.280–2:17.729
雖然說單條最長是 15 秒,但別嫌短,因為廣告、DEMO、片頭都夠用了
2:17.729–2:21.266
先看一個我自己做的 demo,講個故事
2:21.266–2:23.182
我以前是個劇本殺作者
2:23.182–2:30.079
我以前寫過一個叫《未接來電》的本子,可惜那個時候沒有這種模型啊,物料全部都是手搓的
2:30.079–2:35.827
我把角色卡和主持人手冊都丟給 Image2,先生成了一套風格圖
2:35.827–2:41.633
然後再丟給 H3,等了不到十分鐘,一條 768p 的宣傳片就出來了
2:41.633–2:47.050
說實話,看到成片的那一刻,我還挺感慨的,當年的遺憾啊,現在十分鐘就補上了。
2:47.050–2:53.167
隨後啊,我就突發奇想,不如讓AI來發揮一下創意,不斷地Push這個模型的邊界。
2:53.167–2:57.536
於是我就給他定了一個通宵抽卡任務,看看他能做出什麼來。
2:57.536–2:59.633
哇,早上起來的時候我被驚到了。
2:59.633–3:03.301
37條作品,沒有一個重複的,也沒有廢片。
3:03.301–3:05.674
各種各樣AI的奇思妙想。
3:05.674–3:12.578
如果用官方的768p,最低價算兩毛三分錢,這一晚上也就消耗了百來塊錢。
3:12.578–3:19.266
但這麼高的成功率和豐富的藝術表達,在過往的開源模型上都從來沒見過。
3:19.266–3:23.142
我又看了一下官方的demo,啊,那個就更驚艷了。
3:23.142–3:28.864
如果你做TVC廣告,或者是電商產品遊戲demo,或者是產品demo。
3:28.864–3:31.264
我很想說,H3已經殺死比賽了。
3:31.264–3:34.217
在這樣的成本下,你很難再回歸手搓了。
3:34.217–3:39.016
還有一個我特別喜歡的能力,視頻編輯。有一次我錄口播錄錯了。
3:39.016–3:41.746
但我錄製時穿的衣服,剛丟進洗衣機。
3:41.746–3:45.204
那我就直接給一段素材,再給一段重錄的語音。
3:45.204–3:48.116
你們看看這段,隨時都可以換一身衣服。
3:48.116–3:54.486
豐富的藝術表達加上這種隨意的編輯,可以讓每一條素材,都可以充分發揮它的價值。
3:54.486–3:57.216
OK,爽片咱們放完了,咱們說點硬的。
3:57.216–4:00.182
大家肯定想知道本地跑的效果如何。
4:00.182–4:08.288
以我这台Pro6000為例吧,我這邊測到的極致速度是1088P的,十秒可以24分鐘搞定。
4:08.288–4:14.417
但你要知道,H3剛推出那個早上,768p的解析度也要花這麼久的時間
4:14.417–4:17.466
但沒想到H3的社群如此熱情
4:17.466–4:26.150
很快地各種優化方案都出來了,像是Sage Attention、Easy Cache FBC(First Block Cache)
4:26.150–4:30.193
我就跟著社群一路更換方案,不到48小時,生成速度直接翻倍
4:30.193–4:33.637
而且我覺得這個優化節奏根本不會停,社群太狂熱了
4:33.637–4:35.733
但是啊,這件事本身比速度更重要
4:35.733–4:40.699
因為權重一釋出,全世界最聰明的一群人就開始幫你免費優化
4:40.699–4:44.137
這在閉源模型上永遠都不可能發生,對吧
4:44.137–4:52.540
更厲害的是,8月3日開源的當天,各種晶片廠商的推理框架都同一天宣布,ComfyUI當天就能跑
4:52.540–4:55.221
於是賣課的、賣提示詞的,连夜上架
4:55.221–4:59.078
玩ComfyUI的那些朋友,瘋狂地持續輸出
4:59.078–5:03.513
只有公認的頂級開源,才能在一夜之間出現這樣的生態
5:03.513–5:07.370
所以,我們得給MiniMax點一個大大的讚
5:07.370–5:13.733
現在視頻生成這個領域,是被閉源模型壟斷了,對吧,像極了ChatGPT時刻
5:13.733–5:17.241
剛剛發生過的那段日子,大家又興奮又焦慮,對不對
5:17.241–5:23.905
而MiniMax沒有選擇成為Anthropic,他選擇做DeepSeek
5:23.905–5:27.764
把智能平權交給每一個人,把機會平權交給每一個人
5:27.764–5:31.096
所以看到這裡的朋友,請把感謝打在公屏上吧
5:31.096–5:32.850
好接下來我想說的是這
5:33.066–5:35.781
智能平權會帶來多大的機會和變革
5:35.781–5:38.135
這是我們每個人都不能忽視的
5:38.135–5:40.669
大家都想在AI時代賺錢對吧
5:40.669–5:43.023
但我們不能總盯著提升生產力
5:43.023–5:45.376
因為產品會被海量地生產出來
5:45.376–5:47.548
但傳播和獲客依舊是最難的
5:47.548–5:49.359
你依然需要獲得注意力
5:49.359–5:51.350
而每一次內容形式的升級
5:51.350–5:53.606
都會帶來注意力的重新分配
5:53.606–5:58.119
SD 2.0 和 SD 2.5 解決了AI視頻能否進入生產線的問題
5:58.119–5:58.683
的問題
5:58.683–6:00.563
但它沒解決另一個問題
6:00.563–6:02.632
普通人的試錯成本太高了
6:02.632–6:03.760
過去幾個月啊
6:03.760–6:05.640
少數付得起抽卡費的人
6:05.640–6:07.144
先掌握了這個技巧
6:07.144–6:09.213
他們的內容越來越精彩了
6:09.213–6:12.033
你刷到那些用AI參與敘事的博主
6:12.033–6:13.108
是真的做得好
6:13.108–6:15.975
但你們看不到的是他們背後的帳單
6:15.975–6:16.871
而更多的人
6:16.871–6:19.737
被那恐怖的成本嚇得站在門外
6:19.737–6:20.454
而H3呢
6:20.454–6:23.142
把試錯成本第一次打到了電費級別
6:23.142–6:26.008
剛才說的社區爆發就是因為這個原因
6:26.008–6:27.621
我自己就是個樣本啊
6:27.621–6:29.771
我的GPU 48小時都沒停過
6:29.771–6:32.233
每做一條我的提示詞就精準一分
6:32.233–6:33.936
我的經驗就增長一分
6:33.936–6:34.882
而且這一次
6:34.882–6:37.531
經驗的傳播速度會比上次快得多
6:37.531–6:39.045
因為一起試錯的人
6:39.045–6:40.558
多了好幾個數量級
6:40.558–6:41.504
更好的鏡頭
6:41.504–6:42.450
更好的敘事
6:42.450–6:44.153
會一波一波地冒出來
6:44.153–6:45.856
我不敢說H3的出現
6:45.856–6:48.127
會讓每個用AI做視頻的人
6:48.127–6:49.262
都會變得更好
6:49.262–6:52.266
但它一定會導致注意力的重新分配
6:52.266–6:54.249
所以為什麼我最近睡眠也變少了
6:54.249–6:56.066
就是因為正在消耗電力和時間
6:56.066–6:57.223
搶跑這波經驗差
6:57.223–6:58.545
我的影片製作流程
6:58.545–6:59.371
其實一大半
6:59.371–7:01.519
已經被 Hyperframe
7:01.519–7:03.337
這樣的 AI 工作流接管了
7:03.337–7:04.989
如果這套 H3 流程跑通
7:04.989–7:06.806
那剩下的也全都交出去了
7:06.806–7:07.137
所以
7:07.137–7:08.294
我永遠都是那句
7:08.294–7:10.111
得趕快行動起來啊朋友們
7:10.111–7:11.433
但是有卡的朋友們
7:11.433–7:12.734
我先潑個冷水啊
7:12.734–7:15.521
本地部署並不是生產級內容的解法
7:15.521–7:17.193
這次 MiniMax
7:17.193–7:19.423
有兩個重要的模組沒有開源
7:19.423–7:21.838
一個是 Context-IR
7:21.838–7:23.139
就是一個雲端的
7:23.139–7:25.368
更智能理解素材的中間服務
7:25.368–7:29.085
它可以返回複雜邏輯推理生成的結構化提示詞
7:29.085–7:32.300
它不是單純地把提示詞寫得更長
7:32.300–7:33.967
而是先判斷什麼該保留
7:33.967–7:34.800
什麼該改變
7:34.800–7:39.133
我做了一個雨夜小提琴的編輯測試(讓主角換成紅色雨衣)
7:39.133–7:41.300
如果只用簡單提示詞加原影片
7:41.300–7:43.466
衣服雖然成功變成了紅色雨衣
7:43.466–7:46.133
但運鏡完全變了(角色動作也變了)
7:46.133–7:49.466
我再使用 Context-IR 重新生成提示詞
7:49.466–7:50.133
看到沒有
7:50.133–7:51.633
人物、場景和鏡頭運動
7:51.633–7:53.301
都跟原片保持一致了
7:53.301–7:54.228
還有一個是
7:54.228–7:58.120
Regenerate-2K 的超分模型沒有開源
7:58.120–8:00.345
H3 是一個原生 768P 的
8:00.345–8:00.901
而雲端
8:00.901–8:01.457
api
8:01.457–8:02.013
是透過
8:02.013–8:05.349
Regenerate-2K 的超分模型
8:05.349–8:07.017
提升到 2K 解析度的
8:07.017–8:07.944
它的計算速度快
8:07.944–8:08.686
成本也低
8:08.686–8:11.466
本地只能說你能輸出1088P
8:11.466–8:13.332
但細節提升是非常有限的
8:13.332–8:15.198
完全達不到雲端那個效果
8:15.198–8:17.912
而且我試了其他的超分也完全不可用
8:17.912–8:19.947
而且1088P的時間成本
8:19.947–8:21.304
是768P的三倍
8:21.304–8:22.831
所以開源部署的版本
8:22.831–8:25.375
是完全沒法和官方的2K比質量的
8:25.375–8:26.053
這是事實
8:26.053–8:27.580
所以本地部署的朋友
8:27.580–8:28.937
咱們把定位搞清楚
8:28.937–8:30.833
本地是用來刷經驗試錯
8:30.833–8:32.438
不是用來搞生產力的
8:32.438–8:34.043
你早點跑通一條路徑
8:34.043–8:35.469
產出高質量的內容
8:35.469–8:37.431
和收益掛鉤才是最優先的
8:37.431–8:39.214
跑通了这个token
8:39.214–8:39.927
就是槓桿
8:39.927–8:42.602
跑不通那就是燒token交學費
8:42.602–8:43.850
我現在的策略是
8:43.850–8:45.990
一邊拼命尋找各種案例
8:45.990–8:47.238
驗證並提煉工作流
8:47.238–8:49.200
另外我會先在本地生成768p
8:49.200–8:49.906
然後購買API
8:49.906–8:50.789
超分至2K
8:50.789–8:52.026
按照實際用量付費
8:52.026–8:53.439
等我的業務量變大
8:53.439–8:54.851
穩定下來且消耗量增加後
8:54.851–8:59.796
我也會考慮是否要直接購買MiniMax Design的包月或包年方案
8:59.796–9:00.326
直接輸出
9:00.326–9:00.856
包年版本
9:00.856–9:02.269
簡直是價格屠夫
9:02.269–9:03.152
它輸出2K
9:03.152–9:04.035
每秒只要四毛錢
9:04.035–9:06.154
在影視短劇和漫劇之外的行業
9:06.154–9:06.861
我可以說
9:06.861–9:09.433
SD 2.5的價格毫無競爭力
9:09.433–9:11.217
如果你原本就有業務
9:11.217–9:12.823
那你就直接走API
9:12.823–9:13.180
好了
9:13.180–9:15.857
使用Context-IR的API
9:15.857–9:17.641
可以對複雜素材進行理解
9:17.641–9:19.068
生成複雜的提示詞
9:19.068–9:21.031
你甚至可以先用本地抽卡
9:21.031–9:21.923
再呼叫2K
9:21.923–9:22.815
超分API
9:22.815–9:23.708
來提升畫質
9:23.708–9:24.600
而且API
9:24.600–9:25.492
更加靈活
9:25.492–9:27.750
它能接入你的自動化工作流
9:27.750–9:29.109
總之就是趕快行動起來
9:29.109–9:31.374
現在MiniMax Design
9:31.374–9:32.733
上有三次免費生成機會
9:32.733–9:34.092
海螺AI也能直接玩
9:34.092–9:36.357
你總得先做出你的第一部影片對吧
9:36.357–9:37.263
產品Demo
9:37.263–9:38.774
或是品牌故事
9:38.774–9:41.190
或是你只是想隨便找個提示詞玩玩
9:41.190–9:42.096
隨便生成都可以
9:42.096–9:43.153
但我的建議是
9:43.153–9:45.418
你得盡早開始建立自己的內容體系
9:45.418–9:47.683
尤其是埋頭做產品的程式設計師朋友們
9:47.683–9:50.208
現在是進入內容領域門檻最低的时代了
9:50.208–9:52.553
你得盡早嘗試建立自己的流量
9:52.553–9:54.898
否則以後就得找網紅來購買流量
9:54.898–9:56.160
那我們就交點學費
9:56.160–9:57.062
跑完試錯流程後
9:57.062–9:59.407
應該進一步提升內容的品質
9:59.407–10:01.932
因為內容生產的成本大幅降低
10:01.932–10:03.555
試錯成本也大幅降低
10:03.555–10:05.916
所以市場上的內容數量和品質
10:05.916–10:06.980
都會水漲船高
10:06.980–10:09.107
而人類是會產生審美疲勞的
10:09.107–10:11.234
酷炫的效果幾天就看膩了對吧
10:11.234–10:13.892
我們最終還是會回歸到更好的鏡頭
10:13.892–10:15.310
以及更佳的敘事表達中
10:15.310–10:16.374
所以我認為啊
10:16.374–10:17.792
注意力的重新分配
10:17.792–10:19.033
也是有窗口期的
10:19.033–10:21.337
過了這段時間,內容依然是王道
10:21.337–10:21.691
所以
10:21.691–10:24.366
我也在探索其他創意產出的方式
10:24.366–10:25.878
例如更好的工具
10:25.878–10:28.398
或是能幫你快速提升內容品質的產品
10:28.398–10:30.750
能扮演導演和編劇的 Agent
10:30.750–10:33.270
除了 MiniMax Design
10:33.270–10:34.950
如果大家有經常在使用的
10:34.950–10:36.630
也可以在評論區告訴我
10:36.630–10:38.310
最後我還有一個預判
10:38.310–10:39.486
視頻生成的這條路
10:39.486–10:43.350
最終還是會回到由 Agent 指揮視頻模型生成一切
10:43.350–10:45.092
我絕對相信馬斯克所說的
10:45.092–10:45.788
我們現在
10:45.788–10:48.226
已經處於技術發展的奇點時刻
10:48.226–10:49.097
用技術加速
10:49.097–10:49.445
技術
10:49.445–10:50.316
肯定是趨勢
10:50.316–10:51.883
而 MiniMax
10:51.883–10:53.103
擁有視頻生成模型
10:53.103–10:56.586
有MiniMax Design這個數據平台
10:56.586–10:59.198
他們沒有理由不把導演和編劇的能力
10:59.198–11:01.288
訓練到M系列語言模型裡
11:01.288–11:03.950
所以我堅定看好M系列的後續更新
11:03.950–11:05.543
也許幾個月或半年後
11:05.543–11:07.933
我就不用再去搞提示詞了
11:07.933–11:09.924
AI就能搞定一切內容
11:09.924–11:10.721
在那之前
11:10.721–11:12.314
誰有更多的注意力
11:12.314–11:13.708
那個時刻一到來
11:13.708–11:15.699
就會被技術加速得更多
11:15.699–11:17.890
這就是指數型世界的特点
11:17.890–11:20.678
所以H3這波機會你們看懂了嗎
11:20.678–11:23.466
好了以上就是本期的全部內容了
11:23.466–11:24.000
謝謝大家
0:09.400–0:12.201
zh朋友们我的显卡已经两天没合眼了
朋友們,我的顯示卡已經兩天沒休息了
0:12.201–0:13.509
zh事情是这样子的
事情是這樣的
0:13.509–0:20.419
zhMiniMax 发布了一款开源的SOTA级别的视频 生成模型 MiniMax H3
MiniMax 發布了一款開源的 SOTA 級別視頻生成模型 MiniMax H3
0:20.419–0:24.901
zh开源前夜 我拿了一条过去的旧AI视频 丢给H3去重做
在開源的前一夜,我拿了一條舊的 AI 視頻交給 H3 重新生成
0:24.901–0:28.450
zh原本啊我只是想跑一条试试 结果效果一出来
原本我只是想跑一條試試,結果效果一出來
0:28.450–0:29.761
zh我就坐不住了
我就坐不住了
0:29.761–0:32.601
zh我把过去全部的都重跑了一遍
我把過去所有的都重新跑了一遍
0:32.601–0:34.130
zh做完天都快亮了
做完時天都快亮了
0:34.130–0:39.810
zh我当时脑子里就只有一个想法 后悔我之前付给SD钱能退吗
當時我腦子裡只有一個想法:後悔我之前付給 SD 的錢能退嗎
0:39.810–0:46.783
zh那个时候权重还没放出来 于是我就苦等啊 等了好几天 他还跳票了好几次
當時權重還沒放出來,於是我就苦等啊,等了好幾天,它還跳票了好幾次
0:46.783–0:48.059
zh最后他终于来了
最後它終於來了
0:48.059–0:51.342
zh我第一时间就把这个权重 塞进了我的显卡
我第一時間就把這個權重塞進了我的顯示卡
0:51.342–0:54.624
zh从那一刻起到现在 我的GPU 就没有停过
從那一刻起到現在,我的 GPU 就沒有停過
0:54.624–1:01.371
zh所以先下结论啊 MiniMax H3 就是开放权重视频模型的 DeepSeek 时刻
所以先下結論,MiniMax H3 就是開放權重視頻模型的 DeepSeek 時刻
1:01.371–1:04.471
zh今天这期视频有点长 建议先点个收藏啊
今天這期視頻有點長,建議先點個收藏啊
1:04.471–1:05.383
zh我讲三件事
我講三件事
1:05.383–1:09.574
zh他能干什么 他改变了什么 还有最重要的 你应该做什么
它能做什麼、它改變了什麼,還有最重要的,你應該做什麼
1:09.574–1:15.953
zh之前看我视频 跟风买了RTX Pro6000的朋友 请现在把笑哭了打在公屏上
之前看我視頻,跟風買了 RTX Pro6000 的朋友,請現在把笑哭了打在公屏上
1:15.953–1:18.140
zh那这个模型参数我就不念了
那這個模型的參數我就不念了
1:18.140–1:21.966
zh先说一个 它和以前所有视频模型 不太一样的地方
先說一個,它和以前所有視頻模型不太一樣的地方
1:21.966–1:25.100
zh以前视频模型吧 你得按他的规矩来
以前的影片模型啊,你得按照它的規則來操作
1:25.100–1:28.129
zh文生视频一个入口 图生视频一个入口
文字生成影片有一個入口,圖片生成影片有另一個入口
1:28.129–1:33.052
zh你想搞点复杂 你就得接各种工作流 对吧每个模型只干一件事
如果你想搞點複雜的,你就得接各種工作流,對吧?每個模型只做一件事
1:33.052–1:36.839
zh但H3不一样 他文字图片视频声音你随便组合
但 H3 不一樣,文字、圖片、影片、聲音你可以隨意組合
1:36.839–1:40.058
zh你扔给他 然后用大白话告诉它 你要什么
你丟給它,然後用大白話告訴它,你想要什麼
1:40.058–1:42.898
zh官方说法 这叫统一的多模态上下文
官方說法,這叫統一的多模態上下文
1:42.898–1:43.466
zh说人话
說人話
1:43.466–1:46.483
zh他就是个会看会听会拍的创作者
它就是一個會看、會聽、會拍的創作者
1:46.483–1:50.363
zh他还有个名字叫迈向 更通用的多模态智能
它還有一個名字叫邁向更通用的多模態智能
1:50.363–1:56.614
zh他做的片子全部都自带声音 对白音效 BGM 一次生成 口型也能对上
它製作的影片全都自帶聲音,對白、音效、BGM 一次生成,口型也能對上
1:56.614–1:58.338
zh11种语言都能说
11 種語言都能說
1:58.338–2:02.750
zh你给他一段参考音频 他连音色都能给你换掉
你給它一段參考音訊,它連音色都能給你換掉
2:02.750–2:08.159
zh这事能成 是因为画面和声音 是在同一个模型里 一起长出来的
這件事能成功,是因為畫面和聲音是在同一個模型裡一起生成的
2:08.159–2:11.280
zh所以口型呼吸环境天然就是咬合的
所以口型、呼吸、環境音天然就是契合的
2:11.280–2:17.729
zh虽然说单条最长是15秒 你别嫌短 因为广告啊 DEMO 啊 片头都够用了
雖然說單條最長是 15 秒,但別嫌短,因為廣告、DEMO、片頭都夠用了
2:17.729–2:21.266
zh先看一个我自己做的demo 讲个故事
先看一個我自己做的 demo,講個故事
2:21.266–2:23.182
zh我以前是个剧本杀作者
我以前是個劇本殺作者
2:23.182–2:30.079
zh我以前写过一个叫未接来电的本 可惜那个时候没有这种模型啊 物料全部都是手搓的
我以前寫過一個叫《未接來電》的本子,可惜那個時候沒有這種模型啊,物料全部都是手搓的
2:30.079–2:35.827
zh我把角色卡和主持人手册都丢给了Image2 先生成了一套风格图
我把角色卡和主持人手冊都丟給 Image2,先生成了一套風格圖
2:35.827–2:41.633
zh然后再丢给了H3 等了不到十分钟 一条768p 的宣传片就出来了
然後再丟給 H3,等了不到十分鐘,一條 768p 的宣傳片就出來了
2:41.633–2:47.050
zh说实话看到成片的那一刻 我挺感慨的 当年的遗憾啊 现在十分钟就补上了
說實話,看到成片的那一刻,我還挺感慨的,當年的遺憾啊,現在十分鐘就補上了。
2:47.050–2:53.167
zh随后啊我就突发奇想 不如让AI来发挥一下创意 不断的Push这个模型的边界
隨後啊,我就突發奇想,不如讓AI來發揮一下創意,不斷地Push這個模型的邊界。
2:53.167–2:57.536
zh于是我就给他定了一个通宵抽卡任务 看看他能做出来什么
於是我就給他定了一個通宵抽卡任務,看看他能做出什麼來。
2:57.536–2:59.633
zh哇早上起来时候我被惊到了
哇,早上起來的時候我被驚到了。
2:59.633–3:03.301
zh37条作品 没有一个重复的 也没有废片
37條作品,沒有一個重複的,也沒有廢片。
3:03.301–3:05.674
zh各种各样AI的奇思妙想
各種各樣AI的奇思妙想。
3:05.674–3:12.578
zh如果用官方的768p 最低价算两毛三分钱 这一晚上也就消耗了百来块钱
如果用官方的768p,最低價算兩毛三分錢,這一晚上也就消耗了百來塊錢。
3:12.578–3:19.266
zh但这么高的成功率和丰富的艺术表达 在过往的开源模型上都从来没见过
但這麼高的成功率和豐富的藝術表達,在過往的開源模型上都從來沒見過。
3:19.266–3:23.142
zh我又看了一下官方的demo 啊 那个就更惊艳了
我又看了一下官方的demo,啊,那個就更驚艷了。
3:23.142–3:28.864
zh如果你做tvc 广告 或者是电商产品游戏demo 或者是产品demo
如果你做TVC廣告,或者是電商產品遊戲demo,或者是產品demo。
3:28.864–3:31.264
zh我很想说 H3已经杀死比赛了
我很想說,H3已經殺死比賽了。
3:31.264–3:34.217
zh在这样的成本下 你很难再回归手搓了
在這樣的成本下,你很難再回歸手搓了。
3:34.217–3:39.016
zh还有一个我特别喜欢的能力 视频编辑有一次我录口播录错了
還有一個我特別喜歡的能力,視頻編輯。有一次我錄口播錄錯了。
3:39.016–3:41.746
zh但我录制时穿的衣服 刚丢进洗衣机
但我錄製時穿的衣服,剛丟進洗衣機。
3:41.746–3:45.204
zh那我就直接给一段素材 再给一段重录的语音
那我就直接給一段素材,再給一段重錄的語音。
3:45.204–3:48.116
zh你们看看这段 随时都可以换一身衣服
你們看看這段,隨時都可以換一身衣服。
3:48.116–3:54.486
zh丰富的艺术表达加上这种随意的编辑 可以让每一条素材 都可以充分发挥它的价值
豐富的藝術表達加上這種隨意的編輯,可以讓每一條素材,都可以充分發揮它的價值。
3:54.486–3:57.216
zhok 爽片咱们放完了 咱们说点硬的
OK,爽片咱們放完了,咱們說點硬的。
3:57.216–4:00.182
zh大家肯定想知道本地跑的效果如何
大家肯定想知道本地跑的效果如何。
4:00.182–4:08.288
zh以我这台Pro6000为例吧 我这边测到的极致速度是1088P的 十秒可以24分钟搞定
以我这台Pro6000為例吧,我這邊測到的極致速度是1088P的,十秒可以24分鐘搞定。
4:08.288–4:14.417
zh但是你要知道 H3刚出来那个早上啊 768p 的分辨率也要这么长时间
但你要知道,H3剛推出那個早上,768p的解析度也要花這麼久的時間
4:14.417–4:17.466
zh但是没有想到H3的社区如此热情
但沒想到H3的社群如此熱情
4:17.466–4:26.150
zh很快的各种优化方案都出来了 什么Sage Attention 啊 Easy Cache FBC (First Block Cache)
很快地各種優化方案都出來了,像是Sage Attention、Easy Cache FBC(First Block Cache)
4:26.150–4:30.193
zh我就跟着社区一路换方案 不到48小时 生成速度直接翻了一倍
我就跟著社群一路更換方案,不到48小時,生成速度直接翻倍
4:30.193–4:33.637
zh而且这个优化节奏 我觉得根本不会停啊 社区太狂热了
而且我覺得這個優化節奏根本不會停,社群太狂熱了
4:33.637–4:35.733
zh但是啊这件事本身比速度更重要
但是啊,這件事本身比速度更重要
4:35.733–4:40.699
zh因为权重放出来 全世界最聪明的一群人 就开始帮你免费优化
因為權重一釋出,全世界最聰明的一群人就開始幫你免費優化
4:40.699–4:44.137
zh这在闭源模型上永远都不可能会发生 对吧
這在閉源模型上永遠都不可能發生,對吧
4:44.137–4:52.540
zh更厉害的是 8月3日开源的当天 各种芯片厂商推理框架都同一天宣布 适配 ComfyUI当天就能跑
更厲害的是,8月3日開源的當天,各種晶片廠商的推理框架都同一天宣布,ComfyUI當天就能跑
4:52.540–4:55.221
zh于是卖课的 卖提示词的 连夜上架
於是賣課的、賣提示詞的,连夜上架
4:55.221–4:59.078
zh玩ComfyUI的那些朋友 疯狂的持续输出
玩ComfyUI的那些朋友,瘋狂地持續輸出
4:59.078–5:03.513
zh只有公认的顶级开源 才能一夜之间有这样的生态出现
只有公認的頂級開源,才能在一夜之間出現這樣的生態
5:03.513–5:07.370
zh所以 我们得给 MiniMax点一个大大的赞
所以,我們得給MiniMax點一個大大的讚
5:07.370–5:13.733
zh现在视频生成这个领域 是被闭源模型垄断了 对吧像极了 ChatGPT 时刻
現在視頻生成這個領域,是被閉源模型壟斷了,對吧,像極了ChatGPT時刻
5:13.733–5:17.241
zh刚刚发生的那段日子 大家又兴奋又焦虑对不对
剛剛發生過的那段日子,大家又興奮又焦慮,對不對
5:17.241–5:23.905
zh而 MiniMax 他没有选择去成为 Anthropic 他选择了做 DeepSeek
而MiniMax沒有選擇成為Anthropic,他選擇做DeepSeek
5:23.905–5:27.764
zh把智能平权交给每一个人 把机会平权交给每一个人
把智能平權交給每一個人,把機會平權交給每一個人
5:27.764–5:31.096
zh所以看到这里的朋友 请把感谢打在公屏上吧
所以看到這裡的朋友,請把感謝打在公屏上吧
5:31.096–5:32.850
zh好接下来我想说的是这
好接下來我想說的是這
5:33.066–5:35.781
zh智能平权会带来多大的机会和变革
智能平權會帶來多大的機會和變革
5:35.781–5:38.135
zh这是我们每个人都不能忽视的
這是我們每個人都不能忽視的
5:38.135–5:40.669
zh大家都想在AI时代赚钱对不对
大家都想在AI時代賺錢對吧
5:40.669–5:43.023
zh但是咱不能总盯着提效生产力
但我們不能總盯著提升生產力
5:43.023–5:45.376
zh因为产品会被海量的生产出来
因為產品會被海量地生產出來
5:45.376–5:47.548
zh但传播和获客依旧是最难的
但傳播和獲客依舊是最難的
5:47.548–5:49.359
zh你依然需要获得注意力
你依然需要獲得注意力
5:49.359–5:51.350
zh而每一次内容形式的升级
而每一次內容形式的升級
5:51.350–5:53.606
zh都会带来注意力的重新分配
都會帶來注意力的重新分配
5:53.606–5:58.119
zhSD 2.0 SD 2.5 解决了AI视频能不能进生产线
SD 2.0 和 SD 2.5 解決了AI視頻能否進入生產線的問題
5:58.119–5:58.683
zh的问题
的問題
5:58.683–6:00.563
zh但它没解决另一个问题
但它沒解決另一個問題
6:00.563–6:02.632
zh普通人的试错成本太高了
普通人的試錯成本太高了
6:02.632–6:03.760
zh过去几个月啊
過去幾個月啊
6:03.760–6:05.640
zh少数付得起抽卡费的人
少數付得起抽卡費的人
6:05.640–6:07.144
zh先掌握了这个技巧
先掌握了這個技巧
6:07.144–6:09.213
zh他们的内容越来越精彩了
他們的內容越來越精彩了
6:09.213–6:12.033
zh你刷到那些用AI参与叙事的博主
你刷到那些用AI參與敘事的博主
6:12.033–6:13.108
zh是真的做的好
是真的做得好
6:13.108–6:15.975
zh但是你们看不到的是他们背后的账单
但你們看不到的是他們背後的帳單
6:15.975–6:16.871
zh而更多的人
而更多的人
6:16.871–6:19.737
zh是被那个恐怖的成本吓得站在了门外
被那恐怖的成本嚇得站在門外
6:19.737–6:20.454
zh而H3呢
而H3呢
6:20.454–6:23.142
zh把试错成本第一次打到了电费级别
把試錯成本第一次打到了電費級別
6:23.142–6:26.008
zh刚才说的社区爆发就是因为这个原因
剛才說的社區爆發就是因為這個原因
6:26.008–6:27.621
zh我自己就是个样本啊
我自己就是個樣本啊
6:27.621–6:29.771
zh我的GPU 48小时就没停
我的GPU 48小時都沒停過
6:29.771–6:32.233
zh每做一条我的提示词就准一分
每做一條我的提示詞就精準一分
6:32.233–6:33.936
zh我的经验就增长一分
我的經驗就增長一分
6:33.936–6:34.882
zh而且这一次
而且這一次
6:34.882–6:37.531
zh经验的传播速度会比上次快的多
經驗的傳播速度會比上次快得多
6:37.531–6:39.045
zh因为一起试错的人
因為一起試錯的人
6:39.045–6:40.558
zh多了好几个数量级
多了好幾個數量級
6:40.558–6:41.504
zh更好的镜头
更好的鏡頭
6:41.504–6:42.450
zh更好的叙事
更好的敘事
6:42.450–6:44.153
zh会一波一波的冒出来
會一波一波地冒出來
6:44.153–6:45.856
zh我不敢说H3的出现
我不敢說H3的出現
6:45.856–6:48.127
zh会让每个用AI做视频的人
會讓每個用AI做視頻的人
6:48.127–6:49.262
zh都会变得更好
都會變得更好
6:49.262–6:52.266
zh但它一定会导致注意力的重新分配
但它一定會導致注意力的重新分配
6:52.266–6:54.249
zh所以为什么我最近睡眠也少
所以為什麼我最近睡眠也變少了
6:54.249–6:56.066
zh就是因为在用电力和时间
就是因為正在消耗電力和時間
6:56.066–6:57.223
zh抢跑这波经验差
搶跑這波經驗差
6:57.223–6:58.545
zh我的视频制作流程
我的影片製作流程
6:58.545–6:59.371
zh其实一大半
其實一大半
6:59.371–7:01.519
zh已经被Hyperframe
已經被 Hyperframe
7:01.519–7:03.337
zh这样的AI工作流接管了
這樣的 AI 工作流接管了
7:03.337–7:04.989
zh如果这套H3流程跑通
如果這套 H3 流程跑通
7:04.989–7:06.806
zh那剩下的也全都交出去了
那剩下的也全都交出去了
7:06.806–7:07.137
zh所以
所以
7:07.137–7:08.294
zh我永远都是那句
我永遠都是那句
7:08.294–7:10.111
zh得赶快行动起来啊朋友们
得趕快行動起來啊朋友們
7:10.111–7:11.433
zh但是有卡的朋友们
但是有卡的朋友們
7:11.433–7:12.734
zh我先泼个冷水啊
我先潑個冷水啊
7:12.734–7:15.521
zh本地部署并不是生产级内容的解法
本地部署並不是生產級內容的解法
7:15.521–7:17.193
zh这次MiniMax
這次 MiniMax
7:17.193–7:19.423
zh有两个重要的模块没有开源
有兩個重要的模組沒有開源
7:19.423–7:21.838
zh一个是Context-IR
一個是 Context-IR
7:21.838–7:23.139
zh就是一个云端的
就是一個雲端的
7:23.139–7:25.368
zh更智能理解素材的中间服务
更智能理解素材的中間服務
7:25.368–7:29.085
zh它可以返回复杂逻辑推理生成的结构化提示词
它可以返回複雜邏輯推理生成的結構化提示詞
7:29.085–7:32.300
zh它不是简单把提示词写得更长
它不是單純地把提示詞寫得更長
7:32.300–7:33.967
zh而是先判断什么该保留
而是先判斷什麼該保留
7:33.967–7:34.800
zh什么该改变
什麼該改變
7:34.800–7:39.133
zh我做了一个雨夜小提琴的编辑测试(让主角换成红色雨衣)
我做了一個雨夜小提琴的編輯測試(讓主角換成紅色雨衣)
7:39.133–7:41.300
zh如果只用简单提示词加原视频
如果只用簡單提示詞加原影片
7:41.300–7:43.466
zh衣服虽然成功变成了红色雨衣
衣服雖然成功變成了紅色雨衣
7:43.466–7:46.133
zh但运镜完全变了(角色动作也变了)
但運鏡完全變了(角色動作也變了)
7:46.133–7:49.466
zh我再用Context-IR重新生成提示词
我再使用 Context-IR 重新生成提示詞
7:49.466–7:50.133
zh看到没有
看到沒有
7:50.133–7:51.633
zh人物场景和镜头运动
人物、場景和鏡頭運動
7:51.633–7:53.301
zh都跟原片保持一致了
都跟原片保持一致了
7:53.301–7:54.228
zh还有一个是
還有一個是
7:54.228–7:58.120
zhRegenerate-2K的超分模型没开源
Regenerate-2K 的超分模型沒有開源
7:58.120–8:00.345
zhH3是一个原生768P的
H3 是一個原生 768P 的
8:00.345–8:00.901
zh而云端
而雲端
8:00.901–8:01.457
enapi
api
8:01.457–8:02.013
zh是通过
是透過
8:02.013–8:05.349
zhRegenerate-2K的超分模型
Regenerate-2K 的超分模型
8:05.349–8:07.017
zh提升到2K分辨率的
提升到 2K 解析度的
8:07.017–8:07.944
zh它的计算快
它的計算速度快
8:07.944–8:08.686
zh成本也低
成本也低
8:08.686–8:11.466
zh本地只能说是你能输出1088P
本地只能說你能輸出1088P
8:11.466–8:13.332
zh但细节提升是非常有限的
但細節提升是非常有限的
8:13.332–8:15.198
zh完全达不到云端那个效果
完全達不到雲端那個效果
8:15.198–8:17.912
zh而且我试了其他的超分也完全不可用
而且我試了其他的超分也完全不可用
8:17.912–8:19.947
zh而且1088P的时间成本
而且1088P的時間成本
8:19.947–8:21.304
zh是768P的三倍
是768P的三倍
8:21.304–8:22.831
zh所以开源部署的版本
所以開源部署的版本
8:22.831–8:25.375
zh是完全没法和官方的2K比质量的
是完全沒法和官方的2K比質量的
8:25.375–8:26.053
zh这是事实
這是事實
8:26.053–8:27.580
zh所以本地部署的朋友
所以本地部署的朋友
8:27.580–8:28.937
zh咱们把定位搞清楚
咱們把定位搞清楚
8:28.937–8:30.833
zh本地是用来刷经验试错
本地是用來刷經驗試錯
8:30.833–8:32.438
zh不是用来搞生产力的
不是用來搞生產力的
8:32.438–8:34.043
zh你早点跑通一条路径
你早點跑通一條路徑
8:34.043–8:35.469
zh产出高质量的内容
產出高質量的內容
8:35.469–8:37.431
zh和收益挂钩才是最优先的
和收益掛鉤才是最優先的
8:37.431–8:39.214
zh跑通了这个token
跑通了这个token
8:39.214–8:39.927
zh就是杠杆
就是槓桿
8:39.927–8:42.602
zh跑不通那就是烧token交学费
跑不通那就是燒token交學費
8:42.602–8:43.850
zh我现在策略就是
我現在的策略是
8:43.850–8:45.990
zh一边拼命的找各种case
一邊拼命尋找各種案例
8:45.990–8:47.238
zh验证提炼工作流
驗證並提煉工作流
8:47.238–8:49.200
zh另外我会本地出768p
另外我會先在本地生成768p
8:49.200–8:49.906
zh买api
然後購買API
8:49.906–8:50.789
zh超分到2K
超分至2K
8:50.789–8:52.026
zh按实际的用量走
按照實際用量付費
8:52.026–8:53.439
zh等我的业务量大了
等我的業務量變大
8:53.439–8:54.851
zh稳定了消耗的多了
穩定下來且消耗量增加後
8:54.851–8:59.796
zh我也会考虑要不要直接买MiniMax Design包月包年
我也會考慮是否要直接購買MiniMax Design的包月或包年方案
8:59.796–9:00.326
zh直接出
直接輸出
9:00.326–9:00.856
zh包年版
包年版本
9:00.856–9:02.269
zh简直是个价格屠夫
簡直是價格屠夫
9:02.269–9:03.152
zh它输出2K
它輸出2K
9:03.152–9:04.035
zh四毛钱一秒
每秒只要四毛錢
9:04.035–9:06.154
zh在影视短剧漫剧之外的行业
在影視短劇和漫劇之外的行業
9:06.154–9:06.861
zh我可以说
我可以說
9:06.861–9:09.433
zhsd 2.5的价格是毫无竞争力
SD 2.5的價格毫無競爭力
9:09.433–9:11.217
zh如果你是原先就有业务
如果你原本就有業務
9:11.217–9:12.823
zh那你就直接走api
那你就直接走API
9:12.823–9:13.180
zh得了
好了
9:13.180–9:15.857
zh用Context-IR的api
使用Context-IR的API
9:15.857–9:17.641
zh可以对复杂素材做理解
可以對複雜素材進行理解
9:17.641–9:19.068
zh生成复杂的提示词
生成複雜的提示詞
9:19.068–9:21.031
zh你甚至可以先用本地抽卡
你甚至可以先用本地抽卡
9:21.031–9:21.923
zh再调用2K
再呼叫2K
9:21.923–9:22.815
zh超分api
超分API
9:22.815–9:23.708
zh来提升质量
來提升畫質
9:23.708–9:24.600
zh而且api
而且API
9:24.600–9:25.492
zh是更灵活的
更加靈活
9:25.492–9:27.750
zh它能接入你的自动化工作流
它能接入你的自動化工作流
9:27.750–9:29.109
zh总之就是赶快动起来
總之就是趕快行動起來
9:29.109–9:31.374
zh现在MiniMax Design
現在MiniMax Design
9:31.374–9:32.733
zh上有三次的免费生成
上有三次免費生成機會
9:32.733–9:34.092
zh海螺AI也能直接玩
海螺AI也能直接玩
9:34.092–9:36.357
zh你先得把你第一条片子做出来对吧
你總得先做出你的第一部影片對吧
9:36.357–9:37.263
zh产品demo
產品Demo
9:37.263–9:38.774
zh或者是品牌story
或是品牌故事
9:38.774–9:41.190
zh或者是你就是随便想找个提示词玩玩
或是你只是想隨便找個提示詞玩玩
9:41.190–9:42.096
zh随便出都可以
隨便生成都可以
9:42.096–9:43.153
zh但我的建议就是
但我的建議是
9:43.153–9:45.418
zh你得早点开始建立自己的内容体系
你得盡早開始建立自己的內容體系
9:45.418–9:47.683
zh尤其是闷头做产品的程序员朋友们
尤其是埋頭做產品的程式設計師朋友們
9:47.683–9:50.208
zh现在是做内容门槛最低的时代了
現在是進入內容領域門檻最低的时代了
9:50.208–9:52.553
zh你得早点尝试建立自己的流量
你得盡早嘗試建立自己的流量
9:52.553–9:54.898
zh否则以后就得找博主来买流量
否則以後就得找網紅來購買流量
9:54.898–9:56.160
zh那我们交好学费
那我們就交點學費
9:56.160–9:57.062
zh跑完试错后
跑完試錯流程後
9:57.062–9:59.407
zh应该进一步的提高内容的质量
應該進一步提升內容的品質
9:59.407–10:01.932
zh因为内容生产的成本大幅的降低
因為內容生產的成本大幅降低
10:01.932–10:03.555
zh试错成本也大幅降低
試錯成本也大幅降低
10:03.555–10:05.916
zh所以市场上的内容数量和质量
所以市場上的內容數量和品質
10:05.916–10:06.980
zh都会水涨船高
都會水漲船高
10:06.980–10:09.107
zh那我们人类是会审美疲劳的
而人類是會產生審美疲勞的
10:09.107–10:11.234
zh酷炫效果几天就看腻了对吧
酷炫的效果幾天就看膩了對吧
10:11.234–10:13.892
zh我们最后还是会回归到更好的镜头
我們最終還是會回歸到更好的鏡頭
10:13.892–10:15.310
zh表达更好的叙事中
以及更佳的敘事表達中
10:15.310–10:16.374
zh所以我认为啊
所以我認為啊
10:16.374–10:17.792
zh注意力的重新分配
注意力的重新分配
10:17.792–10:19.033
zh也是有窗口期的
也是有窗口期的
10:19.033–10:21.337
zh过了这段时间还是得内容为王
過了這段時間,內容依然是王道
10:21.337–10:21.691
zh所以
所以
10:21.691–10:24.366
zh我也在探索其他的产出创意的方式
我也在探索其他創意產出的方式
10:24.366–10:25.878
zh比如说更好的工具啊
例如更好的工具
10:25.878–10:28.398
zh能帮你快速提升内容质量的产品呀
或是能幫你快速提升內容品質的產品
10:28.398–10:30.750
zh能扮演导演和编剧的agent
能扮演導演和編劇的 Agent
10:30.750–10:33.270
zh除了MiniMax Design
除了 MiniMax Design
10:33.270–10:34.950
zh如果大家有经常在用的
如果大家有經常在使用的
10:34.950–10:36.630
zh也可以在评论区告诉我
也可以在評論區告訴我
10:36.630–10:38.310
zh结尾我还有一个预判啊
最後我還有一個預判
10:38.310–10:39.486
zh视频生成这条路
視頻生成的這條路
10:39.486–10:43.350
zh最终还是会回到Agent指挥视频模型生成一切的
最終還是會回到由 Agent 指揮視頻模型生成一切
10:43.350–10:45.092
zh我绝对相信马斯克说的
我絕對相信馬斯克所說的
10:45.092–10:45.788
zh我们现在
我們現在
10:45.788–10:48.226
zh已经处于技术发展的奇点时刻了
已經處於技術發展的奇點時刻
10:48.226–10:49.097
zh用技术加速
用技術加速
10:49.097–10:49.445
zh技术
技術
10:49.445–10:50.316
zh肯定是趋势
肯定是趨勢
10:50.316–10:51.883
zh而MiniMax 呢
而 MiniMax
10:51.883–10:53.103
zh有视频生成模型
擁有視頻生成模型
10:53.103–10:56.586
zh有MiniMax Design这个数据平台
有MiniMax Design這個數據平台
10:56.586–10:59.198
zh他们没有理由不把导演编剧的能力
他們沒有理由不把導演和編劇的能力
10:59.198–11:01.288
zh训练到M系列语言模型里的
訓練到M系列語言模型裡
11:01.288–11:03.950
zh所以我坚定看好M系列的后续更新
所以我堅定看好M系列的後續更新
11:03.950–11:05.543
zh也许几个月半年后
也許幾個月或半年後
11:05.543–11:07.933
zh我就再也不用去搞提示词了
我就不用再去搞提示詞了
11:07.933–11:09.924
zhAI就搞定一切的内容
AI就能搞定一切內容
11:09.924–11:10.721
zh在那之前
在那之前
11:10.721–11:12.314
zh谁有更多的注意力
誰有更多的注意力
11:12.314–11:13.708
zh那个时刻一到来
那個時刻一到來
11:13.708–11:15.699
zh就会更多的被技术加速
就會被技術加速得更多
11:15.699–11:17.890
zh这就是指数型世界的特点
這就是指數型世界的特点
11:17.890–11:20.678
zh所以H3这波机会你们看懂了吗
所以H3這波機會你們看懂了嗎
11:20.678–11:23.466
zh好了以上就是本期的全部内容了
好了以上就是本期的全部內容了
11:23.466–11:24.000
zh谢谢大家
謝謝大家

影片筆記:Seedance 退钱!MiniMax H3 实测感受

一句話總結

MiniMax H3 作為開源 SOTA 級視頻生成模型,打破了傳統單一入口限制,實現多模態統一與音畫同步,極低成本激發社區優化,但本地部署受限於未開源組件,建議採用「本地驗證 + 雲端超分」的混合工作流,並預判未來將回歸 Agent 自動指揮。

核心重點

  • 多模態統一與音畫同步:MiniMax H3 不再區分文生視頻或圖生視頻,支持文字、圖片、視頻、聲音隨意組合。生成的視頻自帶聲音、對白、音效與 BGM,口型與呼吸、環境音自然咬合,並支持 11 種語言及音色替換。
  • 極低成本與社區生態爆發:H3 被類比為「開放權重視頻模型的 DeepSeek 時刻」。768p 生成成本僅約兩毛三分錢,極低的試錯成本激發全球開發者熱情,推動 Sage Attention、Easy Cache、FBC 等優化方案快速迭代,速度大幅提升。
  • 本地與雲端的技術差異:本地部署(如 RTX Pro6000)適合刷經驗與試錯,但無法達到雲端 API 的 2K 分辨率與細節質量。關鍵組件 Context-IR(智能理解素材)與 Regenerate-2K(超分模型)未開源,導致本地無法直接生成高質量 2K 視頻。
  • 推薦工作流與商業建議:建議用戶利用本地低成本 768p 進行工作流驗證,再結合雲端 API 進行 2K 超分。業務量大時,建議購買 MiniMax Design 包年服務(2K 輸出約 4 毛錢/秒),利用 API 的靈活性與 Context-IR 處理複雜素材。
  • 未來趨勢:Agent 指揮:視頻生成最終將回歸 Agent 指揮。MiniMax 有望將導演與編劇能力整合進 M 系列語言模型,實現自動化內容生產,未來可能無需手動調提示詞,由 AI 自動搞定內容。

詳細大綱

I. MiniMax H3 的核心能力與特性

  • 統一多模態上下文
  • 打破傳統模型單一入口限制,支持文字、圖片、視頻、聲音隨意組合。
  • 被定義為「會看會聽會拍的創作者」。
  • 音畫同步與多語言支持
  • 生成的片子自帶聲音、對白、音效、BGM。
  • 口型與呼吸、環境音天然咬合。
  • 支持 11 種語言,可通過參考音頻替換音色。
  • 技術原理:畫面與聲音在同一模型中共同生成。
  • 應用場景與案例
  • 單條最長 15 秒,足以覆蓋廣告、Demo、片頭。
  • 案例:將劇本殺《未接來電》的角色卡與主持人手冊丟入,10 分鐘生成 768p 宣傳片。
  • 視頻編輯能力:支持換衣服、換語音,保持鏡頭與動作一致性。

II. 社區生態與技術優化

  • 開源帶來的生態爆發
  • 權重開放後,全球開發者免費優化,閉源模型無法做到。
  • 8月3日開源當天,芯片廠商與推理框架(ComfyUI)同步適配。
  • 社區熱情推動優化方案迭代:Sage Attention、Easy Cache、FBC (First Block Cache)。
  • 速度提升
  • 講者測試顯示速度大幅提升,優化節奏不會停止,社區極度狂熱。

III. 本地部署與雲端 API 的對比與策略

  • 本地部署的局限性
  • 未開源組件
  1. Context-IR:雲端智能理解素材的中間服務,返回結構化提示詞,判斷保留與改變內容,保持鏡頭與動作一致性。
  2. Regenerate-2K:超分模型,將原生 768p 提升至 2K,計算快、成本低。
  • 質量差異:本地 1088p 細節提升有限,無法達到雲端 2K 效果;其他超分模型不可用。
  • 時間成本:1088p 時間成本是 768p 的三倍。
  • 講者推薦策略
  • 定位:本地用於刷經驗、試錯,非生產級內容。
  • 混合工作流:本地出 768p 驗證工作流 -> 調用 2K 超分 API 提升質量。
  • 商業購買建議
  • 業務量大時,考慮 MiniMax Design 包年(2K 輸出約 4 毛錢/秒,被稱為「價格屠夫」)。
  • 原有業務可直接走 API,利用 Context-IR 處理複雜素材。
  • API 更靈活,可接入自動化工作流。

IV. 市場影響與未來預判

  • 智能平權與注意力重新分配
  • H3 將試錯成本降至「電費級別」,打破少數人壟斷技巧的局面。
  • 經驗傳播速度加快,內容數量與質量水漲船高。
  • 注意力的重新分配存在窗口期,最終回歸內容為王(更好的鏡頭、敘事)。
  • 行動建議
  • 盡快行動,建立自己的內容體系與流量。
  • 利用 MiniMax Design 三次免費生成或海螺 AI 嘗試。
  • 程序員等產品創業者應低門檻嘗試內容生產,避免未來購買流量。
  • 未來趨勢預判
  • 視頻生成最終回歸 Agent 指揮 視頻模型生成一切。
  • 相信馬斯克關於「技術發展奇點」的觀點。
  • MiniMax 擁有視頻模型與 Design 數據平台,有望將導演、編劇能力訓練進 M 系列語言模型。
  • 預測幾個月或半年後,可能無需手動調提示詞,AI 自動搞定內容。

工具 / 模型 / 名詞整理

  • MiniMax H3:MiniMax 發布的開源 SOTA 級視頻生成模型。
  • MiniMax Design:MiniMax 的數據平台/服務,提供包年包月服務。
  • SD (Stable Diffusion):提及的舊有 AI 視頻/圖像模型,講者提到「SD 2.0」、「SD 2.5」,並抱怨之前付給 SD 的錢。
  • ComfyUI:工作流工具,H3 開源當天即適配。
  • RTX Pro6000:講者使用的顯卡型號。
  • Context-IR:MiniMax 未開源的雲端組件,用於智能理解素材與生成結構化提示詞。
  • Regenerate-2K:MiniMax 未開源的超分模型,用於將 768p 提升至 2K。
  • Sage Attention:社區提供的優化方案。
  • Easy Cache:社區提供的優化方案。
  • FBC (First Block Cache):社區提供的優化方案。
  • 海螺 AI:提及可直觀體驗 H3 的平台。
  • Hyperframe:講者提到的接管視頻制作流程的 AI 工作流。
  • DeepSeek:被類比為 H3 在開源視頻領域的地位。
  • ChatGPT:被類比為視頻領域閉源壟斷的時期。
  • Anthropic:被提及為 MiniMax 沒有選擇成為的對象(暗示 Anthropic 的閉源或特定路線)。
  • M 系列語言模型:MiniMax 的語言模型系列,講者看好其後續更新。

操作流程整理

  1. 本地驗證階段
  • 使用本地顯卡(如 RTX Pro6000)部署 MiniMax H3。
  • 輸入文字、圖片、視頻、聲音等多模態素材。
  • 生成 768p 視頻,驗證工作流、鏡頭與動作一致性。
  • 利用社區優化方案(Sage Attention, Easy Cache, FBC)提升生成速度。
  1. 雲端超分階段
  • 將本地生成的 768p 視頻調用雲端 API。
  • 利用未開源的 Context-IR 進行智能理解與結構化提示詞生成。
  • 利用未開源的 Regenerate-2K 模型將視頻超分至 2K 分辨率,提升細節質量。
  1. 商業化應用階段
  • 業務量大時,購買 MiniMax Design 包年服務。
  • 直接通過 API 接入自動化工作流,利用 Context-IR 處理複雜素材,實現高性價比生產。

值得注意的限制或風險

  • 本地質量上限:本地部署無法使用 Context-IR 與 Regenerate-2K,因此無法達到雲端 2K 的分辨率與細節質量,其他超分模型也不可用。
  • 時間成本:本地生成 1088p 的時間成本是 768p 的三倍。
  • 未開源組件依賴:高質量輸出依賴雲端未開源的 Context-IR 與 Regenerate-2K,本地用戶無法獨立實現同等效果。
  • 單條時長限制:單條視頻最長僅 15 秒,雖足以覆蓋廣告、Demo、片頭,但對於長視頻生成仍有局限。

逐字稿辨識疑點

  • 「SD 錢能退嗎」:講者口語,意指之前為 Stable Diffusion 相關服務付費,現在因 H3 出現而感到浪費,非實際退款操作。
  • 「Pro6000」:顯卡型號,通常為 NVIDIA RTX 6000 Ada Generation 或舊款 RTX 6000,逐字稿僅寫 Pro6000,保留原樣。
  • 「1088P」:逐字稿中多次出現「1088P」,通常視頻分辨率為 1080p,此處可能為口誤或特定解析度,標記為疑點。
  • 「十秒可以 24 分鐘搞定」:講者在描述 Pro6000 測試極致速度時說「1088P 的十秒可以 24 分鐘搞定」,語意稍顯矛盾(通常指生成 10 秒視頻需 24 分鐘,或優化後速度提升),保留原文描述,需查證具體性能數據。
  • 「兩毛三分錢」:指 768p 生成的成本,保留原數值。
  • 「四毛錢一秒」:指 MiniMax Design 包年版輸出 2K 的成本,保留原數值。
  • 「MiniMax H3 就是開放權重視頻模型的 DeepSeek 時刻」:講者的比喻,非官方定義。
  • 「SD 2.0 SD 2.5 解決了 AI 視頻能不能進生產線的問題」:講者對 SD 版本的評價,可能與實際版本號或功能劃分有出入,標記為講者觀點。

可延伸追問

  • MiniMax H3 的 11 種語言支持中,是否包含中文方言或特定口音的優化?
  • Context-IR 與 Regenerate-2K 未開源,未來是否有開源計劃或替代方案?
  • 社區優化方案(Sage Attention, Easy Cache, FBC)的具體性能提升數據是多少?
  • MiniMax Design 包年服務的具體定價與使用條款為何?
  • Agent 指揮視頻生成的具體實現路徑是什麼?M 系列語言模型如何整合導演與編劇能力?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習