0:00.000–0:03.540
Fibon 5仅仅上线了三天就被下架了
0:03.540–0:06.740
原因是美国的出口管制指令
0:06.740–0:11.240
但仅仅几天就找到了替代Fibon 5的方法
0:11.240–0:14.640
Open Router最新公布了一套测试
0:14.640–0:16.860
在测试中使用融合技术
0:16.860–0:21.740
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
0:21.740–0:24.700
这套组合进行Dirico测试
0:24.700–0:28.040
得分为64.7%
0:28.040–0:32.140
而Fibon 5的单模型得分是65.3%
0:32.140–0:35.000
仅仅相差0.6%
0:35.000–0:40.840
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
0:40.840–0:46.800
这三个模型融合得分更是高达68.3%
0:46.800–0:50.600
这下美国封锁Fibon 5显然意义也不大了
0:50.600–0:55.180
那今天我们不探讨得分的具体细节
0:55.180–0:57.520
详细聊聊这个融合技术
0:57.520–1:01.120
它是怎么打破自己的智力上限的
1:01.120–1:04.480
我们从几个点把这个知识吃透
1:04.480–1:07.200
那第一什么是融合模型
1:07.200–1:12.720
第二融合模型的五种干活方式以及优缺点
1:12.720–1:16.140
第三就是融合技术的真实效果怎么样
1:16.140–1:19.600
第四融合技术的成本是多少
1:19.600–1:26.220
那第五如何快速在Cloud和Codex中使用简单的融合
1:26.220–1:30.520
那第五就是在使用中哪些坑不要踩
1:30.520–1:33.980
我们先来看第一融合的原理
1:33.980–1:37.580
你大概有过这种经验
1:37.580–1:39.580
同一个问题
1:39.580–1:43.180
第五它的回答详细但是有点啰嗦
1:43.180–1:46.120
但Cloud Ops简洁严谨
1:46.120–1:47.980
但是回答比较高了
1:47.980–1:49.660
问Deepseek回答呢
1:49.660–1:50.760
它有哲学性
1:50.760–1:52.860
但写代码稍微差点意思
1:52.860–1:55.720
问Gmini它适合插资料
1:55.720–1:58.060
但有时候它也会降置
1:58.060–2:02.020
那每个模型都有长版也有短版
2:02.020–2:05.260
那于是一个很自然的想法就冒出来
2:05.260–2:08.380
能不能把这些模型的答案融合起来
2:08.380–2:09.340
取长补短呢
2:09.340–2:12.280
这就是多模型融合
2:12.280–2:15.060
它的技术就是为了解决这个问题
2:15.060–2:17.920
那融合技术有多厉害呢
2:17.920–2:19.260
先讲个故事
2:19.260–2:24.020
2024年一家叫Sakana的日本AI小公司
2:24.020–2:25.600
没花什么大价钱
2:25.600–2:27.480
训练了一个新模型
2:27.480–2:30.880
只是把两个县城的开源免费模型
2:30.880–2:32.500
一个擅长日语
2:32.500–2:33.820
一个擅长数学
2:33.820–2:36.520
用巧妙的办法拼在了一起
2:36.520–2:39.260
结果这个拼出来的新模型
2:39.260–2:41.820
既会日语又会做数学题
2:41.820–2:44.820
还在日语数学的权威测试里
2:44.820–2:46.220
拿下了一个第一
2:46.220–2:48.880
打败了比它大好几倍的模型
2:48.880–2:52.260
而它从没有专门为这个任务训练过
2:52.260–2:54.420
用一句话解释就是
2:54.420–2:56.900
让多个AI模型一起干活
2:56.900–3:00.300
常常能干出1加1大于2的效果
3:00.300–3:03.420
把一道难题同时丢给三个模型
3:03.420–3:05.740
谁的答案好呢就用谁
3:05.740–3:07.500
最后整合出的版本
3:07.500–3:10.420
往往比单一模型效果要更好
3:10.420–3:14.300
不同模型的训练数据架构优化目标都不同
3:14.300–3:16.020
犯的错呢也不同
3:16.020–3:17.700
正是这种差异
3:17.700–3:19.420
专业上叫多样性
3:19.420–3:22.500
让互相纠错成为可能
3:22.500–3:24.660
假设有一道题
3:24.660–3:28.700
每个模型独立答对的概率是70%
3:28.700–3:30.820
且错误互相独立
3:30.820–3:33.980
三个模型多数投票后
3:33.980–3:37.340
答对的概率就变成了78.4%
3:37.340–3:39.620
凭空多出8个百分点
3:39.620–3:40.740
什么都没改
3:40.740–3:42.740
只是多问了几步
3:42.740–3:44.740
然后再进行投票而已
3:44.740–3:47.300
但这里有个问题需要注意
3:47.300–3:49.380
模型必须是不同的
3:49.380–3:51.540
如果你拿GPT5.5
3:51.540–3:54.860
加GPT5.5 mini加5 Turbo
3:54.860–3:55.540
来投票
3:55.540–3:57.380
他们失出同门
3:57.380–3:59.020
错误高度雷同
3:59.020–4:01.380
投票几乎没有增益
4:01.380–4:03.140
甚至可能三个一起错
4:03.140–4:07.500
选差异大的模型比选更多模型重要的多
4:07.500–4:10.780
下面我们来看五种融合方式
4:10.780–4:12.620
还有它的优缺点
4:12.620–4:14.740
那第一个就是投票法
4:14.740–4:16.860
多个模型独立作答
4:16.860–4:19.620
出现最多次的答案获胜
4:19.620–4:21.000
简单粗暴
4:21.000–4:24.740
它的优势就是在选择题数学题代码
4:24.740–4:27.800
等一系列有标准答案的任务
4:27.800–4:31.340
那缺点就是在编写文案审美等方面
4:31.340–4:32.820
你没办法用投票
4:32.820–4:35.700
决定哪篇文章写得更好
4:35.700–4:37.780
那第二个就是裁判法
4:37.780–4:41.780
裁判法就是让多个模型各自作答
4:41.780–4:44.620
再用一个更强的模型当裁判
4:44.620–4:46.140
选最优的那一个
4:46.140–4:50.740
优势就是写作文案分析开放式问答
4:50.740–4:54.660
那缺点就是对裁判模型要求比较高
4:54.660–4:57.660
裁判要判断出好坏
4:57.660–5:01.220
这是为什么OpenRouter在融合模型中
5:01.220–5:04.100
把OPUS4.8当裁判的原因
5:04.100–5:06.980
因为这个裁判也会有偏见
5:06.980–5:09.060
比如说谁先回答
5:09.060–5:10.500
谁的回答字数多
5:10.500–5:11.940
画风更客气
5:11.940–5:13.940
他就更愿意采纳谁
5:13.940–5:18.980
这是2024年以来多项研究反复确认的系统性问题
5:18.980–5:21.860
对策是调换候选顺序
5:21.860–5:24.180
各凭一次取平均值
5:24.180–5:28.500
然而代价就是它的Token消耗会高出数倍
5:28.500–5:30.820
那第三种融合方式
5:30.820–5:33.540
就叫MOA分层融合
5:33.540–5:37.140
这个分层融合稍微复杂一些
5:37.140–5:40.820
普通集成可以把它比作为几个厨师
5:40.820–5:41.940
各做一道菜
5:41.940–5:44.980
然后最后端上桌让您选
5:44.980–5:49.860
而MOA是第一层几个厨师各做一道菜
5:49.860–5:51.540
再传给第二层
5:51.540–5:55.540
由第二层的另几个厨师尝过第一层
5:55.540–5:57.460
所有人做的菜之后
5:57.460–5:59.540
再各自改进一把
5:59.540–6:01.460
这样迭代几层之后
6:01.460–6:02.900
最后一个主厨
6:02.900–6:06.740
再把大家的成果综合成一道终极菜
6:07.460–6:09.300
具体到模型
6:09.300–6:11.380
它有两个关键角色
6:11.380–6:13.220
第一个是提议者
6:13.220–6:16.740
是每一层里负责生成答案的多个模型
6:16.740–6:18.980
第二个是聚合者
6:18.980–6:21.780
是负责看完上一层所有答案
6:21.780–6:24.260
再综合出更好版本的模型
6:24.260–6:27.300
这个MOA它的精髓在于
6:27.300–6:28.580
每一层每个模型
6:28.580–6:31.620
都会拿到上一层所有模型的输出
6:31.620–6:32.740
当做参考
6:32.740–6:34.740
然后在此基础上
6:34.740–6:35.860
再写一版
6:35.860–6:37.140
一层一层下来
6:37.140–6:39.860
答案被反复的汇诊补充
6:39.860–6:41.540
纠错越来越好
6:41.540–6:44.180
最后再由一个聚合者拍板
6:44.180–6:47.380
那它适合于追求极致质量
6:47.380–6:48.820
非实时的场景
6:48.820–6:51.540
那它的代价就是调用次数多
6:51.540–6:53.220
质量上限高
6:53.220–6:55.060
但是又贵又慢
6:55.060–6:56.660
那第四个呢
6:56.660–6:58.180
它叫路由法
6:58.180–6:59.380
不融合答案
6:59.380–7:00.820
而是智能分流
7:00.820–7:02.180
简单的问题呢
7:02.180–7:04.260
它就交给便宜的模型
7:04.260–7:06.740
难的问题才调用贵的模型
7:06.740–7:07.700
说白了呢
7:07.700–7:09.620
它就是智能分流
7:09.620–7:12.340
本质上还是单模型在输出
7:12.340–7:15.620
它适合生产环境成本敏感
7:15.620–7:17.140
和大批量处理
7:17.140–7:19.060
那风险就是路由
7:19.060–7:21.140
有的时候也会判断失误
7:21.140–7:24.580
把复杂的问题交给轻量模型去处理
7:24.580–7:26.100
那第五种方式呢
7:26.100–7:28.180
就叫模型合并
7:28.180–7:29.220
打个比方
7:29.220–7:32.180
一个公司招了四个程序员
7:32.180–7:35.380
各自负责前端后端架构审核
7:35.380–7:37.780
现在你找了一个全能程序员
7:37.780–7:40.740
让他学习这四个程序员的手艺
7:40.740–7:43.940
以后你就不用发四份工资了
7:43.940–7:46.100
只雇一个程序员就可以
7:46.100–7:49.540
它的妙处就是融合发生的训练阶段
7:49.540–7:52.660
你平时用的时候只是用一个模型
7:52.660–7:54.260
所以日常使用呢
7:54.260–7:56.260
不会变慢和变贵
7:56.260–7:58.260
实际上现在各家的大模型
7:58.260–8:00.580
已经在做这种模型合并了
8:00.580–8:02.900
比如腾讯的会员模型
8:02.900–8:06.260
它把快思考和慢思考两套能力
8:06.260–8:07.940
融合进一个模型
8:07.940–8:09.540
让模型能力更强
8:09.540–8:11.220
但是最后我们调用时
8:11.220–8:13.300
不需要手动调整
8:13.300–8:16.500
模型会自动切换专家MOE
8:16.500–8:17.700
那这种方式
8:17.700–8:18.980
最大的优点是
8:18.980–8:22.660
合并后推理成本和单个模型完全一样
8:22.660–8:24.340
没有额外开销
8:24.340–8:25.700
适合本地部署
8:25.700–8:28.820
有多个同底座的微调模型
8:28.820–8:32.980
那缺点就是个人只能用现成融合好的模型
8:32.980–8:34.740
想自己融合呢
8:34.740–8:37.860
它有非常大的成本和技术门槛
8:37.860–8:40.180
说完了以上五种融合模式
8:40.180–8:41.620
我们再来看一下
8:41.620–8:43.380
使用融合的办法
8:43.380–8:46.660
模型具体能提升多少智力
8:46.660–8:47.620
2024年
8:47.620–8:51.460
Tagazer AI提出MixedJury of Agent
8:51.460–8:53.380
是这个领域的里程碑
8:53.380–8:56.020
它的做法是分层融合
8:56.020–8:58.420
第一层几个模型各写草稿
8:58.420–8:59.060
第二层
8:59.060–9:01.220
另一个模型读完所有草稿
9:01.220–9:03.540
再出综合判断结果
9:03.540–9:08.340
在衡量回答质量的PakaEvo 2.0榜单上
9:08.340–9:13.540
它的原始结果是超出当时旗舰模型7.6个百分点
9:13.540–9:14.660
但是要注意
9:14.660–9:17.700
这六个模型全部为开源模型
9:17.700–9:20.100
也就是说你的电脑足够多
9:20.100–9:22.500
自己就能配出一个顶尖模型
9:22.500–9:24.660
算力成本却极低
9:24.660–9:25.860
对于企业来说
9:25.860–9:28.900
这种部署方式有很大价值
9:28.900–9:30.420
在数学推理方面
9:30.420–9:34.900
多模型投票通常能带来3-8分的提升
9:34.900–9:36.500
而代码生成
9:36.500–9:40.740
多模型生成加测试用力筛选加裁判选优
9:40.740–9:42.820
可能提升10-20分
9:42.820–9:45.540
这是融合收益最夸张的领域
9:45.540–9:48.500
因为代码能直接跑测试验证
9:48.500–9:50.980
而开放式写作对话
9:50.980–9:56.340
用裁判法和MOA能带来3-15分的提升
9:56.340–9:59.140
而路由法不为提升上限
9:59.140–10:02.740
而是节省约41%的成本
10:02.740–10:06.500
但保住了最强模型95%的性能
10:06.500–10:09.700
在模型能力上限见顶的当下
10:09.700–10:12.660
每提升一分都非常难
10:12.660–10:15.860
这种融合法提升可以说是巨大的
10:15.860–10:17.300
但现实的问题是
10:17.300–10:20.020
OpenAI、Anthrobic这些公司
10:20.020–10:22.180
无法提供这种服务
10:22.180–10:26.660
OpenAI不可能在Codex中添加OPS模型
10:26.660–10:30.180
只能靠第三方做客户端和路由判断
10:30.180–10:33.220
我们再来看融合模型它的成本
10:33.220–10:35.140
先记住一句话
10:35.140–10:36.660
除了路由法
10:36.660–10:40.900
所有融合法都比单独调用一个模型更贵
10:40.900–10:44.180
因为融合的本质就是多调用几次
10:44.180–10:45.860
调用的次数上去了
10:45.860–10:48.020
Token自然就上去了
10:48.020–10:50.340
我们给几种融合法排个序
10:50.340–10:53.940
可以看到MOA在这里是最贵的
10:53.940–10:56.340
如果跟单独调用模型比
10:56.340–11:00.020
那投票、裁判、MOA全部都更贵
11:00.020–11:03.540
路由法是唯一一个能省Token的
11:03.540–11:07.380
如果只在会合并答案的融合法内对比
11:07.380–11:09.780
投票法因为只算N次
11:09.780–11:13.060
不加裁判是这里几个最便宜的
11:13.060–11:16.340
但它依然是单模型成本的N倍
11:16.340–11:20.660
那在这里我们如何使用模型融合呢
11:20.660–11:24.740
个人最快的部署方式就是写一个Skill
11:24.740–11:30.020
将Dbseek或者其他国产模型写入到这个Skill当中
11:30.020–11:32.580
使用的时候直接调用就可以
11:32.580–11:36.420
优势是无论你使用Cloud或者Codex
11:36.420–11:37.860
添加一个Skill
11:37.860–11:42.020
设置一下K的环境变量就可以在Cloud中跑多么
11:42.020–11:43.300
行融合了
11:43.300–11:45.300
让Cloud充当裁判
11:45.300–11:48.580
当然这也会增加一些Token的用量
11:48.580–11:52.660
我目前就是自己写了一个简单的Skill
11:52.660–11:55.140
然后接通中转站的方式
11:55.140–11:57.860
目前正在调整这个Skill
11:57.860–12:01.700
关键就在于这个充当裁判说明书的Skill
12:01.700–12:03.300
写得好并不容易
12:03.300–12:05.940
那如果你是玩本地模型的
12:05.940–12:09.500
也可以用MergerKit这个主流开源工具
12:09.500–12:14.420
那它支持逐层拼接合并LauraTeach
12:14.420–12:16.980
还能提供网页版零代码
12:16.980–12:19.100
无需GPU在线合并
12:19.100–12:24.320
如果是想同时调用GPT或者Opus这些模型的话
12:24.320–12:25.940
可以用OpenRouter
12:25.940–12:28.740
这个网站接入了数百个模型
12:28.740–12:32.580
其中的Fusion模式会把同一个Prompt
12:32.580–12:35.020
并行发送给一组模型
12:35.020–12:39.460
再由裁判模型分析共识矛盾综合输出
12:39.460–12:42.260
缺点就是价格会比较贵
12:42.260–12:43.740
那我用下来呢
12:43.740–12:47.240
一个2000字的输出大概就需要两美金
12:47.240–12:49.220
这个坑我已经踩过了
12:49.220–12:51.660
从这几个方面来看
12:51.660–12:54.140
现在并没有特别好的融合软件
12:54.140–12:56.540
关键点在于算法
12:56.540–12:59.700
目前融合这条路呢也在探索中
12:59.700–13:03.140
相信未来会有更好的第三方融合工具
13:03.140–13:05.580
那最后我们来总结一下
13:05.580–13:08.980
从2024年到2026年这两年
13:08.980–13:12.940
多模型融合从论文阶段逐渐走进大厂
13:12.940–13:16.140
各种模型厂商正在把融合逻辑
13:16.140–13:18.140
内化进单个模型
13:18.140–13:21.580
今天的旗舰模型大多是混合专家架构
13:21.580–13:26.020
本质就是把多专家融合进一个模型内部
13:26.020–13:29.060
但这并不代表外部融合会消失
13:29.060–13:30.260
恰恰相反
13:30.260–13:35.660
当你同时调用多家厂商能力边界完全不同的模型时
13:35.660–13:40.220
外部融合能突破任何一家单一模型的上限
13:40.220–13:43.740
这个是单个MOE模型做不到的
13:43.740–13:46.420
比如每家都有自己的训练员
13:46.420–13:49.380
解锁信息也有特定的网站
13:49.380–13:52.460
比如Gminite就可以搜索YouTube
13:52.460–13:55.300
而豆包可以搜索抖音
13:55.300–13:55.860
好了
13:55.860–13:58.500
这就是本期视频的全部内容
13:58.500–14:01.860
欢迎大家点赞留言订阅转发
14:01.860–14:02.620
我是刘延
14:02.620–14:04.500
我们下个视频见
0:00.000–0:03.540
Fibon 5仅仅上线了三天就被下架了
0:03.540–0:06.740
原因是美国的出口管制指令
0:06.740–0:11.240
但仅仅几天就找到了替代Fibon 5的方法
0:11.240–0:14.640
Open Router最新公布了一套测试
0:14.640–0:16.860
在测试中使用融合技术
0:16.860–0:21.740
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
0:21.740–0:24.700
这套组合进行Dirico测试
0:24.700–0:28.040
得分为64.7%
0:28.040–0:32.140
而Fibon 5的单模型得分是65.3%
0:32.140–0:35.000
仅仅相差0.6%
0:35.000–0:40.840
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
0:40.840–0:46.800
这三个模型融合得分更是高达68.3%
0:46.800–0:50.600
这下美国封锁Fibon 5显然意义也不大了
0:50.600–0:55.180
那今天我们不探讨得分的具体细节
0:55.180–0:57.520
详细聊聊这个融合技术
0:57.520–1:01.120
它是怎么打破自己的智力上限的
1:01.120–1:04.480
我们从几个点把这个知识吃透
1:04.480–1:07.200
那第一什么是融合模型
1:07.200–1:12.720
第二融合模型的五种干活方式以及优缺点
1:12.720–1:16.140
第三就是融合技术的真实效果怎么样
1:16.140–1:19.600
第四融合技术的成本是多少
1:19.600–1:26.220
那第五如何快速在Cloud和Codex中使用简单的融合
1:26.220–1:30.520
那第五就是在使用中哪些坑不要踩
1:30.520–1:33.980
我们先来看第一融合的原理
1:33.980–1:37.580
你大概有过这种经验
1:37.580–1:39.580
同一个问题
1:39.580–1:43.180
第五它的回答详细但是有点啰嗦
1:43.180–1:46.120
但Cloud Ops简洁严谨
1:46.120–1:47.980
但是回答比较高了
1:47.980–1:49.660
问Deepseek回答呢
1:49.660–1:50.760
它有哲学性
1:50.760–1:52.860
但写代码稍微差点意思
1:52.860–1:55.720
问Gmini它适合插资料
1:55.720–1:58.060
但有时候它也会降置
1:58.060–2:02.020
那每个模型都有长版也有短版
2:02.020–2:05.260
那于是一个很自然的想法就冒出来
2:05.260–2:08.380
能不能把这些模型的答案融合起来
2:08.380–2:09.340
取长补短呢
2:09.340–2:12.280
这就是多模型融合
2:12.280–2:15.060
它的技术就是为了解决这个问题
2:15.060–2:17.920
那融合技术有多厉害呢
2:17.920–2:19.260
先讲个故事
2:19.260–2:24.020
2024年一家叫Sakana的日本AI小公司
2:24.020–2:25.600
没花什么大价钱
2:25.600–2:27.480
训练了一个新模型
2:27.480–2:30.880
只是把两个县城的开源免费模型
2:30.880–2:32.500
一个擅长日语
2:32.500–2:33.820
一个擅长数学
2:33.820–2:36.520
用巧妙的办法拼在了一起
2:36.520–2:39.260
结果这个拼出来的新模型
2:39.260–2:41.820
既会日语又会做数学题
2:41.820–2:44.820
还在日语数学的权威测试里
2:44.820–2:46.220
拿下了一个第一
2:46.220–2:48.880
打败了比它大好几倍的模型
2:48.880–2:52.260
而它从没有专门为这个任务训练过
2:52.260–2:54.420
用一句话解释就是
2:54.420–2:56.900
让多个AI模型一起干活
2:56.900–3:00.300
常常能干出1加1大于2的效果
3:00.300–3:03.420
把一道难题同时丢给三个模型
3:03.420–3:05.740
谁的答案好呢就用谁
3:05.740–3:07.500
最后整合出的版本
3:07.500–3:10.420
往往比单一模型效果要更好
3:10.420–3:14.300
不同模型的训练数据架构优化目标都不同
3:14.300–3:16.020
犯的错呢也不同
3:16.020–3:17.700
正是这种差异
3:17.700–3:19.420
专业上叫多样性
3:19.420–3:22.500
让互相纠错成为可能
3:22.500–3:24.660
假设有一道题
3:24.660–3:28.700
每个模型独立答对的概率是70%
3:28.700–3:30.820
且错误互相独立
3:30.820–3:33.980
三个模型多数投票后
3:33.980–3:37.340
答对的概率就变成了78.4%
3:37.340–3:39.620
凭空多出8个百分点
3:39.620–3:40.740
什么都没改
3:40.740–3:42.740
只是多问了几步
3:42.740–3:44.740
然后再进行投票而已
3:44.740–3:47.300
但这里有个问题需要注意
3:47.300–3:49.380
模型必须是不同的
3:49.380–3:51.540
如果你拿GPT5.5
3:51.540–3:54.860
加GPT5.5 mini加5 Turbo
3:54.860–3:55.540
来投票
3:55.540–3:57.380
他们失出同门
3:57.380–3:59.020
错误高度雷同
3:59.020–4:01.380
投票几乎没有增益
4:01.380–4:03.140
甚至可能三个一起错
4:03.140–4:07.500
选差异大的模型比选更多模型重要的多
4:07.500–4:10.780
下面我们来看五种融合方式
4:10.780–4:12.620
还有它的优缺点
4:12.620–4:14.740
那第一个就是投票法
4:14.740–4:16.860
多个模型独立作答
4:16.860–4:19.620
出现最多次的答案获胜
4:19.620–4:21.000
简单粗暴
4:21.000–4:24.740
它的优势就是在选择题数学题代码
4:24.740–4:27.800
等一系列有标准答案的任务
4:27.800–4:31.340
那缺点就是在编写文案审美等方面
4:31.340–4:32.820
你没办法用投票
4:32.820–4:35.700
决定哪篇文章写得更好
4:35.700–4:37.780
那第二个就是裁判法
4:37.780–4:41.780
裁判法就是让多个模型各自作答
4:41.780–4:44.620
再用一个更强的模型当裁判
4:44.620–4:46.140
选最优的那一个
4:46.140–4:50.740
优势就是写作文案分析开放式问答
4:50.740–4:54.660
那缺点就是对裁判模型要求比较高
4:54.660–4:57.660
裁判要判断出好坏
4:57.660–5:01.220
这是为什么OpenRouter在融合模型中
5:01.220–5:04.100
把OPUS4.8当裁判的原因
5:04.100–5:06.980
因为这个裁判也会有偏见
5:06.980–5:09.060
比如说谁先回答
5:09.060–5:10.500
谁的回答字数多
5:10.500–5:11.940
画风更客气
5:11.940–5:13.940
他就更愿意采纳谁
5:13.940–5:18.980
这是2024年以来多项研究反复确认的系统性问题
5:18.980–5:21.860
对策是调换候选顺序
5:21.860–5:24.180
各凭一次取平均值
5:24.180–5:28.500
然而代价就是它的Token消耗会高出数倍
5:28.500–5:30.820
那第三种融合方式
5:30.820–5:33.540
就叫MOA分层融合
5:33.540–5:37.140
这个分层融合稍微复杂一些
5:37.140–5:40.820
普通集成可以把它比作为几个厨师
5:40.820–5:41.940
各做一道菜
5:41.940–5:44.980
然后最后端上桌让您选
5:44.980–5:49.860
而MOA是第一层几个厨师各做一道菜
5:49.860–5:51.540
再传给第二层
5:51.540–5:55.540
由第二层的另几个厨师尝过第一层
5:55.540–5:57.460
所有人做的菜之后
5:57.460–5:59.540
再各自改进一把
5:59.540–6:01.460
这样迭代几层之后
6:01.460–6:02.900
最后一个主厨
6:02.900–6:06.740
再把大家的成果综合成一道终极菜
6:07.460–6:09.300
具体到模型
6:09.300–6:11.380
它有两个关键角色
6:11.380–6:13.220
第一个是提议者
6:13.220–6:16.740
是每一层里负责生成答案的多个模型
6:16.740–6:18.980
第二个是聚合者
6:18.980–6:21.780
是负责看完上一层所有答案
6:21.780–6:24.260
再综合出更好版本的模型
6:24.260–6:27.300
这个MOA它的精髓在于
6:27.300–6:28.580
每一层每个模型
6:28.580–6:31.620
都会拿到上一层所有模型的输出
6:31.620–6:32.740
当做参考
6:32.740–6:34.740
然后在此基础上
6:34.740–6:35.860
再写一版
6:35.860–6:37.140
一层一层下来
6:37.140–6:39.860
答案被反复的汇诊补充
6:39.860–6:41.540
纠错越来越好
6:41.540–6:44.180
最后再由一个聚合者拍板
6:44.180–6:47.380
那它适合于追求极致质量
6:47.380–6:48.820
非实时的场景
6:48.820–6:51.540
那它的代价就是调用次数多
6:51.540–6:53.220
质量上限高
6:53.220–6:55.060
但是又贵又慢
6:55.060–6:56.660
那第四个呢
6:56.660–6:58.180
它叫路由法
6:58.180–6:59.380
不融合答案
6:59.380–7:00.820
而是智能分流
7:00.820–7:02.180
简单的问题呢
7:02.180–7:04.260
它就交给便宜的模型
7:04.260–7:06.740
难的问题才调用贵的模型
7:06.740–7:07.700
说白了呢
7:07.700–7:09.620
它就是智能分流
7:09.620–7:12.340
本质上还是单模型在输出
7:12.340–7:15.620
它适合生产环境成本敏感
7:15.620–7:17.140
和大批量处理
7:17.140–7:19.060
那风险就是路由
7:19.060–7:21.140
有的时候也会判断失误
7:21.140–7:24.580
把复杂的问题交给轻量模型去处理
7:24.580–7:26.100
那第五种方式呢
7:26.100–7:28.180
就叫模型合并
7:28.180–7:29.220
打个比方
7:29.220–7:32.180
一个公司招了四个程序员
7:32.180–7:35.380
各自负责前端后端架构审核
7:35.380–7:37.780
现在你找了一个全能程序员
7:37.780–7:40.740
让他学习这四个程序员的手艺
7:40.740–7:43.940
以后你就不用发四份工资了
7:43.940–7:46.100
只雇一个程序员就可以
7:46.100–7:49.540
它的妙处就是融合发生的训练阶段
7:49.540–7:52.660
你平时用的时候只是用一个模型
7:52.660–7:54.260
所以日常使用呢
7:54.260–7:56.260
不会变慢和变贵
7:56.260–7:58.260
实际上现在各家的大模型
7:58.260–8:00.580
已经在做这种模型合并了
8:00.580–8:02.900
比如腾讯的会员模型
8:02.900–8:06.260
它把快思考和慢思考两套能力
8:06.260–8:07.940
融合进一个模型
8:07.940–8:09.540
让模型能力更强
8:09.540–8:11.220
但是最后我们调用时
8:11.220–8:13.300
不需要手动调整
8:13.300–8:16.500
模型会自动切换专家MOE
8:16.500–8:17.700
那这种方式
8:17.700–8:18.980
最大的优点是
8:18.980–8:22.660
合并后推理成本和单个模型完全一样
8:22.660–8:24.340
没有额外开销
8:24.340–8:25.700
适合本地部署
8:25.700–8:28.820
有多个同底座的微调模型
8:28.820–8:32.980
那缺点就是个人只能用现成融合好的模型
8:32.980–8:34.740
想自己融合呢
8:34.740–8:37.860
它有非常大的成本和技术门槛
8:37.860–8:40.180
说完了以上五种融合模式
8:40.180–8:41.620
我们再来看一下
8:41.620–8:43.380
使用融合的办法
8:43.380–8:46.660
模型具体能提升多少智力
8:46.660–8:47.620
2024年
8:47.620–8:51.460
Tagazer AI提出MixedJury of Agent
8:51.460–8:53.380
是这个领域的里程碑
8:53.380–8:56.020
它的做法是分层融合
8:56.020–8:58.420
第一层几个模型各写草稿
8:58.420–8:59.060
第二层
8:59.060–9:01.220
另一个模型读完所有草稿
9:01.220–9:03.540
再出综合判断结果
9:03.540–9:08.340
在衡量回答质量的PakaEvo 2.0榜单上
9:08.340–9:13.540
它的原始结果是超出当时旗舰模型7.6个百分点
9:13.540–9:14.660
但是要注意
9:14.660–9:17.700
这六个模型全部为开源模型
9:17.700–9:20.100
也就是说你的电脑足够多
9:20.100–9:22.500
自己就能配出一个顶尖模型
9:22.500–9:24.660
算力成本却极低
9:24.660–9:25.860
对于企业来说
9:25.860–9:28.900
这种部署方式有很大价值
9:28.900–9:30.420
在数学推理方面
9:30.420–9:34.900
多模型投票通常能带来3-8分的提升
9:34.900–9:36.500
而代码生成
9:36.500–9:40.740
多模型生成加测试用力筛选加裁判选优
9:40.740–9:42.820
可能提升10-20分
9:42.820–9:45.540
这是融合收益最夸张的领域
9:45.540–9:48.500
因为代码能直接跑测试验证
9:48.500–9:50.980
而开放式写作对话
9:50.980–9:56.340
用裁判法和MOA能带来3-15分的提升
9:56.340–9:59.140
而路由法不为提升上限
9:59.140–10:02.740
而是节省约41%的成本
10:02.740–10:06.500
但保住了最强模型95%的性能
10:06.500–10:09.700
在模型能力上限见顶的当下
10:09.700–10:12.660
每提升一分都非常难
10:12.660–10:15.860
这种融合法提升可以说是巨大的
10:15.860–10:17.300
但现实的问题是
10:17.300–10:20.020
OpenAI、Anthrobic这些公司
10:20.020–10:22.180
无法提供这种服务
10:22.180–10:26.660
OpenAI不可能在Codex中添加OPS模型
10:26.660–10:30.180
只能靠第三方做客户端和路由判断
10:30.180–10:33.220
我们再来看融合模型它的成本
10:33.220–10:35.140
先记住一句话
10:35.140–10:36.660
除了路由法
10:36.660–10:40.900
所有融合法都比单独调用一个模型更贵
10:40.900–10:44.180
因为融合的本质就是多调用几次
10:44.180–10:45.860
调用的次数上去了
10:45.860–10:48.020
Token自然就上去了
10:48.020–10:50.340
我们给几种融合法排个序
10:50.340–10:53.940
可以看到MOA在这里是最贵的
10:53.940–10:56.340
如果跟单独调用模型比
10:56.340–11:00.020
那投票、裁判、MOA全部都更贵
11:00.020–11:03.540
路由法是唯一一个能省Token的
11:03.540–11:07.380
如果只在会合并答案的融合法内对比
11:07.380–11:09.780
投票法因为只算N次
11:09.780–11:13.060
不加裁判是这里几个最便宜的
11:13.060–11:16.340
但它依然是单模型成本的N倍
11:16.340–11:20.660
那在这里我们如何使用模型融合呢
11:20.660–11:24.740
个人最快的部署方式就是写一个Skill
11:24.740–11:30.020
将Dbseek或者其他国产模型写入到这个Skill当中
11:30.020–11:32.580
使用的时候直接调用就可以
11:32.580–11:36.420
优势是无论你使用Cloud或者Codex
11:36.420–11:37.860
添加一个Skill
11:37.860–11:42.020
设置一下K的环境变量就可以在Cloud中跑多么
11:42.020–11:43.300
行融合了
11:43.300–11:45.300
让Cloud充当裁判
11:45.300–11:48.580
当然这也会增加一些Token的用量
11:48.580–11:52.660
我目前就是自己写了一个简单的Skill
11:52.660–11:55.140
然后接通中转站的方式
11:55.140–11:57.860
目前正在调整这个Skill
11:57.860–12:01.700
关键就在于这个充当裁判说明书的Skill
12:01.700–12:03.300
写得好并不容易
12:03.300–12:05.940
那如果你是玩本地模型的
12:05.940–12:09.500
也可以用MergerKit这个主流开源工具
12:09.500–12:14.420
那它支持逐层拼接合并LauraTeach
12:14.420–12:16.980
还能提供网页版零代码
12:16.980–12:19.100
无需GPU在线合并
12:19.100–12:24.320
如果是想同时调用GPT或者Opus这些模型的话
12:24.320–12:25.940
可以用OpenRouter
12:25.940–12:28.740
这个网站接入了数百个模型
12:28.740–12:32.580
其中的Fusion模式会把同一个Prompt
12:32.580–12:35.020
并行发送给一组模型
12:35.020–12:39.460
再由裁判模型分析共识矛盾综合输出
12:39.460–12:42.260
缺点就是价格会比较贵
12:42.260–12:43.740
那我用下来呢
12:43.740–12:47.240
一个2000字的输出大概就需要两美金
12:47.240–12:49.220
这个坑我已经踩过了
12:49.220–12:51.660
从这几个方面来看
12:51.660–12:54.140
现在并没有特别好的融合软件
12:54.140–12:56.540
关键点在于算法
12:56.540–12:59.700
目前融合这条路呢也在探索中
12:59.700–13:03.140
相信未来会有更好的第三方融合工具
13:03.140–13:05.580
那最后我们来总结一下
13:05.580–13:08.980
从2024年到2026年这两年
13:08.980–13:12.940
多模型融合从论文阶段逐渐走进大厂
13:12.940–13:16.140
各种模型厂商正在把融合逻辑
13:16.140–13:18.140
内化进单个模型
13:18.140–13:21.580
今天的旗舰模型大多是混合专家架构
13:21.580–13:26.020
本质就是把多专家融合进一个模型内部
13:26.020–13:29.060
但这并不代表外部融合会消失
13:29.060–13:30.260
恰恰相反
13:30.260–13:35.660
当你同时调用多家厂商能力边界完全不同的模型时
13:35.660–13:40.220
外部融合能突破任何一家单一模型的上限
13:40.220–13:43.740
这个是单个MOE模型做不到的
13:43.740–13:46.420
比如每家都有自己的训练员
13:46.420–13:49.380
解锁信息也有特定的网站
13:49.380–13:52.460
比如Gminite就可以搜索YouTube
13:52.460–13:55.300
而豆包可以搜索抖音
13:55.300–13:55.860
好了
13:55.860–13:58.500
这就是本期视频的全部内容
13:58.500–14:01.860
欢迎大家点赞留言订阅转发
14:01.860–14:02.620
我是刘延
14:02.620–14:04.500
我们下个视频见
0:00.000–0:03.540
Fibon 5仅仅上线了三天就被下架了
Fibon 5仅仅上线了三天就被下架了
0:03.540–0:06.740
原因是美国的出口管制指令
原因是美国的出口管制指令
0:06.740–0:11.240
但仅仅几天就找到了替代Fibon 5的方法
但仅仅几天就找到了替代Fibon 5的方法
0:11.240–0:14.640
Open Router最新公布了一套测试
Open Router最新公布了一套测试
0:14.640–0:16.860
在测试中使用融合技术
在测试中使用融合技术
0:16.860–0:21.740
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
0:21.740–0:24.700
这套组合进行Dirico测试
这套组合进行Dirico测试
0:24.700–0:28.040
得分为64.7%
得分为64.7%
0:28.040–0:32.140
而Fibon 5的单模型得分是65.3%
而Fibon 5的单模型得分是65.3%
0:32.140–0:35.000
仅仅相差0.6%
仅仅相差0.6%
0:35.000–0:40.840
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
0:40.840–0:46.800
这三个模型融合得分更是高达68.3%
这三个模型融合得分更是高达68.3%
0:46.800–0:50.600
这下美国封锁Fibon 5显然意义也不大了
这下美国封锁Fibon 5显然意义也不大了
0:50.600–0:55.180
那今天我们不探讨得分的具体细节
那今天我们不探讨得分的具体细节
0:55.180–0:57.520
详细聊聊这个融合技术
详细聊聊这个融合技术
0:57.520–1:01.120
它是怎么打破自己的智力上限的
它是怎么打破自己的智力上限的
1:01.120–1:04.480
我们从几个点把这个知识吃透
我们从几个点把这个知识吃透
1:04.480–1:07.200
那第一什么是融合模型
那第一什么是融合模型
1:07.200–1:12.720
第二融合模型的五种干活方式以及优缺点
第二融合模型的五种干活方式以及优缺点
1:12.720–1:16.140
第三就是融合技术的真实效果怎么样
第三就是融合技术的真实效果怎么样
1:16.140–1:19.600
第四融合技术的成本是多少
第四融合技术的成本是多少
1:19.600–1:26.220
那第五如何快速在Cloud和Codex中使用简单的融合
那第五如何快速在Cloud和Codex中使用简单的融合
1:26.220–1:30.520
那第五就是在使用中哪些坑不要踩
那第五就是在使用中哪些坑不要踩
1:30.520–1:33.980
我们先来看第一融合的原理
我们先来看第一融合的原理
1:33.980–1:37.580
你大概有过这种经验
你大概有过这种经验
1:37.580–1:39.580
同一个问题
同一个问题
1:39.580–1:43.180
第五它的回答详细但是有点啰嗦
第五它的回答详细但是有点啰嗦
1:43.180–1:46.120
但Cloud Ops简洁严谨
但Cloud Ops简洁严谨
1:46.120–1:47.980
但是回答比较高了
但是回答比较高了
1:47.980–1:49.660
问Deepseek回答呢
问Deepseek回答呢
1:49.660–1:50.760
它有哲学性
它有哲学性
1:50.760–1:52.860
但写代码稍微差点意思
但写代码稍微差点意思
1:52.860–1:55.720
问Gmini它适合插资料
问Gmini它适合插资料
1:55.720–1:58.060
但有时候它也会降置
但有时候它也会降置
1:58.060–2:02.020
那每个模型都有长版也有短版
那每个模型都有长版也有短版
2:02.020–2:05.260
那于是一个很自然的想法就冒出来
那于是一个很自然的想法就冒出来
2:05.260–2:08.380
能不能把这些模型的答案融合起来
能不能把这些模型的答案融合起来
2:08.380–2:09.340
取长补短呢
取长补短呢
2:09.340–2:12.280
这就是多模型融合
这就是多模型融合
2:12.280–2:15.060
它的技术就是为了解决这个问题
它的技术就是为了解决这个问题
2:15.060–2:17.920
那融合技术有多厉害呢
那融合技术有多厉害呢
2:17.920–2:19.260
先讲个故事
先讲个故事
2:19.260–2:24.020
2024年一家叫Sakana的日本AI小公司
2024年一家叫Sakana的日本AI小公司
2:24.020–2:25.600
没花什么大价钱
没花什么大价钱
2:25.600–2:27.480
训练了一个新模型
训练了一个新模型
2:27.480–2:30.880
只是把两个县城的开源免费模型
只是把两个县城的开源免费模型
2:30.880–2:32.500
一个擅长日语
一个擅长日语
2:32.500–2:33.820
一个擅长数学
一个擅长数学
2:33.820–2:36.520
用巧妙的办法拼在了一起
用巧妙的办法拼在了一起
2:36.520–2:39.260
结果这个拼出来的新模型
结果这个拼出来的新模型
2:39.260–2:41.820
既会日语又会做数学题
既会日语又会做数学题
2:41.820–2:44.820
还在日语数学的权威测试里
还在日语数学的权威测试里
2:44.820–2:46.220
拿下了一个第一
拿下了一个第一
2:46.220–2:48.880
打败了比它大好几倍的模型
打败了比它大好几倍的模型
2:48.880–2:52.260
而它从没有专门为这个任务训练过
而它从没有专门为这个任务训练过
2:52.260–2:54.420
用一句话解释就是
用一句话解释就是
2:54.420–2:56.900
让多个AI模型一起干活
让多个AI模型一起干活
2:56.900–3:00.300
常常能干出1加1大于2的效果
常常能干出1加1大于2的效果
3:00.300–3:03.420
把一道难题同时丢给三个模型
把一道难题同时丢给三个模型
3:03.420–3:05.740
谁的答案好呢就用谁
谁的答案好呢就用谁
3:05.740–3:07.500
最后整合出的版本
最后整合出的版本
3:07.500–3:10.420
往往比单一模型效果要更好
往往比单一模型效果要更好
3:10.420–3:14.300
不同模型的训练数据架构优化目标都不同
不同模型的训练数据架构优化目标都不同
3:14.300–3:16.020
犯的错呢也不同
犯的错呢也不同
3:16.020–3:17.700
正是这种差异
正是这种差异
3:17.700–3:19.420
专业上叫多样性
专业上叫多样性
3:19.420–3:22.500
让互相纠错成为可能
让互相纠错成为可能
3:22.500–3:24.660
假设有一道题
假设有一道题
3:24.660–3:28.700
每个模型独立答对的概率是70%
每个模型独立答对的概率是70%
3:28.700–3:30.820
且错误互相独立
且错误互相独立
3:30.820–3:33.980
三个模型多数投票后
三个模型多数投票后
3:33.980–3:37.340
答对的概率就变成了78.4%
答对的概率就变成了78.4%
3:37.340–3:39.620
凭空多出8个百分点
凭空多出8个百分点
3:39.620–3:40.740
什么都没改
什么都没改
3:40.740–3:42.740
只是多问了几步
只是多问了几步
3:42.740–3:44.740
然后再进行投票而已
然后再进行投票而已
3:44.740–3:47.300
但这里有个问题需要注意
但这里有个问题需要注意
3:47.300–3:49.380
模型必须是不同的
模型必须是不同的
3:49.380–3:51.540
如果你拿GPT5.5
如果你拿GPT5.5
3:51.540–3:54.860
加GPT5.5 mini加5 Turbo
加GPT5.5 mini加5 Turbo
3:54.860–3:55.540
来投票
来投票
3:55.540–3:57.380
他们失出同门
他们失出同门
3:57.380–3:59.020
错误高度雷同
错误高度雷同
3:59.020–4:01.380
投票几乎没有增益
投票几乎没有增益
4:01.380–4:03.140
甚至可能三个一起错
甚至可能三个一起错
4:03.140–4:07.500
选差异大的模型比选更多模型重要的多
选差异大的模型比选更多模型重要的多
4:07.500–4:10.780
下面我们来看五种融合方式
下面我们来看五种融合方式
4:10.780–4:12.620
还有它的优缺点
还有它的优缺点
4:12.620–4:14.740
那第一个就是投票法
那第一个就是投票法
4:14.740–4:16.860
多个模型独立作答
多个模型独立作答
4:16.860–4:19.620
出现最多次的答案获胜
出现最多次的答案获胜
4:19.620–4:21.000
简单粗暴
简单粗暴
4:21.000–4:24.740
它的优势就是在选择题数学题代码
它的优势就是在选择题数学题代码
4:24.740–4:27.800
等一系列有标准答案的任务
等一系列有标准答案的任务
4:27.800–4:31.340
那缺点就是在编写文案审美等方面
那缺点就是在编写文案审美等方面
4:31.340–4:32.820
你没办法用投票
你没办法用投票
4:32.820–4:35.700
决定哪篇文章写得更好
决定哪篇文章写得更好
4:35.700–4:37.780
那第二个就是裁判法
那第二个就是裁判法
4:37.780–4:41.780
裁判法就是让多个模型各自作答
裁判法就是让多个模型各自作答
4:41.780–4:44.620
再用一个更强的模型当裁判
再用一个更强的模型当裁判
4:44.620–4:46.140
选最优的那一个
选最优的那一个
4:46.140–4:50.740
优势就是写作文案分析开放式问答
优势就是写作文案分析开放式问答
4:50.740–4:54.660
那缺点就是对裁判模型要求比较高
那缺点就是对裁判模型要求比较高
4:54.660–4:57.660
裁判要判断出好坏
裁判要判断出好坏
4:57.660–5:01.220
这是为什么OpenRouter在融合模型中
这是为什么OpenRouter在融合模型中
5:01.220–5:04.100
把OPUS4.8当裁判的原因
把OPUS4.8当裁判的原因
5:04.100–5:06.980
因为这个裁判也会有偏见
因为这个裁判也会有偏见
5:06.980–5:09.060
比如说谁先回答
比如说谁先回答
5:09.060–5:10.500
谁的回答字数多
谁的回答字数多
5:10.500–5:11.940
画风更客气
画风更客气
5:11.940–5:13.940
他就更愿意采纳谁
他就更愿意采纳谁
5:13.940–5:18.980
这是2024年以来多项研究反复确认的系统性问题
这是2024年以来多项研究反复确认的系统性问题
5:18.980–5:21.860
对策是调换候选顺序
对策是调换候选顺序
5:21.860–5:24.180
各凭一次取平均值
各凭一次取平均值
5:24.180–5:28.500
然而代价就是它的Token消耗会高出数倍
然而代价就是它的Token消耗会高出数倍
5:28.500–5:30.820
那第三种融合方式
那第三种融合方式
5:30.820–5:33.540
就叫MOA分层融合
就叫MOA分层融合
5:33.540–5:37.140
这个分层融合稍微复杂一些
这个分层融合稍微复杂一些
5:37.140–5:40.820
普通集成可以把它比作为几个厨师
普通集成可以把它比作为几个厨师
5:40.820–5:41.940
各做一道菜
各做一道菜
5:41.940–5:44.980
然后最后端上桌让您选
然后最后端上桌让您选
5:44.980–5:49.860
而MOA是第一层几个厨师各做一道菜
而MOA是第一层几个厨师各做一道菜
5:49.860–5:51.540
再传给第二层
再传给第二层
5:51.540–5:55.540
由第二层的另几个厨师尝过第一层
由第二层的另几个厨师尝过第一层
5:55.540–5:57.460
所有人做的菜之后
所有人做的菜之后
5:57.460–5:59.540
再各自改进一把
再各自改进一把
5:59.540–6:01.460
这样迭代几层之后
这样迭代几层之后
6:01.460–6:02.900
最后一个主厨
最后一个主厨
6:02.900–6:06.740
再把大家的成果综合成一道终极菜
再把大家的成果综合成一道终极菜
6:07.460–6:09.300
具体到模型
具体到模型
6:09.300–6:11.380
它有两个关键角色
它有两个关键角色
6:11.380–6:13.220
第一个是提议者
第一个是提议者
6:13.220–6:16.740
是每一层里负责生成答案的多个模型
是每一层里负责生成答案的多个模型
6:16.740–6:18.980
第二个是聚合者
第二个是聚合者
6:18.980–6:21.780
是负责看完上一层所有答案
是负责看完上一层所有答案
6:21.780–6:24.260
再综合出更好版本的模型
再综合出更好版本的模型
6:24.260–6:27.300
这个MOA它的精髓在于
这个MOA它的精髓在于
6:27.300–6:28.580
每一层每个模型
每一层每个模型
6:28.580–6:31.620
都会拿到上一层所有模型的输出
都会拿到上一层所有模型的输出
6:31.620–6:32.740
当做参考
当做参考
6:32.740–6:34.740
然后在此基础上
然后在此基础上
6:34.740–6:35.860
再写一版
再写一版
6:35.860–6:37.140
一层一层下来
一层一层下来
6:37.140–6:39.860
答案被反复的汇诊补充
答案被反复的汇诊补充
6:39.860–6:41.540
纠错越来越好
纠错越来越好
6:41.540–6:44.180
最后再由一个聚合者拍板
最后再由一个聚合者拍板
6:44.180–6:47.380
那它适合于追求极致质量
那它适合于追求极致质量
6:47.380–6:48.820
非实时的场景
非实时的场景
6:48.820–6:51.540
那它的代价就是调用次数多
那它的代价就是调用次数多
6:51.540–6:53.220
质量上限高
质量上限高
6:53.220–6:55.060
但是又贵又慢
但是又贵又慢
6:55.060–6:56.660
那第四个呢
那第四个呢
6:56.660–6:58.180
它叫路由法
它叫路由法
6:58.180–6:59.380
不融合答案
不融合答案
6:59.380–7:00.820
而是智能分流
而是智能分流
7:00.820–7:02.180
简单的问题呢
简单的问题呢
7:02.180–7:04.260
它就交给便宜的模型
它就交给便宜的模型
7:04.260–7:06.740
难的问题才调用贵的模型
难的问题才调用贵的模型
7:06.740–7:07.700
说白了呢
说白了呢
7:07.700–7:09.620
它就是智能分流
它就是智能分流
7:09.620–7:12.340
本质上还是单模型在输出
本质上还是单模型在输出
7:12.340–7:15.620
它适合生产环境成本敏感
它适合生产环境成本敏感
7:15.620–7:17.140
和大批量处理
和大批量处理
7:17.140–7:19.060
那风险就是路由
那风险就是路由
7:19.060–7:21.140
有的时候也会判断失误
有的时候也会判断失误
7:21.140–7:24.580
把复杂的问题交给轻量模型去处理
把复杂的问题交给轻量模型去处理
7:24.580–7:26.100
那第五种方式呢
那第五种方式呢
7:26.100–7:28.180
就叫模型合并
就叫模型合并
7:28.180–7:29.220
打个比方
打个比方
7:29.220–7:32.180
一个公司招了四个程序员
一个公司招了四个程序员
7:32.180–7:35.380
各自负责前端后端架构审核
各自负责前端后端架构审核
7:35.380–7:37.780
现在你找了一个全能程序员
现在你找了一个全能程序员
7:37.780–7:40.740
让他学习这四个程序员的手艺
让他学习这四个程序员的手艺
7:40.740–7:43.940
以后你就不用发四份工资了
以后你就不用发四份工资了
7:43.940–7:46.100
只雇一个程序员就可以
只雇一个程序员就可以
7:46.100–7:49.540
它的妙处就是融合发生的训练阶段
它的妙处就是融合发生的训练阶段
7:49.540–7:52.660
你平时用的时候只是用一个模型
你平时用的时候只是用一个模型
7:52.660–7:54.260
所以日常使用呢
所以日常使用呢
7:54.260–7:56.260
不会变慢和变贵
不会变慢和变贵
7:56.260–7:58.260
实际上现在各家的大模型
实际上现在各家的大模型
7:58.260–8:00.580
已经在做这种模型合并了
已经在做这种模型合并了
8:00.580–8:02.900
比如腾讯的会员模型
比如腾讯的会员模型
8:02.900–8:06.260
它把快思考和慢思考两套能力
它把快思考和慢思考两套能力
8:06.260–8:07.940
融合进一个模型
融合进一个模型
8:07.940–8:09.540
让模型能力更强
让模型能力更强
8:09.540–8:11.220
但是最后我们调用时
但是最后我们调用时
8:11.220–8:13.300
不需要手动调整
不需要手动调整
8:13.300–8:16.500
模型会自动切换专家MOE
模型会自动切换专家MOE
8:16.500–8:17.700
那这种方式
那这种方式
8:17.700–8:18.980
最大的优点是
最大的优点是
8:18.980–8:22.660
合并后推理成本和单个模型完全一样
合并后推理成本和单个模型完全一样
8:22.660–8:24.340
没有额外开销
没有额外开销
8:24.340–8:25.700
适合本地部署
适合本地部署
8:25.700–8:28.820
有多个同底座的微调模型
有多个同底座的微调模型
8:28.820–8:32.980
那缺点就是个人只能用现成融合好的模型
那缺点就是个人只能用现成融合好的模型
8:32.980–8:34.740
想自己融合呢
想自己融合呢
8:34.740–8:37.860
它有非常大的成本和技术门槛
它有非常大的成本和技术门槛
8:37.860–8:40.180
说完了以上五种融合模式
说完了以上五种融合模式
8:40.180–8:41.620
我们再来看一下
我们再来看一下
8:41.620–8:43.380
使用融合的办法
使用融合的办法
8:43.380–8:46.660
模型具体能提升多少智力
模型具体能提升多少智力
8:46.660–8:47.620
2024年
2024年
8:47.620–8:51.460
Tagazer AI提出MixedJury of Agent
Tagazer AI提出MixedJury of Agent
8:51.460–8:53.380
是这个领域的里程碑
是这个领域的里程碑
8:53.380–8:56.020
它的做法是分层融合
它的做法是分层融合
8:56.020–8:58.420
第一层几个模型各写草稿
第一层几个模型各写草稿
8:58.420–8:59.060
第二层
第二层
8:59.060–9:01.220
另一个模型读完所有草稿
另一个模型读完所有草稿
9:01.220–9:03.540
再出综合判断结果
再出综合判断结果
9:03.540–9:08.340
在衡量回答质量的PakaEvo 2.0榜单上
在衡量回答质量的PakaEvo 2.0榜单上
9:08.340–9:13.540
它的原始结果是超出当时旗舰模型7.6个百分点
它的原始结果是超出当时旗舰模型7.6个百分点
9:13.540–9:14.660
但是要注意
但是要注意
9:14.660–9:17.700
这六个模型全部为开源模型
这六个模型全部为开源模型
9:17.700–9:20.100
也就是说你的电脑足够多
也就是说你的电脑足够多
9:20.100–9:22.500
自己就能配出一个顶尖模型
自己就能配出一个顶尖模型
9:22.500–9:24.660
算力成本却极低
算力成本却极低
9:24.660–9:25.860
对于企业来说
对于企业来说
9:25.860–9:28.900
这种部署方式有很大价值
这种部署方式有很大价值
9:28.900–9:30.420
在数学推理方面
在数学推理方面
9:30.420–9:34.900
多模型投票通常能带来3-8分的提升
多模型投票通常能带来3-8分的提升
9:34.900–9:36.500
而代码生成
而代码生成
9:36.500–9:40.740
多模型生成加测试用力筛选加裁判选优
多模型生成加测试用力筛选加裁判选优
9:40.740–9:42.820
可能提升10-20分
可能提升10-20分
9:42.820–9:45.540
这是融合收益最夸张的领域
这是融合收益最夸张的领域
9:45.540–9:48.500
因为代码能直接跑测试验证
因为代码能直接跑测试验证
9:48.500–9:50.980
而开放式写作对话
而开放式写作对话
9:50.980–9:56.340
用裁判法和MOA能带来3-15分的提升
用裁判法和MOA能带来3-15分的提升
9:56.340–9:59.140
而路由法不为提升上限
而路由法不为提升上限
9:59.140–10:02.740
而是节省约41%的成本
而是节省约41%的成本
10:02.740–10:06.500
但保住了最强模型95%的性能
但保住了最强模型95%的性能
10:06.500–10:09.700
在模型能力上限见顶的当下
在模型能力上限见顶的当下
10:09.700–10:12.660
每提升一分都非常难
每提升一分都非常难
10:12.660–10:15.860
这种融合法提升可以说是巨大的
这种融合法提升可以说是巨大的
10:15.860–10:17.300
但现实的问题是
但现实的问题是
10:17.300–10:20.020
OpenAI、Anthrobic这些公司
OpenAI、Anthrobic这些公司
10:20.020–10:22.180
无法提供这种服务
无法提供这种服务
10:22.180–10:26.660
OpenAI不可能在Codex中添加OPS模型
OpenAI不可能在Codex中添加OPS模型
10:26.660–10:30.180
只能靠第三方做客户端和路由判断
只能靠第三方做客户端和路由判断
10:30.180–10:33.220
我们再来看融合模型它的成本
我们再来看融合模型它的成本
10:33.220–10:35.140
先记住一句话
先记住一句话
10:35.140–10:36.660
除了路由法
除了路由法
10:36.660–10:40.900
所有融合法都比单独调用一个模型更贵
所有融合法都比单独调用一个模型更贵
10:40.900–10:44.180
因为融合的本质就是多调用几次
因为融合的本质就是多调用几次
10:44.180–10:45.860
调用的次数上去了
调用的次数上去了
10:45.860–10:48.020
Token自然就上去了
Token自然就上去了
10:48.020–10:50.340
我们给几种融合法排个序
我们给几种融合法排个序
10:50.340–10:53.940
可以看到MOA在这里是最贵的
可以看到MOA在这里是最贵的
10:53.940–10:56.340
如果跟单独调用模型比
如果跟单独调用模型比
10:56.340–11:00.020
那投票、裁判、MOA全部都更贵
那投票、裁判、MOA全部都更贵
11:00.020–11:03.540
路由法是唯一一个能省Token的
路由法是唯一一个能省Token的
11:03.540–11:07.380
如果只在会合并答案的融合法内对比
如果只在会合并答案的融合法内对比
11:07.380–11:09.780
投票法因为只算N次
投票法因为只算N次
11:09.780–11:13.060
不加裁判是这里几个最便宜的
不加裁判是这里几个最便宜的
11:13.060–11:16.340
但它依然是单模型成本的N倍
但它依然是单模型成本的N倍
11:16.340–11:20.660
那在这里我们如何使用模型融合呢
那在这里我们如何使用模型融合呢
11:20.660–11:24.740
个人最快的部署方式就是写一个Skill
个人最快的部署方式就是写一个Skill
11:24.740–11:30.020
将Dbseek或者其他国产模型写入到这个Skill当中
将Dbseek或者其他国产模型写入到这个Skill当中
11:30.020–11:32.580
使用的时候直接调用就可以
使用的时候直接调用就可以
11:32.580–11:36.420
优势是无论你使用Cloud或者Codex
优势是无论你使用Cloud或者Codex
11:36.420–11:37.860
添加一个Skill
添加一个Skill
11:37.860–11:42.020
设置一下K的环境变量就可以在Cloud中跑多么
设置一下K的环境变量就可以在Cloud中跑多么
11:42.020–11:43.300
行融合了
行融合了
11:43.300–11:45.300
让Cloud充当裁判
让Cloud充当裁判
11:45.300–11:48.580
当然这也会增加一些Token的用量
当然这也会增加一些Token的用量
11:48.580–11:52.660
我目前就是自己写了一个简单的Skill
我目前就是自己写了一个简单的Skill
11:52.660–11:55.140
然后接通中转站的方式
然后接通中转站的方式
11:55.140–11:57.860
目前正在调整这个Skill
目前正在调整这个Skill
11:57.860–12:01.700
关键就在于这个充当裁判说明书的Skill
关键就在于这个充当裁判说明书的Skill
12:01.700–12:03.300
写得好并不容易
写得好并不容易
12:03.300–12:05.940
那如果你是玩本地模型的
那如果你是玩本地模型的
12:05.940–12:09.500
也可以用MergerKit这个主流开源工具
也可以用MergerKit这个主流开源工具
12:09.500–12:14.420
那它支持逐层拼接合并LauraTeach
那它支持逐层拼接合并LauraTeach
12:14.420–12:16.980
还能提供网页版零代码
还能提供网页版零代码
12:16.980–12:19.100
无需GPU在线合并
无需GPU在线合并
12:19.100–12:24.320
如果是想同时调用GPT或者Opus这些模型的话
如果是想同时调用GPT或者Opus这些模型的话
12:24.320–12:25.940
可以用OpenRouter
可以用OpenRouter
12:25.940–12:28.740
这个网站接入了数百个模型
这个网站接入了数百个模型
12:28.740–12:32.580
其中的Fusion模式会把同一个Prompt
其中的Fusion模式会把同一个Prompt
12:32.580–12:35.020
并行发送给一组模型
并行发送给一组模型
12:35.020–12:39.460
再由裁判模型分析共识矛盾综合输出
再由裁判模型分析共识矛盾综合输出
12:39.460–12:42.260
缺点就是价格会比较贵
缺点就是价格会比较贵
12:42.260–12:43.740
那我用下来呢
那我用下来呢
12:43.740–12:47.240
一个2000字的输出大概就需要两美金
一个2000字的输出大概就需要两美金
12:47.240–12:49.220
这个坑我已经踩过了
这个坑我已经踩过了
12:49.220–12:51.660
从这几个方面来看
从这几个方面来看
12:51.660–12:54.140
现在并没有特别好的融合软件
现在并没有特别好的融合软件
12:54.140–12:56.540
关键点在于算法
关键点在于算法
12:56.540–12:59.700
目前融合这条路呢也在探索中
目前融合这条路呢也在探索中
12:59.700–13:03.140
相信未来会有更好的第三方融合工具
相信未来会有更好的第三方融合工具
13:03.140–13:05.580
那最后我们来总结一下
那最后我们来总结一下
13:05.580–13:08.980
从2024年到2026年这两年
从2024年到2026年这两年
13:08.980–13:12.940
多模型融合从论文阶段逐渐走进大厂
多模型融合从论文阶段逐渐走进大厂
13:12.940–13:16.140
各种模型厂商正在把融合逻辑
各种模型厂商正在把融合逻辑
13:16.140–13:18.140
内化进单个模型
内化进单个模型
13:18.140–13:21.580
今天的旗舰模型大多是混合专家架构
今天的旗舰模型大多是混合专家架构
13:21.580–13:26.020
本质就是把多专家融合进一个模型内部
本质就是把多专家融合进一个模型内部
13:26.020–13:29.060
但这并不代表外部融合会消失
但这并不代表外部融合会消失
13:29.060–13:30.260
恰恰相反
恰恰相反
13:30.260–13:35.660
当你同时调用多家厂商能力边界完全不同的模型时
当你同时调用多家厂商能力边界完全不同的模型时
13:35.660–13:40.220
外部融合能突破任何一家单一模型的上限
外部融合能突破任何一家单一模型的上限
13:40.220–13:43.740
这个是单个MOE模型做不到的
这个是单个MOE模型做不到的
13:43.740–13:46.420
比如每家都有自己的训练员
比如每家都有自己的训练员
13:46.420–13:49.380
解锁信息也有特定的网站
解锁信息也有特定的网站
13:49.380–13:52.460
比如Gminite就可以搜索YouTube
比如Gminite就可以搜索YouTube
13:52.460–13:55.300
而豆包可以搜索抖音
而豆包可以搜索抖音
13:55.300–13:55.860
好了
好了
13:55.860–13:58.500
这就是本期视频的全部内容
这就是本期视频的全部内容
13:58.500–14:01.860
欢迎大家点赞留言订阅转发
欢迎大家点赞留言订阅转发
14:01.860–14:02.620
我是刘延
我是刘延
14:02.620–14:04.500
我们下个视频见
我们下个视频见
尚未產生學習筆記
請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習