實際影片長度:14:05.000。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:03.540
Fibon 5仅仅上线了三天就被下架了
0:03.540–0:06.740
原因是美国的出口管制指令
0:06.740–0:11.240
但仅仅几天就找到了替代Fibon 5的方法
0:11.240–0:14.640
Open Router最新公布了一套测试
0:14.640–0:16.860
在测试中使用融合技术
0:16.860–0:21.740
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
0:21.740–0:24.700
这套组合进行Dirico测试
0:24.700–0:28.040
得分为64.7%
0:28.040–0:32.140
而Fibon 5的单模型得分是65.3%
0:32.140–0:35.000
仅仅相差0.6%
0:35.000–0:40.840
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
0:40.840–0:46.800
这三个模型融合得分更是高达68.3%
0:46.800–0:50.600
这下美国封锁Fibon 5显然意义也不大了
0:50.600–0:55.180
那今天我们不探讨得分的具体细节
0:55.180–0:57.520
详细聊聊这个融合技术
0:57.520–1:01.120
它是怎么打破自己的智力上限的
1:01.120–1:04.480
我们从几个点把这个知识吃透
1:04.480–1:07.200
那第一什么是融合模型
1:07.200–1:12.720
第二融合模型的五种干活方式以及优缺点
1:12.720–1:16.140
第三就是融合技术的真实效果怎么样
1:16.140–1:19.600
第四融合技术的成本是多少
1:19.600–1:26.220
那第五如何快速在Cloud和Codex中使用简单的融合
1:26.220–1:30.520
那第五就是在使用中哪些坑不要踩
1:30.520–1:33.980
我们先来看第一融合的原理
1:33.980–1:37.580
你大概有过这种经验
1:37.580–1:39.580
同一个问题
1:39.580–1:43.180
第五它的回答详细但是有点啰嗦
1:43.180–1:46.120
但Cloud Ops简洁严谨
1:46.120–1:47.980
但是回答比较高了
1:47.980–1:49.660
问Deepseek回答呢
1:49.660–1:50.760
它有哲学性
1:50.760–1:52.860
但写代码稍微差点意思
1:52.860–1:55.720
问Gmini它适合插资料
1:55.720–1:58.060
但有时候它也会降置
1:58.060–2:02.020
那每个模型都有长版也有短版
2:02.020–2:05.260
那于是一个很自然的想法就冒出来
2:05.260–2:08.380
能不能把这些模型的答案融合起来
2:08.380–2:09.340
取长补短呢
2:09.340–2:12.280
这就是多模型融合
2:12.280–2:15.060
它的技术就是为了解决这个问题
2:15.060–2:17.920
那融合技术有多厉害呢
2:17.920–2:19.260
先讲个故事
2:19.260–2:24.020
2024年一家叫Sakana的日本AI小公司
2:24.020–2:25.600
没花什么大价钱
2:25.600–2:27.480
训练了一个新模型
2:27.480–2:30.880
只是把两个县城的开源免费模型
2:30.880–2:32.500
一个擅长日语
2:32.500–2:33.820
一个擅长数学
2:33.820–2:36.520
用巧妙的办法拼在了一起
2:36.520–2:39.260
结果这个拼出来的新模型
2:39.260–2:41.820
既会日语又会做数学题
2:41.820–2:44.820
还在日语数学的权威测试里
2:44.820–2:46.220
拿下了一个第一
2:46.220–2:48.880
打败了比它大好几倍的模型
2:48.880–2:52.260
而它从没有专门为这个任务训练过
2:52.260–2:54.420
用一句话解释就是
2:54.420–2:56.900
让多个AI模型一起干活
2:56.900–3:00.300
常常能干出1加1大于2的效果
3:00.300–3:03.420
把一道难题同时丢给三个模型
3:03.420–3:05.740
谁的答案好呢就用谁
3:05.740–3:07.500
最后整合出的版本
3:07.500–3:10.420
往往比单一模型效果要更好
3:10.420–3:14.300
不同模型的训练数据架构优化目标都不同
3:14.300–3:16.020
犯的错呢也不同
3:16.020–3:17.700
正是这种差异
3:17.700–3:19.420
专业上叫多样性
3:19.420–3:22.500
让互相纠错成为可能
3:22.500–3:24.660
假设有一道题
3:24.660–3:28.700
每个模型独立答对的概率是70%
3:28.700–3:30.820
且错误互相独立
3:30.820–3:33.980
三个模型多数投票后
3:33.980–3:37.340
答对的概率就变成了78.4%
3:37.340–3:39.620
凭空多出8个百分点
3:39.620–3:40.740
什么都没改
3:40.740–3:42.740
只是多问了几步
3:42.740–3:44.740
然后再进行投票而已
3:44.740–3:47.300
但这里有个问题需要注意
3:47.300–3:49.380
模型必须是不同的
3:49.380–3:51.540
如果你拿GPT5.5
3:51.540–3:54.860
加GPT5.5 mini加5 Turbo
3:54.860–3:55.540
来投票
3:55.540–3:57.380
他们失出同门
3:57.380–3:59.020
错误高度雷同
3:59.020–4:01.380
投票几乎没有增益
4:01.380–4:03.140
甚至可能三个一起错
4:03.140–4:07.500
选差异大的模型比选更多模型重要的多
4:07.500–4:10.780
下面我们来看五种融合方式
4:10.780–4:12.620
还有它的优缺点
4:12.620–4:14.740
那第一个就是投票法
4:14.740–4:16.860
多个模型独立作答
4:16.860–4:19.620
出现最多次的答案获胜
4:19.620–4:21.000
简单粗暴
4:21.000–4:24.740
它的优势就是在选择题数学题代码
4:24.740–4:27.800
等一系列有标准答案的任务
4:27.800–4:31.340
那缺点就是在编写文案审美等方面
4:31.340–4:32.820
你没办法用投票
4:32.820–4:35.700
决定哪篇文章写得更好
4:35.700–4:37.780
那第二个就是裁判法
4:37.780–4:41.780
裁判法就是让多个模型各自作答
4:41.780–4:44.620
再用一个更强的模型当裁判
4:44.620–4:46.140
选最优的那一个
4:46.140–4:50.740
优势就是写作文案分析开放式问答
4:50.740–4:54.660
那缺点就是对裁判模型要求比较高
4:54.660–4:57.660
裁判要判断出好坏
4:57.660–5:01.220
这是为什么OpenRouter在融合模型中
5:01.220–5:04.100
把OPUS4.8当裁判的原因
5:04.100–5:06.980
因为这个裁判也会有偏见
5:06.980–5:09.060
比如说谁先回答
5:09.060–5:10.500
谁的回答字数多
5:10.500–5:11.940
画风更客气
5:11.940–5:13.940
他就更愿意采纳谁
5:13.940–5:18.980
这是2024年以来多项研究反复确认的系统性问题
5:18.980–5:21.860
对策是调换候选顺序
5:21.860–5:24.180
各凭一次取平均值
5:24.180–5:28.500
然而代价就是它的Token消耗会高出数倍
5:28.500–5:30.820
那第三种融合方式
5:30.820–5:33.540
就叫MOA分层融合
5:33.540–5:37.140
这个分层融合稍微复杂一些
5:37.140–5:40.820
普通集成可以把它比作为几个厨师
5:40.820–5:41.940
各做一道菜
5:41.940–5:44.980
然后最后端上桌让您选
5:44.980–5:49.860
而MOA是第一层几个厨师各做一道菜
5:49.860–5:51.540
再传给第二层
5:51.540–5:55.540
由第二层的另几个厨师尝过第一层
5:55.540–5:57.460
所有人做的菜之后
5:57.460–5:59.540
再各自改进一把
5:59.540–6:01.460
这样迭代几层之后
6:01.460–6:02.900
最后一个主厨
6:02.900–6:06.740
再把大家的成果综合成一道终极菜
6:07.460–6:09.300
具体到模型
6:09.300–6:11.380
它有两个关键角色
6:11.380–6:13.220
第一个是提议者
6:13.220–6:16.740
是每一层里负责生成答案的多个模型
6:16.740–6:18.980
第二个是聚合者
6:18.980–6:21.780
是负责看完上一层所有答案
6:21.780–6:24.260
再综合出更好版本的模型
6:24.260–6:27.300
这个MOA它的精髓在于
6:27.300–6:28.580
每一层每个模型
6:28.580–6:31.620
都会拿到上一层所有模型的输出
6:31.620–6:32.740
当做参考
6:32.740–6:34.740
然后在此基础上
6:34.740–6:35.860
再写一版
6:35.860–6:37.140
一层一层下来
6:37.140–6:39.860
答案被反复的汇诊补充
6:39.860–6:41.540
纠错越来越好
6:41.540–6:44.180
最后再由一个聚合者拍板
6:44.180–6:47.380
那它适合于追求极致质量
6:47.380–6:48.820
非实时的场景
6:48.820–6:51.540
那它的代价就是调用次数多
6:51.540–6:53.220
质量上限高
6:53.220–6:55.060
但是又贵又慢
6:55.060–6:56.660
那第四个呢
6:56.660–6:58.180
它叫路由法
6:58.180–6:59.380
不融合答案
6:59.380–7:00.820
而是智能分流
7:00.820–7:02.180
简单的问题呢
7:02.180–7:04.260
它就交给便宜的模型
7:04.260–7:06.740
难的问题才调用贵的模型
7:06.740–7:07.700
说白了呢
7:07.700–7:09.620
它就是智能分流
7:09.620–7:12.340
本质上还是单模型在输出
7:12.340–7:15.620
它适合生产环境成本敏感
7:15.620–7:17.140
和大批量处理
7:17.140–7:19.060
那风险就是路由
7:19.060–7:21.140
有的时候也会判断失误
7:21.140–7:24.580
把复杂的问题交给轻量模型去处理
7:24.580–7:26.100
那第五种方式呢
7:26.100–7:28.180
就叫模型合并
7:28.180–7:29.220
打个比方
7:29.220–7:32.180
一个公司招了四个程序员
7:32.180–7:35.380
各自负责前端后端架构审核
7:35.380–7:37.780
现在你找了一个全能程序员
7:37.780–7:40.740
让他学习这四个程序员的手艺
7:40.740–7:43.940
以后你就不用发四份工资了
7:43.940–7:46.100
只雇一个程序员就可以
7:46.100–7:49.540
它的妙处就是融合发生的训练阶段
7:49.540–7:52.660
你平时用的时候只是用一个模型
7:52.660–7:54.260
所以日常使用呢
7:54.260–7:56.260
不会变慢和变贵
7:56.260–7:58.260
实际上现在各家的大模型
7:58.260–8:00.580
已经在做这种模型合并了
8:00.580–8:02.900
比如腾讯的会员模型
8:02.900–8:06.260
它把快思考和慢思考两套能力
8:06.260–8:07.940
融合进一个模型
8:07.940–8:09.540
让模型能力更强
8:09.540–8:11.220
但是最后我们调用时
8:11.220–8:13.300
不需要手动调整
8:13.300–8:16.500
模型会自动切换专家MOE
8:16.500–8:17.700
那这种方式
8:17.700–8:18.980
最大的优点是
8:18.980–8:22.660
合并后推理成本和单个模型完全一样
8:22.660–8:24.340
没有额外开销
8:24.340–8:25.700
适合本地部署
8:25.700–8:28.820
有多个同底座的微调模型
8:28.820–8:32.980
那缺点就是个人只能用现成融合好的模型
8:32.980–8:34.740
想自己融合呢
8:34.740–8:37.860
它有非常大的成本和技术门槛
8:37.860–8:40.180
说完了以上五种融合模式
8:40.180–8:41.620
我们再来看一下
8:41.620–8:43.380
使用融合的办法
8:43.380–8:46.660
模型具体能提升多少智力
8:46.660–8:47.620
2024年
8:47.620–8:51.460
Tagazer AI提出MixedJury of Agent
8:51.460–8:53.380
是这个领域的里程碑
8:53.380–8:56.020
它的做法是分层融合
8:56.020–8:58.420
第一层几个模型各写草稿
8:58.420–8:59.060
第二层
8:59.060–9:01.220
另一个模型读完所有草稿
9:01.220–9:03.540
再出综合判断结果
9:03.540–9:08.340
在衡量回答质量的PakaEvo 2.0榜单上
9:08.340–9:13.540
它的原始结果是超出当时旗舰模型7.6个百分点
9:13.540–9:14.660
但是要注意
9:14.660–9:17.700
这六个模型全部为开源模型
9:17.700–9:20.100
也就是说你的电脑足够多
9:20.100–9:22.500
自己就能配出一个顶尖模型
9:22.500–9:24.660
算力成本却极低
9:24.660–9:25.860
对于企业来说
9:25.860–9:28.900
这种部署方式有很大价值
9:28.900–9:30.420
在数学推理方面
9:30.420–9:34.900
多模型投票通常能带来3-8分的提升
9:34.900–9:36.500
而代码生成
9:36.500–9:40.740
多模型生成加测试用力筛选加裁判选优
9:40.740–9:42.820
可能提升10-20分
9:42.820–9:45.540
这是融合收益最夸张的领域
9:45.540–9:48.500
因为代码能直接跑测试验证
9:48.500–9:50.980
而开放式写作对话
9:50.980–9:56.340
用裁判法和MOA能带来3-15分的提升
9:56.340–9:59.140
而路由法不为提升上限
9:59.140–10:02.740
而是节省约41%的成本
10:02.740–10:06.500
但保住了最强模型95%的性能
10:06.500–10:09.700
在模型能力上限见顶的当下
10:09.700–10:12.660
每提升一分都非常难
10:12.660–10:15.860
这种融合法提升可以说是巨大的
10:15.860–10:17.300
但现实的问题是
10:17.300–10:20.020
OpenAI、Anthrobic这些公司
10:20.020–10:22.180
无法提供这种服务
10:22.180–10:26.660
OpenAI不可能在Codex中添加OPS模型
10:26.660–10:30.180
只能靠第三方做客户端和路由判断
10:30.180–10:33.220
我们再来看融合模型它的成本
10:33.220–10:35.140
先记住一句话
10:35.140–10:36.660
除了路由法
10:36.660–10:40.900
所有融合法都比单独调用一个模型更贵
10:40.900–10:44.180
因为融合的本质就是多调用几次
10:44.180–10:45.860
调用的次数上去了
10:45.860–10:48.020
Token自然就上去了
10:48.020–10:50.340
我们给几种融合法排个序
10:50.340–10:53.940
可以看到MOA在这里是最贵的
10:53.940–10:56.340
如果跟单独调用模型比
10:56.340–11:00.020
那投票、裁判、MOA全部都更贵
11:00.020–11:03.540
路由法是唯一一个能省Token的
11:03.540–11:07.380
如果只在会合并答案的融合法内对比
11:07.380–11:09.780
投票法因为只算N次
11:09.780–11:13.060
不加裁判是这里几个最便宜的
11:13.060–11:16.340
但它依然是单模型成本的N倍
11:16.340–11:20.660
那在这里我们如何使用模型融合呢
11:20.660–11:24.740
个人最快的部署方式就是写一个Skill
11:24.740–11:30.020
将Dbseek或者其他国产模型写入到这个Skill当中
11:30.020–11:32.580
使用的时候直接调用就可以
11:32.580–11:36.420
优势是无论你使用Cloud或者Codex
11:36.420–11:37.860
添加一个Skill
11:37.860–11:42.020
设置一下K的环境变量就可以在Cloud中跑多么
11:42.020–11:43.300
行融合了
11:43.300–11:45.300
让Cloud充当裁判
11:45.300–11:48.580
当然这也会增加一些Token的用量
11:48.580–11:52.660
我目前就是自己写了一个简单的Skill
11:52.660–11:55.140
然后接通中转站的方式
11:55.140–11:57.860
目前正在调整这个Skill
11:57.860–12:01.700
关键就在于这个充当裁判说明书的Skill
12:01.700–12:03.300
写得好并不容易
12:03.300–12:05.940
那如果你是玩本地模型的
12:05.940–12:09.500
也可以用MergerKit这个主流开源工具
12:09.500–12:14.420
那它支持逐层拼接合并LauraTeach
12:14.420–12:16.980
还能提供网页版零代码
12:16.980–12:19.100
无需GPU在线合并
12:19.100–12:24.320
如果是想同时调用GPT或者Opus这些模型的话
12:24.320–12:25.940
可以用OpenRouter
12:25.940–12:28.740
这个网站接入了数百个模型
12:28.740–12:32.580
其中的Fusion模式会把同一个Prompt
12:32.580–12:35.020
并行发送给一组模型
12:35.020–12:39.460
再由裁判模型分析共识矛盾综合输出
12:39.460–12:42.260
缺点就是价格会比较贵
12:42.260–12:43.740
那我用下来呢
12:43.740–12:47.240
一个2000字的输出大概就需要两美金
12:47.240–12:49.220
这个坑我已经踩过了
12:49.220–12:51.660
从这几个方面来看
12:51.660–12:54.140
现在并没有特别好的融合软件
12:54.140–12:56.540
关键点在于算法
12:56.540–12:59.700
目前融合这条路呢也在探索中
12:59.700–13:03.140
相信未来会有更好的第三方融合工具
13:03.140–13:05.580
那最后我们来总结一下
13:05.580–13:08.980
从2024年到2026年这两年
13:08.980–13:12.940
多模型融合从论文阶段逐渐走进大厂
13:12.940–13:16.140
各种模型厂商正在把融合逻辑
13:16.140–13:18.140
内化进单个模型
13:18.140–13:21.580
今天的旗舰模型大多是混合专家架构
13:21.580–13:26.020
本质就是把多专家融合进一个模型内部
13:26.020–13:29.060
但这并不代表外部融合会消失
13:29.060–13:30.260
恰恰相反
13:30.260–13:35.660
当你同时调用多家厂商能力边界完全不同的模型时
13:35.660–13:40.220
外部融合能突破任何一家单一模型的上限
13:40.220–13:43.740
这个是单个MOE模型做不到的
13:43.740–13:46.420
比如每家都有自己的训练员
13:46.420–13:49.380
解锁信息也有特定的网站
13:49.380–13:52.460
比如Gminite就可以搜索YouTube
13:52.460–13:55.300
而豆包可以搜索抖音
13:55.300–13:55.860
好了
13:55.860–13:58.500
这就是本期视频的全部内容
13:58.500–14:01.860
欢迎大家点赞留言订阅转发
14:01.860–14:02.620
我是刘延
14:02.620–14:04.500
我们下个视频见
0:00.000–0:03.540
Fibon 5仅仅上线了三天就被下架了
0:03.540–0:06.740
原因是美国的出口管制指令
0:06.740–0:11.240
但仅仅几天就找到了替代Fibon 5的方法
0:11.240–0:14.640
Open Router最新公布了一套测试
0:14.640–0:16.860
在测试中使用融合技术
0:16.860–0:21.740
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
0:21.740–0:24.700
这套组合进行Dirico测试
0:24.700–0:28.040
得分为64.7%
0:28.040–0:32.140
而Fibon 5的单模型得分是65.3%
0:32.140–0:35.000
仅仅相差0.6%
0:35.000–0:40.840
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
0:40.840–0:46.800
这三个模型融合得分更是高达68.3%
0:46.800–0:50.600
这下美国封锁Fibon 5显然意义也不大了
0:50.600–0:55.180
那今天我们不探讨得分的具体细节
0:55.180–0:57.520
详细聊聊这个融合技术
0:57.520–1:01.120
它是怎么打破自己的智力上限的
1:01.120–1:04.480
我们从几个点把这个知识吃透
1:04.480–1:07.200
那第一什么是融合模型
1:07.200–1:12.720
第二融合模型的五种干活方式以及优缺点
1:12.720–1:16.140
第三就是融合技术的真实效果怎么样
1:16.140–1:19.600
第四融合技术的成本是多少
1:19.600–1:26.220
那第五如何快速在Cloud和Codex中使用简单的融合
1:26.220–1:30.520
那第五就是在使用中哪些坑不要踩
1:30.520–1:33.980
我们先来看第一融合的原理
1:33.980–1:37.580
你大概有过这种经验
1:37.580–1:39.580
同一个问题
1:39.580–1:43.180
第五它的回答详细但是有点啰嗦
1:43.180–1:46.120
但Cloud Ops简洁严谨
1:46.120–1:47.980
但是回答比较高了
1:47.980–1:49.660
问Deepseek回答呢
1:49.660–1:50.760
它有哲学性
1:50.760–1:52.860
但写代码稍微差点意思
1:52.860–1:55.720
问Gmini它适合插资料
1:55.720–1:58.060
但有时候它也会降置
1:58.060–2:02.020
那每个模型都有长版也有短版
2:02.020–2:05.260
那于是一个很自然的想法就冒出来
2:05.260–2:08.380
能不能把这些模型的答案融合起来
2:08.380–2:09.340
取长补短呢
2:09.340–2:12.280
这就是多模型融合
2:12.280–2:15.060
它的技术就是为了解决这个问题
2:15.060–2:17.920
那融合技术有多厉害呢
2:17.920–2:19.260
先讲个故事
2:19.260–2:24.020
2024年一家叫Sakana的日本AI小公司
2:24.020–2:25.600
没花什么大价钱
2:25.600–2:27.480
训练了一个新模型
2:27.480–2:30.880
只是把两个县城的开源免费模型
2:30.880–2:32.500
一个擅长日语
2:32.500–2:33.820
一个擅长数学
2:33.820–2:36.520
用巧妙的办法拼在了一起
2:36.520–2:39.260
结果这个拼出来的新模型
2:39.260–2:41.820
既会日语又会做数学题
2:41.820–2:44.820
还在日语数学的权威测试里
2:44.820–2:46.220
拿下了一个第一
2:46.220–2:48.880
打败了比它大好几倍的模型
2:48.880–2:52.260
而它从没有专门为这个任务训练过
2:52.260–2:54.420
用一句话解释就是
2:54.420–2:56.900
让多个AI模型一起干活
2:56.900–3:00.300
常常能干出1加1大于2的效果
3:00.300–3:03.420
把一道难题同时丢给三个模型
3:03.420–3:05.740
谁的答案好呢就用谁
3:05.740–3:07.500
最后整合出的版本
3:07.500–3:10.420
往往比单一模型效果要更好
3:10.420–3:14.300
不同模型的训练数据架构优化目标都不同
3:14.300–3:16.020
犯的错呢也不同
3:16.020–3:17.700
正是这种差异
3:17.700–3:19.420
专业上叫多样性
3:19.420–3:22.500
让互相纠错成为可能
3:22.500–3:24.660
假设有一道题
3:24.660–3:28.700
每个模型独立答对的概率是70%
3:28.700–3:30.820
且错误互相独立
3:30.820–3:33.980
三个模型多数投票后
3:33.980–3:37.340
答对的概率就变成了78.4%
3:37.340–3:39.620
凭空多出8个百分点
3:39.620–3:40.740
什么都没改
3:40.740–3:42.740
只是多问了几步
3:42.740–3:44.740
然后再进行投票而已
3:44.740–3:47.300
但这里有个问题需要注意
3:47.300–3:49.380
模型必须是不同的
3:49.380–3:51.540
如果你拿GPT5.5
3:51.540–3:54.860
加GPT5.5 mini加5 Turbo
3:54.860–3:55.540
来投票
3:55.540–3:57.380
他们失出同门
3:57.380–3:59.020
错误高度雷同
3:59.020–4:01.380
投票几乎没有增益
4:01.380–4:03.140
甚至可能三个一起错
4:03.140–4:07.500
选差异大的模型比选更多模型重要的多
4:07.500–4:10.780
下面我们来看五种融合方式
4:10.780–4:12.620
还有它的优缺点
4:12.620–4:14.740
那第一个就是投票法
4:14.740–4:16.860
多个模型独立作答
4:16.860–4:19.620
出现最多次的答案获胜
4:19.620–4:21.000
简单粗暴
4:21.000–4:24.740
它的优势就是在选择题数学题代码
4:24.740–4:27.800
等一系列有标准答案的任务
4:27.800–4:31.340
那缺点就是在编写文案审美等方面
4:31.340–4:32.820
你没办法用投票
4:32.820–4:35.700
决定哪篇文章写得更好
4:35.700–4:37.780
那第二个就是裁判法
4:37.780–4:41.780
裁判法就是让多个模型各自作答
4:41.780–4:44.620
再用一个更强的模型当裁判
4:44.620–4:46.140
选最优的那一个
4:46.140–4:50.740
优势就是写作文案分析开放式问答
4:50.740–4:54.660
那缺点就是对裁判模型要求比较高
4:54.660–4:57.660
裁判要判断出好坏
4:57.660–5:01.220
这是为什么OpenRouter在融合模型中
5:01.220–5:04.100
把OPUS4.8当裁判的原因
5:04.100–5:06.980
因为这个裁判也会有偏见
5:06.980–5:09.060
比如说谁先回答
5:09.060–5:10.500
谁的回答字数多
5:10.500–5:11.940
画风更客气
5:11.940–5:13.940
他就更愿意采纳谁
5:13.940–5:18.980
这是2024年以来多项研究反复确认的系统性问题
5:18.980–5:21.860
对策是调换候选顺序
5:21.860–5:24.180
各凭一次取平均值
5:24.180–5:28.500
然而代价就是它的Token消耗会高出数倍
5:28.500–5:30.820
那第三种融合方式
5:30.820–5:33.540
就叫MOA分层融合
5:33.540–5:37.140
这个分层融合稍微复杂一些
5:37.140–5:40.820
普通集成可以把它比作为几个厨师
5:40.820–5:41.940
各做一道菜
5:41.940–5:44.980
然后最后端上桌让您选
5:44.980–5:49.860
而MOA是第一层几个厨师各做一道菜
5:49.860–5:51.540
再传给第二层
5:51.540–5:55.540
由第二层的另几个厨师尝过第一层
5:55.540–5:57.460
所有人做的菜之后
5:57.460–5:59.540
再各自改进一把
5:59.540–6:01.460
这样迭代几层之后
6:01.460–6:02.900
最后一个主厨
6:02.900–6:06.740
再把大家的成果综合成一道终极菜
6:07.460–6:09.300
具体到模型
6:09.300–6:11.380
它有两个关键角色
6:11.380–6:13.220
第一个是提议者
6:13.220–6:16.740
是每一层里负责生成答案的多个模型
6:16.740–6:18.980
第二个是聚合者
6:18.980–6:21.780
是负责看完上一层所有答案
6:21.780–6:24.260
再综合出更好版本的模型
6:24.260–6:27.300
这个MOA它的精髓在于
6:27.300–6:28.580
每一层每个模型
6:28.580–6:31.620
都会拿到上一层所有模型的输出
6:31.620–6:32.740
当做参考
6:32.740–6:34.740
然后在此基础上
6:34.740–6:35.860
再写一版
6:35.860–6:37.140
一层一层下来
6:37.140–6:39.860
答案被反复的汇诊补充
6:39.860–6:41.540
纠错越来越好
6:41.540–6:44.180
最后再由一个聚合者拍板
6:44.180–6:47.380
那它适合于追求极致质量
6:47.380–6:48.820
非实时的场景
6:48.820–6:51.540
那它的代价就是调用次数多
6:51.540–6:53.220
质量上限高
6:53.220–6:55.060
但是又贵又慢
6:55.060–6:56.660
那第四个呢
6:56.660–6:58.180
它叫路由法
6:58.180–6:59.380
不融合答案
6:59.380–7:00.820
而是智能分流
7:00.820–7:02.180
简单的问题呢
7:02.180–7:04.260
它就交给便宜的模型
7:04.260–7:06.740
难的问题才调用贵的模型
7:06.740–7:07.700
说白了呢
7:07.700–7:09.620
它就是智能分流
7:09.620–7:12.340
本质上还是单模型在输出
7:12.340–7:15.620
它适合生产环境成本敏感
7:15.620–7:17.140
和大批量处理
7:17.140–7:19.060
那风险就是路由
7:19.060–7:21.140
有的时候也会判断失误
7:21.140–7:24.580
把复杂的问题交给轻量模型去处理
7:24.580–7:26.100
那第五种方式呢
7:26.100–7:28.180
就叫模型合并
7:28.180–7:29.220
打个比方
7:29.220–7:32.180
一个公司招了四个程序员
7:32.180–7:35.380
各自负责前端后端架构审核
7:35.380–7:37.780
现在你找了一个全能程序员
7:37.780–7:40.740
让他学习这四个程序员的手艺
7:40.740–7:43.940
以后你就不用发四份工资了
7:43.940–7:46.100
只雇一个程序员就可以
7:46.100–7:49.540
它的妙处就是融合发生的训练阶段
7:49.540–7:52.660
你平时用的时候只是用一个模型
7:52.660–7:54.260
所以日常使用呢
7:54.260–7:56.260
不会变慢和变贵
7:56.260–7:58.260
实际上现在各家的大模型
7:58.260–8:00.580
已经在做这种模型合并了
8:00.580–8:02.900
比如腾讯的会员模型
8:02.900–8:06.260
它把快思考和慢思考两套能力
8:06.260–8:07.940
融合进一个模型
8:07.940–8:09.540
让模型能力更强
8:09.540–8:11.220
但是最后我们调用时
8:11.220–8:13.300
不需要手动调整
8:13.300–8:16.500
模型会自动切换专家MOE
8:16.500–8:17.700
那这种方式
8:17.700–8:18.980
最大的优点是
8:18.980–8:22.660
合并后推理成本和单个模型完全一样
8:22.660–8:24.340
没有额外开销
8:24.340–8:25.700
适合本地部署
8:25.700–8:28.820
有多个同底座的微调模型
8:28.820–8:32.980
那缺点就是个人只能用现成融合好的模型
8:32.980–8:34.740
想自己融合呢
8:34.740–8:37.860
它有非常大的成本和技术门槛
8:37.860–8:40.180
说完了以上五种融合模式
8:40.180–8:41.620
我们再来看一下
8:41.620–8:43.380
使用融合的办法
8:43.380–8:46.660
模型具体能提升多少智力
8:46.660–8:47.620
2024年
8:47.620–8:51.460
Tagazer AI提出MixedJury of Agent
8:51.460–8:53.380
是这个领域的里程碑
8:53.380–8:56.020
它的做法是分层融合
8:56.020–8:58.420
第一层几个模型各写草稿
8:58.420–8:59.060
第二层
8:59.060–9:01.220
另一个模型读完所有草稿
9:01.220–9:03.540
再出综合判断结果
9:03.540–9:08.340
在衡量回答质量的PakaEvo 2.0榜单上
9:08.340–9:13.540
它的原始结果是超出当时旗舰模型7.6个百分点
9:13.540–9:14.660
但是要注意
9:14.660–9:17.700
这六个模型全部为开源模型
9:17.700–9:20.100
也就是说你的电脑足够多
9:20.100–9:22.500
自己就能配出一个顶尖模型
9:22.500–9:24.660
算力成本却极低
9:24.660–9:25.860
对于企业来说
9:25.860–9:28.900
这种部署方式有很大价值
9:28.900–9:30.420
在数学推理方面
9:30.420–9:34.900
多模型投票通常能带来3-8分的提升
9:34.900–9:36.500
而代码生成
9:36.500–9:40.740
多模型生成加测试用力筛选加裁判选优
9:40.740–9:42.820
可能提升10-20分
9:42.820–9:45.540
这是融合收益最夸张的领域
9:45.540–9:48.500
因为代码能直接跑测试验证
9:48.500–9:50.980
而开放式写作对话
9:50.980–9:56.340
用裁判法和MOA能带来3-15分的提升
9:56.340–9:59.140
而路由法不为提升上限
9:59.140–10:02.740
而是节省约41%的成本
10:02.740–10:06.500
但保住了最强模型95%的性能
10:06.500–10:09.700
在模型能力上限见顶的当下
10:09.700–10:12.660
每提升一分都非常难
10:12.660–10:15.860
这种融合法提升可以说是巨大的
10:15.860–10:17.300
但现实的问题是
10:17.300–10:20.020
OpenAI、Anthrobic这些公司
10:20.020–10:22.180
无法提供这种服务
10:22.180–10:26.660
OpenAI不可能在Codex中添加OPS模型
10:26.660–10:30.180
只能靠第三方做客户端和路由判断
10:30.180–10:33.220
我们再来看融合模型它的成本
10:33.220–10:35.140
先记住一句话
10:35.140–10:36.660
除了路由法
10:36.660–10:40.900
所有融合法都比单独调用一个模型更贵
10:40.900–10:44.180
因为融合的本质就是多调用几次
10:44.180–10:45.860
调用的次数上去了
10:45.860–10:48.020
Token自然就上去了
10:48.020–10:50.340
我们给几种融合法排个序
10:50.340–10:53.940
可以看到MOA在这里是最贵的
10:53.940–10:56.340
如果跟单独调用模型比
10:56.340–11:00.020
那投票、裁判、MOA全部都更贵
11:00.020–11:03.540
路由法是唯一一个能省Token的
11:03.540–11:07.380
如果只在会合并答案的融合法内对比
11:07.380–11:09.780
投票法因为只算N次
11:09.780–11:13.060
不加裁判是这里几个最便宜的
11:13.060–11:16.340
但它依然是单模型成本的N倍
11:16.340–11:20.660
那在这里我们如何使用模型融合呢
11:20.660–11:24.740
个人最快的部署方式就是写一个Skill
11:24.740–11:30.020
将Dbseek或者其他国产模型写入到这个Skill当中
11:30.020–11:32.580
使用的时候直接调用就可以
11:32.580–11:36.420
优势是无论你使用Cloud或者Codex
11:36.420–11:37.860
添加一个Skill
11:37.860–11:42.020
设置一下K的环境变量就可以在Cloud中跑多么
11:42.020–11:43.300
行融合了
11:43.300–11:45.300
让Cloud充当裁判
11:45.300–11:48.580
当然这也会增加一些Token的用量
11:48.580–11:52.660
我目前就是自己写了一个简单的Skill
11:52.660–11:55.140
然后接通中转站的方式
11:55.140–11:57.860
目前正在调整这个Skill
11:57.860–12:01.700
关键就在于这个充当裁判说明书的Skill
12:01.700–12:03.300
写得好并不容易
12:03.300–12:05.940
那如果你是玩本地模型的
12:05.940–12:09.500
也可以用MergerKit这个主流开源工具
12:09.500–12:14.420
那它支持逐层拼接合并LauraTeach
12:14.420–12:16.980
还能提供网页版零代码
12:16.980–12:19.100
无需GPU在线合并
12:19.100–12:24.320
如果是想同时调用GPT或者Opus这些模型的话
12:24.320–12:25.940
可以用OpenRouter
12:25.940–12:28.740
这个网站接入了数百个模型
12:28.740–12:32.580
其中的Fusion模式会把同一个Prompt
12:32.580–12:35.020
并行发送给一组模型
12:35.020–12:39.460
再由裁判模型分析共识矛盾综合输出
12:39.460–12:42.260
缺点就是价格会比较贵
12:42.260–12:43.740
那我用下来呢
12:43.740–12:47.240
一个2000字的输出大概就需要两美金
12:47.240–12:49.220
这个坑我已经踩过了
12:49.220–12:51.660
从这几个方面来看
12:51.660–12:54.140
现在并没有特别好的融合软件
12:54.140–12:56.540
关键点在于算法
12:56.540–12:59.700
目前融合这条路呢也在探索中
12:59.700–13:03.140
相信未来会有更好的第三方融合工具
13:03.140–13:05.580
那最后我们来总结一下
13:05.580–13:08.980
从2024年到2026年这两年
13:08.980–13:12.940
多模型融合从论文阶段逐渐走进大厂
13:12.940–13:16.140
各种模型厂商正在把融合逻辑
13:16.140–13:18.140
内化进单个模型
13:18.140–13:21.580
今天的旗舰模型大多是混合专家架构
13:21.580–13:26.020
本质就是把多专家融合进一个模型内部
13:26.020–13:29.060
但这并不代表外部融合会消失
13:29.060–13:30.260
恰恰相反
13:30.260–13:35.660
当你同时调用多家厂商能力边界完全不同的模型时
13:35.660–13:40.220
外部融合能突破任何一家单一模型的上限
13:40.220–13:43.740
这个是单个MOE模型做不到的
13:43.740–13:46.420
比如每家都有自己的训练员
13:46.420–13:49.380
解锁信息也有特定的网站
13:49.380–13:52.460
比如Gminite就可以搜索YouTube
13:52.460–13:55.300
而豆包可以搜索抖音
13:55.300–13:55.860
好了
13:55.860–13:58.500
这就是本期视频的全部内容
13:58.500–14:01.860
欢迎大家点赞留言订阅转发
14:01.860–14:02.620
我是刘延
14:02.620–14:04.500
我们下个视频见
0:00.000–0:03.540
Fibon 5仅仅上线了三天就被下架了
Fibon 5仅仅上线了三天就被下架了
0:03.540–0:06.740
原因是美国的出口管制指令
原因是美国的出口管制指令
0:06.740–0:11.240
但仅仅几天就找到了替代Fibon 5的方法
但仅仅几天就找到了替代Fibon 5的方法
0:11.240–0:14.640
Open Router最新公布了一套测试
Open Router最新公布了一套测试
0:14.640–0:16.860
在测试中使用融合技术
在测试中使用融合技术
0:16.860–0:21.740
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro
0:21.740–0:24.700
这套组合进行Dirico测试
这套组合进行Dirico测试
0:24.700–0:28.040
得分为64.7%
得分为64.7%
0:28.040–0:32.140
而Fibon 5的单模型得分是65.3%
而Fibon 5的单模型得分是65.3%
0:32.140–0:35.000
仅仅相差0.6%
仅仅相差0.6%
0:35.000–0:40.840
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro
0:40.840–0:46.800
这三个模型融合得分更是高达68.3%
这三个模型融合得分更是高达68.3%
0:46.800–0:50.600
这下美国封锁Fibon 5显然意义也不大了
这下美国封锁Fibon 5显然意义也不大了
0:50.600–0:55.180
那今天我们不探讨得分的具体细节
那今天我们不探讨得分的具体细节
0:55.180–0:57.520
详细聊聊这个融合技术
详细聊聊这个融合技术
0:57.520–1:01.120
它是怎么打破自己的智力上限的
它是怎么打破自己的智力上限的
1:01.120–1:04.480
我们从几个点把这个知识吃透
我们从几个点把这个知识吃透
1:04.480–1:07.200
那第一什么是融合模型
那第一什么是融合模型
1:07.200–1:12.720
第二融合模型的五种干活方式以及优缺点
第二融合模型的五种干活方式以及优缺点
1:12.720–1:16.140
第三就是融合技术的真实效果怎么样
第三就是融合技术的真实效果怎么样
1:16.140–1:19.600
第四融合技术的成本是多少
第四融合技术的成本是多少
1:19.600–1:26.220
那第五如何快速在Cloud和Codex中使用简单的融合
那第五如何快速在Cloud和Codex中使用简单的融合
1:26.220–1:30.520
那第五就是在使用中哪些坑不要踩
那第五就是在使用中哪些坑不要踩
1:30.520–1:33.980
我们先来看第一融合的原理
我们先来看第一融合的原理
1:33.980–1:37.580
你大概有过这种经验
你大概有过这种经验
1:37.580–1:39.580
同一个问题
同一个问题
1:39.580–1:43.180
第五它的回答详细但是有点啰嗦
第五它的回答详细但是有点啰嗦
1:43.180–1:46.120
但Cloud Ops简洁严谨
但Cloud Ops简洁严谨
1:46.120–1:47.980
但是回答比较高了
但是回答比较高了
1:47.980–1:49.660
问Deepseek回答呢
问Deepseek回答呢
1:49.660–1:50.760
它有哲学性
它有哲学性
1:50.760–1:52.860
但写代码稍微差点意思
但写代码稍微差点意思
1:52.860–1:55.720
问Gmini它适合插资料
问Gmini它适合插资料
1:55.720–1:58.060
但有时候它也会降置
但有时候它也会降置
1:58.060–2:02.020
那每个模型都有长版也有短版
那每个模型都有长版也有短版
2:02.020–2:05.260
那于是一个很自然的想法就冒出来
那于是一个很自然的想法就冒出来
2:05.260–2:08.380
能不能把这些模型的答案融合起来
能不能把这些模型的答案融合起来
2:08.380–2:09.340
取长补短呢
取长补短呢
2:09.340–2:12.280
这就是多模型融合
这就是多模型融合
2:12.280–2:15.060
它的技术就是为了解决这个问题
它的技术就是为了解决这个问题
2:15.060–2:17.920
那融合技术有多厉害呢
那融合技术有多厉害呢
2:17.920–2:19.260
先讲个故事
先讲个故事
2:19.260–2:24.020
2024年一家叫Sakana的日本AI小公司
2024年一家叫Sakana的日本AI小公司
2:24.020–2:25.600
没花什么大价钱
没花什么大价钱
2:25.600–2:27.480
训练了一个新模型
训练了一个新模型
2:27.480–2:30.880
只是把两个县城的开源免费模型
只是把两个县城的开源免费模型
2:30.880–2:32.500
一个擅长日语
一个擅长日语
2:32.500–2:33.820
一个擅长数学
一个擅长数学
2:33.820–2:36.520
用巧妙的办法拼在了一起
用巧妙的办法拼在了一起
2:36.520–2:39.260
结果这个拼出来的新模型
结果这个拼出来的新模型
2:39.260–2:41.820
既会日语又会做数学题
既会日语又会做数学题
2:41.820–2:44.820
还在日语数学的权威测试里
还在日语数学的权威测试里
2:44.820–2:46.220
拿下了一个第一
拿下了一个第一
2:46.220–2:48.880
打败了比它大好几倍的模型
打败了比它大好几倍的模型
2:48.880–2:52.260
而它从没有专门为这个任务训练过
而它从没有专门为这个任务训练过
2:52.260–2:54.420
用一句话解释就是
用一句话解释就是
2:54.420–2:56.900
让多个AI模型一起干活
让多个AI模型一起干活
2:56.900–3:00.300
常常能干出1加1大于2的效果
常常能干出1加1大于2的效果
3:00.300–3:03.420
把一道难题同时丢给三个模型
把一道难题同时丢给三个模型
3:03.420–3:05.740
谁的答案好呢就用谁
谁的答案好呢就用谁
3:05.740–3:07.500
最后整合出的版本
最后整合出的版本
3:07.500–3:10.420
往往比单一模型效果要更好
往往比单一模型效果要更好
3:10.420–3:14.300
不同模型的训练数据架构优化目标都不同
不同模型的训练数据架构优化目标都不同
3:14.300–3:16.020
犯的错呢也不同
犯的错呢也不同
3:16.020–3:17.700
正是这种差异
正是这种差异
3:17.700–3:19.420
专业上叫多样性
专业上叫多样性
3:19.420–3:22.500
让互相纠错成为可能
让互相纠错成为可能
3:22.500–3:24.660
假设有一道题
假设有一道题
3:24.660–3:28.700
每个模型独立答对的概率是70%
每个模型独立答对的概率是70%
3:28.700–3:30.820
且错误互相独立
且错误互相独立
3:30.820–3:33.980
三个模型多数投票后
三个模型多数投票后
3:33.980–3:37.340
答对的概率就变成了78.4%
答对的概率就变成了78.4%
3:37.340–3:39.620
凭空多出8个百分点
凭空多出8个百分点
3:39.620–3:40.740
什么都没改
什么都没改
3:40.740–3:42.740
只是多问了几步
只是多问了几步
3:42.740–3:44.740
然后再进行投票而已
然后再进行投票而已
3:44.740–3:47.300
但这里有个问题需要注意
但这里有个问题需要注意
3:47.300–3:49.380
模型必须是不同的
模型必须是不同的
3:49.380–3:51.540
如果你拿GPT5.5
如果你拿GPT5.5
3:51.540–3:54.860
加GPT5.5 mini加5 Turbo
加GPT5.5 mini加5 Turbo
3:54.860–3:55.540
来投票
来投票
3:55.540–3:57.380
他们失出同门
他们失出同门
3:57.380–3:59.020
错误高度雷同
错误高度雷同
3:59.020–4:01.380
投票几乎没有增益
投票几乎没有增益
4:01.380–4:03.140
甚至可能三个一起错
甚至可能三个一起错
4:03.140–4:07.500
选差异大的模型比选更多模型重要的多
选差异大的模型比选更多模型重要的多
4:07.500–4:10.780
下面我们来看五种融合方式
下面我们来看五种融合方式
4:10.780–4:12.620
还有它的优缺点
还有它的优缺点
4:12.620–4:14.740
那第一个就是投票法
那第一个就是投票法
4:14.740–4:16.860
多个模型独立作答
多个模型独立作答
4:16.860–4:19.620
出现最多次的答案获胜
出现最多次的答案获胜
4:19.620–4:21.000
简单粗暴
简单粗暴
4:21.000–4:24.740
它的优势就是在选择题数学题代码
它的优势就是在选择题数学题代码
4:24.740–4:27.800
等一系列有标准答案的任务
等一系列有标准答案的任务
4:27.800–4:31.340
那缺点就是在编写文案审美等方面
那缺点就是在编写文案审美等方面
4:31.340–4:32.820
你没办法用投票
你没办法用投票
4:32.820–4:35.700
决定哪篇文章写得更好
决定哪篇文章写得更好
4:35.700–4:37.780
那第二个就是裁判法
那第二个就是裁判法
4:37.780–4:41.780
裁判法就是让多个模型各自作答
裁判法就是让多个模型各自作答
4:41.780–4:44.620
再用一个更强的模型当裁判
再用一个更强的模型当裁判
4:44.620–4:46.140
选最优的那一个
选最优的那一个
4:46.140–4:50.740
优势就是写作文案分析开放式问答
优势就是写作文案分析开放式问答
4:50.740–4:54.660
那缺点就是对裁判模型要求比较高
那缺点就是对裁判模型要求比较高
4:54.660–4:57.660
裁判要判断出好坏
裁判要判断出好坏
4:57.660–5:01.220
这是为什么OpenRouter在融合模型中
这是为什么OpenRouter在融合模型中
5:01.220–5:04.100
把OPUS4.8当裁判的原因
把OPUS4.8当裁判的原因
5:04.100–5:06.980
因为这个裁判也会有偏见
因为这个裁判也会有偏见
5:06.980–5:09.060
比如说谁先回答
比如说谁先回答
5:09.060–5:10.500
谁的回答字数多
谁的回答字数多
5:10.500–5:11.940
画风更客气
画风更客气
5:11.940–5:13.940
他就更愿意采纳谁
他就更愿意采纳谁
5:13.940–5:18.980
这是2024年以来多项研究反复确认的系统性问题
这是2024年以来多项研究反复确认的系统性问题
5:18.980–5:21.860
对策是调换候选顺序
对策是调换候选顺序
5:21.860–5:24.180
各凭一次取平均值
各凭一次取平均值
5:24.180–5:28.500
然而代价就是它的Token消耗会高出数倍
然而代价就是它的Token消耗会高出数倍
5:28.500–5:30.820
那第三种融合方式
那第三种融合方式
5:30.820–5:33.540
就叫MOA分层融合
就叫MOA分层融合
5:33.540–5:37.140
这个分层融合稍微复杂一些
这个分层融合稍微复杂一些
5:37.140–5:40.820
普通集成可以把它比作为几个厨师
普通集成可以把它比作为几个厨师
5:40.820–5:41.940
各做一道菜
各做一道菜
5:41.940–5:44.980
然后最后端上桌让您选
然后最后端上桌让您选
5:44.980–5:49.860
而MOA是第一层几个厨师各做一道菜
而MOA是第一层几个厨师各做一道菜
5:49.860–5:51.540
再传给第二层
再传给第二层
5:51.540–5:55.540
由第二层的另几个厨师尝过第一层
由第二层的另几个厨师尝过第一层
5:55.540–5:57.460
所有人做的菜之后
所有人做的菜之后
5:57.460–5:59.540
再各自改进一把
再各自改进一把
5:59.540–6:01.460
这样迭代几层之后
这样迭代几层之后
6:01.460–6:02.900
最后一个主厨
最后一个主厨
6:02.900–6:06.740
再把大家的成果综合成一道终极菜
再把大家的成果综合成一道终极菜
6:07.460–6:09.300
具体到模型
具体到模型
6:09.300–6:11.380
它有两个关键角色
它有两个关键角色
6:11.380–6:13.220
第一个是提议者
第一个是提议者
6:13.220–6:16.740
是每一层里负责生成答案的多个模型
是每一层里负责生成答案的多个模型
6:16.740–6:18.980
第二个是聚合者
第二个是聚合者
6:18.980–6:21.780
是负责看完上一层所有答案
是负责看完上一层所有答案
6:21.780–6:24.260
再综合出更好版本的模型
再综合出更好版本的模型
6:24.260–6:27.300
这个MOA它的精髓在于
这个MOA它的精髓在于
6:27.300–6:28.580
每一层每个模型
每一层每个模型
6:28.580–6:31.620
都会拿到上一层所有模型的输出
都会拿到上一层所有模型的输出
6:31.620–6:32.740
当做参考
当做参考
6:32.740–6:34.740
然后在此基础上
然后在此基础上
6:34.740–6:35.860
再写一版
再写一版
6:35.860–6:37.140
一层一层下来
一层一层下来
6:37.140–6:39.860
答案被反复的汇诊补充
答案被反复的汇诊补充
6:39.860–6:41.540
纠错越来越好
纠错越来越好
6:41.540–6:44.180
最后再由一个聚合者拍板
最后再由一个聚合者拍板
6:44.180–6:47.380
那它适合于追求极致质量
那它适合于追求极致质量
6:47.380–6:48.820
非实时的场景
非实时的场景
6:48.820–6:51.540
那它的代价就是调用次数多
那它的代价就是调用次数多
6:51.540–6:53.220
质量上限高
质量上限高
6:53.220–6:55.060
但是又贵又慢
但是又贵又慢
6:55.060–6:56.660
那第四个呢
那第四个呢
6:56.660–6:58.180
它叫路由法
它叫路由法
6:58.180–6:59.380
不融合答案
不融合答案
6:59.380–7:00.820
而是智能分流
而是智能分流
7:00.820–7:02.180
简单的问题呢
简单的问题呢
7:02.180–7:04.260
它就交给便宜的模型
它就交给便宜的模型
7:04.260–7:06.740
难的问题才调用贵的模型
难的问题才调用贵的模型
7:06.740–7:07.700
说白了呢
说白了呢
7:07.700–7:09.620
它就是智能分流
它就是智能分流
7:09.620–7:12.340
本质上还是单模型在输出
本质上还是单模型在输出
7:12.340–7:15.620
它适合生产环境成本敏感
它适合生产环境成本敏感
7:15.620–7:17.140
和大批量处理
和大批量处理
7:17.140–7:19.060
那风险就是路由
那风险就是路由
7:19.060–7:21.140
有的时候也会判断失误
有的时候也会判断失误
7:21.140–7:24.580
把复杂的问题交给轻量模型去处理
把复杂的问题交给轻量模型去处理
7:24.580–7:26.100
那第五种方式呢
那第五种方式呢
7:26.100–7:28.180
就叫模型合并
就叫模型合并
7:28.180–7:29.220
打个比方
打个比方
7:29.220–7:32.180
一个公司招了四个程序员
一个公司招了四个程序员
7:32.180–7:35.380
各自负责前端后端架构审核
各自负责前端后端架构审核
7:35.380–7:37.780
现在你找了一个全能程序员
现在你找了一个全能程序员
7:37.780–7:40.740
让他学习这四个程序员的手艺
让他学习这四个程序员的手艺
7:40.740–7:43.940
以后你就不用发四份工资了
以后你就不用发四份工资了
7:43.940–7:46.100
只雇一个程序员就可以
只雇一个程序员就可以
7:46.100–7:49.540
它的妙处就是融合发生的训练阶段
它的妙处就是融合发生的训练阶段
7:49.540–7:52.660
你平时用的时候只是用一个模型
你平时用的时候只是用一个模型
7:52.660–7:54.260
所以日常使用呢
所以日常使用呢
7:54.260–7:56.260
不会变慢和变贵
不会变慢和变贵
7:56.260–7:58.260
实际上现在各家的大模型
实际上现在各家的大模型
7:58.260–8:00.580
已经在做这种模型合并了
已经在做这种模型合并了
8:00.580–8:02.900
比如腾讯的会员模型
比如腾讯的会员模型
8:02.900–8:06.260
它把快思考和慢思考两套能力
它把快思考和慢思考两套能力
8:06.260–8:07.940
融合进一个模型
融合进一个模型
8:07.940–8:09.540
让模型能力更强
让模型能力更强
8:09.540–8:11.220
但是最后我们调用时
但是最后我们调用时
8:11.220–8:13.300
不需要手动调整
不需要手动调整
8:13.300–8:16.500
模型会自动切换专家MOE
模型会自动切换专家MOE
8:16.500–8:17.700
那这种方式
那这种方式
8:17.700–8:18.980
最大的优点是
最大的优点是
8:18.980–8:22.660
合并后推理成本和单个模型完全一样
合并后推理成本和单个模型完全一样
8:22.660–8:24.340
没有额外开销
没有额外开销
8:24.340–8:25.700
适合本地部署
适合本地部署
8:25.700–8:28.820
有多个同底座的微调模型
有多个同底座的微调模型
8:28.820–8:32.980
那缺点就是个人只能用现成融合好的模型
那缺点就是个人只能用现成融合好的模型
8:32.980–8:34.740
想自己融合呢
想自己融合呢
8:34.740–8:37.860
它有非常大的成本和技术门槛
它有非常大的成本和技术门槛
8:37.860–8:40.180
说完了以上五种融合模式
说完了以上五种融合模式
8:40.180–8:41.620
我们再来看一下
我们再来看一下
8:41.620–8:43.380
使用融合的办法
使用融合的办法
8:43.380–8:46.660
模型具体能提升多少智力
模型具体能提升多少智力
8:46.660–8:47.620
2024年
2024年
8:47.620–8:51.460
Tagazer AI提出MixedJury of Agent
Tagazer AI提出MixedJury of Agent
8:51.460–8:53.380
是这个领域的里程碑
是这个领域的里程碑
8:53.380–8:56.020
它的做法是分层融合
它的做法是分层融合
8:56.020–8:58.420
第一层几个模型各写草稿
第一层几个模型各写草稿
8:58.420–8:59.060
第二层
第二层
8:59.060–9:01.220
另一个模型读完所有草稿
另一个模型读完所有草稿
9:01.220–9:03.540
再出综合判断结果
再出综合判断结果
9:03.540–9:08.340
在衡量回答质量的PakaEvo 2.0榜单上
在衡量回答质量的PakaEvo 2.0榜单上
9:08.340–9:13.540
它的原始结果是超出当时旗舰模型7.6个百分点
它的原始结果是超出当时旗舰模型7.6个百分点
9:13.540–9:14.660
但是要注意
但是要注意
9:14.660–9:17.700
这六个模型全部为开源模型
这六个模型全部为开源模型
9:17.700–9:20.100
也就是说你的电脑足够多
也就是说你的电脑足够多
9:20.100–9:22.500
自己就能配出一个顶尖模型
自己就能配出一个顶尖模型
9:22.500–9:24.660
算力成本却极低
算力成本却极低
9:24.660–9:25.860
对于企业来说
对于企业来说
9:25.860–9:28.900
这种部署方式有很大价值
这种部署方式有很大价值
9:28.900–9:30.420
在数学推理方面
在数学推理方面
9:30.420–9:34.900
多模型投票通常能带来3-8分的提升
多模型投票通常能带来3-8分的提升
9:34.900–9:36.500
而代码生成
而代码生成
9:36.500–9:40.740
多模型生成加测试用力筛选加裁判选优
多模型生成加测试用力筛选加裁判选优
9:40.740–9:42.820
可能提升10-20分
可能提升10-20分
9:42.820–9:45.540
这是融合收益最夸张的领域
这是融合收益最夸张的领域
9:45.540–9:48.500
因为代码能直接跑测试验证
因为代码能直接跑测试验证
9:48.500–9:50.980
而开放式写作对话
而开放式写作对话
9:50.980–9:56.340
用裁判法和MOA能带来3-15分的提升
用裁判法和MOA能带来3-15分的提升
9:56.340–9:59.140
而路由法不为提升上限
而路由法不为提升上限
9:59.140–10:02.740
而是节省约41%的成本
而是节省约41%的成本
10:02.740–10:06.500
但保住了最强模型95%的性能
但保住了最强模型95%的性能
10:06.500–10:09.700
在模型能力上限见顶的当下
在模型能力上限见顶的当下
10:09.700–10:12.660
每提升一分都非常难
每提升一分都非常难
10:12.660–10:15.860
这种融合法提升可以说是巨大的
这种融合法提升可以说是巨大的
10:15.860–10:17.300
但现实的问题是
但现实的问题是
10:17.300–10:20.020
OpenAI、Anthrobic这些公司
OpenAI、Anthrobic这些公司
10:20.020–10:22.180
无法提供这种服务
无法提供这种服务
10:22.180–10:26.660
OpenAI不可能在Codex中添加OPS模型
OpenAI不可能在Codex中添加OPS模型
10:26.660–10:30.180
只能靠第三方做客户端和路由判断
只能靠第三方做客户端和路由判断
10:30.180–10:33.220
我们再来看融合模型它的成本
我们再来看融合模型它的成本
10:33.220–10:35.140
先记住一句话
先记住一句话
10:35.140–10:36.660
除了路由法
除了路由法
10:36.660–10:40.900
所有融合法都比单独调用一个模型更贵
所有融合法都比单独调用一个模型更贵
10:40.900–10:44.180
因为融合的本质就是多调用几次
因为融合的本质就是多调用几次
10:44.180–10:45.860
调用的次数上去了
调用的次数上去了
10:45.860–10:48.020
Token自然就上去了
Token自然就上去了
10:48.020–10:50.340
我们给几种融合法排个序
我们给几种融合法排个序
10:50.340–10:53.940
可以看到MOA在这里是最贵的
可以看到MOA在这里是最贵的
10:53.940–10:56.340
如果跟单独调用模型比
如果跟单独调用模型比
10:56.340–11:00.020
那投票、裁判、MOA全部都更贵
那投票、裁判、MOA全部都更贵
11:00.020–11:03.540
路由法是唯一一个能省Token的
路由法是唯一一个能省Token的
11:03.540–11:07.380
如果只在会合并答案的融合法内对比
如果只在会合并答案的融合法内对比
11:07.380–11:09.780
投票法因为只算N次
投票法因为只算N次
11:09.780–11:13.060
不加裁判是这里几个最便宜的
不加裁判是这里几个最便宜的
11:13.060–11:16.340
但它依然是单模型成本的N倍
但它依然是单模型成本的N倍
11:16.340–11:20.660
那在这里我们如何使用模型融合呢
那在这里我们如何使用模型融合呢
11:20.660–11:24.740
个人最快的部署方式就是写一个Skill
个人最快的部署方式就是写一个Skill
11:24.740–11:30.020
将Dbseek或者其他国产模型写入到这个Skill当中
将Dbseek或者其他国产模型写入到这个Skill当中
11:30.020–11:32.580
使用的时候直接调用就可以
使用的时候直接调用就可以
11:32.580–11:36.420
优势是无论你使用Cloud或者Codex
优势是无论你使用Cloud或者Codex
11:36.420–11:37.860
添加一个Skill
添加一个Skill
11:37.860–11:42.020
设置一下K的环境变量就可以在Cloud中跑多么
设置一下K的环境变量就可以在Cloud中跑多么
11:42.020–11:43.300
行融合了
行融合了
11:43.300–11:45.300
让Cloud充当裁判
让Cloud充当裁判
11:45.300–11:48.580
当然这也会增加一些Token的用量
当然这也会增加一些Token的用量
11:48.580–11:52.660
我目前就是自己写了一个简单的Skill
我目前就是自己写了一个简单的Skill
11:52.660–11:55.140
然后接通中转站的方式
然后接通中转站的方式
11:55.140–11:57.860
目前正在调整这个Skill
目前正在调整这个Skill
11:57.860–12:01.700
关键就在于这个充当裁判说明书的Skill
关键就在于这个充当裁判说明书的Skill
12:01.700–12:03.300
写得好并不容易
写得好并不容易
12:03.300–12:05.940
那如果你是玩本地模型的
那如果你是玩本地模型的
12:05.940–12:09.500
也可以用MergerKit这个主流开源工具
也可以用MergerKit这个主流开源工具
12:09.500–12:14.420
那它支持逐层拼接合并LauraTeach
那它支持逐层拼接合并LauraTeach
12:14.420–12:16.980
还能提供网页版零代码
还能提供网页版零代码
12:16.980–12:19.100
无需GPU在线合并
无需GPU在线合并
12:19.100–12:24.320
如果是想同时调用GPT或者Opus这些模型的话
如果是想同时调用GPT或者Opus这些模型的话
12:24.320–12:25.940
可以用OpenRouter
可以用OpenRouter
12:25.940–12:28.740
这个网站接入了数百个模型
这个网站接入了数百个模型
12:28.740–12:32.580
其中的Fusion模式会把同一个Prompt
其中的Fusion模式会把同一个Prompt
12:32.580–12:35.020
并行发送给一组模型
并行发送给一组模型
12:35.020–12:39.460
再由裁判模型分析共识矛盾综合输出
再由裁判模型分析共识矛盾综合输出
12:39.460–12:42.260
缺点就是价格会比较贵
缺点就是价格会比较贵
12:42.260–12:43.740
那我用下来呢
那我用下来呢
12:43.740–12:47.240
一个2000字的输出大概就需要两美金
一个2000字的输出大概就需要两美金
12:47.240–12:49.220
这个坑我已经踩过了
这个坑我已经踩过了
12:49.220–12:51.660
从这几个方面来看
从这几个方面来看
12:51.660–12:54.140
现在并没有特别好的融合软件
现在并没有特别好的融合软件
12:54.140–12:56.540
关键点在于算法
关键点在于算法
12:56.540–12:59.700
目前融合这条路呢也在探索中
目前融合这条路呢也在探索中
12:59.700–13:03.140
相信未来会有更好的第三方融合工具
相信未来会有更好的第三方融合工具
13:03.140–13:05.580
那最后我们来总结一下
那最后我们来总结一下
13:05.580–13:08.980
从2024年到2026年这两年
从2024年到2026年这两年
13:08.980–13:12.940
多模型融合从论文阶段逐渐走进大厂
多模型融合从论文阶段逐渐走进大厂
13:12.940–13:16.140
各种模型厂商正在把融合逻辑
各种模型厂商正在把融合逻辑
13:16.140–13:18.140
内化进单个模型
内化进单个模型
13:18.140–13:21.580
今天的旗舰模型大多是混合专家架构
今天的旗舰模型大多是混合专家架构
13:21.580–13:26.020
本质就是把多专家融合进一个模型内部
本质就是把多专家融合进一个模型内部
13:26.020–13:29.060
但这并不代表外部融合会消失
但这并不代表外部融合会消失
13:29.060–13:30.260
恰恰相反
恰恰相反
13:30.260–13:35.660
当你同时调用多家厂商能力边界完全不同的模型时
当你同时调用多家厂商能力边界完全不同的模型时
13:35.660–13:40.220
外部融合能突破任何一家单一模型的上限
外部融合能突破任何一家单一模型的上限
13:40.220–13:43.740
这个是单个MOE模型做不到的
这个是单个MOE模型做不到的
13:43.740–13:46.420
比如每家都有自己的训练员
比如每家都有自己的训练员
13:46.420–13:49.380
解锁信息也有特定的网站
解锁信息也有特定的网站
13:49.380–13:52.460
比如Gminite就可以搜索YouTube
比如Gminite就可以搜索YouTube
13:52.460–13:55.300
而豆包可以搜索抖音
而豆包可以搜索抖音
13:55.300–13:55.860
好了
好了
13:55.860–13:58.500
这就是本期视频的全部内容
这就是本期视频的全部内容
13:58.500–14:01.860
欢迎大家点赞留言订阅转发
欢迎大家点赞留言订阅转发
14:01.860–14:02.620
我是刘延
我是刘延
14:02.620–14:04.500
我们下个视频见
我们下个视频见

影片筆記:把 3 个 AI 融合,竟反超被封杀的顶级模型?多模型融合全拆解 | Multi-Model Fusion

一句話總結

影片解析了「多模型融合」(Multi-Model Fusion)技術,透過投票、裁判、分層、路由及模型合併五種方式,突破單一模型的能力上限與成本限制,並探討了其在當前 AI 監管與技術趨勢下的應用價值與實踐陷阱。

核心重點

  1. 融合技術的必要性
  • 受美國出口管制影響,部分頂級模型(如 Fibon 5)下架或受限,多模型融合成為替代方案。
  • 單一模型存在能力邊界,融合多個不同架構、訓練數據的模型可取長補短,突破智力上限。
  • 大廠趨勢是將融合邏輯內化至單一模型(如 MOE 架構),但外部融合仍能實現跨廠商、跨架構的能力疊加。
  1. 五大融合方式及其適用場景
  • 投票法:適合有標準答案的任務(數學、代碼、選擇題),依賴多數決提升準確率。
  • 裁判法:適合開放式任務(文案、分析),由強模型評判並選出最佳答案,但成本高且裁判可能有偏見。
  • MOA 分層融合:多層迭代改進,追求極致質量,但調用次數多、速度慢、成本高。
  • 路由法:智能分流,簡單問題用便宜模型,難問題用貴模型,主要優勢是節省成本(約 41%),而非提升上限。
  • 模型合併:在訓練階段合併能力,適合本地部署與日常使用,但技術門檻高,個人難以自行實現。
  1. 效能與成本分析
  • 效能提升:在數學推理、代碼生成、開放式寫作等領域,融合技術可帶來顯著分數提升(最高達 10-20 分或超越旗艦模型)。
  • 成本結構:除路由法外,其他融合法因多次調用模型,成本通常高於單模型調用。MOA 最貴,投票與裁判法次之。
  1. 實踐建議與風險
  • 個人開發者可透過編寫 Skill 或利用 OpenRouter 等平台進行融合。
  • 本地部署可使用 MergerKit 等工具。
  • 需注意模型多樣性(同門模型融合增益低)、裁判偏見、路由失誤及 Token 消耗過高等風險。

詳細大綱

一、 背景與動機

  • 現狀挑戰:Fibon 5 因美國出口管制指令,僅上線三天即下架,導致市場需要替代方案。
  • Open Router 測試結果
  • 組合 GIMI 3 Flash + KMI 2.6 + Deep Seek V4 Pro 進行 Dirico 測試,得分 64.7%。
  • Fibon 5 單模型得分 65.3%,差距僅 0.6%。
  • 組合 Opus 4.8 + GBT 5.5 + GB9 3.1 Pro 融合得分高達 68.3%,顯示融合技術可超越單一頂級模型。
  • 核心問題:融合技術如何打破單一模型的智力上限?

二、 融合原理與基礎概念

  • 定義:多模型融合是將多個模型的答案融合,取長補短。
  • 案例故事:2024年日本 AI 小公司 Sakana 將兩個開源免費模型(擅長日語與擅長數學)拼接,在權威測試中擊敗更大模型。
  • 數學邏輯
  • 若每個模型獨立答對概率為 70%,且錯誤互相獨立。
  • 三個模型多數投票後,答對概率提升至 78.4%。
  • 關鍵前提:模型必須具有「多樣性」(訓練數據、架構、優化目標不同)。同門模型(如 GPT5.5 系列)錯誤高度雷同,投票增益極低。

三、 五種融合方式及優缺點

| 融合方式 | 原理描述 | 優勢/適用場景 | 缺點/風險 |
| :--- | :--- | :--- | :--- |
| 1. 投票法 | 多個模型獨立作答,出現最多次的答案獲勝。 | 有標準答案的任務(選擇題、數學、代碼)。 | 無法用於文案、審美等無標準答案的場景。 |
| 2. 裁判法 | 多個模型作答,由一個更強的模型(裁判)選出最優者。 | 寫作文案、分析、開放式問答。 | 對裁判模型要求高;裁判可能有偏見(如順序、字數、語氣);Token 消耗高出數倍。 |
| 3. MOA 分層融合 | 多層迭代。第一層生成答案,第二層參考所有答案並改進,最後由聚合者拍板。 | 追求極致質量、非實時場景。 | 調用次數多,又貴又慢;質量上限高。 |
| 4. 路由法 | 智能分流。簡單問題交給便宜模型,難問題調用貴模型。 | 生產環境、成本敏感、大批量處理。 | 路由判斷可能失誤,將複雜問題交給輕量模型。 |
| 5. 模型合併 | 在訓練階段將多個模型的能力合併為單一模型(類似全能程序員)。 | 日常使用不慢不貴;適合本地部署;自動切換專家(MOE)。 | 個人難以自行融合,成本高、技術門檻高;只能使用現成融合模型。 |

四、 融合技術的真實效果

  • 里程碑案例:2024年 Tagazer AI 提出 MixedJury of Agent(分層融合)。
  • 在 PakaEvo 2.0 榜單上,原始結果超出當時旗艦模型 7.6 個百分點。
  • 全部為開源模型,算力成本極低。
  • 具體領域提升
  • 數學推理:多模型投票帶來 3-8 分提升。
  • 代碼生成:生成 + 測試過濾 + 裁判選優,可能提升 10-20 分(收益最誇張領域,因可直接跑測試驗證)。
  • 開放式寫作/對話:裁判法和 MOA 帶來 3-15 分提升。
  • 路由法:不提升上限,但節省約 41% 成本,並保住最強模型 95% 的性能。

五、 成本分析

  • 基本原則:除路由法外,所有融合法都比單獨調用一個模型更貴(因為調用次數增加,Token 消耗增加)。
  • 成本排序
  1. 最貴:MOA(分層融合)。
  2. 次貴:投票法、裁判法(均比單模型貴 N 倍)。
  3. 唯一省錢:路由法。
  • 實際案例:使用 OpenRouter Fusion 模式,2000 字輸出約需 2 美金。

六、 部署與實踐建議

  • 個人/雲端部署
  • 寫一個 Skill,將 Dbseek 或其他國產模型寫入。
  • 在 Cloud 或 Codex 中設置 K 環境變量,讓 Cloud 充当裁判。
  • 關鍵在於撰寫充当裁判的 Skill 說明書。
  • 本地部署
  • 使用 MergerKit(主流開源工具)。
  • 支持逐層拼接、合併 LauraTeach。
  • 提供網頁版零代碼、無需 GPU 在線合併。
  • 第三方平台
  • OpenRouter:接入數百個模型,Fusion 模式並行發送 Prompt,由裁判模型分析共識。
  • 現狀總結:目前沒有特別好的融合軟件,關鍵在於算法,仍在探索中。

七、 未來趨勢與總結

  • 大廠趨勢:2024-2026年,多模型融合從論文階段走進大廠,廠商將融合邏輯內化進單個模型(混合專家架構 MOE)。
  • 外部融合價值:外部融合不會消失。當同時調用多家廠商能力邊界完全不同的模型時,外部融合能突破任何單一模型的上限(這是單個 MOE 模型做不到的)。
  • 例子:不同模型擁有不同的訓練員、解鎖信息、特定網站搜索能力(如 Gminite 搜索 YouTube,豆包搜索抖音)。

工具 / 模型 / 名詞整理

  • 模型/產品名稱
  • Fibon 5
  • Open Router
  • GIMI 3 Flash
  • KMI 2.6
  • Deep Seek V4 Pro
  • Dirico
  • Opus 4.8
  • GBT 5.5
  • GB9 3.1 Pro
  • 第五(疑為模型名稱或口誤)
  • Cloud Ops(疑為模型名稱或口誤)
  • Deepseek
  • Gmini(疑為模型名稱或口誤)
  • GPT5.5
  • GPT5.5 mini
  • 5 Turbo
  • Sakana(日本 AI 公司)
  • Tagazer AI
  • MixedJury of Agent
  • PakaEvo 2.0
  • OpenAI
  • Anthrobic(疑為 Anthropic 之誤)
  • Codex
  • OPS(疑為 Opus 之誤)
  • Dbseek(疑為 DeepSeek 之誤)
  • Cloud(疑為 Claude 之誤)
  • MergerKit
  • LauraTeach(疑為 LoRA/Checkpoint 等術語之誤)
  • Gminite(疑為模型名稱或口誤)
  • 豆包
  • 技術/架構名稱
  • 融合技術
  • 投票法
  • 裁判法
  • MOA 分層融合
  • 路由法
  • 模型合併
  • MOE(混合專家架構)
  • Skill
  • 環境變量 K

操作流程整理

  1. 確定融合目標與場景
  • 評估任務類型(是否有標準答案、是否對成本敏感、是否對質量要求極高)。
  • 選擇對應的融合策略(投票、裁判、MOA、路由、合併)。
  1. 選擇與配置模型
  • 多樣性檢查:確保參與融合的模型來自不同廠商或具有不同架構/訓練數據,避免同門模型錯誤雷同。
  • 平台選擇
  • 雲端/個人開發:使用 OpenRouter 等平台,或編寫 Skill 將特定模型(如 Dbseek)接入。
  • 本地部署:使用 MergerKit 等工具進行模型合併或拼接。
  1. 實施融合邏輯
  • 投票法:並行發送 Prompt,統計結果,取多數答案。
  • 裁判法:並行生成多個答案,調用強模型(裁判)進行評判與篩選。
  • MOA 分層融合:第一層生成,後續層迭代改進,最後由聚合者決定。
  • 路由法:設置路由規則,根據問題難度動態分配模型。
  1. 評估與優化
  • 監控 Token 消耗與成本(注意除路由法外,融合通常更貴)。
  • 驗證效能提升(如數學、代碼、寫作領域的分數變化)。
  • 調整裁判模型或路由邏輯以減少偏見或失誤。

值得注意的限制或風險

  1. 成本增加:除路由法外,投票、裁判、MOA 等融合法因多次調用模型,Token 消耗顯著增加,成本高於單模型。
  2. 模型多樣性要求:若參與融合的模型屬於同一系列(如 GPT5.5 系列),錯誤高度雷同,投票法增益極低。
  3. 裁判偏見:裁判法中,裁判模型可能受順序、字數、語氣等因素影響,產生偏見。
  4. 路由失誤:路由法可能將複雜問題錯誤地分配給輕量模型,導致質量下降。
  5. 技術門檻:模型合併需要高技術門檻與算力,個人難以自行實現,多依賴現成工具或平台。
  6. 監管與可用性:部分頂級模型可能因出口管制等原因下架或受限,影響融合方案的穩定性。

逐字稿辨識疑點

  • Fibon 5:逐字稿中多次出現,疑似為某模型名稱,但常見模型中無此標準名稱,需查證。
  • GIMI 3 Flash:疑似為 Gemini 系列之誤聽或特定版本名稱,需查證。
  • KMI 2.6:常見模型中無此標準名稱,需查證。
  • Dirico 測試:常見基準測試中無此標準名稱(如 MMLU, GSM8K 等),需查證。
  • 第五:在描述模型回答風格時出現(「第五它的回答詳細...」),疑似為模型名稱或口誤。
  • Cloud Ops:在描述模型風格時出現(「但Cloud Ops簡潔嚴謹」),疑似為 Claude 系列或其他模型之誤聽。
  • Gminite:在描述搜索能力時出現(「比如Gminite就可以搜索YouTube」),疑似為模型名稱或口誤。
  • Anthrobic:疑似為 Anthropic 之誤聽。
  • OPS:在「OpenAI不可能在Codex中添加OPS模型」中出現,疑似為 Opus 之誤聽。
  • Dbseek:疑似為 DeepSeek 之誤聽。
  • Cloud:在「使用Cloud或者Codex」及「讓Cloud充当裁判」中出現,結合上下文極大機率指代 Claude,但逐字稿寫作 Cloud。
  • LauraTeach:在 MergerKit 功能描述中出現,疑似為 LoRA、Checkpoint 或特定技術術語之誤聽。
  • GBT 5.5:疑似為 GPT 系列之誤聽。
  • GB9 3.1 Pro:疑似為某模型版本號之誤聽或拼寫錯誤。

可延伸追問

  1. 在實際應用中,如何量化評估「模型多樣性」,以確保融合後的增益大於成本?
  2. 對於開源模型與閉源模型的混合融合,是否存在特定的技術挑戰或兼容性問題?
  3. 隨著大廠將融合邏輯內化至 MOE 架構,外部多模型融合市場是否會萎縮?其長期價值何在?
  4. 路由法中的「路由判斷失誤」如何通過機器學習或規則優化來降低風險?
  5. 在本地部署環境中,MergerKit 等工具對硬體資源(GPU/CPU)的具体要求是多少?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習