Fibon 5仅仅上线了三天就被下架了 原因是美国的出口管制指令 但仅仅几天就找到了替代Fibon 5的方法 Open Router最新公布了一套测试 在测试中使用融合技术 将GIMI 3 Flash加KMI 2.6加Deep Seek V4 Pro 这套组合进行Dirico测试 得分为64.7% 而Fibon 5的单模型得分是65.3% 仅仅相差0.6% 如果使用Opus 4.8加GBT 5.5加GB9 3.1 Pro 这三个模型融合得分更是高达68.3% 这下美国封锁Fibon 5显然意义也不大了 那今天我们不探讨得分的具体细节 详细聊聊这个融合技术 它是怎么打破自己的智力上限的 我们从几个点把这个知识吃透 那第一什么是融合模型 第二融合模型的五种干活方式以及优缺点 第三就是融合技术的真实效果怎么样 第四融合技术的成本是多少 那第五如何快速在Cloud和Codex中使用简单的融合 那第五就是在使用中哪些坑不要踩 我们先来看第一融合的原理 你大概有过这种经验 同一个问题 第五它的回答详细但是有点啰嗦 但Cloud Ops简洁严谨 但是回答比较高了 问Deepseek回答呢 它有哲学性 但写代码稍微差点意思 问Gmini它适合插资料 但有时候它也会降置 那每个模型都有长版也有短版 那于是一个很自然的想法就冒出来 能不能把这些模型的答案融合起来 取长补短呢 这就是多模型融合 它的技术就是为了解决这个问题 那融合技术有多厉害呢 先讲个故事 2024年一家叫Sakana的日本AI小公司 没花什么大价钱 训练了一个新模型 只是把两个县城的开源免费模型 一个擅长日语 一个擅长数学 用巧妙的办法拼在了一起 结果这个拼出来的新模型 既会日语又会做数学题 还在日语数学的权威测试里 拿下了一个第一 打败了比它大好几倍的模型 而它从没有专门为这个任务训练过 用一句话解释就是 让多个AI模型一起干活 常常能干出1加1大于2的效果 把一道难题同时丢给三个模型 谁的答案好呢就用谁 最后整合出的版本 往往比单一模型效果要更好 不同模型的训练数据架构优化目标都不同 犯的错呢也不同 正是这种差异 专业上叫多样性 让互相纠错成为可能 假设有一道题 每个模型独立答对的概率是70% 且错误互相独立 三个模型多数投票后 答对的概率就变成了78.4% 凭空多出8个百分点 什么都没改 只是多问了几步 然后再进行投票而已 但这里有个问题需要注意 模型必须是不同的 如果你拿GPT5.5 加GPT5.5 mini加5 Turbo 来投票 他们失出同门 错误高度雷同 投票几乎没有增益 甚至可能三个一起错 选差异大的模型比选更多模型重要的多 下面我们来看五种融合方式 还有它的优缺点 那第一个就是投票法 多个模型独立作答 出现最多次的答案获胜 简单粗暴 它的优势就是在选择题数学题代码 等一系列有标准答案的任务 那缺点就是在编写文案审美等方面 你没办法用投票 决定哪篇文章写得更好 那第二个就是裁判法 裁判法就是让多个模型各自作答 再用一个更强的模型当裁判 选最优的那一个 优势就是写作文案分析开放式问答 那缺点就是对裁判模型要求比较高 裁判要判断出好坏 这是为什么OpenRouter在融合模型中 把OPUS4.8当裁判的原因 因为这个裁判也会有偏见 比如说谁先回答 谁的回答字数多 画风更客气 他就更愿意采纳谁 这是2024年以来多项研究反复确认的系统性问题 对策是调换候选顺序 各凭一次取平均值 然而代价就是它的Token消耗会高出数倍 那第三种融合方式 就叫MOA分层融合 这个分层融合稍微复杂一些 普通集成可以把它比作为几个厨师 各做一道菜 然后最后端上桌让您选 而MOA是第一层几个厨师各做一道菜 再传给第二层 由第二层的另几个厨师尝过第一层 所有人做的菜之后 再各自改进一把 这样迭代几层之后 最后一个主厨 再把大家的成果综合成一道终极菜 具体到模型 它有两个关键角色 第一个是提议者 是每一层里负责生成答案的多个模型 第二个是聚合者 是负责看完上一层所有答案 再综合出更好版本的模型 这个MOA它的精髓在于 每一层每个模型 都会拿到上一层所有模型的输出 当做参考 然后在此基础上 再写一版 一层一层下来 答案被反复的汇诊补充 纠错越来越好 最后再由一个聚合者拍板 那它适合于追求极致质量 非实时的场景 那它的代价就是调用次数多 质量上限高 但是又贵又慢 那第四个呢 它叫路由法 不融合答案 而是智能分流 简单的问题呢 它就交给便宜的模型 难的问题才调用贵的模型 说白了呢 它就是智能分流 本质上还是单模型在输出 它适合生产环境成本敏感 和大批量处理 那风险就是路由 有的时候也会判断失误 把复杂的问题交给轻量模型去处理 那第五种方式呢 就叫模型合并 打个比方 一个公司招了四个程序员 各自负责前端后端架构审核 现在你找了一个全能程序员 让他学习这四个程序员的手艺 以后你就不用发四份工资了 只雇一个程序员就可以 它的妙处就是融合发生的训练阶段 你平时用的时候只是用一个模型 所以日常使用呢 不会变慢和变贵 实际上现在各家的大模型 已经在做这种模型合并了 比如腾讯的会员模型 它把快思考和慢思考两套能力 融合进一个模型 让模型能力更强 但是最后我们调用时 不需要手动调整 模型会自动切换专家MOE 那这种方式 最大的优点是 合并后推理成本和单个模型完全一样 没有额外开销 适合本地部署 有多个同底座的微调模型 那缺点就是个人只能用现成融合好的模型 想自己融合呢 它有非常大的成本和技术门槛 说完了以上五种融合模式 我们再来看一下 使用融合的办法 模型具体能提升多少智力 2024年 Tagazer AI提出MixedJury of Agent 是这个领域的里程碑 它的做法是分层融合 第一层几个模型各写草稿 第二层 另一个模型读完所有草稿 再出综合判断结果 在衡量回答质量的PakaEvo 2.0榜单上 它的原始结果是超出当时旗舰模型7.6个百分点 但是要注意 这六个模型全部为开源模型 也就是说你的电脑足够多 自己就能配出一个顶尖模型 算力成本却极低 对于企业来说 这种部署方式有很大价值 在数学推理方面 多模型投票通常能带来3-8分的提升 而代码生成 多模型生成加测试用力筛选加裁判选优 可能提升10-20分 这是融合收益最夸张的领域 因为代码能直接跑测试验证 而开放式写作对话 用裁判法和MOA能带来3-15分的提升 而路由法不为提升上限 而是节省约41%的成本 但保住了最强模型95%的性能 在模型能力上限见顶的当下 每提升一分都非常难 这种融合法提升可以说是巨大的 但现实的问题是 OpenAI、Anthrobic这些公司 无法提供这种服务 OpenAI不可能在Codex中添加OPS模型 只能靠第三方做客户端和路由判断 我们再来看融合模型它的成本 先记住一句话 除了路由法 所有融合法都比单独调用一个模型更贵 因为融合的本质就是多调用几次 调用的次数上去了 Token自然就上去了 我们给几种融合法排个序 可以看到MOA在这里是最贵的 如果跟单独调用模型比 那投票、裁判、MOA全部都更贵 路由法是唯一一个能省Token的 如果只在会合并答案的融合法内对比 投票法因为只算N次 不加裁判是这里几个最便宜的 但它依然是单模型成本的N倍 那在这里我们如何使用模型融合呢 个人最快的部署方式就是写一个Skill 将Dbseek或者其他国产模型写入到这个Skill当中 使用的时候直接调用就可以 优势是无论你使用Cloud或者Codex 添加一个Skill 设置一下K的环境变量就可以在Cloud中跑多么 行融合了 让Cloud充当裁判 当然这也会增加一些Token的用量 我目前就是自己写了一个简单的Skill 然后接通中转站的方式 目前正在调整这个Skill 关键就在于这个充当裁判说明书的Skill 写得好并不容易 那如果你是玩本地模型的 也可以用MergerKit这个主流开源工具 那它支持逐层拼接合并LauraTeach 还能提供网页版零代码 无需GPU在线合并 如果是想同时调用GPT或者Opus这些模型的话 可以用OpenRouter 这个网站接入了数百个模型 其中的Fusion模式会把同一个Prompt 并行发送给一组模型 再由裁判模型分析共识矛盾综合输出 缺点就是价格会比较贵 那我用下来呢 一个2000字的输出大概就需要两美金 这个坑我已经踩过了 从这几个方面来看 现在并没有特别好的融合软件 关键点在于算法 目前融合这条路呢也在探索中 相信未来会有更好的第三方融合工具 那最后我们来总结一下 从2024年到2026年这两年 多模型融合从论文阶段逐渐走进大厂 各种模型厂商正在把融合逻辑 内化进单个模型 今天的旗舰模型大多是混合专家架构 本质就是把多专家融合进一个模型内部 但这并不代表外部融合会消失 恰恰相反 当你同时调用多家厂商能力边界完全不同的模型时 外部融合能突破任何一家单一模型的上限 这个是单个MOE模型做不到的 比如每家都有自己的训练员 解锁信息也有特定的网站 比如Gminite就可以搜索YouTube 而豆包可以搜索抖音 好了 这就是本期视频的全部内容 欢迎大家点赞留言订阅转发 我是刘延 我们下个视频见