哈喽下班了 好久没有看到让人眼前一亮的研究了 最近看到日本的一家AI公司叫Sakana AI 他们最新提出了一个模型叫Fugu 就是河豚的意思 然后我觉得非常有意思 它不是一个特别特别强的一个天才模型 而是一个集体智慧 靠训练模型的管理能力强化出来的一个全新的模型 然后他们这个公司很有意思 因为日本的AI感觉一直以来没有什么声音 但是可能Sakana AI是它唯一一家 我觉得可能是最有希望的一家AI公司 因为两个创始人 一个是从Google Brain出来的 以前就是做复杂系统研究的 另外一个是Transformer的八位作者之一 就是Attention is all you need的那篇论文的八位作者之一 他们两个有一个特别独特的审美品位 他们一直认为可以从自然中学习和借鉴 比如说从这种渔群啊 这个风群啊 从自然界中它的这个自组织 包括涌现 集体智慧 这些层面去给模型的研发一些启示 所以他们一直以来就是去探索的这个方向 就是在去看这些模型 能不能通过彼此之间合作 就像这个基因片段之间的合作一样 能不能找到一些新的机会和方向 所以他们这次推出的FUGU这个模型呢 就是用了集体智慧的这种意思啊 而且取得了非常好的效果 他们最近的这个打榜啊 在各种评测上都非常棒 都超过了OPUS 4.8 就是它不是一个模型 而是一个模型强化出来的一些管理能力 就相当于是用这一个模型 它可以组织调度开源的和避源的模型 来协同工作 来实现的一种非常好的结果 那比如说在这个榜单上 你在这种编程的榜单上 甚至超过了FUGU5 然后有的榜单呢 跟NESOS处于同一个水平 包括Humanity Last Exam上 也超过Gemini 3.1 Pro 这个模型背后啊 实际上是由两篇论文 去做支撑的 两个论文探索的 其实是不同的方向 一篇呢是叫Trinity 就是三文一体的那个Trinity 它讲的呢 就是说去探索一下 模型能不能在一个 比较简单任务的调度方面 能够有一个非常快的响应 能够去在三种角色上 用不同的模型来实现 相当于用了一套方法啊 一套演化的方法 去探索出来一个路径 能够让这个模型知道 接下来这一步操作 应该让哪个模型 以一个什么样的身份 去参与下一步工作 比如说他们把模型 划分为三种角色 这个我们也之前讲过 最有效的三种角色 一种是Thinker 就是思考者 一种是这个执行者 就是Worker 另外一种是Verifier 就是验证者 一般我们说这三种角色 就可以起到一个 非常好的效果 那这个模型 就是一个0.6B的 一个小模型 就是在这个内部的状态上 再去识别 接下来通过上下文的感知 认为接下来 应该用什么样的模型 用一个什么样的角色 来去执行下一步工作 然后直接就让这个模型 开始工作 特别像是一个调度器 就如果类比成公司来说 它就像一个在生产线上 去排弯的一个经理 它有非常明确的 对下一步状态的一个感知 然后它就直接 想都没想 就直接执行了这样的操作 然后这是一条线 另外一条线是它另外一篇论文里讲的 叫Conductor 就是一个指挥家的角色 就有点像我们去做Multi Agent System去协作 让多个模型 多个智能体 让它去分工协作 有一个复杂的任务 让它在这个复杂任务中做拆解 比如说 这个任务应该有几个Agent来完成 每一个Agent是什么角色 以及他们之间 应该是怎么样去信息交互 他们是一个什么样的凑谱结构 以及他们这个彼此之间 有哪个是PM 哪个是负责全局的 哪些是负责执行 哪些是负责验证的 就是也是要有一系列 非常明确的身份规划 就特别像他们强化训练出来了 一个大概7B的一个模型 去调动不同的模型来去解决问题 然后这个就特别像一个职业经理人 他有非常强的管理能力 相当于模型在通过强化学习的训练之后 我给模型激励 如果你要调度不同的模型产生一些比较好的结果的话 那我就给你激励 所以这个是非常有意思的一个方向 其实他们也是在这一次的论文中明确了 通过强化学习 确实是可以把模型的调度能力提升上去的 甚至是涌现出了一些超出以往 单一模型执行的能力 然后其实我们都知道像这样的一些能力 我们现在在Harness Engineering里面就是在做嘛 我们也在做编排 比如说在Workbody里面 我们可以有这个股票交易的这个专家 对吧 他其实就是在用Multi Agent 来去实现一些更好的一些判断 比如说有人唱空 有人唱多 有人对这个基本面做分析 有人对鱼形做分析 就是他不同的模型 他负责的方向是不一样的 但是他们是用了一个相当于是训练一个模型 去拥有这个调度能力的这种方式 相当于让Harness的这个能力在模型中进行了沉淀 而且他也不光是训练的这些任务他能够做 他还泛化出来了一些其他的能力 就是他可以在没见过的任务上也产出同样很好的一个水平 所以他是一个非常有意思的一个结构 我们从他那个官网上的模型结构图上 其实可以看到他就是一个复古这个模型 他可以access就可以接触到 有的是开源模型 有的是必源模型 同样他也可以接触到他自己 他是一个地规的一个架构 然后所以这条方法他们评估下来 发现不光是在这些场景上 trading比如说做交易的评测 然后看一段时间之后 哪一个交易模型的这个带来的交易收益更高 对吧 或者是让他解一个谜题 做一个魔方 然后恢复一个魔方 哪个效果会更快 哪一个步数更少 相当于一系列的测试中 发现这种方式确实能够起到一个很好的效果 那这个意味着什么呢 我觉得就是很容易类比和联想到我们人类社会上 就是我们每个人其实都有自己不同的能力 有的人擅长写代码 有的人擅长执行 有的人擅长写文章 那不同的模型也像我们人一样有不同的能力 那通过这种管理者就是有一个模型专门拥有了这个管理能力 我去协调这些模型能够产生一个非常好的效果 对 然后这个是就是很有意思了 就是因为我是学城市规划的 然后我对这种组织这个叫集体智慧 集体智能涌现就非常感兴趣 而且它这个方向也正好契合了我们前一段时间写的 就是从超级个体到超级团队 为什么有了一个一个的天才模型之后 它依然需要团队 对吧 有了这个要数据中心中的天才之国 那为什么还需要这个不同模型之间的协作 就是因为协作还是可以去拉高上线的 而且这次的这个论文也是发现了 在强化学习的这个训练方法之下 这种协调能力也可以被训练出来 这就带来了两个问题 一个呢就是那harness还重不重要 对吧 比如说我们有未来模型 可以吸收到这些模型的编排之后 那我们还要不要有harness 我的观点是它两个都同样重要 就像你有大组织也有出放公司一样 就是还是有非常非常多的场景 需要去灵活的探索 就可能还没有被吸收到模型的能力里面 所以我认为未来的每一个软件公司 在未来可能都会变成一个模型公司 这个模型公司就是专门去为特定的场景 特定的数据 然后特定的条件去做优化的 如果你能够在一个特定的场景下 去调用非常多的模型去解决场景的问题 能够在效率成本还有速度之间 取得一个很好的平衡的话 那你就是能够贡献价值的 未来比如说像富库这个公司 它可以提供一套通用的这种conductor 就是模型编排能力 但是每一个软件公司 因为你对场景数据最了解 你对这个模型的评测最了解 那你是可以在这个场景中最有发言权的 所以我觉得这个肯定是一个 就是harness和这种模型端 它都会同时存在 还有一个问题 那我们既然说集体智慧这么重要了 那单个模型的智能还重不重要 我觉得依然是重要的 因为就是你把一个天才和一堆普通人放在一起 发挥的价值和把一堆天才聚集在一起 发挥的价值 那可是差的不只是一倍两倍三倍 对吧 那可能是十倍几十倍的差异 所以像那个阿茂Day他说的 未来在这个数据中心中的天才之国 就是当这个数据中心中有很多的模型 它都是天才的时候 那产生的这个效应和效果 那其实是超乎想象的 所以我觉得未来可能这个技术路线 不光是在日本的这家公司里会去使用 就是像前沿模型这些公司 他们也会去使用 他们也会去开始这个组织智能的探索 其实像OpenAI之前 把HCI的实现 划分了五个等级 那最后一等级就是 Organizer 就是协调者组织者 那我觉得这一次的这个Takana AI 确实是在这个方向上 得到了一个很好的突破 就是验证了这个方向也是可行的 所以我觉得接下来对我们每个人来说 就是你费劲巴拉的去写 Multi Agent的这些约束 其实不如直接拿一个模型来去使用 这也并不是说我们自己就没那么重要了 而是说我们的时间 注意力可以解放在更多 我们更擅长的这种端到端的 以及线下的一些事情上去 对 机会还是存在的 只是说现在我们有更多的 模型公司的研发 可以把人类的注意力更好的解脱出来 我就做这些推演吧 拜拜 拜拜 拜拜