0:00.000–0:01.240
zh哈喽下班了
0:01.240–0:04.300
zh好久没有看到让人眼前一亮的研究了
0:04.300–0:08.040
zh最近看到日本的一家AI公司叫Sakana AI
0:08.040–0:11.540
zh他们最新提出了一个模型叫Fugu
0:11.540–0:13.580
zh就是河豚的意思
0:13.580–0:15.540
zh然后我觉得非常有意思
0:15.540–0:19.440
zh它不是一个特别特别强的一个天才模型
0:19.440–0:21.220
zh而是一个集体智慧
0:21.220–0:25.840
zh靠训练模型的管理能力强化出来的一个全新的模型
0:25.840–0:28.480
zh然后他们这个公司很有意思
0:28.480–0:31.660
zh因为日本的AI感觉一直以来没有什么声音
0:31.660–0:35.520
zh但是可能Sakana AI是它唯一一家
0:35.520–0:38.380
zh我觉得可能是最有希望的一家AI公司
0:38.380–0:40.440
zh因为两个创始人
0:40.440–0:42.640
zh一个是从Google Brain出来的
0:42.640–0:44.360
zh以前就是做复杂系统研究的
0:44.360–0:49.060
zh另外一个是Transformer的八位作者之一
0:49.060–0:52.580
zh就是Attention is all you need的那篇论文的八位作者之一
0:52.580–0:55.620
zh他们两个有一个特别独特的审美品位
0:55.620–0:58.960
zh他们一直认为可以从自然中学习和借鉴
0:58.960–1:01.380
zh比如说从这种渔群啊
1:01.380–1:02.660
zh这个风群啊
1:02.660–1:05.720
zh从自然界中它的这个自组织
1:05.720–1:06.840
zh包括涌现
1:06.840–1:07.900
zh集体智慧
1:07.900–1:10.880
zh这些层面去给模型的研发一些启示
1:10.880–1:14.620
zh所以他们一直以来就是去探索的这个方向
1:14.620–1:16.700
zh就是在去看这些模型
1:16.700–1:19.040
zh能不能通过彼此之间合作
1:19.040–1:21.800
zh就像这个基因片段之间的合作一样
1:21.800–1:24.080
zh能不能找到一些新的机会和方向
1:24.080–1:27.240
zh所以他们这次推出的FUGU这个模型呢
1:27.240–1:30.040
zh就是用了集体智慧的这种意思啊
1:30.040–1:31.840
zh而且取得了非常好的效果
1:31.840–1:33.800
zh他们最近的这个打榜啊
1:33.800–1:36.960
zh在各种评测上都非常棒
1:36.960–1:38.360
zh都超过了OPUS 4.8
1:38.360–1:39.480
zh就是它不是一个模型
1:39.480–1:42.760
zh而是一个模型强化出来的一些管理能力
1:42.760–1:44.640
zh就相当于是用这一个模型
1:44.640–1:48.040
zh它可以组织调度开源的和避源的模型
1:48.040–1:48.980
zh来协同工作
1:48.980–1:51.220
zh来实现的一种非常好的结果
1:51.220–1:52.900
zh那比如说在这个榜单上
1:52.900–1:54.700
zh你在这种编程的榜单上
1:54.700–1:56.480
zh甚至超过了FUGU5
1:56.480–1:58.960
zh然后有的榜单呢
1:58.960–2:00.940
zh跟NESOS处于同一个水平
2:00.940–2:03.860
zh包括Humanity Last Exam上
2:03.860–2:05.640
zh也超过Gemini 3.1 Pro
2:05.640–2:07.120
zh这个模型背后啊
2:07.120–2:08.820
zh实际上是由两篇论文
2:08.820–2:09.820
zh去做支撑的
2:09.820–2:11.360
zh两个论文探索的
2:11.360–2:12.540
zh其实是不同的方向
2:12.540–2:14.980
zh一篇呢是叫Trinity
2:14.980–2:16.660
zh就是三文一体的那个Trinity
2:16.660–2:18.180
zh它讲的呢
2:18.180–2:19.660
zh就是说去探索一下
2:19.660–2:21.420
zh模型能不能在一个
2:21.420–2:24.060
zh比较简单任务的调度方面
2:24.060–2:25.980
zh能够有一个非常快的响应
2:25.980–2:28.660
zh能够去在三种角色上
2:28.660–2:30.060
zh用不同的模型来实现
2:30.060–2:32.260
zh相当于用了一套方法啊
2:32.260–2:33.780
zh一套演化的方法
2:33.780–2:36.180
zh去探索出来一个路径
2:36.180–2:37.800
zh能够让这个模型知道
2:37.800–2:39.400
zh接下来这一步操作
2:39.400–2:41.000
zh应该让哪个模型
2:41.000–2:42.760
zh以一个什么样的身份
2:42.760–2:44.080
zh去参与下一步工作
2:44.080–2:45.400
zh比如说他们把模型
2:45.400–2:46.600
zh划分为三种角色
2:46.600–2:47.760
zh这个我们也之前讲过
2:47.760–2:48.940
zh最有效的三种角色
2:48.940–2:50.000
zh一种是Thinker
2:50.000–2:50.800
zh就是思考者
2:50.800–2:53.060
zh一种是这个执行者
2:53.060–2:53.920
zh就是Worker
2:53.920–2:55.400
zh另外一种是Verifier
2:55.400–2:56.520
zh就是验证者
2:56.520–2:58.100
zh一般我们说这三种角色
2:58.100–2:59.180
zh就可以起到一个
2:59.180–3:00.080
zh非常好的效果
3:00.080–3:00.980
zh那这个模型
3:00.980–3:02.340
zh就是一个0.6B的
3:02.340–3:03.160
zh一个小模型
3:03.160–3:06.260
zh就是在这个内部的状态上
3:06.260–3:07.060
zh再去识别
3:07.060–3:08.780
zh接下来通过上下文的感知
3:08.780–3:09.440
zh认为接下来
3:09.440–3:11.320
zh应该用什么样的模型
3:11.320–3:12.360
zh用一个什么样的角色
3:12.360–3:13.760
zh来去执行下一步工作
3:13.760–3:15.440
zh然后直接就让这个模型
3:15.440–3:15.880
zh开始工作
3:15.880–3:17.360
zh特别像是一个调度器
3:17.360–3:19.080
zh就如果类比成公司来说
3:19.080–3:20.920
zh它就像一个在生产线上
3:20.920–3:22.140
zh去排弯的一个经理
3:22.140–3:24.080
zh它有非常明确的
3:24.080–3:26.000
zh对下一步状态的一个感知
3:26.000–3:26.880
zh然后它就直接
3:26.880–3:27.760
zh想都没想
3:27.760–3:29.560
zh就直接执行了这样的操作
3:29.560–3:30.980
zh然后这是一条线
3:30.980–3:33.380
zh另外一条线是它另外一篇论文里讲的
3:33.380–3:34.400
zh叫Conductor
3:34.400–3:37.220
zh就是一个指挥家的角色
3:37.220–3:39.480
zh就有点像我们去做Multi Agent
3:39.480–3:41.700
zhSystem去协作
3:41.700–3:42.780
zh让多个模型
3:42.780–3:43.520
zh多个智能体
3:43.520–3:45.140
zh让它去分工协作
3:45.140–3:46.700
zh有一个复杂的任务
3:46.700–3:49.020
zh让它在这个复杂任务中做拆解
3:49.020–3:49.900
zh比如说
3:49.900–3:52.660
zh这个任务应该有几个Agent来完成
3:52.660–3:54.300
zh每一个Agent是什么角色
3:54.300–3:55.380
zh以及他们之间
3:55.380–3:57.180
zh应该是怎么样去信息交互
3:57.180–3:59.080
zh他们是一个什么样的凑谱结构
3:59.080–4:01.640
zh以及他们这个彼此之间
4:01.640–4:02.680
zh有哪个是PM
4:02.680–4:04.360
zh哪个是负责全局的
4:04.360–4:05.480
zh哪些是负责执行
4:05.480–4:06.440
zh哪些是负责验证的
4:06.440–4:08.040
zh就是也是要有一系列
4:08.040–4:09.600
zh非常明确的身份规划
4:09.600–4:12.560
zh就特别像他们强化训练出来了
4:12.560–4:14.360
zh一个大概7B的一个模型
4:14.360–4:17.660
zh去调动不同的模型来去解决问题
4:17.660–4:20.400
zh然后这个就特别像一个职业经理人
4:20.400–4:22.300
zh他有非常强的管理能力
4:22.300–4:25.420
zh相当于模型在通过强化学习的训练之后
4:25.420–4:26.460
zh我给模型激励
4:26.460–4:29.900
zh如果你要调度不同的模型产生一些比较好的结果的话
4:29.900–4:31.300
zh那我就给你激励
4:31.300–4:34.620
zh所以这个是非常有意思的一个方向
4:34.620–4:38.420
zh其实他们也是在这一次的论文中明确了
4:38.420–4:39.780
zh通过强化学习
4:39.780–4:43.640
zh确实是可以把模型的调度能力提升上去的
4:43.640–4:46.100
zh甚至是涌现出了一些超出以往
4:46.100–4:48.380
zh单一模型执行的能力
4:48.380–4:51.760
zh然后其实我们都知道像这样的一些能力
4:51.760–4:54.700
zh我们现在在Harness Engineering里面就是在做嘛
4:54.700–4:55.800
zh我们也在做编排
4:55.800–4:57.480
zh比如说在Workbody里面
4:57.480–5:01.340
zh我们可以有这个股票交易的这个专家
5:01.340–5:01.620
zh对吧
5:01.620–5:03.200
zh他其实就是在用Multi Agent
5:03.200–5:06.700
zh来去实现一些更好的一些判断
5:06.700–5:07.880
zh比如说有人唱空
5:07.880–5:09.020
zh有人唱多
5:09.020–5:11.360
zh有人对这个基本面做分析
5:11.360–5:12.340
zh有人对鱼形做分析
5:12.340–5:13.980
zh就是他不同的模型
5:13.980–5:15.700
zh他负责的方向是不一样的
5:15.700–5:20.140
zh但是他们是用了一个相当于是训练一个模型
5:20.140–5:22.500
zh去拥有这个调度能力的这种方式
5:22.500–5:26.160
zh相当于让Harness的这个能力在模型中进行了沉淀
5:26.160–5:30.100
zh而且他也不光是训练的这些任务他能够做
5:30.100–5:32.380
zh他还泛化出来了一些其他的能力
5:32.380–5:36.540
zh就是他可以在没见过的任务上也产出同样很好的一个水平
5:36.540–5:39.080
zh所以他是一个非常有意思的一个结构
5:39.080–5:42.040
zh我们从他那个官网上的模型结构图上
5:42.040–5:44.720
zh其实可以看到他就是一个复古这个模型
5:44.720–5:47.520
zh他可以access就可以接触到
5:47.520–5:48.660
zh有的是开源模型
5:48.660–5:49.580
zh有的是必源模型
5:49.580–5:51.800
zh同样他也可以接触到他自己
5:51.800–5:54.440
zh他是一个地规的一个架构
5:54.440–5:58.080
zh然后所以这条方法他们评估下来
5:58.080–6:00.780
zh发现不光是在这些场景上
6:00.780–6:03.060
zhtrading比如说做交易的评测
6:03.060–6:05.340
zh然后看一段时间之后
6:05.340–6:09.100
zh哪一个交易模型的这个带来的交易收益更高
6:09.100–6:09.960
zh对吧
6:09.960–6:12.640
zh或者是让他解一个谜题
6:12.640–6:13.720
zh做一个魔方
6:13.720–6:15.340
zh然后恢复一个魔方
6:15.340–6:17.320
zh哪个效果会更快
6:17.320–6:18.520
zh哪一个步数更少
6:18.520–6:20.020
zh相当于一系列的测试中
6:20.020–6:23.520
zh发现这种方式确实能够起到一个很好的效果
6:23.520–6:25.200
zh那这个意味着什么呢
6:25.200–6:29.200
zh我觉得就是很容易类比和联想到我们人类社会上
6:29.200–6:32.140
zh就是我们每个人其实都有自己不同的能力
6:32.140–6:35.900
zh有的人擅长写代码 有的人擅长执行
6:35.900–6:40.520
zh有的人擅长写文章 那不同的模型也像我们人一样有不同的能力
6:40.520–6:45.900
zh那通过这种管理者就是有一个模型专门拥有了这个管理能力
6:45.900–6:49.160
zh我去协调这些模型能够产生一个非常好的效果
6:49.160–6:51.700
zh对 然后这个是就是很有意思了
6:51.700–6:53.440
zh就是因为我是学城市规划的
6:53.440–6:57.400
zh然后我对这种组织这个叫集体智慧
6:57.400–7:00.120
zh集体智能涌现就非常感兴趣
7:00.120–7:04.200
zh而且它这个方向也正好契合了我们前一段时间写的
7:04.200–7:06.400
zh就是从超级个体到超级团队
7:06.400–7:09.600
zh为什么有了一个一个的天才模型之后
7:09.600–7:11.400
zh它依然需要团队 对吧
7:11.400–7:13.860
zh有了这个要数据中心中的天才之国
7:13.860–7:16.700
zh那为什么还需要这个不同模型之间的协作
7:16.700–7:19.540
zh就是因为协作还是可以去拉高上线的
7:19.540–7:22.740
zh而且这次的这个论文也是发现了
7:22.740–7:24.760
zh在强化学习的这个训练方法之下
7:24.760–7:27.100
zh这种协调能力也可以被训练出来
7:27.100–7:28.560
zh这就带来了两个问题
7:28.560–7:32.020
zh一个呢就是那harness还重不重要
7:32.020–7:34.160
zh对吧 比如说我们有未来模型
7:34.160–7:36.220
zh可以吸收到这些模型的编排之后
7:36.220–7:37.860
zh那我们还要不要有harness
7:37.860–7:40.640
zh我的观点是它两个都同样重要
7:40.640–7:43.900
zh就像你有大组织也有出放公司一样
7:43.900–7:45.800
zh就是还是有非常非常多的场景
7:45.800–7:47.720
zh需要去灵活的探索
7:47.720–7:50.400
zh就可能还没有被吸收到模型的能力里面
7:50.400–7:53.220
zh所以我认为未来的每一个软件公司
7:53.220–7:55.880
zh在未来可能都会变成一个模型公司
7:55.880–7:58.960
zh这个模型公司就是专门去为特定的场景
7:58.960–8:00.180
zh特定的数据
8:00.180–8:02.680
zh然后特定的条件去做优化的
8:02.680–8:05.420
zh如果你能够在一个特定的场景下
8:05.420–8:08.780
zh去调用非常多的模型去解决场景的问题
8:08.780–8:12.300
zh能够在效率成本还有速度之间
8:12.300–8:14.180
zh取得一个很好的平衡的话
8:14.180–8:16.340
zh那你就是能够贡献价值的
8:16.340–8:18.960
zh未来比如说像富库这个公司
8:18.960–8:21.940
zh它可以提供一套通用的这种conductor
8:21.940–8:23.200
zh就是模型编排能力
8:23.200–8:24.720
zh但是每一个软件公司
8:24.720–8:26.320
zh因为你对场景数据最了解
8:26.320–8:28.460
zh你对这个模型的评测最了解
8:28.460–8:31.360
zh那你是可以在这个场景中最有发言权的
8:31.360–8:33.020
zh所以我觉得这个肯定是一个
8:33.020–8:35.160
zh就是harness和这种模型端
8:35.160–8:36.640
zh它都会同时存在
8:36.640–8:37.320
zh还有一个问题
8:37.320–8:39.640
zh那我们既然说集体智慧这么重要了
8:39.640–8:42.480
zh那单个模型的智能还重不重要
8:42.480–8:43.780
zh我觉得依然是重要的
8:43.780–8:47.320
zh因为就是你把一个天才和一堆普通人放在一起
8:47.320–8:50.100
zh发挥的价值和把一堆天才聚集在一起
8:50.100–8:51.080
zh发挥的价值
8:51.080–8:54.360
zh那可是差的不只是一倍两倍三倍
8:54.360–8:54.600
zh对吧
8:54.600–8:56.300
zh那可能是十倍几十倍的差异
8:56.300–8:58.960
zh所以像那个阿茂Day他说的
8:58.960–9:01.820
zh未来在这个数据中心中的天才之国
9:01.820–9:04.640
zh就是当这个数据中心中有很多的模型
9:04.640–9:05.760
zh它都是天才的时候
9:05.760–9:08.100
zh那产生的这个效应和效果
9:08.100–9:10.020
zh那其实是超乎想象的
9:10.020–9:12.760
zh所以我觉得未来可能这个技术路线
9:12.760–9:16.280
zh不光是在日本的这家公司里会去使用
9:16.280–9:18.480
zh就是像前沿模型这些公司
9:18.480–9:19.600
zh他们也会去使用
9:19.600–9:23.380
zh他们也会去开始这个组织智能的探索
9:23.380–9:24.920
zh其实像OpenAI之前
9:24.920–9:27.060
zh把HCI的实现
9:27.060–9:28.640
zh划分了五个等级
9:28.640–9:31.000
zh那最后一等级就是
9:31.000–9:32.460
enOrganizer
9:32.460–9:34.180
zh就是协调者组织者
9:34.180–9:37.120
zh那我觉得这一次的这个Takana AI
9:37.120–9:38.960
zh确实是在这个方向上
9:38.960–9:40.600
zh得到了一个很好的突破
9:40.600–9:43.120
zh就是验证了这个方向也是可行的
9:43.120–9:46.280
zh所以我觉得接下来对我们每个人来说
9:46.280–9:48.840
zh就是你费劲巴拉的去写
9:48.840–9:51.500
zhMulti Agent的这些约束
9:51.500–9:53.760
zh其实不如直接拿一个模型来去使用
9:53.760–9:56.180
zh这也并不是说我们自己就没那么重要了
9:56.180–9:58.560
zh而是说我们的时间
9:58.560–10:00.180
zh注意力可以解放在更多
10:00.180–10:03.180
zh我们更擅长的这种端到端的
10:03.180–10:05.100
zh以及线下的一些事情上去
10:05.100–10:05.720
zh对
10:05.720–10:06.980
zh机会还是存在的
10:06.980–10:08.800
zh只是说现在我们有更多的
10:08.800–10:10.160
zh模型公司的研发
10:10.160–10:12.360
zh可以把人类的注意力更好的解脱出来
10:12.360–10:14.140
zh我就做这些推演吧
10:14.140–10:14.900
zh拜拜
10:14.900–10:15.580
zh拜拜
10:15.580–10:15.900
zh拜拜
0:00.000–0:01.240
哈喽下班了
0:01.240–0:04.300
好久没有看到让人眼前一亮的研究了
0:04.300–0:08.040
最近看到日本的一家AI公司叫Sakana AI
0:08.040–0:11.540
他们最新提出了一个模型叫Fugu
0:11.540–0:13.580
就是河豚的意思
0:13.580–0:15.540
然后我觉得非常有意思
0:15.540–0:19.440
它不是一个特别特别强的一个天才模型
0:19.440–0:21.220
而是一个集体智慧
0:21.220–0:25.840
靠训练模型的管理能力强化出来的一个全新的模型
0:25.840–0:28.480
然后他们这个公司很有意思
0:28.480–0:31.660
因为日本的AI感觉一直以来没有什么声音
0:31.660–0:35.520
但是可能Sakana AI是它唯一一家
0:35.520–0:38.380
我觉得可能是最有希望的一家AI公司
0:38.380–0:40.440
因为两个创始人
0:40.440–0:42.640
一个是从Google Brain出来的
0:42.640–0:44.360
以前就是做复杂系统研究的
0:44.360–0:49.060
另外一个是Transformer的八位作者之一
0:49.060–0:52.580
就是Attention is all you need的那篇论文的八位作者之一
0:52.580–0:55.620
他们两个有一个特别独特的审美品位
0:55.620–0:58.960
他们一直认为可以从自然中学习和借鉴
0:58.960–1:01.380
比如说从这种渔群啊
1:01.380–1:02.660
这个风群啊
1:02.660–1:05.720
从自然界中它的这个自组织
1:05.720–1:06.840
包括涌现
1:06.840–1:07.900
集体智慧
1:07.900–1:10.880
这些层面去给模型的研发一些启示
1:10.880–1:14.620
所以他们一直以来就是去探索的这个方向
1:14.620–1:16.700
就是在去看这些模型
1:16.700–1:19.040
能不能通过彼此之间合作
1:19.040–1:21.800
就像这个基因片段之间的合作一样
1:21.800–1:24.080
能不能找到一些新的机会和方向
1:24.080–1:27.240
所以他们这次推出的FUGU这个模型呢
1:27.240–1:30.040
就是用了集体智慧的这种意思啊
1:30.040–1:31.840
而且取得了非常好的效果
1:31.840–1:33.800
他们最近的这个打榜啊
1:33.800–1:36.960
在各种评测上都非常棒
1:36.960–1:38.360
都超过了OPUS 4.8
1:38.360–1:39.480
就是它不是一个模型
1:39.480–1:42.760
而是一个模型强化出来的一些管理能力
1:42.760–1:44.640
就相当于是用这一个模型
1:44.640–1:48.040
它可以组织调度开源的和避源的模型
1:48.040–1:48.980
来协同工作
1:48.980–1:51.220
来实现的一种非常好的结果
1:51.220–1:52.900
那比如说在这个榜单上
1:52.900–1:54.700
你在这种编程的榜单上
1:54.700–1:56.480
甚至超过了FUGU5
1:56.480–1:58.960
然后有的榜单呢
1:58.960–2:00.940
跟NESOS处于同一个水平
2:00.940–2:03.860
包括Humanity Last Exam上
2:03.860–2:05.640
也超过Gemini 3.1 Pro
2:05.640–2:07.120
这个模型背后啊
2:07.120–2:08.820
实际上是由两篇论文
2:08.820–2:09.820
去做支撑的
2:09.820–2:11.360
两个论文探索的
2:11.360–2:12.540
其实是不同的方向
2:12.540–2:14.980
一篇呢是叫Trinity
2:14.980–2:16.660
就是三文一体的那个Trinity
2:16.660–2:18.180
它讲的呢
2:18.180–2:19.660
就是说去探索一下
2:19.660–2:21.420
模型能不能在一个
2:21.420–2:24.060
比较简单任务的调度方面
2:24.060–2:25.980
能够有一个非常快的响应
2:25.980–2:28.660
能够去在三种角色上
2:28.660–2:30.060
用不同的模型来实现
2:30.060–2:32.260
相当于用了一套方法啊
2:32.260–2:33.780
一套演化的方法
2:33.780–2:36.180
去探索出来一个路径
2:36.180–2:37.800
能够让这个模型知道
2:37.800–2:39.400
接下来这一步操作
2:39.400–2:41.000
应该让哪个模型
2:41.000–2:42.760
以一个什么样的身份
2:42.760–2:44.080
去参与下一步工作
2:44.080–2:45.400
比如说他们把模型
2:45.400–2:46.600
划分为三种角色
2:46.600–2:47.760
这个我们也之前讲过
2:47.760–2:48.940
最有效的三种角色
2:48.940–2:50.000
一种是Thinker
2:50.000–2:50.800
就是思考者
2:50.800–2:53.060
一种是这个执行者
2:53.060–2:53.920
就是Worker
2:53.920–2:55.400
另外一种是Verifier
2:55.400–2:56.520
就是验证者
2:56.520–2:58.100
一般我们说这三种角色
2:58.100–2:59.180
就可以起到一个
2:59.180–3:00.080
非常好的效果
3:00.080–3:00.980
那这个模型
3:00.980–3:02.340
就是一个0.6B的
3:02.340–3:03.160
一个小模型
3:03.160–3:06.260
就是在这个内部的状态上
3:06.260–3:07.060
再去识别
3:07.060–3:08.780
接下来通过上下文的感知
3:08.780–3:09.440
认为接下来
3:09.440–3:11.320
应该用什么样的模型
3:11.320–3:12.360
用一个什么样的角色
3:12.360–3:13.760
来去执行下一步工作
3:13.760–3:15.440
然后直接就让这个模型
3:15.440–3:15.880
开始工作
3:15.880–3:17.360
特别像是一个调度器
3:17.360–3:19.080
就如果类比成公司来说
3:19.080–3:20.920
它就像一个在生产线上
3:20.920–3:22.140
去排弯的一个经理
3:22.140–3:24.080
它有非常明确的
3:24.080–3:26.000
对下一步状态的一个感知
3:26.000–3:26.880
然后它就直接
3:26.880–3:27.760
想都没想
3:27.760–3:29.560
就直接执行了这样的操作
3:29.560–3:30.980
然后这是一条线
3:30.980–3:33.380
另外一条线是它另外一篇论文里讲的
3:33.380–3:34.400
叫Conductor
3:34.400–3:37.220
就是一个指挥家的角色
3:37.220–3:39.480
就有点像我们去做Multi Agent
3:39.480–3:41.700
System去协作
3:41.700–3:42.780
让多个模型
3:42.780–3:43.520
多个智能体
3:43.520–3:45.140
让它去分工协作
3:45.140–3:46.700
有一个复杂的任务
3:46.700–3:49.020
让它在这个复杂任务中做拆解
3:49.020–3:49.900
比如说
3:49.900–3:52.660
这个任务应该有几个Agent来完成
3:52.660–3:54.300
每一个Agent是什么角色
3:54.300–3:55.380
以及他们之间
3:55.380–3:57.180
应该是怎么样去信息交互
3:57.180–3:59.080
他们是一个什么样的凑谱结构
3:59.080–4:01.640
以及他们这个彼此之间
4:01.640–4:02.680
有哪个是PM
4:02.680–4:04.360
哪个是负责全局的
4:04.360–4:05.480
哪些是负责执行
4:05.480–4:06.440
哪些是负责验证的
4:06.440–4:08.040
就是也是要有一系列
4:08.040–4:09.600
非常明确的身份规划
4:09.600–4:12.560
就特别像他们强化训练出来了
4:12.560–4:14.360
一个大概7B的一个模型
4:14.360–4:17.660
去调动不同的模型来去解决问题
4:17.660–4:20.400
然后这个就特别像一个职业经理人
4:20.400–4:22.300
他有非常强的管理能力
4:22.300–4:25.420
相当于模型在通过强化学习的训练之后
4:25.420–4:26.460
我给模型激励
4:26.460–4:29.900
如果你要调度不同的模型产生一些比较好的结果的话
4:29.900–4:31.300
那我就给你激励
4:31.300–4:34.620
所以这个是非常有意思的一个方向
4:34.620–4:38.420
其实他们也是在这一次的论文中明确了
4:38.420–4:39.780
通过强化学习
4:39.780–4:43.640
确实是可以把模型的调度能力提升上去的
4:43.640–4:46.100
甚至是涌现出了一些超出以往
4:46.100–4:48.380
单一模型执行的能力
4:48.380–4:51.760
然后其实我们都知道像这样的一些能力
4:51.760–4:54.700
我们现在在Harness Engineering里面就是在做嘛
4:54.700–4:55.800
我们也在做编排
4:55.800–4:57.480
比如说在Workbody里面
4:57.480–5:01.340
我们可以有这个股票交易的这个专家
5:01.340–5:01.620
对吧
5:01.620–5:03.200
他其实就是在用Multi Agent
5:03.200–5:06.700
来去实现一些更好的一些判断
5:06.700–5:07.880
比如说有人唱空
5:07.880–5:09.020
有人唱多
5:09.020–5:11.360
有人对这个基本面做分析
5:11.360–5:12.340
有人对鱼形做分析
5:12.340–5:13.980
就是他不同的模型
5:13.980–5:15.700
他负责的方向是不一样的
5:15.700–5:20.140
但是他们是用了一个相当于是训练一个模型
5:20.140–5:22.500
去拥有这个调度能力的这种方式
5:22.500–5:26.160
相当于让Harness的这个能力在模型中进行了沉淀
5:26.160–5:30.100
而且他也不光是训练的这些任务他能够做
5:30.100–5:32.380
他还泛化出来了一些其他的能力
5:32.380–5:36.540
就是他可以在没见过的任务上也产出同样很好的一个水平
5:36.540–5:39.080
所以他是一个非常有意思的一个结构
5:39.080–5:42.040
我们从他那个官网上的模型结构图上
5:42.040–5:44.720
其实可以看到他就是一个复古这个模型
5:44.720–5:47.520
他可以access就可以接触到
5:47.520–5:48.660
有的是开源模型
5:48.660–5:49.580
有的是必源模型
5:49.580–5:51.800
同样他也可以接触到他自己
5:51.800–5:54.440
他是一个地规的一个架构
5:54.440–5:58.080
然后所以这条方法他们评估下来
5:58.080–6:00.780
发现不光是在这些场景上
6:00.780–6:03.060
trading比如说做交易的评测
6:03.060–6:05.340
然后看一段时间之后
6:05.340–6:09.100
哪一个交易模型的这个带来的交易收益更高
6:09.100–6:09.960
对吧
6:09.960–6:12.640
或者是让他解一个谜题
6:12.640–6:13.720
做一个魔方
6:13.720–6:15.340
然后恢复一个魔方
6:15.340–6:17.320
哪个效果会更快
6:17.320–6:18.520
哪一个步数更少
6:18.520–6:20.020
相当于一系列的测试中
6:20.020–6:23.520
发现这种方式确实能够起到一个很好的效果
6:23.520–6:25.200
那这个意味着什么呢
6:25.200–6:29.200
我觉得就是很容易类比和联想到我们人类社会上
6:29.200–6:32.140
就是我们每个人其实都有自己不同的能力
6:32.140–6:35.900
有的人擅长写代码 有的人擅长执行
6:35.900–6:40.520
有的人擅长写文章 那不同的模型也像我们人一样有不同的能力
6:40.520–6:45.900
那通过这种管理者就是有一个模型专门拥有了这个管理能力
6:45.900–6:49.160
我去协调这些模型能够产生一个非常好的效果
6:49.160–6:51.700
对 然后这个是就是很有意思了
6:51.700–6:53.440
就是因为我是学城市规划的
6:53.440–6:57.400
然后我对这种组织这个叫集体智慧
6:57.400–7:00.120
集体智能涌现就非常感兴趣
7:00.120–7:04.200
而且它这个方向也正好契合了我们前一段时间写的
7:04.200–7:06.400
就是从超级个体到超级团队
7:06.400–7:09.600
为什么有了一个一个的天才模型之后
7:09.600–7:11.400
它依然需要团队 对吧
7:11.400–7:13.860
有了这个要数据中心中的天才之国
7:13.860–7:16.700
那为什么还需要这个不同模型之间的协作
7:16.700–7:19.540
就是因为协作还是可以去拉高上线的
7:19.540–7:22.740
而且这次的这个论文也是发现了
7:22.740–7:24.760
在强化学习的这个训练方法之下
7:24.760–7:27.100
这种协调能力也可以被训练出来
7:27.100–7:28.560
这就带来了两个问题
7:28.560–7:32.020
一个呢就是那harness还重不重要
7:32.020–7:34.160
对吧 比如说我们有未来模型
7:34.160–7:36.220
可以吸收到这些模型的编排之后
7:36.220–7:37.860
那我们还要不要有harness
7:37.860–7:40.640
我的观点是它两个都同样重要
7:40.640–7:43.900
就像你有大组织也有出放公司一样
7:43.900–7:45.800
就是还是有非常非常多的场景
7:45.800–7:47.720
需要去灵活的探索
7:47.720–7:50.400
就可能还没有被吸收到模型的能力里面
7:50.400–7:53.220
所以我认为未来的每一个软件公司
7:53.220–7:55.880
在未来可能都会变成一个模型公司
7:55.880–7:58.960
这个模型公司就是专门去为特定的场景
7:58.960–8:00.180
特定的数据
8:00.180–8:02.680
然后特定的条件去做优化的
8:02.680–8:05.420
如果你能够在一个特定的场景下
8:05.420–8:08.780
去调用非常多的模型去解决场景的问题
8:08.780–8:12.300
能够在效率成本还有速度之间
8:12.300–8:14.180
取得一个很好的平衡的话
8:14.180–8:16.340
那你就是能够贡献价值的
8:16.340–8:18.960
未来比如说像富库这个公司
8:18.960–8:21.940
它可以提供一套通用的这种conductor
8:21.940–8:23.200
就是模型编排能力
8:23.200–8:24.720
但是每一个软件公司
8:24.720–8:26.320
因为你对场景数据最了解
8:26.320–8:28.460
你对这个模型的评测最了解
8:28.460–8:31.360
那你是可以在这个场景中最有发言权的
8:31.360–8:33.020
所以我觉得这个肯定是一个
8:33.020–8:35.160
就是harness和这种模型端
8:35.160–8:36.640
它都会同时存在
8:36.640–8:37.320
还有一个问题
8:37.320–8:39.640
那我们既然说集体智慧这么重要了
8:39.640–8:42.480
那单个模型的智能还重不重要
8:42.480–8:43.780
我觉得依然是重要的
8:43.780–8:47.320
因为就是你把一个天才和一堆普通人放在一起
8:47.320–8:50.100
发挥的价值和把一堆天才聚集在一起
8:50.100–8:51.080
发挥的价值
8:51.080–8:54.360
那可是差的不只是一倍两倍三倍
8:54.360–8:54.600
对吧
8:54.600–8:56.300
那可能是十倍几十倍的差异
8:56.300–8:58.960
所以像那个阿茂Day他说的
8:58.960–9:01.820
未来在这个数据中心中的天才之国
9:01.820–9:04.640
就是当这个数据中心中有很多的模型
9:04.640–9:05.760
它都是天才的时候
9:05.760–9:08.100
那产生的这个效应和效果
9:08.100–9:10.020
那其实是超乎想象的
9:10.020–9:12.760
所以我觉得未来可能这个技术路线
9:12.760–9:16.280
不光是在日本的这家公司里会去使用
9:16.280–9:18.480
就是像前沿模型这些公司
9:18.480–9:19.600
他们也会去使用
9:19.600–9:23.380
他们也会去开始这个组织智能的探索
9:23.380–9:24.920
其实像OpenAI之前
9:24.920–9:27.060
把HCI的实现
9:27.060–9:28.640
划分了五个等级
9:28.640–9:31.000
那最后一等级就是
9:31.000–9:32.460
Organizer
9:32.460–9:34.180
就是协调者组织者
9:34.180–9:37.120
那我觉得这一次的这个Takana AI
9:37.120–9:38.960
确实是在这个方向上
9:38.960–9:40.600
得到了一个很好的突破
9:40.600–9:43.120
就是验证了这个方向也是可行的
9:43.120–9:46.280
所以我觉得接下来对我们每个人来说
9:46.280–9:48.840
就是你费劲巴拉的去写
9:48.840–9:51.500
Multi Agent的这些约束
9:51.500–9:53.760
其实不如直接拿一个模型来去使用
9:53.760–9:56.180
这也并不是说我们自己就没那么重要了
9:56.180–9:58.560
而是说我们的时间
9:58.560–10:00.180
注意力可以解放在更多
10:00.180–10:03.180
我们更擅长的这种端到端的
10:03.180–10:05.100
以及线下的一些事情上去
10:05.100–10:05.720
对
10:05.720–10:06.980
机会还是存在的
10:06.980–10:08.800
只是说现在我们有更多的
10:08.800–10:10.160
模型公司的研发
10:10.160–10:12.360
可以把人类的注意力更好的解脱出来
10:12.360–10:14.140
我就做这些推演吧
10:14.140–10:14.900
拜拜
10:14.900–10:15.580
拜拜
10:15.580–10:15.900
拜拜
0:00.000–0:01.240
zh哈喽下班了
哈喽下班了
0:01.240–0:04.300
zh好久没有看到让人眼前一亮的研究了
好久没有看到让人眼前一亮的研究了
0:04.300–0:08.040
zh最近看到日本的一家AI公司叫Sakana AI
最近看到日本的一家AI公司叫Sakana AI
0:08.040–0:11.540
zh他们最新提出了一个模型叫Fugu
他们最新提出了一个模型叫Fugu
0:11.540–0:13.580
zh就是河豚的意思
就是河豚的意思
0:13.580–0:15.540
zh然后我觉得非常有意思
然后我觉得非常有意思
0:15.540–0:19.440
zh它不是一个特别特别强的一个天才模型
它不是一个特别特别强的一个天才模型
0:19.440–0:21.220
zh而是一个集体智慧
而是一个集体智慧
0:21.220–0:25.840
zh靠训练模型的管理能力强化出来的一个全新的模型
靠训练模型的管理能力强化出来的一个全新的模型
0:25.840–0:28.480
zh然后他们这个公司很有意思
然后他们这个公司很有意思
0:28.480–0:31.660
zh因为日本的AI感觉一直以来没有什么声音
因为日本的AI感觉一直以来没有什么声音
0:31.660–0:35.520
zh但是可能Sakana AI是它唯一一家
但是可能Sakana AI是它唯一一家
0:35.520–0:38.380
zh我觉得可能是最有希望的一家AI公司
我觉得可能是最有希望的一家AI公司
0:38.380–0:40.440
zh因为两个创始人
因为两个创始人
0:40.440–0:42.640
zh一个是从Google Brain出来的
一个是从Google Brain出来的
0:42.640–0:44.360
zh以前就是做复杂系统研究的
以前就是做复杂系统研究的
0:44.360–0:49.060
zh另外一个是Transformer的八位作者之一
另外一个是Transformer的八位作者之一
0:49.060–0:52.580
zh就是Attention is all you need的那篇论文的八位作者之一
就是Attention is all you need的那篇论文的八位作者之一
0:52.580–0:55.620
zh他们两个有一个特别独特的审美品位
他们两个有一个特别独特的审美品位
0:55.620–0:58.960
zh他们一直认为可以从自然中学习和借鉴
他们一直认为可以从自然中学习和借鉴
0:58.960–1:01.380
zh比如说从这种渔群啊
比如说从这种渔群啊
1:01.380–1:02.660
zh这个风群啊
这个风群啊
1:02.660–1:05.720
zh从自然界中它的这个自组织
从自然界中它的这个自组织
1:05.720–1:06.840
zh包括涌现
包括涌现
1:06.840–1:07.900
zh集体智慧
集体智慧
1:07.900–1:10.880
zh这些层面去给模型的研发一些启示
这些层面去给模型的研发一些启示
1:10.880–1:14.620
zh所以他们一直以来就是去探索的这个方向
所以他们一直以来就是去探索的这个方向
1:14.620–1:16.700
zh就是在去看这些模型
就是在去看这些模型
1:16.700–1:19.040
zh能不能通过彼此之间合作
能不能通过彼此之间合作
1:19.040–1:21.800
zh就像这个基因片段之间的合作一样
就像这个基因片段之间的合作一样
1:21.800–1:24.080
zh能不能找到一些新的机会和方向
能不能找到一些新的机会和方向
1:24.080–1:27.240
zh所以他们这次推出的FUGU这个模型呢
所以他们这次推出的FUGU这个模型呢
1:27.240–1:30.040
zh就是用了集体智慧的这种意思啊
就是用了集体智慧的这种意思啊
1:30.040–1:31.840
zh而且取得了非常好的效果
而且取得了非常好的效果
1:31.840–1:33.800
zh他们最近的这个打榜啊
他们最近的这个打榜啊
1:33.800–1:36.960
zh在各种评测上都非常棒
在各种评测上都非常棒
1:36.960–1:38.360
zh都超过了OPUS 4.8
都超过了OPUS 4.8
1:38.360–1:39.480
zh就是它不是一个模型
就是它不是一个模型
1:39.480–1:42.760
zh而是一个模型强化出来的一些管理能力
而是一个模型强化出来的一些管理能力
1:42.760–1:44.640
zh就相当于是用这一个模型
就相当于是用这一个模型
1:44.640–1:48.040
zh它可以组织调度开源的和避源的模型
它可以组织调度开源的和避源的模型
1:48.040–1:48.980
zh来协同工作
来协同工作
1:48.980–1:51.220
zh来实现的一种非常好的结果
来实现的一种非常好的结果
1:51.220–1:52.900
zh那比如说在这个榜单上
那比如说在这个榜单上
1:52.900–1:54.700
zh你在这种编程的榜单上
你在这种编程的榜单上
1:54.700–1:56.480
zh甚至超过了FUGU5
甚至超过了FUGU5
1:56.480–1:58.960
zh然后有的榜单呢
然后有的榜单呢
1:58.960–2:00.940
zh跟NESOS处于同一个水平
跟NESOS处于同一个水平
2:00.940–2:03.860
zh包括Humanity Last Exam上
包括Humanity Last Exam上
2:03.860–2:05.640
zh也超过Gemini 3.1 Pro
也超过Gemini 3.1 Pro
2:05.640–2:07.120
zh这个模型背后啊
这个模型背后啊
2:07.120–2:08.820
zh实际上是由两篇论文
实际上是由两篇论文
2:08.820–2:09.820
zh去做支撑的
去做支撑的
2:09.820–2:11.360
zh两个论文探索的
两个论文探索的
2:11.360–2:12.540
zh其实是不同的方向
其实是不同的方向
2:12.540–2:14.980
zh一篇呢是叫Trinity
一篇呢是叫Trinity
2:14.980–2:16.660
zh就是三文一体的那个Trinity
就是三文一体的那个Trinity
2:16.660–2:18.180
zh它讲的呢
它讲的呢
2:18.180–2:19.660
zh就是说去探索一下
就是说去探索一下
2:19.660–2:21.420
zh模型能不能在一个
模型能不能在一个
2:21.420–2:24.060
zh比较简单任务的调度方面
比较简单任务的调度方面
2:24.060–2:25.980
zh能够有一个非常快的响应
能够有一个非常快的响应
2:25.980–2:28.660
zh能够去在三种角色上
能够去在三种角色上
2:28.660–2:30.060
zh用不同的模型来实现
用不同的模型来实现
2:30.060–2:32.260
zh相当于用了一套方法啊
相当于用了一套方法啊
2:32.260–2:33.780
zh一套演化的方法
一套演化的方法
2:33.780–2:36.180
zh去探索出来一个路径
去探索出来一个路径
2:36.180–2:37.800
zh能够让这个模型知道
能够让这个模型知道
2:37.800–2:39.400
zh接下来这一步操作
接下来这一步操作
2:39.400–2:41.000
zh应该让哪个模型
应该让哪个模型
2:41.000–2:42.760
zh以一个什么样的身份
以一个什么样的身份
2:42.760–2:44.080
zh去参与下一步工作
去参与下一步工作
2:44.080–2:45.400
zh比如说他们把模型
比如说他们把模型
2:45.400–2:46.600
zh划分为三种角色
划分为三种角色
2:46.600–2:47.760
zh这个我们也之前讲过
这个我们也之前讲过
2:47.760–2:48.940
zh最有效的三种角色
最有效的三种角色
2:48.940–2:50.000
zh一种是Thinker
一种是Thinker
2:50.000–2:50.800
zh就是思考者
就是思考者
2:50.800–2:53.060
zh一种是这个执行者
一种是这个执行者
2:53.060–2:53.920
zh就是Worker
就是Worker
2:53.920–2:55.400
zh另外一种是Verifier
另外一种是Verifier
2:55.400–2:56.520
zh就是验证者
就是验证者
2:56.520–2:58.100
zh一般我们说这三种角色
一般我们说这三种角色
2:58.100–2:59.180
zh就可以起到一个
就可以起到一个
2:59.180–3:00.080
zh非常好的效果
非常好的效果
3:00.080–3:00.980
zh那这个模型
那这个模型
3:00.980–3:02.340
zh就是一个0.6B的
就是一个0.6B的
3:02.340–3:03.160
zh一个小模型
一个小模型
3:03.160–3:06.260
zh就是在这个内部的状态上
就是在这个内部的状态上
3:06.260–3:07.060
zh再去识别
再去识别
3:07.060–3:08.780
zh接下来通过上下文的感知
接下来通过上下文的感知
3:08.780–3:09.440
zh认为接下来
认为接下来
3:09.440–3:11.320
zh应该用什么样的模型
应该用什么样的模型
3:11.320–3:12.360
zh用一个什么样的角色
用一个什么样的角色
3:12.360–3:13.760
zh来去执行下一步工作
来去执行下一步工作
3:13.760–3:15.440
zh然后直接就让这个模型
然后直接就让这个模型
3:15.440–3:15.880
zh开始工作
开始工作
3:15.880–3:17.360
zh特别像是一个调度器
特别像是一个调度器
3:17.360–3:19.080
zh就如果类比成公司来说
就如果类比成公司来说
3:19.080–3:20.920
zh它就像一个在生产线上
它就像一个在生产线上
3:20.920–3:22.140
zh去排弯的一个经理
去排弯的一个经理
3:22.140–3:24.080
zh它有非常明确的
它有非常明确的
3:24.080–3:26.000
zh对下一步状态的一个感知
对下一步状态的一个感知
3:26.000–3:26.880
zh然后它就直接
然后它就直接
3:26.880–3:27.760
zh想都没想
想都没想
3:27.760–3:29.560
zh就直接执行了这样的操作
就直接执行了这样的操作
3:29.560–3:30.980
zh然后这是一条线
然后这是一条线
3:30.980–3:33.380
zh另外一条线是它另外一篇论文里讲的
另外一条线是它另外一篇论文里讲的
3:33.380–3:34.400
zh叫Conductor
叫Conductor
3:34.400–3:37.220
zh就是一个指挥家的角色
就是一个指挥家的角色
3:37.220–3:39.480
zh就有点像我们去做Multi Agent
就有点像我们去做Multi Agent
3:39.480–3:41.700
zhSystem去协作
System去协作
3:41.700–3:42.780
zh让多个模型
让多个模型
3:42.780–3:43.520
zh多个智能体
多个智能体
3:43.520–3:45.140
zh让它去分工协作
让它去分工协作
3:45.140–3:46.700
zh有一个复杂的任务
有一个复杂的任务
3:46.700–3:49.020
zh让它在这个复杂任务中做拆解
让它在这个复杂任务中做拆解
3:49.020–3:49.900
zh比如说
比如说
3:49.900–3:52.660
zh这个任务应该有几个Agent来完成
这个任务应该有几个Agent来完成
3:52.660–3:54.300
zh每一个Agent是什么角色
每一个Agent是什么角色
3:54.300–3:55.380
zh以及他们之间
以及他们之间
3:55.380–3:57.180
zh应该是怎么样去信息交互
应该是怎么样去信息交互
3:57.180–3:59.080
zh他们是一个什么样的凑谱结构
他们是一个什么样的凑谱结构
3:59.080–4:01.640
zh以及他们这个彼此之间
以及他们这个彼此之间
4:01.640–4:02.680
zh有哪个是PM
有哪个是PM
4:02.680–4:04.360
zh哪个是负责全局的
哪个是负责全局的
4:04.360–4:05.480
zh哪些是负责执行
哪些是负责执行
4:05.480–4:06.440
zh哪些是负责验证的
哪些是负责验证的
4:06.440–4:08.040
zh就是也是要有一系列
就是也是要有一系列
4:08.040–4:09.600
zh非常明确的身份规划
非常明确的身份规划
4:09.600–4:12.560
zh就特别像他们强化训练出来了
就特别像他们强化训练出来了
4:12.560–4:14.360
zh一个大概7B的一个模型
一个大概7B的一个模型
4:14.360–4:17.660
zh去调动不同的模型来去解决问题
去调动不同的模型来去解决问题
4:17.660–4:20.400
zh然后这个就特别像一个职业经理人
然后这个就特别像一个职业经理人
4:20.400–4:22.300
zh他有非常强的管理能力
他有非常强的管理能力
4:22.300–4:25.420
zh相当于模型在通过强化学习的训练之后
相当于模型在通过强化学习的训练之后
4:25.420–4:26.460
zh我给模型激励
我给模型激励
4:26.460–4:29.900
zh如果你要调度不同的模型产生一些比较好的结果的话
如果你要调度不同的模型产生一些比较好的结果的话
4:29.900–4:31.300
zh那我就给你激励
那我就给你激励
4:31.300–4:34.620
zh所以这个是非常有意思的一个方向
所以这个是非常有意思的一个方向
4:34.620–4:38.420
zh其实他们也是在这一次的论文中明确了
其实他们也是在这一次的论文中明确了
4:38.420–4:39.780
zh通过强化学习
通过强化学习
4:39.780–4:43.640
zh确实是可以把模型的调度能力提升上去的
确实是可以把模型的调度能力提升上去的
4:43.640–4:46.100
zh甚至是涌现出了一些超出以往
甚至是涌现出了一些超出以往
4:46.100–4:48.380
zh单一模型执行的能力
单一模型执行的能力
4:48.380–4:51.760
zh然后其实我们都知道像这样的一些能力
然后其实我们都知道像这样的一些能力
4:51.760–4:54.700
zh我们现在在Harness Engineering里面就是在做嘛
我们现在在Harness Engineering里面就是在做嘛
4:54.700–4:55.800
zh我们也在做编排
我们也在做编排
4:55.800–4:57.480
zh比如说在Workbody里面
比如说在Workbody里面
4:57.480–5:01.340
zh我们可以有这个股票交易的这个专家
我们可以有这个股票交易的这个专家
5:01.340–5:01.620
zh对吧
对吧
5:01.620–5:03.200
zh他其实就是在用Multi Agent
他其实就是在用Multi Agent
5:03.200–5:06.700
zh来去实现一些更好的一些判断
来去实现一些更好的一些判断
5:06.700–5:07.880
zh比如说有人唱空
比如说有人唱空
5:07.880–5:09.020
zh有人唱多
有人唱多
5:09.020–5:11.360
zh有人对这个基本面做分析
有人对这个基本面做分析
5:11.360–5:12.340
zh有人对鱼形做分析
有人对鱼形做分析
5:12.340–5:13.980
zh就是他不同的模型
就是他不同的模型
5:13.980–5:15.700
zh他负责的方向是不一样的
他负责的方向是不一样的
5:15.700–5:20.140
zh但是他们是用了一个相当于是训练一个模型
但是他们是用了一个相当于是训练一个模型
5:20.140–5:22.500
zh去拥有这个调度能力的这种方式
去拥有这个调度能力的这种方式
5:22.500–5:26.160
zh相当于让Harness的这个能力在模型中进行了沉淀
相当于让Harness的这个能力在模型中进行了沉淀
5:26.160–5:30.100
zh而且他也不光是训练的这些任务他能够做
而且他也不光是训练的这些任务他能够做
5:30.100–5:32.380
zh他还泛化出来了一些其他的能力
他还泛化出来了一些其他的能力
5:32.380–5:36.540
zh就是他可以在没见过的任务上也产出同样很好的一个水平
就是他可以在没见过的任务上也产出同样很好的一个水平
5:36.540–5:39.080
zh所以他是一个非常有意思的一个结构
所以他是一个非常有意思的一个结构
5:39.080–5:42.040
zh我们从他那个官网上的模型结构图上
我们从他那个官网上的模型结构图上
5:42.040–5:44.720
zh其实可以看到他就是一个复古这个模型
其实可以看到他就是一个复古这个模型
5:44.720–5:47.520
zh他可以access就可以接触到
他可以access就可以接触到
5:47.520–5:48.660
zh有的是开源模型
有的是开源模型
5:48.660–5:49.580
zh有的是必源模型
有的是必源模型
5:49.580–5:51.800
zh同样他也可以接触到他自己
同样他也可以接触到他自己
5:51.800–5:54.440
zh他是一个地规的一个架构
他是一个地规的一个架构
5:54.440–5:58.080
zh然后所以这条方法他们评估下来
然后所以这条方法他们评估下来
5:58.080–6:00.780
zh发现不光是在这些场景上
发现不光是在这些场景上
6:00.780–6:03.060
zhtrading比如说做交易的评测
trading比如说做交易的评测
6:03.060–6:05.340
zh然后看一段时间之后
然后看一段时间之后
6:05.340–6:09.100
zh哪一个交易模型的这个带来的交易收益更高
哪一个交易模型的这个带来的交易收益更高
6:09.100–6:09.960
zh对吧
对吧
6:09.960–6:12.640
zh或者是让他解一个谜题
或者是让他解一个谜题
6:12.640–6:13.720
zh做一个魔方
做一个魔方
6:13.720–6:15.340
zh然后恢复一个魔方
然后恢复一个魔方
6:15.340–6:17.320
zh哪个效果会更快
哪个效果会更快
6:17.320–6:18.520
zh哪一个步数更少
哪一个步数更少
6:18.520–6:20.020
zh相当于一系列的测试中
相当于一系列的测试中
6:20.020–6:23.520
zh发现这种方式确实能够起到一个很好的效果
发现这种方式确实能够起到一个很好的效果
6:23.520–6:25.200
zh那这个意味着什么呢
那这个意味着什么呢
6:25.200–6:29.200
zh我觉得就是很容易类比和联想到我们人类社会上
我觉得就是很容易类比和联想到我们人类社会上
6:29.200–6:32.140
zh就是我们每个人其实都有自己不同的能力
就是我们每个人其实都有自己不同的能力
6:32.140–6:35.900
zh有的人擅长写代码 有的人擅长执行
有的人擅长写代码 有的人擅长执行
6:35.900–6:40.520
zh有的人擅长写文章 那不同的模型也像我们人一样有不同的能力
有的人擅长写文章 那不同的模型也像我们人一样有不同的能力
6:40.520–6:45.900
zh那通过这种管理者就是有一个模型专门拥有了这个管理能力
那通过这种管理者就是有一个模型专门拥有了这个管理能力
6:45.900–6:49.160
zh我去协调这些模型能够产生一个非常好的效果
我去协调这些模型能够产生一个非常好的效果
6:49.160–6:51.700
zh对 然后这个是就是很有意思了
对 然后这个是就是很有意思了
6:51.700–6:53.440
zh就是因为我是学城市规划的
就是因为我是学城市规划的
6:53.440–6:57.400
zh然后我对这种组织这个叫集体智慧
然后我对这种组织这个叫集体智慧
6:57.400–7:00.120
zh集体智能涌现就非常感兴趣
集体智能涌现就非常感兴趣
7:00.120–7:04.200
zh而且它这个方向也正好契合了我们前一段时间写的
而且它这个方向也正好契合了我们前一段时间写的
7:04.200–7:06.400
zh就是从超级个体到超级团队
就是从超级个体到超级团队
7:06.400–7:09.600
zh为什么有了一个一个的天才模型之后
为什么有了一个一个的天才模型之后
7:09.600–7:11.400
zh它依然需要团队 对吧
它依然需要团队 对吧
7:11.400–7:13.860
zh有了这个要数据中心中的天才之国
有了这个要数据中心中的天才之国
7:13.860–7:16.700
zh那为什么还需要这个不同模型之间的协作
那为什么还需要这个不同模型之间的协作
7:16.700–7:19.540
zh就是因为协作还是可以去拉高上线的
就是因为协作还是可以去拉高上线的
7:19.540–7:22.740
zh而且这次的这个论文也是发现了
而且这次的这个论文也是发现了
7:22.740–7:24.760
zh在强化学习的这个训练方法之下
在强化学习的这个训练方法之下
7:24.760–7:27.100
zh这种协调能力也可以被训练出来
这种协调能力也可以被训练出来
7:27.100–7:28.560
zh这就带来了两个问题
这就带来了两个问题
7:28.560–7:32.020
zh一个呢就是那harness还重不重要
一个呢就是那harness还重不重要
7:32.020–7:34.160
zh对吧 比如说我们有未来模型
对吧 比如说我们有未来模型
7:34.160–7:36.220
zh可以吸收到这些模型的编排之后
可以吸收到这些模型的编排之后
7:36.220–7:37.860
zh那我们还要不要有harness
那我们还要不要有harness
7:37.860–7:40.640
zh我的观点是它两个都同样重要
我的观点是它两个都同样重要
7:40.640–7:43.900
zh就像你有大组织也有出放公司一样
就像你有大组织也有出放公司一样
7:43.900–7:45.800
zh就是还是有非常非常多的场景
就是还是有非常非常多的场景
7:45.800–7:47.720
zh需要去灵活的探索
需要去灵活的探索
7:47.720–7:50.400
zh就可能还没有被吸收到模型的能力里面
就可能还没有被吸收到模型的能力里面
7:50.400–7:53.220
zh所以我认为未来的每一个软件公司
所以我认为未来的每一个软件公司
7:53.220–7:55.880
zh在未来可能都会变成一个模型公司
在未来可能都会变成一个模型公司
7:55.880–7:58.960
zh这个模型公司就是专门去为特定的场景
这个模型公司就是专门去为特定的场景
7:58.960–8:00.180
zh特定的数据
特定的数据
8:00.180–8:02.680
zh然后特定的条件去做优化的
然后特定的条件去做优化的
8:02.680–8:05.420
zh如果你能够在一个特定的场景下
如果你能够在一个特定的场景下
8:05.420–8:08.780
zh去调用非常多的模型去解决场景的问题
去调用非常多的模型去解决场景的问题
8:08.780–8:12.300
zh能够在效率成本还有速度之间
能够在效率成本还有速度之间
8:12.300–8:14.180
zh取得一个很好的平衡的话
取得一个很好的平衡的话
8:14.180–8:16.340
zh那你就是能够贡献价值的
那你就是能够贡献价值的
8:16.340–8:18.960
zh未来比如说像富库这个公司
未来比如说像富库这个公司
8:18.960–8:21.940
zh它可以提供一套通用的这种conductor
它可以提供一套通用的这种conductor
8:21.940–8:23.200
zh就是模型编排能力
就是模型编排能力
8:23.200–8:24.720
zh但是每一个软件公司
但是每一个软件公司
8:24.720–8:26.320
zh因为你对场景数据最了解
因为你对场景数据最了解
8:26.320–8:28.460
zh你对这个模型的评测最了解
你对这个模型的评测最了解
8:28.460–8:31.360
zh那你是可以在这个场景中最有发言权的
那你是可以在这个场景中最有发言权的
8:31.360–8:33.020
zh所以我觉得这个肯定是一个
所以我觉得这个肯定是一个
8:33.020–8:35.160
zh就是harness和这种模型端
就是harness和这种模型端
8:35.160–8:36.640
zh它都会同时存在
它都会同时存在
8:36.640–8:37.320
zh还有一个问题
还有一个问题
8:37.320–8:39.640
zh那我们既然说集体智慧这么重要了
那我们既然说集体智慧这么重要了
8:39.640–8:42.480
zh那单个模型的智能还重不重要
那单个模型的智能还重不重要
8:42.480–8:43.780
zh我觉得依然是重要的
我觉得依然是重要的
8:43.780–8:47.320
zh因为就是你把一个天才和一堆普通人放在一起
因为就是你把一个天才和一堆普通人放在一起
8:47.320–8:50.100
zh发挥的价值和把一堆天才聚集在一起
发挥的价值和把一堆天才聚集在一起
8:50.100–8:51.080
zh发挥的价值
发挥的价值
8:51.080–8:54.360
zh那可是差的不只是一倍两倍三倍
那可是差的不只是一倍两倍三倍
8:54.360–8:54.600
zh对吧
对吧
8:54.600–8:56.300
zh那可能是十倍几十倍的差异
那可能是十倍几十倍的差异
8:56.300–8:58.960
zh所以像那个阿茂Day他说的
所以像那个阿茂Day他说的
8:58.960–9:01.820
zh未来在这个数据中心中的天才之国
未来在这个数据中心中的天才之国
9:01.820–9:04.640
zh就是当这个数据中心中有很多的模型
就是当这个数据中心中有很多的模型
9:04.640–9:05.760
zh它都是天才的时候
它都是天才的时候
9:05.760–9:08.100
zh那产生的这个效应和效果
那产生的这个效应和效果
9:08.100–9:10.020
zh那其实是超乎想象的
那其实是超乎想象的
9:10.020–9:12.760
zh所以我觉得未来可能这个技术路线
所以我觉得未来可能这个技术路线
9:12.760–9:16.280
zh不光是在日本的这家公司里会去使用
不光是在日本的这家公司里会去使用
9:16.280–9:18.480
zh就是像前沿模型这些公司
就是像前沿模型这些公司
9:18.480–9:19.600
zh他们也会去使用
他们也会去使用
9:19.600–9:23.380
zh他们也会去开始这个组织智能的探索
他们也会去开始这个组织智能的探索
9:23.380–9:24.920
zh其实像OpenAI之前
其实像OpenAI之前
9:24.920–9:27.060
zh把HCI的实现
把HCI的实现
9:27.060–9:28.640
zh划分了五个等级
划分了五个等级
9:28.640–9:31.000
zh那最后一等级就是
那最后一等级就是
9:31.000–9:32.460
enOrganizer
Organizer
9:32.460–9:34.180
zh就是协调者组织者
就是协调者组织者
9:34.180–9:37.120
zh那我觉得这一次的这个Takana AI
那我觉得这一次的这个Takana AI
9:37.120–9:38.960
zh确实是在这个方向上
确实是在这个方向上
9:38.960–9:40.600
zh得到了一个很好的突破
得到了一个很好的突破
9:40.600–9:43.120
zh就是验证了这个方向也是可行的
就是验证了这个方向也是可行的
9:43.120–9:46.280
zh所以我觉得接下来对我们每个人来说
所以我觉得接下来对我们每个人来说
9:46.280–9:48.840
zh就是你费劲巴拉的去写
就是你费劲巴拉的去写
9:48.840–9:51.500
zhMulti Agent的这些约束
Multi Agent的这些约束
9:51.500–9:53.760
zh其实不如直接拿一个模型来去使用
其实不如直接拿一个模型来去使用
9:53.760–9:56.180
zh这也并不是说我们自己就没那么重要了
这也并不是说我们自己就没那么重要了
9:56.180–9:58.560
zh而是说我们的时间
而是说我们的时间
9:58.560–10:00.180
zh注意力可以解放在更多
注意力可以解放在更多
10:00.180–10:03.180
zh我们更擅长的这种端到端的
我们更擅长的这种端到端的
10:03.180–10:05.100
zh以及线下的一些事情上去
以及线下的一些事情上去
10:05.100–10:05.720
zh对
对
10:05.720–10:06.980
zh机会还是存在的
机会还是存在的
10:06.980–10:08.800
zh只是说现在我们有更多的
只是说现在我们有更多的
10:08.800–10:10.160
zh模型公司的研发
模型公司的研发
10:10.160–10:12.360
zh可以把人类的注意力更好的解脱出来
可以把人类的注意力更好的解脱出来
10:12.360–10:14.140
zh我就做这些推演吧
我就做这些推演吧
10:14.140–10:14.900
zh拜拜
拜拜
10:14.900–10:15.580
zh拜拜
拜拜
10:15.580–10:15.900
zh拜拜
拜拜
尚未產生學習筆記
請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習