實際影片長度:8:54.600。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:03.180
zhHello 今天咱们来聊点超有意思的AI圈新鲜事
0:03.180–0:05.800
zh绝对能刷新你之前对大模型的刻板印象
0:05.800–0:08.260
zh今天我们来聊聊一个有点意思的模型
0:08.260–0:09.800
enMindforge 27B
0:09.800–0:11.600
zh听到名字里的27B
0:11.600–0:14.120
zh你可能会觉得这不就是个小参数模型吗
0:14.120–0:17.380
zh毕竟现在动辄千亿参数的AI模型满天飞
0:17.380–0:19.340
zh27B顶多算个小个子
0:19.340–0:20.860
zh但就是这个小个子
0:20.860–0:23.500
zh在编程能力上却干翻了不少大块头
0:23.500–0:26.020
zh在编程测试基准Program Bench上
0:26.020–0:27.760
zh它的第一次尝试通过率
0:27.760–0:30.560
zhPass@1达到了49.51%
0:30.560–0:34.400
zh比DeepSeek第四代专业版的47.80%还高
0:34.400–0:38.860
zh甚至逼近了Claude Opus 3.5的51.38%
0:38.860–0:42.380
zh要知道Claude Opus 3.5可是公认的编程高手
0:42.380–0:45.940
zh而Mindforge 27B只用了1001条数据训练
0:45.940–0:47.560
zh这到底是咋做到的
0:47.560–0:50.340
zh咱们今天就来扒一扒它背后的技术细节
0:50.340–0:51.460
zh首先得说
0:51.460–0:53.800
zh这个模型的核心不在参数多
0:53.800–0:55.000
zh而在数据精
0:55.000–0:57.540
zh传统的大模型训练编程能力
0:57.540–0:59.320
zh基本都是海量堆数据
0:59.320–1:01.220
zhGitHub上几百万个项目
1:01.220–1:02.820
zh几十亿行代码片段
1:02.820–1:05.700
zh甚至包括各种开源库的函数定义
1:05.700–1:06.360
zh注释
1:06.360–1:07.400
zh用法示例
1:07.400–1:09.000
zh一股脑往模型里塞
1:09.000–1:11.460
zh这种训练方式确实能让模型
1:11.460–1:12.840
zh学会写代码的语法
1:12.840–1:14.340
zh比如怎么定义变量
1:14.340–1:15.200
zh写循环
1:15.200–1:15.840
zh调库
1:15.840–1:17.060
zh但有个大问题
1:17.060–1:18.940
zh它学到的是局部技能
1:18.940–1:20.320
zh而不是工程思维
1:20.320–1:23.000
zh就像你让一个只会被单词的人写小说
1:23.000–1:24.400
zh他可能词都认识
1:24.400–1:26.020
zh但写不出连贯的故事
1:26.020–1:28.960
zhMindforge 27B完全反其道而行之
1:28.960–1:30.880
zh它没用海量代码片段
1:30.880–1:33.280
zh而是用了1001条完整开发轨迹
1:33.280–1:34.980
zh啥叫完整开发轨迹
1:34.980–1:36.200
zh咱们打个比方
1:36.200–1:39.400
zh你让一个程序员开发一个电商订单管理系统
1:39.400–1:41.900
zh传统数据可能只给他订单创建
1:41.900–1:43.360
zh这个函数的代码片段
1:43.360–1:45.440
zh或者库存检查的一段逻辑
1:45.440–1:47.100
zh但完整开发轨迹
1:47.100–1:48.900
zh是从老板提需求开始
1:48.900–1:50.680
zh到程序员分析需求
1:50.680–1:51.920
zh设计系统架构
1:51.920–1:52.940
zh画流程图
1:52.940–1:53.720
zh写代码
1:53.720–1:54.360
zh测bug
1:54.360–1:55.040
zh改bug
1:55.040–1:55.980
zh最后上线
1:55.980–1:58.000
zh整个过程每一步的对话
1:58.000–1:58.620
zh思考
1:58.620–1:59.520
zh代码修改
1:59.520–2:00.360
zh错误反馈
2:00.360–2:01.420
zh全都有记录
2:01.420–2:02.560
zh具体来说
2:02.560–2:04.000
zh这1001条轨迹
2:04.000–2:06.740
zh平均每条有181.6轮对话
2:06.740–2:08.220
zh这不是简单的问答
2:08.220–2:10.560
zh而是像真实开发团队里的协作
2:10.560–2:11.680
zh比如第一轮
2:11.680–2:13.380
zh用户也就是需求方说
2:13.380–2:14.980
zh我们需要一个订单系统
2:14.980–2:16.800
zh要支持多种支付方式
2:16.800–2:18.460
zh还要能实时查库存
2:18.460–2:20.020
zh模型作为开发者
2:20.020–2:21.360
zh不会直接写代码
2:21.360–2:22.380
zh而是先问细节
2:22.380–2:24.660
zh支付方式需要支持支付宝
2:24.660–2:25.980
zh微信还是银行卡
2:25.980–2:28.340
zh实时查库存是扣库存前查
2:28.340–2:29.560
zh还是扣库存实查
2:29.560–2:30.720
zh订单取消后
2:30.720–2:31.800
zh库存要不要回退
2:31.800–2:33.020
zh用户回答后
2:33.020–2:34.600
zh模型会接着设计架构
2:34.600–2:36.280
zh我们可以分订单服务
2:36.280–2:37.160
zh支付服务
2:37.160–2:38.600
zh库存服务三个模块
2:38.600–2:40.160
zh用消息队列解耦
2:40.160–2:41.520
zh然后写代码的时候
2:41.520–2:43.820
zh模型会写订单表的创建语句
2:43.820–2:44.960
zh写接口定义
2:44.960–2:46.000
zh写业务逻辑
2:46.000–2:47.180
zh写完跑测试
2:47.180–2:48.800
zh比如发现高并发时
2:48.800–2:49.820
zh库存扣减不对
2:49.820–2:52.300
zh模型会根据错误日志分析原因
2:52.300–2:54.000
zh应该是没加分布式锁
2:54.000–2:55.140
zh导致两个请求
2:55.140–2:56.600
zh同时读到库存为一
2:56.600–2:57.440
zh都扣了
2:57.440–2:58.540
zh然后修改代码
2:58.540–2:59.160
zh加锁
2:59.160–2:59.980
zh再测试
2:59.980–3:00.920
zh直到通过
3:00.920–3:01.460
zh你看
3:01.460–3:03.660
zh这181.6轮对话里
3:03.660–3:05.720
zh每一轮都包含三类信息
3:05.720–3:06.540
zh上下文
3:06.540–3:07.920
zh之前的需求讨论
3:07.920–3:08.860
zh架构设计
3:08.860–3:09.560
zh动作
3:09.560–3:10.580
zh写了什么代码
3:10.580–3:11.360
zh改了哪里
3:11.360–3:11.980
zh反馈
3:11.980–3:13.220
zh测试报了什么错
3:13.220–3:14.580
zh用户提了什么意见
3:14.580–3:15.900
zh模型训练的时候
3:15.900–3:18.280
zh就是学习这三者之间的因果链
3:18.280–3:19.420
zh根据上下文
3:19.420–3:20.600
zh应该做什么动作
3:20.600–3:22.580
zh做了动作会得到什么反馈
3:22.580–3:24.540
zh得到反馈后该怎么调整
3:24.540–3:26.420
zh这比单纯学代码片段
3:26.420–3:27.120
zh长什么样
3:27.120–3:28.080
zh高明太多了
3:28.080–3:29.120
zh他学到的是
3:29.120–3:31.060
zh开发代码的全流程逻辑
3:31.060–3:32.520
zh也就是工程思维
3:32.520–3:34.740
zh那这些轨迹数据是怎么来的
3:34.740–3:36.640
zh研究团队从开源项目的
3:36.640–3:38.440
zh完整开发历史里挖出来的
3:38.440–3:40.600
zh比如Github上一些知名项目的
3:40.600–3:41.580
zhissue讨论区
3:41.580–3:43.300
zhPull Request的修改记录
3:43.300–3:44.660
zh代码评审的评论
3:44.660–3:47.000
zh甚至是开发者之间的聊天记录
3:47.000–3:48.000
zh当然脱敏了
3:48.000–3:50.060
zh他们把这些非结构化的数据
3:50.060–3:51.760
zh整理成结构化的对话
3:51.760–3:52.360
zh代码
3:52.360–3:53.160
zh反馈链
3:53.160–3:55.380
zh每条轨迹都像一部开发日志
3:55.380–3:56.620
zh记录了一个功能
3:56.620–3:58.100
zh从无到有的全过程
3:58.100–3:59.240
zh比如某个轨迹
3:59.240–4:00.300
zh可能是开发一个
4:00.300–4:01.880
zh用户登陆鉴权功能
4:01.880–4:03.120
zh从最开始讨论
4:03.120–4:04.900
zh用JWT还是Session
4:04.900–4:06.820
zh到设计Token刷新机制
4:06.820–4:08.480
zh到写登陆接口代码
4:08.480–4:09.580
zh到测试发现
4:09.580–4:11.120
zhToken过期时间太短
4:11.120–4:12.740
zh再到调整过期时间
4:12.740–4:13.980
zh加刷新接口
4:13.980–4:14.860
zh最后上线
4:14.860–4:15.860
zh这些细节
4:15.860–4:17.240
zh传统代码数据里
4:17.240–4:18.240
zh根本不会保留
4:18.240–4:19.860
zh接下来是训练策略
4:19.860–4:21.100
zh研究团队用了
4:21.100–4:22.200
zh因果语言建模
4:22.200–4:24.180
zh但不是普通的因果建模
4:24.180–4:25.300
zh普通建模是
4:25.300–4:26.940
zh把一段文本拆成Token
4:26.940–4:28.900
zh让模型预测下一个Token
4:28.900–4:30.680
zh而MindForge 27B
4:30.680–4:32.160
zh把轨迹拆成片段
4:32.160–4:33.040
zh每个片段
4:33.040–4:34.420
zh可能是用户需求
4:34.420–4:35.380
zh模型回复
4:35.380–4:36.140
zh代码块
4:36.140–4:37.000
zh错误日志
4:37.000–4:39.780
zh然后让模型学习在什么上下文下
4:39.780–4:41.600
zh该生成什么类型的片段
4:41.600–4:44.220
zh比如前面是用户提了一个bug反馈
4:44.220–4:47.560
zh模型就该预测错误分析和代码修改片段
4:47.560–4:49.700
zh而不是直接生成代码片段
4:49.700–4:53.500
zh这种结构化预测让模型更理解开发流程的节奏
4:53.500–4:54.820
zh还有一个关键点
4:54.820–4:57.140
zh模型在训练时会模拟错误
4:57.140–4:58.260
zh传统训练里
4:58.260–5:00.120
zh代码数据大多是正确的
5:00.120–5:01.980
zh比如开源项目的最终代码
5:01.980–5:04.760
zh模型很少看到错误代码和修复过程
5:04.760–5:07.080
zh但MindForge 27B的轨迹里
5:07.080–5:09.640
zh包含大量错误修复的循环
5:09.640–5:11.260
zh比如模型写了一段代码
5:11.260–5:12.940
zh测试爆空指针异常
5:12.940–5:15.620
zh然后模型会分析哪个变量可能为空
5:15.620–5:17.220
zh修改代码加判空
5:17.220–5:18.080
zh再测试
5:18.080–5:19.740
zh可能又爆类型不匹配
5:19.740–5:20.700
zh再调整
5:20.700–5:21.780
zh这种试错过程
5:21.780–5:23.660
zh让模型学会了如何调试
5:23.660–5:25.460
zh这不是靠记住常见bug
5:25.460–5:27.720
zh而是掌握了排查问题的思路
5:27.720–5:29.160
zh就像一个老程序员
5:29.160–5:31.180
zh不是背会了所有bug的解法
5:31.180–5:33.340
zh而是掌握了排查问题的思路
5:33.340–5:34.780
zh那效果为啥这么好
5:34.780–5:36.240
zh咱们再看实验细节
5:36.240–5:39.340
zhProgramBench是一个很严格的编程测试集
5:39.340–5:41.520
zh里面全是真实的工程任务
5:41.520–5:44.060
zh比如实现一个分布式缓存系统
5:44.060–5:45.820
zh优化一个数据库查询
5:45.820–5:47.500
zh写一个微服务的网关
5:47.500–5:49.760
zh而不是简单的写个排序算法
5:49.760–5:51.300
zh它的PASS@1指标
5:51.300–5:53.560
zh就是模型第一次生成的代码
5:53.560–5:55.920
zh直接通过所有测试用例的比例
5:55.920–5:57.800
zh这个指标比PASS@10
5:57.800–5:59.920
zh尝试十次通过更靠谱
5:59.920–6:01.240
zh因为实际开发中
6:01.240–6:03.380
zh你不可能让模型试十次
6:03.380–6:05.300
zh要的是第一次就尽量对
6:05.300–6:09.380
zhMindforge 27B的PASS@1是49.51%
6:09.380–6:11.320
zh意味着它几乎一半的任务
6:11.320–6:13.520
zh第一次生成的代码就能跑通
6:13.520–6:16.920
zh而Deepseek V4 Pro用了海量代码数据训练
6:16.920–6:17.940
zh参数更大
6:17.940–6:20.800
zh但PASS@1只有47.80%
6:20.800–6:23.760
zhClaude Opus 4.7虽然是顶尖模型
6:23.760–6:26.280
zh但也只比它高1.87个百分点
6:26.280–6:27.040
zh这说明啥
6:27.040–6:30.180
zh说明在编程这种强工程属性的任务里
6:30.180–6:31.380
zh知道怎么开发
6:31.380–6:33.720
zh比知道多少代码片段更重要
6:33.720–6:34.760
zh更有意思的是
6:34.760–6:36.680
zh研究团队做了个对比实验
6:36.680–6:38.540
zh用同样的27B模型
6:38.540–6:41.280
zh一组用1001条完整轨迹训练
6:41.280–6:43.740
zh另一组用100万条代码片段
6:43.740–6:45.680
zh相当于传统数据量训练
6:45.680–6:46.320
zh结果
6:46.320–6:47.680
zh轨迹训练的模型
6:47.680–6:49.140
zh在ProgramBench上
6:49.140–6:51.420
zhPASS@1是49.51%
6:51.420–6:53.600
zh而海量片段训练的模型
6:53.600–6:55.420
zh只有32.7%
6:55.420–6:57.140
zh差了快17个百分点
6:57.140–6:58.220
zh这直接证明
6:58.220–6:59.980
zh高质量的全流程数据
6:59.980–7:02.280
zh比海量的局部数据有效得多
7:02.280–7:04.280
zh那这对中小团队意味着啥
7:04.280–7:05.380
zh以前大家觉得
7:05.380–7:07.220
zh要做个能写代码的AI
7:07.220–7:08.500
zh得有千亿参数
7:08.500–7:10.180
zh得有几十万块GPU
7:10.180–7:12.040
zh得收集TB级的数据
7:12.040–7:13.720
zh中小团队根本玩不起
7:13.720–7:16.020
zh但Mindforge 27B告诉我们
7:16.020–7:16.520
zh不用
7:16.520–7:18.160
zh你只需要花精力整理
7:18.160–7:20.620
zh几百上千条高质量的开发轨迹
7:20.620–7:22.160
zh用个小参数模型
7:22.160–7:23.280
zh比如27B
7:23.280–7:25.220
zh几张V100卡就能训练
7:25.220–7:27.940
zh就能做出接近顶尖大模型的效果
7:27.940–7:29.980
zh这对资源有限的团队来说
7:29.980–7:31.120
zh简直是福音
7:31.120–7:32.220
zh不用卷算力
7:32.220–7:33.440
zh不用卷数据量
7:33.440–7:34.940
zh卷数据质量就行了
7:34.940–7:36.840
zh比如一个小团队想做一个
7:36.840–7:38.780
zh金融代码生成的专业模型
7:38.780–7:41.260
zh他们不用去爬Github上所有代码
7:41.260–7:43.620
zh只需要找几个资深金融工程师
7:43.620–7:45.500
zh记录他们开发风控系统
7:45.500–7:46.920
zh交易接口的全过程
7:46.920–7:48.500
zh整理成几百条轨迹
7:48.500–7:50.720
zh就能训练出一个懂金融业务
7:50.720–7:52.220
zh懂工程逻辑的模型
7:52.220–7:53.940
zh这种模型虽然参数小
7:53.940–7:56.020
zh但比那些啥都懂一点的大模型
7:56.020–7:58.160
zh在实际金融场景里更靠谱
7:58.160–7:59.240
zh最后总结一下
7:59.240–8:01.300
zhMindforge 27B的成功
8:01.300–8:03.820
zh其实打破了一个长期存在的迷思
8:03.820–8:05.860
zh编程能力等于参数规模
8:05.860–8:06.620
zh它证明
8:06.620–8:08.660
zh在编程这种需要强逻辑
8:08.660–8:10.300
zh强工程思维的领域
8:10.300–8:11.360
zh数据的质量
8:11.360–8:12.580
zh是不是全流程
8:12.580–8:14.420
zh是不是包含试错过程
8:14.420–8:16.160
zh是不是有完整上下文
8:16.160–8:17.560
zh比数据量更重要
8:17.560–8:18.560
zh就像教徒弟
8:18.560–8:20.640
zh你让他看一万行代码片段
8:20.640–8:23.060
zh不如让他跟着你完整做十个项目
8:23.060–8:25.280
zh因为前者只能让他记住怎么写
8:25.280–8:27.220
zh后者能让他学会怎么做
8:27.220–8:27.780
zh未来
8:27.780–8:30.960
zh可能会有更多这种小而美的专业模型出现
8:30.960–8:32.640
zh他们不需要千亿参数
8:32.640–8:35.240
zh只需要几千条高质量的领域轨迹
8:35.240–8:37.840
zh就能在特定领域达到顶尖水平
8:37.840–8:40.160
zh这对AI的普及来说是件好事
8:40.160–8:42.200
zh毕竟不是每个团队都有谷歌
8:42.200–8:43.480
zhOpenAI的资源
8:43.480–8:46.580
zh但每个团队都可能拥有高质量的领域数据
8:46.580–8:49.700
zhMindforge 27B算是给我们开了个好头
0:00.000–0:03.180
(此句尚無繁中翻譯)
0:03.180–0:05.800
(此句尚無繁中翻譯)
0:05.800–0:08.260
(此句尚無繁中翻譯)
0:08.260–0:09.800
(此句尚無繁中翻譯)
0:09.800–0:11.600
(此句尚無繁中翻譯)
0:11.600–0:14.120
(此句尚無繁中翻譯)
0:14.120–0:17.380
(此句尚無繁中翻譯)
0:17.380–0:19.340
(此句尚無繁中翻譯)
0:19.340–0:20.860
(此句尚無繁中翻譯)
0:20.860–0:23.500
(此句尚無繁中翻譯)
0:23.500–0:26.020
(此句尚無繁中翻譯)
0:26.020–0:27.760
(此句尚無繁中翻譯)
0:27.760–0:30.560
(此句尚無繁中翻譯)
0:30.560–0:34.400
(此句尚無繁中翻譯)
0:34.400–0:38.860
(此句尚無繁中翻譯)
0:38.860–0:42.380
(此句尚無繁中翻譯)
0:42.380–0:45.940
(此句尚無繁中翻譯)
0:45.940–0:47.560
(此句尚無繁中翻譯)
0:47.560–0:50.340
(此句尚無繁中翻譯)
0:50.340–0:51.460
(此句尚無繁中翻譯)
0:51.460–0:53.800
(此句尚無繁中翻譯)
0:53.800–0:55.000
(此句尚無繁中翻譯)
0:55.000–0:57.540
(此句尚無繁中翻譯)
0:57.540–0:59.320
(此句尚無繁中翻譯)
0:59.320–1:01.220
(此句尚無繁中翻譯)
1:01.220–1:02.820
(此句尚無繁中翻譯)
1:02.820–1:05.700
(此句尚無繁中翻譯)
1:05.700–1:06.360
(此句尚無繁中翻譯)
1:06.360–1:07.400
(此句尚無繁中翻譯)
1:07.400–1:09.000
(此句尚無繁中翻譯)
1:09.000–1:11.460
(此句尚無繁中翻譯)
1:11.460–1:12.840
(此句尚無繁中翻譯)
1:12.840–1:14.340
(此句尚無繁中翻譯)
1:14.340–1:15.200
(此句尚無繁中翻譯)
1:15.200–1:15.840
(此句尚無繁中翻譯)
1:15.840–1:17.060
(此句尚無繁中翻譯)
1:17.060–1:18.940
(此句尚無繁中翻譯)
1:18.940–1:20.320
(此句尚無繁中翻譯)
1:20.320–1:23.000
(此句尚無繁中翻譯)
1:23.000–1:24.400
(此句尚無繁中翻譯)
1:24.400–1:26.020
(此句尚無繁中翻譯)
1:26.020–1:28.960
(此句尚無繁中翻譯)
1:28.960–1:30.880
(此句尚無繁中翻譯)
1:30.880–1:33.280
(此句尚無繁中翻譯)
1:33.280–1:34.980
(此句尚無繁中翻譯)
1:34.980–1:36.200
(此句尚無繁中翻譯)
1:36.200–1:39.400
(此句尚無繁中翻譯)
1:39.400–1:41.900
(此句尚無繁中翻譯)
1:41.900–1:43.360
(此句尚無繁中翻譯)
1:43.360–1:45.440
(此句尚無繁中翻譯)
1:45.440–1:47.100
(此句尚無繁中翻譯)
1:47.100–1:48.900
(此句尚無繁中翻譯)
1:48.900–1:50.680
(此句尚無繁中翻譯)
1:50.680–1:51.920
(此句尚無繁中翻譯)
1:51.920–1:52.940
(此句尚無繁中翻譯)
1:52.940–1:53.720
(此句尚無繁中翻譯)
1:53.720–1:54.360
(此句尚無繁中翻譯)
1:54.360–1:55.040
(此句尚無繁中翻譯)
1:55.040–1:55.980
(此句尚無繁中翻譯)
1:55.980–1:58.000
(此句尚無繁中翻譯)
1:58.000–1:58.620
(此句尚無繁中翻譯)
1:58.620–1:59.520
(此句尚無繁中翻譯)
1:59.520–2:00.360
(此句尚無繁中翻譯)
2:00.360–2:01.420
(此句尚無繁中翻譯)
2:01.420–2:02.560
(此句尚無繁中翻譯)
2:02.560–2:04.000
(此句尚無繁中翻譯)
2:04.000–2:06.740
(此句尚無繁中翻譯)
2:06.740–2:08.220
(此句尚無繁中翻譯)
2:08.220–2:10.560
(此句尚無繁中翻譯)
2:10.560–2:11.680
(此句尚無繁中翻譯)
2:11.680–2:13.380
(此句尚無繁中翻譯)
2:13.380–2:14.980
(此句尚無繁中翻譯)
2:14.980–2:16.800
(此句尚無繁中翻譯)
2:16.800–2:18.460
(此句尚無繁中翻譯)
2:18.460–2:20.020
(此句尚無繁中翻譯)
2:20.020–2:21.360
(此句尚無繁中翻譯)
2:21.360–2:22.380
(此句尚無繁中翻譯)
2:22.380–2:24.660
(此句尚無繁中翻譯)
2:24.660–2:25.980
(此句尚無繁中翻譯)
2:25.980–2:28.340
(此句尚無繁中翻譯)
2:28.340–2:29.560
(此句尚無繁中翻譯)
2:29.560–2:30.720
(此句尚無繁中翻譯)
2:30.720–2:31.800
(此句尚無繁中翻譯)
2:31.800–2:33.020
(此句尚無繁中翻譯)
2:33.020–2:34.600
(此句尚無繁中翻譯)
2:34.600–2:36.280
(此句尚無繁中翻譯)
2:36.280–2:37.160
(此句尚無繁中翻譯)
2:37.160–2:38.600
(此句尚無繁中翻譯)
2:38.600–2:40.160
(此句尚無繁中翻譯)
2:40.160–2:41.520
(此句尚無繁中翻譯)
2:41.520–2:43.820
(此句尚無繁中翻譯)
2:43.820–2:44.960
(此句尚無繁中翻譯)
2:44.960–2:46.000
(此句尚無繁中翻譯)
2:46.000–2:47.180
(此句尚無繁中翻譯)
2:47.180–2:48.800
(此句尚無繁中翻譯)
2:48.800–2:49.820
(此句尚無繁中翻譯)
2:49.820–2:52.300
(此句尚無繁中翻譯)
2:52.300–2:54.000
(此句尚無繁中翻譯)
2:54.000–2:55.140
(此句尚無繁中翻譯)
2:55.140–2:56.600
(此句尚無繁中翻譯)
2:56.600–2:57.440
(此句尚無繁中翻譯)
2:57.440–2:58.540
(此句尚無繁中翻譯)
2:58.540–2:59.160
(此句尚無繁中翻譯)
2:59.160–2:59.980
(此句尚無繁中翻譯)
2:59.980–3:00.920
(此句尚無繁中翻譯)
3:00.920–3:01.460
(此句尚無繁中翻譯)
3:01.460–3:03.660
(此句尚無繁中翻譯)
3:03.660–3:05.720
(此句尚無繁中翻譯)
3:05.720–3:06.540
(此句尚無繁中翻譯)
3:06.540–3:07.920
(此句尚無繁中翻譯)
3:07.920–3:08.860
(此句尚無繁中翻譯)
3:08.860–3:09.560
(此句尚無繁中翻譯)
3:09.560–3:10.580
(此句尚無繁中翻譯)
3:10.580–3:11.360
(此句尚無繁中翻譯)
3:11.360–3:11.980
(此句尚無繁中翻譯)
3:11.980–3:13.220
(此句尚無繁中翻譯)
3:13.220–3:14.580
(此句尚無繁中翻譯)
3:14.580–3:15.900
(此句尚無繁中翻譯)
3:15.900–3:18.280
(此句尚無繁中翻譯)
3:18.280–3:19.420
(此句尚無繁中翻譯)
3:19.420–3:20.600
(此句尚無繁中翻譯)
3:20.600–3:22.580
(此句尚無繁中翻譯)
3:22.580–3:24.540
(此句尚無繁中翻譯)
3:24.540–3:26.420
(此句尚無繁中翻譯)
3:26.420–3:27.120
(此句尚無繁中翻譯)
3:27.120–3:28.080
(此句尚無繁中翻譯)
3:28.080–3:29.120
(此句尚無繁中翻譯)
3:29.120–3:31.060
(此句尚無繁中翻譯)
3:31.060–3:32.520
(此句尚無繁中翻譯)
3:32.520–3:34.740
(此句尚無繁中翻譯)
3:34.740–3:36.640
(此句尚無繁中翻譯)
3:36.640–3:38.440
(此句尚無繁中翻譯)
3:38.440–3:40.600
(此句尚無繁中翻譯)
3:40.600–3:41.580
(此句尚無繁中翻譯)
3:41.580–3:43.300
(此句尚無繁中翻譯)
3:43.300–3:44.660
(此句尚無繁中翻譯)
3:44.660–3:47.000
(此句尚無繁中翻譯)
3:47.000–3:48.000
(此句尚無繁中翻譯)
3:48.000–3:50.060
(此句尚無繁中翻譯)
3:50.060–3:51.760
(此句尚無繁中翻譯)
3:51.760–3:52.360
(此句尚無繁中翻譯)
3:52.360–3:53.160
(此句尚無繁中翻譯)
3:53.160–3:55.380
(此句尚無繁中翻譯)
3:55.380–3:56.620
(此句尚無繁中翻譯)
3:56.620–3:58.100
(此句尚無繁中翻譯)
3:58.100–3:59.240
(此句尚無繁中翻譯)
3:59.240–4:00.300
(此句尚無繁中翻譯)
4:00.300–4:01.880
(此句尚無繁中翻譯)
4:01.880–4:03.120
(此句尚無繁中翻譯)
4:03.120–4:04.900
(此句尚無繁中翻譯)
4:04.900–4:06.820
(此句尚無繁中翻譯)
4:06.820–4:08.480
(此句尚無繁中翻譯)
4:08.480–4:09.580
(此句尚無繁中翻譯)
4:09.580–4:11.120
(此句尚無繁中翻譯)
4:11.120–4:12.740
(此句尚無繁中翻譯)
4:12.740–4:13.980
(此句尚無繁中翻譯)
4:13.980–4:14.860
(此句尚無繁中翻譯)
4:14.860–4:15.860
(此句尚無繁中翻譯)
4:15.860–4:17.240
(此句尚無繁中翻譯)
4:17.240–4:18.240
(此句尚無繁中翻譯)
4:18.240–4:19.860
(此句尚無繁中翻譯)
4:19.860–4:21.100
(此句尚無繁中翻譯)
4:21.100–4:22.200
(此句尚無繁中翻譯)
4:22.200–4:24.180
(此句尚無繁中翻譯)
4:24.180–4:25.300
(此句尚無繁中翻譯)
4:25.300–4:26.940
(此句尚無繁中翻譯)
4:26.940–4:28.900
(此句尚無繁中翻譯)
4:28.900–4:30.680
(此句尚無繁中翻譯)
4:30.680–4:32.160
(此句尚無繁中翻譯)
4:32.160–4:33.040
(此句尚無繁中翻譯)
4:33.040–4:34.420
(此句尚無繁中翻譯)
4:34.420–4:35.380
(此句尚無繁中翻譯)
4:35.380–4:36.140
(此句尚無繁中翻譯)
4:36.140–4:37.000
(此句尚無繁中翻譯)
4:37.000–4:39.780
(此句尚無繁中翻譯)
4:39.780–4:41.600
(此句尚無繁中翻譯)
4:41.600–4:44.220
(此句尚無繁中翻譯)
4:44.220–4:47.560
(此句尚無繁中翻譯)
4:47.560–4:49.700
(此句尚無繁中翻譯)
4:49.700–4:53.500
(此句尚無繁中翻譯)
4:53.500–4:54.820
(此句尚無繁中翻譯)
4:54.820–4:57.140
(此句尚無繁中翻譯)
4:57.140–4:58.260
(此句尚無繁中翻譯)
4:58.260–5:00.120
(此句尚無繁中翻譯)
5:00.120–5:01.980
(此句尚無繁中翻譯)
5:01.980–5:04.760
(此句尚無繁中翻譯)
5:04.760–5:07.080
(此句尚無繁中翻譯)
5:07.080–5:09.640
(此句尚無繁中翻譯)
5:09.640–5:11.260
(此句尚無繁中翻譯)
5:11.260–5:12.940
(此句尚無繁中翻譯)
5:12.940–5:15.620
(此句尚無繁中翻譯)
5:15.620–5:17.220
(此句尚無繁中翻譯)
5:17.220–5:18.080
(此句尚無繁中翻譯)
5:18.080–5:19.740
(此句尚無繁中翻譯)
5:19.740–5:20.700
(此句尚無繁中翻譯)
5:20.700–5:21.780
(此句尚無繁中翻譯)
5:21.780–5:23.660
(此句尚無繁中翻譯)
5:23.660–5:25.460
(此句尚無繁中翻譯)
5:25.460–5:27.720
(此句尚無繁中翻譯)
5:27.720–5:29.160
(此句尚無繁中翻譯)
5:29.160–5:31.180
(此句尚無繁中翻譯)
5:31.180–5:33.340
(此句尚無繁中翻譯)
5:33.340–5:34.780
(此句尚無繁中翻譯)
5:34.780–5:36.240
(此句尚無繁中翻譯)
5:36.240–5:39.340
(此句尚無繁中翻譯)
5:39.340–5:41.520
(此句尚無繁中翻譯)
5:41.520–5:44.060
(此句尚無繁中翻譯)
5:44.060–5:45.820
(此句尚無繁中翻譯)
5:45.820–5:47.500
(此句尚無繁中翻譯)
5:47.500–5:49.760
(此句尚無繁中翻譯)
5:49.760–5:51.300
(此句尚無繁中翻譯)
5:51.300–5:53.560
(此句尚無繁中翻譯)
5:53.560–5:55.920
(此句尚無繁中翻譯)
5:55.920–5:57.800
(此句尚無繁中翻譯)
5:57.800–5:59.920
(此句尚無繁中翻譯)
5:59.920–6:01.240
(此句尚無繁中翻譯)
6:01.240–6:03.380
(此句尚無繁中翻譯)
6:03.380–6:05.300
(此句尚無繁中翻譯)
6:05.300–6:09.380
(此句尚無繁中翻譯)
6:09.380–6:11.320
(此句尚無繁中翻譯)
6:11.320–6:13.520
(此句尚無繁中翻譯)
6:13.520–6:16.920
(此句尚無繁中翻譯)
6:16.920–6:17.940
(此句尚無繁中翻譯)
6:17.940–6:20.800
(此句尚無繁中翻譯)
6:20.800–6:23.760
(此句尚無繁中翻譯)
6:23.760–6:26.280
(此句尚無繁中翻譯)
6:26.280–6:27.040
(此句尚無繁中翻譯)
6:27.040–6:30.180
(此句尚無繁中翻譯)
6:30.180–6:31.380
(此句尚無繁中翻譯)
6:31.380–6:33.720
(此句尚無繁中翻譯)
6:33.720–6:34.760
(此句尚無繁中翻譯)
6:34.760–6:36.680
(此句尚無繁中翻譯)
6:36.680–6:38.540
(此句尚無繁中翻譯)
6:38.540–6:41.280
(此句尚無繁中翻譯)
6:41.280–6:43.740
(此句尚無繁中翻譯)
6:43.740–6:45.680
(此句尚無繁中翻譯)
6:45.680–6:46.320
(此句尚無繁中翻譯)
6:46.320–6:47.680
(此句尚無繁中翻譯)
6:47.680–6:49.140
(此句尚無繁中翻譯)
6:49.140–6:51.420
(此句尚無繁中翻譯)
6:51.420–6:53.600
(此句尚無繁中翻譯)
6:53.600–6:55.420
(此句尚無繁中翻譯)
6:55.420–6:57.140
(此句尚無繁中翻譯)
6:57.140–6:58.220
(此句尚無繁中翻譯)
6:58.220–6:59.980
(此句尚無繁中翻譯)
6:59.980–7:02.280
(此句尚無繁中翻譯)
7:02.280–7:04.280
(此句尚無繁中翻譯)
7:04.280–7:05.380
(此句尚無繁中翻譯)
7:05.380–7:07.220
(此句尚無繁中翻譯)
7:07.220–7:08.500
(此句尚無繁中翻譯)
7:08.500–7:10.180
(此句尚無繁中翻譯)
7:10.180–7:12.040
(此句尚無繁中翻譯)
7:12.040–7:13.720
(此句尚無繁中翻譯)
7:13.720–7:16.020
(此句尚無繁中翻譯)
7:16.020–7:16.520
(此句尚無繁中翻譯)
7:16.520–7:18.160
(此句尚無繁中翻譯)
7:18.160–7:20.620
(此句尚無繁中翻譯)
7:20.620–7:22.160
(此句尚無繁中翻譯)
7:22.160–7:23.280
(此句尚無繁中翻譯)
7:23.280–7:25.220
(此句尚無繁中翻譯)
7:25.220–7:27.940
(此句尚無繁中翻譯)
7:27.940–7:29.980
(此句尚無繁中翻譯)
7:29.980–7:31.120
(此句尚無繁中翻譯)
7:31.120–7:32.220
(此句尚無繁中翻譯)
7:32.220–7:33.440
(此句尚無繁中翻譯)
7:33.440–7:34.940
(此句尚無繁中翻譯)
7:34.940–7:36.840
(此句尚無繁中翻譯)
7:36.840–7:38.780
(此句尚無繁中翻譯)
7:38.780–7:41.260
(此句尚無繁中翻譯)
7:41.260–7:43.620
(此句尚無繁中翻譯)
7:43.620–7:45.500
(此句尚無繁中翻譯)
7:45.500–7:46.920
(此句尚無繁中翻譯)
7:46.920–7:48.500
(此句尚無繁中翻譯)
7:48.500–7:50.720
(此句尚無繁中翻譯)
7:50.720–7:52.220
(此句尚無繁中翻譯)
7:52.220–7:53.940
(此句尚無繁中翻譯)
7:53.940–7:56.020
(此句尚無繁中翻譯)
7:56.020–7:58.160
(此句尚無繁中翻譯)
7:58.160–7:59.240
(此句尚無繁中翻譯)
7:59.240–8:01.300
(此句尚無繁中翻譯)
8:01.300–8:03.820
(此句尚無繁中翻譯)
8:03.820–8:05.860
(此句尚無繁中翻譯)
8:05.860–8:06.620
(此句尚無繁中翻譯)
8:06.620–8:08.660
(此句尚無繁中翻譯)
8:08.660–8:10.300
(此句尚無繁中翻譯)
8:10.300–8:11.360
(此句尚無繁中翻譯)
8:11.360–8:12.580
(此句尚無繁中翻譯)
8:12.580–8:14.420
(此句尚無繁中翻譯)
8:14.420–8:16.160
(此句尚無繁中翻譯)
8:16.160–8:17.560
(此句尚無繁中翻譯)
8:17.560–8:18.560
(此句尚無繁中翻譯)
8:18.560–8:20.640
(此句尚無繁中翻譯)
8:20.640–8:23.060
(此句尚無繁中翻譯)
8:23.060–8:25.280
(此句尚無繁中翻譯)
8:25.280–8:27.220
(此句尚無繁中翻譯)
8:27.220–8:27.780
(此句尚無繁中翻譯)
8:27.780–8:30.960
(此句尚無繁中翻譯)
8:30.960–8:32.640
(此句尚無繁中翻譯)
8:32.640–8:35.240
(此句尚無繁中翻譯)
8:35.240–8:37.840
(此句尚無繁中翻譯)
8:37.840–8:40.160
(此句尚無繁中翻譯)
8:40.160–8:42.200
(此句尚無繁中翻譯)
8:42.200–8:43.480
(此句尚無繁中翻譯)
8:43.480–8:46.580
(此句尚無繁中翻譯)
8:46.580–8:49.700
(此句尚無繁中翻譯)
0:00.000–0:03.180
zhHello 今天咱们来聊点超有意思的AI圈新鲜事
(此句尚無繁中翻譯)
0:03.180–0:05.800
zh绝对能刷新你之前对大模型的刻板印象
(此句尚無繁中翻譯)
0:05.800–0:08.260
zh今天我们来聊聊一个有点意思的模型
(此句尚無繁中翻譯)
0:08.260–0:09.800
enMindforge 27B
(此句尚無繁中翻譯)
0:09.800–0:11.600
zh听到名字里的27B
(此句尚無繁中翻譯)
0:11.600–0:14.120
zh你可能会觉得这不就是个小参数模型吗
(此句尚無繁中翻譯)
0:14.120–0:17.380
zh毕竟现在动辄千亿参数的AI模型满天飞
(此句尚無繁中翻譯)
0:17.380–0:19.340
zh27B顶多算个小个子
(此句尚無繁中翻譯)
0:19.340–0:20.860
zh但就是这个小个子
(此句尚無繁中翻譯)
0:20.860–0:23.500
zh在编程能力上却干翻了不少大块头
(此句尚無繁中翻譯)
0:23.500–0:26.020
zh在编程测试基准Program Bench上
(此句尚無繁中翻譯)
0:26.020–0:27.760
zh它的第一次尝试通过率
(此句尚無繁中翻譯)
0:27.760–0:30.560
zhPass@1达到了49.51%
(此句尚無繁中翻譯)
0:30.560–0:34.400
zh比DeepSeek第四代专业版的47.80%还高
(此句尚無繁中翻譯)
0:34.400–0:38.860
zh甚至逼近了Claude Opus 3.5的51.38%
(此句尚無繁中翻譯)
0:38.860–0:42.380
zh要知道Claude Opus 3.5可是公认的编程高手
(此句尚無繁中翻譯)
0:42.380–0:45.940
zh而Mindforge 27B只用了1001条数据训练
(此句尚無繁中翻譯)
0:45.940–0:47.560
zh这到底是咋做到的
(此句尚無繁中翻譯)
0:47.560–0:50.340
zh咱们今天就来扒一扒它背后的技术细节
(此句尚無繁中翻譯)
0:50.340–0:51.460
zh首先得说
(此句尚無繁中翻譯)
0:51.460–0:53.800
zh这个模型的核心不在参数多
(此句尚無繁中翻譯)
0:53.800–0:55.000
zh而在数据精
(此句尚無繁中翻譯)
0:55.000–0:57.540
zh传统的大模型训练编程能力
(此句尚無繁中翻譯)
0:57.540–0:59.320
zh基本都是海量堆数据
(此句尚無繁中翻譯)
0:59.320–1:01.220
zhGitHub上几百万个项目
(此句尚無繁中翻譯)
1:01.220–1:02.820
zh几十亿行代码片段
(此句尚無繁中翻譯)
1:02.820–1:05.700
zh甚至包括各种开源库的函数定义
(此句尚無繁中翻譯)
1:05.700–1:06.360
zh注释
(此句尚無繁中翻譯)
1:06.360–1:07.400
zh用法示例
(此句尚無繁中翻譯)
1:07.400–1:09.000
zh一股脑往模型里塞
(此句尚無繁中翻譯)
1:09.000–1:11.460
zh这种训练方式确实能让模型
(此句尚無繁中翻譯)
1:11.460–1:12.840
zh学会写代码的语法
(此句尚無繁中翻譯)
1:12.840–1:14.340
zh比如怎么定义变量
(此句尚無繁中翻譯)
1:14.340–1:15.200
zh写循环
(此句尚無繁中翻譯)
1:15.200–1:15.840
zh调库
(此句尚無繁中翻譯)
1:15.840–1:17.060
zh但有个大问题
(此句尚無繁中翻譯)
1:17.060–1:18.940
zh它学到的是局部技能
(此句尚無繁中翻譯)
1:18.940–1:20.320
zh而不是工程思维
(此句尚無繁中翻譯)
1:20.320–1:23.000
zh就像你让一个只会被单词的人写小说
(此句尚無繁中翻譯)
1:23.000–1:24.400
zh他可能词都认识
(此句尚無繁中翻譯)
1:24.400–1:26.020
zh但写不出连贯的故事
(此句尚無繁中翻譯)
1:26.020–1:28.960
zhMindforge 27B完全反其道而行之
(此句尚無繁中翻譯)
1:28.960–1:30.880
zh它没用海量代码片段
(此句尚無繁中翻譯)
1:30.880–1:33.280
zh而是用了1001条完整开发轨迹
(此句尚無繁中翻譯)
1:33.280–1:34.980
zh啥叫完整开发轨迹
(此句尚無繁中翻譯)
1:34.980–1:36.200
zh咱们打个比方
(此句尚無繁中翻譯)
1:36.200–1:39.400
zh你让一个程序员开发一个电商订单管理系统
(此句尚無繁中翻譯)
1:39.400–1:41.900
zh传统数据可能只给他订单创建
(此句尚無繁中翻譯)
1:41.900–1:43.360
zh这个函数的代码片段
(此句尚無繁中翻譯)
1:43.360–1:45.440
zh或者库存检查的一段逻辑
(此句尚無繁中翻譯)
1:45.440–1:47.100
zh但完整开发轨迹
(此句尚無繁中翻譯)
1:47.100–1:48.900
zh是从老板提需求开始
(此句尚無繁中翻譯)
1:48.900–1:50.680
zh到程序员分析需求
(此句尚無繁中翻譯)
1:50.680–1:51.920
zh设计系统架构
(此句尚無繁中翻譯)
1:51.920–1:52.940
zh画流程图
(此句尚無繁中翻譯)
1:52.940–1:53.720
zh写代码
(此句尚無繁中翻譯)
1:53.720–1:54.360
zh测bug
(此句尚無繁中翻譯)
1:54.360–1:55.040
zh改bug
(此句尚無繁中翻譯)
1:55.040–1:55.980
zh最后上线
(此句尚無繁中翻譯)
1:55.980–1:58.000
zh整个过程每一步的对话
(此句尚無繁中翻譯)
1:58.000–1:58.620
zh思考
(此句尚無繁中翻譯)
1:58.620–1:59.520
zh代码修改
(此句尚無繁中翻譯)
1:59.520–2:00.360
zh错误反馈
(此句尚無繁中翻譯)
2:00.360–2:01.420
zh全都有记录
(此句尚無繁中翻譯)
2:01.420–2:02.560
zh具体来说
(此句尚無繁中翻譯)
2:02.560–2:04.000
zh这1001条轨迹
(此句尚無繁中翻譯)
2:04.000–2:06.740
zh平均每条有181.6轮对话
(此句尚無繁中翻譯)
2:06.740–2:08.220
zh这不是简单的问答
(此句尚無繁中翻譯)
2:08.220–2:10.560
zh而是像真实开发团队里的协作
(此句尚無繁中翻譯)
2:10.560–2:11.680
zh比如第一轮
(此句尚無繁中翻譯)
2:11.680–2:13.380
zh用户也就是需求方说
(此句尚無繁中翻譯)
2:13.380–2:14.980
zh我们需要一个订单系统
(此句尚無繁中翻譯)
2:14.980–2:16.800
zh要支持多种支付方式
(此句尚無繁中翻譯)
2:16.800–2:18.460
zh还要能实时查库存
(此句尚無繁中翻譯)
2:18.460–2:20.020
zh模型作为开发者
(此句尚無繁中翻譯)
2:20.020–2:21.360
zh不会直接写代码
(此句尚無繁中翻譯)
2:21.360–2:22.380
zh而是先问细节
(此句尚無繁中翻譯)
2:22.380–2:24.660
zh支付方式需要支持支付宝
(此句尚無繁中翻譯)
2:24.660–2:25.980
zh微信还是银行卡
(此句尚無繁中翻譯)
2:25.980–2:28.340
zh实时查库存是扣库存前查
(此句尚無繁中翻譯)
2:28.340–2:29.560
zh还是扣库存实查
(此句尚無繁中翻譯)
2:29.560–2:30.720
zh订单取消后
(此句尚無繁中翻譯)
2:30.720–2:31.800
zh库存要不要回退
(此句尚無繁中翻譯)
2:31.800–2:33.020
zh用户回答后
(此句尚無繁中翻譯)
2:33.020–2:34.600
zh模型会接着设计架构
(此句尚無繁中翻譯)
2:34.600–2:36.280
zh我们可以分订单服务
(此句尚無繁中翻譯)
2:36.280–2:37.160
zh支付服务
(此句尚無繁中翻譯)
2:37.160–2:38.600
zh库存服务三个模块
(此句尚無繁中翻譯)
2:38.600–2:40.160
zh用消息队列解耦
(此句尚無繁中翻譯)
2:40.160–2:41.520
zh然后写代码的时候
(此句尚無繁中翻譯)
2:41.520–2:43.820
zh模型会写订单表的创建语句
(此句尚無繁中翻譯)
2:43.820–2:44.960
zh写接口定义
(此句尚無繁中翻譯)
2:44.960–2:46.000
zh写业务逻辑
(此句尚無繁中翻譯)
2:46.000–2:47.180
zh写完跑测试
(此句尚無繁中翻譯)
2:47.180–2:48.800
zh比如发现高并发时
(此句尚無繁中翻譯)
2:48.800–2:49.820
zh库存扣减不对
(此句尚無繁中翻譯)
2:49.820–2:52.300
zh模型会根据错误日志分析原因
(此句尚無繁中翻譯)
2:52.300–2:54.000
zh应该是没加分布式锁
(此句尚無繁中翻譯)
2:54.000–2:55.140
zh导致两个请求
(此句尚無繁中翻譯)
2:55.140–2:56.600
zh同时读到库存为一
(此句尚無繁中翻譯)
2:56.600–2:57.440
zh都扣了
(此句尚無繁中翻譯)
2:57.440–2:58.540
zh然后修改代码
(此句尚無繁中翻譯)
2:58.540–2:59.160
zh加锁
(此句尚無繁中翻譯)
2:59.160–2:59.980
zh再测试
(此句尚無繁中翻譯)
2:59.980–3:00.920
zh直到通过
(此句尚無繁中翻譯)
3:00.920–3:01.460
zh你看
(此句尚無繁中翻譯)
3:01.460–3:03.660
zh这181.6轮对话里
(此句尚無繁中翻譯)
3:03.660–3:05.720
zh每一轮都包含三类信息
(此句尚無繁中翻譯)
3:05.720–3:06.540
zh上下文
(此句尚無繁中翻譯)
3:06.540–3:07.920
zh之前的需求讨论
(此句尚無繁中翻譯)
3:07.920–3:08.860
zh架构设计
(此句尚無繁中翻譯)
3:08.860–3:09.560
zh动作
(此句尚無繁中翻譯)
3:09.560–3:10.580
zh写了什么代码
(此句尚無繁中翻譯)
3:10.580–3:11.360
zh改了哪里
(此句尚無繁中翻譯)
3:11.360–3:11.980
zh反馈
(此句尚無繁中翻譯)
3:11.980–3:13.220
zh测试报了什么错
(此句尚無繁中翻譯)
3:13.220–3:14.580
zh用户提了什么意见
(此句尚無繁中翻譯)
3:14.580–3:15.900
zh模型训练的时候
(此句尚無繁中翻譯)
3:15.900–3:18.280
zh就是学习这三者之间的因果链
(此句尚無繁中翻譯)
3:18.280–3:19.420
zh根据上下文
(此句尚無繁中翻譯)
3:19.420–3:20.600
zh应该做什么动作
(此句尚無繁中翻譯)
3:20.600–3:22.580
zh做了动作会得到什么反馈
(此句尚無繁中翻譯)
3:22.580–3:24.540
zh得到反馈后该怎么调整
(此句尚無繁中翻譯)
3:24.540–3:26.420
zh这比单纯学代码片段
(此句尚無繁中翻譯)
3:26.420–3:27.120
zh长什么样
(此句尚無繁中翻譯)
3:27.120–3:28.080
zh高明太多了
(此句尚無繁中翻譯)
3:28.080–3:29.120
zh他学到的是
(此句尚無繁中翻譯)
3:29.120–3:31.060
zh开发代码的全流程逻辑
(此句尚無繁中翻譯)
3:31.060–3:32.520
zh也就是工程思维
(此句尚無繁中翻譯)
3:32.520–3:34.740
zh那这些轨迹数据是怎么来的
(此句尚無繁中翻譯)
3:34.740–3:36.640
zh研究团队从开源项目的
(此句尚無繁中翻譯)
3:36.640–3:38.440
zh完整开发历史里挖出来的
(此句尚無繁中翻譯)
3:38.440–3:40.600
zh比如Github上一些知名项目的
(此句尚無繁中翻譯)
3:40.600–3:41.580
zhissue讨论区
(此句尚無繁中翻譯)
3:41.580–3:43.300
zhPull Request的修改记录
(此句尚無繁中翻譯)
3:43.300–3:44.660
zh代码评审的评论
(此句尚無繁中翻譯)
3:44.660–3:47.000
zh甚至是开发者之间的聊天记录
(此句尚無繁中翻譯)
3:47.000–3:48.000
zh当然脱敏了
(此句尚無繁中翻譯)
3:48.000–3:50.060
zh他们把这些非结构化的数据
(此句尚無繁中翻譯)
3:50.060–3:51.760
zh整理成结构化的对话
(此句尚無繁中翻譯)
3:51.760–3:52.360
zh代码
(此句尚無繁中翻譯)
3:52.360–3:53.160
zh反馈链
(此句尚無繁中翻譯)
3:53.160–3:55.380
zh每条轨迹都像一部开发日志
(此句尚無繁中翻譯)
3:55.380–3:56.620
zh记录了一个功能
(此句尚無繁中翻譯)
3:56.620–3:58.100
zh从无到有的全过程
(此句尚無繁中翻譯)
3:58.100–3:59.240
zh比如某个轨迹
(此句尚無繁中翻譯)
3:59.240–4:00.300
zh可能是开发一个
(此句尚無繁中翻譯)
4:00.300–4:01.880
zh用户登陆鉴权功能
(此句尚無繁中翻譯)
4:01.880–4:03.120
zh从最开始讨论
(此句尚無繁中翻譯)
4:03.120–4:04.900
zh用JWT还是Session
(此句尚無繁中翻譯)
4:04.900–4:06.820
zh到设计Token刷新机制
(此句尚無繁中翻譯)
4:06.820–4:08.480
zh到写登陆接口代码
(此句尚無繁中翻譯)
4:08.480–4:09.580
zh到测试发现
(此句尚無繁中翻譯)
4:09.580–4:11.120
zhToken过期时间太短
(此句尚無繁中翻譯)
4:11.120–4:12.740
zh再到调整过期时间
(此句尚無繁中翻譯)
4:12.740–4:13.980
zh加刷新接口
(此句尚無繁中翻譯)
4:13.980–4:14.860
zh最后上线
(此句尚無繁中翻譯)
4:14.860–4:15.860
zh这些细节
(此句尚無繁中翻譯)
4:15.860–4:17.240
zh传统代码数据里
(此句尚無繁中翻譯)
4:17.240–4:18.240
zh根本不会保留
(此句尚無繁中翻譯)
4:18.240–4:19.860
zh接下来是训练策略
(此句尚無繁中翻譯)
4:19.860–4:21.100
zh研究团队用了
(此句尚無繁中翻譯)
4:21.100–4:22.200
zh因果语言建模
(此句尚無繁中翻譯)
4:22.200–4:24.180
zh但不是普通的因果建模
(此句尚無繁中翻譯)
4:24.180–4:25.300
zh普通建模是
(此句尚無繁中翻譯)
4:25.300–4:26.940
zh把一段文本拆成Token
(此句尚無繁中翻譯)
4:26.940–4:28.900
zh让模型预测下一个Token
(此句尚無繁中翻譯)
4:28.900–4:30.680
zh而MindForge 27B
(此句尚無繁中翻譯)
4:30.680–4:32.160
zh把轨迹拆成片段
(此句尚無繁中翻譯)
4:32.160–4:33.040
zh每个片段
(此句尚無繁中翻譯)
4:33.040–4:34.420
zh可能是用户需求
(此句尚無繁中翻譯)
4:34.420–4:35.380
zh模型回复
(此句尚無繁中翻譯)
4:35.380–4:36.140
zh代码块
(此句尚無繁中翻譯)
4:36.140–4:37.000
zh错误日志
(此句尚無繁中翻譯)
4:37.000–4:39.780
zh然后让模型学习在什么上下文下
(此句尚無繁中翻譯)
4:39.780–4:41.600
zh该生成什么类型的片段
(此句尚無繁中翻譯)
4:41.600–4:44.220
zh比如前面是用户提了一个bug反馈
(此句尚無繁中翻譯)
4:44.220–4:47.560
zh模型就该预测错误分析和代码修改片段
(此句尚無繁中翻譯)
4:47.560–4:49.700
zh而不是直接生成代码片段
(此句尚無繁中翻譯)
4:49.700–4:53.500
zh这种结构化预测让模型更理解开发流程的节奏
(此句尚無繁中翻譯)
4:53.500–4:54.820
zh还有一个关键点
(此句尚無繁中翻譯)
4:54.820–4:57.140
zh模型在训练时会模拟错误
(此句尚無繁中翻譯)
4:57.140–4:58.260
zh传统训练里
(此句尚無繁中翻譯)
4:58.260–5:00.120
zh代码数据大多是正确的
(此句尚無繁中翻譯)
5:00.120–5:01.980
zh比如开源项目的最终代码
(此句尚無繁中翻譯)
5:01.980–5:04.760
zh模型很少看到错误代码和修复过程
(此句尚無繁中翻譯)
5:04.760–5:07.080
zh但MindForge 27B的轨迹里
(此句尚無繁中翻譯)
5:07.080–5:09.640
zh包含大量错误修复的循环
(此句尚無繁中翻譯)
5:09.640–5:11.260
zh比如模型写了一段代码
(此句尚無繁中翻譯)
5:11.260–5:12.940
zh测试爆空指针异常
(此句尚無繁中翻譯)
5:12.940–5:15.620
zh然后模型会分析哪个变量可能为空
(此句尚無繁中翻譯)
5:15.620–5:17.220
zh修改代码加判空
(此句尚無繁中翻譯)
5:17.220–5:18.080
zh再测试
(此句尚無繁中翻譯)
5:18.080–5:19.740
zh可能又爆类型不匹配
(此句尚無繁中翻譯)
5:19.740–5:20.700
zh再调整
(此句尚無繁中翻譯)
5:20.700–5:21.780
zh这种试错过程
(此句尚無繁中翻譯)
5:21.780–5:23.660
zh让模型学会了如何调试
(此句尚無繁中翻譯)
5:23.660–5:25.460
zh这不是靠记住常见bug
(此句尚無繁中翻譯)
5:25.460–5:27.720
zh而是掌握了排查问题的思路
(此句尚無繁中翻譯)
5:27.720–5:29.160
zh就像一个老程序员
(此句尚無繁中翻譯)
5:29.160–5:31.180
zh不是背会了所有bug的解法
(此句尚無繁中翻譯)
5:31.180–5:33.340
zh而是掌握了排查问题的思路
(此句尚無繁中翻譯)
5:33.340–5:34.780
zh那效果为啥这么好
(此句尚無繁中翻譯)
5:34.780–5:36.240
zh咱们再看实验细节
(此句尚無繁中翻譯)
5:36.240–5:39.340
zhProgramBench是一个很严格的编程测试集
(此句尚無繁中翻譯)
5:39.340–5:41.520
zh里面全是真实的工程任务
(此句尚無繁中翻譯)
5:41.520–5:44.060
zh比如实现一个分布式缓存系统
(此句尚無繁中翻譯)
5:44.060–5:45.820
zh优化一个数据库查询
(此句尚無繁中翻譯)
5:45.820–5:47.500
zh写一个微服务的网关
(此句尚無繁中翻譯)
5:47.500–5:49.760
zh而不是简单的写个排序算法
(此句尚無繁中翻譯)
5:49.760–5:51.300
zh它的PASS@1指标
(此句尚無繁中翻譯)
5:51.300–5:53.560
zh就是模型第一次生成的代码
(此句尚無繁中翻譯)
5:53.560–5:55.920
zh直接通过所有测试用例的比例
(此句尚無繁中翻譯)
5:55.920–5:57.800
zh这个指标比PASS@10
(此句尚無繁中翻譯)
5:57.800–5:59.920
zh尝试十次通过更靠谱
(此句尚無繁中翻譯)
5:59.920–6:01.240
zh因为实际开发中
(此句尚無繁中翻譯)
6:01.240–6:03.380
zh你不可能让模型试十次
(此句尚無繁中翻譯)
6:03.380–6:05.300
zh要的是第一次就尽量对
(此句尚無繁中翻譯)
6:05.300–6:09.380
zhMindforge 27B的PASS@1是49.51%
(此句尚無繁中翻譯)
6:09.380–6:11.320
zh意味着它几乎一半的任务
(此句尚無繁中翻譯)
6:11.320–6:13.520
zh第一次生成的代码就能跑通
(此句尚無繁中翻譯)
6:13.520–6:16.920
zh而Deepseek V4 Pro用了海量代码数据训练
(此句尚無繁中翻譯)
6:16.920–6:17.940
zh参数更大
(此句尚無繁中翻譯)
6:17.940–6:20.800
zh但PASS@1只有47.80%
(此句尚無繁中翻譯)
6:20.800–6:23.760
zhClaude Opus 4.7虽然是顶尖模型
(此句尚無繁中翻譯)
6:23.760–6:26.280
zh但也只比它高1.87个百分点
(此句尚無繁中翻譯)
6:26.280–6:27.040
zh这说明啥
(此句尚無繁中翻譯)
6:27.040–6:30.180
zh说明在编程这种强工程属性的任务里
(此句尚無繁中翻譯)
6:30.180–6:31.380
zh知道怎么开发
(此句尚無繁中翻譯)
6:31.380–6:33.720
zh比知道多少代码片段更重要
(此句尚無繁中翻譯)
6:33.720–6:34.760
zh更有意思的是
(此句尚無繁中翻譯)
6:34.760–6:36.680
zh研究团队做了个对比实验
(此句尚無繁中翻譯)
6:36.680–6:38.540
zh用同样的27B模型
(此句尚無繁中翻譯)
6:38.540–6:41.280
zh一组用1001条完整轨迹训练
(此句尚無繁中翻譯)
6:41.280–6:43.740
zh另一组用100万条代码片段
(此句尚無繁中翻譯)
6:43.740–6:45.680
zh相当于传统数据量训练
(此句尚無繁中翻譯)
6:45.680–6:46.320
zh结果
(此句尚無繁中翻譯)
6:46.320–6:47.680
zh轨迹训练的模型
(此句尚無繁中翻譯)
6:47.680–6:49.140
zh在ProgramBench上
(此句尚無繁中翻譯)
6:49.140–6:51.420
zhPASS@1是49.51%
(此句尚無繁中翻譯)
6:51.420–6:53.600
zh而海量片段训练的模型
(此句尚無繁中翻譯)
6:53.600–6:55.420
zh只有32.7%
(此句尚無繁中翻譯)
6:55.420–6:57.140
zh差了快17个百分点
(此句尚無繁中翻譯)
6:57.140–6:58.220
zh这直接证明
(此句尚無繁中翻譯)
6:58.220–6:59.980
zh高质量的全流程数据
(此句尚無繁中翻譯)
6:59.980–7:02.280
zh比海量的局部数据有效得多
(此句尚無繁中翻譯)
7:02.280–7:04.280
zh那这对中小团队意味着啥
(此句尚無繁中翻譯)
7:04.280–7:05.380
zh以前大家觉得
(此句尚無繁中翻譯)
7:05.380–7:07.220
zh要做个能写代码的AI
(此句尚無繁中翻譯)
7:07.220–7:08.500
zh得有千亿参数
(此句尚無繁中翻譯)
7:08.500–7:10.180
zh得有几十万块GPU
(此句尚無繁中翻譯)
7:10.180–7:12.040
zh得收集TB级的数据
(此句尚無繁中翻譯)
7:12.040–7:13.720
zh中小团队根本玩不起
(此句尚無繁中翻譯)
7:13.720–7:16.020
zh但Mindforge 27B告诉我们
(此句尚無繁中翻譯)
7:16.020–7:16.520
zh不用
(此句尚無繁中翻譯)
7:16.520–7:18.160
zh你只需要花精力整理
(此句尚無繁中翻譯)
7:18.160–7:20.620
zh几百上千条高质量的开发轨迹
(此句尚無繁中翻譯)
7:20.620–7:22.160
zh用个小参数模型
(此句尚無繁中翻譯)
7:22.160–7:23.280
zh比如27B
(此句尚無繁中翻譯)
7:23.280–7:25.220
zh几张V100卡就能训练
(此句尚無繁中翻譯)
7:25.220–7:27.940
zh就能做出接近顶尖大模型的效果
(此句尚無繁中翻譯)
7:27.940–7:29.980
zh这对资源有限的团队来说
(此句尚無繁中翻譯)
7:29.980–7:31.120
zh简直是福音
(此句尚無繁中翻譯)
7:31.120–7:32.220
zh不用卷算力
(此句尚無繁中翻譯)
7:32.220–7:33.440
zh不用卷数据量
(此句尚無繁中翻譯)
7:33.440–7:34.940
zh卷数据质量就行了
(此句尚無繁中翻譯)
7:34.940–7:36.840
zh比如一个小团队想做一个
(此句尚無繁中翻譯)
7:36.840–7:38.780
zh金融代码生成的专业模型
(此句尚無繁中翻譯)
7:38.780–7:41.260
zh他们不用去爬Github上所有代码
(此句尚無繁中翻譯)
7:41.260–7:43.620
zh只需要找几个资深金融工程师
(此句尚無繁中翻譯)
7:43.620–7:45.500
zh记录他们开发风控系统
(此句尚無繁中翻譯)
7:45.500–7:46.920
zh交易接口的全过程
(此句尚無繁中翻譯)
7:46.920–7:48.500
zh整理成几百条轨迹
(此句尚無繁中翻譯)
7:48.500–7:50.720
zh就能训练出一个懂金融业务
(此句尚無繁中翻譯)
7:50.720–7:52.220
zh懂工程逻辑的模型
(此句尚無繁中翻譯)
7:52.220–7:53.940
zh这种模型虽然参数小
(此句尚無繁中翻譯)
7:53.940–7:56.020
zh但比那些啥都懂一点的大模型
(此句尚無繁中翻譯)
7:56.020–7:58.160
zh在实际金融场景里更靠谱
(此句尚無繁中翻譯)
7:58.160–7:59.240
zh最后总结一下
(此句尚無繁中翻譯)
7:59.240–8:01.300
zhMindforge 27B的成功
(此句尚無繁中翻譯)
8:01.300–8:03.820
zh其实打破了一个长期存在的迷思
(此句尚無繁中翻譯)
8:03.820–8:05.860
zh编程能力等于参数规模
(此句尚無繁中翻譯)
8:05.860–8:06.620
zh它证明
(此句尚無繁中翻譯)
8:06.620–8:08.660
zh在编程这种需要强逻辑
(此句尚無繁中翻譯)
8:08.660–8:10.300
zh强工程思维的领域
(此句尚無繁中翻譯)
8:10.300–8:11.360
zh数据的质量
(此句尚無繁中翻譯)
8:11.360–8:12.580
zh是不是全流程
(此句尚無繁中翻譯)
8:12.580–8:14.420
zh是不是包含试错过程
(此句尚無繁中翻譯)
8:14.420–8:16.160
zh是不是有完整上下文
(此句尚無繁中翻譯)
8:16.160–8:17.560
zh比数据量更重要
(此句尚無繁中翻譯)
8:17.560–8:18.560
zh就像教徒弟
(此句尚無繁中翻譯)
8:18.560–8:20.640
zh你让他看一万行代码片段
(此句尚無繁中翻譯)
8:20.640–8:23.060
zh不如让他跟着你完整做十个项目
(此句尚無繁中翻譯)
8:23.060–8:25.280
zh因为前者只能让他记住怎么写
(此句尚無繁中翻譯)
8:25.280–8:27.220
zh后者能让他学会怎么做
(此句尚無繁中翻譯)
8:27.220–8:27.780
zh未来
(此句尚無繁中翻譯)
8:27.780–8:30.960
zh可能会有更多这种小而美的专业模型出现
(此句尚無繁中翻譯)
8:30.960–8:32.640
zh他们不需要千亿参数
(此句尚無繁中翻譯)
8:32.640–8:35.240
zh只需要几千条高质量的领域轨迹
(此句尚無繁中翻譯)
8:35.240–8:37.840
zh就能在特定领域达到顶尖水平
(此句尚無繁中翻譯)
8:37.840–8:40.160
zh这对AI的普及来说是件好事
(此句尚無繁中翻譯)
8:40.160–8:42.200
zh毕竟不是每个团队都有谷歌
(此句尚無繁中翻譯)
8:42.200–8:43.480
zhOpenAI的资源
(此句尚無繁中翻譯)
8:43.480–8:46.580
zh但每个团队都可能拥有高质量的领域数据
(此句尚無繁中翻譯)
8:46.580–8:49.700
zhMindforge 27B算是给我们开了个好头
(此句尚無繁中翻譯)

影片筆記:27B模型在编程任务上干掉了deepseek-v4

一句話總結

影片介紹了名為 Mindforge 27B 的 AI 模型,該模型僅有 27B 參數,卻透過使用僅 1001 條包含完整開發軌跡(含試錯與除錯過程)的高質量數據進行訓練,在 Program Bench 基準測試中超越了 DeepSeek 第四代專業版,證明了在編程領域,全流程高質量數據比海量代碼片段更為有效。

核心重點

  1. 小參數大表現:Mindforge 27B 僅有 27B 參數,但在編程任務上表現優異,Pass@1 達到 49.51%,超越了 DeepSeek 第四代專業版(47.80%),並逼近 Claude Opus 3.5(51.38%)。
  2. 數據策略革命:傳統大模型依賴海量代碼片段,而 Mindforge 27B 僅使用 1001 條「完整開發軌跡」進行訓練。
  3. 完整開發軌跡定義:這些軌跡記錄了從需求分析、架構設計、編碼、測試到除錯的完整對話與邏輯鏈,平均每條軌跡包含 181.6 輪對話。
  4. 工程思維學習:模型不僅學習代碼,更學習上下文、動作與反饋之間的因果鏈,掌握開發全流程邏輯與排查問題的思路。
  5. 中小團隊可行性:此方法打破了編程能力等於參數規模的迷思,資源有限的團隊只需整理幾百上千條高質量開發軌跡,即可訓練出懂業務、懂工程邏輯的專業模型。

詳細大綱

一、 Mindforge 27B 的表現與爭議

  • 參數規模與表現的反差
  • Mindforge 27B 被視為「小參數模型」。
  • 在 Program Bench 基準測試中,Pass@1 達到 49.51%。
  • 超越 DeepSeek 第四代專業版(47.80%)。
  • 逼近 Claude Opus 3.5(51.38%)。
  • 訓練數據量極小:僅使用 1001 條數據進行訓練。

二、 核心技術:數據精煉 vs. 海量堆疊

  • 傳統大模型訓練方式
  • 依賴海量數據(GitHub 數百萬項目、數十億行代碼片段)。
  • 包含函數定義、註釋、用法示例。
  • 缺點:僅學會局部技能(語法、變量定義、循環、調庫),缺乏工程思維。
  • Mindforge 27B 的反向操作
  • 不使用海量代碼片段。
  • 使用 1001 條「完整開發軌跡」。
  • 完整開發軌跡定義:記錄從需求提出到上線的全過程。
  • 包含:需求分析、系統架構設計、流程圖、編碼、測試、除錯、上線。
  • 包含:每一步的對話、思考、代碼修改、錯誤反饋。
  • 數據特徵:平均每條軌跡包含 181.6 輪對話。
  • 對話結構範例
  1. 上下文:需求討論(如支付方式、庫存查詢邏輯)。
  2. 動作:架構設計(模組劃分、消息隊列解耦)、編寫代碼(創建語句、接口定義)。
  3. 反饋:測試錯誤(如高併發庫存扣減錯誤)、模型分析原因(缺少分布式鎖)、修改代碼、再次測試。
  • 訓練目標:學習上下文、動作、反饋三者之間的因果鏈,掌握開發全流程邏輯(工程思維)。

三、 數據來源與處理

  • 數據來源:從開源項目的完整開發歷史中挖掘。
  • GitHub 知名項目的 Issue 討論區。
  • Pull Request 的修改記錄。
  • 代碼評論。
  • 開發者之間的聊天記錄(已脫敏)。
  • 數據整理:將非結構化數據整理為結構化的對話、代碼、反饋鏈。
  • 軌跡範例:開發用戶登錄鑑權功能,從討論 JWT/Session、設計 Token 刷新機制、編寫接口、測試發現 Token 過期時間過短、調整過期時間與刷新接口,直至上線。

四、 訓練策略:因果語言建模

  • 普通因果建模:將文本拆分為 Token,預測下一個 Token。
  • Mindforge 27B 的建模方式
  • 將軌跡拆分為片段(用戶需求、模型回覆、代碼塊、錯誤日誌)。
  • 讓模型學習在特定上下文下生成特定類型的片段。
  • 結構化預測:例如,若前文是 Bug 反饋,模型預測錯誤分析和代碼修改片段,而非直接生成代碼。
  • 目的:讓模型理解開發流程的節奏。

五、 模擬錯誤與除錯能力

  • 傳統訓練缺失:代碼數據多為最終正確代碼,模型很少看到錯誤代碼和修復過程。
  • Mindforge 27B 的優勢
  • 軌跡中包含大量錯誤修復循環。
  • 範例:代碼爆空指針異常 -> 分析變量 -> 加判空 -> 測試爆類型不匹配 -> 調整。
  • 結果:模型學會排查問題的思路,而非僅記住常見 Bug 解法。

六、 實驗結果與對比

  • Program Bench 基準測試
  • 包含真實工程任務(分布式緩存系統、數據庫查詢優化、微服務網關)。
  • Pass@1 指標:模型第一次生成的代碼直接通過所有測試用例的比例。
  • Mindforge 27B:Pass@1 為 49.51%。
  • DeepSeek V4 Pro:Pass@1 為 47.80%。
  • Claude Opus 4.7:僅比 Mindforge 27B 高 1.87 個百分點。
  • 對比實驗
  • 組別 A:27B 模型 + 1001 條完整軌跡訓練 -> Pass@1 49.51%。
  • 組別 B:27B 模型 + 100 萬條代碼片段訓練 -> Pass@1 32.7%。
  • 結論:高質量全流程數據比海量局部數據有效得多(相差近 17 個百分點)。

七、 對中小團隊的意義

  • 打破迷思:編程能力不等於參數規模。
  • 資源需求降低
  • 無需千亿參數、數十萬塊 GPU、TB 級數據。
  • 只需整理幾百上千條高質量開發軌跡。
  • 可使用小參數模型(如 27B),幾張 V100 卡即可訓練。
  • 應用場景範例
  • 中小團隊可記錄資深工程師開發特定領域(如金融風控系統、交易接口)的全過程。
  • 整理成幾百條軌跡,訓練出懂業務、懂工程邏輯的專業模型。
  • 雖參數小,但在特定場景比「啥都懂一點」的大模型更可靠。

八、 總結與展望

  • 核心結論:在編程領域,數據質量(是否全流程、是否包含試錯、是否有完整上下文)比數據量更重要。
  • 比喻:讓徒弟跟隨完整做十個項目,比看一萬行代碼片段更有效。
  • 未來趨勢
  • 出現更多「小而美」的專業模型。
  • 只需幾千條高質量領域軌跡,即可在特定領域達到頂尖水平。
  • 促進 AI 普及,讓資源有限的團隊也能擁有高質量領域數據優勢。

工具 / 模型 / 名詞整理

  • Mindforge 27B:影片討論的核心模型名稱,僅有 27B 參數。
  • Program Bench:編程測試基準名稱。
  • DeepSeek 第四代專業版:對比模型,Pass@1 為 47.80%。
  • Claude Opus 3.5:對比模型,Pass@1 為 51.38%。
  • DeepSeek V4 Pro:對比模型,Pass@1 為 47.80%。
  • Claude Opus 4.7:對比模型,僅比 Mindforge 27B 高 1.87 個百分點。
  • GitHub:開源代碼托管平台,數據來源之一。
  • V100:提及的用於訓練的 GPU 型號。
  • JWT (JSON Web Tokens):提及的登錄鑑權技術。
  • Session:提及的登錄鑑權技術。
  • Token:提及的驗證令牌。
  • Pass@1:測試指標,指模型第一次生成的代碼直接通過所有測試用例的比例。
  • Pass@10:測試指標名稱(提及但未詳細展開數值)。
  • 27B:參數規模描述。
  • 1001 條:訓練數據的條數。
  • 181.6 輪:平均每條軌跡的對話輪數。
  • 49.51%:Mindforge 27B 的 Pass@1 指標數值。
  • 47.80%:DeepSeek 第四代專業版 / DeepSeek V4 Pro 的 Pass@1 數值。
  • 51.38%:Claude Opus 3.5 的 Pass@1 數值。
  • 32.7%:使用 100 萬條代碼片段訓練的 27B 模型的 Pass@1 數值。
  • 1.87 個百分點:Claude Opus 4.7 與 Mindforge 27B 的差距。
  • 17 個百分點:兩組對比實驗(完整軌跡 vs. 海量片段)的差距。

操作流程整理

  1. 數據挖掘:從 GitHub 知名項目的 Issue 討論區、Pull Request 修改記錄、代碼評論及開發者聊天記錄(已脫敏)中挖掘完整開發歷史。
  2. 數據整理:將非結構化數據整理為結構化的對話、代碼、反饋鏈,形成「完整開發軌跡」。
  • 確保軌跡包含:需求分析、系統架構設計、流程圖、編碼、測試、除錯、上線。
  • 確保軌跡包含:每一步的對話、思考、代碼修改、錯誤反饋。
  1. 模型訓練
  • 使用 Mindforge 27B 模型。
  • 採用因果語言建模策略,將軌跡拆分為片段(用戶需求、模型回覆、代碼塊、錯誤日誌)。
  • 讓模型學習在特定上下文下生成特定類型的片段(結構化預測),理解開發流程節奏。
  1. 評估測試
  • 使用 Program Bench 基準測試。
  • 測試指標為 Pass@1(首次嘗試通過率)。
  • 對比不同數據策略(完整軌跡 vs. 海量片段)及不同模型(Mindforge 27B vs. DeepSeek vs. Claude)的表現。

值得注意的限制或風險

  • 數據獲取難度:需要從開源項目中挖掘並整理高質量的完整開發軌跡,這可能涉及數據清洗和結構化的複雜工作。
  • 領域特定性:雖然模型在特定領域表現優異,但其參數規模較小,可能不如大模型在通用任務上靈活。
  • 數據質量依賴:模型表現高度依賴訓練數據的質量,若軌跡數據本身存在邏輯錯誤或質量不佳,可能影響模型效果。
  • 計算資源:雖然相比超大模型所需資源較少,但仍需一定的計算資源(如 V100 卡)進行訓練。

逐字稿辨識疑點

  • Mindforge 27B:模型名稱,逐字稿中多次出現,保留原樣。
  • Program Bench:測試基準名稱,保留原樣。
  • DeepSeek 第四代專業版:模型版本描述,保留原樣。
  • Claude Opus 3.5:模型版本,保留原樣。
  • DeepSeek V4 Pro:模型版本,保留原樣。
  • Claude Opus 4.7:模型版本,保留原樣。
  • V100:GPU 型號,保留原樣。
  • Pass@1:測試指標名稱,保留原樣。
  • Pass@10:測試指標名稱,保留原樣。
  • 27B:參數規模描述,保留原樣。
  • 1001 條:數據條數,保留原樣。
  • 181.6 輪:對話輪數,保留原樣。
  • 49.51%:Pass@1 指標數值,保留原樣。
  • 47.80%:DeepSeek 第四代專業版 Pass@1 數值,保留原樣。
  • 51.38%:Claude Opus 3.5 Pass@1 數值,保留原樣。
  • 32.7%:海量片段訓練模型 Pass@1 數值,保留原樣。
  • 1.87 個百分點:Claude Opus 4.7 與 Mindforge 27B 的差距,保留原樣。
  • 17 個百分點:兩組對比實驗的差距,保留原樣。

可延伸追問

  1. Mindforge 27B 的訓練成本具體是多少?與訓練同等規模但使用海量代碼片段的模型相比,成本節省了多少?
  2. 除了編程任務,這種「完整開發軌跡」的訓練方法是否適用於其他領域(如自然語言處理、數據分析)?
  3. 如何確保從 GitHub 等開源項目中挖掘的數據的隱私性和合規性?
  4. Mindforge 27B 在處理複雜、多步驟的編程任務時,是否會出現邏輯斷層或上下文丟失的情況?
  5. 對於中小團隊而言,如何高效地收集和整理高質量的開發軌跡數據?是否有現成的工具或平台支持?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習