0:00.000–0:07.460
zh大家好 欢迎收看新一期视频
0:07.460–0:10.720
zhDeepseek刚刚发布了一个很有意思的更新
0:10.720–0:14.980
zhDeepseek V4 Flash官方API现已开启公测
0:14.980–0:19.240
zh新版本命名为Deepseek V4 Flash 0731
0:19.240–0:21.600
zh这可不只是一个小补丁
0:21.600–0:25.000
zhDeepseek表示他们大幅提升了智能体能力
0:25.000–0:27.180
zh在该模型上甚至
0:27.180–0:30.600
zh使其测试分数如今已远超V4 Pro预览版
0:30.600–0:31.780
zh也就是说
0:31.780–0:33.980
zh这个小模型现在击败了预览版
0:33.980–0:36.720
zh极大模型在智能体任务上的版本
0:36.720–0:38.420
zh这确实挺疯狂的
0:38.420–0:40.420
zh我也用我自己的Kinbench测试了它
0:40.420–0:42.320
zh而在我的基准测试中
0:42.320–0:43.040
zh它做到了
0:43.040–0:45.200
zh其他任何模型都未曾做到的事
0:45.200–0:46.400
zh包括Claude 3.5
0:46.400–0:48.360
zh以及Opus稍后我们会细聊
0:48.360–0:48.860
zh但首先
0:48.860–0:51.040
zh我们先聊聊这次更新到底是什么
0:51.040–0:53.340
zh前阵子我介绍过DeepSeek V4 Pro
0:53.340–0:55.120
zh和V4 Flash的预览版
0:55.120–0:58.120
zh包括如何通过NVIDIA Link免费使用它们
0:58.120–0:59.560
zh视频链接已放在下方
0:59.560–1:00.940
zh我们先快速回顾一下Flash
1:00.940–1:03.120
zh它是V4系列中较小的模型
1:03.120–1:05.400
zh该混合专家模型拥有2000
1:05.400–1:07.720
zh0840亿的总参数量
1:07.720–1:09.660
zh约130亿激活参数
1:09.660–1:12.000
zh支持100万Token上下文窗口
1:12.000–1:13.780
zh它定位为主打快速
1:13.780–1:15.180
zh与低成本版本
1:15.180–1:15.900
zh而V4 Pro
1:15.900–1:18.200
zh是1.6万亿参数旗舰大模型
1:18.200–1:19.940
zh关于这次0731更新
1:19.940–1:21.040
zh有一个关键细节
1:21.040–1:22.500
zhDeepSeek明确表示
1:22.500–1:24.340
enV4Flash 0731
1:24.340–1:26.540
zh保持了完全相同的模型架构
1:26.540–1:29.060
zh和参数规模与预览版完全一致
1:29.060–1:30.700
zh所以它并没有变大
1:30.700–1:31.300
zh依然是
1:31.300–1:33.480
zh那款2840亿参数的Flash
1:33.480–1:34.820
zh但在此基础上
1:34.820–1:36.880
zh它似乎进行了高强度的智能体后训练
1:36.880–1:39.640
zh所有的性能提升都源于训练的优化
1:39.640–1:41.200
zh而不是增加参数量
1:41.200–1:42.240
zh他们还明确指出
1:42.240–1:45.040
zh这次升级仅是用于DeepSeek V4 Flash API
1:45.040–1:46.480
enV4 Pro API
1:46.480–1:48.240
zh以及App端模型
1:48.240–1:50.120
zh和网页端目前都保持不变
1:50.120–1:52.000
zh公告最后提到
1:52.000–1:54.240
zhDeepSeek V4 Pro的正式版本
1:54.240–1:55.960
zh很快就会发布
1:55.960–1:58.240
zh所以这次Flash更新基本只是热身
1:58.240–2:00.780
zh真正的重头戏还在后头
2:00.780–2:01.720
zh另外
2:01.720–2:03.260
zh这次发布中还有一点
2:03.260–2:05.020
zh我觉得非常明智
2:05.020–2:08.940
zh官方V4 Flash现在原生支持Response API格式
2:08.940–2:11.620
zhDeepSeek还表示他已完全适配Codex
2:11.620–2:13.820
zh所以他们不仅是发布了一个模型
2:13.820–2:15.880
zh而不是被动等待工具链的适配
2:15.880–2:18.280
zh他们直接面向Codex适配框架进行了开发
2:18.280–2:20.320
zh这意味着你可以将其接入
2:20.320–2:22.980
zh到Codex风格的工作流中且毫无阻碍
2:22.980–2:25.740
zhGLM以及国内的其他一些实验室也在做
2:25.740–2:26.940
zh类似的框架适配
2:26.940–2:28.840
zh事实证明效果立竿见影
2:28.840–2:30.100
zh这确实是个明智之举
2:30.100–2:32.440
zh接下来看看官方的基准测试数据
2:32.440–2:33.820
zh这次性能提升太惊人了
2:33.820–2:35.180
zh在Terminal Bench 2.1测试中
2:35.180–2:37.440
zh新版Flash跑分高达82.7
2:37.440–2:39.960
zh而此前的预览版仅为61.8
2:39.960–2:42.980
zh甚至连V4 Pro预览版也只有72.1分
2:42.980–2:46.260
zh这也让它超越了81分的GLM-4-0520
2:46.260–2:49.160
zh而且距离85分的OPUS差距并不大
2:49.160–2:51.300
zh要知道后者的价格可要贵得多
2:51.300–2:52.800
zh而最夸张的是SWBEC
2:52.980–2:55.580
zh预览版在这个测试中仅获得了7.3分
2:55.580–2:58.040
zh而新版本直接飙升到54.4分
2:58.040–2:59.900
zh实现了从基本无法使用
2:59.900–3:03.900
zh到足以与46.2分的GLM4-0520正面竞争的水平
3:03.900–3:05.920
zh甚至是58分的OPUS
3:05.920–3:08.140
zhCybergen也从38.7分
3:08.140–3:10.680
zh升至76.7分,CoderEval从
3:10.680–3:13.280
zh从49.7分升至70.3分
3:13.280–3:15.500
zh在其内部DSBench测试集上
3:15.500–3:18.260
zh全栈任务得分从37升至68.7
3:18.260–3:20.380
zh高难度编码智能体任务也
3:20.380–3:22.740
zh从25.8升至59.6
3:22.740–3:23.800
zh总的来说
3:23.800–3:25.840
zh这较其自身的预览版有了巨大飞跃
3:25.840–3:28.200
zh且在大多数智能体基准测试中
3:28.200–3:29.820
zh它已逼近OPUS 4.8
3:29.820–3:31.820
zh而它作为一款尺寸小得多
3:31.820–3:33.160
zh且更便宜的模型
3:33.160–3:34.100
zh不过需要说明的是
3:34.100–3:35.120
zhDeepSeek指出
3:35.120–3:36.820
zh在公开的编码智能体任务测试中
3:36.820–3:38.380
zhV4 Flash使用了
3:38.380–3:41.360
zh其即将推出的Deep-C Harness框架在极简模式下
3:41.360–3:42.760
zh以最高档位运行
3:42.760–3:44.120
zh且Top-p采样设为0.95
3:44.120–3:45.840
zh温度参数设为一可见
3:45.840–3:47.500
zh测试框架的选择至关重要
3:47.500–3:49.000
zh测试结果可能不同
3:49.000–3:50.580
zh数据仅供参考
3:50.580–3:52.660
zh不过了解本频道的人都知道
3:52.660–3:54.640
zh我们从不只看官方宣传数据
3:54.640–3:56.380
zh所以我用自己的基准测试跑了一下
3:56.380–3:58.360
zh话不多说我们直接切入正题
3:58.360–3:59.440
zh和往常一样
3:59.440–4:00.860
zh我用我的TingBench进行了测试
4:00.860–4:02.400
zh其中涵盖了一些前端
4:02.400–4:05.200
zh与动画一些Three.js任务以及SVG测试
4:05.200–4:08.780
zh一道数学题以及一个长程智能体任务
4:08.780–4:10.720
zh最后还有一个超难的3D任务
4:10.720–4:12.500
zh每项测试满分10分
4:12.500–4:15.280
zh最后我们会通过最终的图表来看看
4:15.280–4:18.060
zh看看它的表现与其他模型相比如何
4:18.060–4:19.880
zh第一题是电梯模拟
4:19.880–4:22.300
zh模型需要构建一个模拟程序
4:22.300–4:24.520
zh你可以在不同楼层生成乘客
4:24.520–4:26.020
zh共有三部电梯
4:26.020–4:27.500
zh其每部只能在一人
4:27.500–4:29.980
zh没赶上的人需要搭乘下一班电梯
4:29.980–4:32.760
zh还需要有提示框显示每个人的目标楼层
4:32.760–4:34.720
zh当鼠标悬停在他们身上时
4:34.720–4:36.500
zh我们发送提示词看看效果
4:36.500–4:38.020
zh这个表现只能算一半
4:38.020–4:40.000
zh得了五分基本框架是有了
4:40.000–4:42.020
zh但关于乘客没赶上电梯
4:42.020–4:44.620
zh并被下一班电梯接走的核心逻辑并没有完全跑通
4:44.620–4:46.500
zh而且动画也不够流畅
4:46.500–4:47.360
zh作为参考
4:47.360–4:49.860
zh只有OPUS模型在这项测试中拿过10分
4:49.860–4:51.800
zh而像CLAUDE 3.5这样的模型
4:51.800–4:53.620
zh和Kimi k3也只有9分
4:53.620–4:55.540
zh所以这开局只能算重归原矩
4:55.540–4:58.640
zh第二个测试是Three.js隐形眼镜盒
4:58.640–5:01.240
zh它需要生成一个3D模型
5:01.240–5:04.940
zh是一个带有明显L和R标识盖子的隐形眼镜盒
5:04.940–5:08.660
zh并且点击盖子能够将其打开这项测试
5:08.660–5:11.280
zh几乎所有模型都会在这里翻车
5:11.280–5:12.480
zh我们发送过去看看
5:12.480–5:14.800
zh好的 这其实做得非常好
5:14.800–5:16.140
zh它拿到了8分
5:16.140–5:17.880
zh盒子看起来很像样
5:17.880–5:19.300
zh像个合格的眼镜盒L
5:19.300–5:21.800
zh而且L和R盖也清晰可见
5:21.800–5:23.240
zh点击打开的交互也有效
5:23.240–5:25.080
zh这让他与Qwen 2.5 Maths并列
5:25.080–5:26.420
zh而Opus拿到了5分
5:26.420–5:27.340
zh是历史第二高分
5:27.340–5:29.520
zh在该测试中仅次于Claude 3.5
5:29.520–5:31.140
zh他仍然是唯一在这个测试中
5:31.140–5:32.180
zh拿到满分10分的模型
5:32.180–5:33.860
zh所以对于一个小模型来说
5:33.860–5:35.640
zh能有这样的表现已经非常惊艳了
5:35.640–5:37.120
zh第三题是
5:37.120–5:38.580
zhFreeJF折叠桌
5:38.580–5:39.860
zh这里有一个滑块
5:39.860–5:42.040
zh当你向右拖动它时
5:42.040–5:43.400
zh桌子应该展开
5:43.400–5:44.780
zh向左拖则折叠回去
5:44.780–5:46.480
zh动画需要无缝衔接
5:46.480–5:48.500
zh且呈现出真正的3D效果
5:48.500–5:49.780
zh我们发送请求看看
5:49.780–5:51.260
zh这个得到了7分
5:51.260–5:52.780
zh桌子确实能折叠起来
5:52.780–5:55.220
zh并能随滑块拖动而展开
5:55.220–5:56.820
zh过渡基本自然
5:56.820–5:58.400
zh只是还不够完全流畅
5:58.400–6:00.160
zh表现最好的模型
6:00.160–6:01.160
zh如Claude 3.5
6:01.160–6:02.340
enKIMI GLM4
6:02.340–6:03.800
zh以及Sonnet 3.5
6:03.800–6:05.440
zh在这项测试中都拿到了9分
6:05.440–6:06.640
zh但对比来看
6:06.640–6:08.460
zhOpus在这项测试中仅得了5分
6:08.460–6:10.740
zh所以这表现绝对算很不错了
6:10.740–6:13.060
zh第四题是生成熊猫的SVG
6:13.060–6:14.220
zh吃着汉堡
6:14.220–6:15.420
zh我们发送过去看看
6:15.420–6:16.500
zh好
6:16.500–6:18.620
zh这确实能看出是一只熊猫
6:18.620–6:20.420
zh也能看出是汉堡
6:20.420–6:21.860
zh但构图有点别扭
6:21.860–6:24.620
zh而且看起来不太像在吃汉堡
6:24.620–6:26.020
zh这题给五分
6:26.020–6:28.000
zh在这项测试中
6:28.000–6:31.600
zh像Kimi和Gemini 1.5这样表现最好的模型
6:31.600–6:35.240
zh以及Qwen 2.5 Max得分也仅为8分
6:35.240–6:37.340
zh所以并不算惊艳
6:37.340–6:39.180
zh第五题是制作弓箭
6:39.180–6:41.940
zh模拟游戏里面设计了四个靶子
6:41.940–6:44.700
zh玩家需要以最短的时间击中所有靶子
6:44.700–6:46.120
zh从而登上排行榜
6:46.120–6:47.740
zh我们发送代码运行一下看看
6:47.740–6:49.140
zh这道题得了7分
6:49.140–6:50.960
zh核心射击机制可以正常运行
6:50.960–6:52.660
zh靶子能判定击中
6:52.660–6:54.040
zh排行榜功能也正常
6:54.040–6:56.200
zh但整体手感和细节打磨
6:56.200–6:57.840
zh还达不到顶尖模型的水平
6:57.840–7:00.740
zh比如Groq 1.5和Qwen 2.5 Math
7:00.740–7:03.560
zh虽然Opus模型在这里都拿了满分
7:03.560–7:05.100
zh但这依然是个可玩的游戏
7:05.100–7:06.960
zh所以表现还算不错
7:06.960–7:09.240
zh第六题是一道数学难题
7:09.240–7:11.320
zh关于计算有序队的排列数
7:11.320–7:13.300
zh答案应该是2460
7:13.300–7:15.740
zh很多模型在这一题上完全翻车
7:15.740–7:16.620
zh我们提交一下
7:16.620–7:17.700
zh看看
7:17.700–7:19.860
zh他完美答对了2460
7:19.860–7:21.420
zh完全正确
7:21.420–7:22.640
zh拿了满分10分
7:22.640–7:24.300
zh这让他跻身同一梯队
7:24.300–7:26.160
zh与Claude 3.5
7:26.160–7:26.800
enGemini Chat
7:26.800–7:28.060
enQwen Max
7:28.060–7:29.400
zh以及Opus模型并列
7:29.400–7:30.060
zh有趣的是
7:30.060–7:31.600
zh在我测试时
7:31.600–7:33.760
zhV4 Pro预览版也做对了这道题
7:33.760–7:37.320
zh所以V4系列的推理能力显然非常过硬
7:37.320–7:40.600
zh第七题是一个复杂的长程任务
7:40.600–7:43.580
zh生成一个关于熊猫知识的数据集
7:43.580–7:46.880
zh并用该数据集微调一个Gemma 2B模型
7:46.880–7:51.240
zh接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识
7:51.240–7:53.500
zh全程从零开始完全自主完成
7:53.500–7:55.180
zh且完全在本地运行
7:55.180–7:56.500
zh我们启动任务看看效果
7:56.500–7:58.560
zh这次的表现绝对可以达满分
7:58.560–8:01.040
zh它生成了数据集并完成了整个微调
8:01.040–8:03.260
zh独自运行期间完全没有卡壳
8:03.672–8:05.532
zh生成的Web UI正常运行
8:05.532–8:08.052
zh每次刷新都显示新的熊猫冷知识
8:08.052–8:11.372
zh这正是那种复杂的长程智能体任务
8:11.372–8:13.392
zhDeepSeek 声称对其进行过针对性升级
8:13.392–8:14.472
zh说实话
8:14.472–8:15.432
zh效果显而易见
8:15.432–8:17.192
zh之前的预览版远没这么可靠
8:17.192–8:19.372
zh这波表现确实堪称完美
8:19.372–8:21.032
zh第八题也是最后一题
8:21.032–8:22.112
zh是制作一个3D万年历
8:22.112–8:23.992
zh要求是一个功能完整的3D万年历
8:23.992–8:25.392
zh能显示当前实际时间
8:25.392–8:26.312
zh秒针 分针
8:26.312–8:27.832
zh以及时针都要平滑转动
8:27.832–8:28.492
zh还要有日期
8:28.492–8:29.492
zh核心日期显示
8:29.492–8:30.112
zh以及双时区
8:30.112–8:31.632
zh这是整个测试集中最难的一题
8:31.632–8:33.172
zh之前没有任何模型
8:33.172–8:34.572
zh能在这道题上拿到好成绩
8:34.572–8:36.712
zh历史最高分是GPT-4o创下的
8:36.712–8:37.452
zh4分
8:37.452–8:38.612
zh让我们直接运行测试
8:38.612–8:39.672
zh但令人惊喜的是
8:39.672–8:41.572
zhDeepSeek V4 Flash竟然拿到了6分
8:41.572–8:43.212
zh创下这道题历史记录
8:43.212–8:44.772
zh手表完整呈现出来
8:47.192–8:48.272
zh指针转动平滑
8:48.272–8:49.552
zh指针实时同步时间
8:49.552–8:51.352
zh双时区设置也基本正常
8:51.352–8:52.172
zh虽然还不完美
8:52.172–8:54.152
zh所以没能拿到更高的分数
8:54.152–8:56.112
zh但这个小模型刚刚击败了
8:56.112–8:57.092
enCloud 3.5 Opus
8:57.092–8:59.272
zh以及我测试集最难题目上的
8:59.272–9:00.332
zh其他所有前沿模型
9:00.332–9:02.092
zh这完全出乎我的意料
9:02.092–9:03.892
zh来看一下最终的图表
9:03.892–9:05.932
enDeep Seek V4 Flash 0731
9:05.932–9:07.912
zh最终拿到了58分
9:07.912–9:10.052
zh得分率为72.5%
9:10.052–9:10.712
zh这让它排在
9:10.712–9:15.272
zh略高于GPT-4o-513的71.25%
9:15.272–9:18.852
zh稍低于Gemini 1.5 Pro的75%
9:18.852–9:19.752
zh而在它之上
9:19.752–9:21.172
zh有Kimi和
9:21.172–9:23.352
zhOpenAI并列77.5%
9:23.352–9:25.192
zhGPT-4o-2024-05-13达80%
9:25.192–9:25.832
zh接着是Qwen
9:25.832–9:29.152
zhQwen 2.5 Max拿下81.25%
9:29.152–9:32.032
zh而Claude 3.5仍以82.5%稳居榜首
9:32.032–9:33.572
zh而对比以下背景
9:33.572–9:35.092
zh你就能明白这有多惊人
9:35.092–9:37.732
zh我之前测试DeepSeek V4 Pro预览版时
9:37.732–9:40.532
zh它在此测试中仅得了24.8%
9:40.532–9:44.092
zh新的Flash模型得分达到了72.5%
9:44.092–9:45.892
zh这意味着该系列的小模型现在
9:45.892–9:48.472
zh比大模型预览版的表现提升了近三倍
9:48.472–9:49.872
zh在我的测试中
9:49.872–9:52.572
zh而且在架构和尺寸与预览版相同
9:52.572–9:54.892
zh单靠后训练就能取得惊人提升
9:54.892–9:55.472
zh不可思议
9:55.472–9:59.052
zh这也印证了DeepSeek所宣称的Agent能力升级
9:59.052–10:01.932
zh从得分规律中也可以清楚地看到
10:01.932–10:03.712
zh所有逻辑推理
10:03.712–10:06.892
zh或长程Agent任务基本上都拿到了满分
10:06.892–10:09.292
zh比如数学和微调任务
10:09.292–10:11.532
zh还有创纪录的代码生成常识
10:11.532–10:14.112
zh但像熊猫SVG这种纯视觉打磨的任务
10:14.112–10:15.252
zh还有电梯动画
10:15.252–10:16.892
zh在这些方面它的表现依然平平
10:16.892–10:18.592
zh所以这确实很像是一个
10:18.592–10:20.372
zh针对智能体编程深度微调的模型
10:20.372–10:22.292
zh正如官方基准测试所示
10:22.292–10:23.292
zh那么结论是什么
10:23.292–10:25.532
zh这绝对是目前性价比最高的模型之一
10:25.532–10:26.772
zh可用于智能体编程
10:26.772–10:27.792
zh在我的测试中
10:27.792–10:29.692
zh它的表现已经达到了Gemini 1.5 Pro的水平
10:29.692–10:32.012
zh它可以直接接入Cursor等代码工具
10:32.012–10:33.392
zh这得益于其API知识
10:33.392–10:34.972
zh而且DeepSeek的价格
10:34.972–10:36.312
zh一直都非常便宜
10:36.312–10:37.112
zh如果你是学生
10:37.112–10:39.092
zh或者对于预算有限的开发者
10:39.092–10:40.412
zh这绝对是个极佳的选择
10:40.412–10:42.612
zh它显然还无法击败Claude 3.5
10:42.612–10:44.572
zh或是在综合表现上超越OPUS
10:44.572–10:46.672
zh而且他的视觉能力依然表现平平
10:46.672–10:48.252
zh但考虑到他的体量和价格
10:48.252–10:49.292
zh这已经足够惊艳了
10:49.292–10:50.032
zh而且别忘了
10:50.032–10:51.672
zh这还仅仅是Flash版本
10:51.672–10:53.412
zh官方的DeepSeek V4 Pro也即将发布
10:53.412–10:54.652
zh据官方介绍
10:54.652–10:56.492
zh如果将同样的智能体后训练应用
10:56.492–10:58.452
zh到1.6万亿参数的模型上
10:58.452–11:00.452
zh那对市面上昂贵的闭源模型来说
11:00.452–11:01.812
zh将是降维打击般的存在
11:01.812–11:03.932
zh我会在上线后第一时间进行测试
11:03.932–11:04.592
zh请继续关注
11:04.592–11:05.692
zh总的来说
11:05.692–11:06.432
zh这非常酷
0:00.000–0:07.460
(此句尚無繁中翻譯)
0:07.460–0:10.720
(此句尚無繁中翻譯)
0:10.720–0:14.980
(此句尚無繁中翻譯)
0:14.980–0:19.240
(此句尚無繁中翻譯)
0:19.240–0:21.600
(此句尚無繁中翻譯)
0:21.600–0:25.000
(此句尚無繁中翻譯)
0:25.000–0:27.180
(此句尚無繁中翻譯)
0:27.180–0:30.600
(此句尚無繁中翻譯)
0:30.600–0:31.780
(此句尚無繁中翻譯)
0:31.780–0:33.980
(此句尚無繁中翻譯)
0:33.980–0:36.720
(此句尚無繁中翻譯)
0:36.720–0:38.420
(此句尚無繁中翻譯)
0:38.420–0:40.420
(此句尚無繁中翻譯)
0:40.420–0:42.320
(此句尚無繁中翻譯)
0:42.320–0:43.040
(此句尚無繁中翻譯)
0:43.040–0:45.200
(此句尚無繁中翻譯)
0:45.200–0:46.400
(此句尚無繁中翻譯)
0:46.400–0:48.360
(此句尚無繁中翻譯)
0:48.360–0:48.860
(此句尚無繁中翻譯)
0:48.860–0:51.040
(此句尚無繁中翻譯)
0:51.040–0:53.340
(此句尚無繁中翻譯)
0:53.340–0:55.120
(此句尚無繁中翻譯)
0:55.120–0:58.120
(此句尚無繁中翻譯)
0:58.120–0:59.560
(此句尚無繁中翻譯)
0:59.560–1:00.940
(此句尚無繁中翻譯)
1:00.940–1:03.120
(此句尚無繁中翻譯)
1:03.120–1:05.400
(此句尚無繁中翻譯)
1:05.400–1:07.720
(此句尚無繁中翻譯)
1:07.720–1:09.660
(此句尚無繁中翻譯)
1:09.660–1:12.000
(此句尚無繁中翻譯)
1:12.000–1:13.780
(此句尚無繁中翻譯)
1:13.780–1:15.180
(此句尚無繁中翻譯)
1:15.180–1:15.900
(此句尚無繁中翻譯)
1:15.900–1:18.200
(此句尚無繁中翻譯)
1:18.200–1:19.940
(此句尚無繁中翻譯)
1:19.940–1:21.040
(此句尚無繁中翻譯)
1:21.040–1:22.500
(此句尚無繁中翻譯)
1:22.500–1:24.340
(此句尚無繁中翻譯)
1:24.340–1:26.540
(此句尚無繁中翻譯)
1:26.540–1:29.060
(此句尚無繁中翻譯)
1:29.060–1:30.700
(此句尚無繁中翻譯)
1:30.700–1:31.300
(此句尚無繁中翻譯)
1:31.300–1:33.480
(此句尚無繁中翻譯)
1:33.480–1:34.820
(此句尚無繁中翻譯)
1:34.820–1:36.880
(此句尚無繁中翻譯)
1:36.880–1:39.640
(此句尚無繁中翻譯)
1:39.640–1:41.200
(此句尚無繁中翻譯)
1:41.200–1:42.240
(此句尚無繁中翻譯)
1:42.240–1:45.040
(此句尚無繁中翻譯)
1:45.040–1:46.480
(此句尚無繁中翻譯)
1:46.480–1:48.240
(此句尚無繁中翻譯)
1:48.240–1:50.120
(此句尚無繁中翻譯)
1:50.120–1:52.000
(此句尚無繁中翻譯)
1:52.000–1:54.240
(此句尚無繁中翻譯)
1:54.240–1:55.960
(此句尚無繁中翻譯)
1:55.960–1:58.240
(此句尚無繁中翻譯)
1:58.240–2:00.780
(此句尚無繁中翻譯)
2:00.780–2:01.720
(此句尚無繁中翻譯)
2:01.720–2:03.260
(此句尚無繁中翻譯)
2:03.260–2:05.020
(此句尚無繁中翻譯)
2:05.020–2:08.940
(此句尚無繁中翻譯)
2:08.940–2:11.620
(此句尚無繁中翻譯)
2:11.620–2:13.820
(此句尚無繁中翻譯)
2:13.820–2:15.880
(此句尚無繁中翻譯)
2:15.880–2:18.280
(此句尚無繁中翻譯)
2:18.280–2:20.320
(此句尚無繁中翻譯)
2:20.320–2:22.980
(此句尚無繁中翻譯)
2:22.980–2:25.740
(此句尚無繁中翻譯)
2:25.740–2:26.940
(此句尚無繁中翻譯)
2:26.940–2:28.840
(此句尚無繁中翻譯)
2:28.840–2:30.100
(此句尚無繁中翻譯)
2:30.100–2:32.440
(此句尚無繁中翻譯)
2:32.440–2:33.820
(此句尚無繁中翻譯)
2:33.820–2:35.180
(此句尚無繁中翻譯)
2:35.180–2:37.440
(此句尚無繁中翻譯)
2:37.440–2:39.960
(此句尚無繁中翻譯)
2:39.960–2:42.980
(此句尚無繁中翻譯)
2:42.980–2:46.260
(此句尚無繁中翻譯)
2:46.260–2:49.160
(此句尚無繁中翻譯)
2:49.160–2:51.300
(此句尚無繁中翻譯)
2:51.300–2:52.800
(此句尚無繁中翻譯)
2:52.980–2:55.580
(此句尚無繁中翻譯)
2:55.580–2:58.040
(此句尚無繁中翻譯)
2:58.040–2:59.900
(此句尚無繁中翻譯)
2:59.900–3:03.900
(此句尚無繁中翻譯)
3:03.900–3:05.920
(此句尚無繁中翻譯)
3:05.920–3:08.140
(此句尚無繁中翻譯)
3:08.140–3:10.680
(此句尚無繁中翻譯)
3:10.680–3:13.280
(此句尚無繁中翻譯)
3:13.280–3:15.500
(此句尚無繁中翻譯)
3:15.500–3:18.260
(此句尚無繁中翻譯)
3:18.260–3:20.380
(此句尚無繁中翻譯)
3:20.380–3:22.740
(此句尚無繁中翻譯)
3:22.740–3:23.800
(此句尚無繁中翻譯)
3:23.800–3:25.840
(此句尚無繁中翻譯)
3:25.840–3:28.200
(此句尚無繁中翻譯)
3:28.200–3:29.820
(此句尚無繁中翻譯)
3:29.820–3:31.820
(此句尚無繁中翻譯)
3:31.820–3:33.160
(此句尚無繁中翻譯)
3:33.160–3:34.100
(此句尚無繁中翻譯)
3:34.100–3:35.120
(此句尚無繁中翻譯)
3:35.120–3:36.820
(此句尚無繁中翻譯)
3:36.820–3:38.380
(此句尚無繁中翻譯)
3:38.380–3:41.360
(此句尚無繁中翻譯)
3:41.360–3:42.760
(此句尚無繁中翻譯)
3:42.760–3:44.120
(此句尚無繁中翻譯)
3:44.120–3:45.840
(此句尚無繁中翻譯)
3:45.840–3:47.500
(此句尚無繁中翻譯)
3:47.500–3:49.000
(此句尚無繁中翻譯)
3:49.000–3:50.580
(此句尚無繁中翻譯)
3:50.580–3:52.660
(此句尚無繁中翻譯)
3:52.660–3:54.640
(此句尚無繁中翻譯)
3:54.640–3:56.380
(此句尚無繁中翻譯)
3:56.380–3:58.360
(此句尚無繁中翻譯)
3:58.360–3:59.440
(此句尚無繁中翻譯)
3:59.440–4:00.860
(此句尚無繁中翻譯)
4:00.860–4:02.400
(此句尚無繁中翻譯)
4:02.400–4:05.200
(此句尚無繁中翻譯)
4:05.200–4:08.780
(此句尚無繁中翻譯)
4:08.780–4:10.720
(此句尚無繁中翻譯)
4:10.720–4:12.500
(此句尚無繁中翻譯)
4:12.500–4:15.280
(此句尚無繁中翻譯)
4:15.280–4:18.060
(此句尚無繁中翻譯)
4:18.060–4:19.880
(此句尚無繁中翻譯)
4:19.880–4:22.300
(此句尚無繁中翻譯)
4:22.300–4:24.520
(此句尚無繁中翻譯)
4:24.520–4:26.020
(此句尚無繁中翻譯)
4:26.020–4:27.500
(此句尚無繁中翻譯)
4:27.500–4:29.980
(此句尚無繁中翻譯)
4:29.980–4:32.760
(此句尚無繁中翻譯)
4:32.760–4:34.720
(此句尚無繁中翻譯)
4:34.720–4:36.500
(此句尚無繁中翻譯)
4:36.500–4:38.020
(此句尚無繁中翻譯)
4:38.020–4:40.000
(此句尚無繁中翻譯)
4:40.000–4:42.020
(此句尚無繁中翻譯)
4:42.020–4:44.620
(此句尚無繁中翻譯)
4:44.620–4:46.500
(此句尚無繁中翻譯)
4:46.500–4:47.360
(此句尚無繁中翻譯)
4:47.360–4:49.860
(此句尚無繁中翻譯)
4:49.860–4:51.800
(此句尚無繁中翻譯)
4:51.800–4:53.620
(此句尚無繁中翻譯)
4:53.620–4:55.540
(此句尚無繁中翻譯)
4:55.540–4:58.640
(此句尚無繁中翻譯)
4:58.640–5:01.240
(此句尚無繁中翻譯)
5:01.240–5:04.940
(此句尚無繁中翻譯)
5:04.940–5:08.660
(此句尚無繁中翻譯)
5:08.660–5:11.280
(此句尚無繁中翻譯)
5:11.280–5:12.480
(此句尚無繁中翻譯)
5:12.480–5:14.800
(此句尚無繁中翻譯)
5:14.800–5:16.140
(此句尚無繁中翻譯)
5:16.140–5:17.880
(此句尚無繁中翻譯)
5:17.880–5:19.300
(此句尚無繁中翻譯)
5:19.300–5:21.800
(此句尚無繁中翻譯)
5:21.800–5:23.240
(此句尚無繁中翻譯)
5:23.240–5:25.080
(此句尚無繁中翻譯)
5:25.080–5:26.420
(此句尚無繁中翻譯)
5:26.420–5:27.340
(此句尚無繁中翻譯)
5:27.340–5:29.520
(此句尚無繁中翻譯)
5:29.520–5:31.140
(此句尚無繁中翻譯)
5:31.140–5:32.180
(此句尚無繁中翻譯)
5:32.180–5:33.860
(此句尚無繁中翻譯)
5:33.860–5:35.640
(此句尚無繁中翻譯)
5:35.640–5:37.120
(此句尚無繁中翻譯)
5:37.120–5:38.580
(此句尚無繁中翻譯)
5:38.580–5:39.860
(此句尚無繁中翻譯)
5:39.860–5:42.040
(此句尚無繁中翻譯)
5:42.040–5:43.400
(此句尚無繁中翻譯)
5:43.400–5:44.780
(此句尚無繁中翻譯)
5:44.780–5:46.480
(此句尚無繁中翻譯)
5:46.480–5:48.500
(此句尚無繁中翻譯)
5:48.500–5:49.780
(此句尚無繁中翻譯)
5:49.780–5:51.260
(此句尚無繁中翻譯)
5:51.260–5:52.780
(此句尚無繁中翻譯)
5:52.780–5:55.220
(此句尚無繁中翻譯)
5:55.220–5:56.820
(此句尚無繁中翻譯)
5:56.820–5:58.400
(此句尚無繁中翻譯)
5:58.400–6:00.160
(此句尚無繁中翻譯)
6:00.160–6:01.160
(此句尚無繁中翻譯)
6:01.160–6:02.340
(此句尚無繁中翻譯)
6:02.340–6:03.800
(此句尚無繁中翻譯)
6:03.800–6:05.440
(此句尚無繁中翻譯)
6:05.440–6:06.640
(此句尚無繁中翻譯)
6:06.640–6:08.460
(此句尚無繁中翻譯)
6:08.460–6:10.740
(此句尚無繁中翻譯)
6:10.740–6:13.060
(此句尚無繁中翻譯)
6:13.060–6:14.220
(此句尚無繁中翻譯)
6:14.220–6:15.420
(此句尚無繁中翻譯)
6:15.420–6:16.500
(此句尚無繁中翻譯)
6:16.500–6:18.620
(此句尚無繁中翻譯)
6:18.620–6:20.420
(此句尚無繁中翻譯)
6:20.420–6:21.860
(此句尚無繁中翻譯)
6:21.860–6:24.620
(此句尚無繁中翻譯)
6:24.620–6:26.020
(此句尚無繁中翻譯)
6:26.020–6:28.000
(此句尚無繁中翻譯)
6:28.000–6:31.600
(此句尚無繁中翻譯)
6:31.600–6:35.240
(此句尚無繁中翻譯)
6:35.240–6:37.340
(此句尚無繁中翻譯)
6:37.340–6:39.180
(此句尚無繁中翻譯)
6:39.180–6:41.940
(此句尚無繁中翻譯)
6:41.940–6:44.700
(此句尚無繁中翻譯)
6:44.700–6:46.120
(此句尚無繁中翻譯)
6:46.120–6:47.740
(此句尚無繁中翻譯)
6:47.740–6:49.140
(此句尚無繁中翻譯)
6:49.140–6:50.960
(此句尚無繁中翻譯)
6:50.960–6:52.660
(此句尚無繁中翻譯)
6:52.660–6:54.040
(此句尚無繁中翻譯)
6:54.040–6:56.200
(此句尚無繁中翻譯)
6:56.200–6:57.840
(此句尚無繁中翻譯)
6:57.840–7:00.740
(此句尚無繁中翻譯)
7:00.740–7:03.560
(此句尚無繁中翻譯)
7:03.560–7:05.100
(此句尚無繁中翻譯)
7:05.100–7:06.960
(此句尚無繁中翻譯)
7:06.960–7:09.240
(此句尚無繁中翻譯)
7:09.240–7:11.320
(此句尚無繁中翻譯)
7:11.320–7:13.300
(此句尚無繁中翻譯)
7:13.300–7:15.740
(此句尚無繁中翻譯)
7:15.740–7:16.620
(此句尚無繁中翻譯)
7:16.620–7:17.700
(此句尚無繁中翻譯)
7:17.700–7:19.860
(此句尚無繁中翻譯)
7:19.860–7:21.420
(此句尚無繁中翻譯)
7:21.420–7:22.640
(此句尚無繁中翻譯)
7:22.640–7:24.300
(此句尚無繁中翻譯)
7:24.300–7:26.160
(此句尚無繁中翻譯)
7:26.160–7:26.800
(此句尚無繁中翻譯)
7:26.800–7:28.060
(此句尚無繁中翻譯)
7:28.060–7:29.400
(此句尚無繁中翻譯)
7:29.400–7:30.060
(此句尚無繁中翻譯)
7:30.060–7:31.600
(此句尚無繁中翻譯)
7:31.600–7:33.760
(此句尚無繁中翻譯)
7:33.760–7:37.320
(此句尚無繁中翻譯)
7:37.320–7:40.600
(此句尚無繁中翻譯)
7:40.600–7:43.580
(此句尚無繁中翻譯)
7:43.580–7:46.880
(此句尚無繁中翻譯)
7:46.880–7:51.240
(此句尚無繁中翻譯)
7:51.240–7:53.500
(此句尚無繁中翻譯)
7:53.500–7:55.180
(此句尚無繁中翻譯)
7:55.180–7:56.500
(此句尚無繁中翻譯)
7:56.500–7:58.560
(此句尚無繁中翻譯)
7:58.560–8:01.040
(此句尚無繁中翻譯)
8:01.040–8:03.260
(此句尚無繁中翻譯)
8:03.672–8:05.532
(此句尚無繁中翻譯)
8:05.532–8:08.052
(此句尚無繁中翻譯)
8:08.052–8:11.372
(此句尚無繁中翻譯)
8:11.372–8:13.392
(此句尚無繁中翻譯)
8:13.392–8:14.472
(此句尚無繁中翻譯)
8:14.472–8:15.432
(此句尚無繁中翻譯)
8:15.432–8:17.192
(此句尚無繁中翻譯)
8:17.192–8:19.372
(此句尚無繁中翻譯)
8:19.372–8:21.032
(此句尚無繁中翻譯)
8:21.032–8:22.112
(此句尚無繁中翻譯)
8:22.112–8:23.992
(此句尚無繁中翻譯)
8:23.992–8:25.392
(此句尚無繁中翻譯)
8:25.392–8:26.312
(此句尚無繁中翻譯)
8:26.312–8:27.832
(此句尚無繁中翻譯)
8:27.832–8:28.492
(此句尚無繁中翻譯)
8:28.492–8:29.492
(此句尚無繁中翻譯)
8:29.492–8:30.112
(此句尚無繁中翻譯)
8:30.112–8:31.632
(此句尚無繁中翻譯)
8:31.632–8:33.172
(此句尚無繁中翻譯)
8:33.172–8:34.572
(此句尚無繁中翻譯)
8:34.572–8:36.712
(此句尚無繁中翻譯)
8:36.712–8:37.452
(此句尚無繁中翻譯)
8:37.452–8:38.612
(此句尚無繁中翻譯)
8:38.612–8:39.672
(此句尚無繁中翻譯)
8:39.672–8:41.572
(此句尚無繁中翻譯)
8:41.572–8:43.212
(此句尚無繁中翻譯)
8:43.212–8:44.772
(此句尚無繁中翻譯)
8:47.192–8:48.272
(此句尚無繁中翻譯)
8:48.272–8:49.552
(此句尚無繁中翻譯)
8:49.552–8:51.352
(此句尚無繁中翻譯)
8:51.352–8:52.172
(此句尚無繁中翻譯)
8:52.172–8:54.152
(此句尚無繁中翻譯)
8:54.152–8:56.112
(此句尚無繁中翻譯)
8:56.112–8:57.092
(此句尚無繁中翻譯)
8:57.092–8:59.272
(此句尚無繁中翻譯)
8:59.272–9:00.332
(此句尚無繁中翻譯)
9:00.332–9:02.092
(此句尚無繁中翻譯)
9:02.092–9:03.892
(此句尚無繁中翻譯)
9:03.892–9:05.932
(此句尚無繁中翻譯)
9:05.932–9:07.912
(此句尚無繁中翻譯)
9:07.912–9:10.052
(此句尚無繁中翻譯)
9:10.052–9:10.712
(此句尚無繁中翻譯)
9:10.712–9:15.272
(此句尚無繁中翻譯)
9:15.272–9:18.852
(此句尚無繁中翻譯)
9:18.852–9:19.752
(此句尚無繁中翻譯)
9:19.752–9:21.172
(此句尚無繁中翻譯)
9:21.172–9:23.352
(此句尚無繁中翻譯)
9:23.352–9:25.192
(此句尚無繁中翻譯)
9:25.192–9:25.832
(此句尚無繁中翻譯)
9:25.832–9:29.152
(此句尚無繁中翻譯)
9:29.152–9:32.032
(此句尚無繁中翻譯)
9:32.032–9:33.572
(此句尚無繁中翻譯)
9:33.572–9:35.092
(此句尚無繁中翻譯)
9:35.092–9:37.732
(此句尚無繁中翻譯)
9:37.732–9:40.532
(此句尚無繁中翻譯)
9:40.532–9:44.092
(此句尚無繁中翻譯)
9:44.092–9:45.892
(此句尚無繁中翻譯)
9:45.892–9:48.472
(此句尚無繁中翻譯)
9:48.472–9:49.872
(此句尚無繁中翻譯)
9:49.872–9:52.572
(此句尚無繁中翻譯)
9:52.572–9:54.892
(此句尚無繁中翻譯)
9:54.892–9:55.472
(此句尚無繁中翻譯)
9:55.472–9:59.052
(此句尚無繁中翻譯)
9:59.052–10:01.932
(此句尚無繁中翻譯)
10:01.932–10:03.712
(此句尚無繁中翻譯)
10:03.712–10:06.892
(此句尚無繁中翻譯)
10:06.892–10:09.292
(此句尚無繁中翻譯)
10:09.292–10:11.532
(此句尚無繁中翻譯)
10:11.532–10:14.112
(此句尚無繁中翻譯)
10:14.112–10:15.252
(此句尚無繁中翻譯)
10:15.252–10:16.892
(此句尚無繁中翻譯)
10:16.892–10:18.592
(此句尚無繁中翻譯)
10:18.592–10:20.372
(此句尚無繁中翻譯)
10:20.372–10:22.292
(此句尚無繁中翻譯)
10:22.292–10:23.292
(此句尚無繁中翻譯)
10:23.292–10:25.532
(此句尚無繁中翻譯)
10:25.532–10:26.772
(此句尚無繁中翻譯)
10:26.772–10:27.792
(此句尚無繁中翻譯)
10:27.792–10:29.692
(此句尚無繁中翻譯)
10:29.692–10:32.012
(此句尚無繁中翻譯)
10:32.012–10:33.392
(此句尚無繁中翻譯)
10:33.392–10:34.972
(此句尚無繁中翻譯)
10:34.972–10:36.312
(此句尚無繁中翻譯)
10:36.312–10:37.112
(此句尚無繁中翻譯)
10:37.112–10:39.092
(此句尚無繁中翻譯)
10:39.092–10:40.412
(此句尚無繁中翻譯)
10:40.412–10:42.612
(此句尚無繁中翻譯)
10:42.612–10:44.572
(此句尚無繁中翻譯)
10:44.572–10:46.672
(此句尚無繁中翻譯)
10:46.672–10:48.252
(此句尚無繁中翻譯)
10:48.252–10:49.292
(此句尚無繁中翻譯)
10:49.292–10:50.032
(此句尚無繁中翻譯)
10:50.032–10:51.672
(此句尚無繁中翻譯)
10:51.672–10:53.412
(此句尚無繁中翻譯)
10:53.412–10:54.652
(此句尚無繁中翻譯)
10:54.652–10:56.492
(此句尚無繁中翻譯)
10:56.492–10:58.452
(此句尚無繁中翻譯)
10:58.452–11:00.452
(此句尚無繁中翻譯)
11:00.452–11:01.812
(此句尚無繁中翻譯)
11:01.812–11:03.932
(此句尚無繁中翻譯)
11:03.932–11:04.592
(此句尚無繁中翻譯)
11:04.592–11:05.692
(此句尚無繁中翻譯)
11:05.692–11:06.432
(此句尚無繁中翻譯)
0:00.000–0:07.460
zh大家好 欢迎收看新一期视频
(此句尚無繁中翻譯)
0:07.460–0:10.720
zhDeepseek刚刚发布了一个很有意思的更新
(此句尚無繁中翻譯)
0:10.720–0:14.980
zhDeepseek V4 Flash官方API现已开启公测
(此句尚無繁中翻譯)
0:14.980–0:19.240
zh新版本命名为Deepseek V4 Flash 0731
(此句尚無繁中翻譯)
0:19.240–0:21.600
zh这可不只是一个小补丁
(此句尚無繁中翻譯)
0:21.600–0:25.000
zhDeepseek表示他们大幅提升了智能体能力
(此句尚無繁中翻譯)
0:25.000–0:27.180
zh在该模型上甚至
(此句尚無繁中翻譯)
0:27.180–0:30.600
zh使其测试分数如今已远超V4 Pro预览版
(此句尚無繁中翻譯)
0:30.600–0:31.780
zh也就是说
(此句尚無繁中翻譯)
0:31.780–0:33.980
zh这个小模型现在击败了预览版
(此句尚無繁中翻譯)
0:33.980–0:36.720
zh极大模型在智能体任务上的版本
(此句尚無繁中翻譯)
0:36.720–0:38.420
zh这确实挺疯狂的
(此句尚無繁中翻譯)
0:38.420–0:40.420
zh我也用我自己的Kinbench测试了它
(此句尚無繁中翻譯)
0:40.420–0:42.320
zh而在我的基准测试中
(此句尚無繁中翻譯)
0:42.320–0:43.040
zh它做到了
(此句尚無繁中翻譯)
0:43.040–0:45.200
zh其他任何模型都未曾做到的事
(此句尚無繁中翻譯)
0:45.200–0:46.400
zh包括Claude 3.5
(此句尚無繁中翻譯)
0:46.400–0:48.360
zh以及Opus稍后我们会细聊
(此句尚無繁中翻譯)
0:48.360–0:48.860
zh但首先
(此句尚無繁中翻譯)
0:48.860–0:51.040
zh我们先聊聊这次更新到底是什么
(此句尚無繁中翻譯)
0:51.040–0:53.340
zh前阵子我介绍过DeepSeek V4 Pro
(此句尚無繁中翻譯)
0:53.340–0:55.120
zh和V4 Flash的预览版
(此句尚無繁中翻譯)
0:55.120–0:58.120
zh包括如何通过NVIDIA Link免费使用它们
(此句尚無繁中翻譯)
0:58.120–0:59.560
zh视频链接已放在下方
(此句尚無繁中翻譯)
0:59.560–1:00.940
zh我们先快速回顾一下Flash
(此句尚無繁中翻譯)
1:00.940–1:03.120
zh它是V4系列中较小的模型
(此句尚無繁中翻譯)
1:03.120–1:05.400
zh该混合专家模型拥有2000
(此句尚無繁中翻譯)
1:05.400–1:07.720
zh0840亿的总参数量
(此句尚無繁中翻譯)
1:07.720–1:09.660
zh约130亿激活参数
(此句尚無繁中翻譯)
1:09.660–1:12.000
zh支持100万Token上下文窗口
(此句尚無繁中翻譯)
1:12.000–1:13.780
zh它定位为主打快速
(此句尚無繁中翻譯)
1:13.780–1:15.180
zh与低成本版本
(此句尚無繁中翻譯)
1:15.180–1:15.900
zh而V4 Pro
(此句尚無繁中翻譯)
1:15.900–1:18.200
zh是1.6万亿参数旗舰大模型
(此句尚無繁中翻譯)
1:18.200–1:19.940
zh关于这次0731更新
(此句尚無繁中翻譯)
1:19.940–1:21.040
zh有一个关键细节
(此句尚無繁中翻譯)
1:21.040–1:22.500
zhDeepSeek明确表示
(此句尚無繁中翻譯)
1:22.500–1:24.340
enV4Flash 0731
(此句尚無繁中翻譯)
1:24.340–1:26.540
zh保持了完全相同的模型架构
(此句尚無繁中翻譯)
1:26.540–1:29.060
zh和参数规模与预览版完全一致
(此句尚無繁中翻譯)
1:29.060–1:30.700
zh所以它并没有变大
(此句尚無繁中翻譯)
1:30.700–1:31.300
zh依然是
(此句尚無繁中翻譯)
1:31.300–1:33.480
zh那款2840亿参数的Flash
(此句尚無繁中翻譯)
1:33.480–1:34.820
zh但在此基础上
(此句尚無繁中翻譯)
1:34.820–1:36.880
zh它似乎进行了高强度的智能体后训练
(此句尚無繁中翻譯)
1:36.880–1:39.640
zh所有的性能提升都源于训练的优化
(此句尚無繁中翻譯)
1:39.640–1:41.200
zh而不是增加参数量
(此句尚無繁中翻譯)
1:41.200–1:42.240
zh他们还明确指出
(此句尚無繁中翻譯)
1:42.240–1:45.040
zh这次升级仅是用于DeepSeek V4 Flash API
(此句尚無繁中翻譯)
1:45.040–1:46.480
enV4 Pro API
(此句尚無繁中翻譯)
1:46.480–1:48.240
zh以及App端模型
(此句尚無繁中翻譯)
1:48.240–1:50.120
zh和网页端目前都保持不变
(此句尚無繁中翻譯)
1:50.120–1:52.000
zh公告最后提到
(此句尚無繁中翻譯)
1:52.000–1:54.240
zhDeepSeek V4 Pro的正式版本
(此句尚無繁中翻譯)
1:54.240–1:55.960
zh很快就会发布
(此句尚無繁中翻譯)
1:55.960–1:58.240
zh所以这次Flash更新基本只是热身
(此句尚無繁中翻譯)
1:58.240–2:00.780
zh真正的重头戏还在后头
(此句尚無繁中翻譯)
2:00.780–2:01.720
zh另外
(此句尚無繁中翻譯)
2:01.720–2:03.260
zh这次发布中还有一点
(此句尚無繁中翻譯)
2:03.260–2:05.020
zh我觉得非常明智
(此句尚無繁中翻譯)
2:05.020–2:08.940
zh官方V4 Flash现在原生支持Response API格式
(此句尚無繁中翻譯)
2:08.940–2:11.620
zhDeepSeek还表示他已完全适配Codex
(此句尚無繁中翻譯)
2:11.620–2:13.820
zh所以他们不仅是发布了一个模型
(此句尚無繁中翻譯)
2:13.820–2:15.880
zh而不是被动等待工具链的适配
(此句尚無繁中翻譯)
2:15.880–2:18.280
zh他们直接面向Codex适配框架进行了开发
(此句尚無繁中翻譯)
2:18.280–2:20.320
zh这意味着你可以将其接入
(此句尚無繁中翻譯)
2:20.320–2:22.980
zh到Codex风格的工作流中且毫无阻碍
(此句尚無繁中翻譯)
2:22.980–2:25.740
zhGLM以及国内的其他一些实验室也在做
(此句尚無繁中翻譯)
2:25.740–2:26.940
zh类似的框架适配
(此句尚無繁中翻譯)
2:26.940–2:28.840
zh事实证明效果立竿见影
(此句尚無繁中翻譯)
2:28.840–2:30.100
zh这确实是个明智之举
(此句尚無繁中翻譯)
2:30.100–2:32.440
zh接下来看看官方的基准测试数据
(此句尚無繁中翻譯)
2:32.440–2:33.820
zh这次性能提升太惊人了
(此句尚無繁中翻譯)
2:33.820–2:35.180
zh在Terminal Bench 2.1测试中
(此句尚無繁中翻譯)
2:35.180–2:37.440
zh新版Flash跑分高达82.7
(此句尚無繁中翻譯)
2:37.440–2:39.960
zh而此前的预览版仅为61.8
(此句尚無繁中翻譯)
2:39.960–2:42.980
zh甚至连V4 Pro预览版也只有72.1分
(此句尚無繁中翻譯)
2:42.980–2:46.260
zh这也让它超越了81分的GLM-4-0520
(此句尚無繁中翻譯)
2:46.260–2:49.160
zh而且距离85分的OPUS差距并不大
(此句尚無繁中翻譯)
2:49.160–2:51.300
zh要知道后者的价格可要贵得多
(此句尚無繁中翻譯)
2:51.300–2:52.800
zh而最夸张的是SWBEC
(此句尚無繁中翻譯)
2:52.980–2:55.580
zh预览版在这个测试中仅获得了7.3分
(此句尚無繁中翻譯)
2:55.580–2:58.040
zh而新版本直接飙升到54.4分
(此句尚無繁中翻譯)
2:58.040–2:59.900
zh实现了从基本无法使用
(此句尚無繁中翻譯)
2:59.900–3:03.900
zh到足以与46.2分的GLM4-0520正面竞争的水平
(此句尚無繁中翻譯)
3:03.900–3:05.920
zh甚至是58分的OPUS
(此句尚無繁中翻譯)
3:05.920–3:08.140
zhCybergen也从38.7分
(此句尚無繁中翻譯)
3:08.140–3:10.680
zh升至76.7分,CoderEval从
(此句尚無繁中翻譯)
3:10.680–3:13.280
zh从49.7分升至70.3分
(此句尚無繁中翻譯)
3:13.280–3:15.500
zh在其内部DSBench测试集上
(此句尚無繁中翻譯)
3:15.500–3:18.260
zh全栈任务得分从37升至68.7
(此句尚無繁中翻譯)
3:18.260–3:20.380
zh高难度编码智能体任务也
(此句尚無繁中翻譯)
3:20.380–3:22.740
zh从25.8升至59.6
(此句尚無繁中翻譯)
3:22.740–3:23.800
zh总的来说
(此句尚無繁中翻譯)
3:23.800–3:25.840
zh这较其自身的预览版有了巨大飞跃
(此句尚無繁中翻譯)
3:25.840–3:28.200
zh且在大多数智能体基准测试中
(此句尚無繁中翻譯)
3:28.200–3:29.820
zh它已逼近OPUS 4.8
(此句尚無繁中翻譯)
3:29.820–3:31.820
zh而它作为一款尺寸小得多
(此句尚無繁中翻譯)
3:31.820–3:33.160
zh且更便宜的模型
(此句尚無繁中翻譯)
3:33.160–3:34.100
zh不过需要说明的是
(此句尚無繁中翻譯)
3:34.100–3:35.120
zhDeepSeek指出
(此句尚無繁中翻譯)
3:35.120–3:36.820
zh在公开的编码智能体任务测试中
(此句尚無繁中翻譯)
3:36.820–3:38.380
zhV4 Flash使用了
(此句尚無繁中翻譯)
3:38.380–3:41.360
zh其即将推出的Deep-C Harness框架在极简模式下
(此句尚無繁中翻譯)
3:41.360–3:42.760
zh以最高档位运行
(此句尚無繁中翻譯)
3:42.760–3:44.120
zh且Top-p采样设为0.95
(此句尚無繁中翻譯)
3:44.120–3:45.840
zh温度参数设为一可见
(此句尚無繁中翻譯)
3:45.840–3:47.500
zh测试框架的选择至关重要
(此句尚無繁中翻譯)
3:47.500–3:49.000
zh测试结果可能不同
(此句尚無繁中翻譯)
3:49.000–3:50.580
zh数据仅供参考
(此句尚無繁中翻譯)
3:50.580–3:52.660
zh不过了解本频道的人都知道
(此句尚無繁中翻譯)
3:52.660–3:54.640
zh我们从不只看官方宣传数据
(此句尚無繁中翻譯)
3:54.640–3:56.380
zh所以我用自己的基准测试跑了一下
(此句尚無繁中翻譯)
3:56.380–3:58.360
zh话不多说我们直接切入正题
(此句尚無繁中翻譯)
3:58.360–3:59.440
zh和往常一样
(此句尚無繁中翻譯)
3:59.440–4:00.860
zh我用我的TingBench进行了测试
(此句尚無繁中翻譯)
4:00.860–4:02.400
zh其中涵盖了一些前端
(此句尚無繁中翻譯)
4:02.400–4:05.200
zh与动画一些Three.js任务以及SVG测试
(此句尚無繁中翻譯)
4:05.200–4:08.780
zh一道数学题以及一个长程智能体任务
(此句尚無繁中翻譯)
4:08.780–4:10.720
zh最后还有一个超难的3D任务
(此句尚無繁中翻譯)
4:10.720–4:12.500
zh每项测试满分10分
(此句尚無繁中翻譯)
4:12.500–4:15.280
zh最后我们会通过最终的图表来看看
(此句尚無繁中翻譯)
4:15.280–4:18.060
zh看看它的表现与其他模型相比如何
(此句尚無繁中翻譯)
4:18.060–4:19.880
zh第一题是电梯模拟
(此句尚無繁中翻譯)
4:19.880–4:22.300
zh模型需要构建一个模拟程序
(此句尚無繁中翻譯)
4:22.300–4:24.520
zh你可以在不同楼层生成乘客
(此句尚無繁中翻譯)
4:24.520–4:26.020
zh共有三部电梯
(此句尚無繁中翻譯)
4:26.020–4:27.500
zh其每部只能在一人
(此句尚無繁中翻譯)
4:27.500–4:29.980
zh没赶上的人需要搭乘下一班电梯
(此句尚無繁中翻譯)
4:29.980–4:32.760
zh还需要有提示框显示每个人的目标楼层
(此句尚無繁中翻譯)
4:32.760–4:34.720
zh当鼠标悬停在他们身上时
(此句尚無繁中翻譯)
4:34.720–4:36.500
zh我们发送提示词看看效果
(此句尚無繁中翻譯)
4:36.500–4:38.020
zh这个表现只能算一半
(此句尚無繁中翻譯)
4:38.020–4:40.000
zh得了五分基本框架是有了
(此句尚無繁中翻譯)
4:40.000–4:42.020
zh但关于乘客没赶上电梯
(此句尚無繁中翻譯)
4:42.020–4:44.620
zh并被下一班电梯接走的核心逻辑并没有完全跑通
(此句尚無繁中翻譯)
4:44.620–4:46.500
zh而且动画也不够流畅
(此句尚無繁中翻譯)
4:46.500–4:47.360
zh作为参考
(此句尚無繁中翻譯)
4:47.360–4:49.860
zh只有OPUS模型在这项测试中拿过10分
(此句尚無繁中翻譯)
4:49.860–4:51.800
zh而像CLAUDE 3.5这样的模型
(此句尚無繁中翻譯)
4:51.800–4:53.620
zh和Kimi k3也只有9分
(此句尚無繁中翻譯)
4:53.620–4:55.540
zh所以这开局只能算重归原矩
(此句尚無繁中翻譯)
4:55.540–4:58.640
zh第二个测试是Three.js隐形眼镜盒
(此句尚無繁中翻譯)
4:58.640–5:01.240
zh它需要生成一个3D模型
(此句尚無繁中翻譯)
5:01.240–5:04.940
zh是一个带有明显L和R标识盖子的隐形眼镜盒
(此句尚無繁中翻譯)
5:04.940–5:08.660
zh并且点击盖子能够将其打开这项测试
(此句尚無繁中翻譯)
5:08.660–5:11.280
zh几乎所有模型都会在这里翻车
(此句尚無繁中翻譯)
5:11.280–5:12.480
zh我们发送过去看看
(此句尚無繁中翻譯)
5:12.480–5:14.800
zh好的 这其实做得非常好
(此句尚無繁中翻譯)
5:14.800–5:16.140
zh它拿到了8分
(此句尚無繁中翻譯)
5:16.140–5:17.880
zh盒子看起来很像样
(此句尚無繁中翻譯)
5:17.880–5:19.300
zh像个合格的眼镜盒L
(此句尚無繁中翻譯)
5:19.300–5:21.800
zh而且L和R盖也清晰可见
(此句尚無繁中翻譯)
5:21.800–5:23.240
zh点击打开的交互也有效
(此句尚無繁中翻譯)
5:23.240–5:25.080
zh这让他与Qwen 2.5 Maths并列
(此句尚無繁中翻譯)
5:25.080–5:26.420
zh而Opus拿到了5分
(此句尚無繁中翻譯)
5:26.420–5:27.340
zh是历史第二高分
(此句尚無繁中翻譯)
5:27.340–5:29.520
zh在该测试中仅次于Claude 3.5
(此句尚無繁中翻譯)
5:29.520–5:31.140
zh他仍然是唯一在这个测试中
(此句尚無繁中翻譯)
5:31.140–5:32.180
zh拿到满分10分的模型
(此句尚無繁中翻譯)
5:32.180–5:33.860
zh所以对于一个小模型来说
(此句尚無繁中翻譯)
5:33.860–5:35.640
zh能有这样的表现已经非常惊艳了
(此句尚無繁中翻譯)
5:35.640–5:37.120
zh第三题是
(此句尚無繁中翻譯)
5:37.120–5:38.580
zhFreeJF折叠桌
(此句尚無繁中翻譯)
5:38.580–5:39.860
zh这里有一个滑块
(此句尚無繁中翻譯)
5:39.860–5:42.040
zh当你向右拖动它时
(此句尚無繁中翻譯)
5:42.040–5:43.400
zh桌子应该展开
(此句尚無繁中翻譯)
5:43.400–5:44.780
zh向左拖则折叠回去
(此句尚無繁中翻譯)
5:44.780–5:46.480
zh动画需要无缝衔接
(此句尚無繁中翻譯)
5:46.480–5:48.500
zh且呈现出真正的3D效果
(此句尚無繁中翻譯)
5:48.500–5:49.780
zh我们发送请求看看
(此句尚無繁中翻譯)
5:49.780–5:51.260
zh这个得到了7分
(此句尚無繁中翻譯)
5:51.260–5:52.780
zh桌子确实能折叠起来
(此句尚無繁中翻譯)
5:52.780–5:55.220
zh并能随滑块拖动而展开
(此句尚無繁中翻譯)
5:55.220–5:56.820
zh过渡基本自然
(此句尚無繁中翻譯)
5:56.820–5:58.400
zh只是还不够完全流畅
(此句尚無繁中翻譯)
5:58.400–6:00.160
zh表现最好的模型
(此句尚無繁中翻譯)
6:00.160–6:01.160
zh如Claude 3.5
(此句尚無繁中翻譯)
6:01.160–6:02.340
enKIMI GLM4
(此句尚無繁中翻譯)
6:02.340–6:03.800
zh以及Sonnet 3.5
(此句尚無繁中翻譯)
6:03.800–6:05.440
zh在这项测试中都拿到了9分
(此句尚無繁中翻譯)
6:05.440–6:06.640
zh但对比来看
(此句尚無繁中翻譯)
6:06.640–6:08.460
zhOpus在这项测试中仅得了5分
(此句尚無繁中翻譯)
6:08.460–6:10.740
zh所以这表现绝对算很不错了
(此句尚無繁中翻譯)
6:10.740–6:13.060
zh第四题是生成熊猫的SVG
(此句尚無繁中翻譯)
6:13.060–6:14.220
zh吃着汉堡
(此句尚無繁中翻譯)
6:14.220–6:15.420
zh我们发送过去看看
(此句尚無繁中翻譯)
6:15.420–6:16.500
zh好
(此句尚無繁中翻譯)
6:16.500–6:18.620
zh这确实能看出是一只熊猫
(此句尚無繁中翻譯)
6:18.620–6:20.420
zh也能看出是汉堡
(此句尚無繁中翻譯)
6:20.420–6:21.860
zh但构图有点别扭
(此句尚無繁中翻譯)
6:21.860–6:24.620
zh而且看起来不太像在吃汉堡
(此句尚無繁中翻譯)
6:24.620–6:26.020
zh这题给五分
(此句尚無繁中翻譯)
6:26.020–6:28.000
zh在这项测试中
(此句尚無繁中翻譯)
6:28.000–6:31.600
zh像Kimi和Gemini 1.5这样表现最好的模型
(此句尚無繁中翻譯)
6:31.600–6:35.240
zh以及Qwen 2.5 Max得分也仅为8分
(此句尚無繁中翻譯)
6:35.240–6:37.340
zh所以并不算惊艳
(此句尚無繁中翻譯)
6:37.340–6:39.180
zh第五题是制作弓箭
(此句尚無繁中翻譯)
6:39.180–6:41.940
zh模拟游戏里面设计了四个靶子
(此句尚無繁中翻譯)
6:41.940–6:44.700
zh玩家需要以最短的时间击中所有靶子
(此句尚無繁中翻譯)
6:44.700–6:46.120
zh从而登上排行榜
(此句尚無繁中翻譯)
6:46.120–6:47.740
zh我们发送代码运行一下看看
(此句尚無繁中翻譯)
6:47.740–6:49.140
zh这道题得了7分
(此句尚無繁中翻譯)
6:49.140–6:50.960
zh核心射击机制可以正常运行
(此句尚無繁中翻譯)
6:50.960–6:52.660
zh靶子能判定击中
(此句尚無繁中翻譯)
6:52.660–6:54.040
zh排行榜功能也正常
(此句尚無繁中翻譯)
6:54.040–6:56.200
zh但整体手感和细节打磨
(此句尚無繁中翻譯)
6:56.200–6:57.840
zh还达不到顶尖模型的水平
(此句尚無繁中翻譯)
6:57.840–7:00.740
zh比如Groq 1.5和Qwen 2.5 Math
(此句尚無繁中翻譯)
7:00.740–7:03.560
zh虽然Opus模型在这里都拿了满分
(此句尚無繁中翻譯)
7:03.560–7:05.100
zh但这依然是个可玩的游戏
(此句尚無繁中翻譯)
7:05.100–7:06.960
zh所以表现还算不错
(此句尚無繁中翻譯)
7:06.960–7:09.240
zh第六题是一道数学难题
(此句尚無繁中翻譯)
7:09.240–7:11.320
zh关于计算有序队的排列数
(此句尚無繁中翻譯)
7:11.320–7:13.300
zh答案应该是2460
(此句尚無繁中翻譯)
7:13.300–7:15.740
zh很多模型在这一题上完全翻车
(此句尚無繁中翻譯)
7:15.740–7:16.620
zh我们提交一下
(此句尚無繁中翻譯)
7:16.620–7:17.700
zh看看
(此句尚無繁中翻譯)
7:17.700–7:19.860
zh他完美答对了2460
(此句尚無繁中翻譯)
7:19.860–7:21.420
zh完全正确
(此句尚無繁中翻譯)
7:21.420–7:22.640
zh拿了满分10分
(此句尚無繁中翻譯)
7:22.640–7:24.300
zh这让他跻身同一梯队
(此句尚無繁中翻譯)
7:24.300–7:26.160
zh与Claude 3.5
(此句尚無繁中翻譯)
7:26.160–7:26.800
enGemini Chat
(此句尚無繁中翻譯)
7:26.800–7:28.060
enQwen Max
(此句尚無繁中翻譯)
7:28.060–7:29.400
zh以及Opus模型并列
(此句尚無繁中翻譯)
7:29.400–7:30.060
zh有趣的是
(此句尚無繁中翻譯)
7:30.060–7:31.600
zh在我测试时
(此句尚無繁中翻譯)
7:31.600–7:33.760
zhV4 Pro预览版也做对了这道题
(此句尚無繁中翻譯)
7:33.760–7:37.320
zh所以V4系列的推理能力显然非常过硬
(此句尚無繁中翻譯)
7:37.320–7:40.600
zh第七题是一个复杂的长程任务
(此句尚無繁中翻譯)
7:40.600–7:43.580
zh生成一个关于熊猫知识的数据集
(此句尚無繁中翻譯)
7:43.580–7:46.880
zh并用该数据集微调一个Gemma 2B模型
(此句尚無繁中翻譯)
7:46.880–7:51.240
zh接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识
(此句尚無繁中翻譯)
7:51.240–7:53.500
zh全程从零开始完全自主完成
(此句尚無繁中翻譯)
7:53.500–7:55.180
zh且完全在本地运行
(此句尚無繁中翻譯)
7:55.180–7:56.500
zh我们启动任务看看效果
(此句尚無繁中翻譯)
7:56.500–7:58.560
zh这次的表现绝对可以达满分
(此句尚無繁中翻譯)
7:58.560–8:01.040
zh它生成了数据集并完成了整个微调
(此句尚無繁中翻譯)
8:01.040–8:03.260
zh独自运行期间完全没有卡壳
(此句尚無繁中翻譯)
8:03.672–8:05.532
zh生成的Web UI正常运行
(此句尚無繁中翻譯)
8:05.532–8:08.052
zh每次刷新都显示新的熊猫冷知识
(此句尚無繁中翻譯)
8:08.052–8:11.372
zh这正是那种复杂的长程智能体任务
(此句尚無繁中翻譯)
8:11.372–8:13.392
zhDeepSeek 声称对其进行过针对性升级
(此句尚無繁中翻譯)
8:13.392–8:14.472
zh说实话
(此句尚無繁中翻譯)
8:14.472–8:15.432
zh效果显而易见
(此句尚無繁中翻譯)
8:15.432–8:17.192
zh之前的预览版远没这么可靠
(此句尚無繁中翻譯)
8:17.192–8:19.372
zh这波表现确实堪称完美
(此句尚無繁中翻譯)
8:19.372–8:21.032
zh第八题也是最后一题
(此句尚無繁中翻譯)
8:21.032–8:22.112
zh是制作一个3D万年历
(此句尚無繁中翻譯)
8:22.112–8:23.992
zh要求是一个功能完整的3D万年历
(此句尚無繁中翻譯)
8:23.992–8:25.392
zh能显示当前实际时间
(此句尚無繁中翻譯)
8:25.392–8:26.312
zh秒针 分针
(此句尚無繁中翻譯)
8:26.312–8:27.832
zh以及时针都要平滑转动
(此句尚無繁中翻譯)
8:27.832–8:28.492
zh还要有日期
(此句尚無繁中翻譯)
8:28.492–8:29.492
zh核心日期显示
(此句尚無繁中翻譯)
8:29.492–8:30.112
zh以及双时区
(此句尚無繁中翻譯)
8:30.112–8:31.632
zh这是整个测试集中最难的一题
(此句尚無繁中翻譯)
8:31.632–8:33.172
zh之前没有任何模型
(此句尚無繁中翻譯)
8:33.172–8:34.572
zh能在这道题上拿到好成绩
(此句尚無繁中翻譯)
8:34.572–8:36.712
zh历史最高分是GPT-4o创下的
(此句尚無繁中翻譯)
8:36.712–8:37.452
zh4分
(此句尚無繁中翻譯)
8:37.452–8:38.612
zh让我们直接运行测试
(此句尚無繁中翻譯)
8:38.612–8:39.672
zh但令人惊喜的是
(此句尚無繁中翻譯)
8:39.672–8:41.572
zhDeepSeek V4 Flash竟然拿到了6分
(此句尚無繁中翻譯)
8:41.572–8:43.212
zh创下这道题历史记录
(此句尚無繁中翻譯)
8:43.212–8:44.772
zh手表完整呈现出来
(此句尚無繁中翻譯)
8:47.192–8:48.272
zh指针转动平滑
(此句尚無繁中翻譯)
8:48.272–8:49.552
zh指针实时同步时间
(此句尚無繁中翻譯)
8:49.552–8:51.352
zh双时区设置也基本正常
(此句尚無繁中翻譯)
8:51.352–8:52.172
zh虽然还不完美
(此句尚無繁中翻譯)
8:52.172–8:54.152
zh所以没能拿到更高的分数
(此句尚無繁中翻譯)
8:54.152–8:56.112
zh但这个小模型刚刚击败了
(此句尚無繁中翻譯)
8:56.112–8:57.092
enCloud 3.5 Opus
(此句尚無繁中翻譯)
8:57.092–8:59.272
zh以及我测试集最难题目上的
(此句尚無繁中翻譯)
8:59.272–9:00.332
zh其他所有前沿模型
(此句尚無繁中翻譯)
9:00.332–9:02.092
zh这完全出乎我的意料
(此句尚無繁中翻譯)
9:02.092–9:03.892
zh来看一下最终的图表
(此句尚無繁中翻譯)
9:03.892–9:05.932
enDeep Seek V4 Flash 0731
(此句尚無繁中翻譯)
9:05.932–9:07.912
zh最终拿到了58分
(此句尚無繁中翻譯)
9:07.912–9:10.052
zh得分率为72.5%
(此句尚無繁中翻譯)
9:10.052–9:10.712
zh这让它排在
(此句尚無繁中翻譯)
9:10.712–9:15.272
zh略高于GPT-4o-513的71.25%
(此句尚無繁中翻譯)
9:15.272–9:18.852
zh稍低于Gemini 1.5 Pro的75%
(此句尚無繁中翻譯)
9:18.852–9:19.752
zh而在它之上
(此句尚無繁中翻譯)
9:19.752–9:21.172
zh有Kimi和
(此句尚無繁中翻譯)
9:21.172–9:23.352
zhOpenAI并列77.5%
(此句尚無繁中翻譯)
9:23.352–9:25.192
zhGPT-4o-2024-05-13达80%
(此句尚無繁中翻譯)
9:25.192–9:25.832
zh接着是Qwen
(此句尚無繁中翻譯)
9:25.832–9:29.152
zhQwen 2.5 Max拿下81.25%
(此句尚無繁中翻譯)
9:29.152–9:32.032
zh而Claude 3.5仍以82.5%稳居榜首
(此句尚無繁中翻譯)
9:32.032–9:33.572
zh而对比以下背景
(此句尚無繁中翻譯)
9:33.572–9:35.092
zh你就能明白这有多惊人
(此句尚無繁中翻譯)
9:35.092–9:37.732
zh我之前测试DeepSeek V4 Pro预览版时
(此句尚無繁中翻譯)
9:37.732–9:40.532
zh它在此测试中仅得了24.8%
(此句尚無繁中翻譯)
9:40.532–9:44.092
zh新的Flash模型得分达到了72.5%
(此句尚無繁中翻譯)
9:44.092–9:45.892
zh这意味着该系列的小模型现在
(此句尚無繁中翻譯)
9:45.892–9:48.472
zh比大模型预览版的表现提升了近三倍
(此句尚無繁中翻譯)
9:48.472–9:49.872
zh在我的测试中
(此句尚無繁中翻譯)
9:49.872–9:52.572
zh而且在架构和尺寸与预览版相同
(此句尚無繁中翻譯)
9:52.572–9:54.892
zh单靠后训练就能取得惊人提升
(此句尚無繁中翻譯)
9:54.892–9:55.472
zh不可思议
(此句尚無繁中翻譯)
9:55.472–9:59.052
zh这也印证了DeepSeek所宣称的Agent能力升级
(此句尚無繁中翻譯)
9:59.052–10:01.932
zh从得分规律中也可以清楚地看到
(此句尚無繁中翻譯)
10:01.932–10:03.712
zh所有逻辑推理
(此句尚無繁中翻譯)
10:03.712–10:06.892
zh或长程Agent任务基本上都拿到了满分
(此句尚無繁中翻譯)
10:06.892–10:09.292
zh比如数学和微调任务
(此句尚無繁中翻譯)
10:09.292–10:11.532
zh还有创纪录的代码生成常识
(此句尚無繁中翻譯)
10:11.532–10:14.112
zh但像熊猫SVG这种纯视觉打磨的任务
(此句尚無繁中翻譯)
10:14.112–10:15.252
zh还有电梯动画
(此句尚無繁中翻譯)
10:15.252–10:16.892
zh在这些方面它的表现依然平平
(此句尚無繁中翻譯)
10:16.892–10:18.592
zh所以这确实很像是一个
(此句尚無繁中翻譯)
10:18.592–10:20.372
zh针对智能体编程深度微调的模型
(此句尚無繁中翻譯)
10:20.372–10:22.292
zh正如官方基准测试所示
(此句尚無繁中翻譯)
10:22.292–10:23.292
zh那么结论是什么
(此句尚無繁中翻譯)
10:23.292–10:25.532
zh这绝对是目前性价比最高的模型之一
(此句尚無繁中翻譯)
10:25.532–10:26.772
zh可用于智能体编程
(此句尚無繁中翻譯)
10:26.772–10:27.792
zh在我的测试中
(此句尚無繁中翻譯)
10:27.792–10:29.692
zh它的表现已经达到了Gemini 1.5 Pro的水平
(此句尚無繁中翻譯)
10:29.692–10:32.012
zh它可以直接接入Cursor等代码工具
(此句尚無繁中翻譯)
10:32.012–10:33.392
zh这得益于其API知识
(此句尚無繁中翻譯)
10:33.392–10:34.972
zh而且DeepSeek的价格
(此句尚無繁中翻譯)
10:34.972–10:36.312
zh一直都非常便宜
(此句尚無繁中翻譯)
10:36.312–10:37.112
zh如果你是学生
(此句尚無繁中翻譯)
10:37.112–10:39.092
zh或者对于预算有限的开发者
(此句尚無繁中翻譯)
10:39.092–10:40.412
zh这绝对是个极佳的选择
(此句尚無繁中翻譯)
10:40.412–10:42.612
zh它显然还无法击败Claude 3.5
(此句尚無繁中翻譯)
10:42.612–10:44.572
zh或是在综合表现上超越OPUS
(此句尚無繁中翻譯)
10:44.572–10:46.672
zh而且他的视觉能力依然表现平平
(此句尚無繁中翻譯)
10:46.672–10:48.252
zh但考虑到他的体量和价格
(此句尚無繁中翻譯)
10:48.252–10:49.292
zh这已经足够惊艳了
(此句尚無繁中翻譯)
10:49.292–10:50.032
zh而且别忘了
(此句尚無繁中翻譯)
10:50.032–10:51.672
zh这还仅仅是Flash版本
(此句尚無繁中翻譯)
10:51.672–10:53.412
zh官方的DeepSeek V4 Pro也即将发布
(此句尚無繁中翻譯)
10:53.412–10:54.652
zh据官方介绍
(此句尚無繁中翻譯)
10:54.652–10:56.492
zh如果将同样的智能体后训练应用
(此句尚無繁中翻譯)
10:56.492–10:58.452
zh到1.6万亿参数的模型上
(此句尚無繁中翻譯)
10:58.452–11:00.452
zh那对市面上昂贵的闭源模型来说
(此句尚無繁中翻譯)
11:00.452–11:01.812
zh将是降维打击般的存在
(此句尚無繁中翻譯)
11:01.812–11:03.932
zh我会在上线后第一时间进行测试
(此句尚無繁中翻譯)
11:03.932–11:04.592
zh请继续关注
(此句尚無繁中翻譯)
11:04.592–11:05.692
zh总的来说
(此句尚無繁中翻譯)
11:05.692–11:06.432
zh这非常酷
(此句尚無繁中翻譯)
影片筆記:DeepSeek V4 Flash 深度实测!冲进前五,这波是真正的王者归来! p01 中文配音
一句話總結
DeepSeek 發布了 V4 Flash 0731 版本,透過「智能體後訓練」大幅提升 Agent 能力,在自建基準測試中展現出極高的性價比與強大的數學、長程任務推理能力,雖在純視覺打磨上表現一般,但已逼近頂尖模型水平,預示著即將發布的 V4 Pro 正式版將帶來更大衝擊。
核心重點
- 版本更新核心:DeepSeek V4 Flash 0731 版本並非增加參數量,而是透過高强度的「智能體後訓練」(Agent Post-training)來提升能力。
- 性能表現:
- 官方基準測試顯示,V4 Flash 0731 在 Terminal Bench 2.1 等指標上超越 V4 Pro 預覽版,並逼近 Opus 水平。
- 講者自建測試(Kinbench/TingBench)顯示,該模型在數學推理、長程智能體任務及部分 3D 生成上表現卓越,創下歷史高分。
- 在純視覺打磨(如 SVG 圖像、電梯動畫流暢度)上表現平平。
- 技術規格與生態:
- V4 Flash 為混合專家模型(MoE),定位快速、低成本。
- 原生支持 Response API 格式,完全適配 Codex 框架,可直接接入 Cursor 等代碼工具。
- 適用對象與建議:
- 該模型性價比極高,適合預算有限的開發者或學生用於智能體編程。
- 官方 DeepSeek V4 Pro 正式版即將發布,若將同樣的智能體後訓練應用於 1.6 萬億參數模型,將對閉源模型形成巨大衝擊。
詳細大綱
I. DeepSeek V4 Flash 0731 更新介紹
- 發布內容:DeepSeek V4 Flash 官方 API 開啟公測,版本號為 0731。
- 核心變化:
- 架構與參數量與預覽版完全一致(未變大)。
- 主要提升來自「智能體後訓練」(Agent Post-training)。
- 智能體能力測試分數遠超 V4 Pro 預覽版。
- 適用範圍:僅限 DeepSeek V4 Flash API、V4 Pro API 及 App 端;網頁端模型未變。
- 未來預告:DeepSeek V4 Pro 正式版本即將發布。
II. 技術細節與生態適配
- 模型規格(V4 Flash 系列):
- 混合專家模型(MoE)。
- 總參數量:2000.0840 億(聽似有誤,疑點見下文)。
- 激活參數量:約 130 億。
- 上下文窗口:100 萬 Token。
- 定位:快速、低成本。
- 對比模型:V4 Pro 為 1.6 萬億參數的旗艦大模型。
- 生態適配:
- 原生支持 Response API 格式。
- 完全適配 Codex 框架,可直接接入 Codex 風格工作流。
- GLM 及其他國內實驗室也在進行類似框架適配。
III. 官方基準測試數據
- Terminal Bench 2.1:
- V4 Flash 0731:82.7 分。
- V4 Flash 預覽版:61.8 分。
- V4 Pro 預覽版:72.1 分。
- GLM-4-0520:81 分。
- Opus:85 分(價格更貴)。
- SWBEC:
- 新版本:54.4 分。
- 預覽版:7.3 分。
- GLM4-0520:46.2 分。
- Opus:58 分。
- 其他指標提升:
- Cybergen:38.7 -> 76.7 分。
- CoderEval:49.7 -> 70.3 分。
- DSBench(全棧任務):37 -> 68.7 分。
- 高難度編碼智能體任務:25.8 -> 59.6 分。
- 測試條件註解:
- 使用了即將推出的 Deep-C Harness 框架。
- 運行於「極簡模式」,最高檔位。
- Top-p 設為 0.95,溫度(Temperature)設為 1。
- DeepSeek 強調測試框架選擇對結果影響巨大,數據僅供參考。
IV. 講者自建基準測試(Kinbench/TingBench)
- 測試環境:講者自建基準測試,涵蓋前端、動畫、Three.js、SVG、數學、長程智能體及 3D 任務。
- 評分標準:每項滿分 10 分。
測試題目與結果:
- 電梯模擬(前端/動畫):
- 任務:構建模擬程序,多電梯運行,懸停顯示目標樓層。
- 結果:5 分。基本框架有,但核心邏輯(乘客接駁)未跑通,動畫不流暢。
- 對比:Opus 10 分,Claude 3.5 與 Kimi k3 為 9 分。
- Three.js 隱形眼鏡盒(3D模型):
- 任務:生成帶 L/R 標識蓋子的 3D 模型,點擊打開交互。
- 結果:8 分。外觀合格,交互有效。
- 對比:Qwen 2.5 Maths 並列,Opus 5 分(歷史第二),Claude 3.5 唯一滿分。
- FreeJF 折疊桌(3D動畫):
- 任務:滑塊控制折疊/展開,無縫 3D 動畫。
- 結果:7 分。過渡基本自然但不完全流暢。
- 對比:Claude 3.5, Kimi, GLM4, Sonnet 3.5 為 9 分;Opus 僅 5 分。
- 生成 SVG 吃漢堡的熊貓(視覺):
- 任務:生成 SVG 圖像。
- 結果:5 分。構圖別扭,不像在吃漢堡。
- 對比:Kimi, Gemini 1.5, Qwen 2.5 Max 僅 8 分。
- 弓箭模擬遊戲(遊戲邏輯):
- 任務:四個靶子,最短時間擊中,排行榜功能。
- 結果:7 分。核心機制正常,手感與細節打磨未達頂尖。
- 對比:Groq 1.5, Qwen 2.5 Math, Opus 滿分。
- 數學難題(推理):
- 任務:計算有序隊排列數,答案 2460。
- 結果:10 分(滿分)。完美答對。
- 對比:與 Claude 3.5, Gemini Chat, Qwen Max, Opus 並列。
- 註:V4 Pro 預覽版也做對了,顯示 V4 系列推理能力強。
- 長程智能體任務(全棧/微調):
- 任務:生成熊貓數據集 -> 微調 Gemma 2B -> 構建本地 WebUI -> 隨機生成冷知識。全程自主、本地運行。
- 結果:10 分(滿分)。表現完美,無卡殼。
- 對比:預覽版遠不如現在可靠。
- 3D 萬年曆(極難 3D):
- 任務:功能完整的 3D 萬年曆,顯示時間(秒/分/針平滑轉動)、日期、雙時區。
- 結果:6 分。創下該題歷史記錄(此前最高為 GPT-4o 的 4 分)。
- 對比:擊敗了 Claude 3.5, Opus 及其他前沿模型。
V. 最終總結與結論
- 總分:58 分,得分率 72.5%。
- 排名對比:
- 高於 GPT-4o-513 (71.25%)。
- 低於 Gemini 1.5 Pro (75%)。
- 低於 Kimi, OpenAI (77.5%)。
- 低於 GPT-4o-2024-05-13 (80%)。
- 低於 Qwen 2.5 Max (81.25%)。
- 低於 Claude 3.5 (82.5%)。
- 關鍵發現:
- V4 Flash 小模型得分率 (72.5%) 遠高於 V4 Pro 預覽版 (24.8%),提升近三倍。
- 在邏輯推理、長程 Agent 任務上表現完美。
- 在純視覺打磨(如 SVG、電梯動畫)上表現平平。
- 結論:針對智能體編程深度微調的模型。
- 建議:
- 目前性價比最高的模型之一。
- 可直接接入 Cursor 等代碼工具。
- 適合學生或預算有限的開發者。
- 雖無法擊敗 Claude 3.5 或 Opus 綜合表現,但考慮體量與價格已足夠驚艷。
- 未來展望:
- 官方 DeepSeek V4 Pro 即將發布。
- 若將同樣的智能體後訓練應用於 1.6 萬億參數模型,將對閉源模型形成「降維打擊」。
工具 / 模型 / 名詞整理
- DeepSeek 系列:
- DeepSeek V4 Flash (0731 版本)
- DeepSeek V4 Pro (預覽版 / 即將發布的正式版)
- 其他模型:
- Claude 3.5
- Opus (可能指 Claude Opus)
- GLM-4-0520 / GLM4
- Kimi k3 / Kimi
- Qwen 2.5 Maths / Qwen 2.5 Max
- Sonnet 3.5
- Gemini 1.5 / Gemini Chat
- GPT-4o-513 / GPT-4o-2024-05-13
- Groq 1.5
- Gemma 2B
- 框架與工具:
- NVIDIA Link (用於免費使用)
- Kinbench (講者自稱的基準測試名稱,後文又稱 TingBench)
- Terminal Bench 2.1
- SWBEC
- Cybergen
- CoderEval
- DSBench
- Deep-C Harness (即將推出的框架)
- Codex (框架/工作流)
- Cursor (代碼工具)
- Three.js
- SVG
- WebUI
操作流程整理
- 獲取模型:通過 DeepSeek V4 Flash API 或 App 端獲取 0731 版本模型。
- 環境配置:
- 確保使用支持 Response API 格式的框架。
- 若使用 Codex 框架,可直接接入工作流。
- 若進行官方基準測試,需使用 Deep-C Harness 框架,設置 Top-p 為 0.95,溫度為 1,並運行於「極簡模式」。
- 執行測試任務:
- 前端/動畫任務:如電梯模擬、折疊桌動畫,測試邏輯與流暢度。
- 3D 生成任務:如隱形眼鏡盒、萬年曆,測試模型生成與交互能力。
- 視覺生成任務:如 SVG 圖像生成,測試視覺構圖能力。
- 數學推理任務:如排列數計算,測試邏輯推理能力。
- 長程智能體任務:如數據集生成、模型微調、WebUI 構建,測試全流程自主執行能力。
- 評估與對比:
- 根據任務完成度、代碼質量、視覺效果進行評分(滿分 10 分)。
- 將結果與其他模型(如 Claude 3.5, Opus, GPT-4o 等)進行對比分析。
- 應用建議:
- 對於預算有限的開發者,建議優先使用 V4 Flash 進行智能體編程與邏輯推理任務。
- 可將模型接入 Cursor 等代碼工具進行實際開發。
值得注意的限制或風險
- 參數量描述疑點:影片中提到 V4 Flash 總參數量為「2000.0840 億」,此數字格式異常,可能為聽寫錯誤或口誤,實際數值需查證。
- 測試名稱不一致:講者先稱測試為「Kinbench」,後又稱「TingBench」,兩者可能為同一測試的不同稱呼或口誤,需查證正確名稱。
- 模型名稱拼寫:影片中出現「Cloud 3.5」,應指「Claude 3.5」,但依規則標為疑點。
- 參數規模描述混淆:影片中存在「2840 億參數的 Flash」與前文「2000 0840 億」及「130 億激活參數」的描述可能存在聽寫混淆,需查證 V4 Flash 的確切參數。
- 溫度參數描述語意不通:影片提到「溫度參數設為一可見」,「可見」二字語意不通,疑為口誤或聽寫錯誤。
- 詞彙聽寫錯誤:「重歸原矩」疑為「重回原點」或類似詞彙的聽寫錯誤。
- 術語使用不常見:「API 知識」在語境中可能指「API 接口」或特定功能,但「API 知識」一詞較不常見,疑為口誤。
逐字稿辨識疑點
- 參數量描述:「2000 0840 億的總參數量」。數字格式異常,疑為聽寫錯誤或口誤,實際數值需查證。
- 測試名稱不一致:講者先稱測試為「Kinbench」,後又稱「TingBench」。兩者可能為同一測試的不同稱呼或口誤,需查證正確名稱。
- 模型名稱拼寫:「Cloud 3.5」應指「Claude 3.5」,但依規則標為疑點。
- 參數規模描述:「2840 億參數的 Flash」與前文「2000 0840 億」及「130 億激活參數」的描述可能存在聽寫混淆,需查證 V4 Flash 的確切參數。
- 溫度參數描述:「溫度參數設為一可見」,「可見」二字語意不通,疑為口誤或聽寫錯誤。
- 重歸原矩:「重歸原矩」疑為「重回原點」或類似詞彙的聽寫錯誤。
- 代碼工具名稱:「API 知識」在語境中可能指「API 接口」或特定功能,但「API 知識」一詞較不常見,疑為口誤。
可延伸追問
- DeepSeek V4 Flash 0731 版本的確切參數量是多少?「2000.0840 億」是否為聽誤?
- 「Kinbench」與「TingBench」是否為同一個基準測試?其正確名稱為何?
- 「Cloud 3.5」是否確指「Claude 3.5」?
- 「溫度參數設為一可見」中的「可見」具體指什麼?是否為「1.0」的聽誤?
- 「重歸原矩」的正確詞彙為何?
- 「API 知識」在影片語境中具體指代什麼功能或接口?
- DeepSeek V4 Pro 正式版的具體發布時間與性能預期為何?
- 如何通過 NVIDIA Link 免費使用 DeepSeek V4 Flash API?
尚未產生學習筆記
請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習