實際影片長度:11:06.956。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:07.460
zh大家好 欢迎收看新一期视频
0:07.460–0:10.720
zhDeepseek刚刚发布了一个很有意思的更新
0:10.720–0:14.980
zhDeepseek V4 Flash官方API现已开启公测
0:14.980–0:19.240
zh新版本命名为Deepseek V4 Flash 0731
0:19.240–0:21.600
zh这可不只是一个小补丁
0:21.600–0:25.000
zhDeepseek表示他们大幅提升了智能体能力
0:25.000–0:27.180
zh在该模型上甚至
0:27.180–0:30.600
zh使其测试分数如今已远超V4 Pro预览版
0:30.600–0:31.780
zh也就是说
0:31.780–0:33.980
zh这个小模型现在击败了预览版
0:33.980–0:36.720
zh极大模型在智能体任务上的版本
0:36.720–0:38.420
zh这确实挺疯狂的
0:38.420–0:40.420
zh我也用我自己的Kinbench测试了它
0:40.420–0:42.320
zh而在我的基准测试中
0:42.320–0:43.040
zh它做到了
0:43.040–0:45.200
zh其他任何模型都未曾做到的事
0:45.200–0:46.400
zh包括Claude 3.5
0:46.400–0:48.360
zh以及Opus稍后我们会细聊
0:48.360–0:48.860
zh但首先
0:48.860–0:51.040
zh我们先聊聊这次更新到底是什么
0:51.040–0:53.340
zh前阵子我介绍过DeepSeek V4 Pro
0:53.340–0:55.120
zh和V4 Flash的预览版
0:55.120–0:58.120
zh包括如何通过NVIDIA Link免费使用它们
0:58.120–0:59.560
zh视频链接已放在下方
0:59.560–1:00.940
zh我们先快速回顾一下Flash
1:00.940–1:03.120
zh它是V4系列中较小的模型
1:03.120–1:05.400
zh该混合专家模型拥有2000
1:05.400–1:07.720
zh0840亿的总参数量
1:07.720–1:09.660
zh约130亿激活参数
1:09.660–1:12.000
zh支持100万Token上下文窗口
1:12.000–1:13.780
zh它定位为主打快速
1:13.780–1:15.180
zh与低成本版本
1:15.180–1:15.900
zh而V4 Pro
1:15.900–1:18.200
zh是1.6万亿参数旗舰大模型
1:18.200–1:19.940
zh关于这次0731更新
1:19.940–1:21.040
zh有一个关键细节
1:21.040–1:22.500
zhDeepSeek明确表示
1:22.500–1:24.340
enV4Flash 0731
1:24.340–1:26.540
zh保持了完全相同的模型架构
1:26.540–1:29.060
zh和参数规模与预览版完全一致
1:29.060–1:30.700
zh所以它并没有变大
1:30.700–1:31.300
zh依然是
1:31.300–1:33.480
zh那款2840亿参数的Flash
1:33.480–1:34.820
zh但在此基础上
1:34.820–1:36.880
zh它似乎进行了高强度的智能体后训练
1:36.880–1:39.640
zh所有的性能提升都源于训练的优化
1:39.640–1:41.200
zh而不是增加参数量
1:41.200–1:42.240
zh他们还明确指出
1:42.240–1:45.040
zh这次升级仅是用于DeepSeek V4 Flash API
1:45.040–1:46.480
enV4 Pro API
1:46.480–1:48.240
zh以及App端模型
1:48.240–1:50.120
zh和网页端目前都保持不变
1:50.120–1:52.000
zh公告最后提到
1:52.000–1:54.240
zhDeepSeek V4 Pro的正式版本
1:54.240–1:55.960
zh很快就会发布
1:55.960–1:58.240
zh所以这次Flash更新基本只是热身
1:58.240–2:00.780
zh真正的重头戏还在后头
2:00.780–2:01.720
zh另外
2:01.720–2:03.260
zh这次发布中还有一点
2:03.260–2:05.020
zh我觉得非常明智
2:05.020–2:08.940
zh官方V4 Flash现在原生支持Response API格式
2:08.940–2:11.620
zhDeepSeek还表示他已完全适配Codex
2:11.620–2:13.820
zh所以他们不仅是发布了一个模型
2:13.820–2:15.880
zh而不是被动等待工具链的适配
2:15.880–2:18.280
zh他们直接面向Codex适配框架进行了开发
2:18.280–2:20.320
zh这意味着你可以将其接入
2:20.320–2:22.980
zh到Codex风格的工作流中且毫无阻碍
2:22.980–2:25.740
zhGLM以及国内的其他一些实验室也在做
2:25.740–2:26.940
zh类似的框架适配
2:26.940–2:28.840
zh事实证明效果立竿见影
2:28.840–2:30.100
zh这确实是个明智之举
2:30.100–2:32.440
zh接下来看看官方的基准测试数据
2:32.440–2:33.820
zh这次性能提升太惊人了
2:33.820–2:35.180
zh在Terminal Bench 2.1测试中
2:35.180–2:37.440
zh新版Flash跑分高达82.7
2:37.440–2:39.960
zh而此前的预览版仅为61.8
2:39.960–2:42.980
zh甚至连V4 Pro预览版也只有72.1分
2:42.980–2:46.260
zh这也让它超越了81分的GLM-4-0520
2:46.260–2:49.160
zh而且距离85分的OPUS差距并不大
2:49.160–2:51.300
zh要知道后者的价格可要贵得多
2:51.300–2:52.800
zh而最夸张的是SWBEC
2:52.980–2:55.580
zh预览版在这个测试中仅获得了7.3分
2:55.580–2:58.040
zh而新版本直接飙升到54.4分
2:58.040–2:59.900
zh实现了从基本无法使用
2:59.900–3:03.900
zh到足以与46.2分的GLM4-0520正面竞争的水平
3:03.900–3:05.920
zh甚至是58分的OPUS
3:05.920–3:08.140
zhCybergen也从38.7分
3:08.140–3:10.680
zh升至76.7分,CoderEval从
3:10.680–3:13.280
zh从49.7分升至70.3分
3:13.280–3:15.500
zh在其内部DSBench测试集上
3:15.500–3:18.260
zh全栈任务得分从37升至68.7
3:18.260–3:20.380
zh高难度编码智能体任务也
3:20.380–3:22.740
zh从25.8升至59.6
3:22.740–3:23.800
zh总的来说
3:23.800–3:25.840
zh这较其自身的预览版有了巨大飞跃
3:25.840–3:28.200
zh且在大多数智能体基准测试中
3:28.200–3:29.820
zh它已逼近OPUS 4.8
3:29.820–3:31.820
zh而它作为一款尺寸小得多
3:31.820–3:33.160
zh且更便宜的模型
3:33.160–3:34.100
zh不过需要说明的是
3:34.100–3:35.120
zhDeepSeek指出
3:35.120–3:36.820
zh在公开的编码智能体任务测试中
3:36.820–3:38.380
zhV4 Flash使用了
3:38.380–3:41.360
zh其即将推出的Deep-C Harness框架在极简模式下
3:41.360–3:42.760
zh以最高档位运行
3:42.760–3:44.120
zh且Top-p采样设为0.95
3:44.120–3:45.840
zh温度参数设为一可见
3:45.840–3:47.500
zh测试框架的选择至关重要
3:47.500–3:49.000
zh测试结果可能不同
3:49.000–3:50.580
zh数据仅供参考
3:50.580–3:52.660
zh不过了解本频道的人都知道
3:52.660–3:54.640
zh我们从不只看官方宣传数据
3:54.640–3:56.380
zh所以我用自己的基准测试跑了一下
3:56.380–3:58.360
zh话不多说我们直接切入正题
3:58.360–3:59.440
zh和往常一样
3:59.440–4:00.860
zh我用我的TingBench进行了测试
4:00.860–4:02.400
zh其中涵盖了一些前端
4:02.400–4:05.200
zh与动画一些Three.js任务以及SVG测试
4:05.200–4:08.780
zh一道数学题以及一个长程智能体任务
4:08.780–4:10.720
zh最后还有一个超难的3D任务
4:10.720–4:12.500
zh每项测试满分10分
4:12.500–4:15.280
zh最后我们会通过最终的图表来看看
4:15.280–4:18.060
zh看看它的表现与其他模型相比如何
4:18.060–4:19.880
zh第一题是电梯模拟
4:19.880–4:22.300
zh模型需要构建一个模拟程序
4:22.300–4:24.520
zh你可以在不同楼层生成乘客
4:24.520–4:26.020
zh共有三部电梯
4:26.020–4:27.500
zh其每部只能在一人
4:27.500–4:29.980
zh没赶上的人需要搭乘下一班电梯
4:29.980–4:32.760
zh还需要有提示框显示每个人的目标楼层
4:32.760–4:34.720
zh当鼠标悬停在他们身上时
4:34.720–4:36.500
zh我们发送提示词看看效果
4:36.500–4:38.020
zh这个表现只能算一半
4:38.020–4:40.000
zh得了五分基本框架是有了
4:40.000–4:42.020
zh但关于乘客没赶上电梯
4:42.020–4:44.620
zh并被下一班电梯接走的核心逻辑并没有完全跑通
4:44.620–4:46.500
zh而且动画也不够流畅
4:46.500–4:47.360
zh作为参考
4:47.360–4:49.860
zh只有OPUS模型在这项测试中拿过10分
4:49.860–4:51.800
zh而像CLAUDE 3.5这样的模型
4:51.800–4:53.620
zh和Kimi k3也只有9分
4:53.620–4:55.540
zh所以这开局只能算重归原矩
4:55.540–4:58.640
zh第二个测试是Three.js隐形眼镜盒
4:58.640–5:01.240
zh它需要生成一个3D模型
5:01.240–5:04.940
zh是一个带有明显L和R标识盖子的隐形眼镜盒
5:04.940–5:08.660
zh并且点击盖子能够将其打开这项测试
5:08.660–5:11.280
zh几乎所有模型都会在这里翻车
5:11.280–5:12.480
zh我们发送过去看看
5:12.480–5:14.800
zh好的 这其实做得非常好
5:14.800–5:16.140
zh它拿到了8分
5:16.140–5:17.880
zh盒子看起来很像样
5:17.880–5:19.300
zh像个合格的眼镜盒L
5:19.300–5:21.800
zh而且L和R盖也清晰可见
5:21.800–5:23.240
zh点击打开的交互也有效
5:23.240–5:25.080
zh这让他与Qwen 2.5 Maths并列
5:25.080–5:26.420
zh而Opus拿到了5分
5:26.420–5:27.340
zh是历史第二高分
5:27.340–5:29.520
zh在该测试中仅次于Claude 3.5
5:29.520–5:31.140
zh他仍然是唯一在这个测试中
5:31.140–5:32.180
zh拿到满分10分的模型
5:32.180–5:33.860
zh所以对于一个小模型来说
5:33.860–5:35.640
zh能有这样的表现已经非常惊艳了
5:35.640–5:37.120
zh第三题是
5:37.120–5:38.580
zhFreeJF折叠桌
5:38.580–5:39.860
zh这里有一个滑块
5:39.860–5:42.040
zh当你向右拖动它时
5:42.040–5:43.400
zh桌子应该展开
5:43.400–5:44.780
zh向左拖则折叠回去
5:44.780–5:46.480
zh动画需要无缝衔接
5:46.480–5:48.500
zh且呈现出真正的3D效果
5:48.500–5:49.780
zh我们发送请求看看
5:49.780–5:51.260
zh这个得到了7分
5:51.260–5:52.780
zh桌子确实能折叠起来
5:52.780–5:55.220
zh并能随滑块拖动而展开
5:55.220–5:56.820
zh过渡基本自然
5:56.820–5:58.400
zh只是还不够完全流畅
5:58.400–6:00.160
zh表现最好的模型
6:00.160–6:01.160
zh如Claude 3.5
6:01.160–6:02.340
enKIMI GLM4
6:02.340–6:03.800
zh以及Sonnet 3.5
6:03.800–6:05.440
zh在这项测试中都拿到了9分
6:05.440–6:06.640
zh但对比来看
6:06.640–6:08.460
zhOpus在这项测试中仅得了5分
6:08.460–6:10.740
zh所以这表现绝对算很不错了
6:10.740–6:13.060
zh第四题是生成熊猫的SVG
6:13.060–6:14.220
zh吃着汉堡
6:14.220–6:15.420
zh我们发送过去看看
6:15.420–6:16.500
zh
6:16.500–6:18.620
zh这确实能看出是一只熊猫
6:18.620–6:20.420
zh也能看出是汉堡
6:20.420–6:21.860
zh但构图有点别扭
6:21.860–6:24.620
zh而且看起来不太像在吃汉堡
6:24.620–6:26.020
zh这题给五分
6:26.020–6:28.000
zh在这项测试中
6:28.000–6:31.600
zh像Kimi和Gemini 1.5这样表现最好的模型
6:31.600–6:35.240
zh以及Qwen 2.5 Max得分也仅为8分
6:35.240–6:37.340
zh所以并不算惊艳
6:37.340–6:39.180
zh第五题是制作弓箭
6:39.180–6:41.940
zh模拟游戏里面设计了四个靶子
6:41.940–6:44.700
zh玩家需要以最短的时间击中所有靶子
6:44.700–6:46.120
zh从而登上排行榜
6:46.120–6:47.740
zh我们发送代码运行一下看看
6:47.740–6:49.140
zh这道题得了7分
6:49.140–6:50.960
zh核心射击机制可以正常运行
6:50.960–6:52.660
zh靶子能判定击中
6:52.660–6:54.040
zh排行榜功能也正常
6:54.040–6:56.200
zh但整体手感和细节打磨
6:56.200–6:57.840
zh还达不到顶尖模型的水平
6:57.840–7:00.740
zh比如Groq 1.5和Qwen 2.5 Math
7:00.740–7:03.560
zh虽然Opus模型在这里都拿了满分
7:03.560–7:05.100
zh但这依然是个可玩的游戏
7:05.100–7:06.960
zh所以表现还算不错
7:06.960–7:09.240
zh第六题是一道数学难题
7:09.240–7:11.320
zh关于计算有序队的排列数
7:11.320–7:13.300
zh答案应该是2460
7:13.300–7:15.740
zh很多模型在这一题上完全翻车
7:15.740–7:16.620
zh我们提交一下
7:16.620–7:17.700
zh看看
7:17.700–7:19.860
zh他完美答对了2460
7:19.860–7:21.420
zh完全正确
7:21.420–7:22.640
zh拿了满分10分
7:22.640–7:24.300
zh这让他跻身同一梯队
7:24.300–7:26.160
zh与Claude 3.5
7:26.160–7:26.800
enGemini Chat
7:26.800–7:28.060
enQwen Max
7:28.060–7:29.400
zh以及Opus模型并列
7:29.400–7:30.060
zh有趣的是
7:30.060–7:31.600
zh在我测试时
7:31.600–7:33.760
zhV4 Pro预览版也做对了这道题
7:33.760–7:37.320
zh所以V4系列的推理能力显然非常过硬
7:37.320–7:40.600
zh第七题是一个复杂的长程任务
7:40.600–7:43.580
zh生成一个关于熊猫知识的数据集
7:43.580–7:46.880
zh并用该数据集微调一个Gemma 2B模型
7:46.880–7:51.240
zh接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识
7:51.240–7:53.500
zh全程从零开始完全自主完成
7:53.500–7:55.180
zh且完全在本地运行
7:55.180–7:56.500
zh我们启动任务看看效果
7:56.500–7:58.560
zh这次的表现绝对可以达满分
7:58.560–8:01.040
zh它生成了数据集并完成了整个微调
8:01.040–8:03.260
zh独自运行期间完全没有卡壳
8:03.672–8:05.532
zh生成的Web UI正常运行
8:05.532–8:08.052
zh每次刷新都显示新的熊猫冷知识
8:08.052–8:11.372
zh这正是那种复杂的长程智能体任务
8:11.372–8:13.392
zhDeepSeek 声称对其进行过针对性升级
8:13.392–8:14.472
zh说实话
8:14.472–8:15.432
zh效果显而易见
8:15.432–8:17.192
zh之前的预览版远没这么可靠
8:17.192–8:19.372
zh这波表现确实堪称完美
8:19.372–8:21.032
zh第八题也是最后一题
8:21.032–8:22.112
zh是制作一个3D万年历
8:22.112–8:23.992
zh要求是一个功能完整的3D万年历
8:23.992–8:25.392
zh能显示当前实际时间
8:25.392–8:26.312
zh秒针 分针
8:26.312–8:27.832
zh以及时针都要平滑转动
8:27.832–8:28.492
zh还要有日期
8:28.492–8:29.492
zh核心日期显示
8:29.492–8:30.112
zh以及双时区
8:30.112–8:31.632
zh这是整个测试集中最难的一题
8:31.632–8:33.172
zh之前没有任何模型
8:33.172–8:34.572
zh能在这道题上拿到好成绩
8:34.572–8:36.712
zh历史最高分是GPT-4o创下的
8:36.712–8:37.452
zh4分
8:37.452–8:38.612
zh让我们直接运行测试
8:38.612–8:39.672
zh但令人惊喜的是
8:39.672–8:41.572
zhDeepSeek V4 Flash竟然拿到了6分
8:41.572–8:43.212
zh创下这道题历史记录
8:43.212–8:44.772
zh手表完整呈现出来
8:47.192–8:48.272
zh指针转动平滑
8:48.272–8:49.552
zh指针实时同步时间
8:49.552–8:51.352
zh双时区设置也基本正常
8:51.352–8:52.172
zh虽然还不完美
8:52.172–8:54.152
zh所以没能拿到更高的分数
8:54.152–8:56.112
zh但这个小模型刚刚击败了
8:56.112–8:57.092
enCloud 3.5 Opus
8:57.092–8:59.272
zh以及我测试集最难题目上的
8:59.272–9:00.332
zh其他所有前沿模型
9:00.332–9:02.092
zh这完全出乎我的意料
9:02.092–9:03.892
zh来看一下最终的图表
9:03.892–9:05.932
enDeep Seek V4 Flash 0731
9:05.932–9:07.912
zh最终拿到了58分
9:07.912–9:10.052
zh得分率为72.5%
9:10.052–9:10.712
zh这让它排在
9:10.712–9:15.272
zh略高于GPT-4o-513的71.25%
9:15.272–9:18.852
zh稍低于Gemini 1.5 Pro的75%
9:18.852–9:19.752
zh而在它之上
9:19.752–9:21.172
zh有Kimi和
9:21.172–9:23.352
zhOpenAI并列77.5%
9:23.352–9:25.192
zhGPT-4o-2024-05-13达80%
9:25.192–9:25.832
zh接着是Qwen
9:25.832–9:29.152
zhQwen 2.5 Max拿下81.25%
9:29.152–9:32.032
zh而Claude 3.5仍以82.5%稳居榜首
9:32.032–9:33.572
zh而对比以下背景
9:33.572–9:35.092
zh你就能明白这有多惊人
9:35.092–9:37.732
zh我之前测试DeepSeek V4 Pro预览版时
9:37.732–9:40.532
zh它在此测试中仅得了24.8%
9:40.532–9:44.092
zh新的Flash模型得分达到了72.5%
9:44.092–9:45.892
zh这意味着该系列的小模型现在
9:45.892–9:48.472
zh比大模型预览版的表现提升了近三倍
9:48.472–9:49.872
zh在我的测试中
9:49.872–9:52.572
zh而且在架构和尺寸与预览版相同
9:52.572–9:54.892
zh单靠后训练就能取得惊人提升
9:54.892–9:55.472
zh不可思议
9:55.472–9:59.052
zh这也印证了DeepSeek所宣称的Agent能力升级
9:59.052–10:01.932
zh从得分规律中也可以清楚地看到
10:01.932–10:03.712
zh所有逻辑推理
10:03.712–10:06.892
zh或长程Agent任务基本上都拿到了满分
10:06.892–10:09.292
zh比如数学和微调任务
10:09.292–10:11.532
zh还有创纪录的代码生成常识
10:11.532–10:14.112
zh但像熊猫SVG这种纯视觉打磨的任务
10:14.112–10:15.252
zh还有电梯动画
10:15.252–10:16.892
zh在这些方面它的表现依然平平
10:16.892–10:18.592
zh所以这确实很像是一个
10:18.592–10:20.372
zh针对智能体编程深度微调的模型
10:20.372–10:22.292
zh正如官方基准测试所示
10:22.292–10:23.292
zh那么结论是什么
10:23.292–10:25.532
zh这绝对是目前性价比最高的模型之一
10:25.532–10:26.772
zh可用于智能体编程
10:26.772–10:27.792
zh在我的测试中
10:27.792–10:29.692
zh它的表现已经达到了Gemini 1.5 Pro的水平
10:29.692–10:32.012
zh它可以直接接入Cursor等代码工具
10:32.012–10:33.392
zh这得益于其API知识
10:33.392–10:34.972
zh而且DeepSeek的价格
10:34.972–10:36.312
zh一直都非常便宜
10:36.312–10:37.112
zh如果你是学生
10:37.112–10:39.092
zh或者对于预算有限的开发者
10:39.092–10:40.412
zh这绝对是个极佳的选择
10:40.412–10:42.612
zh它显然还无法击败Claude 3.5
10:42.612–10:44.572
zh或是在综合表现上超越OPUS
10:44.572–10:46.672
zh而且他的视觉能力依然表现平平
10:46.672–10:48.252
zh但考虑到他的体量和价格
10:48.252–10:49.292
zh这已经足够惊艳了
10:49.292–10:50.032
zh而且别忘了
10:50.032–10:51.672
zh这还仅仅是Flash版本
10:51.672–10:53.412
zh官方的DeepSeek V4 Pro也即将发布
10:53.412–10:54.652
zh据官方介绍
10:54.652–10:56.492
zh如果将同样的智能体后训练应用
10:56.492–10:58.452
zh到1.6万亿参数的模型上
10:58.452–11:00.452
zh那对市面上昂贵的闭源模型来说
11:00.452–11:01.812
zh将是降维打击般的存在
11:01.812–11:03.932
zh我会在上线后第一时间进行测试
11:03.932–11:04.592
zh请继续关注
11:04.592–11:05.692
zh总的来说
11:05.692–11:06.432
zh这非常酷
0:00.000–0:07.460
(此句尚無繁中翻譯)
0:07.460–0:10.720
(此句尚無繁中翻譯)
0:10.720–0:14.980
(此句尚無繁中翻譯)
0:14.980–0:19.240
(此句尚無繁中翻譯)
0:19.240–0:21.600
(此句尚無繁中翻譯)
0:21.600–0:25.000
(此句尚無繁中翻譯)
0:25.000–0:27.180
(此句尚無繁中翻譯)
0:27.180–0:30.600
(此句尚無繁中翻譯)
0:30.600–0:31.780
(此句尚無繁中翻譯)
0:31.780–0:33.980
(此句尚無繁中翻譯)
0:33.980–0:36.720
(此句尚無繁中翻譯)
0:36.720–0:38.420
(此句尚無繁中翻譯)
0:38.420–0:40.420
(此句尚無繁中翻譯)
0:40.420–0:42.320
(此句尚無繁中翻譯)
0:42.320–0:43.040
(此句尚無繁中翻譯)
0:43.040–0:45.200
(此句尚無繁中翻譯)
0:45.200–0:46.400
(此句尚無繁中翻譯)
0:46.400–0:48.360
(此句尚無繁中翻譯)
0:48.360–0:48.860
(此句尚無繁中翻譯)
0:48.860–0:51.040
(此句尚無繁中翻譯)
0:51.040–0:53.340
(此句尚無繁中翻譯)
0:53.340–0:55.120
(此句尚無繁中翻譯)
0:55.120–0:58.120
(此句尚無繁中翻譯)
0:58.120–0:59.560
(此句尚無繁中翻譯)
0:59.560–1:00.940
(此句尚無繁中翻譯)
1:00.940–1:03.120
(此句尚無繁中翻譯)
1:03.120–1:05.400
(此句尚無繁中翻譯)
1:05.400–1:07.720
(此句尚無繁中翻譯)
1:07.720–1:09.660
(此句尚無繁中翻譯)
1:09.660–1:12.000
(此句尚無繁中翻譯)
1:12.000–1:13.780
(此句尚無繁中翻譯)
1:13.780–1:15.180
(此句尚無繁中翻譯)
1:15.180–1:15.900
(此句尚無繁中翻譯)
1:15.900–1:18.200
(此句尚無繁中翻譯)
1:18.200–1:19.940
(此句尚無繁中翻譯)
1:19.940–1:21.040
(此句尚無繁中翻譯)
1:21.040–1:22.500
(此句尚無繁中翻譯)
1:22.500–1:24.340
(此句尚無繁中翻譯)
1:24.340–1:26.540
(此句尚無繁中翻譯)
1:26.540–1:29.060
(此句尚無繁中翻譯)
1:29.060–1:30.700
(此句尚無繁中翻譯)
1:30.700–1:31.300
(此句尚無繁中翻譯)
1:31.300–1:33.480
(此句尚無繁中翻譯)
1:33.480–1:34.820
(此句尚無繁中翻譯)
1:34.820–1:36.880
(此句尚無繁中翻譯)
1:36.880–1:39.640
(此句尚無繁中翻譯)
1:39.640–1:41.200
(此句尚無繁中翻譯)
1:41.200–1:42.240
(此句尚無繁中翻譯)
1:42.240–1:45.040
(此句尚無繁中翻譯)
1:45.040–1:46.480
(此句尚無繁中翻譯)
1:46.480–1:48.240
(此句尚無繁中翻譯)
1:48.240–1:50.120
(此句尚無繁中翻譯)
1:50.120–1:52.000
(此句尚無繁中翻譯)
1:52.000–1:54.240
(此句尚無繁中翻譯)
1:54.240–1:55.960
(此句尚無繁中翻譯)
1:55.960–1:58.240
(此句尚無繁中翻譯)
1:58.240–2:00.780
(此句尚無繁中翻譯)
2:00.780–2:01.720
(此句尚無繁中翻譯)
2:01.720–2:03.260
(此句尚無繁中翻譯)
2:03.260–2:05.020
(此句尚無繁中翻譯)
2:05.020–2:08.940
(此句尚無繁中翻譯)
2:08.940–2:11.620
(此句尚無繁中翻譯)
2:11.620–2:13.820
(此句尚無繁中翻譯)
2:13.820–2:15.880
(此句尚無繁中翻譯)
2:15.880–2:18.280
(此句尚無繁中翻譯)
2:18.280–2:20.320
(此句尚無繁中翻譯)
2:20.320–2:22.980
(此句尚無繁中翻譯)
2:22.980–2:25.740
(此句尚無繁中翻譯)
2:25.740–2:26.940
(此句尚無繁中翻譯)
2:26.940–2:28.840
(此句尚無繁中翻譯)
2:28.840–2:30.100
(此句尚無繁中翻譯)
2:30.100–2:32.440
(此句尚無繁中翻譯)
2:32.440–2:33.820
(此句尚無繁中翻譯)
2:33.820–2:35.180
(此句尚無繁中翻譯)
2:35.180–2:37.440
(此句尚無繁中翻譯)
2:37.440–2:39.960
(此句尚無繁中翻譯)
2:39.960–2:42.980
(此句尚無繁中翻譯)
2:42.980–2:46.260
(此句尚無繁中翻譯)
2:46.260–2:49.160
(此句尚無繁中翻譯)
2:49.160–2:51.300
(此句尚無繁中翻譯)
2:51.300–2:52.800
(此句尚無繁中翻譯)
2:52.980–2:55.580
(此句尚無繁中翻譯)
2:55.580–2:58.040
(此句尚無繁中翻譯)
2:58.040–2:59.900
(此句尚無繁中翻譯)
2:59.900–3:03.900
(此句尚無繁中翻譯)
3:03.900–3:05.920
(此句尚無繁中翻譯)
3:05.920–3:08.140
(此句尚無繁中翻譯)
3:08.140–3:10.680
(此句尚無繁中翻譯)
3:10.680–3:13.280
(此句尚無繁中翻譯)
3:13.280–3:15.500
(此句尚無繁中翻譯)
3:15.500–3:18.260
(此句尚無繁中翻譯)
3:18.260–3:20.380
(此句尚無繁中翻譯)
3:20.380–3:22.740
(此句尚無繁中翻譯)
3:22.740–3:23.800
(此句尚無繁中翻譯)
3:23.800–3:25.840
(此句尚無繁中翻譯)
3:25.840–3:28.200
(此句尚無繁中翻譯)
3:28.200–3:29.820
(此句尚無繁中翻譯)
3:29.820–3:31.820
(此句尚無繁中翻譯)
3:31.820–3:33.160
(此句尚無繁中翻譯)
3:33.160–3:34.100
(此句尚無繁中翻譯)
3:34.100–3:35.120
(此句尚無繁中翻譯)
3:35.120–3:36.820
(此句尚無繁中翻譯)
3:36.820–3:38.380
(此句尚無繁中翻譯)
3:38.380–3:41.360
(此句尚無繁中翻譯)
3:41.360–3:42.760
(此句尚無繁中翻譯)
3:42.760–3:44.120
(此句尚無繁中翻譯)
3:44.120–3:45.840
(此句尚無繁中翻譯)
3:45.840–3:47.500
(此句尚無繁中翻譯)
3:47.500–3:49.000
(此句尚無繁中翻譯)
3:49.000–3:50.580
(此句尚無繁中翻譯)
3:50.580–3:52.660
(此句尚無繁中翻譯)
3:52.660–3:54.640
(此句尚無繁中翻譯)
3:54.640–3:56.380
(此句尚無繁中翻譯)
3:56.380–3:58.360
(此句尚無繁中翻譯)
3:58.360–3:59.440
(此句尚無繁中翻譯)
3:59.440–4:00.860
(此句尚無繁中翻譯)
4:00.860–4:02.400
(此句尚無繁中翻譯)
4:02.400–4:05.200
(此句尚無繁中翻譯)
4:05.200–4:08.780
(此句尚無繁中翻譯)
4:08.780–4:10.720
(此句尚無繁中翻譯)
4:10.720–4:12.500
(此句尚無繁中翻譯)
4:12.500–4:15.280
(此句尚無繁中翻譯)
4:15.280–4:18.060
(此句尚無繁中翻譯)
4:18.060–4:19.880
(此句尚無繁中翻譯)
4:19.880–4:22.300
(此句尚無繁中翻譯)
4:22.300–4:24.520
(此句尚無繁中翻譯)
4:24.520–4:26.020
(此句尚無繁中翻譯)
4:26.020–4:27.500
(此句尚無繁中翻譯)
4:27.500–4:29.980
(此句尚無繁中翻譯)
4:29.980–4:32.760
(此句尚無繁中翻譯)
4:32.760–4:34.720
(此句尚無繁中翻譯)
4:34.720–4:36.500
(此句尚無繁中翻譯)
4:36.500–4:38.020
(此句尚無繁中翻譯)
4:38.020–4:40.000
(此句尚無繁中翻譯)
4:40.000–4:42.020
(此句尚無繁中翻譯)
4:42.020–4:44.620
(此句尚無繁中翻譯)
4:44.620–4:46.500
(此句尚無繁中翻譯)
4:46.500–4:47.360
(此句尚無繁中翻譯)
4:47.360–4:49.860
(此句尚無繁中翻譯)
4:49.860–4:51.800
(此句尚無繁中翻譯)
4:51.800–4:53.620
(此句尚無繁中翻譯)
4:53.620–4:55.540
(此句尚無繁中翻譯)
4:55.540–4:58.640
(此句尚無繁中翻譯)
4:58.640–5:01.240
(此句尚無繁中翻譯)
5:01.240–5:04.940
(此句尚無繁中翻譯)
5:04.940–5:08.660
(此句尚無繁中翻譯)
5:08.660–5:11.280
(此句尚無繁中翻譯)
5:11.280–5:12.480
(此句尚無繁中翻譯)
5:12.480–5:14.800
(此句尚無繁中翻譯)
5:14.800–5:16.140
(此句尚無繁中翻譯)
5:16.140–5:17.880
(此句尚無繁中翻譯)
5:17.880–5:19.300
(此句尚無繁中翻譯)
5:19.300–5:21.800
(此句尚無繁中翻譯)
5:21.800–5:23.240
(此句尚無繁中翻譯)
5:23.240–5:25.080
(此句尚無繁中翻譯)
5:25.080–5:26.420
(此句尚無繁中翻譯)
5:26.420–5:27.340
(此句尚無繁中翻譯)
5:27.340–5:29.520
(此句尚無繁中翻譯)
5:29.520–5:31.140
(此句尚無繁中翻譯)
5:31.140–5:32.180
(此句尚無繁中翻譯)
5:32.180–5:33.860
(此句尚無繁中翻譯)
5:33.860–5:35.640
(此句尚無繁中翻譯)
5:35.640–5:37.120
(此句尚無繁中翻譯)
5:37.120–5:38.580
(此句尚無繁中翻譯)
5:38.580–5:39.860
(此句尚無繁中翻譯)
5:39.860–5:42.040
(此句尚無繁中翻譯)
5:42.040–5:43.400
(此句尚無繁中翻譯)
5:43.400–5:44.780
(此句尚無繁中翻譯)
5:44.780–5:46.480
(此句尚無繁中翻譯)
5:46.480–5:48.500
(此句尚無繁中翻譯)
5:48.500–5:49.780
(此句尚無繁中翻譯)
5:49.780–5:51.260
(此句尚無繁中翻譯)
5:51.260–5:52.780
(此句尚無繁中翻譯)
5:52.780–5:55.220
(此句尚無繁中翻譯)
5:55.220–5:56.820
(此句尚無繁中翻譯)
5:56.820–5:58.400
(此句尚無繁中翻譯)
5:58.400–6:00.160
(此句尚無繁中翻譯)
6:00.160–6:01.160
(此句尚無繁中翻譯)
6:01.160–6:02.340
(此句尚無繁中翻譯)
6:02.340–6:03.800
(此句尚無繁中翻譯)
6:03.800–6:05.440
(此句尚無繁中翻譯)
6:05.440–6:06.640
(此句尚無繁中翻譯)
6:06.640–6:08.460
(此句尚無繁中翻譯)
6:08.460–6:10.740
(此句尚無繁中翻譯)
6:10.740–6:13.060
(此句尚無繁中翻譯)
6:13.060–6:14.220
(此句尚無繁中翻譯)
6:14.220–6:15.420
(此句尚無繁中翻譯)
6:15.420–6:16.500
(此句尚無繁中翻譯)
6:16.500–6:18.620
(此句尚無繁中翻譯)
6:18.620–6:20.420
(此句尚無繁中翻譯)
6:20.420–6:21.860
(此句尚無繁中翻譯)
6:21.860–6:24.620
(此句尚無繁中翻譯)
6:24.620–6:26.020
(此句尚無繁中翻譯)
6:26.020–6:28.000
(此句尚無繁中翻譯)
6:28.000–6:31.600
(此句尚無繁中翻譯)
6:31.600–6:35.240
(此句尚無繁中翻譯)
6:35.240–6:37.340
(此句尚無繁中翻譯)
6:37.340–6:39.180
(此句尚無繁中翻譯)
6:39.180–6:41.940
(此句尚無繁中翻譯)
6:41.940–6:44.700
(此句尚無繁中翻譯)
6:44.700–6:46.120
(此句尚無繁中翻譯)
6:46.120–6:47.740
(此句尚無繁中翻譯)
6:47.740–6:49.140
(此句尚無繁中翻譯)
6:49.140–6:50.960
(此句尚無繁中翻譯)
6:50.960–6:52.660
(此句尚無繁中翻譯)
6:52.660–6:54.040
(此句尚無繁中翻譯)
6:54.040–6:56.200
(此句尚無繁中翻譯)
6:56.200–6:57.840
(此句尚無繁中翻譯)
6:57.840–7:00.740
(此句尚無繁中翻譯)
7:00.740–7:03.560
(此句尚無繁中翻譯)
7:03.560–7:05.100
(此句尚無繁中翻譯)
7:05.100–7:06.960
(此句尚無繁中翻譯)
7:06.960–7:09.240
(此句尚無繁中翻譯)
7:09.240–7:11.320
(此句尚無繁中翻譯)
7:11.320–7:13.300
(此句尚無繁中翻譯)
7:13.300–7:15.740
(此句尚無繁中翻譯)
7:15.740–7:16.620
(此句尚無繁中翻譯)
7:16.620–7:17.700
(此句尚無繁中翻譯)
7:17.700–7:19.860
(此句尚無繁中翻譯)
7:19.860–7:21.420
(此句尚無繁中翻譯)
7:21.420–7:22.640
(此句尚無繁中翻譯)
7:22.640–7:24.300
(此句尚無繁中翻譯)
7:24.300–7:26.160
(此句尚無繁中翻譯)
7:26.160–7:26.800
(此句尚無繁中翻譯)
7:26.800–7:28.060
(此句尚無繁中翻譯)
7:28.060–7:29.400
(此句尚無繁中翻譯)
7:29.400–7:30.060
(此句尚無繁中翻譯)
7:30.060–7:31.600
(此句尚無繁中翻譯)
7:31.600–7:33.760
(此句尚無繁中翻譯)
7:33.760–7:37.320
(此句尚無繁中翻譯)
7:37.320–7:40.600
(此句尚無繁中翻譯)
7:40.600–7:43.580
(此句尚無繁中翻譯)
7:43.580–7:46.880
(此句尚無繁中翻譯)
7:46.880–7:51.240
(此句尚無繁中翻譯)
7:51.240–7:53.500
(此句尚無繁中翻譯)
7:53.500–7:55.180
(此句尚無繁中翻譯)
7:55.180–7:56.500
(此句尚無繁中翻譯)
7:56.500–7:58.560
(此句尚無繁中翻譯)
7:58.560–8:01.040
(此句尚無繁中翻譯)
8:01.040–8:03.260
(此句尚無繁中翻譯)
8:03.672–8:05.532
(此句尚無繁中翻譯)
8:05.532–8:08.052
(此句尚無繁中翻譯)
8:08.052–8:11.372
(此句尚無繁中翻譯)
8:11.372–8:13.392
(此句尚無繁中翻譯)
8:13.392–8:14.472
(此句尚無繁中翻譯)
8:14.472–8:15.432
(此句尚無繁中翻譯)
8:15.432–8:17.192
(此句尚無繁中翻譯)
8:17.192–8:19.372
(此句尚無繁中翻譯)
8:19.372–8:21.032
(此句尚無繁中翻譯)
8:21.032–8:22.112
(此句尚無繁中翻譯)
8:22.112–8:23.992
(此句尚無繁中翻譯)
8:23.992–8:25.392
(此句尚無繁中翻譯)
8:25.392–8:26.312
(此句尚無繁中翻譯)
8:26.312–8:27.832
(此句尚無繁中翻譯)
8:27.832–8:28.492
(此句尚無繁中翻譯)
8:28.492–8:29.492
(此句尚無繁中翻譯)
8:29.492–8:30.112
(此句尚無繁中翻譯)
8:30.112–8:31.632
(此句尚無繁中翻譯)
8:31.632–8:33.172
(此句尚無繁中翻譯)
8:33.172–8:34.572
(此句尚無繁中翻譯)
8:34.572–8:36.712
(此句尚無繁中翻譯)
8:36.712–8:37.452
(此句尚無繁中翻譯)
8:37.452–8:38.612
(此句尚無繁中翻譯)
8:38.612–8:39.672
(此句尚無繁中翻譯)
8:39.672–8:41.572
(此句尚無繁中翻譯)
8:41.572–8:43.212
(此句尚無繁中翻譯)
8:43.212–8:44.772
(此句尚無繁中翻譯)
8:47.192–8:48.272
(此句尚無繁中翻譯)
8:48.272–8:49.552
(此句尚無繁中翻譯)
8:49.552–8:51.352
(此句尚無繁中翻譯)
8:51.352–8:52.172
(此句尚無繁中翻譯)
8:52.172–8:54.152
(此句尚無繁中翻譯)
8:54.152–8:56.112
(此句尚無繁中翻譯)
8:56.112–8:57.092
(此句尚無繁中翻譯)
8:57.092–8:59.272
(此句尚無繁中翻譯)
8:59.272–9:00.332
(此句尚無繁中翻譯)
9:00.332–9:02.092
(此句尚無繁中翻譯)
9:02.092–9:03.892
(此句尚無繁中翻譯)
9:03.892–9:05.932
(此句尚無繁中翻譯)
9:05.932–9:07.912
(此句尚無繁中翻譯)
9:07.912–9:10.052
(此句尚無繁中翻譯)
9:10.052–9:10.712
(此句尚無繁中翻譯)
9:10.712–9:15.272
(此句尚無繁中翻譯)
9:15.272–9:18.852
(此句尚無繁中翻譯)
9:18.852–9:19.752
(此句尚無繁中翻譯)
9:19.752–9:21.172
(此句尚無繁中翻譯)
9:21.172–9:23.352
(此句尚無繁中翻譯)
9:23.352–9:25.192
(此句尚無繁中翻譯)
9:25.192–9:25.832
(此句尚無繁中翻譯)
9:25.832–9:29.152
(此句尚無繁中翻譯)
9:29.152–9:32.032
(此句尚無繁中翻譯)
9:32.032–9:33.572
(此句尚無繁中翻譯)
9:33.572–9:35.092
(此句尚無繁中翻譯)
9:35.092–9:37.732
(此句尚無繁中翻譯)
9:37.732–9:40.532
(此句尚無繁中翻譯)
9:40.532–9:44.092
(此句尚無繁中翻譯)
9:44.092–9:45.892
(此句尚無繁中翻譯)
9:45.892–9:48.472
(此句尚無繁中翻譯)
9:48.472–9:49.872
(此句尚無繁中翻譯)
9:49.872–9:52.572
(此句尚無繁中翻譯)
9:52.572–9:54.892
(此句尚無繁中翻譯)
9:54.892–9:55.472
(此句尚無繁中翻譯)
9:55.472–9:59.052
(此句尚無繁中翻譯)
9:59.052–10:01.932
(此句尚無繁中翻譯)
10:01.932–10:03.712
(此句尚無繁中翻譯)
10:03.712–10:06.892
(此句尚無繁中翻譯)
10:06.892–10:09.292
(此句尚無繁中翻譯)
10:09.292–10:11.532
(此句尚無繁中翻譯)
10:11.532–10:14.112
(此句尚無繁中翻譯)
10:14.112–10:15.252
(此句尚無繁中翻譯)
10:15.252–10:16.892
(此句尚無繁中翻譯)
10:16.892–10:18.592
(此句尚無繁中翻譯)
10:18.592–10:20.372
(此句尚無繁中翻譯)
10:20.372–10:22.292
(此句尚無繁中翻譯)
10:22.292–10:23.292
(此句尚無繁中翻譯)
10:23.292–10:25.532
(此句尚無繁中翻譯)
10:25.532–10:26.772
(此句尚無繁中翻譯)
10:26.772–10:27.792
(此句尚無繁中翻譯)
10:27.792–10:29.692
(此句尚無繁中翻譯)
10:29.692–10:32.012
(此句尚無繁中翻譯)
10:32.012–10:33.392
(此句尚無繁中翻譯)
10:33.392–10:34.972
(此句尚無繁中翻譯)
10:34.972–10:36.312
(此句尚無繁中翻譯)
10:36.312–10:37.112
(此句尚無繁中翻譯)
10:37.112–10:39.092
(此句尚無繁中翻譯)
10:39.092–10:40.412
(此句尚無繁中翻譯)
10:40.412–10:42.612
(此句尚無繁中翻譯)
10:42.612–10:44.572
(此句尚無繁中翻譯)
10:44.572–10:46.672
(此句尚無繁中翻譯)
10:46.672–10:48.252
(此句尚無繁中翻譯)
10:48.252–10:49.292
(此句尚無繁中翻譯)
10:49.292–10:50.032
(此句尚無繁中翻譯)
10:50.032–10:51.672
(此句尚無繁中翻譯)
10:51.672–10:53.412
(此句尚無繁中翻譯)
10:53.412–10:54.652
(此句尚無繁中翻譯)
10:54.652–10:56.492
(此句尚無繁中翻譯)
10:56.492–10:58.452
(此句尚無繁中翻譯)
10:58.452–11:00.452
(此句尚無繁中翻譯)
11:00.452–11:01.812
(此句尚無繁中翻譯)
11:01.812–11:03.932
(此句尚無繁中翻譯)
11:03.932–11:04.592
(此句尚無繁中翻譯)
11:04.592–11:05.692
(此句尚無繁中翻譯)
11:05.692–11:06.432
(此句尚無繁中翻譯)
0:00.000–0:07.460
zh大家好 欢迎收看新一期视频
(此句尚無繁中翻譯)
0:07.460–0:10.720
zhDeepseek刚刚发布了一个很有意思的更新
(此句尚無繁中翻譯)
0:10.720–0:14.980
zhDeepseek V4 Flash官方API现已开启公测
(此句尚無繁中翻譯)
0:14.980–0:19.240
zh新版本命名为Deepseek V4 Flash 0731
(此句尚無繁中翻譯)
0:19.240–0:21.600
zh这可不只是一个小补丁
(此句尚無繁中翻譯)
0:21.600–0:25.000
zhDeepseek表示他们大幅提升了智能体能力
(此句尚無繁中翻譯)
0:25.000–0:27.180
zh在该模型上甚至
(此句尚無繁中翻譯)
0:27.180–0:30.600
zh使其测试分数如今已远超V4 Pro预览版
(此句尚無繁中翻譯)
0:30.600–0:31.780
zh也就是说
(此句尚無繁中翻譯)
0:31.780–0:33.980
zh这个小模型现在击败了预览版
(此句尚無繁中翻譯)
0:33.980–0:36.720
zh极大模型在智能体任务上的版本
(此句尚無繁中翻譯)
0:36.720–0:38.420
zh这确实挺疯狂的
(此句尚無繁中翻譯)
0:38.420–0:40.420
zh我也用我自己的Kinbench测试了它
(此句尚無繁中翻譯)
0:40.420–0:42.320
zh而在我的基准测试中
(此句尚無繁中翻譯)
0:42.320–0:43.040
zh它做到了
(此句尚無繁中翻譯)
0:43.040–0:45.200
zh其他任何模型都未曾做到的事
(此句尚無繁中翻譯)
0:45.200–0:46.400
zh包括Claude 3.5
(此句尚無繁中翻譯)
0:46.400–0:48.360
zh以及Opus稍后我们会细聊
(此句尚無繁中翻譯)
0:48.360–0:48.860
zh但首先
(此句尚無繁中翻譯)
0:48.860–0:51.040
zh我们先聊聊这次更新到底是什么
(此句尚無繁中翻譯)
0:51.040–0:53.340
zh前阵子我介绍过DeepSeek V4 Pro
(此句尚無繁中翻譯)
0:53.340–0:55.120
zh和V4 Flash的预览版
(此句尚無繁中翻譯)
0:55.120–0:58.120
zh包括如何通过NVIDIA Link免费使用它们
(此句尚無繁中翻譯)
0:58.120–0:59.560
zh视频链接已放在下方
(此句尚無繁中翻譯)
0:59.560–1:00.940
zh我们先快速回顾一下Flash
(此句尚無繁中翻譯)
1:00.940–1:03.120
zh它是V4系列中较小的模型
(此句尚無繁中翻譯)
1:03.120–1:05.400
zh该混合专家模型拥有2000
(此句尚無繁中翻譯)
1:05.400–1:07.720
zh0840亿的总参数量
(此句尚無繁中翻譯)
1:07.720–1:09.660
zh约130亿激活参数
(此句尚無繁中翻譯)
1:09.660–1:12.000
zh支持100万Token上下文窗口
(此句尚無繁中翻譯)
1:12.000–1:13.780
zh它定位为主打快速
(此句尚無繁中翻譯)
1:13.780–1:15.180
zh与低成本版本
(此句尚無繁中翻譯)
1:15.180–1:15.900
zh而V4 Pro
(此句尚無繁中翻譯)
1:15.900–1:18.200
zh是1.6万亿参数旗舰大模型
(此句尚無繁中翻譯)
1:18.200–1:19.940
zh关于这次0731更新
(此句尚無繁中翻譯)
1:19.940–1:21.040
zh有一个关键细节
(此句尚無繁中翻譯)
1:21.040–1:22.500
zhDeepSeek明确表示
(此句尚無繁中翻譯)
1:22.500–1:24.340
enV4Flash 0731
(此句尚無繁中翻譯)
1:24.340–1:26.540
zh保持了完全相同的模型架构
(此句尚無繁中翻譯)
1:26.540–1:29.060
zh和参数规模与预览版完全一致
(此句尚無繁中翻譯)
1:29.060–1:30.700
zh所以它并没有变大
(此句尚無繁中翻譯)
1:30.700–1:31.300
zh依然是
(此句尚無繁中翻譯)
1:31.300–1:33.480
zh那款2840亿参数的Flash
(此句尚無繁中翻譯)
1:33.480–1:34.820
zh但在此基础上
(此句尚無繁中翻譯)
1:34.820–1:36.880
zh它似乎进行了高强度的智能体后训练
(此句尚無繁中翻譯)
1:36.880–1:39.640
zh所有的性能提升都源于训练的优化
(此句尚無繁中翻譯)
1:39.640–1:41.200
zh而不是增加参数量
(此句尚無繁中翻譯)
1:41.200–1:42.240
zh他们还明确指出
(此句尚無繁中翻譯)
1:42.240–1:45.040
zh这次升级仅是用于DeepSeek V4 Flash API
(此句尚無繁中翻譯)
1:45.040–1:46.480
enV4 Pro API
(此句尚無繁中翻譯)
1:46.480–1:48.240
zh以及App端模型
(此句尚無繁中翻譯)
1:48.240–1:50.120
zh和网页端目前都保持不变
(此句尚無繁中翻譯)
1:50.120–1:52.000
zh公告最后提到
(此句尚無繁中翻譯)
1:52.000–1:54.240
zhDeepSeek V4 Pro的正式版本
(此句尚無繁中翻譯)
1:54.240–1:55.960
zh很快就会发布
(此句尚無繁中翻譯)
1:55.960–1:58.240
zh所以这次Flash更新基本只是热身
(此句尚無繁中翻譯)
1:58.240–2:00.780
zh真正的重头戏还在后头
(此句尚無繁中翻譯)
2:00.780–2:01.720
zh另外
(此句尚無繁中翻譯)
2:01.720–2:03.260
zh这次发布中还有一点
(此句尚無繁中翻譯)
2:03.260–2:05.020
zh我觉得非常明智
(此句尚無繁中翻譯)
2:05.020–2:08.940
zh官方V4 Flash现在原生支持Response API格式
(此句尚無繁中翻譯)
2:08.940–2:11.620
zhDeepSeek还表示他已完全适配Codex
(此句尚無繁中翻譯)
2:11.620–2:13.820
zh所以他们不仅是发布了一个模型
(此句尚無繁中翻譯)
2:13.820–2:15.880
zh而不是被动等待工具链的适配
(此句尚無繁中翻譯)
2:15.880–2:18.280
zh他们直接面向Codex适配框架进行了开发
(此句尚無繁中翻譯)
2:18.280–2:20.320
zh这意味着你可以将其接入
(此句尚無繁中翻譯)
2:20.320–2:22.980
zh到Codex风格的工作流中且毫无阻碍
(此句尚無繁中翻譯)
2:22.980–2:25.740
zhGLM以及国内的其他一些实验室也在做
(此句尚無繁中翻譯)
2:25.740–2:26.940
zh类似的框架适配
(此句尚無繁中翻譯)
2:26.940–2:28.840
zh事实证明效果立竿见影
(此句尚無繁中翻譯)
2:28.840–2:30.100
zh这确实是个明智之举
(此句尚無繁中翻譯)
2:30.100–2:32.440
zh接下来看看官方的基准测试数据
(此句尚無繁中翻譯)
2:32.440–2:33.820
zh这次性能提升太惊人了
(此句尚無繁中翻譯)
2:33.820–2:35.180
zh在Terminal Bench 2.1测试中
(此句尚無繁中翻譯)
2:35.180–2:37.440
zh新版Flash跑分高达82.7
(此句尚無繁中翻譯)
2:37.440–2:39.960
zh而此前的预览版仅为61.8
(此句尚無繁中翻譯)
2:39.960–2:42.980
zh甚至连V4 Pro预览版也只有72.1分
(此句尚無繁中翻譯)
2:42.980–2:46.260
zh这也让它超越了81分的GLM-4-0520
(此句尚無繁中翻譯)
2:46.260–2:49.160
zh而且距离85分的OPUS差距并不大
(此句尚無繁中翻譯)
2:49.160–2:51.300
zh要知道后者的价格可要贵得多
(此句尚無繁中翻譯)
2:51.300–2:52.800
zh而最夸张的是SWBEC
(此句尚無繁中翻譯)
2:52.980–2:55.580
zh预览版在这个测试中仅获得了7.3分
(此句尚無繁中翻譯)
2:55.580–2:58.040
zh而新版本直接飙升到54.4分
(此句尚無繁中翻譯)
2:58.040–2:59.900
zh实现了从基本无法使用
(此句尚無繁中翻譯)
2:59.900–3:03.900
zh到足以与46.2分的GLM4-0520正面竞争的水平
(此句尚無繁中翻譯)
3:03.900–3:05.920
zh甚至是58分的OPUS
(此句尚無繁中翻譯)
3:05.920–3:08.140
zhCybergen也从38.7分
(此句尚無繁中翻譯)
3:08.140–3:10.680
zh升至76.7分,CoderEval从
(此句尚無繁中翻譯)
3:10.680–3:13.280
zh从49.7分升至70.3分
(此句尚無繁中翻譯)
3:13.280–3:15.500
zh在其内部DSBench测试集上
(此句尚無繁中翻譯)
3:15.500–3:18.260
zh全栈任务得分从37升至68.7
(此句尚無繁中翻譯)
3:18.260–3:20.380
zh高难度编码智能体任务也
(此句尚無繁中翻譯)
3:20.380–3:22.740
zh从25.8升至59.6
(此句尚無繁中翻譯)
3:22.740–3:23.800
zh总的来说
(此句尚無繁中翻譯)
3:23.800–3:25.840
zh这较其自身的预览版有了巨大飞跃
(此句尚無繁中翻譯)
3:25.840–3:28.200
zh且在大多数智能体基准测试中
(此句尚無繁中翻譯)
3:28.200–3:29.820
zh它已逼近OPUS 4.8
(此句尚無繁中翻譯)
3:29.820–3:31.820
zh而它作为一款尺寸小得多
(此句尚無繁中翻譯)
3:31.820–3:33.160
zh且更便宜的模型
(此句尚無繁中翻譯)
3:33.160–3:34.100
zh不过需要说明的是
(此句尚無繁中翻譯)
3:34.100–3:35.120
zhDeepSeek指出
(此句尚無繁中翻譯)
3:35.120–3:36.820
zh在公开的编码智能体任务测试中
(此句尚無繁中翻譯)
3:36.820–3:38.380
zhV4 Flash使用了
(此句尚無繁中翻譯)
3:38.380–3:41.360
zh其即将推出的Deep-C Harness框架在极简模式下
(此句尚無繁中翻譯)
3:41.360–3:42.760
zh以最高档位运行
(此句尚無繁中翻譯)
3:42.760–3:44.120
zh且Top-p采样设为0.95
(此句尚無繁中翻譯)
3:44.120–3:45.840
zh温度参数设为一可见
(此句尚無繁中翻譯)
3:45.840–3:47.500
zh测试框架的选择至关重要
(此句尚無繁中翻譯)
3:47.500–3:49.000
zh测试结果可能不同
(此句尚無繁中翻譯)
3:49.000–3:50.580
zh数据仅供参考
(此句尚無繁中翻譯)
3:50.580–3:52.660
zh不过了解本频道的人都知道
(此句尚無繁中翻譯)
3:52.660–3:54.640
zh我们从不只看官方宣传数据
(此句尚無繁中翻譯)
3:54.640–3:56.380
zh所以我用自己的基准测试跑了一下
(此句尚無繁中翻譯)
3:56.380–3:58.360
zh话不多说我们直接切入正题
(此句尚無繁中翻譯)
3:58.360–3:59.440
zh和往常一样
(此句尚無繁中翻譯)
3:59.440–4:00.860
zh我用我的TingBench进行了测试
(此句尚無繁中翻譯)
4:00.860–4:02.400
zh其中涵盖了一些前端
(此句尚無繁中翻譯)
4:02.400–4:05.200
zh与动画一些Three.js任务以及SVG测试
(此句尚無繁中翻譯)
4:05.200–4:08.780
zh一道数学题以及一个长程智能体任务
(此句尚無繁中翻譯)
4:08.780–4:10.720
zh最后还有一个超难的3D任务
(此句尚無繁中翻譯)
4:10.720–4:12.500
zh每项测试满分10分
(此句尚無繁中翻譯)
4:12.500–4:15.280
zh最后我们会通过最终的图表来看看
(此句尚無繁中翻譯)
4:15.280–4:18.060
zh看看它的表现与其他模型相比如何
(此句尚無繁中翻譯)
4:18.060–4:19.880
zh第一题是电梯模拟
(此句尚無繁中翻譯)
4:19.880–4:22.300
zh模型需要构建一个模拟程序
(此句尚無繁中翻譯)
4:22.300–4:24.520
zh你可以在不同楼层生成乘客
(此句尚無繁中翻譯)
4:24.520–4:26.020
zh共有三部电梯
(此句尚無繁中翻譯)
4:26.020–4:27.500
zh其每部只能在一人
(此句尚無繁中翻譯)
4:27.500–4:29.980
zh没赶上的人需要搭乘下一班电梯
(此句尚無繁中翻譯)
4:29.980–4:32.760
zh还需要有提示框显示每个人的目标楼层
(此句尚無繁中翻譯)
4:32.760–4:34.720
zh当鼠标悬停在他们身上时
(此句尚無繁中翻譯)
4:34.720–4:36.500
zh我们发送提示词看看效果
(此句尚無繁中翻譯)
4:36.500–4:38.020
zh这个表现只能算一半
(此句尚無繁中翻譯)
4:38.020–4:40.000
zh得了五分基本框架是有了
(此句尚無繁中翻譯)
4:40.000–4:42.020
zh但关于乘客没赶上电梯
(此句尚無繁中翻譯)
4:42.020–4:44.620
zh并被下一班电梯接走的核心逻辑并没有完全跑通
(此句尚無繁中翻譯)
4:44.620–4:46.500
zh而且动画也不够流畅
(此句尚無繁中翻譯)
4:46.500–4:47.360
zh作为参考
(此句尚無繁中翻譯)
4:47.360–4:49.860
zh只有OPUS模型在这项测试中拿过10分
(此句尚無繁中翻譯)
4:49.860–4:51.800
zh而像CLAUDE 3.5这样的模型
(此句尚無繁中翻譯)
4:51.800–4:53.620
zh和Kimi k3也只有9分
(此句尚無繁中翻譯)
4:53.620–4:55.540
zh所以这开局只能算重归原矩
(此句尚無繁中翻譯)
4:55.540–4:58.640
zh第二个测试是Three.js隐形眼镜盒
(此句尚無繁中翻譯)
4:58.640–5:01.240
zh它需要生成一个3D模型
(此句尚無繁中翻譯)
5:01.240–5:04.940
zh是一个带有明显L和R标识盖子的隐形眼镜盒
(此句尚無繁中翻譯)
5:04.940–5:08.660
zh并且点击盖子能够将其打开这项测试
(此句尚無繁中翻譯)
5:08.660–5:11.280
zh几乎所有模型都会在这里翻车
(此句尚無繁中翻譯)
5:11.280–5:12.480
zh我们发送过去看看
(此句尚無繁中翻譯)
5:12.480–5:14.800
zh好的 这其实做得非常好
(此句尚無繁中翻譯)
5:14.800–5:16.140
zh它拿到了8分
(此句尚無繁中翻譯)
5:16.140–5:17.880
zh盒子看起来很像样
(此句尚無繁中翻譯)
5:17.880–5:19.300
zh像个合格的眼镜盒L
(此句尚無繁中翻譯)
5:19.300–5:21.800
zh而且L和R盖也清晰可见
(此句尚無繁中翻譯)
5:21.800–5:23.240
zh点击打开的交互也有效
(此句尚無繁中翻譯)
5:23.240–5:25.080
zh这让他与Qwen 2.5 Maths并列
(此句尚無繁中翻譯)
5:25.080–5:26.420
zh而Opus拿到了5分
(此句尚無繁中翻譯)
5:26.420–5:27.340
zh是历史第二高分
(此句尚無繁中翻譯)
5:27.340–5:29.520
zh在该测试中仅次于Claude 3.5
(此句尚無繁中翻譯)
5:29.520–5:31.140
zh他仍然是唯一在这个测试中
(此句尚無繁中翻譯)
5:31.140–5:32.180
zh拿到满分10分的模型
(此句尚無繁中翻譯)
5:32.180–5:33.860
zh所以对于一个小模型来说
(此句尚無繁中翻譯)
5:33.860–5:35.640
zh能有这样的表现已经非常惊艳了
(此句尚無繁中翻譯)
5:35.640–5:37.120
zh第三题是
(此句尚無繁中翻譯)
5:37.120–5:38.580
zhFreeJF折叠桌
(此句尚無繁中翻譯)
5:38.580–5:39.860
zh这里有一个滑块
(此句尚無繁中翻譯)
5:39.860–5:42.040
zh当你向右拖动它时
(此句尚無繁中翻譯)
5:42.040–5:43.400
zh桌子应该展开
(此句尚無繁中翻譯)
5:43.400–5:44.780
zh向左拖则折叠回去
(此句尚無繁中翻譯)
5:44.780–5:46.480
zh动画需要无缝衔接
(此句尚無繁中翻譯)
5:46.480–5:48.500
zh且呈现出真正的3D效果
(此句尚無繁中翻譯)
5:48.500–5:49.780
zh我们发送请求看看
(此句尚無繁中翻譯)
5:49.780–5:51.260
zh这个得到了7分
(此句尚無繁中翻譯)
5:51.260–5:52.780
zh桌子确实能折叠起来
(此句尚無繁中翻譯)
5:52.780–5:55.220
zh并能随滑块拖动而展开
(此句尚無繁中翻譯)
5:55.220–5:56.820
zh过渡基本自然
(此句尚無繁中翻譯)
5:56.820–5:58.400
zh只是还不够完全流畅
(此句尚無繁中翻譯)
5:58.400–6:00.160
zh表现最好的模型
(此句尚無繁中翻譯)
6:00.160–6:01.160
zh如Claude 3.5
(此句尚無繁中翻譯)
6:01.160–6:02.340
enKIMI GLM4
(此句尚無繁中翻譯)
6:02.340–6:03.800
zh以及Sonnet 3.5
(此句尚無繁中翻譯)
6:03.800–6:05.440
zh在这项测试中都拿到了9分
(此句尚無繁中翻譯)
6:05.440–6:06.640
zh但对比来看
(此句尚無繁中翻譯)
6:06.640–6:08.460
zhOpus在这项测试中仅得了5分
(此句尚無繁中翻譯)
6:08.460–6:10.740
zh所以这表现绝对算很不错了
(此句尚無繁中翻譯)
6:10.740–6:13.060
zh第四题是生成熊猫的SVG
(此句尚無繁中翻譯)
6:13.060–6:14.220
zh吃着汉堡
(此句尚無繁中翻譯)
6:14.220–6:15.420
zh我们发送过去看看
(此句尚無繁中翻譯)
6:15.420–6:16.500
zh
(此句尚無繁中翻譯)
6:16.500–6:18.620
zh这确实能看出是一只熊猫
(此句尚無繁中翻譯)
6:18.620–6:20.420
zh也能看出是汉堡
(此句尚無繁中翻譯)
6:20.420–6:21.860
zh但构图有点别扭
(此句尚無繁中翻譯)
6:21.860–6:24.620
zh而且看起来不太像在吃汉堡
(此句尚無繁中翻譯)
6:24.620–6:26.020
zh这题给五分
(此句尚無繁中翻譯)
6:26.020–6:28.000
zh在这项测试中
(此句尚無繁中翻譯)
6:28.000–6:31.600
zh像Kimi和Gemini 1.5这样表现最好的模型
(此句尚無繁中翻譯)
6:31.600–6:35.240
zh以及Qwen 2.5 Max得分也仅为8分
(此句尚無繁中翻譯)
6:35.240–6:37.340
zh所以并不算惊艳
(此句尚無繁中翻譯)
6:37.340–6:39.180
zh第五题是制作弓箭
(此句尚無繁中翻譯)
6:39.180–6:41.940
zh模拟游戏里面设计了四个靶子
(此句尚無繁中翻譯)
6:41.940–6:44.700
zh玩家需要以最短的时间击中所有靶子
(此句尚無繁中翻譯)
6:44.700–6:46.120
zh从而登上排行榜
(此句尚無繁中翻譯)
6:46.120–6:47.740
zh我们发送代码运行一下看看
(此句尚無繁中翻譯)
6:47.740–6:49.140
zh这道题得了7分
(此句尚無繁中翻譯)
6:49.140–6:50.960
zh核心射击机制可以正常运行
(此句尚無繁中翻譯)
6:50.960–6:52.660
zh靶子能判定击中
(此句尚無繁中翻譯)
6:52.660–6:54.040
zh排行榜功能也正常
(此句尚無繁中翻譯)
6:54.040–6:56.200
zh但整体手感和细节打磨
(此句尚無繁中翻譯)
6:56.200–6:57.840
zh还达不到顶尖模型的水平
(此句尚無繁中翻譯)
6:57.840–7:00.740
zh比如Groq 1.5和Qwen 2.5 Math
(此句尚無繁中翻譯)
7:00.740–7:03.560
zh虽然Opus模型在这里都拿了满分
(此句尚無繁中翻譯)
7:03.560–7:05.100
zh但这依然是个可玩的游戏
(此句尚無繁中翻譯)
7:05.100–7:06.960
zh所以表现还算不错
(此句尚無繁中翻譯)
7:06.960–7:09.240
zh第六题是一道数学难题
(此句尚無繁中翻譯)
7:09.240–7:11.320
zh关于计算有序队的排列数
(此句尚無繁中翻譯)
7:11.320–7:13.300
zh答案应该是2460
(此句尚無繁中翻譯)
7:13.300–7:15.740
zh很多模型在这一题上完全翻车
(此句尚無繁中翻譯)
7:15.740–7:16.620
zh我们提交一下
(此句尚無繁中翻譯)
7:16.620–7:17.700
zh看看
(此句尚無繁中翻譯)
7:17.700–7:19.860
zh他完美答对了2460
(此句尚無繁中翻譯)
7:19.860–7:21.420
zh完全正确
(此句尚無繁中翻譯)
7:21.420–7:22.640
zh拿了满分10分
(此句尚無繁中翻譯)
7:22.640–7:24.300
zh这让他跻身同一梯队
(此句尚無繁中翻譯)
7:24.300–7:26.160
zh与Claude 3.5
(此句尚無繁中翻譯)
7:26.160–7:26.800
enGemini Chat
(此句尚無繁中翻譯)
7:26.800–7:28.060
enQwen Max
(此句尚無繁中翻譯)
7:28.060–7:29.400
zh以及Opus模型并列
(此句尚無繁中翻譯)
7:29.400–7:30.060
zh有趣的是
(此句尚無繁中翻譯)
7:30.060–7:31.600
zh在我测试时
(此句尚無繁中翻譯)
7:31.600–7:33.760
zhV4 Pro预览版也做对了这道题
(此句尚無繁中翻譯)
7:33.760–7:37.320
zh所以V4系列的推理能力显然非常过硬
(此句尚無繁中翻譯)
7:37.320–7:40.600
zh第七题是一个复杂的长程任务
(此句尚無繁中翻譯)
7:40.600–7:43.580
zh生成一个关于熊猫知识的数据集
(此句尚無繁中翻譯)
7:43.580–7:46.880
zh并用该数据集微调一个Gemma 2B模型
(此句尚無繁中翻譯)
7:46.880–7:51.240
zh接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识
(此句尚無繁中翻譯)
7:51.240–7:53.500
zh全程从零开始完全自主完成
(此句尚無繁中翻譯)
7:53.500–7:55.180
zh且完全在本地运行
(此句尚無繁中翻譯)
7:55.180–7:56.500
zh我们启动任务看看效果
(此句尚無繁中翻譯)
7:56.500–7:58.560
zh这次的表现绝对可以达满分
(此句尚無繁中翻譯)
7:58.560–8:01.040
zh它生成了数据集并完成了整个微调
(此句尚無繁中翻譯)
8:01.040–8:03.260
zh独自运行期间完全没有卡壳
(此句尚無繁中翻譯)
8:03.672–8:05.532
zh生成的Web UI正常运行
(此句尚無繁中翻譯)
8:05.532–8:08.052
zh每次刷新都显示新的熊猫冷知识
(此句尚無繁中翻譯)
8:08.052–8:11.372
zh这正是那种复杂的长程智能体任务
(此句尚無繁中翻譯)
8:11.372–8:13.392
zhDeepSeek 声称对其进行过针对性升级
(此句尚無繁中翻譯)
8:13.392–8:14.472
zh说实话
(此句尚無繁中翻譯)
8:14.472–8:15.432
zh效果显而易见
(此句尚無繁中翻譯)
8:15.432–8:17.192
zh之前的预览版远没这么可靠
(此句尚無繁中翻譯)
8:17.192–8:19.372
zh这波表现确实堪称完美
(此句尚無繁中翻譯)
8:19.372–8:21.032
zh第八题也是最后一题
(此句尚無繁中翻譯)
8:21.032–8:22.112
zh是制作一个3D万年历
(此句尚無繁中翻譯)
8:22.112–8:23.992
zh要求是一个功能完整的3D万年历
(此句尚無繁中翻譯)
8:23.992–8:25.392
zh能显示当前实际时间
(此句尚無繁中翻譯)
8:25.392–8:26.312
zh秒针 分针
(此句尚無繁中翻譯)
8:26.312–8:27.832
zh以及时针都要平滑转动
(此句尚無繁中翻譯)
8:27.832–8:28.492
zh还要有日期
(此句尚無繁中翻譯)
8:28.492–8:29.492
zh核心日期显示
(此句尚無繁中翻譯)
8:29.492–8:30.112
zh以及双时区
(此句尚無繁中翻譯)
8:30.112–8:31.632
zh这是整个测试集中最难的一题
(此句尚無繁中翻譯)
8:31.632–8:33.172
zh之前没有任何模型
(此句尚無繁中翻譯)
8:33.172–8:34.572
zh能在这道题上拿到好成绩
(此句尚無繁中翻譯)
8:34.572–8:36.712
zh历史最高分是GPT-4o创下的
(此句尚無繁中翻譯)
8:36.712–8:37.452
zh4分
(此句尚無繁中翻譯)
8:37.452–8:38.612
zh让我们直接运行测试
(此句尚無繁中翻譯)
8:38.612–8:39.672
zh但令人惊喜的是
(此句尚無繁中翻譯)
8:39.672–8:41.572
zhDeepSeek V4 Flash竟然拿到了6分
(此句尚無繁中翻譯)
8:41.572–8:43.212
zh创下这道题历史记录
(此句尚無繁中翻譯)
8:43.212–8:44.772
zh手表完整呈现出来
(此句尚無繁中翻譯)
8:47.192–8:48.272
zh指针转动平滑
(此句尚無繁中翻譯)
8:48.272–8:49.552
zh指针实时同步时间
(此句尚無繁中翻譯)
8:49.552–8:51.352
zh双时区设置也基本正常
(此句尚無繁中翻譯)
8:51.352–8:52.172
zh虽然还不完美
(此句尚無繁中翻譯)
8:52.172–8:54.152
zh所以没能拿到更高的分数
(此句尚無繁中翻譯)
8:54.152–8:56.112
zh但这个小模型刚刚击败了
(此句尚無繁中翻譯)
8:56.112–8:57.092
enCloud 3.5 Opus
(此句尚無繁中翻譯)
8:57.092–8:59.272
zh以及我测试集最难题目上的
(此句尚無繁中翻譯)
8:59.272–9:00.332
zh其他所有前沿模型
(此句尚無繁中翻譯)
9:00.332–9:02.092
zh这完全出乎我的意料
(此句尚無繁中翻譯)
9:02.092–9:03.892
zh来看一下最终的图表
(此句尚無繁中翻譯)
9:03.892–9:05.932
enDeep Seek V4 Flash 0731
(此句尚無繁中翻譯)
9:05.932–9:07.912
zh最终拿到了58分
(此句尚無繁中翻譯)
9:07.912–9:10.052
zh得分率为72.5%
(此句尚無繁中翻譯)
9:10.052–9:10.712
zh这让它排在
(此句尚無繁中翻譯)
9:10.712–9:15.272
zh略高于GPT-4o-513的71.25%
(此句尚無繁中翻譯)
9:15.272–9:18.852
zh稍低于Gemini 1.5 Pro的75%
(此句尚無繁中翻譯)
9:18.852–9:19.752
zh而在它之上
(此句尚無繁中翻譯)
9:19.752–9:21.172
zh有Kimi和
(此句尚無繁中翻譯)
9:21.172–9:23.352
zhOpenAI并列77.5%
(此句尚無繁中翻譯)
9:23.352–9:25.192
zhGPT-4o-2024-05-13达80%
(此句尚無繁中翻譯)
9:25.192–9:25.832
zh接着是Qwen
(此句尚無繁中翻譯)
9:25.832–9:29.152
zhQwen 2.5 Max拿下81.25%
(此句尚無繁中翻譯)
9:29.152–9:32.032
zh而Claude 3.5仍以82.5%稳居榜首
(此句尚無繁中翻譯)
9:32.032–9:33.572
zh而对比以下背景
(此句尚無繁中翻譯)
9:33.572–9:35.092
zh你就能明白这有多惊人
(此句尚無繁中翻譯)
9:35.092–9:37.732
zh我之前测试DeepSeek V4 Pro预览版时
(此句尚無繁中翻譯)
9:37.732–9:40.532
zh它在此测试中仅得了24.8%
(此句尚無繁中翻譯)
9:40.532–9:44.092
zh新的Flash模型得分达到了72.5%
(此句尚無繁中翻譯)
9:44.092–9:45.892
zh这意味着该系列的小模型现在
(此句尚無繁中翻譯)
9:45.892–9:48.472
zh比大模型预览版的表现提升了近三倍
(此句尚無繁中翻譯)
9:48.472–9:49.872
zh在我的测试中
(此句尚無繁中翻譯)
9:49.872–9:52.572
zh而且在架构和尺寸与预览版相同
(此句尚無繁中翻譯)
9:52.572–9:54.892
zh单靠后训练就能取得惊人提升
(此句尚無繁中翻譯)
9:54.892–9:55.472
zh不可思议
(此句尚無繁中翻譯)
9:55.472–9:59.052
zh这也印证了DeepSeek所宣称的Agent能力升级
(此句尚無繁中翻譯)
9:59.052–10:01.932
zh从得分规律中也可以清楚地看到
(此句尚無繁中翻譯)
10:01.932–10:03.712
zh所有逻辑推理
(此句尚無繁中翻譯)
10:03.712–10:06.892
zh或长程Agent任务基本上都拿到了满分
(此句尚無繁中翻譯)
10:06.892–10:09.292
zh比如数学和微调任务
(此句尚無繁中翻譯)
10:09.292–10:11.532
zh还有创纪录的代码生成常识
(此句尚無繁中翻譯)
10:11.532–10:14.112
zh但像熊猫SVG这种纯视觉打磨的任务
(此句尚無繁中翻譯)
10:14.112–10:15.252
zh还有电梯动画
(此句尚無繁中翻譯)
10:15.252–10:16.892
zh在这些方面它的表现依然平平
(此句尚無繁中翻譯)
10:16.892–10:18.592
zh所以这确实很像是一个
(此句尚無繁中翻譯)
10:18.592–10:20.372
zh针对智能体编程深度微调的模型
(此句尚無繁中翻譯)
10:20.372–10:22.292
zh正如官方基准测试所示
(此句尚無繁中翻譯)
10:22.292–10:23.292
zh那么结论是什么
(此句尚無繁中翻譯)
10:23.292–10:25.532
zh这绝对是目前性价比最高的模型之一
(此句尚無繁中翻譯)
10:25.532–10:26.772
zh可用于智能体编程
(此句尚無繁中翻譯)
10:26.772–10:27.792
zh在我的测试中
(此句尚無繁中翻譯)
10:27.792–10:29.692
zh它的表现已经达到了Gemini 1.5 Pro的水平
(此句尚無繁中翻譯)
10:29.692–10:32.012
zh它可以直接接入Cursor等代码工具
(此句尚無繁中翻譯)
10:32.012–10:33.392
zh这得益于其API知识
(此句尚無繁中翻譯)
10:33.392–10:34.972
zh而且DeepSeek的价格
(此句尚無繁中翻譯)
10:34.972–10:36.312
zh一直都非常便宜
(此句尚無繁中翻譯)
10:36.312–10:37.112
zh如果你是学生
(此句尚無繁中翻譯)
10:37.112–10:39.092
zh或者对于预算有限的开发者
(此句尚無繁中翻譯)
10:39.092–10:40.412
zh这绝对是个极佳的选择
(此句尚無繁中翻譯)
10:40.412–10:42.612
zh它显然还无法击败Claude 3.5
(此句尚無繁中翻譯)
10:42.612–10:44.572
zh或是在综合表现上超越OPUS
(此句尚無繁中翻譯)
10:44.572–10:46.672
zh而且他的视觉能力依然表现平平
(此句尚無繁中翻譯)
10:46.672–10:48.252
zh但考虑到他的体量和价格
(此句尚無繁中翻譯)
10:48.252–10:49.292
zh这已经足够惊艳了
(此句尚無繁中翻譯)
10:49.292–10:50.032
zh而且别忘了
(此句尚無繁中翻譯)
10:50.032–10:51.672
zh这还仅仅是Flash版本
(此句尚無繁中翻譯)
10:51.672–10:53.412
zh官方的DeepSeek V4 Pro也即将发布
(此句尚無繁中翻譯)
10:53.412–10:54.652
zh据官方介绍
(此句尚無繁中翻譯)
10:54.652–10:56.492
zh如果将同样的智能体后训练应用
(此句尚無繁中翻譯)
10:56.492–10:58.452
zh到1.6万亿参数的模型上
(此句尚無繁中翻譯)
10:58.452–11:00.452
zh那对市面上昂贵的闭源模型来说
(此句尚無繁中翻譯)
11:00.452–11:01.812
zh将是降维打击般的存在
(此句尚無繁中翻譯)
11:01.812–11:03.932
zh我会在上线后第一时间进行测试
(此句尚無繁中翻譯)
11:03.932–11:04.592
zh请继续关注
(此句尚無繁中翻譯)
11:04.592–11:05.692
zh总的来说
(此句尚無繁中翻譯)
11:05.692–11:06.432
zh这非常酷
(此句尚無繁中翻譯)

影片筆記:DeepSeek V4 Flash 深度实测!冲进前五,这波是真正的王者归来! p01 中文配音

一句話總結

DeepSeek 發布了 V4 Flash 0731 版本,透過「智能體後訓練」大幅提升 Agent 能力,在自建基準測試中展現出極高的性價比與強大的數學、長程任務推理能力,雖在純視覺打磨上表現一般,但已逼近頂尖模型水平,預示著即將發布的 V4 Pro 正式版將帶來更大衝擊。

核心重點

  1. 版本更新核心:DeepSeek V4 Flash 0731 版本並非增加參數量,而是透過高强度的「智能體後訓練」(Agent Post-training)來提升能力。
  2. 性能表現
  • 官方基準測試顯示,V4 Flash 0731 在 Terminal Bench 2.1 等指標上超越 V4 Pro 預覽版,並逼近 Opus 水平。
  • 講者自建測試(Kinbench/TingBench)顯示,該模型在數學推理、長程智能體任務及部分 3D 生成上表現卓越,創下歷史高分。
  • 在純視覺打磨(如 SVG 圖像、電梯動畫流暢度)上表現平平。
  1. 技術規格與生態
  • V4 Flash 為混合專家模型(MoE),定位快速、低成本。
  • 原生支持 Response API 格式,完全適配 Codex 框架,可直接接入 Cursor 等代碼工具。
  1. 適用對象與建議
  • 該模型性價比極高,適合預算有限的開發者或學生用於智能體編程。
  • 官方 DeepSeek V4 Pro 正式版即將發布,若將同樣的智能體後訓練應用於 1.6 萬億參數模型,將對閉源模型形成巨大衝擊。

詳細大綱

I. DeepSeek V4 Flash 0731 更新介紹

  • 發布內容:DeepSeek V4 Flash 官方 API 開啟公測,版本號為 0731。
  • 核心變化
  • 架構與參數量與預覽版完全一致(未變大)。
  • 主要提升來自「智能體後訓練」(Agent Post-training)。
  • 智能體能力測試分數遠超 V4 Pro 預覽版。
  • 適用範圍:僅限 DeepSeek V4 Flash API、V4 Pro API 及 App 端;網頁端模型未變。
  • 未來預告:DeepSeek V4 Pro 正式版本即將發布。

II. 技術細節與生態適配

  • 模型規格(V4 Flash 系列)
  • 混合專家模型(MoE)。
  • 總參數量:2000.0840 億(聽似有誤,疑點見下文)。
  • 激活參數量:約 130 億。
  • 上下文窗口:100 萬 Token。
  • 定位:快速、低成本。
  • 對比模型:V4 Pro 為 1.6 萬億參數的旗艦大模型。
  • 生態適配
  • 原生支持 Response API 格式。
  • 完全適配 Codex 框架,可直接接入 Codex 風格工作流。
  • GLM 及其他國內實驗室也在進行類似框架適配。

III. 官方基準測試數據

  • Terminal Bench 2.1
  • V4 Flash 0731:82.7 分。
  • V4 Flash 預覽版:61.8 分。
  • V4 Pro 預覽版:72.1 分。
  • GLM-4-0520:81 分。
  • Opus:85 分(價格更貴)。
  • SWBEC
  • 新版本:54.4 分。
  • 預覽版:7.3 分。
  • GLM4-0520:46.2 分。
  • Opus:58 分。
  • 其他指標提升
  • Cybergen:38.7 -> 76.7 分。
  • CoderEval:49.7 -> 70.3 分。
  • DSBench(全棧任務):37 -> 68.7 分。
  • 高難度編碼智能體任務:25.8 -> 59.6 分。
  • 測試條件註解
  • 使用了即將推出的 Deep-C Harness 框架。
  • 運行於「極簡模式」,最高檔位。
  • Top-p 設為 0.95,溫度(Temperature)設為 1。
  • DeepSeek 強調測試框架選擇對結果影響巨大,數據僅供參考。

IV. 講者自建基準測試(Kinbench/TingBench)

  • 測試環境:講者自建基準測試,涵蓋前端、動畫、Three.js、SVG、數學、長程智能體及 3D 任務。
  • 評分標準:每項滿分 10 分。

測試題目與結果:

  1. 電梯模擬(前端/動畫)
  • 任務:構建模擬程序,多電梯運行,懸停顯示目標樓層。
  • 結果:5 分。基本框架有,但核心邏輯(乘客接駁)未跑通,動畫不流暢。
  • 對比:Opus 10 分,Claude 3.5 與 Kimi k3 為 9 分。
  1. Three.js 隱形眼鏡盒(3D模型)
  • 任務:生成帶 L/R 標識蓋子的 3D 模型,點擊打開交互。
  • 結果:8 分。外觀合格,交互有效。
  • 對比:Qwen 2.5 Maths 並列,Opus 5 分(歷史第二),Claude 3.5 唯一滿分。
  1. FreeJF 折疊桌(3D動畫)
  • 任務:滑塊控制折疊/展開,無縫 3D 動畫。
  • 結果:7 分。過渡基本自然但不完全流暢。
  • 對比:Claude 3.5, Kimi, GLM4, Sonnet 3.5 為 9 分;Opus 僅 5 分。
  1. 生成 SVG 吃漢堡的熊貓(視覺)
  • 任務:生成 SVG 圖像。
  • 結果:5 分。構圖別扭,不像在吃漢堡。
  • 對比:Kimi, Gemini 1.5, Qwen 2.5 Max 僅 8 分。
  1. 弓箭模擬遊戲(遊戲邏輯)
  • 任務:四個靶子,最短時間擊中,排行榜功能。
  • 結果:7 分。核心機制正常,手感與細節打磨未達頂尖。
  • 對比:Groq 1.5, Qwen 2.5 Math, Opus 滿分。
  1. 數學難題(推理)
  • 任務:計算有序隊排列數,答案 2460。
  • 結果:10 分(滿分)。完美答對。
  • 對比:與 Claude 3.5, Gemini Chat, Qwen Max, Opus 並列。
  • 註:V4 Pro 預覽版也做對了,顯示 V4 系列推理能力強。
  1. 長程智能體任務(全棧/微調)
  • 任務:生成熊貓數據集 -> 微調 Gemma 2B -> 構建本地 WebUI -> 隨機生成冷知識。全程自主、本地運行。
  • 結果:10 分(滿分)。表現完美,無卡殼。
  • 對比:預覽版遠不如現在可靠。
  1. 3D 萬年曆(極難 3D)
  • 任務:功能完整的 3D 萬年曆,顯示時間(秒/分/針平滑轉動)、日期、雙時區。
  • 結果:6 分。創下該題歷史記錄(此前最高為 GPT-4o 的 4 分)。
  • 對比:擊敗了 Claude 3.5, Opus 及其他前沿模型。

V. 最終總結與結論

  • 總分:58 分,得分率 72.5%。
  • 排名對比
  • 高於 GPT-4o-513 (71.25%)。
  • 低於 Gemini 1.5 Pro (75%)。
  • 低於 Kimi, OpenAI (77.5%)。
  • 低於 GPT-4o-2024-05-13 (80%)。
  • 低於 Qwen 2.5 Max (81.25%)。
  • 低於 Claude 3.5 (82.5%)。
  • 關鍵發現
  • V4 Flash 小模型得分率 (72.5%) 遠高於 V4 Pro 預覽版 (24.8%),提升近三倍。
  • 在邏輯推理、長程 Agent 任務上表現完美。
  • 在純視覺打磨(如 SVG、電梯動畫)上表現平平。
  • 結論:針對智能體編程深度微調的模型。
  • 建議
  • 目前性價比最高的模型之一。
  • 可直接接入 Cursor 等代碼工具。
  • 適合學生或預算有限的開發者。
  • 雖無法擊敗 Claude 3.5 或 Opus 綜合表現,但考慮體量與價格已足夠驚艷。
  • 未來展望
  • 官方 DeepSeek V4 Pro 即將發布。
  • 若將同樣的智能體後訓練應用於 1.6 萬億參數模型,將對閉源模型形成「降維打擊」。

工具 / 模型 / 名詞整理

  • DeepSeek 系列
  • DeepSeek V4 Flash (0731 版本)
  • DeepSeek V4 Pro (預覽版 / 即將發布的正式版)
  • 其他模型
  • Claude 3.5
  • Opus (可能指 Claude Opus)
  • GLM-4-0520 / GLM4
  • Kimi k3 / Kimi
  • Qwen 2.5 Maths / Qwen 2.5 Max
  • Sonnet 3.5
  • Gemini 1.5 / Gemini Chat
  • GPT-4o-513 / GPT-4o-2024-05-13
  • Groq 1.5
  • Gemma 2B
  • 框架與工具
  • NVIDIA Link (用於免費使用)
  • Kinbench (講者自稱的基準測試名稱,後文又稱 TingBench)
  • Terminal Bench 2.1
  • SWBEC
  • Cybergen
  • CoderEval
  • DSBench
  • Deep-C Harness (即將推出的框架)
  • Codex (框架/工作流)
  • Cursor (代碼工具)
  • Three.js
  • SVG
  • WebUI

操作流程整理

  1. 獲取模型:通過 DeepSeek V4 Flash API 或 App 端獲取 0731 版本模型。
  2. 環境配置
  • 確保使用支持 Response API 格式的框架。
  • 若使用 Codex 框架,可直接接入工作流。
  • 若進行官方基準測試,需使用 Deep-C Harness 框架,設置 Top-p 為 0.95,溫度為 1,並運行於「極簡模式」。
  1. 執行測試任務
  • 前端/動畫任務:如電梯模擬、折疊桌動畫,測試邏輯與流暢度。
  • 3D 生成任務:如隱形眼鏡盒、萬年曆,測試模型生成與交互能力。
  • 視覺生成任務:如 SVG 圖像生成,測試視覺構圖能力。
  • 數學推理任務:如排列數計算,測試邏輯推理能力。
  • 長程智能體任務:如數據集生成、模型微調、WebUI 構建,測試全流程自主執行能力。
  1. 評估與對比
  • 根據任務完成度、代碼質量、視覺效果進行評分(滿分 10 分)。
  • 將結果與其他模型(如 Claude 3.5, Opus, GPT-4o 等)進行對比分析。
  1. 應用建議
  • 對於預算有限的開發者,建議優先使用 V4 Flash 進行智能體編程與邏輯推理任務。
  • 可將模型接入 Cursor 等代碼工具進行實際開發。

值得注意的限制或風險

  1. 參數量描述疑點:影片中提到 V4 Flash 總參數量為「2000.0840 億」,此數字格式異常,可能為聽寫錯誤或口誤,實際數值需查證。
  2. 測試名稱不一致:講者先稱測試為「Kinbench」,後又稱「TingBench」,兩者可能為同一測試的不同稱呼或口誤,需查證正確名稱。
  3. 模型名稱拼寫:影片中出現「Cloud 3.5」,應指「Claude 3.5」,但依規則標為疑點。
  4. 參數規模描述混淆:影片中存在「2840 億參數的 Flash」與前文「2000 0840 億」及「130 億激活參數」的描述可能存在聽寫混淆,需查證 V4 Flash 的確切參數。
  5. 溫度參數描述語意不通:影片提到「溫度參數設為一可見」,「可見」二字語意不通,疑為口誤或聽寫錯誤。
  6. 詞彙聽寫錯誤:「重歸原矩」疑為「重回原點」或類似詞彙的聽寫錯誤。
  7. 術語使用不常見:「API 知識」在語境中可能指「API 接口」或特定功能,但「API 知識」一詞較不常見,疑為口誤。

逐字稿辨識疑點

  • 參數量描述:「2000 0840 億的總參數量」。數字格式異常,疑為聽寫錯誤或口誤,實際數值需查證。
  • 測試名稱不一致:講者先稱測試為「Kinbench」,後又稱「TingBench」。兩者可能為同一測試的不同稱呼或口誤,需查證正確名稱。
  • 模型名稱拼寫:「Cloud 3.5」應指「Claude 3.5」,但依規則標為疑點。
  • 參數規模描述:「2840 億參數的 Flash」與前文「2000 0840 億」及「130 億激活參數」的描述可能存在聽寫混淆,需查證 V4 Flash 的確切參數。
  • 溫度參數描述:「溫度參數設為一可見」,「可見」二字語意不通,疑為口誤或聽寫錯誤。
  • 重歸原矩:「重歸原矩」疑為「重回原點」或類似詞彙的聽寫錯誤。
  • 代碼工具名稱:「API 知識」在語境中可能指「API 接口」或特定功能,但「API 知識」一詞較不常見,疑為口誤。

可延伸追問

  1. DeepSeek V4 Flash 0731 版本的確切參數量是多少?「2000.0840 億」是否為聽誤?
  2. 「Kinbench」與「TingBench」是否為同一個基準測試?其正確名稱為何?
  3. 「Cloud 3.5」是否確指「Claude 3.5」?
  4. 「溫度參數設為一可見」中的「可見」具體指什麼?是否為「1.0」的聽誤?
  5. 「重歸原矩」的正確詞彙為何?
  6. 「API 知識」在影片語境中具體指代什麼功能或接口?
  7. DeepSeek V4 Pro 正式版的具體發布時間與性能預期為何?
  8. 如何通過 NVIDIA Link 免費使用 DeepSeek V4 Flash API?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習