start	end	text
0	7460	大家好 欢迎收看新一期视频
7460	10720	Deepseek刚刚发布了一个很有意思的更新
10720	14980	Deepseek V4 Flash官方API现已开启公测
14980	19240	新版本命名为Deepseek V4 Flash 0731
19240	21600	这可不只是一个小补丁
21600	25000	Deepseek表示他们大幅提升了智能体能力
25000	27180	在该模型上甚至
27180	30600	使其测试分数如今已远超V4 Pro预览版
30600	31780	也就是说
31780	33980	这个小模型现在击败了预览版
33980	36720	极大模型在智能体任务上的版本
36720	38420	这确实挺疯狂的
38420	40420	我也用我自己的Kinbench测试了它
40420	42320	而在我的基准测试中
42320	43040	它做到了
43040	45200	其他任何模型都未曾做到的事
45200	46400	包括Code 3.5
46400	48360	以及Opus稍后我们会细聊
48360	48860	但首先
48860	51040	我们先聊聊这次更新到底是什么
51040	53340	前阵子我介绍过DeepSeek V4 Pro
53340	55120	和V4 Flash的预览版
55120	58120	包括如何通过NVIDIA Link免费使用它们
58120	59560	视频链接已放在下方
59560	60940	我们先快速回顾一下Flash
60940	63120	它是V4系列中较小的模型
63120	65400	该混合专家模型拥有2000
65400	67720	0840亿的总参数量
67720	69660	约130亿激活参数
69660	72000	支持100万Token上下文窗口
72000	73780	它定位为主打快速
73780	75180	与低成本版本
75180	75900	而V4 Pro
75900	78200	是1.6万亿参数旗舰大模型
78200	79940	关于这次0731更新
79940	81040	有一个关键细节
81040	82500	DeepSea明确表示
82500	84340	V4Flash 0731
84340	86540	保持了完全相同的模型架构
86540	89060	和参数规模与预览版完全一致
89060	90700	所以它并没有变大
90700	91300	依然是
91300	93480	那款2840亿参数的Flash
93480	94820	但在此基础上
94820	96880	它似乎进行了高强度的智能体后训练
96880	99640	所有的性能提升都源于训练的优化
99640	101200	而不是增加参数量
101200	102240	他们还明确指出
102240	105040	这次升级仅是用于DeepSeek V4 Flash API
105040	106480	V4 Pro API
106480	108240	以及App端D模型
108240	110120	和网页端目前都保持不变
110120	112000	公告最后提到
112000	114240	DeepSeek V4 Pro的正式版本
114240	115960	很快就会发布
115960	118240	所以这次Flash更新基本只是热身
118240	120780	真正的重头戏还在后头
120780	121720	另外
121720	123260	这次发布中还有一点
123260	125020	我觉得非常明智
125020	128940	官方V4Flash现在原生支持Response API格式
128940	131620	Dipsy还表示他已完全适配Codex
131620	133820	所以他们不仅是发布了一个模型
133820	135880	而不是被动等待工具链的适配
135880	138280	他们直接面向Codex适配框架进行了开发
138280	140320	这意味着你可以将其接入
140320	142980	到Codex风格的工作流中且毫无阻碍
142980	145740	GLM以及国内的其他一些实验室也在做
145740	146940	类似的框架适配
146940	148840	事实证明效果立竿见影
148840	150100	这确实是个明智之举
150100	152440	接下来看看官方的基准测试数据
152440	153820	这次性能提升太惊人了
153820	155180	在Terminal Bench 2.1测试中
155180	157440	新版Flash跑分高达82.7
157440	159960	而此前的预览版仅为61.8
159960	162980	甚至连V4 Pro预览版也只有72.1分
162980	166260	这也让它超越了81分的GLM40520
166260	169160	而且距离85分的OPUS差距并不大
169160	171300	要知道后者的价格可要贵得多
171300	172800	而最夸张的是SWBEC
172980	175580	预览版在这个测试中仅获得了7.3分
175580	178040	而新版本直接飙升到54.4分
178040	179900	实现了从基本无法使用
179900	183900	到足以于46.2分的GLM40520正面竞争的水平
183900	185920	甚至是58分的OPUS
185920	188140	Cybergen也从38.7分
188140	190680	升至76.7分涂了冷验证机
190680	193280	从49.7分升至70.3分
193280	195500	在其内部DSBench测试集上
195500	198260	全战任务得分从37升至68.7
198260	200380	高难度编码智能体任务也
200380	202740	从25.8升至59.6
202740	203800	总的来说
203800	205840	这叫其自身的预览板有了巨大飞跃
205840	208200	且在大多数智能体基准测试中
208200	209820	它已逼近OPUS 4.8
209820	211820	而它作为一款尺寸小得多
211820	213160	且更便宜的模型
213160	214100	不过需要说明的是
214100	215120	Deep-C指出
215120	216820	在公开的编码智能体任务测试中
216820	218380	V4 Flash使用了
218380	221360	其即将推出的Deep-C Harness框架在极简模式下
221360	222760	以最高档位运行
222760	224120	且套采样设为0.95
224120	225840	温度参数设为一可见
225840	227500	测试框架的选择至关重要
227500	229000	测试结果可能不同
229000	230580	数据仅供参考
230580	232660	不过了解本频道的人都知道
232660	234640	我们从不只看官方宣传数据
234640	236380	所以我用自己的基准测试跑了一下
236380	238360	话不多说我们直接切入正题
238360	239440	和往常一样
239440	240860	我用我的TingBench进行了测试
240860	242400	其中涵盖了一些前端
242400	245200	与动画一些FreeJS任务以及SVG测试
245200	248780	一道数学题以及一个长城智能体任务
248780	250720	最后还有一个超难的3D任务
250720	252500	每项测试满分10分
252500	255280	最后我们会通过最终的图表来看看
255280	258060	看看它的表现与其他模型相比如何
258060	259880	第一题是电梯模拟
259880	262300	模型需要构建一个模拟程序
262300	264520	你可以在不同楼层生成乘客
264520	266020	共有三部电梯
266020	267500	其每部只能在一人
267500	269980	没赶上的人需要搭乘下一班电梯
269980	272760	还需要有提示框显示每个人的目标楼层
272760	274720	当鼠标悬停在他们身上时
274720	276500	我们发送提示词看看效果
276500	278020	这个表现只能算一半
278020	280000	得了五分基本框架是有了
280000	282020	但关于乘客没赶上电梯
282020	284620	并被下一班电梯接走的核心逻辑并没有完全跑通
284620	286500	而且动画也不够流畅
286500	287360	作为参考
287360	289860	只有OPUS模型在这项测试中拿过10分
289860	291800	而像CLUD3.5这样的模型
291800	293620	和KIMMYK3也只有9分
293620	295540	所以这开局只能算重归重矩
295540	298640	第二个测试是FreeJF隐形眼镜盒
298640	301240	它需要生成一个3D模型
301240	304940	是一个带有明显L和R标识盖子的隐形眼镜盒
304940	308660	并且点击盖子能够将其打开这项测试
308660	311280	几乎所有模型都会在这里翻车
311280	312480	我们发送过去看看
312480	314800	好的 这其实做得非常好
314800	316140	它拿到了8分
316140	317880	盒子看起来很像样
317880	319300	像个合格的眼镜盒L
319300	321800	而且L和二盖也清晰可见
321800	323240	点击打开的交互也有效
323240	325080	这让他与Quan2.5Maps并列
325080	326420	而Opus拿到了5分
326420	327340	是历史第二高分
327340	329520	在该测试中仅次于Plus 3.5
329520	331140	他仍然是唯一在这个测试中
331140	332180	拿到满分10分的模型
332180	333860	所以对于一个小模型来说
333860	335640	能有这样的表现已经非常惊艳了
335640	337120	第三题是
337120	338580	FreeJF折叠桌
338580	339860	这里有一个滑块
339860	342040	当你向右拖动它时
342040	343400	桌子应该展开
343400	344780	向左拖则折叠回去
344780	346480	动画需要无缝衔剑
346480	348500	且呈现出真正的3D效果
348500	349780	我们发送请求看看
349780	351260	这个得到了7分
351260	352780	桌子确实能折叠起来
352780	355220	并能随滑快拖动而展开
355220	356820	过度基本自然
356820	358400	只是还不够完全流畅
358400	360160	表现最好的模型
360160	361160	如Cloud 3.5
361160	362340	KIMI GLM4
362340	363800	以及Summit 3.5
363800	365440	在这项测试中都拿到了9分
365440	366640	但对比来看
366640	368460	Opus在这项测试中仅得了5分
368460	370740	所以这表现绝对算很不错了
370740	373060	第四题是生成熊猫的SVG
373060	374220	吃着汉堡
374220	375420	我们发送过去看看
375420	376500	好
376500	378620	这确实能看出是一只熊猫
378620	380420	也能看出是汉堡
380420	381860	但构图有点别扭
381860	384620	而且看起来不太像在吃汉堡
384620	386020	这题给五分
386020	388000	在这项测试中
388000	391600	像Pimi和Gemini 1.5这样表现最好的模型
391600	395240	以及Quain 2.5 Max得分也仅为8分
395240	397340	所以并不算惊艳
397340	399180	第五题是制作弓箭
399180	401940	模拟游戏里面设计了四个靶子
401940	404700	玩家需要以最短的时间击中所有靶子
404700	406120	从而登上排行榜
406120	407740	我们发送代码运行一下看看
407740	409140	这道题得了7分
409140	410960	核心射击机制可以正常运行
410960	412660	靶子能判定击中
412660	414040	排行榜功能也正常
414040	416200	但整体手感和细节打磨
416200	417840	还达不到顶尖模型的水平
417840	420740	比如Grog 1.5和Quang 2.5 Math
420740	423560	虽然Opus模型在这里都拿了满分
423560	425100	但这依然是个可玩的游戏
425100	426960	所以表现还算不错
426960	429240	第六题是一道数学难题
429240	431320	关于计算有序队的排列数
431320	433300	答应该是2460
433300	435740	很多模型在这一题上完全翻车
435740	436620	我们提交一下
436620	437700	看看
437700	439860	他完美答对了2460
439860	441420	完全正确
441420	442640	拿了满分10分
442640	444300	这让他机身同一梯队
444300	446160	与Cloud 3.5
446160	446800	Timmy Chat
446800	448060	Queen Max
448060	449400	以及Opus模型并列
449400	450060	有趣的是
450060	451600	在我测试时
451600	453760	V4 Pro预览版也做对了这道题
453760	457320	所以V4系列的推理能力显然非常过瘾
457320	460600	第七题是一个复杂的长城任务
460600	463580	生成一个关于熊猫知识的数据集
463580	466880	并用该数据集为调一个GEM2B模型
466880	471240	接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识
471240	473500	全程从零开始完全自主完成
473500	475180	且完全在本地运行
475180	476500	我们启动任务看看效果
476500	478560	这次的表现绝对可以达满分
478560	481040	它生成了数据集并完成了整个微调
481040	483260	独自运行期间完全没有卡科
483672	485532	生成的Web UI正常运行
485532	488052	每次刷新都显示新的熊猫冷知识
488052	491372	这正是那种复杂的长程智能体任务
491372	493392	Deep C声称对其进行过针对性升级
493392	494472	说实话
494472	495432	效果显而易见
495432	497192	之前的预览版远没这么可靠
497192	499372	这波表现确实堪称完美
499372	501032	第八题也是最后一题
501032	502112	是制作一个3D万秒
502112	503992	要求是一个功能完整的3D万秒
503992	505392	能显示当前实际时间
505392	506312	秒针 分针
506312	507832	以及时针都要平滑转动
507832	508492	还要有日期
508492	509492	核心器显示
509492	510112	以及双时区
510112	511632	这是整个测试集中最难的一题
511632	513172	之前没有任何模型
513172	514572	能在这道题上拿到好成绩
514572	516712	历史最高分是Fibo5创下的
516712	517452	4分
517452	518612	让我们直接运行测试
518612	519672	但你感谢
519672	521572	Lip6 V4 Flav竟然拿到了6分
521572	523212	创下这道题历史记录
523212	524772	手表完整呈现出来
527192	528272	指针转动平滑
528272	529552	只能实时同步时间
529552	531352	双时区设置也基本正常
531352	532172	虽然还不完美
532172	534152	所以没能拿到更高的分数
534152	536112	但这个小模型刚刚击败了
536112	537092	Cloud 3.5 Opus
537092	539272	以及我测试集最难题目上的
539272	540332	其他所有前沿模型
540332	542092	这完全出乎我的意料
542092	543892	来看一下最终的图表
543892	545932	Deep Seek V4 Flash 0731
545932	547912	最终拿到了58分
547912	550052	得分率为72.5%
550052	550712	这让它排在
550712	555272	略高于GPT4O513的71.25%
555272	558852	稍低于Gemini 1.5 Pro的75%
558852	559752	而在它之上
559752	561172	有Kinning和
561172	563352	Opas并列77.5%
563352	565192	GTT 450808达80%
565192	565832	接着是Quain
565832	569152	Quain 2.5 Max拿下81.25%
569152	572032	而Cloud 3.5仍以82.5%稳居榜首
572032	573572	而对比以下背景
573572	575092	你就能明白这有多惊人
575092	577732	我之前测试Deep Seek V4 Pro预览版时
577732	580532	它在此测试中仅得了24.8%
580532	584092	新的Flash模型得分达到了72.5%
584092	585892	这意味着该系列的小模型现在
585892	588472	比大模型预览版的表现提升了近三倍
588472	589872	在我的测试中
589872	592572	而且在架构和尺寸与预览版相同
592572	594892	单靠后训练就能取得惊人提升
594892	595472	不可思议
595472	599052	这也印证了Deep Seed所宣称的Agent能力升级
599052	601932	从得分规律中也可以清楚地看到
601932	603712	所有射击推理
603712	606892	或长城Agent任务基本上都拿到了满分
606892	609292	比如数学和微调任务
609292	611532	还有创纪录的时钟生成常识
611532	614112	但像熊猫SVG这种纯视觉打磨的任务
614112	615252	还有电梯动画
615252	616892	在这些方面它的表现依然平平
616892	618592	所以这确实很像是一个
618592	620372	针对智能体编程深度微调的模型
620372	622292	正如官方基准测试所示
622292	623292	那么结论是什么
623292	625532	这绝对是目前性价比最高的模型之一
625532	626772	可用于智能体编程
626772	627792	在我的测试中
627792	629692	它的表现已经达到了Gemini 1.5 Pro的水平
629692	632012	它可以直接接入Cursor等代码工具
632012	633392	这得益于其API知识
633392	634972	而且Ditsig的价格
634972	636312	一直都非常便宜
636312	637112	如果你是学生
637112	639092	或者对于预算有限的开发者
639092	640412	这绝对是个极佳的选择
640412	642612	他显然还无法击败Cloud 3.5
642612	644572	或是在综合表现上超越OPUS
644572	646672	而且他的视觉能力依然表现平平
646672	648252	但考虑到他的体量和价格
648252	649292	这已经足够经验了
649292	650032	而且别忘了
650032	651672	这还仅仅是Flash版本
651672	653412	官方的DeepSick V4 Pro也即将发布
653412	654652	据官方介绍
654652	656492	如果将同样的智能体后训练应用
656492	658452	到1.6万亿参数的模型上
658452	660452	那对市面上昂贵的B元模型来说
660452	661812	将是降维打击般的存在
661812	663932	我会在上线后第一时间进行测试
663932	664592	尽情关注
664592	665692	总的来说
665692	666432	这非常酷
