1
00:00:00,000 --> 00:00:07,460
大家好 欢迎收看新一期视频

2
00:00:07,460 --> 00:00:10,720
Deepseek刚刚发布了一个很有意思的更新

3
00:00:10,720 --> 00:00:14,980
Deepseek V4 Flash官方API现已开启公测

4
00:00:14,980 --> 00:00:19,240
新版本命名为Deepseek V4 Flash 0731

5
00:00:19,240 --> 00:00:21,600
这可不只是一个小补丁

6
00:00:21,600 --> 00:00:25,000
Deepseek表示他们大幅提升了智能体能力

7
00:00:25,000 --> 00:00:27,180
在该模型上甚至

8
00:00:27,180 --> 00:00:30,600
使其测试分数如今已远超V4 Pro预览版

9
00:00:30,600 --> 00:00:31,780
也就是说

10
00:00:31,780 --> 00:00:33,980
这个小模型现在击败了预览版

11
00:00:33,980 --> 00:00:36,720
极大模型在智能体任务上的版本

12
00:00:36,720 --> 00:00:38,420
这确实挺疯狂的

13
00:00:38,420 --> 00:00:40,420
我也用我自己的Kinbench测试了它

14
00:00:40,420 --> 00:00:42,320
而在我的基准测试中

15
00:00:42,320 --> 00:00:43,040
它做到了

16
00:00:43,040 --> 00:00:45,200
其他任何模型都未曾做到的事

17
00:00:45,200 --> 00:00:46,400
包括Code 3.5

18
00:00:46,400 --> 00:00:48,360
以及Opus稍后我们会细聊

19
00:00:48,360 --> 00:00:48,860
但首先

20
00:00:48,860 --> 00:00:51,040
我们先聊聊这次更新到底是什么

21
00:00:51,040 --> 00:00:53,340
前阵子我介绍过DeepSeek V4 Pro

22
00:00:53,340 --> 00:00:55,120
和V4 Flash的预览版

23
00:00:55,120 --> 00:00:58,120
包括如何通过NVIDIA Link免费使用它们

24
00:00:58,120 --> 00:00:59,560
视频链接已放在下方

25
00:00:59,560 --> 00:01:00,940
我们先快速回顾一下Flash

26
00:01:00,940 --> 00:01:03,120
它是V4系列中较小的模型

27
00:01:03,120 --> 00:01:05,400
该混合专家模型拥有2000

28
00:01:05,400 --> 00:01:07,720
0840亿的总参数量

29
00:01:07,720 --> 00:01:09,660
约130亿激活参数

30
00:01:09,660 --> 00:01:12,000
支持100万Token上下文窗口

31
00:01:12,000 --> 00:01:13,780
它定位为主打快速

32
00:01:13,780 --> 00:01:15,180
与低成本版本

33
00:01:15,180 --> 00:01:15,900
而V4 Pro

34
00:01:15,900 --> 00:01:18,200
是1.6万亿参数旗舰大模型

35
00:01:18,200 --> 00:01:19,940
关于这次0731更新

36
00:01:19,940 --> 00:01:21,040
有一个关键细节

37
00:01:21,040 --> 00:01:22,500
DeepSea明确表示

38
00:01:22,500 --> 00:01:24,340
V4Flash 0731

39
00:01:24,340 --> 00:01:26,540
保持了完全相同的模型架构

40
00:01:26,540 --> 00:01:29,060
和参数规模与预览版完全一致

41
00:01:29,060 --> 00:01:30,700
所以它并没有变大

42
00:01:30,700 --> 00:01:31,300
依然是

43
00:01:31,300 --> 00:01:33,480
那款2840亿参数的Flash

44
00:01:33,480 --> 00:01:34,820
但在此基础上

45
00:01:34,820 --> 00:01:36,880
它似乎进行了高强度的智能体后训练

46
00:01:36,880 --> 00:01:39,640
所有的性能提升都源于训练的优化

47
00:01:39,640 --> 00:01:41,200
而不是增加参数量

48
00:01:41,200 --> 00:01:42,240
他们还明确指出

49
00:01:42,240 --> 00:01:45,040
这次升级仅是用于DeepSeek V4 Flash API

50
00:01:45,040 --> 00:01:46,480
V4 Pro API

51
00:01:46,480 --> 00:01:48,240
以及App端D模型

52
00:01:48,240 --> 00:01:50,120
和网页端目前都保持不变

53
00:01:50,120 --> 00:01:52,000
公告最后提到

54
00:01:52,000 --> 00:01:54,240
DeepSeek V4 Pro的正式版本

55
00:01:54,240 --> 00:01:55,960
很快就会发布

56
00:01:55,960 --> 00:01:58,240
所以这次Flash更新基本只是热身

57
00:01:58,240 --> 00:02:00,780
真正的重头戏还在后头

58
00:02:00,780 --> 00:02:01,720
另外

59
00:02:01,720 --> 00:02:03,260
这次发布中还有一点

60
00:02:03,260 --> 00:02:05,020
我觉得非常明智

61
00:02:05,020 --> 00:02:08,940
官方V4Flash现在原生支持Response API格式

62
00:02:08,940 --> 00:02:11,620
Dipsy还表示他已完全适配Codex

63
00:02:11,620 --> 00:02:13,820
所以他们不仅是发布了一个模型

64
00:02:13,820 --> 00:02:15,880
而不是被动等待工具链的适配

65
00:02:15,880 --> 00:02:18,280
他们直接面向Codex适配框架进行了开发

66
00:02:18,280 --> 00:02:20,320
这意味着你可以将其接入

67
00:02:20,320 --> 00:02:22,980
到Codex风格的工作流中且毫无阻碍

68
00:02:22,980 --> 00:02:25,740
GLM以及国内的其他一些实验室也在做

69
00:02:25,740 --> 00:02:26,940
类似的框架适配

70
00:02:26,940 --> 00:02:28,840
事实证明效果立竿见影

71
00:02:28,840 --> 00:02:30,100
这确实是个明智之举

72
00:02:30,100 --> 00:02:32,440
接下来看看官方的基准测试数据

73
00:02:32,440 --> 00:02:33,820
这次性能提升太惊人了

74
00:02:33,820 --> 00:02:35,180
在Terminal Bench 2.1测试中

75
00:02:35,180 --> 00:02:37,440
新版Flash跑分高达82.7

76
00:02:37,440 --> 00:02:39,960
而此前的预览版仅为61.8

77
00:02:39,960 --> 00:02:42,980
甚至连V4 Pro预览版也只有72.1分

78
00:02:42,980 --> 00:02:46,260
这也让它超越了81分的GLM40520

79
00:02:46,260 --> 00:02:49,160
而且距离85分的OPUS差距并不大

80
00:02:49,160 --> 00:02:51,300
要知道后者的价格可要贵得多

81
00:02:51,300 --> 00:02:52,800
而最夸张的是SWBEC

82
00:02:52,980 --> 00:02:55,580
预览版在这个测试中仅获得了7.3分

83
00:02:55,580 --> 00:02:58,040
而新版本直接飙升到54.4分

84
00:02:58,040 --> 00:02:59,900
实现了从基本无法使用

85
00:02:59,900 --> 00:03:03,900
到足以于46.2分的GLM40520正面竞争的水平

86
00:03:03,900 --> 00:03:05,920
甚至是58分的OPUS

87
00:03:05,920 --> 00:03:08,140
Cybergen也从38.7分

88
00:03:08,140 --> 00:03:10,680
升至76.7分涂了冷验证机

89
00:03:10,680 --> 00:03:13,280
从49.7分升至70.3分

90
00:03:13,280 --> 00:03:15,500
在其内部DSBench测试集上

91
00:03:15,500 --> 00:03:18,260
全战任务得分从37升至68.7

92
00:03:18,260 --> 00:03:20,380
高难度编码智能体任务也

93
00:03:20,380 --> 00:03:22,740
从25.8升至59.6

94
00:03:22,740 --> 00:03:23,800
总的来说

95
00:03:23,800 --> 00:03:25,840
这叫其自身的预览板有了巨大飞跃

96
00:03:25,840 --> 00:03:28,200
且在大多数智能体基准测试中

97
00:03:28,200 --> 00:03:29,820
它已逼近OPUS 4.8

98
00:03:29,820 --> 00:03:31,820
而它作为一款尺寸小得多

99
00:03:31,820 --> 00:03:33,160
且更便宜的模型

100
00:03:33,160 --> 00:03:34,100
不过需要说明的是

101
00:03:34,100 --> 00:03:35,120
Deep-C指出

102
00:03:35,120 --> 00:03:36,820
在公开的编码智能体任务测试中

103
00:03:36,820 --> 00:03:38,380
V4 Flash使用了

104
00:03:38,380 --> 00:03:41,360
其即将推出的Deep-C Harness框架在极简模式下

105
00:03:41,360 --> 00:03:42,760
以最高档位运行

106
00:03:42,760 --> 00:03:44,120
且套采样设为0.95

107
00:03:44,120 --> 00:03:45,840
温度参数设为一可见

108
00:03:45,840 --> 00:03:47,500
测试框架的选择至关重要

109
00:03:47,500 --> 00:03:49,000
测试结果可能不同

110
00:03:49,000 --> 00:03:50,580
数据仅供参考

111
00:03:50,580 --> 00:03:52,660
不过了解本频道的人都知道

112
00:03:52,660 --> 00:03:54,640
我们从不只看官方宣传数据

113
00:03:54,640 --> 00:03:56,380
所以我用自己的基准测试跑了一下

114
00:03:56,380 --> 00:03:58,360
话不多说我们直接切入正题

115
00:03:58,360 --> 00:03:59,440
和往常一样

116
00:03:59,440 --> 00:04:00,860
我用我的TingBench进行了测试

117
00:04:00,860 --> 00:04:02,400
其中涵盖了一些前端

118
00:04:02,400 --> 00:04:05,200
与动画一些FreeJS任务以及SVG测试

119
00:04:05,200 --> 00:04:08,780
一道数学题以及一个长城智能体任务

120
00:04:08,780 --> 00:04:10,720
最后还有一个超难的3D任务

121
00:04:10,720 --> 00:04:12,500
每项测试满分10分

122
00:04:12,500 --> 00:04:15,280
最后我们会通过最终的图表来看看

123
00:04:15,280 --> 00:04:18,060
看看它的表现与其他模型相比如何

124
00:04:18,060 --> 00:04:19,880
第一题是电梯模拟

125
00:04:19,880 --> 00:04:22,300
模型需要构建一个模拟程序

126
00:04:22,300 --> 00:04:24,520
你可以在不同楼层生成乘客

127
00:04:24,520 --> 00:04:26,020
共有三部电梯

128
00:04:26,020 --> 00:04:27,500
其每部只能在一人

129
00:04:27,500 --> 00:04:29,980
没赶上的人需要搭乘下一班电梯

130
00:04:29,980 --> 00:04:32,760
还需要有提示框显示每个人的目标楼层

131
00:04:32,760 --> 00:04:34,720
当鼠标悬停在他们身上时

132
00:04:34,720 --> 00:04:36,500
我们发送提示词看看效果

133
00:04:36,500 --> 00:04:38,020
这个表现只能算一半

134
00:04:38,020 --> 00:04:40,000
得了五分基本框架是有了

135
00:04:40,000 --> 00:04:42,020
但关于乘客没赶上电梯

136
00:04:42,020 --> 00:04:44,620
并被下一班电梯接走的核心逻辑并没有完全跑通

137
00:04:44,620 --> 00:04:46,500
而且动画也不够流畅

138
00:04:46,500 --> 00:04:47,360
作为参考

139
00:04:47,360 --> 00:04:49,860
只有OPUS模型在这项测试中拿过10分

140
00:04:49,860 --> 00:04:51,800
而像CLUD3.5这样的模型

141
00:04:51,800 --> 00:04:53,620
和KIMMYK3也只有9分

142
00:04:53,620 --> 00:04:55,540
所以这开局只能算重归重矩

143
00:04:55,540 --> 00:04:58,640
第二个测试是FreeJF隐形眼镜盒

144
00:04:58,640 --> 00:05:01,240
它需要生成一个3D模型

145
00:05:01,240 --> 00:05:04,940
是一个带有明显L和R标识盖子的隐形眼镜盒

146
00:05:04,940 --> 00:05:08,660
并且点击盖子能够将其打开这项测试

147
00:05:08,660 --> 00:05:11,280
几乎所有模型都会在这里翻车

148
00:05:11,280 --> 00:05:12,480
我们发送过去看看

149
00:05:12,480 --> 00:05:14,800
好的 这其实做得非常好

150
00:05:14,800 --> 00:05:16,140
它拿到了8分

151
00:05:16,140 --> 00:05:17,880
盒子看起来很像样

152
00:05:17,880 --> 00:05:19,300
像个合格的眼镜盒L

153
00:05:19,300 --> 00:05:21,800
而且L和二盖也清晰可见

154
00:05:21,800 --> 00:05:23,240
点击打开的交互也有效

155
00:05:23,240 --> 00:05:25,080
这让他与Quan2.5Maps并列

156
00:05:25,080 --> 00:05:26,420
而Opus拿到了5分

157
00:05:26,420 --> 00:05:27,340
是历史第二高分

158
00:05:27,340 --> 00:05:29,520
在该测试中仅次于Plus 3.5

159
00:05:29,520 --> 00:05:31,140
他仍然是唯一在这个测试中

160
00:05:31,140 --> 00:05:32,180
拿到满分10分的模型

161
00:05:32,180 --> 00:05:33,860
所以对于一个小模型来说

162
00:05:33,860 --> 00:05:35,640
能有这样的表现已经非常惊艳了

163
00:05:35,640 --> 00:05:37,120
第三题是

164
00:05:37,120 --> 00:05:38,580
FreeJF折叠桌

165
00:05:38,580 --> 00:05:39,860
这里有一个滑块

166
00:05:39,860 --> 00:05:42,040
当你向右拖动它时

167
00:05:42,040 --> 00:05:43,400
桌子应该展开

168
00:05:43,400 --> 00:05:44,780
向左拖则折叠回去

169
00:05:44,780 --> 00:05:46,480
动画需要无缝衔剑

170
00:05:46,480 --> 00:05:48,500
且呈现出真正的3D效果

171
00:05:48,500 --> 00:05:49,780
我们发送请求看看

172
00:05:49,780 --> 00:05:51,260
这个得到了7分

173
00:05:51,260 --> 00:05:52,780
桌子确实能折叠起来

174
00:05:52,780 --> 00:05:55,220
并能随滑快拖动而展开

175
00:05:55,220 --> 00:05:56,820
过度基本自然

176
00:05:56,820 --> 00:05:58,400
只是还不够完全流畅

177
00:05:58,400 --> 00:06:00,160
表现最好的模型

178
00:06:00,160 --> 00:06:01,160
如Cloud 3.5

179
00:06:01,160 --> 00:06:02,340
KIMI GLM4

180
00:06:02,340 --> 00:06:03,800
以及Summit 3.5

181
00:06:03,800 --> 00:06:05,440
在这项测试中都拿到了9分

182
00:06:05,440 --> 00:06:06,640
但对比来看

183
00:06:06,640 --> 00:06:08,460
Opus在这项测试中仅得了5分

184
00:06:08,460 --> 00:06:10,740
所以这表现绝对算很不错了

185
00:06:10,740 --> 00:06:13,060
第四题是生成熊猫的SVG

186
00:06:13,060 --> 00:06:14,220
吃着汉堡

187
00:06:14,220 --> 00:06:15,420
我们发送过去看看

188
00:06:15,420 --> 00:06:16,500
好

189
00:06:16,500 --> 00:06:18,620
这确实能看出是一只熊猫

190
00:06:18,620 --> 00:06:20,420
也能看出是汉堡

191
00:06:20,420 --> 00:06:21,860
但构图有点别扭

192
00:06:21,860 --> 00:06:24,620
而且看起来不太像在吃汉堡

193
00:06:24,620 --> 00:06:26,020
这题给五分

194
00:06:26,020 --> 00:06:28,000
在这项测试中

195
00:06:28,000 --> 00:06:31,600
像Pimi和Gemini 1.5这样表现最好的模型

196
00:06:31,600 --> 00:06:35,240
以及Quain 2.5 Max得分也仅为8分

197
00:06:35,240 --> 00:06:37,340
所以并不算惊艳

198
00:06:37,340 --> 00:06:39,180
第五题是制作弓箭

199
00:06:39,180 --> 00:06:41,940
模拟游戏里面设计了四个靶子

200
00:06:41,940 --> 00:06:44,700
玩家需要以最短的时间击中所有靶子

201
00:06:44,700 --> 00:06:46,120
从而登上排行榜

202
00:06:46,120 --> 00:06:47,740
我们发送代码运行一下看看

203
00:06:47,740 --> 00:06:49,140
这道题得了7分

204
00:06:49,140 --> 00:06:50,960
核心射击机制可以正常运行

205
00:06:50,960 --> 00:06:52,660
靶子能判定击中

206
00:06:52,660 --> 00:06:54,040
排行榜功能也正常

207
00:06:54,040 --> 00:06:56,200
但整体手感和细节打磨

208
00:06:56,200 --> 00:06:57,840
还达不到顶尖模型的水平

209
00:06:57,840 --> 00:07:00,740
比如Grog 1.5和Quang 2.5 Math

210
00:07:00,740 --> 00:07:03,560
虽然Opus模型在这里都拿了满分

211
00:07:03,560 --> 00:07:05,100
但这依然是个可玩的游戏

212
00:07:05,100 --> 00:07:06,960
所以表现还算不错

213
00:07:06,960 --> 00:07:09,240
第六题是一道数学难题

214
00:07:09,240 --> 00:07:11,320
关于计算有序队的排列数

215
00:07:11,320 --> 00:07:13,300
答应该是2460

216
00:07:13,300 --> 00:07:15,740
很多模型在这一题上完全翻车

217
00:07:15,740 --> 00:07:16,620
我们提交一下

218
00:07:16,620 --> 00:07:17,700
看看

219
00:07:17,700 --> 00:07:19,860
他完美答对了2460

220
00:07:19,860 --> 00:07:21,420
完全正确

221
00:07:21,420 --> 00:07:22,640
拿了满分10分

222
00:07:22,640 --> 00:07:24,300
这让他机身同一梯队

223
00:07:24,300 --> 00:07:26,160
与Cloud 3.5

224
00:07:26,160 --> 00:07:26,800
Timmy Chat

225
00:07:26,800 --> 00:07:28,060
Queen Max

226
00:07:28,060 --> 00:07:29,400
以及Opus模型并列

227
00:07:29,400 --> 00:07:30,060
有趣的是

228
00:07:30,060 --> 00:07:31,600
在我测试时

229
00:07:31,600 --> 00:07:33,760
V4 Pro预览版也做对了这道题

230
00:07:33,760 --> 00:07:37,320
所以V4系列的推理能力显然非常过瘾

231
00:07:37,320 --> 00:07:40,600
第七题是一个复杂的长城任务

232
00:07:40,600 --> 00:07:43,580
生成一个关于熊猫知识的数据集

233
00:07:43,580 --> 00:07:46,880
并用该数据集为调一个GEM2B模型

234
00:07:46,880 --> 00:07:51,240
接着构建一个本地WebUI每次刷新页面都会生成一条熊猫冷知识

235
00:07:51,240 --> 00:07:53,500
全程从零开始完全自主完成

236
00:07:53,500 --> 00:07:55,180
且完全在本地运行

237
00:07:55,180 --> 00:07:56,500
我们启动任务看看效果

238
00:07:56,500 --> 00:07:58,560
这次的表现绝对可以达满分

239
00:07:58,560 --> 00:08:01,040
它生成了数据集并完成了整个微调

240
00:08:01,040 --> 00:08:03,260
独自运行期间完全没有卡科

241
00:08:03,672 --> 00:08:05,532
生成的Web UI正常运行

242
00:08:05,532 --> 00:08:08,052
每次刷新都显示新的熊猫冷知识

243
00:08:08,052 --> 00:08:11,372
这正是那种复杂的长程智能体任务

244
00:08:11,372 --> 00:08:13,392
Deep C声称对其进行过针对性升级

245
00:08:13,392 --> 00:08:14,472
说实话

246
00:08:14,472 --> 00:08:15,432
效果显而易见

247
00:08:15,432 --> 00:08:17,192
之前的预览版远没这么可靠

248
00:08:17,192 --> 00:08:19,372
这波表现确实堪称完美

249
00:08:19,372 --> 00:08:21,032
第八题也是最后一题

250
00:08:21,032 --> 00:08:22,112
是制作一个3D万秒

251
00:08:22,112 --> 00:08:23,992
要求是一个功能完整的3D万秒

252
00:08:23,992 --> 00:08:25,392
能显示当前实际时间

253
00:08:25,392 --> 00:08:26,312
秒针 分针

254
00:08:26,312 --> 00:08:27,832
以及时针都要平滑转动

255
00:08:27,832 --> 00:08:28,492
还要有日期

256
00:08:28,492 --> 00:08:29,492
核心器显示

257
00:08:29,492 --> 00:08:30,112
以及双时区

258
00:08:30,112 --> 00:08:31,632
这是整个测试集中最难的一题

259
00:08:31,632 --> 00:08:33,172
之前没有任何模型

260
00:08:33,172 --> 00:08:34,572
能在这道题上拿到好成绩

261
00:08:34,572 --> 00:08:36,712
历史最高分是Fibo5创下的

262
00:08:36,712 --> 00:08:37,452
4分

263
00:08:37,452 --> 00:08:38,612
让我们直接运行测试

264
00:08:38,612 --> 00:08:39,672
但你感谢

265
00:08:39,672 --> 00:08:41,572
Lip6 V4 Flav竟然拿到了6分

266
00:08:41,572 --> 00:08:43,212
创下这道题历史记录

267
00:08:43,212 --> 00:08:44,772
手表完整呈现出来

268
00:08:47,192 --> 00:08:48,272
指针转动平滑

269
00:08:48,272 --> 00:08:49,552
只能实时同步时间

270
00:08:49,552 --> 00:08:51,352
双时区设置也基本正常

271
00:08:51,352 --> 00:08:52,172
虽然还不完美

272
00:08:52,172 --> 00:08:54,152
所以没能拿到更高的分数

273
00:08:54,152 --> 00:08:56,112
但这个小模型刚刚击败了

274
00:08:56,112 --> 00:08:57,092
Cloud 3.5 Opus

275
00:08:57,092 --> 00:08:59,272
以及我测试集最难题目上的

276
00:08:59,272 --> 00:09:00,332
其他所有前沿模型

277
00:09:00,332 --> 00:09:02,092
这完全出乎我的意料

278
00:09:02,092 --> 00:09:03,892
来看一下最终的图表

279
00:09:03,892 --> 00:09:05,932
Deep Seek V4 Flash 0731

280
00:09:05,932 --> 00:09:07,912
最终拿到了58分

281
00:09:07,912 --> 00:09:10,052
得分率为72.5%

282
00:09:10,052 --> 00:09:10,712
这让它排在

283
00:09:10,712 --> 00:09:15,272
略高于GPT4O513的71.25%

284
00:09:15,272 --> 00:09:18,852
稍低于Gemini 1.5 Pro的75%

285
00:09:18,852 --> 00:09:19,752
而在它之上

286
00:09:19,752 --> 00:09:21,172
有Kinning和

287
00:09:21,172 --> 00:09:23,352
Opas并列77.5%

288
00:09:23,352 --> 00:09:25,192
GTT 450808达80%

289
00:09:25,192 --> 00:09:25,832
接着是Quain

290
00:09:25,832 --> 00:09:29,152
Quain 2.5 Max拿下81.25%

291
00:09:29,152 --> 00:09:32,032
而Cloud 3.5仍以82.5%稳居榜首

292
00:09:32,032 --> 00:09:33,572
而对比以下背景

293
00:09:33,572 --> 00:09:35,092
你就能明白这有多惊人

294
00:09:35,092 --> 00:09:37,732
我之前测试Deep Seek V4 Pro预览版时

295
00:09:37,732 --> 00:09:40,532
它在此测试中仅得了24.8%

296
00:09:40,532 --> 00:09:44,092
新的Flash模型得分达到了72.5%

297
00:09:44,092 --> 00:09:45,892
这意味着该系列的小模型现在

298
00:09:45,892 --> 00:09:48,472
比大模型预览版的表现提升了近三倍

299
00:09:48,472 --> 00:09:49,872
在我的测试中

300
00:09:49,872 --> 00:09:52,572
而且在架构和尺寸与预览版相同

301
00:09:52,572 --> 00:09:54,892
单靠后训练就能取得惊人提升

302
00:09:54,892 --> 00:09:55,472
不可思议

303
00:09:55,472 --> 00:09:59,052
这也印证了Deep Seed所宣称的Agent能力升级

304
00:09:59,052 --> 00:10:01,932
从得分规律中也可以清楚地看到

305
00:10:01,932 --> 00:10:03,712
所有射击推理

306
00:10:03,712 --> 00:10:06,892
或长城Agent任务基本上都拿到了满分

307
00:10:06,892 --> 00:10:09,292
比如数学和微调任务

308
00:10:09,292 --> 00:10:11,532
还有创纪录的时钟生成常识

309
00:10:11,532 --> 00:10:14,112
但像熊猫SVG这种纯视觉打磨的任务

310
00:10:14,112 --> 00:10:15,252
还有电梯动画

311
00:10:15,252 --> 00:10:16,892
在这些方面它的表现依然平平

312
00:10:16,892 --> 00:10:18,592
所以这确实很像是一个

313
00:10:18,592 --> 00:10:20,372
针对智能体编程深度微调的模型

314
00:10:20,372 --> 00:10:22,292
正如官方基准测试所示

315
00:10:22,292 --> 00:10:23,292
那么结论是什么

316
00:10:23,292 --> 00:10:25,532
这绝对是目前性价比最高的模型之一

317
00:10:25,532 --> 00:10:26,772
可用于智能体编程

318
00:10:26,772 --> 00:10:27,792
在我的测试中

319
00:10:27,792 --> 00:10:29,692
它的表现已经达到了Gemini 1.5 Pro的水平

320
00:10:29,692 --> 00:10:32,012
它可以直接接入Cursor等代码工具

321
00:10:32,012 --> 00:10:33,392
这得益于其API知识

322
00:10:33,392 --> 00:10:34,972
而且Ditsig的价格

323
00:10:34,972 --> 00:10:36,312
一直都非常便宜

324
00:10:36,312 --> 00:10:37,112
如果你是学生

325
00:10:37,112 --> 00:10:39,092
或者对于预算有限的开发者

326
00:10:39,092 --> 00:10:40,412
这绝对是个极佳的选择

327
00:10:40,412 --> 00:10:42,612
他显然还无法击败Cloud 3.5

328
00:10:42,612 --> 00:10:44,572
或是在综合表现上超越OPUS

329
00:10:44,572 --> 00:10:46,672
而且他的视觉能力依然表现平平

330
00:10:46,672 --> 00:10:48,252
但考虑到他的体量和价格

331
00:10:48,252 --> 00:10:49,292
这已经足够经验了

332
00:10:49,292 --> 00:10:50,032
而且别忘了

333
00:10:50,032 --> 00:10:51,672
这还仅仅是Flash版本

334
00:10:51,672 --> 00:10:53,412
官方的DeepSick V4 Pro也即将发布

335
00:10:53,412 --> 00:10:54,652
据官方介绍

336
00:10:54,652 --> 00:10:56,492
如果将同样的智能体后训练应用

337
00:10:56,492 --> 00:10:58,452
到1.6万亿参数的模型上

338
00:10:58,452 --> 00:11:00,452
那对市面上昂贵的B元模型来说

339
00:11:00,452 --> 00:11:01,812
将是降维打击般的存在

340
00:11:01,812 --> 00:11:03,932
我会在上线后第一时间进行测试

341
00:11:03,932 --> 00:11:04,592
尽情关注

342
00:11:04,592 --> 00:11:05,692
总的来说

343
00:11:05,692 --> 00:11:06,432
这非常酷
