1
00:00:00,000 --> 00:00:07,400
好,那么Deepseek v4的模型实际上是在4月份首次亮相。当时它其实是叫preview,预览版。

2
00:00:07,400 --> 00:00:11,600
当然对于Deepseek这个模型来说,国内开发者应该是用的非常多了。

3
00:00:11,600 --> 00:00:16,200
这个模型不仅性能非常不错,而且关键价格很便宜,还可以本地部署。

4
00:00:16,200 --> 00:00:24,600
关键是Deepseek在过去的这么一年的时间迭代的过程当中,从V1开始,其实始终都是给人一种走技术黑科技的感觉。

5
00:00:24,600 --> 00:00:29,600
对不对,不仅运行速度很快,前段时间还发了Dspark这样一篇论文,对不对。

6
00:00:29,600 --> 00:00:31,520
在不改任何价格的这个情况下

7
00:00:31,520 --> 00:00:32,120
然后呢

8
00:00:32,120 --> 00:00:34,780
这个整个的推理速度提升了80%

9
00:00:34,780 --> 00:00:35,540
然后呢

10
00:00:35,540 --> 00:00:36,120
同时啊

11
00:00:36,120 --> 00:00:37,840
这个并且啊

12
00:00:37,840 --> 00:00:39,420
它还可以支持各式各样的

13
00:00:39,420 --> 00:00:41,200
现在有各式各样的这个本地部署

14
00:00:41,200 --> 00:00:43,960
也支持适配国内的各式各样GPU这样的型号啊

15
00:00:43,960 --> 00:00:44,200
所以呢

16
00:00:44,200 --> 00:00:45,960
DeepSeek这个模型应该是

17
00:00:45,960 --> 00:00:48,160
国内所有开源模型的这个来看

18
00:00:48,160 --> 00:00:49,540
普及深度非常非常广啊

19
00:00:49,540 --> 00:00:50,380
这样的一块模型啊

20
00:00:50,380 --> 00:00:51,580
那么今年4月份啊

21
00:00:51,580 --> 00:00:52,740
V4版本正式上线

22
00:00:52,740 --> 00:00:54,100
我们V4版本的上线实际上

23
00:00:54,100 --> 00:00:56,460
是对整个的DeepSeek这个模型的这个性能呢

24
00:00:56,460 --> 00:00:58,780
是往前提了很大一步啊

25
00:00:58,780 --> 00:01:00,780
在当时其实是性能非常不错的

26
00:01:00,780 --> 00:01:02,080
这样的一款模型

27
00:01:02,080 --> 00:01:02,940
然后时隔三个月

28
00:01:02,940 --> 00:01:05,620
Deepseek v4的正式版模型是正式上线的

29
00:01:05,620 --> 00:01:07,840
当然正式版模型上线之后

30
00:01:07,840 --> 00:01:10,480
网上也是铺天盖地的测评

31
00:01:10,480 --> 00:01:12,700
性能方面评价等等

32
00:01:12,700 --> 00:01:14,760
那么Deepseek v4正式版模型

33
00:01:14,760 --> 00:01:18,920
相比于此前的4月份发布的预览版的模型来说

34
00:01:18,920 --> 00:01:21,720
其实它整个的架构是没有发生任何变化的

35
00:01:21,720 --> 00:01:23,680
那么它首先在7月31号的时候

36
00:01:23,680 --> 00:01:26,540
是先上线了v4的Flash版本

37
00:01:26,540 --> 00:01:28,680
那么整个Deepseek v4其实有两款模型

38
00:01:28,680 --> 00:01:32,720
一个是Flash 一个是Pro 就是一个大杯一个小杯

39
00:01:32,720 --> 00:01:35,840
然后Flash模型实际上是小杯这个模型

40
00:01:35,840 --> 00:01:41,240
然后Flash的模型它原始的V4版本就是284B的参数

41
00:01:41,240 --> 00:01:44,180
然后是3B的每次推理几乎的参数量

42
00:01:44,180 --> 00:01:49,680
现在正式版也是这么一个模型的尺寸和核心的底层的功能

43
00:01:49,680 --> 00:01:50,760
其实都是没有发生变化的

44
00:01:50,760 --> 00:01:55,100
那么它实际上最后整个的正式版下面预览版来说

45
00:01:55,100 --> 00:01:57,860
其实只是在模型后训练的环节

46
00:01:57,860 --> 00:01:59,960
加入了很多的

47
00:01:59,960 --> 00:02:01,580
现在暂时还不为人知的

48
00:02:01,580 --> 00:02:02,760
一些训练的方法

49
00:02:02,760 --> 00:02:03,460
当然之后

50
00:02:03,460 --> 00:02:04,700
这个V4 Pro这个模型

51
00:02:04,700 --> 00:02:07,140
出来之后应该会有相关的技术手册

52
00:02:07,140 --> 00:02:08,140
到时候大家就能看到

53
00:02:08,140 --> 00:02:09,340
他是怎么做着后训练的

54
00:02:09,340 --> 00:02:11,560
但是基于后训练的过程

55
00:02:11,560 --> 00:02:13,480
基本上我们说V4 Flash这个模型

56
00:02:13,480 --> 00:02:15,240
相比于原版的Flash模型

57
00:02:15,240 --> 00:02:17,080
其实性能是提升将近30%

58
00:02:17,080 --> 00:02:18,880
下面其实有非常完整的

59
00:02:18,880 --> 00:02:20,880
官方给出的性能评测的报告

60
00:02:20,880 --> 00:02:21,700
大家可以看一看

61
00:02:21,700 --> 00:02:23,240
各式各样的测评结果

62
00:02:23,240 --> 00:02:25,060
那么官方给出的V4 Flash

63
00:02:25,060 --> 00:02:25,800
正式版本

64
00:02:25,800 --> 00:02:27,260
实际上是对比较G2 5.2的

65
00:02:27,260 --> 00:02:31,760
那GM5.2实际上在年初的时候也算是国内旗舰的开源大模型了

66
00:02:31,760 --> 00:02:37,500
大家能看到现在整个的国内的开源大模型的发展和迭代的速度实际上是非常快的

67
00:02:37,500 --> 00:02:42,620
那么整个的Deepseek V4 Flash在Terminal Bench命运行的测评

68
00:02:42,620 --> 00:02:46,780
还有像下面大家比较熟悉的像DeepSWE对不对

69
00:02:46,780 --> 00:02:48,580
一些前端的一些评测的框架

70
00:02:48,580 --> 00:02:50,480
还有Agent Last Exam

71
00:02:50,480 --> 00:02:54,320
现在已经不是人类最终考试了

72
00:02:54,320 --> 00:02:55,740
是Agent的最终考试对不对

73
00:02:55,740 --> 00:02:57,040
评到多少多少分等等

74
00:02:57,040 --> 00:03:01,560
然后你会发现其实整体的评分相比于这样5.2来说

75
00:03:01,560 --> 00:03:02,620
基本上是全面领先

76
00:03:02,620 --> 00:03:05,680
然后相比于Op4.8来说有一些小小的差距

77
00:03:05,680 --> 00:03:09,160
但是实际上在很多我们平时用的比较多的一些关键指标上

78
00:03:09,160 --> 00:03:11,860
比如说一些前端的一些开发或者是前命令行

79
00:03:11,860 --> 00:03:12,180
对不对

80
00:03:12,180 --> 00:03:14,300
它现在都是通过运行这些agent

81
00:03:14,300 --> 00:03:17,560
而驱动这些agent运行非常关键的一个模型的性能指标

82
00:03:17,560 --> 00:03:18,400
就是它的命令行

83
00:03:18,400 --> 00:03:20,820
通过命令行去便写各式各样的命令

84
00:03:20,820 --> 00:03:22,080
去操纵本机电脑等等

85
00:03:22,080 --> 00:03:23,940
我们在这些指标上其实你会发现

86
00:03:23,940 --> 00:03:27,300
Deepseek v4 flash和OPUS 4.8基本上是非常类似的

87
00:03:27,300 --> 00:03:30,200
这也是使得现在官方可以说

88
00:03:30,200 --> 00:03:33,180
整个的v4正式版的模型

89
00:03:33,180 --> 00:03:34,980
它的agent性能是大幅增强

90
00:03:34,980 --> 00:03:36,680
那么这个其实是我们能看到的

91
00:03:36,680 --> 00:03:39,220
现在整个的模型的基本情况

92
00:03:39,220 --> 00:03:43,680
然后除了它整体的所谓的agent性能大幅增强之外

93
00:03:43,680 --> 00:03:46,380
其实它现在还全面的拥抱了Responses API

94
00:03:46,380 --> 00:03:47,780
然后可以无缝接入Codex

95
00:03:47,780 --> 00:03:49,380
这个其实对于国内开发者来说

96
00:03:49,380 --> 00:03:51,560
应该是非常巨大的影响

97
00:03:51,560 --> 00:03:54,300
当然在此之前

98
00:03:54,300 --> 00:03:58,100
其实DeepSeek模型和很多其他的一些模型

99
00:03:58,100 --> 00:04:00,360
通过比如说像CCSWITCH这样的工具

100
00:04:00,360 --> 00:04:01,760
也是可以接入Codex

101
00:04:01,760 --> 00:04:04,340
只不过当时官方的模型

102
00:04:04,340 --> 00:04:05,560
它本身的响应格式

103
00:04:05,560 --> 00:04:08,260
其实和Codex并不是完全兼容

104
00:04:08,260 --> 00:04:10,460
所以它中间需要有个转换的环节

105
00:04:10,460 --> 00:04:11,740
既然有转换的环节的话

106
00:04:11,740 --> 00:04:15,940
那么距离真实的大规模深度的工程化的应用

107
00:04:15,940 --> 00:04:17,020
其实就还有距离

108
00:04:17,020 --> 00:04:21,160
现在它其实已经在新版本的训练过程当中

109
00:04:21,160 --> 00:04:24,460
它的输出格式是完全兼容Codex的响应格式的

110
00:04:24,460 --> 00:04:27,180
所以使得整个V4的正式版模型

111
00:04:27,180 --> 00:04:29,520
是可以接入到Codex里边去的

112
00:04:29,520 --> 00:04:30,860
这点其实对于开发者来说

113
00:04:30,860 --> 00:04:32,900
可以说是非常巨大的影响

114
00:04:32,900 --> 00:04:34,020
因为之前

115
00:04:34,020 --> 00:04:36,460
现在我们进行Agent的开发

116
00:04:36,460 --> 00:04:38,160
或者是进行AI编程的时候

117
00:04:38,160 --> 00:04:40,500
在写程序做各式各样项目

118
00:04:40,500 --> 00:04:40,900
少不了

119
00:04:40,900 --> 00:04:43,120
你需要有一个编程的框架

120
00:04:43,120 --> 00:04:45,400
需要有一个Harness的Agent

121
00:04:45,400 --> 00:04:45,800
对不对

122
00:04:45,800 --> 00:04:47,280
那对于DeepSeek的用户来说

123
00:04:47,280 --> 00:04:48,840
其实就少了这么一块

124
00:04:48,840 --> 00:04:53,060
尽管今天上面有一个叫DeepseekTY的这样的一个项目

125
00:04:53,060 --> 00:04:54,860
当然这个项目后面改名了叫Resenix

126
00:04:54,860 --> 00:04:59,120
然后最后还被Deepseek属于一个半收编的这样的状态

127
00:04:59,120 --> 00:05:02,060
但是Deepseek确实它没有官方的这样的Harness Agent

128
00:05:02,060 --> 00:05:04,100
所以你要使用Deepseek这个模型

129
00:05:04,100 --> 00:05:07,040
你得去用别人家的Agent开发工具

130
00:05:07,040 --> 00:05:10,940
现在Deepseek全面拥抱Responsees API和Codex之后

131
00:05:10,940 --> 00:05:14,880
你就可以无缝的使用Codex来去使用Deepseek来进行开发

132
00:05:14,880 --> 00:05:17,800
当然我们今天最后的案例实际上也是使用Codex

133
00:05:17,800 --> 00:05:20,900
用Deepseek模型来进行的开发

134
00:05:20,900 --> 00:05:22,740
也是走这样的一个完整的链路

135
00:05:22,740 --> 00:05:24,860
当然Codex和Responsees API

136
00:05:24,860 --> 00:05:25,740
它们什么关系

137
00:05:25,740 --> 00:05:29,020
为什么它要兼容Responsees API

138
00:05:29,020 --> 00:05:30,780
然后同时可以介入Codex

139
00:05:30,780 --> 00:05:33,220
这里其实有一个大家需要知道的

140
00:05:33,220 --> 00:05:34,720
是Responsees API

141
00:05:34,720 --> 00:05:37,600
实际上是去年3月11号

142
00:05:37,600 --> 00:05:40,740
然后OpenAI他们发布的一个新的

143
00:05:40,740 --> 00:05:42,420
一个Agent定义的

144
00:05:42,420 --> 00:05:44,120
Agent通信的一种范式

145
00:05:44,120 --> 00:05:45,960
或者你可以把它理解成是

146
00:05:45,960 --> 00:05:48,320
OpenAI他们发布的自己家的LongChain

147
00:05:48,320 --> 00:05:49,440
你可以这么来经理解

148
00:05:49,440 --> 00:05:51,520
LongChain Agent开发框架

149
00:05:51,520 --> 00:05:53,280
或者是一个Agent Loop

150
00:05:53,280 --> 00:05:53,820
对不对

151
00:05:53,820 --> 00:05:56,660
把这个模型把提日词把工具绑在一块

152
00:05:56,660 --> 00:05:58,360
他们就可以组合成一个Agent

153
00:05:58,360 --> 00:05:59,280
是这么一回事

154
00:05:59,280 --> 00:06:01,100
所谓的Response API

155
00:06:01,100 --> 00:06:03,660
其实是OpenAI他们家出的一套

156
00:06:03,660 --> 00:06:06,540
就类似于像LongChain这样的一个开发框架

157
00:06:06,540 --> 00:06:09,260
或者说它这种大模型的通信范式

158
00:06:09,260 --> 00:06:10,880
那么借助Response API

159
00:06:10,880 --> 00:06:13,500
实际上我们可以非常快速搭建起一些Agent Loop

160
00:06:13,500 --> 00:06:17,580
那实际上Codex背后的通信格式实际上就是这个Response API

161
00:06:17,580 --> 00:06:20,960
所以呢现在啊你说我们说DeepseekV4这个模型

162
00:06:20,960 --> 00:06:23,120
它能够无缝接入Codex里边去啊

163
00:06:23,120 --> 00:06:25,580
非常核心的原因是因为它底层的通信格式呢

164
00:06:25,580 --> 00:06:27,940
是全面兼容啊这个Response API的

165
00:06:27,940 --> 00:06:30,740
当然这个Response API具体是什么

166
00:06:30,740 --> 00:06:32,680
它是怎么兼容的啊

167
00:06:32,680 --> 00:06:33,760
如何来进行运行啊

168
00:06:33,760 --> 00:06:36,060
这个呢我们一会在公开课的这个进行过程当中

169
00:06:36,060 --> 00:06:38,040
我们会来进行详细的这个解释啊

170
00:06:38,040 --> 00:06:39,720
但是这里首先大需要知道的是呢

171
00:06:39,720 --> 00:06:42,760
对于Code对于DeepseekV4的正式版模型来说啊

172
00:06:42,760 --> 00:06:47,120
他呢实际上是已经确定了是全面兼容这个Response API的啊

173
00:06:47,120 --> 00:06:48,400
也是因为这样的原因呢

174
00:06:48,400 --> 00:06:50,440
所以他现在呢能够无缝接入Codex

175
00:06:50,700 --> 00:06:54,020
那这样的一套开发的规则其实对于现在开发者来说啊

176
00:06:54,020 --> 00:06:57,420
还是非常重要的一个这个需要掌握的一个地方啊

177
00:06:57,420 --> 00:07:00,360
其实也是因为对于Deepseek的用户来说啊

178
00:07:00,360 --> 00:07:03,860
未来他虽然自家也会出Harness Agent啊

179
00:07:03,860 --> 00:07:07,300
这个叫Deepseek的这个Harness Agent现在名字还没定啊

180
00:07:07,300 --> 00:07:09,760
但他们今天发了一个这个内测的这个邀请啊

181
00:07:09,760 --> 00:07:11,500
已经开始进行测试了啊

182
00:07:11,500 --> 00:07:13,040
应该8月份很快就会上线

183
00:07:13,300 --> 00:07:15,860
但是呢 现在啊 对于v4这个模型来说

184
00:07:15,860 --> 00:07:18,920
那他已经是能够全面兼容这个responses api了

185
00:07:18,920 --> 00:07:23,020
所以哪怕啊 这个deep seek他们未来推出了自己的cloud code啊

186
00:07:23,020 --> 00:07:25,320
推出自己的这个harness agent

187
00:07:25,320 --> 00:07:29,160
那么他呢 其实底层也是兼容这个responses api的啊

188
00:07:29,160 --> 00:07:30,440
是怎么样的这个情况啊

189
00:07:30,440 --> 00:07:33,000
所以呢 现在啊 我们在进行开发的这个时候呢

190
00:07:33,000 --> 00:07:36,340
哎 如果你是之前是使用着codex来进行开发的话

191
00:07:36,340 --> 00:07:40,180
那现在确实是可以无缝迁移到deep seek的这个模型啊 来进行开发了

192
00:07:40,180 --> 00:07:42,160
当然也有同学说关于这个deep seek

193
00:07:42,160 --> 00:07:44,680
为什么不迁移到这cloud code里面去

194
00:07:44,680 --> 00:07:45,060
对不对

195
00:07:45,060 --> 00:07:47,160
这cloud code就主要是这个

196
00:07:47,160 --> 00:07:47,920
怎么说呢

197
00:07:47,920 --> 00:07:49,660
生态相对来说还是比较封闭

198
00:07:49,660 --> 00:07:50,940
这个用呢是能用

199
00:07:50,940 --> 00:07:51,960
但是不太稳定

200
00:07:51,960 --> 00:07:53,720
那么对于V4这个模型来说

201
00:07:53,720 --> 00:07:54,780
其实我相信过去段时间

202
00:07:54,780 --> 00:07:56,140
大家应该已经看到了很多

203
00:07:56,140 --> 00:07:57,120
各式各样的

204
00:07:57,120 --> 00:07:59,140
关于V4这个模型的这个评测

205
00:07:59,140 --> 00:07:59,740
对不对

206
00:07:59,740 --> 00:08:03,540
这个这姑骑自行车

207
00:08:03,540 --> 00:08:04,640
这个鸭子骑自行车

208
00:08:04,640 --> 00:08:08,520
这其实是看它逻辑推理能力

209
00:08:08,520 --> 00:08:11,960
和SVG的代码理解能力的这样的一个测试

210
00:08:11,960 --> 00:08:14,300
还有就比如说大家现在看到的

211
00:08:14,300 --> 00:08:18,640
Dipzig V4 Flash和GPT5.6的LUNA地球模型

212
00:08:18,640 --> 00:08:21,680
中号模型来进行性能的测试对比

213
00:08:21,680 --> 00:08:26,340
其实基本上V4 Flash和GPT5.6的LUNA模型是差别不大的

214
00:08:26,340 --> 00:08:29,060
他们二者其实属于同一个档次和梯队

215
00:08:29,060 --> 00:08:31,040
当然这个价格上其实要便宜很多

216
00:08:31,040 --> 00:08:34,820
然后还有就比如说什么探索细胞结构

217
00:08:34,820 --> 00:08:35,600
对不对

218
00:08:36,095 --> 00:08:42,695
然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。

219
00:08:42,695 --> 00:08:50,395
其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。

220
00:08:50,395 --> 00:08:52,575
但实际上Pro这个模型应该很快会上

221
00:08:52,575 --> 00:08:54,075
然后对于Pro这个模型来说

222
00:08:54,075 --> 00:08:58,475
如果按照像Flash进步30%性能来看的话

223
00:08:58,475 --> 00:09:02,635
那么基本上我们说Deptic V4的Pro这个模型的性能

224
00:09:02,635 --> 00:09:04,775
肯定是要超越GPT5.6的

225
00:09:04,775 --> 00:09:06,235
也是超越OPPO4.8的

226
00:09:06,235 --> 00:09:09,375
这个应该是要比KMIK3这个模型是要更强的

227
00:09:09,375 --> 00:09:11,115
所以大家也非常期待

228
00:09:11,115 --> 00:09:11,455
对不对

229
00:09:11,455 --> 00:09:12,755
这个Pro模型最终创新

230
00:09:12,755 --> 00:09:18,135
当然我们今天来讲Flash模型完整的使用的方法和流程

231
00:09:18,135 --> 00:09:20,175
相关的这些代码呀

232
00:09:20,175 --> 00:09:22,215
开发流程的开发范式啊

233
00:09:22,215 --> 00:09:24,735
包括你对Responsees API的这个理解呀

234
00:09:24,735 --> 00:09:26,375
是可以全部迁移到啊

235
00:09:26,375 --> 00:09:28,215
这个V4 Pro这个模型当中去的啊

236
00:09:28,215 --> 00:09:29,215
尽管他现在还没发布啊

237
00:09:29,215 --> 00:09:29,595
但是呢

238
00:09:29,595 --> 00:09:31,775
他们底层其实是完全一样的啊

239
00:09:31,775 --> 00:09:32,835
这个其实没有任何问题啊

240
00:09:32,835 --> 00:09:34,315
当然其实这里还有一个啊

241
00:09:34,315 --> 00:09:35,855
可能同学们会非常感兴趣的地方

242
00:09:35,855 --> 00:09:38,615
在于说像V4 Flash这个模型的话啊

243
00:09:38,615 --> 00:09:40,855
他如果是要本地来进行部署的话

244
00:09:40,855 --> 00:09:42,195
他有什么样的这个啊

245
00:09:42,195 --> 00:09:43,595
什么样的这个硬件条件啊

246
00:09:43,595 --> 00:09:44,495
一般来说啊

247
00:09:44,495 --> 00:09:46,835
我们说这个呃单卡啊

248
00:09:46,835 --> 00:09:53,175
单节点8卡A100的服务器实际上是肯定是可以稳定的去运行V4 Flash这个模型的

249
00:09:53,175 --> 00:09:57,455
那么最小它的量化大概是Q2量化的情况下

250
00:09:57,455 --> 00:10:00,455
它所需要占用的显存实际上是96G

251
00:10:00,455 --> 00:10:05,775
所以如果假设你是一个比如说128G的Mac Studio统一内存

252
00:10:05,775 --> 00:10:11,155
那么也是可以运行Q2量化下的DeepSig V4 Flash这样的模型

253
00:10:11,155 --> 00:10:13,395
这个其实是一个性价比非常高的选择

254
00:10:13,395 --> 00:10:15,155
或者如果你是比如英伟达

255
00:10:15,155 --> 00:10:17,815
Dspark那样的一个服务器的话

256
00:10:17,815 --> 00:10:20,415
那么其实有128G的统一内存

257
00:10:20,415 --> 00:10:23,015
也是可以运行QR量化下的

258
00:10:23,015 --> 00:10:25,275
Dipsick V4 Flash这个模型

259
00:10:25,275 --> 00:10:28,675
这个是它的一个基本本地部署的一个硬件门槛

260
00:10:28,675 --> 00:10:31,215
当然咱们今天晚上来介绍的顺序

261
00:10:31,215 --> 00:10:35,395
实际上首先会来讲解关于Dipsick V4 Flash 0731

262
00:10:35,395 --> 00:10:36,615
这样的一个模型的基本情况

263
00:10:36,615 --> 00:10:38,215
这个我们刚刚已经讲到过了

264
00:10:38,215 --> 00:10:38,515
对不对

265
00:10:38,515 --> 00:10:41,755
然后接下来我们会给大家介绍关于它第一层的

266
00:10:41,755 --> 00:10:44,855
开发过程当中非常重要的

267
00:10:44,855 --> 00:10:46,615
这个Responses API

268
00:10:46,615 --> 00:10:49,295
这个接口到底应该如何来进行使用

269
00:10:49,295 --> 00:10:49,835
对吧

270
00:10:49,835 --> 00:10:50,655
然后呢

271
00:10:50,655 --> 00:10:51,695
就是这个Codex

272
00:10:51,695 --> 00:10:54,155
Codex其实很多同学之前应该非常熟悉

273
00:10:54,155 --> 00:10:55,535
这个桌面端的使用

274
00:10:55,535 --> 00:10:55,815
对不对

275
00:10:55,815 --> 00:10:57,675
这个APP的这样的使用

276
00:10:57,675 --> 00:10:59,815
那我们在实际在进行开发的过程当中

277
00:10:59,815 --> 00:11:01,455
尤其是要完成

278
00:11:01,455 --> 00:11:02,535
就被大家现在看到的

279
00:11:02,535 --> 00:11:04,435
一些比较复杂的

280
00:11:04,435 --> 00:11:07,675
这样的一些系统的开发

281
00:11:07,675 --> 00:11:09,115
比较复杂的

282
00:11:09,115 --> 00:11:10,935
这个数据分析的

283
00:11:10,935 --> 00:11:12,555
一整个系统的开发的话

284
00:11:12,555 --> 00:11:16,255
那么其实你还是需要用的CLI

285
00:11:16,255 --> 00:11:17,115
用的CLI

286
00:11:17,115 --> 00:11:18,955
用的命令行这个环境来进行开发

287
00:11:18,955 --> 00:11:21,175
其实是有很多同学特别担心

288
00:11:21,175 --> 00:11:22,535
觉得命令行特别难

289
00:11:22,535 --> 00:11:23,595
很难操作

290
00:11:23,595 --> 00:11:24,415
很难上手

291
00:11:24,415 --> 00:11:25,715
其实不至于

292
00:11:25,715 --> 00:11:28,095
我们一会带大家一步一步来看

293
00:11:28,095 --> 00:11:30,755
其实也没有那么的复杂

294
00:11:30,755 --> 00:11:32,055
它只是可能页面行

295
00:11:32,055 --> 00:11:36,135
命框长的样子有点吓人而已

296
00:11:36,135 --> 00:11:38,175
但实际上对于现在的开发者来说

297
00:11:38,175 --> 00:11:40,555
你肯定是需要掌握命令行

298
00:11:40,555 --> 00:11:44,155
我们这样的开发工具才能够更加灵活高效便捷的AE

299
00:11:44,155 --> 00:11:46,235
使用这些agent来完成这些项目的开发

300
00:11:46,235 --> 00:11:50,075
所以这个是我们今天整个课程内容的基本安排

301
00:11:50,075 --> 00:11:51,675
那么三者之间是什么样的关系

302
00:11:51,675 --> 00:11:53,035
我们稍微跟大家说一下

303
00:11:53,035 --> 00:11:55,475
首先模型这个flash这个其实没什么问题

304
00:11:55,475 --> 00:11:58,595
然后交互协议统一是使用Response API

305
00:11:58,595 --> 00:12:01,275
来进行底层的交互协议的说明

306
00:12:01,275 --> 00:12:03,035
这个稍微会有一些偏底层

307
00:12:03,035 --> 00:12:04,235
这个我们一会会说

308
00:12:04,235 --> 00:12:08,195
然后接下来使用Codex来去完成各式各样的开发工作

309
00:12:08,195 --> 00:12:13,355
那么下面其实有一些关于像deep seek v4 flash模型的发展历程

310
00:12:13,355 --> 00:12:14,075
对不对

311
00:12:14,075 --> 00:12:17,015
今年4月份发布的v4

312
00:12:17,015 --> 00:12:18,495
然后现在两个版本

313
00:12:18,495 --> 00:12:19,415
之前是preview

314
00:12:19,415 --> 00:12:22,095
现在是最新版正式版的模型

315
00:12:22,095 --> 00:12:22,815
眼镜

316
00:12:22,815 --> 00:12:23,775
性能指标

317
00:12:23,775 --> 00:12:24,775
变化等等

318
00:12:24,775 --> 00:12:25,935
然后同时

319
00:12:25,935 --> 00:12:26,755
这个权重

320
00:12:26,755 --> 00:12:29,195
v4 flash这个权重也是已经开放了的

321
00:12:29,195 --> 00:12:31,355
大家是可以直接下载来进行使用的

322
00:12:31,355 --> 00:12:34,215
然后它整个的v4 flash这个模型

323
00:12:34,215 --> 00:12:35,495
其实它的价格没有变

324
00:12:35,495 --> 00:12:38,075
只是后训练是发生了一些变化

325
00:12:38,075 --> 00:12:38,955
所谓后训练呢

326
00:12:38,955 --> 00:12:39,515
其实指的是

327
00:12:39,515 --> 00:12:40,975
他经过了前期的完整的

328
00:12:40,975 --> 00:12:41,835
这个预训练之后

329
00:12:41,835 --> 00:12:43,555
其实模型已经有了基础的

330
00:12:43,555 --> 00:12:45,815
记忆基础的这个知识边界

331
00:12:45,815 --> 00:12:47,255
然后基础的这样的能力

332
00:12:47,255 --> 00:12:48,275
然后所谓后训练呢

333
00:12:48,275 --> 00:12:49,555
实际上是训练他的

334
00:12:49,555 --> 00:12:51,415
这个响应的这个范式

335
00:12:51,415 --> 00:12:52,475
你可以这么来进行理解

336
00:12:52,475 --> 00:12:53,615
他就经过后训练

337
00:12:53,615 --> 00:12:55,755
他整个的性能就有飞跃式的

338
00:12:55,755 --> 00:12:56,295
这个增长

339
00:12:56,295 --> 00:12:58,615
他呢总共是284B的

340
00:12:58,615 --> 00:13:00,455
MOE这个模型

341
00:13:00,455 --> 00:13:02,435
这个混合专家模型

342
00:13:02,435 --> 00:13:03,135
然后呢

343
00:13:03,135 --> 00:13:04,955
他其实不会像KIMI K3那样

344
00:13:04,955 --> 00:13:05,795
那么稀疏

345
00:13:05,795 --> 00:13:06,715
但是他其实因为

346
00:13:06,715 --> 00:13:08,175
也是一个MOE这样的模型

347
00:13:08,175 --> 00:13:11,275
然后每次推理是激活13B的参数

348
00:13:11,275 --> 00:13:12,175
你可以这么来进行理解

349
00:13:12,175 --> 00:13:13,255
所谓MOE这个模型

350
00:13:13,255 --> 00:13:15,315
也就指的是它有很多的专家

351
00:13:15,315 --> 00:13:18,495
然后每次在进行每一个Token的预测的时候

352
00:13:18,495 --> 00:13:21,895
它会分给某一个特定的专家来进行运行

353
00:13:21,895 --> 00:13:23,095
然后最后输出结果

354
00:13:23,095 --> 00:13:25,735
是这么样的一个MOE的基本架构

355
00:13:25,735 --> 00:13:27,495
这个其实大家了解一下就行

356
00:13:27,495 --> 00:13:29,715
因为其实肯对我们开发人员来说

357
00:13:29,715 --> 00:13:31,155
关于它底层的怎么架构

358
00:13:31,155 --> 00:13:33,395
模型的底层的架构

359
00:13:33,395 --> 00:13:35,535
其实一般来说影响并不会特别大

360
00:13:35,535 --> 00:13:38,055
然后同时他现在推理是13个档位

361
00:13:38,055 --> 00:13:39,195
这个还比较好记

362
00:13:39,195 --> 00:13:41,175
相比于GPT的5个档位来说

363
00:13:41,175 --> 00:13:43,295
还比较容易就能够记住

364
00:13:43,295 --> 00:13:45,355
然后关于他的agent的性能

365
00:13:45,355 --> 00:13:47,455
实际上是进步的是非常明显的

366
00:13:47,455 --> 00:13:49,415
他有很多的benchmark的对比

367
00:13:49,415 --> 00:13:49,855
对不对

368
00:13:49,855 --> 00:13:50,515
大家可以看到

369
00:13:50,515 --> 00:13:53,735
基本上是相比上一代是提升了30%以上

370
00:13:53,735 --> 00:13:55,795
这个大家可以自己去看一下

371
00:13:55,795 --> 00:13:59,875
然后下面还有关于一些海外用户的反馈

372
00:13:59,875 --> 00:14:01,995
包括他的智力的提升等等

373
00:14:01,995 --> 00:14:05,175
这个就作为课外的参考

374
00:14:05,175 --> 00:14:06,455
大家可以自己去看一下

375
00:14:06,455 --> 00:14:07,855
如果想更多的了解一下

376
00:14:07,855 --> 00:14:10,355
关于DeepSeq V4 Flash这个模型的

377
00:14:10,355 --> 00:14:11,275
这个基本情况的话

378
00:14:11,275 --> 00:14:12,095
这里面可以了解一下

379
00:14:12,095 --> 00:14:12,735
然后同时呢

380
00:14:12,735 --> 00:14:14,115
对于想要本地部署同学

381
00:14:14,115 --> 00:14:15,515
下面其实这一段

382
00:14:15,515 --> 00:14:17,855
是给大家专门准备的

383
00:14:17,855 --> 00:14:19,475
就如果你是想本地部署的话

384
00:14:19,475 --> 00:14:20,255
那么这里呢

385
00:14:20,255 --> 00:14:21,115
有各式各样的

386
00:14:21,115 --> 00:14:22,075
不同类型的

387
00:14:22,075 --> 00:14:23,315
这个本地部署的

388
00:14:23,315 --> 00:14:26,315
这个它的本地部署的

389
00:14:26,315 --> 00:14:29,235
所涉及到的模型的格式

390
00:14:29,235 --> 00:14:30,595
量化的这个程度

391
00:14:30,595 --> 00:14:32,775
以及对应的下载的这个入口

392
00:14:32,775 --> 00:14:33,515
等等等等

393
00:14:33,515 --> 00:14:35,195
从Q2到Q4不等

394
00:14:35,195 --> 00:14:36,575
各式各样的不同

395
00:14:36,575 --> 00:14:38,435
他们家做的量化这个版本

396
00:14:38,435 --> 00:14:39,315
大家都可以去看一下

397
00:14:39,315 --> 00:14:42,735
然后都可以去找到对应的下载地址来进行下载

398
00:14:42,735 --> 00:14:45,895
然后同时下面还有关于各个不同量化的版本

399
00:14:45,895 --> 00:14:49,855
他们所需要的一些基本的一些硬件方面的一些说明

400
00:14:49,855 --> 00:14:52,515
这个其实纯粹就是一个参考表了

401
00:14:52,515 --> 00:14:54,595
大家自己拿到之后就可以对照着去参考
