WEBVTT

00:00:00.000 --> 00:00:07.400
好,那么Deepseek v4的模型实际上是在4月份首次亮相。当时它其实是叫preview,预览版。

00:00:07.400 --> 00:00:11.600
当然对于Deepseek这个模型来说,国内开发者应该是用的非常多了。

00:00:11.600 --> 00:00:16.200
这个模型不仅性能非常不错,而且关键价格很便宜,还可以本地部署。

00:00:16.200 --> 00:00:24.600
关键是Deepseek在过去的这么一年的时间迭代的过程当中,从V1开始,其实始终都是给人一种走技术黑科技的感觉。

00:00:24.600 --> 00:00:29.600
对不对,不仅运行速度很快,前段时间还发了Dspark这样一篇论文,对不对。

00:00:29.600 --> 00:00:31.520
在不改任何价格的这个情况下

00:00:31.520 --> 00:00:32.120
然后呢

00:00:32.120 --> 00:00:34.780
这个整个的推理速度提升了80%

00:00:34.780 --> 00:00:35.540
然后呢

00:00:35.540 --> 00:00:36.120
同时啊

00:00:36.120 --> 00:00:37.840
这个并且啊

00:00:37.840 --> 00:00:39.420
它还可以支持各式各样的

00:00:39.420 --> 00:00:41.200
现在有各式各样的这个本地部署

00:00:41.200 --> 00:00:43.960
也支持适配国内的各式各样GPU这样的型号啊

00:00:43.960 --> 00:00:44.200
所以呢

00:00:44.200 --> 00:00:45.960
DeepSeek这个模型应该是

00:00:45.960 --> 00:00:48.160
国内所有开源模型的这个来看

00:00:48.160 --> 00:00:49.540
普及深度非常非常广啊

00:00:49.540 --> 00:00:50.380
这样的一块模型啊

00:00:50.380 --> 00:00:51.580
那么今年4月份啊

00:00:51.580 --> 00:00:52.740
V4版本正式上线

00:00:52.740 --> 00:00:54.100
我们V4版本的上线实际上

00:00:54.100 --> 00:00:56.460
是对整个的DeepSeek这个模型的这个性能呢

00:00:56.460 --> 00:00:58.780
是往前提了很大一步啊

00:00:58.780 --> 00:01:00.780
在当时其实是性能非常不错的

00:01:00.780 --> 00:01:02.080
这样的一款模型

00:01:02.080 --> 00:01:02.940
然后时隔三个月

00:01:02.940 --> 00:01:05.620
Deepseek v4的正式版模型是正式上线的

00:01:05.620 --> 00:01:07.840
当然正式版模型上线之后

00:01:07.840 --> 00:01:10.480
网上也是铺天盖地的测评

00:01:10.480 --> 00:01:12.700
性能方面评价等等

00:01:12.700 --> 00:01:14.760
那么Deepseek v4正式版模型

00:01:14.760 --> 00:01:18.920
相比于此前的4月份发布的预览版的模型来说

00:01:18.920 --> 00:01:21.720
其实它整个的架构是没有发生任何变化的

00:01:21.720 --> 00:01:23.680
那么它首先在7月31号的时候

00:01:23.680 --> 00:01:26.540
是先上线了v4的Flash版本

00:01:26.540 --> 00:01:28.680
那么整个Deepseek v4其实有两款模型

00:01:28.680 --> 00:01:32.720
一个是Flash 一个是Pro 就是一个大杯一个小杯

00:01:32.720 --> 00:01:35.840
然后Flash模型实际上是小杯这个模型

00:01:35.840 --> 00:01:41.240
然后Flash的模型它原始的V4版本就是284B的参数

00:01:41.240 --> 00:01:44.180
然后是3B的每次推理几乎的参数量

00:01:44.180 --> 00:01:49.680
现在正式版也是这么一个模型的尺寸和核心的底层的功能

00:01:49.680 --> 00:01:50.760
其实都是没有发生变化的

00:01:50.760 --> 00:01:55.100
那么它实际上最后整个的正式版下面预览版来说

00:01:55.100 --> 00:01:57.860
其实只是在模型后训练的环节

00:01:57.860 --> 00:01:59.960
加入了很多的

00:01:59.960 --> 00:02:01.580
现在暂时还不为人知的

00:02:01.580 --> 00:02:02.760
一些训练的方法

00:02:02.760 --> 00:02:03.460
当然之后

00:02:03.460 --> 00:02:04.700
这个V4 Pro这个模型

00:02:04.700 --> 00:02:07.140
出来之后应该会有相关的技术手册

00:02:07.140 --> 00:02:08.140
到时候大家就能看到

00:02:08.140 --> 00:02:09.340
他是怎么做着后训练的

00:02:09.340 --> 00:02:11.560
但是基于后训练的过程

00:02:11.560 --> 00:02:13.480
基本上我们说V4 Flash这个模型

00:02:13.480 --> 00:02:15.240
相比于原版的Flash模型

00:02:15.240 --> 00:02:17.080
其实性能是提升将近30%

00:02:17.080 --> 00:02:18.880
下面其实有非常完整的

00:02:18.880 --> 00:02:20.880
官方给出的性能评测的报告

00:02:20.880 --> 00:02:21.700
大家可以看一看

00:02:21.700 --> 00:02:23.240
各式各样的测评结果

00:02:23.240 --> 00:02:25.060
那么官方给出的V4 Flash

00:02:25.060 --> 00:02:25.800
正式版本

00:02:25.800 --> 00:02:27.260
实际上是对比较G2 5.2的

00:02:27.260 --> 00:02:31.760
那GM5.2实际上在年初的时候也算是国内旗舰的开源大模型了

00:02:31.760 --> 00:02:37.500
大家能看到现在整个的国内的开源大模型的发展和迭代的速度实际上是非常快的

00:02:37.500 --> 00:02:42.620
那么整个的Deepseek V4 Flash在Terminal Bench命运行的测评

00:02:42.620 --> 00:02:46.780
还有像下面大家比较熟悉的像DeepSWE对不对

00:02:46.780 --> 00:02:48.580
一些前端的一些评测的框架

00:02:48.580 --> 00:02:50.480
还有Agent Last Exam

00:02:50.480 --> 00:02:54.320
现在已经不是人类最终考试了

00:02:54.320 --> 00:02:55.740
是Agent的最终考试对不对

00:02:55.740 --> 00:02:57.040
评到多少多少分等等

00:02:57.040 --> 00:03:01.560
然后你会发现其实整体的评分相比于这样5.2来说

00:03:01.560 --> 00:03:02.620
基本上是全面领先

00:03:02.620 --> 00:03:05.680
然后相比于Op4.8来说有一些小小的差距

00:03:05.680 --> 00:03:09.160
但是实际上在很多我们平时用的比较多的一些关键指标上

00:03:09.160 --> 00:03:11.860
比如说一些前端的一些开发或者是前命令行

00:03:11.860 --> 00:03:12.180
对不对

00:03:12.180 --> 00:03:14.300
它现在都是通过运行这些agent

00:03:14.300 --> 00:03:17.560
而驱动这些agent运行非常关键的一个模型的性能指标

00:03:17.560 --> 00:03:18.400
就是它的命令行

00:03:18.400 --> 00:03:20.820
通过命令行去便写各式各样的命令

00:03:20.820 --> 00:03:22.080
去操纵本机电脑等等

00:03:22.080 --> 00:03:23.940
我们在这些指标上其实你会发现

00:03:23.940 --> 00:03:27.300
Deepseek v4 flash和OPUS 4.8基本上是非常类似的

00:03:27.300 --> 00:03:30.200
这也是使得现在官方可以说

00:03:30.200 --> 00:03:33.180
整个的v4正式版的模型

00:03:33.180 --> 00:03:34.980
它的agent性能是大幅增强

00:03:34.980 --> 00:03:36.680
那么这个其实是我们能看到的

00:03:36.680 --> 00:03:39.220
现在整个的模型的基本情况

00:03:39.220 --> 00:03:43.680
然后除了它整体的所谓的agent性能大幅增强之外

00:03:43.680 --> 00:03:46.380
其实它现在还全面的拥抱了Responses API

00:03:46.380 --> 00:03:47.780
然后可以无缝接入Codex

00:03:47.780 --> 00:03:49.380
这个其实对于国内开发者来说

00:03:49.380 --> 00:03:51.560
应该是非常巨大的影响

00:03:51.560 --> 00:03:54.300
当然在此之前

00:03:54.300 --> 00:03:58.100
其实DeepSeek模型和很多其他的一些模型

00:03:58.100 --> 00:04:00.360
通过比如说像CCSWITCH这样的工具

00:04:00.360 --> 00:04:01.760
也是可以接入Codex

00:04:01.760 --> 00:04:04.340
只不过当时官方的模型

00:04:04.340 --> 00:04:05.560
它本身的响应格式

00:04:05.560 --> 00:04:08.260
其实和Codex并不是完全兼容

00:04:08.260 --> 00:04:10.460
所以它中间需要有个转换的环节

00:04:10.460 --> 00:04:11.740
既然有转换的环节的话

00:04:11.740 --> 00:04:15.940
那么距离真实的大规模深度的工程化的应用

00:04:15.940 --> 00:04:17.020
其实就还有距离

00:04:17.020 --> 00:04:21.160
现在它其实已经在新版本的训练过程当中

00:04:21.160 --> 00:04:24.460
它的输出格式是完全兼容Codex的响应格式的

00:04:24.460 --> 00:04:27.180
所以使得整个V4的正式版模型

00:04:27.180 --> 00:04:29.520
是可以接入到Codex里边去的

00:04:29.520 --> 00:04:30.860
这点其实对于开发者来说

00:04:30.860 --> 00:04:32.900
可以说是非常巨大的影响

00:04:32.900 --> 00:04:34.020
因为之前

00:04:34.020 --> 00:04:36.460
现在我们进行Agent的开发

00:04:36.460 --> 00:04:38.160
或者是进行AI编程的时候

00:04:38.160 --> 00:04:40.500
在写程序做各式各样项目

00:04:40.500 --> 00:04:40.900
少不了

00:04:40.900 --> 00:04:43.120
你需要有一个编程的框架

00:04:43.120 --> 00:04:45.400
需要有一个Harness的Agent

00:04:45.400 --> 00:04:45.800
对不对

00:04:45.800 --> 00:04:47.280
那对于DeepSeek的用户来说

00:04:47.280 --> 00:04:48.840
其实就少了这么一块

00:04:48.840 --> 00:04:53.060
尽管今天上面有一个叫DeepseekTY的这样的一个项目

00:04:53.060 --> 00:04:54.860
当然这个项目后面改名了叫Resenix

00:04:54.860 --> 00:04:59.120
然后最后还被Deepseek属于一个半收编的这样的状态

00:04:59.120 --> 00:05:02.060
但是Deepseek确实它没有官方的这样的Harness Agent

00:05:02.060 --> 00:05:04.100
所以你要使用Deepseek这个模型

00:05:04.100 --> 00:05:07.040
你得去用别人家的Agent开发工具

00:05:07.040 --> 00:05:10.940
现在Deepseek全面拥抱Responsees API和Codex之后

00:05:10.940 --> 00:05:14.880
你就可以无缝的使用Codex来去使用Deepseek来进行开发

00:05:14.880 --> 00:05:17.800
当然我们今天最后的案例实际上也是使用Codex

00:05:17.800 --> 00:05:20.900
用Deepseek模型来进行的开发

00:05:20.900 --> 00:05:22.740
也是走这样的一个完整的链路

00:05:22.740 --> 00:05:24.860
当然Codex和Responsees API

00:05:24.860 --> 00:05:25.740
它们什么关系

00:05:25.740 --> 00:05:29.020
为什么它要兼容Responsees API

00:05:29.020 --> 00:05:30.780
然后同时可以介入Codex

00:05:30.780 --> 00:05:33.220
这里其实有一个大家需要知道的

00:05:33.220 --> 00:05:34.720
是Responsees API

00:05:34.720 --> 00:05:37.600
实际上是去年3月11号

00:05:37.600 --> 00:05:40.740
然后OpenAI他们发布的一个新的

00:05:40.740 --> 00:05:42.420
一个Agent定义的

00:05:42.420 --> 00:05:44.120
Agent通信的一种范式

00:05:44.120 --> 00:05:45.960
或者你可以把它理解成是

00:05:45.960 --> 00:05:48.320
OpenAI他们发布的自己家的LongChain

00:05:48.320 --> 00:05:49.440
你可以这么来经理解

00:05:49.440 --> 00:05:51.520
LongChain Agent开发框架

00:05:51.520 --> 00:05:53.280
或者是一个Agent Loop

00:05:53.280 --> 00:05:53.820
对不对

00:05:53.820 --> 00:05:56.660
把这个模型把提日词把工具绑在一块

00:05:56.660 --> 00:05:58.360
他们就可以组合成一个Agent

00:05:58.360 --> 00:05:59.280
是这么一回事

00:05:59.280 --> 00:06:01.100
所谓的Response API

00:06:01.100 --> 00:06:03.660
其实是OpenAI他们家出的一套

00:06:03.660 --> 00:06:06.540
就类似于像LongChain这样的一个开发框架

00:06:06.540 --> 00:06:09.260
或者说它这种大模型的通信范式

00:06:09.260 --> 00:06:10.880
那么借助Response API

00:06:10.880 --> 00:06:13.500
实际上我们可以非常快速搭建起一些Agent Loop

00:06:13.500 --> 00:06:17.580
那实际上Codex背后的通信格式实际上就是这个Response API

00:06:17.580 --> 00:06:20.960
所以呢现在啊你说我们说DeepseekV4这个模型

00:06:20.960 --> 00:06:23.120
它能够无缝接入Codex里边去啊

00:06:23.120 --> 00:06:25.580
非常核心的原因是因为它底层的通信格式呢

00:06:25.580 --> 00:06:27.940
是全面兼容啊这个Response API的

00:06:27.940 --> 00:06:30.740
当然这个Response API具体是什么

00:06:30.740 --> 00:06:32.680
它是怎么兼容的啊

00:06:32.680 --> 00:06:33.760
如何来进行运行啊

00:06:33.760 --> 00:06:36.060
这个呢我们一会在公开课的这个进行过程当中

00:06:36.060 --> 00:06:38.040
我们会来进行详细的这个解释啊

00:06:38.040 --> 00:06:39.720
但是这里首先大需要知道的是呢

00:06:39.720 --> 00:06:42.760
对于Code对于DeepseekV4的正式版模型来说啊

00:06:42.760 --> 00:06:47.120
他呢实际上是已经确定了是全面兼容这个Response API的啊

00:06:47.120 --> 00:06:48.400
也是因为这样的原因呢

00:06:48.400 --> 00:06:50.440
所以他现在呢能够无缝接入Codex

00:06:50.700 --> 00:06:54.020
那这样的一套开发的规则其实对于现在开发者来说啊

00:06:54.020 --> 00:06:57.420
还是非常重要的一个这个需要掌握的一个地方啊

00:06:57.420 --> 00:07:00.360
其实也是因为对于Deepseek的用户来说啊

00:07:00.360 --> 00:07:03.860
未来他虽然自家也会出Harness Agent啊

00:07:03.860 --> 00:07:07.300
这个叫Deepseek的这个Harness Agent现在名字还没定啊

00:07:07.300 --> 00:07:09.760
但他们今天发了一个这个内测的这个邀请啊

00:07:09.760 --> 00:07:11.500
已经开始进行测试了啊

00:07:11.500 --> 00:07:13.040
应该8月份很快就会上线

00:07:13.300 --> 00:07:15.860
但是呢 现在啊 对于v4这个模型来说

00:07:15.860 --> 00:07:18.920
那他已经是能够全面兼容这个responses api了

00:07:18.920 --> 00:07:23.020
所以哪怕啊 这个deep seek他们未来推出了自己的cloud code啊

00:07:23.020 --> 00:07:25.320
推出自己的这个harness agent

00:07:25.320 --> 00:07:29.160
那么他呢 其实底层也是兼容这个responses api的啊

00:07:29.160 --> 00:07:30.440
是怎么样的这个情况啊

00:07:30.440 --> 00:07:33.000
所以呢 现在啊 我们在进行开发的这个时候呢

00:07:33.000 --> 00:07:36.340
哎 如果你是之前是使用着codex来进行开发的话

00:07:36.340 --> 00:07:40.180
那现在确实是可以无缝迁移到deep seek的这个模型啊 来进行开发了

00:07:40.180 --> 00:07:42.160
当然也有同学说关于这个deep seek

00:07:42.160 --> 00:07:44.680
为什么不迁移到这cloud code里面去

00:07:44.680 --> 00:07:45.060
对不对

00:07:45.060 --> 00:07:47.160
这cloud code就主要是这个

00:07:47.160 --> 00:07:47.920
怎么说呢

00:07:47.920 --> 00:07:49.660
生态相对来说还是比较封闭

00:07:49.660 --> 00:07:50.940
这个用呢是能用

00:07:50.940 --> 00:07:51.960
但是不太稳定

00:07:51.960 --> 00:07:53.720
那么对于V4这个模型来说

00:07:53.720 --> 00:07:54.780
其实我相信过去段时间

00:07:54.780 --> 00:07:56.140
大家应该已经看到了很多

00:07:56.140 --> 00:07:57.120
各式各样的

00:07:57.120 --> 00:07:59.140
关于V4这个模型的这个评测

00:07:59.140 --> 00:07:59.740
对不对

00:07:59.740 --> 00:08:03.540
这个这姑骑自行车

00:08:03.540 --> 00:08:04.640
这个鸭子骑自行车

00:08:04.640 --> 00:08:08.520
这其实是看它逻辑推理能力

00:08:08.520 --> 00:08:11.960
和SVG的代码理解能力的这样的一个测试

00:08:11.960 --> 00:08:14.300
还有就比如说大家现在看到的

00:08:14.300 --> 00:08:18.640
Dipzig V4 Flash和GPT5.6的LUNA地球模型

00:08:18.640 --> 00:08:21.680
中号模型来进行性能的测试对比

00:08:21.680 --> 00:08:26.340
其实基本上V4 Flash和GPT5.6的LUNA模型是差别不大的

00:08:26.340 --> 00:08:29.060
他们二者其实属于同一个档次和梯队

00:08:29.060 --> 00:08:31.040
当然这个价格上其实要便宜很多

00:08:31.040 --> 00:08:34.820
然后还有就比如说什么探索细胞结构

00:08:34.820 --> 00:08:35.600
对不对

00:08:36.095 --> 00:08:42.695
然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。

00:08:42.695 --> 00:08:50.395
其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。

00:08:50.395 --> 00:08:52.575
但实际上Pro这个模型应该很快会上

00:08:52.575 --> 00:08:54.075
然后对于Pro这个模型来说

00:08:54.075 --> 00:08:58.475
如果按照像Flash进步30%性能来看的话

00:08:58.475 --> 00:09:02.635
那么基本上我们说Deptic V4的Pro这个模型的性能

00:09:02.635 --> 00:09:04.775
肯定是要超越GPT5.6的

00:09:04.775 --> 00:09:06.235
也是超越OPPO4.8的

00:09:06.235 --> 00:09:09.375
这个应该是要比KMIK3这个模型是要更强的

00:09:09.375 --> 00:09:11.115
所以大家也非常期待

00:09:11.115 --> 00:09:11.455
对不对

00:09:11.455 --> 00:09:12.755
这个Pro模型最终创新

00:09:12.755 --> 00:09:18.135
当然我们今天来讲Flash模型完整的使用的方法和流程

00:09:18.135 --> 00:09:20.175
相关的这些代码呀

00:09:20.175 --> 00:09:22.215
开发流程的开发范式啊

00:09:22.215 --> 00:09:24.735
包括你对Responsees API的这个理解呀

00:09:24.735 --> 00:09:26.375
是可以全部迁移到啊

00:09:26.375 --> 00:09:28.215
这个V4 Pro这个模型当中去的啊

00:09:28.215 --> 00:09:29.215
尽管他现在还没发布啊

00:09:29.215 --> 00:09:29.595
但是呢

00:09:29.595 --> 00:09:31.775
他们底层其实是完全一样的啊

00:09:31.775 --> 00:09:32.835
这个其实没有任何问题啊

00:09:32.835 --> 00:09:34.315
当然其实这里还有一个啊

00:09:34.315 --> 00:09:35.855
可能同学们会非常感兴趣的地方

00:09:35.855 --> 00:09:38.615
在于说像V4 Flash这个模型的话啊

00:09:38.615 --> 00:09:40.855
他如果是要本地来进行部署的话

00:09:40.855 --> 00:09:42.195
他有什么样的这个啊

00:09:42.195 --> 00:09:43.595
什么样的这个硬件条件啊

00:09:43.595 --> 00:09:44.495
一般来说啊

00:09:44.495 --> 00:09:46.835
我们说这个呃单卡啊

00:09:46.835 --> 00:09:53.175
单节点8卡A100的服务器实际上是肯定是可以稳定的去运行V4 Flash这个模型的

00:09:53.175 --> 00:09:57.455
那么最小它的量化大概是Q2量化的情况下

00:09:57.455 --> 00:10:00.455
它所需要占用的显存实际上是96G

00:10:00.455 --> 00:10:05.775
所以如果假设你是一个比如说128G的Mac Studio统一内存

00:10:05.775 --> 00:10:11.155
那么也是可以运行Q2量化下的DeepSig V4 Flash这样的模型

00:10:11.155 --> 00:10:13.395
这个其实是一个性价比非常高的选择

00:10:13.395 --> 00:10:15.155
或者如果你是比如英伟达

00:10:15.155 --> 00:10:17.815
Dspark那样的一个服务器的话

00:10:17.815 --> 00:10:20.415
那么其实有128G的统一内存

00:10:20.415 --> 00:10:23.015
也是可以运行QR量化下的

00:10:23.015 --> 00:10:25.275
Dipsick V4 Flash这个模型

00:10:25.275 --> 00:10:28.675
这个是它的一个基本本地部署的一个硬件门槛

00:10:28.675 --> 00:10:31.215
当然咱们今天晚上来介绍的顺序

00:10:31.215 --> 00:10:35.395
实际上首先会来讲解关于Dipsick V4 Flash 0731

00:10:35.395 --> 00:10:36.615
这样的一个模型的基本情况

00:10:36.615 --> 00:10:38.215
这个我们刚刚已经讲到过了

00:10:38.215 --> 00:10:38.515
对不对

00:10:38.515 --> 00:10:41.755
然后接下来我们会给大家介绍关于它第一层的

00:10:41.755 --> 00:10:44.855
开发过程当中非常重要的

00:10:44.855 --> 00:10:46.615
这个Responses API

00:10:46.615 --> 00:10:49.295
这个接口到底应该如何来进行使用

00:10:49.295 --> 00:10:49.835
对吧

00:10:49.835 --> 00:10:50.655
然后呢

00:10:50.655 --> 00:10:51.695
就是这个Codex

00:10:51.695 --> 00:10:54.155
Codex其实很多同学之前应该非常熟悉

00:10:54.155 --> 00:10:55.535
这个桌面端的使用

00:10:55.535 --> 00:10:55.815
对不对

00:10:55.815 --> 00:10:57.675
这个APP的这样的使用

00:10:57.675 --> 00:10:59.815
那我们在实际在进行开发的过程当中

00:10:59.815 --> 00:11:01.455
尤其是要完成

00:11:01.455 --> 00:11:02.535
就被大家现在看到的

00:11:02.535 --> 00:11:04.435
一些比较复杂的

00:11:04.435 --> 00:11:07.675
这样的一些系统的开发

00:11:07.675 --> 00:11:09.115
比较复杂的

00:11:09.115 --> 00:11:10.935
这个数据分析的

00:11:10.935 --> 00:11:12.555
一整个系统的开发的话

00:11:12.555 --> 00:11:16.255
那么其实你还是需要用的CLI

00:11:16.255 --> 00:11:17.115
用的CLI

00:11:17.115 --> 00:11:18.955
用的命令行这个环境来进行开发

00:11:18.955 --> 00:11:21.175
其实是有很多同学特别担心

00:11:21.175 --> 00:11:22.535
觉得命令行特别难

00:11:22.535 --> 00:11:23.595
很难操作

00:11:23.595 --> 00:11:24.415
很难上手

00:11:24.415 --> 00:11:25.715
其实不至于

00:11:25.715 --> 00:11:28.095
我们一会带大家一步一步来看

00:11:28.095 --> 00:11:30.755
其实也没有那么的复杂

00:11:30.755 --> 00:11:32.055
它只是可能页面行

00:11:32.055 --> 00:11:36.135
命框长的样子有点吓人而已

00:11:36.135 --> 00:11:38.175
但实际上对于现在的开发者来说

00:11:38.175 --> 00:11:40.555
你肯定是需要掌握命令行

00:11:40.555 --> 00:11:44.155
我们这样的开发工具才能够更加灵活高效便捷的AE

00:11:44.155 --> 00:11:46.235
使用这些agent来完成这些项目的开发

00:11:46.235 --> 00:11:50.075
所以这个是我们今天整个课程内容的基本安排

00:11:50.075 --> 00:11:51.675
那么三者之间是什么样的关系

00:11:51.675 --> 00:11:53.035
我们稍微跟大家说一下

00:11:53.035 --> 00:11:55.475
首先模型这个flash这个其实没什么问题

00:11:55.475 --> 00:11:58.595
然后交互协议统一是使用Response API

00:11:58.595 --> 00:12:01.275
来进行底层的交互协议的说明

00:12:01.275 --> 00:12:03.035
这个稍微会有一些偏底层

00:12:03.035 --> 00:12:04.235
这个我们一会会说

00:12:04.235 --> 00:12:08.195
然后接下来使用Codex来去完成各式各样的开发工作

00:12:08.195 --> 00:12:13.355
那么下面其实有一些关于像deep seek v4 flash模型的发展历程

00:12:13.355 --> 00:12:14.075
对不对

00:12:14.075 --> 00:12:17.015
今年4月份发布的v4

00:12:17.015 --> 00:12:18.495
然后现在两个版本

00:12:18.495 --> 00:12:19.415
之前是preview

00:12:19.415 --> 00:12:22.095
现在是最新版正式版的模型

00:12:22.095 --> 00:12:22.815
眼镜

00:12:22.815 --> 00:12:23.775
性能指标

00:12:23.775 --> 00:12:24.775
变化等等

00:12:24.775 --> 00:12:25.935
然后同时

00:12:25.935 --> 00:12:26.755
这个权重

00:12:26.755 --> 00:12:29.195
v4 flash这个权重也是已经开放了的

00:12:29.195 --> 00:12:31.355
大家是可以直接下载来进行使用的

00:12:31.355 --> 00:12:34.215
然后它整个的v4 flash这个模型

00:12:34.215 --> 00:12:35.495
其实它的价格没有变

00:12:35.495 --> 00:12:38.075
只是后训练是发生了一些变化

00:12:38.075 --> 00:12:38.955
所谓后训练呢

00:12:38.955 --> 00:12:39.515
其实指的是

00:12:39.515 --> 00:12:40.975
他经过了前期的完整的

00:12:40.975 --> 00:12:41.835
这个预训练之后

00:12:41.835 --> 00:12:43.555
其实模型已经有了基础的

00:12:43.555 --> 00:12:45.815
记忆基础的这个知识边界

00:12:45.815 --> 00:12:47.255
然后基础的这样的能力

00:12:47.255 --> 00:12:48.275
然后所谓后训练呢

00:12:48.275 --> 00:12:49.555
实际上是训练他的

00:12:49.555 --> 00:12:51.415
这个响应的这个范式

00:12:51.415 --> 00:12:52.475
你可以这么来进行理解

00:12:52.475 --> 00:12:53.615
他就经过后训练

00:12:53.615 --> 00:12:55.755
他整个的性能就有飞跃式的

00:12:55.755 --> 00:12:56.295
这个增长

00:12:56.295 --> 00:12:58.615
他呢总共是284B的

00:12:58.615 --> 00:13:00.455
MOE这个模型

00:13:00.455 --> 00:13:02.435
这个混合专家模型

00:13:02.435 --> 00:13:03.135
然后呢

00:13:03.135 --> 00:13:04.955
他其实不会像KIMI K3那样

00:13:04.955 --> 00:13:05.795
那么稀疏

00:13:05.795 --> 00:13:06.715
但是他其实因为

00:13:06.715 --> 00:13:08.175
也是一个MOE这样的模型

00:13:08.175 --> 00:13:11.275
然后每次推理是激活13B的参数

00:13:11.275 --> 00:13:12.175
你可以这么来进行理解

00:13:12.175 --> 00:13:13.255
所谓MOE这个模型

00:13:13.255 --> 00:13:15.315
也就指的是它有很多的专家

00:13:15.315 --> 00:13:18.495
然后每次在进行每一个Token的预测的时候

00:13:18.495 --> 00:13:21.895
它会分给某一个特定的专家来进行运行

00:13:21.895 --> 00:13:23.095
然后最后输出结果

00:13:23.095 --> 00:13:25.735
是这么样的一个MOE的基本架构

00:13:25.735 --> 00:13:27.495
这个其实大家了解一下就行

00:13:27.495 --> 00:13:29.715
因为其实肯对我们开发人员来说

00:13:29.715 --> 00:13:31.155
关于它底层的怎么架构

00:13:31.155 --> 00:13:33.395
模型的底层的架构

00:13:33.395 --> 00:13:35.535
其实一般来说影响并不会特别大

00:13:35.535 --> 00:13:38.055
然后同时他现在推理是13个档位

00:13:38.055 --> 00:13:39.195
这个还比较好记

00:13:39.195 --> 00:13:41.175
相比于GPT的5个档位来说

00:13:41.175 --> 00:13:43.295
还比较容易就能够记住

00:13:43.295 --> 00:13:45.355
然后关于他的agent的性能

00:13:45.355 --> 00:13:47.455
实际上是进步的是非常明显的

00:13:47.455 --> 00:13:49.415
他有很多的benchmark的对比

00:13:49.415 --> 00:13:49.855
对不对

00:13:49.855 --> 00:13:50.515
大家可以看到

00:13:50.515 --> 00:13:53.735
基本上是相比上一代是提升了30%以上

00:13:53.735 --> 00:13:55.795
这个大家可以自己去看一下

00:13:55.795 --> 00:13:59.875
然后下面还有关于一些海外用户的反馈

00:13:59.875 --> 00:14:01.995
包括他的智力的提升等等

00:14:01.995 --> 00:14:05.175
这个就作为课外的参考

00:14:05.175 --> 00:14:06.455
大家可以自己去看一下

00:14:06.455 --> 00:14:07.855
如果想更多的了解一下

00:14:07.855 --> 00:14:10.355
关于DeepSeq V4 Flash这个模型的

00:14:10.355 --> 00:14:11.275
这个基本情况的话

00:14:11.275 --> 00:14:12.095
这里面可以了解一下

00:14:12.095 --> 00:14:12.735
然后同时呢

00:14:12.735 --> 00:14:14.115
对于想要本地部署同学

00:14:14.115 --> 00:14:15.515
下面其实这一段

00:14:15.515 --> 00:14:17.855
是给大家专门准备的

00:14:17.855 --> 00:14:19.475
就如果你是想本地部署的话

00:14:19.475 --> 00:14:20.255
那么这里呢

00:14:20.255 --> 00:14:21.115
有各式各样的

00:14:21.115 --> 00:14:22.075
不同类型的

00:14:22.075 --> 00:14:23.315
这个本地部署的

00:14:23.315 --> 00:14:26.315
这个它的本地部署的

00:14:26.315 --> 00:14:29.235
所涉及到的模型的格式

00:14:29.235 --> 00:14:30.595
量化的这个程度

00:14:30.595 --> 00:14:32.775
以及对应的下载的这个入口

00:14:32.775 --> 00:14:33.515
等等等等

00:14:33.515 --> 00:14:35.195
从Q2到Q4不等

00:14:35.195 --> 00:14:36.575
各式各样的不同

00:14:36.575 --> 00:14:38.435
他们家做的量化这个版本

00:14:38.435 --> 00:14:39.315
大家都可以去看一下

00:14:39.315 --> 00:14:42.735
然后都可以去找到对应的下载地址来进行下载

00:14:42.735 --> 00:14:45.895
然后同时下面还有关于各个不同量化的版本

00:14:45.895 --> 00:14:49.855
他们所需要的一些基本的一些硬件方面的一些说明

00:14:49.855 --> 00:14:52.515
这个其实纯粹就是一个参考表了

00:14:52.515 --> 00:14:54.595
大家自己拿到之后就可以对照着去参考
