實際影片長度:14:54.686。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:04.531
好,那么Deepseek v4的模型实际上是在4月份首次亮相。
0:04.531–0:07.400
当时它其实是叫preview,预览版。
0:07.400–0:11.600
当然对于Deepseek这个模型来说,国内开发者应该是用的非常多了。
0:11.600–0:16.200
这个模型不仅性能非常不错,而且关键价格很便宜,还可以本地部署。
0:16.200–0:24.600
关键是Deepseek在过去的这么一年的时间迭代的过程当中,从V1开始,其实始终都是给人一种走技术黑科技的感觉。
0:24.600–0:29.600
对不对,不仅运行速度很快,前段时间还发了Dspark这样一篇论文,对不对。
0:29.600–0:31.520
在不改任何价格的这个情况下
0:31.520–0:32.120
然后呢
0:32.120–0:34.780
这个整个的推理速度提升了80%
0:34.780–0:35.540
然后呢
0:35.540–0:36.120
同时啊
0:36.120–0:37.840
这个并且啊
0:37.840–0:39.420
它还可以支持各式各样的
0:39.420–0:41.200
现在有各式各样的这个本地部署
0:41.200–0:43.960
也支持适配国内的各式各样GPU这样的型号啊
0:43.960–0:44.200
所以呢
0:44.200–0:45.960
DeepSeek这个模型应该是
0:45.960–0:48.160
国内所有开源模型的这个来看
0:48.160–0:49.540
普及深度非常非常广啊
0:49.540–0:50.380
这样的一块模型啊
0:50.380–0:51.580
那么今年4月份啊
0:51.580–0:52.740
V4版本正式上线
0:52.740–0:54.100
我们V4版本的上线实际上
0:54.100–0:56.460
是对整个的DeepSeek这个模型的这个性能呢
0:56.460–0:58.780
是往前提了很大一步啊
0:58.780–1:00.780
在当时其实是性能非常不错的
1:00.780–1:02.080
这样的一款模型
1:02.080–1:02.940
然后时隔三个月
1:02.940–1:05.620
Deepseek v4的正式版模型是正式上线的
1:05.620–1:07.840
当然正式版模型上线之后
1:07.840–1:10.480
网上也是铺天盖地的测评
1:10.480–1:12.700
性能方面评价等等
1:12.700–1:14.760
那么Deepseek v4正式版模型
1:14.760–1:18.920
相比于此前的4月份发布的预览版的模型来说
1:18.920–1:21.720
其实它整个的架构是没有发生任何变化的
1:21.720–1:23.680
那么它首先在7月31号的时候
1:23.680–1:26.540
是先上线了v4的Flash版本
1:26.540–1:28.680
那么整个Deepseek v4其实有两款模型
1:28.680–1:32.720
一个是Flash 一个是Pro 就是一个大杯一个小杯
1:32.720–1:35.840
然后Flash模型实际上是小杯这个模型
1:35.840–1:41.240
然后Flash的模型它原始的V4版本就是284B的参数
1:41.240–1:44.180
然后是3B的每次推理几乎的参数量
1:44.180–1:49.680
现在正式版也是这么一个模型的尺寸和核心的底层的功能
1:49.680–1:50.760
其实都是没有发生变化的
1:50.760–1:55.100
那么它实际上最后整个的正式版下面预览版来说
1:55.100–1:57.860
其实只是在模型后训练的环节
1:57.860–1:59.960
加入了很多的
1:59.960–2:01.580
现在暂时还不为人知的
2:01.580–2:02.760
一些训练的方法
2:02.760–2:03.460
当然之后
2:03.460–2:04.700
这个V4 Pro这个模型
2:04.700–2:07.140
出来之后应该会有相关的技术手册
2:07.140–2:08.140
到时候大家就能看到
2:08.140–2:09.340
他是怎么做着后训练的
2:09.340–2:11.560
但是基于后训练的过程
2:11.560–2:13.480
基本上我们说V4 Flash这个模型
2:13.480–2:15.240
相比于原版的Flash模型
2:15.240–2:17.080
其实性能是提升将近30%
2:17.080–2:18.880
下面其实有非常完整的
2:18.880–2:20.880
官方给出的性能评测的报告
2:20.880–2:21.700
大家可以看一看
2:21.700–2:23.240
各式各样的测评结果
2:23.240–2:25.060
那么官方给出的V4 Flash
2:25.060–2:25.800
正式版本
2:25.800–2:27.260
实际上是对比较G2 5.2的
2:27.260–2:31.760
那GM5.2实际上在年初的时候也算是国内旗舰的开源大模型了
2:31.760–2:37.500
大家能看到现在整个的国内的开源大模型的发展和迭代的速度实际上是非常快的
2:37.500–2:42.620
那么整个的Deepseek V4 Flash在Terminal Bench命运行的测评
2:42.620–2:46.780
还有像下面大家比较熟悉的像DeepSWE对不对
2:46.780–2:48.580
一些前端的一些评测的框架
2:48.580–2:50.480
还有Agent Last Exam
2:50.480–2:54.320
现在已经不是人类最终考试了
2:54.320–2:55.740
是Agent的最终考试对不对
2:55.740–2:57.040
评到多少多少分等等
2:57.040–3:01.560
然后你会发现其实整体的评分相比于这样5.2来说
3:01.560–3:02.620
基本上是全面领先
3:02.620–3:05.680
然后相比于Op4.8来说有一些小小的差距
3:05.680–3:09.160
但是实际上在很多我们平时用的比较多的一些关键指标上
3:09.160–3:11.860
比如说一些前端的一些开发或者是前命令行
3:11.860–3:12.180
对不对
3:12.180–3:14.300
它现在都是通过运行这些agent
3:14.300–3:17.560
而驱动这些agent运行非常关键的一个模型的性能指标
3:17.560–3:18.400
就是它的命令行
3:18.400–3:20.820
通过命令行去便写各式各样的命令
3:20.820–3:22.080
去操纵本机电脑等等
3:22.080–3:23.940
我们在这些指标上其实你会发现
3:23.940–3:27.300
Deepseek v4 flash和OPUS 4.8基本上是非常类似的
3:27.300–3:30.200
这也是使得现在官方可以说
3:30.200–3:33.180
整个的v4正式版的模型
3:33.180–3:34.980
它的agent性能是大幅增强
3:34.980–3:36.680
那么这个其实是我们能看到的
3:36.680–3:39.220
现在整个的模型的基本情况
3:39.220–3:43.680
然后除了它整体的所谓的agent性能大幅增强之外
3:43.680–3:46.380
其实它现在还全面的拥抱了Responses API
3:46.380–3:47.780
然后可以无缝接入Codex
3:47.780–3:49.380
这个其实对于国内开发者来说
3:49.380–3:51.560
应该是非常巨大的影响
3:51.560–3:54.300
当然在此之前
3:54.300–3:58.100
其实DeepSeek模型和很多其他的一些模型
3:58.100–4:00.360
通过比如说像CCSWITCH这样的工具
4:00.360–4:01.760
也是可以接入Codex
4:01.760–4:04.340
只不过当时官方的模型
4:04.340–4:05.560
它本身的响应格式
4:05.560–4:08.260
其实和Codex并不是完全兼容
4:08.260–4:10.460
所以它中间需要有个转换的环节
4:10.460–4:11.740
既然有转换的环节的话
4:11.740–4:15.940
那么距离真实的大规模深度的工程化的应用
4:15.940–4:17.020
其实就还有距离
4:17.020–4:21.160
现在它其实已经在新版本的训练过程当中
4:21.160–4:24.460
它的输出格式是完全兼容Codex的响应格式的
4:24.460–4:27.180
所以使得整个V4的正式版模型
4:27.180–4:29.520
是可以接入到Codex里边去的
4:29.520–4:30.860
这点其实对于开发者来说
4:30.860–4:32.900
可以说是非常巨大的影响
4:32.900–4:34.020
因为之前
4:34.020–4:36.460
现在我们进行Agent的开发
4:36.460–4:38.160
或者是进行AI编程的时候
4:38.160–4:40.500
在写程序做各式各样项目
4:40.500–4:40.900
少不了
4:40.900–4:43.120
你需要有一个编程的框架
4:43.120–4:45.400
需要有一个Harness的Agent
4:45.400–4:45.800
对不对
4:45.800–4:47.280
那对于DeepSeek的用户来说
4:47.280–4:48.840
其实就少了这么一块
4:48.840–4:53.060
尽管今天上面有一个叫DeepseekTY的这样的一个项目
4:53.060–4:54.860
当然这个项目后面改名了叫Resenix
4:54.860–4:59.120
然后最后还被Deepseek属于一个半收编的这样的状态
4:59.120–5:02.060
但是Deepseek确实它没有官方的这样的Harness Agent
5:02.060–5:04.100
所以你要使用Deepseek这个模型
5:04.100–5:07.040
你得去用别人家的Agent开发工具
5:07.040–5:10.940
现在Deepseek全面拥抱Responsees API和Codex之后
5:10.940–5:14.880
你就可以无缝的使用Codex来去使用Deepseek来进行开发
5:14.880–5:17.800
当然我们今天最后的案例实际上也是使用Codex
5:17.800–5:20.900
用Deepseek模型来进行的开发
5:20.900–5:22.740
也是走这样的一个完整的链路
5:22.740–5:24.860
当然Codex和Responsees API
5:24.860–5:25.740
它们什么关系
5:25.740–5:29.020
为什么它要兼容Responsees API
5:29.020–5:30.780
然后同时可以介入Codex
5:30.780–5:33.220
这里其实有一个大家需要知道的
5:33.220–5:34.720
是Responsees API
5:34.720–5:37.600
实际上是去年3月11号
5:37.600–5:40.740
然后OpenAI他们发布的一个新的
5:40.740–5:42.420
一个Agent定义的
5:42.420–5:44.120
Agent通信的一种范式
5:44.120–5:45.960
或者你可以把它理解成是
5:45.960–5:48.320
OpenAI他们发布的自己家的LongChain
5:48.320–5:49.440
你可以这么来经理解
5:49.440–5:51.520
LongChain Agent开发框架
5:51.520–5:53.280
或者是一个Agent Loop
5:53.280–5:53.820
对不对
5:53.820–5:56.660
把这个模型把提日词把工具绑在一块
5:56.660–5:58.360
他们就可以组合成一个Agent
5:58.360–5:59.280
是这么一回事
5:59.280–6:01.100
所谓的Response API
6:01.100–6:03.660
其实是OpenAI他们家出的一套
6:03.660–6:06.540
就类似于像LongChain这样的一个开发框架
6:06.540–6:09.260
或者说它这种大模型的通信范式
6:09.260–6:10.880
那么借助Response API
6:10.880–6:13.500
实际上我们可以非常快速搭建起一些Agent Loop
6:13.500–6:17.580
那实际上Codex背后的通信格式实际上就是这个Response API
6:17.580–6:20.960
所以呢现在啊你说我们说DeepseekV4这个模型
6:20.960–6:23.120
它能够无缝接入Codex里边去啊
6:23.120–6:25.580
非常核心的原因是因为它底层的通信格式呢
6:25.580–6:27.940
是全面兼容啊这个Response API的
6:27.940–6:30.740
当然这个Response API具体是什么
6:30.740–6:32.680
它是怎么兼容的啊
6:32.680–6:33.760
如何来进行运行啊
6:33.760–6:36.060
这个呢我们一会在公开课的这个进行过程当中
6:36.060–6:38.040
我们会来进行详细的这个解释啊
6:38.040–6:39.720
但是这里首先大需要知道的是呢
6:39.720–6:42.760
对于Code对于DeepseekV4的正式版模型来说啊
6:42.760–6:47.120
他呢实际上是已经确定了是全面兼容这个Response API的啊
6:47.120–6:48.400
也是因为这样的原因呢
6:48.400–6:50.700
所以他现在呢能够无缝接入Codex
6:50.700–6:54.020
那这样的一套开发的规则其实对于现在开发者来说啊
6:54.020–6:57.420
还是非常重要的一个这个需要掌握的一个地方啊
6:57.420–7:00.360
其实也是因为对于Deepseek的用户来说啊
7:00.360–7:03.860
未来他虽然自家也会出Harness Agent啊
7:03.860–7:07.300
这个叫Deepseek的这个Harness Agent现在名字还没定啊
7:07.300–7:09.760
但他们今天发了一个这个内测的这个邀请啊
7:09.760–7:11.500
已经开始进行测试了啊
7:11.500–7:13.300
应该8月份很快就会上线
7:13.300–7:15.860
但是呢 现在啊 对于v4这个模型来说
7:15.860–7:18.920
那他已经是能够全面兼容这个responses api了
7:18.920–7:23.020
所以哪怕啊 这个deep seek他们未来推出了自己的cloud code啊
7:23.020–7:25.320
推出自己的这个harness agent
7:25.320–7:29.160
那么他呢 其实底层也是兼容这个responses api的啊
7:29.160–7:30.440
是怎么样的这个情况啊
7:30.440–7:33.000
所以呢 现在啊 我们在进行开发的这个时候呢
7:33.000–7:36.340
哎 如果你是之前是使用着codex来进行开发的话
7:36.340–7:40.180
那现在确实是可以无缝迁移到deep seek的这个模型啊 来进行开发了
7:40.180–7:42.160
当然也有同学说关于这个deep seek
7:42.160–7:44.680
为什么不迁移到这cloud code里面去
7:44.680–7:45.060
对不对
7:45.060–7:47.160
这cloud code就主要是这个
7:47.160–7:47.920
怎么说呢
7:47.920–7:49.660
生态相对来说还是比较封闭
7:49.660–7:50.940
这个用呢是能用
7:50.940–7:51.960
但是不太稳定
7:51.960–7:53.720
那么对于V4这个模型来说
7:53.720–7:54.780
其实我相信过去段时间
7:54.780–7:56.140
大家应该已经看到了很多
7:56.140–7:57.120
各式各样的
7:57.120–7:59.140
关于V4这个模型的这个评测
7:59.140–7:59.740
对不对
7:59.740–8:03.540
这个这姑骑自行车
8:03.540–8:04.640
这个鸭子骑自行车
8:04.640–8:08.520
这其实是看它逻辑推理能力
8:08.520–8:11.960
和SVG的代码理解能力的这样的一个测试
8:11.960–8:14.300
还有就比如说大家现在看到的
8:14.300–8:18.640
Dipzig V4 Flash和GPT5.6的LUNA地球模型
8:18.640–8:21.680
中号模型来进行性能的测试对比
8:21.680–8:26.340
其实基本上V4 Flash和GPT5.6的LUNA模型是差别不大的
8:26.340–8:29.060
他们二者其实属于同一个档次和梯队
8:29.060–8:31.040
当然这个价格上其实要便宜很多
8:31.040–8:34.820
然后还有就比如说什么探索细胞结构
8:34.820–8:36.095
对不对
8:36.095–8:42.695
然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。
8:42.695–8:50.395
其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。
8:50.395–8:52.575
但实际上Pro这个模型应该很快会上
8:52.575–8:54.075
然后对于Pro这个模型来说
8:54.075–8:58.475
如果按照像Flash进步30%性能来看的话
8:58.475–9:02.635
那么基本上我们说Deptic V4的Pro这个模型的性能
9:02.635–9:04.775
肯定是要超越GPT5.6的
9:04.775–9:06.235
也是超越OPPO4.8的
9:06.235–9:09.375
这个应该是要比KMIK3这个模型是要更强的
9:09.375–9:11.115
所以大家也非常期待
9:11.115–9:11.455
对不对
9:11.455–9:12.755
这个Pro模型最终创新
9:12.755–9:18.135
当然我们今天来讲Flash模型完整的使用的方法和流程
9:18.135–9:20.175
相关的这些代码呀
9:20.175–9:22.215
开发流程的开发范式啊
9:22.215–9:24.735
包括你对Responsees API的这个理解呀
9:24.735–9:26.375
是可以全部迁移到啊
9:26.375–9:28.215
这个V4 Pro这个模型当中去的啊
9:28.215–9:29.215
尽管他现在还没发布啊
9:29.215–9:29.595
但是呢
9:29.595–9:31.775
他们底层其实是完全一样的啊
9:31.775–9:32.835
这个其实没有任何问题啊
9:32.835–9:34.315
当然其实这里还有一个啊
9:34.315–9:35.855
可能同学们会非常感兴趣的地方
9:35.855–9:38.615
在于说像V4 Flash这个模型的话啊
9:38.615–9:40.855
他如果是要本地来进行部署的话
9:40.855–9:42.195
他有什么样的这个啊
9:42.195–9:43.595
什么样的这个硬件条件啊
9:43.595–9:44.495
一般来说啊
9:44.495–9:46.835
我们说这个呃单卡啊
9:46.835–9:53.175
单节点8卡A100的服务器实际上是肯定是可以稳定的去运行V4 Flash这个模型的
9:53.175–9:57.455
那么最小它的量化大概是Q2量化的情况下
9:57.455–10:00.455
它所需要占用的显存实际上是96G
10:00.455–10:05.775
所以如果假设你是一个比如说128G的Mac Studio统一内存
10:05.775–10:11.155
那么也是可以运行Q2量化下的DeepSig V4 Flash这样的模型
10:11.155–10:13.395
这个其实是一个性价比非常高的选择
10:13.395–10:15.155
或者如果你是比如英伟达
10:15.155–10:17.815
Dspark那样的一个服务器的话
10:17.815–10:20.415
那么其实有128G的统一内存
10:20.415–10:23.015
也是可以运行QR量化下的
10:23.015–10:25.275
Dipsick V4 Flash这个模型
10:25.275–10:28.675
这个是它的一个基本本地部署的一个硬件门槛
10:28.675–10:31.215
当然咱们今天晚上来介绍的顺序
10:31.215–10:35.395
实际上首先会来讲解关于Dipsick V4 Flash 0731
10:35.395–10:36.615
这样的一个模型的基本情况
10:36.615–10:38.215
这个我们刚刚已经讲到过了
10:38.215–10:38.515
对不对
10:38.515–10:41.755
然后接下来我们会给大家介绍关于它第一层的
10:41.755–10:44.855
开发过程当中非常重要的
10:44.855–10:46.615
这个Responses API
10:46.615–10:49.295
这个接口到底应该如何来进行使用
10:49.295–10:49.835
对吧
10:49.835–10:50.655
然后呢
10:50.655–10:51.695
就是这个Codex
10:51.695–10:54.155
Codex其实很多同学之前应该非常熟悉
10:54.155–10:55.535
这个桌面端的使用
10:55.535–10:55.815
对不对
10:55.815–10:57.675
这个APP的这样的使用
10:57.675–10:59.815
那我们在实际在进行开发的过程当中
10:59.815–11:01.455
尤其是要完成
11:01.455–11:02.535
就被大家现在看到的
11:02.535–11:04.435
一些比较复杂的
11:04.435–11:07.675
这样的一些系统的开发
11:07.675–11:09.115
比较复杂的
11:09.115–11:10.935
这个数据分析的
11:10.935–11:12.555
一整个系统的开发的话
11:12.555–11:16.255
那么其实你还是需要用的CLI
11:16.255–11:17.115
用的CLI
11:17.115–11:18.955
用的命令行这个环境来进行开发
11:18.955–11:21.175
其实是有很多同学特别担心
11:21.175–11:22.535
觉得命令行特别难
11:22.535–11:23.595
很难操作
11:23.595–11:24.415
很难上手
11:24.415–11:25.715
其实不至于
11:25.715–11:28.095
我们一会带大家一步一步来看
11:28.095–11:30.755
其实也没有那么的复杂
11:30.755–11:32.055
它只是可能页面行
11:32.055–11:36.135
命框长的样子有点吓人而已
11:36.135–11:38.175
但实际上对于现在的开发者来说
11:38.175–11:40.555
你肯定是需要掌握命令行
11:40.555–11:44.155
我们这样的开发工具才能够更加灵活高效便捷的AE
11:44.155–11:46.235
使用这些agent来完成这些项目的开发
11:46.235–11:50.075
所以这个是我们今天整个课程内容的基本安排
11:50.075–11:51.675
那么三者之间是什么样的关系
11:51.675–11:53.035
我们稍微跟大家说一下
11:53.035–11:55.475
首先模型这个flash这个其实没什么问题
11:55.475–11:58.595
然后交互协议统一是使用Response API
11:58.595–12:01.275
来进行底层的交互协议的说明
12:01.275–12:03.035
这个稍微会有一些偏底层
12:03.035–12:04.235
这个我们一会会说
12:04.235–12:08.195
然后接下来使用Codex来去完成各式各样的开发工作
12:08.195–12:13.355
那么下面其实有一些关于像deep seek v4 flash模型的发展历程
12:13.355–12:14.075
对不对
12:14.075–12:17.015
今年4月份发布的v4
12:17.015–12:18.495
然后现在两个版本
12:18.495–12:19.415
之前是preview
12:19.415–12:22.095
现在是最新版正式版的模型
12:22.095–12:22.815
眼镜
12:22.815–12:23.775
性能指标
12:23.775–12:24.775
变化等等
12:24.775–12:25.935
然后同时
12:25.935–12:26.755
这个权重
12:26.755–12:29.195
v4 flash这个权重也是已经开放了的
12:29.195–12:31.355
大家是可以直接下载来进行使用的
12:31.355–12:34.215
然后它整个的v4 flash这个模型
12:34.215–12:35.495
其实它的价格没有变
12:35.495–12:38.075
只是后训练是发生了一些变化
12:38.075–12:38.955
所谓后训练呢
12:38.955–12:39.515
其实指的是
12:39.515–12:40.975
他经过了前期的完整的
12:40.975–12:41.835
这个预训练之后
12:41.835–12:43.555
其实模型已经有了基础的
12:43.555–12:45.815
记忆基础的这个知识边界
12:45.815–12:47.255
然后基础的这样的能力
12:47.255–12:48.275
然后所谓后训练呢
12:48.275–12:49.555
实际上是训练他的
12:49.555–12:51.415
这个响应的这个范式
12:51.415–12:52.475
你可以这么来进行理解
12:52.475–12:53.615
他就经过后训练
12:53.615–12:55.755
他整个的性能就有飞跃式的
12:55.755–12:56.295
这个增长
12:56.295–12:58.615
他呢总共是284B的
12:58.615–13:00.455
MOE这个模型
13:00.455–13:02.435
这个混合专家模型
13:02.435–13:03.135
然后呢
13:03.135–13:04.955
他其实不会像KIMI K3那样
13:04.955–13:05.795
那么稀疏
13:05.795–13:06.715
但是他其实因为
13:06.715–13:08.175
也是一个MOE这样的模型
13:08.175–13:11.275
然后每次推理是激活13B的参数
13:11.275–13:12.175
你可以这么来进行理解
13:12.175–13:13.255
所谓MOE这个模型
13:13.255–13:15.315
也就指的是它有很多的专家
13:15.315–13:18.495
然后每次在进行每一个Token的预测的时候
13:18.495–13:21.895
它会分给某一个特定的专家来进行运行
13:21.895–13:23.095
然后最后输出结果
13:23.095–13:25.735
是这么样的一个MOE的基本架构
13:25.735–13:27.495
这个其实大家了解一下就行
13:27.495–13:29.715
因为其实肯对我们开发人员来说
13:29.715–13:31.155
关于它底层的怎么架构
13:31.155–13:33.395
模型的底层的架构
13:33.395–13:35.535
其实一般来说影响并不会特别大
13:35.535–13:38.055
然后同时他现在推理是13个档位
13:38.055–13:39.195
这个还比较好记
13:39.195–13:41.175
相比于GPT的5个档位来说
13:41.175–13:43.295
还比较容易就能够记住
13:43.295–13:45.355
然后关于他的agent的性能
13:45.355–13:47.455
实际上是进步的是非常明显的
13:47.455–13:49.415
他有很多的benchmark的对比
13:49.415–13:49.855
对不对
13:49.855–13:50.515
大家可以看到
13:50.515–13:53.735
基本上是相比上一代是提升了30%以上
13:53.735–13:55.795
这个大家可以自己去看一下
13:55.795–13:59.875
然后下面还有关于一些海外用户的反馈
13:59.875–14:01.995
包括他的智力的提升等等
14:01.995–14:05.175
这个就作为课外的参考
14:05.175–14:06.455
大家可以自己去看一下
14:06.455–14:07.855
如果想更多的了解一下
14:07.855–14:10.355
关于DeepSeq V4 Flash这个模型的
14:10.355–14:11.275
这个基本情况的话
14:11.275–14:12.095
这里面可以了解一下
14:12.095–14:12.735
然后同时呢
14:12.735–14:14.115
对于想要本地部署同学
14:14.115–14:15.515
下面其实这一段
14:15.515–14:17.855
是给大家专门准备的
14:17.855–14:19.475
就如果你是想本地部署的话
14:19.475–14:20.255
那么这里呢
14:20.255–14:21.115
有各式各样的
14:21.115–14:22.075
不同类型的
14:22.075–14:23.315
这个本地部署的
14:23.315–14:26.315
这个它的本地部署的
14:26.315–14:29.235
所涉及到的模型的格式
14:29.235–14:30.595
量化的这个程度
14:30.595–14:32.775
以及对应的下载的这个入口
14:32.775–14:33.515
等等等等
14:33.515–14:35.195
从Q2到Q4不等
14:35.195–14:36.575
各式各样的不同
14:36.575–14:38.435
他们家做的量化这个版本
14:38.435–14:39.315
大家都可以去看一下
14:39.315–14:42.735
然后都可以去找到对应的下载地址来进行下载
14:42.735–14:45.895
然后同时下面还有关于各个不同量化的版本
14:45.895–14:49.855
他们所需要的一些基本的一些硬件方面的一些说明
14:49.855–14:52.515
这个其实纯粹就是一个参考表了
14:52.515–14:54.595
大家自己拿到之后就可以对照着去参考
0:00.000–0:04.531
好的,那麼 DeepSeek V4 模型實際上是在四月首次亮相。
0:04.531–0:07.400
當時它其實叫做 Preview,也就是預覽版。
0:07.400–0:11.600
當然,對於 DeepSeek 這個模型來說,國內開發者應該已經用得非常多。
0:11.600–0:16.200
這個模型不僅性能非常出色,關鍵是價格便宜,還支援本地部署。
0:16.200–0:24.600
重點是,DeepSeek 在過去這一年多的迭代過程中,從 V1 開始,始終給人一種走技術黑科技的感覺。
0:24.600–0:29.600
對吧,不僅運行速度很快,前陣子還發表了 DSpark 這樣的論文,對吧。
0:29.600–0:31.520
在不改變任何價格的情況下
0:31.520–0:32.120
然後呢
0:32.120–0:34.780
整個推理速度提升了 80%
0:34.780–0:35.540
然後呢
0:35.540–0:36.120
同時啊
0:36.120–0:37.840
並且啊
0:37.840–0:39.420
它還支援各種各樣
0:39.420–0:41.200
現在有各種各樣的本地部署
0:41.200–0:43.960
也支援適配國內各種型號的 GPU
0:43.960–0:44.200
所以呢
0:44.200–0:45.960
DeepSeek 這個模型應該是
0:45.960–0:48.160
從國內所有開源模型來看
0:48.160–0:49.540
普及深度非常非常廣啊
0:49.540–0:50.380
這樣的一款模型啊
0:50.380–0:51.580
那麼在今年四月啊
0:51.580–0:52.740
V4 版本正式上線
0:52.740–0:54.100
我們 V4 版本的實際上線
0:54.100–0:56.460
是對整個 DeepSeek 模型的性能呢
0:56.460–0:58.780
往前邁進了一大步啊
0:58.780–1:00.780
當時其實性能非常不錯
1:00.780–1:02.080
這樣的一款模型
1:02.080–1:02.940
然後隔了三個月
1:02.940–1:05.620
DeepSeek V4 的正式版模型正式上線
1:05.620–1:07.840
當然正式版模型上線之後
1:07.840–1:10.480
網路上也是鋪天蓋地的評測
1:10.480–1:12.700
性能方面的評價等等
1:12.700–1:14.760
那麼 DeepSeek V4 正式版模型
1:14.760–1:18.920
相比於此前四月發布的預覽版模型來說
1:18.920–1:21.720
其實它整個架構並沒有發生任何變化
1:21.720–1:23.680
那麼它首先在七月三十一號的時候
1:23.680–1:26.540
是先上線了 V4 的 Flash 版本
1:26.540–1:28.680
那麼整個 DeepSeek V4 其實有兩款模型
1:28.680–1:32.720
一個是 Flash,一個是 Pro,就是大杯和小杯
1:32.720–1:35.840
然後 Flash 模型實際上是小杯這個模型
1:35.840–1:41.240
接著Flash模型原始的V4版本擁有284B的參數量
1:41.240–1:44.180
每次推理幾乎只有3B的參數量
1:44.180–1:49.680
現在正式版的模型尺寸和核心底層功能其實都沒有變化
1:49.680–1:50.760
其實都沒有發生變化
1:50.760–1:55.100
那麼實際上最後整個正式版相對於預覽版來說
1:55.100–1:57.860
其實只是在模型後訓練的環節
1:57.860–1:59.960
加入了很多
1:59.960–2:01.580
現在暫時還不为人知的
2:01.580–2:02.760
一些訓練方法
2:02.760–2:03.460
當然之後
2:03.460–2:04.700
這個V4 Pro模型
2:04.700–2:07.140
出來之後應該會有相關的技術手冊
2:07.140–2:08.140
到時候大家就能看到
2:08.140–2:09.340
他是怎么做後訓練的
2:09.340–2:11.560
但是基於後訓練的過程
2:11.560–2:13.480
基本上我們說V4 Flash這個模型
2:13.480–2:15.240
相比于原版的Flash模型
2:15.240–2:17.080
其實性能提升了將近30%
2:17.080–2:18.880
下面其實有非常完整的
2:18.880–2:20.880
官方給出的性能評估報告
2:20.880–2:21.700
大家可以看一看
2:21.700–2:23.240
各式各樣的評估結果
2:23.240–2:25.060
那么官方給出的V4 Flash
2:25.060–2:25.800
正式版本
2:25.800–2:27.260
實際上是和G2 5.2進行比較
2:27.260–2:31.760
那GM5.2實際上在年初的時候也算是國內旗艦級的開源大模型了
2:31.760–2:37.500
大家能看到現在整個國內開源大模型的發展和迭代速度實際上是非常快的
2:37.500–2:42.620
那么整個Deepseek V4 Flash在Terminal Bench任務行的評估
2:42.620–2:46.780
還有像下面大家比較熟悉的像DeepSWE對吧
2:46.780–2:48.580
一些前端的一些評估框架
2:48.580–2:50.480
還有Agent Last Exam
2:50.480–2:54.320
現在已經不是人類的最終考試了
2:54.320–2:55.740
是Agent的最終考試對吧
2:55.740–2:57.040
評到多少多少分等等
2:57.040–3:01.560
然后你會發現其實整體的評分相比于這樣5.2來說
3:01.560–3:02.620
基本上是全面領先
3:02.620–3:05.680
然后相比于Op4.8來說有一些小小的差距
3:05.680–3:09.160
但是實際上在很多我們平時用的比較多的一些關鍵指標上
3:09.160–3:11.860
比如說一些前端的一些開發或者是前命令行
3:11.860–3:12.180
對不對
3:12.180–3:14.300
它現在都是透過執行這些 agent
3:14.300–3:17.560
而驅動這些 agent 運行非常關鍵的一個模型效能指標
3:17.560–3:18.400
就是它的命令列
3:18.400–3:20.820
透過命令列去編寫各式各樣的指令
3:20.820–3:22.080
去操作本機電腦等等
3:22.080–3:23.940
我們在這些指標上其實你會發現
3:23.940–3:27.300
DeepSeek v4 flash 和 OPUS 4.8 基本上是非常類似的
3:27.300–3:30.200
這也是使得現在官方可以說
3:30.200–3:33.180
整個 v4 正式版的模型
3:33.180–3:34.980
它的 agent 效能是大幅增強
3:34.980–3:36.680
那麼這個其實是我們能看到的
3:36.680–3:39.220
現在整個的模型的基本情況
3:39.220–3:43.680
然後除了它整體的所謂 agent 效能大幅增強之外
3:43.680–3:46.380
其實它現在還全面擁抱了 Responses API
3:46.380–3:47.780
然後可以無縫接入 Codex
3:47.780–3:49.380
這個其實對於國內開發者來說
3:49.380–3:51.560
應該是非常巨大的影響
3:51.560–3:54.300
當然在此之前
3:54.300–3:58.100
其實 DeepSeek 模型和很多其他的一些模型
3:58.100–4:00.360
透過比如說像 CCSWITCH 這樣的工具
4:00.360–4:01.760
也是可以接入 Codex
4:01.760–4:04.340
只不過當時官方的模型
4:04.340–4:05.560
它本身的回應格式
4:05.560–4:08.260
其實和 Codex 並不是完全相容
4:08.260–4:10.460
所以它中間需要有個轉換的環節
4:10.460–4:11.740
既然有轉換的環節的話
4:11.740–4:15.940
那麼距離真實的大規模深度的工程化應用
4:15.940–4:17.020
其實就還有距離
4:17.020–4:21.160
現在它其實已經在新版本的訓練過程當中
4:21.160–4:24.460
它的輸出格式是完全相容 Codex 的回應格式的
4:24.460–4:27.180
所以使得整個 V4 的正式版模型
4:27.180–4:29.520
是可以接入到 Codex 裡邊的
4:29.520–4:30.860
這點其實對於開發者來說
4:30.860–4:32.900
可以說是非常巨大的影響
4:32.900–4:34.020
因為之前
4:34.020–4:36.460
現在我們進行 Agent 的開發
4:36.460–4:38.160
或者是進行 AI 程式設計的時候
4:38.160–4:40.500
在寫程式做各式各樣專案
4:40.500–4:40.900
少不了
4:40.900–4:43.120
你需要有一個程式設計的框架
4:43.120–4:45.400
需要有一個Harness的Agent
4:45.400–4:45.800
對不對
4:45.800–4:47.280
那對於DeepSeek的用戶來說
4:47.280–4:48.840
其實就少了這麼一塊
4:48.840–4:53.060
儘管今天上面有一個叫DeepseekTY的這樣一個項目
4:53.060–4:54.860
當然這個項目後面改名了叫Resenix
4:54.860–4:59.120
然後最後還被DeepSeek屬於一個半收編的這樣的狀態
4:59.120–5:02.060
但是DeepSeek確實它沒有官方的這樣的Harness Agent
5:02.060–5:04.100
所以你要使用DeepSeek這個模型
5:04.100–5:07.040
你得去用別人家的Agent開發工具
5:07.040–5:10.940
現在DeepSeek全面擁抱Responses API和Codex之後
5:10.940–5:14.880
你就可以無縫的使用Codex來去使用DeepSEEK來進行開發
5:14.880–5:17.800
當然我們今天最後的案例實際上也是使用Codex
5:17.800–5:20.900
用DeepSEEK模型來進行開發的
5:20.900–5:22.740
也是走這樣的一個完整的鏈路
5:22.740–5:24.860
當然Codex和Responses API
5:24.860–5:25.740
它們什麼關係
5:25.740–5:29.020
為什麼它要兼容Responses API
5:29.020–5:30.780
然後同時可以介入Codex
5:30.780–5:33.220
這裡其實有一個大家需要知道的
5:33.220–5:34.720
是Responses API
5:34.720–5:37.600
實際上是去年3月11號
5:37.600–5:40.740
然後OpenAI他們發布的一個新的
5:40.740–5:42.420
一個Agent定義的
5:42.420–5:44.120
Agent通信的一種範式
5:44.120–5:45.960
或者你可以把它理解成是
5:45.960–5:48.320
OpenAI他們發布的自己家的LangChain
5:48.320–5:49.440
你可以這麼來理解
5:49.440–5:51.520
LangChain Agent開發框架
5:51.520–5:53.280
或者是一個Agent Loop
5:53.280–5:53.820
對不對
5:53.820–5:56.660
把這個模型把提示詞把工具綁在一塊
5:56.660–5:58.360
他們就可以組合成一個Agent
5:58.360–5:59.280
是這麼一回事
5:59.280–6:01.100
所謂的Responses API
6:01.100–6:03.660
其實是OpenAI他們家出的一套
6:03.660–6:06.540
就類似於像LangChain這樣的一個開發框架
6:06.540–6:09.260
或者說它這種大模型的通信範式
6:09.260–6:10.880
那麼借助Responses API
6:10.880–6:13.500
實際上我們可以非常快速搭建起一些Agent Loop
6:13.500–6:17.580
實際上,Codex 背後的通訊格式正是這個 Response API。
6:17.580–6:20.960
所以現在,我們提到 DeepSeek V4 這個模型。
6:20.960–6:23.120
它能夠無縫接入 Codex。
6:23.120–6:25.580
非常核心的原因是,因為它底層的通訊格式。
6:25.580–6:27.940
是全面兼容這個 Response API。
6:27.940–6:30.740
當然,這個 Response API 具體是什麼。
6:30.740–6:32.680
它是如何兼容的。
6:32.680–6:33.760
以及如何進行運行。
6:33.760–6:36.060
這部分我們稍後在公開課的進行過程中。
6:36.060–6:38.040
會來進行詳細的解釋。
6:38.040–6:39.720
但這裡首先需要知道的是。
6:39.720–6:42.760
對於 DeepSeek V4 正式版模型來說。
6:42.760–6:47.120
它實際上已經確定全面兼容這個 Response API。
6:47.120–6:48.400
也是因為這樣的緣故。
6:48.400–6:50.700
所以它現在能夠無縫接入 Codex。
6:50.700–6:54.020
這樣的一套開發規則,其實對於現在的開發者來說。
6:54.020–6:57.420
還是一個非常重要的需要掌握的點。
6:57.420–7:00.360
其實也是因為對於 DeepSeek 的用戶來說。
7:00.360–7:03.860
未來他們雖然自家也會推出 Harness Agent。
7:03.860–7:07.300
這個叫做 DeepSeek 的 Harness Agent,現在名字還沒定。
7:07.300–7:09.760
但他們今天發了一個這個內測的邀請。
7:09.760–7:11.500
已經開始進行測試了。
7:11.500–7:13.300
應該在 8 月份很快就會上線。
7:13.300–7:15.860
但是呢,現在對於 V4 這個模型來說。
7:15.860–7:18.920
它已經能夠全面兼容這個 Responses API。
7:18.920–7:23.020
所以哪怕 DeepSeek 未來推出了自己的 Cloud Code。
7:23.020–7:25.320
推出自己的這個 Harness Agent。
7:25.320–7:29.160
那麼它底層其實也是兼容這個 Responses API。
7:29.160–7:30.440
是怎麼樣的這個情況。
7:30.440–7:33.000
所以現在,我們在進行開發的時候。
7:33.000–7:36.340
哎,如果你是之前使用 Codex 來進行開發的話。
7:36.340–7:40.180
那現在確實是可以無縫遷移到 DeepSeek 的模型來進行開發。
7:40.180–7:42.160
當然也有同學說關於這個 DeepSeek。
7:42.160–7:44.680
為什麼不遷移到這個 Cloud Code 裡面去。
7:44.680–7:45.060
對不對。
7:45.060–7:47.160
這個 Cloud Code 主要就是這個。
7:47.160–7:47.920
怎麼說呢。
7:47.920–7:49.660
生態相對來說還比較封閉。
7:49.660–7:50.940
這個用呢是能用。
7:50.940–7:51.960
但是不太穩定。
7:51.960–7:53.720
那麼對於V4這個模型來說
7:53.720–7:54.780
其實我相信過去這段時間
7:54.780–7:56.140
大家應該已經看到了很多
7:56.140–7:57.120
各式各樣的
7:57.120–7:59.140
關於V4這個模型的這個評測
7:59.140–7:59.740
對不對
7:59.740–8:03.540
這個騎自行車的企鵝
8:03.540–8:04.640
這個企鵝騎自行車
8:04.640–8:08.520
這其實是看它邏輯推理能力
8:08.520–8:11.960
和SVG代碼理解能力的一個這樣的測試
8:11.960–8:14.300
還有就比如說大家現在看到的
8:14.300–8:18.640
DeepSeek V4 Flash和GPT5.6的LUNA地球模型
8:18.640–8:21.680
中號模型來進行性能的測試對比
8:21.680–8:26.340
其實基本上V4 Flash和GPT5.6的LUNA模型是差別不大的
8:26.340–8:29.060
他們二者其實屬於同一個檔次和梯隊
8:29.060–8:31.040
當然這個價格上其實要便宜很多
8:31.040–8:34.820
然後還有就比如說什麼探索細胞結構
8:34.820–8:36.095
對不對
8:36.095–8:42.695
然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。
8:42.695–8:50.395
其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。
8:50.395–8:52.575
但實際上Pro這個模型應該很快會上
8:52.575–8:54.075
然後對於Pro這個模型來說
8:54.075–8:58.475
如果按照像Flash進步30%性能來看的話
8:58.475–9:02.635
那麼基本上我們說DeepSeek V4的Pro這個模型的性能
9:02.635–9:04.775
肯定是要超越GPT5.6的
9:04.775–9:06.235
也是超越OPPO4.8的
9:06.235–9:09.375
這個應該是要比KIMI K2這個模型是要更強的
9:09.375–9:11.115
所以大家也非常期待
9:11.115–9:11.455
對不對
9:11.455–9:12.755
這個Pro模型最終創新
9:12.755–9:18.135
當然今天我們來講Flash模型完整的使用的方法和流程
9:18.135–9:20.175
相關的這些代碼呀
9:20.175–9:22.215
開發流程的開發範式啊
9:22.215–9:24.735
包括你對Response API的這個理解呀
9:24.735–9:26.375
是可以全部遷移到啊
9:26.375–9:28.215
這個V4 Pro這個模型當中去的啊
9:28.215–9:29.215
儘管他現在還沒發布啊
9:29.215–9:29.595
但是呢
9:29.595–9:31.775
他們底層其實是完全一樣的啊
9:31.775–9:32.835
這個其實沒有任何問題啊
9:32.835–9:34.315
當然其實這裡還有一個啊
9:34.315–9:35.855
可能同學們會非常感興趣的地方
9:35.855–9:38.615
在於說像V4 Flash這個模型的啊
9:38.615–9:40.855
他如果是要本地來進行部署的話
9:40.855–9:42.195
他有什麼樣的這個啊
9:42.195–9:43.595
什麼樣的這個硬體條件啊
9:43.595–9:44.495
一般來說啊
9:44.495–9:46.835
我們說這個呃單卡啊
9:46.835–9:53.175
單節點8卡A100的伺服器實際上肯定是能夠穩定運行V4 Flash這個模型的
9:53.175–9:57.455
那麼最小它的量化大概是Q2量化的情況下
9:57.455–10:00.455
它所需要佔用的顯存實際上96G
10:00.455–10:05.775
所以如果假設你是一個比如說128G的Mac Studio統一記憶體
10:05.775–10:11.155
那麼也是可以運行Q2量化下的DeepSig V4 Flash這樣的模型
10:11.155–10:13.395
這個其實是一個性價比非常高的選擇
10:13.395–10:15.155
或者如果你是比如英偉達
10:15.155–10:17.815
Dspark那樣的一個伺服器的話
10:17.815–10:20.415
那麼其實有128G的統一記憶體
10:20.415–10:23.015
也是可以運行QR量化下的
10:23.015–10:25.275
Dipsick V4 Flash這個模型
10:25.275–10:28.675
這個是它的一個基本本地部署的硬體門檻
10:28.675–10:31.215
當然咱們今天晚上來介紹的順序
10:31.215–10:35.395
實際上首先會來講解關於Dipsick V4 Flash 0731
10:35.395–10:36.615
這樣的一個模型的基本情況
10:36.615–10:38.215
這個我們剛剛已經講到過了
10:38.215–10:38.515
對不對
10:38.515–10:41.755
然後接下來我們會給大家介紹關於它第一層的
10:41.755–10:44.855
開發過程當中非常重要的
10:44.855–10:46.615
這個Responses API
10:46.615–10:49.295
這個接口到底應該如何來進行使用
10:49.295–10:49.835
對吧
10:49.835–10:50.655
然後呢
10:50.655–10:51.695
就是這個Codex
10:51.695–10:54.155
Codex其實很多同學之前應該非常熟悉
10:54.155–10:55.535
這個桌面端的用法
10:55.535–10:55.815
對不對
10:55.815–10:57.675
這個APP的這樣的用法
10:57.675–10:59.815
那我們在實際在進行開發的過程當中
10:59.815–11:01.455
尤其是要完成
11:01.455–11:02.535
就被大家現在看到的
11:02.535–11:04.435
一些比較複雜的
11:04.435–11:07.675
這樣的一些系統開發
11:07.675–11:09.115
比較複雜的
11:09.115–11:10.935
這個數據分析的
11:10.935–11:12.555
一整個系統的開發的話
11:12.555–11:16.255
那麼其實你還是需要用到 CLI
11:16.255–11:17.115
用到 CLI
11:17.115–11:18.955
使用命令行這個環境來進行開發
11:18.955–11:21.175
其實有很多同學特別擔心
11:21.175–11:22.535
覺得命令行特別難
11:22.535–11:23.595
很難操作
11:23.595–11:24.415
很難上手
11:24.415–11:25.715
其實不至於
11:25.715–11:28.095
我們一會兒帶大家一步一步來看
11:28.095–11:30.755
其實也沒有那麼複雜
11:30.755–11:32.055
它只是可能頁面
11:32.055–11:36.135
命令行框長得樣子有點嚇人而已
11:36.135–11:38.175
但實際上對於現在的開發者來說
11:38.175–11:40.555
你肯定是需要掌握命令行
11:40.555–11:44.155
我們這樣的開發工具才能夠更加靈活、高效、便捷地 AE
11:44.155–11:46.235
使用這些 agent 來完成這些項目的開發
11:46.235–11:50.075
所以這個是我們今天整個課程內容的基本安排
11:50.075–11:51.675
那麼三者之間是什麼樣的關係
11:51.675–11:53.035
我們稍微跟大家說一下
11:53.035–11:55.475
首先模型這個 flash 這個其實沒什麼問題
11:55.475–11:58.595
然後交互協議統一是使用 Response API
11:58.595–12:01.275
來進行底層交互協議的說明
12:01.275–12:03.035
這個稍微會有一些偏底層
12:03.035–12:04.235
這個我們一會兒會說
12:04.235–12:08.195
然後接下來使用 Codex 來完成各式各樣的開發工作
12:08.195–12:13.355
那麼下面其實有一些關於像 Deep Seek V4 Flash 模型的發展歷程
12:13.355–12:14.075
對不對
12:14.075–12:17.015
今年 4 月份發布的 V4
12:17.015–12:18.495
然後現在兩個版本
12:18.495–12:19.415
之前是 Preview
12:19.415–12:22.095
現在是最新版正式版的模型
12:22.095–12:22.815
眼鏡
12:22.815–12:23.775
性能指標
12:23.775–12:24.775
變化等等
12:24.775–12:25.935
然後同時
12:25.935–12:26.755
這個權重
12:26.755–12:29.195
v4 flash 這個權重也已經開放了
12:29.195–12:31.355
大家可以直接下載來使用
12:31.355–12:34.215
然後它整個 v4 flash 這個模型
12:34.215–12:35.495
其實它的價格沒有變
12:35.495–12:38.075
只是後訓練發生了一些變化
12:38.075–12:38.955
所謂後訓練呢
12:38.955–12:39.515
其實指的是
12:39.515–12:40.975
他經過了前期的完整
12:40.975–12:41.835
這個預訓練之後
12:41.835–12:43.555
其實模型已經有了基礎的
12:43.555–12:45.815
記憶基礎的這個知識邊界
12:45.815–12:47.255
然後基礎這樣的這個能力
12:47.255–12:48.275
然後所謂後訓練呢
12:48.275–12:49.555
實際上是訓練他的
12:49.555–12:51.415
這個響應的這個範式
12:51.415–12:52.475
你可以這麼來進行理解
12:52.475–12:53.615
他就經過後訓練
12:53.615–12:55.755
他整個的性能就有飛躍式的
12:55.755–12:56.295
這個增長
12:56.295–12:58.615
他呢總共是 284B 的
12:58.615–13:00.455
MOE 這個模型
13:00.455–13:02.435
這個混合專家模型
13:02.435–13:03.135
然後呢
13:03.135–13:04.955
他其實不會像 KIMI K3 那樣
13:04.955–13:05.795
那麼稀疏
13:05.795–13:06.715
但是他其實因為
13:06.715–13:08.175
也是一個 MOE 這樣的模型
13:08.175–13:11.275
然後每次推理是激活 13B 的參數
13:11.275–13:12.175
你可以這麼來進行理解
13:12.175–13:13.255
所謂 MOE 這個模型
13:13.255–13:15.315
也就指的是它有很多的專家
13:15.315–13:18.495
然後每次在進行每一個 Token 預測的時候
13:18.495–13:21.895
它會分給某一個特定的專家來進行運行
13:21.895–13:23.095
然後最後輸出結果
13:23.095–13:25.735
是這麼樣的這個 MOE 的基本架構
13:25.735–13:27.495
這個其實大家了解一下就行
13:27.495–13:29.715
因為其實對我們開發人員來說
13:29.715–13:31.155
關於它底層的怎麼架構
13:31.155–13:33.395
模型的底層架構
13:33.395–13:35.535
其實一般來說影響並不會特別大
13:35.535–13:38.055
然後同時他現在推理是13個檔位
13:38.055–13:39.195
這個還比較好記
13:39.195–13:41.175
相對於GPT的5個檔位來說
13:41.175–13:43.295
還比較容易就能夠記住
13:43.295–13:45.355
然後關於他的agent的性能
13:45.355–13:47.455
實際上是進步得非常明顯的
13:47.455–13:49.415
他有很多benchmark的對比
13:49.415–13:49.855
對不對
13:49.855–13:50.515
大家可以看到
13:50.515–13:53.735
基本上是相比上一代是提升了30%以上
13:53.735–13:55.795
這個大家可以自己去看一下
13:55.795–13:59.875
然後下面還有關於一些海外用戶的反饋
13:59.875–14:01.995
包括他的智力的提升等等
14:01.995–14:05.175
這個就作為課外的參考
14:05.175–14:06.455
大家可以自己去看一下
14:06.455–14:07.855
如果想更多的了解一下
14:07.855–14:10.355
關於DeepSeq V4 Flash這個模型的
14:10.355–14:11.275
這個基本情況的話
14:11.275–14:12.095
這裡面可以了解一下
14:12.095–14:12.735
然後同時呢
14:12.735–14:14.115
對於想要本地部署的同學
14:14.115–14:15.515
下面其實這段
14:15.515–14:17.855
是給大家專門準備的
14:17.855–14:19.475
就是如果你是想本地部署的話
14:19.475–14:20.255
那麼這裡呢
14:20.255–14:21.115
有各式各樣的
14:21.115–14:22.075
不同類型的
14:22.075–14:23.315
這個本地部署的
14:23.315–14:26.315
這個它的本地部署的
14:26.315–14:29.235
所涉及到的模型的格式
14:29.235–14:30.595
量化的這個程度
14:30.595–14:32.775
以及對應的下載的這個入口
14:32.775–14:33.515
等等等等
14:33.515–14:35.195
從Q2到Q4不等
14:35.195–14:36.575
各式各樣的不同的
14:36.575–14:38.435
他們家做的量化這個版本
14:38.435–14:39.315
大家都可以去看一下
14:39.315–14:42.735
然後都可以去找到對應的下載地址來進行下載
14:42.735–14:45.895
然後同時下面還有關於各個不同量化的版本
14:45.895–14:49.855
他們所需要的一些基本的一些硬件方面的一些說明
14:49.855–14:52.515
這其實就只是一張參考表
14:52.515–14:54.595
大家拿到之後就可以對照著參考
0:00.000–0:04.531
好,那么Deepseek v4的模型实际上是在4月份首次亮相。
好的,那麼 DeepSeek V4 模型實際上是在四月首次亮相。
0:04.531–0:07.400
当时它其实是叫preview,预览版。
當時它其實叫做 Preview,也就是預覽版。
0:07.400–0:11.600
当然对于Deepseek这个模型来说,国内开发者应该是用的非常多了。
當然,對於 DeepSeek 這個模型來說,國內開發者應該已經用得非常多。
0:11.600–0:16.200
这个模型不仅性能非常不错,而且关键价格很便宜,还可以本地部署。
這個模型不僅性能非常出色,關鍵是價格便宜,還支援本地部署。
0:16.200–0:24.600
关键是Deepseek在过去的这么一年的时间迭代的过程当中,从V1开始,其实始终都是给人一种走技术黑科技的感觉。
重點是,DeepSeek 在過去這一年多的迭代過程中,從 V1 開始,始終給人一種走技術黑科技的感覺。
0:24.600–0:29.600
对不对,不仅运行速度很快,前段时间还发了Dspark这样一篇论文,对不对。
對吧,不僅運行速度很快,前陣子還發表了 DSpark 這樣的論文,對吧。
0:29.600–0:31.520
在不改任何价格的这个情况下
在不改變任何價格的情況下
0:31.520–0:32.120
然后呢
然後呢
0:32.120–0:34.780
这个整个的推理速度提升了80%
整個推理速度提升了 80%
0:34.780–0:35.540
然后呢
然後呢
0:35.540–0:36.120
同时啊
同時啊
0:36.120–0:37.840
这个并且啊
並且啊
0:37.840–0:39.420
它还可以支持各式各样的
它還支援各種各樣
0:39.420–0:41.200
现在有各式各样的这个本地部署
現在有各種各樣的本地部署
0:41.200–0:43.960
也支持适配国内的各式各样GPU这样的型号啊
也支援適配國內各種型號的 GPU
0:43.960–0:44.200
所以呢
所以呢
0:44.200–0:45.960
DeepSeek这个模型应该是
DeepSeek 這個模型應該是
0:45.960–0:48.160
国内所有开源模型的这个来看
從國內所有開源模型來看
0:48.160–0:49.540
普及深度非常非常广啊
普及深度非常非常廣啊
0:49.540–0:50.380
这样的一块模型啊
這樣的一款模型啊
0:50.380–0:51.580
那么今年4月份啊
那麼在今年四月啊
0:51.580–0:52.740
V4版本正式上线
V4 版本正式上線
0:52.740–0:54.100
我们V4版本的上线实际上
我們 V4 版本的實際上線
0:54.100–0:56.460
是对整个的DeepSeek这个模型的这个性能呢
是對整個 DeepSeek 模型的性能呢
0:56.460–0:58.780
是往前提了很大一步啊
往前邁進了一大步啊
0:58.780–1:00.780
在当时其实是性能非常不错的
當時其實性能非常不錯
1:00.780–1:02.080
这样的一款模型
這樣的一款模型
1:02.080–1:02.940
然后时隔三个月
然後隔了三個月
1:02.940–1:05.620
Deepseek v4的正式版模型是正式上线的
DeepSeek V4 的正式版模型正式上線
1:05.620–1:07.840
当然正式版模型上线之后
當然正式版模型上線之後
1:07.840–1:10.480
网上也是铺天盖地的测评
網路上也是鋪天蓋地的評測
1:10.480–1:12.700
性能方面评价等等
性能方面的評價等等
1:12.700–1:14.760
那么Deepseek v4正式版模型
那麼 DeepSeek V4 正式版模型
1:14.760–1:18.920
相比于此前的4月份发布的预览版的模型来说
相比於此前四月發布的預覽版模型來說
1:18.920–1:21.720
其实它整个的架构是没有发生任何变化的
其實它整個架構並沒有發生任何變化
1:21.720–1:23.680
那么它首先在7月31号的时候
那麼它首先在七月三十一號的時候
1:23.680–1:26.540
是先上线了v4的Flash版本
是先上線了 V4 的 Flash 版本
1:26.540–1:28.680
那么整个Deepseek v4其实有两款模型
那麼整個 DeepSeek V4 其實有兩款模型
1:28.680–1:32.720
一个是Flash 一个是Pro 就是一个大杯一个小杯
一個是 Flash,一個是 Pro,就是大杯和小杯
1:32.720–1:35.840
然后Flash模型实际上是小杯这个模型
然後 Flash 模型實際上是小杯這個模型
1:35.840–1:41.240
然后Flash的模型它原始的V4版本就是284B的参数
接著Flash模型原始的V4版本擁有284B的參數量
1:41.240–1:44.180
然后是3B的每次推理几乎的参数量
每次推理幾乎只有3B的參數量
1:44.180–1:49.680
现在正式版也是这么一个模型的尺寸和核心的底层的功能
現在正式版的模型尺寸和核心底層功能其實都沒有變化
1:49.680–1:50.760
其实都是没有发生变化的
其實都沒有發生變化
1:50.760–1:55.100
那么它实际上最后整个的正式版下面预览版来说
那麼實際上最後整個正式版相對於預覽版來說
1:55.100–1:57.860
其实只是在模型后训练的环节
其實只是在模型後訓練的環節
1:57.860–1:59.960
加入了很多的
加入了很多
1:59.960–2:01.580
现在暂时还不为人知的
現在暫時還不为人知的
2:01.580–2:02.760
一些训练的方法
一些訓練方法
2:02.760–2:03.460
当然之后
當然之後
2:03.460–2:04.700
这个V4 Pro这个模型
這個V4 Pro模型
2:04.700–2:07.140
出来之后应该会有相关的技术手册
出來之後應該會有相關的技術手冊
2:07.140–2:08.140
到时候大家就能看到
到時候大家就能看到
2:08.140–2:09.340
他是怎么做着后训练的
他是怎么做後訓練的
2:09.340–2:11.560
但是基于后训练的过程
但是基於後訓練的過程
2:11.560–2:13.480
基本上我们说V4 Flash这个模型
基本上我們說V4 Flash這個模型
2:13.480–2:15.240
相比于原版的Flash模型
相比于原版的Flash模型
2:15.240–2:17.080
其实性能是提升将近30%
其實性能提升了將近30%
2:17.080–2:18.880
下面其实有非常完整的
下面其實有非常完整的
2:18.880–2:20.880
官方给出的性能评测的报告
官方給出的性能評估報告
2:20.880–2:21.700
大家可以看一看
大家可以看一看
2:21.700–2:23.240
各式各样的测评结果
各式各樣的評估結果
2:23.240–2:25.060
那么官方给出的V4 Flash
那么官方給出的V4 Flash
2:25.060–2:25.800
正式版本
正式版本
2:25.800–2:27.260
实际上是对比较G2 5.2的
實際上是和G2 5.2進行比較
2:27.260–2:31.760
那GM5.2实际上在年初的时候也算是国内旗舰的开源大模型了
那GM5.2實際上在年初的時候也算是國內旗艦級的開源大模型了
2:31.760–2:37.500
大家能看到现在整个的国内的开源大模型的发展和迭代的速度实际上是非常快的
大家能看到現在整個國內開源大模型的發展和迭代速度實際上是非常快的
2:37.500–2:42.620
那么整个的Deepseek V4 Flash在Terminal Bench命运行的测评
那么整個Deepseek V4 Flash在Terminal Bench任務行的評估
2:42.620–2:46.780
还有像下面大家比较熟悉的像DeepSWE对不对
還有像下面大家比較熟悉的像DeepSWE對吧
2:46.780–2:48.580
一些前端的一些评测的框架
一些前端的一些評估框架
2:48.580–2:50.480
还有Agent Last Exam
還有Agent Last Exam
2:50.480–2:54.320
现在已经不是人类最终考试了
現在已經不是人類的最終考試了
2:54.320–2:55.740
是Agent的最终考试对不对
是Agent的最終考試對吧
2:55.740–2:57.040
评到多少多少分等等
評到多少多少分等等
2:57.040–3:01.560
然后你会发现其实整体的评分相比于这样5.2来说
然后你會發現其實整體的評分相比于這樣5.2來說
3:01.560–3:02.620
基本上是全面领先
基本上是全面領先
3:02.620–3:05.680
然后相比于Op4.8来说有一些小小的差距
然后相比于Op4.8來說有一些小小的差距
3:05.680–3:09.160
但是实际上在很多我们平时用的比较多的一些关键指标上
但是實際上在很多我們平時用的比較多的一些關鍵指標上
3:09.160–3:11.860
比如说一些前端的一些开发或者是前命令行
比如說一些前端的一些開發或者是前命令行
3:11.860–3:12.180
对不对
對不對
3:12.180–3:14.300
它现在都是通过运行这些agent
它現在都是透過執行這些 agent
3:14.300–3:17.560
而驱动这些agent运行非常关键的一个模型的性能指标
而驅動這些 agent 運行非常關鍵的一個模型效能指標
3:17.560–3:18.400
就是它的命令行
就是它的命令列
3:18.400–3:20.820
通过命令行去便写各式各样的命令
透過命令列去編寫各式各樣的指令
3:20.820–3:22.080
去操纵本机电脑等等
去操作本機電腦等等
3:22.080–3:23.940
我们在这些指标上其实你会发现
我們在這些指標上其實你會發現
3:23.940–3:27.300
Deepseek v4 flash和OPUS 4.8基本上是非常类似的
DeepSeek v4 flash 和 OPUS 4.8 基本上是非常類似的
3:27.300–3:30.200
这也是使得现在官方可以说
這也是使得現在官方可以說
3:30.200–3:33.180
整个的v4正式版的模型
整個 v4 正式版的模型
3:33.180–3:34.980
它的agent性能是大幅增强
它的 agent 效能是大幅增強
3:34.980–3:36.680
那么这个其实是我们能看到的
那麼這個其實是我們能看到的
3:36.680–3:39.220
现在整个的模型的基本情况
現在整個的模型的基本情況
3:39.220–3:43.680
然后除了它整体的所谓的agent性能大幅增强之外
然後除了它整體的所謂 agent 效能大幅增強之外
3:43.680–3:46.380
其实它现在还全面的拥抱了Responses API
其實它現在還全面擁抱了 Responses API
3:46.380–3:47.780
然后可以无缝接入Codex
然後可以無縫接入 Codex
3:47.780–3:49.380
这个其实对于国内开发者来说
這個其實對於國內開發者來說
3:49.380–3:51.560
应该是非常巨大的影响
應該是非常巨大的影響
3:51.560–3:54.300
当然在此之前
當然在此之前
3:54.300–3:58.100
其实DeepSeek模型和很多其他的一些模型
其實 DeepSeek 模型和很多其他的一些模型
3:58.100–4:00.360
通过比如说像CCSWITCH这样的工具
透過比如說像 CCSWITCH 這樣的工具
4:00.360–4:01.760
也是可以接入Codex
也是可以接入 Codex
4:01.760–4:04.340
只不过当时官方的模型
只不過當時官方的模型
4:04.340–4:05.560
它本身的响应格式
它本身的回應格式
4:05.560–4:08.260
其实和Codex并不是完全兼容
其實和 Codex 並不是完全相容
4:08.260–4:10.460
所以它中间需要有个转换的环节
所以它中間需要有個轉換的環節
4:10.460–4:11.740
既然有转换的环节的话
既然有轉換的環節的話
4:11.740–4:15.940
那么距离真实的大规模深度的工程化的应用
那麼距離真實的大規模深度的工程化應用
4:15.940–4:17.020
其实就还有距离
其實就還有距離
4:17.020–4:21.160
现在它其实已经在新版本的训练过程当中
現在它其實已經在新版本的訓練過程當中
4:21.160–4:24.460
它的输出格式是完全兼容Codex的响应格式的
它的輸出格式是完全相容 Codex 的回應格式的
4:24.460–4:27.180
所以使得整个V4的正式版模型
所以使得整個 V4 的正式版模型
4:27.180–4:29.520
是可以接入到Codex里边去的
是可以接入到 Codex 裡邊的
4:29.520–4:30.860
这点其实对于开发者来说
這點其實對於開發者來說
4:30.860–4:32.900
可以说是非常巨大的影响
可以說是非常巨大的影響
4:32.900–4:34.020
因为之前
因為之前
4:34.020–4:36.460
现在我们进行Agent的开发
現在我們進行 Agent 的開發
4:36.460–4:38.160
或者是进行AI编程的时候
或者是進行 AI 程式設計的時候
4:38.160–4:40.500
在写程序做各式各样项目
在寫程式做各式各樣專案
4:40.500–4:40.900
少不了
少不了
4:40.900–4:43.120
你需要有一个编程的框架
你需要有一個程式設計的框架
4:43.120–4:45.400
需要有一个Harness的Agent
需要有一個Harness的Agent
4:45.400–4:45.800
对不对
對不對
4:45.800–4:47.280
那对于DeepSeek的用户来说
那對於DeepSeek的用戶來說
4:47.280–4:48.840
其实就少了这么一块
其實就少了這麼一塊
4:48.840–4:53.060
尽管今天上面有一个叫DeepseekTY的这样的一个项目
儘管今天上面有一個叫DeepseekTY的這樣一個項目
4:53.060–4:54.860
当然这个项目后面改名了叫Resenix
當然這個項目後面改名了叫Resenix
4:54.860–4:59.120
然后最后还被Deepseek属于一个半收编的这样的状态
然後最後還被DeepSeek屬於一個半收編的這樣的狀態
4:59.120–5:02.060
但是Deepseek确实它没有官方的这样的Harness Agent
但是DeepSeek確實它沒有官方的這樣的Harness Agent
5:02.060–5:04.100
所以你要使用Deepseek这个模型
所以你要使用DeepSeek這個模型
5:04.100–5:07.040
你得去用别人家的Agent开发工具
你得去用別人家的Agent開發工具
5:07.040–5:10.940
现在Deepseek全面拥抱Responsees API和Codex之后
現在DeepSeek全面擁抱Responses API和Codex之後
5:10.940–5:14.880
你就可以无缝的使用Codex来去使用Deepseek来进行开发
你就可以無縫的使用Codex來去使用DeepSEEK來進行開發
5:14.880–5:17.800
当然我们今天最后的案例实际上也是使用Codex
當然我們今天最後的案例實際上也是使用Codex
5:17.800–5:20.900
用Deepseek模型来进行的开发
用DeepSEEK模型來進行開發的
5:20.900–5:22.740
也是走这样的一个完整的链路
也是走這樣的一個完整的鏈路
5:22.740–5:24.860
当然Codex和Responsees API
當然Codex和Responses API
5:24.860–5:25.740
它们什么关系
它們什麼關係
5:25.740–5:29.020
为什么它要兼容Responsees API
為什麼它要兼容Responses API
5:29.020–5:30.780
然后同时可以介入Codex
然後同時可以介入Codex
5:30.780–5:33.220
这里其实有一个大家需要知道的
這裡其實有一個大家需要知道的
5:33.220–5:34.720
是Responsees API
是Responses API
5:34.720–5:37.600
实际上是去年3月11号
實際上是去年3月11號
5:37.600–5:40.740
然后OpenAI他们发布的一个新的
然後OpenAI他們發布的一個新的
5:40.740–5:42.420
一个Agent定义的
一個Agent定義的
5:42.420–5:44.120
Agent通信的一种范式
Agent通信的一種範式
5:44.120–5:45.960
或者你可以把它理解成是
或者你可以把它理解成是
5:45.960–5:48.320
OpenAI他们发布的自己家的LongChain
OpenAI他們發布的自己家的LangChain
5:48.320–5:49.440
你可以这么来经理解
你可以這麼來理解
5:49.440–5:51.520
LongChain Agent开发框架
LangChain Agent開發框架
5:51.520–5:53.280
或者是一个Agent Loop
或者是一個Agent Loop
5:53.280–5:53.820
对不对
對不對
5:53.820–5:56.660
把这个模型把提日词把工具绑在一块
把這個模型把提示詞把工具綁在一塊
5:56.660–5:58.360
他们就可以组合成一个Agent
他們就可以組合成一個Agent
5:58.360–5:59.280
是这么一回事
是這麼一回事
5:59.280–6:01.100
所谓的Response API
所謂的Responses API
6:01.100–6:03.660
其实是OpenAI他们家出的一套
其實是OpenAI他們家出的一套
6:03.660–6:06.540
就类似于像LongChain这样的一个开发框架
就類似於像LangChain這樣的一個開發框架
6:06.540–6:09.260
或者说它这种大模型的通信范式
或者說它這種大模型的通信範式
6:09.260–6:10.880
那么借助Response API
那麼借助Responses API
6:10.880–6:13.500
实际上我们可以非常快速搭建起一些Agent Loop
實際上我們可以非常快速搭建起一些Agent Loop
6:13.500–6:17.580
那实际上Codex背后的通信格式实际上就是这个Response API
實際上,Codex 背後的通訊格式正是這個 Response API。
6:17.580–6:20.960
所以呢现在啊你说我们说DeepseekV4这个模型
所以現在,我們提到 DeepSeek V4 這個模型。
6:20.960–6:23.120
它能够无缝接入Codex里边去啊
它能夠無縫接入 Codex。
6:23.120–6:25.580
非常核心的原因是因为它底层的通信格式呢
非常核心的原因是,因為它底層的通訊格式。
6:25.580–6:27.940
是全面兼容啊这个Response API的
是全面兼容這個 Response API。
6:27.940–6:30.740
当然这个Response API具体是什么
當然,這個 Response API 具體是什麼。
6:30.740–6:32.680
它是怎么兼容的啊
它是如何兼容的。
6:32.680–6:33.760
如何来进行运行啊
以及如何進行運行。
6:33.760–6:36.060
这个呢我们一会在公开课的这个进行过程当中
這部分我們稍後在公開課的進行過程中。
6:36.060–6:38.040
我们会来进行详细的这个解释啊
會來進行詳細的解釋。
6:38.040–6:39.720
但是这里首先大需要知道的是呢
但這裡首先需要知道的是。
6:39.720–6:42.760
对于Code对于DeepseekV4的正式版模型来说啊
對於 DeepSeek V4 正式版模型來說。
6:42.760–6:47.120
他呢实际上是已经确定了是全面兼容这个Response API的啊
它實際上已經確定全面兼容這個 Response API。
6:47.120–6:48.400
也是因为这样的原因呢
也是因為這樣的緣故。
6:48.400–6:50.700
所以他现在呢能够无缝接入Codex
所以它現在能夠無縫接入 Codex。
6:50.700–6:54.020
那这样的一套开发的规则其实对于现在开发者来说啊
這樣的一套開發規則,其實對於現在的開發者來說。
6:54.020–6:57.420
还是非常重要的一个这个需要掌握的一个地方啊
還是一個非常重要的需要掌握的點。
6:57.420–7:00.360
其实也是因为对于Deepseek的用户来说啊
其實也是因為對於 DeepSeek 的用戶來說。
7:00.360–7:03.860
未来他虽然自家也会出Harness Agent啊
未來他們雖然自家也會推出 Harness Agent。
7:03.860–7:07.300
这个叫Deepseek的这个Harness Agent现在名字还没定啊
這個叫做 DeepSeek 的 Harness Agent,現在名字還沒定。
7:07.300–7:09.760
但他们今天发了一个这个内测的这个邀请啊
但他們今天發了一個這個內測的邀請。
7:09.760–7:11.500
已经开始进行测试了啊
已經開始進行測試了。
7:11.500–7:13.300
应该8月份很快就会上线
應該在 8 月份很快就會上線。
7:13.300–7:15.860
但是呢 现在啊 对于v4这个模型来说
但是呢,現在對於 V4 這個模型來說。
7:15.860–7:18.920
那他已经是能够全面兼容这个responses api了
它已經能夠全面兼容這個 Responses API。
7:18.920–7:23.020
所以哪怕啊 这个deep seek他们未来推出了自己的cloud code啊
所以哪怕 DeepSeek 未來推出了自己的 Cloud Code。
7:23.020–7:25.320
推出自己的这个harness agent
推出自己的這個 Harness Agent。
7:25.320–7:29.160
那么他呢 其实底层也是兼容这个responses api的啊
那麼它底層其實也是兼容這個 Responses API。
7:29.160–7:30.440
是怎么样的这个情况啊
是怎麼樣的這個情況。
7:30.440–7:33.000
所以呢 现在啊 我们在进行开发的这个时候呢
所以現在,我們在進行開發的時候。
7:33.000–7:36.340
哎 如果你是之前是使用着codex来进行开发的话
哎,如果你是之前使用 Codex 來進行開發的話。
7:36.340–7:40.180
那现在确实是可以无缝迁移到deep seek的这个模型啊 来进行开发了
那現在確實是可以無縫遷移到 DeepSeek 的模型來進行開發。
7:40.180–7:42.160
当然也有同学说关于这个deep seek
當然也有同學說關於這個 DeepSeek。
7:42.160–7:44.680
为什么不迁移到这cloud code里面去
為什麼不遷移到這個 Cloud Code 裡面去。
7:44.680–7:45.060
对不对
對不對。
7:45.060–7:47.160
这cloud code就主要是这个
這個 Cloud Code 主要就是這個。
7:47.160–7:47.920
怎么说呢
怎麼說呢。
7:47.920–7:49.660
生态相对来说还是比较封闭
生態相對來說還比較封閉。
7:49.660–7:50.940
这个用呢是能用
這個用呢是能用。
7:50.940–7:51.960
但是不太稳定
但是不太穩定。
7:51.960–7:53.720
那么对于V4这个模型来说
那麼對於V4這個模型來說
7:53.720–7:54.780
其实我相信过去段时间
其實我相信過去這段時間
7:54.780–7:56.140
大家应该已经看到了很多
大家應該已經看到了很多
7:56.140–7:57.120
各式各样的
各式各樣的
7:57.120–7:59.140
关于V4这个模型的这个评测
關於V4這個模型的這個評測
7:59.140–7:59.740
对不对
對不對
7:59.740–8:03.540
这个这姑骑自行车
這個騎自行車的企鵝
8:03.540–8:04.640
这个鸭子骑自行车
這個企鵝騎自行車
8:04.640–8:08.520
这其实是看它逻辑推理能力
這其實是看它邏輯推理能力
8:08.520–8:11.960
和SVG的代码理解能力的这样的一个测试
和SVG代碼理解能力的一個這樣的測試
8:11.960–8:14.300
还有就比如说大家现在看到的
還有就比如說大家現在看到的
8:14.300–8:18.640
Dipzig V4 Flash和GPT5.6的LUNA地球模型
DeepSeek V4 Flash和GPT5.6的LUNA地球模型
8:18.640–8:21.680
中号模型来进行性能的测试对比
中號模型來進行性能的測試對比
8:21.680–8:26.340
其实基本上V4 Flash和GPT5.6的LUNA模型是差别不大的
其實基本上V4 Flash和GPT5.6的LUNA模型是差別不大的
8:26.340–8:29.060
他们二者其实属于同一个档次和梯队
他們二者其實屬於同一個檔次和梯隊
8:29.060–8:31.040
当然这个价格上其实要便宜很多
當然這個價格上其實要便宜很多
8:31.040–8:34.820
然后还有就比如说什么探索细胞结构
然後還有就比如說什麼探索細胞結構
8:34.820–8:36.095
对不对
對不對
8:36.095–8:42.695
然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。
然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。
8:42.695–8:50.395
其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。
其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。
8:50.395–8:52.575
但实际上Pro这个模型应该很快会上
但實際上Pro這個模型應該很快會上
8:52.575–8:54.075
然后对于Pro这个模型来说
然後對於Pro這個模型來說
8:54.075–8:58.475
如果按照像Flash进步30%性能来看的话
如果按照像Flash進步30%性能來看的話
8:58.475–9:02.635
那么基本上我们说Deptic V4的Pro这个模型的性能
那麼基本上我們說DeepSeek V4的Pro這個模型的性能
9:02.635–9:04.775
肯定是要超越GPT5.6的
肯定是要超越GPT5.6的
9:04.775–9:06.235
也是超越OPPO4.8的
也是超越OPPO4.8的
9:06.235–9:09.375
这个应该是要比KMIK3这个模型是要更强的
這個應該是要比KIMI K2這個模型是要更強的
9:09.375–9:11.115
所以大家也非常期待
所以大家也非常期待
9:11.115–9:11.455
对不对
對不對
9:11.455–9:12.755
这个Pro模型最终创新
這個Pro模型最終創新
9:12.755–9:18.135
当然我们今天来讲Flash模型完整的使用的方法和流程
當然今天我們來講Flash模型完整的使用的方法和流程
9:18.135–9:20.175
相关的这些代码呀
相關的這些代碼呀
9:20.175–9:22.215
开发流程的开发范式啊
開發流程的開發範式啊
9:22.215–9:24.735
包括你对Responsees API的这个理解呀
包括你對Response API的這個理解呀
9:24.735–9:26.375
是可以全部迁移到啊
是可以全部遷移到啊
9:26.375–9:28.215
这个V4 Pro这个模型当中去的啊
這個V4 Pro這個模型當中去的啊
9:28.215–9:29.215
尽管他现在还没发布啊
儘管他現在還沒發布啊
9:29.215–9:29.595
但是呢
但是呢
9:29.595–9:31.775
他们底层其实是完全一样的啊
他們底層其實是完全一樣的啊
9:31.775–9:32.835
这个其实没有任何问题啊
這個其實沒有任何問題啊
9:32.835–9:34.315
当然其实这里还有一个啊
當然其實這裡還有一個啊
9:34.315–9:35.855
可能同学们会非常感兴趣的地方
可能同學們會非常感興趣的地方
9:35.855–9:38.615
在于说像V4 Flash这个模型的话啊
在於說像V4 Flash這個模型的啊
9:38.615–9:40.855
他如果是要本地来进行部署的话
他如果是要本地來進行部署的話
9:40.855–9:42.195
他有什么样的这个啊
他有什麼樣的這個啊
9:42.195–9:43.595
什么样的这个硬件条件啊
什麼樣的這個硬體條件啊
9:43.595–9:44.495
一般来说啊
一般來說啊
9:44.495–9:46.835
我们说这个呃单卡啊
我們說這個呃單卡啊
9:46.835–9:53.175
单节点8卡A100的服务器实际上是肯定是可以稳定的去运行V4 Flash这个模型的
單節點8卡A100的伺服器實際上肯定是能夠穩定運行V4 Flash這個模型的
9:53.175–9:57.455
那么最小它的量化大概是Q2量化的情况下
那麼最小它的量化大概是Q2量化的情況下
9:57.455–10:00.455
它所需要占用的显存实际上是96G
它所需要佔用的顯存實際上96G
10:00.455–10:05.775
所以如果假设你是一个比如说128G的Mac Studio统一内存
所以如果假設你是一個比如說128G的Mac Studio統一記憶體
10:05.775–10:11.155
那么也是可以运行Q2量化下的DeepSig V4 Flash这样的模型
那麼也是可以運行Q2量化下的DeepSig V4 Flash這樣的模型
10:11.155–10:13.395
这个其实是一个性价比非常高的选择
這個其實是一個性價比非常高的選擇
10:13.395–10:15.155
或者如果你是比如英伟达
或者如果你是比如英偉達
10:15.155–10:17.815
Dspark那样的一个服务器的话
Dspark那樣的一個伺服器的話
10:17.815–10:20.415
那么其实有128G的统一内存
那麼其實有128G的統一記憶體
10:20.415–10:23.015
也是可以运行QR量化下的
也是可以運行QR量化下的
10:23.015–10:25.275
Dipsick V4 Flash这个模型
Dipsick V4 Flash這個模型
10:25.275–10:28.675
这个是它的一个基本本地部署的一个硬件门槛
這個是它的一個基本本地部署的硬體門檻
10:28.675–10:31.215
当然咱们今天晚上来介绍的顺序
當然咱們今天晚上來介紹的順序
10:31.215–10:35.395
实际上首先会来讲解关于Dipsick V4 Flash 0731
實際上首先會來講解關於Dipsick V4 Flash 0731
10:35.395–10:36.615
这样的一个模型的基本情况
這樣的一個模型的基本情況
10:36.615–10:38.215
这个我们刚刚已经讲到过了
這個我們剛剛已經講到過了
10:38.215–10:38.515
对不对
對不對
10:38.515–10:41.755
然后接下来我们会给大家介绍关于它第一层的
然後接下來我們會給大家介紹關於它第一層的
10:41.755–10:44.855
开发过程当中非常重要的
開發過程當中非常重要的
10:44.855–10:46.615
这个Responses API
這個Responses API
10:46.615–10:49.295
这个接口到底应该如何来进行使用
這個接口到底應該如何來進行使用
10:49.295–10:49.835
对吧
對吧
10:49.835–10:50.655
然后呢
然後呢
10:50.655–10:51.695
就是这个Codex
就是這個Codex
10:51.695–10:54.155
Codex其实很多同学之前应该非常熟悉
Codex其實很多同學之前應該非常熟悉
10:54.155–10:55.535
这个桌面端的使用
這個桌面端的用法
10:55.535–10:55.815
对不对
對不對
10:55.815–10:57.675
这个APP的这样的使用
這個APP的這樣的用法
10:57.675–10:59.815
那我们在实际在进行开发的过程当中
那我們在實際在進行開發的過程當中
10:59.815–11:01.455
尤其是要完成
尤其是要完成
11:01.455–11:02.535
就被大家现在看到的
就被大家現在看到的
11:02.535–11:04.435
一些比较复杂的
一些比較複雜的
11:04.435–11:07.675
这样的一些系统的开发
這樣的一些系統開發
11:07.675–11:09.115
比较复杂的
比較複雜的
11:09.115–11:10.935
这个数据分析的
這個數據分析的
11:10.935–11:12.555
一整个系统的开发的话
一整個系統的開發的話
11:12.555–11:16.255
那么其实你还是需要用的CLI
那麼其實你還是需要用到 CLI
11:16.255–11:17.115
用的CLI
用到 CLI
11:17.115–11:18.955
用的命令行这个环境来进行开发
使用命令行這個環境來進行開發
11:18.955–11:21.175
其实是有很多同学特别担心
其實有很多同學特別擔心
11:21.175–11:22.535
觉得命令行特别难
覺得命令行特別難
11:22.535–11:23.595
很难操作
很難操作
11:23.595–11:24.415
很难上手
很難上手
11:24.415–11:25.715
其实不至于
其實不至於
11:25.715–11:28.095
我们一会带大家一步一步来看
我們一會兒帶大家一步一步來看
11:28.095–11:30.755
其实也没有那么的复杂
其實也沒有那麼複雜
11:30.755–11:32.055
它只是可能页面行
它只是可能頁面
11:32.055–11:36.135
命框长的样子有点吓人而已
命令行框長得樣子有點嚇人而已
11:36.135–11:38.175
但实际上对于现在的开发者来说
但實際上對於現在的開發者來說
11:38.175–11:40.555
你肯定是需要掌握命令行
你肯定是需要掌握命令行
11:40.555–11:44.155
我们这样的开发工具才能够更加灵活高效便捷的AE
我們這樣的開發工具才能夠更加靈活、高效、便捷地 AE
11:44.155–11:46.235
使用这些agent来完成这些项目的开发
使用這些 agent 來完成這些項目的開發
11:46.235–11:50.075
所以这个是我们今天整个课程内容的基本安排
所以這個是我們今天整個課程內容的基本安排
11:50.075–11:51.675
那么三者之间是什么样的关系
那麼三者之間是什麼樣的關係
11:51.675–11:53.035
我们稍微跟大家说一下
我們稍微跟大家說一下
11:53.035–11:55.475
首先模型这个flash这个其实没什么问题
首先模型這個 flash 這個其實沒什麼問題
11:55.475–11:58.595
然后交互协议统一是使用Response API
然後交互協議統一是使用 Response API
11:58.595–12:01.275
来进行底层的交互协议的说明
來進行底層交互協議的說明
12:01.275–12:03.035
这个稍微会有一些偏底层
這個稍微會有一些偏底層
12:03.035–12:04.235
这个我们一会会说
這個我們一會兒會說
12:04.235–12:08.195
然后接下来使用Codex来去完成各式各样的开发工作
然後接下來使用 Codex 來完成各式各樣的開發工作
12:08.195–12:13.355
那么下面其实有一些关于像deep seek v4 flash模型的发展历程
那麼下面其實有一些關於像 Deep Seek V4 Flash 模型的發展歷程
12:13.355–12:14.075
对不对
對不對
12:14.075–12:17.015
今年4月份发布的v4
今年 4 月份發布的 V4
12:17.015–12:18.495
然后现在两个版本
然後現在兩個版本
12:18.495–12:19.415
之前是preview
之前是 Preview
12:19.415–12:22.095
现在是最新版正式版的模型
現在是最新版正式版的模型
12:22.095–12:22.815
眼镜
眼鏡
12:22.815–12:23.775
性能指标
性能指標
12:23.775–12:24.775
变化等等
變化等等
12:24.775–12:25.935
然后同时
然後同時
12:25.935–12:26.755
这个权重
這個權重
12:26.755–12:29.195
v4 flash这个权重也是已经开放了的
v4 flash 這個權重也已經開放了
12:29.195–12:31.355
大家是可以直接下载来进行使用的
大家可以直接下載來使用
12:31.355–12:34.215
然后它整个的v4 flash这个模型
然後它整個 v4 flash 這個模型
12:34.215–12:35.495
其实它的价格没有变
其實它的價格沒有變
12:35.495–12:38.075
只是后训练是发生了一些变化
只是後訓練發生了一些變化
12:38.075–12:38.955
所谓后训练呢
所謂後訓練呢
12:38.955–12:39.515
其实指的是
其實指的是
12:39.515–12:40.975
他经过了前期的完整的
他經過了前期的完整
12:40.975–12:41.835
这个预训练之后
這個預訓練之後
12:41.835–12:43.555
其实模型已经有了基础的
其實模型已經有了基礎的
12:43.555–12:45.815
记忆基础的这个知识边界
記憶基礎的這個知識邊界
12:45.815–12:47.255
然后基础的这样的能力
然後基礎這樣的這個能力
12:47.255–12:48.275
然后所谓后训练呢
然後所謂後訓練呢
12:48.275–12:49.555
实际上是训练他的
實際上是訓練他的
12:49.555–12:51.415
这个响应的这个范式
這個響應的這個範式
12:51.415–12:52.475
你可以这么来进行理解
你可以這麼來進行理解
12:52.475–12:53.615
他就经过后训练
他就經過後訓練
12:53.615–12:55.755
他整个的性能就有飞跃式的
他整個的性能就有飛躍式的
12:55.755–12:56.295
这个增长
這個增長
12:56.295–12:58.615
他呢总共是284B的
他呢總共是 284B 的
12:58.615–13:00.455
MOE这个模型
MOE 這個模型
13:00.455–13:02.435
这个混合专家模型
這個混合專家模型
13:02.435–13:03.135
然后呢
然後呢
13:03.135–13:04.955
他其实不会像KIMI K3那样
他其實不會像 KIMI K3 那樣
13:04.955–13:05.795
那么稀疏
那麼稀疏
13:05.795–13:06.715
但是他其实因为
但是他其實因為
13:06.715–13:08.175
也是一个MOE这样的模型
也是一個 MOE 這樣的模型
13:08.175–13:11.275
然后每次推理是激活13B的参数
然後每次推理是激活 13B 的參數
13:11.275–13:12.175
你可以这么来进行理解
你可以這麼來進行理解
13:12.175–13:13.255
所谓MOE这个模型
所謂 MOE 這個模型
13:13.255–13:15.315
也就指的是它有很多的专家
也就指的是它有很多的專家
13:15.315–13:18.495
然后每次在进行每一个Token的预测的时候
然後每次在進行每一個 Token 預測的時候
13:18.495–13:21.895
它会分给某一个特定的专家来进行运行
它會分給某一個特定的專家來進行運行
13:21.895–13:23.095
然后最后输出结果
然後最後輸出結果
13:23.095–13:25.735
是这么样的一个MOE的基本架构
是這麼樣的這個 MOE 的基本架構
13:25.735–13:27.495
这个其实大家了解一下就行
這個其實大家了解一下就行
13:27.495–13:29.715
因为其实肯对我们开发人员来说
因為其實對我們開發人員來說
13:29.715–13:31.155
关于它底层的怎么架构
關於它底層的怎麼架構
13:31.155–13:33.395
模型的底层的架构
模型的底層架構
13:33.395–13:35.535
其实一般来说影响并不会特别大
其實一般來說影響並不會特別大
13:35.535–13:38.055
然后同时他现在推理是13个档位
然後同時他現在推理是13個檔位
13:38.055–13:39.195
这个还比较好记
這個還比較好記
13:39.195–13:41.175
相比于GPT的5个档位来说
相對於GPT的5個檔位來說
13:41.175–13:43.295
还比较容易就能够记住
還比較容易就能夠記住
13:43.295–13:45.355
然后关于他的agent的性能
然後關於他的agent的性能
13:45.355–13:47.455
实际上是进步的是非常明显的
實際上是進步得非常明顯的
13:47.455–13:49.415
他有很多的benchmark的对比
他有很多benchmark的對比
13:49.415–13:49.855
对不对
對不對
13:49.855–13:50.515
大家可以看到
大家可以看到
13:50.515–13:53.735
基本上是相比上一代是提升了30%以上
基本上是相比上一代是提升了30%以上
13:53.735–13:55.795
这个大家可以自己去看一下
這個大家可以自己去看一下
13:55.795–13:59.875
然后下面还有关于一些海外用户的反馈
然後下面還有關於一些海外用戶的反饋
13:59.875–14:01.995
包括他的智力的提升等等
包括他的智力的提升等等
14:01.995–14:05.175
这个就作为课外的参考
這個就作為課外的參考
14:05.175–14:06.455
大家可以自己去看一下
大家可以自己去看一下
14:06.455–14:07.855
如果想更多的了解一下
如果想更多的了解一下
14:07.855–14:10.355
关于DeepSeq V4 Flash这个模型的
關於DeepSeq V4 Flash這個模型的
14:10.355–14:11.275
这个基本情况的话
這個基本情況的話
14:11.275–14:12.095
这里面可以了解一下
這裡面可以了解一下
14:12.095–14:12.735
然后同时呢
然後同時呢
14:12.735–14:14.115
对于想要本地部署同学
對於想要本地部署的同學
14:14.115–14:15.515
下面其实这一段
下面其實這段
14:15.515–14:17.855
是给大家专门准备的
是給大家專門準備的
14:17.855–14:19.475
就如果你是想本地部署的话
就是如果你是想本地部署的話
14:19.475–14:20.255
那么这里呢
那麼這裡呢
14:20.255–14:21.115
有各式各样的
有各式各樣的
14:21.115–14:22.075
不同类型的
不同類型的
14:22.075–14:23.315
这个本地部署的
這個本地部署的
14:23.315–14:26.315
这个它的本地部署的
這個它的本地部署的
14:26.315–14:29.235
所涉及到的模型的格式
所涉及到的模型的格式
14:29.235–14:30.595
量化的这个程度
量化的這個程度
14:30.595–14:32.775
以及对应的下载的这个入口
以及對應的下載的這個入口
14:32.775–14:33.515
等等等等
等等等等
14:33.515–14:35.195
从Q2到Q4不等
從Q2到Q4不等
14:35.195–14:36.575
各式各样的不同
各式各樣的不同的
14:36.575–14:38.435
他们家做的量化这个版本
他們家做的量化這個版本
14:38.435–14:39.315
大家都可以去看一下
大家都可以去看一下
14:39.315–14:42.735
然后都可以去找到对应的下载地址来进行下载
然後都可以去找到對應的下載地址來進行下載
14:42.735–14:45.895
然后同时下面还有关于各个不同量化的版本
然後同時下面還有關於各個不同量化的版本
14:45.895–14:49.855
他们所需要的一些基本的一些硬件方面的一些说明
他們所需要的一些基本的一些硬件方面的一些說明
14:49.855–14:52.515
这个其实纯粹就是一个参考表了
這其實就只是一張參考表
14:52.515–14:54.595
大家自己拿到之后就可以对照着去参考
大家拿到之後就可以對照著參考

影片筆記:DeepSeek V4正式版+Codex工业Agent开发实战!从零手搓AI数据分析Agent,Responses API调用流程与Codex核心功能详解! p02 02.DeepSeek-V4正式版模型入门介绍

一句話總結

本段內容詳細介紹了 DeepSeek V4 正式版的發布歷程、技術架構(284B MOE 模型)、性能提升(Flash 版本提升 30%),並強調其全面兼容 OpenAI Responses API 以無縫接入 Codex 開發生態,同時提供了本地部署的硬體門檻參考及後續課程規劃。

核心重點

  • 發布時間線:DeepSeek V4 於 4 月以 Preview(預覽版)亮相,7 月 31 日推出 V4 Flash 版本,近期正式發布 V4 正式版,結束了三個月的預覽期。
  • 技術架構與性能
  • V4 正式版與預覽版架構無變化,仍為 284B 參數的 MOE(混合專家)模型。
  • 每次推理激活參數約為 13B(註:筆記中提及口誤曾說 3B,後修正為 13B)。
  • 正式版主要通過「後訓練」(Post-training)提升性能,Flash 版本性能較原版提升近 30%。
  • 提及 Dspark 論文,在不改價格情況下推理速度提升 80%。
  • 生態整合與 API
  • V4 正式版底層通信格式全面兼容 OpenAI 的 Responses API。
  • 可無縫接入 Codex,解決了此前需透過第三方工具(如 CCSWITCH)轉換格式的痛點,有利於 Agent 開發。
  • 未來 DeepSeek 可能推出自家 Harness Agent,但底層仍將兼容 Responses API。
  • 本地部署硬體要求
  • 穩定運行條件:單節點 8 卡 A100 伺服器。
  • 最小量化需求:Q2 量化,需佔用約 96G 顯存。
  • 替代方案:具備 128G 統一記憶體的设备(如 Mac Studio 或特定 NVIDIA 伺服器)可運行 Q2 或 QR 量化版本。
  • 測評表現
  • 對比 G2 5.2(年初國內旗艦開源大模型):全面領先。
  • 對比 Op4.8:部分指標有微小差距,但在前端開發、命令行操作等關鍵 Agent 指標上表現類似。
  • 與 GPT5.6 LUNA 中號模型對比:性能差別不大,屬於同一梯隊,但價格更便宜。
  • Pro 模型預測:若 Flash 進步 30%,Pro 模型性能預期將超越 GPT5.6 及 OPPO4.8,強於 KMIK3。

詳細大綱

一、 DeepSeek V4 發布與迭代歷史

  • 時間線
  • 4 月:首次亮相,名為 Preview(預覽版)。
  • 7 月 31 日:上線 V4 Flash 版本。
  • 近期:V4 正式版正式上線,結束三個月的預覽期。
  • 市場反響
  • 國內開發者使用廣泛,普及深度廣。
  • 正式版上線後,網上出現大量測評與性能評價。

二、 技術架構與性能提升

  • 模型規格
  • 參數量:284B。
  • 架構類型:MOE(混合專家模型)。
  • 推理激活參數:每次推理幾乎僅激活 3B(註:文中口誤提及 3B,後文修正為 13B,此處依原文記錄疑點)。
  • 版本劃分:分為 Flash(小杯)與 Pro(大杯)。
  • 性能變化
  • 架構無變化,核心底層功能未變。
  • 主要變化在於「後訓練」(Post-training)環節,加入了新的訓練方法。
  • Flash 版本提升:相比原版 Flash,性能提升近 30%。
  • 推理速度:提及 Dspark 論文,在不改價格情況下推理速度提升 80%。
  • 測評表現
  • 對比 G2 5.2(年初國內旗艦開源大模型):全面領先。
  • 對比 Op4.8:部分指標有微小差距,但在前端開發、命令行操作等關鍵 Agent 指標上表現類似。
  • 基準測試:Terminal Bench、DeepSWE、Agent Last Exam 等。
  • 邏輯推理與 SVG 代碼理解:透過「看它邏輯推理能力」及「SVG 代碼理解能力」測試。
  • 與 GPT5.6 LUNA 中號模型對比:性能差別不大,屬於同一梯隊,但價格更便宜。
  • Pro 模型預測:若 Flash 進步 30%,Pro 模型性能預期將超越 GPT5.6 及 OPPO4.8,強於 KMIK3。

三、 開發生態與 API 整合

  • Responses API
  • 定義:OpenAI 於去年 3 月 11 日發布的 Agent 定義與通信範式,類似於 LongChain 或 Agent Loop。
  • 作用:將模型、提示詞、工具綁定,快速搭建 Agent。
  • V4 狀態:V4 正式版底層通信格式全面兼容 Responses API。
  • Codex 接入
  • 優勢:V4 正式版可無縫接入 Codex,無需中間轉換環節。
  • 影響:對於國內開發者影響巨大,解決了此前 DeepSeek 缺乏官方 Harness Agent 的問題,允許開發者直接使用 Codex 進行開發。
  • 對比:此前需透過 CCSWITCH 等工具接入,存在格式轉換瓶頸。
  • 未來展望
  • DeepSeek 未來可能推出自家 Harness Agent(名稱未定,內測邀請已發,預計 8 月上線)。
  • 即使推出自家工具,底層仍將兼容 Responses API,確保與 Codex 的互通性。

四、 本地部署硬體要求

  • 硬體門檻
  • 穩定運行條件:單節點 8 卡 A100 伺服器。
  • 最小量化需求:Q2 量化,需佔用約 96G 顯存。
  • 替代方案:
  • Mac Studio:具備 128G 統一記憶體,可運行 Q2 量化下的 DeepSig V4 Flash。
  • NVIDIA 伺服器:具備 128G 統一記憶體,可運行 QR 量化下的 Dipsick V4 Flash。
  • 資源獲取
  • 權重已開放,提供從 Q2 到 Q4 等不同量化版本的下載入口。

五、 課程內容安排

  • 第一部分:DeepSeek V4 Flash (0731) 模型基本情況。
  • 第二部分:Responses API 接口的具體使用與底層交互協議。
  • 第三部分:Codex 開發實踐。
  • 涵蓋桌面端 APP 使用。
  • 重點講解 CLI(命令行環境)操作,強調其對靈活高效完成複雜系統開發的重要性。

工具 / 模型 / 名詞整理

  • 模型名稱
  • Deepseek v4 (Preview / 正式版)
  • Deepseek v4 Flash
  • Deepseek v4 Pro
  • Deepseek V1
  • G2 5.2
  • Op4.8 (或 OPPO4.8)
  • GPT5.6 (LUNA 地球模型 / 中號模型)
  • KIMI K3 (或 KMIK3)
  • 產品與工具
  • Codex (含桌面端 APP 及 CLI 命令行環境)
  • Responses API (OpenAI 發布)
  • LongChain (開發框架)
  • CCSWITCH (工具)
  • Dspark (論文/伺服器提及)
  • DeepseekTY (項目,後改名為 Resenix)
  • Resenix (項目)
  • Mac Studio (硬體)
  • A100 (顯卡/伺服器)
  • NVIDIA (硬體品牌)
  • 測試與基準
  • Terminal Bench
  • DeepSWE
  • Agent Last Exam
  • SVG 代碼理解能力測試
  • 探索細胞結構測試
  • 發動機結構拆解測試

操作流程整理

  • 模型選擇與部署流程
  1. 根據硬體條件選擇模型版本:
  • 若擁有單節點 8 卡 A100 伺服器,可穩定運行。
  • 若使用 Mac Studio 或具備 128G 統一記憶體的 NVIDIA 伺服器,可選擇 Q2 或 QR 量化版本。
  1. 下載權重:從官方入口下載從 Q2 到 Q4 等不同量化版本的權重。
  • Agent 開發流程
  1. 利用 DeepSeek V4 正式版底層對 Responses API 的兼容性。
  2. 直接接入 Codex(桌面端或 CLI),無需透過 CCSWITCH 等第三方工具進行格式轉換。
  3. 在 Codex 中綁定模型、提示詞與工具,快速搭建 Agent。
  4. (未來選項)若 DeepSeek 推出自家 Harness Agent,仍可透過兼容 Responses API 的方式與 Codex 互通。

值得注意的限制或風險

  • 硬體門檻限制
  • 本地部署對硬體要求較高,穩定運行需單節點 8 卡 A100。
  • 量化版本(Q2)仍需約 96G 顯存,僅具備 128G 統一記憶體的设备(如 Mac Studio)可運行,存在硬體兼容性限制。
  • 性能預期風險
  • Pro 模型超越 GPT5.6 及 OPPO4.8 的預測基於 Flash 版本進步 30% 的假設,實際表現需視具體測評而定。
  • 生態依賴風險
  • 目前高度依賴 OpenAI 的 Responses API 標準來實現與 Codex 的無縫接入,若 API 標準發生重大變更,可能影響開發流程。

逐字稿辨識疑點

  • 參數激活數量矛盾
  • 文中先提到「3B 的每次推理幾乎的參數量」,後文又提到「推理是 13 個檔位...推理是 13 個...激活 13B 的參數」。需查證 V4 Flash 實際激活參數為 3B 還是 13B。
  • 模型名稱拼寫
  • 「DeepSig V4 Flash」:疑為 DeepSeek 的聽寫錯誤。
  • 「Dipsick V4 Flash」:疑為 DeepSeek 的聽寫錯誤。
  • 「OPPO4.8」:疑為 Op4.8 或特定模型名稱,需查證。
  • 「KMIK3」:疑為 KIMI K3 的聽寫錯誤。
  • 「GPT5.6」:需查證是否為 GPT-4o 或其他版本的口誤,或確實存在此版本。
  • 「LUNA 地球模型」:需查證 GPT5.6 是否對應 LUNA 模型,或為口誤。
  • 產品名稱
  • 「DeepseekTY」:需查證該項目確切名稱,文中提及後改名為 Resenix。
  • 「Cloud code」:文中提及「Cloud Code」,需確認是否指 Google Cloud Code 或其他特定產品,或為口誤。
  • 「Dspark」:文中提及「Dspark 這樣一篇論文」及「英偉達 Dspark 那樣的伺服器」,需查證 Dspark 具體指代何種技術或硬體。
  • 技術術語
  • 「QR 量化」:需查證量化格式是否為 QR,通常常見為 Q4、Q5 等,QR 可能為口誤或特定格式。
  • 「後訓練」:文中強調 V4 正式版僅在「後訓練」環節有變化,需確認此技術描述是否準確對應官方技術文檔。

可延伸追問

  • DeepSeek V4 Flash 版本的實際激活參數究竟是多少?是 3B 還是 13B?
  • 「GPT5.6」和「LUNA 地球模型」具體指代哪款模型?是否存在該版本號?
  • 「Dspark」論文或伺服器具體是指什麼技術?與 NVIDIA 的關係為何?
  • 「QR 量化」具體是什麼格式?與常見的 Q4_K_M 等格式有何區別?
  • DeepSeek 即將推出的自家 Harness Agent 預計何時正式上線?其與 Responses API 的具體兼容機制為何?
  • 對於普通開發者,使用 Mac Studio (128G) 運行 Q2 量化版本的 DeepSeek V4 Flash,在實際 Agent 開發中的體驗與性能表現如何?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習