start	end	text
0	7400	好,那么Deepseek v4的模型实际上是在4月份首次亮相。当时它其实是叫preview,预览版。
7400	11600	当然对于Deepseek这个模型来说,国内开发者应该是用的非常多了。
11600	16200	这个模型不仅性能非常不错,而且关键价格很便宜,还可以本地部署。
16200	24600	关键是Deepseek在过去的这么一年的时间迭代的过程当中,从V1开始,其实始终都是给人一种走技术黑科技的感觉。
24600	29600	对不对,不仅运行速度很快,前段时间还发了Dspark这样一篇论文,对不对。
29600	31520	在不改任何价格的这个情况下
31520	32120	然后呢
32120	34780	这个整个的推理速度提升了80%
34780	35540	然后呢
35540	36120	同时啊
36120	37840	这个并且啊
37840	39420	它还可以支持各式各样的
39420	41200	现在有各式各样的这个本地部署
41200	43960	也支持适配国内的各式各样GPU这样的型号啊
43960	44200	所以呢
44200	45960	DeepSeek这个模型应该是
45960	48160	国内所有开源模型的这个来看
48160	49540	普及深度非常非常广啊
49540	50380	这样的一块模型啊
50380	51580	那么今年4月份啊
51580	52740	V4版本正式上线
52740	54100	我们V4版本的上线实际上
54100	56460	是对整个的DeepSeek这个模型的这个性能呢
56460	58780	是往前提了很大一步啊
58780	60780	在当时其实是性能非常不错的
60780	62080	这样的一款模型
62080	62940	然后时隔三个月
62940	65620	Deepseek v4的正式版模型是正式上线的
65620	67840	当然正式版模型上线之后
67840	70480	网上也是铺天盖地的测评
70480	72700	性能方面评价等等
72700	74760	那么Deepseek v4正式版模型
74760	78920	相比于此前的4月份发布的预览版的模型来说
78920	81720	其实它整个的架构是没有发生任何变化的
81720	83680	那么它首先在7月31号的时候
83680	86540	是先上线了v4的Flash版本
86540	88680	那么整个Deepseek v4其实有两款模型
88680	92720	一个是Flash 一个是Pro 就是一个大杯一个小杯
92720	95840	然后Flash模型实际上是小杯这个模型
95840	101240	然后Flash的模型它原始的V4版本就是284B的参数
101240	104180	然后是3B的每次推理几乎的参数量
104180	109680	现在正式版也是这么一个模型的尺寸和核心的底层的功能
109680	110760	其实都是没有发生变化的
110760	115100	那么它实际上最后整个的正式版下面预览版来说
115100	117860	其实只是在模型后训练的环节
117860	119960	加入了很多的
119960	121580	现在暂时还不为人知的
121580	122760	一些训练的方法
122760	123460	当然之后
123460	124700	这个V4 Pro这个模型
124700	127140	出来之后应该会有相关的技术手册
127140	128140	到时候大家就能看到
128140	129340	他是怎么做着后训练的
129340	131560	但是基于后训练的过程
131560	133480	基本上我们说V4 Flash这个模型
133480	135240	相比于原版的Flash模型
135240	137080	其实性能是提升将近30%
137080	138880	下面其实有非常完整的
138880	140880	官方给出的性能评测的报告
140880	141700	大家可以看一看
141700	143240	各式各样的测评结果
143240	145060	那么官方给出的V4 Flash
145060	145800	正式版本
145800	147260	实际上是对比较G2 5.2的
147260	151760	那GM5.2实际上在年初的时候也算是国内旗舰的开源大模型了
151760	157500	大家能看到现在整个的国内的开源大模型的发展和迭代的速度实际上是非常快的
157500	162620	那么整个的Deepseek V4 Flash在Terminal Bench命运行的测评
162620	166780	还有像下面大家比较熟悉的像DeepSWE对不对
166780	168580	一些前端的一些评测的框架
168580	170480	还有Agent Last Exam
170480	174320	现在已经不是人类最终考试了
174320	175740	是Agent的最终考试对不对
175740	177040	评到多少多少分等等
177040	181560	然后你会发现其实整体的评分相比于这样5.2来说
181560	182620	基本上是全面领先
182620	185680	然后相比于Op4.8来说有一些小小的差距
185680	189160	但是实际上在很多我们平时用的比较多的一些关键指标上
189160	191860	比如说一些前端的一些开发或者是前命令行
191860	192180	对不对
192180	194300	它现在都是通过运行这些agent
194300	197560	而驱动这些agent运行非常关键的一个模型的性能指标
197560	198400	就是它的命令行
198400	200820	通过命令行去便写各式各样的命令
200820	202080	去操纵本机电脑等等
202080	203940	我们在这些指标上其实你会发现
203940	207300	Deepseek v4 flash和OPUS 4.8基本上是非常类似的
207300	210200	这也是使得现在官方可以说
210200	213180	整个的v4正式版的模型
213180	214980	它的agent性能是大幅增强
214980	216680	那么这个其实是我们能看到的
216680	219220	现在整个的模型的基本情况
219220	223680	然后除了它整体的所谓的agent性能大幅增强之外
223680	226380	其实它现在还全面的拥抱了Responses API
226380	227780	然后可以无缝接入Codex
227780	229380	这个其实对于国内开发者来说
229380	231560	应该是非常巨大的影响
231560	234300	当然在此之前
234300	238100	其实DeepSeek模型和很多其他的一些模型
238100	240360	通过比如说像CCSWITCH这样的工具
240360	241760	也是可以接入Codex
241760	244340	只不过当时官方的模型
244340	245560	它本身的响应格式
245560	248260	其实和Codex并不是完全兼容
248260	250460	所以它中间需要有个转换的环节
250460	251740	既然有转换的环节的话
251740	255940	那么距离真实的大规模深度的工程化的应用
255940	257020	其实就还有距离
257020	261160	现在它其实已经在新版本的训练过程当中
261160	264460	它的输出格式是完全兼容Codex的响应格式的
264460	267180	所以使得整个V4的正式版模型
267180	269520	是可以接入到Codex里边去的
269520	270860	这点其实对于开发者来说
270860	272900	可以说是非常巨大的影响
272900	274020	因为之前
274020	276460	现在我们进行Agent的开发
276460	278160	或者是进行AI编程的时候
278160	280500	在写程序做各式各样项目
280500	280900	少不了
280900	283120	你需要有一个编程的框架
283120	285400	需要有一个Harness的Agent
285400	285800	对不对
285800	287280	那对于DeepSeek的用户来说
287280	288840	其实就少了这么一块
288840	293060	尽管今天上面有一个叫DeepseekTY的这样的一个项目
293060	294860	当然这个项目后面改名了叫Resenix
294860	299120	然后最后还被Deepseek属于一个半收编的这样的状态
299120	302060	但是Deepseek确实它没有官方的这样的Harness Agent
302060	304100	所以你要使用Deepseek这个模型
304100	307040	你得去用别人家的Agent开发工具
307040	310940	现在Deepseek全面拥抱Responsees API和Codex之后
310940	314880	你就可以无缝的使用Codex来去使用Deepseek来进行开发
314880	317800	当然我们今天最后的案例实际上也是使用Codex
317800	320900	用Deepseek模型来进行的开发
320900	322740	也是走这样的一个完整的链路
322740	324860	当然Codex和Responsees API
324860	325740	它们什么关系
325740	329020	为什么它要兼容Responsees API
329020	330780	然后同时可以介入Codex
330780	333220	这里其实有一个大家需要知道的
333220	334720	是Responsees API
334720	337600	实际上是去年3月11号
337600	340740	然后OpenAI他们发布的一个新的
340740	342420	一个Agent定义的
342420	344120	Agent通信的一种范式
344120	345960	或者你可以把它理解成是
345960	348320	OpenAI他们发布的自己家的LongChain
348320	349440	你可以这么来经理解
349440	351520	LongChain Agent开发框架
351520	353280	或者是一个Agent Loop
353280	353820	对不对
353820	356660	把这个模型把提日词把工具绑在一块
356660	358360	他们就可以组合成一个Agent
358360	359280	是这么一回事
359280	361100	所谓的Response API
361100	363660	其实是OpenAI他们家出的一套
363660	366540	就类似于像LongChain这样的一个开发框架
366540	369260	或者说它这种大模型的通信范式
369260	370880	那么借助Response API
370880	373500	实际上我们可以非常快速搭建起一些Agent Loop
373500	377580	那实际上Codex背后的通信格式实际上就是这个Response API
377580	380960	所以呢现在啊你说我们说DeepseekV4这个模型
380960	383120	它能够无缝接入Codex里边去啊
383120	385580	非常核心的原因是因为它底层的通信格式呢
385580	387940	是全面兼容啊这个Response API的
387940	390740	当然这个Response API具体是什么
390740	392680	它是怎么兼容的啊
392680	393760	如何来进行运行啊
393760	396060	这个呢我们一会在公开课的这个进行过程当中
396060	398040	我们会来进行详细的这个解释啊
398040	399720	但是这里首先大需要知道的是呢
399720	402760	对于Code对于DeepseekV4的正式版模型来说啊
402760	407120	他呢实际上是已经确定了是全面兼容这个Response API的啊
407120	408400	也是因为这样的原因呢
408400	410440	所以他现在呢能够无缝接入Codex
410700	414020	那这样的一套开发的规则其实对于现在开发者来说啊
414020	417420	还是非常重要的一个这个需要掌握的一个地方啊
417420	420360	其实也是因为对于Deepseek的用户来说啊
420360	423860	未来他虽然自家也会出Harness Agent啊
423860	427300	这个叫Deepseek的这个Harness Agent现在名字还没定啊
427300	429760	但他们今天发了一个这个内测的这个邀请啊
429760	431500	已经开始进行测试了啊
431500	433040	应该8月份很快就会上线
433300	435860	但是呢 现在啊 对于v4这个模型来说
435860	438920	那他已经是能够全面兼容这个responses api了
438920	443020	所以哪怕啊 这个deep seek他们未来推出了自己的cloud code啊
443020	445320	推出自己的这个harness agent
445320	449160	那么他呢 其实底层也是兼容这个responses api的啊
449160	450440	是怎么样的这个情况啊
450440	453000	所以呢 现在啊 我们在进行开发的这个时候呢
453000	456340	哎 如果你是之前是使用着codex来进行开发的话
456340	460180	那现在确实是可以无缝迁移到deep seek的这个模型啊 来进行开发了
460180	462160	当然也有同学说关于这个deep seek
462160	464680	为什么不迁移到这cloud code里面去
464680	465060	对不对
465060	467160	这cloud code就主要是这个
467160	467920	怎么说呢
467920	469660	生态相对来说还是比较封闭
469660	470940	这个用呢是能用
470940	471960	但是不太稳定
471960	473720	那么对于V4这个模型来说
473720	474780	其实我相信过去段时间
474780	476140	大家应该已经看到了很多
476140	477120	各式各样的
477120	479140	关于V4这个模型的这个评测
479140	479740	对不对
479740	483540	这个这姑骑自行车
483540	484640	这个鸭子骑自行车
484640	488520	这其实是看它逻辑推理能力
488520	491960	和SVG的代码理解能力的这样的一个测试
491960	494300	还有就比如说大家现在看到的
494300	498640	Dipzig V4 Flash和GPT5.6的LUNA地球模型
498640	501680	中号模型来进行性能的测试对比
501680	506340	其实基本上V4 Flash和GPT5.6的LUNA模型是差别不大的
506340	509060	他们二者其实属于同一个档次和梯队
509060	511040	当然这个价格上其实要便宜很多
511040	514820	然后还有就比如说什么探索细胞结构
514820	515600	对不对
516095	522695	然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。
522695	530395	其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。
530395	532575	但实际上Pro这个模型应该很快会上
532575	534075	然后对于Pro这个模型来说
534075	538475	如果按照像Flash进步30%性能来看的话
538475	542635	那么基本上我们说Deptic V4的Pro这个模型的性能
542635	544775	肯定是要超越GPT5.6的
544775	546235	也是超越OPPO4.8的
546235	549375	这个应该是要比KMIK3这个模型是要更强的
549375	551115	所以大家也非常期待
551115	551455	对不对
551455	552755	这个Pro模型最终创新
552755	558135	当然我们今天来讲Flash模型完整的使用的方法和流程
558135	560175	相关的这些代码呀
560175	562215	开发流程的开发范式啊
562215	564735	包括你对Responsees API的这个理解呀
564735	566375	是可以全部迁移到啊
566375	568215	这个V4 Pro这个模型当中去的啊
568215	569215	尽管他现在还没发布啊
569215	569595	但是呢
569595	571775	他们底层其实是完全一样的啊
571775	572835	这个其实没有任何问题啊
572835	574315	当然其实这里还有一个啊
574315	575855	可能同学们会非常感兴趣的地方
575855	578615	在于说像V4 Flash这个模型的话啊
578615	580855	他如果是要本地来进行部署的话
580855	582195	他有什么样的这个啊
582195	583595	什么样的这个硬件条件啊
583595	584495	一般来说啊
584495	586835	我们说这个呃单卡啊
586835	593175	单节点8卡A100的服务器实际上是肯定是可以稳定的去运行V4 Flash这个模型的
593175	597455	那么最小它的量化大概是Q2量化的情况下
597455	600455	它所需要占用的显存实际上是96G
600455	605775	所以如果假设你是一个比如说128G的Mac Studio统一内存
605775	611155	那么也是可以运行Q2量化下的DeepSig V4 Flash这样的模型
611155	613395	这个其实是一个性价比非常高的选择
613395	615155	或者如果你是比如英伟达
615155	617815	Dspark那样的一个服务器的话
617815	620415	那么其实有128G的统一内存
620415	623015	也是可以运行QR量化下的
623015	625275	Dipsick V4 Flash这个模型
625275	628675	这个是它的一个基本本地部署的一个硬件门槛
628675	631215	当然咱们今天晚上来介绍的顺序
631215	635395	实际上首先会来讲解关于Dipsick V4 Flash 0731
635395	636615	这样的一个模型的基本情况
636615	638215	这个我们刚刚已经讲到过了
638215	638515	对不对
638515	641755	然后接下来我们会给大家介绍关于它第一层的
641755	644855	开发过程当中非常重要的
644855	646615	这个Responses API
646615	649295	这个接口到底应该如何来进行使用
649295	649835	对吧
649835	650655	然后呢
650655	651695	就是这个Codex
651695	654155	Codex其实很多同学之前应该非常熟悉
654155	655535	这个桌面端的使用
655535	655815	对不对
655815	657675	这个APP的这样的使用
657675	659815	那我们在实际在进行开发的过程当中
659815	661455	尤其是要完成
661455	662535	就被大家现在看到的
662535	664435	一些比较复杂的
664435	667675	这样的一些系统的开发
667675	669115	比较复杂的
669115	670935	这个数据分析的
670935	672555	一整个系统的开发的话
672555	676255	那么其实你还是需要用的CLI
676255	677115	用的CLI
677115	678955	用的命令行这个环境来进行开发
678955	681175	其实是有很多同学特别担心
681175	682535	觉得命令行特别难
682535	683595	很难操作
683595	684415	很难上手
684415	685715	其实不至于
685715	688095	我们一会带大家一步一步来看
688095	690755	其实也没有那么的复杂
690755	692055	它只是可能页面行
692055	696135	命框长的样子有点吓人而已
696135	698175	但实际上对于现在的开发者来说
698175	700555	你肯定是需要掌握命令行
700555	704155	我们这样的开发工具才能够更加灵活高效便捷的AE
704155	706235	使用这些agent来完成这些项目的开发
706235	710075	所以这个是我们今天整个课程内容的基本安排
710075	711675	那么三者之间是什么样的关系
711675	713035	我们稍微跟大家说一下
713035	715475	首先模型这个flash这个其实没什么问题
715475	718595	然后交互协议统一是使用Response API
718595	721275	来进行底层的交互协议的说明
721275	723035	这个稍微会有一些偏底层
723035	724235	这个我们一会会说
724235	728195	然后接下来使用Codex来去完成各式各样的开发工作
728195	733355	那么下面其实有一些关于像deep seek v4 flash模型的发展历程
733355	734075	对不对
734075	737015	今年4月份发布的v4
737015	738495	然后现在两个版本
738495	739415	之前是preview
739415	742095	现在是最新版正式版的模型
742095	742815	眼镜
742815	743775	性能指标
743775	744775	变化等等
744775	745935	然后同时
745935	746755	这个权重
746755	749195	v4 flash这个权重也是已经开放了的
749195	751355	大家是可以直接下载来进行使用的
751355	754215	然后它整个的v4 flash这个模型
754215	755495	其实它的价格没有变
755495	758075	只是后训练是发生了一些变化
758075	758955	所谓后训练呢
758955	759515	其实指的是
759515	760975	他经过了前期的完整的
760975	761835	这个预训练之后
761835	763555	其实模型已经有了基础的
763555	765815	记忆基础的这个知识边界
765815	767255	然后基础的这样的能力
767255	768275	然后所谓后训练呢
768275	769555	实际上是训练他的
769555	771415	这个响应的这个范式
771415	772475	你可以这么来进行理解
772475	773615	他就经过后训练
773615	775755	他整个的性能就有飞跃式的
775755	776295	这个增长
776295	778615	他呢总共是284B的
778615	780455	MOE这个模型
780455	782435	这个混合专家模型
782435	783135	然后呢
783135	784955	他其实不会像KIMI K3那样
784955	785795	那么稀疏
785795	786715	但是他其实因为
786715	788175	也是一个MOE这样的模型
788175	791275	然后每次推理是激活13B的参数
791275	792175	你可以这么来进行理解
792175	793255	所谓MOE这个模型
793255	795315	也就指的是它有很多的专家
795315	798495	然后每次在进行每一个Token的预测的时候
798495	801895	它会分给某一个特定的专家来进行运行
801895	803095	然后最后输出结果
803095	805735	是这么样的一个MOE的基本架构
805735	807495	这个其实大家了解一下就行
807495	809715	因为其实肯对我们开发人员来说
809715	811155	关于它底层的怎么架构
811155	813395	模型的底层的架构
813395	815535	其实一般来说影响并不会特别大
815535	818055	然后同时他现在推理是13个档位
818055	819195	这个还比较好记
819195	821175	相比于GPT的5个档位来说
821175	823295	还比较容易就能够记住
823295	825355	然后关于他的agent的性能
825355	827455	实际上是进步的是非常明显的
827455	829415	他有很多的benchmark的对比
829415	829855	对不对
829855	830515	大家可以看到
830515	833735	基本上是相比上一代是提升了30%以上
833735	835795	这个大家可以自己去看一下
835795	839875	然后下面还有关于一些海外用户的反馈
839875	841995	包括他的智力的提升等等
841995	845175	这个就作为课外的参考
845175	846455	大家可以自己去看一下
846455	847855	如果想更多的了解一下
847855	850355	关于DeepSeq V4 Flash这个模型的
850355	851275	这个基本情况的话
851275	852095	这里面可以了解一下
852095	852735	然后同时呢
852735	854115	对于想要本地部署同学
854115	855515	下面其实这一段
855515	857855	是给大家专门准备的
857855	859475	就如果你是想本地部署的话
859475	860255	那么这里呢
860255	861115	有各式各样的
861115	862075	不同类型的
862075	863315	这个本地部署的
863315	866315	这个它的本地部署的
866315	869235	所涉及到的模型的格式
869235	870595	量化的这个程度
870595	872775	以及对应的下载的这个入口
872775	873515	等等等等
873515	875195	从Q2到Q4不等
875195	876575	各式各样的不同
876575	878435	他们家做的量化这个版本
878435	879315	大家都可以去看一下
879315	882735	然后都可以去找到对应的下载地址来进行下载
882735	885895	然后同时下面还有关于各个不同量化的版本
885895	889855	他们所需要的一些基本的一些硬件方面的一些说明
889855	892515	这个其实纯粹就是一个参考表了
892515	894595	大家自己拿到之后就可以对照着去参考
