好,那么Deepseek v4的模型实际上是在4月份首次亮相。当时它其实是叫preview,预览版。 当然对于Deepseek这个模型来说,国内开发者应该是用的非常多了。 这个模型不仅性能非常不错,而且关键价格很便宜,还可以本地部署。 关键是Deepseek在过去的这么一年的时间迭代的过程当中,从V1开始,其实始终都是给人一种走技术黑科技的感觉。 对不对,不仅运行速度很快,前段时间还发了Dspark这样一篇论文,对不对。 在不改任何价格的这个情况下 然后呢 这个整个的推理速度提升了80% 然后呢 同时啊 这个并且啊 它还可以支持各式各样的 现在有各式各样的这个本地部署 也支持适配国内的各式各样GPU这样的型号啊 所以呢 DeepSeek这个模型应该是 国内所有开源模型的这个来看 普及深度非常非常广啊 这样的一块模型啊 那么今年4月份啊 V4版本正式上线 我们V4版本的上线实际上 是对整个的DeepSeek这个模型的这个性能呢 是往前提了很大一步啊 在当时其实是性能非常不错的 这样的一款模型 然后时隔三个月 Deepseek v4的正式版模型是正式上线的 当然正式版模型上线之后 网上也是铺天盖地的测评 性能方面评价等等 那么Deepseek v4正式版模型 相比于此前的4月份发布的预览版的模型来说 其实它整个的架构是没有发生任何变化的 那么它首先在7月31号的时候 是先上线了v4的Flash版本 那么整个Deepseek v4其实有两款模型 一个是Flash 一个是Pro 就是一个大杯一个小杯 然后Flash模型实际上是小杯这个模型 然后Flash的模型它原始的V4版本就是284B的参数 然后是3B的每次推理几乎的参数量 现在正式版也是这么一个模型的尺寸和核心的底层的功能 其实都是没有发生变化的 那么它实际上最后整个的正式版下面预览版来说 其实只是在模型后训练的环节 加入了很多的 现在暂时还不为人知的 一些训练的方法 当然之后 这个V4 Pro这个模型 出来之后应该会有相关的技术手册 到时候大家就能看到 他是怎么做着后训练的 但是基于后训练的过程 基本上我们说V4 Flash这个模型 相比于原版的Flash模型 其实性能是提升将近30% 下面其实有非常完整的 官方给出的性能评测的报告 大家可以看一看 各式各样的测评结果 那么官方给出的V4 Flash 正式版本 实际上是对比较G2 5.2的 那GM5.2实际上在年初的时候也算是国内旗舰的开源大模型了 大家能看到现在整个的国内的开源大模型的发展和迭代的速度实际上是非常快的 那么整个的Deepseek V4 Flash在Terminal Bench命运行的测评 还有像下面大家比较熟悉的像DeepSWE对不对 一些前端的一些评测的框架 还有Agent Last Exam 现在已经不是人类最终考试了 是Agent的最终考试对不对 评到多少多少分等等 然后你会发现其实整体的评分相比于这样5.2来说 基本上是全面领先 然后相比于Op4.8来说有一些小小的差距 但是实际上在很多我们平时用的比较多的一些关键指标上 比如说一些前端的一些开发或者是前命令行 对不对 它现在都是通过运行这些agent 而驱动这些agent运行非常关键的一个模型的性能指标 就是它的命令行 通过命令行去便写各式各样的命令 去操纵本机电脑等等 我们在这些指标上其实你会发现 Deepseek v4 flash和OPUS 4.8基本上是非常类似的 这也是使得现在官方可以说 整个的v4正式版的模型 它的agent性能是大幅增强 那么这个其实是我们能看到的 现在整个的模型的基本情况 然后除了它整体的所谓的agent性能大幅增强之外 其实它现在还全面的拥抱了Responses API 然后可以无缝接入Codex 这个其实对于国内开发者来说 应该是非常巨大的影响 当然在此之前 其实DeepSeek模型和很多其他的一些模型 通过比如说像CCSWITCH这样的工具 也是可以接入Codex 只不过当时官方的模型 它本身的响应格式 其实和Codex并不是完全兼容 所以它中间需要有个转换的环节 既然有转换的环节的话 那么距离真实的大规模深度的工程化的应用 其实就还有距离 现在它其实已经在新版本的训练过程当中 它的输出格式是完全兼容Codex的响应格式的 所以使得整个V4的正式版模型 是可以接入到Codex里边去的 这点其实对于开发者来说 可以说是非常巨大的影响 因为之前 现在我们进行Agent的开发 或者是进行AI编程的时候 在写程序做各式各样项目 少不了 你需要有一个编程的框架 需要有一个Harness的Agent 对不对 那对于DeepSeek的用户来说 其实就少了这么一块 尽管今天上面有一个叫DeepseekTY的这样的一个项目 当然这个项目后面改名了叫Resenix 然后最后还被Deepseek属于一个半收编的这样的状态 但是Deepseek确实它没有官方的这样的Harness Agent 所以你要使用Deepseek这个模型 你得去用别人家的Agent开发工具 现在Deepseek全面拥抱Responsees API和Codex之后 你就可以无缝的使用Codex来去使用Deepseek来进行开发 当然我们今天最后的案例实际上也是使用Codex 用Deepseek模型来进行的开发 也是走这样的一个完整的链路 当然Codex和Responsees API 它们什么关系 为什么它要兼容Responsees API 然后同时可以介入Codex 这里其实有一个大家需要知道的 是Responsees API 实际上是去年3月11号 然后OpenAI他们发布的一个新的 一个Agent定义的 Agent通信的一种范式 或者你可以把它理解成是 OpenAI他们发布的自己家的LongChain 你可以这么来经理解 LongChain Agent开发框架 或者是一个Agent Loop 对不对 把这个模型把提日词把工具绑在一块 他们就可以组合成一个Agent 是这么一回事 所谓的Response API 其实是OpenAI他们家出的一套 就类似于像LongChain这样的一个开发框架 或者说它这种大模型的通信范式 那么借助Response API 实际上我们可以非常快速搭建起一些Agent Loop 那实际上Codex背后的通信格式实际上就是这个Response API 所以呢现在啊你说我们说DeepseekV4这个模型 它能够无缝接入Codex里边去啊 非常核心的原因是因为它底层的通信格式呢 是全面兼容啊这个Response API的 当然这个Response API具体是什么 它是怎么兼容的啊 如何来进行运行啊 这个呢我们一会在公开课的这个进行过程当中 我们会来进行详细的这个解释啊 但是这里首先大需要知道的是呢 对于Code对于DeepseekV4的正式版模型来说啊 他呢实际上是已经确定了是全面兼容这个Response API的啊 也是因为这样的原因呢 所以他现在呢能够无缝接入Codex 那这样的一套开发的规则其实对于现在开发者来说啊 还是非常重要的一个这个需要掌握的一个地方啊 其实也是因为对于Deepseek的用户来说啊 未来他虽然自家也会出Harness Agent啊 这个叫Deepseek的这个Harness Agent现在名字还没定啊 但他们今天发了一个这个内测的这个邀请啊 已经开始进行测试了啊 应该8月份很快就会上线 但是呢 现在啊 对于v4这个模型来说 那他已经是能够全面兼容这个responses api了 所以哪怕啊 这个deep seek他们未来推出了自己的cloud code啊 推出自己的这个harness agent 那么他呢 其实底层也是兼容这个responses api的啊 是怎么样的这个情况啊 所以呢 现在啊 我们在进行开发的这个时候呢 哎 如果你是之前是使用着codex来进行开发的话 那现在确实是可以无缝迁移到deep seek的这个模型啊 来进行开发了 当然也有同学说关于这个deep seek 为什么不迁移到这cloud code里面去 对不对 这cloud code就主要是这个 怎么说呢 生态相对来说还是比较封闭 这个用呢是能用 但是不太稳定 那么对于V4这个模型来说 其实我相信过去段时间 大家应该已经看到了很多 各式各样的 关于V4这个模型的这个评测 对不对 这个这姑骑自行车 这个鸭子骑自行车 这其实是看它逻辑推理能力 和SVG的代码理解能力的这样的一个测试 还有就比如说大家现在看到的 Dipzig V4 Flash和GPT5.6的LUNA地球模型 中号模型来进行性能的测试对比 其实基本上V4 Flash和GPT5.6的LUNA模型是差别不大的 他们二者其实属于同一个档次和梯队 当然这个价格上其实要便宜很多 然后还有就比如说什么探索细胞结构 对不对 然後還有比如說探索細胞結構,讓它去做各樣的開發工作。還有發動機的結構拆解等等。 其實現在V4的整體的模型性能已經是非常不錯了。儘管我們現在只開源了,只上線了Flash模型。 但实际上Pro这个模型应该很快会上 然后对于Pro这个模型来说 如果按照像Flash进步30%性能来看的话 那么基本上我们说Deptic V4的Pro这个模型的性能 肯定是要超越GPT5.6的 也是超越OPPO4.8的 这个应该是要比KMIK3这个模型是要更强的 所以大家也非常期待 对不对 这个Pro模型最终创新 当然我们今天来讲Flash模型完整的使用的方法和流程 相关的这些代码呀 开发流程的开发范式啊 包括你对Responsees API的这个理解呀 是可以全部迁移到啊 这个V4 Pro这个模型当中去的啊 尽管他现在还没发布啊 但是呢 他们底层其实是完全一样的啊 这个其实没有任何问题啊 当然其实这里还有一个啊 可能同学们会非常感兴趣的地方 在于说像V4 Flash这个模型的话啊 他如果是要本地来进行部署的话 他有什么样的这个啊 什么样的这个硬件条件啊 一般来说啊 我们说这个呃单卡啊 单节点8卡A100的服务器实际上是肯定是可以稳定的去运行V4 Flash这个模型的 那么最小它的量化大概是Q2量化的情况下 它所需要占用的显存实际上是96G 所以如果假设你是一个比如说128G的Mac Studio统一内存 那么也是可以运行Q2量化下的DeepSig V4 Flash这样的模型 这个其实是一个性价比非常高的选择 或者如果你是比如英伟达 Dspark那样的一个服务器的话 那么其实有128G的统一内存 也是可以运行QR量化下的 Dipsick V4 Flash这个模型 这个是它的一个基本本地部署的一个硬件门槛 当然咱们今天晚上来介绍的顺序 实际上首先会来讲解关于Dipsick V4 Flash 0731 这样的一个模型的基本情况 这个我们刚刚已经讲到过了 对不对 然后接下来我们会给大家介绍关于它第一层的 开发过程当中非常重要的 这个Responses API 这个接口到底应该如何来进行使用 对吧 然后呢 就是这个Codex Codex其实很多同学之前应该非常熟悉 这个桌面端的使用 对不对 这个APP的这样的使用 那我们在实际在进行开发的过程当中 尤其是要完成 就被大家现在看到的 一些比较复杂的 这样的一些系统的开发 比较复杂的 这个数据分析的 一整个系统的开发的话 那么其实你还是需要用的CLI 用的CLI 用的命令行这个环境来进行开发 其实是有很多同学特别担心 觉得命令行特别难 很难操作 很难上手 其实不至于 我们一会带大家一步一步来看 其实也没有那么的复杂 它只是可能页面行 命框长的样子有点吓人而已 但实际上对于现在的开发者来说 你肯定是需要掌握命令行 我们这样的开发工具才能够更加灵活高效便捷的AE 使用这些agent来完成这些项目的开发 所以这个是我们今天整个课程内容的基本安排 那么三者之间是什么样的关系 我们稍微跟大家说一下 首先模型这个flash这个其实没什么问题 然后交互协议统一是使用Response API 来进行底层的交互协议的说明 这个稍微会有一些偏底层 这个我们一会会说 然后接下来使用Codex来去完成各式各样的开发工作 那么下面其实有一些关于像deep seek v4 flash模型的发展历程 对不对 今年4月份发布的v4 然后现在两个版本 之前是preview 现在是最新版正式版的模型 眼镜 性能指标 变化等等 然后同时 这个权重 v4 flash这个权重也是已经开放了的 大家是可以直接下载来进行使用的 然后它整个的v4 flash这个模型 其实它的价格没有变 只是后训练是发生了一些变化 所谓后训练呢 其实指的是 他经过了前期的完整的 这个预训练之后 其实模型已经有了基础的 记忆基础的这个知识边界 然后基础的这样的能力 然后所谓后训练呢 实际上是训练他的 这个响应的这个范式 你可以这么来进行理解 他就经过后训练 他整个的性能就有飞跃式的 这个增长 他呢总共是284B的 MOE这个模型 这个混合专家模型 然后呢 他其实不会像KIMI K3那样 那么稀疏 但是他其实因为 也是一个MOE这样的模型 然后每次推理是激活13B的参数 你可以这么来进行理解 所谓MOE这个模型 也就指的是它有很多的专家 然后每次在进行每一个Token的预测的时候 它会分给某一个特定的专家来进行运行 然后最后输出结果 是这么样的一个MOE的基本架构 这个其实大家了解一下就行 因为其实肯对我们开发人员来说 关于它底层的怎么架构 模型的底层的架构 其实一般来说影响并不会特别大 然后同时他现在推理是13个档位 这个还比较好记 相比于GPT的5个档位来说 还比较容易就能够记住 然后关于他的agent的性能 实际上是进步的是非常明显的 他有很多的benchmark的对比 对不对 大家可以看到 基本上是相比上一代是提升了30%以上 这个大家可以自己去看一下 然后下面还有关于一些海外用户的反馈 包括他的智力的提升等等 这个就作为课外的参考 大家可以自己去看一下 如果想更多的了解一下 关于DeepSeq V4 Flash这个模型的 这个基本情况的话 这里面可以了解一下 然后同时呢 对于想要本地部署同学 下面其实这一段 是给大家专门准备的 就如果你是想本地部署的话 那么这里呢 有各式各样的 不同类型的 这个本地部署的 这个它的本地部署的 所涉及到的模型的格式 量化的这个程度 以及对应的下载的这个入口 等等等等 从Q2到Q4不等 各式各样的不同 他们家做的量化这个版本 大家都可以去看一下 然后都可以去找到对应的下载地址来进行下载 然后同时下面还有关于各个不同量化的版本 他们所需要的一些基本的一些硬件方面的一些说明 这个其实纯粹就是一个参考表了 大家自己拿到之后就可以对照着去参考