好,那么之前我们是了解了关于deep seek模型的Responsees API和Codex怎么样来进行接入。现在其实对于咱们的开发者的学习来说,前期肯定是要有一个基础的学习的这样的过程。当然其实我会觉得可能更长的学习的周期应该放在围绕一个又一个项目来进行开发试错,不断的来提取经验,然后最后优化完成一个系统开发的整个完整的链路。 那么大家现在看到的DS4-AI数据分析系统 实际上就是接下来带大家来手动一步一步来完成搭建的这样的开发的项目 当然我们这里同样是使用Deepseek V4 Flash搭配着Codex来完成一个系列完整的开发 实际上大家需要知道尽管现在Deepseek我们使用的是Flash这样的小号模型 但是其实它的性能并不比今年上半年或者今年年初 对不对当时Codex当时Opera 4.5这样的那样的一个模型的性能差甚至要强很多 所以其实对这样的性能来说 尽管它是小号 但是对于很多开发任务来说 其实绝对可以来进行使用的 并且它本身的响应速度也很快 对吧 再加上现在和整个Codex的兼容特性也非常稳定 那么我们刚才其实是围绕着 我们的part3的课件重新进行一轮修正 然后我们刚刚讲Codex好多功能 什么States 什么Innet 什么项目结构 Agents 各式各样的这些东西 应该怎么样进行编写 包括它的Sandbox 怎么样来进行开启 对不对 他的subagents怎么样进行开启等等 我们之前课程里面的截图被吞了 导致大家可能没有看到 没关系 大家现在可以再去看一看 我们的part3里面的这些截图 再回顾一下codex的整体这样的功能 那么接下来 在整个实操过程当中 也会有一个更加快速的 上手的这样的一个效果 当然我们在所有的开发过程当中 我们首先需要跟大家先梳理清楚的是 整个开发思路 和需要用到的codex相关的功能 以及围绕我们当前这个系统 我们怎么样来进行技术选行 我们公开课其实每一期公开课都是这个时间有限 可能我们只能够讲完到这一层 至于说最后通过总共是40多轮这样的提示 就完成一整个系统开发的每一轮的提示词 和每一轮的系统的快照还是一样的 我们会放在课件里面 大家回头可以自己拿到再去看 然后我们的公开课的有限的最后一个小时 这个时间会跟大家梳理清楚 关于整个项目在进行开发的过程当中 它的底层的思路和技术选行到底是什么样 我们之前K3的课其实也是 进展到这一块的时候 时间稍微一点紧 好 那么首先我们在对照的这个项目 跟大家来说 到底有哪一些这样的功能 当然其实从整个AI技术兴起开始 就是关于使用AI来进行数据分析 其实是一块非常大的功能 非常大的一块业务的需求 包括我们现在课程里面 总共有四项旗舰项目里边 而且有一个项目也是工业级的 非常复杂创技家的AI数据分析 那么围绕这个数据分析 其实它内部有很多的一些技术体系 包括像NL2色刻画 包括像这个现在 还有全自动的 这个AI来进行机器学习建模 等等等等 各个细分的 这样的这个技术体系 当然之所以 AI能够很好的来进行数据分析 这样的操作 其实也是因为 这个对大模型来说 这个内容创作 或许不得行 然后呢 这个最开始的时候 非常复杂大规模 几万行 十几万行代码的项目开发 或许有点困难 但是像AI数据分析 对不对 从这数据里面找规律下判断 然后呢 写一些这个circle 来去完成一些高精准的 这个数据清洗或者数据建模相关的这个操作 这个对于AI来说实际上是非常好就能够实现的 所以现在如果你看所有的一些领域的落地的 各项其实落地的这个情况来看 像AI数据分析这个领域的这个落地应该是非常深刻 非常彻底 并且是很早就能取得非常显著这样的成效了 所以现在我们在进行一些项目 拿了一些项目来进行开发 大家想去练手 尤其是咱们接下来如果邱昭想去找工作的话 那么其实做几个AI数据分析这样的项目 是能够很能够是能够获得一些成果的 那么接下来我们给大家介绍的 这个DS4-AI数据分析系统 实际上就是现在 就现在这个阶段适配于2026下半年 比较适合去做一个 大家如果想要去做一些简历项目的一个功能 非常齐全 并且性能也还非常不错的一个完整的AI数据分析系统 那么这个数据分析系统 我们先看它到底有哪些功能 首先对于整个数据分析系统来说 它必须得有一个漂亮的页面 这个不是必要的 但是如果有的话当然更好 对不对 有一个比较好的webdesign的效果肯定会更好 当然我们webdesign是怎么做的 我们稍后再跟大家说 这先不着急 然后首先我们肯定是要有一个 稍等 我们给它切换成浅色的 因为浅色的话 我会觉得可能更容易看得出效果一些 好 那么首先第一块是需要有一个数据资产的管理的系统 所谓数据资产管理系统指的是 我们需要有一个完整的工程模块 去负责去给当前的AI数据分析 去介入各个不同的渠道这样的数据 包括你本地的 Excel CSV这个数据 包括你数据户里面的一些数据 MySQL的数据 SQLite的数据 甚至是一些分布数的数据户里面等等 总之你需要维护一整个数据资产也好 或者数据中台也好 负责去介入各式各样不同类型的数据 当然这一块开发 其实是整个项目里面来说 应该是非常简单的一块功能 因为无非就是去验证各个不同渠道的 验证各个不同渠道的这样的一些数据的情况 然后再来进行一个开发 然后我们现在我们看一下 因为我现在是连接的是远程的服务 所以MySQL是起动不了的 因为我本地没做MySQL 但其他的数据是能看到的 对不对 就很多很多各式各样数据 你可以去查询各个不同类型的字段 对吧 它各个不同类型的曲子等等等等 那首先呢我们其实是在需要为整个系统呢 需要去维护一个完整的数据的中台这样的功能啊 或者是数据存储这样的功能啊 当然对于一些企业的应用场景来说 它可能还会涉及到一些 比如说数据的这样的一个权限啊 查询的这样的权限等等等等 当然这个数据资产的管理啊 一方面你是需要去设置一些 比如说远程的麦斯克连接 或者你自己本地导入一些这个数据 然后同时它还会涉及到一些 比如说我们在实际在进行数据分析的时候 中间啊状态我们提取 或者说临时存储的一些数据 或者说一些数据结论等等等等 统一都是从一个功能入口 来进行一个统一的这样的维护 这里能看到什么数据资产 服务项目 多少行数据 本地的数据的规模等等 这个数据其实还是一个比较大的 一个数规模的数据 毕竟有300多万行的数据 对吧 还是一个比较大的数据 然后这个数据 我们在课程里面 因为是为了做这个项目 来进行一个测试 所以它是分布在 什么MySQL CircleLite Excel CSV 这个四种不同类型的这个数据库里面 四种不同类型的数据载体里面 所以我们可以去给它打散 那么我们课程里面设计的这四个数据载体 应该是非常通用的这四个数据载体 除此之外呢 你还可以去考虑拓展连接更加复杂的一些数据员 也是都是ok的 这是第一个 那么第二个呢 是对于现在的这个数据分析系统来说 你或多或少总得给它整一些 这个技能系统 对不对 那么什么叫做这个数据分析 这个技能系统 我们给大家看一下我们实际对话的过程当中 那么我们实际上在进行具体的对话的时候 那你需要来进行数据分析 对吧 那有很多很多需要来进行分析的 需要来进行分析的一些事项 那么有的时候你可能会偏好某一些分析的流程 分析偏好某一些可视化这样的方式 或者你本来你们公司来进行数据欣喜 或者提取特定的这业务指标 可能就有具体的一些领域这样的知识 对不对 那这些东西的话 怎么样灌输给当前的数据分析系统 其实我们可能考虑的 就通过SGU这样的方式来去告诉 我们当前的数据分析系统 我们在不同环节的时候 到底需要做哪一些事情 对不对 可视化的时候 往往都是采用什么样的图片 来进行绘制 对不对 然后还可以选择 其他的什么柄图 热力图等等 各样的图片来进行呈现 那么总之就是 我们其实 那么总之我们其实很多时候在先分析的时候都会涉及到非常具体领域里面的特殊的判断。这些东西都可以通过Skill来进行完成。 更别谈比如说我们后期还需要来围绕数据报告,需要去生成对应的数据报告。 那么生成数据报告的时候 更是你数据报告里面需要有哪些分析的维度 对不对 它需要有哪一些特定的这样的指标的统计 然后如何去解读一些我们本身数据分析的过程当中 可能涉及到行业的黑化 那这东西其实都属于一个分析统里面 它必须要去具备一些这样的功能 那这东西当然都是通过这一系列的Skill来去完成 所以我们这里其实是预制了很多的 也没有很多 就总共是内置了4个Skill 因为都是用Codex进行开发 所以我们这里是设置一些场景 然后是设置了4个不同类型的Skill 那么它包括比如说生成一些数据摘要 包括数据的检查 包括去检查一些异常值 包括老外进行数据分析报告等等 但实际上我们说在一个数据分析的完整流程里面 像实际在进行业务的过程当中 它需要涉及到的阶段其实非常非常多 可能会有比如说前期的像数据清洗 对不对 包括再往前比如说可能要进行数据探索 然后很有可能还需要来进行一些 数据指标的这样的计算 需要来进行一些可视化的分析 然后到后期建模的时候 可能还会涉及到一些 比如说特征的增强 或者特征工程的一些操作 或者模型融合的一些操作 然后在实际机器建模的过程当中 还会涉及到一些比较复杂的 一些机器学习的算法 对不对 一些集成算法来进行 更加复杂的机器学习的建模 甚至后期可能还需要模型融合相关的操作 因为其实我早年刚大学毕业的时候实际上就是做数据分析 是做大数据相关的工作 所以这一整个流程其实非常长 其实所有流程里面其实都可以固化一些skills 对不对换当线系统里面 然后在我们接下来分析的每一个流程的每一个环节里面 我们就可以自由的来进行一个切换 和来进行个选取了 那么除此之外 我们这里可能还有一些系统方面的一些设置 对于一个像我们刚才这样的一些基本功能的agent来说 你可能需要有比如说设置的模型的apir 设置这个沙盒环境啊 这个沙盒环境主要是给我们的python代码的进行运行的时候 单独创建的一个 本地的一个这个沙盒环境 那么这个沙盒环境其实主要是 为了去隔离你当前运行的程序 可能会对原始的数据造成一些不好的这个影响 在说建在这个沙盒环境 那比如说还有什么连接本地的这个MySQL 对不对啊 你这里肯定还是需要去围绕这个本地的这个MySQL 来进行个连接来进行验证等等等等 这都是需要的 然后还有一些这个数据安全 这个安全措施呢 其实是我们可以自己来进行一些设置的 比如说我们数据库只读 这个权限当然你可以自己放宽了 然后什么最小上下文的披露 什么CPU脚本沙盒 这些东西是你可以来进行设置的 然后同时还有关于当前整个的数据集的一个概览 以及还有些界面外观 界面外观其实你就可以任意来进行选取了 我们这里其实内置了很多不同类型的页面的外观 这个页面外观 其实你可以随便 你可以自己 我们用一些webdesign这个方式 来进行设计啊 这个其实完全没有什么问题的 那实际我们在进行使用的时候 这个项目到底有哪一些功能呢 这大家可以看到好 到底有哪些功能啊 当然我们这里 对于整个的系统架构来说 现在当代的这个AI数据分析的 这样的一个体系的这个设置啊 都是我们刚刚所看到什么数据资产啊 这个Skills中心啊 这种写其他是一套 跨越项目的维护的一个 综合的这样的一个这个设置 而我们接下来每一次对话 相当于是开启了一个新的数据分析项目 是这么一回事 比如说我们这一项面点新建数据分析 那么它马上我们就相当于是获得了一个全新的数据分析这样的空间 然后你加拿就可以连接数据源 你可以自己去选取一些数据源 你也可以去读取MySQL里面的数据源 也都是OK的 这里面其实你可以去选择连接各式各样的数据源 然后接下来我们就可以开始进行对话了 当然上面你可以去选择一些项目的数据 然后同时你也可以选择一些分析的工具 这些分析工具其实指的是一些分析的skill 然后接下来我们说你就可以开始来进行对话了 是这么样的一个情况 那我们上面其实有一组完成的一组比较复杂的对话 大家可以看直接对话这样的效果 那么每一个对话就是一个单独的我们分配了这个数据 分配了这个sql来进行运行的一个完整的agent运行时这样的一个项目 对不对 然后当然我们这个项目底层是使用deep seek 这个模型deep seek flash这个模型来进行的底层的响应 然后同时我们底层的架构是使用Deep Agents 就LongChainDeep Agents来进行的底层的这样的一个agent运行时的这样的搭建 包括工具调用 包括一些系统设置 包括Skew加载 包括跨线程记忆 包括持有机 都是通过Deep Agents来完成的开发 那么具体我们说它里面有哪些功能 大家可以看一下它是怎么样进行对话的 这里先随便说两句 然后接下来就开始确认我们当前这个数据资产 那么它实际上是一个 Agentic数据分析这样的流程 也就是说它是会根据当前用户这样的需求去判断 我们现在是不是需要从我们当前的数据资产里面去盘点某些数据 然后再来进行回复 是这么样的一个情况 那我们先让它这里面就找了一些分析的思路 什么旅约体验 什么客户口碑 交叉归因和建议等等 就是说我们现在分析思路行不行 我们让他进行分析 他给我们提了一个分析思路 然后分析前去我们拍板的三件事情 然后接下来OK我们就跟他说 他就可以开始来进行分析了 然后具体分析的过程当中 其实他也会他会进行一些 比如说字段的提取对不对 各式各样的字段的提取 但有些简单的字段你可以看 直接看比如他去找一些核心的指标 对不对 定单最多的这样的商品等等 当然也会有一些比如说简单的 什么月度收入与履约分析趋势 那么这里它其实是通过交叉的各个不同维度去筛选出一张表 然后这个表其实在我们当前这个系统里面 我们是给大家单独集成了一些e-chats的这样的一些工具 这个e-chats其实也是我们在进行AI数据分析的过程当中 经常会要用到的一个非常核心这样的功能 那么它其实就允许对不对 有这样的一个一系列的各式各样交互的这个 交互的这样的这个效果 我们就可以在里面能够去看到了 这个是e-chats的这样的一些这个功能 然后它是允许我们去根据选取不同的指标 然后去选取不同这样的图片 然后来进行实时的数据的这样的生成 然后其实上面每一步都它执行的一些过程 比如说它先提取了一个指标 然后在我们对话列表里面 我们通过这些结构化输出这样的方式 让它去输出一个比如说核心指标 某一个特定类型这样的一个message 然后我们的系统读取到它特定类型的message之后 在前端渲染的时候就会使用这HS 把它渲染成这个样子 是这么一回事 然后接下来比如说 它又提取了一组数据 那么前端又实时的把它渲染成 这样的一个表格 可以供我们来进行操作 像这样的渲染 这样的功能 也是现在就比如说 我们使用这个Cloud Cowork 或者是使用这个ChatGPT的这个Sheet 这样的一些这个系统 你发现它也是 类似这样的一个执行的思路 这也是现在当代AI数据分析的 agent开发的过程当中 一个提升用户观感的一个小技巧 一个小技巧 就这么一回事 然后他又提取各式各样的东西 然后在我们系统里面 他还有就比如说有一些 能够去追溯我们原来的数据 整个生成的血脉这样的过程 关于像什么数据血缘这样的追溯 这个其实也是现在 还是进行数据分析的时候 有一个非常时髦的一个概念 这个血缘追溯 其实一个是为了关联分析 一个是为了确认我们当前的本身数据 提取结果这样的可信度 这样的一些功能 去进行追溯进行关联检测等等 这里他就点一下就可以进来 就可以看到他所谓的产物科学源 相关这些东西了 我们不管我们继续看 請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字。請保持中文字 多维度的一个这个啊 多维度的这个表格分析啊 就是一个多维度的这个指标分析啊 然后他呢 实际上是提取各个不同维度啊 然后来然后来进行分析啊 只不过呢 我们他所有提取的各个维度数据在前端渲染的时候呢 都给他渲染成了这个啊 大家现在看到的啊 这个呃 一些图表的这样的这个模样啊 是这么一回事啊 所以这里面其实很多很多很多的一些指标的一些这个分析啊 所有这个指标都可以提取摘要啊 表格呀 图片呢 都是ok的啊 有很多的一些这个分析啊 然后同时我们最后其实还有关于什么软投票模型 这个其实是一个建模分析 我们实际上是让它来进行模型融合相关的分析 然后等等等等 当然我们在实时运行的过程当中 我们其实还给它了一些功能 就是这里面在进行对话的时候 同时你可以在右边去比如保存一些数据结果 这里你可以实时来进行保存 其实没有什么问题 同时它还会生成一个可视化的报告 里面会综合我们现在所有的这些结论 然后最后生成一个完整的数据分析的报告 然后同时数据分析的报告 也是可以直接生成HTML来进行本地的保存的 这是我们当前的整个agent一个基本功能 当然了解这个基本功能之后 其实比较重要的是我们需要看 关于整个系统它的架构是如何实现 它的架构是怎么样来进行完整的设计的 那么对于我们当前这个系统来说 OK我们给大家放大一下 给大家看一下 对我们当前的系统的架构来说 那基本上是这么几个方面 大家可以先来看一下 当然首先大家这个之后 如果拿到这个项目的话 其实是能够看到它完整的一个架构的这个列表的 那首先它肯定是流失对话的这个基本的这个工具台 然后呢它是这个fastfpi跟sse的网关 因为我们本来是本地的这个部署 那这里正好给大家看一下 我们实际上在进行这个 在进行agent的开发过程当中 当我们已经就比如说 在这个看到一个成熟的这个项目 你可以从哪些角度去看 它底层的这样的架构 当然首先我们是对话切入的 这样一些功能 然后就是我们整个Fast API后端服务 来进行封装的这样的一个功能模块 和SSE的网关 然后比较重要的是 我们现在的agent运行时的这样的编排 那么agent运行时 这里我们其实是采用的是 Deepseek V4 Flash这样的一个模型 对不对 然后来了 OpenAI的ChatComplations API作为底层 Sorry Responses API 作为底层来进行一个基础功能 这样的响应 然后同时 整个的编排是用Deep Agents来进行的编排 所以它就会允许我们按照意图来进行工具调用 然后同时也可以加载这个Skill 这两块功能其实在实际开发过程当中 并没有那么的复杂 就比如说我们关联一些工具和关联一些Skill 其实并没有那么的复杂 核心原因是因为对于像LongChain的Deep Agents来说 大家可能之前没有看过我们那期Deep Agents的公开课 那么对于Deep Agents来说 这功能其实都是内置功能 你其实只需要几行代码 然后去给它写好一些对应的一些skill 然后在进行读取的过程当中 把这个skill就像工具一样给它读进来 然后它就可以加载这样的一些skill 这些其实并不会特别的复杂 然后比较复杂的其实是 关于我们在进数据分析的时候 你需要去梳理我们当前系统 到底需要哪些功能 这一点其实也是现在 就是我们经常去讨论 比如说像FDE对不对 前沿部署工程师 我们经常说FDE FDE这个难在哪呢 其实不一定是难在 说我们要去完成Agent开发 其实反而很多FDE的场景下 Agent本身的开发难度 其实是并不大的 然后FDE最难的地方 可能在于说 它怎么样结合业务去分析 我们当前业务到底 需要达到哪些目标 然后合理的去适配一条 最为稳健这样的一个开发方案 然后去解决这样的问题 比如说拿到数据分析这样的场景 它就非常典型了 对吧 你就可以去分析 关于说 我们这个数据分析 到底需要实现哪一些功能 就比如说多元数据接入 这个得有 然后什么数据 只读的数据查询引擎 这个查数的功能肯定是要有 然后像什么数据清洗和特征工程 然后包括数据探索 数据可视化分析 这东西肯定是要有的 对不对 这就是一块功能 还有什么异步训练精神管道 所谓异步训练 其实主要指的是一些画图的工作 和机器学习建模预测的一些工作 然后机器学习和模型融合 这个肯定也是要有的 我们需要很多时候需要围绕一些数值来进行预测 对不对 然后出分析报告 这条链路基本上就是我们现在 其实不仅仅是我们当前项目这么规定的 其实现在很多的一些agent开发 很多的一些这个数据分析项目 基本上也是按照这样的一个链路 来规划我们现在整个模块核心需要的功能 那么有了这功能之后 你会发现 那这些功能如何实现 基本上就是两层 第一层我们说底层 你需要有一些基础功能层作为它的支撑 比如说你要有本地的数据库 对不对 你需要有这个项目隔离仓 和这个血缘关系的这个梳理 你需要有什么这个CircleLite 去存储每一个数据集的这个原数据 你还需要有独立项目空间和文件 这东西其实是怎么说呢 就是这东西倒不一定你需要跟Codex去说 他其实很多时候自己能够梳理清楚 就是你需要去跟他讲的更多的 其实是上面这一层 我们到底需要有哪一些业务的这个指标 以及这所有的业务 他需要完成到什么样的这个程度 就比如说OK我们的这个分析报告 写的什么程度 然后我们的这个一步训练进程 他需要做到什么样的程度等等 然后至于说有了这些程度之后 下面的很多的一些功能 其实都可以由当前的agent或者kodex 自己来去完成 这个其实问题不大 但是确实需要我们人工来进行讨论和完成 实际上是上面这些 主要是agent的智能编排程 就是比如说我们比如说模型 或者最小的工具路由 或者sgills这样的披露等等 你需要有一整套完整的技术选型 确定是需要你需要采用哪一组技术来进行开发 OK 差不多是这样的一个基本的架构 所以我们说从架构当中 你也能够看得出来 基本上我们现在在进行agent开发过程当中 其实比较重要的第一点 其实倒不一定怎么说 当然选取一个合适的工具和模型也很重要 但是其实更加重要的是 你需要非常清楚的知道 我们当前的业务的意图是什么 那也就是说我们现在到底需要解决哪一些这个问题啊 然后呢 到底有哪一些这个非常关键的这样的一些这个场景啊 等等等等啊 这些呢可能是 哎 放大一下 那么这些呢可能是首先我们需要确认的啊 然后呢 接下来比较重要的是我们可能就需要讨论清楚 关于我要去解决当前这样的一些业务的难题啊 哎 你得做好哪一些技术这个选型 对不对啊 就是选型这块肯定也是我们需要去做的啊 那么然后再往下才是啊 你用着这个codex啊 你用着这个这个deep seek啊 这样的这个模型啊 再来进行一轮一轮的开发啊 是这么一回事 好 那么了解了我们当前整个系统 那完整的一些基本的功能之后啊 那么接下来啊 就我们需要来看一看啊 他到底应该呃 怎么样来进行开发和底层的这个思路啊 到底是什么样的呢