實際影片長度:23:16.091。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:09.169
zh好,那么之前我们是了解了关于deep seek模型的Responsees API和Codex怎么样来进行接入。
0:09.169–0:15.917
zh现在其实对于咱们的开发者的学习来说,前期肯定是要有一个基础的学习的这样的过程。
0:15.917–0:28.200
zh当然其实我会觉得可能更长的学习的周期应该放在围绕一个又一个项目来进行开发试错,不断的来提取经验,然后最后优化完成一个系统开发的整个完整的链路。
0:28.200–0:32.100
zh那么大家现在看到的DS4-AI数据分析系统
0:32.100–0:37.600
zh实际上就是接下来带大家来手动一步一步来完成搭建的这样的开发的项目
0:37.600–0:43.620
zh当然我们这里同样是使用Deepseek V4 Flash搭配着Codex来完成一个系列完整的开发
0:43.620–0:48.420
zh实际上大家需要知道尽管现在Deepseek我们使用的是Flash这样的小号模型
0:48.420–0:52.080
zh但是其实它的性能并不比今年上半年或者今年年初
0:52.080–0:57.820
zh对不对当时Codex当时Opera 4.5这样的那样的一个模型的性能差甚至要强很多
0:57.820–0:59.640
zh所以其实对这样的性能来说
0:59.640–1:00.720
zh尽管它是小号
1:00.720–1:02.300
zh但是对于很多开发任务来说
1:02.300–1:03.920
zh其实绝对可以来进行使用的
1:03.920–1:05.960
zh并且它本身的响应速度也很快
1:05.960–1:06.360
zh对吧
1:06.360–1:09.700
zh再加上现在和整个Codex的兼容特性也非常稳定
1:09.700–1:11.760
zh那么我们刚才其实是围绕着
1:11.760–1:15.140
zh我们的part3的课件重新进行一轮修正
1:15.140–1:17.300
zh然后我们刚刚讲Codex好多功能
1:17.300–1:19.380
zh什么States
1:19.380–1:20.240
zh什么Innet
1:20.240–1:21.360
zh什么项目结构
1:21.360–1:22.160
enAgents
1:22.160–1:23.940
zh各式各样的这些东西
1:23.940–1:25.260
zh应该怎么样进行编写
1:25.260–1:26.940
zh包括它的Sandbox
1:26.940–1:28.400
zh怎么样来进行开启
1:28.400–1:28.760
zh对不对
1:28.760–1:30.540
zh他的subagents怎么样进行开启等等
1:30.540–1:32.900
zh我们之前课程里面的截图被吞了
1:32.900–1:33.780
zh导致大家可能没有看到
1:33.780–1:34.500
zh没关系
1:34.500–1:35.680
zh大家现在可以再去看一看
1:35.680–1:37.720
zh我们的part3里面的这些截图
1:37.720–1:39.860
zh再回顾一下codex的整体这样的功能
1:39.860–1:40.560
zh那么接下来
1:40.560–1:42.020
zh在整个实操过程当中
1:42.020–1:44.460
zh也会有一个更加快速的
1:44.460–1:46.080
zh上手的这样的一个效果
1:46.080–1:48.320
zh当然我们在所有的开发过程当中
1:48.320–1:50.340
zh我们首先需要跟大家先梳理清楚的是
1:50.340–1:51.100
zh整个开发思路
1:51.100–1:53.380
zh和需要用到的codex相关的功能
1:53.380–1:55.340
zh以及围绕我们当前这个系统
1:55.340–1:56.720
zh我们怎么样来进行技术选行
1:56.720–1:59.760
zh我们公开课其实每一期公开课都是这个时间有限
1:59.760–2:01.400
zh可能我们只能够讲完到这一层
2:01.400–2:04.880
zh至于说最后通过总共是40多轮这样的提示
2:04.880–2:08.380
zh就完成一整个系统开发的每一轮的提示词
2:08.380–2:10.720
zh和每一轮的系统的快照还是一样的
2:10.720–2:11.700
zh我们会放在课件里面
2:11.700–2:13.040
zh大家回头可以自己拿到再去看
2:13.040–2:15.760
zh然后我们的公开课的有限的最后一个小时
2:15.760–2:17.620
zh这个时间会跟大家梳理清楚
2:17.620–2:20.180
zh关于整个项目在进行开发的过程当中
2:20.180–2:23.500
zh它的底层的思路和技术选行到底是什么样
2:23.500–2:25.120
zh我们之前K3的课其实也是
2:25.120–2:26.340
zh进展到这一块的时候
2:26.340–2:27.200
zh时间稍微一点紧
2:27.200–2:27.660
zh
2:27.660–2:29.640
zh那么首先我们在对照的这个项目
2:29.640–2:30.300
zh跟大家来说
2:30.300–2:31.800
zh到底有哪一些这样的功能
2:31.800–2:35.080
zh当然其实从整个AI技术兴起开始
2:35.080–2:37.120
zh就是关于使用AI来进行数据分析
2:37.120–2:39.120
zh其实是一块非常大的功能
2:39.120–2:40.720
zh非常大的一块业务的需求
2:40.720–2:42.280
zh包括我们现在课程里面
2:42.280–2:44.120
zh总共有四项旗舰项目里边
2:44.120–2:46.120
zh而且有一个项目也是工业级的
2:46.120–2:47.900
zh非常复杂创技家的AI数据分析
2:47.900–2:49.440
zh那么围绕这个数据分析
2:49.440–2:52.720
zh其实它内部有很多的一些技术体系
2:52.720–2:54.040
zh包括像NL2色刻画
2:54.040–2:55.260
zh包括像这个现在
2:55.260–2:56.300
zh还有全自动的
2:56.300–2:58.000
zh这个AI来进行机器学习建模
2:58.000–2:58.560
zh等等等等
2:58.560–2:59.560
zh各个细分的
2:59.560–3:00.720
zh这样的这个技术体系
3:00.720–3:01.520
zh当然之所以
3:01.520–3:03.440
zhAI能够很好的来进行数据分析
3:03.440–3:04.120
zh这样的操作
3:04.120–3:04.940
zh其实也是因为
3:04.940–3:06.720
zh这个对大模型来说
3:06.720–3:07.640
zh这个内容创作
3:07.640–3:08.540
zh或许不得行
3:08.540–3:09.580
zh然后呢
3:09.580–3:10.900
zh这个最开始的时候
3:10.900–3:12.220
zh非常复杂大规模
3:12.220–3:12.840
zh几万行
3:12.840–3:14.200
zh十几万行代码的项目开发
3:14.200–3:15.040
zh或许有点困难
3:15.040–3:16.580
zh但是像AI数据分析
3:16.580–3:16.880
zh对不对
3:16.880–3:18.580
zh从这数据里面找规律下判断
3:18.580–3:19.120
zh然后呢
3:19.120–3:20.080
zh写一些这个circle
3:20.080–3:21.580
zh来去完成一些高精准的
3:21.580–3:24.700
zh这个数据清洗或者数据建模相关的这个操作
3:24.700–3:28.960
zh这个对于AI来说实际上是非常好就能够实现的
3:28.960–3:32.000
zh所以现在如果你看所有的一些领域的落地的
3:32.000–3:33.440
zh各项其实落地的这个情况来看
3:33.440–3:37.180
zh像AI数据分析这个领域的这个落地应该是非常深刻
3:37.180–3:37.820
zh非常彻底
3:37.820–3:40.880
zh并且是很早就能取得非常显著这样的成效了
3:40.880–3:43.620
zh所以现在我们在进行一些项目
3:43.620–3:44.780
zh拿了一些项目来进行开发
3:44.780–3:45.660
zh大家想去练手
3:45.660–3:48.360
zh尤其是咱们接下来如果邱昭想去找工作的话
3:48.360–3:51.060
zh那么其实做几个AI数据分析这样的项目
3:51.060–3:54.320
zh是能够很能够是能够获得一些成果的
3:54.320–3:56.240
zh那么接下来我们给大家介绍的
3:56.240–3:58.300
zh这个DS4-AI数据分析系统
3:58.300–3:59.420
zh实际上就是现在
3:59.420–4:02.180
zh就现在这个阶段适配于2026下半年
4:02.180–4:04.620
zh比较适合去做一个
4:04.620–4:07.620
zh大家如果想要去做一些简历项目的一个功能
4:07.620–4:08.340
zh非常齐全
4:08.340–4:11.400
zh并且性能也还非常不错的一个完整的AI数据分析系统
4:11.400–4:12.820
zh那么这个数据分析系统
4:12.820–4:14.340
zh我们先看它到底有哪些功能
4:14.340–4:16.740
zh首先对于整个数据分析系统来说
4:16.740–4:18.220
zh它必须得有一个漂亮的页面
4:18.220–4:22.380
zh这个不是必要的 但是如果有的话当然更好 对不对
4:22.380–4:26.060
zh有一个比较好的webdesign的效果肯定会更好
4:26.060–4:29.420
zh当然我们webdesign是怎么做的 我们稍后再跟大家说 这先不着急
4:29.420–4:32.140
zh然后首先我们肯定是要有一个
4:32.140–4:36.260
zh稍等 我们给它切换成浅色的
4:36.260–4:44.340
zh因为浅色的话 我会觉得可能更容易看得出效果一些
4:44.340–4:48.300
zh好 那么首先第一块是需要有一个数据资产的管理的系统
4:48.300–4:49.680
zh所谓数据资产管理系统指的是
4:49.680–4:52.280
zh我们需要有一个完整的工程模块
4:52.280–4:53.980
zh去负责去给当前的AI数据分析
4:53.980–4:56.500
zh去介入各个不同的渠道这样的数据
4:56.500–4:58.920
zh包括你本地的 Excel CSV这个数据
4:58.920–5:01.160
zh包括你数据户里面的一些数据
5:01.160–5:02.060
zhMySQL的数据
5:02.060–5:02.940
zhSQLite的数据
5:02.940–5:05.020
zh甚至是一些分布数的数据户里面等等
5:05.020–5:08.400
zh总之你需要维护一整个数据资产也好
5:08.400–5:09.440
zh或者数据中台也好
5:09.440–5:11.520
zh负责去介入各式各样不同类型的数据
5:11.520–5:12.960
zh当然这一块开发
5:12.960–5:14.640
zh其实是整个项目里面来说
5:14.640–5:15.920
zh应该是非常简单的一块功能
5:15.920–5:18.640
zh因为无非就是去验证各个不同渠道的
5:18.640–5:22.140
zh验证各个不同渠道的这样的一些数据的情况
5:22.140–5:24.660
zh然后再来进行一个开发
5:24.660–5:26.740
zh然后我们现在我们看一下
5:26.740–5:29.120
zh因为我现在是连接的是远程的服务
5:29.120–5:30.980
zh所以MySQL是起动不了的
5:30.980–5:31.880
zh因为我本地没做MySQL
5:31.880–5:33.700
zh但其他的数据是能看到的
5:33.700–5:33.980
zh对不对
5:33.980–5:36.340
zh就很多很多各式各样数据
5:36.340–5:38.980
zh你可以去查询各个不同类型的字段
5:38.980–5:39.300
zh对吧
5:39.300–5:40.820
zh它各个不同类型的曲子等等等等
5:40.820–5:43.180
zh那首先呢我们其实是在需要为整个系统呢
5:43.180–5:46.660
zh需要去维护一个完整的数据的中台这样的功能啊
5:46.660–5:48.520
zh或者是数据存储这样的功能啊
5:48.520–5:49.960
zh当然对于一些企业的应用场景来说
5:49.960–5:50.880
zh它可能还会涉及到一些
5:50.880–5:52.700
zh比如说数据的这样的一个权限啊
5:52.700–5:54.460
zh查询的这样的权限等等等等
5:54.460–5:56.360
zh当然这个数据资产的管理啊
5:56.360–5:58.500
zh一方面你是需要去设置一些
5:58.500–5:59.780
zh比如说远程的麦斯克连接
5:59.780–6:01.540
zh或者你自己本地导入一些这个数据
6:01.540–6:02.900
zh然后同时它还会涉及到一些
6:02.900–6:04.960
zh比如说我们在实际在进行数据分析的时候
6:04.960–6:06.920
zh中间啊状态我们提取
6:06.920–6:08.480
zh或者说临时存储的一些数据
6:08.480–6:10.160
zh或者说一些数据结论等等等等
6:10.160–6:12.440
zh统一都是从一个功能入口
6:12.440–6:13.980
zh来进行一个统一的这样的维护
6:13.980–6:15.660
zh这里能看到什么数据资产
6:15.660–6:16.920
zh服务项目
6:16.920–6:18.060
zh多少行数据
6:18.060–6:20.020
zh本地的数据的规模等等
6:20.020–6:22.080
zh这个数据其实还是一个比较大的
6:22.080–6:23.480
zh一个数规模的数据
6:23.480–6:24.860
zh毕竟有300多万行的数据
6:24.860–6:25.100
zh对吧
6:25.100–6:26.820
zh还是一个比较大的数据
6:26.820–6:27.920
zh然后这个数据
6:27.920–6:29.160
zh我们在课程里面
6:29.160–6:30.380
zh因为是为了做这个项目
6:30.380–6:31.140
zh来进行一个测试
6:31.140–6:32.500
zh所以它是分布在
6:32.500–6:33.320
zh什么MySQL
6:33.320–6:34.260
enCircleLite
6:34.260–6:34.900
enExcel
6:34.900–6:35.420
enCSV
6:35.420–6:37.220
zh这个四种不同类型的这个数据库里面
6:37.220–6:38.980
zh四种不同类型的数据载体里面
6:38.980–6:40.400
zh所以我们可以去给它打散
6:40.400–6:42.820
zh那么我们课程里面设计的这四个数据载体
6:42.820–6:44.620
zh应该是非常通用的这四个数据载体
6:44.620–6:45.200
zh除此之外呢
6:45.200–6:48.700
zh你还可以去考虑拓展连接更加复杂的一些数据员
6:48.700–6:49.520
zh也是都是ok的
6:49.520–6:50.140
zh这是第一个
6:50.140–6:51.080
zh那么第二个呢
6:51.080–6:53.460
zh是对于现在的这个数据分析系统来说
6:53.460–6:55.640
zh你或多或少总得给它整一些
6:55.640–6:56.760
zh这个技能系统
6:56.760–6:57.380
zh对不对
6:57.380–6:58.920
zh那么什么叫做这个数据分析
6:58.920–6:59.880
zh这个技能系统
6:59.880–7:01.960
zh我们给大家看一下我们实际对话的过程当中
7:01.960–7:05.840
zh那么我们实际上在进行具体的对话的时候
7:05.840–7:07.660
zh那你需要来进行数据分析
7:07.660–7:07.940
zh对吧
7:07.940–7:11.220
zh那有很多很多需要来进行分析的
7:11.220–7:15.760
zh需要来进行分析的一些事项
7:15.760–7:19.100
zh那么有的时候你可能会偏好某一些分析的流程
7:19.100–7:21.860
zh分析偏好某一些可视化这样的方式
7:21.860–7:24.340
zh或者你本来你们公司来进行数据欣喜
7:24.340–7:26.840
zh或者提取特定的这业务指标
7:26.840–7:28.900
zh可能就有具体的一些领域这样的知识
7:28.900–7:29.220
zh对不对
7:29.220–7:30.240
zh那这些东西的话
7:30.240–7:32.240
zh怎么样灌输给当前的数据分析系统
7:32.240–7:33.960
zh其实我们可能考虑的
7:33.960–7:35.960
zh就通过SGU这样的方式来去告诉
7:35.960–7:37.400
zh我们当前的数据分析系统
7:37.400–7:39.060
zh我们在不同环节的时候
7:39.060–7:40.700
zh到底需要做哪一些事情
7:40.700–7:41.080
zh对不对
7:41.080–7:41.960
zh可视化的时候
7:41.960–7:45.880
zh往往都是采用什么样的图片
7:45.880–7:47.340
zh来进行绘制
7:47.340–7:48.000
zh对不对
7:48.000–7:50.060
zh然后还可以选择
7:50.060–7:51.720
zh其他的什么柄图
7:51.720–7:55.140
zh热力图等等
7:55.140–7:58.160
zh各样的图片来进行呈现
7:58.160–7:59.220
zh那么总之就是
7:59.220–8:00.000
zh我们其实
8:00.000–8:03.966
zh那么总之我们其实很多时候在先分析的时候都会涉及到非常具体领域里面的特殊的判断。
8:03.966–8:06.000
zh这些东西都可以通过Skill来进行完成。
8:06.000–8:11.500
zh更别谈比如说我们后期还需要来围绕数据报告,需要去生成对应的数据报告。
8:11.500–8:12.780
zh那么生成数据报告的时候
8:12.780–8:15.540
zh更是你数据报告里面需要有哪些分析的维度
8:15.540–8:15.840
zh对不对
8:15.840–8:19.000
zh它需要有哪一些特定的这样的指标的统计
8:19.000–8:21.600
zh然后如何去解读一些我们本身数据分析的过程当中
8:21.600–8:22.760
zh可能涉及到行业的黑化
8:22.760–8:24.660
zh那这东西其实都属于一个分析统里面
8:24.660–8:26.600
zh它必须要去具备一些这样的功能
8:26.600–8:29.960
zh那这东西当然都是通过这一系列的Skill来去完成
8:29.960–8:32.460
zh所以我们这里其实是预制了很多的
8:32.460–8:33.380
zh也没有很多
8:33.380–8:35.840
zh就总共是内置了4个Skill
8:35.840–8:37.620
zh因为都是用Codex进行开发
8:37.620–8:39.540
zh所以我们这里是设置一些场景
8:39.540–8:41.980
zh然后是设置了4个不同类型的Skill
8:41.980–8:44.800
zh那么它包括比如说生成一些数据摘要
8:44.800–8:47.700
zh包括数据的检查
8:47.700–8:49.860
zh包括去检查一些异常值
8:49.860–8:51.700
zh包括老外进行数据分析报告等等
8:51.700–8:54.980
zh但实际上我们说在一个数据分析的完整流程里面
8:54.980–8:57.020
zh像实际在进行业务的过程当中
8:57.020–9:00.240
zh它需要涉及到的阶段其实非常非常多
9:00.240–9:03.160
zh可能会有比如说前期的像数据清洗
9:03.160–9:03.880
zh对不对
9:03.880–9:06.260
zh包括再往前比如说可能要进行数据探索
9:06.260–9:08.880
zh然后很有可能还需要来进行一些
9:08.880–9:10.620
zh数据指标的这样的计算
9:10.620–9:12.680
zh需要来进行一些可视化的分析
9:12.680–9:14.700
zh然后到后期建模的时候
9:14.700–9:15.680
zh可能还会涉及到一些
9:15.680–9:18.480
zh比如说特征的增强
9:18.480–9:20.400
zh或者特征工程的一些操作
9:20.400–9:21.840
zh或者模型融合的一些操作
9:21.840–9:23.880
zh然后在实际机器建模的过程当中
9:23.880–9:25.980
zh还会涉及到一些比较复杂的
9:25.980–9:28.940
zh一些机器学习的算法
9:28.940–9:29.540
zh对不对
9:29.540–9:31.020
zh一些集成算法来进行
9:31.020–9:32.720
zh更加复杂的机器学习的建模
9:32.720–9:35.000
zh甚至后期可能还需要模型融合相关的操作
9:35.000–9:38.680
zh因为其实我早年刚大学毕业的时候实际上就是做数据分析
9:38.680–9:40.180
zh是做大数据相关的工作
9:40.180–9:42.420
zh所以这一整个流程其实非常长
9:42.420–9:45.700
zh其实所有流程里面其实都可以固化一些skills
9:45.700–9:46.840
zh对不对换当线系统里面
9:46.840–9:50.260
zh然后在我们接下来分析的每一个流程的每一个环节里面
9:50.260–9:52.720
zh我们就可以自由的来进行一个切换
9:52.720–9:53.680
zh和来进行个选取了
9:53.680–9:54.480
zh那么除此之外
9:54.480–9:57.480
zh我们这里可能还有一些系统方面的一些设置
9:57.480–10:01.100
zh对于一个像我们刚才这样的一些基本功能的agent来说
10:01.100–10:03.860
zh你可能需要有比如说设置的模型的apir
10:03.860–10:05.140
zh设置这个沙盒环境啊
10:05.140–10:08.200
zh这个沙盒环境主要是给我们的python代码的进行运行的时候
10:08.200–10:09.460
zh单独创建的一个
10:09.460–10:12.340
zh本地的一个这个沙盒环境
10:12.340–10:13.860
zh那么这个沙盒环境其实主要是
10:13.860–10:15.900
zh为了去隔离你当前运行的程序
10:15.900–10:18.100
zh可能会对原始的数据造成一些不好的这个影响
10:18.100–10:19.520
zh在说建在这个沙盒环境
10:19.520–10:21.900
zh那比如说还有什么连接本地的这个MySQL
10:21.900–10:22.460
zh对不对啊
10:22.460–10:25.220
zh你这里肯定还是需要去围绕这个本地的这个MySQL
10:25.220–10:27.320
zh来进行个连接来进行验证等等等等
10:27.320–10:28.460
zh这都是需要的
10:28.460–10:30.140
zh然后还有一些这个数据安全
10:30.140–10:31.160
zh这个安全措施呢
10:31.160–10:33.320
zh其实是我们可以自己来进行一些设置的
10:33.320–10:34.800
zh比如说我们数据库只读
10:34.800–10:36.760
zh这个权限当然你可以自己放宽了
10:36.760–10:38.800
zh然后什么最小上下文的披露
10:38.800–10:40.400
zh什么CPU脚本沙盒
10:40.400–10:42.160
zh这些东西是你可以来进行设置的
10:42.160–10:45.760
zh然后同时还有关于当前整个的数据集的一个概览
10:45.760–10:47.580
zh以及还有些界面外观
10:47.580–10:50.940
zh界面外观其实你就可以任意来进行选取了
10:50.940–10:54.140
zh我们这里其实内置了很多不同类型的页面的外观
10:54.140–10:54.880
zh这个页面外观
10:54.880–10:56.380
zh其实你可以随便
10:56.380–10:58.360
zh你可以自己
10:58.360–11:00.200
zh我们用一些webdesign这个方式
11:00.200–11:01.340
zh来进行设计啊
11:01.340–11:02.660
zh这个其实完全没有什么问题的
11:02.660–11:04.560
zh那实际我们在进行使用的时候
11:04.560–11:06.060
zh这个项目到底有哪一些功能呢
11:06.060–11:06.980
zh这大家可以看到好
11:06.980–11:07.760
zh到底有哪些功能啊
11:07.760–11:08.360
zh当然我们这里
11:08.360–11:10.560
zh对于整个的系统架构来说
11:10.560–11:12.540
zh现在当代的这个AI数据分析的
11:12.540–11:14.200
zh这样的一个体系的这个设置啊
11:14.200–11:16.060
zh都是我们刚刚所看到什么数据资产啊
11:16.060–11:17.120
zh这个Skills中心啊
11:17.120–11:18.340
zh这种写其他是一套
11:18.340–11:20.300
zh跨越项目的维护的一个
11:20.300–11:22.220
zh综合的这样的一个这个设置
11:22.220–11:23.700
zh而我们接下来每一次对话
11:23.700–11:25.720
zh相当于是开启了一个新的数据分析项目
11:25.720–11:26.320
zh是这么一回事
11:26.320–11:28.320
zh比如说我们这一项面点新建数据分析
11:28.320–11:32.740
zh那么它马上我们就相当于是获得了一个全新的数据分析这样的空间
11:32.740–11:34.400
zh然后你加拿就可以连接数据源
11:34.400–11:36.540
zh你可以自己去选取一些数据源
11:36.540–11:39.520
zh你也可以去读取MySQL里面的数据源
11:39.520–11:40.680
zh也都是OK的
11:40.680–11:43.400
zh这里面其实你可以去选择连接各式各样的数据源
11:43.400–11:45.440
zh然后接下来我们就可以开始进行对话了
11:45.440–11:50.480
zh当然上面你可以去选择一些项目的数据
11:50.480–11:52.900
zh然后同时你也可以选择一些分析的工具
11:52.900–11:55.220
zh这些分析工具其实指的是一些分析的skill
11:55.220–11:59.020
zh然后接下来我们说你就可以开始来进行对话了
11:59.020–12:00.960
zh是这么样的一个情况
12:00.960–12:04.480
zh那我们上面其实有一组完成的一组比较复杂的对话
12:04.480–12:06.440
zh大家可以看直接对话这样的效果
12:06.440–12:09.860
zh那么每一个对话就是一个单独的我们分配了这个数据
12:09.860–12:15.240
zh分配了这个sql来进行运行的一个完整的agent运行时这样的一个项目
12:15.240–12:15.540
zh对不对
12:15.540–12:19.460
zh然后当然我们这个项目底层是使用deep seek
12:19.460–12:23.700
zh这个模型deep seek flash这个模型来进行的底层的响应
12:23.700–12:27.320
zh然后同时我们底层的架构是使用Deep Agents
12:27.320–12:31.960
zh就LongChainDeep Agents来进行的底层的这样的一个agent运行时的这样的搭建
12:31.960–12:33.260
zh包括工具调用
12:33.260–12:35.860
zh包括一些系统设置
12:35.860–12:37.060
zh包括Skew加载
12:37.060–12:38.120
zh包括跨线程记忆
12:38.120–12:38.800
zh包括持有机
12:38.800–12:43.660
zh都是通过Deep Agents来完成的开发
12:43.660–12:45.580
zh那么具体我们说它里面有哪些功能
12:45.580–12:47.380
zh大家可以看一下它是怎么样进行对话的
12:47.380–12:48.880
zh这里先随便说两句
12:48.880–12:51.480
zh然后接下来就开始确认我们当前这个数据资产
12:51.480–12:53.840
zh那么它实际上是一个
12:53.840–12:56.880
zhAgentic数据分析这样的流程
12:56.880–13:00.640
zh也就是说它是会根据当前用户这样的需求去判断
13:00.640–13:05.100
zh我们现在是不是需要从我们当前的数据资产里面去盘点某些数据
13:05.100–13:06.680
zh然后再来进行回复
13:06.680–13:07.960
zh是这么样的一个情况
13:07.960–13:12.820
zh那我们先让它这里面就找了一些分析的思路
13:12.820–13:16.820
zh什么旅约体验
13:16.820–13:18.100
zh什么客户口碑
13:18.100–13:20.240
zh交叉归因和建议等等
13:20.240–13:23.200
zh就是说我们现在分析思路行不行
13:23.200–13:24.320
zh我们让他进行分析
13:24.320–13:25.260
zh他给我们提了一个分析思路
13:25.260–13:27.740
zh然后分析前去我们拍板的三件事情
13:27.740–13:29.600
zh然后接下来OK我们就跟他说
13:29.600–13:30.920
zh他就可以开始来进行分析了
13:30.920–13:32.500
zh然后具体分析的过程当中
13:32.500–13:35.180
zh其实他也会他会进行一些
13:35.180–13:36.760
zh比如说字段的提取对不对
13:36.760–13:38.840
zh各式各样的字段的提取
13:38.840–13:40.960
zh但有些简单的字段你可以看
13:40.960–13:44.000
zh直接看比如他去找一些核心的指标
13:44.000–13:44.300
zh对不对
13:44.300–13:46.960
zh定单最多的这样的商品等等
13:46.960–13:49.020
zh当然也会有一些比如说简单的
13:49.020–13:50.980
zh什么月度收入与履约分析趋势
13:50.980–13:54.400
zh那么这里它其实是通过交叉的各个不同维度去筛选出一张表
13:54.400–13:57.140
zh然后这个表其实在我们当前这个系统里面
13:57.140–14:00.400
zh我们是给大家单独集成了一些e-chats的这样的一些工具
14:00.400–14:03.580
zh这个e-chats其实也是我们在进行AI数据分析的过程当中
14:03.580–14:06.080
zh经常会要用到的一个非常核心这样的功能
14:06.080–14:07.800
zh那么它其实就允许对不对
14:07.800–14:11.120
zh有这样的一个一系列的各式各样交互的这个
14:11.120–14:13.200
zh交互的这样的这个效果
14:13.200–14:15.340
zh我们就可以在里面能够去看到了
14:15.340–14:17.720
zh这个是e-chats的这样的一些这个功能
14:17.720–14:22.860
zh然后它是允许我们去根据选取不同的指标
14:22.860–14:24.760
zh然后去选取不同这样的图片
14:24.760–14:27.740
zh然后来进行实时的数据的这样的生成
14:27.740–14:30.960
zh然后其实上面每一步都它执行的一些过程
14:30.960–14:32.540
zh比如说它先提取了一个指标
14:32.540–14:34.440
zh然后在我们对话列表里面
14:34.440–14:36.660
zh我们通过这些结构化输出这样的方式
14:36.660–14:39.280
zh让它去输出一个比如说核心指标
14:39.280–14:41.560
zh某一个特定类型这样的一个message
14:41.560–14:44.600
zh然后我们的系统读取到它特定类型的message之后
14:44.600–14:47.000
zh在前端渲染的时候就会使用这HS
14:47.000–14:47.940
zh把它渲染成这个样子
14:47.940–14:48.580
zh是这么一回事
14:48.580–14:50.120
zh然后接下来比如说
14:50.120–14:51.640
zh它又提取了一组数据
14:51.640–14:53.800
zh那么前端又实时的把它渲染成
14:53.800–14:54.880
zh这样的一个表格
14:54.880–14:55.960
zh可以供我们来进行操作
14:55.960–14:57.000
zh像这样的渲染
14:57.000–14:58.160
zh这样的功能
14:58.160–14:59.600
zh也是现在就比如说
14:59.600–15:01.300
zh我们使用这个Cloud Cowork
15:01.300–15:04.000
zh或者是使用这个ChatGPT的这个Sheet
15:04.000–15:04.960
zh这样的一些这个系统
15:04.960–15:06.020
zh你发现它也是
15:06.020–15:07.780
zh类似这样的一个执行的思路
15:07.780–15:09.660
zh这也是现在当代AI数据分析的
15:09.660–15:11.280
zhagent开发的过程当中
15:11.280–15:14.420
zh一个提升用户观感的一个小技巧
15:14.420–15:15.260
zh一个小技巧
15:15.260–15:15.980
zh就这么一回事
15:15.980–15:18.100
zh然后他又提取各式各样的东西
15:18.100–15:19.480
zh然后在我们系统里面
15:19.480–15:21.280
zh他还有就比如说有一些
15:21.280–15:24.720
zh能够去追溯我们原来的数据
15:24.720–15:26.680
zh整个生成的血脉这样的过程
15:26.680–15:28.520
zh关于像什么数据血缘这样的追溯
15:28.520–15:29.480
zh这个其实也是现在
15:29.480–15:30.720
zh还是进行数据分析的时候
15:30.720–15:32.120
zh有一个非常时髦的一个概念
15:32.120–15:33.000
zh这个血缘追溯
15:33.000–15:34.200
zh其实一个是为了关联分析
15:34.200–15:37.020
zh一个是为了确认我们当前的本身数据
15:37.020–15:39.580
zh提取结果这样的可信度
15:39.580–15:40.780
zh这样的一些功能
15:40.780–15:43.380
zh去进行追溯进行关联检测等等
15:43.380–15:46.700
zh这里他就点一下就可以进来
15:46.700–15:48.980
zh就可以看到他所谓的产物科学源
15:48.980–15:50.420
zh相关这些东西了
15:50.420–16:07.499
zh我们不管我们继续看
16:07.499–16:10.499
zh多维度的一个这个啊 多维度的这个表格分析啊
16:10.499–16:13.299
zh就是一个多维度的这个指标分析啊
16:13.299–16:15.699
zh然后他呢 实际上是提取各个不同维度啊
16:15.699–16:16.899
zh然后来然后来进行分析啊
16:16.899–16:20.099
zh只不过呢 我们他所有提取的各个维度数据在前端渲染的时候呢
16:20.099–16:23.499
zh都给他渲染成了这个啊 大家现在看到的啊
16:23.499–16:26.099
zh这个呃 一些图表的这样的这个模样啊
16:26.099–16:26.699
zh是这么一回事啊
16:26.699–16:29.799
zh所以这里面其实很多很多很多的一些指标的一些这个分析啊
16:29.799–16:32.799
zh所有这个指标都可以提取摘要啊 表格呀 图片呢
16:32.799–16:35.499
zh都是ok的啊 有很多的一些这个分析啊
16:35.499–16:39.559
zh然后同时我们最后其实还有关于什么软投票模型
16:39.559–16:40.999
zh这个其实是一个建模分析
16:40.999–16:43.959
zh我们实际上是让它来进行模型融合相关的分析
16:43.959–16:44.779
zh然后等等等等
16:44.779–16:46.379
zh当然我们在实时运行的过程当中
16:46.379–16:47.879
zh我们其实还给它了一些功能
16:47.879–16:49.759
zh就是这里面在进行对话的时候
16:49.759–16:53.839
zh同时你可以在右边去比如保存一些数据结果
16:53.839–16:55.379
zh这里你可以实时来进行保存
16:55.379–16:55.919
zh其实没有什么问题
16:55.919–16:59.339
zh同时它还会生成一个可视化的报告
16:59.339–17:02.339
zh里面会综合我们现在所有的这些结论
17:02.339–17:06.019
zh然后最后生成一个完整的数据分析的报告
17:06.019–17:07.719
zh然后同时数据分析的报告
17:07.719–17:11.159
zh也是可以直接生成HTML来进行本地的保存的
17:11.159–17:13.919
zh这是我们当前的整个agent一个基本功能
17:13.919–17:15.559
zh当然了解这个基本功能之后
17:15.559–17:17.039
zh其实比较重要的是我们需要看
17:17.039–17:20.279
zh关于整个系统它的架构是如何实现
17:20.279–17:23.579
zh它的架构是怎么样来进行完整的设计的
17:23.579–17:26.059
zh那么对于我们当前这个系统来说
17:26.059–17:27.579
zhOK我们给大家放大一下
17:27.579–17:28.319
zh给大家看一下
17:28.319–17:32.279
zh对我们当前的系统的架构来说
17:32.279–17:34.899
zh那基本上是这么几个方面
17:34.899–17:36.479
zh大家可以先来看一下
17:36.479–17:39.439
zh当然首先大家这个之后
17:39.439–17:40.379
zh如果拿到这个项目的话
17:40.379–17:43.199
zh其实是能够看到它完整的一个架构的这个列表的
17:43.199–17:46.639
zh那首先它肯定是流失对话的这个基本的这个工具台
17:46.639–17:49.279
zh然后呢它是这个fastfpi跟sse的网关
17:49.279–17:50.819
zh因为我们本来是本地的这个部署
17:50.819–17:52.319
zh那这里正好给大家看一下
17:52.319–17:54.319
zh我们实际上在进行这个
17:54.319–17:56.539
zh在进行agent的开发过程当中
17:56.539–17:58.539
zh当我们已经就比如说
17:58.539–18:00.299
zh在这个看到一个成熟的这个项目
18:00.299–18:01.499
zh你可以从哪些角度去看
18:01.499–18:02.639
zh它底层的这样的架构
18:02.639–18:04.839
zh当然首先我们是对话切入的
18:04.839–18:05.659
zh这样一些功能
18:05.659–18:08.199
zh然后就是我们整个Fast API后端服务
18:08.199–18:10.479
zh来进行封装的这样的一个功能模块
18:10.479–18:11.799
zh和SSE的网关
18:11.799–18:13.799
zh然后比较重要的是
18:13.799–18:16.059
zh我们现在的agent运行时的这样的编排
18:16.059–18:17.199
zh那么agent运行时
18:17.199–18:18.879
zh这里我们其实是采用的是
18:18.879–18:20.879
zhDeepseek V4 Flash这样的一个模型
18:20.879–18:21.199
zh对不对
18:21.199–18:22.059
zh然后来了
18:22.059–18:25.079
zhOpenAI的ChatComplations API作为底层
18:25.079–18:26.679
enSorry Responses API
18:26.679–18:28.739
zh作为底层来进行一个基础功能
18:28.739–18:29.599
zh这样的响应
18:29.599–18:30.659
zh然后同时
18:30.659–18:35.619
zh整个的编排是用Deep Agents来进行的编排
18:35.619–18:39.859
zh所以它就会允许我们按照意图来进行工具调用
18:39.859–18:41.859
zh然后同时也可以加载这个Skill
18:41.859–18:45.039
zh这两块功能其实在实际开发过程当中
18:45.039–18:46.199
zh并没有那么的复杂
18:46.199–18:48.659
zh就比如说我们关联一些工具和关联一些Skill
18:48.659–18:50.879
zh其实并没有那么的复杂
18:50.879–18:54.239
zh核心原因是因为对于像LongChain的Deep Agents来说
18:54.239–18:57.959
zh大家可能之前没有看过我们那期Deep Agents的公开课
18:57.959–18:59.819
zh那么对于Deep Agents来说
18:59.819–19:01.259
zh这功能其实都是内置功能
19:01.259–19:02.999
zh你其实只需要几行代码
19:02.999–19:09.339
zh然后去给它写好一些对应的一些skill
19:09.339–19:10.999
zh然后在进行读取的过程当中
19:10.999–19:13.099
zh把这个skill就像工具一样给它读进来
19:13.099–19:15.099
zh然后它就可以加载这样的一些skill
19:15.099–19:17.439
zh这些其实并不会特别的复杂
19:17.439–19:19.619
zh然后比较复杂的其实是
19:19.619–19:21.079
zh关于我们在进数据分析的时候
19:21.079–19:22.699
zh你需要去梳理我们当前系统
19:22.699–19:24.039
zh到底需要哪些功能
19:24.039–19:26.059
zh这一点其实也是现在
19:26.059–19:27.179
zh就是我们经常去讨论
19:27.179–19:28.419
zh比如说像FDE对不对
19:28.419–19:30.259
zh前沿部署工程师
19:30.259–19:31.519
zh我们经常说FDE
19:31.519–19:33.159
zhFDE这个难在哪呢
19:33.159–19:34.499
zh其实不一定是难在
19:34.499–19:36.759
zh说我们要去完成Agent开发
19:36.759–19:39.319
zh其实反而很多FDE的场景下
19:39.319–19:40.639
zhAgent本身的开发难度
19:40.639–19:41.459
zh其实是并不大的
19:41.459–19:43.259
zh然后FDE最难的地方
19:43.259–19:43.859
zh可能在于说
19:43.859–19:45.879
zh它怎么样结合业务去分析
19:45.879–19:46.759
zh我们当前业务到底
19:46.759–19:48.039
zh需要达到哪些目标
19:48.039–19:49.879
zh然后合理的去适配一条
19:49.879–19:51.979
zh最为稳健这样的一个开发方案
19:51.979–19:52.979
zh然后去解决这样的问题
19:52.979–19:54.759
zh比如说拿到数据分析这样的场景
19:54.759–19:55.719
zh它就非常典型了
19:55.719–19:56.119
zh对吧
19:56.119–19:56.879
zh你就可以去分析
19:56.879–19:57.419
zh关于说
19:57.419–19:59.179
zh我们这个数据分析
19:59.179–20:01.479
zh到底需要实现哪一些功能
20:01.479–20:03.859
zh就比如说多元数据接入
20:03.859–20:04.579
zh这个得有
20:04.579–20:06.379
zh然后什么数据
20:06.379–20:08.179
zh只读的数据查询引擎
20:08.179–20:09.819
zh这个查数的功能肯定是要有
20:09.819–20:12.579
zh然后像什么数据清洗和特征工程
20:12.579–20:13.799
zh然后包括数据探索
20:13.799–20:14.719
zh数据可视化分析
20:14.719–20:16.019
zh这东西肯定是要有的
20:16.019–20:16.419
zh对不对
20:16.419–20:17.159
zh这就是一块功能
20:17.159–20:19.399
zh还有什么异步训练精神管道
20:19.399–20:20.419
zh所谓异步训练
20:20.419–20:22.239
zh其实主要指的是一些画图的工作
20:22.239–20:24.019
zh和机器学习建模预测的一些工作
20:24.019–20:25.779
zh然后机器学习和模型融合
20:25.779–20:26.679
zh这个肯定也是要有的
20:26.679–20:29.139
zh我们需要很多时候需要围绕一些数值来进行预测
20:29.139–20:29.399
zh对不对
20:29.399–20:30.399
zh然后出分析报告
20:30.399–20:32.539
zh这条链路基本上就是我们现在
20:32.539–20:34.799
zh其实不仅仅是我们当前项目这么规定的
20:34.799–20:37.199
zh其实现在很多的一些agent开发
20:37.199–20:38.839
zh很多的一些这个数据分析项目
20:38.839–20:40.479
zh基本上也是按照这样的一个链路
20:40.479–20:42.699
zh来规划我们现在整个模块核心需要的功能
20:42.699–20:43.999
zh那么有了这功能之后
20:43.999–20:44.599
zh你会发现
20:44.599–20:45.939
zh那这些功能如何实现
20:45.939–20:46.959
zh基本上就是两层
20:46.959–20:48.779
zh第一层我们说底层
20:48.779–20:51.639
zh你需要有一些基础功能层作为它的支撑
20:51.639–20:52.999
zh比如说你要有本地的数据库
20:52.999–20:53.599
zh对不对
20:53.599–20:55.839
zh你需要有这个项目隔离仓
20:55.839–20:57.339
zh和这个血缘关系的这个梳理
20:57.339–20:59.379
zh你需要有什么这个CircleLite
20:59.379–21:01.339
zh去存储每一个数据集的这个原数据
21:01.339–21:02.879
zh你还需要有独立项目空间和文件
21:02.879–21:05.479
zh这东西其实是怎么说呢
21:05.479–21:09.419
zh就是这东西倒不一定你需要跟Codex去说
21:09.419–21:11.359
zh他其实很多时候自己能够梳理清楚
21:11.359–21:13.059
zh就是你需要去跟他讲的更多的
21:13.059–21:14.479
zh其实是上面这一层
21:14.479–21:17.059
zh我们到底需要有哪一些业务的这个指标
21:17.059–21:18.199
zh以及这所有的业务
21:18.199–21:20.739
zh他需要完成到什么样的这个程度
21:20.739–21:22.779
zh就比如说OK我们的这个分析报告
21:22.779–21:23.959
zh写的什么程度
21:23.959–21:25.439
zh然后我们的这个一步训练进程
21:25.439–21:28.119
zh他需要做到什么样的程度等等
21:28.119–21:31.399
zh然后至于说有了这些程度之后
21:31.399–21:34.779
zh下面的很多的一些功能
21:34.779–21:37.739
zh其实都可以由当前的agent或者kodex
21:37.739–21:38.479
zh自己来去完成
21:38.479–21:39.399
zh这个其实问题不大
21:39.399–21:42.319
zh但是确实需要我们人工来进行讨论和完成
21:42.319–21:43.639
zh实际上是上面这些
21:43.639–21:46.279
zh主要是agent的智能编排程
21:46.279–21:49.239
zh就是比如说我们比如说模型
21:49.239–21:52.279
zh或者最小的工具路由
21:52.279–21:54.439
zh或者sgills这样的披露等等
21:54.439–21:56.939
zh你需要有一整套完整的技术选型
21:56.939–22:00.139
zh确定是需要你需要采用哪一组技术来进行开发
22:00.139–22:03.339
zhOK 差不多是这样的一个基本的架构
22:03.339–22:05.819
zh所以我们说从架构当中
22:05.819–22:07.019
zh你也能够看得出来
22:07.019–22:10.019
zh基本上我们现在在进行agent开发过程当中
22:10.019–22:12.039
zh其实比较重要的第一点
22:12.039–22:14.259
zh其实倒不一定怎么说
22:14.259–22:17.919
zh当然选取一个合适的工具和模型也很重要
22:17.919–22:19.139
zh但是其实更加重要的是
22:19.139–22:20.579
zh你需要非常清楚的知道
22:20.579–22:23.299
zh我们当前的业务的意图是什么
22:23.299–22:27.959
zh那也就是说我们现在到底需要解决哪一些这个问题啊
22:27.959–22:28.559
zh然后呢
22:28.559–22:33.059
zh到底有哪一些这个非常关键的这样的一些这个场景啊
22:33.059–22:33.999
zh等等等等啊
22:33.999–22:34.999
zh这些呢可能是
22:34.999–22:35.259
zh
22:35.259–22:35.959
zh放大一下
22:35.959–22:38.859
zh那么这些呢可能是首先我们需要确认的啊
22:38.859–22:39.519
zh然后呢
22:39.519–22:43.699
zh接下来比较重要的是我们可能就需要讨论清楚
22:43.699–22:48.339
zh关于我要去解决当前这样的一些业务的难题啊
22:48.339–22:48.539
zh
22:48.539–22:50.939
zh你得做好哪一些技术这个选型
22:50.939–22:51.559
zh对不对啊
22:51.559–22:53.479
zh就是选型这块肯定也是我们需要去做的啊
22:53.479–22:55.739
zh那么然后再往下才是啊
22:55.739–22:57.079
zh你用着这个codex啊
22:57.079–22:59.599
zh你用着这个这个deep seek啊
22:59.599–23:00.499
zh这样的这个模型啊
23:00.499–23:01.879
zh再来进行一轮一轮的开发啊
23:01.879–23:02.419
zh是这么一回事
23:02.419–23:02.859
zh
23:02.859–23:06.379
zh那么了解了我们当前整个系统
23:06.379–23:09.759
zh那完整的一些基本的功能之后啊
23:09.759–23:10.539
zh那么接下来啊
23:10.539–23:12.039
zh就我们需要来看一看啊
23:12.039–23:13.359
zh他到底应该呃
23:13.359–23:15.379
zh怎么样来进行开发和底层的这个思路啊
23:15.379–23:16.032
zh到底是什么样的呢
0:00.000–0:09.169
好,那麼之前我們已經了解了關於 DeepSeek 模型的 Responses API 和 Codex 如何進行接入。
0:09.169–0:15.917
現在其實對於我們的開發者學習來說,前期肯定需要有一個基礎學習的過程。
0:15.917–0:28.200
當然,其實我認為更長的学习週期應該放在圍繞一個又一個項目來進行開發試錯,不斷地提取經驗,然後最後優化完成一個系統開發的整個完整鏈路。
0:28.200–0:32.100
那麼大家現在看到的 DS4-AI 數據分析系統
0:32.100–0:37.600
實際上就是接下來帶大家來手動一步一步完成搭建的這樣的一個開發項目。
0:37.600–0:43.620
當然,我們這裡同樣是使用 DeepSeek V4 Flash 搭配 Codex 來完成一個系列完整的開發。
0:43.620–0:48.420
實際上大家需要知道,儘管現在 DeepSeek 我們使用的是 Flash 這樣的小號模型。
0:48.420–0:52.080
但是其實它的性能並不比今年上半年或今年年初
0:52.080–0:57.820
對吧,當時 Codex 當時的 o4.5 這樣的模型的性能差,甚至還要強很多。
0:57.820–0:59.640
所以其實對這樣的性能來說
0:59.640–1:00.720
儘管它是小號
1:00.720–1:02.300
但是對於很多開發任務來說
1:02.300–1:03.920
其實絕對可以來進行使用的。
1:03.920–1:05.960
並且它本身的響應速度也很快。
1:05.960–1:06.360
對吧。
1:06.360–1:09.700
再加上現在和整個 Codex 的兼容特性也非常穩定。
1:09.700–1:11.760
那麼我們剛才其實是圍繞著
1:11.760–1:15.140
我們的 Part 3 的課件重新進行一輪修正。
1:15.140–1:17.300
然後我們剛剛講了 Codex 好多功能
1:17.300–1:19.380
什麼 States
1:19.380–1:20.240
什麼 Innet
1:20.240–1:21.360
什麼項目結構
1:21.360–1:22.160
代理程式
1:22.160–1:23.940
各式各樣的這些東西
1:23.940–1:25.260
應該怎麼樣進行編寫
1:25.260–1:26.940
包括它的 Sandbox
1:26.940–1:28.400
怎麼樣來進行開啟
1:28.400–1:28.760
對吧
1:28.760–1:30.540
他的 Subagents 怎麼樣來進行開啟等等。
1:30.540–1:32.900
我們之前課程裡面的截圖被吞了
1:32.900–1:33.780
導致大家可能沒有看到
1:33.780–1:34.500
沒關係
1:34.500–1:35.680
大家現在可以再去看一看
1:35.680–1:37.720
我們的 Part 3 裡面的這些截圖
1:37.720–1:39.860
再回顧一下 Codex 整體這樣的功能。
1:39.860–1:40.560
那麼接下來
1:40.560–1:42.020
在整個實操過程當中
1:42.020–1:44.460
也會有一個更加快速的
1:44.460–1:46.080
上手的這樣的一個效果。
1:46.080–1:48.320
當然我們在所有的開發過程當中
1:48.320–1:50.340
我們首先需要跟大家先梳理清楚的是
1:50.340–1:51.100
整個開發思路
1:51.100–1:53.380
和需要用到的 Codex 相關功能
1:53.380–1:55.340
以及圍繞我們當前這個系統
1:55.340–1:56.720
我們怎麼樣來進行技術選型
1:56.720–1:59.760
我們的公開課其實每一期公開課時間都有限
1:59.760–2:01.400
可能我們只能夠講到這一層
2:01.400–2:04.880
至於說最後通過總共 40 多輪這樣的提示
2:04.880–2:08.380
就完成一整個系統開發的每一輪提示詞
2:08.380–2:10.720
和每一輪系統的快照還是一樣的
2:10.720–2:11.700
我們會放在課件裡面
2:11.700–2:13.040
大家回頭可以自己拿到再去看
2:13.040–2:15.760
然後我們的公開課有限的最後一個小時
2:15.760–2:17.620
這個時間會跟大家梳理清楚
2:17.620–2:20.180
關於整個項目在進行開發的過程當中
2:20.180–2:23.500
它的底層的思路和技術選型到底是什麼樣
2:23.500–2:25.120
我們之前 K3 的課其實也是
2:25.120–2:26.340
進展到這一部分的時候
2:26.340–2:27.200
時間稍微有點緊
2:27.200–2:27.660
2:27.660–2:29.640
那麼首先我們在對照這個項目
2:29.640–2:30.300
跟大家來說
2:30.300–2:31.800
到底有哪一些這樣的功能
2:31.800–2:35.080
當然其實從整個 AI 技術興起開始
2:35.080–2:37.120
就是關於使用 AI 來進行數據分析
2:37.120–2:39.120
其實是一塊非常大的功能
2:39.120–2:40.720
非常大的一塊業務的需求
2:40.720–2:42.280
包括我們現在課程裡面
2:42.280–2:44.120
總共有四項旗艦項目裡面
2:44.120–2:46.120
而且有一個項目也是工業級的
2:46.120–2:47.900
非常複雜的 AI 數據分析
2:47.900–2:49.440
那麼圍繞這個數據分析
2:49.440–2:52.720
其實它內部有很多的一些技術體系
2:52.720–2:54.040
包括像 NL2SQL 技術
2:54.040–2:55.260
包括像這個現在
2:55.260–2:56.300
還有全自動的
2:56.300–2:58.000
這個 AI 來進行機器學習建模
2:58.000–2:58.560
等等等等
2:58.560–2:59.560
各個細分的
2:59.560–3:00.720
這樣的這個技術體系
3:00.720–3:01.520
當然之所以
3:01.520–3:03.440
AI能夠很好地進行數據分析
3:03.440–3:04.120
這樣的操作
3:04.120–3:04.940
其實也是因為
3:04.940–3:06.720
這對大模型來說
3:06.720–3:07.640
內容創作
3:07.640–3:08.540
或許不太行
3:08.540–3:09.580
然後呢
3:09.580–3:10.900
在最開始的時候
3:10.900–3:12.220
非常複雜的大規模
3:12.220–3:12.840
幾萬行
3:12.840–3:14.200
十幾萬行代碼的項目開發
3:14.200–3:15.040
或許有點困難
3:15.040–3:16.580
但是像AI數據分析
3:16.580–3:16.880
對吧
3:16.880–3:18.580
從這些數據中尋找規律並做出判斷
3:18.580–3:19.120
然後呢
3:19.120–3:20.080
寫一些這個circle
3:20.080–3:21.580
來完成一些高精準度的
3:21.580–3:24.700
數據清洗或數據建模相關的這個操作
3:24.700–3:28.960
這對AI來說實際上是非常容易實現的
3:28.960–3:32.000
所以現在如果你看所有各個領域的落地
3:32.000–3:33.440
各項其實落地的這個情況來看
3:33.440–3:37.180
像AI數據分析這個領域的落地應該是非常深刻
3:37.180–3:37.820
非常徹底
3:37.820–3:40.880
並且是很早就能取得非常顯著這樣的成效了
3:40.880–3:43.620
所以現在我們在進行一些項目
3:43.620–3:44.780
拿了一些項目來進行開發
3:44.780–3:45.660
大家想去練手
3:45.660–3:48.360
尤其是咱們接下來如果邱昭想去找工作的話
3:48.360–3:51.060
那麼其實做幾個AI數據分析這樣的項目
3:51.060–3:54.320
是能夠很能夠是能夠獲得一些成果的
3:54.320–3:56.240
那麼接下來我們給大家介紹的
3:56.240–3:58.300
這個DS4-AI數據分析系統
3:58.300–3:59.420
實際上就是現在
3:59.420–4:02.180
就現在這個階段適配於2026下半年
4:02.180–4:04.620
比較適合去做一個
4:04.620–4:07.620
大家如果想要去做一些履歷項目的一個功能
4:07.620–4:08.340
非常齊全
4:08.340–4:11.400
並且性能也還非常不錯的一個完整的AI數據分析系統
4:11.400–4:12.820
那麼這個數據分析系統
4:12.820–4:14.340
我們先來看看它到底有哪些功能
4:14.340–4:16.740
首先對於整個數據分析系統來說
4:16.740–4:18.220
它必須得有一個漂亮的頁面
4:18.220–4:22.380
這不是必要的,但如果有的話當然更好,對吧
4:22.380–4:26.060
有一個比較好的 Web Design 效果肯定會更好
4:26.060–4:29.420
當然我們的 Web Design 是怎麼做的,我們稍後再跟大家說,這先不着急
4:29.420–4:32.140
然後首先我們肯定是要有一個
4:32.140–4:36.260
稍等,我們把它切換成淺色的
4:36.260–4:44.340
因為淺色的話,我覺得可能更容易看得出效果一些
4:44.340–4:48.300
好,那麼首先第一塊是需要有一個數據資產管理的系統
4:48.300–4:49.680
所謂數據資產管理系統指的是
4:49.680–4:52.280
我們需要有一個完整的工程模組
4:52.280–4:53.980
去負責給當前的 AI 數據分析
4:53.980–4:56.500
去介入各個不同渠道的數據
4:56.500–4:58.920
包括你本地的 Excel、CSV 數據
4:58.920–5:01.160
包括你數據庫裡面的一些數據
5:01.160–5:02.060
MySQL 的數據
5:02.060–5:02.940
SQLite 的數據
5:02.940–5:05.020
甚至是一些分佈式數據庫裡面等等
5:05.020–5:08.400
總之你需要維護一整個數據資產也好
5:08.400–5:09.440
或者數據中台也好
5:09.440–5:11.520
負責去介入各式各樣不同類型的數據
5:11.520–5:12.960
當然這一部分開發
5:12.960–5:14.640
其實是整個項目裡面來說
5:14.640–5:15.920
應該是非常簡單的一塊功能
5:15.920–5:18.640
因為無非就是去驗證各個不同渠道的
5:18.640–5:22.140
驗證各個不同渠道的一些數據的情況
5:22.140–5:24.660
然後再來進行開發
5:24.660–5:26.740
然後我們現在看一下
5:26.740–5:29.120
因為我現在連接的是遠端的服務
5:29.120–5:30.980
所以 MySQL 是啟動不了的
5:30.980–5:31.880
因為我本地沒做 MySQL
5:31.880–5:33.700
但其他的數據是能看到的
5:33.700–5:33.980
對吧
5:33.980–5:36.340
就很多很多各式各樣的數據
5:36.340–5:38.980
你可以去查詢各個不同類型的欄位
5:38.980–5:39.300
對吧
5:39.300–5:40.820
它各個不同類型的數據等等等等
5:40.820–5:43.180
那首先呢我們其實是在需要為整個系統呢
5:43.180–5:46.660
需要維護一個完整的中台數據功能
5:46.660–5:48.520
或是數據存儲等功能
5:48.520–5:49.960
當然對於一些企業應用場景而言
5:49.960–5:50.880
它可能還會涉及一些
5:50.880–5:52.700
例如數據權限
5:52.700–5:54.460
查詢權限等等
5:54.460–5:56.360
當然這個數據資產的管理
5:56.360–5:58.500
一方面你需要設置一些
5:58.500–5:59.780
例如遠程的 MySQL 連接
5:59.780–6:01.540
或是你自己本地導入一些數據
6:01.540–6:02.900
同時它還會涉及一些
6:02.900–6:04.960
例如我們在實際進行數據分析時
6:04.960–6:06.920
中間狀態提取的數據
6:06.920–6:08.480
或是臨時存儲的數據
6:08.480–6:10.160
或是某些數據結論等等
6:10.160–6:12.440
統一都是從一個功能入口
6:12.440–6:13.980
進行統一的維護
6:13.980–6:15.660
這裡能看到哪些數據資產
6:15.660–6:16.920
服務項目
6:16.920–6:18.060
多少行數據
6:18.060–6:20.020
本地數據的規模等
6:20.020–6:22.080
這個數據量其實還挺大的
6:22.080–6:23.480
數據規模相當龐大
6:23.480–6:24.860
畢竟有三百多萬行的數據
6:24.860–6:25.100
對吧
6:25.100–6:26.820
還是一個相當大的數據量
6:26.820–6:27.920
然後這個數據
6:27.920–6:29.160
我們在課程中
6:29.160–6:30.380
因為是為了這個項目
6:30.380–6:31.140
進行測試
6:31.140–6:32.500
所以它分布在
6:32.500–6:33.320
MySQL
6:33.320–6:34.260
[未翻譯]
6:34.260–6:34.900
Excel
6:34.900–6:35.420
CSV
6:35.420–6:37.220
這四種不同類型的數據庫中
6:37.220–6:38.980
四種不同類型的數據載體中
6:38.980–6:40.400
所以我們可以將其分散
6:40.400–6:42.820
那麼課程中設計的這四個數據載體
6:42.820–6:44.620
應該是非常通用的這四個數據載體
6:44.620–6:45.200
除此之外呢
6:45.200–6:48.700
你還可以考慮擴展連接更複雜的一些數據載體
6:48.700–6:49.520
也都是可以的
6:49.520–6:50.140
這是第一個
6:50.140–6:51.080
那麼第二個呢
6:51.080–6:53.460
是對於現在這個數據分析系統來說
6:53.460–6:55.640
你或多或少總得為它準備一些
6:55.640–6:56.760
這個技能系統
6:56.760–6:57.380
對吧
6:57.380–6:58.920
那麼什麼叫做這個數據分析
6:58.920–6:59.880
這個技能系統
6:59.880–7:01.960
我們給大家看一下在我們實際對話的過程中
7:01.960–7:05.840
那麼我們實際上在進行具體對話的時候
7:05.840–7:07.660
那你需要來進行數據分析
7:07.660–7:07.940
對吧
7:07.940–7:11.220
那有很多很多需要來進行分析的
7:11.220–7:15.760
需要來進行分析的一些事項
7:15.760–7:19.100
那麼有時候你可能會偏好某些分析的流程
7:19.100–7:21.860
分析偏好某些可視化這樣的方式
7:21.860–7:24.340
或者你原本你們公司來進行數據分析
7:24.340–7:26.840
或者提取特定的業務指標
7:26.840–7:28.900
可能就有具體的一些領域知識
7:28.900–7:29.220
對吧
7:29.220–7:30.240
那這些東西的話
7:30.240–7:32.240
怎麼樣灌輸給當前的數據分析系統
7:32.240–7:33.960
其實我們可能考慮的
7:33.960–7:35.960
就通過 Skill 這樣的方式去告訴
7:35.960–7:37.400
我們當前的數據分析系統
7:37.400–7:39.060
我們在不同環節的時候
7:39.060–7:40.700
到底需要做哪些事情
7:40.700–7:41.080
對吧
7:41.080–7:41.960
可視化的時候
7:41.960–7:45.880
往往都是採用什麼樣的圖表
7:45.880–7:47.340
來進行繪製
7:47.340–7:48.000
對吧
7:48.000–7:50.060
然後還可以選擇
7:50.060–7:51.720
其他的什麼餅圖
7:51.720–7:55.140
熱力圖等等
7:55.140–7:58.160
各種圖表來進行呈現
7:58.160–7:59.220
那麼總之就是
7:59.220–8:00.000
我們其實
8:00.000–8:03.966
總之,我們其實在許多時候進行先期分析時,都會涉及到非常具體領域內的特殊判斷。
8:03.966–8:06.000
這些事情都可以透過 Skill 來完成。
8:06.000–8:11.500
更不用說,例如我們後期還需要圍繞數據報告,去生成對應的數據報告。
8:11.500–8:12.780
那麼在生成數據報告的時候
8:12.780–8:15.540
更是你的數據報告裡面需要包含哪些分析維度
8:15.540–8:15.840
對吧
8:15.840–8:19.000
它需要有哪一些特定的這類指標的統計
8:19.000–8:21.600
然後如何去解讀一些在我們本身數據分析過程中
8:21.600–8:22.760
可能涉及到行業的黑話
8:22.760–8:24.660
那這些東西其實都屬於一個分析體系裡面
8:24.660–8:26.600
它必須要去具備一些這樣的機能
8:26.600–8:29.960
那這些東西當然都是透過這一連串的 Skill 來完成
8:29.960–8:32.460
所以我們這裡其實是預先設定了很多
8:32.460–8:33.380
也沒有很多
8:33.380–8:35.840
就總共內建了 4 個 Skill
8:35.840–8:37.620
因為都是用 Codex 進行開發
8:37.620–8:39.540
所以我們這裡設定了一些場景
8:39.540–8:41.980
然後設定了 4 種不同類型的 Skill
8:41.980–8:44.800
那麼它包括例如生成一些數據摘要
8:44.800–8:47.700
包括數據的檢查
8:47.700–8:49.860
包括去檢查一些異常值
8:49.860–8:51.700
包括進行數據分析報告等等
8:51.700–8:54.980
但實際上我們說,在一個數據分析的完整流程裡面
8:54.980–8:57.020
像實際進行業務的過程當中
8:57.020–9:00.240
它需要涉及的階段其實非常多非常多
9:00.240–9:03.160
可能會有的,例如前期的像數據清洗
9:03.160–9:03.880
對吧
9:03.880–9:06.260
包括再往前,例如可能還要進行數據探索
9:06.260–9:08.880
然後很有可能還需要來進行一些
9:08.880–9:10.620
數據指標這樣的計算
9:10.620–9:12.680
需要來進行一些可視化的分析
9:12.680–9:14.700
然後到後期建模的時候
9:14.700–9:15.680
可能還會涉及到一些
9:15.680–9:18.480
例如特徵增強
9:18.480–9:20.400
或者特徵工程的一些操作
9:20.400–9:21.840
或者模型融合的一些操作
9:21.840–9:23.880
然後在實際機器建模的過程當中
9:23.880–9:25.980
還會涉及到一些比較複雜的
9:25.980–9:28.940
一些機器學習的算法
9:28.940–9:29.540
對吧
9:29.540–9:31.020
使用一些集成算法來進行
9:31.020–9:32.720
更複雜的機器學習建模
9:32.720–9:35.000
甚至後期可能還需要進行模型融合相關的作業
9:35.000–9:38.680
因為其實我早年剛大學畢業時,實際上就是從事數據分析工作
9:38.680–9:40.180
從事與大數據相關的工作
9:40.180–9:42.420
所以這整個流程其實非常長
9:42.420–9:45.700
其實在所有流程中,都可以將一些技能固化下來
9:45.700–9:46.840
對吧,在系統線路中
9:46.840–9:50.260
然後在我們接下來分析的每個流程的每個環節中
9:50.260–9:52.720
我們就可以自由地進行切換
9:52.720–9:53.680
並進行選擇
9:53.680–9:54.480
那麼除此之外
9:54.480–9:57.480
我們這裡可能還有一些系統方面的設定
9:57.480–10:01.100
對於像我們剛才那樣的基本功能代理來說
10:01.100–10:03.860
你可能需要設定模型的 API
10:03.860–10:05.140
設定這個沙盒環境
10:05.140–10:08.200
這個沙盒環境主要是為了讓我們執行 Python 程式碼時
10:08.200–10:09.460
單獨建立一個
10:09.460–10:12.340
本地的沙盒環境
10:12.340–10:13.860
那麼這個沙盒環境其實主要是
10:13.860–10:15.900
為了隔離你當前執行的程式
10:15.900–10:18.100
可能會對原始資料造成一些不良影響
10:18.100–10:19.520
建立在這個沙盒環境中
10:19.520–10:21.900
那比如說還有什麼連接本地的 MySQL
10:21.900–10:22.460
對吧
10:22.460–10:25.220
你這裡肯定還是需要圍繞這個本地的 MySQL
10:25.220–10:27.320
來進行連接、驗證等等
10:27.320–10:28.460
這些都是需要的
10:28.460–10:30.140
然後還有一些資料安全
10:30.140–10:31.160
這些安全措施呢
10:31.160–10:33.320
其實我們可以自行進行一些設定
10:33.320–10:34.800
比如說我們的資料庫只讀
10:34.800–10:36.760
這個權限當然你可以自行放寬
10:36.760–10:38.800
然後什麼是最小上下文披露
10:38.800–10:40.400
什麼 CPU 腳本沙盒
10:40.400–10:42.160
這些東西是你來進行設定的
10:42.160–10:45.760
然後同時還有關於當前整個資料集的概覽
10:45.760–10:47.580
以及還有些介面外觀
10:47.580–10:50.940
介面外觀其實你就可以任意進行選擇了
10:50.940–10:54.140
我們這裡其實內建了許多不同類型頁面的外觀
10:54.140–10:54.880
這個頁面外觀
10:54.880–10:56.380
其實你可以隨意
10:56.380–10:58.360
你可以自己
10:58.360–11:00.200
我們用一些 Web Design 這種方式
11:00.200–11:01.340
來進行設計啊
11:01.340–11:02.660
這個其實完全沒有什麼問題
11:02.660–11:04.560
那實際我們在進行使用的時候
11:04.560–11:06.060
這個專案到底有哪些功能呢
11:06.060–11:06.980
這大家可以看到好
11:06.980–11:07.760
到底有哪些功能啊
11:07.760–11:08.360
當然我們這裡
11:08.360–11:10.560
對於整個系統架構來說
11:10.560–11:12.540
現在當代這個 AI 數據分析的
11:12.540–11:14.200
這樣一個體系的這個設定啊
11:14.200–11:16.060
都是我們剛剛所看到什麼數據資產啊
11:16.060–11:17.120
這個 Skills 中心啊
11:17.120–11:18.340
這種寫其他是一套
11:18.340–11:20.300
跨越專案維護的一個
11:20.300–11:22.220
綜合的這樣的一個這個設定
11:22.220–11:23.700
而我們接下來每一次對話
11:23.700–11:25.720
相當於是開啟了一個新的數據分析專案
11:25.720–11:26.320
是這麼一回事
11:26.320–11:28.320
比如說我們這一項面點新建數據分析
11:28.320–11:32.740
那麼它馬上我們就相當於是獲得了一個全新的數據分析這樣的空間
11:32.740–11:34.400
然後你就可以連接數據源
11:34.400–11:36.540
你可以自己去選取一些數據源
11:36.540–11:39.520
你也可以去讀取 MySQL 裡面的數據源
11:39.520–11:40.680
也都是 OK 的
11:40.680–11:43.400
這裡面其實你可以去選擇連接各式各樣的數據源
11:43.400–11:45.440
然後接下來我們就可以開始進行對話了
11:45.440–11:50.480
當然上面你可以去選擇一些專案的數據
11:50.480–11:52.900
然後同時你也可以選擇一些分析的 tool
11:52.900–11:55.220
這些分析 tool 其實指的是一些分析的 skill
11:55.220–11:59.020
然後接下來我們說你就可以開始來進行對話了
11:59.020–12:00.960
是這麼樣的的一個情況
12:00.960–12:04.480
那我們上面其實有一組完成的一組比較複雜的對話
12:04.480–12:06.440
大家可以看直接對話這樣的效果
12:06.440–12:09.860
那麼每一個對話就是一個單獨的我們分配了這個數據
12:09.860–12:15.240
分配了這個 SQL 來進行運行的一個完整的 Agent 運行時這樣的一個專案
12:15.240–12:15.540
對吧
12:15.540–12:19.460
然後當然我們這個項目底層是使用 Deep Seek
12:19.460–12:23.700
這個模型 Deep Seek Flash 這個模型來進行底層的回應
12:23.700–12:27.320
然後同時我們底層的架構是使用 Deep Agents
12:27.320–12:31.960
就是 LongChain Deep Agents 來進行底層的這樣一個 Agent 運行時的這樣的搭建
12:31.960–12:33.260
包括工具呼叫
12:33.260–12:35.860
包括一些系統設定
12:35.860–12:37.060
包括 Skew 加載
12:37.060–12:38.120
包括跨線程記憶
12:38.120–12:38.800
包括持有机
12:38.800–12:43.660
都是透過 Deep Agents 來完成的開發
12:43.660–12:45.580
那麼具體我們說它裡面有哪些功能
12:45.580–12:47.380
大家可以看一下它是怎麼樣進行對話的
12:47.380–12:48.880
這裡先隨便說兩句
12:48.880–12:51.480
然後接下來就開始確認我們當前這個數據資產
12:51.480–12:53.840
那麼它實際上是一個
12:53.840–12:56.880
Agentic 數據分析這樣的流程
12:56.880–13:00.640
也就是說它是會根據當前用戶這樣的需求去判斷
13:00.640–13:05.100
我們現在是不是需要從我們當前的數據資產裡面去盤點某些數據
13:05.100–13:06.680
然後再來進行回覆
13:06.680–13:07.960
是這麼樣的的一個情況
13:07.960–13:12.820
那我們先讓它裡面就找了一些分析的思路
13:12.820–13:16.820
什麼履約體驗
13:16.820–13:18.100
什麼客戶口碑
13:18.100–13:20.240
交叉歸因和建議等等
13:20.240–13:23.200
就是說我們現在分析思路行不行
13:23.200–13:24.320
我們讓他進行分析
13:24.320–13:25.260
他給我們提了一個分析思路
13:25.260–13:27.740
然後分析前去我們拍板的三件事情
13:27.740–13:29.600
然後接下來 OK 我們就跟他說
13:29.600–13:30.920
他就可以開始來進行分析了
13:30.920–13:32.500
然後具體分析的過程當中
13:32.500–13:35.180
其實他也會他會進行一些
13:35.180–13:36.760
比如說字段的提取對吧
13:36.760–13:38.840
各式各樣的字段的提取
13:38.840–13:40.960
但有些簡單的字段你可以看
13:40.960–13:44.000
直接看比如他去找一些核心的指標
13:44.000–13:44.300
對吧
13:44.300–13:46.960
訂單最多的這樣的商品等等
13:46.960–13:49.020
當然也會有一些比如說簡單的
13:49.020–13:50.980
什麼月度收入與履約分析趨勢
13:50.980–13:54.400
那麼這裡它其實是透過交叉各個不同維度來篩選出一張表格
13:54.400–13:57.140
然後這張表格其實在我們目前的系統裡面
13:57.140–14:00.400
我們是為各位單獨整合了一些 e-chats 這樣的工具
14:00.400–14:03.580
這個 e-chats 其實也是我們在進行 AI 數據分析的過程當中
14:03.580–14:06.080
經常會要用到的非常核心這樣的功能
14:06.080–14:07.800
那麼它其實就允許,對吧?
14:07.800–14:11.120
有這樣一系列各種各樣互動的
14:11.120–14:13.200
互動這樣的效果
14:13.200–14:15.340
我們就可以在里面看到了
14:15.340–14:17.720
這是 e-chats 的一些功能
14:17.720–14:22.860
然後它允許我們根據選取不同的指標
14:22.860–14:24.760
然後選取不同的圖片
14:24.760–14:27.740
然後進行實時數據的生成
14:27.740–14:30.960
然後其實上面每一步它執行的一些過程
14:30.960–14:32.540
比如說它先提取了一個指標
14:32.540–14:34.440
然後在我們的對話列表裡面
14:34.440–14:36.660
我們透過這些結構化輸出的方式
14:36.660–14:39.280
讓它去輸出一個比如說核心指標
14:39.280–14:41.560
某一種特定類型的訊息
14:41.560–14:44.600
然後我們的系統讀取到它特定類型的訊息之後
14:44.600–14:47.000
在前端渲染的時候就會使用這HS
14:47.000–14:47.940
將其渲染成這個樣子
14:47.940–14:48.580
就是這麼回事
14:48.580–14:50.120
然後接下來,例如說
14:50.120–14:51.640
它又提取了一組數據
14:51.640–14:53.800
那麼前端又即時將其渲染成
14:53.800–14:54.880
這樣的一個表格
14:54.880–14:55.960
供我們進行操作
14:55.960–14:57.000
像這樣的渲染
14:57.000–14:58.160
這樣的應用功能
14:58.160–14:59.600
也就是現在舉例來說
14:59.600–15:01.300
我們使用這個Cloud Cowork
15:01.300–15:04.000
或是使用這個ChatGPT的Sheet
15:04.000–15:04.960
這類的一些系統
15:04.960–15:06.020
你會發現它也是
15:06.020–15:07.780
類似這樣的執行思路
15:07.780–15:09.660
這也是當今AI數據分析
15:09.660–15:11.280
在開發 agent 的過程中
15:11.280–15:14.420
一個提升使用者體驗的小技巧
15:14.420–15:15.260
小技巧
15:15.260–15:15.980
就是這麼回事
15:15.980–15:18.100
接著他又提取了各種各樣的東西
15:18.100–15:19.480
然後在我們的系統裡面
15:19.480–15:21.280
他還有比如說有一些
15:21.280–15:24.720
能夠追溯我們原始數據
15:24.720–15:26.680
整個生成的血緣過程
15:26.680–15:28.520
關於像數據血緣這樣的追溯
15:28.520–15:29.480
這其實也是現在
15:29.480–15:30.720
進行數據分析時
15:30.720–15:32.120
一個非常時髦的概念
15:32.120–15:33.000
這個血緣追溯
15:33.000–15:34.200
其實一方面是為了關聯分析
15:34.200–15:37.020
另一方面是為了確認我們當前原始數據
15:37.020–15:39.580
提取結果的可信度
15:39.580–15:40.780
這樣的一些功能
15:40.780–15:43.380
進行追溯和關聯檢測等
15:43.380–15:46.700
這裡他點一下就可以進來
15:46.700–15:48.980
就可以看到所謂的產物科學源
15:48.980–15:50.420
相關這些內容了
15:50.420–16:07.499
我們繼續往下看
16:07.499–16:10.499
多維度的這個啊 多維度的表格分析啊
16:10.499–16:13.299
就是多維度的指標分析啊
16:13.299–16:15.699
然後他實際上提取了各個不同維度啊
16:15.699–16:16.899
然後來進行分析啊
16:16.899–16:20.099
只不過呢 我們他所有提取的各維度數據在前端渲染時呢
16:20.099–16:23.499
都渲染成了這個啊 大家現在看到的啊
16:23.499–16:26.099
這個呃 一些圖表這樣的模樣啊
16:26.099–16:26.699
就是這麼回事啊
16:26.699–16:29.799
所以這裡面其實有很多很多很多的一些指標分析啊
16:29.799–16:32.799
所有這些指標都可以提取摘要啊 表格呀 圖片呢
16:32.799–16:35.499
都是ok的啊 有很多的一些分析啊
16:35.499–16:39.559
然後同時我們最後其實還有關於什麼軟投票模型
16:39.559–16:40.999
這其實是一個建模分析
16:40.999–16:43.959
我們實際上是讓它來進行模型融合相關的分析
16:43.959–16:44.779
然後等等等等
16:44.779–16:46.379
當然我們在即時運行的過程中
16:46.379–16:47.879
我們其實還給它了一些功能
16:47.879–16:49.759
就是這裡面在進行對話時
16:49.759–16:53.839
同時你可以在右邊去比如保存一些數據結果
16:53.839–16:55.379
這裡你可以即時進行保存
16:55.379–16:55.919
其實沒什麼問題
16:55.919–16:59.339
同時它還會生成一份可視化的報告
16:59.339–17:02.339
裡面會綜合我們目前所有的這些結論
17:02.339–17:06.019
然後最後生成一份完整的数据分析報告
17:06.019–17:07.719
然後同時這份數據分析報告
17:07.719–17:11.159
也可以直接生成 HTML 進行本地保存
17:11.159–17:13.919
這是我們目前整個 Agent 的基本功能
17:13.919–17:15.559
當然在了解這個基本功能之後
17:15.559–17:17.039
其實比較重要的是我們需要看
17:17.039–17:20.279
關於整個系統它的架構是如何實現的
17:20.279–17:23.579
它的架構是怎樣進行完整設計的
17:23.579–17:26.059
那麼對於我們目前這個系統來說
17:26.059–17:27.579
好的我們給大家放大一下
17:27.579–17:28.319
給大家看一下
17:28.319–17:32.279
對我們目前系統的架構來說
17:32.279–17:34.899
那基本上是這麼幾個方面
17:34.899–17:36.479
大家可以先來看一下
17:36.479–17:39.439
當然首先大家這個之後
17:39.439–17:40.379
如果拿到這個項目的話
17:40.379–17:43.199
其實能夠看到它完整的一個架構列表
17:43.199–17:46.639
那首先它肯定是流式對話的基本工具台
17:46.639–17:49.279
然後呢它是這個 FastAPI 跟 SSE 的網關
17:49.279–17:50.819
因為我們本來是本地部署
17:50.819–17:52.319
那這裡正好給大家看一下
17:52.319–17:54.319
我們實際上在進行這個
17:54.319–17:56.539
在進行 Agent 開發的過程當中
17:56.539–17:58.539
當我們已經就比如說
17:58.539–18:00.299
在這個看到一個成熟的項目
18:00.299–18:01.499
你可以從哪些角度去看
18:01.499–18:02.639
它底層這樣的架構
18:02.639–18:04.839
當然首先我們是對話切入的
18:04.839–18:05.659
這樣一些功能
18:05.659–18:08.199
然後就是我們整個 FastAPI 後端服務
18:08.199–18:10.479
來進行封裝的這樣的功能模組
18:10.479–18:11.799
和 SSE 的網關
18:11.799–18:13.799
然後比較重要的是
18:13.799–18:16.059
我們現在 Agent 運行時的這樣的編排
18:16.059–18:17.199
那麼 Agent 運行時
18:17.199–18:18.879
這裡我們其實是採用的是
18:18.879–18:20.879
Deepseek V4 Flash 這樣的模型
18:20.879–18:21.199
對吧
18:21.199–18:22.059
然後來了
18:22.059–18:25.079
OpenAI 的 ChatCompletions API 作為底層
18:25.079–18:26.679
抱歉回應 API
18:26.679–18:28.739
作為底層來進行基礎功能
18:28.739–18:29.599
這樣的回應
18:29.599–18:30.659
然後同時
18:30.659–18:35.619
整個的編排是用 Deep Agents 來進行編排
18:35.619–18:39.859
所以它就會允許我們按照意圖來進行工具呼叫
18:39.859–18:41.859
然後同時也可以載入這個 Skill
18:41.859–18:45.039
這兩塊功能其實在實際開發過程當中
18:45.039–18:46.199
並沒有那麼複雜
18:46.199–18:48.659
就比如說我們關聯一些工具和關聯一些 Skill
18:48.659–18:50.879
其實並沒有那麼複雜
18:50.879–18:54.239
核心原因是因為對於像 LangChain 的 Deep Agents 來說
18:54.239–18:57.959
大家可能之前沒有看過我們那期 Deep Agents 的公開課
18:57.959–18:59.819
那麼對於 Deep Agents 來說
18:59.819–19:01.259
這功能其實都是內建功能
19:01.259–19:02.999
你其實只需要幾行程式碼
19:02.999–19:09.339
然後去給它寫好一些對應的一些 skill
19:09.339–19:10.999
然後在進行讀取的過程當中
19:10.999–19:13.099
把這個 skill 就像工具一樣給它讀進來
19:13.099–19:15.099
然後它就可以載入這樣的一些 skill
19:15.099–19:17.439
這些其實並不會特別複雜
19:17.439–19:19.619
然後比較複雜的其實是
19:19.619–19:21.079
關於我們在進行數據分析的時候
19:21.079–19:22.699
你需要去梳理我們當前系統
19:22.699–19:24.039
到底需要哪些功能
19:24.039–19:26.059
這一點其實也是現在
19:26.059–19:27.179
就是我們經常去討論
19:27.179–19:28.419
比如說像 FDE 對吧
19:28.419–19:30.259
前沿部署工程師
19:30.259–19:31.519
我們經常說 FDE
19:31.519–19:33.159
FDE 這個難在哪呢
19:33.159–19:34.499
其實不一定是難在
19:34.499–19:36.759
說我們要完成 Agent 開發
19:36.759–19:39.319
其實反而很多 FDE 的場景下
19:39.319–19:40.639
Agent 本身的開發難度
19:40.639–19:41.459
其實並不大
19:41.459–19:43.259
接著FDE最困難的地方
19:43.259–19:43.859
可能在於
19:43.859–19:45.879
它如何結合業務進行分析
19:45.879–19:46.759
我們當前的業務究竟
19:46.759–19:48.039
需要達成哪些目標
19:48.039–19:49.879
然後合理地調整一條
19:49.879–19:51.979
最為穩健的開發方案
19:51.979–19:52.979
並去解決這樣的問題
19:52.979–19:54.759
舉例來說,像是取得數據分析這樣的場景
19:54.759–19:55.719
就非常典型了
19:55.719–19:56.119
對吧
19:56.119–19:56.879
你就可以去分析
19:56.879–19:57.419
關於說
19:57.419–19:59.179
我們這個數據分析
19:59.179–20:01.479
究竟需要實現哪些功能
20:01.479–20:03.859
就比如說多元數據接入
20:03.859–20:04.579
這個必須要有
20:04.579–20:06.379
然後什麼樣的數據
20:06.379–20:08.179
只讀的數據查詢引擎
20:08.179–20:09.819
這個查數的功能肯定是要有
20:09.819–20:12.579
然後像什麼數據清洗和特徵工程
20:12.579–20:13.799
然後包括數據探索
20:13.799–20:14.719
數據可視化分析
20:14.719–20:16.019
這些東西肯定是要有的
20:16.019–20:16.419
對不對
20:16.419–20:17.159
這就是一個功能區塊
20:17.159–20:19.399
還有什麼異步訓練與推理管道
20:19.399–20:20.419
所謂異步訓練
20:20.419–20:22.239
其實主要指的是一些繪圖的工作
20:22.239–20:24.019
和機器學習建模預測的一些工作
20:24.019–20:25.779
然後機器學習和模型融合
20:25.779–20:26.679
這個肯定也是要有的
20:26.679–20:29.139
我們需要很多時候需要圍繞一些數值來進行預測
20:29.139–20:29.399
對不對
20:29.399–20:30.399
然後產出分析報告
20:30.399–20:32.539
這條鏈路基本上就是我們現在
20:32.539–20:34.799
其實不僅僅是我們當前項目這麼規定的
20:34.799–20:37.199
其實現在很多的一些agent開發
20:37.199–20:38.839
很多的一些這個數據分析項目
20:38.839–20:40.479
基本上也是按照這樣的一個鏈路
20:40.479–20:42.699
來規劃我們目前整個模組核心所需的功能
20:42.699–20:43.999
那麼有了這些功能之後
20:43.999–20:44.599
你會發現
20:44.599–20:45.939
這些功能該如何實現
20:45.939–20:46.959
基本上分為兩層
20:46.959–20:48.779
第一層我們稱為底層
20:48.779–20:51.639
你需要有一些基礎功能層作為支撐
20:51.639–20:52.999
例如你需要有本地資料庫
20:52.999–20:53.599
對吧
20:53.599–20:55.839
你需要有這個專案隔離倉
20:55.839–20:57.339
以及梳理這個血緣關係
20:57.339–20:59.379
你需要有這個 CircleLite
20:59.379–21:01.339
用來儲存每個資料集的元數據
21:01.339–21:02.879
你還需要有獨立的專案空間和檔案
21:02.879–21:05.479
這東西其實該怎麼說呢
21:05.479–21:09.419
就是這東西倒不一定你需要跟 Codex 說明
21:09.419–21:11.359
他其實在很多時候自己能夠梳理清楚
21:11.359–21:13.059
就是你需要去跟他講的更多
21:13.059–21:14.479
其實是上面這一層
21:14.479–21:17.059
我們到底需要有哪些業務指標
21:17.059–21:18.199
以及所有這些業務
21:18.199–21:20.739
他需要完成到什麼樣的程度
21:20.739–21:22.779
就例如 OK 我們的這個分析報告
21:22.779–21:23.959
寫到什麼程度
21:23.959–21:25.439
然後我們的這個一階訓練進程
21:25.439–21:28.119
他需要做到什麼樣的程度等等
21:28.119–21:31.399
然後至於說有了這些程度之後
21:31.399–21:34.779
下面的很多功能
21:34.779–21:37.739
其實都可以由當前的 agent 或 Codex
21:37.739–21:38.479
自己來完成
21:38.479–21:39.399
這個其實問題不大
21:39.399–21:42.319
但是確實需要我們人工來進行討論和完成
21:42.319–21:43.639
實際上是上面這些
21:43.639–21:46.279
主要是 agent 的智能編排程度
21:46.279–21:49.239
就是例如我們說模型
21:49.239–21:52.279
或者最小的工具路由
21:52.279–21:54.439
或者像 Skills 這樣的披露等等
21:54.439–21:56.939
你需要有一整套完整的技術選型
21:56.939–22:00.139
確定你需要採用哪一組技術來進行開發
22:00.139–22:03.339
OK 差不多就是這樣一個基本的架構
22:03.339–22:05.819
所以我們說從架構當中
22:05.819–22:07.019
你也能夠看得出來
22:07.019–22:10.019
基本上我們現在在進行 Agent 開發的過程當中
22:10.019–22:12.039
其實比較重要的第一點
22:12.039–22:14.259
其實倒不一定怎麼說
22:14.259–22:17.919
當然選取一個合適的工具和模型也很重要
22:17.919–22:19.139
但是其實更加重要的是
22:19.139–22:20.579
你需要非常清楚的知道
22:20.579–22:23.299
我們當前的業務意圖是什麼
22:23.299–22:27.959
那也就是說我們現在到底需要解決哪些問題啊
22:27.959–22:28.559
然後呢
22:28.559–22:33.059
到底有哪些這樣非常關鍵的場景啊
22:33.059–22:33.999
等等等等啊
22:33.999–22:34.999
這些呢可能是
22:34.999–22:35.259
22:35.259–22:35.959
放大一下
22:35.959–22:38.859
那麼這些呢可能是首先我們需要確認的啊
22:38.859–22:39.519
然後呢
22:39.519–22:43.699
接下來比較重要的是我們可能就需要討論清楚
22:43.699–22:48.339
關於我要去解決當前這樣的一些業務難題啊
22:48.339–22:48.539
22:48.539–22:50.939
你得做好哪些技術選型
22:50.939–22:51.559
對不對啊
22:51.559–22:53.479
就是選型這塊肯定也是我們需要去做的啊
22:53.479–22:55.739
那麼然後再往下才是啊
22:55.739–22:57.079
你用著這個 Codex 啊
22:57.079–22:59.599
你用著這個這個 Deep Seek 啊
22:59.599–23:00.499
這樣的這個模型啊
23:00.499–23:01.879
再進行一輪一輪的開發啊
23:01.879–23:02.419
是這麼一回事
23:02.419–23:02.859
23:02.859–23:06.379
那麼了解了我們當前整個系統
23:06.379–23:09.759
那完整的一些基本的功能之後啊
23:09.759–23:10.539
那麼接下來啊
23:10.539–23:12.039
就我們需要來看一看啊
23:12.039–23:13.359
他到底應該呃
23:13.359–23:15.379
怎麼樣來進行開發和底層的這個思路啊
23:15.379–23:16.032
到底是什麼樣的呢
0:00.000–0:09.169
zh好,那么之前我们是了解了关于deep seek模型的Responsees API和Codex怎么样来进行接入。
好,那麼之前我們已經了解了關於 DeepSeek 模型的 Responses API 和 Codex 如何進行接入。
0:09.169–0:15.917
zh现在其实对于咱们的开发者的学习来说,前期肯定是要有一个基础的学习的这样的过程。
現在其實對於我們的開發者學習來說,前期肯定需要有一個基礎學習的過程。
0:15.917–0:28.200
zh当然其实我会觉得可能更长的学习的周期应该放在围绕一个又一个项目来进行开发试错,不断的来提取经验,然后最后优化完成一个系统开发的整个完整的链路。
當然,其實我認為更長的学习週期應該放在圍繞一個又一個項目來進行開發試錯,不斷地提取經驗,然後最後優化完成一個系統開發的整個完整鏈路。
0:28.200–0:32.100
zh那么大家现在看到的DS4-AI数据分析系统
那麼大家現在看到的 DS4-AI 數據分析系統
0:32.100–0:37.600
zh实际上就是接下来带大家来手动一步一步来完成搭建的这样的开发的项目
實際上就是接下來帶大家來手動一步一步完成搭建的這樣的一個開發項目。
0:37.600–0:43.620
zh当然我们这里同样是使用Deepseek V4 Flash搭配着Codex来完成一个系列完整的开发
當然,我們這裡同樣是使用 DeepSeek V4 Flash 搭配 Codex 來完成一個系列完整的開發。
0:43.620–0:48.420
zh实际上大家需要知道尽管现在Deepseek我们使用的是Flash这样的小号模型
實際上大家需要知道,儘管現在 DeepSeek 我們使用的是 Flash 這樣的小號模型。
0:48.420–0:52.080
zh但是其实它的性能并不比今年上半年或者今年年初
但是其實它的性能並不比今年上半年或今年年初
0:52.080–0:57.820
zh对不对当时Codex当时Opera 4.5这样的那样的一个模型的性能差甚至要强很多
對吧,當時 Codex 當時的 o4.5 這樣的模型的性能差,甚至還要強很多。
0:57.820–0:59.640
zh所以其实对这样的性能来说
所以其實對這樣的性能來說
0:59.640–1:00.720
zh尽管它是小号
儘管它是小號
1:00.720–1:02.300
zh但是对于很多开发任务来说
但是對於很多開發任務來說
1:02.300–1:03.920
zh其实绝对可以来进行使用的
其實絕對可以來進行使用的。
1:03.920–1:05.960
zh并且它本身的响应速度也很快
並且它本身的響應速度也很快。
1:05.960–1:06.360
zh对吧
對吧。
1:06.360–1:09.700
zh再加上现在和整个Codex的兼容特性也非常稳定
再加上現在和整個 Codex 的兼容特性也非常穩定。
1:09.700–1:11.760
zh那么我们刚才其实是围绕着
那麼我們剛才其實是圍繞著
1:11.760–1:15.140
zh我们的part3的课件重新进行一轮修正
我們的 Part 3 的課件重新進行一輪修正。
1:15.140–1:17.300
zh然后我们刚刚讲Codex好多功能
然後我們剛剛講了 Codex 好多功能
1:17.300–1:19.380
zh什么States
什麼 States
1:19.380–1:20.240
zh什么Innet
什麼 Innet
1:20.240–1:21.360
zh什么项目结构
什麼項目結構
1:21.360–1:22.160
enAgents
代理程式
1:22.160–1:23.940
zh各式各样的这些东西
各式各樣的這些東西
1:23.940–1:25.260
zh应该怎么样进行编写
應該怎麼樣進行編寫
1:25.260–1:26.940
zh包括它的Sandbox
包括它的 Sandbox
1:26.940–1:28.400
zh怎么样来进行开启
怎麼樣來進行開啟
1:28.400–1:28.760
zh对不对
對吧
1:28.760–1:30.540
zh他的subagents怎么样进行开启等等
他的 Subagents 怎麼樣來進行開啟等等。
1:30.540–1:32.900
zh我们之前课程里面的截图被吞了
我們之前課程裡面的截圖被吞了
1:32.900–1:33.780
zh导致大家可能没有看到
導致大家可能沒有看到
1:33.780–1:34.500
zh没关系
沒關係
1:34.500–1:35.680
zh大家现在可以再去看一看
大家現在可以再去看一看
1:35.680–1:37.720
zh我们的part3里面的这些截图
我們的 Part 3 裡面的這些截圖
1:37.720–1:39.860
zh再回顾一下codex的整体这样的功能
再回顧一下 Codex 整體這樣的功能。
1:39.860–1:40.560
zh那么接下来
那麼接下來
1:40.560–1:42.020
zh在整个实操过程当中
在整個實操過程當中
1:42.020–1:44.460
zh也会有一个更加快速的
也會有一個更加快速的
1:44.460–1:46.080
zh上手的这样的一个效果
上手的這樣的一個效果。
1:46.080–1:48.320
zh当然我们在所有的开发过程当中
當然我們在所有的開發過程當中
1:48.320–1:50.340
zh我们首先需要跟大家先梳理清楚的是
我們首先需要跟大家先梳理清楚的是
1:50.340–1:51.100
zh整个开发思路
整個開發思路
1:51.100–1:53.380
zh和需要用到的codex相关的功能
和需要用到的 Codex 相關功能
1:53.380–1:55.340
zh以及围绕我们当前这个系统
以及圍繞我們當前這個系統
1:55.340–1:56.720
zh我们怎么样来进行技术选行
我們怎麼樣來進行技術選型
1:56.720–1:59.760
zh我们公开课其实每一期公开课都是这个时间有限
我們的公開課其實每一期公開課時間都有限
1:59.760–2:01.400
zh可能我们只能够讲完到这一层
可能我們只能夠講到這一層
2:01.400–2:04.880
zh至于说最后通过总共是40多轮这样的提示
至於說最後通過總共 40 多輪這樣的提示
2:04.880–2:08.380
zh就完成一整个系统开发的每一轮的提示词
就完成一整個系統開發的每一輪提示詞
2:08.380–2:10.720
zh和每一轮的系统的快照还是一样的
和每一輪系統的快照還是一樣的
2:10.720–2:11.700
zh我们会放在课件里面
我們會放在課件裡面
2:11.700–2:13.040
zh大家回头可以自己拿到再去看
大家回頭可以自己拿到再去看
2:13.040–2:15.760
zh然后我们的公开课的有限的最后一个小时
然後我們的公開課有限的最後一個小時
2:15.760–2:17.620
zh这个时间会跟大家梳理清楚
這個時間會跟大家梳理清楚
2:17.620–2:20.180
zh关于整个项目在进行开发的过程当中
關於整個項目在進行開發的過程當中
2:20.180–2:23.500
zh它的底层的思路和技术选行到底是什么样
它的底層的思路和技術選型到底是什麼樣
2:23.500–2:25.120
zh我们之前K3的课其实也是
我們之前 K3 的課其實也是
2:25.120–2:26.340
zh进展到这一块的时候
進展到這一部分的時候
2:26.340–2:27.200
zh时间稍微一点紧
時間稍微有點緊
2:27.200–2:27.660
zh
2:27.660–2:29.640
zh那么首先我们在对照的这个项目
那麼首先我們在對照這個項目
2:29.640–2:30.300
zh跟大家来说
跟大家來說
2:30.300–2:31.800
zh到底有哪一些这样的功能
到底有哪一些這樣的功能
2:31.800–2:35.080
zh当然其实从整个AI技术兴起开始
當然其實從整個 AI 技術興起開始
2:35.080–2:37.120
zh就是关于使用AI来进行数据分析
就是關於使用 AI 來進行數據分析
2:37.120–2:39.120
zh其实是一块非常大的功能
其實是一塊非常大的功能
2:39.120–2:40.720
zh非常大的一块业务的需求
非常大的一塊業務的需求
2:40.720–2:42.280
zh包括我们现在课程里面
包括我們現在課程裡面
2:42.280–2:44.120
zh总共有四项旗舰项目里边
總共有四項旗艦項目裡面
2:44.120–2:46.120
zh而且有一个项目也是工业级的
而且有一個項目也是工業級的
2:46.120–2:47.900
zh非常复杂创技家的AI数据分析
非常複雜的 AI 數據分析
2:47.900–2:49.440
zh那么围绕这个数据分析
那麼圍繞這個數據分析
2:49.440–2:52.720
zh其实它内部有很多的一些技术体系
其實它內部有很多的一些技術體系
2:52.720–2:54.040
zh包括像NL2色刻画
包括像 NL2SQL 技術
2:54.040–2:55.260
zh包括像这个现在
包括像這個現在
2:55.260–2:56.300
zh还有全自动的
還有全自動的
2:56.300–2:58.000
zh这个AI来进行机器学习建模
這個 AI 來進行機器學習建模
2:58.000–2:58.560
zh等等等等
等等等等
2:58.560–2:59.560
zh各个细分的
各個細分的
2:59.560–3:00.720
zh这样的这个技术体系
這樣的這個技術體系
3:00.720–3:01.520
zh当然之所以
當然之所以
3:01.520–3:03.440
zhAI能够很好的来进行数据分析
AI能夠很好地進行數據分析
3:03.440–3:04.120
zh这样的操作
這樣的操作
3:04.120–3:04.940
zh其实也是因为
其實也是因為
3:04.940–3:06.720
zh这个对大模型来说
這對大模型來說
3:06.720–3:07.640
zh这个内容创作
內容創作
3:07.640–3:08.540
zh或许不得行
或許不太行
3:08.540–3:09.580
zh然后呢
然後呢
3:09.580–3:10.900
zh这个最开始的时候
在最開始的時候
3:10.900–3:12.220
zh非常复杂大规模
非常複雜的大規模
3:12.220–3:12.840
zh几万行
幾萬行
3:12.840–3:14.200
zh十几万行代码的项目开发
十幾萬行代碼的項目開發
3:14.200–3:15.040
zh或许有点困难
或許有點困難
3:15.040–3:16.580
zh但是像AI数据分析
但是像AI數據分析
3:16.580–3:16.880
zh对不对
對吧
3:16.880–3:18.580
zh从这数据里面找规律下判断
從這些數據中尋找規律並做出判斷
3:18.580–3:19.120
zh然后呢
然後呢
3:19.120–3:20.080
zh写一些这个circle
寫一些這個circle
3:20.080–3:21.580
zh来去完成一些高精准的
來完成一些高精準度的
3:21.580–3:24.700
zh这个数据清洗或者数据建模相关的这个操作
數據清洗或數據建模相關的這個操作
3:24.700–3:28.960
zh这个对于AI来说实际上是非常好就能够实现的
這對AI來說實際上是非常容易實現的
3:28.960–3:32.000
zh所以现在如果你看所有的一些领域的落地的
所以現在如果你看所有各個領域的落地
3:32.000–3:33.440
zh各项其实落地的这个情况来看
各項其實落地的這個情況來看
3:33.440–3:37.180
zh像AI数据分析这个领域的这个落地应该是非常深刻
像AI數據分析這個領域的落地應該是非常深刻
3:37.180–3:37.820
zh非常彻底
非常徹底
3:37.820–3:40.880
zh并且是很早就能取得非常显著这样的成效了
並且是很早就能取得非常顯著這樣的成效了
3:40.880–3:43.620
zh所以现在我们在进行一些项目
所以現在我們在進行一些項目
3:43.620–3:44.780
zh拿了一些项目来进行开发
拿了一些項目來進行開發
3:44.780–3:45.660
zh大家想去练手
大家想去練手
3:45.660–3:48.360
zh尤其是咱们接下来如果邱昭想去找工作的话
尤其是咱們接下來如果邱昭想去找工作的話
3:48.360–3:51.060
zh那么其实做几个AI数据分析这样的项目
那麼其實做幾個AI數據分析這樣的項目
3:51.060–3:54.320
zh是能够很能够是能够获得一些成果的
是能夠很能夠是能夠獲得一些成果的
3:54.320–3:56.240
zh那么接下来我们给大家介绍的
那麼接下來我們給大家介紹的
3:56.240–3:58.300
zh这个DS4-AI数据分析系统
這個DS4-AI數據分析系統
3:58.300–3:59.420
zh实际上就是现在
實際上就是現在
3:59.420–4:02.180
zh就现在这个阶段适配于2026下半年
就現在這個階段適配於2026下半年
4:02.180–4:04.620
zh比较适合去做一个
比較適合去做一個
4:04.620–4:07.620
zh大家如果想要去做一些简历项目的一个功能
大家如果想要去做一些履歷項目的一個功能
4:07.620–4:08.340
zh非常齐全
非常齊全
4:08.340–4:11.400
zh并且性能也还非常不错的一个完整的AI数据分析系统
並且性能也還非常不錯的一個完整的AI數據分析系統
4:11.400–4:12.820
zh那么这个数据分析系统
那麼這個數據分析系統
4:12.820–4:14.340
zh我们先看它到底有哪些功能
我們先來看看它到底有哪些功能
4:14.340–4:16.740
zh首先对于整个数据分析系统来说
首先對於整個數據分析系統來說
4:16.740–4:18.220
zh它必须得有一个漂亮的页面
它必須得有一個漂亮的頁面
4:18.220–4:22.380
zh这个不是必要的 但是如果有的话当然更好 对不对
這不是必要的,但如果有的話當然更好,對吧
4:22.380–4:26.060
zh有一个比较好的webdesign的效果肯定会更好
有一個比較好的 Web Design 效果肯定會更好
4:26.060–4:29.420
zh当然我们webdesign是怎么做的 我们稍后再跟大家说 这先不着急
當然我們的 Web Design 是怎麼做的,我們稍後再跟大家說,這先不着急
4:29.420–4:32.140
zh然后首先我们肯定是要有一个
然後首先我們肯定是要有一個
4:32.140–4:36.260
zh稍等 我们给它切换成浅色的
稍等,我們把它切換成淺色的
4:36.260–4:44.340
zh因为浅色的话 我会觉得可能更容易看得出效果一些
因為淺色的話,我覺得可能更容易看得出效果一些
4:44.340–4:48.300
zh好 那么首先第一块是需要有一个数据资产的管理的系统
好,那麼首先第一塊是需要有一個數據資產管理的系統
4:48.300–4:49.680
zh所谓数据资产管理系统指的是
所謂數據資產管理系統指的是
4:49.680–4:52.280
zh我们需要有一个完整的工程模块
我們需要有一個完整的工程模組
4:52.280–4:53.980
zh去负责去给当前的AI数据分析
去負責給當前的 AI 數據分析
4:53.980–4:56.500
zh去介入各个不同的渠道这样的数据
去介入各個不同渠道的數據
4:56.500–4:58.920
zh包括你本地的 Excel CSV这个数据
包括你本地的 Excel、CSV 數據
4:58.920–5:01.160
zh包括你数据户里面的一些数据
包括你數據庫裡面的一些數據
5:01.160–5:02.060
zhMySQL的数据
MySQL 的數據
5:02.060–5:02.940
zhSQLite的数据
SQLite 的數據
5:02.940–5:05.020
zh甚至是一些分布数的数据户里面等等
甚至是一些分佈式數據庫裡面等等
5:05.020–5:08.400
zh总之你需要维护一整个数据资产也好
總之你需要維護一整個數據資產也好
5:08.400–5:09.440
zh或者数据中台也好
或者數據中台也好
5:09.440–5:11.520
zh负责去介入各式各样不同类型的数据
負責去介入各式各樣不同類型的數據
5:11.520–5:12.960
zh当然这一块开发
當然這一部分開發
5:12.960–5:14.640
zh其实是整个项目里面来说
其實是整個項目裡面來說
5:14.640–5:15.920
zh应该是非常简单的一块功能
應該是非常簡單的一塊功能
5:15.920–5:18.640
zh因为无非就是去验证各个不同渠道的
因為無非就是去驗證各個不同渠道的
5:18.640–5:22.140
zh验证各个不同渠道的这样的一些数据的情况
驗證各個不同渠道的一些數據的情況
5:22.140–5:24.660
zh然后再来进行一个开发
然後再來進行開發
5:24.660–5:26.740
zh然后我们现在我们看一下
然後我們現在看一下
5:26.740–5:29.120
zh因为我现在是连接的是远程的服务
因為我現在連接的是遠端的服務
5:29.120–5:30.980
zh所以MySQL是起动不了的
所以 MySQL 是啟動不了的
5:30.980–5:31.880
zh因为我本地没做MySQL
因為我本地沒做 MySQL
5:31.880–5:33.700
zh但其他的数据是能看到的
但其他的數據是能看到的
5:33.700–5:33.980
zh对不对
對吧
5:33.980–5:36.340
zh就很多很多各式各样数据
就很多很多各式各樣的數據
5:36.340–5:38.980
zh你可以去查询各个不同类型的字段
你可以去查詢各個不同類型的欄位
5:38.980–5:39.300
zh对吧
對吧
5:39.300–5:40.820
zh它各个不同类型的曲子等等等等
它各個不同類型的數據等等等等
5:40.820–5:43.180
zh那首先呢我们其实是在需要为整个系统呢
那首先呢我們其實是在需要為整個系統呢
5:43.180–5:46.660
zh需要去维护一个完整的数据的中台这样的功能啊
需要維護一個完整的中台數據功能
5:46.660–5:48.520
zh或者是数据存储这样的功能啊
或是數據存儲等功能
5:48.520–5:49.960
zh当然对于一些企业的应用场景来说
當然對於一些企業應用場景而言
5:49.960–5:50.880
zh它可能还会涉及到一些
它可能還會涉及一些
5:50.880–5:52.700
zh比如说数据的这样的一个权限啊
例如數據權限
5:52.700–5:54.460
zh查询的这样的权限等等等等
查詢權限等等
5:54.460–5:56.360
zh当然这个数据资产的管理啊
當然這個數據資產的管理
5:56.360–5:58.500
zh一方面你是需要去设置一些
一方面你需要設置一些
5:58.500–5:59.780
zh比如说远程的麦斯克连接
例如遠程的 MySQL 連接
5:59.780–6:01.540
zh或者你自己本地导入一些这个数据
或是你自己本地導入一些數據
6:01.540–6:02.900
zh然后同时它还会涉及到一些
同時它還會涉及一些
6:02.900–6:04.960
zh比如说我们在实际在进行数据分析的时候
例如我們在實際進行數據分析時
6:04.960–6:06.920
zh中间啊状态我们提取
中間狀態提取的數據
6:06.920–6:08.480
zh或者说临时存储的一些数据
或是臨時存儲的數據
6:08.480–6:10.160
zh或者说一些数据结论等等等等
或是某些數據結論等等
6:10.160–6:12.440
zh统一都是从一个功能入口
統一都是從一個功能入口
6:12.440–6:13.980
zh来进行一个统一的这样的维护
進行統一的維護
6:13.980–6:15.660
zh这里能看到什么数据资产
這裡能看到哪些數據資產
6:15.660–6:16.920
zh服务项目
服務項目
6:16.920–6:18.060
zh多少行数据
多少行數據
6:18.060–6:20.020
zh本地的数据的规模等等
本地數據的規模等
6:20.020–6:22.080
zh这个数据其实还是一个比较大的
這個數據量其實還挺大的
6:22.080–6:23.480
zh一个数规模的数据
數據規模相當龐大
6:23.480–6:24.860
zh毕竟有300多万行的数据
畢竟有三百多萬行的數據
6:24.860–6:25.100
zh对吧
對吧
6:25.100–6:26.820
zh还是一个比较大的数据
還是一個相當大的數據量
6:26.820–6:27.920
zh然后这个数据
然後這個數據
6:27.920–6:29.160
zh我们在课程里面
我們在課程中
6:29.160–6:30.380
zh因为是为了做这个项目
因為是為了這個項目
6:30.380–6:31.140
zh来进行一个测试
進行測試
6:31.140–6:32.500
zh所以它是分布在
所以它分布在
6:32.500–6:33.320
zh什么MySQL
MySQL
6:33.320–6:34.260
enCircleLite
[未翻譯]
6:34.260–6:34.900
enExcel
Excel
6:34.900–6:35.420
enCSV
CSV
6:35.420–6:37.220
zh这个四种不同类型的这个数据库里面
這四種不同類型的數據庫中
6:37.220–6:38.980
zh四种不同类型的数据载体里面
四種不同類型的數據載體中
6:38.980–6:40.400
zh所以我们可以去给它打散
所以我們可以將其分散
6:40.400–6:42.820
zh那么我们课程里面设计的这四个数据载体
那麼課程中設計的這四個數據載體
6:42.820–6:44.620
zh应该是非常通用的这四个数据载体
應該是非常通用的這四個數據載體
6:44.620–6:45.200
zh除此之外呢
除此之外呢
6:45.200–6:48.700
zh你还可以去考虑拓展连接更加复杂的一些数据员
你還可以考慮擴展連接更複雜的一些數據載體
6:48.700–6:49.520
zh也是都是ok的
也都是可以的
6:49.520–6:50.140
zh这是第一个
這是第一個
6:50.140–6:51.080
zh那么第二个呢
那麼第二個呢
6:51.080–6:53.460
zh是对于现在的这个数据分析系统来说
是對於現在這個數據分析系統來說
6:53.460–6:55.640
zh你或多或少总得给它整一些
你或多或少總得為它準備一些
6:55.640–6:56.760
zh这个技能系统
這個技能系統
6:56.760–6:57.380
zh对不对
對吧
6:57.380–6:58.920
zh那么什么叫做这个数据分析
那麼什麼叫做這個數據分析
6:58.920–6:59.880
zh这个技能系统
這個技能系統
6:59.880–7:01.960
zh我们给大家看一下我们实际对话的过程当中
我們給大家看一下在我們實際對話的過程中
7:01.960–7:05.840
zh那么我们实际上在进行具体的对话的时候
那麼我們實際上在進行具體對話的時候
7:05.840–7:07.660
zh那你需要来进行数据分析
那你需要來進行數據分析
7:07.660–7:07.940
zh对吧
對吧
7:07.940–7:11.220
zh那有很多很多需要来进行分析的
那有很多很多需要來進行分析的
7:11.220–7:15.760
zh需要来进行分析的一些事项
需要來進行分析的一些事項
7:15.760–7:19.100
zh那么有的时候你可能会偏好某一些分析的流程
那麼有時候你可能會偏好某些分析的流程
7:19.100–7:21.860
zh分析偏好某一些可视化这样的方式
分析偏好某些可視化這樣的方式
7:21.860–7:24.340
zh或者你本来你们公司来进行数据欣喜
或者你原本你們公司來進行數據分析
7:24.340–7:26.840
zh或者提取特定的这业务指标
或者提取特定的業務指標
7:26.840–7:28.900
zh可能就有具体的一些领域这样的知识
可能就有具體的一些領域知識
7:28.900–7:29.220
zh对不对
對吧
7:29.220–7:30.240
zh那这些东西的话
那這些東西的話
7:30.240–7:32.240
zh怎么样灌输给当前的数据分析系统
怎麼樣灌輸給當前的數據分析系統
7:32.240–7:33.960
zh其实我们可能考虑的
其實我們可能考慮的
7:33.960–7:35.960
zh就通过SGU这样的方式来去告诉
就通過 Skill 這樣的方式去告訴
7:35.960–7:37.400
zh我们当前的数据分析系统
我們當前的數據分析系統
7:37.400–7:39.060
zh我们在不同环节的时候
我們在不同環節的時候
7:39.060–7:40.700
zh到底需要做哪一些事情
到底需要做哪些事情
7:40.700–7:41.080
zh对不对
對吧
7:41.080–7:41.960
zh可视化的时候
可視化的時候
7:41.960–7:45.880
zh往往都是采用什么样的图片
往往都是採用什麼樣的圖表
7:45.880–7:47.340
zh来进行绘制
來進行繪製
7:47.340–7:48.000
zh对不对
對吧
7:48.000–7:50.060
zh然后还可以选择
然後還可以選擇
7:50.060–7:51.720
zh其他的什么柄图
其他的什麼餅圖
7:51.720–7:55.140
zh热力图等等
熱力圖等等
7:55.140–7:58.160
zh各样的图片来进行呈现
各種圖表來進行呈現
7:58.160–7:59.220
zh那么总之就是
那麼總之就是
7:59.220–8:00.000
zh我们其实
我們其實
8:00.000–8:03.966
zh那么总之我们其实很多时候在先分析的时候都会涉及到非常具体领域里面的特殊的判断。
總之,我們其實在許多時候進行先期分析時,都會涉及到非常具體領域內的特殊判斷。
8:03.966–8:06.000
zh这些东西都可以通过Skill来进行完成。
這些事情都可以透過 Skill 來完成。
8:06.000–8:11.500
zh更别谈比如说我们后期还需要来围绕数据报告,需要去生成对应的数据报告。
更不用說,例如我們後期還需要圍繞數據報告,去生成對應的數據報告。
8:11.500–8:12.780
zh那么生成数据报告的时候
那麼在生成數據報告的時候
8:12.780–8:15.540
zh更是你数据报告里面需要有哪些分析的维度
更是你的數據報告裡面需要包含哪些分析維度
8:15.540–8:15.840
zh对不对
對吧
8:15.840–8:19.000
zh它需要有哪一些特定的这样的指标的统计
它需要有哪一些特定的這類指標的統計
8:19.000–8:21.600
zh然后如何去解读一些我们本身数据分析的过程当中
然後如何去解讀一些在我們本身數據分析過程中
8:21.600–8:22.760
zh可能涉及到行业的黑化
可能涉及到行業的黑話
8:22.760–8:24.660
zh那这东西其实都属于一个分析统里面
那這些東西其實都屬於一個分析體系裡面
8:24.660–8:26.600
zh它必须要去具备一些这样的功能
它必須要去具備一些這樣的機能
8:26.600–8:29.960
zh那这东西当然都是通过这一系列的Skill来去完成
那這些東西當然都是透過這一連串的 Skill 來完成
8:29.960–8:32.460
zh所以我们这里其实是预制了很多的
所以我們這裡其實是預先設定了很多
8:32.460–8:33.380
zh也没有很多
也沒有很多
8:33.380–8:35.840
zh就总共是内置了4个Skill
就總共內建了 4 個 Skill
8:35.840–8:37.620
zh因为都是用Codex进行开发
因為都是用 Codex 進行開發
8:37.620–8:39.540
zh所以我们这里是设置一些场景
所以我們這裡設定了一些場景
8:39.540–8:41.980
zh然后是设置了4个不同类型的Skill
然後設定了 4 種不同類型的 Skill
8:41.980–8:44.800
zh那么它包括比如说生成一些数据摘要
那麼它包括例如生成一些數據摘要
8:44.800–8:47.700
zh包括数据的检查
包括數據的檢查
8:47.700–8:49.860
zh包括去检查一些异常值
包括去檢查一些異常值
8:49.860–8:51.700
zh包括老外进行数据分析报告等等
包括進行數據分析報告等等
8:51.700–8:54.980
zh但实际上我们说在一个数据分析的完整流程里面
但實際上我們說,在一個數據分析的完整流程裡面
8:54.980–8:57.020
zh像实际在进行业务的过程当中
像實際進行業務的過程當中
8:57.020–9:00.240
zh它需要涉及到的阶段其实非常非常多
它需要涉及的階段其實非常多非常多
9:00.240–9:03.160
zh可能会有比如说前期的像数据清洗
可能會有的,例如前期的像數據清洗
9:03.160–9:03.880
zh对不对
對吧
9:03.880–9:06.260
zh包括再往前比如说可能要进行数据探索
包括再往前,例如可能還要進行數據探索
9:06.260–9:08.880
zh然后很有可能还需要来进行一些
然後很有可能還需要來進行一些
9:08.880–9:10.620
zh数据指标的这样的计算
數據指標這樣的計算
9:10.620–9:12.680
zh需要来进行一些可视化的分析
需要來進行一些可視化的分析
9:12.680–9:14.700
zh然后到后期建模的时候
然後到後期建模的時候
9:14.700–9:15.680
zh可能还会涉及到一些
可能還會涉及到一些
9:15.680–9:18.480
zh比如说特征的增强
例如特徵增強
9:18.480–9:20.400
zh或者特征工程的一些操作
或者特徵工程的一些操作
9:20.400–9:21.840
zh或者模型融合的一些操作
或者模型融合的一些操作
9:21.840–9:23.880
zh然后在实际机器建模的过程当中
然後在實際機器建模的過程當中
9:23.880–9:25.980
zh还会涉及到一些比较复杂的
還會涉及到一些比較複雜的
9:25.980–9:28.940
zh一些机器学习的算法
一些機器學習的算法
9:28.940–9:29.540
zh对不对
對吧
9:29.540–9:31.020
zh一些集成算法来进行
使用一些集成算法來進行
9:31.020–9:32.720
zh更加复杂的机器学习的建模
更複雜的機器學習建模
9:32.720–9:35.000
zh甚至后期可能还需要模型融合相关的操作
甚至後期可能還需要進行模型融合相關的作業
9:35.000–9:38.680
zh因为其实我早年刚大学毕业的时候实际上就是做数据分析
因為其實我早年剛大學畢業時,實際上就是從事數據分析工作
9:38.680–9:40.180
zh是做大数据相关的工作
從事與大數據相關的工作
9:40.180–9:42.420
zh所以这一整个流程其实非常长
所以這整個流程其實非常長
9:42.420–9:45.700
zh其实所有流程里面其实都可以固化一些skills
其實在所有流程中,都可以將一些技能固化下來
9:45.700–9:46.840
zh对不对换当线系统里面
對吧,在系統線路中
9:46.840–9:50.260
zh然后在我们接下来分析的每一个流程的每一个环节里面
然後在我們接下來分析的每個流程的每個環節中
9:50.260–9:52.720
zh我们就可以自由的来进行一个切换
我們就可以自由地進行切換
9:52.720–9:53.680
zh和来进行个选取了
並進行選擇
9:53.680–9:54.480
zh那么除此之外
那麼除此之外
9:54.480–9:57.480
zh我们这里可能还有一些系统方面的一些设置
我們這裡可能還有一些系統方面的設定
9:57.480–10:01.100
zh对于一个像我们刚才这样的一些基本功能的agent来说
對於像我們剛才那樣的基本功能代理來說
10:01.100–10:03.860
zh你可能需要有比如说设置的模型的apir
你可能需要設定模型的 API
10:03.860–10:05.140
zh设置这个沙盒环境啊
設定這個沙盒環境
10:05.140–10:08.200
zh这个沙盒环境主要是给我们的python代码的进行运行的时候
這個沙盒環境主要是為了讓我們執行 Python 程式碼時
10:08.200–10:09.460
zh单独创建的一个
單獨建立一個
10:09.460–10:12.340
zh本地的一个这个沙盒环境
本地的沙盒環境
10:12.340–10:13.860
zh那么这个沙盒环境其实主要是
那麼這個沙盒環境其實主要是
10:13.860–10:15.900
zh为了去隔离你当前运行的程序
為了隔離你當前執行的程式
10:15.900–10:18.100
zh可能会对原始的数据造成一些不好的这个影响
可能會對原始資料造成一些不良影響
10:18.100–10:19.520
zh在说建在这个沙盒环境
建立在這個沙盒環境中
10:19.520–10:21.900
zh那比如说还有什么连接本地的这个MySQL
那比如說還有什麼連接本地的 MySQL
10:21.900–10:22.460
zh对不对啊
對吧
10:22.460–10:25.220
zh你这里肯定还是需要去围绕这个本地的这个MySQL
你這裡肯定還是需要圍繞這個本地的 MySQL
10:25.220–10:27.320
zh来进行个连接来进行验证等等等等
來進行連接、驗證等等
10:27.320–10:28.460
zh这都是需要的
這些都是需要的
10:28.460–10:30.140
zh然后还有一些这个数据安全
然後還有一些資料安全
10:30.140–10:31.160
zh这个安全措施呢
這些安全措施呢
10:31.160–10:33.320
zh其实是我们可以自己来进行一些设置的
其實我們可以自行進行一些設定
10:33.320–10:34.800
zh比如说我们数据库只读
比如說我們的資料庫只讀
10:34.800–10:36.760
zh这个权限当然你可以自己放宽了
這個權限當然你可以自行放寬
10:36.760–10:38.800
zh然后什么最小上下文的披露
然後什麼是最小上下文披露
10:38.800–10:40.400
zh什么CPU脚本沙盒
什麼 CPU 腳本沙盒
10:40.400–10:42.160
zh这些东西是你可以来进行设置的
這些東西是你來進行設定的
10:42.160–10:45.760
zh然后同时还有关于当前整个的数据集的一个概览
然後同時還有關於當前整個資料集的概覽
10:45.760–10:47.580
zh以及还有些界面外观
以及還有些介面外觀
10:47.580–10:50.940
zh界面外观其实你就可以任意来进行选取了
介面外觀其實你就可以任意進行選擇了
10:50.940–10:54.140
zh我们这里其实内置了很多不同类型的页面的外观
我們這裡其實內建了許多不同類型頁面的外觀
10:54.140–10:54.880
zh这个页面外观
這個頁面外觀
10:54.880–10:56.380
zh其实你可以随便
其實你可以隨意
10:56.380–10:58.360
zh你可以自己
你可以自己
10:58.360–11:00.200
zh我们用一些webdesign这个方式
我們用一些 Web Design 這種方式
11:00.200–11:01.340
zh来进行设计啊
來進行設計啊
11:01.340–11:02.660
zh这个其实完全没有什么问题的
這個其實完全沒有什麼問題
11:02.660–11:04.560
zh那实际我们在进行使用的时候
那實際我們在進行使用的時候
11:04.560–11:06.060
zh这个项目到底有哪一些功能呢
這個專案到底有哪些功能呢
11:06.060–11:06.980
zh这大家可以看到好
這大家可以看到好
11:06.980–11:07.760
zh到底有哪些功能啊
到底有哪些功能啊
11:07.760–11:08.360
zh当然我们这里
當然我們這裡
11:08.360–11:10.560
zh对于整个的系统架构来说
對於整個系統架構來說
11:10.560–11:12.540
zh现在当代的这个AI数据分析的
現在當代這個 AI 數據分析的
11:12.540–11:14.200
zh这样的一个体系的这个设置啊
這樣一個體系的這個設定啊
11:14.200–11:16.060
zh都是我们刚刚所看到什么数据资产啊
都是我們剛剛所看到什麼數據資產啊
11:16.060–11:17.120
zh这个Skills中心啊
這個 Skills 中心啊
11:17.120–11:18.340
zh这种写其他是一套
這種寫其他是一套
11:18.340–11:20.300
zh跨越项目的维护的一个
跨越專案維護的一個
11:20.300–11:22.220
zh综合的这样的一个这个设置
綜合的這樣的一個這個設定
11:22.220–11:23.700
zh而我们接下来每一次对话
而我們接下來每一次對話
11:23.700–11:25.720
zh相当于是开启了一个新的数据分析项目
相當於是開啟了一個新的數據分析專案
11:25.720–11:26.320
zh是这么一回事
是這麼一回事
11:26.320–11:28.320
zh比如说我们这一项面点新建数据分析
比如說我們這一項面點新建數據分析
11:28.320–11:32.740
zh那么它马上我们就相当于是获得了一个全新的数据分析这样的空间
那麼它馬上我們就相當於是獲得了一個全新的數據分析這樣的空間
11:32.740–11:34.400
zh然后你加拿就可以连接数据源
然後你就可以連接數據源
11:34.400–11:36.540
zh你可以自己去选取一些数据源
你可以自己去選取一些數據源
11:36.540–11:39.520
zh你也可以去读取MySQL里面的数据源
你也可以去讀取 MySQL 裡面的數據源
11:39.520–11:40.680
zh也都是OK的
也都是 OK 的
11:40.680–11:43.400
zh这里面其实你可以去选择连接各式各样的数据源
這裡面其實你可以去選擇連接各式各樣的數據源
11:43.400–11:45.440
zh然后接下来我们就可以开始进行对话了
然後接下來我們就可以開始進行對話了
11:45.440–11:50.480
zh当然上面你可以去选择一些项目的数据
當然上面你可以去選擇一些專案的數據
11:50.480–11:52.900
zh然后同时你也可以选择一些分析的工具
然後同時你也可以選擇一些分析的 tool
11:52.900–11:55.220
zh这些分析工具其实指的是一些分析的skill
這些分析 tool 其實指的是一些分析的 skill
11:55.220–11:59.020
zh然后接下来我们说你就可以开始来进行对话了
然後接下來我們說你就可以開始來進行對話了
11:59.020–12:00.960
zh是这么样的一个情况
是這麼樣的的一個情況
12:00.960–12:04.480
zh那我们上面其实有一组完成的一组比较复杂的对话
那我們上面其實有一組完成的一組比較複雜的對話
12:04.480–12:06.440
zh大家可以看直接对话这样的效果
大家可以看直接對話這樣的效果
12:06.440–12:09.860
zh那么每一个对话就是一个单独的我们分配了这个数据
那麼每一個對話就是一個單獨的我們分配了這個數據
12:09.860–12:15.240
zh分配了这个sql来进行运行的一个完整的agent运行时这样的一个项目
分配了這個 SQL 來進行運行的一個完整的 Agent 運行時這樣的一個專案
12:15.240–12:15.540
zh对不对
對吧
12:15.540–12:19.460
zh然后当然我们这个项目底层是使用deep seek
然後當然我們這個項目底層是使用 Deep Seek
12:19.460–12:23.700
zh这个模型deep seek flash这个模型来进行的底层的响应
這個模型 Deep Seek Flash 這個模型來進行底層的回應
12:23.700–12:27.320
zh然后同时我们底层的架构是使用Deep Agents
然後同時我們底層的架構是使用 Deep Agents
12:27.320–12:31.960
zh就LongChainDeep Agents来进行的底层的这样的一个agent运行时的这样的搭建
就是 LongChain Deep Agents 來進行底層的這樣一個 Agent 運行時的這樣的搭建
12:31.960–12:33.260
zh包括工具调用
包括工具呼叫
12:33.260–12:35.860
zh包括一些系统设置
包括一些系統設定
12:35.860–12:37.060
zh包括Skew加载
包括 Skew 加載
12:37.060–12:38.120
zh包括跨线程记忆
包括跨線程記憶
12:38.120–12:38.800
zh包括持有机
包括持有机
12:38.800–12:43.660
zh都是通过Deep Agents来完成的开发
都是透過 Deep Agents 來完成的開發
12:43.660–12:45.580
zh那么具体我们说它里面有哪些功能
那麼具體我們說它裡面有哪些功能
12:45.580–12:47.380
zh大家可以看一下它是怎么样进行对话的
大家可以看一下它是怎麼樣進行對話的
12:47.380–12:48.880
zh这里先随便说两句
這裡先隨便說兩句
12:48.880–12:51.480
zh然后接下来就开始确认我们当前这个数据资产
然後接下來就開始確認我們當前這個數據資產
12:51.480–12:53.840
zh那么它实际上是一个
那麼它實際上是一個
12:53.840–12:56.880
zhAgentic数据分析这样的流程
Agentic 數據分析這樣的流程
12:56.880–13:00.640
zh也就是说它是会根据当前用户这样的需求去判断
也就是說它是會根據當前用戶這樣的需求去判斷
13:00.640–13:05.100
zh我们现在是不是需要从我们当前的数据资产里面去盘点某些数据
我們現在是不是需要從我們當前的數據資產裡面去盤點某些數據
13:05.100–13:06.680
zh然后再来进行回复
然後再來進行回覆
13:06.680–13:07.960
zh是这么样的一个情况
是這麼樣的的一個情況
13:07.960–13:12.820
zh那我们先让它这里面就找了一些分析的思路
那我們先讓它裡面就找了一些分析的思路
13:12.820–13:16.820
zh什么旅约体验
什麼履約體驗
13:16.820–13:18.100
zh什么客户口碑
什麼客戶口碑
13:18.100–13:20.240
zh交叉归因和建议等等
交叉歸因和建議等等
13:20.240–13:23.200
zh就是说我们现在分析思路行不行
就是說我們現在分析思路行不行
13:23.200–13:24.320
zh我们让他进行分析
我們讓他進行分析
13:24.320–13:25.260
zh他给我们提了一个分析思路
他給我們提了一個分析思路
13:25.260–13:27.740
zh然后分析前去我们拍板的三件事情
然後分析前去我們拍板的三件事情
13:27.740–13:29.600
zh然后接下来OK我们就跟他说
然後接下來 OK 我們就跟他說
13:29.600–13:30.920
zh他就可以开始来进行分析了
他就可以開始來進行分析了
13:30.920–13:32.500
zh然后具体分析的过程当中
然後具體分析的過程當中
13:32.500–13:35.180
zh其实他也会他会进行一些
其實他也會他會進行一些
13:35.180–13:36.760
zh比如说字段的提取对不对
比如說字段的提取對吧
13:36.760–13:38.840
zh各式各样的字段的提取
各式各樣的字段的提取
13:38.840–13:40.960
zh但有些简单的字段你可以看
但有些簡單的字段你可以看
13:40.960–13:44.000
zh直接看比如他去找一些核心的指标
直接看比如他去找一些核心的指標
13:44.000–13:44.300
zh对不对
對吧
13:44.300–13:46.960
zh定单最多的这样的商品等等
訂單最多的這樣的商品等等
13:46.960–13:49.020
zh当然也会有一些比如说简单的
當然也會有一些比如說簡單的
13:49.020–13:50.980
zh什么月度收入与履约分析趋势
什麼月度收入與履約分析趨勢
13:50.980–13:54.400
zh那么这里它其实是通过交叉的各个不同维度去筛选出一张表
那麼這裡它其實是透過交叉各個不同維度來篩選出一張表格
13:54.400–13:57.140
zh然后这个表其实在我们当前这个系统里面
然後這張表格其實在我們目前的系統裡面
13:57.140–14:00.400
zh我们是给大家单独集成了一些e-chats的这样的一些工具
我們是為各位單獨整合了一些 e-chats 這樣的工具
14:00.400–14:03.580
zh这个e-chats其实也是我们在进行AI数据分析的过程当中
這個 e-chats 其實也是我們在進行 AI 數據分析的過程當中
14:03.580–14:06.080
zh经常会要用到的一个非常核心这样的功能
經常會要用到的非常核心這樣的功能
14:06.080–14:07.800
zh那么它其实就允许对不对
那麼它其實就允許,對吧?
14:07.800–14:11.120
zh有这样的一个一系列的各式各样交互的这个
有這樣一系列各種各樣互動的
14:11.120–14:13.200
zh交互的这样的这个效果
互動這樣的效果
14:13.200–14:15.340
zh我们就可以在里面能够去看到了
我們就可以在里面看到了
14:15.340–14:17.720
zh这个是e-chats的这样的一些这个功能
這是 e-chats 的一些功能
14:17.720–14:22.860
zh然后它是允许我们去根据选取不同的指标
然後它允許我們根據選取不同的指標
14:22.860–14:24.760
zh然后去选取不同这样的图片
然後選取不同的圖片
14:24.760–14:27.740
zh然后来进行实时的数据的这样的生成
然後進行實時數據的生成
14:27.740–14:30.960
zh然后其实上面每一步都它执行的一些过程
然後其實上面每一步它執行的一些過程
14:30.960–14:32.540
zh比如说它先提取了一个指标
比如說它先提取了一個指標
14:32.540–14:34.440
zh然后在我们对话列表里面
然後在我們的對話列表裡面
14:34.440–14:36.660
zh我们通过这些结构化输出这样的方式
我們透過這些結構化輸出的方式
14:36.660–14:39.280
zh让它去输出一个比如说核心指标
讓它去輸出一個比如說核心指標
14:39.280–14:41.560
zh某一个特定类型这样的一个message
某一種特定類型的訊息
14:41.560–14:44.600
zh然后我们的系统读取到它特定类型的message之后
然後我們的系統讀取到它特定類型的訊息之後
14:44.600–14:47.000
zh在前端渲染的时候就会使用这HS
在前端渲染的時候就會使用這HS
14:47.000–14:47.940
zh把它渲染成这个样子
將其渲染成這個樣子
14:47.940–14:48.580
zh是这么一回事
就是這麼回事
14:48.580–14:50.120
zh然后接下来比如说
然後接下來,例如說
14:50.120–14:51.640
zh它又提取了一组数据
它又提取了一組數據
14:51.640–14:53.800
zh那么前端又实时的把它渲染成
那麼前端又即時將其渲染成
14:53.800–14:54.880
zh这样的一个表格
這樣的一個表格
14:54.880–14:55.960
zh可以供我们来进行操作
供我們進行操作
14:55.960–14:57.000
zh像这样的渲染
像這樣的渲染
14:57.000–14:58.160
zh这样的功能
這樣的應用功能
14:58.160–14:59.600
zh也是现在就比如说
也就是現在舉例來說
14:59.600–15:01.300
zh我们使用这个Cloud Cowork
我們使用這個Cloud Cowork
15:01.300–15:04.000
zh或者是使用这个ChatGPT的这个Sheet
或是使用這個ChatGPT的Sheet
15:04.000–15:04.960
zh这样的一些这个系统
這類的一些系統
15:04.960–15:06.020
zh你发现它也是
你會發現它也是
15:06.020–15:07.780
zh类似这样的一个执行的思路
類似這樣的執行思路
15:07.780–15:09.660
zh这也是现在当代AI数据分析的
這也是當今AI數據分析
15:09.660–15:11.280
zhagent开发的过程当中
在開發 agent 的過程中
15:11.280–15:14.420
zh一个提升用户观感的一个小技巧
一個提升使用者體驗的小技巧
15:14.420–15:15.260
zh一个小技巧
小技巧
15:15.260–15:15.980
zh就这么一回事
就是這麼回事
15:15.980–15:18.100
zh然后他又提取各式各样的东西
接著他又提取了各種各樣的東西
15:18.100–15:19.480
zh然后在我们系统里面
然後在我們的系統裡面
15:19.480–15:21.280
zh他还有就比如说有一些
他還有比如說有一些
15:21.280–15:24.720
zh能够去追溯我们原来的数据
能夠追溯我們原始數據
15:24.720–15:26.680
zh整个生成的血脉这样的过程
整個生成的血緣過程
15:26.680–15:28.520
zh关于像什么数据血缘这样的追溯
關於像數據血緣這樣的追溯
15:28.520–15:29.480
zh这个其实也是现在
這其實也是現在
15:29.480–15:30.720
zh还是进行数据分析的时候
進行數據分析時
15:30.720–15:32.120
zh有一个非常时髦的一个概念
一個非常時髦的概念
15:32.120–15:33.000
zh这个血缘追溯
這個血緣追溯
15:33.000–15:34.200
zh其实一个是为了关联分析
其實一方面是為了關聯分析
15:34.200–15:37.020
zh一个是为了确认我们当前的本身数据
另一方面是為了確認我們當前原始數據
15:37.020–15:39.580
zh提取结果这样的可信度
提取結果的可信度
15:39.580–15:40.780
zh这样的一些功能
這樣的一些功能
15:40.780–15:43.380
zh去进行追溯进行关联检测等等
進行追溯和關聯檢測等
15:43.380–15:46.700
zh这里他就点一下就可以进来
這裡他點一下就可以進來
15:46.700–15:48.980
zh就可以看到他所谓的产物科学源
就可以看到所謂的產物科學源
15:48.980–15:50.420
zh相关这些东西了
相關這些內容了
15:50.420–16:07.499
zh我们不管我们继续看
我們繼續往下看
16:07.499–16:10.499
zh多维度的一个这个啊 多维度的这个表格分析啊
多維度的這個啊 多維度的表格分析啊
16:10.499–16:13.299
zh就是一个多维度的这个指标分析啊
就是多維度的指標分析啊
16:13.299–16:15.699
zh然后他呢 实际上是提取各个不同维度啊
然後他實際上提取了各個不同維度啊
16:15.699–16:16.899
zh然后来然后来进行分析啊
然後來進行分析啊
16:16.899–16:20.099
zh只不过呢 我们他所有提取的各个维度数据在前端渲染的时候呢
只不過呢 我們他所有提取的各維度數據在前端渲染時呢
16:20.099–16:23.499
zh都给他渲染成了这个啊 大家现在看到的啊
都渲染成了這個啊 大家現在看到的啊
16:23.499–16:26.099
zh这个呃 一些图表的这样的这个模样啊
這個呃 一些圖表這樣的模樣啊
16:26.099–16:26.699
zh是这么一回事啊
就是這麼回事啊
16:26.699–16:29.799
zh所以这里面其实很多很多很多的一些指标的一些这个分析啊
所以這裡面其實有很多很多很多的一些指標分析啊
16:29.799–16:32.799
zh所有这个指标都可以提取摘要啊 表格呀 图片呢
所有這些指標都可以提取摘要啊 表格呀 圖片呢
16:32.799–16:35.499
zh都是ok的啊 有很多的一些这个分析啊
都是ok的啊 有很多的一些分析啊
16:35.499–16:39.559
zh然后同时我们最后其实还有关于什么软投票模型
然後同時我們最後其實還有關於什麼軟投票模型
16:39.559–16:40.999
zh这个其实是一个建模分析
這其實是一個建模分析
16:40.999–16:43.959
zh我们实际上是让它来进行模型融合相关的分析
我們實際上是讓它來進行模型融合相關的分析
16:43.959–16:44.779
zh然后等等等等
然後等等等等
16:44.779–16:46.379
zh当然我们在实时运行的过程当中
當然我們在即時運行的過程中
16:46.379–16:47.879
zh我们其实还给它了一些功能
我們其實還給它了一些功能
16:47.879–16:49.759
zh就是这里面在进行对话的时候
就是這裡面在進行對話時
16:49.759–16:53.839
zh同时你可以在右边去比如保存一些数据结果
同時你可以在右邊去比如保存一些數據結果
16:53.839–16:55.379
zh这里你可以实时来进行保存
這裡你可以即時進行保存
16:55.379–16:55.919
zh其实没有什么问题
其實沒什麼問題
16:55.919–16:59.339
zh同时它还会生成一个可视化的报告
同時它還會生成一份可視化的報告
16:59.339–17:02.339
zh里面会综合我们现在所有的这些结论
裡面會綜合我們目前所有的這些結論
17:02.339–17:06.019
zh然后最后生成一个完整的数据分析的报告
然後最後生成一份完整的数据分析報告
17:06.019–17:07.719
zh然后同时数据分析的报告
然後同時這份數據分析報告
17:07.719–17:11.159
zh也是可以直接生成HTML来进行本地的保存的
也可以直接生成 HTML 進行本地保存
17:11.159–17:13.919
zh这是我们当前的整个agent一个基本功能
這是我們目前整個 Agent 的基本功能
17:13.919–17:15.559
zh当然了解这个基本功能之后
當然在了解這個基本功能之後
17:15.559–17:17.039
zh其实比较重要的是我们需要看
其實比較重要的是我們需要看
17:17.039–17:20.279
zh关于整个系统它的架构是如何实现
關於整個系統它的架構是如何實現的
17:20.279–17:23.579
zh它的架构是怎么样来进行完整的设计的
它的架構是怎樣進行完整設計的
17:23.579–17:26.059
zh那么对于我们当前这个系统来说
那麼對於我們目前這個系統來說
17:26.059–17:27.579
zhOK我们给大家放大一下
好的我們給大家放大一下
17:27.579–17:28.319
zh给大家看一下
給大家看一下
17:28.319–17:32.279
zh对我们当前的系统的架构来说
對我們目前系統的架構來說
17:32.279–17:34.899
zh那基本上是这么几个方面
那基本上是這麼幾個方面
17:34.899–17:36.479
zh大家可以先来看一下
大家可以先來看一下
17:36.479–17:39.439
zh当然首先大家这个之后
當然首先大家這個之後
17:39.439–17:40.379
zh如果拿到这个项目的话
如果拿到這個項目的話
17:40.379–17:43.199
zh其实是能够看到它完整的一个架构的这个列表的
其實能夠看到它完整的一個架構列表
17:43.199–17:46.639
zh那首先它肯定是流失对话的这个基本的这个工具台
那首先它肯定是流式對話的基本工具台
17:46.639–17:49.279
zh然后呢它是这个fastfpi跟sse的网关
然後呢它是這個 FastAPI 跟 SSE 的網關
17:49.279–17:50.819
zh因为我们本来是本地的这个部署
因為我們本來是本地部署
17:50.819–17:52.319
zh那这里正好给大家看一下
那這裡正好給大家看一下
17:52.319–17:54.319
zh我们实际上在进行这个
我們實際上在進行這個
17:54.319–17:56.539
zh在进行agent的开发过程当中
在進行 Agent 開發的過程當中
17:56.539–17:58.539
zh当我们已经就比如说
當我們已經就比如說
17:58.539–18:00.299
zh在这个看到一个成熟的这个项目
在這個看到一個成熟的項目
18:00.299–18:01.499
zh你可以从哪些角度去看
你可以從哪些角度去看
18:01.499–18:02.639
zh它底层的这样的架构
它底層這樣的架構
18:02.639–18:04.839
zh当然首先我们是对话切入的
當然首先我們是對話切入的
18:04.839–18:05.659
zh这样一些功能
這樣一些功能
18:05.659–18:08.199
zh然后就是我们整个Fast API后端服务
然後就是我們整個 FastAPI 後端服務
18:08.199–18:10.479
zh来进行封装的这样的一个功能模块
來進行封裝的這樣的功能模組
18:10.479–18:11.799
zh和SSE的网关
和 SSE 的網關
18:11.799–18:13.799
zh然后比较重要的是
然後比較重要的是
18:13.799–18:16.059
zh我们现在的agent运行时的这样的编排
我們現在 Agent 運行時的這樣的編排
18:16.059–18:17.199
zh那么agent运行时
那麼 Agent 運行時
18:17.199–18:18.879
zh这里我们其实是采用的是
這裡我們其實是採用的是
18:18.879–18:20.879
zhDeepseek V4 Flash这样的一个模型
Deepseek V4 Flash 這樣的模型
18:20.879–18:21.199
zh对不对
對吧
18:21.199–18:22.059
zh然后来了
然後來了
18:22.059–18:25.079
zhOpenAI的ChatComplations API作为底层
OpenAI 的 ChatCompletions API 作為底層
18:25.079–18:26.679
enSorry Responses API
抱歉回應 API
18:26.679–18:28.739
zh作为底层来进行一个基础功能
作為底層來進行基礎功能
18:28.739–18:29.599
zh这样的响应
這樣的回應
18:29.599–18:30.659
zh然后同时
然後同時
18:30.659–18:35.619
zh整个的编排是用Deep Agents来进行的编排
整個的編排是用 Deep Agents 來進行編排
18:35.619–18:39.859
zh所以它就会允许我们按照意图来进行工具调用
所以它就會允許我們按照意圖來進行工具呼叫
18:39.859–18:41.859
zh然后同时也可以加载这个Skill
然後同時也可以載入這個 Skill
18:41.859–18:45.039
zh这两块功能其实在实际开发过程当中
這兩塊功能其實在實際開發過程當中
18:45.039–18:46.199
zh并没有那么的复杂
並沒有那麼複雜
18:46.199–18:48.659
zh就比如说我们关联一些工具和关联一些Skill
就比如說我們關聯一些工具和關聯一些 Skill
18:48.659–18:50.879
zh其实并没有那么的复杂
其實並沒有那麼複雜
18:50.879–18:54.239
zh核心原因是因为对于像LongChain的Deep Agents来说
核心原因是因為對於像 LangChain 的 Deep Agents 來說
18:54.239–18:57.959
zh大家可能之前没有看过我们那期Deep Agents的公开课
大家可能之前沒有看過我們那期 Deep Agents 的公開課
18:57.959–18:59.819
zh那么对于Deep Agents来说
那麼對於 Deep Agents 來說
18:59.819–19:01.259
zh这功能其实都是内置功能
這功能其實都是內建功能
19:01.259–19:02.999
zh你其实只需要几行代码
你其實只需要幾行程式碼
19:02.999–19:09.339
zh然后去给它写好一些对应的一些skill
然後去給它寫好一些對應的一些 skill
19:09.339–19:10.999
zh然后在进行读取的过程当中
然後在進行讀取的過程當中
19:10.999–19:13.099
zh把这个skill就像工具一样给它读进来
把這個 skill 就像工具一樣給它讀進來
19:13.099–19:15.099
zh然后它就可以加载这样的一些skill
然後它就可以載入這樣的一些 skill
19:15.099–19:17.439
zh这些其实并不会特别的复杂
這些其實並不會特別複雜
19:17.439–19:19.619
zh然后比较复杂的其实是
然後比較複雜的其實是
19:19.619–19:21.079
zh关于我们在进数据分析的时候
關於我們在進行數據分析的時候
19:21.079–19:22.699
zh你需要去梳理我们当前系统
你需要去梳理我們當前系統
19:22.699–19:24.039
zh到底需要哪些功能
到底需要哪些功能
19:24.039–19:26.059
zh这一点其实也是现在
這一點其實也是現在
19:26.059–19:27.179
zh就是我们经常去讨论
就是我們經常去討論
19:27.179–19:28.419
zh比如说像FDE对不对
比如說像 FDE 對吧
19:28.419–19:30.259
zh前沿部署工程师
前沿部署工程師
19:30.259–19:31.519
zh我们经常说FDE
我們經常說 FDE
19:31.519–19:33.159
zhFDE这个难在哪呢
FDE 這個難在哪呢
19:33.159–19:34.499
zh其实不一定是难在
其實不一定是難在
19:34.499–19:36.759
zh说我们要去完成Agent开发
說我們要完成 Agent 開發
19:36.759–19:39.319
zh其实反而很多FDE的场景下
其實反而很多 FDE 的場景下
19:39.319–19:40.639
zhAgent本身的开发难度
Agent 本身的開發難度
19:40.639–19:41.459
zh其实是并不大的
其實並不大
19:41.459–19:43.259
zh然后FDE最难的地方
接著FDE最困難的地方
19:43.259–19:43.859
zh可能在于说
可能在於
19:43.859–19:45.879
zh它怎么样结合业务去分析
它如何結合業務進行分析
19:45.879–19:46.759
zh我们当前业务到底
我們當前的業務究竟
19:46.759–19:48.039
zh需要达到哪些目标
需要達成哪些目標
19:48.039–19:49.879
zh然后合理的去适配一条
然後合理地調整一條
19:49.879–19:51.979
zh最为稳健这样的一个开发方案
最為穩健的開發方案
19:51.979–19:52.979
zh然后去解决这样的问题
並去解決這樣的問題
19:52.979–19:54.759
zh比如说拿到数据分析这样的场景
舉例來說,像是取得數據分析這樣的場景
19:54.759–19:55.719
zh它就非常典型了
就非常典型了
19:55.719–19:56.119
zh对吧
對吧
19:56.119–19:56.879
zh你就可以去分析
你就可以去分析
19:56.879–19:57.419
zh关于说
關於說
19:57.419–19:59.179
zh我们这个数据分析
我們這個數據分析
19:59.179–20:01.479
zh到底需要实现哪一些功能
究竟需要實現哪些功能
20:01.479–20:03.859
zh就比如说多元数据接入
就比如說多元數據接入
20:03.859–20:04.579
zh这个得有
這個必須要有
20:04.579–20:06.379
zh然后什么数据
然後什麼樣的數據
20:06.379–20:08.179
zh只读的数据查询引擎
只讀的數據查詢引擎
20:08.179–20:09.819
zh这个查数的功能肯定是要有
這個查數的功能肯定是要有
20:09.819–20:12.579
zh然后像什么数据清洗和特征工程
然後像什麼數據清洗和特徵工程
20:12.579–20:13.799
zh然后包括数据探索
然後包括數據探索
20:13.799–20:14.719
zh数据可视化分析
數據可視化分析
20:14.719–20:16.019
zh这东西肯定是要有的
這些東西肯定是要有的
20:16.019–20:16.419
zh对不对
對不對
20:16.419–20:17.159
zh这就是一块功能
這就是一個功能區塊
20:17.159–20:19.399
zh还有什么异步训练精神管道
還有什麼異步訓練與推理管道
20:19.399–20:20.419
zh所谓异步训练
所謂異步訓練
20:20.419–20:22.239
zh其实主要指的是一些画图的工作
其實主要指的是一些繪圖的工作
20:22.239–20:24.019
zh和机器学习建模预测的一些工作
和機器學習建模預測的一些工作
20:24.019–20:25.779
zh然后机器学习和模型融合
然後機器學習和模型融合
20:25.779–20:26.679
zh这个肯定也是要有的
這個肯定也是要有的
20:26.679–20:29.139
zh我们需要很多时候需要围绕一些数值来进行预测
我們需要很多時候需要圍繞一些數值來進行預測
20:29.139–20:29.399
zh对不对
對不對
20:29.399–20:30.399
zh然后出分析报告
然後產出分析報告
20:30.399–20:32.539
zh这条链路基本上就是我们现在
這條鏈路基本上就是我們現在
20:32.539–20:34.799
zh其实不仅仅是我们当前项目这么规定的
其實不僅僅是我們當前項目這麼規定的
20:34.799–20:37.199
zh其实现在很多的一些agent开发
其實現在很多的一些agent開發
20:37.199–20:38.839
zh很多的一些这个数据分析项目
很多的一些這個數據分析項目
20:38.839–20:40.479
zh基本上也是按照这样的一个链路
基本上也是按照這樣的一個鏈路
20:40.479–20:42.699
zh来规划我们现在整个模块核心需要的功能
來規劃我們目前整個模組核心所需的功能
20:42.699–20:43.999
zh那么有了这功能之后
那麼有了這些功能之後
20:43.999–20:44.599
zh你会发现
你會發現
20:44.599–20:45.939
zh那这些功能如何实现
這些功能該如何實現
20:45.939–20:46.959
zh基本上就是两层
基本上分為兩層
20:46.959–20:48.779
zh第一层我们说底层
第一層我們稱為底層
20:48.779–20:51.639
zh你需要有一些基础功能层作为它的支撑
你需要有一些基礎功能層作為支撐
20:51.639–20:52.999
zh比如说你要有本地的数据库
例如你需要有本地資料庫
20:52.999–20:53.599
zh对不对
對吧
20:53.599–20:55.839
zh你需要有这个项目隔离仓
你需要有這個專案隔離倉
20:55.839–20:57.339
zh和这个血缘关系的这个梳理
以及梳理這個血緣關係
20:57.339–20:59.379
zh你需要有什么这个CircleLite
你需要有這個 CircleLite
20:59.379–21:01.339
zh去存储每一个数据集的这个原数据
用來儲存每個資料集的元數據
21:01.339–21:02.879
zh你还需要有独立项目空间和文件
你還需要有獨立的專案空間和檔案
21:02.879–21:05.479
zh这东西其实是怎么说呢
這東西其實該怎麼說呢
21:05.479–21:09.419
zh就是这东西倒不一定你需要跟Codex去说
就是這東西倒不一定你需要跟 Codex 說明
21:09.419–21:11.359
zh他其实很多时候自己能够梳理清楚
他其實在很多時候自己能夠梳理清楚
21:11.359–21:13.059
zh就是你需要去跟他讲的更多的
就是你需要去跟他講的更多
21:13.059–21:14.479
zh其实是上面这一层
其實是上面這一層
21:14.479–21:17.059
zh我们到底需要有哪一些业务的这个指标
我們到底需要有哪些業務指標
21:17.059–21:18.199
zh以及这所有的业务
以及所有這些業務
21:18.199–21:20.739
zh他需要完成到什么样的这个程度
他需要完成到什麼樣的程度
21:20.739–21:22.779
zh就比如说OK我们的这个分析报告
就例如 OK 我們的這個分析報告
21:22.779–21:23.959
zh写的什么程度
寫到什麼程度
21:23.959–21:25.439
zh然后我们的这个一步训练进程
然後我們的這個一階訓練進程
21:25.439–21:28.119
zh他需要做到什么样的程度等等
他需要做到什麼樣的程度等等
21:28.119–21:31.399
zh然后至于说有了这些程度之后
然後至於說有了這些程度之後
21:31.399–21:34.779
zh下面的很多的一些功能
下面的很多功能
21:34.779–21:37.739
zh其实都可以由当前的agent或者kodex
其實都可以由當前的 agent 或 Codex
21:37.739–21:38.479
zh自己来去完成
自己來完成
21:38.479–21:39.399
zh这个其实问题不大
這個其實問題不大
21:39.399–21:42.319
zh但是确实需要我们人工来进行讨论和完成
但是確實需要我們人工來進行討論和完成
21:42.319–21:43.639
zh实际上是上面这些
實際上是上面這些
21:43.639–21:46.279
zh主要是agent的智能编排程
主要是 agent 的智能編排程度
21:46.279–21:49.239
zh就是比如说我们比如说模型
就是例如我們說模型
21:49.239–21:52.279
zh或者最小的工具路由
或者最小的工具路由
21:52.279–21:54.439
zh或者sgills这样的披露等等
或者像 Skills 這樣的披露等等
21:54.439–21:56.939
zh你需要有一整套完整的技术选型
你需要有一整套完整的技術選型
21:56.939–22:00.139
zh确定是需要你需要采用哪一组技术来进行开发
確定你需要採用哪一組技術來進行開發
22:00.139–22:03.339
zhOK 差不多是这样的一个基本的架构
OK 差不多就是這樣一個基本的架構
22:03.339–22:05.819
zh所以我们说从架构当中
所以我們說從架構當中
22:05.819–22:07.019
zh你也能够看得出来
你也能夠看得出來
22:07.019–22:10.019
zh基本上我们现在在进行agent开发过程当中
基本上我們現在在進行 Agent 開發的過程當中
22:10.019–22:12.039
zh其实比较重要的第一点
其實比較重要的第一點
22:12.039–22:14.259
zh其实倒不一定怎么说
其實倒不一定怎麼說
22:14.259–22:17.919
zh当然选取一个合适的工具和模型也很重要
當然選取一個合適的工具和模型也很重要
22:17.919–22:19.139
zh但是其实更加重要的是
但是其實更加重要的是
22:19.139–22:20.579
zh你需要非常清楚的知道
你需要非常清楚的知道
22:20.579–22:23.299
zh我们当前的业务的意图是什么
我們當前的業務意圖是什麼
22:23.299–22:27.959
zh那也就是说我们现在到底需要解决哪一些这个问题啊
那也就是說我們現在到底需要解決哪些問題啊
22:27.959–22:28.559
zh然后呢
然後呢
22:28.559–22:33.059
zh到底有哪一些这个非常关键的这样的一些这个场景啊
到底有哪些這樣非常關鍵的場景啊
22:33.059–22:33.999
zh等等等等啊
等等等等啊
22:33.999–22:34.999
zh这些呢可能是
這些呢可能是
22:34.999–22:35.259
zh
22:35.259–22:35.959
zh放大一下
放大一下
22:35.959–22:38.859
zh那么这些呢可能是首先我们需要确认的啊
那麼這些呢可能是首先我們需要確認的啊
22:38.859–22:39.519
zh然后呢
然後呢
22:39.519–22:43.699
zh接下来比较重要的是我们可能就需要讨论清楚
接下來比較重要的是我們可能就需要討論清楚
22:43.699–22:48.339
zh关于我要去解决当前这样的一些业务的难题啊
關於我要去解決當前這樣的一些業務難題啊
22:48.339–22:48.539
zh
22:48.539–22:50.939
zh你得做好哪一些技术这个选型
你得做好哪些技術選型
22:50.939–22:51.559
zh对不对啊
對不對啊
22:51.559–22:53.479
zh就是选型这块肯定也是我们需要去做的啊
就是選型這塊肯定也是我們需要去做的啊
22:53.479–22:55.739
zh那么然后再往下才是啊
那麼然後再往下才是啊
22:55.739–22:57.079
zh你用着这个codex啊
你用著這個 Codex 啊
22:57.079–22:59.599
zh你用着这个这个deep seek啊
你用著這個這個 Deep Seek 啊
22:59.599–23:00.499
zh这样的这个模型啊
這樣的這個模型啊
23:00.499–23:01.879
zh再来进行一轮一轮的开发啊
再進行一輪一輪的開發啊
23:01.879–23:02.419
zh是这么一回事
是這麼一回事
23:02.419–23:02.859
zh
23:02.859–23:06.379
zh那么了解了我们当前整个系统
那麼了解了我們當前整個系統
23:06.379–23:09.759
zh那完整的一些基本的功能之后啊
那完整的一些基本的功能之後啊
23:09.759–23:10.539
zh那么接下来啊
那麼接下來啊
23:10.539–23:12.039
zh就我们需要来看一看啊
就我們需要來看一看啊
23:12.039–23:13.359
zh他到底应该呃
他到底應該呃
23:13.359–23:15.379
zh怎么样来进行开发和底层的这个思路啊
怎麼樣來進行開發和底層的這個思路啊
23:15.379–23:16.032
zh到底是什么样的呢
到底是什麼樣的呢

影片筆記:DeepSeek V4正式版+Codex工业Agent开发实战!从零手搓AI数据分析Agent,Responses API调用流程与Codex核心功能详解! p06 06.【实战】AI数据分析系统开发实战(上)

一句話總結

本集介紹了基於 DeepSeek V4 Flash 模型與 Codex 開發的「DS4-AI 數據分析系統」實戰,詳細拆解了從數據接入、技能中心(Skills)配置、FastAPI 後端架構到前端可視化渲染的完整開發鏈路,並強調了業務場景理解與技術選型在 Agent 開發中的核心地位。

核心重點

  1. 模型與工具選型
  • 使用 DeepSeek V4 Flash 搭配 Codex 進行開發。
  • 講者認為,儘管 V4 Flash 是「小號」模型,但其性能優於早期版本(甚至提及比 Opera 4.5 更強,疑點),且響應速度快,與 Codex 兼容性穩定,適合多數開發任務。
  • 架構基於 Deep Agents(LongChain Deep Agents)與 FastAPI
  1. DS4-AI 系統核心功能
  • 數據資產管理:支持接入本地 Excel/CSV、MySQL、SQLite 等多種數據源,管理數據權限、臨時存儲及結論。示例數據規模為 300 多萬行。
  • 技能中心(Skills Center):通過 Skill 灌輸領域知識。內置 4 個 Skill:生成數據摘要、數據檢查、異常值檢查、生成數據分析報告。覆蓋數據清洗、探索、可視化、特徵工程等全流程。
  • 安全與隔離:採用沙盒環境隔離 Python 代碼運行,數據庫設置只讀權限,確保原始數據安全。
  • 對話與 Agent 運行時:每次對話視為獨立項目,支持工具調用、跨線程記憶與持久化。
  1. 開發難點與架構設計
  • 難點不在代碼編寫:核心難點在於對業務場景的理解、技術選型以及功能鏈路的梳理(數據接入、清洗、可視化、建模等)。
  • 功能鏈路規劃:多元數據接入 -> 只讀查詢引擎 -> 數據清洗/特徵工程 -> 探索與可視化 -> 異步訓練/建模 -> 模型融合 -> 生成報告。
  • 層級劃分:底層支撐(數據庫、隔離倉、血緣梳理)、上層業務(指標定義、報告質量)、智能編排(模型路由、Skill 披露)。
  1. 用戶體驗與交互
  • 前端渲染為 E-charts(疑點,應為 ECharts)圖表,支持實時生成表格與圖表。
  • 具備數據血緣追溯功能,可確認提取結果可信度。
  • 支持生成 HTML 報告並本地保存。

詳細大綱

1. 開發背景與模型評估

  • 學習建議:基礎學習後應圍繞具體項目進行開發試錯,提取經驗並優化,完成全鏈路開發。
  • 模型對比
  • DeepSeek V4 Flash 性能優於上半年或年初的模型。
  • 提及與 Opera 4.5 的性能比較(疑點)。
  • 優勢:響應速度快,Codex 兼容性穩定。

2. DS4-AI 數據分析系統功能詳解

  • 系統定位:適配 2026 下半年,適合用於履歷項目,功能齊全。
  • 模塊一:數據資產管理
  • 接入渠道:本地 Excel/CSV、MySQL、SQLite、分佈式數據庫。
  • 功能:維護數據中台/存儲,處理權限,管理臨時數據及結論。
  • 數據規模示例:300 多萬行,分散在 MySQL、CircleLite(疑點)、Excel、CSV。
  • 模塊二:技能中心(Skills Center)
  • 通過 Skill 灌輸領域知識和分析偏好。
  • 內置 Skill:生成數據摘要、數據檢查、異常值檢查、生成數據分析報告。
  • 覆蓋流程:數據清洗、探索、指標計算、可視化、特徵工程、模型融合。
  • 模塊三:系統設置與安全
  • 模型 API 設置、沙盒環境配置(隔離 Python 代碼)。
  • 安全措施:數據庫只讀、最小上下文披露、CPU 腳本沙盒。
  • 界面:支持 Web Design 風格,內置多種頁面外觀。
  • 模塊四:對話與 Agent 運行時
  • 每次對話為獨立數據分析項目,擁有獨立空間。
  • 底層使用 Deepseek Flash 模型,架構基於 Deep Agents。
  • 功能:工具調用、系統設置、Skill 加載、跨線程記憶、持久化。

3. 系統架構與技術選型

  • 技術棧
  • 前端:流式對話工具台。
  • 後端:FastAPI 封裝模塊 + SSE 網關。
  • Agent 運行時:Deepseek V4 Flash + OpenAI ChatComplations API(疑點) + Deep Agents。
  • FDE(前沿部署工程師)視角
  • 難點在於結合業務分析目標,確定業務目標、适配穩健開發方案、梳理功能鏈路。
  • 數據分析功能鏈路
  1. 多元數據接入。
  2. 只讀數據查詢引擎。
  3. 數據清洗與特徵工程。
  4. 數據探索與可視化分析。
  5. 異步訓練進程管道(畫圖、機器學習建模預測)。
  6. 機器學習與模型融合。
  7. 生成分析報告。
  • 開發層級
  • 底層:本地數據庫、項目隔離倉、血緣關係梳理、SQLite/CircleLite 存儲、獨立項目空間。
  • 上層:業務指標定義、功能完成程度。
  • 智能編排:模型路由、最小工具路由、Skill 披露。

4. 用戶體驗與交互細節

  • 前端渲染
  • 系統讀取特定 Message,在前端渲染為 E-charts 圖表。
  • 支持實時生成表格、圖表,提升觀感。
  • 類似 Cloud Cowork 或 ChatGPT Sheet 的執行思路。
  • 數據血緣追溯
  • 追溯數據生成過程,確認提取結果可信度。
  • 支持關聯分析,點擊查看產物血緣。
  • 報告生成
  • 綜合結論生成可視化報告。
  • 支持生成 HTML 並本地保存。

工具 / 模型 / 名詞整理

  • 模型/技術名稱
  • DeepSeek V4 Flash
  • Codex
  • Deep Agents (LongChain Deep Agents)
  • FastAPI
  • SSE (Server-Sent Events)
  • OpenAI ChatComplations API (原文拼寫,疑點)
  • Responses API (前文提及)
  • E-chats (原文,疑點,可能指 ECharts)
  • SQLite
  • MySQL
  • CircleLite (原文提及數據載體,疑點)
  • Cloud Cowork (原文,疑點)
  • ChatGPT Sheet (原文,疑點)
  • Opera 4.5 (原文提及模型性能比較,疑點)
  • 概念/術語
  • NL2色刻画 (疑點,可能為 NL2SQL 或類似術語)
  • Skill (技能)
  • Agent (智能體)
  • Sandbox (沙盒)
  • Subagents (子智能體)
  • States (狀態)
  • Innet (疑點,可能為 Intent 或 Internal)
  • FDE (前沿部署工程師)
  • 數據血緣 (Data Lineage)
  • 模型融合 (Model Fusion)
  • 特徵工程 (Feature Engineering)
  • 持有机 (原文,疑點,可能為持久化 Persistence)
  • 软投票模型 (原文,疑點,可能為 Soft Voting)
  • 一步训练进程 (原文,疑點,可能為異步訓練進程)

操作流程整理

  1. 環境與數據準備
  • 配置 FastAPI 後端與 SSE 網關。
  • 接入多元數據源(Excel, CSV, MySQL, SQLite 等),建立數據資產管理系統。
  • 設置數據庫只讀權限與沙盒環境,確保安全。
  1. 技能中心配置
  • 定義並灌輸 Skill(數據摘要、檢查、異常值檢查、報告生成)。
  • 將 Skill 與 Deep Agents 框架綁定,實現代讀取加載。
  1. Agent 運行與編排
  • 初始化 DeepSeek V4 Flash 模型,配置 API 調用。
  • 建立獨立項目空間,處理跨線程記憶與持久化。
  • 執行功能鏈路:數據接入 -> 清洗/特徵工程 -> 探索/可視化 -> 異步訓練/建模 -> 模型融合。
  1. 前端交互與輸出
  • 通過流式對話工具台進行交互。
  • 解析模型輸出,在前端渲染 E-charts 圖表與表格。
  • 生成數據血緣追溯鏈,確認結果可信度。
  • 最終生成 HTML 格式的分析報告並保存。

值得注意的限制或風險

  1. 數據安全風險
  • 雖然設置了沙盒和只讀權限,但仍需確保 Python 代碼在沙盒內嚴格隔離,防止影響原始數據或系統資源。
  • 最小上下文披露原則需嚴格執行,避免敏感數據泄露。
  1. 模型性能與兼容性
  • 使用「小號」模型(DeepSeek V4 Flash)可能在處理極複雜邏輯或超大規模數據時存在性能瓶頸,需依賴 Codex 的輔助。
  • 與 OpenAI API 的兼容性(ChatComplations API 拼寫疑點)可能帶來集成風險。
  1. 業務場景適配難度高
  • 開發難點不在於 Agent 代碼編寫,而在於對業務目標的理解和功能鏈路的梳理。若業務邏輯梳理不清,系統可能無法生成高質量的分析報告。
  1. 數據質量與多樣性
  • 系統需處理分散在不同載體(MySQL, Excel, CSV 等)的數據,數據清洗與特徵工程環節可能因數據質量問題而變得複雜。

逐字稿辨識疑點

  • Responsees API:原文拼寫,疑點,可能為 Responses API。
  • Opera 4.5:原文提及模型性能比較,疑點,Opera 通常為瀏覽器,此處指代不明,需查證。
  • NL2色刻画:原文,疑點,可能為 NL2SQL 或其他數據分析術語。
  • States / Innet:原文提及 Codex 功能,疑點,Innet 可能為聽寫錯誤,需查證。
  • CircleLite:原文提及數據載體,疑點,可能為 SQLite 或其他數據庫名稱。
  • ChatComplations API:原文拼寫,疑點,可能為 Chat Completions API。
  • e-chats:原文,疑點,可能為 ECharts。
  • Cloud Cowork:原文,疑點,可能為 GitHub Copilot Workspace 或其他協作工具。
  • 持有机:原文,疑點,可能為持久化(Persistence)或類似術語。
  • 软投票模型:原文,疑點,可能為 Soft Voting。
  • 一步训练进程:原文,疑點,可能為異步訓練進程。

可延伸追問

  1. DeepSeek V4 Flash 模型在處理 300 多萬行數據時,具體的性能表現如何?是否存在延遲或準確度下降的情況?
  2. 「Deep Agents (LongChain Deep Agents)」框架與標準的 LangChain 或 LlamaIndex 相比,在 Skill 加載和狀態管理上有何具體優勢?
  3. 系統中提到的「數據血緣追溯」技術實現細節是什麼?如何確保追溯鏈的準確性和完整性?
  4. 對於「小號」模型,Codex 在其中具體承擔了哪些輔助角色?是代碼生成、調試還是邏輯糾正?
  5. 系統如何處理多數據源之間的數據衝突或格式不一致問題?在數據清洗環節有哪些具體的自動化策略?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習