WEBVTT
Kind: captions
Language: zh-Hans

00:00:00.100 --> 00:00:02.100
大家好欢迎来到灵姐说AI

00:00:02.133 --> 00:00:05.266
这期视频给大家分享Codex最近上线

00:00:05.266 --> 00:00:08.366
的一个我认为非常重要的新功能

00:00:08.366 --> 00:00:10.933
叫做record and Replay

00:00:11.066 --> 00:00:12.766
我刚刚用这个功能

00:00:12.866 --> 00:00:15.000
完成了两个实测的任务

00:00:15.300 --> 00:00:16.866
用完之后我的第一反应

00:00:16.866 --> 00:00:19.533
是感觉有一点后背发凉

00:00:19.533 --> 00:00:22.566
我觉得Openai在下一步非常大的棋

00:00:22.966 --> 00:00:23.900
在这期视频里面

00:00:23.900 --> 00:00:26.566
我会给大家去讲解一下这个功能

00:00:26.566 --> 00:00:27.866
它的本质是什么

00:00:27.866 --> 00:00:29.366
它会带来哪些影响

00:00:29.400 --> 00:00:31.533
并且我会有两个实操项目

00:00:31.533 --> 00:00:33.133
给大家去演示一下

00:00:33.166 --> 00:00:35.766
这个record and Replay的能力

00:00:35.766 --> 00:00:38.800
它的实际的效果到底怎么样并且啊

00:00:38.800 --> 00:00:42.366
我觉得从这个功能可以管中窥豹

00:00:42.700 --> 00:00:45.666
看出Openai的野心有多大

00:00:45.666 --> 00:00:46.966
而且用了这个功能

00:00:46.966 --> 00:00:48.700
我觉得你会对这家公司

00:00:48.700 --> 00:00:50.800
的未来有更大的信心

00:00:50.866 --> 00:00:51.500
这个功能呢

00:00:51.500 --> 00:00:52.766
说起来挺简单的

00:00:52.766 --> 00:00:55.366
就是你在Codex上面主动

00:00:55.366 --> 00:00:57.466
的录制一次你的操作

00:00:57.500 --> 00:01:00.866
然后它会自动的记住你整个过程

00:01:00.933 --> 00:01:02.466
然后它通过思考把

00:01:02.466 --> 00:01:03.933
它封装为一个skill

00:01:04.100 --> 00:01:05.733
这个skill就沉淀了下来

00:01:05.733 --> 00:01:08.333
下次你可以自动的复用

00:01:08.333 --> 00:01:09.500
不过不好意思

00:01:09.600 --> 00:01:13.166
这个功能现在也只支持macos

00:01:13.366 --> 00:01:15.133
Windows的用户不要抱怨

00:01:15.366 --> 00:01:17.800
如果说你还没有买macos的电脑

00:01:17.800 --> 00:01:21.866
我建议你现在立刻马上下单一台

00:01:21.900 --> 00:01:23.700
因为库克已经警告了

00:01:23.700 --> 00:01:26.600
未来苹果的产品还会继续涨价

00:01:26.666 --> 00:01:28.666
因为它的上游的供应链

00:01:28.700 --> 00:01:31.100
存储的价格还在继续上涨

00:01:31.366 --> 00:01:34.366
至少在这个比较短的周期窗口里面

00:01:34.366 --> 00:01:35.500
肯定是这样子的

00:01:35.500 --> 00:01:37.400
这个功能不是传统的

00:01:37.400 --> 00:01:39.300
这种宏录制的工具

00:01:39.333 --> 00:01:42.066
它实际上是你演示一次

00:01:42.200 --> 00:01:45.166
Codex主动的去观察你的操作

00:01:45.166 --> 00:01:47.533
记录和电脑的运行记录

00:01:47.566 --> 00:01:49.333
把你的整个的操作

00:01:49.333 --> 00:01:52.000
过程抽象为一个SOP

00:01:52.100 --> 00:01:53.466
形成一个skill

00:01:53.700 --> 00:01:57.066
沉淀为一个可以复用的资产和能力

00:01:57.066 --> 00:01:59.633
它整个的过程实际上就是三层

00:01:59.700 --> 00:02:01.533
第一层就是record

00:02:01.533 --> 00:02:02.666
观察你的记录

00:02:02.766 --> 00:02:05.566
Codex会观察在这个workflow所

00:02:05.566 --> 00:02:07.866
需要的动作和窗口内容

00:02:07.866 --> 00:02:09.900
第二层是skill drafting

00:02:09.966 --> 00:02:11.800
把操作抽象为skill

00:02:11.866 --> 00:02:13.500
在录制结束之后

00:02:13.500 --> 00:02:16.366
Codex会检查捕获到的workflow

00:02:16.400 --> 00:02:18.300
并且草拟为一个skill

00:02:18.333 --> 00:02:20.566
这个skill会说明什么时候使用

00:02:20.800 --> 00:02:21.700
需要哪些输入

00:02:21.700 --> 00:02:22.900
按什么步骤走

00:02:22.900 --> 00:02:23.966
如何验证

00:02:24.066 --> 00:02:26.066
第三层是Replay

00:02:26.200 --> 00:02:29.333
用skill去指导这个agent再做一遍

00:02:29.333 --> 00:02:32.266
你在新的线程里面给它新的变量

00:02:32.266 --> 00:02:34.600
比如新的文件新的日期

00:02:34.700 --> 00:02:36.866
新的标题新的环境等等

00:02:36.866 --> 00:02:40.300
它会把skill当做可以复用的上下文

00:02:40.333 --> 00:02:44.533
再结合当前环境里面的Computer Use插件

00:02:44.533 --> 00:02:47.400
和浏览器的操作来完成整个任务

00:02:47.433 --> 00:02:49.133
这个能力真的是Openai在

00:02:49.133 --> 00:02:51.000
codex上面的重大更新

00:02:51.066 --> 00:02:54.533
以前我们要去沉淀skill或者是驱动AI

00:02:54.533 --> 00:02:56.066
我们需要写提示词

00:02:56.100 --> 00:02:57.733
那么有一部分人他

00:02:57.733 --> 00:02:59.300
没有这样的抽象能力

00:02:59.600 --> 00:03:01.800
现在相当于它可以直接

00:03:01.800 --> 00:03:05.000
根据你演示工作的操作过程

00:03:05.033 --> 00:03:07.566
去把它抽象沉淀为一个skill

00:03:07.600 --> 00:03:09.900
相当于普通人也可以

00:03:09.900 --> 00:03:11.700
沉淀自动化的流程

00:03:11.866 --> 00:03:14.833
只要你能够把这个事情做出来

00:03:14.833 --> 00:03:16.833
我就能够记录record

00:03:16.900 --> 00:03:19.100
然后把它再做一遍

00:03:19.200 --> 00:03:20.500
而这个事情带来另外

00:03:20.500 --> 00:03:21.900
一个方面的影响就是

00:03:21.900 --> 00:03:23.600
即使你在一个工作岗位上

00:03:23.600 --> 00:03:26.233
你不主动把自己的经验交出来

00:03:26.300 --> 00:03:29.933
企业也可以通过观察你的工作流

00:03:30.000 --> 00:03:33.633
把你的整个的操作过程给抽象出来

00:03:33.633 --> 00:03:34.566
沉淀为skill

00:03:34.566 --> 00:03:36.133
以前企业的整个的

00:03:36.133 --> 00:03:37.800
工作流是SOP的文档

00:03:37.800 --> 00:03:40.433
以后这些工作经验沉淀为skill

00:03:40.533 --> 00:03:42.433
由agent来执行

00:03:42.466 --> 00:03:44.633
人进行最后的把关

00:03:44.633 --> 00:03:46.900
这和我之前讲的skill OPS

00:03:47.100 --> 00:03:48.933
的路线也是一致的

00:03:48.933 --> 00:03:50.766
岗位经验可以抽象

00:03:50.766 --> 00:03:52.500
成为可复用的skill

00:03:52.666 --> 00:03:56.133
然后人负责agent执行这个skill

00:03:56.133 --> 00:03:58.633
最后的工作节点的检查

00:03:58.666 --> 00:04:01.000
并且对最后的结果负责

00:04:01.000 --> 00:04:03.533
而这些可复用的内容就会

00:04:03.533 --> 00:04:06.033
沉淀为公司的skill资产库

00:04:06.033 --> 00:04:08.366
可能有人又要谈到AI对

00:04:08.366 --> 00:04:09.666
工作的影响和冲击

00:04:09.666 --> 00:04:11.966
我想说确实是的啊

00:04:12.066 --> 00:04:15.333
这个以后不管你交不交出你的经验

00:04:15.433 --> 00:04:18.833
你的经验都会被AI抽象为skill

00:04:19.033 --> 00:04:21.266
那么其实大部分白领的

00:04:21.266 --> 00:04:23.533
工作都是在数字世界里面的

00:04:23.533 --> 00:04:26.300
就没有在数字世界里面

00:04:26.333 --> 00:04:28.533
AI抽象不出来的东西

00:04:28.633 --> 00:04:31.700
无非是如何原子化和结构化

00:04:31.700 --> 00:04:32.933
但是我想讲的是

00:04:33.166 --> 00:04:36.966
如果说你的工作内容100%

00:04:37.066 --> 00:04:39.733
能够被AI替代和抽象出来

00:04:39.933 --> 00:04:43.933
和你的工作90%AI能够替你做

00:04:43.933 --> 00:04:45.766
这是有本质的区别的

00:04:45.766 --> 00:04:49.533
如果说你的工作能够100%的由AI完成

00:04:49.533 --> 00:04:52.300
你的这个工作就会被抽象出来

00:04:52.300 --> 00:04:53.033
沉淀为skill

00:04:53.033 --> 00:04:53.866
最后被替代

00:04:54.266 --> 00:04:59.300
但是如果说你的工作90%AI来完成的

00:04:59.300 --> 00:05:00.466
agent完成的

00:05:00.466 --> 00:05:04.233
但是最后的关键节点需要人的确认

00:05:04.233 --> 00:05:06.466
需要这个human gate人的确认

00:05:06.500 --> 00:05:08.366
你的这个工作仍然是

00:05:08.366 --> 00:05:09.833
一个高价值的工作

00:05:10.100 --> 00:05:13.833
那100%的替代和90%的替代

00:05:13.866 --> 00:05:16.666
会产生0和1的差别

00:05:16.666 --> 00:05:20.300
第三块大的影响就是UI型的软件

00:05:20.333 --> 00:05:22.166
它会被极大的削弱

00:05:22.166 --> 00:05:23.666
这个能力上线之后

00:05:23.666 --> 00:05:27.200
实际上我的理解就是它在吃掉数据

00:05:27.266 --> 00:05:31.600
就是你和这种UI型的软件的协同

00:05:31.666 --> 00:05:35.000
包括你和这种GUI的这种桌面型

00:05:35.000 --> 00:05:38.133
图形型的这种软件的操作的协同的

00:05:38.133 --> 00:05:40.600
数据实际上是被抽象出来

00:05:40.800 --> 00:05:44.000
被Codex整个的大的数据集吃掉

00:05:44.000 --> 00:05:47.000
那么我们知道我们用AI操作的时候

00:05:47.000 --> 00:05:49.033
用MCP用插件

00:05:49.033 --> 00:05:50.066
用API接口

00:05:50.066 --> 00:05:51.833
它的效率是更高的

00:05:51.833 --> 00:05:54.766
而且能够批量高效的去产出

00:05:54.800 --> 00:05:57.133
而且在这个阶段Codex

00:05:57.133 --> 00:06:00.333
Openai的官方也会建议大家对于能用

00:06:00.533 --> 00:06:03.233
这种MCP能用接口去解决的问题

00:06:03.233 --> 00:06:05.400
尽量不要用使用这样的方式

00:06:05.400 --> 00:06:07.000
因为它会受到这个

00:06:07.000 --> 00:06:09.133
图形界面各种方式的影响

00:06:09.133 --> 00:06:10.766
不稳定性会比较强

00:06:10.766 --> 00:06:12.966
关于record and Replay的能力到底如何

00:06:12.966 --> 00:06:13.933
我在随后啊

00:06:13.933 --> 00:06:15.800
再跟大家去结合我的实操案例

00:06:15.800 --> 00:06:18.000
大家看完之后再去讲我的感受

00:06:18.000 --> 00:06:20.133
可能大家会更加直观一点

00:06:20.133 --> 00:06:21.633
首先我们找到这个功能

00:06:21.633 --> 00:06:23.133
在Codex的界面

00:06:23.133 --> 00:06:25.566
在左边点击这里的插件

00:06:25.700 --> 00:06:28.066
然后搜索record and replay

00:06:28.200 --> 00:06:29.666
好就点击这里

00:06:29.666 --> 00:06:31.066
因为我这里已经连接过了

00:06:31.066 --> 00:06:31.833
如果没有连接

00:06:31.833 --> 00:06:34.100
在这里重新点一下连接就可以了

00:06:34.100 --> 00:06:36.000
然后打开一个新的对话

00:06:36.033 --> 00:06:40.233
只要斜杠输入这个插件record and Replay

00:06:40.300 --> 00:06:41.966
跟它沟通就可以了

00:06:44.200 --> 00:06:44.900
第一个任务

00:06:44.900 --> 00:06:47.900
我们让record and Replay来复刻我们从

00:06:47.933 --> 00:06:50.533
Youtube上传整个发布包的过程

00:06:50.733 --> 00:06:53.266
这里的发布包不仅包含视频

00:06:53.466 --> 00:06:55.766
还包含了标题简介

00:06:56.066 --> 00:06:57.766
以及它的公开范围

00:06:57.833 --> 00:06:59.400
还有上传对应的字幕

00:06:59.600 --> 00:07:01.200
以及上传缩略图

00:07:01.233 --> 00:07:03.500
还有选择对应的播放列表

00:07:03.700 --> 00:07:05.633
选择是否开启创收

00:07:05.766 --> 00:07:08.166
一系列的整个的操作过程

00:07:08.266 --> 00:07:08.766
在这里啊

00:07:08.766 --> 00:07:11.500
我首先在Codex的对话框里面

00:07:11.666 --> 00:07:14.200
先激活这个插件能力

00:07:14.400 --> 00:07:16.500
然后在这里面大概的描述

00:07:16.500 --> 00:07:18.366
一下我整个的任务过程

00:07:18.500 --> 00:07:19.700
我会做哪些操作

00:07:19.700 --> 00:07:21.266
我任务的目标是什么

00:07:21.400 --> 00:07:24.100
然后把任务描述发给Codex

00:07:24.266 --> 00:07:26.066
它在思考了一段时间之后

00:07:26.100 --> 00:07:28.333
会给你一个简短的回复

00:07:28.466 --> 00:07:30.333
然后它会自动的弹出

00:07:30.333 --> 00:07:32.366
一个录制的时间轴

00:07:32.733 --> 00:07:34.866
在这里这个红点的位置

00:07:34.866 --> 00:07:36.033
在录制的过程中

00:07:36.066 --> 00:07:36.966
按照官方的说明

00:07:37.000 --> 00:07:39.066
你需要整个的录制过程

00:07:39.266 --> 00:07:40.733
尽可能的干净

00:07:41.066 --> 00:07:43.233
不要造成一些额外的动作

00:07:43.333 --> 00:07:45.433
这样子你的整个的过程在

00:07:45.466 --> 00:07:48.400
抽取的过程中是清晰的干净的

00:07:48.400 --> 00:07:50.566
不会给到它过多的噪音

00:07:50.633 --> 00:07:53.966
也是保证你的整个的复刻能够成功

00:07:53.966 --> 00:07:56.400
当然在我的这个录制过程中

00:07:56.400 --> 00:07:58.233
我是希望去验收

00:07:58.233 --> 00:08:01.033
去测试它的能力到底有多强

00:08:01.066 --> 00:08:02.400
所以在这里其实我给

00:08:02.433 --> 00:08:03.933
它制造了一些噪音

00:08:04.000 --> 00:08:05.466
我有一些额外的

00:08:05.733 --> 00:08:07.433
不是完全线性的去

00:08:07.433 --> 00:08:08.933
整个操作整个过程

00:08:09.000 --> 00:08:11.300
首先我是打开我Youtube的后台

00:08:11.433 --> 00:08:13.400
点击上传视频

00:08:13.400 --> 00:08:15.400
在这里进入到对应的文件夹

00:08:15.533 --> 00:08:17.000
选择对应的视频

00:08:17.166 --> 00:08:18.933
在这里我把我自己的

00:08:19.000 --> 00:08:20.766
视频内容上传上去

00:08:20.866 --> 00:08:23.433
然后选择对应的操作列表

00:08:23.600 --> 00:08:26.900
然后再打开对应的一个文档把

00:08:26.933 --> 00:08:30.666
这里的发布包的MD文档里面的标题

00:08:30.866 --> 00:08:34.633
还有对应的简介都粘贴进去

00:08:34.700 --> 00:08:37.666
在这里我是开启了创收

00:08:37.700 --> 00:08:39.400
并且添加字幕

00:08:39.666 --> 00:08:41.700
字幕呢是SRT文档

00:08:41.866 --> 00:08:44.000
我整个操作完成之后

00:08:44.033 --> 00:08:46.700
在这里我就会点击暂停

00:08:46.733 --> 00:08:48.300
这个时候Codex在对话框

00:08:48.300 --> 00:08:50.066
里面就会收到一条消息

00:08:50.133 --> 00:08:51.633
我已经完成录制了

00:08:51.700 --> 00:08:52.900
这个时候就可以看到

00:08:52.900 --> 00:08:54.966
Codex实际上在思考

00:08:55.100 --> 00:08:57.066
它在抽取整个的你

00:08:57.066 --> 00:08:58.800
工作流的操作过程

00:08:58.866 --> 00:09:00.633
然后大概5分钟之后

00:09:00.633 --> 00:09:01.366
它就告诉我

00:09:01.433 --> 00:09:04.066
它把刚刚的那一个整个流程

00:09:04.166 --> 00:09:06.133
整理成了一个可以复用的skill

00:09:06.233 --> 00:09:07.933
而且它帮我自动命名了

00:09:08.000 --> 00:09:10.166
叫做Youtube studio folder upload

00:09:10.466 --> 00:09:11.566
这个技能我就可以

00:09:11.566 --> 00:09:13.266
去重复的去使用了

00:09:13.266 --> 00:09:15.200
这个时候你看我斜杠去

00:09:15.266 --> 00:09:16.866
调用这个关键词的时候

00:09:16.866 --> 00:09:19.400
我就发现这个技能我能够去使用了

00:09:19.500 --> 00:09:21.266
接着我就去验证一下

00:09:21.333 --> 00:09:23.400
这个能力能不能使用

00:09:23.433 --> 00:09:24.533
这里就不得不提到

00:09:24.533 --> 00:09:26.000
我给整个的任务是

00:09:26.000 --> 00:09:28.066
增加了一定的复杂性的

00:09:28.133 --> 00:09:30.466
我刚刚在封装这个skill的时候

00:09:30.500 --> 00:09:32.633
我使用的是这个文件夹

00:09:32.800 --> 00:09:35.233
它的文件夹目录大概是这样子的

00:09:35.566 --> 00:09:38.333
我核心存储的关键的视频文档

00:09:38.733 --> 00:09:41.166
MP4文件还有SRT文件在这里

00:09:41.433 --> 00:09:43.966
我对应的封面图我放在了

00:09:44.100 --> 00:09:46.233
IMAGE2 candidate这里的封面图

00:09:46.300 --> 00:09:48.100
当然这个封面图的结构啊

00:09:48.100 --> 00:09:49.000
包括整个文件夹的

00:09:49.033 --> 00:09:50.700
结构是Codex帮我搭的

00:09:50.733 --> 00:09:52.033
因为我每一次的任务

00:09:52.466 --> 00:09:54.300
整体上的工作流是相似的

00:09:54.300 --> 00:09:55.400
但是它还是每一次

00:09:55.400 --> 00:09:56.866
有一些具体的情况

00:09:56.966 --> 00:09:59.266
需要根据我的一些判断进行微调

00:09:59.300 --> 00:10:02.033
所以它的文件夹结构是这样子的

00:10:02.166 --> 00:10:04.666
它的这个缩略图是在这里的

00:10:04.733 --> 00:10:07.366
它的整个的标题简介发布的

00:10:07.433 --> 00:10:09.266
标签时间轴是这个文件夹

00:10:09.266 --> 00:10:10.366
MD文档在这里

00:10:10.566 --> 00:10:12.700
然后再看到我让它做的这个任务

00:10:12.866 --> 00:10:15.266
我等会让它上传的这个

00:10:15.266 --> 00:10:17.066
文件夹是这样的结构

00:10:17.066 --> 00:10:19.233
可以看到跟之前的这个

00:10:19.266 --> 00:10:20.633
项目文档是不一样的

00:10:20.800 --> 00:10:22.500
在这里我的这个视频

00:10:22.533 --> 00:10:24.833
文档是MP4这个文档和SRT

00:10:24.866 --> 00:10:25.933
其实这个倒是好识别

00:10:25.966 --> 00:10:27.900
因为它可以通过文件名

00:10:27.900 --> 00:10:29.366
加上文件类型去识别

00:10:29.533 --> 00:10:33.200
然后这里我的缩略图是放在了

00:10:33.200 --> 00:10:35.233
06发布的文件夹下的

00:10:35.333 --> 00:10:36.966
所以我的文件的分支

00:10:37.033 --> 00:10:39.233
跟上一个基本上不一样

00:10:39.233 --> 00:10:41.600
其实这里面是有一点小噪音的

00:10:41.600 --> 00:10:43.500
我们看一下它的复刻

00:10:43.533 --> 00:10:44.800
能力到了什么程度

00:10:44.900 --> 00:10:46.966
首先我把任务的指令发给他

00:10:47.066 --> 00:10:49.033
我唤醒这个技能

00:10:49.166 --> 00:10:50.366
然后我跟他说

00:10:50.766 --> 00:10:52.533
你在这个文件夹里面

00:10:52.566 --> 00:10:54.533
将这条视频及发布包

00:10:54.566 --> 00:10:56.433
的内容上传到Youtube

00:10:56.500 --> 00:10:57.700
不公开列出

00:10:57.800 --> 00:10:59.633
同步的它就开始运行了

00:10:59.800 --> 00:11:02.100
Codex上面会有它的整个的运行过程

00:11:02.166 --> 00:11:03.566
而你打开对应的界面

00:11:03.600 --> 00:11:05.100
它会有操作的路径

00:11:05.333 --> 00:11:06.833
它使用的是computer  use

00:11:06.966 --> 00:11:09.366
浏览器的集成和一些插件的能力

00:11:09.433 --> 00:11:12.033
在综合的应用在完成整个过程

00:11:12.033 --> 00:11:13.166
大家在这个过程中

00:11:13.166 --> 00:11:15.000
看到这个闪烁的光标

00:11:15.133 --> 00:11:17.566
实际上就是computer use在工作

00:11:17.766 --> 00:11:19.766
大家可以看到我最后上传的结果

00:11:20.166 --> 00:11:21.566
视频自然是不必说

00:11:21.566 --> 00:11:22.533
上传成功了

00:11:22.700 --> 00:11:24.700
标题还有对应的简介

00:11:24.866 --> 00:11:25.633
还有封面图

00:11:25.633 --> 00:11:28.733
这些基础的三大件都是上传完成了

00:11:28.900 --> 00:11:30.400
它把我的公开范围按照我

00:11:30.466 --> 00:11:32.566
的要求设定为不公开列出

00:11:32.566 --> 00:11:33.766
而且可以看到它的

00:11:33.833 --> 00:11:36.433
字幕是帮我成功上传了

00:11:36.566 --> 00:11:39.300
唯一有一点小的遗憾或者瑕疵

00:11:39.533 --> 00:11:42.666
是最后的这个片尾画面和

00:11:42.766 --> 00:11:44.766
最后的这个播放列表的选择

00:11:44.800 --> 00:11:47.066
它没有完全复刻我之前的操作

00:11:47.366 --> 00:11:49.000
也有可能是在这个过程中

00:11:49.033 --> 00:11:50.533
我同步的在操作

00:11:50.566 --> 00:11:52.066
电脑中间有一些影响

00:11:52.133 --> 00:11:53.666
而且我在这个过程中其实

00:11:53.700 --> 00:11:56.533
有很多偏噪音型的操作

00:11:56.566 --> 00:11:58.366
啊会影响它的整个的过程

00:11:58.366 --> 00:12:01.366
其实整个的路径是没有那么干净的

00:12:01.366 --> 00:12:03.800
而Openai它给出的官方的

00:12:03.800 --> 00:12:05.066
演示的案例的时候

00:12:05.200 --> 00:12:07.633
它给的东西是非常的干净的

00:12:07.700 --> 00:12:10.266
它不像我给一个整的项目文件夹

00:12:10.333 --> 00:12:13.100
里面包含了各种各样不同的文件

00:12:13.366 --> 00:12:15.833
它就直接把需要使用到的文件

00:12:16.300 --> 00:12:19.100
文档图片视频直接丢给Codex

00:12:19.100 --> 00:12:20.933
那个是比较清爽干净的

00:12:20.933 --> 00:12:21.800
这样的路径呢

00:12:21.833 --> 00:12:23.233
就更不容易出错

00:12:25.466 --> 00:12:26.933
我们再来看第二个任务

00:12:27.200 --> 00:12:29.933
第二个任务我设计的是让record and

00:12:29.933 --> 00:12:33.333
Replay的功能帮我去在剪映的这个

00:12:33.400 --> 00:12:36.166
APP里面去剪辑我的口播视频

00:12:36.266 --> 00:12:38.166
口播视频有个特点啊这里呢

00:12:38.166 --> 00:12:40.900
我也故意增加了一些噪音和难度

00:12:41.033 --> 00:12:42.966
我的录的这个视频里面

00:12:43.066 --> 00:12:45.066
整个的口播的片段

00:12:45.100 --> 00:12:47.333
它会有很多说的重复的话

00:12:47.433 --> 00:12:48.733
大家看到我在这个

00:12:48.733 --> 00:12:50.900
视频里面放了两段视频

00:12:51.100 --> 00:12:53.100
一段是我录制使用的视频

00:12:53.166 --> 00:12:55.200
一段是我测试使用的视频

00:12:55.300 --> 00:12:58.733
这两段视频录制所使用的是不同的

00:12:58.933 --> 00:13:00.633
我可以通过剪口播的方式

00:13:00.633 --> 00:13:02.733
大家看一下这个原始视频

00:13:02.733 --> 00:13:05.533
它是会有很多的需要剪掉的地方

00:13:05.633 --> 00:13:07.700
首先会有一些无关的文字

00:13:07.733 --> 00:13:09.233
比如说一开始会说开始录制

00:13:09.366 --> 00:13:12.666
然后会有很多的空白的无声的地方

00:13:12.800 --> 00:13:13.233
再比如

00:13:13.266 --> 00:13:15.166
我觉得这里就是比较难剪的地方

00:13:15.333 --> 00:13:16.133
就是我这里啊

00:13:16.133 --> 00:13:18.066
有可能有的地方嘴瓢了

00:13:18.433 --> 00:13:19.366
说的话会重复

00:13:19.400 --> 00:13:21.566
比如说你看这里会有另外另外一位

00:13:21.600 --> 00:13:23.833
这里我同样一句话说了好几遍

00:13:23.866 --> 00:13:25.700
那实际上只有最后这

00:13:25.733 --> 00:13:27.000
一遍是需要保留的

00:13:27.066 --> 00:13:29.566
那前面的都是需要删除的

00:13:29.566 --> 00:13:31.133
那么对于Codex来说

00:13:31.200 --> 00:13:33.966
它就需要去从全文去理解

00:13:34.000 --> 00:13:36.933
而不是说直接像剪口播这样

00:13:37.200 --> 00:13:39.333
把它相对机械性的

00:13:39.333 --> 00:13:40.366
它是以一个小的

00:13:40.400 --> 00:13:42.300
文段去理解整个文字

00:13:42.366 --> 00:13:44.166
而如果说你从整个的一

00:13:44.166 --> 00:13:45.633
长串视频去理解的话

00:13:45.800 --> 00:13:47.533
你要能理解到说诶

00:13:47.566 --> 00:13:48.700
像这样一段

00:13:48.733 --> 00:13:50.533
类似这样子的重复的

00:13:50.533 --> 00:13:51.833
说的不好的地方

00:13:51.866 --> 00:13:52.966
重复表达的地方

00:13:53.000 --> 00:13:55.633
是需要按照文义去删掉的

00:13:55.633 --> 00:13:58.800
那我需要他应用剪映APP的

00:13:58.933 --> 00:14:00.600
智能剪口播的功能

00:14:00.766 --> 00:14:03.266
基于口播中重复错误

00:14:03.433 --> 00:14:05.266
或者不合理的表达

00:14:05.300 --> 00:14:07.333
对它进行合理的删除

00:14:07.500 --> 00:14:10.433
而且我录制所使用的这段视频

00:14:10.600 --> 00:14:13.366
和我在测试的时候使用的视频

00:14:13.533 --> 00:14:15.566
它所错误的这种段落

00:14:15.633 --> 00:14:16.966
或者错误的表达

00:14:17.000 --> 00:14:19.233
或者这种重复的表达是不一样的

00:14:19.366 --> 00:14:22.233
他们没有直接的可复刻性

00:14:22.333 --> 00:14:23.633
这里面就需要他有

00:14:23.666 --> 00:14:25.266
一个自我的学习能力

00:14:25.333 --> 00:14:27.900
我们看一下Codex这个功能

00:14:27.900 --> 00:14:29.133
它的表现如何

00:14:29.466 --> 00:14:31.200
首先还是和第一个任务一样

00:14:31.300 --> 00:14:33.033
我把这个功能激活

00:14:33.066 --> 00:14:34.166
然后我跟他说了一下

00:14:34.200 --> 00:14:35.733
我大概需要做的事情

00:14:36.033 --> 00:14:38.533
就是我打算使用剪映剪口播

00:14:38.600 --> 00:14:41.400
视频的方式来智能剪口播

00:14:41.500 --> 00:14:43.600
希望它去理解整体的文稿

00:14:43.600 --> 00:14:46.000
把不连贯重复错误的地方删掉

00:14:46.033 --> 00:14:47.933
去掉停顿等等进行口播

00:14:48.033 --> 00:14:49.300
经过思考之后呢

00:14:49.366 --> 00:14:51.966
它也同时开启了录制的功能

00:14:52.066 --> 00:14:52.400
然后呢

00:14:52.400 --> 00:14:55.066
我就在这一段录制的视频里面

00:14:55.066 --> 00:14:57.233
开始按照逻辑去剪辑

00:14:57.500 --> 00:14:59.100
剪完之后停止录制

00:14:59.333 --> 00:15:01.066
它同样的收到了停止的指令

00:15:01.166 --> 00:15:02.266
它也开始思考了

00:15:02.333 --> 00:15:04.100
还是经过那三个步骤

00:15:04.266 --> 00:15:06.466
先把整个的事件流读完

00:15:06.533 --> 00:15:08.133
记录下来然后呢

00:15:08.133 --> 00:15:10.466
再把可以复用的部分抽取出来

00:15:10.466 --> 00:15:12.400
形成skill Creator的封装

00:15:12.566 --> 00:15:14.233
然后呢我新开了一个窗口

00:15:14.300 --> 00:15:16.200
我把他希望剪的这段

00:15:16.233 --> 00:15:17.766
视频的地址发给他

00:15:17.900 --> 00:15:19.100
然后激活这个skill

00:15:19.100 --> 00:15:19.700
我跟它说

00:15:19.733 --> 00:15:21.733
请使用剪映给我剪这个视频

00:15:21.866 --> 00:15:22.900
好它开始思考

00:15:22.900 --> 00:15:24.133
然后规划路径

00:15:24.200 --> 00:15:25.500
就开始工作了

00:15:25.500 --> 00:15:26.666
首先它像人一样

00:15:26.766 --> 00:15:29.833
先把这个视频导到整个的工作界面

00:15:30.000 --> 00:15:32.700
然后打开智能剪口播的能力

00:15:32.800 --> 00:15:34.600
这里面我觉得很惊喜的点就是它

00:15:34.600 --> 00:15:37.533
不仅在我刚刚讲的这个操作上面

00:15:37.633 --> 00:15:39.533
它还继续拓展了这个能力

00:15:39.533 --> 00:15:41.233
就之前其实我没有选择

00:15:41.300 --> 00:15:43.200
这个智能粗检的能力

00:15:43.200 --> 00:15:45.733
它这里把智能粗检的能力也打开了

00:15:45.833 --> 00:15:46.900
也在去尝试

00:15:46.900 --> 00:15:47.566
而且在最后

00:15:47.566 --> 00:15:50.433
它还会去帮我去做时间线

00:15:50.566 --> 00:15:51.433
去做校准

00:15:51.466 --> 00:15:55.033
而且帮我完成了整个视频的导出

00:15:55.100 --> 00:15:55.800
可以看到

00:15:55.900 --> 00:15:57.400
Codex的它的整个的

00:15:57.433 --> 00:15:59.400
工作过程的记录里面它会说

00:15:59.500 --> 00:16:00.600
里面有中间版

00:16:00.600 --> 00:16:01.400
还有最终版

00:16:01.466 --> 00:16:03.066
它不断的在校准

00:16:03.133 --> 00:16:05.000
而且中间它还自己给自己发命令

00:16:05.033 --> 00:16:07.166
不断的去做新的迭代

00:16:07.366 --> 00:16:09.500
大家现在看到的版本是

00:16:09.500 --> 00:16:11.666
剪映完成的整个的精简版

00:16:11.800 --> 00:16:13.033
就看这些文字

00:16:13.233 --> 00:16:17.933
所有的气口停顿重复全部都去掉了

00:16:17.933 --> 00:16:18.933
这里的文字和这个

00:16:18.933 --> 00:16:20.433
视频是一一对应的

00:16:20.500 --> 00:16:22.200
我就不给大家一个个去听了

00:16:22.200 --> 00:16:24.533
我给大家对比一下剪之前和

00:16:24.566 --> 00:16:26.633
剪之后这个文字稿的对比

00:16:26.666 --> 00:16:27.566
大家就清楚了

00:16:27.666 --> 00:16:28.400
大家看一下

00:16:28.400 --> 00:16:30.233
这是剪之前的文字稿

00:16:30.233 --> 00:16:31.033
我举个例子

00:16:31.200 --> 00:16:32.166
看到这个位置

00:16:32.766 --> 00:16:34.466
比如说你看这里呢

00:16:34.600 --> 00:16:35.700
剪映它这个剪口播

00:16:35.733 --> 00:16:36.933
它会自动识别哎

00:16:37.033 --> 00:16:38.700
这期视频这里是重复的

00:16:38.700 --> 00:16:39.500
因为它比较近

00:16:39.566 --> 00:16:41.700
它的语群的界定是比较近的

00:16:41.933 --> 00:16:43.033
但是你看

00:16:43.066 --> 00:16:44.800
我刚刚剪的那个地方吧

00:16:44.833 --> 00:16:45.900
这里是剪的很干净的

00:16:45.933 --> 00:16:47.766
现在先看一下剪之前

00:16:47.833 --> 00:16:49.933
这里有好几个这期视频这期视频

00:16:49.966 --> 00:16:50.333
这期视频

00:16:50.333 --> 00:16:52.233
这里明显是我嘴瓢了

00:16:52.300 --> 00:16:52.933
但实际上

00:16:52.966 --> 00:16:54.966
如果真的我们自己剪的话

00:16:55.000 --> 00:16:58.000
就会把前面这一节全部都剪掉

00:16:58.066 --> 00:16:59.900
只留下最后的这一段表达

00:16:59.966 --> 00:17:01.000
因为你看这句话

00:17:01.300 --> 00:17:02.000
和这句话

00:17:02.066 --> 00:17:04.500
它本质上虽然不完全一样

00:17:04.566 --> 00:17:05.400
但是实际上你看

00:17:05.400 --> 00:17:07.300
前面这句话说了一半断掉了

00:17:07.366 --> 00:17:09.533
但它想讲的意思和这句话一样

00:17:09.566 --> 00:17:12.133
对不对在剪口播这个智能识别里面

00:17:12.200 --> 00:17:13.700
它是没有识别出来的

00:17:13.733 --> 00:17:15.566
那每一次需要人肉去做

00:17:15.600 --> 00:17:16.800
我们回过头来再来

00:17:16.800 --> 00:17:18.600
看一下这个剪之后的

00:17:18.666 --> 00:17:20.933
你看也是中间这个部分

00:17:21.233 --> 00:17:24.133
这期视频这句话它没有前后的重复

00:17:24.166 --> 00:17:25.633
非常的干净

00:17:26.000 --> 00:17:28.866
前后的它都是连贯的一个状态

00:17:29.000 --> 00:17:30.666
而且我觉得很惊喜的是

00:17:30.733 --> 00:17:32.933
它启用了我之前在原来的

00:17:33.033 --> 00:17:35.600
工作流里面都没有用过的工具

00:17:35.700 --> 00:17:37.900
相当于它自我在发现

00:17:37.933 --> 00:17:40.366
这个剪映的GUI这个操作界面

00:17:40.633 --> 00:17:42.200
一些新的功能去

00:17:42.266 --> 00:17:44.100
结合它搜索到的信息

00:17:44.166 --> 00:17:46.033
加上实际操作的界面

00:17:46.166 --> 00:17:48.133
它可以比人在这个

00:17:48.166 --> 00:17:49.800
维度上面做得更好

00:17:49.833 --> 00:17:52.000
因为本质上这个工作就是

00:17:52.033 --> 00:17:54.000
纯粹数字世界里面的东西

00:17:54.433 --> 00:17:56.933
机器会比大部分的人都要做得好

00:17:56.933 --> 00:17:59.666
刚刚的两个任务用Codex的record

00:17:59.733 --> 00:18:02.233
and Replay完成得都还挺不错的

00:18:02.400 --> 00:18:03.500
虽然谈不上完美

00:18:03.500 --> 00:18:04.833
但是已经很不错了

00:18:04.833 --> 00:18:05.800
虽然有瑕疵

00:18:05.800 --> 00:18:07.333
但是我想强调的是

00:18:07.333 --> 00:18:08.466
在这个阶段

00:18:08.466 --> 00:18:10.466
最重要的并不是这个能力

00:18:10.466 --> 00:18:12.900
把这些任务完成得有多好

00:18:12.900 --> 00:18:15.800
而是Openai的Codex在通过

00:18:15.800 --> 00:18:18.066
这样的方式在吃数据

00:18:18.400 --> 00:18:19.866
它相当于把人

00:18:19.866 --> 00:18:21.933
特别是白领工作中

00:18:21.933 --> 00:18:24.466
和这种传统的GUI的图形

00:18:24.466 --> 00:18:27.066
操作界面的工作协同过程

00:18:27.066 --> 00:18:28.666
把它记录下来了

00:18:28.666 --> 00:18:31.400
把这个数据喂给了Codex

00:18:31.466 --> 00:18:35.100
相当于Openai不仅在吃传统的数据

00:18:35.300 --> 00:18:38.533
传统的数据包括文本的多模态的

00:18:38.533 --> 00:18:41.066
coding的这些数据已经不够他吃了

00:18:41.100 --> 00:18:43.266
现在他要把这些工作

00:18:43.266 --> 00:18:46.066
协同的数据全部抽象进去

00:18:46.233 --> 00:18:49.433
而这些内容之所以被录制下来

00:18:49.433 --> 00:18:51.000
就代表了这个工作

00:18:51.000 --> 00:18:52.600
它本身是有价值的

00:18:52.600 --> 00:18:54.833
而且它的频率特别高

00:18:54.833 --> 00:18:58.000
那么当数据量足够多的时候

00:18:58.000 --> 00:19:00.233
它就能够抽取出来对

00:19:00.233 --> 00:19:02.066
大部分人通用型的

00:19:02.066 --> 00:19:04.100
工作能力和接口方式

00:19:04.233 --> 00:19:06.733
数据本身就是有价值的

00:19:06.733 --> 00:19:10.300
要知道Openai全球的用户有10亿之多

00:19:10.300 --> 00:19:13.866
而Codex的周活用户有500万以上

00:19:13.866 --> 00:19:16.033
而且他们还在继续增长

00:19:16.033 --> 00:19:17.333
而且他们在用一种

00:19:17.633 --> 00:19:20.833
很变态的方式在继续增长用户

00:19:20.833 --> 00:19:22.133
大家如果注意到

00:19:22.166 --> 00:19:24.766
在Codex的左下角新增了一个

00:19:24.766 --> 00:19:26.966
拉一个好友就可以赠送

00:19:26.966 --> 00:19:29.166
一次你重置数据的方式

00:19:29.300 --> 00:19:30.233
这是一种

00:19:30.500 --> 00:19:32.033
我觉得很互联网味

00:19:32.033 --> 00:19:33.666
的这个拉新方式吧

00:19:33.666 --> 00:19:34.700
也不知道是哪个

00:19:34.700 --> 00:19:36.633
互联网鬼才给他出的主意

00:19:36.633 --> 00:19:39.133
之前大家知道的OpenAI

00:19:39.133 --> 00:19:40.766
搞的Sora的这个项目

00:19:40.766 --> 00:19:43.366
虽然Sora的APP现在应该是停摆了

00:19:43.366 --> 00:19:45.166
未来说不定有一天会重启

00:19:45.166 --> 00:19:47.066
那不可否认的是

00:19:47.400 --> 00:19:49.833
Sora它的用户的增长的速度和

00:19:49.833 --> 00:19:51.866
拉新的过程就是非常快的

00:19:51.933 --> 00:19:53.933
当时Sora增长的时候就是用

00:19:53.933 --> 00:19:56.233
了这个邀请码获得的机制

00:19:56.266 --> 00:19:58.233
而现在Codex的这个

00:19:58.233 --> 00:19:59.600
机制也非常的鬼才

00:19:59.600 --> 00:20:03.400
原来是100刀的用户有10X的这个额度

00:20:03.433 --> 00:20:05.166
现在呢直接降为5X

00:20:05.200 --> 00:20:07.066
然后剩下的这个额度呢

00:20:07.066 --> 00:20:09.133
他就可以运营随机分发呀

00:20:09.133 --> 00:20:10.733
他可以完全把它用

00:20:10.733 --> 00:20:12.666
在用户的拉新上面

00:20:12.666 --> 00:20:14.466
而且你拉新的用户越多

00:20:14.466 --> 00:20:16.366
你重置的次数就越多

00:20:16.366 --> 00:20:17.333
我只能说

00:20:17.533 --> 00:20:19.433
Openai的这个拉新啊

00:20:19.433 --> 00:20:21.033
用户增长这一块做的

00:20:21.033 --> 00:20:23.800
还是有一点鬼才在里面的

00:20:23.800 --> 00:20:25.000
说回来这个能力啊

00:20:25.033 --> 00:20:29.266
相当于Openai把越来越多的在白领

00:20:29.266 --> 00:20:31.966
世界里面有工作价值的这些工作

00:20:31.966 --> 00:20:35.166
内容全部都在抽象化和数字化了

00:20:35.533 --> 00:20:38.366
Openai整个的增长和迭代

00:20:38.366 --> 00:20:39.466
速度是非常恐怖的

00:20:39.466 --> 00:20:41.333
那未来下一步什么呢

00:20:41.366 --> 00:20:42.966
数字世界抽象完之后

00:20:42.966 --> 00:20:44.566
就会走到物理世界

00:20:44.600 --> 00:20:47.733
当然物理世界是相对难度更大一点

00:20:47.733 --> 00:20:50.966
因为它需要原子的组装和移动

00:20:51.066 --> 00:20:53.333
未来也不是没有可能

00:20:53.400 --> 00:20:56.800
不管你最近是否打算使用record and

00:20:56.800 --> 00:20:59.466
Replay这个能力去完成一些重复的

00:20:59.466 --> 00:21:01.366
工作帮你去封装skill

00:21:01.466 --> 00:21:03.533
我都建议你去体验

00:21:03.533 --> 00:21:05.333
一下这个插件能力

00:21:05.366 --> 00:21:07.500
看看它会不会给你带来像

00:21:07.500 --> 00:21:09.600
我一样后背发凉的体验

00:21:09.700 --> 00:21:13.466
如果说你本来把你的整个的工作流

00:21:13.500 --> 00:21:17.133
进行了充分的结构化和原子化的话

00:21:17.133 --> 00:21:18.866
那么这个能力出来之后

00:21:18.866 --> 00:21:20.866
它就可以帮你解决大问题

00:21:20.966 --> 00:21:23.700
原来你在组织整个的工作流的时候

00:21:23.700 --> 00:21:26.966
你会发现有一份工作它用MCP

00:21:27.066 --> 00:21:29.400
通过API或者通过插件的方式

00:21:29.400 --> 00:21:30.966
它不能够稳定的解决

00:21:31.000 --> 00:21:33.700
目前这个阶段仍然需要去

00:21:33.700 --> 00:21:35.300
借助一些图形化的界面

00:21:35.300 --> 00:21:36.700
完成整个的工作流

00:21:36.933 --> 00:21:39.666
而现在这个能力补全进来了

00:21:39.666 --> 00:21:41.166
它相当于把你整个

00:21:41.166 --> 00:21:43.166
的过程闭环起来了

00:21:43.166 --> 00:21:45.366
所以我觉得这个能力它

00:21:45.366 --> 00:21:47.166
的上线是非常重要的

00:21:47.166 --> 00:21:49.400
而且更重要的是让我看到

00:21:49.400 --> 00:21:51.800
了Openai不可限量的未来

00:21:51.800 --> 00:21:55.600
让我更加期待Openai在今年或者是在

00:21:55.600 --> 00:21:58.933
明年初的它的IPO的上线和到来

00:21:58.933 --> 00:21:59.866
关于这个能力

00:21:59.866 --> 00:22:01.166
你有什么想说的

00:22:01.200 --> 00:22:04.366
关于Openai未来的IPO和

00:22:04.366 --> 00:22:06.166
它未来的发展图景

00:22:06.166 --> 00:22:07.400
你有什么想聊的

00:22:07.566 --> 00:22:10.233
欢迎在评论区跟我互动和留言

00:22:10.333 --> 00:22:13.200
如果觉得我的频道有趣有料

00:22:13.266 --> 00:22:15.333
欢迎订阅我的频道灵姐说AI

00:22:15.333 --> 00:22:17.400
我们下期再见啦拜拜

