大家好欢迎来到灵姐说AI 这期视频给大家分享Codex最近上线 的一个我认为非常重要的新功能 叫做record and Replay 我刚刚用这个功能 完成了两个实测的任务 用完之后我的第一反应 是感觉有一点后背发凉 我觉得Openai在下一步非常大的棋 在这期视频里面 我会给大家去讲解一下这个功能 它的本质是什么 它会带来哪些影响 并且我会有两个实操项目 给大家去演示一下 这个record and Replay的能力 它的实际的效果到底怎么样并且啊 我觉得从这个功能可以管中窥豹 看出Openai的野心有多大 而且用了这个功能 我觉得你会对这家公司 的未来有更大的信心 这个功能呢 说起来挺简单的 就是你在Codex上面主动 的录制一次你的操作 然后它会自动的记住你整个过程 然后它通过思考把 它封装为一个skill 这个skill就沉淀了下来 下次你可以自动的复用 不过不好意思 这个功能现在也只支持macos Windows的用户不要抱怨 如果说你还没有买macos的电脑 我建议你现在立刻马上下单一台 因为库克已经警告了 未来苹果的产品还会继续涨价 因为它的上游的供应链 存储的价格还在继续上涨 至少在这个比较短的周期窗口里面 肯定是这样子的 这个功能不是传统的 这种宏录制的工具 它实际上是你演示一次 Codex主动的去观察你的操作 记录和电脑的运行记录 把你的整个的操作 过程抽象为一个SOP 形成一个skill 沉淀为一个可以复用的资产和能力 它整个的过程实际上就是三层 第一层就是record 观察你的记录 Codex会观察在这个workflow所 需要的动作和窗口内容 第二层是skill drafting 把操作抽象为skill 在录制结束之后 Codex会检查捕获到的workflow 并且草拟为一个skill 这个skill会说明什么时候使用 需要哪些输入 按什么步骤走 如何验证 第三层是Replay 用skill去指导这个agent再做一遍 你在新的线程里面给它新的变量 比如新的文件新的日期 新的标题新的环境等等 它会把skill当做可以复用的上下文 再结合当前环境里面的Computer Use插件 和浏览器的操作来完成整个任务 这个能力真的是Openai在 codex上面的重大更新 以前我们要去沉淀skill或者是驱动AI 我们需要写提示词 那么有一部分人他 没有这样的抽象能力 现在相当于它可以直接 根据你演示工作的操作过程 去把它抽象沉淀为一个skill 相当于普通人也可以 沉淀自动化的流程 只要你能够把这个事情做出来 我就能够记录record 然后把它再做一遍 而这个事情带来另外 一个方面的影响就是 即使你在一个工作岗位上 你不主动把自己的经验交出来 企业也可以通过观察你的工作流 把你的整个的操作过程给抽象出来 沉淀为skill 以前企业的整个的 工作流是SOP的文档 以后这些工作经验沉淀为skill 由agent来执行 人进行最后的把关 这和我之前讲的skill OPS 的路线也是一致的 岗位经验可以抽象 成为可复用的skill 然后人负责agent执行这个skill 最后的工作节点的检查 并且对最后的结果负责 而这些可复用的内容就会 沉淀为公司的skill资产库 可能有人又要谈到AI对 工作的影响和冲击 我想说确实是的啊 这个以后不管你交不交出你的经验 你的经验都会被AI抽象为skill 那么其实大部分白领的 工作都是在数字世界里面的 就没有在数字世界里面 AI抽象不出来的东西 无非是如何原子化和结构化 但是我想讲的是 如果说你的工作内容100% 能够被AI替代和抽象出来 和你的工作90%AI能够替你做 这是有本质的区别的 如果说你的工作能够100%的由AI完成 你的这个工作就会被抽象出来 沉淀为skill 最后被替代 但是如果说你的工作90%AI来完成的 agent完成的 但是最后的关键节点需要人的确认 需要这个human gate人的确认 你的这个工作仍然是 一个高价值的工作 那100%的替代和90%的替代 会产生0和1的差别 第三块大的影响就是UI型的软件 它会被极大的削弱 这个能力上线之后 实际上我的理解就是它在吃掉数据 就是你和这种UI型的软件的协同 包括你和这种GUI的这种桌面型 图形型的这种软件的操作的协同的 数据实际上是被抽象出来 被Codex整个的大的数据集吃掉 那么我们知道我们用AI操作的时候 用MCP用插件 用API接口 它的效率是更高的 而且能够批量高效的去产出 而且在这个阶段Codex Openai的官方也会建议大家对于能用 这种MCP能用接口去解决的问题 尽量不要用使用这样的方式 因为它会受到这个 图形界面各种方式的影响 不稳定性会比较强 关于record and Replay的能力到底如何 我在随后啊 再跟大家去结合我的实操案例 大家看完之后再去讲我的感受 可能大家会更加直观一点 首先我们找到这个功能 在Codex的界面 在左边点击这里的插件 然后搜索record and replay 好就点击这里 因为我这里已经连接过了 如果没有连接 在这里重新点一下连接就可以了 然后打开一个新的对话 只要斜杠输入这个插件record and Replay 跟它沟通就可以了 第一个任务 我们让record and Replay来复刻我们从 Youtube上传整个发布包的过程 这里的发布包不仅包含视频 还包含了标题简介 以及它的公开范围 还有上传对应的字幕 以及上传缩略图 还有选择对应的播放列表 选择是否开启创收 一系列的整个的操作过程 在这里啊 我首先在Codex的对话框里面 先激活这个插件能力 然后在这里面大概的描述 一下我整个的任务过程 我会做哪些操作 我任务的目标是什么 然后把任务描述发给Codex 它在思考了一段时间之后 会给你一个简短的回复 然后它会自动的弹出 一个录制的时间轴 在这里这个红点的位置 在录制的过程中 按照官方的说明 你需要整个的录制过程 尽可能的干净 不要造成一些额外的动作 这样子你的整个的过程在 抽取的过程中是清晰的干净的 不会给到它过多的噪音 也是保证你的整个的复刻能够成功 当然在我的这个录制过程中 我是希望去验收 去测试它的能力到底有多强 所以在这里其实我给 它制造了一些噪音 我有一些额外的 不是完全线性的去 整个操作整个过程 首先我是打开我Youtube的后台 点击上传视频 在这里进入到对应的文件夹 选择对应的视频 在这里我把我自己的 视频内容上传上去 然后选择对应的操作列表 然后再打开对应的一个文档把 这里的发布包的MD文档里面的标题 还有对应的简介都粘贴进去 在这里我是开启了创收 并且添加字幕 字幕呢是SRT文档 我整个操作完成之后 在这里我就会点击暂停 这个时候Codex在对话框 里面就会收到一条消息 我已经完成录制了 这个时候就可以看到 Codex实际上在思考 它在抽取整个的你 工作流的操作过程 然后大概5分钟之后 它就告诉我 它把刚刚的那一个整个流程 整理成了一个可以复用的skill 而且它帮我自动命名了 叫做Youtube studio folder upload 这个技能我就可以 去重复的去使用了 这个时候你看我斜杠去 调用这个关键词的时候 我就发现这个技能我能够去使用了 接着我就去验证一下 这个能力能不能使用 这里就不得不提到 我给整个的任务是 增加了一定的复杂性的 我刚刚在封装这个skill的时候 我使用的是这个文件夹 它的文件夹目录大概是这样子的 我核心存储的关键的视频文档 MP4文件还有SRT文件在这里 我对应的封面图我放在了 IMAGE2 candidate这里的封面图 当然这个封面图的结构啊 包括整个文件夹的 结构是Codex帮我搭的 因为我每一次的任务 整体上的工作流是相似的 但是它还是每一次 有一些具体的情况 需要根据我的一些判断进行微调 所以它的文件夹结构是这样子的 它的这个缩略图是在这里的 它的整个的标题简介发布的 标签时间轴是这个文件夹 MD文档在这里 然后再看到我让它做的这个任务 我等会让它上传的这个 文件夹是这样的结构 可以看到跟之前的这个 项目文档是不一样的 在这里我的这个视频 文档是MP4这个文档和SRT 其实这个倒是好识别 因为它可以通过文件名 加上文件类型去识别 然后这里我的缩略图是放在了 06发布的文件夹下的 所以我的文件的分支 跟上一个基本上不一样 其实这里面是有一点小噪音的 我们看一下它的复刻 能力到了什么程度 首先我把任务的指令发给他 我唤醒这个技能 然后我跟他说 你在这个文件夹里面 将这条视频及发布包 的内容上传到Youtube 不公开列出 同步的它就开始运行了 Codex上面会有它的整个的运行过程 而你打开对应的界面 它会有操作的路径 它使用的是computer use 浏览器的集成和一些插件的能力 在综合的应用在完成整个过程 大家在这个过程中 看到这个闪烁的光标 实际上就是computer use在工作 大家可以看到我最后上传的结果 视频自然是不必说 上传成功了 标题还有对应的简介 还有封面图 这些基础的三大件都是上传完成了 它把我的公开范围按照我 的要求设定为不公开列出 而且可以看到它的 字幕是帮我成功上传了 唯一有一点小的遗憾或者瑕疵 是最后的这个片尾画面和 最后的这个播放列表的选择 它没有完全复刻我之前的操作 也有可能是在这个过程中 我同步的在操作 电脑中间有一些影响 而且我在这个过程中其实 有很多偏噪音型的操作 啊会影响它的整个的过程 其实整个的路径是没有那么干净的 而Openai它给出的官方的 演示的案例的时候 它给的东西是非常的干净的 它不像我给一个整的项目文件夹 里面包含了各种各样不同的文件 它就直接把需要使用到的文件 文档图片视频直接丢给Codex 那个是比较清爽干净的 这样的路径呢 就更不容易出错 我们再来看第二个任务 第二个任务我设计的是让record and Replay的功能帮我去在剪映的这个 APP里面去剪辑我的口播视频 口播视频有个特点啊这里呢 我也故意增加了一些噪音和难度 我的录的这个视频里面 整个的口播的片段 它会有很多说的重复的话 大家看到我在这个 视频里面放了两段视频 一段是我录制使用的视频 一段是我测试使用的视频 这两段视频录制所使用的是不同的 我可以通过剪口播的方式 大家看一下这个原始视频 它是会有很多的需要剪掉的地方 首先会有一些无关的文字 比如说一开始会说开始录制 然后会有很多的空白的无声的地方 再比如 我觉得这里就是比较难剪的地方 就是我这里啊 有可能有的地方嘴瓢了 说的话会重复 比如说你看这里会有另外另外一位 这里我同样一句话说了好几遍 那实际上只有最后这 一遍是需要保留的 那前面的都是需要删除的 那么对于Codex来说 它就需要去从全文去理解 而不是说直接像剪口播这样 把它相对机械性的 它是以一个小的 文段去理解整个文字 而如果说你从整个的一 长串视频去理解的话 你要能理解到说诶 像这样一段 类似这样子的重复的 说的不好的地方 重复表达的地方 是需要按照文义去删掉的 那我需要他应用剪映APP的 智能剪口播的功能 基于口播中重复错误 或者不合理的表达 对它进行合理的删除 而且我录制所使用的这段视频 和我在测试的时候使用的视频 它所错误的这种段落 或者错误的表达 或者这种重复的表达是不一样的 他们没有直接的可复刻性 这里面就需要他有 一个自我的学习能力 我们看一下Codex这个功能 它的表现如何 首先还是和第一个任务一样 我把这个功能激活 然后我跟他说了一下 我大概需要做的事情 就是我打算使用剪映剪口播 视频的方式来智能剪口播 希望它去理解整体的文稿 把不连贯重复错误的地方删掉 去掉停顿等等进行口播 经过思考之后呢 它也同时开启了录制的功能 然后呢 我就在这一段录制的视频里面 开始按照逻辑去剪辑 剪完之后停止录制 它同样的收到了停止的指令 它也开始思考了 还是经过那三个步骤 先把整个的事件流读完 记录下来然后呢 再把可以复用的部分抽取出来 形成skill Creator的封装 然后呢我新开了一个窗口 我把他希望剪的这段 视频的地址发给他 然后激活这个skill 我跟它说 请使用剪映给我剪这个视频 好它开始思考 然后规划路径 就开始工作了 首先它像人一样 先把这个视频导到整个的工作界面 然后打开智能剪口播的能力 这里面我觉得很惊喜的点就是它 不仅在我刚刚讲的这个操作上面 它还继续拓展了这个能力 就之前其实我没有选择 这个智能粗检的能力 它这里把智能粗检的能力也打开了 也在去尝试 而且在最后 它还会去帮我去做时间线 去做校准 而且帮我完成了整个视频的导出 可以看到 Codex的它的整个的 工作过程的记录里面它会说 里面有中间版 还有最终版 它不断的在校准 而且中间它还自己给自己发命令 不断的去做新的迭代 大家现在看到的版本是 剪映完成的整个的精简版 就看这些文字 所有的气口停顿重复全部都去掉了 这里的文字和这个 视频是一一对应的 我就不给大家一个个去听了 我给大家对比一下剪之前和 剪之后这个文字稿的对比 大家就清楚了 大家看一下 这是剪之前的文字稿 我举个例子 看到这个位置 比如说你看这里呢 剪映它这个剪口播 它会自动识别哎 这期视频这里是重复的 因为它比较近 它的语群的界定是比较近的 但是你看 我刚刚剪的那个地方吧 这里是剪的很干净的 现在先看一下剪之前 这里有好几个这期视频这期视频 这期视频 这里明显是我嘴瓢了 但实际上 如果真的我们自己剪的话 就会把前面这一节全部都剪掉 只留下最后的这一段表达 因为你看这句话 和这句话 它本质上虽然不完全一样 但是实际上你看 前面这句话说了一半断掉了 但它想讲的意思和这句话一样 对不对在剪口播这个智能识别里面 它是没有识别出来的 那每一次需要人肉去做 我们回过头来再来 看一下这个剪之后的 你看也是中间这个部分 这期视频这句话它没有前后的重复 非常的干净 前后的它都是连贯的一个状态 而且我觉得很惊喜的是 它启用了我之前在原来的 工作流里面都没有用过的工具 相当于它自我在发现 这个剪映的GUI这个操作界面 一些新的功能去 结合它搜索到的信息 加上实际操作的界面 它可以比人在这个 维度上面做得更好 因为本质上这个工作就是 纯粹数字世界里面的东西 机器会比大部分的人都要做得好 刚刚的两个任务用Codex的record and Replay完成得都还挺不错的 虽然谈不上完美 但是已经很不错了 虽然有瑕疵 但是我想强调的是 在这个阶段 最重要的并不是这个能力 把这些任务完成得有多好 而是Openai的Codex在通过 这样的方式在吃数据 它相当于把人 特别是白领工作中 和这种传统的GUI的图形 操作界面的工作协同过程 把它记录下来了 把这个数据喂给了Codex 相当于Openai不仅在吃传统的数据 传统的数据包括文本的多模态的 coding的这些数据已经不够他吃了 现在他要把这些工作 协同的数据全部抽象进去 而这些内容之所以被录制下来 就代表了这个工作 它本身是有价值的 而且它的频率特别高 那么当数据量足够多的时候 它就能够抽取出来对 大部分人通用型的 工作能力和接口方式 数据本身就是有价值的 要知道Openai全球的用户有10亿之多 而Codex的周活用户有500万以上 而且他们还在继续增长 而且他们在用一种 很变态的方式在继续增长用户 大家如果注意到 在Codex的左下角新增了一个 拉一个好友就可以赠送 一次你重置数据的方式 这是一种 我觉得很互联网味 的这个拉新方式吧 也不知道是哪个 互联网鬼才给他出的主意 之前大家知道的OpenAI 搞的Sora的这个项目 虽然Sora的APP现在应该是停摆了 未来说不定有一天会重启 那不可否认的是 Sora它的用户的增长的速度和 拉新的过程就是非常快的 当时Sora增长的时候就是用 了这个邀请码获得的机制 而现在Codex的这个 机制也非常的鬼才 原来是100刀的用户有10X的这个额度 现在呢直接降为5X 然后剩下的这个额度呢 他就可以运营随机分发呀 他可以完全把它用 在用户的拉新上面 而且你拉新的用户越多 你重置的次数就越多 我只能说 Openai的这个拉新啊 用户增长这一块做的 还是有一点鬼才在里面的 说回来这个能力啊 相当于Openai把越来越多的在白领 世界里面有工作价值的这些工作 内容全部都在抽象化和数字化了 Openai整个的增长和迭代 速度是非常恐怖的 那未来下一步什么呢 数字世界抽象完之后 就会走到物理世界 当然物理世界是相对难度更大一点 因为它需要原子的组装和移动 未来也不是没有可能 不管你最近是否打算使用record and Replay这个能力去完成一些重复的 工作帮你去封装skill 我都建议你去体验 一下这个插件能力 看看它会不会给你带来像 我一样后背发凉的体验 如果说你本来把你的整个的工作流 进行了充分的结构化和原子化的话 那么这个能力出来之后 它就可以帮你解决大问题 原来你在组织整个的工作流的时候 你会发现有一份工作它用MCP 通过API或者通过插件的方式 它不能够稳定的解决 目前这个阶段仍然需要去 借助一些图形化的界面 完成整个的工作流 而现在这个能力补全进来了 它相当于把你整个 的过程闭环起来了 所以我觉得这个能力它 的上线是非常重要的 而且更重要的是让我看到 了Openai不可限量的未来 让我更加期待Openai在今年或者是在 明年初的它的IPO的上线和到来 关于这个能力 你有什么想说的 关于Openai未来的IPO和 它未来的发展图景 你有什么想聊的 欢迎在评论区跟我互动和留言 如果觉得我的频道有趣有料 欢迎订阅我的频道灵姐说AI 我们下期再见啦拜拜