20260622-07 | 演示一次,AI就能复刻工作流?我实测 Codex Record & Replay
來源:Youtube | 建立:2026-06-22T14:47:08 | HTML:2026-06-22T14:49:12
開啟原始影片 note.md transcript.txt transcript.vtt

影片筆記:演示一次,AI就能复刻工作流?我实测 Codex Record & Replay

YouTube 影片框會固定在左上方;點擊右側逐字稿時間戳可跳到對應時間。

一句話總結

OpenAI Codex 推出「Record and Replay」功能,透過錄製 GUI 操作並抽象為可複用的 Skill,實現工作流的自動化重播;實測顯示其能處理 YouTube 發布與剪映剪輯等複雜任務,但受環境干擾影響穩定性,同時該功能也是 OpenAI 蒐集協同數據與進行病毒式拉新的戰略工具。

核心重點

功能本質:Record and Replay 並非傳統宏錄製,而是將人類操作抽象化為 Skill(技能/資產),形成可複用的 SOP(標準作業程序)。

運作機制

實測結果

工作替代界線

OpenAI 戰略

限制與建議:目前僅支援 macOS;官方建議能用 MCP 或接口解決的問題,盡量不要使用 GUI 方式,因 GUI 操作受圖形界面影響不穩定性較強。

詳細大綱

一、功能介紹與核心概念

二、對工作與企業的潛在影響

三、對 UI/GUI 型軟體的影響

四、實測案例演示

#### 案例一:YouTube 發布流程自動化

#### 案例二:剪映(Jianying)口播剪輯

五、OpenAI 的戰略野心與增長策略

工具 / 模型 / 名詞整理

操作流程整理

通用流程

Record(錄製):使用者在 Codex 上主動錄製一次操作過程,Codex 觀察並記錄動作與視窗內容。

Skill Drafting(技能草擬):Codex 將錄製的 Workflow 抽象化為 Skill,說明使用時機、輸入、步驟及驗證方式。

Replay(重播):在新環境中,利用該 Skill 結合 Computer Use 插件與瀏覽器操作,自動完成任務。

案例一:YouTube 發布流程

準備素材:影片檔案、標題/簡介 MD 文檔、SRT 字幕檔案、縮略圖、播放列表資訊。

錄製階段:

生成 Skill:系統生成名為 Youtube studio folder upload 的 Skill。

重播階段:

案例二:剪映口播剪輯

準備素材:包含錯誤、停頓、重複內容的原始視頻。

錄製階段:

生成 Skill:系統學習處理流程。

重播階段:

值得注意的限制或風險

平台限制:目前 Record and Replay 功能僅支援 macOS,Windows 用戶無法使用。

穩定性問題:GUI 操作受圖形界面影響,不穩定性較強。若錄製時存在「噪音」(如非線性操作、額外動作、文件結構不清晰),重播時容易出現瑕疵(如未復刻片尾畫面或播放列表選擇)。

替代風險

數據隱私與資產歸屬:企業可透過觀察工作流將操作抽象為 Skill 並沉澱為公司資產庫,這可能改變員工經驗分享的動力與企業對員工操作的監控方式。

逐字稿辨識疑點

可延伸追問

Record and Replay 生成的 Skill 在不同版本的軟體介面(UI 更新)中是否仍能保持穩定?

OpenAI 如何處理錄製過程中產生的敏感數據(如個人隱私、商業機密)?

對於非 macOS 用戶,是否有替代方案或未來支援 Windows 的計畫?

「智能粗檢」等 Agent 自我發現的功能,其背後的邏輯是基於預設規則還是動態學習?

企業如何評估將現有 SOP 轉換為 Skill 的成本與收益?

逐字稿時間軸

右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。

00:00:00.100 → 00:00:02.100
大家好欢迎来到灵姐说AI
00:00:02.133 → 00:00:05.266
这期视频给大家分享Codex最近上线
00:00:05.266 → 00:00:08.366
的一个我认为非常重要的新功能
00:00:08.366 → 00:00:10.933
叫做record and Replay
00:00:11.066 → 00:00:12.766
我刚刚用这个功能
00:00:12.866 → 00:00:15.000
完成了两个实测的任务
00:00:15.300 → 00:00:16.866
用完之后我的第一反应
00:00:16.866 → 00:00:19.533
是感觉有一点后背发凉
00:00:19.533 → 00:00:22.566
我觉得Openai在下一步非常大的棋
00:00:22.966 → 00:00:23.900
在这期视频里面
00:00:23.900 → 00:00:26.566
我会给大家去讲解一下这个功能
00:00:26.566 → 00:00:27.866
它的本质是什么
00:00:27.866 → 00:00:29.366
它会带来哪些影响
00:00:29.400 → 00:00:31.533
并且我会有两个实操项目
00:00:31.533 → 00:00:33.133
给大家去演示一下
00:00:33.166 → 00:00:35.766
这个record and Replay的能力
00:00:35.766 → 00:00:38.800
它的实际的效果到底怎么样并且啊
00:00:38.800 → 00:00:42.366
我觉得从这个功能可以管中窥豹
00:00:42.700 → 00:00:45.666
看出Openai的野心有多大
00:00:45.666 → 00:00:46.966
而且用了这个功能
00:00:46.966 → 00:00:48.700
我觉得你会对这家公司
00:00:48.700 → 00:00:50.800
的未来有更大的信心
00:00:51.500 → 00:00:52.766
说起来挺简单的
00:00:52.766 → 00:00:55.366
就是你在Codex上面主动
00:00:55.366 → 00:00:57.466
的录制一次你的操作
00:00:57.500 → 00:01:00.866
然后它会自动的记住你整个过程
00:01:00.933 → 00:01:02.466
然后它通过思考把
00:01:02.466 → 00:01:03.933
它封装为一个skill
00:01:04.100 → 00:01:05.733
这个skill就沉淀了下来
00:01:05.733 → 00:01:08.333
下次你可以自动的复用
00:01:08.333 → 00:01:09.500
不过不好意思
00:01:09.600 → 00:01:13.166
这个功能现在也只支持macos
00:01:13.366 → 00:01:15.133
Windows的用户不要抱怨
00:01:15.366 → 00:01:17.800
如果说你还没有买macos的电脑
00:01:17.800 → 00:01:21.866
我建议你现在立刻马上下单一台
00:01:21.900 → 00:01:23.700
因为库克已经警告了
00:01:23.700 → 00:01:26.600
未来苹果的产品还会继续涨价
00:01:26.666 → 00:01:28.666
因为它的上游的供应链
00:01:28.700 → 00:01:31.100
存储的价格还在继续上涨
00:01:31.366 → 00:01:34.366
至少在这个比较短的周期窗口里面
00:01:34.366 → 00:01:35.500
肯定是这样子的
00:01:35.500 → 00:01:37.400
这个功能不是传统的
00:01:37.400 → 00:01:39.300
这种宏录制的工具
00:01:39.333 → 00:01:42.066
它实际上是你演示一次
00:01:42.200 → 00:01:45.166
Codex主动的去观察你的操作
00:01:45.166 → 00:01:47.533
记录和电脑的运行记录
00:01:47.566 → 00:01:49.333
把你的整个的操作
00:01:49.333 → 00:01:52.000
过程抽象为一个SOP
00:01:52.100 → 00:01:53.466
形成一个skill
00:01:53.700 → 00:01:57.066
沉淀为一个可以复用的资产和能力
00:01:57.066 → 00:01:59.633
它整个的过程实际上就是三层
00:01:59.700 → 00:02:01.533
第一层就是record
00:02:01.533 → 00:02:02.666
观察你的记录
00:02:02.766 → 00:02:05.566
Codex会观察在这个workflow所
00:02:05.566 → 00:02:07.866
需要的动作和窗口内容
00:02:07.866 → 00:02:09.900
第二层是skill drafting
00:02:09.966 → 00:02:11.800
把操作抽象为skill
00:02:11.866 → 00:02:13.500
在录制结束之后
00:02:13.500 → 00:02:16.366
Codex会检查捕获到的workflow
00:02:16.400 → 00:02:18.300
并且草拟为一个skill
00:02:18.333 → 00:02:20.566
这个skill会说明什么时候使用
00:02:20.800 → 00:02:21.700
需要哪些输入
00:02:21.700 → 00:02:22.900
按什么步骤走
00:02:24.066 → 00:02:26.066
第三层是Replay
00:02:26.200 → 00:02:29.333
用skill去指导这个agent再做一遍
00:02:29.333 → 00:02:32.266
你在新的线程里面给它新的变量
00:02:32.266 → 00:02:34.600
比如新的文件新的日期
00:02:34.700 → 00:02:36.866
新的标题新的环境等等
00:02:36.866 → 00:02:40.300
它会把skill当做可以复用的上下文
00:02:40.333 → 00:02:44.533
再结合当前环境里面的Computer Use插件
00:02:44.533 → 00:02:47.400
和浏览器的操作来完成整个任务
00:02:47.433 → 00:02:49.133
这个能力真的是Openai在
00:02:49.133 → 00:02:51.000
codex上面的重大更新
00:02:51.066 → 00:02:54.533
以前我们要去沉淀skill或者是驱动AI
00:02:54.533 → 00:02:56.066
我们需要写提示词
00:02:56.100 → 00:02:57.733
那么有一部分人他
00:02:57.733 → 00:02:59.300
没有这样的抽象能力
00:02:59.600 → 00:03:01.800
现在相当于它可以直接
00:03:01.800 → 00:03:05.000
根据你演示工作的操作过程
00:03:05.033 → 00:03:07.566
去把它抽象沉淀为一个skill
00:03:07.600 → 00:03:09.900
相当于普通人也可以
00:03:09.900 → 00:03:11.700
沉淀自动化的流程
00:03:11.866 → 00:03:14.833
只要你能够把这个事情做出来
00:03:14.833 → 00:03:16.833
我就能够记录record
00:03:16.900 → 00:03:19.100
然后把它再做一遍
00:03:19.200 → 00:03:20.500
而这个事情带来另外
00:03:20.500 → 00:03:21.900
一个方面的影响就是
00:03:21.900 → 00:03:23.600
即使你在一个工作岗位上
00:03:23.600 → 00:03:26.233
你不主动把自己的经验交出来
00:03:26.300 → 00:03:29.933
企业也可以通过观察你的工作流
00:03:30.000 → 00:03:33.633
把你的整个的操作过程给抽象出来
00:03:34.566 → 00:03:36.133
以前企业的整个的
00:03:36.133 → 00:03:37.800
工作流是SOP的文档
00:03:37.800 → 00:03:40.433
以后这些工作经验沉淀为skill
00:03:40.533 → 00:03:42.433
由agent来执行
00:03:42.466 → 00:03:44.633
人进行最后的把关
00:03:44.633 → 00:03:46.900
这和我之前讲的skill OPS
00:03:47.100 → 00:03:48.933
的路线也是一致的
00:03:48.933 → 00:03:50.766
岗位经验可以抽象
00:03:50.766 → 00:03:52.500
成为可复用的skill
00:03:52.666 → 00:03:56.133
然后人负责agent执行这个skill
00:03:56.133 → 00:03:58.633
最后的工作节点的检查
00:03:58.666 → 00:04:01.000
并且对最后的结果负责
00:04:01.000 → 00:04:03.533
而这些可复用的内容就会
00:04:03.533 → 00:04:06.033
沉淀为公司的skill资产库
00:04:06.033 → 00:04:08.366
可能有人又要谈到AI对
00:04:08.366 → 00:04:09.666
工作的影响和冲击
00:04:09.666 → 00:04:11.966
我想说确实是的啊
00:04:12.066 → 00:04:15.333
这个以后不管你交不交出你的经验
00:04:15.433 → 00:04:18.833
你的经验都会被AI抽象为skill
00:04:19.033 → 00:04:21.266
那么其实大部分白领的
00:04:21.266 → 00:04:23.533
工作都是在数字世界里面的
00:04:23.533 → 00:04:26.300
就没有在数字世界里面
00:04:26.333 → 00:04:28.533
AI抽象不出来的东西
00:04:28.633 → 00:04:31.700
无非是如何原子化和结构化
00:04:31.700 → 00:04:32.933
但是我想讲的是
00:04:33.166 → 00:04:36.966
如果说你的工作内容100%
00:04:37.066 → 00:04:39.733
能够被AI替代和抽象出来
00:04:39.933 → 00:04:43.933
和你的工作90%AI能够替你做
00:04:43.933 → 00:04:45.766
这是有本质的区别的
00:04:45.766 → 00:04:49.533
如果说你的工作能够100%的由AI完成
00:04:49.533 → 00:04:52.300
你的这个工作就会被抽象出来
00:04:54.266 → 00:04:59.300
但是如果说你的工作90%AI来完成的
00:05:00.466 → 00:05:04.233
但是最后的关键节点需要人的确认
00:05:04.233 → 00:05:06.466
需要这个human gate人的确认
00:05:06.500 → 00:05:08.366
你的这个工作仍然是
00:05:08.366 → 00:05:09.833
一个高价值的工作
00:05:10.100 → 00:05:13.833
那100%的替代和90%的替代
00:05:13.866 → 00:05:16.666
会产生0和1的差别
00:05:16.666 → 00:05:20.300
第三块大的影响就是UI型的软件
00:05:20.333 → 00:05:22.166
它会被极大的削弱
00:05:22.166 → 00:05:23.666
这个能力上线之后
00:05:23.666 → 00:05:27.200
实际上我的理解就是它在吃掉数据
00:05:27.266 → 00:05:31.600
就是你和这种UI型的软件的协同
00:05:31.666 → 00:05:35.000
包括你和这种GUI的这种桌面型
00:05:35.000 → 00:05:38.133
图形型的这种软件的操作的协同的
00:05:38.133 → 00:05:40.600
数据实际上是被抽象出来
00:05:40.800 → 00:05:44.000
被Codex整个的大的数据集吃掉
00:05:44.000 → 00:05:47.000
那么我们知道我们用AI操作的时候
00:05:50.066 → 00:05:51.833
它的效率是更高的
00:05:51.833 → 00:05:54.766
而且能够批量高效的去产出
00:05:54.800 → 00:05:57.133
而且在这个阶段Codex
00:05:57.133 → 00:06:00.333
Openai的官方也会建议大家对于能用
00:06:00.533 → 00:06:03.233
这种MCP能用接口去解决的问题
00:06:03.233 → 00:06:05.400
尽量不要用使用这样的方式
00:06:05.400 → 00:06:07.000
因为它会受到这个
00:06:07.000 → 00:06:09.133
图形界面各种方式的影响
00:06:09.133 → 00:06:10.766
不稳定性会比较强
00:06:10.766 → 00:06:12.966
关于record and Replay的能力到底如何
00:06:13.933 → 00:06:15.800
再跟大家去结合我的实操案例
00:06:15.800 → 00:06:18.000
大家看完之后再去讲我的感受
00:06:18.000 → 00:06:20.133
可能大家会更加直观一点
00:06:20.133 → 00:06:21.633
首先我们找到这个功能
00:06:21.633 → 00:06:23.133
在Codex的界面
00:06:23.133 → 00:06:25.566
在左边点击这里的插件
00:06:25.700 → 00:06:28.066
然后搜索record and replay
00:06:28.200 → 00:06:29.666
好就点击这里
00:06:29.666 → 00:06:31.066
因为我这里已经连接过了
00:06:31.066 → 00:06:31.833
如果没有连接
00:06:31.833 → 00:06:34.100
在这里重新点一下连接就可以了
00:06:34.100 → 00:06:36.000
然后打开一个新的对话
00:06:36.033 → 00:06:40.233
只要斜杠输入这个插件record and Replay
00:06:40.300 → 00:06:41.966
跟它沟通就可以了
00:06:44.900 → 00:06:47.900
我们让record and Replay来复刻我们从
00:06:47.933 → 00:06:50.533
Youtube上传整个发布包的过程
00:06:50.733 → 00:06:53.266
这里的发布包不仅包含视频
00:06:53.466 → 00:06:55.766
还包含了标题简介
00:06:56.066 → 00:06:57.766
以及它的公开范围
00:06:57.833 → 00:06:59.400
还有上传对应的字幕
00:06:59.600 → 00:07:01.200
以及上传缩略图
00:07:01.233 → 00:07:03.500
还有选择对应的播放列表
00:07:03.700 → 00:07:05.633
选择是否开启创收
00:07:05.766 → 00:07:08.166
一系列的整个的操作过程
00:07:08.766 → 00:07:11.500
我首先在Codex的对话框里面
00:07:11.666 → 00:07:14.200
先激活这个插件能力
00:07:14.400 → 00:07:16.500
然后在这里面大概的描述
00:07:16.500 → 00:07:18.366
一下我整个的任务过程
00:07:18.500 → 00:07:19.700
我会做哪些操作
00:07:19.700 → 00:07:21.266
我任务的目标是什么
00:07:21.400 → 00:07:24.100
然后把任务描述发给Codex
00:07:24.266 → 00:07:26.066
它在思考了一段时间之后
00:07:26.100 → 00:07:28.333
会给你一个简短的回复
00:07:28.466 → 00:07:30.333
然后它会自动的弹出
00:07:30.333 → 00:07:32.366
一个录制的时间轴
00:07:32.733 → 00:07:34.866
在这里这个红点的位置
00:07:34.866 → 00:07:36.033
在录制的过程中
00:07:36.066 → 00:07:36.966
按照官方的说明
00:07:37.000 → 00:07:39.066
你需要整个的录制过程
00:07:39.266 → 00:07:40.733
尽可能的干净
00:07:41.066 → 00:07:43.233
不要造成一些额外的动作
00:07:43.333 → 00:07:45.433
这样子你的整个的过程在
00:07:45.466 → 00:07:48.400
抽取的过程中是清晰的干净的
00:07:48.400 → 00:07:50.566
不会给到它过多的噪音
00:07:50.633 → 00:07:53.966
也是保证你的整个的复刻能够成功
00:07:53.966 → 00:07:56.400
当然在我的这个录制过程中
00:07:56.400 → 00:07:58.233
我是希望去验收
00:07:58.233 → 00:08:01.033
去测试它的能力到底有多强
00:08:01.066 → 00:08:02.400
所以在这里其实我给
00:08:02.433 → 00:08:03.933
它制造了一些噪音
00:08:04.000 → 00:08:05.466
我有一些额外的
00:08:05.733 → 00:08:07.433
不是完全线性的去
00:08:07.433 → 00:08:08.933
整个操作整个过程
00:08:09.000 → 00:08:11.300
首先我是打开我Youtube的后台
00:08:11.433 → 00:08:13.400
点击上传视频
00:08:13.400 → 00:08:15.400
在这里进入到对应的文件夹
00:08:15.533 → 00:08:17.000
选择对应的视频
00:08:17.166 → 00:08:18.933
在这里我把我自己的
00:08:19.000 → 00:08:20.766
视频内容上传上去
00:08:20.866 → 00:08:23.433
然后选择对应的操作列表
00:08:23.600 → 00:08:26.900
然后再打开对应的一个文档把
00:08:26.933 → 00:08:30.666
这里的发布包的MD文档里面的标题
00:08:30.866 → 00:08:34.633
还有对应的简介都粘贴进去
00:08:34.700 → 00:08:37.666
在这里我是开启了创收
00:08:37.700 → 00:08:39.400
并且添加字幕
00:08:39.666 → 00:08:41.700
字幕呢是SRT文档
00:08:41.866 → 00:08:44.000
我整个操作完成之后
00:08:44.033 → 00:08:46.700
在这里我就会点击暂停
00:08:46.733 → 00:08:48.300
这个时候Codex在对话框
00:08:48.300 → 00:08:50.066
里面就会收到一条消息
00:08:50.133 → 00:08:51.633
我已经完成录制了
00:08:51.700 → 00:08:52.900
这个时候就可以看到
00:08:52.900 → 00:08:54.966
Codex实际上在思考
00:08:55.100 → 00:08:57.066
它在抽取整个的你
00:08:57.066 → 00:08:58.800
工作流的操作过程
00:08:58.866 → 00:09:00.633
然后大概5分钟之后
00:09:01.433 → 00:09:04.066
它把刚刚的那一个整个流程
00:09:04.166 → 00:09:06.133
整理成了一个可以复用的skill
00:09:06.233 → 00:09:07.933
而且它帮我自动命名了
00:09:08.000 → 00:09:10.166
叫做Youtube studio folder upload
00:09:10.466 → 00:09:11.566
这个技能我就可以
00:09:11.566 → 00:09:13.266
去重复的去使用了
00:09:13.266 → 00:09:15.200
这个时候你看我斜杠去
00:09:15.266 → 00:09:16.866
调用这个关键词的时候
00:09:16.866 → 00:09:19.400
我就发现这个技能我能够去使用了
00:09:19.500 → 00:09:21.266
接着我就去验证一下
00:09:21.333 → 00:09:23.400
这个能力能不能使用
00:09:23.433 → 00:09:24.533
这里就不得不提到
00:09:24.533 → 00:09:26.000
我给整个的任务是
00:09:26.000 → 00:09:28.066
增加了一定的复杂性的
00:09:28.133 → 00:09:30.466
我刚刚在封装这个skill的时候
00:09:30.500 → 00:09:32.633
我使用的是这个文件夹
00:09:32.800 → 00:09:35.233
它的文件夹目录大概是这样子的
00:09:35.566 → 00:09:38.333
我核心存储的关键的视频文档
00:09:38.733 → 00:09:41.166
MP4文件还有SRT文件在这里
00:09:41.433 → 00:09:43.966
我对应的封面图我放在了
00:09:44.100 → 00:09:46.233
IMAGE2 candidate这里的封面图
00:09:46.300 → 00:09:48.100
当然这个封面图的结构啊
00:09:48.100 → 00:09:49.000
包括整个文件夹的
00:09:49.033 → 00:09:50.700
结构是Codex帮我搭的
00:09:50.733 → 00:09:52.033
因为我每一次的任务
00:09:52.466 → 00:09:54.300
整体上的工作流是相似的
00:09:54.300 → 00:09:55.400
但是它还是每一次
00:09:55.400 → 00:09:56.866
有一些具体的情况
00:09:56.966 → 00:09:59.266
需要根据我的一些判断进行微调
00:09:59.300 → 00:10:02.033
所以它的文件夹结构是这样子的
00:10:02.166 → 00:10:04.666
它的这个缩略图是在这里的
00:10:04.733 → 00:10:07.366
它的整个的标题简介发布的
00:10:07.433 → 00:10:09.266
标签时间轴是这个文件夹
00:10:09.266 → 00:10:10.366
MD文档在这里
00:10:10.566 → 00:10:12.700
然后再看到我让它做的这个任务
00:10:12.866 → 00:10:15.266
我等会让它上传的这个
00:10:15.266 → 00:10:17.066
文件夹是这样的结构
00:10:17.066 → 00:10:19.233
可以看到跟之前的这个
00:10:19.266 → 00:10:20.633
项目文档是不一样的
00:10:20.800 → 00:10:22.500
在这里我的这个视频
00:10:22.533 → 00:10:24.833
文档是MP4这个文档和SRT
00:10:24.866 → 00:10:25.933
其实这个倒是好识别
00:10:25.966 → 00:10:27.900
因为它可以通过文件名
00:10:27.900 → 00:10:29.366
加上文件类型去识别
00:10:29.533 → 00:10:33.200
然后这里我的缩略图是放在了
00:10:33.200 → 00:10:35.233
06发布的文件夹下的
00:10:35.333 → 00:10:36.966
所以我的文件的分支
00:10:37.033 → 00:10:39.233
跟上一个基本上不一样
00:10:39.233 → 00:10:41.600
其实这里面是有一点小噪音的
00:10:41.600 → 00:10:43.500
我们看一下它的复刻
00:10:43.533 → 00:10:44.800
能力到了什么程度
00:10:44.900 → 00:10:46.966
首先我把任务的指令发给他
00:10:47.066 → 00:10:49.033
我唤醒这个技能
00:10:49.166 → 00:10:50.366
然后我跟他说
00:10:50.766 → 00:10:52.533
你在这个文件夹里面
00:10:52.566 → 00:10:54.533
将这条视频及发布包
00:10:54.566 → 00:10:56.433
的内容上传到Youtube
00:10:57.800 → 00:10:59.633
同步的它就开始运行了
00:10:59.800 → 00:11:02.100
Codex上面会有它的整个的运行过程
00:11:02.166 → 00:11:03.566
而你打开对应的界面
00:11:03.600 → 00:11:05.100
它会有操作的路径
00:11:05.333 → 00:11:06.833
它使用的是computer use
00:11:06.966 → 00:11:09.366
浏览器的集成和一些插件的能力
00:11:09.433 → 00:11:12.033
在综合的应用在完成整个过程
00:11:12.033 → 00:11:13.166
大家在这个过程中
00:11:13.166 → 00:11:15.000
看到这个闪烁的光标
00:11:15.133 → 00:11:17.566
实际上就是computer use在工作
00:11:17.766 → 00:11:19.766
大家可以看到我最后上传的结果
00:11:20.166 → 00:11:21.566
视频自然是不必说
00:11:22.700 → 00:11:24.700
标题还有对应的简介
00:11:25.633 → 00:11:28.733
这些基础的三大件都是上传完成了
00:11:28.900 → 00:11:30.400
它把我的公开范围按照我
00:11:30.466 → 00:11:32.566
的要求设定为不公开列出
00:11:32.566 → 00:11:33.766
而且可以看到它的
00:11:33.833 → 00:11:36.433
字幕是帮我成功上传了
00:11:36.566 → 00:11:39.300
唯一有一点小的遗憾或者瑕疵
00:11:39.533 → 00:11:42.666
是最后的这个片尾画面和
00:11:42.766 → 00:11:44.766
最后的这个播放列表的选择
00:11:44.800 → 00:11:47.066
它没有完全复刻我之前的操作
00:11:47.366 → 00:11:49.000
也有可能是在这个过程中
00:11:49.033 → 00:11:50.533
我同步的在操作
00:11:50.566 → 00:11:52.066
电脑中间有一些影响
00:11:52.133 → 00:11:53.666
而且我在这个过程中其实
00:11:53.700 → 00:11:56.533
有很多偏噪音型的操作
00:11:56.566 → 00:11:58.366
啊会影响它的整个的过程
00:11:58.366 → 00:12:01.366
其实整个的路径是没有那么干净的
00:12:01.366 → 00:12:03.800
而Openai它给出的官方的
00:12:03.800 → 00:12:05.066
演示的案例的时候
00:12:05.200 → 00:12:07.633
它给的东西是非常的干净的
00:12:07.700 → 00:12:10.266
它不像我给一个整的项目文件夹
00:12:10.333 → 00:12:13.100
里面包含了各种各样不同的文件
00:12:13.366 → 00:12:15.833
它就直接把需要使用到的文件
00:12:16.300 → 00:12:19.100
文档图片视频直接丢给Codex
00:12:19.100 → 00:12:20.933
那个是比较清爽干净的
00:12:20.933 → 00:12:21.800
这样的路径呢
00:12:21.833 → 00:12:23.233
就更不容易出错
00:12:25.466 → 00:12:26.933
我们再来看第二个任务
00:12:27.200 → 00:12:29.933
第二个任务我设计的是让record and
00:12:29.933 → 00:12:33.333
Replay的功能帮我去在剪映的这个
00:12:33.400 → 00:12:36.166
APP里面去剪辑我的口播视频
00:12:36.266 → 00:12:38.166
口播视频有个特点啊这里呢
00:12:38.166 → 00:12:40.900
我也故意增加了一些噪音和难度
00:12:41.033 → 00:12:42.966
我的录的这个视频里面
00:12:43.066 → 00:12:45.066
整个的口播的片段
00:12:45.100 → 00:12:47.333
它会有很多说的重复的话
00:12:47.433 → 00:12:48.733
大家看到我在这个
00:12:48.733 → 00:12:50.900
视频里面放了两段视频
00:12:51.100 → 00:12:53.100
一段是我录制使用的视频
00:12:53.166 → 00:12:55.200
一段是我测试使用的视频
00:12:55.300 → 00:12:58.733
这两段视频录制所使用的是不同的
00:12:58.933 → 00:13:00.633
我可以通过剪口播的方式
00:13:00.633 → 00:13:02.733
大家看一下这个原始视频
00:13:02.733 → 00:13:05.533
它是会有很多的需要剪掉的地方
00:13:05.633 → 00:13:07.700
首先会有一些无关的文字
00:13:07.733 → 00:13:09.233
比如说一开始会说开始录制
00:13:09.366 → 00:13:12.666
然后会有很多的空白的无声的地方
00:13:13.266 → 00:13:15.166
我觉得这里就是比较难剪的地方
00:13:15.333 → 00:13:16.133
就是我这里啊
00:13:16.133 → 00:13:18.066
有可能有的地方嘴瓢了
00:13:18.433 → 00:13:19.366
说的话会重复
00:13:19.400 → 00:13:21.566
比如说你看这里会有另外另外一位
00:13:21.600 → 00:13:23.833
这里我同样一句话说了好几遍
00:13:23.866 → 00:13:25.700
那实际上只有最后这
00:13:25.733 → 00:13:27.000
一遍是需要保留的
00:13:27.066 → 00:13:29.566
那前面的都是需要删除的
00:13:29.566 → 00:13:31.133
那么对于Codex来说
00:13:31.200 → 00:13:33.966
它就需要去从全文去理解
00:13:34.000 → 00:13:36.933
而不是说直接像剪口播这样
00:13:37.200 → 00:13:39.333
把它相对机械性的
00:13:39.333 → 00:13:40.366
它是以一个小的
00:13:40.400 → 00:13:42.300
文段去理解整个文字
00:13:42.366 → 00:13:44.166
而如果说你从整个的一
00:13:44.166 → 00:13:45.633
长串视频去理解的话
00:13:45.800 → 00:13:47.533
你要能理解到说诶
00:13:48.733 → 00:13:50.533
类似这样子的重复的
00:13:50.533 → 00:13:51.833
说的不好的地方
00:13:51.866 → 00:13:52.966
重复表达的地方
00:13:53.000 → 00:13:55.633
是需要按照文义去删掉的
00:13:55.633 → 00:13:58.800
那我需要他应用剪映APP的
00:13:58.933 → 00:14:00.600
智能剪口播的功能
00:14:00.766 → 00:14:03.266
基于口播中重复错误
00:14:03.433 → 00:14:05.266
或者不合理的表达
00:14:05.300 → 00:14:07.333
对它进行合理的删除
00:14:07.500 → 00:14:10.433
而且我录制所使用的这段视频
00:14:10.600 → 00:14:13.366
和我在测试的时候使用的视频
00:14:13.533 → 00:14:15.566
它所错误的这种段落
00:14:15.633 → 00:14:16.966
或者错误的表达
00:14:17.000 → 00:14:19.233
或者这种重复的表达是不一样的
00:14:19.366 → 00:14:22.233
他们没有直接的可复刻性
00:14:22.333 → 00:14:23.633
这里面就需要他有
00:14:23.666 → 00:14:25.266
一个自我的学习能力
00:14:25.333 → 00:14:27.900
我们看一下Codex这个功能
00:14:27.900 → 00:14:29.133
它的表现如何
00:14:29.466 → 00:14:31.200
首先还是和第一个任务一样
00:14:31.300 → 00:14:33.033
我把这个功能激活
00:14:33.066 → 00:14:34.166
然后我跟他说了一下
00:14:34.200 → 00:14:35.733
我大概需要做的事情
00:14:36.033 → 00:14:38.533
就是我打算使用剪映剪口播
00:14:38.600 → 00:14:41.400
视频的方式来智能剪口播
00:14:41.500 → 00:14:43.600
希望它去理解整体的文稿
00:14:43.600 → 00:14:46.000
把不连贯重复错误的地方删掉
00:14:46.033 → 00:14:47.933
去掉停顿等等进行口播
00:14:48.033 → 00:14:49.300
经过思考之后呢
00:14:49.366 → 00:14:51.966
它也同时开启了录制的功能
00:14:52.400 → 00:14:55.066
我就在这一段录制的视频里面
00:14:55.066 → 00:14:57.233
开始按照逻辑去剪辑
00:14:57.500 → 00:14:59.100
剪完之后停止录制
00:14:59.333 → 00:15:01.066
它同样的收到了停止的指令
00:15:01.166 → 00:15:02.266
它也开始思考了
00:15:02.333 → 00:15:04.100
还是经过那三个步骤
00:15:04.266 → 00:15:06.466
先把整个的事件流读完
00:15:06.533 → 00:15:08.133
记录下来然后呢
00:15:08.133 → 00:15:10.466
再把可以复用的部分抽取出来
00:15:10.466 → 00:15:12.400
形成skill Creator的封装
00:15:12.566 → 00:15:14.233
然后呢我新开了一个窗口
00:15:14.300 → 00:15:16.200
我把他希望剪的这段
00:15:16.233 → 00:15:17.766
视频的地址发给他
00:15:17.900 → 00:15:19.100
然后激活这个skill
00:15:19.733 → 00:15:21.733
请使用剪映给我剪这个视频
00:15:21.866 → 00:15:22.900
好它开始思考
00:15:22.900 → 00:15:24.133
然后规划路径
00:15:24.200 → 00:15:25.500
就开始工作了
00:15:25.500 → 00:15:26.666
首先它像人一样
00:15:26.766 → 00:15:29.833
先把这个视频导到整个的工作界面
00:15:30.000 → 00:15:32.700
然后打开智能剪口播的能力
00:15:32.800 → 00:15:34.600
这里面我觉得很惊喜的点就是它
00:15:34.600 → 00:15:37.533
不仅在我刚刚讲的这个操作上面
00:15:37.633 → 00:15:39.533
它还继续拓展了这个能力
00:15:39.533 → 00:15:41.233
就之前其实我没有选择
00:15:41.300 → 00:15:43.200
这个智能粗检的能力
00:15:43.200 → 00:15:45.733
它这里把智能粗检的能力也打开了
00:15:47.566 → 00:15:50.433
它还会去帮我去做时间线
00:15:51.466 → 00:15:55.033
而且帮我完成了整个视频的导出
00:15:55.900 → 00:15:57.400
Codex的它的整个的
00:15:57.433 → 00:15:59.400
工作过程的记录里面它会说
00:15:59.500 → 00:16:00.600
里面有中间版
00:16:01.466 → 00:16:03.066
它不断的在校准
00:16:03.133 → 00:16:05.000
而且中间它还自己给自己发命令
00:16:05.033 → 00:16:07.166
不断的去做新的迭代
00:16:07.366 → 00:16:09.500
大家现在看到的版本是
00:16:09.500 → 00:16:11.666
剪映完成的整个的精简版
00:16:11.800 → 00:16:13.033
就看这些文字
00:16:13.233 → 00:16:17.933
所有的气口停顿重复全部都去掉了
00:16:17.933 → 00:16:18.933
这里的文字和这个
00:16:18.933 → 00:16:20.433
视频是一一对应的
00:16:20.500 → 00:16:22.200
我就不给大家一个个去听了
00:16:22.200 → 00:16:24.533
我给大家对比一下剪之前和
00:16:24.566 → 00:16:26.633
剪之后这个文字稿的对比
00:16:26.666 → 00:16:27.566
大家就清楚了
00:16:28.400 → 00:16:30.233
这是剪之前的文字稿
00:16:31.200 → 00:16:32.166
看到这个位置
00:16:32.766 → 00:16:34.466
比如说你看这里呢
00:16:34.600 → 00:16:35.700
剪映它这个剪口播
00:16:35.733 → 00:16:36.933
它会自动识别哎
00:16:37.033 → 00:16:38.700
这期视频这里是重复的
00:16:38.700 → 00:16:39.500
因为它比较近
00:16:39.566 → 00:16:41.700
它的语群的界定是比较近的
00:16:43.066 → 00:16:44.800
我刚刚剪的那个地方吧
00:16:44.833 → 00:16:45.900
这里是剪的很干净的
00:16:45.933 → 00:16:47.766
现在先看一下剪之前
00:16:47.833 → 00:16:49.933
这里有好几个这期视频这期视频
00:16:50.333 → 00:16:52.233
这里明显是我嘴瓢了
00:16:52.966 → 00:16:54.966
如果真的我们自己剪的话
00:16:55.000 → 00:16:58.000
就会把前面这一节全部都剪掉
00:16:58.066 → 00:16:59.900
只留下最后的这一段表达
00:16:59.966 → 00:17:01.000
因为你看这句话
00:17:02.066 → 00:17:04.500
它本质上虽然不完全一样
00:17:04.566 → 00:17:05.400
但是实际上你看
00:17:05.400 → 00:17:07.300
前面这句话说了一半断掉了
00:17:07.366 → 00:17:09.533
但它想讲的意思和这句话一样
00:17:09.566 → 00:17:12.133
对不对在剪口播这个智能识别里面
00:17:12.200 → 00:17:13.700
它是没有识别出来的
00:17:13.733 → 00:17:15.566
那每一次需要人肉去做
00:17:15.600 → 00:17:16.800
我们回过头来再来
00:17:16.800 → 00:17:18.600
看一下这个剪之后的
00:17:18.666 → 00:17:20.933
你看也是中间这个部分
00:17:21.233 → 00:17:24.133
这期视频这句话它没有前后的重复
00:17:26.000 → 00:17:28.866
前后的它都是连贯的一个状态
00:17:29.000 → 00:17:30.666
而且我觉得很惊喜的是
00:17:30.733 → 00:17:32.933
它启用了我之前在原来的
00:17:33.033 → 00:17:35.600
工作流里面都没有用过的工具
00:17:35.700 → 00:17:37.900
相当于它自我在发现
00:17:37.933 → 00:17:40.366
这个剪映的GUI这个操作界面
00:17:40.633 → 00:17:42.200
一些新的功能去
00:17:42.266 → 00:17:44.100
结合它搜索到的信息
00:17:44.166 → 00:17:46.033
加上实际操作的界面
00:17:46.166 → 00:17:48.133
它可以比人在这个
00:17:48.166 → 00:17:49.800
维度上面做得更好
00:17:49.833 → 00:17:52.000
因为本质上这个工作就是
00:17:52.033 → 00:17:54.000
纯粹数字世界里面的东西
00:17:54.433 → 00:17:56.933
机器会比大部分的人都要做得好
00:17:56.933 → 00:17:59.666
刚刚的两个任务用Codex的record
00:17:59.733 → 00:18:02.233
and Replay完成得都还挺不错的
00:18:02.400 → 00:18:03.500
虽然谈不上完美
00:18:03.500 → 00:18:04.833
但是已经很不错了
00:18:05.800 → 00:18:07.333
但是我想强调的是
00:18:08.466 → 00:18:10.466
最重要的并不是这个能力
00:18:10.466 → 00:18:12.900
把这些任务完成得有多好
00:18:12.900 → 00:18:15.800
而是Openai的Codex在通过
00:18:15.800 → 00:18:18.066
这样的方式在吃数据
00:18:18.400 → 00:18:19.866
它相当于把人
00:18:19.866 → 00:18:21.933
特别是白领工作中
00:18:21.933 → 00:18:24.466
和这种传统的GUI的图形
00:18:24.466 → 00:18:27.066
操作界面的工作协同过程
00:18:27.066 → 00:18:28.666
把它记录下来了
00:18:28.666 → 00:18:31.400
把这个数据喂给了Codex
00:18:31.466 → 00:18:35.100
相当于Openai不仅在吃传统的数据
00:18:35.300 → 00:18:38.533
传统的数据包括文本的多模态的
00:18:38.533 → 00:18:41.066
coding的这些数据已经不够他吃了
00:18:41.100 → 00:18:43.266
现在他要把这些工作
00:18:43.266 → 00:18:46.066
协同的数据全部抽象进去
00:18:46.233 → 00:18:49.433
而这些内容之所以被录制下来
00:18:49.433 → 00:18:51.000
就代表了这个工作
00:18:51.000 → 00:18:52.600
它本身是有价值的
00:18:52.600 → 00:18:54.833
而且它的频率特别高
00:18:54.833 → 00:18:58.000
那么当数据量足够多的时候
00:18:58.000 → 00:19:00.233
它就能够抽取出来对
00:19:00.233 → 00:19:02.066
大部分人通用型的
00:19:02.066 → 00:19:04.100
工作能力和接口方式
00:19:04.233 → 00:19:06.733
数据本身就是有价值的
00:19:06.733 → 00:19:10.300
要知道Openai全球的用户有10亿之多
00:19:10.300 → 00:19:13.866
而Codex的周活用户有500万以上
00:19:13.866 → 00:19:16.033
而且他们还在继续增长
00:19:16.033 → 00:19:17.333
而且他们在用一种
00:19:17.633 → 00:19:20.833
很变态的方式在继续增长用户
00:19:20.833 → 00:19:22.133
大家如果注意到
00:19:22.166 → 00:19:24.766
在Codex的左下角新增了一个
00:19:24.766 → 00:19:26.966
拉一个好友就可以赠送
00:19:26.966 → 00:19:29.166
一次你重置数据的方式
00:19:30.500 → 00:19:32.033
我觉得很互联网味
00:19:32.033 → 00:19:33.666
的这个拉新方式吧
00:19:33.666 → 00:19:34.700
也不知道是哪个
00:19:34.700 → 00:19:36.633
互联网鬼才给他出的主意
00:19:36.633 → 00:19:39.133
之前大家知道的OpenAI
00:19:39.133 → 00:19:40.766
搞的Sora的这个项目
00:19:40.766 → 00:19:43.366
虽然Sora的APP现在应该是停摆了
00:19:43.366 → 00:19:45.166
未来说不定有一天会重启
00:19:45.166 → 00:19:47.066
那不可否认的是
00:19:47.400 → 00:19:49.833
Sora它的用户的增长的速度和
00:19:49.833 → 00:19:51.866
拉新的过程就是非常快的
00:19:51.933 → 00:19:53.933
当时Sora增长的时候就是用
00:19:53.933 → 00:19:56.233
了这个邀请码获得的机制
00:19:56.266 → 00:19:58.233
而现在Codex的这个
00:19:58.233 → 00:19:59.600
机制也非常的鬼才
00:19:59.600 → 00:20:03.400
原来是100刀的用户有10X的这个额度
00:20:03.433 → 00:20:05.166
现在呢直接降为5X
00:20:05.200 → 00:20:07.066
然后剩下的这个额度呢
00:20:07.066 → 00:20:09.133
他就可以运营随机分发呀
00:20:09.133 → 00:20:10.733
他可以完全把它用
00:20:10.733 → 00:20:12.666
在用户的拉新上面
00:20:12.666 → 00:20:14.466
而且你拉新的用户越多
00:20:14.466 → 00:20:16.366
你重置的次数就越多
00:20:17.533 → 00:20:19.433
Openai的这个拉新啊
00:20:19.433 → 00:20:21.033
用户增长这一块做的
00:20:21.033 → 00:20:23.800
还是有一点鬼才在里面的
00:20:23.800 → 00:20:25.000
说回来这个能力啊
00:20:25.033 → 00:20:29.266
相当于Openai把越来越多的在白领
00:20:29.266 → 00:20:31.966
世界里面有工作价值的这些工作
00:20:31.966 → 00:20:35.166
内容全部都在抽象化和数字化了
00:20:35.533 → 00:20:38.366
Openai整个的增长和迭代
00:20:38.366 → 00:20:39.466
速度是非常恐怖的
00:20:39.466 → 00:20:41.333
那未来下一步什么呢
00:20:41.366 → 00:20:42.966
数字世界抽象完之后
00:20:42.966 → 00:20:44.566
就会走到物理世界
00:20:44.600 → 00:20:47.733
当然物理世界是相对难度更大一点
00:20:47.733 → 00:20:50.966
因为它需要原子的组装和移动
00:20:51.066 → 00:20:53.333
未来也不是没有可能
00:20:53.400 → 00:20:56.800
不管你最近是否打算使用record and
00:20:56.800 → 00:20:59.466
Replay这个能力去完成一些重复的
00:20:59.466 → 00:21:01.366
工作帮你去封装skill
00:21:01.466 → 00:21:03.533
我都建议你去体验
00:21:03.533 → 00:21:05.333
一下这个插件能力
00:21:05.366 → 00:21:07.500
看看它会不会给你带来像
00:21:07.500 → 00:21:09.600
我一样后背发凉的体验
00:21:09.700 → 00:21:13.466
如果说你本来把你的整个的工作流
00:21:13.500 → 00:21:17.133
进行了充分的结构化和原子化的话
00:21:17.133 → 00:21:18.866
那么这个能力出来之后
00:21:18.866 → 00:21:20.866
它就可以帮你解决大问题
00:21:20.966 → 00:21:23.700
原来你在组织整个的工作流的时候
00:21:23.700 → 00:21:26.966
你会发现有一份工作它用MCP
00:21:27.066 → 00:21:29.400
通过API或者通过插件的方式
00:21:29.400 → 00:21:30.966
它不能够稳定的解决
00:21:31.000 → 00:21:33.700
目前这个阶段仍然需要去
00:21:33.700 → 00:21:35.300
借助一些图形化的界面
00:21:35.300 → 00:21:36.700
完成整个的工作流
00:21:36.933 → 00:21:39.666
而现在这个能力补全进来了
00:21:39.666 → 00:21:41.166
它相当于把你整个
00:21:41.166 → 00:21:43.166
的过程闭环起来了
00:21:43.166 → 00:21:45.366
所以我觉得这个能力它
00:21:45.366 → 00:21:47.166
的上线是非常重要的
00:21:47.166 → 00:21:49.400
而且更重要的是让我看到
00:21:49.400 → 00:21:51.800
了Openai不可限量的未来
00:21:51.800 → 00:21:55.600
让我更加期待Openai在今年或者是在
00:21:55.600 → 00:21:58.933
明年初的它的IPO的上线和到来
00:21:58.933 → 00:21:59.866
关于这个能力
00:21:59.866 → 00:22:01.166
你有什么想说的
00:22:01.200 → 00:22:04.366
关于Openai未来的IPO和
00:22:04.366 → 00:22:06.166
它未来的发展图景
00:22:06.166 → 00:22:07.400
你有什么想聊的
00:22:07.566 → 00:22:10.233
欢迎在评论区跟我互动和留言
00:22:10.333 → 00:22:13.200
如果觉得我的频道有趣有料
00:22:13.266 → 00:22:15.333
欢迎订阅我的频道灵姐说AI
00:22:15.333 → 00:22:17.400
我们下期再见啦拜拜