影片筆記:演示一次,AI就能复刻工作流?我实测 Codex Record & Replay
一句話總結
OpenAI Codex 推出「Record and Replay」功能,透過錄製 GUI 操作並抽象為可複用的 Skill,實現工作流的自動化重播;實測顯示其能處理 YouTube 發布與剪映剪輯等複雜任務,但受環境干擾影響穩定性,同時該功能也是 OpenAI 蒐集協同數據與進行病毒式拉新的戰略工具。
核心重點
功能本質:Record and Replay 並非傳統宏錄製,而是將人類操作抽象化為 Skill(技能/資產),形成可複用的 SOP(標準作業程序)。
運作機制:
- Record:使用者在 Codex 中錄製操作,Codex 觀察並記錄動作與視窗內容。
- Skill Drafting:Codex 將 Workflow 抽象化為 Skill,定義使用時機、輸入、步驟及驗證方式。
- Replay:在新環境中,利用該 Skill 結合 Computer Use 插件與瀏覽器操作,自動完成任務。
實測結果:
- YouTube 發布:成功上傳影片、標題、簡介、封面、字幕並設定隱私,但片尾畫面與播放列表選擇因錄製時噪音干擾而未完全復刻。
- 剪映剪輯:成功去除氣口與停頓,且 Agent 自我發現並啟用了「智能粗檢」功能,表現優於部分人類操作。
工作替代界線:
- 100% 被 AI 替代:工作內容完全可被抽象為 Skill,該職位將被取代。
- 90% 由 AI 完成:關鍵節點需人類確認(Human Gate),此類工作仍屬高價值。
- 講者強調 100% 與 90% 的替代率存在本質區別(0 與 1 的差別)。
OpenAI 戰略:
- 數據戰略:透過 Record and Replay 吸收「工作協同數據」,抽取通用型工作能力與接口。
- 拉新機制:利用「拉好友贈送重置數據」功能,將原 100 美元用戶的 10X 額度降至 5X,剩餘額度用於隨機分發與拉新,形成病毒式增長。
限制與建議:目前僅支援 macOS;官方建議能用 MCP 或接口解決的問題,盡量不要使用 GUI 方式,因 GUI 操作受圖形界面影響不穩定性較強。
詳細大綱
一、功能介紹與核心概念
- 功能名稱:Record and Replay(錄製與重播)。
- 支援平台:目前僅支援 macOS(講者建議購買 Mac 以使用此功能)。
- 本質區別:非傳統宏錄製工具,而是將操作過程抽象為 SOP(標準作業程序),形成可複用的資產。
二、對工作與企業的潛在影響
- Skill OPS 路線:
- 過去:依賴 SOP 文檔。
- 未來:工作經驗抽象為 Skill,由 Agent 執行,人類負責最後把關(Human Gate)。
- 企業視角:即使員工不主動分享經驗,企業也可透過觀察工作流,將操作過程抽象為 Skill 並沉澱為公司資產庫。
三、對 UI/GUI 型軟體的影響
- 數據抽象化:此功能正在「吃掉」與 UI/GUI 軟體協同操作的數據。
- 效率對比:
- MCP、插件、API 接口:效率高、可批量產出。
- GUI 操作:受圖形界面影響,不穩定性較強。
- OpenAI 官方建議:能用 MCP 或接口解決的問題,盡量不要使用此 GUI 方式。
四、實測案例演示
#### 案例一:YouTube 發布流程自動化
- 任務目標:上傳影片、設定標題/簡介、公開範圍、上傳字幕(SRT)、上傳縮略圖、選擇播放列表、設定創收。
- 操作細節:
- 講者故意製造「噪音」(非線性操作、額外動作)以測試極限。
- 錄製時需保持過程乾淨,避免過多噪音影響抽取清晰度。
- 結果驗證:
- Skill 命名為
Youtube studio folder upload。 - 成功上傳影片、標題、簡介、封面、字幕,並設定為「不公開列出」。
- 瑕疵:片尾畫面與播放列表選擇未完全復刻(可能因錄製時有額外操作干擾)。
- 講者對比官方演示案例,指出官方案例文件結構更清爽,因此錯誤率較低。
#### 案例二:剪映(Jianying)口播剪輯
- 任務目標:利用剪映的「智能剪口播」功能,刪除重複、錯誤、停頓的內容。
- 難度設定:
- 錄製視頻與測試視頻的錯誤段落不同,無直接可復刻性。
- 需理解全文語義,而非僅機械性剪切。
- 操作細節:
- 講者錄製時使用「智能剪口播」功能。
- Codex 在重播時,不僅執行原指令,還自我發現並開啟了「智能粗檢」功能,並進行時間線校準與導出。
- 結果驗證:
- 成功去除氣口、停頓、重複表達。
- 講者認為驚喜點在於 Agent 能自我發現 GUI 界面中的新功能(如智能粗檢),結合搜尋資訊與實際操作,表現優於部分人類操作。
五、OpenAI 的戰略野心與增長策略
- 數據戰略:
- OpenAI 不僅消費文本/多模態/Coding 數據,現在更透過 Record and Replay 吸收「工作協同數據」。
- 被錄製的工作代表其具有價值且頻率高,大量數據有助於抽取通用型工作能力與接口。
- 用戶增長(拉新)機制:
- Codex 左下角新增「拉好友贈送重置數據」功能。
- 對比 Sora 時期的邀請碼機制,此機制被講者稱為「互聯網鬼才」的主意。
- 原 100 美元用戶擁有 10X 額度,現降至 5X,剩餘額度用於隨機分發與拉新。
- 拉新越多,重置次數越多,形成病毒式增長。
- 未來展望:
- 數字世界抽象化完成後,將走向物理世界(原子組裝與移動,難度較大)。
- 講者對 OpenAI 今年或明年初的 IPO 充滿期待。
工具 / 模型 / 名詞整理
- OpenAI:開發者。
- Codex:OpenAI 推出的具備 Computer Use 能力的模型/產品。
- Record and Replay:Codex 的功能名稱,指錄製與重播工作流。
- Skill:技能/資產概念,指將操作過程抽象化後的複用單元。
- SOP:Standard Operating Procedure,標準作業程序。
- MCP:Model Context Protocol,模型上下文協議。
- Computer Use:插件/功能名稱,指 Codex 控制電腦的功能。
- YouTube:影片平台。
- Youtube studio folder upload:實測中自動生成的 Skill 名稱。
- 剪映:APP 名稱。
- 智能剪口播:剪映功能。
- 智能粗檢:剪映功能,Agent 自我發現並啟用。
- Sora:提及的舊項目。
- macOS:支援系統。
- Windows:目前不支援系統。
- 庫克:Apple CEO,提及產品漲價警告。
操作流程整理
通用流程
Record(錄製):使用者在 Codex 上主動錄製一次操作過程,Codex 觀察並記錄動作與視窗內容。
Skill Drafting(技能草擬):Codex 將錄製的 Workflow 抽象化為 Skill,說明使用時機、輸入、步驟及驗證方式。
Replay(重播):在新環境中,利用該 Skill 結合 Computer Use 插件與瀏覽器操作,自動完成任務。
案例一:YouTube 發布流程
準備素材:影片檔案、標題/簡介 MD 文檔、SRT 字幕檔案、縮略圖、播放列表資訊。
錄製階段:
- 開啟 YouTube Studio。
- 上傳影片。
- 填寫標題、簡介、上傳字幕、上傳縮略圖。
- 設定公開範圍(如「不公開列出」)。
- (講者故意加入非線性操作以測試極限)。
生成 Skill:系統生成名為 Youtube studio folder upload 的 Skill。
重播階段:
- 在新環境中執行該 Skill。
- 驗證是否成功上傳影片、標題、簡介、封面、字幕及設定隱私。
案例二:剪映口播剪輯
準備素材:包含錯誤、停頓、重複內容的原始視頻。
錄製階段:
- 開啟剪映。
- 使用「智能剪口播」功能處理視頻。
生成 Skill:系統學習處理流程。
重播階段:
- 執行 Skill。
- Agent 自我發現並開啟「智能粗檢」功能。
- 進行時間線校準與導出。
- 驗證是否成功去除氣口、停頓、重複表達。
值得注意的限制或風險
平台限制:目前 Record and Replay 功能僅支援 macOS,Windows 用戶無法使用。
穩定性問題:GUI 操作受圖形界面影響,不穩定性較強。若錄製時存在「噪音」(如非線性操作、額外動作、文件結構不清晰),重播時容易出現瑕疵(如未復刻片尾畫面或播放列表選擇)。
替代風險:
- 若工作內容完全可被抽象為 Skill,將面臨 100% 被 AI 替代的風險。
- 講者強調 100% 與 90% 的替代率存在本質區別(0 與 1 的差別),企業應關注如何保留人類在關鍵節點的把關權(Human Gate)。
數據隱私與資產歸屬:企業可透過觀察工作流將操作抽象為 Skill 並沉澱為公司資產庫,這可能改變員工經驗分享的動力與企業對員工操作的監控方式。
逐字稿辨識疑點
- 靈姐說AI:講者頻道名稱,聽寫可能為「靈姐說 AI」或類似變體。
- Skill OPS:講者提及的特定路線名稱,聽寫可能為「Skill Ops」或「Skill Operations」。
- Computer Use:講者口語中多次提及,指代 Codex 控制電腦的功能或插件,原文聽寫為「computer use」。
- 10X / 5X:講者提及用戶額度倍數,聽寫為「10X」與「5X」,具體指代需查證官方當前政策。
- IMAGE2 candidate:講者描述文件夾結構時提到的路徑名稱,聽寫可能為「Image2」或特定文件夾命名,需查證實際文件結構。
- MD 文檔:講者提及「發布包的 MD 文檔」,MD 通常指 Markdown,但在此語境下指代包含標題、簡介等資訊的文件,聽寫為「MD 文檔」。
- SRT 文檔:講者提及字幕文件,聽寫為「SRT 文檔」,通常為 .srt 格式。
- 06 發布的文件夾:講者描述文件夾結構時提到的路徑,聽寫為「06 發布」,需查證實際文件夾命名。
可延伸追問
Record and Replay 生成的 Skill 在不同版本的軟體介面(UI 更新)中是否仍能保持穩定?
OpenAI 如何處理錄製過程中產生的敏感數據(如個人隱私、商業機密)?
對於非 macOS 用戶,是否有替代方案或未來支援 Windows 的計畫?
「智能粗檢」等 Agent 自我發現的功能,其背後的邏輯是基於預設規則還是動態學習?
企業如何評估將現有 SOP 轉換為 Skill 的成本與收益?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。