# 影片筆記:演示一次,AI就能复刻工作流?我实测 Codex Record & Replay ## 一句話總結 OpenAI Codex 推出「Record and Replay」功能,透過錄製 GUI 操作並抽象為可複用的 Skill,實現工作流的自動化重播;實測顯示其能處理 YouTube 發布與剪映剪輯等複雜任務,但受環境干擾影響穩定性,同時該功能也是 OpenAI 蒐集協同數據與進行病毒式拉新的戰略工具。 ## 核心重點 1. **功能本質**:Record and Replay 並非傳統宏錄製,而是將人類操作抽象化為 Skill(技能/資產),形成可複用的 SOP(標準作業程序)。 2. **運作機制**: * **Record**:使用者在 Codex 中錄製操作,Codex 觀察並記錄動作與視窗內容。 * **Skill Drafting**:Codex 將 Workflow 抽象化為 Skill,定義使用時機、輸入、步驟及驗證方式。 * **Replay**:在新環境中,利用該 Skill 結合 Computer Use 插件與瀏覽器操作,自動完成任務。 3. **實測結果**: * **YouTube 發布**:成功上傳影片、標題、簡介、封面、字幕並設定隱私,但片尾畫面與播放列表選擇因錄製時噪音干擾而未完全復刻。 * **剪映剪輯**:成功去除氣口與停頓,且 Agent 自我發現並啟用了「智能粗檢」功能,表現優於部分人類操作。 4. **工作替代界線**: * **100% 被 AI 替代**:工作內容完全可被抽象為 Skill,該職位將被取代。 * **90% 由 AI 完成**:關鍵節點需人類確認(Human Gate),此類工作仍屬高價值。 * 講者強調 100% 與 90% 的替代率存在本質區別(0 與 1 的差別)。 5. **OpenAI 戰略**: * **數據戰略**:透過 Record and Replay 吸收「工作協同數據」,抽取通用型工作能力與接口。 * **拉新機制**:利用「拉好友贈送重置數據」功能,將原 100 美元用戶的 10X 額度降至 5X,剩餘額度用於隨機分發與拉新,形成病毒式增長。 6. **限制與建議**:目前僅支援 macOS;官方建議能用 MCP 或接口解決的問題,盡量不要使用 GUI 方式,因 GUI 操作受圖形界面影響不穩定性較強。 ## 詳細大綱 ### 一、功能介紹與核心概念 * **功能名稱**:Record and Replay(錄製與重播)。 * **支援平台**:目前僅支援 macOS(講者建議購買 Mac 以使用此功能)。 * **本質區別**:非傳統宏錄製工具,而是將操作過程抽象為 SOP(標準作業程序),形成可複用的資產。 ### 二、對工作與企業的潛在影響 * **Skill OPS 路線**: * 過去:依賴 SOP 文檔。 * 未來:工作經驗抽象為 Skill,由 Agent 執行,人類負責最後把關(Human Gate)。 * **企業視角**:即使員工不主動分享經驗,企業也可透過觀察工作流,將操作過程抽象為 Skill 並沉澱為公司資產庫。 ### 三、對 UI/GUI 型軟體的影響 * **數據抽象化**:此功能正在「吃掉」與 UI/GUI 軟體協同操作的數據。 * **效率對比**: * MCP、插件、API 接口:效率高、可批量產出。 * GUI 操作:受圖形界面影響,不穩定性較強。 * OpenAI 官方建議:能用 MCP 或接口解決的問題,盡量不要使用此 GUI 方式。 ### 四、實測案例演示 #### 案例一:YouTube 發布流程自動化 * **任務目標**:上傳影片、設定標題/簡介、公開範圍、上傳字幕(SRT)、上傳縮略圖、選擇播放列表、設定創收。 * **操作細節**: * 講者故意製造「噪音」(非線性操作、額外動作)以測試極限。 * 錄製時需保持過程乾淨,避免過多噪音影響抽取清晰度。 * **結果驗證**: * Skill 命名為 `Youtube studio folder upload`。 * 成功上傳影片、標題、簡介、封面、字幕,並設定為「不公開列出」。 * **瑕疵**:片尾畫面與播放列表選擇未完全復刻(可能因錄製時有額外操作干擾)。 * 講者對比官方演示案例,指出官方案例文件結構更清爽,因此錯誤率較低。 #### 案例二:剪映(Jianying)口播剪輯 * **任務目標**:利用剪映的「智能剪口播」功能,刪除重複、錯誤、停頓的內容。 * **難度設定**: * 錄製視頻與測試視頻的錯誤段落不同,無直接可復刻性。 * 需理解全文語義,而非僅機械性剪切。 * **操作細節**: * 講者錄製時使用「智能剪口播」功能。 * Codex 在重播時,不僅執行原指令,還**自我發現並開啟了「智能粗檢」功能**,並進行時間線校準與導出。 * **結果驗證**: * 成功去除氣口、停頓、重複表達。 * 講者認為驚喜點在於 Agent 能自我發現 GUI 界面中的新功能(如智能粗檢),結合搜尋資訊與實際操作,表現優於部分人類操作。 ### 五、OpenAI 的戰略野心與增長策略 * **數據戰略**: * OpenAI 不僅消費文本/多模態/Coding 數據,現在更透過 Record and Replay 吸收「工作協同數據」。 * 被錄製的工作代表其具有價值且頻率高,大量數據有助於抽取通用型工作能力與接口。 * **用戶增長(拉新)機制**: * Codex 左下角新增「拉好友贈送重置數據」功能。 * 對比 Sora 時期的邀請碼機制,此機制被講者稱為「互聯網鬼才」的主意。 * 原 100 美元用戶擁有 10X 額度,現降至 5X,剩餘額度用於隨機分發與拉新。 * 拉新越多,重置次數越多,形成病毒式增長。 * **未來展望**: * 數字世界抽象化完成後,將走向物理世界(原子組裝與移動,難度較大)。 * 講者對 OpenAI 今年或明年初的 IPO 充滿期待。 ## 工具 / 模型 / 名詞整理 * **OpenAI**:開發者。 * **Codex**:OpenAI 推出的具備 Computer Use 能力的模型/產品。 * **Record and Replay**:Codex 的功能名稱,指錄製與重播工作流。 * **Skill**:技能/資產概念,指將操作過程抽象化後的複用單元。 * **SOP**:Standard Operating Procedure,標準作業程序。 * **MCP**:Model Context Protocol,模型上下文協議。 * **Computer Use**:插件/功能名稱,指 Codex 控制電腦的功能。 * **YouTube**:影片平台。 * **Youtube studio folder upload**:實測中自動生成的 Skill 名稱。 * **剪映**:APP 名稱。 * **智能剪口播**:剪映功能。 * **智能粗檢**:剪映功能,Agent 自我發現並啟用。 * **Sora**:提及的舊項目。 * **macOS**:支援系統。 * **Windows**:目前不支援系統。 * **庫克**:Apple CEO,提及產品漲價警告。 ## 操作流程整理 ### 通用流程 1. **Record(錄製)**:使用者在 Codex 上主動錄製一次操作過程,Codex 觀察並記錄動作與視窗內容。 2. **Skill Drafting(技能草擬)**:Codex 將錄製的 Workflow 抽象化為 Skill,說明使用時機、輸入、步驟及驗證方式。 3. **Replay(重播)**:在新環境中,利用該 Skill 結合 Computer Use 插件與瀏覽器操作,自動完成任務。 ### 案例一:YouTube 發布流程 1. 準備素材:影片檔案、標題/簡介 MD 文檔、SRT 字幕檔案、縮略圖、播放列表資訊。 2. 錄製階段: * 開啟 YouTube Studio。 * 上傳影片。 * 填寫標題、簡介、上傳字幕、上傳縮略圖。 * 設定公開範圍(如「不公開列出」)。 * (講者故意加入非線性操作以測試極限)。 3. 生成 Skill:系統生成名為 `Youtube studio folder upload` 的 Skill。 4. 重播階段: * 在新環境中執行該 Skill。 * 驗證是否成功上傳影片、標題、簡介、封面、字幕及設定隱私。 ### 案例二:剪映口播剪輯 1. 準備素材:包含錯誤、停頓、重複內容的原始視頻。 2. 錄製階段: * 開啟剪映。 * 使用「智能剪口播」功能處理視頻。 3. 生成 Skill:系統學習處理流程。 4. 重播階段: * 執行 Skill。 * Agent 自我發現並開啟「智能粗檢」功能。 * 進行時間線校準與導出。 * 驗證是否成功去除氣口、停頓、重複表達。 ## 值得注意的限制或風險 1. **平台限制**:目前 Record and Replay 功能僅支援 macOS,Windows 用戶無法使用。 2. **穩定性問題**:GUI 操作受圖形界面影響,不穩定性較強。若錄製時存在「噪音」(如非線性操作、額外動作、文件結構不清晰),重播時容易出現瑕疵(如未復刻片尾畫面或播放列表選擇)。 3. **替代風險**: * 若工作內容完全可被抽象為 Skill,將面臨 100% 被 AI 替代的風險。 * 講者強調 100% 與 90% 的替代率存在本質區別(0 與 1 的差別),企業應關注如何保留人類在關鍵節點的把關權(Human Gate)。 4. **數據隱私與資產歸屬**:企業可透過觀察工作流將操作抽象為 Skill 並沉澱為公司資產庫,這可能改變員工經驗分享的動力與企業對員工操作的監控方式。 ## 逐字稿辨識疑點 * **靈姐說AI**:講者頻道名稱,聽寫可能為「靈姐說 AI」或類似變體。 * **Skill OPS**:講者提及的特定路線名稱,聽寫可能為「Skill Ops」或「Skill Operations」。 * **Computer Use**:講者口語中多次提及,指代 Codex 控制電腦的功能或插件,原文聽寫為「computer use」。 * **10X / 5X**:講者提及用戶額度倍數,聽寫為「10X」與「5X」,具體指代需查證官方當前政策。 * **IMAGE2 candidate**:講者描述文件夾結構時提到的路徑名稱,聽寫可能為「Image2」或特定文件夾命名,需查證實際文件結構。 * **MD 文檔**:講者提及「發布包的 MD 文檔」,MD 通常指 Markdown,但在此語境下指代包含標題、簡介等資訊的文件,聽寫為「MD 文檔」。 * **SRT 文檔**:講者提及字幕文件,聽寫為「SRT 文檔」,通常為 .srt 格式。 * **06 發布的文件夾**:講者描述文件夾結構時提到的路徑,聽寫為「06 發布」,需查證實際文件夾命名。 ## 可延伸追問 1. Record and Replay 生成的 Skill 在不同版本的軟體介面(UI 更新)中是否仍能保持穩定? 2. OpenAI 如何處理錄製過程中產生的敏感數據(如個人隱私、商業機密)? 3. 對於非 macOS 用戶,是否有替代方案或未來支援 Windows 的計畫? 4. 「智能粗檢」等 Agent 自我發現的功能,其背後的邏輯是基於預設規則還是動態學習? 5. 企業如何評估將現有 SOP 轉換為 Skill 的成本與收益?