# 影片筆記:Codex神级更新:Record & Replay ## 一句話總結 Codex 推出「Record and Replay」新功能,允許用戶直接透過視覺示範操作(如跨軟體複製貼上),讓 AI 自動理解意圖並生成可重複使用的 Skill,實現從「文字描述」到「視覺示範」的學習方式轉變,並透過反饋機制修正遺漏步驟。 ## 核心重點 * **學習方式進化**:AI 學習方式從傳統的「文字描述生成 Skill」進化到「直接示範給 AI 看」,降低了將工作流結構化的門檻。 * **隱性知識顯性化**:該功能本質上是將用戶的隱性知識(操作習慣、邏輯)透過視覺錄製轉化為顯性知識(可執行的 Skill)。 * **跨軟體自動化**:演示了從寫作軟件 Ulysses 複製文章並發布至 Substack 的過程,展示了 AI 自動執行跨軟體操作的能力。 * **自我修正機制**:透過「回放」發現遺漏步驟(如缺少訂閱按鈕),並透過向 AI 反饋,讓 AI 檢查錄像並補上步驟,實現 Skill 的迭代優化。 * **技術基礎**:基於「多模態」(理解錄像)與「Computer Use」(執行操作)兩大能力,由 OpenEye 將這些能力與 Skills 組合。 ## 詳細大綱 ### 1. 功能介紹與評價 * **新功能名稱**:Record and Replay(錄製與回放)。 * **講者評價**:稱為「神級更新」,因為它改變了 AI 學習方式。 * **核心轉變**: * 過去:需要文字描述來生成 Skill。 * 現在:直接示範操作給 AI 看。 * **解決痛點**:消除了將工作流語言化、結構化的高門檻。 * **本質意義**:將隱性知識顯性化,讓不易被文字描述的能力通過視覺輸出給 AI。 ### 2. 實際操作演示 * **場景設定**:將文章從寫作軟件 Ulysses 複製並發布至 Substack。 * **錄製階段(Record)**: 1. 加載 Record and Replay 插件。 2. 授予錄屏權限。 3. 執行一系列操作: * 打開 Ulysses。 * 全選複製文章。 * 打開 Substack 後台。 * 創建新文章。 * 貼入正文。 * 添加訂閱按鈕。 * 貼入標題。 * 去除序號。 * 返回。 4. 結束錄製,Codex 自動創建 Skill。 * **回放與測試階段(Replay)**: 1. 指令 Codex 發布另一篇文章。 2. Codex 自動執行流程: * 找到 Ulysses。 * 複製文章。 * 打開 Chrome。 * 進入 Substack 後台。 * 創建文章。 * 貼入內容。 * 處理標題。 3. **問題發現**:草稿箱中缺少訂閱按鈕。 * **修正與驗證**: 1. 向 Codex 反饋遺漏(缺少訂閱按鈕)。 2. Codex 檢查錄像,確認判斷失誤,在 Skill 中補上添加訂閱按鈕的步驟。 3. 再次驗證:Codex 滾動至正文結尾,插入點,添加訂閱按鈕。 4. 結果:完全符合預期。 ### 3. 技術原理與總結 * **兩大核心能力**: 1. **多模態**:理解錄像內容。 2. **Computer Use**:執行用戶操作。 * **組合實體**:OpenEye 將多模態、Computer Use 與 Skills 組合起來。 * **意義**:推動人類技能被 AI 學會,讓視覺輸出成為 AI 學習的重要途徑。 ### 4. 社群推廣 * **講者介紹**:自稱國內少數能講明白 AI 的播主。 * **社群名稱**:Newtype。 * **社群規模**:運營超過 800 天,超過 2400 名付費成員。 * **加入渠道**: * 國內用戶:通過知識星球。 * 海外用戶:通過 Substack。 * **提供內容**:兩套課程、日常 Newsletter、專屬視頻。 ## 工具 / 模型 / 名詞整理 * **Codex**:提及更新功能的 AI 模型/系統。 * **Record and Replay**:Codex 的新功能名稱,指錄製與回放功能。 * **Skill**:由 AI 根據錄製操作生成的技能包/腳本。 * **Ulysses**:演示中使用的寫作軟件。 * **Substack**:演示中使用的發布平台/後台,也是海外用戶加入社群的渠道。 * **Chrome**:演示中使用的瀏覽器。 * **多模態**:提及的理解錄像的能力。 * **Computer Use**:提及的執行用戶操作的能力。 * **OpenEye**:提及將多模態、Computer Use 與 Skills 組合的實體(疑點:需查證是否為正確名稱)。 * **Newtype**:講者的社群名稱。 * **知識星球**:國內用戶加入社群的渠道。 ## 操作流程整理 **場景:從 Ulysses 複製文章並發布至 Substack** 1. **初始化**: * 加載 Record and Replay 插件。 * 授予錄屏權限。 2. **錄製階段(Record)**: * 打開 Ulysses。 * 全選並複製文章內容。 * 打開 Chrome 瀏覽器。 * 進入 Substack 後台。 * 創建新文章。 * 將複製的內容貼入正文。 * 添加訂閱按鈕。 * 貼入文章標題。 * 去除標題中的序號。 * 結束錄製,系統自動生成 Skill。 3. **回放階段(Replay)- 初次測試**: * 輸入指令發布另一篇文章。 * AI 自動執行:打開 Ulysses -> 複製 -> 打開 Chrome -> 進入 Substack -> 創建文章 -> 貼入內容 -> 處理標題。 * **結果**:草稿箱中缺少訂閱按鈕。 4. **修正階段**: * 用戶向 Codex 反饋遺漏(缺少訂閱按鈕)。 * Codex 檢查錄像,確認判斷失誤。 * Codex 在 Skill 中補上「添加訂閱按鈕」的步驟。 5. **驗證階段**: * 再次執行 Skill。 * AI 滾動至正文結尾,插入點,添加訂閱按鈕。 * **結果**:完全符合預期。 ## 值得注意的限制或風險 * **判斷失誤風險**:初次回放時,AI 可能遺漏某些視覺細節(如訂閱按鈕),需要用戶進行反饋修正。 * **依賴視覺環境**:Skill 的生成高度依賴錄製時的視覺環境和操作路徑,若目標軟體介面發生變化,Skill 可能失效。 * **反饋依賴**:需要用戶主動識別錯誤並向 AI 反饋,AI 才能自動修正 Skill,並非完全自動化的一鍵完美執行。 ## 逐字稿辨識疑點 * **OpenEye**:逐字稿中提及「OpenEye 把它們組合起來」,需查證是否為正確名稱或口誤。 * **多摩泰**:逐字稿中提及「基於兩個能力,一個是多摩泰」,疑為「多模態」的聽寫錯誤,但依規則標為疑點。 * **附現**:逐字稿中提及「因為它要附現用戶的操作」,疑為「復現」或「執行」的聽寫錯誤,但依規則標為疑點。 * **Y 和號**:逐字稿中提及「關於 AI 的 Y 和號」,疑為「YouTube」或其他詞彙的聽寫錯誤,但依規則標為疑點。 * **考出來**:逐字稿中提及「從寫作軟件 Ulyssies 裡考出來」,疑為「拷貝」或「導出」的聽寫錯誤,但依規則標為疑點。 * **純進**:逐字稿中提及「純進 Substack 裡」,疑為「進入」或「轉入」的聽寫錯誤,但依規則標為疑點。 * **序號**:逐字稿中提及「把序號去掉」,在標題處理語境下,疑為「序言」或「前綴」的聽寫錯誤,但依規則標為疑點。 * **Ulyssies**:逐字稿中提及「Ulyssies」,疑為「Ulysses」的聽寫錯誤,但依規則標為疑點。 ## 可延伸追問 * Record and Replay 生成的 Skill 在不同作業系統或軟體版本更新後的兼容性如何? * 除了跨軟體操作,該功能是否支援單一軟體內的複雜互動邏輯? * OpenEye 具體是什麼產品或服務?與 OpenAI 的關係為何? * 如何確保錄製的 Skill 在安全性上不會執行惡意操作?