# 影片筆記:Learn 95% of Codex in 30 minutes ## 一句話總結 OpenAI 推出的 AI Agent 工具 **Codex** 是一個具備「完全控制電腦」能力的超級應用程式,透過完整檔案存取、持久記憶、外掛連接、技能創建、影像生成、瀏覽器/電腦控制以及自動化功能,實現從知識工作到程式開發的全流程自動化,且所有產出預設儲存於使用者本地電腦。 ## 核心重點 1. **本地化與完全控制**:與 ChatGPT 或 Claude 不同,Codex 生成的檔案預設儲存於使用者本地電腦,並具備對電腦和瀏覽器的完全控制權。 2. **三大核心能力**: * **完整檔案存取**:支援專案管理,自動將產出物儲存至指定資料夾,支援多工處理與檔案引用。 * **持久記憶**:包含透過 `agents.md` 的手動記憶,以及由 Agent 自動維護的自動記憶。 * **外掛程式 (Plugins)**:連接 Gmail、Slack、Notion 等外部工具,擴展工作流。 3. **技能 (Skills) 與自動化**:可將反覆執行或滿意的操作流程轉化為可重複使用的「技能」,並設定為定期執行的「自動化」任務。 4. **內建生成與控制能力**:內建 GPT-image/2 進行圖像生成,並透過 `@computer use` 和 `@browser use` 插件控制桌面應用與瀏覽器。 5. **Chronicle 新功能**:透過持續記錄螢幕畫面獲取上下文,讓 AI 能根據使用者當前操作自動建議內容。 ## 詳細大綱 ### A. Codex 基本介紹與定位 * **目標受眾**:使用 ChatGPT、Claude、Claude Code、Claude Co-work 或 Codex,但不確定如何將其用於商業知識工作與程式開發的使用者。 * **核心定義**:OpenAI 的 AI Agent 超級應用程式 (Super App),提供易於使用的介面,用於知識工作 (Knowledge Work) 與程式開發 (Coding Work)。 * **與競品差異**: * ChatGPT/Claude:上傳的檔案儲存於雲端。 * Codex:上傳或生成的檔案全部儲存於使用者本地電腦。 * **功能範圍**: * 生成動態圖形影片 (Motion graphics video)。 * 建立登陸頁面 (Landing pages)。 * 生成圖片並放置於網站。 * 建立複雜遊戲與 3D 模擬。 * 建立具備前後端與專業設計的行動應用程式 (Mobile apps)。 * 建立桌面應用程式 (Desktop apps)。 * 生成 Excel 試算表、Word 文件、簡報 (可匯出至 Canva)。 * 完全控制電腦與瀏覽器。 ### B. 核心能力一:完整檔案存取 (Full File Access) * **檔案儲存機制**: * Agent 擁有電腦的完整檔案存取權限。 * 所有生成的檔案預設儲存於本地電腦,而非雲端。 * **專案管理 (Project Organization)**: * **建立聊天 (Chat)**:僅顯示在側邊欄,未關聯到特定資料夾。 * **建立專案 (Project)**: * 可從現有資料夾開始 (Start at existing folder)。 * 專案會顯示在左側面板。 * 在專案內的聊天所生成的文件,會自動儲存至該專案對應的本地資料夾中。 * **多工處理 (Multitasking)**: * 可同時建立多個聊天視窗。 * 支援「@提及」(At mention) 專案內的檔案,引用現有文件進行後續操作(例如將 Word 文件轉為登陸頁面)。 * **實戰案例:發票處理**: * 情境:處理資料夾內的 60 張發票照片。 * 操作:指定模型為 **GPT 5.5 high**。 * 流程:Agent 識別資料夾 -> OCR 提取文字 -> 分類交易 -> 建立 Excel 工作簿。 * 結果:生成包含儀表板、總支出、類別摘要、付款摘要及趨勢圖表的 Excel 檔案,儲存於本地。 ### C. 核心能力二:持久記憶 (Persistent Memory) Codex 具備兩種記憶類型,均儲存於本地檔案中: 1. **手動記憶 (Manual Memory)**: * **機制**:使用者要求 Agent 記住特定偏好或格式。 * **儲存位置**:`agents.md` 檔案。 * **特性**:是一個「活的文件」(Living document),會隨時間更新。使用者可手動更新或要求 Agent 更新。 * **案例**:使用者要求 Agent 記住特定的登陸頁面樣式(左側欄、目錄格式),Agent 會將此偏好寫入 `agents.md`。 2. **自動記憶 (Auto Memory)**: * **機制**:Agent 自動觀察並更新使用者行為與任務歷史。 * **儲存位置**:`Codex / memories` 資料夾內的檔案。 * **特性**:建議使用者不要手動修改,讓 Agent 自行維護以確保準確性。 * **用途**:提供使用者任務歷史摘要,可用於協助他人建立類似工作流。 ### D. 核心能力三:外掛程式 (Plugins) * **定義**:可安裝、可重複使用的套件,用於連接 OpenAI Codex 與外部工具、應用程式及工作流。 * **功能**:擴展 Agent 功能,連接使用者日常使用的工具。 * **操作方式**: * 透過 Plugins 標籤頁安裝(例如:Slack、Gmail)。 * 安裝後,外掛可能包含特定技能 (Skills),如 Gmail 技能、收件匣分類技能 (Inbox triage skill)。 * 目前支援超過 100 種外掛。 * **引用方式**:在聊天中使用「@提及」(At mention) 外掛名稱來調用。 * **實戰案例:品牌合作與腳本撰寫**: * **案例 1 (Gmail)**: * 情境:尋找過去兩週的品牌推廣郵件。 * 操作:建立專案資料夾,要求 Agent 搜尋 Gmail,研究品牌並建立包含相關註解的表格。 * 引用:使用 `@Gmail` 外掛。 * **案例 2 (Notion)**: * 情境:撰寫關於 CLIs 和 MCPs 的影片腳本。 * 操作:要求 Agent 查看 Notion 中的高質量長篇腳本,並使用 Excalidraw 圖表撰寫新腳本。 * 引用:使用 `@Notion` 外掛。 ### E. 技能 (Skills) 的應用與創建 1. **技能的概念** * 技能是可重複使用的工作流程配方 (Workflow recipes) 或標準作業程序 (SOPs)。 * 技能類似於插件,但本質上是指示文件 (Instruction files),代理 (Agent) 每次使用時都會遵循。 * 位置:位於插件 (Plugins) 資料夾下的技能 (Skills) 子資料夾。 * 調用方式:輸入斜線 (`/`) 即可快速訪問技能;插件則使用 `@` 符號。 2. **創建技能的方法** * **方法一:提示詞轉技能 (Prompt to Skill)** * 格式:「我想要你創建一個名為 [名稱] 的技能,功能是 [功能]」。 * 特點:生成可重複使用的指示文件,但講者認為效果可能不如方法二。 * **方法二:手動工作流程法 (Manual Workflow Method) - 推薦** * 流程:要求代理執行任務 -> 反覆調整與迭代直到滿意 -> 反向工程 (Reverse engineer) 將流程轉化為技能。 * 關鍵指令:「我對這個輸出很滿意,將其轉化為我可以使用的技能 (Turn this into a skill that I can use)」。 * 結果:代理會生成 `.md` 檔案(如 `brand deal researcher skill.md`),將整個工作流程轉化為指示。 3. **技能的更新與優化** * 技能可以包含調用特定插件的指示。 * 使用技能後若發現更好的格式或功能,可要求代理更新技能,使其未來總是採用該格式。 * 每次使用技能都是優化技能的機會。 ### F. 內建圖像生成 (Built-in GPT Image) 1. **功能說明** * Codex 內建 GPT-image/2 模型,可直接在系統內生成圖片。 * 屬於系統內建的推薦技能 (Recommended skills),預設使用最新且最佳的圖像模型,無需手動啟用。 2. **操作示範** * 創建新專案 (Content)。 * 上傳參考圖片(如毛衣)。 * 提示詞要求:生成不同國家模特兒穿著該毛衣的五張圖片(分別為 1 人、1 人、1 人、3 人、5 人的組合)。 * 結果:圖片生成後保存在內容資料夾中,並使用內建的 `image gen skill.md`。 ### G. 瀏覽器與電腦控制 (Browser Use & Computer Use) 1. **電腦控制 (Computer Use)** * 插件調用:`@computer use`。 * 功能:控制桌面應用程式。 * 示範:打開 Canva 應用程式,創建簡報,並將生成的圖片逐一放入幻燈片中。 * 特徵:使用者可見滑鼠游標移動,代理自動點擊與操作,無需使用者介入。 2. **瀏覽器控制 (Browser Use)** * 插件調用:`@browser use`。 * 功能:控制瀏覽器進行測試與互動。 * 示範:將 HTML 檔案轉為應用程式,並測試介面按鈕與導航功能。 * 特徵:代理控制瀏覽器游標,執行點擊、滾動、驗證按鈕功能等測試步驟。 ### H. 自動化 (Automation) 1. **功能說明** * 透過與 Codex 對話即可創建自動化任務。 * 可將已創建的技能設定為定期執行(每週、每日或每小時)。 2. **操作示範** * 基於之前創建的「品牌合作研究技能 (Brand deal researcher skill)」。 * 指令:「請在每個星期五上午 9:00 執行此操作,並更新此試算表」。 * 結果: * UI 中顯示自動化任務狀態(Active)。 * 設定為每週五上午 9:00 重複執行。 * 使用 `brand deal researcher skill` 掃描 Gmail 以獲取品牌贊助資訊。 ### I. 新功能:Chronicle 研究預覽版 * **啟用方式**:Settings > Personalization > 開啟「Chronicle research preview」。 * **運作機制**: * 持續記錄螢幕畫面。 * 獲取使用者當前工作內容的上下文。 * 看似具有侵入性(invasive),但能提供即時情境感知。 * **操作示範**: * 指令:「use Chronicle」。 * 請求:「告訴我應該在我的 Codex 視覺簡報中添加什麼」。 * 結果:AI 識別近期螢幕截圖,建議添加「Codex super app map」、「prompt files 的全控制迴圈圖表」、「Chronicle 演示投影片」等內容。 * 關鍵點:無需上傳圖片或 Excalidraw 文件,AI 僅憑螢幕監控即可理解簡報內容。 ### J. Codex 功能總覽回顧 * **檔案控制 (Full file control)**:建立、編輯、刪除任何檔案。 * **記憶系統 (Persistent memory)**: * 自動記憶。 * 手動記憶(透過 `agents.md` 檔案)。 * **外掛 (Plugins)**:平台內建,連接 Agent 至所有工具。 * **技能 (Skills)**:將 Agent 執行的任務轉換為技能。 * **影像生成 (Image generation)**: * 支援影像生成。 * 宣稱為全球最佳模型:GPT-image-2。 * **瀏覽器控制與電腦使用 (Browser control and computer use)**: * Agent 可像人類一樣控制電腦。 * 介面包含鍵盤、滑鼠、螢幕。 * 效能持續指數級提升。 * **自動化 (Automations)**: * 將任務設定為定期執行(每日、每小時、每週、每月)。 ## 工具 / 模型 / 名詞整理 * **OpenAI Codex** (或稱 Code X):影片主要介紹的 AI Agent 工具。 * **ChatGPT**:對比對象,檔案儲存於雲端。 * **Claude**:對比對象,檔案儲存於雲端。 * **Claude Code**:對比對象。 * **Claude Co-work**:對比對象。 * **GPT 5.5 high**:影片中選擇使用的模型版本。 * **GPT 5.5**:提及的模型名稱。 * **GPT-image/2** (或 GPT-image-2):Codex 內建使用的圖像生成模型名稱。 * **Canva**:桌面應用程式名稱,用於創建簡報;簡報匯出目標工具。 * **Slack**:Codex 支援連接的外掛工具。 * **Gmail**:Codex 支援連接的外掛工具。 * **Notion**:Codex 支援連接的外掛工具。 * **Excalidraw**:用於繪製圖表的工具;提及「give it an Excalidraw document」。 * **Finder**:macOS 檔案管理系統(提及「Open in Finder」)。 * **agents.md**:儲存手動記憶的檔案名稱。 * **Codex / memories**:儲存自動記憶的資料夾路徑。 * **@computer use**:控制電腦應用程式的插件調用方式。 * **@browser use**:控制瀏覽器的插件調用方式。 * **@Gmail**:引用 Gmail 外掛的方式。 * **@Notion**:引用 Notion 外掛的方式。 * **brand deal researcher skill.md**:講者手動創建的技能檔案名稱。 * **image gen skill.md**:Codex 內建的圖像生成技能檔案。 * **Excalidraw diagram skill**:用於創建圖表的技能。 * **YouTube researcher skill**:用於研究 YouTube 相關內容的技能。 * **YouTube thumbnail skill**:用於處理 YouTube 縮圖的技能。 * **Chronicle**:Codex 內的新功能/模組名稱,位於 Settings > Personalization。 * **index.html**:瀏覽器中打開的檔案類型。 * **CLIs and MCPs**:提及影片主題包含 "CLIs" 與 "MCPs"。 * **seven capabilities folder**:使用者建立專案資料夾時命名。 * **receipts to process**:資料夾名稱。 * **learn 90% of OpenAI Codex in under 2 minutes**:生成的 Word 文件標題。 ## 操作流程整理 ### 流程一:建立專案與處理發票 (完整檔案存取) 1. 建立專案 (Project),選擇從現有資料夾開始。 2. 指定模型為 **GPT 5.5 high**。 3. Agent 識別資料夾內的發票照片。 4. Agent 執行 OCR 提取文字並分類交易。 5. Agent 建立 Excel 工作簿,包含儀表板、總支出、類別摘要、付款摘要及趨勢圖表。 6. 檔案自動儲存至專案對應的本地資料夾。 ### 流程二:創建與使用技能 (Skills) 1. **創建技能 (手動工作流程法)**: * 要求 Agent 執行特定任務。 * 反覆調整與迭代直到滿意。 * 輸入指令:「我對這個輸出很滿意,將其轉化為我可以使用的技能」。 * Agent 生成 `.md` 檔案 (如 `brand deal researcher skill.md`)。 2. **使用技能**: * 在聊天中輸入斜線 (`/`) 訪問技能列表。 * 選擇並執行該技能。 3. **更新技能**: * 若發現更好格式,要求 Agent 更新技能,使其未來採用該格式。 ### 流程三:圖像生成 (內建 GPT Image) 1. 創建新專案 (Content)。 2. 上傳參考圖片 (如毛衣)。 3. 輸入提示詞要求生成不同國家模特兒穿著該毛衣的圖片。 4. Agent 使用內建 `image gen skill.md` 生成圖片。 5. 圖片保存至內容資料夾。 ### 流程四:電腦與瀏覽器控制 1. **電腦控制**: * 調用 `@computer use` 插件。 * Agent 自動打開桌面應用 (如 Canva)。 * Agent 自動點擊、操作,將生成的圖片放入幻燈片。 2. **瀏覽器控制**: * 調用 `@browser use` 插件。 * Agent 控制瀏覽器游標,執行點擊、滾動、驗證按鈕功能等測試步驟。 ### 流程五:設定自動化 (Automation) 1. 基於已創建的技能 (如 `brand deal researcher skill`)。 2. 輸入指令: