# 影片筆記:ChatGPT App 基本功 EP07:一份 YAML,指揮 6 個 AI 同時做簡報 ## 一句話總結 本集探討在 ChatGPT App(或稱 TrackGPT/Cloud Code)環境中,如何利用 **Subagent(子代理)** 進行平行處理來加速圖片生成,並透過 **YAML 規格書** 統一簡報風格與版型,以解決內建生圖速度慢的問題,同時對比了訂閱額度與 OpenAI API Key 的優缺點。 ## 核心重點 1. **加速原理**:利用 **Subagent(子代理)** 進行平行工作(Parallel Work)。若任務無依賴關係(如生成不同圖片),可同時啟動多個 Subagent。 2. **效能與代價**:同時啟動 N 個 Subagent 可獲得 N 倍速度,但相對消耗 N 倍的 Token/額度。官方預設上限為 **6 個** Subagent。 3. **YML Image Deck 技能**:透過 YAML 規格書定義「風格(Style)」、「版型(Layout)」與「內容(Content)」,確保簡報生成的一致性。 4. **輸出模式**: * **Backit**:純圖片簡報(文字烤進圖片,不可編輯)。 * **Plat**:可編輯文字簡報(生成底圖後,在簡報軟體中疊加文字)。 5. **生圖方案對比**: * **訂閱額度**:免費但速度慢,受伺服器排隊影響。 * **OpenAI API Key**:速度快(約 1 分鐘 5 張),品質與內建無差別(基於 T40/SDXL 模型),但需額外付費(約 0.3 元台幣/張)。 6. **實戰風險**:大量消耗額度可能觸發 **429 錯誤**(速率限制);同時運行多個 Subagent 會大量消耗記憶體(RAM),導致電腦運算變慢、滑鼠延遲。 ## 詳細大綱 ### 一、 生圖速度瓶頸與 Subagent 加速原理 * **現狀問題**:QRGBT/AGIN 內建生圖功能依賴訂閱額度,生成速度極慢,且每次生成後會進行檢查與驗證,進一步拖慢進度。 * **Subagent 加速機制**: * 利用 **Subagent** 進行平行工作。 * 若工作之間無依賴關係,可同時啟動多個 Subagent。 * **速度與消耗**:同時啟動 N 個 Subagent 可獲得 N 倍速度,但相對消耗 N 倍的 Token/額度。 * **上限設定**:官方預設最多可同時開啟 **6 個** Subagent。需調整設定(如推理強度或特定參數)以達到上限。 * **風險提示**:短時間內大量消耗額度,可能觸發 429 錯誤或燒完週額度。 ### 二、 YML Image Deck 技能運作邏輯 * **核心概念**:這不是繪圖程式,而是「設計合約」。透過 YAML 規格書統一風格、版型與內容。 * **三層架構**: 1. **風格(Style)**:先定義整體視覺風格(如立體貼紙、溫暖質感、霓虹科技)。 2. **版型(Layout)**:根據內容決定版面配置(對比、並排、順序等),版型需與風格一致。 3. **內容(Content)**:將文字與資訊填入版型。 * **生成流程**: 1. 讀取內容並決定版型。 2. 生成提示詞(Prompt)。 3. 利用 Subagent 平行生成圖片。 4. 封裝成簡報格式。 * **輸出模式**: * **Backit**:純圖片簡報(文字直接烤進圖片,不可編輯)。 * **Plat**:可編輯文字簡報(生成底圖後,在簡報軟體中疊加文字)。 ### 三、 API Key 生圖方案對比 * **訂閱額度生圖**: * 優點:免費(包含在訂閱費中)。 * 缺點:速度慢,受伺服器排隊影響。 * **OpenAI API Key 生圖**: * 優點:速度極快(約 1 分鐘 5 張),品質與內建生圖無差別(基於 T40/SDXL 模型)。 * 缺點:需額外付費(約 0.3 元台幣/張),需自行安裝技能(如 TrackGPT Image 2 至 Cloud Code)。 * 適用性:適用於任何 AGIN(Cloud Code, TrackGPT App 等)。 ### 四、 實戰操作與設定調整 * **設定調整**:需在軟體(如 Codex/Cloud Code)中調整設定,將 Subagent 上限調至 6 個,並可能需要重啟應用程式以套用設定。 * **硬體效能**:同時運行多個 Subagent 會大量消耗記憶體(RAM),導致電腦運算變慢、滑鼠延遲(Delay)。 * **進度追蹤**:講者演示了從 3 個 Subagent 升級到 6 個 Subagent 的過程,並比較了 API Key 與訂閱額度的生成速度差異。 ### 五、 技術嘗試與失敗過程(第二段補充) * **工具比較與選擇**: * 講者表示目前使用 **Codex** 與 **Cloud Code** 進行簡報生成。 * 認為其可編輯性比 **NotebookLM** 更佳,因此不再使用 NotebookLM。 * 建議固定喜歡的风格(如使用 **Cloud Design** 或 **Open Design**),以確保風格一致性。 * **效能評估與痛點**: * **GPT** 的優點在於「生徒」(生成簡報/圖片),這是其他家較沒有的優勢。 * 主要缺點是速度太慢,講者多次強調「實在是太慢了」、「生徒啦」。 * 雖然 GPT 在規劃文字或寫程式方面 OK,但生成簡報時效率低落。 * 講者串接 **Cloud Code** 的目的正是為了讓生成過程快一點。 * **技術嘗試與失敗過程**: * 嘗試使用 **OpenAI API Key** 搭配 **6 個 Subagent**(子代理)。 * 過程中遇到問題導致停止,原因可能是 **Codex** 禁止代理呼叫外部 API。 * 講者觀察到使用 **Image2** 或訂閱字深圖(深圖)在 **YM**(疑點)下結果應相同,但 API Key 深圖需要較完整的提示詞才能固定內容。 * 嘗試讓 **OpenAI API Key** 生成另一種風格,發現品質差異不大。 * 傳統簡報加圖片的方式可行,但講者不願繼續等待。 * **結論與互動**: * 因耗時過久(已過 11 點),講者決定放棄 **API Key 生徒** 的嘗試。 * 保留失敗畫面讓觀眾看到真實情況。 * 呼籲觀眾訂閱、按讚、分享以支持節目。 ## 工具 / 模型 / 名詞整理 * **平台/應用程式**: * **QRGBT APP**:影片標題提及的平台。 * **AGIN**:指代 AI Agent 環境。 * **TrackGPT** / **TranceGPT**:講者主要使用的應用程式(講者口語中交替使用)。 * **Cloud Code**:講者日常主力使用的 Agent 環境。 * **Open Code**:講者提及的另一個環境。 * **ChadGPT** / **Changeby**:講者提及的其他 Agent 名稱。 * **Codex**:講者提及的應用程式,用於調整 Subagent 設定。 * **Gemini Notebook**:講者提及已不再主要使用的工具。 * **NotebookLM**:講者對比的可編輯性較差的工具。 * **技能/功能名稱**: * **YML Image Deck**:講者介紹的簡報生成技能。 * **Subagent** / **Subaging** / **Sub-a-gene**:指代子代理,用於平行處理任務。 * **Backit**:純圖片簡報輸出模式。 * **Plat**:可編輯文字簡報輸出模式。 * **Draw**:講者提及的使用 API Key 的生圖技能名稱。 * **TrackGPT Image 2**:講者推薦安裝以使用 API Key 生圖的技能。 * **Cloud Design** / **Open Design**:講者建議固定的風格名稱。 * **技術/規格**: * **YAML** / **Spec.yml**:用於定義規格、風格與版型的標記語言。 * **API Key**:OpenAI 的應用程式介面金鑰。 * **OpenAI Image 2**:講者提及的模型名稱(疑點:通常指 DALL-E 3 或特定版本,講者口語為 Image 2)。 * **T40**:講者提及的模型相關詞彙(疑點:可能是指 SDXL 或其他模型代號,聽似 T40)。 * **429**:HTTP 狀態碼,指觸發速率限制(Too Many Requests)。 * **5小時額度 vs 週用量**:講者提到 Cloud Code 有「5小時用量」與「週用量」的區別,並建議改為週用量,此為該平台特定的計費或限制機制描述。 ## 操作流程整理 1. **環境準備**: * 安裝或開啟 **TrackGPT** / **Cloud Code** / **Codex** 等 Agent 環境。 * 若需使用 API Key 生圖,需安裝相關技能(如 **TrackGPT Image 2**)。 * 調整軟體設定,將 **Subagent** 上限調至 **6 個**,並視情況重啟應用程式。 2. **定義規格(YAML)**: * 撰寫 **YML Image Deck** 規格書。 * 定義 **風格(Style)**:如立體貼紙、溫暖質感等。 * 定義 **版型(Layout)**:如對比、並排、順序等。 * 定義 **內容(Content)**:填入文字與資訊。 3. **生成與輸出**: * **方案 A(訂閱額度)**:使用內建生圖功能,速度較慢,但免費。 * **方案 B(API Key)**:使用 **OpenAI API Key**,速度極快(約 1 分鐘 5 張),需付費。 * **平行處理**:啟動多個 **Subagent** 同時生成圖片。 * **選擇輸出模式**: * **Backit**:生成純圖片簡報。 * **Plat**:生成底圖後,於簡報軟體中疊加可編輯文字。 4. **監控與風險管理**: * 監控 Token/額度消耗,避免觸發 **429 錯誤**。 * 注意電腦記憶體(RAM)使用情況,避免系統當機或延遲。 ## 值得注意的限制或風險 1. **額度與速率限制**: * 同時啟動多個 Subagent 會快速消耗 Token/額度。 * 短時間內大量請求可能觸發 **429 錯誤**(Too Many Requests)。 * 訂閱用戶需注意「5小時用量」與「週用量」的限制。 2. **硬體資源消耗**: * 同時運行多個 Subagent 會大量消耗記憶體(RAM)。 * 可能導致電腦運算變慢、滑鼠延遲(Delay)。 3. **技術兼容性與錯誤**: * 使用 **Codex** 搭配 **OpenAI API Key** 時,可能遭遇代理呼叫外部 API 被禁止的問題。 * 部分技能或模型名稱(如 Image 2, T40)可能存在辨識錯誤或特定版本差異。 4. **時間成本**: * 即使使用加速技巧,複雜的簡報生成仍可能耗費大量時間(如講者實戰中耗至晚上 11 點)。 ## 逐字稿辨識疑點 * **QRGBT**:影片標題與開頭提及,後續多稱為 TrackGPT 或 AGIN,需確認是否為特定品牌或口誤。 * **Subaging / Sub-a-gene / Sub-edge / Sub-H**:講者在不同段落對 "Subagent" 的發音或拼寫略有不同,統一理解為 Subagent。 * **T40**:講者提到「原來上 T40 寫好的話」,疑點為模型名稱或技術規格,需查證。 * **Image 2**:講者提到「OpenAI 的 Image 2」,OpenAI 目前主流為 DALL-E 3,Image 2 可能為講者口誤或特定內部版本名稱。 * **Backit / Plat**:講者定義的輸出模式名稱,非通用標準術語,為該技能專屬術語。 * **TrackGPT vs TranceGPT**:講者口語中交替使用,疑點為同一產品的不同稱呼或聽寫錯誤。 * **ChadGPT / Changeby**:講者提及的其他 Agent 名稱,疑點為特定產品名稱或口誤。 * **Clock code / Calco**:講者在後半段將 "Cloud Code" 聽寫或口誤為 "Clock code" 和 "Calco",需查證正確名稱。 * **生徒 / 生土**:逐字稿中多次出現「叫他生土」、「生徒啦」、「生徒這件事情真的很慢」、「API Key生徒失敗」。根據上下文推測應指「生成簡報」或「生成圖片」,但聽寫為「生徒」或「生土」,需查證是否為特定術語或口誤。 * **7GPT**:講者提到「7GPT什麼都好」,疑點為是否指代特定模型版本或口誤。 * **YM**:講者提到「如果用YM的話」,需查證此縮寫指代的具體工具或平台。 * **深圖**:講者提到「訂閱字深圖」、「API Key深圖」,疑點為是否指「生成圖」或特定功能名稱。 * **甚PBT**:講者提到「甚PBT」,需查證此縮寫或產品名稱。 ## 可延伸追問 1. **YAML 規格書的具體語法結構**:如何撰寫一份完整的 `Spec.yml` 來定義複雜的簡報版型與風格? 2. **Subagent 的平行處理限制**:除了數量上限(6個),Subagent 之間是否有隱性的依賴關係會導致平行處理失效? 3. **OpenAI API Key 的成本效益分析**:對於一般用戶而言,訂閱額度與自行購買 API Key 的成本平衡點為何? 4. **Backit 與 Plat 的實際應用場景**:在什麼情況下應選擇不可編輯的 Backit, versus 可編輯的 Plat? 5. **如何解決 Codex 禁止呼叫外部 API 的問題**:是否有替代方案或設定技巧來繞過此限制?