影片筆記:Loop Engineering 火了:AI Agent 的杠杆,正在从 Prompt 移到 Loop
一句話總結
隨著 AI Coding Agent(如 Claude Code、Codex)能力的提升,開發重點正從單次的「提示詞工程(Prompt Engineering)」轉向設計自我迭代與可審計的「Loop 工程(Loop Engineering)」,透過雙執行機制、模組化架構及人工閘口,實現 Agent 的企業級可控與自動化複利。
核心重點
趨勢轉變:矽谷熱門趨勢顯示,開發者應從主動提示 Coding Agent 轉向設計引導 Agent 的循環(Loop)。這是由於 Agent 具備長任務執行能力、工具調用增強,以及企業對可重複、可審計工作流的需求。
Loop 的核心機制:
- 強調「執行者」與「觀察/反思者」分離的雙執行玩法(Double Execution)。
- 形成自我迭代的閉環,不僅觀察結果,更觀察過程與步驟,基於目標進行反思與改進。
Loop Engineering 架構:
- 引用 Google 工程師 Addy 的博客,將 Loop 拆解為五大模組:自動化(Automation)、工作樹(Worktree)、技能(Skill)、連接器(Connector)、子代理(Sub Agents),以及一個記憶機制(Memory)。
實戰關鍵要素:
- 驗收標準:明確 Loop 何時持續執行、何時停止。
- 權限邊界:遵循最小權限原則,明確修改、刪除、訪問及自動支付等權限。
- 人工審查閘口(Human Gate):超出權限邊界時需人工介入,決定 Loop 暫停或協助拍板。
- 可觀察性:不僅結果可觀察,Loop 整個過程(任務拆解、執行動作)均需可觀察。
詳細大綱
I. Loop 概念的興起與背景
- 矽谷熱門趨勢:
- OpenClaw 創始人 Peter Steinberger 提醒:不應再主動提示 Coding Agent,而應設計引導 Agent 的循環(Loop)。
- Claude Code 負責人 Boris Cherny 表示:其工作本質是「寫 Loop」。
- Google 工程師 Addy 發表文章闡述「Loop Engineering」。
- 講者觀點:
- 講者自稱一年前已開始實踐 Loop 思維(提及 2025年12月分享科研製圖,4月分享組織提效)。
- 認為當前技術階段適合推廣此概念。
- 推動 Loop 火的四大趨勢:
Coding Agent(如 Claude Code, Codex)具備處理長任務能力。
模型調用工具(插件、API)能力增強,更新頻繁。
企業端關注可重複、可測試、可審計的 Agent 工作流。
真實企業任務中,Token 成本、失敗率及權限風險成為問題,需將 Agent 升級為可控的 Loop。
II. Agent Loop 的核心機制
- 定義:底層機制,涉及目標設定、任務規劃、執行、結果輸出。
- 閉環關鍵:
- 不僅觀察結果,還要觀察過程與步驟。
- 基於目標進行反思、復盤與改進。
- 雙執行玩法(Double Execution):
- 一個 Agent 負責執行(如 Codex)。
- 另一個 Agent(如 CC 或 GPT)負責觀察與反思。
- 引入第三方評審機制,促使執行者不斷迭代演進。
- 演進階段:
提示詞工程(Prompt Engineering):提升模型對單次輸入的理解力。
工作流工程(Workflow Engineering) / 上下文工程(Context Engineering):解決任務流串聯與大項目背景理解。
Harness 工程(Harness Engineering):解決運行層問題,搭建執行環境、工具反饋、權限框架與驗證信號(CC 與 Codex 在此層表現較好)。
Loop 工程(Loop Engineering):設計 Agent 自我演進的閉環,系統替代人工進行提示、檢查與糾偏。
III. Loop Engineering 的架構解析(基於 Addy 博客)
- 五大模組 + 記憶機制:
自動化(Automation):
- 作用:解決「誰啟動循環」,讓 Agent 在特定條件或固定頻率下自動醒來。
- 實現:Codex 的心跳機制;CC 的定時任務運行符。
工作樹(Worktree):
- 作用:隔離倉,解決多個 Agent 同時工作衝突問題。
- 特性:共享 Git 歷史,但文本副本獨立,讓並行不變成混亂。
技能(Skill):
- 作用:解決 Agent 非從零理解項目,提供固定的沉澱工作流與封裝能力。
- 區別:Skill 是經驗,Loop 是讓經驗循環執行的系統。
- 操作:可通過斜杠命令查找、刪除、合併 Skill。
連接器(Connector):
- 作用:包含 MCP、插件、API 接口,賦予通用 Agent 泛化能力。
- 範例:Codex 本身不能剪輯,但通過接入外部工具可實現剪輯、收發郵件、生成 MV/音樂。
子代理(Sub Agents):
- 作用:分離「檢查者」與「製圖者/執行者」角色。
- 原則:一個負責探索與代碼編排,另一個負責驗證現有規範。
- 重要性:避免過擬合,確保創建者與檢查者分離,實現信息互通共聯。
狀態記憶(Memory):
- 作用:解決模型遺忘問題,將經驗沉澱、錯誤規避、工作留痕。
- 價值:產生複利,使 Loop 成為真正的循環。
IV. 講者補充的實戰關鍵要素
- 驗收標準(Acceptance Criteria):
- 明確 Loop 何時持續執行、何時停止。
- 應在啟動目標(Goal)時寫入。
- 權限邊界(Permission Boundaries):
- 企業級 Loop 需遵循「最小權限原則」。
- 明確能否修改、刪除、訪問特定網絡、自動支付 API、發送消息(如 Slack)或合併代碼。
- 人工審查閘口(Human Gate / Human Review):
- 當超出特定權限邊界時,需人工觀察介入。
- 決定 Loop 何時暫停及需要人類協助拍板的情況。
- 可觀察性(Observability):
- 不僅結果可觀察,Loop 整個過程(任務拆解、執行動作)均需可觀察。
- 基於審核對比機制不斷提升任務有效性。
V. 總結與呼籲
- Loop 思維的價值:
- 將 AI 轉為真正的生產系統。
- 高級玩家不再追求長 Prompt,而是設計可循環、迭代、沉澱的生產機制。
- 將瞬間靈感轉為長效工作機制,將單次對話轉為自動化複利過程。
- 行動呼籲:
- 回顧講者前期關於 Loop 的視頻。
- 歡迎在評論區交流,點讚訂閱。
工具 / 模型 / 名詞整理
- OpenClaw:提及的項目/公司。
- Peter Steinberger:OpenClaw 創始人。
- Boris Cherny:Claude Code 負責人。
- Claude Code (CC):AI 編碼工具。
- Addy:Google 工程師,發表關於 Loop Engineering 的文章。
- Google Chrome / Google Cloud AI:提及的 Google 產品。
- Codex:OpenAI 的編碼 Agent。
- OpenAI:公司名稱。
- GPT:模型系列。
- Gemini:Google 的模型系列。
- MCP:Model Context Protocol,連接器的一部分。
- Slack:通訊工具,提及發送消息的權限。
- Git:版本控制系統,提及共享歷史。
- PR (Pull Request):代碼合併請求。
- Dry run:術語,指模擬運行。
- Smoke test:術語,指冒煙測試。
- Loop Engineering:影片核心概念,指設計 Agent 自我演進閉環的工程方法。
- Double Execution:雙執行玩法,執行者與觀察者分離。
- Worktree:隔離倉,用於解決多 Agent 衝突。
- Skill:封裝的工作流與經驗。
- Connector:連接外部工具與 API 的接口。
- Sub Agents:子代理,用於分離檢查與執行角色。
- Memory:狀態記憶,用於沉澱經驗與避免遺忘。
- Human Gate:人工審查閘口。
- Observability:可觀察性,涵蓋過程與結果。
操作流程整理
啟動與自動化:
- 設定自動化觸發條件(如特定條件或固定頻率)。
- 利用工具(如 Codex 心跳機制、CC 定時任務)讓 Agent 自動醒來啟動循環。
環境隔離與準備:
- 使用 Worktree 建立隔離倉,確保多個 Agent 並行工作時不產生衝突。
- 共享 Git 歷史,但保持文本副本獨立。
執行與工具調用:
- 執行 Agent(Maker)根據目標進行任務規劃與代碼編排。
- 通過 Connector(MCP、插件、API)調用外部工具(如剪輯、郵件、生成內容)。
- 若無特定技能,可通過 Skill 調用封裝好的工作流。
雙執行與反思:
- 觀察/反思 Agent(Tracker)監控執行過程與結果。
- 引入第三方評審或子代理機制,對比執行者與檢查者的輸出。
- 基於目標進行反思、復盤,識別偏差。
權限檢查與人工介入:
- 檢查當前操作是否在預設的權限邊界內(最小權限原則)。
- 若涉及敏感操作(如自動支付、合併代碼、發送消息)或超出邊界,觸發 Human Gate。
- 人工審查並決定是否暫停 Loop 或協助拍板。
記憶沉澱與迭代:
- 將本次循環的經驗、錯誤規避方法、工作留痕存入 Memory。
- 更新 Skill 或調整 Loop 參數,實現經驗複利。
- 根據驗收標準判斷是否繼續循環或停止。
可觀察性監控:
- 全程記錄任務拆解、執行動作及結果。
- 基於審核對比機制,持續提升任務有效性與系統穩定性。
值得注意的限制或風險
- Token 成本與失敗率:真實企業任務中,Loop 的持續運行可能帶來高昂的 Token 成本及較高的失敗率。
- 權限風險:若權限邊界設定不當,Agent 可能執行未經授權的操作(如修改代碼、發送消息、自動支付)。
- 過擬合風險:若創建者與檢查者未有效分離,可能導致過擬合,影響系統泛化能力。
- 模型遺忘問題:若缺乏有效的 Memory 機制,Agent 可能在長任務中遺忘關鍵經驗或上下文。
- 並行衝突:多個 Agent 同時工作若無 Worktree 等隔離機制,可能導致混亂。
逐字稿辨識疑點
- Loop l o o p:逐字稿中出現此拼寫,疑為口語強調或聽寫特徵。
- Openclaw:通常知名項目為 OpenClaw 或類似拼寫,此處依逐字稿保留。
- Peter Steinberger:OpenClaw 創始人,名稱依逐字稿保留。
- Boris Cherny:Claude Code 負責人,名稱依逐字稿保留。
- Addy:Google 工程師,僅提及名字,疑為暱稱或簡稱。
- CC:在文中多次出現,指代 Claude Code,依逐字稿保留。
- Harness 框架:文中提及「Harness 框架的成熟」及「Harness engineering」,疑為特定技術術語或聽寫,依逐字稿保留。
- 2025年的12月:時間點為未來時間,依逐字稿保留,疑為口誤或特定時間線敘述。
- 4月份:與 2025年12月 的時間順序邏輯需查證,依逐字稿保留。
- Worktree:文中解釋為「隔離倉」,並提到在 Codex 設置中可見,依逐字稿保留。
- Sub agents:原文引用為「SUB agents keep the maker away from the Tracker」,依逐字稿保留。
- Tracker:在 Sub agents 描述中出現,指代檢查者角色,依逐字稿保留。
- Maker:在 Sub agents 描述中出現,指代執行者角色,依逐字稿保留。
- Dry run:術語,依逐字稿保留。
- Smoke test:術語,依逐字稿保留。
可延伸追問
- 如何在實際企業環境中平衡 Loop 的自動化效率與人工審查(Human Gate)的成本?
- 對於不同規模的團隊,Worktree 和 Skill 的最佳實踐配置是什麼?
- 如何量化 Loop Engineering 帶來的 Token 成本節省與效率提升?
- 在缺乏成熟 Memory 機制的當前模型下,如何有效實現經驗的長期沉澱?
- Addy 提出的 Loop Engineering 五大模組在主流 AI 編碼工具(如 Claude Code, Codex)中的具體實現差異為何?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。