影片筆記:AI 時代非技術人最該學的設計能力:把 Human SOP 變成 Agentic Workflow
一句話總結
將傳統給人類閱讀的 Human SOP 轉化為適合 AI Agent 執行的 Agentic Workflow,核心在於透過「任務拆解」(Task Decomposition)將大任務分解為多個明確的小任務(Small Tasks),並結合結構化標準、雙向迭代開發與 Human-in-the-loop 機制,以解決單一 Mega Agent 的黑箱與不穩定問題。
核心重點
Human SOP 與 Agentic Workflow 的差異:
- Human SOP:通常是簡報或 Word 文件,寫給人看,依賴人類腦補 Context 與判斷例外,對 Agent 而言是非結構化文字,理解成本高。
- Agentic Workflow:由多個 Agents、Tools、Skills、資料源組成的完整工作流(生產線),強調可預測、有邊界、出錯可修。
- Skill:將方法論、判斷標準、踩坑紀錄打包給 Agent 的執行單位,對應單一任務,非整條工作流。
拒絕 Mega Agent,主張分而治之:
- Mega Agent 缺陷:將大任務整包丟給單一模型,導致黑箱操作、無法追蹤推理過程、出錯時難以定位問題(Prompt、工具或模型幻想),缺乏穩定性、可觀測性與可修復性,無法直接上線 Production。
- 核心主張:問題不在模型能力,而在任務是否被拆解為明確的小任務。好的任務拆解能力能構建更穩定的系統。
四步法:將 Human SOP 轉為 Agentic Workflow:
- Step 1: 格式標準化:將自然語言流程轉為結構化、參數化的 SOP。使用 RFC 2119 標準(MUST/SHOULD/MAY)定義規則強度,並區分 Parameters、Steps、Error Handling。
- Step 2: 任務拆解與連結:將流程拆解為 Pipeline Steps,各步驟擁有明確的 Input/Output。透過 Artifacts(如 JSON)將上一個 Agent 的 Output 變成下一個 Agent 的 Input 進行串接。
- Step 3: 雙向開發:透過「寫 SOP -> 執行 -> 發現錯誤 -> 修正 SOP」的迭代循環處理默會知識(Tacit Knowledge)。採用 Scrum 精神小步快跑,先上線粗糙但可用的版本,穩定滿足 95% 情境,剩餘 5% Edge Case 交由 Human-in-the-loop。
- Step 4: 整合與執行環境:將 Workflow 接上真實工具(Tools,如內部系統、資料庫、API),並設計 Human-in-the-loop 檢查點以處理高風險決策,確保「人類掌舵,Agent 執行」。
技術生態與 MCP:
- MCP (Model Context Protocol):作為統一 AI 呼叫外部工具的標準協定,比喻為 AI 世界的 USB-C。由 Anthropic 於 2025 年初捐給 Linux Foundation 底下的 Agentic AI Foundation,成為長期維護的開放標準。
- 企業應用:IBM、AWS、ServiceNow 等大公司已將 Agentic Workflow 應用於 IT Ticket、HR 請求等流程,取代傳統規則引擎。
詳細大綱
I. 核心觀念與定義釐清
- 現狀問題:前沿模型能力雖強,但常因任務過大、模糊導致產出不靠譜。
- 三大名詞定義:
Human SOP:傳統流程檔案,依賴人類腦補 Context。
Skill:包含 SKILL markdown(核心 SOP)、References(參考資料)、Scripts(執行指令碼),對應單一任務。
Agentic Workflow:完整的生產線式工作流。
II. 為什麼需要拆解?(Mega Agent 的缺陷)
- 定義差異風險:人類與 AI 對抽象詞彙(如「乾淨」)定義不同,導致產出偏差。
- Mega Agent 問題:
- 黑箱操作,無法追蹤推理過程。
- 出錯時難以定位問題。
- 缺乏穩定性、可觀測性、可修復性,無法直接上線 Production。
- 分而治之(Divide and Conquer):設計一條可預測、有邊界、出錯可修的生產線,而非訓練超人 Agent。
III. 實戰方法論:四步將 Human SOP 轉為 Agentic Workflow
以「洗衣服」為例,演示如何將口頭流程轉為結構化 Workflow。
#### Step 1: 格式標準化 (Standardization)
- 目標:將 Human SOP 轉為 Agent 可讀懂的版本。
- 關鍵動作:
引數化 (Parameterization):避免寫死情境,改用 Template(如 mode, temperature),提高 SOP 重複使用率與容錯率。
RFC 2119 規範:
- MUST:硬性規定,絕對不能跳過。
- SHOULD:建議作法,若有強烈理由可不做,但需說明原因。
- MAY:選填專案,做不做皆可。
結構化格式:使用 Markdown 區分 Parameters、Steps、Error Handling,便於後續接入 MCP 等標準介面。
#### Step 2: 任務拆解與連結 (Task Decomposition & Linking)
- 目標:將流程 Decompose 為 Pipeline Steps。
- 關鍵動作:
- 每個 Step 為獨立節點,擁有獨立 Input/Output,可獨立執行、Debug 或替換。
- 串接機制:透過 Artifacts(上一個 Agent 的 Output 變成下一個 Agent 的 Input,例如 JSON 格式)進行連結。
- 優點:局部錯誤(如分類錯誤)僅需修復該節點,不影響其他邏輯。
#### Step 3: 雙向開發 (Bidirectional Development)
- 目標:處理「默會知識」(Tacit Knowledge),透過迭代完善 SOP。
- 關鍵動作:
- 迭代循環:寫第一版 SOP -> 實際執行 -> 發現撞牆/錯誤 -> 回頭補充規則 -> 再執行。
- Scrum 精神:小步快跑,快速迭代。兩週內上線粗糙但可用的版本,優於花兩個月寫完美但無法運行的 SOP。
- 最終穩定滿足 95% 情境,剩餘 5% Edge Case 交由 Human-in-the-loop 處理。
#### Step 4: 整合與執行環境 (Integration & Execution)
- 目標:讓 Agent 接上真實世界工具,從 Demo 變為 Production 可用。
- 關鍵動作:
- 工具整合:接上內部系統、資料庫、API、檔案系統等。
- Human-in-the-loop Checkpoint:在高風險決策(如大金額、權限變更)前,強制 Agent 暫停並請求人類確認。
- 確保系統為「人類掌舵,Agent 執行」,而非失控黑箱。
IV. 案例應用:公司內部請求分類系統
- 場景:處理來自 Slack/Email 的雜事請求(IT、HR、Finance)。
- 實作流程:
標準化:定義 INTERNAL REQUEST TRIAGE SOP,包含引數(來源、文字、編號)與步驟(驗證員工、分類、判斷 Priority、產出結構化輸出)。
拆解:
- Skill 1:
internal request triage(分類、判斷 Priority、推薦 Assignee,輸出 JSON)。 - Skill 2:
internal request reply drafting(根據 JSON 產出回覆草稿)。
雙向開發:透過實際運行修正分類誤差與 Priority 判斷邏輯。
整合:接上 Tracking Sheet(Notion/Jira/Google Sheet),並設置高風險請求的 Human-in-the-loop 檢查點。
V. 技術生態與未來趨勢
- MCP (Model Context Protocol):
- 開放協定,讓 LLM/Agent 透過標準介面呼叫外部 Tools/Resources/Prompts。
- 比喻為 AI 世界的 USB-C,統一不同 Host(ChatGPT, Claude, Cursor)的工具呼叫方式。
- 由 Anthropic 於 2025 年初捐給 Linux Foundation 底下的 Agentic AI Foundation,成為長期維護的開放標準。
- 企業應用現況:IBM、AWS、ServiceNow 等大公司已將 Agentic Workflow 應用於 IT Ticket、HR 請求等流程,取代傳統規則引擎。
- 競爭力建議:
- 不需一次自動化所有流程。
- 挑選最無聊、重複的 Human SOP,照四步法拆解。
- 先建立能節省 30% 時間的版本,再逐步迭代。
- 設計給 AI 執行的工作流能力,價值隨 MCP 與 Multi-agent 普及而提升。
工具 / 模型 / 名詞整理
- 模型/平台:
- Stanford AI 系統
- ChatGPT
- Claude
- Cursor
- AGI (Artificial General Intelligence)
- 技術/協定/框架:
- RAG (Retrieval-Augmented Generation)
- Prompt Engineering
- Model 微調 (Model Fine-tuning)
- Agentic Workflow
- Task Decomposition
- Human SOP
- Skill
- MCP (Model Context Protocol)
- RFC 2119 (網路協定規格書寫法,用於定義 MUST/SHOULD/MAY)
- Markdown
- JSON
- Python Scripts (提及指令碼處理確定性操作)
- MCP Server
- 企業/組織/基金會:
- Linux Foundation
- Agentic AI Foundation
- IBM
- AWS
- ServiceNow
- 軟體/系統:
- Notion
- Jira
- Google Sheet
- Slack
- Teams
- Ticketing System
- IDE (Integrated Development Environment)
- Agent Host
操作流程整理
分析 Human SOP:識別現有流程中的默會知識與例外情況。
格式標準化 (Step 1):
- 將流程轉為結構化 Markdown。
- 定義 Parameters(引數化)。
- 使用 RFC 2119 定義規則強度(MUST/SHOULD/MAY)。
- 明確定義 Error Handling。
任務拆解與連結 (Step 2):
- 將流程分解為多個 Pipeline Steps(Skills)。
- 定義每個 Step 的獨立 Input/Output。
- 設計 Artifacts(如 JSON)作為步驟間的數據交換格式。
雙向開發與迭代 (Step 3):
- 撰寫第一版 SOP/Skills。
- 實際執行並觀察錯誤。
- 根據錯誤修正 SOP 或補充規則(處理 Edge Cases)。
- 重複此循環直至穩定滿足 95% 情境。
整合與部署 (Step 4):
- 將 Skills 接上真實工具(Tools/APIs)。
- 設置 Human-in-the-loop 檢查點(針對高風險決策)。
- 上線 Production 環境,持續監控與維護。
值得注意的限制或風險
定義差異風險:人類與 AI 對抽象詞彙(如「乾淨」)的定義可能不同,導致產出偏差,需透過明確的參數化與規則來緩解。
Mega Agent 的黑箱風險:單一模型處理大任務時,若出現錯誤,難以定位是 Prompt、工具還是模型本身的問題,且缺乏可觀測性。
默會知識的轉化難度:將存在於個人大腦與身體記憶中的默會知識轉為文字明示規則(SOP)需要大量的迭代與實際執行經驗,非一次性可完成。
Edge Cases 處理:即使系統穩定滿足 95% 情境,剩餘 5% 的邊緣案例仍需 Human-in-the-loop 介入,無法完全自動化。
工具整合複雜度:將 Workflow 接上真實世界工具(內部系統、資料庫、API)可能涉及技術整合挑戰。
逐字稿辨識疑點
- Stanford 的 AI 系統建構教學:逐字稿提及「前陣子出了一部影片講解 Stanford 的 AI 系統建構教學」,未明確指出具體課程名稱或連結,僅作為背景提及。
- Agentic AI Foundation:逐字稿稱 Anthropic 將 MCP 捐給「Linux Foundation 底下的 Agentic AI Foundation」。需查證該基金會確切名稱是否為 "Agentic AI Foundation" 或為其他名稱(如 Linux Foundation AI & Data 等),因為 Linux Foundation 下有多個基金會,且 MCP 捐贈細節可能隨時間變動。
- 2025年初:逐字稿提及「Anthropic 在2025年初把這個協定整個捐給...」。若當前時間早於 2025 年初,此為未來時間點或口誤;若當前時間已過,則為事實陳述。此處僅記錄原貌。
- Mega Agent:逐字稿使用此詞彙描述「找一個最強的模型,把任務整包丟給它」的概念。此為影片作者使用的術語,非標準學術定義,故保留原貌。
- 默會知識 (Tacit Knowledge):逐字稿定義為「存在於個人大腦與身體記憶中的知識」,並指出 SOP 本質是將此轉為文字明示規則。此為知識管理領域常見概念,逐字稿解釋清晰,無明顯錯字。
- Human-in-the-loop:逐字稿解釋為「在某些決策點,agent 必須停下來請人類確認」。此為標準 AI 倫理與工程概念,無誤。
- Artifacts:逐字稿定義為「上一個 agent 的 output 變成下一個 agent 的 input」,並舉例為 JSON。此處定義較為狹義,通常 Artifacts 在 CI/CD 或更廣泛的 Agent 框架中可能有其他含義,但在此上下文中指代數據交換格式,故保留原貌。
可延伸追問
如何具體量化「默會知識」轉化為 SOP 的效率提升?是否有具體的 ROI 計算案例?
在「雙向開發」階段,如何自動化檢測與分類錯誤,以加速迭代循環?
MCP 協定在不同 Host(如 ChatGPT, Claude, Cursor)之間的實際相容性與限制為何?
對於高度非結構化、創意型的任務(如行銷文案撰寫),Agentic Workflow 的拆解策略應如何調整?
Human-in-the-loop 的檢查點設置頻率與時機,應如何根據任務風險等級動態調整?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。