# 影片筆記:我愿称之为AI圈最具诚意的入门教程!#ai #程序员 #人工智能 #agent ## 一句話總結 上海交大張卓勝教授主導的開源教程強調,從「小白」轉向「工業級落地」需具備四大核心能力:任務拆解、工具調用、評測與可觀測性,以及生產環境能力,以應對大模型概率性輸出與幻覺帶來的挑戰。 ## 核心重點 1. **思維轉變**:傳統軟體開發追求確定性(1+1=2),而大模型開發基於概率且存在幻覺,開發者需適應這種不確定性。 2. **四大核心能力**: * **任務拆解能力**:根據業務複雜度選擇架構(單次 Prompt、Workflow、多智能體)。 * **工具調用能力**:採用單一職責工具模式、漸進式擴展及沙箱安全分級。 * **評測與可觀測性**:建立黃金數據集、使用 LM as a judge 量化評測,並實現全鏈路可觀測性以支持故障復現。 * **生產環境能力**:包含持久化配置、分層記憶、上下文壓縮、系統安全鉤子、混合模型路由及 RAG 飛輪。 3. **架構選擇邏輯**: * 低複雜度:單次 Prompt。 * 中等複雜度:Workflow 工作流(節點固定,信息傳遞顯性)。 * 高複雜度:多智能體協同(需引入人機協同安全紅線,智能體間獨立上下文)。 4. **工程設計思路**: * **分佈循環**:探索(只讀)-> 規劃(人工確認)-> 執行(寫文件/命令)-> 反饋。 * **上下文隔離**:主智能體與子智能體(搜索、規劃、執行)擁有專屬上下文,僅通過主智能體傳遞標準數據。 5. **工具與安全**: * 推薦單一職責工具(read, edit, grab, write),避免全能 Mesh 工具。 * 使用 MCP 標準化加載外部系統。 * 底層安全沙箱分級:安全命令自動執行,風險命令暫停確認,毀滅性指令硬編碼拉黑。 6. **生產環境優化**: * **記憶機制**:分層記憶(核心索引、按需加載、歷史歸檔)及上下文壓縮(記憶睡眠鞏固、漸進式壓縮)。 * **安全與成本**:硬邏輯剝離至生命週期鉤子(前置檢查、後置格式化/測試);混合模型路由(動態難度分發)。 * **RAG 飛輪**:混合檢索、重排提純、融合輸出、數據沉澱與反補迭代。 ## 詳細大綱 ### 一、 思維轉變與核心能力概覽 * **傳統開發 vs. 大模型開發**: * 傳統開發:確定性邏輯。 * 大模型開發:概率性輸出,存在幻覺與不確定性。 * **四大核心能力**: 1. 任務拆解能力 2. 工具調用能力 3. 評測和可觀測性 4. 生產環境能力 ### 二、 核心能力一:任務拆解能力 * **業務複雜度分級與架構匹配**: * **第一檔:低複雜度** * 特徵:一次性交互,無需記憶狀態。 * 方案:**Damp Prompt**(單次提示詞)。 * 範例:寫郵件、檢查拼寫錯誤。 * **第二檔:中等複雜度** * 特徵:需保持高可控性,標準 SOP。 * 方案:**Workflow 工作流**。 * 範例:合同審批、財務報表。 * 特點:節點固定,信息傳遞顯性。 * **第三檔:高複雜度** * 特徵:長週期、多角色分工、混沌任務。 * 方案:**多智能體協同**。 * 範例:完整軟體模組開發。 * 要求:引入「人機協同安全紅線」(部署前需人工審核),智能體間獨立上下文。 * **工程設計思路:分佈循環 + 上下文隔离子智能體** * **分佈循環(探索-規劃-執行)**: 1. **探索**:只讀權限(讀文檔、搜代碼)。 2. **規劃**:制定執行計劃,加入人工確認。 3. **執行**:獲得完整操作權限(寫文件、運命令)。 4. **反饋**:若報錯,回到探索階段。 * **上下文隔离子智能體**: * 設立主智能體與子智能體(搜索、規劃、執行)。 * 各子智能體擁有專屬上下文,僅通過主智能體進行標準數據傳遞,避免信息混淆。 ### 三、 核心能力二:工具調用能力 * **工具設計模式**: * **反面模式**:全能 Mesh 工具(類似通用命令行),風險高,難以授權審查。 * **推薦模式**:**單一職責工具模式**。 * 將工具拆分為 read, edit, grab, write 等專業工具。 * 嚴格參數規範(Schema),邊界明確。 * 可分配獨立權限,降低理解偏差。 * **工具管理與擴展原則**: 1. **漸進式工具擴展**: * 初期僅提供基礎工具(讀寫修改)。 * 後續按需接入外部系統,使用 **MCP(模型上下文協議)** 標準化加載。 * 遠程主機或數據庫介入遠程工具。 2. **底層安全沙箱與風險分級**: * **安全命令**(測試、看差異):自動執行。 * **風險命令**(強推代碼):暫停並彈出用戶確認。 * **毀滅性指令**:在沙箱底層硬編碼拉黑,禁止運行。 ### 四、 核心能力三:評測和可觀測性 * **量化評測流程(告別主觀體感)**: 1. **構建黃金數據集**:覆蓋核心真實業務場景(經典提問與標準答案)。 2. **自動打分**:引入強推理模型作為裁判(**LM as a judge**)。 3. **多維度指標體系**: * 幻覺率。 * 答案相關性。 * 檢索召回率。 * 響應耗時。 * **全鏈路可觀測性設計**: * **目的**:解決大模型「黑盒」問題,支持故障復現。 * **記錄階段**: 1. **輸入階段**:原始 Prompt 及系統狀態。 2. **推理中間**:思維鏈(Chain of Thought)、Token 消耗(成本)。 3. **工具調用階段**:參數、接口、響應時間。 4. **輸出階段**:異常捕捉(超時、格式錯誤、服務降級)。 * **應用**:導出調用數據在本地重新跑,定位思維鏈偏差或參數錯誤,優化 Prompt 或增加容錯機制。 ### 五、 核心能力四:生產環境能力 * **狀態管理與記憶機制**: 1. **持久化配置**:代碼庫中放置持久化配置指令文件(如 `cloud.md`),隨版本控制,自動加載項目規範。 2. **分層記憶機制**: * **第一層(核心索引)**:永遠加載,控制在 200 行以內,低延遲。 * **第二層(按需加載)**:相關文檔與當前狀態(支持斷點恢復)。 * **第三層(歷史歸檔)**:僅支持檢索的完整歷史對話,按需搜索。 3. **上下文壓縮與管理**: * **記憶睡眠鞏固機制**:閒時由後台智能體整理零散上下文,修剪衝突事實,合併為核心索引。 * **漸進式上下文壓縮**: * 近期對話:保留詳細細節。 * 中期對話:輕度總結。 * 遠期對話:極限摺疊。 * **系統安全與成本優化**: 1. **系統安全(硬邏輯)**: * 將硬邏輯剝離出 Prompt,使用確定性的生命週期鉤子。 * **前置鉤子**:強行檢查命令安全性。 * **後置鉤子**:強行執行代碼格式化與測試。 2. **混合模型路由機制**: * 動態難度分發。 * 高難度任務(寫架構):大型顆粒模型。 * 簡單任務(問路、格式化):急速小模型或命中提示詞緩存。 * **企業知識庫(RAG)飛輪**: 1. **混合檢索**:向量檢索 + 關鍵詞檢索。 2. **重排提純**:使用重排模型篩選精準節點。 3. **融合輸出**:結合業務邏輯生成最終結果。 4. **數據沉澱**:捕獲用戶反饋,記錄高頻查詢盲區。 5. **反補迭代**:自動更新、修正和強化企業知識庫。 ### 六、 總結:工程師成長路徑 * **業務架構**:單一 Prompt -> 多智能體編排。 * **工具與協議**:硬編碼 API -> 標準 **MCP 協議** 與單一職責工具。 * **生產機狀態**:粗暴內存階段 -> 分層記憶與動態上下文壓縮。 * **系統級整合**:基礎檢索 -> RAG 飛輪與模型路由。 * **質量可觀測性**:基礎檢索 -> 全鏈路追蹤與量化評測。 ## 工具 / 模型 / 名詞整理 * **GitHub** * **上海交大**(開源教程來源) * **張卓勝教授** * **API** * **Prompt**(提示詞) * **Damp Prompt**(文中提及的低複雜度方案名稱) * **Workflow**(工作流) * **智能體 / 大模型** * **MCP**(模型上下文協議,Model Context Protocol) * **LM as a judge**(大模型作為裁判) * **RAG**(檢索增強生成,文中提及「RG系統」) * **cloud.md**(示例配置文件名) * **AMCP**(文中總結部分提及) * **Chain of Thought**(思維鏈) * **RAG 飛輪**(企業知識庫迭代機制) * **靜默退化**(模型在未被測試到的角落變差的情況) ## 操作流程整理 ### 任務架構選擇流程 1. **評估業務複雜度**: * 若為一次性交互、無狀態:選擇 **Damp Prompt**。 * 若需高可控性、標準 SOP:選擇 **Workflow 工作流**。 * 若為長週期、多角色、混沌任務:選擇 **多智能體協同**。 2. **多智能體協同執行步驟**: * **探索階段**:智能體獲得只讀權限(讀文檔、搜代碼)。 * **規劃階段**:智能體制定執行計劃,觸發人工確認(安全紅線)。 * **執行階段**:智能體獲得完整操作權限(寫文件、運命令)。 * **反饋階段**:若執行報錯,返回探索階段重新分析。 ### 工具調用與安全管理流程 1. **工具設計**:採用單一職責工具(read, edit, grab, write),嚴格定義 Schema。 2. **擴展機制**: * 初期提供基礎讀寫工具。 * 後續通過 **MCP 協議** 標準化加載外部系統或遠程數據庫。 3. **沙箱執行分級**: * **安全命令**(如測試、看差異):系統自動執行。 * **風險命令**(如強推代碼):系統暫停,彈出用戶確認。 * **毀滅性指令**:在沙箱底層硬編碼拉黑,禁止運行。 ### 評測與可觀測性實施流程 1. **構建黃金數據集**:整理核心真實業務場景的經典提問與標準答案。 2. **自動化評測**: * 使用強推理模型作為裁判(LM as a judge)進行自動打分。 * 計算指標:幻覺率、答案相關性、檢索召回率、響應耗時。 3. **全鏈路追蹤記錄**: * 記錄輸入(Prompt、系統狀態)。 * 記錄推理中間過程(思維鏈、Token 消耗)。 * 記錄工具調用(參數、接口、響應時間)。 * 記錄輸出異常(超時、格式錯誤、服務降級)。 4. **故障復現與優化**:導出調用數據在本地重新運行,定位思維鏈偏差或參數錯誤,進而優化 Prompt 或增加容錯機制。 ### 生產環境配置與維護流程 1. **持久化配置**:在代碼庫放置 `cloud.md` 等配置文件,隨版本控制自動加載項目規範。 2. **記憶管理**: * **核心索引**:永遠加載(<200行)。 * **按需加載**:相關文檔與當前狀態(支持斷點恢復)。 * **歷史歸檔**:完整歷史對話,按需檢索。 3. **上下文壓縮**: * **閒時鞏固**:後台智能體整理零散上下文,修剪衝突,合併為核心索引。 * **漸進壓縮**:近期保留細節,中期輕度總結,遠期極限摺疊。 4. **路由與檢索**: * **混合模型路由**:高難度任務分發至大型模型,簡單任務使用小模型或命中緩存。 * **RAG 飛輪**:混合檢索(向量+關鍵詞)-> 重排提純 -> 融合輸出 -> 數據沉澱 -> 反補迭代更新知識庫。 ## 值得注意的限制或風險 1. **大模型的不確定性**:基於概率輸出,存在幻覺,無法像傳統軟體開發那樣追求絕對確定性。 2. **全能工具的風險**:全能 Mesh 工具(類似通用命令行)風險高,難以進行授權審查。 3. **靜默退化**:模型可能在未被測試到的角落變差,需通過量化評測和全鏈路可觀測性來發現。 4. **安全紅線**:高複雜度多智能體任務需引入「人機協同安全紅線」,部署前需人工審核。 5. **上下文混淆**:若子智能體間未進行上下文隔離,僅通過主智能體傳遞標準數據,可能導致信息混淆。 6. **成本與效率平衡**:需通過混合模型路由和上下文壓縮來控制 Token 開銷與響應延遲。 ## 逐字稿辨識疑點 * **Damp Prompt**:逐字稿中多次提及「Damp Prompt」作為低複雜度任務的解決方案。在 AI 領域通常稱為「Simple Prompt」或僅稱「Prompt」。此處「Damp」可能為聽寫錯誤或口誤。 * **RG系統**:逐字稿最後部分提及「企業知識庫,也就是RG系統」。標準術語通常為「RAG」(Retrieval-Augmented Generation)。此處「RG」可能為聽寫錯誤。 * **AMCP協議**:逐字稿總結部分提及「運用標準的AMCP協議」。前文提及的是「MCP」(Model Context Protocol)。此處「AMCP」可能為聽寫錯誤或口誤。 * **大木型**:逐字稿中出現「喂給大木型」、「工具給太多,大木型在做選擇」。應為「大模型」的聽寫錯誤。 * **強推代碼**:在安全分級部分提及「強推代碼」。通常術語為「強推代碼」或「強制推送代碼」(Force Push),此處表述尚可,但需注意語境。 * **投肯開銷**:逐字稿提及「省下一大筆的投肯開銷」。應為「Token 開銷」的聽寫錯誤。 * **明氣**:逐字稿提及「保留最詳細的明氣」。應為「細節」或「信息」的聽寫錯誤。 * **去虫**:逐字稿提及「去虫之後合併」。應為「去重」的聽寫錯誤。 * **公渡**:逐字稿提及「拼命公渡」。應為「溝通」或「工作」的聽寫錯誤。 * **靜默退化**:文中提及此術語,