# 影片筆記:GPT-5.6 做到了!你该怎么做? ## 一句話總結 OpenAI 發布 GPT 5.6(及相關變體),標誌著 AI 工作流從單一模型回答轉向多智能體協作與分層架構(Soul/Terra/Nuna),強調在降低 Token 成本與時間的同時,透過並行處理與計算機使用能力,實現從「生成」到「交付與審核」的完整閉環,人類角色轉為定義目標與承擔責任。 ## 核心重點 * **架構轉變:從單一工具到組織化分工** * 不再依賴單一模型解決所有問題,而是建立能力分層架構。 * 引入 **Soul**(旗艦)、**Terra**(均衡)、**Nuna**(高效/低成本)三個層級,象徵 AI 工作流轉向類似人類組織的分工模式。 * 成熟的工作流應像組織一樣,根據任務難度與成本敏感度調用不同模型,而非全部使用最貴模型。 * **效率與成本優化:預設高效與按需拉滿** * 核心理念為「預設高效」(Inficient by Default)與「按需最大性能」(Maximum Performance on Demand)。 * 在長週期任務中,透過減少 Token 消耗、模型往返次數及人工盯梢來降低成本。 * 數據顯示,GPT 5.6 Soul 在專業領域測試中成績優異,且預估成本僅為競爭對手(如 Cloud Fibo 5)的四分之一。 * **多智能體協作(Action / Ultro)** * 從單一模型的串行思考(多想一會兒)轉向協調多個 Agent 並行處理。 * 類似將任務丟入會議室,由不同 Agent 分別負責拆解、查找、執行與查漏,最後由系統匯總。 * 提示詞(Prompt)演變為類似 Brief(簡報/需求書),需明確終點約束、素材、驗收標準與邊界。 * **從生成到交付:計算機使用與設計判斷** * AI 具備檢查渲染結果、修復問題的能力,形成「做出來 -> 看一眼 -> 發現問題 -> 再修」的反饋迴路。 * 不僅生成代碼或文案,還能處理網頁渲染擠壓、按鈕可點擊性、PPT 上會標準等設計判斷。 * 整合 Slack、Notion、Microsoft 365、Google Drive 等辦公軟件的知識工作,生成符合模板與版式的專業成果。 * **人類角色的轉變:定義目標與承擔責任** * 未來價值不在於操作 AI 的技巧,而在於定義目標、制定標準、提供上下文判斷及承擔最終責任。 * 人類需給出明確目標、拆分可驗證階段、設定驗收標準,並在關鍵節點保留判斷。 * 真正值錢的人是「最會給 AI 下達完整目標的人」。 * **安全與責任歸屬** * 隨著 AI 深入現實世界與研發核心,安全驗證與責任歸屬變得重要。 * OpenAI 對高風險實體與地區實施訪問限制,個人需啟用 Advanced Account Security,組織需申請 Trusted Excise for Cyber。 * 建議被限制地區用戶將核心業務放在開源模型上。 * **自主改進與後訓練** * 旗艦模型 Soul 參與對 Nuna 的後訓練工作,展示 AI 開始介入模型研發流程。 * 這並非完全自主進化,而是人類研究員從寫腳本轉向給出目標與邊界,由模型執行實驗與診斷。 ## 詳細大綱 ### 一、 核心信號:從「聰明腦袋」到「項目團隊」 * **工作流轉變**:AI 不再僅是回答問題,而是拆解任務、調用工具、檢查結果,並讓多個智能體並行工作。 * **模型參與研發**:Soul 參與對 Nuna 的後訓練,展示 AI 開始介入「如何讓下一代 AI 變好」的工作流。 * **非完全自主進化**:強調這不是 AI 實現完全自主地規自我改進,而是人類研究員從寫腳本轉向給出目標與邊界,由模型執行實驗與診斷。 ### 二、 能力分層:Soul、Terra、Nuna 的分工 * **Soul(旗艦)**:解決最難的編碼、研究、知識工作及高風險專業任務;用於判斷方向、處理例外。 * **Terra(均衡)**:適合日常專業工作,在穩定中間層執行。 * **Nuna(高效)**:瞄準高頻、大規模、對成本和速度極度敏感任務;負責大規模分類、摘要提取。 * **商業意義**:未來不是所有任務都扔給最貴模型,成熟工作流應像組織一樣分工,降低整體成本。 ### 三、 效率與成本:預設高效與按需拉滿 * **定位**:Inficient by Default(預設高效)與 Maximum Performance on Demand(按需拉滿)。 * **數據表現**: * 在 Agent's Last Exam(覆蓋 55 個專業領域)中,GPT 5.6 Soul 最高成績 53.6,超過 Cloud Fibo 5 11.4 分,預估成本約為後者四分之一。 * 在 Artificial Analysis Coding Agent Index 上,Soul 在 Max 推理下達 80 分,輸出 Token 少於一半,耗時少於一半,預估成本低三分之一。 * **競爭核心**:從「是否聰明」轉向「省得用更少的 Token、更少的模型往返、更少的人工盯梢」。 ### 四、 多智能體協作:Action 與 Ultro * **概念轉變**:從讓同一個模型多想一會兒(低中高 X-high max),轉向協調四個 Agent 並行處理(Action/Ultro)。 * **運作邏輯**:類似將模糊困難項目扔進會議室,瞬間出現四人分別負責任務拆解、資料查找、執行與尋找漏洞,最後由系統匯總。 * **風險與成本**:並行不是免費午餐,Token 成本、協調與失敗風險增加,但能解決單個模型容易卡死的任務。 * **提示詞演變**:提示詞將變得像 Brief(簡報/需求書),需給清楚終點約束、素材、驗收標準與邊界,而非祈禱式提問。 ### 五、 交付能力:從生成到設計與知識工作 * **計算機使用能力**:AI 能檢查並完善已渲染結果,擁有從「做出來」到「看一眼」到「發現問題」再到「再修」的反饋迴路。 * **設計判斷**:不僅生成代碼/文案,還能看見網頁渲染後的擠壓、按鈕在移動端是否可點擊、PPT 是否符合上會標準。 * **知識工作整合**:能整理 Slack、Notion、Microsoft 365、Google Drive 等工作流中的雜亂上下文,生成符合模板、版式、字句規則的專業成果。 * **體驗對比**:相比於生成第一版,真實工作更花時間在讓 AI 遵守現有版本、不丟失關鍵組件並進入審核。 ### 六、 底層技術與安全限制 * **Programmatic Tool Calling**:模型可在 Responses API 中寫並行內存中的輕量程序,協調工具處理海量中間結果,減少數據搬運與模型往返。 * **安全與訪問限制**: * 個人需在 9 月 1 日前啟用 Advanced Account Security 才能保留最高 Cyber Capable 模型訪問權。 * 組織需申請 Trusted Excise for Cyber,高風險實體與地區將受額外限制。 * 建議被限制地區用戶將核心業務放在開源模型上。 ### 七、 真實世界反饋與結論 * **正面案例**:Matt Schumer 分享 GPT 5.6 Soul 一次性完成體速化邁哈頓項目,自主運行接近一週(極端案例)。 * **負面/冷靜聲音**: * Addit 測試 AI 數據看板後認為 UI 仍有濃厚 AI 生成感,設計能力提升不等於審美問題解決。 * 工程師 Mark Miller 分享 Soul 用一次調用重構整個代碼庫(50,235 次調用,15 小時,60 億 Token,100 萬行新代碼),但「沒有一處真的能跑」。 * **專業使用方式**:給明確目標、拆分可驗證階段、設定驗收標準、關鍵節點保留人類判斷與責任。 * **未來價值觀**: * 按鈕會越來越簡單,界面越來越像聊天。 * 未來真正值錢的人是「最會給 AI 下達完整目標的人」。 * 人類價值來自決定方向、建立標準、組織智能並判斷結果,而非親手完成每一個動作。 ## 工具 / 模型 / 名詞整理 * **模型/產品名稱**: * GPT 5.6 / GPT5.6 * OPI / OpenAI * Soul(旗艦模型層級) * Terra(均衡模型層級) * Nuna(高效模型層級) * Cloud Fibo 5 * Hermes * Workspace * Codex * A-Lib Forward InDesign * Browsecap SEC Bench Pro * Termal Bench 2.1 * Agent's Last Exam * Artificial Analysis Coding Agent Index * East Bank Mark * Ultro / Action(多智能體功能名稱) * Responses API * Advanced Account Security * Trusted Excise for Cyber * Cyber Capable * Luna(疑點,前文為 Nuna) * 16A(疑點,可能為 16 Agent) * **第三方/合作夥伴名稱**: * Cursor * Oscar Schultz(奧斯卡·舒爾茨,Cursor 相關人物) * Matt Schumer * Addit * Mark Miller * **軟件/平台名稱**: * Slack * Notion * Microsoft 365 * Google Drive * **其他名詞**: * World Insight(疑點,頻道或品牌名稱) * 體速化邁哈頓項目(疑點,項目名稱) * 未寫提示詞(疑點,概念聽寫) * 反共(疑點,聽寫錯誤) * 人工丁梢(疑點,聽寫錯誤) * 缩水吧(疑點,聽寫錯誤) * 補權代碼(疑點,聽寫錯誤) * 出港(疑點,聽寫錯誤) * 收數成(疑點,聽寫錯誤) * 片尾小字(疑點,聽寫錯誤) ## 操作流程整理 1. **任務拆解與分層調用**: * 根據任務難度與成本敏感度,選擇合適的模型層級(Soul/Terra/Nuna)。 * 對於複雜任務,啟動多智能體協作(Action/Ultro),將任務分配給不同 Agent 並行處理(拆解、查找、執行、查漏)。 2. **提示詞定義(Brief)**: * 撰寫類似簡報/需求書的提示詞,明確終點約束、素材、驗收標準與邊界。 * 避免祈禱式提問,確保 AI 理解完整目標。 3. **執行與生成**: * 模型生成代碼、內容或初步成果。 * 利用 Programmatic Tool Calling 在 Responses API 中協調工具處理中間結果。 4. **檢查與反饋迴路**: * AI 檢查渲染結果(如網頁擠壓、按鈕可點擊性、PPT 標準)。 * 整合 Slack、Notion 等辦公軟件上下文,生成符合模板與版式的成果。 * 發現問題後進行修復(再修),形成閉環。 5. **人類審核與責任承擔**: * 人類在關鍵節點進行判斷,確保符合標準。 * 承擔最終責任,決定方向與建立標準。 * 對於高風險任務,確保符合安全政策(如 Advanced Account Security)。 ## 值得注意的限制或風險 * **成本與風險增加**:多智能體並行處理並非免費午餐,Token 成本、協調與失敗風險增加。 * **生成結果可用性**:部分案例顯示,即使生成大量代碼(如 100 萬行),可能「沒有一處真的能跑」,存在可用性風險。 * **審美與設計局限**:AI 設計能力提升不等於解決審美問題,UI 仍可能有濃厚 AI 生成感。 * **安全與訪問限制**: * 個人需在 9 月 1 日前啟用 Advanced Account Security 才能保留最高 Cyber Capable 模型訪問權。 * 組織需申請 Trusted Excise for Cyber,高風險實體與地區將受額外限制。 * 建議被限制地區用戶將核心業務放在開源模型上。 * **非完全自主進化**:目前的 AI 改進仍依賴人類研究員給出目標與邊界,並非完全自主。 ## 逐字稿辨識疑點 * **OPI**:逐字稿中出現「OPI展示的方向」、「OPI给GPT5.6的定位」,推測應為 OpenAI 或特定品牌縮寫,但依規則標為疑點。 * **GPT5.6**:逐字稿中多次出現此版本號,需查證是否為官方正式命名(通常為 GPT-4o 或 GPT-5 等,此處嚴格保留原文)。 * **Soul / Terra / Nuna**:逐字稿中作為模型層級名稱出現,需查證是否為官方正式命名。 * **Cloud Fibo 5**:逐字稿中出現「超過Cloud Fibo 5 11.4分」,疑點為模型或產品名稱,可能為競爭對手模型(如 Claude 或 Gemini 系列)的聽寫錯誤,但不得自行更正。 * **East Bank Mark**:逐字稿中出現「比East Bank Mark多兩分」,疑點為指標名稱或人名聽寫錯誤。 * **Ultro / Action**:逐字稿中交替出現「Action再往前走了一步」與「那Ultro解决的就是」,疑點為同一功能的兩個不同名稱或聽寫不一致。 * **Browsecap SEC Bench Pro**:疑點為基準測試名稱,聽寫可能不準確。 * **Termal Bench 2.1**:疑點為基準測試名稱,聽寫可能不準確。 * **A-Lib Forward InDesign**:疑點為產品或功能名稱,聽寫可能不準確。 * **Hermes**:逐字稿中提及「我在長期使用Hermes的時候感覺」及「GPT 5.6在Workspace和Codex里已经开始吞噬Hermes的这些能力」,疑點為特定模型或產品名稱。 * **Trusted Excise for Cyber**:疑點為安全政策或功能名稱,聽寫可能不準確(通常為 Trusted Access 或類似詞彙)。 * **體速化邁哈頓項目**:疑點為項目名稱或描述,聽寫可能不準確。 * **未寫提示詞**:逐字稿中出現「让未写提示词这件事开始过时」,疑點為「無提示詞」或「Zero-shot」等概念的聽寫。 * **反共**:逐字稿中出現「交给你一堆需要反共的半成品」,疑點為「反芻」或「反覆修改」的聽寫錯誤。 * **人工丁梢**:逐字稿中出現「更少的人工丁梢」,疑點為「人工盯梢」的聽寫錯誤。 * **缩水吧**:逐字稿中出現「Terra和Luna也不只是缩水吧」,疑點為「縮水版」或類似詞彙的聽寫。 * **Luna**:逐字稿中出現「Terra和Luna」,前文為 Nuna,此處疑點為名稱不一致或聽寫錯誤。 * **16A**:逐字稿中出現「官方也展示了16A的配置的评测」,疑點為「16 Agent」或特定配置的聽寫。 * **补权代码**:逐字稿中出現「會不會补权代码」,疑點為「補全代碼」或「編寫代碼」的聽寫錯誤。 * **出港**:逐字稿中出現「做出可以继续编辑继续审核的出港」,疑點為「輸出」或「產出」的聽寫錯誤。 * **收数成**:逐字稿中出現「把复杂信息收数成可审核产物」,疑點為「收攏成」或「彙整成」的聽寫錯誤。 * **片尾小字**:逐字稿中出現「安全驗證和責任就越不能被當成片尾小字」,疑點為「附註」或「小字條款」的聽寫。 * **World Insight**:逐字稿結尾出現「這裡是World Insight」,疑點為頻道名稱或品牌名稱。 ## 可延伸追問 * GPT 5.6 的 Soul、Terra、Nuna 層級在實際應用中如何