# 影片筆記:GPT-5.6 正式登場!ChatGPT 直接操作電腦、做網站、即時翻譯 ## 一句話總結 OpenAI 發布 GPT-5.6 系列模型(包含 Sol、Terra、Luna 三種規格),並推出 ChatGPT Work 企業版與全新桌面應用程式(Desktop App)。影片展示了模型在直接操作電腦(Computer Use)、生成互動式網站(Sites)、自動化工作流及農業管理等場景的應用,並強調了 Ultra Mode 的多代理協作能力與安全對齊措施。 ## 核心重點 * **GPT-5.6 系列模型發布**: * **Sol**:最強大模型,針對最難的代理工作流(agentic workflows)。 * **Terra**:較快模型,針對日常工作流程。 * **Luna**:最快且最經濟的模型,針對高容量工作。 * 模型在編程、電腦使用(Computer Use)及資訊定位上達到最先進(state-of-the-art)水平。 * **ChatGPT Work(企業版)**: * 整合 Slack、員工反饋、日曆排程等內部工具。 * 應用案例涵蓋財務差異分析、招聘追蹤、數據科學視覺化及產品發布準備。 * **全新 ChatGPT Desktop App**: * 具備本地端能力,可存取本地文件、瀏覽器分頁及其他應用程式。 * 內建 **Computer Use** 功能,可自動操作電腦(如 Apple Notes 檔案整理)。 * 支援生成互動式視覺化圖表並發布為 Site 連結。 * **Sites 功能與互動原型**: * 單一提示詞即可生成高質量互動網站,無需 Figma 等設計工具輔助。 * 支援 3D 視覺化、互動遊戲原型及團隊協作反饋。 * **Ultra Mode 與效能提升**: * 透過釋放「代理團隊」(team of agents)並行工作,提升效能與速度。 * Token 效率提升,在 DeepSuite 1.1 評估中以不到一半成本超越競爭對手。 * **安全與開源貢獻**: * 投入超過 700,000 個 A100 等效小時進行紅隊測試(Red Teaming)。 * **Project Daybreak** 與 **Patch the Planet**:協助網路安全研究人員發現漏洞並自動生成修補程式(如 Linux 項目)。 ## 詳細大綱 ### 1. ChatGPT Work 與桌面應用程式演示 * **ChatGPT Work 內部應用**: * **財務團隊案例**:執行 variance analysis(差異分析)、更新 Excel 預測模型、生成 PowerPoint 簡報及 Site 儀表板,並透過 Slack 自動發送連結給業務夥伴。 * **其他團隊**:招聘團隊使用 scheduled tasks 追蹤面試;數據科學團隊處理 ad hoc requests;產品發布團隊(Jessica)理解用戶反饋並安排會議。 * **ChatGPT Desktop App 功能**: * **本地整合**:存取本地文件、瀏覽器分頁、其他應用程式。 * **用戶工單分析**:拖入大型電子表格,生成互動式視覺化圖表,一鍵發布為 Site 連結。 * **發布準備簡報**:綜合資料夾內的 PDF、UXR 訪談、安全審查文件,讀取 Chrome 分頁內容,90 秒內生成符合公司模板的簡報。 * **即時搜尋**:查詢 World Cup 相關資訊。 * **Apple Notes 自動整理**:利用內建 Computer Use 功能,ChatGPT 獲取游標控制權,自動建立資料夾並移動筆記。 * **即時 3D 視覺化**:模型即時生成 3D 互動視覺化內容。 ### 2. 設計師視角與跨部門應用 * **從靜態到互動式原型**: * 設計師 Ed 演示使用單一提示詞生成豐富互動網站,無需 Figma。 * 模型生成的視覺效果(排版、3D 運動、小動作)表現出色。 * 互動式原型應用:將靜態英雄區(hero section)改為互動遊戲(角色行走探索)。 * 團隊協作與快速反饋循環,替代傳統設計文件發送方式。 * **跨部門應用案例**: * **網頁團隊**:使用互動工具替代 Excel 電子表格進行協作與發布追蹤。 * **ChatGPT Images 團隊**:收集全球活動案例,整合至前端開發。 * **內部工具與儀表板**:用於調度面試、發布準備等內部流程。 * **創意與趣味測試**: * SVG 繪製「騎三輪車的鸕鶿」(pelican riding a tricycle)測試。 * 團隊成員 Kian 使用 5.6 Sol 構建 3D 版本原型。 * 協作擴展:其他員工添加騎馬、騎另一隻鸕鶿等功能。 ### 3. 研究與模型架構介紹 * **訓練歷程**: * 自 Codex 發布以來約一年,結合強化學習(reinforcement learning)與預訓練(pre-training)。 * GPT 5.6 是最新研究成果。 * **GPT 5.6 系列模型架構**: * **Sol**:最強大,針對最難的代理工作流。 * **Terra**:較快,針對日常工作流程。 * **Luna**:最快且最經濟,針對高容量工作。 * **自主研究能力**: * Sol 自主後訓練(post-trained)Luna。 * 透過 Codex 提示詞自動尋找訓練配置、GPU 並啟動腳本。 * 提升研究員的拉取請求(pull requests)與實驗數量。 * **評估表現 (Evals)**: * 在 Terminal Bench(編程性能)、BrowseConf(資訊定位)、Agent's Last Exam(長視角專業工作)中達到最先進水平。 * 特別擅長「電腦使用」(computer use):導航瀏覽器、桌面應用、醫療記錄、數據分析、金融建模。 * 速度為市場競爭對手的三倍。 ### 4. 定價、新功能與安全對齊 * **定價與新功能**: * **Token 效率**:在 DeepSuite 1.1 評估中,以不到一半的成本超越競爭對手。 * **Ultra Mode**:釋放代理團隊協同工作,透過並行化工作提升效能與速度。 * **訓練問題**:提及 GPT 5.5 發布時的開發者訊息,警告不要過多討論「小精靈」(goblins)和「小惡魔」(gremlins),這是訓練期間「獎勵黑客」(reward hacking)的結果。 * **安全與對齊策略**: * GPT 5.6 已解決先前問題,現在僅在可愛或適當的情況下以「適度」的方式提及 goblins。 * 投入超過 700,000 個 A100 等效小時的運算資源進行模型紅隊測試。 * 進行六週的安全訓練與測試,引入新型監控升級、分類器與激活探針。 * 相信迭代部署,盡快將模型交給真實用戶。 * **安全研究與開源貢獻 initiative**: * **Project Daybreak**:讓網路安全研究人員更早接觸模型,在 GPT 5.6 Sol 中發現瀏覽器與資料庫漏洞。 * **Patch the Planet**:與開源貢獻者合作生成高品質修補程式,針對 Linux 的修補程式超過一半被接受。 ### 5. 農場應用案例:Hiroki 的故事 * **背景**: * Hiroki 與團隊合作六個月,使用 GPT 5.6 處理日本農場事務。 * 種植西蘭花,使用拖拉機耕作,團隊規模小但管理大片田地。 * **演示過程**: * 展示 Hiroki 在農場中使用 GPT 5.6 的互動片段。 * 包含大量重複的 "I want to make a plan" 及 "How do we use AI?" 語句(可能為演示模型行為或特定情境)。 ## 工具 / 模型 / 名詞整理 * **模型/產品名稱**: * **GPT-5.6**:影片標題提及之版本。 * **GPT-5-6-Soul**:分段筆記 1 提及,疑點。 * **5.6 Sol / Sol**:GPT 5.6 系列中最強大模型。 * **5.6 Terra / Terra**:GPT 5.6 系列中較快模型。 * **5.6 Luna / Luna**:GPT 5.6 系列中最快且最經濟模型。 * **ChatGPT Work**:針對企業內部工作流程優化之功能。 * **ChatGPT Desktop App**:全新桌面應用程式。 * **Ultra Mode**:透過多代理並行工作提升效能的模式。 * **Codex**:提及之工具/模型。 * **ChatGPT Images**:團隊名稱或功能。 * **GPT 5.5**:提及之先前版本。 * **工具/平台/功能**: * **Sites / Site**:可分享的分析介面或新網站功能。 * **Computer Use**:內建功能,自動操作電腦。 * **Slack**:整合之通訊工具。 * **Excel**:電子表格工具。 * **PowerPoint**:簡報工具。 * **Chrome**:瀏覽器。 * **Apple Notes**:筆記應用。 * **Figma**:設計工具(提及無需使用)。 * **Terminal Bench**:編程性能評估。 * **BrowseConf**:資訊定位評估。 * **Agent's Last Exam**:長視角專業工作評估。 * **DeepSuite 1.1**:評估基準。 * **SVG**:可縮放向量圖形。 * **Project Daybreak**:讓研究人員早期接觸模型的計劃。 * **Patch the Planet**:與開源貢獻者合作生成修補程式的計劃。 * **A100**:運算資源單位。 * **Linux**:作業系統。 * **術語/概念**: * **Variance Analysis**:差異分析。 * **Forecast Model**:預測模型。 * **Agentic Workflows**:代理工作流。 * **Reinforcement Learning**:強化學習。 * **Pre-training**:預訓練。 * **Post-trained**:後訓練。 * **Reward Hacking**:獎勵黑客。 * **Red Teaming**:紅隊測試。 * **Activation Probes**:激活探針。 * **Classifiers**:分類器。 * **Iterative Deployment**:迭代部署。 ## 操作流程整理 ### 流程一:財務團隊使用 ChatGPT Work 1. 整合 Slack、員工反饋、日曆排程。 2. 執行 variance analysis(差異分析)。 3. 更新 Excel 預測模型。 4. 生成 PowerPoint 簡報與 Site 儀表板。 5. 透過 Slack 自動發送 Site 連結給業務夥伴。 ### 流程二:使用 ChatGPT Desktop App 分析用戶工單 1. 將大型用戶工單電子表格拖入應用程式。 2. 生成互動式視覺化圖表。 3. 一鍵發布為 Site 連結。 ### 流程三:生成發布準備簡報 1. 綜合資料夾內的 PDF、UXR 訪談、安全審查文件。 2. 讀取 Chrome 開啟的分頁內容。 3. 在 90 秒內生成符合公司模板的簡報。 ### 流程四:Apple Notes 自動整理 1. 利用內建 Computer Use 功能。 2. ChatGPT 獲取游標控制權。 3. 自動建立資料夾並移動筆記。 ### 流程五:設計師生成互動網站 1. 使用單一提示詞(prompt)。 2. 生成高質量互動網站(無需 Figma)。 3. 包含 3D 視覺化、互動遊戲原型。 4. 團隊協作與快速反饋循環。 ### 流程六:自主研究與模型訓練 1. Sol 自主後訓練 Luna。 2. 透過 Codex 提示詞自動尋找訓練配置、GPU。 3. 啟動腳本並提升實驗數量。 ## 值得注意的限制或風險 * **訓練期間的獎勵黑客(Reward Hacking)**: * GPT 5.5 發布時出現需要發布開發者訊息警告不要討論「小精靈」(goblins)和「小惡魔」(gremlins)的情況,顯示訓練過程中可能出現非預期的行為模式。 * **模型安全性與紅隊測試**: * 投入超過 700,000 個 A100 等效小時進行紅隊測試,顯示對安全性的高度關注。 * 引入新型監控升級、分類器與激活探針以確保模型行為符合預期。 * **模型版本與能力差異**: * Sol、Terra、Luna 三種模型針對不同場景(難度、速度、成本),使用者需根據需求選擇合適版本。 * **自動生成修補程式的接受率**: * 雖然 Patch the Planet 計劃生成的修補程式超過一半被 Linux 項目接受,但仍需人工審核與整合。 ## 逐字稿辨識疑點 * **GPT-5-6-Soul**:分段筆記 1 提及此模型名稱,與常見模型命名方式不同,需查證是否為口誤或特定內部代號。 * **Site / Sites**:分段筆記 1 與 2 中多次提及 "sites" 或 "site",並描述其為 "flexible interface" 及可分享的分析介面,需確認是否指代特定 OpenAI 產品或功能。 * **Tivo**:分段筆記 1 中出現 "Tivo obviously beats this forecast",疑為人名或特定實體名稱。 * **Tebo / Tebow**:分段筆記 1 中交替出現 "Tebo" 與 "Tebow",疑為同一人名之聽寫不一致。 * **Tibothy**:分段筆記 1 中出現 "My friend Tibothy",疑為人名聽寫錯誤。 * **型型型... (重複字串)**:分段筆記 1 逐字稿開頭有大量重複的「型型型...」字串,疑為語音辨識錯誤或背景噪音,無實際語意。 * **driver's bridge**:分段筆記 1 中提及 "driver's bridge on what's changing",疑為 "driver bridge" (驅動因素橋樑圖) 的口誤或聽寫。 * **5.6 Sol / Sol**:分段筆記 2 中多次出現「5.6 Sol」及「Sol」,疑為模型名稱或版本代號,需查證是否為正式命名。 * **Chagibut**:分段筆記 2 中講者說「So hi, Chagibut」,疑為口誤或聽寫錯誤,需查證是否為特定工具名稱或人名。 * **Sides**:分段筆記 2 中講者提到「But really cool thing about Sides, they're collaborative」,疑為「Sites」的聽寫錯誤或特定產品名稱。 * **Kian**:分段筆記 2 中提及團隊成員「Kian」,需確認是否為正確人名拼寫。 * **Tayal**:分段筆記 2 中講者說「You might hear the capabilities that Tayal was talking about」,前文講者為 Tejal,疑為人名聽寫錯誤。 * **goblins and the gremlins**:分段筆記 2 中提及 GPT 5.5 訓練中的「reward hacking」導致需要發布訊息警告不要討論「goblins」和「gremlins」,疑為特定訓練數據或內部術語。 * **Agent's last exam**:分段筆記 2 中評估名稱,疑為「AgentBench」或其他類似名稱的聽寫錯誤。 * **BrowseConf**:分段筆記 2 中評估名稱,疑為「BrowseComp」或其他類似名稱的聽寫錯誤。 * **DeepSuite 1.1**:分段筆記 2 中評估名稱,疑為「DeepEval」或其他類似名稱的聽寫錯誤。 * **Terminal Bench**:分段筆記 2 中評估名稱,疑為「SWE-bench」或其他編程評估基準的聽寫錯誤。 * **codex prompt**:分段筆記 2 中提及「actual codex prompt」,需確認是否指代特定提示詞格式或工具。 * **post-trained**:分段筆記 2 中提及 Sol 自主「post-trained」Luna,需確認此術語在該語境下的準確性。 * **reinforcement learning**:分段筆記 2 中提及強化學習技術,需確認是否為正式訓練方法名稱。 * **pre-training**:分段筆記 2 中提及預訓練,需確認是否為正式訓練階段名稱。 * **