# 影片筆記:gpt-5.6 真实案例上手体验,慢工出细活,一个真正干活的模型。 ## 一句話總結 主講人透過遊戲優化與 API 計費功能兩個真實案例,實測 OpenAI 發布的 **GPT-5.6** 模型,指出其雖耗時較長(2-3 小時),但具備主動截圖測試、修復計劃外問題及自動優化的能力,展現出比前幾代模型更接近「真正干活」的工作模式,同時提醒使用者需注意模型可能進行的不必要修改或降級風險。 ## 核心重點 1. **性能與體驗的轉變**: * 與 GPT-5.2 升級至 5.3 時的速度質變不同,GPT-5.6 的進步在於「用時間換空間」。 * 任務完成時間增加,但換取了更全面的優化能力與更細緻的工作細節。 * 主講人認為跑分高不代表實際上手體驗好,GPT-5.6 在實際任務完成度上表現更佳。 2. **工作模式的革新**: * **主動性增強**:不再僅是被動「給出頁面讓用戶反覆測試修復」,而是會主動進行截圖、測試、調整。 * **計劃外修復**:能發現並修復計劃外的问题,例如靈動島適配、後台暫停邏輯等。 * **流程簡化**:省略了以往「給頁面 -> 用戶測試 -> 發現 Bug -> 修復」的繁瑣循環,更接近直接可用的狀態。 3. **實測案例驗證**: * **遊戲項目優化**:針對原由 Claude + GPT-5.5 完成的遊戲,GPT-5.6 自動進行了近 20 次修改,包括機型適配(17 Pro, 16E)、UI 美化、增加暫停按鈕及後台邏輯處理。 * **API 計費功能**:為 Sub2 API 增加計費功能時,不僅調整價格,還主動測試並修復錯誤,展現對模糊請求的細膩處理能力。 4. **使用建議與風險**: * **模式選擇**:複雜任務建議使用 **Ultra 模式**(協調四個 Agent 並行,耗時長但輸出接近可用);簡單任務建議使用 **Max 思考模式**。 * **潛在風險**:模型可能會自動進行不必要的修改或導致功能「降級」,可能影響現有功能。 * **核對必要性**:任務完成後,務必詢問並核對具體修改內容,避免無必要修改導致項目問題。 ## 詳細大綱 ### 一、 GPT-5.6 發布與基本認知 * GPT-5.6 已發布,可在 Codex 環境中直接體驗。 * 主講人指出,雖然跑分必然高於上一代,但跑分與實際上手體驗存在巨大差異。 * 過往模型(GPT-5.3, 5.4, 5.5)之間感覺區別不大。 * 歷史對比:GPT-5.2 升級至 5.3 時,任務完成速度有巨大提升;但 GPT-5.6 的任務時間反而增加,這並非缺點,而是工作模式的改變。 ### 二、 GPT-5.6 的核心體驗變化 * **時間換空間**:雖然完成任務時間增加,但並非像 5.2 那樣在單一問題上卡住。 * **主動優化能力**: * 不僅解決提出問題,還會順手優化或解決過程中發現的其他問題。 * 例如開發 APP 時,會主動進行截圖、測試、調整,省略了以往「給頁面 -> 用戶測試 -> 發現 Bug -> 修復」的繁瑣流程。 * **工作細節度**:做事更加細緻,更接近真正「干活」的模型。 ### 三、 實測案例一:遊戲項目優化 * **背景**:原遊戲由 Claude 模型 + GPT-5.5 共同完成。 * **操作**:切換至 GPT-5.6,提問關於項目的改進方面。 * **優化前問題**: * 吃到食物無變化。 * 左上角血量與數字重合。 * 無動畫效果。 * 無遊戲暫停鍵,體驗單調。 * **優化後成果**: * 針對不同機型(如 17 Pro, 16E)進行適配,處理劉海與靈動島位置影響。 * UI 元素美化,食物/金幣/分數/血量顯示邏輯優化。 * 增加右上角暫停按鈕。 * **工作過程分析**: * 模型自動啟動遊戲並截圖。 * 耗時約 2-3 小時。 * 總計進行近 20 個修改。 * 包含計劃外修改:如 APP 進入後台或接電話時自動暫停、避開靈動島等。 ### 四、 實測案例二:Sub2 API 計費功能 * **任務**:為 Sub2 API 增加 GPT-5.6 模型的計費功能。 * **對比**: * 一般模型(如 GPT-5.5)僅關注功能實現。 * GPT-5.6 不僅調整價格,還會主動測試,若發現錯誤會順帶修復。 * **結論**:對於模糊請求,GPT-5.6 能提供更細膩、更接近可用狀態的結果。 ### 五、 使用建議與潛在風險 * **模式選擇**: * **Ultra 模式**:協調四個 Agent 並行工作,全面但速度慢,適合複雜任務。 * **Max 思考模式**:適合不複雜的任務。 * **潛在風險**: * 模型可能會自動進行不必要的修改或「降級」。 * 可能影響實際應用場景中不需要降級的功能。 * **操作建議**: * 任務完成後,務必詢問並核對具體做了哪些修改。 * 避免無必要的修改導致項目出現問題。 ## 工具 / 模型 / 名詞整理 * **三少科技**:影片主講頻道或品牌名稱。 * **GPT-5.6**:影片重點實測的 OpenAI 最新發布模型。 * **Codex**:GPT-5.6 可體驗的環境。 * **GPT-5.2 / 5.3 / 5.4 / 5.5**:影片提及的前幾代模型,用於對比性能與體驗差異。 * **Claude 模型**:影片案例中與 GPT-5.5 共同完成原遊戲項目的模型。 * **17 Pro / 16E**:影片案例中提到的手機機型代稱,用於描述適配問題。 * **靈動島**:手機設計元素/功能,影片案例中涉及適配問題。 * **Sub2 API**:影片案例中進行計費功能開發的 API 服務。 * **Ultra 模式**:Codex 中的一種模式,協調四個 Agent 並行工作,耗時長但輸出接近可用狀態。 * **Max 思考模式**:Codex 中的一種模式,適合不複雜的任務。 ## 操作流程整理 ### 案例一:遊戲項目優化流程 1. **準備階段**:確認原遊戲由 Claude + GPT-5.5 完成,存在 UI 重合、無動畫、無暫停鍵等問題。 2. **執行階段**: * 在 Codex 中切換至 GPT-5.6。 * 輸入關於項目改進的提問。 * 模型自動啟動遊戲並進行截圖測試。 * 模型進行多輪修改(約 20 次),耗時 2-3 小時。 3. **結果驗證**: * 檢查機型適配(17 Pro, 16E)及靈動島避開情況。 * 確認 UI 美化(食物/金幣/分數/血量)及新增暫停按鈕。 * 驗證後台邏輯(接電話/進入後台自動暫停)。 ### 案例二:Sub2 API 計費功能開發流程 1. **任務定義**:為 Sub2 API 增加計費功能。 2. **執行階段**: * 使用 GPT-5.6 進行開發。 * 模型不僅調整價格邏輯,還主動進行測試。 * 若發現錯誤,模型順帶修復。 3. **結果驗證**:確認計費功能可用且錯誤已修復。 ### 通用操作建議 1. **選擇模式**:根據任務複雜度選擇 Ultra(複雜)或 Max(簡單)模式。 2. **任務執行**:等待模型完成工作(複雜任務需 2-3 小時)。 3. **事後核對**: * 詢問模型具體做了哪些修改。 * 核對修改內容,檢查是否有不必要的修改或功能降級。 * 確認現有功能未受影響。 ## 值得注意的限制或風險 1. **耗時較長**:使用 Ultra 模式處理複雜任務時,耗時約 2-3 小時,效率低於以往追求速度的模型。 2. **不必要的修改**:模型可能會自動進行不必要的修改,或對功能進行「降級」。 3. **潛在功能影響**:自動修改可能影響實際應用場景中不需要降級的功能,導致現有功能出現問題。 4. **跑分與體驗落差**:高跑分不代表實際上手體驗好,需謹慎評估模型在具體任務中的表現。 ## 逐字稿辨識疑點 * **GPT-5.6 / GPT-5.2 / GPT-5.3 / GPT-5.4 / GPT-5.5**:逐字稿中反覆出現「GPT-5.x」系列名稱。目前公開的 GPT 系列主要為 GPT-4 系列, rumored 的 GPT-5 命名規則亦未完全確立或與此處描述不符。需查證是否為口誤、特定內部版本號、聽寫錯誤,或是影片作者對未來模型的預測性稱呼。 * **Sub2 API**:需查證是否為特定產品名稱,或為口誤(例如是否為 Substack API 或其他服務)。 * **17 Pro / 16E**:需查證是否為特定手機型號的代稱或口誤(例如是否指 iPhone 17 Pro, iPhone 16 等,或為其他品牌機型)。 * **Ultra 模式 / Max 思考模式**:需查證 Codex 中是否確有此命名,或為口誤(例如是否為 Ultra 模式、Max 模式等)。 * **跑分與實際體驗差異**:主講人提到「很多国产模型跑分都很高,但是一上手工作就很难去完成一个任务」,此為觀點陳述,非事實錯誤,但需注意其對跑分價值的否定態度。 ## 可延伸追問 1. GPT-5.6 的「Ultra 模式」與「Max 思考模式」在技術架構上有何具體差異? 2. 為何 GPT-5.6 需要 2-3 小時才能完成原本可能較短時間的任務?其背後的計算資源分配邏輯為何? 3. 如何有效識別並阻止模型進行的「不必要修改」或「降級」?是否有特定的提示詞(Prompt)技巧可以避免此問題? 4. 影片提到的「17 Pro」與「16E」具體對應哪些手機型號?靈動島適配在開發中有哪些常見技術難點? 5. Sub2 API 的計費功能具體是如何實現的?GPT-5.6 在測試過程中發現了哪些典型錯誤?