影片筆記:gpt-5.6 真实案例上手体验,慢工出细活,一个真正干活的模型。
一句話總結
主講人透過遊戲優化與 API 計費功能兩個真實案例,實測 OpenAI 發布的 GPT-5.6 模型,指出其雖耗時較長(2-3 小時),但具備主動截圖測試、修復計劃外問題及自動優化的能力,展現出比前幾代模型更接近「真正干活」的工作模式,同時提醒使用者需注意模型可能進行的不必要修改或降級風險。
核心重點
性能與體驗的轉變:
- 與 GPT-5.2 升級至 5.3 時的速度質變不同,GPT-5.6 的進步在於「用時間換空間」。
- 任務完成時間增加,但換取了更全面的優化能力與更細緻的工作細節。
- 主講人認為跑分高不代表實際上手體驗好,GPT-5.6 在實際任務完成度上表現更佳。
工作模式的革新:
- 主動性增強:不再僅是被動「給出頁面讓用戶反覆測試修復」,而是會主動進行截圖、測試、調整。
- 計劃外修復:能發現並修復計劃外的问题,例如靈動島適配、後台暫停邏輯等。
- 流程簡化:省略了以往「給頁面 -> 用戶測試 -> 發現 Bug -> 修復」的繁瑣循環,更接近直接可用的狀態。
實測案例驗證:
- 遊戲項目優化:針對原由 Claude + GPT-5.5 完成的遊戲,GPT-5.6 自動進行了近 20 次修改,包括機型適配(17 Pro, 16E)、UI 美化、增加暫停按鈕及後台邏輯處理。
- API 計費功能:為 Sub2 API 增加計費功能時,不僅調整價格,還主動測試並修復錯誤,展現對模糊請求的細膩處理能力。
使用建議與風險:
- 模式選擇:複雜任務建議使用 Ultra 模式(協調四個 Agent 並行,耗時長但輸出接近可用);簡單任務建議使用 Max 思考模式。
- 潛在風險:模型可能會自動進行不必要的修改或導致功能「降級」,可能影響現有功能。
- 核對必要性:任務完成後,務必詢問並核對具體修改內容,避免無必要修改導致項目問題。
詳細大綱
一、 GPT-5.6 發布與基本認知
- GPT-5.6 已發布,可在 Codex 環境中直接體驗。
- 主講人指出,雖然跑分必然高於上一代,但跑分與實際上手體驗存在巨大差異。
- 過往模型(GPT-5.3, 5.4, 5.5)之間感覺區別不大。
- 歷史對比:GPT-5.2 升級至 5.3 時,任務完成速度有巨大提升;但 GPT-5.6 的任務時間反而增加,這並非缺點,而是工作模式的改變。
二、 GPT-5.6 的核心體驗變化
- 時間換空間:雖然完成任務時間增加,但並非像 5.2 那樣在單一問題上卡住。
- 主動優化能力:
- 不僅解決提出問題,還會順手優化或解決過程中發現的其他問題。
- 例如開發 APP 時,會主動進行截圖、測試、調整,省略了以往「給頁面 -> 用戶測試 -> 發現 Bug -> 修復」的繁瑣流程。
- 工作細節度:做事更加細緻,更接近真正「干活」的模型。
三、 實測案例一:遊戲項目優化
- 背景:原遊戲由 Claude 模型 + GPT-5.5 共同完成。
- 操作:切換至 GPT-5.6,提問關於項目的改進方面。
- 優化前問題:
- 吃到食物無變化。
- 左上角血量與數字重合。
- 無動畫效果。
- 無遊戲暫停鍵,體驗單調。
- 優化後成果:
- 針對不同機型(如 17 Pro, 16E)進行適配,處理劉海與靈動島位置影響。
- UI 元素美化,食物/金幣/分數/血量顯示邏輯優化。
- 增加右上角暫停按鈕。
- 工作過程分析:
- 模型自動啟動遊戲並截圖。
- 耗時約 2-3 小時。
- 總計進行近 20 個修改。
- 包含計劃外修改:如 APP 進入後台或接電話時自動暫停、避開靈動島等。
四、 實測案例二:Sub2 API 計費功能
- 任務:為 Sub2 API 增加 GPT-5.6 模型的計費功能。
- 對比:
- 一般模型(如 GPT-5.5)僅關注功能實現。
- GPT-5.6 不僅調整價格,還會主動測試,若發現錯誤會順帶修復。
- 結論:對於模糊請求,GPT-5.6 能提供更細膩、更接近可用狀態的結果。
五、 使用建議與潛在風險
- 模式選擇:
- Ultra 模式:協調四個 Agent 並行工作,全面但速度慢,適合複雜任務。
- Max 思考模式:適合不複雜的任務。
- 潛在風險:
- 模型可能會自動進行不必要的修改或「降級」。
- 可能影響實際應用場景中不需要降級的功能。
- 操作建議:
- 任務完成後,務必詢問並核對具體做了哪些修改。
- 避免無必要的修改導致項目出現問題。
工具 / 模型 / 名詞整理
- 三少科技:影片主講頻道或品牌名稱。
- GPT-5.6:影片重點實測的 OpenAI 最新發布模型。
- Codex:GPT-5.6 可體驗的環境。
- GPT-5.2 / 5.3 / 5.4 / 5.5:影片提及的前幾代模型,用於對比性能與體驗差異。
- Claude 模型:影片案例中與 GPT-5.5 共同完成原遊戲項目的模型。
- 17 Pro / 16E:影片案例中提到的手機機型代稱,用於描述適配問題。
- 靈動島:手機設計元素/功能,影片案例中涉及適配問題。
- Sub2 API:影片案例中進行計費功能開發的 API 服務。
- Ultra 模式:Codex 中的一種模式,協調四個 Agent 並行工作,耗時長但輸出接近可用狀態。
- Max 思考模式:Codex 中的一種模式,適合不複雜的任務。
操作流程整理
案例一:遊戲項目優化流程
準備階段:確認原遊戲由 Claude + GPT-5.5 完成,存在 UI 重合、無動畫、無暫停鍵等問題。
執行階段:
- 在 Codex 中切換至 GPT-5.6。
- 輸入關於項目改進的提問。
- 模型自動啟動遊戲並進行截圖測試。
- 模型進行多輪修改(約 20 次),耗時 2-3 小時。
結果驗證:
- 檢查機型適配(17 Pro, 16E)及靈動島避開情況。
- 確認 UI 美化(食物/金幣/分數/血量)及新增暫停按鈕。
- 驗證後台邏輯(接電話/進入後台自動暫停)。
案例二:Sub2 API 計費功能開發流程
任務定義:為 Sub2 API 增加計費功能。
執行階段:
- 使用 GPT-5.6 進行開發。
- 模型不僅調整價格邏輯,還主動進行測試。
- 若發現錯誤,模型順帶修復。
結果驗證:確認計費功能可用且錯誤已修復。
通用操作建議
選擇模式:根據任務複雜度選擇 Ultra(複雜)或 Max(簡單)模式。
任務執行:等待模型完成工作(複雜任務需 2-3 小時)。
事後核對:
- 詢問模型具體做了哪些修改。
- 核對修改內容,檢查是否有不必要的修改或功能降級。
- 確認現有功能未受影響。
值得注意的限制或風險
耗時較長:使用 Ultra 模式處理複雜任務時,耗時約 2-3 小時,效率低於以往追求速度的模型。
不必要的修改:模型可能會自動進行不必要的修改,或對功能進行「降級」。
潛在功能影響:自動修改可能影響實際應用場景中不需要降級的功能,導致現有功能出現問題。
跑分與體驗落差:高跑分不代表實際上手體驗好,需謹慎評估模型在具體任務中的表現。
逐字稿辨識疑點
- GPT-5.6 / GPT-5.2 / GPT-5.3 / GPT-5.4 / GPT-5.5:逐字稿中反覆出現「GPT-5.x」系列名稱。目前公開的 GPT 系列主要為 GPT-4 系列, rumored 的 GPT-5 命名規則亦未完全確立或與此處描述不符。需查證是否為口誤、特定內部版本號、聽寫錯誤,或是影片作者對未來模型的預測性稱呼。
- Sub2 API:需查證是否為特定產品名稱,或為口誤(例如是否為 Substack API 或其他服務)。
- 17 Pro / 16E:需查證是否為特定手機型號的代稱或口誤(例如是否指 iPhone 17 Pro, iPhone 16 等,或為其他品牌機型)。
- Ultra 模式 / Max 思考模式:需查證 Codex 中是否確有此命名,或為口誤(例如是否為 Ultra 模式、Max 模式等)。
- 跑分與實際體驗差異:主講人提到「很多国产模型跑分都很高,但是一上手工作就很难去完成一个任务」,此為觀點陳述,非事實錯誤,但需注意其對跑分價值的否定態度。
可延伸追問
GPT-5.6 的「Ultra 模式」與「Max 思考模式」在技術架構上有何具體差異?
為何 GPT-5.6 需要 2-3 小時才能完成原本可能較短時間的任務?其背後的計算資源分配邏輯為何?
如何有效識別並阻止模型進行的「不必要修改」或「降級」?是否有特定的提示詞(Prompt)技巧可以避免此問題?
影片提到的「17 Pro」與「16E」具體對應哪些手機型號?靈動島適配在開發中有哪些常見技術難點?
Sub2 API 的計費功能具體是如何實現的?GPT-5.6 在測試過程中發現了哪些典型錯誤?
逐字稿時間軸
右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。