20260710-18 | gpt-5.6 真实案例上手体验,慢工出细活,一个真正干活的模型。
來源:Youtube | 建立:2026-07-10T22:49:58 | HTML:2026-07-10T22:51:26
開啟原始影片 note.md transcript.txt transcript.vtt

影片筆記:gpt-5.6 真实案例上手体验,慢工出细活,一个真正干活的模型。

YouTube 影片框會固定在左上方;點擊右側逐字稿時間戳可跳到對應時間。

一句話總結

主講人透過遊戲優化與 API 計費功能兩個真實案例,實測 OpenAI 發布的 GPT-5.6 模型,指出其雖耗時較長(2-3 小時),但具備主動截圖測試、修復計劃外問題及自動優化的能力,展現出比前幾代模型更接近「真正干活」的工作模式,同時提醒使用者需注意模型可能進行的不必要修改或降級風險。

核心重點

性能與體驗的轉變

工作模式的革新

實測案例驗證

使用建議與風險

詳細大綱

一、 GPT-5.6 發布與基本認知

二、 GPT-5.6 的核心體驗變化

三、 實測案例一:遊戲項目優化

四、 實測案例二:Sub2 API 計費功能

五、 使用建議與潛在風險

工具 / 模型 / 名詞整理

操作流程整理

案例一:遊戲項目優化流程

準備階段:確認原遊戲由 Claude + GPT-5.5 完成,存在 UI 重合、無動畫、無暫停鍵等問題。

執行階段

結果驗證

案例二:Sub2 API 計費功能開發流程

任務定義:為 Sub2 API 增加計費功能。

執行階段

結果驗證:確認計費功能可用且錯誤已修復。

通用操作建議

選擇模式:根據任務複雜度選擇 Ultra(複雜)或 Max(簡單)模式。

任務執行:等待模型完成工作(複雜任務需 2-3 小時)。

事後核對

值得注意的限制或風險

耗時較長:使用 Ultra 模式處理複雜任務時,耗時約 2-3 小時,效率低於以往追求速度的模型。

不必要的修改:模型可能會自動進行不必要的修改,或對功能進行「降級」。

潛在功能影響:自動修改可能影響實際應用場景中不需要降級的功能,導致現有功能出現問題。

跑分與體驗落差:高跑分不代表實際上手體驗好,需謹慎評估模型在具體任務中的表現。

逐字稿辨識疑點

可延伸追問

GPT-5.6 的「Ultra 模式」與「Max 思考模式」在技術架構上有何具體差異?

為何 GPT-5.6 需要 2-3 小時才能完成原本可能較短時間的任務?其背後的計算資源分配邏輯為何?

如何有效識別並阻止模型進行的「不必要修改」或「降級」?是否有特定的提示詞(Prompt)技巧可以避免此問題?

影片提到的「17 Pro」與「16E」具體對應哪些手機型號?靈動島適配在開發中有哪些常見技術難點?

Sub2 API 的計費功能具體是如何實現的?GPT-5.6 在測試過程中發現了哪些典型錯誤?

逐字稿時間軸

右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。

00:00:00.100 → 00:00:01.166
小伙伴们你们好
00:00:01.166 → 00:00:02.866
欢迎来到三少科技
00:00:02.866 → 00:00:04.766
跟着三少科技一起玩转AI编程
00:00:05.066 → 00:00:06.733
gpt-5.6已经发布了
00:00:07.166 → 00:00:08.566
并且现在在Codex里面
00:00:08.866 → 00:00:09.833
可以直接体验
00:00:10.766 → 00:00:12.466
也是用它来优化了两个项目
00:00:12.866 → 00:00:14.066
所以说本期视频呢
00:00:14.066 → 00:00:15.133
就给大家分享一下
00:00:15.433 → 00:00:16.666
我对这个模型的一些
00:00:18.266 → 00:00:19.300
关于他的跑分
00:00:19.700 → 00:00:21.700
这个不用说肯定会比上一代模型
00:00:22.233 → 00:00:22.966
是要高一些的
00:00:23.333 → 00:00:24.633
我对跑分这个东西
00:00:24.633 → 00:00:25.733
说实在的不是很感冒
00:00:26.166 → 00:00:27.466
因为总感觉跑分的东西
00:00:27.666 → 00:00:28.566
跟实际上手体验
00:00:28.833 → 00:00:30.700
会有很大的这个差别
00:00:31.066 → 00:00:33.333
就好像很多国产模型跑分都很高
00:00:33.566 → 00:00:34.433
但是一上手工作
00:00:34.633 → 00:00:36.566
就很难去完成一个任务
00:00:36.833 → 00:00:39.133
所以说像gpt-5.3,gpt-5.4,gpt-5.5
00:00:39.666 → 00:00:40.766
说实在的这3个模型
00:00:41.200 → 00:00:43.466
给我的一个感觉就是区别不是很大
00:00:47.566 → 00:00:48.333
给我的一个感受
00:00:48.633 → 00:00:49.366
区别是要大一些
00:00:51.366 → 00:00:52.766
完成一个任务要非常久
00:00:52.900 → 00:00:54.366
后面5.3以后的版本
00:00:54.566 → 00:00:56.733
他完成这个任务的速度就快了非常多
00:00:57.333 → 00:00:59.266
但是本次到了这个gpt-5.6之后
00:00:59.666 → 00:01:00.333
我的一个体验是
00:01:00.666 → 00:01:01.633
完成任务的时间
00:01:03.166 → 00:01:04.866
但是虽然他完成任务的时间增加了
00:01:05.266 → 00:01:06.800
但是我觉得他增加的时间
00:01:09.333 → 00:01:11.100
只是帮你解决了某个问题
00:01:11.100 → 00:01:12.800
在某个问题上耗时了非常久
00:01:15.066 → 00:01:16.300
你给他提出一个问题
00:01:16.700 → 00:01:18.500
然后他会去解决优化这个问题
00:01:18.800 → 00:01:20.166
并且如果在过程当中
00:01:20.300 → 00:01:21.733
他发现了其他的问题
00:01:22.066 → 00:01:24.366
他还会顺手去把它优化或者是解决掉
00:01:24.666 → 00:01:26.300
就好像你让他做一个APP
00:01:26.700 → 00:01:28.366
他可能会进行截图
00:01:29.266 → 00:01:31.933
调整也就是他会想到的比较全面
00:01:32.100 → 00:01:33.500
就不像以前的模型
00:01:33.700 → 00:01:34.700
他就给你一个页面
00:01:35.066 → 00:01:36.533
然后让你不断的去调整
00:01:36.900 → 00:01:38.466
测试发现bug修复
00:01:38.966 → 00:01:40.100
这一套繁琐的流程
00:01:40.333 → 00:01:41.300
他就给你省略掉了
00:01:42.000 → 00:01:43.766
这个就是我一个最大的一个感受
00:01:44.166 → 00:01:45.866
我这里呢做了一个游戏然后呢
00:01:46.166 → 00:01:48.000
看一下他的一个工作过程是怎么样的
00:01:48.633 → 00:01:49.800
像比如我第一个游戏
00:01:50.133 → 00:01:51.233
然后呢叫他优化一下
00:01:51.666 → 00:01:52.533
刚开始这个游戏
00:01:54.200 → 00:01:57.033
claude模型+gpt-5.5一起完成的
00:01:57.833 → 00:01:59.600
然后呢中途这里我把它切换过来了
00:02:00.066 → 00:02:01.800
其实我就给了这样一个提问
00:02:02.166 → 00:02:03.166
问他对于我们这个项目
00:02:03.366 → 00:02:05.000
看看有哪些改进的方面
00:02:05.333 → 00:02:06.200
然后他就开始来
00:02:06.200 → 00:02:07.500
给我们这个改进的方案
00:02:07.733 → 00:02:09.333
方案其实做的也还可以
00:02:09.333 → 00:02:10.066
但是说实在的
00:02:10.066 → 00:02:11.133
我没有仔细去看
00:02:11.366 → 00:02:13.300
像它增加了这个关卡制
00:02:13.600 → 00:02:15.700
然后呢重新平衡这个血量和食物
00:02:16.033 → 00:02:18.400
接着是把这个底部操作做的更加可靠
00:02:18.700 → 00:02:19.666
下来就是这个美术
00:02:20.233 → 00:02:22.100
我就开始来叫他进行这个优化
00:02:22.566 → 00:02:23.766
我们可以先看一下
00:02:23.766 → 00:02:25.700
我优化前的一个版本的一个玩法
00:02:26.233 → 00:02:27.700
像你现在看到的这个页面
00:02:28.100 → 00:02:29.666
就是他优化前的一个版本
00:02:30.000 → 00:02:31.400
我们可以先玩一下看一下
00:02:34.566 → 00:02:35.900
可以看到吃到的食物
00:02:36.200 → 00:02:37.066
它没有发生变化
00:02:37.400 → 00:02:38.166
然后这个地方
00:02:38.400 → 00:02:39.666
然后左上角这个血量
00:02:39.966 → 00:02:41.133
会跟这个数字重合
00:02:42.733 → 00:02:43.600
然后这个是动画效果
00:02:44.300 → 00:02:46.300
然后目前呢是没有这个游戏暂停键
00:02:46.866 → 00:02:48.300
也就说这个游戏出版的时候
00:02:48.600 → 00:02:49.766
会比较单调一点
00:02:50.033 → 00:02:51.133
然后我们看一下
00:02:51.333 → 00:02:53.133
这个是他优化后的版本
00:02:53.466 → 00:02:54.900
像左边是这个17pro
00:02:55.300 → 00:02:56.300
向他优化的时候
00:02:56.566 → 00:02:58.733
我们可以看到它打开了两个页面
00:03:01.600 → 00:03:02.933
它为什么要打开这两个界面呢
00:03:03.233 → 00:03:05.666
主要是他为了适配不同的机型
00:03:05.666 → 00:03:07.066
看一下这个刘海的位置
00:03:07.366 → 00:03:08.533
对这个游戏的一个影响
00:03:09.000 → 00:03:10.233
我们现在试玩一下看看
00:03:10.533 → 00:03:12.066
可以看到这个游戏的
00:03:12.400 → 00:03:14.400
看起来这个UI元素就更加好看一点
00:03:14.966 → 00:03:16.200
并且吃到这些食物之后
00:03:16.800 → 00:03:17.666
就跳到分数上面
00:03:18.066 → 00:03:19.666
食物它就会跳到血量这里
00:03:20.800 → 00:03:22.233
同时呢这个右上角这里
00:03:22.333 → 00:03:24.066
它增加了这个暂停的按钮
00:03:24.533 → 00:03:25.866
加多少这个金币
00:03:25.866 → 00:03:26.766
它上面都有显示
00:03:27.166 → 00:03:29.000
再下来就是右下角的这个UI元素
00:03:29.900 → 00:03:31.333
的元素也更加的好看
00:03:31.633 → 00:03:33.100
所以说整体它的可玩性
00:03:33.366 → 00:03:35.833
就比之前的一个版本就高很多了
00:03:36.233 → 00:03:38.400
在这期间他还会自己启动游戏
00:03:38.566 → 00:03:39.833
并且进行这个截图
00:03:40.266 → 00:03:41.300
所以说它的一个工作
00:03:41.300 → 00:03:42.333
过程非常的长
00:03:42.866 → 00:03:44.233
在我交给他这个任务之后
00:03:44.566 → 00:03:47.166
花了两三个小时去做一个优化
00:03:47.500 → 00:03:49.966
我们在游戏上可能看到的这个体验
00:03:50.900 → 00:03:53.100
他是做了非常多的一个修改
00:03:53.466 → 00:03:56.033
他的这个修改不仅仅是在他计划之内
00:03:57.833 → 00:03:59.333
他也来做了这个修改
00:03:59.700 → 00:04:00.533
但他这里面的话
00:04:00.533 → 00:04:02.866
总共是做了将近20个修改
00:04:03.266 → 00:04:05.266
他之前给我的计划单里面的话
00:04:06.500 → 00:04:07.733
好像是没有提到的
00:04:08.133 → 00:04:08.933
像他这里面提到
00:04:09.200 → 00:04:11.666
APP进入后台或者是接电话的时候
00:04:13.566 → 00:04:15.033
然后就是这个避开灵动岛方面
00:04:15.633 → 00:04:17.366
他也是在写代码过程当中
00:04:18.733 → 00:04:20.166
去进行这个优化
00:04:21.866 → 00:04:23.000
给我的一个感受就是
00:04:23.000 → 00:04:24.666
他做事情会做的更加的细
00:04:25.166 → 00:04:26.833
当然我选择的是这个ultra
00:04:27.933 → 00:04:28.833
不是说所有的任务
00:04:29.000 → 00:04:30.633
都适合去用这个模式
00:04:31.766 → 00:04:33.800
它会协调四个agent并行工作
00:04:34.200 → 00:04:35.800
我感觉它干活就更加的全面
00:04:36.700 → 00:04:37.733
但是也会更加的慢
00:04:38.000 → 00:04:39.233
如果说不是很复杂的任务
00:04:39.600 → 00:04:41.800
可能那我们使用这个Max的思考模式
00:04:42.933 → 00:04:45.200
然后我们看一下另外的一个任务
00:04:45.466 → 00:04:46.700
也就是给这个sub2
00:04:46.933 → 00:04:49.200
api加上这个gpt-5.6
00:04:49.566 → 00:04:50.700
这个模型的一个计费
00:04:51.066 → 00:04:53.200
其实如果是平时的gpt-5.5
00:04:53.566 → 00:04:55.900
可能他就只关心帮你把这个功能搞好
00:04:56.166 → 00:04:57.900
但是的话这个gpt-5.6
00:04:58.366 → 00:05:00.000
他不仅帮你把这个价格调整好
00:05:00.533 → 00:05:02.000
同时呢他还会去测试
00:05:02.333 → 00:05:04.033
如果测试有发现错误的话
00:05:04.333 → 00:05:06.166
他还会顺带去把它修复了
00:05:06.466 → 00:05:09.000
所以说gpt-5.6给我的一个感觉就是
00:05:09.033 → 00:05:10.766
更加适合干活
00:05:10.966 → 00:05:13.266
也就是我们给他一个模糊的请求
00:05:13.266 → 00:05:15.100
他可能就比之前的模型
00:05:15.666 → 00:05:16.700
就干的比较细腻
00:05:17.000 → 00:05:19.066
也就是更加接近可用的一个状态
00:05:19.466 → 00:05:21.500
但是这里面其实我有一些担心
00:05:21.966 → 00:05:23.533
因为有些你没有刷的需求
00:05:24.000 → 00:05:25.766
它会自动的帮你去做一些修改
00:05:26.066 → 00:05:27.800
或者是降级之类的
00:05:28.166 → 00:05:29.966
我就怕有一些实际应用的场景
00:05:30.333 → 00:05:31.633
其实我是不需要降级的
00:05:32.000 → 00:05:33.933
他有可能顺带的就帮我去做了一下
00:05:34.200 → 00:05:35.000
这方面的一个优化
00:05:35.500 → 00:05:37.500
可能会导致我的项目出现一个问题
00:05:38.000 → 00:05:39.433
所以说给我的一个感觉
00:05:39.500 → 00:05:41.200
如果使用gpt-5.6的话
00:05:41.300 → 00:05:42.466
当他完成任务之后
00:05:42.700 → 00:05:43.766
一定要去问一下
00:05:43.766 → 00:05:45.933
他到底做哪方面的这个修改
00:05:46.266 → 00:05:48.166
以免去动到一些没必要的修改
00:05:49.100 → 00:05:51.300
它更接近真正干活的一个模型
00:05:52.300 → 00:05:53.800
就是本期视频一个分享
00:05:53.800 → 00:05:54.666
非常感谢大家收看
00:05:54.833 → 00:05:56.666
喜欢我的视频记得点赞加关注再见