如果你只是把GPT5.6当成是一次 模型分数又涨了的发布 那你就可能错过了 这次更新最值得警惕的一件事 过去我们使用AI 就像是在问一个很聪明的人 让他帮我写一段代码 做一页PPT读一份报告 他给你一个答案 你继续接手 但这一次 OPI展示的方向已经变了 他不止回答 他还开始拆解任务 调用工具 检查结果 让多个智能体并行工作 而在官方发布的直播展示内部案例 旗舰模型Soul 甚至参与了对NUNA的后训练工作 所以最强的AI已经开始参与 如何让下一代AI 变得更好的那段工作流 注意 我不是说AI已经实现了 完全自主的地规自我改进 更不是说 它明天就会关起门来自我进化 那是两回事 但是从人类研究员写脚本 条参数 跑实验 到AI能够诊断训练系统 运行实验 解释结果 参与模型改进 这条路上最难 最有价值的一段 已经被他走进去了 今天我们要拆开 GPT5.6真正的信号 那就是 它为什么不只是一颗 更聪明的脑袋 它为什么像一个 能被随时召唤出来的项目团队 它为什么让未写提示词这件事开始过时 以及在AI真正接手工作流之前 人类究竟还剩下哪一种不可替代的能力 这些视频最值得看的不是答案 而是生产答案的方式变了 GPT5.6这次不是只发了一个模型 而是同时给出了三个长期存在的能力层级 Soul、Terra和Nuna Soul是旗舰解决最难的编码研究 知识工作和高风险专业任务 Terra是更均衡适合日常专业工作的一层 Nuna则瞄准高频 大规模对成本和速度极度敏感的任务 官方强调这三个名字不是一次性的营销后缀 而是会分别按自己的节奏演进的能力层级 这背后的意思很重要 也就是未来不是所有任务都扔给最贵的模型 真正成熟的AI工作流会像一家组织一样分工 最贵最强的Soul用来判断方向处理例外 解决最难的问题 Terra在稳定的中间层执行 Nuna负责大规模的分类摘要提取和重要性工作 而真正让我停下来的 是官方在发布直播里展示的那一幕 就是Soul参与后训练Nuna 我们不需要把它神话成AI生孩子 但它确实极具象征意义 过去人类把模型当工具 现在模型开始进入制造工作的流程 OpenAI在博客中也明确写到 研究人员已经在用GPT5.6诊断失败 优化训练系统运行实验解释结果 他们的内部研究评测中 与低规自我改进相关的一组能力 叫GPT5.5提升了16.2分 这个数字不等于自动研究员已经诞生 但它说明了一个方向 就是AI不再只服务于最终用户 也开始反过来加速AI本身的研发 屏幕上的这张图不是自动研究员已经上线的证明 这是自动研究员所需的一种能力 就是调试实验优化和改进模型 这是正在被快速补齐的证据 从今天开始我们可能要习惯一个新的画面 就是人类研究员不再亲自完成每一次实验 而是给出目标边界和评价标准 让模型去跑更多轮尝试 再用人类决定什么值得被相信 什么值得被部署 什么值得被承担后果 模型变强当然很重要 但模型真正改变世界的那一刻 往往不是它第一次答对难题 而是它开始在可接受的成本里 把完整工作交付出来 OPI给GPT5.6的定位很准确 一个是Inficient by Default 默认高效 还有一个是Maximum Performance on Demand 需要时再把性能拉满 别把这张图理解成一场考试的胜负 它真正想展示的是 当任务变长跨领域需要多部推进时 模型有没有把完成一次工作的成本打下来 官方数据显示 在Agent's Last Exam 一个覆盖55个专业领域 偏长周期工作流的评测中 GPT5.6Soul的最高成绩为53.6 在中等推理设置下 它仍然超过Cloud Fibo 5 11.4分 而预估成本大约为后者的四分之一 对于这个分数 你要理解它的商业意义 就是以前你让AI做一件长任务 最怕的不是它不聪明 而是它会想很久调用很多次 花很多钱 最后却仍然交给你一堆需要反共的半成品 现在竞争的核心正在变成 省得用更少的Token 更少的模型往返 更少的人工丁梢 让任务真正往前走 在编码智能体评测 Artificial Analysis Coding Agent Index上 官方称Soul在Max推理下达到80分 相比Fibo 5高出2.8分 同时输出Token少于一半 耗时少于一半 预估成本大约低三分之一 Terra和Luna也不只是缩水吧 官方称它们在相应比较中 用更低的时间Token和成本 仍维持很有竞争力的编码表现 前面切换的这三张图 要说的是同一件事 就是Soul不是单纯把分数做高 它试图同时少花钱少等待 少吐无效Token 对于写代码的人来说 这比East Bank Mark多两分 更接近日常体验 但这里要提醒一句的是 所有厂商的Benchmark 都应当看作是值得测试的信号 而不是你项目里的保证书 真实成本会随任务 提示工具调用 重视次数和上下文长度大幅变化 所以这期视频的结论不是 GPT 5.6永远最强 真正的结论是 模型能力开始从一个昂贵的演示品 变成一条更接近工业化的成本曲线 当智能的单位成本下降 原来请不起AI团队的任务 才会第一次被认真地搬进真实的工作流 如果说效率解决了用不用得起 那Ultro解决的就是 一个模型不够是怎么办 过去的推理模式 本质是让同一个模型多想一会儿 低中高X-high max 它会探索备选方案 检查自己修改路径 这个逻辑很好理解 就是拿更多推理时间换更高质量 Action再往前走了一步 官方的定义非常明确 它会默认协调四个agent 并行处理复杂任务 以更高talk消耗换取更强结果和更短的完成时间 官方也展示了16A的配置的评测 但那是额外配置和实验比较 不要把它误读成日常默认开了16个分身 看横轴和纵轴的关系 理想的升级不是为了更高分而无限延迟 而是在更短的时间里把结果推得更高 Action的野心就是把单个agent的思考换成并行工作流 这听上去像什么呢 像是你把一个模糊但是困难的项目扔到会议室里 瞬间出现四个人 一个先做任务拆解 一个去找资料和约束 一个尝试执行 一个专门寻找漏洞 最后由系统把它们的结果汇总 这就是多智能体最让人上瘾 也最容易让人误解的地方 它不是魔法 四个错误的人不会自动拼成一个正确答案 并行也不是免费的午餐 Token成本协调和失败风险都会增加 但对于那些路径很多需要交叉验证 当个模型容易卡死的任务 多智能体解决的不是想得更久 而是同时从不同方向去试 官方在Browsecap SEC Bench Pro和Termal Bench 2.1的图表中展示 增加并行agent之后 分数与延迟的边界被推向更好的一侧 说白了 同样是做难题 他不一定要等一个人把所有路都走完 Cursor的奥斯卡·舒尔茨 对早期评测的评价非常克制 他认为这是他们测试过的最强模型之一 并特别提到了持久性、智能和整体效率 但要注意的是 这是合作伙伴的早期评价 而并不是独立评测结论 但他恰好说明 开发者真正关心的 已经不只是会不会补权代码了 对使用者来说 最关键的升级其实不是会不会点Altra 而是你有没有能力把任务说成一个 可被团队并行处理的目标 帮我做一个网站仍然是个坏任务 基于这一份品牌规范和三份访谈 先提出三个信息架方案 再选风险最低的方案实现成可以访问的落地也 完成后检查移动端表单和关键转化路径 并输出改动说明 这才是可以被一个AI团队真正接住的任务 未来提示词会变得越来越像像Brief 不是祈祷式的问一句 而是给清楚终点约束素材 验收标准和不可以碰的边界 我们看看这个游戏视频 先别管它背后是不是AI 你觉得你第一眼会不会把它当成一个真正在售的小游戏呢 这就是官方把它放在A-Lib Forward InDesign第一位的原因 就是真正有说服力的不是他写了多少行前端 而是交回来的东西是否已经像个产品 很多人低估了GPT5.6最实际的一项变化 就是设计判断和计算机使用能力 以前的AI很会生成 它可以生成代码 生成文案 生成HTML 生成图片 但生成不等于交付 它经常只能看见自己写出的文本 而看不见网页渲染后是不是挤在一起 也看不见按钮在移动端是否点得到 也不懂一份PPT 虽然信息齐全 却根本不能上回 OpenAI对GPT5.6的描述是 它的计算机使用能力更强 能检查并完善已经渲染出来的结果 而不只是生成底层代码或者内容 这句话非常关键 它意味着AI开始拥有一条 从做出来到看一眼到发现问题 再到再修的反馈回路 这不代表它已经拥有稳定的人类审美 更不代表每次都能交出好设计 但对于真实工作 能看见最终呈现 往往比会写一段代码更重要 前面的三个交互案例 比一张漂亮的网页更值得看 它展示的不是静态网页生成 而是模型把一个抽象概念做成可以拖 可以看可以理解的交互解释器 官方还特别强调了知识工作 它能把 Slack Notion Microsoft 365 Google Drive等工作流中的杂论上下文 整理为可以分享的专业成果 在演示文稿 文档和表格上 它更能遵循参考模板 理解版式、字句、颜色、模板和重复内容规则 这类对比不如游戏炫酷 但更接近日常工作 真正花时间的从来不是生成第一版 而是让它遵守现有版本 别把关键组件丢掉 能直接进入下一轮审核 说点我的体验 我在长期使用Hermes的时候感觉 一个好的智能体 不是AI一键做出神级网页 而是一个更成熟更接近生产环境的过程 给它一份旧的deck 一套品牌规范 一些散乱的资料 它先理解哪些不能改 哪些要补 再做出可以继续编辑继续审核的出港 最后让人类把时间花在判断方向上 这才是所谓全能数字员工最值得讨论的版本 它不是一个会替你按键盘的幽灵 而是一个能把复杂信息收数成 可审核产物的协作者 所以你可以更新一下拆GPT的桌面版本 GPT 5.6在Workspace和Codex里 已经开始吞噬Hermes的这些能力 它很强 但Hermes仍然有自己的生存空间 而支撑底层这一切的是Programmatic Tool Calling 官方所说的不是AI把10万号Excel全塞进脑子 而是模型可以在Responses API里面写 并行内存中的轻量程序 协调工具处理海量中间结果 保留真正重要的信息 并在过程中调整下一步 少一点把数据来回搬运 少一点模型与工具的往返 少一点人类盯着每一小步确认 你会发现真正被替代的不是某一个职业名称 而是大量人类只是充当软件之间搬运工的工作片段 这不是用来教任何人攻击系统的图 它说明的是 模型已经更能理解从脆弱代码到可执行利用之间的复杂链条 所以官方同时强调 它的防御性价值 也就是审计修复威胁节目蓝队 也必须伴随更严格的访问与监控 同一件事在网络安全和生命科学上同时出现 AI不再只会写一段看聪明的回答 它开始参与更长更专业更需要验证的过程 能力越靠近现实世界 安全验证和责任就越不能被当成片尾小字 OPEN也明确写了它对可信访问的限制 个人需要在9月1日前启用Advanced Account Security 才能保留最高Cyber Capable模型访问权 组织需要申请Trusted Excise for Cyber 同时会在高风险实体与高风险辖区做额外限制 所以对于被限制的地区的用户 我的建议是 还是把核心业务放在开源模型上 没有必要对目前的头部B用AI公司心存幻想 当然 模型发布当天最有意思的从来不是 厂商自己怎么说 而是第一批重度用户 把它扔进真实任务之后发生了什么 有一种声音是惊艳 Matt Schumer分享过一个案例 GPT 5.6SO一次性完成了一个体速化迈哈顿项目 按他的描述 模型未完成任务 自己运行了接近一周 你可以把它看成是一个极端案例 不要把单个展示当成普遍结论 但是他足够说明 长周期持续执行的agent 已经不只是实验室里的概念了 第二种声音是泼冷水 而且这种声音非常重要 开发者 Addit也在测试AI数据看板后直言 UI仍然有浓厚的AI生成感 没有看到巨大改善 这正好提醒我们 设计能力的提升不等于审美问题 已经被彻底解决 能做出一个能跑的界面 和能做出一个让用户愿意停留 让品牌愿意签字的界面 中间仍然隔着品位上下文和业务判断 第三种声音可能是我最喜欢的一条 工程师Mark Miller分享GPT5.6Soul 用一次调用重构了整个代码库 也就是50,235次调用 15个小时 60亿Token 100万行新代码 1500个新文件 然后他写了一句 大意是没有一处真的能跑 但确实壮观 这就是今天agent的真实状态 他们能把产出量推到人类难以想象的高度 但是产出量不等于可靠性 自主运行时间不等于对目标的理解 看起来完整也不等于可以上线 所以不要把GPT5.6神化 真正专业的使用方式不是让它无限跑 而是给它明确目标 拆分可验证阶段 设定验收标准 并在关键节点保留人的判断和责任 这张价格表你可以仔细去看看 它实际上是整场发布的商业答案 SO负责最难的角色 Terra负责平衡 Nura负责规模化 缓存和工具调用 再把反复工作压低 未来真正跑起来的 不会是一个无所不能昂贵无比的神模型 而是一条懂得分工的智能产线 好 让我们回到开头那个问题 GPT5.6到底改变了什么 它不只是把一个模型做得更聪明 它把Soul Terra Nula 变成了一条可以丰功的智能产线 它让默认高效和暗需拉满性能同时成立 它用Ultro让多个Agent开始运行协作 它让AI不止生成代码和内容 也开始检查渲染结果 加工可交付的文档表格与演示文稿 它还开始参与训练系统实验和模型改进 这些更靠近AI研发核心的工作 所以最危险的误解是 未来属于最会操作AI的人 不 按钮会越来越简单 界面会越来越像聊天 连工具调用 任务拆解和执行路径 都会越来越被系统藏在背后 未来真正值钱的人是最会给AI下达完整目标的人 他知道什么问题值得解决 他能说清楚什么叫做好 他能提供别人没有的上下文判断和审美 他也愿意在AI做错时承担最后的责任 会写代码的人不会因此失去价值 设计师 研究员 运营 创业者也不会凭空消失 但所有人的价值都会更少的来自 亲手完成每一个动作 更多的来自决定方向 建立标准 组织智能并判断结果是否真的值得存在 当AI开始像一个团队一样工作时 人类最该升级的就不再只是自己的工具熟练度了 而是你带领一个团队走向结果的能力 哪怕这个团队今天还没有一个人类成员 好的 这里是World Insight 今天的视频就先聊到这里 如果你喜欢今天的节目 别忘了点赞分享并订阅我的频道 及时获取科技资讯和深度解析 如果你觉得对你有帮助 欢迎加入我的会员 每月一杯咖啡的钱 这就是对我最大的支持 好 感谢观看 我们下期再见