2026年7月20日 洛杉矶第53届SIGGRAPH大会现场 英伟达刚刚向全世界 摊牌了他们真正的野心 语言大模型只是一道开胃菜 AI接下来的主战场 根本不在互联网上 而是在物理世界 但这里有一个巨大的悖论 你要训练能干实事的物理AI 比如机器人自动驾驶 你需要海量的物理世界数据 可是现实世界的时间是按秒流逝的 你没法按快进键 那怎么办 英伟达给出的答案极其疯狂 既然现实世界太慢 那我们就用AI自己生成一个拥有 绝对真实物理规律的虚拟世界 让机器人在里面试错 而要造出这个世界 靠单纯的代码根本写不出来 必须要把计算机图形学物理 模拟和生成式AI彻底砸碎 揉在一起 这就是这场SIGGRAPH 2026主题演讲的真正内核 这场发布会的信息 密度大到让人窒息 不仅直接终结了传统 游戏渲染的路线之争 还把原本需要超级计算机才能跑 的流体力学压缩到了一张显卡里 最后甚至端出了一个让机器人 能在里面无限进化的母体世界 英伟达在这次大会上 到底放出了什么怪物 为了把逻辑盘清楚 我会把整场发布会拆解 成三个最核心的板块 less 5的降维打击 AI对传统物理模拟的颠覆 以及终极武器Cosmos3世界模型 这期内容没有任何水分 各位看官先赞后看 祝大家好运不断 我们直接开始 首先让我们把目光 拉回黄仁勋的开场 老黄一上台就提到了 一个很有意思的闭环 30年前英伟达为了解决传统 电脑做不了的图形计算 造出了GPU 后来他们搞出了可编程着色器 搞出了CUDA 结果阴差阳错的在 2012年引爆了现代AI 现在AI长大了 它要开始反哺它的 老本行图形渲染了 这引出了整场发布会的第一颗核弹 del S5 玩游戏的朋友对del s肯定不陌生 从早期的空间放大 到后来的帧生成 再到del s三点五的光线重建 英伟达一直在教显卡怎么猜像素 但到了Delsew 应用深度学习研究总监 Edward Liu上台说了一句话 直接把桌子掀了 他说 传统的图形学是从第一性原理出发 我们搭建场景 用物理定律模拟光线 然后用摄像机去拍 每一个像素出现在那里 都是因为有人希望它在那里 这是传统渲染的骄傲 但也成了它的死穴 就算你用上了最顶级的路径追踪 比如DES4时代的水平 光线是全模拟了 但你抬头看看那张图 离真正的照片级 真实还是差了一口气为什么 因为真实世界的光影互动太复杂了 次表面散射 复杂的慢反射 这些东西如果全靠传统算法去硬算 算力根本撑不住 这时候你可能会说 那直接用AI生成不就好了 现在的midjourney或者stable diffusion生成 的照片不是早就以假乱真了吗 这就是问题所在 生成式模型确实懂什么是真实 你喂给他几亿张现实照片 他早就学会了皮肤 在阳光下怎么透亮 头发背光时怎么发丝分明 但生成式模型有一个致命的缺陷 它是基于概率的 它不可控 你给AI输入一个提示词 黄昏下的商人 他能给你画出一个绝美的商人 但你再让他画一次 商人的脸就变了 这对离线作图没问题 但如果是实时运行的游戏 这一帧商人长这样 下一帧商人换了套衣服 玩家还以为见鬼了 更要命的是 生成式模型有一种自作主张的毛病 比如游戏美术总监设定这个 主角脸上必须有一道深深的疤痕 因为这是他的故事线 但AI模型一看哎呀 这脸上有个瑕疵 顺手就给你抹平了 甚至还给你加了个美颜 画面是好看了 但艺术表达彻底被毁了 这就是摆在Edward Liu和他 的团队面前的三座大山 Dolores 5要解决的就是怎么把AI的 相片级生成能力塞进游戏里 同时还得把它像狗一样死死 拴在游戏引擎的渲染管线上 绝对不能乱跑 第一座大山就是怎么保留一素一图 DOLOS5的做法非常粗暴但有效 他不听提示词 他只看游戏引擎刚渲染 出来的那些原始数据缓冲 比如反照率表面法线 还有基础光照信息 模型被严格训练成一个死心眼 必须绝对尊重这些 底层几何和语义数据 如果引擎说这里有一道疤 你就得在这道疤上给我做文章 在这个红线之内 AI可以尽情发挥它对真实感的理解 比如它可以在这道疤痕周围 加上极其逼真的皮肤肌理 给耳朵加上之前引擎算 不出来的次表面散射 让环境光遮蔽变得更深邃 它改变了画面的质感 但绝对不改变画面里的故事 第二座大山是时间连续性 目前市面上搞视频生成的AI模型 比如Sora 它们的工作原理 都是一次性看好几帧 甚至一整段视频 前前后后对齐了再生成 但游戏不行啊 游戏是实时互动的 玩家鼠标一甩 下一帧是什么 谁都不知道 所以Delessu根本没有偷看未来的特权 它必须严格遵循因果关系 一帧进一帧出 这就必须用到游戏 引擎底层的运动向量 通过告诉AI模型画面里 的物体是怎么移动的 DIOS5硬生生做到了一帧接一帧生成 而且没有画面闪烁 没有物体漂移 角色走在水里的倒影稳如老狗 第三座大山简直就是地狱难度 那就是速度 你想想一个4K分辨率的画面 大概有800万个像素 如果你要跑到60帧 意味着留给每一帧的总 时间只有区区16.6毫秒 而这16.6毫秒里 游戏本身的物理计算AI逻辑 基础渲染还要占掉一大半 留给LARS5的时间可能只有几毫秒 那些能生成逼真画面的基础大模型 动不动就几十几百亿参数 跑一张图要几秒钟 英伟达是怎么把它塞进 几毫秒的计算窗里的 Edward Liu透露 他们做了一次极其夸张的模型蒸馏 他们把大模型里关于世界 长什么样的常识提取出来 扔掉所有没用的东西 比如怎么生成猫咪搞笑视频 最后压缩成了一个单步 像素空间的扩散Transformer模型 这个模型小巧专注 唯一的任务就是 看着引擎给出的草图 瞬间给它披上一层照片级真实的皮 为了证明这套东西 不是实验室里的PPT 英伟达直接把他们的 创意艺术家Geff请上了台 现场演示了开发者 怎么驯服这台AI怪兽 这一段演示其实透露了 一个非常可怕的商业信号 我们稍微停下来拆解一下 在Geoff的演示里 我们看到delight5并不是 一个傻瓜式的开关 它给开发者提供了 一整套极为变态的控制台 开发者可以选不同的底层模型 模型a模型b模型c 不同模型的成图风格都不一样 更夸张的是结构强度 structure intensity和色调强度 tone intensity这两个滑块 结构强度控制的是高频细节 比如毛孔 微小阴影 色调强度控制的是低频细节 比如整体光影氛围 不仅如此 因为DLSS5在底层就懂场景里的语义 开发者可以直接在引擎里拉个框 说我只要这串葡萄和这个酒瓶 应用DLSS5 背景的木板不要动 然后你拉动滑块 眼看着那个塑料质感的酒瓶瞬间 有了金属和玻璃交织的折射光 葡萄透出了晶莹剔透的水分 而旁边的环境纹丝不变 你看出英伟达的阳谋了吗 以往游戏公司为了优化画质 要花海量的时间写各种shader着色器 调优各种光影参数 现在英伟达告诉你 别折腾了 把基础几何建好 剩下的写实渲染用我的Delux 5大模型加上滑块来搞定 一旦游戏开发者习惯了这种 所见即所得的AI生成式渲染管线 他们就再也回不去 传统的手工死磕模式了 而这种开发流 是深度绑定英伟达硬件的Tensor core 这意味着什么 这意味着AMD和索尼在主机和显卡 市场的传统追赶路线彻底失效了 你堆再多的传统流处理器 算力翻倍 也打不过英伟达 直接在管线末端用AI大模型给 你无中生有生成的真实感 这其实宣告了计算机 图形学进入了一个新纪元 Edward Liu在台上放出了一张图 展示了图形学历史上的几次飞跃 可编程着色器是一次 光线追踪是一次 而现在 生成式AI是最新的一条增长曲线 最可怕的是 只要英伟达在后台不断用更好的 数据更优的损失函数训练这个模型 玩家甚至不需要换显卡 只要更新一下驱动 游戏画面的真实度就能凭空跃升 Delus 5本质上是将算力门槛 转换成了模型护城河 这就是为什么老黄敢说 下一代的内容创作基建 依然牢牢握在英伟达手里 但游戏和电影 说到底只是给人的眼睛看的 如果你觉得迪乐斯舞已经够震撼了 那接下来的内容才是真正 触及物理世界底层的硬核科技 当画面真实到一定程度后 下一个要解决的 就是物理规律的真实 这个时候 英国科学家Neil Ashdown上场了 他带来的技术才是 真正能帮波音造飞机 帮台积电建厂房的核心武器 AI驱动的物理模拟 如果说格拉斯5是在视觉 上欺骗了我们的眼睛 那么接下来的技术 就是在物理规律上 直接掀翻了传统 科学和工程界的桌子 当Neil Ashton上台的时候 他没有一上来就提游戏或者渲染 而是放了一段非常震撼 的地球气候模拟视频 这是一个分辨率达到1公里 拥有500亿个网格单元 的超级模拟系统 用来预测全球的气象变化 这种级别的模拟在传统 科学界是什么概念呢 它需要动用超过2万张最顶级的GPU 连续运行不知道多少天才能 算出一个勉强精准的结果 为什么传统物理模拟这么费劲 这里我们要补一点干货 在传统的工程世界里 不管是预测天气设计汽车的风阻 还是测试台积电晶圆厂里的气流 用的都是这类传统数值方法 你要把空间切成无数个微小的网格 然后根据那些让 人头秃的偏微分方程 计算每一个网格里 空气水或者热量的变化 你的网格切得越细 时间步长设得越短 结果就越准确 但代价是计算量会呈指数级爆炸 这就好比你要一粒沙一粒沙地 去数整个撒哈拉沙漠的沙子 算力根本不够用所以 Ashton在台上抛出了一个灵魂拷问 既然我们的目标是得到更高的精度 但又不可能每天都跑2万张GPU 那AI能不能来帮忙答案是 能而且效果极其吓人 它展示了目前气象界的一场革命 NVIDIA和其他研究机构合作 不是让AI去强行背诵物理公式 而是把过去40年积累 的气象观测数据 以及最高精度的传统模拟数据 统统喂给一个机器学习模型 就像大语言模型通过 海量文本学会了说话一样 这个AI模型通过海量的数据 硬生生的领悟了流体 和热力学运作的规律 结果是什么 这个训练好的AI模型 只需要几秒钟或者几分钟 就能在普通的硬件上跑出 以前需要几个小时甚至 几天才能算出的天气预测 而且准确率甚至比 传统的数值模拟还要高现在 全球很多顶级的气象中心已经把 这种AI预测模型投入到实际生产中 了但这还不是最牛的Ashton 紧接着话锋一转 气象学家其实还算轻松的 因为地球的形状是固定的 但对于我们这些搞 流体力学工程的人来说 最痛苦的是几何形状的无限变化 他放出了一个极度复杂 的飞机气动模拟画面 当你坐飞机的时候 可能留意过发动机外壳 上有几道不起眼的凸起 这玩意是干嘛的 空气是看不见的 如果不通过极高精度的模拟 设计师根本不知道这些凸起 会在空气中划出怎样的涡流 更不知道这些涡流能不能顺着机翼 在起飞和降落时提供额外的升力 为了设计出一架好飞机 一辆好汽车 工程师需要反复修改 这些零部件的形状 然后再进行漫长的模拟计算 这中间的时间成本和算力成本 简直是个天文数字 那么Nvidia是怎么用AI来 降维打击这个领域的呢 重点来了 请竖起耳朵 这段数据非常夸张 Ashton展示了一个包含了大约2,000种 不同气动布局的飞机公开数据集 如果用传统方法去跑这2,000 种布局的高精度流体模拟 超过10亿个自由度 它会生成大约200TB的庞大数据 你猜NVIDIA用他们最新的Transformer 架构和极度聪明的TOKEN化技术 训练出来的AI模型有多大 不是20太字节 不是2太字节 而是只有200兆字节 你没听错 这简直不是压缩 这是魔法 相当于把200TB包含了复杂 流体力学知识的数据 提炼出了最核心的物理规律 塞进了一个200兆字节的检查点里 这是一个近乎100万倍的数据压缩 更可怕的是它的速度和泛化能力 Ashton在台上直接做了一个现场演示 这在工程界堪称神迹 他用这个200兆字节的训练模型 去预测一个他在训练数据里 从来没有见过的全新飞机几何 形状以及全新的边界条件结果呢 这个模型只用了一秒钟 仅仅在一张相对普通的 RT X6000工作站显卡上 就立刻吐出了气流分布的预测结果 更绝的是 这个结果不是那种为了 好看而生成的瞎猜动画 它是符合严谨物理规律的 与传统高精度模拟相比 误差只有惊人的1%到2% 传统的流程是改一次设计 等几天出结果 发现不行 再改一次设计 现在的流程是改一次设计 一秒钟出结果 立刻知道行不行 效率提升了1万倍以上 这意味着什么 这意味着未来工业设计 的门槛将被彻底打穿 波音空客特斯拉 甚至是造服务器机房的公司 他们可以把这个极度轻量化 但在物理上完全正确的AI模拟引擎 直接插进他们的设计软件里 设计师随便调整一下汽车的尾翼 软件就能在毫秒级 告诉你风阻降了多少 散热工程师改变一下机箱的进风口 立刻就能看到热流的变化 艾什顿站在台上对台下的 计算机图形学专家们喊话 你们这些搞好莱坞特效的 搞水流烟雾模拟的 你们以前只是为了 追求视觉上的好看现在 是时候把你们在可微物理 几何建模上的经验带过来 跟我们一起把这些能力推向电磁学 结构力学 去加速下一代的科学和工程革命 听到这里 如果你是一个懂商业的人 你应该能闻到血腥味了 NVIDIA现在的野心绝不仅仅是 做个卖铲子的算力供应商 他正在把自己变成 一个物理现实的定义者 所有的物理世界规律 正在被Nvidia的模型吃进去 嚼碎了变成了一行行AI可以 瞬间调用的代码 但Nvidia花这么大力气搞物理模拟 真的是只为了帮人造飞机造汽车吗 当然不是 所有这些在虚拟世界里 极度真实的物理法则 其实都是在为整场 发布会的终极形态铺路 他们要创造一个完全受 物理定律支配的虚拟宇宙 去孕育下一代的人工智能 这就引出了发布会的第三个板块 也是最让科技界炸锅的内容 Cosmos3世界模型以及那个 让人细思极恐的物理AI NVIDIA花这么大代价搭建这个 绝对符合物理定律的游乐场 真正要装进去的玩家只有一个 那就是未来的物理AI 也就是具身智能和自动驾驶 这个时候 Cosmos实验室的副总裁Ming Liu上台了 他一开口直接戳穿了现在 整个机器人行业的遮羞布 物理AI现在有一个致命的死穴 数据枯竭 你仔细算一笔账 为什么ChatGPT这种 语言大模型能爆发 因为互联网上存着人类 几十年敲下来的海量文本 Openai直接拿爬虫一刮 语料库就有了 但机器人呢 机器人要学习怎么抓杯子 怎么躲避行人 怎么在厨房煎鸡蛋 这些所谓的物理直觉 互联网上根本没有 现成的数据包可以下载 你想让机器人变聪明 传统的做法就是 真枪实弹的去录数据 比如你要训练自动驾驶 你就得派车队去 马路上跑几千万公里 你要训练机械臂 就得让人带着VR头显 一次次控制机械臂去 抓取桌子上的积木 这种遥操作收集的数据确实精准 但效率低得令人发指 现实世界的物理法则是按秒流逝的 你没法对着现实世界按快进键 真车在路上开一个小时 就是实打实的一个小时 遇到极端车祸场景的概率 更是低到可以忽略不计 如果靠传统方式去喂养物理AI 可能再过50年 机器人还是个只会扫地的智障 明佑陆在台上的原话非常狠 他说如果只有现实世界这一条路 物理AI永远无法普及但如果 我们能造出一个从机器人 视角出发的虚拟世界模型呢 这句话一出来 整个逻辑闭环彻底打通 只要能用AI生成一个 极度真实的虚拟世界 数据获取就不再是苦 哈哈的去大街上收集 而是变成了在机房里用算力生成 每一滴消耗的GPU算力 都会直接转化成 无数个边缘测试场景 无数种天气状况 一千个不同的厨房布局 一万个不同的仓库环境 这就是这场发布会的终极核 但Cosmos3世界模型 不要把Cosmos当成一个 简单的视频生成工具 它跟Sora完全不是一个维度的东西 Cosmos的底层是一个极其 庞大的混合Transformer架构 左边是一个自回归塔 负责逻辑推理 比如它看到画面 会自己思考接下来该发生什么 右边是一个扩散塔 负责生成画面和声音 而这中间最核心的突破 是他把一种全新的 模态扔进了神经网络里 这个模态叫做动作 什么意思呢 以前的AI看视频就 只是看一堆像素在动 但Cosmos不一样 它是带着目的去理解世界的 为了让全天下所有长得 奇形怪状的机器人都能听懂指令 NVIDIA做了一件非常 可怕的底层统一工作 他们发明了一套 通用的几何动作语言 不管你是四个轮子的自动驾驶汽车 还是单臂工业机器人 或者是拥有两条腿 两只手的人形机器人 在Cosmos眼里 统统被拆解成了最基础的几何基元 你的机身位置在哪里 ego pose你的执行器在哪里 effectors你的抓手在干什么 grippers这个动作定义一确立 发生了一件颠覆整个行业的事情 人类拍的第一人称视频 突然全部变成了机器人的顶级教材 你想一个人带着Gopro在厨房里做饭 视频里的画面就是机身位置 两只手就是两个执行器 Cosmos通过逆向动力学 看完这段视频 立刻就能反推出做饭时 的关节受力和空间轨迹 然后把这套动作逻辑直接 打包装进机器人的大脑里 以前那些没用的网红做饭视频 现在全成了喂养物理AI的顶级语料 这就是降维打击 有了这个万能底座 NVIDIA直接掏出了Cosmos3的家族全家桶 前面提到的针对自动驾驶的Nano模型 针对极致保真度的super模型 这些其实在之前的GTC 大会上就露过脸了 但这次SIGGRAPH min Liu 亮出了最后一块拼图 也是最关键的一步棋Cosmos3edge 这是一个只有40亿 参数的维缩版小模型 专为端侧实时运行量身定制 发布会现场直接切 到了一个实机演示 一个机械臂盯着桌子 上的一个灰色方块 机械臂的底座里插着一块 搭载Jetson Thor芯片的计算板 这个40亿参数的Cosmos 3 edge模型 就在这块本地芯片上疯狂运转 他直接通过摄像头看着那个方块 不仅能瞬间看懂 方块的材质空间位置 还能在毫秒级预测出 自己抓取动作的结果 然后直接指挥机械臂 一把将方块抓起来 这个过程没有任何 云端服务器的参与 没有来回传输的网络延迟 传感器数据进去 机械臂的控制信号出来 这就是边缘端实时控制的完全体 NVIDIA告诉你 未来的机器人不需要时刻 连着Wifi去求助云端的大脑 他们出厂自带一个极度聪明的小脑 能够在真实物理环境里 靠自己的芯片做出 瞬间的生存和作业反应 而为了让这种模型能够又快又准 NVIDIA甚至把去噪步数 强行压缩到了4步 这意味着什么 这意味着图像和视频生成的 响应速度足足飙升了25倍 不管是响应时间还是推理成本 都直接砸穿了地板价 让商用落地变成了可能 最后整场发布会的高潮 也是最让自动驾驶厂商 后背发凉的演示来了 Cosmostreams神经闭环模拟器 在屏幕上 你看到的是一辆自动驾驶 汽车在城郊街道上行驶的画面 阳光树影路过的其他车辆 一切都真实的 甚至有些刺眼 但Ming Yulu旁边的 工程师拿着一个PS4手柄 直接控制着画面里的 汽车左转右转刹车 这不是放录像 也不是GTA5游戏画面 这是Cosmos DREAMS在毫秒级 实时生成的AI梦境 工程师手柄按下去的每一个动作 传给Cosmos后 大模型立刻根据现实 世界的物理规律光影逻辑 凭空运算出汽车挡风玻璃前 接下来该出现的每一帧画面 不仅是正前方的主视角 连右下角的鸟瞰图 也是同步实时生成的 这台自动驾驶汽车的AI算法 其实正行驶在Cosmos大模型给 它编织的一场逼真梦境里 他在梦里遇到加塞 遇到暴雨 遇到鬼探头 他做出的每一次方向盘打轮 都会得到完全符合现实规律的反馈 车企甚至不需要把测试车开上街 直接把自动驾驶的策略 模型接进Cosmos DREAMS里 就可以做无尽的被动 验证和极端场景训练 最离谱的在这里 几个月前 NVIDIA刚搞出这个实时 梦境系统的时候 还要靠整整64张GB300级别的 顶级芯片并联才能勉强跑动 那个成本是正常 公司根本负担不起的 后来他们把算力优化 到了16张Vera Rubin芯片 而今天在SIGGRAPH 2026的舞台上 这套完全实时的高保真的 闭环虚拟自动驾驶模拟器 只需要靠桌子上一张单 卡的RTX Pro6,000工作站显卡 就能流畅运行 一张单卡跑起了一整个物理世界 当算力成本被压缩到这个地步 自动驾驶和机器人行业的研发门槛 直接从云端跌落到了车库级别 以后任何一家做物理AI的创业公司 只要买一台Nvidia的工作站 就等于拥有了一个可以 无限折叠时间和空间 无限试错的现实训练场 讲到这里 整场SIGGRAPH 2026主题演讲的 底牌已经完全翻开了 如果你到现在 还以为Nvidia只是在卖GPU 那你已经被远远甩在时代后面了 从delight五重数图形渲染管线 到把庞大的流体力学 压缩近200兆的模型 再到今天发布主宰物理 定律的Cosmos3和Cosmos DREAMS NVIDIA正在亲手搭建 一条从数字到物理 从软件到硬件的绝对垄断闭环 它给开发者提供底层算力 给工程师提供物理引擎 最后给未来的机器人发放大脑 在这个新纪元里 不再是代码定义游戏 而是生成式AI直接定义世界 不再是车队去马路上苦苦收集数据 而是算力直接涌现出数据 未来的商业竞争 谁能掌握构建虚拟 世界的速度和保真度 谁就能控制物理AI进化的速度 而在这条赛道上 英伟达已经不是在领跑 它是在亲手制定物理 世界的全新操作系统 好今天就到这里了 记得点个订阅 我们持续追踪这些 巨头怎么改变未来