WEBVTT
Kind: captions
Language: zh-TW

00:00:00.166 --> 00:00:02.133
2026年7月20日

00:00:02.333 --> 00:00:05.666
洛杉矶第53届SIGGRAPH大会现场

00:00:05.900 --> 00:00:07.600
英伟达刚刚向全世界

00:00:07.600 --> 00:00:09.466
摊牌了他们真正的野心

00:00:10.200 --> 00:00:12.866
语言大模型只是一道开胃菜

00:00:13.300 --> 00:00:15.200
AI接下来的主战场

00:00:15.500 --> 00:00:17.166
根本不在互联网上

00:00:17.500 --> 00:00:18.933
而是在物理世界

00:00:19.000 --> 00:00:20.800
但这里有一个巨大的悖论

00:00:20.966 --> 00:00:23.400
你要训练能干实事的物理AI

00:00:23.566 --> 00:00:25.800
比如机器人自动驾驶

00:00:26.133 --> 00:00:28.166
你需要海量的物理世界数据

00:00:28.266 --> 00:00:31.700
可是现实世界的时间是按秒流逝的

00:00:31.733 --> 00:00:33.300
你没法按快进键

00:00:33.400 --> 00:00:34.300
那怎么办

00:00:34.466 --> 00:00:36.600
英伟达给出的答案极其疯狂

00:00:37.000 --> 00:00:38.533
既然现实世界太慢

00:00:38.733 --> 00:00:41.133
那我们就用AI自己生成一个拥有

00:00:41.133 --> 00:00:43.700
绝对真实物理规律的虚拟世界

00:00:43.766 --> 00:00:45.700
让机器人在里面试错

00:00:45.733 --> 00:00:47.266
而要造出这个世界

00:00:47.600 --> 00:00:50.000
靠单纯的代码根本写不出来

00:00:50.400 --> 00:00:53.000
必须要把计算机图形学物理

00:00:53.000 --> 00:00:55.900
模拟和生成式AI彻底砸碎

00:00:56.000 --> 00:00:56.866
揉在一起

00:00:56.933 --> 00:00:58.766
这就是这场SIGGRAPH

00:00:59.100 --> 00:01:01.400
2026主题演讲的真正内核

00:01:01.466 --> 00:01:02.800
这场发布会的信息

00:01:02.800 --> 00:01:04.400
密度大到让人窒息

00:01:04.566 --> 00:01:06.266
不仅直接终结了传统

00:01:06.266 --> 00:01:08.133
游戏渲染的路线之争

00:01:08.366 --> 00:01:10.966
还把原本需要超级计算机才能跑

00:01:10.966 --> 00:01:13.900
的流体力学压缩到了一张显卡里

00:01:14.200 --> 00:01:16.200
最后甚至端出了一个让机器人

00:01:16.200 --> 00:01:18.700
能在里面无限进化的母体世界

00:01:18.933 --> 00:01:20.266
英伟达在这次大会上

00:01:20.266 --> 00:01:21.866
到底放出了什么怪物

00:01:22.000 --> 00:01:23.600
为了把逻辑盘清楚

00:01:23.600 --> 00:01:25.733
我会把整场发布会拆解

00:01:25.733 --> 00:01:27.566
成三个最核心的板块

00:01:28.100 --> 00:01:29.533
less 5的降维打击

00:01:29.800 --> 00:01:32.266
AI对传统物理模拟的颠覆

00:01:32.400 --> 00:01:35.533
以及终极武器Cosmos3世界模型

00:01:35.600 --> 00:01:37.600
这期内容没有任何水分

00:01:37.700 --> 00:01:39.866
各位看官先赞后看

00:01:39.866 --> 00:01:41.333
祝大家好运不断

00:01:41.333 --> 00:01:42.566
我们直接开始

00:01:42.800 --> 00:01:44.366
首先让我们把目光

00:01:44.366 --> 00:01:46.100
拉回黄仁勋的开场

00:01:46.466 --> 00:01:48.133
老黄一上台就提到了

00:01:48.133 --> 00:01:49.666
一个很有意思的闭环

00:01:50.133 --> 00:01:53.000
30年前英伟达为了解决传统

00:01:53.000 --> 00:01:55.066
电脑做不了的图形计算

00:01:55.100 --> 00:01:56.400
造出了GPU

00:01:56.566 --> 00:01:59.566
后来他们搞出了可编程着色器

00:01:59.733 --> 00:02:00.800
搞出了CUDA

00:02:00.900 --> 00:02:02.600
结果阴差阳错的在

00:02:02.600 --> 00:02:05.000
2012年引爆了现代AI

00:02:05.466 --> 00:02:07.366
现在AI长大了

00:02:07.366 --> 00:02:08.533
它要开始反哺它的

00:02:08.533 --> 00:02:10.666
老本行图形渲染了

00:02:10.766 --> 00:02:13.600
这引出了整场发布会的第一颗核弹

00:02:13.766 --> 00:02:14.566
del S5

00:02:14.566 --> 00:02:17.133
玩游戏的朋友对del s肯定不陌生

00:02:17.400 --> 00:02:19.300
从早期的空间放大

00:02:19.333 --> 00:02:20.866
到后来的帧生成

00:02:21.100 --> 00:02:23.500
再到del s三点五的光线重建

00:02:23.966 --> 00:02:26.700
英伟达一直在教显卡怎么猜像素

00:02:26.766 --> 00:02:27.800
但到了Delsew

00:02:28.400 --> 00:02:30.600
应用深度学习研究总监

00:02:30.700 --> 00:02:32.866
Edward Liu上台说了一句话

00:02:32.933 --> 00:02:34.533
直接把桌子掀了

00:02:34.733 --> 00:02:35.533
他说

00:02:35.533 --> 00:02:38.600
传统的图形学是从第一性原理出发

00:02:38.700 --> 00:02:40.166
我们搭建场景

00:02:40.366 --> 00:02:42.733
用物理定律模拟光线

00:02:42.800 --> 00:02:44.733
然后用摄像机去拍

00:02:44.933 --> 00:02:47.066
每一个像素出现在那里

00:02:47.166 --> 00:02:49.333
都是因为有人希望它在那里

00:02:49.533 --> 00:02:51.200
这是传统渲染的骄傲

00:02:51.366 --> 00:02:52.933
但也成了它的死穴

00:02:53.166 --> 00:02:55.700
就算你用上了最顶级的路径追踪

00:02:55.733 --> 00:02:57.700
比如DES4时代的水平

00:02:57.966 --> 00:02:59.600
光线是全模拟了

00:02:59.600 --> 00:03:01.400
但你抬头看看那张图

00:03:01.466 --> 00:03:02.766
离真正的照片级

00:03:02.766 --> 00:03:05.533
真实还是差了一口气为什么

00:03:05.666 --> 00:03:08.700
因为真实世界的光影互动太复杂了

00:03:08.966 --> 00:03:10.200
次表面散射

00:03:10.700 --> 00:03:11.966
复杂的慢反射

00:03:12.300 --> 00:03:15.200
这些东西如果全靠传统算法去硬算

00:03:15.500 --> 00:03:17.100
算力根本撑不住

00:03:17.133 --> 00:03:18.566
这时候你可能会说

00:03:18.666 --> 00:03:21.166
那直接用AI生成不就好了

00:03:21.566 --> 00:03:25.100
现在的midjourney或者stable diffusion生成

00:03:25.100 --> 00:03:27.866
的照片不是早就以假乱真了吗

00:03:27.933 --> 00:03:29.466
这就是问题所在

00:03:29.733 --> 00:03:32.400
生成式模型确实懂什么是真实

00:03:32.566 --> 00:03:34.966
你喂给他几亿张现实照片

00:03:35.100 --> 00:03:36.366
他早就学会了皮肤

00:03:36.366 --> 00:03:38.100
在阳光下怎么透亮

00:03:38.200 --> 00:03:40.533
头发背光时怎么发丝分明

00:03:40.866 --> 00:03:43.300
但生成式模型有一个致命的缺陷

00:03:43.766 --> 00:03:45.300
它是基于概率的

00:03:45.333 --> 00:03:46.300
它不可控

00:03:46.366 --> 00:03:48.533
你给AI输入一个提示词

00:03:49.066 --> 00:03:50.500
黄昏下的商人

00:03:50.666 --> 00:03:53.166
他能给你画出一个绝美的商人

00:03:53.300 --> 00:03:55.100
但你再让他画一次

00:03:55.466 --> 00:03:56.933
商人的脸就变了

00:03:56.933 --> 00:03:58.800
这对离线作图没问题

00:03:58.966 --> 00:04:01.166
但如果是实时运行的游戏

00:04:01.300 --> 00:04:03.100
这一帧商人长这样

00:04:03.100 --> 00:04:05.100
下一帧商人换了套衣服

00:04:05.200 --> 00:04:06.900
玩家还以为见鬼了

00:04:06.900 --> 00:04:08.166
更要命的是

00:04:08.600 --> 00:04:12.333
生成式模型有一种自作主张的毛病

00:04:12.333 --> 00:04:15.100
比如游戏美术总监设定这个

00:04:15.100 --> 00:04:17.600
主角脸上必须有一道深深的疤痕

00:04:17.766 --> 00:04:19.400
因为这是他的故事线

00:04:19.533 --> 00:04:21.766
但AI模型一看哎呀

00:04:21.766 --> 00:04:23.266
这脸上有个瑕疵

00:04:23.600 --> 00:04:25.366
顺手就给你抹平了

00:04:25.366 --> 00:04:27.200
甚至还给你加了个美颜

00:04:27.533 --> 00:04:28.800
画面是好看了

00:04:28.800 --> 00:04:31.066
但艺术表达彻底被毁了

00:04:31.066 --> 00:04:33.466
这就是摆在Edward Liu和他

00:04:33.466 --> 00:04:35.666
的团队面前的三座大山

00:04:35.866 --> 00:04:39.066
Dolores 5要解决的就是怎么把AI的

00:04:39.066 --> 00:04:41.800
相片级生成能力塞进游戏里

00:04:41.966 --> 00:04:44.500
同时还得把它像狗一样死死

00:04:44.500 --> 00:04:47.133
拴在游戏引擎的渲染管线上

00:04:47.466 --> 00:04:48.666
绝对不能乱跑

00:04:48.666 --> 00:04:51.966
第一座大山就是怎么保留一素一图

00:04:52.100 --> 00:04:54.800
DOLOS5的做法非常粗暴但有效

00:04:54.966 --> 00:04:56.366
他不听提示词

00:04:56.566 --> 00:04:58.533
他只看游戏引擎刚渲染

00:04:58.533 --> 00:05:00.700
出来的那些原始数据缓冲

00:05:01.100 --> 00:05:03.366
比如反照率表面法线

00:05:03.566 --> 00:05:05.266
还有基础光照信息

00:05:05.666 --> 00:05:08.166
模型被严格训练成一个死心眼

00:05:08.333 --> 00:05:09.966
必须绝对尊重这些

00:05:09.966 --> 00:05:12.166
底层几何和语义数据

00:05:12.366 --> 00:05:14.466
如果引擎说这里有一道疤

00:05:14.933 --> 00:05:17.400
你就得在这道疤上给我做文章

00:05:17.700 --> 00:05:19.300
在这个红线之内

00:05:19.466 --> 00:05:23.100
AI可以尽情发挥它对真实感的理解

00:05:23.266 --> 00:05:25.466
比如它可以在这道疤痕周围

00:05:25.466 --> 00:05:27.533
加上极其逼真的皮肤肌理

00:05:27.666 --> 00:05:29.566
给耳朵加上之前引擎算

00:05:29.566 --> 00:05:31.300
不出来的次表面散射

00:05:31.500 --> 00:05:33.866
让环境光遮蔽变得更深邃

00:05:34.266 --> 00:05:36.066
它改变了画面的质感

00:05:36.066 --> 00:05:38.266
但绝对不改变画面里的故事

00:05:38.366 --> 00:05:40.900
第二座大山是时间连续性

00:05:41.466 --> 00:05:44.200
目前市面上搞视频生成的AI模型

00:05:44.200 --> 00:05:45.166
比如Sora

00:05:45.366 --> 00:05:46.500
它们的工作原理

00:05:46.500 --> 00:05:48.166
都是一次性看好几帧

00:05:48.466 --> 00:05:49.966
甚至一整段视频

00:05:50.000 --> 00:05:52.100
前前后后对齐了再生成

00:05:52.266 --> 00:05:53.533
但游戏不行啊

00:05:53.600 --> 00:05:55.300
游戏是实时互动的

00:05:55.300 --> 00:05:56.566
玩家鼠标一甩

00:05:56.866 --> 00:05:58.166
下一帧是什么

00:05:58.166 --> 00:05:59.266
谁都不知道

00:05:59.666 --> 00:06:02.666
所以Delessu根本没有偷看未来的特权

00:06:03.066 --> 00:06:05.466
它必须严格遵循因果关系

00:06:05.600 --> 00:06:07.600
一帧进一帧出

00:06:07.600 --> 00:06:08.966
这就必须用到游戏

00:06:08.966 --> 00:06:10.866
引擎底层的运动向量

00:06:10.933 --> 00:06:12.766
通过告诉AI模型画面里

00:06:12.766 --> 00:06:14.400
的物体是怎么移动的

00:06:14.666 --> 00:06:17.533
DIOS5硬生生做到了一帧接一帧生成

00:06:17.900 --> 00:06:19.466
而且没有画面闪烁

00:06:19.666 --> 00:06:20.866
没有物体漂移

00:06:21.133 --> 00:06:23.766
角色走在水里的倒影稳如老狗

00:06:23.800 --> 00:06:26.400
第三座大山简直就是地狱难度

00:06:26.400 --> 00:06:27.500
那就是速度

00:06:27.566 --> 00:06:30.400
你想想一个4K分辨率的画面

00:06:30.400 --> 00:06:32.000
大概有800万个像素

00:06:32.500 --> 00:06:34.000
如果你要跑到60帧

00:06:34.133 --> 00:06:35.733
意味着留给每一帧的总

00:06:35.733 --> 00:06:38.266
时间只有区区16.6毫秒

00:06:38.400 --> 00:06:40.333
而这16.6毫秒里

00:06:40.333 --> 00:06:43.133
游戏本身的物理计算AI逻辑

00:06:43.400 --> 00:06:45.666
基础渲染还要占掉一大半

00:06:45.733 --> 00:06:48.933
留给LARS5的时间可能只有几毫秒

00:06:49.266 --> 00:06:52.133
那些能生成逼真画面的基础大模型

00:06:52.666 --> 00:06:54.933
动不动就几十几百亿参数

00:06:55.200 --> 00:06:56.900
跑一张图要几秒钟

00:06:57.300 --> 00:06:58.800
英伟达是怎么把它塞进

00:06:58.800 --> 00:07:00.700
几毫秒的计算窗里的

00:07:00.766 --> 00:07:02.400
Edward Liu透露

00:07:02.800 --> 00:07:05.500
他们做了一次极其夸张的模型蒸馏

00:07:05.700 --> 00:07:07.466
他们把大模型里关于世界

00:07:07.466 --> 00:07:09.566
长什么样的常识提取出来

00:07:09.866 --> 00:07:11.566
扔掉所有没用的东西

00:07:11.766 --> 00:07:14.100
比如怎么生成猫咪搞笑视频

00:07:14.566 --> 00:07:16.333
最后压缩成了一个单步

00:07:16.566 --> 00:07:19.333
像素空间的扩散Transformer模型

00:07:19.466 --> 00:07:21.600
这个模型小巧专注

00:07:21.800 --> 00:07:23.166
唯一的任务就是

00:07:23.200 --> 00:07:25.200
看着引擎给出的草图

00:07:25.400 --> 00:07:28.600
瞬间给它披上一层照片级真实的皮

00:07:28.700 --> 00:07:29.900
为了证明这套东西

00:07:29.900 --> 00:07:31.733
不是实验室里的PPT

00:07:31.966 --> 00:07:33.300
英伟达直接把他们的

00:07:33.300 --> 00:07:35.700
创意艺术家Geff请上了台

00:07:35.733 --> 00:07:37.466
现场演示了开发者

00:07:37.466 --> 00:07:39.266
怎么驯服这台AI怪兽

00:07:39.333 --> 00:07:41.266
这一段演示其实透露了

00:07:41.266 --> 00:07:43.300
一个非常可怕的商业信号

00:07:43.300 --> 00:07:45.400
我们稍微停下来拆解一下

00:07:45.600 --> 00:07:47.000
在Geoff的演示里

00:07:47.000 --> 00:07:48.666
我们看到delight5并不是

00:07:48.666 --> 00:07:50.166
一个傻瓜式的开关

00:07:50.500 --> 00:07:51.733
它给开发者提供了

00:07:51.733 --> 00:07:53.866
一整套极为变态的控制台

00:07:53.966 --> 00:07:56.200
开发者可以选不同的底层模型

00:07:56.500 --> 00:07:58.933
模型a模型b模型c

00:07:59.133 --> 00:08:01.600
不同模型的成图风格都不一样

00:08:01.733 --> 00:08:03.700
更夸张的是结构强度

00:08:04.133 --> 00:08:06.800
structure intensity和色调强度

00:08:06.933 --> 00:08:09.333
tone intensity这两个滑块

00:08:09.500 --> 00:08:12.366
结构强度控制的是高频细节

00:08:12.366 --> 00:08:13.333
比如毛孔

00:08:13.400 --> 00:08:14.266
微小阴影

00:08:15.066 --> 00:08:17.900
色调强度控制的是低频细节

00:08:17.900 --> 00:08:19.600
比如整体光影氛围

00:08:19.600 --> 00:08:20.600
不仅如此

00:08:20.800 --> 00:08:24.266
因为DLSS5在底层就懂场景里的语义

00:08:24.366 --> 00:08:26.866
开发者可以直接在引擎里拉个框

00:08:27.200 --> 00:08:29.866
说我只要这串葡萄和这个酒瓶

00:08:29.933 --> 00:08:31.100
应用DLSS5

00:08:31.733 --> 00:08:33.333
背景的木板不要动

00:08:33.500 --> 00:08:34.933
然后你拉动滑块

00:08:35.200 --> 00:08:37.866
眼看着那个塑料质感的酒瓶瞬间

00:08:37.866 --> 00:08:40.733
有了金属和玻璃交织的折射光

00:08:40.900 --> 00:08:43.066
葡萄透出了晶莹剔透的水分

00:08:43.400 --> 00:08:45.666
而旁边的环境纹丝不变

00:08:45.766 --> 00:08:48.000
你看出英伟达的阳谋了吗

00:08:48.133 --> 00:08:50.733
以往游戏公司为了优化画质

00:08:50.866 --> 00:08:54.466
要花海量的时间写各种shader着色器

00:08:54.500 --> 00:08:56.200
调优各种光影参数

00:08:56.333 --> 00:08:57.866
现在英伟达告诉你

00:08:57.866 --> 00:08:59.000
别折腾了

00:08:59.000 --> 00:09:00.700
把基础几何建好

00:09:00.966 --> 00:09:03.766
剩下的写实渲染用我的Delux

00:09:03.766 --> 00:09:06.133
5大模型加上滑块来搞定

00:09:06.200 --> 00:09:08.333
一旦游戏开发者习惯了这种

00:09:08.333 --> 00:09:11.533
所见即所得的AI生成式渲染管线

00:09:11.800 --> 00:09:13.466
他们就再也回不去

00:09:13.466 --> 00:09:15.733
传统的手工死磕模式了

00:09:15.733 --> 00:09:17.000
而这种开发流

00:09:17.366 --> 00:09:20.266
是深度绑定英伟达硬件的Tensor core

00:09:20.566 --> 00:09:21.733
这意味着什么

00:09:21.933 --> 00:09:24.666
这意味着AMD和索尼在主机和显卡

00:09:24.666 --> 00:09:27.333
市场的传统追赶路线彻底失效了

00:09:27.333 --> 00:09:29.666
你堆再多的传统流处理器

00:09:29.866 --> 00:09:30.966
算力翻倍

00:09:31.000 --> 00:09:32.400
也打不过英伟达

00:09:32.766 --> 00:09:35.400
直接在管线末端用AI大模型给

00:09:35.400 --> 00:09:37.866
你无中生有生成的真实感

00:09:37.966 --> 00:09:39.766
这其实宣告了计算机

00:09:39.766 --> 00:09:41.866
图形学进入了一个新纪元

00:09:42.266 --> 00:09:44.700
Edward Liu在台上放出了一张图

00:09:44.966 --> 00:09:47.600
展示了图形学历史上的几次飞跃

00:09:47.866 --> 00:09:49.766
可编程着色器是一次

00:09:49.966 --> 00:09:51.500
光线追踪是一次

00:09:51.866 --> 00:09:52.666
而现在

00:09:52.800 --> 00:09:55.866
生成式AI是最新的一条增长曲线

00:09:55.966 --> 00:09:57.200
最可怕的是

00:09:57.266 --> 00:09:59.600
只要英伟达在后台不断用更好的

00:09:59.600 --> 00:10:02.900
数据更优的损失函数训练这个模型

00:10:03.066 --> 00:10:04.866
玩家甚至不需要换显卡

00:10:04.933 --> 00:10:06.533
只要更新一下驱动

00:10:06.600 --> 00:10:09.166
游戏画面的真实度就能凭空跃升

00:10:09.466 --> 00:10:12.200
Delus 5本质上是将算力门槛

00:10:12.266 --> 00:10:14.266
转换成了模型护城河

00:10:14.466 --> 00:10:16.266
这就是为什么老黄敢说

00:10:16.300 --> 00:10:18.366
下一代的内容创作基建

00:10:18.366 --> 00:10:20.533
依然牢牢握在英伟达手里

00:10:20.566 --> 00:10:21.933
但游戏和电影

00:10:22.200 --> 00:10:24.466
说到底只是给人的眼睛看的

00:10:24.466 --> 00:10:27.566
如果你觉得迪乐斯舞已经够震撼了

00:10:27.666 --> 00:10:30.166
那接下来的内容才是真正

00:10:30.166 --> 00:10:32.766
触及物理世界底层的硬核科技

00:10:33.133 --> 00:10:35.266
当画面真实到一定程度后

00:10:35.466 --> 00:10:36.900
下一个要解决的

00:10:36.900 --> 00:10:38.733
就是物理规律的真实

00:10:38.866 --> 00:10:39.700
这个时候

00:10:39.733 --> 00:10:42.200
英国科学家Neil Ashdown上场了

00:10:42.200 --> 00:10:43.966
他带来的技术才是

00:10:43.966 --> 00:10:45.900
真正能帮波音造飞机

00:10:45.966 --> 00:10:48.466
帮台积电建厂房的核心武器

00:10:48.700 --> 00:10:50.366
AI驱动的物理模拟

00:10:50.666 --> 00:10:52.400
如果说格拉斯5是在视觉

00:10:52.400 --> 00:10:54.100
上欺骗了我们的眼睛

00:10:54.300 --> 00:10:55.733
那么接下来的技术

00:10:55.900 --> 00:10:57.500
就是在物理规律上

00:10:57.800 --> 00:10:59.000
直接掀翻了传统

00:10:59.000 --> 00:11:00.933
科学和工程界的桌子

00:11:00.966 --> 00:11:03.133
当Neil Ashton上台的时候

00:11:03.366 --> 00:11:06.000
他没有一上来就提游戏或者渲染

00:11:06.600 --> 00:11:08.300
而是放了一段非常震撼

00:11:08.300 --> 00:11:10.300
的地球气候模拟视频

00:11:10.366 --> 00:11:12.666
这是一个分辨率达到1公里

00:11:12.800 --> 00:11:14.700
拥有500亿个网格单元

00:11:14.700 --> 00:11:16.300
的超级模拟系统

00:11:16.366 --> 00:11:18.733
用来预测全球的气象变化

00:11:18.933 --> 00:11:20.700
这种级别的模拟在传统

00:11:20.700 --> 00:11:22.500
科学界是什么概念呢

00:11:22.800 --> 00:11:25.966
它需要动用超过2万张最顶级的GPU

00:11:26.266 --> 00:11:28.533
连续运行不知道多少天才能

00:11:28.533 --> 00:11:30.666
算出一个勉强精准的结果

00:11:30.800 --> 00:11:33.133
为什么传统物理模拟这么费劲

00:11:33.166 --> 00:11:34.800
这里我们要补一点干货

00:11:35.133 --> 00:11:36.866
在传统的工程世界里

00:11:36.933 --> 00:11:40.100
不管是预测天气设计汽车的风阻

00:11:40.266 --> 00:11:43.133
还是测试台积电晶圆厂里的气流

00:11:43.300 --> 00:11:45.800
用的都是这类传统数值方法

00:11:45.900 --> 00:11:48.866
你要把空间切成无数个微小的网格

00:11:49.333 --> 00:11:50.400
然后根据那些让

00:11:50.400 --> 00:11:52.500
人头秃的偏微分方程

00:11:52.800 --> 00:11:54.333
计算每一个网格里

00:11:54.333 --> 00:11:57.000
空气水或者热量的变化

00:11:57.100 --> 00:11:58.600
你的网格切得越细

00:11:59.066 --> 00:12:00.700
时间步长设得越短

00:12:00.866 --> 00:12:02.133
结果就越准确

00:12:02.200 --> 00:12:05.466
但代价是计算量会呈指数级爆炸

00:12:05.600 --> 00:12:08.400
这就好比你要一粒沙一粒沙地

00:12:08.400 --> 00:12:11.100
去数整个撒哈拉沙漠的沙子

00:12:11.366 --> 00:12:13.566
算力根本不够用所以

00:12:13.933 --> 00:12:16.566
Ashton在台上抛出了一个灵魂拷问

00:12:16.700 --> 00:12:19.500
既然我们的目标是得到更高的精度

00:12:19.500 --> 00:12:22.366
但又不可能每天都跑2万张GPU

00:12:22.500 --> 00:12:25.466
那AI能不能来帮忙答案是

00:12:25.800 --> 00:12:27.966
能而且效果极其吓人

00:12:28.000 --> 00:12:30.566
它展示了目前气象界的一场革命

00:12:30.700 --> 00:12:33.133
NVIDIA和其他研究机构合作

00:12:33.133 --> 00:12:35.933
不是让AI去强行背诵物理公式

00:12:36.100 --> 00:12:37.900
而是把过去40年积累

00:12:37.900 --> 00:12:39.366
的气象观测数据

00:12:39.733 --> 00:12:42.100
以及最高精度的传统模拟数据

00:12:42.166 --> 00:12:44.466
统统喂给一个机器学习模型

00:12:44.533 --> 00:12:46.300
就像大语言模型通过

00:12:46.300 --> 00:12:48.800
海量文本学会了说话一样

00:12:48.800 --> 00:12:51.266
这个AI模型通过海量的数据

00:12:51.466 --> 00:12:53.366
硬生生的领悟了流体

00:12:53.366 --> 00:12:55.266
和热力学运作的规律

00:12:55.400 --> 00:12:56.400
结果是什么

00:12:56.466 --> 00:12:58.266
这个训练好的AI模型

00:12:58.700 --> 00:13:00.966
只需要几秒钟或者几分钟

00:13:01.000 --> 00:13:03.333
就能在普通的硬件上跑出

00:13:03.333 --> 00:13:05.166
以前需要几个小时甚至

00:13:05.166 --> 00:13:07.466
几天才能算出的天气预测

00:13:07.700 --> 00:13:09.600
而且准确率甚至比

00:13:09.600 --> 00:13:12.200
传统的数值模拟还要高现在

00:13:12.600 --> 00:13:15.466
全球很多顶级的气象中心已经把

00:13:15.466 --> 00:13:18.600
这种AI预测模型投入到实际生产中

00:13:18.600 --> 00:13:21.566
了但这还不是最牛的Ashton

00:13:22.000 --> 00:13:23.500
紧接着话锋一转

00:13:23.666 --> 00:13:26.100
气象学家其实还算轻松的

00:13:26.100 --> 00:13:28.466
因为地球的形状是固定的

00:13:28.533 --> 00:13:30.200
但对于我们这些搞

00:13:30.200 --> 00:13:32.266
流体力学工程的人来说

00:13:32.400 --> 00:13:35.300
最痛苦的是几何形状的无限变化

00:13:35.666 --> 00:13:37.066
他放出了一个极度复杂

00:13:37.066 --> 00:13:39.200
的飞机气动模拟画面

00:13:39.366 --> 00:13:40.900
当你坐飞机的时候

00:13:40.900 --> 00:13:42.733
可能留意过发动机外壳

00:13:42.733 --> 00:13:44.800
上有几道不起眼的凸起

00:13:44.966 --> 00:13:46.533
这玩意是干嘛的

00:13:46.566 --> 00:13:48.133
空气是看不见的

00:13:48.600 --> 00:13:50.800
如果不通过极高精度的模拟

00:13:51.100 --> 00:13:53.066
设计师根本不知道这些凸起

00:13:53.066 --> 00:13:55.533
会在空气中划出怎样的涡流

00:13:55.733 --> 00:13:58.400
更不知道这些涡流能不能顺着机翼

00:13:58.400 --> 00:14:01.333
在起飞和降落时提供额外的升力

00:14:01.600 --> 00:14:03.566
为了设计出一架好飞机

00:14:03.600 --> 00:14:04.866
一辆好汽车

00:14:04.966 --> 00:14:06.566
工程师需要反复修改

00:14:06.566 --> 00:14:08.100
这些零部件的形状

00:14:08.200 --> 00:14:10.500
然后再进行漫长的模拟计算

00:14:10.566 --> 00:14:13.333
这中间的时间成本和算力成本

00:14:13.733 --> 00:14:15.500
简直是个天文数字

00:14:15.666 --> 00:14:18.300
那么Nvidia是怎么用AI来

00:14:18.300 --> 00:14:20.300
降维打击这个领域的呢

00:14:20.366 --> 00:14:21.566
重点来了

00:14:21.700 --> 00:14:23.100
请竖起耳朵

00:14:23.100 --> 00:14:24.966
这段数据非常夸张

00:14:25.200 --> 00:14:28.266
Ashton展示了一个包含了大约2,000种

00:14:28.266 --> 00:14:31.066
不同气动布局的飞机公开数据集

00:14:31.500 --> 00:14:33.666
如果用传统方法去跑这2,000

00:14:33.666 --> 00:14:35.800
种布局的高精度流体模拟

00:14:36.166 --> 00:14:37.933
超过10亿个自由度

00:14:38.000 --> 00:14:41.366
它会生成大约200TB的庞大数据

00:14:41.666 --> 00:14:44.100
你猜NVIDIA用他们最新的Transformer

00:14:44.266 --> 00:14:46.766
架构和极度聪明的TOKEN化技术

00:14:47.000 --> 00:14:49.600
训练出来的AI模型有多大

00:14:49.666 --> 00:14:51.100
不是20太字节

00:14:51.266 --> 00:14:52.533
不是2太字节

00:14:52.766 --> 00:14:54.566
而是只有200兆字节

00:14:54.700 --> 00:14:55.766
你没听错

00:14:55.866 --> 00:14:57.333
这简直不是压缩

00:14:57.700 --> 00:14:58.666
这是魔法

00:14:58.800 --> 00:15:02.066
相当于把200TB包含了复杂

00:15:02.066 --> 00:15:03.733
流体力学知识的数据

00:15:03.933 --> 00:15:06.366
提炼出了最核心的物理规律

00:15:06.666 --> 00:15:09.900
塞进了一个200兆字节的检查点里

00:15:09.933 --> 00:15:13.133
这是一个近乎100万倍的数据压缩

00:15:13.566 --> 00:15:16.133
更可怕的是它的速度和泛化能力

00:15:16.266 --> 00:15:19.366
Ashton在台上直接做了一个现场演示

00:15:19.566 --> 00:15:21.766
这在工程界堪称神迹

00:15:22.166 --> 00:15:24.766
他用这个200兆字节的训练模型

00:15:24.933 --> 00:15:27.400
去预测一个他在训练数据里

00:15:27.400 --> 00:15:30.133
从来没有见过的全新飞机几何

00:15:30.133 --> 00:15:33.800
形状以及全新的边界条件结果呢

00:15:33.933 --> 00:15:35.866
这个模型只用了一秒钟

00:15:36.300 --> 00:15:38.000
仅仅在一张相对普通的

00:15:38.000 --> 00:15:40.566
RT X6000工作站显卡上

00:15:40.566 --> 00:15:43.966
就立刻吐出了气流分布的预测结果

00:15:44.100 --> 00:15:45.066
更绝的是

00:15:45.066 --> 00:15:46.600
这个结果不是那种为了

00:15:46.600 --> 00:15:48.566
好看而生成的瞎猜动画

00:15:48.766 --> 00:15:50.966
它是符合严谨物理规律的

00:15:51.133 --> 00:15:53.333
与传统高精度模拟相比

00:15:53.466 --> 00:15:56.500
误差只有惊人的1%到2%

00:15:56.666 --> 00:15:59.000
传统的流程是改一次设计

00:15:59.166 --> 00:16:00.666
等几天出结果

00:16:00.766 --> 00:16:01.800
发现不行

00:16:01.900 --> 00:16:03.166
再改一次设计

00:16:03.300 --> 00:16:05.800
现在的流程是改一次设计

00:16:05.866 --> 00:16:07.266
一秒钟出结果

00:16:07.400 --> 00:16:08.866
立刻知道行不行

00:16:09.400 --> 00:16:11.300
效率提升了1万倍以上

00:16:11.333 --> 00:16:12.533
这意味着什么

00:16:12.600 --> 00:16:14.366
这意味着未来工业设计

00:16:14.366 --> 00:16:16.400
的门槛将被彻底打穿

00:16:16.600 --> 00:16:18.933
波音空客特斯拉

00:16:19.100 --> 00:16:21.533
甚至是造服务器机房的公司

00:16:21.700 --> 00:16:23.700
他们可以把这个极度轻量化

00:16:23.866 --> 00:16:26.866
但在物理上完全正确的AI模拟引擎

00:16:27.300 --> 00:16:29.333
直接插进他们的设计软件里

00:16:29.566 --> 00:16:31.966
设计师随便调整一下汽车的尾翼

00:16:32.266 --> 00:16:33.733
软件就能在毫秒级

00:16:33.733 --> 00:16:35.600
告诉你风阻降了多少

00:16:35.933 --> 00:16:38.733
散热工程师改变一下机箱的进风口

00:16:38.900 --> 00:16:40.900
立刻就能看到热流的变化

00:16:41.133 --> 00:16:43.100
艾什顿站在台上对台下的

00:16:43.100 --> 00:16:45.400
计算机图形学专家们喊话

00:16:45.500 --> 00:16:47.700
你们这些搞好莱坞特效的

00:16:47.700 --> 00:16:49.966
搞水流烟雾模拟的

00:16:49.966 --> 00:16:51.333
你们以前只是为了

00:16:51.333 --> 00:16:53.800
追求视觉上的好看现在

00:16:54.600 --> 00:16:56.666
是时候把你们在可微物理

00:16:56.800 --> 00:16:59.066
几何建模上的经验带过来

00:16:59.366 --> 00:17:03.066
跟我们一起把这些能力推向电磁学

00:17:03.166 --> 00:17:04.266
结构力学

00:17:04.666 --> 00:17:07.533
去加速下一代的科学和工程革命

00:17:07.666 --> 00:17:08.566
听到这里

00:17:08.700 --> 00:17:10.533
如果你是一个懂商业的人

00:17:10.533 --> 00:17:12.500
你应该能闻到血腥味了

00:17:12.566 --> 00:17:15.300
NVIDIA现在的野心绝不仅仅是

00:17:15.300 --> 00:17:17.566
做个卖铲子的算力供应商

00:17:17.966 --> 00:17:19.300
他正在把自己变成

00:17:19.300 --> 00:17:21.300
一个物理现实的定义者

00:17:21.366 --> 00:17:23.366
所有的物理世界规律

00:17:23.500 --> 00:17:26.000
正在被Nvidia的模型吃进去

00:17:26.166 --> 00:17:28.700
嚼碎了变成了一行行AI可以

00:17:28.700 --> 00:17:30.100
瞬间调用的代码

00:17:30.166 --> 00:17:32.800
但Nvidia花这么大力气搞物理模拟

00:17:33.300 --> 00:17:36.100
真的是只为了帮人造飞机造汽车吗

00:17:36.266 --> 00:17:37.200
当然不是

00:17:37.500 --> 00:17:39.366
所有这些在虚拟世界里

00:17:39.366 --> 00:17:41.100
极度真实的物理法则

00:17:41.466 --> 00:17:43.200
其实都是在为整场

00:17:43.200 --> 00:17:45.266
发布会的终极形态铺路

00:17:45.566 --> 00:17:47.166
他们要创造一个完全受

00:17:47.166 --> 00:17:49.166
物理定律支配的虚拟宇宙

00:17:49.300 --> 00:17:51.400
去孕育下一代的人工智能

00:17:51.500 --> 00:17:54.066
这就引出了发布会的第三个板块

00:17:54.166 --> 00:17:56.766
也是最让科技界炸锅的内容

00:17:57.100 --> 00:17:59.800
Cosmos3世界模型以及那个

00:17:59.800 --> 00:18:01.933
让人细思极恐的物理AI

00:18:02.100 --> 00:18:04.333
NVIDIA花这么大代价搭建这个

00:18:04.333 --> 00:18:06.600
绝对符合物理定律的游乐场

00:18:06.866 --> 00:18:09.300
真正要装进去的玩家只有一个

00:18:09.333 --> 00:18:11.000
那就是未来的物理AI

00:18:11.366 --> 00:18:13.800
也就是具身智能和自动驾驶

00:18:13.966 --> 00:18:14.766
这个时候

00:18:14.900 --> 00:18:18.300
Cosmos实验室的副总裁Ming Liu上台了

00:18:18.300 --> 00:18:20.200
他一开口直接戳穿了现在

00:18:20.200 --> 00:18:22.266
整个机器人行业的遮羞布

00:18:22.366 --> 00:18:24.666
物理AI现在有一个致命的死穴

00:18:25.133 --> 00:18:26.000
数据枯竭

00:18:26.166 --> 00:18:27.666
你仔细算一笔账

00:18:28.066 --> 00:18:29.900
为什么ChatGPT这种

00:18:29.900 --> 00:18:31.733
语言大模型能爆发

00:18:32.100 --> 00:18:33.800
因为互联网上存着人类

00:18:33.800 --> 00:18:35.766
几十年敲下来的海量文本

00:18:36.400 --> 00:18:38.333
Openai直接拿爬虫一刮

00:18:38.566 --> 00:18:39.900
语料库就有了

00:18:39.900 --> 00:18:41.300
但机器人呢

00:18:41.500 --> 00:18:43.600
机器人要学习怎么抓杯子

00:18:43.733 --> 00:18:45.166
怎么躲避行人

00:18:45.333 --> 00:18:47.100
怎么在厨房煎鸡蛋

00:18:47.266 --> 00:18:48.966
这些所谓的物理直觉

00:18:49.400 --> 00:18:50.766
互联网上根本没有

00:18:50.766 --> 00:18:52.700
现成的数据包可以下载

00:18:52.766 --> 00:18:54.566
你想让机器人变聪明

00:18:54.933 --> 00:18:56.100
传统的做法就是

00:18:56.100 --> 00:18:58.000
真枪实弹的去录数据

00:18:58.100 --> 00:18:59.933
比如你要训练自动驾驶

00:19:00.100 --> 00:19:01.400
你就得派车队去

00:19:01.400 --> 00:19:03.266
马路上跑几千万公里

00:19:03.266 --> 00:19:04.700
你要训练机械臂

00:19:04.766 --> 00:19:06.766
就得让人带着VR头显

00:19:06.866 --> 00:19:08.900
一次次控制机械臂去

00:19:08.900 --> 00:19:10.500
抓取桌子上的积木

00:19:10.566 --> 00:19:13.866
这种遥操作收集的数据确实精准

00:19:14.133 --> 00:19:16.000
但效率低得令人发指

00:19:16.300 --> 00:19:19.600
现实世界的物理法则是按秒流逝的

00:19:19.666 --> 00:19:22.266
你没法对着现实世界按快进键

00:19:22.366 --> 00:19:24.533
真车在路上开一个小时

00:19:24.533 --> 00:19:26.533
就是实打实的一个小时

00:19:26.733 --> 00:19:28.966
遇到极端车祸场景的概率

00:19:28.966 --> 00:19:30.900
更是低到可以忽略不计

00:19:31.300 --> 00:19:33.900
如果靠传统方式去喂养物理AI

00:19:34.000 --> 00:19:35.500
可能再过50年

00:19:35.566 --> 00:19:38.100
机器人还是个只会扫地的智障

00:19:38.266 --> 00:19:40.666
明佑陆在台上的原话非常狠

00:19:40.900 --> 00:19:43.933
他说如果只有现实世界这一条路

00:19:44.066 --> 00:19:47.000
物理AI永远无法普及但如果

00:19:47.533 --> 00:19:49.533
我们能造出一个从机器人

00:19:49.533 --> 00:19:52.300
视角出发的虚拟世界模型呢

00:19:52.300 --> 00:19:53.566
这句话一出来

00:19:53.733 --> 00:19:55.866
整个逻辑闭环彻底打通

00:19:56.266 --> 00:19:57.866
只要能用AI生成一个

00:19:57.866 --> 00:19:59.666
极度真实的虚拟世界

00:19:59.900 --> 00:20:01.866
数据获取就不再是苦

00:20:01.866 --> 00:20:03.533
哈哈的去大街上收集

00:20:03.733 --> 00:20:06.700
而是变成了在机房里用算力生成

00:20:06.866 --> 00:20:08.933
每一滴消耗的GPU算力

00:20:08.933 --> 00:20:10.400
都会直接转化成

00:20:10.733 --> 00:20:12.466
无数个边缘测试场景

00:20:12.600 --> 00:20:14.166
无数种天气状况

00:20:14.300 --> 00:20:16.200
一千个不同的厨房布局

00:20:16.400 --> 00:20:18.266
一万个不同的仓库环境

00:20:18.300 --> 00:20:20.466
这就是这场发布会的终极核

00:20:20.866 --> 00:20:23.466
但Cosmos3世界模型

00:20:23.566 --> 00:20:25.200
不要把Cosmos当成一个

00:20:25.200 --> 00:20:27.166
简单的视频生成工具

00:20:27.900 --> 00:20:30.466
它跟Sora完全不是一个维度的东西

00:20:30.700 --> 00:20:32.766
Cosmos的底层是一个极其

00:20:32.766 --> 00:20:35.066
庞大的混合Transformer架构

00:20:35.200 --> 00:20:36.933
左边是一个自回归塔

00:20:37.266 --> 00:20:38.600
负责逻辑推理

00:20:38.733 --> 00:20:40.266
比如它看到画面

00:20:40.466 --> 00:20:43.100
会自己思考接下来该发生什么

00:20:43.200 --> 00:20:44.766
右边是一个扩散塔

00:20:45.533 --> 00:20:47.466
负责生成画面和声音

00:20:47.533 --> 00:20:49.600
而这中间最核心的突破

00:20:49.733 --> 00:20:51.333
是他把一种全新的

00:20:51.333 --> 00:20:53.600
模态扔进了神经网络里

00:20:53.733 --> 00:20:55.333
这个模态叫做动作

00:20:55.766 --> 00:20:56.766
什么意思呢

00:20:56.933 --> 00:20:59.000
以前的AI看视频就

00:20:59.000 --> 00:21:00.966
只是看一堆像素在动

00:21:00.966 --> 00:21:02.466
但Cosmos不一样

00:21:02.700 --> 00:21:04.933
它是带着目的去理解世界的

00:21:04.933 --> 00:21:06.933
为了让全天下所有长得

00:21:06.933 --> 00:21:09.700
奇形怪状的机器人都能听懂指令

00:21:10.000 --> 00:21:11.866
NVIDIA做了一件非常

00:21:11.866 --> 00:21:13.800
可怕的底层统一工作

00:21:14.166 --> 00:21:15.200
他们发明了一套

00:21:15.200 --> 00:21:17.100
通用的几何动作语言

00:21:17.200 --> 00:21:20.100
不管你是四个轮子的自动驾驶汽车

00:21:20.300 --> 00:21:22.333
还是单臂工业机器人

00:21:22.800 --> 00:21:24.400
或者是拥有两条腿

00:21:24.400 --> 00:21:26.266
两只手的人形机器人

00:21:26.333 --> 00:21:27.800
在Cosmos眼里

00:21:27.966 --> 00:21:30.766
统统被拆解成了最基础的几何基元

00:21:31.133 --> 00:21:32.600
你的机身位置在哪里

00:21:32.733 --> 00:21:35.266
ego pose你的执行器在哪里

00:21:35.566 --> 00:21:37.866
effectors你的抓手在干什么

00:21:37.966 --> 00:21:40.533
grippers这个动作定义一确立

00:21:40.766 --> 00:21:43.366
发生了一件颠覆整个行业的事情

00:21:43.733 --> 00:21:45.800
人类拍的第一人称视频

00:21:46.066 --> 00:21:49.066
突然全部变成了机器人的顶级教材

00:21:49.133 --> 00:21:52.933
你想一个人带着Gopro在厨房里做饭

00:21:53.300 --> 00:21:55.666
视频里的画面就是机身位置

00:21:56.000 --> 00:21:57.866
两只手就是两个执行器

00:21:58.066 --> 00:21:59.966
Cosmos通过逆向动力学

00:21:59.966 --> 00:22:01.300
看完这段视频

00:22:01.666 --> 00:22:03.533
立刻就能反推出做饭时

00:22:03.533 --> 00:22:05.566
的关节受力和空间轨迹

00:22:06.133 --> 00:22:08.500
然后把这套动作逻辑直接

00:22:08.500 --> 00:22:10.900
打包装进机器人的大脑里

00:22:10.933 --> 00:22:13.266
以前那些没用的网红做饭视频

00:22:13.600 --> 00:22:16.533
现在全成了喂养物理AI的顶级语料

00:22:16.700 --> 00:22:18.200
这就是降维打击

00:22:18.366 --> 00:22:19.800
有了这个万能底座

00:22:20.133 --> 00:22:23.866
NVIDIA直接掏出了Cosmos3的家族全家桶

00:22:24.000 --> 00:22:27.500
前面提到的针对自动驾驶的Nano模型

00:22:27.700 --> 00:22:30.100
针对极致保真度的super模型

00:22:30.533 --> 00:22:32.300
这些其实在之前的GTC

00:22:32.300 --> 00:22:33.866
大会上就露过脸了

00:22:33.866 --> 00:22:36.000
但这次SIGGRAPH min Liu

00:22:36.000 --> 00:22:37.666
亮出了最后一块拼图

00:22:38.066 --> 00:22:41.566
也是最关键的一步棋Cosmos3edge

00:22:41.766 --> 00:22:43.600
这是一个只有40亿

00:22:43.600 --> 00:22:45.600
参数的维缩版小模型

00:22:46.000 --> 00:22:48.800
专为端侧实时运行量身定制

00:22:49.066 --> 00:22:50.700
发布会现场直接切

00:22:50.700 --> 00:22:52.200
到了一个实机演示

00:22:52.466 --> 00:22:54.366
一个机械臂盯着桌子

00:22:54.366 --> 00:22:56.200
上的一个灰色方块

00:22:56.366 --> 00:22:58.800
机械臂的底座里插着一块

00:22:58.800 --> 00:23:01.266
搭载Jetson Thor芯片的计算板

00:23:01.300 --> 00:23:04.766
这个40亿参数的Cosmos 3 edge模型

00:23:05.133 --> 00:23:07.933
就在这块本地芯片上疯狂运转

00:23:08.100 --> 00:23:10.733
他直接通过摄像头看着那个方块

00:23:11.066 --> 00:23:12.600
不仅能瞬间看懂

00:23:12.600 --> 00:23:14.866
方块的材质空间位置

00:23:15.133 --> 00:23:16.966
还能在毫秒级预测出

00:23:16.966 --> 00:23:18.800
自己抓取动作的结果

00:23:19.500 --> 00:23:21.300
然后直接指挥机械臂

00:23:21.533 --> 00:23:23.366
一把将方块抓起来

00:23:23.466 --> 00:23:24.766
这个过程没有任何

00:23:24.766 --> 00:23:26.266
云端服务器的参与

00:23:26.766 --> 00:23:28.766
没有来回传输的网络延迟

00:23:29.100 --> 00:23:30.566
传感器数据进去

00:23:30.666 --> 00:23:32.900
机械臂的控制信号出来

00:23:32.933 --> 00:23:35.900
这就是边缘端实时控制的完全体

00:23:36.000 --> 00:23:37.566
NVIDIA告诉你

00:23:37.733 --> 00:23:39.533
未来的机器人不需要时刻

00:23:39.533 --> 00:23:42.066
连着Wifi去求助云端的大脑

00:23:42.333 --> 00:23:45.266
他们出厂自带一个极度聪明的小脑

00:23:45.466 --> 00:23:47.666
能够在真实物理环境里

00:23:47.666 --> 00:23:49.333
靠自己的芯片做出

00:23:49.333 --> 00:23:51.500
瞬间的生存和作业反应

00:23:51.600 --> 00:23:54.200
而为了让这种模型能够又快又准

00:23:54.500 --> 00:23:56.500
NVIDIA甚至把去噪步数

00:23:56.500 --> 00:23:58.133
强行压缩到了4步

00:23:58.200 --> 00:23:59.366
这意味着什么

00:23:59.600 --> 00:24:01.800
这意味着图像和视频生成的

00:24:01.800 --> 00:24:04.700
响应速度足足飙升了25倍

00:24:04.766 --> 00:24:07.300
不管是响应时间还是推理成本

00:24:07.766 --> 00:24:09.500
都直接砸穿了地板价

00:24:09.533 --> 00:24:11.766
让商用落地变成了可能

00:24:11.866 --> 00:24:14.266
最后整场发布会的高潮

00:24:14.500 --> 00:24:16.533
也是最让自动驾驶厂商

00:24:16.533 --> 00:24:18.466
后背发凉的演示来了

00:24:18.966 --> 00:24:21.766
Cosmostreams神经闭环模拟器

00:24:21.866 --> 00:24:22.900
在屏幕上

00:24:22.900 --> 00:24:24.600
你看到的是一辆自动驾驶

00:24:24.600 --> 00:24:27.333
汽车在城郊街道上行驶的画面

00:24:27.533 --> 00:24:30.533
阳光树影路过的其他车辆

00:24:30.600 --> 00:24:31.933
一切都真实的

00:24:31.933 --> 00:24:33.333
甚至有些刺眼

00:24:33.333 --> 00:24:34.666
但Ming Yulu旁边的

00:24:34.666 --> 00:24:37.466
工程师拿着一个PS4手柄

00:24:38.300 --> 00:24:39.766
直接控制着画面里的

00:24:39.766 --> 00:24:42.100
汽车左转右转刹车

00:24:42.133 --> 00:24:43.466
这不是放录像

00:24:43.533 --> 00:24:45.733
也不是GTA5游戏画面

00:24:45.800 --> 00:24:48.566
这是Cosmos DREAMS在毫秒级

00:24:48.566 --> 00:24:50.466
实时生成的AI梦境

00:24:50.666 --> 00:24:53.133
工程师手柄按下去的每一个动作

00:24:53.266 --> 00:24:54.733
传给Cosmos后

00:24:54.933 --> 00:24:56.600
大模型立刻根据现实

00:24:56.600 --> 00:24:59.200
世界的物理规律光影逻辑

00:24:59.533 --> 00:25:02.066
凭空运算出汽车挡风玻璃前

00:25:02.066 --> 00:25:04.400
接下来该出现的每一帧画面

00:25:04.700 --> 00:25:06.466
不仅是正前方的主视角

00:25:06.533 --> 00:25:08.066
连右下角的鸟瞰图

00:25:08.066 --> 00:25:09.900
也是同步实时生成的

00:25:09.900 --> 00:25:12.366
这台自动驾驶汽车的AI算法

00:25:12.466 --> 00:25:15.300
其实正行驶在Cosmos大模型给

00:25:15.300 --> 00:25:17.333
它编织的一场逼真梦境里

00:25:17.533 --> 00:25:18.933
他在梦里遇到加塞

00:25:19.000 --> 00:25:19.800
遇到暴雨

00:25:19.800 --> 00:25:21.000
遇到鬼探头

00:25:21.200 --> 00:25:23.400
他做出的每一次方向盘打轮

00:25:23.600 --> 00:25:26.500
都会得到完全符合现实规律的反馈

00:25:26.600 --> 00:25:29.366
车企甚至不需要把测试车开上街

00:25:29.733 --> 00:25:31.566
直接把自动驾驶的策略

00:25:31.566 --> 00:25:33.733
模型接进Cosmos DREAMS里

00:25:33.966 --> 00:25:35.333
就可以做无尽的被动

00:25:35.333 --> 00:25:37.333
验证和极端场景训练

00:25:37.500 --> 00:25:39.100
最离谱的在这里

00:25:39.200 --> 00:25:40.200
几个月前

00:25:40.466 --> 00:25:42.266
NVIDIA刚搞出这个实时

00:25:42.266 --> 00:25:43.600
梦境系统的时候

00:25:43.866 --> 00:25:47.166
还要靠整整64张GB300级别的

00:25:47.166 --> 00:25:49.733
顶级芯片并联才能勉强跑动

00:25:50.266 --> 00:25:51.533
那个成本是正常

00:25:51.533 --> 00:25:53.366
公司根本负担不起的

00:25:53.366 --> 00:25:55.000
后来他们把算力优化

00:25:55.000 --> 00:25:57.400
到了16张Vera Rubin芯片

00:25:57.533 --> 00:26:00.666
而今天在SIGGRAPH 2026的舞台上

00:26:00.733 --> 00:26:03.200
这套完全实时的高保真的

00:26:03.200 --> 00:26:05.466
闭环虚拟自动驾驶模拟器

00:26:05.900 --> 00:26:07.600
只需要靠桌子上一张单

00:26:07.600 --> 00:26:10.400
卡的RTX Pro6,000工作站显卡

00:26:10.400 --> 00:26:11.800
就能流畅运行

00:26:11.933 --> 00:26:15.133
一张单卡跑起了一整个物理世界

00:26:15.333 --> 00:26:17.866
当算力成本被压缩到这个地步

00:26:18.266 --> 00:26:21.000
自动驾驶和机器人行业的研发门槛

00:26:21.300 --> 00:26:24.100
直接从云端跌落到了车库级别

00:26:24.166 --> 00:26:27.000
以后任何一家做物理AI的创业公司

00:26:27.166 --> 00:26:29.200
只要买一台Nvidia的工作站

00:26:29.566 --> 00:26:31.000
就等于拥有了一个可以

00:26:31.000 --> 00:26:33.000
无限折叠时间和空间

00:26:33.133 --> 00:26:35.366
无限试错的现实训练场

00:26:35.400 --> 00:26:36.300
讲到这里

00:26:36.466 --> 00:26:39.133
整场SIGGRAPH 2026主题演讲的

00:26:39.133 --> 00:26:41.266
底牌已经完全翻开了

00:26:41.333 --> 00:26:42.266
如果你到现在

00:26:42.266 --> 00:26:44.733
还以为Nvidia只是在卖GPU

00:26:45.066 --> 00:26:47.800
那你已经被远远甩在时代后面了

00:26:47.800 --> 00:26:50.400
从delight五重数图形渲染管线

00:26:50.533 --> 00:26:52.300
到把庞大的流体力学

00:26:52.300 --> 00:26:54.166
压缩近200兆的模型

00:26:54.566 --> 00:26:56.366
再到今天发布主宰物理

00:26:56.366 --> 00:26:59.133
定律的Cosmos3和Cosmos DREAMS

00:26:59.400 --> 00:27:00.900
NVIDIA正在亲手搭建

00:27:00.900 --> 00:27:02.733
一条从数字到物理

00:27:03.000 --> 00:27:05.466
从软件到硬件的绝对垄断闭环

00:27:05.600 --> 00:27:08.100
它给开发者提供底层算力

00:27:08.166 --> 00:27:10.333
给工程师提供物理引擎

00:27:10.533 --> 00:27:13.100
最后给未来的机器人发放大脑

00:27:13.166 --> 00:27:14.666
在这个新纪元里

00:27:14.666 --> 00:27:16.500
不再是代码定义游戏

00:27:16.800 --> 00:27:19.333
而是生成式AI直接定义世界

00:27:19.366 --> 00:27:22.333
不再是车队去马路上苦苦收集数据

00:27:22.400 --> 00:27:24.866
而是算力直接涌现出数据

00:27:25.000 --> 00:27:26.400
未来的商业竞争

00:27:26.666 --> 00:27:28.333
谁能掌握构建虚拟

00:27:28.333 --> 00:27:30.300
世界的速度和保真度

00:27:30.366 --> 00:27:33.600
谁就能控制物理AI进化的速度

00:27:33.866 --> 00:27:35.266
而在这条赛道上

00:27:35.366 --> 00:27:37.266
英伟达已经不是在领跑

00:27:37.366 --> 00:27:39.133
它是在亲手制定物理

00:27:39.133 --> 00:27:41.000
世界的全新操作系统

00:27:41.100 --> 00:27:43.133
好今天就到这里了

00:27:43.166 --> 00:27:44.333
记得点个订阅

00:27:44.566 --> 00:27:46.000
我们持续追踪这些

00:27:46.000 --> 00:27:47.500
巨头怎么改变未来

