20260723-08 | 英偉達DLSS 5與Cosmos 3橫空出世,物理世界徹底淪陷?😱
來源:Youtube | 建立:2026-07-23T17:40:32 | HTML:2026-07-23T17:42:31
開啟原始影片 note.md transcript.txt transcript.vtt

影片筆記:英偉達DLSS 5與Cosmos 3橫空出世,物理世界徹底淪陷?😱

YouTube 影片框會固定在左上方;點擊右側逐字稿時間戳可跳到對應時間。

一句話總結

2026年7月20日於洛杉磯舉辦的第53屆SIGGRAPH大會上,英偉達(NVIDIA)發布核心技術戰略,指出AI主戰場正從互聯網轉向物理世界,並透過三個核心板塊展示如何構建從視覺到物理規律的虛擬世界。

核心重點

AI 戰場轉移:演講明確指出,AI 的主戰場正在從互聯網領域轉向「物理世界」。

三大核心板塊:英偉達展示了三個核心板塊,旨在構建一個涵蓋從視覺效果到物理規律的完整虛擬世界。

技術戰略發布:此次發布為2026年SIGGRAPH大會的重點內容,標誌著英偉達在物理模擬與生成式 AI 結合領域的新戰略方向。

詳細大綱

1. 會議背景與時間

2. 戰略核心觀點

3. 技術架構(三個核心板塊)

視覺層面:涉及圖像生成與渲染技術(對應標題提及之 DLSS 5)。

物理層面:涉及物理規律的模擬與計算(對應標題提及之 Cosmos 3)。

整合層面:將視覺與物理規律結合,形成完整的虛擬世界構建方案。

*(註:分段筆記中詳細列出了多個 DLSS 變體名稱,但主要論述集中在戰略方向與三大板塊的概念上。)*

工具 / 模型 / 名詞整理

操作流程整理

由於分段筆記主要為戰略摘要,未提供具體的操作步驟,僅能整理出戰略發布的流程邏輯:

確認會議場合:在 2026 年 SIGGRAPH 大會上進行主題演講。

闡述戰略轉向:提出 AI 主戰場從互聯網轉向物理世界的觀點。

展示技術板塊:介紹三個核心板塊(視覺、物理、整合),說明如何構建具備物理規律的虛擬世界。

值得注意的限制或風險

逐字稿辨識疑點

以下名詞在分段筆記中出現多次變體或疑似辨識錯誤,建議查證原始逐字稿:

DLSS 5 的變體名稱

Cosmos 3

可延伸追問

DLSS 5(或其變體名稱)具體支持哪些硬體型號?

Cosmos 3 在物理模擬方面的具體能力與前代相比有何提升?

這三個核心板塊之間是如何進行數據交互與整合的?

「物理世界」在英偉達的定義中,具體包含哪些應用場景(如遊戲、工業模擬、機器人訓練等)?

逐字稿時間軸

右側可一路往下捲;左側影片框會固定。點擊時間戳會讓左側影片跳到對應秒數。

00:00:02.333 → 00:00:05.666
洛杉矶第53届SIGGRAPH大会现场
00:00:05.900 → 00:00:07.600
英伟达刚刚向全世界
00:00:07.600 → 00:00:09.466
摊牌了他们真正的野心
00:00:10.200 → 00:00:12.866
语言大模型只是一道开胃菜
00:00:13.300 → 00:00:15.200
AI接下来的主战场
00:00:15.500 → 00:00:17.166
根本不在互联网上
00:00:17.500 → 00:00:18.933
而是在物理世界
00:00:19.000 → 00:00:20.800
但这里有一个巨大的悖论
00:00:20.966 → 00:00:23.400
你要训练能干实事的物理AI
00:00:23.566 → 00:00:25.800
比如机器人自动驾驶
00:00:26.133 → 00:00:28.166
你需要海量的物理世界数据
00:00:28.266 → 00:00:31.700
可是现实世界的时间是按秒流逝的
00:00:31.733 → 00:00:33.300
你没法按快进键
00:00:34.466 → 00:00:36.600
英伟达给出的答案极其疯狂
00:00:37.000 → 00:00:38.533
既然现实世界太慢
00:00:38.733 → 00:00:41.133
那我们就用AI自己生成一个拥有
00:00:41.133 → 00:00:43.700
绝对真实物理规律的虚拟世界
00:00:43.766 → 00:00:45.700
让机器人在里面试错
00:00:45.733 → 00:00:47.266
而要造出这个世界
00:00:47.600 → 00:00:50.000
靠单纯的代码根本写不出来
00:00:50.400 → 00:00:53.000
必须要把计算机图形学物理
00:00:53.000 → 00:00:55.900
模拟和生成式AI彻底砸碎
00:00:56.933 → 00:00:58.766
这就是这场SIGGRAPH
00:00:59.100 → 00:01:01.400
2026主题演讲的真正内核
00:01:01.466 → 00:01:02.800
这场发布会的信息
00:01:02.800 → 00:01:04.400
密度大到让人窒息
00:01:04.566 → 00:01:06.266
不仅直接终结了传统
00:01:06.266 → 00:01:08.133
游戏渲染的路线之争
00:01:08.366 → 00:01:10.966
还把原本需要超级计算机才能跑
00:01:10.966 → 00:01:13.900
的流体力学压缩到了一张显卡里
00:01:14.200 → 00:01:16.200
最后甚至端出了一个让机器人
00:01:16.200 → 00:01:18.700
能在里面无限进化的母体世界
00:01:18.933 → 00:01:20.266
英伟达在这次大会上
00:01:20.266 → 00:01:21.866
到底放出了什么怪物
00:01:22.000 → 00:01:23.600
为了把逻辑盘清楚
00:01:23.600 → 00:01:25.733
我会把整场发布会拆解
00:01:25.733 → 00:01:27.566
成三个最核心的板块
00:01:28.100 → 00:01:29.533
less 5的降维打击
00:01:29.800 → 00:01:32.266
AI对传统物理模拟的颠覆
00:01:32.400 → 00:01:35.533
以及终极武器Cosmos3世界模型
00:01:35.600 → 00:01:37.600
这期内容没有任何水分
00:01:37.700 → 00:01:39.866
各位看官先赞后看
00:01:39.866 → 00:01:41.333
祝大家好运不断
00:01:41.333 → 00:01:42.566
我们直接开始
00:01:42.800 → 00:01:44.366
首先让我们把目光
00:01:44.366 → 00:01:46.100
拉回黄仁勋的开场
00:01:46.466 → 00:01:48.133
老黄一上台就提到了
00:01:48.133 → 00:01:49.666
一个很有意思的闭环
00:01:50.133 → 00:01:53.000
30年前英伟达为了解决传统
00:01:53.000 → 00:01:55.066
电脑做不了的图形计算
00:01:56.566 → 00:01:59.566
后来他们搞出了可编程着色器
00:02:00.900 → 00:02:02.600
结果阴差阳错的在
00:02:02.600 → 00:02:05.000
2012年引爆了现代AI
00:02:05.466 → 00:02:07.366
现在AI长大了
00:02:07.366 → 00:02:08.533
它要开始反哺它的
00:02:08.533 → 00:02:10.666
老本行图形渲染了
00:02:10.766 → 00:02:13.600
这引出了整场发布会的第一颗核弹
00:02:14.566 → 00:02:17.133
玩游戏的朋友对del s肯定不陌生
00:02:17.400 → 00:02:19.300
从早期的空间放大
00:02:19.333 → 00:02:20.866
到后来的帧生成
00:02:21.100 → 00:02:23.500
再到del s三点五的光线重建
00:02:23.966 → 00:02:26.700
英伟达一直在教显卡怎么猜像素
00:02:28.400 → 00:02:30.600
应用深度学习研究总监
00:02:30.700 → 00:02:32.866
Edward Liu上台说了一句话
00:02:32.933 → 00:02:34.533
直接把桌子掀了
00:02:35.533 → 00:02:38.600
传统的图形学是从第一性原理出发
00:02:38.700 → 00:02:40.166
我们搭建场景
00:02:40.366 → 00:02:42.733
用物理定律模拟光线
00:02:42.800 → 00:02:44.733
然后用摄像机去拍
00:02:44.933 → 00:02:47.066
每一个像素出现在那里
00:02:47.166 → 00:02:49.333
都是因为有人希望它在那里
00:02:49.533 → 00:02:51.200
这是传统渲染的骄傲
00:02:51.366 → 00:02:52.933
但也成了它的死穴
00:02:53.166 → 00:02:55.700
就算你用上了最顶级的路径追踪
00:02:55.733 → 00:02:57.700
比如DES4时代的水平
00:02:57.966 → 00:02:59.600
光线是全模拟了
00:02:59.600 → 00:03:01.400
但你抬头看看那张图
00:03:01.466 → 00:03:02.766
离真正的照片级
00:03:02.766 → 00:03:05.533
真实还是差了一口气为什么
00:03:05.666 → 00:03:08.700
因为真实世界的光影互动太复杂了
00:03:10.700 → 00:03:11.966
复杂的慢反射
00:03:12.300 → 00:03:15.200
这些东西如果全靠传统算法去硬算
00:03:15.500 → 00:03:17.100
算力根本撑不住
00:03:17.133 → 00:03:18.566
这时候你可能会说
00:03:18.666 → 00:03:21.166
那直接用AI生成不就好了
00:03:21.566 → 00:03:25.100
现在的midjourney或者stable diffusion生成
00:03:25.100 → 00:03:27.866
的照片不是早就以假乱真了吗
00:03:27.933 → 00:03:29.466
这就是问题所在
00:03:29.733 → 00:03:32.400
生成式模型确实懂什么是真实
00:03:32.566 → 00:03:34.966
你喂给他几亿张现实照片
00:03:35.100 → 00:03:36.366
他早就学会了皮肤
00:03:36.366 → 00:03:38.100
在阳光下怎么透亮
00:03:38.200 → 00:03:40.533
头发背光时怎么发丝分明
00:03:40.866 → 00:03:43.300
但生成式模型有一个致命的缺陷
00:03:43.766 → 00:03:45.300
它是基于概率的
00:03:46.366 → 00:03:48.533
你给AI输入一个提示词
00:03:49.066 → 00:03:50.500
黄昏下的商人
00:03:50.666 → 00:03:53.166
他能给你画出一个绝美的商人
00:03:53.300 → 00:03:55.100
但你再让他画一次
00:03:55.466 → 00:03:56.933
商人的脸就变了
00:03:56.933 → 00:03:58.800
这对离线作图没问题
00:03:58.966 → 00:04:01.166
但如果是实时运行的游戏
00:04:01.300 → 00:04:03.100
这一帧商人长这样
00:04:03.100 → 00:04:05.100
下一帧商人换了套衣服
00:04:05.200 → 00:04:06.900
玩家还以为见鬼了
00:04:08.600 → 00:04:12.333
生成式模型有一种自作主张的毛病
00:04:12.333 → 00:04:15.100
比如游戏美术总监设定这个
00:04:15.100 → 00:04:17.600
主角脸上必须有一道深深的疤痕
00:04:17.766 → 00:04:19.400
因为这是他的故事线
00:04:19.533 → 00:04:21.766
但AI模型一看哎呀
00:04:21.766 → 00:04:23.266
这脸上有个瑕疵
00:04:23.600 → 00:04:25.366
顺手就给你抹平了
00:04:25.366 → 00:04:27.200
甚至还给你加了个美颜
00:04:27.533 → 00:04:28.800
画面是好看了
00:04:28.800 → 00:04:31.066
但艺术表达彻底被毁了
00:04:31.066 → 00:04:33.466
这就是摆在Edward Liu和他
00:04:33.466 → 00:04:35.666
的团队面前的三座大山
00:04:35.866 → 00:04:39.066
Dolores 5要解决的就是怎么把AI的
00:04:39.066 → 00:04:41.800
相片级生成能力塞进游戏里
00:04:41.966 → 00:04:44.500
同时还得把它像狗一样死死
00:04:44.500 → 00:04:47.133
拴在游戏引擎的渲染管线上
00:04:47.466 → 00:04:48.666
绝对不能乱跑
00:04:48.666 → 00:04:51.966
第一座大山就是怎么保留一素一图
00:04:52.100 → 00:04:54.800
DOLOS5的做法非常粗暴但有效
00:04:54.966 → 00:04:56.366
他不听提示词
00:04:56.566 → 00:04:58.533
他只看游戏引擎刚渲染
00:04:58.533 → 00:05:00.700
出来的那些原始数据缓冲
00:05:01.100 → 00:05:03.366
比如反照率表面法线
00:05:03.566 → 00:05:05.266
还有基础光照信息
00:05:05.666 → 00:05:08.166
模型被严格训练成一个死心眼
00:05:08.333 → 00:05:09.966
必须绝对尊重这些
00:05:09.966 → 00:05:12.166
底层几何和语义数据
00:05:12.366 → 00:05:14.466
如果引擎说这里有一道疤
00:05:14.933 → 00:05:17.400
你就得在这道疤上给我做文章
00:05:17.700 → 00:05:19.300
在这个红线之内
00:05:19.466 → 00:05:23.100
AI可以尽情发挥它对真实感的理解
00:05:23.266 → 00:05:25.466
比如它可以在这道疤痕周围
00:05:25.466 → 00:05:27.533
加上极其逼真的皮肤肌理
00:05:27.666 → 00:05:29.566
给耳朵加上之前引擎算
00:05:29.566 → 00:05:31.300
不出来的次表面散射
00:05:31.500 → 00:05:33.866
让环境光遮蔽变得更深邃
00:05:34.266 → 00:05:36.066
它改变了画面的质感
00:05:36.066 → 00:05:38.266
但绝对不改变画面里的故事
00:05:38.366 → 00:05:40.900
第二座大山是时间连续性
00:05:41.466 → 00:05:44.200
目前市面上搞视频生成的AI模型
00:05:45.366 → 00:05:46.500
它们的工作原理
00:05:46.500 → 00:05:48.166
都是一次性看好几帧
00:05:48.466 → 00:05:49.966
甚至一整段视频
00:05:50.000 → 00:05:52.100
前前后后对齐了再生成
00:05:52.266 → 00:05:53.533
但游戏不行啊
00:05:53.600 → 00:05:55.300
游戏是实时互动的
00:05:55.300 → 00:05:56.566
玩家鼠标一甩
00:05:56.866 → 00:05:58.166
下一帧是什么
00:05:59.666 → 00:06:02.666
所以Delessu根本没有偷看未来的特权
00:06:03.066 → 00:06:05.466
它必须严格遵循因果关系
00:06:05.600 → 00:06:07.600
一帧进一帧出
00:06:07.600 → 00:06:08.966
这就必须用到游戏
00:06:08.966 → 00:06:10.866
引擎底层的运动向量
00:06:10.933 → 00:06:12.766
通过告诉AI模型画面里
00:06:12.766 → 00:06:14.400
的物体是怎么移动的
00:06:14.666 → 00:06:17.533
DIOS5硬生生做到了一帧接一帧生成
00:06:17.900 → 00:06:19.466
而且没有画面闪烁
00:06:19.666 → 00:06:20.866
没有物体漂移
00:06:21.133 → 00:06:23.766
角色走在水里的倒影稳如老狗
00:06:23.800 → 00:06:26.400
第三座大山简直就是地狱难度
00:06:27.566 → 00:06:30.400
你想想一个4K分辨率的画面
00:06:30.400 → 00:06:32.000
大概有800万个像素
00:06:32.500 → 00:06:34.000
如果你要跑到60帧
00:06:34.133 → 00:06:35.733
意味着留给每一帧的总
00:06:35.733 → 00:06:38.266
时间只有区区16.6毫秒
00:06:38.400 → 00:06:40.333
而这16.6毫秒里
00:06:40.333 → 00:06:43.133
游戏本身的物理计算AI逻辑
00:06:43.400 → 00:06:45.666
基础渲染还要占掉一大半
00:06:45.733 → 00:06:48.933
留给LARS5的时间可能只有几毫秒
00:06:49.266 → 00:06:52.133
那些能生成逼真画面的基础大模型
00:06:52.666 → 00:06:54.933
动不动就几十几百亿参数
00:06:55.200 → 00:06:56.900
跑一张图要几秒钟
00:06:57.300 → 00:06:58.800
英伟达是怎么把它塞进
00:06:58.800 → 00:07:00.700
几毫秒的计算窗里的
00:07:02.800 → 00:07:05.500
他们做了一次极其夸张的模型蒸馏
00:07:05.700 → 00:07:07.466
他们把大模型里关于世界
00:07:07.466 → 00:07:09.566
长什么样的常识提取出来
00:07:09.866 → 00:07:11.566
扔掉所有没用的东西
00:07:11.766 → 00:07:14.100
比如怎么生成猫咪搞笑视频
00:07:14.566 → 00:07:16.333
最后压缩成了一个单步
00:07:16.566 → 00:07:19.333
像素空间的扩散Transformer模型
00:07:19.466 → 00:07:21.600
这个模型小巧专注
00:07:21.800 → 00:07:23.166
唯一的任务就是
00:07:23.200 → 00:07:25.200
看着引擎给出的草图
00:07:25.400 → 00:07:28.600
瞬间给它披上一层照片级真实的皮
00:07:28.700 → 00:07:29.900
为了证明这套东西
00:07:29.900 → 00:07:31.733
不是实验室里的PPT
00:07:31.966 → 00:07:33.300
英伟达直接把他们的
00:07:33.300 → 00:07:35.700
创意艺术家Geff请上了台
00:07:35.733 → 00:07:37.466
现场演示了开发者
00:07:37.466 → 00:07:39.266
怎么驯服这台AI怪兽
00:07:39.333 → 00:07:41.266
这一段演示其实透露了
00:07:41.266 → 00:07:43.300
一个非常可怕的商业信号
00:07:43.300 → 00:07:45.400
我们稍微停下来拆解一下
00:07:45.600 → 00:07:47.000
在Geoff的演示里
00:07:47.000 → 00:07:48.666
我们看到delight5并不是
00:07:48.666 → 00:07:50.166
一个傻瓜式的开关
00:07:50.500 → 00:07:51.733
它给开发者提供了
00:07:51.733 → 00:07:53.866
一整套极为变态的控制台
00:07:53.966 → 00:07:56.200
开发者可以选不同的底层模型
00:07:56.500 → 00:07:58.933
模型a模型b模型c
00:07:59.133 → 00:08:01.600
不同模型的成图风格都不一样
00:08:01.733 → 00:08:03.700
更夸张的是结构强度
00:08:04.133 → 00:08:06.800
structure intensity和色调强度
00:08:06.933 → 00:08:09.333
tone intensity这两个滑块
00:08:09.500 → 00:08:12.366
结构强度控制的是高频细节
00:08:15.066 → 00:08:17.900
色调强度控制的是低频细节
00:08:17.900 → 00:08:19.600
比如整体光影氛围
00:08:20.800 → 00:08:24.266
因为DLSS5在底层就懂场景里的语义
00:08:24.366 → 00:08:26.866
开发者可以直接在引擎里拉个框
00:08:27.200 → 00:08:29.866
说我只要这串葡萄和这个酒瓶
00:08:31.733 → 00:08:33.333
背景的木板不要动
00:08:33.500 → 00:08:34.933
然后你拉动滑块
00:08:35.200 → 00:08:37.866
眼看着那个塑料质感的酒瓶瞬间
00:08:37.866 → 00:08:40.733
有了金属和玻璃交织的折射光
00:08:40.900 → 00:08:43.066
葡萄透出了晶莹剔透的水分
00:08:43.400 → 00:08:45.666
而旁边的环境纹丝不变
00:08:45.766 → 00:08:48.000
你看出英伟达的阳谋了吗
00:08:48.133 → 00:08:50.733
以往游戏公司为了优化画质
00:08:50.866 → 00:08:54.466
要花海量的时间写各种shader着色器
00:08:54.500 → 00:08:56.200
调优各种光影参数
00:08:56.333 → 00:08:57.866
现在英伟达告诉你
00:08:59.000 → 00:09:00.700
把基础几何建好
00:09:00.966 → 00:09:03.766
剩下的写实渲染用我的Delux
00:09:03.766 → 00:09:06.133
5大模型加上滑块来搞定
00:09:06.200 → 00:09:08.333
一旦游戏开发者习惯了这种
00:09:08.333 → 00:09:11.533
所见即所得的AI生成式渲染管线
00:09:11.800 → 00:09:13.466
他们就再也回不去
00:09:13.466 → 00:09:15.733
传统的手工死磕模式了
00:09:15.733 → 00:09:17.000
而这种开发流
00:09:17.366 → 00:09:20.266
是深度绑定英伟达硬件的Tensor core
00:09:20.566 → 00:09:21.733
这意味着什么
00:09:21.933 → 00:09:24.666
这意味着AMD和索尼在主机和显卡
00:09:24.666 → 00:09:27.333
市场的传统追赶路线彻底失效了
00:09:27.333 → 00:09:29.666
你堆再多的传统流处理器
00:09:31.000 → 00:09:32.400
也打不过英伟达
00:09:32.766 → 00:09:35.400
直接在管线末端用AI大模型给
00:09:35.400 → 00:09:37.866
你无中生有生成的真实感
00:09:37.966 → 00:09:39.766
这其实宣告了计算机
00:09:39.766 → 00:09:41.866
图形学进入了一个新纪元
00:09:42.266 → 00:09:44.700
Edward Liu在台上放出了一张图
00:09:44.966 → 00:09:47.600
展示了图形学历史上的几次飞跃
00:09:47.866 → 00:09:49.766
可编程着色器是一次
00:09:49.966 → 00:09:51.500
光线追踪是一次
00:09:52.800 → 00:09:55.866
生成式AI是最新的一条增长曲线
00:09:57.266 → 00:09:59.600
只要英伟达在后台不断用更好的
00:09:59.600 → 00:10:02.900
数据更优的损失函数训练这个模型
00:10:03.066 → 00:10:04.866
玩家甚至不需要换显卡
00:10:04.933 → 00:10:06.533
只要更新一下驱动
00:10:06.600 → 00:10:09.166
游戏画面的真实度就能凭空跃升
00:10:09.466 → 00:10:12.200
Delus 5本质上是将算力门槛
00:10:12.266 → 00:10:14.266
转换成了模型护城河
00:10:14.466 → 00:10:16.266
这就是为什么老黄敢说
00:10:16.300 → 00:10:18.366
下一代的内容创作基建
00:10:18.366 → 00:10:20.533
依然牢牢握在英伟达手里
00:10:20.566 → 00:10:21.933
但游戏和电影
00:10:22.200 → 00:10:24.466
说到底只是给人的眼睛看的
00:10:24.466 → 00:10:27.566
如果你觉得迪乐斯舞已经够震撼了
00:10:27.666 → 00:10:30.166
那接下来的内容才是真正
00:10:30.166 → 00:10:32.766
触及物理世界底层的硬核科技
00:10:33.133 → 00:10:35.266
当画面真实到一定程度后
00:10:35.466 → 00:10:36.900
下一个要解决的
00:10:36.900 → 00:10:38.733
就是物理规律的真实
00:10:39.733 → 00:10:42.200
英国科学家Neil Ashdown上场了
00:10:42.200 → 00:10:43.966
他带来的技术才是
00:10:43.966 → 00:10:45.900
真正能帮波音造飞机
00:10:45.966 → 00:10:48.466
帮台积电建厂房的核心武器
00:10:48.700 → 00:10:50.366
AI驱动的物理模拟
00:10:50.666 → 00:10:52.400
如果说格拉斯5是在视觉
00:10:52.400 → 00:10:54.100
上欺骗了我们的眼睛
00:10:54.300 → 00:10:55.733
那么接下来的技术
00:10:55.900 → 00:10:57.500
就是在物理规律上
00:10:57.800 → 00:10:59.000
直接掀翻了传统
00:10:59.000 → 00:11:00.933
科学和工程界的桌子
00:11:00.966 → 00:11:03.133
当Neil Ashton上台的时候
00:11:03.366 → 00:11:06.000
他没有一上来就提游戏或者渲染
00:11:06.600 → 00:11:08.300
而是放了一段非常震撼
00:11:08.300 → 00:11:10.300
的地球气候模拟视频
00:11:10.366 → 00:11:12.666
这是一个分辨率达到1公里
00:11:12.800 → 00:11:14.700
拥有500亿个网格单元
00:11:14.700 → 00:11:16.300
的超级模拟系统
00:11:16.366 → 00:11:18.733
用来预测全球的气象变化
00:11:18.933 → 00:11:20.700
这种级别的模拟在传统
00:11:20.700 → 00:11:22.500
科学界是什么概念呢
00:11:22.800 → 00:11:25.966
它需要动用超过2万张最顶级的GPU
00:11:26.266 → 00:11:28.533
连续运行不知道多少天才能
00:11:28.533 → 00:11:30.666
算出一个勉强精准的结果
00:11:30.800 → 00:11:33.133
为什么传统物理模拟这么费劲
00:11:33.166 → 00:11:34.800
这里我们要补一点干货
00:11:35.133 → 00:11:36.866
在传统的工程世界里
00:11:36.933 → 00:11:40.100
不管是预测天气设计汽车的风阻
00:11:40.266 → 00:11:43.133
还是测试台积电晶圆厂里的气流
00:11:43.300 → 00:11:45.800
用的都是这类传统数值方法
00:11:45.900 → 00:11:48.866
你要把空间切成无数个微小的网格
00:11:49.333 → 00:11:50.400
然后根据那些让
00:11:50.400 → 00:11:52.500
人头秃的偏微分方程
00:11:52.800 → 00:11:54.333
计算每一个网格里
00:11:54.333 → 00:11:57.000
空气水或者热量的变化
00:11:57.100 → 00:11:58.600
你的网格切得越细
00:11:59.066 → 00:12:00.700
时间步长设得越短
00:12:00.866 → 00:12:02.133
结果就越准确
00:12:02.200 → 00:12:05.466
但代价是计算量会呈指数级爆炸
00:12:05.600 → 00:12:08.400
这就好比你要一粒沙一粒沙地
00:12:08.400 → 00:12:11.100
去数整个撒哈拉沙漠的沙子
00:12:11.366 → 00:12:13.566
算力根本不够用所以
00:12:13.933 → 00:12:16.566
Ashton在台上抛出了一个灵魂拷问
00:12:16.700 → 00:12:19.500
既然我们的目标是得到更高的精度
00:12:19.500 → 00:12:22.366
但又不可能每天都跑2万张GPU
00:12:22.500 → 00:12:25.466
那AI能不能来帮忙答案是
00:12:25.800 → 00:12:27.966
能而且效果极其吓人
00:12:28.000 → 00:12:30.566
它展示了目前气象界的一场革命
00:12:30.700 → 00:12:33.133
NVIDIA和其他研究机构合作
00:12:33.133 → 00:12:35.933
不是让AI去强行背诵物理公式
00:12:36.100 → 00:12:37.900
而是把过去40年积累
00:12:37.900 → 00:12:39.366
的气象观测数据
00:12:39.733 → 00:12:42.100
以及最高精度的传统模拟数据
00:12:42.166 → 00:12:44.466
统统喂给一个机器学习模型
00:12:44.533 → 00:12:46.300
就像大语言模型通过
00:12:46.300 → 00:12:48.800
海量文本学会了说话一样
00:12:48.800 → 00:12:51.266
这个AI模型通过海量的数据
00:12:51.466 → 00:12:53.366
硬生生的领悟了流体
00:12:53.366 → 00:12:55.266
和热力学运作的规律
00:12:56.466 → 00:12:58.266
这个训练好的AI模型
00:12:58.700 → 00:13:00.966
只需要几秒钟或者几分钟
00:13:01.000 → 00:13:03.333
就能在普通的硬件上跑出
00:13:03.333 → 00:13:05.166
以前需要几个小时甚至
00:13:05.166 → 00:13:07.466
几天才能算出的天气预测
00:13:07.700 → 00:13:09.600
而且准确率甚至比
00:13:09.600 → 00:13:12.200
传统的数值模拟还要高现在
00:13:12.600 → 00:13:15.466
全球很多顶级的气象中心已经把
00:13:15.466 → 00:13:18.600
这种AI预测模型投入到实际生产中
00:13:18.600 → 00:13:21.566
了但这还不是最牛的Ashton
00:13:22.000 → 00:13:23.500
紧接着话锋一转
00:13:23.666 → 00:13:26.100
气象学家其实还算轻松的
00:13:26.100 → 00:13:28.466
因为地球的形状是固定的
00:13:28.533 → 00:13:30.200
但对于我们这些搞
00:13:30.200 → 00:13:32.266
流体力学工程的人来说
00:13:32.400 → 00:13:35.300
最痛苦的是几何形状的无限变化
00:13:35.666 → 00:13:37.066
他放出了一个极度复杂
00:13:37.066 → 00:13:39.200
的飞机气动模拟画面
00:13:39.366 → 00:13:40.900
当你坐飞机的时候
00:13:40.900 → 00:13:42.733
可能留意过发动机外壳
00:13:42.733 → 00:13:44.800
上有几道不起眼的凸起
00:13:44.966 → 00:13:46.533
这玩意是干嘛的
00:13:46.566 → 00:13:48.133
空气是看不见的
00:13:48.600 → 00:13:50.800
如果不通过极高精度的模拟
00:13:51.100 → 00:13:53.066
设计师根本不知道这些凸起
00:13:53.066 → 00:13:55.533
会在空气中划出怎样的涡流
00:13:55.733 → 00:13:58.400
更不知道这些涡流能不能顺着机翼
00:13:58.400 → 00:14:01.333
在起飞和降落时提供额外的升力
00:14:01.600 → 00:14:03.566
为了设计出一架好飞机
00:14:04.966 → 00:14:06.566
工程师需要反复修改
00:14:06.566 → 00:14:08.100
这些零部件的形状
00:14:08.200 → 00:14:10.500
然后再进行漫长的模拟计算
00:14:10.566 → 00:14:13.333
这中间的时间成本和算力成本
00:14:13.733 → 00:14:15.500
简直是个天文数字
00:14:15.666 → 00:14:18.300
那么Nvidia是怎么用AI来
00:14:18.300 → 00:14:20.300
降维打击这个领域的呢
00:14:23.100 → 00:14:24.966
这段数据非常夸张
00:14:25.200 → 00:14:28.266
Ashton展示了一个包含了大约2,000种
00:14:28.266 → 00:14:31.066
不同气动布局的飞机公开数据集
00:14:31.500 → 00:14:33.666
如果用传统方法去跑这2,000
00:14:33.666 → 00:14:35.800
种布局的高精度流体模拟
00:14:36.166 → 00:14:37.933
超过10亿个自由度
00:14:38.000 → 00:14:41.366
它会生成大约200TB的庞大数据
00:14:41.666 → 00:14:44.100
你猜NVIDIA用他们最新的Transformer
00:14:44.266 → 00:14:46.766
架构和极度聪明的TOKEN化技术
00:14:47.000 → 00:14:49.600
训练出来的AI模型有多大
00:14:49.666 → 00:14:51.100
不是20太字节
00:14:52.766 → 00:14:54.566
而是只有200兆字节
00:14:55.866 → 00:14:57.333
这简直不是压缩
00:14:58.800 → 00:15:02.066
相当于把200TB包含了复杂
00:15:02.066 → 00:15:03.733
流体力学知识的数据
00:15:03.933 → 00:15:06.366
提炼出了最核心的物理规律
00:15:06.666 → 00:15:09.900
塞进了一个200兆字节的检查点里
00:15:09.933 → 00:15:13.133
这是一个近乎100万倍的数据压缩
00:15:13.566 → 00:15:16.133
更可怕的是它的速度和泛化能力
00:15:16.266 → 00:15:19.366
Ashton在台上直接做了一个现场演示
00:15:19.566 → 00:15:21.766
这在工程界堪称神迹
00:15:22.166 → 00:15:24.766
他用这个200兆字节的训练模型
00:15:24.933 → 00:15:27.400
去预测一个他在训练数据里
00:15:27.400 → 00:15:30.133
从来没有见过的全新飞机几何
00:15:30.133 → 00:15:33.800
形状以及全新的边界条件结果呢
00:15:33.933 → 00:15:35.866
这个模型只用了一秒钟
00:15:36.300 → 00:15:38.000
仅仅在一张相对普通的
00:15:38.000 → 00:15:40.566
RT X6000工作站显卡上
00:15:40.566 → 00:15:43.966
就立刻吐出了气流分布的预测结果
00:15:45.066 → 00:15:46.600
这个结果不是那种为了
00:15:46.600 → 00:15:48.566
好看而生成的瞎猜动画
00:15:48.766 → 00:15:50.966
它是符合严谨物理规律的
00:15:51.133 → 00:15:53.333
与传统高精度模拟相比
00:15:53.466 → 00:15:56.500
误差只有惊人的1%到2%
00:15:56.666 → 00:15:59.000
传统的流程是改一次设计
00:15:59.166 → 00:16:00.666
等几天出结果
00:16:01.900 → 00:16:03.166
再改一次设计
00:16:03.300 → 00:16:05.800
现在的流程是改一次设计
00:16:05.866 → 00:16:07.266
一秒钟出结果
00:16:07.400 → 00:16:08.866
立刻知道行不行
00:16:09.400 → 00:16:11.300
效率提升了1万倍以上
00:16:11.333 → 00:16:12.533
这意味着什么
00:16:12.600 → 00:16:14.366
这意味着未来工业设计
00:16:14.366 → 00:16:16.400
的门槛将被彻底打穿
00:16:16.600 → 00:16:18.933
波音空客特斯拉
00:16:19.100 → 00:16:21.533
甚至是造服务器机房的公司
00:16:21.700 → 00:16:23.700
他们可以把这个极度轻量化
00:16:23.866 → 00:16:26.866
但在物理上完全正确的AI模拟引擎
00:16:27.300 → 00:16:29.333
直接插进他们的设计软件里
00:16:29.566 → 00:16:31.966
设计师随便调整一下汽车的尾翼
00:16:32.266 → 00:16:33.733
软件就能在毫秒级
00:16:33.733 → 00:16:35.600
告诉你风阻降了多少
00:16:35.933 → 00:16:38.733
散热工程师改变一下机箱的进风口
00:16:38.900 → 00:16:40.900
立刻就能看到热流的变化
00:16:41.133 → 00:16:43.100
艾什顿站在台上对台下的
00:16:43.100 → 00:16:45.400
计算机图形学专家们喊话
00:16:45.500 → 00:16:47.700
你们这些搞好莱坞特效的
00:16:47.700 → 00:16:49.966
搞水流烟雾模拟的
00:16:49.966 → 00:16:51.333
你们以前只是为了
00:16:51.333 → 00:16:53.800
追求视觉上的好看现在
00:16:54.600 → 00:16:56.666
是时候把你们在可微物理
00:16:56.800 → 00:16:59.066
几何建模上的经验带过来
00:16:59.366 → 00:17:03.066
跟我们一起把这些能力推向电磁学
00:17:04.666 → 00:17:07.533
去加速下一代的科学和工程革命
00:17:08.700 → 00:17:10.533
如果你是一个懂商业的人
00:17:10.533 → 00:17:12.500
你应该能闻到血腥味了
00:17:12.566 → 00:17:15.300
NVIDIA现在的野心绝不仅仅是
00:17:15.300 → 00:17:17.566
做个卖铲子的算力供应商
00:17:17.966 → 00:17:19.300
他正在把自己变成
00:17:19.300 → 00:17:21.300
一个物理现实的定义者
00:17:21.366 → 00:17:23.366
所有的物理世界规律
00:17:23.500 → 00:17:26.000
正在被Nvidia的模型吃进去
00:17:26.166 → 00:17:28.700
嚼碎了变成了一行行AI可以
00:17:28.700 → 00:17:30.100
瞬间调用的代码
00:17:30.166 → 00:17:32.800
但Nvidia花这么大力气搞物理模拟
00:17:33.300 → 00:17:36.100
真的是只为了帮人造飞机造汽车吗
00:17:37.500 → 00:17:39.366
所有这些在虚拟世界里
00:17:39.366 → 00:17:41.100
极度真实的物理法则
00:17:41.466 → 00:17:43.200
其实都是在为整场
00:17:43.200 → 00:17:45.266
发布会的终极形态铺路
00:17:45.566 → 00:17:47.166
他们要创造一个完全受
00:17:47.166 → 00:17:49.166
物理定律支配的虚拟宇宙
00:17:49.300 → 00:17:51.400
去孕育下一代的人工智能
00:17:51.500 → 00:17:54.066
这就引出了发布会的第三个板块
00:17:54.166 → 00:17:56.766
也是最让科技界炸锅的内容
00:17:57.100 → 00:17:59.800
Cosmos3世界模型以及那个
00:17:59.800 → 00:18:01.933
让人细思极恐的物理AI
00:18:02.100 → 00:18:04.333
NVIDIA花这么大代价搭建这个
00:18:04.333 → 00:18:06.600
绝对符合物理定律的游乐场
00:18:06.866 → 00:18:09.300
真正要装进去的玩家只有一个
00:18:09.333 → 00:18:11.000
那就是未来的物理AI
00:18:11.366 → 00:18:13.800
也就是具身智能和自动驾驶
00:18:14.900 → 00:18:18.300
Cosmos实验室的副总裁Ming Liu上台了
00:18:18.300 → 00:18:20.200
他一开口直接戳穿了现在
00:18:20.200 → 00:18:22.266
整个机器人行业的遮羞布
00:18:22.366 → 00:18:24.666
物理AI现在有一个致命的死穴
00:18:26.166 → 00:18:27.666
你仔细算一笔账
00:18:28.066 → 00:18:29.900
为什么ChatGPT这种
00:18:29.900 → 00:18:31.733
语言大模型能爆发
00:18:32.100 → 00:18:33.800
因为互联网上存着人类
00:18:33.800 → 00:18:35.766
几十年敲下来的海量文本
00:18:36.400 → 00:18:38.333
Openai直接拿爬虫一刮
00:18:38.566 → 00:18:39.900
语料库就有了
00:18:41.500 → 00:18:43.600
机器人要学习怎么抓杯子
00:18:43.733 → 00:18:45.166
怎么躲避行人
00:18:45.333 → 00:18:47.100
怎么在厨房煎鸡蛋
00:18:47.266 → 00:18:48.966
这些所谓的物理直觉
00:18:49.400 → 00:18:50.766
互联网上根本没有
00:18:50.766 → 00:18:52.700
现成的数据包可以下载
00:18:52.766 → 00:18:54.566
你想让机器人变聪明
00:18:54.933 → 00:18:56.100
传统的做法就是
00:18:56.100 → 00:18:58.000
真枪实弹的去录数据
00:18:58.100 → 00:18:59.933
比如你要训练自动驾驶
00:19:00.100 → 00:19:01.400
你就得派车队去
00:19:01.400 → 00:19:03.266
马路上跑几千万公里
00:19:03.266 → 00:19:04.700
你要训练机械臂
00:19:04.766 → 00:19:06.766
就得让人带着VR头显
00:19:06.866 → 00:19:08.900
一次次控制机械臂去
00:19:08.900 → 00:19:10.500
抓取桌子上的积木
00:19:10.566 → 00:19:13.866
这种遥操作收集的数据确实精准
00:19:14.133 → 00:19:16.000
但效率低得令人发指
00:19:16.300 → 00:19:19.600
现实世界的物理法则是按秒流逝的
00:19:19.666 → 00:19:22.266
你没法对着现实世界按快进键
00:19:22.366 → 00:19:24.533
真车在路上开一个小时
00:19:24.533 → 00:19:26.533
就是实打实的一个小时
00:19:26.733 → 00:19:28.966
遇到极端车祸场景的概率
00:19:28.966 → 00:19:30.900
更是低到可以忽略不计
00:19:31.300 → 00:19:33.900
如果靠传统方式去喂养物理AI
00:19:34.000 → 00:19:35.500
可能再过50年
00:19:35.566 → 00:19:38.100
机器人还是个只会扫地的智障
00:19:38.266 → 00:19:40.666
明佑陆在台上的原话非常狠
00:19:40.900 → 00:19:43.933
他说如果只有现实世界这一条路
00:19:44.066 → 00:19:47.000
物理AI永远无法普及但如果
00:19:47.533 → 00:19:49.533
我们能造出一个从机器人
00:19:49.533 → 00:19:52.300
视角出发的虚拟世界模型呢
00:19:52.300 → 00:19:53.566
这句话一出来
00:19:53.733 → 00:19:55.866
整个逻辑闭环彻底打通
00:19:56.266 → 00:19:57.866
只要能用AI生成一个
00:19:57.866 → 00:19:59.666
极度真实的虚拟世界
00:19:59.900 → 00:20:01.866
数据获取就不再是苦
00:20:01.866 → 00:20:03.533
哈哈的去大街上收集
00:20:03.733 → 00:20:06.700
而是变成了在机房里用算力生成
00:20:06.866 → 00:20:08.933
每一滴消耗的GPU算力
00:20:08.933 → 00:20:10.400
都会直接转化成
00:20:10.733 → 00:20:12.466
无数个边缘测试场景
00:20:12.600 → 00:20:14.166
无数种天气状况
00:20:14.300 → 00:20:16.200
一千个不同的厨房布局
00:20:16.400 → 00:20:18.266
一万个不同的仓库环境
00:20:18.300 → 00:20:20.466
这就是这场发布会的终极核
00:20:20.866 → 00:20:23.466
但Cosmos3世界模型
00:20:23.566 → 00:20:25.200
不要把Cosmos当成一个
00:20:25.200 → 00:20:27.166
简单的视频生成工具
00:20:27.900 → 00:20:30.466
它跟Sora完全不是一个维度的东西
00:20:30.700 → 00:20:32.766
Cosmos的底层是一个极其
00:20:32.766 → 00:20:35.066
庞大的混合Transformer架构
00:20:35.200 → 00:20:36.933
左边是一个自回归塔
00:20:37.266 → 00:20:38.600
负责逻辑推理
00:20:38.733 → 00:20:40.266
比如它看到画面
00:20:40.466 → 00:20:43.100
会自己思考接下来该发生什么
00:20:43.200 → 00:20:44.766
右边是一个扩散塔
00:20:45.533 → 00:20:47.466
负责生成画面和声音
00:20:47.533 → 00:20:49.600
而这中间最核心的突破
00:20:49.733 → 00:20:51.333
是他把一种全新的
00:20:51.333 → 00:20:53.600
模态扔进了神经网络里
00:20:53.733 → 00:20:55.333
这个模态叫做动作
00:20:56.933 → 00:20:59.000
以前的AI看视频就
00:20:59.000 → 00:21:00.966
只是看一堆像素在动
00:21:00.966 → 00:21:02.466
但Cosmos不一样
00:21:02.700 → 00:21:04.933
它是带着目的去理解世界的
00:21:04.933 → 00:21:06.933
为了让全天下所有长得
00:21:06.933 → 00:21:09.700
奇形怪状的机器人都能听懂指令
00:21:10.000 → 00:21:11.866
NVIDIA做了一件非常
00:21:11.866 → 00:21:13.800
可怕的底层统一工作
00:21:14.166 → 00:21:15.200
他们发明了一套
00:21:15.200 → 00:21:17.100
通用的几何动作语言
00:21:17.200 → 00:21:20.100
不管你是四个轮子的自动驾驶汽车
00:21:20.300 → 00:21:22.333
还是单臂工业机器人
00:21:22.800 → 00:21:24.400
或者是拥有两条腿
00:21:24.400 → 00:21:26.266
两只手的人形机器人
00:21:27.966 → 00:21:30.766
统统被拆解成了最基础的几何基元
00:21:31.133 → 00:21:32.600
你的机身位置在哪里
00:21:32.733 → 00:21:35.266
ego pose你的执行器在哪里
00:21:35.566 → 00:21:37.866
effectors你的抓手在干什么
00:21:37.966 → 00:21:40.533
grippers这个动作定义一确立
00:21:40.766 → 00:21:43.366
发生了一件颠覆整个行业的事情
00:21:43.733 → 00:21:45.800
人类拍的第一人称视频
00:21:46.066 → 00:21:49.066
突然全部变成了机器人的顶级教材
00:21:49.133 → 00:21:52.933
你想一个人带着Gopro在厨房里做饭
00:21:53.300 → 00:21:55.666
视频里的画面就是机身位置
00:21:56.000 → 00:21:57.866
两只手就是两个执行器
00:21:58.066 → 00:21:59.966
Cosmos通过逆向动力学
00:21:59.966 → 00:22:01.300
看完这段视频
00:22:01.666 → 00:22:03.533
立刻就能反推出做饭时
00:22:03.533 → 00:22:05.566
的关节受力和空间轨迹
00:22:06.133 → 00:22:08.500
然后把这套动作逻辑直接
00:22:08.500 → 00:22:10.900
打包装进机器人的大脑里
00:22:10.933 → 00:22:13.266
以前那些没用的网红做饭视频
00:22:13.600 → 00:22:16.533
现在全成了喂养物理AI的顶级语料
00:22:16.700 → 00:22:18.200
这就是降维打击
00:22:18.366 → 00:22:19.800
有了这个万能底座
00:22:20.133 → 00:22:23.866
NVIDIA直接掏出了Cosmos3的家族全家桶
00:22:24.000 → 00:22:27.500
前面提到的针对自动驾驶的Nano模型
00:22:27.700 → 00:22:30.100
针对极致保真度的super模型
00:22:30.533 → 00:22:32.300
这些其实在之前的GTC
00:22:32.300 → 00:22:33.866
大会上就露过脸了
00:22:33.866 → 00:22:36.000
但这次SIGGRAPH min Liu
00:22:36.000 → 00:22:37.666
亮出了最后一块拼图
00:22:38.066 → 00:22:41.566
也是最关键的一步棋Cosmos3edge
00:22:41.766 → 00:22:43.600
这是一个只有40亿
00:22:43.600 → 00:22:45.600
参数的维缩版小模型
00:22:46.000 → 00:22:48.800
专为端侧实时运行量身定制
00:22:49.066 → 00:22:50.700
发布会现场直接切
00:22:50.700 → 00:22:52.200
到了一个实机演示
00:22:52.466 → 00:22:54.366
一个机械臂盯着桌子
00:22:54.366 → 00:22:56.200
上的一个灰色方块
00:22:56.366 → 00:22:58.800
机械臂的底座里插着一块
00:22:58.800 → 00:23:01.266
搭载Jetson Thor芯片的计算板
00:23:01.300 → 00:23:04.766
这个40亿参数的Cosmos 3 edge模型
00:23:05.133 → 00:23:07.933
就在这块本地芯片上疯狂运转
00:23:08.100 → 00:23:10.733
他直接通过摄像头看着那个方块
00:23:11.066 → 00:23:12.600
不仅能瞬间看懂
00:23:12.600 → 00:23:14.866
方块的材质空间位置
00:23:15.133 → 00:23:16.966
还能在毫秒级预测出
00:23:16.966 → 00:23:18.800
自己抓取动作的结果
00:23:19.500 → 00:23:21.300
然后直接指挥机械臂
00:23:21.533 → 00:23:23.366
一把将方块抓起来
00:23:23.466 → 00:23:24.766
这个过程没有任何
00:23:24.766 → 00:23:26.266
云端服务器的参与
00:23:26.766 → 00:23:28.766
没有来回传输的网络延迟
00:23:29.100 → 00:23:30.566
传感器数据进去
00:23:30.666 → 00:23:32.900
机械臂的控制信号出来
00:23:32.933 → 00:23:35.900
这就是边缘端实时控制的完全体
00:23:37.733 → 00:23:39.533
未来的机器人不需要时刻
00:23:39.533 → 00:23:42.066
连着Wifi去求助云端的大脑
00:23:42.333 → 00:23:45.266
他们出厂自带一个极度聪明的小脑
00:23:45.466 → 00:23:47.666
能够在真实物理环境里
00:23:47.666 → 00:23:49.333
靠自己的芯片做出
00:23:49.333 → 00:23:51.500
瞬间的生存和作业反应
00:23:51.600 → 00:23:54.200
而为了让这种模型能够又快又准
00:23:54.500 → 00:23:56.500
NVIDIA甚至把去噪步数
00:23:56.500 → 00:23:58.133
强行压缩到了4步
00:23:58.200 → 00:23:59.366
这意味着什么
00:23:59.600 → 00:24:01.800
这意味着图像和视频生成的
00:24:01.800 → 00:24:04.700
响应速度足足飙升了25倍
00:24:04.766 → 00:24:07.300
不管是响应时间还是推理成本
00:24:07.766 → 00:24:09.500
都直接砸穿了地板价
00:24:09.533 → 00:24:11.766
让商用落地变成了可能
00:24:11.866 → 00:24:14.266
最后整场发布会的高潮
00:24:14.500 → 00:24:16.533
也是最让自动驾驶厂商
00:24:16.533 → 00:24:18.466
后背发凉的演示来了
00:24:18.966 → 00:24:21.766
Cosmostreams神经闭环模拟器
00:24:22.900 → 00:24:24.600
你看到的是一辆自动驾驶
00:24:24.600 → 00:24:27.333
汽车在城郊街道上行驶的画面
00:24:27.533 → 00:24:30.533
阳光树影路过的其他车辆
00:24:30.600 → 00:24:31.933
一切都真实的
00:24:31.933 → 00:24:33.333
甚至有些刺眼
00:24:33.333 → 00:24:34.666
但Ming Yulu旁边的
00:24:34.666 → 00:24:37.466
工程师拿着一个PS4手柄
00:24:38.300 → 00:24:39.766
直接控制着画面里的
00:24:39.766 → 00:24:42.100
汽车左转右转刹车
00:24:42.133 → 00:24:43.466
这不是放录像
00:24:43.533 → 00:24:45.733
也不是GTA5游戏画面
00:24:45.800 → 00:24:48.566
这是Cosmos DREAMS在毫秒级
00:24:48.566 → 00:24:50.466
实时生成的AI梦境
00:24:50.666 → 00:24:53.133
工程师手柄按下去的每一个动作
00:24:54.933 → 00:24:56.600
大模型立刻根据现实
00:24:56.600 → 00:24:59.200
世界的物理规律光影逻辑
00:24:59.533 → 00:25:02.066
凭空运算出汽车挡风玻璃前
00:25:02.066 → 00:25:04.400
接下来该出现的每一帧画面
00:25:04.700 → 00:25:06.466
不仅是正前方的主视角
00:25:06.533 → 00:25:08.066
连右下角的鸟瞰图
00:25:08.066 → 00:25:09.900
也是同步实时生成的
00:25:09.900 → 00:25:12.366
这台自动驾驶汽车的AI算法
00:25:12.466 → 00:25:15.300
其实正行驶在Cosmos大模型给
00:25:15.300 → 00:25:17.333
它编织的一场逼真梦境里
00:25:17.533 → 00:25:18.933
他在梦里遇到加塞
00:25:21.200 → 00:25:23.400
他做出的每一次方向盘打轮
00:25:23.600 → 00:25:26.500
都会得到完全符合现实规律的反馈
00:25:26.600 → 00:25:29.366
车企甚至不需要把测试车开上街
00:25:29.733 → 00:25:31.566
直接把自动驾驶的策略
00:25:31.566 → 00:25:33.733
模型接进Cosmos DREAMS里
00:25:33.966 → 00:25:35.333
就可以做无尽的被动
00:25:35.333 → 00:25:37.333
验证和极端场景训练
00:25:37.500 → 00:25:39.100
最离谱的在这里
00:25:40.466 → 00:25:42.266
NVIDIA刚搞出这个实时
00:25:42.266 → 00:25:43.600
梦境系统的时候
00:25:43.866 → 00:25:47.166
还要靠整整64张GB300级别的
00:25:47.166 → 00:25:49.733
顶级芯片并联才能勉强跑动
00:25:50.266 → 00:25:51.533
那个成本是正常
00:25:51.533 → 00:25:53.366
公司根本负担不起的
00:25:53.366 → 00:25:55.000
后来他们把算力优化
00:25:55.000 → 00:25:57.400
到了16张Vera Rubin芯片
00:25:57.533 → 00:26:00.666
而今天在SIGGRAPH 2026的舞台上
00:26:00.733 → 00:26:03.200
这套完全实时的高保真的
00:26:03.200 → 00:26:05.466
闭环虚拟自动驾驶模拟器
00:26:05.900 → 00:26:07.600
只需要靠桌子上一张单
00:26:07.600 → 00:26:10.400
卡的RTX Pro6,000工作站显卡
00:26:10.400 → 00:26:11.800
就能流畅运行
00:26:11.933 → 00:26:15.133
一张单卡跑起了一整个物理世界
00:26:15.333 → 00:26:17.866
当算力成本被压缩到这个地步
00:26:18.266 → 00:26:21.000
自动驾驶和机器人行业的研发门槛
00:26:21.300 → 00:26:24.100
直接从云端跌落到了车库级别
00:26:24.166 → 00:26:27.000
以后任何一家做物理AI的创业公司
00:26:27.166 → 00:26:29.200
只要买一台Nvidia的工作站
00:26:29.566 → 00:26:31.000
就等于拥有了一个可以
00:26:31.000 → 00:26:33.000
无限折叠时间和空间
00:26:33.133 → 00:26:35.366
无限试错的现实训练场
00:26:36.466 → 00:26:39.133
整场SIGGRAPH 2026主题演讲的
00:26:39.133 → 00:26:41.266
底牌已经完全翻开了
00:26:41.333 → 00:26:42.266
如果你到现在
00:26:42.266 → 00:26:44.733
还以为Nvidia只是在卖GPU
00:26:45.066 → 00:26:47.800
那你已经被远远甩在时代后面了
00:26:47.800 → 00:26:50.400
从delight五重数图形渲染管线
00:26:50.533 → 00:26:52.300
到把庞大的流体力学
00:26:52.300 → 00:26:54.166
压缩近200兆的模型
00:26:54.566 → 00:26:56.366
再到今天发布主宰物理
00:26:56.366 → 00:26:59.133
定律的Cosmos3和Cosmos DREAMS
00:26:59.400 → 00:27:00.900
NVIDIA正在亲手搭建
00:27:00.900 → 00:27:02.733
一条从数字到物理
00:27:03.000 → 00:27:05.466
从软件到硬件的绝对垄断闭环
00:27:05.600 → 00:27:08.100
它给开发者提供底层算力
00:27:08.166 → 00:27:10.333
给工程师提供物理引擎
00:27:10.533 → 00:27:13.100
最后给未来的机器人发放大脑
00:27:13.166 → 00:27:14.666
在这个新纪元里
00:27:14.666 → 00:27:16.500
不再是代码定义游戏
00:27:16.800 → 00:27:19.333
而是生成式AI直接定义世界
00:27:19.366 → 00:27:22.333
不再是车队去马路上苦苦收集数据
00:27:22.400 → 00:27:24.866
而是算力直接涌现出数据
00:27:25.000 → 00:27:26.400
未来的商业竞争
00:27:26.666 → 00:27:28.333
谁能掌握构建虚拟
00:27:28.333 → 00:27:30.300
世界的速度和保真度
00:27:30.366 → 00:27:33.600
谁就能控制物理AI进化的速度
00:27:33.866 → 00:27:35.266
而在这条赛道上
00:27:35.366 → 00:27:37.266
英伟达已经不是在领跑
00:27:37.366 → 00:27:39.133
它是在亲手制定物理
00:27:39.133 → 00:27:41.000
世界的全新操作系统
00:27:41.100 → 00:27:43.133
好今天就到这里了
00:27:43.166 → 00:27:44.333
记得点个订阅
00:27:44.566 → 00:27:46.000
我们持续追踪这些
00:27:46.000 → 00:27:47.500
巨头怎么改变未来