實際影片長度:2:56.000。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:01.600
蘇媽這次是真把桌子掀了
0:01.600–0:03.320
就在AI硬件圈都以為
0:03.320–0:05.260
嚴肅大模型必須繼續住在雲端
0:05.260–0:06.280
住在數據中心
0:06.280–0:07.620
住在英偉達機櫃裏的時候
0:07.620–0:09.200
AMD直接端出來一個
0:09.200–0:10.620
午餐盒大小的小主機
0:10.620–0:12.740
外網有人把這事説得特別狠
0:12.740–0:14.680
AMD用一台小盒子
0:14.680–0:16.380
打穿了英偉達4000美元級別
0:16.380–0:17.760
桌面AI超算的想象空間
0:17.760–0:19.020
一開始我也以為
0:19.020–0:20.700
這只是又一次常規升級
0:20.700–0:24.380
新APU 新核顯 新跑分 新AIPC
0:24.380–0:25.800
這些東西我們都見過了
0:25.800–0:27.280
但是當我看到兩個數字的時候
0:27.280–0:28.220
我愣了一下
0:28.220–0:29.960
128GB統一內存
0:29.960–0:31.820
235B級別大模型
0:31.820–0:32.580
本地運行
0:32.580–0:33.920
這兩個數字放在一起
0:33.920–0:35.660
才是這件事真正炸的地方
0:35.660–0:36.760
過去這麼多年
0:36.760–0:38.300
桌面AI有一條默認規則
0:38.300–0:39.960
小模型可以在本地玩一玩
0:39.960–0:41.680
真大模型必須上雲
0:41.680–0:42.160
為什麼
0:42.160–0:43.960
因為本地電腦有一堵牆
0:43.960–0:44.860
叫顯存
0:44.860–0:47.760
RTX4090 24GB顯存
0:47.760–0:50.700
RTX5090 32GB顯存
0:50.700–0:52.100
聽起來已經很豪華了
0:52.100–0:53.340
但在大模型面前
0:53.340–0:55.180
這點顯存就像你拿一個飯盒
0:55.180–0:56.460
想裝下一整鍋湯
0:56.460–0:57.700
裝不進去
0:57.700–0:58.940
後面算力再強
0:58.940–0:59.940
軟件再漂亮
0:59.940–1:00.800
都是廢話
1:00.800–1:03.040
所以過去普通人要用大模型
1:03.040–1:04.200
基本只有一條路
1:04.200–1:05.560
租別人的服務器
1:05.560–1:06.780
用別人的雲
1:06.780–1:08.400
交別人的訂閲費
1:08.400–1:10.060
把自己的數據
1:10.060–1:11.560
發到別人的機器上
1:11.560–1:13.420
但AMD這次最狠的地方
1:13.420–1:15.360
就是把這條規則撕開了一道口子
1:15.360–1:17.400
這顆芯片叫Ryzen AI Max
1:17.400–1:18.400
加395
1:18.400–1:19.480
名字你不用記
1:19.480–1:21.340
你只要記住它最關鍵的一招
1:21.340–1:23.700
CPU和GPU共享同一大石內存
1:23.700–1:24.820
翻譯一下就是
1:24.820–1:26.540
以前CPU有CPU的飯碗
1:26.540–1:27.720
GPU有GPU的飯碗
1:27.720–1:28.800
大家各吃各的
1:28.800–1:29.780
顯卡玩小
1:29.780–1:30.860
大模型就吃不下
1:30.860–1:32.740
但現在AMD直接做了一個大鍋
1:32.740–1:34.860
CPU GPU都從這口鍋裏要飯
1:34.860–1:36.480
這128GB統一內存
1:36.480–1:37.280
最關鍵的意義
1:37.280–1:38.140
不是參數好看
1:38.140–1:39.480
而是它讓本地大模型
1:39.480–1:40.820
第一次有了裝得下的可能
1:40.820–1:42.340
這才是桌面AI的命門
1:42.340–1:43.400
不是先問快不快
1:43.400–1:44.940
而是先問裝不裝得下
1:44.940–1:45.620
裝不下
1:45.620–1:46.860
一切都沒開始
1:46.860–1:48.940
裝得下才有資格談推理速度
1:48.940–1:50.440
隱私成本和工作流
1:50.440–1:51.500
更狠的是
1:51.500–1:52.900
這東西已經不是PPT了
1:52.900–1:54.720
GMKTEC這種迷你主機
1:54.720–1:56.220
已經把Ryzen AI Max
1:56.220–1:56.920
加395
1:56.920–1:57.820
做進了小盒子裏
1:57.820–1:59.420
官方頁面甚至直接寫着
1:59.420–2:01.060
128集字節版本
2:01.060–2:02.460
可以本地跑Q-1-3
2:02.460–2:03.860
235B級別模型
2:04.860–2:05.860
是什麼概念
2:05.860–2:07.860
你原來以為200B級別的大模型
2:07.860–2:09.140
是機房裏的東西
2:09.140–2:10.420
是服務器裏的東西
2:10.420–2:11.460
是雲廠商背後
2:11.460–2:12.900
一排排機櫃裏的東西
2:12.900–2:13.660
結果現在
2:13.660–2:14.540
它被塞進了一個
2:14.540–2:16.260
可以放在桌面上的小盒子裏
2:16.260–2:16.900
這一下
2:16.900–2:17.980
整個故事就變了
2:17.980–2:19.340
因為AMD不是在告訴你
2:19.340–2:20.940
我的核顯又強了一點
2:20.940–2:22.140
它真正想説的是
2:22.140–2:24.060
嚴肅AI不一定永遠只能租
2:24.060–2:25.380
它也可以被買回家
2:25.380–2:26.460
這就很刺激了
2:26.460–2:28.380
你看英偉達過去幾年怎麼講AI
2:28.380–2:29.300
很清楚
2:29.300–2:30.100
你要做AI
2:30.100–2:31.100
就進我的生態
2:31.100–2:32.100
用我的GPU
2:32.100–2:33.100
用我的軟件站
2:33.100–2:34.500
用我的數據中心方案
2:34.500–2:35.620
從訓練到推理
2:35.620–2:36.700
從企業到開發者
2:36.700–2:38.980
整個AI世界最好都圍着英偉達轉
2:38.980–2:40.900
而AMD這台小盒子的方向是
2:40.900–2:42.780
我不跟你在機櫃里正面硬鋼
2:42.780–2:44.780
我先把本地AI的門檻打下來
2:44.780–2:45.740
讓開發者
2:45.740–2:46.460
小團隊
2:46.460–2:47.180
創業者
2:47.180–2:47.780
律師
2:47.780–2:48.660
公司辦公室
2:48.660–2:50.860
也能開始擁有自己的AI工作台
2:50.860–2:52.940
這才是蘇媽這次最狠的地方
2:52.940–2:53.540
我是大寶
2:53.540–2:54.100
關注我
2:54.100–2:56.000
每天帶給你更多精彩AI諮詢
0:00.000–0:01.600
蘇媽這次是真把桌子掀了
0:01.600–0:03.320
就在AI硬件圈都以為
0:03.320–0:05.260
嚴肅大模型必須繼續住在雲端
0:05.260–0:06.280
住在數據中心
0:06.280–0:07.620
住在英偉達機櫃裏的時候
0:07.620–0:09.200
AMD直接端出來一個
0:09.200–0:10.620
午餐盒大小的小主機
0:10.620–0:12.740
外網有人把這事説得特別狠
0:12.740–0:14.680
AMD用一台小盒子
0:14.680–0:16.380
打穿了英偉達4000美元級別
0:16.380–0:17.760
桌面AI超算的想象空間
0:17.760–0:19.020
一開始我也以為
0:19.020–0:20.700
這只是又一次常規升級
0:20.700–0:24.380
新APU 新核顯 新跑分 新AIPC
0:24.380–0:25.800
這些東西我們都見過了
0:25.800–0:27.280
但是當我看到兩個數字的時候
0:27.280–0:28.220
我愣了一下
0:28.220–0:29.960
128GB統一內存
0:29.960–0:31.820
235B級別大模型
0:31.820–0:32.580
本地運行
0:32.580–0:33.920
這兩個數字放在一起
0:33.920–0:35.660
才是這件事真正炸的地方
0:35.660–0:36.760
過去這麼多年
0:36.760–0:38.300
桌面AI有一條默認規則
0:38.300–0:39.960
小模型可以在本地玩一玩
0:39.960–0:41.680
真大模型必須上雲
0:41.680–0:42.160
為什麼
0:42.160–0:43.960
因為本地電腦有一堵牆
0:43.960–0:44.860
叫顯存
0:44.860–0:47.760
RTX4090 24GB顯存
0:47.760–0:50.700
RTX5090 32GB顯存
0:50.700–0:52.100
聽起來已經很豪華了
0:52.100–0:53.340
但在大模型面前
0:53.340–0:55.180
這點顯存就像你拿一個飯盒
0:55.180–0:56.460
想裝下一整鍋湯
0:56.460–0:57.700
裝不進去
0:57.700–0:58.940
後面算力再強
0:58.940–0:59.940
軟件再漂亮
0:59.940–1:00.800
都是廢話
1:00.800–1:03.040
所以過去普通人要用大模型
1:03.040–1:04.200
基本只有一條路
1:04.200–1:05.560
租別人的服務器
1:05.560–1:06.780
用別人的雲
1:06.780–1:08.400
交別人的訂閲費
1:08.400–1:10.060
把自己的數據
1:10.060–1:11.560
發到別人的機器上
1:11.560–1:13.420
但AMD這次最狠的地方
1:13.420–1:15.360
就是把這條規則撕開了一道口子
1:15.360–1:17.400
這顆芯片叫Ryzen AI Max
1:17.400–1:18.400
加395
1:18.400–1:19.480
名字你不用記
1:19.480–1:21.340
你只要記住它最關鍵的一招
1:21.340–1:23.700
CPU和GPU共享同一大石內存
1:23.700–1:24.820
翻譯一下就是
1:24.820–1:26.540
以前CPU有CPU的飯碗
1:26.540–1:27.720
GPU有GPU的飯碗
1:27.720–1:28.800
大家各吃各的
1:28.800–1:29.780
顯卡玩小
1:29.780–1:30.860
大模型就吃不下
1:30.860–1:32.740
但現在AMD直接做了一個大鍋
1:32.740–1:34.860
CPU GPU都從這口鍋裏要飯
1:34.860–1:36.480
這128GB統一內存
1:36.480–1:37.280
最關鍵的意義
1:37.280–1:38.140
不是參數好看
1:38.140–1:39.480
而是它讓本地大模型
1:39.480–1:40.820
第一次有了裝得下的可能
1:40.820–1:42.340
這才是桌面AI的命門
1:42.340–1:43.400
不是先問快不快
1:43.400–1:44.940
而是先問裝不裝得下
1:44.940–1:45.620
裝不下
1:45.620–1:46.860
一切都沒開始
1:46.860–1:48.940
裝得下才有資格談推理速度
1:48.940–1:50.440
隱私成本和工作流
1:50.440–1:51.500
更狠的是
1:51.500–1:52.900
這東西已經不是PPT了
1:52.900–1:54.720
GMKTEC這種迷你主機
1:54.720–1:56.220
已經把Ryzen AI Max
1:56.220–1:56.920
加395
1:56.920–1:57.820
做進了小盒子裏
1:57.820–1:59.420
官方頁面甚至直接寫着
1:59.420–2:01.060
128集字節版本
2:01.060–2:02.460
可以本地跑Q-1-3
2:02.460–2:03.860
235B級別模型
2:04.860–2:05.860
是什麼概念
2:05.860–2:07.860
你原來以為200B級別的大模型
2:07.860–2:09.140
是機房裏的東西
2:09.140–2:10.420
是服務器裏的東西
2:10.420–2:11.460
是雲廠商背後
2:11.460–2:12.900
一排排機櫃裏的東西
2:12.900–2:13.660
結果現在
2:13.660–2:14.540
它被塞進了一個
2:14.540–2:16.260
可以放在桌面上的小盒子裏
2:16.260–2:16.900
這一下
2:16.900–2:17.980
整個故事就變了
2:17.980–2:19.340
因為AMD不是在告訴你
2:19.340–2:20.940
我的核顯又強了一點
2:20.940–2:22.140
它真正想説的是
2:22.140–2:24.060
嚴肅AI不一定永遠只能租
2:24.060–2:25.380
它也可以被買回家
2:25.380–2:26.460
這就很刺激了
2:26.460–2:28.380
你看英偉達過去幾年怎麼講AI
2:28.380–2:29.300
很清楚
2:29.300–2:30.100
你要做AI
2:30.100–2:31.100
就進我的生態
2:31.100–2:32.100
用我的GPU
2:32.100–2:33.100
用我的軟件站
2:33.100–2:34.500
用我的數據中心方案
2:34.500–2:35.620
從訓練到推理
2:35.620–2:36.700
從企業到開發者
2:36.700–2:38.980
整個AI世界最好都圍着英偉達轉
2:38.980–2:40.900
而AMD這台小盒子的方向是
2:40.900–2:42.780
我不跟你在機櫃里正面硬鋼
2:42.780–2:44.780
我先把本地AI的門檻打下來
2:44.780–2:45.740
讓開發者
2:45.740–2:46.460
小團隊
2:46.460–2:47.180
創業者
2:47.180–2:47.780
律師
2:47.780–2:48.660
公司辦公室
2:48.660–2:50.860
也能開始擁有自己的AI工作台
2:50.860–2:52.940
這才是蘇媽這次最狠的地方
2:52.940–2:53.540
我是大寶
2:53.540–2:54.100
關注我
2:54.100–2:56.000
每天帶給你更多精彩AI諮詢
0:00.000–0:01.600
蘇媽這次是真把桌子掀了
蘇媽這次是真把桌子掀了
0:01.600–0:03.320
就在AI硬件圈都以為
就在AI硬件圈都以為
0:03.320–0:05.260
嚴肅大模型必須繼續住在雲端
嚴肅大模型必須繼續住在雲端
0:05.260–0:06.280
住在數據中心
住在數據中心
0:06.280–0:07.620
住在英偉達機櫃裏的時候
住在英偉達機櫃裏的時候
0:07.620–0:09.200
AMD直接端出來一個
AMD直接端出來一個
0:09.200–0:10.620
午餐盒大小的小主機
午餐盒大小的小主機
0:10.620–0:12.740
外網有人把這事説得特別狠
外網有人把這事説得特別狠
0:12.740–0:14.680
AMD用一台小盒子
AMD用一台小盒子
0:14.680–0:16.380
打穿了英偉達4000美元級別
打穿了英偉達4000美元級別
0:16.380–0:17.760
桌面AI超算的想象空間
桌面AI超算的想象空間
0:17.760–0:19.020
一開始我也以為
一開始我也以為
0:19.020–0:20.700
這只是又一次常規升級
這只是又一次常規升級
0:20.700–0:24.380
新APU 新核顯 新跑分 新AIPC
新APU 新核顯 新跑分 新AIPC
0:24.380–0:25.800
這些東西我們都見過了
這些東西我們都見過了
0:25.800–0:27.280
但是當我看到兩個數字的時候
但是當我看到兩個數字的時候
0:27.280–0:28.220
我愣了一下
我愣了一下
0:28.220–0:29.960
128GB統一內存
128GB統一內存
0:29.960–0:31.820
235B級別大模型
235B級別大模型
0:31.820–0:32.580
本地運行
本地運行
0:32.580–0:33.920
這兩個數字放在一起
這兩個數字放在一起
0:33.920–0:35.660
才是這件事真正炸的地方
才是這件事真正炸的地方
0:35.660–0:36.760
過去這麼多年
過去這麼多年
0:36.760–0:38.300
桌面AI有一條默認規則
桌面AI有一條默認規則
0:38.300–0:39.960
小模型可以在本地玩一玩
小模型可以在本地玩一玩
0:39.960–0:41.680
真大模型必須上雲
真大模型必須上雲
0:41.680–0:42.160
為什麼
為什麼
0:42.160–0:43.960
因為本地電腦有一堵牆
因為本地電腦有一堵牆
0:43.960–0:44.860
叫顯存
叫顯存
0:44.860–0:47.760
RTX4090 24GB顯存
RTX4090 24GB顯存
0:47.760–0:50.700
RTX5090 32GB顯存
RTX5090 32GB顯存
0:50.700–0:52.100
聽起來已經很豪華了
聽起來已經很豪華了
0:52.100–0:53.340
但在大模型面前
但在大模型面前
0:53.340–0:55.180
這點顯存就像你拿一個飯盒
這點顯存就像你拿一個飯盒
0:55.180–0:56.460
想裝下一整鍋湯
想裝下一整鍋湯
0:56.460–0:57.700
裝不進去
裝不進去
0:57.700–0:58.940
後面算力再強
後面算力再強
0:58.940–0:59.940
軟件再漂亮
軟件再漂亮
0:59.940–1:00.800
都是廢話
都是廢話
1:00.800–1:03.040
所以過去普通人要用大模型
所以過去普通人要用大模型
1:03.040–1:04.200
基本只有一條路
基本只有一條路
1:04.200–1:05.560
租別人的服務器
租別人的服務器
1:05.560–1:06.780
用別人的雲
用別人的雲
1:06.780–1:08.400
交別人的訂閲費
交別人的訂閲費
1:08.400–1:10.060
把自己的數據
把自己的數據
1:10.060–1:11.560
發到別人的機器上
發到別人的機器上
1:11.560–1:13.420
但AMD這次最狠的地方
但AMD這次最狠的地方
1:13.420–1:15.360
就是把這條規則撕開了一道口子
就是把這條規則撕開了一道口子
1:15.360–1:17.400
這顆芯片叫Ryzen AI Max
這顆芯片叫Ryzen AI Max
1:17.400–1:18.400
加395
加395
1:18.400–1:19.480
名字你不用記
名字你不用記
1:19.480–1:21.340
你只要記住它最關鍵的一招
你只要記住它最關鍵的一招
1:21.340–1:23.700
CPU和GPU共享同一大石內存
CPU和GPU共享同一大石內存
1:23.700–1:24.820
翻譯一下就是
翻譯一下就是
1:24.820–1:26.540
以前CPU有CPU的飯碗
以前CPU有CPU的飯碗
1:26.540–1:27.720
GPU有GPU的飯碗
GPU有GPU的飯碗
1:27.720–1:28.800
大家各吃各的
大家各吃各的
1:28.800–1:29.780
顯卡玩小
顯卡玩小
1:29.780–1:30.860
大模型就吃不下
大模型就吃不下
1:30.860–1:32.740
但現在AMD直接做了一個大鍋
但現在AMD直接做了一個大鍋
1:32.740–1:34.860
CPU GPU都從這口鍋裏要飯
CPU GPU都從這口鍋裏要飯
1:34.860–1:36.480
這128GB統一內存
這128GB統一內存
1:36.480–1:37.280
最關鍵的意義
最關鍵的意義
1:37.280–1:38.140
不是參數好看
不是參數好看
1:38.140–1:39.480
而是它讓本地大模型
而是它讓本地大模型
1:39.480–1:40.820
第一次有了裝得下的可能
第一次有了裝得下的可能
1:40.820–1:42.340
這才是桌面AI的命門
這才是桌面AI的命門
1:42.340–1:43.400
不是先問快不快
不是先問快不快
1:43.400–1:44.940
而是先問裝不裝得下
而是先問裝不裝得下
1:44.940–1:45.620
裝不下
裝不下
1:45.620–1:46.860
一切都沒開始
一切都沒開始
1:46.860–1:48.940
裝得下才有資格談推理速度
裝得下才有資格談推理速度
1:48.940–1:50.440
隱私成本和工作流
隱私成本和工作流
1:50.440–1:51.500
更狠的是
更狠的是
1:51.500–1:52.900
這東西已經不是PPT了
這東西已經不是PPT了
1:52.900–1:54.720
GMKTEC這種迷你主機
GMKTEC這種迷你主機
1:54.720–1:56.220
已經把Ryzen AI Max
已經把Ryzen AI Max
1:56.220–1:56.920
加395
加395
1:56.920–1:57.820
做進了小盒子裏
做進了小盒子裏
1:57.820–1:59.420
官方頁面甚至直接寫着
官方頁面甚至直接寫着
1:59.420–2:01.060
128集字節版本
128集字節版本
2:01.060–2:02.460
可以本地跑Q-1-3
可以本地跑Q-1-3
2:02.460–2:03.860
235B級別模型
235B級別模型
2:04.860–2:05.860
是什麼概念
是什麼概念
2:05.860–2:07.860
你原來以為200B級別的大模型
你原來以為200B級別的大模型
2:07.860–2:09.140
是機房裏的東西
是機房裏的東西
2:09.140–2:10.420
是服務器裏的東西
是服務器裏的東西
2:10.420–2:11.460
是雲廠商背後
是雲廠商背後
2:11.460–2:12.900
一排排機櫃裏的東西
一排排機櫃裏的東西
2:12.900–2:13.660
結果現在
結果現在
2:13.660–2:14.540
它被塞進了一個
它被塞進了一個
2:14.540–2:16.260
可以放在桌面上的小盒子裏
可以放在桌面上的小盒子裏
2:16.260–2:16.900
這一下
這一下
2:16.900–2:17.980
整個故事就變了
整個故事就變了
2:17.980–2:19.340
因為AMD不是在告訴你
因為AMD不是在告訴你
2:19.340–2:20.940
我的核顯又強了一點
我的核顯又強了一點
2:20.940–2:22.140
它真正想説的是
它真正想説的是
2:22.140–2:24.060
嚴肅AI不一定永遠只能租
嚴肅AI不一定永遠只能租
2:24.060–2:25.380
它也可以被買回家
它也可以被買回家
2:25.380–2:26.460
這就很刺激了
這就很刺激了
2:26.460–2:28.380
你看英偉達過去幾年怎麼講AI
你看英偉達過去幾年怎麼講AI
2:28.380–2:29.300
很清楚
很清楚
2:29.300–2:30.100
你要做AI
你要做AI
2:30.100–2:31.100
就進我的生態
就進我的生態
2:31.100–2:32.100
用我的GPU
用我的GPU
2:32.100–2:33.100
用我的軟件站
用我的軟件站
2:33.100–2:34.500
用我的數據中心方案
用我的數據中心方案
2:34.500–2:35.620
從訓練到推理
從訓練到推理
2:35.620–2:36.700
從企業到開發者
從企業到開發者
2:36.700–2:38.980
整個AI世界最好都圍着英偉達轉
整個AI世界最好都圍着英偉達轉
2:38.980–2:40.900
而AMD這台小盒子的方向是
而AMD這台小盒子的方向是
2:40.900–2:42.780
我不跟你在機櫃里正面硬鋼
我不跟你在機櫃里正面硬鋼
2:42.780–2:44.780
我先把本地AI的門檻打下來
我先把本地AI的門檻打下來
2:44.780–2:45.740
讓開發者
讓開發者
2:45.740–2:46.460
小團隊
小團隊
2:46.460–2:47.180
創業者
創業者
2:47.180–2:47.780
律師
律師
2:47.780–2:48.660
公司辦公室
公司辦公室
2:48.660–2:50.860
也能開始擁有自己的AI工作台
也能開始擁有自己的AI工作台
2:50.860–2:52.940
這才是蘇媽這次最狠的地方
這才是蘇媽這次最狠的地方
2:52.940–2:53.540
我是大寶
我是大寶
2:53.540–2:54.100
關注我
關注我
2:54.100–2:56.000
每天帶給你更多精彩AI諮詢
每天帶給你更多精彩AI諮詢

影片筆記:苏妈掀桌!AMD小主机 跑235B大模型

一句話總結

AMD 推出搭載 Ryzen AI Max+ 395 芯片的迷你主機(如 GMKTEC 品牌),透過 128GB 統一內存 架構讓 CPU 與 GPU 共享記憶體,成功在本地桌面設備上運行 235B 參數量級 的大模型,挑戰了「大型語言模型必須依賴雲端數據中心」的傳統認知,並試圖打破英偉達在桌面 AI 領域的生態封閉性。

核心重點

  1. 打破顯存牆(Memory Wall)
  • 傳統桌面 AI 的瓶頸在於顯存不足(如 RTX 4090 僅 24GB,RTX 5090 僅 32GB),導致大模型無法在本地運行,必須依賴雲端服務器。
  • AMD 的解決方案是提供 128GB 統一內存,讓 CPU 和 GPU 可以共享同一個大容量記憶體池,解決了「裝得下」的問題。
  1. 本地運行大模型的可行性
  • 官方宣稱該架構可在本地運行 235B 參數量級的大模型(逐字稿提及「Q-1-3」格式)。
  • 這標誌著 200B 級別模型從「機房/服務器」移至「桌面小盒子」,實現了從「租用服務」到「本地擁有」的轉變。
  1. AMD 與英偉達的戰略對比
  • 英偉達策略:建立生態封閉性,從訓練到推理,要求用戶使用其 GPU、軟件棧及數據中心方案,圍繞英偉達轉。
  • AMD 策略:降低本地 AI 門檻,目標受眾為開發者、小團隊、創業者、律師及公司辦公室,讓用戶擁有自己的 AI 工作台,而非正面硬剛機櫃市場。
  1. 市場定位與影響
  • 打破「嚴肅大模型必須運行在雲端、數據中心及英偉達機櫃中」的認知。
  • 被視為將 AI 從「租用服務」轉向「本地擁有」的關鍵轉折,降低了開發者、小團隊及個人用戶使用嚴肅 AI 的門檻。
  • 提及該產品打穿了「4000 美元級別桌面 AI 超算」的想象空間。

詳細大綱

一、 市場背景與衝突

  • 傳統認知:嚴肅大模型必須運行在雲端、數據中心及英偉達(NVIDIA)機櫃中。
  • AMD 的行動:推出午餐盒大小的小主機,挑戰英偉達在桌面 AI 超算領域的定價與想象空間。

二、 技術瓶頸與突破

  • 過去的限制(顯存牆)
  • 桌面 AI 默認規則:小模型可在本地運行,大模型必須上雲。
  • 原因:本地顯存不足(如 RTX 4090 僅 24GB,RTX 5090 僅 32GB)。
  • 比喻:顯存小如飯盒,無法裝下大模型這整鍋湯。
  • 後果:普通人需租用服務器、使用雲端服務、支付訂閱費,並將數據發送至他人機器。
  • AMD 的解決方案
  • 核心技術:CPU 和 GPU 共享同一大容量內存(統一內存架構)。
  • 比喻:從「各吃各的飯碗」轉變為「從一口大鍋裏要飯」。
  • 關鍵意義:128GB 統一內存讓本地大模型第一次有了「裝得下」的可能。
  • 核心邏輯:先問「裝不裝得下」,再談推理速度、隱私成本和工作流。

三、 產品落地與實際應用

  • 硬體實現:GMKTEC 等迷你主機廠商已將 Ryzen AI Max+ 395 集成至小盒子中。
  • 官方宣稱:128GB 字節版本可本地運行 Q-1-3 235B 級別模型。
  • 概念轉變
  • 200B 級別模型從「機房/服務器/雲廠商機櫃」移至「桌面小盒子」。
  • 從「我的核顯又強一點」轉向「嚴肅 AI 不一定永遠只能租,也可以被買回家」。

四、 戰略對比:AMD vs. 英偉達

  • 英偉達策略
  • 建立生態封閉性:要求用戶進入其生態,使用其 GPU、軟件棧及數據中心方案。
  • 範圍:從訓練到推理,從企業到開發者,圍繞英偉達轉。
  • AMD 策略
  • 降低本地 AI 門檻。
  • 目標受眾:開發者、小團隊、創業者、律師、公司辦公室。
  • 願景:讓用戶擁有自己的 AI 工作台,而非正面硬剛機櫃市場。

工具 / 模型 / 名詞整理

  • 芯片/處理器
  • Ryzen AI Max+ 395(逐字稿中多次寫作「Ryzen AI Max 加395」或「Ryzen AI Max 加 395」)
  • APU
  • 核顯
  • 顯卡型號
  • RTX 4090(提及 24GB 顯存)
  • RTX 5090(提及 32GB 顯存)
  • 硬體品牌/產品
  • GMKTEC(迷你主機品牌)
  • 午餐盒大小的小主機 / 小盒子
  • 模型參數級別
  • 235B 級別大模型
  • 200B 級別大模型
  • Q-1-3(疑點,見下文)
  • 競爭對手/生態
  • 英偉達(NVIDIA)
  • 雲端 / 數據中心 / 服務器

操作流程整理

  1. 硬體準備:使用搭載 Ryzen AI Max+ 395 芯片的迷你主機(如 GMKTEC 品牌)。
  2. 記憶體配置:確保設備具備 128GB 統一內存,使 CPU 與 GPU 能夠共享記憶體資源。
  3. 模型加載:將 235B 參數量級的大模型(逐字稿提及格式為 Q-1-3)加載至本地設備。
  4. 本地推理:在桌面環境下直接運行大模型,無需將數據發送至上雲服務器。
  5. 應用場景:開發者、小團隊、律師或辦公室用戶利用該本地 AI 工作台進行工作。

值得注意的限制或風險

  • 推理速度與性能:影片指出在解決「裝得下」的問題後,仍需關注推理速度、隱私成本和工作流等實際應用問題。
  • 生態封閉性挑戰:英偉達建立的生態封閉性(從訓練到推理的軟件棧)對 AMD 的本地化方案構成競爭壓力。
  • 具體規格模糊:對於模型運行的具體量化格式(如「Q-1-3」)及記憶體單位(如「128集字節」)的表述存在聽寫或口語上的模糊,可能影響對技術細節的精確理解。

逐字稿辨識疑點

  • 「Q-1-3」
  • 來源:逐字稿中提及「官方頁面甚至直接寫着 128集字節版本 可以本地跑Q-1-3 235B級別模型」。
  • 註釋:此處聽寫或口語表達極為模糊,可能是指某種量化格式(如 Q4、Q5、Q8 等)或特定模型名稱,但逐字稿記錄為「Q-1-3」,無法確定具體指代何種模型或量化技術,僅保留原樣。
  • 「128集字節」
  • 來源:逐字稿中寫作「128集字節版本」。
  • 註釋:應為「128GB 字節」或「128GB 記憶體」的口誤或聽寫錯誤,但依規則僅標記為疑點,不自行更正為 GB。
  • 「Ryzen AI Max 加395」
  • 來源:逐字稿中多次出現「加395」或「加 395」。
  • 註釋:可能為「+395」或特定型號編號的口語表達,依規則保留原樣,不確認是否為正式型號名稱。
  • 「打穿了英偉達4000美元級別桌面AI超算的想象空間」
  • 來源:逐字稿中提及此說法。
  • 註釋:此處為外網評論的轉述,具體「4000美元級別」的定義及「打穿」的具體技術指標在逐字稿中未進一步展開,僅作為觀點記錄。

可延伸追問

  • 在本地運行 235B 模型時,實際的推理速度(Tokens per second)表現如何?是否滿足實時交互需求?
  • 「Q-1-3」具體對應哪種量化技術或模型架構?對模型精確度有何影響?
  • 與雲端推理相比,本地運行在隱私保護、數據傳輸成本及長期擁有成本(TCO)上的具體優勢數據為何?
  • GMKTEC 等廠商推出的具體產品型號及售價是多少?是否真的低於 4000 美元?
  • 該統一內存架構在處理多任務或複雜工作流時,CPU 與 GPU 之間的資源調度機制是如何運作的?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習