0:00.100–0:06.570
zh一台8G字节内存的MacBook 居然能跑26B级别的大模型
0:06.570–0:08.578
zh这件事听起来很反常
0:08.578–0:13.709
zh过去谈本地AI 大家第一反应都是显存不够 内存不够
0:13.709–0:17.725
zh电脑风扇起飞 模型还没加载完 系统先卡死
0:17.725–0:20.000
zh26B参数这种模型
0:20.000–0:24.578
zh正常想象里至少要一台很贵的机器 或者干脆丢到云端GPU上跑
0:24.578–0:28.338
zh可是最近一个叫Turbo fillfair的项目
0:28.338–0:34.552
zh把Google Gemma 426B a四b 跑到了apple Silicon Mac上
0:34.552–0:39.066
zh而且运行时权重加4K KV CACHE只占大约二级字节内存
0:39.066–0:42.685
zh这个数字最狠的地方 不是省了一点内存
0:42.685–0:46.517
zh而是把本地AI的门槛 直接往下砸了一层
0:46.517–0:52.052
zh原本14.3GB左右的模型安装体积 不需要整包塞进内存
0:52.052–0:58.066
zh项目只把常驻核心留在内存里 把大部分专家权重放在SSD上
0:58.066–0:59.899
zh需要哪一块再读哪一块
0:59.899–1:03.933
zh视频里在M3Max上跑到23.4tokens
1:03.933–1:12.183
zh项目readme里也记录了8GBM二Macbook air 可以跑到5.1-6.3tokens
1:12.183–1:15.666
zh这个速度不是数据中心级别 但已经不是玩具
1:15.666–1:17.333
zh这件事真正值得看
1:17.333–1:20.846
zh不是某个开发者做了一个炫技项目
1:20.846–1:23.890
zh而是本地AI的路线开始变了
1:23.890–1:28.809
zh过去本地大模型的思路很简单 模型越大 硬件越贵
1:28.809–1:35.733
zh想跑7B准备一块不错的消费级显卡 想跑30B开始考虑大显存
1:35.733–1:38.909
zh想跑更大的moe 就看云服务账单
1:38.909–1:43.992
zh用户被迫接受一个隐含规则 AI越聪明越远离个人电脑
1:43.992–1:49.074
zh越强的模型越集中在云厂商 GPU集群和数据中心手里
1:49.074–1:54.166
zhTurbo fuel fair给出的反方向答案是
1:54.166–1:58.201
zh模型可以很大 但每一秒真正用到的部分可能很小
1:58.201–2:04.734
zh这要从Moe讲起 Moe叫mixture of experts 混合专家模型
2:04.734–2:11.074
zh普通模型像一个巨大的统一车间 每个TOKEN进来 很多权重都要参与计算
2:11.074–2:14.600
zhMoe更像一座有128个小工位的工厂
2:14.600–2:20.318
zh每个TOKEN进来 Router会判断这次该找 哪几个专家处理
2:20.318–2:23.473
zh编码是26B a4b 总参数是26B
2:23.473–2:28.008
zh但每个TOKEN实际激活 的大约是3.88B参数
2:28.008–2:32.542
zh模型名义上很大 但每一步真正干活 的只是其中一部分
2:32.542–2:36.266
zh过去这件事的好处主要体现在云端
2:36.266–2:40.772
zh模型公司可以用更大的总参数 保持相对可控的推理成本
2:40.772–2:46.030
zh可是Turbo Fillfair把这个 特性拿到了本地机器上
2:46.030–2:51.663
zh既然每个TOKEN只用几个专家 那为什么要把所有专家都常驻内存
2:51.663–2:56.966
zh于是他把模型拆成两堆 第一堆是每个TOKEN都要用的东西
2:56.966–3:05.785
zh比如attention router embedding shared expert 还有KV CACHE
3:05.785–3:10.851
zh这一部分大约1.35吉字节 加上运行需要的缓存 留在内存里
3:10.851–3:15.333
zh第二堆是专家权重 30层 每层128个expert
3:15.333–3:19.091
zh每个expert只有几MB 加起来是主要体积
3:19.091–3:21.776
zh这一堆不常驻内存 只放在SSD上
3:21.776–3:29.650
zh每生成一个TOKEN 模型先完成attention 再由router决定当前层要用哪8个专家
3:29.650–3:33.900
zhCPU接到名单之后 去SSD读取对应expert
3:33.900–3:38.293
zh放到GPU能看到的内存区域里 metal接着算
3:38.293–3:43.284
zh这个过程听起来麻烦 但关键在apple Silicon
3:43.284–3:47.477
zh传统PC上 CPU和独立GPU通常分两套内存
3:47.477–3:53.966
zhSSD读出来的数据先进系统内存 再通过Pcie总线搬到显卡VRAM
3:53.966–3:59.480
zh模型如果每个TOKEN都 要频繁从SSD拉权重 再搬进VRAM
3:59.480–4:02.902
zh中间的拷贝和总线 延迟会直接把速度打穿
4:02.902–4:06.134
zh数据不是不会动 而是动得太慢 动得太贵
4:06.134–4:11.268
zhapple Silicon的统一内存 架构把这个问题变小了
4:11.268–4:14.700
zhCPU和GPU看的是同一块物理内存
4:14.700–4:21.603
zhCPU从SSD读进来的数据可以 直接成为GPU要用的metal buffer
4:21.603–4:27.930
zh少了一次拷贝 少了一段总线搬运 也少了传统独显架构 里最难受的VRAM墙
4:27.930–4:31.190
zh这就是为什么这个 项目特别像一把钥匙
4:31.190–4:34.266
zh它不是证明苹果芯片算力天下无敌
4:34.266–4:41.025
zh而是证明apple Silicon的结构刚好适合 一种边读边算的本地推理路线
4:41.025–4:47.597
zh还不止这个 Turbo fieldfare没有把磁盘上 的权重用普通格式存着
4:47.597–4:51.164
zh等读取之后再解包 再转成GPU需要的布局
4:51.164–4:55.330
zh它在安装阶段就把 模型重新打包成Dubo格式
4:55.330–5:01.274
zh尽量让磁盘里的数据就是 metal kernel可以消费的样子
5:01.274–5:07.217
zh读文件就是加载权重 中间少一次转换就少 一次内存浪费和时间浪费
5:07.217–5:13.766
zh它还用了缓存 每一层128个expert 不可能每次都从SSD读
5:13.766–5:19.520
zh项目给每层留了16个expert 常位常用的expert放在内存里
5:19.520–5:24.195
zhrouter如果选中已经缓存的expert 立刻就能用
5:24.195–5:27.791
zh如果没命中 再从SSD读取 把不常用的挤出去
5:27.791–5:32.766
zh它用的是LFU least frequently used
5:32.766–5:38.255
zh也就是踢掉使用频率最低的专家 而不是简单踢掉最久没用的
5:38.255–5:42.900
zh这个选择很重要 因为moe的路由并不是完全随机
5:42.900–5:48.811
zh有些专家在很多TOKEN 上都会被反复选中 有些专家很少出现
5:48.811–5:52.400
zh按频率留下热门专家 比按时间留下最近
5:52.400–5:54.517
zh专家更适合这个任务
5:54.517–5:56.399
zh项目押注的是语言
5:56.399–5:58.751
zh生成的专家选择有规律
5:58.751–6:00.398
zh只要规律足够强
6:00.398–6:03.456
zhSSD读取就不会把速度拖死
6:03.456–6:06.749
zh所以它能做到一个很奇怪的效果
6:06.749–6:10.277
zh明明模型大部分权重还在SSD上
6:10.277–6:13.133
zh实际体验却没有慢到不能用
6:13.133–6:16.054
zh这件事对普通用户意味着什么
6:16.054–6:19.424
zh第一本地AI不一定只能靠堆硬件
6:19.424–6:21.896
zh过去用户想跑更好的模型
6:21.896–6:23.693
zh唯一办法是买更大
6:23.693–6:25.940
zh内存更大显存更贵显卡
6:25.940–6:28.187
zh这个逻辑会把个人电脑
6:28.187–6:30.210
zh推向数据中心的反面
6:30.210–6:31.333
zh云越来越强
6:31.333–6:33.372
zh个人设备越来越像终端
6:33.372–6:37.858
zhTurbo field fair展示的是另一条路
6:37.858–6:40.713
zh如果模型结构文件布局操作系统
6:40.713–6:43.771
zh芯片内存架构和运行时配合得足够
6:43.771–6:43.975
zh好
6:43.975–6:47.034
zh小机器也能吃下一部分大模型能力
6:47.034–6:48.461
zh它不是免费午餐
6:48.461–6:50.866
zhSSD读取有延迟模型
6:50.866–6:52.288
zh限制在特定结构
6:52.288–6:54.727
zh速度和云端旗舰模型没法比
6:54.727–6:56.555
zh但它证明了一个方向
6:56.555–6:59.603
zh优化路线不是只剩买更贵的GPU
6:59.603–7:04.683
zh第二 apple Silicon的AI价值可能被低估了
7:04.683–7:06.309
zh过去评价AI硬件
7:06.309–7:08.137
zh大家喜欢看TOPS
7:08.137–7:10.133
zh看GPU看显存大小
7:10.133–7:12.503
zh苹果在这场叙事里经常显得尴尬
7:12.503–7:15.213
zh它的neural engine很强
7:15.213–7:17.075
zh但开发生态不如CUDA
7:17.075–7:18.260
zh统一内存很漂亮
7:18.260–7:19.784
zh但高配内存价格很贵
7:19.784–7:21.647
zhMac很适合创作和开发
7:21.647–7:23.001
zh但说到本地大模型
7:23.001–7:25.372
zh很多人还是先想到Nvidia
7:25.372–7:29.400
zhTurbo field fair把问题换了一个角度
7:29.400–7:32.655
zh苹果真正的优势不一定是单点算力
7:32.655–7:38.515
zh而是CPU GPU内存SSD metal和系统API的整合
7:38.515–7:41.120
zh只要工作负载设计的够贴合
7:41.120–7:44.158
zh它可以用更少的数据搬运换性能
7:44.158–7:45.895
zh这和手机时代很像
7:45.895–7:49.300
zh苹果不一定每个硬件参数都最大
7:49.300–7:51.374
zh但它能把芯片系统
7:51.374–7:53.707
zh应用和框架整在一起
7:53.707–7:56.559
zh让开发者吃到一体化红利
7:56.559–7:59.670
zh本地AI也可能走类似路线
7:59.670–8:02.781
zh不是每个人都需要训练模型
8:02.781–8:06.670
zh但很多人需要在个人设备上跑推理
8:06.670–8:10.300
zh写作翻译代码补全文件整理私人
8:10.300–8:13.585
zh知识库离线助手隐私敏感的资料
8:13.585–8:14.054
zh分析
8:14.054–8:17.808
zh如果这些场景能在普通Mac上运行
8:17.808–8:19.685
zh苹果就不是旁观者
8:19.685–8:22.970
zh第三云端AI的垄断感会被削弱
8:22.970–8:26.020
zh过去AI服务天然集中在云端
8:26.020–8:27.428
zh因为模型太大
8:27.428–8:28.466
zh推理太贵
8:28.466–8:29.985
zh用户设备跑不动
8:29.985–8:32.590
zh集中在云端就带来几个问题
8:32.590–8:33.675
zh数据要上传
8:33.675–8:34.978
zh隐私要交出去
8:34.978–8:36.497
zh订阅费要长期付
8:36.497–8:38.234
zh网络断了就没法用
8:38.234–8:39.753
zh模型公司改规则
8:39.753–8:41.055
zh用户只能接受
8:41.055–8:43.226
zh本地AI如果慢慢可用
8:43.226–8:44.962
zh用户会多一个选择
8:44.962–8:47.300
zh不是所有任务都要上云
8:47.300–8:50.017
zh私人笔记公司内部文档离线
8:50.017–8:52.960
zh代码助手本地搜索个人自动化
8:52.960–8:56.357
zh这些场景其实很适合在设备端完成
8:56.357–8:58.168
zh云端负责最强模型
8:58.168–8:59.979
zh本地负责高频隐私
8:59.979–9:01.791
zh低成本和及时响应
9:01.791–9:03.602
zh这会改变产品形态
9:03.602–9:05.866
zh未来AI助手可能不是
9:05.866–9:07.909
zh一个纯云端聊天窗口
9:07.909–9:09.725
zh而是一套混合系统
9:09.725–9:11.541
zh简单任务本地完成
9:11.541–9:13.130
zh复杂任务再上云
9:13.130–9:14.946
zh敏感文件本地分析
9:14.946–9:16.761
zh公开资料云端补充
9:16.761–9:18.804
zh离线场景用本地模型
9:18.804–9:20.620
zh联网场景用大模型
9:20.620–9:22.890
zh用户感觉不到背后切换
9:22.890–9:24.933
zh只知道电脑更聪明了
9:24.933–9:27.158
zh这也是苹果真正想要的方向
9:27.158–9:29.197
zh苹果不会轻易把用户数据
9:29.197–9:31.050
zh全部交给第三方云模型
9:31.050–9:32.348
zh他更喜欢把智能
9:32.348–9:34.016
zh功能藏进设备和系统
9:34.016–9:38.095
zhapple intelligence的战略一直
9:38.095–9:40.319
zh强调设备端处理和隐私边界
9:40.319–9:43.133
zh问题在于设备端模型能力如果太弱
9:43.133–9:45.116
zh体验就会被云端模型拉开
9:45.116–9:47.640
enTurbo field fair
9:47.640–9:49.442
zh这种项目说明设备端的
9:49.442–9:51.605
zh能力上限还有很多工程空间
9:51.605–9:53.588
zh这里要把苹果的处境讲透
9:53.588–9:54.850
zhAI这轮浪潮里
9:54.850–9:56.472
zh苹果一直显得慢半拍
9:56.472–9:58.636
zhOpenai抢走聊天入口
9:58.636–10:01.866
zhGoogle抢搜索和Android
10:01.866–10:07.009
zhMicrosoft把copilot塞进Windows和office
10:07.009–10:08.879
zhNVIDIA拿走算力叙事
10:08.879–10:12.464
zh苹果虽然发布apple intelligence
10:12.464–10:14.178
zh但市场反应一直不算兴奋
10:14.178–10:14.957
zh原因很简单
10:14.957–10:16.671
zh苹果不是靠开放API和
10:16.671–10:17.918
zh云模型赚钱的公司
10:17.918–10:20.133
zh它擅长的是把能力变成系统体验
10:20.133–10:21.467
zh可大模型初期最
10:21.467–10:23.181
zh耀眼的能力都在云端
10:23.181–10:25.277
zh苹果的优势一时很难展示
10:25.277–10:29.659
zhTurbo field day这类项目的意义就在于
10:29.659–10:31.755
zh它让苹果的优势重新有用
10:31.755–10:33.660
zh如果AI的未来只是谁
10:33.660–10:34.994
zh有最大数据中心
10:34.994–10:36.518
zh苹果确实不占主场
10:36.518–10:39.800
zh它没有Nvidia那种GPU生态
10:39.800–10:42.963
zh也没有Microsoft Azure或
10:42.963–10:45.775
zhGoogle cloud那种云入口
10:45.775–10:47.532
zh但如果未来一部分AI
10:47.532–10:48.938
zh工作要回到设备端
10:48.938–10:50.695
zh苹果手里的筹码就多了
10:50.695–10:51.750
zh它有统一内存
10:51.750–10:53.683
zh有自研芯片有metal
10:53.683–10:55.264
zh有强控制的操作系统
10:55.264–10:56.494
zh有高端用户设备
10:56.494–10:57.900
zh也有一群愿意花钱
10:57.900–10:59.662
zh买稳定体验的用户
10:59.662–11:02.967
zh这件事最适合用一个普通场景理解
11:02.967–11:04.950
zh一个用户坐在飞机上
11:04.950–11:05.831
zh没有网路
11:05.831–11:09.135
zh想让电脑整理本地笔记总结PDF
11:09.135–11:10.457
zh查找项目文档
11:10.457–11:12.219
zh生成一段邮件草稿
11:12.219–11:14.643
zh如果所有AI都依赖云端
11:14.643–11:17.100
zh这些任务马上变成半残废
11:17.100–11:19.680
zh可是如果Mac本地能跑
11:19.680–11:21.322
zh一个够用的模型
11:21.322–11:23.433
zh很多事情就能直接做
11:23.433–11:25.075
zh速度不一定顶级
11:25.075–11:26.716
zh能力不一定最强
11:26.716–11:29.062
zh但它能离线私密低延迟
11:29.062–11:32.111
zh而且不需要每次把资料传出去
11:32.111–11:33.753
zh对企业也是一样
11:33.753–11:36.566
zh很多公司不是不想用AI
11:36.566–11:38.180
zh而是不敢把内部
11:38.180–11:40.716
zh资料全部丢给外部API
11:40.716–11:42.790
zh法律合同源代码客户
11:42.790–11:45.096
zh数据医疗资料财务表格
11:45.096–11:46.940
zh这些内容一旦上传
11:46.940–11:49.015
zh就牵涉权限审计地区
11:49.015–11:51.089
zh合规和数据泄露风险
11:51.089–11:53.395
zh如果本地或私有设备端
11:53.395–11:55.700
zh模型能处理一部分任务
11:55.900–11:58.618
zh企业的AI使用门槛会下降
11:58.618–12:02.242
zh它不需要替代GPT5这种旗舰模型
12:02.242–12:05.414
zh只要把70%的日常任务吃下来
12:05.414–12:06.999
zh价值就已经很大
12:06.999–12:11.756
zh这也是为什么二级字节 内存这个数字有流量潜力
12:11.756–12:14.474
zh它让观众立刻听懂一个变化
12:14.474–12:17.100
zhAI不再只属于云端巨头
12:17.100–12:19.925
zh哪怕这个结论现在还不能完全成立
12:19.925–12:21.620
zh它已经打开想象空间
12:21.620–12:23.315
zh但这件事不能吹过头
12:23.315–12:27.081
zhTurbo field fair不是通用魔法
12:27.081–12:31.413
zh它目前主要针对Gemma 426BA 4B文本推理
12:31.413–12:33.108
zh不支持图像音频视频
12:33.108–12:36.000
zh也不是一个完整的agent系统
12:36.000–12:38.412
zh项目readme也写得很清楚
12:38.412–12:40.997
zh它是model specific
12:40.997–12:44.616
zh不是MLX或LLAMA CPP那种通用包装器
12:44.616–12:46.167
zh换模型不一定能照搬
12:46.167–12:47.718
zh换硬件也不一定成立
12:47.718–12:50.303
zh它需要apple Silicon
12:50.303–12:54.300
zh需要macos 26 metal 4 Swift 6.2
12:54.300–12:56.950
zh还需要足够的SSD空间
12:56.950–12:59.118
zh它还有一个限时限制
12:59.118–13:00.805
zhSSD不是内存
13:00.805–13:03.695
zhSSD再快也比内存慢得多
13:03.695–13:06.345
zh频繁读取权重会带来延迟
13:06.345–13:09.236
zh也可能增加能耗和存储磨损
13:09.236–13:11.405
zh缓存命中率如果不好
13:11.405–13:12.609
zh速度就会掉
13:12.609–13:15.500
zh长上下文复杂提示多轮对话
13:15.500–13:17.927
zh并发请求都会挑战这套设计
13:17.927–13:22.376
zh视频里的23 tokens是M3 Max上的演示
13:22.376–13:30.264
zh8级字节MR MacBook air的5-6tokens更接近低 配用户会看到的体验
13:30.264–13:31.680
zh能用不等于丝滑
13:31.680–13:33.500
zh所以正确的判断不是
13:33.500–13:36.645
zhMacbook从此取代云GPU
13:36.645–13:39.371
zh而是本地AI的下限被抬高了
13:39.371–13:40.629
zh这已经很重要
13:40.629–13:43.565
zh还要补一个容易被忽略的成本账
13:43.565–13:45.452
zh云端AI看起来省心
13:45.452–13:47.549
zh但它的成本是持续性的
13:47.549–13:49.226
zh用户每个月付订阅
13:49.226–13:51.733
zh开发者按TOKEN付费
13:51.733–13:54.286
zh企业按席位和调用量付钱
13:54.286–13:56.142
zh用得越多 账单越高
13:56.142–13:58.927
zh本地AI的成本更像买设备
13:58.927–14:00.783
zh前期花钱买Mac
14:00.783–14:03.104
zh后面用本地算力跑任务
14:03.104–14:07.513
zh对高频任务来说 本地推理会越来越有吸引力
14:07.513–14:10.166
zh当然本地也不是不要成本
14:10.166–14:12.167
zh它吃电吃存储吃内存
14:12.167–14:14.168
zh也吃开发者优化时间
14:14.168–14:18.171
zh可它的账单不再完全 掌握在模型公司手里
14:18.171–14:23.285
zh用户买了机器之后 至少有一部分智能能力可以自己用
14:23.285–14:25.286
zh这种心理差异很重要
14:25.286–14:29.900
zh订阅时代 用户越来越讨厌 每个功能都按月收费
14:29.900–14:32.775
zh本地AI如果能提供够用体验
14:32.775–14:35.429
zh就会成为反订阅情绪的出口
14:35.429–14:37.199
zh这会影响应用开发
14:37.199–14:41.401
zh现在很多AI APP只是套一层云端API
14:41.401–14:44.498
zh用户输入文字 服务器转发给模型
14:44.498–14:46.267
zh再把结果显示回来
14:46.267–14:48.733
zh这种产品门槛低 替代也快
14:48.733–14:51.099
zh未来真正有壁垒的应用
14:51.099–14:57.723
zh可能会把本地模型云端模型本地 文件隐私权限系统操作结合起来
14:57.723–15:01.982
zhMac上的本地AI应用 尤其适合这么做
15:01.982–15:08.300
zh因为它能直接贴近用户的文件 日历邮件代码仓库和创作软件
15:08.300–15:11.919
zh这样一来 竞争重点就从谁接了最强API
15:11.919–15:14.533
zh变成谁把AI放进真实工作流
15:14.533–15:19.157
zhTurbo feelfair没有解决所有产品问题
15:19.157–15:21.570
zh但它说明底层可行性在提升
15:21.570–15:24.787
zh底层每提升一点 应用层就多一批可能
15:24.787–15:27.200
zhAI行业过去几年一直在讲
15:27.200–15:29.985
zh更大模型更大集群更大融资
15:29.985–15:31.377
zh模型越来越强
15:31.377–15:33.930
zh但普通用户越来越像租客
15:33.930–15:37.411
zh账号订阅API云端限制数据上传
15:37.411–15:40.196
zh所有j能力都隔着一层平台
15:40.196–15:46.066
zhTurbo field fair 这种项目提醒了一件事
15:46.066–15:49.522
zhAI的未来不一定只有超级数据中心
15:49.522–15:52.331
zh也可以有一部分回到个人电脑
15:52.331–15:54.275
zh这对开发者也有启发
15:54.275–15:56.219
zh以后做本地AI应用
15:56.219–15:58.380
zh不能只问模型能不能跑
15:58.380–16:00.756
zh还要问模型哪部分必须跑
16:00.756–16:02.268
zh哪部分可以缓存
16:02.268–16:04.212
zh哪部分可以流式读取
16:04.212–16:08.666
zh数据在CPU GPU内存SSD之间搬了几次
16:08.666–16:11.925
zhAI应用开发会越来越像系统工程
16:11.925–16:15.183
zh谁能少搬一次数据 谁就多一点性能
16:15.183–16:18.442
zh谁能少占一点内存 谁就多一批用户
16:18.442–16:24.307
zh谁能把模型结构和硬件结构对齐 谁就能把不可能变成勉强可用
16:24.307–16:28.133
zh这也是苹果生态里 可能出现机会的地方
16:28.133–16:37.995
zh如果开发者围绕metal 统一内存 neural engine 本地文件索引 Spotlight SHORTCUTS做AI工具
16:37.995–16:41.802
zhMac可能会变成一个很 独特的本地AI开发平台
16:41.802–16:43.878
zh不是为了和云端模型硬碰硬
16:43.878–16:46.666
zh而是做那些云端不适合做的任务
16:46.666–16:50.148
zh私密离线低延迟贴近个人文件系统
16:50.148–16:53.863
zh真正的竞争不是 本地和云端谁消灭谁
16:53.863–16:55.953
zh而是谁掌握默认入口
16:55.953–16:57.810
zh云端模型会继续强
16:57.810–17:01.757
zh因为训练和最强推理 都离不开巨量算力
17:01.757–17:06.700
zh可是本地模型一旦够用 就会吃掉大量日常任务
17:06.700–17:09.374
zh用户不需要每次都请最强模型
17:09.374–17:11.637
zh写一封邮件 整理会议记录
17:11.637–17:14.106
zh搜索本地文档 解释一段代码
17:14.106–17:15.546
zh生成一个小脚本
17:15.546–17:18.837
zh够快够私密够便宜 比绝对最强更重要
17:18.837–17:23.569
zh这就是Turbo fillfair事件的流量价值
17:23.569–17:27.100
zh表面看 它只是内存减少7倍的技术新闻
17:27.100–17:30.326
zh往深一层看 它在挑战一个行业共识
17:30.326–17:32.476
zh大模型必须被云端垄断
17:32.476–17:34.412
zh它没有推翻云端AI
17:34.412–17:36.132
zh但它撕开了一条缝
17:36.132–17:41.078
zh接下来要看的不是这个项目 本身能不能变成大众产品
17:41.078–17:44.304
zh而是它代表的工程路线会不会扩散
17:44.304–17:47.100
zh更多MOE模型会不会被专门
17:47.100–17:48.736
zh打包成本地流式格式
17:48.736–17:55.282
zh更多Mac应用会不会接入 本地Openai compatible Server
17:55.282–17:58.918
zhapple会不会把类似 思路放进系统级框架
17:58.918–18:03.282
zh开发者会不会开始为8级字节 16级字节设备认真优化
18:03.282–18:05.100
zh而不是默认要求64级
18:05.100–18:06.890
zh字节内存和大显卡
18:06.890–18:08.681
zh如果这些事情发生
18:08.681–18:11.143
zh本地AI就会从极客演示
18:11.143–18:12.933
zh变成产品基础设施
18:12.933–18:15.843
zh还有一个变量是模型公司本身
18:15.843–18:18.305
zh如果更多模型采用MOE
18:18.305–18:20.543
zh如果更多模型公开权重
18:20.543–18:24.066
zh如果更多小模型追上日常任务能力
18:24.066–18:26.109
zh本地推理就会更快普及
18:26.109–18:31.215
zhTurbo Fillfair依赖Gemma4这种结构
18:31.215–18:33.666
zh不代表所有模型都能这么跑
18:33.666–18:36.934
zh但AI行业已经在往稀疏激活专用小
18:36.934–18:39.589
zh模型端侧模型模型路由方向走
18:39.589–18:41.632
zh云端超级模型负责难题
18:41.632–18:43.366
zh端侧模型负责日常
18:43.366–18:45.909
zh多个模型组合起来完成任务
18:45.909–18:48.876
zh这个方向对Nvidia是提醒
18:48.876–18:50.148
zh对苹果是机会
18:50.148–18:51.843
zh对开发者是新战场
18:51.843–18:55.658
zhNVIDIA仍然会统治训练和高端推理
18:55.658–18:57.354
zh可是如果越来越多
18:57.354–18:59.049
zh日常推理回到端侧
18:59.049–19:01.169
zh市场对所有AI都必须
19:01.169–19:03.733
zh上云GPU的想象会降温
19:03.733–19:06.438
zh苹果不一定抢走数据中心的钱
19:06.438–19:09.350
zh但可以抢回个人设备的智能入口
19:09.350–19:12.055
zh开发者如果能把本地模型用好
19:12.055–19:14.968
zh就不用完全被API成本牵着走
19:14.968–19:16.424
zh观众继续听下去
19:16.424–19:18.089
zh应该带走的判断是
19:18.089–19:20.169
zh这不是一个小工具新闻
19:20.169–19:22.866
zh而是AI权力结构的小变化
19:22.866–19:24.494
zh以前能力在云端
19:24.494–19:26.122
zh用户只是调用者
19:26.122–19:29.145
zh现在一部分能力开始回到设备
19:29.145–19:31.703
zh用户重新拥有一点控制权
19:31.703–19:33.331
zh这一点现在还小
19:33.331–19:34.726
zh但方向很清楚
19:34.726–19:37.051
zh只要端侧模型继续变强
19:37.051–19:40.075
zh本地AI就会从能跑走向好用
19:40.075–19:42.533
zh再从好用走向默认存在
19:42.533–19:45.477
zh接下来还要看一个更现实的变量
19:45.477–19:46.318
zh内存配置
19:46.318–19:48.000
zh苹果这些年一直被
19:48.000–19:50.312
zh吐槽入门Mac内存太小
19:50.312–19:51.574
zh升级内存太贵
19:51.574–19:53.887
zh过去这个槽点主要影响剪
19:53.887–19:56.199
zh视频跑虚拟机开大型项目
19:56.199–19:57.881
zh到了本地AI时代
19:57.881–20:00.404
zh它会变成更核心的购买理由
20:00.404–20:01.666
zh8吉字节能跑
20:01.666–20:03.820
zh不代表8吉字节最舒服
20:03.820–20:07.482
zh16级字节会成为更合理的AI入门线
20:07.482–20:10.283
zh32级字节64级字节会变成
20:10.283–20:12.868
zh开发者和重度用户的新分界
20:12.868–20:16.745
zhTurbo field day把门槛打低
20:16.745–20:18.684
zh不代表硬件需求消失
20:18.684–20:21.900
zh而是让更多人第一次有资格进场
20:21.900–20:24.671
zh这对苹果的产品策略很微妙
20:24.671–20:28.829
zh如果本地AI真的变成Mac的重要卖点
20:28.829–20:30.907
zh苹果就会有更强理由
20:30.907–20:33.448
zh推动用户买更高内存版本
20:33.448–20:36.912
zh用户过去买内存是为了今天的软件
20:36.912–20:38.067
zh未来买内存
20:38.067–20:41.300
zh可能是为了未来几年的本地模型
20:41.466–20:43.592
zh苹果当然喜欢这个故事
20:43.592–20:46.568
zh因为它能提高Mac的平均售价
20:46.568–20:48.269
zh但用户也会更敏感
20:48.269–20:50.820
zh既然AI要在设备端跑入门
20:50.820–20:52.521
zh配置就不能太寒酸
20:52.521–20:54.860
zh苹果如果继续把内存升级
20:54.860–20:56.135
zh价格定得很高
20:56.135–20:58.687
zh反而会限制本地AI的普及
20:58.687–21:00.766
zh另一个变量是SSD
21:00.766–21:04.406
zhTurbo field fair的路线
21:04.406–21:06.761
zh把SSD从单纯存储变成
21:06.761–21:08.473
zh推理链路的一部分
21:08.473–21:10.828
zhSSD速度寿命文件布局
21:10.828–21:12.969
zh系统缓存都会影响体验
21:12.969–21:16.395
zh过去用户选电脑看SSD主要是容量
21:16.395–21:18.536
zh未来本地AI应用多了
21:18.536–21:21.733
zhSSD读写性能也会被重新关注
21:21.733–21:23.596
zh模型权重不再只是躺
21:23.596–21:25.251
zh在硬盘里的大文件
21:25.251–21:28.149
zh而是生成每个TOKEN时可能
21:28.149–21:30.218
zh被反复访问的工作材料
21:30.218–21:32.909
zh这会把电脑硬件评价体系改掉
21:32.909–21:36.013
zh过去AI电脑宣传喜欢堆TOPS
21:36.013–21:39.117
zh以后真正懂行的人会看一整套链路
21:39.117–21:40.766
zh内存带宽够不够
21:40.766–21:43.565
zhCPU和GPU是否共享内存
21:43.565–21:45.933
zhSSD读取延迟如何系统
21:45.933–21:48.517
zhAPI能不能减少拷贝模型
21:48.517–21:50.455
zh格式是不是贴合硬件
21:50.455–21:53.254
zh单看一个算力数字很容易被骗
21:53.254–21:56.053
zhAI推理的瓶颈可能不在算力
21:56.053–21:57.345
zh而在数据搬运
21:57.345–22:02.566
zh这也是Turbo fair给普通观众上的一课
22:02.566–22:05.346
zhAI不是只有模型聪不聪明
22:05.346–22:07.199
zh还有数据怎么流动
22:07.199–22:10.442
zh同一个模型放在不同硬件结构上
22:10.442–22:12.527
zh体验可能完全不一样
22:12.527–22:15.538
zh未来优秀的本地AI产品背后
22:15.538–22:18.318
zh一定不是简单下载一个模型
22:18.318–22:20.966
zh而是围绕设备做深度优化
22:20.966–22:22.652
zh最后给一个明确判断
22:22.652–22:25.275
zh苹果芯片这次赢的不是模型参数
22:25.275–22:27.898
zh也不是Benchmark排名
22:27.898–22:29.958
zh而是设备端AI的叙事权
22:29.958–22:33.518
zh过去AI叙事被NVIDIA和云厂商拿走
22:33.518–22:37.077
zh大家谈的都是GPU集群数据中心和API
22:37.077–22:40.666
enTurbo field fair
22:40.666–22:43.193
zh让另一个问题重新回到桌面
22:43.193–22:45.510
zh如果模型不必全部进内存
22:45.510–22:48.248
zh如果CPU和GPU共享内存
22:48.248–22:50.354
zh如果SSD能参与推理
22:50.354–22:53.303
zh如果应用能直接贴着硬件写本地
22:53.303–22:56.041
zh设备还能不能变成AI的主场
22:56.041–22:57.094
zh答案还没定
22:57.094–22:59.200
zh但这次Mac不再只是
22:59.200–23:00.987
zh调用云模型的屏幕
23:00.987–23:02.997
zh它开始像一台真正能
23:02.997–23:05.007
zh承载AI的个人机器
23:05.007–23:06.793
zh如果这个趋势继续
23:06.793–23:09.920
zh未来买电脑时就会多一个新问题
23:09.920–23:12.600
zh这台机器能不能把个人资料
23:12.600–23:15.057
zh工作流和本地模型连起来
23:15.057–23:17.067
zh过去电脑拼的是性能
23:17.067–23:19.866
zh后来拼的是续航和生态
23:19.866–23:22.633
zh接下来可能要拼本地智能密度
23:22.633–23:25.613
zh苹果芯片这次露出的牌就在这里
23:25.613–23:28.806
zh谁能让AI更贴近用户自己的设备
23:28.806–23:29.870
zh自己的文件
23:29.870–23:31.360
zh自己的隐私边界
23:31.360–23:33.063
zh谁就能在云端巨头
23:33.063–23:34.766
zh之外拿回一块入口
0:00.100–0:06.570
一台配備8GB記憶體(RAM)的MacBook竟然能運行26B參數級別的大型語言模型
0:06.570–0:08.578
這件事聽起來非常反常
0:08.578–0:13.709
過去談論本地AI時,大家的第一反應通常是顯存不夠、記憶體不足
0:13.709–0:17.725
電腦風扇狂轉,模型還沒加載完,系統就先當機了
0:17.725–0:20.000
像26B參數這種模型
0:20.000–0:24.578
在正常想像中,至少需要一台很昂貴的機器,或者乾脆丟到雲端GPU上去運行
0:24.578–0:28.338
可是最近有一個叫做Turbo fillfair(Turbo Fillfair)的專案
0:28.338–0:34.552
成功將Google Gemma 426B a4b(Gemma 2 27B)運行在Apple Silicon Mac上
0:34.552–0:39.066
而且運行時權重加上4K KV Cache僅佔用大約2GB記憶體
0:39.066–0:42.685
這個數字最厲害的地方,不是節省了一些記憶體
0:42.685–0:46.517
而是直接把本地AI的門檻往下拉了一層
0:46.517–0:52.052
原本約14.3GB的模型安裝體積,不需要整個塞進記憶體裡
0:52.052–0:58.066
專案只將核心常駐在記憶體中,將大部分專家權重放在SSD上
0:58.066–0:59.899
需要哪一塊再讀取哪一塊
0:59.899–1:03.933
影片中在M3 Max上達到了23.4 tokens/s的速度
1:03.933–1:12.183
專案readme中也記錄了8GB M2 MacBook Air可以跑到5.1-6.3tokens
1:12.183–1:15.666
這個速度雖非資料中心等級,但已不再是玩具
1:15.666–1:17.333
這件事真正值得關注
1:17.333–1:20.846
並非某個開發者做了一個炫技專案
1:20.846–1:23.890
而是本地AI的演進路線開始改變
1:23.890–1:28.809
過去本地大模型的思路很簡單,模型越大,硬體越貴。
1:28.809–1:35.733
想跑7B準備一塊不錯的消費級顯卡,想跑30B開始考慮大顯存。
1:35.733–1:38.909
想跑更大的MoE,就看雲端服務帳單。
1:38.909–1:43.992
用戶被迫接受一個隱含規則:AI越聰明,越遠離個人電腦。
1:43.992–1:49.074
越強的模型越集中在雲端廠商的GPU集群和數據中心手裡。
1:49.074–1:54.166
Turbo Fillfair給出的反方向答案是。
1:54.166–1:58.201
模型可以很大,但每一秒真正用到的部分可能很小。
1:58.201–2:04.734
這要從MoE講起,MoE叫Mixture of Experts,混合專家模型。
2:04.734–2:11.074
普通模型像一個巨大的統一車間,每個Token進來,很多權重都要參與計算。
2:11.074–2:14.600
MoE更像一座有128個小工位的工廠。
2:14.600–2:20.318
每個Token進來,Router會判斷這次該找哪幾個專家處理。
2:20.318–2:23.473
編碼是26B a4b,總參數是26B。
2:23.473–2:28.008
但每個Token實際激活的大約是3.88B參數。
2:28.008–2:32.542
模型名義上很大,但每一步真正幹活的只是其中一部分。
2:32.542–2:36.266
過去這件事的好處主要體現在雲端。
2:36.266–2:40.772
模型公司可以用更大的總參數,保持相對可控的推理成本。
2:40.772–2:46.030
可是Turbo Fillfair把這個特性拿到了本地機器上。
2:46.030–2:51.663
既然每個Token只用幾個專家,那為什麼要把所有專家都駐留記憶體?
2:51.663–2:56.966
於是他把模型拆成兩堆,第一堆是每個Token都要用的東西。
2:56.966–3:05.785
比如Attention、Router、Embedding、Shared Expert,還有KV Cache。
3:05.785–3:10.851
這部分大約1.35吉位元組,加上運行所需的緩衝區,留在記憶體裡
3:10.851–3:15.333
第二堆是專家權重,30層,每層128個expert
3:15.333–3:19.091
每個expert只有幾MB,加起來是主要體積
3:19.091–3:21.776
這堆不常駐記憶體,只放在SSD上
3:21.776–3:29.650
每生成一個TOKEN,模型先完成attention,再由router決定當前層要用哪8個專家
3:29.650–3:33.900
CPU接到名單之後,去SSD讀取對應expert
3:33.900–3:38.293
放到GPU能看到的記憶體區域裡,metal接著算
3:38.293–3:43.284
這個過程聽起來麻煩,但關鍵在Apple Silicon
3:43.284–3:47.477
傳統PC上,CPU和獨立GPU通常分兩套記憶體
3:47.477–3:53.966
SSD讀出來的數據先進系統記憶體,再通過PCIe總線搬到顯卡VRAM
3:53.966–3:59.480
模型如果每個TOKEN都要頻繁從SSD拉權重,再搬進VRAM
3:59.480–4:02.902
中間的拷貝和總線延遲會直接把速度打穿
4:02.902–4:06.134
數據不是不會動,而是動得太慢,動得太貴
4:06.134–4:11.268
Apple Silicon的統一記憶體架構把這個問題變小了
4:11.268–4:14.700
CPU和GPU看的是同一塊實體記憶體
4:14.700–4:21.603
CPU從SSD讀進來的數據可以直接成為GPU要用的metal buffer
4:21.603–4:27.930
少了一次拷貝,少了一段總線搬運,也少了傳統獨顯架構裡最難受的VRAM牆
4:27.930–4:31.190
這就是為什麼這個專案特別像一把鑰匙
4:31.190–4:34.266
它不是證明蘋果晶片算力天下無敵
4:34.266–4:41.025
而是證明Apple Silicon的結構剛好適合一種邊讀邊算的本地推理路線
4:41.025–4:47.597
不僅如此,Turbo fieldfare 也沒有把磁碟上的權重用一般格式儲存
4:47.597–4:51.164
而是讀取後再解包,並轉換成 GPU 所需的佈局
4:51.164–4:55.330
它在安裝階段就將模型重新打包成 Dubo 格式
4:55.330–5:01.274
盡量讓磁碟中的資料直接符合 Metal kernel 可以處理的格式
5:01.274–5:07.217
讀取檔案就是載入權重,中間少一次轉換就少一次記憶體與時間的浪費
5:07.217–5:13.766
它還使用了快取,每一層有 128 個專家,不可能每次都從 SSD 讀取
5:13.766–5:19.520
專案為每一層預留了 16 個專家,將常用專家放在記憶體中
5:19.520–5:24.195
如果路由器選中已快取的專家,可以立即使用
5:24.195–5:27.791
如果未命中,再從 SSD 讀取,並將不常用的專家擠出
5:27.791–5:32.766
它使用的是 LFU(最不頻繁使用)演算法
5:32.766–5:38.255
也就是踢掉使用頻率最低的專家,而不是簡單地踢掉最久沒用的
5:38.255–5:42.900
這個選擇很重要,因為 MoE 的路由並非完全隨機
5:42.900–5:48.811
有些專家在很多 Token 上都會被反覆選中,有些專家則很少出現
5:48.811–5:52.400
按頻率保留熱門專家,比按時間保留最近使用的專家
5:52.400–5:54.517
更適合這個任務
5:54.517–5:56.399
專案押注的是語言
5:56.399–5:58.751
生成的專家選擇具有規律
5:58.751–6:00.398
只要規律足夠強烈
6:00.398–6:03.456
SSD 讀取就不會把速度拖垮
6:03.456–6:06.749
所以它能達到一個很奇怪的效果
6:06.749–6:10.277
明明模型的大部分權重都還在SSD上
6:10.277–6:13.133
實際體驗卻沒有慢到無法使用
6:13.133–6:16.054
這件事對一般用戶意味著什麼
6:16.054–6:19.424
第一、本地AI不一定只能靠堆疊硬體
6:19.424–6:21.896
過去用戶想運行更好的模型
6:21.896–6:23.693
唯一辦法是購買更大
6:23.693–6:25.940
記憶體更大、顯存更貴的顯示卡
6:25.940–6:28.187
這個邏輯會把個人電腦
6:28.187–6:30.210
推向數據中心對立面
6:30.210–6:31.333
雲端越來越強大
6:31.333–6:33.372
個人設備越來越像終端
6:33.372–6:37.858
Turbo field fair展示的是另一條路
6:37.858–6:40.713
如果模型結構、檔案佈局、作業系統
6:40.713–6:43.771
晶片記憶體架構和執行時配合得足夠
6:43.771–6:43.975
好
6:43.975–6:47.034
小機器也能吃下一部分大模型能力
6:47.034–6:48.461
它不是免費午餐
6:48.461–6:50.866
SSD讀取有延遲、模型
6:50.866–6:52.288
限制在特定結構
6:52.288–6:54.727
速度和雲端旗艦模型沒法比
6:54.727–6:56.555
但它證明了一個方向
6:56.555–6:59.603
優化路線並非只有購買更昂貴的GPU
6:59.603–7:04.683
第二,Apple Silicon的AI價值可能被低估了
7:04.683–7:06.309
過去在評估AI硬體時
7:06.309–7:08.137
大家喜歡看TOPS
7:08.137–7:10.133
關注GPU和顯存大小
7:10.133–7:12.503
蘋果在這種敘事中經常顯得尷尬
7:12.503–7:15.213
它的Neural Engine很強大
7:15.213–7:17.075
但開發生態不如CUDA
7:17.075–7:18.260
統一記憶體很漂亮
7:18.260–7:19.784
但高配記憶體價格很昂貴
7:19.784–7:21.647
Mac很適合創作和開發
7:21.647–7:23.001
但談到本地大型模型
7:23.001–7:25.372
很多人還是先想到Nvidia
7:25.372–7:29.400
Turbo Field Fair從另一個角度看待問題
7:29.400–7:32.655
蘋果真正的優勢不一定是單點算力
7:32.655–7:38.515
而是CPU、GPU、記憶體、SSD、Metal和系統API的整合
7:38.515–7:41.120
只要工作負載設計得夠貼合
7:41.120–7:44.158
它可以用更少的數據搬運換取性能
7:44.158–7:45.895
這和手機時代很像
7:45.895–7:49.300
蘋果不一定每個硬體參數都最大
7:49.300–7:51.374
但它能把晶片系統
7:51.374–7:53.707
應用和框架整合在一起
7:53.707–7:56.559
讓開發者吃到一體化紅利
7:56.559–7:59.670
本地AI也可能走類似路線
7:59.670–8:02.781
不是每個人都需要訓練模型
8:02.781–8:06.670
但很多人需要在個人裝置上執行推論
8:06.670–8:10.300
寫作翻譯程式碼補整檔案整理私人
8:10.300–8:13.585
知識庫離線助手隱私敏感資料
8:13.585–8:14.054
分析
8:14.054–8:17.808
如果這些場景能在一般Mac上執行
8:17.808–8:19.685
蘋果就不是旁觀者
8:19.685–8:22.970
第三雲端AI的壟斷感會被削弱
8:22.970–8:26.020
過去AI服務天然集中在雲端
8:26.020–8:27.428
因為模型太大
8:27.428–8:28.466
推論成本太高
8:28.466–8:29.985
使用者裝置跑不動
8:29.985–8:32.590
集中在雲端就帶來幾個問題
8:32.590–8:33.675
資料要上傳
8:33.675–8:34.978
隱私要交出去
8:34.978–8:36.497
訂閱費要長期支付
8:36.497–8:38.234
網路中斷就無法使用
8:38.234–8:39.753
模型公司修改規則
8:39.753–8:41.055
用戶只能接受
8:41.055–8:43.226
如果本地AI逐漸可用
8:43.226–8:44.962
用戶會多出一個選擇
8:44.962–8:47.300
並非所有任務都要上雲端
8:47.300–8:50.017
私人筆記、公司內部文件離線處理
8:50.017–8:52.960
程式碼助手、本地搜尋、個人自動化
8:52.960–8:56.357
這些場景其實很適合在設備端完成
8:56.357–8:58.168
雲端負責最強的模型
8:58.168–8:59.979
本地負責高頻、隱私需求
8:59.979–9:01.791
低成本與即時回應
9:01.791–9:03.602
這將改變產品形態
9:03.602–9:05.866
未來的AI助手可能不是
9:05.866–9:07.909
一個純雲端的聊天視窗
9:07.909–9:09.725
而是一套混合系統
9:09.725–9:11.541
簡單任務在本地完成
9:11.541–9:13.130
複雜任務再上雲端
9:13.130–9:14.946
敏感檔案在本地分析
9:14.946–9:16.761
公開資料由雲端補充
9:16.761–9:18.804
離線場景使用本地模型
9:18.804–9:20.620
聯網場景使用大型語言模型
9:20.620–9:22.890
用戶感覺不到後端的切換
9:22.890–9:24.933
只知道電腦變得更聰明了
9:24.933–9:27.158
這也是蘋果真正想要的方向
9:27.158–9:29.197
蘋果不會輕易將用戶數據
9:29.197–9:31.050
全部交給第三方雲端模型
9:31.050–9:32.348
他更傾向於將智能
9:32.348–9:34.016
功能隱藏在設備和系統中
9:34.016–9:38.095
Apple Intelligence 的策略一直
9:38.095–9:40.319
強調設備端處理和隱私邊界
9:40.319–9:43.133
問題在於設備端模型能力如果太弱
9:43.133–9:45.116
體驗就會被雲端模型拉開差距
9:45.116–9:47.640
Turbo 領域的公平性
9:47.640–9:49.442
這種項目說明設備端的
9:49.442–9:51.605
能力上限還有許多工程空間
9:51.605–9:53.588
這裡要把蘋果的處境講透
9:53.588–9:54.850
在這一輪 AI 浪潮中
9:54.850–9:56.472
蘋果一直顯得慢半拍
9:56.472–9:58.636
Openai搶走聊天入口
9:58.636–10:01.866
Google搶搜索和Android
10:01.866–10:07.009
Microsoft把copilot塞進Windows和office
10:07.009–10:08.879
NVIDIA拿走算力敘事
10:08.879–10:12.464
蘋果雖然發布apple intelligence
10:12.464–10:14.178
但市場反應一直不算興奮
10:14.178–10:14.957
原因很簡單
10:14.957–10:16.671
蘋果不是靠開放API和
10:16.671–10:17.918
雲模型賺錢的公司
10:17.918–10:20.133
它擅長的是把能力變成系統體驗
10:20.133–10:21.467
可大模型初期最
10:21.467–10:23.181
耀眼的能力都在雲端
10:23.181–10:25.277
蘋果的優勢一時很難展示
10:25.277–10:29.659
Turbo field day這類項目的意義就在於
10:29.659–10:31.755
它讓蘋果的優勢重新有用
10:31.755–10:33.660
如果AI的未來只是誰
10:33.660–10:34.994
有最大數據中心
10:34.994–10:36.518
蘋果確實不佔主場
10:36.518–10:39.800
它沒有Nvidia那種GPU生態
10:39.800–10:42.963
也沒有Microsoft Azure或
10:42.963–10:45.775
Google Cloud那種雲端入口
10:45.775–10:47.532
但如果未來部分AI
10:47.532–10:48.938
工作要回到設備端
10:48.938–10:50.695
蘋果手中的籌碼就多了
10:50.695–10:51.750
它有統一記憶體
10:51.750–10:53.683
有自研晶片和Metal
10:53.683–10:55.264
有強控制的作業系統
10:55.264–10:56.494
有高端用戶設備
10:56.494–10:57.900
也有一群願意花錢
10:57.900–10:59.662
購買穩定體驗的用戶
10:59.662–11:02.967
這件事最適合用一個普通場景來理解
11:02.967–11:04.950
一個用戶坐在飛機上
11:04.950–11:05.831
沒有網路
11:05.831–11:09.135
想讓電腦整理本地筆記並總結PDF
11:09.135–11:10.457
查找專案文件
11:10.457–11:12.219
生成一段郵件草稿
11:12.219–11:14.643
如果所有AI都依賴雲端
11:14.643–11:17.100
這些任務馬上就會變成半殘廢
11:17.100–11:19.680
可是如果Mac本地能跑
11:19.680–11:21.322
一個夠用的模型
11:21.322–11:23.433
很多事情就能直接做
11:23.433–11:25.075
速度不一定頂級
11:25.075–11:26.716
能力不一定最強
11:26.716–11:29.062
但它能離線、私密、低延遲
11:29.062–11:32.111
而且不需要每次把資料傳出去
11:32.111–11:33.753
對企業也是一樣
11:33.753–11:36.566
很多公司不是不想用AI
11:36.566–11:38.180
而是不敢把內部
11:38.180–11:40.716
資料全部丟給外部API
11:40.716–11:42.790
法律合約、原始碼、客戶
11:42.790–11:45.096
數據、醫療資料、財務表格
11:45.096–11:46.940
這些內容一旦上傳
11:46.940–11:49.015
就牽涉權限、審計、地區
11:49.015–11:51.089
合規和數據洩露風險
11:51.089–11:53.395
如果本地或私有設備端
11:53.395–11:55.700
模型能處理一部分任務
11:55.900–11:58.618
企業的AI使用門檻會下降
11:58.618–12:02.242
它不需要替代GPT5這種旗艦模型
12:02.242–12:05.414
只要把70%的日常任務吃下來
12:05.414–12:06.999
價值就已經很大
12:06.999–12:11.756
這也是為什麼二級字節記憶體這個概念具有流量潛力
12:11.756–12:14.474
它讓觀眾立刻理解一個變化
12:14.474–12:17.100
AI不再僅屬於雲端巨頭
12:17.100–12:19.925
即使這個結論目前還無法完全成立
12:19.925–12:21.620
它已經打開了想像空間
12:21.620–12:23.315
但這件事不能過度吹噓
12:23.315–12:27.081
Turbo field fair不是通用魔法
12:27.081–12:31.413
它目前主要針對Gemma 426BA 4B的文本推理
12:31.413–12:33.108
不支援圖像、音訊和影片
12:33.108–12:36.000
也不是一個完整的agent系統
12:36.000–12:38.412
專案readme也寫得很清楚
12:38.412–12:40.997
它是model specific
12:40.997–12:44.616
不是MLX或LLAMA CPP那種通用包裝器
12:44.616–12:46.167
換模型不一定能照搬
12:46.167–12:47.718
換硬體也不一定適用
12:47.718–12:50.303
它需要Apple Silicon
12:50.303–12:54.300
需要macOS 26、Metal 4和Swift 6.2
12:54.300–12:56.950
還需要足夠的SSD空間
12:56.950–12:59.118
它還有一個限時限制
12:59.118–13:00.805
SSD不是記憶體
13:00.805–13:03.695
SSD再快也比記憶體慢得多
13:03.695–13:06.345
頻繁讀取權重會帶來延遲
13:06.345–13:09.236
也可能增加能耗和儲存磨損
13:09.236–13:11.405
快取命中率如果不好
13:11.405–13:12.609
速度就會掉
13:12.609–13:15.500
長上下文複雜提示多輪對話
13:15.500–13:17.927
併發請求都會挑戰這套設計
13:17.927–13:22.376
影片裡的23 tokens是M3 Max上的演示
13:22.376–13:30.264
8級字節MR MacBook air的5-6tokens更接近低配用戶會看到的體驗
13:30.264–13:31.680
能用不等於絲滑
13:31.680–13:33.500
所以正確的判斷不是
13:33.500–13:36.645
Macbook從此取代雲GPU
13:36.645–13:39.371
而是本地AI的下限被抬高了
13:39.371–13:40.629
這已經很重要
13:40.629–13:43.565
還要補一個容易被忽略的成本帳
13:43.565–13:45.452
雲端AI看起來省心
13:45.452–13:47.549
但它的成本是持續性的
13:47.549–13:49.226
用戶每個月付訂閱
13:49.226–13:51.733
開發者按TOKEN付費
13:51.733–13:54.286
企業按席位和調用量付錢
13:54.286–13:56.142
用得越多,帳單越高
13:56.142–13:58.927
本地AI的成本更像買設備
13:58.927–14:00.783
前期花錢買Mac
14:00.783–14:03.104
後面用本地算力跑任務
14:03.104–14:07.513
對高頻任務來說,本地推理會越來越有吸引力
14:07.513–14:10.166
當然本地也不是不要成本
14:10.166–14:12.167
它吃電、吃儲存、吃記憶體
14:12.167–14:14.168
也吃開發者優化時間
14:14.168–14:18.171
可它的帳單不再完全掌握在模型公司手裡
14:18.171–14:23.285
用戶買了機器之後,至少有一部分智能能力可以自己用
14:23.285–14:25.286
這種心理差異很重要
14:25.286–14:29.900
訂閱時代,用戶越來越討厭每個功能都按月收費
14:29.900–14:32.775
本地AI如果能提供夠用體驗
14:32.775–14:35.429
就會成為反訂閱情緒的出口
14:35.429–14:37.199
這會影響應用開發
14:37.199–14:41.401
現在很多AI APP只是套一層雲端API
14:41.401–14:44.498
用戶輸入文字,伺服器轉發給模型
14:44.498–14:46.267
再把結果顯示回來
14:46.267–14:48.733
這種產品門檻低,替代也快
14:48.733–14:51.099
未來真正有壁壘的應用
14:51.099–14:57.723
可能會將本地模型、雲端模型、本地文件、隱私權限和系統操作結合起來
14:57.723–15:01.982
在 Mac 上的本地 AI 應用特別適合這樣做
15:01.982–15:08.300
因為它能直接接觸用戶的文件、日曆、郵件、程式碼倉庫和創作軟體
15:08.300–15:11.919
這樣一來,競爭重點就不再是誰接入了最強的 API
15:11.919–15:14.533
而是變成誰能把 AI 融入真實的工作流程
15:14.533–15:19.157
Turbo feel fair 並未解決所有產品問題
15:19.157–15:21.570
但它顯示底層可行性正在提升
15:21.570–15:24.787
底層每提升一點,應用層就會多出一批可能性
15:24.787–15:27.200
過去幾年,AI 行業一直在談論
15:27.200–15:29.985
更大的模型、更大的集群、更大的融資
15:29.985–15:31.377
模型越來越強大
15:31.377–15:33.930
但普通用戶卻越來越像租戶
15:33.930–15:37.411
帳號訂閱、API、雲端限制、數據上傳
15:37.411–15:40.196
所有能力都隔著一層平台
15:40.196–15:46.066
Turbo field fair 這類專案提醒了一件事
15:46.066–15:49.522
AI 的未來不一定只有超級數據中心
15:49.522–15:52.331
也可以有一部分回歸到個人電腦
15:52.331–15:54.275
這對開發者也有啟發
15:54.275–15:56.219
未來開發本地 AI 應用
15:56.219–15:58.380
不能只問模型能不能運行
15:58.380–16:00.756
還要問模型哪部分必須運行
16:00.756–16:02.268
哪部分可以緩存
16:02.268–16:04.212
哪部分可以串流讀取
16:04.212–16:08.666
數據在 CPU、GPU、記憶體和 SSD 之間搬運了幾次
16:08.666–16:11.925
AI 應用開發會越來越像系統工程
16:11.925–16:15.183
誰能少搬運一次數據,誰就擁有多一點效能
16:15.183–16:18.442
誰能少佔用一點記憶體,誰就能多獲得一批用戶
16:18.442–16:24.307
誰能將模型結構與硬體結構對齊,誰就能把不可能變成勉強可用
16:24.307–16:28.133
這也是蘋果生態系中可能出現機會的地方
16:28.133–16:37.995
如果開發者圍繞 Metal、統一記憶體、Neural Engine、本地文件索引、Spotlight 和 SHORTCUTS 來打造 AI 工具
16:37.995–16:41.802
Mac 可能會變成一個非常獨特的本地 AI 開發平台
16:41.802–16:43.878
不是為了與雲端模型硬碰硬
16:43.878–16:46.666
而是去做那些雲端不適合處理的任務
16:46.666–16:50.148
私密、離線、低延遲,且貼近個人文件系統
16:50.148–16:53.863
真正的競爭不是本地與雲端誰消滅誰
16:53.863–16:55.953
而是誰能掌握預設入口
16:55.953–16:57.810
雲端模型會繼續強大
16:57.810–17:01.757
因為訓練和最強推理都離不開巨量運算力
17:01.757–17:06.700
可是本地模型一旦夠用,就會吃掉大量日常任務
17:06.700–17:09.374
用戶不需要每次都請動最強模型
17:09.374–17:11.637
寫一封郵件、整理會議記錄
17:11.637–17:14.106
搜尋本地文件、解釋一段程式碼
17:14.106–17:15.546
生成一個小腳本
17:15.546–17:18.837
夠快、夠私密、夠便宜,這比絕對最強更重要
17:18.837–17:23.569
這就是Turbo fillfair事件的流量價值
17:23.569–17:27.100
表面上看,它只是記憶體減少7倍技術新聞
17:27.100–17:30.326
往深一層看,它在挑戰一個行業共識
17:30.326–17:32.476
大模型必須被雲端壟斷
17:32.476–17:34.412
它沒有推翻雲端AI
17:34.412–17:36.132
但它撕開了一條縫
17:36.132–17:41.078
接下來要看的不是這個項目本身能不能變成大眾產品
17:41.078–17:44.304
而是它代表的工程路線會不會擴散
17:44.304–17:47.100
更多MOE模型會不會被專門
17:47.100–17:48.736
打包成本地串流格式
17:48.736–17:55.282
更多Mac應用會不會接入本地Openai compatible Server
17:55.282–17:58.918
Apple會不會把類似思路放進系統級框架
17:58.918–18:03.282
開發者會不會開始為8位元、16位元設備認真優化
18:03.282–18:05.100
而不是預設要求64位元
18:05.100–18:06.890
記憶體和大顯卡
18:06.890–18:08.681
如果這些事情發生
18:08.681–18:11.143
本地AI就會從極客演示
18:11.143–18:12.933
變成產品基礎設施
18:12.933–18:15.843
還有一個變數是模型公司本身
18:15.843–18:18.305
如果更多模型採用MOE
18:18.305–18:20.543
如果更多模型公開權重
18:20.543–18:24.066
如果更多小模型追上日常任務能力
18:24.066–18:26.109
本地推理就會更快普及
18:26.109–18:31.215
Turbo Fillfair依賴Gemma4這種結構
18:31.215–18:33.666
不代表所有模型都能這麼跑
18:33.666–18:36.934
但AI行業已經在往稀疏激活專用小
18:36.934–18:39.589
模型端側模型模型路由方向走
18:39.589–18:41.632
雲端超級模型負責難題
18:41.632–18:43.366
端側模型負責日常
18:43.366–18:45.909
多個模型組合起來完成任務
18:45.909–18:48.876
這個方向對Nvidia是提醒
18:48.876–18:50.148
對蘋果是機會
18:50.148–18:51.843
對開發者是新戰場
18:51.843–18:55.658
NVIDIA仍然會統治訓練和高端推理
18:55.658–18:57.354
可是如果越來越多
18:57.354–18:59.049
日常推理回到端側
18:59.049–19:01.169
市場對所有AI都必須
19:01.169–19:03.733
上雲GPU的想像會降溫
19:03.733–19:06.438
蘋果不一定搶走資料中心的錢
19:06.438–19:09.350
但可以搶回個人裝置的智慧入口
19:09.350–19:12.055
開發者如果能把本機模型用好
19:12.055–19:14.968
就不用完全被API成本牽著走
19:14.968–19:16.424
觀眾繼續聽下去
19:16.424–19:18.089
應該帶走的判斷是
19:18.089–19:20.169
這不是小工具新聞
19:20.169–19:22.866
而是AI權力結構的小變化
19:22.866–19:24.494
以前能力在雲端
19:24.494–19:26.122
用戶只是呼叫者
19:26.122–19:29.145
現在一部分能力開始回到裝置
19:29.145–19:31.703
用戶重新擁有一點控制權
19:31.703–19:33.331
這一點現在還小
19:33.331–19:34.726
但方向很清楚
19:34.726–19:37.051
只要端側模型繼續變強
19:37.051–19:40.075
本地AI就會從能跑走向好用
19:40.075–19:42.533
再從好用走向預設存在
19:42.533–19:45.477
接下來還要看一個更現實的變數
19:45.477–19:46.318
記憶體配置
19:46.318–19:48.000
蘋果這些年來一直
19:48.000–19:50.312
被吐槽入門 Mac 記憶體太小
19:50.312–19:51.574
升級記憶體太貴
19:51.574–19:53.887
過去這個槽點主要影響剪
19:53.887–19:56.199
影片、跑虛擬機、開啟大型專案
19:56.199–19:57.881
到了本地 AI 時代
19:57.881–20:00.404
它會變成更核心的購買理由
20:00.404–20:01.666
8GB 能跑
20:01.666–20:03.820
不代表 8GB 最舒適
20:03.820–20:07.482
16GB 會成為更合理的 AI 入門門檻
20:07.482–20:10.283
32GB、64GB 會變成
20:10.283–20:12.868
開發者和重度使用者的新分水嶺
20:12.868–20:16.745
Turbo Field Day 把門檻打低
20:16.745–20:18.684
不代表硬體需求消失
20:18.684–20:21.900
而是讓更多人第一次有資格進場
20:21.900–20:24.671
這對蘋果的產品策略很微妙
20:24.671–20:28.829
如果本地 AI 真的變成 Mac 的重要賣點
20:28.829–20:30.907
蘋果就會有更强理由
20:30.907–20:33.448
推動用戶購買更高記憶體版本
20:33.448–20:36.912
用戶過去購買記憶體是為了當前的軟體
20:36.912–20:38.067
未來購買記憶體
20:38.067–20:41.300
可能是為了未來幾年的本地模型
20:41.466–20:43.592
蘋果當然喜歡這個故事
20:43.592–20:46.568
因為它能提高Mac的平均售價
20:46.568–20:48.269
但用戶也會更敏感
20:48.269–20:50.820
既然AI要在設備端運行入門
20:50.820–20:52.521
配置就不能太寒酸
20:52.521–20:54.860
蘋果如果繼續將記憶體升級
20:54.860–20:56.135
價格定得很高
20:56.135–20:58.687
反而會限制本地AI的普及
20:58.687–21:00.766
另一個變數是SSD
21:00.766–21:04.406
Turbo field fair的路線
21:04.406–21:06.761
把SSD從單純儲存變成
21:06.761–21:08.473
推理鏈路的一部分
21:08.473–21:10.828
SSD速度壽命文件佈局
21:10.828–21:12.969
系統快取都會影響體驗
21:12.969–21:16.395
過去用戶選電腦看SSD主要是容量
21:16.395–21:18.536
未來本地AI應用多了
21:18.536–21:21.733
SSD讀寫性能也會被重新關注
21:21.733–21:23.596
模型權重不再只是靜態存在
21:23.596–21:25.251
存在硬碟裡的大檔案
21:25.251–21:28.149
而是生成每個TOKEN時可能
21:28.149–21:30.218
被反覆訪問的工作材料
21:30.218–21:32.909
這會改變電腦硬體評價體系
21:32.909–21:36.013
過去AI電腦宣傳喜歡堆疊TOPS
21:36.013–21:39.117
以後真正懂行的人會看一整套鏈路
21:39.117–21:40.766
記憶體頻寬夠不夠
21:40.766–21:43.565
CPU和GPU是否共享記憶體
21:43.565–21:45.933
SSD讀取延遲如何
21:45.933–21:48.517
系統API能不能減少模型拷貝
21:48.517–21:50.455
格式是不是貼合硬體
21:50.455–21:53.254
單看一個算力數字很容易上當
21:53.254–21:56.053
AI推理的瓶頸可能不在算力
21:56.053–21:57.345
而在資料搬運
21:57.345–22:02.566
這也是Turbo fair給普通觀眾上的一課
22:02.566–22:05.346
AI不只是模型聰不聰明
22:05.346–22:07.199
還有資料怎麼流動
22:07.199–22:10.442
同一個模型放在不同硬體結構上
22:10.442–22:12.527
體驗可能完全不一樣
22:12.527–22:15.538
未來優秀的本地AI產品背後
22:15.538–22:18.318
絕非只是簡單下載一個模型
22:18.318–22:20.966
而是圍繞設備進行深度優化
22:20.966–22:22.652
最後給出一個明確的判斷
22:22.652–22:25.275
蘋果晶片這次贏的不是模型參數
22:25.275–22:27.898
也不是Benchmark排名
22:27.898–22:29.958
而是設備端AI的話語權
22:29.958–22:33.518
過去AI的話語權被NVIDIA和雲端廠商拿走
22:33.518–22:37.077
大家談的都是GPU叢集、資料中心和API
22:37.077–22:40.666
Turbo 領域的公平競賽
22:40.666–22:43.193
讓另一個問題重新回到桌面
22:43.193–22:45.510
如果模型不必全部進入記憶體
22:45.510–22:48.248
如果CPU和GPU共享記憶體
22:48.248–22:50.354
如果SSD能參與推論
22:50.354–22:53.303
如果應用程式能直接貼著硬體寫本地
22:53.303–22:56.041
設備還能變成AI的主場嗎
22:56.041–22:57.094
答案尚未確定
22:57.094–22:59.200
但這次Mac不再只是
22:59.200–23:00.987
調用雲端模型的螢幕
23:00.987–23:02.997
它開始像一台真正能
23:02.997–23:05.007
承載AI的個人設備
23:05.007–23:06.793
如果這個趨勢持續下去
23:06.793–23:09.920
未來購買電腦時就會多出一個新問題
23:09.920–23:12.600
這台設備能否將個人資料
23:12.600–23:15.057
工作流程和本地模型串連起來
23:15.057–23:17.067
過去電腦比拼的是效能
23:17.067–23:19.866
後來比拼的是續航和生態系
23:19.866–23:22.633
接下來可能要比拼的是本地智能密度
23:22.633–23:25.613
蘋果晶片這次露出的底牌就在這裡
23:25.613–23:28.806
誰能讓AI更貼近用戶自己的設備
23:28.806–23:29.870
自己的檔案
23:29.870–23:31.360
自己的隱私界線
23:31.360–23:33.063
誰就能在雲端巨頭
23:33.063–23:34.766
之外奪回一塊入口
0:00.100–0:06.570
zh一台8G字节内存的MacBook 居然能跑26B级别的大模型
一台配備8GB記憶體(RAM)的MacBook竟然能運行26B參數級別的大型語言模型
0:06.570–0:08.578
zh这件事听起来很反常
這件事聽起來非常反常
0:08.578–0:13.709
zh过去谈本地AI 大家第一反应都是显存不够 内存不够
過去談論本地AI時,大家的第一反應通常是顯存不夠、記憶體不足
0:13.709–0:17.725
zh电脑风扇起飞 模型还没加载完 系统先卡死
電腦風扇狂轉,模型還沒加載完,系統就先當機了
0:17.725–0:20.000
zh26B参数这种模型
像26B參數這種模型
0:20.000–0:24.578
zh正常想象里至少要一台很贵的机器 或者干脆丢到云端GPU上跑
在正常想像中,至少需要一台很昂貴的機器,或者乾脆丟到雲端GPU上去運行
0:24.578–0:28.338
zh可是最近一个叫Turbo fillfair的项目
可是最近有一個叫做Turbo fillfair(Turbo Fillfair)的專案
0:28.338–0:34.552
zh把Google Gemma 426B a四b 跑到了apple Silicon Mac上
成功將Google Gemma 426B a4b(Gemma 2 27B)運行在Apple Silicon Mac上
0:34.552–0:39.066
zh而且运行时权重加4K KV CACHE只占大约二级字节内存
而且運行時權重加上4K KV Cache僅佔用大約2GB記憶體
0:39.066–0:42.685
zh这个数字最狠的地方 不是省了一点内存
這個數字最厲害的地方,不是節省了一些記憶體
0:42.685–0:46.517
zh而是把本地AI的门槛 直接往下砸了一层
而是直接把本地AI的門檻往下拉了一層
0:46.517–0:52.052
zh原本14.3GB左右的模型安装体积 不需要整包塞进内存
原本約14.3GB的模型安裝體積,不需要整個塞進記憶體裡
0:52.052–0:58.066
zh项目只把常驻核心留在内存里 把大部分专家权重放在SSD上
專案只將核心常駐在記憶體中,將大部分專家權重放在SSD上
0:58.066–0:59.899
zh需要哪一块再读哪一块
需要哪一塊再讀取哪一塊
0:59.899–1:03.933
zh视频里在M3Max上跑到23.4tokens
影片中在M3 Max上達到了23.4 tokens/s的速度
1:03.933–1:12.183
zh项目readme里也记录了8GBM二Macbook air 可以跑到5.1-6.3tokens
專案readme中也記錄了8GB M2 MacBook Air可以跑到5.1-6.3tokens
1:12.183–1:15.666
zh这个速度不是数据中心级别 但已经不是玩具
這個速度雖非資料中心等級,但已不再是玩具
1:15.666–1:17.333
zh这件事真正值得看
這件事真正值得關注
1:17.333–1:20.846
zh不是某个开发者做了一个炫技项目
並非某個開發者做了一個炫技專案
1:20.846–1:23.890
zh而是本地AI的路线开始变了
而是本地AI的演進路線開始改變
1:23.890–1:28.809
zh过去本地大模型的思路很简单 模型越大 硬件越贵
過去本地大模型的思路很簡單,模型越大,硬體越貴。
1:28.809–1:35.733
zh想跑7B准备一块不错的消费级显卡 想跑30B开始考虑大显存
想跑7B準備一塊不錯的消費級顯卡,想跑30B開始考慮大顯存。
1:35.733–1:38.909
zh想跑更大的moe 就看云服务账单
想跑更大的MoE,就看雲端服務帳單。
1:38.909–1:43.992
zh用户被迫接受一个隐含规则 AI越聪明越远离个人电脑
用戶被迫接受一個隱含規則:AI越聰明,越遠離個人電腦。
1:43.992–1:49.074
zh越强的模型越集中在云厂商 GPU集群和数据中心手里
越強的模型越集中在雲端廠商的GPU集群和數據中心手裡。
1:49.074–1:54.166
zhTurbo fuel fair给出的反方向答案是
Turbo Fillfair給出的反方向答案是。
1:54.166–1:58.201
zh模型可以很大 但每一秒真正用到的部分可能很小
模型可以很大,但每一秒真正用到的部分可能很小。
1:58.201–2:04.734
zh这要从Moe讲起 Moe叫mixture of experts 混合专家模型
這要從MoE講起,MoE叫Mixture of Experts,混合專家模型。
2:04.734–2:11.074
zh普通模型像一个巨大的统一车间 每个TOKEN进来 很多权重都要参与计算
普通模型像一個巨大的統一車間,每個Token進來,很多權重都要參與計算。
2:11.074–2:14.600
zhMoe更像一座有128个小工位的工厂
MoE更像一座有128個小工位的工廠。
2:14.600–2:20.318
zh每个TOKEN进来 Router会判断这次该找 哪几个专家处理
每個Token進來,Router會判斷這次該找哪幾個專家處理。
2:20.318–2:23.473
zh编码是26B a4b 总参数是26B
編碼是26B a4b,總參數是26B。
2:23.473–2:28.008
zh但每个TOKEN实际激活 的大约是3.88B参数
但每個Token實際激活的大約是3.88B參數。
2:28.008–2:32.542
zh模型名义上很大 但每一步真正干活 的只是其中一部分
模型名義上很大,但每一步真正幹活的只是其中一部分。
2:32.542–2:36.266
zh过去这件事的好处主要体现在云端
過去這件事的好處主要體現在雲端。
2:36.266–2:40.772
zh模型公司可以用更大的总参数 保持相对可控的推理成本
模型公司可以用更大的總參數,保持相對可控的推理成本。
2:40.772–2:46.030
zh可是Turbo Fillfair把这个 特性拿到了本地机器上
可是Turbo Fillfair把這個特性拿到了本地機器上。
2:46.030–2:51.663
zh既然每个TOKEN只用几个专家 那为什么要把所有专家都常驻内存
既然每個Token只用幾個專家,那為什麼要把所有專家都駐留記憶體?
2:51.663–2:56.966
zh于是他把模型拆成两堆 第一堆是每个TOKEN都要用的东西
於是他把模型拆成兩堆,第一堆是每個Token都要用的東西。
2:56.966–3:05.785
zh比如attention router embedding shared expert 还有KV CACHE
比如Attention、Router、Embedding、Shared Expert,還有KV Cache。
3:05.785–3:10.851
zh这一部分大约1.35吉字节 加上运行需要的缓存 留在内存里
這部分大約1.35吉位元組,加上運行所需的緩衝區,留在記憶體裡
3:10.851–3:15.333
zh第二堆是专家权重 30层 每层128个expert
第二堆是專家權重,30層,每層128個expert
3:15.333–3:19.091
zh每个expert只有几MB 加起来是主要体积
每個expert只有幾MB,加起來是主要體積
3:19.091–3:21.776
zh这一堆不常驻内存 只放在SSD上
這堆不常駐記憶體,只放在SSD上
3:21.776–3:29.650
zh每生成一个TOKEN 模型先完成attention 再由router决定当前层要用哪8个专家
每生成一個TOKEN,模型先完成attention,再由router決定當前層要用哪8個專家
3:29.650–3:33.900
zhCPU接到名单之后 去SSD读取对应expert
CPU接到名單之後,去SSD讀取對應expert
3:33.900–3:38.293
zh放到GPU能看到的内存区域里 metal接着算
放到GPU能看到的記憶體區域裡,metal接著算
3:38.293–3:43.284
zh这个过程听起来麻烦 但关键在apple Silicon
這個過程聽起來麻煩,但關鍵在Apple Silicon
3:43.284–3:47.477
zh传统PC上 CPU和独立GPU通常分两套内存
傳統PC上,CPU和獨立GPU通常分兩套記憶體
3:47.477–3:53.966
zhSSD读出来的数据先进系统内存 再通过Pcie总线搬到显卡VRAM
SSD讀出來的數據先進系統記憶體,再通過PCIe總線搬到顯卡VRAM
3:53.966–3:59.480
zh模型如果每个TOKEN都 要频繁从SSD拉权重 再搬进VRAM
模型如果每個TOKEN都要頻繁從SSD拉權重,再搬進VRAM
3:59.480–4:02.902
zh中间的拷贝和总线 延迟会直接把速度打穿
中間的拷貝和總線延遲會直接把速度打穿
4:02.902–4:06.134
zh数据不是不会动 而是动得太慢 动得太贵
數據不是不會動,而是動得太慢,動得太貴
4:06.134–4:11.268
zhapple Silicon的统一内存 架构把这个问题变小了
Apple Silicon的統一記憶體架構把這個問題變小了
4:11.268–4:14.700
zhCPU和GPU看的是同一块物理内存
CPU和GPU看的是同一塊實體記憶體
4:14.700–4:21.603
zhCPU从SSD读进来的数据可以 直接成为GPU要用的metal buffer
CPU從SSD讀進來的數據可以直接成為GPU要用的metal buffer
4:21.603–4:27.930
zh少了一次拷贝 少了一段总线搬运 也少了传统独显架构 里最难受的VRAM墙
少了一次拷貝,少了一段總線搬運,也少了傳統獨顯架構裡最難受的VRAM牆
4:27.930–4:31.190
zh这就是为什么这个 项目特别像一把钥匙
這就是為什麼這個專案特別像一把鑰匙
4:31.190–4:34.266
zh它不是证明苹果芯片算力天下无敌
它不是證明蘋果晶片算力天下無敵
4:34.266–4:41.025
zh而是证明apple Silicon的结构刚好适合 一种边读边算的本地推理路线
而是證明Apple Silicon的結構剛好適合一種邊讀邊算的本地推理路線
4:41.025–4:47.597
zh还不止这个 Turbo fieldfare没有把磁盘上 的权重用普通格式存着
不僅如此,Turbo fieldfare 也沒有把磁碟上的權重用一般格式儲存
4:47.597–4:51.164
zh等读取之后再解包 再转成GPU需要的布局
而是讀取後再解包,並轉換成 GPU 所需的佈局
4:51.164–4:55.330
zh它在安装阶段就把 模型重新打包成Dubo格式
它在安裝階段就將模型重新打包成 Dubo 格式
4:55.330–5:01.274
zh尽量让磁盘里的数据就是 metal kernel可以消费的样子
盡量讓磁碟中的資料直接符合 Metal kernel 可以處理的格式
5:01.274–5:07.217
zh读文件就是加载权重 中间少一次转换就少 一次内存浪费和时间浪费
讀取檔案就是載入權重,中間少一次轉換就少一次記憶體與時間的浪費
5:07.217–5:13.766
zh它还用了缓存 每一层128个expert 不可能每次都从SSD读
它還使用了快取,每一層有 128 個專家,不可能每次都從 SSD 讀取
5:13.766–5:19.520
zh项目给每层留了16个expert 常位常用的expert放在内存里
專案為每一層預留了 16 個專家,將常用專家放在記憶體中
5:19.520–5:24.195
zhrouter如果选中已经缓存的expert 立刻就能用
如果路由器選中已快取的專家,可以立即使用
5:24.195–5:27.791
zh如果没命中 再从SSD读取 把不常用的挤出去
如果未命中,再從 SSD 讀取,並將不常用的專家擠出
5:27.791–5:32.766
zh它用的是LFU least frequently used
它使用的是 LFU(最不頻繁使用)演算法
5:32.766–5:38.255
zh也就是踢掉使用频率最低的专家 而不是简单踢掉最久没用的
也就是踢掉使用頻率最低的專家,而不是簡單地踢掉最久沒用的
5:38.255–5:42.900
zh这个选择很重要 因为moe的路由并不是完全随机
這個選擇很重要,因為 MoE 的路由並非完全隨機
5:42.900–5:48.811
zh有些专家在很多TOKEN 上都会被反复选中 有些专家很少出现
有些專家在很多 Token 上都會被反覆選中,有些專家則很少出現
5:48.811–5:52.400
zh按频率留下热门专家 比按时间留下最近
按頻率保留熱門專家,比按時間保留最近使用的專家
5:52.400–5:54.517
zh专家更适合这个任务
更適合這個任務
5:54.517–5:56.399
zh项目押注的是语言
專案押注的是語言
5:56.399–5:58.751
zh生成的专家选择有规律
生成的專家選擇具有規律
5:58.751–6:00.398
zh只要规律足够强
只要規律足夠強烈
6:00.398–6:03.456
zhSSD读取就不会把速度拖死
SSD 讀取就不會把速度拖垮
6:03.456–6:06.749
zh所以它能做到一个很奇怪的效果
所以它能達到一個很奇怪的效果
6:06.749–6:10.277
zh明明模型大部分权重还在SSD上
明明模型的大部分權重都還在SSD上
6:10.277–6:13.133
zh实际体验却没有慢到不能用
實際體驗卻沒有慢到無法使用
6:13.133–6:16.054
zh这件事对普通用户意味着什么
這件事對一般用戶意味著什麼
6:16.054–6:19.424
zh第一本地AI不一定只能靠堆硬件
第一、本地AI不一定只能靠堆疊硬體
6:19.424–6:21.896
zh过去用户想跑更好的模型
過去用戶想運行更好的模型
6:21.896–6:23.693
zh唯一办法是买更大
唯一辦法是購買更大
6:23.693–6:25.940
zh内存更大显存更贵显卡
記憶體更大、顯存更貴的顯示卡
6:25.940–6:28.187
zh这个逻辑会把个人电脑
這個邏輯會把個人電腦
6:28.187–6:30.210
zh推向数据中心的反面
推向數據中心對立面
6:30.210–6:31.333
zh云越来越强
雲端越來越強大
6:31.333–6:33.372
zh个人设备越来越像终端
個人設備越來越像終端
6:33.372–6:37.858
zhTurbo field fair展示的是另一条路
Turbo field fair展示的是另一條路
6:37.858–6:40.713
zh如果模型结构文件布局操作系统
如果模型結構、檔案佈局、作業系統
6:40.713–6:43.771
zh芯片内存架构和运行时配合得足够
晶片記憶體架構和執行時配合得足夠
6:43.771–6:43.975
zh好
好
6:43.975–6:47.034
zh小机器也能吃下一部分大模型能力
小機器也能吃下一部分大模型能力
6:47.034–6:48.461
zh它不是免费午餐
它不是免費午餐
6:48.461–6:50.866
zhSSD读取有延迟模型
SSD讀取有延遲、模型
6:50.866–6:52.288
zh限制在特定结构
限制在特定結構
6:52.288–6:54.727
zh速度和云端旗舰模型没法比
速度和雲端旗艦模型沒法比
6:54.727–6:56.555
zh但它证明了一个方向
但它證明了一個方向
6:56.555–6:59.603
zh优化路线不是只剩买更贵的GPU
優化路線並非只有購買更昂貴的GPU
6:59.603–7:04.683
zh第二 apple Silicon的AI价值可能被低估了
第二,Apple Silicon的AI價值可能被低估了
7:04.683–7:06.309
zh过去评价AI硬件
過去在評估AI硬體時
7:06.309–7:08.137
zh大家喜欢看TOPS
大家喜歡看TOPS
7:08.137–7:10.133
zh看GPU看显存大小
關注GPU和顯存大小
7:10.133–7:12.503
zh苹果在这场叙事里经常显得尴尬
蘋果在這種敘事中經常顯得尷尬
7:12.503–7:15.213
zh它的neural engine很强
它的Neural Engine很強大
7:15.213–7:17.075
zh但开发生态不如CUDA
但開發生態不如CUDA
7:17.075–7:18.260
zh统一内存很漂亮
統一記憶體很漂亮
7:18.260–7:19.784
zh但高配内存价格很贵
但高配記憶體價格很昂貴
7:19.784–7:21.647
zhMac很适合创作和开发
Mac很適合創作和開發
7:21.647–7:23.001
zh但说到本地大模型
但談到本地大型模型
7:23.001–7:25.372
zh很多人还是先想到Nvidia
很多人還是先想到Nvidia
7:25.372–7:29.400
zhTurbo field fair把问题换了一个角度
Turbo Field Fair從另一個角度看待問題
7:29.400–7:32.655
zh苹果真正的优势不一定是单点算力
蘋果真正的優勢不一定是單點算力
7:32.655–7:38.515
zh而是CPU GPU内存SSD metal和系统API的整合
而是CPU、GPU、記憶體、SSD、Metal和系統API的整合
7:38.515–7:41.120
zh只要工作负载设计的够贴合
只要工作負載設計得夠貼合
7:41.120–7:44.158
zh它可以用更少的数据搬运换性能
它可以用更少的數據搬運換取性能
7:44.158–7:45.895
zh这和手机时代很像
這和手機時代很像
7:45.895–7:49.300
zh苹果不一定每个硬件参数都最大
蘋果不一定每個硬體參數都最大
7:49.300–7:51.374
zh但它能把芯片系统
但它能把晶片系統
7:51.374–7:53.707
zh应用和框架整在一起
應用和框架整合在一起
7:53.707–7:56.559
zh让开发者吃到一体化红利
讓開發者吃到一體化紅利
7:56.559–7:59.670
zh本地AI也可能走类似路线
本地AI也可能走類似路線
7:59.670–8:02.781
zh不是每个人都需要训练模型
不是每個人都需要訓練模型
8:02.781–8:06.670
zh但很多人需要在个人设备上跑推理
但很多人需要在個人裝置上執行推論
8:06.670–8:10.300
zh写作翻译代码补全文件整理私人
寫作翻譯程式碼補整檔案整理私人
8:10.300–8:13.585
zh知识库离线助手隐私敏感的资料
知識庫離線助手隱私敏感資料
8:13.585–8:14.054
zh分析
分析
8:14.054–8:17.808
zh如果这些场景能在普通Mac上运行
如果這些場景能在一般Mac上執行
8:17.808–8:19.685
zh苹果就不是旁观者
蘋果就不是旁觀者
8:19.685–8:22.970
zh第三云端AI的垄断感会被削弱
第三雲端AI的壟斷感會被削弱
8:22.970–8:26.020
zh过去AI服务天然集中在云端
過去AI服務天然集中在雲端
8:26.020–8:27.428
zh因为模型太大
因為模型太大
8:27.428–8:28.466
zh推理太贵
推論成本太高
8:28.466–8:29.985
zh用户设备跑不动
使用者裝置跑不動
8:29.985–8:32.590
zh集中在云端就带来几个问题
集中在雲端就帶來幾個問題
8:32.590–8:33.675
zh数据要上传
資料要上傳
8:33.675–8:34.978
zh隐私要交出去
隱私要交出去
8:34.978–8:36.497
zh订阅费要长期付
訂閱費要長期支付
8:36.497–8:38.234
zh网络断了就没法用
網路中斷就無法使用
8:38.234–8:39.753
zh模型公司改规则
模型公司修改規則
8:39.753–8:41.055
zh用户只能接受
用戶只能接受
8:41.055–8:43.226
zh本地AI如果慢慢可用
如果本地AI逐漸可用
8:43.226–8:44.962
zh用户会多一个选择
用戶會多出一個選擇
8:44.962–8:47.300
zh不是所有任务都要上云
並非所有任務都要上雲端
8:47.300–8:50.017
zh私人笔记公司内部文档离线
私人筆記、公司內部文件離線處理
8:50.017–8:52.960
zh代码助手本地搜索个人自动化
程式碼助手、本地搜尋、個人自動化
8:52.960–8:56.357
zh这些场景其实很适合在设备端完成
這些場景其實很適合在設備端完成
8:56.357–8:58.168
zh云端负责最强模型
雲端負責最強的模型
8:58.168–8:59.979
zh本地负责高频隐私
本地負責高頻、隱私需求
8:59.979–9:01.791
zh低成本和及时响应
低成本與即時回應
9:01.791–9:03.602
zh这会改变产品形态
這將改變產品形態
9:03.602–9:05.866
zh未来AI助手可能不是
未來的AI助手可能不是
9:05.866–9:07.909
zh一个纯云端聊天窗口
一個純雲端的聊天視窗
9:07.909–9:09.725
zh而是一套混合系统
而是一套混合系統
9:09.725–9:11.541
zh简单任务本地完成
簡單任務在本地完成
9:11.541–9:13.130
zh复杂任务再上云
複雜任務再上雲端
9:13.130–9:14.946
zh敏感文件本地分析
敏感檔案在本地分析
9:14.946–9:16.761
zh公开资料云端补充
公開資料由雲端補充
9:16.761–9:18.804
zh离线场景用本地模型
離線場景使用本地模型
9:18.804–9:20.620
zh联网场景用大模型
聯網場景使用大型語言模型
9:20.620–9:22.890
zh用户感觉不到背后切换
用戶感覺不到後端的切換
9:22.890–9:24.933
zh只知道电脑更聪明了
只知道電腦變得更聰明了
9:24.933–9:27.158
zh这也是苹果真正想要的方向
這也是蘋果真正想要的方向
9:27.158–9:29.197
zh苹果不会轻易把用户数据
蘋果不會輕易將用戶數據
9:29.197–9:31.050
zh全部交给第三方云模型
全部交給第三方雲端模型
9:31.050–9:32.348
zh他更喜欢把智能
他更傾向於將智能
9:32.348–9:34.016
zh功能藏进设备和系统
功能隱藏在設備和系統中
9:34.016–9:38.095
zhapple intelligence的战略一直
Apple Intelligence 的策略一直
9:38.095–9:40.319
zh强调设备端处理和隐私边界
強調設備端處理和隱私邊界
9:40.319–9:43.133
zh问题在于设备端模型能力如果太弱
問題在於設備端模型能力如果太弱
9:43.133–9:45.116
zh体验就会被云端模型拉开
體驗就會被雲端模型拉開差距
9:45.116–9:47.640
enTurbo field fair
Turbo 領域的公平性
9:47.640–9:49.442
zh这种项目说明设备端的
這種項目說明設備端的
9:49.442–9:51.605
zh能力上限还有很多工程空间
能力上限還有許多工程空間
9:51.605–9:53.588
zh这里要把苹果的处境讲透
這裡要把蘋果的處境講透
9:53.588–9:54.850
zhAI这轮浪潮里
在這一輪 AI 浪潮中
9:54.850–9:56.472
zh苹果一直显得慢半拍
蘋果一直顯得慢半拍
9:56.472–9:58.636
zhOpenai抢走聊天入口
Openai搶走聊天入口
9:58.636–10:01.866
zhGoogle抢搜索和Android
Google搶搜索和Android
10:01.866–10:07.009
zhMicrosoft把copilot塞进Windows和office
Microsoft把copilot塞進Windows和office
10:07.009–10:08.879
zhNVIDIA拿走算力叙事
NVIDIA拿走算力敘事
10:08.879–10:12.464
zh苹果虽然发布apple intelligence
蘋果雖然發布apple intelligence
10:12.464–10:14.178
zh但市场反应一直不算兴奋
但市場反應一直不算興奮
10:14.178–10:14.957
zh原因很简单
原因很簡單
10:14.957–10:16.671
zh苹果不是靠开放API和
蘋果不是靠開放API和
10:16.671–10:17.918
zh云模型赚钱的公司
雲模型賺錢的公司
10:17.918–10:20.133
zh它擅长的是把能力变成系统体验
它擅長的是把能力變成系統體驗
10:20.133–10:21.467
zh可大模型初期最
可大模型初期最
10:21.467–10:23.181
zh耀眼的能力都在云端
耀眼的能力都在雲端
10:23.181–10:25.277
zh苹果的优势一时很难展示
蘋果的優勢一時很難展示
10:25.277–10:29.659
zhTurbo field day这类项目的意义就在于
Turbo field day這類項目的意義就在於
10:29.659–10:31.755
zh它让苹果的优势重新有用
它讓蘋果的優勢重新有用
10:31.755–10:33.660
zh如果AI的未来只是谁
如果AI的未來只是誰
10:33.660–10:34.994
zh有最大数据中心
有最大數據中心
10:34.994–10:36.518
zh苹果确实不占主场
蘋果確實不佔主場
10:36.518–10:39.800
zh它没有Nvidia那种GPU生态
它沒有Nvidia那種GPU生態
10:39.800–10:42.963
zh也没有Microsoft Azure或
也沒有Microsoft Azure或
10:42.963–10:45.775
zhGoogle cloud那种云入口
Google Cloud那種雲端入口
10:45.775–10:47.532
zh但如果未来一部分AI
但如果未來部分AI
10:47.532–10:48.938
zh工作要回到设备端
工作要回到設備端
10:48.938–10:50.695
zh苹果手里的筹码就多了
蘋果手中的籌碼就多了
10:50.695–10:51.750
zh它有统一内存
它有統一記憶體
10:51.750–10:53.683
zh有自研芯片有metal
有自研晶片和Metal
10:53.683–10:55.264
zh有强控制的操作系统
有強控制的作業系統
10:55.264–10:56.494
zh有高端用户设备
有高端用戶設備
10:56.494–10:57.900
zh也有一群愿意花钱
也有一群願意花錢
10:57.900–10:59.662
zh买稳定体验的用户
購買穩定體驗的用戶
10:59.662–11:02.967
zh这件事最适合用一个普通场景理解
這件事最適合用一個普通場景來理解
11:02.967–11:04.950
zh一个用户坐在飞机上
一個用戶坐在飛機上
11:04.950–11:05.831
zh没有网路
沒有網路
11:05.831–11:09.135
zh想让电脑整理本地笔记总结PDF
想讓電腦整理本地筆記並總結PDF
11:09.135–11:10.457
zh查找项目文档
查找專案文件
11:10.457–11:12.219
zh生成一段邮件草稿
生成一段郵件草稿
11:12.219–11:14.643
zh如果所有AI都依赖云端
如果所有AI都依賴雲端
11:14.643–11:17.100
zh这些任务马上变成半残废
這些任務馬上就會變成半殘廢
11:17.100–11:19.680
zh可是如果Mac本地能跑
可是如果Mac本地能跑
11:19.680–11:21.322
zh一个够用的模型
一個夠用的模型
11:21.322–11:23.433
zh很多事情就能直接做
很多事情就能直接做
11:23.433–11:25.075
zh速度不一定顶级
速度不一定頂級
11:25.075–11:26.716
zh能力不一定最强
能力不一定最強
11:26.716–11:29.062
zh但它能离线私密低延迟
但它能離線、私密、低延遲
11:29.062–11:32.111
zh而且不需要每次把资料传出去
而且不需要每次把資料傳出去
11:32.111–11:33.753
zh对企业也是一样
對企業也是一樣
11:33.753–11:36.566
zh很多公司不是不想用AI
很多公司不是不想用AI
11:36.566–11:38.180
zh而是不敢把内部
而是不敢把內部
11:38.180–11:40.716
zh资料全部丢给外部API
資料全部丟給外部API
11:40.716–11:42.790
zh法律合同源代码客户
法律合約、原始碼、客戶
11:42.790–11:45.096
zh数据医疗资料财务表格
數據、醫療資料、財務表格
11:45.096–11:46.940
zh这些内容一旦上传
這些內容一旦上傳
11:46.940–11:49.015
zh就牵涉权限审计地区
就牽涉權限、審計、地區
11:49.015–11:51.089
zh合规和数据泄露风险
合規和數據洩露風險
11:51.089–11:53.395
zh如果本地或私有设备端
如果本地或私有設備端
11:53.395–11:55.700
zh模型能处理一部分任务
模型能處理一部分任務
11:55.900–11:58.618
zh企业的AI使用门槛会下降
企業的AI使用門檻會下降
11:58.618–12:02.242
zh它不需要替代GPT5这种旗舰模型
它不需要替代GPT5這種旗艦模型
12:02.242–12:05.414
zh只要把70%的日常任务吃下来
只要把70%的日常任務吃下來
12:05.414–12:06.999
zh价值就已经很大
價值就已經很大
12:06.999–12:11.756
zh这也是为什么二级字节 内存这个数字有流量潜力
這也是為什麼二級字節記憶體這個概念具有流量潛力
12:11.756–12:14.474
zh它让观众立刻听懂一个变化
它讓觀眾立刻理解一個變化
12:14.474–12:17.100
zhAI不再只属于云端巨头
AI不再僅屬於雲端巨頭
12:17.100–12:19.925
zh哪怕这个结论现在还不能完全成立
即使這個結論目前還無法完全成立
12:19.925–12:21.620
zh它已经打开想象空间
它已經打開了想像空間
12:21.620–12:23.315
zh但这件事不能吹过头
但這件事不能過度吹噓
12:23.315–12:27.081
zhTurbo field fair不是通用魔法
Turbo field fair不是通用魔法
12:27.081–12:31.413
zh它目前主要针对Gemma 426BA 4B文本推理
它目前主要針對Gemma 426BA 4B的文本推理
12:31.413–12:33.108
zh不支持图像音频视频
不支援圖像、音訊和影片
12:33.108–12:36.000
zh也不是一个完整的agent系统
也不是一個完整的agent系統
12:36.000–12:38.412
zh项目readme也写得很清楚
專案readme也寫得很清楚
12:38.412–12:40.997
zh它是model specific
它是model specific
12:40.997–12:44.616
zh不是MLX或LLAMA CPP那种通用包装器
不是MLX或LLAMA CPP那種通用包裝器
12:44.616–12:46.167
zh换模型不一定能照搬
換模型不一定能照搬
12:46.167–12:47.718
zh换硬件也不一定成立
換硬體也不一定適用
12:47.718–12:50.303
zh它需要apple Silicon
它需要Apple Silicon
12:50.303–12:54.300
zh需要macos 26 metal 4 Swift 6.2
需要macOS 26、Metal 4和Swift 6.2
12:54.300–12:56.950
zh还需要足够的SSD空间
還需要足夠的SSD空間
12:56.950–12:59.118
zh它还有一个限时限制
它還有一個限時限制
12:59.118–13:00.805
zhSSD不是内存
SSD不是記憶體
13:00.805–13:03.695
zhSSD再快也比内存慢得多
SSD再快也比記憶體慢得多
13:03.695–13:06.345
zh频繁读取权重会带来延迟
頻繁讀取權重會帶來延遲
13:06.345–13:09.236
zh也可能增加能耗和存储磨损
也可能增加能耗和儲存磨損
13:09.236–13:11.405
zh缓存命中率如果不好
快取命中率如果不好
13:11.405–13:12.609
zh速度就会掉
速度就會掉
13:12.609–13:15.500
zh长上下文复杂提示多轮对话
長上下文複雜提示多輪對話
13:15.500–13:17.927
zh并发请求都会挑战这套设计
併發請求都會挑戰這套設計
13:17.927–13:22.376
zh视频里的23 tokens是M3 Max上的演示
影片裡的23 tokens是M3 Max上的演示
13:22.376–13:30.264
zh8级字节MR MacBook air的5-6tokens更接近低 配用户会看到的体验
8級字節MR MacBook air的5-6tokens更接近低配用戶會看到的體驗
13:30.264–13:31.680
zh能用不等于丝滑
能用不等於絲滑
13:31.680–13:33.500
zh所以正确的判断不是
所以正確的判斷不是
13:33.500–13:36.645
zhMacbook从此取代云GPU
Macbook從此取代雲GPU
13:36.645–13:39.371
zh而是本地AI的下限被抬高了
而是本地AI的下限被抬高了
13:39.371–13:40.629
zh这已经很重要
這已經很重要
13:40.629–13:43.565
zh还要补一个容易被忽略的成本账
還要補一個容易被忽略的成本帳
13:43.565–13:45.452
zh云端AI看起来省心
雲端AI看起來省心
13:45.452–13:47.549
zh但它的成本是持续性的
但它的成本是持續性的
13:47.549–13:49.226
zh用户每个月付订阅
用戶每個月付訂閱
13:49.226–13:51.733
zh开发者按TOKEN付费
開發者按TOKEN付費
13:51.733–13:54.286
zh企业按席位和调用量付钱
企業按席位和調用量付錢
13:54.286–13:56.142
zh用得越多 账单越高
用得越多,帳單越高
13:56.142–13:58.927
zh本地AI的成本更像买设备
本地AI的成本更像買設備
13:58.927–14:00.783
zh前期花钱买Mac
前期花錢買Mac
14:00.783–14:03.104
zh后面用本地算力跑任务
後面用本地算力跑任務
14:03.104–14:07.513
zh对高频任务来说 本地推理会越来越有吸引力
對高頻任務來說,本地推理會越來越有吸引力
14:07.513–14:10.166
zh当然本地也不是不要成本
當然本地也不是不要成本
14:10.166–14:12.167
zh它吃电吃存储吃内存
它吃電、吃儲存、吃記憶體
14:12.167–14:14.168
zh也吃开发者优化时间
也吃開發者優化時間
14:14.168–14:18.171
zh可它的账单不再完全 掌握在模型公司手里
可它的帳單不再完全掌握在模型公司手裡
14:18.171–14:23.285
zh用户买了机器之后 至少有一部分智能能力可以自己用
用戶買了機器之後,至少有一部分智能能力可以自己用
14:23.285–14:25.286
zh这种心理差异很重要
這種心理差異很重要
14:25.286–14:29.900
zh订阅时代 用户越来越讨厌 每个功能都按月收费
訂閱時代,用戶越來越討厭每個功能都按月收費
14:29.900–14:32.775
zh本地AI如果能提供够用体验
本地AI如果能提供夠用體驗
14:32.775–14:35.429
zh就会成为反订阅情绪的出口
就會成為反訂閱情緒的出口
14:35.429–14:37.199
zh这会影响应用开发
這會影響應用開發
14:37.199–14:41.401
zh现在很多AI APP只是套一层云端API
現在很多AI APP只是套一層雲端API
14:41.401–14:44.498
zh用户输入文字 服务器转发给模型
用戶輸入文字,伺服器轉發給模型
14:44.498–14:46.267
zh再把结果显示回来
再把結果顯示回來
14:46.267–14:48.733
zh这种产品门槛低 替代也快
這種產品門檻低,替代也快
14:48.733–14:51.099
zh未来真正有壁垒的应用
未來真正有壁壘的應用
14:51.099–14:57.723
zh可能会把本地模型云端模型本地 文件隐私权限系统操作结合起来
可能會將本地模型、雲端模型、本地文件、隱私權限和系統操作結合起來
14:57.723–15:01.982
zhMac上的本地AI应用 尤其适合这么做
在 Mac 上的本地 AI 應用特別適合這樣做
15:01.982–15:08.300
zh因为它能直接贴近用户的文件 日历邮件代码仓库和创作软件
因為它能直接接觸用戶的文件、日曆、郵件、程式碼倉庫和創作軟體
15:08.300–15:11.919
zh这样一来 竞争重点就从谁接了最强API
這樣一來,競爭重點就不再是誰接入了最強的 API
15:11.919–15:14.533
zh变成谁把AI放进真实工作流
而是變成誰能把 AI 融入真實的工作流程
15:14.533–15:19.157
zhTurbo feelfair没有解决所有产品问题
Turbo feel fair 並未解決所有產品問題
15:19.157–15:21.570
zh但它说明底层可行性在提升
但它顯示底層可行性正在提升
15:21.570–15:24.787
zh底层每提升一点 应用层就多一批可能
底層每提升一點,應用層就會多出一批可能性
15:24.787–15:27.200
zhAI行业过去几年一直在讲
過去幾年,AI 行業一直在談論
15:27.200–15:29.985
zh更大模型更大集群更大融资
更大的模型、更大的集群、更大的融資
15:29.985–15:31.377
zh模型越来越强
模型越來越強大
15:31.377–15:33.930
zh但普通用户越来越像租客
但普通用戶卻越來越像租戶
15:33.930–15:37.411
zh账号订阅API云端限制数据上传
帳號訂閱、API、雲端限制、數據上傳
15:37.411–15:40.196
zh所有j能力都隔着一层平台
所有能力都隔著一層平台
15:40.196–15:46.066
zhTurbo field fair 这种项目提醒了一件事
Turbo field fair 這類專案提醒了一件事
15:46.066–15:49.522
zhAI的未来不一定只有超级数据中心
AI 的未來不一定只有超級數據中心
15:49.522–15:52.331
zh也可以有一部分回到个人电脑
也可以有一部分回歸到個人電腦
15:52.331–15:54.275
zh这对开发者也有启发
這對開發者也有啟發
15:54.275–15:56.219
zh以后做本地AI应用
未來開發本地 AI 應用
15:56.219–15:58.380
zh不能只问模型能不能跑
不能只問模型能不能運行
15:58.380–16:00.756
zh还要问模型哪部分必须跑
還要問模型哪部分必須運行
16:00.756–16:02.268
zh哪部分可以缓存
哪部分可以緩存
16:02.268–16:04.212
zh哪部分可以流式读取
哪部分可以串流讀取
16:04.212–16:08.666
zh数据在CPU GPU内存SSD之间搬了几次
數據在 CPU、GPU、記憶體和 SSD 之間搬運了幾次
16:08.666–16:11.925
zhAI应用开发会越来越像系统工程
AI 應用開發會越來越像系統工程
16:11.925–16:15.183
zh谁能少搬一次数据 谁就多一点性能
誰能少搬運一次數據,誰就擁有多一點效能
16:15.183–16:18.442
zh谁能少占一点内存 谁就多一批用户
誰能少佔用一點記憶體,誰就能多獲得一批用戶
16:18.442–16:24.307
zh谁能把模型结构和硬件结构对齐 谁就能把不可能变成勉强可用
誰能將模型結構與硬體結構對齊,誰就能把不可能變成勉強可用
16:24.307–16:28.133
zh这也是苹果生态里 可能出现机会的地方
這也是蘋果生態系中可能出現機會的地方
16:28.133–16:37.995
zh如果开发者围绕metal 统一内存 neural engine 本地文件索引 Spotlight SHORTCUTS做AI工具
如果開發者圍繞 Metal、統一記憶體、Neural Engine、本地文件索引、Spotlight 和 SHORTCUTS 來打造 AI 工具
16:37.995–16:41.802
zhMac可能会变成一个很 独特的本地AI开发平台
Mac 可能會變成一個非常獨特的本地 AI 開發平台
16:41.802–16:43.878
zh不是为了和云端模型硬碰硬
不是為了與雲端模型硬碰硬
16:43.878–16:46.666
zh而是做那些云端不适合做的任务
而是去做那些雲端不適合處理的任務
16:46.666–16:50.148
zh私密离线低延迟贴近个人文件系统
私密、離線、低延遲,且貼近個人文件系統
16:50.148–16:53.863
zh真正的竞争不是 本地和云端谁消灭谁
真正的競爭不是本地與雲端誰消滅誰
16:53.863–16:55.953
zh而是谁掌握默认入口
而是誰能掌握預設入口
16:55.953–16:57.810
zh云端模型会继续强
雲端模型會繼續強大
16:57.810–17:01.757
zh因为训练和最强推理 都离不开巨量算力
因為訓練和最強推理都離不開巨量運算力
17:01.757–17:06.700
zh可是本地模型一旦够用 就会吃掉大量日常任务
可是本地模型一旦夠用,就會吃掉大量日常任務
17:06.700–17:09.374
zh用户不需要每次都请最强模型
用戶不需要每次都請動最強模型
17:09.374–17:11.637
zh写一封邮件 整理会议记录
寫一封郵件、整理會議記錄
17:11.637–17:14.106
zh搜索本地文档 解释一段代码
搜尋本地文件、解釋一段程式碼
17:14.106–17:15.546
zh生成一个小脚本
生成一個小腳本
17:15.546–17:18.837
zh够快够私密够便宜 比绝对最强更重要
夠快、夠私密、夠便宜,這比絕對最強更重要
17:18.837–17:23.569
zh这就是Turbo fillfair事件的流量价值
這就是Turbo fillfair事件的流量價值
17:23.569–17:27.100
zh表面看 它只是内存减少7倍的技术新闻
表面上看,它只是記憶體減少7倍技術新聞
17:27.100–17:30.326
zh往深一层看 它在挑战一个行业共识
往深一層看,它在挑戰一個行業共識
17:30.326–17:32.476
zh大模型必须被云端垄断
大模型必須被雲端壟斷
17:32.476–17:34.412
zh它没有推翻云端AI
它沒有推翻雲端AI
17:34.412–17:36.132
zh但它撕开了一条缝
但它撕開了一條縫
17:36.132–17:41.078
zh接下来要看的不是这个项目 本身能不能变成大众产品
接下來要看的不是這個項目本身能不能變成大眾產品
17:41.078–17:44.304
zh而是它代表的工程路线会不会扩散
而是它代表的工程路線會不會擴散
17:44.304–17:47.100
zh更多MOE模型会不会被专门
更多MOE模型會不會被專門
17:47.100–17:48.736
zh打包成本地流式格式
打包成本地串流格式
17:48.736–17:55.282
zh更多Mac应用会不会接入 本地Openai compatible Server
更多Mac應用會不會接入本地Openai compatible Server
17:55.282–17:58.918
zhapple会不会把类似 思路放进系统级框架
Apple會不會把類似思路放進系統級框架
17:58.918–18:03.282
zh开发者会不会开始为8级字节 16级字节设备认真优化
開發者會不會開始為8位元、16位元設備認真優化
18:03.282–18:05.100
zh而不是默认要求64级
而不是預設要求64位元
18:05.100–18:06.890
zh字节内存和大显卡
記憶體和大顯卡
18:06.890–18:08.681
zh如果这些事情发生
如果這些事情發生
18:08.681–18:11.143
zh本地AI就会从极客演示
本地AI就會從極客演示
18:11.143–18:12.933
zh变成产品基础设施
變成產品基礎設施
18:12.933–18:15.843
zh还有一个变量是模型公司本身
還有一個變數是模型公司本身
18:15.843–18:18.305
zh如果更多模型采用MOE
如果更多模型採用MOE
18:18.305–18:20.543
zh如果更多模型公开权重
如果更多模型公開權重
18:20.543–18:24.066
zh如果更多小模型追上日常任务能力
如果更多小模型追上日常任務能力
18:24.066–18:26.109
zh本地推理就会更快普及
本地推理就會更快普及
18:26.109–18:31.215
zhTurbo Fillfair依赖Gemma4这种结构
Turbo Fillfair依賴Gemma4這種結構
18:31.215–18:33.666
zh不代表所有模型都能这么跑
不代表所有模型都能這麼跑
18:33.666–18:36.934
zh但AI行业已经在往稀疏激活专用小
但AI行業已經在往稀疏激活專用小
18:36.934–18:39.589
zh模型端侧模型模型路由方向走
模型端側模型模型路由方向走
18:39.589–18:41.632
zh云端超级模型负责难题
雲端超級模型負責難題
18:41.632–18:43.366
zh端侧模型负责日常
端側模型負責日常
18:43.366–18:45.909
zh多个模型组合起来完成任务
多個模型組合起來完成任務
18:45.909–18:48.876
zh这个方向对Nvidia是提醒
這個方向對Nvidia是提醒
18:48.876–18:50.148
zh对苹果是机会
對蘋果是機會
18:50.148–18:51.843
zh对开发者是新战场
對開發者是新戰場
18:51.843–18:55.658
zhNVIDIA仍然会统治训练和高端推理
NVIDIA仍然會統治訓練和高端推理
18:55.658–18:57.354
zh可是如果越来越多
可是如果越來越多
18:57.354–18:59.049
zh日常推理回到端侧
日常推理回到端側
18:59.049–19:01.169
zh市场对所有AI都必须
市場對所有AI都必須
19:01.169–19:03.733
zh上云GPU的想象会降温
上雲GPU的想像會降溫
19:03.733–19:06.438
zh苹果不一定抢走数据中心的钱
蘋果不一定搶走資料中心的錢
19:06.438–19:09.350
zh但可以抢回个人设备的智能入口
但可以搶回個人裝置的智慧入口
19:09.350–19:12.055
zh开发者如果能把本地模型用好
開發者如果能把本機模型用好
19:12.055–19:14.968
zh就不用完全被API成本牵着走
就不用完全被API成本牽著走
19:14.968–19:16.424
zh观众继续听下去
觀眾繼續聽下去
19:16.424–19:18.089
zh应该带走的判断是
應該帶走的判斷是
19:18.089–19:20.169
zh这不是一个小工具新闻
這不是小工具新聞
19:20.169–19:22.866
zh而是AI权力结构的小变化
而是AI權力結構的小變化
19:22.866–19:24.494
zh以前能力在云端
以前能力在雲端
19:24.494–19:26.122
zh用户只是调用者
用戶只是呼叫者
19:26.122–19:29.145
zh现在一部分能力开始回到设备
現在一部分能力開始回到裝置
19:29.145–19:31.703
zh用户重新拥有一点控制权
用戶重新擁有一點控制權
19:31.703–19:33.331
zh这一点现在还小
這一點現在還小
19:33.331–19:34.726
zh但方向很清楚
但方向很清楚
19:34.726–19:37.051
zh只要端侧模型继续变强
只要端側模型繼續變強
19:37.051–19:40.075
zh本地AI就会从能跑走向好用
本地AI就會從能跑走向好用
19:40.075–19:42.533
zh再从好用走向默认存在
再從好用走向預設存在
19:42.533–19:45.477
zh接下来还要看一个更现实的变量
接下來還要看一個更現實的變數
19:45.477–19:46.318
zh内存配置
記憶體配置
19:46.318–19:48.000
zh苹果这些年一直被
蘋果這些年來一直
19:48.000–19:50.312
zh吐槽入门Mac内存太小
被吐槽入門 Mac 記憶體太小
19:50.312–19:51.574
zh升级内存太贵
升級記憶體太貴
19:51.574–19:53.887
zh过去这个槽点主要影响剪
過去這個槽點主要影響剪
19:53.887–19:56.199
zh视频跑虚拟机开大型项目
影片、跑虛擬機、開啟大型專案
19:56.199–19:57.881
zh到了本地AI时代
到了本地 AI 時代
19:57.881–20:00.404
zh它会变成更核心的购买理由
它會變成更核心的購買理由
20:00.404–20:01.666
zh8吉字节能跑
8GB 能跑
20:01.666–20:03.820
zh不代表8吉字节最舒服
不代表 8GB 最舒適
20:03.820–20:07.482
zh16级字节会成为更合理的AI入门线
16GB 會成為更合理的 AI 入門門檻
20:07.482–20:10.283
zh32级字节64级字节会变成
32GB、64GB 會變成
20:10.283–20:12.868
zh开发者和重度用户的新分界
開發者和重度使用者的新分水嶺
20:12.868–20:16.745
zhTurbo field day把门槛打低
Turbo Field Day 把門檻打低
20:16.745–20:18.684
zh不代表硬件需求消失
不代表硬體需求消失
20:18.684–20:21.900
zh而是让更多人第一次有资格进场
而是讓更多人第一次有資格進場
20:21.900–20:24.671
zh这对苹果的产品策略很微妙
這對蘋果的產品策略很微妙
20:24.671–20:28.829
zh如果本地AI真的变成Mac的重要卖点
如果本地 AI 真的變成 Mac 的重要賣點
20:28.829–20:30.907
zh苹果就会有更强理由
蘋果就會有更强理由
20:30.907–20:33.448
zh推动用户买更高内存版本
推動用戶購買更高記憶體版本
20:33.448–20:36.912
zh用户过去买内存是为了今天的软件
用戶過去購買記憶體是為了當前的軟體
20:36.912–20:38.067
zh未来买内存
未來購買記憶體
20:38.067–20:41.300
zh可能是为了未来几年的本地模型
可能是為了未來幾年的本地模型
20:41.466–20:43.592
zh苹果当然喜欢这个故事
蘋果當然喜歡這個故事
20:43.592–20:46.568
zh因为它能提高Mac的平均售价
因為它能提高Mac的平均售價
20:46.568–20:48.269
zh但用户也会更敏感
但用戶也會更敏感
20:48.269–20:50.820
zh既然AI要在设备端跑入门
既然AI要在設備端運行入門
20:50.820–20:52.521
zh配置就不能太寒酸
配置就不能太寒酸
20:52.521–20:54.860
zh苹果如果继续把内存升级
蘋果如果繼續將記憶體升級
20:54.860–20:56.135
zh价格定得很高
價格定得很高
20:56.135–20:58.687
zh反而会限制本地AI的普及
反而會限制本地AI的普及
20:58.687–21:00.766
zh另一个变量是SSD
另一個變數是SSD
21:00.766–21:04.406
zhTurbo field fair的路线
Turbo field fair的路線
21:04.406–21:06.761
zh把SSD从单纯存储变成
把SSD從單純儲存變成
21:06.761–21:08.473
zh推理链路的一部分
推理鏈路的一部分
21:08.473–21:10.828
zhSSD速度寿命文件布局
SSD速度壽命文件佈局
21:10.828–21:12.969
zh系统缓存都会影响体验
系統快取都會影響體驗
21:12.969–21:16.395
zh过去用户选电脑看SSD主要是容量
過去用戶選電腦看SSD主要是容量
21:16.395–21:18.536
zh未来本地AI应用多了
未來本地AI應用多了
21:18.536–21:21.733
zhSSD读写性能也会被重新关注
SSD讀寫性能也會被重新關注
21:21.733–21:23.596
zh模型权重不再只是躺
模型權重不再只是靜態存在
21:23.596–21:25.251
zh在硬盘里的大文件
存在硬碟裡的大檔案
21:25.251–21:28.149
zh而是生成每个TOKEN时可能
而是生成每個TOKEN時可能
21:28.149–21:30.218
zh被反复访问的工作材料
被反覆訪問的工作材料
21:30.218–21:32.909
zh这会把电脑硬件评价体系改掉
這會改變電腦硬體評價體系
21:32.909–21:36.013
zh过去AI电脑宣传喜欢堆TOPS
過去AI電腦宣傳喜歡堆疊TOPS
21:36.013–21:39.117
zh以后真正懂行的人会看一整套链路
以後真正懂行的人會看一整套鏈路
21:39.117–21:40.766
zh内存带宽够不够
記憶體頻寬夠不夠
21:40.766–21:43.565
zhCPU和GPU是否共享内存
CPU和GPU是否共享記憶體
21:43.565–21:45.933
zhSSD读取延迟如何系统
SSD讀取延遲如何
21:45.933–21:48.517
zhAPI能不能减少拷贝模型
系統API能不能減少模型拷貝
21:48.517–21:50.455
zh格式是不是贴合硬件
格式是不是貼合硬體
21:50.455–21:53.254
zh单看一个算力数字很容易被骗
單看一個算力數字很容易上當
21:53.254–21:56.053
zhAI推理的瓶颈可能不在算力
AI推理的瓶頸可能不在算力
21:56.053–21:57.345
zh而在数据搬运
而在資料搬運
21:57.345–22:02.566
zh这也是Turbo fair给普通观众上的一课
這也是Turbo fair給普通觀眾上的一課
22:02.566–22:05.346
zhAI不是只有模型聪不聪明
AI不只是模型聰不聰明
22:05.346–22:07.199
zh还有数据怎么流动
還有資料怎麼流動
22:07.199–22:10.442
zh同一个模型放在不同硬件结构上
同一個模型放在不同硬體結構上
22:10.442–22:12.527
zh体验可能完全不一样
體驗可能完全不一樣
22:12.527–22:15.538
zh未来优秀的本地AI产品背后
未來優秀的本地AI產品背後
22:15.538–22:18.318
zh一定不是简单下载一个模型
絕非只是簡單下載一個模型
22:18.318–22:20.966
zh而是围绕设备做深度优化
而是圍繞設備進行深度優化
22:20.966–22:22.652
zh最后给一个明确判断
最後給出一個明確的判斷
22:22.652–22:25.275
zh苹果芯片这次赢的不是模型参数
蘋果晶片這次贏的不是模型參數
22:25.275–22:27.898
zh也不是Benchmark排名
也不是Benchmark排名
22:27.898–22:29.958
zh而是设备端AI的叙事权
而是設備端AI的話語權
22:29.958–22:33.518
zh过去AI叙事被NVIDIA和云厂商拿走
過去AI的話語權被NVIDIA和雲端廠商拿走
22:33.518–22:37.077
zh大家谈的都是GPU集群数据中心和API
大家談的都是GPU叢集、資料中心和API
22:37.077–22:40.666
enTurbo field fair
Turbo 領域的公平競賽
22:40.666–22:43.193
zh让另一个问题重新回到桌面
讓另一個問題重新回到桌面
22:43.193–22:45.510
zh如果模型不必全部进内存
如果模型不必全部進入記憶體
22:45.510–22:48.248
zh如果CPU和GPU共享内存
如果CPU和GPU共享記憶體
22:48.248–22:50.354
zh如果SSD能参与推理
如果SSD能參與推論
22:50.354–22:53.303
zh如果应用能直接贴着硬件写本地
如果應用程式能直接貼著硬體寫本地
22:53.303–22:56.041
zh设备还能不能变成AI的主场
設備還能變成AI的主場嗎
22:56.041–22:57.094
zh答案还没定
答案尚未確定
22:57.094–22:59.200
zh但这次Mac不再只是
但這次Mac不再只是
22:59.200–23:00.987
zh调用云模型的屏幕
調用雲端模型的螢幕
23:00.987–23:02.997
zh它开始像一台真正能
它開始像一台真正能
23:02.997–23:05.007
zh承载AI的个人机器
承載AI的個人設備
23:05.007–23:06.793
zh如果这个趋势继续
如果這個趨勢持續下去
23:06.793–23:09.920
zh未来买电脑时就会多一个新问题
未來購買電腦時就會多出一個新問題
23:09.920–23:12.600
zh这台机器能不能把个人资料
這台設備能否將個人資料
23:12.600–23:15.057
zh工作流和本地模型连起来
工作流程和本地模型串連起來
23:15.057–23:17.067
zh过去电脑拼的是性能
過去電腦比拼的是效能
23:17.067–23:19.866
zh后来拼的是续航和生态
後來比拼的是續航和生態系
23:19.866–23:22.633
zh接下来可能要拼本地智能密度
接下來可能要比拼的是本地智能密度
23:22.633–23:25.613
zh苹果芯片这次露出的牌就在这里
蘋果晶片這次露出的底牌就在這裡
23:25.613–23:28.806
zh谁能让AI更贴近用户自己的设备
誰能讓AI更貼近用戶自己的設備
23:28.806–23:29.870
zh自己的文件
自己的檔案
23:29.870–23:31.360
zh自己的隐私边界
自己的隱私界線
23:31.360–23:33.063
zh谁就能在云端巨头
誰就能在雲端巨頭
23:33.063–23:34.766
zh之外拿回一块入口
之外奪回一塊入口