WEBVTT
Kind: captions
Language: zh

00:00:00.100 --> 00:00:02.466
一台8G字节内存的MacBook

00:00:02.700 --> 00:00:05.333
居然能跑26B级别的大模型

00:00:05.466 --> 00:00:07.300
这件事听起来很反常

00:00:07.466 --> 00:00:09.100
过去谈本地AI

00:00:09.200 --> 00:00:11.566
大家第一反应都是显存不够

00:00:11.700 --> 00:00:12.700
内存不够

00:00:12.766 --> 00:00:14.266
电脑风扇起飞

00:00:14.500 --> 00:00:16.100
模型还没加载完

00:00:16.166 --> 00:00:17.533
系统先卡死

00:00:17.866 --> 00:00:19.733
26B参数这种模型

00:00:20.000 --> 00:00:22.800
正常想象里至少要一台很贵的机器

00:00:23.000 --> 00:00:25.800
或者干脆丢到云端GPU上跑

00:00:25.900 --> 00:00:28.533
可是最近一个叫Turbo fillfair的项目

00:00:28.533 --> 00:00:31.566
把Google Gemma 426B a四b

00:00:31.566 --> 00:00:33.733
跑到了apple Silicon Mac上

00:00:33.933 --> 00:00:36.066
而且运行时权重加4K

00:00:36.266 --> 00:00:38.966
KV CACHE只占大约二级字节内存

00:00:39.066 --> 00:00:40.666
这个数字最狠的地方

00:00:40.766 --> 00:00:42.166
不是省了一点内存

00:00:42.400 --> 00:00:44.266
而是把本地AI的门槛

00:00:44.266 --> 00:00:45.800
直接往下砸了一层

00:00:46.333 --> 00:00:49.533
原本14.3GB左右的模型安装体积

00:00:49.766 --> 00:00:51.666
不需要整包塞进内存

00:00:51.933 --> 00:00:54.700
项目只把常驻核心留在内存里

00:00:54.800 --> 00:00:57.800
把大部分专家权重放在SSD上

00:00:58.066 --> 00:00:59.900
需要哪一块再读哪一块

00:01:00.066 --> 00:01:03.166
视频里在M3Max上跑到23.4tokens

00:01:03.566 --> 00:01:07.300
项目readme里也记录了8GBM二Macbook air

00:01:07.300 --> 00:01:09.866
可以跑到5.1-6.3tokens

00:01:10.333 --> 00:01:13.133
这个速度不是数据中心级别

00:01:13.800 --> 00:01:15.300
但已经不是玩具

00:01:15.366 --> 00:01:17.133
这件事真正值得看

00:01:17.333 --> 00:01:20.100
不是某个开发者做了一个炫技项目

00:01:20.133 --> 00:01:22.866
而是本地AI的路线开始变了

00:01:22.866 --> 00:01:25.333
过去本地大模型的思路很简单

00:01:25.900 --> 00:01:26.900
模型越大

00:01:26.900 --> 00:01:27.866
硬件越贵

00:01:28.400 --> 00:01:32.200
想跑7B准备一块不错的消费级显卡

00:01:32.533 --> 00:01:35.366
想跑30B开始考虑大显存

00:01:35.733 --> 00:01:37.366
想跑更大的moe

00:01:37.366 --> 00:01:38.966
就看云服务账单

00:01:39.133 --> 00:01:41.566
用户被迫接受一个隐含规则

00:01:41.933 --> 00:01:44.666
AI越聪明越远离个人电脑

00:01:45.166 --> 00:01:47.933
越强的模型越集中在云厂商

00:01:47.966 --> 00:01:50.666
GPU集群和数据中心手里

00:01:50.766 --> 00:01:53.733
Turbo fuel fair给出的反方向答案是

00:01:54.166 --> 00:01:55.333
模型可以很大

00:01:55.333 --> 00:01:58.366
但每一秒真正用到的部分可能很小

00:01:58.366 --> 00:02:00.000
这要从Moe讲起

00:02:00.266 --> 00:02:02.400
Moe叫mixture of experts

00:02:02.733 --> 00:02:04.100
混合专家模型

00:02:04.133 --> 00:02:07.333
普通模型像一个巨大的统一车间

00:02:07.500 --> 00:02:08.666
每个TOKEN进来

00:02:08.666 --> 00:02:10.733
很多权重都要参与计算

00:02:11.000 --> 00:02:14.533
Moe更像一座有128个小工位的工厂

00:02:14.600 --> 00:02:15.966
每个TOKEN进来

00:02:16.100 --> 00:02:17.766
Router会判断这次该找

00:02:17.766 --> 00:02:19.166
哪几个专家处理

00:02:19.400 --> 00:02:21.766
编码是26B a4b

00:02:22.200 --> 00:02:23.766
总参数是26B

00:02:23.800 --> 00:02:25.266
但每个TOKEN实际激活

00:02:25.266 --> 00:02:27.533
的大约是3.88B参数

00:02:27.733 --> 00:02:29.266
模型名义上很大

00:02:29.266 --> 00:02:30.766
但每一步真正干活

00:02:30.766 --> 00:02:32.400
的只是其中一部分

00:02:32.600 --> 00:02:35.500
过去这件事的好处主要体现在云端

00:02:36.266 --> 00:02:38.766
模型公司可以用更大的总参数

00:02:38.866 --> 00:02:41.100
保持相对可控的推理成本

00:02:41.266 --> 00:02:43.266
可是Turbo Fillfair把这个

00:02:43.266 --> 00:02:45.600
特性拿到了本地机器上

00:02:45.966 --> 00:02:48.300
既然每个TOKEN只用几个专家

00:02:48.533 --> 00:02:51.666
那为什么要把所有专家都常驻内存

00:02:51.866 --> 00:02:53.900
于是他把模型拆成两堆

00:02:54.400 --> 00:02:56.733
第一堆是每个TOKEN都要用的东西

00:02:56.966 --> 00:03:01.933
比如attention  router  embedding  shared expert

00:03:02.133 --> 00:03:03.500
还有KV CACHE

00:03:03.933 --> 00:03:06.200
这一部分大约1.35吉字节

00:03:06.466 --> 00:03:08.266
加上运行需要的缓存

00:03:08.600 --> 00:03:09.900
留在内存里

00:03:09.900 --> 00:03:12.800
第二堆是专家权重 30层

00:03:13.266 --> 00:03:15.166
每层128个expert

00:03:15.333 --> 00:03:17.133
每个expert只有几MB

00:03:17.333 --> 00:03:18.866
加起来是主要体积

00:03:19.066 --> 00:03:20.733
这一堆不常驻内存

00:03:21.066 --> 00:03:22.733
只放在SSD上

00:03:22.800 --> 00:03:24.200
每生成一个TOKEN

00:03:24.366 --> 00:03:25.866
模型先完成attention

00:03:26.066 --> 00:03:29.666
再由router决定当前层要用哪8个专家

00:03:29.866 --> 00:03:31.400
CPU接到名单之后

00:03:31.400 --> 00:03:33.766
去SSD读取对应expert

00:03:33.900 --> 00:03:36.533
放到GPU能看到的内存区域里

00:03:36.866 --> 00:03:37.966
metal接着算

00:03:38.300 --> 00:03:39.933
这个过程听起来麻烦

00:03:40.100 --> 00:03:42.200
但关键在apple Silicon

00:03:42.400 --> 00:03:43.600
传统PC上

00:03:43.733 --> 00:03:47.100
CPU和独立GPU通常分两套内存

00:03:47.600 --> 00:03:50.366
SSD读出来的数据先进系统内存

00:03:50.766 --> 00:03:53.866
再通过Pcie总线搬到显卡VRAM

00:03:53.966 --> 00:03:55.466
模型如果每个TOKEN都

00:03:55.466 --> 00:03:57.600
要频繁从SSD拉权重

00:03:57.866 --> 00:03:59.000
再搬进VRAM

00:03:59.000 --> 00:04:00.500
中间的拷贝和总线

00:04:00.500 --> 00:04:02.933
延迟会直接把速度打穿

00:04:03.400 --> 00:04:04.700
数据不是不会动

00:04:04.700 --> 00:04:05.900
而是动得太慢

00:04:05.900 --> 00:04:06.766
动得太贵

00:04:06.933 --> 00:04:09.000
apple Silicon的统一内存

00:04:09.000 --> 00:04:10.866
架构把这个问题变小了

00:04:11.200 --> 00:04:14.500
CPU和GPU看的是同一块物理内存

00:04:14.700 --> 00:04:17.366
CPU从SSD读进来的数据可以

00:04:17.366 --> 00:04:20.333
直接成为GPU要用的metal buffer

00:04:20.533 --> 00:04:21.733
少了一次拷贝

00:04:21.966 --> 00:04:23.666
少了一段总线搬运

00:04:23.733 --> 00:04:25.500
也少了传统独显架构

00:04:25.500 --> 00:04:27.566
里最难受的VRAM墙

00:04:27.933 --> 00:04:28.900
这就是为什么这个

00:04:28.900 --> 00:04:30.766
项目特别像一把钥匙

00:04:31.066 --> 00:04:34.066
它不是证明苹果芯片算力天下无敌

00:04:34.266 --> 00:04:37.333
而是证明apple Silicon的结构刚好适合

00:04:37.333 --> 00:04:40.100
一种边读边算的本地推理路线

00:04:40.500 --> 00:04:41.566
还不止这个

00:04:41.700 --> 00:04:43.733
Turbo fieldfare没有把磁盘上

00:04:43.733 --> 00:04:46.133
的权重用普通格式存着

00:04:46.266 --> 00:04:48.066
等读取之后再解包

00:04:48.800 --> 00:04:51.066
再转成GPU需要的布局

00:04:51.333 --> 00:04:52.666
它在安装阶段就把

00:04:52.666 --> 00:04:55.133
模型重新打包成Dubo格式

00:04:55.733 --> 00:04:57.766
尽量让磁盘里的数据就是

00:04:57.766 --> 00:05:00.000
metal kernel可以消费的样子

00:05:00.133 --> 00:05:02.133
读文件就是加载权重

00:05:02.800 --> 00:05:04.733
中间少一次转换就少

00:05:04.733 --> 00:05:06.866
一次内存浪费和时间浪费

00:05:07.066 --> 00:05:08.200
它还用了缓存

00:05:08.366 --> 00:05:10.533
每一层128个expert

00:05:10.666 --> 00:05:13.366
不可能每次都从SSD读

00:05:13.766 --> 00:05:16.066
项目给每层留了16个expert

00:05:16.300 --> 00:05:18.966
常位常用的expert放在内存里

00:05:19.166 --> 00:05:21.933
router如果选中已经缓存的expert

00:05:21.933 --> 00:05:23.100
立刻就能用

00:05:23.600 --> 00:05:24.766
如果没命中

00:05:24.900 --> 00:05:26.566
再从SSD读取

00:05:26.600 --> 00:05:28.333
把不常用的挤出去

00:05:28.466 --> 00:05:30.566
它用的是LFU

00:05:31.100 --> 00:05:32.466
least frequently used

00:05:32.766 --> 00:05:35.466
也就是踢掉使用频率最低的专家

00:05:35.733 --> 00:05:38.166
而不是简单踢掉最久没用的

00:05:38.166 --> 00:05:39.533
这个选择很重要

00:05:39.800 --> 00:05:42.500
因为moe的路由并不是完全随机

00:05:42.966 --> 00:05:44.700
有些专家在很多TOKEN

00:05:44.700 --> 00:05:46.300
上都会被反复选中

00:05:46.733 --> 00:05:48.333
有些专家很少出现

00:05:48.466 --> 00:05:50.600
按频率留下热门专家

00:05:50.766 --> 00:05:52.400
比按时间留下最近

00:05:52.400 --> 00:05:54.166
专家更适合这个任务

00:05:54.366 --> 00:05:56.333
项目押注的是语言

00:05:56.333 --> 00:05:58.400
生成的专家选择有规律

00:05:58.866 --> 00:06:00.266
只要规律足够强

00:06:00.366 --> 00:06:03.066
SSD读取就不会把速度拖死

00:06:03.066 --> 00:06:05.800
所以它能做到一个很奇怪的效果

00:06:06.266 --> 00:06:10.133
明明模型大部分权重还在SSD上

00:06:10.466 --> 00:06:13.100
实际体验却没有慢到不能用

00:06:13.133 --> 00:06:15.900
这件事对普通用户意味着什么

00:06:16.000 --> 00:06:19.300
第一本地AI不一定只能靠堆硬件

00:06:19.300 --> 00:06:21.366
过去用户想跑更好的模型

00:06:21.666 --> 00:06:23.200
唯一办法是买更大

00:06:23.200 --> 00:06:26.133
内存更大显存更贵显卡

00:06:26.166 --> 00:06:27.933
这个逻辑会把个人电脑

00:06:27.933 --> 00:06:29.800
推向数据中心的反面

00:06:30.366 --> 00:06:31.333
云越来越强

00:06:31.333 --> 00:06:33.366
个人设备越来越像终端

00:06:33.600 --> 00:06:36.466
Turbo field fair展示的是另一条路

00:06:36.666 --> 00:06:39.866
如果模型结构文件布局操作系统

00:06:39.900 --> 00:06:42.933
芯片内存架构和运行时配合得足够

00:06:42.933 --> 00:06:43.500
好

00:06:43.500 --> 00:06:46.700
小机器也能吃下一部分大模型能力

00:06:46.966 --> 00:06:48.333
它不是免费午餐

00:06:48.500 --> 00:06:50.500
SSD读取有延迟模型

00:06:50.866 --> 00:06:51.966
限制在特定结构

00:06:51.966 --> 00:06:54.400
速度和云端旗舰模型没法比

00:06:54.400 --> 00:06:56.100
但它证明了一个方向

00:06:56.333 --> 00:07:00.333
优化路线不是只剩买更贵的GPU第二

00:07:00.933 --> 00:07:03.800
apple Silicon的AI价值可能被低估了

00:07:03.800 --> 00:07:05.566
过去评价AI硬件

00:07:05.800 --> 00:07:07.166
大家喜欢看TOPS

00:07:07.733 --> 00:07:09.966
看GPU看显存大小

00:07:10.133 --> 00:07:12.766
苹果在这场叙事里经常显得尴尬

00:07:12.933 --> 00:07:14.400
它的neural engine很强

00:07:14.400 --> 00:07:16.366
但开发生态不如CUDA

00:07:16.566 --> 00:07:17.966
统一内存很漂亮

00:07:17.966 --> 00:07:19.933
但高配内存价格很贵

00:07:20.133 --> 00:07:22.166
Mac很适合创作和开发

00:07:22.366 --> 00:07:24.133
但说到本地大模型

00:07:24.400 --> 00:07:26.333
很多人还是先想到Nvidia

00:07:26.533 --> 00:07:29.266
Turbo field fair把问题换了一个角度

00:07:29.400 --> 00:07:32.166
苹果真正的优势不一定是单点算力

00:07:32.300 --> 00:07:35.966
而是CPU  GPU内存SSD

00:07:35.966 --> 00:07:38.466
metal和系统API的整合

00:07:38.666 --> 00:07:40.900
只要工作负载设计的够贴合

00:07:41.200 --> 00:07:43.900
它可以用更少的数据搬运换性能

00:07:44.100 --> 00:07:45.700
这和手机时代很像

00:07:45.800 --> 00:07:48.933
苹果不一定每个硬件参数都最大

00:07:49.300 --> 00:07:51.900
但它能把芯片系统

00:07:51.966 --> 00:07:54.400
应用和框架整在一起

00:07:54.466 --> 00:07:56.566
让开发者吃到一体化红利

00:07:57.300 --> 00:07:59.533
本地AI也可能走类似路线

00:07:59.600 --> 00:08:01.733
不是每个人都需要训练模型

00:08:01.800 --> 00:08:04.500
但很多人需要在个人设备上跑推理

00:08:04.966 --> 00:08:10.300
写作翻译代码补全文件整理私人

00:08:10.300 --> 00:08:13.866
知识库离线助手隐私敏感的资料

00:08:13.866 --> 00:08:14.500
分析

00:08:14.500 --> 00:08:17.100
如果这些场景能在普通Mac上运行

00:08:17.700 --> 00:08:19.400
苹果就不是旁观者

00:08:19.600 --> 00:08:23.066
第三云端AI的垄断感会被削弱

00:08:23.166 --> 00:08:25.866
过去AI服务天然集中在云端

00:08:25.966 --> 00:08:27.300
因为模型太大

00:08:27.300 --> 00:08:28.366
推理太贵

00:08:28.466 --> 00:08:29.933
用户设备跑不动

00:08:29.966 --> 00:08:31.966
集中在云端就带来几个问题

00:08:32.266 --> 00:08:33.333
数据要上传

00:08:33.566 --> 00:08:34.866
隐私要交出去

00:08:34.966 --> 00:08:36.400
订阅费要长期付

00:08:36.533 --> 00:08:38.100
网络断了就没法用

00:08:38.200 --> 00:08:39.500
模型公司改规则

00:08:39.500 --> 00:08:40.733
用户只能接受

00:08:41.000 --> 00:08:43.400
本地AI如果慢慢可用

00:08:43.600 --> 00:08:45.266
用户会多一个选择

00:08:45.300 --> 00:08:47.133
不是所有任务都要上云

00:08:47.300 --> 00:08:50.166
私人笔记公司内部文档离线

00:08:50.166 --> 00:08:53.400
代码助手本地搜索个人自动化

00:08:53.400 --> 00:08:56.333
这些场景其实很适合在设备端完成

00:08:56.500 --> 00:08:58.100
云端负责最强模型

00:08:58.400 --> 00:09:00.400
本地负责高频隐私

00:09:00.500 --> 00:09:02.300
低成本和及时响应

00:09:02.366 --> 00:09:03.966
这会改变产品形态

00:09:04.133 --> 00:09:05.866
未来AI助手可能不是

00:09:05.866 --> 00:09:07.800
一个纯云端聊天窗口

00:09:07.800 --> 00:09:09.500
而是一套混合系统

00:09:09.600 --> 00:09:11.266
简单任务本地完成

00:09:11.400 --> 00:09:12.800
复杂任务再上云

00:09:13.200 --> 00:09:14.933
敏感文件本地分析

00:09:15.100 --> 00:09:16.900
公开资料云端补充

00:09:17.100 --> 00:09:19.066
离线场景用本地模型

00:09:19.200 --> 00:09:20.933
联网场景用大模型

00:09:21.100 --> 00:09:22.966
用户感觉不到背后切换

00:09:22.966 --> 00:09:24.933
只知道电脑更聪明了

00:09:24.933 --> 00:09:27.133
这也是苹果真正想要的方向

00:09:27.366 --> 00:09:29.266
苹果不会轻易把用户数据

00:09:29.266 --> 00:09:31.133
全部交给第三方云模型

00:09:31.700 --> 00:09:32.933
他更喜欢把智能

00:09:32.933 --> 00:09:34.766
功能藏进设备和系统

00:09:34.966 --> 00:09:36.666
apple intelligence的战略一直

00:09:36.666 --> 00:09:39.400
强调设备端处理和隐私边界

00:09:39.666 --> 00:09:43.100
问题在于设备端模型能力如果太弱

00:09:43.133 --> 00:09:45.300
体验就会被云端模型拉开

00:09:45.466 --> 00:09:46.600
Turbo field fair

00:09:47.100 --> 00:09:49.333
这种项目说明设备端的

00:09:49.333 --> 00:09:51.800
能力上限还有很多工程空间

00:09:51.900 --> 00:09:54.066
这里要把苹果的处境讲透

00:09:54.366 --> 00:09:55.800
AI这轮浪潮里

00:09:55.800 --> 00:09:57.500
苹果一直显得慢半拍

00:09:57.733 --> 00:09:59.700
Openai抢走聊天入口

00:09:59.800 --> 00:10:01.700
Google抢搜索和Android

00:10:01.866 --> 00:10:04.866
Microsoft把copilot塞进Windows和office

00:10:05.166 --> 00:10:06.933
NVIDIA拿走算力叙事

00:10:07.166 --> 00:10:09.500
苹果虽然发布apple intelligence

00:10:09.800 --> 00:10:12.066
但市场反应一直不算兴奋

00:10:12.333 --> 00:10:13.366
原因很简单

00:10:13.766 --> 00:10:15.500
苹果不是靠开放API和

00:10:15.500 --> 00:10:17.100
云模型赚钱的公司

00:10:17.300 --> 00:10:20.100
它擅长的是把能力变成系统体验

00:10:20.133 --> 00:10:21.566
可大模型初期最

00:10:21.566 --> 00:10:23.266
耀眼的能力都在云端

00:10:23.666 --> 00:10:25.666
苹果的优势一时很难展示

00:10:25.866 --> 00:10:29.133
Turbo field day这类项目的意义就在于

00:10:29.166 --> 00:10:31.733
它让苹果的优势重新有用

00:10:31.733 --> 00:10:33.466
如果AI的未来只是谁

00:10:33.466 --> 00:10:34.900
有最大数据中心

00:10:35.466 --> 00:10:37.000
苹果确实不占主场

00:10:37.066 --> 00:10:39.566
它没有Nvidia那种GPU生态

00:10:39.800 --> 00:10:41.700
也没有Microsoft Azure或

00:10:41.700 --> 00:10:43.600
Google cloud那种云入口

00:10:43.600 --> 00:10:45.600
但如果未来一部分AI

00:10:45.600 --> 00:10:47.366
工作要回到设备端

00:10:47.600 --> 00:10:49.666
苹果手里的筹码就多了

00:10:49.800 --> 00:10:50.866
它有统一内存

00:10:50.900 --> 00:10:52.866
有自研芯片有metal

00:10:52.900 --> 00:10:54.733
有强控制的操作系统

00:10:54.800 --> 00:10:56.366
有高端用户设备

00:10:56.500 --> 00:10:57.900
也有一群愿意花钱

00:10:57.900 --> 00:10:59.500
买稳定体验的用户

00:10:59.566 --> 00:11:02.733
这件事最适合用一个普通场景理解

00:11:02.800 --> 00:11:04.500
一个用户坐在飞机上

00:11:04.500 --> 00:11:05.366
没有网路

00:11:05.733 --> 00:11:08.966
想让电脑整理本地笔记总结PDF

00:11:09.166 --> 00:11:10.533
查找项目文档

00:11:10.666 --> 00:11:12.466
生成一段邮件草稿

00:11:12.533 --> 00:11:14.700
如果所有AI都依赖云端

00:11:14.733 --> 00:11:17.066
这些任务马上变成半残废

00:11:17.100 --> 00:11:19.000
可是如果Mac本地能跑

00:11:19.000 --> 00:11:20.400
一个够用的模型

00:11:20.600 --> 00:11:22.533
很多事情就能直接做

00:11:22.666 --> 00:11:24.133
速度不一定顶级

00:11:24.500 --> 00:11:25.933
能力不一定最强

00:11:26.100 --> 00:11:29.200
但它能离线私密低延迟

00:11:29.800 --> 00:11:32.366
而且不需要每次把资料传出去

00:11:32.466 --> 00:11:33.900
对企业也是一样

00:11:34.333 --> 00:11:36.333
很多公司不是不想用AI

00:11:36.566 --> 00:11:37.733
而是不敢把内部

00:11:37.733 --> 00:11:39.900
资料全部丢给外部API

00:11:40.100 --> 00:11:42.566
法律合同源代码客户

00:11:42.566 --> 00:11:45.300
数据医疗资料财务表格

00:11:45.300 --> 00:11:46.866
这些内容一旦上传

00:11:46.866 --> 00:11:49.566
就牵涉权限审计地区

00:11:49.566 --> 00:11:51.366
合规和数据泄露风险

00:11:51.666 --> 00:11:53.766
如果本地或私有设备端

00:11:53.800 --> 00:11:55.700
模型能处理一部分任务

00:11:55.900 --> 00:11:58.133
企业的AI使用门槛会下降

00:11:58.266 --> 00:12:01.600
它不需要替代GPT5这种旗舰模型

00:12:02.100 --> 00:12:05.266
只要把70%的日常任务吃下来

00:12:05.333 --> 00:12:06.933
价值就已经很大

00:12:06.966 --> 00:12:08.500
这也是为什么二级字节

00:12:08.500 --> 00:12:10.933
内存这个数字有流量潜力

00:12:11.100 --> 00:12:13.700
它让观众立刻听懂一个变化

00:12:14.300 --> 00:12:16.966
AI不再只属于云端巨头

00:12:17.100 --> 00:12:19.733
哪怕这个结论现在还不能完全成立

00:12:19.966 --> 00:12:21.733
它已经打开想象空间

00:12:21.900 --> 00:12:23.933
但这件事不能吹过头

00:12:24.166 --> 00:12:26.333
Turbo field fair不是通用魔法

00:12:26.466 --> 00:12:30.800
它目前主要针对Gemma 426BA 4B文本推理

00:12:31.000 --> 00:12:33.500
不支持图像音频视频

00:12:33.800 --> 00:12:35.933
也不是一个完整的agent系统

00:12:36.000 --> 00:12:38.000
项目readme也写得很清楚

00:12:38.266 --> 00:12:39.600
它是model specific

00:12:39.900 --> 00:12:43.900
不是MLX或LLAMA CPP那种通用包装器

00:12:44.066 --> 00:12:45.766
换模型不一定能照搬

00:12:46.066 --> 00:12:47.866
换硬件也不一定成立

00:12:48.100 --> 00:12:49.600
它需要apple Silicon

00:12:49.666 --> 00:12:54.266
需要macos 26 metal 4 Swift 6.2

00:12:54.300 --> 00:12:56.733
还需要足够的SSD空间

00:12:56.866 --> 00:12:58.500
它还有一个限时限制

00:12:59.200 --> 00:13:00.566
SSD不是内存

00:13:00.966 --> 00:13:03.666
SSD再快也比内存慢得多

00:13:03.733 --> 00:13:05.933
频繁读取权重会带来延迟

00:13:06.166 --> 00:13:08.866
也可能增加能耗和存储磨损

00:13:09.166 --> 00:13:10.933
缓存命中率如果不好

00:13:11.166 --> 00:13:12.133
速度就会掉

00:13:12.366 --> 00:13:15.500
长上下文复杂提示多轮对话

00:13:15.500 --> 00:13:18.200
并发请求都会挑战这套设计

00:13:18.466 --> 00:13:22.200
视频里的23 tokens是M3 Max上的演示

00:13:22.333 --> 00:13:23.700
8级字节MR

00:13:24.166 --> 00:13:27.533
MacBook air的5-6tokens更接近低

00:13:27.533 --> 00:13:29.133
配用户会看到的体验

00:13:29.300 --> 00:13:31.200
能用不等于丝滑

00:13:31.733 --> 00:13:33.500
所以正确的判断不是

00:13:33.500 --> 00:13:36.000
Macbook从此取代云GPU

00:13:36.066 --> 00:13:38.900
而是本地AI的下限被抬高了

00:13:38.900 --> 00:13:40.100
这已经很重要

00:13:40.200 --> 00:13:42.800
还要补一个容易被忽略的成本账

00:13:43.133 --> 00:13:45.366
云端AI看起来省心

00:13:45.500 --> 00:13:47.866
但它的成本是持续性的

00:13:47.900 --> 00:13:49.500
用户每个月付订阅

00:13:49.866 --> 00:13:51.533
开发者按TOKEN付费

00:13:51.733 --> 00:13:54.133
企业按席位和调用量付钱

00:13:54.200 --> 00:13:55.200
用得越多

00:13:55.300 --> 00:13:56.300
账单越高

00:13:56.366 --> 00:13:59.100
本地AI的成本更像买设备

00:13:59.600 --> 00:14:01.166
前期花钱买Mac

00:14:01.333 --> 00:14:03.466
后面用本地算力跑任务

00:14:03.566 --> 00:14:05.133
对高频任务来说

00:14:05.166 --> 00:14:07.566
本地推理会越来越有吸引力

00:14:07.700 --> 00:14:10.066
当然本地也不是不要成本

00:14:10.166 --> 00:14:13.000
它吃电吃存储吃内存

00:14:13.133 --> 00:14:15.100
也吃开发者优化时间

00:14:15.166 --> 00:14:16.800
可它的账单不再完全

00:14:16.800 --> 00:14:18.666
掌握在模型公司手里

00:14:18.966 --> 00:14:20.500
用户买了机器之后

00:14:20.700 --> 00:14:23.366
至少有一部分智能能力可以自己用

00:14:23.366 --> 00:14:25.300
这种心理差异很重要

00:14:25.500 --> 00:14:26.366
订阅时代

00:14:26.533 --> 00:14:27.900
用户越来越讨厌

00:14:27.900 --> 00:14:29.733
每个功能都按月收费

00:14:29.900 --> 00:14:32.466
本地AI如果能提供够用体验

00:14:32.533 --> 00:14:34.933
就会成为反订阅情绪的出口

00:14:34.966 --> 00:14:36.933
这会影响应用开发

00:14:37.300 --> 00:14:40.600
现在很多AI APP只是套一层云端API

00:14:40.600 --> 00:14:42.166
用户输入文字

00:14:42.166 --> 00:14:44.200
服务器转发给模型

00:14:44.333 --> 00:14:46.133
再把结果显示回来

00:14:46.400 --> 00:14:47.766
这种产品门槛低

00:14:47.766 --> 00:14:48.700
替代也快

00:14:48.733 --> 00:14:50.366
未来真正有壁垒的应用

00:14:50.366 --> 00:14:53.533
可能会把本地模型云端模型本地

00:14:53.533 --> 00:14:57.000
文件隐私权限系统操作结合起来

00:14:57.133 --> 00:14:58.933
Mac上的本地AI应用

00:14:59.366 --> 00:15:00.700
尤其适合这么做

00:15:01.066 --> 00:15:03.500
因为它能直接贴近用户的文件

00:15:03.700 --> 00:15:08.133
日历邮件代码仓库和创作软件

00:15:08.300 --> 00:15:09.200
这样一来

00:15:09.700 --> 00:15:12.466
竞争重点就从谁接了最强API

00:15:12.466 --> 00:15:15.133
变成谁把AI放进真实工作流

00:15:15.333 --> 00:15:18.166
Turbo feelfair没有解决所有产品问题

00:15:18.466 --> 00:15:20.866
但它说明底层可行性在提升

00:15:21.133 --> 00:15:22.600
底层每提升一点

00:15:22.733 --> 00:15:24.566
应用层就多一批可能

00:15:24.733 --> 00:15:27.200
AI行业过去几年一直在讲

00:15:27.200 --> 00:15:30.466
更大模型更大集群更大融资

00:15:30.600 --> 00:15:31.900
模型越来越强

00:15:31.933 --> 00:15:34.266
但普通用户越来越像租客

00:15:34.400 --> 00:15:39.466
账号订阅API云端限制数据上传

00:15:39.866 --> 00:15:41.766
所有j能力都隔着一层平台

00:15:41.933 --> 00:15:43.300
Turbo field fair

00:15:43.733 --> 00:15:45.766
这种项目提醒了一件事

00:15:46.066 --> 00:15:49.000
AI的未来不一定只有超级数据中心

00:15:49.333 --> 00:15:51.800
也可以有一部分回到个人电脑

00:15:51.866 --> 00:15:53.533
这对开发者也有启发

00:15:53.700 --> 00:15:55.366
以后做本地AI应用

00:15:55.366 --> 00:15:57.133
不能只问模型能不能跑

00:15:57.133 --> 00:15:59.566
还要问模型哪部分必须跑

00:15:59.733 --> 00:16:01.066
哪部分可以缓存

00:16:01.500 --> 00:16:03.133
哪部分可以流式读取

00:16:03.333 --> 00:16:08.533
数据在CPU  GPU内存SSD之间搬了几次

00:16:08.666 --> 00:16:11.900
AI应用开发会越来越像系统工程

00:16:12.000 --> 00:16:13.600
谁能少搬一次数据

00:16:13.600 --> 00:16:15.000
谁就多一点性能

00:16:15.100 --> 00:16:16.733
谁能少占一点内存

00:16:17.366 --> 00:16:18.866
谁就多一批用户

00:16:19.133 --> 00:16:22.166
谁能把模型结构和硬件结构对齐

00:16:22.266 --> 00:16:24.733
谁就能把不可能变成勉强可用

00:16:24.733 --> 00:16:26.200
这也是苹果生态里

00:16:26.200 --> 00:16:28.000
可能出现机会的地方

00:16:28.133 --> 00:16:29.933
如果开发者围绕metal

00:16:30.166 --> 00:16:31.100
统一内存

00:16:31.566 --> 00:16:32.500
neural engine

00:16:32.666 --> 00:16:33.933
本地文件索引

00:16:34.666 --> 00:16:37.366
Spotlight SHORTCUTS做AI工具

00:16:37.600 --> 00:16:38.933
Mac可能会变成一个很

00:16:38.933 --> 00:16:41.100
独特的本地AI开发平台

00:16:41.300 --> 00:16:43.666
不是为了和云端模型硬碰硬

00:16:43.733 --> 00:16:46.300
而是做那些云端不适合做的任务

00:16:46.666 --> 00:16:51.133
私密离线低延迟贴近个人文件系统

00:16:51.266 --> 00:16:52.366
真正的竞争不是

00:16:52.366 --> 00:16:54.366
本地和云端谁消灭谁

00:16:54.366 --> 00:16:56.366
而是谁掌握默认入口

00:16:56.600 --> 00:16:58.466
云端模型会继续强

00:16:58.566 --> 00:17:00.533
因为训练和最强推理

00:17:00.533 --> 00:17:02.300
都离不开巨量算力

00:17:02.366 --> 00:17:04.466
可是本地模型一旦够用

00:17:04.466 --> 00:17:06.400
就会吃掉大量日常任务

00:17:06.700 --> 00:17:09.066
用户不需要每次都请最强模型

00:17:09.200 --> 00:17:10.266
写一封邮件

00:17:10.300 --> 00:17:11.466
整理会议记录

00:17:11.466 --> 00:17:12.733
搜索本地文档

00:17:12.966 --> 00:17:14.200
解释一段代码

00:17:14.200 --> 00:17:15.566
生成一个小脚本

00:17:15.700 --> 00:17:17.800
够快够私密够便宜

00:17:17.800 --> 00:17:19.600
比绝对最强更重要

00:17:19.666 --> 00:17:23.066
这就是Turbo fillfair事件的流量价值

00:17:23.500 --> 00:17:24.266
表面看

00:17:24.266 --> 00:17:27.066
它只是内存减少7倍的技术新闻

00:17:27.100 --> 00:17:28.466
往深一层看

00:17:28.666 --> 00:17:30.533
它在挑战一个行业共识

00:17:30.766 --> 00:17:33.000
大模型必须被云端垄断

00:17:33.300 --> 00:17:35.066
它没有推翻云端AI

00:17:35.166 --> 00:17:36.700
但它撕开了一条缝

00:17:37.000 --> 00:17:38.966
接下来要看的不是这个项目

00:17:38.966 --> 00:17:41.400
本身能不能变成大众产品

00:17:41.800 --> 00:17:44.800
而是它代表的工程路线会不会扩散

00:17:44.966 --> 00:17:47.100
更多MOE模型会不会被专门

00:17:47.100 --> 00:17:49.066
打包成本地流式格式

00:17:49.266 --> 00:17:51.566
更多Mac应用会不会接入

00:17:51.566 --> 00:17:53.866
本地Openai compatible Server

00:17:54.066 --> 00:17:55.366
apple会不会把类似

00:17:55.366 --> 00:17:57.333
思路放进系统级框架

00:17:57.533 --> 00:17:59.966
开发者会不会开始为8级字节

00:18:00.366 --> 00:18:02.733
16级字节设备认真优化

00:18:02.900 --> 00:18:05.100
而不是默认要求64级

00:18:05.100 --> 00:18:06.933
字节内存和大显卡

00:18:07.366 --> 00:18:08.766
如果这些事情发生

00:18:08.800 --> 00:18:11.100
本地AI就会从极客演示

00:18:11.100 --> 00:18:12.766
变成产品基础设施

00:18:13.000 --> 00:18:15.866
还有一个变量是模型公司本身

00:18:16.000 --> 00:18:18.266
如果更多模型采用MOE

00:18:18.466 --> 00:18:20.533
如果更多模型公开权重

00:18:20.966 --> 00:18:23.900
如果更多小模型追上日常任务能力

00:18:24.066 --> 00:18:26.100
本地推理就会更快普及

00:18:26.400 --> 00:18:29.500
Turbo Fillfair依赖Gemma4这种结构

00:18:29.566 --> 00:18:31.900
不代表所有模型都能这么跑

00:18:31.900 --> 00:18:35.466
但AI行业已经在往稀疏激活专用小

00:18:35.466 --> 00:18:38.666
模型端侧模型模型路由方向走

00:18:38.900 --> 00:18:41.166
云端超级模型负责难题

00:18:41.400 --> 00:18:43.266
端侧模型负责日常

00:18:43.366 --> 00:18:45.800
多个模型组合起来完成任务

00:18:45.933 --> 00:18:48.266
这个方向对Nvidia是提醒

00:18:48.733 --> 00:18:49.966
对苹果是机会

00:18:50.300 --> 00:18:51.966
对开发者是新战场

00:18:52.100 --> 00:18:55.300
NVIDIA仍然会统治训练和高端推理

00:18:55.333 --> 00:18:56.933
可是如果越来越多

00:18:56.933 --> 00:18:58.566
日常推理回到端侧

00:18:59.066 --> 00:19:00.900
市场对所有AI都必须

00:19:00.900 --> 00:19:03.500
上云GPU的想象会降温

00:19:03.733 --> 00:19:06.166
苹果不一定抢走数据中心的钱

00:19:06.200 --> 00:19:08.866
但可以抢回个人设备的智能入口

00:19:08.966 --> 00:19:11.566
开发者如果能把本地模型用好

00:19:11.566 --> 00:19:14.600
就不用完全被API成本牵着走

00:19:14.700 --> 00:19:16.066
观众继续听下去

00:19:16.066 --> 00:19:17.700
应该带走的判断是

00:19:17.933 --> 00:19:19.866
这不是一个小工具新闻

00:19:20.000 --> 00:19:22.666
而是AI权力结构的小变化

00:19:22.866 --> 00:19:24.366
以前能力在云端

00:19:24.466 --> 00:19:26.066
用户只是调用者

00:19:26.066 --> 00:19:28.533
现在一部分能力开始回到设备

00:19:28.966 --> 00:19:31.100
用户重新拥有一点控制权

00:19:31.166 --> 00:19:32.700
这一点现在还小

00:19:32.700 --> 00:19:34.133
但方向很清楚

00:19:34.300 --> 00:19:36.500
只要端侧模型继续变强

00:19:36.500 --> 00:19:39.866
本地AI就会从能跑走向好用

00:19:39.866 --> 00:19:42.400
再从好用走向默认存在

00:19:42.533 --> 00:19:44.700
接下来还要看一个更现实的变量

00:19:44.966 --> 00:19:45.933
内存配置

00:19:46.333 --> 00:19:47.600
苹果这些年一直被

00:19:47.600 --> 00:19:50.133
吐槽入门Mac内存太小

00:19:50.133 --> 00:19:51.533
升级内存太贵

00:19:51.666 --> 00:19:53.800
过去这个槽点主要影响剪

00:19:53.800 --> 00:19:56.500
视频跑虚拟机开大型项目

00:19:56.533 --> 00:19:58.133
到了本地AI时代

00:19:58.133 --> 00:20:00.366
它会变成更核心的购买理由

00:20:00.466 --> 00:20:01.666
8吉字节能跑

00:20:01.666 --> 00:20:03.800
不代表8吉字节最舒服

00:20:04.200 --> 00:20:07.566
16级字节会成为更合理的AI入门线

00:20:07.733 --> 00:20:11.366
32级字节64级字节会变成

00:20:11.366 --> 00:20:13.933
开发者和重度用户的新分界

00:20:14.200 --> 00:20:16.666
Turbo field day把门槛打低

00:20:16.666 --> 00:20:18.566
不代表硬件需求消失

00:20:18.700 --> 00:20:21.700
而是让更多人第一次有资格进场

00:20:21.900 --> 00:20:24.466
这对苹果的产品策略很微妙

00:20:24.600 --> 00:20:28.300
如果本地AI真的变成Mac的重要卖点

00:20:28.533 --> 00:20:30.400
苹果就会有更强理由

00:20:30.400 --> 00:20:33.100
推动用户买更高内存版本

00:20:33.200 --> 00:20:36.600
用户过去买内存是为了今天的软件

00:20:37.200 --> 00:20:38.266
未来买内存

00:20:38.533 --> 00:20:41.300
可能是为了未来几年的本地模型

00:20:41.466 --> 00:20:43.166
苹果当然喜欢这个故事

00:20:43.300 --> 00:20:45.800
因为它能提高Mac的平均售价

00:20:45.866 --> 00:20:47.533
但用户也会更敏感

00:20:47.566 --> 00:20:49.933
既然AI要在设备端跑入门

00:20:49.933 --> 00:20:51.466
配置就不能太寒酸

00:20:51.700 --> 00:20:53.966
苹果如果继续把内存升级

00:20:54.000 --> 00:20:55.366
价格定得很高

00:20:55.866 --> 00:20:58.166
反而会限制本地AI的普及

00:20:58.466 --> 00:21:00.600
另一个变量是SSD

00:21:00.766 --> 00:21:02.333
Turbo field fair的路线

00:21:02.933 --> 00:21:05.300
把SSD从单纯存储变成

00:21:05.300 --> 00:21:06.766
推理链路的一部分

00:21:07.200 --> 00:21:10.066
SSD速度寿命文件布局

00:21:10.266 --> 00:21:12.266
系统缓存都会影响体验

00:21:12.333 --> 00:21:15.900
过去用户选电脑看SSD主要是容量

00:21:16.266 --> 00:21:18.400
未来本地AI应用多了

00:21:18.700 --> 00:21:21.533
SSD读写性能也会被重新关注

00:21:21.733 --> 00:21:23.333
模型权重不再只是躺

00:21:23.333 --> 00:21:25.066
在硬盘里的大文件

00:21:25.466 --> 00:21:27.500
而是生成每个TOKEN时可能

00:21:27.500 --> 00:21:29.566
被反复访问的工作材料

00:21:29.666 --> 00:21:32.366
这会把电脑硬件评价体系改掉

00:21:32.466 --> 00:21:35.566
过去AI电脑宣传喜欢堆TOPS

00:21:35.733 --> 00:21:38.800
以后真正懂行的人会看一整套链路

00:21:39.066 --> 00:21:40.566
内存带宽够不够

00:21:40.766 --> 00:21:43.666
CPU和GPU是否共享内存

00:21:44.333 --> 00:21:46.666
SSD读取延迟如何系统

00:21:47.166 --> 00:21:49.300
API能不能减少拷贝模型

00:21:49.666 --> 00:21:51.500
格式是不是贴合硬件

00:21:51.566 --> 00:21:54.266
单看一个算力数字很容易被骗

00:21:54.400 --> 00:21:57.000
AI推理的瓶颈可能不在算力

00:21:57.066 --> 00:21:58.500
而在数据搬运

00:21:58.566 --> 00:22:01.866
这也是Turbo fair给普通观众上的一课

00:22:02.566 --> 00:22:05.000
AI不是只有模型聪不聪明

00:22:05.300 --> 00:22:07.100
还有数据怎么流动

00:22:07.133 --> 00:22:10.533
同一个模型放在不同硬件结构上

00:22:10.600 --> 00:22:12.400
体验可能完全不一样

00:22:12.566 --> 00:22:15.533
未来优秀的本地AI产品背后

00:22:15.533 --> 00:22:17.900
一定不是简单下载一个模型

00:22:18.333 --> 00:22:20.866
而是围绕设备做深度优化

00:22:20.966 --> 00:22:22.566
最后给一个明确判断

00:22:22.700 --> 00:22:25.533
苹果芯片这次赢的不是模型参数

00:22:25.666 --> 00:22:27.533
也不是Benchmark排名

00:22:27.666 --> 00:22:30.166
而是设备端AI的叙事权

00:22:30.366 --> 00:22:33.733
过去AI叙事被NVIDIA和云厂商拿走

00:22:33.766 --> 00:22:38.400
大家谈的都是GPU集群数据中心和API

00:22:38.566 --> 00:22:39.700
Turbo field fair

00:22:40.666 --> 00:22:42.933
让另一个问题重新回到桌面

00:22:43.133 --> 00:22:45.466
如果模型不必全部进内存

00:22:45.600 --> 00:22:47.966
如果CPU和GPU共享内存

00:22:48.300 --> 00:22:50.300
如果SSD能参与推理

00:22:50.600 --> 00:22:53.400
如果应用能直接贴着硬件写本地

00:22:53.966 --> 00:22:56.166
设备还能不能变成AI的主场

00:22:56.166 --> 00:22:57.200
答案还没定

00:22:57.200 --> 00:22:59.200
但这次Mac不再只是

00:22:59.200 --> 00:23:00.800
调用云模型的屏幕

00:23:00.900 --> 00:23:02.566
它开始像一台真正能

00:23:02.566 --> 00:23:04.566
承载AI的个人机器

00:23:04.700 --> 00:23:06.200
如果这个趋势继续

00:23:06.600 --> 00:23:09.300
未来买电脑时就会多一个新问题

00:23:09.933 --> 00:23:12.166
这台机器能不能把个人资料

00:23:12.333 --> 00:23:15.000
工作流和本地模型连起来

00:23:15.066 --> 00:23:16.900
过去电脑拼的是性能

00:23:17.200 --> 00:23:19.300
后来拼的是续航和生态

00:23:19.866 --> 00:23:22.133
接下来可能要拼本地智能密度

00:23:22.300 --> 00:23:25.100
苹果芯片这次露出的牌就在这里

00:23:25.400 --> 00:23:28.333
谁能让AI更贴近用户自己的设备

00:23:28.600 --> 00:23:29.733
自己的文件

00:23:30.000 --> 00:23:31.466
自己的隐私边界

00:23:31.733 --> 00:23:33.200
谁就能在云端巨头

00:23:33.200 --> 00:23:34.766
之外拿回一块入口

