1
00:00:00,100 --> 00:00:19,733
一台8G字节内存的MacBook 居然能跑26B级别的大模型 这件事听起来很反常 过去谈本地AI 大家第一反应都是显存不够 内存不够 电脑风扇起飞 模型还没加载完 系统先卡死 26B参数这种模型

2
00:00:20,000 --> 00:00:38,966
正常想象里至少要一台很贵的机器 或者干脆丢到云端GPU上跑 可是最近一个叫Turbo fillfair的项目 把Google Gemma 426B a四b 跑到了apple Silicon Mac上 而且运行时权重加4K KV CACHE只占大约二级字节内存

3
00:00:39,066 --> 00:00:57,800
这个数字最狠的地方 不是省了一点内存 而是把本地AI的门槛 直接往下砸了一层 原本14.3GB左右的模型安装体积 不需要整包塞进内存 项目只把常驻核心留在内存里 把大部分专家权重放在SSD上

4
00:00:58,066 --> 00:01:17,133
需要哪一块再读哪一块 视频里在M3Max上跑到23.4tokens 项目readme里也记录了8GBM二Macbook air 可以跑到5.1-6.3tokens 这个速度不是数据中心级别 但已经不是玩具 这件事真正值得看

5
00:01:17,333 --> 00:01:35,366
不是某个开发者做了一个炫技项目 而是本地AI的路线开始变了 过去本地大模型的思路很简单 模型越大 硬件越贵 想跑7B准备一块不错的消费级显卡 想跑30B开始考虑大显存

6
00:01:35,733 --> 00:01:53,733
想跑更大的moe 就看云服务账单 用户被迫接受一个隐含规则 AI越聪明越远离个人电脑 越强的模型越集中在云厂商 GPU集群和数据中心手里 Turbo fuel fair给出的反方向答案是

7
00:01:54,166 --> 00:02:14,533
模型可以很大 但每一秒真正用到的部分可能很小 这要从Moe讲起 Moe叫mixture of experts 混合专家模型 普通模型像一个巨大的统一车间 每个TOKEN进来 很多权重都要参与计算 Moe更像一座有128个小工位的工厂

8
00:02:14,600 --> 00:02:35,500
每个TOKEN进来 Router会判断这次该找 哪几个专家处理 编码是26B a4b 总参数是26B 但每个TOKEN实际激活 的大约是3.88B参数 模型名义上很大 但每一步真正干活 的只是其中一部分 过去这件事的好处主要体现在云端

9
00:02:36,266 --> 00:02:56,733
模型公司可以用更大的总参数 保持相对可控的推理成本 可是Turbo Fillfair把这个 特性拿到了本地机器上 既然每个TOKEN只用几个专家 那为什么要把所有专家都常驻内存 于是他把模型拆成两堆 第一堆是每个TOKEN都要用的东西

10
00:02:56,966 --> 00:03:15,166
比如attention router embedding shared expert 还有KV CACHE 这一部分大约1.35吉字节 加上运行需要的缓存 留在内存里 第二堆是专家权重 30层 每层128个expert

11
00:03:15,333 --> 00:03:33,766
每个expert只有几MB 加起来是主要体积 这一堆不常驻内存 只放在SSD上 每生成一个TOKEN 模型先完成attention 再由router决定当前层要用哪8个专家 CPU接到名单之后 去SSD读取对应expert

12
00:03:33,900 --> 00:03:53,866
放到GPU能看到的内存区域里 metal接着算 这个过程听起来麻烦 但关键在apple Silicon 传统PC上 CPU和独立GPU通常分两套内存 SSD读出来的数据先进系统内存 再通过Pcie总线搬到显卡VRAM

13
00:03:53,966 --> 00:04:14,500
模型如果每个TOKEN都 要频繁从SSD拉权重 再搬进VRAM 中间的拷贝和总线 延迟会直接把速度打穿 数据不是不会动 而是动得太慢 动得太贵 apple Silicon的统一内存 架构把这个问题变小了 CPU和GPU看的是同一块物理内存

14
00:04:14,700 --> 00:04:34,066
CPU从SSD读进来的数据可以 直接成为GPU要用的metal buffer 少了一次拷贝 少了一段总线搬运 也少了传统独显架构 里最难受的VRAM墙 这就是为什么这个 项目特别像一把钥匙 它不是证明苹果芯片算力天下无敌

15
00:04:34,266 --> 00:04:52,666
而是证明apple Silicon的结构刚好适合 一种边读边算的本地推理路线 还不止这个 Turbo fieldfare没有把磁盘上 的权重用普通格式存着 等读取之后再解包 再转成GPU需要的布局 它在安装阶段就把

16
00:04:52,666 --> 00:05:13,366
模型重新打包成Dubo格式 尽量让磁盘里的数据就是 metal kernel可以消费的样子 读文件就是加载权重 中间少一次转换就少 一次内存浪费和时间浪费 它还用了缓存 每一层128个expert 不可能每次都从SSD读

17
00:05:13,766 --> 00:05:32,466
项目给每层留了16个expert 常位常用的expert放在内存里 router如果选中已经缓存的expert 立刻就能用 如果没命中 再从SSD读取 把不常用的挤出去 它用的是LFU least frequently used

18
00:05:32,766 --> 00:05:52,400
也就是踢掉使用频率最低的专家 而不是简单踢掉最久没用的 这个选择很重要 因为moe的路由并不是完全随机 有些专家在很多TOKEN 上都会被反复选中 有些专家很少出现 按频率留下热门专家 比按时间留下最近

19
00:05:52,400 --> 00:06:13,100
专家更适合这个任务 项目押注的是语言 生成的专家选择有规律 只要规律足够强 SSD读取就不会把速度拖死 所以它能做到一个很奇怪的效果 明明模型大部分权重还在SSD上 实际体验却没有慢到不能用

20
00:06:13,133 --> 00:06:31,333
这件事对普通用户意味着什么 第一本地AI不一定只能靠堆硬件 过去用户想跑更好的模型 唯一办法是买更大 内存更大显存更贵显卡 这个逻辑会把个人电脑 推向数据中心的反面 云越来越强

21
00:06:31,333 --> 00:06:50,500
个人设备越来越像终端 Turbo field fair展示的是另一条路 如果模型结构文件布局操作系统 芯片内存架构和运行时配合得足够 好 小机器也能吃下一部分大模型能力 它不是免费午餐 SSD读取有延迟模型

22
00:06:50,866 --> 00:07:09,966
限制在特定结构 速度和云端旗舰模型没法比 但它证明了一个方向 优化路线不是只剩买更贵的GPU第二 apple Silicon的AI价值可能被低估了 过去评价AI硬件 大家喜欢看TOPS 看GPU看显存大小

23
00:07:10,133 --> 00:07:29,266
苹果在这场叙事里经常显得尴尬 它的neural engine很强 但开发生态不如CUDA 统一内存很漂亮 但高配内存价格很贵 Mac很适合创作和开发 但说到本地大模型 很多人还是先想到Nvidia Turbo field fair把问题换了一个角度

24
00:07:29,400 --> 00:07:48,933
苹果真正的优势不一定是单点算力 而是CPU GPU内存SSD metal和系统API的整合 只要工作负载设计的够贴合 它可以用更少的数据搬运换性能 这和手机时代很像 苹果不一定每个硬件参数都最大

25
00:07:49,300 --> 00:08:10,300
但它能把芯片系统 应用和框架整在一起 让开发者吃到一体化红利 本地AI也可能走类似路线 不是每个人都需要训练模型 但很多人需要在个人设备上跑推理 写作翻译代码补全文件整理私人

26
00:08:10,300 --> 00:08:28,366
知识库离线助手隐私敏感的资料 分析 如果这些场景能在普通Mac上运行 苹果就不是旁观者 第三云端AI的垄断感会被削弱 过去AI服务天然集中在云端 因为模型太大 推理太贵

27
00:08:28,466 --> 00:08:47,133
用户设备跑不动 集中在云端就带来几个问题 数据要上传 隐私要交出去 订阅费要长期付 网络断了就没法用 模型公司改规则 用户只能接受 本地AI如果慢慢可用 用户会多一个选择 不是所有任务都要上云

28
00:08:47,300 --> 00:09:05,866
私人笔记公司内部文档离线 代码助手本地搜索个人自动化 这些场景其实很适合在设备端完成 云端负责最强模型 本地负责高频隐私 低成本和及时响应 这会改变产品形态 未来AI助手可能不是

29
00:09:05,866 --> 00:09:24,933
一个纯云端聊天窗口 而是一套混合系统 简单任务本地完成 复杂任务再上云 敏感文件本地分析 公开资料云端补充 离线场景用本地模型 联网场景用大模型 用户感觉不到背后切换 只知道电脑更聪明了

30
00:09:24,933 --> 00:09:43,100
这也是苹果真正想要的方向 苹果不会轻易把用户数据 全部交给第三方云模型 他更喜欢把智能 功能藏进设备和系统 apple intelligence的战略一直 强调设备端处理和隐私边界 问题在于设备端模型能力如果太弱

31
00:09:43,133 --> 00:10:01,700
体验就会被云端模型拉开 Turbo field fair 这种项目说明设备端的 能力上限还有很多工程空间 这里要把苹果的处境讲透 AI这轮浪潮里 苹果一直显得慢半拍 Openai抢走聊天入口 Google抢搜索和Android

32
00:10:01,866 --> 00:10:20,100
Microsoft把copilot塞进Windows和office NVIDIA拿走算力叙事 苹果虽然发布apple intelligence 但市场反应一直不算兴奋 原因很简单 苹果不是靠开放API和 云模型赚钱的公司 它擅长的是把能力变成系统体验

33
00:10:20,133 --> 00:10:39,566
可大模型初期最 耀眼的能力都在云端 苹果的优势一时很难展示 Turbo field day这类项目的意义就在于 它让苹果的优势重新有用 如果AI的未来只是谁 有最大数据中心 苹果确实不占主场 它没有Nvidia那种GPU生态

34
00:10:39,800 --> 00:10:57,900
也没有Microsoft Azure或 Google cloud那种云入口 但如果未来一部分AI 工作要回到设备端 苹果手里的筹码就多了 它有统一内存 有自研芯片有metal 有强控制的操作系统 有高端用户设备 也有一群愿意花钱

35
00:10:57,900 --> 00:11:17,066
买稳定体验的用户 这件事最适合用一个普通场景理解 一个用户坐在飞机上 没有网路 想让电脑整理本地笔记总结PDF 查找项目文档 生成一段邮件草稿 如果所有AI都依赖云端 这些任务马上变成半残废

36
00:11:17,100 --> 00:11:36,333
可是如果Mac本地能跑 一个够用的模型 很多事情就能直接做 速度不一定顶级 能力不一定最强 但它能离线私密低延迟 而且不需要每次把资料传出去 对企业也是一样 很多公司不是不想用AI

37
00:11:36,566 --> 00:11:55,700
而是不敢把内部 资料全部丢给外部API 法律合同源代码客户 数据医疗资料财务表格 这些内容一旦上传 就牵涉权限审计地区 合规和数据泄露风险 如果本地或私有设备端 模型能处理一部分任务

38
00:11:55,900 --> 00:12:16,966
企业的AI使用门槛会下降 它不需要替代GPT5这种旗舰模型 只要把70%的日常任务吃下来 价值就已经很大 这也是为什么二级字节 内存这个数字有流量潜力 它让观众立刻听懂一个变化 AI不再只属于云端巨头

39
00:12:17,100 --> 00:12:35,933
哪怕这个结论现在还不能完全成立 它已经打开想象空间 但这件事不能吹过头 Turbo field fair不是通用魔法 它目前主要针对Gemma 426BA 4B文本推理 不支持图像音频视频 也不是一个完整的agent系统

40
00:12:36,000 --> 00:12:54,266
项目readme也写得很清楚 它是model specific 不是MLX或LLAMA CPP那种通用包装器 换模型不一定能照搬 换硬件也不一定成立 它需要apple Silicon 需要macos 26 metal 4 Swift 6.2

41
00:12:54,300 --> 00:13:15,500
还需要足够的SSD空间 它还有一个限时限制 SSD不是内存 SSD再快也比内存慢得多 频繁读取权重会带来延迟 也可能增加能耗和存储磨损 缓存命中率如果不好 速度就会掉 长上下文复杂提示多轮对话

42
00:13:15,500 --> 00:13:33,500
并发请求都会挑战这套设计 视频里的23 tokens是M3 Max上的演示 8级字节MR MacBook air的5-6tokens更接近低 配用户会看到的体验 能用不等于丝滑 所以正确的判断不是

43
00:13:33,500 --> 00:13:51,533
Macbook从此取代云GPU 而是本地AI的下限被抬高了 这已经很重要 还要补一个容易被忽略的成本账 云端AI看起来省心 但它的成本是持续性的 用户每个月付订阅 开发者按TOKEN付费

44
00:13:51,733 --> 00:14:10,066
企业按席位和调用量付钱 用得越多 账单越高 本地AI的成本更像买设备 前期花钱买Mac 后面用本地算力跑任务 对高频任务来说 本地推理会越来越有吸引力 当然本地也不是不要成本

45
00:14:10,166 --> 00:14:29,733
它吃电吃存储吃内存 也吃开发者优化时间 可它的账单不再完全 掌握在模型公司手里 用户买了机器之后 至少有一部分智能能力可以自己用 这种心理差异很重要 订阅时代 用户越来越讨厌 每个功能都按月收费

46
00:14:29,900 --> 00:14:48,700
本地AI如果能提供够用体验 就会成为反订阅情绪的出口 这会影响应用开发 现在很多AI APP只是套一层云端API 用户输入文字 服务器转发给模型 再把结果显示回来 这种产品门槛低 替代也快

47
00:14:48,733 --> 00:15:08,133
未来真正有壁垒的应用 可能会把本地模型云端模型本地 文件隐私权限系统操作结合起来 Mac上的本地AI应用 尤其适合这么做 因为它能直接贴近用户的文件 日历邮件代码仓库和创作软件

48
00:15:08,300 --> 00:15:27,200
这样一来 竞争重点就从谁接了最强API 变成谁把AI放进真实工作流 Turbo feelfair没有解决所有产品问题 但它说明底层可行性在提升 底层每提升一点 应用层就多一批可能 AI行业过去几年一直在讲

49
00:15:27,200 --> 00:15:45,766
更大模型更大集群更大融资 模型越来越强 但普通用户越来越像租客 账号订阅API云端限制数据上传 所有j能力都隔着一层平台 Turbo field fair 这种项目提醒了一件事

50
00:15:46,066 --> 00:16:08,533
AI的未来不一定只有超级数据中心 也可以有一部分回到个人电脑 这对开发者也有启发 以后做本地AI应用 不能只问模型能不能跑 还要问模型哪部分必须跑 哪部分可以缓存 哪部分可以流式读取 数据在CPU GPU内存SSD之间搬了几次

51
00:16:08,666 --> 00:16:28,000
AI应用开发会越来越像系统工程 谁能少搬一次数据 谁就多一点性能 谁能少占一点内存 谁就多一批用户 谁能把模型结构和硬件结构对齐 谁就能把不可能变成勉强可用 这也是苹果生态里 可能出现机会的地方

52
00:16:28,133 --> 00:16:46,300
如果开发者围绕metal 统一内存 neural engine 本地文件索引 Spotlight SHORTCUTS做AI工具 Mac可能会变成一个很 独特的本地AI开发平台 不是为了和云端模型硬碰硬 而是做那些云端不适合做的任务

53
00:16:46,666 --> 00:17:06,400
私密离线低延迟贴近个人文件系统 真正的竞争不是 本地和云端谁消灭谁 而是谁掌握默认入口 云端模型会继续强 因为训练和最强推理 都离不开巨量算力 可是本地模型一旦够用 就会吃掉大量日常任务

54
00:17:06,700 --> 00:17:27,066
用户不需要每次都请最强模型 写一封邮件 整理会议记录 搜索本地文档 解释一段代码 生成一个小脚本 够快够私密够便宜 比绝对最强更重要 这就是Turbo fillfair事件的流量价值 表面看 它只是内存减少7倍的技术新闻

55
00:17:27,100 --> 00:17:47,100
往深一层看 它在挑战一个行业共识 大模型必须被云端垄断 它没有推翻云端AI 但它撕开了一条缝 接下来要看的不是这个项目 本身能不能变成大众产品 而是它代表的工程路线会不会扩散 更多MOE模型会不会被专门

56
00:17:47,100 --> 00:18:05,100
打包成本地流式格式 更多Mac应用会不会接入 本地Openai compatible Server apple会不会把类似 思路放进系统级框架 开发者会不会开始为8级字节 16级字节设备认真优化 而不是默认要求64级

57
00:18:05,100 --> 00:18:23,900
字节内存和大显卡 如果这些事情发生 本地AI就会从极客演示 变成产品基础设施 还有一个变量是模型公司本身 如果更多模型采用MOE 如果更多模型公开权重 如果更多小模型追上日常任务能力

58
00:18:24,066 --> 00:18:43,266
本地推理就会更快普及 Turbo Fillfair依赖Gemma4这种结构 不代表所有模型都能这么跑 但AI行业已经在往稀疏激活专用小 模型端侧模型模型路由方向走 云端超级模型负责难题 端侧模型负责日常

59
00:18:43,366 --> 00:19:03,500
多个模型组合起来完成任务 这个方向对Nvidia是提醒 对苹果是机会 对开发者是新战场 NVIDIA仍然会统治训练和高端推理 可是如果越来越多 日常推理回到端侧 市场对所有AI都必须 上云GPU的想象会降温

60
00:19:03,733 --> 00:19:22,666
苹果不一定抢走数据中心的钱 但可以抢回个人设备的智能入口 开发者如果能把本地模型用好 就不用完全被API成本牵着走 观众继续听下去 应该带走的判断是 这不是一个小工具新闻 而是AI权力结构的小变化

61
00:19:22,866 --> 00:19:42,400
以前能力在云端 用户只是调用者 现在一部分能力开始回到设备 用户重新拥有一点控制权 这一点现在还小 但方向很清楚 只要端侧模型继续变强 本地AI就会从能跑走向好用 再从好用走向默认存在

62
00:19:42,533 --> 00:20:01,666
接下来还要看一个更现实的变量 内存配置 苹果这些年一直被 吐槽入门Mac内存太小 升级内存太贵 过去这个槽点主要影响剪 视频跑虚拟机开大型项目 到了本地AI时代 它会变成更核心的购买理由 8吉字节能跑

63
00:20:01,666 --> 00:20:21,700
不代表8吉字节最舒服 16级字节会成为更合理的AI入门线 32级字节64级字节会变成 开发者和重度用户的新分界 Turbo field day把门槛打低 不代表硬件需求消失 而是让更多人第一次有资格进场

64
00:20:21,900 --> 00:20:41,300
这对苹果的产品策略很微妙 如果本地AI真的变成Mac的重要卖点 苹果就会有更强理由 推动用户买更高内存版本 用户过去买内存是为了今天的软件 未来买内存 可能是为了未来几年的本地模型

65
00:20:41,466 --> 00:21:00,600
苹果当然喜欢这个故事 因为它能提高Mac的平均售价 但用户也会更敏感 既然AI要在设备端跑入门 配置就不能太寒酸 苹果如果继续把内存升级 价格定得很高 反而会限制本地AI的普及 另一个变量是SSD

66
00:21:00,766 --> 00:21:21,533
Turbo field fair的路线 把SSD从单纯存储变成 推理链路的一部分 SSD速度寿命文件布局 系统缓存都会影响体验 过去用户选电脑看SSD主要是容量 未来本地AI应用多了 SSD读写性能也会被重新关注

67
00:21:21,733 --> 00:21:40,566
模型权重不再只是躺 在硬盘里的大文件 而是生成每个TOKEN时可能 被反复访问的工作材料 这会把电脑硬件评价体系改掉 过去AI电脑宣传喜欢堆TOPS 以后真正懂行的人会看一整套链路 内存带宽够不够

68
00:21:40,766 --> 00:22:01,866
CPU和GPU是否共享内存 SSD读取延迟如何系统 API能不能减少拷贝模型 格式是不是贴合硬件 单看一个算力数字很容易被骗 AI推理的瓶颈可能不在算力 而在数据搬运 这也是Turbo fair给普通观众上的一课

69
00:22:02,566 --> 00:22:20,866
AI不是只有模型聪不聪明 还有数据怎么流动 同一个模型放在不同硬件结构上 体验可能完全不一样 未来优秀的本地AI产品背后 一定不是简单下载一个模型 而是围绕设备做深度优化

70
00:22:20,966 --> 00:22:39,700
最后给一个明确判断 苹果芯片这次赢的不是模型参数 也不是Benchmark排名 而是设备端AI的叙事权 过去AI叙事被NVIDIA和云厂商拿走 大家谈的都是GPU集群数据中心和API Turbo field fair

71
00:22:40,666 --> 00:22:59,200
让另一个问题重新回到桌面 如果模型不必全部进内存 如果CPU和GPU共享内存 如果SSD能参与推理 如果应用能直接贴着硬件写本地 设备还能不能变成AI的主场 答案还没定 但这次Mac不再只是

72
00:22:59,200 --> 00:23:19,300
调用云模型的屏幕 它开始像一台真正能 承载AI的个人机器 如果这个趋势继续 未来买电脑时就会多一个新问题 这台机器能不能把个人资料 工作流和本地模型连起来 过去电脑拼的是性能 后来拼的是续航和生态

73
00:23:19,866 --> 00:23:34,766
接下来可能要拼本地智能密度 苹果芯片这次露出的牌就在这里 谁能让AI更贴近用户自己的设备 自己的文件 自己的隐私边界 谁就能在云端巨头 之外拿回一块入口
