實際影片長度:7:19.637。原文、繁中、雙語可點擊句子跳轉影片。
0:00.000–0:03.540
zh写出Redis的那个人刚刚又做了一个自己的AI引擎
0:03.540–0:06.380
zh他居然能在你面前那台笔记本上
0:06.380–0:08.660
zh跑起接近前沿模型的效果
0:08.660–0:10.520
zh这个项目叫DS4
0:10.520–0:13.000
zh不过引擎本身有个更好听的名字
0:13.000–0:14.700
zh叫Dwarf Star
0:14.700–0:17.400
zh作者是Salvatore Sanfilippo
0:17.400–0:21.460
zh也就是大家熟知的Antares Redis的创始人
0:21.460–0:23.220
zh大约两个月前
0:23.220–0:26.120
zh他用C从0写了一个全新的推理引擎
0:26.120–0:29.040
zh只为了让DeepSeek的V4模型
0:29.040–0:32.040
zh能在你可能真的拥有的机器上跑得很好
0:32.040–0:34.620
zh比如MacBook或MacStudio
0:34.620–0:36.220
zh接下来的惊喜是
0:36.220–0:38.720
zh模型不再非得塞进内存里
0:38.720–0:41.880
zh它把你的SSD也当成它真正的家
0:41.880–0:45.640
zh需要时再从硬盘流逝读取那些重的部分
0:45.640–0:48.680
zh而不是逼你把整个模型都塞进人
0:48.680–0:50.740
zh到现在为止还喜欢吗
0:50.740–0:52.400
zh订阅这个YouTube频道
0:52.400–0:54.720
zh还可以去Indie Hacker News
0:54.720–0:56.340
zh免费领取每日Newsletter
0:56.340–0:59.380
zh每个工作日都有一个新的深度解析
0:59.380–1:01.680
zh如果你真的打开这个Repo
1:01.680–1:05.000
zh最显眼的就是他对这一切都很坦诚
1:05.000–1:06.500
zh开头他就说了
1:06.500–1:08.740
zh这个项目故意做得很窄
1:08.740–1:10.460
zh一次只针对一个模型
1:10.460–1:13.120
zh而且他不是想做通用运行器
1:13.120–1:14.300
zh往下再看一点
1:14.300–1:16.100
zh你会看到他的动机
1:16.100–1:19.060
zh基本上就是真正有能力的开源模型
1:19.060–1:22.820
zh终于和真正有能力的个人电脑同时出现了
1:22.820–1:25.480
zh所以这两者该碰到一起了
1:25.480–1:26.760
zh继续往下
1:26.760–1:28.780
zh你会看到真正的速度数据
1:28.780–1:32.120
zh都是在真实的MacBook上跑出来的实际
1:32.120–1:32.720
enBenchmark
1:32.720–1:34.720
zh还有那些小图表
1:34.720–1:36.480
zh就算上下文越来越长
1:36.480–1:39.380
zhToken Per Second也几乎没怎么掉
1:39.380–1:41.200
zh然后他会讲到
1:41.200–1:42.940
zh怎么运行比你内存还大的模型
1:42.940–1:44.340
zh快到下面时
1:44.340–1:45.640
zh最疯狂的部分来了
1:45.640–1:50.480
zh把一个模型拆到两台用网线连在一起的笔记本上跑
1:50.480–1:51.900
zh说实话
1:51.900–1:54.900
zh在自己机器上跑模型也不新鲜了
1:54.900–1:55.920
zh有Lama CPP
1:55.920–1:58.140
zh这个庞大的开源项目
1:58.140–2:01.260
zh整个生态里有一半都是建立在他之上
2:01.260–2:04.960
zhDwarf Star也毫不掩饰地站在他肩膀上
2:04.960–2:08.860
zhAlama把本地模型变成了一型命令安装
2:08.860–2:13.460
zhLM Studio又把这一切包装成了友好的桌面应用
2:13.460–2:16.360
zh连不爱用终端的人也能上手
2:16.360–2:17.960
zh但这个项目不一样
2:17.960–2:20.380
zh他走的是完全相反的路
2:20.380–2:22.480
zh他不是什么模型都支持
2:22.480–2:24.300
zh而是只选一个
2:24.300–2:25.900
zh然后把它调到极致
2:25.900–2:28.840
zh拼命榨出最后一点速度和效果
2:28.840–2:30.740
zh先说下这个规模
2:30.740–2:33.300
zh已经有18500多个Star了
2:33.300–2:35.720
zh而且是MIT许可证
2:35.720–2:37.980
zh所以你基本可以随便拿去用
2:37.980–2:40.820
zh整个项目几乎完全用C写成
2:40.820–2:41.820
zh真想跑得顺
2:41.820–2:45.420
zh还是得有一台差不多96G内存的Mac
2:45.420–2:48.580
zh当然内存更少也能流逝运行
2:48.580–2:51.740
zh好机制上它到底是怎么工作的
2:51.740–2:54.140
zh核心是在现代机器上
2:54.140–2:57.860
zh你的模型和缓存不一定非得放在RAM里
2:57.860–3:00.240
zh也可以放在SSD上
3:00.240–3:01.720
zh这个思路一变
3:01.720–3:03.660
zh事情就完全不一样了
3:03.660–3:05.340
zh路由专家层
3:05.340–3:07.880
zh也就是这类Mixture Model里
3:07.880–3:09.000
zh占大头的部分
3:09.000–3:11.720
zh会在某个Token需要它的时候
3:11.720–3:13.160
zh才从磁盘流逝加赛
3:13.160–3:14.460
zh这样一来
3:14.460–3:17.220
zh内存就不再是一睹你一头撞上的硬墙
3:17.220–3:19.480
zh而更像是加速用的杠杆
3:19.480–3:21.440
zh为了让它能跑起来
3:21.440–3:24.020
zh它用了比较激进的2bit量化
3:24.020–3:26.720
zh但这是有意做成不对称的
3:26.720–3:28.560
zh它只压缩Exper权重
3:28.560–3:30.820
zhAttention和共享层
3:30.820–3:32.900
zh则尽量保持接近满质量
3:32.900–3:35.900
zh所以它还能保持足够稳定
3:35.900–3:37.760
zh值得拿来做真实任务
3:37.760–3:39.840
zh而结果确实有效
3:39.840–3:41.820
zh在M3MAX笔记本上
3:41.820–3:44.760
zh速度大约是每秒27个Token
3:44.760–3:46.260
zh已经完全够用了
3:46.260–3:48.040
zh想被推荐吗
3:48.040–3:50.720
zh把你的开源仓库提交到Indie Hacker
3:50.720–3:52.200
enNew Supply
3:52.200–3:54.900
zh就能让成千上万的开发者看到你
3:54.900–3:56.240
zh说实话
3:56.240–3:58.340
zh到这里它就不再只是个技术演示了
3:58.340–4:00.540
zh而是开始像个真正的产品了
4:00.540–4:02.200
zh它内置了一个编码Agent
4:02.200–4:03.920
zh有个很巧的设计师
4:03.920–4:06.060
zh这个绘画不会存到什么数据库里
4:06.060–4:08.760
zh这个Session本质上就是把KVCache
4:08.760–4:09.980
zh放在你的硬盘上
4:09.980–4:13.000
zh这样切换以保存的对话就会非常快
4:13.000–4:14.640
zh它还内置了一个
4:14.640–4:17.800
zh同时支持OpenLayer和Enthropy API的Server
4:17.800–4:21.940
zh这意味着你可以直接把Codex或Cloud Code
4:21.940–4:23.820
zh指向你自己的笔记本电脑
4:23.820–4:26.380
zh在你自己托管的模型上工作
4:26.380–4:28.620
zh它甚至加了一个PowerDial
4:28.620–4:31.380
zh可以在你更在意机器两款安静
4:31.380–4:34.920
zh而不是榨干每一个Token的时候去限制GPU
4:34.920–4:37.660
zh所有这些都在指向同一个想法
4:37.660–4:40.760
zh本地模型应该像一个做完整的产品
4:40.760–4:42.060
zh而不是一堆零件
4:42.060–4:43.180
zh说到底
4:43.180–4:44.860
zh它的底层其实非常老派
4:44.860–4:46.620
zh核心部分是纯C
4:46.620–4:49.940
zh再加上一些手写的Cuda和Metal Shader
4:49.940–4:53.540
zh真正负责GPU运算的几乎就只有这些
4:53.540–4:56.100
zh它明确没有链接GGML
4:56.100–4:58.060
zh也就是LamaCPP背后的那个库
4:58.060–5:01.720
zh但它确实适配了其中一些格式和Kernel
5:01.720–5:02.940
zh而且出于尊重
5:02.940–5:06.480
zh把它们的版权信息直接保留了下来
5:06.480–5:10.860
zh每次构建都会拿DivC在不同上下文长度下的官方输出做检查
5:10.860–5:14.720
zh所以那种悄悄把质量搞坏的改动会在发布前被发现
5:14.720–5:17.600
zh它还能跑在Apple Metal和NVIDIA显卡上
5:17.600–5:19.940
zh连小小的DGX2也支持
5:19.940–5:23.720
zh它甚至还能处理AMD的统一内存机器
5:23.720–5:26.100
zh启动它出人意料的简单
5:26.100–5:27.300
zh甚至有点无聊
5:27.300–5:28.360
zh但这是好事
5:28.360–5:30.360
zh你先运行下载脚本
5:30.360–5:32.800
zh把适配你机器的2bit模型拉下来
5:32.800–5:35.960
zh然后在Mac上用Mac构建Metal版本
5:35.960–5:37.120
zh再把它启动起来
5:37.120–5:40.220
zh你还可以选择开启SSD Streaming
5:40.860–5:43.280
zh这样就能用比实际内存更大的模型
5:43.280–5:44.020
zh之后
5:44.020–5:47.120
zh你就是在和自己硬件上的模型对话
5:47.120–5:50.040
zh输入的内容也不会离开这台机器
5:50.040–5:52.680
zh然后还有一个最近才上线
5:52.680–5:54.900
zh让大家都有点惊讶的功能
5:54.900–5:56.700
enDistributed Mode
5:56.700–6:00.060
zh它会把一个模型拆到多台机器上
6:00.060–6:02.260
zh每台分一部分layers
6:02.260–6:05.880
zh这样一个大到任何单机都跑不动的模型
6:05.880–6:07.400
zh也照样能运行
6:07.400–6:09.520
zh最典型的例子
6:09.520–6:13.940
zh是两台128G的MacBook通过Thunderbolt连接
6:13.940–6:17.640
zh在它们之间运行完整的4bit模型
6:17.640–6:19.240
zh更惊人的是
6:19.240–6:22.720
zh这一切都是在最近几周的提交里才出现的
6:22.720–6:24.980
zh所以这对你意味着什么
6:24.980–6:26.260
zh现在还很早
6:26.260–6:28.720
zh作者也首先承认这还是Beta
6:28.720–6:31.380
zh已经有几百个未解决的问题
6:31.380–6:35.360
zh而且它只会运行它发布的那些特定模型文件
6:35.360–6:38.260
zh所以它是把利器不是瑞士军刀
6:38.260–6:42.360
zh你还得有一台相当强的Mac才能获得好的体验
6:42.360–6:44.280
zh也有些人会介意
6:44.280–6:47.960
zh这里面很多代码都是在AI参与下写出来的
6:47.960–6:49.020
zh但往后看
6:49.020–6:52.160
zh这背后的压注其实挺让人兴奋的
6:52.160–6:52.740
zh它在说
6:52.740–6:56.300
zh这么强大的模型完全跑在你自己的硬件上
6:56.300–6:59.020
zh而且不会把任何东西回传出去
6:59.020–7:00.720
zh这不是以后才会有的事
7:00.720–7:02.960
zh而是现在就能做到的事
7:02.960–7:06.380
zh如果你是那种想把整套技术站都摆在桌面上
7:06.380–7:08.780
zh而不是放在别人云端里的开发者
7:08.780–7:11.220
zh这大概就是目前最清楚的信号
7:11.220–7:12.540
zh说明局面正在变化
7:12.540–7:15.560
zh再想到这位作者下一次他发出来的东西
7:15.560–7:17.300
zh肯定也会很有意思
7:17.300–7:18.820
zh值得一看
0:00.000–0:03.540
(此句尚無繁中翻譯)
0:03.540–0:06.380
(此句尚無繁中翻譯)
0:06.380–0:08.660
(此句尚無繁中翻譯)
0:08.660–0:10.520
(此句尚無繁中翻譯)
0:10.520–0:13.000
(此句尚無繁中翻譯)
0:13.000–0:14.700
(此句尚無繁中翻譯)
0:14.700–0:17.400
(此句尚無繁中翻譯)
0:17.400–0:21.460
(此句尚無繁中翻譯)
0:21.460–0:23.220
(此句尚無繁中翻譯)
0:23.220–0:26.120
(此句尚無繁中翻譯)
0:26.120–0:29.040
(此句尚無繁中翻譯)
0:29.040–0:32.040
(此句尚無繁中翻譯)
0:32.040–0:34.620
(此句尚無繁中翻譯)
0:34.620–0:36.220
(此句尚無繁中翻譯)
0:36.220–0:38.720
(此句尚無繁中翻譯)
0:38.720–0:41.880
(此句尚無繁中翻譯)
0:41.880–0:45.640
(此句尚無繁中翻譯)
0:45.640–0:48.680
(此句尚無繁中翻譯)
0:48.680–0:50.740
(此句尚無繁中翻譯)
0:50.740–0:52.400
(此句尚無繁中翻譯)
0:52.400–0:54.720
(此句尚無繁中翻譯)
0:54.720–0:56.340
(此句尚無繁中翻譯)
0:56.340–0:59.380
(此句尚無繁中翻譯)
0:59.380–1:01.680
(此句尚無繁中翻譯)
1:01.680–1:05.000
(此句尚無繁中翻譯)
1:05.000–1:06.500
(此句尚無繁中翻譯)
1:06.500–1:08.740
(此句尚無繁中翻譯)
1:08.740–1:10.460
(此句尚無繁中翻譯)
1:10.460–1:13.120
(此句尚無繁中翻譯)
1:13.120–1:14.300
(此句尚無繁中翻譯)
1:14.300–1:16.100
(此句尚無繁中翻譯)
1:16.100–1:19.060
(此句尚無繁中翻譯)
1:19.060–1:22.820
(此句尚無繁中翻譯)
1:22.820–1:25.480
(此句尚無繁中翻譯)
1:25.480–1:26.760
(此句尚無繁中翻譯)
1:26.760–1:28.780
(此句尚無繁中翻譯)
1:28.780–1:32.120
(此句尚無繁中翻譯)
1:32.120–1:32.720
(此句尚無繁中翻譯)
1:32.720–1:34.720
(此句尚無繁中翻譯)
1:34.720–1:36.480
(此句尚無繁中翻譯)
1:36.480–1:39.380
(此句尚無繁中翻譯)
1:39.380–1:41.200
(此句尚無繁中翻譯)
1:41.200–1:42.940
(此句尚無繁中翻譯)
1:42.940–1:44.340
(此句尚無繁中翻譯)
1:44.340–1:45.640
(此句尚無繁中翻譯)
1:45.640–1:50.480
(此句尚無繁中翻譯)
1:50.480–1:51.900
(此句尚無繁中翻譯)
1:51.900–1:54.900
(此句尚無繁中翻譯)
1:54.900–1:55.920
(此句尚無繁中翻譯)
1:55.920–1:58.140
(此句尚無繁中翻譯)
1:58.140–2:01.260
(此句尚無繁中翻譯)
2:01.260–2:04.960
(此句尚無繁中翻譯)
2:04.960–2:08.860
(此句尚無繁中翻譯)
2:08.860–2:13.460
(此句尚無繁中翻譯)
2:13.460–2:16.360
(此句尚無繁中翻譯)
2:16.360–2:17.960
(此句尚無繁中翻譯)
2:17.960–2:20.380
(此句尚無繁中翻譯)
2:20.380–2:22.480
(此句尚無繁中翻譯)
2:22.480–2:24.300
(此句尚無繁中翻譯)
2:24.300–2:25.900
(此句尚無繁中翻譯)
2:25.900–2:28.840
(此句尚無繁中翻譯)
2:28.840–2:30.740
(此句尚無繁中翻譯)
2:30.740–2:33.300
(此句尚無繁中翻譯)
2:33.300–2:35.720
(此句尚無繁中翻譯)
2:35.720–2:37.980
(此句尚無繁中翻譯)
2:37.980–2:40.820
(此句尚無繁中翻譯)
2:40.820–2:41.820
(此句尚無繁中翻譯)
2:41.820–2:45.420
(此句尚無繁中翻譯)
2:45.420–2:48.580
(此句尚無繁中翻譯)
2:48.580–2:51.740
(此句尚無繁中翻譯)
2:51.740–2:54.140
(此句尚無繁中翻譯)
2:54.140–2:57.860
(此句尚無繁中翻譯)
2:57.860–3:00.240
(此句尚無繁中翻譯)
3:00.240–3:01.720
(此句尚無繁中翻譯)
3:01.720–3:03.660
(此句尚無繁中翻譯)
3:03.660–3:05.340
(此句尚無繁中翻譯)
3:05.340–3:07.880
(此句尚無繁中翻譯)
3:07.880–3:09.000
(此句尚無繁中翻譯)
3:09.000–3:11.720
(此句尚無繁中翻譯)
3:11.720–3:13.160
(此句尚無繁中翻譯)
3:13.160–3:14.460
(此句尚無繁中翻譯)
3:14.460–3:17.220
(此句尚無繁中翻譯)
3:17.220–3:19.480
(此句尚無繁中翻譯)
3:19.480–3:21.440
(此句尚無繁中翻譯)
3:21.440–3:24.020
(此句尚無繁中翻譯)
3:24.020–3:26.720
(此句尚無繁中翻譯)
3:26.720–3:28.560
(此句尚無繁中翻譯)
3:28.560–3:30.820
(此句尚無繁中翻譯)
3:30.820–3:32.900
(此句尚無繁中翻譯)
3:32.900–3:35.900
(此句尚無繁中翻譯)
3:35.900–3:37.760
(此句尚無繁中翻譯)
3:37.760–3:39.840
(此句尚無繁中翻譯)
3:39.840–3:41.820
(此句尚無繁中翻譯)
3:41.820–3:44.760
(此句尚無繁中翻譯)
3:44.760–3:46.260
(此句尚無繁中翻譯)
3:46.260–3:48.040
(此句尚無繁中翻譯)
3:48.040–3:50.720
(此句尚無繁中翻譯)
3:50.720–3:52.200
(此句尚無繁中翻譯)
3:52.200–3:54.900
(此句尚無繁中翻譯)
3:54.900–3:56.240
(此句尚無繁中翻譯)
3:56.240–3:58.340
(此句尚無繁中翻譯)
3:58.340–4:00.540
(此句尚無繁中翻譯)
4:00.540–4:02.200
(此句尚無繁中翻譯)
4:02.200–4:03.920
(此句尚無繁中翻譯)
4:03.920–4:06.060
(此句尚無繁中翻譯)
4:06.060–4:08.760
(此句尚無繁中翻譯)
4:08.760–4:09.980
(此句尚無繁中翻譯)
4:09.980–4:13.000
(此句尚無繁中翻譯)
4:13.000–4:14.640
(此句尚無繁中翻譯)
4:14.640–4:17.800
(此句尚無繁中翻譯)
4:17.800–4:21.940
(此句尚無繁中翻譯)
4:21.940–4:23.820
(此句尚無繁中翻譯)
4:23.820–4:26.380
(此句尚無繁中翻譯)
4:26.380–4:28.620
(此句尚無繁中翻譯)
4:28.620–4:31.380
(此句尚無繁中翻譯)
4:31.380–4:34.920
(此句尚無繁中翻譯)
4:34.920–4:37.660
(此句尚無繁中翻譯)
4:37.660–4:40.760
(此句尚無繁中翻譯)
4:40.760–4:42.060
(此句尚無繁中翻譯)
4:42.060–4:43.180
(此句尚無繁中翻譯)
4:43.180–4:44.860
(此句尚無繁中翻譯)
4:44.860–4:46.620
(此句尚無繁中翻譯)
4:46.620–4:49.940
(此句尚無繁中翻譯)
4:49.940–4:53.540
(此句尚無繁中翻譯)
4:53.540–4:56.100
(此句尚無繁中翻譯)
4:56.100–4:58.060
(此句尚無繁中翻譯)
4:58.060–5:01.720
(此句尚無繁中翻譯)
5:01.720–5:02.940
(此句尚無繁中翻譯)
5:02.940–5:06.480
(此句尚無繁中翻譯)
5:06.480–5:10.860
(此句尚無繁中翻譯)
5:10.860–5:14.720
(此句尚無繁中翻譯)
5:14.720–5:17.600
(此句尚無繁中翻譯)
5:17.600–5:19.940
(此句尚無繁中翻譯)
5:19.940–5:23.720
(此句尚無繁中翻譯)
5:23.720–5:26.100
(此句尚無繁中翻譯)
5:26.100–5:27.300
(此句尚無繁中翻譯)
5:27.300–5:28.360
(此句尚無繁中翻譯)
5:28.360–5:30.360
(此句尚無繁中翻譯)
5:30.360–5:32.800
(此句尚無繁中翻譯)
5:32.800–5:35.960
(此句尚無繁中翻譯)
5:35.960–5:37.120
(此句尚無繁中翻譯)
5:37.120–5:40.220
(此句尚無繁中翻譯)
5:40.860–5:43.280
(此句尚無繁中翻譯)
5:43.280–5:44.020
(此句尚無繁中翻譯)
5:44.020–5:47.120
(此句尚無繁中翻譯)
5:47.120–5:50.040
(此句尚無繁中翻譯)
5:50.040–5:52.680
(此句尚無繁中翻譯)
5:52.680–5:54.900
(此句尚無繁中翻譯)
5:54.900–5:56.700
(此句尚無繁中翻譯)
5:56.700–6:00.060
(此句尚無繁中翻譯)
6:00.060–6:02.260
(此句尚無繁中翻譯)
6:02.260–6:05.880
(此句尚無繁中翻譯)
6:05.880–6:07.400
(此句尚無繁中翻譯)
6:07.400–6:09.520
(此句尚無繁中翻譯)
6:09.520–6:13.940
(此句尚無繁中翻譯)
6:13.940–6:17.640
(此句尚無繁中翻譯)
6:17.640–6:19.240
(此句尚無繁中翻譯)
6:19.240–6:22.720
(此句尚無繁中翻譯)
6:22.720–6:24.980
(此句尚無繁中翻譯)
6:24.980–6:26.260
(此句尚無繁中翻譯)
6:26.260–6:28.720
(此句尚無繁中翻譯)
6:28.720–6:31.380
(此句尚無繁中翻譯)
6:31.380–6:35.360
(此句尚無繁中翻譯)
6:35.360–6:38.260
(此句尚無繁中翻譯)
6:38.260–6:42.360
(此句尚無繁中翻譯)
6:42.360–6:44.280
(此句尚無繁中翻譯)
6:44.280–6:47.960
(此句尚無繁中翻譯)
6:47.960–6:49.020
(此句尚無繁中翻譯)
6:49.020–6:52.160
(此句尚無繁中翻譯)
6:52.160–6:52.740
(此句尚無繁中翻譯)
6:52.740–6:56.300
(此句尚無繁中翻譯)
6:56.300–6:59.020
(此句尚無繁中翻譯)
6:59.020–7:00.720
(此句尚無繁中翻譯)
7:00.720–7:02.960
(此句尚無繁中翻譯)
7:02.960–7:06.380
(此句尚無繁中翻譯)
7:06.380–7:08.780
(此句尚無繁中翻譯)
7:08.780–7:11.220
(此句尚無繁中翻譯)
7:11.220–7:12.540
(此句尚無繁中翻譯)
7:12.540–7:15.560
(此句尚無繁中翻譯)
7:15.560–7:17.300
(此句尚無繁中翻譯)
7:17.300–7:18.820
(此句尚無繁中翻譯)
0:00.000–0:03.540
zh写出Redis的那个人刚刚又做了一个自己的AI引擎
(此句尚無繁中翻譯)
0:03.540–0:06.380
zh他居然能在你面前那台笔记本上
(此句尚無繁中翻譯)
0:06.380–0:08.660
zh跑起接近前沿模型的效果
(此句尚無繁中翻譯)
0:08.660–0:10.520
zh这个项目叫DS4
(此句尚無繁中翻譯)
0:10.520–0:13.000
zh不过引擎本身有个更好听的名字
(此句尚無繁中翻譯)
0:13.000–0:14.700
zh叫Dwarf Star
(此句尚無繁中翻譯)
0:14.700–0:17.400
zh作者是Salvatore Sanfilippo
(此句尚無繁中翻譯)
0:17.400–0:21.460
zh也就是大家熟知的Antares Redis的创始人
(此句尚無繁中翻譯)
0:21.460–0:23.220
zh大约两个月前
(此句尚無繁中翻譯)
0:23.220–0:26.120
zh他用C从0写了一个全新的推理引擎
(此句尚無繁中翻譯)
0:26.120–0:29.040
zh只为了让DeepSeek的V4模型
(此句尚無繁中翻譯)
0:29.040–0:32.040
zh能在你可能真的拥有的机器上跑得很好
(此句尚無繁中翻譯)
0:32.040–0:34.620
zh比如MacBook或MacStudio
(此句尚無繁中翻譯)
0:34.620–0:36.220
zh接下来的惊喜是
(此句尚無繁中翻譯)
0:36.220–0:38.720
zh模型不再非得塞进内存里
(此句尚無繁中翻譯)
0:38.720–0:41.880
zh它把你的SSD也当成它真正的家
(此句尚無繁中翻譯)
0:41.880–0:45.640
zh需要时再从硬盘流逝读取那些重的部分
(此句尚無繁中翻譯)
0:45.640–0:48.680
zh而不是逼你把整个模型都塞进人
(此句尚無繁中翻譯)
0:48.680–0:50.740
zh到现在为止还喜欢吗
(此句尚無繁中翻譯)
0:50.740–0:52.400
zh订阅这个YouTube频道
(此句尚無繁中翻譯)
0:52.400–0:54.720
zh还可以去Indie Hacker News
(此句尚無繁中翻譯)
0:54.720–0:56.340
zh免费领取每日Newsletter
(此句尚無繁中翻譯)
0:56.340–0:59.380
zh每个工作日都有一个新的深度解析
(此句尚無繁中翻譯)
0:59.380–1:01.680
zh如果你真的打开这个Repo
(此句尚無繁中翻譯)
1:01.680–1:05.000
zh最显眼的就是他对这一切都很坦诚
(此句尚無繁中翻譯)
1:05.000–1:06.500
zh开头他就说了
(此句尚無繁中翻譯)
1:06.500–1:08.740
zh这个项目故意做得很窄
(此句尚無繁中翻譯)
1:08.740–1:10.460
zh一次只针对一个模型
(此句尚無繁中翻譯)
1:10.460–1:13.120
zh而且他不是想做通用运行器
(此句尚無繁中翻譯)
1:13.120–1:14.300
zh往下再看一点
(此句尚無繁中翻譯)
1:14.300–1:16.100
zh你会看到他的动机
(此句尚無繁中翻譯)
1:16.100–1:19.060
zh基本上就是真正有能力的开源模型
(此句尚無繁中翻譯)
1:19.060–1:22.820
zh终于和真正有能力的个人电脑同时出现了
(此句尚無繁中翻譯)
1:22.820–1:25.480
zh所以这两者该碰到一起了
(此句尚無繁中翻譯)
1:25.480–1:26.760
zh继续往下
(此句尚無繁中翻譯)
1:26.760–1:28.780
zh你会看到真正的速度数据
(此句尚無繁中翻譯)
1:28.780–1:32.120
zh都是在真实的MacBook上跑出来的实际
(此句尚無繁中翻譯)
1:32.120–1:32.720
enBenchmark
(此句尚無繁中翻譯)
1:32.720–1:34.720
zh还有那些小图表
(此句尚無繁中翻譯)
1:34.720–1:36.480
zh就算上下文越来越长
(此句尚無繁中翻譯)
1:36.480–1:39.380
zhToken Per Second也几乎没怎么掉
(此句尚無繁中翻譯)
1:39.380–1:41.200
zh然后他会讲到
(此句尚無繁中翻譯)
1:41.200–1:42.940
zh怎么运行比你内存还大的模型
(此句尚無繁中翻譯)
1:42.940–1:44.340
zh快到下面时
(此句尚無繁中翻譯)
1:44.340–1:45.640
zh最疯狂的部分来了
(此句尚無繁中翻譯)
1:45.640–1:50.480
zh把一个模型拆到两台用网线连在一起的笔记本上跑
(此句尚無繁中翻譯)
1:50.480–1:51.900
zh说实话
(此句尚無繁中翻譯)
1:51.900–1:54.900
zh在自己机器上跑模型也不新鲜了
(此句尚無繁中翻譯)
1:54.900–1:55.920
zh有Lama CPP
(此句尚無繁中翻譯)
1:55.920–1:58.140
zh这个庞大的开源项目
(此句尚無繁中翻譯)
1:58.140–2:01.260
zh整个生态里有一半都是建立在他之上
(此句尚無繁中翻譯)
2:01.260–2:04.960
zhDwarf Star也毫不掩饰地站在他肩膀上
(此句尚無繁中翻譯)
2:04.960–2:08.860
zhAlama把本地模型变成了一型命令安装
(此句尚無繁中翻譯)
2:08.860–2:13.460
zhLM Studio又把这一切包装成了友好的桌面应用
(此句尚無繁中翻譯)
2:13.460–2:16.360
zh连不爱用终端的人也能上手
(此句尚無繁中翻譯)
2:16.360–2:17.960
zh但这个项目不一样
(此句尚無繁中翻譯)
2:17.960–2:20.380
zh他走的是完全相反的路
(此句尚無繁中翻譯)
2:20.380–2:22.480
zh他不是什么模型都支持
(此句尚無繁中翻譯)
2:22.480–2:24.300
zh而是只选一个
(此句尚無繁中翻譯)
2:24.300–2:25.900
zh然后把它调到极致
(此句尚無繁中翻譯)
2:25.900–2:28.840
zh拼命榨出最后一点速度和效果
(此句尚無繁中翻譯)
2:28.840–2:30.740
zh先说下这个规模
(此句尚無繁中翻譯)
2:30.740–2:33.300
zh已经有18500多个Star了
(此句尚無繁中翻譯)
2:33.300–2:35.720
zh而且是MIT许可证
(此句尚無繁中翻譯)
2:35.720–2:37.980
zh所以你基本可以随便拿去用
(此句尚無繁中翻譯)
2:37.980–2:40.820
zh整个项目几乎完全用C写成
(此句尚無繁中翻譯)
2:40.820–2:41.820
zh真想跑得顺
(此句尚無繁中翻譯)
2:41.820–2:45.420
zh还是得有一台差不多96G内存的Mac
(此句尚無繁中翻譯)
2:45.420–2:48.580
zh当然内存更少也能流逝运行
(此句尚無繁中翻譯)
2:48.580–2:51.740
zh好机制上它到底是怎么工作的
(此句尚無繁中翻譯)
2:51.740–2:54.140
zh核心是在现代机器上
(此句尚無繁中翻譯)
2:54.140–2:57.860
zh你的模型和缓存不一定非得放在RAM里
(此句尚無繁中翻譯)
2:57.860–3:00.240
zh也可以放在SSD上
(此句尚無繁中翻譯)
3:00.240–3:01.720
zh这个思路一变
(此句尚無繁中翻譯)
3:01.720–3:03.660
zh事情就完全不一样了
(此句尚無繁中翻譯)
3:03.660–3:05.340
zh路由专家层
(此句尚無繁中翻譯)
3:05.340–3:07.880
zh也就是这类Mixture Model里
(此句尚無繁中翻譯)
3:07.880–3:09.000
zh占大头的部分
(此句尚無繁中翻譯)
3:09.000–3:11.720
zh会在某个Token需要它的时候
(此句尚無繁中翻譯)
3:11.720–3:13.160
zh才从磁盘流逝加赛
(此句尚無繁中翻譯)
3:13.160–3:14.460
zh这样一来
(此句尚無繁中翻譯)
3:14.460–3:17.220
zh内存就不再是一睹你一头撞上的硬墙
(此句尚無繁中翻譯)
3:17.220–3:19.480
zh而更像是加速用的杠杆
(此句尚無繁中翻譯)
3:19.480–3:21.440
zh为了让它能跑起来
(此句尚無繁中翻譯)
3:21.440–3:24.020
zh它用了比较激进的2bit量化
(此句尚無繁中翻譯)
3:24.020–3:26.720
zh但这是有意做成不对称的
(此句尚無繁中翻譯)
3:26.720–3:28.560
zh它只压缩Exper权重
(此句尚無繁中翻譯)
3:28.560–3:30.820
zhAttention和共享层
(此句尚無繁中翻譯)
3:30.820–3:32.900
zh则尽量保持接近满质量
(此句尚無繁中翻譯)
3:32.900–3:35.900
zh所以它还能保持足够稳定
(此句尚無繁中翻譯)
3:35.900–3:37.760
zh值得拿来做真实任务
(此句尚無繁中翻譯)
3:37.760–3:39.840
zh而结果确实有效
(此句尚無繁中翻譯)
3:39.840–3:41.820
zh在M3MAX笔记本上
(此句尚無繁中翻譯)
3:41.820–3:44.760
zh速度大约是每秒27个Token
(此句尚無繁中翻譯)
3:44.760–3:46.260
zh已经完全够用了
(此句尚無繁中翻譯)
3:46.260–3:48.040
zh想被推荐吗
(此句尚無繁中翻譯)
3:48.040–3:50.720
zh把你的开源仓库提交到Indie Hacker
(此句尚無繁中翻譯)
3:50.720–3:52.200
enNew Supply
(此句尚無繁中翻譯)
3:52.200–3:54.900
zh就能让成千上万的开发者看到你
(此句尚無繁中翻譯)
3:54.900–3:56.240
zh说实话
(此句尚無繁中翻譯)
3:56.240–3:58.340
zh到这里它就不再只是个技术演示了
(此句尚無繁中翻譯)
3:58.340–4:00.540
zh而是开始像个真正的产品了
(此句尚無繁中翻譯)
4:00.540–4:02.200
zh它内置了一个编码Agent
(此句尚無繁中翻譯)
4:02.200–4:03.920
zh有个很巧的设计师
(此句尚無繁中翻譯)
4:03.920–4:06.060
zh这个绘画不会存到什么数据库里
(此句尚無繁中翻譯)
4:06.060–4:08.760
zh这个Session本质上就是把KVCache
(此句尚無繁中翻譯)
4:08.760–4:09.980
zh放在你的硬盘上
(此句尚無繁中翻譯)
4:09.980–4:13.000
zh这样切换以保存的对话就会非常快
(此句尚無繁中翻譯)
4:13.000–4:14.640
zh它还内置了一个
(此句尚無繁中翻譯)
4:14.640–4:17.800
zh同时支持OpenLayer和Enthropy API的Server
(此句尚無繁中翻譯)
4:17.800–4:21.940
zh这意味着你可以直接把Codex或Cloud Code
(此句尚無繁中翻譯)
4:21.940–4:23.820
zh指向你自己的笔记本电脑
(此句尚無繁中翻譯)
4:23.820–4:26.380
zh在你自己托管的模型上工作
(此句尚無繁中翻譯)
4:26.380–4:28.620
zh它甚至加了一个PowerDial
(此句尚無繁中翻譯)
4:28.620–4:31.380
zh可以在你更在意机器两款安静
(此句尚無繁中翻譯)
4:31.380–4:34.920
zh而不是榨干每一个Token的时候去限制GPU
(此句尚無繁中翻譯)
4:34.920–4:37.660
zh所有这些都在指向同一个想法
(此句尚無繁中翻譯)
4:37.660–4:40.760
zh本地模型应该像一个做完整的产品
(此句尚無繁中翻譯)
4:40.760–4:42.060
zh而不是一堆零件
(此句尚無繁中翻譯)
4:42.060–4:43.180
zh说到底
(此句尚無繁中翻譯)
4:43.180–4:44.860
zh它的底层其实非常老派
(此句尚無繁中翻譯)
4:44.860–4:46.620
zh核心部分是纯C
(此句尚無繁中翻譯)
4:46.620–4:49.940
zh再加上一些手写的Cuda和Metal Shader
(此句尚無繁中翻譯)
4:49.940–4:53.540
zh真正负责GPU运算的几乎就只有这些
(此句尚無繁中翻譯)
4:53.540–4:56.100
zh它明确没有链接GGML
(此句尚無繁中翻譯)
4:56.100–4:58.060
zh也就是LamaCPP背后的那个库
(此句尚無繁中翻譯)
4:58.060–5:01.720
zh但它确实适配了其中一些格式和Kernel
(此句尚無繁中翻譯)
5:01.720–5:02.940
zh而且出于尊重
(此句尚無繁中翻譯)
5:02.940–5:06.480
zh把它们的版权信息直接保留了下来
(此句尚無繁中翻譯)
5:06.480–5:10.860
zh每次构建都会拿DivC在不同上下文长度下的官方输出做检查
(此句尚無繁中翻譯)
5:10.860–5:14.720
zh所以那种悄悄把质量搞坏的改动会在发布前被发现
(此句尚無繁中翻譯)
5:14.720–5:17.600
zh它还能跑在Apple Metal和NVIDIA显卡上
(此句尚無繁中翻譯)
5:17.600–5:19.940
zh连小小的DGX2也支持
(此句尚無繁中翻譯)
5:19.940–5:23.720
zh它甚至还能处理AMD的统一内存机器
(此句尚無繁中翻譯)
5:23.720–5:26.100
zh启动它出人意料的简单
(此句尚無繁中翻譯)
5:26.100–5:27.300
zh甚至有点无聊
(此句尚無繁中翻譯)
5:27.300–5:28.360
zh但这是好事
(此句尚無繁中翻譯)
5:28.360–5:30.360
zh你先运行下载脚本
(此句尚無繁中翻譯)
5:30.360–5:32.800
zh把适配你机器的2bit模型拉下来
(此句尚無繁中翻譯)
5:32.800–5:35.960
zh然后在Mac上用Mac构建Metal版本
(此句尚無繁中翻譯)
5:35.960–5:37.120
zh再把它启动起来
(此句尚無繁中翻譯)
5:37.120–5:40.220
zh你还可以选择开启SSD Streaming
(此句尚無繁中翻譯)
5:40.860–5:43.280
zh这样就能用比实际内存更大的模型
(此句尚無繁中翻譯)
5:43.280–5:44.020
zh之后
(此句尚無繁中翻譯)
5:44.020–5:47.120
zh你就是在和自己硬件上的模型对话
(此句尚無繁中翻譯)
5:47.120–5:50.040
zh输入的内容也不会离开这台机器
(此句尚無繁中翻譯)
5:50.040–5:52.680
zh然后还有一个最近才上线
(此句尚無繁中翻譯)
5:52.680–5:54.900
zh让大家都有点惊讶的功能
(此句尚無繁中翻譯)
5:54.900–5:56.700
enDistributed Mode
(此句尚無繁中翻譯)
5:56.700–6:00.060
zh它会把一个模型拆到多台机器上
(此句尚無繁中翻譯)
6:00.060–6:02.260
zh每台分一部分layers
(此句尚無繁中翻譯)
6:02.260–6:05.880
zh这样一个大到任何单机都跑不动的模型
(此句尚無繁中翻譯)
6:05.880–6:07.400
zh也照样能运行
(此句尚無繁中翻譯)
6:07.400–6:09.520
zh最典型的例子
(此句尚無繁中翻譯)
6:09.520–6:13.940
zh是两台128G的MacBook通过Thunderbolt连接
(此句尚無繁中翻譯)
6:13.940–6:17.640
zh在它们之间运行完整的4bit模型
(此句尚無繁中翻譯)
6:17.640–6:19.240
zh更惊人的是
(此句尚無繁中翻譯)
6:19.240–6:22.720
zh这一切都是在最近几周的提交里才出现的
(此句尚無繁中翻譯)
6:22.720–6:24.980
zh所以这对你意味着什么
(此句尚無繁中翻譯)
6:24.980–6:26.260
zh现在还很早
(此句尚無繁中翻譯)
6:26.260–6:28.720
zh作者也首先承认这还是Beta
(此句尚無繁中翻譯)
6:28.720–6:31.380
zh已经有几百个未解决的问题
(此句尚無繁中翻譯)
6:31.380–6:35.360
zh而且它只会运行它发布的那些特定模型文件
(此句尚無繁中翻譯)
6:35.360–6:38.260
zh所以它是把利器不是瑞士军刀
(此句尚無繁中翻譯)
6:38.260–6:42.360
zh你还得有一台相当强的Mac才能获得好的体验
(此句尚無繁中翻譯)
6:42.360–6:44.280
zh也有些人会介意
(此句尚無繁中翻譯)
6:44.280–6:47.960
zh这里面很多代码都是在AI参与下写出来的
(此句尚無繁中翻譯)
6:47.960–6:49.020
zh但往后看
(此句尚無繁中翻譯)
6:49.020–6:52.160
zh这背后的压注其实挺让人兴奋的
(此句尚無繁中翻譯)
6:52.160–6:52.740
zh它在说
(此句尚無繁中翻譯)
6:52.740–6:56.300
zh这么强大的模型完全跑在你自己的硬件上
(此句尚無繁中翻譯)
6:56.300–6:59.020
zh而且不会把任何东西回传出去
(此句尚無繁中翻譯)
6:59.020–7:00.720
zh这不是以后才会有的事
(此句尚無繁中翻譯)
7:00.720–7:02.960
zh而是现在就能做到的事
(此句尚無繁中翻譯)
7:02.960–7:06.380
zh如果你是那种想把整套技术站都摆在桌面上
(此句尚無繁中翻譯)
7:06.380–7:08.780
zh而不是放在别人云端里的开发者
(此句尚無繁中翻譯)
7:08.780–7:11.220
zh这大概就是目前最清楚的信号
(此句尚無繁中翻譯)
7:11.220–7:12.540
zh说明局面正在变化
(此句尚無繁中翻譯)
7:12.540–7:15.560
zh再想到这位作者下一次他发出来的东西
(此句尚無繁中翻譯)
7:15.560–7:17.300
zh肯定也会很有意思
(此句尚無繁中翻譯)
7:17.300–7:18.820
zh值得一看
(此句尚無繁中翻譯)

影片筆記:Redis 创始人亲手写了个 AI 引擎:用 MacBook 跑近前沿模型,还能把 SSD 当内存用

一句話總結

Redis 創始人 Salvatore Sanfilippo 開發了名為 Dwarf Star(專案名 DS4)的本地 AI 推理引擎,透過將 SSD 視為記憶體延伸(流式讀取)、採用針對單一模型的極致 2-bit 非對稱量化技術,以及支援分散式運算,實現了在 MacBook 等個人硬體上高效運行接近前沿的大規模模型(如 DeepSeek V4),並強調數據完全保留在本地。

核心重點

  • 專案背景與動機
  • 由 Redis 創始人 Salvatore Sanfilippo(代號 Antares)從零開始使用 C 語言編寫。
  • 目標是讓強大的開源模型能在普通硬體(MacBook/Mac Studio)上運行,結合前沿效果與個人電腦。
  • 拒絕做通用運行器,採取「窄而深」策略,僅針對單一模型調至極致。
  • 技術架構突破
  • 記憶體與儲存策略:打破模型必須完全載入記憶體的限制,將 SSD 視為模型的「真正家園」,需要時從硬碟流式讀取重型部分。記憶體作為加速槓桿而非硬性限制。
  • 非對稱量化:採用激進的 2-bit 量化,但僅壓縮「專家層」(Expert weights)權重;Attention 和共享層盡量保持接近滿精度(Full Quality)以維持穩定性。
  • 硬體支援:支援 Apple Metal、NVIDIA 顯卡及 AMD 統一記憶體機器。底層為純 C 語言 + 手寫 CUDA 和 Metal Shader。
  • 未連結 GGML:明確沒有連結 LamaCPP 背後的 GGML 庫,但適配部分格式與 Kernel。
  • 功能與產品化
  • 效能:在 M3 Max 筆記型電腦上,速度約為每秒 27 個 Token(Token Per Second),且隨上下文變長,速度幾乎不下降。
  • 內建功能:包含 Coding Agent、Session 管理(KVCache 放硬碟實現快速切換對話)、API Server(支援 OpenLayer 和 Enthropy API,可指向 Codex 或 Cloud Code)、PowerDial(權衡機器安靜與 Token 速度)。
  • 分散式模式:支援將模型拆分至多台機器運行(如兩台 128GB MacBook 透過 Thunderbolt 連接運行完整 4-bit 模型)。
  • 當前狀態
  • 專案擁有 18,500+ Stars,採用 MIT 許可證。
  • 目前為 Beta 版本,有數百個未解決問題。
  • 僅運行發布的特定模型文件,非通用解決方案。
  • 部分代碼由 AI 參與撰寫。

詳細大綱

1. 專案背景與開發動機

  • 作者身份:Salvatore Sanfilippo,Redis 創始人,代號 Antares。
  • 專案名稱
  • 專案名:DS4
  • 引擎名:Dwarf Star
  • 開發語言:從零開始使用 C 語言編寫。
  • 核心動機
  • 讓真正強大的開源模型與個人電腦同時出現,兩者應結合。
  • 讓模型在普通硬體(如 MacBook/Mac Studio)上運行接近前沿的效果。
  • 拒絕做通用運行器,選擇「窄而深」的策略,只針對單一模型調至極致。

2. 技術架構與原理

  • 記憶體與儲存策略
  • 打破模型必須塞入記憶體的限制。
  • 將 SSD 視為模型的「真正家園」,需要時從硬碟流式讀取重型部分。
  • 記憶體不再是硬性限制,而是作為加速的槓桿。
  • 量化技術
  • 採用激進的 2-bit 量化。
  • 非對稱設計:僅壓縮「專家層」(Expert weights)權重;Attention 和共享層盡量保持接近滿精度(Full Quality),以維持穩定性。
  • 硬體支援
  • 支援 Apple Metal 和 NVIDIA 顯卡。
  • 支援 AMD 統一記憶體機器。
  • 推薦硬體:約 96GB 記憶體 Mac(記憶體較少亦可運行)。
  • 底層實現:純 C 語言 + 手寫 CUDA 和 Metal Shader。
  • 未連結 GGML:明確沒有連結 LamaCPP 背後的 GGML 庫,但適配部分格式與 Kernel,並保留版權資訊。

3. 功能與產品化設計

  • 效能表現
  • 在 M3 Max 筆記型電腦上,速度約為每秒 27 個 Token(Token Per Second)。
  • 隨著上下文變長,Token Per Second 幾乎沒有下降。
  • 內建功能
  • Coding Agent:內建編碼 Agent。
  • Session 管理:將 KVCache 放在硬碟上,實現快速切換已保存的對話。
  • API Server:支援 OpenLayer 和 Enthropy API,可指向 Codex 或 Cloud Code 在本地模型上工作。
  • PowerDial:允許用戶在「機器安靜」與「榨乾 Token 速度」之間進行權衡限制。
  • 分散式模式(Distributed Mode)
  • 將模型拆分到多台機器上運行,每台機器分擔部分 Layers。
  • 典型場景:兩台 128GB MacBook 透過 Thunderbolt 連接,運行完整的 4-bit 模型。
  • 解決單機記憶體不足無法運行大模型的問題。

4. 使用流程與現狀

  • 安裝與運行
  1. 運行下載腳本,拉取適配機器的 2-bit 模型。
  2. 在 Mac 上構建 Metal 版本。
  3. 啟動引擎,可選擇開啟 SSD Streaming。
  4. 輸入內容不離開機器,實現本地對話。
  • 品質保證
  • 每次構建使用 DivC 檢查不同上下文長度下的官方輸出,防止質量被悄悄破壞。
  • 當前狀態
  • 專案擁有 18,500+ Stars,採用 MIT 許可證。
  • 目前為 Beta 版本,有數百個未解決問題。
  • 僅運行發布的特定模型文件,非通用解決方案。
  • 部分代碼由 AI 參與撰寫。

工具 / 模型 / 名詞整理

  • AI 模型/技術
  • DeepSeek V4
  • Mixture Model(混合模型)
  • KVCache
  • 2-bit 量化 / 4-bit 模型
  • 軟體/專案名稱
  • Dwarf Star(推理引擎名稱)
  • DS4(專案名稱)
  • Redis
  • Lama CPP(註:逐字稿原文拼寫,疑為 llama.cpp)
  • LM Studio
  • GGML
  • Codex
  • Cloud Code
  • Indie Hacker News
  • Indie Hacker New Supply(註:疑為 Indie Hacker News 或相關社群名稱的聽寫錯誤)
  • 硬體/平台
  • MacBook
  • Mac Studio
  • M3 Max
  • DGX2
  • Apple Metal
  • NVIDIA 顯卡
  • AMD 統一記憶體
  • Thunderbolt
  • 其他專有名詞
  • Antares(Salvatore Sanfilippo 的代號)
  • OpenLayer(註:疑為 OpenAI API 或類似名稱的聽寫錯誤)
  • Enthropy API(註:疑為 Entropy API 或其他名稱的聽寫錯誤)
  • PowerDial
  • Cuda
  • Metal Shader
  • MIT 許可證

操作流程整理

  1. 準備環境:運行下載腳本,拉取適配機器的 2-bit 模型。
  2. 構建引擎:在 Mac 上構建 Metal 版本。
  3. 啟動引擎:啟動 Dwarf Star 引擎,可選擇開啟 SSD Streaming 功能。
  4. 進行對話:輸入內容,數據不離開機器,實現本地對話。
  • *註:若需分散式運算,可透過 Thunderbolt 連接多台機器(如兩台 128GB MacBook)共同運行模型。*
  1. 品質檢查:每次構建使用 DivC 檢查不同上下文長度下的官方輸出,確保質量未被破壞。

值得注意的限制或風險

  • 非通用解決方案:僅運行發布的特定模型文件,並非通用解決方案。
  • Beta 階段穩定性:目前為 Beta 版本,存在數百個未解決問題。
  • 硬體依賴:雖支援多種硬體,但針對單一模型優化,換用其他模型可能需重新構建或調整。
  • 分散式運算複雜度:分散式模式需多台機器透過 Thunderbolt 連接,對普通用戶門檻較高。
  • 數據隱私與本地化:強調數據完全保留在本地,不上傳雲端,這既是優勢也意味著缺乏雲端備份或協同功能。

逐字稿辨識疑點

  • Lama CPP:逐字稿中多次出現「Lama CPP」,結合上下文「整個生態裡有一半都是建立在他之上」及「GGML」,極大機率為 llama.cpp 的聽寫錯誤,但依規則標註為疑點。
  • OpenLayer:逐字稿提及「支持 OpenLayer 和 Enthropy API」,疑為 OpenAI API 或其他特定 API 名稱的聽寫錯誤。
  • Enthropy API:逐字稿提及「Enthropy API」,疑為 Entropy API 或其他名稱的聽寫錯誤。
  • Indie Hacker New Supply:逐字稿提及「提交到 Indie Hacker New Supply」,疑為 Indie Hacker News 或該社群特定版塊名稱的聽寫錯誤。
  • Antares:逐字稿稱 Salvatore Sanfilippo 為「大家熟知的 Antares」,通常 Antares 指代其他技術或人物,此處為逐字稿原樣記錄。
  • DivC:逐字稿提及「拿 DivC 在不同上下文長度下的官方輸出做檢查」,疑為 Diff 或特定測試工具名稱的聽寫錯誤。
  • DS4:專案名稱,保留原樣。
  • Dwarf Star:引擎名稱,保留原樣。
  • DeepSeek 的 V4 模型:保留原樣,指代特定模型版本。
  • 18500 多個 Star:保留原樣,指 GitHub Stars 數量。
  • 96G 内存:保留原樣,指記憶體容量。
  • 27 个 Token:保留原樣,指每秒 Token 數。
  • 128G 的 MacBook:保留原樣,指記憶體容量。

可延伸追問

  • Dwarf Star 引擎的 2-bit 非對稱量化具體如何影響模型的推理準確率?
  • 分散式模式下,Thunderbolt 連接的頻寬是否會成為運行大模型的瓶頸?
  • 為何選擇不連結 GGML 庫,這對未來的生態兼容性有何影響?
  • PowerDial 功能具體如何平衡「機器安靜」與「Token 速度」?
  • 該引擎是否支援除 DeepSeek V4 以外的其他開源模型?

尚未產生學習筆記

請在 Telegram 指令最後加上「學習」,例如:videonote 網址 英文 雙語 學習