写出Redis的那个人刚刚又做了一个自己的AI引擎 他居然能在你面前那台笔记本上 跑起接近前沿模型的效果 这个项目叫DS4 不过引擎本身有个更好听的名字 叫Dwarf Star 作者是Salvatore Sanfilippo 也就是大家熟知的Antares Redis的创始人 大约两个月前 他用C从0写了一个全新的推理引擎 只为了让DeepSeek的V4模型 能在你可能真的拥有的机器上跑得很好 比如MacBook或MacStudio 接下来的惊喜是 模型不再非得塞进内存里 它把你的SSD也当成它真正的家 需要时再从硬盘流逝读取那些重的部分 而不是逼你把整个模型都塞进人 到现在为止还喜欢吗 订阅这个YouTube频道 还可以去Indie Hacker News 免费领取每日Newsletter 每个工作日都有一个新的深度解析 如果你真的打开这个Repo 最显眼的就是他对这一切都很坦诚 开头他就说了 这个项目故意做得很窄 一次只针对一个模型 而且他不是想做通用运行器 往下再看一点 你会看到他的动机 基本上就是真正有能力的开源模型 终于和真正有能力的个人电脑同时出现了 所以这两者该碰到一起了 继续往下 你会看到真正的速度数据 都是在真实的MacBook上跑出来的实际 Benchmark 还有那些小图表 就算上下文越来越长 Token Per Second也几乎没怎么掉 然后他会讲到 怎么运行比你内存还大的模型 快到下面时 最疯狂的部分来了 把一个模型拆到两台用网线连在一起的笔记本上跑 说实话 在自己机器上跑模型也不新鲜了 有Lama CPP 这个庞大的开源项目 整个生态里有一半都是建立在他之上 Dwarf Star也毫不掩饰地站在他肩膀上 Alama把本地模型变成了一型命令安装 LM Studio又把这一切包装成了友好的桌面应用 连不爱用终端的人也能上手 但这个项目不一样 他走的是完全相反的路 他不是什么模型都支持 而是只选一个 然后把它调到极致 拼命榨出最后一点速度和效果 先说下这个规模 已经有18500多个Star了 而且是MIT许可证 所以你基本可以随便拿去用 整个项目几乎完全用C写成 真想跑得顺 还是得有一台差不多96G内存的Mac 当然内存更少也能流逝运行 好机制上它到底是怎么工作的 核心是在现代机器上 你的模型和缓存不一定非得放在RAM里 也可以放在SSD上 这个思路一变 事情就完全不一样了 路由专家层 也就是这类Mixture Model里 占大头的部分 会在某个Token需要它的时候 才从磁盘流逝加赛 这样一来 内存就不再是一睹你一头撞上的硬墙 而更像是加速用的杠杆 为了让它能跑起来 它用了比较激进的2bit量化 但这是有意做成不对称的 它只压缩Exper权重 Attention和共享层 则尽量保持接近满质量 所以它还能保持足够稳定 值得拿来做真实任务 而结果确实有效 在M3MAX笔记本上 速度大约是每秒27个Token 已经完全够用了 想被推荐吗 把你的开源仓库提交到Indie Hacker New Supply 就能让成千上万的开发者看到你 说实话 到这里它就不再只是个技术演示了 而是开始像个真正的产品了 它内置了一个编码Agent 有个很巧的设计师 这个绘画不会存到什么数据库里 这个Session本质上就是把KVCache 放在你的硬盘上 这样切换以保存的对话就会非常快 它还内置了一个 同时支持OpenLayer和Enthropy API的Server 这意味着你可以直接把Codex或Cloud Code 指向你自己的笔记本电脑 在你自己托管的模型上工作 它甚至加了一个PowerDial 可以在你更在意机器两款安静 而不是榨干每一个Token的时候去限制GPU 所有这些都在指向同一个想法 本地模型应该像一个做完整的产品 而不是一堆零件 说到底 它的底层其实非常老派 核心部分是纯C 再加上一些手写的Cuda和Metal Shader 真正负责GPU运算的几乎就只有这些 它明确没有链接GGML 也就是LamaCPP背后的那个库 但它确实适配了其中一些格式和Kernel 而且出于尊重 把它们的版权信息直接保留了下来 每次构建都会拿DivC在不同上下文长度下的官方输出做检查 所以那种悄悄把质量搞坏的改动会在发布前被发现 它还能跑在Apple Metal和NVIDIA显卡上 连小小的DGX2也支持 它甚至还能处理AMD的统一内存机器 启动它出人意料的简单 甚至有点无聊 但这是好事 你先运行下载脚本 把适配你机器的2bit模型拉下来 然后在Mac上用Mac构建Metal版本 再把它启动起来 你还可以选择开启SSD Streaming 这样就能用比实际内存更大的模型 之后 你就是在和自己硬件上的模型对话 输入的内容也不会离开这台机器 然后还有一个最近才上线 让大家都有点惊讶的功能 Distributed Mode 它会把一个模型拆到多台机器上 每台分一部分layers 这样一个大到任何单机都跑不动的模型 也照样能运行 最典型的例子 是两台128G的MacBook通过Thunderbolt连接 在它们之间运行完整的4bit模型 更惊人的是 这一切都是在最近几周的提交里才出现的 所以这对你意味着什么 现在还很早 作者也首先承认这还是Beta 已经有几百个未解决的问题 而且它只会运行它发布的那些特定模型文件 所以它是把利器不是瑞士军刀 你还得有一台相当强的Mac才能获得好的体验 也有些人会介意 这里面很多代码都是在AI参与下写出来的 但往后看 这背后的压注其实挺让人兴奋的 它在说 这么强大的模型完全跑在你自己的硬件上 而且不会把任何东西回传出去 这不是以后才会有的事 而是现在就能做到的事 如果你是那种想把整套技术站都摆在桌面上 而不是放在别人云端里的开发者 这大概就是目前最清楚的信号 说明局面正在变化 再想到这位作者下一次他发出来的东西 肯定也会很有意思 值得一看