今天是2026年8月5日,700E参数塞进4GB显卡。Aon用逐层搬运改写门槛。L,让塞不进显卡的大模型改用逐层搬运。它一次只把需要的一层送进GPU,让700E参数模型可用单张4GB显卡执行。小团队在工作站测试大模型,不必先租多卡主机。安装后,以AutoModel载入模型平台的模型。 它会切分快取权重,预取再重叠,磁叠载入与运算。新版支援FP8与西数Mod。官方称KIMI-K3可低于4GB显存运行。 今天增加1716颗星,低显存推论重新受到关注。代价是速度受磁叠吞吐影响,少次切分需足够储存空间。 想在CUDA或Apple晶片探索超大模型,可先用小模型验证品质与速度,再把本地实验推向更大尺度。 以上就是今天的Github开源焦点,喜欢这类工具介绍,记得按赞订阅频道,我们明天见。