AirLLM:4GB 显存跑 70B,还能跑 Kimi K3
本地跑大模型,第一关往往卡在显存上。
AirLLM 给了一个解决思路,就是用磁盘 I/O 和调度换显存。它按层拆分模型权重并将它保存在磁盘中,推理时只将当前计算需要的一层权重加载到 GPU 中,完成计算后立即释放,然后继续处理下一层。这样,显存不用保存完整的模型,70B 模型能在单张 4GB 显卡上运行,而要运行 Llama 3.1 405B 需要的最低显存也降至约 8GB。
在技术实现方面,AirLLM 除了支持按层切分、权重流式加载、下一层预取,还支持 4-bit、8-bit 压缩。
预取机制让权重读取与计算尽量并行,压缩进一步减少了磁盘的读取量。AirLLM 主要降低运行模型的硬件门槛,模型的推理速度仍然受到磁盘性能、数据传输和逐层加载开销影响,因此它不适合实时聊天或高并发服务等场景。
上周,AirLLM 新增了对 Kimi K3 的支持。Kimi K3 拥有 2.8T 参数,据项目仓库公布的测试数据,它在一张 RTX 6000 Ada 上运行时,端到端显存占用约为 3.72GB。针对稀疏 MoE 架构,AirLLM 只流式加载当前 Token 实际路由到的专家,从而进一步降低显存占用。
这个充分体现了 AirLLM 的工程思路,超大模型不用完整地常驻显存,个人开发者也能进行兼容性验证、离线推理、RAG 文档处理和低频实验。
如果你的显存不是特别富裕但磁盘够大,比起并发和吞吐更看重“先跑起来”(比如做兼容性测试、离线 Batch 推理、RAG 预处理或低频实验),AirLLM 会是个很实用的工具。
开源项目 AirLLM 大模型推理 低显存 本地大模型 LLM 推理框架 模型部署 开发者工具





