「70B 大模型得用专业显卡、几十 GB 显存(显卡上的内存,模型运行时数据先放这里)才能跑」——这个常识被一个开源工具打破了。AirLLM 让 70B 的大模型在单张 4GB 消费级显卡上运行,不用量化(把模型精度调低来省资源,会损失些效果)、不用蒸馏(用大模型教出小模型,换取更小体积)。更夸张的是,目前最大的开源模型(代码公开、谁都能免费下载用的模型)、2.8 万亿参数的 Kimi K3,用它跑实测只要 3.72GB 显存。这个项目 8 月初冲上了 GitHub 热榜第三。

把跑大模型想成后厨做满汉全席。传统做法是把所有食材一次性堆上操作台——可操作台(显存)太小,整桌菜的食材根本放不下,这就是「显存不够」的死结。AirLLM 的思路是现做现取:做哪道菜,才从冷库(磁盘)把那道菜的食材取到操作台,做完撤下去,再取下一道。操作台再小,也能一道道做完整桌席——只是一道菜一道菜上,慢一点。类比到此为止,实际差别是:真实瓶颈在磁盘到显存的搬运速度,后面细说。
AirLLM 官方图表:开启预取优化后的推理提速对比
官方图表:AirLLM 开启预取(prefetching)后的推理提速对比 · 来源:AirLLM GitHub 官方仓库
事件

4GB 显卡跑 70B,这次火的是 Kimi K3

AirLLM 其实不是新项目,它从 2023 年底就在迭代。这次火起来,是因为它在 2026 年 7 月新增了对 Kimi K3 的支持——那是目前最大的开源模型,2.8 万亿参数。官方实测,在一张 RTX 6000 Ada 上,跑 Kimi K3 的显存占用稳定在 3.72GB。

它给出的「小显存跑大模型」清单很直观:70B 的 Llama 3.x 约 4GB,405B 的 Llama 3.1 约 8GB,671B 的 DeepSeek-V3 约 12GB,235B 的 Qwen3 约 3GB。而且这些都不靠量化、蒸馏、剪枝——是原始精度直接跑。

4GB
跑 70B Llama
不量化、不蒸馏,原始精度。来源:AirLLM GitHub。
3.72GB
跑 2.8T Kimi K3
RTX 6000 Ada 端到端实测。来源:AirLLM GitHub。
热榜第 3
GitHub 8/3
新增 Kimi K3 支持后冲上热榜。来源:GitHub trending。
机制

怎么做到的:显存里一次只放一层

要理解 AirLLM,得先纠正一个直觉:跑大模型需要的显存,不取决于模型总共有多少参数,而取决于一次要往显存里放多少。传统做法是把整个模型一次性载入显存,所以模型越大显存越大。AirLLM 反过来:推理时显存里始终只保留当前这一层的权重,算完就换下一层。

这样一来,显存需求就只取决于「单层有多大」,而不是「模型总共有多大」。再大的模型,也是一层一层过,所以 4GB 也能跑 70B。

对 MoE(混合专家模型,每个词只经过少数几个「专家」子网络,不是全部)模型还能更省:每个词其实只路由到少数几个专家,AirLLM 就只流式加载当前这个词用到的那几个专家,不碰其他几百个。这正是 2.8T 的 Kimi K3 能压到 3.72GB 的原因。

一次只放一层的推理流程
01
拆层存磁盘
首次运行把模型按层拆开存到磁盘
02
载入当前层
只把当前层从磁盘读进显存
03
算完就换
算完这层释放,再载入下一层
04
循环到输出
层层推进直到生成结果
关键:显存只看「一层多大」,不看「模型多大」。MoE 模型还能只载当前用到的专家。
反直觉

代价很实在:它慢

天底下没有免费的午餐。AirLLM 省下的是显存,付出的是速度。因为每算一层都要从磁盘把这层搬进显存,瓶颈卡在磁盘读写(从硬盘把数据搬进显存,比直接在显存里算慢得多)上,所以它的推理(模型算出答案的过程)延迟明显高于把整个模型常驻显存的方案。

官方也给了缓解办法:开启 prefetching(预取,提前搬运下一层,让搬运和计算重叠)能提速约 10%;用 4-bit 压缩能减小每次搬运的体积、约 3 倍提速,几乎不损失精度。但即便如此,它的设计目标是「极端受限硬件上能跑」,不是「跑得快」。

一句话定位

AirLLM 解决的是「能不能跑」,不是「跑得快不快」。要低延迟、高并发的实时服务,该用 vLLM、llama.cpp 这类方案;AirLLM 适合的是「我显存就这么点,但我就是想在本地把大模型跑起来」的场景。

影响

大模型平民化:门槛被踩碎意味着什么

把视角拉远。AirLLM 这类工具真正的意义,不在「省显存」本身,而在它把「本地跑大模型」的硬件门槛从数据中心级踩到了消费级——一张几千块的显卡就能跑 70B,甚至 2.8T。

这带来两个实在的变化。第一,隐私:敏感数据不用上传到第三方 API,本地就能推理,对金融、医疗、法务这些数据敏感场景是硬需求。第二,可及性:没有 GPU 集群的个人和小团队,也能摸到顶级开源模型——Kimi K3、DeepSeek-V3 这些,不再是「看得见跑不起」。

当然也要冷静:它慢、吃磁盘(首次拆层很占空间)、配置上有些坑(比如 Kimi K3 强制要 flash-attn、CUDA 12、transformers 4.56.x)。它不是万能钥匙,是把「能不能跑」这扇门推开了。

隐私
数据不出本地
敏感数据不必上传第三方 API,本地即可推理。来源:AirLLM 适用场景分析。
可及性
个人也能摸到顶级模型
Kimi K3、DeepSeek-V3 等顶级开源模型不再「跑不起」。来源:AirLLM GitHub。
有坑
慢 + 吃磁盘 + 配置要求
首次拆层占磁盘;K3 需 flash-attn/CUDA12/transformers 4.56.x。来源:AirLLM FAQ。
动手

谁该用、怎么用、避什么坑

如果你手上只有一张 4-8GB 显存的消费级显卡,又想跑 70B 或更大的模型,AirLLM 值得一试。装起来就一行,用法和常规 transformers 几乎一样。

上手与避坑清单
1

安装:pip install airllm,然后 AutoModel.from_pretrained(模型名) 一行加载,换模型只改这一行。

2

磁盘留够:首次运行会把模型按层拆开存盘,很占空间;报 MetadataIncompleteBuffer 多半是磁盘不够,清缓存重跑。

3

想提速:装 bitsandbytes 后加 compression='4bit',约 3 倍提速、精度损失极小。

4

跑 Kimi K3 注意:需 pip install compressed-tensors flash-attn,用 CUDA 12 版 torch 和 transformers 4.56.x。

快速上手
安装pip install airllm
加载AutoModel.from_pretrained("Qwen/Qwen3-32B"),换模型只改这一行
提速加 compression='4bit'(需 bitsandbytes),约 3 倍提速
适合离线批处理、本地隐私推理;不适合低延迟实时服务

大模型推理的瓶颈不在「模型多大」,而在「一次往显存里塞多少」。AirLLM 用「一次只放一层」把 70B 塞进 4GB,代价是慢。想在本地跑大模型又怕显存不够的,今天就 pip install airllm 试一把;要快的实时服务,请绕道 vLLM。

本文数据来自 AirLLM GitHub 官方文档(一手信源)及 GitHub trending。显存占用为官方/实测口径,实际因硬件与模型而异。文中「70B」「2.8T」等参数为模型规模表述。