「70B 大模型得用专业显卡、几十 GB 显存(显卡上的内存,模型运行时数据先放这里)才能跑」——这个常识被一个开源工具打破了。AirLLM 让 70B 的大模型在单张 4GB 消费级显卡上运行,不用量化(把模型精度调低来省资源,会损失些效果)、不用蒸馏(用大模型教出小模型,换取更小体积)。更夸张的是,目前最大的开源模型(代码公开、谁都能免费下载用的模型)、2.8 万亿参数的 Kimi K3,用它跑实测只要 3.72GB 显存。这个项目 8 月初冲上了 GitHub 热榜第三。
4GB 显卡跑 70B,这次火的是 Kimi K3
AirLLM 其实不是新项目,它从 2023 年底就在迭代。这次火起来,是因为它在 2026 年 7 月新增了对 Kimi K3 的支持——那是目前最大的开源模型,2.8 万亿参数。官方实测,在一张 RTX 6000 Ada 上,跑 Kimi K3 的显存占用稳定在 3.72GB。
它给出的「小显存跑大模型」清单很直观:70B 的 Llama 3.x 约 4GB,405B 的 Llama 3.1 约 8GB,671B 的 DeepSeek-V3 约 12GB,235B 的 Qwen3 约 3GB。而且这些都不靠量化、蒸馏、剪枝——是原始精度直接跑。
怎么做到的:显存里一次只放一层
要理解 AirLLM,得先纠正一个直觉:跑大模型需要的显存,不取决于模型总共有多少参数,而取决于一次要往显存里放多少。传统做法是把整个模型一次性载入显存,所以模型越大显存越大。AirLLM 反过来:推理时显存里始终只保留当前这一层的权重,算完就换下一层。
这样一来,显存需求就只取决于「单层有多大」,而不是「模型总共有多大」。再大的模型,也是一层一层过,所以 4GB 也能跑 70B。
对 MoE(混合专家模型,每个词只经过少数几个「专家」子网络,不是全部)模型还能更省:每个词其实只路由到少数几个专家,AirLLM 就只流式加载当前这个词用到的那几个专家,不碰其他几百个。这正是 2.8T 的 Kimi K3 能压到 3.72GB 的原因。
代价很实在:它慢
天底下没有免费的午餐。AirLLM 省下的是显存,付出的是速度。因为每算一层都要从磁盘把这层搬进显存,瓶颈卡在磁盘读写(从硬盘把数据搬进显存,比直接在显存里算慢得多)上,所以它的推理(模型算出答案的过程)延迟明显高于把整个模型常驻显存的方案。
官方也给了缓解办法:开启 prefetching(预取,提前搬运下一层,让搬运和计算重叠)能提速约 10%;用 4-bit 压缩能减小每次搬运的体积、约 3 倍提速,几乎不损失精度。但即便如此,它的设计目标是「极端受限硬件上能跑」,不是「跑得快」。
AirLLM 解决的是「能不能跑」,不是「跑得快不快」。要低延迟、高并发的实时服务,该用 vLLM、llama.cpp 这类方案;AirLLM 适合的是「我显存就这么点,但我就是想在本地把大模型跑起来」的场景。
大模型平民化:门槛被踩碎意味着什么
把视角拉远。AirLLM 这类工具真正的意义,不在「省显存」本身,而在它把「本地跑大模型」的硬件门槛从数据中心级踩到了消费级——一张几千块的显卡就能跑 70B,甚至 2.8T。
这带来两个实在的变化。第一,隐私:敏感数据不用上传到第三方 API,本地就能推理,对金融、医疗、法务这些数据敏感场景是硬需求。第二,可及性:没有 GPU 集群的个人和小团队,也能摸到顶级开源模型——Kimi K3、DeepSeek-V3 这些,不再是「看得见跑不起」。
当然也要冷静:它慢、吃磁盘(首次拆层很占空间)、配置上有些坑(比如 Kimi K3 强制要 flash-attn、CUDA 12、transformers 4.56.x)。它不是万能钥匙,是把「能不能跑」这扇门推开了。
谁该用、怎么用、避什么坑
如果你手上只有一张 4-8GB 显存的消费级显卡,又想跑 70B 或更大的模型,AirLLM 值得一试。装起来就一行,用法和常规 transformers 几乎一样。
安装:pip install airllm,然后 AutoModel.from_pretrained(模型名) 一行加载,换模型只改这一行。
磁盘留够:首次运行会把模型按层拆开存盘,很占空间;报 MetadataIncompleteBuffer 多半是磁盘不够,清缓存重跑。
想提速:装 bitsandbytes 后加 compression='4bit',约 3 倍提速、精度损失极小。
跑 Kimi K3 注意:需 pip install compressed-tensors flash-attn,用 CUDA 12 版 torch 和 transformers 4.56.x。
大模型推理的瓶颈不在「模型多大」,而在「一次往显存里塞多少」。AirLLM 用「一次只放一层」把 70B 塞进 4GB,代价是慢。想在本地跑大模型又怕显存不够的,今天就 pip install airllm 试一把;要快的实时服务,请绕道 vLLM。
本文数据来自 AirLLM GitHub 官方文档(一手信源)及 GitHub trending。显存占用为官方/实测口径,实际因硬件与模型而异。文中「70B」「2.8T」等参数为模型规模表述。