airllm lyogavin
AirLLM 70B inference with single 4GB GPU
- 主要语言
- Jupyter Notebook
- Stars
- 30,779
- Forks
- 3,273
标签
- 库/SDK
- 推理优化
- 深度学习
- 本地部署
- Python
摘要
AirLLM 是一个极致降低大语言模型推理显存占用的开源框架,无需量化、蒸馏或剪枝,即可在单张4GB显存的GPU上运行70B参数的大模型。其核心原理是将模型按层分片存储并逐层加载推理,配合预取机制减少等待时间。支持Llama、Qwen、DeepSeek、Mixtral等主流模型,甚至可在不足4GB显存下运行2.8T参数的Kimi K3稀疏MoE模型,适合显存有限的个人开发者和研究者进行本地大模型推理。
README
 [**快速开始**](#quickstart) | [**配置**](#configurations) | [**MacOS**](#macos) | [**示例 Notebook**](#example-python-notebook) | [**常见问题**](#faq) **AirLLM** 大幅降低推理所需的显存,让 70B 大型语言模型无需量化、蒸馏或剪枝即可在单张 4GB GPU 上…