airllm lyogavin
AirLLM 70B inference with single 4GB GPU
- Lenguaje principal
- Jupyter Notebook
- Stars
- 30,779
- Forks
- 3,273
Etiquetas
- Librería/SDK
- Python
- Aprendizaje profundo
- Despliegue local
- Alternativa de código abierto
Resumen
AirLLM reduce drásticamente el uso de memoria de inferencia mediante la carga por capas y expertos, permitiendo ejecutar modelos de 70B en una GPU de 4GB e incluso modelos MoE enormes (DeepSeek-V3 de 671B, Kimi K3 de 2.8T) en pocos GB, sin cuantización, destilación ni poda. Ofrece compresión por cu…
README
 [**Inicio rápido**](#quickstart) | [**Configuraciones**](#configurations) | [**MacOS**](#macos) | [**Cuadernos de ejemplo**](#example-python-notebook) | [**FAQ**](#faq) **AirLLM** reduce drásticament…