airllm lyogavin

AirLLM 70B inference with single 4GB GPU

Lenguaje principal
Jupyter Notebook
Stars
30,779
Forks
3,273

Etiquetas

  • Librería/SDK
  • Python
  • Aprendizaje profundo
  • Despliegue local
  • Alternativa de código abierto

Resumen

AirLLM reduce drásticamente el uso de memoria de inferencia mediante la carga por capas y expertos, permitiendo ejecutar modelos de 70B en una GPU de 4GB e incluso modelos MoE enormes (DeepSeek-V3 de 671B, Kimi K3 de 2.8T) en pocos GB, sin cuantización, destilación ni poda. Ofrece compresión por cu…

README

![airllm_logo](https://github.com/lyogavin/airllm/blob/main/assets/airllm_logo_sm.png?v=3&raw=true) [**Inicio rápido**](#quickstart) | [**Configuraciones**](#configurations) | [**MacOS**](#macos) | [**Cuadernos de ejemplo**](#example-python-notebook) | [**FAQ**](#faq) **AirLLM** reduce drásticament…

查看完整页面