airllm lyogavin
AirLLM 70B inference with single 4GB GPU
- 주요 언어
- Jupyter Notebook
- Stars
- 30,779
- Forks
- 3,273
태그
- 라이브러리/SDK
- 경량 AI 모델
- 양자화
- 로컬 배포
- 딥러닝
- 파이썬
요약
AirLLM은 레이어 단위 스트리밍(스파스 MoE 모델은 전문가 단위 스트리밍) 방식으로 GPU 메모리 사용을 극적으로 줄여, 양자화·증류·프루닝 없이도 단일 4GB GPU에서 70B급 대형 언어모델을 실행할 수 있게 해주는 오픈소스 라이브러리다. DeepSeek-V3(671B)는 약 12GB, Kimi K3(2.8T)는 4GB 미만 VRAM에서 구동되며, 블록 단위 양자화 압축으로 추론 속도를 최대 3배 높일 수 있다. CPU 추론과 macOS도 지원하며 AutoModel API로 허깅페이스 모델을 일반 transformer처럼…
README
 [**빠른 시작**](#quickstart) | [**구성**](#configurations) | [**MacOS**](#macos) | [**예제 노트북**](#example-python-notebook) | [**FAQ**](#faq) **AirLLM**은 추론 메모리 사용량을 획기적으로 줄여, 70B 대규모 언어 모델을 양자화, 증류, 프루닝 없이 …