airllm lyogavin

AirLLM 70B inference with single 4GB GPU

주요 언어
Jupyter Notebook
Stars
30,779
Forks
3,273

태그

  • 라이브러리/SDK
  • 경량 AI 모델
  • 양자화
  • 로컬 배포
  • 딥러닝
  • 파이썬

요약

AirLLM은 레이어 단위 스트리밍(스파스 MoE 모델은 전문가 단위 스트리밍) 방식으로 GPU 메모리 사용을 극적으로 줄여, 양자화·증류·프루닝 없이도 단일 4GB GPU에서 70B급 대형 언어모델을 실행할 수 있게 해주는 오픈소스 라이브러리다. DeepSeek-V3(671B)는 약 12GB, Kimi K3(2.8T)는 4GB 미만 VRAM에서 구동되며, 블록 단위 양자화 압축으로 추론 속도를 최대 3배 높일 수 있다. CPU 추론과 macOS도 지원하며 AutoModel API로 허깅페이스 모델을 일반 transformer처럼…

README

![airllm_logo](https://github.com/lyogavin/airllm/blob/main/assets/airllm_logo_sm.png?v=3&raw=true) [**빠른 시작**](#quickstart) | [**구성**](#configurations) | [**MacOS**](#macos) | [**예제 노트북**](#example-python-notebook) | [**FAQ**](#faq) **AirLLM**은 추론 메모리 사용량을 획기적으로 줄여, 70B 대규모 언어 모델을 양자화, 증류, 프루닝 없이 …

查看完整页面