airllm lyogavin

AirLLM 70B inference with single 4GB GPU

主要语言
Jupyter Notebook
Stars
30,779
Forks
3,273

标签

  • 库/SDK
  • 推理优化
  • 深度学习
  • 本地部署
  • Python

摘要

AirLLM 是一个极致降低大语言模型推理显存占用的开源框架,无需量化、蒸馏或剪枝,即可在单张4GB显存的GPU上运行70B参数的大模型。其核心原理是将模型按层分片存储并逐层加载推理,配合预取机制减少等待时间。支持Llama、Qwen、DeepSeek、Mixtral等主流模型,甚至可在不足4GB显存下运行2.8T参数的Kimi K3稀疏MoE模型,适合显存有限的个人开发者和研究者进行本地大模型推理。

README

![airllm_logo](https://github.com/lyogavin/airllm/blob/main/assets/airllm_logo_sm.png?v=3&raw=true) [**快速开始**](#quickstart) | [**配置**](#configurations) | [**MacOS**](#macos) | [**示例 Notebook**](#example-python-notebook) | [**常见问题**](#faq) **AirLLM** 大幅降低推理所需的显存,让 70B 大型语言模型无需量化、蒸馏或剪枝即可在单张 4GB GPU 上…

查看完整页面