airllm
lyogavin/airllmAirLLM giúp giảm tiêu thụ bộ nhớ inference của các mô hình ngôn ngữ lớn, cho phép chạy mô hình 70B trên GPU 4GB mà không cần quantization, distillation hay pruning. Nó hỗ trợ nhiều mô hình mở rộng lớn, phù hợp với môi trường hạn chế VRAM.