Inference engine for large language models on consumer GPUs, with deep optimization for older hardware
cuda inference pytorch moe glm minimax quantization inference-engine ascend llm qwen deepseek consumer-gpu rtx-2080-ti
-
Updated
Sep 16, 2026 - C++