Discrete-event simulation of multi-LoRA adapter serving strategies on a single GPU — comparing naive swap, hot-set preloading, and batch-by-adapter under variable VRAM pressure and arrival rates.
python simulation scheduling inference pytorch memory-management lora lru-cache llm-serving multi-lora vram-management adapter-serving s-lora mlsystems
-
Updated
Jul 18, 2026 - Python