Last released Oct 1, 2026
MoE inference L2 hot-cache scheduler — run large MoE models on consumer GPUs