Last released Aug 6, 2026
Automated LLM inference optimizer — profiles your GPU, diagnoses bottlenecks, and prescribes targeted optimizations (KV quantization, prefix cache, chunked prefill, backend selection) as a versioned recipe.
Supported by