Last released Aug 15, 2026
Attention-aware KV cache quantization for LLM inference (KVQuant++ extensions)
Last released Jun 26, 2026
Triton GPU kernels for transformer operations — softmax, FlashAttention-2, RMSNorm, SwiGLU, quantized matmul