2 projects
gridbook
vLLM plugin for the NVFP4-CB / FP8-CB product-codebook weight formats: 2-6 bit-per-weight LLM quantization served by dedicated CUDA decode and prefill kernels.
prismaquant
Mixed-precision quantization allocator for LLMs: every layer refracts into a different format based on its sensitivity.