Last released Jul 25, 2026
A KVCache-centric Disaggregated Architecture for large-scale LLM inference and training. (CUDA 13 version)
A KVCache-centric Disaggregated Architecture for large-scale LLM inference and training.
Supported by