Last released Jul 28, 2026
A highly optimized MOE hybrid inference engine for CPU-GPU collaborative execution of large-scale MOE models.
Last released Jul 18, 2026
SGLang is a fast serving framework for large language models and vision language models.
Supported by