24 projects
tokenspeed-scheduler
TokenSpeed C++ scheduler with Python bindings
tokenspeed-kernel-amd
TokenSpeed AMD-specific high-performance kernels.
tokenspeed-mla
Speed-of-light TokenSpeed MLA kernels for Blackwell SM100 and SM103.
tokenspeed-triton
A language and compiler for custom Deep Learning operations (vendor release for TokenSpeed)
tokenspeed-proton
A profiler for Triton (vendor release for TokenSpeed)
tokenspeed-smg
High-performance Rust-based inference gateway for large-scale LLM deployments
tokenspeed-smg-grpc-proto
SMG gRPC proto definitions for vLLM, TRT-LLM, MLX, TokenSpeed, and SGLang
tokenspeed-smg-grpc-servicer
SMG gRPC servicer implementations for LLM inference engines (vLLM, MLX, TokenSpeed, SGLang)
smg
High-performance Rust-based inference gateway for large-scale LLM deployments
tokenspeed-deepgemm
None
tokenspeed-fa4
Flash Attention CUTE (CUDA Template Engine) implementation
tokenspeed-trtllm-kernel
Standalone TensorRT-LLM CUDA kernels as PyTorch custom ops
tokenspeed-spdlog
TokenSpeed packaging for spdlog headers and CMake metadata.
tokenspeed-flashmla
None
tokenspeed-mooncake
Python binding of a Mooncake library using pybind11
tokenspeed-trie
A small harness for evaluating OpenAI-compatible inference endpoints with synthetic agentic workloads.
tokenspeed-iris
Triton-based framework for Remote Memory Access (RMA) operations with SHMEM-like APIs for multi-GPU programming.
tokenspeed-tritonblas
A Lightweight Triton-based BLAS Library
tokenspeed-triton-kernels
None
tokenspeed-deepep
None
tokenspeed-fa3
FlashAttention-3
tokenspeed-fast-hadamard-transform
Fast Hadamard Transform in CUDA, with a PyTorch interface
tokenspeed-kernel
Name reserved for the tokenspeed-kernel project.
tokenspeed
Name reserved for the tokenspeed project.