Skip to main content
Avatar for LightSeek Foundation from gravatar.com

LightSeek Foundation

Username    lightseek
Date joined   Joined

28 projects

tokenspeed-triton

Last released

A language and compiler for custom Deep Learning operations (vendor release for TokenSpeed)

tokenspeed-proton

Last released

A profiler for Triton (vendor release for TokenSpeed)

tokenspeed-smg

Last released

High-performance Rust-based inference gateway for large-scale LLM deployments

tokenspeed-smg-grpc-proto

Last released

SMG gRPC proto definitions for vLLM, TRT-LLM, MLX, TokenSpeed, and SGLang

tokenspeed-smg-grpc-servicer

Last released

SMG gRPC servicer implementations for LLM inference engines (vLLM, MLX, TokenSpeed, SGLang)

tokenrl

Last released

Placeholder for the upcoming TokenSpeed RL package

tokenspeed-scheduler

Last released

TokenSpeed C++ scheduler with Python bindings

tokenspeed-deepgemm

Last released

None

tokenspeed-cutedsl-kda

Last released

AOT CuteDSL KDA prefill kernels for TokenSpeed

tokenspeed-mla

Last released

Speed-of-light TokenSpeed MLA kernels for Blackwell SM100 and SM103.

tokenspeed-fa4

Last released

Flash Attention CUTE (CUDA Template Engine) implementation

tokenspeed-quack

Last released

A Quirky Assortment of CuTe Kernels

smg

Last released

High-performance Rust-based inference gateway for large-scale LLM deployments

tokenspeed-mooncake

Last released

A KVCache-centric Disaggregated Architecture for large-scale LLM inference and training.

tokenspeed-kernel-npu

Last released

Reserved placeholder for future TokenSpeed NPU kernel support.

tokenspeed-trtllm-kernel

Last released

Standalone TensorRT-LLM CUDA kernels as PyTorch custom ops

tokenspeed-fa3

Last released

FlashAttention-3

tokenspeed-flashkda

Last released

FlashKDA: Flash Kimi Delta Attention

tokenspeed-flashmla

Last released

None

tokenspeed-deepep

Last released

None

tokenspeed-fast-hadamard-transform

Last released

Fast Hadamard Transform in CUDA, with a PyTorch interface

tokenspeed

Last released

TokenSpeed is a speed-of-light LLM inference engine.

tokenspeed-kernel

Last released

None

tokenspeed-kernel-amd

Last released

TokenSpeed AMD-specific high-performance kernels.

tokenspeed-spdlog

Last released

TokenSpeed packaging for spdlog headers and CMake metadata.

tokenspeed-trie

Last released

A small harness for evaluating OpenAI-compatible inference endpoints with synthetic agentic workloads.

tokenspeed-iris

Last released

Triton-based framework for Remote Memory Access (RMA) operations with SHMEM-like APIs for multi-GPU programming.

tokenspeed-tritonblas

Last released

A Lightweight Triton-based BLAS Library

Anthropic, PBC Visionary sponsor Bloomberg Visionary sponsor Hudson River Trading Visionary sponsor Meta Visionary sponsor NVIDIA Visionary sponsor Microsoft Sustainability sponsor Depot Continuous Integration AWS Cloud computing and Security Sponsor Datadog Monitoring Fastly CDN Google Download Analytics Sentry Error logging StatusPage Status page