3 projects
whisper-blaze
High-throughput batched Whisper large-v3 serving on H100, with VRAM capping and a fused Hopper LayerNorm kernel
vrambatch
Run batched GPU work inside a VRAM budget, self-healing on CUDA out-of-memory
llm-host
OpenAI-compatible inference server: Llama 3.1 8B + Whisper + Kokoro TTS exposed via ngrok