Last released Sep 5, 2026
Model-agnostic GPU/CPU memory management for PyTorch — host offloading, block streaming, and LRU model caching.
Reusable PyTorch inference operators and Triton kernels.