Last released Sep 15, 2026
Run transformers larger than memory: weights stream from NVMe at neuron granularity under a hard memory ceiling.
Last released Sep 13, 2026
Bounded, asynchronous parameter streaming for PyTorch blocks, with NVMe weight offload and LoRA finetuning