2 projects
fermion-research
Sub-2-bit models from Fermion Research: chat with a ~2 GB 8B language model at native-runtime speed, transcribe speech on Apple silicon or a plain CPU, and serve either on an OpenAI-compatible endpoint
fermion-run
Fermion Research — Neutrino: frontier-grade models below two bits per weight. Full release imminent.