Last released Jul 14, 2026
Benchmark tool for LLM batch workloads — compare cost and quality across candidate models vs. a SOTA baseline.
Supported by