APAR
Pick a Cursor model per lane, same task, independent sandboxes — then a deterministic ranking: correctness 0.6, speed 0.25, cost 0.15.
Single runAnalytics
7 tasks across 5 capabilities
Spins up two Zerops projects — weighs eval over speed