APAR

Agent race

Pick a Cursor model per lane, same task, independent sandboxes — then a deterministic ranking: correctness 0.6, speed 0.25, cost 0.15.

7 tasks across 5 capabilities

Spins up two Zerops projects — weighs eval over speed