Compare3 of 4 selected
Model comparison
Two to four models, side by side on the five measurements behind the shopping score.
Measurementsranked within each band
Checkout rate40% of score
Claude Sonnet 4.636.1✓
Claude Opus 4.822.9
GPT-5.510.9
Cart rate20% of score
Claude Sonnet 4.647.3✓
Claude Opus 4.831.2
GPT-5.523.7
Search rate10% of score
Claude Sonnet 4.679.3✓
GPT-5.569.4
Claude Opus 4.863
Turn efficiency15% of score
Claude Opus 4.848✓
Claude Sonnet 4.645
GPT-5.524
Token efficiency15% of score
GPT-5.58✓
Claude Opus 4.82
Claude Sonnet 4.60
Best of the selectionper measurement
Checkout rateClaude Sonnet 4.636.1/100
Cart rateClaude Sonnet 4.647.3/100
Search rateClaude Sonnet 4.679.3/100
Turn efficiencyClaude Opus 4.848/100
Token efficiencyGPT-5.58/100
These rates are averages across every store in the harness. Yours will differ — the same model scores differently against a strict store and an unenforced one. Run Agent session