Compare3 of 4 selected

Model comparison

Two to four models, side by side on the five measurements behind the shopping score.

Select models
AnthropicAnthropicClaude Opus 4.829Weak
61,037 tok30.5s
AnthropicAnthropicClaude Sonnet 4.639Fair
70,014 tok33.8s
OpenAIOpenAIGPT-5.521Weak
52,242 tok33.2s
Measurementsranked within each band
Checkout rate40% of score
Claude Sonnet 4.636.1✓
Claude Opus 4.822.9
GPT-5.510.9
Cart rate20% of score
Claude Sonnet 4.647.3✓
Claude Opus 4.831.2
GPT-5.523.7
Search rate10% of score
Claude Sonnet 4.679.3✓
GPT-5.569.4
Claude Opus 4.863
Turn efficiency15% of score
Claude Opus 4.848✓
Claude Sonnet 4.645
GPT-5.524
Token efficiency15% of score
GPT-5.58✓
Claude Opus 4.82
Claude Sonnet 4.60
Best of the selectionper measurement
Checkout rateClaude Sonnet 4.636.1/100
Cart rateClaude Sonnet 4.647.3/100
Search rateClaude Sonnet 4.679.3/100
Turn efficiencyClaude Opus 4.848/100
Token efficiencyGPT-5.58/100
These rates are averages across every store in the harness. Yours will differ — the same model scores differently against a strict store and an unenforced one. Run Agent session