Claude 3.7 Sonnet (Reasoning)
Provider: Anthropic • ID: claude-3-7-sonnet-thinking
Detailed evaluation metrics and judge breakdown for Claude 3.7 Sonnet (Reasoning) across all 4 launch categories.
Compare in Blind Arena
Pricing: In — • Out —
Composite Verdict Score/100
27.1
0
.0
Category Score Breakdown
Frontend UI27.6
Interactive dashboards and landing pages
Game Dev26.5
Canvas 2D physics and browser games
SVG Art27.3
Vector graphics and generative math art
Agentic Tasks26.2
Multi-step execution planning
Auditable Multi-Judge Dimension Scoring
Grades evaluated across 3 independent judge models using published rubrics.
Functionality— Executes without runtime JS exceptions
27.9
Craft— Clean semantic markup and clean TypeScript
27.3
Design— Visual aesthetics, contrast, layout harmony
26.8
Creativity— Original micro-interactions and layout depth
26.2
Fidelity— Strict adherence to complex prompt constraints
26.5