← Anthropic · Claude Individual model view Anthropic · Claude

Claude 3.5 Sonnet

Appears in 3 benchmarksMean lean (confidence − pass rate): -0.011/3 benchmarks lean overconfident (prospective probe)

Positioning spread

0.000.250.500.751.00SQuAD (factual recall)MMLU-Pro (knowledge)LegalBench (legal reasoning)performanceconfidence (red gap = overconfident)
Performance vs. confidence for Claude 3.5 Sonnet, per benchmark (prospective probe).
BenchmarkTask accConfidenceF₁Leans
SQuAD (factual recall)0.560.390.64-0.18 cautious
MMLU-Pro (knowledge)0.540.830.70+0.28 overconfident
LegalBench (legal reasoning)0.860.730.82-0.13 cautious

In the full cloud

-3-3-2-2-1-100112233Performance z-score within benchmark/probe →Confidence z-score →
Claude 3.5 Sonnet conditions all other model/condition points equal relative confidence and pass rate

Pairwise footprint

Match accuracy controls for the performance base-rate gap
Claude 3.5 Sonnet pairs
18/ 171
Claude 3.5 Sonnet mean tau
+0.006
All-pairs mean
+0.037
Claude 3.5 Sonnet p<0.05
4(22.2%)
-1.0-0.50.00.51.0Pair signal: do confidence gaps rank performance gaps? (Kendall tau-b)
all model pairs (observed) base-rate-matched null calibration-preserving null Claude 3.5 Sonnet pair (filled = p<0.05) Claude 3.5 Sonnet mean all-pairs mean
vs Claude 3 Haiku →vs Claude Haiku 4.5 →vs Claude Sonnet 4.5 → Compare with anything →