← All comparisons

Claude 4.5 Haiku (Reasoning) vs Hermes 4 - Llama-3.1 405B (Non-reasoning)

Anthropic vs Nous Research — side-by-side benchmark comparison

Claude 4.5 Haiku (Reasoning)Hermes 4 - Llama-3.1 405B (Non-reasoning)
Intelligence Index37.117.6
Coding Index32.618.1
Math Index83.715.3
Output speed (tok/s)142.240.8
Blended price ($/1M)$2.19$1.50
Time to first token (s)10.48s0.73s
aime
aime 2583.7%15.3%
artificial analysis coding index32.6018.10
artificial analysis intelligence index37.1017.60
artificial analysis math index83.7015.30
gpqa67.2%53.6%
hle9.7%4.2%
ifbench54.3%34.8%
lcr70.3%20.0%
livecodebench61.5%54.6%
math 500
mmlu pro76.0%72.9%
scicode43.3%34.6%
tau254.7%26.6%
terminalbench hard27.3%9.8%

Benchmark data from Artificial Analysis.