← All comparisons

Claude 4.5 Haiku (Reasoning) vs Hermes 4 - Llama-3.1 70B (Non-reasoning)

Anthropic vs Nous Research — side-by-side benchmark comparison

Claude 4.5 Haiku (Reasoning)Hermes 4 - Llama-3.1 70B (Non-reasoning)
Intelligence Index37.112.6
Coding Index32.69.2
Math Index83.711.3
Output speed (tok/s)142.294.3
Blended price ($/1M)$2.19$0.20
Time to first token (s)10.48s0.61s
aime
aime 2583.7%11.3%
artificial analysis coding index32.609.20
artificial analysis intelligence index37.1012.60
artificial analysis math index83.7011.30
gpqa67.2%49.1%
hle9.7%3.6%
ifbench54.3%29.0%
lcr70.3%2.0%
livecodebench61.5%26.9%
math 500
mmlu pro76.0%66.4%
scicode43.3%27.7%
tau254.7%21.6%
terminalbench hard27.3%0.0%

Benchmark data from Artificial Analysis.