← All comparisons

Hermes 4 - Llama-3.1 70B (Reasoning) vs Claude 4.1 Opus (Reasoning)

Nous Research vs Anthropic — side-by-side benchmark comparison

Hermes 4 - Llama-3.1 70B (Reasoning)Claude 4.1 Opus (Reasoning)
Intelligence Index16.042.0
Coding Index14.436.5
Math Index68.780.3
Output speed (tok/s)92.844.5
Blended price ($/1M)$0.20$32.81
Time to first token (s)0.64s8.55s
aime
aime 2568.7%80.3%
artificial analysis coding index14.4036.50
artificial analysis intelligence index16.0042.00
artificial analysis math index68.7080.30
gpqa69.9%80.9%
hle7.9%11.9%
ifbench31.3%55.4%
lcr6.7%66.3%
livecodebench65.3%65.4%
math 500
mmlu pro81.1%88.0%
scicode34.1%40.9%
tau222.5%71.4%
terminalbench hard4.5%34.3%

Benchmark data from Artificial Analysis.