mhevalSubmit results

Headline score

  1. GPT-4oOpenAI · Public API
    0.367
  2. GPT-6 LunaOpenAI · Public API
    0.411
  3. GPT-6 AstraOpenAI · Public API
    0.433
  4. Claude Opus 5.5Anthropic · Public API
    0.486
  5. Qwen3.5-27BQwen · Open weights
    0.489
  6. Qwen3.5-122B-A10BQwen · Open weights
    0.489
  7. GPT-5OpenAI · Public API
    0.494
  8. Gemini 2.5 ProGoogle · Public API
    0.536
  9. Claude Sonnet 4.5Anthropic · Public API
    0.567
Bars span the metric's full 0–1 scale; lower is better. Hover the info icon for settings a model ran with.

Failure rate by targeted issue

Model
Qwen3.5-122B-A10BQwen · Open weights0.0000.6170.8330.1000.5000.883
Claude Opus 5.5Anthropic · Public API0.0000.2670.8830.1000.7830.883
Gemini 2.5 ProGoogle · Public API0.0000.7670.8500.1330.6170.850
GPT-6 AstraOpenAI · Public API0.0000.1330.8500.0500.7330.833
Qwen3.5-27BQwen · Open weights0.0000.6000.8000.1170.6000.817
GPT-5OpenAI · Public API0.0170.1830.8830.0170.9500.917
GPT-6 LunaOpenAI · Public API0.0330.1830.8500.0500.6170.733
Claude Sonnet 4.5Anthropic · Public API0.0670.6330.8670.2170.7670.850
GPT-4oOpenAI · Public API0.0670.4170.7670.0330.4000.517