mhevalSubmit results

Headline score

  1. GPT-6 AstraOpenAI · Public API
    81.2
  2. GPT-6 LunaOpenAI · Public API
    80.7
  3. Claude Opus 5.5Anthropic · Public API
    74.1
  4. GPT-5OpenAI · Public API
    62.3
  5. Claude Sonnet 4.5Anthropic · Public API
    56.0
  6. Qwen3.5-122B-A10BQwen · Open weights
    40.5
  7. Qwen3.5-27BQwen · Open weights
    39.6
  8. Gemini 2.5 ProGoogle · Public API
    30.7
  9. GPT-4oOpenAI · Public API
    28.2
Bars span the metric's full 0–100 scale; higher is better. Hover the info icon for settings a model ran with.

Dimension

Model
GPT-4oOpenAI · Public API96.70.84.151.147.3
Claude Sonnet 4.5Anthropic · Public API95.828.354.163.347.6
GPT-6 AstraOpenAI · Public API95.0100.081.488.944.5
Claude Opus 5.5Anthropic · Public API93.774.265.490.747.7
Gemini 2.5 ProGoogle · Public API91.51.312.745.150.3
GPT-5OpenAI · Public API89.588.937.752.844.5
Qwen3.5-122B-A10BQwen · Open weights88.45.026.447.763.7
GPT-6 LunaOpenAI · Public API86.497.586.389.046.6
Qwen3.5-27BQwen · Open weights85.15.826.446.659.8