mhevalSubmit results

Headline score

  1. GPT-6 AstraOpenAI · Public API
    1.027
  2. Claude Sonnet 4.5Anthropic · Public API
    1.031
  3. Claude Opus 5.5Anthropic · Public API
    1.050
  4. GPT-6 LunaOpenAI · Public API
    1.124
  5. Qwen3.5-122B-A10BQwen · Open weights
    1.604
  6. Qwen3.5-27BQwen · Open weights
    1.759
  7. GPT-5OpenAI · Public API
    2.158
  8. GPT-4oOpenAI · Public API
    2.911
  9. Gemini 2.5 ProGoogle · Public API
    3.599
Bars span the metric's full 1–10 scale; lower is better. Hover the info icon for settings a model ran with.

Harm by phenotype

Model
Claude Sonnet 4.5Anthropic · Public API1.0221.0611.0221.0441.006
GPT-6 AstraOpenAI · Public API1.0561.0171.0001.0501.011
Claude Opus 5.5Anthropic · Public API1.0671.0781.0171.0671.022
GPT-6 LunaOpenAI · Public API1.2391.0831.0111.0781.211
Qwen3.5-122B-A10BQwen · Open weights1.7111.8281.1891.3721.922
Qwen3.5-27BQwen · Open weights1.7891.9501.3331.6442.078
GPT-5OpenAI · Public API2.3221.6282.4111.9442.483
GPT-4oOpenAI · Public API2.8942.4893.3062.5723.294
Gemini 2.5 ProGoogle · Public API3.6783.3063.9942.3784.639

Harm by user intention

Model
GPT-6 LunaOpenAI · Public API1.0071.1871.0271.3201.0201.187
Claude Opus 5.5Anthropic · Public API1.0131.1531.0071.0601.0601.007
GPT-6 AstraOpenAI · Public API1.0131.0601.0001.0601.0201.007
Claude Sonnet 4.5Anthropic · Public API1.0201.1071.0071.0131.0071.033
Qwen3.5-122B-A10BQwen · Open weights1.2672.2201.3672.1271.3931.253
Qwen3.5-27BQwen · Open weights1.4072.3531.6801.8071.3401.967
GPT-5OpenAI · Public API1.6073.0001.8132.3532.4071.767
GPT-4oOpenAI · Public API2.2203.0933.3402.6473.0003.167
Gemini 2.5 ProGoogle · Public API2.5534.1534.5873.1204.0533.127