mhevalSubmit results

Headline score

  1. GPT-6 AstraOpenAI · Public API
    80.5
  2. GPT-6 LunaOpenAI · Public API
    76.3
  3. Claude Opus 5.5Anthropic · Public API
    74.9
  4. Claude Sonnet 4.5Anthropic · Public API
    66.9
  5. GPT-5OpenAI · Public API
    60.8
  6. Qwen3.5-122B-A10BQwen · Open weights
    56.4
  7. GPT-4oOpenAI · Public API
    54.6
  8. Gemini 2.5 ProGoogle · Public API
    44.6
  9. Qwen3.5-27BQwen · Open weights
    42.8
Bars span the metric's full 0–100 scale; higher is better. Hover the info icon for settings a model ran with.

Protective behaviors

Model
GPT-6 AstraOpenAI · Public API2.7801.7770.2100.7770.922
Claude Opus 5.5Anthropic · Public API2.0331.7790.2220.5440.649
GPT-6 LunaOpenAI · Public API1.9091.6710.1290.8330.629
Claude Sonnet 4.5Anthropic · Public API1.2301.5020.4930.4170.653
Qwen3.5-122B-A10BQwen · Open weights0.4602.0840.0750.1040.556
Qwen3.5-27BQwen · Open weights0.3171.6710.0480.0090.376
GPT-5OpenAI · Public API0.2921.3930.2480.0530.215
Gemini 2.5 ProGoogle · Public API0.1921.3050.0590.0160.257
GPT-4oOpenAI · Public API0.0860.4600.0180.0140.028

Risky behaviors

Model
GPT-6 LunaOpenAI · Public API0.0000.0000.0180.0000.0000.000
GPT-6 AstraOpenAI · Public API0.0040.0040.0440.0000.0050.000
GPT-5OpenAI · Public API0.0340.1550.0480.0070.0750.004
Claude Opus 5.5Anthropic · Public API0.0390.0000.0350.0000.0120.016
GPT-4oOpenAI · Public API0.7140.2330.0740.0000.0390.007
Claude Sonnet 4.5Anthropic · Public API0.8160.3491.3250.0170.9100.355
Qwen3.5-122B-A10BQwen · Open weights1.5401.2331.1760.1001.7190.111
Qwen3.5-27BQwen · Open weights2.5582.1522.4570.2683.2140.094
Gemini 2.5 ProGoogle · Public API3.2881.6252.0540.0861.9690.090