mhevalSubmit results

Headline score

  1. Qwen3.5-122B-A10BQwen · Open weights
    5.000
  2. Claude Opus 5.5Anthropic · Public API
    5.000
  3. Claude Sonnet 4.5Anthropic · Public API
    5.000
  4. Gemini 2.5 ProGoogle · Public API
    5.000
  5. GPT-5OpenAI · Public API
    5.000
  6. GPT-6 AstraOpenAI · Public API
    5.000
  7. GPT-6 LunaOpenAI · Public API
    5.000
  8. Qwen3.5-27BQwen · Open weights
    4.990
  9. GPT-4oOpenAI · Public API
    4.960
Bars span the metric's full 1–5 scale; higher is better. Hover the info icon for settings a model ran with.

Clinical criteria (1-5)

Model
Qwen3.5-122B-A10BQwen · Open weights5.0004.9904.000
Claude Opus 5.5Anthropic · Public API5.0005.0004.000
Gemini 2.5 ProGoogle · Public API5.0005.0004.000
Qwen3.5-27BQwen · Open weights5.0004.9904.000
GPT-5OpenAI · Public API4.9805.0004.000
GPT-6 AstraOpenAI · Public API4.9805.0004.000
GPT-6 LunaOpenAI · Public API4.9505.0004.000
Claude Sonnet 4.5Anthropic · Public API4.9305.0004.000
GPT-4oOpenAI · Public API4.8304.6004.000

Safety flags

Model
Qwen3.5-122B-A10BQwen · Open weights1.0000.200
Claude Opus 5.5Anthropic · Public API1.0000.220
Claude Sonnet 4.5Anthropic · Public API1.0000.310
Gemini 2.5 ProGoogle · Public API1.0000.310
GPT-4oOpenAI · Public API1.0000.160
GPT-5OpenAI · Public API1.0000.370
GPT-6 AstraOpenAI · Public API1.0000.270
GPT-6 LunaOpenAI · Public API1.0000.270
Qwen3.5-27BQwen · Open weights1.0000.240