mhevalSubmit results

Headline score

  1. Claude Opus 5.5Anthropic · Public APIRun settings
    Reasoning effort
    high
    3.976
  2. GPT-6 AstraOpenAI · Public APIRun settings
    Reasoning effort
    high
    3.889
  3. GPT-6 LunaOpenAI · Public APIRun settings
    Reasoning effort
    high
    3.762
  4. Gemini 2.5 ProGoogle · Public APIRun settings
    Reasoning effort
    high
    3.756
  5. Claude Sonnet 4.5Anthropic · Public APIRun settings
    Reasoning effort
    high
    3.718
  6. Qwen3.5-122B-A10BQwen · Open weights
    3.623
  7. Qwen3.5-27BQwen · Open weightsRun settings
    Reasoning effort
    high
    Num retries
    8
    3.598
  8. GPT-5OpenAI · Public APIRun settings
    Reasoning effort
    high
    3.512
  9. GPT-4oOpenAI · Public API
    3.169
Bars span the metric's full 1–6 scale; higher is better. Hover the info icon for settings a model ran with.

Clinical criteria (1-6)

Model
Claude Opus 5.5Anthropic · Public API4.0634.5823.9254.1283.183
GPT-6 AstraOpenAI · Public API3.9284.6073.7853.9583.165
Claude Sonnet 4.5Anthropic · Public API3.7924.3803.6323.7833.002
Gemini 2.5 ProGoogle · Public API3.7554.4703.5183.9903.050
Qwen3.5-122B-A10BQwen · Open weights3.7004.3673.5103.7952.740
GPT-6 LunaOpenAI · Public API3.6904.5503.5153.8683.188
GPT-5OpenAI · Public API3.5984.3953.4003.5532.615
Qwen3.5-27BQwen · Open weights3.5954.3573.4533.8052.777
GPT-4oOpenAI · Public API2.9154.0852.8683.1832.795