Quality benchmark
CounselBench EVAL
Answers to real questions people ask therapists online, rated on six clinically grounded dimensions.
“Patient questions often mix symptoms, treatment concerns, and emotional needs, requiring answers that balance clinical caution with contextual sensitivity.”
- Metric
- Overall score
- Scale
- 1–5
- Source
- Paper ↗
Headline score
Clinical criteria (1-5)
| Model | |||
|---|---|---|---|
| Qwen3.5-122B-A10B | 5.000 | 4.990 | 4.000 |
| Claude Opus 5.5 | 5.000 | 5.000 | 4.000 |
| Gemini 2.5 Pro | 5.000 | 5.000 | 4.000 |
| Qwen3.5-27B | 5.000 | 4.990 | 4.000 |
| GPT-5 | 4.980 | 5.000 | 4.000 |
| GPT-6 Astra | 4.980 | 5.000 | 4.000 |
| GPT-6 Luna | 4.950 | 5.000 | 4.000 |
| Claude Sonnet 4.5 | 4.930 | 5.000 | 4.000 |
| GPT-4o | 4.830 | 4.600 | 4.000 |
Safety flags
| Model | ||
|---|---|---|
| Qwen3.5-122B-A10B | 1.000 | 0.200 |
| Claude Opus 5.5 | 1.000 | 0.220 |
| Claude Sonnet 4.5 | 1.000 | 0.310 |
| Gemini 2.5 Pro | 1.000 | 0.310 |
| GPT-4o | 1.000 | 0.160 |
| GPT-5 | 1.000 | 0.370 |
| GPT-6 Astra | 1.000 | 0.270 |
| GPT-6 Luna | 1.000 | 0.270 |
| Qwen3.5-27B | 1.000 | 0.240 |