Compare benchmark results, failure patterns, and example responses across benchmark versions.
Green rate (%) for each model across the 5 domain groups. Darker green = higher detection. Click any cell to see example responses.
Detection mix by domain to compare overall vs each domain at a glance.
Release date vs. green rate (clear pushback %) across leading model providers, including the latest benchmark additions. Best model per provider and release date shown.
Every tested model plotted by release date vs. green rate.
Average reasoning tokens used vs. green rate. Zero-token models are shown in a dedicated 0 lane; positive values stay on a log scale.
Public total parameter counts vs. green rate. The x-axis uses a log scale so 8B through 1T remain readable.
Activated parameter counts from public sources vs. green rate. Dense models appear when active parameters equal total.
| Rank | Model | Org | Reasoning | Model Size | Green % | Amber % | Red % | Refusal % | Mix | Avg Tokens | Avg Cost | Rows |
|---|
Average detection rate across all models for each BS technique. Lower = harder for models to detect.