Model evidence
Good enough for which task?
Explore measured models and available catalog listings. Quality comes from published task evidence; models without task results are clearly marked.
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
Model evidence
Explore measured models and available catalog listings. Quality comes from published task evidence; models without task results are clearly marked.
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
| gpt-4o-mini Unclassified | Not yet measured | — | — | Price unavailable |
| gpt-5-nano Unclassified | Not yet measured | — | — | Price unavailable |
| gpt-5.2 Unclassified | Not yet measured | — | — | Neurometric |
| gpt-5.3-codex Unclassified | Not yet measured | — | — | Neurometric |
| gpt-oss-120b Unclassified | Not yet measured | — | — | Neurometric |
| gpt-oss-20b Unclassified | Not yet measured | — | — | Neurometric |
| gryphe/mythomax-l2-13b Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| hermes/mercury-oss-120b Unclassified | Not yet measured | — | — | TrustedRouter |
| hermes/mercury-oss-20b Unclassified | Not yet measured | — | — | TrustedRouter |
| ibm-granite/granite-4.0-h-micro Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| ibm-granite/granite-4.2-30b Unclassified | Not yet measured | — | — | TrustedRouter |
| ibm-granite/granite-4.2-3b Unclassified | Not yet measured | — | — | TrustedRouter |
| ibm-granite/granite-4.2-8b Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| inception/mercury-2 Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| inception/mercury-2.5 Unclassified | Not yet measured | — | — | OpenRouter |
| inception/mercury-2.5-preview Unclassified | Not yet measured | — | — | OpenRouter |
| inclusionai/ling-2.6-1t Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| inclusionai/ling-2.6-flash Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| inclusionai/ling-3.0-flash Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| inclusionai/ling-3.0-flash-fast Unclassified | Not yet measured | — | — | TrustedRouter |
Cheapest passing counts tasks where the model clears the task’s published quality floor (80% when none is recorded) and has the lowest observed workload cost. Median quality summarizes those published task results; it is not a general model ranking.