Model evidence
Good enough for which task?
Explore measured models and available catalog listings. Quality comes from published task evidence; models without task results are clearly marked.
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
Model evidence
Explore measured models and available catalog listings. Quality comes from published task evidence; models without task results are clearly marked.
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
| openai/gpt-oss-120b-turbo Unclassified | Not yet measured | — | — | TrustedRouter |
| openai/gpt-oss-120b-ultra Unclassified | Not yet measured | — | — | TrustedRouter |
| openai/gpt-oss-120b:batch Unclassified | Not yet measured | — | — | OpenRouter |
| openai/gpt-oss-120b:free Unclassified | Not yet measured | — | — | OpenRouter |
| openai/gpt-oss-20b Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| openai/gpt-oss-20b:batch Unclassified | Not yet measured | — | — | OpenRouter |
| openai/gpt-oss-20b:free Unclassified | Not yet measured | — | — | OpenRouter |
| openai/gpt-oss-safeguard-20b Unclassified | Not yet measured | — | — | OpenRouter |
| openai/o1 Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| openai/o1-pro Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| openai/o1-pro:batch Unclassified | Not yet measured | — | — | OpenRouter |
| openai/o1:batch Unclassified | Not yet measured | — | — | OpenRouter |
| openai/o3 Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| openai/o3-deep-research Unclassified | Not yet measured | — | — | OpenRouter |
| openai/o3-mini Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| openai/o3-mini-high Unclassified | Not yet measured | — | — | OpenRouter |
| openai/o3-mini-high:batch Unclassified | Not yet measured | — | — | OpenRouter |
| openai/o3-mini:batch Unclassified | Not yet measured | — | — | OpenRouter |
| openai/o3-pro Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| openai/o3-pro:batch Unclassified | Not yet measured | — | — | OpenRouter |
Cheapest passing counts tasks where the model clears the task’s published quality floor (80% when none is recorded) and has the lowest observed workload cost. Median quality summarizes those published task results; it is not a general model ranking.