Model evidence
Good enough for which task?
Explore measured models and available catalog listings. Quality comes from published task evidence; models without task results are clearly marked.
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
Model evidence
Explore measured models and available catalog listings. Quality comes from published task evidence; models without task results are clearly marked.
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
| Model | Evidence | Cheapest passing | Median quality | Providers |
|---|---|---|---|---|
| anthropic/claude-sonnet-5.5:batch Unclassified | Not yet measured | — | — | OpenRouter |
| apodex/apodex-1.1-mini:free Unclassified | Not yet measured | — | — | OpenRouter |
| arcee-ai/coder-large Unclassified | Not yet measured | — | — | OpenRouter |
| arcee-ai/trinity-mini Unclassified | Not yet measured | — | — | OpenRouter |
| arcee-ai/virtuoso-large Unclassified | Not yet measured | — | — | OpenRouter |
| arcee/trinity-large-preview Unclassified | Not yet measured | — | — | Price unavailable |
| arcee/trinity-mini Unclassified | Not yet measured | — | — | Price unavailable |
| azure-gpt-4o Unclassified | Not yet measured | — | — | Neurometric |
| azure-gpt-4o-mini Unclassified | Not yet measured | — | — | Neurometric |
| azure-gpt-5-nano Unclassified | Not yet measured | — | — | Neurometric |
| baichuan/baichuan-m2-32b Unclassified | Not yet measured | — | — | TrustedRouter |
| baidu/cobuddy Unclassified | Not yet measured | — | — | TrustedRouter |
| baidu/ernie-4.5-21B-a3b Unclassified | Not yet measured | — | — | TrustedRouter |
| baidu/ernie-4.5-21B-a3b-thinking Unclassified | Not yet measured | — | — | TrustedRouter |
| baidu/ernie-4.5-300b-a47b-paddle Unclassified | Not yet measured | — | — | TrustedRouter |
| baidu/ernie-4.5-vl-28b-a3b-thinking Unclassified | Not yet measured | — | — | TrustedRouter |
| baidu/ernie-4.5-vl-424b-a47b Unclassified | Not yet measured | — | — | OpenRouterTrustedRouter |
| bedrock/amazon.nova-2-lite-v1:0 Unclassified | Not yet measured | — | — | Price unavailable |
| bedrock/amazon.nova-lite-v1:0 Unclassified | Not yet measured | — | — | Price unavailable |
| bedrock/amazon.nova-pro-v1:0 Unclassified | Not yet measured | — | — | Price unavailable |
Cheapest passing counts tasks where the model clears the task’s published quality floor (80% when none is recorded) and has the lowest observed workload cost. Median quality summarizes those published task results; it is not a general model ranking.