The Best LLMs on SWE-bench Verified
Which model solves the most SWE-bench Verified issues?
Only 7 of the 144 buyable models publish a SWE-bench Verified number at all. The other 137 are named in full below, with whatever they publish instead.
Method: Published SWE-bench Verified pass@1, descending, exactly as reported. Every figure here comes from the provider's own announcement, because no independent lab publishes this suite across the catalogue. Pricing as of July 2026. 1 row below carries a score measured at a non-default reasoning tier and is marked as such; every affected model is named on the hub. Read the full method.
| Rank | Model | SWE-bench Verified | Terminal-Bench | Quality | Reported by | Blended $/1M |
|---|---|---|---|---|---|---|
| #1 | Claude Opus 4.8Anthropic | 88.6 | 84.6 | 87.0 | Unstated / mixed | $10.00 |
| #2 | Claude Sonnet 5Anthropic· non-default tier | 85.2 | 80.5 | 83.3 | Unstated / mixed | $4.00 |
| #3 | Nex-N2-ProNex AGI | 80.8 | 67.8 | 75.6 | Unstated / mixed | $1.00 |
| #4 | MiMo-V2-ProXiaomi | 78.0 | not published | 78.0 | Unstated / mixed | $1.50 |
| #5 | Mistral Medium 3.5Mistral | 77.6 | 50.6 | 66.8 | Unstated / mixed | $3.00 |
| #6 | Nemotron 3 Ultra 550BNVIDIA | 71.9 | not published | 71.9 | Unstated / mixed | $1.00 |
| #7 | Qwen3 Coder NextAlibaba | 70.6 | 38.2 | 57.6 | Unstated / mixed | $0.282 |
The 137 models that publish no SWE-bench Verified score
This list is short because the suite is rarely reported, not because the catalogue is small. Every buyable model without a published SWE-bench Verified number is named below, with whatever it does publish instead. An absent score is a fact about what a provider chose to release, and none of these are estimated to fill the table out.
OpenAI
33- GPT-4.1 — GPQA 66.6 · tau2 47.1 · $3.50/1M
- GPT-4.1 Mini — Terminal-Bench 2.1 10.1 · GPQA 66.4 · tau2 52.9 · $0.700/1M
- GPT-4.1 Nano — Terminal-Bench 2.1 3.7 · GPQA 51.2 · tau2 17.3 · $0.175/1M
- GPT-4o — GPQA 54.3 · tau2 25.1 · $4.38/1M
- GPT-4o Mini — Terminal-Bench 2.1 5.6 · GPQA 42.6 · $0.263/1M
- GPT-5 — GPQA 84.2 · tau2 86.5 · $3.44/1M
- GPT-5 Medium — GPQA 84.2 · tau2 86.5 · $3.44/1M
- GPT-5 Mini — GPQA 80.3 · tau2 71.1 · $0.688/1M
- GPT-5 Nano — GPQA 67.0 · tau2 30.4 · $0.138/1M
- GPT-5.1 — Terminal-Bench 2.1 52.4 · GPQA 87.3 · tau2 81.9 · $3.44/1M
- GPT-5.2 — GPQA 86.4 · tau2 74.3 · $4.81/1M
- GPT-5.3 Codex — GPQA 91.5 · tau2 86.0 · $4.81/1M
- GPT-5.4 — GPQA 87.1 · tau2 74.6 · $5.63/1M
- GPT-5.4 Mini — GPQA 82.3 · tau2 36.5 · $1.69/1M
- GPT-5.4 Nano — GPQA 76.1 · tau2 52.6 · $0.463/1M
- GPT-5.4 Pro — nothing published · $67.50/1M
- GPT-5.5 — Terminal-Bench 2.1 80.5 · GPQA 92.6 · tau2 91.8 · $11.25/1M
- GPT-5.5 Pro — nothing published · $67.50/1M
- GPT-5.6 Luna — Terminal-Bench 2.1 53.2 · GPQA 85.9 · $2.25/1M
- GPT-5.6 Sol — Terminal-Bench 2.1 86.1 · GPQA 92.6 · tau2 81.0 · $11.25/1M
- GPT-5.6 Terra — Terminal-Bench 2.1 72.3 · GPQA 87.2 · tau2 72.8 · $5.63/1M
- GPT-OSS 120B — Terminal-Bench 2.1 13.9 · GPQA 67.2 · tau2 45.0 · $0.077/1M
- GPT-OSS 120B (Bedrock) — nothing published · $0.263/1M
- GPT-OSS 20B — GPQA 61.1 · tau2 50.3 · $0.131/1M
- GPT-OSS 20B (Bedrock) — nothing published · $0.128/1M
- o1 — GPQA 74.7 · tau2 62.6 · $26.25/1M
- o1 Pro — AA index 18.9 · $262.50/1M
- o3 — GPQA 82.7 · tau2 80.7 · $3.50/1M
- o3 Deep Research — nothing published · $17.50/1M
- o3 Mini — GPQA 74.8 · tau2 28.7 · $1.93/1M
- o3-pro — GPQA 84.5 · $35.00/1M
- o4 Mini — GPQA 78.4 · tau2 55.6 · $1.93/1M
- o4 Mini Deep Research — nothing published · $3.50/1M
- DiffusionGemma 26B — nothing published · $0.00/1M
- Gemini 2.5 Flash — GPQA 79.0 · tau2 31.6 · $0.850/1M
- Gemini 2.5 Flash-Lite — GPQA 62.5 · tau2 18.4 · $0.175/1M
- Gemini 2.5 Pro — Terminal-Bench 2.1 28.5 · GPQA 84.4 · tau2 54.1 · $3.44/1M
- Gemini 3 Flash — nothing published · $1.13/1M
- Gemini 3 Flash Reasoning — GPQA 89.8 · tau2 80.4 · $1.13/1M
- Gemini 3 Pro — nothing published · $4.50/1M
- Gemini 3.1 Flash Live — nothing published · $1.69/1M
- Gemini 3.1 Flash TTS — nothing published · $5.75/1M
- Gemini 3.1 Flash-Lite — Terminal-Bench 2.1 31.1 · GPQA 82.2 · tau2 31.3 · $0.563/1M
- Gemini 3.1 Pro — nothing published · $4.50/1M
- Gemini 3.5 Flash — Terminal-Bench 2.1 76.2 · GPQA 92.1 · tau2 95.6 · $3.38/1M
- Gemini 3.5 Flash-Lite — Terminal-Bench 2.1 53.6 · GPQA 83.8 · $0.850/1M
- Gemini 3.6 Flash — Terminal-Bench 2.1 77.5 · GPQA 92.8 · $3.00/1M
- Gemma 4 12B — Terminal-Bench 2.1 27.3 · GPQA 75.3 · tau2 36.3 · $0.00/1M
- Gemma 4 26B A4B — Terminal-Bench 2.1 39.0 · GPQA 79.2 · tau2 43.6 · $0.120/1M
- Gemma 4 31B — Terminal-Bench 2.1 43.4 · GPQA 85.7 · tau2 59.9 · $0.180/1M
Mistral
14- Codestral — nothing published · $0.450/1M
- Devstral — nothing published · $0.800/1M
- Devstral Small — GPQA 41.4 · tau2 28.4 · $0.150/1M
- Magistral Medium — GPQA 67.9 · tau2 23.1 · $2.75/1M
- Magistral Small — GPQA 64.1 · tau2 26.6 · $0.750/1M
- Ministral 3 14B — Terminal-Bench 2.1 9.7 · GPQA 57.2 · tau2 27.2 · $0.200/1M
- Ministral 3 8B — Terminal-Bench 2.1 4.1 · GPQA 47.1 · tau2 26.6 · $0.150/1M
- Mistral Large 3 — Terminal-Bench 2.1 12.0 · GPQA 68.0 · tau2 24.6 · $0.750/1M
- Mistral Medium — GPQA 34.9 · $0.800/1M
- Mistral Small 3.2 — GPQA 38.1 · $0.150/1M
- Mistral Small 4 — Terminal-Bench 2.1 21.0 · GPQA 76.9 · tau2 41.2 · $0.263/1M
- Pixtral 12B — nothing published · $0.150/1M
- Pixtral Large — GPQA 50.5 · tau2 36.5 · $3.00/1M
- Voxtral TTS — nothing published · $12.00/1M
xAI
13- Grok 2 — GPQA 51.0 · $4.00/1M
- Grok 3 — GPQA 69.3 · tau2 48.8 · $6.00/1M
- Grok 3 Fast — nothing published · $10.00/1M
- Grok 3 Mini — nothing published · $0.350/1M
- Grok 3 Mini Fast — nothing published · $1.45/1M
- Grok 4 — GPQA 87.7 · tau2 74.9 · $6.00/1M
- Grok 4.1 Fast — GPQA 85.3 · tau2 93.3 · $0.275/1M
- Grok 4.1 Fast Reasoning — GPQA 85.3 · tau2 93.3 · $0.275/1M
- Grok 4.20 — GPQA 91.1 · tau2 93.0 · $3.00/1M
- Grok 4.3 — GPQA 89.0 · tau2 91.2 · $1.56/1M
- Grok 4.5 — Terminal-Bench 2.1 81.6 · GPQA 93.1 · $3.00/1M
- Grok Build 0.1 — nothing published · $1.25/1M
- Grok Code Fast — nothing published · $0.525/1M
Alibaba
11- Qwen 3.5 27B — GPQA 85.8 · tau2 93.9 · $0.825/1M
- Qwen 3.5 397B — nothing published · $1.35/1M
- Qwen3-Next-80B-A3B-Thinking — nothing published · $0.268/1M
- Qwen3.5-9B — Terminal-Bench 2.1 29.2 · GPQA 80.6 · tau2 86.8 · $0.075/1M
- Qwen3.5-Omni Flash — GPQA 74.2 · tau2 84.5 · $0.850/1M
- Qwen3.5-Omni Plus — GPQA 82.6 · tau2 88.3 · $1.50/1M
- Qwen3.6-Max-Preview — GPQA 88.8 · tau2 95.9 · $2.92/1M
- Qwen3.6-Plus — Terminal-Bench 2.1 61.4 · GPQA 88.2 · tau2 97.7 · $0.620/1M
- Qwen3.7 Max — Terminal-Bench 2.1 74.5 · GPQA 92.3 · tau2 94.7 · $3.75/1M
- Qwen3.7 Plus — Terminal-Bench 2.1 61.0 · GPQA 90.0 · tau2 93.0 · $0.700/1M
- QwQ-Plus — nothing published · $1.20/1M
Anthropic
10- Claude 3.7 Sonnet — GPQA 77.2 · tau2 54.7 · $6.00/1M
- Claude Fable 5 — Terminal-Bench 2.1 84.6 · GPQA 92.6 · tau2 98.5 · $20.00/1M
- Claude Haiku 3.5 — nothing published · $1.60/1M
- Claude Haiku 4.5 — nothing published · $2.00/1M
- Claude Opus 4.1 — nothing published · $30.00/1M
- Claude Opus 4.5 — GPQA 86.6 · tau2 89.5 · $10.00/1M
- Claude Opus 4.6 — GPQA 89.6 · tau2 92.1 · $10.00/1M
- Claude Opus 4.7 — Terminal-Bench 2.1 83.1 · GPQA 91.4 · tau2 88.6 · $10.00/1M
- Claude Sonnet 4.5 — nothing published · $6.00/1M
- Claude Sonnet 4.6 — Terminal-Bench 2.1 71.2 · GPQA 87.5 · tau2 75.7 · $6.00/1M
Moonshot
6- Kimi K2 Thinking — GPQA 83.8 · tau2 93.0 · $1.07/1M
- Kimi K2 Thinking Turbo — nothing published · $2.86/1M
- Kimi K2.5 — Terminal-Bench 2.1 45.7 · GPQA 87.9 · tau2 95.9 · $1.20/1M
- Kimi K2.6 — Terminal-Bench 2.1 65.9 · GPQA 91.1 · tau2 95.9 · $1.71/1M
- Kimi K2.7 Code — Terminal-Bench 2.1 67.4 · GPQA 89.6 · tau2 90.1 · $1.71/1M
- Kimi K3 — Terminal-Bench 2.1 85.0 · GPQA 93.5 · $6.00/1M
Zhipu
6- GLM-4.7 — Terminal-Bench 2.1 45.3 · GPQA 85.9 · tau2 95.9 · $1.00/1M
- GLM-4.7-flash — GPQA 58.1 · tau2 98.8 · $0.152/1M
- GLM-5 — GPQA 82.0 · tau2 98.2 · $1.55/1M
- GLM-5 Turbo — GPQA 84.7 · tau2 98.5 · $1.90/1M
- GLM-5.1 — Terminal-Bench 2.1 61.8 · GPQA 86.8 · tau2 97.7 · $2.15/1M
- GLM-5.2 — Terminal-Bench 2.1 77.9 · GPQA 89.5 · tau2 99.1 · $2.15/1M
DeepSeek
5- DeepSeek R1 — GPQA 81.3 · tau2 36.5 · $0.960/1M
- DeepSeek V3.2 (Chat) — nothing published · $0.315/1M
- DeepSeek V3.2 (Reasoner) — nothing published · $0.315/1M
- DeepSeek V4-Flash — Terminal-Bench 2.1 56.9 · GPQA 86.7 · tau2 95.6 · $0.175/1M
- DeepSeek V4-Pro — Terminal-Bench 2.1 64.8 · GPQA 90.5 · tau2 94.2 · $0.544/1M
Meta
4- Llama 3.3 70B — nothing published · $0.180/1M
- Llama 4 Maverick — Terminal-Bench 2.1 7.9 · GPQA 67.1 · tau2 17.8 · $0.415/1M
- Llama 4 Scout — Terminal-Bench 2.1 3.7 · GPQA 58.7 · tau2 15.5 · $0.135/1M
- Muse Spark 1.1 — Terminal-Bench 2.1 77.9 · GPQA 89.8 · $2.00/1M
MiniMax
3- MiniMax M2.5 — GPQA 84.8 · tau2 95.3 · $0.525/1M
- MiniMax M2.7 — Terminal-Bench 2.1 55.4 · GPQA 87.4 · tau2 84.8 · $0.525/1M
- MiniMax M3 — Terminal-Bench 2.1 65.2 · GPQA 92.9 · tau2 88.9 · $1.05/1M
Amazon
2- Nova 2.0 Lite — GPQA 76.8 · tau2 75.7 · $0.850/1M
- Nova 2.0 Pro Reasoning — nothing published · $3.44/1M
ByteDance
2- Doubao Seed 2.1 Pro — nothing published · $1.76/1M
- Doubao Seed 2.1 Turbo — nothing published · $0.882/1M
Cohere
2- Command A — Terminal-Bench 2.1 22.8 · GPQA 76.1 · tau2 80.7 · $4.38/1M
- Command A+ — Terminal-Bench 2.1 22.8 · GPQA 76.1 · tau2 80.7 · $4.38/1M
Kwaipilot
2- KAT-Coder-Air v2.5 — nothing published · $0.263/1M
- KAT-Coder-Pro v2.5 — Terminal-Bench 2.1 60.7 · $1.29/1M
Inception Labs
1- Mercury 2 — Terminal-Bench 2.1 27.3 · GPQA 77.0 · tau2 70.8 · $0.375/1M
Meituan
1- LongCat-2.0 — Terminal-Bench 2.1 50.2 · GPQA 78.0 · $1.30/1M
Microsoft
1- MAI-Image-2 — nothing published · $12.00/1M
NVIDIA
1- Nemotron 3 Super 120B — nothing published · $0.425/1M
Perplexity
1- Sonar Pro — GPQA 57.8 · $6.00/1M
StepFun
1- Step 3.7 Flash — Terminal-Bench 2.1 39.3 · GPQA 80.9 · tau2 98.5 · $0.438/1M
Xiaomi
1- MiMo-V2.5-Pro — Terminal-Bench 2.1 65.2 · GPQA 86.6 · tau2 94.2 · $0.544/1M