- claude-opus-5high72.8%±1.9$0.08/pt
- gpt-5-6-solhigh69.4%±1.4$0.05/pt
- gpt-5-6-lunamax67.2%±4.0$0.05/pt
- gemini-3-7-flashmedium65.5%±3.1$0.03/pt
- deepseek-v4-promax62.8%±6.30.38¢/pt
- deepseek-v4-flashmax53.3%±3.60.19¢/pt
Model Leaderboard
Which DeepSWE model gives you the most performance per dollar — and where you are overpaying for the same score.
Best Models
The most cost-efficient model for each performance score, from all available models.
Charts
Compare DeepSWE pass rate with mean cost. The top-right corner is the sweet spot: higher performance for less money.
15 selected models
Chart loads in the browser.
Comparison Table
15 selected models · sort by performance, price, or speed
Sort by
- claude-opus-5max· Anthropic73.6%±3.9$0.16/ptclaude-opus-5high72.8%±1.9$0.08/pt49% cheaper0.8% worse
- gpt-5-6-solmax· OpenAI72.7%±2.8$0.12/ptclaude-opus-5high72.8%±1.9$0.08/pt28% cheaper0.2% better
- claude-fable-5xhigh· Anthropic69.9%±3.2$0.19/ptgpt-5-6-solhigh69.4%±1.4$0.05/pt74% cheaper0.5% worse
- gpt-5-6-terramax· OpenAI69.6%±2.6$0.07/ptgpt-5-6-solhigh69.4%±1.4$0.05/pt30% cheaper0.2% worse
- glm-5-3max· Zhipu69.0%±3.0$0.06/ptgpt-5-6-lunamax67.2%±4.0$0.05/pt24% cheaper1.8% worse
- kimi-k3max· Moonshot68.5%±4.5$0.07/ptgpt-5-6-lunamax67.2%±4.0$0.05/pt35% cheaper1.3% worse
- grok-4-6medium· xAI67.5%±2.3$0.05/ptgpt-5-6-lunamax67.2%±4.0$0.05/pt12% cheaper0.3% worse
- gpt-5-6-lunamax· OpenAI67.2%±4.0$0.05/ptBest in class
- gemini-3-7-flashmedium· Google65.5%±3.1$0.03/ptBest in class
- deepseek-v4-promax· DeepSeek62.8%±6.30.38¢/ptBest in class
- qwen3-8-maxxhigh· Alibaba57.5%±2.7$0.06/ptdeepseek-v4-promax62.8%±6.30.38¢/pt94% cheaper5.4% better
- muse-spark-1-2xhigh· Meta54.9%±2.1$0.07/ptdeepseek-v4-promax62.8%±6.30.38¢/pt93% cheaper8.0% better
- claude-sonnet-5max· Anthropic53.8%±4.2$0.49/ptdeepseek-v4-flashmax53.3%±3.60.19¢/pt100% cheaper0.5% worse
- deepseek-v4-flashmax· DeepSeek53.3%±3.60.19¢/ptBest in class
- kimi-k2-7-codedefault· Moonshot30.5%±0.5$0.09/ptdeepseek-v4-flashmax53.3%±3.60.19¢/pt96% cheaper22.8% better
Model selector
Choose the model and reasoning effort rows to compare.
15 of 44 selected
ProvidersAll providers shown
Alibaba
qwen3-8-max
Alibaba
Anthropic
claude-opus-5
Anthropic
claude-fable-5
Anthropic
claude-sonnet-5
Anthropic
DeepSeek
deepseek-v4-pro
DeepSeek
deepseek-v4-flash
DeepSeek
Google
gemini-3-7-flash
Meta
muse-spark-1-2
Meta
Moonshot
kimi-k3
Moonshot
kimi-k2-7-code
Moonshot
OpenAI
gpt-5-6-sol
OpenAI
gpt-5-6-terra
OpenAI
gpt-5-6-luna
OpenAI
xAI
grok-4-6
xAI
Zhipu
glm-5-3
Zhipu