Model
SWE-bench
Reasoning
Context
Cost
Claude 4.6 Opus
Agentic / autonomous coding
RECOMMENDED
80.9%leads
200Ktokens
$$$premium
Gemini 3.1 Pro
Repo-scale context / logic
highstrong
2Mtokens
$$$premium
DeepSeek V4
Cost-sensitive / high-volume
~4.6comparable
largemoe
$cheapest
GPT-5.4 Codex
Multi-step planning / stable
solidreliable
largetokens
$$mid