Benchmarks

Do more with less.

Structure is what makes a smaller model reason like a bigger one. On SWE-Atlas-QnA, the Coresource runtime running DeepSeek V4 Flash, an open model a fraction of the size, lands fifth of seventeen systems, matching agents that cost 14-32x more.

80.3%
Average pass@1 · #5 of 17 systems
$0.37
Cost per task · 14-32x cheaper
~$46
Full benchmark run · 124 tasks
Claude Fable 5
83.3
$11.75
Claude Opus 4.8
82.5
$7.70
Claude Opus 4.7
81.0
$5.64
Codex GPT-5.5
80.8
$5.07
Coresource · DeepSeek V4 Flash
80.3
$0.37
Codex GPT-5.5 med
79.1
$2.75
Opencode Opus 4.7
79.0
$2.93
Claude Opus 4.8 med
76.8
$3.26
Claude GLM-5.2
73.6
$6.47
Claude GLM-5.1
73.2
$4.33
Codex GPT-5.4 med
72.4
$2.27
Claude Opus 4.6 med
71.9
$1.26
Claude Opus 4.7 med
71.7
$1.68
Claude Sonnet 4.6
70.3
$0.27
Claude DeepSeek V4 Pro
67.8
$0.27
Claude Kimi K2.6
59.8
$1.18
Gemini 3.1 Pro
45.6
$2.00

Average pass@1 on SWE-Atlas-QnA (0-100); dollar figures are measured cost per task across 124 tasks. Source: Artificial Analysis.