Terminal-BenchBenchmark scores and sources

Published result; benchmark version and evaluation conditions remain in the id and result note.

pillar: coding · weight 1 within pillar · unit: % (higher is better) · official board ↗
Row Model Result Normalized (0–100) Confidence
1 Fugu Ultra Sakana AI 82.1%Official model cards via models.devLab-reported; metric percent score; transcribed by MIT models.dev catalog; not independently evaluated [variant] Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
82.1 100% confidence 100 percent, Full
2 Fugu Sakana AI 80.2%Official model cards via models.devLab-reported; metric percent score; transcribed by MIT models.dev catalog; not independently evaluated [variant] Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
80.2 100% confidence 100 percent, Full
3 Ornith 1.0 397B DeepReinforce 78.2%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Claude Code Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
78.2 100% confidence 100 percent, Full
4 Ornith 1.0 397B DeepReinforce 77.5%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Terminus-2 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
77.5 100% confidence 100 percent, Full
5 Ornith 1.0 35B DeepReinforce 64.2%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Terminus-2 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
64.2 100% confidence 100 percent, Full
6 Ornith 1.0 35B DeepReinforce 62.8%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Claude Code Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
62.8 100% confidence 100 percent, Full
7 Ornith 1.0 9B DeepReinforce 43.1%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Terminus-2 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
43.1 100% confidence 100 percent, Full
8 Ornith 1.0 9B DeepReinforce 40.6%Official model cards via models.devLab-reported; metric percent; transcribed by MIT models.dev catalog; not independently evaluated [variant] Claude Code Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
40.6 100% confidence 100 percent, Full
9 GPT-5-Codex OpenAI 37.9%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 1, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
37.9 6% confidence 6 percent, Low
10 Step 3.7 Flash StepFun 35.6%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 15, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
35.6 13% confidence 13 percent, Low
11 GLM-4.7 Z.ai 33.4%Official model cards via models.devLab-reported; metric score; transcribed by MIT models.dev catalog; not independently evaluated [variant] Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
33.4 69% confidence 69 percent, Medium
12 Step 3.5 Flash 2603 StepFun 32.6%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
32.6 13% confidence 13 percent, Low
13 Step 3.5 Flash StepFun 27.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
27.3 88% confidence 88 percent, High
14 Gemini 2.5 Pro Google 26.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
26.5 90% confidence 90 percent, High
15 GLM-4.6 Z.ai 25%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 22, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
25.0 55% confidence 55 percent, Medium
16 GLM-4.5 Z.ai 22%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
22.0 47% confidence 47 percent, Low
17 Qwen3 Max Alibaba / Qwen 20.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 30, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
20.5 69% confidence 69 percent, Medium
18 GLM-4.5-Air Z.ai 20.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 30, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
20.5 37% confidence 37 percent, Low
19 Devstral 2 Mistral AI 18.9%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 31, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
18.9 19% confidence 19 percent, Low
20 Mistral Small 4 Mistral AI 17.4%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 1, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
17.4 6% confidence 6 percent, Low
21 Mistral Large 3 Mistral AI 15.9%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 4, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
15.9 37% confidence 37 percent, Low
22 Qwen3-Coder 30B-A3B Instruct Alibaba / Qwen 15.2%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
15.2 19% confidence 19 percent, Low
23 Gemini 2.5 Flash Google 13.6%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Jun 2, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
13.6 47% confidence 47 percent, Low
24 GPT-4o (2024-08-06) OpenAI 8.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
8.3 100% confidence 100 percent, Full
25 GPT-4o (2024-11-20) OpenAI 8.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
8.3 61% confidence 61 percent, Medium
26 DeepSeek-R1 DeepSeek 6.1%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
6.1 88% confidence 88 percent, High
27 Mistral Large 2.1 Mistral AI 6.1%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
6.1 100% confidence 100 percent, Full
28 GLM-4.5V Z.ai 5.3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Apr 29, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
5.3 37% confidence 37 percent, Low
29 Gemini 2.5 Flash-Lite Google 4.5%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
4.5 6% confidence 6 percent, Low
30 Mistral Medium 3 Mistral AI 3.8%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published May 30, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
3.8 85% confidence 85 percent, High
31 Llama-3.3-70B-Instruct Meta 3%Official model cards via models.devLab-reported; metric success rate; transcribed by MIT models.dev catalog; not independently evaluated [variant] Published Mar 11, 2026 Retrieved Oct 9, 2026 · factual citation; MIT transcription
Open source ↗
3.0 100% confidence 100 percent, Full

Results are as published by the source behind each value (hover or tap the number). Benchmark scores are shown individually for every source/variant (a model may have multiple rows), and vary by version, harness and date; the normalized column uses the method’s fixed 0–100 scales and feeds the coding pillar of the SI Score.

What changed

All releases · RSS feed

Alerts on this device

What to be alerted about
RSS feed