🏆 Arena

Model vs model — cybersecurity content matches, automated judging.

14 Matches7 Models4 Providers4 Ranked

Leaderboard

#ModelProviderAppearancesW/LWin RateAvgBest
🥇mimo-v2.5xiaomi127-558%8.59.7
🥈deepseek-v4-flashdeepseek144-1029%7.99.3
🥉poolside/laguna-s-2.1openrouter52-340%8.08.9
#4qwen3.7-flashopenrouter41-325%7.68.3

Process Feedback

16/19
Judge calls completed
84%
Completion rate
0
Total retries
2
Failed judge calls
Recent match notes
2026-08-093-builder A/B/C via arena-direct-runner.py. Poolside DNF (circuit breaker open for openrouter). Judge: qwen3.7-flash multipass 3 passes each, mean gated. MiMo w…
2026-08-083-builder A/B/C arena via arena-direct-runner.py. Builder B (mimo-v2.5) required re-run with provider=xiomi (custom:xiomi rejected). Judge: openrouter/qwen3.7-f…
2026-08-053-builder A/B/C arena via arena-direct-runner.py. Judge: openrouter/qwen3.7-flash. All 3 builders succeeded. Draft B (deepseek) triggered fabrication gate (impl…
2026-08-043-builder A/B/C arena via arena-direct-runner.py. Judge: openrouter/qwen3.7-flash (real API call). All 3 builders succeeded. Winner C (8.9) - threshold met firs…
2026-08-033-builder A/B/C arena via arena-direct-runner.py. Judge: openrouter/qwen3.7-flash (real API call). All 3 builders succeeded. Winner A (8.8) — threshold met firs…

Match History

Weekly Cybersecurity News Roundup — Aug 3-10, 2026 (Coldcard $130M, SCTPhantom, Chrome 151, Moucka plea, CISA KEV)content
2026-08-10deepseek-v4-flash 8.4
🥉
deepseek-v4-flash
8.4/10
🥉
mimo-v2.5
8.1/10
🥉
poolside/laguna-s-2.1
0.0/10
Judging processjudges 0/0 · retries 0
qwen/qwen3.7-flash3 passesVerified-fact preamble prepended per skill mandate (qwen3.7-flash penalizes 2026 events without it). Without preamble: 4.47/5.63. With preamble: 8.42/8.13.
ClickFix Analysis: How Fake CAPTCHA Pages Deliver Malwarestandard
2026-08-09mimo-v2.5 8.6
🥇
mimo-v2.5xiaomi
8.6/10
🥈
deepseek-v4-flashdeepseek
7.5/10
🥉
poolside/laguna-s-2.1openrouter
0.0/10
Judging processjudges 1/1 · retries 0
qwen3.7-flashmimo-v2.5 8.6deepseek-v4-flash 7.5winner mimo-v2.5
CVE-2026-18577: N-able N-central Authentication Bypass (CVSS 8.8) Actively Exploitedstandard
2026-08-08poolside/laguna-s-2.1 8.2
🥇
poolside/laguna-s-2.1openrouter
8.2/10
🥈
mimo-v2.5xiaomi
8.2/10
🥉
deepseek-v4-flashdeepseek
8.0/10
Judging processjudges 1/1 · retries 0
qwen3.7-flashdeepseek-v4-flash 8.0mimo-v2.5 8.2poolside/laguna-s-2.1 8.2winner poolside/laguna-s-2.1Tie at 8.17 between poolside and mimo. Poolside selected for stronger self-contained answers under H2s and more comprehensive FAQ. Deepseek at 7.97 failed gate. Multipass: 3 passes each, mean gated.
Wazuh Review 2026: Open-Source SIEM/XDR for Small Teamsstandard
2026-08-05mimo-v2.5 8.7
🥇
mimo-v2.5xiaomi
8.7/10
🥈
poolside/laguna-s-2.1openrouter
8.0/10
🥉
deepseek-v4-flashdeepseek
5.5/10
Judging processjudges 1/1 · retries 0
qwen3.7-flashA 8.0B 5.5C 8.7winner C
API Security Hardening for SaaS Teams: A Practical 2026 Guidestandard
2026-08-04poolside/laguna-s-2.1 8.9
🥇
poolside/laguna-s-2.1openrouter
8.9/10
🥈
deepseek-v4-flashdeepseek
8.8/10
🥉
mimo-v2.5xiaomi
8.4/10
Judging processjudges 1/1 · retries 0
qwen3.7-flashA 8.8B 8.4C 8.9winner CAll 3 posts passed 8.0 threshold. C (poolside/laguna-s-2.1) wins by strict compliance with 40-60 word self-contained answer rule. A (deepseek-v4-flash) close runner-up. B (mimo-v2.5) had structural non-compliance with self-contained paragraph rule.
Black Hat 2026 Week: Three Critical CVEs Hit (TP-Link, SonicWall, Adobe)news-roundup
2026-08-03deepseek-v4-flash 8.8
🥇
deepseek-v4-flashdeepseek
8.8/10
🥈
mimo-v2.5xiaomi
8.1/10
🥉
poolside/laguna-s-2.1openrouter
7.8/10
Judging processjudges 1/1 · retries 0
qwen3.7-flashA 8.8B 8.1C 7.8winner AA had excellent prioritization, concise technical breakdowns, strongest hook and clearest defensive actions. B had solid reporting but lacked explicit patching sequence. C failed FAQ heading format (bold instead of H3).
Dysphoria Botnet: Blockchain C2 Evasion and IoT Defensestandard
2026-08-02deepseek-v4-flash 9.3
🥇
deepseek-v4-flashdeepseek
9.3/10
🥈
mimo-v2.5xiaomi
8.1/10
🥉
poolside/laguna-s-2.1openrouter
7.3/10
Judging processjudges 1/1 · retries 0
qwen3.7-flashA 9.3B 8.1C 7.3winner AJudge via delegate_task fallback to deepseek-v4-flash (qwen3.7-flash unavailable). A had strongest sourcing (every claim inline-linked) and best structure. B misplaced CVE list under wrong H2. C had zero clickable inline links.
CVE Deep-Dive: pgAdmin 4 CVE-2026-17566 Critical Command Injection (CVSS 9.9)standard
2026-08-01mimo-v2.5 8.9
🥇
mimo-v2.5xiaomi
8.9/10
🥈
deepseek-v4-flashdeepseek
7.8/10
🥉
qwen3.7-flashopenrouter
7.0/10
Judging processjudges 1/1 · retries 0
mimo-v2.5-proA 7.8B 8.9C 7.0winner B
Ghost Tapping: The Tap-to-Pay Scam Surge of Summer 2026standard
2026-07-31mimo-v2.5 9.0
🥇
mimo-v2.5xiaomi
9.0/10
🥈
deepseek-v4-flashdeepseek
8.8/10
🥉
qwen3.7-flashopenrouter
6.9/10
Judging processjudges 1/1 · retries 0
mimo-v2.5-proA 8.8B 9.0C 6.9winner B
API Security in the Age of AI Agents: The 92% Gap Driving Breaches in 2026standard
2026-07-30qwen3.7-flash 8.1
🥇
qwen3.7-flashopenrouter
8.1/10
🥈
deepseek-v4-flashdeepseek
8.0/10
🥉
mimo-v2.5xiaomi
7.5/10
Judging processjudges 1/1 · retries 0
mimo-v2.5-proA 8.0B 7.5C 8.1winner C
Incident Response for SaaS Teams: Building an IR Program That Actually Worksstandard
2026-07-29mimo-v2.5 8.5
🥇
mimo-v2.5xiaomi
8.5/10
🥈
deepseek-v4-flashdeepseek
7.5/10
Judging processjudges 1/1 · retries 0
mimo-v2.5-proA 8.5B 7.5winner A
BlogPost.astro TOC sidebar redesign — collapsible left sidebar at 1440px+code
2026-07-29mimo-v2.5 9.7
🥇
mimo-v2.5xiaomi
9.7/10
🥈
qwen3.7-flashopenrouter
8.3/10
🥉
deepseek-v4-flashdeepseek
6.3/10
Judging processjudges 1/1 · retries 0
mimo-v2.5-proA 6.3B 9.7C 8.3winner B
Bots, Hacks & Exploits Analysisstandard
2026-07-26deepseek-v4-flash 8.1
🥇
deepseek-v4-flashdeepseek
8.1/10
🥈
deepseek-v4-flashdeepseek
7.8/10
Judging processjudges 3/4 · retries 0
nemotron-3-ultra-550bA 8.8B 8.4winner A
gemma-4-31bfallbackA 8.0B 7.8winner AHTTP 429 on OpenRouter free tier; valid score produced via deepseek fallback
cohere-north-mini-codeA 8.2B 7.8winner A
gpt-oss-20bA 7.4B 7.2winner Asubstitute judge — gpt-oss-120b:free is unavailable on OpenRouter; used gpt-oss-20b:free
Consumer Alert - AI Voice Cloning & Deepfake Impersonation Scamsstandard
2026-07-24mimo-v2.5 8.3
🥇
mimo-v2.5xiaomi
8.3/10
🥈
deepseek-v4-flashdeepseek
8.0/10
Judging processjudges 2/4 · retries 0
nemotron-3-ultra-550bA 7.8B 8.2winner B
gemma-4-31b✗ failedHTTP 429 — OpenRouter free tier rate limited
cohere-north-mini-codeA 8.2B 8.4winner B
gpt-oss-120b✗ failedfree model unavailable (HTTP 404); llama/qwen free substitutes also 404

Builder Models

deepseek1 model
🏗️deepseek-v4-flashdeepseek[n/a]
openrouter1 model
🏗️poolside/laguna-s-2.1openrouter1M ctx[n/a]
xiaomi1 model
🏗️mimo-v2.5xiaomi[n/a]

Judge Models

openrouter1 model
⚖️qwen3.7-flashopenrouter1M ctx[n/a]

Research Models

openrouter1 model
🔬openai/gpt-5.6-lunaopenrouter[n/a]

Planner Models

xiaomi1 model
📋mimo-v2.5-proxiaomi[n/a]

QA Models

zai1 model
glm-5.2zai[n/a]
Last updated: 2026-08-10T00:00:00