PERSONAL CODING EVALS

Coding agents evaluated on tasks derived from my day-to-day engineering work. Not a general "best coding model" ranking. Updated 2026-09-27. How this benchmark works → ---

MODELS

Suite core10-v1.3: 10 tasks × 3 runs per config. Harbor 0.21.0; harnesses: Pi 0.85.1, Claude Code 2.1.281, Oh My Pi 18.2.11.

HarnessModelEffortpass@1pass@3pass-all-3$/taskTime/taskStepsTokens/task
PiGPT-6 Lunaxhigh100%100%100%$0.01452:4614.2290k
PiGPT-6 Solmedium100%100%100%$0.07150:538.058k
PiOpus 5.5low100%100%100%$0.11680:373.731k
PiOpus 5.5medium100%100%100%$0.22071:125.765k
PiGPT-6 Astralow100%100%100%$0.26180:556.535k
PiOpus 5.5high100%100%100%$0.30341:426.798k
Claude CodeOpus 5.5high100%100%100%$0.35461:476.5227k
PiGPT-6 Lunamedium96.7%100%90%$0.00611:0211.0113k
PiGLM-5.3-Flashmax (default)96.7%100%90%$0.19997:0123.21,196k
PiOpus 5high96.7%100%90%$0.51612:269.7177k
PiGPT-6 Lunahigh93.3%100%90%$0.01122:0414.0228k
PiDeepSeek-V4.1-Flashoff93.3%100%80%$0.04254:3016.6426k
Oh My PiGPT-6 Lunaxhigh90%90%90%$0.02773:5017.7776k
PiQwen3.8-27Bxhigh76.7%100%40%$0.23012:1616.8694k