Model coding arena: same brief, different models. Expense splitter benchmark.
  • HTML 97.3%
  • Shell 2.3%
  • Python 0.4%
Find a file
2026-10-03 02:23:46 +08:00
fable5 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
gemini38 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
glm53 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
glm53flash Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
gpt61sol Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
grok47 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
kimi3agent kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard 2026-10-03 02:21:24 +08:00
mimov26pro Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
minimaxm3 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
opus55 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
shots Add dashboard.html + screenshots to repo 2026-10-02 17:48:40 +08:00
sonnet5 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
sonnet46 Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
brief.txt Add benchmark brief 2026-10-02 17:03:23 +08:00
dashboard.html kimi-k3-agent run2/3 costs: avg $0.1032 (rank 7) 2026-10-03 02:23:46 +08:00
kimi-2x-results.json kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard 2026-10-03 02:21:24 +08:00
run-fable5-log.txt Arena: add claude-fable-5 result (34KB, 455s, clean layout QA pass) 2026-10-02 17:02:16 +08:00
run-gem38-log.txt Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass) 2026-10-02 16:30:37 +08:00
run-glm53-log.txt Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass) 2026-10-02 17:28:33 +08:00
run-glm53b-log.txt Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass) 2026-10-02 17:28:33 +08:00
run-glm53c-log.txt Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass) 2026-10-02 17:28:33 +08:00
run-glm53f-log.txt Arena: add glm-5.3-flash result (12KB, 46.5s, QA pass) + dashboard updated to 9 models 2026-10-02 17:52:51 +08:00
run-glm53flash-bench-log.txt Re-run glm-5.3-flash on dedicated benchmark key (65.8s, 19KB, QA pass) 2026-10-02 17:57:19 +08:00
run-grok47-log.txt Arena: add grok-4.7 result (23KB, 254s, minor UX quirk: participants label below dropdown) 2026-10-02 16:41:04 +08:00
run-kimi-2x-log.txt kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard 2026-10-03 02:21:24 +08:00
run-kimi-2x.sh kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard 2026-10-03 02:21:24 +08:00
run-kimi3a-log.txt Arena: add kimi-k3-agent result (27KB, 166s, clean layout QA pass) 2026-10-02 16:50:57 +08:00
run-log.txt Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5 2026-10-02 16:03:04 +08:00
run-mimo-log.txt Arena: add mimo-v2.6-pro result (26KB, 92s, QA pass, full Indonesian UI) - 12 models 2026-10-02 19:11:32 +08:00
run-mimo.sh Arena: add mimo-v2.6-pro result (26KB, 92s, QA pass, full Indonesian UI) - 12 models 2026-10-02 19:11:32 +08:00
run-minimax-log.txt Dashboard: cost formatting to 6 decimals for sub-cent values; glm53flash $0.000007 2026-10-02 18:08:01 +08:00
run-minimax.sh Dashboard: cost formatting to 6 decimals for sub-cent values; glm53flash $0.000007 2026-10-02 18:08:01 +08:00
run-minimaxm3-log.txt Arena: add minimax-m3 result (31KB, 73s, had JS syntax error fixed manually) - 11 models 2026-10-02 19:03:26 +08:00
run-minimaxm3.sh Arena: add minimax-m3 result (31KB, 73s, had JS syntax error fixed manually) - 11 models 2026-10-02 19:03:26 +08:00
run-opus55-log.txt Arena: add claude-opus-5.5 result (29KB, 239s, all features pass) 2026-10-02 16:22:07 +08:00
run-second-try-log.txt Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x) 2026-10-02 20:30:41 +08:00
run-second-try.sh Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x) 2026-10-02 20:30:41 +08:00
run-sonnet46-log.txt Arena: add claude-sonnet-4.6 result (63KB, 881s w/ retry, QA pass) - 10 models 2026-10-02 18:44:37 +08:00
run-sonnet46.sh Arena: add claude-sonnet-4.6 result (63KB, 881s w/ retry, QA pass) - 10 models 2026-10-02 18:44:37 +08:00
run-third-try-log.txt Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
run-third-try.sh Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
run2-log.txt Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5 2026-10-02 16:03:04 +08:00
run3-log.txt Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5 2026-10-02 16:03:04 +08:00
run4-log.txt Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5 2026-10-02 16:03:04 +08:00
runkey.sh Re-run glm-5.3-flash on dedicated benchmark key (65.8s, 19KB, QA pass) 2026-10-02 17:57:19 +08:00
second-try-results.json Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x) 2026-10-02 20:30:41 +08:00
shot-dashboard.png Add dashboard with costs, screenshots, per-model reviews 2026-10-02 17:36:22 +08:00
shot-dashboard2.png Re-run glm-5.3-flash on dedicated benchmark key (65.8s, 19KB, QA pass) 2026-10-02 17:57:19 +08:00
shot-fable5.png Arena: add claude-fable-5 result (34KB, 455s, clean layout QA pass) 2026-10-02 17:02:16 +08:00
shot-gemini38.png Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass) 2026-10-02 16:30:37 +08:00
shot-glm53.png Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass) 2026-10-02 17:28:33 +08:00
shot-gpt61sol.png Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass) 2026-10-02 16:30:37 +08:00
shot-grok47.png Arena: add grok-4.7 result (23KB, 254s, minor UX quirk: participants label below dropdown) 2026-10-02 16:41:04 +08:00
shot-kimi3agent.png Arena: add kimi-k3-agent result (27KB, 166s, clean layout QA pass) 2026-10-02 16:50:57 +08:00
shot-opus55.png Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass) 2026-10-02 16:30:37 +08:00
shot-sonnet5.png Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass) 2026-10-02 16:30:37 +08:00
shot.js Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass) 2026-10-02 16:30:37 +08:00
third-try-results.json Third-try: 3-run averages on dashboard, run3 screenshots + reviews 2026-10-03 01:20:26 +08:00
update-dash.py Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x) 2026-10-02 20:30:41 +08:00
update3.py Dashboard: run-2 screenshots + per-model run2 comparison reviews 2026-10-02 21:11:00 +08:00