|
fable5
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
gemini38
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
glm53
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
glm53flash
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
gpt61sol
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
grok47
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
kimi3agent
|
kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard
|
2026-10-03 02:21:24 +08:00 |
|
mimov26pro
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
minimaxm3
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
opus55
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
shots
|
Add dashboard.html + screenshots to repo
|
2026-10-02 17:48:40 +08:00 |
|
sonnet5
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
sonnet46
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
brief.txt
|
Add benchmark brief
|
2026-10-02 17:03:23 +08:00 |
|
dashboard.html
|
kimi-k3-agent run2/3 costs: avg $0.1032 (rank 7)
|
2026-10-03 02:23:46 +08:00 |
|
kimi-2x-results.json
|
kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard
|
2026-10-03 02:21:24 +08:00 |
|
run-fable5-log.txt
|
Arena: add claude-fable-5 result (34KB, 455s, clean layout QA pass)
|
2026-10-02 17:02:16 +08:00 |
|
run-gem38-log.txt
|
Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass)
|
2026-10-02 16:30:37 +08:00 |
|
run-glm53-log.txt
|
Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass)
|
2026-10-02 17:28:33 +08:00 |
|
run-glm53b-log.txt
|
Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass)
|
2026-10-02 17:28:33 +08:00 |
|
run-glm53c-log.txt
|
Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass)
|
2026-10-02 17:28:33 +08:00 |
|
run-glm53f-log.txt
|
Arena: add glm-5.3-flash result (12KB, 46.5s, QA pass) + dashboard updated to 9 models
|
2026-10-02 17:52:51 +08:00 |
|
run-glm53flash-bench-log.txt
|
Re-run glm-5.3-flash on dedicated benchmark key (65.8s, 19KB, QA pass)
|
2026-10-02 17:57:19 +08:00 |
|
run-grok47-log.txt
|
Arena: add grok-4.7 result (23KB, 254s, minor UX quirk: participants label below dropdown)
|
2026-10-02 16:41:04 +08:00 |
|
run-kimi-2x-log.txt
|
kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard
|
2026-10-03 02:21:24 +08:00 |
|
run-kimi-2x.sh
|
kimi-k3-agent restored: 2 new runs (177s/192s), screenshots + reviews, unhidden from leaderboard
|
2026-10-03 02:21:24 +08:00 |
|
run-kimi3a-log.txt
|
Arena: add kimi-k3-agent result (27KB, 166s, clean layout QA pass)
|
2026-10-02 16:50:57 +08:00 |
|
run-log.txt
|
Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5
|
2026-10-02 16:03:04 +08:00 |
|
run-mimo-log.txt
|
Arena: add mimo-v2.6-pro result (26KB, 92s, QA pass, full Indonesian UI) - 12 models
|
2026-10-02 19:11:32 +08:00 |
|
run-mimo.sh
|
Arena: add mimo-v2.6-pro result (26KB, 92s, QA pass, full Indonesian UI) - 12 models
|
2026-10-02 19:11:32 +08:00 |
|
run-minimax-log.txt
|
Dashboard: cost formatting to 6 decimals for sub-cent values; glm53flash $0.000007
|
2026-10-02 18:08:01 +08:00 |
|
run-minimax.sh
|
Dashboard: cost formatting to 6 decimals for sub-cent values; glm53flash $0.000007
|
2026-10-02 18:08:01 +08:00 |
|
run-minimaxm3-log.txt
|
Arena: add minimax-m3 result (31KB, 73s, had JS syntax error fixed manually) - 11 models
|
2026-10-02 19:03:26 +08:00 |
|
run-minimaxm3.sh
|
Arena: add minimax-m3 result (31KB, 73s, had JS syntax error fixed manually) - 11 models
|
2026-10-02 19:03:26 +08:00 |
|
run-opus55-log.txt
|
Arena: add claude-opus-5.5 result (29KB, 239s, all features pass)
|
2026-10-02 16:22:07 +08:00 |
|
run-second-try-log.txt
|
Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x)
|
2026-10-02 20:30:41 +08:00 |
|
run-second-try.sh
|
Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x)
|
2026-10-02 20:30:41 +08:00 |
|
run-sonnet46-log.txt
|
Arena: add claude-sonnet-4.6 result (63KB, 881s w/ retry, QA pass) - 10 models
|
2026-10-02 18:44:37 +08:00 |
|
run-sonnet46.sh
|
Arena: add claude-sonnet-4.6 result (63KB, 881s w/ retry, QA pass) - 10 models
|
2026-10-02 18:44:37 +08:00 |
|
run-third-try-log.txt
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
run-third-try.sh
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
run2-log.txt
|
Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5
|
2026-10-02 16:03:04 +08:00 |
|
run3-log.txt
|
Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5
|
2026-10-02 16:03:04 +08:00 |
|
run4-log.txt
|
Arena: expense splitter — gpt-6.1-sol vs claude-sonnet-5
|
2026-10-02 16:03:04 +08:00 |
|
runkey.sh
|
Re-run glm-5.3-flash on dedicated benchmark key (65.8s, 19KB, QA pass)
|
2026-10-02 17:57:19 +08:00 |
|
second-try-results.json
|
Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x)
|
2026-10-02 20:30:41 +08:00 |
|
shot-dashboard.png
|
Add dashboard with costs, screenshots, per-model reviews
|
2026-10-02 17:36:22 +08:00 |
|
shot-dashboard2.png
|
Re-run glm-5.3-flash on dedicated benchmark key (65.8s, 19KB, QA pass)
|
2026-10-02 17:57:19 +08:00 |
|
shot-fable5.png
|
Arena: add claude-fable-5 result (34KB, 455s, clean layout QA pass)
|
2026-10-02 17:02:16 +08:00 |
|
shot-gemini38.png
|
Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass)
|
2026-10-02 16:30:37 +08:00 |
|
shot-glm53.png
|
Arena: add glm-5.3 result (26KB, 101s with reasoning_effort low, clean layout QA pass)
|
2026-10-02 17:28:33 +08:00 |
|
shot-gpt61sol.png
|
Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass)
|
2026-10-02 16:30:37 +08:00 |
|
shot-grok47.png
|
Arena: add grok-4.7 result (23KB, 254s, minor UX quirk: participants label below dropdown)
|
2026-10-02 16:41:04 +08:00 |
|
shot-kimi3agent.png
|
Arena: add kimi-k3-agent result (27KB, 166s, clean layout QA pass)
|
2026-10-02 16:50:57 +08:00 |
|
shot-opus55.png
|
Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass)
|
2026-10-02 16:30:37 +08:00 |
|
shot-sonnet5.png
|
Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass)
|
2026-10-02 16:30:37 +08:00 |
|
shot.js
|
Arena: add gemini-3.8-flash result (36KB, 47s, clean layout QA pass)
|
2026-10-02 16:30:37 +08:00 |
|
third-try-results.json
|
Third-try: 3-run averages on dashboard, run3 screenshots + reviews
|
2026-10-03 01:20:26 +08:00 |
|
update-dash.py
|
Second-try results: avg times on dashboard, 10/12 re-ran OK (kimi 404, sonnet-4.6 failed 2x)
|
2026-10-02 20:30:41 +08:00 |
|
update3.py
|
Dashboard: run-2 screenshots + per-model run2 comparison reviews
|
2026-10-02 21:11:00 +08:00 |