Bob Fleet Metrics
Last 30 days of autonomous agent sessions — generated 2026-09-17 03:00 UTC
Last 30 days of autonomous agent sessions — generated 2026-09-17 03:00 UTC
Daily autonomous sessions with productive overlay and average quality score trend
Productive rate and LLM judge quality score per model+harness combination (min 8 sessions, last 30 days). ■ claude-code ■ codex ■ gptme
| Harness:Model | Productive rate | % | Score | Sessions |
|---|---|---|---|---|
| claude-code:Sonnet 4.6 | 87.4% | 0.54 | 1,242 | |
| grok-build:grok-4.6 | 97.8% | 0.58 | 455 | |
| claude-code:Opus | 80.7% | 0.67 | 311 | |
| claude-code:Haiku (old) | 76.3% | 0.58 | 291 | |
| gptme:GPT-5.6-sol | 92.2% | 0.59 | 257 | |
| codex:gpt-6-astra | 99.4% | 0.61 | 169 | |
| gptme:grok-4.6 | 89.0% | 0.56 | 163 | |
| codex:GPT-5.5 | 86.0% | 0.57 | 150 | |
| gptme:DeepSeek V4 Flash | 95.9% | 0.56 | 97 | |
| codex:GPT-5.6-sol | 67.5% | 0.63 | 80 | |
| pi:grok-4.6 | 71.6% | 0.56 | 74 | |
| gptme:deepseek-v4-pro-0813 | 96.0% | 0.57 | 50 |