Email Bench

Evaluates language models on producing production-ready emails from real briefs, in HTML and React Email.

15%20%25%30%35%40%45%50%55%$0.005$0.01$0.02$0.04$0.08$0.16$0.32$0.64$1.28Average cost per task (log scale)GPT-6 Astra: 50.0%, $0.59 average cost per taskGPT-6 Sol: 48.5%, $0.12 average cost per taskClaude Opus 5.5: 36.2%, $0.42 average cost per taskGPT-6 Luna: 36.2%, $0.006 average cost per taskGrok 4.7: 33.7%, $1.15 average cost per taskClaude Fable 5.1: 24.0%, $0.94 average cost per taskMuse Spark 1.3: 18.4%, $0.14 average cost per taskGPT-6 AstraGPT-6 SolClaude Opus 5.5GPT-6 LunaGrok 4.7Claude Fable 5.1Muse Spark 1.3

196 tasks · 100 HTML · 96 React Email

Model
1GPT-6 Astra50.0%$0.59103,640
2GPT-6 Sol48.5%$0.12108,520
3Claude Opus 5.536.2%$0.42247,780
4GPT-6 Luna36.2%$0.006116,668
5Grok 4.733.7%$1.151,541,825
6Claude Fable 5.124.0%$0.94212,287
7Muse Spark 1.318.4%$0.14185,367

Every model runs each task once through the Pi coding agent, at high reasoning effort. A run that produces no email counts as a failure. Cost and tokens are averages per task.