Compare top models

LLM Benchmarks

See how today's leading models write Spacetime code, scored task by task on live modules.

Leaderboard

ModelEval Pass%CostRun TimeLast RunAuthBasicsData ModelingLifecycleMigrationsProceduresQueriesReducersSchemaTablesViews
Anthropic: Claude Fable 598.9%$4.69392.3K tokens5m 18s1mo87.5%100.0%100.0%100.0%100.0%
Anthropic: Claude Fable 5.198.9%$4.65391.7K tokens5m 15s3d87.5%100.0%100.0%100.0%100.0%
Claude Sonnet 4.698.9%$0.78204.6K tokens3m 27s1mo87.5%100.0%100.0%100.0%100.0%
Gemini 3.1 Pro97.8%$1.87352.3K tokens11m 58s1mo87.5%96.7%100.0%100.0%100.0%
Claude Opus 4.896.6%$1.81289.5K tokens4m 18s1mo87.5%100.0%100.0%100.0%94.6%
GPT-5.596.6%$1.48178.8K tokens7m 29s1mo87.5%100.0%100.0%100.0%94.6%
Grok Build 0.195.5%$0.40280.5K tokens11m 55s1mo75.0%100.0%100.0%100.0%94.6%
Grok 4.393.3%$0.30201.6K tokens8m 47s1mo87.5%100.0%100.0%87.5%89.2%
MoonshotAI: Kimi K393.3%$0.82225.5K tokens7m 21s1mo87.5%86.7%100.0%87.5%100.0%
OpenAI: GPT-5.6 Sol92.2%$0.97371.9K tokens7m 38s1mo70.0%100.0%100.0%100.0%100.0%85.7%87.5%0.0%100.0%100.0%100.0%
DeepSeek V4 Flash91.0%$0.02247.5K tokens7m 46s1mo87.5%86.7%100.0%100.0%91.9%
GPT-5.4-mini88.8%$0.17166.2K tokens2m 27s1mo50.0%100.0%66.7%100.0%89.2%
Claude Opus 566.7%$2.33391.8K tokens3m 58s1mo70.0%86.7%100.0%0.0%0.0%0.0%100.0%0.0%100.0%0.0%0.0%
DeepSeek V4 Pro63.4%$0.32276.3K tokens13m 22s1mo40.0%76.7%100.0%72.7%0.0%0.0%87.5%0.0%100.0%0.0%0.0%
Gemini 3.5 Flash50.6%$0.81233.6K tokens6m 28s1mo12.5%66.7%50.0%50.0%45.9%