Compare top models

LLM Benchmarks

See how today's leading models write Spacetime code, scored task by task on live modules.

Leaderboard

ModelEval Pass%CostRun TimeLast RunAuthBasicsData ModelingLifecycleMigrationsProceduresQueriesReducersSchemaTablesViews
Grok 4.397.8%$0.33218.4K tokens9m 17s1mo100.0%100.0%100.0%100.0%94.6%
Grok Build 0.197.8%$0.47324.0K tokens26m 40s1mo100.0%100.0%100.0%100.0%94.6%
Anthropic: Claude Fable 597.4%$8.06672.6K tokens7m 48s3d90.9%93.3%100.0%100.0%100.0%100.0%100.0%100.0%100.0%85.7%100.0%
Anthropic: Claude Fable 5.196.6%$4.46378.7K tokens5m 19s3d100.0%93.3%100.0%87.5%100.0%
Claude Sonnet 4.696.6%$0.80216.0K tokens3m 14s1mo100.0%100.0%83.3%100.0%94.6%
GPT-5.596.6%$1.62194.2K tokens8m 8s1mo100.0%100.0%83.3%100.0%94.6%
Claude Opus 596.3%$4.04673.1K tokens6m 20s3d90.9%90.0%100.0%100.0%100.0%100.0%100.0%100.0%100.0%85.7%92.9%
Claude Opus 4.894.4%$1.81297.2K tokens3m 43s1mo100.0%96.7%83.3%87.5%94.6%
Gemini 3.1 Pro92.1%$2.30554.3K tokens15m 20s3d90.9%86.7%100.0%100.0%100.0%66.7%87.5%100.0%100.0%100.0%85.7%
GPT-5.4-mini92.1%$0.17178.8K tokens1m 53s1mo100.0%86.7%66.7%87.5%100.0%
MoonshotAI: Kimi K391.6%$1.50412.7K tokens20m 50s3d90.9%86.7%100.0%100.0%100.0%81.0%100.0%100.0%91.9%71.4%100.0%
Gemini 3.5 Flash91.6%$2.13599.3K tokens13m 53s3d100.0%83.3%83.3%63.6%100.0%81.0%100.0%100.0%100.0%100.0%85.7%
DeepSeek V4 Pro91.1%$0.62507.5K tokens30m 49s3d81.8%96.7%100.0%36.4%100.0%90.5%100.0%100.0%100.0%85.7%78.6%
OpenAI: GPT-5.6 Sol82.9%$0.76301.8K tokens4m 29s1mo80.0%100.0%100.0%100.0%100.0%0.0%100.0%0.0%94.6%100.0%0.0%
DeepSeek V4 Flash79.6%$0.05471.9K tokens26m 22s3d81.8%86.7%100.0%72.7%100.0%42.9%87.5%100.0%81.1%100.0%28.6%