Compare top models

LLM Benchmarks

See how today's leading models write Spacetime code, scored task by task on live modules.

Leaderboard

ModelEval Pass%CostRun TimeLast RunAuthBasicsData ModelingLifecycleMigrationsProceduresQueriesReducersSchemaTablesViews
OpenAI: GPT-5.6 Sol99.5%$1.60469.7K tokens10m 14s2w91.7%100.0%100.0%100.0%100.0%100.0%100.0%100.0%100.0%100.0%100.0%
Claude Opus 4.897.8%$1.66266.3K tokens4m 4s1mo100.0%100.0%100.0%100.0%94.6%
Claude Sonnet 4.697.8%$0.75195.6K tokens4m 0s1mo100.0%100.0%100.0%100.0%94.6%
GPT-5.597.8%$1.50177.0K tokens6m 48s1mo100.0%100.0%100.0%100.0%94.6%
Grok 4.397.8%$0.30198.4K tokens7m 2s1mo100.0%100.0%100.0%100.0%94.6%
Grok Build 0.197.8%$0.40278.1K tokens15m 29s1mo100.0%100.0%100.0%100.0%94.6%
Gemini 3.1 Pro97.4%$2.43607.7K tokens15m 1s2w100.0%100.0%100.0%72.7%100.0%100.0%100.0%100.0%100.0%100.0%85.7%
GPT-5.4-mini96.6%$0.16163.3K tokens1m 38s1mo100.0%96.7%83.3%87.5%100.0%
Claude Opus 596.4%$4.39743.5K tokens8m 13s2w100.0%96.7%100.0%100.0%100.0%95.2%100.0%100.0%100.0%92.9%71.4%
Anthropic: Claude Fable 595.3%$8.80744.0K tokens9m 34s2w100.0%100.0%100.0%100.0%100.0%100.0%87.5%100.0%100.0%100.0%42.9%
MoonshotAI: Kimi K393.3%$1.63452.7K tokens11m 13s2w100.0%96.7%100.0%72.7%100.0%100.0%87.5%68.8%100.0%100.0%85.7%
DeepSeek V4 Flash93.2%$0.05528.8K tokens17m 47s2w100.0%90.0%100.0%100.0%100.0%76.2%100.0%100.0%100.0%92.9%71.4%
DeepSeek V4 Pro89.1%$0.47541.2K tokens33m 44s2w100.0%96.7%100.0%63.6%100.0%66.7%87.5%100.0%100.0%71.4%71.4%
Gemini 3.5 Flash44.9%$0.84234.9K tokens7m 8s1mo0.0%63.3%66.7%25.0%40.5%