Compare top models

LLM Benchmarks

See how today's leading models write SpacetimeDB code, scored task by task on live modules.

Leaderboard

6 models
ModelEval Pass%ChecksCostRun TimeAuthBasicsData ModelingQueriesSchema
anthropic/claude-sonnet-50.0%0/89$0.72284.4K tokens3m 58s0.0%0.0%0.0%0.0%0.0%
openai/gpt-5.6-sol0.0%0/89$1.27177.6K tokens7m 16s0.0%0.0%0.0%0.0%0.0%
anthropic/claude-opus-50.0%0/89$1.76283.1K tokens4m 18s0.0%0.0%0.0%0.0%0.0%
moonshotai/kimi-k30.0%0/89$0.95195.7K tokens6m 34s0.0%0.0%0.0%0.0%0.0%
x-ai/grok-4.50.0%0/89$0.56215.7K tokens6m 52s0.0%0.0%0.0%0.0%0.0%
anthropic/claude-fable-50.0%0/89$3.54283.4K tokens5m 18s0.0%0.0%0.0%0.0%0.0%