Compare top models

LLM Benchmarks

See how today's leading models write SpacetimeDB code, scored task by task on live modules.

Leaderboard

13 models
ModelEval Pass%ChecksCostRun TimeAuthBasicsData ModelingQueriesSchema
openai/gpt-5.6-sol100.0%89/89$1.65258.2K tokens4m 7s100.0%100.0%100.0%100.0%100.0%
x-ai/grok-4.5100.0%89/89$0.73301.1K tokens6m 34s100.0%100.0%100.0%100.0%100.0%
Gemini 3.1 Pro100.0%89/89$1.28333.4K tokens7m 39s100.0%100.0%100.0%100.0%100.0%
anthropic/claude-opus-598.9%88/89$2.39413.1K tokens3m 42s100.0%96.7%100.0%100.0%100.0%
anthropic/claude-fable-598.9%88/89$4.80413.5K tokens5m 3s100.0%100.0%100.0%87.5%100.0%
anthropic/claude-sonnet-598.9%88/89$0.96413.4K tokens3m 31s100.0%96.7%100.0%100.0%100.0%
google/gemini-3-flash-preview97.8%87/89$2.29988.6K tokens61m 15s100.0%96.7%100.0%87.5%100.0%
DeepSeek V4 Pro97.8%87/89$0.15294.5K tokens12m 50s100.0%96.7%100.0%87.5%100.0%
openai/gpt-5.6-terra97.8%87/89$0.31255.6K tokens1m 53s100.0%93.3%100.0%100.0%100.0%
moonshotai/kimi-k397.8%87/89$0.92258.6K tokens5m 57s100.0%96.7%100.0%87.5%100.0%
DeepSeek V4 Flash96.6%86/89$0.04284.6K tokens8m 13s100.0%90.0%100.0%100.0%100.0%
qwen/qwen3-coder-plus68.5%61/89$0.19256.0K tokens3m 5s75.0%93.3%83.3%62.5%45.9%
qwen/qwen3-coder-flash57.3%51/89$0.06255.9K tokens2m 41s75.0%83.3%83.3%50.0%29.7%