Compare top models

LLM Benchmarks

See how today's leading models write Spacetime code, scored task by task on live modules.

Trends

Task pass rate over time, per model.
Anthropic: Claude Opus 5.5OpenAI: GPT-6 SolSpaceXAI: Grok 4.7OpenAI: GPT-6 AstraOpenAI: GPT-5.6 Sol

Task Pass Rate Over Time

Click a data point to view that day's leaderboard.