Compare top models

LLM Benchmarks

See how today's leading models write SpacetimeDB code, scored task by task on live modules.

openai/gpt-5.6-sol

Typescript · With Guidelines
0.0%Task Pass Rate
0/89Checks Passed
47Total Evals

auth

0% · 8 evals
StatusTask IDChecksRun Time
t_026_auth_identity_check0/134.3s
t_027_private_vs_public_table0/110.2s
t_041_registered_user_gate0/14.9s
t_042_admin_bootstrap0/17.9s
t_043_role_based_access0/111.2s
t_044_ban_list0/112.1s
t_045_rate_limit0/15.0s
t_046_shared_document0/120.3s

basics

0% · 15 evals
StatusTask IDChecksRun Time
t_000_empty_reducers0/18.5s
t_001_basic_tables0/15.5s
t_002_scheduled_table0/113.5s
t_003_struct_in_table0/14.0s
t_004_insert0/25.2s
t_005_update0/39.0s
t_006_delete0/35.4s
t_007_crud0/48.6s
t_008_index_lookup0/38.9s
t_009_init0/47.0s
t_010_connect0/14.4s
t_011_helper_function0/314.9s
t_038_schedule_at_time0/19.1s
t_039_cancel_schedule0/114.1s
t_040_lifecycle_player0/18.0s

data modeling

0% · 6 evals
StatusTask IDChecksRun Time
t_024_event_table0/19.3s
t_025_optional_fields0/14.3s
t_028_cascade_delete0/19.1s
t_029_filter_and_aggregate0/110.7s
t_030_two_table_join0/19.5s
t_031_unique_constraint0/15.2s

queries

0% · 8 evals
StatusTask IDChecksRun Time
t_022_view_basic0/110.3s
t_023_view_per_user0/118.8s
t_032_range_query0/114.8s
t_033_sort_and_limit0/18.2s
t_034_find_first0/17.4s
t_035_select_distinct0/120.7s
t_036_count_without_collect0/111.3s
t_037_multi_column_filter0/128.0s

schema

0% · 10 evals
StatusTask IDChecksRun Time
t_012_spacetime_product_type0/34.6s
t_013_spacetime_sum_type0/36.8s
t_014_elementary_columns0/35.1s
t_015_product_type_columns0/34.4s
t_016_sum_type_columns0/311.0s
t_017_scheduled_columns0/211.9s
t_018_constraints0/330.4s
t_019_many_to_many0/511.2s
t_020_ecs0/719.6s
t_021_multi_column_index0/58.5s