Compare top models

LLM Benchmarks

See how today's leading models write SpacetimeDB code, scored task by task on live modules.

openai/gpt-5.6-sol

Typescript · With Guidelines
100.0%Task Pass Rate
89/89Checks Passed
47Total Evals

Pass Rate Over Time

Click a data point to view results from that date.

auth

100% · 8 evals
StatusTask IDChecksRun Time
t_041_registered_user_gate1/16.3s
t_042_admin_bootstrap1/14.0s
t_043_role_based_access1/124.4s
t_044_ban_list1/16.5s
t_045_rate_limit1/15.9s
t_046_shared_document1/18.0s
t_026_auth_identity_check1/17.3s
t_027_private_vs_public_table1/15.8s

basics

100% · 15 evals
StatusTask IDChecksRun Time
t_038_schedule_at_time1/111.7s
t_039_cancel_schedule1/16.2s
t_040_lifecycle_player1/13.9s
t_000_empty_reducers1/16.6s
t_001_basic_tables1/18.6s
t_002_scheduled_table1/110.5s
t_003_struct_in_table1/13.4s
t_004_insert2/27.1s
t_006_delete3/35.8s
t_005_update3/39.8s
t_007_crud4/46.2s
t_008_index_lookup3/37.6s
t_009_init4/43.7s
t_010_connect1/13.4s
t_011_helper_function3/37.4s

data modeling

100% · 6 evals
StatusTask IDChecksRun Time
t_024_event_table1/14.6s
t_025_optional_fields1/13.0s
t_028_cascade_delete1/15.7s
t_029_filter_and_aggregate1/17.6s
t_030_two_table_join1/17.7s
t_031_unique_constraint1/17.6s

queries

100% · 8 evals
StatusTask IDChecksRun Time
t_036_count_without_collect1/111.7s
t_037_multi_column_filter1/17.1s
t_032_range_query1/110.2s
t_033_sort_and_limit1/111.7s
t_034_find_first1/17.0s
t_035_select_distinct1/16.0s
t_022_view_basic1/111.3s
t_023_view_per_user1/15.4s

schema

100% · 10 evals
StatusTask IDChecksRun Time
t_012_spacetime_product_type3/36.3s
t_013_spacetime_sum_type3/37.8s
t_014_elementary_columns3/36.9s
t_015_product_type_columns3/36.4s
t_016_sum_type_columns3/33.9s
t_017_scheduled_columns2/29.5s
t_018_constraints3/310.5s
t_019_many_to_many5/511.4s
t_020_ecs7/711.0s
t_021_multi_column_index5/54.4s