Forskere har publisert det de sier er den første testen der generelle KI-modeller kjører en ekte bil, og hovedresultatet er at de fleste av dem ikke klarte å komme seg rundt en kjeglebane på en parkeringsplass.

Testen

DrivingBench, lagt ut på arXiv 30. september 2026 av Aditya Ramabadran, Simon Mahns og Tobias Gessler, satte fire banebrytende visjon-språkmodeller til å styre en Toyota Corolla fra 2022 utstyrt med comma-maskinvare som kjørte openpilot. Modellene fikk tre verktøy: ett for å se bilens kamerabilder og telemetri, ett for å styre rattutslag og hastighet, og ett for å stoppe.

Banen var en kort rute fra punkt til punkt gjennom en parkeringsplass, markert med små kjegler, med rette strekninger, kurver, venstre- og høyresvinger og et markert målområde. Hastighetene var lave hele veien.

Én designbeslutning gjør dette vanskeligere enn det høres ut. Bilen fortsetter å bevege seg mens modellen tenker, og en ny kommando erstatter den som fortsatt kjører. Slutningsforsinkelse er en del av oppgaven, ikke noe testoppsettet skjuler: Modellen må observere, handle, oppdage at den tok feil og hente seg inn igjen, alt mens bilen er i bevegelse.

Resultatene

Modell Resultat
GPT-6 Astra Fullførte banen, på sitt andre forsøk
Claude Fable 5.1 Fullførte ikke
GPT-5.6 Sol Fullførte ikke
Grok 4.6 Fullførte ikke

Hver modell fikk opptil tre forsøk i én samtale, i leverandørens eget testoppsett — Codex, Claude Code og Cursor. Astra var den eneste som fullførte, og forfatterne påpeker at ingen andre forsøk kom forbi 50 % av banen. Av de 11 kjøringene endte åtte i en krasj, og åtte klarte ikke å fullføre 11 % av ruten, men mislyktes i den første kurven.

De enkelte feilene er mer lærerike enn opptellingen. Grok tolket et mellomrom mellom kjegler som en port og kjørte gjennom det etter to kommandoer. Én GPT-modell fant opp en regel om hva kjeglefargene betydde og handlet etter den, til tross for at den uttrykkelig var blitt advart om det motsatte. Flere svingte rett og slett ikke langt nok. Astras vellykkede kjøring kostet $7,74 i slutning, omtrent fire ganger så mye som de tidligere forsøkene som nådde halve banen.

Forfatternes oppsummering er at banebrytende modeller er «ærlig talt ikke gode til dette».

Hvorfor dette er en Tesla-sak

Fordi dette er kontrollbetingelsen i en diskusjon folk har hatt om FSD i to år.

Teslas argument er at kjøring trenger et spesialbygd ende-til-ende-nettverk trent på kjøring, som kjører med kameraets bildefrekvens i bilen. Det underforståtte motargumentet — at generelle multimodale modeller blir gode nok til å gjøre en kjørespesifikk stack til en overgangsløsning — har nå fått et tall knyttet til seg, og tallet er åtte krasj på elleve kjøringer blant kjegler på en parkeringsplass i gangfart. Det er ikke en dom over hvor generelle modeller ender opp; det er en måling av hvor de er, på en bane uten annen trafikk, fotgjengere, vær eller fart.

Det er også en påminnelse om hva maskinvaren allerede gjorde. Bilen kjørte openpilot, comma.ai-systemet som NHTSA åpnet etterforskning av i september for det samme kollisjonsmønsteret med stillestående kjøretøy som de undersøkte Autopilot for. openpilot kjører den Corollaen helt fint på egen hånd. Modellene konkurrerte ikke mot ingenting — de fikk overta rattet i en bil som allerede hadde et kjøresystem i seg, og gjorde stort sett en dårligere jobb.

Hva det betyr i Europa

Ingenting endrer seg i en europeisk bil denne uken, men testen kommer midt i en diskusjon europeiske tilsynsmyndigheter aktivt fører.

Argumentet Tesla og andre legger frem for EU-myndigheter, er at et trent, kjørespesifikt nettverk kan revideres på en måte en generell modell ikke kan: Du kan beskrive feilmodusene, versjonere det og teste det mot en scenariokatalog. TCMVs håndtering av den nederlandske forespørselen etter artikkel 39 — en diskusjon i oktober, en avstemning tidligst i desember — er en prosess bygget rundt nettopp den typen dokumentasjon.

DrivingBench viser hvorfor skillet trekkes der det gjør. En modell som finner opp en regel om kjeglefarger etter å ha fått beskjed om at regelen ikke finnes, viser feilmodusen typegodkjenning håndterer dårligst: ikke en sansefeil, men en selvsikker feilslutning uten noe som fanger den opp. Europeisk godkjenning av et førerassistansesystem er et veddemål om at feilene kan listes opp. Basert på dette beviset kan generelle modellers feil det ikke ennå.