Forskare har publicerat vad de säger är det första riktmärket där generella AI-modeller kör en riktig bil, och huvudresultatet är att de flesta av dem inte kunde ta sig runt en konbana på en parkeringsplats.
Testet
DrivingBench, upplagt på arXiv den 30 september 2026 av Aditya Ramabadran, Simon Mahns och Tobias Gessler, lät fyra syn- och språkmodeller i framkant styra en Toyota Corolla från 2022 utrustad med comma-hårdvara som kör openpilot. Modellerna fick tre verktyg: ett för att se bilens kamerabilder och telemetri, ett för att styra ratt och hastighet samt ett för att stanna.
Banan var en kort rutt från punkt till punkt genom en parkeringsplats, utmärkt med små koner, med raka sträckor, kurvor, vänster- och högersvängar samt ett markerat målområde. Hastigheterna var låga hela tiden.
Ett konstruktionsbeslut gör uppgiften svårare än den låter. Bilen fortsätter röra sig medan modellen tänker, och ett nytt kommando ersätter det som fortfarande körs. Fördröjning vid inferens är en del av uppgiften snarare än något testmiljön döljer: modellen måste observera, agera, märka att den hade fel och återhämta sig, allt medan bilen färdas.
Resultaten
| Modell | Resultat |
|---|---|
| GPT-6 Astra | Slutförde banan, på sitt andra försök |
| Claude Fable 5.1 | Slutförde inte |
| GPT-5.6 Sol | Slutförde inte |
| Grok 4.6 | Slutförde inte |
Varje modell fick upp till tre försök i en enda konversation, i sin leverantörs egen miljö — Codex, Claude Code och Cursor. Astra var den enda som slutförde banan, och författarna noterar att inget annat försök tog sig längre än 50 % av banan. Av de 11 körningarna slutade åtta i en krasch, och åtta lyckades inte klara 11 % av rutten utan föll samman i den första kurvan.
De enskilda misslyckandena lär mer än sammanräkningen. Grok tolkade ett mellanrum mellan koner som en port och körde genom det efter två kommandon. En GPT-modell hittade på en regel om vad konernas färger betydde och agerade utifrån den, trots att den uttryckligen hade varnatts för motsatsen. Flera svängde helt enkelt inte tillräckligt mycket. Astras lyckade körning kostade $7,74 i inferens, ungefär fyra gånger mer än de tidigare försöken som nådde halva banan.
Författarnas sammanfattning är att modeller i framkant är ”ärligt talat inte bra på detta”.
Varför detta är en Tesla-historia
Eftersom det är kontrollvillkoret för en diskussion som människor har haft om FSD i två år.
Teslas argument är att körning kräver ett specialbyggt nätverk från början till slut, tränat för körning och kört i bilens kamerabildehastighet. Motargumentet som antyds — att generella multimodala modeller blir tillräckligt bra för att göra en körspecifik stack till en övergångslösning — har nu fått en siffra kopplad till sig, och siffran är åtta krascher på elva körningar bland koner på en parkeringsplats i gångfart. Det är inte ett omdöme om var generella modeller hamnar; det är en mätning av var de befinner sig, på en bana utan annan trafik, fotgängare, väder eller fart.
Det är också en påminnelse om vad hårdvaran redan gjorde. Bilen körde openpilot, comma.ai-systemet som NHTSA inledde en utredning om i september på grund av samma mönster av kollisioner med stillastående fordon som myndigheten utredde Autopilot för. openpilot kör den Corollan alldeles utmärkt på egen hand. Modellerna konkurrerade inte med ingenting — de fick ratten i en bil som redan hade ett körsystem i sig, och presterade för det mesta sämre.
Vad det innebär i Europa
Ingenting förändras i en europeisk bil den här veckan, men riktmärket landar mitt i en diskussion som europeiska tillsynsmyndigheter aktivt för.
Argumentet som Tesla och andra framför till EU-myndigheter är att ett tränat, körspecifikt nätverk går att granska på ett sätt som en generell modell inte gör: du kan kartlägga dess felmoder, versionshantera det och testa det mot en scenariokatalog. TCMV:s hantering av den nederländska begäran enligt artikel 39 — en diskussion i oktober, en omröstning tidigast i december — är en process uppbyggd kring just den typen av dokumentation.
DrivingBench visar varför gränsen dras där den gör. En modell som hittar på en regel om konernas färger efter att ha fått höra att regeln inte finns visar den typ av felmod som typgodkännande hanterar sämst: inte ett avkänningsfel, utan en självsäker felaktig slutsats utan något som fångar upp den. Europeiskt godkännande av ett förarassistanssystem är ett vad om att dess misstag går att räkna upp. Enligt detta underlag gör generella modellers misstag det ännu inte.