Onderzoekers hebben naar eigen zeggen de eerste benchmark gepubliceerd waarin algemene AI-modellen een echte auto besturen, en de belangrijkste uitkomst is dat de meeste niet rond een parcours met pylonen op een parkeerterrein kwamen.
De test
DrivingBench, op 30 september 2026 op arXiv geplaatst door Aditya Ramabadran, Simon Mahns en Tobias Gessler, zette vier geavanceerde vision-language-modellen aan het stuur van een Toyota Corolla uit 2022, uitgerust met comma-hardware waarop openpilot draaide. De modellen kregen drie tools: één om de camerabeelden en telemetrie van de auto te zien, één om stuurhoek en snelheid aan te sturen, en één om te stoppen.
Het parcours was een korte route van punt naar punt over een parkeerterrein, gemarkeerd met kleine pylonen, met rechte stukken, bochten, afslagen naar links en rechts en een gemarkeerd finishgebied. De snelheden bleven overal laag.
Eén ontwerpkeuze maakt het moeilijker dan het klinkt. De auto blijft rijden terwijl het model nadenkt, en een nieuw commando vervangt het commando dat nog wordt uitgevoerd. Inferentievertraging maakt deel uit van de taak, in plaats van iets dat de testopstelling verbergt: het model moet observeren, handelen, merken dat het fout zat en herstellen, terwijl de auto rijdt.
De resultaten
| Model | Uitkomst |
|---|---|
| GPT-6 Astra | Voltooide het parcours, bij zijn tweede poging |
| Claude Fable 5.1 | Finishte niet |
| GPT-5.6 Sol | Finishte niet |
| Grok 4.6 | Finishte niet |
Elk model kreeg maximaal drie pogingen in één gesprek, in de eigen testomgeving van de leverancier — Codex, Claude Code en Cursor. Astra was de enige die finishte, en de auteurs merken op dat geen enkele andere poging meer dan 50% van het parcours aflegde. Van de 11 ritten eindigden er acht in een crash, en acht slaagden er niet in 11% van de route af te leggen; ze gingen al mis bij de eerste bocht.
De afzonderlijke mislukkingen zijn leerzamer dan de totaalscore. Grok las een opening tussen pylonen als een poort en reed er na twee commando's doorheen. Eén GPT-model verzon een regel over de betekenis van de kleuren van de pylonen en handelde ernaar, hoewel het expliciet anders was gewaarschuwd. Verschillende modellen stuurden eenvoudigweg niet ver genoeg. Astra's succesvolle rit kostte $7,74 aan inferentie, ongeveer vier keer zoveel als de eerdere pogingen die de helft van het parcours haalden.
De samenvatting van de auteurs is dat geavanceerde modellen "eerlijk gezegd niet goed hierin" zijn.
Waarom dit een Tesla-verhaal is
Omdat dit de controlegroep is voor een discussie die mensen al twee jaar over FSD voeren.
Tesla stelt dat autorijden een speciaal gebouwd end-to-end-netwerk vereist, getraind op rijden en in de auto draaiend op de framerate van de camera. Het impliciete tegenargument — dat algemene multimodale modellen goed genoeg worden om een rijspecifieke stack slechts tijdelijk relevant te maken — heeft nu een cijfer gekregen, en dat cijfer is acht crashes in elf ritten tussen pylonen op een parkeerterrein, op wandelsnelheid. Dat is geen oordeel over waar algemene modellen uiteindelijk terechtkomen; het is een meting van waar ze nu staan, op een parcours zonder ander verkeer, voetgangers, weer of snelheid.
Het herinnert ook aan wat de hardware al deed. De auto draaide op openpilot, het comma.ai-systeem waar de NHTSA in september een onderzoek naar opende vanwege hetzelfde crashpatroon met stilstaande voertuigen waarvoor het Autopilot onderzocht. openpilot rijdt die Corolla zelfstandig prima. De modellen concurreerden niet met niets — ze kregen het stuur van een auto die al een rijsysteem had, en deden het meestal slechter.
Wat het in Europa betekent
Deze week verandert er niets in een Europese auto, maar de benchmark verschijnt midden in een discussie die Europese toezichthouders actief voeren.
Tesla en anderen stellen tegenover EU-autoriteiten dat een getraind, rijspecifiek netwerk controleerbaar is op een manier waarop een algemeen model dat niet is: je kunt de faalmodi ervan karakteriseren, er versies van beheren en het testen tegen een catalogus van scenario's. De behandeling door de TCMV van het Nederlandse verzoek onder Artikel 39 — een bespreking in oktober, een stemming niet eerder dan december — is een proces dat precies rond dat soort documentatie is opgebouwd.
DrivingBench laat zien waarom het onderscheid daar wordt gemaakt. Een model dat een regel over de kleuren van pylonen verzint nadat het te horen heeft gekregen dat die regel niet bestaat, toont het type faalmodus waarmee typegoedkeuring het slechtst omgaat: geen waarnemingsfout, maar een zelfverzekerde onjuiste gevolgtrekking zonder iets dat die opvangt. Europese goedkeuring van een rijhulpsysteem is een gok dat de fouten ervan te inventariseren zijn. Op basis van dit bewijs zijn de fouten van algemene modellen dat nog niet.