Výskumníci zverejnili to, čo označujú za prvý benchmark, v ktorom univerzálne modely AI riadia skutočné auto, a hlavný výsledok je, že väčšina z nich nedokázala prejsť trať z kužeľov na parkovisku.
Test
DrivingBench, ktorý 30. septembra 2026 zverejnili na arXiv Aditya Ramabadran, Simon Mahns a Tobias Gessler, poveril štyri špičkové modely videnia a jazyka riadením Toyoty Corolla z roku 2022 vybavenej hardvérom comma so systémom openpilot. Modely dostali tri nástroje: jeden na zobrazenie snímok z kamier auta a telemetrie, jeden na ovládanie riadenia a rýchlosti a jeden na zastavenie.
Trať predstavovala krátku trasu medzi dvoma bodmi cez parkovisko, vyznačenú malými kužeľmi, s rovnými úsekmi, zákrutami, odbočeniami doľava aj doprava a vyznačenou cieľovou zónou. Rýchlosti boli počas celého testu nízke.
Jedno rozhodnutie pri návrhu robí úlohu náročnejšou, než znie. Auto sa pohybuje aj počas premýšľania modelu a nový príkaz nahradí ten, ktorý sa ešte vykonáva. Latencia inferencie je súčasťou úlohy, nie niečím, čo testovací rámec skrýva: model musí pozorovať, konať, všimnúť si, že sa mýlil, a zotaviť sa, pričom auto je stále v pohybe.
Výsledky
| Model | Výsledok |
|---|---|
| GPT-6 Astra | Dokončil trať na druhý pokus |
| Claude Fable 5.1 | Nedokončil |
| GPT-5.6 Sol | Nedokončil |
| Grok 4.6 | Nedokončil |
Každý model dostal až tri pokusy v jednej konverzácii, vo vlastnom testovacom prostredí svojho dodávateľa — Codex, Claude Code a Cursor. Astra bol jediný, kto trať dokončil, a autori uvádzajú, že žiadny ďalší pokus neprešiel viac než 50% trate. Z 11 jázd sa osem skončilo haváriou a osem nezvládlo ani 11% trasy, keď zlyhali v prvej zákrute.
Jednotlivé zlyhania sú poučnejšie než samotný súčet. Grok vyhodnotil medzeru medzi kužeľmi ako bránu a po dvoch príkazoch cez ňu prešiel. Jeden model GPT si vymyslel pravidlo o význame farieb kužeľov a konal podľa neho, hoci bol výslovne upozornený na opak. Viaceré jednoducho nezatočili dostatočne. Úspešná jazda modelu Astra stála $7,74 na inferencii, približne štyrikrát viac než skoršie pokusy, ktoré prešli polovicu trate.
Zhrnutie autorov znie, že špičkové modely „v tomto úprimne povedané nie sú dobré“.
Prečo je to príbeh o Tesle
Pretože ide o kontrolnú podmienku pre spor, ktorý ľudia vedú o FSD už dva roky.
Tesla tvrdí, že riadenie potrebuje účelovo vytvorenú end-to-end sieť trénovanú na jazdu, bežiacu v aute rýchlosťou snímok z kamier. Naznačený opačný argument — že všeobecné multimodálne modely sú už dosť dobré na to, aby sa špecifický systém pre riadenie stal len prechodným riešením — má teraz priradené číslo a tým číslom je osem havárií v jedenástich jazdách medzi kužeľmi na parkovisku pri rýchlosti chôdze. Nie je to verdikt o tom, kam sa všeobecné modely napokon dostanú; je to meranie toho, kde sú teraz, na trati bez inej premávky, chodcov, počasia a rýchlosti.
Je to aj pripomienka toho, čo už robil hardvér. Auto používalo openpilot, systém comma.ai, voči ktorému NHTSA v septembri začala vyšetrovanie pre rovnaký vzorec nehôd so stojacimi vozidlami, aký skúmala pri Autopilote. openpilot riadi túto Corollu celkom dobre aj sám. Modely nesúťažili s ničím — dostali do rúk volant auta, ktoré už malo vlastný systém riadenia, a väčšinou si viedli horšie.
Čo to znamená v Európe
V európskom aute sa tento týždeň nič nemení, benchmark však prichádza uprostred sporu, ktorý európski regulátori aktívne vedú.
Tesla a ďalší pred orgánmi EÚ argumentujú, že trénovaná sieť špecifická pre riadenie je auditovateľná spôsobom, akým univerzálny model nie je: možno charakterizovať jej režimy zlyhania, verziovať ju a testovať ju podľa katalógu scenárov. Postup TCMV pri holandskej žiadosti podľa článku 39 — diskusia v októbri, hlasovanie najskôr v decembri — je proces postavený presne na takomto druhu dokumentácie.
DrivingBench ukazuje, prečo sa toto rozlíšenie vedie práve takto. Model, ktorý si vymyslí pravidlo o farbách kužeľov po tom, ako mu bolo povedané, že také pravidlo neexistuje, demonštruje typ zlyhania, s ktorým typové schválenie pracuje najhoršie: nie chybu snímania, ale sebavedomý nesprávny záver bez ničoho, čo by ho zachytilo. Európske schválenie systému asistencie vodiča je stávkou na to, že jeho chyby sú vymenovateľné. Podľa týchto dôkazov chyby všeobecných modelov zatiaľ nie sú.