Výzkumníci zveřejnili, podle svých slov, první benchmark, v němž univerzální AI modely řídí skutečné auto, a hlavním výsledkem je, že většina z nich nedokázala projet trasu mezi kužely na parkovišti.
Test
DrivingBench, který 30. září 2026 zveřejnili na arXivu Aditya Ramabadran, Simon Mahns a Tobias Gessler, svěřil čtyřem špičkovým modelům vision-language řízení Toyoty Corolla z roku 2022 vybavené hardwarem comma se systémem openpilot. Modely dostaly tři nástroje: jeden pro zobrazení snímků z kamer a telemetrie vozu, jeden pro ovládání řízení a rychlosti a jeden pro zastavení.
Trasa byla krátká cesta z bodu do bodu přes parkoviště, vyznačená malými kužely, s rovnými úseky, zatáčkami, levými a pravými odbočeními a označeným cílovým prostorem. Rychlosti byly po celou dobu nízké.
Jedno konstrukční rozhodnutí z ní dělá obtížnější úkol, než se zdá. Auto se pohybuje dál, zatímco model přemýšlí, a nový příkaz nahradí ten, který se ještě vykonává. Latence inference je součástí úkolu, nikoli něco, co by testovací prostředí skrývalo: model musí pozorovat, jednat, všimnout si, že se spletl, a vzpamatovat se, zatímco auto jede.
Výsledky
| Model | Výsledek |
|---|---|
| GPT-6 Astra | Dokončil trasu při druhém pokusu |
| Claude Fable 5.1 | Nedokončil |
| GPT-5.6 Sol | Nedokončil |
| Grok 4.6 | Nedokončil |
Každý model dostal až tři pokusy v jediné konverzaci, ve vlastním prostředí svého dodavatele — Codex, Claude Code a Cursor. Astra byla jediným modelem, který trasu dokončil, a autoři uvádějí, že žádný jiný pokus nepřekonal 50 % trasy. Z 11 jízd jich osm skončilo havárií a osm nedokázalo projet ani 11 % trasy, protože selhaly v první zatáčce.
Jednotlivá selhání jsou poučnější než celkový součet. Grok vyhodnotil mezeru mezi kužely jako bránu a po dvou příkazech jí projel. Jeden model GPT si vymyslel pravidlo o významu barev kuželů a řídil se jím, přestože byl výslovně varován, že nic takového neplatí. Několik modelů jednoduše nezatočilo dostatečně. Úspěšná jízda Astry stála $7,74 za inferenci, zhruba čtyřikrát více než dřívější pokusy, které zvládly polovinu trasy.
Shrnutí autorů zní, že špičkové modely jsou „upřímně řečeno, v tomhle špatné“.
Proč je to příběh o Tesle
Protože jde o kontrolní podmínku pro debatu, kterou lidé o FSD vedou už dva roky.
Tesla tvrdí, že řízení vyžaduje účelově vytvořenou end-to-end síť vycvičenou pro řízení, běžící ve voze rychlostí snímků kamer. Naznačený protiargument — že univerzální multimodální modely se zlepšují natolik, že specializovaný systém pro řízení je jen přechodným řešením — nyní dostal číslo, a tím číslem je osm havárií v jedenácti jízdách mezi kužely na parkovišti při rychlosti chůze. Není to verdikt o tom, kam se univerzální modely nakonec dostanou; je to měření toho, kde jsou nyní, na trase bez dalšího provozu, chodců, počasí a rychlosti.
Je to také připomínka toho, co už hardware dělal. Vůz používal openpilot, systém comma.ai, kvůli němuž NHTSA v září zahájila vyšetřování pro stejný vzorec nehod se stojícím vozidlem, jaký vyšetřovala u Autopilotu. openpilot řídí tuto Corollu sám o sobě velmi dobře. Modely nesoutěžily s ničím — dostaly do rukou volant auta, které už mělo vlastní systém řízení, a většinou si vedly hůře.
Co to znamená v Evropě
V evropském autě se tento týden nic nemění, benchmark však přichází uprostřed debaty, kterou evropští regulátoři aktivně vedou.
Tesla a další společnosti argumentují vůči orgánům EU tím, že vycvičená síť určená specificky pro řízení je auditovatelná způsobem, jakým univerzální model není: lze charakterizovat její režimy selhání, verzovat ji a testovat vůči katalogu scénářů. Postup TCMV při vyřizování nizozemské žádosti podle článku 39 — diskuse v říjnu, hlasování nejdříve v prosinci — je proces postavený právě na takovém typu dokumentace.
DrivingBench ukazuje, proč je tato hranice stanovena právě tam. Model, který si vymyslí pravidlo o barvách kuželů poté, co mu bylo řečeno, že takové pravidlo neexistuje, předvádí typ selhání, s nímž se schvalování typu vyrovnává nejhůře: nikoli chybu snímání, ale sebejistý chybný závěr bez čehokoli, co by jej zachytilo. Evropské schválení systému asistence řidiče je sázkou na to, že jeho chyby lze vyjmenovat. Podle těchto důkazů chyby univerzálních modelů zatím vyjmenovat nelze.