Badacze opublikowali, jak twierdzą, pierwszy benchmark, w którym uniwersalne modele AI prowadzą prawdziwy samochód, a najważniejszy wynik jest taki, że większość z nich nie potrafiła pokonać trasy z pachołkami na parkingu.
Test
DrivingBench, opublikowany na arXiv 30 września 2026 r. przez Adityę Ramabadrana, Simona Mahnsa i Tobiasa Gesslera, oddał cztery najnowocześniejsze modele wizualno-językowe za kierownicę Toyoty Corolli z 2022 r. wyposażonej w sprzęt comma i działającej na openpilot. Modelom udostępniono trzy narzędzia: jedno do oglądania klatek z kamer samochodu i telemetrii, jedno do wydawania poleceń dotyczących skrętu i prędkości oraz jedno do zatrzymania pojazdu.
Trasa była krótkim przejazdem od punktu do punktu przez parking, wytyczonym małymi pachołkami, z prostymi odcinkami, łukami, lewymi i prawymi zakrętami oraz oznaczonym obszarem mety. Prędkości przez cały czas były niskie.
Jedna decyzja projektowa sprawia, że zadanie jest trudniejsze, niż brzmi. Samochód nadal jedzie, gdy model rozumuje, a nowe polecenie zastępuje to, które wciąż jest wykonywane. Opóźnienie inferencji jest częścią zadania, a nie czymś ukrywanym przez środowisko testowe: model musi obserwować, działać, zauważyć, że się pomylił, i skorygować sytuację, podczas gdy samochód jest w ruchu.
Wyniki
| Model | Wynik |
|---|---|
| GPT-6 Astra | Ukończył trasę za drugim podejściem |
| Claude Fable 5.1 | Nie ukończył trasy |
| GPT-5.6 Sol | Nie ukończył trasy |
| Grok 4.6 | Nie ukończył trasy |
Każdy model otrzymał do trzech prób w jednej rozmowie, w środowisku własnego dostawcy — Codex, Claude Code i Cursor. Astra był jedynym, który ukończył trasę, a autorzy zauważają, że żadna inna próba nie przekroczyła 50% trasy. Spośród 11 przejazdów osiem zakończyło się kraksą, a osiem nie pokonało 11% trasy, rozpadając się na pierwszym łuku.
Poszczególne porażki mówią więcej niż sam bilans. Grok odczytał przerwę między pachołkami jako bramkę i przejechał przez nią po dwóch poleceniach. Jeden model GPT wymyślił regułę dotyczącą znaczenia kolorów pachołków i działał zgodnie z nią, mimo że wyraźnie go przed tym ostrzeżono. Kilka modeli po prostu nie skręciło wystarczająco mocno. Udany przejazd Astry kosztował $7,74 za inferencję, około cztery razy więcej niż wcześniejsze próby pokonania połowy trasy.
Podsumowanie autorów brzmi: modele z czołówki są „szczerze mówiąc, kiepskie w tym”.
Dlaczego to historia o Tesli
Ponieważ stanowi warunek kontrolny dla dyskusji, którą ludzie prowadzą o FSD od dwóch lat.
Teza Tesli jest taka, że jazda wymaga stworzonej do tego kompleksowej sieci trenowanej na danych z jazdy, działającej w samochodzie z częstotliwością klatek kamery. Dorozumiana kontrteza — że uniwersalne modele multimodalne stają się wystarczająco dobre, by stos technologiczny specyficzny dla jazdy był jedynie rozwiązaniem przejściowym — ma teraz przypisaną liczbę: osiem kraks w jedenastu przejazdach między pachołkami na parkingu, w tempie marszu. Nie jest to werdykt dotyczący tego, dokąd dotrą uniwersalne modele; to pomiar tego, gdzie są obecnie, na trasie bez innego ruchu, pieszych, pogody i prędkości.
To również przypomnienie, co sprzęt robił już wcześniej. Samochód działał na openpilot, systemie comma.ai, w sprawie którego NHTSA wszczęła we wrześniu dochodzenie dotyczące tego samego wzorca kolizji ze stojącymi pojazdami, który badała w przypadku Autopilot. openpilot samodzielnie prowadzi tę Corollę całkiem dobrze. Modele nie konkurowały z niczym — oddano im kierownicę samochodu, który już miał w sobie system prowadzenia, a one przeważnie radziły sobie gorzej.
Co to oznacza w Europie
W europejskim samochodzie nic nie zmieni się w tym tygodniu, ale benchmark pojawia się w środku dyskusji, którą europejscy regulatorzy aktywnie prowadzą.
Argument Tesli i innych firm wobec władz UE jest taki, że wytrenowana sieć przeznaczona do jazdy podlega audytowi w sposób, w jaki nie podlega mu model ogólnego przeznaczenia: można scharakteryzować jej tryby awarii, wersjonować ją i testować względem katalogu scenariuszy. Sposób rozpatrywania przez TCMV holenderskiego wniosku na podstawie artykułu 39 — dyskusja w październiku, głosowanie nie wcześniej niż w grudniu — to proces zbudowany właśnie wokół tego rodzaju dokumentacji.
DrivingBench pokazuje, dlaczego rozróżnienie przebiega właśnie tam, gdzie przebiega. Model, który wymyśla regułę dotyczącą kolorów pachołków po tym, jak powiedziano mu, że taka reguła nie istnieje, demonstruje rodzaj trybu awarii, z którym homologacja radzi sobie najgorzej: nie błąd percepcji, lecz pewne siebie błędne wnioskowanie bez niczego, co mogłoby je wychwycić. Europejskie zatwierdzenie systemu wspomagania kierowcy jest zakładem, że jego błędy można wyliczyć. Na podstawie tych danych błędów uniwersalnych modeli jeszcze nie można.