Forschende haben einen nach eigener Aussage ersten Benchmark veröffentlicht, bei dem universell einsetzbare KI-Modelle ein echtes Auto fahren, und das zentrale Ergebnis lautet: Die meisten schafften nicht einmal einen Pylonenparcours auf einem Parkplatz.
Der Test
DrivingBench, am 30. September 2026 von Aditya Ramabadran, Simon Mahns und Tobias Gessler auf arXiv veröffentlicht, setzte vier Frontier-Vision-Language-Modelle ans Steuer eines Toyota Corolla von 2022, der mit comma-Hardware ausgestattet war und openpilot ausführte. Die Modelle erhielten drei Werkzeuge: eines zum Abrufen der Kamerabilder und Telemetriedaten des Fahrzeugs, eines zum Steuern von Lenkung und Geschwindigkeit und eines zum Anhalten.
Der Kurs war eine kurze Punkt-zu-Punkt-Strecke durch einen Parkplatz, mit kleinen Pylonen markiert und mit geraden Abschnitten, Kurven, Links- und Rechtsabbiegungen sowie einem markierten Zielbereich. Die Geschwindigkeiten waren durchgehend niedrig.
Eine Designentscheidung macht die Aufgabe schwieriger, als sie klingt. Das Auto fährt weiter, während das Modell nachdenkt, und ein neuer Befehl ersetzt den noch ausgeführten. Die Inferenzlatenz ist Teil der Aufgabe, statt etwas zu sein, das das Testsystem verbirgt: Das Modell muss beobachten, handeln, erkennen, dass es falsch lag, und sich korrigieren — während das Auto unterwegs ist.
Die Ergebnisse
| Modell | Ergebnis |
|---|---|
| GPT-6 Astra | Absolvierte den Kurs beim zweiten Versuch |
| Claude Fable 5.1 | Nicht beendet |
| GPT-5.6 Sol | Nicht beendet |
| Grok 4.6 | Nicht beendet |
Jedes Modell erhielt in einer einzigen Unterhaltung bis zu drei Versuche, jeweils im eigenen Testsystem seines Anbieters — Codex, Claude Code und Cursor. Astra war das einzige Modell, das den Kurs beendete, und die Autoren weisen darauf hin, dass kein anderer Versuch mehr als 50 % des Kurses schaffte. Von den 11 Fahrten endeten acht mit einem Unfall, und acht schafften nicht einmal 11 % der Strecke und scheiterten bereits in der ersten Kurve.
Die einzelnen Fehlschläge sind aufschlussreicher als die Bilanz. Grok deutete eine Lücke zwischen Pylonen als Tor und fuhr nach zwei Befehlen hindurch. Ein GPT-Modell erfand eine Regel über die Bedeutung der Pylonenfarben und handelte danach, obwohl es ausdrücklich vor dem Gegenteil gewarnt worden war. Mehrere Modelle lenkten schlicht nicht weit genug ein. Astras erfolgreiche Fahrt verursachte Inferenzkosten von $7,74, etwa viermal so viel wie die früheren Versuche, die nur die halbe Strecke schafften.
Die Zusammenfassung der Autoren lautet, dass Frontier-Modelle „offen gesagt nicht gut darin“ sind.
Warum das eine Tesla-Geschichte ist
Weil dies die Kontrollbedingung für eine Debatte ist, die Menschen seit zwei Jahren über FSD führen.
Teslas Argument lautet, dass autonomes Fahren ein speziell entwickeltes End-to-End-Netzwerk erfordert, das auf das Fahren trainiert wurde und im Auto mit der Bildrate der Kameras läuft. Das implizite Gegenargument — dass allgemeine multimodale Modelle gut genug werden, um einen fahrspezifischen Stack zu einer Übergangslösung zu machen — ist nun mit einer Zahl versehen, und diese Zahl lautet: acht Unfälle in elf Fahrten zwischen Pylonen auf einem Parkplatz bei Schritttempo. Das ist kein Urteil darüber, wo allgemeine Modelle letztlich landen werden; es ist eine Messung ihres aktuellen Stands auf einem Kurs ohne anderen Verkehr, Fußgänger, Wetter oder Geschwindigkeit.
Es erinnert auch daran, was die Hardware bereits leistete. Das Auto nutzte openpilot, das comma.ai-System, zu dem die NHTSA im September eine Untersuchung wegen desselben Unfallmusters mit stehenden Fahrzeugen eröffnete, das sie auch bei Autopilot untersucht hatte. openpilot fährt diesen Corolla allein problemlos. Die Modelle traten nicht gegen nichts an — ihnen wurde das Lenkrad eines Autos übergeben, das bereits ein Fahrsystem besaß, und meist schnitten sie schlechter ab.
Was das in Europa bedeutet
Diese Woche ändert sich in einem europäischen Auto nichts, doch der Benchmark erscheint mitten in einer Debatte, die europäische Regulierungsbehörden aktiv führen.
Tesla und andere vertreten gegenüber EU-Behörden die Auffassung, dass ein trainiertes, fahrspezifisches Netzwerk auf eine Weise prüfbar ist, wie es ein universell einsetzbares Modell nicht ist: Seine Fehlermodi lassen sich charakterisieren, versionieren und anhand eines Szenariokatalogs testen. Der Umgang des TCMV mit dem niederländischen Antrag nach Artikel 39 — eine Diskussion im Oktober, eine Abstimmung frühestens im Dezember — ist ein Prozess, der genau auf dieser Art von Dokumentation beruht.
DrivingBench zeigt, warum diese Unterscheidung genau dort gezogen wird. Ein Modell, das eine Regel über Pylonenfarben erfindet, nachdem ihm gesagt wurde, dass diese Regel nicht existiert, demonstriert den Fehlermodus, den die Typgenehmigung am schlechtesten bewältigt: keinen Wahrnehmungsfehler, sondern eine selbstsichere falsche Schlussfolgerung ohne etwas, das sie auffängt. Die europäische Zulassung eines Fahrerassistenzsystems ist eine Wette darauf, dass dessen Fehler aufzählbar sind. Nach diesen Ergebnissen sind es die Fehler allgemeiner Modelle noch nicht.