I ricercatori hanno pubblicato quello che definiscono il primo benchmark in cui modelli di IA per uso generale guidano un'auto reale, e il risultato principale è che la maggior parte di essi non è riuscita a completare un percorso tra i coni in un parcheggio.
Il test
DrivingBench, pubblicato su arXiv il 30 settembre 2026 da Aditya Ramabadran, Simon Mahns e Tobias Gessler, ha messo quattro modelli vision-language di frontiera al comando di una Toyota Corolla del 2022 dotata di hardware comma con openpilot. Ai modelli sono stati forniti tre strumenti: uno per vedere i fotogrammi delle telecamere e la telemetria dell'auto, uno per comandare sterzo e velocità e uno per fermarsi.
Il tracciato era un breve percorso da punto a punto attraverso un parcheggio, delimitato da piccoli coni, con tratti rettilinei, curve, svolte a sinistra e a destra e un'area di arrivo segnalata. Le velocità sono rimaste basse per tutta la durata della prova.
Una scelta progettuale rende il compito più difficile di quanto sembri. L'auto continua a muoversi mentre il modello elabora, e un nuovo comando sostituisce quello ancora in esecuzione. La latenza di inferenza fa parte del compito anziché essere nascosta dal sistema di test: il modello deve osservare, agire, accorgersi di aver sbagliato e recuperare, il tutto mentre l'auto è in movimento.
I risultati
| Modello | Esito |
|---|---|
| GPT-6 Astra | Ha completato il percorso, al secondo tentativo |
| Claude Fable 5.1 | Non ha concluso il percorso |
| GPT-5.6 Sol | Non ha concluso il percorso |
| Grok 4.6 | Non ha concluso il percorso |
Ogni modello ha avuto fino a tre tentativi in un'unica conversazione, nel sistema del rispettivo fornitore — Codex, Claude Code e Cursor. Astra è stato l'unico a completare il percorso e gli autori osservano che nessun altro tentativo ha superato il 50% del tracciato. Delle 11 prove, otto si sono concluse con un incidente e otto non sono riuscite a superare l'11% del percorso, fallendo alla prima curva.
I singoli fallimenti sono più istruttivi del conteggio. Grok ha interpretato uno spazio tra i coni come un varco e lo ha attraversato dopo due comandi. Un modello GPT ha inventato una regola sul significato dei colori dei coni e ha agito di conseguenza, nonostante fosse stato esplicitamente avvertito del contrario. Diversi modelli semplicemente non hanno sterzato abbastanza. L'esecuzione riuscita di Astra è costata $7,74 in inferenza, circa quattro volte i precedenti tentativi che avevano raggiunto metà percorso.
Il riepilogo degli autori è che i modelli di frontiera «francamente, non sono bravi in questo».
Perché questa è una storia Tesla
Perché è la condizione di controllo per una discussione che le persone stanno avendo su FSD da due anni.
La tesi di Tesla è che la guida richieda una rete end-to-end progettata appositamente e addestrata alla guida, eseguita nell'auto alla frequenza dei fotogrammi delle telecamere. La tesi contraria implicita — secondo cui i modelli multimodali generali stanno diventando abbastanza validi da rendere transitorio uno stack specifico per la guida — ora ha un numero associato: otto incidenti in undici prove tra i coni in un parcheggio a passo d'uomo. Non è un verdetto su dove arriveranno i modelli generali; è una misurazione di dove si trovano oggi, su un percorso senza altro traffico, pedoni, condizioni meteorologiche o velocità.
È anche un promemoria di ciò che l'hardware stava già facendo. L'auto utilizzava openpilot, il sistema di comma.ai sul quale la NHTSA ha aperto a settembre un'indagine per lo stesso schema di incidenti contro veicoli fermi già esaminato per Autopilot. openpilot guida quella Corolla perfettamente bene da solo. I modelli non stavano competendo con il nulla — ricevevano il volante di un'auto che aveva già al suo interno un sistema di guida, e nella maggior parte dei casi facevano peggio.
Cosa significa in Europa
Questa settimana non cambia nulla in un'auto europea, ma il benchmark arriva nel mezzo di una discussione che le autorità di regolamentazione europee stanno affrontando attivamente.
La tesi che Tesla e altri presentano alle autorità dell'UE è che una rete addestrata e specifica per la guida sia verificabile in un modo in cui un modello per uso generale non lo è: se ne possono caratterizzare le modalità di guasto, versionarla e testarla rispetto a un catalogo di scenari. La gestione da parte del TCMV della richiesta olandese ai sensi dell'Articolo 39 — una discussione a ottobre, un voto non prima di dicembre — è un processo costruito esattamente attorno a quel tipo di documentazione.
DrivingBench mostra perché la distinzione viene tracciata in quel punto. Un modello che inventa una regola sui colori dei coni dopo che gli è stato detto che tale regola non esiste sta dimostrando il tipo di modalità di guasto che l'omologazione gestisce peggio: non un errore di rilevamento, ma un'inferenza errata formulata con sicurezza, senza nulla che la intercetti. L'approvazione europea di un sistema di assistenza alla guida è una scommessa sul fatto che i suoi errori siano enumerabili. In base a queste evidenze, gli errori dei modelli generali non lo sono ancora.