Des chercheurs ont publié ce qu’ils présentent comme le premier benchmark dans lequel des modèles d’IA généralistes conduisent une vraie voiture, et le résultat principal est que la plupart n’ont pas réussi à terminer un parcours de cônes dans un parking.
Le test
DrivingBench, mis en ligne sur arXiv le 30 septembre 2026 par Aditya Ramabadran, Simon Mahns et Tobias Gessler, a confié les commandes à quatre modèles vision-langage de pointe dans une Toyota Corolla de 2022 équipée de matériel comma utilisant openpilot. Les modèles disposaient de trois outils : l’un pour voir les images des caméras et la télémétrie de la voiture, l’un pour commander la direction et la vitesse, et l’autre pour s’arrêter.
Le parcours était un court itinéraire de point à point dans un parking, balisé par de petits cônes, avec des lignes droites, des virages, des tournants à gauche et à droite ainsi qu’une zone d’arrivée marquée. Les vitesses sont restées faibles tout au long des essais.
Un choix de conception rend l’exercice plus difficile qu’il n’y paraît. La voiture continue de rouler pendant que le modèle réfléchit, et une nouvelle commande remplace celle qui est encore en cours. La latence d’inférence fait partie de la tâche plutôt que d’être masquée par le banc d’essai : le modèle doit observer, agir, constater qu’il s’est trompé et se rétablir, pendant que la voiture avance.
Les résultats
| Modèle | Résultat |
|---|---|
| GPT-6 Astra | A terminé le parcours, lors de sa deuxième tentative |
| Claude Fable 5.1 | N’a pas terminé |
| GPT-5.6 Sol | N’a pas terminé |
| Grok 4.6 | N’a pas terminé |
Chaque modèle a bénéficié de jusqu’à trois tentatives dans une seule conversation, dans l’environnement propre à son fournisseur — Codex, Claude Code et Cursor. Astra a été le seul à terminer, et les auteurs soulignent que toutes les autres tentatives sont restées sous les 50 % du parcours. Sur les 11 essais, huit se sont terminés par un accident, et huit n’ont pas dépassé 11 % de l’itinéraire, échouant dès le premier virage.
Les échecs individuels sont plus instructifs que le décompte. Grok a interprété un espace entre deux cônes comme un portail et l’a traversé après deux commandes. Un modèle GPT a inventé une règle sur la signification des couleurs des cônes et a agi en conséquence, bien qu’il ait été explicitement averti du contraire. Plusieurs n’ont tout simplement pas assez braqué. L’essai réussi d’Astra a coûté $7,74 en inférence, soit environ quatre fois plus que les précédentes tentatives ayant atteint la moitié du parcours.
Les auteurs résument ainsi la situation : les modèles de pointe ne sont « franchement pas bons pour ça ».
Pourquoi c’est une histoire Tesla
Parce qu’il s’agit de la condition de contrôle d’un débat que les gens ont sur FSD depuis deux ans.
La position de Tesla est que la conduite nécessite un réseau de bout en bout conçu spécifiquement à cette fin, entraîné à la conduite et fonctionnant à la cadence des images des caméras dans la voiture. La position contraire implicite — selon laquelle les modèles multimodaux généralistes deviennent suffisamment performants pour qu’une pile logicielle spécifique à la conduite ne soit qu’une étape transitoire — est désormais assortie d’un chiffre : huit accidents en onze essais sur des cônes dans un parking, à vitesse de marche. Ce n’est pas un verdict sur le niveau qu’atteindront les modèles généralistes ; c’est une mesure de leur niveau actuel, sur un parcours sans autre circulation, sans piétons, sans météo et sans vitesse.
C’est aussi un rappel de ce que le matériel faisait déjà. La voiture utilisait openpilot, le système de comma.ai sur lequel la NHTSA a ouvert une enquête en septembre pour le même schéma d’accidents impliquant des véhicules à l’arrêt qu’elle avait étudié pour Autopilot. openpilot conduit très bien cette Corolla tout seul. Les modèles ne rivalisaient pas avec l’absence de système — on leur confiait le volant d’une voiture qui disposait déjà d’un système de conduite, et ils ont surtout fait pire.
Ce que cela signifie en Europe
Rien ne change cette semaine dans une voiture européenne, mais ce benchmark arrive au cœur d’un débat que les régulateurs européens mènent activement.
L’argument avancé par Tesla et d’autres auprès des autorités de l’UE est qu’un réseau entraîné spécifiquement pour la conduite est auditable d’une manière qu’un modèle généraliste ne l’est pas : il est possible de caractériser ses modes de défaillance, de le versionner et de le tester face à un catalogue de scénarios. Le traitement par le TCMV de la demande néerlandaise au titre de l’article 39 — une discussion en octobre, un vote pas avant décembre — relève d’un processus construit autour de ce type précis de documentation.
DrivingBench montre pourquoi la distinction est établie ainsi. Un modèle qui invente une règle sur les couleurs des cônes après qu’on lui a indiqué que cette règle n’existe pas illustre le type de mode de défaillance que l’homologation gère le plus mal : non pas une erreur de perception, mais une inférence erronée formulée avec assurance, sans rien pour la détecter. L’approbation européenne d’un système d’aide à la conduite repose sur le pari que ses erreurs sont dénombrables. Au vu de ces résultats, celles des modèles généralistes ne le sont pas encore.