DrivingBench: modely blíží ovládání vozidel pomalu

Článek

DrivingBench: modely blíží ovládání vozidel pomalu

Projekt DrivingBench testoval, zda pokročilé jazykové modely jako GPT-6 Astra, Grok 4.6 a Claude Fable 5.1 dokážou ovládat Toyota Corollu na parkovišti. Studie ukazuje částečný pokrok, ale zdůrazňuje vysoké výpočetní náklady a naléhavou potřebu práce na bezpečnosti a dalším ověření.

Doba čtení: 2 Minuty
Sledovat na Google

GPT-6 Astra byl jediným modelem, který dokončil test na skutečném parkovišti. Za pět minut ujel necelých 152 metrů průměrnou rychlostí přibližně 1,5 km/h a spotřeboval 6,6 milionu tokenů v hodnotě 7,74 USD. Tým výzkumníků odhadl, že to představuje zhruba pětisetnásobek nákladů na palivo potřebné k překonání stejné vzdálenosti.

Jde o hlavní zjištění projektu DrivingBench, který vedli tři počítačoví vědci a v němž testovali schopnost pokročilých jazykových modelů ovládat Toyotu Corollu na parkovišti. Tým hodnotil modely GPT-6 Astra od OpenAI, Grok 4.6 (xAI/SpaceX AI) a Claude Fable 5.1 od Anthropic. Příkazy směřoval do řídicích systémů Corolly prostřednictvím jednotky comma four. Modely vydávaly povely k jízdě na základě GPS, údajů z odometrie a dat o úhlu natočení kol, většina pokusů však skončila ještě před první zatáčkou.

Selhání vnímání a chování modelů

Výzkumníci rozsáhlá selhání připisují nedostatkům ve vnímání okolí. „Obecně byla selhání způsobena nedostatky ve vnímání prostředí, zejména při určování, na které straně první šikmé řady dopravních kuželů se nacházela trasa,“ napsali.

Grok 4.6 po jednom z prvních pokusů ve vlastní analýze uvedl: „Auto je širší, než ukazuje kamera. Cesta vpřed nebyla rovná a otevřená a vozidlo mířilo k truhlíku, zdi nebo červenému kuželu.“

Pouze GPT-6 Astra dokázal testovací okruh úspěšně absolvovat, a to až při druhém pokusu. Dokončená jízda byla pomalá a opatrná; výzkumníci zdůraznili, že úspěchu bylo dosaženo při velmi nízké rychlosti a za vysokých výpočetních nákladů.

Některé modely z bezpečnostních důvodů odmítly převzít řízení. Tým uvedl: „Některé modely (zejména GPT-6 Astra) se někdy z bezpečnostních důvodů odmítly ujmout řízení skutečného vozidla, přestože bylo parkoviště jinak prázdné a byla zavedena bezpečnostní opatření, jako velmi nízký rychlostní limit a přítomnost osoby připravené brzdit.“

Výzkumníci rozsáhle experimentovali s různými variantami promptů, aby modely povzbudili k plynulé jízdě. Někdy úkol popisovali jako simulaci, avšak při pokusech, v nichž modely dostávaly snímky ze skutečného prostředí, systémy často rozpoznaly realitu a odmítly pokračovat.

Studie ukazuje, že přední modely se při velmi nízkých rychlostech přibližují schopnosti ovládat skutečná vozidla, zároveň však zdůrazňuje bezprostřední potřebu další práce na bezpečnosti, sladění a robustním hodnocení.

Podrobnosti o komunikaci, citované odpovědi modelů i údaje o tokenech a nákladech pocházejí ze zprávy DrivingBench. Tým zdůrazňuje, že úspěchy byly omezené, většina jízd skončila záhy neúspěchem a než bude možné tento přístup považovat za praktický, bude zapotřebí dalšího technického vývoje a bezpečnostního přezkumu.

Napsat komentář

Komentáře

Zatím žádné komentáře. Buďte první.