{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/impromptu-vla-open-weights-and-open-data-for","title":"Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models","arxiv_id":"2505.23757","date":"2025-05-29","proceeding":null,"authors":["Haohan Chi","Huan-ang Gao","Ziming Liu","Jianing Liu","Chenyu Liu","Jinwei Li","Kaisen Yang","Yangcheng Yu","Zeda Wang","Wenyi Li","Leichen Wang","Xingtao Hu","Hao Sun","Hang Zhao","Hao Zhao"],"abstract":"Vision-Language-Action (VLA) models for autonomous driving show promise but falter in unstructured corner case scenarios, largely due to a scarcity of targeted benchmarks. To address this, we introduce Impromptu VLA. Our core contribution is the Impromptu VLA Dataset: over 80,000 meticulously curated video clips, distilled from over 2M source clips sourced from 8 open-source large-scale datasets. This dataset is built upon our novel taxonomy of four challenging unstructured categories and features rich, planning-oriented question-answering annotations and action trajectories. Crucially, experiments demonstrate that VLAs trained with our dataset achieve substantial performance gains on established benchmarks--improving closed-loop NeuroNCAP scores and collision rates, and reaching near state-of-the-art L2 accuracy in open-loop nuScenes trajectory prediction. Furthermore, our Q&A suite serves as an effective diagnostic, revealing clear VLM improvements in perception, prediction, and planning. Our code, data and models are available at https://github.com/ahydchh/Impromptu-VLA.","url_abs":"https://arxiv.org/abs/2505.23757v1","url_pdf":"https://arxiv.org/pdf/2505.23757v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"impromptu-vla-open-weights-and-open-data-for","repo_url":"https://github.com/ahydchh/impromptu-vla","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"autonomous-driving","task_name":"Autonomous Driving"},{"task_slug":"diagnostic","task_name":"Diagnostic"},{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"trajectory-prediction","task_name":"Trajectory Prediction"},{"task_slug":"vision-language-action","task_name":"Vision-Language-Action"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[],"syntology":{"syntology_url":"https://syntology.ai/paper/2505.23757","atlas_url":"https://app.syntology.ai/?focus=2505.23757","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}