{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/vision-language-action/papers/2","list_of":"/task/vision-language-action","task":"Vision-Language-Action","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":2,"rows_per_page":100,"rows":[101,157],"of":157,"counts":{"archive_papers_tagged":157,"with_a_code_link":49,"where_syntology_ran_a_sample":26,"not_listed_spam_title":0,"listed":157,"listed_where_code_ran":26,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":23,"every_run_a_failure_of_syntologys_instrument":3,"listed_with_a_run_with_no_instrument_failure":23,"listed_every_run_a_failure_of_syntologys_instrument":3,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/vision-language-action","prev":"/task/vision-language-action","next":null,"papers":[{"url":null,"slug":"gr00t-n1-an-open-foundation-model-for","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","date":"2025-03-18","arxiv_id":"2503.14734","repositories_listed":0,"syntology":null},{"url":null,"slug":"momanipvla-transferring-vision-language","title":"MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation","date":"2025-03-17","arxiv_id":"2503.13446","repositories_listed":0,"syntology":null},{"url":null,"slug":"rebot-scaling-robot-learning-with-real-to-sim","title":"ReBot: Scaling Robot Learning with Real-to-Sim-to-Real Robotic Video Synthesis","date":"2025-03-15","arxiv_id":"2503.14526","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybridvla-collaborative-diffusion-and","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","date":"2025-03-13","arxiv_id":"2503.10631","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-unlocking-scalability-in-reinforcement","title":"MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models","date":"2025-03-11","arxiv_id":"2503.08007","repositories_listed":0,"syntology":null},{"url":null,"slug":"refined-policy-distillation-from-vla","title":"Refined Policy Distillation: From VLA Generalists to RL Experts","date":"2025-03-06","arxiv_id":"2503.05833","repositories_listed":0,"syntology":null},{"url":null,"slug":"otter-a-vision-language-action-model-with","title":"OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction","date":"2025-03-05","arxiv_id":"2503.03734","repositories_listed":0,"syntology":null},{"url":null,"slug":"safevla-towards-safety-alignment-of-vision","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","date":"2025-03-05","arxiv_id":"2503.03480","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-vision-language-action-model","title":"Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding","date":"2025-03-04","arxiv_id":"2503.02310","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-01238","title":"A Taxonomy for Evaluating Generalist Robot Policies","date":"2025-03-03","arxiv_id":"2503.01238","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexgraspvla-a-vision-language-action","title":"DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping","date":"2025-02-28","arxiv_id":"2502.20900","repositories_listed":0,"syntology":null},{"url":null,"slug":"hi-robot-open-ended-instruction-following","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","date":"2025-02-26","arxiv_id":"2502.19417","repositories_listed":0,"syntology":null},{"url":null,"slug":"objectvla-end-to-end-open-world-object","title":"ObjectVLA: End-to-End Open-World Object Manipulation Without Demonstration","date":"2025-02-26","arxiv_id":"2502.19250","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolution-6-0-evolving-robotic-capabilities","title":"Evolution 6.0: Evolving Robotic Capabilities Through Generative Design","date":"2025-02-24","arxiv_id":"2502.17034","repositories_listed":0,"syntology":null},{"url":null,"slug":"gevrm-goal-expressive-video-generation-model","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","date":"2025-02-13","arxiv_id":"2502.09268","repositories_listed":0,"syntology":null},{"url":null,"slug":"hamster-hierarchical-action-models-for-open","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","date":"2025-02-08","arxiv_id":"2502.05485","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-on-vision-language-action-models","title":"Survey on Vision-Language-Action Models","date":"2025-02-07","arxiv_id":"2502.06851","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-a-vision-language-action-model-for","title":"Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture","date":"2025-02-06","arxiv_id":"2502.04558","repositories_listed":0,"syntology":null},{"url":null,"slug":"vla-cache-towards-efficient-vision-language","title":"VLA-Cache: Towards Efficient Vision-Language-Action Model via Adaptive Token Caching in Robotic Manipulation","date":"2025-02-04","arxiv_id":"2502.02175","repositories_listed":0,"syntology":null},{"url":"/paper/up-vla-a-unified-understanding-and-prediction","slug":"up-vla-a-unified-understanding-and-prediction","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","date":"2025-01-31","arxiv_id":"2501.18867","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-vision-language-action-model-with","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","date":"2025-01-28","arxiv_id":"2501.16664","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-efficient-action-tokenization-for-vision","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","date":"2025-01-16","arxiv_id":"2501.09747","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-sight-finetuning-generalist-robot","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","date":"2025-01-08","arxiv_id":"2501.04693","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-models-for-artificial-general","title":"Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches","date":"2025-01-06","arxiv_id":"2501.03151","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-centric-prompt-driven-vision-language","title":"Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"solami-social-vision-language-action-modeling","title":"SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vlabench-a-large-scale-benchmark-for-language","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","date":"2024-12-24","arxiv_id":"2412.18194","repositories_listed":0,"syntology":null},{"url":null,"slug":"quart-online-latency-free-large-multimodal","title":"QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning","date":"2024-12-20","arxiv_id":"2412.15576","repositories_listed":0,"syntology":null},{"url":null,"slug":"robomind-benchmark-on-multi-embodiment","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","date":"2024-12-18","arxiv_id":"2412.13877","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-driven-design-for-multi-step","title":"Modality-Driven Design for Multi-Step Dexterous Manipulation: Insights from Neuroscience","date":"2024-12-15","arxiv_id":"2412.11337","repositories_listed":0,"syntology":null},{"url":"/paper/tracevla-visual-trace-prompting-enhances","slug":"tracevla-visual-trace-prompting-enhances","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","date":"2024-12-13","arxiv_id":"2412.10345","repositories_listed":0,"syntology":null},{"url":null,"slug":"uni-navid-a-video-based-vision-language","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","date":"2024-12-09","arxiv_id":"2412.06224","repositories_listed":0,"syntology":null},{"url":null,"slug":"navila-legged-robot-vision-language-action","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","date":"2024-12-05","arxiv_id":"2412.04453","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantization-aware-imitation-learning-for","title":"Quantization-Aware Imitation-Learning for Resource-Efficient Robotic Control","date":"2024-12-02","arxiv_id":"2412.01034","repositories_listed":0,"syntology":null},{"url":null,"slug":"cogact-a-foundational-vision-language-action","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","date":"2024-11-29","arxiv_id":"2411.19650","repositories_listed":0,"syntology":null},{"url":null,"slug":"grape-generalizing-robot-policy-via","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","date":"2024-11-28","arxiv_id":"2411.19309","repositories_listed":0,"syntology":null},{"url":null,"slug":"p-0-a-vision-language-action-flow-model-for","title":"$π_0$: A Vision-Language-Action Flow Model for General Robot Control","date":"2024-10-31","arxiv_id":"2410.24164","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-process-vla-efficient-robotic","title":"A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM","date":"2024-10-21","arxiv_id":"2410.15549","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-action-model-and-diffusion","title":"Vision-Language-Action Model and Diffusion Policy Switching Enables Dexterous Control of an Anthropomorphic Hand","date":"2024-10-17","arxiv_id":"2410.14022","repositories_listed":0,"syntology":null},{"url":"/paper/towards-synergistic-generalized-and-efficient","slug":"towards-synergistic-generalized-and-efficient","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","date":"2024-10-10","arxiv_id":"2410.08001","repositories_listed":0,"syntology":null},{"url":null,"slug":"ladev-a-language-driven-testing-and","title":"LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation","date":"2024-10-07","arxiv_id":"2410.05191","repositories_listed":0,"syntology":null},{"url":null,"slug":"run-time-observation-interventions-make","title":"Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust","date":"2024-10-02","arxiv_id":"2410.01971","repositories_listed":0,"syntology":null},{"url":null,"slug":"revla-reverting-visual-domain-limitation-of","title":"ReVLA: Reverting Visual Domain Limitation of Robotic Foundation Models","date":"2024-09-23","arxiv_id":"2409.15250","repositories_listed":0,"syntology":null},{"url":null,"slug":"manipulation-facing-threats-evaluating","title":"Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models","date":"2024-09-20","arxiv_id":"2409.13174","repositories_listed":0,"syntology":null},{"url":null,"slug":"hirt-enhancing-robotic-control-with","title":"HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers","date":"2024-09-12","arxiv_id":"2410.05273","repositories_listed":0,"syntology":null},{"url":null,"slug":"occllama-an-occupancy-language-action","title":"OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving","date":"2024-09-05","arxiv_id":"2409.03272","repositories_listed":0,"syntology":null},{"url":null,"slug":"covla-comprehensive-vision-language-action","title":"CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving","date":"2024-08-19","arxiv_id":"2408.10845","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-control-via-embodied-chain-of-thought","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","date":"2024-07-11","arxiv_id":"2407.08693","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobility-vla-multimodal-instruction","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","date":"2024-07-10","arxiv_id":"2407.07775","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnijarvis-unified-vision-language-action","title":"OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents","date":"2024-06-27","arxiv_id":"2407.00114","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-natural-language-driven-assembly","title":"Towards Natural Language-Driven Assembly Using Foundation Models","date":"2024-06-23","arxiv_id":"2406.16093","repositories_listed":0,"syntology":null},{"url":"/paper/robomamba-multimodal-state-space-model-for","slug":"robomamba-multimodal-state-space-model-for","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","date":"2024-06-06","arxiv_id":"2406.04339","repositories_listed":0,"syntology":null},{"url":null,"slug":"legent-open-platform-for-embodied-agents","title":"LEGENT: Open Platform for Embodied Agents","date":"2024-04-28","arxiv_id":"2404.18243","repositories_listed":0,"syntology":null},{"url":null,"slug":"3d-vla-a-3d-vision-language-action-generative","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","date":"2024-03-14","arxiv_id":"2403.09631","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-purpose-foundation-models-for","title":"General-purpose foundation models for increased autonomy in robot-assisted surgery","date":"2024-01-01","arxiv_id":"2401.00678","repositories_listed":0,"syntology":null},{"url":null,"slug":"quar-vla-vision-language-action-model-for","title":"QUAR-VLA: Vision-Language-Action Model for Quadruped Robots","date":"2023-12-22","arxiv_id":"2312.14457","repositories_listed":0,"syntology":null},{"url":null,"slug":"sara-rt-scaling-up-robotics-transformers-with","title":"SARA-RT: Scaling up Robotics Transformers with Self-Adaptive Robust Attention","date":"2023-12-04","arxiv_id":"2312.01990","repositories_listed":0,"syntology":null}],"record_sha256":"1d83705c1a37b054a5ce05199f4086a61d91f639951051a7a549529a83fbc656","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}