{"url":"/dataset/robo-vln","name":"robo-vln","full_name":"Robotics Vision-and-Language Navigation","description_markdown":"The Robo-VLN dataset is a continuous control formulation of the VLN-CE dataset by [Krantz et al](https://arxiv.org/pdf/2004.02857.pdf) ported over from Room-to-Room (R2R) dataset created by [Anderson et al](http://openaccess.thecvf.com/content_cvpr_2018/papers/Anderson_Vision-and-Language_Navigation_Interpreting_CVPR_2018_paper.pdf). The details regarding converting discrete VLN dataset into continuous control formulation can be found in our [paper](https://github.com/zubair-irshad/zubair-irshad.github.io/blob/master/projects/resources/HCM_ICRA21.pdf). \r\n\r\n| Dataset \t| Path to extract              \t| Size  \t|\r\n|--------------\t|----------------------------\t|-------\t|\r\n| [robo_vln_v1.zip](https://www.dropbox.com/s/1h1rfx4bssz5qwy/robo_vln_v1.zip?dl=1) \t| `data/datasets/robo_vln_v1`          \t| 76.9 MB \t|\r\n\r\n#### Robo-VLN Dataset\r\n\r\nThe dataset `robo_vln_v1` contains the `train`, `val_seen`, and `val_unseen` splits. \r\n\r\n* train: 7739 episodes\r\n* val_seen: 570 episodes\r\n* val_unseen: 1224 episodes\r\n\r\nFormat of `{split}.json.gz`\r\n\r\n```\r\n{\r\n    'episodes' = [\r\n        {\r\n            'episode_id': 4991,\r\n            'trajectory_id': 3279,\r\n            'scene_id': 'mp3d/JeFG25nYj2p/JeFG25nYj2p.glb',\r\n            'instruction': {\r\n                'instruction_text': 'Walk past the striped area rug...',\r\n                'instruction_tokens': [2384, 1589, 2202, 2118, 133, 1856, 9]\r\n            },\r\n            'start_position': [10.257800102233887, 0.09358400106430054, -2.379739999771118],\r\n            'start_rotation': [0, 0.3332950713608026, 0, 0.9428225683587541],\r\n            'goals': [\r\n                {\r\n                    'position': [3.360340118408203, 0.09358400106430054, 3.07817006111145], \r\n                    'radius': 3.0\r\n                }\r\n            ],\r\n            'reference_path': [\r\n                [10.257800102233887, 0.09358400106430054, -2.379739999771118], \r\n                [9.434900283813477, 0.09358400106430054, -1.3061100244522095]\r\n                ...\r\n                [3.360340118408203, 0.09358400106430054, 3.07817006111145],\r\n            ],\r\n            'info': {'geodesic_distance': 9.65537166595459},\r\n        },\r\n        ...\r\n    ],\r\n    'instruction_vocab': [\r\n        'word_list': [..., 'orchids', 'order', 'orient', ...],\r\n        'word2idx_dict': {\r\n            ...,\r\n            'orchids': 1505,\r\n            'order': 1506,\r\n            'orient': 1507,\r\n            ...\r\n        },\r\n        'itos': [..., 'orchids', 'order', 'orient', ...],\r\n        'stoi': {\r\n            ...,\r\n            'orchids': 1505,\r\n            'order': 1506,\r\n            'orient': 1507,\r\n            ...\r\n        },\r\n        'num_vocab': 2504,\r\n        'UNK_INDEX': 1,\r\n        'PAD_INDEX': 0,\r\n    ]\r\n}\r\n```\r\n* Format of `{split}_gt.json.gz`\r\n\r\n```\r\n{\r\n    '4991': {\r\n        'actions': [\r\n          ...\r\n          [-0.999969482421875, 1.0],\r\n          [-0.9999847412109375, 0.15731772780418396],\r\n          ...\r\n          ],\r\n        'forward_steps': 325,\r\n        'locations': [\r\n            [10.257800102233887, 0.09358400106430054, -2.379739999771118],\r\n            [10.257800102233887, 0.09358400106430054, -2.379739999771118],\r\n            ...\r\n            [-12.644463539123535, 0.1518409252166748, 4.2241311073303220]\r\n        ]\r\n    }\r\n    ...\r\n}\r\n```","description_withheld":null,"homepage":"https://zubair-irshad.github.io/projects/robo-vln.html","introduced_date":"2021-04-21","introduced_date_note":null,"introduced_by":null,"license":{"name":"MIT License","url":"https://opensource.org/licenses/MIT"},"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Time series","url":"/datasets/modality/time-series"},{"name":"RGB-D","url":"/datasets/modality/rgb-d"}],"tasks":[{"name":"Vision and Language Navigation","url":"/task/vision-and-language-navigation","datasets_with_task":"/datasets/task/vision-and-language-navigation"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["robo-vln"],"data_loaders":[],"num_papers_in_archive":2,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/vision-and-language-navigation-on-robo-vln","task":"Vision and Language Navigation","dataset_variant":"robo-vln","rows":1,"metrics":["SPL (Sucess Weighted by Path Length)"],"first_row_in_archive_order":{"model":"Hierarchical Cross-Modal Agent","paper":"/paper/hierarchical-cross-modal-agent-for-robotics","metrics":{"SPL (Sucess Weighted by Path Length)":"0.40"},"code_links":[{"title":"GT-RIPL/robo-vln","url":"https://github.com/GT-RIPL/robo-vln"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/hierarchical-cross-modal-agent-for-robotics","title":"Hierarchical Cross-Modal Agent for Robotics Vision-and-Language Navigation","date":null,"rows_on_this_dataset":1,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}