{"url":"/task/visual-navigation","name":"Visual Navigation","slug":"visual-navigation","description_markdown":"**Visual Navigation** is the problem of navigating an agent, e.g. a mobile robot, in an environment using camera input only. The agent is given a target image (an image it will see from the target position), and its goal is to move from its current position to the target by applying a sequence of actions, based on the camera observations only.\n\n\n<span class=\"description-source\">Source: [Vision-based Navigation Using Deep Reinforcement Learning ](https://arxiv.org/abs/1908.03627)</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Robots","url":"/area/robots"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":316,"papers_with_code":132,"benchmarks":6,"benchmark_tables_in_archive":6,"benchmark_tables_shown":6,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":19,"subtasks":1,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/visual-navigation-on-cooperative-vision-and-1","slug":"visual-navigation-on-cooperative-vision-and-1","dataset":"Cooperative Vision-and-Dialogue Navigation","dataset_url":null,"rows_in_archive":19,"metrics":["dist_to_end_reduction","spl"],"first_row_in_archive_order":{"model":"NaviLLM","paper_title":"Towards Learning a Generalist Model for Embodied Navigation","paper_url":"/paper/towards-learning-a-generalist-model-for","paper_date":"2023-12-04","arxiv_id":"2312.02010","code_links":[{"title":"zd11024/NaviLLM","url":"https://github.com/zd11024/NaviLLM"},{"title":"lavi-lab/navillm","url":"https://github.com/lavi-lab/navillm"}],"syntology":{"n":15,"n_ran":10,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-navigation-on-room-to-room-1","slug":"visual-navigation-on-room-to-room-1","dataset":"R2R","dataset_url":"/dataset/room-to-room","rows_in_archive":11,"metrics":["spl"],"first_row_in_archive_order":{"model":"SUSA","paper_title":"Agent Journey Beyond RGB: Unveiling Hybrid Semantic-Spatial Environmental Representations for Vision-and-Language Navigation","paper_url":"/paper/agent-journey-beyond-rgb-unveiling-hybrid","paper_date":"2024-12-09","arxiv_id":"2412.06465","code_links":[{"title":"HCI-LMC/VLN-SUSA","url":"https://github.com/HCI-LMC/VLN-SUSA"}],"syntology":null}},{"leaderboard":"/sota/visual-navigation-on-soon-test","slug":"visual-navigation-on-soon-test","dataset":"SOON Test","dataset_url":null,"rows_in_archive":6,"metrics":["Nav-SPL","SR"],"first_row_in_archive_order":{"model":"AutoVLN","paper_title":"Learning from Unlabeled 3D Environments for Vision-and-Language Navigation","paper_url":"/paper/learning-from-unlabeled-3d-environments-for","paper_date":"2022-08-24","arxiv_id":"2208.11781","code_links":[{"title":"cshizhe/HM3DAutoVLN","url":"https://github.com/cshizhe/HM3DAutoVLN"}],"syntology":null}},{"leaderboard":"/sota/visual-navigation-on-ai2-thor","slug":"visual-navigation-on-ai2-thor","dataset":"AI2-THOR","dataset_url":"/dataset/ai2-thor","rows_in_archive":2,"metrics":["SPL (All)","SPL (L≥5)","Success Rate (All)","Success Rate (L≥5)"],"first_row_in_archive_order":{"model":"MVV-IN","paper_title":"Multimodal Aggregation Approach for Memory Vision-Voice Indoor Navigation with Meta-Learning","paper_url":"/paper/multimodal-aggregation-approach-for-memory","paper_date":"2020-09-01","arxiv_id":"2009.00402","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-navigation-on-dmlab-30","slug":"visual-navigation-on-dmlab-30","dataset":"Dmlab-30","dataset_url":null,"rows_in_archive":1,"metrics":["Medium Human-Normalized Score"],"first_row_in_archive_order":{"model":"PopArt-IMPALA","paper_title":"Multi-task Deep Reinforcement Learning with PopArt","paper_url":"/paper/multi-task-deep-reinforcement-learning-with","paper_date":"2018-09-12","arxiv_id":"1809.04474","code_links":[{"title":"opendilab/DI-engine","url":"https://github.com/opendilab/DI-engine"},{"title":"aluscher/torchbeastpopart","url":"https://github.com/aluscher/torchbeastpopart"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":2}}},{"leaderboard":"/sota/visual-navigation-on-help-anna-hanna-1","slug":"visual-navigation-on-help-anna-hanna-1","dataset":"Help, Anna! (HANNA)","dataset_url":"/dataset/help","rows_in_archive":1,"metrics":["spl"],"first_row_in_archive_order":{"model":"Prevalent","paper_title":"Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-training","paper_url":"/paper/towards-learning-a-generic-agent-for-vision","paper_date":"2020-02-25","arxiv_id":"2002.10638","code_links":[{"title":"weituo12321/PREVALENT","url":"https://github.com/weituo12321/PREVALENT"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/replica","name":"Replica","full_name":"","num_papers_in_archive":414},{"url":"/dataset/ai2-thor","name":"AI2-THOR","full_name":"AI2-THOR","num_papers_in_archive":243},{"url":"/dataset/suncg","name":"SUNCG","full_name":"SUNCG","num_papers_in_archive":186},{"url":"/dataset/room-to-room","name":"R2R","full_name":"Room-to-Room","num_papers_in_archive":174},{"url":"/dataset/2d-3d-s","name":"2D-3D-S","full_name":"2D-3D-Semantic","num_papers_in_archive":147},{"url":"/dataset/help","name":"HELP","full_name":"","num_papers_in_archive":30},{"url":"/dataset/avd","name":"AVD","full_name":"Active Vision Dataset","num_papers_in_archive":29},{"url":"/dataset/minos","name":"MINOS","full_name":"MINOS","num_papers_in_archive":22},{"url":"/dataset/hm3dsem","name":"HM3DSem","full_name":"","num_papers_in_archive":13},{"url":"/dataset/house3d-environment","name":"House3D Environment","full_name":"","num_papers_in_archive":11},{"url":"/dataset/talk-the-walk","name":"Talk the Walk","full_name":"","num_papers_in_archive":11},{"url":"/dataset/iquad","name":"IQUAD","full_name":"Interactive Question Answering Dataset","num_papers_in_archive":7},{"url":"/dataset/minerl","name":"MineRL","full_name":"MineRL","num_papers_in_archive":3},{"url":"/dataset/baseprod","name":"BASEPROD","full_name":"The Bardenas Semi-Desert Planetary Rover Dataset","num_papers_in_archive":2},{"url":"/dataset/midgard","name":"MIDGARD","full_name":"MIDGARD","num_papers_in_archive":2},{"url":"/dataset/talk2nav","name":"Talk2Nav","full_name":"","num_papers_in_archive":2},{"url":"/dataset/image-goal-nav-dataset","name":"image-goal-nav-dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/luna-1","name":"Luna-1","full_name":"","num_papers_in_archive":1},{"url":"/dataset/uav-multiview-navigation","name":"UAV Multiview Navigation","full_name":"UAV Multiview Navigation","num_papers_in_archive":1}],"subtasks":[{"url":"/task/objectgoal-navigation","name":"ObjectGoal Navigation"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":132,"tagged_in_all":316,"items":[{"url":"/paper/vision-and-language-navigation-interpreting","title":"Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments","date":"2017-11-20","arxiv_id":"1711.07280","repositories_listed":8,"syntology":null},{"url":"/paper/cognitive-mapping-and-planning-for-visual","title":"Cognitive Mapping and Planning for Visual Navigation","date":"2017-02-13","arxiv_id":"1702.03920","repositories_listed":6,"syntology":null},{"url":"/paper/think-locally-act-globally-federated-learning","title":"Think Locally, Act Globally: Federated Learning with Local and Global Representations","date":"2020-01-06","arxiv_id":"2001.01523","repositories_listed":4,"syntology":{"n":6,"n_ran":1,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/are-we-making-real-progress-in-simulated","title":"Sim2Real Predictivity: Does Evaluation in Simulation Predict Real-World Performance?","date":"2019-12-13","arxiv_id":"1912.06321","repositories_listed":4,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/popgym-benchmarking-partially-observable","title":"POPGym: Benchmarking Partially Observable Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01859","repositories_listed":3,"syntology":null},{"url":"/paper/the-regretful-agent-heuristic-aided","title":"The Regretful Agent: Heuristic-Aided Navigation through Progress Estimation","date":"2019-03-05","arxiv_id":"1903.01602","repositories_listed":3,"syntology":{"n":11,"n_ran":1,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/visual-representations-for-semantic-target","title":"Visual Representations for Semantic Target Driven Navigation","date":"2018-05-15","arxiv_id":"1805.06066","repositories_listed":3,"syntology":null},{"url":"/paper/a-64mw-dnn-based-visual-navigation-engine-for","title":"A 64mW DNN-based Visual Navigation Engine for Autonomous Nano-Drones","date":"2018-05-04","arxiv_id":"1805.01831","repositories_listed":3,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/towards-learning-a-generalist-model-for","title":"Towards Learning a Generalist Model for Embodied Navigation","date":"2023-12-04","arxiv_id":"2312.02010","repositories_listed":2,"syntology":{"n":15,"n_ran":10,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/navgpt-explicit-reasoning-in-vision-and","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","date":"2023-05-26","arxiv_id":"2305.16986","repositories_listed":2,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/soundspaces-2-0-a-simulation-platform-for","title":"SoundSpaces 2.0: A Simulation Platform for Visual-Acoustic Learning","date":"2022-06-16","arxiv_id":"2206.08312","repositories_listed":2,"syntology":null},{"url":"/paper/towards-real-world-navigation-with-deep","title":"Towards real-world navigation with deep differentiable planners","date":"2021-08-08","arxiv_id":"2108.05713","repositories_listed":2,"syntology":null},{"url":"/paper/teaching-agents-how-to-map-spatial-reasoning","title":"Teaching Agents how to Map: Spatial Reasoning for Multi-Object Navigation","date":"2021-07-13","arxiv_id":"2107.06011","repositories_listed":2,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/end-to-end-egospheric-spatial-memory","title":"End-to-End Egospheric Spatial Memory","date":"2021-02-15","arxiv_id":"2102.07764","repositories_listed":2,"syntology":null},{"url":"/paper/visual-navigation-in-real-world-indoor","title":"Visual Navigation in Real-World Indoor Environments Using End-to-End Deep Reinforcement Learning","date":"2020-10-21","arxiv_id":"2010.10903","repositories_listed":2,"syntology":null},{"url":"/paper/explore-then-execute-adapting-without-rewards","title":"Decoupling Exploration and Exploitation for Meta-Reinforcement Learning without Sacrifices","date":"2020-08-06","arxiv_id":"2008.02790","repositories_listed":2,"syntology":null},{"url":"/paper/side-tuning-network-adaptation-via-additive-1","title":"Side-Tuning: A Baseline for Network Adaptation via Additive Side Networks","date":"2019-12-31","arxiv_id":"1912.13503","repositories_listed":2,"syntology":null},{"url":"/paper/audio-visual-embodied-navigation","title":"SoundSpaces: Audio-Visual Navigation in 3D Environments","date":"2019-12-24","arxiv_id":"1912.11474","repositories_listed":2,"syntology":null},{"url":"/paper/vusfavariational-universal-successor-features","title":"VUSFA:Variational Universal Successor Features Approximator to Improve Transfer DRL for Target Driven Visual Navigation","date":"2019-08-18","arxiv_id":"1908.06376","repositories_listed":2,"syntology":null},{"url":"/paper/vision-and-dialog-navigation","title":"Vision-and-Dialog Navigation","date":"2019-07-10","arxiv_id":"1907.04957","repositories_listed":2,"syntology":null},{"url":"/paper/an-open-source-and-open-hardware-deep","title":"An Open Source and Open Hardware Deep Learning-powered Visual Navigation Engine for Autonomous Nano-UAVs","date":"2019-05-10","arxiv_id":"1905.04166","repositories_listed":2,"syntology":null},{"url":"/paper/scaling-and-benchmarking-self-supervised","title":"Scaling and Benchmarking Self-Supervised Visual Representation Learning","date":"2019-05-03","arxiv_id":"1905.01235","repositories_listed":2,"syntology":null},{"url":"/paper/learning-exploration-policies-for-navigation","title":"Learning Exploration Policies for Navigation","date":"2019-03-05","arxiv_id":"1903.01959","repositories_listed":2,"syntology":null},{"url":"/paper/self-monitoring-navigation-agent-via","title":"Self-Monitoring Navigation Agent via Auxiliary Progress Estimation","date":"2019-01-10","arxiv_id":"1901.03035","repositories_listed":2,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/learning-to-learn-how-to-learn-self-adaptive","title":"Learning to Learn How to Learn: Self-Adaptive Visual Navigation Using Meta-Learning","date":"2018-12-03","arxiv_id":"1812.00971","repositories_listed":2,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/target-driven-visual-navigation-in-indoor","title":"Target-driven Visual Navigation in Indoor Scenes using Deep Reinforcement Learning","date":"2016-09-16","arxiv_id":"1609.05143","repositories_listed":2,"syntology":null},{"url":"/paper/2505-11409","title":"Visual Planning: Let's Think Only with Images","date":"2025-05-16","arxiv_id":"2505.11409","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/task-oriented-communications-for-visual","title":"Task-Oriented Communications for Visual Navigation with Edge-Aerial Collaboration in Low Altitude Economy","date":"2025-04-25","arxiv_id":"2504.18317","repositories_listed":1,"syntology":null},{"url":"/paper/prior-does-matter-visual-navigation-via","title":"Prior Does Matter: Visual Navigation via Denoising Diffusion Bridge Models","date":"2025-04-14","arxiv_id":"2504.10041","repositories_listed":1,"syntology":null},{"url":"/paper/navidiffusor-cost-guided-diffusion-model-for","title":"NaviDiffusor: Cost-Guided Diffusion Model for Visual Navigation","date":"2025-04-14","arxiv_id":"2504.10003","repositories_listed":1,"syntology":null}],"syntology_records":10,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}