{"url":"/task/visual-dialogue","name":"Visual Dialog","slug":"visual-dialogue","description_markdown":"Visual Dialog requires an AI agent to hold a meaningful dialog with humans in natural, conversational language about visual content. Specifically, given an image, a dialog history, and a follow-up question about the image, the task is to answer the question.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":118,"papers_with_code":56,"benchmarks":8,"benchmark_tables_in_archive":8,"benchmark_tables_shown":8,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":9,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/visual-dialog-on-visual-dialog-v1-0-test-std","slug":"visual-dialog-on-visual-dialog-v1-0-test-std","dataset":"Visual Dialog v1.0 test-std","dataset_url":"/dataset/visdial","rows_in_archive":80,"metrics":["NDCG (x 100)","MRR (x 100)","R@1","R@5","R@10","Mean"],"first_row_in_archive_order":{"model":"Single","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-dialog-on-visdial-v09-val","slug":"visual-dialog-on-visdial-v09-val","dataset":"VisDial v0.9 val","dataset_url":"/dataset/visdial","rows_in_archive":18,"metrics":["MRR","R@1","R@10","R@5","Mean Rank"],"first_row_in_archive_order":{"model":"9xFGA (VGG)","paper_title":"Factor Graph Attention","paper_url":"/paper/factor-graph-attention","paper_date":"2019-04-11","arxiv_id":"1904.05880","code_links":[{"title":"idansc/fga","url":"https://github.com/idansc/fga"}],"syntology":null}},{"leaderboard":"/sota/visual-dialog-on-visdial-v10-test-std","slug":"visual-dialog-on-visdial-v10-test-std","dataset":"VisDial v1.0 test-std","dataset_url":"/dataset/visdial","rows_in_archive":3,"metrics":["MRR","Mean Rank","NDCG","R@1","R@10","R@5"],"first_row_in_archive_order":{"model":"5xFGA + LS*+","paper_title":"Ensemble of MRR and NDCG models for Visual Dialog","paper_url":"/paper/ensemble-of-mrr-and-ndcg-models-for-visual","paper_date":"2021-04-15","arxiv_id":"2104.07511","code_links":[{"title":"idansc/mrr-ndcg","url":"https://github.com/idansc/mrr-ndcg"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}}},{"leaderboard":"/sota/visual-dialog-on-blendedskilltalk","slug":"visual-dialog-on-blendedskilltalk","dataset":"BlendedSkillTalk","dataset_url":"/dataset/blended-skill-talk","rows_in_archive":1,"metrics":["BLEU-4","F1","ROUGE-L"],"first_row_in_archive_order":{"model":"Multi-Modal BlenderBot","paper_title":"Multi-Modal Open-Domain Dialogue","paper_url":"/paper/multi-modal-open-domain-dialogue","paper_date":"2020-10-02","arxiv_id":"2010.01082","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-dialog-on-convai2","slug":"visual-dialog-on-convai2","dataset":"ConvAI2","dataset_url":"/dataset/convai2","rows_in_archive":1,"metrics":["BLEU-4","F1","ROUGE-L"],"first_row_in_archive_order":{"model":"Multi-Modal BlenderBot","paper_title":"Multi-Modal Open-Domain Dialogue","paper_url":"/paper/multi-modal-open-domain-dialogue","paper_date":"2020-10-02","arxiv_id":"2010.01082","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-dialog-on-empatheticdialogues","slug":"visual-dialog-on-empatheticdialogues","dataset":"EmpatheticDialogues","dataset_url":"/dataset/empatheticdialogues","rows_in_archive":1,"metrics":["BLEU-4","F1","ROUGE-L"],"first_row_in_archive_order":{"model":"Multi-Modal BlenderBot","paper_title":"Multi-Modal Open-Domain Dialogue","paper_url":"/paper/multi-modal-open-domain-dialogue","paper_date":"2020-10-02","arxiv_id":"2010.01082","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-dialog-on-image-chat","slug":"visual-dialog-on-image-chat","dataset":"Image-Chat","dataset_url":"/dataset/image-chat","rows_in_archive":1,"metrics":["BLEU-4","F1","ROUGE-L"],"first_row_in_archive_order":{"model":"Multi-Modal BlenderBot","paper_title":"Multi-Modal Open-Domain Dialogue","paper_url":"/paper/multi-modal-open-domain-dialogue","paper_date":"2020-10-02","arxiv_id":"2010.01082","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-dialog-on-wizard-of-wikipedia","slug":"visual-dialog-on-wizard-of-wikipedia","dataset":"Wizard of Wikipedia","dataset_url":"/dataset/wizard-of-wikipedia","rows_in_archive":1,"metrics":["BLEU-4","F1","ROUGE-L"],"first_row_in_archive_order":{"model":"Multi-Modal BlenderBot","paper_title":"Multi-Modal Open-Domain Dialogue","paper_url":"/paper/multi-modal-open-domain-dialogue","paper_date":"2020-10-02","arxiv_id":"2010.01082","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/visdial","name":"VisDial","full_name":"Visual Dialog","num_papers_in_archive":159},{"url":"/dataset/wizard-of-wikipedia","name":"Wizard of Wikipedia","full_name":"","num_papers_in_archive":145},{"url":"/dataset/convai2","name":"ConvAI2","full_name":"Conversational Intelligence Challenge 2","num_papers_in_archive":100},{"url":"/dataset/empatheticdialogues","name":"EmpatheticDialogues","full_name":"","num_papers_in_archive":64},{"url":"/dataset/blended-skill-talk","name":"Blended Skill Talk","full_name":"Blended Skill Talk","num_papers_in_archive":32},{"url":"/dataset/image-chat","name":"Image-Chat","full_name":"","num_papers_in_archive":31},{"url":"/dataset/photobook","name":"PhotoBook","full_name":"","num_papers_in_archive":11},{"url":"/dataset/clevr-dialog","name":"CLEVR-Dialog","full_name":"CLEVR-Dialog","num_papers_in_archive":10},{"url":"/dataset/vispro","name":"VisPro","full_name":"VisPro","num_papers_in_archive":6}],"subtasks":[],"parent_tasks":[{"url":"/task/dialogue","name":"Dialogue"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":56,"tagged_in_all":118,"items":[{"url":"/paper/visual-dialog","title":"Visual Dialog","date":"2016-11-26","arxiv_id":"1611.08669","repositories_listed":11,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/hierarchical-question-image-co-attention-for","title":"Hierarchical Question-Image Co-Attention for Visual Question Answering","date":"2016-05-31","arxiv_id":"1606.00061","repositories_listed":9,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":1}},{"url":"/paper/learning-cooperative-visual-dialog-agents","title":"Learning Cooperative Visual Dialog Agents with Deep Reinforcement Learning","date":"2017-03-20","arxiv_id":"1703.06585","repositories_listed":7,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/audio-visual-scene-aware-dialog-avsd","title":"Audio Visual Scene-Aware Dialog (AVSD) Challenge at DSTC7","date":"2018-06-01","arxiv_id":"1806.00525","repositories_listed":4,"syntology":null},{"url":"/paper/perceptual-score-what-data-modalities-does","title":"Perceptual Score: What Data Modalities Does Your Model Perceive?","date":"2021-10-27","arxiv_id":"2110.14375","repositories_listed":3,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/mini-gemini-mining-the-potential-of-multi","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","date":"2024-03-27","arxiv_id":"2403.18814","repositories_listed":2,"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/the-dialog-must-go-on-improving-visual-dialog","title":"The Dialog Must Go On: Improving Visual Dialog via Generative Self-Training","date":"2022-05-25","arxiv_id":"2205.12502","repositories_listed":2,"syntology":null},{"url":"/paper/where-are-you-localization-from-embodied","title":"Where Are You? Localization from Embodied Dialog","date":"2020-11-16","arxiv_id":"2011.08277","repositories_listed":2,"syntology":null},{"url":"/paper/history-for-visual-dialog-do-we-really-need","title":"History for Visual Dialog: Do we really need it?","date":"2020-05-08","arxiv_id":"2005.07493","repositories_listed":2,"syntology":null},{"url":"/paper/large-scale-pretraining-for-visual-dialog-a","title":"Large-scale Pretraining for Visual Dialog: A Simple State-of-the-Art Baseline","date":"2019-12-05","arxiv_id":"1912.02379","repositories_listed":2,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/dual-attention-networks-for-visual-reference","title":"Dual Attention Networks for Visual Reference Resolution in Visual Dialog","date":"2019-02-25","arxiv_id":"1902.09368","repositories_listed":2,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/visual-dialogue-without-vision-or-dialogue","title":"Visual Dialogue without Vision or Dialogue","date":"2018-12-16","arxiv_id":"1812.06417","repositories_listed":2,"syntology":null},{"url":"/paper/hawk-learning-to-understand-open-world-video","title":"Hawk: Learning to Understand Open-World Video Anomalies","date":"2024-05-27","arxiv_id":"2405.16886","repositories_listed":1,"syntology":{"n":9,"n_ran":7,"n_unverified":2,"n_pointer_only":9}},{"url":"/paper/collecting-visually-grounded-dialogue-with-a-1","title":"Collecting Visually-Grounded Dialogue with A Game Of Sorts","date":"2023-09-10","arxiv_id":"2309.05162","repositories_listed":1,"syntology":null},{"url":"/paper/pace-unified-multi-modal-dialogue-pre","title":"PaCE: Unified Multi-modal Dialogue Pre-training with Progressive and Compositional Experts","date":"2023-05-24","arxiv_id":"2305.14839","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/unified-multimodal-model-with-unlikelihood","title":"Unified Multimodal Model with Unlikelihood Training for Visual Dialog","date":"2022-11-23","arxiv_id":"2211.13235","repositories_listed":1,"syntology":null},{"url":"/paper/lavis-a-library-for-language-vision","title":"LAVIS: A Library for Language-Vision Intelligence","date":"2022-09-15","arxiv_id":"2209.09019","repositories_listed":1,"syntology":null},{"url":"/paper/video-dialog-as-conversation-about-objects","title":"Video Dialog as Conversation about Objects Living in Space-Time","date":"2022-07-08","arxiv_id":"2207.03656","repositories_listed":1,"syntology":null},{"url":"/paper/vd-pcr-improving-visual-dialog-with-pronoun","title":"VD-PCR: Improving Visual Dialog with Pronoun Coreference Resolution","date":"2022-05-29","arxiv_id":"2205.14693","repositories_listed":1,"syntology":null},{"url":"/paper/spot-the-difference-a-cooperative-object-1","title":"Spot the Difference: A Cooperative Object-Referring Game in Non-Perfectly Co-Observable Scene","date":"2022-03-16","arxiv_id":"2203.08362","repositories_listed":1,"syntology":null},{"url":"/paper/uniter-based-situated-coreference-resolution","title":"UNITER-Based Situated Coreference Resolution with Rich Multimodal Input","date":"2021-12-07","arxiv_id":"2112.03521","repositories_listed":1,"syntology":null},{"url":"/paper/enhancing-visual-dialog-questioner-with","title":"Enhancing Visual Dialog Questioner with Entity-based Strategy Learning and Augmented Guesser","date":"2021-09-06","arxiv_id":"2109.02297","repositories_listed":1,"syntology":null},{"url":"/paper/seqdialn-sequential-visual-dialog-network-in","title":"SeqDialN: Sequential Visual Dialog Network in Joint Visual-Linguistic Representation Space","date":"2021-08-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/learning-better-visual-dialog-agents-with","title":"Learning Better Visual Dialog Agents with Pretrained Visual-Linguistic Representation","date":"2021-05-24","arxiv_id":"2105.11541","repositories_listed":1,"syntology":null},{"url":"/paper/ensemble-of-mrr-and-ndcg-models-for-visual","title":"Ensemble of MRR and NDCG models for Visual Dialog","date":"2021-04-15","arxiv_id":"2104.07511","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/answer-driven-visual-state-estimator-for-goal","title":"Answer-Driven Visual State Estimator for Goal-Oriented Visual Dialogue","date":"2020-10-01","arxiv_id":"2010.00361","repositories_listed":1,"syntology":null},{"url":"/paper/seqdialn-sequential-visual-dialog-networks-in","title":"SeqDialN: Sequential Visual Dialog Networks in Joint Visual-Linguistic Representation Space","date":"2020-08-02","arxiv_id":"2008.00397","repositories_listed":1,"syntology":null},{"url":"/paper/dialog-without-dialog-data-learning-visual","title":"Dialog without Dialog Data: Learning Visual Dialog Agents from VQA Data","date":"2020-07-24","arxiv_id":"2007.12750","repositories_listed":1,"syntology":null},{"url":"/paper/multi-view-attention-networks-for-visual","title":"Multi-View Attention Network for Visual Dialog","date":"2020-04-29","arxiv_id":"2004.14025","repositories_listed":1,"syntology":null},{"url":"/paper/vd-bert-a-unified-vision-and-dialog","title":"VD-BERT: A Unified Vision and Dialog Transformer with BERT","date":"2020-04-28","arxiv_id":"2004.13278","repositories_listed":1,"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}}],"syntology_records":11,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}