{"url":"/dataset/mmdialog","name":"MMDialog","full_name":null,"description_markdown":"**MMDialog** is a large-scale multi-turn dialogue dataset containing multi-modal open-domain conversations derived from real human-human chat content in social media. MMDialog contains 1.08M dialogue sessions and 1.53M associated images. On average, one dialogue session has 2.59 images, which can be located anywhere at any conversation turn.\r\n\r\nSource: [MMDialog: A Large-scale Multi-turn Dialogue Dataset Towards Multi-modal Open-domain Conversation](https://arxiv.org/pdf/2211.05719v1.pdf)\r\n\r\nImage Source: [https://arxiv.org/pdf/2211.05719v1.pdf](https://arxiv.org/pdf/2211.05719v1.pdf)","description_withheld":null,"homepage":"https://github.com/victorsungo/MMDialog","introduced_date":"2022-11-10","introduced_date_note":null,"introduced_by":{"paper":"/paper/mmdialog-a-large-scale-multi-turn-dialogue","title":"MMDialog: A Large-scale Multi-turn Dialogue Dataset Towards Multi-modal Open-domain Conversation","first_author":"Jiazhan Feng","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Open-Domain Dialog","url":"/task/open-domain-dialog","datasets_with_task":"/datasets/task/open-domain-dialog"},{"name":"Multimodal Intent Recognition","url":"/task/multimodal-intent-recognition","datasets_with_task":"/datasets/task/multimodal-intent-recognition"},{"name":"Multi-modal Dialogue Generation","url":"/task/multi-modal-dialogue-generation","datasets_with_task":"/datasets/task/multi-modal-dialogue-generation"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["MMDialog"],"data_loaders":[],"num_papers_in_archive":17,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/multimodal-intent-recognition-on-mmdialog","task":"Multimodal Intent Recognition","dataset_variant":"MMDialog","rows":4,"metrics":["F1"],"first_row_in_archive_order":{"model":"PaCE","paper":"/paper/pace-unified-multi-modal-dialogue-pre","metrics":{"F1":"77.6"},"code_links":[{"title":"AlibabaResearch/DAMO-ConvAI","url":"https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/pace"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/pace-unified-multi-modal-dialogue-pre","title":"PaCE: Unified Multi-modal Dialogue Pre-training with Progressive and Compositional Experts","date":"2023-05-24","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mmdialog-a-large-scale-multi-turn-dialogue","title":"MMDialog: A Large-scale Multi-turn Dialogue Dataset Towards Multi-modal Open-domain Conversation","date":"2022-11-10","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/vilt-vision-and-language-transformer-without","title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","date":"2021-02-05","rows_on_this_dataset":1,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":1,"samples_unverified":3,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":2,"samples_harvested":5,"samples_ran":1,"samples_unverified":4,"pointer_only_for_licence":1,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}