{"url":"/dataset/multi30k","name":"Multi30K","full_name":null,"description_markdown":"Multi30K is a large-scale multilingual multimodal dataset for interdisciplinary machine learning research. It extends the Flickr30K dataset with German translations created by professional translators over a subset of the English descriptions, and descriptions crowdsourced independently of the original English descriptions. The dataset was introduced to stimulate multilingual multimodal research.","description_withheld":null,"homepage":"https://github.com/multi30k/dataset","introduced_date":"2016-05-02","introduced_date_note":null,"introduced_by":{"paper":"/paper/multi30k-multilingual-english-german-image","title":"Multi30K: Multilingual English-German Image Descriptions","first_author":"Desmond Elliott","url":null},"license":null,"modalities":[],"tasks":[{"name":"Translation deu-eng","url":"/task/translation-deu-eng","datasets_with_task":"/datasets/task/translation-deu-eng"},{"name":"Translation eng-deu","url":"/task/translation-eng-deu","datasets_with_task":"/datasets/task/translation-eng-deu"},{"name":"Real-time Instance Segmentation","url":"/task/real-time-instance-segmentation","datasets_with_task":"/datasets/task/real-time-instance-segmentation"},{"name":"Multimodal Machine Translation","url":"/task/multimodal-machine-translation","datasets_with_task":"/datasets/task/multimodal-machine-translation"},{"name":"Translation eng-fra","url":"/task/translation-eng-fra","datasets_with_task":"/datasets/task/translation-eng-fra"},{"name":"Translation ces-eng","url":"/task/translation-ces-eng","datasets_with_task":"/datasets/task/translation-ces-eng"},{"name":"Translation fra-eng","url":"/task/translation-fra-eng","datasets_with_task":"/datasets/task/translation-fra-eng"},{"name":"Translation ces-deu","url":"/task/translation-ces-deu","datasets_with_task":"/datasets/task/translation-ces-deu"},{"name":"Translation ces-fra","url":"/task/translation-ces-fra","datasets_with_task":"/datasets/task/translation-ces-fra"},{"name":"Translation deu-fra","url":"/task/translation-deu-fra","datasets_with_task":"/datasets/task/translation-deu-fra"},{"name":"Translation fra-deu","url":"/task/translation-fra-deu","datasets_with_task":"/datasets/task/translation-fra-deu"}],"languages":[],"variants":["multi30k_test_2018_flickr eng-deu","multi30k_test_2018_flickr deu-eng","multi30k_test_2018_flickr","multi30k_test_2017_mscoco","multi30k_test_2017_flickr","multi30k_test_2016_flickr","multi30k_task2_test_2016","Multi30K"],"data_loaders":[],"num_papers_in_archive":139,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/multimodal-machine-translation-on-multi30k","task":"Multimodal Machine Translation","dataset_variant":"Multi30K","rows":15,"metrics":["BLEU (EN-DE)","BLUE (DE-EN)","Meteor (EN-DE)","Meteor (EN-FR)"],"first_row_in_archive_order":{"model":"ERNIE-UniX2","paper":"/paper/ernie-unix2-a-unified-cross-lingual-cross","metrics":{"BLEU (EN-DE)":"49.3"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/real-time-instance-segmentation-on-multi30k","task":"Real-time Instance Segmentation","dataset_variant":"multi30k_test_2017_mscoco","rows":1,"metrics":["mask AP"],"first_row_in_archive_order":{"model":"RTMDet-Ins-s","paper":"/paper/rtmdet-an-empirical-study-of-designing-real","metrics":{"mask AP":"38.7"},"code_links":[{"title":"open-mmlab/mmdetection","url":"https://github.com/open-mmlab/mmdetection/tree/3.x/configs/rtmdet"},{"title":"open-mmlab/mmyolo","url":"https://github.com/open-mmlab/mmyolo"},{"title":"open-mmlab/mmrotate","url":"https://github.com/open-mmlab/mmrotate"},{"title":"open-edge-platform/training_extensions","url":"https://github.com/open-edge-platform/training_extensions"},{"title":"PaddlePaddle/PaddleYOLO","url":"https://github.com/PaddlePaddle/PaddleYOLO"},{"title":"open-edge-platform/geti","url":"https://github.com/open-edge-platform/geti"},{"title":"yxb-nku/strip-r-cnn","url":"https://github.com/yxb-nku/strip-r-cnn"},{"title":"HVision-NKU/Strip-R-CNN","url":"https://github.com/HVision-NKU/Strip-R-CNN"},{"title":"fiveai/MoCaE","url":"https://github.com/fiveai/MoCaE"},{"title":"yuyi1005/point2rbox-mmrotate","url":"https://github.com/yuyi1005/point2rbox-mmrotate"},{"title":"cszzshi/SimD","url":"https://github.com/cszzshi/SimD"},{"title":"CycloneBoy/PPDetectionPytorch","url":"https://github.com/CycloneBoy/PPDetectionPytorch"},{"title":"V3Det/mmdetection-V3Det","url":"https://github.com/V3Det/mmdetection-V3Det"},{"title":"RangiLyu/mmdetection_test","url":"https://github.com/RangiLyu/mmdetection_test"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/rtmdet-an-empirical-study-of-designing-real","title":"RTMDet: An Empirical Study of Designing Real-Time Object Detectors","date":"2022-12-14","rows_on_this_dataset":1,"code_links":14,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":3,"samples_unverified":17,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/ernie-unix2-a-unified-cross-lingual-cross","title":"ERNIE-UniX2: A Unified Cross-lingual Cross-modal Framework for Understanding and Generation","date":"2022-11-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/distill-the-image-to-nowhere-inversion","title":"Distill the Image to Nowhere: Inversion Knowledge Distillation for Multimodal Machine Translation","date":"2022-10-10","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/gumbel-attention-for-multi-modal-machine","title":"Gumbel-Attention for Multi-modal Machine Translation","date":"2021-03-16","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/generative-imagination-elevates-machine","title":"Generative Imagination Elevates Machine Translation","date":"2020-09-21","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/dynamic-context-guided-capsule-network-for","title":"Dynamic Context-guided Capsule Network for Multimodal Machine Translation","date":"2020-09-04","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multimodal-transformer-for-multimodal-machine","title":"Multimodal Transformer for Multimodal Machine Translation","date":"2020-07-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/self-knowledge-distillation-a-simple-way-for","title":"Self-Knowledge Distillation with Progressive Refinement of Targets","date":"2020-06-22","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multimodal-machine-translation-through","title":"Multimodal Machine Translation through Visuals and Speech","date":"2019-11-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/distilling-translations-with-visual-awareness","title":"Distilling Translations with Visual Awareness","date":"2019-06-18","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/latent-visual-cues-for-neural-machine","title":"Latent Variable Model for Multi-modal Translation","date":"2018-11-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/a-visual-attention-grounding-neural-model-for","title":"A Visual Attention Grounding Neural Model for Multimodal Machine Translation","date":"2018-08-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/attention-is-all-you-need","title":"Attention Is All You Need","date":"2017-06-12","rows_on_this_dataset":1,"code_links":595,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":946,"samples_ran":600,"samples_unverified":346,"pointer_only_for_licence":451,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/doubly-attentive-decoder-for-multi-modal","title":"Doubly-Attentive Decoder for Multi-modal Neural Machine Translation","date":"2017-02-04","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/incorporating-global-visual-features-into","title":"Incorporating Global Visual Features into Attention-Based Neural Machine Translation","date":"2017-01-23","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":4,"samples_harvested":976,"samples_ran":611,"samples_unverified":365,"pointer_only_for_licence":456,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}