{"url":"/dataset/referit3d","name":"ReferIt3D","full_name":null,"description_markdown":"ReferIt3D provides two large-scale and complementary visio-linguistic datasets: i) Sr3D, which contains 83.5K template-based utterances leveraging spatial relations among fine-grained object classes to localize a referred object in a scene, and ii) Nr3D which contains 41.5K natural, free-form, utterances collected by deploying a 2-player object reference game in 3D scenes. This dataset can be used for 3D visual grounding and 3D dense captioning tasks.","description_withheld":null,"homepage":"https://referit3d.github.io/","introduced_date":"2020-08-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/referit3d-neural-listeners-for-fine-grained","title":"ReferIt3D: Neural Listeners for Fine-Grained 3D Object Identification in Real-World Scenes","first_author":"Panos Achlioptas","url":null},"license":null,"modalities":[{"name":"Texts","url":"/datasets/modality/texts"},{"name":"3D","url":"/datasets/modality/3d"},{"name":"Point cloud","url":"/datasets/modality/point-cloud"}],"tasks":[{"name":"3D dense captioning","url":"/task/3d-dense-captioning","datasets_with_task":"/datasets/task/3d-dense-captioning"},{"name":"Natural Language Visual Grounding","url":"/task/natural-language-visual-grounding","datasets_with_task":"/datasets/task/natural-language-visual-grounding"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["ReferIt3D","Nr3D"],"data_loaders":[],"num_papers_in_archive":104,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/3d-dense-captioning-on-nr3d","task":"3D dense captioning","dataset_variant":"Nr3D","rows":10,"metrics":["CIDEr","BLEU-4","METEOR","ROUGE-L"],"first_row_in_archive_order":{"model":"3D CoCa","paper":"/paper/3d-coca-contrastive-learners-are-3d","metrics":{"BLEU-4":"29.29","CIDEr":"52.84","METEOR":"25.55","ROUGE-L":"56.43"},"code_links":[{"title":"AIGeeksGroup/3DCoCa","url":"https://github.com/AIGeeksGroup/3DCoCa"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/3d-coca-contrastive-learners-are-3d","title":"3D CoCa: Contrastive Learners are 3D Captioners","date":"2025-04-13","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/bi-directional-contextual-attention-for-3d","title":"Bi-directional Contextual Attention for 3D Dense Captioning","date":"2024-08-13","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/complete-3d-relationships-extraction-modality","title":"Complete 3d relationships extraction modality alignment network for 3d dense captioning","date":"2024-08-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/vote2cap-detr-decoupling-localization-and","title":"Vote2Cap-DETR++: Decoupling Localization and Describing for End-to-End 3D Dense Captioning","date":"2023-09-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/end-to-end-3d-dense-captioning-with-vote2cap","title":"End-to-End 3D Dense Captioning with Vote2Cap-DETR","date":"2023-01-06","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/contextual-modeling-for-3d-dense-captioning","title":"Contextual Modeling for 3D Dense Captioning on Point Clouds","date":"2022-10-08","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/spatiality-guided-transformer-for-3d-dense","title":"Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds","date":"2022-04-22","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/3djcg-a-unified-framework-for-joint-dense","title":"3DJCG: A Unified Framework for Joint Dense Captioning and Visual Grounding on 3D Point Clouds","date":"2022-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/d3net-a-speaker-listener-architecture-for","title":"D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual Grounding","date":"2021-12-02","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/scan2cap-context-aware-dense-captioning-in","title":"Scan2Cap: Context-aware Dense Captioning in RGB-D Scans","date":"2020-12-03","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":1,"samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}