{"url":"/dataset/commercialadsdataset","name":"CommercialAdsDataset","full_name":"CommercialAdsDataset","description_markdown":"A large commercial Ads Dataset includes 480K labeled query-ad pairwise data with structured information of image, title, seller, description, and so on.","description_withheld":null,"homepage":"https://github.com/microsoft/CommercialAdsDataset","introduced_date":"2022-10-10","introduced_date_note":null,"introduced_by":{"paper":"/paper/adscvlr-commercial-visual-linguistic","title":"AdsCVLR: Commercial Visual-Linguistic Representation Modeling in Sponsored Search","first_author":"Yongjie Zhu","url":null},"license":null,"modalities":[],"tasks":[{"name":"Image-text matching","url":"/task/image-text-matching","datasets_with_task":"/datasets/task/image-text-matching"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["CommercialAdsDataset"],"data_loaders":[],"num_papers_in_archive":8,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/image-text-matching-on-commercialadsdataset","task":"Image-text matching","dataset_variant":"CommercialAdsDataset","rows":8,"metrics":["ADD(S) AUC"],"first_row_in_archive_order":{"model":"AlignCMSS","paper":"/paper/align-before-search-aligning-ads-image-to","metrics":{"ADD(S) AUC":"91.73"},"code_links":[{"title":"pter61/aligncmss","url":"https://github.com/pter61/aligncmss"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/align-before-search-aligning-ads-image-to","title":"Align before Search: Aligning Ads Image to Text for Accurate Cross-Modal Sponsored Search","date":"2023-09-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/adscvlr-commercial-visual-linguistic","title":"AdsCVLR: Commercial Visual-Linguistic Representation Modeling in Sponsored Search","date":"2022-10-10","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/blip-bootstrapping-language-image-pre","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","date":"2022-01-28","rows_on_this_dataset":1,"code_links":9,"syntology":null},{"paper":"/paper/align-before-fuse-vision-and-language","title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation","date":"2021-07-16","rows_on_this_dataset":1,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":3,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vinvl-making-visual-representations-matter-in","title":"VinVL: Revisiting Visual Representations in Vision-Language Models","date":"2021-01-02","rows_on_this_dataset":1,"code_links":7,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/oscar-object-semantics-aligned-pre-training","title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks","date":"2020-04-13","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":23,"samples_ran":11,"samples_unverified":12,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/vl-bert-pre-training-of-generic-visual","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","date":"2019-08-22","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/unicoder-vl-a-universal-encoder-for-vision","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","date":"2019-08-16","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":4,"samples_harvested":31,"samples_ran":16,"samples_unverified":15,"pointer_only_for_licence":4,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}