{"url":"/task/information-retrieval","name":"Information Retrieval","slug":"information-retrieval","description_markdown":"Information retrieval is the task of ranking a list of documents or search results in response to a query\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [sudhanshumittal](https://github.com/sudhanshumittal/Information-retrieval-system) )</span>","categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":4740,"papers_with_code":1188,"benchmarks":11,"benchmark_tables_in_archive":33,"benchmark_tables_shown":33,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":93,"subtasks":6,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/information-retrieval-on-bsard","slug":"information-retrieval-on-bsard","dataset":"BSARD","dataset_url":"/dataset/bsard","rows_in_archive":3,"metrics":["Recall@100","Recall@200","Recall@500"],"first_row_in_archive_order":{"model":"Two-tower Bi-Encoder (RoBERTa)","paper_title":"A Statutory Article Retrieval Dataset in French","paper_url":"/paper/a-statutory-article-retrieval-dataset-in","paper_date":"2021-08-26","arxiv_id":"2108.11792","code_links":[{"title":"maastrichtlawtech/bsard","url":"https://github.com/maastrichtlawtech/bsard"}],"syntology":null}},{"leaderboard":"/sota/information-retrieval-on-ms-marco","slug":"information-retrieval-on-ms-marco","dataset":"MS MARCO","dataset_url":"/dataset/ms-marco","rows_in_archive":3,"metrics":["Time (ms)","MRR@10"],"first_row_in_archive_order":{"model":"ConAE-128","paper_title":"Dimension Reduction for Efficient Dense Retrieval via Conditional Autoencoder","paper_url":"/paper/dimension-reduction-for-efficient-dense","paper_date":"2022-05-06","arxiv_id":"2205.03284","code_links":[{"title":"neuir/conae","url":"https://github.com/neuir/conae"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/information-retrieval-on-cqadupstack","slug":"information-retrieval-on-cqadupstack","dataset":"CQADupStack","dataset_url":"/dataset/cqadupstack","rows_in_archive":2,"metrics":["mAP@100"],"first_row_in_archive_order":{"model":"SGPT-BE-5.8B","paper_title":"SGPT: GPT Sentence Embeddings for Semantic Search","paper_url":"/paper/sgpt-gpt-sentence-embeddings-for-semantic","paper_date":"2022-02-17","arxiv_id":"2202.08904","code_links":[{"title":"muennighoff/sgpt","url":"https://github.com/muennighoff/sgpt"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/information-retrieval-on-trec-pm","slug":"information-retrieval-on-trec-pm","dataset":"TREC-PM","dataset_url":null,"rows_in_archive":2,"metrics":["infNDCG"],"first_row_in_archive_order":{"model":"hpipubcommon","paper_title":"HPI-DHC at TREC 2018 Precision Medicine Track","paper_url":"/paper/hpi-dhc-at-trec-2018-precision-medicine-track","paper_date":"2018-11-14","arxiv_id":null,"code_links":[{"title":"hpi-dhc/trec-pm","url":"https://github.com/hpi-dhc/trec-pm"}],"syntology":null}},{"leaderboard":"/sota/information-retrieval-on","slug":"information-retrieval-on","dataset":"!(()&&!|*|*|","dataset_url":null,"rows_in_archive":1,"metrics":["10-20% Mask PSNR"],"first_row_in_archive_order":{"model":"rana ijt","paper_title":"SegCV : Eficient parsing of r\\'esum\\'es with analysis and correction of errors (SegCV : traitement efficace de CV avec analyse et correction d'erreurs) [in French]","paper_url":"/paper/segcv-eficient-parsing-of-resumes-with","paper_date":"2013-06-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/information-retrieval-on-amazon","slug":"information-retrieval-on-amazon","dataset":"Amazon","dataset_url":null,"rows_in_archive":1,"metrics":["HR@30"],"first_row_in_archive_order":{"model":"MIND","paper_title":"Multi-Interest Network with Dynamic Routing for Recommendation at Tmall","paper_url":"/paper/multi-interest-network-with-dynamic-routing","paper_date":"2019-04-17","arxiv_id":"1904.08030","code_links":[{"title":"PaddlePaddle/PaddleRec","url":"https://github.com/PaddlePaddle/PaddleRec/tree/release/2.1.0/models/recall/mind"},{"title":"shenweichen/deepmatch","url":"https://github.com/shenweichen/deepmatch"},{"title":"alibaba/easyrec","url":"https://github.com/alibaba/easyrec"},{"title":"UlionTse/mlgb","url":"https://github.com/UlionTse/mlgb"},{"title":"alibaba/TorchEasyRec","url":"https://github.com/alibaba/TorchEasyRec"},{"title":"Wang-Yu-Qing/MIND","url":"https://github.com/Wang-Yu-Qing/MIND"}],"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/information-retrieval-on-mslr-web30k","slug":"information-retrieval-on-mslr-web30k","dataset":"MSLR-WEB30K","dataset_url":"/dataset/mslr-web30k-1","rows_in_archive":1,"metrics":["nDCG@10"],"first_row_in_archive_order":{"model":"Distilled Network","paper_title":"Distilled Neural Networks for Efficient Learning to Rank","paper_url":"/paper/distilled-neural-networks-for-efficient","paper_date":"2022-02-22","arxiv_id":"2202.10728","code_links":[{"title":"hpclab/efficient_nn_for_ltr","url":"https://github.com/hpclab/efficient_nn_for_ltr"}],"syntology":null}},{"leaderboard":"/sota/information-retrieval-on-msmarco","slug":"information-retrieval-on-msmarco","dataset":"MSMARCO","dataset_url":"/dataset/ms-marco","rows_in_archive":1,"metrics":["MRR@10"],"first_row_in_archive_order":{"model":"RetroMAE","paper_title":"RetroMAE: Pre-Training Retrieval-oriented Language Models Via Masked Auto-Encoder","paper_url":"/paper/retromae-pre-training-retrieval-oriented","paper_date":"2022-05-24","arxiv_id":"2205.12035","code_links":[{"title":"staoxiao/retromae","url":"https://github.com/staoxiao/retromae"}],"syntology":null}},{"leaderboard":"/sota/information-retrieval-on-mteb","slug":"information-retrieval-on-mteb","dataset":"MTEB","dataset_url":"/dataset/mteb","rows_in_archive":1,"metrics":["nDCG@10"],"first_row_in_archive_order":{"model":"SGPT-5.8B-msmarco","paper_title":"MTEB: Massive Text Embedding Benchmark","paper_url":"/paper/mteb-massive-text-embedding-benchmark","paper_date":"2022-10-13","arxiv_id":"2210.07316","code_links":[{"title":"embeddings-benchmark/mteb","url":"https://github.com/embeddings-benchmark/mteb"},{"title":"lyon-nlp/mteb-french","url":"https://github.com/lyon-nlp/mteb-french"},{"title":"climsocana/tecb-de","url":"https://github.com/climsocana/tecb-de"},{"title":"wadoodabdul/clinical_ner_benchmark","url":"https://github.com/wadoodabdul/clinical_ner_benchmark"},{"title":"basf/chemteb","url":"https://github.com/basf/chemteb"}],"syntology":{"n":13,"n_ran":3,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/information-retrieval-on-news-headlines","slug":"information-retrieval-on-news-headlines","dataset":"News Headlines","dataset_url":null,"rows_in_archive":1,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"Information Retrieval + SVM","paper_title":"Recognition of Sarcasms in Tweets Based on Concept Level Sentiment Analysis and Supervised Learning Approaches","paper_url":"/paper/recognition-of-sarcasms-in-tweets-based-on","paper_date":"2014-12-01","arxiv_id":null,"code_links":[{"title":"WahajJaved20/Sarcasm_Detection-Feature_Selection","url":"https://github.com/WahajJaved20/Sarcasm_Detection-Feature_Selection"}],"syntology":null}},{"leaderboard":"/sota/information-retrieval-on-ohsumed","slug":"information-retrieval-on-ohsumed","dataset":"Ohsumed","dataset_url":"/dataset/ohsumed","rows_in_archive":1,"metrics":["NDCG"],"first_row_in_archive_order":{"model":"BERT+CONCEPT FILTER","paper_title":"Semantic Enrichment of Pretrained Embedding Output for Unsupervised IR","paper_url":"/paper/semantic-enrichment-of-pretrained-embedding","paper_date":"2021-03-24","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":null,"slug":"information-retrieval-on-ai-hub-legal-qa-data","dataset":"AI HUB legal QA data","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@10","Cosine Map@100","Cosine Map@50","Cosine Mrr@10","Cosine Mrr@100","Cosine Mrr@50","Cosine Ndcg@10","Cosine Ndcg@5","Cosine Precision@1","Cosine Recall@1"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-dim-1024","dataset":"dim 1024","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-dim-128","dataset":"dim 128","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-dim-256","dataset":"dim 256","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-dim-512","dataset":"dim 512","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-dim-64","dataset":"dim 64","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-dim-768","dataset":"dim 768","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-evaluate","dataset":"Evaluate","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5","Dot Accuracy@1","Dot Accuracy@10","Dot Accuracy@3","Dot Accuracy@5","Dot Map@100","Dot Mrr@10","Dot Ndcg@10","Dot Precision@1","Dot Precision@10","Dot Precision@3","Dot Precision@5","Dot Recall@1","Dot Recall@10","Dot Recall@3","Dot Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-germanquad","dataset":"GermanQuAD","dataset_url":"/dataset/germanquad","rows_in_archive":0,"metrics":["Mean Reciprocal Rank","Recall@1","Recall@10","Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanoarguana","dataset":"NanoArguAna","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanodbpedia","dataset":"NanoDBPedia","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanofever","dataset":"NanoFEVER","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanofiqa2018","dataset":"NanoFiQA2018","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanohotpotqa","dataset":"NanoHotpotQA","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanomsmarco","dataset":"NanoMSMARCO","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanonfcorpus","dataset":"NanoNFCorpus","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanonq","dataset":"NanoNQ","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanoquoraretrieval","dataset":"NanoQuoraRetrieval","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanoscidocs","dataset":"NanoSCIDOCS","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanoscifact","dataset":"NanoSciFact","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-nanotouche2020","dataset":"NanoTouche2020","dataset_url":null,"rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null},{"leaderboard":null,"slug":"information-retrieval-on-unknown","dataset":"Unknown","dataset_url":"/dataset/conll-2003","rows_in_archive":0,"metrics":["Cosine Accuracy@1","Cosine Accuracy@10","Cosine Accuracy@3","Cosine Accuracy@5","Cosine Map@100","Cosine Mrr@10","Cosine Ndcg@10","Cosine Precision@1","Cosine Precision@10","Cosine Precision@3","Cosine Precision@5","Cosine Recall@1","Cosine Recall@10","Cosine Recall@3","Cosine Recall@5"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/ms-marco","name":"MS MARCO","full_name":"Microsoft Machine Reading Comprehension Dataset","num_papers_in_archive":1036},{"url":"/dataset/conll-2003","name":"CoNLL 2003","full_name":"","num_papers_in_archive":755},{"url":"/dataset/bioasq","name":"BioASQ","full_name":"Biomedical Semantic Indexing and Question Answering","num_papers_in_archive":192},{"url":"/dataset/cord-19","name":"CORD-19","full_name":"CORD-19","num_papers_in_archive":163},{"url":"/dataset/mteb","name":"MTEB","full_name":"Massive Text Embedding Benchmark","num_papers_in_archive":155},{"url":"/dataset/fma","name":"FMA","full_name":"Free Music Archive","num_papers_in_archive":128},{"url":"/dataset/publaynet","name":"PubLayNet","full_name":"","num_papers_in_archive":123},{"url":"/dataset/qasc","name":"QASC","full_name":"Question Answering via Sentence Composition","num_papers_in_archive":114},{"url":"/dataset/trec-covid","name":"TREC-COVID","full_name":"","num_papers_in_archive":73},{"url":"/dataset/medleydb","name":"MedleyDB","full_name":"","num_papers_in_archive":47},{"url":"/dataset/mlsum","name":"MLSUM","full_name":"MultiLingual SUMmarization","num_papers_in_archive":45},{"url":"/dataset/insuranceqa","name":"InsuranceQA","full_name":"","num_papers_in_archive":38},{"url":"/dataset/mslr-web10k","name":"MSLR-WEB10K","full_name":"","num_papers_in_archive":36},{"url":"/dataset/scitsr","name":"SciTSR","full_name":null,"num_papers_in_archive":36},{"url":"/dataset/mq2007","name":"MQ2007","full_name":"","num_papers_in_archive":32},{"url":"/dataset/guitarset","name":"GuitarSet","full_name":null,"num_papers_in_archive":31},{"url":"/dataset/mq2008","name":"MQ2008","full_name":"","num_papers_in_archive":31},{"url":"/dataset/mslr-web30k-1","name":"MSLR-WEB30K","full_name":"","num_papers_in_archive":31},{"url":"/dataset/wikireading","name":"WikiReading","full_name":"","num_papers_in_archive":26},{"url":"/dataset/asnq","name":"ASNQ","full_name":"Answer Sentence Natural Questions","num_papers_in_archive":25},{"url":"/dataset/learning-to-rank-challenge","name":"Learning to Rank Challenge","full_name":"Yahoo! Learning to Rank Challenge","num_papers_in_archive":25},{"url":"/dataset/arcd","name":"ARCD","full_name":"","num_papers_in_archive":24},{"url":"/dataset/headqa","name":"HeadQA","full_name":"","num_papers_in_archive":23},{"url":"/dataset/george-washington","name":"George Washington","full_name":"George Washington","num_papers_in_archive":20},{"url":"/dataset/ikala","name":"iKala","full_name":"","num_papers_in_archive":20},{"url":"/dataset/qulac","name":"Qulac","full_name":null,"num_papers_in_archive":19},{"url":"/dataset/doqa","name":"DoQA","full_name":"","num_papers_in_archive":18},{"url":"/dataset/orcas","name":"ORCAS","full_name":"","num_papers_in_archive":18},{"url":"/dataset/orconvqa","name":"ORConvQA","full_name":"Open-Retrieval Conversational Question Answering","num_papers_in_archive":17},{"url":"/dataset/juice","name":"JuICe","full_name":"JuICe Dataset","num_papers_in_archive":16},{"url":"/dataset/tripclick","name":"TripClick","full_name":"","num_papers_in_archive":16},{"url":"/dataset/covidqa","name":"CovidQA","full_name":"","num_papers_in_archive":15},{"url":"/dataset/robust04","name":"Robust04","full_name":"","num_papers_in_archive":13},{"url":"/dataset/clariq","name":"ClariQ","full_name":"","num_papers_in_archive":11},{"url":"/dataset/ohsumed","name":"Ohsumed","full_name":"","num_papers_in_archive":11},{"url":"/dataset/reqa","name":"ReQA","full_name":"Retrieval Question-Answering","num_papers_in_archive":10},{"url":"/dataset/clirmatrix","name":"CLIRMatrix","full_name":"","num_papers_in_archive":9},{"url":"/dataset/clueweb22","name":"ClueWeb22","full_name":"","num_papers_in_archive":9},{"url":"/dataset/giantmidi-piano","name":"GiantMIDI-Piano","full_name":"","num_papers_in_archive":9},{"url":"/dataset/scirepeval","name":"SciRepEval","full_name":"","num_papers_in_archive":9},{"url":"/dataset/standardized-project-gutenberg-corpus","name":"Standardized Project Gutenberg Corpus","full_name":null,"num_papers_in_archive":9},{"url":"/dataset/germanquad","name":"GermanQuAD","full_name":"","num_papers_in_archive":8},{"url":"/dataset/openmic-2018","name":"OpenMIC-2018","full_name":null,"num_papers_in_archive":8},{"url":"/dataset/quasar-s","name":"QUASAR-S","full_name":"QUestion Answering by Search And Reading – Stack Overflow","num_papers_in_archive":8},{"url":"/dataset/wands","name":"WANDS","full_name":"Wayfair ANnotation Dataset","num_papers_in_archive":8},{"url":"/dataset/hirest","name":"HiREST","full_name":"HIerarchical REtrieval and STep-captioning","num_papers_in_archive":7},{"url":"/dataset/mssd","name":"MSSD","full_name":"Music Streaming Sessions Dataset","num_papers_in_archive":7},{"url":"/dataset/arcov-19","name":"ArCOV-19","full_name":"","num_papers_in_archive":6},{"url":"/dataset/bsard","name":"BSARD","full_name":"Belgian Statutory Article Retrieval Dataset","num_papers_in_archive":6},{"url":"/dataset/microsoft-research-social-media-conversation","name":"Microsoft Research Social Media Conversation Corpus","full_name":"","num_papers_in_archive":6},{"url":"/dataset/tutorialbank","name":"TutorialBank","full_name":"","num_papers_in_archive":6},{"url":"/dataset/coached-conversational-preference-elicitation","name":"Coached Conversational Preference Elicitation","full_name":"","num_papers_in_archive":5},{"url":"/dataset/cqadupstack","name":"CQADupStack","full_name":"","num_papers_in_archive":5},{"url":"/dataset/grep-biasir","name":"Grep-BiasIR","full_name":"Gender Representation-Bias for Information Retrieval","num_papers_in_archive":5},{"url":"/dataset/nfcorpus","name":"NFCorpus","full_name":"","num_papers_in_archive":5},{"url":"/dataset/bach-doodle","name":"Bach Doodle","full_name":"Bach Doodle","num_papers_in_archive":4},{"url":"/dataset/ccpe-m","name":"CCPE-M","full_name":"Coached Conversational Preference Elicitation dataset for Movies","num_papers_in_archive":4},{"url":"/dataset/goal","name":"Goal","full_name":"","num_papers_in_archive":4},{"url":"/dataset/goodsounds","name":"GoodSounds","full_name":null,"num_papers_in_archive":4},{"url":"/dataset/i2b2-de-identification-dataset","name":"i2b2 De-identification Dataset","full_name":"Informatics for Integrating Biology and the Bedside (i2b2) Project — De-identification Dataset","num_papers_in_archive":4},{"url":"/dataset/mumu","name":"MuMu","full_name":"","num_papers_in_archive":4},{"url":"/dataset/sv-ident","name":"SV-Ident","full_name":"Survey Variable Identification","num_papers_in_archive":4},{"url":"/dataset/wikiclir","name":"WikiCLIR","full_name":"","num_papers_in_archive":4},{"url":"/dataset/cosian","name":"COSIAN","full_name":"a collection of singing voice annotation","num_papers_in_archive":3},{"url":"/dataset/dawt","name":"DAWT","full_name":"Densely Annotated Wikipedia Texts","num_papers_in_archive":3},{"url":"/dataset/italian-crime-news","name":"DICE: a Dataset of Italian Crime Event news","full_name":"from Gazzetta di Modena [2011-2021]","num_papers_in_archive":3},{"url":"/dataset/perkey","name":"PerKey","full_name":"","num_papers_in_archive":3},{"url":"/dataset/resq","name":"ResQ","full_name":"Real-world Spatial Question Answering","num_papers_in_archive":3},{"url":"/dataset/rp2k","name":"RP2K","full_name":"","num_papers_in_archive":3},{"url":"/dataset/trec-news-1","name":"TREC-News","full_name":"","num_papers_in_archive":3},{"url":"/dataset/triviahg","name":"TriviaHG","full_name":"","num_papers_in_archive":3},{"url":"/dataset/boostclir","name":"BoostCLIR","full_name":"","num_papers_in_archive":2},{"url":"/dataset/large-scale-clir-dataset","name":"Large-Scale CLIR Dataset","full_name":"","num_papers_in_archive":2},{"url":"/dataset/orcas-i","name":"ORCAS-I","full_name":"Queries Annotated with Intent using Weak Supervision","num_papers_in_archive":2},{"url":"/dataset/threatgram-101-extreme-telegram-data","name":"ThreatGram 101 - Extreme Telegram Data","full_name":"ThreatGram 101 - Extreme Telegram Replies Data with Threat Levels","num_papers_in_archive":2},{"url":"/dataset/twitter-conversations-dataset","name":"Twitter Conversations Dataset","full_name":"","num_papers_in_archive":2},{"url":"/dataset/webis-touche-2020","name":"Webis-Touché-2020","full_name":"","num_papers_in_archive":2},{"url":"/dataset/compmix-ir","name":"CompMix-IR","full_name":"","num_papers_in_archive":1},{"url":"/dataset/cosqa-1","name":"CoSQA+","full_name":"CoSQA_Plus","num_papers_in_archive":1},{"url":"/dataset/diaforge-utc-r-0725","name":"diaforge-utc-r-0725","full_name":"DiaFORGE UTC: Unified Tool-Calling Conversations Dataset","num_papers_in_archive":1},{"url":"/dataset/fz-queries","name":"FZ queries","full_name":"FindZebra queries","num_papers_in_archive":1},{"url":"/dataset/glare","name":"GLARE","full_name":"Guided LexRank for Advanced Retrieval in Legal Analysis","num_papers_in_archive":1},{"url":"/dataset/metaclir","name":"MetaCLIR","full_name":"","num_papers_in_archive":1},{"url":"/dataset/opendebateevidence","name":"OpenDebateEvidence","full_name":"","num_papers_in_archive":1},{"url":"/dataset/persian-reverse-dictionary-dataset","name":"Persian Reverse Dictionary Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/phrase-in-context","name":"Phrase-in-Context","full_name":"Phrase-in-Context","num_papers_in_archive":1},{"url":"/dataset/urdu-msmarco","name":"Urdu MsMarco","full_name":"","num_papers_in_archive":1},{"url":"/dataset/urdu-news-headlines-dataset","name":"Urdu News Headlines Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/wikipii","name":"WikiPII","full_name":"","num_papers_in_archive":1},{"url":"/dataset/wmt-2014-medical","name":"WMT 2014 Medical","full_name":"WMT 2014 Medical Translation Task","num_papers_in_archive":1},{"url":"/dataset/medleydb-2-0","name":"MedleyDB 2.0","full_name":null,"num_papers_in_archive":0},{"url":"/dataset/nian","name":"NIAN","full_name":"Needle in a Needlestack","num_papers_in_archive":0},{"url":"/dataset/panacea","name":"PANACEA","full_name":"PANACEA dataset - Heterogeneous COVID-19 Claims","num_papers_in_archive":0}],"subtasks":[{"url":"/task/cross-lingual-information-retrieval","name":"Cross-Lingual Information Retrieval"},{"url":"/task/passage-retrieval","name":"Passage Retrieval"},{"url":"/task/scientific-results-extraction","name":"Scientific Results Extraction"},{"url":"/task/table-search","name":"Table Search"},{"url":"/task/tar","name":"TAR"},{"url":"/task/zero-shot-on-beir-inference-free-model","name":"Zero Shot on BEIR (Inference Free Model)"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":1188,"tagged_in_all":4740,"items":[{"url":"/paper/modeling-relational-data-with-graph","title":"Modeling Relational Data with Graph Convolutional Networks","date":"2017-03-17","arxiv_id":"1703.06103","repositories_listed":27,"syntology":{"n":32,"n_ran":10,"n_unverified":22,"n_pointer_only":15}},{"url":"/paper/transfertransfo-a-transfer-learning-approach","title":"TransferTransfo: A Transfer Learning Approach for Neural Network Based Conversational Agents","date":"2019-01-23","arxiv_id":"1901.08149","repositories_listed":23,"syntology":{"n":26,"n_ran":8,"n_unverified":18,"n_pointer_only":7}},{"url":"/paper/codesearchnet-challenge-evaluating-the-state","title":"CodeSearchNet Challenge: Evaluating the State of Semantic Code Search","date":"2019-09-20","arxiv_id":"1909.09436","repositories_listed":14,"syntology":{"n":17,"n_ran":8,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/product-based-neural-networks-for-user-1","title":"Product-based Neural Networks for User Response Prediction over Multi-field Categorical Data","date":"2018-07-01","arxiv_id":"1807.00311","repositories_listed":10,"syntology":null},{"url":"/paper/declarative-experimentation-in-information","title":"Declarative Experimentation in Information Retrieval using PyTerrier","date":"2020-07-28","arxiv_id":"2007.14271","repositories_listed":9,"syntology":null},{"url":"/paper/colbert-efficient-and-effective-passage","title":"ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT","date":"2020-04-27","arxiv_id":"2004.12832","repositories_listed":9,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/deep-learning-based-recommender-system-a","title":"Deep Learning based Recommender System: A Survey and New Perspectives","date":"2017-07-24","arxiv_id":"1707.07435","repositories_listed":8,"syntology":null},{"url":"/paper/deep-neural-networks-for-youtube","title":"Deep Neural Networks for YouTube Recommendations","date":"2016-09-07","arxiv_id":null,"repositories_listed":7,"syntology":null},{"url":"/paper/towards-unsupervised-dense-information","title":"Unsupervised Dense Information Retrieval with Contrastive Learning","date":"2021-12-16","arxiv_id":"2112.09118","repositories_listed":6,"syntology":{"n":5,"n_ran":1,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/jointly-optimizing-query-encoder-and-product","title":"Jointly Optimizing Query Encoder and Product Quantization to Improve Retrieval Performance","date":"2021-08-02","arxiv_id":"2108.00644","repositories_listed":6,"syntology":null},{"url":"/paper/integrating-semantics-and-neighborhood","title":"Integrating Semantics and Neighborhood Information with Graph-Driven Generative Models for Document Retrieval","date":"2021-05-27","arxiv_id":"2105.13066","repositories_listed":6,"syntology":null},{"url":"/paper/tsdae-using-transformer-based-sequential","title":"TSDAE: Using Transformer-based Sequential Denoising Auto-Encoder for Unsupervised Sentence Embedding Learning","date":"2021-04-14","arxiv_id":"2104.06979","repositories_listed":6,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/image-based-table-recognition-data-model-and","title":"Image-based table recognition: data, model, and evaluation","date":"2019-11-25","arxiv_id":"1911.10683","repositories_listed":6,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/multi-interest-network-with-dynamic-routing","title":"Multi-Interest Network with Dynamic Routing for Recommendation at Tmall","date":"2019-04-17","arxiv_id":"1904.08030","repositories_listed":6,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/music-artist-classification-with","title":"Music Artist Classification with Convolutional Recurrent Neural Networks","date":"2019-01-14","arxiv_id":"1901.04555","repositories_listed":6,"syntology":null},{"url":"/paper/mteb-massive-text-embedding-benchmark","title":"MTEB: Massive Text Embedding Benchmark","date":"2022-10-13","arxiv_id":"2210.07316","repositories_listed":5,"syntology":{"n":13,"n_ran":3,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/infinite-recommendation-networks-a-data","title":"Infinite Recommendation Networks: A Data-Centric Approach","date":"2022-06-03","arxiv_id":"2206.02626","repositories_listed":5,"syntology":{"n":13,"n_ran":6,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/active-learning-in-annotating-micro-blogs","title":"Active learning in annotating micro-blogs dealing with e-reputation","date":"2017-06-16","arxiv_id":"1706.05349","repositories_listed":5,"syntology":null},{"url":"/paper/regnlp-in-action-facilitating-compliance","title":"RIRAG: Regulatory Information Retrieval and Answer Generation","date":"2024-09-09","arxiv_id":"2409.05677","repositories_listed":4,"syntology":null},{"url":"/paper/mustango-toward-controllable-text-to-music","title":"Mustango: Toward Controllable Text-to-Music Generation","date":"2023-11-14","arxiv_id":"2311.08355","repositories_listed":4,"syntology":{"n":9,"n_ran":7,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/one-embedder-any-task-instruction-finetuned","title":"One Embedder, Any Task: Instruction-Finetuned Text Embeddings","date":"2022-12-19","arxiv_id":"2212.09741","repositories_listed":4,"syntology":{"n":20,"n_ran":10,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/learning-discrete-representations-via-1","title":"Learning Discrete Representations via Constrained Clustering for Effective and Efficient Dense Retrieval","date":"2021-10-12","arxiv_id":"2110.05789","repositories_listed":4,"syntology":{"n":22,"n_ran":5,"n_unverified":17,"n_pointer_only":0}},{"url":"/paper/optimizing-dense-retrieval-model-training","title":"Optimizing Dense Retrieval Model Training with Hard Negatives","date":"2021-04-16","arxiv_id":"2104.08051","repositories_listed":4,"syntology":null},{"url":"/paper/distilling-knowledge-from-reader-to-retriever-1","title":"Distilling Knowledge from Reader to Retriever for Question Answering","date":"2020-12-08","arxiv_id":"2012.04584","repositories_listed":4,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/cord-19-the-covid-19-open-research-dataset","title":"CORD-19: The COVID-19 Open Research Dataset","date":"2020-04-22","arxiv_id":"2004.10706","repositories_listed":4,"syntology":null},{"url":"/paper/bi-directional-lattice-recurrent-neural","title":"Bi-Directional Lattice Recurrent Neural Networks for Confidence Estimation","date":"2018-10-30","arxiv_id":"1810.13024","repositories_listed":4,"syntology":null},{"url":"/paper/revisiting-singing-voice-detection-a","title":"Revisiting Singing Voice Detection: a Quantitative Review and the Future Outlook","date":"2018-06-04","arxiv_id":"1806.01180","repositories_listed":4,"syntology":null},{"url":"/paper/neural-vector-spaces-for-unsupervised","title":"Neural Vector Spaces for Unsupervised Information Retrieval","date":"2017-08-09","arxiv_id":"1708.02702","repositories_listed":4,"syntology":null},{"url":"/paper/scdv-sparse-composite-document-vectors-using","title":"SCDV : Sparse Composite Document Vectors using soft clustering over distributional representations","date":"2016-12-20","arxiv_id":"1612.06778","repositories_listed":4,"syntology":null},{"url":"/paper/glove-global-vectors-for-word-representation","title":"GloVe: Global Vectors for Word Representation","date":"2014-10-01","arxiv_id":null,"repositories_listed":4,"syntology":null}],"syntology_records":14,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}