{"url":"/task/multilingual-nlp","name":"Multilingual NLP","slug":"multilingual-nlp","description_markdown":null,"categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":96,"papers_with_code":42,"benchmarks":0,"benchmark_tables_in_archive":0,"benchmark_tables_shown":0,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":8,"subtasks":0,"parent_tasks":0},"benchmarks":[],"datasets":[{"url":"/dataset/belebele","name":"Belebele","full_name":"","num_papers_in_archive":68},{"url":"/dataset/duolingo-staple-shared-task","name":"Duolingo STAPLE Shared Task","full_name":"","num_papers_in_archive":10},{"url":"/dataset/humset","name":"HumSet","full_name":"HumSet","num_papers_in_archive":2},{"url":"/dataset/m2qa","name":"M2QA","full_name":"Multi-domain Multilingual Question Answering","num_papers_in_archive":2},{"url":"/dataset/glare","name":"GLARE","full_name":"Guided LexRank for Advanced Retrieval in Legal Analysis","num_papers_in_archive":1},{"url":"/dataset/maked","name":"MAKED","full_name":"MultiModal MultiLingual Summarization and Keyword Extraction Dataset","num_papers_in_archive":1},{"url":"/dataset/mbbc","name":"mBBC dataset","full_name":"Multilingual BBC news","num_papers_in_archive":1},{"url":"/dataset/english-pashto-language-dataset-epld","name":"English-Pashto Language Dataset (EPLD)","full_name":"","num_papers_in_archive":0}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":42,"tagged_in_all":96,"items":[{"url":"/paper/unsupervised-cross-lingual-representation-1","title":"Unsupervised Cross-lingual Representation Learning at Scale","date":"2019-11-05","arxiv_id":"1911.02116","repositories_listed":35,"syntology":{"n":59,"n_ran":25,"n_unverified":34,"n_pointer_only":52}},{"url":"/paper/bloom-a-176b-parameter-open-access","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","date":"2022-11-09","arxiv_id":"2211.05100","repositories_listed":7,"syntology":{"n":11,"n_ran":2,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/language-agnostic-bert-sentence-embedding","title":"Language-agnostic BERT Sentence Embedding","date":"2020-07-03","arxiv_id":"2007.01852","repositories_listed":6,"syntology":null},{"url":"/paper/uqa-corpus-for-urdu-question-answering","title":"UQA: Corpus for Urdu Question Answering","date":"2024-05-02","arxiv_id":"2405.01458","repositories_listed":3,"syntology":null},{"url":"/paper/what-is-typological-diversity-in-nlp","title":"What is \"Typological Diversity\" in NLP?","date":"2024-02-06","arxiv_id":"2402.04222","repositories_listed":2,"syntology":null},{"url":"/paper/crosslingual-transfer-learning-for-low","title":"Crosslingual Transfer Learning for Low-Resource Languages Based on Multilingual Colexification Graphs","date":"2023-05-22","arxiv_id":"2305.12818","repositories_listed":2,"syntology":null},{"url":"/paper/xeroalign-zero-shot-cross-lingual-transformer","title":"XeroAlign: Zero-Shot Cross-lingual Transformer Alignment","date":"2021-05-06","arxiv_id":"2105.02472","repositories_listed":2,"syntology":null},{"url":"/paper/pmindia-a-collection-of-parallel-corpora-of","title":"PMIndia -- A Collection of Parallel Corpora of Languages of India","date":"2020-01-27","arxiv_id":"2001.09907","repositories_listed":2,"syntology":null},{"url":"/paper/mmcr4nlp-multilingual-multiway-corpora","title":"MMCR4NLP: Multilingual Multiway Corpora Repository for Natural Language Processing","date":"2017-10-03","arxiv_id":"1710.01025","repositories_listed":2,"syntology":null},{"url":"/paper/news-without-borders-domain-adaptation-of","title":"News Without Borders: Domain Adaptation of Multilingual Sentence Embeddings for Cross-lingual News Recommendation","date":"2024-06-18","arxiv_id":"2406.12634","repositories_listed":1,"syntology":null},{"url":"/paper/proxylm-predicting-language-model-performance","title":"ProxyLM: Predicting Language Model Performance on Multilingual Tasks via Proxy Models","date":"2024-06-13","arxiv_id":"2406.09334","repositories_listed":1,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/analyzing-language-bias-between-french-and","title":"Analyzing Language Bias Between French and English in Conventional Multilingual Sentiment Analysis Models","date":"2024-05-07","arxiv_id":"2405.06692","repositories_listed":1,"syntology":null},{"url":"/paper/what-drives-performance-in-multilingual","title":"What Drives Performance in Multilingual Language Models?","date":"2024-04-29","arxiv_id":"2404.19159","repositories_listed":1,"syntology":null},{"url":"/paper/a-measure-for-transparent-comparison-of","title":"A Measure for Transparent Comparison of Linguistic Diversity in Multilingual NLP Data Sets","date":"2024-03-06","arxiv_id":"2403.03909","repositories_listed":1,"syntology":null},{"url":"/paper/self-augmented-in-context-learning-for","title":"Self-Augmented In-Context Learning for Unsupervised Word Translation","date":"2024-02-15","arxiv_id":"2402.10024","repositories_listed":1,"syntology":{"n":10,"n_ran":7,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/on-bilingual-lexicon-induction-with-large","title":"On Bilingual Lexicon Induction with Large Language Models","date":"2023-10-21","arxiv_id":"2310.13995","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/baitbuster-bangla-a-comprehensive-dataset-for","title":"BaitBuster-Bangla: A Comprehensive Dataset for Clickbait Detection in Bangla with Multi-Feature and Multi-Modal Analysis","date":"2023-10-13","arxiv_id":"2310.11465","repositories_listed":1,"syntology":null},{"url":"/paper/evaluating-the-effectiveness-of-capsule","title":"Evaluating The Effectiveness of Capsule Neural Network in Toxic Comment Classification using Pre-trained BERT Embeddings","date":"2023-10-12","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/monolingual-or-multilingual-instruction","title":"Monolingual or Multilingual Instruction Tuning: Which Makes a Better Alpaca","date":"2023-09-16","arxiv_id":"2309.08958","repositories_listed":1,"syntology":null},{"url":"/paper/xtreme-up-a-user-centric-scarce-data","title":"XTREME-UP: A User-Centric Scarce-Data Benchmark for Under-Represented Languages","date":"2023-05-19","arxiv_id":"2305.11938","repositories_listed":1,"syntology":{"n":11,"n_ran":0,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/pmindiasum-multilingual-and-cross-lingual","title":"PMIndiaSum: Multilingual and Cross-lingual Headline Summarization for Languages in India","date":"2023-05-15","arxiv_id":"2305.08828","repositories_listed":1,"syntology":null},{"url":"/paper/a-general-purpose-multilingual-document","title":"A General-Purpose Multilingual Document Encoder","date":"2023-05-11","arxiv_id":"2305.07016","repositories_listed":1,"syntology":null},{"url":"/paper/peach-pre-training-sequence-to-sequence","title":"PEACH: Pre-Training Sequence-to-Sequence Multilingual Models for Translation with Semi-Supervised Pseudo-Parallel Document Generation","date":"2023-04-03","arxiv_id":"2304.01282","repositories_listed":1,"syntology":null},{"url":"/paper/improving-bilingual-lexicon-induction-with-1","title":"Improving Bilingual Lexicon Induction with Cross-Encoder Reranking","date":"2022-10-30","arxiv_id":"2210.16953","repositories_listed":1,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/humset-dataset-of-multilingual-information","title":"HumSet: Dataset of Multilingual Information Extraction and Classification for Humanitarian Crisis Response","date":"2022-10-10","arxiv_id":"2210.04573","repositories_listed":1,"syntology":null},{"url":"/paper/detie-multilingual-open-information","title":"DetIE: Multilingual Open Information Extraction Inspired by Object Detection","date":"2022-06-24","arxiv_id":"2206.12514","repositories_listed":1,"syntology":null},{"url":"/paper/teddi-sample-text-data-diversity-sample-for","title":"TeDDi Sample: Text Data Diversity Sample for Language Comparison and Multilingual NLP","date":"2022-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/improving-word-translation-via-two-stage-1","title":"Improving Word Translation via Two-Stage Contrastive Learning","date":"2022-03-15","arxiv_id":"2203.08307","repositories_listed":1,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/improving-word-translation-via-two-stage","title":"Improving Word Translation via Two-Stage Contrastive Learning","date":"2021-11-16","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/wikineural-combined-neural-and-knowledge","title":"WikiNEuRal: Combined Neural and Knowledge-based Silver Data Creation for Multilingual NER","date":"2021-11-01","arxiv_id":null,"repositories_listed":1,"syntology":null}],"syntology_records":8,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}