{"url":"/task/cross-lingual-document-classification","name":"Cross-Lingual Document Classification","slug":"cross-lingual-document-classification","description_markdown":"Cross-lingual document classification refers to the task of using data and models available for one language for which ample such resources are available (e.g., English) to solve classification tasks in another, commonly low-resource, language.","categories":[{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":25,"papers_with_code":12,"benchmarks":10,"benchmark_tables_in_archive":10,"benchmark_tables_shown":10,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":2,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/cross-lingual-document-classification-on-1","slug":"cross-lingual-document-classification-on-1","dataset":"MLDoc Zero-Shot English-to-Spanish","dataset_url":"/dataset/mldoc","rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"XLMft UDA","paper_title":"Bridging the domain gap in cross-lingual document classification","paper_url":"/paper/bridging-the-domain-gap-in-cross-lingual","paper_date":"2019-09-16","arxiv_id":"1909.07009","code_links":[{"title":"laiguokun/xlu-data","url":"https://github.com/laiguokun/xlu-data"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}}},{"leaderboard":"/sota/cross-lingual-document-classification-on-2","slug":"cross-lingual-document-classification-on-2","dataset":"MLDoc Zero-Shot English-to-French","dataset_url":"/dataset/mldoc","rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"XLMft UDA","paper_title":"Bridging the domain gap in cross-lingual document classification","paper_url":"/paper/bridging-the-domain-gap-in-cross-lingual","paper_date":"2019-09-16","arxiv_id":"1909.07009","code_links":[{"title":"laiguokun/xlu-data","url":"https://github.com/laiguokun/xlu-data"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}}},{"leaderboard":"/sota/cross-lingual-document-classification-on","slug":"cross-lingual-document-classification-on","dataset":"MLDoc Zero-Shot English-to-German","dataset_url":"/dataset/mldoc","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"XLMft UDA","paper_title":"Bridging the domain gap in cross-lingual document classification","paper_url":"/paper/bridging-the-domain-gap-in-cross-lingual","paper_date":"2019-09-16","arxiv_id":"1909.07009","code_links":[{"title":"laiguokun/xlu-data","url":"https://github.com/laiguokun/xlu-data"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}}},{"leaderboard":"/sota/cross-lingual-document-classification-on-8","slug":"cross-lingual-document-classification-on-8","dataset":"MLDoc Zero-Shot English-to-Chinese","dataset_url":"/dataset/mldoc","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"XLMft UDA","paper_title":"Bridging the domain gap in cross-lingual document classification","paper_url":"/paper/bridging-the-domain-gap-in-cross-lingual","paper_date":"2019-09-16","arxiv_id":"1909.07009","code_links":[{"title":"laiguokun/xlu-data","url":"https://github.com/laiguokun/xlu-data"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}}},{"leaderboard":"/sota/cross-lingual-document-classification-on-9","slug":"cross-lingual-document-classification-on-9","dataset":"MLDoc Zero-Shot English-to-Russian","dataset_url":"/dataset/mldoc","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"XLMft UDA","paper_title":"Bridging the domain gap in cross-lingual document classification","paper_url":"/paper/bridging-the-domain-gap-in-cross-lingual","paper_date":"2019-09-16","arxiv_id":"1909.07009","code_links":[{"title":"laiguokun/xlu-data","url":"https://github.com/laiguokun/xlu-data"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}}},{"leaderboard":"/sota/cross-lingual-document-classification-on-10","slug":"cross-lingual-document-classification-on-10","dataset":"MLDoc Zero-Shot English-to-Italian","dataset_url":"/dataset/mldoc","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MultiFiT, pseudo","paper_title":"MultiFiT: Efficient Multi-lingual Language Model Fine-tuning","paper_url":"/paper/multifit-efficient-multi-lingual-language","paper_date":"2019-09-10","arxiv_id":"1909.04761","code_links":[{"title":"piegu/language-models","url":"https://github.com/piegu/language-models"},{"title":"n-waves/multifit","url":"https://github.com/n-waves/multifit"},{"title":"TheophileBlard/french-sentiment-analysis-with-bert","url":"https://github.com/TheophileBlard/french-sentiment-analysis-with-bert"},{"title":"lukexyz/Language-Models","url":"https://github.com/lukexyz/Language-Models"}],"syntology":null}},{"leaderboard":"/sota/cross-lingual-document-classification-on-11","slug":"cross-lingual-document-classification-on-11","dataset":"MLDoc Zero-Shot English-to-Japanese","dataset_url":"/dataset/mldoc","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MultiFiT, pseudo","paper_title":"MultiFiT: Efficient Multi-lingual Language Model Fine-tuning","paper_url":"/paper/multifit-efficient-multi-lingual-language","paper_date":"2019-09-10","arxiv_id":"1909.04761","code_links":[{"title":"piegu/language-models","url":"https://github.com/piegu/language-models"},{"title":"n-waves/multifit","url":"https://github.com/n-waves/multifit"},{"title":"TheophileBlard/french-sentiment-analysis-with-bert","url":"https://github.com/TheophileBlard/french-sentiment-analysis-with-bert"},{"title":"lukexyz/Language-Models","url":"https://github.com/lukexyz/Language-Models"}],"syntology":null}},{"leaderboard":"/sota/cross-lingual-document-classification-on-12","slug":"cross-lingual-document-classification-on-12","dataset":"Reuters RCV1/RCV2 English-to-German","dataset_url":"/dataset/rcv1","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Biinclusion (Euro500kReuters)","paper_title":"Leveraging Monolingual Data for Crosslingual Compositional Word Representations","paper_url":"/paper/leveraging-monolingual-data-for-crosslingual","paper_date":"2014-12-19","arxiv_id":"1412.6334","code_links":[{"title":"ogh/binclusion","url":"https://github.com/ogh/binclusion"}],"syntology":null}},{"leaderboard":"/sota/cross-lingual-document-classification-on-13","slug":"cross-lingual-document-classification-on-13","dataset":"Reuters RCV1/RCV2 German-to-English","dataset_url":"/dataset/rcv1","rows_in_archive":3,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Biinclusion (Euro500kReuters)","paper_title":"Leveraging Monolingual Data for Crosslingual Compositional Word Representations","paper_url":"/paper/leveraging-monolingual-data-for-crosslingual","paper_date":"2014-12-19","arxiv_id":"1412.6334","code_links":[{"title":"ogh/binclusion","url":"https://github.com/ogh/binclusion"}],"syntology":null}},{"leaderboard":"/sota/cross-lingual-document-classification-on-14","slug":"cross-lingual-document-classification-on-14","dataset":"MLDoc Zero-Shot German-to-French","dataset_url":"/dataset/mldoc","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BiLSTM (Europarl)","paper_title":"A Corpus for Multilingual Document Classification in Eight Languages","paper_url":"/paper/a-corpus-for-multilingual-document","paper_date":"2018-05-24","arxiv_id":"1805.09821","code_links":[{"title":"n-waves/multifit","url":"https://github.com/n-waves/multifit"},{"title":"facebookresearch/MLDoc","url":"https://github.com/facebookresearch/MLDoc"}],"syntology":{"n":15,"n_ran":1,"n_unverified":14,"n_pointer_only":1}}}],"datasets":[{"url":"/dataset/rcv1","name":"RCV1","full_name":"Reuters Corpus Volume 1","num_papers_in_archive":336},{"url":"/dataset/mldoc","name":"MLDoc","full_name":"Multilingual Document Classification Corpus","num_papers_in_archive":53}],"subtasks":[{"url":"/task/news-classification","name":"News Classification"}],"parent_tasks":[{"url":"/task/cross-lingual","name":"Cross-Lingual"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":12,"of":12,"tagged_in_all":25,"items":[{"url":"/paper/massively-multilingual-sentence-embeddings","title":"Massively Multilingual Sentence Embeddings for Zero-Shot Cross-Lingual Transfer and Beyond","date":"2018-12-26","arxiv_id":"1812.10464","repositories_listed":13,"syntology":{"n":10,"n_ran":4,"n_unverified":6,"n_pointer_only":4}},{"url":"/paper/zero-memory-optimization-towards-training-a","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","date":"2019-10-04","arxiv_id":"1910.02054","repositories_listed":10,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/multifit-efficient-multi-lingual-language","title":"MultiFiT: Efficient Multi-lingual Language Model Fine-tuning","date":"2019-09-10","arxiv_id":"1909.04761","repositories_listed":4,"syntology":null},{"url":"/paper/robust-cross-lingual-embeddings-from-parallel-1","title":"Robust Cross-lingual Embeddings from Parallel Sentences","date":"2019-12-28","arxiv_id":"1912.12481","repositories_listed":2,"syntology":null},{"url":"/paper/a-corpus-for-multilingual-document","title":"A Corpus for Multilingual Document Classification in Eight Languages","date":"2018-05-24","arxiv_id":"1805.09821","repositories_listed":2,"syntology":{"n":15,"n_ran":1,"n_unverified":14,"n_pointer_only":1}},{"url":"/paper/adversarial-deep-averaging-networks-for-cross","title":"Adversarial Deep Averaging Networks for Cross-Lingual Sentiment Classification","date":"2016-06-06","arxiv_id":"1606.01614","repositories_listed":2,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/bilbowa-fast-bilingual-distributed","title":"BilBOWA: Fast Bilingual Distributed Representations without Word Alignments","date":"2014-10-09","arxiv_id":"1410.2455","repositories_listed":2,"syntology":null},{"url":"/paper/multilingual-and-cross-lingual-document","title":"Multilingual and cross-lingual document classification: A meta-learning approach","date":"2021-01-27","arxiv_id":"2101.11302","repositories_listed":1,"syntology":null},{"url":"/paper/bridging-the-domain-gap-in-cross-lingual","title":"Bridging the domain gap in cross-lingual document classification","date":"2019-09-16","arxiv_id":"1909.07009","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/learning-crosslingual-word-embeddings-without","title":"Learning Crosslingual Word Embeddings without Bilingual Corpora","date":"2016-06-30","arxiv_id":"1606.09403","repositories_listed":1,"syntology":null},{"url":"/paper/multilingual-models-for-compositional","title":"Multilingual Models for Compositional Distributed Semantics","date":"2014-04-17","arxiv_id":"1404.4641","repositories_listed":1,"syntology":null},{"url":"/paper/multilingual-distributed-representations","title":"Multilingual Distributed Representations without Word Alignment","date":"2013-12-20","arxiv_id":"1312.6173","repositories_listed":1,"syntology":null}],"syntology_records":5,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}