{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/a-corpus-for-multilingual-document","title":"A Corpus for Multilingual Document Classification in Eight Languages","arxiv_id":"1805.09821","date":"2018-05-24","proceeding":"LREC 2018 5","authors":["Holger Schwenk","Xi-An Li"],"abstract":"Cross-lingual document classification aims at training a document classifier\non resources in one language and transferring it to a different language\nwithout any additional resources. Several approaches have been proposed in the\nliterature and the current best practice is to evaluate them on a subset of the\nReuters Corpus Volume 2. However, this subset covers only few languages\n(English, German, French and Spanish) and almost all published works focus on\nthe the transfer between English and German. In addition, we have observed that\nthe class prior distributions differ significantly between the languages. We\nargue that this complicates the evaluation of the multilinguality. In this\npaper, we propose a new subset of the Reuters corpus with balanced class priors\nfor eight languages. By adding Italian, Russian, Japanese and Chinese, we cover\nlanguages which are very different with respect to syntax, morphology, etc. We\nprovide strong baselines for all language transfer directions using\nmultilingual word and sentence embeddings respectively. Our goal is to offer a\nfreely available framework to evaluate cross-lingual document classification,\nand we hope to foster by these means, research in this important area.","url_abs":"http://arxiv.org/abs/1805.09821v1","url_pdf":"http://arxiv.org/pdf/1805.09821v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"a-corpus-for-multilingual-document","repo_url":"https://github.com/facebookresearch/MLDoc","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"none","reach":null},{"paper_slug":"a-corpus-for-multilingual-document","repo_url":"https://github.com/n-waves/multifit","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"cross-lingual-document-classification","task_name":"Cross-Lingual Document Classification"},{"task_slug":"document-classification","task_name":"Document Classification"},{"task_slug":"classification","task_name":"General Classification"},{"task_slug":"sentence","task_name":"Sentence"},{"task_slug":"sentence-embeddings","task_name":"Sentence Embeddings"}],"methods":[],"datasets_introduced":[{"slug":"mldoc","name":"MLDoc","full_name":"Multilingual Document Classification Corpus"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/cross-lingual-document-classification-on-8","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Chinese","model":"MultiCCA + CNN","rank_in_archive_order":3,"of":5,"metrics":{"Accuracy":"74.73"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-8","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Chinese","model":"BiLSTM (UN)","rank_in_archive_order":4,"of":5,"metrics":{"Accuracy":"71.97"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-2","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-French","model":"BiLSTM (UN)","rank_in_archive_order":4,"of":6,"metrics":{"Accuracy":"74.52"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-2","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-French","model":"BiLSTM (Europarl)","rank_in_archive_order":5,"of":6,"metrics":{"Accuracy":"72.83"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-2","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-French","model":"MultiCCA + CNN","rank_in_archive_order":6,"of":6,"metrics":{"Accuracy":"72.38"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-German","model":"MultiCCA + CNN","rank_in_archive_order":4,"of":5,"metrics":{"Accuracy":"81.2%"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-German","model":"BiLSTM (Europarl)","rank_in_archive_order":5,"of":5,"metrics":{"Accuracy":"71.83%"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-10","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Italian","model":"MultiCCA + CNN","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"69.38"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-10","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Italian","model":"BiLSTM (Europarl)","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"60.73"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-11","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Japanese","model":"MultiCCA + CNN","rank_in_archive_order":2,"of":3,"metrics":{"Accuracy":"67.63"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-9","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Russian","model":"BiLSTM (UN)","rank_in_archive_order":4,"of":5,"metrics":{"Accuracy":"61.42"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-9","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Russian","model":"MultiCCA + CNN","rank_in_archive_order":5,"of":5,"metrics":{"Accuracy":"60.8"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-1","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Spanish","model":"MultiCCA + CNN","rank_in_archive_order":4,"of":6,"metrics":{"Accuracy":"72.5"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-1","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Spanish","model":"BiLSTM (UN)","rank_in_archive_order":5,"of":6,"metrics":{"Accuracy":"69.5"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-1","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot English-to-Spanish","model":"BiLSTM (Europarl)","rank_in_archive_order":6,"of":6,"metrics":{"Accuracy":"66.65"},"uses_additional_data":false},{"leaderboard":"/sota/cross-lingual-document-classification-on-14","task":"Cross-Lingual Document Classification","dataset":"MLDoc Zero-Shot German-to-French","model":"BiLSTM (Europarl)","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"75.45"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1805.09821","atlas_url":"https://app.syntology.ai/?focus=1805.09821","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1805.09821"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-25T09:33:49+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/n-waves/multifit","reach":{"status":"ok","spdx":"MIT"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/facebookresearch/MLDoc","reach":null}],"summary":{"ran_violates":1,"unverified":14},"by_repo_kind":{"official":{"samples":1,"ran":1,"repositories":1},"listed":{"samples":14,"ran":0,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":1,"samples":[{"code_sha256_prefix":"ecc0491c7303786a","entry":"check_data_sufficiency","repo":"facebookresearch/MLDoc","repo_kind":"official","path":"sampling_rcv2.py","file_url":"https://github.com/facebookresearch/MLDoc/blob/HEAD/sampling_rcv2.py","link_basis":"first_harvest_node","language":"python","status":"ran_violates","verification_level":1,"contract_check":"VIOLATES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"mcp_get_code":{"code_sha256":"ecc0491c7303786a"}},{"code_sha256_prefix":"ddc663023f98e224","entry":"build_vocab","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/datasets/postprocess_wikitext.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/datasets/postprocess_wikitext.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"ddc663023f98e224"}},{"code_sha256_prefix":"5f761b0bed59bd96","entry":"cross_remove_duplicates","repo":"n-waves/multifit","repo_kind":"listed","path":"split-cls.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/split-cls.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"5f761b0bed59bd96"}},{"code_sha256_prefix":"57b99f2ca95b81fb","entry":"detect_lang_from_dataset_path","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/training.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/training.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"57b99f2ca95b81fb"}},{"code_sha256_prefix":"fea81e299034679b","entry":"download_data","repo":"n-waves/multifit","repo_kind":"listed","path":"prepare_xnli.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/prepare_xnli.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"fea81e299034679b"}},{"code_sha256_prefix":"6f5f358981413f2c","entry":"get_and_unzip_data","repo":"n-waves/multifit","repo_kind":"listed","path":"prepare_xnli.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/prepare_xnli.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"6f5f358981413f2c"}},{"code_sha256_prefix":"c657462a7c04bcc5","entry":"get_texts","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/datasets/utils.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/datasets/utils.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"c657462a7c04bcc5"}},{"code_sha256_prefix":"47aefbe32b4a53dc","entry":"multifit1152_lstm_nl3","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/configurations.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/configurations.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"47aefbe32b4a53dc"}},{"code_sha256_prefix":"1232e453f40b140f","entry":"multifit1552_fp32","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/configurations.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/configurations.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"1232e453f40b140f"}},{"code_sha256_prefix":"620047035f3f6733","entry":"patch_learner","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/training.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/training.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"620047035f3f6733"}},{"code_sha256_prefix":"356ad3b49f5db3bc","entry":"read_clas_csv","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/datasets/dataset.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/datasets/dataset.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"356ad3b49f5db3bc"}},{"code_sha256_prefix":"e4d788b551ad578b","entry":"read_wiki_articles","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/datasets/dataset.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/datasets/dataset.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"e4d788b551ad578b"}},{"code_sha256_prefix":"21075dccf90eda43","entry":"remove_duplicates","repo":"n-waves/multifit","repo_kind":"listed","path":"split-cls.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/split-cls.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"21075dccf90eda43"}},{"code_sha256_prefix":"3d6c8a5734a1712d","entry":"remove_rt","repo":"n-waves/multifit","repo_kind":"listed","path":"split-cls.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/split-cls.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"3d6c8a5734a1712d"}},{"code_sha256_prefix":"f32a11c0002ecb23","entry":"to_json_serializable","repo":"n-waves/multifit","repo_kind":"listed","path":"multifit/training.py","file_url":"https://github.com/n-waves/multifit/blob/HEAD/multifit/training.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"f32a11c0002ecb23"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}