{"url":"/method/mbart","slug":"mbart","name":"mBART","full_name":"mBART","full_name_withheld":false,"description_markdown":"**mBART** is a sequence-to-sequence denoising auto-encoder pre-trained on large-scale monolingual corpora in many languages using the [BART objective](https://paperswithcode.com/method/bart). The input texts are noised by masking phrases and permuting sentences, and a single [Transformer model](https://paperswithcode.com/method/transformer) is learned to recover the texts. Different from other pre-training approaches for machine translation, mBART pre-trains a complete autoregressive [Seq2Seq](https://paperswithcode.com/method/seq2seq) model. mBART is trained once for all languages, providing a set of parameters that can be fine-tuned for any of the language pairs in both supervised and unsupervised settings, without any task-specific or language-specific modifications or initialization schemes.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/2001.08210v2","title":"Multilingual Denoising Pre-training for Neural Machine Translation","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Natural Language Processing","area_id":"natural-language-processing","collection":"Language Models","url":"/methods/category/language-models","pwc_aliases":[]}],"n_papers_tagged":66,"archive_num_papers":null,"papers_newest_first":[{"paper":null,"title":"State-of-the-Art Translation of Text-to-Gloss using mBART : A case study of Bangla","date":"2025-04-03","arxiv_id":"2504.02293","n_code_links":0,"syntology":null},{"paper":"/paper/belin-a-novel-corpus-for-bengali-religious","title":"BeliN: A Novel Corpus for Bengali Religious News Headline Generation using Contextual Feature Fusion","date":"2025-01-02","arxiv_id":"2501.01069","n_code_links":1,"syntology":null},{"paper":"/paper/sitse-sinhala-text-simplification-dataset-and","title":"SiTSE: Sinhala Text Simplification Dataset and Evaluation","date":"2024-12-02","arxiv_id":"2412.01293","n_code_links":1,"syntology":null},{"paper":null,"title":"Abstractive Summarization of Low resourced Nepali language using Multilingual Transformers","date":"2024-09-29","arxiv_id":"2409.19566","n_code_links":0,"syntology":null},{"paper":null,"title":"Exploring Fine-tuned Generative Models for Keyphrase Selection: A Case Study for Russian","date":"2024-09-16","arxiv_id":"2409.10640","n_code_links":0,"syntology":null},{"paper":null,"title":"Segment-Based Interactive Machine Translation for Pre-trained Models","date":"2024-07-09","arxiv_id":"2407.06990","n_code_links":0,"syntology":null},{"paper":null,"title":"NAIST Simultaneous Speech Translation System for IWSLT 2024","date":"2024-06-30","arxiv_id":"2407.00826","n_code_links":0,"syntology":null},{"paper":"/paper/cantonmt-cantonese-to-english-nmt-platform","title":"CantonMT: Cantonese to English NMT Platform with Fine-Tuned Models Using Synthetic Back-Translation Data","date":"2024-03-17","arxiv_id":"2403.11346","n_code_links":1,"syntology":null},{"paper":null,"title":"VBART: The Turkish LLM","date":"2024-03-02","arxiv_id":"2403.01308","n_code_links":0,"syntology":null},{"paper":null,"title":"Transcription and translation of videos using fine-tuned XLSR Wav2Vec2 on custom dataset and mBART","date":"2024-03-01","arxiv_id":"2403.00212","n_code_links":0,"syntology":null},{"paper":null,"title":"Key ingredients for effective zero-shot cross-lingual knowledge transfer in generative tasks","date":"2024-02-19","arxiv_id":"2402.12279","n_code_links":0,"syntology":null},{"paper":null,"title":"End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2","date":"2024-01-11","arxiv_id":"2401.06183","n_code_links":0,"syntology":null},{"paper":"/paper/exploring-automatic-text-simplification-of","title":"Exploring Automatic Text Simplification of German Narrative Documents","date":"2023-12-15","arxiv_id":"2312.09907","n_code_links":1,"syntology":null},{"paper":"/paper/context-aware-neural-machine-translation-for","title":"Context-aware Neural Machine Translation for English-Japanese Business Scene Dialogues","date":"2023-11-20","arxiv_id":"2311.11976","n_code_links":1,"syntology":null},{"paper":null,"title":"Empirical study of pretrained multilingual language models for zero-shot cross-lingual knowledge transfer in generation","date":"2023-10-15","arxiv_id":"2310.09917","n_code_links":0,"syntology":null},{"paper":null,"title":"Direct Text to Speech Translation System using Acoustic Units","date":"2023-09-14","arxiv_id":"2309.07478","n_code_links":0,"syntology":null},{"paper":"/paper/benchmarking-procedural-language","title":"Benchmarking Procedural Language Understanding for Low-Resource Languages: A Case Study on Turkish","date":"2023-09-13","arxiv_id":"2309.06698","n_code_links":1,"syntology":null},{"paper":"/paper/cliptrans-transferring-visual-knowledge-with","title":"CLIPTrans: Transferring Visual Knowledge with Pre-trained Models for Multimodal Machine Translation","date":"2023-08-29","arxiv_id":"2308.15226","n_code_links":1,"syntology":{"ran":5,"of":7,"unverified":2,"pointer_only":7}},{"paper":null,"title":"VBD-MT Chinese-Vietnamese Translation Systems for VLSP 2022","date":"2023-08-15","arxiv_id":"2308.07601","n_code_links":0,"syntology":null},{"paper":"/paper/binary-and-ternary-natural-language","title":"Binary and Ternary Natural Language Generation","date":"2023-06-02","arxiv_id":"2306.01841","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}},{"paper":null,"title":"Improving Polish to English Neural Machine Translation with Transfer Learning: Effects of Data Volume and Language Similarity","date":"2023-06-01","arxiv_id":"2306.00660","n_code_links":0,"syntology":null},{"paper":"/paper/deplain-a-german-parallel-corpus-with","title":"DEPLAIN: A German Parallel Corpus with Intralingual Translations into Plain Language for Sentence and Document Simplification","date":"2023-05-30","arxiv_id":"2305.18939","n_code_links":1,"syntology":null},{"paper":null,"title":"Enhancing Translation for Indigenous Languages: Experiments with Multilingual Models","date":"2023-05-27","arxiv_id":"2305.17406","n_code_links":0,"syntology":null},{"paper":null,"title":"Extrapolating Multilingual Understanding Models as Multilingual Generators","date":"2023-05-22","arxiv_id":"2305.13140","n_code_links":0,"syntology":null},{"paper":"/paper/mlongt5-a-multilingual-and-efficient-text-to","title":"mLongT5: A Multilingual and Efficient Text-To-Text Transformer for Longer Sequences","date":"2023-05-18","arxiv_id":"2305.11129","n_code_links":1,"syntology":null},{"paper":"/paper/towards-speech-dialogue-translation-mediating","title":"Towards Speech Dialogue Translation Mediating Speakers of Different Languages","date":"2023-05-16","arxiv_id":"2305.09210","n_code_links":1,"syntology":null},{"paper":"/paper/prompt-learning-for-cross-lingual-relation","title":"Prompt-Learning for Cross-Lingual Relation Extraction","date":"2023-04-20","arxiv_id":"2304.10354","n_code_links":1,"syntology":null},{"paper":"/paper/neural-machine-translation-for-low-resource-3","title":"Neural Machine Translation For Low Resource Languages","date":"2023-04-16","arxiv_id":"2304.07869","n_code_links":1,"syntology":null},{"paper":"/paper/peach-pre-training-sequence-to-sequence","title":"PEACH: Pre-Training Sequence-to-Sequence Multilingual Models for Translation with Semi-Supervised Pseudo-Parallel Document Generation","date":"2023-04-03","arxiv_id":"2304.01282","n_code_links":1,"syntology":null},{"paper":null,"title":"Summarizing Indian Languages using Multilingual Transformers based Models","date":"2023-03-29","arxiv_id":"2303.16657","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/translation","name":"Translation","papers":38},{"task":"/task/machine-translation","name":"Machine Translation","papers":28},{"task":"/task/sentence","name":"Sentence","papers":13},{"task":"/task/text-generation","name":"Text Generation","papers":9},{"task":"/task/decoder","name":"Decoder","papers":8},{"task":"/task/denoising","name":"Denoising","papers":8},{"task":"/task/nmt","name":"NMT","papers":8},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":8},{"task":"/task/abstractive-text-summarization","name":"Abstractive Text Summarization","papers":7},{"task":"/task/text-summarization","name":"Text Summarization","papers":7},{"task":"/task/cross-lingual-transfer","name":"Cross-Lingual Transfer","papers":5},{"task":"/task/language-modeling","name":"Language Modeling","papers":5},{"task":"/task/language-modelling","name":"Language Modelling","papers":5},{"task":"/task/natural-language-understanding","name":"Natural Language Understanding","papers":5},{"task":"/task/text-simplification","name":"Text Simplification","papers":4},{"task":"/task/articles","name":"Articles","papers":3},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":3},{"task":"/task/headline-generation","name":"Headline Generation","papers":3},{"task":"/task/question-generation","name":"Question Generation","papers":3},{"task":"/task/question-generation","name":"Question-Generation","papers":3}],"tasks_shown":20,"n_tasks":76,"usage_by_year":[{"year":"2020","papers":7},{"year":"2021","papers":15},{"year":"2022","papers":14},{"year":"2023","papers":18},{"year":"2024","papers":10},{"year":"2025","papers":2}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/mbart"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}