{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/mixture-content-selection-for-diverse","title":"Mixture Content Selection for Diverse Sequence Generation","arxiv_id":"1909.01953","date":"2019-09-04","proceeding":"IJCNLP 2019 11","authors":["Jaemin Cho","Minjoon Seo","Hannaneh Hajishirzi"],"abstract":"Generating diverse sequences is important in many NLP applications such as question generation or summarization that exhibit semantically one-to-many relationships between source and the target sequences. We present a method to explicitly separate diversification from generation using a general plug-and-play module (called SELECTOR) that wraps around and guides an existing encoder-decoder model. The diversification stage uses a mixture of experts to sample different binary masks on the source sequence for diverse content selection. The generation stage uses a standard encoder-decoder model given each selected content from the source sequence. Due to the non-differentiable nature of discrete sampling and the lack of ground truth labels for binary mask, we leverage a proxy for ground truth mask and adopt stochastic hard-EM for training. In question generation (SQuAD) and abstractive summarization (CNN-DM), our method demonstrates significant improvements in accuracy, diversity and training efficiency, including state-of-the-art top-1 accuracy in both datasets, 6% gain in top-5 accuracy, and 3.7 times faster training over a state of the art model. Our code is publicly available at https://github.com/clovaai/FocusSeq2Seq.","url_abs":"https://arxiv.org/abs/1909.01953v1","url_pdf":"https://arxiv.org/pdf/1909.01953v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"mixture-content-selection-for-diverse","repo_url":"https://github.com/clovaai/FocusSeq2Seq","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"abstractive-text-summarization","task_name":"Abstractive Text Summarization"},{"task_slug":"decoder","task_name":"Decoder"},{"task_slug":"diversity","task_name":"Diversity"},{"task_slug":"document-summarization","task_name":"Document Summarization"},{"task_slug":"mixture-of-experts","task_name":"Mixture-of-Experts"},{"task_slug":"question-generation","task_name":"Question Generation"},{"task_slug":"question-generation","task_name":"Question-Generation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/abstractive-text-summarization-on-cnn-daily","task":"Abstractive Text Summarization","dataset":"CNN / Daily Mail","model":"Selector & Pointer-Generator","rank_in_archive_order":29,"of":53,"metrics":{"ROUGE-1":"41.72","ROUGE-2":"18.74","ROUGE-L":"38.79"},"uses_additional_data":true},{"leaderboard":"/sota/document-summarization-on-cnn-daily-mail","task":"Document Summarization","dataset":"CNN / Daily Mail","model":"Selector+Pointer Generator","rank_in_archive_order":14,"of":26,"metrics":{"ROUGE-1":"41.72","ROUGE-2":"18.74","ROUGE-L":"38.79"},"uses_additional_data":false},{"leaderboard":"/sota/question-generation-on-squad11","task":"Question Generation","dataset":"SQuAD1.1","model":"Selector & NQG++","rank_in_archive_order":10,"of":13,"metrics":{"BLEU-4":"15.874"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1909.01953","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}