{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/gosum-extractive-summarization-of-long","title":"GoSum: Extractive Summarization of Long Documents by Reinforcement Learning and Graph Organized discourse state","arxiv_id":"2211.10247","date":"2022-11-18","proceeding":null,"authors":["Junyi Bian","Xiaodi Huang","Hong Zhou","Shanfeng Zhu"],"abstract":"Extracting summaries from long documents can be regarded as sentence classification using the structural information of the documents. How to use such structural information to summarize a document is challenging. In this paper, we propose GoSum, a novel graph and reinforcement learning based extractive model for long-paper summarization. In particular, GoSum encodes sentence states in reinforcement learning by building a heterogeneous graph for each input document at different discourse levels. An edge in the graph reflects the discourse hierarchy of a document for restraining the semantic drifts across section boundaries. We evaluate GoSum on two datasets of scientific articles summarization: PubMed and arXiv. The experimental results have demonstrated that GoSum achieve state-of-the-art results compared with strong baselines of both extractive and abstractive models. The ablation studies further validate that the performance of our GoSum benefits from the use of discourse information.","url_abs":"https://arxiv.org/abs/2211.10247v2","url_pdf":"https://arxiv.org/pdf/2211.10247v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"gosum-extractive-summarization-of-long","repo_url":"https://github.com/Eulring/GoSum","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"articles","task_name":"Articles"},{"task_slug":"document-summarization","task_name":"Document Summarization"},{"task_slug":"extractive-document-summarization-1","task_name":"Extractive Document Summarization"},{"task_slug":"extractive-summarization","task_name":"Extractive Summarization"},{"task_slug":"reinforcement-learning","task_name":"Reinforcement Learning"},{"task_slug":"reinforcement-learning-1","task_name":"Reinforcement Learning (RL)"},{"task_slug":"sentence","task_name":"Sentence"},{"task_slug":"sentence-classification","task_name":"Sentence Classification"},{"task_slug":"text-summarization","task_name":"Text Summarization"},{"task_slug":"reinforcement-learning-2","task_name":"reinforcement-learning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/text-summarization-on-pubmed-1","task":"Text Summarization","dataset":"Pubmed","model":"GoSum (extractive)","rank_in_archive_order":5,"of":29,"metrics":{"ROUGE-1":"49.83","ROUGE-2":"23.56","ROUGE-L":"45.10"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2211.10247","atlas_url":"https://app.syntology.ai/?focus=2211.10247","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}