{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/hibert-document-level-pre-training-of","title":"HIBERT: Document Level Pre-training of Hierarchical Bidirectional Transformers for Document Summarization","arxiv_id":"1905.06566","date":"2019-05-16","proceeding":"ACL 2019 7","authors":["Xingxing Zhang","Furu Wei","Ming Zhou"],"abstract":"Neural extractive summarization models usually employ a hierarchical encoder for document encoding and they are trained using sentence-level labels, which are created heuristically using rule-based methods. Training the hierarchical encoder with these \\emph{inaccurate} labels is challenging. Inspired by the recent work on pre-training transformer sentence encoders \\cite{devlin:2018:arxiv}, we propose {\\sc Hibert} (as shorthand for {\\bf HI}erachical {\\bf B}idirectional {\\bf E}ncoder {\\bf R}epresentations from {\\bf T}ransformers) for document encoding and a method to pre-train it using unlabeled data. We apply the pre-trained {\\sc Hibert} to our summarization model and it outperforms its randomly initialized counterpart by 1.25 ROUGE on the CNN/Dailymail dataset and by 2.0 ROUGE on a version of New York Times dataset. We also achieve the state-of-the-art performance on these two datasets.","url_abs":"https://arxiv.org/abs/1905.06566v1","url_pdf":"https://arxiv.org/pdf/1905.06566v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"document-summarization","task_name":"Document Summarization"},{"task_slug":"extractive-summarization","task_name":"Extractive Summarization"},{"task_slug":"extractive-document-summarization","task_name":"Extractive Text Summarization"},{"task_slug":"sentence","task_name":"Sentence"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/extractive-document-summarization-on-cnn","task":"Extractive Text Summarization","dataset":"CNN / Daily Mail","model":"HIBERT","rank_in_archive_order":8,"of":15,"metrics":{"ROUGE-1":"42.37","ROUGE-2":"19.95","ROUGE-L":"38.83"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1905.06566","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}