{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/glossbert-bert-for-word-sense-disambiguation","title":"GlossBERT: BERT for Word Sense Disambiguation with Gloss Knowledge","arxiv_id":"1908.07245","date":"2019-08-20","proceeding":"IJCNLP 2019 11","authors":["Luyao Huang","Chi Sun","Xipeng Qiu","Xuanjing Huang"],"abstract":"Word Sense Disambiguation (WSD) aims to find the exact sense of an ambiguous word in a particular context. Traditional supervised methods rarely take into consideration the lexical resources like WordNet, which are widely utilized in knowledge-based methods. Recent studies have shown the effectiveness of incorporating gloss (sense definition) into neural networks for WSD. However, compared with traditional word expert supervised methods, they have not achieved much improvement. In this paper, we focus on how to better leverage gloss knowledge in a supervised neural WSD system. We construct context-gloss pairs and propose three BERT-based models for WSD. We fine-tune the pre-trained BERT model on SemCor3.0 training corpus and the experimental results on several English all-words WSD benchmark datasets show that our approach outperforms the state-of-the-art systems.","url_abs":"https://arxiv.org/abs/1908.07245v4","url_pdf":"https://arxiv.org/pdf/1908.07245v4.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"glossbert-bert-for-word-sense-disambiguation","repo_url":"https://github.com/HSLCY/GlossBERT","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"glossbert-bert-for-word-sense-disambiguation","repo_url":"https://github.com/nkhl-p/glossBERT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"glossbert-bert-for-word-sense-disambiguation","repo_url":"https://github.com/tintamarre1/NLP_word_sense_disambiguation","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"word-sense-disambiguation","task_name":"Word Sense Disambiguation"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/entity-linking-on-wic-tsv","task":"Entity Linking","dataset":"WiC-TSV","model":"GlossBert-ws","rank_in_archive_order":3,"of":8,"metrics":{"Task 1 Accuracy: all":"75.9","Task 1 Accuracy: domain specific":"76.7","Task 1 Accuracy: general purpose":"75.2"},"uses_additional_data":false},{"leaderboard":"/sota/word-sense-disambiguation-on-supervised","task":"Word Sense Disambiguation","dataset":"Supervised:","model":"GlossBERT","rank_in_archive_order":15,"of":27,"metrics":{"SemEval 2007":"72.5","SemEval 2013":"76.1","SemEval 2015":"80.4","Senseval 2":"77.7","Senseval 3":"75.2"},"uses_additional_data":false},{"leaderboard":"/sota/word-sense-disambiguation-on-wic-tsv","task":"Word Sense Disambiguation","dataset":"WiC-TSV","model":"GlossBert-ws","rank_in_archive_order":3,"of":8,"metrics":{"Task 1 Accuracy: all":"75.9","Task 1 Accuracy: domain specific":"76.7","Task 1 Accuracy: general purpose":"75.2"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1908.07245","atlas_url":"https://app.syntology.ai/?focus=1908.07245","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}