{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/190910430","title":"Does BERT Make Any Sense? Interpretable Word Sense Disambiguation with Contextualized Embeddings","arxiv_id":"1909.10430","date":"2019-09-23","proceeding":null,"authors":["Gregor Wiedemann","Steffen Remus","Avi Chawla","Chris Biemann"],"abstract":"Contextualized word embeddings (CWE) such as provided by ELMo (Peters et al., 2018), Flair NLP (Akbik et al., 2018), or BERT (Devlin et al., 2019) are a major recent innovation in NLP. CWEs provide semantic vector representations of words depending on their respective context. Their advantage over static word embeddings has been shown for a number of tasks, such as text classification, sequence tagging, or machine translation. Since vectors of the same word type can vary depending on the respective context, they implicitly provide a model for word sense disambiguation (WSD). We introduce a simple but effective approach to WSD using a nearest neighbor classification on CWEs. We compare the performance of different CWE models for the task and can report improvements above the current state of the art for two standard WSD benchmark datasets. We further show that the pre-trained BERT model is able to place polysemic words into distinct 'sense' regions of the embedding space, while ELMo and Flair NLP do not seem to possess this ability.","url_abs":"https://arxiv.org/abs/1909.10430v2","url_pdf":"https://arxiv.org/pdf/1909.10430v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"190910430","repo_url":"https://github.com/uhh-lt/bert-sense","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"classification","task_name":"General Classification"},{"task_slug":"translation","task_name":"Translation"},{"task_slug":"word-sense-disambiguation","task_name":"Word Sense Disambiguation"},{"task_slug":"text-classification-1","task_name":"text-classification"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"bilstm","method_name":"BiLSTM"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"elmo","method_name":"ELMo"},{"method_slug":"lstm","method_name":"LSTM"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"tanh-activation","method_name":"Tanh Activation"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/word-sense-disambiguation-on-semeval-2007","task":"Word Sense Disambiguation","dataset":"SemEval 2007 Task 17","model":"kNN-BERT + POS (training corpus: SemCor)","rank_in_archive_order":7,"of":9,"metrics":{"F1":"63.17"},"uses_additional_data":false},{"leaderboard":"/sota/word-sense-disambiguation-on-semeval-2007","task":"Word Sense Disambiguation","dataset":"SemEval 2007 Task 17","model":"kNN-BERT","rank_in_archive_order":8,"of":9,"metrics":{"F1":"60.94"},"uses_additional_data":false},{"leaderboard":"/sota/word-sense-disambiguation-on-semeval-2007-1","task":"Word Sense Disambiguation","dataset":"SemEval 2007 Task 7","model":"kNN-BERT + POS (training corpus: WNGT)","rank_in_archive_order":3,"of":10,"metrics":{"F1":"85.32"},"uses_additional_data":false},{"leaderboard":"/sota/word-sense-disambiguation-on-semeval-2007-1","task":"Word Sense Disambiguation","dataset":"SemEval 2007 Task 7","model":"kNN-BERT","rank_in_archive_order":9,"of":10,"metrics":{"F1":"81.20"},"uses_additional_data":false},{"leaderboard":"/sota/word-sense-disambiguation-on-senseval-2-1","task":"Word Sense Disambiguation","dataset":"SensEval 2 Lexical Sample","model":"kNN-BERT","rank_in_archive_order":1,"of":3,"metrics":{"F1":"76.52"},"uses_additional_data":false},{"leaderboard":"/sota/word-sense-disambiguation-on-senseval-3","task":"Word Sense Disambiguation","dataset":"SensEval 3 Lexical Sample","model":"kNN-BERT","rank_in_archive_order":1,"of":4,"metrics":{"F1":"80.12"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1909.10430","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}