{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/attention-is-not-all-you-need-for-commonsense","title":"Attention Is (not) All You Need for Commonsense Reasoning","arxiv_id":"1905.13497","date":"2019-05-31","proceeding":"ACL 2019 7","authors":["Tassilo Klein","Moin Nabi"],"abstract":"The recently introduced BERT model exhibits strong performance on several language understanding benchmarks. In this paper, we describe a simple re-implementation of BERT for commonsense reasoning. We show that the attentions produced by BERT can be directly utilized for tasks such as the Pronoun Disambiguation Problem and Winograd Schema Challenge. Our proposed attention-guided commonsense reasoning method is conceptually simple yet empirically powerful. Experimental analysis on multiple datasets demonstrates that our proposed system performs remarkably well on all cases while outperforming the previously reported state of the art by a margin. While results suggest that BERT seems to implicitly learn to establish complex relationships between entities, solving commonsense reasoning tasks might require more than unsupervised models learned from huge text corpora.","url_abs":"https://arxiv.org/abs/1905.13497v1","url_pdf":"https://arxiv.org/pdf/1905.13497v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"attention-is-not-all-you-need-for-commonsense","repo_url":"https://github.com/SAP-samples/acl2019-commonsense-reasoning","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"attention-is-not-all-you-need-for-commonsense","repo_url":"https://github.com/SAP-samples/acl2020-commonsense","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}}],"tasks":[{"task_slug":"all","task_name":"All"},{"task_slug":"coreference-resolution","task_name":"Coreference Resolution"},{"task_slug":"natural-language-understanding","task_name":"Natural Language Understanding"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/coreference-resolution-on-winograd-schema","task":"Coreference Resolution","dataset":"Winograd Schema Challenge","model":"BERT-base 110M + MAS","rank_in_archive_order":57,"of":82,"metrics":{"Accuracy":"60.3"},"uses_additional_data":false},{"leaderboard":"/sota/coreference-resolution-on-winograd-schema","task":"Coreference Resolution","dataset":"Winograd Schema Challenge","model":"USSM + Supervised DeepNet + KB","rank_in_archive_order":74,"of":82,"metrics":{"Accuracy":"52.8"},"uses_additional_data":false},{"leaderboard":"/sota/coreference-resolution-on-winograd-schema","task":"Coreference Resolution","dataset":"Winograd Schema Challenge","model":"USSM + KB","rank_in_archive_order":76,"of":82,"metrics":{"Accuracy":"52"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-understanding-on-pdp60","task":"Natural Language Understanding","dataset":"PDP60","model":"BERT-base 110M + MAS","rank_in_archive_order":7,"of":13,"metrics":{"Accuracy":"68.3"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-understanding-on-pdp60","task":"Natural Language Understanding","dataset":"PDP60","model":"USSM + Supervised Deepnet + 3 Knowledge Bases","rank_in_archive_order":8,"of":13,"metrics":{"Accuracy":"66.7"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-understanding-on-pdp60","task":"Natural Language Understanding","dataset":"PDP60","model":"USSM + Supervised Deepnet","rank_in_archive_order":13,"of":13,"metrics":{"Accuracy":"53.3"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1905.13497","atlas_url":"https://app.syntology.ai/?focus=1905.13497","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}