{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/baseline-needs-more-love-on-simple-word","title":"Baseline Needs More Love: On Simple Word-Embedding-Based Models and Associated Pooling Mechanisms","arxiv_id":"1805.09843","date":"2018-05-24","proceeding":"ACL 2018 7","authors":["Dinghan Shen","Guoyin Wang","Wenlin Wang","Martin Renqiang Min","Qinliang Su","Yizhe Zhang","Chunyuan Li","Ricardo Henao","Lawrence Carin"],"abstract":"Many deep learning architectures have been proposed to model the\ncompositionality in text sequences, requiring a substantial number of\nparameters and expensive computations. However, there has not been a rigorous\nevaluation regarding the added value of sophisticated compositional functions.\nIn this paper, we conduct a point-by-point comparative study between Simple\nWord-Embedding-based Models (SWEMs), consisting of parameter-free pooling\noperations, relative to word-embedding-based RNN/CNN models. Surprisingly,\nSWEMs exhibit comparable or even superior performance in the majority of cases\nconsidered. Based upon this understanding, we propose two additional pooling\nstrategies over learned word embeddings: (i) a max-pooling operation for\nimproved interpretability; and (ii) a hierarchical pooling operation, which\npreserves spatial (n-gram) information within text sequences. We present\nexperiments on 17 datasets encompassing three tasks: (i) (long) document\nclassification; (ii) text sequence matching; and (iii) short text tasks,\nincluding classification and tagging. The source code and datasets can be\nobtained from https:// github.com/dinghanshen/SWEM.","url_abs":"http://arxiv.org/abs/1805.09843v1","url_pdf":"http://arxiv.org/pdf/1805.09843v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"baseline-needs-more-love-on-simple-word","repo_url":"https://github.com/dinghanshen/SWEM","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok"}},{"paper_slug":"baseline-needs-more-love-on-simple-word","repo_url":"https://github.com/nyk510/scdv-python","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}}],"tasks":[{"task_slug":"document-classification","task_name":"Document Classification"},{"task_slug":"classification","task_name":"General Classification"},{"task_slug":"named-entity-recognition-ner","task_name":"Named Entity Recognition (NER)"},{"task_slug":"sentiment-analysis","task_name":"Sentiment Analysis"},{"task_slug":"subjectivity-analysis","task_name":"Subjectivity Analysis"},{"task_slug":"text-classification","task_name":"Text Classification"},{"task_slug":"word-embeddings","task_name":"Word Embeddings"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/named-entity-recognition-on-conll-2000","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2000","model":"SWEM-CRF","rank_in_archive_order":1,"of":1,"metrics":{"F1":"90.34"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-conll-2003","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2003 (English)","model":"SWEM-CRF","rank_in_archive_order":72,"of":73,"metrics":{"F1":"86.28"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-multinli","task":"Natural Language Inference","dataset":"MultiNLI","model":"SWEM-max","rank_in_archive_order":54,"of":67,"metrics":{"Matched":"68.2","Mismatched":"67.7"},"uses_additional_data":false},{"leaderboard":"/sota/natural-language-inference-on-snli","task":"Natural Language Inference","dataset":"SNLI","model":"SWEM-max","rank_in_archive_order":82,"of":98,"metrics":{"% Test Accuracy":"83.8"},"uses_additional_data":false},{"leaderboard":"/sota/paraphrase-identification-on-msrp","task":"Paraphrase Identification","dataset":"MSRP","model":"SWEM-concat","rank_in_archive_order":3,"of":3,"metrics":{"Accuracy":"71.5","F1":"81.3"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-quora-question-pairs","task":"Question Answering","dataset":"Quora Question Pairs","model":"SWEM-concat","rank_in_archive_order":17,"of":19,"metrics":{"Accuracy":"83.03%"},"uses_additional_data":false},{"leaderboard":"/sota/question-answering-on-wikiqa","task":"Question Answering","dataset":"WikiQA","model":"SWEM-concat","rank_in_archive_order":19,"of":25,"metrics":{"MAP":"0.6788","MRR":"0.6908"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-mr","task":"Sentiment Analysis","dataset":"MR","model":"SWEM-concat","rank_in_archive_order":12,"of":19,"metrics":{"Accuracy":"78.2"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-sst-2-binary","task":"Sentiment Analysis","dataset":"SST-2 Binary classification","model":"SWEM-concat","rank_in_archive_order":78,"of":87,"metrics":{"Accuracy":"84.3"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-sst-5-fine-grained","task":"Sentiment Analysis","dataset":"SST-5 Fine-grained classification","model":"SWEM-concat","rank_in_archive_order":24,"of":31,"metrics":{"Accuracy":"46.1"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-yelp-binary","task":"Sentiment Analysis","dataset":"Yelp Binary classification","model":"SWEM-hier","rank_in_archive_order":16,"of":20,"metrics":{"Error":"4.19"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-yelp-fine-grained","task":"Sentiment Analysis","dataset":"Yelp Fine-grained classification","model":"SWEM-hier","rank_in_archive_order":15,"of":17,"metrics":{"Error":"36.21"},"uses_additional_data":false},{"leaderboard":"/sota/subjectivity-analysis-on-subj","task":"Subjectivity Analysis","dataset":"SUBJ","model":"SWEM-concat","rank_in_archive_order":13,"of":19,"metrics":{"Accuracy":"93"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-ag-news","task":"Text Classification","dataset":"AG News","model":"SWEM-concat","rank_in_archive_order":11,"of":24,"metrics":{"Error":"7.34"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-dbpedia","task":"Text Classification","dataset":"DBpedia","model":"SWEM-concat","rank_in_archive_order":19,"of":21,"metrics":{"Error":"1.43"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-trec-6","task":"Text Classification","dataset":"TREC-6","model":"SWEM-aver","rank_in_archive_order":16,"of":19,"metrics":{"Error":"7.8"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-yahoo-answers","task":"Text Classification","dataset":"Yahoo! Answers","model":"SWEM-concat","rank_in_archive_order":8,"of":10,"metrics":{"Accuracy":"73.53"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1805.09843","atlas_url":"https://app.syntology.ai/?focus=1805.09843","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}