{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/automated-concatenation-of-embeddings-for-1","title":"Automated Concatenation of Embeddings for Structured Prediction","arxiv_id":"2010.05006","date":"2020-10-10","proceeding":"ACL 2021 5","authors":["Xinyu Wang","Yong Jiang","Nguyen Bach","Tao Wang","Zhongqiang Huang","Fei Huang","Kewei Tu"],"abstract":"Pretrained contextualized embeddings are powerful word representations for structured prediction tasks. Recent work found that better word representations can be obtained by concatenating different types of embeddings. However, the selection of embeddings to form the best concatenated representation usually varies depending on the task and the collection of candidate embeddings, and the ever-increasing number of embedding types makes it a more difficult problem. In this paper, we propose Automated Concatenation of Embeddings (ACE) to automate the process of finding better concatenations of embeddings for structured prediction tasks, based on a formulation inspired by recent progress on neural architecture search. Specifically, a controller alternately samples a concatenation of embeddings, according to its current belief of the effectiveness of individual embedding types in consideration for a task, and updates the belief based on a reward. We follow strategies in reinforcement learning to optimize the parameters of the controller and compute the reward based on the accuracy of a task model, which is fed with the sampled concatenation as input and trained on a task dataset. Empirical results on 6 tasks and 21 datasets show that our approach outperforms strong baselines and achieves state-of-the-art performance with fine-tuned embeddings in all the evaluations.","url_abs":"https://arxiv.org/abs/2010.05006v4","url_pdf":"https://arxiv.org/pdf/2010.05006v4.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"automated-concatenation-of-embeddings-for-1","repo_url":"https://github.com/Alibaba-NLP/ACE","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"automated-concatenation-of-embeddings-for-1","repo_url":"https://github.com/zhaoyuesun/phee","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"aspect-extraction","task_name":"Aspect Extraction"},{"task_slug":"chunking","task_name":"Chunking"},{"task_slug":"dependency-parsing","task_name":"Dependency Parsing"},{"task_slug":"named-entity-recognition-ner","task_name":"Named Entity Recognition (NER)"},{"task_slug":"architecture-search","task_name":"Neural Architecture Search"},{"task_slug":"part-of-speech-tagging","task_name":"Part-Of-Speech Tagging"},{"task_slug":"prediction","task_name":"Prediction"},{"task_slug":"semantic-dependency-parsing","task_name":"Semantic Dependency Parsing"},{"task_slug":"structured-prediction","task_name":"Structured Prediction"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"crf","method_name":"CRF"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"entropy-regularization","method_name":"Entropy Regularization"},{"method_slug":"lstm","method_name":"LSTM"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"neural-architecture-search","method_name":"Neural Architecture Search"},{"method_slug":"ppo","method_name":"PPO"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"sentencepiece","method_name":"SentencePiece"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"tanh-activation","method_name":"Tanh Activation"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"},{"method_slug":"xlnet","method_name":"XLNet"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/aspect-extraction-on-semeval-2015-task-12","task":"Aspect Extraction","dataset":"SemEval 2015 Task 12","model":"ACE","rank_in_archive_order":1,"of":2,"metrics":{"Restaurant (F1)":"80.3"},"uses_additional_data":false},{"leaderboard":"/sota/aspect-extraction-on-semeval-2014-task-4-sub-1","task":"Aspect Extraction","dataset":"SemEval-2014 Task-4","model":"ACE","rank_in_archive_order":2,"of":6,"metrics":{"Laptop (F1)":"87.4","Restaurant (F1)":"92.0"},"uses_additional_data":false},{"leaderboard":"/sota/chunking-on-conll-2000","task":"Chunking","dataset":"CoNLL 2000","model":"ACE","rank_in_archive_order":1,"of":9,"metrics":{"Exact Span F1":"97.3"},"uses_additional_data":false},{"leaderboard":"/sota/chunking-on-conll-2003-english","task":"Chunking","dataset":"CoNLL 2003 (English)","model":"ACE","rank_in_archive_order":1,"of":3,"metrics":{"F1":"92.5"},"uses_additional_data":false},{"leaderboard":"/sota/chunking-on-conll-2003-german","task":"Chunking","dataset":"CoNLL 2003 (German)","model":"ACE","rank_in_archive_order":1,"of":3,"metrics":{"F1":"95.0"},"uses_additional_data":false},{"leaderboard":"/sota/chunking-on-penn-treebank","task":"Chunking","dataset":"Penn Treebank","model":"ACE","rank_in_archive_order":1,"of":8,"metrics":{"F1 score":"97.3"},"uses_additional_data":false},{"leaderboard":"/sota/dependency-parsing-on-penn-treebank","task":"Dependency Parsing","dataset":"Penn Treebank","model":"ACE","rank_in_archive_order":3,"of":22,"metrics":{"LAS":"95.8","UAS":"97.2"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2002-dutch","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2002 (Dutch)","model":"ACE + document-context","rank_in_archive_order":1,"of":6,"metrics":{"F1":"95.7"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2002-dutch","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2002 (Dutch)","model":"ACE","rank_in_archive_order":3,"of":6,"metrics":{"F1":"94.6"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2002","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2002 (Spanish)","model":"ACE + document-context","rank_in_archive_order":1,"of":6,"metrics":{"F1":"95.9"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2002","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2002 (Spanish)","model":"ACE","rank_in_archive_order":2,"of":6,"metrics":{"F1":"91.7"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-conll-2003","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2003 (English)","model":"ACE + document-context","rank_in_archive_order":1,"of":73,"metrics":{"F1":"94.6"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-ner-on-conll-2003","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2003 (English)","model":"ACE","rank_in_archive_order":16,"of":73,"metrics":{"F1":"93.64"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2003-german","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2003 (German)","model":"ACE + document-context","rank_in_archive_order":1,"of":6,"metrics":{"F1":"88.38"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2003-german","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2003 (German)","model":"ACE","rank_in_archive_order":4,"of":6,"metrics":{"F1":"87.0"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2003-german-1","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2003 (German) Revised","model":"ACE + document-context","rank_in_archive_order":2,"of":5,"metrics":{"F1":"91.7"},"uses_additional_data":false},{"leaderboard":"/sota/named-entity-recognition-on-conll-2003-german-1","task":"Named Entity Recognition (NER)","dataset":"CoNLL 2003 (German) Revised","model":"ACE","rank_in_archive_order":3,"of":5,"metrics":{"F1":"90.5"},"uses_additional_data":false},{"leaderboard":"/sota/part-of-speech-tagging-on-ark","task":"Part-Of-Speech Tagging","dataset":"ARK","model":"ACE","rank_in_archive_order":1,"of":3,"metrics":{"Acc":"94.4"},"uses_additional_data":false},{"leaderboard":"/sota/part-of-speech-tagging-on-ritter","task":"Part-Of-Speech Tagging","dataset":"Ritter","model":"ACE","rank_in_archive_order":1,"of":4,"metrics":{"Acc":"93.4"},"uses_additional_data":false},{"leaderboard":"/sota/part-of-speech-tagging-on-tweebank","task":"Part-Of-Speech Tagging","dataset":"Tweebank","model":"ACE","rank_in_archive_order":1,"of":3,"metrics":{"Acc":"95.8"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-dependency-parsing-on-dm","task":"Semantic Dependency Parsing","dataset":"DM","model":"ACE","rank_in_archive_order":1,"of":4,"metrics":{"In-domain":"95.6","Out-of-domain":"92.6"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-dependency-parsing-on-pas","task":"Semantic Dependency Parsing","dataset":"PAS","model":"ACE","rank_in_archive_order":1,"of":4,"metrics":{"In-domain":"95.8","Out-of-domain":"94.6"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-dependency-parsing-on-psd","task":"Semantic Dependency Parsing","dataset":"PSD","model":"ACE","rank_in_archive_order":1,"of":4,"metrics":{"In-domain":"83.8","Out-of-domain":"83.4"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2010.05006","atlas_url":"https://app.syntology.ai/?focus=2010.05006","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}