{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/trans-encoder-unsupervised-sentence-pair","title":"Trans-Encoder: Unsupervised sentence-pair modelling through self- and mutual-distillations","arxiv_id":"2109.13059","date":"2021-09-27","proceeding":"ICLR 2022 4","authors":["Fangyu Liu","Yunlong Jiao","Jordan Massiah","Emine Yilmaz","Serhii Havrylov"],"abstract":"In NLP, a large volume of tasks involve pairwise comparison between two sequences (e.g. sentence similarity and paraphrase identification). Predominantly, two formulations are used for sentence-pair tasks: bi-encoders and cross-encoders. Bi-encoders produce fixed-dimensional sentence representations and are computationally efficient, however, they usually underperform cross-encoders. Cross-encoders can leverage their attention heads to exploit inter-sentence interactions for better performance but they require task fine-tuning and are computationally more expensive. In this paper, we present a completely unsupervised sentence representation model termed as Trans-Encoder that combines the two learning paradigms into an iterative joint framework to simultaneously learn enhanced bi- and cross-encoders. Specifically, on top of a pre-trained Language Model (PLM), we start with converting it to an unsupervised bi-encoder, and then alternate between the bi- and cross-encoder task formulations. In each alternation, one task formulation will produce pseudo-labels which are used as learning signals for the other task formulation. We then propose an extension to conduct such self-distillation approach on multiple PLMs in parallel and use the average of their pseudo-labels for mutual-distillation. Trans-Encoder creates, to the best of our knowledge, the first completely unsupervised cross-encoder and also a state-of-the-art unsupervised bi-encoder for sentence similarity. Both the bi-encoder and cross-encoder formulations of Trans-Encoder outperform recently proposed state-of-the-art unsupervised sentence encoders such as Mirror-BERT and SimCSE by up to 5% on the sentence similarity benchmarks.","url_abs":"https://arxiv.org/abs/2109.13059v4","url_pdf":"https://arxiv.org/pdf/2109.13059v4.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"trans-encoder-unsupervised-sentence-pair","repo_url":"https://github.com/amzn/trans-encoder","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}}],"tasks":[{"task_slug":"contrastive-learning","task_name":"Contrastive Learning"},{"task_slug":"language-modelling","task_name":"Language Modelling"},{"task_slug":"paraphrase-identification","task_name":"Paraphrase Identification"},{"task_slug":"semantic-textual-similarity","task_name":"Semantic Textual Similarity"},{"task_slug":"sentence","task_name":"Sentence"},{"task_slug":"sentence-similarity","task_name":"Sentence Similarity"}],"methods":[{"method_slug":"mirror-bert","method_name":"Mirror-BERT"},{"method_slug":"simcse","method_name":"SimCSE"},{"method_slug":"trans-encoder","method_name":"Trans-Encoder"}],"datasets_introduced":[],"methods_introduced":[{"slug":"trans-encoder","name":"Trans-Encoder","full_name":"Trans-Encoder"}],"results":[{"leaderboard":"/sota/semantic-textual-similarity-on-sick","task":"Semantic Textual Similarity","dataset":"SICK","model":"Trans-Encoder-BERT-base-bi (unsup.)","rank_in_archive_order":12,"of":22,"metrics":{"Spearman Correlation":"0.7276"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sick","task":"Semantic Textual Similarity","dataset":"SICK","model":"Trans-Encoder-BERT-large-cross (unsup.)","rank_in_archive_order":13,"of":22,"metrics":{"Spearman Correlation":"0.7192"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sick","task":"Semantic Textual Similarity","dataset":"SICK","model":"Trans-Encoder-RoBERTa-large-cross (unsup.)","rank_in_archive_order":14,"of":22,"metrics":{"Spearman Correlation":"0.7163"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sick","task":"Semantic Textual Similarity","dataset":"SICK","model":"Trans-Encoder-BERT-large-bi (unsup.)","rank_in_archive_order":15,"of":22,"metrics":{"Spearman Correlation":"0.7133"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sick","task":"Semantic Textual Similarity","dataset":"SICK","model":"Trans-Encoder-BERT-base-cross (unsup.)","rank_in_archive_order":18,"of":22,"metrics":{"Spearman Correlation":"0.6952"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"Trans-Encoder-RoBERTa-large-cross (unsup.)","rank_in_archive_order":41,"of":66,"metrics":{"Spearman Correlation":"0.867"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"Trans-Encoder-RoBERTa-large-bi (unsup.)","rank_in_archive_order":42,"of":66,"metrics":{"Spearman Correlation":"0.8655"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"Trans-Encoder-BERT-large-bi (unsup.)","rank_in_archive_order":45,"of":66,"metrics":{"Spearman Correlation":"0.8616"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"Trans-Encoder-RoBERTa-base-cross (unsup.)","rank_in_archive_order":48,"of":66,"metrics":{"Spearman Correlation":"0.8465"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"Trans-Encoder-BERT-base-bi (unsup.)","rank_in_archive_order":51,"of":66,"metrics":{"Spearman Correlation":"0.839"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts12","task":"Semantic Textual Similarity","dataset":"STS12","model":"Trans-Encoder-RoBERTa-large-cross (unsup.)","rank_in_archive_order":7,"of":20,"metrics":{"Spearman Correlation":"0.7828"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts12","task":"Semantic Textual Similarity","dataset":"STS12","model":"Trans-Encoder-BERT-large-bi (unsup.)","rank_in_archive_order":8,"of":20,"metrics":{"Spearman Correlation":"0.7819"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts12","task":"Semantic Textual Similarity","dataset":"STS12","model":"Trans-Encoder-RoBERTa-base-cross (unsup.)","rank_in_archive_order":10,"of":20,"metrics":{"Spearman Correlation":"0.7637"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts12","task":"Semantic Textual Similarity","dataset":"STS12","model":"Trans-Encoder-BERT-base-bi (unsup.)","rank_in_archive_order":11,"of":20,"metrics":{"Spearman Correlation":"0.7509"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts13","task":"Semantic Textual Similarity","dataset":"STS13","model":"Trans-Encoder-BERT-large-bi (unsup.)","rank_in_archive_order":7,"of":22,"metrics":{"Spearman Correlation":"0.8851"},"uses_additional_data":true},{"leaderboard":"/sota/semantic-textual-similarity-on-sts13","task":"Semantic Textual Similarity","dataset":"STS13","model":"Trans-Encoder-BERT-large-cross (unsup.)","rank_in_archive_order":8,"of":22,"metrics":{"Spearman Correlation":"0.8831"},"uses_additional_data":true},{"leaderboard":"/sota/semantic-textual-similarity-on-sts13","task":"Semantic Textual Similarity","dataset":"STS13","model":"Trans-Encoder-RoBERTa-large-cross (unsup.)","rank_in_archive_order":9,"of":22,"metrics":{"Spearman Correlation":"0.8831"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts13","task":"Semantic Textual Similarity","dataset":"STS13","model":"Trans-Encoder-BERT-base-cross (unsup.)","rank_in_archive_order":11,"of":22,"metrics":{"Spearman Correlation":"0.8559"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts13","task":"Semantic Textual Similarity","dataset":"STS13","model":"Trans-Encoder-BERT-base-bi (unsup.)","rank_in_archive_order":12,"of":22,"metrics":{"Spearman Correlation":"0.851"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts14","task":"Semantic Textual Similarity","dataset":"STS14","model":"Trans-Encoder-RoBERTa-large-cross (unsup.)","rank_in_archive_order":9,"of":21,"metrics":{"Spearman Correlation":"0.8194"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts14","task":"Semantic Textual Similarity","dataset":"STS14","model":"Trans-Encoder-RoBERTa-large-bi (unsup.)","rank_in_archive_order":10,"of":21,"metrics":{"Spearman Correlation":"0.8176"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts14","task":"Semantic Textual Similarity","dataset":"STS14","model":"Trans-Encoder-BERT-large-bi (unsup.)","rank_in_archive_order":11,"of":21,"metrics":{"Spearman Correlation":"0.8137"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts14","task":"Semantic Textual Similarity","dataset":"STS14","model":"Trans-Encoder-RoBERTa-base-cross (unsup.)","rank_in_archive_order":12,"of":21,"metrics":{"Spearman Correlation":"0.7903"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts14","task":"Semantic Textual Similarity","dataset":"STS14","model":"Trans-Encoder-BERT-base-bi (unsup.)","rank_in_archive_order":13,"of":21,"metrics":{"Spearman Correlation":"0.779"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts15","task":"Semantic Textual Similarity","dataset":"STS15","model":"Trans-Encoder-RoBERTa-large-cross (unsup.)","rank_in_archive_order":6,"of":20,"metrics":{"Spearman Correlation":"0.8863"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts15","task":"Semantic Textual Similarity","dataset":"STS15","model":"Trans-Encoder-BERT-large-bi (unsup.)","rank_in_archive_order":7,"of":20,"metrics":{"Spearman Correlation":"0.8816"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts15","task":"Semantic Textual Similarity","dataset":"STS15","model":"Trans-Encoder-RoBERTa-base-cross (unsup.)","rank_in_archive_order":10,"of":20,"metrics":{"Spearman Correlation":"0.8577"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts15","task":"Semantic Textual Similarity","dataset":"STS15","model":"Trans-Encoder-BERT-base-bi (unsup.)","rank_in_archive_order":11,"of":20,"metrics":{"Spearman Correlation":"0.8508"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts15","task":"Semantic Textual Similarity","dataset":"STS15","model":"Trans-Encoder-BERT-base-cross (unsup.)","rank_in_archive_order":12,"of":20,"metrics":{"Spearman Correlation":"0.8444"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts16","task":"Semantic Textual Similarity","dataset":"STS16","model":"Trans-Encoder-RoBERTa-large-cross (unsup.)","rank_in_archive_order":7,"of":20,"metrics":{"Spearman Correlation":"0.8503"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts16","task":"Semantic Textual Similarity","dataset":"STS16","model":"Trans-Encoder-BERT-large-bi (unsup.)","rank_in_archive_order":9,"of":20,"metrics":{"Spearman Correlation":"0.8481"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts16","task":"Semantic Textual Similarity","dataset":"STS16","model":"Trans-Encoder-RoBERTa-base-cross (unsup.)","rank_in_archive_order":11,"of":20,"metrics":{"Spearman Correlation":"0.8377"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts16","task":"Semantic Textual Similarity","dataset":"STS16","model":"Trans-Encoder-BERT-base-bi (unsup.)","rank_in_archive_order":12,"of":20,"metrics":{"Spearman Correlation":"0.8305"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":"https://app.syntology.ai/?focus=2109.13059","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}