{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/fast-effective-and-self-supervised","title":"Fast, Effective, and Self-Supervised: Transforming Masked Language Models into Universal Lexical and Sentence Encoders","arxiv_id":"2104.08027","date":"2021-04-16","proceeding":"EMNLP 2021 11","authors":["Fangyu Liu","Ivan Vulić","Anna Korhonen","Nigel Collier"],"abstract":"Pretrained Masked Language Models (MLMs) have revolutionised NLP in recent years. However, previous work has indicated that off-the-shelf MLMs are not effective as universal lexical or sentence encoders without further task-specific fine-tuning on NLI, sentence similarity, or paraphrasing tasks using annotated task data. In this work, we demonstrate that it is possible to turn MLMs into effective universal lexical and sentence encoders even without any additional data and without any supervision. We propose an extremely simple, fast and effective contrastive learning technique, termed Mirror-BERT, which converts MLMs (e.g., BERT and RoBERTa) into such encoders in 20-30 seconds without any additional external knowledge. Mirror-BERT relies on fully identical or slightly modified string pairs as positive (i.e., synonymous) fine-tuning examples, and aims to maximise their similarity during identity fine-tuning. We report huge gains over off-the-shelf MLMs with Mirror-BERT in both lexical-level and sentence-level tasks, across different domains and different languages. Notably, in the standard sentence semantic similarity (STS) tasks, our self-supervised Mirror-BERT model even matches the performance of the task-tuned Sentence-BERT models from prior work. Finally, we delve deeper into the inner workings of MLMs, and suggest some evidence on why this simple approach can yield effective universal lexical and sentence encoders.","url_abs":"https://arxiv.org/abs/2104.08027v2","url_pdf":"https://arxiv.org/pdf/2104.08027v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"fast-effective-and-self-supervised","repo_url":"https://github.com/cambridgeltl/mirror-bert","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"contrastive-learning","task_name":"Contrastive Learning"},{"task_slug":"cross-lingual-semantic-textual-similarity","task_name":"Cross-Lingual Semantic Textual Similarity"},{"task_slug":"entity-linking","task_name":"Entity Linking"},{"task_slug":"sts","task_name":"STS"},{"task_slug":"semantic-similarity","task_name":"Semantic Similarity"},{"task_slug":"semantic-textual-similarity","task_name":"Semantic Textual Similarity"},{"task_slug":"sentence","task_name":"Sentence"},{"task_slug":"sentence-similarity","task_name":"Sentence Similarity"}],"methods":[{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"bert","method_name":"BERT"},{"method_slug":"contrastive-learning","method_name":"Contrastive Learning"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"linear-warmup-with-linear-decay","method_name":"Linear Warmup With Linear Decay"},{"method_slug":"mirror-bert","method_name":"Mirror-BERT"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"wordpiece","method_name":"WordPiece"}],"datasets_introduced":[],"methods_introduced":[{"slug":"mirror-bert","name":"Mirror-BERT","full_name":"Mirror-BERT"}],"results":[{"leaderboard":"/sota/semantic-textual-similarity-on-sick","task":"Semantic Textual Similarity","dataset":"SICK","model":"Mirror-RoBERTa-base (unsup.)","rank_in_archive_order":16,"of":22,"metrics":{"Spearman Correlation":"0.706"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sick","task":"Semantic Textual Similarity","dataset":"SICK","model":"Mirror-BERT-base (unsup.)","rank_in_archive_order":17,"of":22,"metrics":{"Spearman Correlation":"0.703"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"Mirror-RoBERTa-base (unsup.)","rank_in_archive_order":54,"of":66,"metrics":{"Spearman Correlation":"0.787"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts-benchmark","task":"Semantic Textual Similarity","dataset":"STS Benchmark","model":"Mirror-BERT-base (unsup.)","rank_in_archive_order":59,"of":66,"metrics":{"Spearman Correlation":"0.764"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts12","task":"Semantic Textual Similarity","dataset":"STS12","model":"Mirror-BERT-base (unsup.)","rank_in_archive_order":17,"of":20,"metrics":{"Spearman Correlation":"0.674"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts12","task":"Semantic Textual Similarity","dataset":"STS12","model":"Mirror-RoBERTa-base (unsup.)","rank_in_archive_order":19,"of":20,"metrics":{"Spearman Correlation":"0.648"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts13","task":"Semantic Textual Similarity","dataset":"STS13","model":"Mirror-RoBERTa-base (unsup.)","rank_in_archive_order":16,"of":22,"metrics":{"Spearman Correlation":"0.819"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts13","task":"Semantic Textual Similarity","dataset":"STS13","model":"Mirror-BERT-base (unsup.)","rank_in_archive_order":19,"of":22,"metrics":{"Spearman Correlation":"0.796"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts14","task":"Semantic Textual Similarity","dataset":"STS14","model":"Mirror-RoBERTa-base (unsup.)","rank_in_archive_order":17,"of":21,"metrics":{"Spearman Correlation":"0.732"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts14","task":"Semantic Textual Similarity","dataset":"STS14","model":"Mirror-BERT-base (unsup.)","rank_in_archive_order":18,"of":21,"metrics":{"Spearman Correlation":"0.713"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts15","task":"Semantic Textual Similarity","dataset":"STS15","model":"Mirror-BERT-base (unsup.)","rank_in_archive_order":16,"of":20,"metrics":{"Spearman Correlation":"0.814"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts15","task":"Semantic Textual Similarity","dataset":"STS15","model":"Mirror-RoBERTa-base (unsup.)","rank_in_archive_order":18,"of":20,"metrics":{"Spearman Correlation":"0.798"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts16","task":"Semantic Textual Similarity","dataset":"STS16","model":"Mirror-RoBERTa-base (unsup.)","rank_in_archive_order":15,"of":20,"metrics":{"Spearman Correlation":"0.78"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-textual-similarity-on-sts16","task":"Semantic Textual Similarity","dataset":"STS16","model":"Mirror-BERT-base (unsup.)","rank_in_archive_order":19,"of":20,"metrics":{"Spearman Correlation":"0.743"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2104.08027","atlas_url":"https://app.syntology.ai/?focus=2104.08027","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2104.08027"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-25T09:33:49+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"deterministic:regex_extraction","url":"https://github.com/cambridgeltl/mirror-bert","reach":null}],"summary":{"unverified":1},"by_repo_kind":{"official":{"samples":1,"ran":0,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":0,"samples":[{"code_sha256_prefix":"b50c6b3ff155dbd1","entry":"MirrorBERT","repo":"cambridgeltl/mirror-bert","repo_kind":"official","path":"src/mirror_bert.py","file_url":"https://github.com/cambridgeltl/mirror-bert/blob/HEAD/src/mirror_bert.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"b50c6b3ff155dbd1"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}