{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/masked-language-modeling/papers/4","list_of":"/task/masked-language-modeling","task":"Masked Language Modeling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":5,"rows_per_page":100,"rows":[301,400],"of":475,"counts":{"archive_papers_tagged":475,"with_a_code_link":254,"where_syntology_ran_a_sample":67,"not_listed_spam_title":0,"listed":475,"listed_where_code_ran":67,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":52,"every_run_a_failure_of_syntologys_instrument":15,"listed_with_a_run_with_no_instrument_failure":52,"listed_every_run_a_failure_of_syntologys_instrument":15,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/masked-language-modeling","prev":"/task/masked-language-modeling/papers/3","next":"/task/masked-language-modeling/papers/5","papers":[{"url":null,"slug":"feuda-frustratingly-easy-prompt-based","title":"How Useful is Continued Pre-Training for Generative Unsupervised Domain Adaptation?","date":"2024-01-31","arxiv_id":"2401.17514","repositories_listed":0,"syntology":null},{"url":null,"slug":"drbert-unveiling-the-potential-of-masked","title":"BPDec: Unveiling the Potential of Masked Language Modeling Decoder in BERT pretraining","date":"2024-01-29","arxiv_id":"2401.15861","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-not-always-look-right-investigating-the","title":"Looking Right is Sometimes Right: Investigating the Capabilities of Decoder-only LLMs for Sequence Labeling","date":"2024-01-25","arxiv_id":"2401.14556","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-scoring-of-clinical-patient-notes","title":"Automated Scoring of Clinical Patient Notes using Advanced NLP and Pseudo Labeling","date":"2024-01-18","arxiv_id":"2401.12994","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-mask-filling-an-effective-text","title":"Iterative Mask Filling: An Effective Text Augmentation Method Using Masked Language Modeling","date":"2024-01-03","arxiv_id":"2401.01830","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-parallel-audio-generation-using","title":"Efficient Parallel Audio Generation using Group Masked Language Modeling","date":"2024-01-02","arxiv_id":"2401.01099","repositories_listed":0,"syntology":null},{"url":null,"slug":"hcdir-end-to-end-hate-context-detection-and","title":"HCDIR: End-to-end Hate Context Detection, and Intensity Reduction model for online comments","date":"2023-12-20","arxiv_id":"2312.13193","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightclip-learning-multi-level-interaction","title":"LightCLIP: Learning Multi-Level Interaction for Lightweight Vision-Language Models","date":"2023-12-01","arxiv_id":"2312.00674","repositories_listed":0,"syntology":null},{"url":null,"slug":"bim-block-wise-self-supervised-learning-with","title":"BIM: Block-Wise Self-Supervised Learning with Masked Image Modeling","date":"2023-11-28","arxiv_id":"2311.17218","repositories_listed":0,"syntology":null},{"url":null,"slug":"climb-curriculum-learning-for-infant-inspired","title":"CLIMB: Curriculum Learning for Infant-inspired Model Building","date":"2023-11-15","arxiv_id":"2311.08886","repositories_listed":0,"syntology":null},{"url":null,"slug":"user-persona-identification-and-new-service","title":"User Persona Identification and New Service Adaptation Recommendation","date":"2023-11-15","arxiv_id":"2311.10773","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-natural-language-of-dna","title":"Understanding the Natural Language of DNA using Encoder-Decoder Foundation Models with Byte-level Precision","date":"2023-11-04","arxiv_id":"2311.02333","repositories_listed":0,"syntology":null},{"url":null,"slug":"bertwich-extending-bert-s-capabilities-to","title":"BERTwich: Extending BERT's Capabilities to Model Dialectal and Noisy Text","date":"2023-10-31","arxiv_id":"2311.00116","repositories_listed":0,"syntology":null},{"url":null,"slug":"clickprompt-ctr-models-are-strong-prompt","title":"ClickPrompt: CTR Models are Strong Prompt Generators for Adapting Language Models to CTR Prediction","date":"2023-10-13","arxiv_id":"2310.09234","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-bert-based-visual-question","title":"Enhancing BERT-Based Visual Question Answering through Keyword-Driven Sentence Selection","date":"2023-10-13","arxiv_id":"2310.09432","repositories_listed":0,"syntology":null},{"url":null,"slug":"perplm-personalized-fine-tuning-of-pretrained","title":"PerPLM: Personalized Fine-tuning of Pretrained Language Models via Writer-specific Intermediate Learning and Prompts","date":"2023-09-14","arxiv_id":"2309.07727","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilma-bidirectional-local-matching-for-text","title":"BiLMa: Bidirectional Local-Matching for Text-based Person Re-identification","date":"2023-09-09","arxiv_id":"2309.04675","repositories_listed":0,"syntology":null},{"url":null,"slug":"vilta-enhancing-vision-language-pre-training","title":"ViLTA: Enhancing Vision-Language Pre-training through Textual Augmentation","date":"2023-08-31","arxiv_id":"2308.16689","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-multi-modal-contextual-knowledge","title":"Exploring Multi-Modal Contextual Knowledge for Open-Vocabulary Object Detection","date":"2023-08-30","arxiv_id":"2308.15846","repositories_listed":0,"syntology":null},{"url":null,"slug":"gender-tuning-empowering-fine-tuning-for","title":"Gender-tuning: Empowering Fine-tuning for Debiasing Pre-trained Language Models","date":"2023-07-20","arxiv_id":"2307.10522","repositories_listed":0,"syntology":null},{"url":null,"slug":"pasta-pretrained-action-state-transformer","title":"PASTA: Pretrained Action-State Transformer Agents","date":"2023-07-20","arxiv_id":"2307.10936","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-pre-trained-language-models","title":"Improving the Reusability of Pre-trained Language Models in Real-world Applications","date":"2023-07-19","arxiv_id":"2307.10457","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-bert-with-hybrid-pooling-network","title":"Improving BERT with Hybrid Pooling Network and Drop Mask","date":"2023-07-14","arxiv_id":"2307.07258","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-dialogue-grounding-embodied-task-in-a","title":"Solving Dialogue Grounding Embodied Task in a Simulated Environment using Further Masked Language Modeling","date":"2023-06-21","arxiv_id":"2306.12387","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-masking-based-data-generation","title":"Investigating Masking-based Data Generation in Language Models","date":"2023-06-16","arxiv_id":"2307.00008","repositories_listed":0,"syntology":null},{"url":null,"slug":"recipes-for-sequential-pre-training-of","title":"Recipes for Sequential Pre-training of Multilingual Encoder and Seq2Seq Models","date":"2023-06-14","arxiv_id":"2306.08756","repositories_listed":0,"syntology":null},{"url":null,"slug":"absformer-transformer-based-model-for","title":"Absformer: Transformer-based Model for Unsupervised Multi-Document Abstractive Summarization","date":"2023-06-07","arxiv_id":"2306.04787","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-explicit-procedural-instructions","title":"Leveraging Explicit Procedural Instructions for Data-Efficient Action Prediction","date":"2023-06-06","arxiv_id":"2306.03959","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-augmentation-based-self","title":"Understanding Augmentation-based Self-Supervised Representation Learning via RKHS Approximation and Regression","date":"2023-06-01","arxiv_id":"2306.00788","repositories_listed":0,"syntology":null},{"url":"/paper/layoutmask-enhance-text-layout-interaction-in","slug":"layoutmask-enhance-text-layout-interaction-in","title":"LayoutMask: Enhance Text-Layout Interaction in Multi-modal Pre-training for Document Understanding","date":"2023-05-30","arxiv_id":"2305.18721","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-masking-rate-schedules-for-mlm","title":"Dynamic Masking Rate Schedules for MLM Pretraining","date":"2023-05-24","arxiv_id":"2305.15096","repositories_listed":0,"syntology":null},{"url":null,"slug":"extrapolating-multilingual-understanding","title":"Extrapolating Multilingual Understanding Models as Multilingual Generators","date":"2023-05-22","arxiv_id":"2305.13140","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-pilot-study-on-dialogue-level-dependency","title":"A Pilot Study on Dialogue-Level Dependency Parsing for Chinese","date":"2023-05-21","arxiv_id":"2305.12441","repositories_listed":0,"syntology":null},{"url":"/paper/patton-language-model-pretraining-on-text","slug":"patton-language-model-pretraining-on-text","title":"Patton: Language Model Pretraining on Text-Rich Networks","date":"2023-05-20","arxiv_id":"2305.12268","repositories_listed":0,"syntology":{"n":8,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":6,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 6 unverified","sample_list":"/paper/patton-language-model-pretraining-on-text#ran","syntology_url":"https://syntology.ai/paper/2305.12268","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2305.12268"}},"official":null}},{"url":null,"slug":"pre-training-language-model-as-a-multi","title":"Pre-training Language Model as a Multi-perspective Course Learner","date":"2023-05-06","arxiv_id":"2305.03981","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-inference-of-a-generalised-potts","title":"Mapping of attention mechanisms to a generalized Potts model","date":"2023-04-14","arxiv_id":"2304.07235","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-unsupervised-and-supervised-learning","title":"Joint unsupervised and supervised learning for context-aware language identification","date":"2023-03-29","arxiv_id":"2303.16511","repositories_listed":0,"syntology":null},{"url":null,"slug":"hop-history-enhanced-and-order-aware-pre","title":"HOP+: History-enhanced and Order-aware Pre-training for Vision-and-Language Navigation","date":"2023-03-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lightweight-contrastive-protein-structure","title":"CCPL: Cross-modal Contrastive Protein Learning","date":"2023-03-19","arxiv_id":"2303.11783","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-transformers-parse-while-predicting-the","title":"Do Transformers Parse while Predicting the Masked Word?","date":"2023-03-14","arxiv_id":"2303.08117","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-multiple-choice-questions-for","title":"Generating multiple-choice questions for medical question answering with distractors and cue-masking","date":"2023-03-13","arxiv_id":"2303.07069","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adapted-large-language-models-for","title":"Domain-adapted large language models for classifying nuclear medicine reports","date":"2023-03-01","arxiv_id":"2303.01258","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-masked-autoencoders-with-self","title":"Efficient Masked Autoencoders with Self-Consistency","date":"2023-02-28","arxiv_id":"2302.14431","repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-sampling-for-masked-language","title":"Weighted Sampling for Masked Language Modeling","date":"2023-02-28","arxiv_id":"2302.14225","repositories_listed":0,"syntology":null},{"url":null,"slug":"capturing-topic-framing-via-masked-language","title":"Capturing Topic Framing via Masked Language Modeling","date":"2023-02-07","arxiv_id":"2302.03183","repositories_listed":0,"syntology":null},{"url":null,"slug":"tagging-before-alignment-integrating-multi","title":"Tagging before Alignment: Integrating Multi-Modal Tags for Video-Text Retrieval","date":"2023-01-30","arxiv_id":"2301.12644","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cohesive-distillation-architecture-for","title":"A Cohesive Distillation Architecture for Neural Language Models","date":"2023-01-12","arxiv_id":"2301.08130","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-as-a-foreign-language-beit-pretraining-1","title":"Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language Tasks","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"go-tuning-improving-zero-shot-learning","title":"Go-tuning: Improving Zero-shot Learning Abilities of Smaller Language Models","date":"2022-12-20","arxiv_id":"2212.10461","repositories_listed":0,"syntology":null},{"url":null,"slug":"apollo-a-simple-approach-for-adaptive","title":"APOLLO: A Simple Approach for Adaptive Pretraining of Language Models for Logical Reasoning","date":"2022-12-19","arxiv_id":"2212.09282","repositories_listed":0,"syntology":null},{"url":null,"slug":"mu-2-slam-multitask-multilingual-speech-and","title":"Mu$^{2}$SLAM: Multitask, Multilingual Speech and Language Models","date":"2022-12-19","arxiv_id":"2212.09553","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniform-masking-prevails-in-vision-language","title":"Uniform Masking Prevails in Vision-Language Pretraining","date":"2022-12-10","arxiv_id":"2212.05195","repositories_listed":0,"syntology":null},{"url":"/paper/toward-efficient-language-model-pretraining","slug":"toward-efficient-language-model-pretraining","title":"Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE","date":"2022-12-04","arxiv_id":"2212.01853","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-memory-transformer-for-processing-long","title":"Global memory transformer for processing long documents","date":"2022-12-03","arxiv_id":"2212.01650","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-study-between-token-classification","title":"Comparison Study Between Token Classification and Sequence Classification In Text Classification","date":"2022-11-25","arxiv_id":"2211.13899","repositories_listed":0,"syntology":null},{"url":null,"slug":"embracing-ambiguity-improving-similarity","title":"Embracing Ambiguity: Improving Similarity-oriented Tasks with Contextual Synonym Knowledge","date":"2022-11-20","arxiv_id":"2211.10997","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-per-image-token-consistency-for","title":"Leveraging per Image-Token Consistency for Vision-Language Pre-training","date":"2022-11-20","arxiv_id":"2211.15398","repositories_listed":0,"syntology":null},{"url":null,"slug":"hantrans-an-empirical-study-on-cross-era","title":"HanTrans: An Empirical Study on Cross-Era Transferability of Chinese Pre-trained Language Model","date":"2022-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reduce-reuse-recycle-improving-training","title":"Reduce, Reuse, Recycle: Improving Training Efficiency with Distillation","date":"2022-11-01","arxiv_id":"2211.00683","repositories_listed":0,"syntology":null},{"url":null,"slug":"spabert-a-pretrained-language-model-from","title":"SpaBERT: A Pretrained Language Model from Geographic Data for Geo-Entity Representation","date":"2022-10-21","arxiv_id":"2210.12213","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-closer-look-at-parameter-contributions-when","title":"A Closer Look at Parameter Contributions When Training Neural Language and Translation Models","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"kul-smm4h22-template-augmented-adaptive-pre","title":"KUL@SMM4H’22: Template Augmented Adaptive Pre-training for Tweet Classification","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"taking-actions-separately-a-bidirectionally","title":"Taking Actions Separately: A Bidirectionally-Adaptive Transfer Learning Method for Low-Resource Neural Machine Translation","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-making-the-most-of-pre-trained","title":"Towards Making the Most of Pre-trained Translation Model for Quality Estimation","date":"2022-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bidirectional-language-models-are-also-few","title":"Bidirectional Language Models Are Also Few-shot Learners","date":"2022-09-29","arxiv_id":"2209.14500","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-vision-and-language-modeling-for-multi","title":"Masked Vision and Language Modeling for Multi-modal Representation Learning","date":"2022-08-03","arxiv_id":"2208.02131","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-vision-language-pretraining-by","title":"Augmenting Vision Language Pretraining by Learning Codebook with Visual Semantics","date":"2022-07-31","arxiv_id":"2208.00475","repositories_listed":0,"syntology":null},{"url":null,"slug":"stt-soft-template-tuning-for-few-shot-1","title":"STT: Soft Template Tuning for Few-Shot Adaptation","date":"2022-07-18","arxiv_id":"2207.08408","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpts-at-factify-2022-prompt-aided-fact","title":"GPTs at Factify 2022: Prompt Aided Fact-Verification","date":"2022-06-29","arxiv_id":"2206.14913","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-framework-for-reversible-data-hiding-1","title":"General Framework for Reversible Data Hiding in Texts Based on Masked Language Modeling","date":"2022-06-21","arxiv_id":"2206.10112","repositories_listed":0,"syntology":null},{"url":null,"slug":"vl-beit-generative-vision-language","title":"VL-BEiT: Generative Vision-Language Pretraining","date":"2022-06-02","arxiv_id":"2206.01127","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-language-resources-and-nlp-tools","title":"Developing Language Resources and NLP Tools for the North Korean Language","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-financial-hypernyms-by-prompting","title":"Discovering Financial Hypernyms by Prompting Masked Language Models","date":"2022-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-for-expressive-task-related-sentence","title":"Enhancing Continual Learning with Global Prototypes: Counteracting Negative Representation Drift","date":"2022-05-24","arxiv_id":"2205.12186","repositories_listed":0,"syntology":null},{"url":null,"slug":"maskeval-weighted-mlm-based-evaluation-for","title":"MaskEval: Weighted MLM-Based Evaluation for Text Summarization and Simplification","date":"2022-05-24","arxiv_id":"2205.12394","repositories_listed":0,"syntology":null},{"url":null,"slug":"memorization-without-overfitting-analyzing","title":"Memorization Without Overfitting: Analyzing the Training Dynamics of Large Language Models","date":"2022-05-22","arxiv_id":"2205.10770","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundation-posteriors-for-approximate","title":"Foundation Posteriors for Approximate Probabilistic Inference","date":"2022-05-19","arxiv_id":"2205.09735","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-soft-prompt-tuning-for-cross","title":"Adversarial Soft Prompt Tuning for Cross-Domain Sentiment Analysis","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"is-whole-word-masking-always-better-for-2","title":"“Is Whole Word Masking Always Better for Chinese BERT?”: Probing on Chinese Grammatical Error Correction","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"phrase-aware-unsupervised-constituency-1","title":"Phrase-aware Unsupervised Constituency Parsing","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pretraining-chinese-bert-for-detecting-word","title":"Pretraining Chinese BERT for Detecting Word Insertion and Deletion Errors","date":"2022-04-26","arxiv_id":"2204.12052","repositories_listed":0,"syntology":null},{"url":null,"slug":"simplebert-a-pre-trained-model-that-learns-to","title":"SimpleBERT: A Pre-trained Model That Learns to Generate Simple Words","date":"2022-04-16","arxiv_id":"2204.07779","repositories_listed":0,"syntology":null},{"url":null,"slug":"wordalchemy-a-transformer-based-reverse","title":"WordAlchemy: A transformer-based Reverse Dictionary","date":"2022-04-16","arxiv_id":"2204.10181","repositories_listed":0,"syntology":null},{"url":null,"slug":"token-dropping-for-efficient-bert-pretraining","title":"Token Dropping for Efficient BERT Pretraining","date":"2022-03-24","arxiv_id":"2203.13240","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-model-multiple-tasks-pathways-for-natural","title":"SkillNet-NLU: A Sparsely Activated Model for General-Purpose Natural Language Understanding","date":"2022-03-07","arxiv_id":"2203.03312","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-whole-word-masking-always-better-for-1","title":"\"Is Whole Word Masking Always Better for Chinese BERT?\": Probing on Chinese Grammatical Error Correction","date":"2022-03-01","arxiv_id":"2203.00286","repositories_listed":0,"syntology":null},{"url":null,"slug":"vu-bert-a-unified-framework-for-visual-dialog","title":"VU-BERT: A Unified framework for Visual Dialog","date":"2022-02-22","arxiv_id":"2202.10787","repositories_listed":0,"syntology":null},{"url":null,"slug":"misinformation-detection-in-social-media","title":"Misinformation Detection in Social Media Video Posts","date":"2022-02-15","arxiv_id":"2202.07706","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-guided-injection-of-conformation-to","title":"Prompt-Guided Injection of Conformation to Pre-trained Protein Model","date":"2022-02-07","arxiv_id":"2202.02944","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-style-transfer-for-bias-mitigation-using","title":"Text Style Transfer for Bias Mitigation using Masked Language Modeling","date":"2022-01-21","arxiv_id":"2201.08643","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-distillation-for-language-models-1","title":"Causal Distillation for Language Models","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-augmentation-for-biomedical-factoid","title":"Data Augmentation for Biomedical Factoid Question Answering","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stt-soft-template-tuning-for-few-shot","title":"STT: Soft Template Tuning for Few-Shot Learning","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/a-transfer-learning-pipeline-for-educational","slug":"a-transfer-learning-pipeline-for-educational","title":"A Transfer Learning Pipeline for Educational Resource Discovery with Application in Leading Paragraph Generation","date":"2022-01-07","arxiv_id":"2201.02312","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-pre-training-induce-systematic-inference","title":"Does Pre-training Induce Systematic Inference? How Masked Language Models Acquire Commonsense Knowledge","date":"2021-12-16","arxiv_id":"2112.08583","repositories_listed":0,"syntology":null},{"url":null,"slug":"coco-bert-improving-video-language-pre","title":"CoCo-BERT: Improving Video-Language Pre-training with Contrastive Cross-modal Matching and Denoising","date":"2021-12-14","arxiv_id":"2112.07515","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-multimodal-pre-training-and-prompt","title":"Unified Multimodal Pre-training and Prompt-based Tuning for Vision-Language Understanding and Generation","date":"2021-12-10","arxiv_id":"2112.05587","repositories_listed":0,"syntology":null},{"url":null,"slug":"ufo-a-unified-transformer-for-vision-language","title":"UFO: A UniFied TransfOrmer for Vision-Language Representation Learning","date":"2021-11-19","arxiv_id":"2111.10023","repositories_listed":0,"syntology":null},{"url":null,"slug":"lanobert-system-log-anomaly-detection-based","title":"LAnoBERT: System Log Anomaly Detection based on BERT Masked Language Model","date":"2021-11-18","arxiv_id":"2111.09564","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-good-prompt-is-worth-millions-of-parameters-1","title":"A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"2ce4d5880d5ce18aa6eafa34541d006a3412997090a282046935108d3a9c2dbb","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}