{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modeling/papers/115","list_of":"/task/language-modeling","task":"Language Modeling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":115,"pages_in_order":142,"rows_per_page":100,"rows":[11401,11500],"of":14182,"counts":{"archive_papers_tagged":14182,"with_a_code_link":5620,"where_syntology_ran_a_sample":1894,"not_listed_spam_title":0,"listed":14182,"listed_where_code_ran":1894,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1580,"every_run_a_failure_of_syntologys_instrument":314,"listed_with_a_run_with_no_instrument_failure":1580,"listed_every_run_a_failure_of_syntologys_instrument":314,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modeling","prev":"/task/language-modeling/papers/114","next":"/task/language-modeling/papers/116","papers":[{"url":null,"slug":"pretraining-chinese-bert-for-detecting-word","title":"Pretraining Chinese BERT for Detecting Word Insertion and Deletion Errors","date":"2022-04-26","arxiv_id":"2204.12052","repositories_listed":0,"syntology":null},{"url":null,"slug":"c3-continued-pretraining-with-contrastive","title":"C3: Continued Pretraining with Contrastive Weak Supervision for Cross Language Ad-Hoc Retrieval","date":"2022-04-25","arxiv_id":"2204.11989","repositories_listed":0,"syntology":null},{"url":null,"slug":"crystal-transformer-self-learning-neural","title":"Crystal Transformer: Self-learning neural language model for Generative and Tinkering Design of Materials","date":"2022-04-25","arxiv_id":"2204.11953","repositories_listed":0,"syntology":null},{"url":null,"slug":"ed2lm-encoder-decoder-to-language-model-for-1","title":"ED2LM: Encoder-Decoder to Language Model for Faster Document Re-ranking Inference","date":"2022-04-25","arxiv_id":"2204.11458","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-expert-utilization-in-mixture-of","title":"Sparsely-gated Mixture-of-Expert Layers for CNN Interpretability","date":"2022-04-22","arxiv_id":"2204.10598","repositories_listed":0,"syntology":null},{"url":null,"slug":"locally-aggregated-feature-attribution-on","title":"Locally Aggregated Feature Attribution on Natural Language Model Understanding","date":"2022-04-22","arxiv_id":"2204.10893","repositories_listed":0,"syntology":null},{"url":null,"slug":"taygete-at-semeval-2022-task-4-roberta-based","title":"Taygete at SemEval-2022 Task 4: RoBERTa based models for detecting Patronising and Condescending Language","date":"2022-04-22","arxiv_id":"2204.10519","repositories_listed":0,"syntology":null},{"url":null,"slug":"wabert-a-low-resource-end-to-end-model-for","title":"WaBERT: A Low-resource End-to-end Model for Spoken Language Understanding and Speech-to-BERT Alignment","date":"2022-04-22","arxiv_id":"2204.10461","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-unintended-memorization-in-language","title":"Detecting Unintended Memorization in Language-Model-Fused ASR","date":"2022-04-20","arxiv_id":"2204.09606","repositories_listed":0,"syntology":null},{"url":null,"slug":"decbert-enhancing-the-language-understanding","title":"DecBERT: Enhancing the Language Understanding of BERT with Causal Attention Masks","date":"2022-04-19","arxiv_id":"2204.08688","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-syntax-aware-language-modeling-1","title":"Multilingual Syntax-aware Language Modeling through Dependency Tree Conversion","date":"2022-04-19","arxiv_id":"2204.08644","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-language-modeling-for-goal-1","title":"Context-Aware Language Modeling for Goal-Oriented Dialogue Systems","date":"2022-04-18","arxiv_id":"2204.10198","repositories_listed":0,"syntology":null},{"url":null,"slug":"umass-pcl-at-semeval-2022-task-4-pre-trained","title":"UMass PCL at SemEval-2022 Task 4: Pre-trained Language Model Ensembles for Detecting Patronizing and Condescending Language","date":"2022-04-18","arxiv_id":"2204.08304","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-entity-and-tweet-characterization","title":"Zero-shot Entity and Tweet Characterization with Designed Conditional Prompts and Contexts","date":"2022-04-18","arxiv_id":"2204.08405","repositories_listed":0,"syntology":null},{"url":null,"slug":"simplebert-a-pre-trained-model-that-learns-to","title":"SimpleBERT: A Pre-trained Model That Learns to Generate Simple Words","date":"2022-04-16","arxiv_id":"2204.07779","repositories_listed":0,"syntology":null},{"url":null,"slug":"wordalchemy-a-transformer-based-reverse","title":"WordAlchemy: A transformer-based Reverse Dictionary","date":"2022-04-16","arxiv_id":"2204.10181","repositories_listed":0,"syntology":null},{"url":null,"slug":"rows-from-many-sources-enriching-row","title":"Rows from Many Sources: Enriching row completions from Wikidata with a pre-trained Language Model","date":"2022-04-14","arxiv_id":"2204.07014","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-a-broad-coverage-benchmark-for-1","title":"Curriculum: A Broad-Coverage Benchmark for Linguistic Phenomena in Natural Language Understanding","date":"2022-04-13","arxiv_id":"2204.06283","repositories_listed":0,"syntology":null},{"url":null,"slug":"hit-at-semeval-2022-task-2-pre-trained","title":"HIT at SemEval-2022 Task 2: Pre-trained Language Model for Idioms Detection","date":"2022-04-13","arxiv_id":"2204.06145","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-not-fire-the-linguist-grammatical-profiles","title":"Do Not Fire the Linguist: Grammatical Profiles Help Language Models Detect Semantic Change","date":"2022-04-12","arxiv_id":"2204.05717","repositories_listed":0,"syntology":null},{"url":null,"slug":"mining-logical-event-schemas-from-pre-trained","title":"Mining Logical Event Schemas From Pre-Trained Language Models","date":"2022-04-12","arxiv_id":"2204.05939","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-bigscience-multilingual-model-to","title":"Adapting BigScience Multilingual Model to Unseen Languages","date":"2022-04-11","arxiv_id":"2204.04873","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-the-gap-between-language-models-and","title":"Bridging the Gap between Language Models and Cross-Lingual Sequence Labeling","date":"2022-04-11","arxiv_id":"2204.05210","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-character-are-subwords-good-enough-1","title":"Breaking Character: Are Subwords Good Enough for MRLs After All?","date":"2022-04-10","arxiv_id":"2204.04748","repositories_listed":0,"syntology":null},{"url":null,"slug":"pushing-on-personality-detection-from-verbal","title":"Pushing on Personality Detection from Verbal Behavior: A Transformer Meets Text Contours of Psycholinguistic Features","date":"2022-04-10","arxiv_id":"2204.04629","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-for-public-health-surveillance","title":"Benchmarking for Public Health Surveillance tasks on Social Media with a Domain-Specific Pretrained Language Model","date":"2022-04-09","arxiv_id":"2204.04521","repositories_listed":0,"syntology":null},{"url":null,"slug":"idpg-an-instance-dependent-prompt-generation-1","title":"IDPG: An Instance-Dependent Prompt Generation Method","date":"2022-04-09","arxiv_id":"2204.04497","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-semi-supervised-learning-of-automatic","title":"Advancing Semi-Supervised Learning for Automatic Post-Editing: Data-Synthesis by Mask-Infilling with Erroneous Terms","date":"2022-04-08","arxiv_id":"2204.03896","repositories_listed":0,"syntology":null},{"url":null,"slug":"autoencoding-language-model-based-ensemble","title":"Autoencoding Language Model Based Ensemble Learning for Commonsense Validation and Explanation","date":"2022-04-07","arxiv_id":"2204.03324","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-wordnet-construction-using-word","title":"Towards Automatic Construction of Filipino WordNet: Word Sense Induction and Synset Induction Using Sentence Embeddings","date":"2022-04-07","arxiv_id":"2204.03251","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-complementary-joint-training-approach-using","title":"A Complementary Joint Training Approach Using Unpaired Speech and Text for Low-Resource Automatic Speech Recognition","date":"2022-04-05","arxiv_id":"2204.02023","repositories_listed":0,"syntology":null},{"url":null,"slug":"lamner-code-comment-generation-using","title":"LAMNER: Code Comment Generation Using Character Language Model and Named Entity Recognition","date":"2022-04-05","arxiv_id":"2204.09654","repositories_listed":0,"syntology":null},{"url":null,"slug":"into-tts-intonation-template-based-prosody","title":"Into-TTS : Intonation Template Based Prosody Control System","date":"2022-04-04","arxiv_id":"2204.01271","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-dialect-density-estimation-for","title":"Automatic Dialect Density Estimation for African American English","date":"2022-04-03","arxiv_id":"2204.00967","repositories_listed":0,"syntology":null},{"url":null,"slug":"effect-and-analysis-of-large-scale-language","title":"Effect and Analysis of Large-scale Language Model Rescoring on Competitive ASR Systems","date":"2022-04-01","arxiv_id":"2204.00212","repositories_listed":0,"syntology":null},{"url":null,"slug":"nc-dre-leveraging-non-entity-clue-information","title":"NC-DRE: Leveraging Non-entity Clue Information for Document-level Relation Extraction","date":"2022-04-01","arxiv_id":"2204.00255","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-informed-question-answering-with","title":"Syntax-informed Question Answering with Heterogeneous Graph Transformer","date":"2022-04-01","arxiv_id":"2204.09655","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-cross-lingual-aphasia-detection","title":"Zero-Shot Cross-lingual Aphasia Detection using Automatic Speech Recognition","date":"2022-04-01","arxiv_id":"2204.00448","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-of-language-model","title":"An Empirical Study of Language Model Integration for Transducer based Speech Recognition","date":"2022-03-31","arxiv_id":"2203.16776","repositories_listed":0,"syntology":null},{"url":null,"slug":"esgbert-language-model-to-help-with","title":"ESGBERT: Language Model to Help with Classification Tasks Related to Companies Environmental, Social, and Governance Practices","date":"2022-03-31","arxiv_id":"2203.16788","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-language-model-size-in-cross-device","title":"Scaling Language Model Size in Cross-Device Federated Learning","date":"2022-03-31","arxiv_id":"2204.09715","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-mlm-improved-contrastive-learning-for","title":"Auto-MLM: Improved Contrastive Learning for Self-supervised Multi-lingual Knowledge Retrieval","date":"2022-03-30","arxiv_id":"2203.16187","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-spoken-dialogue-language-modeling","title":"Generative Spoken Dialogue Language Modeling","date":"2022-03-30","arxiv_id":"2203.16502","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-speech-recognition-for-indic","title":"Improving Speech Recognition for Indic Languages using Language Model","date":"2022-03-30","arxiv_id":"2203.16595","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-dynamic-semantics-into-pre","title":"Incorporating Dynamic Semantics into Pre-Trained Language Model for Aspect-based Sentiment Analysis","date":"2022-03-30","arxiv_id":"2203.16369","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-media-scientific-research-achievements","title":"Cross-Media Scientific Research Achievements Retrieval Based on Deep Language Model","date":"2022-03-29","arxiv_id":"2203.15595","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualizing-the-relationship-between-encoded","title":"Visualizing the Relationship Between Encoded Linguistic Information and Task Performance","date":"2022-03-29","arxiv_id":"2203.15860","repositories_listed":0,"syntology":null},{"url":null,"slug":"anna-enhanced-language-representation-for-1","title":"ANNA: Enhanced Language Representation for Question Answering","date":"2022-03-28","arxiv_id":"2203.14507","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-in-context-improving-cosine","title":"Comparing in context: Improving cosine similarity measures with a metric tensor","date":"2022-03-28","arxiv_id":"2203.14996","repositories_listed":0,"syntology":null},{"url":null,"slug":"encbp-a-new-benchmark-dataset-for-finer","title":"EnCBP: A New Benchmark Dataset for Finer-Grained Cultural Background Prediction in English","date":"2022-03-28","arxiv_id":"2203.14498","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-roadmap-for-big-model","title":"A Roadmap for Big Model","date":"2022-03-26","arxiv_id":"2203.14101","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-distributional-distortion-in-1","title":"Evaluating Distributional Distortion in Neural Language Modeling","date":"2022-03-24","arxiv_id":"2203.12788","repositories_listed":0,"syntology":null},{"url":null,"slug":"token-dropping-for-efficient-bert-pretraining","title":"Token Dropping for Efficient BERT Pretraining","date":"2022-03-24","arxiv_id":"2203.13240","repositories_listed":0,"syntology":null},{"url":null,"slug":"linearizing-transformer-with-key-value-memory","title":"Linearizing Transformer with Key-Value Memory","date":"2022-03-23","arxiv_id":"2203.12644","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-based-pre-trained-model-for","title":"Prompt-based System for Personality and Interpersonal Reactivity Prediction","date":"2022-03-23","arxiv_id":"2203.12481","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-textual-out-of-domain-detection","title":"Towards Textual Out-of-Domain Detection without In-Domain Labels","date":"2022-03-22","arxiv_id":"2203.11396","repositories_listed":0,"syntology":null},{"url":null,"slug":"immersive-text-game-and-personality","title":"Immersive Text Game and Personality Classification","date":"2022-03-20","arxiv_id":"2203.10621","repositories_listed":0,"syntology":null},{"url":"/paper/histruct-improving-extractive-text-1","slug":"histruct-improving-extractive-text-1","title":"HiStruct+: Improving Extractive Text Summarization with Hierarchical Structure Information","date":"2022-03-17","arxiv_id":"2203.09629","repositories_listed":0,"syntology":null},{"url":null,"slug":"triangular-transfer-freezing-the-pivot-for","title":"Triangular Transfer: Freezing the Pivot for Triangular Machine Translation","date":"2022-03-17","arxiv_id":"2203.09027","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-ability-of-multilingual-masked","title":"Cross-Lingual Ability of Multilingual Masked Language Models: A Study of Language Structure","date":"2022-03-16","arxiv_id":"2203.08430","repositories_listed":0,"syntology":null},{"url":null,"slug":"ta-sbert-token-attention-sentence-bert-for","title":"TA-SBERT: Token Attention Sentence-BERT for Improving Sentence Representation","date":"2022-03-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-text-to-sql-capabilities-of-1","title":"Evaluating the Text-to-SQL Capabilities of Large Language Models","date":"2022-03-15","arxiv_id":"2204.00498","repositories_listed":0,"syntology":null},{"url":null,"slug":"contact-a-dutch-covid-19-adapted-bert-for","title":"CoNTACT: A Dutch COVID-19 Adapted BERT for Vaccine Hesitancy and Argumentation Detection","date":"2022-03-14","arxiv_id":"2203.07362","repositories_listed":0,"syntology":null},{"url":"/paper/efficient-language-modeling-with-sparse-all","slug":"efficient-language-modeling-with-sparse-all","title":"Efficient Language Modeling with Sparse all-MLP","date":"2022-03-14","arxiv_id":"2203.06850","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-visual-knowledge-in-language-tasks-1","title":"Leveraging Visual Knowledge in Language Tasks: An Empirical Study on Intermediate Pre-training for Cross-modal Knowledge Transfer","date":"2022-03-14","arxiv_id":"2203.07519","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-multimodal-generation-on-clip-via-1","title":"Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation","date":"2022-03-12","arxiv_id":"2203.06386","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-discrete-units-necessary-for-spoken","title":"Are discrete units necessary for Spoken Language Modeling?","date":"2022-03-11","arxiv_id":"2203.05936","repositories_listed":0,"syntology":null},{"url":null,"slug":"compilable-neural-code-generation-with","title":"Compilable Neural Code Generation with Compiler Feedback","date":"2022-03-10","arxiv_id":"2203.05132","repositories_listed":0,"syntology":null},{"url":null,"slug":"mvp-multimodality-guided-visual-pre-training","title":"MVP: Multimodality-guided Visual Pre-training","date":"2022-03-10","arxiv_id":"2203.05175","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-practical-framework-for-multi-domain-speech","title":"A practical framework for multi-domain speech recognition and an instance sampling method to neural language modeling","date":"2022-03-09","arxiv_id":"2203.04767","repositories_listed":0,"syntology":null},{"url":null,"slug":"healthprompt-a-zero-shot-learning-paradigm","title":"HealthPrompt: A Zero-shot Learning Paradigm for Clinical Natural Language Processing","date":"2022-03-09","arxiv_id":"2203.05061","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-driven-negative-sampling","title":"LEMON: LanguagE ModeL for Negative Sampling of Knowledge Graph Embeddings","date":"2022-03-09","arxiv_id":"2203.04703","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentence-select-large-scale-language-model","title":"Sentence-Select: Large-Scale Language Model Data Selection for Rare-Word Speech Recognition","date":"2022-03-09","arxiv_id":"2203.05008","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperpelt-unified-parameter-efficient","title":"HyperPELT: Unified Parameter-Efficient Language Model Tuning for Both Language and Vision-and-Language Tasks","date":"2022-03-08","arxiv_id":"2203.03878","repositories_listed":0,"syntology":null},{"url":null,"slug":"which-side-are-you-on-insider-outsider","title":"Which side are you on? Insider-Outsider classification in conspiracy-theoretic social media","date":"2022-03-08","arxiv_id":"2203.04356","repositories_listed":0,"syntology":null},{"url":null,"slug":"input-tuning-adapting-unfamiliar-inputs-to","title":"Input-Tuning: Adapting Unfamiliar Inputs to Frozen Pretrained Models","date":"2022-03-07","arxiv_id":"2203.03131","repositories_listed":0,"syntology":null},{"url":null,"slug":"unfreeze-with-care-space-efficient-fine","title":"Unfreeze with Care: Space-Efficient Fine-Tuning of Semantic Parsing Models","date":"2022-03-05","arxiv_id":"2203.02652","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-neural-framework-for-image-caption","title":"A Deep Neural Framework for Image Caption Generation Using GRU-Based Attention Mechanism","date":"2022-03-03","arxiv_id":"2203.01594","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-whole-word-masking-always-better-for-1","title":"\"Is Whole Word Masking Always Better for Chinese BERT?\": Probing on Chinese Grammatical Error Correction","date":"2022-03-01","arxiv_id":"2203.00286","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-grammars-augmenting-transformer","title":"Transformer Grammars: Augmenting Transformer Language Models with Syntactic Inductive Biases at Scale","date":"2022-03-01","arxiv_id":"2203.00633","repositories_listed":0,"syntology":null},{"url":null,"slug":"cino-a-chinese-minority-pre-trained-language-1","title":"CINO: A Chinese Minority Pre-trained Language Model","date":"2022-02-28","arxiv_id":"2202.13558","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-text-classification-with-2","title":"Cross-Lingual Text Classification with Multilingual Distillation and Zero-Shot-Aware Training","date":"2022-02-28","arxiv_id":"2202.13654","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-natural-language-generation-with-1","title":"Controllable Natural Language Generation with Contrastive Prefixes","date":"2022-02-27","arxiv_id":"2202.13257","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-persian-tokenizers","title":"Evaluating Persian Tokenizers","date":"2022-02-22","arxiv_id":"2202.10879","repositories_listed":0,"syntology":null},{"url":null,"slug":"korean-tokenization-for-beam-search-rescoring","title":"Korean Tokenization for Beam Search Rescoring in Speech Recognition","date":"2022-02-22","arxiv_id":"2203.03583","repositories_listed":0,"syntology":null},{"url":null,"slug":"vu-bert-a-unified-framework-for-visual-dialog","title":"VU-BERT: A Unified framework for Visual Dialog","date":"2022-02-22","arxiv_id":"2202.10787","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-discounting-of-implicit-language","title":"Adaptive Discounting of Implicit Language Models in RNN-Transducers","date":"2022-02-21","arxiv_id":"2203.02317","repositories_listed":0,"syntology":null},{"url":null,"slug":"stylebert-chinese-pretraining-by-font-style","title":"StyleBERT: Chinese pretraining by font style information","date":"2022-02-21","arxiv_id":"2202.09955","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-modeling-for-mitigating-toxicity-in","title":"Reward Modeling for Mitigating Toxicity in Transformer-based Language Models","date":"2022-02-19","arxiv_id":"2202.09662","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-freem-to-d-alembert-a-large-corpus-and-a","title":"From FreEM to D'AlemBERT: a Large Corpus and a Language Model for Early Modern French","date":"2022-02-18","arxiv_id":"2202.09452","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-knowledge-intensive-nlp-with-pre","title":"A Survey of Knowledge-Intensive NLP with Pre-Trained Language Models","date":"2022-02-17","arxiv_id":"2202.08772","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-bert-meets-quantum-temporal-convolution","title":"When BERT Meets Quantum Temporal Convolution Learning for Text Classification in Heterogeneous Computing","date":"2022-02-17","arxiv_id":"2203.03550","repositories_listed":0,"syntology":null},{"url":null,"slug":"capitalization-normalization-for-language","title":"Capitalization Normalization for Language Modeling with an Accurate and Efficient Hierarchical RNN Model","date":"2022-02-16","arxiv_id":"2202.08171","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-from-large-scale","title":"Knowledge Transfer from Large-scale Pretrained Language Models to End-to-end Speech Recognizers","date":"2022-02-16","arxiv_id":"2202.07894","repositories_listed":0,"syntology":null},{"url":null,"slug":"xfboost-improving-text-generation-with","title":"XFBoost: Improving Text Generation with Controllable Decoders","date":"2022-02-16","arxiv_id":"2202.08124","repositories_listed":0,"syntology":null},{"url":null,"slug":"misinformation-detection-in-social-media","title":"Misinformation Detection in Social Media Video Posts","date":"2022-02-15","arxiv_id":"2202.07706","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-based-action-model-acquisition-for","title":"Text-Based Action-Model Acquisition for Planning","date":"2022-02-15","arxiv_id":"2202.08373","repositories_listed":0,"syntology":null},{"url":null,"slug":"usted-improving-asr-with-a-unified-speech-and","title":"USTED: Improving ASR with a Unified Speech and Text Encoder-Decoder","date":"2022-02-12","arxiv_id":"2202.06045","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-does-it-mean-for-a-language-model-to","title":"What Does it Mean for a Language Model to Preserve Privacy?","date":"2022-02-11","arxiv_id":"2202.05520","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaprompt-adaptive-model-training-for-prompt","title":"AdaPrompt: Adaptive Model Training for Prompt-based NLP","date":"2022-02-10","arxiv_id":"2202.04824","repositories_listed":0,"syntology":null}],"record_sha256":"1d4b591d4d8f6fa6c21ed1d8f23a8ac6fc745ea0cdbbb7eed6916a06922053b5","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}