{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modeling/papers/119","list_of":"/task/language-modeling","task":"Language Modeling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":119,"pages_in_order":142,"rows_per_page":100,"rows":[11801,11900],"of":14182,"counts":{"archive_papers_tagged":14182,"with_a_code_link":5620,"where_syntology_ran_a_sample":1894,"not_listed_spam_title":0,"listed":14182,"listed_where_code_ran":1894,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1580,"every_run_a_failure_of_syntologys_instrument":314,"listed_with_a_run_with_no_instrument_failure":1580,"listed_every_run_a_failure_of_syntologys_instrument":314,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modeling","prev":"/task/language-modeling/papers/118","next":"/task/language-modeling/papers/120","papers":[{"url":null,"slug":"paraphrasing-compound-nominalizations","title":"Paraphrasing Compound Nominalizations","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"small-model-and-in-domain-data-are-all-you","title":"Small Model and In-Domain Data Are All You Need","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spellbert-a-lightweight-pretrained-model-for","title":"SpellBERT: A Lightweight Pretrained Model for Chinese Spelling Check","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncle-explicitly-leveraging-semantic","title":"UnClE: Explicitly Leveraging Semantic Similarity to Reduce the Parameters of Word Embeddings","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-adverbial-identification-in","title":"Unsupervised Adverbial Identification in Modern Chinese Literature","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-discovery-of-unaccusative-and","title":"Unsupervised Discovery of Unaccusative and Unergative Verbs","date":"2021-11-01","arxiv_id":"2111.00808","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-multi-view-post-ocr-error","title":"Unsupervised Multi-View Post-OCR Error Correction With Language Models","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"what-bert-based-language-model-learns-in","title":"What BERT Based Language Model Learns in Spoken Transcripts: An Empirical Study","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"what-can-a-generative-language-model-answer","title":"What Can a Generative Language Model Answer About a Passage?","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-cross-lingual-meaning","title":"Zero-shot cross-lingual Meaning Representation Transfer: Annotation of Hungarian using the Prague Functional Generative Description","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pnpood-out-of-distribution-detection-for-text","title":"PnPOOD : Out-Of-Distribution Detection for Text Classification via Plug andPlay Data Augmentation","date":"2021-10-31","arxiv_id":"2111.00506","repositories_listed":0,"syntology":null},{"url":"/paper/r-bert-cnn-drug-target-interactions","slug":"r-bert-cnn-drug-target-interactions","title":"R-BERT-CNN: Drug-target interactions extraction from biomedical literature","date":"2021-10-31","arxiv_id":"2111.00611","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-knowledge-augmentation-for","title":"Automatic Knowledge Augmentation for Generative Commonsense Reasoning","date":"2021-10-30","arxiv_id":"2111.00192","repositories_listed":0,"syntology":null},{"url":null,"slug":"empbot-a-t5-based-empathetic-chatbot-focusing","title":"EmpBot: A T5-based Empathetic Chatbot focusing on Sentiments","date":"2021-10-30","arxiv_id":"2111.00310","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-unsupervised-and-text-augmented","title":"Combining Unsupervised and Text Augmented Semi-Supervised Learning for Low Resourced Autoregressive Speech Recognition","date":"2021-10-29","arxiv_id":"2110.15836","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-co-evolutionary-protein","title":"Pre-training Co-evolutionary Protein Representation via A Pairwise Masked Language Model","date":"2021-10-29","arxiv_id":"2110.15527","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-recurrent-decoders","title":"Distributionally Robust Recurrent Decoders with Random Network Distillation","date":"2021-10-25","arxiv_id":"2110.13229","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-news-is-good-news-a-critique-of-the-one","title":"No News is Good News: A Critique of the One Billion Word Benchmark","date":"2021-10-25","arxiv_id":"2110.12609","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-cnn-for-highly-inflected-bengali","title":"Paradigm Shift in Language Modeling: Revisiting CNN for Modeling Sanskrit Originated Bengali and Hindi Language","date":"2021-10-25","arxiv_id":"2110.13032","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentence-punctuation-for-collaborative","title":"Sentence Punctuation for Collaborative Commentary Generation in Esports Live-Streaming","date":"2021-10-24","arxiv_id":"2110.12416","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-from-language-model-to","title":"Knowledge distillation from language model to acoustic model: a hierarchical multi-task learning approach","date":"2021-10-20","arxiv_id":"2110.10429","repositories_listed":0,"syntology":null},{"url":null,"slug":"slam-a-unified-encoder-for-speech-and","title":"SLAM: A Unified Encoder for Speech and Language Modeling via Speech-Text Joint Pre-Training","date":"2021-10-20","arxiv_id":"2110.10329","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-learning-of-subword-dependent-model","title":"Automatic Learning of Subword Dependent Model Scales","date":"2021-10-18","arxiv_id":"2110.09324","repositories_listed":0,"syntology":null},{"url":null,"slug":"reminding-the-incremental-language-model-via","title":"Reminding the Incremental Language Model via Data-Free Self-Distillation","date":"2021-10-17","arxiv_id":"2110.08745","repositories_listed":0,"syntology":null},{"url":null,"slug":"asr4real-an-extended-benchmark-for-speech","title":"ASR4REAL: An extended benchmark for speech models","date":"2021-10-16","arxiv_id":"2110.08583","repositories_listed":0,"syntology":null},{"url":null,"slug":"bitfit-simple-parameter-efficient-fine-tuning-1","title":"BitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-models","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"demix-layers-disentangling-domains-for-1","title":"DEMix Layers: Disentangling Domains for Modular Language Modeling","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"echo-attention-attend-once-and-get-n","title":"Echo-Attention: Attend Once and Get $N$ Attentions for Free","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-knowledge-in-multilingual","title":"Leveraging Knowledge in Multilingual Commonsense Reasoning","date":"2021-10-16","arxiv_id":"2110.08462","repositories_listed":0,"syntology":null},{"url":null,"slug":"models-in-a-spelling-bee-language-models-1","title":"Models In a Spelling Bee: Language Models Implicitly Learn the Character Composition of Tokens","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"n-shot-learning-for-augmenting-task-oriented","title":"N-Shot Learning for Augmenting Task-Oriented Dialogue State Tracking","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-complementarity-of-data-selection-and-1","title":"On the Complementarity of Data Selection and Fine Tuning for Domain Adaptation","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sharpness-aware-minimization-improves","title":"Sharpness-Aware Minimization Improves Language Model Generalization","date":"2021-10-16","arxiv_id":"2110.08529","repositories_listed":0,"syntology":null},{"url":null,"slug":"xgqa-cross-lingual-visual-question-answering-1","title":"xGQA: Cross-Lingual Visual Question Answering","date":"2021-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multilingual-bag-of-entities-model-for-zero","title":"A Multilingual Bag-of-Entities Model for Zero-Shot Cross-Lingual Text Classification","date":"2021-10-15","arxiv_id":"2110.07792","repositories_listed":0,"syntology":null},{"url":null,"slug":"kronecker-decomposition-for-gpt-compression","title":"Kronecker Decomposition for GPT Compression","date":"2021-10-15","arxiv_id":"2110.08152","repositories_listed":0,"syntology":null},{"url":null,"slug":"bert2bert-towards-reusable-pretrained","title":"bert2BERT: Towards Reusable Pretrained Language Models","date":"2021-10-14","arxiv_id":"2110.07143","repositories_listed":0,"syntology":null},{"url":null,"slug":"mimicause-defining-identifying-and-predicting","title":"MIMICause: Representation and automatic extraction of causal relation types from clinical notes","date":"2021-10-14","arxiv_id":"2110.07090","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparks-inspiration-for-science-writing-using","title":"Sparks: Inspiration for Science Writing using Language Models","date":"2021-10-14","arxiv_id":"2110.07640","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-efficiency-of-language-model-pre","title":"Maximizing Efficiency of Language Model Pre-training for Learning Representation","date":"2021-10-13","arxiv_id":"2110.06620","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-language-model-integration-for-rnn","title":"On Language Model Integration for RNN Transducer based Speech Recognition","date":"2021-10-13","arxiv_id":"2110.06841","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-average-and-worst-case-accuracy-in-1","title":"Balancing Average and Worst-case Accuracy in Multitask Learning","date":"2021-10-12","arxiv_id":"2110.05838","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-for-bias-detection-from","title":"Deep Learning for Bias Detection: From Inception to Deployment","date":"2021-10-12","arxiv_id":"2110.15728","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-pre-training-for-automated-speech","title":"Multi-Modal Pre-Training for Automated Speech Recognition","date":"2021-10-12","arxiv_id":"2110.09890","repositories_listed":0,"syntology":null},{"url":null,"slug":"smaprat-dialogpt-for-natural-language","title":"Småprat: DialoGPT for Natural Language Generation of Swedish Dialogue by Transfer Learning","date":"2021-10-12","arxiv_id":"2110.06273","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-softmax-bottleneck-for","title":"Breaking the Softmax Bottleneck for Sequential Recommender Systems with Dropout and Decoupling","date":"2021-10-11","arxiv_id":"2110.05409","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-user-perception-of-speech","title":"Evaluating User Perception of Speech Recognition System Quality with Semantic Distance Metric","date":"2021-10-11","arxiv_id":"2110.05376","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-for-situated-multi-domain","title":"Multi-Task Learning for Situated Multi-Domain End-to-End Dialogue Systems","date":"2021-10-11","arxiv_id":"2110.05221","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-a-benefit-of-mask-language-modeling","title":"On a Benefit of Mask Language Modeling: Robustness to Simplicity Bias","date":"2021-10-11","arxiv_id":"2110.05301","repositories_listed":0,"syntology":null},{"url":null,"slug":"sru-pioneering-fast-recurrence-with-attention","title":"SRU++: Pioneering Fast Recurrence with Attention for Speech Recognition","date":"2021-10-11","arxiv_id":"2110.05571","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-neural-machine-translation-with-5","title":"Unsupervised Neural Machine Translation with Generative Language Models Only","date":"2021-10-11","arxiv_id":"2110.05448","repositories_listed":0,"syntology":null},{"url":null,"slug":"frequency-aware-sgd-for-efficient-embedding-1","title":"Frequency-aware SGD for Efficient Embedding Learning with Provable Benefits","date":"2021-10-10","arxiv_id":"2110.04844","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-automatic-text-extractive-summarization","title":"Automatic Text Extractive Summarization Based on Graph and Pre-trained Language Model Attention","date":"2021-10-10","arxiv_id":"2110.04878","repositories_listed":0,"syntology":null},{"url":null,"slug":"karasinger-score-free-singing-voice-synthesis","title":"KaraSinger: Score-Free Singing Voice Synthesis with VQ-VAE using Mel-spectrograms","date":"2021-10-08","arxiv_id":"2110.04005","repositories_listed":0,"syntology":null},{"url":null,"slug":"back-from-the-future-bidirectional-ctc","title":"Back from the future: bidirectional CTC decoding using future information in speech recognition","date":"2021-10-07","arxiv_id":"2110.03326","repositories_listed":0,"syntology":null},{"url":null,"slug":"beam-search-with-bidirectional-strategies-for","title":"Beam Search with Bidirectional Strategies for Neural Response Generation","date":"2021-10-07","arxiv_id":"2110.03389","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-confidence-estimation-on-out-of","title":"Improving Confidence Estimation on Out-of-Domain Data for End-to-End Speech Recognition","date":"2021-10-07","arxiv_id":"2110.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"abc-attention-with-bounded-memory-control","title":"ABC: Attention with Bounded-memory Control","date":"2021-10-06","arxiv_id":"2110.02488","repositories_listed":0,"syntology":null},{"url":null,"slug":"cut-the-carp-fishing-for-zero-shot-story","title":"Cut the CARP: Fishing for zero-shot story evaluation","date":"2021-10-06","arxiv_id":"2110.03111","repositories_listed":0,"syntology":null},{"url":null,"slug":"internal-language-model-adaptation-with-text","title":"Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition","date":"2021-10-06","arxiv_id":"2110.05354","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-augmented-convolutional-transformer","title":"Attention Augmented Convolutional Transformer for Tabular Time-series","date":"2021-10-05","arxiv_id":"2110.01825","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-contextual-adaptation-with-neural","title":"Fast Contextual Adaptation with Neural Associative Memory for On-Device Personalized Speech Recognition","date":"2021-10-05","arxiv_id":"2110.02220","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-modeling-using-lmus-10x-better-data","title":"Language Modeling using LMUs: 10x Better Data Efficiency or Improved Scaling Compared to Transformers","date":"2021-10-05","arxiv_id":"2110.02402","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-chains-transparent-and-controllable-human","title":"AI Chains: Transparent and Controllable Human-AI Interaction by Chaining Large Language Model Prompts","date":"2021-10-04","arxiv_id":"2110.01691","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-information-bottleneck-for","title":"Leveraging Information Bottleneck for Scientific Document Summarization","date":"2021-10-04","arxiv_id":"2110.01280","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-anderson-mixing-for-nonconvex","title":"Stochastic Anderson Mixing for Nonconvex Stochastic Optimization","date":"2021-10-04","arxiv_id":"2110.01543","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-contextualized-language-modeling","title":"A Study on Contextualized Language Modeling for Machine Reading Comprehension","date":"2021-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-low-resource-code-switching-data","title":"Exploiting Low-Resource Code-Switching Data to Mandarin-English Speech Recognition Systems","date":"2021-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-networks-based-on","title":"Generative Adversarial Networks based on Mixed-Attentions for Citation Intent Classification in Scientific Publications","date":"2021-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-punctuation-restoration-for-speech","title":"Improving Punctuation Restoration for Speech Transcripts via External Data","date":"2021-10-01","arxiv_id":"2110.00560","repositories_listed":0,"syntology":null},{"url":null,"slug":"span-labeling-approach-for-vietnamese-and","title":"Span Labeling Approach for Vietnamese and Chinese Word Segmentation","date":"2021-10-01","arxiv_id":"2110.00156","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-technology-for-everyone-automatic","title":"Speech Technology for Everyone: Automatic Speech Recognition for Non-Native English with Transfer Learning","date":"2021-10-01","arxiv_id":"2110.00678","repositories_listed":0,"syntology":null},{"url":null,"slug":"unpacking-the-interdependent-systems-of","title":"Unpacking the Interdependent Systems of Discrimination: Ableist Bias in NLP Systems through an Intersectional Lens","date":"2021-10-01","arxiv_id":"2110.00521","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-neural-compression-via-concurrent","title":"Deep Neural Compression Via Concurrent Pruning and Self-Distillation","date":"2021-09-30","arxiv_id":"2109.15014","repositories_listed":0,"syntology":null},{"url":null,"slug":"focused-contrastive-training-for-test-based","title":"Focused Contrastive Training for Test-based Constituency Analysis","date":"2021-09-30","arxiv_id":"2109.15159","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-step-wise-weighting-approach-for","title":"A Step-Wise Weighting Approach for Controllable Text Generation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-the-implicit-position-encoding","title":"Analyzing the Implicit Position Encoding Ability of Transformer Decoder","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"autocog-a-unified-data-modal-co-search","title":"AutoCoG: A Unified Data-Modal Co-Search Framework for Graph Neural Networks","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"beliefbank-adding-memory-to-a-pre-trained","title":"BeliefBank: Adding Memory to a Pre-Trained Language Model for a Systematic Notion of Belief","date":"2021-09-29","arxiv_id":"2109.14723","repositories_listed":0,"syntology":null},{"url":null,"slug":"dictformer-tiny-transformer-with-shared","title":"DictFormer: Tiny Transformer with Shared Dictionary","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-in-representation-for-multilingual","title":"Fairness in Representation for Multilingual NLP: Insights from Controlled Experiments on Conditional Language Modeling","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generate-annotate-and-learn-generative-models-1","title":"Generate, Annotate, and Learn: Generative Models Advance Self-Training and Knowledge Distillation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gental-generative-denoising-skip-gram","title":"GenTAL: Generative Denoising Skip-gram Transformer for Unsupervised Binary Code Similarity Detection","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-character-tagger-for-short-text","title":"Hierarchical Character Tagger for Short Text Spelling Error Correction","date":"2021-09-29","arxiv_id":"2109.14259","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-adapt-your-large-scale-vision-and","title":"How to Adapt Your Large-Scale Vision-and-Language Model","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"image-bert-pre-training-with-online-tokenizer","title":"Image BERT Pre-training with Online Tokenizer","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-non-autoregressive-translation","title":"Improving Non-Autoregressive Translation Models Without Distillation","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-pre-training-improves","title":"Language Model Pre-training Improves Generalization in Policy Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-large","title":"Offline Reinforcement Learning for Large Scale Language Action Spaces","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pretrained-language-model-in-continual","title":"Pretrained Language Model in Continual Learning: A Comparative Study","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-client-reweighting-for-selfish","title":"Rethinking Client Reweighting for Selfish Federated Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-transformer-a-unified-architecture-for","title":"Scene Transformer: A unified architecture for predicting future trajectories of multiple agents","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-token-generation-for-few-shot","title":"Selective Token Generation for Few-shot Language Modeling","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-distilled-pruning-of-neural-networks","title":"Self-Distilled Pruning Of Neural Networks","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-attention-with-learning-to-hash","title":"Sparse Attention with Learning to Hash","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"topic-aware-neural-language-model-domain","title":"Topic Aware Neural Language Model: Domain Adaptation of Unconditional Text Generation Models","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transliteration-a-simple-technique-for","title":"Transliteration: A Simple Technique For Improving Multilingual Language Modeling","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"private-language-model-adaptation-for-speech","title":"Private Language Model Adaptation for Speech Recognition","date":"2021-09-28","arxiv_id":"2110.10026","repositories_listed":0,"syntology":null},{"url":null,"slug":"fquad2-0-french-question-answering-and","title":"FQuAD2.0: French Question Answering and knowing that you know nothing","date":"2021-09-27","arxiv_id":"2109.13209","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-priming-for-cross-lingual","title":"Language Model Priming for Cross-Lingual Event Extraction","date":"2021-09-25","arxiv_id":"2109.12383","repositories_listed":0,"syntology":null}],"record_sha256":"85d8c1a0daa99d0c2b22081ac0350fc0290c6908c2123c1150e0819a9a254598","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}