{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modeling/papers/123","list_of":"/task/language-modeling","task":"Language Modeling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":123,"pages_in_order":142,"rows_per_page":100,"rows":[12201,12300],"of":14182,"counts":{"archive_papers_tagged":14182,"with_a_code_link":5620,"where_syntology_ran_a_sample":1894,"not_listed_spam_title":0,"listed":14182,"listed_where_code_ran":1894,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1580,"every_run_a_failure_of_syntologys_instrument":314,"listed_with_a_run_with_no_instrument_failure":1580,"listed_every_run_a_failure_of_syntologys_instrument":314,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modeling","prev":"/task/language-modeling/papers/122","next":"/task/language-modeling/papers/124","papers":[{"url":null,"slug":"maximal-multiverse-learning-for-promoting","title":"Maximal Multiverse Learning for Promoting Cross-Task Generalization of Fine-Tuned Language Models","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-slavic-named-entity-recognition","title":"Multilingual Slavic Named Entity Recognition","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-computational-modelling-of-michif","title":"On the Computational Modelling of Michif Verbal Morphology","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"one-toward-one-model-one-algorithm-one-corpus","title":"ONE: Toward ONE model, ONE algorithm, ONE corpus dedicated to sentiment analysis of Arabic/Arabizi and its dialects","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pseudo-label-guided-unsupervised-domain","title":"Pseudo-Label Guided Unsupervised Domain Adaptation of Contextual Embeddings","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"quranic-verses-semantic-relatedness-using","title":"Quranic Verses Semantic Relatedness Using AraBERT","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"story-centaur-large-language-model-few-shot","title":"Story Centaur: Large Language Model Few Shot Learning as a Creative Writing Tool","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-encoding-and-pre-training-matter","title":"Structural Encoding and Pre-training Matter: Adapting BERT for Table-Based Fact Verification","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"team-hub-lt-edi-eacl2021-hope-speech","title":"TEAM HUB@LT-EDI-EACL2021: Hope Speech Detection Based On Pre-trained Language Model","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uc2-universal-cross-lingual-cross-modal","title":"UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training","date":"2021-04-01","arxiv_id":"2104.00332","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-does-bert-learn-from-arabic-machine","title":"What does BERT Learn from Arabic Machine Reading Comprehension Datasets?","date":"2021-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-encoder-learning-and-stream-fusion-for","title":"Multi-Encoder Learning and Stream Fusion for Transformer-Based End-to-End Automatic Speech Recognition","date":"2021-03-31","arxiv_id":"2104.00120","repositories_listed":0,"syntology":null},{"url":null,"slug":"afriki-machine-in-the-loop-afrikaans-poetry","title":"AfriKI: Machine-in-the-Loop Afrikaans Poetry Generation","date":"2021-03-30","arxiv_id":"2103.16190","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-image-text-pre-training-with","title":"Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays","date":"2021-03-30","arxiv_id":"2103.16022","repositories_listed":0,"syntology":null},{"url":null,"slug":"retraining-distilbert-for-a-voice-shopping","title":"Retraining DistilBERT for a Voice Shopping Assistant by Using Universal Dependencies","date":"2021-03-29","arxiv_id":"2103.15737","repositories_listed":0,"syntology":null},{"url":null,"slug":"bart-based-semantic-correction-for-mandarin","title":"BART based semantic correction for Mandarin automatic speech recognition system","date":"2021-03-26","arxiv_id":"2104.05507","repositories_listed":0,"syntology":null},{"url":null,"slug":"correcting-automated-and-manual-speech","title":"Correcting Automated and Manual Speech Transcription Errors using Warped Language Models","date":"2021-03-26","arxiv_id":"2103.14580","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-improve-robustness-of-nlp","title":"An Approach to Improve Robustness of NLP Systems against ASR Errors","date":"2021-03-25","arxiv_id":"2103.13610","repositories_listed":0,"syntology":null},{"url":null,"slug":"k-xlnet-a-general-method-for-combining","title":"K-XLNet: A General Method for Combining Explicit Knowledge with Language Model Pretraining","date":"2021-03-25","arxiv_id":"2104.10649","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-grounding-strategies-for-text-only","title":"Visual Grounding Strategies for Text-Only Natural Language Processing","date":"2021-03-25","arxiv_id":"2103.13942","repositories_listed":0,"syntology":null},{"url":null,"slug":"thinking-aloud-dynamic-context-generation","title":"Thinking Aloud: Dynamic Context Generation Improves Zero-Shot Reasoning Performance of GPT-2","date":"2021-03-24","arxiv_id":"2103.13033","repositories_listed":0,"syntology":null},{"url":null,"slug":"variable-name-recovery-in-decompiled-binary","title":"Variable Name Recovery in Decompiled Binary Code using Constrained Masked Language Modeling","date":"2021-03-23","arxiv_id":"2103.12801","repositories_listed":0,"syntology":null},{"url":null,"slug":"play-the-shannon-game-with-language-models-a","title":"Play the Shannon Game With Language Models: A Human-Free Approach to Summary Evaluation","date":"2021-03-19","arxiv_id":"2103.10918","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-rnn-transducer-technology-for","title":"Advancing RNN Transducer Technology for Speech Recognition","date":"2021-03-17","arxiv_id":"2103.09935","repositories_listed":0,"syntology":null},{"url":null,"slug":"set-to-sequence-methods-in-machine-learning-a","title":"Set-to-Sequence Methods in Machine Learning: a Review","date":"2021-03-17","arxiv_id":"2103.09656","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-few-shot-fact-checking-via-perplexity","title":"Towards Few-Shot Fact-Checking via Perplexity","date":"2021-03-17","arxiv_id":"2103.09535","repositories_listed":0,"syntology":null},{"url":null,"slug":"claim-verification-using-a-multi-gan-based","title":"Claim Verification using a Multi-GAN based Model","date":"2021-03-14","arxiv_id":"2103.08001","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-word-level-language-model-with","title":"Learning a Word-Level Language Model with Sentence-Level Noise Contrastive Estimation for Contextual Sentence Probability Estimation","date":"2021-03-14","arxiv_id":"2103.07875","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedding-calibration-for-music-semantic","title":"Optimal Embedding Calibration for Symbolic Music Similarity","date":"2021-03-13","arxiv_id":"2103.07656","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-diversity-of-neural-text-generation","title":"Improving Diversity of Neural Text Generation via Inverse Probability Weighting","date":"2021-03-13","arxiv_id":"2103.07649","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilingual-dictionary-based-language-model","title":"Bilingual Dictionary-based Language Model Pretraining for Neural Machine Translation","date":"2021-03-12","arxiv_id":"2103.07040","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-morphological-embeddings-for-2","title":"Evaluation of Morphological Embeddings for English and Russian Languages","date":"2021-03-11","arxiv_id":"2103.06884","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-feature-weights-using-reward","title":"Learning Feature Weights using Reward Modeling for Denoising Parallel Corpora","date":"2021-03-11","arxiv_id":"2103.06968","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-context-free-and-contextualized","title":"Combining Context-Free and Contextualized Representations for Arabic Sarcasm Detection and Sentiment Identification","date":"2021-03-09","arxiv_id":"2103.05683","repositories_listed":0,"syntology":null},{"url":null,"slug":"mtlhealth-a-deep-learning-system-for","title":"MTLHealth: A Deep Learning System for Detecting Disturbing Content in Student Essays","date":"2021-03-07","arxiv_id":"2103.04290","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-semantic-process-information-from","title":"Extracting Semantic Process Information from the Natural Language in Event Logs","date":"2021-03-06","arxiv_id":"2103.11761","repositories_listed":0,"syntology":null},{"url":"/paper/random-feature-attention-1","slug":"random-feature-attention-1","title":"Random Feature Attention","date":"2021-03-03","arxiv_id":"2103.02143","repositories_listed":0,"syntology":null},{"url":null,"slug":"university-of-copenhagen-participation-in","title":"University of Copenhagen Participation in TREC Health Misinformation Track 2020","date":"2021-03-03","arxiv_id":"2103.02462","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-rediscovery-hypothesis-language-models","title":"The Rediscovery Hypothesis: Language Models Need to Meet Linguistics","date":"2021-03-02","arxiv_id":"2103.01819","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-document-summarization-in-a-low-resource","title":"Long Document Summarization in a Low Resource Setting using Pretrained Language Models","date":"2021-03-01","arxiv_id":"2103.00751","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-but-effective-approach-to-n-shot","title":"N-Shot Learning for Augmenting Task-Oriented Dialogue State Tracking","date":"2021-02-27","arxiv_id":"2103.00293","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-primer-on-contrastive-pretraining-in","title":"A Primer on Contrastive Pretraining in Language Processing: Methods, Lessons Learned and Perspectives","date":"2021-02-25","arxiv_id":"2102.12982","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-universal-language-model-to-downstream","title":"From Universal Language Model to Downstream Task: Improving RoBERTa-Based Vietnamese Hate Speech Detection","date":"2021-02-24","arxiv_id":"2102.12162","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-modality-transition-for-image","title":"Enhanced Modality Transition for Image Captioning","date":"2021-02-23","arxiv_id":"2102.11526","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-optimization-of-contexts-for","title":"Evolutionary optimization of contexts for phonetic correction in speech recognition systems","date":"2021-02-23","arxiv_id":"2102.11480","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilingual-language-modeling-a-transfer","title":"Bilingual Language Modeling, A transfer learning technique for Roman Urdu","date":"2021-02-22","arxiv_id":"2102.10958","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-human-readable-transcript-for","title":"Generating Human Readable Transcript for Automatic Speech Recognition with Pre-trained Language Model","date":"2021-02-22","arxiv_id":"2102.11114","repositories_listed":0,"syntology":null},{"url":null,"slug":"web-based-application-for-detecting","title":"Web-based Application for Detecting Indonesian Clickbait Headlines using IndoBERT","date":"2021-02-21","arxiv_id":"2102.10601","repositories_listed":0,"syntology":null},{"url":null,"slug":"alternate-endings-improving-prosody-for","title":"Alternate Endings: Improving Prosody for Incremental Neural TTS with Predicted Future Text Input","date":"2021-02-19","arxiv_id":"2102.09914","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-study-on-measuring-the","title":"An Empirical Study on Measuring the Similarity of Sentential Arguments with Language Model Domain Adaptation","date":"2021-02-19","arxiv_id":"2102.09786","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixing-errors-of-the-google-voice-recognizer","title":"Fixing Errors of the Google Voice Recognizer through Phonetic Distance Metrics","date":"2021-02-18","arxiv_id":"2102.09680","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-end-to-end-speech-recognition-models-care","title":"Do End-to-End Speech Recognition Models Care About Context?","date":"2021-02-17","arxiv_id":"2102.09928","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-context-conversational-representation","title":"Large-Context Conversational Representation Learning: Self-Supervised Learning for Conversational Documents","date":"2021-02-16","arxiv_id":"2102.08147","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-end-to-end-speech-recognition-via-non","title":"Fast End-to-End Speech Recognition via Non-Autoregressive Models and Cross-Modal Knowledge Transferring from BERT","date":"2021-02-15","arxiv_id":"2102.07594","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-acoustic-and-linguistic-embeddings","title":"Leveraging Acoustic and Linguistic Embeddings from Pretrained speech and language Models for Intent Classification","date":"2021-02-15","arxiv_id":"2102.07370","repositories_listed":0,"syntology":null},{"url":null,"slug":"reasoning-over-virtual-knowledge-bases-with","title":"Reasoning Over Virtual Knowledge Bases With Open Predicate Relations","date":"2021-02-14","arxiv_id":"2102.07043","repositories_listed":0,"syntology":null},{"url":"/paper/speech-language-pre-training-for-end-to-end","slug":"speech-language-pre-training-for-end-to-end","title":"Speech-language Pre-training for End-to-end Spoken Language Understanding","date":"2021-02-11","arxiv_id":"2102.06283","repositories_listed":0,"syntology":null},{"url":null,"slug":"customizing-contextualized-language-models","title":"Customizing Contextualized Language Models forLegal Document Reviews","date":"2021-02-10","arxiv_id":"2102.05757","repositories_listed":0,"syntology":null},{"url":null,"slug":"fused-acoustic-and-text-encoding-for","title":"Fused Acoustic and Text Encoding for Multimodal Bilingual Pretraining and Speech Translation","date":"2021-02-10","arxiv_id":"2102.05766","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-visual-reasoning-by-exploiting-the","title":"Improving Scene Graph Classification by Exploiting Knowledge from Texts","date":"2021-02-09","arxiv_id":"2102.04760","repositories_listed":0,"syntology":null},{"url":null,"slug":"newsbert-distilling-pre-trained-language","title":"NewsBERT: Distilling Pre-trained Language Model for Intelligent News Application","date":"2021-02-09","arxiv_id":"2102.04887","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-he-wink-or-does-he-nod-a-challenging","title":"Does He Wink or Does He Nod? A Challenging Benchmark for Evaluating Word Understanding of Language Models","date":"2021-02-06","arxiv_id":"2102.03596","repositories_listed":0,"syntology":null},{"url":null,"slug":"intermediate-loss-regularization-for-ctc","title":"Intermediate Loss Regularization for CTC-based Speech Recognition","date":"2021-02-05","arxiv_id":"2102.03216","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-emails-and-drafting-responses","title":"Understanding Emails and Drafting Responses -- An Approach Using GPT-3","date":"2021-02-05","arxiv_id":"2102.03062","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-semiparametric-language-models","title":"Adaptive Semiparametric Language Models","date":"2021-02-04","arxiv_id":"2102.02557","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-capabilities-limitations","title":"Understanding the Capabilities, Limitations, and Societal Impact of Large Language Models","date":"2021-02-04","arxiv_id":"2102.02503","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-number-of-filters-of-convolutional","title":"Effects of Number of Filters of Convolutional Layers on Speech Recognition Model Accuracy","date":"2021-02-03","arxiv_id":"2102.02326","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-purpose-speech-representation","title":"General-Purpose Speech Representation Learning through a Self-Supervised Multi-Granularity Framework","date":"2021-02-03","arxiv_id":"2102.01930","repositories_listed":0,"syntology":null},{"url":null,"slug":"clickbait-headline-detection-in-indonesian","title":"Clickbait Headline Detection in Indonesian News Sites using Multilingual Bidirectional Encoder Representations from Transformers (M-BERT)","date":"2021-02-02","arxiv_id":"2102.01497","repositories_listed":0,"syntology":null},{"url":null,"slug":"internal-language-model-training-for-domain","title":"Internal Language Model Training for Domain-Adaptive End-to-End Speech Recognition","date":"2021-02-02","arxiv_id":"2102.01380","repositories_listed":0,"syntology":null},{"url":null,"slug":"end2end-acoustic-to-semantic-transduction","title":"End2End Acoustic to Semantic Transduction","date":"2021-02-01","arxiv_id":"2102.01013","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-contrastive-pre-training-for","title":"Adversarial Contrastive Pre-training for Protein Sequences","date":"2021-01-31","arxiv_id":"2102.00466","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-recognition-by-simply-fine-tuning-bert","title":"Speech Recognition by Simply Fine-tuning BERT","date":"2021-01-30","arxiv_id":"2102.00291","repositories_listed":0,"syntology":null},{"url":null,"slug":"bcn2brno-asr-system-fusion-for-albayzin-2020","title":"BCN2BRNO: ASR System Fusion for Albayzin 2020 Speech to Text Challenge","date":"2021-01-29","arxiv_id":"2101.12729","repositories_listed":0,"syntology":null},{"url":null,"slug":"protoda-efficient-transfer-learning-for-few","title":"ProtoDA: Efficient Transfer Learning for Few-Shot Intent Classification","date":"2021-01-28","arxiv_id":"2101.11753","repositories_listed":0,"syntology":null},{"url":null,"slug":"weakly-supervised-neuro-symbolic-module-1","title":"Weakly Supervised Neuro-Symbolic Module Networks for Numerical Reasoning","date":"2021-01-28","arxiv_id":"2101.11802","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-for-personalised-learning-the-long","title":"Developing for personalised learning: the long road from educational objectives to development and feedback","date":"2021-01-27","arxiv_id":"2101.11333","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-zero-shot-cross-lingual-transfer-in","title":"Analyzing Zero-shot Cross-lingual Transfer in Supervised NLP Tasks","date":"2021-01-26","arxiv_id":"2101.10649","repositories_listed":0,"syntology":null},{"url":null,"slug":"climp-a-benchmark-for-chinese-language-model","title":"CLiMP: A Benchmark for Chinese Language Model Evaluation","date":"2021-01-26","arxiv_id":"2101.11131","repositories_listed":0,"syntology":null},{"url":null,"slug":"disambiguating-symbolic-expressions-in-1","title":"Disambiguating Symbolic Expressions in Informal Documents","date":"2021-01-25","arxiv_id":"2101.11716","repositories_listed":0,"syntology":null},{"url":null,"slug":"mermaid-metaphor-generation-with-symbolism-1","title":"MERMAID: Metaphor Generation with Symbolism and Discriminative Decoding","date":"2021-01-23","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-multiple-parallel-phrase","title":"The Impact of Multiple Parallel Phrase Suggestions on Email Input and Composition Behaviour of Native and Non-Native English Writers","date":"2021-01-22","arxiv_id":"2101.09157","repositories_listed":0,"syntology":null},{"url":null,"slug":"wechat-ai-s-submission-for-dstc9-interactive","title":"WeChat AI & ICT's Submission for DSTC9 Interactive Dialogue Evaluation Track","date":"2021-01-20","arxiv_id":"2101.07947","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-generalization-in-dialog-state","title":"Zero-shot Generalization in Dialog State Tracking through Generative Question Answering","date":"2021-01-20","arxiv_id":"2101.08333","repositories_listed":0,"syntology":null},{"url":null,"slug":"fusing-wav2vec2-0-and-bert-into-end-to-end","title":"Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition","date":"2021-01-17","arxiv_id":"2101.06699","repositories_listed":0,"syntology":null},{"url":null,"slug":"grid-search-hyperparameter-benchmarking-of","title":"Grid Search Hyperparameter Benchmarking of BERT, ALBERT, and LongFormer on DuoRC","date":"2021-01-15","arxiv_id":"2101.06326","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-language-model-fine-tuning","title":"Transformer-based Language Model Fine-tuning Methods for COVID-19 Fake News Detection","date":"2021-01-14","arxiv_id":"2101.05509","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-commonsense-causal-reasoning-by","title":"Improving Commonsense Causal Reasoning by Adversarial Training and Data Augmentation","date":"2021-01-13","arxiv_id":"2101.04966","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-better-sentence-representation-with","title":"Learning Better Sentence Representation with Syntax Information","date":"2021-01-09","arxiv_id":"2101.03343","repositories_listed":0,"syntology":null},{"url":null,"slug":"misspelling-correction-with-pre-trained","title":"Misspelling Correction with Pre-trained Contextual Language Model","date":"2021-01-08","arxiv_id":"2101.03204","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-optimized-n-gram-for-mobile-devices","title":"Real-Time Optimized N-gram For Mobile Devices","date":"2021-01-07","arxiv_id":"2101.03967","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-aware-neural-language-models-for","title":"Domain-aware Neural Language Models for Speech Recognition","date":"2021-01-05","arxiv_id":"2101.03229","repositories_listed":0,"syntology":null},{"url":null,"slug":"adding-recurrence-to-pretrained-transformers-1","title":"Adding Recurrence to Pretrained Transformers","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-neural-networks-with-variance","title":"Bayesian Neural Networks with Variance Propagation for Uncertainty Evaluation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"block-skim-transformer-for-efficient-question","title":"Block Skim Transformer for Efficient Question Answering","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bros-a-pre-trained-language-model-for","title":"BROS: A Pre-trained Language Model for Understanding Texts in Document","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"context-aware-temperature-for-language","title":"Context-Aware Temperature for Language Modeling","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-knowledge-distillation-for","title":"Contextual Knowledge Distillation for Transformer Compression","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-transfer-learning-for-pre","title":"Cross-lingual Transfer Learning for Pre-trained Contextualized Language Models","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-slot-relationship-modeling-using-a-pre","title":"Domain-slot Relationship Modeling using a Pre-trained Language Encoder for Multi-Domain Dialogue State Tracking","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"d0c5ad81005ef7daec382501c71d9e225feae07d4574c925c8a3a7d946272ece","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}