{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modelling/papers/155","list_of":"/task/language-modelling","task":"Language Modelling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":155,"pages_in_order":177,"rows_per_page":100,"rows":[15401,15500],"of":17610,"counts":{"archive_papers_tagged":17610,"with_a_code_link":7012,"where_syntology_ran_a_sample":2428,"not_listed_spam_title":0,"listed":17610,"listed_where_code_ran":2428,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":2027,"every_run_a_failure_of_syntologys_instrument":401,"listed_with_a_run_with_no_instrument_failure":2027,"listed_every_run_a_failure_of_syntologys_instrument":401,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modelling","prev":"/task/language-modelling/papers/154","next":"/task/language-modelling/papers/156","papers":[{"url":null,"slug":"self-training-for-unsupervised-parsing-with","title":"Self-Training for Unsupervised Parsing with PRPN","date":"2020-05-27","arxiv_id":"2005.13455","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntactic-structure-distillation-pretraining","title":"Syntactic Structure Distillation Pretraining For Bidirectional Encoders","date":"2020-05-27","arxiv_id":"2005.13482","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-text-and-image-mutual-translation","title":"TIME: Text and Image Mutual-Translation Adversarial Networks","date":"2020-05-27","arxiv_id":"2005.13192","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-relation-extraction-from-1","title":"Unsupervised Relation Extraction from Language Models using Constrained Cloze Completion","date":"2020-05-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"qdkt-question-centric-deep-knowledge-tracing","title":"qDKT: Question-centric Deep Knowledge Tracing","date":"2020-05-25","arxiv_id":"2005.12442","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-does-maml-work-the-best-an-empirical","title":"When does MAML Work the Best? An Empirical Study on Model-Agnostic Meta-Learning in NLP Applications","date":"2020-05-24","arxiv_id":"2005.11700","repositories_listed":0,"syntology":null},{"url":"/paper/asapp-asr-multistream-cnn-and-self-attentive","slug":"asapp-asr-multistream-cnn-and-self-attentive","title":"ASAPP-ASR: Multistream CNN and Self-Attentive SRU for SOTA Speech Recognition","date":"2020-05-21","arxiv_id":"2005.10469","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-text-data-using-hybrid-transformer","title":"Leveraging Text Data Using Hybrid Transformer-LSTM Based End-to-End ASR in Transfer Learning","date":"2020-05-21","arxiv_id":"2005.10407","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-learning-for-debiased-candidate","title":"Contrastive Learning for Debiased Candidate Generation in Large-Scale Recommender Systems","date":"2020-05-20","arxiv_id":"2005.12964","repositories_listed":0,"syntology":null},{"url":null,"slug":"early-stage-lm-integration-using-local-and","title":"Early Stage LM Integration Using Local and Global Log-Linear Combination","date":"2020-05-20","arxiv_id":"2005.10049","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigation-of-large-margin-softmax-in","title":"Investigation of Large-Margin Softmax in Neural Language Modeling","date":"2020-05-20","arxiv_id":"2005.10089","repositories_listed":0,"syntology":null},{"url":null,"slug":"scisight-combining-faceted-navigation-and","title":"SciSight: Combining faceted navigation and research group detection for COVID-19 exploratory scientific search","date":"2020-05-20","arxiv_id":"2005.12668","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-instruction-following-with-deep","title":"Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text","date":"2020-05-19","arxiv_id":"2005.09382","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-proper-noun-recognition-in-end-to","title":"Improving Proper Noun Recognition in End-to-End ASR By Customization of the MWER Loss Criterion","date":"2020-05-19","arxiv_id":"2005.09756","repositories_listed":0,"syntology":null},{"url":null,"slug":"approaches-to-improving-recognition-of","title":"Approaches to Improving Recognition of Underrepresented Named Entities in Hybrid ASR Systems","date":"2020-05-18","arxiv_id":"2005.08742","repositories_listed":0,"syntology":null},{"url":null,"slug":"semeval-2020-task-5-detecting-counterfactuals","title":"Yseop at SemEval-2020 Task 5: Cascaded BERT Language Model for Counterfactual Statement Analysis","date":"2020-05-18","arxiv_id":"2005.08519","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-ntnu-system-at-the-interspeech-2020-non","title":"The NTNU System at the Interspeech 2020 Non-Native Children's Speech ASR Challenge","date":"2020-05-18","arxiv_id":"2005.08433","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-classification-parity-across-cohorts","title":"Towards classification parity across cohorts","date":"2020-05-16","arxiv_id":"2005.08033","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextualizing-asr-lattice-rescoring-with","title":"Contextualizing ASR Lattice Rescoring with Hybrid Pointer Network Language Model","date":"2020-05-15","arxiv_id":"2005.07394","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-communication-meets-natural","title":"Multi-agent Communication meets Natural Language: Synergies between Functional and Structural Language Learning","date":"2020-05-14","arxiv_id":"2005.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"you-do-not-need-more-data-improving-end-to","title":"You Do Not Need More Data: Improving End-To-End Speech Recognition by Text-To-Speech Data Augmentation","date":"2020-05-14","arxiv_id":"2005.07157","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-mixture-of-h-1-heads-is-better-than-h-heads","title":"A Mixture of $h-1$ Heads is Better than $h$ Heads","date":"2020-05-13","arxiv_id":"2005.06537","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-multi-actor-generative-dialog","title":"Large Scale Multi-Actor Generative Dialog Modeling","date":"2020-05-13","arxiv_id":"2005.06114","repositories_listed":0,"syntology":null},{"url":"/paper/parallel-corpus-filtering-via-pre-trained","slug":"parallel-corpus-filtering-via-pre-trained","title":"Parallel Corpus Filtering via Pre-trained Language Models","date":"2020-05-13","arxiv_id":"2005.06166","repositories_listed":0,"syntology":null},{"url":null,"slug":"discretalk-text-to-speech-as-a-machine","title":"DiscreTalk: Text-to-Speech as a Machine Translation Problem","date":"2020-05-12","arxiv_id":"2005.05525","repositories_listed":0,"syntology":null},{"url":null,"slug":"commonsense-evidence-generation-and-injection","title":"Commonsense Evidence Generation and Injection in Reading Comprehension","date":"2020-05-11","arxiv_id":"2005.05240","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-polysynthetic-language-modelling","title":"Neural Polysynthetic Language Modelling","date":"2020-05-11","arxiv_id":"2005.05477","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-context-affects-language-models-factual","title":"How Context Affects Language Models' Factual Predictions","date":"2020-05-10","arxiv_id":"2005.04611","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-knowledge-from-pre-trained","title":"Distilling Knowledge from Pre-trained Language Models via Text Smoothing","date":"2020-05-08","arxiv_id":"2005.03848","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-natural-language-processing-on-near","title":"Quantum Natural Language Processing on Near-Term Quantum Computers","date":"2020-05-08","arxiv_id":"2005.04147","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-common-sense-acquisition-with","title":"Temporal Common Sense Acquisition with Minimal Supervision","date":"2020-05-08","arxiv_id":"2005.04304","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-architectures-from-an-extended","title":"Learning Architectures from an Extended Search Space for Language Modeling","date":"2020-05-06","arxiv_id":"2005.02593","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-robust-unsupervised-contextual","title":"Fast and Robust Unsupervised Contextual Biasing for Speech Recognition","date":"2020-05-04","arxiv_id":"2005.01677","repositories_listed":0,"syntology":null},{"url":null,"slug":"influence-paths-for-characterizing-subject","title":"Influence Paths for Characterizing Subject-Verb Number Agreement in LSTM Language Models","date":"2020-05-03","arxiv_id":"2005.01190","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-survey-of-grammar-error","title":"A Comprehensive Survey of Grammar Error Correction","date":"2020-05-02","arxiv_id":"2005.06600","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-language-score-based-output-selection","title":"A language score based output selection method for multilingual speech recognition","date":"2020-05-02","arxiv_id":"2005.00851","repositories_listed":0,"syntology":null},{"url":"/paper/forecastqa-machine-comprehension-of-temporal","slug":"forecastqa-machine-comprehension-of-temporal","title":"ForecastQA: A Question Answering Challenge for Event Forecasting with Temporal Text Data","date":"2020-05-02","arxiv_id":"2005.00792","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multimodal-educational-corpus-of-oral","title":"A Multimodal Educational Corpus of Oral Courses: Annotation, Analysis and Case Study","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"acoustic-phonetic-approach-for-asr-of-less","title":"Acoustic-Phonetic Approach for ASR of Less Resourced Languages Using Monolingual and Cross-Lingual Information","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptation-of-deep-bidirectional-transformers","title":"Adaptation of Deep Bidirectional Transformers for Afrikaans Language","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-bert-to-implicit-discourse-relation","title":"Adapting BERT to Implicit Discourse Relation Classification with a Focus on Discourse Connectives","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"aggression-identification-in-social-media-a","title":"Aggression Identification in Social Media: a Transfer Learning Based Approach","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-myanmar-image-captioning-using-cnn","title":"Automatic Myanmar Image Captioning using CNN and LSTM-Based Language Model","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"building-language-models-for-morphological","title":"Building Language Models for Morphological Rich Low-Resource Languages using Data from Related Donor Languages: the Case of Uyghur","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"class-based-lstm-russian-language-model-with","title":"Class-based LSTM Russian Language Model with Linguistic Information","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-sentence-pre-trained-model-for","title":"Cross-sentence Pre-trained Model for Interactive QA matching","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dnn-based-multilingual-automatic-speech","title":"DNN-Based Multilingual Automatic Speech Recognition for Wolaytta using Oromo Speech","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"embeddings-for-named-entity-recognition-in","title":"Embeddings for Named Entity Recognition in Geoscience Portuguese Literature","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-approaches-to-personalizing","title":"Evaluating Approaches to Personalizing Language Models","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-impact-of-sub-word-information","title":"Evaluating the Impact of Sub-word Information and Cross-lingual Word Embeddings on Mi'kmaq Language Modelling","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-pre-training-with-alignments-for","title":"Exploring Pre-training with Alignments for RNN Transducer based End-to-End Speech Recognition","date":"2020-05-01","arxiv_id":"2005.00572","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-zero-to-hero-on-the-limitations-of-zero","title":"From Zero to Hero: On the Limitations of Zero-Shot Cross-Lingual Transfer with Multilingual Transformers","date":"2020-05-01","arxiv_id":"2005.00633","repositories_listed":0,"syntology":null},{"url":null,"slug":"implementation-of-supervised-training","title":"Implementation of Supervised Training Approaches for Monolingual Word Sense Alignment: ACDH-CH System Description for the MWSA Shared Task at GlobaLex 2020","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-neural-language-generation-with","title":"Improving Neural Language Generation with Spectrum Control","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-language-model-for-low-resource","title":"Improving the Language Model for Low-Resource ASR with Online Text Corpora","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"irit-at-trac-2020","title":"IRIT at TRAC 2020","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"is-language-modeling-enough-evaluating","title":"Is Language Modeling Enough? Evaluating Effective Embedding Combinations","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"jamo-pair-encoding-subcharacter","title":"Jamo Pair Encoding: Subcharacter Representation-based Extreme Korean Vocabulary Compression for Efficient Subword Tokenization","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"japanese-realistic-textual-entailment-corpus","title":"Japanese Realistic Textual Entailment Corpus","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-modeling-with-a-general-second-order","title":"Language Modeling with a General Second-Order RNN","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-models-for-cloze-task-answer","title":"Language Models for Cloze Task Answer Generation in Russian","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-translation-from-spoken-language-to","title":"Machine Translation from Spoken Language to Sign Language using Pre-trained Language Model as Encoder","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"minority-positive-sampling-for-switching","title":"Minority Positive Sampling for Switching Points - an Anecdote for the Code-Mixing Language Modeling","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-scale-transformer-language-models","title":"Multi-scale Transformer Language Models","date":"2020-05-01","arxiv_id":"2005.00581","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-using-arabert-for","title":"Multi-Task Learning using AraBert for Offensive Language Detection","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-models-for-predicting-celtic-mutations","title":"Neural Models for Predicting Celtic Mutations","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"no-data-to-crawl-monolingual-corpus-creation","title":"No Data to Crawl? Monolingual Corpus Creation from PDF Files of Truly low-Resource Languages in Peru","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-construction-of-the-asr-oriented-indian","title":"On Construction of the ASR-oriented Indian English Pronunciation Dictionary","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-exploration-of-english-to-urdu-machine","title":"On the Exploration of English to Urdu Machine Translation","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"recognizing-semantic-relations-by-combining","title":"Recognizing Semantic Relations by Combining Transformers and Fully Connected Models","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-acoustic-and-language-model-1","title":"Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-transcription-challenges-for-resource","title":"Speech Transcription Challenges for Resource Constrained Indigenous Language Cree","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"style-variation-as-a-vantage-point-for-code","title":"Style Variation as a Vantage Point for Code-Switching","date":"2020-05-01","arxiv_id":"2005.00458","repositories_listed":0,"syntology":null},{"url":null,"slug":"stylometry-in-a-bilingual-setup","title":"Stylometry in a Bilingual Setup","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-incomslav-platform-experimental-website","title":"The INCOMSLAV Platform: Experimental Website with Integrated Methods for Measuring Linguistic Distances and Asymmetries in Receptive Multilingualism","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/wiki-40b-multilingual-language-model-dataset","slug":"wiki-40b-multilingual-language-model-dataset","title":"Wiki-40B: Multilingual Language Model Dataset","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"apo-vae-text-generation-in-hyperbolic-space","title":"APo-VAE: Text Generation in Hyperbolic Space","date":"2020-04-30","arxiv_id":"2005.00054","repositories_listed":0,"syntology":null},{"url":null,"slug":"coheval-benchmarking-coherence-models","title":"Rethinking Coherence Modeling: Synthetic vs. Downstream Tasks","date":"2020-04-30","arxiv_id":"2004.14626","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-based-text-generation-using-lstm","title":"Context based Text-generation using LSTM networks","date":"2020-04-30","arxiv_id":"2005.00048","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemblegan-adversarial-learning-for","title":"EnsembleGAN: Adversarial Learning for Retrieval-Generation Ensemble Model on Short-Text Conversation","date":"2020-04-30","arxiv_id":"2004.14592","repositories_listed":0,"syntology":null},{"url":"/paper/few-shot-natural-language-generation-by","slug":"few-shot-natural-language-generation-by","title":"Template Guided Text Generation for Task-Oriented Dialogue","date":"2020-04-30","arxiv_id":"2004.15006","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-text-simplification-with-back","title":"Semi-Supervised Text Simplification with Back-Translation and Asymmetric Denoising Autoencoders","date":"2020-04-30","arxiv_id":"2004.14693","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-injection-of-knowledge-into","title":"Knowledge Injection into Dialogue Generation via Language Models","date":"2020-04-30","arxiv_id":"2004.14614","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-role-of-language-typology-in","title":"Evaluating Transformer-Based Multilingual Text Classification","date":"2020-04-29","arxiv_id":"2004.13939","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-structured-knowledge-in-text-via","title":"Exploiting Structured Knowledge in Text via Graph-Guided Representation Learning","date":"2020-04-29","arxiv_id":"2004.14224","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-long-context-for-task-oriented","title":"Modeling Long Context for Task-Oriented Dialogue State Generation","date":"2020-04-29","arxiv_id":"2004.14080","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-choice-dialogue-based-reading","title":"Knowledgeable Dialogue Reading Comprehension on Key Turns","date":"2020-04-29","arxiv_id":"2004.13988","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-is-almost-all-you-need-an","title":"Pre-training Is (Almost) All You Need: An Application to Commonsense Reasoning","date":"2020-04-29","arxiv_id":"2004.14074","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-memory-efficient-neural-code","title":"Fast and Memory-Efficient Neural Code Completion","date":"2020-04-28","arxiv_id":"2004.13651","repositories_listed":0,"syntology":null},{"url":null,"slug":"lightpaff-a-two-stage-distillation-framework-1","title":"LightPAFF: A Two-Stage Distillation Framework for Pre-training and Fine-tuning","date":"2020-04-27","arxiv_id":"2004.12817","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-discourse-relations-in-language","title":"Assessing Discourse Relations in Language Generation from GPT-2","date":"2020-04-26","arxiv_id":"2004.12506","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenge-closed-book-science-exam-a-meta","title":"Challenge Closed-book Science Exam: A Meta-learning Based Question Answering System","date":"2020-04-26","arxiv_id":"2004.12303","repositories_listed":0,"syntology":null},{"url":null,"slug":"jointly-trained-transformers-models-for","title":"Jointly Trained Transformers models for Spoken Language Translation","date":"2020-04-25","arxiv_id":"2004.12111","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextualized-representations-using-textual","title":"Contextualized Representations Using Textual Encyclopedic Knowledge","date":"2020-04-24","arxiv_id":"2004.12006","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-fine-can-fine-tuning-be-learning","title":"How fine can fine-tuning be? Learning efficient language models","date":"2020-04-24","arxiv_id":"2004.14129","repositories_listed":0,"syntology":null},{"url":null,"slug":"coupled-intrinsic-and-extrinsic-human","title":"Coupled intrinsic and extrinsic human language resource-based query expansion","date":"2020-04-23","arxiv_id":"2004.11083","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-adversarial-examples-for-biomedical-nlp","title":"On Adversarial Examples for Biomedical NLP Tasks","date":"2020-04-23","arxiv_id":"2004.11157","repositories_listed":0,"syntology":null},{"url":null,"slug":"qurious-question-generation-pretraining-for","title":"QURIOUS: Question Generation Pretraining for Text Generation","date":"2020-04-23","arxiv_id":"2004.11026","repositories_listed":0,"syntology":null},{"url":null,"slug":"uhh-lt-lt2-at-semeval-2020-task-12-fine","title":"UHH-LT at SemEval-2020 Task 12: Fine-Tuning of Pre-Trained Transformer Networks for Offensive Language Detection","date":"2020-04-23","arxiv_id":"2004.11493","repositories_listed":0,"syntology":null},{"url":null,"slug":"dialogue-state-tracking-with-pretrained","title":"Fast and Scalable Dialogue State Tracking with Explicit Modular Decomposition","date":"2020-04-22","arxiv_id":"2004.10663","repositories_listed":0,"syntology":null}],"record_sha256":"9637a7430774b2696ea6d6429aa45715664efe9552d13e7b21be84552dd34bea","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}