{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modelling/papers/156","list_of":"/task/language-modelling","task":"Language Modelling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":156,"pages_in_order":177,"rows_per_page":100,"rows":[15501,15600],"of":17610,"counts":{"archive_papers_tagged":17610,"with_a_code_link":7012,"where_syntology_ran_a_sample":2428,"not_listed_spam_title":0,"listed":17610,"listed_where_code_ran":2428,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":2027,"every_run_a_failure_of_syntologys_instrument":401,"listed_with_a_run_with_no_instrument_failure":2027,"listed_every_run_a_failure_of_syntologys_instrument":401,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modelling","prev":"/task/language-modelling/papers/155","next":"/task/language-modelling/papers/157","papers":[{"url":null,"slug":"discretized-bottleneck-in-vae-posterior","title":"Improve Variational Autoencoder for Text Generationwith Discrete Latent Bottleneck","date":"2020-04-22","arxiv_id":"2004.10603","repositories_listed":0,"syntology":null},{"url":null,"slug":"keyphrase-prediction-with-pre-trained","title":"Keyphrase Prediction With Pre-trained Language Model","date":"2020-04-22","arxiv_id":"2004.10462","repositories_listed":0,"syntology":null},{"url":null,"slug":"discrete-variational-attention-models-for","title":"Discrete Variational Attention Models for Language Generation","date":"2020-04-21","arxiv_id":"2004.09764","repositories_listed":0,"syntology":null},{"url":null,"slug":"music-generation-with-temporal-structure","title":"Music Generation with Temporal Structure Augmentation","date":"2020-04-21","arxiv_id":"2004.10246","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-multi-hop-question-answering-with","title":"Fine-tuning Multi-hop Question Answering with Hierarchical Graph Network","date":"2020-04-20","arxiv_id":"2004.13821","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-sentence-learning-by-adversarial","title":"Active Sentence Learning by Adversarial Uncertainty Sampling in Discrete Space","date":"2020-04-17","arxiv_id":"2004.08046","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-sequence-to-sequence-vaes-learn-global","title":"Do sequence-to-sequence VAEs learn global features of sentences?","date":"2020-04-16","arxiv_id":"2004.07683","repositories_listed":0,"syntology":null},{"url":null,"slug":"extending-text-informativeness-measures-to","title":"Extending Text Informativeness Measures to Passage Interestingness Evaluation (Language Model vs. Word Embedding)","date":"2020-04-14","arxiv_id":"2004.06747","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-variational-autoencoder","title":"ControlVAE: Controllable Variational Autoencoder","date":"2020-04-13","arxiv_id":"2004.05988","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustly-pre-trained-neural-model-for-direct","title":"Robustly Pre-trained Neural Model for Direct Temporal Relation Extraction","date":"2020-04-13","arxiv_id":"2004.06216","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-multi-criteria-chinese-word","title":"Unified Multi-Criteria Chinese Word Segmentation with BERT","date":"2020-04-13","arxiv_id":"2004.05808","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-text-representations-as-meta","title":"Pre-training Text Representations as Meta Learning","date":"2020-04-12","arxiv_id":"2004.05568","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploit-where-optimizer-explores-via","title":"Detached Error Feedback for Distributed SGD with Random Sparsification","date":"2020-04-11","arxiv_id":"2004.05298","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-model-design-for-code-completion-in","title":"Sequence Model Design for Code Completion in the Modern IDE","date":"2020-04-10","arxiv_id":"2004.05249","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-convolutional-deep-encoding-network","title":"Stacked Convolutional Deep Encoding Network for Video-Text Retrieval","date":"2020-04-10","arxiv_id":"2004.04959","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-scale-multilingual","title":"Learning to Scale Multilingual Representations for Vision-Language Tasks","date":"2020-04-09","arxiv_id":"2004.04312","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-of-phone-based-subword-units","title":"An investigation of phone-based subword units for end-to-end speech recognition","date":"2020-04-08","arxiv_id":"2004.04290","repositories_listed":0,"syntology":null},{"url":null,"slug":"calm-continuous-adaptive-learning-for","title":"CALM: Continuous Adaptive Learning for Language Modeling","date":"2020-04-08","arxiv_id":"2004.03794","repositories_listed":0,"syntology":null},{"url":"/paper/efficient-long-distance-relation-extraction","slug":"efficient-long-distance-relation-extraction","title":"Efficient long-distance relation extraction with DG-SpanBERT","date":"2020-04-07","arxiv_id":"2004.03636","repositories_listed":0,"syntology":null},{"url":null,"slug":"homophone-based-label-smoothing-in-end-to-end","title":"Homophone-based Label Smoothing in End-to-End Automatic Speech Recognition","date":"2020-04-07","arxiv_id":"2004.03437","repositories_listed":0,"syntology":null},{"url":null,"slug":"bert-in-negotiations-early-prediction-of","title":"Exploring Early Prediction of Buyer-Seller Negotiation Outcomes","date":"2020-04-06","arxiv_id":"2004.02363","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-acoustic-and-language-model","title":"Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition","date":"2020-04-05","arxiv_id":"2004.04054","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-driven-iterative-expansion-language","title":"Syntax-driven Iterative Expansion Language Models for Controllable Text Generation","date":"2020-04-05","arxiv_id":"2004.02211","repositories_listed":0,"syntology":null},{"url":null,"slug":"cg-bert-conditional-text-generation-with-bert","title":"CG-BERT: Conditional Text Generation with BERT for Generalized Few-shot Intent Detection","date":"2020-04-04","arxiv_id":"2004.01881","repositories_listed":0,"syntology":null},{"url":null,"slug":"recognizing-long-grammatical-sequences-using","title":"Recognizing Long Grammatical Sequences Using Recurrent Networks Augmented With An External Differentiable Stack","date":"2020-04-04","arxiv_id":"2004.07623","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-transfer-learning-for-punctuation","title":"Adversarial Transfer Learning for Punctuation Restoration","date":"2020-04-01","arxiv_id":"2004.00248","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-productionizing-subjective-search","title":"Towards Productionizing Subjective Search Systems","date":"2020-03-31","arxiv_id":"2003.13968","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hierarchical-transformer-for-unsupervised","title":"A Hierarchical Transformer for Unsupervised Parsing","date":"2020-03-30","arxiv_id":"2003.13841","repositories_listed":0,"syntology":null},{"url":null,"slug":"sac-accelerating-and-structuring-self","title":"SAC: Accelerating and Structuring Self-Attention via Sparse Adaptive Connection","date":"2020-03-22","arxiv_id":"2003.09833","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-sampling-and-selective-masking-for","title":"Dynamic Sampling and Selective Masking for Communication-Efficient Federated Learning","date":"2020-03-21","arxiv_id":"2003.09603","repositories_listed":0,"syntology":null},{"url":null,"slug":"anchor-transform-learning-sparse-1","title":"Anchor & Transform: Learning Sparse Embeddings for Large Vocabularies","date":"2020-03-18","arxiv_id":"2003.08197","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-label-natural-language-processing-to","title":"Multi-label natural language processing to identify diagnosis and procedure codes from MIMIC-III inpatient notes","date":"2020-03-17","arxiv_id":"2003.07507","repositories_listed":0,"syntology":null},{"url":null,"slug":"key-phrase-classification-in-complex","title":"Key Phrase Classification in Complex Assignments","date":"2020-03-16","arxiv_id":"2003.07019","repositories_listed":0,"syntology":null},{"url":null,"slug":"finnish-language-modeling-with-deep","title":"Finnish Language Modeling with Deep Transformer Models","date":"2020-03-14","arxiv_id":"2003.11562","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-autoregressive-transducer-hat","title":"Hybrid Autoregressive Transducer (hat)","date":"2020-03-12","arxiv_id":"2003.07705","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-cotgan-a-meta-cooperative-training","title":"Meta-CoTGAN: A Meta Cooperative Training Paradigm for Improving Adversarial Text Generation","date":"2020-03-12","arxiv_id":"2003.11530","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-the-mask-making-sense-of-language","title":"What the [MASK]? Making Sense of Language-Specific BERT Models","date":"2020-03-05","arxiv_id":"2003.02912","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-uyghur-asr-systems-with-decoders","title":"Improving Uyghur ASR systems with decoders using morpheme-based language models","date":"2020-03-03","arxiv_id":"2003.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-embeddings-based-on-self-attention","title":"Meta-Embeddings Based On Self-Attention","date":"2020-03-03","arxiv_id":"2003.01371","repositories_listed":0,"syntology":null},{"url":"/paper/xgpt-cross-modal-generative-pre-training-for","slug":"xgpt-cross-modal-generative-pre-training-for","title":"XGPT: Cross-modal Generative Pre-Training for Image Captioning","date":"2020-03-03","arxiv_id":"2003.01473","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-a-thousand-optimization-tasks-to-learn","title":"Using a thousand optimization tasks to learn hyperparameter search strategies","date":"2020-02-27","arxiv_id":"2002.11887","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-density-ratio-approach-to-language-model","title":"A Density Ratio Approach to Language Model Fusion in End-To-End Automatic Speech Recognition","date":"2020-02-26","arxiv_id":"2002.11268","repositories_listed":0,"syntology":null},{"url":"/paper/object-relational-graph-with-teacher","slug":"object-relational-graph-with-teacher","title":"Object Relational Graph with Teacher-Recommended Learning for Video Captioning","date":"2020-02-26","arxiv_id":"2002.11566","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantized-neural-network-inference-with","title":"Quantized Neural Network Inference with Precision Batching","date":"2020-02-26","arxiv_id":"2003.00822","repositories_listed":0,"syntology":null},{"url":null,"slug":"refined-gate-a-simple-and-effective-gating","title":"Refined Gate: A Simple and Effective Gating Mechanism for Recurrent Units","date":"2020-02-26","arxiv_id":"2002.11338","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-more-abstractive-summarization-model","title":"A more abstractive summarization model","date":"2020-02-25","arxiv_id":"2002.10959","repositories_listed":0,"syntology":null},{"url":null,"slug":"backpropamine-training-self-modifying-neural-1","title":"Backpropamine: training self-modifying neural networks with differentiable neuromodulated plasticity","date":"2020-02-24","arxiv_id":"2002.10585","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-preserving-network-traffic","title":"Sequence Preserving Network Traffic Generation","date":"2020-02-23","arxiv_id":"2002.09832","repositories_listed":0,"syntology":null},{"url":null,"slug":"studying-the-effects-of-cognitive-biases-in","title":"Studying the Effects of Cognitive Biases in Evaluation of Conversational Agents","date":"2020-02-18","arxiv_id":"2002.07927","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-financial-service-chatbot-based-on-deep","title":"A Financial Service Chatbot based on Deep Bidirectional Transformers","date":"2020-02-17","arxiv_id":"2003.04987","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-and-local-feature-learning-for-ego","title":"Global and Local Feature Learning for Ego-Network Analysis","date":"2020-02-16","arxiv_id":"2002.06685","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-data-efficient-end-to-end-spoken-language","title":"A Data Efficient End-To-End Spoken Language Understanding Architecture","date":"2020-02-14","arxiv_id":"2002.05955","repositories_listed":0,"syntology":null},{"url":"/paper/fquad-french-question-answering-dataset","slug":"fquad-french-question-answering-dataset","title":"FQuAD: French Question Answering Dataset","date":"2020-02-14","arxiv_id":"2002.06071","repositories_listed":0,"syntology":null},{"url":null,"slug":"cbag-conditional-biomedical-abstract","title":"CBAG: Conditional Biomedical Abstract Generation","date":"2020-02-13","arxiv_id":"2002.05637","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-of-turkish-word-representations","title":"Comparison of Turkish Word Representations Trained on Different Morphological Forms","date":"2020-02-13","arxiv_id":"2002.05417","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-for-query-rewriting-in-a-spoken","title":"Pre-Training for Query Rewriting in A Spoken Language Understanding System","date":"2020-02-13","arxiv_id":"2002.05607","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularizing-activations-in-neural-networks-1","title":"Regularizing activations in neural networks via distribution matching with the Wasserstein metric","date":"2020-02-13","arxiv_id":"2002.05366","repositories_listed":0,"syntology":null},{"url":null,"slug":"localized-flood-detectionwith-minimal-labeled","title":"Localized Flood DetectionWith Minimal Labeled Social Media Data Using Transfer Learning","date":"2020-02-10","arxiv_id":"2003.04973","repositories_listed":0,"syntology":null},{"url":null,"slug":"fastwave-accelerating-autoregressive","title":"FastWave: Accelerating Autoregressive Convolutional Neural Networks on FPGA","date":"2020-02-09","arxiv_id":"2002.04971","repositories_listed":0,"syntology":null},{"url":null,"slug":"limits-of-detecting-text-generated-by-large","title":"Limits of Detecting Text Generated by Large-Scale Language Models","date":"2020-02-09","arxiv_id":"2002.03438","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-the-pretraining-and-finetuning","title":"Aligning the Pretraining and Finetuning Objectives of Language Models","date":"2020-02-05","arxiv_id":"2002.02000","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-difference-of-convex-programming-approach","title":"A Difference-of-Convex Programming Approach With Parallel Branch-and-Bound For Sentence Compression Via A Hybrid Extractive Model","date":"2020-02-02","arxiv_id":"2002.01352","repositories_listed":0,"syntology":null},{"url":null,"slug":"aspect-based-academic-search-using-domain","title":"Aspect-based Academic Search using Domain-specific KB","date":"2020-01-29","arxiv_id":"2001.10781","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-contextual-modeling-for-asr-correction","title":"Joint Contextual Modeling for ASR Correction and Language Understanding","date":"2020-01-28","arxiv_id":"2002.00750","repositories_listed":0,"syntology":null},{"url":null,"slug":"pel-bert-a-joint-model-for-protocol-entity","title":"PEL-BERT: A Joint Model for Protocol Entity Linking","date":"2020-01-28","arxiv_id":"2002.00744","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressing-language-models-using-doped","title":"Compressing Language Models using Doped Kronecker Products","date":"2020-01-24","arxiv_id":"2001.08896","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-a-transformer-based-language","title":"Reducing Non-Normative Text Generation from Language Models","date":"2020-01-23","arxiv_id":"2001.08764","repositories_listed":0,"syntology":null},{"url":"/paper/imagebert-cross-modal-pre-training-with-large","slug":"imagebert-cross-modal-pre-training-with-large","title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","date":"2020-01-22","arxiv_id":"2001.07966","repositories_listed":0,"syntology":null},{"url":"/paper/single-headed-attention-based-sequence-to","slug":"single-headed-attention-based-sequence-to","title":"Single headed attention based sequence-to-sequence model for state-of-the-art results on Switchboard","date":"2020-01-20","arxiv_id":"2001.07263","repositories_listed":0,"syntology":null},{"url":null,"slug":"humpty-dumpty-controlling-word-meanings-via","title":"Humpty Dumpty: Controlling Word Meanings via Corpus Poisoning","date":"2020-01-14","arxiv_id":"2001.04935","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-continuous-space-neural-language-model-for","title":"A Continuous Space Neural Language Model for Bengali Language","date":"2020-01-11","arxiv_id":"2001.05315","repositories_listed":0,"syntology":null},{"url":"/paper/learning-cross-context-entity-representations-1","slug":"learning-cross-context-entity-representations-1","title":"Learning Cross-Context Entity Representations from Text","date":"2020-01-11","arxiv_id":"2001.03765","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-minimal-supervision-bert-based","title":"Towards Minimal Supervision BERT-based Grammar Error Correction","date":"2020-01-10","arxiv_id":"2001.03521","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-business-process-structure","title":"Automatic Business Process Structure Discovery using Ordered Neurons LSTM: A Preliminary Study","date":"2020-01-05","arxiv_id":"2001.01243","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-language-modeling-and","title":"Transformer-based language modeling and decoding for conversational speech recognition","date":"2020-01-04","arxiv_id":"2001.01140","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-comparability-of-pre-trained-language","title":"On the comparability of Pre-trained Language Models","date":"2020-01-03","arxiv_id":"2001.00781","repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-monoidal-grammars","title":"Incremental Monoidal Grammars","date":"2020-01-02","arxiv_id":"2001.02296","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-multi-head-co-attention-for-multi-choice-1","title":"Dual Multi-head Co-attention for Multi-choice Reading Comprehension","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fedboost-a-communication-efficient-algorithm","title":"FedBoost: A Communication-Efficient Algorithm for Federated Learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"poked-a-semi-supervised-system-for-word-sense","title":"PoKED: A Semi-Supervised System for Word Sense Disambiguation","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"retrieval-augmented-language-model-pre","title":"Retrieval Augmented Language Model Pre-Training","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"script-knowledge-constrains-ellipses-in","title":"Script knowledge constrains ellipses in fragments – Evidence from production data and language modeling","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"training-deep-networks-with-stochastic","title":"Training Deep Networks with Stochastic Gradient Normalized by Layerwise Adaptive Second Moments","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hinglish-language-modeling-a-messy-code-mixed","title":"\"Hinglish\" Language -- Modeling a Messy Code-Mixed Language","date":"2019-12-30","arxiv_id":"1912.13109","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-multi-stage-training-of-online","title":"Improved Multi-Stage Training of Online Attention-based Encoder-Decoder Models","date":"2019-12-28","arxiv_id":"1912.12384","repositories_listed":0,"syntology":null},{"url":null,"slug":"convolutional-quantum-like-language-model","title":"Convolutional Quantum-Like Language Model with Mutual-Attention for Product Rating Prediction","date":"2019-12-25","arxiv_id":"1912.11720","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-training-of-a-large-vocabulary-end","title":"end-to-end training of a large vocabulary end-to-end speech recognition system","date":"2019-12-22","arxiv_id":"1912.11040","repositories_listed":0,"syntology":null},{"url":null,"slug":"candidate-fusion-integrating-language","title":"Candidate Fusion: Integrating Language Modelling into a Sequence-to-Sequence Handwritten Word Recognition Architecture","date":"2019-12-21","arxiv_id":"1912.10308","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretrained-encyclopedia-weakly-supervised-1","title":"Pretrained Encyclopedia: Weakly Supervised Knowledge-Pretrained Language Model","date":"2019-12-20","arxiv_id":"1912.09637","repositories_listed":0,"syntology":null},{"url":null,"slug":"shareable-representations-for-search-query","title":"Shareable Representations for Search Query Understanding","date":"2019-12-20","arxiv_id":"2001.04345","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-privacy-loss-in-updates-of-natural-1","title":"Analyzing Information Leakage of Updates to Natural Language Models","date":"2019-12-17","arxiv_id":"1912.07942","repositories_listed":0,"syntology":null},{"url":null,"slug":"karl-knowledge-aware-reasoning-memory","title":"KARL: Knowledge-Aware Reasoning Memory Modeling with Reinforcement Learning of Vector Space","date":"2019-12-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"waldorf-wasteless-language-model-distillation","title":"WaLDORf: Wasteless Language-model Distillation On Reading-comprehension","date":"2019-12-13","arxiv_id":"1912.06638","repositories_listed":0,"syntology":null},{"url":null,"slug":"just-add-functions-a-neural-symbolic-language","title":"Just Add Functions: A Neural-Symbolic Language Model","date":"2019-12-11","arxiv_id":"1912.05421","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-text-classification-with-generative","title":"Zero-shot Text Classification With Generative Language Models","date":"2019-12-10","arxiv_id":"1912.10165","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-attention-discriminative-language-model","title":"Audio-attention discriminative language model for ASR rescoring","date":"2019-12-06","arxiv_id":"1912.03363","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-whole-context-to-sequence-to","title":"Integrating Knowledge into End-to-End Speech Recognition from External Text-Only Data","date":"2019-12-04","arxiv_id":"1912.01777","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-pretrained-language","title":"A Comparative Study of Pretrained Language Models on Thai Social Text Categorization","date":"2019-12-03","arxiv_id":"1912.01580","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiscale-self-attentive-convolutions-for","title":"Multiscale Self Attentive Convolutions for Vision and Language Modeling","date":"2019-12-03","arxiv_id":"1912.01521","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-inflection-generation-using","title":"Unsupervised Inflection Generation Using Neural Language Modeling","date":"2019-12-03","arxiv_id":"1912.01156","repositories_listed":0,"syntology":null}],"record_sha256":"f990729d2bf049df0bc6d259cb7e95a2274883db647baaf0067cefa80ffdb24d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}