{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modeling/papers/126","list_of":"/task/language-modeling","task":"Language Modeling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":126,"pages_in_order":142,"rows_per_page":100,"rows":[12501,12600],"of":14182,"counts":{"archive_papers_tagged":14182,"with_a_code_link":5620,"where_syntology_ran_a_sample":1894,"not_listed_spam_title":0,"listed":14182,"listed_where_code_ran":1894,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1580,"every_run_a_failure_of_syntologys_instrument":314,"listed_with_a_run_with_no_instrument_failure":1580,"listed_every_run_a_failure_of_syntologys_instrument":314,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modeling","prev":"/task/language-modeling/papers/125","next":"/task/language-modeling/papers/127","papers":[{"url":null,"slug":"autoregressive-modeling-is-misspecified-for","title":"Limitations of Autoregressive Models and Their Alternatives","date":"2020-10-22","arxiv_id":"2010.11939","repositories_listed":0,"syntology":null},{"url":null,"slug":"convex-data-efficient-and-few-shot-slot","title":"ConVEx: Data-Efficient and Few-Shot Slot Labeling","date":"2020-10-22","arxiv_id":"2010.11791","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-stylistic-lexical-preferences","title":"Incorporating Stylistic Lexical Preferences in Generative Language Models","date":"2020-10-22","arxiv_id":"2010.11553","repositories_listed":0,"syntology":null},{"url":null,"slug":"slimipl-language-model-free-iterative-pseudo","title":"SlimIPL: Language-Model-Free Iterative Pseudo-Labeling","date":"2020-10-22","arxiv_id":"2010.11524","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-turking-test-can-language-models","title":"The Turking Test: Can Language Models Understand Instructions?","date":"2020-10-22","arxiv_id":"2010.11982","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-fully-bilingual-deep-language","title":"Towards Fully Bilingual Deep Language Modeling","date":"2020-10-22","arxiv_id":"2010.11639","repositories_listed":0,"syntology":null},{"url":null,"slug":"unicase-rethinking-casing-in-language-models","title":"UniCase -- Rethinking Casing in Language Models","date":"2020-10-22","arxiv_id":"2010.11936","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicitly-modeling-syntax-in-language-model","title":"Explicitly Modeling Syntax in Language Models with Incremental Parsing and a Dynamic Oracle","date":"2020-10-21","arxiv_id":"2011.07960","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-for-improved-accuracy","title":"Knowledge Distillation for Improved Accuracy in Spoken Question Answering","date":"2020-10-21","arxiv_id":"2010.11067","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-benchmark-for-lease-contract-review","title":"A Benchmark for Lease Contract Review","date":"2020-10-20","arxiv_id":"2010.10386","repositories_listed":0,"syntology":null},{"url":null,"slug":"cue-me-in-content-inducing-approaches-to","title":"Cue Me In: Content-Inducing Approaches to Interactive Story Generation","date":"2020-10-20","arxiv_id":"2010.09935","repositories_listed":0,"syntology":null},{"url":null,"slug":"individual-corpora-predict-fast-memory","title":"Individual corpora predict fast memory retrieval during reading","date":"2020-10-20","arxiv_id":"2010.10176","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-chats-for-task-oriented-dialog","title":"Simulated Chats for Building Dialog Systems: Learning to Generate Conversations from Instructions","date":"2020-10-20","arxiv_id":"2010.10216","repositories_listed":0,"syntology":null},{"url":null,"slug":"adabelief-optimizer-adapting-stepsizes-by","title":"AdaBelief Optimizer: Adapting Stepsizes by theBelief in Observed Gradients","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"better-distractions-transformer-based","title":"Better Distractions: Transformer-based Distractor Generation and Multiple Choice Question Filtering","date":"2020-10-19","arxiv_id":"2010.09598","repositories_listed":0,"syntology":null},{"url":null,"slug":"m2d-a-multi-modal-framework-for-automatic","title":"M2D: A Multi-modal Framework for Automatic Medical Diagnosis","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scisummpip-an-unsupervised-scientific-paper","title":"SciSummPip: An Unsupervised Scientific Paper Summarization Pipeline","date":"2020-10-19","arxiv_id":"2010.09190","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automatic-online-hate-speech","title":"Towards Automatic Online Hate Speech Intervention Generation using Pretrained Language Model","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-pretraining-for-neural-machine-1","title":"Unsupervised Pretraining for Neural Machine Translation Using Elastic Weight Consolidation","date":"2020-10-19","arxiv_id":"2010.09403","repositories_listed":0,"syntology":null},{"url":null,"slug":"quesbelm-a-bert-based-ensemble-language-model","title":"QuesBELM: A BERT based Ensemble Language Model for Natural Questions","date":"2020-10-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automatic-sentiment-based-topic","title":"Towards Automatic Sentiment-based Topic Phrase Generation","date":"2020-10-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-multitask-learning-approach-for","title":"Hierarchical Multitask Learning Approach for BERT","date":"2020-10-17","arxiv_id":"2011.04451","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-answering-over-knowledge-base-using-1","title":"Question Answering over Knowledge Base using Language Model Embeddings","date":"2020-10-17","arxiv_id":"2010.08883","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-esg-topics-using-domain-specific","title":"Detecting ESG topics using domain-specific language models and data augmentation approaches","date":"2020-10-16","arxiv_id":"2010.08319","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-adversarial-qa-did-the-model-understand","title":"Human Adversarial QA: Did the Model Understand the Paragraph?","date":"2020-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transformer-based-pitch-sequence","title":"A Transformer Based Pitch Sequence Autoencoder with MIDI Augmentation","date":"2020-10-15","arxiv_id":"2010.07758","repositories_listed":0,"syntology":null},{"url":null,"slug":"grammatical-error-correction-in-low-error","title":"Grammatical Error Correction in Low Error Density Domains: A New Benchmark and Analyses","date":"2020-10-15","arxiv_id":"2010.07574","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-language-to-language-ish-how-brain-like","title":"From Language to Language-ish: How Brain-Like is an LSTM's Representation of Nonsensical Language Stimuli?","date":"2020-10-14","arxiv_id":"2010.07435","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-relation-extraction-from","title":"Unsupervised Relation Extraction from Language Models using Constrained Cloze Completion","date":"2020-10-14","arxiv_id":"2010.06804","repositories_listed":0,"syntology":null},{"url":null,"slug":"corruption-is-not-all-bad-incorporating","title":"Corruption Is Not All Bad: Incorporating Discourse Structure into Pre-training via Corruption for Essay Scoring","date":"2020-10-13","arxiv_id":"2010.06137","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-angina-symptoms-from-clinical","title":"Extracting Angina Symptoms from Clinical Notes Using Pre-Trained Transformer Architectures","date":"2020-10-12","arxiv_id":"2010.05757","repositories_listed":0,"syntology":null},{"url":"/paper/improving-self-supervised-pre-training-via-a-1","slug":"improving-self-supervised-pre-training-via-a-1","title":"Improving Self-supervised Pre-training via a Fully-Explored Masked Language Model","date":"2020-10-12","arxiv_id":"2010.06040","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-stage-pre-training-for-low-resource","title":"Multi-Stage Pre-training for Low-Resource Domain Adaptation","date":"2020-10-12","arxiv_id":"2010.05904","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-trained-language-model-based-active","title":"Pre-trained Language Model Based Active Learning for Sentence Matching","date":"2020-10-12","arxiv_id":"2010.05522","repositories_listed":0,"syntology":null},{"url":null,"slug":"plan-ahead-self-supervised-text-planning-for","title":"Plan ahead: Self-Supervised Text Planning for Paragraph Completion Task","date":"2020-10-11","arxiv_id":"2010.05141","repositories_listed":0,"syntology":null},{"url":null,"slug":"sjtu-nict-s-supervised-and-unsupervised","title":"SJTU-NICT's Supervised and Unsupervised Neural Machine Translation Systems for the WMT20 News Translation Task","date":"2020-10-11","arxiv_id":"2010.05122","repositories_listed":0,"syntology":null},{"url":null,"slug":"multichannel-generative-language-model","title":"Multichannel Generative Language Model: Learning All Possible Factorizations Within and Across Channels","date":"2020-10-09","arxiv_id":"2010.04438","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-historical-dictionary-codes-with-a","title":"Solving Historical Dictionary Codes with a Neural Language Model","date":"2020-10-09","arxiv_id":"2010.04746","repositories_listed":0,"syntology":null},{"url":null,"slug":"style-attuned-pre-training-and-parameter","title":"Style Attuned Pre-training and Parameter Efficient Fine-tuning for Spoken Language Understanding","date":"2020-10-09","arxiv_id":"2010.04355","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-effectiveness-of-efficient","title":"Evaluating the Effectiveness of Efficient Neural Architecture Search for Sentence-Pair Tasks","date":"2020-10-08","arxiv_id":"2010.04249","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-product-key-memory-for-pretrained","title":"Large Product Key Memory for Pretrained Language Models","date":"2020-10-08","arxiv_id":"2010.03881","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-elmo-an-evolution-of-elmo-towards","title":"Masked ELMo: An evolution of ELMo towards fully contextual RNN language models","date":"2020-10-08","arxiv_id":"2010.04302","repositories_listed":0,"syntology":null},{"url":"/paper/on-the-importance-of-pre-training-data-volume","slug":"on-the-importance-of-pre-training-data-volume","title":"On the importance of pre-training data volume for compact language models","date":"2020-10-08","arxiv_id":"2010.03813","repositories_listed":0,"syntology":null},{"url":null,"slug":"tatum-level-drum-transcription-based-on-a","title":"Tatum-Level Drum Transcription Based on a Convolutional Recurrent Neural Network with Language Model-Based Regularized Training","date":"2020-10-08","arxiv_id":"2010.03749","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-mathematical-exploration-of-why-language-1","title":"A Mathematical Exploration of Why Language Models Help Solve Downstream Tasks","date":"2020-10-07","arxiv_id":"2010.03648","repositories_listed":0,"syntology":null},{"url":"/paper/i-d-rather-just-go-to-bed-understanding","slug":"i-d-rather-just-go-to-bed-understanding","title":"\"I'd rather just go to bed\": Understanding Indirect Answers","date":"2020-10-07","arxiv_id":"2010.03450","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-cls-through-ranking-by-generation","title":"Beyond [CLS] through Ranking by Generation","date":"2020-10-06","arxiv_id":"2010.03073","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-represent-image-and-text-with","title":"Learning to Represent Image and Text with Denotation Graph","date":"2020-10-06","arxiv_id":"2010.02949","repositories_listed":0,"syntology":null},{"url":null,"slug":"rank-and-run-time-aware-compression-of-nlp","title":"Rank and run-time aware compression of NLP Applications","date":"2020-10-06","arxiv_id":"2010.03193","repositories_listed":0,"syntology":null},{"url":null,"slug":"inference-strategies-for-machine-translation","title":"Inference Strategies for Machine Translation with Conditional Masking","date":"2020-10-05","arxiv_id":"2010.02352","repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistic-profiling-of-a-neural-language","title":"Linguistic Profiling of a Neural Language Model","date":"2020-10-05","arxiv_id":"2010.01869","repositories_listed":0,"syntology":null},{"url":null,"slug":"nlp-service-apis-and-models-for-efficient","title":"NLP Service APIs and Models for Efficient Registration of New Clients","date":"2020-10-04","arxiv_id":"2010.01526","repositories_listed":0,"syntology":null},{"url":null,"slug":"personality-trait-detection-using-bagged-svm","title":"Personality Trait Detection Using Bagged SVM over BERT Word Embedding Ensembles","date":"2020-10-03","arxiv_id":"2010.01309","repositories_listed":0,"syntology":null},{"url":null,"slug":"jaket-joint-pre-training-of-knowledge-graph","title":"JAKET: Joint Pre-training of Knowledge Graph and Language Understanding","date":"2020-10-02","arxiv_id":"2010.00796","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparterm-learning-term-based-sparse","title":"SparTerm: Learning Term-based Sparse Representation for Fast Text Retrieval","date":"2020-10-02","arxiv_id":"2010.00768","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-representation-in-word-embeddings-and","title":"Syntax Representation in Word Embeddings and Neural Networks -- A Survey","date":"2020-10-02","arxiv_id":"2010.01063","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-joint-framework-for-multiple-chinese","title":"A Novel Joint Framework for Multiple Chinese Events Extraction","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"chinese-long-and-short-form-choice-exploiting","title":"Chinese Long and Short Form Choice Exploiting Neural Network Language Modeling Approaches","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-relative-position-representation-based","title":"Entity Relative Position Representation based Multi-head Selection for Joint Entity and Relation Extraction","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-lstm-encodes-syntax-exploring-context","title":"How LSTM Encodes Syntax: Exploring Context Vectors and Semi-Quantization on Natural Text","date":"2020-10-01","arxiv_id":"2010.00363","repositories_listed":0,"syntology":null},{"url":"/paper/how-to-motivate-your-dragon-teaching-goal","slug":"how-to-motivate-your-dragon-teaching-goal","title":"How to Motivate Your Dragon: Teaching Goal-Driven Agents to Speak and Act in Fantasy Worlds","date":"2020-10-01","arxiv_id":"2010.00685","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-text-classification-via-cross","title":"Low-Resource Text Classification via Cross-lingual Language Model Fine-tuning","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-reward-based-reinforcement-learning-for","title":"Multi-Reward based Reinforcement Learning for Neural Machine Translation","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-melody-segmentation-based-on-a","title":"Unsupervised Melody Segmentation Based on a Nested Pitman-Yor Language Model","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"wae-rn-integrating-wasserstein-autoencoder","title":"WAE_RN: Integrating Wasserstein Autoencoder and Relational Network for Text Sequence","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"test-positive-at-w-nut-2020-shared-task-3","title":"TEST_POSITIVE at W-NUT 2020 Shared Task-3: Joint Event Multi-task Learning for Slot Filling in Noisy Text","date":"2020-09-29","arxiv_id":"2009.14262","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-design-and-implementation-of-language","title":"The design and implementation of Language Learning Chatbot with XAI using Ontology and Transfer Learning","date":"2020-09-29","arxiv_id":"2009.13984","repositories_listed":0,"syntology":null},{"url":null,"slug":"veco-variable-encoder-decoder-pre-training","title":"VECO: Variable Encoder-decoder Pre-training for Cross-lingual Understanding and Generation","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-timescale-representation-learning-in","title":"Multi-timescale Representation Learning in LSTM Language Models","date":"2020-09-27","arxiv_id":"2009.12727","repositories_listed":0,"syntology":null},{"url":null,"slug":"inductive-graph-embeddings-through-locality","title":"Inductive Graph Embeddings through Locality Encodings","date":"2020-09-26","arxiv_id":"2009.12585","repositories_listed":0,"syntology":null},{"url":null,"slug":"recobert-a-catalog-language-model-for-text","title":"RecoBERT: A Catalog Language Model for Text-Based Recommendations","date":"2020-09-25","arxiv_id":"2009.13292","repositories_listed":0,"syntology":null},{"url":null,"slug":"wessa-at-semeval-2020-task-9-code-mixed","title":"WESSA at SemEval-2020 Task 9: Code-Mixed Sentiment Analysis using Transformers","date":"2020-09-21","arxiv_id":"2009.09879","repositories_listed":0,"syntology":null},{"url":null,"slug":"bioalbert-a-simple-and-effective-pre-trained","title":"BioALBERT: A Simple and Effective Pre-trained Language Model for Biomedical Named Entity Recognition","date":"2020-09-19","arxiv_id":"2009.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-gpt-with-congruent-transformers","title":"Hierarchical GPT with Congruent Transformers for Multi-Sentence Language Models","date":"2020-09-18","arxiv_id":"2009.08636","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-language-grounded-policy-in-vision","title":"Generative Language-Grounded Policy in Vision-and-Language Navigation with Bayes' Rule","date":"2020-09-16","arxiv_id":"2009.07783","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrofitting-structure-aware-transformer","title":"Retrofitting Structure-aware Transformer Language Model for End Tasks","date":"2020-09-16","arxiv_id":"2009.07408","repositories_listed":0,"syntology":null},{"url":"/paper/denert-kg-named-entity-and-relation","slug":"denert-kg-named-entity-and-relation","title":"DeNERT-KG: Named Entity and Relation Extraction Model Using DQN, Knowledge Graph, and BERT","date":"2020-09-15","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/mlmlm-link-prediction-with-mean-likelihood","slug":"mlmlm-link-prediction-with-mean-likelihood","title":"MLMLM: Link Prediction with Mean Likelihood Masked Language Model","date":"2020-09-15","arxiv_id":"2009.07058","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-language-models","title":"Differentially Private Language Models Benefit from Public Pre-training","date":"2020-09-13","arxiv_id":"2009.05886","repositories_listed":0,"syntology":null},{"url":null,"slug":"radlex-normalization-in-radiology-reports","title":"RadLex Normalization in Radiology Reports","date":"2020-09-10","arxiv_id":"2009.05128","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-study-of-language-models-on-cross","title":"Comparative Study of Language Models on Cross-Domain Data with Model Agnostic Explainability","date":"2020-09-09","arxiv_id":"2009.04095","repositories_listed":0,"syntology":null},{"url":null,"slug":"brown-university-at-trec-deep-learning-2019","title":"Brown University at TREC Deep Learning 2019","date":"2020-09-08","arxiv_id":"2009.04016","repositories_listed":0,"syntology":null},{"url":null,"slug":"ernie-at-semeval-2020-task-10-learning-word","title":"ERNIE at SemEval-2020 Task 10: Learning Word Emphasis Selection by Pre-trained Language Model","date":"2020-09-08","arxiv_id":"2009.03706","repositories_listed":0,"syntology":null},{"url":null,"slug":"kk2018-at-semeval-2020-task-9-adversarial","title":"kk2018 at SemEval-2020 Task 9: Adversarial Training for Code-Mixing Sentiment Classification","date":"2020-09-08","arxiv_id":"2009.03673","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-predictions-of-people-perusing","title":"Probabilistic Predictions of People Perusing: Evaluating Metrics of Language Model Performance for Psycholinguistic Modeling","date":"2020-09-08","arxiv_id":"2009.03954","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-bert-a-phrase-and-product-knowledge","title":"E-BERT: A Phrase and Product Knowledge Enhanced Language Model for E-commerce","date":"2020-09-07","arxiv_id":"2009.02835","repositories_listed":0,"syntology":null},{"url":"/paper/generative-language-modeling-for-automated","slug":"generative-language-modeling-for-automated","title":"Generative Language Modeling for Automated Theorem Proving","date":"2020-09-07","arxiv_id":"2009.03393","repositories_listed":0,"syntology":null},{"url":null,"slug":"qiaoning-at-semeval-2020-task-4-commonsense","title":"QiaoNing at SemEval-2020 Task 4: Commonsense Validation and Explanation system based on ensemble of language model","date":"2020-09-06","arxiv_id":"2009.02645","repositories_listed":0,"syntology":null},{"url":null,"slug":"bio-inspired-structure-identification-in","title":"Bio-inspired Structure Identification in Language Embeddings","date":"2020-09-05","arxiv_id":"2009.02459","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-flows-analyzing-and-comparing","title":"Attention Flows: Analyzing and Comparing Attention Mechanisms in Language Models","date":"2020-09-03","arxiv_id":"2009.07053","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-exploratory-study-of-l1-specific-non-words","title":"An exploratory study of L1-specific non-words","date":"2020-09-02","arxiv_id":"2009.01134","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-contextualized-language-modeling-1","title":"A Study on Contextualized Language Modeling for FAQ Retrieval","date":"2020-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-disparate-language-model","title":"Exploring Disparate Language Model Combination Strategies for Mandarin-English Code-Switching ASR","date":"2020-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ambert-a-pre-trained-language-model-with","title":"AMBERT: A Pre-trained Language Model with Multi-Grained Tokenization","date":"2020-08-27","arxiv_id":"2008.11869","repositories_listed":0,"syntology":null},{"url":"/paper/entity-and-evidence-guided-relation","slug":"entity-and-evidence-guided-relation","title":"Entity and Evidence Guided Relation Extraction for DocRED","date":"2020-08-27","arxiv_id":"2008.12283","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-models-as-emotional-classifiers-for","title":"Language Models as Emotional Classifiers for Textual Conversations","date":"2020-08-27","arxiv_id":"2008.12360","repositories_listed":0,"syntology":null},{"url":null,"slug":"conceptualized-representation-learning-for","title":"Conceptualized Representation Learning for Chinese Biomedical Text Mining","date":"2020-08-25","arxiv_id":"2008.10813","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-language-model-with-entanglement","title":"Quantum Language Model with Entanglement Embedding for Question Answering","date":"2020-08-23","arxiv_id":"2008.09943","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-event-extractors-to-medical-data","title":"Adapting Event Extractors to Medical Data: Bridging the Covariate Shift","date":"2020-08-21","arxiv_id":"2008.09266","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-useful-sentence-representations","title":"Discovering Useful Sentence Representations from Large Pretrained Language Models","date":"2020-08-20","arxiv_id":"2008.09049","repositories_listed":0,"syntology":null}],"record_sha256":"1f24e7318d8faa061a18d0122e75f68ef6fe988fa00efbd1132fe0a067104891","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}