{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modelling/papers/153","list_of":"/task/language-modelling","task":"Language Modelling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":153,"pages_in_order":177,"rows_per_page":100,"rows":[15201,15300],"of":17610,"counts":{"archive_papers_tagged":17610,"with_a_code_link":7012,"where_syntology_ran_a_sample":2428,"not_listed_spam_title":0,"listed":17610,"listed_where_code_ran":2428,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":2027,"every_run_a_failure_of_syntologys_instrument":401,"listed_with_a_run_with_no_instrument_failure":2027,"listed_every_run_a_failure_of_syntologys_instrument":401,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modelling","prev":"/task/language-modelling/papers/152","next":"/task/language-modelling/papers/154","papers":[{"url":null,"slug":"individual-corpora-predict-fast-memory","title":"Individual corpora predict fast memory retrieval during reading","date":"2020-10-20","arxiv_id":"2010.10176","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-chats-for-task-oriented-dialog","title":"Simulated Chats for Building Dialog Systems: Learning to Generate Conversations from Instructions","date":"2020-10-20","arxiv_id":"2010.10216","repositories_listed":0,"syntology":null},{"url":null,"slug":"adabelief-optimizer-adapting-stepsizes-by","title":"AdaBelief Optimizer: Adapting Stepsizes by theBelief in Observed Gradients","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"better-distractions-transformer-based","title":"Better Distractions: Transformer-based Distractor Generation and Multiple Choice Question Filtering","date":"2020-10-19","arxiv_id":"2010.09598","repositories_listed":0,"syntology":null},{"url":null,"slug":"m2d-a-multi-modal-framework-for-automatic","title":"M2D: A Multi-modal Framework for Automatic Medical Diagnosis","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scisummpip-an-unsupervised-scientific-paper","title":"SciSummPip: An Unsupervised Scientific Paper Summarization Pipeline","date":"2020-10-19","arxiv_id":"2010.09190","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automatic-online-hate-speech","title":"Towards Automatic Online Hate Speech Intervention Generation using Pretrained Language Model","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-pretraining-for-neural-machine-1","title":"Unsupervised Pretraining for Neural Machine Translation Using Elastic Weight Consolidation","date":"2020-10-19","arxiv_id":"2010.09403","repositories_listed":0,"syntology":null},{"url":null,"slug":"quesbelm-a-bert-based-ensemble-language-model","title":"QuesBELM: A BERT based Ensemble Language Model for Natural Questions","date":"2020-10-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automatic-sentiment-based-topic","title":"Towards Automatic Sentiment-based Topic Phrase Generation","date":"2020-10-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"consistency-and-coherency-enhanced-story","title":"Consistency and Coherency Enhanced Story Generation","date":"2020-10-17","arxiv_id":"2010.08822","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-multitask-learning-approach-for","title":"Hierarchical Multitask Learning Approach for BERT","date":"2020-10-17","arxiv_id":"2011.04451","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-answering-over-knowledge-base-using-1","title":"Question Answering over Knowledge Base using Language Model Embeddings","date":"2020-10-17","arxiv_id":"2010.08883","repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-esg-topics-using-domain-specific","title":"Detecting ESG topics using domain-specific language models and data augmentation approaches","date":"2020-10-16","arxiv_id":"2010.08319","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-adversarial-qa-did-the-model-understand","title":"Human Adversarial QA: Did the Model Understand the Paragraph?","date":"2020-10-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transformer-based-pitch-sequence","title":"A Transformer Based Pitch Sequence Autoencoder with MIDI Augmentation","date":"2020-10-15","arxiv_id":"2010.07758","repositories_listed":0,"syntology":null},{"url":null,"slug":"grammatical-error-correction-in-low-error","title":"Grammatical Error Correction in Low Error Density Domains: A New Benchmark and Analyses","date":"2020-10-15","arxiv_id":"2010.07574","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-language-to-language-ish-how-brain-like","title":"From Language to Language-ish: How Brain-Like is an LSTM's Representation of Nonsensical Language Stimuli?","date":"2020-10-14","arxiv_id":"2010.07435","repositories_listed":0,"syntology":null},{"url":null,"slug":"memformer-the-memory-augmented-transformer-1","title":"Memformer: A Memory-Augmented Transformer for Sequence Modeling","date":"2020-10-14","arxiv_id":"2010.06891","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-relation-extraction-from","title":"Unsupervised Relation Extraction from Language Models using Constrained Cloze Completion","date":"2020-10-14","arxiv_id":"2010.06804","repositories_listed":0,"syntology":null},{"url":null,"slug":"corruption-is-not-all-bad-incorporating","title":"Corruption Is Not All Bad: Incorporating Discourse Structure into Pre-training via Corruption for Essay Scoring","date":"2020-10-13","arxiv_id":"2010.06137","repositories_listed":0,"syntology":null},{"url":null,"slug":"extracting-angina-symptoms-from-clinical","title":"Extracting Angina Symptoms from Clinical Notes Using Pre-Trained Transformer Architectures","date":"2020-10-12","arxiv_id":"2010.05757","repositories_listed":0,"syntology":null},{"url":"/paper/improving-self-supervised-pre-training-via-a-1","slug":"improving-self-supervised-pre-training-via-a-1","title":"Improving Self-supervised Pre-training via a Fully-Explored Masked Language Model","date":"2020-10-12","arxiv_id":"2010.06040","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-stage-pre-training-for-low-resource","title":"Multi-Stage Pre-training for Low-Resource Domain Adaptation","date":"2020-10-12","arxiv_id":"2010.05904","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-trained-language-model-based-active","title":"Pre-trained Language Model Based Active Learning for Sentence Matching","date":"2020-10-12","arxiv_id":"2010.05522","repositories_listed":0,"syntology":null},{"url":null,"slug":"plan-ahead-self-supervised-text-planning-for","title":"Plan ahead: Self-Supervised Text Planning for Paragraph Completion Task","date":"2020-10-11","arxiv_id":"2010.05141","repositories_listed":0,"syntology":null},{"url":null,"slug":"sjtu-nict-s-supervised-and-unsupervised","title":"SJTU-NICT's Supervised and Unsupervised Neural Machine Translation Systems for the WMT20 News Translation Task","date":"2020-10-11","arxiv_id":"2010.05122","repositories_listed":0,"syntology":null},{"url":null,"slug":"multichannel-generative-language-model","title":"Multichannel Generative Language Model: Learning All Possible Factorizations Within and Across Channels","date":"2020-10-09","arxiv_id":"2010.04438","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-historical-dictionary-codes-with-a","title":"Solving Historical Dictionary Codes with a Neural Language Model","date":"2020-10-09","arxiv_id":"2010.04746","repositories_listed":0,"syntology":null},{"url":null,"slug":"style-attuned-pre-training-and-parameter","title":"Style Attuned Pre-training and Parameter Efficient Fine-tuning for Spoken Language Understanding","date":"2020-10-09","arxiv_id":"2010.04355","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-the-effectiveness-of-efficient","title":"Evaluating the Effectiveness of Efficient Neural Architecture Search for Sentence-Pair Tasks","date":"2020-10-08","arxiv_id":"2010.04249","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-product-key-memory-for-pretrained","title":"Large Product Key Memory for Pretrained Language Models","date":"2020-10-08","arxiv_id":"2010.03881","repositories_listed":0,"syntology":null},{"url":null,"slug":"masked-elmo-an-evolution-of-elmo-towards","title":"Masked ELMo: An evolution of ELMo towards fully contextual RNN language models","date":"2020-10-08","arxiv_id":"2010.04302","repositories_listed":0,"syntology":null},{"url":"/paper/on-the-importance-of-pre-training-data-volume","slug":"on-the-importance-of-pre-training-data-volume","title":"On the importance of pre-training data volume for compact language models","date":"2020-10-08","arxiv_id":"2010.03813","repositories_listed":0,"syntology":null},{"url":null,"slug":"tatum-level-drum-transcription-based-on-a","title":"Tatum-Level Drum Transcription Based on a Convolutional Recurrent Neural Network with Language Model-Based Regularized Training","date":"2020-10-08","arxiv_id":"2010.03749","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-mathematical-exploration-of-why-language-1","title":"A Mathematical Exploration of Why Language Models Help Solve Downstream Tasks","date":"2020-10-07","arxiv_id":"2010.03648","repositories_listed":0,"syntology":null},{"url":"/paper/i-d-rather-just-go-to-bed-understanding","slug":"i-d-rather-just-go-to-bed-understanding","title":"\"I'd rather just go to bed\": Understanding Indirect Answers","date":"2020-10-07","arxiv_id":"2010.03450","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-cls-through-ranking-by-generation","title":"Beyond [CLS] through Ranking by Generation","date":"2020-10-06","arxiv_id":"2010.03073","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-represent-image-and-text-with","title":"Learning to Represent Image and Text with Denotation Graph","date":"2020-10-06","arxiv_id":"2010.02949","repositories_listed":0,"syntology":null},{"url":null,"slug":"rank-and-run-time-aware-compression-of-nlp","title":"Rank and run-time aware compression of NLP Applications","date":"2020-10-06","arxiv_id":"2010.03193","repositories_listed":0,"syntology":null},{"url":null,"slug":"acrostic-poem-generation","title":"Acrostic Poem Generation","date":"2020-10-05","arxiv_id":"2010.02239","repositories_listed":0,"syntology":null},{"url":null,"slug":"inference-strategies-for-machine-translation","title":"Inference Strategies for Machine Translation with Conditional Masking","date":"2020-10-05","arxiv_id":"2010.02352","repositories_listed":0,"syntology":null},{"url":null,"slug":"linguistic-profiling-of-a-neural-language","title":"Linguistic Profiling of a Neural Language Model","date":"2020-10-05","arxiv_id":"2010.01869","repositories_listed":0,"syntology":null},{"url":null,"slug":"nlp-service-apis-and-models-for-efficient","title":"NLP Service APIs and Models for Efficient Registration of New Clients","date":"2020-10-04","arxiv_id":"2010.01526","repositories_listed":0,"syntology":null},{"url":null,"slug":"personality-trait-detection-using-bagged-svm","title":"Personality Trait Detection Using Bagged SVM over BERT Word Embedding Ensembles","date":"2020-10-03","arxiv_id":"2010.01309","repositories_listed":0,"syntology":null},{"url":null,"slug":"jaket-joint-pre-training-of-knowledge-graph","title":"JAKET: Joint Pre-training of Knowledge Graph and Language Understanding","date":"2020-10-02","arxiv_id":"2010.00796","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparterm-learning-term-based-sparse","title":"SparTerm: Learning Term-based Sparse Representation for Fast Text Retrieval","date":"2020-10-02","arxiv_id":"2010.00768","repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-representation-in-word-embeddings-and","title":"Syntax Representation in Word Embeddings and Neural Networks -- A Survey","date":"2020-10-02","arxiv_id":"2010.01063","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-joint-framework-for-multiple-chinese","title":"A Novel Joint Framework for Multiple Chinese Events Extraction","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"chinese-long-and-short-form-choice-exploiting","title":"Chinese Long and Short Form Choice Exploiting Neural Network Language Modeling Approaches","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"detecting-white-supremacist-hate-speech-using","title":"Detecting White Supremacist Hate Speech using Domain Specific Word Embedding with Deep Learning and BERT","date":"2020-10-01","arxiv_id":"2010.00357","repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-relative-position-representation-based","title":"Entity Relative Position Representation based Multi-head Selection for Joint Entity and Relation Extraction","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-lstm-encodes-syntax-exploring-context","title":"How LSTM Encodes Syntax: Exploring Context Vectors and Semi-Quantization on Natural Text","date":"2020-10-01","arxiv_id":"2010.00363","repositories_listed":0,"syntology":null},{"url":"/paper/how-to-motivate-your-dragon-teaching-goal","slug":"how-to-motivate-your-dragon-teaching-goal","title":"How to Motivate Your Dragon: Teaching Goal-Driven Agents to Speak and Act in Fantasy Worlds","date":"2020-10-01","arxiv_id":"2010.00685","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-resource-text-classification-via-cross","title":"Low-Resource Text Classification via Cross-lingual Language Model Fine-tuning","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-reward-based-reinforcement-learning-for","title":"Multi-Reward based Reinforcement Learning for Neural Machine Translation","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-melody-segmentation-based-on-a","title":"Unsupervised Melody Segmentation Based on a Nested Pitman-Yor Language Model","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"wae-rn-integrating-wasserstein-autoencoder","title":"WAE_RN: Integrating Wasserstein Autoencoder and Relational Network for Text Sequence","date":"2020-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"test-positive-at-w-nut-2020-shared-task-3","title":"TEST_POSITIVE at W-NUT 2020 Shared Task-3: Joint Event Multi-task Learning for Slot Filling in Noisy Text","date":"2020-09-29","arxiv_id":"2009.14262","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-design-and-implementation-of-language","title":"The design and implementation of Language Learning Chatbot with XAI using Ontology and Transfer Learning","date":"2020-09-29","arxiv_id":"2009.13984","repositories_listed":0,"syntology":null},{"url":null,"slug":"distillation-of-weighted-automata-from","title":"Distillation of Weighted Automata from Recurrent Neural Networks using a Spectral Approach","date":"2020-09-28","arxiv_id":"2009.13101","repositories_listed":0,"syntology":null},{"url":null,"slug":"pin-a-novel-parallel-interactive-network-for","title":"PIN: A Novel Parallel Interactive Network for Spoken Language Understanding","date":"2020-09-28","arxiv_id":"2009.13431","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantal-synaptic-dilution-enhances-sparse","title":"Quantal synaptic dilution enhances sparse encoding and dropout regularisation in deep networks","date":"2020-09-28","arxiv_id":"2009.13165","repositories_listed":0,"syntology":null},{"url":null,"slug":"veco-variable-encoder-decoder-pre-training","title":"VECO: Variable Encoder-decoder Pre-training for Cross-lingual Understanding and Generation","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-timescale-representation-learning-in","title":"Multi-timescale Representation Learning in LSTM Language Models","date":"2020-09-27","arxiv_id":"2009.12727","repositories_listed":0,"syntology":null},{"url":null,"slug":"inductive-graph-embeddings-through-locality","title":"Inductive Graph Embeddings through Locality Encodings","date":"2020-09-26","arxiv_id":"2009.12585","repositories_listed":0,"syntology":null},{"url":null,"slug":"recobert-a-catalog-language-model-for-text","title":"RecoBERT: A Catalog Language Model for Text-Based Recommendations","date":"2020-09-25","arxiv_id":"2009.13292","repositories_listed":0,"syntology":null},{"url":null,"slug":"wessa-at-semeval-2020-task-9-code-mixed","title":"WESSA at SemEval-2020 Task 9: Code-Mixed Sentiment Analysis using Transformers","date":"2020-09-21","arxiv_id":"2009.09879","repositories_listed":0,"syntology":null},{"url":null,"slug":"bioalbert-a-simple-and-effective-pre-trained","title":"BioALBERT: A Simple and Effective Pre-trained Language Model for Biomedical Named Entity Recognition","date":"2020-09-19","arxiv_id":"2009.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-gpt-with-congruent-transformers","title":"Hierarchical GPT with Congruent Transformers for Multi-Sentence Language Models","date":"2020-09-18","arxiv_id":"2009.08636","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-fully-8-bit-integer-inference-for-the","title":"Towards Fully 8-bit Integer Inference for the Transformer Model","date":"2020-09-17","arxiv_id":"2009.08034","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-language-grounded-policy-in-vision","title":"Generative Language-Grounded Policy in Vision-and-Language Navigation with Bayes' Rule","date":"2020-09-16","arxiv_id":"2009.07783","repositories_listed":0,"syntology":null},{"url":null,"slug":"retrofitting-structure-aware-transformer","title":"Retrofitting Structure-aware Transformer Language Model for End Tasks","date":"2020-09-16","arxiv_id":"2009.07408","repositories_listed":0,"syntology":null},{"url":null,"slug":"cascaded-semantic-and-positional-self","title":"Cascaded Semantic and Positional Self-Attention Network for Document Classification","date":"2020-09-15","arxiv_id":"2009.07148","repositories_listed":0,"syntology":null},{"url":"/paper/denert-kg-named-entity-and-relation","slug":"denert-kg-named-entity-and-relation","title":"DeNERT-KG: Named Entity and Relation Extraction Model Using DQN, Knowledge Graph, and BERT","date":"2020-09-15","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/mlmlm-link-prediction-with-mean-likelihood","slug":"mlmlm-link-prediction-with-mean-likelihood","title":"MLMLM: Link Prediction with Mean Likelihood Masked Language Model","date":"2020-09-15","arxiv_id":"2009.07058","repositories_listed":0,"syntology":null},{"url":"/paper/cluster-former-clustering-based-sparse","slug":"cluster-former-clustering-based-sparse","title":"Cluster-Former: Clustering-based Sparse Transformer for Long-Range Dependency Encoding","date":"2020-09-13","arxiv_id":"2009.06097","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-language-models","title":"Differentially Private Language Models Benefit from Public Pre-training","date":"2020-09-13","arxiv_id":"2009.05886","repositories_listed":0,"syntology":null},{"url":null,"slug":"radlex-normalization-in-radiology-reports","title":"RadLex Normalization in Radiology Reports","date":"2020-09-10","arxiv_id":"2009.05128","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-study-of-language-models-on-cross","title":"Comparative Study of Language Models on Cross-Domain Data with Model Agnostic Explainability","date":"2020-09-09","arxiv_id":"2009.04095","repositories_listed":0,"syntology":null},{"url":null,"slug":"brown-university-at-trec-deep-learning-2019","title":"Brown University at TREC Deep Learning 2019","date":"2020-09-08","arxiv_id":"2009.04016","repositories_listed":0,"syntology":null},{"url":null,"slug":"ernie-at-semeval-2020-task-10-learning-word","title":"ERNIE at SemEval-2020 Task 10: Learning Word Emphasis Selection by Pre-trained Language Model","date":"2020-09-08","arxiv_id":"2009.03706","repositories_listed":0,"syntology":null},{"url":null,"slug":"kk2018-at-semeval-2020-task-9-adversarial","title":"kk2018 at SemEval-2020 Task 9: Adversarial Training for Code-Mixing Sentiment Classification","date":"2020-09-08","arxiv_id":"2009.03673","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-predictions-of-people-perusing","title":"Probabilistic Predictions of People Perusing: Evaluating Metrics of Language Model Performance for Psycholinguistic Modeling","date":"2020-09-08","arxiv_id":"2009.03954","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-bert-a-phrase-and-product-knowledge","title":"E-BERT: A Phrase and Product Knowledge Enhanced Language Model for E-commerce","date":"2020-09-07","arxiv_id":"2009.02835","repositories_listed":0,"syntology":null},{"url":"/paper/generative-language-modeling-for-automated","slug":"generative-language-modeling-for-automated","title":"Generative Language Modeling for Automated Theorem Proving","date":"2020-09-07","arxiv_id":"2009.03393","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-framework-for-learning-code","title":"Self-Supervised Contrastive Learning for Code Retrieval and Summarization via Semantic-Preserving Transformations","date":"2020-09-06","arxiv_id":"2009.02731","repositories_listed":0,"syntology":null},{"url":null,"slug":"qiaoning-at-semeval-2020-task-4-commonsense","title":"QiaoNing at SemEval-2020 Task 4: Commonsense Validation and Explanation system based on ensemble of language model","date":"2020-09-06","arxiv_id":"2009.02645","repositories_listed":0,"syntology":null},{"url":null,"slug":"bio-inspired-structure-identification-in","title":"Bio-inspired Structure Identification in Language Embeddings","date":"2020-09-05","arxiv_id":"2009.02459","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-flows-analyzing-and-comparing","title":"Attention Flows: Analyzing and Comparing Attention Mechanisms in Language Models","date":"2020-09-03","arxiv_id":"2009.07053","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-meta-networks-for-sequential","title":"Sparse Meta Networks for Sequential Adaptation and its Application to Adaptive Language Modelling","date":"2020-09-03","arxiv_id":"2009.01803","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-exploratory-study-of-l1-specific-non-words","title":"An exploratory study of L1-specific non-words","date":"2020-09-02","arxiv_id":"2009.01134","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-contextualized-language-modeling-1","title":"A Study on Contextualized Language Modeling for FAQ Retrieval","date":"2020-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-disparate-language-model","title":"Exploring Disparate Language Model Combination Strategies for Mandarin-English Code-Switching ASR","date":"2020-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-efficient-deep-learning-for-natural","title":"Knowledge Efficient Deep Learning for Natural Language Processing","date":"2020-08-28","arxiv_id":"2008.12878","repositories_listed":0,"syntology":null},{"url":null,"slug":"ambert-a-pre-trained-language-model-with","title":"AMBERT: A Pre-trained Language Model with Multi-Grained Tokenization","date":"2020-08-27","arxiv_id":"2008.11869","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-speech-summarisation-a-scoping","title":"Automatic Speech Summarisation: A Scoping Review","date":"2020-08-27","arxiv_id":"2008.11897","repositories_listed":0,"syntology":null},{"url":"/paper/entity-and-evidence-guided-relation","slug":"entity-and-evidence-guided-relation","title":"Entity and Evidence Guided Relation Extraction for DocRED","date":"2020-08-27","arxiv_id":"2008.12283","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-models-as-emotional-classifiers-for","title":"Language Models as Emotional Classifiers for Textual Conversations","date":"2020-08-27","arxiv_id":"2008.12360","repositories_listed":0,"syntology":null},{"url":null,"slug":"conceptualized-representation-learning-for","title":"Conceptualized Representation Learning for Chinese Biomedical Text Mining","date":"2020-08-25","arxiv_id":"2008.10813","repositories_listed":0,"syntology":null}],"record_sha256":"4c80a0feca7394b3fa7b0ac7430f74f521299b374bee91a45829867579351a8d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}