{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/language-modeling/papers/142","list_of":"/task/language-modeling","task":"Language Modeling","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":142,"pages_in_order":142,"rows_per_page":100,"rows":[14101,14182],"of":14182,"counts":{"archive_papers_tagged":14182,"with_a_code_link":5620,"where_syntology_ran_a_sample":1894,"not_listed_spam_title":0,"listed":14182,"listed_where_code_ran":1894,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1580,"every_run_a_failure_of_syntologys_instrument":314,"listed_with_a_run_with_no_instrument_failure":1580,"listed_every_run_a_failure_of_syntologys_instrument":314,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/language-modeling","prev":"/task/language-modeling/papers/141","next":null,"papers":[{"url":null,"slug":"automatic-language-identity-tagging-on-word","title":"Automatic language identity tagging on word and sentence-level in multilingual text sources: a case-study on Luxembourgish","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/cawac-a-web-corpus-of-catalan-and-its","slug":"cawac-a-web-corpus-of-catalan-and-its","title":"caWaC -- A web corpus of Catalan and its application to language modeling and machine translation","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"development-of-a-tv-broadcasts-speech","title":"Development of a TV Broadcasts Speech Recognition System for Qatari Arabic","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-the-ted-lium-corpus-with-selected","title":"Enhancing the TED-LIUM Corpus with Selected Data for Language Modeling and More TED Talks","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"focusing-annotation-for-semantic-role","title":"Focusing Annotation for Semantic Role Labeling","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improvements-to-dependency-parsing-using","title":"Improvements to Dependency Parsing Using Automatic Simplification of Data","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mygoal-finding-motivations-on-twitter","title":"\\#mygoal: Finding Motivations on Twitter","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"n-gram-counts-and-language-models-from-the","title":"N-gram Counts and Language Models from the Common Crawl","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pagination-its-what-you-say-not-how-long-it","title":"Pagination: It's what you say, not how long it takes to say it","date":"2014-04-11","arxiv_id":"1404.3233","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-entropy-estimates-for-dag-based","title":"Using Entropy Estimates for DAG-Based Ontologies","date":"2014-03-19","arxiv_id":"1403.4887","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-predict-from-textual-data","title":"Learning to Predict from Textual Data","date":"2014-02-04","arxiv_id":"1402.0574","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-wikipedia-based-cross-language","title":"Assessing Wikipedia-Based Cross-Language Retrieval Models","date":"2014-01-10","arxiv_id":"1401.2258","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-language-models-for-streaming-text","title":"Dynamic Language Models for Streaming Text","date":"2014-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-modeling-with-power-low-rank","title":"Language Modeling with Power Low Rank Ensembles","date":"2013-12-26","arxiv_id":"1312.7077","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-construct-deep-recurrent-neural","title":"How to Construct Deep Recurrent Neural Networks","date":"2013-12-20","arxiv_id":"1312.6026","repositories_listed":0,"syntology":null},{"url":null,"slug":"regular-patterns-probably-approximately","title":"Regular Patterns - Probably Approximately Correct Language Model","date":"2013-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hybrid-chinese-spelling-correction-using","title":"A Hybrid Chinese Spelling Correction Using Language Model and Statistical Machine Translation with Reranking","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-language-modeling-for-chinese","title":"A Study of Language Modeling for Chinese Spelling Check","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-topic-triggered-language-model-for","title":"A Topic-Triggered Language Model for Statistical Machine Translation","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-language-model-using-double","title":"An Efficient Language Model Using Double-Array Structures","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-unsupervised-parameter-estimation","title":"An Unsupervised Parameter Estimation Algorithm for a Generative Dependency N-gram Language Model","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"conditional-random-field-based-parser-and","title":"Conditional Random Field-based Parser and Language Model for Tradi-tional Chinese Spelling Checker","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-based-neural-language-model-and","title":"Feature-based Neural Language Model and Chinese Word Segmentation","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-vs-positions-utilizing-balanced","title":"Semantic v.s. Positions: Utilizing Balanced Proximity in Language Model Smoothing for Information Retrieval","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicate-logic-as-a-modeling-language","title":"Predicate Logic as a Modeling Language: Modeling and Solving some Machine Learning and Data Mining Problems with IDP3","date":"2013-09-26","arxiv_id":"1309.6883","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-language-model-adaptation-using","title":"Improving Language Model Adaptation using Automatic Data Selection and Neural Network","date":"2013-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"accurate-word-segmentation-using","title":"Accurate Word Segmentation using Transliteration and Language Model Projection","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"building-bilingual-lexicon-to-create-dialect","title":"Building bilingual lexicon to create Dialect Tunisian corpora and adapt language model","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combination-of-recurrent-neural-networks-and","title":"Combination of Recurrent Neural Networks and Factored Language Models for Code-Switching Language Modeling","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-selection-of-language-model-training","title":"Hybrid Selection of Language Model Training Data Using Linguistic Information and Perplexity","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-text-simplification-language","title":"Improving Text Simplification Language Modeling Using Unsimplified Text Data","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-of-term-distance-and-term-occurrence","title":"Modeling of term-distance and term-occurrence information for improving n-gram language model performance","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-modified-kneser-ney-language-model","title":"Scalable Modified Kneser-Ney Language Model Estimation","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"smoothed-marginal-distribution-constraints","title":"Smoothed marginal distribution constraints for language modeling","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"polyglot-distributed-word-representations-for","title":"Polyglot: Distributed Word Representations for Multilingual NLP","date":"2013-07-05","arxiv_id":"1307.1662","repositories_listed":0,"syntology":null},{"url":null,"slug":"arabizi-detection-and-conversion-to-arabic","title":"Arabizi Detection and Conversion to Arabic","date":"2013-06-28","arxiv_id":"1306.6755","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-unsupervised-language-model","title":"Evaluating Unsupervised Language Model Adaptation Methods for Speaking Assessment","date":"2013-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"grouping-language-model-boundary-words-to","title":"Grouping Language Model Boundary Words to Speed K--Best Extraction from Hypergraphs","date":"2013-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-discriminative-language","title":"Semi-Supervised Discriminative Language Modeling with Out-of-Domain Text Data","date":"2013-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sfs-tue-compound-paraphrasing-with-a-language","title":"SFS-TUE: Compound Paraphrasing with a Language Model and Discriminative Reranking","date":"2013-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-a-supertagged-dependency-language-model","title":"Using a Supertagged Dependency Language Model to Select a Good Translation in System Combination","date":"2013-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-semantic-representations-in-a-bigram","title":"Learning Semantic Representations in a Bigram Language Model","date":"2013-03-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-space-neural-probabilistic-language","title":"Joint Space Neural Probabilistic Language Model for Statistical Machine Translation","date":"2013-01-16","arxiv_id":"1301.3614","repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-tree-substitution-grammar-for","title":"Incremental Tree Substitution Grammar for Parsing and Sentence Prediction","date":"2013-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-language-modeling-approach-to-identifying","title":"A Language Modeling Approach to Identifying Code-Switched Sentences and Words","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"code-switch-language-model-with-inversion","title":"Code-Switch Language Model with Inversion Constraints for Mixed Language Speech Recognition","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"factored-language-model-based-on-recurrent","title":"Factored Language Model based on Recurrent Neural Network","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-modeling-for-spoken-dialogue-system","title":"Language Modeling for Spoken Dialogue System based on Filtering using Predicate-Argument Structures","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-probabilistic-language-model-for","title":"Neural Probabilistic Language Model for System Combination","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"introduction-of-a-probabilistic-language","title":"Introduction of a Probabilistic Language Model to Non-Factoid Question Answering Using Example Q\\&A Pairs","date":"2012-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-neural-network-based-language","title":"遞迴式類神經網路語言模型應用額外資訊於語音辨識之研究 (Recurrent Neural Network-based Language Modeling with Extra Information Cues for Speech Recognition) [In Chinese]","date":"2012-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-language-modeling-with","title":"Cross-Lingual Language Modeling with Syntactic Reordering for Low-Resource Speech Recognition","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-scalable-decoding-with-language","title":"Fast and Scalable Decoding with Language Model Look-Ahead for Phrase-based Statistical Machine Translation","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-syntactic-analysis-for-statistical","title":"Fast Syntactic Analysis for Statistical Language Modeling via Substructure Sharing and Uptraining","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-rest-costs-and-space-efficient","title":"Language Model Rest Costs and Space-Efficient Storage","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-syntactic-language-modeling-with","title":"Large-Scale Syntactic Language Modeling with Treelets","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"translation-model-based-cross-lingual","title":"Translation Model Based Cross-Lingual Language Model Adaptation: from Word Models to Phrase Models","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"wsd-for-n-best-reranking-and-local-language","title":"WSD for n-best reranking and local language modeling in SMT","date":"2012-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-joint-model-of-language-and-perception-for","title":"A Joint Model of Language and Perception for Grounded Attribute Learning","date":"2012-06-27","arxiv_id":"1206.6423","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-challenge-set-for-advancing-language","title":"A Challenge Set for Advancing Language Modeling","date":"2012-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-investigation-of-morphological","title":"A Comparative Investigation of Morphological Language Modeling for the Languages of the European Union","date":"2012-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"analyse-des-performances-de-modeles-de","title":"Analyse des performances de mod\\`eles de langage sub-lexicale pour des langues peu-dot\\'ees \\`a morphologie riche (Performance analysis of sub-word language modeling for under-resourced languages with rich morphology: case study on Swahili and Amharic) [in French]","date":"2012-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-discriminative-language-model","title":"Large-scale discriminative language model reranking for voice-search","date":"2012-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"morpheme-and-pos-based-ibm1-and-language","title":"Morpheme- and POS-based IBM1 and language model scores for translation quality estimation","date":"2012-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"proceedings-of-the-naacl-hlt-2012-workshop","title":"Proceedings of the NAACL-HLT 2012 Workshop: Will We Ever Really Replace the N-gram Model? On the Future of Language Modeling for HLT","date":"2012-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rel-grams-a-probabilistic-model-of-relations","title":"Rel-grams: A Probabilistic Model of Relations in Text","date":"2012-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"arabic-word-generation-and-modelling-for","title":"Arabic Word Generation and Modelling for Spell Checking","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"english-to-indonesian-transliteration-to","title":"English to Indonesian Transliteration to Support English Pronunciation Practice","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"item-development-and-scoring-for-japanese","title":"Item Development and Scoring for Japanese Oral Proficiency Testing","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-and-language-resources-for-lvcsr-of","title":"Speech and Language Resources for LVCSR of Russian","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"suffix-trees-as-language-models","title":"Suffix Trees as Language Models","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-structured-named-entity-recognition-on","title":"Tree-Structured Named Entity Recognition on OCR Data: Analysis, Processing and Results","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"syntax-based-word-ordering-incorporating-a","title":"Syntax-Based Word Ordering Incorporating a Large-Scale Language Model","date":"2012-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"segmenting-dna-sequence-into-words","title":"Segmenting DNA sequence into `words'","date":"2012-02-12","arxiv_id":"1202.2518","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-distributed-syntactic-semantic-and","title":"A Scalable Distributed Syntactic, Semantic, and Lexical Language Model","date":"2012-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"from-machine-learning-to-machine-reasoning","title":"From Machine Learning to Machine Reasoning","date":"2011-02-09","arxiv_id":"1102.1808","repositories_listed":0,"syntology":null},{"url":null,"slug":"improvements-to-the-sequence-memoizer","title":"Improvements to the Sequence Memoizer","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-hierarchical-distributed-language","title":"A Scalable Hierarchical Distributed Language Model","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"correlated-bigram-lsa-for-unsupervised","title":"Correlated Bigram LSA for Unsupervised Language Model Adaptation","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-latent-dirichlet-allocation","title":"Spatial Latent Dirichlet Allocation","date":"2007-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unconstrained-on-line-handwriting-recognition","title":"Unconstrained On-line Handwriting Recognition with Recurrent Neural Networks","date":"2007-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bit-of-progress-in-language-modeling","title":"A Bit of Progress in Language Modeling","date":"2001-08-09","arxiv_id":"cs/0108005","repositories_listed":0,"syntology":null}],"record_sha256":"fbffdbb462faf8073d7c0186805ad89cbbe9cd711157eba334dccd8fbaf897ac","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}