{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-normalization/papers/2","list_of":"/task/text-normalization","task":"Text Normalization","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":2,"rows_per_page":100,"rows":[101,145],"of":145,"counts":{"archive_papers_tagged":145,"with_a_code_link":27,"where_syntology_ran_a_sample":1,"not_listed_spam_title":0,"listed":145,"listed_where_code_ran":1,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1,"every_run_a_failure_of_syntologys_instrument":0,"listed_with_a_run_with_no_instrument_failure":1,"listed_every_run_a_failure_of_syntologys_instrument":0,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-normalization","prev":"/task/text-normalization","next":null,"papers":[{"url":null,"slug":"few-shot-and-zero-shot-learning-for","title":"Few-Shot and Zero-Shot Learning for Historical Text Normalization","date":"2019-03-12","arxiv_id":"1903.04870","repositories_listed":0,"syntology":null},{"url":null,"slug":"utilizing-character-and-word-embeddings-for","title":"Utilizing Character and Word Embeddings for Text Normalization with Sequence-to-Sequence Models","date":"2018-09-05","arxiv_id":"1809.01534","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-and-accurate-reordering-with-itg","title":"Fast and Accurate Reordering with ITG Transition RNN","date":"2018-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-learning-for-historical-text","title":"Multi-task learning for historical text normalization: Size matters","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"text-normalization-infrastructure-that-scales","title":"Text Normalization Infrastructure that Scales to Hundreds of Language Varieties","date":"2018-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-historical-text-normalization","title":"Evaluating historical text normalization systems: How well do they generalize?","date":"2018-04-07","arxiv_id":"1804.02545","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-text-normalization-by-optimizing","title":"Improving Text Normalization by Optimizing Nearest Neighbor Matching","date":"2017-12-27","arxiv_id":"1712.09518","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepnorm-a-deep-learning-approach-to-text","title":"DeepNorm-A Deep Learning Approach to Text Normalization","date":"2017-12-17","arxiv_id":"1712.06994","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatically-extracting-variant","title":"Automatically Extracting Variant-Normalization Pairs for Japanese Text Normalization","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-neural-text-normalization-with-data","title":"Improving Neural Text Normalization with Data Augmentation at Character- and Morphological Levels","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"noisy-uyghur-text-normalization","title":"Noisy Uyghur Text Normalization","date":"2017-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-attention-for-historical-text","title":"Learning attention for historical text normalization by learning to pronounce","date":"2017-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mainstreaming-august-strindberg-with-text","title":"Mainstreaming August Strindberg with Text Normalization","date":"2017-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-word-embeddings-for-unsupervised","title":"Exploring Word Embeddings for Unsupervised Textual User-Generated Content Normalization","date":"2017-04-10","arxiv_id":"1704.02963","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepnnner-applying-blstm-cnns-and-extended","title":"DeepNNNER: Applying BLSTM-CNNs and Extended Lexicons to Named Entity Recognition in Tweets","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"japanese-text-normalization-with-encoder","title":"Japanese Text Normalization with Encoder-Decoder Model","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"keynote-lecture-2-neural-and-other-machine","title":"Keynote Lecture 2: Neural (and other Machine Learning) Approaches to Text Normalization","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"racai-entry-for-the-iwslt-2016-shared-task","title":"RACAI Entry for the IWSLT 2016 Shared Task","date":"2016-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"minimally-supervised-written-to-spoken-text","title":"Minimally Supervised Written-to-Spoken Text Normalization","date":"2016-09-21","arxiv_id":"1609.06649","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-tailoring-for-text-normalization","title":"Context Tailoring for Text Normalization","date":"2016-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-denoised-web-treebank-evaluating","title":"The Denoised Web Treebank: Evaluating Dependency Parsing under Noisy Input Conditions","date":"2016-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tts-for-low-resource-languages-a-bangla","title":"TTS for Low Resource Languages: A Bangla Synthesizer","date":"2016-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"text-normalization-and-unit-selection-for-a","title":"Text Normalization and Unit Selection for a Memory Based Non Uniform Unit Selection TTS in Malayalam","date":"2015-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spoken-language-translation-for-polish","title":"Spoken Language Translation for Polish","date":"2015-11-24","arxiv_id":"1511.07788","repositories_listed":0,"syntology":null},{"url":null,"slug":"beklia-simple-approach-to-twitter-text","title":"Bekli:A Simple Approach to Twitter Text Normalization.","date":"2015-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"iitp-hybrid-approach-for-text-normalization","title":"IITP: Hybrid Approach for Text Normalization in Twitter","date":"2015-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ncsu_sas_wookhee-a-deep-contextual-long-short","title":"NCSU\\_SAS\\_WOOKHEE: A Deep Contextual Long-Short Term Memory Model for Text Normalization","date":"2015-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-text-normalization-using","title":"Unsupervised Text Normalization Using Distributed Representations of Words and Phrases","date":"2015-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-in-depth-analysis-of-the-effect-of-text","title":"An In-depth Analysis of the Effect of Text Normalization in Social Media","date":"2015-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"normalization-of-non-standard-words-in","title":"Normalization of Non-Standard Words in Croatian Texts","date":"2015-03-27","arxiv_id":"1503.08167","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-graph-based-approach-for-contextual-text","title":"A Graph-based Approach for Contextual Text Normalization","date":"2014-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-detecting-messaging-abuse-in-short-text","title":"On Detecting Messaging Abuse in Short Text Messages using Linguistic and Behavioral patterns","date":"2014-08-18","arxiv_id":"1408.3934","repositories_listed":0,"syntology":null},{"url":null,"slug":"morphological-disambiguation-and-text","title":"Morphological Disambiguation and Text Normalization for Southern Quechua Varieties","date":"2014-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-models-for-text-normalization-and","title":"Statistical models for text normalization and machine translation","date":"2014-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"analogy-based-text-normalization-the-case-of","title":"Analogy-based Text Normalization : the case of unknowns words (Normalisation de textes par analogie: le cas des mots inconnus) [in French]","date":"2014-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-text-normalization-via-unsupervised","title":"Improving Text Normalization via Unsupervised Model and Discriminative Reranking","date":"2014-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"an-out-of-domain-test-suite-for-dependency","title":"An Out-of-Domain Test Suite for Dependency Parsing of German","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-shared-datasets-for-normalization","title":"Towards Shared Datasets for Normalization Research","date":"2014-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cascaded-approach-for-social-media-text","title":"A Cascaded Approach for Social Media Text Normalization of Turkish","date":"2014-04-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/a-log-linear-model-for-unsupervised-text","slug":"a-log-linear-model-for-unsupervised-text","title":"A Log-Linear Model for Unsupervised Text Normalization","date":"2013-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-parser-centric-text-normalization","title":"Adaptive Parser-Centric Text Normalization","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"social-text-normalization-using-contextual","title":"Social Text Normalization using Contextual Graph Random Walks","date":"2013-08-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-text-normalization-using-character","title":"Improving Text Normalization using Character-Blocks Based Models and System Combination","date":"2012-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-basic-language-resource-kit-for-persian","title":"A Basic Language Resource Kit for Persian","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"holaaa-writin-like-u-talk-is-kewl-but-kinda","title":"Holaaa!! writin like u talk is kewl but kinda hard 4 NLP","date":"2012-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"8cafb04f8ae5bdc05392c8dad1cf013fe1570c9eb493527411e436472a18a910","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}