{"url":"/sota/language-modelling-on-penn-treebank-word","task":{"name":"Language Modelling","url":"/task/language-modelling","note":null},"dataset":{"name":"Penn Treebank (Word Level)","url":"/dataset/penn-treebank"},"category":"Natural Language Processing","categories":["Medical","Miscellaneous","Natural Language Processing"],"category_note":null,"description":"A language model is a model of natural language. Language models are useful for a variety of tasks, including speech recognition, machine translation, natural language generation (generating more human-like text), optical character recognition, route optimization, handwriting recognition, grammar induction, and information retrieval.\r\n\r\nLarge language models (LLMs), currently their most advanced form, are predominantly based on transformers trained on larger datasets (frequently using words scraped from the public internet). They have superseded recurrent neural network-based models, which had previously superseded the purely statistical models, such as word n-gram language model. \r\n\r\nSource: [Wikipedia](https://en.wikipedia.org/wiki/Language_model)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Test perplexity","Validation perplexity","Params"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Test perplexity":"lower","Validation perplexity":"lower","Params":"lower"}},"counts":{"rows":43,"rows_with_code":42,"rows_with_paper_page":43,"rows_dated":43,"rows_using_additional_data":3},"rows":[{"rank_in_archive_order":1,"model":"GPT-3 (Zero-Shot)","metrics":{"Params":"175000M","Test perplexity":"20.5"},"uses_additional_data":true,"paper_date":"2020-05-28","paper":"/paper/language-models-are-few-shot-learners","paper_url":"https://arxiv.org/abs/2005.14165v4","paper_title":"Language Models are Few-Shot Learners","code":"https://github.com/ggml-org/llama.cpp","n_code_links":67,"syntology":{"n_ran":41,"n_unverified":24,"n_samples":65,"n_pointer_only_licence":4}},{"rank_in_archive_order":2,"model":"BERT-Large-CAS","metrics":{"Params":"395M","Test perplexity":"31.3","Validation perplexity":"36.1"},"uses_additional_data":true,"paper_date":"2019-04-20","paper":"/paper/190409408","paper_url":"https://arxiv.org/abs/1904.09408v2","paper_title":"Language Models with Transformers","code":"https://github.com/cgraywang/gluon-nlp-1","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":3,"model":"GPT-2","metrics":{"Params":"1542M","Test perplexity":"35.76"},"uses_additional_data":true,"paper_date":"2019-02-14","paper":"/paper/language-models-are-unsupervised-multitask","paper_url":"https://d4mucfpksywv.cloudfront.net/better-language-models/language-models.pdf","paper_title":"Language Models are Unsupervised Multitask Learners","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":null},{"rank_in_archive_order":4,"model":"Mogrifier LSTM + dynamic eval","metrics":{"Params":"24M","Test perplexity":"44.9","Validation perplexity":"44.8"},"uses_additional_data":false,"paper_date":"2019-09-04","paper":"/paper/mogrifier-lstm","paper_url":"https://arxiv.org/abs/1909.01792v2","paper_title":"Mogrifier LSTM","code":"https://github.com/deepmind/lamb","n_code_links":3,"syntology":null},{"rank_in_archive_order":5,"model":"adversarial + AWD-LSTM-MoS + dynamic eval","metrics":{"Params":"22M","Test perplexity":"46.01","Validation perplexity":"46.63"},"uses_additional_data":false,"paper_date":"2019-06-10","paper":"/paper/improving-neural-language-modeling-via","paper_url":"https://arxiv.org/abs/1906.03805v2","paper_title":"Improving Neural Language Modeling via Adversarial Training","code":"https://github.com/ChengyueGongR/advsoft","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"GL-LWGC + AWD-MoS-LSTM + dynamic eval","metrics":{"Params":"26M","Test perplexity":"46.34","Validation perplexity":"46.64"},"uses_additional_data":false,"paper_date":"2017-08-29","paper":"/paper/gradual-learning-of-recurrent-neural-networks","paper_url":"http://arxiv.org/abs/1708.08863v2","paper_title":"Gradual Learning of Recurrent Neural Networks","code":"https://github.com/zivaharoni/gradual-learning-rnn","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"FRAGE + AWD-LSTM-MoS + dynamic eval","metrics":{"Params":"22M","Test perplexity":"46.54","Validation perplexity":"47.38"},"uses_additional_data":false,"paper_date":"2018-09-18","paper":"/paper/frage-frequency-agnostic-word-representation","paper_url":"https://arxiv.org/abs/1809.06858v2","paper_title":"FRAGE: Frequency-Agnostic Word Representation","code":"https://github.com/ChengyueGongR/FrequencyAgnostic","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"AWD-LSTM-DOC x5","metrics":{"Params":"185M","Test perplexity":"47.17","Validation perplexity":"48.63"},"uses_additional_data":false,"paper_date":"2018-08-30","paper":"/paper/direct-output-connection-for-a-high-rank","paper_url":"http://arxiv.org/abs/1808.10143v2","paper_title":"Direct Output Connection for a High-Rank Language Model","code":"https://github.com/nttcslab-nlp/doc_lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"Past Decode Reg. + AWD-LSTM-MoS + dyn. eval.","metrics":{"Params":"22M","Test perplexity":"47.3","Validation perplexity":"48.0"},"uses_additional_data":false,"paper_date":"2018-08-14","paper":"/paper/improved-language-modeling-by-decoding-the","paper_url":"http://arxiv.org/abs/1808.05908v4","paper_title":"Improved Language Modeling by Decoding the Past","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":10,"model":"Ensemble of All","metrics":{"Test perplexity":"47.31","Validation perplexity":"48.92"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/advancing-state-of-the-art-in-language","paper_url":"https://arxiv.org/abs/2312.03735v1","paper_title":"Advancing State of the Art in Language Modeling","code":"https://github.com/davidherel/sota_lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"AWD-LSTM-MoS + dynamic eval","metrics":{"Params":"22M","Test perplexity":"47.69","Validation perplexity":"48.33"},"uses_additional_data":false,"paper_date":"2017-11-10","paper":"/paper/breaking-the-softmax-bottleneck-a-high-rank","paper_url":"http://arxiv.org/abs/1711.03953v4","paper_title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","code":"https://github.com/zihangdai/mos","n_code_links":9,"syntology":{"n_ran":1,"n_unverified":22,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"AWD-LSTM-DRILL + dynamic eval","metrics":{"Params":"24M","Test perplexity":"49.4","Validation perplexity":"49.5"},"uses_additional_data":false,"paper_date":"2019-05-14","paper":"/paper/deep-residual-output-layers-for-neural","paper_url":"https://arxiv.org/abs/1905.05513v2","paper_title":"Deep Residual Output Layers for Neural Language Generation","code":"https://github.com/idiap/drill","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"Dense IndRNN+dynamic eval","metrics":{"Test perplexity":"50.97"},"uses_additional_data":false,"paper_date":"2019-10-11","paper":"/paper/deep-independently-recurrent-neural-network","paper_url":"https://arxiv.org/abs/1910.06251v3","paper_title":"Deep Independently Recurrent Neural Network (IndRNN)","code":"https://github.com/Sunnydreamrain/IndRNN_pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"AWD-LSTM + dynamic eval","metrics":{"Params":"24M","Test perplexity":"51.1","Validation perplexity":"51.6"},"uses_additional_data":false,"paper_date":"2017-09-21","paper":"/paper/dynamic-evaluation-of-neural-sequence-models","paper_url":"http://arxiv.org/abs/1709.07432v2","paper_title":"Dynamic Evaluation of Neural Sequence Models","code":"https://github.com/benkrause/dynamic-evaluation","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"AWD-LSTM-DOC + Partial Shuffle","metrics":{"Params":"23M","Test perplexity":"52.0","Validation perplexity":"53.79"},"uses_additional_data":false,"paper_date":"2019-03-11","paper":"/paper/partially-shuffling-the-training-data-to-1","paper_url":"http://arxiv.org/abs/1903.04167v2","paper_title":"Partially Shuffling the Training Data to Improve Language Models","code":"https://github.com/ofirpress/PartialShuffle","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"AWD-LSTM-DOC","metrics":{"Params":"23M","Test perplexity":"52.38","Validation perplexity":"54.12"},"uses_additional_data":false,"paper_date":"2018-08-30","paper":"/paper/direct-output-connection-for-a-high-rank","paper_url":"http://arxiv.org/abs/1808.10143v2","paper_title":"Direct Output Connection for a High-Rank Language Model","code":"https://github.com/nttcslab-nlp/doc_lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"AWD-LSTM + continuous cache pointer","metrics":{"Params":"24M","Test perplexity":"52.8","Validation perplexity":"53.9"},"uses_additional_data":false,"paper_date":"2017-08-07","paper":"/paper/regularizing-and-optimizing-lstm-language","paper_url":"http://arxiv.org/abs/1708.02182v1","paper_title":"Regularizing and Optimizing LSTM Language Models","code":"https://github.com/google-research/google-research/tree/master/enas_lm","n_code_links":45,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":18,"model":"AWD-LSTM-MoS + Partial Shuffle","metrics":{"Params":"22M","Test perplexity":"53.92","Validation perplexity":"55.89"},"uses_additional_data":false,"paper_date":"2019-03-11","paper":"/paper/partially-shuffling-the-training-data-to-1","paper_url":"http://arxiv.org/abs/1903.04167v2","paper_title":"Partially Shuffling the Training Data to Improve Language Models","code":"https://github.com/ofirpress/PartialShuffle","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"Trellis Network","metrics":{"Test perplexity":"54.19"},"uses_additional_data":false,"paper_date":"2018-10-15","paper":"/paper/trellis-networks-for-sequence-modeling","paper_url":"http://arxiv.org/abs/1810.06682v2","paper_title":"Trellis Networks for Sequence Modeling","code":"https://github.com/locuslab/trellisnet","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":20,"model":"AWD-LSTM-MoS","metrics":{"Params":"22M","Test perplexity":"54.44","Validation perplexity":"56.54"},"uses_additional_data":false,"paper_date":"2017-11-10","paper":"/paper/breaking-the-softmax-bottleneck-a-high-rank","paper_url":"http://arxiv.org/abs/1711.03953v4","paper_title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","code":"https://github.com/zihangdai/mos","n_code_links":9,"syntology":{"n_ran":1,"n_unverified":22,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"AWD-FWM Schlag et al. (2020)","metrics":{"Params":"24M","Test perplexity":"54.48","Validation perplexity":"56.76"},"uses_additional_data":false,"paper_date":"2020-11-16","paper":"/paper/learning-associative-inference-using-fast-1","paper_url":"https://arxiv.org/abs/2011.07831v2","paper_title":"Learning Associative Inference Using Fast Weight Memory","code":"https://github.com/ischlag/Fast-Weight-Memory-public","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"Transformer-XL","metrics":{"Params":"24M","Test perplexity":"54.55","Validation perplexity":"56.72"},"uses_additional_data":false,"paper_date":"2019-01-09","paper":"/paper/transformer-xl-attentive-language-models","paper_url":"https://arxiv.org/abs/1901.02860v3","paper_title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","code":"https://github.com/huggingface/transformers","n_code_links":37,"syntology":{"n_ran":65,"n_unverified":78,"n_samples":143,"n_pointer_only_licence":43}},{"rank_in_archive_order":23,"model":"Transformer-XL + AutoDropout","metrics":{"Test perplexity":"54.9","Validation perplexity":"58.1"},"uses_additional_data":false,"paper_date":"2021-01-05","paper":"/paper/autodropout-learning-dropout-patterns-to","paper_url":"https://arxiv.org/abs/2101.01761v1","paper_title":"AutoDropout: Learning Dropout Patterns to Regularize Deep Networks","code":"https://github.com/google-research/google-research","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"2-layer skip-LSTM + dropout tuning","metrics":{"Params":"24M","Test perplexity":"55.3","Validation perplexity":"57.1"},"uses_additional_data":false,"paper_date":"2018-05-23","paper":"/paper/pushing-the-bounds-of-dropout","paper_url":"http://arxiv.org/abs/1805.09208v2","paper_title":"Pushing the bounds of dropout","code":"https://github.com/deepmind/lamb","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"AWD-LSTM-DRILL","metrics":{"Params":"24M","Test perplexity":"55.7","Validation perplexity":"58.2"},"uses_additional_data":false,"paper_date":"2019-05-14","paper":"/paper/deep-residual-output-layers-for-neural","paper_url":"https://arxiv.org/abs/1905.05513v2","paper_title":"Deep Residual Output Layers for Neural Language Generation","code":"https://github.com/idiap/drill","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"Differentiable NAS","metrics":{"Params":"23M","Test perplexity":"56.1","Validation perplexity":"58.3"},"uses_additional_data":false,"paper_date":"2018-06-24","paper":"/paper/darts-differentiable-architecture-search","paper_url":"http://arxiv.org/abs/1806.09055v2","paper_title":"DARTS: Differentiable Architecture Search","code":"https://github.com/google-research/google-research/tree/master/enas_lm","n_code_links":59,"syntology":{"n_ran":69,"n_unverified":87,"n_samples":156,"n_pointer_only_licence":48}},{"rank_in_archive_order":27,"model":"Dense IndRNN","metrics":{"Test perplexity":"56.37"},"uses_additional_data":false,"paper_date":"2019-10-11","paper":"/paper/deep-independently-recurrent-neural-network","paper_url":"https://arxiv.org/abs/1910.06251v3","paper_title":"Deep Independently Recurrent Neural Network (IndRNN)","code":"https://github.com/Sunnydreamrain/IndRNN_pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"AWD-LSTM 3-layer with Fraternal dropout","metrics":{"Params":"24M","Test perplexity":"56.8","Validation perplexity":"58.9"},"uses_additional_data":false,"paper_date":"2017-10-31","paper":"/paper/fraternal-dropout","paper_url":"http://arxiv.org/abs/1711.00066v4","paper_title":"Fraternal Dropout","code":"https://github.com/kondiz/fraternal-dropout","n_code_links":1,"syntology":null},{"rank_in_archive_order":29,"model":"DEQ-TrellisNet","metrics":{"Params":"24M","Test perplexity":"57.1"},"uses_additional_data":false,"paper_date":"2019-09-03","paper":"/paper/deep-equilibrium-models","paper_url":"https://arxiv.org/abs/1909.01377v2","paper_title":"Deep Equilibrium Models","code":"https://github.com/locuslab/deq","n_code_links":11,"syntology":{"n_ran":9,"n_unverified":3,"n_samples":12,"n_pointer_only_licence":4}},{"rank_in_archive_order":30,"model":"AWD-LSTM","metrics":{"Params":"24M","Test perplexity":"57.3","Validation perplexity":"60.0"},"uses_additional_data":false,"paper_date":"2017-08-07","paper":"/paper/regularizing-and-optimizing-lstm-language","paper_url":"http://arxiv.org/abs/1708.02182v1","paper_title":"Regularizing and Optimizing LSTM Language Models","code":"https://github.com/google-research/google-research/tree/master/enas_lm","n_code_links":45,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":31,"model":"Efficient NAS","metrics":{"Params":"24M","Test perplexity":" 58.6","Validation perplexity":"60.8"},"uses_additional_data":false,"paper_date":"2018-02-09","paper":"/paper/efficient-neural-architecture-search-via-1","paper_url":"http://arxiv.org/abs/1802.03268v2","paper_title":"Efficient Neural Architecture Search via Parameter Sharing","code":"https://github.com/google-research/google-research/tree/master/enas_lm","n_code_links":28,"syntology":{"n_ran":18,"n_unverified":20,"n_samples":38,"n_pointer_only_licence":25}},{"rank_in_archive_order":32,"model":"NAS-RL","metrics":{"Params":"25M","Test perplexity":"64.0"},"uses_additional_data":false,"paper_date":"2016-11-05","paper":"/paper/neural-architecture-search-with-reinforcement","paper_url":"http://arxiv.org/abs/1611.01578v2","paper_title":"Neural Architecture Search with Reinforcement Learning","code":"https://github.com/tensorflow/models","n_code_links":12,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":33,"model":"Recurrent highway networks","metrics":{"Params":"23M","Test perplexity":"65.4","Validation perplexity":"67.9"},"uses_additional_data":false,"paper_date":"2016-07-12","paper":"/paper/recurrent-highway-networks","paper_url":"http://arxiv.org/abs/1607.03474v5","paper_title":"Recurrent Highway Networks","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"Inan et al. (2016) - Variational RHN","metrics":{"Test perplexity":"66.0","Validation perplexity":"68.1"},"uses_additional_data":false,"paper_date":"2016-11-04","paper":"/paper/tying-word-vectors-and-word-classifiers-a","paper_url":"http://arxiv.org/abs/1611.01462v3","paper_title":"Tying Word Vectors and Word Classifiers: A Loss Framework for Language Modeling","code":"https://github.com/JianGoForIt/YellowFin_Pytorch","n_code_links":5,"syntology":null},{"rank_in_archive_order":35,"model":"Gal & Ghahramani (2016) - Variational LSTM (large)","metrics":{"Test perplexity":"75.2","Validation perplexity":"77.9"},"uses_additional_data":false,"paper_date":"2015-12-16","paper":"/paper/a-theoretically-grounded-application-of","paper_url":"http://arxiv.org/abs/1512.05287v5","paper_title":"A Theoretically Grounded Application of Dropout in Recurrent Neural Networks","code":"https://github.com/HKUST-KnowComp/R-Net","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"Zaremba et al. (2014) - LSTM (large)","metrics":{"Test perplexity":"78.4","Validation perplexity":"82.2"},"uses_additional_data":false,"paper_date":"2014-09-08","paper":"/paper/recurrent-neural-network-regularization","paper_url":"http://arxiv.org/abs/1409.2329v5","paper_title":"Recurrent Neural Network Regularization","code":"https://github.com/wojzaremba/lstm","n_code_links":21,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":37,"model":"LSTM (Bai et al., 2018)","metrics":{"Test perplexity":"78.93"},"uses_additional_data":false,"paper_date":"2018-03-04","paper":"/paper/an-empirical-evaluation-of-generic","paper_url":"http://arxiv.org/abs/1803.01271v2","paper_title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","code":"https://github.com/timeseriesAI/tsai/tree/main/tsai/models","n_code_links":35,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":1}},{"rank_in_archive_order":38,"model":"Gal & Ghahramani (2016) - Variational LSTM (medium)","metrics":{"Test perplexity":"79.7","Validation perplexity":"81.9"},"uses_additional_data":false,"paper_date":"2015-12-16","paper":"/paper/a-theoretically-grounded-application-of","paper_url":"http://arxiv.org/abs/1512.05287v5","paper_title":"A Theoretically Grounded Application of Dropout in Recurrent Neural Networks","code":"https://github.com/HKUST-KnowComp/R-Net","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"Zaremba et al. (2014) - LSTM (medium)","metrics":{"Test perplexity":"82.7","Validation perplexity":"86.2"},"uses_additional_data":false,"paper_date":"2014-09-08","paper":"/paper/recurrent-neural-network-regularization","paper_url":"http://arxiv.org/abs/1409.2329v5","paper_title":"Recurrent Neural Network Regularization","code":"https://github.com/wojzaremba/lstm","n_code_links":21,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":40,"model":"R-Transformer","metrics":{"Test perplexity":"84.38"},"uses_additional_data":false,"paper_date":"2019-07-12","paper":"/paper/r-transformer-recurrent-neural-network","paper_url":"https://arxiv.org/abs/1907.05572v1","paper_title":"R-Transformer: Recurrent Neural Network Enhanced Transformer","code":"https://github.com/DSE-MSU/R-transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":41,"model":"GRU (Bai et al., 2018)","metrics":{"Test perplexity":"92.48"},"uses_additional_data":false,"paper_date":"2018-03-04","paper":"/paper/an-empirical-evaluation-of-generic","paper_url":"http://arxiv.org/abs/1803.01271v2","paper_title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","code":"https://github.com/timeseriesAI/tsai/tree/main/tsai/models","n_code_links":35,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":1}},{"rank_in_archive_order":42,"model":"Seq-U-Net","metrics":{"Params":"14.9M","Test perplexity":"107.95"},"uses_additional_data":false,"paper_date":"2019-11-14","paper":"/paper/seq-u-net-a-one-dimensional-causal-u-net-for","paper_url":"https://arxiv.org/abs/1911.06393v1","paper_title":"Seq-U-Net: A One-Dimensional Causal U-Net for Efficient Sequence Modelling","code":"https://github.com/f90/Seq-U-Net","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":43,"model":"TCN","metrics":{"Params":"14.7M","Test perplexity":"108.47"},"uses_additional_data":false,"paper_date":"2019-11-14","paper":"/paper/seq-u-net-a-one-dimensional-causal-u-net-for","paper_url":"https://arxiv.org/abs/1911.06393v1","paper_title":"Seq-U-Net: A One-Dimensional Causal U-Net for Efficient Sequence Modelling","code":"https://github.com/f90/Seq-U-Net","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":24,"rows_with_any_sample_ran":19,"distinct_papers_with_graph_line":18,"distinct_papers_with_any_sample_ran":15,"samples_over_distinct_papers":{"n_ran":227,"n_unverified":268,"n_samples":495,"n_pointer_only_licence":145,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":238,"n_unverified":312,"n_samples":550,"n_pointer_only_licence":159,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}