{"url":"/sota/language-modelling-on-wikitext-103","task":{"name":"Language Modelling","url":"/task/language-modelling","note":null},"dataset":{"name":"WikiText-103","url":"/dataset/wikitext-103"},"category":"Natural Language Processing","categories":["Medical","Miscellaneous","Natural Language Processing"],"category_note":null,"description":"A language model is a model of natural language. Language models are useful for a variety of tasks, including speech recognition, machine translation, natural language generation (generating more human-like text), optical character recognition, route optimization, handwriting recognition, grammar induction, and information retrieval.\r\n\r\nLarge language models (LLMs), currently their most advanced form, are predominantly based on transformers trained on larger datasets (frequently using words scraped from the public internet). They have superseded recurrent neural network-based models, which had previously superseded the purely statistical models, such as word n-gram language model. \r\n\r\nSource: [Wikipedia](https://en.wikipedia.org/wiki/Language_model)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Test perplexity","Validation perplexity","Number of params"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Test perplexity":"lower","Validation perplexity":"lower","Number of params":"lower"}},"counts":{"rows":89,"rows_with_code":81,"rows_with_paper_page":89,"rows_dated":89,"rows_using_additional_data":15},"rows":[{"rank_in_archive_order":1,"model":"RETRO (7.5B)","metrics":{"Number of params":"7532M","Test perplexity":"2.4"},"uses_additional_data":true,"paper_date":"2021-12-08","paper":"/paper/improving-language-models-by-retrieving-from","paper_url":"https://arxiv.org/abs/2112.04426v3","paper_title":"Improving language models by retrieving from trillions of tokens","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":7,"n_samples":23,"n_pointer_only_licence":3}},{"rank_in_archive_order":2,"model":"Hybrid H3 (2.7B)","metrics":{"Number of params":"2700M","Test perplexity":"10.6"},"uses_additional_data":true,"paper_date":"2022-12-28","paper":"/paper/hungry-hungry-hippos-towards-language","paper_url":"https://arxiv.org/abs/2212.14052v3","paper_title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","code":"https://github.com/hazyresearch/safari","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"Megatron-LM","metrics":{"Number of params":"8300M","Test perplexity":"10.81"},"uses_additional_data":true,"paper_date":"2019-09-17","paper":"/paper/megatron-lm-training-multi-billion-parameter","paper_url":"https://arxiv.org/abs/1909.08053v4","paper_title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","code":"https://github.com/NVIDIA/Megatron-LM","n_code_links":10,"syntology":{"n_ran":12,"n_unverified":35,"n_samples":47,"n_pointer_only_licence":15}},{"rank_in_archive_order":4,"model":"GLM-XXLarge (bidirectional)","metrics":{"Number of params":"10000M","Test perplexity":"11.33"},"uses_additional_data":true,"paper_date":"2021-03-18","paper":"/paper/all-nlp-tasks-are-generation-tasks-a-general","paper_url":"https://arxiv.org/abs/2103.10360v2","paper_title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","code":"https://github.com/thudm/chatglm2-6b","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"GLM-XXLarge (unidirectional)","metrics":{"Number of params":"10000M","Test perplexity":"12.22"},"uses_additional_data":true,"paper_date":"2021-03-18","paper":"/paper/all-nlp-tasks-are-generation-tasks-a-general","paper_url":"https://arxiv.org/abs/2103.10360v2","paper_title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","code":"https://github.com/thudm/chatglm2-6b","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"Hybrid H3 (1.3B)","metrics":{"Number of params":"1300M","Test perplexity":"12.5"},"uses_additional_data":true,"paper_date":"2022-12-28","paper":"/paper/hungry-hungry-hippos-towards-language","paper_url":"https://arxiv.org/abs/2212.14052v3","paper_title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","code":"https://github.com/hazyresearch/safari","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"Ensemble of All","metrics":{"Test perplexity":"13.29","Validation perplexity":"13.11"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/advancing-state-of-the-art-in-language","paper_url":"https://arxiv.org/abs/2312.03735v1","paper_title":"Advancing State of the Art in Language Modeling","code":"https://github.com/davidherel/sota_lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"GateLoop (125M)","metrics":{"Number of params":"125M","Test perplexity":"13.4"},"uses_additional_data":false,"paper_date":"2023-11-03","paper":"/paper/gateloop-fully-data-controlled-linear","paper_url":"https://arxiv.org/abs/2311.01927v2","paper_title":"GateLoop: Fully Data-Controlled Linear Recurrence for Sequence Modeling","code":"https://github.com/tobiaskatsch/GateLoop","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"kNN-LM w/ Adaptive Coefficient","metrics":{"Number of params":"247M","Test perplexity":"15.5","Validation perplexity":"15.72"},"uses_additional_data":false,"paper_date":"2022-10-28","paper":"/paper/you-can-t-pick-your-neighbors-or-can-you-when","paper_url":"https://arxiv.org/abs/2210.15859v1","paper_title":"You can't pick your neighbors, or can you? When and how to rely on retrieval in the $k$NN-LM","code":"https://github.com/iesl/knnlm-retrieval-quality","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":10,"model":"kNN-LM w/ Continuous Cache","metrics":{"Number of params":"247M","Test perplexity":"15.79","Validation perplexity":"15.81"},"uses_additional_data":false,"paper_date":"2019-11-01","paper":"/paper/generalization-through-memorization-nearest","paper_url":"https://arxiv.org/abs/1911.00172v2","paper_title":"Generalization through Memorization: Nearest Neighbor Language Models","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":5,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"Routing Transformer","metrics":{"Test perplexity":"15.8"},"uses_additional_data":false,"paper_date":"2020-03-12","paper":"/paper/efficient-content-based-sparse-attention-with-1","paper_url":"https://arxiv.org/abs/2003.05997v5","paper_title":"Efficient Content-Based Sparse Attention with Routing Transformers","code":"https://github.com/lucidrains/local-attention","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":12,"model":"kNN-LM","metrics":{"Number of params":"247M","Test perplexity":"16.12","Validation perplexity":"16.06"},"uses_additional_data":false,"paper_date":"2019-11-01","paper":"/paper/generalization-through-memorization-nearest","paper_url":"https://arxiv.org/abs/1911.00172v2","paper_title":"Generalization through Memorization: Nearest Neighbor Language Models","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":5,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"Transformer-XL (RMS dynamic eval)","metrics":{"Number of params":"257M","Test perplexity":"16.4","Validation perplexity":"15.8"},"uses_additional_data":true,"paper_date":"2019-04-17","paper":"/paper/dynamic-evaluation-of-transformer-language","paper_url":"http://arxiv.org/abs/1904.08378v1","paper_title":"Dynamic Evaluation of Transformer Language Models","code":"https://github.com/benkrause/dynamiceval-transformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"[?]-former (SM)","metrics":{"Test perplexity":"16.61"},"uses_additional_data":false,"paper_date":"2021-09-01","paper":"/paper/infty-former-infinite-memory-transformer","paper_url":"https://arxiv.org/abs/2109.00301v3","paper_title":"$\\infty$-former: Infinite Memory Transformer","code":"https://github.com/deep-spin/infinite-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"-former (SM)","metrics":{"Test perplexity":"16.61"},"uses_additional_data":false,"paper_date":"2021-09-01","paper":"/paper/infty-former-infinite-memory-transformer","paper_url":"https://arxiv.org/abs/2109.00301v3","paper_title":"$\\infty$-former: Infinite Memory Transformer","code":"https://github.com/deep-spin/infinite-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"∞-former (Sticky memories + initialized GPT-2 Small)","metrics":{"Test perplexity":"16.61"},"uses_additional_data":true,"paper_date":"2021-09-01","paper":"/paper/infty-former-infinite-memory-transformer","paper_url":"https://arxiv.org/abs/2109.00301v3","paper_title":"$\\infty$-former: Infinite Memory Transformer","code":"https://github.com/deep-spin/infinite-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"∞-former (initialized GPT-2 Small)","metrics":{"Test perplexity":"16.64"},"uses_additional_data":true,"paper_date":"2021-09-01","paper":"/paper/infty-former-infinite-memory-transformer","paper_url":"https://arxiv.org/abs/2109.00301v3","paper_title":"$\\infty$-former: Infinite Memory Transformer","code":"https://github.com/deep-spin/infinite-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"Hybrid H3 (355M)","metrics":{"Number of params":"355M","Test perplexity":"16.9"},"uses_additional_data":true,"paper_date":"2022-12-28","paper":"/paper/hungry-hungry-hippos-towards-language","paper_url":"https://arxiv.org/abs/2212.14052v3","paper_title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","code":"https://github.com/hazyresearch/safari","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"Transformer-XL (SGD dynamic eval)","metrics":{"Number of params":"257M","Test perplexity":"17.0","Validation perplexity":"16.3"},"uses_additional_data":false,"paper_date":"2019-04-17","paper":"/paper/dynamic-evaluation-of-transformer-language","paper_url":"http://arxiv.org/abs/1904.08378v1","paper_title":"Dynamic Evaluation of Transformer Language Models","code":"https://github.com/benkrause/dynamiceval-transformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"Compressive Transformer (18L, M=1024)","metrics":{"Test perplexity":"17.1","Validation perplexity":"16.0"},"uses_additional_data":false,"paper_date":"2019-11-13","paper":"/paper/compressive-transformers-for-long-range-1","paper_url":"https://arxiv.org/abs/1911.05507v1","paper_title":"Compressive Transformers for Long-Range Sequence Modelling","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":6,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"SRU++ Large","metrics":{"Number of params":"234M","Test perplexity":"17.1","Validation perplexity":"16.4"},"uses_additional_data":false,"paper_date":"2021-02-24","paper":"/paper/when-attention-meets-fast-recurrence-training","paper_url":"https://arxiv.org/abs/2102.12459v3","paper_title":"When Attention Meets Fast Recurrence: Training Language Models with Reduced Compute","code":"https://github.com/asappresearch/sru","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"SegaTransformer-XL","metrics":{"Number of params":"257M","Test perplexity":"17.1"},"uses_additional_data":false,"paper_date":"2020-04-30","paper":"/paper/segabert-pre-training-of-segment-aware-bert","paper_url":"https://arxiv.org/abs/2004.14996v2","paper_title":"Segatron: Segment-Aware Transformer for Language Modeling and Understanding","code":"https://github.com/rsvp-ai/segatron_aaai","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"Transformer+SSA+Self-ensemble","metrics":{"Test perplexity":"17.18","Validation perplexity":"16.54"},"uses_additional_data":false,"paper_date":"2023-06-02","paper":"/paper/the-information-pathways-hypothesis","paper_url":"https://arxiv.org/abs/2306.01705v1","paper_title":"The Information Pathways Hypothesis: Transformers are Dynamic Self-Ensembles","code":"https://github.com/shamim-hussain/ssa","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"Transformer-XL Large + Phrase Induction","metrics":{"Number of params":"257M","Test perplexity":"17.4"},"uses_additional_data":false,"paper_date":"2019-06-04","paper":"/paper/improving-neural-language-models-by","paper_url":"https://arxiv.org/abs/1906.01702v1","paper_title":"Improving Neural Language Models by Segmenting, Attending, and Predicting the Future","code":"https://github.com/luohongyin/PILM","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"GPT-2 Full","metrics":{"Number of params":"1542M","Test perplexity":"17.48"},"uses_additional_data":true,"paper_date":"2019-02-14","paper":"/paper/language-models-are-unsupervised-multitask","paper_url":"https://d4mucfpksywv.cloudfront.net/better-language-models/language-models.pdf","paper_title":"Language Models are Unsupervised Multitask Learners","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":null},{"rank_in_archive_order":26,"model":"Staged Training","metrics":{"Number of params":"247M","Test perplexity":"17.56","Validation perplexity":"16.89"},"uses_additional_data":false,"paper_date":"2020-12-31","paper":"/paper/shortformer-better-language-modeling-using","paper_url":"https://arxiv.org/abs/2012.15832v2","paper_title":"Shortformer: Better Language Modeling using Shorter Inputs","code":"https://github.com/ofirpress/shortformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"Transformer+SSA","metrics":{"Test perplexity":"17.60","Validation perplexity":"16.91"},"uses_additional_data":false,"paper_date":"2023-06-02","paper":"/paper/the-information-pathways-hypothesis","paper_url":"https://arxiv.org/abs/2306.01705v1","paper_title":"The Information Pathways Hypothesis: Transformers are Dynamic Self-Ensembles","code":"https://github.com/shamim-hussain/ssa","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"Sandwich Transformer","metrics":{"Number of params":"247M","Test perplexity":"17.96"},"uses_additional_data":false,"paper_date":"2019-11-10","paper":"/paper/improving-transformer-models-by-reordering","paper_url":"https://arxiv.org/abs/1911.03864v2","paper_title":"Improving Transformer Models by Reordering their Sublayers","code":"https://github.com/ofirpress/sandwich_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":29,"model":"DIFFQ (λ=1, g=16)","metrics":{"Test perplexity":"18.0"},"uses_additional_data":false,"paper_date":"2021-04-20","paper":"/paper/differentiable-model-compression-via-pseudo","paper_url":"https://arxiv.org/abs/2104.09987v3","paper_title":"Differentiable Model Compression via Pseudo Quantization Noise","code":"https://github.com/facebookresearch/diffq","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"Mega","metrics":{"Number of params":"252M","Test perplexity":"18.07"},"uses_additional_data":false,"paper_date":"2022-09-21","paper":"/paper/mega-moving-average-equipped-gated-attention","paper_url":"https://arxiv.org/abs/2209.10655v3","paper_title":"Mega: Moving Average Equipped Gated Attention","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":1,"n_samples":13,"n_pointer_only_licence":8}},{"rank_in_archive_order":31,"model":"Shortformer","metrics":{"Number of params":"247M","Test perplexity":"18.15","Validation perplexity":"17.47"},"uses_additional_data":false,"paper_date":"2020-12-31","paper":"/paper/shortformer-better-language-modeling-using","paper_url":"https://arxiv.org/abs/2012.15832v2","paper_title":"Shortformer: Better Language Modeling using Shorter Inputs","code":"https://github.com/ofirpress/shortformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"Feedback Transformer (8 layers)","metrics":{"Number of params":"139M","Test perplexity":"18.2","Validation perplexity":"17.5"},"uses_additional_data":false,"paper_date":"2020-02-21","paper":"/paper/accessing-higher-level-representations-in","paper_url":"https://arxiv.org/abs/2002.09402v3","paper_title":"Addressing Some Limitations of Transformers with Feedback Memory","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":4,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":33,"model":"SRU++ Base","metrics":{"Number of params":"148M","Test perplexity":"18.3","Validation perplexity":"17.5"},"uses_additional_data":false,"paper_date":"2021-02-24","paper":"/paper/when-attention-meets-fast-recurrence-training","paper_url":"https://arxiv.org/abs/2102.12459v3","paper_title":"When Attention Meets Fast Recurrence: Training Language Models with Reduced Compute","code":"https://github.com/asappresearch/sru","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"Transformer-XL Large","metrics":{"Number of params":"257M","Test perplexity":"18.3","Validation perplexity":"18.2"},"uses_additional_data":false,"paper_date":"2019-01-09","paper":"/paper/transformer-xl-attentive-language-models","paper_url":"https://arxiv.org/abs/1901.02860v3","paper_title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","code":"https://github.com/huggingface/transformers","n_code_links":37,"syntology":{"n_ran":63,"n_unverified":80,"n_samples":143,"n_pointer_only_licence":43}},{"rank_in_archive_order":35,"model":"PAR Transformer Large","metrics":{"Test perplexity":"18.4"},"uses_additional_data":false,"paper_date":"2020-09-09","paper":"/paper/pay-attention-when-required","paper_url":"https://arxiv.org/abs/2009.04534v3","paper_title":"Pay Attention when Required","code":"https://github.com/NVIDIA/DeepLearningExamples/tree/master/PyTorch/LanguageModeling","n_code_links":2,"syntology":null},{"rank_in_archive_order":36,"model":"Perceiver AR 358M","metrics":{"Test perplexity":"18.4"},"uses_additional_data":false,"paper_date":"2022-02-15","paper":"/paper/general-purpose-long-context-autoregressive","paper_url":"https://arxiv.org/abs/2202.07765v2","paper_title":"General-purpose, long-context autoregressive modeling with Perceiver AR","code":"https://github.com/krasserm/perceiver-io","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":6,"n_samples":12,"n_pointer_only_licence":1}},{"rank_in_archive_order":37,"model":"Hyena-3-slim","metrics":{"Test perplexity":"18.5"},"uses_additional_data":false,"paper_date":"2023-02-21","paper":"/paper/hyena-hierarchy-towards-larger-convolutional","paper_url":"https://arxiv.org/abs/2302.10866v3","paper_title":"Hyena Hierarchy: Towards Larger Convolutional Language Models","code":"https://github.com/hazyresearch/safari","n_code_links":7,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":38,"model":"Hybrid H3 125M","metrics":{"Test perplexity":"18.5"},"uses_additional_data":false,"paper_date":"2022-12-28","paper":"/paper/hungry-hungry-hippos-towards-language","paper_url":"https://arxiv.org/abs/2212.14052v3","paper_title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","code":"https://github.com/hazyresearch/safari","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"Hyena-3","metrics":{"Test perplexity":"18.6"},"uses_additional_data":false,"paper_date":"2023-02-21","paper":"/paper/hyena-hierarchy-towards-larger-convolutional","paper_url":"https://arxiv.org/abs/2302.10866v3","paper_title":"Hyena Hierarchy: Towards Larger Convolutional Language Models","code":"https://github.com/hazyresearch/safari","n_code_links":7,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":40,"model":"Transformer (Adaptive inputs)","metrics":{"Number of params":"247M","Test perplexity":"18.70","Validation perplexity":"17.97"},"uses_additional_data":false,"paper_date":"2018-09-28","paper":"/paper/adaptive-input-representations-for-neural","paper_url":"http://arxiv.org/abs/1809.10853v3","paper_title":"Adaptive Input Representations for Neural Language Modeling","code":"https://github.com/pytorch/fairseq","n_code_links":3,"syntology":null},{"rank_in_archive_order":41,"model":"T2R + Pretrain","metrics":{"Test perplexity":"19.6","Validation perplexity":"19"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/finetuning-pretrained-transformers-into-rnns","paper_url":"https://arxiv.org/abs/2103.13076v2","paper_title":"Finetuning Pretrained Transformers into RNNs","code":"https://github.com/hazyresearch/lolcats","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":4}},{"rank_in_archive_order":42,"model":"Subformer","metrics":{"Number of params":"96M","Test perplexity":"20.39"},"uses_additional_data":false,"paper_date":"2021-01-01","paper":"/paper/subformer-a-parameter-reduced-transformer","paper_url":"https://openreview.net/forum?id=6UurSaf08jx","paper_title":"Subformer: A Parameter Reduced Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":43,"model":"BERT-Large-CAS","metrics":{"Number of params":"395M","Test perplexity":"20.4","Validation perplexity":"19.6"},"uses_additional_data":false,"paper_date":"2019-04-20","paper":"/paper/190409408","paper_url":"https://arxiv.org/abs/1904.09408v2","paper_title":"Language Models with Transformers","code":"https://github.com/cgraywang/gluon-nlp-1","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":44,"model":"All-attention network (36 layers)","metrics":{"Number of params":"133M","Test perplexity":"20.6","Validation perplexity":"19.7"},"uses_additional_data":false,"paper_date":"2019-07-02","paper":"/paper/augmenting-self-attention-with-persistent","paper_url":"https://arxiv.org/abs/1907.01470v1","paper_title":"Augmenting Self-attention with Persistent Memory","code":"https://github.com/lucidrains/x-transformers","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":45,"model":"S4","metrics":{"Number of params":"249M","Test perplexity":"21.28"},"uses_additional_data":false,"paper_date":"2021-10-31","paper":"/paper/efficiently-modeling-long-sequences-with-1","paper_url":"https://arxiv.org/abs/2111.00396v3","paper_title":"Efficiently Modeling Long Sequences with Structured State Spaces","code":"https://github.com/state-spaces/s4","n_code_links":8,"syntology":{"n_ran":28,"n_unverified":27,"n_samples":55,"n_pointer_only_licence":3}},{"rank_in_archive_order":46,"model":"GPT-2 Large","metrics":{"Number of params":"774M","Test perplexity":"22.05"},"uses_additional_data":true,"paper_date":"2019-02-14","paper":"/paper/language-models-are-unsupervised-multitask","paper_url":"https://d4mucfpksywv.cloudfront.net/better-language-models/language-models.pdf","paper_title":"Language Models are Unsupervised Multitask Learners","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":null},{"rank_in_archive_order":47,"model":"Feedback Transformer (4 layers)","metrics":{"Number of params":"44M","Test perplexity":"22.4","Validation perplexity":"21.4"},"uses_additional_data":false,"paper_date":"2020-02-21","paper":"/paper/accessing-higher-level-representations-in","paper_url":"https://arxiv.org/abs/2002.09402v3","paper_title":"Addressing Some Limitations of Transformers with Feedback Memory","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":4,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":48,"model":"PAR Transformer Base","metrics":{"Test perplexity":"22.7"},"uses_additional_data":false,"paper_date":"2020-09-09","paper":"/paper/pay-attention-when-required","paper_url":"https://arxiv.org/abs/2009.04534v3","paper_title":"Pay Attention when Required","code":"https://github.com/NVIDIA/DeepLearningExamples/tree/master/PyTorch/LanguageModeling","n_code_links":2,"syntology":null},{"rank_in_archive_order":49,"model":"Skip Cross-Head Transformer-XL","metrics":{"Number of params":"122M","Test perplexity":"22.91","Validation perplexity":"21.87"},"uses_additional_data":false,"paper_date":"2023-11-14","paper":"/paper/memory-efficient-stochastic-methods-for","paper_url":"https://arxiv.org/abs/2311.08123v1","paper_title":"Memory-efficient Stochastic methods for Memory-based Transformers","code":"https://github.com/vishwajit-vishnu/memory-efficient-stochastic-methods-for-memory-based-transformers","n_code_links":1,"syntology":null},{"rank_in_archive_order":50,"model":"DEQ-Transformer (medium, adaptive embed)","metrics":{"Number of params":"110M","Test perplexity":"23.2"},"uses_additional_data":false,"paper_date":"2019-09-03","paper":"/paper/deep-equilibrium-models","paper_url":"https://arxiv.org/abs/1909.01377v2","paper_title":"Deep Equilibrium Models","code":"https://github.com/locuslab/deq","n_code_links":11,"syntology":{"n_ran":3,"n_unverified":9,"n_samples":12,"n_pointer_only_licence":4}},{"rank_in_archive_order":51,"model":"TaLK Convolutions","metrics":{"Number of params":"240M","Test perplexity":"23.3"},"uses_additional_data":false,"paper_date":"2020-02-08","paper":"/paper/time-aware-large-kernel-convolutions","paper_url":"https://arxiv.org/abs/2002.03184v2","paper_title":"Time-aware Large Kernel Convolutions","code":"https://github.com/lioutasb/TaLKConvolutions","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":52,"model":"Rfa-Gate-Gaussian-Stateful (Big)","metrics":{"Test perplexity":"23.5","Validation perplexity":"22"},"uses_additional_data":false,"paper_date":"2021-03-03","paper":"/paper/random-feature-attention-1","paper_url":"https://arxiv.org/abs/2103.02143v2","paper_title":"Random Feature Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":53,"model":"Hybrid H3 (125M)","metrics":{"Number of params":"125M","Test perplexity":"23.7"},"uses_additional_data":true,"paper_date":"2022-12-28","paper":"/paper/hungry-hungry-hippos-towards-language","paper_url":"https://arxiv.org/abs/2212.14052v3","paper_title":"Hungry Hungry Hippos: Towards Language Modeling with State Space Models","code":"https://github.com/hazyresearch/safari","n_code_links":3,"syntology":{"n_ran":7,"n_unverified":8,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"Transformer-XL Standard","metrics":{"Number of params":"151M","Test perplexity":"24.0","Validation perplexity":"23.1"},"uses_additional_data":false,"paper_date":"2019-01-09","paper":"/paper/transformer-xl-attentive-language-models","paper_url":"https://arxiv.org/abs/1901.02860v3","paper_title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","code":"https://github.com/huggingface/transformers","n_code_links":37,"syntology":{"n_ran":63,"n_unverified":80,"n_samples":143,"n_pointer_only_licence":43}},{"rank_in_archive_order":55,"model":"DeLighT","metrics":{"Number of params":"99M","Test perplexity":"24.14"},"uses_additional_data":false,"paper_date":"2020-08-03","paper":"/paper/delight-very-deep-and-light-weight","paper_url":"https://arxiv.org/abs/2008.00623v2","paper_title":"DeLighT: Deep and Light-weight Transformer","code":"https://github.com/sacmehta/delight","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"[?]-former (Sticky memories)","metrics":{"Test perplexity":"24.22"},"uses_additional_data":false,"paper_date":"2021-09-01","paper":"/paper/infty-former-infinite-memory-transformer","paper_url":"https://arxiv.org/abs/2109.00301v3","paper_title":"$\\infty$-former: Infinite Memory Transformer","code":"https://github.com/deep-spin/infinite-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":57,"model":"\\infty-former (Sticky memories)","metrics":{"Test perplexity":"24.22"},"uses_additional_data":false,"paper_date":"2021-09-01","paper":"/paper/infty-former-infinite-memory-transformer","paper_url":"https://arxiv.org/abs/2109.00301v3","paper_title":"$\\infty$-former: Infinite Memory Transformer","code":"https://github.com/deep-spin/infinite-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":58,"model":"∞-former (Sticky memories)","metrics":{"Test perplexity":"24.22"},"uses_additional_data":false,"paper_date":"2021-09-01","paper":"/paper/infty-former-infinite-memory-transformer","paper_url":"https://arxiv.org/abs/2109.00301v3","paper_title":"$\\infty$-former: Infinite Memory Transformer","code":"https://github.com/deep-spin/infinite-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":59,"model":"Transformer-N","metrics":{"Number of params":"148M","Test perplexity":"25.2","Validation perplexity":"24.1"},"uses_additional_data":false,"paper_date":"2021-04-08","paper":"/paper/revisiting-simple-neural-probabilistic","paper_url":"https://arxiv.org/abs/2104.03474v1","paper_title":"Revisiting Simple Neural Probabilistic Language Models","code":"https://github.com/SimengSun/revisit-nplm","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"Linear Attention 125M","metrics":{"Test perplexity":"25.6"},"uses_additional_data":false,"paper_date":"2020-06-29","paper":"/paper/transformers-are-rnns-fast-autoregressive","paper_url":"https://arxiv.org/abs/2006.16236v3","paper_title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","code":"https://github.com/idiap/fast-transformers","n_code_links":8,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":3}},{"rank_in_archive_order":61,"model":"FNetAR Medium","metrics":{"Number of params":"144.4M","Test perplexity":"25.81"},"uses_additional_data":false,"paper_date":"2021-07-22","paper":"/paper/fnetar-mixing-tokens-with-autoregressive","paper_url":"https://arxiv.org/abs/2107.10932v1","paper_title":"FNetAR: Mixing Tokens with Autoregressive Fourier Transforms","code":"https://github.com/MindCode-4/code-3/tree/main/fnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":62,"model":"Reformer 125M","metrics":{"Test perplexity":"26.0"},"uses_additional_data":false,"paper_date":"2020-01-13","paper":"/paper/reformer-the-efficient-transformer-1","paper_url":"https://arxiv.org/abs/2001.04451v2","paper_title":"Reformer: The Efficient Transformer","code":"https://github.com/huggingface/transformers","n_code_links":10,"syntology":{"n_ran":6,"n_unverified":2,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"GPT-2 Medium","metrics":{"Number of params":"355M","Test perplexity":"26.37"},"uses_additional_data":true,"paper_date":"2019-02-14","paper":"/paper/language-models-are-unsupervised-multitask","paper_url":"https://d4mucfpksywv.cloudfront.net/better-language-models/language-models.pdf","paper_title":"Language Models are Unsupervised Multitask Learners","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":null},{"rank_in_archive_order":64,"model":"Performer 125M","metrics":{"Test perplexity":"26.8"},"uses_additional_data":false,"paper_date":"2020-09-30","paper":"/paper/rethinking-attention-with-performers","paper_url":"https://arxiv.org/abs/2009.14794v4","paper_title":"Rethinking Attention with Performers","code":"https://github.com/tensorflow/models/tree/master/official/nlp/modeling","n_code_links":7,"syntology":{"n_ran":9,"n_unverified":7,"n_samples":16,"n_pointer_only_licence":6}},{"rank_in_archive_order":65,"model":"AdvSoft (+ 4 layer QRNN + dynamic eval)","metrics":{"Test perplexity":"28.0","Validation perplexity":"27.2"},"uses_additional_data":false,"paper_date":"2019-06-10","paper":"/paper/improving-neural-language-modeling-via","paper_url":"https://arxiv.org/abs/1906.03805v2","paper_title":"Improving Neural Language Modeling via Adversarial Training","code":"https://github.com/ChengyueGongR/advsoft","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"DEQ-TrellisNet","metrics":{"Number of params":"180M","Test perplexity":"29.0"},"uses_additional_data":false,"paper_date":"2019-09-03","paper":"/paper/deep-equilibrium-models","paper_url":"https://arxiv.org/abs/1909.01377v2","paper_title":"Deep Equilibrium Models","code":"https://github.com/locuslab/deq","n_code_links":11,"syntology":{"n_ran":3,"n_unverified":9,"n_samples":12,"n_pointer_only_licence":4}},{"rank_in_archive_order":67,"model":"Trellis Network","metrics":{"Test perplexity":"29.19"},"uses_additional_data":false,"paper_date":"2018-10-15","paper":"/paper/trellis-networks-for-sequence-modeling","paper_url":"http://arxiv.org/abs/1810.06682v2","paper_title":"Trellis Networks for Sequence Modeling","code":"https://github.com/locuslab/trellisnet","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"LSTM (Hebbian, Cache, MbPA)","metrics":{"Test perplexity":"29.2","Validation perplexity":"29.0"},"uses_additional_data":false,"paper_date":"2018-03-27","paper":"/paper/fast-parametric-learning-with-activation","paper_url":"http://arxiv.org/abs/1803.10049v1","paper_title":"Fast Parametric Learning with Activation Memorization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":69,"model":"LSTM (Hebbian, Cache)","metrics":{"Test perplexity":"29.7","Validation perplexity":"29.9"},"uses_additional_data":false,"paper_date":"2018-03-27","paper":"/paper/fast-parametric-learning-with-activation","paper_url":"http://arxiv.org/abs/1803.10049v1","paper_title":"Fast Parametric Learning with Activation Memorization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":70,"model":"Rfa-Gate-Gaussian-Stateful (Small)","metrics":{"Test perplexity":"30.5","Validation perplexity":"29.4"},"uses_additional_data":false,"paper_date":"2021-03-03","paper":"/paper/random-feature-attention-1","paper_url":"https://arxiv.org/abs/2103.02143v2","paper_title":"Random Feature Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":71,"model":"Primal.+Trans.","metrics":{"Test perplexity":"31.0"},"uses_additional_data":false,"paper_date":"2023-05-31","paper":"/paper/primal-attention-self-attention-through","paper_url":"https://arxiv.org/abs/2305.19798v2","paper_title":"Primal-Attention: Self-attention through Asymmetric Kernel SVD in Primal Representation","code":"https://github.com/yingyichen-cyy/PrimalAttention","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":72,"model":"LSTM (RMC)","metrics":{"Test perplexity":"31.6","Validation perplexity":"30.8"},"uses_additional_data":false,"paper_date":"2018-06-05","paper":"/paper/relational-recurrent-neural-networks","paper_url":"http://arxiv.org/abs/1806.01822v2","paper_title":"Relational recurrent neural networks","code":"https://github.com/L0SG/relational-rnn-pytorch","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":73,"model":"DEQ-Transformer (small)","metrics":{"Number of params":"138M","Test perplexity":"32.4"},"uses_additional_data":false,"paper_date":"2019-09-03","paper":"/paper/deep-equilibrium-models","paper_url":"https://arxiv.org/abs/1909.01377v2","paper_title":"Deep Equilibrium Models","code":"https://github.com/locuslab/deq","n_code_links":11,"syntology":{"n_ran":3,"n_unverified":9,"n_samples":12,"n_pointer_only_licence":4}},{"rank_in_archive_order":74,"model":"AWD-LSTM-MoS + ATOI","metrics":{"Test perplexity":"32.85","Validation perplexity":"31.92"},"uses_additional_data":false,"paper_date":"2019-09-18","paper":"/paper/alleviating-sequence-information-loss-with","paper_url":"https://arxiv.org/abs/1909.08700v1","paper_title":"Alleviating Sequence Information Loss with Data Overlapping and Prime Batch Sizes","code":"https://github.com/nkcr/overlap-ml","n_code_links":1,"syntology":null},{"rank_in_archive_order":75,"model":"4 layer QRNN","metrics":{"Number of params":"151M","Test perplexity":"33.0","Validation perplexity":"32.0"},"uses_additional_data":false,"paper_date":"2018-03-22","paper":"/paper/an-analysis-of-neural-language-modeling-at","paper_url":"http://arxiv.org/abs/1803.08240v1","paper_title":"An Analysis of Neural Language Modeling at Multiple Scales","code":"https://github.com/salesforce/awd-lstm-lm","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":15,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":76,"model":"LSTM (Hebbian)","metrics":{"Test perplexity":"34.3","Validation perplexity":"34.1"},"uses_additional_data":false,"paper_date":"2018-03-27","paper":"/paper/fast-parametric-learning-with-activation","paper_url":"http://arxiv.org/abs/1803.10049v1","paper_title":"Fast Parametric Learning with Activation Memorization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":77,"model":"LSTM","metrics":{"Test perplexity":"36.4","Validation perplexity":"36.0"},"uses_additional_data":false,"paper_date":"2018-03-27","paper":"/paper/fast-parametric-learning-with-activation","paper_url":"http://arxiv.org/abs/1803.10049v1","paper_title":"Fast Parametric Learning with Activation Memorization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":78,"model":"GCNN-8","metrics":{"Test perplexity":"37.2","Validation perplexity":"-"},"uses_additional_data":false,"paper_date":"2016-12-23","paper":"/paper/language-modeling-with-gated-convolutional","paper_url":"http://arxiv.org/abs/1612.08083v3","paper_title":"Language Modeling with Gated Convolutional Networks","code":"https://github.com/facebookresearch/fairseq","n_code_links":11,"syntology":null},{"rank_in_archive_order":79,"model":"GPT-2 Small","metrics":{"Number of params":"124M","Test perplexity":"37.50"},"uses_additional_data":true,"paper_date":"2019-02-14","paper":"/paper/language-models-are-unsupervised-multitask","paper_url":"https://d4mucfpksywv.cloudfront.net/better-language-models/language-models.pdf","paper_title":"Language Models are Unsupervised Multitask Learners","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":null},{"rank_in_archive_order":80,"model":"Neural cache model (size = 2,000)","metrics":{"Test perplexity":"40.8"},"uses_additional_data":false,"paper_date":"2016-12-13","paper":"/paper/improving-neural-language-models-with-a","paper_url":"http://arxiv.org/abs/1612.04426v1","paper_title":"Improving Neural Language Models with a Continuous Cache","code":"https://github.com/dmlc/gluon-nlp","n_code_links":14,"syntology":null},{"rank_in_archive_order":81,"model":"Neural cache model (size = 100)","metrics":{"Test perplexity":"44.8"},"uses_additional_data":false,"paper_date":"2016-12-13","paper":"/paper/improving-neural-language-models-with-a","paper_url":"http://arxiv.org/abs/1612.04426v1","paper_title":"Improving Neural Language Models with a Continuous Cache","code":"https://github.com/dmlc/gluon-nlp","n_code_links":14,"syntology":null},{"rank_in_archive_order":82,"model":"GCNN-8","metrics":{"Test perplexity":"44.9"},"uses_additional_data":false,"paper_date":"2016-12-23","paper":"/paper/language-modeling-with-gated-convolutional","paper_url":"http://arxiv.org/abs/1612.08083v3","paper_title":"Language Modeling with Gated Convolutional Networks","code":"https://github.com/facebookresearch/fairseq","n_code_links":11,"syntology":null},{"rank_in_archive_order":83,"model":"TCN","metrics":{"Test perplexity":"45.19"},"uses_additional_data":false,"paper_date":"2018-03-04","paper":"/paper/an-empirical-evaluation-of-generic","paper_url":"http://arxiv.org/abs/1803.01271v2","paper_title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","code":"https://github.com/timeseriesAI/tsai/tree/main/tsai/models","n_code_links":35,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":1}},{"rank_in_archive_order":84,"model":"Temporal CNN","metrics":{"Test perplexity":"45.2","Validation perplexity":"-"},"uses_additional_data":false,"paper_date":"2018-01-01","paper":"/paper/convolutional-sequence-modeling-revisited","paper_url":"https://openreview.net/forum?id=rk8wKk-R-","paper_title":"Convolutional Sequence Modeling Revisited","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":85,"model":"LSTM","metrics":{"Test perplexity":"48.7"},"uses_additional_data":false,"paper_date":"2016-12-13","paper":"/paper/improving-neural-language-models-with-a","paper_url":"http://arxiv.org/abs/1612.04426v1","paper_title":"Improving Neural Language Models with a Continuous Cache","code":"https://github.com/dmlc/gluon-nlp","n_code_links":14,"syntology":null},{"rank_in_archive_order":86,"model":"Transformer  (Adaptive inputs)","metrics":{"Validation perplexity":"19.5"},"uses_additional_data":false,"paper_date":"2019-10-09","paper":"/paper/on-the-adequacy-of-untuned-warmup-for","paper_url":"https://arxiv.org/abs/1910.04209v3","paper_title":"On the adequacy of untuned warmup for adaptive optimization","code":"https://github.com/Tony-Y/pytorch_warmup","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":87,"model":"LSTM","metrics":{"Validation perplexity":"52.73"},"uses_additional_data":false,"paper_date":"2020-05-17","paper":"/paper/how-much-complexity-does-an-rnn-architecture","paper_url":"https://arxiv.org/abs/2005.08199v2","paper_title":"How much complexity does an RNN architecture need to learn syntax-sensitive dependencies?","code":"https://github.com/bhattg/Decay-RNN-ACL-SRW2020","n_code_links":1,"syntology":null},{"rank_in_archive_order":88,"model":"GRU","metrics":{"Validation perplexity":"53.78"},"uses_additional_data":false,"paper_date":"2020-05-17","paper":"/paper/how-much-complexity-does-an-rnn-architecture","paper_url":"https://arxiv.org/abs/2005.08199v2","paper_title":"How much complexity does an RNN architecture need to learn syntax-sensitive dependencies?","code":"https://github.com/bhattg/Decay-RNN-ACL-SRW2020","n_code_links":1,"syntology":null},{"rank_in_archive_order":89,"model":"Decay RNN","metrics":{"Validation perplexity":"76.67"},"uses_additional_data":false,"paper_date":"2020-05-17","paper":"/paper/how-much-complexity-does-an-rnn-architecture","paper_url":"https://arxiv.org/abs/2005.08199v2","paper_title":"How much complexity does an RNN architecture need to learn syntax-sensitive dependencies?","code":"https://github.com/bhattg/Decay-RNN-ACL-SRW2020","n_code_links":1,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":42,"rows_with_any_sample_ran":38,"distinct_papers_with_graph_line":31,"distinct_papers_with_any_sample_ran":27,"samples_over_distinct_papers":{"n_ran":210,"n_unverified":251,"n_samples":461,"n_pointer_only_licence":109,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":319,"n_unverified":381,"n_samples":700,"n_pointer_only_licence":166,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}