{"url":"/sota/sentence-completion-on-hellaswag","task":{"name":"Sentence Completion","url":"/task/sentence-completion","note":null},"dataset":{"name":"HellaSwag","url":"/dataset/hellaswag"},"category":"Natural Language Processing","categories":["Natural Language Processing"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Accuracy":"higher"}},"counts":{"rows":89,"rows_with_code":71,"rows_with_paper_page":86,"rows_dated":86,"rows_using_additional_data":1},"rows":[{"rank_in_archive_order":1,"model":"CompassMTL 567M with Tailor","metrics":{"Accuracy":"96.1"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/task-compass-scaling-multi-task-pre-training","paper_url":"https://arxiv.org/abs/2210.06277v1","paper_title":"Task Compass: Scaling Multi-task Pre-training with Task Prefix","code":"https://github.com/cooelf/compassmtl","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"CompassMTL 567M","metrics":{"Accuracy":"95.6"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/task-compass-scaling-multi-task-pre-training","paper_url":"https://arxiv.org/abs/2210.06277v1","paper_title":"Task Compass: Scaling Multi-task Pre-training with Task Prefix","code":"https://github.com/cooelf/compassmtl","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"DeBERTa-Large 304M (classification-based)","metrics":{"Accuracy":"95.6"},"uses_additional_data":false,"paper_date":"2022-10-29","paper":"/paper/two-is-better-than-many-binary-classification","paper_url":"https://arxiv.org/abs/2210.16495v1","paper_title":"Two is Better than Many? Binary Classification as an Effective Approach to Multi-Choice Question Answering","code":"https://github.com/declare-lab/team","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"GPT-4 (10-shot)","metrics":{"Accuracy":"95.3"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/gpt-4-technical-report-1","paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","code":"https://github.com/openai/evals","n_code_links":11,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":5,"model":"LLaMA3+MoSLoRA","metrics":{"Accuracy":"95.0"},"uses_additional_data":false,"paper_date":"2024-06-16","paper":"/paper/mixture-of-subspaces-in-low-rank-adaptation","paper_url":"https://arxiv.org/abs/2406.11909v3","paper_title":"Mixture-of-Subspaces in Low-Rank Adaptation","code":"https://github.com/wutaiqiang/moslora","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":6,"model":"DeBERTa-Large 304M","metrics":{"Accuracy":"94.7"},"uses_additional_data":false,"paper_date":"2022-10-29","paper":"/paper/two-is-better-than-many-binary-classification","paper_url":"https://arxiv.org/abs/2210.16495v1","paper_title":"Two is Better than Many? Binary Classification as an Effective Approach to Multi-Choice Question Answering","code":"https://github.com/declare-lab/team","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"LLaMA-2 13B + MixLoRA","metrics":{"Accuracy":"94.7"},"uses_additional_data":false,"paper_date":"2024-04-22","paper":"/paper/mixlora-enhancing-large-language-models-fine","paper_url":"https://arxiv.org/abs/2404.15159v3","paper_title":"MixLoRA: Enhancing Large Language Models Fine-Tuning with LoRA-based Mixture of Experts","code":"https://github.com/TUDB-Labs/MixLoRA","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"Unicorn 11B (fine-tuned)","metrics":{"Accuracy":"93.9"},"uses_additional_data":true,"paper_date":"2021-03-24","paper":"/paper/unicorn-on-rainbow-a-universal-commonsense","paper_url":"https://arxiv.org/abs/2103.13009v1","paper_title":"UNICORN on RAINBOW: A Universal Commonsense Reasoning Model on a New Multitask Benchmark","code":"https://github.com/allenai/rainbow","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"LLaMA-3 8B + MixLoRA","metrics":{"Accuracy":"93.3"},"uses_additional_data":false,"paper_date":"2024-04-22","paper":"/paper/mixlora-enhancing-large-language-models-fine","paper_url":"https://arxiv.org/abs/2404.15159v3","paper_title":"MixLoRA: Enhancing Large Language Models Fine-Tuning with LoRA-based Mixture of Experts","code":"https://github.com/TUDB-Labs/MixLoRA","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"LLaMA-2 7B + MixLoRA","metrics":{"Accuracy":"93.1"},"uses_additional_data":false,"paper_date":"2024-04-22","paper":"/paper/mixlora-enhancing-large-language-models-fine","paper_url":"https://arxiv.org/abs/2404.15159v3","paper_title":"MixLoRA: Enhancing Large Language Models Fine-Tuning with LoRA-based Mixture of Experts","code":"https://github.com/TUDB-Labs/MixLoRA","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"DeBERTa++","metrics":{"Accuracy":"93"},"uses_additional_data":false,"paper_date":"2020-06-05","paper":"/paper/deberta-decoding-enhanced-bert-with","paper_url":"https://arxiv.org/abs/2006.03654v6","paper_title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","code":"https://github.com/huggingface/transformers","n_code_links":14,"syntology":{"n_ran":4,"n_unverified":9,"n_samples":13,"n_pointer_only_licence":3}},{"rank_in_archive_order":12,"model":"ELECTRA-Large 335M (fine-tuned on DiscoSense and HellaSwag)","metrics":{"Accuracy":"91.5"},"uses_additional_data":false,"paper_date":"2022-10-22","paper":"/paper/discosense-commonsense-reasoning-with","paper_url":"https://arxiv.org/abs/2210.12478v1","paper_title":"DiscoSense: Commonsense Reasoning with Discourse Connectives","code":"https://github.com/prajjwal1/discosense","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"DBRX Instruct 132B (10-shot)","metrics":{"Accuracy":"89"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":14,"model":"TheBloke/llama-2-70b-Guanaco-QLoRA-fp16 (10-shot)","metrics":{"Accuracy":"88.3"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":15,"model":"ALBERT-XXL 235M","metrics":{"Accuracy":"88"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":16,"model":"PaLM 2-L (1-shot)","metrics":{"Accuracy":"87.4"},"uses_additional_data":false,"paper_date":"2023-05-17","paper":"/paper/palm-2-technical-report-1","paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","code":"https://github.com/eternityyw/tram-benchmark","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"ELECTRA-Large 335M (fine-tuned on HellaSwag)","metrics":{"Accuracy":"86.9"},"uses_additional_data":false,"paper_date":"2022-10-22","paper":"/paper/discosense-commonsense-reasoning-with","paper_url":"https://arxiv.org/abs/2210.12478v1","paper_title":"DiscoSense: Commonsense Reasoning with Discourse Connectives","code":"https://github.com/prajjwal1/discosense","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"PaLM 2-M (1-shot)","metrics":{"Accuracy":"86.7"},"uses_additional_data":false,"paper_date":"2023-05-17","paper":"/paper/palm-2-technical-report-1","paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","code":"https://github.com/eternityyw/tram-benchmark","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"MUPPET Roberta Large","metrics":{"Accuracy":"86.4"},"uses_additional_data":false,"paper_date":"2021-01-26","paper":"/paper/muppet-massive-multi-task-representations","paper_url":"https://arxiv.org/abs/2101.11038v1","paper_title":"Muppet: Massive Multi-task Representations with Pre-Finetuning","code":"https://huggingface.co/facebook/muppet-roberta-base","n_code_links":2,"syntology":null},{"rank_in_archive_order":20,"model":"LLaMA 65B + CFG (0-shot)","metrics":{"Accuracy":"86.3"},"uses_additional_data":false,"paper_date":"2023-06-30","paper":"/paper/stay-on-topic-with-classifier-free-guidance","paper_url":"https://arxiv.org/abs/2306.17806v1","paper_title":"Stay on topic with Classifier-Free Guidance","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":21,"model":"Falcon-180B (0-shot)","metrics":{"Accuracy":"85.9"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/the-falcon-series-of-open-language-models","paper_url":"https://arxiv.org/abs/2311.16867v2","paper_title":"The Falcon Series of Open Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":22,"model":"PaLM 2-S (1-shot)","metrics":{"Accuracy":"85.6"},"uses_additional_data":false,"paper_date":"2023-05-17","paper":"/paper/palm-2-technical-report-1","paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","code":"https://github.com/eternityyw/tram-benchmark","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"GPT-3.5 (10-shot)","metrics":{"Accuracy":"85.5"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/gpt-4-technical-report-1","paper_url":"https://arxiv.org/abs/2303.08774v5","paper_title":"GPT-4 Technical Report","code":"https://github.com/openai/evals","n_code_links":11,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":24,"model":"RoBERTa-Large Ensemble","metrics":{"Accuracy":"85.5"},"uses_additional_data":false,"paper_date":"2019-07-26","paper":"/paper/roberta-a-robustly-optimized-bert-pretraining","paper_url":"https://arxiv.org/abs/1907.11692v1","paper_title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","code":"https://github.com/huggingface/transformers","n_code_links":67,"syntology":{"n_ran":37,"n_unverified":11,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":25,"model":"LLaMA 30B + CFG (0-shot)","metrics":{"Accuracy":"85.3"},"uses_additional_data":false,"paper_date":"2023-06-30","paper":"/paper/stay-on-topic-with-classifier-free-guidance","paper_url":"https://arxiv.org/abs/2306.17806v1","paper_title":"Stay on topic with Classifier-Free Guidance","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":26,"model":"LLaMA 2 70B (0-shot)","metrics":{"Accuracy":"85.3"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":27,"model":"HyKAS+CSKG","metrics":{"Accuracy":"85.0"},"uses_additional_data":false,"paper_date":"2019-10-30","paper":"/paper/towards-generalizable-neuro-symbolic-systems","paper_url":"https://arxiv.org/abs/1910.14087v1","paper_title":"Towards Generalizable Neuro-Symbolic Systems for Commonsense Question Answering","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":28,"model":"LLaMA 65B (0-shot)","metrics":{"Accuracy":"84.2"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":37,"n_unverified":21,"n_samples":58,"n_pointer_only_licence":4}},{"rank_in_archive_order":29,"model":"PaLM-540B (Few-Shot)","metrics":{"Accuracy":"83.8"},"uses_additional_data":false,"paper_date":"2022-04-05","paper":"/paper/palm-scaling-language-modeling-with-pathways-1","paper_url":"https://arxiv.org/abs/2204.02311v5","paper_title":"PaLM: Scaling Language Modeling with Pathways","code":"https://github.com/lucidrains/CoCa-pytorch","n_code_links":7,"syntology":{"n_ran":32,"n_unverified":5,"n_samples":37,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"PaLM-540B (1-shot)","metrics":{"Accuracy":"83.6"},"uses_additional_data":false,"paper_date":"2022-04-05","paper":"/paper/palm-scaling-language-modeling-with-pathways-1","paper_url":"https://arxiv.org/abs/2204.02311v5","paper_title":"PaLM: Scaling Language Modeling with Pathways","code":"https://github.com/lucidrains/CoCa-pytorch","n_code_links":7,"syntology":{"n_ran":32,"n_unverified":5,"n_samples":37,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"ExDeBERTa 567M","metrics":{"Accuracy":"83.6"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/task-compass-scaling-multi-task-pre-training","paper_url":"https://arxiv.org/abs/2210.06277v1","paper_title":"Task Compass: Scaling Multi-task Pre-training with Task Prefix","code":"https://github.com/cooelf/compassmtl","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"PaLM-540B (0-shot)","metrics":{"Accuracy":"83.4"},"uses_additional_data":false,"paper_date":"2022-04-05","paper":"/paper/palm-scaling-language-modeling-with-pathways-1","paper_url":"https://arxiv.org/abs/2204.02311v5","paper_title":"PaLM: Scaling Language Modeling with Pathways","code":"https://github.com/lucidrains/CoCa-pytorch","n_code_links":7,"syntology":{"n_ran":32,"n_unverified":5,"n_samples":37,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"LLaMA 2 34B (0-shot)","metrics":{"Accuracy":"83.3"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":34,"model":"Camelidae-8×34B (10-shot)","metrics":{"Accuracy":"83.2"},"uses_additional_data":false,"paper_date":"2024-01-05","paper":"/paper/parameter-efficient-sparsity-crafting-from","paper_url":"https://arxiv.org/abs/2401.02731v4","paper_title":"Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks","code":"https://github.com/wuhy68/parameter-efficient-moe","n_code_links":2,"syntology":null},{"rank_in_archive_order":35,"model":"LLaMA 33B (0-shot)","metrics":{"Accuracy":"82.8"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":37,"n_unverified":21,"n_samples":58,"n_pointer_only_licence":4}},{"rank_in_archive_order":36,"model":"Falcon-40B (0-shot)","metrics":{"Accuracy":"82.7"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/the-falcon-series-of-open-language-models","paper_url":"https://arxiv.org/abs/2311.16867v2","paper_title":"The Falcon Series of Open Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":37,"model":"Megatron-Turing NLG 530B (Few-Shot)","metrics":{"Accuracy":"82.4"},"uses_additional_data":false,"paper_date":"2022-01-28","paper":"/paper/using-deepspeed-and-megatron-to-train","paper_url":"https://arxiv.org/abs/2201.11990v3","paper_title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","code":"https://github.com/microsoft/DeepSpeed","n_code_links":2,"syntology":null},{"rank_in_archive_order":38,"model":"Qwen2idae-16x14B (10-shot)","metrics":{"Accuracy":"82.3"},"uses_additional_data":false,"paper_date":"2024-01-05","paper":"/paper/parameter-efficient-sparsity-crafting-from","paper_url":"https://arxiv.org/abs/2401.02731v4","paper_title":"Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks","code":"https://github.com/wuhy68/parameter-efficient-moe","n_code_links":2,"syntology":null},{"rank_in_archive_order":39,"model":"LLaMA 13B + CFG (0-shot)","metrics":{"Accuracy":"82.1"},"uses_additional_data":false,"paper_date":"2023-06-30","paper":"/paper/stay-on-topic-with-classifier-free-guidance","paper_url":"https://arxiv.org/abs/2306.17806v1","paper_title":"Stay on topic with Classifier-Free Guidance","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":40,"model":"RoBERTa-Large 355M","metrics":{"Accuracy":"81.7"},"uses_additional_data":false,"paper_date":"2019-07-26","paper":"/paper/roberta-a-robustly-optimized-bert-pretraining","paper_url":"https://arxiv.org/abs/1907.11692v1","paper_title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","code":"https://github.com/huggingface/transformers","n_code_links":67,"syntology":{"n_ran":37,"n_unverified":11,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":41,"model":"Mistral 7B (0-shot)","metrics":{"Accuracy":"81.3"},"uses_additional_data":false,"paper_date":"2023-10-10","paper":"/paper/mistral-7b","paper_url":"https://arxiv.org/abs/2310.06825v1","paper_title":"Mistral 7B","code":"https://github.com/mistralai/mistral-src","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":1,"n_samples":11,"n_pointer_only_licence":1}},{"rank_in_archive_order":42,"model":"Chinchilla 70B (0-shot)","metrics":{"Accuracy":"80.8"},"uses_additional_data":false,"paper_date":"2022-03-29","paper":"/paper/training-compute-optimal-large-language","paper_url":"https://arxiv.org/abs/2203.15556v1","paper_title":"Training Compute-Optimal Large Language Models","code":"https://github.com/karpathy/llama2.c","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":3,"n_samples":11,"n_pointer_only_licence":4}},{"rank_in_archive_order":43,"model":"LLaMA 2 13B (0-shot)","metrics":{"Accuracy":"80.7"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":44,"model":"Megatron-Turing NLG 530B (1-shot)","metrics":{"Accuracy":"80.2"},"uses_additional_data":false,"paper_date":"2022-01-28","paper":"/paper/using-deepspeed-and-megatron-to-train","paper_url":"https://arxiv.org/abs/2201.11990v3","paper_title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","code":"https://github.com/microsoft/DeepSpeed","n_code_links":2,"syntology":null},{"rank_in_archive_order":45,"model":"GPT-3 175B (few-shot, k=32)","metrics":{"Accuracy":"79.3"},"uses_additional_data":false,"paper_date":"2020-05-28","paper":"/paper/language-models-are-few-shot-learners","paper_url":"https://arxiv.org/abs/2005.14165v4","paper_title":"Language Models are Few-Shot Learners","code":"https://github.com/ggml-org/llama.cpp","n_code_links":67,"syntology":{"n_ran":41,"n_unverified":24,"n_samples":65,"n_pointer_only_licence":4}},{"rank_in_archive_order":46,"model":"Gopher 280B (0-shot)","metrics":{"Accuracy":"79.2"},"uses_additional_data":false,"paper_date":"2021-12-08","paper":"/paper/scaling-language-models-methods-analysis-1","paper_url":"https://arxiv.org/abs/2112.11446v2","paper_title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","code":"https://github.com/allenai/dolma","n_code_links":3,"syntology":null},{"rank_in_archive_order":47,"model":"LLaMA 13B (0-shot)","metrics":{"Accuracy":"79.2"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":37,"n_unverified":21,"n_samples":58,"n_pointer_only_licence":4}},{"rank_in_archive_order":48,"model":"GPT-3 (0-shot)","metrics":{"Accuracy":"78.9"},"uses_additional_data":false,"paper_date":"2020-05-28","paper":"/paper/language-models-are-few-shot-learners","paper_url":"https://arxiv.org/abs/2005.14165v4","paper_title":"Language Models are Few-Shot Learners","code":"https://github.com/ggml-org/llama.cpp","n_code_links":67,"syntology":{"n_ran":41,"n_unverified":24,"n_samples":65,"n_pointer_only_licence":4}},{"rank_in_archive_order":49,"model":"LLaMA 2 7B (0-shot)","metrics":{"Accuracy":"77.2"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":50,"model":"Falcon-7B (0-shot)","metrics":{"Accuracy":"76.3"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/the-falcon-series-of-open-language-models","paper_url":"https://arxiv.org/abs/2311.16867v2","paper_title":"The Falcon Series of Open Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":51,"model":"LLaMA 7B (0-shot)","metrics":{"Accuracy":"76.1"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":37,"n_unverified":21,"n_samples":58,"n_pointer_only_licence":4}},{"rank_in_archive_order":52,"model":"BlooombergGPT 50B (1-shot)","metrics":{"Accuracy":"73.9"},"uses_additional_data":false,"paper_date":"2023-03-30","paper":"/paper/bloomberggpt-a-large-language-model-for","paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","code":"https://github.com/yangletliu/finlora","n_code_links":2,"syntology":null},{"rank_in_archive_order":53,"model":"OPT 66B (1-shot)","metrics":{"Accuracy":"73.5"},"uses_additional_data":false,"paper_date":"2023-03-30","paper":"/paper/bloomberggpt-a-large-language-model-for","paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","code":"https://github.com/yangletliu/finlora","n_code_links":2,"syntology":null},{"rank_in_archive_order":54,"model":"BLOOM 176B (1-shot)","metrics":{"Accuracy":"73.2"},"uses_additional_data":false,"paper_date":"2023-03-30","paper":"/paper/bloomberggpt-a-large-language-model-for","paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","code":"https://github.com/yangletliu/finlora","n_code_links":2,"syntology":null},{"rank_in_archive_order":55,"model":"Sheared-LLaMA-2.7B (50B)","metrics":{"Accuracy":"70.8"},"uses_additional_data":false,"paper_date":"2023-10-10","paper":"/paper/sheared-llama-accelerating-language-model-pre","paper_url":"https://arxiv.org/abs/2310.06694v2","paper_title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","code":"https://github.com/princeton-nlp/llm-shearing","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"GPT-NeoX 20B (1-shot)","metrics":{"Accuracy":"68.4"},"uses_additional_data":false,"paper_date":"2023-03-30","paper":"/paper/bloomberggpt-a-large-language-model-for","paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","code":"https://github.com/yangletliu/finlora","n_code_links":2,"syntology":null},{"rank_in_archive_order":57,"model":"Open-LLaMA-3B-v2","metrics":{"Accuracy":"67.6"},"uses_additional_data":false,"paper_date":"2023-10-10","paper":"/paper/sheared-llama-accelerating-language-model-pre","paper_url":"https://arxiv.org/abs/2310.06694v2","paper_title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","code":"https://github.com/princeton-nlp/llm-shearing","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":58,"model":"Mamba-2.8B","metrics":{"Accuracy":"66.1"},"uses_additional_data":false,"paper_date":"2023-12-01","paper":"/paper/mamba-linear-time-sequence-modeling-with","paper_url":"https://arxiv.org/abs/2312.00752v2","paper_title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","code":"https://github.com/state-spaces/mamba","n_code_links":35,"syntology":{"n_ran":27,"n_unverified":35,"n_samples":62,"n_pointer_only_licence":28}},{"rank_in_archive_order":59,"model":"Sheared-LLaMA-1.3B (50B)","metrics":{"Accuracy":"60.7"},"uses_additional_data":false,"paper_date":"2023-10-10","paper":"/paper/sheared-llama-accelerating-language-model-pre","paper_url":"https://arxiv.org/abs/2310.06694v2","paper_title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","code":"https://github.com/princeton-nlp/llm-shearing","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"FLAN 137B (3-shot)","metrics":{"Accuracy":"59.2"},"uses_additional_data":false,"paper_date":"2021-09-03","paper":"/paper/finetuned-language-models-are-zero-shot","paper_url":"https://arxiv.org/abs/2109.01652v5","paper_title":"Finetuned Language Models Are Zero-Shot Learners","code":"https://github.com/hiyouga/llama-efficient-tuning","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":61,"model":"Mamba-1.4B","metrics":{"Accuracy":"59.1"},"uses_additional_data":false,"paper_date":"2023-12-01","paper":"/paper/mamba-linear-time-sequence-modeling-with","paper_url":"https://arxiv.org/abs/2312.00752v2","paper_title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","code":"https://github.com/state-spaces/mamba","n_code_links":35,"syntology":{"n_ran":27,"n_unverified":35,"n_samples":62,"n_pointer_only_licence":28}},{"rank_in_archive_order":62,"model":"FLAN 137B (0-shot)","metrics":{"Accuracy":"56.7"},"uses_additional_data":false,"paper_date":"2021-09-03","paper":"/paper/finetuned-language-models-are-zero-shot","paper_url":"https://arxiv.org/abs/2109.01652v5","paper_title":"Finetuned Language Models Are Zero-Shot Learners","code":"https://github.com/hiyouga/llama-efficient-tuning","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"sMLP – deterministic 9.4B (0-shot)","metrics":{"Accuracy":"54.5"},"uses_additional_data":false,"paper_date":"2022-03-14","paper":"/paper/efficient-language-modeling-with-sparse-all","paper_url":"https://arxiv.org/abs/2203.06850v3","paper_title":"Efficient Language Modeling with Sparse all-MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":64,"model":"Switch Transformer 9B","metrics":{"Accuracy":"52.5"},"uses_additional_data":false,"paper_date":"2022-03-14","paper":"/paper/efficient-language-modeling-with-sparse-all","paper_url":"https://arxiv.org/abs/2203.06850v3","paper_title":"Efficient Language Modeling with Sparse all-MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":65,"model":"GPT-3 Large 760M (0-shot)","metrics":{"Accuracy":"51.0"},"uses_additional_data":false,"paper_date":"2020-05-28","paper":"/paper/language-models-are-few-shot-learners","paper_url":"https://arxiv.org/abs/2005.14165v4","paper_title":"Language Models are Few-Shot Learners","code":"https://github.com/ggml-org/llama.cpp","n_code_links":67,"syntology":{"n_ran":41,"n_unverified":24,"n_samples":65,"n_pointer_only_licence":4}},{"rank_in_archive_order":66,"model":"GPT-2-XL 1.5B","metrics":{"Accuracy":"50.9"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/lamini-lm-a-diverse-herd-of-distilled-models","paper_url":"https://arxiv.org/abs/2304.14402v3","paper_title":"LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions","code":"https://github.com/mbzuai-nlp/lamini-lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":67,"model":"OPT-6.7B","metrics":{"Accuracy":"50.3"},"uses_additional_data":false,"paper_date":"2023-12-12","paper":"/paper/llm-in-a-flash-efficient-large-language-model","paper_url":"https://arxiv.org/abs/2312.11514v3","paper_title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":68,"model":"LLM in a Flash (OPT-6.7B with Predictor)","metrics":{"Accuracy":"49.8"},"uses_additional_data":false,"paper_date":"2023-12-12","paper":"/paper/llm-in-a-flash-efficient-large-language-model","paper_url":"https://arxiv.org/abs/2312.11514v3","paper_title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":69,"model":"FLAN-T5-Large 783M","metrics":{"Accuracy":"48.7"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/lamini-lm-a-diverse-herd-of-distilled-models","paper_url":"https://arxiv.org/abs/2304.14402v3","paper_title":"LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions","code":"https://github.com/mbzuai-nlp/lamini-lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":70,"model":"LaMini-GPT 1.5B","metrics":{"Accuracy":"48.3"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/lamini-lm-a-diverse-herd-of-distilled-models","paper_url":"https://arxiv.org/abs/2304.14402v3","paper_title":"LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions","code":"https://github.com/mbzuai-nlp/lamini-lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":71,"model":"BERT-Large 340M","metrics":{"Accuracy":"47.3"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":72,"model":"LaMini-F-T5 783M","metrics":{"Accuracy":"43.7"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/lamini-lm-a-diverse-herd-of-distilled-models","paper_url":"https://arxiv.org/abs/2304.14402v3","paper_title":"LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions","code":"https://github.com/mbzuai-nlp/lamini-lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":73,"model":"GPT-1 117M","metrics":{"Accuracy":"41.7"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":74,"model":"Flipped-3B","metrics":{"Accuracy":"41.6"},"uses_additional_data":false,"paper_date":"2022-10-06","paper":"/paper/guess-the-instruction-making-language-models","paper_url":"https://arxiv.org/abs/2210.02969v4","paper_title":"Guess the Instruction! Flipped Learning Makes Language Models Stronger Zero-Shot Learners","code":"https://github.com/seonghyeonye/flipped-learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":75,"model":"T0-3B (CoT fine-tuned)","metrics":{"Accuracy":"41.1"},"uses_additional_data":false,"paper_date":"2023-05-23","paper":"/paper/the-cot-collection-improving-zero-shot-and","paper_url":"https://arxiv.org/abs/2305.14045v2","paper_title":"The CoT Collection: Improving Zero-shot and Few-shot Learning of Language Models via Chain-of-Thought Fine-Tuning","code":"https://github.com/kaistai/cot-collection","n_code_links":2,"syntology":null},{"rank_in_archive_order":76,"model":"LaMini-T5 738M","metrics":{"Accuracy":"40.6"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/lamini-lm-a-diverse-herd-of-distilled-models","paper_url":"https://arxiv.org/abs/2304.14402v3","paper_title":"LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions","code":"https://github.com/mbzuai-nlp/lamini-lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"BERT-Base 110M","metrics":{"Accuracy":"40.5"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":78,"model":"T5-Large 738M","metrics":{"Accuracy":"38.9"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/lamini-lm-a-diverse-herd-of-distilled-models","paper_url":"https://arxiv.org/abs/2304.14402v3","paper_title":"LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions","code":"https://github.com/mbzuai-nlp/lamini-lm","n_code_links":1,"syntology":null},{"rank_in_archive_order":79,"model":"Gshard 9B","metrics":{"Accuracy":"38"},"uses_additional_data":false,"paper_date":"2022-03-14","paper":"/paper/efficient-language-modeling-with-sparse-all","paper_url":"https://arxiv.org/abs/2203.06850v3","paper_title":"Efficient Language Modeling with Sparse all-MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":80,"model":"LSTM + BERT-Base","metrics":{"Accuracy":"36.2"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":81,"model":"RoE-3B","metrics":{"Accuracy":"34.6"},"uses_additional_data":false,"paper_date":"2023-02-07","paper":"/paper/exploring-the-benefits-of-training-expert","paper_url":"https://arxiv.org/abs/2302.03202v2","paper_title":"Exploring the Benefits of Training Expert Language Models over Instruction Tuning","code":"https://github.com/joeljang/rlphf","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":82,"model":"ESIM + ElMo","metrics":{"Accuracy":"33.3"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":83,"model":"HASH Layers 10B (0-shot)","metrics":{"Accuracy":"33"},"uses_additional_data":false,"paper_date":"2022-03-14","paper":"/paper/efficient-language-modeling-with-sparse-all","paper_url":"https://arxiv.org/abs/2203.06850v3","paper_title":"Efficient Language Modeling with Sparse all-MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":84,"model":"LSTM + GloVe","metrics":{"Accuracy":"31.7"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":85,"model":"fastText","metrics":{"Accuracy":"31.6"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":86,"model":"LSTM + ElMo","metrics":{"Accuracy":"31.4"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}},{"rank_in_archive_order":87,"model":"Base Layers 10B (0-shot)","metrics":{"Accuracy":"30.2"},"uses_additional_data":false,"paper_date":"2022-03-14","paper":"/paper/efficient-language-modeling-with-sparse-all","paper_url":"https://arxiv.org/abs/2203.06850v3","paper_title":"Efficient Language Modeling with Sparse all-MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":88,"model":"KiC-770M","metrics":{"Accuracy":"29.6"},"uses_additional_data":false,"paper_date":"2022-10-28","paper":"/paper/knowledge-in-context-towards-knowledgeable","paper_url":"https://arxiv.org/abs/2210.16433v3","paper_title":"Knowledge-in-Context: Towards Knowledgeable Semi-Parametric Language Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":89,"model":"Random chance baseline","metrics":{"Accuracy":"25"},"uses_additional_data":false,"paper_date":"2019-05-19","paper":"/paper/hellaswag-can-a-machine-really-finish-your","paper_url":"https://arxiv.org/abs/1905.07830v1","paper_title":"HellaSwag: Can a Machine Really Finish Your Sentence?","code":"https://github.com/facebookresearch/text_characterization_toolkit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":4}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":45,"rows_with_any_sample_ran":43,"distinct_papers_with_graph_line":18,"distinct_papers_with_any_sample_ran":17,"samples_over_distinct_papers":{"n_ran":257,"n_unverified":147,"n_samples":404,"n_pointer_only_licence":97,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":728,"n_unverified":409,"n_samples":1137,"n_pointer_only_licence":249,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}