{"url":"/sota/code-generation-on-mbpp","task":{"name":"Code Generation","url":"/task/code-generation","note":null},"dataset":{"name":"MBPP","url":"/dataset/mbpp"},"category":"Natural Language Processing","categories":["Computer Code","Natural Language Processing","Reasoning"],"category_note":null,"description":"**Code Generation** is an important field to predict explicit code or program structure from multimodal data sources such as incomplete code, programs in another programming language, natural language descriptions or execution examples. Code Generation tools can assist the development of automatic programming tools to improve programming productivity.\r\n\r\n\r\n<span class=\"description-source\">Source: [Deep Learning for Source Code Modeling and Generation ](https://arxiv.org/abs/2002.05442)</span>\r\n\r\nImage source: [Measuring Coding Challenge Competence With APPS](https://paperswithcode.com/paper/measuring-coding-challenge-competence-with)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Accuracy":"higher"}},"counts":{"rows":99,"rows_with_code":88,"rows_with_paper_page":98,"rows_dated":98,"rows_using_additional_data":10},"rows":[{"rank_in_archive_order":1,"model":"EG-CFG (DeepSeek-V3-0324)","metrics":{"Accuracy":"96.6"},"uses_additional_data":false,"paper_date":"2025-06-12","paper":"/paper/execution-guided-line-by-line-code-generation","paper_url":"https://arxiv.org/abs/2506.10948v1","paper_title":"Execution Guided Line-by-Line Code Generation","code":"https://github.com/boazlavon/eg_cfg","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"QualityFlow (Sonnet-3.5)","metrics":{"Accuracy":"94.2"},"uses_additional_data":false,"paper_date":"2025-01-20","paper":"/paper/qualityflow-an-agentic-workflow-for-program","paper_url":"https://arxiv.org/abs/2501.17167v2","paper_title":"QualityFlow: An Agentic Workflow for Program Synthesis Controlled by LLM Quality Checks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"o1-mini + MapCoder (Hamming.ai)","metrics":{"Accuracy":"93.2"},"uses_additional_data":true,"paper_date":"2024-05-18","paper":"/paper/mapcoder-multi-agent-code-generation-for","paper_url":"https://arxiv.org/abs/2405.11403v1","paper_title":"MapCoder: Multi-Agent Code Generation for Competitive Problem Solving","code":"https://github.com/md-ashraful-pramanik/mapcoder","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"MGDebugger (DeepSeek-V3-0324)","metrics":{"Accuracy":"92.4"},"uses_additional_data":false,"paper_date":"2024-10-02","paper":"/paper/from-code-to-correctness-closing-the-last","paper_url":"https://arxiv.org/abs/2410.01215v2","paper_title":"From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging","code":"https://github.com/YerbaPage/MGDebugger","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":1,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"GPT-4 + AgentCoder","metrics":{"Accuracy":"91.8"},"uses_additional_data":false,"paper_date":"2023-12-20","paper":"/paper/agentcoder-multi-agent-based-code-generation","paper_url":"https://arxiv.org/abs/2312.13010v3","paper_title":"AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation","code":"https://github.com/huangd1999/AgentCoder","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":6,"model":"CodeSim (GPT4o)","metrics":{"Accuracy":"90.7"},"uses_additional_data":false,"paper_date":"2025-02-08","paper":"/paper/codesim-multi-agent-code-generation-and-1","paper_url":"https://arxiv.org/abs/2502.05664v1","paper_title":"CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging","code":"https://github.com/kagnlp/CodeGenerator","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"Jiutian-大模型","metrics":{"Accuracy":"90.0"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":8,"model":"GPT-3.5 Turbo (ChatGPT) + AgentCoder","metrics":{"Accuracy":"89.9"},"uses_additional_data":false,"paper_date":"2023-12-20","paper":"/paper/agentcoder-multi-agent-based-code-generation","paper_url":"https://arxiv.org/abs/2312.13010v3","paper_title":"AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation","code":"https://github.com/huangd1999/AgentCoder","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":9,"model":"MapCoder (GPT-4o)","metrics":{"Accuracy":"89.7"},"uses_additional_data":false,"paper_date":"2024-05-18","paper":"/paper/mapcoder-multi-agent-code-generation-for","paper_url":"https://arxiv.org/abs/2405.11403v1","paper_title":"MapCoder: Multi-Agent Code Generation for Competitive Problem Solving","code":"https://github.com/md-ashraful-pramanik/mapcoder","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"GPT-4 (ChatGPT Plus)","metrics":{"Accuracy":"87.5"},"uses_additional_data":false,"paper_date":"2023-07-24","paper":"/paper/chatgpt-for-software-security-exploring-the","paper_url":"https://arxiv.org/abs/2307.12488v5","paper_title":"How Does Naming Affect LLMs on Code Analysis Tasks?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":11,"model":"Claude 3 Opus","metrics":{"Accuracy":"86.4"},"uses_additional_data":false,"paper_date":"2024-03-04","paper":"/paper/the-claude-3-model-family-opus-sonnet-haiku","paper_url":"https://www.anthropic.com/news/claude-3-family","paper_title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"LPW (GPT-4o)","metrics":{"Accuracy":"84.8"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/planning-driven-programming-a-large-language","paper_url":"https://arxiv.org/abs/2411.14503v3","paper_title":"Planning-Driven Programming: A Large Language Model Programming Workflow","code":"https://github.com/you68681/lpw","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":9,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"GPT-3.5 Turbo + FlowGenScrum + Test","metrics":{"Accuracy":"83.8±0.6"},"uses_additional_data":false,"paper_date":"2024-03-23","paper":"/paper/when-llm-based-code-generation-meets-the","paper_url":"https://arxiv.org/abs/2403.15852v2","paper_title":"SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":14,"model":"AFlow(GPT-4o-mini)","metrics":{"Accuracy":"83.4"},"uses_additional_data":false,"paper_date":"2024-10-14","paper":"/paper/aflow-automating-agentic-workflow-generation","paper_url":"https://arxiv.org/abs/2410.10762v4","paper_title":"AFlow: Automating Agentic Workflow Generation","code":"https://github.com/geekan/metagpt","n_code_links":4,"syntology":null},{"rank_in_archive_order":15,"model":"GPT-3.5 Turbo (ChatGPT)","metrics":{"Accuracy":"83.2"},"uses_additional_data":false,"paper_date":"2023-07-24","paper":"/paper/chatgpt-for-software-security-exploring-the","paper_url":"https://arxiv.org/abs/2307.12488v5","paper_title":"How Does Naming Affect LLMs on Code Analysis Tasks?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":16,"model":"EG-CFG (DeepSeek Coder 1.3b Instruct)","metrics":{"Accuracy":"83.2"},"uses_additional_data":false,"paper_date":"2025-06-12","paper":"/paper/execution-guided-line-by-line-code-generation","paper_url":"https://arxiv.org/abs/2506.10948v1","paper_title":"Execution Guided Line-by-Line Code Generation","code":"https://github.com/boazlavon/eg_cfg","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"MapCoder (GPT-4)","metrics":{"Accuracy":"83.1"},"uses_additional_data":false,"paper_date":"2024-05-18","paper":"/paper/mapcoder-multi-agent-code-generation-for","paper_url":"https://arxiv.org/abs/2405.11403v1","paper_title":"MapCoder: Multi-Agent Code Generation for Competitive Problem Solving","code":"https://github.com/md-ashraful-pramanik/mapcoder","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"o1-mini + Language Agent Tree Search (Hamming.ai)","metrics":{"Accuracy":"82.3"},"uses_additional_data":false,"paper_date":"2023-10-06","paper":"/paper/language-agent-tree-search-unifies-reasoning","paper_url":"https://arxiv.org/abs/2310.04406v3","paper_title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","code":"https://github.com/lapisrocks/languageagenttreesearch","n_code_links":2,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"GPT-4 (Bing Chat)","metrics":{"Accuracy":"82"},"uses_additional_data":false,"paper_date":"2023-07-24","paper":"/paper/chatgpt-for-software-security-exploring-the","paper_url":"https://arxiv.org/abs/2307.12488v5","paper_title":"How Does Naming Affect LLMs on Code Analysis Tasks?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":20,"model":"GPT-3.5 Turbo + Language Agent Tree Search","metrics":{"Accuracy":"81.1"},"uses_additional_data":false,"paper_date":"2023-10-06","paper":"/paper/language-agent-tree-search-unifies-reasoning","paper_url":"https://arxiv.org/abs/2310.04406v3","paper_title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","code":"https://github.com/lapisrocks/languageagenttreesearch","n_code_links":2,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"MGDebugger (CodeQwen1.5)","metrics":{"Accuracy":"80.8"},"uses_additional_data":false,"paper_date":"2024-10-02","paper":"/paper/from-code-to-correctness-closing-the-last","paper_url":"https://arxiv.org/abs/2410.01215v2","paper_title":"From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging","code":"https://github.com/YerbaPage/MGDebugger","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":1,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"Claude 3 Haiku","metrics":{"Accuracy":"80.4"},"uses_additional_data":false,"paper_date":"2024-03-04","paper":"/paper/the-claude-3-model-family-opus-sonnet-haiku","paper_url":"https://www.anthropic.com/news/claude-3-family","paper_title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"GPT-4 (Self-Debugging with unit tests + trace)","metrics":{"Accuracy":"80.2"},"uses_additional_data":false,"paper_date":"2023-04-11","paper":"/paper/teaching-large-language-models-to-self-debug","paper_url":"https://arxiv.org/abs/2304.05128v2","paper_title":"Teaching Large Language Models to Self-Debug","code":"https://github.com/amazon-science/SDFeedback","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"GPT-4 (few-shot)","metrics":{"Accuracy":"80"},"uses_additional_data":true,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"Claude 3 Sonnet","metrics":{"Accuracy":"79.4"},"uses_additional_data":false,"paper_date":"2024-03-04","paper":"/paper/the-claude-3-model-family-opus-sonnet-haiku","paper_url":"https://www.anthropic.com/news/claude-3-family","paper_title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":26,"model":"Bard (PaLM 2/chat-bison-001)","metrics":{"Accuracy":"76.2"},"uses_additional_data":false,"paper_date":"2023-07-24","paper":"/paper/chatgpt-for-software-security-exploring-the","paper_url":"https://arxiv.org/abs/2307.12488v5","paper_title":"How Does Naming Affect LLMs on Code Analysis Tasks?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":27,"model":"GPT-3.5 Turbo (Self-Debugging with unit tests + trace)","metrics":{"Accuracy":"72.8"},"uses_additional_data":false,"paper_date":"2023-04-11","paper":"/paper/teaching-large-language-models-to-self-debug","paper_url":"https://arxiv.org/abs/2304.05128v2","paper_title":"Teaching Large Language Models to Self-Debug","code":"https://github.com/amazon-science/SDFeedback","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"Claude","metrics":{"Accuracy":"71.4"},"uses_additional_data":false,"paper_date":"2023-07-24","paper":"/paper/chatgpt-for-software-security-exploring-the","paper_url":"https://arxiv.org/abs/2307.12488v5","paper_title":"How Does Naming Affect LLMs on Code Analysis Tasks?","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"code-davinci-002 175B (Self-Debugging with unit tests + trace)","metrics":{"Accuracy":"70.8"},"uses_additional_data":false,"paper_date":"2023-04-11","paper":"/paper/teaching-large-language-models-to-self-debug","paper_url":"https://arxiv.org/abs/2304.05128v2","paper_title":"Teaching Large Language Models to Self-Debug","code":"https://github.com/amazon-science/SDFeedback","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"GPT-3.5 Turbo (few-shot)","metrics":{"Accuracy":"70.8"},"uses_additional_data":true,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"DeepSeek-Coder-Instruct 33B (few-shot)","metrics":{"Accuracy":"70"},"uses_additional_data":false,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"GPT-3.5 Turbo + INTERVENOR","metrics":{"Accuracy":"69.8"},"uses_additional_data":false,"paper_date":"2023-11-16","paper":"/paper/intervenor-prompt-the-coding-ability-of-large","paper_url":"https://arxiv.org/abs/2311.09868v5","paper_title":"INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of Repair","code":"https://github.com/neuir/intervenor","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"code-davinci-002 175B + LEVER","metrics":{"Accuracy":"68.9"},"uses_additional_data":false,"paper_date":"2023-02-16","paper":"/paper/lever-learning-to-verify-language-to-code","paper_url":"https://arxiv.org/abs/2302.08468v3","paper_title":"LEVER: Learning to Verify Language-to-Code Generation with Execution","code":"https://github.com/niansong1996/lever","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":16,"n_samples":22,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"code-davinci-002 175B + CodeT","metrics":{"Accuracy":"67.7"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/codet-code-generation-with-generated-tests","paper_url":"https://arxiv.org/abs/2207.10397v2","paper_title":"CodeT: Code Generation with Generated Tests","code":"https://github.com/microsoft/codet","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"GPT-3.5 Turbo (3-shot)","metrics":{"Accuracy":"67.6"},"uses_additional_data":true,"paper_date":"2023-04-11","paper":"/paper/teaching-large-language-models-to-self-debug","paper_url":"https://arxiv.org/abs/2304.05128v2","paper_title":"Teaching Large Language Models to Self-Debug","code":"https://github.com/amazon-science/SDFeedback","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"code-davinci-002 175B + Reviewer","metrics":{"Accuracy":"66.9"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":37,"model":"code-davinci-002 175B + Coder-Reviewer","metrics":{"Accuracy":"66.4"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":38,"model":"StarCoder2-15B","metrics":{"Accuracy":"66.2"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/starcoder-2-and-the-stack-v2-the-next","paper_url":"https://arxiv.org/abs/2402.19173v1","paper_title":"StarCoder 2 and The Stack v2: The Next Generation","code":"https://github.com/bigcode-project/starcoder2","n_code_links":4,"syntology":null},{"rank_in_archive_order":39,"model":"DeepSeek-Coder-Base 33B (few-shot)","metrics":{"Accuracy":"66"},"uses_additional_data":false,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":40,"model":"Code Llama - Python 70B (3-shot)","metrics":{"Accuracy":"65.5"},"uses_additional_data":true,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":41,"model":"DeepSeek-Coder-Instruct 6.7B (few-shot)","metrics":{"Accuracy":"65.4"},"uses_additional_data":false,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"code-davinci-002 175B + MBR-Exec","metrics":{"Accuracy":"63"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":43,"model":"Code Llama 70B (3-shot)","metrics":{"Accuracy":"62.4"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":44,"model":"Code Llama - Instruct 70B (3-shot)","metrics":{"Accuracy":"62.2"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":45,"model":"code-davinci-001 175B + CodeT","metrics":{"Accuracy":"61.9"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/codet-code-generation-with-generated-tests","paper_url":"https://arxiv.org/abs/2207.10397v2","paper_title":"CodeT: Code Generation with Generated Tests","code":"https://github.com/microsoft/codet","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"code-davinci-002 175B (3-shot)","metrics":{"Accuracy":"61.4"},"uses_additional_data":true,"paper_date":"2023-04-11","paper":"/paper/teaching-large-language-models-to-self-debug","paper_url":"https://arxiv.org/abs/2304.05128v2","paper_title":"Teaching Large Language Models to Self-Debug","code":"https://github.com/amazon-science/SDFeedback","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"Unnatural Code Llama 34B (3-shot)","metrics":{"Accuracy":"61.2"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":48,"model":"Mixtral 8x7B (3-shot)","metrics":{"Accuracy":"60.7"},"uses_additional_data":false,"paper_date":"2024-01-08","paper":"/paper/mixtral-of-experts","paper_url":"https://arxiv.org/abs/2401.04088v1","paper_title":"Mixtral of Experts","code":"https://github.com/jingyaogong/minimind","n_code_links":6,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"DeepSeek-Coder-Base 6.7B (few-shot)","metrics":{"Accuracy":"60.6"},"uses_additional_data":false,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":50,"model":"code-davinci-001 175B + MBR-Exec","metrics":{"Accuracy":"58.2"},"uses_additional_data":false,"paper_date":"2022-04-25","paper":"/paper/natural-language-to-code-translation-with","paper_url":"https://arxiv.org/abs/2204.11454v2","paper_title":"Natural Language to Code Translation with Execution","code":"https://github.com/facebookresearch/mbr-exec","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":6,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"Code Llama - Instruct 34B (3-shot)","metrics":{"Accuracy":"57"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":52,"model":"Code Llama - Python 34B (3-shot)","metrics":{"Accuracy":"56.2"},"uses_additional_data":true,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":53,"model":"code-cushman-001 12B (CodeT)","metrics":{"Accuracy":"55.4"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/codet-code-generation-with-generated-tests","paper_url":"https://arxiv.org/abs/2207.10397v2","paper_title":"CodeT: Code Generation with Generated Tests","code":"https://github.com/microsoft/codet","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":54,"model":"Code Llama 34B (3-shot)","metrics":{"Accuracy":"55"},"uses_additional_data":true,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":55,"model":"StarCoder 15.5B (Self-Debugging with unit tests + trace)","metrics":{"Accuracy":"53.2"},"uses_additional_data":false,"paper_date":"2023-04-11","paper":"/paper/teaching-large-language-models-to-self-debug","paper_url":"https://arxiv.org/abs/2304.05128v2","paper_title":"Teaching Large Language Models to Self-Debug","code":"https://github.com/amazon-science/SDFeedback","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"StarCoder 15.5B","metrics":{"Accuracy":"52.7"},"uses_additional_data":false,"paper_date":"2023-05-09","paper":"/paper/starcoder-may-the-source-be-with-you","paper_url":"https://arxiv.org/abs/2305.06161v2","paper_title":"StarCoder: may the source be with you!","code":"https://github.com/bigcode-project/starcoder","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":57,"model":"GPT-3.5 Turbo","metrics":{"Accuracy":"52.2"},"uses_additional_data":true,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":58,"model":"WizardCoder 15B","metrics":{"Accuracy":"51.8"},"uses_additional_data":true,"paper_date":"2023-06-14","paper":"/paper/wizardcoder-empowering-code-large-language","paper_url":"https://arxiv.org/abs/2306.08568v1","paper_title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","code":"https://github.com/nlpxucan/wizardlm","n_code_links":4,"syntology":{"n_ran":3,"n_unverified":4,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":59,"model":"PaLM 2-S* (few-shot)","metrics":{"Accuracy":"50"},"uses_additional_data":false,"paper_date":"2023-05-17","paper":"/paper/palm-2-technical-report-1","paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","code":"https://github.com/eternityyw/tram-benchmark","n_code_links":1,"syntology":null},{"rank_in_archive_order":60,"model":"CodeGen-Mono 16B + CodeT","metrics":{"Accuracy":"49.5"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/codet-code-generation-with-generated-tests","paper_url":"https://arxiv.org/abs/2207.10397v2","paper_title":"CodeT: Code Generation with Generated Tests","code":"https://github.com/microsoft/codet","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":61,"model":"Code Llama - Instruct 13B (3-shot)","metrics":{"Accuracy":"49.4"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":62,"model":"DeepSeek-Coder-Instruct 1.3B (few-shot)","metrics":{"Accuracy":"49.4"},"uses_additional_data":false,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"StarCoderBase 15.5B","metrics":{"Accuracy":"49"},"uses_additional_data":false,"paper_date":"2023-05-09","paper":"/paper/starcoder-may-the-source-be-with-you","paper_url":"https://arxiv.org/abs/2305.06161v2","paper_title":"StarCoder: may the source be with you!","code":"https://github.com/bigcode-project/starcoder","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":64,"model":"Code Llama - Python 13B (3-shot)","metrics":{"Accuracy":"49"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":65,"model":"Qwen2idae-16x14B (4-shot)","metrics":{"Accuracy":"48.6"},"uses_additional_data":false,"paper_date":"2024-01-05","paper":"/paper/parameter-efficient-sparsity-crafting-from","paper_url":"https://arxiv.org/abs/2401.02731v4","paper_title":"Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks","code":"https://github.com/wuhy68/parameter-efficient-moe","n_code_links":2,"syntology":null},{"rank_in_archive_order":66,"model":"code-cushman-001 12B + MBR-Exec","metrics":{"Accuracy":"48.3"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":67,"model":"Code Llama - Python 7B (3-shot)","metrics":{"Accuracy":"47.6"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":68,"model":"Mistral 7B (3-shot)","metrics":{"Accuracy":"47.5"},"uses_additional_data":false,"paper_date":"2023-10-10","paper":"/paper/mistral-7b","paper_url":"https://arxiv.org/abs/2310.06825v1","paper_title":"Mistral 7B","code":"https://github.com/mistralai/mistral-src","n_code_links":6,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":1}},{"rank_in_archive_order":69,"model":"CodeGen 16B + MBR-Exec","metrics":{"Accuracy":"47.3"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":70,"model":"StarCoder 15.5B (3-shot)","metrics":{"Accuracy":"47.2"},"uses_additional_data":false,"paper_date":"2023-04-11","paper":"/paper/teaching-large-language-models-to-self-debug","paper_url":"https://arxiv.org/abs/2304.05128v2","paper_title":"Teaching Large Language Models to Self-Debug","code":"https://github.com/amazon-science/SDFeedback","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":71,"model":"PaLM Coder 540B","metrics":{"Accuracy":"47"},"uses_additional_data":false,"paper_date":"2022-04-05","paper":"/paper/palm-scaling-language-modeling-with-pathways-1","paper_url":"https://arxiv.org/abs/2204.02311v5","paper_title":"PaLM: Scaling Language Modeling with Pathways","code":"https://github.com/lucidrains/CoCa-pytorch","n_code_links":7,"syntology":{"n_ran":30,"n_unverified":7,"n_samples":37,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"Code Llama 13B (3-shot)","metrics":{"Accuracy":"47"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":73,"model":"CodeGen 16B + Coder-Reviewer","metrics":{"Accuracy":"46.2"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":74,"model":"DeepSeek-Coder-Base 1.3B (few-shot)","metrics":{"Accuracy":"46.2"},"uses_additional_data":false,"paper_date":"2024-01-25","paper":"/paper/deepseek-coder-when-the-large-language-model","paper_url":"https://arxiv.org/abs/2401.14196v2","paper_title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","code":"https://github.com/deepseek-ai/DeepSeek-Coder","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":75,"model":"GPT-3.5 Turbo (few-shot)","metrics":{"Accuracy":"45.4"},"uses_additional_data":false,"paper_date":"2023-11-16","paper":"/paper/intervenor-prompt-the-coding-ability-of-large","paper_url":"https://arxiv.org/abs/2311.09868v5","paper_title":"INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of Repair","code":"https://github.com/neuir/intervenor","n_code_links":1,"syntology":null},{"rank_in_archive_order":76,"model":"Llama 2 70B (zero-shot)","metrics":{"Accuracy":"45"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":77,"model":"Code Llama - Instruct 7B (3-shot)","metrics":{"Accuracy":"44.4"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":78,"model":"CodeGen 16B + Reviewer","metrics":{"Accuracy":"44.1"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":79,"model":"phi-1.5-web 1.3B","metrics":{"Accuracy":"43.5"},"uses_additional_data":false,"paper_date":"2023-09-11","paper":"/paper/textbooks-are-all-you-need-ii-phi-1-5","paper_url":"https://arxiv.org/abs/2309.05463v1","paper_title":"Textbooks Are All You Need II: phi-1.5 technical report","code":"https://github.com/knowlab/bi-weekly-paper-presentation","n_code_links":1,"syntology":null},{"rank_in_archive_order":80,"model":"Branch-Train-Merge 4x7B (top-2)","metrics":{"Accuracy":"42.6"},"uses_additional_data":false,"paper_date":"2024-03-12","paper":"/paper/branch-train-mix-mixing-expert-llms-into-a","paper_url":"https://arxiv.org/abs/2403.07816v1","paper_title":"Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM","code":"https://github.com/Leeroo-AI/mergoo","n_code_links":1,"syntology":null},{"rank_in_archive_order":81,"model":"Code Llama 7B (3-shot)","metrics":{"Accuracy":"41.4"},"uses_additional_data":false,"paper_date":"2023-08-24","paper":"/paper/code-llama-open-foundation-models-for-code","paper_url":"https://arxiv.org/abs/2308.12950v3","paper_title":"Code Llama: Open Foundation Models for Code","code":"https://github.com/facebookresearch/codellama","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":4}},{"rank_in_archive_order":82,"model":"Camelidae-8×34B (4-shot)","metrics":{"Accuracy":"41.4"},"uses_additional_data":false,"paper_date":"2024-01-05","paper":"/paper/parameter-efficient-sparsity-crafting-from","paper_url":"https://arxiv.org/abs/2401.02731v4","paper_title":"Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks","code":"https://github.com/wuhy68/parameter-efficient-moe","n_code_links":2,"syntology":null},{"rank_in_archive_order":83,"model":"GPT-3.5 Turbo (0-shot)","metrics":{"Accuracy":"39.8"},"uses_additional_data":false,"paper_date":"2023-11-16","paper":"/paper/intervenor-prompt-the-coding-ability-of-large","paper_url":"https://arxiv.org/abs/2311.09868v5","paper_title":"INTERVENOR: Prompting the Coding Ability of Large Language Models with the Interactive Chain of Repair","code":"https://github.com/neuir/intervenor","n_code_links":1,"syntology":null},{"rank_in_archive_order":84,"model":"Branch-Train-MiX 4x7B (sampling top-2 experts)","metrics":{"Accuracy":"39.4"},"uses_additional_data":false,"paper_date":"2024-03-12","paper":"/paper/branch-train-mix-mixing-expert-llms-into-a","paper_url":"https://arxiv.org/abs/2403.07816v1","paper_title":"Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM","code":"https://github.com/Leeroo-AI/mergoo","n_code_links":1,"syntology":null},{"rank_in_archive_order":85,"model":"LLaMA 65B (0-shot)","metrics":{"Accuracy":"37.7"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":26,"n_unverified":32,"n_samples":58,"n_pointer_only_licence":4}},{"rank_in_archive_order":86,"model":"PaLM 540B","metrics":{"Accuracy":"36.8"},"uses_additional_data":false,"paper_date":"2022-04-05","paper":"/paper/palm-scaling-language-modeling-with-pathways-1","paper_url":"https://arxiv.org/abs/2204.02311v5","paper_title":"PaLM: Scaling Language Modeling with Pathways","code":"https://github.com/lucidrains/CoCa-pytorch","n_code_links":7,"syntology":{"n_ran":30,"n_unverified":7,"n_samples":37,"n_pointer_only_licence":0}},{"rank_in_archive_order":87,"model":"SantaCoder 1.1B","metrics":{"Accuracy":"35"},"uses_additional_data":false,"paper_date":"2023-05-09","paper":"/paper/starcoder-may-the-source-be-with-you","paper_url":"https://arxiv.org/abs/2305.06161v2","paper_title":"StarCoder: may the source be with you!","code":"https://github.com/bigcode-project/starcoder","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":88,"model":"InCoder 6.7B + CodeT","metrics":{"Accuracy":"34.4"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/codet-code-generation-with-generated-tests","paper_url":"https://arxiv.org/abs/2207.10397v2","paper_title":"CodeT: Code Generation with Generated Tests","code":"https://github.com/microsoft/codet","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":89,"model":"Llama 2 34B (0-shot)","metrics":{"Accuracy":"33"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":90,"model":"Llama 2 13B (0-shot)","metrics":{"Accuracy":"30.6"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":91,"model":"LLaMA 33B (0-shot)","metrics":{"Accuracy":"30.2"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":26,"n_unverified":32,"n_samples":58,"n_pointer_only_licence":4}},{"rank_in_archive_order":92,"model":"InCoder 6.7B + MBR-Exec","metrics":{"Accuracy":"26.7"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":93,"model":"InCoder 6.7B + Coder-Reviewer","metrics":{"Accuracy":"26.1"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":94,"model":"InCoder 6.7B + Reviewer","metrics":{"Accuracy":"24.4"},"uses_additional_data":false,"paper_date":"2022-11-29","paper":"/paper/coder-reviewer-reranking-for-code-generation","paper_url":"https://arxiv.org/abs/2211.16490v1","paper_title":"Coder Reviewer Reranking for Code Generation","code":"https://github.com/facebookresearch/coder_reviewer_reranking","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":95,"model":"CodeGeeX-13B","metrics":{"Accuracy":"24.4"},"uses_additional_data":false,"paper_date":"2023-03-30","paper":"/paper/codegeex-a-pre-trained-model-for-code","paper_url":"https://arxiv.org/abs/2303.17568v2","paper_title":"CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X","code":"https://github.com/THUDM/CodeGeeX","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":96,"model":"LLaMA 13B (0-shot)","metrics":{"Accuracy":"22"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":26,"n_unverified":32,"n_samples":58,"n_pointer_only_licence":4}},{"rank_in_archive_order":97,"model":"Llama 2 7B (0-shot)","metrics":{"Accuracy":"20.8"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","paper_url":"https://arxiv.org/abs/2307.09288v2","paper_title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","code":"https://github.com/facebookresearch/llama","n_code_links":19,"syntology":{"n_ran":31,"n_unverified":21,"n_samples":52,"n_pointer_only_licence":16}},{"rank_in_archive_order":98,"model":"InCoder 6.7B (0-shot)","metrics":{"Accuracy":"19.4"},"uses_additional_data":false,"paper_date":"2022-04-12","paper":"/paper/incoder-a-generative-model-for-code-infilling","paper_url":"https://arxiv.org/abs/2204.05999v3","paper_title":"InCoder: A Generative Model for Code Infilling and Synthesis","code":"https://github.com/dpfried/incoder","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":2}},{"rank_in_archive_order":99,"model":"LLaMA 7B (0-shot)","metrics":{"Accuracy":"17.7"},"uses_additional_data":false,"paper_date":"2023-02-27","paper":"/paper/llama-open-and-efficient-foundation-language-1","paper_url":"https://arxiv.org/abs/2302.13971v1","paper_title":"LLaMA: Open and Efficient Foundation Language Models","code":"https://github.com/huggingface/transformers","n_code_links":57,"syntology":{"n_ran":26,"n_unverified":32,"n_samples":58,"n_pointer_only_licence":4}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,795 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6795,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2785},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":["Accuracy"],"entries":[{"paper":"/paper/arxiv-2510-05069","paper_title":"SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs","arxiv_id":"2510.05069","model":"SwiR (Ours)","row_label":"SwiR (Ours)","configuration":null,"configuration_in_model":false,"configuration_not_shown_because":null,"values":{"Accuracy":"95.33"},"date":"2025-10-06","month_from_arxiv_id":null,"where_in_paper":"Table 5, row “SwiR (Ours)”","table_label":"5","table_label_from":"the caption's own label","table_position_1based":5,"caption_head":"Table 5: Comparison of SwiReasoning and baselines on coding, multi-hop QA, and…","cells":[{"column":"Accuracy","cell_text":"95.33","column_header":"MBPP / MBPP","value":95.33,"table_index_0based":4,"row":5,"col":9}],"code":"4 of 6 ran"}]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":75,"rows_with_any_sample_ran":63,"distinct_papers_with_graph_line":22,"distinct_papers_with_any_sample_ran":18,"samples_over_distinct_papers":{"n_ran":158,"n_unverified":127,"n_samples":285,"n_pointer_only_licence":31,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":507,"n_unverified":355,"n_samples":862,"n_pointer_only_licence":162,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}