{"url":"/task/mathematical-reasoning","name":"Mathematical Reasoning","slug":"mathematical-reasoning","description_markdown":null,"categories":[{"name":"Knowledge Base","url":"/area/knowledge-base"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"},{"name":"Reasoning","url":"/area/reasoning"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":805,"papers_with_code":395,"benchmarks":10,"benchmark_tables_in_archive":11,"benchmark_tables_shown":11,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":26,"subtasks":7,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/mathematical-reasoning-on-aime24","slug":"mathematical-reasoning-on-aime24","dataset":"AIME24","dataset_url":null,"rows_in_archive":9,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Xolver","paper_title":"Xolver: Multi-Agent Reasoning with Holistic Experience Learning Just Like an Olympiad Team","paper_url":"/paper/xolver-multi-agent-reasoning-with-holistic","paper_date":"2025-06-17","arxiv_id":"2506.14234","code_links":[{"title":"kagnlp/Xolver","url":"https://github.com/kagnlp/Xolver"}],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-frontiermath","slug":"mathematical-reasoning-on-frontiermath","dataset":"FrontierMath","dataset_url":null,"rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"o3","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-lila-iid","slug":"mathematical-reasoning-on-lila-iid","dataset":"Lila (IID)","dataset_url":null,"rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Codex (Few-Shot, 175B)","paper_title":"Lila: A Unified Benchmark for Mathematical Reasoning","paper_url":"/paper/lila-a-unified-benchmark-for-mathematical","paper_date":"2022-10-31","arxiv_id":"2210.17517","code_links":[{"title":"allenai/lila","url":"https://github.com/allenai/lila"}],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-lila-ood","slug":"mathematical-reasoning-on-lila-ood","dataset":"Lila (OOD)","dataset_url":null,"rows_in_archive":6,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Codex (Few-Shot, 175B)","paper_title":"Lila: A Unified Benchmark for Mathematical Reasoning","paper_url":"/paper/lila-a-unified-benchmark-for-mathematical","paper_date":"2022-10-31","arxiv_id":"2210.17517","code_links":[{"title":"allenai/lila","url":"https://github.com/allenai/lila"}],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-pgps9k","slug":"mathematical-reasoning-on-pgps9k","dataset":"PGPS9K","dataset_url":"/dataset/pgps9k","rows_in_archive":6,"metrics":["Completion accuracy"],"first_row_in_archive_order":{"model":"GOLD","paper_title":"GOLD: Geometry Problem Solver with Natural Language Description","paper_url":"/paper/gold-geometry-problem-solver-with-natural","paper_date":"2024-05-01","arxiv_id":"2405.00494","code_links":[{"title":"neurasearch/geometry-diagram-description","url":"https://github.com/neurasearch/geometry-diagram-description"}],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-amc23","slug":"mathematical-reasoning-on-amc23","dataset":"AMC23","dataset_url":null,"rows_in_archive":3,"metrics":["Acc"],"first_row_in_archive_order":{"model":"QWQ-32B-preview","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-geoqa","slug":"mathematical-reasoning-on-geoqa","dataset":"GeoQA","dataset_url":"/dataset/geoqa","rows_in_archive":2,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"GOLD","paper_title":"GOLD: Geometry Problem Solver with Natural Language Description","paper_url":"/paper/gold-geometry-problem-solver-with-natural","paper_date":"2024-05-01","arxiv_id":"2405.00494","code_links":[{"title":"neurasearch/geometry-diagram-description","url":"https://github.com/neurasearch/geometry-diagram-description"}],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-math500","slug":"mathematical-reasoning-on-math500","dataset":"MATH500","dataset_url":"/dataset/math500-1","rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"Search-o1","paper_title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","paper_url":"/paper/search-o1-agentic-search-enhanced-large","paper_date":"2025-01-09","arxiv_id":"2501.05366","code_links":[{"title":"sunnynexus/search-o1","url":"https://github.com/sunnynexus/search-o1"},{"title":"terrierteam/pyterrier_rag","url":"https://github.com/terrierteam/pyterrier_rag"}],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-unigeo","slug":"mathematical-reasoning-on-unigeo","dataset":"UniGeo","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"GOLD","paper_title":"GOLD: Geometry Problem Solver with Natural Language Description","paper_url":"/paper/gold-geometry-problem-solver-with-natural","paper_date":"2024-05-01","arxiv_id":"2405.00494","code_links":[{"title":"neurasearch/geometry-diagram-description","url":"https://github.com/neurasearch/geometry-diagram-description"}],"syntology":null}},{"leaderboard":"/sota/mathematical-reasoning-on-unigeo-prv","slug":"mathematical-reasoning-on-unigeo-prv","dataset":"UniGeo (PRV)","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"GAPS","paper_title":"GAPS: Geometry-Aware Problem Solver","paper_url":"/paper/gaps-geometry-aware-problem-solver","paper_date":"2024-01-29","arxiv_id":"2401.16287","code_links":[],"syntology":null}},{"leaderboard":null,"slug":"mathematical-reasoning-on-gsm8k","dataset":"GSM8K","dataset_url":"/dataset/gsm8k","rows_in_archive":0,"metrics":["Accuracy"],"first_row_in_archive_order":null}],"datasets":[{"url":"/dataset/gsm8k","name":"GSM8K","full_name":"","num_papers_in_archive":1881},{"url":"/dataset/svamp","name":"SVAMP","full_name":"Simple Variations on Arithmetic Math word Problems","num_papers_in_archive":362},{"url":"/dataset/mathvista","name":"MathVista","full_name":"Mathematical Reasoning of in Visual Contexts","num_papers_in_archive":242},{"url":"/dataset/prontoqa","name":"PrOntoQA","full_name":"Proof and Ontology-Generated Question-Answering","num_papers_in_archive":55},{"url":"/dataset/geoqa","name":"GeoQA","full_name":"Geometric Question Answering","num_papers_in_archive":46},{"url":"/dataset/iconqa","name":"IconQA","full_name":"Icon Question Answering","num_papers_in_archive":42},{"url":"/dataset/theoremqa","name":"TheoremQA","full_name":"TheoremQA","num_papers_in_archive":40},{"url":"/dataset/mathbench","name":"MathBench","full_name":"MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark","num_papers_in_archive":16},{"url":"/dataset/pgps9k","name":"PGPS9K","full_name":"","num_papers_in_archive":14},{"url":"/dataset/lila","name":"Lila","full_name":"","num_papers_in_archive":12},{"url":"/dataset/math-v","name":"MATH-V","full_name":"","num_papers_in_archive":12},{"url":"/dataset/criticbench","name":"CriticBench","full_name":"","num_papers_in_archive":10},{"url":"/dataset/clevr-math","name":"CLEVR-Math","full_name":"","num_papers_in_archive":8},{"url":"/dataset/math500-1","name":"Math500","full_name":"","num_papers_in_archive":4},{"url":"/dataset/mgsm8kinstruct","name":"MGSM8KInstruct","full_name":"MGSM8KInstruct","num_papers_in_archive":2},{"url":"/dataset/paramawps","name":"ParaMAWPS","full_name":"Paraphrased Math Word Problem Solving Repository","num_papers_in_archive":2},{"url":"/dataset/quite","name":"QUITE","full_name":"Quantifying Uncertainty in natural language Text","num_papers_in_archive":2},{"url":"/dataset/asymob","name":"ASyMOB","full_name":"ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark","num_papers_in_archive":1},{"url":"/dataset/champ","name":"CHAMP","full_name":"Concept and Hint-Annotated Math Problems","num_papers_in_archive":1},{"url":"/dataset/conic10k","name":"Conic10K","full_name":"","num_papers_in_archive":1},{"url":"/dataset/constructivebench","name":"ConstructiveBench","full_name":"","num_papers_in_archive":1},{"url":"/dataset/dart-math-uniform","name":"DART-Math-Uniform","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mathmc","name":"MathMC","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mathtof","name":"MathToF","full_name":"","num_papers_in_archive":1},{"url":"/dataset/polymath","name":"PolyMATH","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vimath","name":"ViMATH","full_name":"Vietnamese MATH","num_papers_in_archive":1}],"subtasks":[{"url":"/task/abstract-algebra","name":"Abstract Algebra"},{"url":"/task/formal-logic","name":"Formal Logic"},{"url":"/task/geometry-problem-solving","name":"Geometry Problem Solving"},{"url":"/task/high-school-mathematics","name":"High School Mathematics"},{"url":"/task/math-word-problem-solving","name":"Math Word Problem Solving"},{"url":"/task/mathematical-induction","name":"Mathematical Induction"},{"url":"/task/professional-accounting","name":"Professional Accounting"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":395,"tagged_in_all":805,"items":[{"url":"/paper/lora-low-rank-adaptation-of-large-language","title":"LoRA: Low-Rank Adaptation of Large Language Models","date":"2021-06-17","arxiv_id":"2106.09685","repositories_listed":74,"syntology":{"n":84,"n_ran":51,"n_unverified":33,"n_pointer_only":28}},{"url":"/paper/analysing-mathematical-reasoning-abilities-of-1","title":"Analysing Mathematical Reasoning Abilities of Neural Models","date":"2019-04-02","arxiv_id":"1904.01557","repositories_listed":7,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/qwen2-5-technical-report","title":"Qwen2.5 Technical Report","date":"2024-12-19","arxiv_id":"2412.15115","repositories_listed":6,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/mistral-7b","title":"Mistral 7B","date":"2023-10-10","arxiv_id":"2310.06825","repositories_listed":6,"syntology":{"n":11,"n_ran":10,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/training-verifiers-to-solve-math-word","title":"Training Verifiers to Solve Math Word Problems","date":"2021-10-27","arxiv_id":"2110.14168","repositories_listed":6,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/deepseekmath-pushing-the-limits-of","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","date":"2024-02-05","arxiv_id":"2402.03300","repositories_listed":5,"syntology":{"n":24,"n_ran":10,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/measuring-mathematical-problem-solving-with","title":"Measuring Mathematical Problem Solving With the MATH Dataset","date":"2021-03-05","arxiv_id":"2103.03874","repositories_listed":5,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/qwen3-technical-report","title":"Qwen3 Technical Report","date":"2025-05-14","arxiv_id":"2505.09388","repositories_listed":4,"syntology":null},{"url":"/paper/deepseek-r1-incentivizing-reasoning","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","date":"2025-01-22","arxiv_id":"2501.12948","repositories_listed":4,"syntology":null},{"url":"/paper/absolute-zero-reinforced-self-play-reasoning","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","date":"2025-05-06","arxiv_id":"2505.03335","repositories_listed":3,"syntology":{"n":12,"n_ran":5,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/eccos-efficient-capability-and-cost","title":"OmniRouter: Budget and Performance Controllable Multi-LLM Routing","date":"2025-02-27","arxiv_id":"2502.20576","repositories_listed":3,"syntology":null},{"url":"/paper/reasonflux-hierarchical-llm-reasoning-via","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","date":"2025-02-10","arxiv_id":"2502.06772","repositories_listed":3,"syntology":null},{"url":"/paper/limo-less-is-more-for-reasoning","title":"LIMO: Less is More for Reasoning","date":"2025-02-05","arxiv_id":"2502.03387","repositories_listed":3,"syntology":null},{"url":"/paper/mavis-mathematical-visual-instruction-tuning","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","date":"2024-07-11","arxiv_id":"2407.08739","repositories_listed":3,"syntology":null},{"url":"/paper/mathodyssey-benchmarking-mathematical-problem","title":"MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data","date":"2024-06-26","arxiv_id":"2406.18321","repositories_listed":3,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/knowledge-fusion-of-large-language-models","title":"Knowledge Fusion of Large Language Models","date":"2024-01-19","arxiv_id":"2401.10491","repositories_listed":3,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/math-shepherd-a-label-free-step-by-step","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","date":"2023-12-14","arxiv_id":"2312.08935","repositories_listed":3,"syntology":null},{"url":"/paper/factool-factuality-detection-in-generative-ai","title":"FacTool: Factuality Detection in Generative AI -- A Tool Augmented Framework for Multi-Task and Multi-Domain Scenarios","date":"2023-07-25","arxiv_id":"2307.13528","repositories_listed":3,"syntology":{"n":14,"n_ran":11,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/self-refine-iterative-refinement-with-self-1","title":"Self-Refine: Iterative Refinement with Self-Feedback","date":"2023-03-30","arxiv_id":"2303.17651","repositories_listed":3,"syntology":null},{"url":"/paper/sparks-of-artificial-general-intelligence","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","date":"2023-03-22","arxiv_id":"2303.12712","repositories_listed":3,"syntology":{"n":10,"n_ran":9,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/pal-program-aided-language-models","title":"PAL: Program-aided Language Models","date":"2022-11-18","arxiv_id":"2211.10435","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/scaling-language-models-methods-analysis-1","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","date":"2021-12-08","arxiv_id":"2112.11446","repositories_listed":3,"syntology":null},{"url":"/paper/memory-augmented-recursive-neural-networks","title":"Compositional Generalization with Tree Stack Memory Units","date":"2019-11-05","arxiv_id":"1911.01545","repositories_listed":3,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/skywork-r1v3-technical-report","title":"Skywork-R1V3 Technical Report","date":"2025-07-08","arxiv_id":"2507.06167","repositories_listed":2,"syntology":{"n":12,"n_ran":3,"n_unverified":9,"n_pointer_only":12}},{"url":"/paper/deeptheorem-advancing-llm-reasoning-for","title":"DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning","date":"2025-05-29","arxiv_id":"2505.23754","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/mm-prm-enhancing-multimodal-mathematical","title":"MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision","date":"2025-05-19","arxiv_id":"2505.13427","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/agent-rl-scaling-law-agent-rl-with","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","date":"2025-05-12","arxiv_id":"2505.07773","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/challenging-the-boundaries-of-reasoning-an","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","date":"2025-03-27","arxiv_id":"2503.21380","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/self-rewarding-correction-for-mathematical","title":"Self-rewarding correction for mathematical reasoning","date":"2025-02-26","arxiv_id":"2502.19613","repositories_listed":2,"syntology":{"n":16,"n_ran":8,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/s1-simple-test-time-scaling","title":"s1: Simple test-time scaling","date":"2025-01-31","arxiv_id":"2501.19393","repositories_listed":2,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":0}}],"syntology_records":21,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}