{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/read-problems","entry":"read_problems","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":17,"n_papers_ran":8,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":12,"n_samples_ran":8,"n_samples_fingerprinted":0,"n_places":18,"n_places_pointer_only":6,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":1,"ran_fixture":0,"ran":7,"unverified":4},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2606.05859","paper":"/paper/arxiv-2606-05859","title":"TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"NKU-LITI/TARPO-master","path":"humanevaleval.py","file_url":"https://github.com/NKU-LITI/TARPO-master/blob/HEAD/humanevaleval.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e289de48f4ad6a1e","mcp_get_code":{"code_sha256":"e289de48f4ad6a1e"}},{"arxiv_id":"2604.23626","paper":"/paper/arxiv-2604-23626","title":"GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"ulab-uiuc/GraphPlanner","path":"router_planner/shared/evaluation/human_eval/data.py","file_url":"https://github.com/ulab-uiuc/GraphPlanner/blob/HEAD/router_planner/shared/evaluation/human_eval/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"16c6b5cd0ca7e8e3","mcp_get_code":{"code_sha256":"16c6b5cd0ca7e8e3"}},{"arxiv_id":"2604.12268","paper":"/paper/arxiv-2604-12268","title":"CODESPECBENCH: Benchmarking LLMs for Executable Behavioral Specification Generation","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"SparksofAGI/CodeSpecBench","path":"CodeSpecBench-Func/spec-verifier/evaluation.py","file_url":"https://github.com/SparksofAGI/CodeSpecBench/blob/HEAD/CodeSpecBench-Func/spec-verifier/evaluation.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1e2d6367f1b86235","mcp_get_code":{"code_sha256":"1e2d6367f1b86235"}},{"arxiv_id":"2602.13773","paper":"/paper/arxiv-2602-13773","title":"On Representation Redundancy in Large-Scale Instruction Tuning Data Selection","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"tdano1/CRDS","path":"main/eval/codex_humaneval/data.py","file_url":"https://github.com/tdano1/CRDS/blob/HEAD/main/eval/codex_humaneval/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"776a712a353130e7","mcp_get_code":{"code_sha256":"776a712a353130e7"}},{"arxiv_id":"2602.02979","paper":"/paper/arxiv-2602-02979","title":"CPMöbius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"thunlp/CPMobius","path":"evaluation/utils/data.py","file_url":"https://github.com/thunlp/CPMobius/blob/HEAD/evaluation/utils/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"562c0ef13357b53b","mcp_get_code":{"code_sha256":"562c0ef13357b53b"}},{"arxiv_id":"2502.01456","paper":"/paper/process-reinforcement-through-implicit","title":"Process Reinforcement through Implicit Rewards","date":"2025-02-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"prime-rl/prime","path":"eval/utils/data.py","file_url":"https://github.com/prime-rl/prime/blob/HEAD/eval/utils/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"562c0ef13357b53b","mcp_get_code":{"code_sha256":"562c0ef13357b53b"}},{"arxiv_id":"2407.01910","paper":"/paper/mg-verilog-multi-grained-dataset-towards","title":"MG-Verilog: Multi-grained Dataset Towards Enhanced LLM-assisted Verilog Generation","date":"2024-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luke-avionics/mg-verilog","path":"verilog_eval/verilog_eval/data.py","file_url":"https://github.com/luke-avionics/mg-verilog/blob/HEAD/verilog_eval/verilog_eval/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c06721d357c61091","mcp_get_code":{"code_sha256":"c06721d357c61091"}},{"arxiv_id":"2404.02078","paper":"/paper/advancing-llm-reasoning-generalists-with","title":"Advancing LLM Reasoning Generalists with Preference Trees","date":"2024-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openbmb/eurus","path":"eval/utils/data.py","file_url":"https://github.com/openbmb/eurus/blob/HEAD/eval/utils/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2a1cf35aaf759bca","mcp_get_code":{"code_sha256":"2a1cf35aaf759bca"}},{"arxiv_id":"2404.02078","paper":"/paper/advancing-llm-reasoning-generalists-with","title":"Advancing LLM Reasoning Generalists with Preference Trees","date":"2024-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openbmb/eurus","path":"eval/Coding/leetcode/data.py","file_url":"https://github.com/openbmb/eurus/blob/HEAD/eval/Coding/leetcode/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"776a712a353130e7","mcp_get_code":{"code_sha256":"776a712a353130e7"}},{"arxiv_id":"2402.14852","paper":"/paper/humaneval-on-latest-gpt-models-2024","title":"HumanEval on Latest GPT Models -- 2024","date":"2024-02-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"daniel442li/gpt-human-eval","path":"human_eval/data.py","file_url":"https://github.com/daniel442li/gpt-human-eval/blob/HEAD/human_eval/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"776a712a353130e7","mcp_get_code":{"code_sha256":"776a712a353130e7"}},{"arxiv_id":"2401.16405","paper":"/paper/scaling-sparse-fine-tuning-to-large-language","title":"Scaling Sparse Fine-Tuning to Large Language Models","date":"2024-01-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ducdauge/sft-llm","path":"eval/codex_humaneval/data.py","file_url":"https://github.com/ducdauge/sft-llm/blob/HEAD/eval/codex_humaneval/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"776a712a353130e7","mcp_get_code":{"code_sha256":"776a712a353130e7"}},{"arxiv_id":"2401.14196","paper":"/paper/deepseek-coder-when-the-large-language-model","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","date":"2024-01-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deepseek-ai/DeepSeek-Coder","path":"Evaluation/HumanEval/human_eval/data.py","file_url":"https://github.com/deepseek-ai/DeepSeek-Coder/blob/HEAD/Evaluation/HumanEval/human_eval/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"21359df82e68e215","mcp_get_code":{"code_sha256":"21359df82e68e215"}},{"arxiv_id":"2401.08565","paper":"/paper/tuning-language-models-by-proxy","title":"Tuning Language Models by Proxy","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alisawuffles/proxy-tuning","path":"eval/codex_humaneval/data.py","file_url":"https://github.com/alisawuffles/proxy-tuning/blob/HEAD/eval/codex_humaneval/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"776a712a353130e7","mcp_get_code":{"code_sha256":"776a712a353130e7"}},{"arxiv_id":"2401.06628","paper":"/paper/oop-object-oriented-programming-evaluation","title":"OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models","date":"2024-01-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alphadl/oop-eval","path":"oop_evaluate/data.py","file_url":"https://github.com/alphadl/oop-eval/blob/HEAD/oop_evaluate/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"16310fe23c55a895","mcp_get_code":{"code_sha256":"16310fe23c55a895"}},{"arxiv_id":"2310.20329","paper":"/paper/instructcoder-empowering-language-models-for","title":"InstructCoder: Instruction Tuning Large Language Models for Code Editing","date":"2023-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qishenghu/CodeInstruct","path":"edit_eval/data.py","file_url":"https://github.com/qishenghu/CodeInstruct/blob/HEAD/edit_eval/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"776a712a353130e7","mcp_get_code":{"code_sha256":"776a712a353130e7"}},{"arxiv_id":"2310.06830","paper":"/paper/lemur-harmonizing-natural-language-and-code","title":"Lemur: Harmonizing Natural Language and Code for Language Agents","date":"2023-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenLemur/Lemur","path":"xchat/eval/mbpp/data.py","file_url":"https://github.com/OpenLemur/Lemur/blob/HEAD/xchat/eval/mbpp/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1cf1721a0bcb876e","mcp_get_code":{"code_sha256":"1cf1721a0bcb876e"}},{"arxiv_id":"2207.14255","paper":"/paper/efficient-training-of-language-models-to-fill","title":"Efficient Training of Language Models to Fill in the Middle","date":"2022-07-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openai/human-eval-infilling","path":"human_eval_infilling/data.py","file_url":"https://github.com/openai/human-eval-infilling/blob/HEAD/human_eval_infilling/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c3e6a38615ffe825","mcp_get_code":{"code_sha256":"c3e6a38615ffe825"}},{"arxiv_id":"2107.03374","paper":"/paper/evaluating-large-language-models-trained-on","title":"Evaluating Large Language Models Trained on Code","date":"2021-07-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"2796gaurav/human-eval","path":"human_eval/data.py","file_url":"https://github.com/2796gaurav/human-eval/blob/HEAD/human_eval/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"d3d6eed5a7c21746","mcp_get_code":{"code_sha256":"d3d6eed5a7c21746"}}]}