{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/parse-eval-args","entry":"parse_eval_args","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":16,"n_papers_ran":16,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":1,"n_samples_ran":1,"n_samples_fingerprinted":0,"n_places":16,"n_places_pointer_only":2,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":1,"ran_fixture":0,"ran":0,"unverified":0},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.26430","paper":"/paper/arxiv-2608-26430","title":"Fine-Tuning of Transformer models with Frames","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"vsingh-group/FrameFT","path":"lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/vsingh-group/FrameFT/blob/HEAD/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2601.22527","paper":"/paper/arxiv-2601-22527","title":"ρ-EOS: Training-free Bidirectional Variable-Length Control for Masked Diffusion LLMs","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"yjyddq/rho-EOS","path":"dllm_eval/__main__.py","file_url":"https://github.com/yjyddq/rho-EOS/blob/HEAD/dllm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2601.02236","paper":"/paper/arxiv-2601-02236","title":"CD 4 LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"yihao-liang/CDLM","path":"evaluation/dllm_eval/__main__.py","file_url":"https://github.com/yihao-liang/CDLM/blob/HEAD/evaluation/dllm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2505.05408","paper":"/paper/crosslingual-reasoning-through-test-time","title":"Crosslingual Reasoning through Test-Time Scaling","date":"2025-05-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BatsResearch/crosslingual-test-time-scaling","path":"lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/BatsResearch/crosslingual-test-time-scaling/blob/HEAD/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2503.00555","paper":"/paper/2503-00555","title":"Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable","date":"2025-03-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"git-disl/safety-tax","path":"eval/lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/git-disl/safety-tax/blob/HEAD/eval/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2502.05171","paper":"/paper/scaling-up-test-time-compute-with-latent","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","date":"2025-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seal-rg/recurrent-pretraining","path":"evaluate_raven/local_lm_eval.py","file_url":"https://github.com/seal-rg/recurrent-pretraining/blob/HEAD/evaluate_raven/local_lm_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2501.19393","paper":"/paper/s1-simple-test-time-scaling","title":"s1: Simple test-time scaling","date":"2025-01-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"simplescaling/s1","path":"eval/lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/simplescaling/s1/blob/HEAD/eval/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2411.10606","paper":"/paper/amoeballm-constructing-any-shape-large","title":"AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment","date":"2024-11-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"GATECH-EIC/AmoebaLLM","path":"lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/GATECH-EIC/AmoebaLLM/blob/HEAD/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2408.05646","paper":"/paper/eigen-attention-attention-in-low-rank-space","title":"Eigen Attention: Attention in Low-Rank Space for KV Cache Compression","date":"2024-08-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"utkarshsaxena1/eigenattn","path":"evaluate_llm.py","file_url":"https://github.com/utkarshsaxena1/eigenattn/blob/HEAD/evaluate_llm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2407.03856","paper":"/paper/q-adapter-training-your-llm-adapter-as-a","title":"Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation","date":"2024-07-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LAMDA-RL/Q-Adapter","path":"lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/LAMDA-RL/Q-Adapter/blob/HEAD/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2406.11687","paper":"/paper/tokenization-falling-short-the-curse-of","title":"Tokenization Falling Short: On Subword Robustness in Large Language Models","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"floatai/tkeval","path":"evaluation/lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/floatai/tkeval/blob/HEAD/evaluation/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2405.07938","paper":"/paper/econlogicqa-a-question-answering-benchmark","title":"EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning","date":"2024-05-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yinzhu-quan/lm-evaluation-harness","path":"lm_eval/__main__.py","file_url":"https://github.com/yinzhu-quan/lm-evaluation-harness/blob/HEAD/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2005.14165","paper":"/paper/language-models-are-few-shot-learners","title":"Language Models are Few-Shot Learners","date":"2020-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Sypherd/lm-evaluation-harness","path":"lm_eval/__main__.py","file_url":"https://github.com/Sypherd/lm-evaluation-harness/blob/HEAD/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"openreview_QrC8OgQyOI","paper":null,"title":"arXiv:openreview_QrC8OgQyOI","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"viiika/Prism","path":"LLaDA/LLaDA_Prism/dllm_eval/__main__.py","file_url":"https://github.com/viiika/Prism/blob/HEAD/LLaDA/LLaDA_Prism/dllm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2025.findings-acl.744","paper":null,"title":"arXiv:2025.findings-acl.744","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"szu-tera/RankedVotingSC","path":"lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/szu-tera/RankedVotingSC/blob/HEAD/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}},{"arxiv_id":"2024.findings-emnlp.86","paper":null,"title":"arXiv:2024.findings-emnlp.86","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"FloatAI/TKEval","path":"evaluation/lm-evaluation-harness/lm_eval/__main__.py","file_url":"https://github.com/FloatAI/TKEval/blob/HEAD/evaluation/lm-evaluation-harness/lm_eval/__main__.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"400ea4f64ccce5ef","mcp_get_code":{"code_sha256":"400ea4f64ccce5ef"}}]}