{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/extract-boxed-content","entry":"extract_boxed_content","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":8,"n_papers_ran":5,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":10,"n_samples_ran":4,"n_samples_fingerprinted":4,"n_places":11,"n_places_pointer_only":6,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":2,"ran_fixture":0,"ran":2,"unverified":6},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2606.00869","paper":"/paper/arxiv-2606-00869","title":"Enhancing LLM Metacognition via Cognitive Pairwise Training","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Tsinghua-dhy/CPT","path":"data_construction/3_judge/judge_pairs.py","file_url":"https://github.com/Tsinghua-dhy/CPT/blob/HEAD/data_construction/3_judge/judge_pairs.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5a65ce548f2db502","mcp_get_code":{"code_sha256":"5a65ce548f2db502"}},{"arxiv_id":"2602.10635","paper":"/paper/arxiv-2602-10635","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"MIT-MI/human_behavior_atlas","path":"training/rl/reward_function/human_behaviour.py","file_url":"https://github.com/MIT-MI/human_behavior_atlas/blob/HEAD/training/rl/reward_function/human_behaviour.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"478ec7c6a2abcfff","mcp_get_code":{"code_sha256":"478ec7c6a2abcfff"}},{"arxiv_id":"2602.10635","paper":"/paper/arxiv-2602-10635","title":"OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"MIT-MI/human_behavior_atlas","path":"training/rl/reward_function/human_behaviour_harpo.py","file_url":"https://github.com/MIT-MI/human_behavior_atlas/blob/HEAD/training/rl/reward_function/human_behaviour_harpo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"48ce7f7eaee7ec01","mcp_get_code":{"code_sha256":"48ce7f7eaee7ec01"}},{"arxiv_id":"2602.03084","paper":"/paper/arxiv-2602-03084","title":"AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"mira-ai-lab/AERO","path":"synth/inner_loop.py","file_url":"https://github.com/mira-ai-lab/AERO/blob/HEAD/synth/inner_loop.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"42c1c4531ba1e342","mcp_get_code":{"code_sha256":"42c1c4531ba1e342"}},{"arxiv_id":"2601.09233","paper":"/paper/arxiv-2601-09233","title":"GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"zzy1127/GIFT","path":"utils/polymath/run_eval.py","file_url":"https://github.com/zzy1127/GIFT/blob/HEAD/utils/polymath/run_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0db9401e2d8d130e","mcp_get_code":{"code_sha256":"0db9401e2d8d130e"}},{"arxiv_id":"2505.00662","paper":"/paper/deepcritic-deliberate-critique-with-large","title":"DeepCritic: Deliberate Critique with Large Language Models","date":"2025-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucbm/deepcritic","path":"Critique_Generation/correct_slutions_rollout.py","file_url":"https://github.com/rucbm/deepcritic/blob/HEAD/Critique_Generation/correct_slutions_rollout.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"270812d6db4adfac","mcp_get_code":{"code_sha256":"270812d6db4adfac"}},{"arxiv_id":"2505.00662","paper":"/paper/deepcritic-deliberate-critique-with-large","title":"DeepCritic: Deliberate Critique with Large Language Models","date":"2025-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucbm/deepcritic","path":"Critique_Generation/gen_step_solutions.py","file_url":"https://github.com/rucbm/deepcritic/blob/HEAD/Critique_Generation/gen_step_solutions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f9fd47fd902934ae","mcp_get_code":{"code_sha256":"f9fd47fd902934ae"}},{"arxiv_id":"2504.20157","paper":"/paper/toward-evaluative-thinking-meta-policy","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","date":"2025-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"minnesotanlp/mpo","path":"trl/extras/mpo/rm_math_reasoning.py","file_url":"https://github.com/minnesotanlp/mpo/blob/HEAD/trl/extras/mpo/rm_math_reasoning.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":false,"code_sha256_prefix":"cf11df858b102576","mcp_get_code":{"code_sha256":"cf11df858b102576"}},{"arxiv_id":"2504.18428","paper":"/paper/polymath-evaluating-mathematical-reasoning-in","title":"PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts","date":"2025-04-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"QwenLM/PolyMath","path":"eval/run_eval.py","file_url":"https://github.com/QwenLM/PolyMath/blob/HEAD/eval/run_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0db9401e2d8d130e","mcp_get_code":{"code_sha256":"0db9401e2d8d130e"}},{"arxiv_id":"2409.00147","paper":"/paper/multimath-bridging-visual-and-mathematical","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","date":"2024-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pengshuai-rin/multimath","path":"eval_mathverse/infer.py","file_url":"https://github.com/pengshuai-rin/multimath/blob/HEAD/eval_mathverse/infer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8c9945b50705931d","mcp_get_code":{"code_sha256":"8c9945b50705931d"}},{"arxiv_id":"2409.00147","paper":"/paper/multimath-bridging-visual-and-mathematical","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","date":"2024-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pengshuai-rin/multimath","path":"eval_mathvista/response.py","file_url":"https://github.com/pengshuai-rin/multimath/blob/HEAD/eval_mathvista/response.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a820443033d63826","mcp_get_code":{"code_sha256":"a820443033d63826"}}]}