{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/generate-completions","entry":"generate_completions","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":38,"n_papers_ran":23,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":15,"n_samples_ran":7,"n_samples_fingerprinted":0,"n_places":39,"n_places_pointer_only":14,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":7,"unverified":8},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2606.10528","paper":"/paper/arxiv-2606-10528","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"fanqiwan/FuseAI","path":"FuseO1-Preview/math_evaluation/model_utils.py","file_url":"https://github.com/fanqiwan/FuseAI/blob/HEAD/FuseO1-Preview/math_evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2606.06315","paper":"/paper/arxiv-2606-06315","title":"LLM Self-Recognition: Steering and Retrieving Activation Signatures","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Thibaud-Ardoin/LLM-Self-Recognition","path":"self_recognition/LLM_SelfRecognition_via_Activations-public/text_generation.py","file_url":"https://github.com/Thibaud-Ardoin/LLM-Self-Recognition/blob/HEAD/self_recognition/LLM_SelfRecognition_via_Activations-public/text_generation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4eab1454f559e5e8","mcp_get_code":{"code_sha256":"4eab1454f559e5e8"}},{"arxiv_id":"2604.11056","paper":"/paper/arxiv-2604-11056","title":"Where Hindsight Credit Can Reside: A Signed-Capacity View of Token Updates in RLVR","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"QwenLM/Qwen2.5-Math","path":"evaluation/model_utils.py","file_url":"https://github.com/QwenLM/Qwen2.5-Math/blob/HEAD/evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2604.08281","paper":"/paper/arxiv-2604-08281","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"00Dreamer00/ATTC","path":"model_utils.py","file_url":"https://github.com/00Dreamer00/ATTC/blob/HEAD/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2604.00698","paper":"/paper/arxiv-2604-00698","title":"Learning to Hint for Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"Andree-9/HiLL","path":"eval/qwen_evaluation/model_utils.py","file_url":"https://github.com/Andree-9/HiLL/blob/HEAD/eval/qwen_evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2603.19470","paper":"/paper/arxiv-2603-19470","title":"Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"amazon-science/adaptive-layerwise-perturbation","path":"multi-turn/eval/qwen_evaluation/model_utils.py","file_url":"https://github.com/amazon-science/adaptive-layerwise-perturbation/blob/HEAD/multi-turn/eval/qwen_evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2602.13773","paper":"/paper/arxiv-2602-13773","title":"On Representation Redundancy in Large-Scale Instruction Tuning Data Selection","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"tdano1/CRDS","path":"main/eval/eval_utils.py","file_url":"https://github.com/tdano1/CRDS/blob/HEAD/main/eval/eval_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"352416cd121404a7","mcp_get_code":{"code_sha256":"352416cd121404a7"}},{"arxiv_id":"2602.13773","paper":"/paper/arxiv-2602-13773","title":"On Representation Redundancy in Large-Scale Instruction Tuning Data Selection","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"tdano1/CRDS","path":"main/eval/utils.py","file_url":"https://github.com/tdano1/CRDS/blob/HEAD/main/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cdbcc01805fac313","mcp_get_code":{"code_sha256":"cdbcc01805fac313"}},{"arxiv_id":"2602.03143","paper":"/paper/arxiv-2602-03143","title":"Self-Hinting Language Models Enhance Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"BaohaoLiao/SAGE","path":"eval/qwen_evaluation/model_utils.py","file_url":"https://github.com/BaohaoLiao/SAGE/blob/HEAD/eval/qwen_evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2602.01539","paper":"/paper/arxiv-2602-01539","title":"MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"BattleWen/MAGIC","path":"eval/safety-eval-fork/src/generation_utils.py","file_url":"https://github.com/BattleWen/MAGIC/blob/HEAD/eval/safety-eval-fork/src/generation_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0910689e7f72b55a","mcp_get_code":{"code_sha256":"0910689e7f72b55a"}},{"arxiv_id":"2601.03895","paper":"/paper/arxiv-2601-03895","title":"All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"chi2liu/ABC-GRPO","path":"eval_math/model_utils.py","file_url":"https://github.com/chi2liu/ABC-GRPO/blob/HEAD/eval_math/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2507.13266","paper":"/paper/questa-expanding-reasoning-capacity-in-llms","title":"QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation","date":"2025-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"foreverlasting1202/QuestA","path":"AReaL/evaluation/model_utils.py","file_url":"https://github.com/foreverlasting1202/QuestA/blob/HEAD/AReaL/evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2506.20512","paper":"/paper/octothinker-mid-training-incentivizes","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","date":"2025-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gair-nlp/octothinker","path":"eval/eval/utils.py","file_url":"https://github.com/gair-nlp/octothinker/blob/HEAD/eval/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"73f280086b2714ce","mcp_get_code":{"code_sha256":"73f280086b2714ce"}},{"arxiv_id":"2505.19716","paper":"/paper/concise-reasoning-big-gains-pruning-long","title":"Concise Reasoning, Big Gains: Pruning Long Reasoning Trace with Difficulty-Aware Prompting","date":"2025-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"evanwu1125/litecot","path":"eval/Qwen2.5-Math/evaluation/model_utils.py","file_url":"https://github.com/evanwu1125/litecot/blob/HEAD/eval/Qwen2.5-Math/evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2505.07437","paper":"/paper/lead-iterative-data-selection-for-efficient","title":"LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning","date":"2025-05-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HKUSTDial/LEAD","path":"src/eval/utils.py","file_url":"https://github.com/HKUSTDial/LEAD/blob/HEAD/src/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cdbcc01805fac313","mcp_get_code":{"code_sha256":"cdbcc01805fac313"}},{"arxiv_id":"2504.20571","paper":"/paper/reinforcement-learning-for-reasoning-in-large","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","date":"2025-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ypwang61/one-shot-rlvr","path":"Qwen2.5-Eval/evaluation/model_utils.py","file_url":"https://github.com/ypwang61/one-shot-rlvr/blob/HEAD/Qwen2.5-Eval/evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2504.16828","paper":"/paper/process-reward-models-that-think","title":"Process Reward Models That Think","date":"2025-04-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mukhal/thinkprm","path":"search-and-learn/evaluation/model_utils.py","file_url":"https://github.com/mukhal/thinkprm/blob/HEAD/search-and-learn/evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2504.11393","paper":"/paper/datadecide-how-to-predict-best-pretraining","title":"DataDecide: How to Predict Best Pretraining Data with Small Experiments","date":"2025-04-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gair-nlp/prox","path":"eval/utils.py","file_url":"https://github.com/gair-nlp/prox/blob/HEAD/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"656a50d525064a31","mcp_get_code":{"code_sha256":"656a50d525064a31"}},{"arxiv_id":"2504.05185","paper":"/paper/concise-reasoning-via-reinforcement-learning","title":"Concise Reasoning via Reinforcement Learning","date":"2025-04-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai-wand/concise-reasoning","path":"eval/model_utils.py","file_url":"https://github.com/ai-wand/concise-reasoning/blob/HEAD/eval/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2502.12853","paper":"/paper/s-2-r-teaching-llms-to-self-verify-and-self","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","date":"2025-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nineabyss/s2r","path":"sample/model_utils.py","file_url":"https://github.com/nineabyss/s2r/blob/HEAD/sample/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2502.12067","paper":"/paper/tokenskip-controllable-chain-of-thought","title":"TokenSkip: Controllable Chain-of-Thought Compression in LLMs","date":"2025-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hemingkx/TokenSkip","path":"eval/utils.py","file_url":"https://github.com/hemingkx/TokenSkip/blob/HEAD/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"14ec4b04b4360475","mcp_get_code":{"code_sha256":"14ec4b04b4360475"}},{"arxiv_id":"2502.06773","paper":"/paper/on-the-emergence-of-thinking-in-llms-i","title":"On the Emergence of Thinking in LLMs I: Searching for the Right Intuition","date":"2025-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"GuanghaoYe/Emergence-of-Thinking","path":"evaluation/model_utils.py","file_url":"https://github.com/GuanghaoYe/Emergence-of-Thinking/blob/HEAD/evaluation/model_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"25f1381fe69df071","mcp_get_code":{"code_sha256":"25f1381fe69df071"}},{"arxiv_id":"2412.03187","paper":"/paper/weighted-reward-preference-optimization-for","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","date":"2024-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fanqiwan/fuseai","path":"FuseO1-Preview/math_evaluation/model_utils.py","file_url":"https://github.com/fanqiwan/fuseai/blob/HEAD/FuseO1-Preview/math_evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2410.24175","paper":"/paper/constraint-back-translation-improves-complex","title":"Constraint Back-translation Improves Complex Instruction Following of Large Language Models","date":"2024-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thu-keg/crab","path":"eval/utils.py","file_url":"https://github.com/thu-keg/crab/blob/HEAD/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cdbcc01805fac313","mcp_get_code":{"code_sha256":"cdbcc01805fac313"}},{"arxiv_id":"2410.16208","paper":"/paper/compute-constrained-data-selection","title":"Compute-Constrained Data Selection","date":"2024-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"oseyosey/CCDS","path":"ccds/evaluation/eval/utils.py","file_url":"https://github.com/oseyosey/CCDS/blob/HEAD/ccds/evaluation/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"352416cd121404a7","mcp_get_code":{"code_sha256":"352416cd121404a7"}},{"arxiv_id":"2410.07985","paper":"/paper/omni-math-a-universal-olympiad-level","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","date":"2024-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kbsdjames/omni-math-rule","path":"evaluation/model_utils.py","file_url":"https://github.com/kbsdjames/omni-math-rule/blob/HEAD/evaluation/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2408.07471","paper":"/paper/bridging-and-modeling-correlations-in","title":"Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization","date":"2024-08-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"YJiangcm/BMC","path":"eval/math/eval/model_utils.py","file_url":"https://github.com/YJiangcm/BMC/blob/HEAD/eval/math/eval/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2407.08770","paper":"/paper/model-surgery-modulating-llm-s-behavior-via","title":"Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucywang720/model-surgery","path":"eval/utils.py","file_url":"https://github.com/lucywang720/model-surgery/blob/HEAD/eval/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0064be5c9154d721","mcp_get_code":{"code_sha256":"0064be5c9154d721"}},{"arxiv_id":"2406.18629","paper":"/paper/step-dpo-step-wise-preference-optimization","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","date":"2024-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dvlab-research/step-dpo","path":"evaluation/eval/utils.py","file_url":"https://github.com/dvlab-research/step-dpo/blob/HEAD/evaluation/eval/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"df28d2ed3962986b","mcp_get_code":{"code_sha256":"df28d2ed3962986b"}},{"arxiv_id":"2406.14144","paper":"/paper/finding-safety-neurons-in-large-language","title":"Finding Safety Neurons in Large Language Models","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"THU-KEG/SafetyNeuron","path":"src/eval/utils.py","file_url":"https://github.com/THU-KEG/SafetyNeuron/blob/HEAD/src/eval/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4b7fca0051f25274","mcp_get_code":{"code_sha256":"4b7fca0051f25274"}},{"arxiv_id":"2405.14365","paper":"/paper/jiuzhang3-0-efficiently-improving","title":"JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis Models","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucaibox/jiuzhang3.0","path":"eval/model_utils.py","file_url":"https://github.com/rucaibox/jiuzhang3.0/blob/HEAD/eval/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1525d8bc0fc8d5a0","mcp_get_code":{"code_sha256":"1525d8bc0fc8d5a0"}},{"arxiv_id":"2405.05008","paper":"/paper/adelie-aligning-large-language-models-on","title":"ADELIE: Aligning Large Language Models on Information Extraction","date":"2024-05-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"THU-KEG/ADELIE","path":"train4llama/eval/utils.py","file_url":"https://github.com/THU-KEG/ADELIE/blob/HEAD/train4llama/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cdbcc01805fac313","mcp_get_code":{"code_sha256":"cdbcc01805fac313"}},{"arxiv_id":"2402.16705","paper":"/paper/selectit-selective-instruction-tuning-for","title":"SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection","date":"2024-02-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Blue-Raincoat/SelectIT","path":"eval/eval/utils.py","file_url":"https://github.com/Blue-Raincoat/SelectIT/blob/HEAD/eval/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cdbcc01805fac313","mcp_get_code":{"code_sha256":"cdbcc01805fac313"}},{"arxiv_id":"2401.16405","paper":"/paper/scaling-sparse-fine-tuning-to-large-language","title":"Scaling Sparse Fine-Tuning to Large Language Models","date":"2024-01-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ducdauge/sft-llm","path":"eval/utils.py","file_url":"https://github.com/ducdauge/sft-llm/blob/HEAD/eval/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"62004a6900e0e332","mcp_get_code":{"code_sha256":"62004a6900e0e332"}},{"arxiv_id":"2401.15006","paper":"/paper/airavata-introducing-hindi-instruction-tuned","title":"Airavata: Introducing Hindi Instruction-tuned LLM","date":"2024-01-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai4bharat/indicinstruct","path":"eval/utils.py","file_url":"https://github.com/ai4bharat/indicinstruct/blob/HEAD/eval/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"352416cd121404a7","mcp_get_code":{"code_sha256":"352416cd121404a7"}},{"arxiv_id":"2401.10768","paper":"/paper/mitigating-hallucinations-of-large-language","title":"Knowledge Verification to Nip Hallucination in the Bud","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fanqiwan/KCA","path":"examination/utils.py","file_url":"https://github.com/fanqiwan/KCA/blob/HEAD/examination/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"352416cd121404a7","mcp_get_code":{"code_sha256":"352416cd121404a7"}},{"arxiv_id":"2401.08565","paper":"/paper/tuning-language-models-by-proxy","title":"Tuning Language Models by Proxy","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alisawuffles/proxy-tuning","path":"eval/utils.py","file_url":"https://github.com/alisawuffles/proxy-tuning/blob/HEAD/eval/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b304416cbba64cb7","mcp_get_code":{"code_sha256":"b304416cbba64cb7"}},{"arxiv_id":"2310.08491","paper":"/paper/prometheus-inducing-fine-grained-evaluation","title":"Prometheus: Inducing Fine-grained Evaluation Capability in Language Models","date":"2023-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kaistAI/Prometheus","path":"train/utils.py","file_url":"https://github.com/kaistAI/Prometheus/blob/HEAD/train/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"352416cd121404a7","mcp_get_code":{"code_sha256":"352416cd121404a7"}},{"arxiv_id":"2310.06830","paper":"/paper/lemur-harmonizing-natural-language-and-code","title":"Lemur: Harmonizing Natural Language and Code for Language Agents","date":"2023-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenLemur/Lemur","path":"xchat/eval/utils.py","file_url":"https://github.com/OpenLemur/Lemur/blob/HEAD/xchat/eval/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3eeddf88871321ab","mcp_get_code":{"code_sha256":"3eeddf88871321ab"}}]}