{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/apply-chat-template","entry":"apply_chat_template","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":44,"n_papers_ran":26,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":35,"n_samples_ran":20,"n_samples_fingerprinted":0,"n_places":45,"n_places_pointer_only":18,"by_status":{"ran_honours":1,"ran_violates":0,"ran_draft_wrong":4,"ran_fixture":0,"ran":15,"unverified":15},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.19662","paper":"/paper/arxiv-2608-19662","title":"ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"EIT-NLP/ReCache","path":"capsule/src/chat.py","file_url":"https://github.com/EIT-NLP/ReCache/blob/HEAD/capsule/src/chat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"561fab9ba99c10a9","mcp_get_code":{"code_sha256":"561fab9ba99c10a9"}},{"arxiv_id":"2607.19450","paper":"/paper/arxiv-2607-19450","title":"REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"yunjie-sysu/REGEN","path":"regen_train.py","file_url":"https://github.com/yunjie-sysu/REGEN/blob/HEAD/regen_train.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fa5ffe76078469b4","mcp_get_code":{"code_sha256":"fa5ffe76078469b4"}},{"arxiv_id":"2606.11854","paper":"/paper/arxiv-2606-11854","title":"Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"jinymusim/ART","path":"src/reasoning_with_art/models/chat_template.py","file_url":"https://github.com/jinymusim/ART/blob/HEAD/src/reasoning_with_art/models/chat_template.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"8c6d5abeff384032","mcp_get_code":{"code_sha256":"8c6d5abeff384032"}},{"arxiv_id":"2606.09124","paper":"/paper/arxiv-2606-09124","title":"A Regret Minimization Framework on Preference Learning in Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"YSLIU627/Regularized-Preference-Optimization","path":"alignment-handbook/src/alignment/data.py","file_url":"https://github.com/YSLIU627/Regularized-Preference-Optimization/blob/HEAD/alignment-handbook/src/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5a84f9e5640fe497","mcp_get_code":{"code_sha256":"5a84f9e5640fe497"}},{"arxiv_id":"2606.02684","paper":"/paper/arxiv-2606-02684","title":"Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"YuYingLi0/FiRe-OPD","path":"math_eval/eval_math.py","file_url":"https://github.com/YuYingLi0/FiRe-OPD/blob/HEAD/math_eval/eval_math.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6eceb1b9ba215e62","mcp_get_code":{"code_sha256":"6eceb1b9ba215e62"}},{"arxiv_id":"2605.11974","paper":"/paper/arxiv-2605-11974","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Hyalinesky/DGAO","path":"trl/data_utils.py","file_url":"https://github.com/Hyalinesky/DGAO/blob/HEAD/trl/data_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c70072e46530e6e1","mcp_get_code":{"code_sha256":"c70072e46530e6e1"}},{"arxiv_id":"2605.11739","paper":"/paper/arxiv-2605-11739","title":"Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"caiyuchen-ustc/EffOPD","path":"EffOPD/math_eval/eval_math.py","file_url":"https://github.com/caiyuchen-ustc/EffOPD/blob/HEAD/EffOPD/math_eval/eval_math.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6eceb1b9ba215e62","mcp_get_code":{"code_sha256":"6eceb1b9ba215e62"}},{"arxiv_id":"2604.20051","paper":"/paper/arxiv-2604-20051","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"HCY123902/POP","path":"training/data_utils.py","file_url":"https://github.com/HCY123902/POP/blob/HEAD/training/data_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f8fe363ab9ecb4d6","mcp_get_code":{"code_sha256":"f8fe363ab9ecb4d6"}},{"arxiv_id":"2602.10117","paper":"/paper/arxiv-2602-10117","title":"Biases in the Blind Spot: Detecting What LLMs Fail to Mention","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"FlyingPumba/biases-in-the-blind-spot","path":"biases_in_the_blind_spot/prompting.py","file_url":"https://github.com/FlyingPumba/biases-in-the-blind-spot/blob/HEAD/biases_in_the_blind_spot/prompting.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8d2a192c16537e25","mcp_get_code":{"code_sha256":"8d2a192c16537e25"}},{"arxiv_id":"2512.11715","paper":"/paper/arxiv-2512-11715","title":"EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"VectorSpaceLab/OmniGen2","path":"OmniGen2-RL/reward_server/reward_server.py","file_url":"https://github.com/VectorSpaceLab/OmniGen2/blob/HEAD/OmniGen2-RL/reward_server/reward_server.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a6ba03fb70bfe8c6","mcp_get_code":{"code_sha256":"a6ba03fb70bfe8c6"}},{"arxiv_id":"2509.13760","paper":"/paper/arxiv-2509-13760","title":"Iterative Prompt Refinement for Safer Text-to-Image Generation","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"ku-dmlab/IPR","path":"trl/data_utils.py","file_url":"https://github.com/ku-dmlab/IPR/blob/HEAD/trl/data_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53017c7a8e570221","mcp_get_code":{"code_sha256":"53017c7a8e570221"}},{"arxiv_id":"2506.18871","paper":"/paper/omnigen2-exploration-to-advanced-multimodal","title":"OmniGen2: Exploration to Advanced Multimodal Generation","date":"2025-06-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vectorspacelab/omnigen2","path":"OmniGen2-RL/reward_server/reward_server.py","file_url":"https://github.com/vectorspacelab/omnigen2/blob/HEAD/OmniGen2-RL/reward_server/reward_server.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a6ba03fb70bfe8c6","mcp_get_code":{"code_sha256":"a6ba03fb70bfe8c6"}},{"arxiv_id":"2506.08349","paper":"/paper/evaluating-llms-across-multi-cognitive-levels","title":"Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving","date":"2025-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thumlp/multicogeval","path":"scripts/evaluate_high_level.py","file_url":"https://github.com/thumlp/multicogeval/blob/HEAD/scripts/evaluate_high_level.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"435da15dd90581b2","mcp_get_code":{"code_sha256":"435da15dd90581b2"}},{"arxiv_id":"2505.15656","paper":"/paper/be-careful-when-fine-tuning-on-open-source","title":"Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!","date":"2025-05-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thu-coai/backdoor-data-extraction","path":"train/trl/data_utils.py","file_url":"https://github.com/thu-coai/backdoor-data-extraction/blob/HEAD/train/trl/data_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53017c7a8e570221","mcp_get_code":{"code_sha256":"53017c7a8e570221"}},{"arxiv_id":"2505.13866","paper":"/paper/reasoning-path-compression-compressing","title":"Reasoning Path Compression: Compressing Generation Trajectories for Efficient LLM Reasoning","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiwonsong-dev/reasoningpathcompression","path":"utils/apply_chat_template.py","file_url":"https://github.com/jiwonsong-dev/reasoningpathcompression/blob/HEAD/utils/apply_chat_template.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d966163bc3a3005","mcp_get_code":{"code_sha256":"2d966163bc3a3005"}},{"arxiv_id":"2505.09655","paper":"/paper/dra-grpo-exploring-diversity-aware-reward","title":"DRA-GRPO: Exploring Diversity-Aware Reward Adjustment for R1-Zero-Like Training of Large Language Models","date":"2025-05-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiwenc1/dra-grpo","path":"src/open_r1/trl/data_utils.py","file_url":"https://github.com/xiwenc1/dra-grpo/blob/HEAD/src/open_r1/trl/data_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53017c7a8e570221","mcp_get_code":{"code_sha256":"53017c7a8e570221"}},{"arxiv_id":"2505.00662","paper":"/paper/deepcritic-deliberate-critique-with-large","title":"DeepCritic: Deliberate Critique with Large Language Models","date":"2025-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucbm/deepcritic","path":"Critique_Generation/correct_slutions_rollout.py","file_url":"https://github.com/rucbm/deepcritic/blob/HEAD/Critique_Generation/correct_slutions_rollout.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"488c133e028a1ca6","mcp_get_code":{"code_sha256":"488c133e028a1ca6"}},{"arxiv_id":"2505.00662","paper":"/paper/deepcritic-deliberate-critique-with-large","title":"DeepCritic: Deliberate Critique with Large Language Models","date":"2025-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucbm/deepcritic","path":"Critique_Generation/gen_step_solutions.py","file_url":"https://github.com/rucbm/deepcritic/blob/HEAD/Critique_Generation/gen_step_solutions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2e16de463ce3df94","mcp_get_code":{"code_sha256":"2e16de463ce3df94"}},{"arxiv_id":"2504.20157","paper":"/paper/toward-evaluative-thinking-meta-policy","title":"Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models","date":"2025-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"minnesotanlp/mpo","path":"trl/data_utils.py","file_url":"https://github.com/minnesotanlp/mpo/blob/HEAD/trl/data_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":false,"code_sha256_prefix":"0b7223ebdefef219","mcp_get_code":{"code_sha256":"0b7223ebdefef219"}},{"arxiv_id":"2503.12524","paper":"/paper/exaone-deep-reasoning-enhanced-language","title":"EXAONE Deep: Reasoning Enhanced Language Models","date":"2025-03-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tengxiao1/simper","path":"alignment/data.py","file_url":"https://github.com/tengxiao1/simper/blob/HEAD/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9be97bcdb51fd634","mcp_get_code":{"code_sha256":"9be97bcdb51fd634"}},{"arxiv_id":"2502.18274","paper":"/paper/citrus-leveraging-expert-cognitive-pathways","title":"Citrus: Leveraging Expert Cognitive Pathways in a Medical Language Model for Advanced Medical Decision Support","date":"2025-02-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jdh-algo/Citrus","path":"model_train/alignment/data.py","file_url":"https://github.com/jdh-algo/Citrus/blob/HEAD/model_train/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9be97bcdb51fd634","mcp_get_code":{"code_sha256":"9be97bcdb51fd634"}},{"arxiv_id":"2502.11089","paper":"/paper/native-sparse-attention-hardware-aligned-and","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","date":"2025-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/seerattention","path":"distillation_decode.py","file_url":"https://github.com/microsoft/seerattention/blob/HEAD/distillation_decode.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"202aa55ac60ff1f6","mcp_get_code":{"code_sha256":"202aa55ac60ff1f6"}},{"arxiv_id":"2502.00657","paper":"/paper/llm-safety-alignment-is-divergence-estimation","title":"LLM Safety Alignment is Divergence Estimation in Disguise","date":"2025-02-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rhaldarpurdue/kldo","path":"metrics.py","file_url":"https://github.com/rhaldarpurdue/kldo/blob/HEAD/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a3e5e980b0266d7e","mcp_get_code":{"code_sha256":"a3e5e980b0266d7e"}},{"arxiv_id":"2412.14516","paper":"/paper/cal-dpo-calibrated-direct-preference","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","date":"2024-12-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tengxiao1/cal-dpo","path":"scripts/run_dpo.py","file_url":"https://github.com/tengxiao1/cal-dpo/blob/HEAD/scripts/run_dpo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e9f3be83e4d643bb","mcp_get_code":{"code_sha256":"e9f3be83e4d643bb"}},{"arxiv_id":"2412.06559","paper":"/paper/processbench-identifying-process-errors-in","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","date":"2024-12-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qwenlm/processbench","path":"code/run_eval.py","file_url":"https://github.com/qwenlm/processbench/blob/HEAD/code/run_eval.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ff5ecf497e982ea2","mcp_get_code":{"code_sha256":"ff5ecf497e982ea2"}},{"arxiv_id":"2411.02442","paper":"/paper/todo-enhancing-llm-alignment-with-ternary","title":"TODO: Enhancing LLM Alignment with Ternary Preferences","date":"2024-11-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XXares/TODO","path":"utils/utils.py","file_url":"https://github.com/XXares/TODO/blob/HEAD/utils/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6744441ca5bd1ea7","mcp_get_code":{"code_sha256":"6744441ca5bd1ea7"}},{"arxiv_id":"2410.10148","paper":"/paper/a-dpo-adaptive-reward-margin-is-what-direct","title":"$α$-DPO: Adaptive Reward Margin is What Direct Preference Optimization Needs","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"junkangwu/alpha-dpo","path":"alignment/data.py","file_url":"https://github.com/junkangwu/alpha-dpo/blob/HEAD/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9be97bcdb51fd634","mcp_get_code":{"code_sha256":"9be97bcdb51fd634"}},{"arxiv_id":"2410.10093","paper":"/paper/how-to-leverage-demonstration-data-in","title":"How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tengxiao1/GSIL","path":"gsil/alignment/data.py","file_url":"https://github.com/tengxiao1/GSIL/blob/HEAD/gsil/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"23781da963dd98a5","mcp_get_code":{"code_sha256":"23781da963dd98a5"}},{"arxiv_id":"2410.03145","paper":"/paper/margin-matching-preference-optimization","title":"Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback","date":"2024-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kykim0/margin-matching-pref-opt","path":"src/alignment/data.py","file_url":"https://github.com/kykim0/margin-matching-pref-opt/blob/HEAD/src/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9be06c85912c5236","mcp_get_code":{"code_sha256":"9be06c85912c5236"}},{"arxiv_id":"2409.05591","paper":"/paper/memorag-moving-towards-next-gen-rag-via","title":"MemoRAG: Moving towards Next-Gen RAG Via Memory-Inspired Knowledge Discovery","date":"2024-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qhjqhj00/memorag","path":"train/src/chat.py","file_url":"https://github.com/qhjqhj00/memorag/blob/HEAD/train/src/chat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"561fab9ba99c10a9","mcp_get_code":{"code_sha256":"561fab9ba99c10a9"}},{"arxiv_id":"2409.03444","paper":"/paper/fine-tuning-large-language-models-for-domain-1","title":"Fine-tuning large language models for domain adaptation: Exploration of training strategies, scaling, model merging and synergistic capabilities","date":"2024-09-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lamm-mit/llm-finetuning","path":"alignment-handbook/src/alignment/data.py","file_url":"https://github.com/lamm-mit/llm-finetuning/blob/HEAD/alignment-handbook/src/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9a40c8da283bcd4a","mcp_get_code":{"code_sha256":"9a40c8da283bcd4a"}},{"arxiv_id":"2408.15313","paper":"/paper/bi-factorial-preference-optimization","title":"Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models","date":"2024-08-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wx-zhang/bfpo","path":"src/alignment/data.py","file_url":"https://github.com/wx-zhang/bfpo/blob/HEAD/src/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ecf650a71ce5efc6","mcp_get_code":{"code_sha256":"ecf650a71ce5efc6"}},{"arxiv_id":"2407.09014","paper":"/paper/compact-compressing-retrieved-documents","title":"CompAct: Compressing Retrieved Documents Actively for Question Answering","date":"2024-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dmis-lab/CompAct","path":"alignment-handbook/src/alignment/data.py","file_url":"https://github.com/dmis-lab/CompAct/blob/HEAD/alignment-handbook/src/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9be97bcdb51fd634","mcp_get_code":{"code_sha256":"9be97bcdb51fd634"}},{"arxiv_id":"2407.11007","paper":"/paper/panacea-a-foundation-model-for-clinical-trial","title":"Panacea: A foundation model for clinical trial search, summarization, design, and recruitment","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"linjc16/panacea","path":"alignment/data.py","file_url":"https://github.com/linjc16/panacea/blob/HEAD/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b90a3acb4197f936","mcp_get_code":{"code_sha256":"b90a3acb4197f936"}},{"arxiv_id":"2406.19371","paper":"/paper/suri-multi-constraint-instruction-following","title":"Suri: Multi-constraint Instruction Following for Long-form Text Generation","date":"2024-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chtmp223/suri","path":"ft/lib/alignment_mod/data.py","file_url":"https://github.com/chtmp223/suri/blob/HEAD/ft/lib/alignment_mod/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ed74b164b2fe6a65","mcp_get_code":{"code_sha256":"ed74b164b2fe6a65"}},{"arxiv_id":"2406.10785","paper":"/paper/sharelora-parameter-efficient-and-robust","title":"ShareLoRA: Parameter Efficient and Robust Large Language Model Fine-tuning via Shared Low-Rank Adaptation","date":"2024-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Rain9876/ShareLoRA","path":"sharelora/few_shot.py","file_url":"https://github.com/Rain9876/ShareLoRA/blob/HEAD/sharelora/few_shot.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"758b57f056efcfff","mcp_get_code":{"code_sha256":"758b57f056efcfff"}},{"arxiv_id":"2406.08414","paper":"/paper/discovering-preference-optimization","title":"Discovering Preference Optimization Algorithms with and for Large Language Models","date":"2024-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luchris429/DiscoPOP","path":"src/alignment/data.py","file_url":"https://github.com/luchris429/DiscoPOP/blob/HEAD/src/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9be97bcdb51fd634","mcp_get_code":{"code_sha256":"9be97bcdb51fd634"}},{"arxiv_id":"2405.19332","paper":"/paper/self-exploring-language-models-active","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shenao-zhang/selm","path":"src/alignment/data.py","file_url":"https://github.com/shenao-zhang/selm/blob/HEAD/src/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6ccb3e2cc15898e6","mcp_get_code":{"code_sha256":"6ccb3e2cc15898e6"}},{"arxiv_id":"2405.16681","paper":"/paper/triple-preference-optimization-achieving","title":"Triple Preference Optimization: Achieving Better Alignment with Less Data in a Single Step Optimization","date":"2024-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sahsaeedi/triple-preference-optimization","path":"utils/data.py","file_url":"https://github.com/sahsaeedi/triple-preference-optimization/blob/HEAD/utils/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a9cb92f38a00fa54","mcp_get_code":{"code_sha256":"a9cb92f38a00fa54"}},{"arxiv_id":"2405.14734","paper":"/paper/simpo-simple-preference-optimization-with-a","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-nlp/SimPO","path":"alignment/data.py","file_url":"https://github.com/princeton-nlp/SimPO/blob/HEAD/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9be97bcdb51fd634","mcp_get_code":{"code_sha256":"9be97bcdb51fd634"}},{"arxiv_id":"2405.07551","paper":"/paper/mumath-code-combining-tool-use-large-language","title":"MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical Reasoning","date":"2024-05-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"project-numina/aimo-progress-prize","path":"training/aimo/utils/utils.py","file_url":"https://github.com/project-numina/aimo-progress-prize/blob/HEAD/training/aimo/utils/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9e3cb3146217643b","mcp_get_code":{"code_sha256":"9e3cb3146217643b"}},{"arxiv_id":"2405.00675","paper":"/paper/self-play-preference-optimization-for","title":"Self-Play Preference Optimization for Language Model Alignment","date":"2024-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uclaml/sppo","path":"sppo/alignment/data.py","file_url":"https://github.com/uclaml/sppo/blob/HEAD/sppo/alignment/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b8b8e4dae1d1318b","mcp_get_code":{"code_sha256":"b8b8e4dae1d1318b"}},{"arxiv_id":"2402.05369","paper":"/paper/noise-contrastive-alignment-of-language","title":"Noise Contrastive Alignment of Language Models with Explicit Rewards","date":"2024-02-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thu-ml/Noise-Contrastive-Alignment","path":"data_utils.py","file_url":"https://github.com/thu-ml/Noise-Contrastive-Alignment/blob/HEAD/data_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c1fa452c713aa74","mcp_get_code":{"code_sha256":"3c1fa452c713aa74"}},{"arxiv_id":"2401.01335","paper":"/paper/self-play-fine-tuning-converts-weak-language","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","date":"2024-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uclaml/SPIN","path":"spin/run_spin.py","file_url":"https://github.com/uclaml/SPIN/blob/HEAD/spin/run_spin.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3cac05ec501439e8","mcp_get_code":{"code_sha256":"3cac05ec501439e8"}},{"arxiv_id":"2025.naacl-long.550","paper":null,"title":"arXiv:2025.naacl-long.550","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"hexuan21/Weak-to-Strong","path":"run_inference.py","file_url":"https://github.com/hexuan21/Weak-to-Strong/blob/HEAD/run_inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"bdcadd7ed60f8a7c","mcp_get_code":{"code_sha256":"bdcadd7ed60f8a7c"}}]}