{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/generate-response","entry":"generate_response","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":23,"n_papers_ran":5,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":25,"n_samples_ran":5,"n_samples_fingerprinted":0,"n_places":25,"n_places_pointer_only":7,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":2,"ran_fixture":0,"ran":3,"unverified":20},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.00845","paper":"/paper/arxiv-2609-00845","title":"Towards Generalizable Visually Grounded Exploration of Household Devices","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"BITHLP/VGEBench","path":"models/local_model_infer.py","file_url":"https://github.com/BITHLP/VGEBench/blob/HEAD/models/local_model_infer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0674caebbfe44771","mcp_get_code":{"code_sha256":"0674caebbfe44771"}},{"arxiv_id":"2605.17565","paper":"/paper/arxiv-2605-17565","title":"Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"ethanjtang/GAMBIT","path":"eval_models_on_puzzles/eval_all_models_modulo.py","file_url":"https://github.com/ethanjtang/GAMBIT/blob/HEAD/eval_models_on_puzzles/eval_all_models_modulo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"9006d9d9d587b7ad","mcp_get_code":{"code_sha256":"9006d9d9d587b7ad"}},{"arxiv_id":"2605.08842","paper":"/paper/arxiv-2605-08842","title":"XPERT: Expert Knowledge Transfer for Effective Training of Language Models","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"databrickslabs/dolly","path":"training/generate.py","file_url":"https://github.com/databrickslabs/dolly/blob/HEAD/training/generate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cc51a3411a9b657d","mcp_get_code":{"code_sha256":"cc51a3411a9b657d"}},{"arxiv_id":"2603.09992","paper":"/paper/arxiv-2603-09992","title":"TAMUSA-Chat: A Domain-Adapted Large Language Model Conversational System for Research and Responsible Deployment","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"alsmadi/TAMUSA_LLM_Based_Chat_app","path":"inference_TAMUSA_V2.py","file_url":"https://github.com/alsmadi/TAMUSA_LLM_Based_Chat_app/blob/HEAD/inference_TAMUSA_V2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1fc5a0b97bbfbb15","mcp_get_code":{"code_sha256":"1fc5a0b97bbfbb15"}},{"arxiv_id":"2602.19146","paper":"/paper/arxiv-2602-19146","title":"VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"dmgcsilva/vigia","path":"inference/vigia/dialogue_sim.py","file_url":"https://github.com/dmgcsilva/vigia/blob/HEAD/inference/vigia/dialogue_sim.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5c629cd26c7f460f","mcp_get_code":{"code_sha256":"5c629cd26c7f460f"}},{"arxiv_id":"2602.01685","paper":"/paper/arxiv-2602-01685","title":"Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"aailab-kaist/WPR","path":"inference/inference_apps.py","file_url":"https://github.com/aailab-kaist/WPR/blob/HEAD/inference/inference_apps.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d94756f73698ae1a","mcp_get_code":{"code_sha256":"d94756f73698ae1a"}},{"arxiv_id":"2602.01685","paper":"/paper/arxiv-2602-01685","title":"Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"aailab-kaist/WPR","path":"inference/inference_with_rewards.py","file_url":"https://github.com/aailab-kaist/WPR/blob/HEAD/inference/inference_with_rewards.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6b6296292665f55a","mcp_get_code":{"code_sha256":"6b6296292665f55a"}},{"arxiv_id":"2507.19969","paper":null,"title":"arXiv:2507.19969","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"vis-nlp/Text2Vis","path":"inference_gpt4o.py","file_url":"https://github.com/vis-nlp/Text2Vis/blob/HEAD/inference_gpt4o.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"5f0ed7387f61400a","mcp_get_code":{"code_sha256":"5f0ed7387f61400a"}},{"arxiv_id":"2507.10646","paper":"/paper/codeassistbench-cab-dataset-benchmarking-for","title":"CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance","date":"2025-07-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amazon-science/CodeAssistBench","path":"script/docker_filter.py","file_url":"https://github.com/amazon-science/CodeAssistBench/blob/HEAD/script/docker_filter.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3ab69c08296acaf6","mcp_get_code":{"code_sha256":"3ab69c08296acaf6"}},{"arxiv_id":"2505.19684","paper":"/paper/viscra-a-visual-chain-reasoning-attack-for","title":"VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models","date":"2025-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DyMessi/VisCRA","path":"evaluation/gemini.py","file_url":"https://github.com/DyMessi/VisCRA/blob/HEAD/evaluation/gemini.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"85fe3245f510864a","mcp_get_code":{"code_sha256":"85fe3245f510864a"}},{"arxiv_id":"2505.19684","paper":"/paper/viscra-a-visual-chain-reasoning-attack-for","title":"VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models","date":"2025-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DyMessi/VisCRA","path":"evaluation/gpt4o.py","file_url":"https://github.com/DyMessi/VisCRA/blob/HEAD/evaluation/gpt4o.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a7841c5371a659a2","mcp_get_code":{"code_sha256":"a7841c5371a659a2"}},{"arxiv_id":"2502.15676","paper":"/paper/autotom-automated-bayesian-inverse-planning","title":"AutoToM: Automated Bayesian Inverse Planning and Model Discovery for Open-ended Theory of Mind","date":"2025-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chuanyangjin/MMToM-QA","path":"BIP-ALM/testing_gpt.py","file_url":"https://github.com/chuanyangjin/MMToM-QA/blob/HEAD/BIP-ALM/testing_gpt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2f2910e1108a303e","mcp_get_code":{"code_sha256":"2f2910e1108a303e"}},{"arxiv_id":"2502.01976","paper":"/paper/citer-collaborative-inference-for-efficient","title":"CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing","date":"2025-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aiming-lab/CITER","path":"src/pipeline/token_route.py","file_url":"https://github.com/aiming-lab/CITER/blob/HEAD/src/pipeline/token_route.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d124dd694ce32d15","mcp_get_code":{"code_sha256":"d124dd694ce32d15"}},{"arxiv_id":"2410.20424","paper":"/paper/autokaggle-a-multi-agent-framework-for","title":"AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions","date":"2024-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"multimodal-art-projection/AutoKaggle","path":"api_handler.py","file_url":"https://github.com/multimodal-art-projection/AutoKaggle/blob/HEAD/api_handler.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"44bf2cebd4c77920","mcp_get_code":{"code_sha256":"44bf2cebd4c77920"}},{"arxiv_id":"2410.04197","paper":"/paper/cs4-measuring-the-creativity-of-large","title":"CS4: Measuring the Creativity of Large Language Models Automatically by Controlling the Number of Story-Writing Constraints","date":"2024-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anirudhlakkaraju/cs4_benchmark","path":"code_files/storygen.py","file_url":"https://github.com/anirudhlakkaraju/cs4_benchmark/blob/HEAD/code_files/storygen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b547c94262782cf4","mcp_get_code":{"code_sha256":"b547c94262782cf4"}},{"arxiv_id":"2406.19853","paper":"/paper/yulan-an-open-source-large-language-model","title":"YuLan: An Open-source Large Language Model","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ruc-gsai/yulan-chat","path":"inference.py","file_url":"https://github.com/ruc-gsai/yulan-chat/blob/HEAD/inference.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"04a0454a2adc8ee4","mcp_get_code":{"code_sha256":"04a0454a2adc8ee4"}},{"arxiv_id":"2406.14155","paper":"/paper/aligning-large-language-models-with-diverse","title":"Aligning Large Language Models with Diverse Political Viewpoints","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dominiksinsaarland/aligning-LLMs-with-political-views","path":"src/inference.py","file_url":"https://github.com/dominiksinsaarland/aligning-LLMs-with-political-views/blob/HEAD/src/inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"531c6f8e484c5e74","mcp_get_code":{"code_sha256":"531c6f8e484c5e74"}},{"arxiv_id":"2403.17141","paper":"/paper/metaaligner-conditional-weak-to-strong","title":"MetaAligner: Towards Generalizable Multi-Objective Alignment of Language Models","date":"2024-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"stevekgyang/metaaligner","path":"inference/aligner_inference.py","file_url":"https://github.com/stevekgyang/metaaligner/blob/HEAD/inference/aligner_inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2ea85cccdeb325fb","mcp_get_code":{"code_sha256":"2ea85cccdeb325fb"}},{"arxiv_id":"2312.14183","paper":"/paper/on-early-detection-of-hallucinations-in","title":"On Early Detection of Hallucinations in Factual Question Answering","date":"2023-12-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amazon-science/llm-hallucinations-factual-qa","path":"result_collector.py","file_url":"https://github.com/amazon-science/llm-hallucinations-factual-qa/blob/HEAD/result_collector.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"03559f369dd0f078","mcp_get_code":{"code_sha256":"03559f369dd0f078"}},{"arxiv_id":"2310.07259","paper":"/paper/uncovering-hidden-connections-iterative","title":"Uncovering Hidden Connections: Iterative Search and Reasoning for Video-grounded Dialog","date":"2023-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Hyu-Zhang/ISR","path":"generate.py","file_url":"https://github.com/Hyu-Zhang/ISR/blob/HEAD/generate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b65d11d0d5341747","mcp_get_code":{"code_sha256":"b65d11d0d5341747"}},{"arxiv_id":"2309.13567","paper":"/paper/mentalllama-interpretable-mental-health","title":"MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models","date":"2023-09-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"stevekgyang/mentalllama","path":"src/IMHI.py","file_url":"https://github.com/stevekgyang/mentalllama/blob/HEAD/src/IMHI.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"54902262b09330a5","mcp_get_code":{"code_sha256":"54902262b09330a5"}},{"arxiv_id":"2305.11490","paper":"/paper/llm-itself-can-read-and-generate-cxr-images","title":"LLM-CXR: Instruction-Finetuned LLM for CXR Image Understanding and Generation","date":"2023-05-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hyn2028/llm-cxr","path":"training/generate.py","file_url":"https://github.com/hyn2028/llm-cxr/blob/HEAD/training/generate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4ccce24e2e7398f3","mcp_get_code":{"code_sha256":"4ccce24e2e7398f3"}},{"arxiv_id":"1901.08149","paper":"/paper/transfertransfo-a-transfer-learning-approach","title":"TransferTransfo: A Transfer Learning Approach for Neural Network Based Conversational Agents","date":"2019-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cerebroai/AskIt","path":"decoder.py","file_url":"https://github.com/cerebroai/AskIt/blob/HEAD/decoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cbad4369484f0733","mcp_get_code":{"code_sha256":"cbad4369484f0733"}},{"arxiv_id":"2025.emnlp-main.835","paper":null,"title":"arXiv:2025.emnlp-main.835","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Astarojth/DynamicNER","path":"CascadeNER/model/infer.py","file_url":"https://github.com/Astarojth/DynamicNER/blob/HEAD/CascadeNER/model/infer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d6ea07b35670a601","mcp_get_code":{"code_sha256":"d6ea07b35670a601"}},{"arxiv_id":"2023.emnlp-industry.17","paper":null,"title":"arXiv:2023.emnlp-industry.17","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"yale-nlp/LLM-T2T","path":"src/GPT_T2T_generation.py","file_url":"https://github.com/yale-nlp/LLM-T2T/blob/HEAD/src/GPT_T2T_generation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"32ed24c259e05547","mcp_get_code":{"code_sha256":"32ed24c259e05547"}}]}