{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/get-result","entry":"get_result","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":30,"n_papers_ran":18,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":31,"n_samples_ran":18,"n_samples_fingerprinted":3,"n_places":40,"n_places_pointer_only":11,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":1,"ran_fixture":0,"ran":17,"unverified":13},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2606.31270","paper":"/paper/arxiv-2606-31270","title":"Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"snow10072740/Learning_from_Failure","path":"run_autoglm.py","file_url":"https://github.com/snow10072740/Learning_from_Failure/blob/HEAD/run_autoglm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fa90c9947264141c","mcp_get_code":{"code_sha256":"fa90c9947264141c"}},{"arxiv_id":"2606.31270","paper":"/paper/arxiv-2606-31270","title":"Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"snow10072740/Learning_from_Failure","path":"run_autoglm_v.py","file_url":"https://github.com/snow10072740/Learning_from_Failure/blob/HEAD/run_autoglm_v.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"50f980bbd7348dea","mcp_get_code":{"code_sha256":"50f980bbd7348dea"}},{"arxiv_id":"2601.14716","paper":"/paper/arxiv-2601-14716","title":"PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"PCL-Reasoner/V1.5","path":"MindSpeed-LLM/evaluation.py","file_url":"https://github.com/PCL-Reasoner/V1.5/blob/HEAD/MindSpeed-LLM/evaluation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ebe7ee2f07cfd847","mcp_get_code":{"code_sha256":"ebe7ee2f07cfd847"}},{"arxiv_id":"2506.09659","paper":"/paper/intent-factored-generation-unleashing-the","title":"Intent Factored Generation: Unleashing the Diversity in Your Language Model","date":"2025-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"flairox/ifg","path":"hendrycks_math/experiment_pipelines/hparam_sweeper.py","file_url":"https://github.com/flairox/ifg/blob/HEAD/hendrycks_math/experiment_pipelines/hparam_sweeper.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"adc1130833a4f725","mcp_get_code":{"code_sha256":"adc1130833a4f725"}},{"arxiv_id":"2505.16421","paper":"/paper/webagent-r1-training-web-agents-via-end-to","title":"WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning","date":"2025-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weizhepei/webagent-r1","path":"WebAgent-R1/Eval/score.py","file_url":"https://github.com/weizhepei/webagent-r1/blob/HEAD/WebAgent-R1/Eval/score.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5372a3148cae304b","mcp_get_code":{"code_sha256":"5372a3148cae304b"}},{"arxiv_id":"2504.08165","paper":"/paper/findings-of-the-babylm-challenge-sample","title":"Findings of the BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora","date":"2025-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"babylm/evaluation-pipeline","path":"lm_eval/models/openai_completions.py","file_url":"https://github.com/babylm/evaluation-pipeline/blob/HEAD/lm_eval/models/openai_completions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"48fb64bd72378059","mcp_get_code":{"code_sha256":"48fb64bd72378059"}},{"arxiv_id":"2411.02391","paper":"/paper/attacking-vision-language-computer-agents-via","title":"Attacking Vision-Language Computer Agents via Pop-ups","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SALT-NLP/PopupAttack","path":"OSWorld/show_result.py","file_url":"https://github.com/SALT-NLP/PopupAttack/blob/HEAD/OSWorld/show_result.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6474985b86ed175b","mcp_get_code":{"code_sha256":"6474985b86ed175b"}},{"arxiv_id":"2410.05459","paper":"/paper/from-sparse-dependence-to-sparse-attention","title":"From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhqwqwq/Learning-Parity-with-CoT","path":"Figures/Fig1/fig1.1.py","file_url":"https://github.com/zhqwqwq/Learning-Parity-with-CoT/blob/HEAD/Figures/Fig1/fig1.1.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"74f79a1e9c94f8ce","mcp_get_code":{"code_sha256":"74f79a1e9c94f8ce"}},{"arxiv_id":"2410.05459","paper":"/paper/from-sparse-dependence-to-sparse-attention","title":"From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhqwqwq/Learning-Parity-with-CoT","path":"Figures/Fig1/fig1.2.py","file_url":"https://github.com/zhqwqwq/Learning-Parity-with-CoT/blob/HEAD/Figures/Fig1/fig1.2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f933eda64995a961","mcp_get_code":{"code_sha256":"f933eda64995a961"}},{"arxiv_id":"2410.05459","paper":"/paper/from-sparse-dependence-to-sparse-attention","title":"From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhqwqwq/Learning-Parity-with-CoT","path":"Figures/Fig10/fig10.py","file_url":"https://github.com/zhqwqwq/Learning-Parity-with-CoT/blob/HEAD/Figures/Fig10/fig10.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"51c4a892dac37e02","mcp_get_code":{"code_sha256":"51c4a892dac37e02"}},{"arxiv_id":"2410.05459","paper":"/paper/from-sparse-dependence-to-sparse-attention","title":"From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhqwqwq/Learning-Parity-with-CoT","path":"Figures/Fig3/fig3.1.py","file_url":"https://github.com/zhqwqwq/Learning-Parity-with-CoT/blob/HEAD/Figures/Fig3/fig3.1.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7a1c0e1ab0c7c812","mcp_get_code":{"code_sha256":"7a1c0e1ab0c7c812"}},{"arxiv_id":"2409.08264","paper":"/paper/windows-agent-arena-evaluating-multi-modal-os","title":"Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale","date":"2024-09-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/windowsagentarena","path":"src/win-arena-container/client/show_result.py","file_url":"https://github.com/microsoft/windowsagentarena/blob/HEAD/src/win-arena-container/client/show_result.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c84f9385b9ff870c","mcp_get_code":{"code_sha256":"c84f9385b9ff870c"}},{"arxiv_id":"2408.06327","paper":"/paper/visualagentbench-towards-large-multimodal","title":"VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents","date":"2024-08-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thudm/visualagentbench","path":"VAB-WebArena-Lite/new/score.py","file_url":"https://github.com/thudm/visualagentbench/blob/HEAD/VAB-WebArena-Lite/new/score.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5372a3148cae304b","mcp_get_code":{"code_sha256":"5372a3148cae304b"}},{"arxiv_id":"2406.13945","paper":"/paper/citybench-evaluating-the-capabilities-of","title":"CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsinghua-fib-lab/citybench","path":"citybench/geoqa/metrics.py","file_url":"https://github.com/tsinghua-fib-lab/citybench/blob/HEAD/citybench/geoqa/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7a47bc523075e6d4","mcp_get_code":{"code_sha256":"7a47bc523075e6d4"}},{"arxiv_id":"2406.10594","paper":"/paper/blockpruner-fine-grained-pruning-for-large","title":"BlockPruner: Fine-grained Pruning for Large Language Models","date":"2024-06-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MrGGLS/BlockPruner","path":"lm_eval/lm_eval/models/gguf.py","file_url":"https://github.com/MrGGLS/BlockPruner/blob/HEAD/lm_eval/lm_eval/models/gguf.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"53354f082d9addc6","mcp_get_code":{"code_sha256":"53354f082d9addc6"}},{"arxiv_id":"2406.10594","paper":"/paper/blockpruner-fine-grained-pruning-for-large","title":"BlockPruner: Fine-grained Pruning for Large Language Models","date":"2024-06-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MrGGLS/BlockPruner","path":"lm_eval/lm_eval/models/gpt3.py","file_url":"https://github.com/MrGGLS/BlockPruner/blob/HEAD/lm_eval/lm_eval/models/gpt3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d253589f2c78dad0","mcp_get_code":{"code_sha256":"d253589f2c78dad0"}},{"arxiv_id":"2405.07938","paper":"/paper/econlogicqa-a-question-answering-benchmark","title":"EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning","date":"2024-05-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yinzhu-quan/lm-evaluation-harness","path":"lm_eval/models/gguf.py","file_url":"https://github.com/yinzhu-quan/lm-evaluation-harness/blob/HEAD/lm_eval/models/gguf.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53354f082d9addc6","mcp_get_code":{"code_sha256":"53354f082d9addc6"}},{"arxiv_id":"2404.07972","paper":"/paper/osworld-benchmarking-multimodal-agents-for","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xlang-ai/OSWorld","path":"mm_agents/maestro/osworld_run_maestro.py","file_url":"https://github.com/xlang-ai/OSWorld/blob/HEAD/mm_agents/maestro/osworld_run_maestro.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"189a37dc14c3d30a","mcp_get_code":{"code_sha256":"189a37dc14c3d30a"}},{"arxiv_id":"2404.07972","paper":"/paper/osworld-benchmarking-multimodal-agents-for","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xlang-ai/OSWorld","path":"show_result.py","file_url":"https://github.com/xlang-ai/OSWorld/blob/HEAD/show_result.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0f5d30c04a47f46a","mcp_get_code":{"code_sha256":"0f5d30c04a47f46a"}},{"arxiv_id":"2403.06606","paper":"/paper/distributionally-generative-augmentation-for","title":"Distributionally Generative Augmentation for Fair Facial Attribute Classification","date":"2024-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"heqianpei/DiGA","path":"BYOL/train_LC.py","file_url":"https://github.com/heqianpei/DiGA/blob/HEAD/BYOL/train_LC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4d741352ba58146a","mcp_get_code":{"code_sha256":"4d741352ba58146a"}},{"arxiv_id":"2402.16775","paper":"/paper/a-comprehensive-evaluation-of-quantization","title":"A Comprehensive Evaluation of Quantization Strategies for Large Language Models","date":"2024-02-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cordercorder/quant_eval","path":"quant/SpQR/lm-evaluation-harness/lm_eval/models/gpt3.py","file_url":"https://github.com/cordercorder/quant_eval/blob/HEAD/quant/SpQR/lm-evaluation-harness/lm_eval/models/gpt3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d253589f2c78dad0","mcp_get_code":{"code_sha256":"d253589f2c78dad0"}},{"arxiv_id":"2312.15838","paper":"/paper/secqa-a-concise-question-answering-dataset","title":"SecQA: A Concise Question-Answering Dataset for Evaluating Large Language Models in Computer Security","date":"2023-12-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zefang-liu/lm-evaluation-harness","path":"lm_eval/models/gguf.py","file_url":"https://github.com/zefang-liu/lm-evaluation-harness/blob/HEAD/lm_eval/models/gguf.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53354f082d9addc6","mcp_get_code":{"code_sha256":"53354f082d9addc6"}},{"arxiv_id":"2312.15838","paper":"/paper/secqa-a-concise-question-answering-dataset","title":"SecQA: A Concise Question-Answering Dataset for Evaluating Large Language Models in Computer Security","date":"2023-12-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zefang-liu/lm-evaluation-harness","path":"lm_eval/models/openai_completions.py","file_url":"https://github.com/zefang-liu/lm-evaluation-harness/blob/HEAD/lm_eval/models/openai_completions.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8cdc4b3572832c60","mcp_get_code":{"code_sha256":"8cdc4b3572832c60"}},{"arxiv_id":"2311.09805","paper":"/paper/docmath-eval-evaluating-numerical-reasoning","title":"DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents","date":"2023-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yale-nlp/docmath-eval","path":"evaluation.py","file_url":"https://github.com/yale-nlp/docmath-eval/blob/HEAD/evaluation.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"87ea38e7e0bd8ee8","mcp_get_code":{"code_sha256":"87ea38e7e0bd8ee8"}},{"arxiv_id":"2311.09797","paper":"/paper/knowledgemath-knowledge-intensive-math-word","title":"FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains","date":"2023-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yale-nlp/knowledgemath","path":"cot_evaluation_with_calculator.py","file_url":"https://github.com/yale-nlp/knowledgemath/blob/HEAD/cot_evaluation_with_calculator.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f4f818c6f8c7f710","mcp_get_code":{"code_sha256":"f4f818c6f8c7f710"}},{"arxiv_id":"2311.09797","paper":"/paper/knowledgemath-knowledge-intensive-math-word","title":"FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains","date":"2023-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yale-nlp/knowledgemath","path":"evaluation.py","file_url":"https://github.com/yale-nlp/knowledgemath/blob/HEAD/evaluation.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e7a7c7026476f66b","mcp_get_code":{"code_sha256":"e7a7c7026476f66b"}},{"arxiv_id":"2307.16039","paper":"/paper/okapi-instruction-tuned-large-language-models","title":"Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback","date":"2023-07-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nlp-uoregon/mlmm-evaluation","path":"lm_eval/models/gpt3.py","file_url":"https://github.com/nlp-uoregon/mlmm-evaluation/blob/HEAD/lm_eval/models/gpt3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d253589f2c78dad0","mcp_get_code":{"code_sha256":"d253589f2c78dad0"}},{"arxiv_id":"2305.14493","paper":"/paper/prompt-position-really-matters-in-few-shot","title":"Do prompt positions really matter?","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"milliemaoo/prompt-position","path":"lm_eval/models/gpt3.py","file_url":"https://github.com/milliemaoo/prompt-position/blob/HEAD/lm_eval/models/gpt3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d253589f2c78dad0","mcp_get_code":{"code_sha256":"d253589f2c78dad0"}},{"arxiv_id":"2303.17003","paper":"/paper/evaluating-gpt-3-5-and-gpt-4-models-on","title":"Evaluating GPT-3.5 and GPT-4 Models on Brazilian University Admission Exams","date":"2023-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"piresramon/gpt-4-enem","path":"lm_eval/models/chatgpt.py","file_url":"https://github.com/piresramon/gpt-4-enem/blob/HEAD/lm_eval/models/chatgpt.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d253589f2c78dad0","mcp_get_code":{"code_sha256":"d253589f2c78dad0"}},{"arxiv_id":"2208.00061","paper":"/paper/uavm-a-unified-model-for-audio-visual","title":"UAVM: Towards Unifying Audio and Visual Models","date":"2022-07-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"YuanGongND/uavm","path":"src/attention_diff/plt_att_diff.py","file_url":"https://github.com/YuanGongND/uavm/blob/HEAD/src/attention_diff/plt_att_diff.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-2-Clause","inline_ok":true,"code_sha256_prefix":"9ff67c442329e8a7","mcp_get_code":{"code_sha256":"9ff67c442329e8a7"}},{"arxiv_id":"2207.00291","paper":"/paper/a-comparative-study-of-graph-matching","title":"A Comparative Study of Graph Matching Algorithms in Computer Vision","date":"2022-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vislearn/gmbench","path":"python/gmbench/analyzer/generate_table.py","file_url":"https://github.com/vislearn/gmbench/blob/HEAD/python/gmbench/analyzer/generate_table.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"698c78a80ac5ab35","mcp_get_code":{"code_sha256":"698c78a80ac5ab35"}},{"arxiv_id":"2110.04374","paper":"/paper/a-few-more-examples-may-be-worth-billions-of","title":"A Few More Examples May Be Worth Billions of Parameters","date":"2021-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuvalkirstain/lm-evaluation-harness","path":"lm_eval/models/gpt3.py","file_url":"https://github.com/yuvalkirstain/lm-evaluation-harness/blob/HEAD/lm_eval/models/gpt3.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"65ed12119df56f3b","mcp_get_code":{"code_sha256":"65ed12119df56f3b"}},{"arxiv_id":"2005.14165","paper":"/paper/language-models-are-few-shot-learners","title":"Language Models are Few-Shot Learners","date":"2020-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neuralmagic/lm-evaluation-harness","path":"lm_eval/models/gguf.py","file_url":"https://github.com/neuralmagic/lm-evaluation-harness/blob/HEAD/lm_eval/models/gguf.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53354f082d9addc6","mcp_get_code":{"code_sha256":"53354f082d9addc6"}},{"arxiv_id":"2005.14165","paper":"/paper/language-models-are-few-shot-learners","title":"Language Models are Few-Shot Learners","date":"2020-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"insait-institute/lm-evaluation-harness-bg","path":"lm_eval/models/openai_completions.py","file_url":"https://github.com/insait-institute/lm-evaluation-harness-bg/blob/HEAD/lm_eval/models/openai_completions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5decf8cec7692d54","mcp_get_code":{"code_sha256":"5decf8cec7692d54"}},{"arxiv_id":"2005.14165","paper":"/paper/language-models-are-few-shot-learners","title":"Language Models are Few-Shot Learners","date":"2020-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vilm-ai/viet-llm-eval","path":"lm_eval/models/openai_completions.py","file_url":"https://github.com/vilm-ai/viet-llm-eval/blob/HEAD/lm_eval/models/openai_completions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"89b22f3da55a855c","mcp_get_code":{"code_sha256":"89b22f3da55a855c"}},{"arxiv_id":"2005.10881","paper":"/paper/revisiting-membership-inference-under","title":"Revisiting Membership Inference Under Realistic Assumptions","date":"2020-05-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bargavj/EvaluatingDPML","path":"improved_ai/interpret_results.py","file_url":"https://github.com/bargavj/EvaluatingDPML/blob/HEAD/improved_ai/interpret_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"13622d0e53332de3","mcp_get_code":{"code_sha256":"13622d0e53332de3"}},{"arxiv_id":"1508.01211","paper":"/paper/listen-attend-and-spell","title":"Listen, Attend and Spell","date":"2015-08-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"msalhab96/Listen-Attend-and-Spell","path":"inference.py","file_url":"https://github.com/msalhab96/Listen-Attend-and-Spell/blob/HEAD/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8dea3694156cfb07","mcp_get_code":{"code_sha256":"8dea3694156cfb07"}},{"arxiv_id":"1411.4038","paper":"/paper/fully-convolutional-networks-for-semantic-1","title":"Fully Convolutional Networks for Semantic Segmentation","date":"2014-11-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"YigeunLee/fcn32","path":"fully_cnn.py","file_url":"https://github.com/YigeunLee/fcn32/blob/HEAD/fully_cnn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"73d1eec357fb97af","mcp_get_code":{"code_sha256":"73d1eec357fb97af"}},{"arxiv_id":"2025.findings-emnlp.638","paper":null,"title":"arXiv:2025.findings-emnlp.638","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"liyaooi/LongTableBench","path":"pred.py","file_url":"https://github.com/liyaooi/LongTableBench/blob/HEAD/pred.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6cba06e249f97f39","mcp_get_code":{"code_sha256":"6cba06e249f97f39"}},{"arxiv_id":"2025.findings-acl.744","paper":null,"title":"arXiv:2025.findings-acl.744","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"szu-tera/RankedVotingSC","path":"lm-evaluation-harness/lm_eval/models/gguf.py","file_url":"https://github.com/szu-tera/RankedVotingSC/blob/HEAD/lm-evaluation-harness/lm_eval/models/gguf.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53354f082d9addc6","mcp_get_code":{"code_sha256":"53354f082d9addc6"}}]}