{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/load-results","entry":"load_results","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":82,"n_papers_ran":31,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":82,"n_samples_ran":28,"n_samples_fingerprinted":4,"n_places":92,"n_places_pointer_only":34,"by_status":{"ran_honours":1,"ran_violates":0,"ran_draft_wrong":6,"ran_fixture":0,"ran":21,"unverified":54},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.00621","paper":"/paper/arxiv-2609-00621","title":"Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"yuntian-group/cdsep","path":"experiments/plot_results.py","file_url":"https://github.com/yuntian-group/cdsep/blob/HEAD/experiments/plot_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5f8da1895084e69b","mcp_get_code":{"code_sha256":"5f8da1895084e69b"}},{"arxiv_id":"2608.25709","paper":"/paper/arxiv-2608-25709","title":"Multi-output Gaussian process prediction of physical fields under linear equality constraints","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"nasrmht/paper_benchmark_repo","path":"constraint_benchmark/plot_ranking_percentages.py","file_url":"https://github.com/nasrmht/paper_benchmark_repo/blob/HEAD/constraint_benchmark/plot_ranking_percentages.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7922f99dc136c87","mcp_get_code":{"code_sha256":"d7922f99dc136c87"}},{"arxiv_id":"2608.17096","paper":"/paper/arxiv-2608-17096","title":"A Glyph Is Not a Letter, a Token Is Not a Word, a Space Is Not a Space: What the Units of Voynichese Are Not","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"lrozanova/voynich-units","path":"analysis/reproduce_cipher_calibration.py","file_url":"https://github.com/lrozanova/voynich-units/blob/HEAD/analysis/reproduce_cipher_calibration.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"16f65573a1092dd7","mcp_get_code":{"code_sha256":"16f65573a1092dd7"}},{"arxiv_id":"2608.12489","paper":"/paper/arxiv-2608-12489","title":"When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner's Guide","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"binshuangli/allocation-ope-bench","path":"src/allocation_ope_bench/analysis/aggregate.py","file_url":"https://github.com/binshuangli/allocation-ope-bench/blob/HEAD/src/allocation_ope_bench/analysis/aggregate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f9641ec6cc54b3ce","mcp_get_code":{"code_sha256":"f9641ec6cc54b3ce"}},{"arxiv_id":"2608.06305","paper":"/paper/arxiv-2608-06305","title":"Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"twospoon/READ","path":"read_eval/metrics.py","file_url":"https://github.com/twospoon/READ/blob/HEAD/read_eval/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6d4808b78e1515fc","mcp_get_code":{"code_sha256":"6d4808b78e1515fc"}},{"arxiv_id":"2607.13591","paper":"/paper/arxiv-2607-13591","title":"Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"ericjiang18/MemCon","path":"agent_baseline/summarize_results.py","file_url":"https://github.com/ericjiang18/MemCon/blob/HEAD/agent_baseline/summarize_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"53e1ee4507b2f389","mcp_get_code":{"code_sha256":"53e1ee4507b2f389"}},{"arxiv_id":"2607.05252","paper":"/paper/arxiv-2607-05252","title":"FUSE: FK-Steered Multi-Modal Flow Matching for Efficient Simulation-Based Posterior Estimation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"qinwch/FUSE","path":"diffusions-for-sbi/jrnnm_lc2st.py","file_url":"https://github.com/qinwch/FUSE/blob/HEAD/diffusions-for-sbi/jrnnm_lc2st.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"55592e953c245d91","mcp_get_code":{"code_sha256":"55592e953c245d91"}},{"arxiv_id":"2607.05252","paper":"/paper/arxiv-2607-05252","title":"FUSE: FK-Steered Multi-Modal Flow Matching for Efficient Simulation-Based Posterior Estimation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"qinwch/FUSE","path":"diffusions-for-sbi/jrnnm_results.py","file_url":"https://github.com/qinwch/FUSE/blob/HEAD/diffusions-for-sbi/jrnnm_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7f08c0463d609faa","mcp_get_code":{"code_sha256":"7f08c0463d609faa"}},{"arxiv_id":"2607.01838","paper":"/paper/arxiv-2607-01838","title":"Adaptive Group-Based Counterfactual Explanations for Time-Series Rehabilitation Data","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"Healthpy/knee-rehab-cfe","path":"src/models/analyze_ablation_results.py","file_url":"https://github.com/Healthpy/knee-rehab-cfe/blob/HEAD/src/models/analyze_ablation_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5016c2d83b28893d","mcp_get_code":{"code_sha256":"5016c2d83b28893d"}},{"arxiv_id":"2606.31394","paper":"/paper/arxiv-2606-31394","title":"Resolving superposition in AI for interpretability and cross-modal alignment in patient-neuronal images","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"jijihihi/Bio_superposition","path":"cell_death/plot_knn_std_trend.py","file_url":"https://github.com/jijihihi/Bio_superposition/blob/HEAD/cell_death/plot_knn_std_trend.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a85aef7f7b9908db","mcp_get_code":{"code_sha256":"a85aef7f7b9908db"}},{"arxiv_id":"2606.27783","paper":"/paper/arxiv-2606-27783","title":"CANNs: A Toolkit for Research on Continuous Attractor Neural Networks","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Routhleck/canns-lib","path":"benchmarks/ripser/analysis_results.py","file_url":"https://github.com/Routhleck/canns-lib/blob/HEAD/benchmarks/ripser/analysis_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"75a623042d612374","mcp_get_code":{"code_sha256":"75a623042d612374"}},{"arxiv_id":"2606.07856","paper":"/paper/arxiv-2606-07856","title":"Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@K Crossover on a Free-Verifier Domain","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"izzortsi/trapdoor-loom","path":"baseline_by_class.py","file_url":"https://github.com/izzortsi/trapdoor-loom/blob/HEAD/baseline_by_class.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8b9078cf626ef76f","mcp_get_code":{"code_sha256":"8b9078cf626ef76f"}},{"arxiv_id":"2606.06036","paper":"/paper/arxiv-2606-06036","title":"Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Ji-shuo/MRAgent","path":"eval/evaluate_reasoning.py","file_url":"https://github.com/Ji-shuo/MRAgent/blob/HEAD/eval/evaluate_reasoning.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ccb59451087e9429","mcp_get_code":{"code_sha256":"ccb59451087e9429"}},{"arxiv_id":"2606.05981","paper":"/paper/arxiv-2606-05981","title":"Inverting the Streaming-Diffusion Bottleneck: Video-Rate MLLM-Conditioned Edit Diffusion on a Consumer GPU","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"otanl/dreamlite-stream","path":"src/dreamlite_stream/paper_table.py","file_url":"https://github.com/otanl/dreamlite-stream/blob/HEAD/src/dreamlite_stream/paper_table.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6ac440ade25a76fa","mcp_get_code":{"code_sha256":"6ac440ade25a76fa"}},{"arxiv_id":"2605.30003","paper":"/paper/arxiv-2605-30003","title":"Discovering Cooperative Pipelines: Autoresearch for Sequential Social Dilemmas","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"vicgalle/autoresearch-social-dilemmas","path":"autoresearch/analyze.py","file_url":"https://github.com/vicgalle/autoresearch-social-dilemmas/blob/HEAD/autoresearch/analyze.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c837be730c58a806","mcp_get_code":{"code_sha256":"c837be730c58a806"}},{"arxiv_id":"2605.23473","paper":"/paper/arxiv-2605-23473","title":"Automated Random Embedding for Practical Bayesian Optimization with Unknown Effective Dimension","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"lamda-bbo/MCTS-VS","path":"plot.py","file_url":"https://github.com/lamda-bbo/MCTS-VS/blob/HEAD/plot.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ca6aa5dcedefe3d6","mcp_get_code":{"code_sha256":"ca6aa5dcedefe3d6"}},{"arxiv_id":"2605.18591","paper":"/paper/arxiv-2605-18591","title":"Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"agent-lab/ICML2026-RAT","path":"utils/monitor.py","file_url":"https://github.com/agent-lab/ICML2026-RAT/blob/HEAD/utils/monitor.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c4981304881dcff","mcp_get_code":{"code_sha256":"3c4981304881dcff"}},{"arxiv_id":"2605.11983","paper":"/paper/arxiv-2605-11983","title":"QDSB: Quantized Diffusion Schrödinger Bridges","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"mathefuchs/qdsb","path":"results/plot_qdsb_anchor_sensitivity.py","file_url":"https://github.com/mathefuchs/qdsb/blob/HEAD/results/plot_qdsb_anchor_sensitivity.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"06e28a7d6e59a102","mcp_get_code":{"code_sha256":"06e28a7d6e59a102"}},{"arxiv_id":"2605.05623","paper":"/paper/arxiv-2605-05623","title":"Retrieval of Coastal Biogeochemical Parameters From Near-Surface Hyperspectral Remote Sensing Reflectance Using Physics-Aware Meta-Learning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"yiqing-csiro/wq-meta","path":"table_scripts/generate_ablation_results.py","file_url":"https://github.com/yiqing-csiro/wq-meta/blob/HEAD/table_scripts/generate_ablation_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"a763fdb7c995ddfa","mcp_get_code":{"code_sha256":"a763fdb7c995ddfa"}},{"arxiv_id":"2605.03618","paper":"/paper/arxiv-2605-03618","title":"BIT.UA-AAUBS at ArchEHR-QA 2026: Evaluating Open-Source and Proprietary LLMs via Prompting in Low-Resource QA","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"bioinformatics-ua/ArchEHR-QA-2026","path":"Subtask2/evaluation/aggregate_results.py","file_url":"https://github.com/bioinformatics-ua/ArchEHR-QA-2026/blob/HEAD/Subtask2/evaluation/aggregate_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6b5cdf342bbb10a0","mcp_get_code":{"code_sha256":"6b5cdf342bbb10a0"}},{"arxiv_id":"2604.25898","paper":"/paper/arxiv-2604-25898","title":"TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"anonymized-for-submission123/tsn-affinity","path":"analyze_runs.py","file_url":"https://github.com/anonymized-for-submission123/tsn-affinity/blob/HEAD/analyze_runs.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c8f60efab3e8b421","mcp_get_code":{"code_sha256":"c8f60efab3e8b421"}},{"arxiv_id":"2604.06613","paper":"/paper/arxiv-2604-06613","title":"The Detection-Extraction Gap: Models Know the Answer Before They Can Say It","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"EdWangLoDaSc/know2say","path":"src/analysis.py","file_url":"https://github.com/EdWangLoDaSc/know2say/blob/HEAD/src/analysis.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99089c0600bcb0a","mcp_get_code":{"code_sha256":"b99089c0600bcb0a"}},{"arxiv_id":"2604.01279","paper":"/paper/arxiv-2604-01279","title":"Sven: Singular Value Descent as a Computationally Efficient Natural Gradient Method","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"sambt/sven-experiments","path":"analysis/style.py","file_url":"https://github.com/sambt/sven-experiments/blob/HEAD/analysis/style.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2bd4ddaa97045954","mcp_get_code":{"code_sha256":"2bd4ddaa97045954"}},{"arxiv_id":"2604.00344","paper":"/paper/arxiv-2604-00344","title":"Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"ericjiang18/Agent-Q-Mix","path":"agent_baseline/summarize_results.py","file_url":"https://github.com/ericjiang18/Agent-Q-Mix/blob/HEAD/agent_baseline/summarize_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"53e1ee4507b2f389","mcp_get_code":{"code_sha256":"53e1ee4507b2f389"}},{"arxiv_id":"2603.21970","paper":"/paper/arxiv-2603-21970","title":"Parameter-Efficient Fine-Tuning for Medical Text Summarization: A Comparative Study of Lora, Prompt Tuning, and Full Fine-Tuning","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"eracoding/llm-medical-summarization","path":"src/evaluation/analysis.py","file_url":"https://github.com/eracoding/llm-medical-summarization/blob/HEAD/src/evaluation/analysis.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"df85bcba33f45f01","mcp_get_code":{"code_sha256":"df85bcba33f45f01"}},{"arxiv_id":"2602.02258","paper":"/paper/arxiv-2602-02258","title":"Alignment-Aware Model Adaptation via Feedback-Guided Optimization","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"facebookresearch/TruthRL","path":"data_utils/find_OOK_questions.py","file_url":"https://github.com/facebookresearch/TruthRL/blob/HEAD/data_utils/find_OOK_questions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"0a937568fc0b343b","mcp_get_code":{"code_sha256":"0a937568fc0b343b"}},{"arxiv_id":"2601.06289","paper":"/paper/arxiv-2601-06289","title":"How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning?","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"airscker/ms-cot-benchmark","path":"analyze_cot.py","file_url":"https://github.com/airscker/ms-cot-benchmark/blob/HEAD/analyze_cot.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"52322961a364c485","mcp_get_code":{"code_sha256":"52322961a364c485"}},{"arxiv_id":"2601.06289","paper":"/paper/arxiv-2601-06289","title":"How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning?","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"airscker/ms-cot-benchmark","path":"plot_results.py","file_url":"https://github.com/airscker/ms-cot-benchmark/blob/HEAD/plot_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"70af9a90f94c1cab","mcp_get_code":{"code_sha256":"70af9a90f94c1cab"}},{"arxiv_id":"2601.05851","paper":"/paper/arxiv-2601-05851","title":"Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"devichand579/MAC","path":"analyze_neural_classifier_results.py","file_url":"https://github.com/devichand579/MAC/blob/HEAD/analyze_neural_classifier_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fc505adbbada736d","mcp_get_code":{"code_sha256":"fc505adbbada736d"}},{"arxiv_id":"2601.05851","paper":"/paper/arxiv-2601-05851","title":"Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"devichand579/MAC","path":"analyze_rf_results.py","file_url":"https://github.com/devichand579/MAC/blob/HEAD/analyze_rf_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"524a94fe41433b05","mcp_get_code":{"code_sha256":"524a94fe41433b05"}},{"arxiv_id":"2601.03973","paper":"/paper/arxiv-2601-03973","title":"Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"yuhui1038/Muse","path":"eval_pipeline/summarize.py","file_url":"https://github.com/yuhui1038/Muse/blob/HEAD/eval_pipeline/summarize.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0c3e6c5a2d211c92","mcp_get_code":{"code_sha256":"0c3e6c5a2d211c92"}},{"arxiv_id":"2511.20273","paper":"/paper/arxiv-2511-20273","title":"Beyond Components: Singular Vector-Based Interpretability of Transformer Circuits","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"Exploration-Lab/Beyond-Components","path":"experiments/evaluation/generate_sigma_table.py","file_url":"https://github.com/Exploration-Lab/Beyond-Components/blob/HEAD/experiments/evaluation/generate_sigma_table.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"a9e2edbf734d8c1a","mcp_get_code":{"code_sha256":"a9e2edbf734d8c1a"}},{"arxiv_id":"2511.18891","paper":"/paper/arxiv-2511-18891","title":"Reproducibility Study of: Large Language Model Bayesian Optimization","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"spagnoloG/llambo-reproducibility","path":"LLAMBO/plot_figure3_surrogate.py","file_url":"https://github.com/spagnoloG/llambo-reproducibility/blob/HEAD/LLAMBO/plot_figure3_surrogate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5dd509e1de869639","mcp_get_code":{"code_sha256":"5dd509e1de869639"}},{"arxiv_id":"2511.17529","paper":"/paper/arxiv-2511-17529","title":"Time-Series Foundation Models for ISP Traffic Forecasting","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"FanL1u/TSFM-for-ISP-traffic-forecasting","path":"evaluation/visual.py","file_url":"https://github.com/FanL1u/TSFM-for-ISP-traffic-forecasting/blob/HEAD/evaluation/visual.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"072a69aed918e665","mcp_get_code":{"code_sha256":"072a69aed918e665"}},{"arxiv_id":"2509.24496","paper":"/paper/arxiv-2509-24496","title":"LLM DNA: Tracing Model Evolution via Functional Representations","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"Xtra-Computing/LLM-DNA","path":"src/llm_dna/utils/DataUtils.py","file_url":"https://github.com/Xtra-Computing/LLM-DNA/blob/HEAD/src/llm_dna/utils/DataUtils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f67940d46925b905","mcp_get_code":{"code_sha256":"f67940d46925b905"}},{"arxiv_id":"2506.21894","paper":null,"title":"arXiv:2506.21894","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"csiro-funml/nots","path":"plot_trials.py","file_url":"https://github.com/csiro-funml/nots/blob/HEAD/plot_trials.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ae6ed81f3bb025cf","mcp_get_code":{"code_sha256":"ae6ed81f3bb025cf"}},{"arxiv_id":"2506.14035","paper":"/paper/simpledoc-multi-modal-document-understanding","title":"SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement","date":"2025-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ag2ai/SimpleDoc","path":"evaluation/evaluate_responses.py","file_url":"https://github.com/ag2ai/SimpleDoc/blob/HEAD/evaluation/evaluate_responses.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d96da92d8a935925","mcp_get_code":{"code_sha256":"d96da92d8a935925"}},{"arxiv_id":"2505.22954","paper":"/paper/darwin-godel-machine-open-ended-evolution-of","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","date":"2025-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jennyzzt/dgm","path":"polyglot/benchmark.py","file_url":"https://github.com/jennyzzt/dgm/blob/HEAD/polyglot/benchmark.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ec8bd9532ec0ac1a","mcp_get_code":{"code_sha256":"ec8bd9532ec0ac1a"}},{"arxiv_id":"2505.15367","paper":"/paper/better-safe-than-sorry-overreaction-problem","title":"Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition","date":"2025-05-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Dasol-Choi/VERI-Emergency","path":"src/comprehensive_analysis.py","file_url":"https://github.com/Dasol-Choi/VERI-Emergency/blob/HEAD/src/comprehensive_analysis.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a5e33150bd3e4125","mcp_get_code":{"code_sha256":"a5e33150bd3e4125"}},{"arxiv_id":"2502.19717","paper":"/paper/exponential-topology-enabled-scalable","title":"Exponential Topology-enabled Scalable Communication in Multi-agent Reinforcement Learning","date":"2025-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e8a91a919b93f3e1","mcp_get_code":{"code_sha256":"e8a91a919b93f3e1"}},{"arxiv_id":"2502.19717","paper":"/paper/exponential-topology-enabled-scalable","title":"Exponential Topology-enabled Scalable Communication in Multi-agent Reinforcement Learning","date":"2025-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uoe-agents/epymarl","path":"plot_results.py","file_url":"https://github.com/uoe-agents/epymarl/blob/HEAD/plot_results.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"73de3ace29add240","mcp_get_code":{"code_sha256":"73de3ace29add240"}},{"arxiv_id":"2410.08540","paper":"/paper/kaleidoscope-learnable-masks-for","title":"Kaleidoscope: Learnable Masks for Heterogeneous Multi-agent Reinforcement Learning","date":"2024-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uoe-agents/epymarl","path":"plot_results.py","file_url":"https://github.com/uoe-agents/epymarl/blob/HEAD/plot_results.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e8a91a919b93f3e1","mcp_get_code":{"code_sha256":"e8a91a919b93f3e1"}},{"arxiv_id":"2410.03997","paper":null,"title":"arXiv:2410.03997","date":null,"month_inferred_from_arxiv_id":"2024-10","title_source":null,"repo":"paulzyzy/YOLO-MARL","path":"YOLO-MARL/plot_results.py","file_url":"https://github.com/paulzyzy/YOLO-MARL/blob/HEAD/YOLO-MARL/plot_results.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"73de3ace29add240","mcp_get_code":{"code_sha256":"73de3ace29add240"}},{"arxiv_id":"2410.00812","paper":"/paper/a-generative-framework-to-bridge-data-driven","title":"Generative causal testing to bridge data-driven models and scientific theories in language neuroscience","date":"2024-10-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/automated-explanations","path":"neuro/analyze_helper.py","file_url":"https://github.com/microsoft/automated-explanations/blob/HEAD/neuro/analyze_helper.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"989dd5f550055630","mcp_get_code":{"code_sha256":"989dd5f550055630"}},{"arxiv_id":"2410.02810","paper":"/paper/stateact-state-tracking-and-reasoning-for","title":"StateAct: State Tracking and Reasoning for Acting and Planning with Large Language Models","date":"2024-09-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai-nikolai/stateact","path":"alfworld_runs/get_score.py","file_url":"https://github.com/ai-nikolai/stateact/blob/HEAD/alfworld_runs/get_score.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c67ce7ef9daabda8","mcp_get_code":{"code_sha256":"c67ce7ef9daabda8"}},{"arxiv_id":"2407.13957","paper":"/paper/the-group-robustness-is-in-the-details","title":"The Group Robustness is in the Details: Revisiting Finetuning under Spurious Correlations","date":"2024-07-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tmlabonte/revisiting-finetuning","path":"exps/finetune.py","file_url":"https://github.com/tmlabonte/revisiting-finetuning/blob/HEAD/exps/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"123af60f657bbf4a","mcp_get_code":{"code_sha256":"123af60f657bbf4a"}},{"arxiv_id":"2407.00900","paper":"/paper/mathcamps-fine-grained-synthesis-of","title":"MathCAMPS: Fine-grained Synthesis of Mathematical Problems From Human Curricula","date":"2024-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gpoesia/mathcamps","path":"analysis.py","file_url":"https://github.com/gpoesia/mathcamps/blob/HEAD/analysis.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"16fc98c8d3cd91a3","mcp_get_code":{"code_sha256":"16fc98c8d3cd91a3"}},{"arxiv_id":"2406.20015","paper":"/paper/toolbehonest-a-multi-level-hallucination","title":"ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"toolbehonest/toolbehonest","path":"utils/load_save.py","file_url":"https://github.com/toolbehonest/toolbehonest/blob/HEAD/utils/load_save.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4cfcb6ed2385c374","mcp_get_code":{"code_sha256":"4cfcb6ed2385c374"}},{"arxiv_id":"2404.07593","paper":"/paper/diffusion-posterior-sampling-for-simulation","title":"Diffusion posterior sampling for simulation-based inference in tall data settings","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"julialinhart/diffusions-for-sbi","path":"jrnnm_lc2st.py","file_url":"https://github.com/julialinhart/diffusions-for-sbi/blob/HEAD/jrnnm_lc2st.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"55592e953c245d91","mcp_get_code":{"code_sha256":"55592e953c245d91"}},{"arxiv_id":"2404.07593","paper":"/paper/diffusion-posterior-sampling-for-simulation","title":"Diffusion posterior sampling for simulation-based inference in tall data settings","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"julialinhart/diffusions-for-sbi","path":"jrnnm_results.py","file_url":"https://github.com/julialinhart/diffusions-for-sbi/blob/HEAD/jrnnm_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7f08c0463d609faa","mcp_get_code":{"code_sha256":"7f08c0463d609faa"}},{"arxiv_id":"2403.02839","paper":"/paper/an-empirical-study-of-llm-as-a-judge-for-llm","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","date":"2024-03-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"huihuichyan/unlimitedjudge","path":"src/cascaded_eval.py","file_url":"https://github.com/huihuichyan/unlimitedjudge/blob/HEAD/src/cascaded_eval.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c7c6421e96f43d9d","mcp_get_code":{"code_sha256":"c7c6421e96f43d9d"}},{"arxiv_id":"2401.14351","paper":"/paper/serverlessllm-locality-enhanced-serverless","title":"ServerlessLLM: Low-Latency Serverless Inference for Large Language Models","date":"2024-01-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"serverlessllm/serverlessllm","path":"benchmarks/generate_report.py","file_url":"https://github.com/serverlessllm/serverlessllm/blob/HEAD/benchmarks/generate_report.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7003961583dddb9d","mcp_get_code":{"code_sha256":"7003961583dddb9d"}},{"arxiv_id":"2401.14351","paper":"/paper/serverlessllm-locality-enhanced-serverless","title":"ServerlessLLM: Low-Latency Serverless Inference for Large Language Models","date":"2024-01-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"serverlessllm/serverlessllm","path":"benchmarks/plot.py","file_url":"https://github.com/serverlessllm/serverlessllm/blob/HEAD/benchmarks/plot.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1397ecf27bc272fd","mcp_get_code":{"code_sha256":"1397ecf27bc272fd"}},{"arxiv_id":"2312.16702","paper":"/paper/rethinking-tabular-data-understanding-with","title":"Rethinking Tabular Data Understanding with Large Language Models","date":"2023-12-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Leolty/tablellm","path":"evaluate.py","file_url":"https://github.com/Leolty/tablellm/blob/HEAD/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c0044887a847001b","mcp_get_code":{"code_sha256":"c0044887a847001b"}},{"arxiv_id":"2310.12611","paper":"/paper/identifying-and-adapting-transformer","title":"Identifying and Adapting Transformer-Components Responsible for Gender Bias in an English Language Model","date":"2023-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iabhijith/bias-causal-analysis","path":"evaluate.py","file_url":"https://github.com/iabhijith/bias-causal-analysis/blob/HEAD/evaluate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a1d2a452faefeadb","mcp_get_code":{"code_sha256":"a1d2a452faefeadb"}},{"arxiv_id":"2309.07556","paper":"/paper/sample-efficient-estimation-of-entanglement","title":"Sample-efficient estimation of entanglement entropy through supervised learning","date":null,"month_inferred_from_arxiv_id":"2023-09","title_source":"archive","repo":"maximilianrie/entropyestimation","path":"lib/load_data.py","file_url":"https://github.com/maximilianrie/entropyestimation/blob/HEAD/lib/load_data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2298b9431630ed29","mcp_get_code":{"code_sha256":"2298b9431630ed29"}},{"arxiv_id":"2308.00113","paper":"/paper/three-bricks-to-consolidate-watermarks-for","title":"Three Bricks to Consolidate Watermarks for Large Language Models","date":"2023-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/three_bricks","path":"main_watermark.py","file_url":"https://github.com/facebookresearch/three_bricks/blob/HEAD/main_watermark.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"1ab299a3c4b402f6","mcp_get_code":{"code_sha256":"1ab299a3c4b402f6"}},{"arxiv_id":"2308.00113","paper":"/paper/three-bricks-to-consolidate-watermarks-for","title":"Three Bricks to Consolidate Watermarks for Large Language Models","date":"2023-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/three_bricks","path":"main_eval.py","file_url":"https://github.com/facebookresearch/three_bricks/blob/HEAD/main_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"00e11ed69501d334","mcp_get_code":{"code_sha256":"00e11ed69501d334"}},{"arxiv_id":"2306.15142","paper":"/paper/efficient-and-accurate-scene-text-detection","title":"LRANet: Towards Accurate and Efficient Scene Text Detection with Low-Rank Approximation Network","date":"2023-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ernestchenchen/sg-lra","path":"Engine_data/chen_lra_to_COCO_eval.py","file_url":"https://github.com/ernestchenchen/sg-lra/blob/HEAD/Engine_data/chen_lra_to_COCO_eval.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"231897c9154a0118","mcp_get_code":{"code_sha256":"231897c9154a0118"}},{"arxiv_id":"2304.11015","paper":"/paper/din-sql-decomposed-in-context-learning-of-1","title":"DIN-SQL: Decomposed In-Context Learning of Text-to-SQL with Self-Correction","date":"2023-04-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mohammadrezapourreza/few-shot-nl2sql-with-prompting","path":"AnalysisResults.py","file_url":"https://github.com/mohammadrezapourreza/few-shot-nl2sql-with-prompting/blob/HEAD/AnalysisResults.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"954e98b3d0e164c5","mcp_get_code":{"code_sha256":"954e98b3d0e164c5"}},{"arxiv_id":"2301.03962","paper":"/paper/a-unified-theory-of-diversity-in-ensemble","title":"A Unified Theory of Diversity in Ensemble Learning","date":"2023-01-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"echostatements/decompose","path":"decompose/experiments.py","file_url":"https://github.com/echostatements/decompose/blob/HEAD/decompose/experiments.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d24ba2ef9595c141","mcp_get_code":{"code_sha256":"d24ba2ef9595c141"}},{"arxiv_id":"2208.10291","paper":"/paper/efficient-planning-in-a-compact-latent-action","title":"Efficient Planning in a Compact Latent Action Space","date":"2022-08-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZhengyaoJiang/latentplan","path":"plotting/read_results.py","file_url":"https://github.com/ZhengyaoJiang/latentplan/blob/HEAD/plotting/read_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"196733754060029a","mcp_get_code":{"code_sha256":"196733754060029a"}},{"arxiv_id":"2207.12824","paper":"/paper/compositional-human-scene-interaction","title":"Compositional Human-Scene Interaction Synthesis with Semantic Control","date":"2022-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zkf1997/COINS","path":"evaluation/load_results.py","file_url":"https://github.com/zkf1997/COINS/blob/HEAD/evaluation/load_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1c8bf84ad350dd01","mcp_get_code":{"code_sha256":"1c8bf84ad350dd01"}},{"arxiv_id":"2206.00176","paper":"/paper/learning-sparse-nonlinear-dynamics-via-mixed","title":"Learning Sparse Nonlinear Dynamics via Mixed-Integer Optimization","date":"2022-06-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wesg52/sindy_mio_paper","path":"make_plots.py","file_url":"https://github.com/wesg52/sindy_mio_paper/blob/HEAD/make_plots.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6a8dbf51cd13118b","mcp_get_code":{"code_sha256":"6a8dbf51cd13118b"}},{"arxiv_id":"2202.03299","paper":"/paper/training-ood-detectors-in-their-natural","title":"Training OOD Detectors in their Natural Habitats","date":"2022-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jkatzsam/woods_ood","path":"CIFAR/plot_results.py","file_url":"https://github.com/jkatzsam/woods_ood/blob/HEAD/CIFAR/plot_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b2dd765101838953","mcp_get_code":{"code_sha256":"b2dd765101838953"}},{"arxiv_id":"2112.02889","paper":"/paper/joint-learning-of-localized-representations","title":"Joint Learning of Localized Representations from Medical Images and Reports","date":"2021-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"philip-mueller/lovt","path":"src/analysis/data_exporter.py","file_url":"https://github.com/philip-mueller/lovt/blob/HEAD/src/analysis/data_exporter.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d693847dd3d12d01","mcp_get_code":{"code_sha256":"d693847dd3d12d01"}},{"arxiv_id":"2111.03941","paper":"/paper/time-discretization-invariant-safe-action","title":"Time Discretization-Invariant Safe Action Repetition for Policy Gradient Methods","date":"2021-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"artberryx/SAR","path":"sb/stable_baselines/bench/monitor.py","file_url":"https://github.com/artberryx/SAR/blob/HEAD/sb/stable_baselines/bench/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dbe46349368917f5","mcp_get_code":{"code_sha256":"dbe46349368917f5"}},{"arxiv_id":"2109.15310","paper":"/paper/width-based-planning-and-active-learning-for","title":"Is Policy Learning Overrated?: Width-Based Planning and Active Learning for Atari","date":"2021-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ibm/atari-active-learning","path":"aggregate_pandas.py","file_url":"https://github.com/ibm/atari-active-learning/blob/HEAD/aggregate_pandas.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cb7a648af304657f","mcp_get_code":{"code_sha256":"cb7a648af304657f"}},{"arxiv_id":"2011.08105","paper":"/paper/enforcing-robust-control-guarantees-within-1","title":"Enforcing robust control guarantees within neural network policies","date":"2020-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"locuslab/robust-nn-control","path":"plots.py","file_url":"https://github.com/locuslab/robust-nn-control/blob/HEAD/plots.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"23fb74979be5ffea","mcp_get_code":{"code_sha256":"23fb74979be5ffea"}},{"arxiv_id":"2010.09170","paper":"/paper/belief-grounded-networks-for-acceleratedrobot","title":"Belief-Grounded Networks for Accelerated Robot Learning under Partial Observability","date":"2020-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hai-h-nguyen/belief-grounded-network","path":"modifications/monitor.py","file_url":"https://github.com/hai-h-nguyen/belief-grounded-network/blob/HEAD/modifications/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ab9306edd1184fa8","mcp_get_code":{"code_sha256":"ab9306edd1184fa8"}},{"arxiv_id":"2006.10728","paper":"/paper/diverse-image-generation-via-self-conditioned-1","title":"Diverse Image Generation via Self-Conditioned GANs","date":"2020-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"stevliu/self-conditioned-gan","path":"metrics.py","file_url":"https://github.com/stevliu/self-conditioned-gan/blob/HEAD/metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c7976bd4f8c4e9f6","mcp_get_code":{"code_sha256":"c7976bd4f8c4e9f6"}},{"arxiv_id":"2006.07869","paper":"/paper/comparative-evaluation-of-multi-agent-deep","title":"Benchmarking Multi-Agent Deep Reinforcement Learning Algorithms in Cooperative Tasks","date":"2020-06-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"73de3ace29add240","mcp_get_code":{"code_sha256":"73de3ace29add240"}},{"arxiv_id":"2006.04061","paper":"/paper/dual-policy-distillation","title":"Dual Policy Distillation","date":"2020-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kiminh/dual-policy-distillation","path":"baselines/bench/monitor.py","file_url":"https://github.com/kiminh/dual-policy-distillation/blob/HEAD/baselines/bench/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"e71620de1b94c6f0","mcp_get_code":{"code_sha256":"e71620de1b94c6f0"}},{"arxiv_id":"1911.02549","paper":"/paper/mlperf-inference-benchmark","title":"MLPerf Inference Benchmark","date":"2019-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlcommons/inference","path":"e2e-rag/evaluate.py","file_url":"https://github.com/mlcommons/inference/blob/HEAD/e2e-rag/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a9ede96a0650926d","mcp_get_code":{"code_sha256":"a9ede96a0650926d"}},{"arxiv_id":"1910.02551","paper":"/paper/improving-dataset-distillation","title":"Soft-Label Dataset Distillation and Text Dataset Distillation","date":"2019-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ilia10000/dataset-distillation","path":"utils/io.py","file_url":"https://github.com/ilia10000/dataset-distillation/blob/HEAD/utils/io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"062128c654a29276","mcp_get_code":{"code_sha256":"062128c654a29276"}},{"arxiv_id":"1909.11942","paper":"/paper/albert-a-lite-bert-for-self-supervised","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","date":"2019-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cypressd1999/FYP_2021","path":"src/train_funcs.py","file_url":"https://github.com/cypressd1999/FYP_2021/blob/HEAD/src/train_funcs.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a8f8b3ec011da390","mcp_get_code":{"code_sha256":"a8f8b3ec011da390"}},{"arxiv_id":"1909.11942","paper":"/paper/albert-a-lite-bert-for-self-supervised","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","date":"2019-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cypressd1999/FYP_2021","path":"src/tasks/train_funcs.py","file_url":"https://github.com/cypressd1999/FYP_2021/blob/HEAD/src/tasks/train_funcs.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e60b8c4379569b89","mcp_get_code":{"code_sha256":"e60b8c4379569b89"}},{"arxiv_id":"1909.00025","paper":"/paper/meta-learning-with-warped-gradient-descent","title":"Meta-Learning with Warped Gradient Descent","date":"2019-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"flennerhag/warpgrad","path":"src/omniglot/monitor.py","file_url":"https://github.com/flennerhag/warpgrad/blob/HEAD/src/omniglot/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fe0761d80f06cb62","mcp_get_code":{"code_sha256":"fe0761d80f06cb62"}},{"arxiv_id":"1908.08351","paper":"/paper/the-compositionality-of-neural-networks","title":"Compositionality decomposed: how do neural networks generalise?","date":"2019-08-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"i-machine-think/am-i-compositional","path":"src/evaluate/plot_pcfg_statistics.py","file_url":"https://github.com/i-machine-think/am-i-compositional/blob/HEAD/src/evaluate/plot_pcfg_statistics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dc6487c8e0261792","mcp_get_code":{"code_sha256":"dc6487c8e0261792"}},{"arxiv_id":"1908.08351","paper":"/paper/the-compositionality-of-neural-networks","title":"Compositionality decomposed: how do neural networks generalise?","date":"2019-08-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"i-machine-think/am-i-compositional","path":"src/evaluate/plot_productivity_statistics.py","file_url":"https://github.com/i-machine-think/am-i-compositional/blob/HEAD/src/evaluate/plot_productivity_statistics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"87e48f490224559a","mcp_get_code":{"code_sha256":"87e48f490224559a"}},{"arxiv_id":"1905.02363","paper":"/paper/dimension-wise-importance-sampling-weight","title":"Dimension-Wise Importance Sampling Weight Clipping for Sample-Efficient Reinforcement Learning","date":"2019-05-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seungyulhan/disc","path":"baselines/bench/monitor.py","file_url":"https://github.com/seungyulhan/disc/blob/HEAD/baselines/bench/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"404244405c7fd238","mcp_get_code":{"code_sha256":"404244405c7fd238"}},{"arxiv_id":"1902.04043","paper":"/paper/the-starcraft-multi-agent-challenge","title":"The StarCraft Multi-Agent Challenge","date":"2019-02-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"73de3ace29add240","mcp_get_code":{"code_sha256":"73de3ace29add240"}},{"arxiv_id":"1812.01054","paper":"/paper/transferring-knowledge-across-learning","title":"Transferring Knowledge across Learning Processes","date":"2018-12-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amzn/metalearn-leap","path":"src/omniglot/monitor.py","file_url":"https://github.com/amzn/metalearn-leap/blob/HEAD/src/omniglot/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fe0761d80f06cb62","mcp_get_code":{"code_sha256":"fe0761d80f06cb62"}},{"arxiv_id":"1811.10959","paper":"/paper/dataset-distillation","title":"Dataset Distillation","date":"2018-11-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SsnL/dataset-distillation","path":"utils/io.py","file_url":"https://github.com/SsnL/dataset-distillation/blob/HEAD/utils/io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"062128c654a29276","mcp_get_code":{"code_sha256":"062128c654a29276"}},{"arxiv_id":"1811.02073","paper":"/paper/quota-the-quantile-option-architecture-for","title":"QUOTA: The Quantile Option Architecture for Reinforcement Learning","date":"2018-11-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Kchu/DeepRL_CK","path":"Distributional_RL/monitor.py","file_url":"https://github.com/Kchu/DeepRL_CK/blob/HEAD/Distributional_RL/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"404244405c7fd238","mcp_get_code":{"code_sha256":"404244405c7fd238"}},{"arxiv_id":"1806.02426","paper":"/paper/deep-variational-reinforcement-learning-for","title":"Deep Variational Reinforcement Learning for POMDPs","date":"2018-06-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maximilianigl/DVRL","path":"code/utils.py","file_url":"https://github.com/maximilianigl/DVRL/blob/HEAD/code/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c7d3d856261b55e8","mcp_get_code":{"code_sha256":"c7d3d856261b55e8"}},{"arxiv_id":"1703.04529","paper":"/paper/task-based-end-to-end-model-learning-in","title":"Task-based End-to-end Model Learning in Stochastic Optimization","date":"2017-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"locuslab/e2e-model-learning","path":"battery_storage/calc_stats.py","file_url":"https://github.com/locuslab/e2e-model-learning/blob/HEAD/battery_storage/calc_stats.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9ec346e1329108c5","mcp_get_code":{"code_sha256":"9ec346e1329108c5"}},{"arxiv_id":"1703.04529","paper":"/paper/task-based-end-to-end-model-learning-in","title":"Task-based End-to-end Model Learning in Stochastic Optimization","date":"2017-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"locuslab/e2e-model-learning","path":"power_sched/plot.py","file_url":"https://github.com/locuslab/e2e-model-learning/blob/HEAD/power_sched/plot.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a9861553a6f58c1b","mcp_get_code":{"code_sha256":"a9861553a6f58c1b"}},{"arxiv_id":"1702.00748","paper":"/paper/qcd-aware-recursive-neural-networks-for-jet","title":"QCD-Aware Recursive Neural Networks for Jet Physics","date":"2017-02-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sebastianmacaluso/treenin","path":"code/saveProb.py","file_url":"https://github.com/sebastianmacaluso/treenin/blob/HEAD/code/saveProb.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aba2779c22a6dd3f","mcp_get_code":{"code_sha256":"aba2779c22a6dd3f"}},{"arxiv_id":"1606.03476","paper":"/paper/generative-adversarial-imitation-learning","title":"Generative Adversarial Imitation Learning","date":"2016-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Techget/gail-tf-sc2","path":"gailtf/baselines/bench/monitor.py","file_url":"https://github.com/Techget/gail-tf-sc2/blob/HEAD/gailtf/baselines/bench/monitor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0c09148efe18bf06","mcp_get_code":{"code_sha256":"0c09148efe18bf06"}},{"arxiv_id":"1207.7160","paper":"/paper/a-qcqp-approach-to-triangulation","title":"A QCQP Approach to Triangulation","date":null,"month_inferred_from_arxiv_id":"2012-07","title_source":"archive","repo":"linusnie/robust-triangulation-relaxations","path":"simulation_experiments.py","file_url":"https://github.com/linusnie/robust-triangulation-relaxations/blob/HEAD/simulation_experiments.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"84a0ae8f42bed6d0","mcp_get_code":{"code_sha256":"84a0ae8f42bed6d0"}},{"arxiv_id":"2025.naacl-demo.13","paper":null,"title":"arXiv:2025.naacl-demo.13","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"IBM/InspectorRAGet","path":"converters/agentif/convert.py","file_url":"https://github.com/IBM/InspectorRAGet/blob/HEAD/converters/agentif/convert.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4ff3dca827eaa7ff","mcp_get_code":{"code_sha256":"4ff3dca827eaa7ff"}}]}