{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/compute-metrics","entry":"compute_metrics","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":208,"n_papers_ran":98,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":199,"n_samples_ran":85,"n_samples_fingerprinted":14,"n_places":222,"n_places_pointer_only":93,"by_status":{"ran_honours":2,"ran_violates":1,"ran_draft_wrong":14,"ran_fixture":8,"ran":60,"unverified":114},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.14391","paper":"/paper/arxiv-2609-14391","title":"Newton Deep Unfolding for Compressed Sensing","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"xianchaoxiu/DNU-Net","path":"NDU-Net/utils/metrics.py","file_url":"https://github.com/xianchaoxiu/DNU-Net/blob/HEAD/NDU-Net/utils/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"db88269952922ada","mcp_get_code":{"code_sha256":"db88269952922ada"}},{"arxiv_id":"2609.02255","paper":"/paper/arxiv-2609-02255","title":"T2LSC-Bench: Benchmarking Localized Semantic Control in Text-to-Image Generation","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"LLMSecResearch/T2LSC-Bench","path":"evaluation/metrics.py","file_url":"https://github.com/LLMSecResearch/T2LSC-Bench/blob/HEAD/evaluation/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fc78ddf4ce44b934","mcp_get_code":{"code_sha256":"fc78ddf4ce44b934"}},{"arxiv_id":"2609.02204","paper":"/paper/arxiv-2609-02204","title":"TAME: Temporal-Aware Mixture-of-Experts for Text-Video Retrieval","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"sejong-rcv/TAME","path":"metrics.py","file_url":"https://github.com/sejong-rcv/TAME/blob/HEAD/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b05823d3dd0bdd19","mcp_get_code":{"code_sha256":"b05823d3dd0bdd19"}},{"arxiv_id":"2608.23799","paper":"/paper/arxiv-2608-23799","title":"Restoring Without Forgetting: Continual Learning Across Image Degradations","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"AlifAshrafee/Restoring-Without-Forgetting","path":"compute_cl_metrics.py","file_url":"https://github.com/AlifAshrafee/Restoring-Without-Forgetting/blob/HEAD/compute_cl_metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1b5955295986b5a8","mcp_get_code":{"code_sha256":"1b5955295986b5a8"}},{"arxiv_id":"2608.20807","paper":"/paper/arxiv-2608-20807","title":"Neuro-Geospatial Modelling of EEG Affective States Using Literature-Informed Environmental Context","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"r11up/geo-cog","path":"evaluation/metrics.py","file_url":"https://github.com/r11up/geo-cog/blob/HEAD/evaluation/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ff2fa028bd8850b8","mcp_get_code":{"code_sha256":"ff2fa028bd8850b8"}},{"arxiv_id":"2608.20801","paper":"/paper/arxiv-2608-20801","title":"Profiling What Matters: Context-Aware Item Profiles from Large-Scale Metadata for LLM Recommenders","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"rgbeing/CAIRO","path":"reranking/metrics.py","file_url":"https://github.com/rgbeing/CAIRO/blob/HEAD/reranking/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3ad6fdec8a710f65","mcp_get_code":{"code_sha256":"3ad6fdec8a710f65"}},{"arxiv_id":"2608.18888","paper":"/paper/arxiv-2608-18888","title":"Assessing Quality of Experience in Natural Language Generation of German Text","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"DFKI-NLP/TextQ","path":"models/ats-mt-new_integrating_features.py","file_url":"https://github.com/DFKI-NLP/TextQ/blob/HEAD/models/ats-mt-new_integrating_features.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fcf3f6541774b512","mcp_get_code":{"code_sha256":"fcf3f6541774b512"}},{"arxiv_id":"2608.18888","paper":"/paper/arxiv-2608-18888","title":"Assessing Quality of Experience in Natural Language Generation of German Text","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"DFKI-NLP/TextQ","path":"models/ats_torch_hybrid.py","file_url":"https://github.com/DFKI-NLP/TextQ/blob/HEAD/models/ats_torch_hybrid.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b9e53045c090a5b0","mcp_get_code":{"code_sha256":"b9e53045c090a5b0"}},{"arxiv_id":"2608.12836","paper":"/paper/arxiv-2608-12836","title":"From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"obedjunias19/structured-compositional-reasoning","path":"utils/metrics.py","file_url":"https://github.com/obedjunias19/structured-compositional-reasoning/blob/HEAD/utils/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ea8d26f4f608c139","mcp_get_code":{"code_sha256":"ea8d26f4f608c139"}},{"arxiv_id":"2608.12695","paper":"/paper/arxiv-2608-12695","title":"The Impact of Temporal Context Length and Encoding Strategies on Self-Supervised ECG Representation Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"muha-0/ecg-ssl-representation-learning","path":"eval/metrics.py","file_url":"https://github.com/muha-0/ecg-ssl-representation-learning/blob/HEAD/eval/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"140160542a17a7b4","mcp_get_code":{"code_sha256":"140160542a17a7b4"}},{"arxiv_id":"2608.03967","paper":"/paper/arxiv-2608-03967","title":"Information-Geometric Forward Policy Training in GFlowNets","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"rodsveiga/infogeometric_gflows","path":"experiments/hypergrid/deceptive/run_adaptive_teacher.py","file_url":"https://github.com/rodsveiga/infogeometric_gflows/blob/HEAD/experiments/hypergrid/deceptive/run_adaptive_teacher.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3495af39e2194108","mcp_get_code":{"code_sha256":"3495af39e2194108"}},{"arxiv_id":"2607.03299","paper":"/paper/arxiv-2607-03299","title":"Piecewise Dynamic Diffusion Regularization for Reconstruction of Cardiac Cine MRI","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"MLI-lab/pddr","path":"cardiac_diffusion/metrics.py","file_url":"https://github.com/MLI-lab/pddr/blob/HEAD/cardiac_diffusion/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-2-Clause","inline_ok":true,"code_sha256_prefix":"8ffd0859dae62979","mcp_get_code":{"code_sha256":"8ffd0859dae62979"}},{"arxiv_id":"2606.17698","paper":"/paper/arxiv-2606-17698","title":"EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Morizeyao/EComAgentBench_","path":"src/evaluation/metrics.py","file_url":"https://github.com/Morizeyao/EComAgentBench_/blob/HEAD/src/evaluation/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"083a8c2a0585cc60","mcp_get_code":{"code_sha256":"083a8c2a0585cc60"}},{"arxiv_id":"2606.15307","paper":"/paper/arxiv-2606-15307","title":"Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"MohamedBayan/MemeReason","path":"training/unimodal/train_image_classifier.py","file_url":"https://github.com/MohamedBayan/MemeReason/blob/HEAD/training/unimodal/train_image_classifier.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7eaffa29be6d6425","mcp_get_code":{"code_sha256":"7eaffa29be6d6425"}},{"arxiv_id":"2605.27866","paper":"/paper/arxiv-2605-27866","title":"GRADE: Generalizable Reasoning-Aware Dialogue Evaluation for AI Tutors","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"AIM-SCU/GRADE","path":"evaluate_run.py","file_url":"https://github.com/AIM-SCU/GRADE/blob/HEAD/evaluate_run.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"158451b3b6b84941","mcp_get_code":{"code_sha256":"158451b3b6b84941"}},{"arxiv_id":"2605.27311","paper":"/paper/arxiv-2605-27311","title":"CHARTOGRAPHER: Counterfactual Chart Generation for Evaluating Vision-Language Models","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"vis-nlp/ChartQA","path":"Models/VisionTapas/train_classification.py","file_url":"https://github.com/vis-nlp/ChartQA/blob/HEAD/Models/VisionTapas/train_classification.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"5e836f87edf97ccf","mcp_get_code":{"code_sha256":"5e836f87edf97ccf"}},{"arxiv_id":"2605.27311","paper":"/paper/arxiv-2605-27311","title":"CHARTOGRAPHER: Counterfactual Chart Generation for Evaluating Vision-Language Models","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"vis-nlp/ChartQA","path":"Models/VisionTapas/train_question_answering.py","file_url":"https://github.com/vis-nlp/ChartQA/blob/HEAD/Models/VisionTapas/train_question_answering.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"d06b4f37837f3dfc","mcp_get_code":{"code_sha256":"d06b4f37837f3dfc"}},{"arxiv_id":"2605.27281","paper":"/paper/arxiv-2605-27281","title":"Causal Risk Minimization for High-Dimensional Treatments","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"nikitadhawan/causal-risk-minimization","path":"projections.py","file_url":"https://github.com/nikitadhawan/causal-risk-minimization/blob/HEAD/projections.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"182473834b652628","mcp_get_code":{"code_sha256":"182473834b652628"}},{"arxiv_id":"2605.19944","paper":"/paper/arxiv-2605-19944","title":"A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Yyuzrah/AMTA4R","path":"MTA4R/src/distribution_metrics.py","file_url":"https://github.com/Yyuzrah/AMTA4R/blob/HEAD/MTA4R/src/distribution_metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"029738e0501d1cd4","mcp_get_code":{"code_sha256":"029738e0501d1cd4"}},{"arxiv_id":"2605.04036","paper":"/paper/arxiv-2605-04036","title":"OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"PolarSeeker/OpenSeeker","path":"eval/generate_answer.py","file_url":"https://github.com/PolarSeeker/OpenSeeker/blob/HEAD/eval/generate_answer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7368bed9fa4daa1","mcp_get_code":{"code_sha256":"d7368bed9fa4daa1"}},{"arxiv_id":"2605.00604","paper":"/paper/arxiv-2605-00604","title":"Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"russellwmy/affinity-is-not-enough","path":"prototype/routing_entropy.py","file_url":"https://github.com/russellwmy/affinity-is-not-enough/blob/HEAD/prototype/routing_entropy.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2ddba7ae7e49d0cf","mcp_get_code":{"code_sha256":"2ddba7ae7e49d0cf"}},{"arxiv_id":"2604.23396","paper":"/paper/arxiv-2604-23396","title":"Lost in <i>Decoding?</i> Reproducing and Stress-Testing the Look-Ahead Prior in Generative Retrieval","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"kidist-amde/lost-in-decoding","path":"cross_lingual/evaluate.py","file_url":"https://github.com/kidist-amde/lost-in-decoding/blob/HEAD/cross_lingual/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"93b61cc5e4023f00","mcp_get_code":{"code_sha256":"93b61cc5e4023f00"}},{"arxiv_id":"2604.22937","paper":"/paper/arxiv-2604-22937","title":"AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"megagonlabs/AutoPyVerifier","path":"src/autopyverifier/search.py","file_url":"https://github.com/megagonlabs/AutoPyVerifier/blob/HEAD/src/autopyverifier/search.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c413778bf61cbc0f","mcp_get_code":{"code_sha256":"c413778bf61cbc0f"}},{"arxiv_id":"2604.21365","paper":"/paper/arxiv-2604-21365","title":"mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"kinit-sk/mcdok-semeval2026","path":"mcdokA.py","file_url":"https://github.com/kinit-sk/mcdok-semeval2026/blob/HEAD/mcdokA.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"def9588282e202c7","mcp_get_code":{"code_sha256":"def9588282e202c7"}},{"arxiv_id":"2604.07937","paper":"/paper/arxiv-2604-07937","title":"HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification Strategy","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"XMUDeepLIT/HCRE","path":"inference/eval_predictions.py","file_url":"https://github.com/XMUDeepLIT/HCRE/blob/HEAD/inference/eval_predictions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f00a11019513fa38","mcp_get_code":{"code_sha256":"f00a11019513fa38"}},{"arxiv_id":"2604.06613","paper":"/paper/arxiv-2604-06613","title":"The Detection-Extraction Gap: Models Know the Answer Before They Can Say It","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"EdWangLoDaSc/know2say","path":"src/dashboard.py","file_url":"https://github.com/EdWangLoDaSc/know2say/blob/HEAD/src/dashboard.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ca864081606c7b8a","mcp_get_code":{"code_sha256":"ca864081606c7b8a"}},{"arxiv_id":"2603.28488","paper":"/paper/arxiv-2603-28488","title":"Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"mnc13/PROClaim","path":"framework/aggregate_ablation_results.py","file_url":"https://github.com/mnc13/PROClaim/blob/HEAD/framework/aggregate_ablation_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5b1c8ae2409e16f6","mcp_get_code":{"code_sha256":"5b1c8ae2409e16f6"}},{"arxiv_id":"2603.26791","paper":"/paper/arxiv-2603-26791","title":"Crystal: Characterizing Relative Impact of Scholarly Publications","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"allenai/multicite","path":"classification/run_citation_classification.py","file_url":"https://github.com/allenai/multicite/blob/HEAD/classification/run_citation_classification.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7588d2b9e8ea0f11","mcp_get_code":{"code_sha256":"7588d2b9e8ea0f11"}},{"arxiv_id":"2603.15130","paper":"/paper/arxiv-2603-15130","title":"Indirect Question Answering in English, German and Bavarian: A Challenging Task for High-and Low-Resource Languages Alike","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"mainlp/Multilingual-IQA","path":"code/train_predict/classify.py","file_url":"https://github.com/mainlp/Multilingual-IQA/blob/HEAD/code/train_predict/classify.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cd18d69bf4f75537","mcp_get_code":{"code_sha256":"cd18d69bf4f75537"}},{"arxiv_id":"2603.07346","paper":"/paper/arxiv-2603-07346","title":"How Much Noise Can BERT Handle? Insights from Multilingual Sentence Difficulty Detection","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"Nouran-Khallaf/denoising-difficulty","path":"utils/metrics_utils.py","file_url":"https://github.com/Nouran-Khallaf/denoising-difficulty/blob/HEAD/utils/metrics_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b4c0c9875ba6e7c6","mcp_get_code":{"code_sha256":"b4c0c9875ba6e7c6"}},{"arxiv_id":"2603.03292","paper":"/paper/arxiv-2603-03292","title":"From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"NJU-RL/MA-RAG","path":"train_bert.py","file_url":"https://github.com/NJU-RL/MA-RAG/blob/HEAD/train_bert.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e92204aa248de1a9","mcp_get_code":{"code_sha256":"e92204aa248de1a9"}},{"arxiv_id":"2603.00634","paper":"/paper/arxiv-2603-00634","title":"BLUFF: Benchmarking the Detection of False and Synthetic Content across 58 Low-Resource Languages","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"jsl5710/BLUFF","path":"src/evaluation/decoder/evaluate.py","file_url":"https://github.com/jsl5710/BLUFF/blob/HEAD/src/evaluation/decoder/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"38c38274522fb8f3","mcp_get_code":{"code_sha256":"38c38274522fb8f3"}},{"arxiv_id":"2602.13297","paper":"/paper/arxiv-2602-13297","title":"Conditional Generative Models for High-Resolution Range Profiles: Capturing Geometry-Driven Trends in a Large-Scale Maritime Dataset","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"EdwynBrient/HRRPGen-geometry","path":"src/ship_hrrp_gen/utils.py","file_url":"https://github.com/EdwynBrient/HRRPGen-geometry/blob/HEAD/src/ship_hrrp_gen/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"801cf48aff7c0cd3","mcp_get_code":{"code_sha256":"801cf48aff7c0cd3"}},{"arxiv_id":"2602.08829","paper":"/paper/arxiv-2602-08829","title":"WILDREWARD: Learning Reward Models from In-the-Wild Human Interactions","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"THU-KEG/WildReward","path":"train_rm/train_rank.py","file_url":"https://github.com/THU-KEG/WildReward/blob/HEAD/train_rm/train_rank.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5363b46bc9c9c257","mcp_get_code":{"code_sha256":"5363b46bc9c9c257"}},{"arxiv_id":"2602.08245","paper":"/paper/arxiv-2602-08245","title":"STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"Kimho666/STEP","path":"multirun_metrics.py","file_url":"https://github.com/Kimho666/STEP/blob/HEAD/multirun_metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3351ad91683faf7f","mcp_get_code":{"code_sha256":"3351ad91683faf7f"}},{"arxiv_id":"2601.18005","paper":"/paper/arxiv-2601-18005","title":"Flow-based Extremal Mathematical Structure Discovery","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"berczig/FlowBoost","path":"flow_boost/heilbronn_square/plot_data_heilbronn.py","file_url":"https://github.com/berczig/FlowBoost/blob/HEAD/flow_boost/heilbronn_square/plot_data_heilbronn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2f705b01f997764b","mcp_get_code":{"code_sha256":"2f705b01f997764b"}},{"arxiv_id":"2601.18005","paper":"/paper/arxiv-2601-18005","title":"Flow-based Extremal Mathematical Structure Discovery","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"berczig/FlowBoost","path":"flow_boost/heilbronn_square/plot_data_points.py","file_url":"https://github.com/berczig/FlowBoost/blob/HEAD/flow_boost/heilbronn_square/plot_data_points.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"15fc8a32d3849637","mcp_get_code":{"code_sha256":"15fc8a32d3849637"}},{"arxiv_id":"2601.16644","paper":"/paper/arxiv-2601-16644","title":"Sycophancy Hides Linearly in the Attention Heads","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"rifoagenadi/sycophancy","path":"extension/metrics.py","file_url":"https://github.com/rifoagenadi/sycophancy/blob/HEAD/extension/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"62c385ad75991b3e","mcp_get_code":{"code_sha256":"62c385ad75991b3e"}},{"arxiv_id":"2601.15479","paper":"/paper/arxiv-2601-15479","title":"Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"sydneyanuyah/CausalDiscovery","path":"results/experiment2/evaluate.py","file_url":"https://github.com/sydneyanuyah/CausalDiscovery/blob/HEAD/results/experiment2/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5938e8daf778ae3e","mcp_get_code":{"code_sha256":"5938e8daf778ae3e"}},{"arxiv_id":"2601.09449","paper":"/paper/arxiv-2601-09449","title":"PrivLEX: Detecting legal concepts in images through Vision-Language Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"idiap/privlex","path":"metrics.py","file_url":"https://github.com/idiap/privlex/blob/HEAD/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d1dc680fd239da4e","mcp_get_code":{"code_sha256":"d1dc680fd239da4e"}},{"arxiv_id":"2601.08467","paper":"/paper/arxiv-2601-08467","title":"Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"mtakamichi/ZVL-DDD","path":"src/metrics.py","file_url":"https://github.com/mtakamichi/ZVL-DDD/blob/HEAD/src/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4277c568ca217e4e","mcp_get_code":{"code_sha256":"4277c568ca217e4e"}},{"arxiv_id":"2601.07348","paper":"/paper/arxiv-2601-07348","title":"Controlled Self-Evolution for Algorithmic Code Optimization","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"QuantaAlpha/EvoControl","path":"utils/analyze_iterations.py","file_url":"https://github.com/QuantaAlpha/EvoControl/blob/HEAD/utils/analyze_iterations.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3de8648950fcd7fc","mcp_get_code":{"code_sha256":"3de8648950fcd7fc"}},{"arxiv_id":"2512.23461","paper":"/paper/arxiv-2512-23461","title":"Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"Qwen-Applications/DIR","path":"reward_models/utils.py","file_url":"https://github.com/Qwen-Applications/DIR/blob/HEAD/reward_models/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7710f1274273fc6c","mcp_get_code":{"code_sha256":"7710f1274273fc6c"}},{"arxiv_id":"2510.14337","paper":"/paper/arxiv-2510-14337","title":"Stop-RAG: Value-Based Retrieval Control for Iterative RAG","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"chosolbee/Stop-RAG","path":"src/train/stop_rag_train.py","file_url":"https://github.com/chosolbee/Stop-RAG/blob/HEAD/src/train/stop_rag_train.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f4bd6643c0e7d760","mcp_get_code":{"code_sha256":"f4bd6643c0e7d760"}},{"arxiv_id":"2510.10963","paper":"/paper/arxiv-2510-10963","title":"APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"BIRlz/APLOT","path":"reward_models/utils.py","file_url":"https://github.com/BIRlz/APLOT/blob/HEAD/reward_models/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7710f1274273fc6c","mcp_get_code":{"code_sha256":"7710f1274273fc6c"}},{"arxiv_id":"2510.07964","paper":"/paper/arxiv-2510-07964","title":"PRESCRIBE: Predicting Single-Cell Responses with Bayesian Estimation","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"Bunnybeibei/PRESCRIBE","path":"gears/inference.py","file_url":"https://github.com/Bunnybeibei/PRESCRIBE/blob/HEAD/gears/inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d3e54ce67d34ed8f","mcp_get_code":{"code_sha256":"d3e54ce67d34ed8f"}},{"arxiv_id":"2510.07437","paper":"/paper/arxiv-2510-07437","title":"LASER: An LLM-based ASR Scoring and Evaluation Rubric","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"Amparulekar/LASER-metric","path":"llama.py","file_url":"https://github.com/Amparulekar/LASER-metric/blob/HEAD/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e4a5e29443fe16c0","mcp_get_code":{"code_sha256":"e4a5e29443fe16c0"}},{"arxiv_id":"2510.03276","paper":"/paper/arxiv-2510-03276","title":"QuadEnhancer: Leveraging Quadratic Transformations to Enhance Deep Neural Networks","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"chitar/QuadEnhancer","path":"text-classification/finetune.py","file_url":"https://github.com/chitar/QuadEnhancer/blob/HEAD/text-classification/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bb1016f9e0e6403c","mcp_get_code":{"code_sha256":"bb1016f9e0e6403c"}},{"arxiv_id":"2509.26455","paper":"/paper/arxiv-2509-26455","title":"Stylos: Multi-View 3D Stylization with Single-Forward Gaussian Splatting","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"HanzhouLiu/Stylos","path":"ArtScore/utils.py","file_url":"https://github.com/HanzhouLiu/Stylos/blob/HEAD/ArtScore/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cceff30e57a71536","mcp_get_code":{"code_sha256":"cceff30e57a71536"}},{"arxiv_id":"2506.18940","paper":"/paper/eccdnamamba-a-pre-trained-model-for-ultra","title":"eccDNAMamba: A Pre-Trained Model for Ultra-Long eccDNA Sequence Analysis","date":"2025-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzq1zh/genai-lab","path":"finetune_sample.py","file_url":"https://github.com/zzq1zh/genai-lab/blob/HEAD/finetune_sample.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d02d4a2ae6122ca6","mcp_get_code":{"code_sha256":"d02d4a2ae6122ca6"}},{"arxiv_id":"2506.14866","paper":"/paper/os-harm-a-benchmark-for-measuring-safety-of","title":"OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents","date":"2025-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thomas-kuntz/os-harm","path":"evaluate/compute_predicted_metrics.py","file_url":"https://github.com/thomas-kuntz/os-harm/blob/HEAD/evaluate/compute_predicted_metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"407d595c1d42da9d","mcp_get_code":{"code_sha256":"407d595c1d42da9d"}},{"arxiv_id":"2506.01833","paper":"/paper/space-your-genomic-profile-predictor-is-a","title":"SPACE: Your Genomic Profile Predictor is a Powerful DNA Foundation Model","date":"2025-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhujiwei111/space","path":"experiments/GUE/expr_GUE.py","file_url":"https://github.com/zhujiwei111/space/blob/HEAD/experiments/GUE/expr_GUE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3a11b641b71ab6a3","mcp_get_code":{"code_sha256":"3a11b641b71ab6a3"}},{"arxiv_id":"2506.01339","paper":"/paper/invariance-makes-llm-unlearning-resilient","title":"Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning","date":"2025-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OPTML-Group/Unlearn-ILU","path":"src/unlearn/base.py","file_url":"https://github.com/OPTML-Group/Unlearn-ILU/blob/HEAD/src/unlearn/base.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88a4f13abd54a00c","mcp_get_code":{"code_sha256":"88a4f13abd54a00c"}},{"arxiv_id":"2503.22719","paper":"/paper/llm-based-agent-simulation-for-maternal","title":"LLM-based Agent Simulation for Maternal Health Interventions: Uncertainty Estimation and Decision-focused Evaluation","date":"2025-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sarahmart/llm-abs-armman-prediction","path":"analysis/aggregation.py","file_url":"https://github.com/sarahmart/llm-abs-armman-prediction/blob/HEAD/analysis/aggregation.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fb0e69ae8e7fe717","mcp_get_code":{"code_sha256":"fb0e69ae8e7fe717"}},{"arxiv_id":"2503.20047","paper":"/paper/med3dvlm-an-efficient-vision-language-model","title":"Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis","date":"2025-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mirthai/med3dvlm","path":"src/train/train_clip.py","file_url":"https://github.com/mirthai/med3dvlm/blob/HEAD/src/train/train_clip.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"220b7697c5a0d40e","mcp_get_code":{"code_sha256":"220b7697c5a0d40e"}},{"arxiv_id":"2503.20047","paper":"/paper/med3dvlm-an-efficient-vision-language-model","title":"Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis","date":"2025-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mirthai/med3dvlm","path":"src/train/train_vlm.py","file_url":"https://github.com/mirthai/med3dvlm/blob/HEAD/src/train/train_vlm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"05b8d6cd94313722","mcp_get_code":{"code_sha256":"05b8d6cd94313722"}},{"arxiv_id":"2503.11429","paper":"/paper/combining-causal-models-for-more-accurate","title":"Combining Causal Models for More Accurate Abstractions of Neural Networks","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marapislar/combining-causal-models-for-accurate-nn-abstractions","path":"src/run_das.py","file_url":"https://github.com/marapislar/combining-causal-models-for-accurate-nn-abstractions/blob/HEAD/src/run_das.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b43a36e53aa3e4b2","mcp_get_code":{"code_sha256":"b43a36e53aa3e4b2"}},{"arxiv_id":"2503.08918","paper":"/paper/multilevel-generative-samplers-for","title":"Multilevel Generative Samplers for Investigating Critical Phenomena","date":"2025-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlneuralsampler/multilevel","path":"van_code/nn.py","file_url":"https://github.com/mlneuralsampler/multilevel/blob/HEAD/van_code/nn.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c58bd2dcaff29593","mcp_get_code":{"code_sha256":"c58bd2dcaff29593"}},{"arxiv_id":"2503.07703","paper":"/paper/seedream-2-0-a-native-chinese-english","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","date":"2025-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DYEvaLab/EvalMuse","path":"NTIRE2025/Track1_Alignment/evaluate.py","file_url":"https://github.com/DYEvaLab/EvalMuse/blob/HEAD/NTIRE2025/Track1_Alignment/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c398976e864ca923","mcp_get_code":{"code_sha256":"c398976e864ca923"}},{"arxiv_id":"2503.00096","paper":"/paper/2503-00096","title":"BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology","date":"2025-02-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Future-House/BixBench","path":"bixbench/utils.py","file_url":"https://github.com/Future-House/BixBench/blob/HEAD/bixbench/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6205d4627a1c839a","mcp_get_code":{"code_sha256":"6205d4627a1c839a"}},{"arxiv_id":"2502.05374","paper":"/paper/towards-llm-unlearning-resilient-to","title":"Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond","date":"2025-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"optml-group/unlearn-smooth","path":"WMDP/src/unlearn/base.py","file_url":"https://github.com/optml-group/unlearn-smooth/blob/HEAD/WMDP/src/unlearn/base.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88a4f13abd54a00c","mcp_get_code":{"code_sha256":"88a4f13abd54a00c"}},{"arxiv_id":"2501.05040","paper":"/paper/swe-fixer-training-open-source-llms-for","title":"SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution","date":"2025-01-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jorge-martinez-gil/graphcodebert-feature-integration","path":"legacy/fine-tunning-graphcodebert-karnalim-with-features.py","file_url":"https://github.com/jorge-martinez-gil/graphcodebert-feature-integration/blob/HEAD/legacy/fine-tunning-graphcodebert-karnalim-with-features.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c17d5d78451bbd57","mcp_get_code":{"code_sha256":"c17d5d78451bbd57"}},{"arxiv_id":"2412.20888","paper":"/paper/navigating-chemical-linguistic-sharing-space","title":"Navigating Chemical-Linguistic Sharing Space with Heterogeneous Molecular Encoding","date":null,"month_inferred_from_arxiv_id":"2024-12","title_source":"archive","repo":"Lyu6PosHao/HME","path":"src/hme/run_classification.py","file_url":"https://github.com/Lyu6PosHao/HME/blob/HEAD/src/hme/run_classification.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b04bf311f5568191","mcp_get_code":{"code_sha256":"b04bf311f5568191"}},{"arxiv_id":"2412.08639","paper":"/paper/fast-prompt-alignment-for-text-to-image","title":"Fast Prompt Alignment for Text-to-Image Generation","date":"2024-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tiktok/fast_prompt_alignment","path":"training/finetune.py","file_url":"https://github.com/tiktok/fast_prompt_alignment/blob/HEAD/training/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1b50bb461afcd4e7","mcp_get_code":{"code_sha256":"1b50bb461afcd4e7"}},{"arxiv_id":"2412.07618","paper":"/paper/adapting-to-non-stationary-environments-multi","title":"Adapting to Non-Stationary Environments: Multi-Armed Bandit Enhanced Retrieval-Augmented Generation on Knowledge Graphs","date":"2024-12-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"futureeeeee/dynamic-rag","path":"nn_router.py","file_url":"https://github.com/futureeeeee/dynamic-rag/blob/HEAD/nn_router.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6acfe88d09a11a54","mcp_get_code":{"code_sha256":"6acfe88d09a11a54"}},{"arxiv_id":"2412.01981","paper":"/paper/free-process-rewards-without-process-labels","title":"Free Process Rewards without Process Labels","date":"2024-12-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lifan-yuan/implicitprm","path":"eval/bon_eval.py","file_url":"https://github.com/lifan-yuan/implicitprm/blob/HEAD/eval/bon_eval.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ad31a6c133b0728c","mcp_get_code":{"code_sha256":"ad31a6c133b0728c"}},{"arxiv_id":"2411.10954","paper":"/paper/dialectal-toxicity-detection-evaluating-llm","title":"Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties","date":"2024-11-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ffaisal93/dialect_toxicity_llm_judge","path":"src/compute_consistency.py","file_url":"https://github.com/ffaisal93/dialect_toxicity_llm_judge/blob/HEAD/src/compute_consistency.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4ace4e4a4187e874","mcp_get_code":{"code_sha256":"4ace4e4a4187e874"}},{"arxiv_id":"2411.10606","paper":"/paper/amoeballm-constructing-any-shape-large","title":"AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment","date":"2024-11-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"GATECH-EIC/AmoebaLLM","path":"eval_func.py","file_url":"https://github.com/GATECH-EIC/AmoebaLLM/blob/HEAD/eval_func.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"89809a6f227449c9","mcp_get_code":{"code_sha256":"89809a6f227449c9"}},{"arxiv_id":"2411.07814","paper":"/paper/community-research-earth-digital-intelligence","title":"Community Research Earth Digital Intelligence Twin (CREDIT)","date":"2024-11-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ncar/miles-credit","path":"credit/applications/rollout_metrics_noisy_model.py","file_url":"https://github.com/ncar/miles-credit/blob/HEAD/credit/applications/rollout_metrics_noisy_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"dca6ac38782407c1","mcp_get_code":{"code_sha256":"dca6ac38782407c1"}},{"arxiv_id":"2411.05561","paper":"/paper/training-objective-drives-the-consistency-of","title":"Training objective drives the consistency of representational similarity across datasets","date":"2024-11-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lciernik/similarity_consistency","path":"sim_consistency/eval/metrics.py","file_url":"https://github.com/lciernik/similarity_consistency/blob/HEAD/sim_consistency/eval/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6beb4e86a582c341","mcp_get_code":{"code_sha256":"6beb4e86a582c341"}},{"arxiv_id":"2411.05383","paper":"/paper/towards-low-resource-harmful-meme-detection","title":"Towards Low-Resource Harmful Meme Detection with LMM Agents","date":"2024-11-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jianzhao-huang/lorehm","path":"utils/utils.py","file_url":"https://github.com/jianzhao-huang/lorehm/blob/HEAD/utils/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2fcda73a00485621","mcp_get_code":{"code_sha256":"2fcda73a00485621"}},{"arxiv_id":"2410.23595","paper":"/paper/disentangling-interpretable-factors-with","title":"Disentangling Interpretable Factors with Supervised Independent Subspace Principal Component Analysis","date":"2024-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nitzanlab/biolord_reproducibility","path":"utils/utils_perturbations.py","file_url":"https://github.com/nitzanlab/biolord_reproducibility/blob/HEAD/utils/utils_perturbations.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"7a8d80823166d9e6","mcp_get_code":{"code_sha256":"7a8d80823166d9e6"}},{"arxiv_id":"2410.19552","paper":"/paper/geollava-efficient-fine-tuned-vision-language","title":"GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing","date":"2024-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HosamGen/GeoLLaVA","path":"eval_metrics.py","file_url":"https://github.com/HosamGen/GeoLLaVA/blob/HEAD/eval_metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d0b60b3a670c8220","mcp_get_code":{"code_sha256":"d0b60b3a670c8220"}},{"arxiv_id":"2410.19278","paper":"/paper/applying-sparse-autoencoders-to-unlearn","title":"Applying sparse autoencoders to unlearn knowledge in language models","date":"2024-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"efarrell1/train_sparse_autoencoder","path":"sae/utils.py","file_url":"https://github.com/efarrell1/train_sparse_autoencoder/blob/HEAD/sae/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bda89456f67fab15","mcp_get_code":{"code_sha256":"bda89456f67fab15"}},{"arxiv_id":"2410.16646","paper":"/paper/topodiffusionnet-a-topology-aware-diffusion","title":"TopoDiffusionNet: A Topology-aware Diffusion Model","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Saumya-Gupta-26/TopoDiffusionNet","path":"analysis-scripts/eval-metrics.py","file_url":"https://github.com/Saumya-Gupta-26/TopoDiffusionNet/blob/HEAD/analysis-scripts/eval-metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"442558c88bf5c121","mcp_get_code":{"code_sha256":"442558c88bf5c121"}},{"arxiv_id":"2410.12011","paper":"/paper/pixology-probing-the-linguistic-and-visual","title":"Pixology: Probing the Linguistic and Visual Capabilities of Pixel-based Language Models","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kushaltatariya/Pixology","path":"finetuning/cifar_finetune.py","file_url":"https://github.com/kushaltatariya/Pixology/blob/HEAD/finetuning/cifar_finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7e409034d19c43ff","mcp_get_code":{"code_sha256":"7e409034d19c43ff"}},{"arxiv_id":"2410.09671","paper":"/paper/openr-an-open-source-framework-for-advanced","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openreasoner/openr","path":"prm/code/finetune_llama.py","file_url":"https://github.com/openreasoner/openr/blob/HEAD/prm/code/finetune_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b78ea990bb05f759","mcp_get_code":{"code_sha256":"b78ea990bb05f759"}},{"arxiv_id":"2410.07163","paper":"/paper/simplicity-prevails-rethinking-negative","title":"Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OPTML-Group/Unlearn-Simple","path":"WMDP/src/unlearn/base.py","file_url":"https://github.com/OPTML-Group/Unlearn-Simple/blob/HEAD/WMDP/src/unlearn/base.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88a4f13abd54a00c","mcp_get_code":{"code_sha256":"88a4f13abd54a00c"}},{"arxiv_id":"2410.04368","paper":"/paper/algorithmic-capabilities-of-random","title":"Algorithmic Capabilities of Random Transformers","date":"2024-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fjzzq2002/random_transformers","path":"modadd_exp.py","file_url":"https://github.com/fjzzq2002/random_transformers/blob/HEAD/modadd_exp.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"429807da8a35c60c","mcp_get_code":{"code_sha256":"429807da8a35c60c"}},{"arxiv_id":"2410.02140","paper":"/paper/a-formal-framework-for-understanding-length","title":"A Formal Framework for Understanding Length Generalization in Transformers","date":"2024-10-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lacoco-lab/length_generalization","path":"algorithmic/language_modeling_train.py","file_url":"https://github.com/lacoco-lab/length_generalization/blob/HEAD/algorithmic/language_modeling_train.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"94fed4ba26e81fca","mcp_get_code":{"code_sha256":"94fed4ba26e81fca"}},{"arxiv_id":"2409.20353","paper":"/paper/cableinspect-ad-an-expert-annotated-anomaly","title":"CableInspect-AD: An Expert-Annotated Anomaly Detection Dataset","date":"2024-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mila-iqia/cableinspect-ad-code","path":"src/anomaly_detector/evaluation_utils.py","file_url":"https://github.com/mila-iqia/cableinspect-ad-code/blob/HEAD/src/anomaly_detector/evaluation_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"753b40afacd6ec68","mcp_get_code":{"code_sha256":"753b40afacd6ec68"}},{"arxiv_id":"2409.06903","paper":"/paper/semi-supervised-reward-modeling-via-iterative","title":"Semi-Supervised Reward Modeling via Iterative Self-Training","date":"2024-09-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RLHFlow/RLHF-Reward-Modeling","path":"bradley-terry-rm/gemma_2B_rm.py","file_url":"https://github.com/RLHFlow/RLHF-Reward-Modeling/blob/HEAD/bradley-terry-rm/gemma_2B_rm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"23a0bca594cfbdcb","mcp_get_code":{"code_sha256":"23a0bca594cfbdcb"}},{"arxiv_id":"2409.06142","paper":"/paper/variational-search-distributions","title":"Variational Search Distributions","date":"2024-09-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"csiro-funml/variationalsearch","path":"experiments/scripts/batch_rounds.py","file_url":"https://github.com/csiro-funml/variationalsearch/blob/HEAD/experiments/scripts/batch_rounds.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"6c9f704672ffed88","mcp_get_code":{"code_sha256":"6c9f704672ffed88"}},{"arxiv_id":"2409.05395","paper":"/paper/shaking-up-vlms-comparing-transformers-and","title":"Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling","date":"2024-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gpantaz/vl_mamba","path":"src/vl_mamba/evaluation/evaluate_ai2d.py","file_url":"https://github.com/gpantaz/vl_mamba/blob/HEAD/src/vl_mamba/evaluation/evaluate_ai2d.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b67b817d3b006d55","mcp_get_code":{"code_sha256":"b67b817d3b006d55"}},{"arxiv_id":"2409.05395","paper":"/paper/shaking-up-vlms-comparing-transformers-and","title":"Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling","date":"2024-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gpantaz/vl_mamba","path":"src/vl_mamba/evaluation/evaluate_gqa.py","file_url":"https://github.com/gpantaz/vl_mamba/blob/HEAD/src/vl_mamba/evaluation/evaluate_gqa.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ee5eb0333993e5fa","mcp_get_code":{"code_sha256":"ee5eb0333993e5fa"}},{"arxiv_id":"2408.00531","paper":"/paper/resi-a-comprehensive-benchmark-for","title":"ReSi: A Comprehensive Benchmark for Representational Similarity Measures","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mklabunde/resi","path":"nlp/bert_finetune.py","file_url":"https://github.com/mklabunde/resi/blob/HEAD/nlp/bert_finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"05059c01bda86bc9","mcp_get_code":{"code_sha256":"05059c01bda86bc9"}},{"arxiv_id":"2407.16997","paper":"/paper/revisiting-who-s-harry-potter-towards","title":"Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective","date":"2024-07-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ucsb-nlp-chang/causal_unlearn","path":"dataloader.py","file_url":"https://github.com/ucsb-nlp-chang/causal_unlearn/blob/HEAD/dataloader.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88a4f13abd54a00c","mcp_get_code":{"code_sha256":"88a4f13abd54a00c"}},{"arxiv_id":"2406.14898","paper":"/paper/safely-learning-with-private-data-a-federated","title":"Safely Learning with Private Data: A Federated Learning Framework for Large Language Model","date":"2024-06-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TAP-LLM/SplitFedLLM","path":"Fed-Llama-module/flclient_llama2.py","file_url":"https://github.com/TAP-LLM/SplitFedLLM/blob/HEAD/Fed-Llama-module/flclient_llama2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f070a226c483d2ba","mcp_get_code":{"code_sha256":"f070a226c483d2ba"}},{"arxiv_id":"2406.14529","paper":"/paper/a-benchmarking-study-of-kolmogorov-arnold","title":"A Benchmarking Study of Kolmogorov-Arnold Networks on Tabular Data","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eleonorapoeta/benchmarking-kan","path":"utils/utils.py","file_url":"https://github.com/eleonorapoeta/benchmarking-kan/blob/HEAD/utils/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5cceac6de41d6976","mcp_get_code":{"code_sha256":"5cceac6de41d6976"}},{"arxiv_id":"2406.14024","paper":"/paper/the-reason-behind-good-or-bad-towards-a","title":"LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kbsdjames/math-minos","path":"RM/process_reward_modeling_pointwise.py","file_url":"https://github.com/kbsdjames/math-minos/blob/HEAD/RM/process_reward_modeling_pointwise.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"43510407b2ec6f22","mcp_get_code":{"code_sha256":"43510407b2ec6f22"}},{"arxiv_id":"2406.14024","paper":"/paper/the-reason-behind-good-or-bad-towards-a","title":"LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kbsdjames/math-minos","path":"RM/reward_modeling_pointwise.py","file_url":"https://github.com/kbsdjames/math-minos/blob/HEAD/RM/reward_modeling_pointwise.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"307f6d829f8c616c","mcp_get_code":{"code_sha256":"307f6d829f8c616c"}},{"arxiv_id":"2406.13356","paper":"/paper/jogging-the-memory-of-unlearned-model-through","title":"Jogging the Memory of Unlearned LLMs Through Targeted Relearning Attacks","date":"2024-06-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"s-huu/jog_llm_memory","path":"synthetic/dataloader.py","file_url":"https://github.com/s-huu/jog_llm_memory/blob/HEAD/synthetic/dataloader.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"88a4f13abd54a00c","mcp_get_code":{"code_sha256":"88a4f13abd54a00c"}},{"arxiv_id":"2406.13133","paper":"/paper/patholm-identifying-pathogenicity-from-the","title":"PathoLM: Identifying pathogenicity from the DNA sequence through the Genome Foundation Model","date":"2024-06-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Sajib-006/Patho-LM","path":"eval_model.py","file_url":"https://github.com/Sajib-006/Patho-LM/blob/HEAD/eval_model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d404195da58b03fd","mcp_get_code":{"code_sha256":"d404195da58b03fd"}},{"arxiv_id":"2406.12845","paper":"/paper/interpretable-preferences-via-multi-objective","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weixiongust/rlhf-reward-modeling","path":"bradley-terry-rm/gemma_2B_rm.py","file_url":"https://github.com/weixiongust/rlhf-reward-modeling/blob/HEAD/bradley-terry-rm/gemma_2B_rm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"23a0bca594cfbdcb","mcp_get_code":{"code_sha256":"23a0bca594cfbdcb"}},{"arxiv_id":"2406.12038","paper":"/paper/soft-prompting-for-unlearning-in-large","title":"Soft Prompting for Unlearning in Large Language Models","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"karuna-bhaila/llm_unlearning","path":"inference_vanilla.py","file_url":"https://github.com/karuna-bhaila/llm_unlearning/blob/HEAD/inference_vanilla.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"49bb87ecc41d23fe","mcp_get_code":{"code_sha256":"49bb87ecc41d23fe"}},{"arxiv_id":"2406.07933","paper":"/paper/large-language-model-unlearning-via-embedding","title":"Large Language Model Unlearning via Embedding-Corrupted Prompts","date":"2024-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chrisliu298/llm-unlearn-eco","path":"scripts/train_classifier.py","file_url":"https://github.com/chrisliu298/llm-unlearn-eco/blob/HEAD/scripts/train_classifier.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2903366de2ae20c9","mcp_get_code":{"code_sha256":"2903366de2ae20c9"}},{"arxiv_id":"2406.02547","paper":"/paper/leveraging-visual-tokens-for-extended-text","title":"Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"showlab/VisInContext","path":"src/main_instruction_tuning.py","file_url":"https://github.com/showlab/VisInContext/blob/HEAD/src/main_instruction_tuning.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dd8287b62746381d","mcp_get_code":{"code_sha256":"dd8287b62746381d"}},{"arxiv_id":"2405.09539","paper":"/paper/mmfusion-multi-modality-diffusion-model-for","title":"MMFusion: Multi-modality Diffusion Model for Lymph Node Metastasis Diagnosis in Esophageal Cancer","date":"2024-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wuchengyu123/mmfusion","path":"utils.py","file_url":"https://github.com/wuchengyu123/mmfusion/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7dbec2e994277534","mcp_get_code":{"code_sha256":"7dbec2e994277534"}},{"arxiv_id":"2405.08553","paper":"/paper/improving-transformers-with-dynamically","title":"Improving Transformers with Dynamically Composable Multi-Head Attention","date":"2024-05-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Caiyun-AI/DCFormer","path":"pytorch/dcformer/run_clm_pt_dcformer.py","file_url":"https://github.com/Caiyun-AI/DCFormer/blob/HEAD/pytorch/dcformer/run_clm_pt_dcformer.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6b376a0abe58a427","mcp_get_code":{"code_sha256":"6b376a0abe58a427"}},{"arxiv_id":"2405.06708","paper":"/paper/langcell-language-cell-pre-training-for-cell","title":"LangCell: Language-Cell Pre-training for Cell Identity Understanding","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PharMolix/LangCell","path":"LangCell-CE-annotation/finetune.py","file_url":"https://github.com/PharMolix/LangCell/blob/HEAD/LangCell-CE-annotation/finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0591830d78ad8c8b","mcp_get_code":{"code_sha256":"0591830d78ad8c8b"}},{"arxiv_id":"2405.06459","paper":"/paper/are-eeg-to-text-models-working","title":"Are EEG-to-Text Models Working?","date":"2024-05-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mikewangwzhl/eeg-to-text","path":"metrics.py","file_url":"https://github.com/mikewangwzhl/eeg-to-text/blob/HEAD/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3b44e7c76889121a","mcp_get_code":{"code_sha256":"3b44e7c76889121a"}},{"arxiv_id":"2404.11341","paper":"/paper/the-causal-chambers-real-physical-systems-as","title":"The Causal Chambers: Real Physical Systems as a Testbed for AI Methodology","date":"2024-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"juangamella/causal-chamber-paper","path":"case_studies/src/symbolicregression/metrics.py","file_url":"https://github.com/juangamella/causal-chamber-paper/blob/HEAD/case_studies/src/symbolicregression/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"69b5fa55a312675e","mcp_get_code":{"code_sha256":"69b5fa55a312675e"}},{"arxiv_id":"2404.04067","paper":"/paper/clue-a-clinical-language-understanding","title":"Does Biomedical Training Lead to Better Medical Performance?","date":"2024-04-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tio-ikim/clue","path":"eval/eval_LongHealth.py","file_url":"https://github.com/tio-ikim/clue/blob/HEAD/eval/eval_LongHealth.py","status":"ran_violates","verification_level":1,"contract_check":"VIOLATES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0c7db73dea0a25ae","mcp_get_code":{"code_sha256":"0c7db73dea0a25ae"}},{"arxiv_id":"2403.18807","paper":"/paper/ecodepth-effective-conditioning-of-diffusion","title":"ECoDepth: Effective Conditioning of Diffusion Models for Monocular Depth Estimation","date":"2024-03-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aradhye2002/ecodepth","path":"model.py","file_url":"https://github.com/aradhye2002/ecodepth/blob/HEAD/model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"e92e07aa1bf1be20","mcp_get_code":{"code_sha256":"e92e07aa1bf1be20"}},{"arxiv_id":"2403.09502","paper":"/paper/equiav-leveraging-equivariance-for-audio","title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JongSuk1/EquiAV","path":"retrieval.py","file_url":"https://github.com/JongSuk1/EquiAV/blob/HEAD/retrieval.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d59b4b3c004c31ff","mcp_get_code":{"code_sha256":"d59b4b3c004c31ff"}},{"arxiv_id":"2403.07691","paper":"/paper/reference-free-monolithic-preference","title":"ORPO: Monolithic Preference Optimization without Reference Model","date":"2024-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shibing624/medicalgpt","path":"training/reward_modeling.py","file_url":"https://github.com/shibing624/medicalgpt/blob/HEAD/training/reward_modeling.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"69a87416659918fe","mcp_get_code":{"code_sha256":"69a87416659918fe"}},{"arxiv_id":"2403.01931","paper":"/paper/varierr-nli-separating-annotation-error-from","title":"VariErr NLI: Separating Annotation Error from Human Label Variation","date":"2024-03-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mainlp/VariErr-NLI","path":"build_score_table.py","file_url":"https://github.com/mainlp/VariErr-NLI/blob/HEAD/build_score_table.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"81217cf08fe12d42","mcp_get_code":{"code_sha256":"81217cf08fe12d42"}},{"arxiv_id":"2403.01748","paper":"/paper/decode-neural-signal-as-speech","title":"NeuSpeech: Decode Neural signal as Speech","date":"2024-03-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neuspeech/neuspeech1","path":"metrics/bleu.py","file_url":"https://github.com/neuspeech/neuspeech1/blob/HEAD/metrics/bleu.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b1936507e543343e","mcp_get_code":{"code_sha256":"b1936507e543343e"}},{"arxiv_id":"2403.00815","paper":"/paper/ram-ehr-retrieval-augmentation-meets-clinical","title":"RAM-EHR: Retrieval Augmentation Meets Clinical Predictions on Electronic Health Records","date":"2024-02-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ritaranx/RAM-EHR","path":"model_src/trainer.py","file_url":"https://github.com/ritaranx/RAM-EHR/blob/HEAD/model_src/trainer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d851686037df7aca","mcp_get_code":{"code_sha256":"d851686037df7aca"}},{"arxiv_id":"2402.17700","paper":"/paper/ravel-evaluating-interpretability-methods-on","title":"RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations","date":"2024-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"explanare/ravel","path":"src/utils/metric_utils.py","file_url":"https://github.com/explanare/ravel/blob/HEAD/src/utils/metric_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5500053238475cfe","mcp_get_code":{"code_sha256":"5500053238475cfe"}},{"arxiv_id":"2402.16445","paper":"/paper/2402-16445","title":"ProLLaMA: A Protein Language Model for Multi-Task Protein Language Processing","date":null,"month_inferred_from_arxiv_id":"2024-02","title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"6b376a0abe58a427","mcp_get_code":{"code_sha256":"6b376a0abe58a427"}},{"arxiv_id":"2402.11760","paper":"/paper/reinforcement-learning-as-a-parsimonious","title":"Reinforcement Learning as a Parsimonious Alternative to Prediction Cascades: A Case Study on Image Segmentation","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"scailab/paser","path":"src/pretrain_rl.py","file_url":"https://github.com/scailab/paser/blob/HEAD/src/pretrain_rl.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"10221f7ecf373762","mcp_get_code":{"code_sha256":"10221f7ecf373762"}},{"arxiv_id":"2402.08573","paper":"/paper/two-tales-of-single-phase-contrastive-hebbian","title":"Two Tales of Single-Phase Contrastive Hebbian Learning","date":"2024-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Rasmuskh/dualprop_icml_2024","path":"src/training_utils.py","file_url":"https://github.com/Rasmuskh/dualprop_icml_2024/blob/HEAD/src/training_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9a9fdb229d44e628","mcp_get_code":{"code_sha256":"9a9fdb229d44e628"}},{"arxiv_id":"2401.13296","paper":"/paper/visual-objectification-in-films-towards-a-new","title":"Visual Objectification in Films: Towards a New AI Task for Video Interpretation","date":"2024-01-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"husky-helen/ObyGaze12","path":"ConceptActivationVector/model/utils_evaluate_todelete.py","file_url":"https://github.com/husky-helen/ObyGaze12/blob/HEAD/ConceptActivationVector/model/utils_evaluate_todelete.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"cb36ea821f385e31","mcp_get_code":{"code_sha256":"cb36ea821f385e31"}},{"arxiv_id":"2401.10768","paper":"/paper/mitigating-hallucinations-of-large-language","title":"Knowledge Verification to Nip Hallucination in the Bud","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fanqiwan/KCA","path":"eval/gpt_judge/gen_summary.py","file_url":"https://github.com/fanqiwan/KCA/blob/HEAD/eval/gpt_judge/gen_summary.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7f0044e5a93e33e2","mcp_get_code":{"code_sha256":"7f0044e5a93e33e2"}},{"arxiv_id":"2401.10065","paper":"/paper/code-prompting-elicits-conditional-reasoning","title":"Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMs","date":"2024-01-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ukplab/arxiv2024-conditional-reasoning-llms","path":"src/conditionalqa/evaluation.py","file_url":"https://github.com/ukplab/arxiv2024-conditional-reasoning-llms/blob/HEAD/src/conditionalqa/evaluation.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"61322bcb67f876e7","mcp_get_code":{"code_sha256":"61322bcb67f876e7"}},{"arxiv_id":"2401.06121","paper":"/paper/tofu-a-task-of-fictitious-unlearning-for-llms","title":"TOFU: A Task of Fictitious Unlearning for LLMs","date":"2024-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"locuslab/tofu","path":"dataloader.py","file_url":"https://github.com/locuslab/tofu/blob/HEAD/dataloader.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88a4f13abd54a00c","mcp_get_code":{"code_sha256":"88a4f13abd54a00c"}},{"arxiv_id":"2312.11250","paper":"/paper/challenges-in-multi-centric-generalization","title":"Challenges in Multi-centric Generalization: Phase and Step Recognition in Roux-en-Y Gastric Bypass Surgery","date":"2023-12-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"camma-public/multibypass140","path":"util/results_collator.py","file_url":"https://github.com/camma-public/multibypass140/blob/HEAD/util/results_collator.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"926dad3993f1f906","mcp_get_code":{"code_sha256":"926dad3993f1f906"}},{"arxiv_id":"2311.17539","paper":"/paper/the-effects-of-overparameterization-on","title":"Critical Influence of Overparameterization on Sharpness-aware Minimization","date":"2023-11-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"log-postech/sam-overparam","path":"train_utils.py","file_url":"https://github.com/log-postech/sam-overparam/blob/HEAD/train_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2d37a890b45f92e7","mcp_get_code":{"code_sha256":"2d37a890b45f92e7"}},{"arxiv_id":"2311.17107","paper":"/paper/climatex-do-llms-accurately-assess-human","title":"ClimateX: Do LLMs Accurately Assess Human Expert Confidence in Climate Statements?","date":"2023-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rlacombe/climatex","path":"bert_classifier.py","file_url":"https://github.com/rlacombe/climatex/blob/HEAD/bert_classifier.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f2095ce2b7e87881","mcp_get_code":{"code_sha256":"f2095ce2b7e87881"}},{"arxiv_id":"2311.17107","paper":"/paper/climatex-do-llms-accurately-assess-human","title":"ClimateX: Do LLMs Accurately Assess Human Expert Confidence in Climate Statements?","date":"2023-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rlacombe/climatex","path":"roberta_classifier.py","file_url":"https://github.com/rlacombe/climatex/blob/HEAD/roberta_classifier.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"11c668fee86bc4a5","mcp_get_code":{"code_sha256":"11c668fee86bc4a5"}},{"arxiv_id":"2311.15156","paper":"/paper/xtrimogene-an-efficient-and-scalable","title":"xTrimoGene: An Efficient and Scalable Representation Learner for Single-Cell RNA-Seq Data","date":"2023-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"snap-stanford/GEARS","path":"gears/inference.py","file_url":"https://github.com/snap-stanford/GEARS/blob/HEAD/gears/inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d3e54ce67d34ed8f","mcp_get_code":{"code_sha256":"d3e54ce67d34ed8f"}},{"arxiv_id":"2311.13171","paper":"/paper/compeft-compression-for-communicating","title":"ComPEFT: Compression for Communicating Parameter Efficient Updates via Sparsification and Quantization","date":"2023-11-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"prateeky2806/compeft","path":"src/bert_eval.py","file_url":"https://github.com/prateeky2806/compeft/blob/HEAD/src/bert_eval.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"6746178a5f7cbcc1","mcp_get_code":{"code_sha256":"6746178a5f7cbcc1"}},{"arxiv_id":"2311.03998","paper":"/paper/exploring-jiu-jitsu-argumentation-for-writing","title":"Exploring Jiu-Jitsu Argumentation for Writing Peer Review Rebuttals","date":"2023-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ukplab/emnlp2023_jiu_jitsu_argumentation_for_rebuttals","path":"codes/rebuttal_scoring/majority_baseline.py","file_url":"https://github.com/ukplab/emnlp2023_jiu_jitsu_argumentation_for_rebuttals/blob/HEAD/codes/rebuttal_scoring/majority_baseline.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"2da0b9affa56d919","mcp_get_code":{"code_sha256":"2da0b9affa56d919"}},{"arxiv_id":"2311.03998","paper":"/paper/exploring-jiu-jitsu-argumentation-for-writing","title":"Exploring Jiu-Jitsu Argumentation for Writing Peer Review Rebuttals","date":"2023-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ukplab/emnlp2023_jiu_jitsu_argumentation_for_rebuttals","path":"codes/rebuttal_scoring/random_baseline.py","file_url":"https://github.com/ukplab/emnlp2023_jiu_jitsu_argumentation_for_rebuttals/blob/HEAD/codes/rebuttal_scoring/random_baseline.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"ae0ab0da268e92ff","mcp_get_code":{"code_sha256":"ae0ab0da268e92ff"}},{"arxiv_id":"2311.03520","paper":"/paper/brain-networks-and-intelligence-a-graph","title":"Brain Networks and Intelligence: A Graph Neural Network Based Approach to Resting State fMRI Data","date":"2023-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bishalth01/BrainRGIN","path":"hcp_main/main_rgin.py","file_url":"https://github.com/bishalth01/BrainRGIN/blob/HEAD/hcp_main/main_rgin.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4f74458418b094c6","mcp_get_code":{"code_sha256":"4f74458418b094c6"}},{"arxiv_id":"2311.01007","paper":"/paper/effective-human-ai-teams-via-learned-natural-1","title":"Effective Human-AI Teams via Learned Natural Language Rules and Onboarding","date":"2023-11-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"clinicalml/onboarding_human_ai","path":"src/teacher_methods/teacher_human.py","file_url":"https://github.com/clinicalml/onboarding_human_ai/blob/HEAD/src/teacher_methods/teacher_human.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"173ade9e3012230f","mcp_get_code":{"code_sha256":"173ade9e3012230f"}},{"arxiv_id":"2310.18440","paper":"/paper/modeling-legal-reasoning-lm-annotation-at-the","title":"Modeling Legal Reasoning: LM Annotation at the Edge of Human Agreement","date":"2023-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rosthalken/legal-interpretation","path":"train_model.py","file_url":"https://github.com/rosthalken/legal-interpretation/blob/HEAD/train_model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f60597a9de3e6501","mcp_get_code":{"code_sha256":"f60597a9de3e6501"}},{"arxiv_id":"2310.16111","paper":"/paper/locally-differentially-private-document","title":"Locally Differentially Private Document Generation Using Zero Shot Prompting","date":"2023-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"saitejautpala/dp_prompt","path":"attacks/text_attacker_architecture.py","file_url":"https://github.com/saitejautpala/dp_prompt/blob/HEAD/attacks/text_attacker_architecture.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9cd82bb0714b58e3","mcp_get_code":{"code_sha256":"9cd82bb0714b58e3"}},{"arxiv_id":"2310.10899","paper":"/paper/instilling-inductive-biases-with-subnetworks","title":"Instilling Inductive Biases with Subnetworks","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rock-z/instilling-inductiva-bias","path":"vision/resnet_16_class_adapt.py","file_url":"https://github.com/rock-z/instilling-inductiva-bias/blob/HEAD/vision/resnet_16_class_adapt.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8761d7e28afd1067","mcp_get_code":{"code_sha256":"8761d7e28afd1067"}},{"arxiv_id":"2310.10899","paper":"/paper/instilling-inductive-biases-with-subnetworks","title":"Instilling Inductive Biases with Subnetworks","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rock-z/instilling-inductiva-bias","path":"math/ambiguous.py","file_url":"https://github.com/rock-z/instilling-inductiva-bias/blob/HEAD/math/ambiguous.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"76e5fff22429bad6","mcp_get_code":{"code_sha256":"76e5fff22429bad6"}},{"arxiv_id":"2310.10195","paper":"/paper/adalomo-low-memory-optimization-with-adaptive","title":"AdaLomo: Low-memory Optimization with Adaptive Learning Rate","date":"2023-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openlmlab/lomo","path":"lomo/src/train_lomo.py","file_url":"https://github.com/openlmlab/lomo/blob/HEAD/lomo/src/train_lomo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d24f1a0428f74639","mcp_get_code":{"code_sha256":"d24f1a0428f74639"}},{"arxiv_id":"2310.09219","paper":"/paper/kelly-is-a-warm-person-joseph-is-a-role-model","title":"\"Kelly is a Warm Person, Joseph is a Role Model\": Gender Biases in LLM-Generated Reference Letters","date":"2023-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uclanlp/biases-llm-reference-letters","path":"agency_classifier/finetune_bert_bias.py","file_url":"https://github.com/uclanlp/biases-llm-reference-letters/blob/HEAD/agency_classifier/finetune_bert_bias.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1cd818c7ce732b1c","mcp_get_code":{"code_sha256":"1cd818c7ce732b1c"}},{"arxiv_id":"2310.09089","paper":"/paper/qilin-med-multi-stage-knowledge-injection","title":"Qilin-Med: Multi-stage Knowledge Injection Advanced Medical Large Language Model","date":"2023-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"6b376a0abe58a427","mcp_get_code":{"code_sha256":"6b376a0abe58a427"}},{"arxiv_id":"2310.06408","paper":"/paper/humans-and-language-models-diverge-when","title":"Humans and language models diverge when predicting repeating text","date":"2023-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"huthlab/lm-repeating-text","path":"attn_optim.py","file_url":"https://github.com/huthlab/lm-repeating-text/blob/HEAD/attn_optim.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"015bafdc9d9b933b","mcp_get_code":{"code_sha256":"015bafdc9d9b933b"}},{"arxiv_id":"2310.05573","paper":"/paper/odeformer-symbolic-regression-of-dynamical","title":"ODEFormer: Symbolic Regression of Dynamical Systems with Transformers","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sdascoli/odeformer","path":"odeformer/metrics.py","file_url":"https://github.com/sdascoli/odeformer/blob/HEAD/odeformer/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"05834022280c159d","mcp_get_code":{"code_sha256":"05834022280c159d"}},{"arxiv_id":"2310.02743","paper":"/paper/reward-model-ensembles-help-mitigate","title":"Reward Model Ensembles Help Mitigate Overoptimization","date":"2023-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tlc4418/llm_optimization","path":"src/sft/trainer_sft.py","file_url":"https://github.com/tlc4418/llm_optimization/blob/HEAD/src/sft/trainer_sft.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9af050606d9b4cea","mcp_get_code":{"code_sha256":"9af050606d9b4cea"}},{"arxiv_id":"2309.17093","paper":"/paper/prototype-based-aleatoric-uncertainty-1","title":"Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval","date":"2023-09-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leolee99/PAU","path":"metrics.py","file_url":"https://github.com/leolee99/PAU/blob/HEAD/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f45b80d057798fed","mcp_get_code":{"code_sha256":"f45b80d057798fed"}},{"arxiv_id":"2309.10091","paper":"/paper/unified-coarse-to-fine-alignment-for-video","title":"Unified Coarse-to-Fine Alignment for Video-Text Retrieval","date":"2023-09-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Ziyang412/UCoFiA","path":"eval_t2v/metrics.py","file_url":"https://github.com/Ziyang412/UCoFiA/blob/HEAD/eval_t2v/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f45b80d057798fed","mcp_get_code":{"code_sha256":"f45b80d057798fed"}},{"arxiv_id":"2309.06365","paper":"/paper/2309-06365","title":"Cited Text Spans for Citation Text Generation","date":"2023-09-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jacklxc/cts4citationtextgeneration","path":"code/BART_span_generator.py","file_url":"https://github.com/jacklxc/cts4citationtextgeneration/blob/HEAD/code/BART_span_generator.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e494156c9a8b836f","mcp_get_code":{"code_sha256":"e494156c9a8b836f"}},{"arxiv_id":"2308.13418","paper":"/paper/nougat-neural-optical-understanding-for","title":"Nougat: Neural Optical Understanding for Academic Documents","date":"2023-08-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/nougat","path":"nougat/metrics.py","file_url":"https://github.com/facebookresearch/nougat/blob/HEAD/nougat/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5f204ab74a9ee7f3","mcp_get_code":{"code_sha256":"5f204ab74a9ee7f3"}},{"arxiv_id":"2308.11131","paper":"/paper/rella-retrieval-enhanced-large-language","title":"ReLLa: Retrieval-enhanced Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation","date":"2023-08-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lavieenrose365/rella","path":"finetune.py","file_url":"https://github.com/lavieenrose365/rella/blob/HEAD/finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2e09afada03cc9f1","mcp_get_code":{"code_sha256":"2e09afada03cc9f1"}},{"arxiv_id":"2308.09687","paper":"/paper/graph-of-thoughts-solving-elaborate-problems","title":"Graph of Thoughts: Solving Elaborate Problems with Large Language Models","date":"2023-08-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chiral-carbon/kg-for-science","path":"src/eval/metrics.py","file_url":"https://github.com/chiral-carbon/kg-for-science/blob/HEAD/src/eval/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0b0492fbf7c9f038","mcp_get_code":{"code_sha256":"0b0492fbf7c9f038"}},{"arxiv_id":"2308.06733","paper":"/paper/precipitation-nowcasting-with-generative","title":"Precipitation nowcasting with generative diffusion models","date":"2023-08-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fmerizzi/precipitation-nowcasting-with-generative-diffusion-models","path":"utils.py","file_url":"https://github.com/fmerizzi/precipitation-nowcasting-with-generative-diffusion-models/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"868cf1409bd9b333","mcp_get_code":{"code_sha256":"868cf1409bd9b333"}},{"arxiv_id":"2308.06354","paper":"/paper/large-language-models-to-identify-social","title":"Large Language Models to Identify Social Determinants of Health in Electronic Health Records","date":"2023-08-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aim-harvard/sdoh","path":"bert_train_predict.py","file_url":"https://github.com/aim-harvard/sdoh/blob/HEAD/bert_train_predict.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4f3b282aa471ce3b","mcp_get_code":{"code_sha256":"4f3b282aa471ce3b"}},{"arxiv_id":"2307.14623","paper":"/paper/bubbleml-a-multi-physics-dataset-and","title":"BubbleML: A Multi-Physics Dataset and Benchmarks for Machine Learning","date":"2023-07-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hpcforge/bubbleml","path":"sciml/op_lib/metrics.py","file_url":"https://github.com/hpcforge/bubbleml/blob/HEAD/sciml/op_lib/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cd059240f26909e2","mcp_get_code":{"code_sha256":"cd059240f26909e2"}},{"arxiv_id":"2307.07443","paper":"/paper/can-large-language-models-empower-molecular","title":"Can Large Language Models Empower Molecular Property Prediction?","date":"2023-07-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chnq/llm4mol","path":"train_scaff.py","file_url":"https://github.com/chnq/llm4mol/blob/HEAD/train_scaff.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6967374fcda709f8","mcp_get_code":{"code_sha256":"6967374fcda709f8"}},{"arxiv_id":"2307.06104","paper":"/paper/deep-learning-for-dynamic-graphs-models-and","title":"Deep learning for dynamic graphs: models and benchmarks","date":"2023-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gravins/dynamic_graph_benchmark","path":"D-TDG/dyngesn.py","file_url":"https://github.com/gravins/dynamic_graph_benchmark/blob/HEAD/D-TDG/dyngesn.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3f1af57b35ed5f3c","mcp_get_code":{"code_sha256":"3f1af57b35ed5f3c"}},{"arxiv_id":"2307.06082","paper":"/paper/velma-verbalization-embodiment-of-llm-agents","title":"VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View","date":"2023-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"raphael-sch/velma","path":"run_finetune.py","file_url":"https://github.com/raphael-sch/velma/blob/HEAD/run_finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fae6e1aff9803719","mcp_get_code":{"code_sha256":"fae6e1aff9803719"}},{"arxiv_id":"2307.02006","paper":"/paper/pulsar-at-mediqa-sum-2023-large-language","title":"PULSAR at MEDIQA-Sum 2023: Large Language Models Augmented by Synthetic Dialogue Convert Patient Dialogues to Medical Records","date":"2023-07-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuping-wu/pulsar","path":"fine-tune/bionlp2023_finetune.py","file_url":"https://github.com/yuping-wu/pulsar/blob/HEAD/fine-tune/bionlp2023_finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"74b86dabed4a8faf","mcp_get_code":{"code_sha256":"74b86dabed4a8faf"}},{"arxiv_id":"2306.15895","paper":"/paper/large-language-model-as-attributed-training-1","title":"Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Bias","date":"2023-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yueyu1030/attrprompt","path":"train_classifier/plm_model/trainer.py","file_url":"https://github.com/yueyu1030/attrprompt/blob/HEAD/train_classifier/plm_model/trainer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d851686037df7aca","mcp_get_code":{"code_sha256":"d851686037df7aca"}},{"arxiv_id":"2306.11879","paper":"/paper/open-domain-text-evaluation-via-meta","title":"Open-Domain Text Evaluation via Contrastive Distribution Methods","date":"2023-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pluslabnlp/cdm","path":"trainer.py","file_url":"https://github.com/pluslabnlp/cdm/blob/HEAD/trainer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"17fedffff12f40e6","mcp_get_code":{"code_sha256":"17fedffff12f40e6"}},{"arxiv_id":"2306.07111","paper":"/paper/linear-classifier-an-often-forgotten-baseline","title":"Linear Classifier: An Often-Forgotten Baseline for Text Classification","date":"2023-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ASUS-AICS/LibMultiLabel","path":"libmultilabel/linear/metrics.py","file_url":"https://github.com/ASUS-AICS/LibMultiLabel/blob/HEAD/libmultilabel/linear/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"11b1e6d135d352a5","mcp_get_code":{"code_sha256":"11b1e6d135d352a5"}},{"arxiv_id":"2305.19523","paper":"/paper/explanations-as-features-llm-based-features","title":"Harnessing Explanations: LLM-to-LM Interpreter for Enhanced Text-Attributed Graph Representation Learning","date":"2023-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiaoxinHe/TAPE","path":"core/LMs/lm_trainer.py","file_url":"https://github.com/XiaoxinHe/TAPE/blob/HEAD/core/LMs/lm_trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"869b258eb176ffca","mcp_get_code":{"code_sha256":"869b258eb176ffca"}},{"arxiv_id":"2305.17491","paper":"/paper/fermat-an-alternative-to-accuracy-for","title":"FERMAT: An Alternative to Accuracy for Numerical Reasoning","date":"2023-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jasivan/FERMAT","path":"codes/evaluate_from_ckpt.py","file_url":"https://github.com/jasivan/FERMAT/blob/HEAD/codes/evaluate_from_ckpt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d927911a7d756812","mcp_get_code":{"code_sha256":"d927911a7d756812"}},{"arxiv_id":"2305.17491","paper":"/paper/fermat-an-alternative-to-accuracy-for","title":"FERMAT: An Alternative to Accuracy for Numerical Reasoning","date":"2023-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jasivan/FERMAT","path":"codes/evaluate_training.py","file_url":"https://github.com/jasivan/FERMAT/blob/HEAD/codes/evaluate_training.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e5d104e749b6caaa","mcp_get_code":{"code_sha256":"e5d104e749b6caaa"}},{"arxiv_id":"2305.13282","paper":"/paper/is-fine-tuning-needed-pre-trained-language","title":"Is Fine-tuning Needed? Pre-trained Language Models Are Near Perfect for Out-of-Domain Detection","date":"2023-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Uppaal/lm-ood","path":"utils/trainer_utils.py","file_url":"https://github.com/Uppaal/lm-ood/blob/HEAD/utils/trainer_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b43faec17e425ded","mcp_get_code":{"code_sha256":"b43faec17e425ded"}},{"arxiv_id":"2305.13272","paper":"/paper/class-meet-spock-an-education-tutoring","title":"CLASS: A Design Framework for building Intelligent Tutoring Systems based on Learning Science principles","date":"2023-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luffycodes/tutorbot-spock","path":"src/evaluate/evaluate_responses.py","file_url":"https://github.com/luffycodes/tutorbot-spock/blob/HEAD/src/evaluate/evaluate_responses.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"64cf6a8e02e4f0f0","mcp_get_code":{"code_sha256":"64cf6a8e02e4f0f0"}},{"arxiv_id":"2305.09235","paper":"/paper/synthetic-data-real-errors-how-not-to-publish","title":"Synthetic data, real errors: how (not) to publish and use synthetic data","date":"2023-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bvanbreugel/deep_generative_ensemble","path":"DGE_utils.py","file_url":"https://github.com/bvanbreugel/deep_generative_ensemble/blob/HEAD/DGE_utils.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"17a967132aae2f11","mcp_get_code":{"code_sha256":"17a967132aae2f11"}},{"arxiv_id":"2304.08177","paper":"/paper/efficient-and-effective-text-encoding-for","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"6b376a0abe58a427","mcp_get_code":{"code_sha256":"6b376a0abe58a427"}},{"arxiv_id":"2303.10571","paper":"/paper/clip4mc-an-rl-friendly-vision-language-model","title":"Reinforcement Learning Friendly Vision-Language Model for Minecraft","date":"2023-03-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PKU-RL/CLIP4MC","path":"utils/compute_metrics.py","file_url":"https://github.com/PKU-RL/CLIP4MC/blob/HEAD/utils/compute_metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"365e62ad8dd70781","mcp_get_code":{"code_sha256":"365e62ad8dd70781"}},{"arxiv_id":"2302.05210","paper":"/paper/boosting-3d-point-cloud-registration-by","title":"Boosting 3D Point Cloud Registration by Transferring Multi-modality Knowledge","date":null,"month_inferred_from_arxiv_id":"2023-02","title_source":"archive","repo":"phdymz/dbenet","path":"scripts/evaluation_3dmatch.py","file_url":"https://github.com/phdymz/dbenet/blob/HEAD/scripts/evaluation_3dmatch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2c94f69a26e5b14a","mcp_get_code":{"code_sha256":"2c94f69a26e5b14a"}},{"arxiv_id":"2301.04253","paper":"/paper/climabench-a-benchmark-dataset-for-climate","title":"Towards Answering Climate Questionnaires from Unstructured Climate Reports","date":"2023-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"climabench/climabench","path":"finetune.py","file_url":"https://github.com/climabench/climabench/blob/HEAD/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0e02018211d1cae7","mcp_get_code":{"code_sha256":"0e02018211d1cae7"}},{"arxiv_id":"2301.03726","paper":"/paper/neighborhood-regularized-self-training-for","title":"Neighborhood-Regularized Self-Training for Learning with Few Labels","date":"2023-01-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ritaranx/NeST","path":"trainer.py","file_url":"https://github.com/ritaranx/NeST/blob/HEAD/trainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"367872121e21753d","mcp_get_code":{"code_sha256":"367872121e21753d"}},{"arxiv_id":"2301.02074","paper":"/paper/test-of-time-instilling-video-language-models","title":"Test of Time: Instilling Video-Language Models with a Sense of Time","date":"2023-01-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bpiyush/TestOfTime","path":"package/metrics/retrieval.py","file_url":"https://github.com/bpiyush/TestOfTime/blob/HEAD/package/metrics/retrieval.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b717eef2896560b3","mcp_get_code":{"code_sha256":"b717eef2896560b3"}},{"arxiv_id":"2301.00184","paper":"/paper/cap4video-what-can-auxiliary-captions-do-for","title":"Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?","date":"2022-12-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"whwu95/Cap4Video","path":"metrics.py","file_url":"https://github.com/whwu95/Cap4Video/blob/HEAD/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f45b80d057798fed","mcp_get_code":{"code_sha256":"f45b80d057798fed"}},{"arxiv_id":"2211.09623","paper":"/paper/cross-modal-adapter-for-text-video-retrieval","title":"Cross-Modal Adapter for Text-Video Retrieval","date":"2022-11-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leaplabthu/cross-modal-adapter","path":"metrics.py","file_url":"https://github.com/leaplabthu/cross-modal-adapter/blob/HEAD/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f45b80d057798fed","mcp_get_code":{"code_sha256":"f45b80d057798fed"}},{"arxiv_id":"2209.00349","paper":"/paper/flame-free-form-language-based-motion","title":"FLAME: Free-form Language-based Motion Synthesis & Editing","date":"2022-09-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kakaobrain/flame","path":"src/utils/eval_util.py","file_url":"https://github.com/kakaobrain/flame/blob/HEAD/src/utils/eval_util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"538ba2f56aa645b7","mcp_get_code":{"code_sha256":"538ba2f56aa645b7"}},{"arxiv_id":"2206.12088","paper":"/paper/classifying-unstructured-clinical-notes-via","title":"Classifying Unstructured Clinical Notes via Automatic Weak Supervision","date":"2022-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"autonlab/KeyClass","path":"keyclass/utils.py","file_url":"https://github.com/autonlab/KeyClass/blob/HEAD/keyclass/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0f5512a4db9b8c25","mcp_get_code":{"code_sha256":"0f5512a4db9b8c25"}},{"arxiv_id":"2206.00259","paper":"/paper/idani-inference-time-domain-adaptation-via","title":"IDANI: Inference-time Domain Adaptation via Neuron-level Interventions","date":"2022-06-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"technion-cs-nlp/idani","path":"code/fineTuning.py","file_url":"https://github.com/technion-cs-nlp/idani/blob/HEAD/code/fineTuning.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"89e891a1f2418927","mcp_get_code":{"code_sha256":"89e891a1f2418927"}},{"arxiv_id":"2204.08582","paper":"/paper/massive-a-1m-example-multilingual-natural","title":"MASSIVE: A 1M-Example Multilingual Natural Language Understanding Dataset with 51 Typologically-Diverse Languages","date":"2022-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rita-nlp/italic","path":"text_finetuning.py","file_url":"https://github.com/rita-nlp/italic/blob/HEAD/text_finetuning.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"652b541e7a5feac9","mcp_get_code":{"code_sha256":"652b541e7a5feac9"}},{"arxiv_id":"2204.08582","paper":"/paper/massive-a-1m-example-multilingual-natural","title":"MASSIVE: A 1M-Example Multilingual Natural Language Understanding Dataset with 51 Typologically-Diverse Languages","date":"2022-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rita-nlp/italic","path":"text_inference.py","file_url":"https://github.com/rita-nlp/italic/blob/HEAD/text_inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0a2872c4352696b2","mcp_get_code":{"code_sha256":"0a2872c4352696b2"}},{"arxiv_id":"2204.08582","paper":"/paper/massive-a-1m-example-multilingual-natural","title":"MASSIVE: A 1M-Example Multilingual Natural Language Understanding Dataset with 51 Typologically-Diverse Languages","date":"2022-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rita-nlp/italic","path":"utils.py","file_url":"https://github.com/rita-nlp/italic/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f3b2d10b53645633","mcp_get_code":{"code_sha256":"f3b2d10b53645633"}},{"arxiv_id":"2204.02874","paper":"/paper/eclipse-efficient-long-range-video-retrieval","title":"ECLIPSE: Efficient Long-range Video Retrieval using Sight and Sound","date":"2022-04-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"GenjiB/ECLIPSE","path":"metrics.py","file_url":"https://github.com/GenjiB/ECLIPSE/blob/HEAD/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b05823d3dd0bdd19","mcp_get_code":{"code_sha256":"b05823d3dd0bdd19"}},{"arxiv_id":"2203.12990","paper":"/paper/generating-scientific-claims-for-zero-shot-1","title":"Generating Scientific Claims for Zero-Shot Scientific Fact Checking","date":"2022-03-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"allenai/scientific-claim-generation","path":"archive/run_bart_claim_generation.py","file_url":"https://github.com/allenai/scientific-claim-generation/blob/HEAD/archive/run_bart_claim_generation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e24368339d19b559","mcp_get_code":{"code_sha256":"e24368339d19b559"}},{"arxiv_id":"2203.12335","paper":"/paper/dr-vic-decomposition-and-reasoning-for-video","title":"DR.VIC: Decomposition and Reasoning for Video Individual Counting","date":"2022-03-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"taohan10200/DRNet","path":"model/VIC.py","file_url":"https://github.com/taohan10200/DRNet/blob/HEAD/model/VIC.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1af15b82e4054ad3","mcp_get_code":{"code_sha256":"1af15b82e4054ad3"}},{"arxiv_id":"2203.04913","paper":"/paper/leveling-down-in-computer-vision-pareto","title":"Leveling Down in Computer Vision: Pareto Inefficiencies in Fair Deep Classifiers","date":"2022-03-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"oxfordinternetinstitute/oxonfair","path":"src/oxonfair/learners/fair_frontier.py","file_url":"https://github.com/oxfordinternetinstitute/oxonfair/blob/HEAD/src/oxonfair/learners/fair_frontier.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"da52ff2f71de7630","mcp_get_code":{"code_sha256":"da52ff2f71de7630"}},{"arxiv_id":"2202.11670","paper":"/paper/wide-mean-field-bayesian-neural-networks","title":"Wide Mean-Field Bayesian Neural Networks Ignore the Data","date":"2022-02-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dtak/wide-bnns-public","path":"scripts/experiment_pytorch.py","file_url":"https://github.com/dtak/wide-bnns-public/blob/HEAD/scripts/experiment_pytorch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"697d6e902861b9c5","mcp_get_code":{"code_sha256":"697d6e902861b9c5"}},{"arxiv_id":"2112.14754","paper":"/paper/2112-14754","title":"Disentanglement and Generalization Under Correlation Shifts","date":"2021-12-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"asteroidhouse/conditional-disentanglement","path":"evaluate_disentanglement.py","file_url":"https://github.com/asteroidhouse/conditional-disentanglement/blob/HEAD/evaluate_disentanglement.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"90939a56c99aa4ab","mcp_get_code":{"code_sha256":"90939a56c99aa4ab"}},{"arxiv_id":"2112.08615","paper":"/paper/commonsense-knowledge-augmented-pretrained-1","title":"Knowledge-Augmented Language Models for Cause-Effect Relation Classification","date":"2021-12-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"phosseini/causal-reasoning","path":"fine_tuning_copa.py","file_url":"https://github.com/phosseini/causal-reasoning/blob/HEAD/fine_tuning_copa.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4aad3142c5f2e529","mcp_get_code":{"code_sha256":"4aad3142c5f2e529"}},{"arxiv_id":"2110.14171","paper":"/paper/diversity-enhanced-active-learning-with","title":"Diversity Enhanced Active Learning with Strictly Proper Scoring Rules","date":"2021-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"davidtw999/bemps","path":"src/data.py","file_url":"https://github.com/davidtw999/bemps/blob/HEAD/src/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"be2ff7666278d157","mcp_get_code":{"code_sha256":"be2ff7666278d157"}},{"arxiv_id":"2110.13475","paper":"/paper/vector-valued-distance-and-gyrocalculus-on","title":"Vector-valued Distance and Gyrocalculus on the Space of Symmetric Positive Definite Matrices","date":"2021-10-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fedelopez77/gyrospd","path":"gyrospd/utils.py","file_url":"https://github.com/fedelopez77/gyrospd/blob/HEAD/gyrospd/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"556b32d9329475dc","mcp_get_code":{"code_sha256":"556b32d9329475dc"}},{"arxiv_id":"2110.08182","paper":"/paper/the-world-of-an-octopus-how-reporting-bias","title":"The World of an Octopus: How Reporting Bias Influences a Language Model's Perception of Color","date":"2021-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nala-cub/coda","path":"projects/coda/probing/_src/metrics.py","file_url":"https://github.com/nala-cub/coda/blob/HEAD/projects/coda/probing/_src/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"49aa65398fbd515b","mcp_get_code":{"code_sha256":"49aa65398fbd515b"}},{"arxiv_id":"2110.06884","paper":"/paper/conditionalqa-a-complex-reading-comprehension","title":"ConditionalQA: A Complex Reading Comprehension Dataset with Conditional Answers","date":"2021-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haitian-sun/conditionalqa","path":"evaluate.py","file_url":"https://github.com/haitian-sun/conditionalqa/blob/HEAD/evaluate.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4f18a3f6971da6c1","mcp_get_code":{"code_sha256":"4f18a3f6971da6c1"}},{"arxiv_id":"2109.02221","paper":"/paper/nearest-neighbour-few-shot-learning-for-cross","title":"Nearest Neighbour Few-Shot Learning for Cross-lingual Classification","date":"2021-09-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amazon-research/nearest-neighbor-crosslingual-classification","path":"processors.py","file_url":"https://github.com/amazon-research/nearest-neighbor-crosslingual-classification/blob/HEAD/processors.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"09bfd5739bdc89aa","mcp_get_code":{"code_sha256":"09bfd5739bdc89aa"}},{"arxiv_id":"2106.09889","paper":"/paper/gem-a-general-evaluation-benchmark-for","title":"GEM: A General Evaluation Benchmark for Multimodal Tasks","date":"2021-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/GEM","path":"evaluation/metric-retrieval.py","file_url":"https://github.com/microsoft/GEM/blob/HEAD/evaluation/metric-retrieval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"593322fdfd62e04e","mcp_get_code":{"code_sha256":"593322fdfd62e04e"}},{"arxiv_id":"2106.03306","paper":"/paper/horopca-hyperbolic-dimensionality-reduction","title":"HoroPCA: Hyperbolic Dimensionality Reduction via Horospherical Projections","date":"2021-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HazyResearch/HoroPCA","path":"learning/pca.py","file_url":"https://github.com/HazyResearch/HoroPCA/blob/HEAD/learning/pca.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8bc9911c8e39f9ef","mcp_get_code":{"code_sha256":"8bc9911c8e39f9ef"}},{"arxiv_id":"2106.01226","paper":"/paper/semi-supervised-semantic-segmentation-with-3","title":"Semi-Supervised Semantic Segmentation with Cross Pseudo Supervision","date":"2021-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"harshm121/m3l","path":"src/semi_supervised/cps.py","file_url":"https://github.com/harshm121/m3l/blob/HEAD/src/semi_supervised/cps.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e74fcb04fd589c71","mcp_get_code":{"code_sha256":"e74fcb04fd589c71"}},{"arxiv_id":"2106.00400","paper":"/paper/shuowen-jiezi-linguistically-informed","title":"Sub-Character Tokenization for Chinese Pretrained Language Models","date":"2021-06-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thunlp/subchartokenization","path":"run_glue.py","file_url":"https://github.com/thunlp/subchartokenization/blob/HEAD/run_glue.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7d7c4b508dbf03cd","mcp_get_code":{"code_sha256":"7d7c4b508dbf03cd"}},{"arxiv_id":"2105.06453","paper":"/paper/episodic-transformer-for-vision-and-language","title":"Episodic Transformer for Vision-and-Language Navigation","date":"2021-05-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alexpashevich/E.T.","path":"alfred/eval/eval_subgoals.py","file_url":"https://github.com/alexpashevich/E.T./blob/HEAD/alfred/eval/eval_subgoals.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"71f2661ddf223250","mcp_get_code":{"code_sha256":"71f2661ddf223250"}},{"arxiv_id":"2104.07644","paper":"/paper/explagraphs-an-explanation-graph-generation","title":"ExplaGraphs: An Explanation Graph Generation Task for Structured Commonsense Reasoning","date":"2021-04-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"swarnaHub/ExplaGraphs","path":"src/utils_stance_pred.py","file_url":"https://github.com/swarnaHub/ExplaGraphs/blob/HEAD/src/utils_stance_pred.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"efbd217b0bee225c","mcp_get_code":{"code_sha256":"efbd217b0bee225c"}},{"arxiv_id":"2104.07644","paper":"/paper/explagraphs-an-explanation-graph-generation","title":"ExplaGraphs: An Explanation Graph Generation Task for Structured Commonsense Reasoning","date":"2021-04-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"swarnaHub/ExplaGraphs","path":"structured_model/utils_relation.py","file_url":"https://github.com/swarnaHub/ExplaGraphs/blob/HEAD/structured_model/utils_relation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4d0f185176bdada1","mcp_get_code":{"code_sha256":"4d0f185176bdada1"}},{"arxiv_id":"2010.12762","paper":"/paper/measuring-association-between-labels-and-free","title":"Measuring Association Between Labels and Free-Text Rationales","date":"2020-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"allenai/label_rationale_association","path":"custom_args.py","file_url":"https://github.com/allenai/label_rationale_association/blob/HEAD/custom_args.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"eee30537df912254","mcp_get_code":{"code_sha256":"eee30537df912254"}},{"arxiv_id":"2010.07835","paper":"/paper/fine-tuning-pre-trained-language-model-with","title":"Fine-Tuning Pre-trained Language Model with Weak Supervision: A Contrastive-Regularized Self-Training Approach","date":"2020-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yueyu1030/COSINE","path":"utils.py","file_url":"https://github.com/yueyu1030/COSINE/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"643c03f907f7dc7c","mcp_get_code":{"code_sha256":"643c03f907f7dc7c"}},{"arxiv_id":"2010.02830","paper":"/paper/prover-proof-generation-for-interpretable","title":"PRover: Proof Generation for Interpretable Reasoning over Rules","date":"2020-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"swarnaHub/PRover","path":"utils.py","file_url":"https://github.com/swarnaHub/PRover/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"edca3480666257aa","mcp_get_code":{"code_sha256":"edca3480666257aa"}},{"arxiv_id":"2010.01239","paper":"/paper/mining-knowledge-for-natural-language","title":"Mining Knowledge for Natural Language Inference from Wikipedia Categories","date":"2020-10-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZeweiChu/WikiNLI","path":"code/utils.py","file_url":"https://github.com/ZeweiChu/WikiNLI/blob/HEAD/code/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC0-1.0","inline_ok":true,"code_sha256_prefix":"007f5e0e593deb75","mcp_get_code":{"code_sha256":"007f5e0e593deb75"}},{"arxiv_id":"2009.05160","paper":"/paper/rank-over-class-the-untapped-potential-of","title":"Rank over Class: The Untapped Potential of Ranking in Natural Language Processing","date":"2020-09-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"atapour/rank-over-class","path":"src/utils.py","file_url":"https://github.com/atapour/rank-over-class/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"32ea450e5e5fea63","mcp_get_code":{"code_sha256":"32ea450e5e5fea63"}},{"arxiv_id":"2006.04697","paper":"/paper/supervised-whole-dag-causal-discovery","title":"Supervised Whole DAG Causal Discovery","date":"2020-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lihebi/DAG-EQ","path":"python/baseline_common.py","file_url":"https://github.com/lihebi/DAG-EQ/blob/HEAD/python/baseline_common.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"689864632fc9f4c4","mcp_get_code":{"code_sha256":"689864632fc9f4c4"}},{"arxiv_id":"2005.00547","paper":"/paper/goemotions-a-dataset-of-fine-grained-emotions","title":"GoEmotions: A Dataset of Fine-Grained Emotions","date":"2020-05-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"monologg/GoEmotions-pytorch","path":"utils.py","file_url":"https://github.com/monologg/GoEmotions-pytorch/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9e482b3b0bc433ce","mcp_get_code":{"code_sha256":"9e482b3b0bc433ce"}},{"arxiv_id":"2004.05704","paper":"/paper/a-negative-case-analysis-of-visual-grounding","title":"Visual Grounding Methods for VQA are Working for the Wrong Reasons!","date":"2020-04-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"erobic/negative_analysis_of_grounding","path":"analysis/analysis_by_answer_type.py","file_url":"https://github.com/erobic/negative_analysis_of_grounding/blob/HEAD/analysis/analysis_by_answer_type.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"aab971a1fea7d955","mcp_get_code":{"code_sha256":"aab971a1fea7d955"}},{"arxiv_id":"2001.01469","paper":"/paper/tablenet-deep-learning-model-for-end-to-end","title":"TableNet: Deep Learning model for end-to-end Table detection and Tabular data extraction from Scanned Document Images","date":"2020-01-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"asagar60/TableNet-pytorch","path":"Training/utils.py","file_url":"https://github.com/asagar60/TableNet-pytorch/blob/HEAD/Training/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aef084a45f2bad60","mcp_get_code":{"code_sha256":"aef084a45f2bad60"}},{"arxiv_id":"1912.06430","paper":"/paper/end-to-end-learning-of-visual-representations","title":"End-to-End Learning of Visual Representations from Uncurated Instructional Videos","date":"2019-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"antoine77340/milnce_howto100m","path":"metrics.py","file_url":"https://github.com/antoine77340/milnce_howto100m/blob/HEAD/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d59b4b3c004c31ff","mcp_get_code":{"code_sha256":"d59b4b3c004c31ff"}},{"arxiv_id":"1910.10683","paper":"/paper/exploring-the-limits-of-transfer-learning","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","date":"2019-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shivamraval98/multitask-t5_ae","path":"src/train_baseline.py","file_url":"https://github.com/shivamraval98/multitask-t5_ae/blob/HEAD/src/train_baseline.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6a4d95581e554907","mcp_get_code":{"code_sha256":"6a4d95581e554907"}},{"arxiv_id":"1909.03193","paper":"/paper/kg-bert-bert-for-knowledge-graph-completion","title":"KG-BERT: BERT for Knowledge Graph Completion","date":"2019-09-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yao8839836/kg-bert","path":"run_bert_triple_classifier.py","file_url":"https://github.com/yao8839836/kg-bert/blob/HEAD/run_bert_triple_classifier.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"557602bbd1a774e3","mcp_get_code":{"code_sha256":"557602bbd1a774e3"}},{"arxiv_id":"1909.00505","paper":"/paper/commonsense-knowledge-mining-from-pretrained","title":"Commonsense Knowledge Mining from Pretrained Models","date":"2019-09-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"557602bbd1a774e3","mcp_get_code":{"code_sha256":"557602bbd1a774e3"}},{"arxiv_id":"1907.04138","paper":"/paper/characterization-of-overlap-in-observational","title":"Characterization of Overlap in Observational Studies","date":"2019-07-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"clinicalml/overlap-code","path":"overrule/utils.py","file_url":"https://github.com/clinicalml/overlap-code/blob/HEAD/overrule/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ff46735c2f67ac5e","mcp_get_code":{"code_sha256":"ff46735c2f67ac5e"}},{"arxiv_id":"1905.08284","paper":"/paper/enriching-pre-trained-language-model-with","title":"Enriching Pre-trained Language Model with Entity Information for Relation Classification","date":"2019-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chielingyueh/anaphora_resolution_chemical_patents","path":"utils.py","file_url":"https://github.com/chielingyueh/anaphora_resolution_chemical_patents/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77ec489744adb0c1","mcp_get_code":{"code_sha256":"77ec489744adb0c1"}},{"arxiv_id":"1905.05583","paper":"/paper/how-to-fine-tune-bert-for-text-classification","title":"How to Fine-Tune BERT for Text Classification?","date":"2019-05-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"soarsmu/BiasFinder","path":"codes/fine-tuning/fine_tune.py","file_url":"https://github.com/soarsmu/BiasFinder/blob/HEAD/codes/fine-tuning/fine_tune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4e3b097142759615","mcp_get_code":{"code_sha256":"4e3b097142759615"}},{"arxiv_id":"1808.02559","paper":"/paper/a-joint-sequence-fusion-model-for-video","title":"A Joint Sequence Fusion Model for Video Question Answering and Retrieval","date":"2018-08-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"antoine77340/howto100m","path":"metrics.py","file_url":"https://github.com/antoine77340/howto100m/blob/HEAD/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d59b4b3c004c31ff","mcp_get_code":{"code_sha256":"d59b4b3c004c31ff"}},{"arxiv_id":"1710.11438","paper":"/paper/learning-neural-representations-of-human","title":"Learning Neural Representations of Human Cognition across Many fMRI Studies","date":"2017-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"arthurmensch/cogspaces","path":"cogspaces/utils.py","file_url":"https://github.com/arthurmensch/cogspaces/blob/HEAD/cogspaces/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-2-Clause","inline_ok":true,"code_sha256_prefix":"c93e9934405404a7","mcp_get_code":{"code_sha256":"c93e9934405404a7"}},{"arxiv_id":"1510.01784","paper":"/paper/vbpr-visual-bayesian-personalized-ranking","title":"VBPR: Visual Bayesian Personalized Ranking from Implicit Feedback","date":"2015-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jchanxtarov/vbpr","path":"src/utils/metrics.py","file_url":"https://github.com/jchanxtarov/vbpr/blob/HEAD/src/utils/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f0b3399bc691065c","mcp_get_code":{"code_sha256":"f0b3399bc691065c"}},{"arxiv_id":"1509.01626","paper":"/paper/character-level-convolutional-networks-for","title":"Character-level Convolutional Networks for Text Classification","date":"2015-09-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZeweiChu/NatCat","path":"code/utils.py","file_url":"https://github.com/ZeweiChu/NatCat/blob/HEAD/code/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC0-1.0","inline_ok":true,"code_sha256_prefix":"8eaa3c45016e8715","mcp_get_code":{"code_sha256":"8eaa3c45016e8715"}},{"arxiv_id":"1505.04597","paper":"/paper/u-net-convolutional-networks-for-biomedical","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","date":"2015-05-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LucaHermes/graph-unet-traffic-prediction","path":"models/unet.py","file_url":"https://github.com/LucaHermes/graph-unet-traffic-prediction/blob/HEAD/models/unet.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e7f2313251ab31d3","mcp_get_code":{"code_sha256":"e7f2313251ab31d3"}},{"arxiv_id":"1205.2618","paper":"/paper/bpr-bayesian-personalized-ranking-from","title":"BPR: Bayesian Personalized Ranking from Implicit Feedback","date":"2012-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jchanxtarov/BPRMF","path":"src/utils/metrics.py","file_url":"https://github.com/jchanxtarov/BPRMF/blob/HEAD/src/utils/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"73699d47e9c0ff00","mcp_get_code":{"code_sha256":"73699d47e9c0ff00"}},{"arxiv_id":"Diao_UniPT_Universal_Parallel_Tuning_for_Transfer_Learning_with_Efficient_Parameter_CVPR_2024_paper","paper":null,"title":"arXiv:Diao_UniPT_Universal_Parallel_Tuning_for_Transfer_Learning_with_Efficient_Parameter_CVPR_2024_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Paranioar/UniPT","path":"CLIP4Clip/metrics.py","file_url":"https://github.com/Paranioar/UniPT/blob/HEAD/CLIP4Clip/metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f45b80d057798fed","mcp_get_code":{"code_sha256":"f45b80d057798fed"}},{"arxiv_id":"2025.findings-acl.949","paper":null,"title":"arXiv:2025.findings-acl.949","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"renjie3/GRUN","path":"baseline/dataloader.py","file_url":"https://github.com/renjie3/GRUN/blob/HEAD/baseline/dataloader.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88a4f13abd54a00c","mcp_get_code":{"code_sha256":"88a4f13abd54a00c"}},{"arxiv_id":"2025.emnlp-industry.190","paper":null,"title":"arXiv:2025.emnlp-industry.190","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"ismail31416/CAPSTONE","path":"capstone/eval/metrics.py","file_url":"https://github.com/ismail31416/CAPSTONE/blob/HEAD/capstone/eval/metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"895ae57202728a3e","mcp_get_code":{"code_sha256":"895ae57202728a3e"}},{"arxiv_id":"2024.findings-naacl.117","paper":null,"title":"arXiv:2024.findings-naacl.117","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"qqplot/dcpmi","path":"utils/utils.py","file_url":"https://github.com/qqplot/dcpmi/blob/HEAD/utils/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c773b22260eaa44e","mcp_get_code":{"code_sha256":"c773b22260eaa44e"}},{"arxiv_id":"2024.findings-acl.742","paper":null,"title":"arXiv:2024.findings-acl.742","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"OpenLMLab/LOMO","path":"lomo/src/train_lomo.py","file_url":"https://github.com/OpenLMLab/LOMO/blob/HEAD/lomo/src/train_lomo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d24f1a0428f74639","mcp_get_code":{"code_sha256":"d24f1a0428f74639"}},{"arxiv_id":"2023.findings-emnlp.566","paper":null,"title":"arXiv:2023.findings-emnlp.566","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"SaitejaUtpala/dp_prompt","path":"attacks/text_attacker_architecture.py","file_url":"https://github.com/SaitejaUtpala/dp_prompt/blob/HEAD/attacks/text_attacker_architecture.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9cd82bb0714b58e3","mcp_get_code":{"code_sha256":"9cd82bb0714b58e3"}},{"arxiv_id":"2022.findings-emnlp.174","paper":null,"title":"arXiv:2022.findings-emnlp.174","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"subercui/CodeExp","path":"code2text/eval/ml_metrics.py","file_url":"https://github.com/subercui/CodeExp/blob/HEAD/code2text/eval/ml_metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1be88a148135ec13","mcp_get_code":{"code_sha256":"1be88a148135ec13"}},{"arxiv_id":"2022.findings-emnlp.174","paper":null,"title":"arXiv:2022.findings-emnlp.174","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"subercui/CodeExp","path":"code2text/eval/ml_metrics_step2.py","file_url":"https://github.com/subercui/CodeExp/blob/HEAD/code2text/eval/ml_metrics_step2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b34b4467b9b87ef8","mcp_get_code":{"code_sha256":"b34b4467b9b87ef8"}}]}