{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/load-json","entry":"load_json","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":344,"n_papers_ran":171,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":290,"n_samples_ran":132,"n_samples_fingerprinted":4,"n_places":365,"n_places_pointer_only":126,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":37,"ran_fixture":0,"ran":95,"unverified":158},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.12735","paper":"/paper/arxiv-2609-12735","title":"Physics-Guided Synthetic High-Frequency Ultrasound Generation for Skin Layer Segmentation","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"Finn-02/synthetic-hfus-skin-layer-segmentation","path":"code/segablation/result_io.py","file_url":"https://github.com/Finn-02/synthetic-hfus-skin-layer-segmentation/blob/HEAD/code/segablation/result_io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"552dcbc7016953db","mcp_get_code":{"code_sha256":"552dcbc7016953db"}},{"arxiv_id":"2609.04105","paper":"/paper/arxiv-2609-04105","title":"Hardware-Aware FP4 FlashAttention-4","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"MrHuff/fp4-fa4","path":"results/fp4_fa4_b300_tuning_20260802/build_summary.py","file_url":"https://github.com/MrHuff/fp4-fa4/blob/HEAD/results/fp4_fa4_b300_tuning_20260802/build_summary.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cf9fc9656dfc42dd","mcp_get_code":{"code_sha256":"cf9fc9656dfc42dd"}},{"arxiv_id":"2609.03629","paper":"/paper/arxiv-2609-03629","title":"EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"HiDream-ai/EraseSAE","path":"configs/config_loader.py","file_url":"https://github.com/HiDream-ai/EraseSAE/blob/HEAD/configs/config_loader.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30180de1929a7196","mcp_get_code":{"code_sha256":"30180de1929a7196"}},{"arxiv_id":"2609.00845","paper":"/paper/arxiv-2609-00845","title":"Towards Generalizable Visually Grounded Exploration of Household Devices","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"BITHLP/VGEBench","path":"bench_close.py","file_url":"https://github.com/BITHLP/VGEBench/blob/HEAD/bench_close.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a0c7393409fd0be9","mcp_get_code":{"code_sha256":"a0c7393409fd0be9"}},{"arxiv_id":"2609.00728","paper":"/paper/arxiv-2609-00728","title":"SOVER: Formal Certification of Optimization Reformulations via LLM-Assisted SMT Verification","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"baranwa2/SOVER","path":"code/Sover_solver_final.py","file_url":"https://github.com/baranwa2/SOVER/blob/HEAD/code/Sover_solver_final.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"b39e419911556004","mcp_get_code":{"code_sha256":"b39e419911556004"}},{"arxiv_id":"2609.00621","paper":"/paper/arxiv-2609-00621","title":"Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"yuntian-group/cdsep","path":"experiments/fill_paper_tables.py","file_url":"https://github.com/yuntian-group/cdsep/blob/HEAD/experiments/fill_paper_tables.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1c44cf41ee922d18","mcp_get_code":{"code_sha256":"1c44cf41ee922d18"}},{"arxiv_id":"2609.00177","paper":"/paper/arxiv-2609-00177","title":"Do General NLP Embeddings Capture Ontological Reasoning?","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"sciknoworg/AVA","path":"src/utils.py","file_url":"https://github.com/sciknoworg/AVA/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2fbbe01c3721715d","mcp_get_code":{"code_sha256":"2fbbe01c3721715d"}},{"arxiv_id":"2608.30978","paper":"/paper/arxiv-2608-30978","title":"Sparse Competition during Training For the Emergence of Specialized Modules","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"BabaVegato/Minimal-SCM","path":"scm/figures.py","file_url":"https://github.com/BabaVegato/Minimal-SCM/blob/HEAD/scm/figures.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e7bb42db6987f3a4","mcp_get_code":{"code_sha256":"e7bb42db6987f3a4"}},{"arxiv_id":"2608.30156","paper":"/paper/arxiv-2608-30156","title":"Reactivating Test-Time Scaling for Plane Geometry Problem Solving","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"Jason8Kang/ReTTS-PGPS","path":"src/retts_pgp/eval/cg_mte.py","file_url":"https://github.com/Jason8Kang/ReTTS-PGPS/blob/HEAD/src/retts_pgp/eval/cg_mte.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"81fcd61c6366767c","mcp_get_code":{"code_sha256":"81fcd61c6366767c"}},{"arxiv_id":"2608.29632","paper":"/paper/arxiv-2608-29632","title":"InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed Information","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"kmsgk0/InteractBench","path":"evaluate.py","file_url":"https://github.com/kmsgk0/InteractBench/blob/HEAD/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4c96c8ad1727f8e9","mcp_get_code":{"code_sha256":"4c96c8ad1727f8e9"}},{"arxiv_id":"2608.24033","paper":"/paper/arxiv-2608-24033","title":"ChorusTIC: Training-Free Multivariate Time Series Classification via Chorus In-Context Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"fangjuntao/ChorusTIC","path":"src/chorustic/model/loading.py","file_url":"https://github.com/fangjuntao/ChorusTIC/blob/HEAD/src/chorustic/model/loading.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3dae1e0ffba39de6","mcp_get_code":{"code_sha256":"3dae1e0ffba39de6"}},{"arxiv_id":"2608.21252","paper":"/paper/arxiv-2608-21252","title":"EnSI-RAG: Entity-Structure-Indexed Retrieval-Augmented Generation for Long-Document Question Answering","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"RamonMeng/EnSI-RAG","path":"ensi-rag-loong-eval/ensi_loong/core/legal_passages.py","file_url":"https://github.com/RamonMeng/EnSI-RAG/blob/HEAD/ensi-rag-loong-eval/ensi_loong/core/legal_passages.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"70dc1e864dd30ccc","mcp_get_code":{"code_sha256":"70dc1e864dd30ccc"}},{"arxiv_id":"2608.19181","paper":"/paper/arxiv-2608-19181","title":"Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"SolereZhang/GC-OPD","path":"evaluation/aggregate_main_table.py","file_url":"https://github.com/SolereZhang/GC-OPD/blob/HEAD/evaluation/aggregate_main_table.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5c2ad610574cbda7","mcp_get_code":{"code_sha256":"5c2ad610574cbda7"}},{"arxiv_id":"2608.14636","paper":"/paper/arxiv-2608-14636","title":"Fractional Optimizers Meet Fractal Activation Functions: An Empirical Study of Multi-Scale Optimization in Neural Networks","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"Raubkatz/FractalAndFractional2026","path":"A_03_analyze_himmelblau.py","file_url":"https://github.com/Raubkatz/FractalAndFractional2026/blob/HEAD/A_03_analyze_himmelblau.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"4d82a982fa751f10","mcp_get_code":{"code_sha256":"4d82a982fa751f10"}},{"arxiv_id":"2608.13607","paper":"/paper/arxiv-2608-13607","title":"No Universal Signal Predicts Sample-Level LLM Regression under Version Updates","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"jiashengsally/llm-regression-signals","path":"analysis/summarize_results.py","file_url":"https://github.com/jiashengsally/llm-regression-signals/blob/HEAD/analysis/summarize_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a1f8a0f919f48ad5","mcp_get_code":{"code_sha256":"a1f8a0f919f48ad5"}},{"arxiv_id":"2608.08212","paper":"/paper/arxiv-2608-08212","title":"Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"PeiYangLiu/icl-em-format-control","path":"run_role_metadata_control.py","file_url":"https://github.com/PeiYangLiu/icl-em-format-control/blob/HEAD/run_role_metadata_control.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c58f6281390f6e07","mcp_get_code":{"code_sha256":"c58f6281390f6e07"}},{"arxiv_id":"2608.03467","paper":"/paper/arxiv-2608-03467","title":"When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"CzZ12/When-Correct-Solutions-Repeat-Rarity-Aware-Credit-Redistribution-for-GRPO","path":"analyze_mechanism.py","file_url":"https://github.com/CzZ12/When-Correct-Solutions-Repeat-Rarity-Aware-Credit-Redistribution-for-GRPO/blob/HEAD/analyze_mechanism.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6d732572d6191ed4","mcp_get_code":{"code_sha256":"6d732572d6191ed4"}},{"arxiv_id":"2607.28439","paper":"/paper/arxiv-2607-28439","title":"Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"Wuzheng02/ESPP","path":"scoring_pipeline/common.py","file_url":"https://github.com/Wuzheng02/ESPP/blob/HEAD/scoring_pipeline/common.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7bb49539f1127719","mcp_get_code":{"code_sha256":"7bb49539f1127719"}},{"arxiv_id":"2607.19913","paper":"/paper/arxiv-2607-19913","title":"JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"xiongyuaay/JANUS","path":"eval_framework_online/annotate_final_outputs.py","file_url":"https://github.com/xiongyuaay/JANUS/blob/HEAD/eval_framework_online/annotate_final_outputs.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a145434950c05a50","mcp_get_code":{"code_sha256":"a145434950c05a50"}},{"arxiv_id":"2607.19312","paper":"/paper/arxiv-2607-19312","title":"Staypoint Detection from Noisy Trajectory Data [Experiment Paper]","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"amirih/staypoint","path":"code/utils.py","file_url":"https://github.com/amirih/staypoint/blob/HEAD/code/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2607.17653","paper":"/paper/arxiv-2607-17653","title":"LFM: Leveraging Foundation Models for Source-Free Universal Domain Adaptation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"iamjingli/LFM","path":"train_target.py","file_url":"https://github.com/iamjingli/LFM/blob/HEAD/train_target.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1069918b276d2855","mcp_get_code":{"code_sha256":"1069918b276d2855"}},{"arxiv_id":"2607.13591","paper":"/paper/arxiv-2607-13591","title":"Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"ericjiang18/MemCon","path":"mas/utils.py","file_url":"https://github.com/ericjiang18/MemCon/blob/HEAD/mas/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fb7d225e5f4b88c5","mcp_get_code":{"code_sha256":"fb7d225e5f4b88c5"}},{"arxiv_id":"2607.12166","paper":"/paper/arxiv-2607-12166","title":"From Geometric Recovery to Causal Validation: A Reproducible Audit of Sparse Autoencoder Features, from Superposition Geometry to Causal Inertness","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"mohamed-bal/sae-causal-audit","path":"src/sae_causal_audit/report.py","file_url":"https://github.com/mohamed-bal/sae-causal-audit/blob/HEAD/src/sae_causal_audit/report.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fe76107a48f0807c","mcp_get_code":{"code_sha256":"fe76107a48f0807c"}},{"arxiv_id":"2607.04735","paper":"/paper/arxiv-2607-04735","title":"Identifiability of Relational Queries in Multi-View Pretraining","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"danielhz/query-identifiability","path":"analysis/export_pgfdata.py","file_url":"https://github.com/danielhz/query-identifiability/blob/HEAD/analysis/export_pgfdata.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"29244bb954637e6f","mcp_get_code":{"code_sha256":"29244bb954637e6f"}},{"arxiv_id":"2606.29920","paper":"/paper/arxiv-2606-29920","title":"Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"THU-KEG/RuVerBench","path":"code/main_leaderboard/compute_main_leaderboard.py","file_url":"https://github.com/THU-KEG/RuVerBench/blob/HEAD/code/main_leaderboard/compute_main_leaderboard.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"d888aa8caa502ac5","mcp_get_code":{"code_sha256":"d888aa8caa502ac5"}},{"arxiv_id":"2606.22325","paper":"/paper/arxiv-2606-22325","title":"All Routes Lead to Collapse","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"parzi-val/all-routes-lead-to-collapse","path":"experiments/calibrate_pstar.py","file_url":"https://github.com/parzi-val/all-routes-lead-to-collapse/blob/HEAD/experiments/calibrate_pstar.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c4557464874373f6","mcp_get_code":{"code_sha256":"c4557464874373f6"}},{"arxiv_id":"2606.19184","paper":"/paper/arxiv-2606-19184","title":"When AUC Misleads: Polarization-Aware Evaluation of Deepfake Detectors under Domain Shift","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"mapooon/SelfBlendedImages","path":"src/utils/funcs.py","file_url":"https://github.com/mapooon/SelfBlendedImages/blob/HEAD/src/utils/funcs.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"b24e1ddfb59f8b53","mcp_get_code":{"code_sha256":"b24e1ddfb59f8b53"}},{"arxiv_id":"2606.16603","paper":"/paper/arxiv-2606-16603","title":"VeriGraph: Towards Verifiable Data-Analytic Agents","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"ignorejjj/VeriGraph","path":"src/inference/run_inference.py","file_url":"https://github.com/ignorejjj/VeriGraph/blob/HEAD/src/inference/run_inference.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"860c94939e40e6cf","mcp_get_code":{"code_sha256":"860c94939e40e6cf"}},{"arxiv_id":"2606.10403","paper":"/paper/arxiv-2606-10403","title":"KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"naver-ai/KCSAT-ML","path":"src/evaluator.py","file_url":"https://github.com/naver-ai/KCSAT-ML/blob/HEAD/src/evaluator.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"88816b951ca46a4d","mcp_get_code":{"code_sha256":"88816b951ca46a4d"}},{"arxiv_id":"2606.10403","paper":"/paper/arxiv-2606-10403","title":"KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"naver-ai/KCSAT-ML","path":"src/generator.py","file_url":"https://github.com/naver-ai/KCSAT-ML/blob/HEAD/src/generator.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"c700c0687c7ab7df","mcp_get_code":{"code_sha256":"c700c0687c7ab7df"}},{"arxiv_id":"2606.06117","paper":"/paper/arxiv-2606-06117","title":"p-adic Bi-Filtrations for Topological Machine Learning on Genomic Sequences","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"MAHI-Group/pVR","path":"make_aux_tables.py","file_url":"https://github.com/MAHI-Group/pVR/blob/HEAD/make_aux_tables.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"388975539a13f8a1","mcp_get_code":{"code_sha256":"388975539a13f8a1"}},{"arxiv_id":"2606.03391","paper":"/paper/arxiv-2606-03391","title":"When Model Merging Breaks Routing: Training-Free Calibration for MoE","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"huangcb01/HARC","path":"src/utils.py","file_url":"https://github.com/huangcb01/HARC/blob/HEAD/src/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4ff854f78fd0c6fc","mcp_get_code":{"code_sha256":"4ff854f78fd0c6fc"}},{"arxiv_id":"2606.00329","paper":"/paper/arxiv-2606-00329","title":"Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"davidmullett/loopzero-paper-public","path":"src/loopzero_paper/benchmarks/recommender/audit_engine_spec.py","file_url":"https://github.com/davidmullett/loopzero-paper-public/blob/HEAD/src/loopzero_paper/benchmarks/recommender/audit_engine_spec.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f7b32649f4ec64b3","mcp_get_code":{"code_sha256":"f7b32649f4ec64b3"}},{"arxiv_id":"2606.00329","paper":"/paper/arxiv-2606-00329","title":"Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"davidmullett/loopzero-paper-public","path":"src/loopzero_paper/benchmarks/recommender/bridge_check.py","file_url":"https://github.com/davidmullett/loopzero-paper-public/blob/HEAD/src/loopzero_paper/benchmarks/recommender/bridge_check.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"eee5a442416d9381","mcp_get_code":{"code_sha256":"eee5a442416d9381"}},{"arxiv_id":"2606.00329","paper":"/paper/arxiv-2606-00329","title":"Benchmarking Recursive-Collapse Warning Claims Under Matched False-Positive Control","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"davidmullett/loopzero-paper-public","path":"src/loopzero_paper/benchmarks/recommender/build_user_episode_manifest.py","file_url":"https://github.com/davidmullett/loopzero-paper-public/blob/HEAD/src/loopzero_paper/benchmarks/recommender/build_user_episode_manifest.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"842e560cd0b69ed7","mcp_get_code":{"code_sha256":"842e560cd0b69ed7"}},{"arxiv_id":"2605.30358","paper":"/paper/arxiv-2605-30358","title":"QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"fuzhenxiao/QASM-Eval","path":"dataset_factory/build_parquet_dataset.py","file_url":"https://github.com/fuzhenxiao/QASM-Eval/blob/HEAD/dataset_factory/build_parquet_dataset.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b60d7699ea0bfa77","mcp_get_code":{"code_sha256":"b60d7699ea0bfa77"}},{"arxiv_id":"2605.28375","paper":"/paper/arxiv-2605-28375","title":"PrionNER: A Named Entity Recognition Dataset for Prion Disease Biomedical Literature","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"daotuanan/PrionNER","path":"code/convert_w2ner_output_to_brat.py","file_url":"https://github.com/daotuanan/PrionNER/blob/HEAD/code/convert_w2ner_output_to_brat.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f5868f251e1785a0","mcp_get_code":{"code_sha256":"f5868f251e1785a0"}},{"arxiv_id":"2605.25816","paper":"/paper/arxiv-2605-25816","title":"Fine-Tuning Over Architectural Complexity: Broad-Coverage PII Detection on PIIBench with DeBERTa","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"pritesh-2711/pii-bench","path":"compile_comparative_results.py","file_url":"https://github.com/pritesh-2711/pii-bench/blob/HEAD/compile_comparative_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0e23ecb91603580c","mcp_get_code":{"code_sha256":"0e23ecb91603580c"}},{"arxiv_id":"2605.19677","paper":"/paper/arxiv-2605-19677","title":"Agentic Discovery of Cryomicroneedle Formulations","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"baitmeister/ML-for-CryoMN","path":"src/06_evaluation_explainability/stage_r2_predicted_vs_actual.py","file_url":"https://github.com/baitmeister/ML-for-CryoMN/blob/HEAD/src/06_evaluation_explainability/stage_r2_predicted_vs_actual.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"877863db38b995d5","mcp_get_code":{"code_sha256":"877863db38b995d5"}},{"arxiv_id":"2605.07510","paper":"/paper/arxiv-2605-07510","title":"InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"hbhalpha/InterLV-Search-Bench","path":"download_interlv_images.py","file_url":"https://github.com/hbhalpha/InterLV-Search-Bench/blob/HEAD/download_interlv_images.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4a42f5d93681e5ac","mcp_get_code":{"code_sha256":"4a42f5d93681e5ac"}},{"arxiv_id":"2604.25847","paper":"/paper/arxiv-2604-25847","title":"From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"CHIANGEL/Agora-Opt","path":"code/Agora-Opt/src/debate_memory/augment_memory_from_standalone_runs.py","file_url":"https://github.com/CHIANGEL/Agora-Opt/blob/HEAD/code/Agora-Opt/src/debate_memory/augment_memory_from_standalone_runs.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b85a1300a89a5565","mcp_get_code":{"code_sha256":"b85a1300a89a5565"}},{"arxiv_id":"2604.21454","paper":"/paper/arxiv-2604-21454","title":"Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"ultor1996/reasoning_primitives","path":"src/utils.py","file_url":"https://github.com/ultor1996/reasoning_primitives/blob/HEAD/src/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dffca3653cbd645f","mcp_get_code":{"code_sha256":"dffca3653cbd645f"}},{"arxiv_id":"2604.20043","paper":"/paper/arxiv-2604-20043","title":"TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"Einsam1819/TriEx","path":"experiments/exp2c_intervention/build_global_summary.py","file_url":"https://github.com/Einsam1819/TriEx/blob/HEAD/experiments/exp2c_intervention/build_global_summary.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7698cf0c526ea351","mcp_get_code":{"code_sha256":"7698cf0c526ea351"}},{"arxiv_id":"2604.08554","paper":"/paper/arxiv-2604-08554","title":"Drift and selection in LLM text ecosystems","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"SR123/LLM-text-ecosystems","path":"src/drift_selection/checkpoints.py","file_url":"https://github.com/SR123/LLM-text-ecosystems/blob/HEAD/src/drift_selection/checkpoints.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"84a5e93fb6de5139","mcp_get_code":{"code_sha256":"84a5e93fb6de5139"}},{"arxiv_id":"2604.08499","paper":"/paper/arxiv-2604-08499","title":"PIArena: A Platform for Prompt Injection Evaluation","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"sleeepeer/PIArena","path":"piarena/utils.py","file_url":"https://github.com/sleeepeer/PIArena/blob/HEAD/piarena/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ed4e52fc66e57123","mcp_get_code":{"code_sha256":"ed4e52fc66e57123"}},{"arxiv_id":"2604.08284","paper":"/paper/arxiv-2604-08284","title":"Distributed Multi-Layer Editing for Rule-Level Knowledge in Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"Pepper66/DMLE","path":"run_new.py","file_url":"https://github.com/Pepper66/DMLE/blob/HEAD/run_new.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3e6c1ee7ad23dfb9","mcp_get_code":{"code_sha256":"3e6c1ee7ad23dfb9"}},{"arxiv_id":"2603.26332","paper":"/paper/arxiv-2603-26332","title":"CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"jhCOR/CALRKBench","path":"src/eval_utils.py","file_url":"https://github.com/jhCOR/CALRKBench/blob/HEAD/src/eval_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"057a1b8fac449e37","mcp_get_code":{"code_sha256":"057a1b8fac449e37"}},{"arxiv_id":"2603.23016","paper":"/paper/arxiv-2603-23016","title":"A Sobering Look at Tabular Data Generation via Probabilistic Circuits","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"april-tools/tabpc","path":"src/util.py","file_url":"https://github.com/april-tools/tabpc/blob/HEAD/src/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"eb460e0605ba191e","mcp_get_code":{"code_sha256":"eb460e0605ba191e"}},{"arxiv_id":"2603.22754","paper":"/paper/arxiv-2603-22754","title":"PRISM: A Dual View of LLM Reasoning through Semantic Flow and Latent Computation","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"chili-lab/PRISM","path":"prism_code/aggregate_lib.py","file_url":"https://github.com/chili-lab/PRISM/blob/HEAD/prism_code/aggregate_lib.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e90b784033e597b2","mcp_get_code":{"code_sha256":"e90b784033e597b2"}},{"arxiv_id":"2603.22754","paper":"/paper/arxiv-2603-22754","title":"PRISM: A Dual View of LLM Reasoning through Semantic Flow and Latent Computation","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"chili-lab/PRISM","path":"prism_code/generate_website_prism.py","file_url":"https://github.com/chili-lab/PRISM/blob/HEAD/prism_code/generate_website_prism.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4f3c32f5060f7280","mcp_get_code":{"code_sha256":"4f3c32f5060f7280"}},{"arxiv_id":"2603.20017","paper":"/paper/arxiv-2603-20017","title":"RouterKGQA: Specialized-General Model Routing for Constraint-Aware Knowledge Graph Question Answering","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"Oldcircle/RouterKGQA","path":"components/utils.py","file_url":"https://github.com/Oldcircle/RouterKGQA/blob/HEAD/components/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7277c744809fb106","mcp_get_code":{"code_sha256":"7277c744809fb106"}},{"arxiv_id":"2603.17685","paper":"/paper/arxiv-2603-17685","title":"Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints","date":"2026-03-18","month_inferred_from_arxiv_id":null,"title_source":"syntology","repo":"lzqw/FLAME","path":"analysis/plot_three_obstacle_pullback_results.py","file_url":"https://github.com/lzqw/FLAME/blob/HEAD/analysis/plot_three_obstacle_pullback_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5d7dd03a436d96f8","mcp_get_code":{"code_sha256":"5d7dd03a436d96f8"}},{"arxiv_id":"2603.13331","paper":"/paper/arxiv-2603-13331","title":"The Norm-Separation Delay Law of Grokking: A First-Principles Theory of Delayed Generalization","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"ClevixLab/grokking-norm-separation","path":"make_figures.py","file_url":"https://github.com/ClevixLab/grokking-norm-separation/blob/HEAD/make_figures.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"520f5124d96d2f01","mcp_get_code":{"code_sha256":"520f5124d96d2f01"}},{"arxiv_id":"2603.13331","paper":"/paper/arxiv-2603-13331","title":"The Norm-Separation Delay Law of Grokking: A First-Principles Theory of Delayed Generalization","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"ClevixLab/grokking-norm-separation","path":"make_figures_supplementary.py","file_url":"https://github.com/ClevixLab/grokking-norm-separation/blob/HEAD/make_figures_supplementary.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"bdf9e875347c2f9e","mcp_get_code":{"code_sha256":"bdf9e875347c2f9e"}},{"arxiv_id":"2603.10992","paper":"/paper/arxiv-2603-10992","title":"A Tutorial Review of Bayesian Optimization with Gaussian Processes to Accelerate Stationary Point Searches","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"lode-org/ChemGP","path":"benchmarks/analysis/summarize.py","file_url":"https://github.com/lode-org/ChemGP/blob/HEAD/benchmarks/analysis/summarize.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"eb7369993fa6881a","mcp_get_code":{"code_sha256":"eb7369993fa6881a"}},{"arxiv_id":"2603.09403","paper":"/paper/arxiv-2603-09403","title":"LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"eiglerl/meta-judge","path":"src/metrics/meta_correlation.py","file_url":"https://github.com/eiglerl/meta-judge/blob/HEAD/src/metrics/meta_correlation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b09dbc63544053c4","mcp_get_code":{"code_sha256":"b09dbc63544053c4"}},{"arxiv_id":"2603.06636","paper":"/paper/arxiv-2603-06636","title":"SmartBench: Evaluating LLMs in Smart Homes with Anomalous Device States and Behavioral Contexts","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"horizonsinzqs/SmartBench","path":"experiments/common/public_benchmark.py","file_url":"https://github.com/horizonsinzqs/SmartBench/blob/HEAD/experiments/common/public_benchmark.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10deba8c8561bee","mcp_get_code":{"code_sha256":"f10deba8c8561bee"}},{"arxiv_id":"2603.05308","paper":"/paper/arxiv-2603-05308","title":"Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"ncbi-nlp/Med-V1","path":"utils.py","file_url":"https://github.com/ncbi-nlp/Med-V1/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"d5a6f286ba2e7d66","mcp_get_code":{"code_sha256":"d5a6f286ba2e7d66"}},{"arxiv_id":"2603.01990","paper":"/paper/arxiv-2603-01990","title":"According to Me: Long-Term Personalized Referential Memory QA","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"JingbiaoMei/ATM-Bench","path":"agent_systems/extract_answer.py","file_url":"https://github.com/JingbiaoMei/ATM-Bench/blob/HEAD/agent_systems/extract_answer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e1a33f82f601f5fe","mcp_get_code":{"code_sha256":"e1a33f82f601f5fe"}},{"arxiv_id":"2603.01990","paper":"/paper/arxiv-2603-01990","title":"According to Me: Long-Term Personalized Referential Memory QA","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"JingbiaoMei/ATM-Bench","path":"agent_systems/extract_usage.py","file_url":"https://github.com/JingbiaoMei/ATM-Bench/blob/HEAD/agent_systems/extract_usage.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d0d3faa7cc886a81","mcp_get_code":{"code_sha256":"d0d3faa7cc886a81"}},{"arxiv_id":"2602.08063","paper":"/paper/arxiv-2602-08063","title":"Efficient Distribution Learning with Error Bounds in Wasserstein Distance","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"EduardoFMDCosta/WassersteinDistributionLearning","path":"configs/handlers.py","file_url":"https://github.com/EduardoFMDCosta/WassersteinDistributionLearning/blob/HEAD/configs/handlers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d2160be344f39f25","mcp_get_code":{"code_sha256":"d2160be344f39f25"}},{"arxiv_id":"2602.06181","paper":"/paper/arxiv-2602-06181","title":"Uncertainty Drives Social Bias Changes in Quantized Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"stan-hua/PostTrainingBiasBenchmark","path":"src/utils/json_utils.py","file_url":"https://github.com/stan-hua/PostTrainingBiasBenchmark/blob/HEAD/src/utils/json_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"51658330a10c0e19","mcp_get_code":{"code_sha256":"51658330a10c0e19"}},{"arxiv_id":"2602.03071","paper":"/paper/arxiv-2602-03071","title":"Boundary Optimization for Weakly Supervised Video Grounding","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"sunoh-kim/gbo","path":"gbocnm/utils.py","file_url":"https://github.com/sunoh-kim/gbo/blob/HEAD/gbocnm/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0d7ac1b9deeffa50","mcp_get_code":{"code_sha256":"0d7ac1b9deeffa50"}},{"arxiv_id":"2601.22648","paper":"/paper/arxiv-2601-22648","title":"UCPO: Uncertainty-Aware Policy Optimization","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"xzhouzeng/ucpo","path":"eval/eval_general.py","file_url":"https://github.com/xzhouzeng/ucpo/blob/HEAD/eval/eval_general.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a34eb4a9ee65c5fb","mcp_get_code":{"code_sha256":"a34eb4a9ee65c5fb"}},{"arxiv_id":"2601.22420","paper":"/paper/arxiv-2601-22420","title":"METALEAD: A Comprehensive Human-Curated Leaderboard Dataset for Transparent Reporting of Machine Learning Experiments","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"RoelTim/metalead","path":"src/evaluate_tuples.py","file_url":"https://github.com/RoelTim/metalead/blob/HEAD/src/evaluate_tuples.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ba57d1fd220fdb48","mcp_get_code":{"code_sha256":"ba57d1fd220fdb48"}},{"arxiv_id":"2601.22162","paper":"/paper/arxiv-2601-22162","title":"UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"aifinlab/UniFinEval","path":"evaluate_py/data_loader.py","file_url":"https://github.com/aifinlab/UniFinEval/blob/HEAD/evaluate_py/data_loader.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d068ef448a266fb4","mcp_get_code":{"code_sha256":"d068ef448a266fb4"}},{"arxiv_id":"2601.17260","paper":"/paper/arxiv-2601-17260","title":"The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"anon-repo-317/experiments","path":"analysis/generate_all_data.py","file_url":"https://github.com/anon-repo-317/experiments/blob/HEAD/analysis/generate_all_data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"eadae9732385cce9","mcp_get_code":{"code_sha256":"eadae9732385cce9"}},{"arxiv_id":"2601.13565","paper":"/paper/arxiv-2601-13565","title":"Learning Fine-Grained Correspondence with Cross-Perspective Perception for Open-Vocabulary 6D Object Pose Estimation","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"zjjqinyu/FiCoP","path":"bop_toolkit_lib/inout.py","file_url":"https://github.com/zjjqinyu/FiCoP/blob/HEAD/bop_toolkit_lib/inout.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"556be2ec895c3dea","mcp_get_code":{"code_sha256":"556be2ec895c3dea"}},{"arxiv_id":"2601.09449","paper":"/paper/arxiv-2601-09449","title":"PrivLEX: Detecting legal concepts in images through Vision-Language Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"idiap/privlex","path":"utils.py","file_url":"https://github.com/idiap/privlex/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a68d8656b672911d","mcp_get_code":{"code_sha256":"a68d8656b672911d"}},{"arxiv_id":"2601.05637","paper":"/paper/arxiv-2601-05637","title":"GenCtrl -A Formal Controllability Toolkit for Generative Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"apple/ml-genctrl","path":"genctrl/utils/setup_utils.py","file_url":"https://github.com/apple/ml-genctrl/blob/HEAD/genctrl/utils/setup_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"654a593d62a67e06","mcp_get_code":{"code_sha256":"654a593d62a67e06"}},{"arxiv_id":"2601.04537","paper":"/paper/arxiv-2601-04537","title":"Linear Dynamics in the RLVR Training of Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"Miaow-Lab/RLVR-Linearity","path":"analysis/token_logprob/token_logprob_linearity.py","file_url":"https://github.com/Miaow-Lab/RLVR-Linearity/blob/HEAD/analysis/token_logprob/token_logprob_linearity.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"db79e1c6f71f41bb","mcp_get_code":{"code_sha256":"db79e1c6f71f41bb"}},{"arxiv_id":"2601.04537","paper":"/paper/arxiv-2601-04537","title":"Linear Dynamics in the RLVR Training of Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"Miaow-Lab/RLVR-Linearity","path":"evaluation/pass_at_k_eval.py","file_url":"https://github.com/Miaow-Lab/RLVR-Linearity/blob/HEAD/evaluation/pass_at_k_eval.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"98cb765f6409dd94","mcp_get_code":{"code_sha256":"98cb765f6409dd94"}},{"arxiv_id":"2601.04455","paper":"/paper/arxiv-2601-04455","title":"Re-Rankers as Relevance Judges","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"ChuanMeng/reranker-as-judge","path":"cross_evaluation.py","file_url":"https://github.com/ChuanMeng/reranker-as-judge/blob/HEAD/cross_evaluation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e36b276d9d394d5f","mcp_get_code":{"code_sha256":"e36b276d9d394d5f"}},{"arxiv_id":"2601.04126","paper":"/paper/arxiv-2601-04126","title":"INFINITEWEB: Scalable Web Environment Synthesis for GUI Agent Training","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"microsoft/FIVE-UI-Evol","path":"InfiniteWeb/src/generate_task_jsons.py","file_url":"https://github.com/microsoft/FIVE-UI-Evol/blob/HEAD/InfiniteWeb/src/generate_task_jsons.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"752cc2290bb5485c","mcp_get_code":{"code_sha256":"752cc2290bb5485c"}},{"arxiv_id":"2601.03699","paper":"/paper/arxiv-2601-03699","title":"ICLR 2026 Workshop: Principled Design for Trustworthy AI REDBENCH: A UNIVERSAL DATASET FOR COMPRE-HENSIVE RED TEAMING OF LARGE LANGUAGE MOD-ELS","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"knoveleng/redeval","path":"redeval/score.py","file_url":"https://github.com/knoveleng/redeval/blob/HEAD/redeval/score.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"67e96c33980c36f3","mcp_get_code":{"code_sha256":"67e96c33980c36f3"}},{"arxiv_id":"2601.00223","paper":"/paper/arxiv-2601-00223","title":"JP-TL-Bench: Anchored Pairwise LLM Evaluation for Bidirectional Japanese-English Translation","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"lhl/liquid-ai-hackathon-tokyo","path":"eval/tui-viewer.py","file_url":"https://github.com/lhl/liquid-ai-hackathon-tokyo/blob/HEAD/eval/tui-viewer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b19d72f495a1c73e","mcp_get_code":{"code_sha256":"b19d72f495a1c73e"}},{"arxiv_id":"2512.00306","paper":"/paper/arxiv-2512-00306","title":"VCWorld: A Biological World Model for Virtual Cell Simulation","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"GENTEL-lab/VCWorld","path":"src/cli_pipeline/stages/prompt.py","file_url":"https://github.com/GENTEL-lab/VCWorld/blob/HEAD/src/cli_pipeline/stages/prompt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"581e1a3430c33f5f","mcp_get_code":{"code_sha256":"581e1a3430c33f5f"}},{"arxiv_id":"2511.00117","paper":"/paper/arxiv-2511-00117","title":"DCcluster-Opt: Benchmarking Dynamic Multi-Objective Optimization for Geo-Distributed Data Center Workloads","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"HewlettPackard/sustain-cluster","path":"utils/config_loader.py","file_url":"https://github.com/HewlettPackard/sustain-cluster/blob/HEAD/utils/config_loader.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"593e5e4d03d4d4df","mcp_get_code":{"code_sha256":"593e5e4d03d4d4df"}},{"arxiv_id":"2510.26937","paper":"/paper/arxiv-2510-26937","title":"MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"MM-OPERA-Bench/MM-OPERA","path":"evaluation/utils.py","file_url":"https://github.com/MM-OPERA-Bench/MM-OPERA/blob/HEAD/evaluation/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2b770451741c0c2c","mcp_get_code":{"code_sha256":"2b770451741c0c2c"}},{"arxiv_id":"2510.18204","paper":"/paper/arxiv-2510-18204","title":"RESCUE: Retrieval Augmented Secure Code Generation","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"steven1518/RESCUE","path":"src/common/utils.py","file_url":"https://github.com/steven1518/RESCUE/blob/HEAD/src/common/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"70da73eeeea12da5","mcp_get_code":{"code_sha256":"70da73eeeea12da5"}},{"arxiv_id":"2510.11509","paper":"/paper/arxiv-2510-11509","title":"Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"RuipingL/Situat3DChange","path":"SCReasoner/common/io_utils.py","file_url":"https://github.com/RuipingL/Situat3DChange/blob/HEAD/SCReasoner/common/io_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"bace1acf5a748097","mcp_get_code":{"code_sha256":"bace1acf5a748097"}},{"arxiv_id":"2510.10618","paper":"/paper/arxiv-2510-10618","title":"Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"BokwaiHo/COLA","path":"cola/utils.py","file_url":"https://github.com/BokwaiHo/COLA/blob/HEAD/cola/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3d492573a8beef65","mcp_get_code":{"code_sha256":"3d492573a8beef65"}},{"arxiv_id":"2510.07364","paper":"/paper/arxiv-2510-07364","title":"Base Models Know How to Reason, Thinking Models Learn When","date":"2025-10-08","month_inferred_from_arxiv_id":null,"title_source":"syntology","repo":"cvenhoff/thinking-llms-interp","path":"human_eval/sample.py","file_url":"https://github.com/cvenhoff/thinking-llms-interp/blob/HEAD/human_eval/sample.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"03331bee0c7d9d6d","mcp_get_code":{"code_sha256":"03331bee0c7d9d6d"}},{"arxiv_id":"2510.05520","paper":"/paper/arxiv-2510-05520","title":"CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"rui9812/CAM","path":"prototype/constructivist_memory.py","file_url":"https://github.com/rui9812/CAM/blob/HEAD/prototype/constructivist_memory.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3ffef03aeacde643","mcp_get_code":{"code_sha256":"3ffef03aeacde643"}},{"arxiv_id":"2510.00307","paper":"/paper/arxiv-2510-00307","title":"BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"thierry123454/tool-selection-bias","path":"5_bias_investigation/extract_features/add_selection_rate.py","file_url":"https://github.com/thierry123454/tool-selection-bias/blob/HEAD/5_bias_investigation/extract_features/add_selection_rate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a0c7393409fd0be9","mcp_get_code":{"code_sha256":"a0c7393409fd0be9"}},{"arxiv_id":"2509.23415","paper":"/paper/arxiv-2509-23415","title":"From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"glee4810/EHR-ChatQA","path":"src/utils.py","file_url":"https://github.com/glee4810/EHR-ChatQA/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fd3ad6e7caf61e76","mcp_get_code":{"code_sha256":"fd3ad6e7caf61e76"}},{"arxiv_id":"2509.19326","paper":"/paper/arxiv-2509-19326","title":"Unveiling the Merits and Defects of LLMs in Automatic Review Generation for Scientific Papers","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"RichardLRC/Peer-Review","path":"Code/Semantic_similarity.py","file_url":"https://github.com/RichardLRC/Peer-Review/blob/HEAD/Code/Semantic_similarity.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a0c7393409fd0be9","mcp_get_code":{"code_sha256":"a0c7393409fd0be9"}},{"arxiv_id":"2509.16598","paper":"/paper/arxiv-2509-16598","title":"PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"hoeng4/PruneCD","path":"2_benchmark/1_tfqa_llama_rating.py","file_url":"https://github.com/hoeng4/PruneCD/blob/HEAD/2_benchmark/1_tfqa_llama_rating.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d0bb7013dd302153","mcp_get_code":{"code_sha256":"d0bb7013dd302153"}},{"arxiv_id":"2509.12158","paper":"/paper/arxiv-2509-12158","title":"Pun Unintended: LLMs and the Illusion of Humor Understanding","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"alezanga/punintended","path":"utils/io.py","file_url":"https://github.com/alezanga/punintended/blob/HEAD/utils/io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cff0a4f4e937c72c","mcp_get_code":{"code_sha256":"cff0a4f4e937c72c"}},{"arxiv_id":"2508.17554","paper":"/paper/arxiv-2508-17554","title":"Bridging Graph and State-Space Modeling for Intensive Care Unit Length of Stay Prediction","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"ShuqiZi1/S2G-Net","path":"src/utils.py","file_url":"https://github.com/ShuqiZi1/S2G-Net/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0ca0c1bca741caa0","mcp_get_code":{"code_sha256":"0ca0c1bca741caa0"}},{"arxiv_id":"2507.22171","paper":null,"title":"arXiv:2507.22171","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"CjangCjengh/Generic_Persona","path":"trust_utils.py","file_url":"https://github.com/CjangCjengh/Generic_Persona/blob/HEAD/trust_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a0c7393409fd0be9","mcp_get_code":{"code_sha256":"a0c7393409fd0be9"}},{"arxiv_id":"2507.15501","paper":null,"title":"arXiv:2507.15501","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"apple/ml-aspera","path":"src/aspera/readers.py","file_url":"https://github.com/apple/ml-aspera/blob/HEAD/src/aspera/readers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"ef54978796fcb878","mcp_get_code":{"code_sha256":"ef54978796fcb878"}},{"arxiv_id":"2507.03616","paper":"/paper/evoagentx-an-automated-framework-for-evolving","title":"EvoAgentX: An Automated Framework for Evolving Agentic Workflows","date":"2025-07-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"evoagentx/evoagentx","path":"evoagentx/core/module_utils.py","file_url":"https://github.com/evoagentx/evoagentx/blob/HEAD/evoagentx/core/module_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"2c12d75b45786664","mcp_get_code":{"code_sha256":"2c12d75b45786664"}},{"arxiv_id":"2506.19054","paper":null,"title":"arXiv:2506.19054","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"AI-secure/PolyGuard","path":"code/evaluate.py","file_url":"https://github.com/AI-secure/PolyGuard/blob/HEAD/code/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a0c7393409fd0be9","mcp_get_code":{"code_sha256":"a0c7393409fd0be9"}},{"arxiv_id":"2506.08184","paper":"/paper/2506-08184","title":"Unable to Forget: Proactive lnterference Reveals Working Memory Limits in LLMs Beyond Context Length","date":"2025-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhuangziGiantfish/Unable-to-Forget","path":"automation/analyze_pi_flow_final.py","file_url":"https://github.com/zhuangziGiantfish/Unable-to-Forget/blob/HEAD/automation/analyze_pi_flow_final.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"484ae19889957547","mcp_get_code":{"code_sha256":"484ae19889957547"}},{"arxiv_id":"2506.03949","paper":null,"title":"arXiv:2506.03949","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"wenge-research/TableEval","path":"utils.py","file_url":"https://github.com/wenge-research/TableEval/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c3b9cc79f7f285ce","mcp_get_code":{"code_sha256":"c3b9cc79f7f285ce"}},{"arxiv_id":"2506.02672","paper":"/paper/evalearn-quantifying-the-learning-capability","title":"EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving","date":"2025-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByteDance-Seed/EvaLearn","path":"Evaluate/evaluate_metric.py","file_url":"https://github.com/ByteDance-Seed/EvaLearn/blob/HEAD/Evaluate/evaluate_metric.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9872647e95bfe2f0","mcp_get_code":{"code_sha256":"9872647e95bfe2f0"}},{"arxiv_id":"2505.20302","paper":"/paper/verithoughts-enabling-automated-verilog-code","title":"VeriThoughts: Enabling Automated Verilog Code Generation using Reasoning and Formal Verification","date":"2025-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wilyub/verithoughts","path":"evaluation_verithoughts/verilog_vllm_multi.py","file_url":"https://github.com/wilyub/verithoughts/blob/HEAD/evaluation_verithoughts/verilog_vllm_multi.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b534fded631201b9","mcp_get_code":{"code_sha256":"b534fded631201b9"}},{"arxiv_id":"2505.13569","paper":"/paper/surrogate-modeling-of-3d-rayleigh-benard","title":"Surrogate Modeling of 3D Rayleigh-Benard Convection with Equivariant Autoencoders","date":"2025-05-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fynnfromme/equivariant-rb-forecasting","path":"experiments/evaluate.py","file_url":"https://github.com/fynnfromme/equivariant-rb-forecasting/blob/HEAD/experiments/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4170a4a36bf2db15","mcp_get_code":{"code_sha256":"4170a4a36bf2db15"}},{"arxiv_id":"2505.12531","paper":"/paper/esc-judge-a-framework-for-comparing-emotional","title":"ESC-Judge: A Framework for Comparing Emotional Support Conversational Agents","date":"2025-05-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"navidmdn/ESC-Judge","path":"multidim_judge_from_merged.py","file_url":"https://github.com/navidmdn/ESC-Judge/blob/HEAD/multidim_judge_from_merged.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"dd20d05a85fb7631","mcp_get_code":{"code_sha256":"dd20d05a85fb7631"}},{"arxiv_id":"2505.12212","paper":"/paper/data-whisperer-efficient-data-selection-for","title":"Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning","date":"2025-05-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gszfwsb/Data-Whisperer","path":"pruning/datawhisperer_gsm_pruner.py","file_url":"https://github.com/gszfwsb/Data-Whisperer/blob/HEAD/pruning/datawhisperer_gsm_pruner.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f33868b25affe264","mcp_get_code":{"code_sha256":"f33868b25affe264"}},{"arxiv_id":"2505.04109","paper":"/paper/one2any-one-reference-6d-pose-estimation-for","title":"One2Any: One-Reference 6D Pose Estimation for Any Object","date":"2025-05-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lmy1001/One2Any","path":"bop_toolkit_lib/inout.py","file_url":"https://github.com/lmy1001/One2Any/blob/HEAD/bop_toolkit_lib/inout.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"556be2ec895c3dea","mcp_get_code":{"code_sha256":"556be2ec895c3dea"}},{"arxiv_id":"2505.02370","paper":"/paper/superedit-rectifying-and-facilitating","title":"SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing","date":"2025-05-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bytedance/superedit","path":"eval/eval_instructpix2pix.py","file_url":"https://github.com/bytedance/superedit/blob/HEAD/eval/eval_instructpix2pix.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2504.04907","paper":null,"title":"arXiv:2504.04907","date":null,"month_inferred_from_arxiv_id":"2025-04","title_source":null,"repo":"Video-Bench/Video-Bench","path":"videobench/utils.py","file_url":"https://github.com/Video-Bench/Video-Bench/blob/HEAD/videobench/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"81155ad798ce29cf","mcp_get_code":{"code_sha256":"81155ad798ce29cf"}},{"arxiv_id":"2504.04635","paper":null,"title":"arXiv:2504.04635","date":null,"month_inferred_from_arxiv_id":"2025-04","title_source":null,"repo":"patqdasilva/steering-off-course","path":"DoLa/tfqa_gpt3_rating.py","file_url":"https://github.com/patqdasilva/steering-off-course/blob/HEAD/DoLa/tfqa_gpt3_rating.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d0bb7013dd302153","mcp_get_code":{"code_sha256":"d0bb7013dd302153"}},{"arxiv_id":"2503.18108","paper":"/paper/unraveling-the-effects-of-synthetic-data-on","title":"Unraveling the Effects of Synthetic Data on End-to-End Autonomous Driving","date":"2025-03-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cancaries/SceneCrafter","path":"data_utils/get_kinemic_hyper.py","file_url":"https://github.com/cancaries/SceneCrafter/blob/HEAD/data_utils/get_kinemic_hyper.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bff1f7ec64588b7c","mcp_get_code":{"code_sha256":"bff1f7ec64588b7c"}},{"arxiv_id":"2503.16212","paper":"/paper/mathfusion-enhancing-mathematic-problem","title":"MathFusion: Enhancing Mathematic Problem-solving of LLM through Instruction Fusion","date":"2025-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qizhipei/mathfusion","path":"evaluation/dart_math/utils.py","file_url":"https://github.com/qizhipei/mathfusion/blob/HEAD/evaluation/dart_math/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c40f841274b3441","mcp_get_code":{"code_sha256":"3c40f841274b3441"}},{"arxiv_id":"2503.16032","paper":"/paper/agentic-keyframe-search-for-video-question","title":"Agentic Keyframe Search for Video Question Answering","date":"2025-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fansunqi/akeys","path":"util.py","file_url":"https://github.com/fansunqi/akeys/blob/HEAD/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"658682feda4928a2","mcp_get_code":{"code_sha256":"658682feda4928a2"}},{"arxiv_id":"2503.10742","paper":"/paper/keyframe-oriented-vision-token-pruning","title":"Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing","date":"2025-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"1999Lyd/KVTP","path":"llava/combine.py","file_url":"https://github.com/1999Lyd/KVTP/blob/HEAD/llava/combine.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f89aea892269a576","mcp_get_code":{"code_sha256":"f89aea892269a576"}},{"arxiv_id":"2503.07539","paper":"/paper/xifbench-evaluating-large-language-models-on","title":"XIFBench: Evaluating Large Language Models on Multilingual Instruction Following","date":"2025-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhenyuli801/XIFBench","path":"A1_sample_instructions.py","file_url":"https://github.com/zhenyuli801/XIFBench/blob/HEAD/A1_sample_instructions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cf254803acaaf54c","mcp_get_code":{"code_sha256":"cf254803acaaf54c"}},{"arxiv_id":"2503.07459","paper":"/paper/medagentsbench-benchmarking-thinking-models","title":"MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning","date":"2025-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gersteinlab/medagents-benchmark","path":"output/utils.py","file_url":"https://github.com/gersteinlab/medagents-benchmark/blob/HEAD/output/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2fbbe01c3721715d","mcp_get_code":{"code_sha256":"2fbbe01c3721715d"}},{"arxiv_id":"2503.07265","paper":"/paper/wise-a-world-knowledge-informed-semantic","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","date":"2025-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PKU-YuanGroup/WISE","path":"vllm_eval.py","file_url":"https://github.com/PKU-YuanGroup/WISE/blob/HEAD/vllm_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"471db2e0891324a8","mcp_get_code":{"code_sha256":"471db2e0891324a8"}},{"arxiv_id":"2503.04800","paper":"/paper/hoh-a-dynamic-benchmark-for-evaluating-the","title":"HoH: A Dynamic Benchmark for Evaluating the Impact of Outdated Information on Retrieval-Augmented Generation","date":"2025-03-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"0russwest0/HoH","path":"qa_generate/src/utils.py","file_url":"https://github.com/0russwest0/HoH/blob/HEAD/qa_generate/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c15cdea70ecc6529","mcp_get_code":{"code_sha256":"c15cdea70ecc6529"}},{"arxiv_id":"2502.18770","paper":"/paper/reward-shaping-to-mitigate-reward-hacking-in","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","date":"2025-02-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"poruna-byte/par","path":"src/combine_plot.py","file_url":"https://github.com/poruna-byte/par/blob/HEAD/src/combine_plot.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a145434950c05a50","mcp_get_code":{"code_sha256":"a145434950c05a50"}},{"arxiv_id":"2502.12067","paper":"/paper/tokenskip-controllable-chain-of-thought","title":"TokenSkip: Controllable Chain-of-Thought Compression in LLMs","date":"2025-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hemingkx/TokenSkip","path":"get_llamafactory_input.py","file_url":"https://github.com/hemingkx/TokenSkip/blob/HEAD/get_llamafactory_input.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"57518f0194aae8fb","mcp_get_code":{"code_sha256":"57518f0194aae8fb"}},{"arxiv_id":"2502.11089","paper":"/paper/native-sparse-attention-hardware-aligned-and","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","date":"2025-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/seerattention","path":"eval/longbench/average_score.py","file_url":"https://github.com/microsoft/seerattention/blob/HEAD/eval/longbench/average_score.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cc892598a14c82a5","mcp_get_code":{"code_sha256":"cc892598a14c82a5"}},{"arxiv_id":"2502.10090","paper":"/paper/manual2skill-learning-to-read-manuals-and","title":"Manual2Skill: Learning to Read Manuals and Acquire Robotic Skills for Furniture Assembly Using Vision-Language Models","date":"2025-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"owensun2004/Manual2Skill","path":"VLM_assembly_plan_gen/inference/utils.py","file_url":"https://github.com/owensun2004/Manual2Skill/blob/HEAD/VLM_assembly_plan_gen/inference/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4d27b551238505d7","mcp_get_code":{"code_sha256":"4d27b551238505d7"}},{"arxiv_id":"2502.06205","paper":"/paper/c-3po-compact-plug-and-play-proxy","title":"C-3PO: Compact Plug-and-Play Proxy Optimization to Achieve Human-like Retrieval-Augmented Generation","date":"2025-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Chen-GX/C-3PO","path":"C-3PO/utils.py","file_url":"https://github.com/Chen-GX/C-3PO/blob/HEAD/C-3PO/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2501.10332","paper":"/paper/agent4edu-generating-learner-response-data-by","title":"Agent4Edu: Generating Learner Response Data by Generative Agents for Intelligent Education Systems","date":"2025-01-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bigdata-ustc/agent4edu","path":"Code/memory.py","file_url":"https://github.com/bigdata-ustc/agent4edu/blob/HEAD/Code/memory.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9231abc6a12fb290","mcp_get_code":{"code_sha256":"9231abc6a12fb290"}},{"arxiv_id":"2501.02144","paper":"/paper/establishing-baselines-for-generative","title":"Establishing baselines for generative discovery of inorganic crystals","date":"2025-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bartel-group/matgen_baselines","path":"matgen_baselines/utils/helpers.py","file_url":"https://github.com/bartel-group/matgen_baselines/blob/HEAD/matgen_baselines/utils/helpers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"338377b48a35b40e","mcp_get_code":{"code_sha256":"338377b48a35b40e"}},{"arxiv_id":"2501.00289","paper":"/paper/dual-diffusion-for-unified-image-generation","title":"Dual Diffusion for Unified Image Generation and Understanding","date":"2024-12-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zijieli-Jlee/Dual-Diffusion","path":"custom_dataset/iterable_data.py","file_url":"https://github.com/zijieli-Jlee/Dual-Diffusion/blob/HEAD/custom_dataset/iterable_data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d91cfae999630304","mcp_get_code":{"code_sha256":"d91cfae999630304"}},{"arxiv_id":"2412.15280","paper":"/paper/context-dpo-aligning-language-models-for","title":"Context-DPO: Aligning Language Models for Context-Faithfulness","date":"2024-12-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byronbbl/context-dpo","path":"train_dpo.py","file_url":"https://github.com/byronbbl/context-dpo/blob/HEAD/train_dpo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c3081871f09008f9","mcp_get_code":{"code_sha256":"c3081871f09008f9"}},{"arxiv_id":"2412.10302","paper":"/paper/deepseek-vl2-mixture-of-experts-vision","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","date":"2024-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deepseek-ai/deepseek-vl2","path":"deepseek_vl2/utils/io.py","file_url":"https://github.com/deepseek-ai/deepseek-vl2/blob/HEAD/deepseek_vl2/utils/io.py","status":"ran_draft_wrong","verification_level":2,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"96f3e857e91a8cb8","mcp_get_code":{"code_sha256":"96f3e857e91a8cb8"}},{"arxiv_id":"2412.06660","paper":"/paper/mumu-llama-multi-modal-music-understanding","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","date":null,"month_inferred_from_arxiv_id":"2024-12","title_source":"archive","repo":"shansongliu/M2UGen","path":"DataSet/MUEdit/prepare.py","file_url":"https://github.com/shansongliu/M2UGen/blob/HEAD/DataSet/MUEdit/prepare.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"67c2fccdb8646607","mcp_get_code":{"code_sha256":"67c2fccdb8646607"}},{"arxiv_id":"2412.06660","paper":"/paper/mumu-llama-multi-modal-music-understanding","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","date":null,"month_inferred_from_arxiv_id":"2024-12","title_source":"archive","repo":"shansongliu/M2UGen","path":"DataSet/MUImage/llava_caption.py","file_url":"https://github.com/shansongliu/M2UGen/blob/HEAD/DataSet/MUImage/llava_caption.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4d1ebce7f6f7cc0e","mcp_get_code":{"code_sha256":"4d1ebce7f6f7cc0e"}},{"arxiv_id":"2412.06474","paper":"/paper/from-uncertainty-to-trust-enhancing","title":"From Uncertainty to Trust: Enhancing Reliability in Vision-Language Models with Uncertainty-Guided Dropout Decoding","date":"2024-12-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kigb/DropoutDecoding","path":"utils/compare.py","file_url":"https://github.com/kigb/DropoutDecoding/blob/HEAD/utils/compare.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2411.15245","paper":"/paper/anytext2-visual-text-generation-and-editing","title":"AnyText2: Visual Text Generation and Editing With Customizable Attributes","date":"2024-11-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tyxsspa/anytext2","path":"eval/anytext2_multiGPUs.py","file_url":"https://github.com/tyxsspa/anytext2/blob/HEAD/eval/anytext2_multiGPUs.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5958926c73426c86","mcp_get_code":{"code_sha256":"5958926c73426c86"}},{"arxiv_id":"2411.14522","paper":"/paper/gmai-vl-gmai-vl-5-5m-a-large-vision-language","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","date":"2024-11-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uni-medical/gmai-vl","path":"demo/gmai_vl_demo/static/get_modality_num.py","file_url":"https://github.com/uni-medical/gmai-vl/blob/HEAD/demo/gmai_vl_demo/static/get_modality_num.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"501a90fb110e541b","mcp_get_code":{"code_sha256":"501a90fb110e541b"}},{"arxiv_id":"2411.10954","paper":"/paper/dialectal-toxicity-detection-evaluating-llm","title":"Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties","date":"2024-11-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ffaisal93/dialect_toxicity_llm_judge","path":"src/judge_translation_vllm.py","file_url":"https://github.com/ffaisal93/dialect_toxicity_llm_judge/blob/HEAD/src/judge_translation_vllm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a0c7393409fd0be9","mcp_get_code":{"code_sha256":"a0c7393409fd0be9"}},{"arxiv_id":"2411.04998","paper":"/paper/hourvideo-1-hour-video-language-understanding","title":"HourVideo: 1-Hour Video-Language Understanding","date":"2024-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"keshik6/HourVideo","path":"hourvideo/hv_utils.py","file_url":"https://github.com/keshik6/HourVideo/blob/HEAD/hourvideo/hv_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8ddb08051f41a1c4","mcp_get_code":{"code_sha256":"8ddb08051f41a1c4"}},{"arxiv_id":"2411.01505","paper":"/paper/object-segmentation-from-common-fate-motion","title":"Object segmentation from common fate: Motion energy processing enables human-like zero-shot generalization to random dot stimuli","date":"2024-11-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mtangemann/motion_energy_segmentation","path":"motion_energy_segmentation/io_utils.py","file_url":"https://github.com/mtangemann/motion_energy_segmentation/blob/HEAD/motion_energy_segmentation/io_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ac0061565b0b8fb2","mcp_get_code":{"code_sha256":"ac0061565b0b8fb2"}},{"arxiv_id":"2411.00132","paper":"/paper/beyond-accuracy-ensuring-correct-predictions","title":"Beyond Accuracy: Ensuring Correct Predictions With Correct Rationales","date":"2024-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deep-real/DCP","path":"loading_helpers.py","file_url":"https://github.com/deep-real/DCP/blob/HEAD/loading_helpers.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1069918b276d2855","mcp_get_code":{"code_sha256":"1069918b276d2855"}},{"arxiv_id":"2410.22388","paper":"/paper/et-flow-equivariant-flow-matching-for","title":"ET-Flow: Equivariant Flow-Matching for Molecular Conformer Generation","date":"2024-10-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shenoynikhil/ETFlow","path":"etflow/commons/io.py","file_url":"https://github.com/shenoynikhil/ETFlow/blob/HEAD/etflow/commons/io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0d62ee150d99b901","mcp_get_code":{"code_sha256":"0d62ee150d99b901"}},{"arxiv_id":"2410.21259","paper":"/paper/autobench-v-can-large-vision-language-models","title":"AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?","date":"2024-10-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wad3birch/AutoBench-V","path":"process/aspect_generate.py","file_url":"https://github.com/wad3birch/AutoBench-V/blob/HEAD/process/aspect_generate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e670ccbd528c1fa5","mcp_get_code":{"code_sha256":"e670ccbd528c1fa5"}},{"arxiv_id":"2410.18336","paper":"/paper/assessing-the-creativity-of-llms-in-proposing","title":"Assessing the Creativity of LLMs in Proposing Novel Solutions to Mathematical Problems","date":"2024-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"junyiye/creativemath","path":"src/utils.py","file_url":"https://github.com/junyiye/creativemath/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f643f9552ec644d5","mcp_get_code":{"code_sha256":"f643f9552ec644d5"}},{"arxiv_id":"2410.16130","paper":"/paper/can-large-audio-language-models-truly-hear","title":"Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning","date":"2024-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kuan2jiu99/audio-hallucination","path":"interspeech2024/generative_tasks/evaluation.py","file_url":"https://github.com/kuan2jiu99/audio-hallucination/blob/HEAD/interspeech2024/generative_tasks/evaluation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"09c061845768f010","mcp_get_code":{"code_sha256":"09c061845768f010"}},{"arxiv_id":"2410.15522","paper":"/paper/m-rewardbench-evaluating-reward-models-in","title":"M-RewardBench: Evaluating Reward Models in Multilingual Settings","date":"2024-10-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"for-ai/m-rewardbench","path":"analysis/maple_results.py","file_url":"https://github.com/for-ai/m-rewardbench/blob/HEAD/analysis/maple_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9e6090f78229e622","mcp_get_code":{"code_sha256":"9e6090f78229e622"}},{"arxiv_id":"2410.14204","paper":"/paper/meditod-an-english-dialogue-dataset-for","title":"MediTOD: An English Dialogue Dataset for Medical History Taking with Comprehensive Annotations","date":"2024-10-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dair-iitd/MediTOD","path":"metrics/nlg_metrics.py","file_url":"https://github.com/dair-iitd/MediTOD/blob/HEAD/metrics/nlg_metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6a08e1753f8b367c","mcp_get_code":{"code_sha256":"6a08e1753f8b367c"}},{"arxiv_id":"2410.12869","paper":"/paper/language-model-preference-evaluation-with","title":"Language Model Preference Evaluation with Multiple Weak Evaluators","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ppsmk388/GED","path":"answer_gen/vllm_generate.py","file_url":"https://github.com/ppsmk388/GED/blob/HEAD/answer_gen/vllm_generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ba7818748c5a71fa","mcp_get_code":{"code_sha256":"ba7818748c5a71fa"}},{"arxiv_id":"2410.12381","paper":"/paper/humaneval-v-evaluating-visual-understanding","title":"HumanEval-V: Evaluating Visual Understanding and Reasoning Abilities of Large Multimodal Models Through Coding Tasks","date":"2024-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HumanEval-V/HumanEval-V-Benchmark","path":"utils.py","file_url":"https://github.com/HumanEval-V/HumanEval-V-Benchmark/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2d7add6459ff5b37","mcp_get_code":{"code_sha256":"2d7add6459ff5b37"}},{"arxiv_id":"2410.08964","paper":"/paper/language-imbalance-driven-rewarding-for","title":"Language Imbalance Driven Rewarding for Multilingual Self-improving","date":"2024-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZNLP/Language-Imbalance-Driven-Rewarding","path":"utils/utils.py","file_url":"https://github.com/ZNLP/Language-Imbalance-Driven-Rewarding/blob/HEAD/utils/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"10b24db4baa49194","mcp_get_code":{"code_sha256":"10b24db4baa49194"}},{"arxiv_id":"2410.08355","paper":"/paper/metalic-meta-learning-in-context-with-protein","title":"Metalic: Meta-Learning In-Context with Protein Language Models","date":"2024-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"instadeepai/metalic","path":"meta/io.py","file_url":"https://github.com/instadeepai/metalic/blob/HEAD/meta/io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"800fbd05b709b1ff","mcp_get_code":{"code_sha256":"800fbd05b709b1ff"}},{"arxiv_id":"2410.04360","paper":"/paper/gensim-a-general-social-simulation-platform","title":"GenSim: A General Social Simulation Platform with Large Language Model based Agents","date":"2024-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TangJiakai/GenSim","path":"simulation/helpers/utils.py","file_url":"https://github.com/TangJiakai/GenSim/blob/HEAD/simulation/helpers/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ba7818748c5a71fa","mcp_get_code":{"code_sha256":"ba7818748c5a71fa"}},{"arxiv_id":"2410.03341","paper":"/paper/zero-shot-fact-verification-via-natural-logic","title":"Zero-Shot Fact Verification via Natural Logic and Large Language Models","date":"2024-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marekstrong/Zero-NatVer","path":"utils.py","file_url":"https://github.com/marekstrong/Zero-NatVer/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"877e4b9e3be5068c","mcp_get_code":{"code_sha256":"877e4b9e3be5068c"}},{"arxiv_id":"2410.01171","paper":"/paper/bordirlines-a-dataset-for-evaluating-cross","title":"BordIRlines: A Dataset for Evaluating Cross-lingual Retrieval-Augmented Generation","date":"2024-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"manestay/bordirlines","path":"generation/check_query_json.py","file_url":"https://github.com/manestay/bordirlines/blob/HEAD/generation/check_query_json.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"456ea162315edf33","mcp_get_code":{"code_sha256":"456ea162315edf33"}},{"arxiv_id":"2409.17266","paper":"/paper/aapm-large-language-model-agent-based-asset","title":"Empirical Asset Pricing with Large Language Model Agents","date":"2024-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chengjunyan1/AAPM","path":"utils.py","file_url":"https://github.com/chengjunyan1/AAPM/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e4e161322a55de64","mcp_get_code":{"code_sha256":"e4e161322a55de64"}},{"arxiv_id":"2409.16751","paper":"/paper/e-sql-direct-schema-linking-via-question","title":"E-SQL: Direct Schema Linking via Question Enrichment in Text-to-SQL","date":"2024-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HasanAlpCaferoglu/E-SQL","path":"evaluation/evaluation.py","file_url":"https://github.com/HasanAlpCaferoglu/E-SQL/blob/HEAD/evaluation/evaluation.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d2fbc7a5ab95bd19","mcp_get_code":{"code_sha256":"d2fbc7a5ab95bd19"}},{"arxiv_id":"2409.15256","paper":"/paper/behavioral-bias-of-vision-language-models-a","title":"Behavioral Bias of Vision-Language Models: A Behavioral Finance View","date":"2024-09-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mydcxiao/vlm_behavioral_fin","path":"gen.py","file_url":"https://github.com/mydcxiao/vlm_behavioral_fin/blob/HEAD/gen.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7504602735c0099","mcp_get_code":{"code_sha256":"d7504602735c0099"}},{"arxiv_id":"2409.14818","paper":"/paper/mobilevlm-a-vision-language-model-for-better","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","date":"2024-09-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiaomi/mobilevlm","path":"corpus/bm25.py","file_url":"https://github.com/xiaomi/mobilevlm/blob/HEAD/corpus/bm25.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"1c84aeb1de479bcc","mcp_get_code":{"code_sha256":"1c84aeb1de479bcc"}},{"arxiv_id":"2409.06851","paper":"/paper/lime-m-less-is-more-for-evaluation-of-mllms","title":"LIME: Less Is More for MLLM Evaluation","date":"2024-09-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kangreen0210/lime","path":"data_curation_pipeline/gpt_double_check.py","file_url":"https://github.com/kangreen0210/lime/blob/HEAD/data_curation_pipeline/gpt_double_check.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"ab5d85a81888b311","mcp_get_code":{"code_sha256":"ab5d85a81888b311"}},{"arxiv_id":"2409.00138","paper":"/paper/privacylens-evaluating-privacy-norm-awareness","title":"PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action","date":"2024-08-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salt-nlp/privacylens","path":"helper/inspect_data.py","file_url":"https://github.com/salt-nlp/privacylens/blob/HEAD/helper/inspect_data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c56cba76d2b331d1","mcp_get_code":{"code_sha256":"c56cba76d2b331d1"}},{"arxiv_id":"2408.11745","paper":"/paper/focusllm-scaling-llm-s-context-by-parallel","title":"FocusLLM: Precise Understanding of Long Context by Dynamic Condensing","date":"2024-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leezythu/focusllm","path":"infbench_src/eval_utils.py","file_url":"https://github.com/leezythu/focusllm/blob/HEAD/infbench_src/eval_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"41e438356614fa31","mcp_get_code":{"code_sha256":"41e438356614fa31"}},{"arxiv_id":"2408.11745","paper":"/paper/focusllm-scaling-llm-s-context-by-parallel","title":"FocusLLM: Precise Understanding of Long Context by Dynamic Condensing","date":"2024-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leezythu/focusllm","path":"src/colossal.py","file_url":"https://github.com/leezythu/focusllm/blob/HEAD/src/colossal.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9edde0325b62d764","mcp_get_code":{"code_sha256":"9edde0325b62d764"}},{"arxiv_id":"2408.09939","paper":"/paper/image-tell-me-your-story-predicting-the","title":"\"Image, Tell me your story!\" Predicting the original meta-context of visual misinformation","date":"2024-08-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"UKPLab/5pils","path":"utils.py","file_url":"https://github.com/UKPLab/5pils/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"eb82c897d04b22b2","mcp_get_code":{"code_sha256":"eb82c897d04b22b2"}},{"arxiv_id":"2408.07930","paper":"/paper/mag-sql-multi-agent-generative-approach-with","title":"MAG-SQL: Multi-Agent Generative Approach with Soft Schema Linking and Iterative Sub-SQL Refinement for Text-to-SQL","date":"2024-08-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LancelotXWX/MAG-SQL","path":"evaluation/evaluation_bird_ex.py","file_url":"https://github.com/LancelotXWX/MAG-SQL/blob/HEAD/evaluation/evaluation_bird_ex.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"72eccdcbaaff9c8d","mcp_get_code":{"code_sha256":"72eccdcbaaff9c8d"}},{"arxiv_id":"2408.06437","paper":"/paper/hat-history-augmented-anchor-transformer-for","title":"HAT: History-Augmented Anchor Transformer for Online Temporal Action Localization","date":"2024-08-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sakibreza/eccv24-hat","path":"dataset.py","file_url":"https://github.com/sakibreza/eccv24-hat/blob/HEAD/dataset.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6feb659b1cc2c1e8","mcp_get_code":{"code_sha256":"6feb659b1cc2c1e8"}},{"arxiv_id":"2407.16434","paper":"/paper/enhancing-llm-s-cognition-via-structurization","title":"Enhancing LLM's Cognition via Structurization","date":"2024-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alibaba/struxgpt","path":"src/utils/io.py","file_url":"https://github.com/alibaba/struxgpt/blob/HEAD/src/utils/io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b560dcb8becd1b02","mcp_get_code":{"code_sha256":"b560dcb8becd1b02"}},{"arxiv_id":"2407.15720","paper":"/paper/do-large-language-models-have-compositional","title":"Do Large Language Models Have Compositional Ability? An Investigation into Limitations and Scalability","date":"2024-07-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"oliverxuzy/llm_compose","path":"src/utils.py","file_url":"https://github.com/oliverxuzy/llm_compose/blob/HEAD/src/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ba7818748c5a71fa","mcp_get_code":{"code_sha256":"ba7818748c5a71fa"}},{"arxiv_id":"2407.15240","paper":"/paper/bigbench-a-unified-benchmark-for-social-bias","title":"BIGbench: A Unified Benchmark for Evaluating Multi-dimensional Social Biases in Text-to-Image Models","date":"2024-07-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bigbench2024/bigbench2024","path":"benchmark/evaluate/eta.py","file_url":"https://github.com/bigbench2024/bigbench2024/blob/HEAD/benchmark/evaluate/eta.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"cf58e9dc07391ea5","mcp_get_code":{"code_sha256":"cf58e9dc07391ea5"}},{"arxiv_id":"2407.15240","paper":"/paper/bigbench-a-unified-benchmark-for-social-bias","title":"BIGbench: A Unified Benchmark for Evaluating Multi-dimensional Social Biases in Text-to-Image Models","date":"2024-07-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bigbench2024/bigbench2024","path":"benchmark/evaluate/implicit.py","file_url":"https://github.com/bigbench2024/bigbench2024/blob/HEAD/benchmark/evaluate/implicit.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"35cf0bcb51d887c8","mcp_get_code":{"code_sha256":"35cf0bcb51d887c8"}},{"arxiv_id":"2407.14614","paper":"/paper/evaluating-language-models-as-risk-scores","title":"Evaluating language models as risk scores","date":"2024-07-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"socialfoundations/folktexts","path":"folktexts/_io.py","file_url":"https://github.com/socialfoundations/folktexts/blob/HEAD/folktexts/_io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"01ac3ca87c183a87","mcp_get_code":{"code_sha256":"01ac3ca87c183a87"}},{"arxiv_id":"2407.14412","paper":"/paper/deal-disentangle-and-localize-concept-level","title":"DEAL: Disentangle and Localize Concept-level Explanations for VLMs","date":"2024-07-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tangli-udel/DEAL","path":"loading_helpers.py","file_url":"https://github.com/tangli-udel/DEAL/blob/HEAD/loading_helpers.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1069918b276d2855","mcp_get_code":{"code_sha256":"1069918b276d2855"}},{"arxiv_id":"2407.09099","paper":"/paper/music-proofreading-with-refinpaint-where-and","title":"Music Proofreading with RefinPaint: Where and How to Modify Compositions given Context","date":"2024-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ta603/refinpaint","path":"FeedbackModel.py","file_url":"https://github.com/ta603/refinpaint/blob/HEAD/FeedbackModel.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"593e5e4d03d4d4df","mcp_get_code":{"code_sha256":"593e5e4d03d4d4df"}},{"arxiv_id":"2407.07093","paper":"/paper/fbi-llm-scaling-up-fully-binarized-llms-from","title":"FBI-LLM: Scaling Up Fully Binarized LLMs from Scratch via Autoregressive Distillation","date":"2024-07-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liqunma/fbi-llm","path":"utils.py","file_url":"https://github.com/liqunma/fbi-llm/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c7c652c2a1cbf982","mcp_get_code":{"code_sha256":"c7c652c2a1cbf982"}},{"arxiv_id":"2407.07084","paper":"/paper/stabilized-proximal-point-methods-for","title":"Stabilized Proximal-Point Methods for Federated Optimization","date":"2024-07-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlolab/s-dane","path":"src/utils.py","file_url":"https://github.com/mlolab/s-dane/blob/HEAD/src/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"493c4dd4d6a4d756","mcp_get_code":{"code_sha256":"493c4dd4d6a4d756"}},{"arxiv_id":"2407.06423","paper":"/paper/insightbench-evaluating-business-analytics","title":"InsightBench: Evaluating Business Analytics Agents Through Multi-Step Insight Generation","date":"2024-07-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ServiceNow/insight-bench","path":"insightbench/utils/exp_utils.py","file_url":"https://github.com/ServiceNow/insight-bench/blob/HEAD/insightbench/utils/exp_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0d5e00c75e457a24","mcp_get_code":{"code_sha256":"0d5e00c75e457a24"}},{"arxiv_id":"2407.05551","paper":"/paper/read-watch-and-scream-sound-generation-from","title":"Read, Watch and Scream! Sound Generation from Text and Video","date":"2024-07-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"naver-ai/rewas","path":"utils.py","file_url":"https://github.com/naver-ai/rewas/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"777e661635ced528","mcp_get_code":{"code_sha256":"777e661635ced528"}},{"arxiv_id":"2407.04538","paper":"/paper/pdiscoformer-relaxing-part-discovery","title":"PDiscoFormer: Relaxing Part Discovery Constraints with Vision Transformers","date":"2024-07-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ananthu-aniraj/pdiscoformer","path":"utils/data_utils/dataset_utils.py","file_url":"https://github.com/ananthu-aniraj/pdiscoformer/blob/HEAD/utils/data_utils/dataset_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cea473d993ab7c54","mcp_get_code":{"code_sha256":"cea473d993ab7c54"}},{"arxiv_id":"2407.03967","paper":"/paper/investigating-the-role-of-instruction-variety","title":"Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation Tasks","date":"2024-07-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amitkparekh/CoGeLoT","path":"src/cogelot/common/io.py","file_url":"https://github.com/amitkparekh/CoGeLoT/blob/HEAD/src/cogelot/common/io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cc6276625cb68fc3","mcp_get_code":{"code_sha256":"cc6276625cb68fc3"}},{"arxiv_id":"2407.02408","paper":"/paper/ceb-compositional-evaluation-benchmark-for","title":"CEB: Compositional Evaluation Benchmark for Fairness in Large Language Models","date":"2024-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SongW-SW/CEB","path":"src/utils/file_process.py","file_url":"https://github.com/SongW-SW/CEB/blob/HEAD/src/utils/file_process.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"51658330a10c0e19","mcp_get_code":{"code_sha256":"51658330a10c0e19"}},{"arxiv_id":"2407.01489","paper":"/paper/agentless-demystifying-llm-based-software","title":"Agentless: Demystifying LLM-based Software Engineering Agents","date":"2024-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"experepair/experepair","path":"ExpeRepair-v1.0/agentless_utils.py","file_url":"https://github.com/experepair/experepair/blob/HEAD/ExpeRepair-v1.0/agentless_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"227736b3e5c52f62","mcp_get_code":{"code_sha256":"227736b3e5c52f62"}},{"arxiv_id":"2407.01400","paper":"/paper/gallop-learning-global-and-local-prompts-for","title":"GalLoP: Learning Global and Local Prompts for Vision-Language Models","date":"2024-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marclafon/gallop","path":"gallop/lib/json_utils.py","file_url":"https://github.com/marclafon/gallop/blob/HEAD/gallop/lib/json_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"23d0707685a2d89b","mcp_get_code":{"code_sha256":"23d0707685a2d89b"}},{"arxiv_id":"2407.00435","paper":"/paper/rtgs-enabling-real-time-gaussian-splatting-on","title":"MetaSapiens: Real-Time Neural Rendering with Efficiency-Aware Pruning and Accelerated Foveated Rendering","date":null,"month_inferred_from_arxiv_id":"2024-07","title_source":"archive","repo":"horizon-research/fov-3dgs","path":"fov3dgs/quality_eval_layers_mmfr.py","file_url":"https://github.com/horizon-research/fov-3dgs/blob/HEAD/fov3dgs/quality_eval_layers_mmfr.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cf58e9dc07391ea5","mcp_get_code":{"code_sha256":"cf58e9dc07391ea5"}},{"arxiv_id":"2407.13690","paper":"/paper/dart-math-difficulty-aware-rejection-tuning-1","title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hkust-nlp/dart-math","path":"dart_math/utils.py","file_url":"https://github.com/hkust-nlp/dart-math/blob/HEAD/dart_math/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c40f841274b3441","mcp_get_code":{"code_sha256":"3c40f841274b3441"}},{"arxiv_id":"2406.19232","paper":"/paper/rublimp-russian-benchmark-of-linguistic","title":"RuBLiMP: Russian Benchmark of Linguistic Minimal Pairs","date":"2024-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"natasha/slovnet","path":"slovnet/io.py","file_url":"https://github.com/natasha/slovnet/blob/HEAD/slovnet/io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ea0488d1412c27b2","mcp_get_code":{"code_sha256":"ea0488d1412c27b2"}},{"arxiv_id":"2406.18522","paper":"/paper/chronomagic-bench-a-benchmark-for-metamorphic","title":"ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation","date":"2024-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pku-yuangroup/magictime","path":"data_preprocess/step2_2_preprocess_frame_caption.py","file_url":"https://github.com/pku-yuangroup/magictime/blob/HEAD/data_preprocess/step2_2_preprocess_frame_caption.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8d5c8c1fcb16fbe2","mcp_get_code":{"code_sha256":"8d5c8c1fcb16fbe2"}},{"arxiv_id":"2406.14546","paper":"/paper/connecting-the-dots-llms-can-infer-and","title":"Connecting the Dots: LLMs can Infer and Verbalize Latent Structure from Disparate Training Data","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"choidami/inductive-oocr","path":"functions/utils.py","file_url":"https://github.com/choidami/inductive-oocr/blob/HEAD/functions/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1fac2ffb996e1be5","mcp_get_code":{"code_sha256":"1fac2ffb996e1be5"}},{"arxiv_id":"2406.13123","paper":"/paper/vilco-bench-video-language-continual-learning","title":"ViLCo-Bench: VIdeo Language COntinual learning Benchmark","date":"2024-06-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cruiseresearchgroup/ViLCo","path":"NLQ/basic_utils.py","file_url":"https://github.com/cruiseresearchgroup/ViLCo/blob/HEAD/NLQ/basic_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d946250dd2f5a4f","mcp_get_code":{"code_sha256":"2d946250dd2f5a4f"}},{"arxiv_id":"2406.12546","paper":"/paper/liar-liar-logical-mire-a-benchmark-for","title":"Liar, Liar, Logical Mire: A Benchmark for Suppositional Reasoning in Large Language Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mainlp/TruthQuest","path":"metareasoning/utils/utils.py","file_url":"https://github.com/mainlp/TruthQuest/blob/HEAD/metareasoning/utils/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC-BY-SA-4.0","inline_ok":false,"code_sha256_prefix":"33346b27774b1973","mcp_get_code":{"code_sha256":"33346b27774b1973"}},{"arxiv_id":"2406.12084","paper":"/paper/when-reasoning-meets-information-aggregation","title":"When Reasoning Meets Information Aggregation: A Case Study with Sports Narratives","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yebowenhu/sportsgen","path":"benchmark.py","file_url":"https://github.com/yebowenhu/sportsgen/blob/HEAD/benchmark.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"40c9c445b5243b03","mcp_get_code":{"code_sha256":"40c9c445b5243b03"}},{"arxiv_id":"2406.12084","paper":"/paper/when-reasoning-meets-information-aggregation","title":"When Reasoning Meets Information Aggregation: A Case Study with Sports Narratives","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yebowenhu/sportsgen","path":"utils/GameGenerator.py","file_url":"https://github.com/yebowenhu/sportsgen/blob/HEAD/utils/GameGenerator.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3fb0a38707708bcc","mcp_get_code":{"code_sha256":"3fb0a38707708bcc"}},{"arxiv_id":"2406.11939","paper":"/paper/from-crowdsourced-data-to-high-quality","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lm-sys/arena-hard-auto","path":"BenchBuilder/filter.py","file_url":"https://github.com/lm-sys/arena-hard-auto/blob/HEAD/BenchBuilder/filter.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6805dfa84dd06130","mcp_get_code":{"code_sha256":"6805dfa84dd06130"}},{"arxiv_id":"2406.11813","paper":"/paper/how-do-large-language-models-acquire-factual","title":"How Do Large Language Models Acquire Factual Knowledge During Pretraining?","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kaistai/factual-knowledge-acquisition","path":"analysis/ppl_analysis.py","file_url":"https://github.com/kaistai/factual-knowledge-acquisition/blob/HEAD/analysis/ppl_analysis.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"55516c0d02594880","mcp_get_code":{"code_sha256":"55516c0d02594880"}},{"arxiv_id":"2406.11633","paper":"/paper/docgenome-an-open-large-scale-scientific","title":"DocGenome: An Open Large-scale Scientific Document Benchmark for Training and Testing Multi-modal Large Language Models","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"UniModal4Reasoning/DocGenome","path":"tutorials/utils.py","file_url":"https://github.com/UniModal4Reasoning/DocGenome/blob/HEAD/tutorials/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"e46c3c4db8ef76e8","mcp_get_code":{"code_sha256":"e46c3c4db8ef76e8"}},{"arxiv_id":"2406.11370","paper":"/paper/fairer-preferences-elicit-improved-human","title":"Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cambridgeltl/zepo","path":"zepo.py","file_url":"https://github.com/cambridgeltl/zepo/blob/HEAD/zepo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4bf2c02de1d92773","mcp_get_code":{"code_sha256":"4bf2c02de1d92773"}},{"arxiv_id":"2406.06613","paper":"/paper/gamebench-evaluating-strategic-reasoning","title":"GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents","date":"2024-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Joshuaclymer/GameBench","path":"api/util.py","file_url":"https://github.com/Joshuaclymer/GameBench/blob/HEAD/api/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cd6b2e237c65f111","mcp_get_code":{"code_sha256":"cd6b2e237c65f111"}},{"arxiv_id":"2406.02915","paper":"/paper/visual-text-cross-alignment-refining-the","title":"Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models","date":"2024-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tmlr-group/WCA","path":"helper.py","file_url":"https://github.com/tmlr-group/WCA/blob/HEAD/helper.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1069918b276d2855","mcp_get_code":{"code_sha256":"1069918b276d2855"}},{"arxiv_id":"2406.02500","paper":"/paper/demystifying-the-compression-of-mixture-of","title":"Demystifying the Compression of Mixture-of-Experts Through a Unified Framework","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"daizedong/unified-moe-compression","path":"src/llmtuner/compression/prune/io.py","file_url":"https://github.com/daizedong/unified-moe-compression/blob/HEAD/src/llmtuner/compression/prune/io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8db0c1b19aba233f","mcp_get_code":{"code_sha256":"8db0c1b19aba233f"}},{"arxiv_id":"2405.19793","paper":"/paper/pddlego-iterative-planning-in-textual","title":"PDDLEGO: Iterative Planning in Textual Environments","date":"2024-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zharry29/nl-to-pddl","path":"source/pddl_evaluation/src/util.py","file_url":"https://github.com/zharry29/nl-to-pddl/blob/HEAD/source/pddl_evaluation/src/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"550dd4e385e290a6","mcp_get_code":{"code_sha256":"550dd4e385e290a6"}},{"arxiv_id":"2405.19360","paper":"/paper/art-automatic-red-teaming-for-text-to-image","title":"ART: Automatic Red-teaming for Text-to-Image Models to Protect Benign Users","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"GuanlinLee/ART","path":"parse_comprehensive_results.py","file_url":"https://github.com/GuanlinLee/ART/blob/HEAD/parse_comprehensive_results.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"46eea92fab94e361","mcp_get_code":{"code_sha256":"46eea92fab94e361"}},{"arxiv_id":"2405.19209","paper":"/paper/videotree-adaptive-tree-based-video","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Ziyang412/VideoTree","path":"util.py","file_url":"https://github.com/Ziyang412/VideoTree/blob/HEAD/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"658682feda4928a2","mcp_get_code":{"code_sha256":"658682feda4928a2"}},{"arxiv_id":"2405.17977","paper":"/paper/aligning-to-thousands-of-preferences-via","title":"Aligning to Thousands of Preferences via System Message Generalization","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deepseek-ai/Janus","path":"janus/utils/io.py","file_url":"https://github.com/deepseek-ai/Janus/blob/HEAD/janus/utils/io.py","status":"ran_draft_wrong","verification_level":2,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"96f3e857e91a8cb8","mcp_get_code":{"code_sha256":"96f3e857e91a8cb8"}},{"arxiv_id":"2405.17814","paper":"/paper/faintbench-a-holistic-and-precise-benchmark","title":"FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Astarojth/FAIntbench-v1","path":"eval/eta/eta.py","file_url":"https://github.com/Astarojth/FAIntbench-v1/blob/HEAD/eval/eta/eta.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"cf58e9dc07391ea5","mcp_get_code":{"code_sha256":"cf58e9dc07391ea5"}},{"arxiv_id":"2405.17814","paper":"/paper/faintbench-a-holistic-and-precise-benchmark","title":"FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"astarojth/faintbench-v1","path":"eval/implicit/implicit.py","file_url":"https://github.com/astarojth/faintbench-v1/blob/HEAD/eval/implicit/implicit.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"35cf0bcb51d887c8","mcp_get_code":{"code_sha256":"35cf0bcb51d887c8"}},{"arxiv_id":"2405.17814","paper":"/paper/faintbench-a-holistic-and-precise-benchmark","title":"FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"astarojth/faintbench-v1","path":"preprocess/2_optimize.py","file_url":"https://github.com/astarojth/faintbench-v1/blob/HEAD/preprocess/2_optimize.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"2fbfe30733956499","mcp_get_code":{"code_sha256":"2fbfe30733956499"}},{"arxiv_id":"2405.15307","paper":"/paper/before-generation-align-it-a-novel-and","title":"Before Generation, Align it! A Novel and Effective Strategy for Mitigating Hallucinations in Text-to-SQL Generation","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"quge2023/TA-SQL","path":"evaluation/evaluation.py","file_url":"https://github.com/quge2023/TA-SQL/blob/HEAD/evaluation/evaluation.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"72eccdcbaaff9c8d","mcp_get_code":{"code_sha256":"72eccdcbaaff9c8d"}},{"arxiv_id":"2405.05466","paper":"/paper/poser-unmasking-alignment-faking-llms-by","title":"Poser: Unmasking Alignment Faking LLMs by Manipulating Their Internals","date":"2024-05-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sevdeawesome/POSER","path":"src/api/util.py","file_url":"https://github.com/sevdeawesome/POSER/blob/HEAD/src/api/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"39de4a28f1a99781","mcp_get_code":{"code_sha256":"39de4a28f1a99781"}},{"arxiv_id":"2405.04950","paper":"/paper/visiongraph-leveraging-large-multimodal","title":"VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context","date":"2024-05-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hitsz-tmg/visiongraph","path":"Evaluate/Evaluate_ChatGPT*.py","file_url":"https://github.com/hitsz-tmg/visiongraph/blob/HEAD/Evaluate/Evaluate_ChatGPT%2A.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3bce677b49cd7c31","mcp_get_code":{"code_sha256":"3bce677b49cd7c31"}},{"arxiv_id":"2405.04078","paper":"/paper/wiser-weak-supervision-and-supervised","title":"WISER: Weak supervISion and supErvised Representation learning to improve drug response prediction in cancer","date":"2024-05-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kyrs/WISER","path":"src/basis_dataloader.py","file_url":"https://github.com/kyrs/WISER/blob/HEAD/src/basis_dataloader.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e94528668c9e2806","mcp_get_code":{"code_sha256":"e94528668c9e2806"}},{"arxiv_id":"2405.03379","paper":"/paper/reverse-forward-curriculum-learning-for","title":"Reverse Forward Curriculum Learning for Extreme Sample and Demonstration Efficiency in Reinforcement Learning","date":"2024-05-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"stonet2000/rfcl","path":"rfcl/utils/io_utils.py","file_url":"https://github.com/stonet2000/rfcl/blob/HEAD/rfcl/utils/io_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"286a32d712c1a70d","mcp_get_code":{"code_sha256":"286a32d712c1a70d"}},{"arxiv_id":"2404.19563","paper":"/paper/repeval-effective-text-evaluation-with-llm","title":"RepEval: Effective Text Evaluation with LLM Representation","date":"2024-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maszhongming/UniEval","path":"reproduce/data_utils.py","file_url":"https://github.com/maszhongming/UniEval/blob/HEAD/reproduce/data_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"79ec7dfe27ceef16","mcp_get_code":{"code_sha256":"79ec7dfe27ceef16"}},{"arxiv_id":"2404.11972","paper":"/paper/aligning-language-models-to-explicitly-handle","title":"Aligning Language Models to Explicitly Handle Ambiguity","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"heyjoonkim/APA","path":"utils/data.py","file_url":"https://github.com/heyjoonkim/APA/blob/HEAD/utils/data.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ba0b4d82b2aefc6a","mcp_get_code":{"code_sha256":"ba0b4d82b2aefc6a"}},{"arxiv_id":"2404.08700","paper":"/paper/is-your-llm-outdated-benchmarking-llms","title":"DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMs","date":"2024-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sislab-unitn/dyknow","path":"models_output/utils.py","file_url":"https://github.com/sislab-unitn/dyknow/blob/HEAD/models_output/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c5182d6eab527d0c","mcp_get_code":{"code_sha256":"c5182d6eab527d0c"}},{"arxiv_id":"2403.20254","paper":"/paper/benchmarking-the-robustness-of-temporal","title":"Benchmarking the Robustness of Temporal Action Detection Models Against Temporal Corruptions","date":"2024-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Alvin-Zeng/temporal-robustness-benchmark","path":"extract_corrupted_feature_code/videomae_v2/libs/pre_process_data_anet.py","file_url":"https://github.com/Alvin-Zeng/temporal-robustness-benchmark/blob/HEAD/extract_corrupted_feature_code/videomae_v2/libs/pre_process_data_anet.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a8ccf61e0ee23809","mcp_get_code":{"code_sha256":"a8ccf61e0ee23809"}},{"arxiv_id":"2403.14622","paper":"/paper/language-repository-for-long-video","title":"Language Repository for Long Video Understanding","date":"2024-03-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kkahatapitiya/langrepo","path":"util.py","file_url":"https://github.com/kkahatapitiya/langrepo/blob/HEAD/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"658682feda4928a2","mcp_get_code":{"code_sha256":"658682feda4928a2"}},{"arxiv_id":"2403.13574","paper":"/paper/a-large-language-model-enhanced-sequential","title":"A Large Language Model Enhanced Sequential Recommender for Joint Video and Comment Recommendation","date":"2024-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucaibox/lsvcr","path":"comment_emb.py","file_url":"https://github.com/rucaibox/lsvcr/blob/HEAD/comment_emb.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b2f989f63a5c79dd","mcp_get_code":{"code_sha256":"b2f989f63a5c79dd"}},{"arxiv_id":"2403.11552","paper":"/paper/llm-3-large-language-model-based-task-and","title":"LLM3:Large Language Model-based Task and Motion Planning with Motion Failure Reasoning","date":"2024-03-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"assassinws/llm-tamp","path":"utils/io_util.py","file_url":"https://github.com/assassinws/llm-tamp/blob/HEAD/utils/io_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4276a32155a05d1b","mcp_get_code":{"code_sha256":"4276a32155a05d1b"}},{"arxiv_id":"2403.09040","paper":"/paper/ragged-towards-informed-design-of-retrieval","title":"RAGGED: Towards Informed Design of Retrieval Augmented Generation Systems","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neulab/ragged","path":"file_utils.py","file_url":"https://github.com/neulab/ragged/blob/HEAD/file_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"130b876997375207","mcp_get_code":{"code_sha256":"130b876997375207"}},{"arxiv_id":"2403.05286","paper":"/paper/llm4decompile-decompiling-binary-code-with","title":"LLM4Decompile: Decompiling Binary Code with Large Language Models","date":"2024-03-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"albertan017/LLM4Decompile","path":"train/colossalai_llm4decompile/colossal_llama/utils/ckpt_io.py","file_url":"https://github.com/albertan017/LLM4Decompile/blob/HEAD/train/colossalai_llm4decompile/colossal_llama/utils/ckpt_io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"edd6dea17a852638","mcp_get_code":{"code_sha256":"edd6dea17a852638"}},{"arxiv_id":"2403.04739","paper":"/paper/i-can-t-believe-it-s-not-scene-flow","title":"I Can't Believe It's Not Scene Flow!","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kylevedder/SceneFlowZoo","path":"data_prep_scripts/flatten_non_causal.py","file_url":"https://github.com/kylevedder/SceneFlowZoo/blob/HEAD/data_prep_scripts/flatten_non_causal.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a9e13d8e6c527e20","mcp_get_code":{"code_sha256":"a9e13d8e6c527e20"}},{"arxiv_id":"2403.04706","paper":"/paper/common-7b-language-models-already-possess","title":"Common 7B Language Models Already Possess Strong Math Capabilities","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jerrywu-code/susgen","path":"src/finetune.py","file_url":"https://github.com/jerrywu-code/susgen/blob/HEAD/src/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b3cd6beeda0e0909","mcp_get_code":{"code_sha256":"b3cd6beeda0e0909"}},{"arxiv_id":"2403.02076","paper":"/paper/vtg-gpt-tuning-free-zero-shot-video-temporal-1","title":"VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPT","date":"2024-03-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"YoucanBaby/VTG-GPT","path":"standalone_eval/file_utils.py","file_url":"https://github.com/YoucanBaby/VTG-GPT/blob/HEAD/standalone_eval/file_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d946250dd2f5a4f","mcp_get_code":{"code_sha256":"2d946250dd2f5a4f"}},{"arxiv_id":"2402.18695","paper":"/paper/grounding-language-models-for-visual-entity","title":"Grounding Language Models for Visual Entity Recognition","date":"2024-02-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mrzilinxiao/autover","path":"bm25_toolkit/bm25_index.py","file_url":"https://github.com/mrzilinxiao/autover/blob/HEAD/bm25_toolkit/bm25_index.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e18691c020115ad3","mcp_get_code":{"code_sha256":"e18691c020115ad3"}},{"arxiv_id":"2402.14874","paper":"/paper/distillation-contrastive-decoding-improving","title":"Distillation Contrastive Decoding: Improving LLMs Reasoning with Contrastive Decoding and Distillation","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pphuc25/distil-cd","path":"dcd_eval/src/compute_accuracy.py","file_url":"https://github.com/pphuc25/distil-cd/blob/HEAD/dcd_eval/src/compute_accuracy.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"593e5e4d03d4d4df","mcp_get_code":{"code_sha256":"593e5e4d03d4d4df"}},{"arxiv_id":"2402.13991","paper":"/paper/analysing-the-impact-of-sequence-composition","title":"Analysing The Impact of Sequence Composition on Language Model Pre-Training","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuzhaouoe/pretraining-data-packing","path":"evaluation/fewshot.py","file_url":"https://github.com/yuzhaouoe/pretraining-data-packing/blob/HEAD/evaluation/fewshot.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"813da56adc0dd787","mcp_get_code":{"code_sha256":"813da56adc0dd787"}},{"arxiv_id":"2402.11893","paper":"/paper/discerning-and-resolving-knowledge-conflicts","title":"Discerning and Resolving Knowledge Conflicts through Adaptive Decoding with Contextual Information-Entropy Constraint","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"stacy027/coiecd","path":"decoding.py","file_url":"https://github.com/stacy027/coiecd/blob/HEAD/decoding.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0d3cfc99da311a4c","mcp_get_code":{"code_sha256":"0d3cfc99da311a4c"}},{"arxiv_id":"2402.11845","paper":"/paper/modularized-networks-for-few-shot-hateful","title":"Modularized Networks for Few-shot Hateful Meme Detection","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"social-ai-studio/mod_hate","path":"src/few_hm_dataset.py","file_url":"https://github.com/social-ai-studio/mod_hate/blob/HEAD/src/few_hm_dataset.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c210122e3d082656","mcp_get_code":{"code_sha256":"c210122e3d082656"}},{"arxiv_id":"2402.11845","paper":"/paper/modularized-networks-for-few-shot-hateful","title":"Modularized Networks for Few-shot Hateful Meme Detection","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"social-ai-studio/mod_hate","path":"src/hfm_gen_eval.py","file_url":"https://github.com/social-ai-studio/mod_hate/blob/HEAD/src/hfm_gen_eval.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"818b40c2877e8a52","mcp_get_code":{"code_sha256":"818b40c2877e8a52"}},{"arxiv_id":"2402.00856","paper":"/paper/towards-efficient-and-exact-optimization-of","title":"Towards Efficient Exact Optimization of Language Model Alignment","date":"2024-02-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haozheji/exact-optimization","path":"src/align_stage/eval_kl.py","file_url":"https://github.com/haozheji/exact-optimization/blob/HEAD/src/align_stage/eval_kl.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ba3d77f8bc434527","mcp_get_code":{"code_sha256":"ba3d77f8bc434527"}},{"arxiv_id":"2401.17882","paper":"/paper/i-think-therefore-i-am-awareness-in-large","title":"I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench","date":"2024-01-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HowieHwong/TrustLLM","path":"trustllm_pkg/trustllm/utils/file_process.py","file_url":"https://github.com/HowieHwong/TrustLLM/blob/HEAD/trustllm_pkg/trustllm/utils/file_process.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"51658330a10c0e19","mcp_get_code":{"code_sha256":"51658330a10c0e19"}},{"arxiv_id":"2401.14490","paper":"/paper/longhealth-a-question-answering-benchmark","title":"LongHealth: A Question Answering Benchmark with Long Clinical Documents","date":"2024-01-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kbressem/longhealth","path":"eval/evaluate_accuracy_task1.py","file_url":"https://github.com/kbressem/longhealth/blob/HEAD/eval/evaluate_accuracy_task1.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ba7818748c5a71fa","mcp_get_code":{"code_sha256":"ba7818748c5a71fa"}},{"arxiv_id":"2401.13478","paper":"/paper/scimmir-benchmarking-scientific-multi-modal","title":"SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval","date":"2024-01-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wusiwei0410/scimmir","path":"LLMs_Embedding.py","file_url":"https://github.com/wusiwei0410/scimmir/blob/HEAD/LLMs_Embedding.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d534d5d0a52ad63f","mcp_get_code":{"code_sha256":"d534d5d0a52ad63f"}},{"arxiv_id":"2401.13478","paper":"/paper/scimmir-benchmarking-scientific-multi-modal","title":"SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval","date":"2024-01-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wusiwei0410/scimmir","path":"error_analysis.py","file_url":"https://github.com/wusiwei0410/scimmir/blob/HEAD/error_analysis.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"938f1d4d665799ca","mcp_get_code":{"code_sha256":"938f1d4d665799ca"}},{"arxiv_id":"2401.12554","paper":"/paper/can-large-language-models-write-parallel-code","title":"Can Large Language Models Write Parallel Code?","date":"2024-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"parallelcodefoundry/ParEval","path":"drivers/util.py","file_url":"https://github.com/parallelcodefoundry/ParEval/blob/HEAD/drivers/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9430b9d58bca314d","mcp_get_code":{"code_sha256":"9430b9d58bca314d"}},{"arxiv_id":"2401.11880","paper":"/paper/psysafe-a-comprehensive-framework-for","title":"PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety","date":"2024-01-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai4good24/psysafe","path":"round_extract.py","file_url":"https://github.com/ai4good24/psysafe/blob/HEAD/round_extract.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5f6710c70514745e","mcp_get_code":{"code_sha256":"5f6710c70514745e"}},{"arxiv_id":"2401.11504","paper":"/paper/with-greater-text-comes-greater-necessity","title":"With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text Generation","date":"2024-01-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"temporarylora/temp-lora","path":"helper.py","file_url":"https://github.com/temporarylora/temp-lora/blob/HEAD/helper.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"28dee895e38130b6","mcp_get_code":{"code_sha256":"28dee895e38130b6"}},{"arxiv_id":"2401.10440","paper":"/paper/breaking-the-curse-of-multilinguality-with","title":"Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"blvns/x-elm","path":"metaseq/file_io.py","file_url":"https://github.com/blvns/x-elm/blob/HEAD/metaseq/file_io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c9fd54c09adfb25d","mcp_get_code":{"code_sha256":"c9fd54c09adfb25d"}},{"arxiv_id":"2401.08573","paper":"/paper/benchmarking-the-robustness-of-image","title":"WAVES: Benchmarking the Robustness of Image Watermarks","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"umd-huang-lab/waves","path":"dev/io.py","file_url":"https://github.com/umd-huang-lab/waves/blob/HEAD/dev/io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dae4eb02495b6bb2","mcp_get_code":{"code_sha256":"dae4eb02495b6bb2"}},{"arxiv_id":"2401.06866","paper":"/paper/health-llm-large-language-models-for-health","title":"Health-LLM: Large Language Models for Health Prediction via Wearable Sensor Data","date":"2024-01-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mitmedialab/health-llm","path":"medalpaca/handler.py","file_url":"https://github.com/mitmedialab/health-llm/blob/HEAD/medalpaca/handler.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c54d2e8f99396d31","mcp_get_code":{"code_sha256":"c54d2e8f99396d31"}},{"arxiv_id":"2401.03568","paper":"/paper/agent-ai-surveying-the-horizons-of-multimodal","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","date":"2024-01-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guilk/kat","path":"build_wikidata_entity_db.py","file_url":"https://github.com/guilk/kat/blob/HEAD/build_wikidata_entity_db.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4dcad5c92be599e1","mcp_get_code":{"code_sha256":"4dcad5c92be599e1"}},{"arxiv_id":"2401.01529","paper":"/paper/glance-and-focus-memory-prompting-for-multi-1","title":"Glance and Focus: Memory Prompting for Multi-Event Video Question Answering","date":"2024-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByZ0e/Glance-Focus","path":"utils/basic_utils.py","file_url":"https://github.com/ByZ0e/Glance-Focus/blob/HEAD/utils/basic_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bace1acf5a748097","mcp_get_code":{"code_sha256":"bace1acf5a748097"}},{"arxiv_id":"2312.17235","paper":"/paper/a-simple-llm-framework-for-long-range-video","title":"A Simple LLM Framework for Long-Range Video Question-Answering","date":"2023-12-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ceezh/llovi","path":"util.py","file_url":"https://github.com/ceezh/llovi/blob/HEAD/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"658682feda4928a2","mcp_get_code":{"code_sha256":"658682feda4928a2"}},{"arxiv_id":"2312.11242","paper":"/paper/mac-sql-multi-agent-collaboration-for-text-to","title":"MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL","date":"2023-12-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wbbeyourself/mac-sql","path":"evaluation/evaluation_bird_ex.py","file_url":"https://github.com/wbbeyourself/mac-sql/blob/HEAD/evaluation/evaluation_bird_ex.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"72eccdcbaaff9c8d","mcp_get_code":{"code_sha256":"72eccdcbaaff9c8d"}},{"arxiv_id":"2312.03801","paper":"/paper/generalization-to-new-sequential-decision","title":"Generalization to New Sequential Decision Making Tasks with In-Context Learning","date":"2023-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/minihack","path":"minihack/wiki.py","file_url":"https://github.com/facebookresearch/minihack/blob/HEAD/minihack/wiki.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fec3bb7eb08698cc","mcp_get_code":{"code_sha256":"fec3bb7eb08698cc"}},{"arxiv_id":"2311.16079","paper":"/paper/meditron-70b-scaling-medical-pretraining-for","title":"MEDITRON-70B: Scaling Medical Pretraining for Large Language Models","date":"2023-11-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"epfllm/meditron","path":"evaluation/evaluate.py","file_url":"https://github.com/epfllm/meditron/blob/HEAD/evaluation/evaluate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7e8c378eedc74237","mcp_get_code":{"code_sha256":"7e8c378eedc74237"}},{"arxiv_id":"2311.12871","paper":"/paper/an-embodied-generalist-agent-in-3d-world","title":"An Embodied Generalist Agent in 3D World","date":"2023-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"embodied-generalist/embodied-generalist","path":"common/io_utils.py","file_url":"https://github.com/embodied-generalist/embodied-generalist/blob/HEAD/common/io_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bace1acf5a748097","mcp_get_code":{"code_sha256":"bace1acf5a748097"}},{"arxiv_id":"2311.07593","paper":"/paper/follow-up-differential-descriptions-language","title":"Follow-Up Differential Descriptions: Language Models Resolve Ambiguities for Image Classification","date":"2023-11-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BatsResearch/fudd","path":"prompt_factory.py","file_url":"https://github.com/BatsResearch/fudd/blob/HEAD/prompt_factory.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9f3aa6a2eca5a1a8","mcp_get_code":{"code_sha256":"9f3aa6a2eca5a1a8"}},{"arxiv_id":"2311.07590","paper":"/paper/technical-report-large-language-models-can","title":"Large Language Models can Strategically Deceive their Users when Put Under Pressure","date":"2023-11-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apolloresearch/insider-trading","path":"upload_to_playground.py","file_url":"https://github.com/apolloresearch/insider-trading/blob/HEAD/upload_to_playground.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"a81c9e6d019b0289","mcp_get_code":{"code_sha256":"a81c9e6d019b0289"}},{"arxiv_id":"2311.03054","paper":"/paper/anytext-multilingual-visual-text-generation","title":"AnyText: Multilingual Visual Text Generation And Editing","date":"2023-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tyxsspa/anytext","path":"eval/anytext_multiGPUs.py","file_url":"https://github.com/tyxsspa/anytext/blob/HEAD/eval/anytext_multiGPUs.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5958926c73426c86","mcp_get_code":{"code_sha256":"5958926c73426c86"}},{"arxiv_id":"2311.00047","paper":"/paper/grounding-visual-illusions-in-language-do","title":"Grounding Visual Illusions in Language: Do Vision-Language Models Perceive Illusions Like Humans?","date":"2023-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vl-illusion/dataset","path":"utils.py","file_url":"https://github.com/vl-illusion/dataset/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4e9a91d2693e8e22","mcp_get_code":{"code_sha256":"4e9a91d2693e8e22"}},{"arxiv_id":"2310.18511","paper":"/paper/3dcompat-an-improved-large-scale-3d-vision","title":"3DCoMPaT$^{++}$: An improved Large-scale 3D Vision Dataset for Compositional Recognition","date":"2023-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cattalyya/3dcompat-challenge","path":"download/download.py","file_url":"https://github.com/cattalyya/3dcompat-challenge/blob/HEAD/download/download.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"7c9da204a931f831","mcp_get_code":{"code_sha256":"7c9da204a931f831"}},{"arxiv_id":"2310.16040","paper":"/paper/instruct-and-extract-instruction-tuning-for","title":"Instruct and Extract: Instruction Tuning for On-Demand Information Extraction","date":"2023-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yzjiao/On-Demand-IE","path":"training/inference.py","file_url":"https://github.com/yzjiao/On-Demand-IE/blob/HEAD/training/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"70c53f6127609f82","mcp_get_code":{"code_sha256":"70c53f6127609f82"}},{"arxiv_id":"2310.08744","paper":"/paper/circuit-component-reuse-across-tasks-in","title":"Circuit Component Reuse Across Tasks in Transformer Language Models","date":"2023-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jmerullo/circuit_reuse","path":"patching_cobjs.py","file_url":"https://github.com/jmerullo/circuit_reuse/blob/HEAD/patching_cobjs.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7f229c43da2e15d7","mcp_get_code":{"code_sha256":"7f229c43da2e15d7"}},{"arxiv_id":"2310.07641","paper":"/paper/evaluating-large-language-models-at","title":"Evaluating Large Language Models at Evaluating Instruction Following","date":"2023-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-nlp/llmbar","path":"LLMEvaluator/evaluate.py","file_url":"https://github.com/princeton-nlp/llmbar/blob/HEAD/LLMEvaluator/evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"57771657a241888c","mcp_get_code":{"code_sha256":"57771657a241888c"}},{"arxiv_id":"2310.05737","paper":"/paper/language-model-beats-diffusion-tokenizer-is","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bornfly-detachment/asymmetric_magvitv2","path":"models/utils/ckpt_utils.py","file_url":"https://github.com/bornfly-detachment/asymmetric_magvitv2/blob/HEAD/models/utils/ckpt_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9edde0325b62d764","mcp_get_code":{"code_sha256":"9edde0325b62d764"}},{"arxiv_id":"2310.01045","paper":"/paper/tool-augmented-reward-modeling","title":"Tool-Augmented Reward Modeling","date":"2023-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ernie-research/Tool-Augmented-Reward-Model","path":"src/utils/file_utils.py","file_url":"https://github.com/ernie-research/Tool-Augmented-Reward-Model/blob/HEAD/src/utils/file_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"593e5e4d03d4d4df","mcp_get_code":{"code_sha256":"593e5e4d03d4d4df"}},{"arxiv_id":"2309.11325","paper":"/paper/disc-lawllm-fine-tuning-large-language-models","title":"DISC-LawLLM: Fine-tuning Large Language Models for Intelligent Legal Services","date":"2023-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fudandisc/disc-finllm","path":"eval/evaluator/utils.py","file_url":"https://github.com/fudandisc/disc-finllm/blob/HEAD/eval/evaluator/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f97998403d38cffc","mcp_get_code":{"code_sha256":"f97998403d38cffc"}},{"arxiv_id":"2309.02460","paper":"/paper/effective-multi-graph-neural-networks-for","title":"Effective Illicit Account Detection on Large Cryptocurrency MultiGraphs","date":"2023-09-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tommydzh/diam","path":"preprocess.py","file_url":"https://github.com/tommydzh/diam/blob/HEAD/preprocess.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3f381e81bed38d52","mcp_get_code":{"code_sha256":"3f381e81bed38d52"}},{"arxiv_id":"2308.09975","paper":"/paper/fineval-a-chinese-financial-domain-knowledge","title":"FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models","date":"2023-08-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sufe-aiflm-lab/fineval","path":"code/opensource_eval/2industry_eval/utils.py","file_url":"https://github.com/sufe-aiflm-lab/fineval/blob/HEAD/code/opensource_eval/2industry_eval/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f97998403d38cffc","mcp_get_code":{"code_sha256":"f97998403d38cffc"}},{"arxiv_id":"2308.07134","paper":"/paper/natural-language-is-all-a-graph-needs","title":"Language is All a Graph Needs","date":"2023-08-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"agiresearch/InstructGLM","path":"data_preprocess/Arxiv_preprocess/Flan_t5_preprocess.py","file_url":"https://github.com/agiresearch/InstructGLM/blob/HEAD/data_preprocess/Arxiv_preprocess/Flan_t5_preprocess.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2308.06259","paper":"/paper/self-alignment-with-instruction","title":"Self-Alignment with Instruction Backtranslation","date":"2023-08-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Spico197/Humback","path":"src/utils/io.py","file_url":"https://github.com/Spico197/Humback/blob/HEAD/src/utils/io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"75a5b9efca62c68e","mcp_get_code":{"code_sha256":"75a5b9efca62c68e"}},{"arxiv_id":"2307.15913","paper":"/paper/moisesdb-a-dataset-for-source-separation","title":"Moisesdb: A dataset for source separation beyond 4-stems","date":"2023-07-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"moises-ai/moises-db","path":"moisesdb/utils.py","file_url":"https://github.com/moises-ai/moises-db/blob/HEAD/moisesdb/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"2f7fbe5ec6d09511","mcp_get_code":{"code_sha256":"2f7fbe5ec6d09511"}},{"arxiv_id":"2307.07393","paper":"/paper/l-dawa-layer-wise-divergence-aware-weight","title":"L-DAWA: Layer-wise Divergence Aware Weight Aggregation in Federated Self-Supervised Visual Representation Learning","date":"2023-07-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yasar-rehman/L-DAWA","path":"Data_distribution_generation/CIFAR10_json_splitter_direchlet.py","file_url":"https://github.com/yasar-rehman/L-DAWA/blob/HEAD/Data_distribution_generation/CIFAR10_json_splitter_direchlet.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"76c22d310ccf456e","mcp_get_code":{"code_sha256":"76c22d310ccf456e"}},{"arxiv_id":"2307.01458","paper":"/paper/care-mi-chinese-benchmark-for-misinformation-1","title":"CARE-MI: Chinese Benchmark for Misinformation Evaluation in Maternity and Infant Care","date":"2023-07-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Meetyou-AI-Lab/CARE-MI","path":"care-mi/utils.py","file_url":"https://github.com/Meetyou-AI-Lab/CARE-MI/blob/HEAD/care-mi/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9e4de2d7b7dc59de","mcp_get_code":{"code_sha256":"9e4de2d7b7dc59de"}},{"arxiv_id":"2306.15255","paper":"/paper/groundnlq-ego4d-natural-language-queries","title":"GroundNLQ @ Ego4D Natural Language Queries Challenge 2023","date":"2023-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"houzhijian/groundnlq","path":"basic_utils.py","file_url":"https://github.com/houzhijian/groundnlq/blob/HEAD/basic_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d946250dd2f5a4f","mcp_get_code":{"code_sha256":"2d946250dd2f5a4f"}},{"arxiv_id":"2306.15255","paper":"/paper/groundnlq-ego4d-natural-language-queries","title":"GroundNLQ @ Ego4D Natural Language Queries Challenge 2023","date":"2023-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"houzhijian/groundnlq","path":"evaluate_ego4d_nlq.py","file_url":"https://github.com/houzhijian/groundnlq/blob/HEAD/evaluate_ego4d_nlq.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ac232ed9fafe27ee","mcp_get_code":{"code_sha256":"ac232ed9fafe27ee"}},{"arxiv_id":"2306.11134","paper":"/paper/openp5-benchmarking-foundation-models-for","title":"OpenP5: An Open-Source Platform for Developing, Training, and Evaluating LLM-based Recommender Systems","date":"2023-06-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jeykigung/P5","path":"src/pretrain_data.py","file_url":"https://github.com/jeykigung/P5/blob/HEAD/src/pretrain_data.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2306.09212","paper":"/paper/cmmlu-measuring-massive-multitask-language","title":"CMMLU: Measuring massive multitask language understanding in Chinese","date":"2023-06-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haonan-li/cmmlu","path":"src/run_pci_eval.py","file_url":"https://github.com/haonan-li/cmmlu/blob/HEAD/src/run_pci_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d2b48c3715e75af8","mcp_get_code":{"code_sha256":"d2b48c3715e75af8"}},{"arxiv_id":"2306.07282","paper":"/paper/waffling-around-for-performance-visual","title":"Waffling around for Performance: Visual Classification with Random Words and Broad Concepts","date":"2023-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ExplainableML/WaffleCLIP","path":"waffle_tools.py","file_url":"https://github.com/ExplainableML/WaffleCLIP/blob/HEAD/waffle_tools.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3de9cd37f5734894","mcp_get_code":{"code_sha256":"3de9cd37f5734894"}},{"arxiv_id":"2305.15393","paper":"/paper/layoutgpt-compositional-visual-planning-and","title":"LayoutGPT: Compositional Visual Planning and Generation with Large Language Models","date":"2023-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weixi-feng/layoutgpt","path":"utils.py","file_url":"https://github.com/weixi-feng/layoutgpt/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a0d7fd544bf9313b","mcp_get_code":{"code_sha256":"a0d7fd544bf9313b"}},{"arxiv_id":"2305.14302","paper":"/paper/vip5-towards-multimodal-foundation-models-for","title":"VIP5: Towards Multimodal Foundation Models for Recommendation","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jeykigung/vip5","path":"src/data.py","file_url":"https://github.com/jeykigung/vip5/blob/HEAD/src/data.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2305.13788","paper":"/paper/can-large-language-models-infer-and-disagree","title":"Can Large Language Models Capture Dissenting Human Voices?","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xfactlab/emnlp2023-LLM-Disagreement","path":"preprocess.py","file_url":"https://github.com/xfactlab/emnlp2023-LLM-Disagreement/blob/HEAD/preprocess.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7eb40d424f4306a5","mcp_get_code":{"code_sha256":"7eb40d424f4306a5"}},{"arxiv_id":"2305.10722","paper":"/paper/discriminative-diffusion-models-as-few-shot","title":"Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners","date":"2023-05-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eric-ai-lab/dsd","path":"utils/helper_functions.py","file_url":"https://github.com/eric-ai-lab/dsd/blob/HEAD/utils/helper_functions.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"02a978e30e225398","mcp_get_code":{"code_sha256":"02a978e30e225398"}},{"arxiv_id":"2305.10308","paper":"/paper/rethinking-data-augmentation-for-tabular-data","title":"Rethinking Data Augmentation for Tabular Data in Deep Learning","date":"2023-05-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"somaonishi/mtr","path":"trainer/utils.py","file_url":"https://github.com/somaonishi/mtr/blob/HEAD/trainer/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bd89263b70038b19","mcp_get_code":{"code_sha256":"bd89263b70038b19"}},{"arxiv_id":"2305.09565","paper":"/paper/toward-falsifying-causal-graphs-using-a","title":"Toward Falsifying Causal Graphs Using a Permutation-Based Test","date":"2023-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eeulig/dag-falsification","path":"falsifydags/utils/auxiliaries.py","file_url":"https://github.com/eeulig/dag-falsification/blob/HEAD/falsifydags/utils/auxiliaries.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c38e86388263f32f","mcp_get_code":{"code_sha256":"c38e86388263f32f"}},{"arxiv_id":"2303.08127","paper":"/paper/cb2-collaborative-natural-language","title":"CB2: Collaborative Natural Language Interaction Research Platform","date":"2023-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lil-lab/cb2","path":"follower_bots/utils.py","file_url":"https://github.com/lil-lab/cb2/blob/HEAD/follower_bots/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b22517f93442b71c","mcp_get_code":{"code_sha256":"b22517f93442b71c"}},{"arxiv_id":"2302.11154","paper":"/paper/open-domain-visual-entity-recognition-towards","title":"Open-domain Visual Entity Recognition: Towards Recognizing Millions of Wikipedia Entities","date":"2023-02-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"edchengg/oven_eval","path":"run_bm25_query.py","file_url":"https://github.com/edchengg/oven_eval/blob/HEAD/run_bm25_query.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e18691c020115ad3","mcp_get_code":{"code_sha256":"e18691c020115ad3"}},{"arxiv_id":"2301.12503","paper":"/paper/audioldm-text-to-audio-generation-with-latent","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","date":"2023-01-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haoheliu/audioldm_eval","path":"audioldm_eval/audio/tools.py","file_url":"https://github.com/haoheliu/audioldm_eval/blob/HEAD/audioldm_eval/audio/tools.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"777e661635ced528","mcp_get_code":{"code_sha256":"777e661635ced528"}},{"arxiv_id":"2301.00746","paper":"/paper/naq-leveraging-narrations-as-queries-to","title":"NaQ: Leveraging Narrations as Queries to Supervise Episodic Memory","date":"2023-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"srama2512/NaQ","path":"ReLER/ms_cm/vslnet_utils.py","file_url":"https://github.com/srama2512/NaQ/blob/HEAD/ReLER/ms_cm/vslnet_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a8ccf61e0ee23809","mcp_get_code":{"code_sha256":"a8ccf61e0ee23809"}},{"arxiv_id":"2301.00746","paper":"/paper/naq-leveraging-narrations-as-queries-to","title":"NaQ: Leveraging Narrations as Queries to Supervise Episodic Memory","date":"2023-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"srama2512/NaQ","path":"utils/create_naq_dataset.py","file_url":"https://github.com/srama2512/NaQ/blob/HEAD/utils/create_naq_dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"21e3f8885442c5f3","mcp_get_code":{"code_sha256":"21e3f8885442c5f3"}},{"arxiv_id":"2212.10847","paper":"/paper/vcnet-a-self-explaining-model-for-realistic","title":"VCNet: A self-explaining model for realistic counterfactual generation","date":"2022-12-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Orange-OpenSource/carla_croco_vcnet","path":"carla/self_explaining_model/catalog/vcnet/library/utils.py","file_url":"https://github.com/Orange-OpenSource/carla_croco_vcnet/blob/HEAD/carla/self_explaining_model/catalog/vcnet/library/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"934c3e9b8141d431","mcp_get_code":{"code_sha256":"934c3e9b8141d431"}},{"arxiv_id":"2212.03191","paper":"/paper/internvideo-general-video-foundation-models","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","date":"2022-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/internvideo","path":"Data/InternVid/utils/basic_utils.py","file_url":"https://github.com/opengvlab/internvideo/blob/HEAD/Data/InternVid/utils/basic_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2d946250dd2f5a4f","mcp_get_code":{"code_sha256":"2d946250dd2f5a4f"}},{"arxiv_id":"2210.11621","paper":"/paper/small-100-introducing-shallow-multilingual","title":"SMaLL-100: Introducing Shallow Multilingual Machine Translation Model for Low-Resource Languages","date":"2022-10-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alirezamshi/small100","path":"tokenization_small100.py","file_url":"https://github.com/alirezamshi/small100/blob/HEAD/tokenization_small100.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aba2bc51d649c01d","mcp_get_code":{"code_sha256":"aba2bc51d649c01d"}},{"arxiv_id":"2210.07183","paper":"/paper/visual-classification-via-description-from","title":"Visual Classification via Description from Large Language Models","date":"2022-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"explainableml/waffleclip","path":"waffle_tools.py","file_url":"https://github.com/explainableml/waffleclip/blob/HEAD/waffle_tools.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3de9cd37f5734894","mcp_get_code":{"code_sha256":"3de9cd37f5734894"}},{"arxiv_id":"2209.15162","paper":"/paper/linearly-mapping-from-image-to-text-space","title":"Linearly Mapping from Image to Text Space","date":"2022-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jmerullo/limber","path":"dataset.py","file_url":"https://github.com/jmerullo/limber/blob/HEAD/dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"26c48ad88add4d84","mcp_get_code":{"code_sha256":"26c48ad88add4d84"}},{"arxiv_id":"2207.06983","paper":"/paper/multitrack-music-transformer-learning-long","title":"Multitrack Music Transformer","date":"2022-07-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salu133445/mmt","path":"mmt/utils.py","file_url":"https://github.com/salu133445/mmt/blob/HEAD/mmt/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"39ad0a1e610519f3","mcp_get_code":{"code_sha256":"39ad0a1e610519f3"}},{"arxiv_id":"2207.04672","paper":"/paper/no-language-left-behind-scaling-human-1","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","date":"2022-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zurichnlp/nmtscore","path":"src/nmtscore/models/tokenization_small100.py","file_url":"https://github.com/zurichnlp/nmtscore/blob/HEAD/src/nmtscore/models/tokenization_small100.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aba2bc51d649c01d","mcp_get_code":{"code_sha256":"aba2bc51d649c01d"}},{"arxiv_id":"2207.02760","paper":"/paper/graph-trees-with-attention","title":"TREE-G: Decision Trees Contesting Graph Neural Networks","date":"2022-07-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mayabechlerspeicher/tree-g","path":"eval_utils/general.py","file_url":"https://github.com/mayabechlerspeicher/tree-g/blob/HEAD/eval_utils/general.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f753e3699554e87a","mcp_get_code":{"code_sha256":"f753e3699554e87a"}},{"arxiv_id":"2207.00383","paper":"/paper/reler-zju-alibaba-submission-to-the-ego4d","title":"ReLER@ZJU-Alibaba Submission to the Ego4D Natural Language Queries Challenge 2022","date":"2022-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nnnnai/ego4d_nlq_2022_1st_place_solution","path":"ms_cm/vslnet_utils.py","file_url":"https://github.com/nnnnai/ego4d_nlq_2022_1st_place_solution/blob/HEAD/ms_cm/vslnet_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a8ccf61e0ee23809","mcp_get_code":{"code_sha256":"a8ccf61e0ee23809"}},{"arxiv_id":"2206.05871","paper":"/paper/causal-inference-based-root-cause-analysis","title":"Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition","date":"2022-06-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"netmanaiops/circa","path":"circa/utils.py","file_url":"https://github.com/netmanaiops/circa/blob/HEAD/circa/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"176e2b5ba512dc70","mcp_get_code":{"code_sha256":"176e2b5ba512dc70"}},{"arxiv_id":"2206.02829","paper":"/paper/rorl-robust-offline-reinforcement-learning","title":"RORL: Robust Offline Reinforcement Learning via Conservative Smoothing","date":"2022-06-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yangrui2015/rorl","path":"experiment_utils/utils.py","file_url":"https://github.com/yangrui2015/rorl/blob/HEAD/experiment_utils/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c0cd96043462cd86","mcp_get_code":{"code_sha256":"c0cd96043462cd86"}},{"arxiv_id":"2206.00700","paper":"/paper/rocoursenet-distributionally-robust-training","title":"RoCourseNet: Distributionally Robust Training of a Prediction Aware Recourse Model","date":"2022-06-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bkghz-orange-blue/counternet_adv","path":"counterfactual/utils.py","file_url":"https://github.com/bkghz-orange-blue/counternet_adv/blob/HEAD/counterfactual/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"934c3e9b8141d431","mcp_get_code":{"code_sha256":"934c3e9b8141d431"}},{"arxiv_id":"2205.12680","paper":"/paper/refining-query-representations-for-dense","title":"Optimizing Test-Time Query Representations for Dense Retrieval","date":"2022-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dmis-lab/tour","path":"cross_encoder.py","file_url":"https://github.com/dmis-lab/tour/blob/HEAD/cross_encoder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8d6173f6bbbf118a","mcp_get_code":{"code_sha256":"8d6173f6bbbf118a"}},{"arxiv_id":"2205.10747","paper":"/paper/language-models-with-image-descriptors-are","title":"Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners","date":"2022-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mikewangwzhl/vidil","path":"eval_video_qa_result.py","file_url":"https://github.com/mikewangwzhl/vidil/blob/HEAD/eval_video_qa_result.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0c5833eaff6e8453","mcp_get_code":{"code_sha256":"0c5833eaff6e8453"}},{"arxiv_id":"2204.01680","paper":"/paper/tallformer-temporal-action-localization-with","title":"TALLFormer: Temporal Action Localization with a Long-memory Transformer","date":"2022-04-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"klauscc/tallformer","path":"AFSD/anet_video_cls/anet_dataset.py","file_url":"https://github.com/klauscc/tallformer/blob/HEAD/AFSD/anet_video_cls/anet_dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f59d6fac89230aac","mcp_get_code":{"code_sha256":"f59d6fac89230aac"}},{"arxiv_id":"2203.03800","paper":"/paper/unknown-aware-object-detection-learning-what","title":"Unknown-Aware Object Detection: Learning What You Don't Know from Videos in the Wild","date":"2022-03-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deeplearning-wisc/stud","path":"datasets/convert_bdd_3cls.py","file_url":"https://github.com/deeplearning-wisc/stud/blob/HEAD/datasets/convert_bdd_3cls.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":false,"code_sha256_prefix":"3dd63d36b0af2850","mcp_get_code":{"code_sha256":"3dd63d36b0af2850"}},{"arxiv_id":"2203.01825","paper":"/paper/what-makes-transfer-learning-work-for-medical","title":"What Makes Transfer Learning Work For Medical Images: Feature Reuse & Other Factors","date":"2022-03-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ChrisMats/feature-reuse","path":"utils/helpfuns.py","file_url":"https://github.com/ChrisMats/feature-reuse/blob/HEAD/utils/helpfuns.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7107762a922c0736","mcp_get_code":{"code_sha256":"7107762a922c0736"}},{"arxiv_id":"2112.07133","paper":"/paper/clip-lite-information-efficient-visual","title":"CLIP-Lite: Information Efficient Visual Representation Learning with Language Supervision","date":"2021-12-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"4m4n5/CLIP-Lite","path":"bias_eda.py","file_url":"https://github.com/4m4n5/CLIP-Lite/blob/HEAD/bias_eda.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4ee4f4cc01e655ca","mcp_get_code":{"code_sha256":"4ee4f4cc01e655ca"}},{"arxiv_id":"2112.05682","paper":"/paper/self-attention-does-not-need-o-n-2-memory","title":"Self-attention Does Not Need $O(n^2)$ Memory","date":"2021-12-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"X-iZhang/Libra","path":"libra/eval/radiology_report.py","file_url":"https://github.com/X-iZhang/Libra/blob/HEAD/libra/eval/radiology_report.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a3698e4aaee89be7","mcp_get_code":{"code_sha256":"a3698e4aaee89be7"}},{"arxiv_id":"2111.15664","paper":"/paper/donut-document-understanding-transformer","title":"OCR-free Document Understanding Transformer","date":"2021-11-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"clovaai/donut","path":"donut/util.py","file_url":"https://github.com/clovaai/donut/blob/HEAD/donut/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"263020461a3e369d","mcp_get_code":{"code_sha256":"263020461a3e369d"}},{"arxiv_id":"2111.10367","paper":"/paper/slue-new-benchmark-tasks-for-spoken-language","title":"SLUE: New Benchmark Tasks for Spoken Language Understanding Evaluation on Natural Speech","date":"2021-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"asappresearch/slue-toolkit","path":"slue_toolkit/generic_utils.py","file_url":"https://github.com/asappresearch/slue-toolkit/blob/HEAD/slue_toolkit/generic_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"16afefff56a55570","mcp_get_code":{"code_sha256":"16afefff56a55570"}},{"arxiv_id":"2110.04292","paper":"/paper/toward-a-visual-concept-vocabulary-for-gan-1","title":"Toward a Visual Concept Vocabulary for GAN Latent Space","date":"2021-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"schwettmann/visual-vocab","path":"visualvocab/deps/netdissect/easydict.py","file_url":"https://github.com/schwettmann/visual-vocab/blob/HEAD/visualvocab/deps/netdissect/easydict.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c4b1e3a489d47780","mcp_get_code":{"code_sha256":"c4b1e3a489d47780"}},{"arxiv_id":"2110.00061","paper":"/paper/scientific-evidence-extraction","title":"PubTables-1M: Towards comprehensive table extraction from unstructured documents","date":"2021-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"phamquiluan/table-transformer","path":"core.py","file_url":"https://github.com/phamquiluan/table-transformer/blob/HEAD/core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"7c2ef30ca5a59095","mcp_get_code":{"code_sha256":"7c2ef30ca5a59095"}},{"arxiv_id":"2107.06383","paper":"/paper/how-much-can-clip-benefit-vision-and-language","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","date":"2021-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jianjieluo/openai-clip-feature","path":"basic_utils.py","file_url":"https://github.com/jianjieluo/openai-clip-feature/blob/HEAD/basic_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"2d946250dd2f5a4f","mcp_get_code":{"code_sha256":"2d946250dd2f5a4f"}},{"arxiv_id":"2106.11959","paper":"/paper/revisiting-deep-learning-models-for-tabular","title":"Revisiting Deep Learning Models for Tabular Data","date":"2021-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Yura52/tabular-dl-revisiting-models","path":"lib/util.py","file_url":"https://github.com/Yura52/tabular-dl-revisiting-models/blob/HEAD/lib/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2f33af03ea909beb","mcp_get_code":{"code_sha256":"2f33af03ea909beb"}},{"arxiv_id":"2106.08087","paper":"/paper/cblue-a-chinese-biomedical-language","title":"CBLUE: A Chinese Biomedical Language Understanding Evaluation Benchmark","date":"2021-06-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cbluebenchmark/cblue","path":"cblue/utils.py","file_url":"https://github.com/cbluebenchmark/cblue/blob/HEAD/cblue/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e02b2a940d01312d","mcp_get_code":{"code_sha256":"e02b2a940d01312d"}},{"arxiv_id":"2106.01202","paper":"/paper/framing-rnn-as-a-kernel-method-a-neural-ode","title":"Framing RNN as a kernel method: A neural ODE approach","date":"2021-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"afermanian/rnn-kernel","path":"utils.py","file_url":"https://github.com/afermanian/rnn-kernel/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"81ec1c7a270adfc9","mcp_get_code":{"code_sha256":"81ec1c7a270adfc9"}},{"arxiv_id":"2105.11544","paper":"/paper/deep-learning-based-damage-mapping-with-insar","title":"Deep Learning-based Damage Mapping with InSAR Coherence Time Series","date":"2021-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"olliestephenson/dpm-rnn-public","path":"generate_dpm.py","file_url":"https://github.com/olliestephenson/dpm-rnn-public/blob/HEAD/generate_dpm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"80f7689e7087217d","mcp_get_code":{"code_sha256":"80f7689e7087217d"}},{"arxiv_id":"2104.12476","paper":"/paper/eigengan-layer-wise-eigen-learning-for-gans","title":"EigenGAN: Layer-Wise Eigen-Learning for GANs","date":"2021-04-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LynnHo/EigenGAN-Tensorflow","path":"pylib/serialization.py","file_url":"https://github.com/LynnHo/EigenGAN-Tensorflow/blob/HEAD/pylib/serialization.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"be1179109aef84de","mcp_get_code":{"code_sha256":"be1179109aef84de"}},{"arxiv_id":"2104.08398","paper":"/paper/re-tacred-addressing-shortcomings-of-the","title":"Re-TACRED: Addressing Shortcomings of the TACRED Dataset","date":"2021-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gstoica27/Re-TACRED","path":"Re-TACRED/apply_patch.py","file_url":"https://github.com/gstoica27/Re-TACRED/blob/HEAD/Re-TACRED/apply_patch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"813da56adc0dd787","mcp_get_code":{"code_sha256":"813da56adc0dd787"}},{"arxiv_id":"2010.16262","paper":"/paper/experimental-design-for-mri-by-greedy-policy","title":"Experimental design for MRI by greedy policy search","date":"2020-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Timsey/pg_mri","path":"src/helpers/utils.py","file_url":"https://github.com/Timsey/pg_mri/blob/HEAD/src/helpers/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4ee4f4cc01e655ca","mcp_get_code":{"code_sha256":"4ee4f4cc01e655ca"}},{"arxiv_id":"2010.11125","paper":"/paper/beyond-english-centric-multilingual-machine","title":"Beyond English-Centric Multilingual Machine Translation","date":"2020-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ikergarcia1996/Easy-Translate","path":"utils/tokenization_small100.py","file_url":"https://github.com/ikergarcia1996/Easy-Translate/blob/HEAD/utils/tokenization_small100.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aba2bc51d649c01d","mcp_get_code":{"code_sha256":"aba2bc51d649c01d"}},{"arxiv_id":"2010.03790","paper":"/paper/text-based-rl-agents-with-commonsense","title":"Text-based RL Agents with Commonsense Knowledge: New Challenges, Environments and Baselines","date":"2020-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IBM/commonsense-rl","path":"game_generation/twc_data.py","file_url":"https://github.com/IBM/commonsense-rl/blob/HEAD/game_generation/twc_data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"066e4dbaa7dc5bcd","mcp_get_code":{"code_sha256":"066e4dbaa7dc5bcd"}},{"arxiv_id":"2010.00515","paper":"/paper/linguistic-structure-guided-context-modeling-1","title":"Linguistic Structure Guided Context Modeling for Referring Image Segmentation","date":"2020-10-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"spyflying/LSCM-Refseg","path":"util/io.py","file_url":"https://github.com/spyflying/LSCM-Refseg/blob/HEAD/util/io.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d946250dd2f5a4f","mcp_get_code":{"code_sha256":"2d946250dd2f5a4f"}},{"arxiv_id":"2009.12626","paper":"/paper/dwie-an-entity-centric-dataset-for-multi-task","title":"DWIE: an entity-centric dataset for multi-task document-level information extraction","date":"2020-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"klimzaporojets/DWIE","path":"src/dwie_evaluation.py","file_url":"https://github.com/klimzaporojets/DWIE/blob/HEAD/src/dwie_evaluation.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"c767859799a51b24","mcp_get_code":{"code_sha256":"c767859799a51b24"}},{"arxiv_id":"2009.07641","paper":"/paper/bsn-complementary-boundary-regressor-with","title":"BSN++: Complementary Boundary Regressor with Scale-Balanced Relation Modeling for Temporal Action Proposal Generation","date":"2020-09-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xxcheng0708/BSNPlusPlus-boundary-sensitive-network","path":"dataset.py","file_url":"https://github.com/xxcheng0708/BSNPlusPlus-boundary-sensitive-network/blob/HEAD/dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1e0bb35d27bdc115","mcp_get_code":{"code_sha256":"1e0bb35d27bdc115"}},{"arxiv_id":"2009.07641","paper":"/paper/bsn-complementary-boundary-regressor-with","title":"BSN++: Complementary Boundary Regressor with Scale-Balanced Relation Modeling for Temporal Action Proposal Generation","date":"2020-09-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xxcheng0708/BSNPlusPlus-boundary-sensitive-network","path":"post_processing.py","file_url":"https://github.com/xxcheng0708/BSNPlusPlus-boundary-sensitive-network/blob/HEAD/post_processing.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e924a491a8d3290b","mcp_get_code":{"code_sha256":"e924a491a8d3290b"}},{"arxiv_id":"2009.07378","paper":"/paper/bop-challenge-2020-on-6d-object-localization","title":"BOP Challenge 2020 on 6D Object Localization","date":"2020-09-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thodan/bop_toolkit","path":"bop_toolkit_lib/inout.py","file_url":"https://github.com/thodan/bop_toolkit/blob/HEAD/bop_toolkit_lib/inout.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c141d39b1c2fdf08","mcp_get_code":{"code_sha256":"c141d39b1c2fdf08"}},{"arxiv_id":"2008.01352","paper":"/paper/pde-driven-spatiotemporal-disentanglement","title":"PDE-Driven Spatiotemporal Disentanglement","date":"2020-08-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JeremDona/spatiotemporal_variable_separation","path":"var_sep/utils/helper.py","file_url":"https://github.com/JeremDona/spatiotemporal_variable_separation/blob/HEAD/var_sep/utils/helper.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1525ee5c735dc09b","mcp_get_code":{"code_sha256":"1525ee5c735dc09b"}},{"arxiv_id":"2008.00807","paper":"/paper/adding-seemingly-uninformative-labels-helps","title":"Adding Seemingly Uninformative Labels Helps in Low Data Regimes","date":"2020-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ChrisMats/seemingly_uninformative_labels","path":"src/helpfuns.py","file_url":"https://github.com/ChrisMats/seemingly_uninformative_labels/blob/HEAD/src/helpfuns.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dee4b3f39d2e97e3","mcp_get_code":{"code_sha256":"dee4b3f39d2e97e3"}},{"arxiv_id":"2007.11744","paper":"/paper/end-to-end-optimization-of-scene-layout-1","title":"End-to-End Optimization of Scene Layout","date":"2020-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aluo-x/3D_SLN","path":"models/misc.py","file_url":"https://github.com/aluo-x/3D_SLN/blob/HEAD/models/misc.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"095a900bebc6eb1e","mcp_get_code":{"code_sha256":"095a900bebc6eb1e"}},{"arxiv_id":"2007.11744","paper":"/paper/end-to-end-optimization-of-scene-layout-1","title":"End-to-End Optimization of Scene Layout","date":"2020-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aluo-x/3D_SLN","path":"render/render_caller.py","file_url":"https://github.com/aluo-x/3D_SLN/blob/HEAD/render/render_caller.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2c077e742f417c7c","mcp_get_code":{"code_sha256":"2c077e742f417c7c"}},{"arxiv_id":"2006.13726","paper":"/paper/imbalanced-gradients-a-new-cause-of","title":"Imbalanced Gradients: A Subtle Cause of Overestimated Adversarial Robustness","date":"2020-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hanxunh/mdattack","path":"collect_results.py","file_url":"https://github.com/hanxunh/mdattack/blob/HEAD/collect_results.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"44930808e0a51ad4","mcp_get_code":{"code_sha256":"44930808e0a51ad4"}},{"arxiv_id":"2005.08139","paper":"/paper/train-in-germany-test-in-the-usa-making-3d","title":"Train in Germany, Test in The USA: Making 3D Object Detectors Generalize","date":"2020-05-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cxy1997/3D_adapt_auto_driving","path":"stat_norm/norm.py","file_url":"https://github.com/cxy1997/3D_adapt_auto_driving/blob/HEAD/stat_norm/norm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a86d4564ef1cb3c9","mcp_get_code":{"code_sha256":"a86d4564ef1cb3c9"}},{"arxiv_id":"2005.07877","paper":"/paper/micronet-for-efficient-language-modeling","title":"MicroNet for Efficient Language Modeling","date":"2020-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mit-han-lab/neurips-micronet","path":"u.py","file_url":"https://github.com/mit-han-lab/neurips-micronet/blob/HEAD/u.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9fd2543dd0d158f8","mcp_get_code":{"code_sha256":"9fd2543dd0d158f8"}},{"arxiv_id":"2005.07421","paper":"/paper/spelling-error-correction-with-soft-masked","title":"Spelling Error Correction with Soft-Masked BERT","date":"2020-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gitabtion/BertBasedCorrectionModels","path":"bbcm/utils/file_io.py","file_url":"https://github.com/gitabtion/BertBasedCorrectionModels/blob/HEAD/bbcm/utils/file_io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fa2946b9355af8b5","mcp_get_code":{"code_sha256":"fa2946b9355af8b5"}},{"arxiv_id":"2005.00695","paper":"/paper/on-the-generalization-effects-of-linear","title":"On the Generalization Effects of Linear Transformations in Data Augmentation","date":"2020-05-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SenWu/dauphin","path":"dauphin/utils.py","file_url":"https://github.com/SenWu/dauphin/blob/HEAD/dauphin/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e10d4efe152bbf23","mcp_get_code":{"code_sha256":"e10d4efe152bbf23"}},{"arxiv_id":"2004.01177","paper":"/paper/tracking-objects-as-points","title":"Tracking Objects as Points","date":"2020-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hampen2929/CenterTrack","path":"notebook/util.py","file_url":"https://github.com/hampen2929/CenterTrack/blob/HEAD/notebook/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f0654f3740c34713","mcp_get_code":{"code_sha256":"f0654f3740c34713"}},{"arxiv_id":"2003.06222","paper":"/paper/an-evaluation-of-change-point-detection","title":"An Evaluation of Change Point Detection Algorithms","date":"2020-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alan-turing-institute/TCPDBench","path":"analysis/scripts/summarize.py","file_url":"https://github.com/alan-turing-institute/TCPDBench/blob/HEAD/analysis/scripts/summarize.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"811e1abb6d8304bb","mcp_get_code":{"code_sha256":"811e1abb6d8304bb"}},{"arxiv_id":"2002.09219","paper":"/paper/stochastic-latent-residual-video-prediction-1","title":"Stochastic Latent Residual Video Prediction","date":"2020-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"edouardelasalles/srvp","path":"helper.py","file_url":"https://github.com/edouardelasalles/srvp/blob/HEAD/helper.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1525ee5c735dc09b","mcp_get_code":{"code_sha256":"1525ee5c735dc09b"}},{"arxiv_id":"2001.09099","paper":"/paper/tvr-a-large-scale-dataset-for-video-subtitle","title":"TVR: A Large-Scale Dataset for Video-Subtitle Moment Retrieval","date":"2020-01-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jayleicn/TVCaption","path":"utils/basic_utils.py","file_url":"https://github.com/jayleicn/TVCaption/blob/HEAD/utils/basic_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d946250dd2f5a4f","mcp_get_code":{"code_sha256":"2d946250dd2f5a4f"}},{"arxiv_id":"2001.09099","paper":"/paper/tvr-a-large-scale-dataset-for-video-subtitle","title":"TVR: A Large-Scale Dataset for Video-Subtitle Moment Retrieval","date":"2020-01-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jayleicn/TVCaption","path":"baselines/multimodal_transformer/local_utils.py","file_url":"https://github.com/jayleicn/TVCaption/blob/HEAD/baselines/multimodal_transformer/local_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2001.06202","paper":"/paper/fedvision-an-online-visual-object-detection","title":"FedVision: An Online Visual Object Detection Platform Powered by Federated Learning","date":"2020-01-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ShenSuanZiZhen/NIID_Person_Detection","path":"fl_client.py","file_url":"https://github.com/ShenSuanZiZhen/NIID_Person_Detection/blob/HEAD/fl_client.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d0bb7013dd302153","mcp_get_code":{"code_sha256":"d0bb7013dd302153"}},{"arxiv_id":"1912.01054","paper":"/paper/the-state-of-the-art-in-kidney-and-kidney","title":"The state of the art in kidney and kidney tumor segmentation in contrast-enhanced CT imaging: Results of the KiTS19 Challenge","date":"2019-12-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neheller/kits23","path":"kits23/annotation/postprocessing.py","file_url":"https://github.com/neheller/kits23/blob/HEAD/kits23/annotation/postprocessing.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6993351600481a61","mcp_get_code":{"code_sha256":"6993351600481a61"}},{"arxiv_id":"1911.11462","paper":"/paper/g-tad-sub-graph-localization-for-temporal","title":"G-TAD: Sub-Graph Localization for Temporal Action Detection","date":"2019-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Frostinassiky/gtad","path":"gtad_lib/dataset.py","file_url":"https://github.com/Frostinassiky/gtad/blob/HEAD/gtad_lib/dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1ebdd50b19a19bc3","mcp_get_code":{"code_sha256":"1ebdd50b19a19bc3"}},{"arxiv_id":"1911.00720","paper":"/paper/zen-pre-training-chinese-text-encoder","title":"ZEN: Pre-training Chinese Text Encoder Enhanced by N-gram Representations","date":"2019-11-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cuhksz-nlp/het-mc","path":"hetmc_helper.py","file_url":"https://github.com/cuhksz-nlp/het-mc/blob/HEAD/hetmc_helper.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3872690ce9ded1c4","mcp_get_code":{"code_sha256":"3872690ce9ded1c4"}},{"arxiv_id":"1910.11089","paper":"/paper/real-world-image-datasets-for-federated","title":"Real-World Image Datasets for Federated Learning","date":"2019-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiahuanluo/Federated-Benchmark","path":"fl_client.py","file_url":"https://github.com/jiahuanluo/Federated-Benchmark/blob/HEAD/fl_client.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d0bb7013dd302153","mcp_get_code":{"code_sha256":"d0bb7013dd302153"}},{"arxiv_id":"1909.11874","paper":"/paper/compact-trilinear-interaction-for-visual","title":"Compact Trilinear Interaction for Visual Question Answering","date":"2019-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aioz-ai/ICCV19_VQA-CTI","path":"src/evaluate_TDIUC.py","file_url":"https://github.com/aioz-ai/ICCV19_VQA-CTI/blob/HEAD/src/evaluate_TDIUC.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6652b5d834042107","mcp_get_code":{"code_sha256":"6652b5d834042107"}},{"arxiv_id":"1909.02622","paper":"/paper/moverscore-text-generation-evaluating-with","title":"MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance","date":"2019-09-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuhui-zh15/nlg_metrics","path":"nlg_metrics/moverscore/examples/run_summarization.py","file_url":"https://github.com/yuhui-zh15/nlg_metrics/blob/HEAD/nlg_metrics/moverscore/examples/run_summarization.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a4efe24ba7c8300b","mcp_get_code":{"code_sha256":"a4efe24ba7c8300b"}},{"arxiv_id":"1907.12461","paper":"/paper/leveraging-pre-trained-checkpoints-for","title":"Leveraging Pre-trained Checkpoints for Sequence Generation Tasks","date":"2019-07-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"m3hrdadfi/news-headline-generation","path":"app/utils/utils.py","file_url":"https://github.com/m3hrdadfi/news-headline-generation/blob/HEAD/app/utils/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d97765a6c8a014f3","mcp_get_code":{"code_sha256":"d97765a6c8a014f3"}},{"arxiv_id":"1907.10568","paper":"/paper/investigating-evaluation-of-open-domain","title":"Investigating Evaluation of Open-Domain Dialogue Systems With Human Generated Multiple References","date":"2019-07-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"prakharguptaz/multirefeval","path":"Code/score_multiref.py","file_url":"https://github.com/prakharguptaz/multirefeval/blob/HEAD/Code/score_multiref.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"adf64d9f13c821c6","mcp_get_code":{"code_sha256":"adf64d9f13c821c6"}},{"arxiv_id":"1907.09702","paper":"/paper/bmn-boundary-matching-network-for-temporal","title":"BMN: Boundary-Matching Network for Temporal Action Proposal Generation","date":"2019-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JJBOY/BMN-Boundary-Matching-Network","path":"dataset.py","file_url":"https://github.com/JJBOY/BMN-Boundary-Matching-Network/blob/HEAD/dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1e0bb35d27bdc115","mcp_get_code":{"code_sha256":"1e0bb35d27bdc115"}},{"arxiv_id":"1907.09702","paper":"/paper/bmn-boundary-matching-network-for-temporal","title":"BMN: Boundary-Matching Network for Temporal Action Proposal Generation","date":"2019-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JJBOY/BMN-Boundary-Matching-Network","path":"post_processing.py","file_url":"https://github.com/JJBOY/BMN-Boundary-Matching-Network/blob/HEAD/post_processing.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e924a491a8d3290b","mcp_get_code":{"code_sha256":"e924a491a8d3290b"}},{"arxiv_id":"1907.01669","paper":"/paper/multiwoz-21-multi-domain-dialogue-state","title":"MultiWOZ 2.1: A Consolidated Multi-Domain Dialogue Dataset with State Corrections and State Tracking Baselines","date":"2019-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qbxlvnf11/MultiWOZ2.1-Parser","path":"util.py","file_url":"https://github.com/qbxlvnf11/MultiWOZ2.1-Parser/blob/HEAD/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8636114389cbc947","mcp_get_code":{"code_sha256":"8636114389cbc947"}},{"arxiv_id":"1904.11574","paper":"/paper/tvqa-spatio-temporal-grounding-for-video","title":"TVQA+: Spatio-Temporal Grounding for Video Question Answering","date":"2019-04-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jayleicn/TVQA-PLUS","path":"utils.py","file_url":"https://github.com/jayleicn/TVQA-PLUS/blob/HEAD/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"1903.02188","paper":"/paper/bidirectional-attentive-memory-networks-for","title":"Bidirectional Attentive Memory Networks for Question Answering over Knowledge Bases","date":"2019-03-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hugochan/PFoodReq","path":"data_builder/src/utils/io_utils.py","file_url":"https://github.com/hugochan/PFoodReq/blob/HEAD/data_builder/src/utils/io_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e26cf1b4355fc107","mcp_get_code":{"code_sha256":"e26cf1b4355fc107"}},{"arxiv_id":"1902.01950","paper":"/paper/meta-amortized-variational-inference-and","title":"Meta-Amortized Variational Inference and Learning","date":"2019-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mhw32/meta-inference-public","path":"src/utils.py","file_url":"https://github.com/mhw32/meta-inference-public/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6712587e99c8ae0b","mcp_get_code":{"code_sha256":"6712587e99c8ae0b"}},{"arxiv_id":"1812.01718","paper":"/paper/deep-learning-for-classical-japanese","title":"Deep Learning for Classical Japanese Literature","date":"2018-12-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"huckiyang/MOT-Kuzushiji-Fashion-Video","path":"modules/utils.py","file_url":"https://github.com/huckiyang/MOT-Kuzushiji-Fashion-Video/blob/HEAD/modules/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0b4f56034d066154","mcp_get_code":{"code_sha256":"0b4f56034d066154"}},{"arxiv_id":"1811.10597","paper":"/paper/gan-dissection-visualizing-and-understanding","title":"GAN Dissection: Visualizing and Understanding Generative Adversarial Networks","date":"2018-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CSAILVision/gandissect","path":"netdissect/easydict.py","file_url":"https://github.com/CSAILVision/gandissect/blob/HEAD/netdissect/easydict.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c4b1e3a489d47780","mcp_get_code":{"code_sha256":"c4b1e3a489d47780"}},{"arxiv_id":"1810.00278","paper":"/paper/multiwoz-a-large-scale-multi-domain-wizard-of","title":"MultiWOZ -- A Large-Scale Multi-Domain Wizard-of-Oz Dataset for Task-Oriented Dialogue Modelling","date":"2018-09-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jojonki/MultiWOZ-Parser","path":"parser.py","file_url":"https://github.com/jojonki/MultiWOZ-Parser/blob/HEAD/parser.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"bfce457fe5f613eb","mcp_get_code":{"code_sha256":"bfce457fe5f613eb"}},{"arxiv_id":"1809.07454","paper":"/paper/tasnet-surpassing-ideal-time-frequency","title":"Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation","date":"2018-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"funcwj/conv-tasnet","path":"nnet/libs/utils.py","file_url":"https://github.com/funcwj/conv-tasnet/blob/HEAD/nnet/libs/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1a0aeff1eb7546d6","mcp_get_code":{"code_sha256":"1a0aeff1eb7546d6"}},{"arxiv_id":"1809.06364","paper":"/paper/generalizing-across-multi-objective-reward","title":"Generalizing Across Multi-Objective Reward Functions in Deep Reinforcement Learning","date":"2018-09-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"trality/fire","path":"src/util.py","file_url":"https://github.com/trality/fire/blob/HEAD/src/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9a0282092a5e7066","mcp_get_code":{"code_sha256":"9a0282092a5e7066"}},{"arxiv_id":"1809.01696","paper":"/paper/tvqa-localized-compositional-video-question","title":"TVQA: Localized, Compositional Video Question Answering","date":"2018-09-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jayleicn/TVQA","path":"utils.py","file_url":"https://github.com/jayleicn/TVQA/blob/HEAD/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"1806.06498","paper":"/paper/conditional-affordance-learning-for-driving","title":"Conditional Affordance Learning for Driving in Urban Environments","date":"2018-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xl-sr/CAL","path":"python_client/agents/CAL_agent/perception/cal_network.py","file_url":"https://github.com/xl-sr/CAL/blob/HEAD/python_client/agents/CAL_agent/perception/cal_network.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"45fe6ae45321b7ad","mcp_get_code":{"code_sha256":"45fe6ae45321b7ad"}},{"arxiv_id":"1805.07594","paper":"/paper/generalizing-point-embeddings-using-the","title":"Generalizing Point Embeddings using the Wasserstein Space of Elliptical Distributions","date":"2018-05-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"albpurpura/PE4IR","path":"MP_WN_WE/util.py","file_url":"https://github.com/albpurpura/PE4IR/blob/HEAD/MP_WN_WE/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"066e4dbaa7dc5bcd","mcp_get_code":{"code_sha256":"066e4dbaa7dc5bcd"}},{"arxiv_id":"1803.04996","paper":"/paper/comparing-task-simplifications-to-learn","title":"Comparing Task Simplifications to Learn Closed-Loop Object Picking Using Deep Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2018-03","title_source":"archive","repo":"BarisYazici/deep-rl-grasping","path":"manipulation_main/common/io_utils.py","file_url":"https://github.com/BarisYazici/deep-rl-grasping/blob/HEAD/manipulation_main/common/io_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f4d4d7adae1e6db6","mcp_get_code":{"code_sha256":"f4d4d7adae1e6db6"}},{"arxiv_id":"1802.06182","paper":"/paper/crepe-a-convolutional-representation-for","title":"CREPE: A Convolutional Representation for Pitch Estimation","date":"2018-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bpiyush/SoundOfWater","path":"shared/utils/io.py","file_url":"https://github.com/bpiyush/SoundOfWater/blob/HEAD/shared/utils/io.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f2e5cc3d297dbfda","mcp_get_code":{"code_sha256":"f2e5cc3d297dbfda"}},{"arxiv_id":"1606.02820","paper":"/paper/inducing-domain-specific-sentiment-lexicons","title":"Inducing Domain-Specific Sentiment Lexicons from Unlabeled Corpora","date":"2016-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"williamleif/socialsent","path":"socialsent/util.py","file_url":"https://github.com/williamleif/socialsent/blob/HEAD/socialsent/util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9ce8828808f61c99","mcp_get_code":{"code_sha256":"9ce8828808f61c99"}},{"arxiv_id":"1506.05908","paper":"/paper/deep-knowledge-tracing","title":"Deep Knowledge Tracing","date":"2015-06-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qqhann/KnowledgeTracing","path":"src/path.py","file_url":"https://github.com/qqhann/KnowledgeTracing/blob/HEAD/src/path.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7186e392cdb3794b","mcp_get_code":{"code_sha256":"7186e392cdb3794b"}},{"arxiv_id":"aaai_19900","paper":null,"title":"arXiv:aaai_19900","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"cg1177/DCAN","path":"dcan_anet/dataset.py","file_url":"https://github.com/cg1177/DCAN/blob/HEAD/dcan_anet/dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"dc1482f0574c1e5e","mcp_get_code":{"code_sha256":"dc1482f0574c1e5e"}},{"arxiv_id":"Wang_Language-Driven_Multi-Label_Zero-Shot_Learning_with_Semantic_Granularity_ICCV_2025_paper","paper":null,"title":"arXiv:Wang_Language-Driven_Multi-Label_Zero-Shot_Learning_with_Semantic_Granularity_ICCV_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"wangshouwen/RCNn","path":"datasets/caption.py","file_url":"https://github.com/wangshouwen/RCNn/blob/HEAD/datasets/caption.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3de9cd37f5734894","mcp_get_code":{"code_sha256":"3de9cd37f5734894"}},{"arxiv_id":"2025.findings-emnlp.427","paper":null,"title":"arXiv:2025.findings-emnlp.427","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Shuzhong-Lai/ASD-iLLM","path":"utils.py","file_url":"https://github.com/Shuzhong-Lai/ASD-iLLM/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b2f989f63a5c79dd","mcp_get_code":{"code_sha256":"b2f989f63a5c79dd"}},{"arxiv_id":"2025.findings-emnlp.1385","paper":null,"title":"arXiv:2025.findings-emnlp.1385","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"bowen-upenn/ControlText","path":"eval/controlnet_multiGPUs.py","file_url":"https://github.com/bowen-upenn/ControlText/blob/HEAD/eval/controlnet_multiGPUs.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5958926c73426c86","mcp_get_code":{"code_sha256":"5958926c73426c86"}},{"arxiv_id":"2025.findings-emnlp.103","paper":null,"title":"arXiv:2025.findings-emnlp.103","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"yha9806/VULCA-EMNLP2025","path":"src/utils.py","file_url":"https://github.com/yha9806/VULCA-EMNLP2025/blob/HEAD/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d061807bd07dc5b","mcp_get_code":{"code_sha256":"2d061807bd07dc5b"}},{"arxiv_id":"2025.findings-acl.294","paper":null,"title":"arXiv:2025.findings-acl.294","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"kkahatapitiya/LangRepo","path":"util.py","file_url":"https://github.com/kkahatapitiya/LangRepo/blob/HEAD/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"658682feda4928a2","mcp_get_code":{"code_sha256":"658682feda4928a2"}},{"arxiv_id":"2025.findings-acl.1107","paper":null,"title":"arXiv:2025.findings-acl.1107","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"travis-xu/PEToolBench","path":"utils.py","file_url":"https://github.com/travis-xu/PEToolBench/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7ad43195eb0a1b17","mcp_get_code":{"code_sha256":"7ad43195eb0a1b17"}},{"arxiv_id":"2025.emnlp-main.67","paper":null,"title":"arXiv:2025.emnlp-main.67","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"isyuhaochen/RRC-DSCD","path":"code/data_processing/cot_data_distill/merge_data.py","file_url":"https://github.com/isyuhaochen/RRC-DSCD/blob/HEAD/code/data_processing/cot_data_distill/merge_data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8f887c241039bc44","mcp_get_code":{"code_sha256":"8f887c241039bc44"}},{"arxiv_id":"2025.acl-long.1500","paper":null,"title":"arXiv:2025.acl-long.1500","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"leezythu/FocusLLM","path":"infbench_src/eval_utils.py","file_url":"https://github.com/leezythu/FocusLLM/blob/HEAD/infbench_src/eval_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"41e438356614fa31","mcp_get_code":{"code_sha256":"41e438356614fa31"}},{"arxiv_id":"2025.acl-long.1425","paper":null,"title":"arXiv:2025.acl-long.1425","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"D2I-ai/struxgpt","path":"src/utils/io.py","file_url":"https://github.com/D2I-ai/struxgpt/blob/HEAD/src/utils/io.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b560dcb8becd1b02","mcp_get_code":{"code_sha256":"b560dcb8becd1b02"}},{"arxiv_id":"2024.findings-emnlp.897","paper":null,"title":"arXiv:2024.findings-emnlp.897","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Hengrui-Gu/T2IKnowledgeEditing","path":"utils.py","file_url":"https://github.com/Hengrui-Gu/T2IKnowledgeEditing/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"62fb09a0f8c7bb39","mcp_get_code":{"code_sha256":"62fb09a0f8c7bb39"}},{"arxiv_id":"2024.findings-acl.148","paper":null,"title":"arXiv:2024.findings-acl.148","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"HillZhang1999/MuCGEC","path":"models/seq2seq-based-CGEC/utils.py","file_url":"https://github.com/HillZhang1999/MuCGEC/blob/HEAD/models/seq2seq-based-CGEC/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8a8d4f4b964a92a9","mcp_get_code":{"code_sha256":"8a8d4f4b964a92a9"}},{"arxiv_id":"2024.emnlp-main.1209","paper":null,"title":"arXiv:2024.emnlp-main.1209","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"CeeZh/LLoVi","path":"util.py","file_url":"https://github.com/CeeZh/LLoVi/blob/HEAD/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"658682feda4928a2","mcp_get_code":{"code_sha256":"658682feda4928a2"}},{"arxiv_id":"2023.findings-emnlp.644","paper":null,"title":"arXiv:2023.findings-emnlp.644","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"jeykigung/VIP5","path":"src/data.py","file_url":"https://github.com/jeykigung/VIP5/blob/HEAD/src/data.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53d425eb1278ddda","mcp_get_code":{"code_sha256":"53d425eb1278ddda"}},{"arxiv_id":"2022.findings-emnlp.24","paper":null,"title":"arXiv:2022.findings-emnlp.24","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"StanLei52/TQVSR","path":"utils/basic_utils.py","file_url":"https://github.com/StanLei52/TQVSR/blob/HEAD/utils/basic_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9e5eaeace9e19d6e","mcp_get_code":{"code_sha256":"9e5eaeace9e19d6e"}},{"arxiv_id":"2021.findings-emnlp.112","paper":null,"title":"arXiv:2021.findings-emnlp.112","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"bepoetree/MTTOD","path":"utils/io_utils.py","file_url":"https://github.com/bepoetree/MTTOD/blob/HEAD/utils/io_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6699a992b525f720","mcp_get_code":{"code_sha256":"6699a992b525f720"}}]}