{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/get-tokens","entry":"get_tokens","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":40,"n_papers_ran":32,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":19,"n_samples_ran":11,"n_samples_fingerprinted":8,"n_places":41,"n_places_pointer_only":11,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":3,"ran_fixture":0,"ran":8,"unverified":8},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.12875","paper":"/paper/arxiv-2608-12875","title":"The Embedder's Dilemma: LLMs Are Better, but at What Cost?","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"embeddings-benchmark/embedders-dilemma","path":"llm_judge/evaluators/llm_rag_evaluator.py","file_url":"https://github.com/embeddings-benchmark/embedders-dilemma/blob/HEAD/llm_judge/evaluators/llm_rag_evaluator.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2d6aa73765f8c641","mcp_get_code":{"code_sha256":"2d6aa73765f8c641"}},{"arxiv_id":"2608.08024","paper":"/paper/arxiv-2608-08024","title":"Prompt Embedding Probes (PEP): Hallucination Detection in LLMs from Hidden States","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"zazamrykh/internal_probing","path":"src/dataset/squad_eval.py","file_url":"https://github.com/zazamrykh/internal_probing/blob/HEAD/src/dataset/squad_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2607.20833","paper":"/paper/arxiv-2607-20833","title":"ReFact: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"NEUIR/REFACT","path":"verl/verl/utils/reward_score/evdience_reward.py","file_url":"https://github.com/NEUIR/REFACT/blob/HEAD/verl/verl/utils/reward_score/evdience_reward.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ef36c60282378811","mcp_get_code":{"code_sha256":"ef36c60282378811"}},{"arxiv_id":"2605.29250","paper":"/paper/arxiv-2605-29250","title":"OmniRetrieval: Unified Retrieval across Heterogeneous Knowledge Sources","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"JinheonBaek/OmniRetrieval","path":"src/evaluation/metrics.py","file_url":"https://github.com/JinheonBaek/OmniRetrieval/blob/HEAD/src/evaluation/metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2412.09560","paper":"/paper/foundational-large-language-models-for","title":"Foundational Large Language Models for Materials Research","date":"2024-12-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"M3RG-IITD/llamat","path":"src/Kshot-val.py","file_url":"https://github.com/M3RG-IITD/llamat/blob/HEAD/src/Kshot-val.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2412.06206","paper":"/paper/sirerag-indexing-similar-and-related","title":"SiReRAG: Indexing Similar and Related Information for Multihop Reasoning","date":"2024-12-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SalesforceAIResearch/SiReRAG","path":"evaluate_musique.py","file_url":"https://github.com/SalesforceAIResearch/SiReRAG/blob/HEAD/evaluate_musique.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2410.09629","paper":"/paper/synthetic-knowledge-ingestion-towards","title":"Synthetic Knowledge Ingestion: Towards Knowledge Refinement and Injection for Enhancing Large Language Models","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"intuit-ai-research/knowledge-infused-ai","path":"synthetic-knowledge-ingestion/finetuning/ft_llama_factory.py","file_url":"https://github.com/intuit-ai-research/knowledge-infused-ai/blob/HEAD/synthetic-knowledge-ingestion/finetuning/ft_llama_factory.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2409.14507","paper":"/paper/a-is-for-absorption-studying-feature","title":"A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders","date":"2024-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lasr-spelling/sae-spelling","path":"sae_spelling/vocab.py","file_url":"https://github.com/lasr-spelling/sae-spelling/blob/HEAD/sae_spelling/vocab.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"927eb86571fdf5f4","mcp_get_code":{"code_sha256":"927eb86571fdf5f4"}},{"arxiv_id":"2402.14433","paper":"/paper/a-language-model-s-guide-through-latent-space","title":"A Language Model's Guide Through Latent Space","date":"2024-02-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dvruette/concept-guidance","path":"concept_guidance/activations.py","file_url":"https://github.com/dvruette/concept-guidance/blob/HEAD/concept_guidance/activations.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b168d5fa90d9b20d","mcp_get_code":{"code_sha256":"b168d5fa90d9b20d"}},{"arxiv_id":"2401.07977","paper":"/paper/leveraging-external-knowledge-resources-to","title":"Towards Efficient Methods in Medical Question Answering using Knowledge Graph Embeddings","date":"2024-01-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"saptarshi059/cdqa-project","path":"covid_qa_baseline.py","file_url":"https://github.com/saptarshi059/cdqa-project/blob/HEAD/covid_qa_baseline.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2311.09821","paper":"/paper/towards-robust-temporal-reasoning-of-large","title":"Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning","date":"2023-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nusnlp/complex-tr","path":"prompt_experiment/sem_metric/evaluate.py","file_url":"https://github.com/nusnlp/complex-tr/blob/HEAD/prompt_experiment/sem_metric/evaluate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"72ae17e5ad61f6cb","mcp_get_code":{"code_sha256":"72ae17e5ad61f6cb"}},{"arxiv_id":"2310.14503","paper":"/paper/diversify-question-generation-with-retrieval","title":"Diversify Question Generation with Retrieval-Augmented Style Transfer","date":"2023-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gouqi666/RAST","path":"eval_squad.py","file_url":"https://github.com/gouqi666/RAST/blob/HEAD/eval_squad.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"011d5cd744886e9d","mcp_get_code":{"code_sha256":"011d5cd744886e9d"}},{"arxiv_id":"2310.12836","paper":"/paper/knowledge-augmented-language-model","title":"Knowledge-Augmented Language Model Verification","date":"2023-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jinheonbaek/kalmv","path":"metrics.py","file_url":"https://github.com/jinheonbaek/kalmv/blob/HEAD/metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2310.12836","paper":"/paper/knowledge-augmented-language-model","title":"Knowledge-Augmented Language Model Verification","date":"2023-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JinheonBaek/KALMV","path":"models/verifiers.py","file_url":"https://github.com/JinheonBaek/KALMV/blob/HEAD/models/verifiers.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a2c23eaf23140be2","mcp_get_code":{"code_sha256":"a2c23eaf23140be2"}},{"arxiv_id":"2310.05157","paper":"/paper/menatqa-a-new-dataset-for-testing-the","title":"MenatQA: A New Dataset for Testing the Temporal Comprehension and Reasoning Abilities of Large Language Models","date":"2023-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weiyifan1023/MenatQA","path":"src/utils.py","file_url":"https://github.com/weiyifan1023/MenatQA/blob/HEAD/src/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"575722a6543d189e","mcp_get_code":{"code_sha256":"575722a6543d189e"}},{"arxiv_id":"2310.04408","paper":"/paper/recomp-improving-retrieval-augmented-lms-with","title":"RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation","date":"2023-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"carriex/recomp","path":"eval_utils.py","file_url":"https://github.com/carriex/recomp/blob/HEAD/eval_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"496046a8354a8130","mcp_get_code":{"code_sha256":"496046a8354a8130"}},{"arxiv_id":"2308.16475","paper":"/paper/transformer-compression-via-subspace","title":"$\\rm SP^3$: Enhancing Structured Pruning via PCA Projection","date":"2023-08-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hyx1999/sp3","path":"bert/metric/squad_v2.py","file_url":"https://github.com/hyx1999/sp3/blob/HEAD/bert/metric/squad_v2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"72ae17e5ad61f6cb","mcp_get_code":{"code_sha256":"72ae17e5ad61f6cb"}},{"arxiv_id":"2308.08973","paper":"/paper/beam-retrieval-general-end-to-end-retrieval","title":"End-to-End Beam Retrieval for Multi-Hop Question Answering","date":"2023-08-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"canghongjian/beam_retriever","path":"gpt_turbo_exp.py","file_url":"https://github.com/canghongjian/beam_retriever/blob/HEAD/gpt_turbo_exp.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8a4f13df2795176e","mcp_get_code":{"code_sha256":"8a4f13df2795176e"}},{"arxiv_id":"2306.06191","paper":"/paper/open-data-on-github-unlocking-the-potential","title":"Open Data on GitHub: Unlocking the Potential of AI","date":"2023-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rajpurkar/SQuAD-explorer","path":"evaluate-v2.0.py","file_url":"https://github.com/rajpurkar/SQuAD-explorer/blob/HEAD/evaluate-v2.0.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2305.12191","paper":"/paper/pointwise-mutual-information-based-metric-and","title":"Pointwise Mutual Information Based Metric and Decoding Strategy for Faithful Generation in Document Grounded Dialogs","date":"2023-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ynandwan/pmi-faith","path":"faithfulness-metrics/src/compute_faithfulness_api.py","file_url":"https://github.com/ynandwan/pmi-faith/blob/HEAD/faithfulness-metrics/src/compute_faithfulness_api.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9c6cb7a5a08fbe5d","mcp_get_code":{"code_sha256":"9c6cb7a5a08fbe5d"}},{"arxiv_id":"2305.09955","paper":"/paper/cook-empowering-general-purpose-language","title":"Knowledge Card: Filling LLMs' Knowledge Gaps with Plug-in Specialized Language Models","date":"2023-05-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bunsenfeng/knowledge_card","path":"eval_datasets/MidtermQA/odqa_utils.py","file_url":"https://github.com/bunsenfeng/knowledge_card/blob/HEAD/eval_datasets/MidtermQA/odqa_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"496046a8354a8130","mcp_get_code":{"code_sha256":"496046a8354a8130"}},{"arxiv_id":"2109.08133","paper":"/paper/phrase-retrieval-learns-passage-retrieval-too","title":"Phrase Retrieval Learns Passage Retrieval, Too","date":"2021-09-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-nlp/DensePhrases","path":"densephrases/utils/squad_metrics.py","file_url":"https://github.com/princeton-nlp/DensePhrases/blob/HEAD/densephrases/utils/squad_metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2108.06314","paper":"/paper/a-dataset-for-answering-time-sensitive","title":"A Dataset for Answering Time-Sensitive Questions","date":"2021-08-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wenhuchen/time-sensitive-qa","path":"utils.py","file_url":"https://github.com/wenhuchen/time-sensitive-qa/blob/HEAD/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"575722a6543d189e","mcp_get_code":{"code_sha256":"575722a6543d189e"}},{"arxiv_id":"2106.01465","paper":"/paper/ethical-advice-taker-do-language-models","title":"Ethical-Advice Taker: Do Language Models Understand Natural Language Interventions?","date":"2021-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"allenai/ethical-interventions","path":"mutils.py","file_url":"https://github.com/allenai/ethical-interventions/blob/HEAD/mutils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"db2b74b069046e20","mcp_get_code":{"code_sha256":"db2b74b069046e20"}},{"arxiv_id":"2105.13889","paper":"/paper/equilibrium-and-non-equilibrium-regimes-in","title":"Equilibrium and non-Equilibrium regimes in the learning of Restricted Boltzmann Machines","date":"2021-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AurelienDecelle/TorchRBM","path":"rbm/fasta_utils.py","file_url":"https://github.com/AurelienDecelle/TorchRBM/blob/HEAD/rbm/fasta_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7eff798ee21e285c","mcp_get_code":{"code_sha256":"7eff798ee21e285c"}},{"arxiv_id":"2105.02692","paper":"/paper/learning-to-perturb-word-embeddings-for-out","title":"Learning to Perturb Word Embeddings for Out-of-distribution QA","date":"2021-05-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seanie12/SWEP","path":"squad_metrics.py","file_url":"https://github.com/seanie12/SWEP/blob/HEAD/squad_metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2104.04302","paper":"/paper/annotating-and-modeling-fine-grained","title":"Annotating and Modeling Fine-grained Factuality in Summarization","date":"2021-04-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tagoyal/factuality-datasets","path":"evaluate_generated_outputs.py","file_url":"https://github.com/tagoyal/factuality-datasets/blob/HEAD/evaluate_generated_outputs.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"702775d840e23942","mcp_get_code":{"code_sha256":"702775d840e23942"}},{"arxiv_id":"2010.08983","paper":"/paper/towards-interpreting-bert-for-reading","title":"Towards Interpreting BERT for Reading Comprehension Based QA","date":"2020-10-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2010.04898","paper":"/paper/open-domain-question-answering-goes","title":"Open-Domain Question Answering Goes Conversational via Question Rewriting","date":"2020-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apple/ml-qrecc","path":"utils/evaluate_qa.py","file_url":"https://github.com/apple/ml-qrecc/blob/HEAD/utils/evaluate_qa.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"119c6dab40b4b162","mcp_get_code":{"code_sha256":"119c6dab40b4b162"}},{"arxiv_id":"2006.12467","paper":"/paper/limits-to-depth-efficiencies-of-self","title":"The Depth-to-Width Interplay in Self-Attention","date":"2020-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uf-hobi-informatics-lab/GatorTron","path":"finetuning/qa/evaluate-squad-v2.0.py","file_url":"https://github.com/uf-hobi-informatics-lab/GatorTron/blob/HEAD/finetuning/qa/evaluate-squad-v2.0.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2004.13922","paper":"/paper/revisiting-pre-trained-models-for-chinese","title":"Revisiting Pre-Trained Models for Chinese Natural Language Processing","date":"2020-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ymcui/Chinese-PreTrained-XLNet","path":"src/squad_utils.py","file_url":"https://github.com/ymcui/Chinese-PreTrained-XLNet/blob/HEAD/src/squad_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2004.07347","paper":"/paper/hybridqa-a-dataset-of-multi-hop-question","title":"HybridQA: A Dataset of Multi-Hop Question Answering over Tabular and Textual Data","date":"2020-04-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"1910.01244","paper":"/paper/linking-artificial-and-human-neural","title":"Linking artificial and human neural representations of language","date":"2019-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hans/nn-decoding","path":"bin/eval_squad.py","file_url":"https://github.com/hans/nn-decoding/blob/HEAD/bin/eval_squad.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"1908.08962","paper":"/paper/well-read-students-learn-better-the-impact-of","title":"Well-Read Students Learn Better: On the Importance of Pre-training Compact Models","date":"2019-08-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"somiltg/bert","path":"evaluate-v2.0.py","file_url":"https://github.com/somiltg/bert/blob/HEAD/evaluate-v2.0.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"1902.01718","paper":"/paper/end-to-end-open-domain-question-answering","title":"End-to-End Open-Domain Question Answering with BERTserini","date":"2019-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rsvp-ai/bertserini","path":"bertserini/utils/utils_squad_metrics.py","file_url":"https://github.com/rsvp-ai/bertserini/blob/HEAD/bertserini/utils/utils_squad_metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Zehui127/SQUAD_BERT","path":"SQUAD/evaluate-v2.0.py","file_url":"https://github.com/Zehui127/SQUAD_BERT/blob/HEAD/SQUAD/evaluate-v2.0.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"aaai_16733","paper":null,"title":"arXiv:aaai_16733","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"rajammanabrolu/WorldGeneration","path":"neural-based/KG-extraction/utils_squad_evaluate.py","file_url":"https://github.com/rajammanabrolu/WorldGeneration/blob/HEAD/neural-based/KG-extraction/utils_squad_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2024.findings-emnlp.365","paper":null,"title":"arXiv:2024.findings-emnlp.365","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"UKPLab/m2qa","path":"Experiments/M2QA_Metric/m2qa_metric.py","file_url":"https://github.com/UKPLab/m2qa/blob/HEAD/Experiments/M2QA_Metric/m2qa_metric.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c74510c72823459a","mcp_get_code":{"code_sha256":"c74510c72823459a"}},{"arxiv_id":"2023.findings-eacl.134","paper":null,"title":"arXiv:2023.findings-eacl.134","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"UniversalPropositions/PriMeSRL-Eval","path":"src/proposed/conversion.py","file_url":"https://github.com/UniversalPropositions/PriMeSRL-Eval/blob/HEAD/src/proposed/conversion.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d0749cdadb55fd4f","mcp_get_code":{"code_sha256":"d0749cdadb55fd4f"}},{"arxiv_id":"2023.emnlp-main.803","paper":null,"title":"arXiv:2023.emnlp-main.803","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"yisunlp/Anti-CF","path":"utils/metrics.py","file_url":"https://github.com/yisunlp/Anti-CF/blob/HEAD/utils/metrics.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aa6bc32d9c17a2f1","mcp_get_code":{"code_sha256":"aa6bc32d9c17a2f1"}},{"arxiv_id":"2022.findings-emnlp.48","paper":null,"title":"arXiv:2022.findings-emnlp.48","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"souvikdgp16/FADE","path":"datasets/calculate_unigram_probability.py","file_url":"https://github.com/souvikdgp16/FADE/blob/HEAD/datasets/calculate_unigram_probability.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0af007f9a8c6b6db","mcp_get_code":{"code_sha256":"0af007f9a8c6b6db"}}]}