{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/preprocess-text","entry":"preprocess_text","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":26,"n_papers_ran":15,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":26,"n_samples_ran":14,"n_samples_fingerprinted":12,"n_places":29,"n_places_pointer_only":17,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":6,"ran_fixture":0,"ran":8,"unverified":12},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2604.11841","paper":"/paper/arxiv-2604-11841","title":"Polynomial Expansion Rank Adaptation: Enhancing Low-Rank Fine-Tuning with High-Order Interactions","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"zhangwenhao6/PERA","path":"dataset/dataset_helper.py","file_url":"https://github.com/zhangwenhao6/PERA/blob/HEAD/dataset/dataset_helper.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"f343f672c3ddd483","mcp_get_code":{"code_sha256":"f343f672c3ddd483"}},{"arxiv_id":"2601.12154","paper":"/paper/arxiv-2601-12154","title":"Analyzing Cancer Patients' Experiences with Embedding-based Topic Modeling and LLMs","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"4dpicture/TM4health","path":"BERT-topic_main.py","file_url":"https://github.com/4dpicture/TM4health/blob/HEAD/BERT-topic_main.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5be1e77cf9455131","mcp_get_code":{"code_sha256":"5be1e77cf9455131"}},{"arxiv_id":"2601.12154","paper":"/paper/arxiv-2601-12154","title":"Analyzing Cancer Patients' Experiences with Embedding-based Topic Modeling and LLMs","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"4dpicture/TM4health","path":"Top2Vec_main.py","file_url":"https://github.com/4dpicture/TM4health/blob/HEAD/Top2Vec_main.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"31c4c5deccef16a5","mcp_get_code":{"code_sha256":"31c4c5deccef16a5"}},{"arxiv_id":"2601.10712","paper":"/paper/arxiv-2601-10712","title":"MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"quchangle1/MatchTIR","path":"Code/verl/utils/reward_score/tool.py","file_url":"https://github.com/quchangle1/MatchTIR/blob/HEAD/Code/verl/utils/reward_score/tool.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"11664393d2a5d440","mcp_get_code":{"code_sha256":"11664393d2a5d440"}},{"arxiv_id":"2511.00177","paper":"/paper/arxiv-2511-00177","title":"Can SAEs reveal and mitigate racial biases of LLMs in healthcare?","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"hibaahsan/sae_bias","path":"src/steer_bhcs.py","file_url":"https://github.com/hibaahsan/sae_bias/blob/HEAD/src/steer_bhcs.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cdfacc9dd53d6bcd","mcp_get_code":{"code_sha256":"cdfacc9dd53d6bcd"}},{"arxiv_id":"2510.14967","paper":"/paper/arxiv-2510-14967","title":"Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"GuoqingWang1/IGPO","path":"evaluate/cacluate_metrics.py","file_url":"https://github.com/GuoqingWang1/IGPO/blob/HEAD/evaluate/cacluate_metrics.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"567311eaeb3eeea6","mcp_get_code":{"code_sha256":"567311eaeb3eeea6"}},{"arxiv_id":"2509.15786","paper":"/paper/arxiv-2509-15786","title":"Building Data-Driven Occupation Taxonomies: A Bottom-Up Multi-Stage Approach via Semantic Clustering and Multi-Agent Collaboration","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"aida-ugent/CLIMB","path":"src/get_embeddings.py","file_url":"https://github.com/aida-ugent/CLIMB/blob/HEAD/src/get_embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"daf229f8df309a33","mcp_get_code":{"code_sha256":"daf229f8df309a33"}},{"arxiv_id":"2410.14204","paper":"/paper/meditod-an-english-dialogue-dataset-for","title":"MediTOD: An English Dialogue Dataset for Medical History Taking with Comprehensive Annotations","date":"2024-10-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dair-iitd/MediTOD","path":"metrics/nlg_metrics.py","file_url":"https://github.com/dair-iitd/MediTOD/blob/HEAD/metrics/nlg_metrics.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a6ac4d0ef910ae31","mcp_get_code":{"code_sha256":"a6ac4d0ef910ae31"}},{"arxiv_id":"2409.08330","paper":"/paper/real-or-robotic-assessing-whether-llms","title":"Real or Robotic? Assessing Whether LLMs Accurately Simulate Qualities of Human Responses in Dialogue","date":"2024-09-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"davidjurgens/human-llm-similarity","path":"src/analysis/constituency_parse.py","file_url":"https://github.com/davidjurgens/human-llm-similarity/blob/HEAD/src/analysis/constituency_parse.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c3e35dbeaa8a7e0c","mcp_get_code":{"code_sha256":"c3e35dbeaa8a7e0c"}},{"arxiv_id":"2406.18187","paper":"/paper/selective-prompting-tuning-for-personalized","title":"Selective Prompting Tuning for Personalized Conversations with LLMs","date":"2024-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hqsiswiliam/SPT","path":"dataset/dataset_helper.py","file_url":"https://github.com/hqsiswiliam/SPT/blob/HEAD/dataset/dataset_helper.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f343f672c3ddd483","mcp_get_code":{"code_sha256":"f343f672c3ddd483"}},{"arxiv_id":"2406.01512","paper":"/paper/mad-multi-alignment-meg-to-text-decoding","title":"MAD: Multi-Alignment MEG-to-Text Decoding","date":"2024-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neuspeech/mad-meg2text","path":"evaluation.py","file_url":"https://github.com/neuspeech/mad-meg2text/blob/HEAD/evaluation.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2908e3c7f6faafb0","mcp_get_code":{"code_sha256":"2908e3c7f6faafb0"}},{"arxiv_id":"2405.21070","paper":"/paper/generalization-beyond-data-imbalance-a","title":"What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cvmi-lab/clip-beyond-tail","path":"concept_freq_utils/calc_class_frequency.py","file_url":"https://github.com/cvmi-lab/clip-beyond-tail/blob/HEAD/concept_freq_utils/calc_class_frequency.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"18545f8c98643da8","mcp_get_code":{"code_sha256":"18545f8c98643da8"}},{"arxiv_id":"2405.19327","paper":"/paper/map-neo-highly-capable-and-transparent","title":"MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"multimodal-art-projection/map-neo","path":"Matrix/get_high_quality_data/consturct_dataset.py","file_url":"https://github.com/multimodal-art-projection/map-neo/blob/HEAD/Matrix/get_high_quality_data/consturct_dataset.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cafca988e5b20807","mcp_get_code":{"code_sha256":"cafca988e5b20807"}},{"arxiv_id":"2405.15585","paper":"/paper/synergizing-in-context-learning-with-hints","title":"Synergizing In-context Learning with Hints for End-to-end Task-oriented Dialog Systems","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dair-iitd/SyncTOD","path":"src/prompting/prompt_gen.py","file_url":"https://github.com/dair-iitd/SyncTOD/blob/HEAD/src/prompting/prompt_gen.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a2572769e9a0fc2d","mcp_get_code":{"code_sha256":"a2572769e9a0fc2d"}},{"arxiv_id":"2404.12391","paper":"/paper/on-the-content-bias-in-frechet-video-distance","title":"On the Content Bias in Fréchet Video Distance","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"songweige/tats","path":"tats/coinrun/coinrun_data.py","file_url":"https://github.com/songweige/tats/blob/HEAD/tats/coinrun/coinrun_data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"24674c65e5c3df68","mcp_get_code":{"code_sha256":"24674c65e5c3df68"}},{"arxiv_id":"2404.07117","paper":"/paper/continuous-language-model-interpolation-for","title":"Continuous Language Model Interpolation for Dynamic and Controllable Text Generation","date":"2024-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"skangasl/continuous-lm-interpolation","path":"finetuning/finetune_classifier.py","file_url":"https://github.com/skangasl/continuous-lm-interpolation/blob/HEAD/finetuning/finetune_classifier.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"756ad99fad4efd57","mcp_get_code":{"code_sha256":"756ad99fad4efd57"}},{"arxiv_id":"2402.03290","paper":"/paper/instancediffusion-instance-level-control-for","title":"InstanceDiffusion: Instance-level Control for Image Generation","date":"2024-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"frank-xwang/InstanceDiffusion","path":"dataset-generation/submitit_automatic_label_ram_save_json.py","file_url":"https://github.com/frank-xwang/InstanceDiffusion/blob/HEAD/dataset-generation/submitit_automatic_label_ram_save_json.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cc40c350f2fdbdf0","mcp_get_code":{"code_sha256":"cc40c350f2fdbdf0"}},{"arxiv_id":"2402.01685","paper":"/paper/smutf-schema-matching-using-generative-tags","title":"SMUTF: Schema Matching Using Generative Tags and Hybrid Features","date":"2024-01-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fireindark707/python-schema-matching","path":"relation_features.py","file_url":"https://github.com/fireindark707/python-schema-matching/blob/HEAD/relation_features.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c30d94617013b74c","mcp_get_code":{"code_sha256":"c30d94617013b74c"}},{"arxiv_id":"2311.03250","paper":"/paper/instructed-language-models-with-retrievers","title":"Instructed Language Models with Retrievers Are Powerful Entity Linkers","date":"2023-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mrzilinxiao/insgenentitylinking","path":"data_scripts/wiki_dump.py","file_url":"https://github.com/mrzilinxiao/insgenentitylinking/blob/HEAD/data_scripts/wiki_dump.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8ea3c73453786f73","mcp_get_code":{"code_sha256":"8ea3c73453786f73"}},{"arxiv_id":"2310.09505","paper":"/paper/advancing-test-time-adaptation-for-acoustic","title":"Advancing Test-Time Adaptation in Wild Acoustic Test Settings","date":"2023-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Waffle-Liu/CEA","path":"corpus/l2arctic.py","file_url":"https://github.com/Waffle-Liu/CEA/blob/HEAD/corpus/l2arctic.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e6c3900dd3f5b5a3","mcp_get_code":{"code_sha256":"e6c3900dd3f5b5a3"}},{"arxiv_id":"2306.01981","paper":"/paper/sgem-test-time-adaptation-for-automatic","title":"SGEM: Test-Time Adaptation for Automatic Speech Recognition via Sequential-Level Generalized Entropy Minimization","date":"2023-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"drumpt/sgem","path":"corpus/commonvoice.py","file_url":"https://github.com/drumpt/sgem/blob/HEAD/corpus/commonvoice.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e6c3900dd3f5b5a3","mcp_get_code":{"code_sha256":"e6c3900dd3f5b5a3"}},{"arxiv_id":"2306.01981","paper":"/paper/sgem-test-time-adaptation-for-automatic","title":"SGEM: Test-Time Adaptation for Automatic Speech Recognition via Sequential-Level Generalized Entropy Minimization","date":"2023-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"drumpt/sgem","path":"corpus/preprocess_ted.py","file_url":"https://github.com/drumpt/sgem/blob/HEAD/corpus/preprocess_ted.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3f1c87031de7b002","mcp_get_code":{"code_sha256":"3f1c87031de7b002"}},{"arxiv_id":"2105.12002","paper":"/paper/super-tickets-in-pre-trained-language-models","title":"Super Tickets in Pre-Trained Language Models: From Model Compression to Improving Generalization","date":"2021-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cliang1453/super-structured-lottery-tickets","path":"data_utils/xlnet_utils.py","file_url":"https://github.com/cliang1453/super-structured-lottery-tickets/blob/HEAD/data_utils/xlnet_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"b19697c998adb1ea","mcp_get_code":{"code_sha256":"b19697c998adb1ea"}},{"arxiv_id":"2007.13184","paper":"/paper/kuisail-at-semeval-2020-task-12-bert-cnn-for","title":"KUISAIL at SemEval-2020 Task 12: BERT-CNN for Offensive Speech Identification in Social Media","date":"2020-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alisafaya/OffensEval2020","path":"bert-cnn.py","file_url":"https://github.com/alisafaya/OffensEval2020/blob/HEAD/bert-cnn.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c86227bb02c3af92","mcp_get_code":{"code_sha256":"c86227bb02c3af92"}},{"arxiv_id":"2004.13922","paper":"/paper/revisiting-pre-trained-models-for-chinese","title":"Revisiting Pre-Trained Models for Chinese Natural Language Processing","date":"2020-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ymcui/Chinese-PreTrained-XLNet","path":"src/prepro_utils.py","file_url":"https://github.com/ymcui/Chinese-PreTrained-XLNet/blob/HEAD/src/prepro_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b19697c998adb1ea","mcp_get_code":{"code_sha256":"b19697c998adb1ea"}},{"arxiv_id":"1909.11942","paper":"/paper/albert-a-lite-bert-for-self-supervised","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","date":"2019-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kpe/bert-for-tf2","path":"bert/tokenization/albert_tokenization.py","file_url":"https://github.com/kpe/bert-for-tf2/blob/HEAD/bert/tokenization/albert_tokenization.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"20e27f52f8beba5e","mcp_get_code":{"code_sha256":"20e27f52f8beba5e"}},{"arxiv_id":"1909.11942","paper":"/paper/albert-a-lite-bert-for-self-supervised","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","date":"2019-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lonePatient/albert_pytorch","path":"model/tokenization_albert.py","file_url":"https://github.com/lonePatient/albert_pytorch/blob/HEAD/model/tokenization_albert.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53ab86e6b6c686ae","mcp_get_code":{"code_sha256":"53ab86e6b6c686ae"}},{"arxiv_id":"1810.04805","paper":"/paper/bert-pre-training-of-deep-bidirectional","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","date":"2018-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JA-Bar/nlp-depression","path":"src/glove_fastext_bert/prediction_suicidal.py","file_url":"https://github.com/JA-Bar/nlp-depression/blob/HEAD/src/glove_fastext_bert/prediction_suicidal.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"68e228e1a25b69ed","mcp_get_code":{"code_sha256":"68e228e1a25b69ed"}},{"arxiv_id":"1803.05567","paper":"/paper/achieving-human-parity-on-automatic-chinese","title":"Achieving Human Parity on Automatic Chinese to English News Translation","date":"2018-03-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sanxing-chen/NMT2017-ZH-EN","path":"preprocess.py","file_url":"https://github.com/sanxing-chen/NMT2017-ZH-EN/blob/HEAD/preprocess.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3ca4d1464b186e3d","mcp_get_code":{"code_sha256":"3ca4d1464b186e3d"}}]}