{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/generate-prompt","entry":"generate_prompt","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":110,"n_papers_ran":85,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":110,"n_samples_ran":74,"n_samples_fingerprinted":30,"n_places":156,"n_places_pointer_only":77,"by_status":{"ran_honours":1,"ran_violates":0,"ran_draft_wrong":34,"ran_fixture":0,"ran":39,"unverified":36},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.21702","paper":"/paper/arxiv-2608-21702","title":"From Association to Causation: Improving Retrieval Precision of Retrieval-Augmented Generation via Causal Relations and an Attention Mechanism","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"Silk-Road/causal-rag-rerank","path":"rag_pipeline.py","file_url":"https://github.com/Silk-Road/causal-rag-rerank/blob/HEAD/rag_pipeline.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"2a94ac4c170abfe3","mcp_get_code":{"code_sha256":"2a94ac4c170abfe3"}},{"arxiv_id":"2605.08110","paper":"/paper/arxiv-2605-08110","title":"BaLoRA: Bayesian Low-Rank Adaptation of Large Scale Models","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"AGI-Edgerunners/LLM-Adapters","path":"finetune.py","file_url":"https://github.com/AGI-Edgerunners/LLM-Adapters/blob/HEAD/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2605.08110","paper":"/paper/arxiv-2605-08110","title":"BaLoRA: Bayesian Low-Rank Adaptation of Large Scale Models","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"AGI-Edgerunners/LLM-Adapters","path":"generate.py","file_url":"https://github.com/AGI-Edgerunners/LLM-Adapters/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0dbc7fc6c518d0fb","mcp_get_code":{"code_sha256":"0dbc7fc6c518d0fb"}},{"arxiv_id":"2605.08110","paper":"/paper/arxiv-2605-08110","title":"BaLoRA: Bayesian Low-Rank Adaptation of Large Scale Models","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"AGI-Edgerunners/LLM-Adapters","path":"commonsense_evaluate.py","file_url":"https://github.com/AGI-Edgerunners/LLM-Adapters/blob/HEAD/commonsense_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2603.20910","paper":"/paper/arxiv-2603-20910","title":"LLM-ODE: Data-driven Discovery of Dynamical Systems with Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"gryaklab/llm-ode","path":"llmode/llm.py","file_url":"https://github.com/gryaklab/llm-ode/blob/HEAD/llmode/llm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e9c0811bde89c645","mcp_get_code":{"code_sha256":"e9c0811bde89c645"}},{"arxiv_id":"2603.12752","paper":"/paper/arxiv-2603-12752","title":"Taming the Long Tail: Efficient Item-wise Sharpness-Aware Minimization for LLM-based Recommender Systems","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"xiye7lai/samlrs","path":"vllm_generate.py","file_url":"https://github.com/xiye7lai/samlrs/blob/HEAD/vllm_generate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1da5fdc05e0b1a13","mcp_get_code":{"code_sha256":"1da5fdc05e0b1a13"}},{"arxiv_id":"2603.07946","paper":"/paper/arxiv-2603-07946","title":"ELLMob: Event-Driven Human Mobility Generation with Self-Aligned LLM Framework","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"deepkashiwa20/ELLMob","path":"simulator/gpt_structure.py","file_url":"https://github.com/deepkashiwa20/ELLMob/blob/HEAD/simulator/gpt_structure.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"95cf67e203557057","mcp_get_code":{"code_sha256":"95cf67e203557057"}},{"arxiv_id":"2601.22925","paper":"/paper/arxiv-2601-22925","title":"BEAR: Towards Beam-Search-Aware Optimization for Recommendation with Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"Tiny-Snow/BEAR-SIGIR-2026","path":"inference.py","file_url":"https://github.com/Tiny-Snow/BEAR-SIGIR-2026/blob/HEAD/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ec980d0edf81e31d","mcp_get_code":{"code_sha256":"ec980d0edf81e31d"}},{"arxiv_id":"2601.22925","paper":"/paper/arxiv-2601-22925","title":"BEAR: Towards Beam-Search-Aware Optimization for Recommendation with Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"Tiny-Snow/BEAR-SIGIR-2026","path":"train_bear.py","file_url":"https://github.com/Tiny-Snow/BEAR-SIGIR-2026/blob/HEAD/train_bear.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"31b0d67913003d72","mcp_get_code":{"code_sha256":"31b0d67913003d72"}},{"arxiv_id":"2601.22420","paper":"/paper/arxiv-2601-22420","title":"METALEAD: A Comprehensive Human-Curated Leaderboard Dataset for Transparent Reporting of Machine Learning Experiments","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"RoelTim/metalead","path":"src/extract_tuples.py","file_url":"https://github.com/RoelTim/metalead/blob/HEAD/src/extract_tuples.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"938e7f4c8acebc02","mcp_get_code":{"code_sha256":"938e7f4c8acebc02"}},{"arxiv_id":"2601.09141","paper":"/paper/arxiv-2601-09141","title":"Identity-Robust Language Model Generation via Content Integrity Preservation","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"XMUDM/Guide-Align","path":"code/augmentation_prompt.py","file_url":"https://github.com/XMUDM/Guide-Align/blob/HEAD/code/augmentation_prompt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"54b95bf60dbf6155","mcp_get_code":{"code_sha256":"54b95bf60dbf6155"}},{"arxiv_id":"2601.09141","paper":"/paper/arxiv-2601-09141","title":"Identity-Robust Language Model Generation via Content Integrity Preservation","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"XMUDM/Guide-Align","path":"code/generate_response.py","file_url":"https://github.com/XMUDM/Guide-Align/blob/HEAD/code/generate_response.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9fdbd9ee47ef2f75","mcp_get_code":{"code_sha256":"9fdbd9ee47ef2f75"}},{"arxiv_id":"2510.03276","paper":"/paper/arxiv-2510-03276","title":"QuadEnhancer: Leveraging Quadratic Transformations to Enhance Deep Neural Networks","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"chitar/QuadEnhancer","path":"LLM-finetuning/commonsense_evaluate.py","file_url":"https://github.com/chitar/QuadEnhancer/blob/HEAD/LLM-finetuning/commonsense_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2509.07666","paper":"/paper/arxiv-2509-07666","title":"MoLoRAG: Bootstrapping Document Understanding via Multi-modal Logic-aware Retrieval","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"WxxShirley/MoLoRAG","path":"VLMRetriever/data_collection.py","file_url":"https://github.com/WxxShirley/MoLoRAG/blob/HEAD/VLMRetriever/data_collection.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8c8321c2a981f64b","mcp_get_code":{"code_sha256":"8c8321c2a981f64b"}},{"arxiv_id":"2506.09944","paper":"/paper/query-focused-retrieval-heads-improve-long","title":"Query-Focused Retrieval Heads Improve Long-Context Reasoning and Re-ranking","date":"2025-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-pli/QRHead","path":"exp_scripts/generation/run_generation_lme.py","file_url":"https://github.com/princeton-pli/QRHead/blob/HEAD/exp_scripts/generation/run_generation_lme.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f8bf3d9d30b922e6","mcp_get_code":{"code_sha256":"f8bf3d9d30b922e6"}},{"arxiv_id":"2506.03230","paper":"/paper/diablo-diagonal-blocks-are-sufficient-for","title":"DiaBlo: Diagonal Blocks Are Sufficient For Finetuning","date":"2025-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ziyangjoy/diablo","path":"evaluate_commonsense.py","file_url":"https://github.com/ziyangjoy/diablo/blob/HEAD/evaluate_commonsense.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"03a0c4249091f289","mcp_get_code":{"code_sha256":"03a0c4249091f289"}},{"arxiv_id":"2505.16270","paper":"/paper/transformer-copilot-learning-from-the-mistake","title":"Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning","date":"2025-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2504.20115","paper":"/paper/autop2c-an-llm-based-agent-framework-for-code","title":"AutoP2C: An LLM-Based Agent Framework for Code Repository Generation from Multimodal Content in Academic Papers","date":"2025-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shoushouyu/automated-paper-to-code","path":"code_gen/code_generate.py","file_url":"https://github.com/shoushouyu/automated-paper-to-code/blob/HEAD/code_gen/code_generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"10527bd8a74e0dd8","mcp_get_code":{"code_sha256":"10527bd8a74e0dd8"}},{"arxiv_id":"2503.22719","paper":"/paper/llm-based-agent-simulation-for-maternal","title":"LLM-based Agent Simulation for Maternal Health Interventions: Uncertainty Estimation and Decision-focused Evaluation","date":"2025-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sarahmart/llm-abs-armman-prediction","path":"models/LLM_simulator.py","file_url":"https://github.com/sarahmart/llm-abs-armman-prediction/blob/HEAD/models/LLM_simulator.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ade64512da6f9546","mcp_get_code":{"code_sha256":"ade64512da6f9546"}},{"arxiv_id":"2503.15092","paper":"/paper/towards-understanding-the-safety-boundaries","title":"Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings","date":"2025-03-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ny1024/deepseek-safety-eval","path":"judge/text/gpt4o_chinese.py","file_url":"https://github.com/ny1024/deepseek-safety-eval/blob/HEAD/judge/text/gpt4o_chinese.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"866c7b26066ee5ea","mcp_get_code":{"code_sha256":"866c7b26066ee5ea"}},{"arxiv_id":"2502.20082","paper":"/paper/longrope2-near-lossless-llm-context-window","title":"LongRoPE2: Near-Lossless LLM Context Window Scaling","date":"2025-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/longrope","path":"evaluation/passkey.py","file_url":"https://github.com/microsoft/longrope/blob/HEAD/evaluation/passkey.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d69527b1fc981538","mcp_get_code":{"code_sha256":"d69527b1fc981538"}},{"arxiv_id":"2502.09319","paper":"/paper/bridging-jensen-gap-for-max-min-group","title":"Bridging Jensen Gap for Max-Min Group Fairness Optimization in Recommendation","date":"2025-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xuchen0427/fairdual","path":"inference.py","file_url":"https://github.com/xuchen0427/fairdual/blob/HEAD/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ec980d0edf81e31d","mcp_get_code":{"code_sha256":"ec980d0edf81e31d"}},{"arxiv_id":"2412.19394","paper":"/paper/an-engorgio-prompt-makes-large-language-model","title":"An Engorgio Prompt Makes Large Language Model Babble on","date":"2024-12-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jianshuod/engorgio-prompt","path":"ica_utils/prepare.py","file_url":"https://github.com/jianshuod/engorgio-prompt/blob/HEAD/ica_utils/prepare.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"875043016598875b","mcp_get_code":{"code_sha256":"875043016598875b"}},{"arxiv_id":"2412.09243","paper":"/paper/sprec-leveraging-self-play-to-debias","title":"SPRec: Leveraging Self-Play to Debias Preference Alignment for Large Language Model-based Recommendations","date":"2024-12-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"regionch/sprec","path":"eval/inference.py","file_url":"https://github.com/regionch/sprec/blob/HEAD/eval/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ec980d0edf81e31d","mcp_get_code":{"code_sha256":"ec980d0edf81e31d"}},{"arxiv_id":"2412.08221","paper":"/paper/generate-any-scene-evaluating-and-improving","title":"Generate Any Scene: Evaluating and Improving Text-to-Vision Generation with Scene Graph Programming","date":"2024-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RAIVNLab/GenerateAnyScene","path":"generation.py","file_url":"https://github.com/RAIVNLab/GenerateAnyScene/blob/HEAD/generation.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5022dcff291c3815","mcp_get_code":{"code_sha256":"5022dcff291c3815"}},{"arxiv_id":"2412.04692","paper":"/paper/smoothie-label-free-language-model-routing","title":"Smoothie: Label Free Language Model Routing","date":"2024-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hazyresearch/smoothie","path":"src/data_utils.py","file_url":"https://github.com/hazyresearch/smoothie/blob/HEAD/src/data_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"640b7cfa08a02bfe","mcp_get_code":{"code_sha256":"640b7cfa08a02bfe"}},{"arxiv_id":"2411.17388","paper":"/paper/can-llms-be-good-graph-judger-for-knowledge","title":"Can LLMs be Good Graph Judge for Knowledge Graph Construction?","date":"2024-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hhy-huang/graphjudge","path":"graph_judger/lora_infer.py","file_url":"https://github.com/hhy-huang/graphjudge/blob/HEAD/graph_judger/lora_infer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e96ec96db9ef37ba","mcp_get_code":{"code_sha256":"e96ec96db9ef37ba"}},{"arxiv_id":"2411.17388","paper":"/paper/can-llms-be-good-graph-judger-for-knowledge","title":"Can LLMs be Good Graph Judge for Knowledge Graph Construction?","date":"2024-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hhy-huang/graphjudge","path":"graph_judger/lora_infer_batch.py","file_url":"https://github.com/hhy-huang/graphjudge/blob/HEAD/graph_judger/lora_infer_batch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fa02d989f7ad994f","mcp_get_code":{"code_sha256":"fa02d989f7ad994f"}},{"arxiv_id":"2411.04358","paper":"/paper/robust-and-efficient-fine-tuning-of-llms-with","title":"Robust and Efficient Fine-tuning of LLMs with Bayesian Reparameterization of Low-Rank Adaptation","date":"2024-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lcs2-iiitd/monteclora","path":"finetune.py","file_url":"https://github.com/lcs2-iiitd/monteclora/blob/HEAD/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2411.04358","paper":"/paper/robust-and-efficient-fine-tuning-of-llms-with","title":"Robust and Efficient Fine-tuning of LLMs with Bayesian Reparameterization of Low-Rank Adaptation","date":"2024-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lcs2-iiitd/monteclora","path":"generate.py","file_url":"https://github.com/lcs2-iiitd/monteclora/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0dbc7fc6c518d0fb","mcp_get_code":{"code_sha256":"0dbc7fc6c518d0fb"}},{"arxiv_id":"2411.04358","paper":"/paper/robust-and-efficient-fine-tuning-of-llms-with","title":"Robust and Efficient Fine-tuning of LLMs with Bayesian Reparameterization of Low-Rank Adaptation","date":"2024-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lcs2-iiitd/monteclora","path":"commonsense_evaluate.py","file_url":"https://github.com/lcs2-iiitd/monteclora/blob/HEAD/commonsense_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2411.03855","paper":"/paper/mambapeft-exploring-parameter-efficient-fine","title":"MambaPEFT: Exploring Parameter-Efficient Fine-Tuning for Mamba","date":"2024-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sony/MambaPEFT","path":"language/commonsense_reasoning/finetune.py","file_url":"https://github.com/sony/MambaPEFT/blob/HEAD/language/commonsense_reasoning/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2410.13025","paper":"/paper/lora-soups-merging-loras-for-practical-skill","title":"LoRA Soups: Merging LoRAs for Practical Skill Composition Tasks","date":"2024-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2410.12869","paper":"/paper/language-model-preference-evaluation-with","title":"Language Model Preference Evaluation with Multiple Weak Evaluators","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ppsmk388/GED","path":"answer_gen/vllm_generate.py","file_url":"https://github.com/ppsmk388/GED/blob/HEAD/answer_gen/vllm_generate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2eb98bc901715d22","mcp_get_code":{"code_sha256":"2eb98bc901715d22"}},{"arxiv_id":"2410.09437","paper":"/paper/mtl-lora-low-rank-adaptation-for-multi-task","title":"MTL-LoRA: Low-Rank Adaptation for Multi-Task Learning","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pumpkin-co/mtl-lora","path":"lora_finetune.py","file_url":"https://github.com/pumpkin-co/mtl-lora/blob/HEAD/lora_finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2410.09437","paper":"/paper/mtl-lora-low-rank-adaptation-for-multi-task","title":"MTL-LoRA: Low-Rank Adaptation for Multi-Task Learning","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pumpkin-co/mtl-lora","path":"lora_evaluate.py","file_url":"https://github.com/pumpkin-co/mtl-lora/blob/HEAD/lora_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2410.06802","paper":"/paper/seg2act-global-context-aware-action","title":"Seg2Act: Global Context-aware Action Generation for Document Logical Structuring","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cascip/seg2act","path":"seg2act/eval/ChCatExt/seg2act_eval.py","file_url":"https://github.com/cascip/seg2act/blob/HEAD/seg2act/eval/ChCatExt/seg2act_eval.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3b3e7dfce732f2f0","mcp_get_code":{"code_sha256":"3b3e7dfce732f2f0"}},{"arxiv_id":"2410.05165","paper":"/paper/efficient-inference-for-large-language-model","title":"Efficient Inference for Large Language Model-based Generative Recommendation","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Linxyhaha/AtSpeed","path":"code/finetune_llama.py","file_url":"https://github.com/Linxyhaha/AtSpeed/blob/HEAD/code/finetune_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"31b0d67913003d72","mcp_get_code":{"code_sha256":"31b0d67913003d72"}},{"arxiv_id":"2410.04010","paper":"/paper/hyperbolic-fine-tuning-for-large-language","title":"Hyperbolic Fine-tuning for Large Language Models","date":"2024-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marlin-codes/HypLLM","path":"finetune_gemma.py","file_url":"https://github.com/marlin-codes/HypLLM/blob/HEAD/finetune_gemma.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"efa052b7627685a8","mcp_get_code":{"code_sha256":"efa052b7627685a8"}},{"arxiv_id":"2410.04010","paper":"/paper/hyperbolic-fine-tuning-for-large-language","title":"Hyperbolic Fine-tuning for Large Language Models","date":"2024-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marlin-codes/HypLLM","path":"finetune_gemma7b.py","file_url":"https://github.com/marlin-codes/HypLLM/blob/HEAD/finetune_gemma7b.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"855c98801d59aba9","mcp_get_code":{"code_sha256":"855c98801d59aba9"}},{"arxiv_id":"2410.04010","paper":"/paper/hyperbolic-fine-tuning-for-large-language","title":"Hyperbolic Fine-tuning for Large Language Models","date":"2024-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marlin-codes/HypLLM","path":"finetune_llama3.py","file_url":"https://github.com/marlin-codes/HypLLM/blob/HEAD/finetune_llama3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"129a49595d6cd469","mcp_get_code":{"code_sha256":"129a49595d6cd469"}},{"arxiv_id":"2410.04010","paper":"/paper/hyperbolic-fine-tuning-for-large-language","title":"Hyperbolic Fine-tuning for Large Language Models","date":"2024-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marlin-codes/HypLLM","path":"finetune_qwen.py","file_url":"https://github.com/marlin-codes/HypLLM/blob/HEAD/finetune_qwen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"10b11110fd400897","mcp_get_code":{"code_sha256":"10b11110fd400897"}},{"arxiv_id":"2410.01623","paper":"/paper/fira-can-we-achieve-full-rank-training-of","title":"Fira: Can We Achieve Full-rank Training of LLMs Under Low-rank Constraint?","date":"2024-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xichen-fy/Fira","path":"fine_tuning/finetune.py","file_url":"https://github.com/xichen-fy/Fira/blob/HEAD/fine_tuning/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2410.00379","paper":"/paper/cxpmrg-bench-pre-training-and-benchmarking","title":"CXPMRG-Bench: Pre-training and Benchmarking for X-ray Medical Report Generation on CheXpert Plus Dataset","date":"2024-10-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"event-ahu/medical_image_analysis","path":"EMRRG/finetune.py","file_url":"https://github.com/event-ahu/medical_image_analysis/blob/HEAD/EMRRG/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2409.11295","paper":"/paper/eia-environmental-injection-attack-on","title":"EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage","date":"2024-09-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"osu-nlp-group/eia_against_webagent","path":"SeeAct/src/data_utils/prompts.py","file_url":"https://github.com/osu-nlp-group/eia_against_webagent/blob/HEAD/SeeAct/src/data_utils/prompts.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"431150ea1b184bf1","mcp_get_code":{"code_sha256":"431150ea1b184bf1"}},{"arxiv_id":"2409.01035","paper":"/paper/unleashing-the-power-of-task-specific","title":"Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning","date":"2024-09-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Chongjie-Si/Subspace-Tuning","path":"CR_MR/finetune.py","file_url":"https://github.com/Chongjie-Si/Subspace-Tuning/blob/HEAD/CR_MR/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2409.01035","paper":"/paper/unleashing-the-power-of-task-specific","title":"Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning","date":"2024-09-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Chongjie-Si/Subspace-Tuning","path":"CR_MR/generate.py","file_url":"https://github.com/Chongjie-Si/Subspace-Tuning/blob/HEAD/CR_MR/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0dbc7fc6c518d0fb","mcp_get_code":{"code_sha256":"0dbc7fc6c518d0fb"}},{"arxiv_id":"2409.01035","paper":"/paper/unleashing-the-power-of-task-specific","title":"Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning","date":"2024-09-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Chongjie-Si/Subspace-Tuning","path":"CR_MR/commonsense_evaluate.py","file_url":"https://github.com/Chongjie-Si/Subspace-Tuning/blob/HEAD/CR_MR/commonsense_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2408.05093","paper":"/paper/order-matters-in-hallucination-reasoning","title":"Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models","date":"2024-08-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiezikai/reflexiveprompting","path":"self_contradictory_comparison.py","file_url":"https://github.com/xiezikai/reflexiveprompting/blob/HEAD/self_contradictory_comparison.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a52bcb839042fe4e","mcp_get_code":{"code_sha256":"a52bcb839042fe4e"}},{"arxiv_id":"2407.10670","paper":"/paper/enhancing-retrieval-and-managing-retrieval-a","title":"Enhancing Retrieval and Managing Retrieval: A Four-Module Synergy for Improved Quality and Efficiency in RAG Systems","date":"2024-07-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ancientshi/erm4","path":"finetune_gemma_rewriter.py","file_url":"https://github.com/ancientshi/erm4/blob/HEAD/finetune_gemma_rewriter.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"51f4c1ae26ea0c4c","mcp_get_code":{"code_sha256":"51f4c1ae26ea0c4c"}},{"arxiv_id":"2407.10670","paper":"/paper/enhancing-retrieval-and-managing-retrieval-a","title":"Enhancing Retrieval and Managing Retrieval: A Four-Module Synergy for Improved Quality and Efficiency in RAG Systems","date":"2024-07-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ancientshi/erm4","path":"infer_gemma_rewriter.py","file_url":"https://github.com/ancientshi/erm4/blob/HEAD/infer_gemma_rewriter.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"4de4c9707060d248","mcp_get_code":{"code_sha256":"4de4c9707060d248"}},{"arxiv_id":"2407.10058","paper":"/paper/learning-to-refuse-towards-mitigating-privacy","title":"Learning to Refuse: Towards Mitigating Privacy Risks in LLMs","date":"2024-07-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhliu0106/learning-to-refuse","path":"process_data/augmentation.py","file_url":"https://github.com/zhliu0106/learning-to-refuse/blob/HEAD/process_data/augmentation.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a4dd4eb5709c2a36","mcp_get_code":{"code_sha256":"a4dd4eb5709c2a36"}},{"arxiv_id":"2407.09946","paper":"/paper/low-rank-interconnected-adaptation-across","title":"Low-Rank Interconnected Adaptation across Layers","date":"2024-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yibozhong/lily","path":"commonsense-reasoning/finetune_llama.py","file_url":"https://github.com/yibozhong/lily/blob/HEAD/commonsense-reasoning/finetune_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2407.09946","paper":"/paper/low-rank-interconnected-adaptation-across","title":"Low-Rank Interconnected Adaptation across Layers","date":"2024-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yibozhong/lily","path":"commonsense-reasoning/evaluate_llama.py","file_url":"https://github.com/yibozhong/lily/blob/HEAD/commonsense-reasoning/evaluate_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2406.11909","paper":"/paper/mixture-of-subspaces-in-low-rank-adaptation","title":"Mixture-of-Subspaces in Low-Rank Adaptation","date":"2024-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wutaiqiang/moslora","path":"commonsense_reasoning/finetune.py","file_url":"https://github.com/wutaiqiang/moslora/blob/HEAD/commonsense_reasoning/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2406.11909","paper":"/paper/mixture-of-subspaces-in-low-rank-adaptation","title":"Mixture-of-Subspaces in Low-Rank Adaptation","date":"2024-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wutaiqiang/moslora","path":"commonsense_reasoning/commonsense_evaluate.py","file_url":"https://github.com/wutaiqiang/moslora/blob/HEAD/commonsense_reasoning/commonsense_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2406.11149","paper":"/paper/goldcoin-grounding-large-language-models-in","title":"GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hkust-knowcomp/goldcoin","path":"eval/eval_api.py","file_url":"https://github.com/hkust-knowcomp/goldcoin/blob/HEAD/eval/eval_api.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1662e8eff561cc46","mcp_get_code":{"code_sha256":"1662e8eff561cc46"}},{"arxiv_id":"2406.10774","paper":"/paper/quest-query-aware-sparsity-for-efficient-long","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","date":"2024-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mit-han-lab/Quest","path":"evaluation/passkey/passkey.py","file_url":"https://github.com/mit-han-lab/Quest/blob/HEAD/evaluation/passkey/passkey.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"82a59167e1c0360c","mcp_get_code":{"code_sha256":"82a59167e1c0360c"}},{"arxiv_id":"2406.04984","paper":"/paper/meft-memory-efficient-fine-tuning-through","title":"MEFT: Memory-Efficient Fine-Tuning through Sparse Adapter","date":"2024-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"currentf/meft","path":"full_finetune.py","file_url":"https://github.com/currentf/meft/blob/HEAD/full_finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5ed93c8ef12816a8","mcp_get_code":{"code_sha256":"5ed93c8ef12816a8"}},{"arxiv_id":"2405.14488","paper":"/paper/mogu-a-framework-for-enhancing-safety-of-open","title":"MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dyr1/mogu","path":"Falcon/sft_mogu.py","file_url":"https://github.com/dyr1/mogu/blob/HEAD/Falcon/sft_mogu.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3eea87ded08eb9c1","mcp_get_code":{"code_sha256":"3eea87ded08eb9c1"}},{"arxiv_id":"2404.19509","paper":"/paper/do-large-language-models-understand","title":"Do Large Language Models Understand Conversational Implicature -- A case study with a chinese sitcom","date":"2024-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sjtu-compling/llm-pragmatics","path":"eval_logit/query.py","file_url":"https://github.com/sjtu-compling/llm-pragmatics/blob/HEAD/eval_logit/query.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e5a280210073469b","mcp_get_code":{"code_sha256":"e5a280210073469b"}},{"arxiv_id":"2404.10859","paper":"/paper/forcing-diffuse-distributions-out-of-language","title":"Forcing Diffuse Distributions out of Language Models","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"y0mingzhang/diffuse-distributions","path":"src/utils.py","file_url":"https://github.com/y0mingzhang/diffuse-distributions/blob/HEAD/src/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f62e5d3a197c22ab","mcp_get_code":{"code_sha256":"f62e5d3a197c22ab"}},{"arxiv_id":"2404.09486","paper":"/paper/mmcode-evaluating-multi-modal-code-large","title":"MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems","date":"2024-04-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"likaixin2000/mmcode","path":"generate.py","file_url":"https://github.com/likaixin2000/mmcode/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"060d68859a97da44","mcp_get_code":{"code_sha256":"060d68859a97da44"}},{"arxiv_id":"2404.00419","paper":"/paper/do-vision-language-models-understand-compound","title":"Do Vision-Language Models Understand Compound Nouns?","date":"2024-03-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sonalkum/compun","path":"generate_captions.py","file_url":"https://github.com/sonalkum/compun/blob/HEAD/generate_captions.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d0904001703f1b95","mcp_get_code":{"code_sha256":"d0904001703f1b95"}},{"arxiv_id":"2403.13271","paper":"/paper/enhancing-code-generation-performance-of","title":"Enhancing Code Generation Performance of Smaller Models by Distilling the Reasoning Ability of LLMs","date":null,"month_inferred_from_arxiv_id":"2024-03","title_source":"archive","repo":"sssszh/codeplan","path":"generate_code_with_plan.py","file_url":"https://github.com/sssszh/codeplan/blob/HEAD/generate_code_with_plan.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8c5a649c50b23995","mcp_get_code":{"code_sha256":"8c5a649c50b23995"}},{"arxiv_id":"2403.08251","paper":"/paper/emergence-of-social-norms-in-large-language","title":"Emergence of Social Norms in Generative Agent Societies: Principles and Architecture","date":"2024-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sxswz213/crsec","path":"reverie/backend_server/compress_sim_storage_norm.py","file_url":"https://github.com/sxswz213/crsec/blob/HEAD/reverie/backend_server/compress_sim_storage_norm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3f8b35c22b491c2d","mcp_get_code":{"code_sha256":"3f8b35c22b491c2d"}},{"arxiv_id":"2403.04706","paper":"/paper/common-7b-language-models-already-possess","title":"Common 7B Language Models Already Possess Strong Math Capabilities","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xwin-lm/xwin-lm","path":"Xwin-Coder/DS1000/ds1000_gen.py","file_url":"https://github.com/xwin-lm/xwin-lm/blob/HEAD/Xwin-Coder/DS1000/ds1000_gen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2763cff93674bd85","mcp_get_code":{"code_sha256":"2763cff93674bd85"}},{"arxiv_id":"2403.04706","paper":"/paper/common-7b-language-models-already-possess","title":"Common 7B Language Models Already Possess Strong Math Capabilities","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xwin-lm/xwin-lm","path":"Xwin-Coder/HumanEval/humaneval_gen.py","file_url":"https://github.com/xwin-lm/xwin-lm/blob/HEAD/Xwin-Coder/HumanEval/humaneval_gen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"34de3c98b4c4ccf0","mcp_get_code":{"code_sha256":"34de3c98b4c4ccf0"}},{"arxiv_id":"2403.03640","paper":"/paper/apollo-lightweight-multilingual-medical-llms","title":"Apollo: A Lightweight Multilingual Medical LLM towards Democratizing Medical AI to 6B People","date":"2024-03-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"freedomintelligence/apollo","path":"src/evaluate/cli_demo.py","file_url":"https://github.com/freedomintelligence/apollo/blob/HEAD/src/evaluate/cli_demo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ba695df2073d9830","mcp_get_code":{"code_sha256":"ba695df2073d9830"}},{"arxiv_id":"2402.16040","paper":"/paper/ehrnoteqa-a-patient-specific-question","title":"EHRNoteQA: An LLM Benchmark for Real-World Clinical Practice Using Discharge Summaries","date":"2024-02-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ji-youn-kim/ehrnoteqa","path":"src/gpt/gpt_setup.py","file_url":"https://github.com/ji-youn-kim/ehrnoteqa/blob/HEAD/src/gpt/gpt_setup.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5652ec21392352cc","mcp_get_code":{"code_sha256":"5652ec21392352cc"}},{"arxiv_id":"2402.15215","paper":"/paper/item-side-fairness-of-large-language-model","title":"Item-side Fairness of Large Language Model-based Recommendation System","date":"2024-02-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiangm-c/ifairlrs","path":"code/finetune_gen.py","file_url":"https://github.com/jiangm-c/ifairlrs/blob/HEAD/code/finetune_gen.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f87a1fd80107335b","mcp_get_code":{"code_sha256":"f87a1fd80107335b"}},{"arxiv_id":"2402.15048","paper":"/paper/unlocking-the-power-of-large-language-models","title":"Unlocking the Power of Large Language Models for Entity Alignment","date":"2024-02-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jxh4945777/ChatEA","path":"preobtain_description.py","file_url":"https://github.com/jxh4945777/ChatEA/blob/HEAD/preobtain_description.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"698c242fbf3edfdb","mcp_get_code":{"code_sha256":"698c242fbf3edfdb"}},{"arxiv_id":"2402.12659","paper":"/paper/the-finben-an-holistic-financial-benchmark","title":"FinBen: A Holistic Financial Benchmark for Large Language Models","date":"2024-02-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chancefocus/pixiu","path":"src/interface.py","file_url":"https://github.com/chancefocus/pixiu/blob/HEAD/src/interface.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d8c48497dd9cc819","mcp_get_code":{"code_sha256":"d8c48497dd9cc819"}},{"arxiv_id":"2402.09353","paper":"/paper/dora-weight-decomposed-low-rank-adaptation","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","date":"2024-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NVlabs/DoRA","path":"commonsense_reasoning/finetune.py","file_url":"https://github.com/NVlabs/DoRA/blob/HEAD/commonsense_reasoning/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2402.09353","paper":"/paper/dora-weight-decomposed-low-rank-adaptation","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","date":"2024-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NVlabs/DoRA","path":"commonsense_reasoning/generate.py","file_url":"https://github.com/NVlabs/DoRA/blob/HEAD/commonsense_reasoning/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0dbc7fc6c518d0fb","mcp_get_code":{"code_sha256":"0dbc7fc6c518d0fb"}},{"arxiv_id":"2402.09353","paper":"/paper/dora-weight-decomposed-low-rank-adaptation","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","date":"2024-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NVlabs/DoRA","path":"commonsense_reasoning/commonsense_evaluate.py","file_url":"https://github.com/NVlabs/DoRA/blob/HEAD/commonsense_reasoning/commonsense_evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2402.06861","paper":"/paper/urbankgent-a-unified-large-language-model","title":"UrbanKGent: A Unified Large Language Model Agent Framework for Urban Knowledge Graph Construction","date":"2024-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"usail-hkust/UrbanKGent","path":"finetune.py","file_url":"https://github.com/usail-hkust/UrbanKGent/blob/HEAD/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fe2ac467a1531bb0","mcp_get_code":{"code_sha256":"fe2ac467a1531bb0"}},{"arxiv_id":"2402.02805","paper":"/paper/graph-enhanced-large-language-models-in","title":"Graph-enhanced Large Language Models in Asynchronous Plan Reasoning","date":"2024-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fangru-lin/graph-llm-asynchow-plan","path":"prototypical/longest_path.py","file_url":"https://github.com/fangru-lin/graph-llm-asynchow-plan/blob/HEAD/prototypical/longest_path.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3b90664fabed7d8a","mcp_get_code":{"code_sha256":"3b90664fabed7d8a"}},{"arxiv_id":"2401.17197","paper":"/paper/data-efficient-fine-tuning-for-llm-based","title":"Data-efficient Fine-tuning for LLM-based Recommendation","date":"2024-01-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"linxyhaha/dealrec","path":"code/finetune/finetune.py","file_url":"https://github.com/linxyhaha/dealrec/blob/HEAD/code/finetune/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cb5205949324ad15","mcp_get_code":{"code_sha256":"cb5205949324ad15"}},{"arxiv_id":"2401.01614","paper":"/paper/gpt-4v-ision-is-a-generalist-web-agent-if","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","date":"2024-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"osu-nlp-group/seeact","path":"seeact_package/seeact/data_utils/prompts.py","file_url":"https://github.com/osu-nlp-group/seeact/blob/HEAD/seeact_package/seeact/data_utils/prompts.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"63deb40acd1e84ea","mcp_get_code":{"code_sha256":"63deb40acd1e84ea"}},{"arxiv_id":"2401.00788","paper":"/paper/astraios-parameter-efficient-instruction","title":"Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models","date":"2024-01-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2401.00788","paper":"/paper/astraios-parameter-efficient-instruction","title":"Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models","date":"2024-01-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"0dbc7fc6c518d0fb","mcp_get_code":{"code_sha256":"0dbc7fc6c518d0fb"}},{"arxiv_id":"2401.00788","paper":"/paper/astraios-parameter-efficient-instruction","title":"Astraios: Parameter-Efficient Instruction Tuning Code Large Language Models","date":"2024-01-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2401.10334","paper":"/paper/drugassist-a-large-language-model-for","title":"DrugAssist: A Large Language Model for Molecule Optimization","date":"2023-12-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"blazerye/drugassist","path":"gradio_service.py","file_url":"https://github.com/blazerye/drugassist/blob/HEAD/gradio_service.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0afac31c1ad3b8c8","mcp_get_code":{"code_sha256":"0afac31c1ad3b8c8"}},{"arxiv_id":"2312.16044","paper":"/paper/large-language-models-as-traffic-signal","title":"LLMLight: Large Language Models as Traffic Signal Control Agents","date":"2023-12-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"usail-hkust/llmtscs","path":"finetune/run_imitation_finetune.py","file_url":"https://github.com/usail-hkust/llmtscs/blob/HEAD/finetune/run_imitation_finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fd451c1c62f562f8","mcp_get_code":{"code_sha256":"fd451c1c62f562f8"}},{"arxiv_id":"2312.15166","paper":"/paper/solar-10-7b-scaling-large-language-models","title":"SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling","date":"2023-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jquesnelle/yarn","path":"eval/passkey.py","file_url":"https://github.com/jquesnelle/yarn/blob/HEAD/eval/passkey.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"82b8d6fd7a1152e0","mcp_get_code":{"code_sha256":"82b8d6fd7a1152e0"}},{"arxiv_id":"2312.15166","paper":"/paper/solar-10-7b-scaling-large-language-models","title":"SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling","date":"2023-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jquesnelle/yarn","path":"eval/passkey_hard.py","file_url":"https://github.com/jquesnelle/yarn/blob/HEAD/eval/passkey_hard.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b21ca20b3500c55f","mcp_get_code":{"code_sha256":"b21ca20b3500c55f"}},{"arxiv_id":"2312.04350","paper":"/paper/cladder-a-benchmark-to-assess-causal-1","title":"CLadder: Assessing Causal Reasoning in Language Models","date":"2023-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"causalNLP/cladder","path":"causalbenchmark/eval/run_alpaca.py","file_url":"https://github.com/causalNLP/cladder/blob/HEAD/causalbenchmark/eval/run_alpaca.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d9793b16bbddeedb","mcp_get_code":{"code_sha256":"d9793b16bbddeedb"}},{"arxiv_id":"2311.09774","paper":"/paper/huatuogpt-ii-one-stage-training-for-medical","title":"HuatuoGPT-II, One-stage Training for Medical Adaption of LLMs","date":"2023-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"freedomintelligence/huatuogpt-ii","path":"cli_demo.py","file_url":"https://github.com/freedomintelligence/huatuogpt-ii/blob/HEAD/cli_demo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"baa2dd07a544df5c","mcp_get_code":{"code_sha256":"baa2dd07a544df5c"}},{"arxiv_id":"2311.09603","paper":"/paper/score-a-framework-for-self-contradictory","title":"Self-Contradictory Reasoning Evaluation and Detection","date":"2023-11-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uscnlp-lime/Self-Contradictory","path":"generate_reasoning_multiple.py","file_url":"https://github.com/uscnlp-lime/Self-Contradictory/blob/HEAD/generate_reasoning_multiple.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5ac1b64a85172751","mcp_get_code":{"code_sha256":"5ac1b64a85172751"}},{"arxiv_id":"2311.07054","paper":"/paper/do-llms-implicitly-exhibit-user","title":"A Study of Implicit Ranking Unfairness in Large Language Models","date":"2023-11-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xuchen0427/implicit_rank_unfairness","path":"train_llama.py","file_url":"https://github.com/xuchen0427/implicit_rank_unfairness/blob/HEAD/train_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"31b0d67913003d72","mcp_get_code":{"code_sha256":"31b0d67913003d72"}},{"arxiv_id":"2310.18338","paper":"/paper/small-language-models-fine-tuned-to","title":"Small Language Models Fine-tuned to Coordinate Larger Language Models improve Complex Reasoning","date":"2023-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lcs2-iiitd/daslam","path":"QuesGenFinetune.py","file_url":"https://github.com/lcs2-iiitd/daslam/blob/HEAD/QuesGenFinetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7b5537fa9f46e747","mcp_get_code":{"code_sha256":"7b5537fa9f46e747"}},{"arxiv_id":"2310.17924","paper":"/paper/soul-towards-sentiment-and-opinion","title":"SOUL: Towards Sentiment and Opinion Understanding of Language","date":"2023-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DAMO-NLP-SG/SOUL","path":"code/llm.py","file_url":"https://github.com/DAMO-NLP-SG/SOUL/blob/HEAD/code/llm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d98832ef4e81304e","mcp_get_code":{"code_sha256":"d98832ef4e81304e"}},{"arxiv_id":"2310.11564","paper":"/paper/personalized-soups-personalized-large","title":"Personalized Soups: Personalized Large Language Model Alignment via Post-hoc Parameter Merging","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"joeljang/rlphf","path":"generate_rollouts.py","file_url":"https://github.com/joeljang/rlphf/blob/HEAD/generate_rollouts.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dad9dcf30ea1d344","mcp_get_code":{"code_sha256":"dad9dcf30ea1d344"}},{"arxiv_id":"2310.11374","paper":"/paper/dialoguellm-context-and-emotion-knowledge","title":"DialogueLLM: Context and Emotion Knowledge-Tuned Large Language Models for Emotion Recognition in Conversations","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Dreamyao516/DialogueLLM","path":"py/myllama-train-IEMOCAP.py","file_url":"https://github.com/Dreamyao516/DialogueLLM/blob/HEAD/py/myllama-train-IEMOCAP.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2775546539a8ffad","mcp_get_code":{"code_sha256":"2775546539a8ffad"}},{"arxiv_id":"2310.08511","paper":"/paper/honeybee-progressive-instruction-finetuning","title":"HoneyBee: Progressive Instruction Finetuning of Large Language Models for Materials Science","date":"2023-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BangLab-UdeM-Mila/NLP4MatSci-HoneyBee","path":"uniform_finetune.py","file_url":"https://github.com/BangLab-UdeM-Mila/NLP4MatSci-HoneyBee/blob/HEAD/uniform_finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0bec18a3b0d91a68","mcp_get_code":{"code_sha256":"0bec18a3b0d91a68"}},{"arxiv_id":"2310.08511","paper":"/paper/honeybee-progressive-instruction-finetuning","title":"HoneyBee: Progressive Instruction Finetuning of Large Language Models for Materials Science","date":"2023-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BangLab-UdeM-Mila/NLP4MatSci-HoneyBee","path":"generate.py","file_url":"https://github.com/BangLab-UdeM-Mila/NLP4MatSci-HoneyBee/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cf3eb2732e36312a","mcp_get_code":{"code_sha256":"cf3eb2732e36312a"}},{"arxiv_id":"2310.05620","paper":"/paper/laiw-a-chinese-legal-large-language-models","title":"LAiW: A Chinese Legal Large Language Models Benchmark","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dai-shen/laiw","path":"src/interface.py","file_url":"https://github.com/dai-shen/laiw/blob/HEAD/src/interface.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d8c48497dd9cc819","mcp_get_code":{"code_sha256":"d8c48497dd9cc819"}},{"arxiv_id":"2309.13064","paper":"/paper/investlm-a-large-language-model-for","title":"InvestLM: A Large Language Model for Investment using Financial Domain Instruction Tuning","date":"2023-09-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"abacinlp/investlm","path":"inference.py","file_url":"https://github.com/abacinlp/investlm/blob/HEAD/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"431f1568cf45e4f4","mcp_get_code":{"code_sha256":"431f1568cf45e4f4"}},{"arxiv_id":"2308.13916","paper":"/paper/exploring-large-language-models-for-knowledge","title":"Exploring Large Language Models for Knowledge Graph Completion","date":"2023-08-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yao8839836/kg-llm","path":"lora_finetune_wn11.py","file_url":"https://github.com/yao8839836/kg-llm/blob/HEAD/lora_finetune_wn11.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0ef5a67d69d73c56","mcp_get_code":{"code_sha256":"0ef5a67d69d73c56"}},{"arxiv_id":"2308.13565","paper":"/paper/darwin-series-domain-specific-large-language","title":"DARWIN Series: Domain Specific Large Language Models for Natural Science","date":"2023-08-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"masterai-eam/darwin","path":"inference.py","file_url":"https://github.com/masterai-eam/darwin/blob/HEAD/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"e0779a97e2422350","mcp_get_code":{"code_sha256":"e0779a97e2422350"}},{"arxiv_id":"2308.09583","paper":"/paper/wizardmath-empowering-mathematical-reasoning","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","date":"2023-08-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nlpxucan/WizardLM","path":"WizardLM/src/inference_wizardlm.py","file_url":"https://github.com/nlpxucan/WizardLM/blob/HEAD/WizardLM/src/inference_wizardlm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0bd14db8e7b2cb18","mcp_get_code":{"code_sha256":"0bd14db8e7b2cb18"}},{"arxiv_id":"2308.09583","paper":"/paper/wizardmath-empowering-mathematical-reasoning","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","date":"2023-08-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nlpxucan/WizardLM","path":"WizardCoder/src/humaneval_gen.py","file_url":"https://github.com/nlpxucan/WizardLM/blob/HEAD/WizardCoder/src/humaneval_gen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e8a51ca7c61c54e2","mcp_get_code":{"code_sha256":"e8a51ca7c61c54e2"}},{"arxiv_id":"2308.09583","paper":"/paper/wizardmath-empowering-mathematical-reasoning","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","date":"2023-08-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nlpxucan/WizardLM","path":"WizardCoder/src/inference_wizardcoder.py","file_url":"https://github.com/nlpxucan/WizardLM/blob/HEAD/WizardCoder/src/inference_wizardcoder.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0773321052909441","mcp_get_code":{"code_sha256":"0773321052909441"}},{"arxiv_id":"2308.09583","paper":"/paper/wizardmath-empowering-mathematical-reasoning","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","date":"2023-08-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nlpxucan/WizardLM","path":"WizardCoder/src/mbpp_gen.py","file_url":"https://github.com/nlpxucan/WizardLM/blob/HEAD/WizardCoder/src/mbpp_gen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"13dc99a819a4f615","mcp_get_code":{"code_sha256":"13dc99a819a4f615"}},{"arxiv_id":"2308.08434","paper":"/paper/a-bi-step-grounding-paradigm-for-large","title":"A Bi-Step Grounding Paradigm for Large Language Models in Recommendation Systems","date":"2023-08-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sai990323/grounding4rec","path":"inference.py","file_url":"https://github.com/sai990323/grounding4rec/blob/HEAD/inference.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ec980d0edf81e31d","mcp_get_code":{"code_sha256":"ec980d0edf81e31d"}},{"arxiv_id":"2307.09288","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IBM/Dromedary","path":"inference/run_stream_chatbot_demo.py","file_url":"https://github.com/IBM/Dromedary/blob/HEAD/inference/run_stream_chatbot_demo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"55e55d5b9201bf5c","mcp_get_code":{"code_sha256":"55e55d5b9201bf5c"}},{"arxiv_id":"2307.09288","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IBM/Dromedary","path":"mc_evaluation/evaluate_hhh_eval.py","file_url":"https://github.com/IBM/Dromedary/blob/HEAD/mc_evaluation/evaluate_hhh_eval.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"c478c1e77422f0de","mcp_get_code":{"code_sha256":"c478c1e77422f0de"}},{"arxiv_id":"2307.08072","paper":"/paper/do-emergent-abilities-exist-in-quantized","title":"Do Emergent Abilities Exist in Quantized Large Language Models: An Empirical Study","date":"2023-07-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucaibox/quantizedempirical","path":"finetune.py","file_url":"https://github.com/rucaibox/quantizedempirical/blob/HEAD/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2307.06082","paper":"/paper/velma-verbalization-embodiment-of-llm-agents","title":"VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View","date":"2023-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"raphael-sch/velma","path":"run_finetune.py","file_url":"https://github.com/raphael-sch/velma/blob/HEAD/run_finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b62337c3ffc7e968","mcp_get_code":{"code_sha256":"b62337c3ffc7e968"}},{"arxiv_id":"2307.05722","paper":"/paper/exploring-large-language-model-for-graph-data","title":"Exploring Large Language Model for Graph Data Understanding in Online Job Recommendations","date":"2023-07-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wlik/glrec","path":"model_GLRec.py","file_url":"https://github.com/wlik/glrec/blob/HEAD/model_GLRec.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f87a1fd80107335b","mcp_get_code":{"code_sha256":"f87a1fd80107335b"}},{"arxiv_id":"2307.04349","paper":"/paper/rltf-reinforcement-learning-from-unit-test","title":"RLTF: Reinforcement Learning from Unit Test Feedback","date":"2023-07-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zyq-scut/rltf","path":"generate.py","file_url":"https://github.com/zyq-scut/rltf/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"6a5218b692e1a379","mcp_get_code":{"code_sha256":"6a5218b692e1a379"}},{"arxiv_id":"2307.04349","paper":"/paper/rltf-reinforcement-learning-from-unit-test","title":"RLTF: Reinforcement Learning from Unit Test Feedback","date":"2023-07-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zyq-scut/rltf","path":"generate_codegen.py","file_url":"https://github.com/zyq-scut/rltf/blob/HEAD/generate_codegen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"458dc199427daade","mcp_get_code":{"code_sha256":"458dc199427daade"}},{"arxiv_id":"2307.00457","paper":"/paper/text-based-large-language-model-for","title":"GenRec: Large Language Model for Generative Recommendation","date":"2023-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rutgerswiselab/genrec","path":"evaluation.py","file_url":"https://github.com/rutgerswiselab/genrec/blob/HEAD/evaluation.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d2bdd366f27052bd","mcp_get_code":{"code_sha256":"d2bdd366f27052bd"}},{"arxiv_id":"2306.15595","paper":"/paper/extending-context-window-of-large-language","title":"Extending Context Window of Large Language Models via Positional Interpolation","date":"2023-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ymcui/chinese-llama-alpaca-2","path":"scripts/inference/inference_hf.py","file_url":"https://github.com/ymcui/chinese-llama-alpaca-2/blob/HEAD/scripts/inference/inference_hf.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b47f5a611055da10","mcp_get_code":{"code_sha256":"b47f5a611055da10"}},{"arxiv_id":"2306.13063","paper":"/paper/can-llms-express-their-uncertainty-an","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","date":"2023-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MiaoXiong2320/llm-uncertainty","path":"query_multistep.py","file_url":"https://github.com/MiaoXiong2320/llm-uncertainty/blob/HEAD/query_multistep.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6ad02b864df95421","mcp_get_code":{"code_sha256":"6ad02b864df95421"}},{"arxiv_id":"2306.08568","paper":"/paper/wizardcoder-empowering-code-large-language","title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","date":"2023-06-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nickrosh/evol-teacher","path":"humaneval_gen.py","file_url":"https://github.com/nickrosh/evol-teacher/blob/HEAD/humaneval_gen.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"13dc99a819a4f615","mcp_get_code":{"code_sha256":"13dc99a819a4f615"}},{"arxiv_id":"2306.07282","paper":"/paper/waffling-around-for-performance-visual","title":"Waffling around for Performance: Visual Classification with Random Words and Broad Concepts","date":"2023-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ExplainableML/WaffleCLIP","path":"generate_descriptors.py","file_url":"https://github.com/ExplainableML/WaffleCLIP/blob/HEAD/generate_descriptors.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d382e047433f0947","mcp_get_code":{"code_sha256":"d382e047433f0947"}},{"arxiv_id":"2306.05836","paper":"/paper/can-large-language-models-infer-causation","title":"Can Large Language Models Infer Causation from Correlation?","date":"2023-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"causalnlp/corr2cause","path":"code/run_alpaca.py","file_url":"https://github.com/causalnlp/corr2cause/blob/HEAD/code/run_alpaca.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d9793b16bbddeedb","mcp_get_code":{"code_sha256":"d9793b16bbddeedb"}},{"arxiv_id":"2305.18403","paper":"/paper/pruning-meets-low-rank-parameter-efficient","title":"LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning","date":"2023-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aim-uofa/loraprune","path":"prune.py","file_url":"https://github.com/aim-uofa/loraprune/blob/HEAD/prune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2d8a5c5d1c76d421","mcp_get_code":{"code_sha256":"2d8a5c5d1c76d421"}},{"arxiv_id":"2305.16300","paper":"/paper/landmark-attention-random-access-infinite","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","date":"2023-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eugenepentland/landmark-attention-qlora","path":"llama/run_test.py","file_url":"https://github.com/eugenepentland/landmark-attention-qlora/blob/HEAD/llama/run_test.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b9c4c8084f5cc40a","mcp_get_code":{"code_sha256":"b9c4c8084f5cc40a"}},{"arxiv_id":"2305.15075","paper":"/paper/huatuogpt-towards-taming-language-model-to-be","title":"HuatuoGPT, towards Taming Language Model to Be a Doctor","date":"2023-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"freedomintelligence/huatuogpt","path":"huatuo_cli_demo_stream.py","file_url":"https://github.com/freedomintelligence/huatuogpt/blob/HEAD/huatuo_cli_demo_stream.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fe4f81d0cc641ac2","mcp_get_code":{"code_sha256":"fe4f81d0cc641ac2"}},{"arxiv_id":"2305.14314","paper":"/paper/qlora-efficient-finetuning-of-quantized-llms","title":"QLoRA: Efficient Finetuning of Quantized LLMs","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b9c4c8084f5cc40a","mcp_get_code":{"code_sha256":"b9c4c8084f5cc40a"}},{"arxiv_id":"2305.14314","paper":"/paper/qlora-efficient-finetuning-of-quantized-llms","title":"QLoRA: Efficient Finetuning of Quantized LLMs","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"KohakuBlueleaf/guanaco-lora","path":"finetune.py","file_url":"https://github.com/KohakuBlueleaf/guanaco-lora/blob/HEAD/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a87961e99cab3b49","mcp_get_code":{"code_sha256":"a87961e99cab3b49"}},{"arxiv_id":"2305.12870","paper":"/paper/lion-adversarial-distillation-of-closed","title":"Lion: Adversarial Distillation of Proprietary Large Language Models","date":"2023-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yjiangcm/lion","path":"src/lion_inference.py","file_url":"https://github.com/yjiangcm/lion/blob/HEAD/src/lion_inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"36dc95d12630a6f0","mcp_get_code":{"code_sha256":"36dc95d12630a6f0"}},{"arxiv_id":"2305.03047","paper":"/paper/principle-driven-self-alignment-of-language-1","title":"Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision","date":"2023-05-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ibm/dromedary","path":"training/step2_principle_driven_self_alignment/generate_self_align_response.py","file_url":"https://github.com/ibm/dromedary/blob/HEAD/training/step2_principle_driven_self_alignment/generate_self_align_response.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"c6f4906a21d19e29","mcp_get_code":{"code_sha256":"c6f4906a21d19e29"}},{"arxiv_id":"2305.03047","paper":"/paper/principle-driven-self-alignment-of-language-1","title":"Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision","date":"2023-05-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ibm/dromedary","path":"inference/run_stream_chatbot_demo.py","file_url":"https://github.com/ibm/dromedary/blob/HEAD/inference/run_stream_chatbot_demo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"55e55d5b9201bf5c","mcp_get_code":{"code_sha256":"55e55d5b9201bf5c"}},{"arxiv_id":"2305.00447","paper":"/paper/tallrec-an-effective-and-efficient-tuning","title":"TALLRec: An Effective and Efficient Tuning Framework to Align Large Language Model with Recommendation","date":"2023-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sai990323/tallrec","path":"finetune_rec.py","file_url":"https://github.com/sai990323/tallrec/blob/HEAD/finetune_rec.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f87a1fd80107335b","mcp_get_code":{"code_sha256":"f87a1fd80107335b"}},{"arxiv_id":"2305.00447","paper":"/paper/tallrec-an-effective-and-efficient-tuning","title":"TALLRec: An Effective and Efficient Tuning Framework to Align Large Language Model with Recommendation","date":"2023-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sai990323/tallrec","path":"finetune.py","file_url":"https://github.com/sai990323/tallrec/blob/HEAD/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"28f53dc446261ab5","mcp_get_code":{"code_sha256":"28f53dc446261ab5"}},{"arxiv_id":"2305.00447","paper":"/paper/tallrec-an-effective-and-efficient-tuning","title":"TALLRec: An Effective and Efficient Tuning Framework to Align Large Language Model with Recommendation","date":"2023-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sai990323/tallrec","path":"finetune_multi_rec.py","file_url":"https://github.com/sai990323/tallrec/blob/HEAD/finetune_multi_rec.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"eeba02bd501ce894","mcp_get_code":{"code_sha256":"eeba02bd501ce894"}},{"arxiv_id":"2305.00447","paper":"/paper/tallrec-an-effective-and-efficient-tuning","title":"TALLRec: An Effective and Efficient Tuning Framework to Align Large Language Model with Recommendation","date":"2023-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sai990323/tallrec","path":"evaluate.py","file_url":"https://github.com/sai990323/tallrec/blob/HEAD/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2f87a49368fc78d7","mcp_get_code":{"code_sha256":"2f87a49368fc78d7"}},{"arxiv_id":"2304.08177","paper":"/paper/efficient-and-effective-text-encoding-for","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ymcui/chinese-llama-alpaca-3","path":"scripts/inference/inference_hf.py","file_url":"https://github.com/ymcui/chinese-llama-alpaca-3/blob/HEAD/scripts/inference/inference_hf.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"506e15dcebddded4","mcp_get_code":{"code_sha256":"506e15dcebddded4"}},{"arxiv_id":"2304.08177","paper":"/paper/efficient-and-effective-text-encoding-for","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neukg/techgpt-2.0","path":"mindspore_inference/techgpt2-alpaca_inference.py","file_url":"https://github.com/neukg/techgpt-2.0/blob/HEAD/mindspore_inference/techgpt2-alpaca_inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5805470da16397ec","mcp_get_code":{"code_sha256":"5805470da16397ec"}},{"arxiv_id":"2304.08177","paper":"/paper/efficient-and-effective-text-encoding-for","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","date":"2023-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neukg/techgpt-2.0","path":"mindspore_inference/techgpt2-atom_inference.py","file_url":"https://github.com/neukg/techgpt-2.0/blob/HEAD/mindspore_inference/techgpt2-atom_inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9975d177719247f6","mcp_get_code":{"code_sha256":"9975d177719247f6"}},{"arxiv_id":"2304.01933","paper":"/paper/llm-adapters-an-adapter-family-for-parameter","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","date":"2023-04-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2304.01933","paper":"/paper/llm-adapters-an-adapter-family-for-parameter","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","date":"2023-04-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"agi-edgerunners/llm-adapters","path":"generate.py","file_url":"https://github.com/agi-edgerunners/llm-adapters/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0dbc7fc6c518d0fb","mcp_get_code":{"code_sha256":"0dbc7fc6c518d0fb"}},{"arxiv_id":"2304.01933","paper":"/paper/llm-adapters-an-adapter-family-for-parameter","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","date":"2023-04-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"agi-edgerunners/llm-adapters","path":"evaluate.py","file_url":"https://github.com/agi-edgerunners/llm-adapters/blob/HEAD/evaluate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1c6b8be890b6118a","mcp_get_code":{"code_sha256":"1c6b8be890b6118a"}},{"arxiv_id":"2304.01196","paper":"/paper/baize-an-open-source-chat-model-with","title":"Baize: An Open-Source Chat Model with Parameter-Efficient Tuning on Self-Chat Data","date":"2023-04-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"project-baize/baize-chatbot","path":"finetune.py","file_url":"https://github.com/project-baize/baize-chatbot/blob/HEAD/finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"5062c499830f8141","mcp_get_code":{"code_sha256":"5062c499830f8141"}},{"arxiv_id":"2302.13971","paper":"/paper/llama-open-and-efficient-foundation-language-1","title":"LLaMA: Open and Efficient Foundation Language Models","date":"2023-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aethercortex/llama-x","path":"src/generate.py","file_url":"https://github.com/aethercortex/llama-x/blob/HEAD/src/generate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"96db588eb784d7e4","mcp_get_code":{"code_sha256":"96db588eb784d7e4"}},{"arxiv_id":"2302.13971","paper":"/paper/llama-open-and-efficient-foundation-language-1","title":"LLaMA: Open and Efficient Foundation Language Models","date":"2023-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ntunlplab/traditional-chinese-alpaca","path":"code/finetune.py","file_url":"https://github.com/ntunlplab/traditional-chinese-alpaca/blob/HEAD/code/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"911a8a5064b9a121","mcp_get_code":{"code_sha256":"911a8a5064b9a121"}},{"arxiv_id":"2302.13971","paper":"/paper/llama-open-and-efficient-foundation-language-1","title":"LLaMA: Open and Efficient Foundation Language Models","date":"2023-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ntunlplab/traditional-chinese-alpaca","path":"code/inference.py","file_url":"https://github.com/ntunlplab/traditional-chinese-alpaca/blob/HEAD/code/inference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d7d073a5b1729e58","mcp_get_code":{"code_sha256":"d7d073a5b1729e58"}},{"arxiv_id":"2302.13971","paper":"/paper/llama-open-and-efficient-foundation-language-1","title":"LLaMA: Open and Efficient Foundation Language Models","date":"2023-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"teelinsan/camoscio","path":"eval/src/utils.py","file_url":"https://github.com/teelinsan/camoscio/blob/HEAD/eval/src/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"efa79bea90c5fd5a","mcp_get_code":{"code_sha256":"efa79bea90c5fd5a"}},{"arxiv_id":"2212.10560","paper":"/paper/self-instruct-aligning-language-model-with","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","date":"2022-12-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jondurbin/airoboros","path":"airoboros/instructors/contextual.py","file_url":"https://github.com/jondurbin/airoboros/blob/HEAD/airoboros/instructors/contextual.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3df9ac239aea5147","mcp_get_code":{"code_sha256":"3df9ac239aea5147"}},{"arxiv_id":"2210.07183","paper":"/paper/visual-classification-via-description-from","title":"Visual Classification via Description from Large Language Models","date":"2022-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"explainableml/waffleclip","path":"generate_descriptors.py","file_url":"https://github.com/explainableml/waffleclip/blob/HEAD/generate_descriptors.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d382e047433f0947","mcp_get_code":{"code_sha256":"d382e047433f0947"}},{"arxiv_id":"2210.07183","paper":"/paper/visual-classification-via-description-from","title":"Visual Classification via Description from Large Language Models","date":"2022-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sachit-menon/classify_by_description_release","path":"generate_descriptors.py","file_url":"https://github.com/sachit-menon/classify_by_description_release/blob/HEAD/generate_descriptors.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ea60dc7cfafc02ad","mcp_get_code":{"code_sha256":"ea60dc7cfafc02ad"}},{"arxiv_id":"2207.01780","paper":"/paper/coderl-mastering-code-generation-through","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","date":"2022-07-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"salesforce/CodeRL","path":"generate.py","file_url":"https://github.com/salesforce/CodeRL/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"6a5218b692e1a379","mcp_get_code":{"code_sha256":"6a5218b692e1a379"}},{"arxiv_id":"2107.03374","paper":"/paper/evaluating-large-language-models-trained-on","title":"Evaluating Large Language Models Trained on Code","date":"2021-07-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"codedotal/gpt-code-clippy","path":"evaluation/apps_utils/generate_gpt_codes.py","file_url":"https://github.com/codedotal/gpt-code-clippy/blob/HEAD/evaluation/apps_utils/generate_gpt_codes.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5bcc0e96c2ae8311","mcp_get_code":{"code_sha256":"5bcc0e96c2ae8311"}},{"arxiv_id":"2107.03374","paper":"/paper/evaluating-large-language-models-trained-on","title":"Evaluating Large Language Models Trained on Code","date":"2021-07-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"codedotal/gpt-code-clippy","path":"data_processing/apps.py","file_url":"https://github.com/codedotal/gpt-code-clippy/blob/HEAD/data_processing/apps.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"73c40ea3df62ea10","mcp_get_code":{"code_sha256":"73c40ea3df62ea10"}},{"arxiv_id":"2025.findings-acl.923","paper":null,"title":"arXiv:2025.findings-acl.923","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"LCS2-IIITD/KD_generalization","path":"generative/finetune.py","file_url":"https://github.com/LCS2-IIITD/KD_generalization/blob/HEAD/generative/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f8af62839d4dab6d","mcp_get_code":{"code_sha256":"f8af62839d4dab6d"}},{"arxiv_id":"2025.findings-acl.923","paper":null,"title":"arXiv:2025.findings-acl.923","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"LCS2-IIITD/KD_generalization","path":"generative/commonsense_evaluate.py","file_url":"https://github.com/LCS2-IIITD/KD_generalization/blob/HEAD/generative/commonsense_evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b9ab95fbc9974ce7","mcp_get_code":{"code_sha256":"b9ab95fbc9974ce7"}},{"arxiv_id":"2025.findings-acl.923","paper":null,"title":"arXiv:2025.findings-acl.923","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"LCS2-IIITD/KD_generalization","path":"generative/evaluate.py","file_url":"https://github.com/LCS2-IIITD/KD_generalization/blob/HEAD/generative/evaluate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d4534c9da61c3482","mcp_get_code":{"code_sha256":"d4534c9da61c3482"}},{"arxiv_id":"2024.naacl-long.132","paper":null,"title":"arXiv:2024.naacl-long.132","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Kent0n-Li/ChatDoctor","path":"train_lora.py","file_url":"https://github.com/Kent0n-Li/ChatDoctor/blob/HEAD/train_lora.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56e674752db00649","mcp_get_code":{"code_sha256":"56e674752db00649"}},{"arxiv_id":"2024.findings-acl.178","paper":null,"title":"arXiv:2024.findings-acl.178","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"aim-uofa/LoRAPrune","path":"prune.py","file_url":"https://github.com/aim-uofa/LoRAPrune/blob/HEAD/prune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2d8a5c5d1c76d421","mcp_get_code":{"code_sha256":"2d8a5c5d1c76d421"}},{"arxiv_id":"2023.findings-emnlp.269","paper":null,"title":"arXiv:2023.findings-emnlp.269","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"PhoebusSi/Alpaca-CoT","path":"uniform_finetune.py","file_url":"https://github.com/PhoebusSi/Alpaca-CoT/blob/HEAD/uniform_finetune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0bec18a3b0d91a68","mcp_get_code":{"code_sha256":"0bec18a3b0d91a68"}},{"arxiv_id":"2023.findings-emnlp.269","paper":null,"title":"arXiv:2023.findings-emnlp.269","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"PhoebusSi/Alpaca-CoT","path":"generate.py","file_url":"https://github.com/PhoebusSi/Alpaca-CoT/blob/HEAD/generate.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cf3eb2732e36312a","mcp_get_code":{"code_sha256":"cf3eb2732e36312a"}},{"arxiv_id":"2023.findings-emnlp.269","paper":null,"title":"arXiv:2023.findings-emnlp.269","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"PhoebusSi/Alpaca-CoT","path":"finetune.py","file_url":"https://github.com/PhoebusSi/Alpaca-CoT/blob/HEAD/finetune.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"03c5ef77d20a1e2a","mcp_get_code":{"code_sha256":"03c5ef77d20a1e2a"}}]}