{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/repeat-kv","entry":"repeat_kv","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":244,"n_papers_ran":233,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":33,"n_samples_ran":25,"n_samples_fingerprinted":21,"n_places":267,"n_places_pointer_only":118,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":16,"ran":9,"unverified":8},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.03756","paper":"/paper/arxiv-2609-03756","title":"ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"speridlabs/eneas","path":"eneas/vendor/SeC/inference/modeling_internlm2.py","file_url":"https://github.com/speridlabs/eneas/blob/HEAD/eneas/vendor/SeC/inference/modeling_internlm2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2609.00097","paper":"/paper/arxiv-2609-00097","title":"Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"qluoluo/faster-flash-decoding","path":"ffd_core/modeling/llama.py","file_url":"https://github.com/qluoluo/faster-flash-decoding/blob/HEAD/ffd_core/modeling/llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2606.18781","paper":"/paper/arxiv-2606-18781","title":"Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"PunchlineAAAA/DICE","path":"dream/modeling_dream.py","file_url":"https://github.com/PunchlineAAAA/DICE/blob/HEAD/dream/modeling_dream.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2606.16158","paper":"/paper/arxiv-2606-16158","title":"Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"TencentBAC/LazyMCoT","path":"Qwen2.5/modeling_qwen2_5_vl_re_infer.py","file_url":"https://github.com/TencentBAC/LazyMCoT/blob/HEAD/Qwen2.5/modeling_qwen2_5_vl_re_infer.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2606.15880","paper":"/paper/arxiv-2606-15880","title":"Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"KQL11/Deep-VRM","path":"Models/DeepVRM/modeling_qwen2_5_vl.py","file_url":"https://github.com/KQL11/Deep-VRM/blob/HEAD/Models/DeepVRM/modeling_qwen2_5_vl.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2606.08705","paper":"/paper/arxiv-2606-08705","title":"Analyzing the Correlation Between Hallucinations and Knowledge Conflicts in Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"llaraspata/HallucinationDetection","path":"src/model/LlaMa.py","file_url":"https://github.com/llaraspata/HallucinationDetection/blob/HEAD/src/model/LlaMa.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2606.07502","paper":"/paper/arxiv-2606-07502","title":"Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"CentreChen/EmbFilter","path":"models/modeling_llama_lr.py","file_url":"https://github.com/CentreChen/EmbFilter/blob/HEAD/models/modeling_llama_lr.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2606.07502","paper":"/paper/arxiv-2606-07502","title":"Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"CentreChen/EmbFilter","path":"models/modeling_mistral_lr.py","file_url":"https://github.com/CentreChen/EmbFilter/blob/HEAD/models/modeling_mistral_lr.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2606.06098","paper":"/paper/arxiv-2606-06098","title":"IR3DE: A Linear Router for Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"gensyn-ai/IR3DE","path":"models/modeling_llama.py","file_url":"https://github.com/gensyn-ai/IR3DE/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2606.00535","paper":"/paper/arxiv-2606-00535","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"SAI-Lab-NYU/DREAM-S","path":"dream_s/model/cnets.py","file_url":"https://github.com/SAI-Lab-NYU/DREAM-S/blob/HEAD/dream_s/model/cnets.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2606.00535","paper":"/paper/arxiv-2606-00535","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"SAI-Lab-NYU/DREAM-S","path":"dream_s/model/modeling_llama_kv.py","file_url":"https://github.com/SAI-Lab-NYU/DREAM-S/blob/HEAD/dream_s/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2605.30992","paper":"/paper/arxiv-2605-30992","title":"Eigenvectors of Experts are Training-free Non-collapsing Routers","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"giangdip2410/SSMoE","path":"SSMoE/Language/SSMoE-Embedding/models/modeling_deepseek.py","file_url":"https://github.com/giangdip2410/SSMoE/blob/HEAD/SSMoE/Language/SSMoE-Embedding/models/modeling_deepseek.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2605.27980","paper":"/paper/arxiv-2605-27980","title":"Periodic RoPE for Infinite Context LLMs","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Cominder/miniwin","path":"model/model_miniwin.py","file_url":"https://github.com/Cominder/miniwin/blob/HEAD/model/model_miniwin.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"07d6ef500d143328","mcp_get_code":{"code_sha256":"07d6ef500d143328"}},{"arxiv_id":"2605.21177","paper":"/paper/arxiv-2605-21177","title":"ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"misonsky/chunk","path":"models/modeling_llama.py","file_url":"https://github.com/misonsky/chunk/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2605.18753","paper":"/paper/arxiv-2605-18753","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"fasa-org/dash-attention","path":"dash_attn/prefill/stage2_block_selection.py","file_url":"https://github.com/fasa-org/dash-attention/blob/HEAD/dash_attn/prefill/stage2_block_selection.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"4e762613ee907cdb","mcp_get_code":{"code_sha256":"4e762613ee907cdb"}},{"arxiv_id":"2605.11396","paper":"/paper/arxiv-2605-11396","title":"MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"YupengSu/MuonQ","path":"src/models.py","file_url":"https://github.com/YupengSu/MuonQ/blob/HEAD/src/models.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7140f5aa8cd118f3","mcp_get_code":{"code_sha256":"7140f5aa8cd118f3"}},{"arxiv_id":"2605.10537","paper":"/paper/arxiv-2605-10537","title":"Mela: Test-Time Memory Consolidation based on Transformation Hypothesis","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Musubi-ai/Mela","path":"mela/model/modeling_mela.py","file_url":"https://github.com/Musubi-ai/Mela/blob/HEAD/mela/model/modeling_mela.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2605.05892","paper":"/paper/arxiv-2605-05892","title":"Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"flas-ai/FLAS","path":"src/flas/model.py","file_url":"https://github.com/flas-ai/FLAS/blob/HEAD/src/flas/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0f07b44f9c18969e","mcp_get_code":{"code_sha256":"0f07b44f9c18969e"}},{"arxiv_id":"2604.18995","paper":"/paper/arxiv-2604-18995","title":"R 2 -dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"GATECH-EIC/R2-dLLM","path":"dream/model/modeling_dream.py","file_url":"https://github.com/GATECH-EIC/R2-dLLM/blob/HEAD/dream/model/modeling_dream.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2604.15750","paper":"/paper/arxiv-2604-15750","title":"DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"X-Xia0828/DepCap","path":"dream/model/modeling_dream.py","file_url":"https://github.com/X-Xia0828/DepCap/blob/HEAD/dream/model/modeling_dream.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2604.07394","paper":"/paper/arxiv-2604-07394","title":"Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"qqtang-code/FluxAttention","path":"fluxattn/training/eval/modeling_flash_llama.py","file_url":"https://github.com/qqtang-code/FluxAttention/blob/HEAD/fluxattn/training/eval/modeling_flash_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"56fbb035393380b6","mcp_get_code":{"code_sha256":"56fbb035393380b6"}},{"arxiv_id":"2603.08185","paper":"/paper/arxiv-2603-08185","title":"SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization SERQ: SALIENCY-AWARE LOW-RANK ERROR RECONSTRUCTION FOR LLM QUANTIZATION","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"acalabys/SERQ","path":"modeling/modeling_llama.py","file_url":"https://github.com/acalabys/SERQ/blob/HEAD/modeling/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2603.08185","paper":"/paper/arxiv-2603-08185","title":"SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization SERQ: SALIENCY-AWARE LOW-RANK ERROR RECONSTRUCTION FOR LLM QUANTIZATION","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"acalabys/SERQ","path":"modeling/modeling_gemma3.py","file_url":"https://github.com/acalabys/SERQ/blob/HEAD/modeling/modeling_gemma3.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2603.00188","paper":"/paper/arxiv-2603-00188","title":"ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"94wen94/ST-Lite","path":"eval/attention_helpers.py","file_url":"https://github.com/94wen94/ST-Lite/blob/HEAD/eval/attention_helpers.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"404c0af567476d50","mcp_get_code":{"code_sha256":"404c0af567476d50"}},{"arxiv_id":"2602.16052","paper":"/paper/arxiv-2602-16052","title":"MoE-Spec: Expert Budgeting for Efficient Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"SafeAILab/EAGLE","path":"eagle/modeling_eagle.py","file_url":"https://github.com/SafeAILab/EAGLE/blob/HEAD/eagle/modeling_eagle.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2602.16052","paper":"/paper/arxiv-2602-16052","title":"MoE-Spec: Expert Budgeting for Efficient Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"SafeAILab/EAGLE","path":"eagle/model/cnets.py","file_url":"https://github.com/SafeAILab/EAGLE/blob/HEAD/eagle/model/cnets.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2602.05258","paper":"/paper/arxiv-2602-05258","title":"CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"hrlics/CoPE","path":"modeling_cope.py","file_url":"https://github.com/hrlics/CoPE/blob/HEAD/modeling_cope.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2602.05258","paper":"/paper/arxiv-2602-05258","title":"CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"hrlics/CoPE","path":"train/training/modeling_flash_llama_cope.py","file_url":"https://github.com/hrlics/CoPE/blob/HEAD/train/training/modeling_flash_llama_cope.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"69874376c94f0785","mcp_get_code":{"code_sha256":"69874376c94f0785"}},{"arxiv_id":"2601.19278","paper":"/paper/arxiv-2601-19278","title":"DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"fvliang/DART","path":"dart/model/llama3_dart.py","file_url":"https://github.com/fvliang/DART/blob/HEAD/dart/model/llama3_dart.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2601.17868","paper":"/paper/arxiv-2601-17868","title":"VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"ziHoHe/VidLaDA","path":"train/llada_v_prepare/files/modeling_llada.py","file_url":"https://github.com/ziHoHe/VidLaDA/blob/HEAD/train/llada_v_prepare/files/modeling_llada.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2601.17367","paper":"/paper/arxiv-2601-17367","title":"Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"LCM-Lab/Elastic-Attention","path":"elasticattn/src/model_utils.py","file_url":"https://github.com/LCM-Lab/Elastic-Attention/blob/HEAD/elasticattn/src/model_utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2601.15498","paper":"/paper/arxiv-2601-15498","title":"MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"5SSjw/MARS","path":"mars/model/cnets1.py","file_url":"https://github.com/5SSjw/MARS/blob/HEAD/mars/model/cnets1.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2601.15498","paper":"/paper/arxiv-2601-15498","title":"MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"5SSjw/MARS","path":"mars/model/cnets.py","file_url":"https://github.com/5SSjw/MARS/blob/HEAD/mars/model/cnets.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2601.03248","paper":"/paper/arxiv-2601-03248","title":"STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"LingFengGold/STReasoner","path":"base_model/Config-Qwen2.5-14B-Instruct/modeling_qwen2.py","file_url":"https://github.com/LingFengGold/STReasoner/blob/HEAD/base_model/Config-Qwen2.5-14B-Instruct/modeling_qwen2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2511.05299","paper":"/paper/arxiv-2511-05299","title":"LiveStar: Live Streaming Assistant for Real-World Online Video Understanding","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"yzy-bupt/LiveStar","path":"inference/modeling_livestar_llm.py","file_url":"https://github.com/yzy-bupt/LiveStar/blob/HEAD/inference/modeling_livestar_llm.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2511.02213","paper":"/paper/arxiv-2511-02213","title":"IG-Pruning: Input-Guided Block Pruning for Large Language Models","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"ictnlp/IG-Pruning","path":"src/models/dsr_modeling_llama.py","file_url":"https://github.com/ictnlp/IG-Pruning/blob/HEAD/src/models/dsr_modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2511.02213","paper":"/paper/arxiv-2511-02213","title":"IG-Pruning: Input-Guided Block Pruning for Large Language Models","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"ictnlp/IG-Pruning","path":"src/models/dsr_modeling_qwen3.py","file_url":"https://github.com/ictnlp/IG-Pruning/blob/HEAD/src/models/dsr_modeling_qwen3.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2510.22139","paper":"/paper/arxiv-2510-22139","title":"Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"LiuJinzhe-Keepgoing/NMKE","path":"modeling_llama.py","file_url":"https://github.com/LiuJinzhe-Keepgoing/NMKE/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2510.21270","paper":"/paper/arxiv-2510-21270","title":"Sparser Block-Sparse Attention via Token Permutation","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"xinghaow99/pbs-attn","path":"pbs_attn/patch/huggingface.py","file_url":"https://github.com/xinghaow99/pbs-attn/blob/HEAD/pbs_attn/patch/huggingface.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2510.06195","paper":"/paper/arxiv-2510-06195","title":"Latent Speech-Text Transformer","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"facebookresearch/lst","path":"lst/base_transformer.py","file_url":"https://github.com/facebookresearch/lst/blob/HEAD/lst/base_transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"705c70c44ddc8080","mcp_get_code":{"code_sha256":"705c70c44ddc8080"}},{"arxiv_id":"2509.15235","paper":"/paper/arxiv-2509-15235","title":"ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"KangJialiang/ViSpec","path":"vispec/model/cnets.py","file_url":"https://github.com/KangJialiang/ViSpec/blob/HEAD/vispec/model/cnets.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2509.15235","paper":"/paper/arxiv-2509-15235","title":"ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"KangJialiang/ViSpec","path":"vispec/model/modeling_llama_kv.py","file_url":"https://github.com/KangJialiang/ViSpec/blob/HEAD/vispec/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2508.05606","paper":"/paper/arxiv-2508-05606","title":"Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"Fr0zenCrane/UniCoT","path":"modeling/qwen2/modeling_qwen2.py","file_url":"https://github.com/Fr0zenCrane/UniCoT/blob/HEAD/modeling/qwen2/modeling_qwen2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2507.23284","paper":null,"title":"arXiv:2507.23284","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"mlvlab/BLiM","path":"videochat_flash/modeling_qwen2_flash.py","file_url":"https://github.com/mlvlab/BLiM/blob/HEAD/videochat_flash/modeling_qwen2_flash.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2507.22424","paper":null,"title":"arXiv:2507.22424","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"PineTreeWss/SpecVLA","path":"openvla/specdecoding/model/cnets.py","file_url":"https://github.com/PineTreeWss/SpecVLA/blob/HEAD/openvla/specdecoding/model/cnets.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2507.11273","paper":"/paper/kv-latent-dimensional-level-kv-cache","title":"KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding","date":"2025-07-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ShiLuohe/KV-Latent","path":"modelcodes/modeling_llama3.py","file_url":"https://github.com/ShiLuohe/KV-Latent/blob/HEAD/modelcodes/modeling_llama3.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2507.10419","paper":null,"title":"arXiv:2507.10419","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"Victorletzelter/LoRA-MCL","path":"ALMA/modeling_xalma.py","file_url":"https://github.com/Victorletzelter/LoRA-MCL/blob/HEAD/ALMA/modeling_xalma.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2506.18841","paper":"/paper/longwriter-zero-mastering-ultra-long-text","title":"LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning","date":"2025-06-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thudm/longwriter","path":"train/patch/modeling_llama.py","file_url":"https://github.com/thudm/longwriter/blob/HEAD/train/patch/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2506.15220","paper":"/paper/video-salmonn-2-captioning-enhanced-audio","title":"video-SALMONN 2: Captioning-Enhanced Audio-Visual Large Language Models","date":"2025-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bytedance/video-salmonn-2","path":"video_SALMONN2_pro/qwenvl/model/modeling_qwen3_vl.py","file_url":"https://github.com/bytedance/video-salmonn-2/blob/HEAD/video_SALMONN2_pro/qwenvl/model/modeling_qwen3_vl.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2506.09944","paper":"/paper/query-focused-retrieval-heads-improve-long","title":"Query-Focused Retrieval Heads Improve Long-Context Reasoning and Re-ranking","date":"2025-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-pli/QRHead","path":"src/qrretriever/custom_modeling_llama.py","file_url":"https://github.com/princeton-pli/QRHead/blob/HEAD/src/qrretriever/custom_modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2506.09351","paper":null,"title":"arXiv:2506.09351","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"yuchenblah/DIVE","path":"models/llama/modeling_llama.py","file_url":"https://github.com/yuchenblah/DIVE/blob/HEAD/models/llama/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2506.08373","paper":"/paper/draft-based-approximate-inference-for-llms","title":"Draft-based Approximate Inference for LLMs","date":"2025-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2506.05410","paper":"/paper/homogeneous-keys-heterogeneous-values","title":"Homogeneous Keys, Heterogeneous Values: Exploiting Local KV Cache Asymmetry for Long-Context LLMs","date":"2025-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"the-scale-lab/AsymKV","path":"asymkv/method/asymkv.py","file_url":"https://github.com/the-scale-lab/AsymKV/blob/HEAD/asymkv/method/asymkv.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56a1aae391d1d899","mcp_get_code":{"code_sha256":"56a1aae391d1d899"}},{"arxiv_id":"2505.24244","paper":"/paper/mamba-knockout-for-unraveling-factual","title":"Mamba Knockout for Unraveling Factual Information Flow","date":"2025-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nirendy/mamba-knockout","path":"src/experiments/knockout/llama/sdpa_attention.py","file_url":"https://github.com/nirendy/mamba-knockout/blob/HEAD/src/experiments/knockout/llama/sdpa_attention.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2505.23416","paper":"/paper/kvzip-query-agnostic-kv-cache-compression","title":"KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction","date":"2025-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2505.22842","paper":"/paper/bayesian-attention-mechanism-a-probabilistic","title":"Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolation","date":"2025-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"arthursbianchessi/bam","path":"models/bam.py","file_url":"https://github.com/arthursbianchessi/bam/blob/HEAD/models/bam.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6d2a08dcf3466514","mcp_get_code":{"code_sha256":"6d2a08dcf3466514"}},{"arxiv_id":"2505.20674","paper":"/paper/pretraining-language-models-to-ponder-in","title":"Pretraining Language Models to Ponder in Continuous Space","date":"2025-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2505.16415","paper":"/paper/attributing-response-to-context-a-jensen","title":"Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation","date":"2025-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ruizheliUOA/ARC_JSD","path":"llm_models/modeling_gemma2.py","file_url":"https://github.com/ruizheliUOA/ARC_JSD/blob/HEAD/llm_models/modeling_gemma2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2505.14671","paper":"/paper/unictokens-boosting-personalized","title":"UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"arctanxarc/unictokens","path":"models/phi.py","file_url":"https://github.com/arctanxarc/unictokens/blob/HEAD/models/phi.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2505.14640","paper":"/paper/videoeval-pro-robust-and-realistic-long-video","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/videochat-flash","path":"llava-train_videochat/llava/model/language_model/modeling_qwen2_flash.py","file_url":"https://github.com/opengvlab/videochat-flash/blob/HEAD/llava-train_videochat/llava/model/language_model/modeling_qwen2_flash.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2505.13866","paper":"/paper/reasoning-path-compression-compressing","title":"Reasoning Path Compression: Compressing Generation Trajectories for Efficient LLM Reasoning","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiwonsong-dev/reasoningpathcompression","path":"rpc/rpc_utils.py","file_url":"https://github.com/jiwonsong-dev/reasoningpathcompression/blob/HEAD/rpc/rpc_utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2505.10518","paper":"/paper/multi-token-prediction-needs-registers","title":"Multi-Token Prediction Needs Registers","date":"2025-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nasosger/mutor","path":"language_modeling/src/models/llama_mutor.py","file_url":"https://github.com/nasosger/mutor/blob/HEAD/language_modeling/src/models/llama_mutor.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2505.10518","paper":"/paper/multi-token-prediction-needs-registers","title":"Multi-Token Prediction Needs Registers","date":"2025-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nasosger/mutor","path":"language_modeling/src/models/gemma_mutor.py","file_url":"https://github.com/nasosger/mutor/blob/HEAD/language_modeling/src/models/gemma_mutor.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2505.10475","paper":"/paper/parallel-scaling-law-for-language-models","title":"Parallel Scaling Law for Language Models","date":"2025-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2505.06708","paper":"/paper/gated-attention-for-large-language-models-non","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","date":"2025-05-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qiuzh20/gated_attention","path":"modeling_qwen3.py","file_url":"https://github.com/qiuzh20/gated_attention/blob/HEAD/modeling_qwen3.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2505.03005","paper":"/paper/radlads-rapid-attention-distillation-to","title":"RADLADS: Rapid Attention Distillation to Linear Attention Decoders at Scale","date":"2025-05-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"recursal/radlads-paper","path":"rwkv6attn.py","file_url":"https://github.com/recursal/radlads-paper/blob/HEAD/rwkv6attn.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2504.21403","paper":null,"title":"arXiv:2504.21403","date":null,"month_inferred_from_arxiv_id":"2025-04","title_source":null,"repo":"ANDgate99/Explore-Then-Select","path":"model/modeling_qwen2.py","file_url":"https://github.com/ANDgate99/Explore-Then-Select/blob/HEAD/model/modeling_qwen2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2504.20595","paper":"/paper/reasonir-training-retrievers-for-reasoning","title":"ReasonIR: Training Retrievers for Reasoning Tasks","date":"2025-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2504.05520","paper":"/paper/efficient-reinforcement-finetuning-via","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","date":"2025-04-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uscnlp-lime/verl","path":"verl/models/transformers/monkey_patch.py","file_url":"https://github.com/uscnlp-lime/verl/blob/HEAD/verl/models/transformers/monkey_patch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"00f0f9848c8cd16c","mcp_get_code":{"code_sha256":"00f0f9848c8cd16c"}},{"arxiv_id":"2503.20533","paper":"/paper/accelerate-parallelizable-reasoning-via","title":"Accelerate Parallelizable Reasoning via Parallel Decoding within One Sequence","date":"2025-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2503.19903","paper":"/paper/scaling-vision-pre-training-to-4k-resolution","title":"Scaling Vision Pre-Training to 4K Resolution","date":"2025-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"efficient-large-model/vila","path":"llava/eval/vision_niah_vila/zigzag_ring_attn/modeling_qwen2.py","file_url":"https://github.com/efficient-large-model/vila/blob/HEAD/llava/eval/vision_niah_vila/zigzag_ring_attn/modeling_qwen2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2503.15798","paper":"/paper/mixture-of-lookup-experts","title":"Mixture of Lookup Experts","date":"2025-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jieshibo/mole","path":"modeling_mole.py","file_url":"https://github.com/jieshibo/mole/blob/HEAD/modeling_mole.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ab40781baaa35b67","mcp_get_code":{"code_sha256":"ab40781baaa35b67"}},{"arxiv_id":"2503.13440","paper":"/paper/matvlm-hybrid-mamba-transformer-for-efficient","title":"MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling","date":"2025-03-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hustvl/MaTVLM","path":"mamba2/hybrid_mamba_layer.py","file_url":"https://github.com/hustvl/MaTVLM/blob/HEAD/mamba2/hybrid_mamba_layer.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2503.12559","paper":"/paper/adaretake-adaptive-redundancy-reduction-to","title":"AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding","date":"2025-03-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sczwangxiao/video-flexreduc","path":"retake/longvideo_cache.py","file_url":"https://github.com/sczwangxiao/video-flexreduc/blob/HEAD/retake/longvideo_cache.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2503.12340","paper":"/paper/svd-llm-v2-optimizing-singular-value","title":"SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression","date":"2025-03-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aiot-mlsys-lab/svd-llm","path":"SVDLLM.py","file_url":"https://github.com/aiot-mlsys-lab/svd-llm/blob/HEAD/SVDLLM.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"25ef0712acc702e7","mcp_get_code":{"code_sha256":"25ef0712acc702e7"}},{"arxiv_id":"2503.11187","paper":"/paper/fastvid-dynamic-density-pruning-for-fast","title":"FastVID: Dynamic Density Pruning for Fast Video Large Language Models","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2503.10501","paper":"/paper/tokencarve-information-preserving-visual","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","date":"2025-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shawntan86/tokencarve","path":"TokenCarve/modeling_llama.py","file_url":"https://github.com/shawntan86/tokencarve/blob/HEAD/TokenCarve/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2503.10135","paper":"/paper/gumiho-a-hybrid-architecture-to-prioritize","title":"Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding","date":"2025-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AMD-AIG-AIMA/Gumiho","path":"gumiho/model/cnets.py","file_url":"https://github.com/AMD-AIG-AIMA/Gumiho/blob/HEAD/gumiho/model/cnets.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2503.10135","paper":"/paper/gumiho-a-hybrid-architecture-to-prioritize","title":"Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding","date":"2025-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AMD-AIG-AIMA/Gumiho","path":"gumiho/model/modeling_llama_kv.py","file_url":"https://github.com/AMD-AIG-AIMA/Gumiho/blob/HEAD/gumiho/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2502.11494","paper":"/paper/stop-looking-for-important-tokens-in","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","date":"2025-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zichenwen1/dart","path":"Qwen2_5-VL/Qwen2_5VL_DART/modeling_qwen2_5_vl_self.py","file_url":"https://github.com/zichenwen1/dart/blob/HEAD/Qwen2_5-VL/Qwen2_5VL_DART/modeling_qwen2_5_vl_self.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2502.07827","paper":"/paper/implicit-language-models-are-rnns-balancing","title":"Implicit Language Models are RNNs: Balancing Parallelization and Expressivity","date":"2025-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/implicit_languagemodels","path":"implicit_llm/modules/attention.py","file_url":"https://github.com/microsoft/implicit_languagemodels/blob/HEAD/implicit_llm/modules/attention.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"541ba8da0f7b6512","mcp_get_code":{"code_sha256":"541ba8da0f7b6512"}},{"arxiv_id":"2502.06352","paper":"/paper/lantern-enhanced-relaxed-speculative-decoding","title":"LANTERN++: Enhancing Relaxed Speculative Decoding with Static Tree Drafting for Visual Auto-regressive Models","date":"2025-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2502.05173","paper":"/paper/videorope-what-makes-for-good-video-rotary","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","date":"2025-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wiselnn570/videorope","path":"videorope_plus/v_ruler/easy_context/modeling_qwen2.py","file_url":"https://github.com/wiselnn570/videorope/blob/HEAD/videorope_plus/v_ruler/easy_context/modeling_qwen2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2502.00592","paper":"/paper/m-extending-memoryllm-with-scalable-long-term","title":"M+: Extending MemoryLLM with Scalable Long-Term Memory","date":"2025-02-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2501.13987","paper":"/paper/ostquant-refining-large-language-model","title":"OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting","date":"2025-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"brotherhappy/ostquant","path":"models/modeling_llama.py","file_url":"https://github.com/brotherhappy/ostquant/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ab40781baaa35b67","mcp_get_code":{"code_sha256":"ab40781baaa35b67"}},{"arxiv_id":"2501.13925","paper":"/paper/geopixel-pixel-grounding-large-multimodal","title":"GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing","date":"2025-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mbzuai-oryx/geopixel","path":"model/IXC/modeling_internlm2.py","file_url":"https://github.com/mbzuai-oryx/geopixel/blob/HEAD/model/IXC/modeling_internlm2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2501.06589","paper":"/paper/ladder-residual-parallelism-aware","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","date":"2025-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mayank31398/ladder-residual-inference","path":"hf_modeling_utils/modeling_llama_ladder.py","file_url":"https://github.com/mayank31398/ladder-residual-inference/blob/HEAD/hf_modeling_utils/modeling_llama_ladder.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2501.01986","paper":"/paper/framefusion-combining-similarity-and","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Visual Language Models","date":"2024-12-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thu-nics/framefusion","path":"framefusion/models/internvl/modeling_internlm2.py","file_url":"https://github.com/thu-nics/framefusion/blob/HEAD/framefusion/models/internvl/modeling_internlm2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2412.20504","paper":"/paper/retake-reducing-temporal-and-knowledge","title":"ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding","date":"2024-12-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sczwangxiao/video-retake","path":"retake/longvideo_cache.py","file_url":"https://github.com/sczwangxiao/video-retake/blob/HEAD/retake/longvideo_cache.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2412.18450","paper":"/paper/3dgraphllm-combining-semantic-graphs-and","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","date":"2024-12-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cognitiveaisystems/3dgraphllm","path":"models/modeling_llama.py","file_url":"https://github.com/cognitiveaisystems/3dgraphllm/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2412.13335","paper":"/paper/experience-of-training-a-1-7b-parameter-llama","title":"Experience of Training a 1.7B-Parameter LLaMa Model From Scratch","date":"2024-12-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2412.09871","paper":"/paper/byte-latent-transformer-patches-scale-better","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","date":"2024-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/blt","path":"bytelatent/base_transformer.py","file_url":"https://github.com/facebookresearch/blt/blob/HEAD/bytelatent/base_transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"705c70c44ddc8080","mcp_get_code":{"code_sha256":"705c70c44ddc8080"}},{"arxiv_id":"2412.07763","paper":"/paper/bayesian-optimization-of-antibodies-informed","title":"Bayesian Optimization of Antibodies Informed by a Generative Model of Evolving Sequences","date":"2024-12-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alannawzadamin/clonebo","path":"clonebo/modeling_llama.py","file_url":"https://github.com/alannawzadamin/clonebo/blob/HEAD/clonebo/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2412.04652","paper":"/paper/cross-self-kv-cache-pruning-for-efficient","title":"Cross-Self KV Cache Pruning for Efficient Vision-Language Inference","date":"2024-12-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2412.01292","paper":"/paper/lscenellm-enhancing-large-3d-scene","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","date":"2024-12-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Hoyyyaard/LSceneLLM","path":"models/modeling_llama.py","file_url":"https://github.com/Hoyyyaard/LSceneLLM/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2412.00129","paper":"/paper/scaling-particle-collision-data-analysis","title":"Scaling Particle Collision Data Analysis","date":"2024-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"supersymmetry-technologies/bbt-neutron","path":"model/modeling_binbbt.py","file_url":"https://github.com/supersymmetry-technologies/bbt-neutron/blob/HEAD/model/modeling_binbbt.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ab40781baaa35b67","mcp_get_code":{"code_sha256":"ab40781baaa35b67"}},{"arxiv_id":"2411.04996","paper":"/paper/mixture-of-transformers-a-sparse-and-scalable","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","date":"2024-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"allenzren/open-pi-zero","path":"src/model/utils.py","file_url":"https://github.com/allenzren/open-pi-zero/blob/HEAD/src/model/utils.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4e762613ee907cdb","mcp_get_code":{"code_sha256":"4e762613ee907cdb"}},{"arxiv_id":"2411.02280","paper":"/paper/the-llm-language-network-a-neuroscientific","title":"The LLM Language Network: A Neuroscientific Approach for Identifying Causally Task-Relevant Units","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bkhmsi/llm-localization","path":"models/modeling_gemma.py","file_url":"https://github.com/bkhmsi/llm-localization/blob/HEAD/models/modeling_gemma.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.19258","paper":"/paper/not-all-heads-matter-a-head-level-kv-cache","title":"Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning","date":"2024-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fyyfu/headkv","path":"headkv/snapkv_utils.py","file_url":"https://github.com/fyyfu/headkv/blob/HEAD/headkv/snapkv_utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2410.18517","paper":"/paper/kvsharer-efficient-inference-via-layer-wise","title":"KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing","date":"2024-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yangyifei729/kvsharer","path":"internlm2_real_share/modeling_internlm2_kvsharer.py","file_url":"https://github.com/yangyifei729/kvsharer/blob/HEAD/internlm2_real_share/modeling_internlm2_kvsharer.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.17897","paper":"/paper/value-residual-learning-for-alleviating","title":"Value Residual Learning For Alleviating Attention Concentration In Transformers","date":"2024-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Zcchill/Value-Residual-Learning","path":"src/modeling/modeling_llama_NeuTRENO_lambda04.py","file_url":"https://github.com/Zcchill/Value-Residual-Learning/blob/HEAD/src/modeling/modeling_llama_NeuTRENO_lambda04.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.17891","paper":"/paper/scaling-diffusion-language-models-via","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","date":"2024-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HKUNLP/DiffuLLaMA","path":"DiffuLLaMA-training/model_llama.py","file_url":"https://github.com/HKUNLP/DiffuLLaMA/blob/HEAD/DiffuLLaMA-training/model_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.17247","paper":"/paper/pyramiddrop-accelerating-your-large-vision","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.16179","paper":"/paper/magicpig-lsh-sampling-for-efficient-llm","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","date":"2024-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"infini-ai-lab/magicpig","path":"models/utils.py","file_url":"https://github.com/infini-ai-lab/magicpig/blob/HEAD/models/utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2410.14067","paper":"/paper/provable-benefits-of-complex","title":"Provable Benefits of Complex Parameterizations for Structured State Space Models","date":"2024-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alxndrTL/mamba.py","path":"mambapy/jamba.py","file_url":"https://github.com/alxndrTL/mamba.py/blob/HEAD/mambapy/jamba.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2410.13708","paper":"/paper/on-the-role-of-attention-heads-in-large","title":"On the Role of Attention Heads in Large Language Model Safety","date":"2024-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ydyjya/SafetyHeadAttribution","path":"lib/utils/custommodel.py","file_url":"https://github.com/ydyjya/SafetyHeadAttribution/blob/HEAD/lib/utils/custommodel.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2410.12299","paper":"/paper/semantics-adaptive-activation-intervention","title":"Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors","date":"2024-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weixuan-wang123/SADI","path":"modeling_llama.py","file_url":"https://github.com/weixuan-wang123/SADI/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.11988","paper":"/paper/disp-llm-dimension-independent-structural","title":"DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.11842","paper":"/paper/moh-multi-head-attention-as-mixture-of-head","title":"MoH: Multi-Head Attention as Mixture-of-Head Attention","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.11289","paper":"/paper/subspace-optimization-for-large-language","title":"Subspace Optimization for Large Language Models with Convergence Guarantees","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pkumelon/Golore","path":"zo-bench/modeling_llama.py","file_url":"https://github.com/pkumelon/Golore/blob/HEAD/zo-bench/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.10450","paper":"/paper/kblam-knowledge-base-augmented-language-model","title":"KBLaM: Knowledge Base augmented Language Model","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/KBLaM","path":"src/kblam/models/phi3_model.py","file_url":"https://github.com/microsoft/KBLaM/blob/HEAD/src/kblam/models/phi3_model.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.10343","paper":"/paper/locking-down-the-finetuned-llms-safety","title":"Locking Down the Finetuned LLMs Safety","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhu-minjun/safetylock","path":"safetylock/model_utils/modeling_llama.py","file_url":"https://github.com/zhu-minjun/safetylock/blob/HEAD/safetylock/model_utils/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.10254","paper":"/paper/lolcats-on-low-rank-linearizing-of-large","title":"LoLCATs: On Low-Rank Linearizing of Large Language Models","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hazyresearch/lolcats","path":"src/model/linear_attention/linear_window_attention_sw_linear.py","file_url":"https://github.com/hazyresearch/lolcats/blob/HEAD/src/model/linear_attention/linear_window_attention_sw_linear.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ab05d5e4c4236572","mcp_get_code":{"code_sha256":"ab05d5e4c4236572"}},{"arxiv_id":"2410.09760","paper":"/paper/targeted-vaccine-safety-alignment-for-large","title":"Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation","date":"2024-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lslland/t-vaccine","path":"models/modeling_gemma_my.py","file_url":"https://github.com/lslland/t-vaccine/blob/HEAD/models/modeling_gemma_my.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.09760","paper":"/paper/targeted-vaccine-safety-alignment-for-large","title":"Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation","date":"2024-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lslland/t-vaccine","path":"models/modeling_gemma2_my.py","file_url":"https://github.com/lslland/t-vaccine/blob/HEAD/models/modeling_gemma2_my.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ca6c6aa5c8b23b27","mcp_get_code":{"code_sha256":"ca6c6aa5c8b23b27"}},{"arxiv_id":"2410.08989","paper":"/paper/subzero-random-subspace-zeroth-order","title":"Zeroth-Order Fine-Tuning of LLMs in Random Subspaces","date":"2024-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zimingyy/subzero","path":"large_models/modeling_llama.py","file_url":"https://github.com/zimingyy/subzero/blob/HEAD/large_models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.07348","paper":"/paper/moe-accelerating-mixture-of-experts-methods","title":"MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.06169","paper":"/paper/quadratic-is-not-what-you-need-for-multimodal","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","date":"2024-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZhangAIPI/YOPO_MLLM_Pruning","path":"modeling_llama_prune.py","file_url":"https://github.com/ZhangAIPI/YOPO_MLLM_Pruning/blob/HEAD/modeling_llama_prune.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.06154","paper":"/paper/glov-guided-large-language-models-as-implicit","title":"GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models","date":"2024-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jmiemirza/glov","path":"modeling_llama.py","file_url":"https://github.com/jmiemirza/glov/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2410.05357","paper":"/paper/model-glue-democratized-llm-scaling-for-a","title":"Model-GLUE: Democratized LLM Scaling for A Large Model Zoo in the Wild","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Model-GLUE/Model-GLUE","path":"mixture/mixtral_model_level/modeling_mixtral_model_level_hybrid.py","file_url":"https://github.com/Model-GLUE/Model-GLUE/blob/HEAD/mixture/mixtral_model_level/modeling_mixtral_model_level_hybrid.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.05076","paper":"/paper/tidaldecode-fast-and-accurate-llm-decoding","title":"TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse Attention","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DerrickYLJ/TidalDecode","path":"src/models/llama_tidaldecoding.py","file_url":"https://github.com/DerrickYLJ/TidalDecode/blob/HEAD/src/models/llama_tidaldecoding.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.05076","paper":"/paper/tidaldecode-fast-and-accurate-llm-decoding","title":"TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse Attention","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DerrickYLJ/TidalDecode","path":"src/models/yarn_tidaldecoding.py","file_url":"https://github.com/DerrickYLJ/TidalDecode/blob/HEAD/src/models/yarn_tidaldecoding.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53b2e52873fb8342","mcp_get_code":{"code_sha256":"53b2e52873fb8342"}},{"arxiv_id":"2410.02660","paper":"/paper/how-to-train-long-context-language-models","title":"How to Train Long-Context Language Models (Effectively)","date":"2024-10-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-nlp/prolong","path":"training/modeling_flash_llama.py","file_url":"https://github.com/princeton-nlp/prolong/blob/HEAD/training/modeling_flash_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"69874376c94f0785","mcp_get_code":{"code_sha256":"69874376c94f0785"}},{"arxiv_id":"2410.01380","paper":"/paper/knowledge-entropy-decay-during-language-model","title":"Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition","date":"2024-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kaistAI/Knowledge-Entropy","path":"analysis/modeling_olmo_hf.py","file_url":"https://github.com/kaistAI/Knowledge-Entropy/blob/HEAD/analysis/modeling_olmo_hf.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2410.00255","paper":"/paper/robin3d-improving-3d-large-language-model-via","title":"Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning","date":"2024-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weitaikang/robin3d","path":"models/modeling_llama.py","file_url":"https://github.com/weitaikang/robin3d/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2409.19134","paper":"/paper/confidential-prompting-protecting-user","title":"Confidential Prompting: Protecting User Prompts from Cloud LLM Providers","date":"2024-09-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yale-sys/confidential-prompting","path":"attention.py","file_url":"https://github.com/yale-sys/confidential-prompting/blob/HEAD/attention.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2409.18869","paper":"/paper/emu3-next-token-prediction-is-all-you-need","title":"Emu3: Next-Token Prediction is All You Need","date":"2024-09-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baaivision/emu3","path":"emu3/mllm/modeling_emu3.py","file_url":"https://github.com/baaivision/emu3/blob/HEAD/emu3/mllm/modeling_emu3.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2409.17504","paper":"/paper/haloscope-harnessing-unlabeled-llm","title":"HaloScope: Harnessing Unlabeled LLM Generations for Hallucination Detection","date":"2024-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deeplearning-wisc/haloscope","path":"llama_iti/modeling_llama.py","file_url":"https://github.com/deeplearning-wisc/haloscope/blob/HEAD/llama_iti/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2409.17027","paper":"/paper/counterfactual-token-generation-in-large","title":"Counterfactual Token Generation in Large Language Models","date":"2024-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"networks-learning/counterfactual-llms","path":"src/mistral-inference/moe_one_file_ref.py","file_url":"https://github.com/networks-learning/counterfactual-llms/blob/HEAD/src/mistral-inference/moe_one_file_ref.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3fdd4f66367ca608","mcp_get_code":{"code_sha256":"3fdd4f66367ca608"}},{"arxiv_id":"2409.17027","paper":"/paper/counterfactual-token-generation-in-large","title":"Counterfactual Token Generation in Large Language Models","date":"2024-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"networks-learning/counterfactual-llms","path":"src/mistral-inference/one_file_ref.py","file_url":"https://github.com/networks-learning/counterfactual-llms/blob/HEAD/src/mistral-inference/one_file_ref.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e8e39c9933cb102c","mcp_get_code":{"code_sha256":"e8e39c9933cb102c"}},{"arxiv_id":"2409.16040","paper":"/paper/time-moe-billion-scale-time-series-foundation","title":"Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts","date":"2024-09-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Time-MoE/Time-MoE","path":"time_moe/models/modeling_time_moe.py","file_url":"https://github.com/Time-MoE/Time-MoE/blob/HEAD/time_moe/models/modeling_time_moe.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2409.14144","paper":"/paper/2409-14144","title":"Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis","date":"2024-09-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zepingyu0512/arithmetic-mechanism","path":"modeling_llama.py","file_url":"https://github.com/zepingyu0512/arithmetic-mechanism/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.16967","paper":"/paper/memlong-memory-augmented-retrieval-for-long","title":"MemLong: Memory-Augmented Retrieval for Long Text Modeling","date":"2024-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bui1dmysea/memlong","path":"eval/icl/MemLong/modeling_llama.py","file_url":"https://github.com/bui1dmysea/memlong/blob/HEAD/eval/icl/MemLong/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.15237","paper":"/paper/the-mamba-in-the-llama-distilling-and","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","date":"2024-08-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jxiw/mambainllama","path":"mamba/hybrid_mamba_layer.py","file_url":"https://github.com/jxiw/mambainllama/blob/HEAD/mamba/hybrid_mamba_layer.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2408.11779","paper":"/paper/personality-alignment-of-large-language","title":"Personality Alignment of Large Language Models","date":"2024-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhu-minjun/PAlign","path":"PAlign/modeling_llama.py","file_url":"https://github.com/zhu-minjun/PAlign/blob/HEAD/PAlign/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.11051","paper":"/paper/flame-learning-to-navigate-with-multimodal","title":"FLAME: Learning to Navigate with Multimodal LLM in Urban Environments","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xyz9911/FLAME","path":"llm_nav/model/llama_xformer.py","file_url":"https://github.com/xyz9911/FLAME/blob/HEAD/llm_nav/model/llama_xformer.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.11049","paper":"/paper/magicdec-breaking-the-latency-throughput","title":"MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"infini-ai-lab/magicdec","path":"Engine/utils.py","file_url":"https://github.com/infini-ai-lab/magicdec/blob/HEAD/Engine/utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2408.10943","paper":"/paper/sysbench-can-large-language-models-follow","title":"SysBench: Can Large Language Models Follow System Messages?","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pku-baichuan-mlsystemlab/sysbench","path":"attenscore/modeling_llama.py","file_url":"https://github.com/pku-baichuan-mlsystemlab/sysbench/blob/HEAD/attenscore/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.02657","paper":"/paper/2408-02657","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","date":"2024-08-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alpha-vllm/lumina-mgpt","path":"lumina_mgpt/model/chameleon/modeling_chameleon.py","file_url":"https://github.com/alpha-vllm/lumina-mgpt/blob/HEAD/lumina_mgpt/model/chameleon/modeling_chameleon.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.02032","paper":"/paper/2408-02032","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","date":"2024-08-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.00264","paper":"/paper/clover-2-accurate-inference-for-regressive","title":"Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiaoBin1992/clover","path":"clover/modeling_eagle.py","file_url":"https://github.com/XiaoBin1992/clover/blob/HEAD/clover/modeling_eagle.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2408.00264","paper":"/paper/clover-2-accurate-inference-for-regressive","title":"Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiaoBin1992/clover","path":"clover/model/clover2.py","file_url":"https://github.com/XiaoBin1992/clover/blob/HEAD/clover/model/clover2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2408.00264","paper":"/paper/clover-2-accurate-inference-for-regressive","title":"Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiaoBin1992/clover","path":"clover/model/modeling_llama_kv.py","file_url":"https://github.com/XiaoBin1992/clover/blob/HEAD/clover/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2407.16286","paper":"/paper/a-deeper-look-at-depth-pruning-of-llms","title":"A deeper look at depth pruning of LLMs","date":"2024-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shoaibahmed/llm_depth_pruning","path":"block_influence/llama_model.py","file_url":"https://github.com/shoaibahmed/llm_depth_pruning/blob/HEAD/block_influence/llama_model.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2407.12665","paper":"/paper/patch-level-training-for-large-language","title":"Beyond Next Token Prediction: Patch-Level Training for Large Language Models","date":"2024-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shaochenze/PatchTrain","path":"modeling_llama.py","file_url":"https://github.com/shaochenze/PatchTrain/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2407.09450","paper":"/paper/human-like-episodic-memory-for-infinite","title":"Human-like Episodic Memory for Infinite Context LLMs","date":"2024-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"em-llm/EM-LLM-model","path":"em_llm/attention/utils.py","file_url":"https://github.com/em-llm/EM-LLM-model/blob/HEAD/em_llm/attention/utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2407.08683","paper":"/paper/seed-story-multimodal-long-story-generation","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tencentarc/seed-story","path":"src/models_clm/modeling_llama_4_35.py","file_url":"https://github.com/tencentarc/seed-story/blob/HEAD/src/models_clm/modeling_llama_4_35.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2407.06581","paper":"/paper/vision-language-models-are-blind","title":"Vision language models are blind: Failing to translate detailed visual features into words","date":"2024-07-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anguyen8/vision-llms-are-blind","path":"src/LinearProbe/Phi3.5/modeling_phi3_v.py","file_url":"https://github.com/anguyen8/vision-llms-are-blind/blob/HEAD/src/LinearProbe/Phi3.5/modeling_phi3_v.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2407.06426","paper":"/paper/debunc-mitigating-hallucinations-in-large","title":"DebUnc: Improving Large Language Model Agent Communication With Uncertainty Metrics","date":"2024-07-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lukeyoffe/debunc","path":"src/models/modeling_llama.py","file_url":"https://github.com/lukeyoffe/debunc/blob/HEAD/src/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.19707","paper":"/paper/infinigen-efficient-generative-inference-of","title":"InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"snu-comparch/infinigen","path":"accuracy/src/modeling_llama_orig.py","file_url":"https://github.com/snu-comparch/infinigen/blob/HEAD/accuracy/src/modeling_llama_orig.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.18200","paper":"/paper/seed-accelerating-reasoning-tree-construction","title":"SEED: Accelerating Reasoning Tree Construction via Scheduled Speculative Decoding","date":"2024-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Linking-ai/SEED","path":"src/llama_tree_attn/modeling_llama.py","file_url":"https://github.com/Linking-ai/SEED/blob/HEAD/src/llama_tree_attn/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.17276","paper":"/paper/opt-tree-speculative-decoding-with-adaptive","title":"OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jikai0wang/opt-tree","path":"opt_eagle/cnets.py","file_url":"https://github.com/jikai0wang/opt-tree/blob/HEAD/opt_eagle/cnets.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.17276","paper":"/paper/opt-tree-speculative-decoding-with-adaptive","title":"OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jikai0wang/opt-tree","path":"opt_classic/modeling_llama_kv.py","file_url":"https://github.com/jikai0wang/opt-tree/blob/HEAD/opt_classic/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2406.15765","paper":"/paper/unveiling-and-harnessing-hidden-attention","title":"Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration","date":"2024-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gatech-eic/act","path":"models/modelling_llama.py","file_url":"https://github.com/gatech-eic/act/blob/HEAD/models/modelling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.14898","paper":"/paper/safely-learning-with-private-data-a-federated","title":"Safely Learning with Private Data: A Federated Learning Framework for Large Language Model","date":"2024-06-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TAP-LLM/SplitFedLLM","path":"Fed-Llama-module/client/modeling_llama_A.py","file_url":"https://github.com/TAP-LLM/SplitFedLLM/blob/HEAD/Fed-Llama-module/client/modeling_llama_A.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2406.14556","paper":"/paper/asynchronous-large-language-model-enhanced","title":"Asynchronous Large Language Model Enhanced Planner for Autonomous Driving","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"memberRE/AsyncDriver","path":"llama2/model.py","file_url":"https://github.com/memberRE/AsyncDriver/blob/HEAD/llama2/model.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.14496","paper":"/paper/african-or-european-swallow-benchmarking","title":"African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gregor-ge/FOCI-Benchmark","path":"benchmark/model/model_internlm_xcomposer2.py","file_url":"https://github.com/gregor-ge/FOCI-Benchmark/blob/HEAD/benchmark/model/model_internlm_xcomposer2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c0aae1f053da2578","mcp_get_code":{"code_sha256":"c0aae1f053da2578"}},{"arxiv_id":"2406.14144","paper":"/paper/finding-safety-neurons-in-large-language","title":"Finding Safety Neurons in Large Language Models","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"THU-KEG/SafetyNeuron","path":"src/models/HookedGemma.py","file_url":"https://github.com/THU-KEG/SafetyNeuron/blob/HEAD/src/models/HookedGemma.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.12246","paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byungkwanlee/trol","path":"trol/arch_phi3/modeling_phi3.py","file_url":"https://github.com/byungkwanlee/trol/blob/HEAD/trol/arch_phi3/modeling_phi3.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.12246","paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByungKwanLee/TroL","path":"trol/arch_internlm2/modeling_trol.py","file_url":"https://github.com/ByungKwanLee/TroL/blob/HEAD/trol/arch_internlm2/modeling_trol.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6045450d1a869974","mcp_get_code":{"code_sha256":"6045450d1a869974"}},{"arxiv_id":"2406.12246","paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byungkwanlee/trol","path":"trol/arch_internlm2/modeling_internlm2.py","file_url":"https://github.com/byungkwanlee/trol/blob/HEAD/trol/arch_internlm2/modeling_internlm2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c0aae1f053da2578","mcp_get_code":{"code_sha256":"c0aae1f053da2578"}},{"arxiv_id":"2406.11256","paper":"/paper/dynamic-data-mixing-maximizes-instruction","title":"Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"spico197/moe-sft","path":"src/models/llama_moe/modeling_llama_moe.py","file_url":"https://github.com/spico197/moe-sft/blob/HEAD/src/models/llama_moe/modeling_llama_moe.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.06385","paper":"/paper/low-rank-quantization-aware-training-for-llms","title":"Low-Rank Quantization-Aware Training for LLMs","date":"2024-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qualcomm-ai-research/lr-qat","path":"models/quantized_llama.py","file_url":"https://github.com/qualcomm-ai-research/lr-qat/blob/HEAD/models/quantized_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause-Clear","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2406.05644","paper":"/paper/how-alignment-and-jailbreak-work-explain-llm","title":"How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States","date":"2024-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ydyjya/llm-ihs-explanation","path":"resource/modeling_llama.py","file_url":"https://github.com/ydyjya/llm-ihs-explanation/blob/HEAD/resource/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.05317","paper":"/paper/lococo-dropping-in-convolutions-for-long","title":"LoCoCo: Dropping In Convolutions for Long Context Compression","date":"2024-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VITA-Group/LoCoCo","path":"llama/modeling_llama.py","file_url":"https://github.com/VITA-Group/LoCoCo/blob/HEAD/llama/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.04329","paper":"/paper/simplified-and-generalized-masked-diffusion","title":"Simplified and Generalized Masked Diffusion for Discrete Data","date":"2024-06-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"google-deepmind/md4","path":"md4/models/diffusion/md4.py","file_url":"https://github.com/google-deepmind/md4/blob/HEAD/md4/models/diffusion/md4.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4a1c75a9a5f46c4f","mcp_get_code":{"code_sha256":"4a1c75a9a5f46c4f"}},{"arxiv_id":"2406.02536","paper":"/paper/mitigate-position-bias-in-large-language","title":"Mitigate Position Bias in Large Language Models via Scaling a Single Dimension","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PositionalHidden/PositionalHidden","path":"positional_hidden/models/modeling_gemma_hidden_scale.py","file_url":"https://github.com/PositionalHidden/PositionalHidden/blob/HEAD/positional_hidden/models/modeling_gemma_hidden_scale.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.02069","paper":"/paper/pyramidkv-dynamic-kv-cache-compression-based","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zefan-cai/pyramidkv","path":"pyramidkv/pyramidkv_utils.py","file_url":"https://github.com/zefan-cai/pyramidkv/blob/HEAD/pyramidkv/pyramidkv_utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2406.01917","paper":"/paper/gomaa-geo-goal-modality-agnostic-active-geo","title":"GOMAA-Geo: GOal Modality Agnostic Active Geo-localization","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mvrl/gomaa-geo","path":"models/model_gemma.py","file_url":"https://github.com/mvrl/gomaa-geo/blob/HEAD/models/model_gemma.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2406.01574","paper":"/paper/mmlu-pro-a-more-robust-and-challenging-multi","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","date":"2024-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wenlai-lavine/jola","path":"jola/modeling_llama.py","file_url":"https://github.com/wenlai-lavine/jola/blob/HEAD/jola/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.20763","paper":"/paper/improving-generalization-and-convergence-by","title":"Improving Generalization and Convergence by Enhancing Implicit Regularization","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wmz9/IRE-algorithm-framework","path":"NLP/LLM/modelling_llama_new.py","file_url":"https://github.com/wmz9/IRE-algorithm-framework/blob/HEAD/NLP/LLM/modelling_llama_new.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.16406","paper":"/paper/spinquant-llm-quantization-with-learned","title":"SpinQuant: LLM quantization with learned rotations","date":"2024-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/SpinQuant","path":"eval_utils/modeling_llama.py","file_url":"https://github.com/facebookresearch/SpinQuant/blob/HEAD/eval_utils/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.15574","paper":"/paper/meteor-mamba-based-traversal-of-rationale-for","title":"Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byungkwanlee/meteor","path":"meteor/arch/modeling_internlm2.py","file_url":"https://github.com/byungkwanlee/meteor/blob/HEAD/meteor/arch/modeling_internlm2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c0aae1f053da2578","mcp_get_code":{"code_sha256":"c0aae1f053da2578"}},{"arxiv_id":"2405.14488","paper":"/paper/mogu-a-framework-for-enhancing-safety-of-open","title":"MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.14256","paper":"/paper/zipcache-accurate-and-efficient-kv-cache","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thisisbillhe/zipcache","path":"zipcache/models/modeling_llama.py","file_url":"https://github.com/thisisbillhe/zipcache/blob/HEAD/zipcache/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.13845","paper":"/paper/semantic-density-uncertainty-quantification","title":"Semantic Density: Uncertainty Quantification for Large Language Models through Confidence Measurement in Semantic Space","date":"2024-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cognizant-ai-labs/semantic-density-paper","path":"huggingface_replacement/modeling_llama2.py","file_url":"https://github.com/cognizant-ai-labs/semantic-density-paper/blob/HEAD/huggingface_replacement/modeling_llama2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.12532","paper":"/paper/pyramidinfer-pyramid-kv-cache-compression-for","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","date":"2024-05-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.10370","paper":"/paper/grounded-3d-llm-with-referent-tokens","title":"Grounded 3D-LLM with Referent Tokens","date":"2024-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenRobotLab/Grounded_3D-LLM","path":"models/LLM/modeling_llama.py","file_url":"https://github.com/OpenRobotLab/Grounded_3D-LLM/blob/HEAD/models/LLM/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2405.05803","paper":"/paper/boosting-multimodal-large-language-models","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lzhxmu/vtw","path":"LISA-VTW/my_modeling_llama.py","file_url":"https://github.com/lzhxmu/vtw/blob/HEAD/LISA-VTW/my_modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.18911","paper":"/paper/kangaroo-lossless-self-speculative-decoding","title":"Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting","date":"2024-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Equationliu/Kangaroo","path":"kangaroo/adapter.py","file_url":"https://github.com/Equationliu/Kangaroo/blob/HEAD/kangaroo/adapter.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.15574","paper":"/paper/retrieval-head-mechanistically-explains-long","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","date":"2024-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nightdessert/retrieval_head","path":"faiss_attn/source/modeling_llama.py","file_url":"https://github.com/nightdessert/retrieval_head/blob/HEAD/faiss_attn/source/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.14469","paper":"/paper/snapkv-llm-knows-what-you-are-looking-for","title":"SnapKV: LLM Knows What You are Looking for Before Generation","date":"2024-04-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fasterdecoding/snapkv","path":"snapkv/monkeypatch/snapkv_utils.py","file_url":"https://github.com/fasterdecoding/snapkv/blob/HEAD/snapkv/monkeypatch/snapkv_utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2404.12362","paper":"/paper/transformer-tricks-removing-weights-for","title":"Transformer tricks: Removing weights for skipless transformers","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openmachine-ai/transformer-tricks","path":"flashNorm_modeling_llama.py","file_url":"https://github.com/openmachine-ai/transformer-tricks/blob/HEAD/flashNorm_modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.12096","paper":"/paper/longembed-extending-embedding-models-for-long","title":"LongEmbed: Extending Embedding Models for Long Context Retrieval","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dwzhu-pku/longembed","path":"src/modeling_e5rope.py","file_url":"https://github.com/dwzhu-pku/longembed/blob/HEAD/src/modeling_e5rope.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.11912","paper":"/paper/triforce-lossless-acceleration-of-long","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Infini-AI-Lab/TriForce","path":"models/tensor_op.py","file_url":"https://github.com/Infini-AI-Lab/TriForce/blob/HEAD/models/tensor_op.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2404.10710","paper":"/paper/dual-modalities-of-text-visual-and-textual","title":"Autoregressive Pre-Training on Pixels and Texts","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.10464","paper":"/paper/destein-navigating-detoxification-of-language","title":"DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lizlizli/destein","path":"modeling/modeling_llama.py","file_url":"https://github.com/lizlizli/destein/blob/HEAD/modeling/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.10308","paper":"/paper/hierarchical-context-merging-better-long","title":"Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMs","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alinlab/HOMER","path":"src/homer/modeling_llama.py","file_url":"https://github.com/alinlab/HOMER/blob/HEAD/src/homer/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.07470","paper":"/paper/scalable-language-model-with-generalized","title":"Scalable Language Model with Generalized Continual Learning","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pbihao/slm","path":"SLM-llama/models/llama.py","file_url":"https://github.com/pbihao/slm/blob/HEAD/SLM-llama/models/llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.07143","paper":"/paper/leave-no-context-behind-efficient-infinite","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","date":"2024-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Beomi/InfiniTransformer","path":"modeling_gemma.py","file_url":"https://github.com/Beomi/InfiniTransformer/blob/HEAD/modeling_gemma.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2404.07143","paper":"/paper/leave-no-context-behind-efficient-infinite","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","date":"2024-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2404.04793","paper":"/paper/squeezeattention-2d-management-of-kv-cache-in","title":"SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget","date":"2024-04-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hetailang/squeezeattention","path":"modeling_llama.py","file_url":"https://github.com/hetailang/squeezeattention/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2403.17830","paper":"/paper/assessment-of-multimodal-large-language","title":"Assessment of Multimodal Large Language Models in Alignment with Human Values","date":"2024-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openlamm/lamm","path":"src/model/LAMM/modeling_llama.py","file_url":"https://github.com/openlamm/lamm/blob/HEAD/src/model/LAMM/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2403.09629","paper":"/paper/quiet-star-language-models-can-teach","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ezelikman/quiet-star","path":"modeling_mistral.py","file_url":"https://github.com/ezelikman/quiet-star/blob/HEAD/modeling_mistral.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2403.07508","paper":"/paper/moai-mixture-of-all-intelligence-for-large","title":"MoAI: Mixture of All Intelligence for Large Language and Vision Models","date":"2024-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByungKwanLee/MoAI","path":"moai/arch/modeling_internlm2.py","file_url":"https://github.com/ByungKwanLee/MoAI/blob/HEAD/moai/arch/modeling_internlm2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c0aae1f053da2578","mcp_get_code":{"code_sha256":"c0aae1f053da2578"}},{"arxiv_id":"2403.05527","paper":"/paper/gear-an-efficient-kv-cache-compression","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","date":"2024-03-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengear-project/gear","path":"GenerationBench/GenerationTest/GEARLM/Simulated/modeling_llama_ablation.py","file_url":"https://github.com/opengear-project/gear/blob/HEAD/GenerationBench/GenerationTest/GEARLM/Simulated/modeling_llama_ablation.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2403.04945","paper":"/paper/electrocardiogram-instruction-tuning-for","title":"MEIT: Multi-Modal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aiot-mlsys-lab/meit","path":"ECG_LLMs/modeling_ecg_llama.py","file_url":"https://github.com/aiot-mlsys-lab/meit/blob/HEAD/ECG_LLMs/modeling_ecg_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2402.18815","paper":"/paper/how-do-large-language-models-handle","title":"How do Large Language Models Handle Multilingualism?","date":"2024-02-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/multilingual_analysis","path":"layers/transformers/models/modeling_llama.py","file_url":"https://github.com/damo-nlp-sg/multilingual_analysis/blob/HEAD/layers/transformers/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.16617","paper":"/paper/long-context-language-modeling-with-parallel","title":"Long-Context Language Modeling with Parallel Context Encoding","date":"2024-02-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-nlp/cepe","path":"modeling_llama_flash.py","file_url":"https://github.com/princeton-nlp/cepe/blob/HEAD/modeling_llama_flash.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.16061","paper":"/paper/how-large-language-models-encode-context","title":"How Large Language Models Encode Context Knowledge? A Layer-Wise Probing Study","date":"2024-02-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jometeorie/probing_llama","path":"code/llama/modeling_llama.py","file_url":"https://github.com/jometeorie/probing_llama/blob/HEAD/code/llama/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.15637","paper":"/paper/addressing-order-sensitivity-of-in-context","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","date":"2024-02-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xyzcs/infoac","path":"LLama.py","file_url":"https://github.com/xyzcs/infoac/blob/HEAD/LLama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.14905","paper":"/paper/mobilellm-optimizing-sub-billion-parameter","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","date":"2024-02-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jingyaogong/minimind","path":"model/model_minimind.py","file_url":"https://github.com/jingyaogong/minimind/blob/HEAD/model/model_minimind.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"226c2c7378c2826e","mcp_get_code":{"code_sha256":"226c2c7378c2826e"}},{"arxiv_id":"2402.14083","paper":"/paper/beyond-a-better-planning-with-transformers","title":"Beyond A*: Better Planning with Transformers via Search Dynamics Bootstrapping","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/searchformer","path":"searchformer/transformer/model.py","file_url":"https://github.com/facebookresearch/searchformer/blob/HEAD/searchformer/transformer/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"f12b7a7b213cf517","mcp_get_code":{"code_sha256":"f12b7a7b213cf517"}},{"arxiv_id":"2402.13991","paper":"/paper/analysing-the-impact-of-sequence-composition","title":"Analysing The Impact of Sequence Composition on Language Model Pre-Training","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuzhaouoe/pretraining-data-packing","path":"llama_modeling.py","file_url":"https://github.com/yuzhaouoe/pretraining-data-packing/blob/HEAD/llama_modeling.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.13720","paper":"/paper/ouroboros-speculative-decoding-with-large","title":"Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thunlp/ouroboros","path":"ouroboros/models/modeling_llama.py","file_url":"https://github.com/thunlp/ouroboros/blob/HEAD/ouroboros/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.12374","paper":"/paper/sequoia-scalable-robust-and-hardware-aware","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"infini-ai-lab/sequoia","path":"Engine/offload_engine.py","file_url":"https://github.com/infini-ai-lab/sequoia/blob/HEAD/Engine/offload_engine.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2402.11809","paper":"/paper/generation-meets-verification-accelerating","title":"Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct Decoding","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cteant/space","path":"src/models/modeling_llama.py","file_url":"https://github.com/cteant/space/blob/HEAD/src/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.11592","paper":"/paper/revisiting-zeroth-order-optimization-for","title":"Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark","date":"2024-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zo-bench/zo-llm","path":"zo-bench/modeling_llama.py","file_url":"https://github.com/zo-bench/zo-llm/blob/HEAD/zo-bench/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.11248","paper":"/paper/collavo-crayon-large-language-and-vision","title":"CoLLaVO: Crayon Large Language and Vision mOdel","date":"2024-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByungKwanLee/CoLLaVO","path":"collavo/arch/modeling_internlm2.py","file_url":"https://github.com/ByungKwanLee/CoLLaVO/blob/HEAD/collavo/arch/modeling_internlm2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c0aae1f053da2578","mcp_get_code":{"code_sha256":"c0aae1f053da2578"}},{"arxiv_id":"2402.10787","paper":"/paper/edgeqat-entropy-and-distribution-guided","title":"EdgeQAT: Entropy and Distribution Guided Quantization-Aware Training for the Acceleration of Lightweight LLMs on the Edge","date":"2024-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shawnricecake/edgeqat","path":"distill_train/models/modeling_llama_fp16.py","file_url":"https://github.com/shawnricecake/edgeqat/blob/HEAD/distill_train/models/modeling_llama_fp16.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.09773","paper":"/paper/nuteprune-efficient-progressive-pruning-with","title":"NutePrune: Efficient Progressive Pruning with Numerous Teachers for Large Language Models","date":"2024-02-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucius-lsr/nuteprune","path":"models/modeling_llama.py","file_url":"https://github.com/lucius-lsr/nuteprune/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.09739","paper":"/paper/qurating-selecting-high-quality-data-for","title":"QuRating: Selecting High-Quality Data for Training Language Models","date":"2024-02-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-nlp/qurating","path":"modeling/modeling_flash_llama.py","file_url":"https://github.com/princeton-nlp/qurating/blob/HEAD/modeling/modeling_flash_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"69874376c94f0785","mcp_get_code":{"code_sha256":"69874376c94f0785"}},{"arxiv_id":"2402.06262","paper":"/paper/on-the-efficacy-of-eviction-policy-for-key","title":"On the Efficacy of Eviction Policy for Key-Value Constrained Generative Language Model Inference","date":"2024-02-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"drsy/easykv","path":"easykv/llama_patch.py","file_url":"https://github.com/drsy/easykv/blob/HEAD/easykv/llama_patch.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.05109","paper":"/paper/hydra-sequentially-dependent-draft-heads-for","title":"Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding","date":"2024-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zankner/hydra","path":"hydra/model/modeling_llama_kv.py","file_url":"https://github.com/zankner/hydra/blob/HEAD/hydra/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2402.04396","paper":"/paper/quip-even-better-llm-quantization-with","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","date":"2024-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Cornell-RelaxML/quip-sharp","path":"model/llama.py","file_url":"https://github.com/Cornell-RelaxML/quip-sharp/blob/HEAD/model/llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.03300","paper":"/paper/deepseekmath-pushing-the-limits-of","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","date":"2024-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yynil/rwkvinside","path":"rwkv_inside/modeling_arwkv.py","file_url":"https://github.com/yynil/rwkvinside/blob/HEAD/rwkv_inside/modeling_arwkv.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.02872","paper":"/paper/how-do-large-language-models-learn-in-context","title":"How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning","date":"2024-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zepingyu0512/in-context-mechanism","path":"modeling_llama.py","file_url":"https://github.com/zepingyu0512/in-context-mechanism/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2402.01912","paper":"/paper/natural-language-guidance-of-high-fidelity","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","date":"2024-02-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2402.01469","paper":"/paper/amor-a-recipe-for-building-adaptable-modular","title":"AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback","date":"2024-02-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JianGuanTHU/AMOR","path":"code/modeling_llama.py","file_url":"https://github.com/JianGuanTHU/AMOR/blob/HEAD/code/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2401.12522","paper":"/paper/bita-bi-directional-tuning-for-lossless","title":"BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models","date":"2024-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"linfeng93/bita","path":"src/modeling_llama_if.py","file_url":"https://github.com/linfeng93/bita/blob/HEAD/src/modeling_llama_if.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2401.10774","paper":"/paper/medusa-simple-llm-inference-acceleration","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fasterdecoding/medusa","path":"medusa/model/modeling_llama_kv.py","file_url":"https://github.com/fasterdecoding/medusa/blob/HEAD/medusa/model/modeling_llama_kv.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2401.10774","paper":"/paper/medusa-simple-llm-inference-acceleration","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fasterdecoding/medusa","path":"medusa/model/modeling_llama_kv_legacy.py","file_url":"https://github.com/fasterdecoding/medusa/blob/HEAD/medusa/model/modeling_llama_kv_legacy.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2401.08508","paper":"/paper/emollms-a-series-of-emotional-large-language","title":"EmoLLMs: A Series of Emotional Large Language Models and Annotation Tools for Comprehensive Affective Analysis","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lzw108/emollms","path":"src/models/llama/modeling_llama.py","file_url":"https://github.com/lzw108/emollms/blob/HEAD/src/models/llama/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2401.08417","paper":"/paper/contrastive-preference-optimization-pushing","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fe1ixxu/alma","path":"modeling_xalma.py","file_url":"https://github.com/fe1ixxu/alma/blob/HEAD/modeling_xalma.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2401.06706","paper":"/paper/multi-candidate-speculative-decoding","title":"Multi-Candidate Speculative Decoding","date":"2024-01-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"njunlp/mcsd","path":"MCSD/model/llama_tree_attn/modeling_llama.py","file_url":"https://github.com/njunlp/mcsd/blob/HEAD/MCSD/model/llama_tree_attn/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2401.06469","paper":"/paper/batch-icl-effective-efficient-and-order","title":"Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context Learning","date":"2024-01-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cardinalere/batch-icl","path":"transformers/models/llama/modeling_llama.py","file_url":"https://github.com/cardinalere/batch-icl/blob/HEAD/transformers/models/llama/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2401.01325","paper":"/paper/llm-maybe-longlm-self-extend-llm-context","title":"LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning","date":"2024-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sdan/selfextend","path":"modeling_mistral.py","file_url":"https://github.com/sdan/selfextend/blob/HEAD/modeling_mistral.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2312.15166","paper":"/paper/solar-10-7b-scaling-large-language-models","title":"SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling","date":"2023-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jquesnelle/scaled-rope","path":"scaled_rope/modeling_llama_yarn.py","file_url":"https://github.com/jquesnelle/scaled-rope/blob/HEAD/scaled_rope/modeling_llama_yarn.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2312.15166","paper":"/paper/solar-10-7b-scaling-large-language-models","title":"SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling","date":"2023-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jquesnelle/scaled-rope","path":"scaled_rope/modeling_llama_together_yarn.py","file_url":"https://github.com/jquesnelle/scaled-rope/blob/HEAD/scaled_rope/modeling_llama_together_yarn.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"53b2e52873fb8342","mcp_get_code":{"code_sha256":"53b2e52873fb8342"}},{"arxiv_id":"2312.12141","paper":"/paper/exploring-the-residual-stream-of-transformers","title":"Neuron-Level Knowledge Attribution in Large Language Models","date":"2023-12-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2312.08168","paper":"/paper/chat-3d-v2-bridging-3d-scene-and-large","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","date":"2023-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chat-3d/chat-3d-v2","path":"models/modeling_llama.py","file_url":"https://github.com/chat-3d/chat-3d-v2/blob/HEAD/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2312.03414","paper":"/paper/compressed-context-memory-for-online-language","title":"Compressed Context Memory For Online Language Model Interaction","date":"2023-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"snu-mllab/context-memory","path":"src/arch/ccm_mistral.py","file_url":"https://github.com/snu-mllab/context-memory/blob/HEAD/src/arch/ccm_mistral.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2312.01648","paper":"/paper/characterizing-large-language-model-geometry","title":"Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation","date":"2023-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"randallbalestriero/splinellm","path":"modeling_llama.py","file_url":"https://github.com/randallbalestriero/splinellm/blob/HEAD/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2311.17911","paper":"/paper/opera-alleviating-hallucination-in-multi","title":"OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation","date":"2023-11-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2311.13230","paper":"/paper/enhancing-uncertainty-based-hallucination","title":"Enhancing Uncertainty-Based Hallucination Detection with Stronger Focus","date":"2023-11-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zthang/focus","path":"models/modeling_llama2.py","file_url":"https://github.com/zthang/focus/blob/HEAD/models/modeling_llama2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2311.08252","paper":"/paper/rest-retrieval-based-speculative-decoding","title":"REST: Retrieval-Based Speculative Decoding","date":"2023-11-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fasterdecoding/rest","path":"rest/model/modeling_llama_kv.py","file_url":"https://github.com/fasterdecoding/rest/blob/HEAD/rest/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2311.01908","paper":"/paper/llm-driven-multimodal-target-volume","title":"LLM-driven Multimodal Target Volume Contouring in Radiation Oncology","date":"2023-11-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tvseg/mm-llm-ro","path":"model/llama2/llama_custom.py","file_url":"https://github.com/tvseg/mm-llm-ro/blob/HEAD/model/llama2/llama_custom.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2310.16450","paper":"/paper/clex-continuous-length-extrapolation-for","title":"CLEX: Continuous Length Extrapolation for Large Language Models","date":"2023-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DAMO-NLP-SG/CLEX","path":"CLEX/llama/modeling_llama_clex.py","file_url":"https://github.com/DAMO-NLP-SG/CLEX/blob/HEAD/CLEX/llama/modeling_llama_clex.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2310.11453","paper":"/paper/bitnet-scaling-1-bit-transformers-for-large","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2310.06825","paper":"/paper/mistral-7b","title":"Mistral 7B","date":"2023-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mistralai/mistral-src","path":"src/mistral_inference/transformer_layers.py","file_url":"https://github.com/mistralai/mistral-src/blob/HEAD/src/mistral_inference/transformer_layers.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a034294fb9d68dfa","mcp_get_code":{"code_sha256":"a034294fb9d68dfa"}},{"arxiv_id":"2310.05910","paper":"/paper/salmon-self-alignment-with-principle","title":"SALMON: Self-Alignment with Instructable Reward Models","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ibm/salmon","path":"training/models/llama_with_flash_attn.py","file_url":"https://github.com/ibm/salmon/blob/HEAD/training/models/llama_with_flash_attn.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2310.03668","paper":"/paper/gollie-annotation-guidelines-improve-zero","title":"GoLLIE: Annotation Guidelines improve Zero-Shot Information-Extraction","date":"2023-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hitz-zentroa/gollie","path":"src/model/patch_models/modeling_flash_llama.py","file_url":"https://github.com/hitz-zentroa/gollie/blob/HEAD/src/model/patch_models/modeling_flash_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"44b3ce4579f7806b","mcp_get_code":{"code_sha256":"44b3ce4579f7806b"}},{"arxiv_id":"2309.15098","paper":"/paper/attention-satisfies-a-constraint-satisfaction","title":"Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models","date":"2023-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/mechanistic-error-probe","path":"model_lib/attention_tools.py","file_url":"https://github.com/microsoft/mechanistic-error-probe/blob/HEAD/model_lib/attention_tools.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"3281dccd4fa39596","mcp_get_code":{"code_sha256":"3281dccd4fa39596"}},{"arxiv_id":"2309.14717","paper":"/paper/qa-lora-quantization-aware-low-rank","title":"QA-LoRA: Quantization-Aware Low-Rank Adaptation of Large Language Models","date":"2023-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"intel/ipex-llm","path":"python/llm/src/ipex_llm/transformers/kv.py","file_url":"https://github.com/intel/ipex-llm/blob/HEAD/python/llm/src/ipex_llm/transformers/kv.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d9150efc59718cbf","mcp_get_code":{"code_sha256":"d9150efc59718cbf"}},{"arxiv_id":"2309.11674","paper":"/paper/a-paradigm-shift-in-machine-translation","title":"A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models","date":"2023-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fe1ixxu/ALMA","path":"modeling_xalma.py","file_url":"https://github.com/fe1ixxu/ALMA/blob/HEAD/modeling_xalma.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2309.11499","paper":"/paper/dreamllm-synergistic-multimodal-comprehension","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","date":"2023-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2308.10882","paper":"/paper/giraffe-adventures-in-expanding-context","title":"Giraffe: Adventures in Expanding Context Lengths in LLMs","date":"2023-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"abacusai/long-context","path":"python/models/modeling_giraffe.py","file_url":"https://github.com/abacusai/long-context/blob/HEAD/python/models/modeling_giraffe.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2308.04152","paper":"/paper/empowering-vision-language-models-to-follow","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","date":"2023-08-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DCDmllm/Cheetah","path":"Cheetah/cheetah/models/modeling_llama2.py","file_url":"https://github.com/DCDmllm/Cheetah/blob/HEAD/Cheetah/cheetah/models/modeling_llama2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2307.09288","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IBM/Dromedary","path":"training/llama_with_flash_attn.py","file_url":"https://github.com/IBM/Dromedary/blob/HEAD/training/llama_with_flash_attn.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2307.08072","paper":"/paper/do-emergent-abilities-exist-in-quantized","title":"Do Emergent Abilities Exist in Quantized Large Language Models: An Empirical Study","date":"2023-07-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucaibox/quantizedempirical","path":"models/modeling_llama2.py","file_url":"https://github.com/rucaibox/quantizedempirical/blob/HEAD/models/modeling_llama2.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2307.06945","paper":"/paper/in-context-autoencoder-for-context","title":"In-context Autoencoder for Context Compression in a Large Language Model","date":"2023-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"getao/icae","path":"code/icae_v1/base/modeling_llama_icae.py","file_url":"https://github.com/getao/icae/blob/HEAD/code/icae_v1/base/modeling_llama_icae.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"CC0-1.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2305.17888","paper":"/paper/llm-qat-data-free-quantization-aware-training","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","date":"2023-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2302.13971","paper":"/paper/llama-open-and-efficient-foundation-language-1","title":"LLaMA: Open and Efficient Foundation Language Models","date":"2023-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"akanyaani/miniLLAMA","path":"model.py","file_url":"https://github.com/akanyaani/miniLLAMA/blob/HEAD/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"31333a36df31a820","mcp_get_code":{"code_sha256":"31333a36df31a820"}},{"arxiv_id":"2203.15556","paper":"/paper/training-compute-optimal-large-language","title":"Training Compute-Optimal Large Language Models","date":"2022-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"6d2a08dcf3466514","mcp_get_code":{"code_sha256":"6d2a08dcf3466514"}},{"arxiv_id":"2002.12804","paper":"/paper/unilmv2-pseudo-masked-language-models-for","title":"UniLMv2: Pseudo-Masked Language Models for Unified Language Model Pre-Training","date":"2020-02-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/unilm","path":"Diff-Transformer/multihead_attention.py","file_url":"https://github.com/microsoft/unilm/blob/HEAD/Diff-Transformer/multihead_attention.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8b9e23cfcb2e7648","mcp_get_code":{"code_sha256":"8b9e23cfcb2e7648"}},{"arxiv_id":"1901.02860","paper":"/paper/transformer-xl-attentive-language-models","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","date":"2019-01-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mustafaaljadery/gemma-2b-10m","path":"src/gemma.py","file_url":"https://github.com/mustafaaljadery/gemma-2b-10m/blob/HEAD/src/gemma.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4e762613ee907cdb","mcp_get_code":{"code_sha256":"4e762613ee907cdb"}},{"arxiv_id":"openreview_trSWJ99WzS","paper":null,"title":"arXiv:openreview_trSWJ99WzS","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DerrickYLJ/LessIsMore","path":"src/models/llama_tidaldecoding.py","file_url":"https://github.com/DerrickYLJ/LessIsMore/blob/HEAD/src/models/llama_tidaldecoding.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"openreview_trSWJ99WzS","paper":null,"title":"arXiv:openreview_trSWJ99WzS","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DerrickYLJ/LessIsMore","path":"src/models/qwen3_tidaldecoding.py","file_url":"https://github.com/DerrickYLJ/LessIsMore/blob/HEAD/src/models/qwen3_tidaldecoding.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"openreview_trSWJ99WzS","paper":null,"title":"arXiv:openreview_trSWJ99WzS","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DerrickYLJ/LessIsMore","path":"src/models/yarn_tidaldecoding.py","file_url":"https://github.com/DerrickYLJ/LessIsMore/blob/HEAD/src/models/yarn_tidaldecoding.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53b2e52873fb8342","mcp_get_code":{"code_sha256":"53b2e52873fb8342"}},{"arxiv_id":"openreview_d3RFDLBw01","paper":null,"title":"arXiv:openreview_d3RFDLBw01","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"AI2C-Lab/STLA","path":"modeling_llama_custom.py","file_url":"https://github.com/AI2C-Lab/STLA/blob/HEAD/modeling_llama_custom.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"aaai_34690","paper":null,"title":"arXiv:aaai_34690","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"ZongyueQin/DSBD","path":"sampling/models/modeling_llama.py","file_url":"https://github.com/ZongyueQin/DSBD/blob/HEAD/sampling/models/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2025.findings-emnlp.435","paper":null,"title":"arXiv:2025.findings-emnlp.435","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"nguyenngocbaocmt02/OT-Intervention","path":"llama/modeling_llama.py","file_url":"https://github.com/nguyenngocbaocmt02/OT-Intervention/blob/HEAD/llama/modeling_llama.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}},{"arxiv_id":"2025.findings-emnlp.429","paper":null,"title":"arXiv:2025.findings-emnlp.429","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"zhzihao/QPruningKV","path":"pyramidkv/pyramidkv_utils.py","file_url":"https://github.com/zhzihao/QPruningKV/blob/HEAD/pyramidkv/pyramidkv_utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2025.emnlp-main.231","paper":null,"title":"arXiv:2025.emnlp-main.231","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"chenziwenhaoshuai/TS-CLIP","path":"time_moe/models/modeling_time_moe.py","file_url":"https://github.com/chenziwenhaoshuai/TS-CLIP/blob/HEAD/time_moe/models/modeling_time_moe.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"3c76e52815c5401d","mcp_get_code":{"code_sha256":"3c76e52815c5401d"}},{"arxiv_id":"2025.acl-long.366","paper":null,"title":"arXiv:2025.acl-long.366","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"princeton-nlp/ProLong","path":"training/modeling_flash_llama.py","file_url":"https://github.com/princeton-nlp/ProLong/blob/HEAD/training/modeling_flash_llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"69874376c94f0785","mcp_get_code":{"code_sha256":"69874376c94f0785"}},{"arxiv_id":"2024.naacl-long.88","paper":null,"title":"arXiv:2024.naacl-long.88","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"FasterDecoding/REST","path":"rest/model/modeling_llama_kv.py","file_url":"https://github.com/FasterDecoding/REST/blob/HEAD/rest/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f6e0c0fc3868b787","mcp_get_code":{"code_sha256":"f6e0c0fc3868b787"}},{"arxiv_id":"2024.findings-emnlp.22","paper":null,"title":"arXiv:2024.findings-emnlp.22","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"HKUDS/XRec","path":"explainer/models/modeling_explainer.py","file_url":"https://github.com/HKUDS/XRec/blob/HEAD/explainer/models/modeling_explainer.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"30d7eec482ebf6b1","mcp_get_code":{"code_sha256":"30d7eec482ebf6b1"}}]}