{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/rotate-half","entry":"rotate_half","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":424,"n_papers_ran":409,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":51,"n_samples_ran":38,"n_samples_fingerprinted":38,"n_places":452,"n_places_pointer_only":189,"by_status":{"ran_honours":7,"ran_violates":0,"ran_draft_wrong":19,"ran_fixture":0,"ran":12,"unverified":13},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.15740","paper":"/paper/arxiv-2609-15740","title":"A Language‐Guided Multimodal Foundation Model for Zero‐Shot and Multi‐Task Brain Signal Analysis","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"mingzhi-c/metis-brain-signal-foundation-model","path":"METIS.py","file_url":"https://github.com/mingzhi-c/metis-brain-signal-foundation-model/blob/HEAD/METIS.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2609.03756","paper":"/paper/arxiv-2609-03756","title":"ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"speridlabs/eneas","path":"eneas/vendor/SeC/inference/modeling_internlm2.py","file_url":"https://github.com/speridlabs/eneas/blob/HEAD/eneas/vendor/SeC/inference/modeling_internlm2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2609.00097","paper":"/paper/arxiv-2609-00097","title":"Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"qluoluo/faster-flash-decoding","path":"ffd_core/modeling/llama.py","file_url":"https://github.com/qluoluo/faster-flash-decoding/blob/HEAD/ffd_core/modeling/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2608.24168","paper":"/paper/arxiv-2608-24168","title":"FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"FireRedTeam/FireRedAudio","path":"fireredaudio/flow/x_transformers.py","file_url":"https://github.com/FireRedTeam/FireRedAudio/blob/HEAD/fireredaudio/flow/x_transformers.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1729f21cf5144f3d","mcp_get_code":{"code_sha256":"1729f21cf5144f3d"}},{"arxiv_id":"2608.20382","paper":"/paper/arxiv-2608-20382","title":"Decoupled Vision-Language System for Multimodal Understanding and Generation","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"YifanXu74/Libra","path":"libra/models/libra/modeling_libra.py","file_url":"https://github.com/YifanXu74/Libra/blob/HEAD/libra/models/libra/modeling_libra.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2607.26504","paper":"/paper/arxiv-2607-26504","title":"From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"SeunggeunKimkr/genuine-any-order","path":"LatentMDM/model/latent_mdm.py","file_url":"https://github.com/SeunggeunKimkr/genuine-any-order/blob/HEAD/LatentMDM/model/latent_mdm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0c3c32d281da5332","mcp_get_code":{"code_sha256":"0c3c32d281da5332"}},{"arxiv_id":"2607.21595","paper":"/paper/arxiv-2607-21595","title":"3D-Aware VLMs with Implicit and Explicit Geometries","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"Vegetebird/VLM-IE3D","path":"common/utils.py","file_url":"https://github.com/Vegetebird/VLM-IE3D/blob/HEAD/common/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2607.09754","paper":"/paper/arxiv-2607-09754","title":"Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"ShanechiLab/WiCAT","path":"wicat/models/transformer.py","file_url":"https://github.com/ShanechiLab/WiCAT/blob/HEAD/wicat/models/transformer.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"2606.21911","paper":"/paper/arxiv-2606-21911","title":"The Pitfall of Scaling Up: Uncovering and Mitigating Popularity Bias Amplification in Scaling Transformer-based Recommenders","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Tiny-Snow/GenRec","path":"src/genrec/models/model_seqrec/sasrec_sprint.py","file_url":"https://github.com/Tiny-Snow/GenRec/blob/HEAD/src/genrec/models/model_seqrec/sasrec_sprint.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"91bc58efb8a6482c","mcp_get_code":{"code_sha256":"91bc58efb8a6482c"}},{"arxiv_id":"2606.18781","paper":"/paper/arxiv-2606-18781","title":"Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"PunchlineAAAA/DICE","path":"dream/modeling_dream.py","file_url":"https://github.com/PunchlineAAAA/DICE/blob/HEAD/dream/modeling_dream.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2606.18703","paper":"/paper/arxiv-2606-18703","title":"Contextualizing Biological Language Models across Modalities via Logit-Space Contrastive Alignment","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"facebookresearch/esm","path":"esm/rotary_embedding.py","file_url":"https://github.com/facebookresearch/esm/blob/HEAD/esm/rotary_embedding.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2606.16158","paper":"/paper/arxiv-2606-16158","title":"Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"TencentBAC/LazyMCoT","path":"Qwen2.5/modeling_qwen2_5_vl_re_infer.py","file_url":"https://github.com/TencentBAC/LazyMCoT/blob/HEAD/Qwen2.5/modeling_qwen2_5_vl_re_infer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2606.15880","paper":"/paper/arxiv-2606-15880","title":"Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"KQL11/Deep-VRM","path":"Models/DeepVRM/modeling_qwen2_5_vl.py","file_url":"https://github.com/KQL11/Deep-VRM/blob/HEAD/Models/DeepVRM/modeling_qwen2_5_vl.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2606.08705","paper":"/paper/arxiv-2606-08705","title":"Analyzing the Correlation Between Hallucinations and Knowledge Conflicts in Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"llaraspata/HallucinationDetection","path":"src/model/LlaMa.py","file_url":"https://github.com/llaraspata/HallucinationDetection/blob/HEAD/src/model/LlaMa.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2606.07502","paper":"/paper/arxiv-2606-07502","title":"Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"CentreChen/EmbFilter","path":"models/modeling_llama_lr.py","file_url":"https://github.com/CentreChen/EmbFilter/blob/HEAD/models/modeling_llama_lr.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2606.07502","paper":"/paper/arxiv-2606-07502","title":"Your UnEmbedding Matrix is Secretly a Feature Lens for Text Embeddings","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"CentreChen/EmbFilter","path":"models/modeling_mistral_lr.py","file_url":"https://github.com/CentreChen/EmbFilter/blob/HEAD/models/modeling_mistral_lr.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2606.06098","paper":"/paper/arxiv-2606-06098","title":"IR3DE: A Linear Router for Large Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"gensyn-ai/IR3DE","path":"models/modeling_llama.py","file_url":"https://github.com/gensyn-ai/IR3DE/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2606.01495","paper":"/paper/arxiv-2606-01495","title":"CART: Context-Anchored Recurrent Transformer * A Parameter-Efficient Architecture with Learned Stability","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"ccapps42/CART","path":"model/cart.py","file_url":"https://github.com/ccapps42/CART/blob/HEAD/model/cart.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4da1a1beab34982c","mcp_get_code":{"code_sha256":"4da1a1beab34982c"}},{"arxiv_id":"2606.00535","paper":"/paper/arxiv-2606-00535","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"SAI-Lab-NYU/DREAM-S","path":"dream_s/model/cnets.py","file_url":"https://github.com/SAI-Lab-NYU/DREAM-S/blob/HEAD/dream_s/model/cnets.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2606.00535","paper":"/paper/arxiv-2606-00535","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"SAI-Lab-NYU/DREAM-S","path":"dream_s/model/modeling_llama_kv.py","file_url":"https://github.com/SAI-Lab-NYU/DREAM-S/blob/HEAD/dream_s/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2605.30992","paper":"/paper/arxiv-2605-30992","title":"Eigenvectors of Experts are Training-free Non-collapsing Routers","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"giangdip2410/SSMoE","path":"SSMoE/Language/SSMoE-Embedding/models/modeling_deepseek.py","file_url":"https://github.com/giangdip2410/SSMoE/blob/HEAD/SSMoE/Language/SSMoE-Embedding/models/modeling_deepseek.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2605.30100","paper":"/paper/arxiv-2605-30100","title":"CHESS-WORLD-MODEL: A 10M-Game Benchmark for Exact State Tracking from Chess Move Sequences","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Benjamin-Walker/Chess-World-Model","path":"models/transformer.py","file_url":"https://github.com/Benjamin-Walker/Chess-World-Model/blob/HEAD/models/transformer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0d5b4082f0e044b9","mcp_get_code":{"code_sha256":"0d5b4082f0e044b9"}},{"arxiv_id":"2605.27102","paper":"/paper/arxiv-2605-27102","title":"JLT: Clean-Latent Prediction in Latent Diffusion Transformers","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"akatsuki-neo/JLT","path":"util/model_util.py","file_url":"https://github.com/akatsuki-neo/JLT/blob/HEAD/util/model_util.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2605.22297","paper":"/paper/arxiv-2605-22297","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"hed-ucas/Layer-wise-Learning-Rate","path":"galore_utils/modeling_llama.py","file_url":"https://github.com/hed-ucas/Layer-wise-Learning-Rate/blob/HEAD/galore_utils/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2605.21177","paper":"/paper/arxiv-2605-21177","title":"ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"misonsky/chunk","path":"models/modeling_llama.py","file_url":"https://github.com/misonsky/chunk/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2605.17811","paper":"/paper/arxiv-2605-17811","title":"One Model, Two Roles: Emergent Specialization in a Shared Recurrent Transformer","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"juchengshen/air","path":"models/air/air_1net_L2x_H2x_input_token_prepend.py","file_url":"https://github.com/juchengshen/air/blob/HEAD/models/air/air_1net_L2x_H2x_input_token_prepend.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5d0ae16200be190c","mcp_get_code":{"code_sha256":"5d0ae16200be190c"}},{"arxiv_id":"2605.15422","paper":"/paper/arxiv-2605-15422","title":"DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"amazon-science/dualkv-flash-attn-for-rl","path":"flash-attention/flash_attn/layers/rotary.py","file_url":"https://github.com/amazon-science/dualkv-flash-attn-for-rl/blob/HEAD/flash-attention/flash_attn/layers/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"163292f43a3c861b","mcp_get_code":{"code_sha256":"163292f43a3c861b"}},{"arxiv_id":"2605.14654","paper":"/paper/arxiv-2605-14654","title":"Beyond Instance-Level Self-Supervision in 3D Multi-Modal Medical Imaging","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Ashespt/TACO","path":"pretrain/TACO/models/modules.py","file_url":"https://github.com/Ashespt/TACO/blob/HEAD/pretrain/TACO/models/modules.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a3ec43c12656acbb","mcp_get_code":{"code_sha256":"a3ec43c12656acbb"}},{"arxiv_id":"2605.11396","paper":"/paper/arxiv-2605-11396","title":"MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"YupengSu/MuonQ","path":"src/models.py","file_url":"https://github.com/YupengSu/MuonQ/blob/HEAD/src/models.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"986643c1063af44b","mcp_get_code":{"code_sha256":"986643c1063af44b"}},{"arxiv_id":"2605.10537","paper":"/paper/arxiv-2605-10537","title":"Mela: Test-Time Memory Consolidation based on Transformation Hypothesis","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Musubi-ai/Mela","path":"mela/model/commons.py","file_url":"https://github.com/Musubi-ai/Mela/blob/HEAD/mela/model/commons.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2605.08724","paper":"/paper/arxiv-2605-08724","title":"SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"piooip/SynerMedGen","path":"modeling/bagel/siglip_navit.py","file_url":"https://github.com/piooip/SynerMedGen/blob/HEAD/modeling/bagel/siglip_navit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"2605.05892","paper":"/paper/arxiv-2605-05892","title":"Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"flas-ai/FLAS","path":"src/flas/model.py","file_url":"https://github.com/flas-ai/FLAS/blob/HEAD/src/flas/model.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e0782939cfb8d55c","mcp_get_code":{"code_sha256":"e0782939cfb8d55c"}},{"arxiv_id":"2604.23798","paper":"/paper/arxiv-2604-23798","title":"ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"Dao-AILab/flash-attention","path":"flash_attn/layers/rotary.py","file_url":"https://github.com/Dao-AILab/flash-attention/blob/HEAD/flash_attn/layers/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"163292f43a3c861b","mcp_get_code":{"code_sha256":"163292f43a3c861b"}},{"arxiv_id":"2604.22225","paper":"/paper/arxiv-2604-22225","title":"TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"xiaomi-research/tts-prism","path":"models/mimo_audio_tokenizer/modeling_rope_utils.py","file_url":"https://github.com/xiaomi-research/tts-prism/blob/HEAD/models/mimo_audio_tokenizer/modeling_rope_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"bc697b02f78768ac","mcp_get_code":{"code_sha256":"bc697b02f78768ac"}},{"arxiv_id":"2604.18995","paper":"/paper/arxiv-2604-18995","title":"R 2 -dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"GATECH-EIC/R2-dLLM","path":"dream/model/modeling_dream.py","file_url":"https://github.com/GATECH-EIC/R2-dLLM/blob/HEAD/dream/model/modeling_dream.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2604.15750","paper":"/paper/arxiv-2604-15750","title":"DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"X-Xia0828/DepCap","path":"dream/model/modeling_dream.py","file_url":"https://github.com/X-Xia0828/DepCap/blob/HEAD/dream/model/modeling_dream.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2604.13226","paper":"/paper/arxiv-2604-13226","title":"KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"ChuangtaoChen-TUM/KVPacket","path":"kvpacket/kvcache/rope.py","file_url":"https://github.com/ChuangtaoChen-TUM/KVPacket/blob/HEAD/kvpacket/kvcache/rope.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"803acdf586a5f2c3","mcp_get_code":{"code_sha256":"803acdf586a5f2c3"}},{"arxiv_id":"2604.07394","paper":"/paper/arxiv-2604-07394","title":"Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"qqtang-code/FluxAttention","path":"fluxattn/training/modeling_flash_qwen.py","file_url":"https://github.com/qqtang-code/FluxAttention/blob/HEAD/fluxattn/training/modeling_flash_qwen.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ce8a56552eacab99","mcp_get_code":{"code_sha256":"ce8a56552eacab99"}},{"arxiv_id":"2603.28610","paper":"/paper/arxiv-2603-28610","title":"ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"Xnhyacinth/ResAdapt","path":"resadapt/allocator/aznet_v1.py","file_url":"https://github.com/Xnhyacinth/ResAdapt/blob/HEAD/resadapt/allocator/aznet_v1.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fdd93453f92f9167","mcp_get_code":{"code_sha256":"fdd93453f92f9167"}},{"arxiv_id":"2603.22216","paper":"/paper/arxiv-2603-22216","title":"Gumbel Distillation for Parallel Text Generation","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"hxixixh/gumbel-distill","path":"models/dit_gumbel.py","file_url":"https://github.com/hxixixh/gumbel-distill/blob/HEAD/models/dit_gumbel.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8526ce179df04bd4","mcp_get_code":{"code_sha256":"8526ce179df04bd4"}},{"arxiv_id":"2603.08185","paper":"/paper/arxiv-2603-08185","title":"SERQ: Saliency-Aware Low-Rank Error Reconstruction for LLM Quantization SERQ: SALIENCY-AWARE LOW-RANK ERROR RECONSTRUCTION FOR LLM QUANTIZATION","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"acalabys/SERQ","path":"modeling/modeling_gemma3.py","file_url":"https://github.com/acalabys/SERQ/blob/HEAD/modeling/modeling_gemma3.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2603.06642","paper":"/paper/arxiv-2603-06642","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training","path":"sr_ttt_kaggle.py","file_url":"https://github.com/swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training/blob/HEAD/sr_ttt_kaggle.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2603.06642","paper":"/paper/arxiv-2603-06642","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training","path":"sr_ttt_v2.py","file_url":"https://github.com/swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training/blob/HEAD/sr_ttt_v2.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2603.06642","paper":"/paper/arxiv-2603-06642","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training","path":"sr_ttt_fixed.py","file_url":"https://github.com/swamynathanvp/Surprisal-Aware-Residual-Test-Time-Training/blob/HEAD/sr_ttt_fixed.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"2603.04759","paper":"/paper/arxiv-2603-04759","title":"Stacked from One: Multi-Scale Self-Injection for Context Window Extension","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"Clement25/SharedLLM","path":"modeling/modeling_llama_sharedllm_flash.py","file_url":"https://github.com/Clement25/SharedLLM/blob/HEAD/modeling/modeling_llama_sharedllm_flash.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2602.22681","paper":"/paper/arxiv-2602-22681","title":"Accelerating LLM Pre-Training through Flat-Direction Dynamics Enhancement","date":"2026-02-26","month_inferred_from_arxiv_id":null,"title_source":"syntology","repo":"SHUCHENZHU/LITE","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/SHUCHENZHU/LITE/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2602.22278","paper":"/paper/arxiv-2602-22278","title":"RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"alivecat05/RETLLM","path":"modeling_qwen2_5_vl.py","file_url":"https://github.com/alivecat05/RETLLM/blob/HEAD/modeling_qwen2_5_vl.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2602.19146","paper":"/paper/arxiv-2602-19146","title":"VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"dmgcsilva/vigia","path":"inference/model.py","file_url":"https://github.com/dmgcsilva/vigia/blob/HEAD/inference/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"766ad0e51b7a8f09","mcp_get_code":{"code_sha256":"766ad0e51b7a8f09"}},{"arxiv_id":"2602.18662","paper":"/paper/arxiv-2602-18662","title":"Large Causal Models for Temporal Causal Discovery","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"kougioulis/LCM","path":"lcm_pytorch/models/misc/RotaryEmbedding.py","file_url":"https://github.com/kougioulis/LCM/blob/HEAD/lcm_pytorch/models/misc/RotaryEmbedding.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"eb0d65450ca1f1f9","mcp_get_code":{"code_sha256":"eb0d65450ca1f1f9"}},{"arxiv_id":"2602.16052","paper":"/paper/arxiv-2602-16052","title":"MoE-Spec: Expert Budgeting for Efficient Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"SafeAILab/EAGLE","path":"eagle/modeling_eagle.py","file_url":"https://github.com/SafeAILab/EAGLE/blob/HEAD/eagle/modeling_eagle.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2602.07628","paper":"/paper/arxiv-2602-07628","title":"SleepMaMi: A Universal Sleep Foundation Model for Integrating Macro-and Micro-structures","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"keondopark/SleepMaMi","path":"models/transformer_modules.py","file_url":"https://github.com/keondopark/SleepMaMi/blob/HEAD/models/transformer_modules.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b61de8836f3137b3","mcp_get_code":{"code_sha256":"b61de8836f3137b3"}},{"arxiv_id":"2602.06953","paper":"/paper/arxiv-2602-06953","title":"DAWN: Dependency-Aware Fast Inference for Diffusion LLMs","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"lizhuo-luo/DAWN","path":"dream/model/modeling_dream.py","file_url":"https://github.com/lizhuo-luo/DAWN/blob/HEAD/dream/model/modeling_dream.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2602.05258","paper":"/paper/arxiv-2602-05258","title":"CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"hrlics/CoPE","path":"modeling_cope.py","file_url":"https://github.com/hrlics/CoPE/blob/HEAD/modeling_cope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2602.01173","paper":"/paper/arxiv-2602-01173","title":"EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"workerred/EEmo-Logic","path":"train/Stage_2/modeling_qwen2_5_vl.py","file_url":"https://github.com/workerred/EEmo-Logic/blob/HEAD/train/Stage_2/modeling_qwen2_5_vl.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2601.19278","paper":"/paper/arxiv-2601-19278","title":"DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"fvliang/DART","path":"dart/model/modeling_mixtral_kv.py","file_url":"https://github.com/fvliang/DART/blob/HEAD/dart/model/modeling_mixtral_kv.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2601.19278","paper":"/paper/arxiv-2601-19278","title":"DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"fvliang/DART","path":"dart/model/llama3_dart.py","file_url":"https://github.com/fvliang/DART/blob/HEAD/dart/model/llama3_dart.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2601.19278","paper":"/paper/arxiv-2601-19278","title":"DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"fvliang/DART","path":"dart/model/modeling_llama_kv.py","file_url":"https://github.com/fvliang/DART/blob/HEAD/dart/model/modeling_llama_kv.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ded2d9e57bfdee4e","mcp_get_code":{"code_sha256":"ded2d9e57bfdee4e"}},{"arxiv_id":"2601.17883","paper":"/paper/arxiv-2601-17883","title":"EEG-FM-Compass: Progress, Benchmarking, and Future Directions for EEG Foundation Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"Dingkun0817/EEG-FM-Benchmark","path":"models/FM/EEGPT/Model_EEGPT.py","file_url":"https://github.com/Dingkun0817/EEG-FM-Benchmark/blob/HEAD/models/FM/EEGPT/Model_EEGPT.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c1f873b79cb6cd24","mcp_get_code":{"code_sha256":"c1f873b79cb6cd24"}},{"arxiv_id":"2601.17868","paper":"/paper/arxiv-2601-17868","title":"VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"ziHoHe/VidLaDA","path":"train/llada_v_prepare/files/modeling_llada.py","file_url":"https://github.com/ziHoHe/VidLaDA/blob/HEAD/train/llada_v_prepare/files/modeling_llada.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2601.17367","paper":"/paper/arxiv-2601-17367","title":"Elastic Attention: Test-time Adaptive Sparsity Ratios for Efficient Transformers","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"LCM-Lab/Elastic-Attention","path":"elasticattn/src/model_utils.py","file_url":"https://github.com/LCM-Lab/Elastic-Attention/blob/HEAD/elasticattn/src/model_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2601.15498","paper":"/paper/arxiv-2601-15498","title":"MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"5SSjw/MARS","path":"mars/model/cnets1.py","file_url":"https://github.com/5SSjw/MARS/blob/HEAD/mars/model/cnets1.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2601.15498","paper":"/paper/arxiv-2601-15498","title":"MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"5SSjw/MARS","path":"mars/model/cnets.py","file_url":"https://github.com/5SSjw/MARS/blob/HEAD/mars/model/cnets.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2601.15498","paper":"/paper/arxiv-2601-15498","title":"MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"5SSjw/MARS","path":"mars/model/modeling_llama_kv.py","file_url":"https://github.com/5SSjw/MARS/blob/HEAD/mars/model/modeling_llama_kv.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ded2d9e57bfdee4e","mcp_get_code":{"code_sha256":"ded2d9e57bfdee4e"}},{"arxiv_id":"2601.11522","paper":"/paper/arxiv-2601-11522","title":"UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"ZrH42/UniX","path":"modeling/unix/siglip_navit.py","file_url":"https://github.com/ZrH42/UniX/blob/HEAD/modeling/unix/siglip_navit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"2601.03248","paper":"/paper/arxiv-2601-03248","title":"STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"LingFengGold/STReasoner","path":"base_model/Config-Qwen2.5-14B-Instruct/modeling_qwen2.py","file_url":"https://github.com/LingFengGold/STReasoner/blob/HEAD/base_model/Config-Qwen2.5-14B-Instruct/modeling_qwen2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2512.07112","paper":"/paper/arxiv-2512-07112","title":"FOAM: Blocked State Folding for Memory-Efficient LLM Training","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"zqOuO/FOAM","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/zqOuO/FOAM/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2511.10056","paper":"/paper/arxiv-2511-10056","title":"From Static Structures to Ensembles: Studying and Harnessing Protein Structure Tokenization","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"IDEA-XL/TokenMD","path":"esm/layers/rotary.py","file_url":"https://github.com/IDEA-XL/TokenMD/blob/HEAD/esm/layers/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"163292f43a3c861b","mcp_get_code":{"code_sha256":"163292f43a3c861b"}},{"arxiv_id":"2511.05299","paper":"/paper/arxiv-2511-05299","title":"LiveStar: Live Streaming Assistant for Real-World Online Video Understanding","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"yzy-bupt/LiveStar","path":"inference/modeling_livestar_llm.py","file_url":"https://github.com/yzy-bupt/LiveStar/blob/HEAD/inference/modeling_livestar_llm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2511.02213","paper":"/paper/arxiv-2511-02213","title":"IG-Pruning: Input-Guided Block Pruning for Large Language Models","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"ictnlp/IG-Pruning","path":"src/models/dsr_modeling_llama.py","file_url":"https://github.com/ictnlp/IG-Pruning/blob/HEAD/src/models/dsr_modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2510.24088","paper":"/paper/arxiv-2510-24088","title":"Information-Theoretic Discrete Diffusion","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"Dongjae0324/infodis","path":"model/rotary.py","file_url":"https://github.com/Dongjae0324/infodis/blob/HEAD/model/rotary.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8526ce179df04bd4","mcp_get_code":{"code_sha256":"8526ce179df04bd4"}},{"arxiv_id":"2510.22139","paper":"/paper/arxiv-2510-22139","title":"Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"LiuJinzhe-Keepgoing/NMKE","path":"modeling_llama.py","file_url":"https://github.com/LiuJinzhe-Keepgoing/NMKE/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2510.21270","paper":"/paper/arxiv-2510-21270","title":"Sparser Block-Sparse Attention via Token Permutation","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"xinghaow99/pbs-attn","path":"pbs_attn/patch/huggingface.py","file_url":"https://github.com/xinghaow99/pbs-attn/blob/HEAD/pbs_attn/patch/huggingface.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2510.16415","paper":"/paper/arxiv-2510-16415","title":"MeCeFO: Enhancing LLM Training Robustness via Fault-Tolerant Optimization","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"pkumelon/MeCeFO","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/pkumelon/MeCeFO/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2510.12764","paper":"/paper/arxiv-2510-12764","title":"AnyUp: Universal Feature Upsampling","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":null,"path":"","file_url":null,"status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2510.11509","paper":"/paper/arxiv-2510-11509","title":"Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"RuipingL/Situat3DChange","path":"SCReasoner/model/transformers.py","file_url":"https://github.com/RuipingL/Situat3DChange/blob/HEAD/SCReasoner/model/transformers.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2509.15235","paper":"/paper/arxiv-2509-15235","title":"ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"KangJialiang/ViSpec","path":"vispec/model/modeling_mixtral_kv.py","file_url":"https://github.com/KangJialiang/ViSpec/blob/HEAD/vispec/model/modeling_mixtral_kv.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2509.15235","paper":"/paper/arxiv-2509-15235","title":"ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"KangJialiang/ViSpec","path":"vispec/model/cnets.py","file_url":"https://github.com/KangJialiang/ViSpec/blob/HEAD/vispec/model/cnets.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2509.15235","paper":"/paper/arxiv-2509-15235","title":"ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"KangJialiang/ViSpec","path":"vispec/model/modeling_llama_kv.py","file_url":"https://github.com/KangJialiang/ViSpec/blob/HEAD/vispec/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2509.01986","paper":"/paper/arxiv-2509-01986","title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"showlab/DIM","path":"models/modeling_qwen2_5_vl.py","file_url":"https://github.com/showlab/DIM/blob/HEAD/models/modeling_qwen2_5_vl.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2508.05606","paper":"/paper/arxiv-2508-05606","title":"Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"Fr0zenCrane/UniCoT","path":"modeling/qwen2/modeling_qwen2.py","file_url":"https://github.com/Fr0zenCrane/UniCoT/blob/HEAD/modeling/qwen2/modeling_qwen2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2508.05606","paper":"/paper/arxiv-2508-05606","title":"Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"Fr0zenCrane/UniCoT","path":"modeling/bagel/siglip_navit.py","file_url":"https://github.com/Fr0zenCrane/UniCoT/blob/HEAD/modeling/bagel/siglip_navit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"2508.04045","paper":"/paper/arxiv-2508-04045","title":"FeDaL: Federated Dataset Learning for General Time Series Foundation Models","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"shengchaochen82/FeDaL","path":"layers/SelfAttention_Family.py","file_url":"https://github.com/shengchaochen82/FeDaL/blob/HEAD/layers/SelfAttention_Family.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"06b7cb00db5681c0","mcp_get_code":{"code_sha256":"06b7cb00db5681c0"}},{"arxiv_id":"2507.23284","paper":null,"title":"arXiv:2507.23284","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"mlvlab/BLiM","path":"videochat_flash/modeling_qwen2_flash.py","file_url":"https://github.com/mlvlab/BLiM/blob/HEAD/videochat_flash/modeling_qwen2_flash.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2507.22424","paper":null,"title":"arXiv:2507.22424","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"PineTreeWss/SpecVLA","path":"openvla/specdecoding/model/cnets.py","file_url":"https://github.com/PineTreeWss/SpecVLA/blob/HEAD/openvla/specdecoding/model/cnets.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2507.22424","paper":null,"title":"arXiv:2507.22424","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"PineTreeWss/SpecVLA","path":"openvla/specdecoding/model/modeling_llama_kv.py","file_url":"https://github.com/PineTreeWss/SpecVLA/blob/HEAD/openvla/specdecoding/model/modeling_llama_kv.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ded2d9e57bfdee4e","mcp_get_code":{"code_sha256":"ded2d9e57bfdee4e"}},{"arxiv_id":"2507.10419","paper":null,"title":"arXiv:2507.10419","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"Victorletzelter/LoRA-MCL","path":"ALMA/modeling_xalma.py","file_url":"https://github.com/Victorletzelter/LoRA-MCL/blob/HEAD/ALMA/modeling_xalma.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2507.03738","paper":"/paper/flow-anchored-consistency-models","title":"Flow-Anchored Consistency Models","date":"2025-07-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ali-vilab/FACM","path":"ldit/pos_embed.py","file_url":"https://github.com/ali-vilab/FACM/blob/HEAD/ldit/pos_embed.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2507.02581","paper":null,"title":"arXiv:2507.02581","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"Ashespt/S2DC","path":"Pretrain/models/modules.py","file_url":"https://github.com/Ashespt/S2DC/blob/HEAD/Pretrain/models/modules.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a3ec43c12656acbb","mcp_get_code":{"code_sha256":"a3ec43c12656acbb"}},{"arxiv_id":"2507.01949","paper":"/paper/kwai-keye-vl-technical-report","title":"Kwai Keye-VL Technical Report","date":"2025-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kwai-keye/keye","path":"keye-vl-8b-preview/modeling_keye.py","file_url":"https://github.com/kwai-keye/keye/blob/HEAD/keye-vl-8b-preview/modeling_keye.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2507.01299","paper":null,"title":"arXiv:2507.01299","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"alibaba/EfficientAI","path":"larosa/inference/modeling_llama_larosa.py","file_url":"https://github.com/alibaba/EfficientAI/blob/HEAD/larosa/inference/modeling_llama_larosa.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.20251","paper":"/paper/q-resafe-assessing-safety-risks-and","title":"Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models","date":"2025-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thecommonirin/qresafe","path":"quant-with-ft/models/modeling_llama_quant.py","file_url":"https://github.com/thecommonirin/qresafe/blob/HEAD/quant-with-ft/models/modeling_llama_quant.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.18841","paper":"/paper/longwriter-zero-mastering-ultra-long-text","title":"LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning","date":"2025-06-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thudm/longwriter","path":"train/patch/modeling_llama.py","file_url":"https://github.com/thudm/longwriter/blob/HEAD/train/patch/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.15564","paper":"/paper/show-o2-improved-native-unified-multimodal","title":"Show-o2: Improved Native Unified Multimodal Models","date":"2025-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"showlab/Show-o","path":"show-o2/models/modules.py","file_url":"https://github.com/showlab/Show-o/blob/HEAD/show-o2/models/modules.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.15220","paper":"/paper/video-salmonn-2-captioning-enhanced-audio","title":"video-SALMONN 2: Captioning-Enhanced Audio-Visual Large Language Models","date":"2025-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bytedance/video-salmonn-2","path":"video_SALMONN2_plus/qwenvl/model/modeling_qwen2_5_vl.py","file_url":"https://github.com/bytedance/video-salmonn-2/blob/HEAD/video_SALMONN2_plus/qwenvl/model/modeling_qwen2_5_vl.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2506.13585","paper":"/paper/minimax-m1-scaling-test-time-compute","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","date":"2025-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"minimax-ai/minimax-m1","path":"modeling_minimax_m1.py","file_url":"https://github.com/minimax-ai/minimax-m1/blob/HEAD/modeling_minimax_m1.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.12687","paper":null,"title":"arXiv:2506.12687","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"Yuzt-zju/CoCorrRec","path":"model/cocorrrec/ttt.py","file_url":"https://github.com/Yuzt-zju/CoCorrRec/blob/HEAD/model/cocorrrec/ttt.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.09944","paper":"/paper/query-focused-retrieval-heads-improve-long","title":"Query-Focused Retrieval Heads Improve Long-Context Reasoning and Re-ranking","date":"2025-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-pli/QRHead","path":"src/qrretriever/custom_modeling_llama.py","file_url":"https://github.com/princeton-pli/QRHead/blob/HEAD/src/qrretriever/custom_modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.09351","paper":null,"title":"arXiv:2506.09351","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"yuchenblah/DIVE","path":"models/llama/modeling_llama.py","file_url":"https://github.com/yuchenblah/DIVE/blob/HEAD/models/llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.09344","paper":"/paper/ming-omni-a-unified-multimodal-model-for","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","date":"2025-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"inclusionai/ming","path":"modeling_bailing_moe_v2.py","file_url":"https://github.com/inclusionai/ming/blob/HEAD/modeling_bailing_moe_v2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2506.04779","paper":"/paper/mmsu-a-massive-multi-task-spoken-language","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","date":"2025-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"QwenLM/Qwen2.5-Omni","path":"low-VRAM-mode/modeling_qwen2_5_omni_low_VRAM_mode.py","file_url":"https://github.com/QwenLM/Qwen2.5-Omni/blob/HEAD/low-VRAM-mode/modeling_qwen2_5_omni_low_VRAM_mode.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2506.06295","paper":"/paper/dllm-cache-accelerating-diffusion-large","title":"dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching","date":"2025-05-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maomaocun/dLLM-cache","path":"dllm_cache/hooks/cache_hook_LLaDA_V.py","file_url":"https://github.com/maomaocun/dLLM-cache/blob/HEAD/dllm_cache/hooks/cache_hook_LLaDA_V.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2505.21906","paper":"/paper/vision-language-action-model-with-open-world","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","date":"2025-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tutujingyugang1/ChatVLA_public","path":"qwen2_vla/models/modeling_qwen2_vla.py","file_url":"https://github.com/tutujingyugang1/ChatVLA_public/blob/HEAD/qwen2_vla/models/modeling_qwen2_vla.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2505.20674","paper":"/paper/pretraining-language-models-to-ponder-in","title":"Pretraining Language Models to Ponder in Continuous Space","date":"2025-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2505.16415","paper":"/paper/attributing-response-to-context-a-jensen","title":"Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation","date":"2025-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ruizheliUOA/ARC_JSD","path":"llm_models/modeling_gemma2.py","file_url":"https://github.com/ruizheliUOA/ARC_JSD/blob/HEAD/llm_models/modeling_gemma2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2505.16270","paper":"/paper/transformer-copilot-learning-from-the-mistake","title":"Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning","date":"2025-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jiaruzouu/transformercopilot","path":"src/Decoder_Only/copilot/modeling_flax_llama.py","file_url":"https://github.com/jiaruzouu/transformercopilot/blob/HEAD/src/Decoder_Only/copilot/modeling_flax_llama.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6b3f1075d5cc01c4","mcp_get_code":{"code_sha256":"6b3f1075d5cc01c4"}},{"arxiv_id":"2505.14683","paper":"/paper/emerging-properties-in-unified-multimodal","title":"Emerging Properties in Unified Multimodal Pretraining","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neverbiasu/ComfyUI-BAGEL","path":"modeling/bagel/siglip_navit.py","file_url":"https://github.com/neverbiasu/ComfyUI-BAGEL/blob/HEAD/modeling/bagel/siglip_navit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"2505.14671","paper":"/paper/unictokens-boosting-personalized","title":"UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"arctanxarc/unictokens","path":"models/phi.py","file_url":"https://github.com/arctanxarc/unictokens/blob/HEAD/models/phi.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2505.14640","paper":"/paper/videoeval-pro-robust-and-realistic-long-video","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/videochat-flash","path":"llava-train_videochat/llava/model/language_model/modeling_qwen2_flash.py","file_url":"https://github.com/opengvlab/videochat-flash/blob/HEAD/llava-train_videochat/llava/model/language_model/modeling_qwen2_flash.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2505.10518","paper":"/paper/multi-token-prediction-needs-registers","title":"Multi-Token Prediction Needs Registers","date":"2025-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nasosger/mutor","path":"language_modeling/src/models/llama_mutor.py","file_url":"https://github.com/nasosger/mutor/blob/HEAD/language_modeling/src/models/llama_mutor.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2505.10518","paper":"/paper/multi-token-prediction-needs-registers","title":"Multi-Token Prediction Needs Registers","date":"2025-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nasosger/mutor","path":"language_modeling/src/models/gemma_mutor.py","file_url":"https://github.com/nasosger/mutor/blob/HEAD/language_modeling/src/models/gemma_mutor.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2505.10475","paper":"/paper/parallel-scaling-law-for-language-models","title":"Parallel Scaling Law for Language Models","date":"2025-05-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2505.07447","paper":"/paper/unified-continuous-generative-models","title":"Unified Continuous Generative Models","date":"2025-05-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LINs-Lab/UCGM","path":"networks/pos_embed.py","file_url":"https://github.com/LINs-Lab/UCGM/blob/HEAD/networks/pos_embed.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2505.06708","paper":"/paper/gated-attention-for-large-language-models-non","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","date":"2025-05-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qiuzh20/gated_attention","path":"modeling_qwen3.py","file_url":"https://github.com/qiuzh20/gated_attention/blob/HEAD/modeling_qwen3.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2505.03005","paper":"/paper/radlads-rapid-attention-distillation-to","title":"RADLADS: Rapid Attention Distillation to Linear Attention Decoders at Scale","date":"2025-05-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"recursal/radlads-paper","path":"models/qwen2.py","file_url":"https://github.com/recursal/radlads-paper/blob/HEAD/models/qwen2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2504.21403","paper":null,"title":"arXiv:2504.21403","date":null,"month_inferred_from_arxiv_id":"2025-04","title_source":null,"repo":"ANDgate99/Explore-Then-Select","path":"model/modeling_qwen2.py","file_url":"https://github.com/ANDgate99/Explore-Then-Select/blob/HEAD/model/modeling_qwen2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2504.21403","paper":null,"title":"arXiv:2504.21403","date":null,"month_inferred_from_arxiv_id":"2025-04","title_source":null,"repo":"ANDgate99/Explore-Then-Select","path":"model/modeling_qwen2_5_vl.py","file_url":"https://github.com/ANDgate99/Explore-Then-Select/blob/HEAD/model/modeling_qwen2_5_vl.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2504.20595","paper":"/paper/reasonir-training-retrievers-for-reasoning","title":"ReasonIR: Training Retrievers for Reasoning Tasks","date":"2025-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2504.17343","paper":"/paper/timechat-online-80-visual-tokens-are","title":"TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos","date":"2025-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"renshuhuai-andy/timechat","path":"timechat/models/modeling_llama.py","file_url":"https://github.com/renshuhuai-andy/timechat/blob/HEAD/timechat/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2504.13181","paper":"/paper/perception-encoder-the-best-visual-embeddings","title":"Perception Encoder: The best visual embeddings are not at the output of the network","date":"2025-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/perception_models","path":"apps/detection/DETA_pe/models/pev1.py","file_url":"https://github.com/facebookresearch/perception_models/blob/HEAD/apps/detection/DETA_pe/models/pev1.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2504.02949","paper":"/paper/vargpt-v1-1-improve-visual-autoregressive","title":"VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning","date":"2025-04-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vargpt-family/vargpt-v1.1","path":"vargpt_qwen_v1_1/modeling_vargpt_qwen2_vl.py","file_url":"https://github.com/vargpt-family/vargpt-v1.1/blob/HEAD/vargpt_qwen_v1_1/modeling_vargpt_qwen2_vl.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2504.02732","paper":"/paper/why-do-llms-attend-to-the-first-token","title":"Why do LLMs attend to the first token?","date":"2025-04-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzmtsvv/ad-gta","path":"src/nn/memeff_rope_fn.py","file_url":"https://github.com/zzmtsvv/ad-gta/blob/HEAD/src/nn/memeff_rope_fn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d03c5ab466edb014","mcp_get_code":{"code_sha256":"d03c5ab466edb014"}},{"arxiv_id":"2503.20533","paper":"/paper/accelerate-parallelizable-reasoning-via","title":"Accelerate Parallelizable Reasoning via Parallel Decoding within One Sequence","date":"2025-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2503.19903","paper":"/paper/scaling-vision-pre-training-to-4k-resolution","title":"Scaling Vision Pre-Training to 4K Resolution","date":"2025-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"efficient-large-model/vila","path":"llava/eval/vision_niah_vila/zigzag_ring_attn/modeling_qwen2.py","file_url":"https://github.com/efficient-large-model/vila/blob/HEAD/llava/eval/vision_niah_vila/zigzag_ring_attn/modeling_qwen2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2503.18938","paper":"/paper/adaworld-learning-adaptable-world-models-with","title":"AdaWorld: Learning Adaptable World Models with Latent Actions","date":"2025-03-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"little-podi/adaworld","path":"lam/lam/modules/lam.py","file_url":"https://github.com/little-podi/adaworld/blob/HEAD/lam/lam/modules/lam.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a61b41823e31cfae","mcp_get_code":{"code_sha256":"a61b41823e31cfae"}},{"arxiv_id":"2503.15798","paper":"/paper/mixture-of-lookup-experts","title":"Mixture of Lookup Experts","date":"2025-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jieshibo/mole","path":"modeling_mole.py","file_url":"https://github.com/jieshibo/mole/blob/HEAD/modeling_mole.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0ad8d888b1eb9c46","mcp_get_code":{"code_sha256":"0ad8d888b1eb9c46"}},{"arxiv_id":"2503.12559","paper":"/paper/adaretake-adaptive-redundancy-reduction-to","title":"AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding","date":"2025-03-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sczwangxiao/video-flexreduc","path":"retake/longvideo_cache.py","file_url":"https://github.com/sczwangxiao/video-flexreduc/blob/HEAD/retake/longvideo_cache.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2503.12340","paper":"/paper/svd-llm-v2-optimizing-singular-value","title":"SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression","date":"2025-03-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aiot-mlsys-lab/svd-llm","path":"SVDLLM.py","file_url":"https://github.com/aiot-mlsys-lab/svd-llm/blob/HEAD/SVDLLM.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2a2393c46243da08","mcp_get_code":{"code_sha256":"2a2393c46243da08"}},{"arxiv_id":"2503.11187","paper":"/paper/fastvid-dynamic-density-pruning-for-fast","title":"FastVID: Dynamic Density Pruning for Fast Video Large Language Models","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2503.11187","paper":"/paper/fastvid-dynamic-density-pruning-for-fast","title":"FastVID: Dynamic Density Pruning for Fast Video Large Language Models","date":"2025-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2503.10501","paper":"/paper/tokencarve-information-preserving-visual","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","date":"2025-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shawntan86/tokencarve","path":"TokenCarve/modeling_llama.py","file_url":"https://github.com/shawntan86/tokencarve/blob/HEAD/TokenCarve/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2503.10135","paper":"/paper/gumiho-a-hybrid-architecture-to-prioritize","title":"Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding","date":"2025-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AMD-AIG-AIMA/Gumiho","path":"gumiho/model/cnets.py","file_url":"https://github.com/AMD-AIG-AIMA/Gumiho/blob/HEAD/gumiho/model/cnets.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2503.10135","paper":"/paper/gumiho-a-hybrid-architecture-to-prioritize","title":"Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding","date":"2025-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AMD-AIG-AIMA/Gumiho","path":"gumiho/model/modeling_llama_kv.py","file_url":"https://github.com/AMD-AIG-AIMA/Gumiho/blob/HEAD/gumiho/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2503.09427","paper":"/paper/multimodal-language-modeling-for-high","title":"Language-Enhanced Representation Learning for Single-Cell Transcriptomics","date":"2025-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2503.07604","paper":"/paper/implicit-reasoning-in-transformers-is","title":"Implicit Reasoning in Transformers is Reasoning through Shortcuts","date":"2025-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TianheL/LM-Implicit-Reasoning","path":"src/model/modeling_gpt2_rope.py","file_url":"https://github.com/TianheL/LM-Implicit-Reasoning/blob/HEAD/src/model/modeling_gpt2_rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2503.06881","paper":"/paper/resmoe-space-efficient-compression-of-mixture","title":"ResMoE: Space-efficient Compression of Mixture of Experts LLMs via Residual Restoration","date":"2025-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"idea-isail-lab-uiuc/resmoe","path":"mixtral/resmoe_mixtral/modeling_mixtral.py","file_url":"https://github.com/idea-isail-lab-uiuc/resmoe/blob/HEAD/mixtral/resmoe_mixtral/modeling_mixtral.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2503.01773","paper":"/paper/why-is-spatial-reasoning-hard-for-vlms-an","title":"Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas","date":"2025-03-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2502.17421","paper":"/paper/longspec-long-context-speculative-decoding","title":"LongSpec: Long-Context Speculative Decoding with Efficient Drafting and Verification","date":"2025-02-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sail-sg/longspec","path":"longspec/train/models/qwen2.py","file_url":"https://github.com/sail-sg/longspec/blob/HEAD/longspec/train/models/qwen2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2502.15894","paper":"/paper/riflex-a-free-lunch-for-length-extrapolation","title":"RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers","date":"2025-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hao-ai-lab/FastVideo","path":"fastvideo/layers/rotary_embedding_3d.py","file_url":"https://github.com/hao-ai-lab/FastVideo/blob/HEAD/fastvideo/layers/rotary_embedding_3d.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d727d58b7f752099","mcp_get_code":{"code_sha256":"d727d58b7f752099"}},{"arxiv_id":"2502.15618","paper":"/paper/probe-pruning-accelerating-llms-through","title":"Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing","date":"2025-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2502.11494","paper":"/paper/stop-looking-for-important-tokens-in","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","date":"2025-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zichenwen1/dart","path":"Qwen2_5-VL/Qwen2_5VL_DART/modeling_qwen2_5_vl_self.py","file_url":"https://github.com/zichenwen1/dart/blob/HEAD/Qwen2_5-VL/Qwen2_5VL_DART/modeling_qwen2_5_vl_self.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2502.11089","paper":"/paper/native-sparse-attention-hardware-aligned-and","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","date":"2025-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/seerattention","path":"seer_attn/modules/common.py","file_url":"https://github.com/microsoft/seerattention/blob/HEAD/seer_attn/modules/common.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2502.10425","paper":"/paper/neuron-platonic-intrinsic-representation-from","title":"Neuron Platonic Intrinsic Representation From Dynamics Using Contrastive Learning","date":"2025-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ww20hust/NeurPIR","path":"src/models/encoder.py","file_url":"https://github.com/ww20hust/NeurPIR/blob/HEAD/src/models/encoder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7082304fd2ae76b8","mcp_get_code":{"code_sha256":"7082304fd2ae76b8"}},{"arxiv_id":"2502.08769","paper":"/paper/cluster-and-predict-latents-patches-for","title":"Cluster and Predict Latents Patches for Improved Masked Image Modeling","date":"2025-02-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2502.06352","paper":"/paper/lantern-enhanced-relaxed-speculative-decoding","title":"LANTERN++: Enhancing Relaxed Speculative Decoding with Static Tree Drafting for Visual Auto-regressive Models","date":"2025-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2502.05173","paper":"/paper/videorope-what-makes-for-good-video-rotary","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","date":"2025-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wiselnn570/videorope","path":"videorope-transformer/modeling_videorope.py","file_url":"https://github.com/wiselnn570/videorope/blob/HEAD/videorope-transformer/modeling_videorope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2502.00592","paper":"/paper/m-extending-memoryllm-with-scalable-long-term","title":"M+: Extending MemoryLLM with Scalable Long-Term Memory","date":"2025-02-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2501.15368","paper":"/paper/baichuan-omni-1-5-technical-report","title":"Baichuan-Omni-1.5 Technical Report","date":"2025-01-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2501.13987","paper":"/paper/ostquant-refining-large-language-model","title":"OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting","date":"2025-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"brotherhappy/ostquant","path":"models/modeling_llama.py","file_url":"https://github.com/brotherhappy/ostquant/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0ad8d888b1eb9c46","mcp_get_code":{"code_sha256":"0ad8d888b1eb9c46"}},{"arxiv_id":"2501.13925","paper":"/paper/geopixel-pixel-grounding-large-multimodal","title":"GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing","date":"2025-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mbzuai-oryx/geopixel","path":"model/IXC/modeling_internlm2.py","file_url":"https://github.com/mbzuai-oryx/geopixel/blob/HEAD/model/IXC/modeling_internlm2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2501.13106","paper":"/paper/videollama-3-frontier-multimodal-foundation","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","date":"2025-01-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/videollama3","path":"inference/transformers_api/modeling_videollama3_encoder.py","file_url":"https://github.com/damo-nlp-sg/videollama3/blob/HEAD/inference/transformers_api/modeling_videollama3_encoder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2501.06589","paper":"/paper/ladder-residual-parallelism-aware","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","date":"2025-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mayank31398/ladder-residual-inference","path":"hf_modeling_utils/modeling_llama_ladder.py","file_url":"https://github.com/mayank31398/ladder-residual-inference/blob/HEAD/hf_modeling_utils/modeling_llama_ladder.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2501.01986","paper":"/paper/framefusion-combining-similarity-and","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Visual Language Models","date":"2024-12-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thu-nics/framefusion","path":"framefusion/models/internvl/modeling_internlm2.py","file_url":"https://github.com/thu-nics/framefusion/blob/HEAD/framefusion/models/internvl/modeling_internlm2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2412.20504","paper":"/paper/retake-reducing-temporal-and-knowledge","title":"ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding","date":"2024-12-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sczwangxiao/video-retake","path":"retake/longvideo_cache.py","file_url":"https://github.com/sczwangxiao/video-retake/blob/HEAD/retake/longvideo_cache.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2412.18450","paper":"/paper/3dgraphllm-combining-semantic-graphs-and","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","date":"2024-12-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cognitiveaisystems/3dgraphllm","path":"models/modeling_llama.py","file_url":"https://github.com/cognitiveaisystems/3dgraphllm/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2412.17743","paper":"/paper/yulan-mini-an-open-data-efficient-language","title":"YuLan-Mini: An Open Data-efficient Language Model","date":"2024-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2412.17619","paper":"/paper/kernel-aware-graph-prompt-learning-for-few","title":"Kernel-Aware Graph Prompt Learning for Few-Shot Anomaly Detection","date":"2024-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cvl-hub/kag-prompt","path":"code/model/modeling_llama.py","file_url":"https://github.com/cvl-hub/kag-prompt/blob/HEAD/code/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2412.13335","paper":"/paper/experience-of-training-a-1-7b-parameter-llama","title":"Experience of Training a 1.7B-Parameter LLaMa Model From Scratch","date":"2024-12-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2412.08781","paper":"/paper/generative-modeling-with-explicit-memory","title":"Generative Modeling with Explicit Memory","date":"2024-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lins-lab/gmem","path":"models/pos_embed.py","file_url":"https://github.com/lins-lab/gmem/blob/HEAD/models/pos_embed.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2412.07763","paper":"/paper/bayesian-optimization-of-antibodies-informed","title":"Bayesian Optimization of Antibodies Informed by a Generative Model of Evolving Sequences","date":"2024-12-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alannawzadamin/clonebo","path":"clonebo/modeling_llama.py","file_url":"https://github.com/alannawzadamin/clonebo/blob/HEAD/clonebo/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2412.06464","paper":"/paper/gated-delta-networks-improving-mamba2-with","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","date":"2024-12-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NVlabs/GatedDeltaNet","path":"lit_gpt/rotary.py","file_url":"https://github.com/NVlabs/GatedDeltaNet/blob/HEAD/lit_gpt/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"163292f43a3c861b","mcp_get_code":{"code_sha256":"163292f43a3c861b"}},{"arxiv_id":"2412.05270","paper":"/paper/apollo-sgd-like-memory-adamw-level","title":"APOLLO: SGD-like Memory, AdamW-level Performance","date":"2024-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhuhanqing/APOLLO","path":"utils/modeling_llama.py","file_url":"https://github.com/zhuhanqing/APOLLO/blob/HEAD/utils/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2412.04467","paper":"/paper/visionzip-longer-is-better-but-not-necessary","title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","date":"2024-12-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dvlab-research/visionzip","path":"Qwen2_5_VL/qwen2_5vl_visionzip.py","file_url":"https://github.com/dvlab-research/visionzip/blob/HEAD/Qwen2_5_VL/qwen2_5vl_visionzip.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2412.03603","paper":"/paper/hunyuanvideo-a-systematic-framework-for-large","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","date":"2024-12-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tencent/hunyuanvideo","path":"hyvideo/modules/models.py","file_url":"https://github.com/tencent/hunyuanvideo/blob/HEAD/hyvideo/modules/models.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"dda8bc930ad44165","mcp_get_code":{"code_sha256":"dda8bc930ad44165"}},{"arxiv_id":"2412.01292","paper":"/paper/lscenellm-enhancing-large-3d-scene","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","date":"2024-12-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Hoyyyaard/LSceneLLM","path":"models/modeling_llama.py","file_url":"https://github.com/Hoyyyaard/LSceneLLM/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2412.00129","paper":"/paper/scaling-particle-collision-data-analysis","title":"Scaling Particle Collision Data Analysis","date":"2024-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"supersymmetry-technologies/bbt-neutron","path":"model/modeling_binbbt.py","file_url":"https://github.com/supersymmetry-technologies/bbt-neutron/blob/HEAD/model/modeling_binbbt.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0ad8d888b1eb9c46","mcp_get_code":{"code_sha256":"0ad8d888b1eb9c46"}},{"arxiv_id":"2411.17465","paper":"/paper/showui-one-vision-language-action-model-for","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","date":"2024-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"showlab/showui","path":"model/showui/modeling_showui.py","file_url":"https://github.com/showlab/showui/blob/HEAD/model/showui/modeling_showui.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2411.16085","paper":"/paper/cautious-optimizers-improving-training-with","title":"Cautious Optimizers: Improving Training with One Line of Code","date":"2024-11-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kyleliang919/c-optim","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/kyleliang919/c-optim/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2411.09502","paper":"/paper/golden-noise-for-diffusion-models-a-learning","title":"Golden Noise for Diffusion Models: A Learning Framework","date":"2024-11-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xie-lab-ml/golden-noise-for-diffusion-models","path":"training/trainer/models/cross_modeling.py","file_url":"https://github.com/xie-lab-ml/golden-noise-for-diffusion-models/blob/HEAD/training/trainer/models/cross_modeling.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fdd93453f92f9167","mcp_get_code":{"code_sha256":"fdd93453f92f9167"}},{"arxiv_id":"2411.07837","paper":"/paper/frugal-memory-efficient-optimization-by","title":"FRUGAL: Memory-Efficient Optimization by Reducing State Overhead for Scalable Training","date":"2024-11-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fzmushko/frugal","path":"utils/modeling_llama.py","file_url":"https://github.com/fzmushko/frugal/blob/HEAD/utils/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2411.04996","paper":"/paper/mixture-of-transformers-a-sparse-and-scalable","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","date":"2024-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"allenzren/open-pi-zero","path":"src/model/utils.py","file_url":"https://github.com/allenzren/open-pi-zero/blob/HEAD/src/model/utils.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"2411.04168","paper":"/paper/dimsum-diffusion-mamba-a-scalable-and-unified","title":"DiMSUM: Diffusion Mamba -- A Scalable and Unified Spatial-Frequency Method for Image Generation","date":"2024-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vinairesearch/dimsum","path":"dimsum/rope.py","file_url":"https://github.com/vinairesearch/dimsum/blob/HEAD/dimsum/rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2411.02335","paper":"/paper/sparsing-law-towards-large-language-models","title":"Sparsing Law: Towards Large Language Models with Greater Activation Sparsity","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thunlp/SparsingLaw","path":"src/model/modeling_minicpm.py","file_url":"https://github.com/thunlp/SparsingLaw/blob/HEAD/src/model/modeling_minicpm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2411.02280","paper":"/paper/the-llm-language-network-a-neuroscientific","title":"The LLM Language Network: A Neuroscientific Approach for Identifying Causally Task-Relevant Units","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bkhmsi/llm-localization","path":"models/modeling_falcon.py","file_url":"https://github.com/bkhmsi/llm-localization/blob/HEAD/models/modeling_falcon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2411.02063","paper":"/paper/scalable-efficient-training-of-large-language","title":"Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsinghuac3i/lpa","path":"architecture/lpa_setting2.py","file_url":"https://github.com/tsinghuac3i/lpa/blob/HEAD/architecture/lpa_setting2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2410.22949","paper":"/paper/mutaplm-protein-language-modeling-for","title":"MutaPLM: Protein Language Modeling for Mutation Explanation and Engineering","date":"2024-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PharMolix/MutaPLM","path":"model/modeling_esm.py","file_url":"https://github.com/PharMolix/MutaPLM/blob/HEAD/model/modeling_esm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"704421799bb183d3","mcp_get_code":{"code_sha256":"704421799bb183d3"}},{"arxiv_id":"2410.18715","paper":"/paper/chatsearch-a-dataset-and-a-generative","title":"ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval","date":"2024-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"joez17/chatsearch","path":"emu_models/rope.py","file_url":"https://github.com/joez17/chatsearch/blob/HEAD/emu_models/rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2410.18517","paper":"/paper/kvsharer-efficient-inference-via-layer-wise","title":"KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing","date":"2024-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yangyifei729/kvsharer","path":"internlm2_real_share/modeling_internlm2_kvsharer.py","file_url":"https://github.com/yangyifei729/kvsharer/blob/HEAD/internlm2_real_share/modeling_internlm2_kvsharer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.17897","paper":"/paper/value-residual-learning-for-alleviating","title":"Value Residual Learning For Alleviating Attention Concentration In Transformers","date":"2024-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Zcchill/Value-Residual-Learning","path":"src/modeling/modeling_llama_NeuTRENO_lambda04.py","file_url":"https://github.com/Zcchill/Value-Residual-Learning/blob/HEAD/src/modeling/modeling_llama_NeuTRENO_lambda04.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.17891","paper":"/paper/scaling-diffusion-language-models-via","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","date":"2024-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HKUNLP/DiffuLLaMA","path":"DiffuLLaMA-training/model_llama.py","file_url":"https://github.com/HKUNLP/DiffuLLaMA/blob/HEAD/DiffuLLaMA-training/model_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.17247","paper":"/paper/pyramiddrop-accelerating-your-large-vision","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.16179","paper":"/paper/magicpig-lsh-sampling-for-efficient-llm","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","date":"2024-10-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"infini-ai-lab/magicpig","path":"models/utils.py","file_url":"https://github.com/infini-ai-lab/magicpig/blob/HEAD/models/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2410.14411","paper":"/paper/snac-multi-scale-neural-audio-codec","title":"SNAC: Multi-Scale Neural Audio Codec","date":"2024-10-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hubertsiuzdak/snac","path":"snac/attention.py","file_url":"https://github.com/hubertsiuzdak/snac/blob/HEAD/snac/attention.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1147383164fd3a66","mcp_get_code":{"code_sha256":"1147383164fd3a66"}},{"arxiv_id":"2410.13708","paper":"/paper/on-the-role-of-attention-heads-in-large","title":"On the Role of Attention Heads in Large Language Model Safety","date":"2024-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ydyjya/SafetyHeadAttribution","path":"lib/utils/custommodel.py","file_url":"https://github.com/ydyjya/SafetyHeadAttribution/blob/HEAD/lib/utils/custommodel.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2410.12299","paper":"/paper/semantics-adaptive-activation-intervention","title":"Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors","date":"2024-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weixuan-wang123/SADI","path":"modeling_llama.py","file_url":"https://github.com/weixuan-wang123/SADI/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.11988","paper":"/paper/disp-llm-dimension-independent-structural","title":"DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.11842","paper":"/paper/moh-multi-head-attention-as-mixture-of-head","title":"MoH: Multi-Head Attention as Mixture-of-Head Attention","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.11289","paper":"/paper/subspace-optimization-for-large-language","title":"Subspace Optimization for Large Language Models with Convergence Guarantees","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pkumelon/Golore","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/pkumelon/Golore/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.10814","paper":"/paper/your-mixture-of-experts-llm-is-secretly-an","title":"Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.10812","paper":"/paper/hart-efficient-visual-generation-with-hybrid","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mit-han-lab/hart","path":"hart/modules/networks/basic_hart.py","file_url":"https://github.com/mit-han-lab/hart/blob/HEAD/hart/modules/networks/basic_hart.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2410.10450","paper":"/paper/kblam-knowledge-base-augmented-language-model","title":"KBLaM: Knowledge Base augmented Language Model","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"microsoft/KBLaM","path":"src/kblam/models/phi3_model.py","file_url":"https://github.com/microsoft/KBLaM/blob/HEAD/src/kblam/models/phi3_model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.10343","paper":"/paper/locking-down-the-finetuned-llms-safety","title":"Locking Down the Finetuned LLMs Safety","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhu-minjun/safetylock","path":"safetylock/model_utils/modeling_llama.py","file_url":"https://github.com/zhu-minjun/safetylock/blob/HEAD/safetylock/model_utils/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.09760","paper":"/paper/targeted-vaccine-safety-alignment-for-large","title":"Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation","date":"2024-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lslland/t-vaccine","path":"models/modeling_gemma2_my.py","file_url":"https://github.com/lslland/t-vaccine/blob/HEAD/models/modeling_gemma2_my.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.08989","paper":"/paper/subzero-random-subspace-zeroth-order","title":"Zeroth-Order Fine-Tuning of LLMs in Random Subspaces","date":"2024-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zimingyy/subzero","path":"large_models/modeling_llama.py","file_url":"https://github.com/zimingyy/subzero/blob/HEAD/large_models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.08417","paper":"/paper/bilinear-mlps-enable-weight-based-mechanistic","title":"Bilinear MLPs enable weight-based mechanistic interpretability","date":"2024-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tdooms/bilinear-decomposition","path":"src/language/transformer.py","file_url":"https://github.com/tdooms/bilinear-decomposition/blob/HEAD/src/language/transformer.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2410.07348","paper":"/paper/moe-accelerating-mixture-of-experts-methods","title":"MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.06169","paper":"/paper/quadratic-is-not-what-you-need-for-multimodal","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","date":"2024-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZhangAIPI/YOPO_MLLM_Pruning","path":"modeling_llama_prune.py","file_url":"https://github.com/ZhangAIPI/YOPO_MLLM_Pruning/blob/HEAD/modeling_llama_prune.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.06154","paper":"/paper/glov-guided-large-language-models-as-implicit","title":"GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models","date":"2024-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jmiemirza/glov","path":"modeling_llama.py","file_url":"https://github.com/jmiemirza/glov/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2410.05714","paper":"/paper/enhancing-temporal-modeling-of-video-llms-via","title":"Enhancing Temporal Modeling of Video LLMs via Time Gating","date":"2024-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lavi-lab/tg-vid","path":"stllm/models/modeling_llama_mem.py","file_url":"https://github.com/lavi-lab/tg-vid/blob/HEAD/stllm/models/modeling_llama_mem.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.05357","paper":"/paper/model-glue-democratized-llm-scaling-for-a","title":"Model-GLUE: Democratized LLM Scaling for A Large Model Zoo in the Wild","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Model-GLUE/Model-GLUE","path":"mixture/mixtral_model_level/modeling_mixtral_model_level_hybrid.py","file_url":"https://github.com/Model-GLUE/Model-GLUE/blob/HEAD/mixture/mixtral_model_level/modeling_mixtral_model_level_hybrid.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.05076","paper":"/paper/tidaldecode-fast-and-accurate-llm-decoding","title":"TidalDecode: Fast and Accurate LLM Decoding with Position Persistent Sparse Attention","date":"2024-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DerrickYLJ/TidalDecode","path":"src/models/llama_tidaldecoding.py","file_url":"https://github.com/DerrickYLJ/TidalDecode/blob/HEAD/src/models/llama_tidaldecoding.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.01380","paper":"/paper/knowledge-entropy-decay-during-language-model","title":"Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition","date":"2024-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kaistAI/Knowledge-Entropy","path":"analysis/modeling_olmo_hf.py","file_url":"https://github.com/kaistAI/Knowledge-Entropy/blob/HEAD/analysis/modeling_olmo_hf.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2410.00255","paper":"/paper/robin3d-improving-3d-large-language-model-via","title":"Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning","date":"2024-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weitaikang/robin3d","path":"models/modeling_llama.py","file_url":"https://github.com/weitaikang/robin3d/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2409.19134","paper":"/paper/confidential-prompting-protecting-user","title":"Confidential Prompting: Protecting User Prompts from Cloud LLM Providers","date":"2024-09-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yale-sys/confidential-prompting","path":"llama.py","file_url":"https://github.com/yale-sys/confidential-prompting/blob/HEAD/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2409.18869","paper":"/paper/emu3-next-token-prediction-is-all-you-need","title":"Emu3: Next-Token Prediction is All You Need","date":"2024-09-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baaivision/emu3","path":"emu3/mllm/modeling_emu3.py","file_url":"https://github.com/baaivision/emu3/blob/HEAD/emu3/mllm/modeling_emu3.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2409.17504","paper":"/paper/haloscope-harnessing-unlabeled-llm","title":"HaloScope: Harnessing Unlabeled LLM Generations for Hallucination Detection","date":"2024-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deeplearning-wisc/haloscope","path":"llama_iti/modeling_llama.py","file_url":"https://github.com/deeplearning-wisc/haloscope/blob/HEAD/llama_iti/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2409.16040","paper":"/paper/time-moe-billion-scale-time-series-foundation","title":"Time-MoE: Billion-Scale Time Series Foundation Models with Mixture of Experts","date":"2024-09-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Time-MoE/Time-MoE","path":"time_moe/models/modeling_time_moe.py","file_url":"https://github.com/Time-MoE/Time-MoE/blob/HEAD/time_moe/models/modeling_time_moe.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2409.15355","paper":"/paper/block-attention-for-efficient-rag","title":"Block-Attention for Efficient RAG","date":"2024-09-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"temporarylora/block-attention","path":"server/block_generate_server.py","file_url":"https://github.com/temporarylora/block-attention/blob/HEAD/server/block_generate_server.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"be9b02c5fb845efa","mcp_get_code":{"code_sha256":"be9b02c5fb845efa"}},{"arxiv_id":"2409.14144","paper":"/paper/2409-14144","title":"Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis","date":"2024-09-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zepingyu0512/arithmetic-mechanism","path":"modeling_llama.py","file_url":"https://github.com/zepingyu0512/arithmetic-mechanism/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2409.09808","paper":"/paper/famba-v-fast-vision-mamba-with-cross-layer","title":"Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion","date":"2024-09-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aiot-mlsys-lab/famba-v","path":"fambav/rope.py","file_url":"https://github.com/aiot-mlsys-lab/famba-v/blob/HEAD/fambav/rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2409.01193","paper":"/paper/clibe-detecting-dynamic-backdoors-in","title":"CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models","date":"2024-09-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"raytsang123/clibe","path":"generative_backdoors/detection/modeling_gpt_neox.py","file_url":"https://github.com/raytsang123/clibe/blob/HEAD/generative_backdoors/detection/modeling_gpt_neox.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.16967","paper":"/paper/memlong-memory-augmented-retrieval-for-long","title":"MemLong: Memory-Augmented Retrieval for Long Text Modeling","date":"2024-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bui1dmysea/memlong","path":"eval/icl/MemLong/modeling_llama.py","file_url":"https://github.com/bui1dmysea/memlong/blob/HEAD/eval/icl/MemLong/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.12857","paper":"/paper/memory-efficient-llm-training-with-online","title":"Memory-Efficient LLM Training with Online Subspace Descent","date":"2024-08-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kyleliang919/online-subspace-descent","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/kyleliang919/online-subspace-descent/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.11779","paper":"/paper/personality-alignment-of-large-language","title":"Personality Alignment of Large Language Models","date":"2024-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhu-minjun/PAlign","path":"PAlign/modeling_llama.py","file_url":"https://github.com/zhu-minjun/PAlign/blob/HEAD/PAlign/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.11363","paper":"/paper/proteingpt-multimodal-llm-for-protein","title":"ProteinGPT: Multimodal LLM for Protein Property Prediction and Structure Understanding","date":"2024-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ProteinGPT/ProteinGPT","path":"src/esm/rotary_embedding.py","file_url":"https://github.com/ProteinGPT/ProteinGPT/blob/HEAD/src/esm/rotary_embedding.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2408.11051","paper":"/paper/flame-learning-to-navigate-with-multimodal","title":"FLAME: Learning to Navigate with Multimodal LLM in Urban Environments","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xyz9911/FLAME","path":"llm_nav/model/llama_xformer.py","file_url":"https://github.com/xyz9911/FLAME/blob/HEAD/llm_nav/model/llama_xformer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.10943","paper":"/paper/sysbench-can-large-language-models-follow","title":"SysBench: Can Large Language Models Follow System Messages?","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pku-baichuan-mlsystemlab/sysbench","path":"attenscore/modeling_llama.py","file_url":"https://github.com/pku-baichuan-mlsystemlab/sysbench/blob/HEAD/attenscore/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.02657","paper":"/paper/2408-02657","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","date":"2024-08-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alpha-vllm/lumina-mgpt","path":"lumina_mgpt/model/chameleon/modeling_chameleon.py","file_url":"https://github.com/alpha-vllm/lumina-mgpt/blob/HEAD/lumina_mgpt/model/chameleon/modeling_chameleon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.02032","paper":"/paper/2408-02032","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","date":"2024-08-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.00264","paper":"/paper/clover-2-accurate-inference-for-regressive","title":"Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiaoBin1992/clover","path":"clover/modeling_eagle.py","file_url":"https://github.com/XiaoBin1992/clover/blob/HEAD/clover/modeling_eagle.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2408.00264","paper":"/paper/clover-2-accurate-inference-for-regressive","title":"Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiaoBin1992/clover","path":"clover/model/clover2.py","file_url":"https://github.com/XiaoBin1992/clover/blob/HEAD/clover/model/clover2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2408.00264","paper":"/paper/clover-2-accurate-inference-for-regressive","title":"Clover-2: Accurate Inference for Regressive Lightweight Speculative Decoding","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XiaoBin1992/clover","path":"clover/model/modeling_llama_kv.py","file_url":"https://github.com/XiaoBin1992/clover/blob/HEAD/clover/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2407.16574","paper":"/paper/tlcr-token-level-continuous-reward-for-fine","title":"TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback","date":"2024-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"esyoon7/rlhf-tlcr","path":"utils/model/reward_model.py","file_url":"https://github.com/esyoon7/rlhf-tlcr/blob/HEAD/utils/model/reward_model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2407.16286","paper":"/paper/a-deeper-look-at-depth-pruning-of-llms","title":"A deeper look at depth pruning of LLMs","date":"2024-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shoaibahmed/llm_depth_pruning","path":"block_influence/llama_model.py","file_url":"https://github.com/shoaibahmed/llm_depth_pruning/blob/HEAD/block_influence/llama_model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2407.14207","paper":"/paper/longhorn-state-space-models-are-amortized","title":"Longhorn: State Space Models are Amortized Online Learners","date":"2024-07-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Cranial-XIX/longhorn","path":"models/llama.py","file_url":"https://github.com/Cranial-XIX/longhorn/blob/HEAD/models/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"08213c6683993d3b","mcp_get_code":{"code_sha256":"08213c6683993d3b"}},{"arxiv_id":"2407.12665","paper":"/paper/patch-level-training-for-large-language","title":"Beyond Next Token Prediction: Patch-Level Training for Large Language Models","date":"2024-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shaochenze/PatchTrain","path":"modeling_llama.py","file_url":"https://github.com/shaochenze/PatchTrain/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2407.08683","paper":"/paper/seed-story-multimodal-long-story-generation","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tencentarc/seed-story","path":"src/models_clm/modeling_llama_4_35.py","file_url":"https://github.com/tencentarc/seed-story/blob/HEAD/src/models_clm/modeling_llama_4_35.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2407.08608","paper":"/paper/flashattention-3-fast-and-accurate-attention","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dao-ailab/flash-attention","path":"flash_attn/layers/rotary.py","file_url":"https://github.com/dao-ailab/flash-attention/blob/HEAD/flash_attn/layers/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"163292f43a3c861b","mcp_get_code":{"code_sha256":"163292f43a3c861b"}},{"arxiv_id":"2407.08296","paper":"/paper/q-galore-quantized-galore-with-int4","title":"Q-GaLore: Quantized GaLore with INT4 Projection and Layer-Adaptive Low-Rank Gradients","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VITA-Group/Q-GaLore","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/VITA-Group/Q-GaLore/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2407.07093","paper":"/paper/fbi-llm-scaling-up-fully-binarized-llms-from","title":"FBI-LLM: Scaling Up Fully Binarized LLMs from Scratch via Autoregressive Distillation","date":"2024-07-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liqunma/fbi-llm","path":"model_utils/modeling_llama.py","file_url":"https://github.com/liqunma/fbi-llm/blob/HEAD/model_utils/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2407.06581","paper":"/paper/vision-language-models-are-blind","title":"Vision language models are blind: Failing to translate detailed visual features into words","date":"2024-07-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anguyen8/vision-llms-are-blind","path":"src/LinearProbe/Phi3.5/modeling_phi3_v.py","file_url":"https://github.com/anguyen8/vision-llms-are-blind/blob/HEAD/src/LinearProbe/Phi3.5/modeling_phi3_v.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2407.06426","paper":"/paper/debunc-mitigating-hallucinations-in-large","title":"DebUnc: Improving Large Language Model Agent Communication With Uncertainty Metrics","date":"2024-07-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lukeyoffe/debunc","path":"src/models/modeling_llama.py","file_url":"https://github.com/lukeyoffe/debunc/blob/HEAD/src/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2407.04620","paper":"/paper/learning-to-learn-at-test-time-rnns-with","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","date":"2024-07-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2407.01851","paper":"/paper/meerkat-audio-visual-large-language-model-for","title":"Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time","date":"2024-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"schowdhury671/meerkat","path":"modeling.py","file_url":"https://github.com/schowdhury671/meerkat/blob/HEAD/modeling.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2406.19707","paper":"/paper/infinigen-efficient-generative-inference-of","title":"InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"snu-comparch/infinigen","path":"accuracy/src/modeling_llama_orig.py","file_url":"https://github.com/snu-comparch/infinigen/blob/HEAD/accuracy/src/modeling_llama_orig.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.19598","paper":"/paper/mixture-of-in-context-experts-enhance-llms","title":"Mixture of In-Context Experts Enhance LLMs' Long Context Awareness","date":"2024-06-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2406.18200","paper":"/paper/seed-accelerating-reasoning-tree-construction","title":"SEED: Accelerating Reasoning Tree Construction via Scheduled Speculative Decoding","date":"2024-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Linking-ai/SEED","path":"src/llama_tree_attn/modeling_llama.py","file_url":"https://github.com/Linking-ai/SEED/blob/HEAD/src/llama_tree_attn/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.17276","paper":"/paper/opt-tree-speculative-decoding-with-adaptive","title":"OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jikai0wang/opt-tree","path":"opt_eagle/cnets.py","file_url":"https://github.com/jikai0wang/opt-tree/blob/HEAD/opt_eagle/cnets.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.17276","paper":"/paper/opt-tree-speculative-decoding-with-adaptive","title":"OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jikai0wang/opt-tree","path":"opt_classic/modeling_llama_kv.py","file_url":"https://github.com/jikai0wang/opt-tree/blob/HEAD/opt_classic/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2406.15765","paper":"/paper/unveiling-and-harnessing-hidden-attention","title":"Unveiling and Harnessing Hidden Attention Sinks: Enhancing Large Language Models without Training through Attention Calibration","date":"2024-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gatech-eic/act","path":"models/modelling_llama.py","file_url":"https://github.com/gatech-eic/act/blob/HEAD/models/modelling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.14898","paper":"/paper/safely-learning-with-private-data-a-federated","title":"Safely Learning with Private Data: A Federated Learning Framework for Large Language Model","date":"2024-06-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TAP-LLM/SplitFedLLM","path":"Fed-Llama-module/client/modeling_llama_A.py","file_url":"https://github.com/TAP-LLM/SplitFedLLM/blob/HEAD/Fed-Llama-module/client/modeling_llama_A.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2406.14556","paper":"/paper/asynchronous-large-language-model-enhanced","title":"Asynchronous Large Language Model Enhanced Planner for Autonomous Driving","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"memberRE/AsyncDriver","path":"llama2/model.py","file_url":"https://github.com/memberRE/AsyncDriver/blob/HEAD/llama2/model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.14496","paper":"/paper/african-or-european-swallow-benchmarking","title":"African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gregor-ge/FOCI-Benchmark","path":"benchmark/model/model_internlm_xcomposer2.py","file_url":"https://github.com/gregor-ge/FOCI-Benchmark/blob/HEAD/benchmark/model/model_internlm_xcomposer2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.14144","paper":"/paper/finding-safety-neurons-in-large-language","title":"Finding Safety Neurons in Large Language Models","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"THU-KEG/SafetyNeuron","path":"src/models/HookedGemma.py","file_url":"https://github.com/THU-KEG/SafetyNeuron/blob/HEAD/src/models/HookedGemma.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.13233","paper":"/paper/adamoe-token-adaptive-routing-with-null","title":"AdaMoE: Token-Adaptive Routing with Null Experts for Mixture-of-Experts Language Models","date":"2024-06-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cengzihao/adamoe","path":"exp_1/src/mola_modeling_llama_hacked.py","file_url":"https://github.com/cengzihao/adamoe/blob/HEAD/exp_1/src/mola_modeling_llama_hacked.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.12384","paper":"/paper/vrsbench-a-versatile-vision-language","title":"VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lavender105/rsgpt","path":"rsgpt/models/modeling_llama.py","file_url":"https://github.com/lavender105/rsgpt/blob/HEAD/rsgpt/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.12246","paper":"/paper/trol-traversal-of-layers-for-large-language","title":"TroL: Traversal of Layers for Large Language and Vision Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byungkwanlee/trol","path":"trol/arch_internlm2/modeling_internlm2.py","file_url":"https://github.com/byungkwanlee/trol/blob/HEAD/trol/arch_internlm2/modeling_internlm2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.11839","paper":"/paper/mdpo-conditional-preference-optimization-for","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luka-group/mDPO","path":"bunny/modeling_bunny_phi.py","file_url":"https://github.com/luka-group/mDPO/blob/HEAD/bunny/modeling_bunny_phi.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.11256","paper":"/paper/dynamic-data-mixing-maximizes-instruction","title":"Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts","date":"2024-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"spico197/moe-sft","path":"src/models/llama_moe/modeling_llama_moe.py","file_url":"https://github.com/spico197/moe-sft/blob/HEAD/src/models/llama_moe/modeling_llama_moe.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.10391","paper":"/paper/beacon-benchmark-for-comprehensive-rna-tasks","title":"BEACON: Benchmark for Comprehensive RNA Tasks and Language Models","date":"2024-06-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"terry-r123/RNABenchmark","path":"model/modeling_utils.py","file_url":"https://github.com/terry-r123/RNABenchmark/blob/HEAD/model/modeling_utils.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2406.10056","paper":"/paper/uniaudio-1-5-large-language-model-driven","title":"UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner","date":null,"month_inferred_from_arxiv_id":"2024-06","title_source":"archive","repo":"yangdongchao/llm-codec","path":"codec/attention.py","file_url":"https://github.com/yangdongchao/llm-codec/blob/HEAD/codec/attention.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1147383164fd3a66","mcp_get_code":{"code_sha256":"1147383164fd3a66"}},{"arxiv_id":"2406.09416","paper":"/paper/alleviating-distortion-in-image-generation","title":"Alleviating Distortion in Image Generation via Multi-Resolution Diffusion Models and Time-Dependent Layer Normalization","date":"2024-06-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qihao067/DiMR","path":"libs/core/axial_rope.py","file_url":"https://github.com/qihao067/DiMR/blob/HEAD/libs/core/axial_rope.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a098b5566baeb748","mcp_get_code":{"code_sha256":"a098b5566baeb748"}},{"arxiv_id":"2406.05644","paper":"/paper/how-alignment-and-jailbreak-work-explain-llm","title":"How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States","date":"2024-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ydyjya/llm-ihs-explanation","path":"resource/modeling_llama.py","file_url":"https://github.com/ydyjya/llm-ihs-explanation/blob/HEAD/resource/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.05317","paper":"/paper/lococo-dropping-in-convolutions-for-long","title":"LoCoCo: Dropping In Convolutions for Long Context Compression","date":"2024-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VITA-Group/LoCoCo","path":"llama/modeling_llama.py","file_url":"https://github.com/VITA-Group/LoCoCo/blob/HEAD/llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.05317","paper":"/paper/lococo-dropping-in-convolutions-for-long","title":"LoCoCo: Dropping In Convolutions for Long Context Compression","date":"2024-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VITA-Group/LoCoCo","path":"llama/modeling_flax_llama.py","file_url":"https://github.com/VITA-Group/LoCoCo/blob/HEAD/llama/modeling_flax_llama.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6b3f1075d5cc01c4","mcp_get_code":{"code_sha256":"6b3f1075d5cc01c4"}},{"arxiv_id":"2406.03736","paper":"/paper/your-absorbing-discrete-diffusion-secretly","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","date":"2024-06-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ml-gsai/radd","path":"model/rotary.py","file_url":"https://github.com/ml-gsai/radd/blob/HEAD/model/rotary.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8526ce179df04bd4","mcp_get_code":{"code_sha256":"8526ce179df04bd4"}},{"arxiv_id":"2406.03386","paper":"/paper/learning-long-range-dependencies-on-graphs","title":"Learning Long Range Dependencies on Graphs via Random Walks","date":"2024-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"borgwardtlab/neuralwalker","path":"neuralwalker/modules/rotary_embedding.py","file_url":"https://github.com/borgwardtlab/neuralwalker/blob/HEAD/neuralwalker/modules/rotary_embedding.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2406.03210","paper":"/paper/text-like-encoding-of-collaborative","title":"Text-like Encoding of Collaborative Information in Large Language Models for Recommendation","date":"2024-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zyang1580/binllm","path":"minigpt4/models/modeling_llama.py","file_url":"https://github.com/zyang1580/binllm/blob/HEAD/minigpt4/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.02536","paper":"/paper/mitigate-position-bias-in-large-language","title":"Mitigate Position Bias in Large Language Models via Scaling a Single Dimension","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PositionalHidden/PositionalHidden","path":"positional_hidden/models/modeling_gemma_hidden_scale.py","file_url":"https://github.com/PositionalHidden/PositionalHidden/blob/HEAD/positional_hidden/models/modeling_gemma_hidden_scale.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.02214","paper":"/paper/sltrain-a-sparse-plus-low-rank-approach-for","title":"SLTrain: a sparse plus low-rank approach for parameter and memory efficient pretraining","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"andyjm3/SLTrain","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/andyjm3/SLTrain/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.01917","paper":"/paper/gomaa-geo-goal-modality-agnostic-active-geo","title":"GOMAA-Geo: GOal Modality Agnostic Active Geo-localization","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mvrl/gomaa-geo","path":"models/model_falcon.py","file_url":"https://github.com/mvrl/gomaa-geo/blob/HEAD/models/model_falcon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2406.01574","paper":"/paper/mmlu-pro-a-more-robust-and-challenging-multi","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","date":"2024-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wenlai-lavine/jola","path":"jola/modeling_llama.py","file_url":"https://github.com/wenlai-lavine/jola/blob/HEAD/jola/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.20971","paper":"/paper/amortizing-intractable-inference-in-diffusion","title":"Amortizing intractable inference in diffusion models for vision, language, and control","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gfnorg/diffusion-finetuning","path":"diffusion_lm/model/rotary.py","file_url":"https://github.com/gfnorg/diffusion-finetuning/blob/HEAD/diffusion_lm/model/rotary.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8526ce179df04bd4","mcp_get_code":{"code_sha256":"8526ce179df04bd4"}},{"arxiv_id":"2405.20763","paper":"/paper/improving-generalization-and-convergence-by","title":"Improving Generalization and Convergence by Enhancing Implicit Regularization","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wmz9/IRE-algorithm-framework","path":"NLP/LLM/modelling_llama_new.py","file_url":"https://github.com/wmz9/IRE-algorithm-framework/blob/HEAD/NLP/LLM/modelling_llama_new.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.17894","paper":"/paper/white-box-multimodal-jailbreaks-against-large","title":"White-box Multimodal Jailbreaks Against Large Vision-Language Models","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"roywang021/UMK","path":"minigpt4/models/modeling_llama.py","file_url":"https://github.com/roywang021/UMK/blob/HEAD/minigpt4/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.16886","paper":"/paper/hawk-learning-to-understand-open-world-video","title":"Hawk: Learning to Understand Open-World Video Anomalies","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jqtangust/hawk","path":"hawk/models/modeling_llama.py","file_url":"https://github.com/jqtangust/hawk/blob/HEAD/hawk/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.16406","paper":"/paper/spinquant-llm-quantization-with-learned","title":"SpinQuant: LLM quantization with learned rotations","date":"2024-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/SpinQuant","path":"eval_utils/modeling_llama.py","file_url":"https://github.com/facebookresearch/SpinQuant/blob/HEAD/eval_utils/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.15574","paper":"/paper/meteor-mamba-based-traversal-of-rationale-for","title":"Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byungkwanlee/meteor","path":"meteor/arch/modeling_internlm2.py","file_url":"https://github.com/byungkwanlee/meteor/blob/HEAD/meteor/arch/modeling_internlm2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.14488","paper":"/paper/mogu-a-framework-for-enhancing-safety-of-open","title":"MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.14256","paper":"/paper/zipcache-accurate-and-efficient-kv-cache","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thisisbillhe/zipcache","path":"zipcache/models/modeling_llama.py","file_url":"https://github.com/thisisbillhe/zipcache/blob/HEAD/zipcache/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.14225","paper":"/paper/reactxt-understanding-molecular-reaction-ship","title":"ReactXT: Understanding Molecular \"Reaction-ship\" via Reaction-Contextualized Molecule-Text Pretraining","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"syr-cn/reactxt","path":"model/modeling_llama.py","file_url":"https://github.com/syr-cn/reactxt/blob/HEAD/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.13845","paper":"/paper/semantic-density-uncertainty-quantification","title":"Semantic Density: Uncertainty Quantification for Large Language Models through Confidence Measurement in Semantic Space","date":"2024-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cognizant-ai-labs/semantic-density-paper","path":"huggingface_replacement/modeling_llama2.py","file_url":"https://github.com/cognizant-ai-labs/semantic-density-paper/blob/HEAD/huggingface_replacement/modeling_llama2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.13053","paper":"/paper/meteora-multiple-tasks-embedded-lora-for","title":"MeteoRA: Multiple-tasks Embedded LoRA for Large Language Models","date":"2024-05-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"paragonlight/meteor-of-lora","path":"base_model/llama/modeling_llama_meteor.py","file_url":"https://github.com/paragonlight/meteor-of-lora/blob/HEAD/base_model/llama/modeling_llama_meteor.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.13053","paper":"/paper/meteora-multiple-tasks-embedded-lora-for","title":"MeteoRA: Multiple-tasks Embedded LoRA for Large Language Models","date":"2024-05-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"paragonlight/meteor-of-lora","path":"base_model/llama/modeling_flax_llama_meteor.py","file_url":"https://github.com/paragonlight/meteor-of-lora/blob/HEAD/base_model/llama/modeling_flax_llama_meteor.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6b3f1075d5cc01c4","mcp_get_code":{"code_sha256":"6b3f1075d5cc01c4"}},{"arxiv_id":"2405.12532","paper":"/paper/pyramidinfer-pyramid-kv-cache-compression-for","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","date":"2024-05-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.10370","paper":"/paper/grounded-3d-llm-with-referent-tokens","title":"Grounded 3D-LLM with Referent Tokens","date":"2024-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenRobotLab/Grounded_3D-LLM","path":"models/LLM/modeling_llama.py","file_url":"https://github.com/OpenRobotLab/Grounded_3D-LLM/blob/HEAD/models/LLM/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.10140","paper":"/paper/libra-building-decoupled-vision-system-on","title":"Libra: Building Decoupled Vision System on Large Language Models","date":"2024-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yifanxu74/libra","path":"libra/models/libra/modeling_libra.py","file_url":"https://github.com/yifanxu74/libra/blob/HEAD/libra/models/libra/modeling_libra.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.05803","paper":"/paper/boosting-multimodal-large-language-models","title":"Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lzhxmu/vtw","path":"LISA-VTW/my_modeling_llama.py","file_url":"https://github.com/lzhxmu/vtw/blob/HEAD/LISA-VTW/my_modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2405.03178","paper":"/paper/popdg-popular-3d-dance-generation-with","title":"POPDG: Popular 3D Dance Generation with PopDanceSet","date":null,"month_inferred_from_arxiv_id":"2024-05","title_source":"archive","repo":"Luke-Luo1/POPDG","path":"model/rotary_embedding_torch.py","file_url":"https://github.com/Luke-Luo1/POPDG/blob/HEAD/model/rotary_embedding_torch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2407.00002","paper":"/paper/protein-property-prediction-with","title":"Kermut: Composite kernel regression for protein variant effects","date":"2024-04-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OATML-Markslab/ProteinGym","path":"proteingym/baselines/rita/rita_modeling.py","file_url":"https://github.com/OATML-Markslab/ProteinGym/blob/HEAD/proteingym/baselines/rita/rita_modeling.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2502f906145be7f6","mcp_get_code":{"code_sha256":"2502f906145be7f6"}},{"arxiv_id":"2404.18911","paper":"/paper/kangaroo-lossless-self-speculative-decoding","title":"Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting","date":"2024-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Equationliu/Kangaroo","path":"kangaroo/adapter.py","file_url":"https://github.com/Equationliu/Kangaroo/blob/HEAD/kangaroo/adapter.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.18202","paper":"/paper/worldgpt-empowering-llm-as-multimodal-world","title":"WorldGPT: Empowering LLM as Multimodal World Model","date":"2024-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dcdmllm/worldgpt","path":"model/modeling_llama.py","file_url":"https://github.com/dcdmllm/worldgpt/blob/HEAD/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.17176","paper":"/paper/moviechat-question-aware-sparse-memory-for","title":"MovieChat+: Question-aware Sparse Memory for Long Video Question Answering","date":"2024-04-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rese1f/MovieChat","path":"MovieChat/models/modeling_llama.py","file_url":"https://github.com/rese1f/MovieChat/blob/HEAD/MovieChat/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.16109","paper":"/paper/zkllm-zero-knowledge-proofs-for-large","title":"zkLLM: Zero Knowledge Proofs for Large Language Models","date":"2024-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jvhs0706/zkllm-ccs2024","path":"llama-self-attn.py","file_url":"https://github.com/jvhs0706/zkllm-ccs2024/blob/HEAD/llama-self-attn.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2404.15574","paper":"/paper/retrieval-head-mechanistically-explains-long","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","date":"2024-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nightdessert/retrieval_head","path":"faiss_attn/source/modeling_llama.py","file_url":"https://github.com/nightdessert/retrieval_head/blob/HEAD/faiss_attn/source/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.14966","paper":"/paper/mamba3d-enhancing-local-features-for-3d-point","title":"Mamba3D: Enhancing Local Features for 3D Point Cloud Analysis via State Space Model","date":"2024-04-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xhanxu/Mamba3D","path":"models/rope.py","file_url":"https://github.com/xhanxu/Mamba3D/blob/HEAD/models/rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2404.12362","paper":"/paper/transformer-tricks-removing-weights-for","title":"Transformer tricks: Removing weights for skipless transformers","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openmachine-ai/transformer-tricks","path":"flashNorm_modeling_llama.py","file_url":"https://github.com/openmachine-ai/transformer-tricks/blob/HEAD/flashNorm_modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.12096","paper":"/paper/longembed-extending-embedding-models-for-long","title":"LongEmbed: Extending Embedding Models for Long Context Retrieval","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dwzhu-pku/longembed","path":"src/modeling_e5rope.py","file_url":"https://github.com/dwzhu-pku/longembed/blob/HEAD/src/modeling_e5rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.11912","paper":"/paper/triforce-lossless-acceleration-of-long","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","date":"2024-04-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Infini-AI-Lab/TriForce","path":"models/modeling_llama_68m.py","file_url":"https://github.com/Infini-AI-Lab/TriForce/blob/HEAD/models/modeling_llama_68m.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2404.10710","paper":"/paper/dual-modalities-of-text-visual-and-textual","title":"Autoregressive Pre-Training on Pixels and Texts","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.10464","paper":"/paper/destein-navigating-detoxification-of-language","title":"DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lizlizli/destein","path":"modeling/modeling_llama.py","file_url":"https://github.com/lizlizli/destein/blob/HEAD/modeling/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.10308","paper":"/paper/hierarchical-context-merging-better-long","title":"Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMs","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alinlab/HOMER","path":"src/homer/modeling_llama.py","file_url":"https://github.com/alinlab/HOMER/blob/HEAD/src/homer/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.07470","paper":"/paper/scalable-language-model-with-generalized","title":"Scalable Language Model with Generalized Continual Learning","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pbihao/slm","path":"SLM-llama/models/llama.py","file_url":"https://github.com/pbihao/slm/blob/HEAD/SLM-llama/models/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.07413","paper":"/paper/jetmoe-reaching-llama2-performance-with-0-1m","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.07143","paper":"/paper/leave-no-context-behind-efficient-infinite","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","date":"2024-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Beomi/InfiniTransformer","path":"modeling_gemma.py","file_url":"https://github.com/Beomi/InfiniTransformer/blob/HEAD/modeling_gemma.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.07143","paper":"/paper/leave-no-context-behind-efficient-infinite","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","date":"2024-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2404.04793","paper":"/paper/squeezeattention-2d-management-of-kv-cache-in","title":"SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget","date":"2024-04-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hetailang/squeezeattention","path":"modeling_llama.py","file_url":"https://github.com/hetailang/squeezeattention/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.04722","paper":"/paper/pollmgraph-unraveling-hallucinations-in-large","title":"PoLLMgraph: Unraveling Hallucinations in Large Language Models via State Transition Dynamics","date":"2024-04-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hitum-dev/pollmgraph","path":"pollmgraph/utils/llama/modeling_llama.py","file_url":"https://github.com/hitum-dev/pollmgraph/blob/HEAD/pollmgraph/utils/llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.02204","paper":"/paper/emergent-abilities-in-reduced-scale","title":"Emergent Abilities in Reduced-Scale Generative Language Models","date":"2024-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"text-machine-lab/mini_gpt","path":"src/modeling_llama.py","file_url":"https://github.com/text-machine-lab/mini_gpt/blob/HEAD/src/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2404.00308","paper":"/paper/st-llm-large-language-models-are-effective-1","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","date":"2024-03-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TencentARC/ST-LLM","path":"stllm/models/modeling_llama_mem.py","file_url":"https://github.com/TencentARC/ST-LLM/blob/HEAD/stllm/models/modeling_llama_mem.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.19928","paper":"/paper/dijiang-efficient-large-language-models","title":"DiJiang: Efficient Large Language Models through Compact Kernelization","date":"2024-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuchuantian/dijiang","path":"modeling/pythia-160M-dijiang/modeling_gpt_neox_dijiang.py","file_url":"https://github.com/yuchuantian/dijiang/blob/HEAD/modeling/pythia-160M-dijiang/modeling_gpt_neox_dijiang.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.17839","paper":"/paper/remamber-referring-image-segmentation-with","title":"ReMamber: Referring Image Segmentation with Mamba Twister","date":"2024-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yyh-rain-song/ReMamber","path":"vmamba_model/rope.py","file_url":"https://github.com/yyh-rain-song/ReMamber/blob/HEAD/vmamba_model/rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2403.17830","paper":"/paper/assessment-of-multimodal-large-language","title":"Assessment of Multimodal Large Language Models in Alignment with Human Values","date":"2024-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openlamm/lamm","path":"src/model/LAMM/modeling_llama.py","file_url":"https://github.com/openlamm/lamm/blob/HEAD/src/model/LAMM/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.10667","paper":"/paper/towards-unified-multi-modal-personalization","title":"Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond","date":"2024-03-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"weitianxin/UniMP","path":"UniMP/xformers_model/llama.py","file_url":"https://github.com/weitianxin/UniMP/blob/HEAD/UniMP/xformers_model/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.09629","paper":"/paper/quiet-star-language-models-can-teach","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ezelikman/quiet-star","path":"modeling_mistral.py","file_url":"https://github.com/ezelikman/quiet-star/blob/HEAD/modeling_mistral.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.08293","paper":"/paper/generative-pretrained-structured-transformers","title":"Generative Pretrained Structured Transformers: Unsupervised Syntactic Language Models at Scale","date":"2024-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alipay/StructuredLM_RTDT","path":"model/Llama_flash_attn.py","file_url":"https://github.com/alipay/StructuredLM_RTDT/blob/HEAD/model/Llama_flash_attn.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2403.07692","paper":"/paper/masked-autodecoder-is-effective-multi-task","title":"Masked AutoDecoder is Effective Multi-Task Vision Generalist","date":"2024-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hanqiu-hq/MAD","path":"projects/mad/model/utils.py","file_url":"https://github.com/hanqiu-hq/MAD/blob/HEAD/projects/mad/model/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2403.07652","paper":"/paper/harder-tasks-need-more-experts-dynamic","title":"Harder Tasks Need More Experts: Dynamic Routing in MoE Models","date":"2024-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.07508","paper":"/paper/moai-mixture-of-all-intelligence-for-large","title":"MoAI: Mixture of All Intelligence for Large Language and Vision Models","date":"2024-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByungKwanLee/MoAI","path":"moai/arch/modeling_internlm2.py","file_url":"https://github.com/ByungKwanLee/MoAI/blob/HEAD/moai/arch/modeling_internlm2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.05527","paper":"/paper/gear-an-efficient-kv-cache-compression","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","date":"2024-03-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengear-project/gear","path":"GenerationBench/GenerationTest/GEARLM/Simulated/modeling_llama_ablation.py","file_url":"https://github.com/opengear-project/gear/blob/HEAD/GenerationBench/GenerationTest/GEARLM/Simulated/modeling_llama_ablation.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2403.04945","paper":"/paper/electrocardiogram-instruction-tuning-for","title":"MEIT: Multi-Modal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aiot-mlsys-lab/meit","path":"ECG_LLMs/modeling_ecg_llama.py","file_url":"https://github.com/aiot-mlsys-lab/meit/blob/HEAD/ECG_LLMs/modeling_ecg_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2403.01590","paper":"/paper/the-hidden-attention-of-mamba-models","title":"The Hidden Attention of Mamba Models","date":"2024-03-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ameenali/hiddenmambaattn","path":"vim/rope.py","file_url":"https://github.com/ameenali/hiddenmambaattn/blob/HEAD/vim/rope.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2403.00813","paper":"/paper/urbangpt-spatio-temporal-large-language","title":"UrbanGPT: Spatio-Temporal Large Language Models","date":"2024-02-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hkuds/urbangpt","path":"urbangpt/model/monkey_patch_non_inplace.py","file_url":"https://github.com/hkuds/urbangpt/blob/HEAD/urbangpt/model/monkey_patch_non_inplace.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"62a553b3b2dcaca7","mcp_get_code":{"code_sha256":"62a553b3b2dcaca7"}},{"arxiv_id":"2403.00043","paper":"/paper/rinalmo-general-purpose-rna-language-models","title":"RiNALMo: General-Purpose RNA Language Models Can Generalize Well on Structure Prediction Tasks","date":"2024-02-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lbcb-sci/rinalmo","path":"rinalmo/model/rope.py","file_url":"https://github.com/lbcb-sci/rinalmo/blob/HEAD/rinalmo/model/rope.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2402.18815","paper":"/paper/how-do-large-language-models-handle","title":"How do Large Language Models Handle Multilingualism?","date":"2024-02-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/multilingual_analysis","path":"layers/transformers/models/modeling_llama.py","file_url":"https://github.com/damo-nlp-sg/multilingual_analysis/blob/HEAD/layers/transformers/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.16617","paper":"/paper/long-context-language-modeling-with-parallel","title":"Long-Context Language Modeling with Parallel Context Encoding","date":"2024-02-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"princeton-nlp/cepe","path":"modeling_llama_flash.py","file_url":"https://github.com/princeton-nlp/cepe/blob/HEAD/modeling_llama_flash.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.16061","paper":"/paper/how-large-language-models-encode-context","title":"How Large Language Models Encode Context Knowledge? A Layer-Wise Probing Study","date":"2024-02-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jometeorie/probing_llama","path":"code/custom_llama/modeling_llama.py","file_url":"https://github.com/jometeorie/probing_llama/blob/HEAD/code/custom_llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.15637","paper":"/paper/addressing-order-sensitivity-of-in-context","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","date":"2024-02-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xyzcs/infoac","path":"LLama.py","file_url":"https://github.com/xyzcs/infoac/blob/HEAD/LLama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.14899","paper":"/paper/stop-reasoning-when-multimodal-llms-with","title":"Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image","date":"2024-02-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aipenguin/stopreasoning","path":"minigpt4/models/modeling_llama.py","file_url":"https://github.com/aipenguin/stopreasoning/blob/HEAD/minigpt4/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.13991","paper":"/paper/analysing-the-impact-of-sequence-composition","title":"Analysing The Impact of Sequence Composition on Language Model Pre-Training","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuzhaouoe/pretraining-data-packing","path":"llama_modeling.py","file_url":"https://github.com/yuzhaouoe/pretraining-data-packing/blob/HEAD/llama_modeling.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.13720","paper":"/paper/ouroboros-speculative-decoding-with-large","title":"Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thunlp/ouroboros","path":"ouroboros/models/modeling_llama.py","file_url":"https://github.com/thunlp/ouroboros/blob/HEAD/ouroboros/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.12374","paper":"/paper/sequoia-scalable-robust-and-hardware-aware","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"infini-ai-lab/sequoia","path":"Engine/offload_engine.py","file_url":"https://github.com/infini-ai-lab/sequoia/blob/HEAD/Engine/offload_engine.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2402.11809","paper":"/paper/generation-meets-verification-accelerating","title":"Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct Decoding","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cteant/space","path":"src/models/modeling_internlm.py","file_url":"https://github.com/cteant/space/blob/HEAD/src/models/modeling_internlm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.11809","paper":"/paper/generation-meets-verification-accelerating","title":"Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct Decoding","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cteant/space","path":"src/models/modeling_falcon.py","file_url":"https://github.com/cteant/space/blob/HEAD/src/models/modeling_falcon.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c89eed9eaa3332c2","mcp_get_code":{"code_sha256":"c89eed9eaa3332c2"}},{"arxiv_id":"2402.11592","paper":"/paper/revisiting-zeroth-order-optimization-for","title":"Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark","date":"2024-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zo-bench/zo-llm","path":"zo-bench/modeling_llama.py","file_url":"https://github.com/zo-bench/zo-llm/blob/HEAD/zo-bench/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.11248","paper":"/paper/collavo-crayon-large-language-and-vision","title":"CoLLaVO: Crayon Large Language and Vision mOdel","date":"2024-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ByungKwanLee/CoLLaVO","path":"collavo/arch/modeling_internlm2.py","file_url":"https://github.com/ByungKwanLee/CoLLaVO/blob/HEAD/collavo/arch/modeling_internlm2.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.10787","paper":"/paper/edgeqat-entropy-and-distribution-guided","title":"EdgeQAT: Entropy and Distribution Guided Quantization-Aware Training for the Acceleration of Lightweight LLMs on the Edge","date":"2024-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shawnricecake/edgeqat","path":"distill_train/models/modeling_llama_fp16.py","file_url":"https://github.com/shawnricecake/edgeqat/blob/HEAD/distill_train/models/modeling_llama_fp16.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.10685","paper":"/paper/longheads-multi-head-attention-is-secretly-a","title":"LongHeads: Multi-Head Attention is Secretly a Long Context Processor","date":"2024-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.10631","paper":"/paper/bitdistiller-unleashing-the-potential-of-sub","title":"BitDistiller: Unleashing the Potential of Sub-4-Bit LLMs via Self-Distillation","date":"2024-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dd-duda/bitdistiller","path":"inference/models/falcon.py","file_url":"https://github.com/dd-duda/bitdistiller/blob/HEAD/inference/models/falcon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"766ad0e51b7a8f09","mcp_get_code":{"code_sha256":"766ad0e51b7a8f09"}},{"arxiv_id":"2402.09773","paper":"/paper/nuteprune-efficient-progressive-pruning-with","title":"NutePrune: Efficient Progressive Pruning with Numerous Teachers for Large Language Models","date":"2024-02-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucius-lsr/nuteprune","path":"models/modelling_mistral.py","file_url":"https://github.com/lucius-lsr/nuteprune/blob/HEAD/models/modelling_mistral.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.08562","paper":"/paper/higher-layers-need-more-lora-experts","title":"Higher Layers Need More LoRA Experts","date":"2024-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gcyzsl/mola","path":"src/mola_modeling_llama_hacked.py","file_url":"https://github.com/gcyzsl/mola/blob/HEAD/src/mola_modeling_llama_hacked.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.07754","paper":"/paper/diffusion-of-thoughts-chain-of-thought","title":"Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models","date":"2024-02-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hkunlp/diffusion-of-thoughts","path":"lib/rotary.py","file_url":"https://github.com/hkunlp/diffusion-of-thoughts/blob/HEAD/lib/rotary.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8526ce179df04bd4","mcp_get_code":{"code_sha256":"8526ce179df04bd4"}},{"arxiv_id":"2402.07398","paper":"/paper/vislinginstruct-elevating-zero-shot-learning","title":"VisLingInstruct: Elevating Zero-Shot Learning in Multi-Modal Language Models with Autonomous Instruction Optimization","date":"2024-02-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhudongsheng75/vislinginstruct","path":"vislinginstruct/models/modeling_llama.py","file_url":"https://github.com/zhudongsheng75/vislinginstruct/blob/HEAD/vislinginstruct/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.06262","paper":"/paper/on-the-efficacy-of-eviction-policy-for-key","title":"On the Efficacy of Eviction Policy for Key-Value Constrained Generative Language Model Inference","date":"2024-02-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"drsy/easykv","path":"easykv/llama_patch.py","file_url":"https://github.com/drsy/easykv/blob/HEAD/easykv/llama_patch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.05406","paper":"/paper/everybody-prune-now-structured-pruning-of","title":"Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes","date":"2024-02-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.05109","paper":"/paper/hydra-sequentially-dependent-draft-heads-for","title":"Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding","date":"2024-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zankner/hydra","path":"hydra/model/modeling_llama_kv.py","file_url":"https://github.com/zankner/hydra/blob/HEAD/hydra/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2402.04647","paper":"/paper/latent-plan-transformer-planning-as-latent","title":"Latent Plan Transformer for Trajectory Abstraction: Planning as Latent Space Inference","date":"2024-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mingluzhao/latent-plan-transformer","path":"model/lpt.py","file_url":"https://github.com/mingluzhao/latent-plan-transformer/blob/HEAD/model/lpt.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.04396","paper":"/paper/quip-even-better-llm-quantization-with","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","date":"2024-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Cornell-RelaxML/quip-sharp","path":"model/llama.py","file_url":"https://github.com/Cornell-RelaxML/quip-sharp/blob/HEAD/model/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.03774","paper":"/paper/learning-a-decision-tree-algorithm-with","title":"Learning a Decision Tree Algorithm with Transformers","date":"2024-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"evanzhuang/metatree","path":"metatree/model_metatree.py","file_url":"https://github.com/evanzhuang/metatree/blob/HEAD/metatree/model_metatree.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.03300","paper":"/paper/deepseekmath-pushing-the-limits-of","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","date":"2024-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yynil/rwkvinside","path":"rwkv_inside/modeling_arwkv.py","file_url":"https://github.com/yynil/rwkvinside/blob/HEAD/rwkv_inside/modeling_arwkv.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.02872","paper":"/paper/how-do-large-language-models-learn-in-context","title":"How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning","date":"2024-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zepingyu0512/in-context-mechanism","path":"modeling_llama.py","file_url":"https://github.com/zepingyu0512/in-context-mechanism/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2402.01469","paper":"/paper/amor-a-recipe-for-building-adaptable-modular","title":"AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback","date":"2024-02-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JianGuanTHU/AMOR","path":"code/modeling_llama.py","file_url":"https://github.com/JianGuanTHU/AMOR/blob/HEAD/code/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.12522","paper":"/paper/bita-bi-directional-tuning-for-lossless","title":"BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models","date":"2024-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"linfeng93/bita","path":"src/modeling_llama_if.py","file_url":"https://github.com/linfeng93/bita/blob/HEAD/src/modeling_llama_if.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.12522","paper":"/paper/bita-bi-directional-tuning-for-lossless","title":"BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models","date":"2024-01-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"linfeng93/bita","path":"src/modeling_falcon_if.py","file_url":"https://github.com/linfeng93/bita/blob/HEAD/src/modeling_falcon_if.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c89eed9eaa3332c2","mcp_get_code":{"code_sha256":"c89eed9eaa3332c2"}},{"arxiv_id":"2401.10774","paper":"/paper/medusa-simple-llm-inference-acceleration","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fasterdecoding/medusa","path":"medusa/model/modeling_llama_kv.py","file_url":"https://github.com/fasterdecoding/medusa/blob/HEAD/medusa/model/modeling_llama_kv.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.10774","paper":"/paper/medusa-simple-llm-inference-acceleration","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fasterdecoding/medusa","path":"medusa/model/modeling_llama_kv_legacy.py","file_url":"https://github.com/fasterdecoding/medusa/blob/HEAD/medusa/model/modeling_llama_kv_legacy.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2401.10727","paper":"/paper/tool-lmm-a-large-multi-modal-model-for-tool","title":"MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning","date":"2024-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mllm-tool/mllm-tool","path":"code/model/modeling_llama.py","file_url":"https://github.com/mllm-tool/mllm-tool/blob/HEAD/code/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.08508","paper":"/paper/emollms-a-series-of-emotional-large-language","title":"EmoLLMs: A Series of Emotional Large Language Models and Annotation Tools for Comprehensive Affective Analysis","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lzw108/emollms","path":"src/models/llama/modeling_llama.py","file_url":"https://github.com/lzw108/emollms/blob/HEAD/src/models/llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.08417","paper":"/paper/contrastive-preference-optimization-pushing","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fe1ixxu/alma","path":"modeling_xalma.py","file_url":"https://github.com/fe1ixxu/alma/blob/HEAD/modeling_xalma.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.07004","paper":"/paper/extending-llms-context-window-with-100","title":"Extending LLMs' Context Window with 100 Samples","date":"2024-01-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gair-nlp/entropy-abf","path":"patch/EABF.py","file_url":"https://github.com/gair-nlp/entropy-abf/blob/HEAD/patch/EABF.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2401.06706","paper":"/paper/multi-candidate-speculative-decoding","title":"Multi-Candidate Speculative Decoding","date":"2024-01-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"njunlp/mcsd","path":"MCSD/model/llama_tree_attn/modeling_llama.py","file_url":"https://github.com/njunlp/mcsd/blob/HEAD/MCSD/model/llama_tree_attn/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.06469","paper":"/paper/batch-icl-effective-efficient-and-order","title":"Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context Learning","date":"2024-01-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cardinalere/batch-icl","path":"transformers/models/llama/modeling_llama.py","file_url":"https://github.com/cardinalere/batch-icl/blob/HEAD/transformers/models/llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2401.01325","paper":"/paper/llm-maybe-longlm-self-extend-llm-context","title":"LLM Maybe LongLM: Self-Extend LLM Context Window Without Tuning","date":"2024-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sdan/selfextend","path":"modeling_mistral.py","file_url":"https://github.com/sdan/selfextend/blob/HEAD/modeling_mistral.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.16862","paper":"/paper/tinygpt-v-efficient-multimodal-large-language","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","date":"2023-12-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dlyuangod/tinygpt-v","path":"TinyGPT-V-main/modeling_phi.py","file_url":"https://github.com/dlyuangod/tinygpt-v/blob/HEAD/TinyGPT-V-main/modeling_phi.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.15166","paper":"/paper/solar-10-7b-scaling-large-language-models","title":"SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling","date":"2023-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jquesnelle/scaled-rope","path":"scaled_rope/modeling_llama_yarn.py","file_url":"https://github.com/jquesnelle/scaled-rope/blob/HEAD/scaled_rope/modeling_llama_yarn.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.15166","paper":"/paper/solar-10-7b-scaling-large-language-models","title":"SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling","date":"2023-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jquesnelle/scaled-rope","path":"scaled_rope/FalconDynamicPartNTKScaledRotaryEmbedding.py","file_url":"https://github.com/jquesnelle/scaled-rope/blob/HEAD/scaled_rope/FalconDynamicPartNTKScaledRotaryEmbedding.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"766ad0e51b7a8f09","mcp_get_code":{"code_sha256":"766ad0e51b7a8f09"}},{"arxiv_id":"2312.12141","paper":"/paper/exploring-the-residual-stream-of-transformers","title":"Neuron-Level Knowledge Attribution in Large Language Models","date":"2023-12-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.11983","paper":"/paper/fluctuation-based-adaptive-structured-pruning","title":"Fluctuation-based Adaptive Structured Pruning for Large Language Models","date":"2023-12-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"casia-iva-lab/flap","path":"models/hf_llama/modeling_llama.py","file_url":"https://github.com/casia-iva-lab/flap/blob/HEAD/models/hf_llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.08168","paper":"/paper/chat-3d-v2-bridging-3d-scene-and-large","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","date":"2023-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Chat-3D/Chat-3D","path":"models/modeling_llama.py","file_url":"https://github.com/Chat-3D/Chat-3D/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.06968","paper":"/paper/hallucination-augmented-contrastive-learning","title":"Hallucination Augmented Contrastive Learning for Multimodal Large Language Model","date":"2023-12-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2312.06149","paper":"/paper/unlocking-anticipatory-text-generation-a","title":"Unlocking Anticipatory Text Generation: A Constrained Approach for Large Language Models Decoding","date":"2023-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SalesforceAIResearch/Unlocking-TextGen","path":"TestReward/transformers_flash/modeling/modeling_llama_flash.py","file_url":"https://github.com/SalesforceAIResearch/Unlocking-TextGen/blob/HEAD/TestReward/transformers_flash/modeling/modeling_llama_flash.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.04021","paper":"/paper/a-study-on-the-calibration-of-in-context","title":"A Study on the Calibration of In-context Learning","date":"2023-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hlzhang109/icl-calibration","path":"llama/modeling_llama.py","file_url":"https://github.com/hlzhang109/icl-calibration/blob/HEAD/llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.03414","paper":"/paper/compressed-context-memory-for-online-language","title":"Compressed Context Memory For Online Language Model Interaction","date":"2023-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"snu-mllab/context-memory","path":"src/arch/ccm_mistral.py","file_url":"https://github.com/snu-mllab/context-memory/blob/HEAD/src/arch/ccm_mistral.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.02051","paper":"/paper/timechat-a-time-sensitive-multimodal-large","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","date":"2023-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lntzm/cvpr24track-longvideo","path":"timechat/models/modeling_llama.py","file_url":"https://github.com/lntzm/cvpr24track-longvideo/blob/HEAD/timechat/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2312.01648","paper":"/paper/characterizing-large-language-model-geometry","title":"Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation","date":"2023-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"randallbalestriero/splinellm","path":"modeling_llama.py","file_url":"https://github.com/randallbalestriero/splinellm/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2311.17911","paper":"/paper/opera-alleviating-hallucination-in-multi","title":"OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation","date":"2023-11-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2311.17005","paper":"/paper/mvbench-a-comprehensive-multi-modal-video","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","date":"2023-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/ask-anything","path":"video_chat/models/modeling_llama.py","file_url":"https://github.com/opengvlab/ask-anything/blob/HEAD/video_chat/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2311.13230","paper":"/paper/enhancing-uncertainty-based-hallucination","title":"Enhancing Uncertainty-Based Hallucination Detection with Stronger Focus","date":"2023-11-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zthang/focus","path":"models/modeling_gpt_neox.py","file_url":"https://github.com/zthang/focus/blob/HEAD/models/modeling_gpt_neox.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2311.13230","paper":"/paper/enhancing-uncertainty-based-hallucination","title":"Enhancing Uncertainty-Based Hallucination Detection with Stronger Focus","date":"2023-11-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zthang/focus","path":"models/modeling_RW.py","file_url":"https://github.com/zthang/focus/blob/HEAD/models/modeling_RW.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2502f906145be7f6","mcp_get_code":{"code_sha256":"2502f906145be7f6"}},{"arxiv_id":"2311.12871","paper":"/paper/an-embodied-generalist-agent-in-3d-world","title":"An Embodied Generalist Agent in 3D World","date":"2023-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"embodied-generalist/embodied-generalist","path":"model/transformers.py","file_url":"https://github.com/embodied-generalist/embodied-generalist/blob/HEAD/model/transformers.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2311.12570","paper":"/paper/bend-benchmarking-dna-language-models-on","title":"BEND: Benchmarking DNA Language Models on biologically meaningful tasks","date":"2023-11-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"frederikkemarin/BEND","path":"bend/models/gena_lm.py","file_url":"https://github.com/frederikkemarin/BEND/blob/HEAD/bend/models/gena_lm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"2502f906145be7f6","mcp_get_code":{"code_sha256":"2502f906145be7f6"}},{"arxiv_id":"2311.10774","paper":"/paper/mmc-advancing-multimodal-chart-understanding","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","date":"2023-11-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"FuxiaoLiu/LRV-Instruction","path":"MiniGPT-4/minigpt4/models/modeling_llama.py","file_url":"https://github.com/FuxiaoLiu/LRV-Instruction/blob/HEAD/MiniGPT-4/minigpt4/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2311.08252","paper":"/paper/rest-retrieval-based-speculative-decoding","title":"REST: Retrieval-Based Speculative Decoding","date":"2023-11-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fasterdecoding/rest","path":"rest/model/modeling_llama_kv.py","file_url":"https://github.com/fasterdecoding/rest/blob/HEAD/rest/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2311.04219","paper":"/paper/otterhd-a-high-resolution-multi-modality","title":"OtterHD: A High-Resolution Multi-modality Model","date":"2023-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luodian/otter","path":"src/otter_ai/models/falcon/modelling_RW.py","file_url":"https://github.com/luodian/otter/blob/HEAD/src/otter_ai/models/falcon/modelling_RW.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2502f906145be7f6","mcp_get_code":{"code_sha256":"2502f906145be7f6"}},{"arxiv_id":"2311.04072","paper":"/paper/beyond-imitation-leveraging-fine-grained","title":"Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment","date":"2023-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucaibox/figa","path":"modeling_llama.py","file_url":"https://github.com/rucaibox/figa/blob/HEAD/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2311.01908","paper":"/paper/llm-driven-multimodal-target-volume","title":"LLM-driven Multimodal Target Volume Contouring in Radiation Oncology","date":"2023-11-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tvseg/mm-llm-ro","path":"model/llama2/llama_custom.py","file_url":"https://github.com/tvseg/mm-llm-ro/blob/HEAD/model/llama2/llama_custom.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.19785","paper":"/paper/what-s-up-with-vision-language-models","title":"What's \"up\" with vision-language models? Investigating their struggle with spatial reasoning","date":"2023-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.19740","paper":"/paper/collaborative-evaluation-exploring-the","title":"Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks","date":"2023-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qtli/coeval","path":"webapp/monkey_patch_non_inplace.py","file_url":"https://github.com/qtli/coeval/blob/HEAD/webapp/monkey_patch_non_inplace.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"62a553b3b2dcaca7","mcp_get_code":{"code_sha256":"62a553b3b2dcaca7"}},{"arxiv_id":"2310.16834","paper":"/paper/discrete-diffusion-language-modeling-by","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","date":"2023-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"louaaron/Score-Entropy-Discrete-Diffusion","path":"model/rotary.py","file_url":"https://github.com/louaaron/Score-Entropy-Discrete-Diffusion/blob/HEAD/model/rotary.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8526ce179df04bd4","mcp_get_code":{"code_sha256":"8526ce179df04bd4"}},{"arxiv_id":"2310.16450","paper":"/paper/clex-continuous-length-extrapolation-for","title":"CLEX: Continuous Length Extrapolation for Large Language Models","date":"2023-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DAMO-NLP-SG/CLEX","path":"CLEX/llama/modeling_llama_clex.py","file_url":"https://github.com/DAMO-NLP-SG/CLEX/blob/HEAD/CLEX/llama/modeling_llama_clex.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.13802","paper":"/paper/improving-molecular-properties-prediction","title":"Improving Molecular Properties Prediction Through Latent Space Fusion","date":"2023-10-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IBM/molformer","path":"finetune/rotate_attention/rotary.py","file_url":"https://github.com/IBM/molformer/blob/HEAD/finetune/rotate_attention/rotary.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"766ad0e51b7a8f09","mcp_get_code":{"code_sha256":"766ad0e51b7a8f09"}},{"arxiv_id":"2310.13596","paper":"/paper/marinegpt-unlocking-secrets-of-ocean-to-the","title":"MarineGPT: Unlocking Secrets of Ocean to the Public","date":"2023-10-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hkust-vgd/marinegpt","path":"marinegpt/models/modeling_llama.py","file_url":"https://github.com/hkust-vgd/marinegpt/blob/HEAD/marinegpt/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.12798","paper":"/paper/molca-molecular-graph-language-modeling-with","title":"MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter","date":"2023-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"acharkq/molca","path":"model/modeling_llama.py","file_url":"https://github.com/acharkq/molca/blob/HEAD/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.12487","paper":"/paper/improved-operator-learning-by-orthogonal","title":"Improved Operator Learning by Orthogonal Attention","date":"2023-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhijie-group/orthogonal-neural-operator","path":"ONOmodel2.py","file_url":"https://github.com/zhijie-group/orthogonal-neural-operator/blob/HEAD/ONOmodel2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8549b7478752bf18","mcp_get_code":{"code_sha256":"8549b7478752bf18"}},{"arxiv_id":"2310.11511","paper":"/paper/self-rag-learning-to-retrieve-generate-and","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.11453","paper":"/paper/bitnet-scaling-1-bit-transformers-for-large","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.08588","paper":"/paper/octopus-embodied-vision-language-programmer","title":"Octopus: Embodied Vision-Language Programmer from Environmental Feedback","date":"2023-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dongyh20/octopus","path":"octopus/Otter/xformers_model/llama.py","file_url":"https://github.com/dongyh20/octopus/blob/HEAD/octopus/Otter/xformers_model/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.08278","paper":"/paper/lag-llama-towards-foundation-models-for-time","title":"Lag-Llama: Towards Foundation Models for Probabilistic Time Series Forecasting","date":"2023-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2310.07707","paper":"/paper/matformer-nested-transformer-for-elastic","title":"MatFormer: Nested Transformer for Elastic Inference","date":"2023-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RAIVNLab/MatFormer-OLMo","path":"olmo/model.py","file_url":"https://github.com/RAIVNLab/MatFormer-OLMo/blob/HEAD/olmo/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"db83ffe217e8539f","mcp_get_code":{"code_sha256":"db83ffe217e8539f"}},{"arxiv_id":"2310.05910","paper":"/paper/salmon-self-alignment-with-principle","title":"SALMON: Self-Alignment with Instructable Reward Models","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ibm/salmon","path":"training/models/llama_with_flash_attn.py","file_url":"https://github.com/ibm/salmon/blob/HEAD/training/models/llama_with_flash_attn.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.05863","paper":"/paper/fine-grained-audio-visual-joint","title":"Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"the-anonymous-bs/favor","path":"video_llama/models/modeling_llama.py","file_url":"https://github.com/the-anonymous-bs/favor/blob/HEAD/video_llama/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2310.02980","paper":"/paper/never-train-from-scratch-fair-comparison-of","title":"Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven Priors","date":"2023-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"idoamos/not-from-scratch","path":"local_attention/rotary.py","file_url":"https://github.com/idoamos/not-from-scratch/blob/HEAD/local_attention/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1147383164fd3a66","mcp_get_code":{"code_sha256":"1147383164fd3a66"}},{"arxiv_id":"2310.00754","paper":"/paper/analyzing-and-mitigating-object-hallucination","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","date":"2023-10-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"YiyangZhou/LURE","path":"minigpt4/models/modeling_llama.py","file_url":"https://github.com/YiyangZhou/LURE/blob/HEAD/minigpt4/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2309.16316","paper":"/paper/astroconformer-the-prospects-of-analyzing","title":"Astroconformer: The Prospects of Analyzing Stellar Light Curves with Transformer-Based Deep Learning Models","date":"2023-09-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"panjiashu/astroconformer","path":"Astroconformer/Model/Modules/mhsa_pro.py","file_url":"https://github.com/panjiashu/astroconformer/blob/HEAD/Astroconformer/Model/Modules/mhsa_pro.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c0a280fe2870951f","mcp_get_code":{"code_sha256":"c0a280fe2870951f"}},{"arxiv_id":"2309.14763","paper":"/paper/conpet-continual-parameter-efficient-tuning","title":"ConPET: Continual Parameter-Efficient Tuning for Large Language Models","date":"2023-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"raincleared-song/conpet","path":"bmt_models/llama_lora.py","file_url":"https://github.com/raincleared-song/conpet/blob/HEAD/bmt_models/llama_lora.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2309.12307","paper":"/paper/longlora-efficient-fine-tuning-of-long","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","date":"2023-09-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dvlab-research/longlora","path":"gptneox_attn_replace.py","file_url":"https://github.com/dvlab-research/longlora/blob/HEAD/gptneox_attn_replace.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2309.11674","paper":"/paper/a-paradigm-shift-in-machine-translation","title":"A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models","date":"2023-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fe1ixxu/ALMA","path":"modeling_xalma.py","file_url":"https://github.com/fe1ixxu/ALMA/blob/HEAD/modeling_xalma.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2309.11499","paper":"/paper/dreamllm-synergistic-multimodal-comprehension","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","date":"2023-09-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2309.06180","paper":"/paper/2309-06180","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","date":"2023-09-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ROCm/flash-attention","path":"flash_attn/layers/rotary.py","file_url":"https://github.com/ROCm/flash-attention/blob/HEAD/flash_attn/layers/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"163292f43a3c861b","mcp_get_code":{"code_sha256":"163292f43a3c861b"}},{"arxiv_id":"2308.16463","paper":"/paper/sparkles-unlocking-chats-across-multiple","title":"Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following Models","date":"2023-08-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HYPJUDY/Sparkles","path":"sparkles/models/modeling_llama.py","file_url":"https://github.com/HYPJUDY/Sparkles/blob/HEAD/sparkles/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2308.16137","paper":"/paper/lm-infinite-simple-on-the-fly-length","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","date":"2023-08-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Glaciohound/LM-Infinite","path":"models/llama.py","file_url":"https://github.com/Glaciohound/LM-Infinite/blob/HEAD/models/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2308.15366","paper":"/paper/anomalygpt-detecting-industrial-anomalies","title":"AnomalyGPT: Detecting Industrial Anomalies Using Large Vision-Language Models","date":"2023-08-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"casia-iva-lab/anomalygpt","path":"code/model/modeling_llama.py","file_url":"https://github.com/casia-iva-lab/anomalygpt/blob/HEAD/code/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2308.12674","paper":"/paper/improving-translation-faithfulness-of-large","title":"Improving Translation Faithfulness of Large Language Models via Augmenting Instructions","date":"2023-08-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pppa2019/swie_overmiss_llm4mt","path":"src/trainable_multiL_ins_llama.py","file_url":"https://github.com/pppa2019/swie_overmiss_llm4mt/blob/HEAD/src/trainable_multiL_ins_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2308.10882","paper":"/paper/giraffe-adventures-in-expanding-context","title":"Giraffe: Adventures in Expanding Context Lengths in LLMs","date":"2023-08-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"abacusai/long-context","path":"python/models/modeling_giraffe.py","file_url":"https://github.com/abacusai/long-context/blob/HEAD/python/models/modeling_giraffe.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2308.09936","paper":"/paper/bliva-a-simple-multimodal-llm-for-better","title":"BLIVA: A Simple Multimodal LLM for Better Handling of Text-Rich Visual Questions","date":"2023-08-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlpc-ucsd/bliva","path":"bliva/models/modeling_llama.py","file_url":"https://github.com/mlpc-ucsd/bliva/blob/HEAD/bliva/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2308.06595","paper":"/paper/visit-bench-a-benchmark-for-vision-language","title":"VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use","date":"2023-08-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlfoundations/VisIT-Bench","path":"baselines/panda_gpt_utils/modeling_llama.py","file_url":"https://github.com/mlfoundations/VisIT-Bench/blob/HEAD/baselines/panda_gpt_utils/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2308.04152","paper":"/paper/empowering-vision-language-models-to-follow","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","date":"2023-08-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DCDmllm/Cheetah","path":"Cheetah/cheetah/models/modeling_llama.py","file_url":"https://github.com/DCDmllm/Cheetah/blob/HEAD/Cheetah/cheetah/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2307.09288","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IBM/Dromedary","path":"training/llama_with_flash_attn.py","file_url":"https://github.com/IBM/Dromedary/blob/HEAD/training/llama_with_flash_attn.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2307.08581","paper":"/paper/bubogpt-enabling-visual-grounding-in-multi","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","date":"2023-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"magic-research/bubogpt","path":"bubogpt/models/modeling_llama.py","file_url":"https://github.com/magic-research/bubogpt/blob/HEAD/bubogpt/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2307.08072","paper":"/paper/do-emergent-abilities-exist-in-quantized","title":"Do Emergent Abilities Exist in Quantized Large Language Models: An Empirical Study","date":"2023-07-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rucaibox/quantizedempirical","path":"models/modeling_llama.py","file_url":"https://github.com/rucaibox/quantizedempirical/blob/HEAD/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2307.06945","paper":"/paper/in-context-autoencoder-for-context","title":"In-context Autoencoder for Context Compression in a Large Language Model","date":"2023-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"getao/icae","path":"code/icae_v1/base/modeling_llama_icae.py","file_url":"https://github.com/getao/icae/blob/HEAD/code/icae_v1/base/modeling_llama_icae.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"CC0-1.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2307.05695","paper":"/paper/stack-more-layers-differently-high-rank","title":"ReLoRA: High-Rank Training Through Low-Rank Updates","date":"2023-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guitaricet/peft_pretraining","path":"peft_pretraining/modeling_llama.py","file_url":"https://github.com/guitaricet/peft_pretraining/blob/HEAD/peft_pretraining/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2307.03170","paper":"/paper/focused-transformer-contrastive-training-for","title":"Focused Transformer: Contrastive Training for Context Scaling","date":"2023-07-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CStanKonrad/long_llama","path":"src/modeling_longllama.py","file_url":"https://github.com/CStanKonrad/long_llama/blob/HEAD/src/modeling_longllama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2306.15595","paper":"/paper/extending-context-window-of-large-language","title":"Extending Context Window of Large Language Models via Positional Interpolation","date":"2023-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2306.13643","paper":"/paper/lightglue-local-feature-matching-at-light","title":"LightGlue: Local Feature Matching at Light Speed","date":"2023-06-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cvg/LightGlue","path":"lightglue/lightglue.py","file_url":"https://github.com/cvg/LightGlue/blob/HEAD/lightglue/lightglue.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a3ec43c12656acbb","mcp_get_code":{"code_sha256":"a3ec43c12656acbb"}},{"arxiv_id":"2306.05284","paper":"/paper/simple-and-controllable-music-generation","title":"Simple and Controllable Music Generation","date":"2023-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"collabora/whisperspeech","path":"whisperspeech/modules.py","file_url":"https://github.com/collabora/whisperspeech/blob/HEAD/whisperspeech/modules.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"72ac2b9f11df2bb5","mcp_get_code":{"code_sha256":"72ac2b9f11df2bb5"}},{"arxiv_id":"2306.02858","paper":"/paper/video-llama-an-instruction-tuned-audio-visual","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","date":"2023-06-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/video-llama","path":"video_llama/models/modeling_llama.py","file_url":"https://github.com/damo-nlp-sg/video-llama/blob/HEAD/video_llama/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2305.17888","paper":"/paper/llm-qat-data-free-quantization-aware-training","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","date":"2023-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2305.16355","paper":"/paper/pandagpt-one-model-to-instruction-follow-them","title":"PandaGPT: One Model To Instruction-Follow Them All","date":"2023-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yxuansu/pandagpt","path":"code/model/modeling_llama.py","file_url":"https://github.com/yxuansu/pandagpt/blob/HEAD/code/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2305.16103","paper":"/paper/chatbridge-bridging-modalities-with-large","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","date":"2023-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"joez17/chatbridge","path":"chatbridge/models/modeling_llama.py","file_url":"https://github.com/joez17/chatbridge/blob/HEAD/chatbridge/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2305.14167","paper":"/paper/detgpt-detect-what-you-need-via-reasoning","title":"DetGPT: Detect What You Need via Reasoning","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"optimalscale/detgpt","path":"detgpt/models/modeling_llama.py","file_url":"https://github.com/optimalscale/detgpt/blob/HEAD/detgpt/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2305.11072","paper":"/paper/self-supervised-fine-tuning-for-improved","title":"Self-supervised Fine-tuning for Improved Content Representations by Speaker-invariant Clustering","date":"2023-05-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vectominist/spin","path":"s3prl_py/wav2vec2_model.py","file_url":"https://github.com/vectominist/spin/blob/HEAD/s3prl_py/wav2vec2_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"766ad0e51b7a8f09","mcp_get_code":{"code_sha256":"766ad0e51b7a8f09"}},{"arxiv_id":"2303.11249","paper":"/paper/what-makes-data-suitable-for-a-locally","title":"What Makes Data Suitable for a Locally Connected Neural Network? A Necessary and Sufficient Condition Based on Quantum Entanglement","date":"2023-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucidrains/local-attention","path":"local_attention/rotary.py","file_url":"https://github.com/lucidrains/local-attention/blob/HEAD/local_attention/rotary.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1147383164fd3a66","mcp_get_code":{"code_sha256":"1147383164fd3a66"}},{"arxiv_id":"2302.04761","paper":"/paper/toolformer-language-models-can-teach","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","date":"2023-02-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucidrains/toolformer-pytorch","path":"toolformer_pytorch/palm.py","file_url":"https://github.com/lucidrains/toolformer-pytorch/blob/HEAD/toolformer_pytorch/palm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"08213c6683993d3b","mcp_get_code":{"code_sha256":"08213c6683993d3b"}},{"arxiv_id":"2211.10658","paper":"/paper/edge-editable-dance-generation-from-music","title":"EDGE: Editable Dance Generation From Music","date":"2022-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Stanford-TML/EDGE","path":"model/rotary_embedding_torch.py","file_url":"https://github.com/Stanford-TML/EDGE/blob/HEAD/model/rotary_embedding_torch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2205.13671","paper":"/paper/transformer-for-partial-differential","title":"Transformer for Partial Differential Equations' Operator Learning","date":"2022-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BaratiLab/OFormer","path":"BVP/nn_module/attention_module.py","file_url":"https://github.com/BaratiLab/OFormer/blob/HEAD/BVP/nn_module/attention_module.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5fa6d15f0e91f394","mcp_get_code":{"code_sha256":"5fa6d15f0e91f394"}},{"arxiv_id":"2205.07514","paper":"/paper/residual-local-feature-network-for-efficient","title":"Residual Local Feature Network for Efficient Super-Resolution","date":"2022-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amazingren/ntire2024_esr","path":"models/team07_DVMSR.py","file_url":"https://github.com/amazingren/ntire2024_esr/blob/HEAD/models/team07_DVMSR.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"2204.14198","paper":"/paper/flamingo-a-visual-language-model-for-few-shot-1","title":"Flamingo: a Visual Language Model for Few-Shot Learning","date":"2022-04-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucidrains/flamingo-pytorch","path":"flamingo_pytorch/flamingo_palm.py","file_url":"https://github.com/lucidrains/flamingo-pytorch/blob/HEAD/flamingo_pytorch/flamingo_palm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fdd93453f92f9167","mcp_get_code":{"code_sha256":"fdd93453f92f9167"}},{"arxiv_id":"2204.02311","paper":"/paper/palm-scaling-language-modeling-with-pathways-1","title":"PaLM: Scaling Language Modeling with Pathways","date":"2022-04-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"conceptofmind/PaLM-flax","path":"palm_flax/palm_flax.py","file_url":"https://github.com/conceptofmind/PaLM-flax/blob/HEAD/palm_flax/palm_flax.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ca6a06a57596c8b4","mcp_get_code":{"code_sha256":"ca6a06a57596c8b4"}},{"arxiv_id":"2204.02311","paper":"/paper/palm-scaling-language-modeling-with-pathways-1","title":"PaLM: Scaling Language Modeling with Pathways","date":"2022-04-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucidrains/PaLM-pytorch","path":"palm_pytorch/palm_pytorch.py","file_url":"https://github.com/lucidrains/PaLM-pytorch/blob/HEAD/palm_pytorch/palm_pytorch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"08213c6683993d3b","mcp_get_code":{"code_sha256":"08213c6683993d3b"}},{"arxiv_id":"2203.07852","paper":"/paper/block-recurrent-transformers","title":"Block-Recurrent Transformers","date":"2022-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dashstander/block-recurrent-transformer","path":"block_recurrent_transformer/transformer.py","file_url":"https://github.com/dashstander/block-recurrent-transformer/blob/HEAD/block_recurrent_transformer/transformer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6b01a575e36ad18c","mcp_get_code":{"code_sha256":"6b01a575e36ad18c"}},{"arxiv_id":"2202.07765","paper":"/paper/general-purpose-long-context-autoregressive","title":"General-purpose, long-context autoregressive modeling with Perceiver AR","date":"2022-02-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucidrains/perceiver-ar-pytorch","path":"perceiver_ar_pytorch/perceiver_ar_pytorch.py","file_url":"https://github.com/lucidrains/perceiver-ar-pytorch/blob/HEAD/perceiver_ar_pytorch/perceiver_ar_pytorch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1964789ef2be9b81","mcp_get_code":{"code_sha256":"1964789ef2be9b81"}},{"arxiv_id":"2202.03036","paper":"/paper/structure-aware-transformer-for-graph","title":"Structure-Aware Transformer for Graph Representation Learning","date":"2022-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"borgwardtlab/pst","path":"pst/rotary_embedding.py","file_url":"https://github.com/borgwardtlab/pst/blob/HEAD/pst/rotary_embedding.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"437c7011506995a3","mcp_get_code":{"code_sha256":"437c7011506995a3"}},{"arxiv_id":"2112.04426","paper":"/paper/improving-language-models-by-retrieving-from","title":"Improving language models by retrieving from trillions of tokens","date":"2021-12-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucidrains/RETRO-pytorch","path":"retro_pytorch/retro_pytorch.py","file_url":"https://github.com/lucidrains/RETRO-pytorch/blob/HEAD/retro_pytorch/retro_pytorch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fdd93453f92f9167","mcp_get_code":{"code_sha256":"fdd93453f92f9167"}},{"arxiv_id":"2104.09864","paper":"/paper/roformer-enhanced-transformer-with-rotary","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","date":"2021-04-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"varungumma/fairseq","path":"fairseq/modules/rotary_embedding.py","file_url":"https://github.com/varungumma/fairseq/blob/HEAD/fairseq/modules/rotary_embedding.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"1901.02860","paper":"/paper/transformer-xl-attentive-language-models","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","date":"2019-01-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mustafaaljadery/gemma-2b-10m","path":"src/gemma.py","file_url":"https://github.com/mustafaaljadery/gemma-2b-10m/blob/HEAD/src/gemma.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cec833a99feb528c","mcp_get_code":{"code_sha256":"cec833a99feb528c"}},{"arxiv_id":"openreview_trSWJ99WzS","paper":null,"title":"arXiv:openreview_trSWJ99WzS","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"DerrickYLJ/LessIsMore","path":"src/models/llama_tidaldecoding.py","file_url":"https://github.com/DerrickYLJ/LessIsMore/blob/HEAD/src/models/llama_tidaldecoding.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"openreview_d3RFDLBw01","paper":null,"title":"arXiv:openreview_d3RFDLBw01","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"AI2C-Lab/STLA","path":"modeling_llama_custom.py","file_url":"https://github.com/AI2C-Lab/STLA/blob/HEAD/modeling_llama_custom.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"openreview_4iupzej9nT","paper":null,"title":"arXiv:openreview_4iupzej9nT","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"hikvision-research/STEP","path":"step/model/olmoe/modeling_olmoe.py","file_url":"https://github.com/hikvision-research/STEP/blob/HEAD/step/model/olmoe/modeling_olmoe.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"aaai_34690","paper":null,"title":"arXiv:aaai_34690","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"ZongyueQin/DSBD","path":"sampling/models/modeling_llama.py","file_url":"https://github.com/ZongyueQin/DSBD/blob/HEAD/sampling/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"aaai_28960","paper":null,"title":"arXiv:aaai_28960","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"CASIA-IVA-Lab/FLAP","path":"models/hf_llama/modeling_llama.py","file_url":"https://github.com/CASIA-IVA-Lab/FLAP/blob/HEAD/models/hf_llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"aaai_27999","paper":null,"title":"arXiv:aaai_27999","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"mlpc-ucsd/BLIVA","path":"bliva/models/modeling_llama.py","file_url":"https://github.com/mlpc-ucsd/BLIVA/blob/HEAD/bliva/models/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"Zhang_Imagine_Before_Go_Self-Supervised_Generative_Map_for_Object_Goal_Navigation_CVPR_2024_paper","paper":null,"title":"arXiv:Zhang_Imagine_Before_Go_Self-Supervised_Generative_Map_for_Object_Goal_Navigation_CVPR_2024_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"sx-zhang/SGM","path":"SGM_train/cross_modeling.py","file_url":"https://github.com/sx-zhang/SGM/blob/HEAD/SGM_train/cross_modeling.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fdd93453f92f9167","mcp_get_code":{"code_sha256":"fdd93453f92f9167"}},{"arxiv_id":"Zhang_Bidirectional_Autoregessive_Diffusion_Model_for_Dance_Generation_CVPR_2024_paper","paper":null,"title":"arXiv:Zhang_Bidirectional_Autoregessive_Diffusion_Model_for_Dance_Generation_CVPR_2024_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"czzhang179/BADM","path":"static/badm/model/rotary_embedding_torch.py","file_url":"https://github.com/czzhang179/BADM/blob/HEAD/static/badm/model/rotary_embedding_torch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"58823d9435a8751b","mcp_get_code":{"code_sha256":"58823d9435a8751b"}},{"arxiv_id":"Lin_ShowUI_One_Vision-Language-Action_Model_for_GUI_Visual_Agent_CVPR_2025_paper","paper":null,"title":"arXiv:Lin_ShowUI_One_Vision-Language-Action_Model_for_GUI_Visual_Agent_CVPR_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"showlab/ShowUI","path":"model/showui/modeling_showui.py","file_url":"https://github.com/showlab/ShowUI/blob/HEAD/model/showui/modeling_showui.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2025.naacl-long.237","paper":null,"title":"arXiv:2025.naacl-long.237","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"nbasyl/LLM-FP4","path":"utils/models.py","file_url":"https://github.com/nbasyl/LLM-FP4/blob/HEAD/utils/models.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2025.findings-emnlp.435","paper":null,"title":"arXiv:2025.findings-emnlp.435","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"nguyenngocbaocmt02/OT-Intervention","path":"llama/modeling_llama.py","file_url":"https://github.com/nguyenngocbaocmt02/OT-Intervention/blob/HEAD/llama/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2025.emnlp-main.231","paper":null,"title":"arXiv:2025.emnlp-main.231","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"chenziwenhaoshuai/TS-CLIP","path":"time_moe/models/modeling_time_moe.py","file_url":"https://github.com/chenziwenhaoshuai/TS-CLIP/blob/HEAD/time_moe/models/modeling_time_moe.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"e03d53ba9d4f9ae5","mcp_get_code":{"code_sha256":"e03d53ba9d4f9ae5"}},{"arxiv_id":"2024.naacl-long.88","paper":null,"title":"arXiv:2024.naacl-long.88","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"FasterDecoding/REST","path":"rest/model/modeling_llama_kv.py","file_url":"https://github.com/FasterDecoding/REST/blob/HEAD/rest/model/modeling_llama_kv.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b71b0ed70aa2939c","mcp_get_code":{"code_sha256":"b71b0ed70aa2939c"}},{"arxiv_id":"2024.findings-emnlp.22","paper":null,"title":"arXiv:2024.findings-emnlp.22","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"HKUDS/XRec","path":"explainer/models/modeling_explainer.py","file_url":"https://github.com/HKUDS/XRec/blob/HEAD/explainer/models/modeling_explainer.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2024.findings-acl.347","paper":null,"title":"arXiv:2024.findings-acl.347","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"dtamayo-nlp/MEMAT","path":"Falcon/modelling_RW.py","file_url":"https://github.com/dtamayo-nlp/MEMAT/blob/HEAD/Falcon/modelling_RW.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2502f906145be7f6","mcp_get_code":{"code_sha256":"2502f906145be7f6"}},{"arxiv_id":"2024.findings-acl.318","paper":null,"title":"arXiv:2024.findings-acl.318","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"syr-cn/ReactXT","path":"model/modeling_llama.py","file_url":"https://github.com/syr-cn/ReactXT/blob/HEAD/model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}},{"arxiv_id":"2024.emnlp-main.758","paper":null,"title":"arXiv:2024.emnlp-main.758","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"HuangOwen/CoT-Influx","path":"llama_model/modeling_llama.py","file_url":"https://github.com/HuangOwen/CoT-Influx/blob/HEAD/llama_model/modeling_llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b99eea6376d1e212","mcp_get_code":{"code_sha256":"b99eea6376d1e212"}}]}