{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/apply-rotary-emb","entry":"apply_rotary_emb","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":121,"n_papers_ran":66,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":74,"n_samples_ran":30,"n_samples_fingerprinted":4,"n_places":129,"n_places_pointer_only":47,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":11,"ran_fixture":9,"ran":10,"unverified":44},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.26973","paper":"/paper/arxiv-2608-26973","title":"Squeezing More from Limited Data with Recursive Transformers","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"serdardoesml/recursive-lm","path":"recursive_lm/block.py","file_url":"https://github.com/serdardoesml/recursive-lm/blob/HEAD/recursive_lm/block.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e8686aa11b98d0c5","mcp_get_code":{"code_sha256":"e8686aa11b98d0c5"}},{"arxiv_id":"2608.01298","paper":"/paper/arxiv-2608-01298","title":"UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"JN-Yun/UDT","path":"models/UDT.py","file_url":"https://github.com/JN-Yun/UDT/blob/HEAD/models/UDT.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dfafa843246491e7","mcp_get_code":{"code_sha256":"dfafa843246491e7"}},{"arxiv_id":"2607.01218","paper":"/paper/arxiv-2607-01218","title":"The State-Prediction Separation Hypothesis","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"lil-lab/sps","path":"src/modeling/models/sps/core.py","file_url":"https://github.com/lil-lab/sps/blob/HEAD/src/modeling/models/sps/core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"02eb4756273503fe","mcp_get_code":{"code_sha256":"02eb4756273503fe"}},{"arxiv_id":"2606.25391","paper":"/paper/arxiv-2606-25391","title":"From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Zyphra/Zonos","path":"zonos/backbone/_torch.py","file_url":"https://github.com/Zyphra/Zonos/blob/HEAD/zonos/backbone/_torch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"eda145d7739459ea","mcp_get_code":{"code_sha256":"eda145d7739459ea"}},{"arxiv_id":"2606.14259","paper":"/paper/arxiv-2606-14259","title":"Beyond a Single Explanation of the Adam-SGD Gap","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"orientino/gap","path":"language/model.py","file_url":"https://github.com/orientino/gap/blob/HEAD/language/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c400816c9ec79f9f","mcp_get_code":{"code_sha256":"c400816c9ec79f9f"}},{"arxiv_id":"2606.00761","paper":"/paper/arxiv-2606-00761","title":"Confidence-Adaptive SwiGLU for Mixture-of-Experts","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"karpathy/nanochat","path":"nanochat/gpt.py","file_url":"https://github.com/karpathy/nanochat/blob/HEAD/nanochat/gpt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"607949933f8aee3e","mcp_get_code":{"code_sha256":"607949933f8aee3e"}},{"arxiv_id":"2605.19811","paper":"/paper/arxiv-2605-19811","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"brain-lab-research/lion-muon","path":"src/models/llama.py","file_url":"https://github.com/brain-lab-research/lion-muon/blob/HEAD/src/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9891174b43bd9c9a","mcp_get_code":{"code_sha256":"9891174b43bd9c9a"}},{"arxiv_id":"2605.17109","paper":"/paper/arxiv-2605-17109","title":"DynMuon: A Dynamic Spectral Shaping View of Muon","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"fzwark/DynMuon","path":"models/gpt_model.py","file_url":"https://github.com/fzwark/DynMuon/blob/HEAD/models/gpt_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0f4f2333e89a6c8c","mcp_get_code":{"code_sha256":"0f4f2333e89a6c8c"}},{"arxiv_id":"2605.14249","paper":"/paper/arxiv-2605-14249","title":"EnergyLens: Predictive Energy-Aware Exploration for Multi-GPU LLM Inference Optimization","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"meta-llama/llama3","path":"llama/model.py","file_url":"https://github.com/meta-llama/llama3/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2605.06615","paper":"/paper/arxiv-2605-06615","title":"When and Why SignSGD Outperforms SGD: A Theoretical Study Based on ℓ 1 -norm Lower Bounds","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"epfml/llm-optimizer-benchmark","path":"src/models/llama.py","file_url":"https://github.com/epfml/llm-optimizer-benchmark/blob/HEAD/src/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9891174b43bd9c9a","mcp_get_code":{"code_sha256":"9891174b43bd9c9a"}},{"arxiv_id":"2604.21450","paper":"/paper/arxiv-2604-21450","title":"VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"EternalEvan/VARestorer","path":"infinity/models/basic.py","file_url":"https://github.com/EternalEvan/VARestorer/blob/HEAD/infinity/models/basic.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"42125baaa5c021b6","mcp_get_code":{"code_sha256":"42125baaa5c021b6"}},{"arxiv_id":"2604.11628","paper":"/paper/arxiv-2604-11628","title":"Back to Basics: Let Conversational Agents Remember with Just Retrieval and Generation","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"qingyue2014/Rsum","path":"llama/model.py","file_url":"https://github.com/qingyue2014/Rsum/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2604.02051","paper":"/paper/arxiv-2604-02051","title":"OUROBOROS: Dynamic Weight Generation for Recursive Transformers via Input-Conditioned LoRA Modulation","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"RightNow-AI/ouroboros","path":"ouroboros/core_block.py","file_url":"https://github.com/RightNow-AI/ouroboros/blob/HEAD/ouroboros/core_block.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"f0fbd1714cb5fcdd","mcp_get_code":{"code_sha256":"f0fbd1714cb5fcdd"}},{"arxiv_id":"2604.01929","paper":"/paper/arxiv-2604-01929","title":"Woosh: A Sound Effects Foundation Model","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"SonyResearch/Woosh","path":"woosh/model/dit_blocks.py","file_url":"https://github.com/SonyResearch/Woosh/blob/HEAD/woosh/model/dit_blocks.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"356d42b48486577b","mcp_get_code":{"code_sha256":"356d42b48486577b"}},{"arxiv_id":"2604.01472","paper":"/paper/arxiv-2604-01472","title":"The Newton-Muon Optimizer","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"KellerJordan/modded-nanogpt","path":"records/track_1_short/2024-10-14_ModernArch/train_gpt2.py","file_url":"https://github.com/KellerJordan/modded-nanogpt/blob/HEAD/records/track_1_short/2024-10-14_ModernArch/train_gpt2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0f4f2333e89a6c8c","mcp_get_code":{"code_sha256":"0f4f2333e89a6c8c"}},{"arxiv_id":"2604.01472","paper":"/paper/arxiv-2604-01472","title":"The Newton-Muon Optimizer","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"KellerJordan/modded-nanogpt","path":"records/track_1_short/2024-10-09_SOAP/train_gpt2.py","file_url":"https://github.com/KellerJordan/modded-nanogpt/blob/HEAD/records/track_1_short/2024-10-09_SOAP/train_gpt2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e00ba58b92a3a5b0","mcp_get_code":{"code_sha256":"e00ba58b92a3a5b0"}},{"arxiv_id":"2603.04805","paper":"/paper/arxiv-2603-04805","title":"Attention's Gravitational Field: A Power-Law Interpretation of Positional Correlation","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"OpenNMT/OpenNMT-py","path":"onmt/modules/multi_headed_attn.py","file_url":"https://github.com/OpenNMT/OpenNMT-py/blob/HEAD/onmt/modules/multi_headed_attn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"19d46f07e889fbb9","mcp_get_code":{"code_sha256":"19d46f07e889fbb9"}},{"arxiv_id":"2602.07425","paper":"/paper/arxiv-2602-07425","title":"Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise","date":"2026-02-07","month_inferred_from_arxiv_id":null,"title_source":"syntology","repo":"Dingzhen230/Heavy-tailed-Noise-in-LLMs","path":"src/models/llama.py","file_url":"https://github.com/Dingzhen230/Heavy-tailed-Noise-in-LLMs/blob/HEAD/src/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9891174b43bd9c9a","mcp_get_code":{"code_sha256":"9891174b43bd9c9a"}},{"arxiv_id":"2602.06283","paper":"/paper/arxiv-2602-06283","title":"SOCKET: SOft Collision Kernel EsTimator for Sparse Attention","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"amarka8/SOCKET","path":"GPT-FAST/model.py","file_url":"https://github.com/amarka8/SOCKET/blob/HEAD/GPT-FAST/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1102ffb719fa5cde","mcp_get_code":{"code_sha256":"1102ffb719fa5cde"}},{"arxiv_id":"2602.02016","paper":"/paper/arxiv-2602-02016","title":"DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"IST-DASLab/DASH","path":"src/models/llama.py","file_url":"https://github.com/IST-DASLab/DASH/blob/HEAD/src/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9891174b43bd9c9a","mcp_get_code":{"code_sha256":"9891174b43bd9c9a"}},{"arxiv_id":"2602.01212","paper":"/paper/arxiv-2602-01212","title":"SimpleGPT: Improving GPT via A Simple Normalization Strategy","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"Ocram7/SimpleGPT","path":"src/torchtitan/models/llama/simplegpt_model.py","file_url":"https://github.com/Ocram7/SimpleGPT/blob/HEAD/src/torchtitan/models/llama/simplegpt_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"3f4b3af840a38f53","mcp_get_code":{"code_sha256":"3f4b3af840a38f53"}},{"arxiv_id":"2601.17883","paper":"/paper/arxiv-2601-17883","title":"EEG-FM-Compass: Progress, Benchmarking, and Future Directions for EEG Foundation Models","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"Dingkun0817/EEG-FM-Benchmark","path":"models/FM/EEGPT/Model_EEGPT.py","file_url":"https://github.com/Dingkun0817/EEG-FM-Benchmark/blob/HEAD/models/FM/EEGPT/Model_EEGPT.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"db94a8e325ace4ed","mcp_get_code":{"code_sha256":"db94a8e325ace4ed"}},{"arxiv_id":"2601.01313","paper":"/paper/arxiv-2601-01313","title":"Spectral-Window Hybrid (SWH)","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"VladimerKhasia/SWH","path":"swh.py","file_url":"https://github.com/VladimerKhasia/SWH/blob/HEAD/swh.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7b8f2c883ea32273","mcp_get_code":{"code_sha256":"7b8f2c883ea32273"}},{"arxiv_id":"2512.11715","paper":"/paper/arxiv-2512-11715","title":"EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"VectorSpaceLab/OmniGen2","path":"omnigen2/models/embeddings.py","file_url":"https://github.com/VectorSpaceLab/OmniGen2/blob/HEAD/omnigen2/models/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"18b51f2c1d11064b","mcp_get_code":{"code_sha256":"18b51f2c1d11064b"}},{"arxiv_id":"2509.25727","paper":"/paper/arxiv-2509-25727","title":"Boundary-to-Region Supervision for Offline Safe Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"HuikangSu/B2R","path":"model/B2R.py","file_url":"https://github.com/HuikangSu/B2R/blob/HEAD/model/B2R.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2a9fa7e07b987077","mcp_get_code":{"code_sha256":"2a9fa7e07b987077"}},{"arxiv_id":"2509.10918","paper":"/paper/arxiv-2509-10918","title":"ToMA: Token Merge with Attention for Diffusion Models","date":null,"month_inferred_from_arxiv_id":"2025-09","title_source":"syntology","repo":"WenboLuu/ToMA","path":"toma/patch.py","file_url":"https://github.com/WenboLuu/ToMA/blob/HEAD/toma/patch.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"208e2100acfde26e","mcp_get_code":{"code_sha256":"208e2100acfde26e"}},{"arxiv_id":"2508.15772","paper":"/paper/arxiv-2508-15772","title":"Visual Autoregressive Modeling for Instruction-Guided Image Editing","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"HiDream-ai/VAREdit","path":"infinity/models/basic.py","file_url":"https://github.com/HiDream-ai/VAREdit/blob/HEAD/infinity/models/basic.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ae628f6f7137682b","mcp_get_code":{"code_sha256":"ae628f6f7137682b"}},{"arxiv_id":"2508.04045","paper":"/paper/arxiv-2508-04045","title":"FeDaL: Federated Dataset Learning for General Time Series Foundation Models","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"shengchaochen82/FeDaL","path":"layers/SelfAttention_Family.py","file_url":"https://github.com/shengchaochen82/FeDaL/blob/HEAD/layers/SelfAttention_Family.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"958923c993b7bc27","mcp_get_code":{"code_sha256":"958923c993b7bc27"}},{"arxiv_id":"2507.17312","paper":null,"title":"arXiv:2507.17312","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"pq-chen/CasP","path":"src/models/nets/casp/decoders/transformer.py","file_url":"https://github.com/pq-chen/CasP/blob/HEAD/src/models/nets/casp/decoders/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"69f95051b572dc0b","mcp_get_code":{"code_sha256":"69f95051b572dc0b"}},{"arxiv_id":"2507.09846","paper":null,"title":"arXiv:2507.09846","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"epfml/llm-baselines","path":"src/models/llama.py","file_url":"https://github.com/epfml/llm-baselines/blob/HEAD/src/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9891174b43bd9c9a","mcp_get_code":{"code_sha256":"9891174b43bd9c9a"}},{"arxiv_id":"2507.03738","paper":"/paper/flow-anchored-consistency-models","title":"Flow-Anchored Consistency Models","date":"2025-07-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ali-vilab/FACM","path":"ldit/rmsnorm.py","file_url":"https://github.com/ali-vilab/FACM/blob/HEAD/ldit/rmsnorm.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2507.02092","paper":"/paper/energy-based-transformers-are-scalable","title":"Energy-Based Transformers are Scalable Learners and Thinkers","date":"2025-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alexiglad/EBT","path":"model/ar_ebt_adaln.py","file_url":"https://github.com/alexiglad/EBT/blob/HEAD/model/ar_ebt_adaln.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"05cbec09ec746d6d","mcp_get_code":{"code_sha256":"05cbec09ec746d6d"}},{"arxiv_id":"2506.18871","paper":"/paper/omnigen2-exploration-to-advanced-multimodal","title":"OmniGen2: Exploration to Advanced Multimodal Generation","date":"2025-06-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vectorspacelab/omnigen2","path":"omnigen2/models/embeddings.py","file_url":"https://github.com/vectorspacelab/omnigen2/blob/HEAD/omnigen2/models/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"18b51f2c1d11064b","mcp_get_code":{"code_sha256":"18b51f2c1d11064b"}},{"arxiv_id":"2505.24722","paper":"/paper/helm-hyperbolic-large-language-models-via","title":"HELM: Hyperbolic Large Language Models via Mixture-of-Curvature Experts","date":"2025-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"graph-and-geometric-learning/helm","path":"helm/modules/hmla.py","file_url":"https://github.com/graph-and-geometric-learning/helm/blob/HEAD/helm/modules/hmla.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9ed763cd81440229","mcp_get_code":{"code_sha256":"9ed763cd81440229"}},{"arxiv_id":"2505.15559","paper":"/paper/moonbeam-a-midi-foundation-model-using-both","title":"Moonbeam: A MIDI Foundation Model Using Both Absolute and Relative Music Attributes","date":"2025-05-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guozixunnicolas/Moonbeam-MIDI-Foundation-Model","path":"generation/llama/model.py","file_url":"https://github.com/guozixunnicolas/Moonbeam-MIDI-Foundation-Model/blob/HEAD/generation/llama/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"88092eec78599288","mcp_get_code":{"code_sha256":"88092eec78599288"}},{"arxiv_id":"2505.07447","paper":"/paper/unified-continuous-generative-models","title":"Unified Continuous Generative Models","date":"2025-05-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LINs-Lab/UCGM","path":"networks/rmsnorm.py","file_url":"https://github.com/LINs-Lab/UCGM/blob/HEAD/networks/rmsnorm.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2505.07447","paper":"/paper/unified-continuous-generative-models","title":"Unified Continuous Generative Models","date":"2025-05-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LINs-Lab/UCGM","path":"networks/ddt.py","file_url":"https://github.com/LINs-Lab/UCGM/blob/HEAD/networks/ddt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d0b336b17472a69b","mcp_get_code":{"code_sha256":"d0b336b17472a69b"}},{"arxiv_id":"2505.02707","paper":"/paper/voila-voice-language-foundation-models-for","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","date":"2025-05-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maitrix-org/Voila","path":"model.py","file_url":"https://github.com/maitrix-org/Voila/blob/HEAD/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1102ffb719fa5cde","mcp_get_code":{"code_sha256":"1102ffb719fa5cde"}},{"arxiv_id":"2504.07963","paper":"/paper/pixelflow-pixel-space-generative-models-with","title":"PixelFlow: Pixel-Space Generative Models with Flow","date":"2025-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shoufachen/pixelflow","path":"pixelflow/model.py","file_url":"https://github.com/shoufachen/pixelflow/blob/HEAD/pixelflow/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"02f9d79f582265dc","mcp_get_code":{"code_sha256":"02f9d79f582265dc"}},{"arxiv_id":"2504.06232","paper":"/paper/2504-06232","title":"HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance","date":"2025-04-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Bujiazi/HiFlow","path":"utils.py","file_url":"https://github.com/Bujiazi/HiFlow/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7f023fbfe5f10053","mcp_get_code":{"code_sha256":"7f023fbfe5f10053"}},{"arxiv_id":"2504.02732","paper":"/paper/why-do-llms-attend-to-the-first-token","title":"Why do LLMs attend to the first token?","date":"2025-04-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzmtsvv/ad-gta","path":"src/nn/memeff_rope_fn.py","file_url":"https://github.com/zzmtsvv/ad-gta/blob/HEAD/src/nn/memeff_rope_fn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e7bb8ed4a55e86fb","mcp_get_code":{"code_sha256":"e7bb8ed4a55e86fb"}},{"arxiv_id":"2503.23367","paper":"/paper/fastvar-linear-visual-autoregressive-modeling","title":"FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning","date":"2025-03-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"csguoh/fastvar","path":"Infinity/infinity/models/basic.py","file_url":"https://github.com/csguoh/fastvar/blob/HEAD/Infinity/infinity/models/basic.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"42125baaa5c021b6","mcp_get_code":{"code_sha256":"42125baaa5c021b6"}},{"arxiv_id":"2503.18938","paper":"/paper/adaworld-learning-adaptable-world-models-with","title":"AdaWorld: Learning Adaptable World Models with Latent Actions","date":"2025-03-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"little-podi/adaworld","path":"lam/lam/modules/lam.py","file_url":"https://github.com/little-podi/adaworld/blob/HEAD/lam/lam/modules/lam.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2f3566324cb2f780","mcp_get_code":{"code_sha256":"2f3566324cb2f780"}},{"arxiv_id":"2502.05003","paper":"/paper/quest-stable-training-of-llms-with-1-bit","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","date":"2025-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IST-DASLab/QuEST","path":"src/models/llama.py","file_url":"https://github.com/IST-DASLab/QuEST/blob/HEAD/src/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"41b98aa1d9397844","mcp_get_code":{"code_sha256":"41b98aa1d9397844"}},{"arxiv_id":"2501.12375","paper":"/paper/video-depth-anything-consistent-depth","title":"Video Depth Anything: Consistent Depth Estimation for Super-Long Videos","date":"2025-01-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DepthAnything/Video-Depth-Anything","path":"video_depth_anything/motion_module/attention.py","file_url":"https://github.com/DepthAnything/Video-Depth-Anything/blob/HEAD/video_depth_anything/motion_module/attention.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"307785ce73cb99aa","mcp_get_code":{"code_sha256":"307785ce73cb99aa"}},{"arxiv_id":"2501.06589","paper":"/paper/ladder-residual-parallelism-aware","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","date":"2025-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mayank31398/ladder-residual-inference","path":"gpt_fast/utils.py","file_url":"https://github.com/mayank31398/ladder-residual-inference/blob/HEAD/gpt_fast/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"1102ffb719fa5cde","mcp_get_code":{"code_sha256":"1102ffb719fa5cde"}},{"arxiv_id":"2501.06425","paper":"/paper/tensor-product-attention-is-all-you-need","title":"Tensor Product Attention Is All You Need","date":"2025-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tensorgi/t6","path":"model/T6_infer.py","file_url":"https://github.com/tensorgi/t6/blob/HEAD/model/T6_infer.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2501.06425","paper":"/paper/tensor-product-attention-is-all-you-need","title":"Tensor Product Attention Is All You Need","date":"2025-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tensorgi/t6","path":"model/T6.py","file_url":"https://github.com/tensorgi/t6/blob/HEAD/model/T6.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0f4f2333e89a6c8c","mcp_get_code":{"code_sha256":"0f4f2333e89a6c8c"}},{"arxiv_id":"2501.06425","paper":"/paper/tensor-product-attention-is-all-you-need","title":"Tensor Product Attention Is All You Need","date":"2025-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tensorgi/t6","path":"model/T6_kvonly_partialrope.py","file_url":"https://github.com/tensorgi/t6/blob/HEAD/model/T6_kvonly_partialrope.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c2a8d2ee1e68a6db","mcp_get_code":{"code_sha256":"c2a8d2ee1e68a6db"}},{"arxiv_id":"2501.06425","paper":"/paper/tensor-product-attention-is-all-you-need","title":"Tensor Product Attention Is All You Need","date":"2025-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tensorgi/t6","path":"model/T6_linearattn_kvonly_partialrope_decay.py","file_url":"https://github.com/tensorgi/t6/blob/HEAD/model/T6_linearattn_kvonly_partialrope_decay.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"31eead4c21084b8b","mcp_get_code":{"code_sha256":"31eead4c21084b8b"}},{"arxiv_id":"2501.04003","paper":"/paper/are-vlms-ready-for-autonomous-driving-an","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","date":"2025-01-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opendrivelab/drivelm","path":"challenge/llama_adapter_v2_multimodal7b/llama/llama.py","file_url":"https://github.com/opendrivelab/drivelm/blob/HEAD/challenge/llama_adapter_v2_multimodal7b/llama/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2412.19505","paper":"/paper/drivingworld-constructingworld-model-for","title":"DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT","date":"2024-12-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yvanyin/drivingworld","path":"modules/tokenizers/vq_model.py","file_url":"https://github.com/yvanyin/drivingworld/blob/HEAD/modules/tokenizers/vq_model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5412a244b5b49ca7","mcp_get_code":{"code_sha256":"5412a244b5b49ca7"}},{"arxiv_id":"2412.19437","paper":"/paper/deepseek-v3-technical-report","title":"DeepSeek-V3 Technical Report","date":"2024-12-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"deepseek-ai/DeepSeek-V3","path":"inference/model.py","file_url":"https://github.com/deepseek-ai/DeepSeek-V3/blob/HEAD/inference/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1056fbfd766f48b9","mcp_get_code":{"code_sha256":"1056fbfd766f48b9"}},{"arxiv_id":"2412.16526","paper":"/paper/text2midi-generating-symbolic-music-from","title":"Text2midi: Generating Symbolic Music from Captions","date":"2024-12-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amaai-lab/text2midi","path":"model/transformer_model.py","file_url":"https://github.com/amaai-lab/text2midi/blob/HEAD/model/transformer_model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"29d1e242a0370aa1","mcp_get_code":{"code_sha256":"29d1e242a0370aa1"}},{"arxiv_id":"2412.08781","paper":"/paper/generative-modeling-with-explicit-memory","title":"Generative Modeling with Explicit Memory","date":"2024-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lins-lab/gmem","path":"models/rmsnorm.py","file_url":"https://github.com/lins-lab/gmem/blob/HEAD/models/rmsnorm.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2412.06660","paper":"/paper/mumu-llama-multi-modal-music-understanding","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","date":null,"month_inferred_from_arxiv_id":"2024-12","title_source":"archive","repo":"shansongliu/MuMu-LLaMA","path":"MuMu-LLaMA/llama/llama.py","file_url":"https://github.com/shansongliu/MuMu-LLaMA/blob/HEAD/MuMu-LLaMA/llama/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c2fac4e6b301302f","mcp_get_code":{"code_sha256":"c2fac4e6b301302f"}},{"arxiv_id":"2412.03603","paper":"/paper/hunyuanvideo-a-systematic-framework-for-large","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","date":"2024-12-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tencent/hunyuanvideo","path":"hyvideo/modules/models.py","file_url":"https://github.com/tencent/hunyuanvideo/blob/HEAD/hyvideo/modules/models.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"11e474d70dbef16a","mcp_get_code":{"code_sha256":"11e474d70dbef16a"}},{"arxiv_id":"2411.16585","paper":"/paper/marketgpt-developing-a-pre-trained","title":"MarketGPT: Developing a Pre-trained transformer (GPT) for Modeling Financial Time Series","date":"2024-11-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"af440c67b16afe67","mcp_get_code":{"code_sha256":"af440c67b16afe67"}},{"arxiv_id":"2411.07506","paper":"/paper/fm-ts-flow-matching-for-time-series","title":"FM-TS: Flow Matching for Time Series Generation","date":"2024-11-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"unites-lab/fmts","path":"FMTS/Models/interpretable_diffusion/transformer.py","file_url":"https://github.com/unites-lab/fmts/blob/HEAD/FMTS/Models/interpretable_diffusion/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6f50094115053323","mcp_get_code":{"code_sha256":"6f50094115053323"}},{"arxiv_id":"2411.07176","paper":"/paper/more-expressive-attention-with-negative","title":"More Expressive Attention with Negative Weights","date":"2024-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"trestad/cogattn","path":"Cogformer/attention.py","file_url":"https://github.com/trestad/cogattn/blob/HEAD/Cogformer/attention.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0bde543b9fcfa17c","mcp_get_code":{"code_sha256":"0bde543b9fcfa17c"}},{"arxiv_id":"2411.06790","paper":"/paper/large-scale-moral-machine-experiment-on-large","title":"Large-scale moral machine experiment on large language models","date":"2024-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kztakemoto/mmllm","path":"llama/model.py","file_url":"https://github.com/kztakemoto/mmllm/blob/HEAD/llama/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7f04dbcdf72d68fd","mcp_get_code":{"code_sha256":"7f04dbcdf72d68fd"}},{"arxiv_id":"2411.04165","paper":"/paper/bio-xlstm-generative-modeling-representation","title":"Bio-xLSTM: Generative modeling, representation and in-context learning of biological and chemical sequences","date":"2024-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ml-jku/prot-xlstm","path":"protxlstm/xlstm/components/rotary_position.py","file_url":"https://github.com/ml-jku/prot-xlstm/blob/HEAD/protxlstm/xlstm/components/rotary_position.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ac829870c326eb73","mcp_get_code":{"code_sha256":"ac829870c326eb73"}},{"arxiv_id":"2410.23856","paper":"/paper/can-language-models-perform-robust-reasoning","title":"Can Language Models Perform Robust Reasoning in Chain-of-thought Prompting with Noisy Rationales?","date":"2024-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tmlr-group/NoisyRationales","path":"llm_model/llama/model.py","file_url":"https://github.com/tmlr-group/NoisyRationales/blob/HEAD/llm_model/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2410.15495","paper":"/paper/sea-state-exchange-attention-for-high","title":"SEA: State-Exchange Attention for High-Fidelity Physics Based Transformers","date":"2024-10-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"parsaesmati/sea","path":"models/temporal.py","file_url":"https://github.com/parsaesmati/sea/blob/HEAD/models/temporal.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC0-1.0","inline_ok":true,"code_sha256_prefix":"397ac9f96a533830","mcp_get_code":{"code_sha256":"397ac9f96a533830"}},{"arxiv_id":"2410.11623","paper":"/paper/videgothink-assessing-egocentric-video","title":"VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"adacheng/egothink","path":"models/llama_adapter_v2/llama.py","file_url":"https://github.com/adacheng/egothink/blob/HEAD/models/llama_adapter_v2/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2410.06511","paper":"/paper/torchtitan-one-stop-pytorch-native-solution","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eth-easl/torchtitan-mixtera","path":"torchtitan/models/llama3/model.py","file_url":"https://github.com/eth-easl/torchtitan-mixtera/blob/HEAD/torchtitan/models/llama3/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"694cae018d480543","mcp_get_code":{"code_sha256":"694cae018d480543"}},{"arxiv_id":"2410.03996","paper":"/paper/on-the-influence-of-gender-and-race-in","title":"On the Influence of Gender and Race in Romantic Relationship Prediction from Large Language Models","date":"2024-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/llama","path":"llama/model.py","file_url":"https://github.com/facebookresearch/llama/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2410.02705","paper":"/paper/controlar-controllable-image-generation-with","title":"ControlAR: Controllable Image Generation with Autoregressive Models","date":"2024-10-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hustvl/controlar","path":"autoregressive/models/gpt.py","file_url":"https://github.com/hustvl/controlar/blob/HEAD/autoregressive/models/gpt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"29173bf6147634f3","mcp_get_code":{"code_sha256":"29173bf6147634f3"}},{"arxiv_id":"2409.17027","paper":"/paper/counterfactual-token-generation-in-large","title":"Counterfactual Token Generation in Large Language Models","date":"2024-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"networks-learning/counterfactual-llms","path":"src/mistral-inference/moe_one_file_ref.py","file_url":"https://github.com/networks-learning/counterfactual-llms/blob/HEAD/src/mistral-inference/moe_one_file_ref.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"22426d7eecb70410","mcp_get_code":{"code_sha256":"22426d7eecb70410"}},{"arxiv_id":"2408.15980","paper":"/paper/in-context-imitation-learning-via-next-token","title":"In-Context Imitation Learning via Next-Token Prediction","date":"2024-08-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Max-Fu/icrt","path":"icrt/models/policy/llama.py","file_url":"https://github.com/Max-Fu/icrt/blob/HEAD/icrt/models/policy/llama.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"373a3280ff76d40d","mcp_get_code":{"code_sha256":"373a3280ff76d40d"}},{"arxiv_id":"2408.15689","paper":"/paper/tempoformer-a-transformer-for-temporally","title":"TempoFormer: A Transformer for Temporally-aware Representations in Change Detection","date":"2024-08-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ttseriotou/tempoformer","path":"models/rope_mha.py","file_url":"https://github.com/ttseriotou/tempoformer/blob/HEAD/models/rope_mha.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f8e7f6458d0c02ff","mcp_get_code":{"code_sha256":"f8e7f6458d0c02ff"}},{"arxiv_id":"2408.11039","paper":"/paper/transfusion-predict-the-next-token-and","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VachanVY/Transfusion.torch","path":"src/llama2c.py","file_url":"https://github.com/VachanVY/Transfusion.torch/blob/HEAD/src/llama2c.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30c8848624ea177f","mcp_get_code":{"code_sha256":"30c8848624ea177f"}},{"arxiv_id":"2408.07092","paper":"/paper/post-training-sparse-attention-with-double","title":"Post-Training Sparse Attention with Double Sparsity","date":"2024-08-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"andy-yang-1/doublesparse","path":"models/model.py","file_url":"https://github.com/andy-yang-1/doublesparse/blob/HEAD/models/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1102ffb719fa5cde","mcp_get_code":{"code_sha256":"1102ffb719fa5cde"}},{"arxiv_id":"2408.01933","paper":"/paper/2408-01933","title":"DiReCT: Diagnostic Reasoning for Clinical Notes via Large Language Models","date":"2024-08-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wbw520/DiReCT","path":"llama/model.py","file_url":"https://github.com/wbw520/DiReCT/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2407.15051","paper":"/paper/prior-knowledge-integration-via-llm-encoding","title":"Prior Knowledge Integration via LLM Encoding and Pseudo Event Regulation for Video Moment Retrieval","date":"2024-07-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fletcherjiang/llmepet","path":"llm_epet/llama.py","file_url":"https://github.com/fletcherjiang/llmepet/blob/HEAD/llm_epet/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2406.16793","paper":"/paper/adam-mini-use-fewer-learning-rates-to-gain","title":"Adam-mini: Use Fewer Learning Rates To Gain More","date":"2024-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zyushun/adam-mini","path":"examples/llama/torchtitan/models/llama/model.py","file_url":"https://github.com/zyushun/adam-mini/blob/HEAD/examples/llama/torchtitan/models/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f5349a28fe475e9b","mcp_get_code":{"code_sha256":"f5349a28fe475e9b"}},{"arxiv_id":"2406.12288","paper":"/paper/an-investigation-of-neuron-activation-as-a","title":"An Investigation of Neuron Activation as a Unified Lens to Explain Chain-of-Thought Eliciting Arithmetic Reasoning of LLMs","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dakingrai/neuron-analysis-cot-arithmetic-reasoning","path":"llama/model.py","file_url":"https://github.com/dakingrai/neuron-analysis-cot-arithmetic-reasoning/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2406.10471","paper":"/paper/personalized-pieces-efficient-personalized","title":"Personalized Pieces: Efficient Personalized Large Language Models through Collaborative Efforts","date":"2024-06-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TamSiuhin/Per-Pcs","path":"llama/model.py","file_url":"https://github.com/TamSiuhin/Per-Pcs/blob/HEAD/llama/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0744ae2f10dfde4f","mcp_get_code":{"code_sha256":"0744ae2f10dfde4f"}},{"arxiv_id":"2406.10056","paper":"/paper/uniaudio-1-5-large-language-model-driven","title":"UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner","date":null,"month_inferred_from_arxiv_id":"2024-06","title_source":"archive","repo":"yangdongchao/llm-codec","path":"llama_inference/llama/model.py","file_url":"https://github.com/yangdongchao/llm-codec/blob/HEAD/llama_inference/llama/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7f04dbcdf72d68fd","mcp_get_code":{"code_sha256":"7f04dbcdf72d68fd"}},{"arxiv_id":"2406.04329","paper":"/paper/simplified-and-generalized-masked-diffusion","title":"Simplified and Generalized Masked Diffusion for Discrete Data","date":"2024-06-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"google-deepmind/md4","path":"md4/models/diffusion/md4.py","file_url":"https://github.com/google-deepmind/md4/blob/HEAD/md4/models/diffusion/md4.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"582256db3844c9de","mcp_get_code":{"code_sha256":"582256db3844c9de"}},{"arxiv_id":"2406.02255","paper":"/paper/midicaps-a-large-scale-midi-dataset-with-text","title":"MidiCaps: A large-scale MIDI dataset with text captions","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amaai-lab/t2m-inferalign","path":"Text2midi/model/transformer_model.py","file_url":"https://github.com/amaai-lab/t2m-inferalign/blob/HEAD/Text2midi/model/transformer_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"24ced75a01bea6eb","mcp_get_code":{"code_sha256":"24ced75a01bea6eb"}},{"arxiv_id":"2405.18400","paper":"/paper/superposed-decoding-multiple-generations-from","title":"Superposed Decoding: Multiple Generations from a Single Autoregressive Inference Pass","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RAIVNLab/SuperposedDecoding","path":"superposed/llama/model.py","file_url":"https://github.com/RAIVNLab/SuperposedDecoding/blob/HEAD/superposed/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2405.18392","paper":"/paper/scaling-laws-and-compute-optimal-training","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"epfml/schedules-and-scaling","path":"src/models/llama.py","file_url":"https://github.com/epfml/schedules-and-scaling/blob/HEAD/src/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9891174b43bd9c9a","mcp_get_code":{"code_sha256":"9891174b43bd9c9a"}},{"arxiv_id":"2405.16727","paper":"/paper/disentangling-and-integrating-relational-and","title":"Disentangling and Integrating Relational and Sensory Information in Transformer Architectures","date":"2024-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"awni00/abstract_transformer","path":"dual_attention_transformer.py","file_url":"https://github.com/awni00/abstract_transformer/blob/HEAD/dual_attention_transformer.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6dc1f541b73c3081","mcp_get_code":{"code_sha256":"6dc1f541b73c3081"}},{"arxiv_id":"2405.16727","paper":"/paper/disentangling-and-integrating-relational-and","title":"Disentangling and Integrating Relational and Sensory Information in Transformer Architectures","date":"2024-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"awni00/dual-attention","path":"dual_attention/dual_attention.py","file_url":"https://github.com/awni00/dual-attention/blob/HEAD/dual_attention/dual_attention.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dd15a61ea3d0e604","mcp_get_code":{"code_sha256":"dd15a61ea3d0e604"}},{"arxiv_id":"2405.13911","paper":"/paper/topa-extend-large-language-models-for-video","title":"TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment","date":"2024-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2405.10587","paper":"/paper/rdrec-rationale-distillation-for-llm-based","title":"RDRec: Rationale Distillation for LLM-based Recommendation","date":"2024-05-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"WangXFng/RDRec","path":"llama/llama/model.py","file_url":"https://github.com/WangXFng/RDRec/blob/HEAD/llama/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2405.05615","paper":"/paper/memory-space-visual-prompting-for-efficient","title":"Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jieshibo/memvp","path":"memvp/model.py","file_url":"https://github.com/jieshibo/memvp/blob/HEAD/memvp/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2404.07990","paper":"/paper/openbias-open-set-bias-detection-in-text-to","title":"OpenBias: Open-set Bias Detection in Text-to-Image Generative Models","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"picsart-ai-research/openbias","path":"llama/model.py","file_url":"https://github.com/picsart-ai-research/openbias/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2404.06773","paper":"/paper/adapting-llama-decoder-to-vision-transformer","title":"Adapting LLaMA Decoder to Vision Transformer","date":"2024-04-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"techmonsterwang/illama","path":"models/illama.py","file_url":"https://github.com/techmonsterwang/illama/blob/HEAD/models/illama.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5412a244b5b49ca7","mcp_get_code":{"code_sha256":"5412a244b5b49ca7"}},{"arxiv_id":"2404.01933","paper":"/paper/prego-online-mistake-detection-in-procedural","title":"PREGO: online mistake detection in PRocedural EGOcentric videos","date":"2024-04-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aleflabo/PREGO","path":"step_anticipation/llama/model.py","file_url":"https://github.com/aleflabo/PREGO/blob/HEAD/step_anticipation/llama/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"21b59364b1cadbc8","mcp_get_code":{"code_sha256":"21b59364b1cadbc8"}},{"arxiv_id":"2403.19589","paper":"/paper/tod3cap-towards-3d-dense-captioning-in","title":"TOD3Cap: Towards 3D Dense Captioning in Outdoor Scenes","date":"2024-03-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jxbbb/tod3cap","path":"tod3cap_camera/llama/llama.py","file_url":"https://github.com/jxbbb/tod3cap/blob/HEAD/tod3cap_camera/llama/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2403.17343","paper":"/paper/language-models-are-free-boosters-for","title":"Residual-based Language Models are Free Boosters for Biomedical Imaging","date":"2024-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhixinlai/llmboostmedical","path":"2D_classification/models/llama.py","file_url":"https://github.com/zhixinlai/llmboostmedical/blob/HEAD/2D_classification/models/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2403.08293","paper":"/paper/generative-pretrained-structured-transformers","title":"Generative Pretrained Structured Transformers: Unsupervised Syntactic Language Models at Scale","date":"2024-03-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alipay/StructuredLM_RTDT","path":"model/Llama_flash_attn.py","file_url":"https://github.com/alipay/StructuredLM_RTDT/blob/HEAD/model/Llama_flash_attn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a1ac0c11d14eec67","mcp_get_code":{"code_sha256":"a1ac0c11d14eec67"}},{"arxiv_id":"2403.00522","paper":"/paper/visionllama-a-unified-llama-interface-for","title":"VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks","date":"2024-03-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"meituan-automl/visionllama","path":"deit/model_llama.py","file_url":"https://github.com/meituan-automl/visionllama/blob/HEAD/deit/model_llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2402.16181","paper":"/paper/how-can-llm-guide-rl-a-value-based-approach","title":"How Can LLM Guide RL? A Value-Based Approach","date":"2024-02-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"agentification/language-integrated-vi","path":"blocksworld/llama/model.py","file_url":"https://github.com/agentification/language-integrated-vi/blob/HEAD/blocksworld/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2402.10631","paper":"/paper/bitdistiller-unleashing-the-potential-of-sub","title":"BitDistiller: Unleashing the Potential of Sub-4-Bit LLMs via Self-Distillation","date":"2024-02-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dd-duda/bitdistiller","path":"inference/models/llama.py","file_url":"https://github.com/dd-duda/bitdistiller/blob/HEAD/inference/models/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"797af70a155dd94f","mcp_get_code":{"code_sha256":"797af70a155dd94f"}},{"arxiv_id":"2402.09181","paper":"/paper/omnimedvqa-a-new-large-scale-comprehensive","title":"OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM","date":"2024-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/multi-modality-arena","path":"LVLM_evaluation/Multi_turn_Reasoning/lib/llama.py","file_url":"https://github.com/opengvlab/multi-modality-arena/blob/HEAD/LVLM_evaluation/Multi_turn_Reasoning/lib/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2402.09181","paper":"/paper/omnimedvqa-a-new-large-scale-comprehensive","title":"OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM","date":"2024-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/multi-modality-arena","path":"LVLM_evaluation/Multi_turn_Reasoning/LLaMA-Adapter-v2/models_mae.py","file_url":"https://github.com/opengvlab/multi-modality-arena/blob/HEAD/LVLM_evaluation/Multi_turn_Reasoning/LLaMA-Adapter-v2/models_mae.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9736f07175994fde","mcp_get_code":{"code_sha256":"9736f07175994fde"}},{"arxiv_id":"2402.08268","paper":"/paper/world-model-on-million-length-video-and","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","date":"2024-02-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LargeWorldModel/LWM","path":"lwm/llama.py","file_url":"https://github.com/LargeWorldModel/LWM/blob/HEAD/lwm/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a305ca669a9cacf3","mcp_get_code":{"code_sha256":"a305ca669a9cacf3"}},{"arxiv_id":"2402.06700","paper":"/paper/entropy-regularized-token-level-policy","title":"Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement","date":"2024-02-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"morning9393/etpo","path":"etpo/models/codellama/model.py","file_url":"https://github.com/morning9393/etpo/blob/HEAD/etpo/models/codellama/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ed8b68645cfd07e0","mcp_get_code":{"code_sha256":"ed8b68645cfd07e0"}},{"arxiv_id":"2402.05935","paper":"/paper/sphinx-x-scaling-data-and-parameters-for-a","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","date":"2024-02-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alpha-vllm/llama2-accessory","path":"accessory/model/LLM/llama.py","file_url":"https://github.com/alpha-vllm/llama2-accessory/blob/HEAD/accessory/model/LLM/llama.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"dcae39c8928b5fd8","mcp_get_code":{"code_sha256":"dcae39c8928b5fd8"}},{"arxiv_id":"2401.05215","paper":"/paper/pre-trained-large-language-models-for-1","title":"Pre-trained Large Language Models for Financial Sentiment Analysis","date":"2024-01-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luosting/LLaMA-Financial-sentiment-analysis","path":"llm-sentiment-analysis-main/llama/model.py","file_url":"https://github.com/luosting/LLaMA-Financial-sentiment-analysis/blob/HEAD/llm-sentiment-analysis-main/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2312.03700","paper":"/paper/onellm-one-framework-to-align-all-modalities","title":"OneLLM: One Framework to Align All Modalities with Language","date":"2023-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"csuhan/onellm","path":"model/LLM/onellm.py","file_url":"https://github.com/csuhan/onellm/blob/HEAD/model/LLM/onellm.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2312.00025","paper":"/paper/secure-transformer-inference","title":"Secure Transformer Inference Protocol","date":"2023-11-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuanmu97/secure-transformer-inference","path":"model.py","file_url":"https://github.com/yuanmu97/secure-transformer-inference/blob/HEAD/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2311.08268","paper":"/paper/a-wolf-in-sheep-s-clothing-generalized-nested","title":"A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily","date":"2023-11-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NJUNLP/ReNeLLM","path":"llama/llama/model.py","file_url":"https://github.com/NJUNLP/ReNeLLM/blob/HEAD/llama/llama/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7f04dbcdf72d68fd","mcp_get_code":{"code_sha256":"7f04dbcdf72d68fd"}},{"arxiv_id":"2311.07575","paper":"/paper/sphinx-the-joint-mixing-of-weights-tasks-and","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","date":"2023-11-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"dcae39c8928b5fd8","mcp_get_code":{"code_sha256":"dcae39c8928b5fd8"}},{"arxiv_id":"2310.19698","paper":"/paper/when-do-prompting-and-prefix-tuning-work-a","title":"When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations","date":"2023-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aleksandarpetrov/prefix-tuning-theory","path":"llama/llama/model.py","file_url":"https://github.com/aleksandarpetrov/prefix-tuning-theory/blob/HEAD/llama/llama/model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"02d0a7c24b7aa390","mcp_get_code":{"code_sha256":"02d0a7c24b7aa390"}},{"arxiv_id":"2310.12973","paper":"/paper/frozen-transformers-in-language-models-are","title":"Frozen Transformers in Language Models Are Effective Visual Encoder Layers","date":"2023-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ziqipang/lm4visualencoding","path":"image_classification/models/llama.py","file_url":"https://github.com/ziqipang/lm4visualencoding/blob/HEAD/image_classification/models/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2310.11374","paper":"/paper/dialoguellm-context-and-emotion-knowledge","title":"DialogueLLM: Context and Emotion Knowledge-Tuned Large Language Models for Emotion Recognition in Conversations","date":"2023-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Dreamyao516/DialogueLLM","path":"llama/model.py","file_url":"https://github.com/Dreamyao516/DialogueLLM/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d7b6dcfe63bfe59b","mcp_get_code":{"code_sha256":"d7b6dcfe63bfe59b"}},{"arxiv_id":"2310.06825","paper":"/paper/mistral-7b","title":"Mistral 7B","date":"2023-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mistralai/mistral-src","path":"src/mistral_inference/rope.py","file_url":"https://github.com/mistralai/mistral-src/blob/HEAD/src/mistral_inference/rope.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0539a5035c30fa83","mcp_get_code":{"code_sha256":"0539a5035c30fa83"}},{"arxiv_id":"2310.03185","paper":"/paper/misusing-tools-in-large-language-models-with","title":"Misusing Tools in Large Language Models With Visual Adversarial Examples","date":"2023-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZihanWangKi/VLMToolMisuse","path":"llama_adapter/llama.py","file_url":"https://github.com/ZihanWangKi/VLMToolMisuse/blob/HEAD/llama_adapter/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2309.00615","paper":"/paper/point-bind-point-llm-aligning-point-cloud","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","date":"2023-09-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ziyuguo99/point-bind_point-llm","path":"Point-LLM/llama/llama.py","file_url":"https://github.com/ziyuguo99/point-bind_point-llm/blob/HEAD/Point-LLM/llama/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2309.00638","paper":"/paper/generative-ai-for-end-to-end-limit-order-book","title":"Generative AI for End-to-End Limit Order Book Modelling: A Token-Level Autoregressive Generative Model of Message Flow Using a Deep State Space Network","date":"2023-08-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aaron-wheeler/marketgpt","path":"equities/fast_model.py","file_url":"https://github.com/aaron-wheeler/marketgpt/blob/HEAD/equities/fast_model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"af440c67b16afe67","mcp_get_code":{"code_sha256":"af440c67b16afe67"}},{"arxiv_id":"2308.12950","paper":"/paper/code-llama-open-foundation-models-for-code","title":"Code Llama: Open Foundation Models for Code","date":"2023-08-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/codellama","path":"llama/model.py","file_url":"https://github.com/facebookresearch/codellama/blob/HEAD/llama/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ed8b68645cfd07e0","mcp_get_code":{"code_sha256":"ed8b68645cfd07e0"}},{"arxiv_id":"2308.11276","paper":"/paper/music-understanding-llama-advancing-text-to","title":"Music Understanding LLaMA: Advancing Text-to-Music Generation with Question Answering and Captioning","date":"2023-08-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"crypto-code/mu-llama","path":"MU-LLaMA/llama/llama.py","file_url":"https://github.com/crypto-code/mu-llama/blob/HEAD/MU-LLaMA/llama/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2308.06595","paper":"/paper/visit-bench-a-benchmark-for-vision-language","title":"VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use","date":"2023-08-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlfoundations/VisIT-Bench","path":"baselines/llama_adapter_v2_utils/llama.py","file_url":"https://github.com/mlfoundations/VisIT-Bench/blob/HEAD/baselines/llama_adapter_v2_utils/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2307.09288","paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IBM/Dromedary","path":"llama_dromedary/llama_dromedary/model.py","file_url":"https://github.com/IBM/Dromedary/blob/HEAD/llama_dromedary/llama_dromedary/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2307.03170","paper":"/paper/focused-transformer-contrastive-training-for","title":"Focused Transformer: Contrastive Training for Context Scaling","date":"2023-07-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CStanKonrad/long_llama","path":"fot_continued_pretraining/EasyLM/models/llama/llama_model.py","file_url":"https://github.com/CStanKonrad/long_llama/blob/HEAD/fot_continued_pretraining/EasyLM/models/llama/llama_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a305ca669a9cacf3","mcp_get_code":{"code_sha256":"a305ca669a9cacf3"}},{"arxiv_id":"2303.09736","paper":"/paper/dynamic-structure-pruning-for-compressing","title":"Dynamic Structure Pruning for Compressing CNNs","date":"2023-03-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pytorch/examples","path":"distributed/tensor_parallelism/llama2_model.py","file_url":"https://github.com/pytorch/examples/blob/HEAD/distributed/tensor_parallelism/llama2_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"468aaad299edb475","mcp_get_code":{"code_sha256":"468aaad299edb475"}},{"arxiv_id":"2302.13971","paper":"/paper/llama-open-and-efficient-foundation-language-1","title":"LLaMA: Open and Efficient Foundation Language Models","date":"2023-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"young-geng/easylm","path":"EasyLM/models/llama/llama_model.py","file_url":"https://github.com/young-geng/easylm/blob/HEAD/EasyLM/models/llama/llama_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f280056a639ae634","mcp_get_code":{"code_sha256":"f280056a639ae634"}},{"arxiv_id":"2302.02676","paper":"/paper/languages-are-rewards-hindsight-finetuning","title":"Chain of Hindsight Aligns Language Models with Feedback","date":"2023-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lhao499/CoH","path":"coh/llama.py","file_url":"https://github.com/lhao499/CoH/blob/HEAD/coh/llama.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a305ca669a9cacf3","mcp_get_code":{"code_sha256":"a305ca669a9cacf3"}},{"arxiv_id":"2203.15556","paper":"/paper/training-compute-optimal-large-language","title":"Training Compute-Optimal Large Language Models","date":"2022-03-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"af440c67b16afe67","mcp_get_code":{"code_sha256":"af440c67b16afe67"}},{"arxiv_id":"2104.09864","paper":"/paper/roformer-enhanced-transformer-with-rotary","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","date":"2021-04-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"varungumma/fairseq","path":"fairseq/modules/rotary_embedding.py","file_url":"https://github.com/varungumma/fairseq/blob/HEAD/fairseq/modules/rotary_embedding.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"60f6b43d9fa0bb55","mcp_get_code":{"code_sha256":"60f6b43d9fa0bb55"}},{"arxiv_id":"2104.09864","paper":"/paper/roformer-enhanced-transformer-with-rotary","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","date":"2021-04-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucidrains/rotary-embedding-torch","path":"rotary_embedding_torch/rotary_embedding_torch.py","file_url":"https://github.com/lucidrains/rotary-embedding-torch/blob/HEAD/rotary_embedding_torch/rotary_embedding_torch.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0a495c8bcfb0380b","mcp_get_code":{"code_sha256":"0a495c8bcfb0380b"}},{"arxiv_id":"openreview_XzsZK1hvpv","paper":null,"title":"arXiv:openreview_XzsZK1hvpv","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"9yc/Reflex","path":"reflex/layers/rope.py","file_url":"https://github.com/9yc/Reflex/blob/HEAD/reflex/layers/rope.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6823a4feed06e08c","mcp_get_code":{"code_sha256":"6823a4feed06e08c"}},{"arxiv_id":"Chung_Fine-Tuning_Visual_Autogressive_Models_for_Subject-Driven_Generation_ICCV_2025_paper","paper":null,"title":"arXiv:Chung_Fine-Tuning_Visual_Autogressive_Models_for_Subject-Driven_Generation_ICCV_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"jiwoogit/ARBooth","path":"infinity/models/basic.py","file_url":"https://github.com/jiwoogit/ARBooth/blob/HEAD/infinity/models/basic.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"42125baaa5c021b6","mcp_get_code":{"code_sha256":"42125baaa5c021b6"}},{"arxiv_id":"2025.findings-acl.979","paper":null,"title":"arXiv:2025.findings-acl.979","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Mrshenshen/FRUIT","path":"models/llama_adapter_v2/llama.py","file_url":"https://github.com/Mrshenshen/FRUIT/blob/HEAD/models/llama_adapter_v2/llama.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}},{"arxiv_id":"2023.emnlp-main.534","paper":null,"title":"arXiv:2023.emnlp-main.534","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"PreferredAI/superposed-topics","path":"llama/model.py","file_url":"https://github.com/PreferredAI/superposed-topics/blob/HEAD/llama/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b47d48e431b34acd","mcp_get_code":{"code_sha256":"b47d48e431b34acd"}}]}