{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/get-2d-sincos-pos-embed","entry":"get_2d_sincos_pos_embed","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":170,"n_papers_ran":111,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":76,"n_samples_ran":44,"n_samples_fingerprinted":14,"n_places":177,"n_places_pointer_only":77,"by_status":{"ran_honours":20,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":5,"ran":19,"unverified":32},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.27066","paper":"/paper/arxiv-2608-27066","title":"Beyond Classification: Task-Dependent Learnability under Privacy-Motivated Image Transformations","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"LeonRanke/Task-Dependent-Learnability","path":"src/models/jpdvt.py","file_url":"https://github.com/LeonRanke/Task-Dependent-Learnability/blob/HEAD/src/models/jpdvt.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"089bdd7a5f8b8da2","mcp_get_code":{"code_sha256":"089bdd7a5f8b8da2"}},{"arxiv_id":"2608.01298","paper":"/paper/arxiv-2608-01298","title":"UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"JN-Yun/UDT","path":"models/UDT.py","file_url":"https://github.com/JN-Yun/UDT/blob/HEAD/models/UDT.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0c991bde9f1d8f95","mcp_get_code":{"code_sha256":"0c991bde9f1d8f95"}},{"arxiv_id":"2607.03349","paper":"/paper/arxiv-2607-03349","title":"PedestrianDiffusion: Multimodal Generative Denoising and Dense State Estimation for Inertial Navigation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"jacklu333333/PedestrianDiffusion","path":"utils/DiT.py","file_url":"https://github.com/jacklu333333/PedestrianDiffusion/blob/HEAD/utils/DiT.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2606.18209","paper":"/paper/arxiv-2606-18209","title":"Rethinking Dataset Distillation for Classification: Do Distilled Sets Outperform Coresets?","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"AyushRoy2001/ManifoldGD","path":"models.py","file_url":"https://github.com/AyushRoy2001/ManifoldGD/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2606.14791","paper":"/paper/arxiv-2606-14791","title":"From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Freyliu0516/audioPG","path":"models/audiomae.py","file_url":"https://github.com/Freyliu0516/audioPG/blob/HEAD/models/audiomae.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d523f56182d4a4ec","mcp_get_code":{"code_sha256":"d523f56182d4a4ec"}},{"arxiv_id":"2606.08063","paper":"/paper/arxiv-2606-08063","title":"Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"jqtangust/Robust-U1","path":"modeling/modeling/bagel/modeling_utils.py","file_url":"https://github.com/jqtangust/Robust-U1/blob/HEAD/modeling/modeling/bagel/modeling_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"58f584dfd7b8fc3f","mcp_get_code":{"code_sha256":"58f584dfd7b8fc3f"}},{"arxiv_id":"2606.06164","paper":"/paper/arxiv-2606-06164","title":"On the training of physics-informed neural operators for solving parametric partial differential equations","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"NanxiiChen/PI-CViT","path":"ldc/film_cvit.py","file_url":"https://github.com/NanxiiChen/PI-CViT/blob/HEAD/ldc/film_cvit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1651ef558fa6fbe9","mcp_get_code":{"code_sha256":"1651ef558fa6fbe9"}},{"arxiv_id":"2605.18903","paper":"/paper/arxiv-2605-18903","title":"Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"lluosi/RDB-CL","path":"ETrain/Models/Qwen/visual.py","file_url":"https://github.com/lluosi/RDB-CL/blob/HEAD/ETrain/Models/Qwen/visual.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2605.08724","paper":"/paper/arxiv-2605-08724","title":"SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"piooip/SynerMedGen","path":"modeling/bagel/modeling_utils.py","file_url":"https://github.com/piooip/SynerMedGen/blob/HEAD/modeling/bagel/modeling_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58f584dfd7b8fc3f","mcp_get_code":{"code_sha256":"58f584dfd7b8fc3f"}},{"arxiv_id":"2603.05528","paper":"/paper/arxiv-2603-05528","title":"Omni-C: Compressing Heterogeneous Modalities into a Single Dense Encoder","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"StevenLauHKHK/Omni-C","path":"models/SimCLR_ViT_SBoRA.py","file_url":"https://github.com/StevenLauHKHK/Omni-C/blob/HEAD/models/SimCLR_ViT_SBoRA.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"da62d544690e3297","mcp_get_code":{"code_sha256":"da62d544690e3297"}},{"arxiv_id":"2603.01759","paper":"/paper/arxiv-2603-01759","title":"Meta-Learning Hyperparameters for Parameter Efficient Fine-Tuning","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"doem97/metalora","path":"models/satmae_vit.py","file_url":"https://github.com/doem97/metalora/blob/HEAD/models/satmae_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2602.02603","paper":"/paper/arxiv-2602-02603","title":"EchoJEPA: A Latent Predictive Foundation Model for Echocardiography","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"bowang-lab/EchoJEPA","path":"src/models/predictor.py","file_url":"https://github.com/bowang-lab/EchoJEPA/blob/HEAD/src/models/predictor.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"49954bacf90c9e2f","mcp_get_code":{"code_sha256":"49954bacf90c9e2f"}},{"arxiv_id":"2601.19541","paper":"/paper/arxiv-2601-19541","title":"GenCP: TOWARDS GENERATIVE MODELING PARADIGM OF COUPLED PHYSICS","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"AI4Science-WestlakeU/GenCP","path":"GenCP/model/SiT_FNO.py","file_url":"https://github.com/AI4Science-WestlakeU/GenCP/blob/HEAD/GenCP/model/SiT_FNO.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"567378fae3bf4b18","mcp_get_code":{"code_sha256":"567378fae3bf4b18"}},{"arxiv_id":"2601.11522","paper":"/paper/arxiv-2601-11522","title":"UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"ZrH42/UniX","path":"modeling/unix/modeling_utils.py","file_url":"https://github.com/ZrH42/UniX/blob/HEAD/modeling/unix/modeling_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"58f584dfd7b8fc3f","mcp_get_code":{"code_sha256":"58f584dfd7b8fc3f"}},{"arxiv_id":"2601.07773","paper":"/paper/arxiv-2601-07773","title":"Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"csslc/Self-Transcendence","path":"models/sit_selftrans_model.py","file_url":"https://github.com/csslc/Self-Transcendence/blob/HEAD/models/sit_selftrans_model.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1df7f271ba4dbf2a","mcp_get_code":{"code_sha256":"1df7f271ba4dbf2a"}},{"arxiv_id":"2601.02289","paper":"/paper/arxiv-2601-02289","title":"Rank-based Geographical Regularization: Revisiting Contrastive Self-Supervised Learning for Multispectral Remote Sensing Imagery","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"tomburgert/georank","path":"models/croma_backbone.py","file_url":"https://github.com/tomburgert/georank/blob/HEAD/models/croma_backbone.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"02baef54967693b0","mcp_get_code":{"code_sha256":"02baef54967693b0"}},{"arxiv_id":"2512.14395","paper":"/paper/arxiv-2512-14395","title":"Massive Editing for Large Language Models Based on Dynamic Weight Generation","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"RodeWayne/MeG-for-Knowledge-Editing","path":"my_model_five_bert_text.py","file_url":"https://github.com/RodeWayne/MeG-for-Knowledge-Editing/blob/HEAD/my_model_five_bert_text.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2511.16315","paper":"/paper/arxiv-2511-16315","title":"BioBench: A Blueprint to Move Beyond ImageNet for Scientific ML Benchmarks","date":null,"month_inferred_from_arxiv_id":"2025-11","title_source":"syntology","repo":"samuelstevens/biobench","path":"src/biobench/vjepa.py","file_url":"https://github.com/samuelstevens/biobench/blob/HEAD/src/biobench/vjepa.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a4c366543709f6a4","mcp_get_code":{"code_sha256":"a4c366543709f6a4"}},{"arxiv_id":"2510.24103","paper":"/paper/arxiv-2510-24103","title":"Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"pantheon5100/mgaudio","path":"mgaudio_model.py","file_url":"https://github.com/pantheon5100/mgaudio/blob/HEAD/mgaudio_model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bfa0b8db19887db1","mcp_get_code":{"code_sha256":"bfa0b8db19887db1"}},{"arxiv_id":"2510.02216","paper":"/paper/arxiv-2510-02216","title":"Diffusion Transformers for Imputation: Statistical Efficiency and Uncertainty Quantification","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"liamyzq/DiT_time_series_imputation","path":"model.py","file_url":"https://github.com/liamyzq/DiT_time_series_imputation/blob/HEAD/model.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"02e4b2a21f4549f3","mcp_get_code":{"code_sha256":"02e4b2a21f4549f3"}},{"arxiv_id":"2508.10298","paper":"/paper/arxiv-2508-10298","title":"SynBrain: Enhancing Visual-to-fMRI Synthesis via Probabilistic Representation Learning","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"MichaelMaiii/SynBrain","path":"src/s2n/sit.py","file_url":"https://github.com/MichaelMaiii/SynBrain/blob/HEAD/src/s2n/sit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2508.07626","paper":"/paper/arxiv-2508-07626","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"idejie/ar","path":"models/ar/transformer_utils.py","file_url":"https://github.com/idejie/ar/blob/HEAD/models/ar/transformer_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e123b38c0bebea84","mcp_get_code":{"code_sha256":"e123b38c0bebea84"}},{"arxiv_id":"2508.05606","paper":"/paper/arxiv-2508-05606","title":"Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"Fr0zenCrane/UniCoT","path":"modeling/bagel/modeling_utils.py","file_url":"https://github.com/Fr0zenCrane/UniCoT/blob/HEAD/modeling/bagel/modeling_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58f584dfd7b8fc3f","mcp_get_code":{"code_sha256":"58f584dfd7b8fc3f"}},{"arxiv_id":"2506.22637","paper":"/paper/cao-2-rectifying-inconsistencies-in-diffusion","title":"CaO$_2$: Rectifying Inconsistencies in Diffusion-Based Dataset Distillation","date":"2025-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hatchetproject/cao2","path":"models.py","file_url":"https://github.com/hatchetproject/cao2/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2506.21803","paper":null,"title":"arXiv:2506.21803","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"HKU-MedAI/MELP","path":"src/melp/backbone/pos_embed.py","file_url":"https://github.com/HKU-MedAI/MELP/blob/HEAD/src/melp/backbone/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2506.13750","paper":"/paper/test3r-learning-to-reconstruct-3d-at-test","title":"Test3R: Learning to Reconstruct 3D at Test Time","date":"2025-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nopqaq/test3r","path":"croco/models/pos_embed.py","file_url":"https://github.com/nopqaq/test3r/blob/HEAD/croco/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"1ffc5791052dedc3","mcp_get_code":{"code_sha256":"1ffc5791052dedc3"}},{"arxiv_id":"2506.12222","paper":"/paper/sslam-enhancing-self-supervised-models-with-1","title":"SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes","date":"2025-06-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ta012/SSLAM","path":"SSLAM_Inference/models/mae.py","file_url":"https://github.com/ta012/SSLAM/blob/HEAD/SSLAM_Inference/models/mae.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2505.14683","paper":"/paper/emerging-properties-in-unified-multimodal","title":"Emerging Properties in Unified Multimodal Pretraining","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neverbiasu/ComfyUI-BAGEL","path":"modeling/bagel/modeling_utils.py","file_url":"https://github.com/neverbiasu/ComfyUI-BAGEL/blob/HEAD/modeling/bagel/modeling_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"58f584dfd7b8fc3f","mcp_get_code":{"code_sha256":"58f584dfd7b8fc3f"}},{"arxiv_id":"2505.07447","paper":"/paper/unified-continuous-generative-models","title":"Unified Continuous Generative Models","date":"2025-05-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LINs-Lab/UCGM","path":"networks/lightningdit.py","file_url":"https://github.com/LINs-Lab/UCGM/blob/HEAD/networks/lightningdit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2505.01237","paper":"/paper/cav-mae-sync-improving-contrastive-audio","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","date":"2025-05-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"edsonroteia/cav-mae-sync","path":"src/models/cav_mae_sync.py","file_url":"https://github.com/edsonroteia/cav-mae-sync/blob/HEAD/src/models/cav_mae_sync.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-2-Clause","inline_ok":true,"code_sha256_prefix":"ce48ff66703cf492","mcp_get_code":{"code_sha256":"ce48ff66703cf492"}},{"arxiv_id":"2504.12576","paper":"/paper/cm3ae-a-unified-rgb-frame-and-event-voxel","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","date":"2025-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"event-ahu/cm3ae","path":"pos_embed.py","file_url":"https://github.com/event-ahu/cm3ae/blob/HEAD/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2504.11295","paper":"/paper/autoregressive-distillation-of-diffusion","title":"Autoregressive Distillation of Diffusion Transformers","date":"2025-04-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alsdudrla10/ARD","path":"models_ARD.py","file_url":"https://github.com/alsdudrla10/ARD/blob/HEAD/models_ARD.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"475a65e2da357f48","mcp_get_code":{"code_sha256":"475a65e2da357f48"}},{"arxiv_id":"2503.20287","paper":"/paper/insvie-1m-effective-instruction-based-video","title":"InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction","date":"2025-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"langmanbusi/insvie","path":"CogVideo/sat/dit_video_concat.py","file_url":"https://github.com/langmanbusi/insvie/blob/HEAD/CogVideo/sat/dit_video_concat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cdd29f549144d05e","mcp_get_code":{"code_sha256":"cdd29f549144d05e"}},{"arxiv_id":"2503.18746","paper":"/paper/linguistics-aware-masked-image-modeling-for","title":"Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition","date":"2025-03-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhangyifei01/LMIM","path":"lmim_pretrain/models_lmim.py","file_url":"https://github.com/zhangyifei01/LMIM/blob/HEAD/lmim_pretrain/models_lmim.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e21a3ffc70da2192","mcp_get_code":{"code_sha256":"e21a3ffc70da2192"}},{"arxiv_id":"2503.14237","paper":"/paper/make-your-training-flexible-towards","title":"Make Your Training Flexible: Towards Deployment-Efficient Video Models","date":"2025-03-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenGVLab/FluxViT","path":"single_modality/models/pos_embed.py","file_url":"https://github.com/OpenGVLab/FluxViT/blob/HEAD/single_modality/models/pos_embed.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2503.08685","paper":"/paper/principal-components-enable-a-new-language-of","title":"\"Principal Components\" Enable A New Language of Images","date":"2025-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"visual-gen/semanticist","path":"semanticist/stage1/diffusion_transfomer.py","file_url":"https://github.com/visual-gen/semanticist/blob/HEAD/semanticist/stage1/diffusion_transfomer.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2503.08685","paper":"/paper/principal-components-enable-a-new-language-of","title":"\"Principal Components\" Enable A New Language of Images","date":"2025-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"visual-gen/semanticist","path":"semanticist/stage1/pos_embed.py","file_url":"https://github.com/visual-gen/semanticist/blob/HEAD/semanticist/stage1/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2502.05179","paper":"/paper/flashvideo-flowing-fidelity-to-detail-for","title":"FlashVideo:Flowing Fidelity to Detail for Efficient High-Resolution Video Generation","date":"2025-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"foundationvision/flashvideo","path":"flashvideo/dit_video_concat.py","file_url":"https://github.com/foundationvision/flashvideo/blob/HEAD/flashvideo/dit_video_concat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cdd29f549144d05e","mcp_get_code":{"code_sha256":"cdd29f549144d05e"}},{"arxiv_id":"2502.02257","paper":"/paper/unip-rethinking-pre-trained-attention","title":"UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation","date":"2025-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"casiatao/unip","path":"UNIP_pretraining/models_unip.py","file_url":"https://github.com/casiatao/unip/blob/HEAD/UNIP_pretraining/models_unip.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"13358844a2bd12b8","mcp_get_code":{"code_sha256":"13358844a2bd12b8"}},{"arxiv_id":"2502.02150","paper":"/paper/on-the-guidance-of-flow-matching","title":"On the Guidance of Flow Matching","date":"2025-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai4science-westlakeu/flow_guidance","path":"offline_rl/gflower/models_flow/transformer.py","file_url":"https://github.com/ai4science-westlakeu/flow_guidance/blob/HEAD/offline_rl/gflower/models_flow/transformer.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2501.02030","paper":"/paper/detecting-music-performance-errors-with","title":"Detecting Music Performance Errors with Transformers","date":"2025-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ben2002chou/polytune","path":"tasks/polytune_net.py","file_url":"https://github.com/ben2002chou/polytune/blob/HEAD/tasks/polytune_net.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"750c7417aa367366","mcp_get_code":{"code_sha256":"750c7417aa367366"}},{"arxiv_id":"2412.15109","paper":"/paper/predictive-inverse-dynamics-models-are","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","date":null,"month_inferred_from_arxiv_id":"2024-12","title_source":"archive","repo":"openrobotlab/seer","path":"models/vit_mae.py","file_url":"https://github.com/openrobotlab/seer/blob/HEAD/models/vit_mae.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2412.13871","paper":"/paper/llava-uhd-v2-an-mllm-integrating-high","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Feature Pyramid via Hierarchical Window Transformer","date":"2024-12-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thunlp/llava-uhd","path":"llava/model/multimodal_projector/uhd_v1_resampler.py","file_url":"https://github.com/thunlp/llava-uhd/blob/HEAD/llava/model/multimodal_projector/uhd_v1_resampler.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2412.12095","paper":"/paper/causal-diffusion-transformers-for-generative","title":"Causal Diffusion Transformers for Generative Modeling","date":"2024-12-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"causalfusion/causalfusion","path":"models.py","file_url":"https://github.com/causalfusion/causalfusion/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"95e24bd9e56b2417","mcp_get_code":{"code_sha256":"95e24bd9e56b2417"}},{"arxiv_id":"2412.08781","paper":"/paper/generative-modeling-with-explicit-memory","title":"Generative Modeling with Explicit Memory","date":"2024-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lins-lab/gmem","path":"models/lightningdit.py","file_url":"https://github.com/lins-lab/gmem/blob/HEAD/models/lightningdit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2412.05628","paper":"/paper/remix-dit-mixing-diffusion-transformers-for","title":"Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising","date":"2024-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vainf/remix-dit","path":"remix_dit.py","file_url":"https://github.com/vainf/remix-dit/blob/HEAD/remix_dit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2412.05435","paper":"/paper/uniscene-unified-occupancy-centric-driving","title":"UniScene: Unified Occupancy-centric Driving Scene Generation","date":"2024-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"arlo0o/uniscene-unified-occupancy-centric-driving-scene-generation","path":"occupancy_gen/diffusion/models.py","file_url":"https://github.com/arlo0o/uniscene-unified-occupancy-centric-driving-scene-generation/blob/HEAD/occupancy_gen/diffusion/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"244852749ee4a19a","mcp_get_code":{"code_sha256":"244852749ee4a19a"}},{"arxiv_id":"2412.01199","paper":"/paper/tinyfusion-diffusion-transformers-learned","title":"TinyFusion: Diffusion Transformers Learned Shallow","date":"2024-12-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vainf/tinyfusion","path":"models.py","file_url":"https://github.com/vainf/tinyfusion/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2412.00887","paper":"/paper/playable-game-generation","title":"Playable Game Generation","date":"2024-12-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"greatx3/playable-game-generation","path":"network/df/models/diffusion/dit_models.py","file_url":"https://github.com/greatx3/playable-game-generation/blob/HEAD/network/df/models/diffusion/dit_models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2412.00733","paper":"/paper/hallo3-highly-dynamic-and-realistic-portrait","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","date":"2024-12-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fudan-generative-vision/hallo3","path":"hallo3/dit_video_concat.py","file_url":"https://github.com/fudan-generative-vision/hallo3/blob/HEAD/hallo3/dit_video_concat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cdd29f549144d05e","mcp_get_code":{"code_sha256":"cdd29f549144d05e"}},{"arxiv_id":"2411.17616","paper":"/paper/accelerating-vision-diffusion-transformers","title":"Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints","date":"2024-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opensparsellms/skip-dit","path":"class-to-image/models.py","file_url":"https://github.com/opensparsellms/skip-dit/blob/HEAD/class-to-image/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2411.12164","paper":"/paper/urbandit-a-foundation-model-for-open-world","title":"UrbanDiT: A Foundation Model for Open-World Urban Spatio-Temporal Learning","date":"2024-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsinghua-fib-lab/UrbanDiT","path":"src/Embed.py","file_url":"https://github.com/tsinghua-fib-lab/UrbanDiT/blob/HEAD/src/Embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3739773ec6873943","mcp_get_code":{"code_sha256":"3739773ec6873943"}},{"arxiv_id":"2411.11409","paper":"/paper/ikea-manuals-at-work-4d-grounding-of-assembly","title":"IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos","date":"2024-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yunongLiu1/IKEA-Manuals-at-Work","path":"src/IKEAVideo/featurizers/MAE.py","file_url":"https://github.com/yunongLiu1/IKEA-Manuals-at-Work/blob/HEAD/src/IKEAVideo/featurizers/MAE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2411.06959","paper":"/paper/enat-rethinking-spatial-temporal-interactions","title":"ENAT: Rethinking Spatial-temporal Interactions in Token-based Image Synthesis","date":"2024-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leaplabthu/enat","path":"libs/models.py","file_url":"https://github.com/leaplabthu/enat/blob/HEAD/libs/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2411.04168","paper":"/paper/dimsum-diffusion-mamba-a-scalable-and-unified","title":"DiMSUM: Diffusion Mamba -- A Scalable and Unified Spatial-Frequency Method for Image Generation","date":"2024-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VinAIResearch/DiMSUM","path":"dimsum/models_dim.py","file_url":"https://github.com/VinAIResearch/DiMSUM/blob/HEAD/dimsum/models_dim.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2410.21264","paper":"/paper/larp-tokenizing-videos-with-a-learned-1","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","date":"2024-10-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hywang66/LARP","path":"models/embed.py","file_url":"https://github.com/hywang66/LARP/blob/HEAD/models/embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"17acd1617dd8a808","mcp_get_code":{"code_sha256":"17acd1617dd8a808"}},{"arxiv_id":"2410.16794","paper":"/paper/one-step-diffusion-distillation-through-score","title":"One-Step Diffusion Distillation through Score Implicit Matching","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maple-research-lab/sim","path":"models/PixArt.py","file_url":"https://github.com/maple-research-lab/sim/blob/HEAD/models/PixArt.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":true,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"c36f2a890e7ba2d6","mcp_get_code":{"code_sha256":"c36f2a890e7ba2d6"}},{"arxiv_id":"2410.13179","paper":"/paper/eh-mam-easy-to-hard-masked-acoustic-modeling","title":"EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning","date":"2024-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cs20s030/ehmam","path":"models/mae.py","file_url":"https://github.com/cs20s030/ehmam/blob/HEAD/models/mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2410.10815","paper":"/paper/depth-any-video-with-scalable-synthetic-data","title":"Depth Any Video with Scalable Synthetic Data","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Nightmare-n/DepthAnyVideo","path":"dav/models/embeddings.py","file_url":"https://github.com/Nightmare-n/DepthAnyVideo/blob/HEAD/dav/models/embeddings.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"f164270170de7c55","mcp_get_code":{"code_sha256":"f164270170de7c55"}},{"arxiv_id":"2410.09575","paper":"/paper/reconstructive-visual-instruction-tuning","title":"Reconstructive Visual Instruction Tuning","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haochen-wang409/ross","path":"ross/model/utils.py","file_url":"https://github.com/haochen-wang409/ross/blob/HEAD/ross/model/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2410.03456","paper":"/paper/dynamic-diffusion-transformer","title":"Dynamic Diffusion Transformer","date":"2024-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nus-hpc-ai-lab/dynamic-diffusion-transformer","path":"models.py","file_url":"https://github.com/nus-hpc-ai-lab/dynamic-diffusion-transformer/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2410.03160","paper":"/paper/redefining-temporal-modeling-in-video","title":"Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach","date":"2024-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yaofang-liu/fvdm","path":"models/latte.py","file_url":"https://github.com/yaofang-liu/fvdm/blob/HEAD/models/latte.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2410.01723","paper":"/paper/harmonica-harmonizing-training-and-inference","title":"HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration","date":"2024-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"modeltc/harmonica","path":"models/dynamic_models.py","file_url":"https://github.com/modeltc/harmonica/blob/HEAD/models/dynamic_models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2409.19407","paper":"/paper/brain-jepa-brain-dynamics-foundation-model","title":"Brain-JEPA: Brain Dynamics Foundation Model with Gradient Positioning and Spatiotemporal Masking","date":"2024-09-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Eric-LRL/Brain-JEPA","path":"src/models/vision_transformer.py","file_url":"https://github.com/Eric-LRL/Brain-JEPA/blob/HEAD/src/models/vision_transformer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a68afae5536bb319","mcp_get_code":{"code_sha256":"a68afae5536bb319"}},{"arxiv_id":"2409.18128","paper":"/paper/flowturbo-towards-real-time-flow-based-image","title":"FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner","date":"2024-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shiml20/FlowTurbo","path":"models_assemble.py","file_url":"https://github.com/shiml20/FlowTurbo/blob/HEAD/models_assemble.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2409.14538","paper":"/paper/towards-model-agnostic-dataset-condensation","title":"Towards Model-Agnostic Dataset Condensation by Heterogeneous Models","date":"2024-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"KHU-AGI/HMDC","path":"gcn_lib/pos_embed.py","file_url":"https://github.com/KHU-AGI/HMDC/blob/HEAD/gcn_lib/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2409.13079","paper":"/paper/embedding-geometries-of-contrastive-language","title":"Embedding Geometries of Contrastive Language-Image Pre-Training","date":"2024-09-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eify/open_clip","path":"src/open_clip/pos_embed.py","file_url":"https://github.com/eify/open_clip/blob/HEAD/src/open_clip/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2409.11340","paper":"/paper/omnigen-unified-image-generation","title":"OmniGen: Unified Image Generation","date":"2024-09-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vectorspacelab/omnigen","path":"OmniGen/model.py","file_url":"https://github.com/vectorspacelab/omnigen/blob/HEAD/OmniGen/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b9da3bec8fc652d6","mcp_get_code":{"code_sha256":"b9da3bec8fc652d6"}},{"arxiv_id":"2409.10695","paper":"/paper/playground-v3-improving-text-to-image","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","date":"2024-09-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuchuantian/u-dit","path":"models.py","file_url":"https://github.com/yuchuantian/u-dit/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2409.07756","paper":"/paper/ditas-quantizing-diffusion-transformers-via","title":"DiTAS: Quantizing Diffusion Transformers via Enhanced Activation Smoothing","date":"2024-09-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DZY122/DiTAS","path":"models.py","file_url":"https://github.com/DZY122/DiTAS/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2408.15980","paper":"/paper/in-context-imitation-learning-via-next-token","title":"In-Context Imitation Learning via Next-Token Prediction","date":"2024-08-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Max-Fu/icrt","path":"icrt/models/backbones/pos_embed.py","file_url":"https://github.com/Max-Fu/icrt/blob/HEAD/icrt/models/backbones/pos_embed.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cd809ededc7ba250","mcp_get_code":{"code_sha256":"cd809ededc7ba250"}},{"arxiv_id":"2408.14368","paper":"/paper/gr-mg-leveraging-partially-annotated-data-via","title":"GR-MG: Leveraging Partially Annotated Data via Multi-Modal Goal-Conditioned Policy","date":"2024-08-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bytedance/GR-MG","path":"policy/model/vision_transformer.py","file_url":"https://github.com/bytedance/GR-MG/blob/HEAD/policy/model/vision_transformer.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5a37690a13a6157d","mcp_get_code":{"code_sha256":"5a37690a13a6157d"}},{"arxiv_id":"2408.11001","paper":"/paper/megafusion-extend-diffusion-models-towards","title":"MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haoningwu3639/MegaFusion","path":"SD3-MegaFusion/model/embedding.py","file_url":"https://github.com/haoningwu3639/MegaFusion/blob/HEAD/SD3-MegaFusion/model/embedding.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9d97e3623eaa8e16","mcp_get_code":{"code_sha256":"9d97e3623eaa8e16"}},{"arxiv_id":"2408.05710","paper":"/paper/efficient-diffusion-transformer-with-step","title":"Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators","date":"2024-08-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leaplabthu/attention-mediators","path":"attention_mediator/models.py","file_url":"https://github.com/leaplabthu/attention-mediators/blob/HEAD/attention_mediator/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2408.02615","paper":"/paper/2408-02615","title":"LaMamba-Diff: Linear-Time High-Fidelity Diffusion Models Based on Local Attention and Mamba","date":"2024-08-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yunxiangfu2001/lamamba-diff","path":"model/lamamba.py","file_url":"https://github.com/yunxiangfu2001/lamamba-diff/blob/HEAD/model/lamamba.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a4b80fe570a120d6","mcp_get_code":{"code_sha256":"a4b80fe570a120d6"}},{"arxiv_id":"2408.01800","paper":"/paper/2408-01800","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","date":"2024-08-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenBMB/MiniCPM-o","path":"omnilmm/model/resampler.py","file_url":"https://github.com/OpenBMB/MiniCPM-o/blob/HEAD/omnilmm/model/resampler.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2408.00372","paper":"/paper/few-shot-defect-image-generation-based-on","title":"Few-shot Defect Image Generation based on Consistency Modeling","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ffdd-diffusion/defectdiffu","path":"models_add_cross_concate.py","file_url":"https://github.com/ffdd-diffusion/defectdiffu/blob/HEAD/models_add_cross_concate.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2407.16957","paper":"/paper/raindrop-clarity-a-dual-focused-dataset-for","title":"Raindrop Clarity: A Dual-Focused Dataset for Day and Night Raindrop Removal","date":"2024-07-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2407.16564","paper":"/paper/audio-prompt-adapter-unleashing-music-editing","title":"Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning","date":"2024-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fundwotsai2001/ap-adapter","path":"audio_encoder/models_mae.py","file_url":"https://github.com/fundwotsai2001/ap-adapter/blob/HEAD/audio_encoder/models_mae.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"caca77a0bdc72e75","mcp_get_code":{"code_sha256":"caca77a0bdc72e75"}},{"arxiv_id":"2407.14651","paper":"/paper/improving-representation-of-high-frequency","title":"Improving Representation of High-frequency Components for Medical Visual Foundation Models","date":"2024-07-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Arturia-Pendragon-Iris/Frepa","path":"attn_module.py","file_url":"https://github.com/Arturia-Pendragon-Iris/Frepa/blob/HEAD/attn_module.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"02c43f67a5f856d7","mcp_get_code":{"code_sha256":"02c43f67a5f856d7"}},{"arxiv_id":"2407.11633","paper":"/paper/scaling-diffusion-transformers-to-16-billion","title":"Scaling Diffusion Transformers to 16 Billion Parameters","date":"2024-07-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"feizc/dit-moe","path":"models.py","file_url":"https://github.com/feizc/dit-moe/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2407.08683","paper":"/paper/seed-story-multimodal-long-story-generation","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tencentarc/seed-story","path":"src/models/qwen_visual.py","file_url":"https://github.com/tencentarc/seed-story/blob/HEAD/src/models/qwen_visual.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2407.07311","paper":"/paper/vitime-a-visual-intelligence-based-foundation","title":"ViTime: A Visual Intelligence-Based Foundation Model for Time Series Forecasting","date":"2024-07-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ikeyang/vitime","path":"model/ViTimeAutoencoder.py","file_url":"https://github.com/ikeyang/vitime/blob/HEAD/model/ViTimeAutoencoder.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6bf22e812fb0381e","mcp_get_code":{"code_sha256":"6bf22e812fb0381e"}},{"arxiv_id":"2407.01425","paper":"/paper/fora-fast-forward-caching-in-diffusion","title":"FORA: Fast-Forward Caching in Diffusion Transformer Acceleration","date":"2024-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"prathebaselva/fora","path":"src/models.py","file_url":"https://github.com/prathebaselva/fora/blob/HEAD/src/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2406.18070","paper":"/paper/egovideo-exploring-egocentric-foundation","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","date":"2024-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opengvlab/egovideo","path":"backbone/model/pos_embed.py","file_url":"https://github.com/opengvlab/egovideo/blob/HEAD/backbone/model/pos_embed.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2406.17601","paper":"/paper/director3d-real-world-camera-trajectory-and","title":"Director3D: Real-world Camera Trajectory and 3D Scene Generation from Text","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"imlixinyang/director3d","path":"modules/dit.py","file_url":"https://github.com/imlixinyang/director3d/blob/HEAD/modules/dit.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2406.17343","paper":"/paper/q-dit-accurate-post-training-quantization-for","title":"Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"juanerx/q-dit","path":"models/models.py","file_url":"https://github.com/juanerx/q-dit/blob/HEAD/models/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2406.12272","paper":"/paper/slot-state-space-models","title":"Slot State Space Models","date":"2024-06-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jindongjiang/slotssms","path":"src/models/encoder.py","file_url":"https://github.com/jindongjiang/slotssms/blob/HEAD/src/models/encoder.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a13510bef3458b6c","mcp_get_code":{"code_sha256":"a13510bef3458b6c"}},{"arxiv_id":"2406.07476","paper":"/paper/videollama-2-advancing-spatial-temporal","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","date":"2024-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/inf-clip","path":"inf_clip/models/pos_embed.py","file_url":"https://github.com/damo-nlp-sg/inf-clip/blob/HEAD/inf_clip/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2406.02176","paper":"/paper/aroma-preserving-spatial-structure-for-latent","title":"AROMA: Preserving Spatial Structure for Latent PDE Modeling with Local Neural Fields","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"louisserrano/aroma","path":"aroma/DIT.py","file_url":"https://github.com/louisserrano/aroma/blob/HEAD/aroma/DIT.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2405.20851","paper":"/paper/megactor-harness-the-power-of-raw-video-for","title":"MegActor: Harness the Power of Raw Video for Vivid Portrait Animation","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"megvii-research/megactor","path":"animate/megactor-sigma/embeddings.py","file_url":"https://github.com/megvii-research/megactor/blob/HEAD/animate/megactor-sigma/embeddings.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"45f1cb4de58b3f3d","mcp_get_code":{"code_sha256":"45f1cb4de58b3f3d"}},{"arxiv_id":"2405.19298","paper":"/paper/adaptive-image-quality-assessment-via","title":"Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Q-Future/Compare2Score","path":"q_align/model/visual_encoder.py","file_url":"https://github.com/Q-Future/Compare2Score/blob/HEAD/q_align/model/visual_encoder.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2405.17829","paper":"/paper/ldmol-text-conditioned-molecule-diffusion","title":"LDMol: Text-to-Molecule Diffusion Model with Structurally Informative Latent Space","date":"2024-05-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jinhojsk515/ldmol","path":"models.py","file_url":"https://github.com/jinhojsk515/ldmol/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"bf3a0284f8d7cc37","mcp_get_code":{"code_sha256":"bf3a0284f8d7cc37"}},{"arxiv_id":"2405.17403","paper":"/paper/a-closer-look-at-time-steps-is-worthy-of","title":"A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"1zeryu/speed","path":"speed/networks/dit/mdt.py","file_url":"https://github.com/1zeryu/speed/blob/HEAD/speed/networks/dit/mdt.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2405.17403","paper":"/paper/a-closer-look-at-time-steps-is-worthy-of","title":"A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"1zeryu/speed","path":"speed/networks/pixart/PixArt.py","file_url":"https://github.com/1zeryu/speed/blob/HEAD/speed/networks/pixart/PixArt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5a10b94b2fe962d2","mcp_get_code":{"code_sha256":"5a10b94b2fe962d2"}},{"arxiv_id":"2405.17220","paper":"/paper/rlaif-v-aligning-mllms-through-open-source-ai","title":"RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openbmb/omnilmm","path":"omnilmm/model/resampler.py","file_url":"https://github.com/openbmb/omnilmm/blob/HEAD/omnilmm/model/resampler.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2405.16273","paper":"/paper/m-3-gpt-an-advanced-multimodal-multitask","title":"M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation","date":"2024-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"luomingshuang/m3gpt","path":"m3gpt/core/models/decoders/network/transformer_decoder/transformer_decoder.py","file_url":"https://github.com/luomingshuang/m3gpt/blob/HEAD/m3gpt/core/models/decoders/network/transformer_decoder/transformer_decoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"09d724b291a01fbe","mcp_get_code":{"code_sha256":"09d724b291a01fbe"}},{"arxiv_id":"2405.14832","paper":"/paper/direct3d-scalable-image-to-3d-generation-via","title":"Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DreamTechAI/Direct3D","path":"direct3d/models/dit.py","file_url":"https://github.com/DreamTechAI/Direct3D/blob/HEAD/direct3d/models/dit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2f540c03b489c19d","mcp_get_code":{"code_sha256":"2f540c03b489c19d"}},{"arxiv_id":"2405.13998","paper":"/paper/bridging-operator-learning-and-conditioned","title":"CViT: Continuous Vision Transformer for Operator Learning","date":"2024-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"predictiveintelligencelab/cvit","path":"src/model.py","file_url":"https://github.com/predictiveintelligencelab/cvit/blob/HEAD/src/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"76b08c5aa18c505a","mcp_get_code":{"code_sha256":"76b08c5aa18c505a"}},{"arxiv_id":"2405.04312","paper":"/paper/inf-dit-upsampling-any-resolution-image-with","title":"Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer","date":"2024-05-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thudm/inf-dit","path":"dit/embeddings.py","file_url":"https://github.com/thudm/inf-dit/blob/HEAD/dit/embeddings.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2405.00233","paper":"/paper/semanticodec-an-ultra-low-bitrate-semantic","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","date":"2024-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haoheliu/SemantiCodec-inference","path":"semanticodec/modules/audiomae/pos_embed.py","file_url":"https://github.com/haoheliu/SemantiCodec-inference/blob/HEAD/semanticodec/modules/audiomae/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2404.12766","paper":"/paper/continual-learning-on-a-diet-learning-from","title":"Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation","date":"2024-04-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wx-zhang/continual-learning-on-a-diet","path":"model/pose_embed.py","file_url":"https://github.com/wx-zhang/continual-learning-on-a-diet/blob/HEAD/model/pose_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2404.10710","paper":"/paper/dual-modalities-of-text-visual-and-textual","title":"Autoregressive Pre-Training on Pixels and Texts","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ernie-research/pixelgpt","path":"src/pixel/models/pixel/modeling_pixel.py","file_url":"https://github.com/ernie-research/pixelgpt/blob/HEAD/src/pixel/models/pixel/modeling_pixel.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4f9f413827752d39","mcp_get_code":{"code_sha256":"4f9f413827752d39"}},{"arxiv_id":"2404.04478","paper":"/paper/diffusion-rwkv-scaling-rwkv-like","title":"Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models","date":"2024-04-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"feizc/diffusion-rwkv","path":"models_drwkv.py","file_url":"https://github.com/feizc/diffusion-rwkv/blob/HEAD/models_drwkv.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2404.03482","paper":"/paper/adaglimpse-active-visual-exploration-with","title":"AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and Scale","date":"2024-04-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apardyl/adaglimpse","path":"architectures/mae_utils.py","file_url":"https://github.com/apardyl/adaglimpse/blob/HEAD/architectures/mae_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7f1c679f2bfb76cf","mcp_get_code":{"code_sha256":"7f1c679f2bfb76cf"}},{"arxiv_id":"2403.15378","paper":"/paper/long-clip-unlocking-the-long-text-capability","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","date":"2024-03-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"beichenzbc/long-clip","path":"open_clip_long/pos_embed.py","file_url":"https://github.com/beichenzbc/long-clip/blob/HEAD/open_clip_long/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2403.09502","paper":"/paper/equiav-leveraging-equivariance-for-audio","title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jongsuk1/equiav","path":"models/pt_EquiAV.py","file_url":"https://github.com/jongsuk1/equiav/blob/HEAD/models/pt_EquiAV.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"660403f722993455","mcp_get_code":{"code_sha256":"660403f722993455"}},{"arxiv_id":"2403.09502","paper":"/paper/equiav-leveraging-equivariance-for-audio","title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JongSuk1/EquiAV","path":"models/pos_embed.py","file_url":"https://github.com/JongSuk1/EquiAV/blob/HEAD/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"57abad7bed6d36ff","mcp_get_code":{"code_sha256":"57abad7bed6d36ff"}},{"arxiv_id":"2403.09176","paper":"/paper/switch-diffusion-transformer-synergizing","title":"Switch Diffusion Transformer: Synergizing Denoising Tasks with Sparse Mixture-of-Experts","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byeongjun-park/Switch-DiT","path":"models/DiT/models.py","file_url":"https://github.com/byeongjun-park/Switch-DiT/blob/HEAD/models/DiT/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2403.01915","paper":"/paper/xt-nested-tokenization-for-larger-context-in","title":"xT: Nested Tokenization for Larger Context in Large Images","date":"2024-03-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bair-climate-initiative/xT","path":"xt/models/decoders/decoder.py","file_url":"https://github.com/bair-climate-initiative/xT/blob/HEAD/xt/models/decoders/decoder.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"57beaaa0fe0fdf0d","mcp_get_code":{"code_sha256":"57beaaa0fe0fdf0d"}},{"arxiv_id":"2402.16445","paper":"/paper/2402-16445","title":"ProLLaMA: A Protein Language Model for Multi-Task Protein Language Processing","date":null,"month_inferred_from_arxiv_id":"2024-02","title_source":"archive","repo":"linzy19/taxdiff","path":"models.py","file_url":"https://github.com/linzy19/taxdiff/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2402.14654","paper":"/paper/multi-hmr-multi-person-whole-body-human-mesh","title":"Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single Shot","date":"2024-02-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"naver/multi-hmr","path":"multi_hmr_anny/pos_embed.py","file_url":"https://github.com/naver/multi-hmr/blob/HEAD/multi_hmr_anny/pos_embed.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"5458750ed2d5de75","mcp_get_code":{"code_sha256":"5458750ed2d5de75"}},{"arxiv_id":"2402.14167","paper":"/paper/t-stitch-accelerating-sampling-in-pre-trained","title":"T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nvlabs/t-stitch","path":"dit/models.py","file_url":"https://github.com/nvlabs/t-stitch/blob/HEAD/dit/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2402.13561","paper":"/paper/cognitive-visual-language-mapper-advancing","title":"Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hitsz-tmg/cognitive-visual-language-mapper","path":"Qwen/Qwen_VL/visual.py","file_url":"https://github.com/hitsz-tmg/cognitive-visual-language-mapper/blob/HEAD/Qwen/Qwen_VL/visual.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2402.11838","paper":"/paper/unist-a-prompt-empowered-universal-model-for","title":"UniST: A Prompt-Empowered Universal Model for Urban Spatio-Temporal Prediction","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsinghua-fib-lab/unist","path":"src/Embed.py","file_url":"https://github.com/tsinghua-fib-lab/unist/blob/HEAD/src/Embed.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6f828db28c6a9fbf","mcp_get_code":{"code_sha256":"6f828db28c6a9fbf"}},{"arxiv_id":"2402.11458","paper":"/paper/key-patch-proposer-key-patches-contain-rich","title":"Key Patch Proposer: Key Patches Contain Rich Information","date":"2024-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CA-TT-AC/key-patch-proposer","path":"util/pos_embed.py","file_url":"https://github.com/CA-TT-AC/key-patch-proposer/blob/HEAD/util/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2402.04252","paper":"/paper/eva-clip-18b-scaling-clip-to-18-billion","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","date":"2024-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baaivision/EVA","path":"EVA-01/eva/modeling_mae_pretrain.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/eva/modeling_mae_pretrain.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2401.14404","paper":"/paper/deconstructing-denoising-diffusion-models-for","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","date":"2024-01-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"futurexiang/ddae","path":"DiT/models.py","file_url":"https://github.com/futurexiang/ddae/blob/HEAD/DiT/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2401.08740","paper":"/paper/sit-exploring-flow-and-diffusion-based","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"willisma/sit","path":"models.py","file_url":"https://github.com/willisma/sit/blob/HEAD/models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2401.03497","paper":"/paper/eat-self-supervised-pre-training-with","title":"EAT: Self-Supervised Pre-Training with Efficient Audio Transformer","date":"2024-01-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cwx-worst-one/eat","path":"models/mae.py","file_url":"https://github.com/cwx-worst-one/eat/blob/HEAD/models/mae.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2401.03048","paper":"/paper/latte-latent-diffusion-transformer-for-video","title":"Latte: Latent Diffusion Transformer for Video Generation","date":"2024-01-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maxin-cn/Latte","path":"models/latte.py","file_url":"https://github.com/maxin-cn/Latte/blob/HEAD/models/latte.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2401.02031","paper":"/paper/spy-watermark-robust-invisible-watermarking","title":"Spy-Watermark: Robust Invisible Watermarking for Backdoor Attack","date":"2024-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rfww/spy-watermark","path":"models/pos_embed.py","file_url":"https://github.com/rfww/spy-watermark/blob/HEAD/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2401.01887","paper":"/paper/leap-vo-long-term-effective-any-point","title":"LEAP-VO: Long-term Effective Any Point Tracking for Visual Odometry","date":"2024-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wrchen530/leapvo","path":"main/leap/core/embeddings.py","file_url":"https://github.com/wrchen530/leapvo/blob/HEAD/main/leap/core/embeddings.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"7a2e39f5bb9f70f7","mcp_get_code":{"code_sha256":"7a2e39f5bb9f70f7"}},{"arxiv_id":"2401.08639","paper":"/paper/one-step-diffusion-distillation-via-deep-1","title":"One-Step Diffusion Distillation via Deep Equilibrium Models","date":"2023-12-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"locuslab/get","path":"models/get.py","file_url":"https://github.com/locuslab/get/blob/HEAD/models/get.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2312.16693","paper":"/paper/i2v-adapter-a-general-image-to-video-adapter","title":"I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models","date":"2023-12-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bytedance/x-dyna","path":"animatediff/models/embeddings.py","file_url":"https://github.com/bytedance/x-dyna/blob/HEAD/animatediff/models/embeddings.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"45f1cb4de58b3f3d","mcp_get_code":{"code_sha256":"45f1cb4de58b3f3d"}},{"arxiv_id":"2312.02139","paper":"/paper/diffit-diffusion-vision-transformers-for","title":"DiffiT: Diffusion Vision Transformers for Image Generation","date":"2023-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nvlabs/diffit","path":"diffit/diffit.py","file_url":"https://github.com/nvlabs/diffit/blob/HEAD/diffit/diffit.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"d77775e45836dc1a","mcp_get_code":{"code_sha256":"d77775e45836dc1a"}},{"arxiv_id":"2311.17597","paper":"/paper/continual-self-supervised-learning-towards","title":"Continual Self-supervised Learning: Towards Universal Multi-modal Medical Data Representation Learning","date":"2023-11-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yeerwen/medcoss","path":"model/Unimodel.py","file_url":"https://github.com/yeerwen/medcoss/blob/HEAD/model/Unimodel.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2311.16922","paper":"/paper/mitigating-object-hallucinations-in-large","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","date":"2023-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/vcd","path":"experiments/Qwen_VL/visual.py","file_url":"https://github.com/damo-nlp-sg/vcd/blob/HEAD/experiments/Qwen_VL/visual.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2311.16498","paper":"/paper/magicanimate-temporally-consistent-human","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","date":"2023-11-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"magic-research/magic-animate","path":"magicanimate/models/embeddings.py","file_url":"https://github.com/magic-research/magic-animate/blob/HEAD/magicanimate/models/embeddings.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"45f1cb4de58b3f3d","mcp_get_code":{"code_sha256":"45f1cb4de58b3f3d"}},{"arxiv_id":"2311.00566","paper":"/paper/croma-remote-sensing-representations-with-1","title":"CROMA: Remote Sensing Representations with Contrastive Radar-Optical Masked Autoencoders","date":"2023-11-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"antofuller/croma","path":"pretrain_croma.py","file_url":"https://github.com/antofuller/croma/blob/HEAD/pretrain_croma.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d599b95b94498131","mcp_get_code":{"code_sha256":"d599b95b94498131"}},{"arxiv_id":"2311.00566","paper":"/paper/croma-remote-sensing-representations-with-1","title":"CROMA: Remote Sensing Representations with Contrastive Radar-Optical Masked Autoencoders","date":"2023-11-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"antofuller/CROMA","path":"pretrain_croma.py","file_url":"https://github.com/antofuller/CROMA/blob/HEAD/pretrain_croma.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2ac385d924e863c5","mcp_get_code":{"code_sha256":"2ac385d924e863c5"}},{"arxiv_id":"2311.00566","paper":"/paper/croma-remote-sensing-representations-with-1","title":"CROMA: Remote Sensing Representations with Contrastive Radar-Optical Masked Autoencoders","date":"2023-11-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"antofuller/croma","path":"pretrain_croma.py","file_url":"https://github.com/antofuller/croma/blob/HEAD/pretrain_croma.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1b10b35db2b36f35","mcp_get_code":{"code_sha256":"1b10b35db2b36f35"}},{"arxiv_id":"2310.18341","paper":"/paper/cxr-llava-multimodal-large-language-model-for","title":"CXR-LLAVA: a multimodal large language model for interpreting chest X-ray images","date":"2023-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ecofri/cxr_llava","path":"CXR_LLAVA_HF/VisualTransformer.py","file_url":"https://github.com/ecofri/cxr_llava/blob/HEAD/CXR_LLAVA_HF/VisualTransformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2310.16318","paper":"/paper/modality-agnostic-self-supervised-learning","title":"Modality-Agnostic Self-Supervised Learning with Meta-Learned Masked Auto-Encoder","date":"2023-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alinlab/MetaMAE","path":"models.py","file_url":"https://github.com/alinlab/MetaMAE/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d599b95b94498131","mcp_get_code":{"code_sha256":"d599b95b94498131"}},{"arxiv_id":"2310.16175","paper":"/paper/g-cascade-efficient-cascaded-graph","title":"G-CASCADE: Efficient Cascaded Graph Convolutional Decoding for 2D Medical Image Segmentation","date":"2023-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SLDGroup/G-CASCADE","path":"lib/gcn_lib/pos_embed.py","file_url":"https://github.com/SLDGroup/G-CASCADE/blob/HEAD/lib/gcn_lib/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2310.09031","paper":"/paper/minde-mutual-information-neural-diffusion","title":"MINDE: Mutual Information Neural Diffusion Estimation","date":"2023-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MustaphaBounoua/minde","path":"src/models/transformer.py","file_url":"https://github.com/MustaphaBounoua/minde/blob/HEAD/src/models/transformer.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2310.06389","paper":"/paper/learning-stackable-and-skippable-lego-bricks","title":"Learning Stackable and Skippable LEGO Bricks for Efficient, Reconfigurable, and Variable-Resolution Diffusion Modeling","date":"2023-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JegZheng/LEGODiffusion","path":"training/lego_models.py","file_url":"https://github.com/JegZheng/LEGODiffusion/blob/HEAD/training/lego_models.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2309.15729","paper":"/paper/mindgpt-interpreting-what-you-see-with-non","title":"MindGPT: Interpreting What You See with Non-invasive Brain Recordings","date":"2023-09-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jxuanc/mindgpt","path":"modules/pos_embed.py","file_url":"https://github.com/jxuanc/mindgpt/blob/HEAD/modules/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2309.10667","paper":"/paper/learning-tri-modal-embeddings-for-zero-shot","title":"Learning Tri-modal Embeddings for Zero-Shot Soundscape Mapping","date":"2023-09-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mvrl/geoclap","path":"geoclap/models/SATMAE.py","file_url":"https://github.com/mvrl/geoclap/blob/HEAD/geoclap/models/SATMAE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"2308.00566","paper":"/paper/predicting-masked-tokens-in-stochastic","title":"Stochastic positional embeddings improve masked image modeling","date":"2023-07-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amirbar/stop","path":"src/deit.py","file_url":"https://github.com/amirbar/stop/blob/HEAD/src/deit.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"3241d318307c5d4f","mcp_get_code":{"code_sha256":"3241d318307c5d4f"}},{"arxiv_id":"2307.14659","paper":"/paper/lldiffusion-learning-degradation","title":"LLDiffusion: Learning Degradation Representations in Diffusion Models for Low-Light Image Enhancement","date":"2023-07-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"taowangzj/lldiffusion","path":"models/modules/dit.py","file_url":"https://github.com/taowangzj/lldiffusion/blob/HEAD/models/modules/dit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4033ff925f9a913a","mcp_get_code":{"code_sha256":"4033ff925f9a913a"}},{"arxiv_id":"2307.09361","paper":"/paper/moca-self-supervised-representation-learning","title":"MOCA: Self-supervised Representation Learning by Predicting Masked Online Codebook Assignments","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"valeoai/moca","path":"util/model_utils.py","file_url":"https://github.com/valeoai/moca/blob/HEAD/util/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"2307.09112","paper":"/paper/nu-mcc-multiview-compressive-coding-with-1","title":"NU-MCC: Multiview Compressive Coding with Neighborhood Decoder and Repulsive UDF","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sail-sg/numcc","path":"src/model/nu_mcc.py","file_url":"https://github.com/sail-sg/numcc/blob/HEAD/src/model/nu_mcc.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"caca77a0bdc72e75","mcp_get_code":{"code_sha256":"caca77a0bdc72e75"}},{"arxiv_id":"2305.13311","paper":"/paper/vdt-an-empirical-study-on-video-diffusion","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","date":"2023-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2304.04269","paper":"/paper/humansd-a-native-skeleton-guided-diffusion","title":"HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image Generation","date":"2023-04-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiangchenyin/grpose","path":"gcn_lib/pos_embed.py","file_url":"https://github.com/xiangchenyin/grpose/blob/HEAD/gcn_lib/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2304.03283","paper":"/paper/diffusion-models-as-masked-autoencoders","title":"Diffusion Models as Masked Autoencoders","date":"2023-04-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kimdanni/DiffMAE","path":"models_cross.py","file_url":"https://github.com/kimdanni/DiffMAE/blob/HEAD/models_cross.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"6df5fc6a28a5d9e4","mcp_get_code":{"code_sha256":"6df5fc6a28a5d9e4"}},{"arxiv_id":"2303.15564","paper":"/paper/mask-and-restore-blind-backdoor-defense-at","title":"Mask and Restore: Blind Backdoor Defense at Test Time with Masked Autoencoder","date":"2023-03-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsun/bdmae","path":"mae/pos_embed.py","file_url":"https://github.com/tsun/bdmae/blob/HEAD/mae/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2303.10834","paper":"/paper/object-centric-slot-diffusion-1","title":"Object-Centric Slot Diffusion","date":"2023-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jindongjiang/latent-slot-diffusion","path":"src/models/utils.py","file_url":"https://github.com/jindongjiang/latent-slot-diffusion/blob/HEAD/src/models/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3984e7faeca4f621","mcp_get_code":{"code_sha256":"3984e7faeca4f621"}},{"arxiv_id":"2303.06457","paper":"/paper/active-visual-exploration-based-on-attention","title":"Active Visual Exploration Based on Attention-Map Entropy","date":"2023-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apardyl/AME","path":"architectures/selectors.py","file_url":"https://github.com/apardyl/AME/blob/HEAD/architectures/selectors.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f10b0368daa03927","mcp_get_code":{"code_sha256":"f10b0368daa03927"}},{"arxiv_id":"2303.05675","paper":"/paper/humanbench-towards-general-human-centric","title":"HumanBench: Towards General Human-centric Perception with Projector Assisted Pretraining","date":"2023-03-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenGVLab/HumanBench","path":"PATH/core/models/backbones/vitdet_for_ladder_attention_share_pos_embed.py","file_url":"https://github.com/OpenGVLab/HumanBench/blob/HEAD/PATH/core/models/backbones/vitdet_for_ladder_attention_share_pos_embed.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0973dbf09d2066c7","mcp_get_code":{"code_sha256":"0973dbf09d2066c7"}},{"arxiv_id":"2301.13155","paper":"/paper/advancing-radiograph-representation-learning","title":"Advancing Radiograph Representation Learning with Masked Record Modeling","date":"2023-01-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rl4m/mrm-pytorch","path":"model_mrm.py","file_url":"https://github.com/rl4m/mrm-pytorch/blob/HEAD/model_mrm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dfd354ccf91ca5bd","mcp_get_code":{"code_sha256":"dfd354ccf91ca5bd"}},{"arxiv_id":"2301.08243","paper":"/paper/self-supervised-learning-from-images-with-a","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","date":"2023-01-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/ijepa","path":"src/models/vision_transformer.py","file_url":"https://github.com/facebookresearch/ijepa/blob/HEAD/src/models/vision_transformer.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"fc939725b0bb127b","mcp_get_code":{"code_sha256":"fc939725b0bb127b"}},{"arxiv_id":"2301.01296","paper":"/paper/tinymim-an-empirical-study-of-distilling-mim","title":"TinyMIM: An Empirical Study of Distilling MIM Pre-trained Models","date":"2023-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"oliverrensu/d-igpt","path":"DiGPT_torch/models_digpt.py","file_url":"https://github.com/oliverrensu/d-igpt/blob/HEAD/DiGPT_torch/models_digpt.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5a37690a13a6157d","mcp_get_code":{"code_sha256":"5a37690a13a6157d"}},{"arxiv_id":"2212.10368","paper":"/paper/masked-event-modeling-self-supervised","title":"Masked Event Modeling: Self-Supervised Pretraining for Event Cameras","date":"2022-12-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tum-vision/mem","path":"mem/modeling_mae.py","file_url":"https://github.com/tum-vision/mem/blob/HEAD/mem/modeling_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2212.09748","paper":"/paper/scalable-diffusion-models-with-transformers","title":"Scalable Diffusion Models with Transformers","date":"2022-12-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2212.07525","paper":"/paper/efficient-self-supervised-learning-with","title":"Efficient Self-supervised Learning with Contextualized Target Representations for Vision, Speech and Language","date":"2022-12-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ashutosh1919/data2vec-pytorch","path":"data2vec/models/mae.py","file_url":"https://github.com/ashutosh1919/data2vec-pytorch/blob/HEAD/data2vec/models/mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2212.03229","paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","date":"2022-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"daniel-code/TubeViT","path":"tubevit/positional_encoding.py","file_url":"https://github.com/daniel-code/TubeViT/blob/HEAD/tubevit/positional_encoding.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e1389b364f3c75ab","mcp_get_code":{"code_sha256":"e1389b364f3c75ab"}},{"arxiv_id":"2211.13594","paper":"/paper/self-supervised-vision-language-pretraining","title":"Self-supervised vision-language pretraining for Medical visual question answering","date":"2022-11-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pengfeiliheu/m2i2","path":"models/mae.py","file_url":"https://github.com/pengfeiliheu/m2i2/blob/HEAD/models/mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2211.12941","paper":"/paper/eurnet-efficient-multi-range-relational","title":"EurNet: Efficient Multi-Range Relational Modeling of Spatial Multi-Relational Data","date":"2022-11-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hirl-team/eurnet-image","path":"eurnet/utils/position_embed.py","file_url":"https://github.com/hirl-team/eurnet-image/blob/HEAD/eurnet/utils/position_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2210.16870","paper":"/paper/a-simple-efficient-and-scalable-contrastive","title":"A simple, efficient and scalable contrastive masked autoencoder for learning visual representations","date":"2022-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bwconrad/can","path":"src/network/pos_embed.py","file_url":"https://github.com/bwconrad/can/blob/HEAD/src/network/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2210.11016","paper":"/paper/towards-sustainable-self-supervised-learning","title":"Towards Sustainable Self-supervised Learning","date":"2022-10-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sail-sg/tec","path":"models/models_tec_vit.py","file_url":"https://github.com/sail-sg/tec/blob/HEAD/models/models_tec_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7089e8a76f671a0f","mcp_get_code":{"code_sha256":"7089e8a76f671a0f"}},{"arxiv_id":"2210.10716","paper":"/paper/croco-self-supervised-pre-training-for-3d","title":"CroCo: Self-Supervised Pre-training for 3D Vision Tasks by Cross-View Completion","date":"2022-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"naver/croco","path":"models/croco.py","file_url":"https://github.com/naver/croco/blob/HEAD/models/croco.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"d9a2bb7a053e82c0","mcp_get_code":{"code_sha256":"d9a2bb7a053e82c0"}},{"arxiv_id":"2207.06405","paper":"/paper/masked-autoencoders-that-listen","title":"Masked Autoencoders that Listen","date":"2022-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eml-eda/tle-supervised","path":"models/models_audio_mae.py","file_url":"https://github.com/eml-eda/tle-supervised/blob/HEAD/models/models_audio_mae.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"11b4cbd5cc85097d","mcp_get_code":{"code_sha256":"11b4cbd5cc85097d"}},{"arxiv_id":"2207.06405","paper":"/paper/masked-autoencoders-that-listen","title":"Masked Autoencoders that Listen","date":"2022-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rishikksh20/AudioMAE-pytorch","path":"audio_mae.py","file_url":"https://github.com/rishikksh20/AudioMAE-pytorch/blob/HEAD/audio_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4dafab91858a28d2","mcp_get_code":{"code_sha256":"4dafab91858a28d2"}},{"arxiv_id":"2204.09435","paper":"/paper/hephaestus-a-large-scale-multitask-dataset","title":"Hephaestus: A large scale multitask dataset towards InSAR understanding","date":"2022-04-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"orion-ai-lab/hephaestus","path":"self_supervised/mae/mae_model.py","file_url":"https://github.com/orion-ai-lab/hephaestus/blob/HEAD/self_supervised/mae/mae_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dc4124ec591f2158","mcp_get_code":{"code_sha256":"dc4124ec591f2158"}},{"arxiv_id":"2203.10897","paper":"/paper/unified-multivariate-gaussian-mixture-for","title":"Unified Multivariate Gaussian Mixture for Efficient Neural Image Compression","date":"2022-03-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiaosu-zhu/McQuic","path":"mcquic/modules/generator.py","file_url":"https://github.com/xiaosu-zhu/McQuic/blob/HEAD/mcquic/modules/generator.py","status":"ran_honours","verification_level":1,"contract_check":"HONOURS","metamorphic_tier":"well_formed","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c92c27c924b517e8","mcp_get_code":{"code_sha256":"c92c27c924b517e8"}},{"arxiv_id":"2202.00660","paper":"/paper/interactron-embodied-adaptive-object","title":"Interactron: Embodied Adaptive Object Detection","date":"2022-02-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"allenai/interactron","path":"models/gpt.py","file_url":"https://github.com/allenai/interactron/blob/HEAD/models/gpt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2111.09887","paper":"/paper/pytorchvideo-a-deep-learning-library-for","title":"PyTorchVideo: A Deep Learning Library for Video Understanding","date":"2021-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/pytorchvideo","path":"pytorchvideo/layers/positional_encoding.py","file_url":"https://github.com/facebookresearch/pytorchvideo/blob/HEAD/pytorchvideo/layers/positional_encoding.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":false,"code_sha256_prefix":"8e6779a0a8e95e06","mcp_get_code":{"code_sha256":"8e6779a0a8e95e06"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yangsun22/tc-moa","path":"model/ViT_MAE.py","file_url":"https://github.com/yangsun22/tc-moa/blob/HEAD/model/ViT_MAE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"43ab33710deb02f8","mcp_get_code":{"code_sha256":"43ab33710deb02f8"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"0jason000/mae_vit","path":"src/mae_vit.py","file_url":"https://github.com/0jason000/mae_vit/blob/HEAD/src/mae_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"2105.12723","paper":"/paper/aggregating-nested-transformers","title":"Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding","date":"2021-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"freder-chen/vitp","path":"util/pos_embed.py","file_url":"https://github.com/freder-chen/vitp/blob/HEAD/util/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"1807.10221","paper":"/paper/unified-perceptual-parsing-for-scene","title":"Unified Perceptual Parsing for Scene Understanding","date":"2018-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ESA-PhiLab/PhilEO-MajorTOM","path":"model/phileo_vit.py","file_url":"https://github.com/ESA-PhiLab/PhilEO-MajorTOM/blob/HEAD/model/phileo_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9417ae492629cf06","mcp_get_code":{"code_sha256":"9417ae492629cf06"}},{"arxiv_id":"aaai_29391","paper":null,"title":"arXiv:aaai_29391","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Jiahuiqu/LDS2AE","path":"pos_embed.py","file_url":"https://github.com/Jiahuiqu/LDS2AE/blob/HEAD/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}},{"arxiv_id":"Zhou_Towards_Effective_Foundation_Model_Adaptation_for_Extreme_Cross-Domain_Few-Shot_Learning_ICCV_2025_paper","paper":null,"title":"arXiv:Zhou_Towards_Effective_Foundation_Model_Adaptation_for_Extreme_Cross-Domain_Few-Shot_Learning_ICCV_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"NWPUZhoufei/FMA","path":"MAE_decoder.py","file_url":"https://github.com/NWPUZhoufei/FMA/blob/HEAD/MAE_decoder.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"77e8a3ac46f3afec","mcp_get_code":{"code_sha256":"77e8a3ac46f3afec"}},{"arxiv_id":"Xiao_OmniGen_Unified_Image_Generation_CVPR_2025_paper","paper":null,"title":"arXiv:Xiao_OmniGen_Unified_Image_Generation_CVPR_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"VectorSpaceLab/OmniGen","path":"OmniGen/model.py","file_url":"https://github.com/VectorSpaceLab/OmniGen/blob/HEAD/OmniGen/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b9da3bec8fc652d6","mcp_get_code":{"code_sha256":"b9da3bec8fc652d6"}},{"arxiv_id":"Garrido-Munoz_On_the_Generalization_of_Handwritten_Text_Recognition_Models_CVPR_2025_paper","paper":null,"title":"arXiv:Garrido-Munoz_On_the_Generalization_of_Handwritten_Text_Recognition_Models_CVPR_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"carlos10garrido/HTR-OOD","path":"src/models/components/htr_vit.py","file_url":"https://github.com/carlos10garrido/HTR-OOD/blob/HEAD/src/models/components/htr_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b3d70fe27e96e6d4","mcp_get_code":{"code_sha256":"b3d70fe27e96e6d4"}},{"arxiv_id":"Fang_Unleashing_Vanilla_Vision_Transformer_with_Masked_Image_Modeling_for_Object_ICCV_2023_paper","paper":null,"title":"arXiv:Fang_Unleashing_Vanilla_Vision_Transformer_with_Masked_Image_Modeling_for_Object_ICCV_2023_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"hustvl/MIMDet","path":"utils/pos_embed.py","file_url":"https://github.com/hustvl/MIMDet/blob/HEAD/utils/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3185afc3e87293ed","mcp_get_code":{"code_sha256":"3185afc3e87293ed"}}]}