{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/get-2d-sincos-pos-embed-from-grid","entry":"get_2d_sincos_pos_embed_from_grid","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":140,"n_papers_ran":3,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":22,"n_samples_ran":2,"n_samples_fingerprinted":1,"n_places":143,"n_places_pointer_only":65,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":2,"ran":0,"unverified":20},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.27066","paper":"/paper/arxiv-2608-27066","title":"Beyond Classification: Task-Dependent Learnability under Privacy-Motivated Image Transformations","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"LeonRanke/Task-Dependent-Learnability","path":"src/models/jpdvt.py","file_url":"https://github.com/LeonRanke/Task-Dependent-Learnability/blob/HEAD/src/models/jpdvt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c03ef37ebf97369c","mcp_get_code":{"code_sha256":"c03ef37ebf97369c"}},{"arxiv_id":"2608.01298","paper":"/paper/arxiv-2608-01298","title":"UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"JN-Yun/UDT","path":"models/UDT.py","file_url":"https://github.com/JN-Yun/UDT/blob/HEAD/models/UDT.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4509f0ab71bc54ca","mcp_get_code":{"code_sha256":"4509f0ab71bc54ca"}},{"arxiv_id":"2607.03349","paper":"/paper/arxiv-2607-03349","title":"PedestrianDiffusion: Multimodal Generative Denoising and Dense State Estimation for Inertial Navigation","date":null,"month_inferred_from_arxiv_id":"2026-07","title_source":"syntology","repo":"jacklu333333/PedestrianDiffusion","path":"utils/DiT.py","file_url":"https://github.com/jacklu333333/PedestrianDiffusion/blob/HEAD/utils/DiT.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2606.18209","paper":"/paper/arxiv-2606-18209","title":"Rethinking Dataset Distillation for Classification: Do Distilled Sets Outperform Coresets?","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"AyushRoy2001/ManifoldGD","path":"models.py","file_url":"https://github.com/AyushRoy2001/ManifoldGD/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2606.14791","paper":"/paper/arxiv-2606-14791","title":"From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"Freyliu0516/audioPG","path":"models/audiomae.py","file_url":"https://github.com/Freyliu0516/audioPG/blob/HEAD/models/audiomae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"572240b722c323a0","mcp_get_code":{"code_sha256":"572240b722c323a0"}},{"arxiv_id":"2606.08063","paper":"/paper/arxiv-2606-08063","title":"Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"jqtangust/Robust-U1","path":"modeling/modeling/bagel/modeling_utils.py","file_url":"https://github.com/jqtangust/Robust-U1/blob/HEAD/modeling/modeling/bagel/modeling_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2605.18903","paper":"/paper/arxiv-2605-18903","title":"Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"lluosi/RDB-CL","path":"ETrain/Models/Qwen/visual.py","file_url":"https://github.com/lluosi/RDB-CL/blob/HEAD/ETrain/Models/Qwen/visual.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2605.08724","paper":"/paper/arxiv-2605-08724","title":"SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"piooip/SynerMedGen","path":"modeling/bagel/modeling_utils.py","file_url":"https://github.com/piooip/SynerMedGen/blob/HEAD/modeling/bagel/modeling_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2603.01759","paper":"/paper/arxiv-2603-01759","title":"Meta-Learning Hyperparameters for Parameter Efficient Fine-Tuning","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"doem97/metalora","path":"models/satmae_vit.py","file_url":"https://github.com/doem97/metalora/blob/HEAD/models/satmae_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2601.11522","paper":"/paper/arxiv-2601-11522","title":"UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"ZrH42/UniX","path":"modeling/unix/modeling_utils.py","file_url":"https://github.com/ZrH42/UniX/blob/HEAD/modeling/unix/modeling_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2601.02289","paper":"/paper/arxiv-2601-02289","title":"Rank-based Geographical Regularization: Revisiting Contrastive Self-Supervised Learning for Multispectral Remote Sensing Imagery","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"tomburgert/georank","path":"models/croma_backbone.py","file_url":"https://github.com/tomburgert/georank/blob/HEAD/models/croma_backbone.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1be616eeae3e24f7","mcp_get_code":{"code_sha256":"1be616eeae3e24f7"}},{"arxiv_id":"2512.14395","paper":"/paper/arxiv-2512-14395","title":"Massive Editing for Large Language Models Based on Dynamic Weight Generation","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"RodeWayne/MeG-for-Knowledge-Editing","path":"my_model_five_bert_text.py","file_url":"https://github.com/RodeWayne/MeG-for-Knowledge-Editing/blob/HEAD/my_model_five_bert_text.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2510.02216","paper":"/paper/arxiv-2510-02216","title":"Diffusion Transformers for Imputation: Statistical Efficiency and Uncertainty Quantification","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"liamyzq/DiT_time_series_imputation","path":"model.py","file_url":"https://github.com/liamyzq/DiT_time_series_imputation/blob/HEAD/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"05ac220b7da8edbb","mcp_get_code":{"code_sha256":"05ac220b7da8edbb"}},{"arxiv_id":"2508.07626","paper":"/paper/arxiv-2508-07626","title":"AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"idejie/ar","path":"models/ar/transformer_utils.py","file_url":"https://github.com/idejie/ar/blob/HEAD/models/ar/transformer_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b1bc67528f8aa03f","mcp_get_code":{"code_sha256":"b1bc67528f8aa03f"}},{"arxiv_id":"2508.05606","paper":"/paper/arxiv-2508-05606","title":"Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"Fr0zenCrane/UniCoT","path":"modeling/bagel/modeling_utils.py","file_url":"https://github.com/Fr0zenCrane/UniCoT/blob/HEAD/modeling/bagel/modeling_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2507.04447","paper":"/paper/dreamvla-a-vision-language-action-model-1","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","date":"2025-07-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Zhangwenyao1/DreamVLA","path":"models/dreamvla_model.py","file_url":"https://github.com/Zhangwenyao1/DreamVLA/blob/HEAD/models/dreamvla_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2506.22637","paper":"/paper/cao-2-rectifying-inconsistencies-in-diffusion","title":"CaO$_2$: Rectifying Inconsistencies in Diffusion-Based Dataset Distillation","date":"2025-06-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hatchetproject/cao2","path":"models.py","file_url":"https://github.com/hatchetproject/cao2/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2506.21803","paper":null,"title":"arXiv:2506.21803","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"HKU-MedAI/MELP","path":"src/melp/backbone/pos_embed.py","file_url":"https://github.com/HKU-MedAI/MELP/blob/HEAD/src/melp/backbone/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2506.13750","paper":"/paper/test3r-learning-to-reconstruct-3d-at-test","title":"Test3R: Learning to Reconstruct 3D at Test Time","date":"2025-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nopqaq/test3r","path":"croco/models/pos_embed.py","file_url":"https://github.com/nopqaq/test3r/blob/HEAD/croco/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2506.11777","paper":"/paper/self-supervised-learning-of-echocardiographic","title":"Self-supervised Learning of Echocardiographic Video Representations via Online Cluster Distillation","date":"2025-06-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mdivyanshu97/discovr","path":"models/modeling_pretrain.py","file_url":"https://github.com/mdivyanshu97/discovr/blob/HEAD/models/modeling_pretrain.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"715aab11d1b73ce8","mcp_get_code":{"code_sha256":"715aab11d1b73ce8"}},{"arxiv_id":"2505.14683","paper":"/paper/emerging-properties-in-unified-multimodal","title":"Emerging Properties in Unified Multimodal Pretraining","date":"2025-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"neverbiasu/ComfyUI-BAGEL","path":"modeling/bagel/modeling_utils.py","file_url":"https://github.com/neverbiasu/ComfyUI-BAGEL/blob/HEAD/modeling/bagel/modeling_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2505.07447","paper":"/paper/unified-continuous-generative-models","title":"Unified Continuous Generative Models","date":"2025-05-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LINs-Lab/UCGM","path":"networks/lightningdit.py","file_url":"https://github.com/LINs-Lab/UCGM/blob/HEAD/networks/lightningdit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2504.12576","paper":"/paper/cm3ae-a-unified-rgb-frame-and-event-voxel","title":"CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework","date":"2025-04-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"event-ahu/cm3ae","path":"pos_embed.py","file_url":"https://github.com/event-ahu/cm3ae/blob/HEAD/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2503.20287","paper":"/paper/insvie-1m-effective-instruction-based-video","title":"InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction","date":"2025-03-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"langmanbusi/insvie","path":"CogVideo/sat/dit_video_concat.py","file_url":"https://github.com/langmanbusi/insvie/blob/HEAD/CogVideo/sat/dit_video_concat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2503.18746","paper":"/paper/linguistics-aware-masked-image-modeling-for","title":"Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition","date":"2025-03-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhangyifei01/LMIM","path":"lmim_pretrain/models_lmim.py","file_url":"https://github.com/zhangyifei01/LMIM/blob/HEAD/lmim_pretrain/models_lmim.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2503.08685","paper":"/paper/principal-components-enable-a-new-language-of","title":"\"Principal Components\" Enable A New Language of Images","date":"2025-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"visual-gen/semanticist","path":"semanticist/stage1/diffusion_transfomer.py","file_url":"https://github.com/visual-gen/semanticist/blob/HEAD/semanticist/stage1/diffusion_transfomer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2503.08685","paper":"/paper/principal-components-enable-a-new-language-of","title":"\"Principal Components\" Enable A New Language of Images","date":"2025-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"visual-gen/semanticist","path":"semanticist/stage1/pos_embed.py","file_url":"https://github.com/visual-gen/semanticist/blob/HEAD/semanticist/stage1/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2502.05179","paper":"/paper/flashvideo-flowing-fidelity-to-detail-for","title":"FlashVideo:Flowing Fidelity to Detail for Efficient High-Resolution Video Generation","date":"2025-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"foundationvision/flashvideo","path":"flashvideo/dit_video_concat.py","file_url":"https://github.com/foundationvision/flashvideo/blob/HEAD/flashvideo/dit_video_concat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2502.02150","paper":"/paper/on-the-guidance-of-flow-matching","title":"On the Guidance of Flow Matching","date":"2025-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ai4science-westlakeu/flow_guidance","path":"offline_rl/gflower/models_flow/transformer.py","file_url":"https://github.com/ai4science-westlakeu/flow_guidance/blob/HEAD/offline_rl/gflower/models_flow/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2412.15109","paper":"/paper/predictive-inverse-dynamics-models-are","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","date":null,"month_inferred_from_arxiv_id":"2024-12","title_source":"archive","repo":"openrobotlab/seer","path":"models/seer_model.py","file_url":"https://github.com/openrobotlab/seer/blob/HEAD/models/seer_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2412.13871","paper":"/paper/llava-uhd-v2-an-mllm-integrating-high","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Feature Pyramid via Hierarchical Window Transformer","date":"2024-12-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thunlp/llava-uhd","path":"llava/model/multimodal_projector/uhd_v1_resampler.py","file_url":"https://github.com/thunlp/llava-uhd/blob/HEAD/llava/model/multimodal_projector/uhd_v1_resampler.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2412.12095","paper":"/paper/causal-diffusion-transformers-for-generative","title":"Causal Diffusion Transformers for Generative Modeling","date":"2024-12-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2412.05628","paper":"/paper/remix-dit-mixing-diffusion-transformers-for","title":"Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising","date":"2024-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vainf/remix-dit","path":"remix_dit.py","file_url":"https://github.com/vainf/remix-dit/blob/HEAD/remix_dit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2412.01199","paper":"/paper/tinyfusion-diffusion-transformers-learned","title":"TinyFusion: Diffusion Transformers Learned Shallow","date":"2024-12-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vainf/tinyfusion","path":"models.py","file_url":"https://github.com/vainf/tinyfusion/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2412.00887","paper":"/paper/playable-game-generation","title":"Playable Game Generation","date":"2024-12-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"greatx3/playable-game-generation","path":"network/df/models/diffusion/dit_models.py","file_url":"https://github.com/greatx3/playable-game-generation/blob/HEAD/network/df/models/diffusion/dit_models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2412.00733","paper":"/paper/hallo3-highly-dynamic-and-realistic-portrait","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","date":"2024-12-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fudan-generative-vision/hallo3","path":"hallo3/ref_dit_video_concat.py","file_url":"https://github.com/fudan-generative-vision/hallo3/blob/HEAD/hallo3/ref_dit_video_concat.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2411.17616","paper":"/paper/accelerating-vision-diffusion-transformers","title":"Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints","date":"2024-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"opensparsellms/skip-dit","path":"class-to-image/models.py","file_url":"https://github.com/opensparsellms/skip-dit/blob/HEAD/class-to-image/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2411.12164","paper":"/paper/urbandit-a-foundation-model-for-open-world","title":"UrbanDiT: A Foundation Model for Open-World Urban Spatio-Temporal Learning","date":"2024-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsinghua-fib-lab/UrbanDiT","path":"src/Embed.py","file_url":"https://github.com/tsinghua-fib-lab/UrbanDiT/blob/HEAD/src/Embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2411.11409","paper":"/paper/ikea-manuals-at-work-4d-grounding-of-assembly","title":"IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos","date":"2024-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yunongLiu1/IKEA-Manuals-at-Work","path":"src/IKEAVideo/featurizers/MAE.py","file_url":"https://github.com/yunongLiu1/IKEA-Manuals-at-Work/blob/HEAD/src/IKEAVideo/featurizers/MAE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2411.06959","paper":"/paper/enat-rethinking-spatial-temporal-interactions","title":"ENAT: Rethinking Spatial-temporal Interactions in Token-based Image Synthesis","date":"2024-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leaplabthu/enat","path":"libs/models.py","file_url":"https://github.com/leaplabthu/enat/blob/HEAD/libs/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2411.04168","paper":"/paper/dimsum-diffusion-mamba-a-scalable-and-unified","title":"DiMSUM: Diffusion Mamba -- A Scalable and Unified Spatial-Frequency Method for Image Generation","date":"2024-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VinAIResearch/DiMSUM","path":"dimsum/models_dim.py","file_url":"https://github.com/VinAIResearch/DiMSUM/blob/HEAD/dimsum/models_dim.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2410.21264","paper":"/paper/larp-tokenizing-videos-with-a-learned-1","title":"LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior","date":"2024-10-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hywang66/LARP","path":"models/embed.py","file_url":"https://github.com/hywang66/LARP/blob/HEAD/models/embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fd6ac2b105d8a7b5","mcp_get_code":{"code_sha256":"fd6ac2b105d8a7b5"}},{"arxiv_id":"2410.16794","paper":"/paper/one-step-diffusion-distillation-through-score","title":"One-Step Diffusion Distillation through Score Implicit Matching","date":"2024-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maple-research-lab/sim","path":"models/PixArt.py","file_url":"https://github.com/maple-research-lab/sim/blob/HEAD/models/PixArt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"AGPL-3.0","inline_ok":false,"code_sha256_prefix":"60599713933af278","mcp_get_code":{"code_sha256":"60599713933af278"}},{"arxiv_id":"2410.13179","paper":"/paper/eh-mam-easy-to-hard-masked-acoustic-modeling","title":"EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning","date":"2024-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cs20s030/ehmam","path":"models/mae.py","file_url":"https://github.com/cs20s030/ehmam/blob/HEAD/models/mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2410.10815","paper":"/paper/depth-any-video-with-scalable-synthetic-data","title":"Depth Any Video with Scalable Synthetic Data","date":"2024-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Nightmare-n/DepthAnyVideo","path":"dav/models/embeddings.py","file_url":"https://github.com/Nightmare-n/DepthAnyVideo/blob/HEAD/dav/models/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"59fa7b38de05f443","mcp_get_code":{"code_sha256":"59fa7b38de05f443"}},{"arxiv_id":"2410.09575","paper":"/paper/reconstructive-visual-instruction-tuning","title":"Reconstructive Visual Instruction Tuning","date":"2024-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haochen-wang409/ross","path":"ross/model/utils.py","file_url":"https://github.com/haochen-wang409/ross/blob/HEAD/ross/model/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2410.01723","paper":"/paper/harmonica-harmonizing-training-and-inference","title":"HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration","date":"2024-10-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"modeltc/harmonica","path":"models/dynamic_models.py","file_url":"https://github.com/modeltc/harmonica/blob/HEAD/models/dynamic_models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2409.19407","paper":"/paper/brain-jepa-brain-dynamics-foundation-model","title":"Brain-JEPA: Brain Dynamics Foundation Model with Gradient Positioning and Spatiotemporal Masking","date":"2024-09-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Eric-LRL/Brain-JEPA","path":"src/models/vision_transformer.py","file_url":"https://github.com/Eric-LRL/Brain-JEPA/blob/HEAD/src/models/vision_transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2409.18128","paper":"/paper/flowturbo-towards-real-time-flow-based-image","title":"FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner","date":"2024-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shiml20/FlowTurbo","path":"models_assemble.py","file_url":"https://github.com/shiml20/FlowTurbo/blob/HEAD/models_assemble.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2409.16280","paper":"/paper/monoformer-one-transformer-for-both-diffusion","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","date":"2024-09-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MonoFormer/MonoFormer","path":"models/modeling.py","file_url":"https://github.com/MonoFormer/MonoFormer/blob/HEAD/models/modeling.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2409.14538","paper":"/paper/towards-model-agnostic-dataset-condensation","title":"Towards Model-Agnostic Dataset Condensation by Heterogeneous Models","date":"2024-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"KHU-AGI/HMDC","path":"gcn_lib/pos_embed.py","file_url":"https://github.com/KHU-AGI/HMDC/blob/HEAD/gcn_lib/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2409.13079","paper":"/paper/embedding-geometries-of-contrastive-language","title":"Embedding Geometries of Contrastive Language-Image Pre-Training","date":"2024-09-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eify/open_clip","path":"src/open_clip/pos_embed.py","file_url":"https://github.com/eify/open_clip/blob/HEAD/src/open_clip/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2409.11340","paper":"/paper/omnigen-unified-image-generation","title":"OmniGen: Unified Image Generation","date":"2024-09-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vectorspacelab/omnigen","path":"OmniGen/model.py","file_url":"https://github.com/vectorspacelab/omnigen/blob/HEAD/OmniGen/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2409.10695","paper":"/paper/playground-v3-improving-text-to-image","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","date":"2024-09-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yuchuantian/u-dit","path":"models.py","file_url":"https://github.com/yuchuantian/u-dit/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2409.07756","paper":"/paper/ditas-quantizing-diffusion-transformers-via","title":"DiTAS: Quantizing Diffusion Transformers via Enhanced Activation Smoothing","date":"2024-09-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DZY122/DiTAS","path":"models.py","file_url":"https://github.com/DZY122/DiTAS/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2408.15980","paper":"/paper/in-context-imitation-learning-via-next-token","title":"In-Context Imitation Learning via Next-Token Prediction","date":"2024-08-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Max-Fu/icrt","path":"icrt/models/backbones/pos_embed.py","file_url":"https://github.com/Max-Fu/icrt/blob/HEAD/icrt/models/backbones/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b7482295ffca3e2c","mcp_get_code":{"code_sha256":"b7482295ffca3e2c"}},{"arxiv_id":"2408.14368","paper":"/paper/gr-mg-leveraging-partially-annotated-data-via","title":"GR-MG: Leveraging Partially Annotated Data via Multi-Modal Goal-Conditioned Policy","date":"2024-08-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bytedance/GR-MG","path":"policy/model/vision_transformer.py","file_url":"https://github.com/bytedance/GR-MG/blob/HEAD/policy/model/vision_transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2408.11001","paper":"/paper/megafusion-extend-diffusion-models-towards","title":"MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning","date":"2024-08-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haoningwu3639/MegaFusion","path":"SD3-MegaFusion/model/embedding.py","file_url":"https://github.com/haoningwu3639/MegaFusion/blob/HEAD/SD3-MegaFusion/model/embedding.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"59fa7b38de05f443","mcp_get_code":{"code_sha256":"59fa7b38de05f443"}},{"arxiv_id":"2408.05710","paper":"/paper/efficient-diffusion-transformer-with-step","title":"Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators","date":"2024-08-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leaplabthu/attention-mediators","path":"attention_mediator/models.py","file_url":"https://github.com/leaplabthu/attention-mediators/blob/HEAD/attention_mediator/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2408.02615","paper":"/paper/2408-02615","title":"LaMamba-Diff: Linear-Time High-Fidelity Diffusion Models Based on Local Attention and Mamba","date":"2024-08-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yunxiangfu2001/lamamba-diff","path":"model/lamamba.py","file_url":"https://github.com/yunxiangfu2001/lamamba-diff/blob/HEAD/model/lamamba.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2408.01800","paper":"/paper/2408-01800","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","date":"2024-08-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"OpenBMB/MiniCPM-o","path":"omnilmm/model/resampler.py","file_url":"https://github.com/OpenBMB/MiniCPM-o/blob/HEAD/omnilmm/model/resampler.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2408.00372","paper":"/paper/few-shot-defect-image-generation-based-on","title":"Few-shot Defect Image Generation based on Consistency Modeling","date":"2024-08-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ffdd-diffusion/defectdiffu","path":"models_add_cross_concate.py","file_url":"https://github.com/ffdd-diffusion/defectdiffu/blob/HEAD/models_add_cross_concate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2407.16957","paper":"/paper/raindrop-clarity-a-dual-focused-dataset-for","title":"Raindrop Clarity: A Dual-Focused Dataset for Day and Night Raindrop Removal","date":"2024-07-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2407.16564","paper":"/paper/audio-prompt-adapter-unleashing-music-editing","title":"Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning","date":"2024-07-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fundwotsai2001/ap-adapter","path":"audio_encoder/models_mae.py","file_url":"https://github.com/fundwotsai2001/ap-adapter/blob/HEAD/audio_encoder/models_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2407.11633","paper":"/paper/scaling-diffusion-transformers-to-16-billion","title":"Scaling Diffusion Transformers to 16 Billion Parameters","date":"2024-07-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"feizc/dit-moe","path":"models.py","file_url":"https://github.com/feizc/dit-moe/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2407.08683","paper":"/paper/seed-story-multimodal-long-story-generation","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","date":"2024-07-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tencentarc/seed-story","path":"src/models/qwen_visual.py","file_url":"https://github.com/tencentarc/seed-story/blob/HEAD/src/models/qwen_visual.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2407.07311","paper":"/paper/vitime-a-visual-intelligence-based-foundation","title":"ViTime: A Visual Intelligence-Based Foundation Model for Time Series Forecasting","date":"2024-07-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ikeyang/vitime","path":"model/ViTimeAutoencoder.py","file_url":"https://github.com/ikeyang/vitime/blob/HEAD/model/ViTimeAutoencoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2407.01425","paper":"/paper/fora-fast-forward-caching-in-diffusion","title":"FORA: Fast-Forward Caching in Diffusion Transformer Acceleration","date":"2024-07-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"prathebaselva/fora","path":"src/models.py","file_url":"https://github.com/prathebaselva/fora/blob/HEAD/src/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2406.17601","paper":"/paper/director3d-real-world-camera-trajectory-and","title":"Director3D: Real-world Camera Trajectory and 3D Scene Generation from Text","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"imlixinyang/director3d","path":"modules/dit.py","file_url":"https://github.com/imlixinyang/director3d/blob/HEAD/modules/dit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2406.17343","paper":"/paper/q-dit-accurate-post-training-quantization-for","title":"Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers","date":"2024-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"juanerx/q-dit","path":"models/models.py","file_url":"https://github.com/juanerx/q-dit/blob/HEAD/models/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2406.07476","paper":"/paper/videollama-2-advancing-spatial-temporal","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","date":"2024-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/inf-clip","path":"inf_clip/models/pos_embed.py","file_url":"https://github.com/damo-nlp-sg/inf-clip/blob/HEAD/inf_clip/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2406.02176","paper":"/paper/aroma-preserving-spatial-structure-for-latent","title":"AROMA: Preserving Spatial Structure for Latent PDE Modeling with Local Neural Fields","date":"2024-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"louisserrano/aroma","path":"aroma/DIT.py","file_url":"https://github.com/louisserrano/aroma/blob/HEAD/aroma/DIT.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2405.20851","paper":"/paper/megactor-harness-the-power-of-raw-video-for","title":"MegActor: Harness the Power of Raw Video for Vivid Portrait Animation","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"megvii-research/megactor","path":"animate/megactor-sigma/embeddings.py","file_url":"https://github.com/megvii-research/megactor/blob/HEAD/animate/megactor-sigma/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"59fa7b38de05f443","mcp_get_code":{"code_sha256":"59fa7b38de05f443"}},{"arxiv_id":"2405.19298","paper":"/paper/adaptive-image-quality-assessment-via","title":"Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Q-Future/Compare2Score","path":"q_align/model/visual_encoder.py","file_url":"https://github.com/Q-Future/Compare2Score/blob/HEAD/q_align/model/visual_encoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2405.17403","paper":"/paper/a-closer-look-at-time-steps-is-worthy-of","title":"A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nus-hpc-ai-lab/speed","path":"speed/networks/pixart/PixArt.py","file_url":"https://github.com/nus-hpc-ai-lab/speed/blob/HEAD/speed/networks/pixart/PixArt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"60599713933af278","mcp_get_code":{"code_sha256":"60599713933af278"}},{"arxiv_id":"2405.17403","paper":"/paper/a-closer-look-at-time-steps-is-worthy-of","title":"A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"1zeryu/speed","path":"speed/networks/dit/mdt.py","file_url":"https://github.com/1zeryu/speed/blob/HEAD/speed/networks/dit/mdt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2405.17220","paper":"/paper/rlaif-v-aligning-mllms-through-open-source-ai","title":"RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openbmb/omnilmm","path":"omnilmm/model/resampler.py","file_url":"https://github.com/openbmb/omnilmm/blob/HEAD/omnilmm/model/resampler.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2405.04312","paper":"/paper/inf-dit-upsampling-any-resolution-image-with","title":"Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer","date":"2024-05-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thudm/inf-dit","path":"dit/embeddings.py","file_url":"https://github.com/thudm/inf-dit/blob/HEAD/dit/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2405.00233","paper":"/paper/semanticodec-an-ultra-low-bitrate-semantic","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","date":"2024-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haoheliu/SemantiCodec-inference","path":"semanticodec/modules/audiomae/pos_embed.py","file_url":"https://github.com/haoheliu/SemantiCodec-inference/blob/HEAD/semanticodec/modules/audiomae/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2404.12766","paper":"/paper/continual-learning-on-a-diet-learning-from","title":"Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation","date":"2024-04-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wx-zhang/continual-learning-on-a-diet","path":"model/pose_embed.py","file_url":"https://github.com/wx-zhang/continual-learning-on-a-diet/blob/HEAD/model/pose_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2404.10710","paper":"/paper/dual-modalities-of-text-visual-and-textual","title":"Autoregressive Pre-Training on Pixels and Texts","date":"2024-04-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ernie-research/pixelgpt","path":"src/pixel/models/pixel/modeling_pixel.py","file_url":"https://github.com/ernie-research/pixelgpt/blob/HEAD/src/pixel/models/pixel/modeling_pixel.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"04ba37e6ea0444db","mcp_get_code":{"code_sha256":"04ba37e6ea0444db"}},{"arxiv_id":"2404.04478","paper":"/paper/diffusion-rwkv-scaling-rwkv-like","title":"Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models","date":"2024-04-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"feizc/diffusion-rwkv","path":"models_drwkv.py","file_url":"https://github.com/feizc/diffusion-rwkv/blob/HEAD/models_drwkv.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2404.03482","paper":"/paper/adaglimpse-active-visual-exploration-with","title":"AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and Scale","date":"2024-04-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"apardyl/adaglimpse","path":"architectures/mae_utils.py","file_url":"https://github.com/apardyl/adaglimpse/blob/HEAD/architectures/mae_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2403.15378","paper":"/paper/long-clip-unlocking-the-long-text-capability","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","date":"2024-03-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"beichenzbc/long-clip","path":"open_clip_long/pos_embed.py","file_url":"https://github.com/beichenzbc/long-clip/blob/HEAD/open_clip_long/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2403.09502","paper":"/paper/equiav-leveraging-equivariance-for-audio","title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JongSuk1/EquiAV","path":"models/pos_embed.py","file_url":"https://github.com/JongSuk1/EquiAV/blob/HEAD/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2403.09176","paper":"/paper/switch-diffusion-transformer-synergizing","title":"Switch Diffusion Transformer: Synergizing Denoising Tasks with Sparse Mixture-of-Experts","date":"2024-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"byeongjun-park/Switch-DiT","path":"models/DiT/models.py","file_url":"https://github.com/byeongjun-park/Switch-DiT/blob/HEAD/models/DiT/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2403.07815","paper":"/paper/chronos-learning-the-language-of-time-series","title":"Chronos: Learning the Language of Time Series","date":"2024-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mobile-sensing-and-ubicomp-laboratory/normwear","path":"modules/layers.py","file_url":"https://github.com/mobile-sensing-and-ubicomp-laboratory/normwear/blob/HEAD/modules/layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2403.04692","paper":"/paper/pixart-s-weak-to-strong-training-of-diffusion","title":"PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","date":"2024-03-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2402.16445","paper":"/paper/2402-16445","title":"ProLLaMA: A Protein Language Model for Multi-Task Protein Language Processing","date":null,"month_inferred_from_arxiv_id":"2024-02","title_source":"archive","repo":"linzy19/taxdiff","path":"models.py","file_url":"https://github.com/linzy19/taxdiff/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2402.14654","paper":"/paper/multi-hmr-multi-person-whole-body-human-mesh","title":"Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single Shot","date":"2024-02-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"naver/multi-hmr","path":"multi_hmr_anny/pos_embed.py","file_url":"https://github.com/naver/multi-hmr/blob/HEAD/multi_hmr_anny/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2402.14167","paper":"/paper/t-stitch-accelerating-sampling-in-pre-trained","title":"T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nvlabs/t-stitch","path":"dit/models.py","file_url":"https://github.com/nvlabs/t-stitch/blob/HEAD/dit/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2402.13561","paper":"/paper/cognitive-visual-language-mapper-advancing","title":"Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment","date":"2024-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hitsz-tmg/cognitive-visual-language-mapper","path":"Qwen/Qwen_VL/visual.py","file_url":"https://github.com/hitsz-tmg/cognitive-visual-language-mapper/blob/HEAD/Qwen/Qwen_VL/visual.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2402.11838","paper":"/paper/unist-a-prompt-empowered-universal-model-for","title":"UniST: A Prompt-Empowered Universal Model for Urban Spatio-Temporal Prediction","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsinghua-fib-lab/unist","path":"src/Embed.py","file_url":"https://github.com/tsinghua-fib-lab/unist/blob/HEAD/src/Embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2402.11458","paper":"/paper/key-patch-proposer-key-patches-contain-rich","title":"Key Patch Proposer: Key Patches Contain Rich Information","date":"2024-02-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CA-TT-AC/key-patch-proposer","path":"util/pos_embed.py","file_url":"https://github.com/CA-TT-AC/key-patch-proposer/blob/HEAD/util/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2402.04252","paper":"/paper/eva-clip-18b-scaling-clip-to-18-billion","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","date":"2024-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baaivision/EVA","path":"EVA-01/eva/modeling_mae_pretrain.py","file_url":"https://github.com/baaivision/EVA/blob/HEAD/EVA-01/eva/modeling_mae_pretrain.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2401.14404","paper":"/paper/deconstructing-denoising-diffusion-models-for","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","date":"2024-01-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"futurexiang/ddae","path":"DiT/models.py","file_url":"https://github.com/futurexiang/ddae/blob/HEAD/DiT/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2401.08740","paper":"/paper/sit-exploring-flow-and-diffusion-based","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","date":"2024-01-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"willisma/sit","path":"models.py","file_url":"https://github.com/willisma/sit/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2401.02031","paper":"/paper/spy-watermark-robust-invisible-watermarking","title":"Spy-Watermark: Robust Invisible Watermarking for Backdoor Attack","date":"2024-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rfww/spy-watermark","path":"models/pos_embed.py","file_url":"https://github.com/rfww/spy-watermark/blob/HEAD/models/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2401.01887","paper":"/paper/leap-vo-long-term-effective-any-point","title":"LEAP-VO: Long-term Effective Any Point Tracking for Visual Odometry","date":"2024-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wrchen530/leapvo","path":"main/leap/core/embeddings.py","file_url":"https://github.com/wrchen530/leapvo/blob/HEAD/main/leap/core/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2401.08639","paper":"/paper/one-step-diffusion-distillation-via-deep-1","title":"One-Step Diffusion Distillation via Deep Equilibrium Models","date":"2023-12-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"locuslab/get","path":"models/get.py","file_url":"https://github.com/locuslab/get/blob/HEAD/models/get.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2312.16693","paper":"/paper/i2v-adapter-a-general-image-to-video-adapter","title":"I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models","date":"2023-12-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bytedance/x-dyna","path":"animatediff/models/embeddings.py","file_url":"https://github.com/bytedance/x-dyna/blob/HEAD/animatediff/models/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"59fa7b38de05f443","mcp_get_code":{"code_sha256":"59fa7b38de05f443"}},{"arxiv_id":"2312.02139","paper":"/paper/diffit-diffusion-vision-transformers-for","title":"DiffiT: Diffusion Vision Transformers for Image Generation","date":"2023-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nvlabs/diffit","path":"diffit/diffit.py","file_url":"https://github.com/nvlabs/diffit/blob/HEAD/diffit/diffit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"5f78ec79ce3ed0a3","mcp_get_code":{"code_sha256":"5f78ec79ce3ed0a3"}},{"arxiv_id":"2311.17597","paper":"/paper/continual-self-supervised-learning-towards","title":"Continual Self-supervised Learning: Towards Universal Multi-modal Medical Data Representation Learning","date":"2023-11-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yeerwen/medcoss","path":"model/Unimodel.py","file_url":"https://github.com/yeerwen/medcoss/blob/HEAD/model/Unimodel.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2311.16922","paper":"/paper/mitigating-object-hallucinations-in-large","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","date":"2023-11-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"damo-nlp-sg/vcd","path":"experiments/Qwen_VL/visual.py","file_url":"https://github.com/damo-nlp-sg/vcd/blob/HEAD/experiments/Qwen_VL/visual.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2311.16498","paper":"/paper/magicanimate-temporally-consistent-human","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","date":"2023-11-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"magic-research/magic-animate","path":"magicanimate/models/embeddings.py","file_url":"https://github.com/magic-research/magic-animate/blob/HEAD/magicanimate/models/embeddings.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"59fa7b38de05f443","mcp_get_code":{"code_sha256":"59fa7b38de05f443"}},{"arxiv_id":"2311.00566","paper":"/paper/croma-remote-sensing-representations-with-1","title":"CROMA: Remote Sensing Representations with Contrastive Radar-Optical Masked Autoencoders","date":"2023-11-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"antofuller/croma","path":"pretrain_croma.py","file_url":"https://github.com/antofuller/croma/blob/HEAD/pretrain_croma.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"90bcf667c7d798b4","mcp_get_code":{"code_sha256":"90bcf667c7d798b4"}},{"arxiv_id":"2311.00566","paper":"/paper/croma-remote-sensing-representations-with-1","title":"CROMA: Remote Sensing Representations with Contrastive Radar-Optical Masked Autoencoders","date":"2023-11-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"antofuller/CROMA","path":"pretrain_croma.py","file_url":"https://github.com/antofuller/CROMA/blob/HEAD/pretrain_croma.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"be98aaf46e9dea53","mcp_get_code":{"code_sha256":"be98aaf46e9dea53"}},{"arxiv_id":"2310.18341","paper":"/paper/cxr-llava-multimodal-large-language-model-for","title":"CXR-LLAVA: a multimodal large language model for interpreting chest X-ray images","date":"2023-10-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ecofri/cxr_llava","path":"CXR_LLAVA_HF/VisualTransformer.py","file_url":"https://github.com/ecofri/cxr_llava/blob/HEAD/CXR_LLAVA_HF/VisualTransformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2310.16175","paper":"/paper/g-cascade-efficient-cascaded-graph","title":"G-CASCADE: Efficient Cascaded Graph Convolutional Decoding for 2D Medical Image Segmentation","date":"2023-10-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SLDGroup/G-CASCADE","path":"lib/gcn_lib/pos_embed.py","file_url":"https://github.com/SLDGroup/G-CASCADE/blob/HEAD/lib/gcn_lib/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2310.09031","paper":"/paper/minde-mutual-information-neural-diffusion","title":"MINDE: Mutual Information Neural Diffusion Estimation","date":"2023-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MustaphaBounoua/minde","path":"src/models/transformer.py","file_url":"https://github.com/MustaphaBounoua/minde/blob/HEAD/src/models/transformer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2310.06389","paper":"/paper/learning-stackable-and-skippable-lego-bricks","title":"Learning Stackable and Skippable LEGO Bricks for Efficient, Reconfigurable, and Variable-Resolution Diffusion Modeling","date":"2023-10-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JegZheng/LEGODiffusion","path":"training/lego_models.py","file_url":"https://github.com/JegZheng/LEGODiffusion/blob/HEAD/training/lego_models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2310.00426","paper":"/paper/pixart-a-fast-training-of-diffusion","title":"PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","date":"2023-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2309.15729","paper":"/paper/mindgpt-interpreting-what-you-see-with-non","title":"MindGPT: Interpreting What You See with Non-invasive Brain Recordings","date":"2023-09-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jxuanc/mindgpt","path":"modules/pos_embed.py","file_url":"https://github.com/jxuanc/mindgpt/blob/HEAD/modules/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2309.10667","paper":"/paper/learning-tri-modal-embeddings-for-zero-shot","title":"Learning Tri-modal Embeddings for Zero-Shot Soundscape Mapping","date":"2023-09-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mvrl/geoclap","path":"geoclap/models/SATMAE.py","file_url":"https://github.com/mvrl/geoclap/blob/HEAD/geoclap/models/SATMAE.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2308.00566","paper":"/paper/predicting-masked-tokens-in-stochastic","title":"Stochastic positional embeddings improve masked image modeling","date":"2023-07-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amirbar/stop","path":"src/deit.py","file_url":"https://github.com/amirbar/stop/blob/HEAD/src/deit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2307.14659","paper":"/paper/lldiffusion-learning-degradation","title":"LLDiffusion: Learning Degradation Representations in Diffusion Models for Low-Light Image Enhancement","date":"2023-07-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"taowangzj/lldiffusion","path":"models/modules/dit.py","file_url":"https://github.com/taowangzj/lldiffusion/blob/HEAD/models/modules/dit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2307.09361","paper":"/paper/moca-self-supervised-representation-learning","title":"MOCA: Self-supervised Representation Learning by Predicting Masked Online Codebook Assignments","date":"2023-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"valeoai/moca","path":"util/model_utils.py","file_url":"https://github.com/valeoai/moca/blob/HEAD/util/model_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2304.04269","paper":"/paper/humansd-a-native-skeleton-guided-diffusion","title":"HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image Generation","date":"2023-04-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiangchenyin/grpose","path":"gcn_lib/pos_embed.py","file_url":"https://github.com/xiangchenyin/grpose/blob/HEAD/gcn_lib/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2304.03283","paper":"/paper/diffusion-models-as-masked-autoencoders","title":"Diffusion Models as Masked Autoencoders","date":"2023-04-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kimdanni/DiffMAE","path":"models_cross.py","file_url":"https://github.com/kimdanni/DiffMAE/blob/HEAD/models_cross.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"b7482295ffca3e2c","mcp_get_code":{"code_sha256":"b7482295ffca3e2c"}},{"arxiv_id":"2303.15564","paper":"/paper/mask-and-restore-blind-backdoor-defense-at","title":"Mask and Restore: Blind Backdoor Defense at Test Time with Masked Autoencoder","date":"2023-03-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tsun/bdmae","path":"mae/pos_embed.py","file_url":"https://github.com/tsun/bdmae/blob/HEAD/mae/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2303.10834","paper":"/paper/object-centric-slot-diffusion-1","title":"Object-Centric Slot Diffusion","date":"2023-03-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jindongjiang/latent-slot-diffusion","path":"src/models/utils.py","file_url":"https://github.com/jindongjiang/latent-slot-diffusion/blob/HEAD/src/models/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2301.13155","paper":"/paper/advancing-radiograph-representation-learning","title":"Advancing Radiograph Representation Learning with Masked Record Modeling","date":"2023-01-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rl4m/mrm-pytorch","path":"model_mrm.py","file_url":"https://github.com/rl4m/mrm-pytorch/blob/HEAD/model_mrm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"21283b827aa73894","mcp_get_code":{"code_sha256":"21283b827aa73894"}},{"arxiv_id":"2301.01296","paper":"/paper/tinymim-an-empirical-study-of-distilling-mim","title":"TinyMIM: An Empirical Study of Distilling MIM Pre-trained Models","date":"2023-01-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"2212.10368","paper":"/paper/masked-event-modeling-self-supervised","title":"Masked Event Modeling: Self-Supervised Pretraining for Event Cameras","date":"2022-12-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tum-vision/mem","path":"mem/modeling_mae.py","file_url":"https://github.com/tum-vision/mem/blob/HEAD/mem/modeling_mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2212.09748","paper":"/paper/scalable-diffusion-models-with-transformers","title":"Scalable Diffusion Models with Transformers","date":"2022-12-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2212.07525","paper":"/paper/efficient-self-supervised-learning-with","title":"Efficient Self-supervised Learning with Contextualized Target Representations for Vision, Speech and Language","date":"2022-12-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ashutosh1919/data2vec-pytorch","path":"data2vec/models/mae.py","file_url":"https://github.com/ashutosh1919/data2vec-pytorch/blob/HEAD/data2vec/models/mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2212.03229","paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","date":"2022-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"daniel-code/TubeViT","path":"tubevit/positional_encoding.py","file_url":"https://github.com/daniel-code/TubeViT/blob/HEAD/tubevit/positional_encoding.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"715aab11d1b73ce8","mcp_get_code":{"code_sha256":"715aab11d1b73ce8"}},{"arxiv_id":"2211.13594","paper":"/paper/self-supervised-vision-language-pretraining","title":"Self-supervised vision-language pretraining for Medical visual question answering","date":"2022-11-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pengfeiliheu/m2i2","path":"models/mae.py","file_url":"https://github.com/pengfeiliheu/m2i2/blob/HEAD/models/mae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2211.12941","paper":"/paper/eurnet-efficient-multi-range-relational","title":"EurNet: Efficient Multi-Range Relational Modeling of Spatial Multi-Relational Data","date":"2022-11-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hirl-team/eurnet-image","path":"eurnet/utils/position_embed.py","file_url":"https://github.com/hirl-team/eurnet-image/blob/HEAD/eurnet/utils/position_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2210.16870","paper":"/paper/a-simple-efficient-and-scalable-contrastive","title":"A simple, efficient and scalable contrastive masked autoencoder for learning visual representations","date":"2022-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bwconrad/can","path":"src/network/pos_embed.py","file_url":"https://github.com/bwconrad/can/blob/HEAD/src/network/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2210.10716","paper":"/paper/croco-self-supervised-pre-training-for-3d","title":"CroCo: Self-Supervised Pre-training for 3D Vision Tasks by Cross-View Completion","date":"2022-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"naver/croco","path":"models/croco.py","file_url":"https://github.com/naver/croco/blob/HEAD/models/croco.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"2204.09435","paper":"/paper/hephaestus-a-large-scale-multitask-dataset","title":"Hephaestus: A large scale multitask dataset towards InSAR understanding","date":"2022-04-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"orion-ai-lab/hephaestus","path":"self_supervised/mae/mae_model.py","file_url":"https://github.com/orion-ai-lab/hephaestus/blob/HEAD/self_supervised/mae/mae_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f531beeb1ce391fb","mcp_get_code":{"code_sha256":"f531beeb1ce391fb"}},{"arxiv_id":"2203.10897","paper":"/paper/unified-multivariate-gaussian-mixture-for","title":"Unified Multivariate Gaussian Mixture for Efficient Neural Image Compression","date":"2022-03-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiaosu-zhu/McQuic","path":"mcquic/modules/generator.py","file_url":"https://github.com/xiaosu-zhu/McQuic/blob/HEAD/mcquic/modules/generator.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"2202.00660","paper":"/paper/interactron-embodied-adaptive-object","title":"Interactron: Embodied Adaptive Object Detection","date":"2022-02-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"allenai/interactron","path":"models/gpt.py","file_url":"https://github.com/allenai/interactron/blob/HEAD/models/gpt.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2111.09887","paper":"/paper/pytorchvideo-a-deep-learning-library-for","title":"PyTorchVideo: A Deep Learning Library for Video Understanding","date":"2021-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/pytorchvideo","path":"pytorchvideo/layers/positional_encoding.py","file_url":"https://github.com/facebookresearch/pytorchvideo/blob/HEAD/pytorchvideo/layers/positional_encoding.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":false,"code_sha256_prefix":"56a6ffa5c906c4e9","mcp_get_code":{"code_sha256":"56a6ffa5c906c4e9"}},{"arxiv_id":"2111.06377","paper":"/paper/masked-autoencoders-are-scalable-vision","title":"Masked Autoencoders Are Scalable Vision Learners","date":"2021-11-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"0jason000/mae_vit","path":"src/mae_vit.py","file_url":"https://github.com/0jason000/mae_vit/blob/HEAD/src/mae_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"2105.12723","paper":"/paper/aggregating-nested-transformers","title":"Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding","date":"2021-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"freder-chen/vitp","path":"util/pos_embed.py","file_url":"https://github.com/freder-chen/vitp/blob/HEAD/util/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"1807.10221","paper":"/paper/unified-perceptual-parsing-for-scene","title":"Unified Perceptual Parsing for Scene Understanding","date":"2018-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ESA-PhiLab/PhilEO-MajorTOM","path":"model/phileo_vit.py","file_url":"https://github.com/ESA-PhiLab/PhilEO-MajorTOM/blob/HEAD/model/phileo_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4fd80de79832745d","mcp_get_code":{"code_sha256":"4fd80de79832745d"}},{"arxiv_id":"aaai_29391","paper":null,"title":"arXiv:aaai_29391","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Jiahuiqu/LDS2AE","path":"pos_embed.py","file_url":"https://github.com/Jiahuiqu/LDS2AE/blob/HEAD/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}},{"arxiv_id":"Zhou_Towards_Effective_Foundation_Model_Adaptation_for_Extreme_Cross-Domain_Few-Shot_Learning_ICCV_2025_paper","paper":null,"title":"arXiv:Zhou_Towards_Effective_Foundation_Model_Adaptation_for_Extreme_Cross-Domain_Few-Shot_Learning_ICCV_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"NWPUZhoufei/FMA","path":"MAE_decoder.py","file_url":"https://github.com/NWPUZhoufei/FMA/blob/HEAD/MAE_decoder.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2884deadbb637c3e","mcp_get_code":{"code_sha256":"2884deadbb637c3e"}},{"arxiv_id":"Xiao_OmniGen_Unified_Image_Generation_CVPR_2025_paper","paper":null,"title":"arXiv:Xiao_OmniGen_Unified_Image_Generation_CVPR_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"VectorSpaceLab/OmniGen","path":"OmniGen/model.py","file_url":"https://github.com/VectorSpaceLab/OmniGen/blob/HEAD/OmniGen/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"Garrido-Munoz_On_the_Generalization_of_Handwritten_Text_Recognition_Models_CVPR_2025_paper","paper":null,"title":"arXiv:Garrido-Munoz_On_the_Generalization_of_Handwritten_Text_Recognition_Models_CVPR_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"carlos10garrido/HTR-OOD","path":"src/models/components/htr_vit.py","file_url":"https://github.com/carlos10garrido/HTR-OOD/blob/HEAD/src/models/components/htr_vit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"665d8a4e8f673a4c","mcp_get_code":{"code_sha256":"665d8a4e8f673a4c"}},{"arxiv_id":"Fang_Unleashing_Vanilla_Vision_Transformer_with_Masked_Image_Modeling_for_Object_ICCV_2023_paper","paper":null,"title":"arXiv:Fang_Unleashing_Vanilla_Vision_Transformer_with_Masked_Image_Modeling_for_Object_ICCV_2023_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"hustvl/MIMDet","path":"utils/pos_embed.py","file_url":"https://github.com/hustvl/MIMDet/blob/HEAD/utils/pos_embed.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f10004e059714d42","mcp_get_code":{"code_sha256":"f10004e059714d42"}}]}