| Beyond Classification: Task-Dependent Learnability under Privacy-Motivated Image Transformations added by Syntology |
2026-08 (from id) |
LeonRanke/Task-Dependent-Learnability/src/models/jpdvt.py c03ef37ebf97369c |
unverified |
MIT (permissive) |
| UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction added by Syntology |
2026-08 (from id) |
JN-Yun/UDT/models/UDT.py 4509f0ab71bc54ca |
unverified |
no licence file found · pointer only |
| PedestrianDiffusion: Multimodal Generative Denoising and Dense State Estimation for Inertial Navigation added by Syntology |
2026-07 (from id) |
jacklu333333/PedestrianDiffusion/utils/DiT.py 665d8a4e8f673a4c |
unverified |
AGPL-3.0 (copyleft) · pointer only |
| Rethinking Dataset Distillation for Classification: Do Distilled Sets Outperform Coresets? added by Syntology |
2026-06 (from id) |
AyushRoy2001/ManifoldGD/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation added by Syntology |
2026-06 (from id) |
Freyliu0516/audioPG/models/audiomae.py 572240b722c323a0 |
unverified |
no licence file found · pointer only |
| Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding? added by Syntology |
2026-06 (from id) |
jqtangust/Robust-U1/modeling/modeling/bagel/modeling_utils.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era added by Syntology |
2026-05 (from id) |
lluosi/RDB-CL/ETrain/Models/Qwen/visual.py 2884deadbb637c3e |
unverified |
no licence file found · pointer only |
| SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment added by Syntology |
2026-05 (from id) |
piooip/SynerMedGen/modeling/bagel/modeling_utils.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| Meta-Learning Hyperparameters for Parameter Efficient Fine-Tuning added by Syntology |
2026-03 (from id) |
doem97/metalora/models/satmae_vit.py 4fd80de79832745d |
unverified |
Apache-2.0 (permissive) |
| UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation added by Syntology |
2026-01 (from id) |
ZrH42/UniX/modeling/unix/modeling_utils.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Rank-based Geographical Regularization: Revisiting Contrastive Self-Supervised Learning for Multispectral Remote Sensing Imagery added by Syntology |
2026-01 (from id) |
tomburgert/georank/models/croma_backbone.py 1be616eeae3e24f7 |
unverified |
no licence file found · pointer only |
| Massive Editing for Large Language Models Based on Dynamic Weight Generation added by Syntology |
2025-12 (from id) |
RodeWayne/MeG-for-Knowledge-Editing/my_model_five_bert_text.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Diffusion Transformers for Imputation: Statistical Efficiency and Uncertainty Quantification added by Syntology |
2025-10 (from id) |
liamyzq/DiT_time_series_imputation/model.py 05ac220b7da8edbb |
ran · fixture could not drive it
fingerprinted |
MIT (permissive) |
| AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning added by Syntology |
2025-08 (from id) |
idejie/ar/models/ar/transformer_utils.py b1bc67528f8aa03f |
unverified |
no licence file found · pointer only |
| Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision added by Syntology |
2025-08 (from id) |
Fr0zenCrane/UniCoT/modeling/bagel/modeling_utils.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge |
6 Jul 2025 |
Zhangwenyao1/DreamVLA/models/dreamvla_model.py 2884deadbb637c3e |
unverified |
no licence file found · pointer only |
| CaO$_2$: Rectifying Inconsistencies in Diffusion-Based Dataset Distillation |
27 Jun 2025 |
hatchetproject/cao2/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| arXiv:2506.21803 |
2025-06 (from id) |
HKU-MedAI/MELP/src/melp/backbone/pos_embed.py 4fd80de79832745d |
unverified |
MIT (permissive) |
| Test3R: Learning to Reconstruct 3D at Test Time |
16 Jun 2025 |
nopqaq/test3r/croco/models/pos_embed.py 4fd80de79832745d |
unverified |
no licence file found · pointer only |
| Self-supervised Learning of Echocardiographic Video Representations via Online Cluster Distillation |
13 Jun 2025 |
mdivyanshu97/discovr/models/modeling_pretrain.py 715aab11d1b73ce8 |
ran · fixture could not drive it
|
no licence file found · pointer only |
| Emerging Properties in Unified Multimodal Pretraining |
20 May 2025 |
neverbiasu/ComfyUI-BAGEL/modeling/bagel/modeling_utils.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| Unified Continuous Generative Models |
12 May 2025 |
LINs-Lab/UCGM/networks/lightningdit.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework |
17 Apr 2025 |
event-ahu/cm3ae/pos_embed.py 4fd80de79832745d |
unverified |
MIT (permissive) |
| InsViE-1M: Effective Instruction-based Video Editing with Elaborate Dataset Construction |
26 Mar 2025 |
langmanbusi/insvie/CogVideo/sat/dit_video_concat.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition |
24 Mar 2025 |
zhangyifei01/LMIM/lmim_pretrain/models_lmim.py f10004e059714d42 |
unverified |
no licence file found · pointer only |
| "Principal Components" Enable A New Language of Images |
11 Mar 2025 |
visual-gen/semanticist/semanticist/stage1/diffusion_transfomer.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| "Principal Components" Enable A New Language of Images |
11 Mar 2025 |
visual-gen/semanticist/semanticist/stage1/pos_embed.py 4fd80de79832745d |
unverified |
MIT (permissive) |
| FlashVideo:Flowing Fidelity to Detail for Efficient High-Resolution Video Generation |
7 Feb 2025 |
foundationvision/flashvideo/flashvideo/dit_video_concat.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| On the Guidance of Flow Matching |
4 Feb 2025 |
ai4science-westlakeu/flow_guidance/offline_rl/gflower/models_flow/transformer.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation |
2024-12 (from id) |
openrobotlab/seer/models/seer_model.py 2884deadbb637c3e |
unverified |
Apache-2.0 (permissive) |
| LLaVA-UHD v2: an MLLM Integrating High-Resolution Feature Pyramid via Hierarchical Window Transformer |
18 Dec 2024 |
thunlp/llava-uhd/llava/model/multimodal_projector/uhd_v1_resampler.py 2884deadbb637c3e |
unverified |
Apache-2.0 (permissive) |
| Causal Diffusion Transformers for Generative Modeling |
16 Dec 2024 |
identical code first harvested elsewhere 665d8a4e8f673a4c |
unverified |
licence of this copy not recorded |
| Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising |
7 Dec 2024 |
vainf/remix-dit/remix_dit.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| TinyFusion: Diffusion Transformers Learned Shallow |
2 Dec 2024 |
vainf/tinyfusion/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Playable Game Generation |
1 Dec 2024 |
greatx3/playable-game-generation/network/df/models/diffusion/dit_models.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer |
1 Dec 2024 |
fudan-generative-vision/hallo3/hallo3/ref_dit_video_concat.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints |
26 Nov 2024 |
opensparsellms/skip-dit/class-to-image/models.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| UrbanDiT: A Foundation Model for Open-World Urban Spatio-Temporal Learning |
19 Nov 2024 |
tsinghua-fib-lab/UrbanDiT/src/Embed.py 2884deadbb637c3e |
unverified |
MIT (permissive) |
| IKEA Manuals at Work: 4D Grounding of Assembly Instructions on Internet Videos |
18 Nov 2024 |
yunongLiu1/IKEA-Manuals-at-Work/src/IKEAVideo/featurizers/MAE.py f10004e059714d42 |
unverified |
no licence file found · pointer only |
| ENAT: Rethinking Spatial-temporal Interactions in Token-based Image Synthesis |
11 Nov 2024 |
leaplabthu/enat/libs/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| DiMSUM: Diffusion Mamba -- A Scalable and Unified Spatial-Frequency Method for Image Generation |
6 Nov 2024 |
VinAIResearch/DiMSUM/dimsum/models_dim.py 665d8a4e8f673a4c |
unverified |
BSD-3-Clause (permissive) |
| LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior |
28 Oct 2024 |
hywang66/LARP/models/embed.py fd6ac2b105d8a7b5 |
unverified |
MIT (permissive) |
| One-Step Diffusion Distillation through Score Implicit Matching |
22 Oct 2024 |
maple-research-lab/sim/models/PixArt.py 60599713933af278 |
unverified |
AGPL-3.0 (copyleft) · pointer only |
| EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning |
17 Oct 2024 |
cs20s030/ehmam/models/mae.py f10004e059714d42 |
unverified |
MIT (permissive) |
| Depth Any Video with Scalable Synthetic Data |
14 Oct 2024 |
Nightmare-n/DepthAnyVideo/dav/models/embeddings.py 59fa7b38de05f443 |
unverified |
licence not identified · pointer only |
| Reconstructive Visual Instruction Tuning |
12 Oct 2024 |
haochen-wang409/ross/ross/model/utils.py 2884deadbb637c3e |
unverified |
Apache-2.0 (permissive) |
| HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration |
2 Oct 2024 |
modeltc/harmonica/models/dynamic_models.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| Brain-JEPA: Brain Dynamics Foundation Model with Gradient Positioning and Spatiotemporal Masking |
28 Sep 2024 |
Eric-LRL/Brain-JEPA/src/models/vision_transformer.py 4fd80de79832745d |
unverified |
no licence file found · pointer only |
| FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner |
26 Sep 2024 |
shiml20/FlowTurbo/models_assemble.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| MonoFormer: One Transformer for Both Diffusion and Autoregression |
24 Sep 2024 |
MonoFormer/MonoFormer/models/modeling.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Towards Model-Agnostic Dataset Condensation by Heterogeneous Models |
22 Sep 2024 |
KHU-AGI/HMDC/gcn_lib/pos_embed.py f10004e059714d42 |
unverified |
no licence file found · pointer only |
| Embedding Geometries of Contrastive Language-Image Pre-Training |
19 Sep 2024 |
eify/open_clip/src/open_clip/pos_embed.py 4fd80de79832745d |
unverified |
no licence file found · pointer only |
| OmniGen: Unified Image Generation |
17 Sep 2024 |
vectorspacelab/omnigen/OmniGen/model.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models |
16 Sep 2024 |
yuchuantian/u-dit/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| DiTAS: Quantizing Diffusion Transformers via Enhanced Activation Smoothing |
12 Sep 2024 |
DZY122/DiTAS/models.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| In-Context Imitation Learning via Next-Token Prediction |
28 Aug 2024 |
Max-Fu/icrt/icrt/models/backbones/pos_embed.py b7482295ffca3e2c |
unverified |
Apache-2.0 (permissive) |
| GR-MG: Leveraging Partially Annotated Data via Multi-Modal Goal-Conditioned Policy |
26 Aug 2024 |
bytedance/GR-MG/policy/model/vision_transformer.py 2884deadbb637c3e |
unverified |
Apache-2.0 (permissive) |
| MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning |
20 Aug 2024 |
haoningwu3639/MegaFusion/SD3-MegaFusion/model/embedding.py 59fa7b38de05f443 |
unverified |
no licence file found · pointer only |
| Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators |
11 Aug 2024 |
leaplabthu/attention-mediators/attention_mediator/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| LaMamba-Diff: Linear-Time High-Fidelity Diffusion Models Based on Local Attention and Mamba |
5 Aug 2024 |
yunxiangfu2001/lamamba-diff/model/lamamba.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| MiniCPM-V: A GPT-4V Level MLLM on Your Phone |
3 Aug 2024 |
OpenBMB/MiniCPM-o/omnilmm/model/resampler.py 2884deadbb637c3e |
unverified |
Apache-2.0 (permissive) |
| Few-shot Defect Image Generation based on Consistency Modeling |
1 Aug 2024 |
ffdd-diffusion/defectdiffu/models_add_cross_concate.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Raindrop Clarity: A Dual-Focused Dataset for Day and Night Raindrop Removal |
24 Jul 2024 |
identical code first harvested elsewhere 665d8a4e8f673a4c |
unverified |
licence of this copy not recorded |
| Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning |
23 Jul 2024 |
fundwotsai2001/ap-adapter/audio_encoder/models_mae.py 4fd80de79832745d |
unverified |
no licence file found · pointer only |
| Scaling Diffusion Transformers to 16 Billion Parameters |
16 Jul 2024 |
feizc/dit-moe/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| SEED-Story: Multimodal Long Story Generation with Large Language Model |
11 Jul 2024 |
tencentarc/seed-story/src/models/qwen_visual.py 2884deadbb637c3e |
unverified |
no licence file found · pointer only |
| ViTime: A Visual Intelligence-Based Foundation Model for Time Series Forecasting |
10 Jul 2024 |
ikeyang/vitime/model/ViTimeAutoencoder.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| FORA: Fast-Forward Caching in Diffusion Transformer Acceleration |
1 Jul 2024 |
prathebaselva/fora/src/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Director3D: Real-world Camera Trajectory and 3D Scene Generation from Text |
25 Jun 2024 |
imlixinyang/director3d/modules/dit.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers |
25 Jun 2024 |
juanerx/q-dit/models/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs |
11 Jun 2024 |
damo-nlp-sg/inf-clip/inf_clip/models/pos_embed.py 4fd80de79832745d |
unverified |
Apache-2.0 (permissive) |
| AROMA: Preserving Spatial Structure for Latent PDE Modeling with Local Neural Fields |
4 Jun 2024 |
louisserrano/aroma/aroma/DIT.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| MegActor: Harness the Power of Raw Video for Vivid Portrait Animation |
31 May 2024 |
megvii-research/megactor/animate/megactor-sigma/embeddings.py 59fa7b38de05f443 |
unverified |
Apache-2.0 (permissive) |
| Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare |
29 May 2024 |
Q-Future/Compare2Score/q_align/model/visual_encoder.py 2884deadbb637c3e |
unverified |
MIT (permissive) |
| A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training |
27 May 2024 |
nus-hpc-ai-lab/speed/speed/networks/pixart/PixArt.py 60599713933af278 |
unverified |
Apache-2.0 (permissive) |
| A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training |
27 May 2024 |
1zeryu/speed/speed/networks/dit/mdt.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness |
27 May 2024 |
openbmb/omnilmm/omnilmm/model/resampler.py 2884deadbb637c3e |
unverified |
Apache-2.0 (permissive) |
| Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer |
7 May 2024 |
thudm/inf-dit/dit/embeddings.py 665d8a4e8f673a4c |
unverified |
Apache-2.0 (permissive) |
| SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound |
30 Apr 2024 |
haoheliu/SemantiCodec-inference/semanticodec/modules/audiomae/pos_embed.py 4fd80de79832745d |
unverified |
MIT (permissive) |
| Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation |
19 Apr 2024 |
wx-zhang/continual-learning-on-a-diet/model/pose_embed.py f10004e059714d42 |
unverified |
no licence file found · pointer only |
| Autoregressive Pre-Training on Pixels and Texts |
16 Apr 2024 |
ernie-research/pixelgpt/src/pixel/models/pixel/modeling_pixel.py 04ba37e6ea0444db |
unverified |
MIT (permissive) |
| Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models |
6 Apr 2024 |
feizc/diffusion-rwkv/models_drwkv.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and Scale |
4 Apr 2024 |
apardyl/adaglimpse/architectures/mae_utils.py 2884deadbb637c3e |
unverified |
no licence file found · pointer only |
| Long-CLIP: Unlocking the Long-Text Capability of CLIP |
22 Mar 2024 |
beichenzbc/long-clip/open_clip_long/pos_embed.py 4fd80de79832745d |
unverified |
Apache-2.0 (permissive) |
| EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning |
14 Mar 2024 |
JongSuk1/EquiAV/models/pos_embed.py f10004e059714d42 |
unverified |
MIT (permissive) |
| Switch Diffusion Transformer: Synergizing Denoising Tasks with Sparse Mixture-of-Experts |
14 Mar 2024 |
byeongjun-park/Switch-DiT/models/DiT/models.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Chronos: Learning the Language of Time Series |
12 Mar 2024 |
mobile-sensing-and-ubicomp-laboratory/normwear/modules/layers.py 2884deadbb637c3e |
unverified |
Apache-2.0 (permissive) |
| PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation |
7 Mar 2024 |
identical code first harvested elsewhere 665d8a4e8f673a4c |
unverified |
licence of this copy not recorded |
| ProLLaMA: A Protein Language Model for Multi-Task Protein Language Processing |
2024-02 (from id) |
linzy19/taxdiff/models.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single Shot |
22 Feb 2024 |
naver/multi-hmr/multi_hmr_anny/pos_embed.py 4fd80de79832745d |
unverified |
no licence file found · pointer only |
| T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching |
21 Feb 2024 |
nvlabs/t-stitch/dit/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment |
21 Feb 2024 |
hitsz-tmg/cognitive-visual-language-mapper/Qwen/Qwen_VL/visual.py 2884deadbb637c3e |
unverified |
no licence file found · pointer only |
| UniST: A Prompt-Empowered Universal Model for Urban Spatio-Temporal Prediction |
19 Feb 2024 |
tsinghua-fib-lab/unist/src/Embed.py 2884deadbb637c3e |
unverified |
no licence file found · pointer only |
| Key Patch Proposer: Key Patches Contain Rich Information |
18 Feb 2024 |
CA-TT-AC/key-patch-proposer/util/pos_embed.py 4fd80de79832745d |
unverified |
no licence file found · pointer only |
| EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters |
6 Feb 2024 |
baaivision/EVA/EVA-01/eva/modeling_mae_pretrain.py f10004e059714d42 |
unverified |
MIT (permissive) |
| Deconstructing Denoising Diffusion Models for Self-Supervised Learning |
25 Jan 2024 |
futurexiang/ddae/DiT/models.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers |
16 Jan 2024 |
willisma/sit/models.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| Spy-Watermark: Robust Invisible Watermarking for Backdoor Attack |
4 Jan 2024 |
rfww/spy-watermark/models/pos_embed.py f10004e059714d42 |
unverified |
no licence file found · pointer only |
| LEAP-VO: Long-term Effective Any Point Tracking for Visual Odometry |
3 Jan 2024 |
wrchen530/leapvo/main/leap/core/embeddings.py 665d8a4e8f673a4c |
unverified |
no licence file found · pointer only |
| One-Step Diffusion Distillation via Deep Equilibrium Models |
12 Dec 2023 |
locuslab/get/models/get.py 665d8a4e8f673a4c |
unverified |
MIT (permissive) |
| I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models |
27 Dec 2023 |
bytedance/x-dyna/animatediff/models/embeddings.py 59fa7b38de05f443 |
unverified |
Apache-2.0 (permissive) |
| DiffiT: Diffusion Vision Transformers for Image Generation |
4 Dec 2023 |
nvlabs/diffit/diffit/diffit.py 5f78ec79ce3ed0a3 |
unverified |
licence not identified · pointer only |