{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-generation/papers/12","list_of":"/task/video-generation","task":"Video Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":12,"pages_in_order":15,"rows_per_page":100,"rows":[1101,1200],"of":1466,"counts":{"archive_papers_tagged":1466,"with_a_code_link":609,"where_syntology_ran_a_sample":257,"not_listed_spam_title":0,"listed":1466,"listed_where_code_ran":257,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":221,"every_run_a_failure_of_syntologys_instrument":36,"listed_with_a_run_with_no_instrument_failure":221,"listed_every_run_a_failure_of_syntologys_instrument":36,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-generation","prev":"/task/video-generation/papers/11","next":"/task/video-generation/papers/13","papers":[{"url":null,"slug":"advancing-video-quality-assessment-for-aigc","title":"Advancing Video Quality Assessment for AIGC","date":"2024-09-23","arxiv_id":"2409.14888","repositories_listed":0,"syntology":null},{"url":null,"slug":"facevid-1k-a-large-scale-high-quality","title":"FaceVid-1K: A Large-Scale High-Quality Multiracial Human Face Video Dataset","date":"2024-09-23","arxiv_id":"2410.07151","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-generative-ai-multi-modal-llm","title":"Multi-Modal Generative AI: Multi-modal LLM, Diffusion and Beyond","date":"2024-09-23","arxiv_id":"2409.14993","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-to-audio-generation-with-fine-grained","title":"Video-to-Audio Generation with Fine-grained Temporal Semantics","date":"2024-09-23","arxiv_id":"2409.14709","repositories_listed":0,"syntology":null},{"url":null,"slug":"jvid-joint-video-image-diffusion-for-visual","title":"JVID: Joint Video-Image Diffusion for Visual-Quality and Temporal-Consistency in Video Generation","date":"2024-09-21","arxiv_id":"2409.14149","repositories_listed":0,"syntology":null},{"url":null,"slug":"joyhallo-digital-human-model-for-mandarin","title":"JoyHallo: Digital human model for Mandarin","date":"2024-09-20","arxiv_id":"2409.13268","repositories_listed":0,"syntology":null},{"url":null,"slug":"denoising-reuse-exploiting-inter-frame-motion","title":"Denoising Reuse: Exploiting Inter-frame Motion Consistency for Efficient Video Latent Generation","date":"2024-09-19","arxiv_id":"2409.12532","repositories_listed":0,"syntology":null},{"url":null,"slug":"osv-one-step-is-enough-for-high-quality-image","title":"OSV: One Step is Enough for High-Quality Image to Video Generation","date":"2024-09-17","arxiv_id":"2409.11367","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-art-of-storytelling-multi-agent","title":"The Art of Storytelling: Multi-Agent Generative AI for Dynamic Multimodal Narratives","date":"2024-09-17","arxiv_id":"2409.11261","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffted-one-shot-audio-driven-ted-talk-video","title":"DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures","date":"2024-09-11","arxiv_id":"2409.07649","repositories_listed":0,"syntology":null},{"url":null,"slug":"g3pt-unleash-the-power-of-autoregressive","title":"G3PT: Unleash the power of Autoregressive Modeling in 3D Generation via Cross-scale Querying Transformer","date":"2024-09-10","arxiv_id":"2409.06322","repositories_listed":0,"syntology":null},{"url":null,"slug":"mygo-consistent-and-controllable-multi-view","title":"MyGo: Consistent and Controllable Multi-View Driving Video Generation with Camera Control","date":"2024-09-10","arxiv_id":"2409.06189","repositories_listed":0,"syntology":null},{"url":null,"slug":"drivescape-towards-high-resolution","title":"DriveScape: Towards High-Resolution Controllable Multi-View Driving Video Generation","date":"2024-09-09","arxiv_id":"2409.05463","repositories_listed":0,"syntology":null},{"url":null,"slug":"loopy-taming-audio-driven-portrait-avatar","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","date":"2024-09-04","arxiv_id":"2409.02634","repositories_listed":0,"syntology":null},{"url":null,"slug":"cyberhost-taming-audio-driven-avatar","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","date":"2024-09-03","arxiv_id":"2409.01876","repositories_listed":0,"syntology":null},{"url":null,"slug":"dive-dit-based-video-generation-with-enhanced","title":"DiVE: DiT-based Video Generation with Enhanced Control","date":"2024-09-03","arxiv_id":"2409.01595","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-3d-aware-video-generation-with","title":"Compositional 3D-aware Video Generation with LLM Director","date":"2024-08-31","arxiv_id":"2409.00558","repositories_listed":0,"syntology":null},{"url":null,"slug":"vq4dit-efficient-post-training-vector","title":"VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers","date":"2024-08-30","arxiv_id":"2408.17131","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-is-all-you-need-a-training-free","title":"Alignment is All You Need: A Training-free Augmentation Strategy for Pose-guided Video Generation","date":"2024-08-29","arxiv_id":"2408.16506","repositories_listed":0,"syntology":null},{"url":null,"slug":"drivegenvlm-real-world-video-generation-for","title":"DriveGenVLM: Real-world Video Generation for Vision Language Model based Autonomous Driving","date":"2024-08-29","arxiv_id":"2408.16647","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-shot-learning-meets-depth-diffusion-in","title":"One-Shot Learning Meets Depth Diffusion in Multi-Object Videos","date":"2024-08-29","arxiv_id":"2408.16704","repositories_listed":0,"syntology":null},{"url":null,"slug":"gendds-generating-diverse-driving-video","title":"GenDDS: Generating Diverse Driving Video Scenarios with Prompt-to-Video Generative Model","date":"2024-08-28","arxiv_id":"2408.15868","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgen-text-guided-diffusion-model-for","title":"SurGen: Text-Guided Diffusion Model for Surgical Video Generation","date":"2024-08-26","arxiv_id":"2408.14028","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-long-video-generation-with","title":"Decoupled Video Generation with Chain of Training-free Diffusion Model Experts","date":"2024-08-24","arxiv_id":"2408.13423","repositories_listed":0,"syntology":null},{"url":null,"slug":"tvg-a-training-free-transition-video","title":"TVG: A Training-free Transition Video Generation Method with Diffusion Models","date":"2024-08-24","arxiv_id":"2408.13413","repositories_listed":0,"syntology":null},{"url":null,"slug":"easycontrol-transfer-controlnet-to-video","title":"EasyControl: Transfer ControlNet to Video Diffusion for Controllable Generation and Interpolation","date":"2024-08-23","arxiv_id":"2408.13005","repositories_listed":0,"syntology":null},{"url":null,"slug":"xgen-videosyn-1-high-fidelity-text-to-video","title":"xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations","date":"2024-08-22","arxiv_id":"2408.12590","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamfactory-pioneering-multi-scene-long","title":"DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework","date":"2024-08-21","arxiv_id":"2408.11788","repositories_listed":0,"syntology":null},{"url":null,"slug":"trackgo-a-flexible-and-efficient-method-for","title":"TrackGo: A Flexible and Efficient Method for Controllable Video Generation","date":"2024-08-21","arxiv_id":"2408.11475","repositories_listed":0,"syntology":null},{"url":null,"slug":"factorized-dreamer-training-a-high-quality","title":"Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data","date":"2024-08-19","arxiv_id":"2408.10119","repositories_listed":0,"syntology":null},{"url":null,"slug":"kubrick-multimodal-agent-collaborations-for","title":"Kubrick: Multimodal Agent Collaborations for Synthetic Video Generation","date":"2024-08-19","arxiv_id":"2408.10453","repositories_listed":0,"syntology":null},{"url":null,"slug":"jpeg-lm-llms-as-image-generators-with","title":"JPEG-LM: LLMs as Image Generators with Canonical Codec Representations","date":"2024-08-15","arxiv_id":"2408.08459","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-video-coding-meets-multimodal-large","title":"When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding","date":"2024-08-15","arxiv_id":"2408.08093","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-fidelity-and-lip-synced-talking-face","title":"High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model","date":"2024-08-10","arxiv_id":"2408.05416","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene123-one-prompt-to-3d-scene-generation","title":"Scene123: One Prompt to 3D Scene Generation via Video-Assisted and Consistency-Enhanced MAE","date":"2024-08-10","arxiv_id":"2408.05477","repositories_listed":0,"syntology":null},{"url":null,"slug":"puppet-master-scaling-interactive-video","title":"Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics","date":"2024-08-08","arxiv_id":"2408.04631","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02629","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","date":"2024-08-05","arxiv_id":"2408.02629","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-00458","title":"Reenact Anything: Semantic Video Motion Transfer Using Motion-Textual Inversion","date":"2024-08-01","arxiv_id":"2408.00458","repositories_listed":0,"syntology":null},{"url":null,"slug":"2407-21490","title":"Explainable and Controllable Motion Curve Guided Cardiac Ultrasound Video Generation","date":"2024-07-31","arxiv_id":"2407.21490","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-aigc-video-quality-assessment-a","title":"Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model","date":"2024-07-31","arxiv_id":"2407.21408","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-gained-zero-shot-video-sampling","title":"Fine-gained Zero-shot Video Sampling","date":"2024-07-31","arxiv_id":"2407.21475","repositories_listed":0,"syntology":null},{"url":null,"slug":"freelong-training-free-long-video-generation","title":"FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention","date":"2024-07-29","arxiv_id":"2407.19918","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-image2video-generation-a-closer-look","title":"Faster Image2Video Generation: A Closer Look at CLIP Image Embedding's Impact on Spatio-Temporal Cross-Attentions","date":"2024-07-27","arxiv_id":"2407.19205","repositories_listed":0,"syntology":null},{"url":null,"slug":"sv4d-dynamic-3d-content-generation-with-multi","title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","date":"2024-07-24","arxiv_id":"2407.17470","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-transformer-captures-spatial","title":"Diffusion Transformer Captures Spatial-Temporal Dependencies: A Theory for Gaussian Process Data","date":"2024-07-23","arxiv_id":"2407.16134","repositories_listed":0,"syntology":null},{"url":null,"slug":"moviedreamer-hierarchical-generation-for","title":"MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence","date":"2024-07-23","arxiv_id":"2407.16655","repositories_listed":0,"syntology":null},{"url":null,"slug":"anchored-diffusion-for-video-face-reenactment","title":"Anchored Diffusion for Video Face Reenactment","date":"2024-07-21","arxiv_id":"2407.15153","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlearning-concepts-from-text-to-video","title":"Unlearning Concepts from Text-to-Video Diffusion Models","date":"2024-07-19","arxiv_id":"2407.14209","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-sentence-video-grounding-for-long-video","title":"Multi-sentence Video Grounding for Long Video Generation","date":"2024-07-18","arxiv_id":"2407.13219","repositories_listed":0,"syntology":null},{"url":null,"slug":"streetscapes-large-scale-consistent-street","title":"Streetscapes: Large-scale Consistent Street View Generation Using Autoregressive Video Diffusion","date":"2024-07-18","arxiv_id":"2407.13759","repositories_listed":0,"syntology":null},{"url":null,"slug":"vd3d-taming-large-video-diffusion","title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","date":"2024-07-17","arxiv_id":"2407.12781","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-defenses-against-ai-generated","title":"A Survey of Defenses against AI-generated Visual Media: Detection, Disruption, and Authentication","date":"2024-07-15","arxiv_id":"2407.10575","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-online-scale-transformation-for","title":"Learning Online Scale Transformation for Talking Head Video Generation","date":"2024-07-13","arxiv_id":"2407.09965","repositories_listed":0,"syntology":null},{"url":null,"slug":"bora-biomedical-generalist-video-generation","title":"Bora: Biomedical Generalist Video Generation Model","date":"2024-07-12","arxiv_id":"2407.08944","repositories_listed":0,"syntology":null},{"url":null,"slug":"inference-optimization-of-foundation-models","title":"Inference Optimization of Foundation Models on AI Accelerators","date":"2024-07-12","arxiv_id":"2407.09111","repositories_listed":0,"syntology":null},{"url":null,"slug":"e2vidiff-perceptual-events-to-video","title":"E2VIDiff: Perceptual Events-to-Video Reconstruction using Diffusion Priors","date":"2024-07-11","arxiv_id":"2407.08231","repositories_listed":0,"syntology":null},{"url":null,"slug":"still-moving-customized-video-generation","title":"Still-Moving: Customized Video Generation without Customized Video Data","date":"2024-07-11","arxiv_id":"2407.08674","repositories_listed":0,"syntology":null},{"url":null,"slug":"venhancer-generative-space-time-enhancement","title":"VEnhancer: Generative Space-Time Enhancement for Video Generation","date":"2024-07-10","arxiv_id":"2407.07667","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-to-audio-generation-with-hidden","title":"Video-to-Audio Generation with Hidden Alignment","date":"2024-07-10","arxiv_id":"2407.07464","repositories_listed":0,"syntology":null},{"url":null,"slug":"t2vsafetybench-evaluating-the-safety-of-text","title":"T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models","date":"2024-07-08","arxiv_id":"2407.05965","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-tug-of-war-between-deepfake-generation","title":"The Tug-of-War Between Deepfake Generation and Detection","date":"2024-07-08","arxiv_id":"2407.06174","repositories_listed":0,"syntology":null},{"url":null,"slug":"this-that-language-gesture-controlled-video","title":"This&That: Language-Gesture Controlled Video Generation for Robot Planning","date":"2024-07-08","arxiv_id":"2407.05530","repositories_listed":0,"syntology":null},{"url":null,"slug":"vimi-grounding-video-generation-through-multi","title":"VIMI: Grounding Video Generation through Multi-modal Instruction","date":"2024-07-08","arxiv_id":"2407.06304","repositories_listed":0,"syntology":null},{"url":null,"slug":"gvdiff-grounded-text-to-video-generation-with","title":"GVDIFF: Grounded Text-to-Video Generation with Diffusion Models","date":"2024-07-02","arxiv_id":"2407.01921","repositories_listed":0,"syntology":null},{"url":null,"slug":"openvid-1m-a-large-scale-high-quality-dataset","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","date":"2024-07-02","arxiv_id":"2407.02371","repositories_listed":0,"syntology":null},{"url":null,"slug":"svg-3d-stereoscopic-video-generation-via","title":"SVG: 3D Stereoscopic Video Generation via Denoising Frame Matrix","date":"2024-06-29","arxiv_id":"2407.00367","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-matters-in-detecting-ai-generated-videos","title":"What Matters in Detecting AI-Generated Videos like Sora?","date":"2024-06-27","arxiv_id":"2406.19568","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionbooth-motion-aware-customized-text-to","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","date":"2024-06-25","arxiv_id":"2406.17758","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-animator-controllable-visual-text-video","title":"Text-Animator: Controllable Visual Text Video Generation","date":"2024-06-25","arxiv_id":"2406.17777","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamitate-real-world-visuomotor-policy","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","date":"2024-06-24","arxiv_id":"2406.16862","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-infinity-distributed-long-video","title":"Video-Infinity: Distributed Long Video Generation","date":"2024-06-24","arxiv_id":"2406.16260","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-and-solving-conditional-image","title":"Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model","date":"2024-06-22","arxiv_id":"2406.15735","repositories_listed":0,"syntology":null},{"url":null,"slug":"mantisscore-building-automatic-metrics-to","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","date":"2024-06-21","arxiv_id":"2406.15252","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-generation-with-learned-action-prior","title":"Video Generation with Learned Action Prior","date":"2024-06-20","arxiv_id":"2406.14436","repositories_listed":0,"syntology":null},{"url":null,"slug":"ardup-active-region-video-diffusion-for","title":"ARDuP: Active Region Video Diffusion for Universal Policies","date":"2024-06-19","arxiv_id":"2406.13301","repositories_listed":0,"syntology":null},{"url":null,"slug":"splatter-a-video-video-gaussian","title":"Splatter a Video: Video Gaussian Representation for Versatile Processing","date":"2024-06-19","arxiv_id":"2406.13870","repositories_listed":0,"syntology":null},{"url":null,"slug":"nldf-neural-light-dynamic-fields-for","title":"NLDF: Neural Light Dynamic Fields for Efficient 3D Talking Head Generation","date":"2024-06-17","arxiv_id":"2406.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-camera-control-for-video","title":"Training-free Camera Control for Video Generation","date":"2024-06-14","arxiv_id":"2406.10126","repositories_listed":0,"syntology":null},{"url":null,"slug":"ditfastattn-attention-compression-for","title":"DiTFastAttn: Attention Compression for Diffusion Transformer Models","date":"2024-06-12","arxiv_id":"2406.08552","repositories_listed":0,"syntology":null},{"url":"/paper/hierarchical-patch-diffusion-models-for-high-1","slug":"hierarchical-patch-diffusion-models-for-high-1","title":"Hierarchical Patch Diffusion Models for High-Resolution Video Generation","date":"2024-06-12","arxiv_id":"2406.07792","repositories_listed":0,"syntology":null},{"url":null,"slug":"vivid-zoo-multi-view-video-generation-with","title":"Vivid-ZOO: Multi-View Video Generation with Diffusion Model","date":"2024-06-12","arxiv_id":"2406.08659","repositories_listed":0,"syntology":null},{"url":null,"slug":"4real-towards-photorealistic-4d-scene","title":"4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models","date":"2024-06-11","arxiv_id":"2406.07472","repositories_listed":0,"syntology":null},{"url":null,"slug":"av-dit-efficient-audio-visual-diffusion","title":"AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation","date":"2024-06-11","arxiv_id":"2406.07686","repositories_listed":0,"syntology":null},{"url":null,"slug":"hoi-swap-swapping-objects-in-videos-with-hand","title":"HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness","date":"2024-06-11","arxiv_id":"2406.07754","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-representation-learning-with-1","title":"Visual Representation Learning with Stochastic Frame Prediction","date":"2024-06-11","arxiv_id":"2406.07398","repositories_listed":0,"syntology":null},{"url":null,"slug":"cono-consistency-noise-injection-for-tuning","title":"CoNo: Consistency Noise Injection for Tuning-free Long Video Diffusion","date":"2024-06-07","arxiv_id":"2406.05082","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-video-editing-through-adaptive","title":"Zero-Shot Video Editing through Adaptive Sliding Score Distillation","date":"2024-06-07","arxiv_id":"2406.04888","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-your-pose-v2-multiple-condition-guided","title":"Follow-Your-Pose v2: Multiple-Condition Guided Character Image Animation for Stable Pose Control","date":"2024-06-05","arxiv_id":"2406.03035","repositories_listed":0,"syntology":null},{"url":null,"slug":"videophy-evaluating-physical-commonsense-for","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","date":"2024-06-05","arxiv_id":"2406.03520","repositories_listed":0,"syntology":null},{"url":null,"slug":"camco-camera-controllable-3d-consistent-image","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","date":"2024-06-04","arxiv_id":"2406.02509","repositories_listed":0,"syntology":null},{"url":null,"slug":"i4vgen-image-as-stepping-stone-for-text-to","title":"I4VGen: Image as Free Stepping Stone for Text-to-Video Generation","date":"2024-06-04","arxiv_id":"2406.02230","repositories_listed":0,"syntology":null},{"url":null,"slug":"v-express-conditional-dropout-for-progressive","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","date":"2024-06-04","arxiv_id":"2406.02511","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-temporally-consistent-video-depth","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","date":"2024-06-03","arxiv_id":"2406.01493","repositories_listed":0,"syntology":null},{"url":null,"slug":"unleashing-generalization-of-end-to-end","title":"Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation","date":"2024-06-03","arxiv_id":"2406.01349","repositories_listed":0,"syntology":null},{"url":null,"slug":"4diffusion-multi-view-video-diffusion-model","title":"4Diffusion: Multi-view Video Diffusion Model for 4D Generation","date":"2024-05-31","arxiv_id":"2405.20674","repositories_listed":0,"syntology":null},{"url":null,"slug":"viton-dit-learning-in-the-wild-video-try-on","title":"VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers","date":"2024-05-28","arxiv_id":"2405.18326","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-video-diffusion-consistent","title":"Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control","date":"2024-05-27","arxiv_id":"2405.17414","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-longer-image-animation-with","title":"Controllable Longer Image Animation with Diffusion Models","date":"2024-05-27","arxiv_id":"2405.17306","repositories_listed":0,"syntology":null},{"url":null,"slug":"human4dit-free-view-human-video-generation","title":"Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer","date":"2024-05-27","arxiv_id":"2405.17405","repositories_listed":0,"syntology":null},{"url":null,"slug":"refdrop-controllable-consistency-in-image-or","title":"RefDrop: Controllable Consistency in Image or Video Generation via Reference Feature Guidance","date":"2024-05-27","arxiv_id":"2405.17661","repositories_listed":0,"syntology":null}],"record_sha256":"1a27448080cf1681af9c5221cc470c3e4e0e4887acc1296943eb3bfdb7b330ff","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}