{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-generation/papers/10","list_of":"/task/video-generation","task":"Video Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":10,"pages_in_order":15,"rows_per_page":100,"rows":[901,1000],"of":1466,"counts":{"archive_papers_tagged":1466,"with_a_code_link":609,"where_syntology_ran_a_sample":257,"not_listed_spam_title":0,"listed":1466,"listed_where_code_ran":257,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":221,"every_run_a_failure_of_syntologys_instrument":36,"listed_with_a_run_with_no_instrument_failure":221,"listed_every_run_a_failure_of_syntologys_instrument":36,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-generation","prev":"/task/video-generation/papers/9","next":"/task/video-generation/papers/11","papers":[{"url":null,"slug":"license-plate-images-generation-with","title":"License Plate Images Generation with Diffusion Models","date":"2025-01-06","arxiv_id":"2501.03374","repositories_listed":0,"syntology":null},{"url":null,"slug":"through-the-mask-mask-based-motion","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","date":"2025-01-06","arxiv_id":"2501.03059","repositories_listed":0,"syntology":null},{"url":null,"slug":"gs-dit-advancing-video-generation-with-pseudo","title":"GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking","date":"2025-01-05","arxiv_id":"2501.02690","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-form-motion-control-a-synthetic-video","title":"Free-Form Motion Control: A Synthetic Video Generation Dataset with Controllable Camera and Object Motions","date":"2025-01-02","arxiv_id":"2501.01425","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-unifying-video-generation-and-camera-pose","title":"JOG3R: Towards 3D-Consistent Video Generators","date":"2025-01-02","arxiv_id":"2501.01409","repositories_listed":0,"syntology":null},{"url":null,"slug":"videoanydoor-high-fidelity-video-object","title":"VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control","date":"2025-01-02","arxiv_id":"2501.01427","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-text-implementing-multimodal-large","title":"Beyond Text: Implementing Multimodal Large Language Model-Powered Multi-Agent Systems Using a No-Code Platform","date":"2025-01-01","arxiv_id":"2501.00750","repositories_listed":0,"syntology":null},{"url":null,"slug":"bytheway-boost-your-text-to-video-generation","title":"ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"co-speech-gesture-video-generation-with","title":"Co-Speech Gesture Video Generation with Implicit Motion-Audio Entanglement","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-based-realistic-listening-head","title":"Diffusion-based Realistic Listening Head Generation via Hybrid Motion Modeling","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"drivescape-high-resolution-driving-video","title":"DriveScape: High-Resolution Driving Video Generation by Multi-View Feature Fusion","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-camera-poses-and-where-to-find-them","title":"Dynamic Camera Poses and Where to Find Them","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"eidt-v-exploiting-intersections-in-diffusion","title":"EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gs-dit-advancing-video-generation-with","title":"GS-DiT: Advancing Video Generation with Dynamic 3D Gaussian Fields through Efficient Dense 3D Point Tracking","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"i2vguard-safeguarding-images-against-misuse","title":"I2VGuard: Safeguarding Images against Misuse in Diffusion-based Image-to-Video Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"im-zero-instance-level-motion-controllable","title":"IM-Zero: Instance-level Motion Controllable Video Generation in a Zero-shot Manner","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mask-2dit-dual-mask-based-diffusion","title":"Mask^2DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mvportrait-text-guided-motion-and-emotion","title":"MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"patch-matters-training-free-fine-grained","title":"Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"patchvsr-breaking-video-diffusion-resolution","title":"PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"q-bench-video-benchmark-the-video-quality","title":"Q-Bench-Video: Benchmark the Video Quality Understanding of LMMs","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"satellite-to-groundscape-large-scale","title":"Satellite to GroundScape - Large-scale Consistent Ground View Generation from Satellite Views","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stdd-spatio-temporal-dual-diffusion-for-video","title":"STDD: Spatio-Temporal Dual Diffusion for Video Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"video-bench-human-aligned-video-generation","title":"Video-Bench: Human-Aligned Video Generation Benchmark","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamdrive-generative-4d-scene-modeling-from","title":"DreamDrive: Generative 4D Scene Modeling from Street View Images","date":"2024-12-31","arxiv_id":"2501.00601","repositories_listed":0,"syntology":null},{"url":null,"slug":"dialogue-director-bridging-the-gap-in","title":"Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling","date":"2024-12-30","arxiv_id":"2412.20725","repositories_listed":0,"syntology":null},{"url":null,"slug":"gender-bias-in-text-to-video-generation","title":"Gender Bias in Text-to-Video Generation Models: A case study of Sora","date":"2024-12-30","arxiv_id":"2501.01987","repositories_listed":0,"syntology":null},{"url":null,"slug":"ildiff-generate-transparent-animated-stickers","title":"ILDiff: Generate Transparent Animated Stickers by Implicit Layout Distillation","date":"2024-12-30","arxiv_id":"2412.20901","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-video-propagation","title":"Generative Video Propagation","date":"2024-12-27","arxiv_id":"2412.19761","repositories_listed":0,"syntology":null},{"url":"/paper/drivinggpt-unifying-driving-world-modeling","slug":"drivinggpt-unifying-driving-world-modeling","title":"DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers","date":"2024-12-24","arxiv_id":"2412.18607","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-is-worth-a-thousand-images-exploring","title":"Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation","date":"2024-12-24","arxiv_id":"2412.18688","repositories_listed":0,"syntology":null},{"url":null,"slug":"zerohsi-zero-shot-4d-human-scene-interaction","title":"ZeroHSI: Zero-Shot 4D Human-Scene Interaction by Video Generation","date":"2024-12-24","arxiv_id":"2412.18600","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-multi-text-long-video-generation","title":"Enhancing Multi-Text Long Video Generation Consistency without Tuning: Time-Frequency Analysis, Prompt Alignment, and Theory","date":"2024-12-23","arxiv_id":"2412.17254","repositories_listed":0,"syntology":null},{"url":null,"slug":"ffa-sora-video-generation-as-fundus","title":"FFA Sora, video generation as fundus fluorescein angiography simulator","date":"2024-12-23","arxiv_id":"2412.17346","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-motion-video-autoencoding-with-cross","title":"Large Motion Video Autoencoding with Cross-modal Video VAE","date":"2024-12-23","arxiv_id":"2412.17805","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-image-to-video-diffusion-models-for","title":"Adapting Image-to-Video Diffusion Models for Large-Motion Frame Interpolation","date":"2024-12-22","arxiv_id":"2412.17042","repositories_listed":0,"syntology":null},{"url":null,"slug":"substationai-multimodal-large-model-based","title":"SubstationAI: Multimodal Large Model-Based Approaches for Analyzing Substation Equipment Faults","date":"2024-12-22","arxiv_id":"2412.17077","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-your-multipose-tuning-free-multi","title":"Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance","date":"2024-12-21","arxiv_id":"2412.16495","repositories_listed":0,"syntology":null},{"url":null,"slug":"tcaq-dm-timestep-channel-adaptive","title":"TCAQ-DM: Timestep-Channel Adaptive Quantization for Diffusion Models","date":"2024-12-21","arxiv_id":"2412.16700","repositories_listed":0,"syntology":null},{"url":null,"slug":"vast-1-0-a-unified-framework-for-controllable","title":"VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation","date":"2024-12-21","arxiv_id":"2412.16677","repositories_listed":0,"syntology":null},{"url":null,"slug":"dollar-few-step-video-generation-via","title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","date":"2024-12-20","arxiv_id":"2412.15689","repositories_listed":0,"syntology":null},{"url":null,"slug":"av-link-temporally-aligned-diffusion-features","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","date":"2024-12-19","arxiv_id":"2412.15191","repositories_listed":0,"syntology":null},{"url":null,"slug":"directorllm-for-human-centric-video","title":"DirectorLLM for Human-Centric Video Generation","date":"2024-12-19","arxiv_id":"2412.14484","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallelized-autoregressive-visual-generation","title":"Parallelized Autoregressive Visual Generation","date":"2024-12-19","arxiv_id":"2412.15119","repositories_listed":0,"syntology":null},{"url":null,"slug":"akira-augmentation-kit-on-rays-for-optical","title":"AKiRa: Augmentation Kit on Rays for optical video generation","date":"2024-12-18","arxiv_id":"2412.14158","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexcache-flexible-approximate-cache-system","title":"FlexCache: Flexible Approximate Cache System for Video Diffusion","date":"2024-12-18","arxiv_id":"2501.04012","repositories_listed":0,"syntology":null},{"url":null,"slug":"manivideo-generating-hand-object-manipulation","title":"ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping","date":"2024-12-18","arxiv_id":"2412.16212","repositories_listed":0,"syntology":null},{"url":null,"slug":"surgsora-decoupled-rgbd-flow-diffusion-model","title":"SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation","date":"2024-12-18","arxiv_id":"2412.14018","repositories_listed":0,"syntology":null},{"url":null,"slug":"videodpo-omni-preference-alignment-for-video","title":"VideoDPO: Omni-Preference Alignment for Video Diffusion Generation","date":"2024-12-18","arxiv_id":"2412.14167","repositories_listed":0,"syntology":null},{"url":null,"slug":"compactflownet-efficient-real-time-optical","title":"CompactFlowNet: Efficient Real-time Optical Flow Estimation on Mobile Devices","date":"2024-12-17","arxiv_id":"2412.13273","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-your-world-simulator-a-good-story","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","date":"2024-12-17","arxiv_id":"2412.16211","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionbridge-dynamic-video-inbetweening-with","title":"MotionBridge: Dynamic Video Inbetweening with Flexible Controls","date":"2024-12-17","arxiv_id":"2412.13190","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-video-generation-replace-cinematographers","title":"Can video generation replace cinematographers? Research on the cinematic language of generated video","date":"2024-12-16","arxiv_id":"2412.12223","repositories_listed":0,"syntology":null},{"url":null,"slug":"interdyn-controllable-interactive-dynamics","title":"InterDyn: Controllable Interactive Dynamics with Video Diffusion Models","date":"2024-12-16","arxiv_id":"2412.11785","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamicscaler-seamless-and-scalable-video","title":"DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes","date":"2024-12-15","arxiv_id":"2412.11100","repositories_listed":0,"syntology":null},{"url":null,"slug":"genlit-reformulating-single-image-relighting","title":"GenLit: Reformulating Single-Image Relighting as Video Generation","date":"2024-12-15","arxiv_id":"2412.11224","repositories_listed":0,"syntology":null},{"url":null,"slug":"lingen-towards-high-resolution-minute-length","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","date":"2024-12-13","arxiv_id":"2412.09856","repositories_listed":0,"syntology":null},{"url":null,"slug":"msc-multi-scale-spatio-temporal-causal","title":"MSC: Multi-Scale Spatio-Temporal Causal Attention for Autoregressive Video Diffusion","date":"2024-12-13","arxiv_id":"2412.09828","repositories_listed":0,"syntology":null},{"url":null,"slug":"snapgen-v-generating-a-five-second-video","title":"SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device","date":"2024-12-13","arxiv_id":"2412.10494","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiv-diffusion-towards-object-centric-movement","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","date":"2024-12-13","arxiv_id":"2412.10275","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-facial-consistency-in-conditional","title":"Enhancing Facial Consistency in Conditional Video Generation via Facial Landmark Transformation","date":"2024-12-12","arxiv_id":"2412.08976","repositories_listed":0,"syntology":null},{"url":null,"slug":"instancecap-improving-text-to-video","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","date":"2024-12-12","arxiv_id":"2412.09283","repositories_listed":0,"syntology":null},{"url":null,"slug":"liftimage3d-lifting-any-single-image-to-3d","title":"LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors","date":"2024-12-12","arxiv_id":"2412.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"mojito-motion-trajectory-and-intensity","title":"Mojito: Motion Trajectory and Intensity Control for Video Generation","date":"2024-12-12","arxiv_id":"2412.08948","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnidrag-enabling-motion-control-for","title":"OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation","date":"2024-12-12","arxiv_id":"2412.09623","repositories_listed":0,"syntology":null},{"url":null,"slug":"t-svg-text-driven-stereoscopic-video","title":"T-SVG: Text-Driven Stereoscopic Video Generation","date":"2024-12-12","arxiv_id":"2412.09323","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-creation-by-demonstration","title":"Video Creation by Demonstration","date":"2024-12-12","arxiv_id":"2412.09551","repositories_listed":0,"syntology":null},{"url":null,"slug":"flip-flow-centric-generative-planning-for","title":"FLIP: Flow-Centric Generative Planning as General-Purpose Manipulation World Model","date":"2024-12-11","arxiv_id":"2412.08261","repositories_listed":0,"syntology":null},{"url":null,"slug":"pysical-informed-driving-world-model","title":"Physical Informed Driving World Model","date":"2024-12-11","arxiv_id":"2412.08410","repositories_listed":0,"syntology":null},{"url":null,"slug":"sweettokenizer-semantic-aware-spatial","title":"SweetTokenizer: Semantic-Aware Spatial-Temporal Tokenizer for Compact Visual Discretization","date":"2024-12-11","arxiv_id":"2412.10443","repositories_listed":0,"syntology":null},{"url":null,"slug":"3dtrajmaster-mastering-3d-trajectory-for","title":"3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation","date":"2024-12-10","arxiv_id":"2412.07759","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-slow-bidirectional-to-fast-causal-video","title":"From Slow Bidirectional to Fast Autoregressive Video Diffusion Models","date":"2024-12-10","arxiv_id":"2412.07772","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-shot-character-consistency-for-text-to","title":"Multi-Shot Character Consistency for Text-to-Video Generation","date":"2024-12-10","arxiv_id":"2412.07750","repositories_listed":0,"syntology":null},{"url":null,"slug":"stiv-scalable-text-and-image-conditioned","title":"STIV: Scalable Text and Image Conditioned Video Generation","date":"2024-12-10","arxiv_id":"2412.07730","repositories_listed":0,"syntology":null},{"url":null,"slug":"stylemaster-stylize-your-video-with-artistic","title":"StyleMaster: Stylize Your Video with Artistic Generation and Translation","date":"2024-12-10","arxiv_id":"2412.07744","repositories_listed":0,"syntology":null},{"url":null,"slug":"unireal-universal-image-generation-and","title":"UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics","date":"2024-12-10","arxiv_id":"2412.07774","repositories_listed":0,"syntology":null},{"url":null,"slug":"safewatch-an-efficient-safety-policy","title":"SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations","date":"2024-12-09","arxiv_id":"2412.06878","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-video-diffusion-models-via","title":"Accelerating Video Diffusion Models via Distribution Matching","date":"2024-12-08","arxiv_id":"2412.05899","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-reframe-enabling-camera-control-for","title":"Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training","date":"2024-12-08","arxiv_id":"2412.06029","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionstone-decoupled-motion-intensity","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","date":"2024-12-08","arxiv_id":"2412.05848","repositories_listed":0,"syntology":null},{"url":null,"slug":"track4gen-teaching-video-diffusion-models-to","title":"Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation","date":"2024-12-08","arxiv_id":"2412.06016","repositories_listed":0,"syntology":null},{"url":null,"slug":"mind-the-time-temporally-controlled-multi","title":"Mind the Time: Temporally-Controlled Multi-Event Video Generation","date":"2024-12-06","arxiv_id":"2412.05263","repositories_listed":0,"syntology":null},{"url":null,"slug":"dicode-diffusion-compressed-deep-tokens-for","title":"DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models","date":"2024-12-05","arxiv_id":"2412.04446","repositories_listed":0,"syntology":null},{"url":null,"slug":"genmac-compositional-text-to-video-generation","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","date":"2024-12-05","arxiv_id":"2412.04440","repositories_listed":0,"syntology":null},{"url":null,"slug":"if-mdm-implicit-face-motion-diffusion-model","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","date":"2024-12-05","arxiv_id":"2412.04000","repositories_listed":0,"syntology":null},{"url":null,"slug":"instructional-video-generation","title":"Instructional Video Generation","date":"2024-12-05","arxiv_id":"2412.04189","repositories_listed":0,"syntology":null},{"url":null,"slug":"memo-memory-guided-diffusion-for-expressive","title":"MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation","date":"2024-12-05","arxiv_id":"2412.04448","repositories_listed":0,"syntology":null},{"url":null,"slug":"movie-gen-swot-analysis-of-meta-s-generative","title":"Movie Gen: SWOT Analysis of Meta's Generative AI Foundation Model for Transforming Media Generation, Advertising, and Entertainment Industries","date":"2024-12-05","arxiv_id":"2412.03837","repositories_listed":0,"syntology":null},{"url":null,"slug":"paintscene4d-consistent-4d-scene-generation","title":"PaintScene4D: Consistent 4D Scene Generation from Text Prompts","date":"2024-12-05","arxiv_id":"2412.04471","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-auto-regressive-continuation-for","title":"Advancing Auto-Regressive Continuation for Video Frames","date":"2024-12-04","arxiv_id":"2412.03758","repositories_listed":0,"syntology":null},{"url":null,"slug":"imagine360-immersive-360-video-generation","title":"Imagine360: Immersive 360 Video Generation from Perspective Anchor","date":"2024-12-04","arxiv_id":"2412.03552","repositories_listed":0,"syntology":null},{"url":null,"slug":"mimir-improving-video-diffusion-models-for","title":"Mimir: Improving Video Diffusion Models for Precise Text Understanding","date":"2024-12-04","arxiv_id":"2412.03085","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-beyond-views-multi-view-driving-scene","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","date":"2024-12-04","arxiv_id":"2412.03520","repositories_listed":0,"syntology":null},{"url":null,"slug":"singer-vivid-audio-driven-singing-video","title":"SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model","date":"2024-12-04","arxiv_id":"2412.03430","repositories_listed":0,"syntology":null},{"url":null,"slug":"anigs-animatable-gaussian-avatar-from-a","title":"AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian Reconstruction","date":"2024-12-03","arxiv_id":"2412.02684","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-dynamic-object-interactions-in-text","title":"Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback","date":"2024-12-03","arxiv_id":"2412.02617","repositories_listed":0,"syntology":null},{"url":null,"slug":"motion-prompting-controlling-video-generation","title":"Motion Prompting: Controlling Video Generation with Motion Trajectories","date":"2024-12-03","arxiv_id":"2412.02700","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnicreator-self-supervised-unified","title":"OmniCreator: Self-Supervised Unified Generation with Universal Editing","date":"2024-12-03","arxiv_id":"2412.02114","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpa-camera-pose-awareness-diffusion","title":"CPA: Camera-pose-awareness Diffusion Transformer for Video Generation","date":"2024-12-02","arxiv_id":"2412.01429","repositories_listed":0,"syntology":null},{"url":null,"slug":"float-generative-motion-latent-flow-matching","title":"FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait","date":"2024-12-02","arxiv_id":"2412.01064","repositories_listed":0,"syntology":null}],"record_sha256":"5a7792be664f407c97706fa549ed49222223984a0a8206d08ec2d0f0633c3fd7","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}