{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/text-to-video-generation/papers/2","list_of":"/task/text-to-video-generation","task":"Text-to-Video Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":3,"rows_per_page":100,"rows":[101,200],"of":201,"counts":{"archive_papers_tagged":201,"with_a_code_link":97,"where_syntology_ran_a_sample":45,"not_listed_spam_title":0,"listed":201,"listed_where_code_ran":45,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":43,"every_run_a_failure_of_syntologys_instrument":2,"listed_with_a_run_with_no_instrument_failure":43,"listed_every_run_a_failure_of_syntologys_instrument":2,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/text-to-video-generation","prev":"/task/text-to-video-generation","next":"/task/text-to-video-generation/papers/3","papers":[{"url":null,"slug":"safe-sora-safe-text-to-video-generation-via","title":"Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking","date":"2025-05-19","arxiv_id":"2505.12667","repositories_listed":0,"syntology":null},{"url":null,"slug":"t2vtextbench-a-human-evaluation-benchmark-for","title":"T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models","date":"2025-05-08","arxiv_id":"2505.04946","repositories_listed":0,"syntology":null},{"url":null,"slug":"dualreal-adaptive-joint-training-for-lossless","title":"DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization","date":"2025-05-04","arxiv_id":"2505.02192","repositories_listed":0,"syntology":null},{"url":null,"slug":"t2vphysbench-a-first-principles-benchmark-for","title":"T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation","date":"2025-05-01","arxiv_id":"2505.00337","repositories_listed":0,"syntology":null},{"url":null,"slug":"we-ll-fix-it-in-post-improving-text-to-video","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","date":"2025-04-24","arxiv_id":"2504.17180","repositories_listed":0,"syntology":null},{"url":null,"slug":"dyst-xl-dynamic-layout-planning-and-content","title":"DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation","date":"2025-04-21","arxiv_id":"2504.15032","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiger200k-manually-curated-high-visual","title":"Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform","date":"2025-04-21","arxiv_id":"2504.15182","repositories_listed":0,"syntology":null},{"url":null,"slug":"modular-cam-modular-dynamic-camera-view-video","title":"Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM","date":"2025-04-16","arxiv_id":"2504.12048","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-devil-is-in-the-prompts-retrieval","title":"The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation","date":"2025-04-16","arxiv_id":"2504.11739","repositories_listed":0,"syntology":null},{"url":null,"slug":"h3ae-high-compression-high-speed-and-high","title":"H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models","date":"2025-04-14","arxiv_id":"2504.10567","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-free-guidance-in-text-to-video","title":"Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization","date":"2025-04-11","arxiv_id":"2504.08641","repositories_listed":0,"syntology":null},{"url":null,"slug":"videomage-multi-subject-and-motion","title":"VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models","date":"2025-03-27","arxiv_id":"2503.21781","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-text-to-video-generation-help-video","title":"Can Text-to-Video Generation help Video-Language Alignment?","date":"2025-03-24","arxiv_id":"2503.18507","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-efficient-motion-control-for-video","title":"Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance","date":"2025-03-24","arxiv_id":"2503.18386","repositories_listed":0,"syntology":null},{"url":null,"slug":"hitvideo-hierarchical-tokenizers-for","title":"HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models","date":"2025-03-14","arxiv_id":"2503.11513","repositories_listed":0,"syntology":null},{"url":null,"slug":"wisa-world-simulator-assistant-for-physics","title":"WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation","date":"2025-03-11","arxiv_id":"2503.08153","repositories_listed":0,"syntology":null},{"url":null,"slug":"haic-improving-human-action-understanding-and","title":"HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models","date":"2025-02-28","arxiv_id":"2502.20811","repositories_listed":0,"syntology":null},{"url":null,"slug":"relactrl-relevance-guided-efficient-control","title":"RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers","date":"2025-02-20","arxiv_id":"2502.14377","repositories_listed":0,"syntology":null},{"url":null,"slug":"malt-diffusion-memory-augmented-latent","title":"MALT Diffusion: Memory-Augmented Latent Transformers for Any-Length Video Generation","date":"2025-02-18","arxiv_id":"2502.12632","repositories_listed":0,"syntology":null},{"url":null,"slug":"cinemaster-a-3d-aware-and-controllable","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","date":"2025-02-12","arxiv_id":"2502.08639","repositories_listed":0,"syntology":null},{"url":null,"slug":"harness-local-rewards-for-global-benefits","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","date":"2025-02-04","arxiv_id":"2502.06812","repositories_listed":0,"syntology":null},{"url":null,"slug":"ipo-iterative-preference-optimization-for","title":"IPO: Iterative Preference Optimization for Text-to-Video Generation","date":"2025-02-04","arxiv_id":"2502.02088","repositories_listed":0,"syntology":null},{"url":null,"slug":"richspace-enriching-text-to-video-prompt","title":"RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation","date":"2025-01-17","arxiv_id":"2501.09982","repositories_listed":0,"syntology":null},{"url":null,"slug":"blobgen-vid-compositional-text-to-video","title":"BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations","date":"2025-01-13","arxiv_id":"2501.07647","repositories_listed":0,"syntology":null},{"url":null,"slug":"conceptmaster-multi-concept-video","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","date":"2025-01-08","arxiv_id":"2501.04698","repositories_listed":0,"syntology":null},{"url":null,"slug":"bytheway-boost-your-text-to-video-generation","title":"ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"eidt-v-exploiting-intersections-in-diffusion","title":"EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"im-zero-instance-level-motion-controllable","title":"IM-Zero: Instance-level Motion Controllable Video Generation in a Zero-shot Manner","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"patch-matters-training-free-fine-grained","title":"Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stdd-spatio-temporal-dual-diffusion-for-video","title":"STDD: Spatio-Temporal Dual Diffusion for Video Generation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"gender-bias-in-text-to-video-generation","title":"Gender Bias in Text-to-Video Generation Models: A case study of Sora","date":"2024-12-30","arxiv_id":"2501.01987","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-your-multipose-tuning-free-multi","title":"Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance","date":"2024-12-21","arxiv_id":"2412.16495","repositories_listed":0,"syntology":null},{"url":null,"slug":"videodpo-omni-preference-alignment-for-video","title":"VideoDPO: Omni-Preference Alignment for Video Diffusion Generation","date":"2024-12-18","arxiv_id":"2412.14167","repositories_listed":0,"syntology":null},{"url":null,"slug":"lingen-towards-high-resolution-minute-length","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","date":"2024-12-13","arxiv_id":"2412.09856","repositories_listed":0,"syntology":null},{"url":null,"slug":"instancecap-improving-text-to-video","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","date":"2024-12-12","arxiv_id":"2412.09283","repositories_listed":0,"syntology":null},{"url":null,"slug":"mojito-motion-trajectory-and-intensity","title":"Mojito: Motion Trajectory and Intensity Control for Video Generation","date":"2024-12-12","arxiv_id":"2412.08948","repositories_listed":0,"syntology":null},{"url":null,"slug":"t-svg-text-driven-stereoscopic-video","title":"T-SVG: Text-Driven Stereoscopic Video Generation","date":"2024-12-12","arxiv_id":"2412.09323","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-shot-character-consistency-for-text-to","title":"Multi-Shot Character Consistency for Text-to-Video Generation","date":"2024-12-10","arxiv_id":"2412.07750","repositories_listed":0,"syntology":null},{"url":null,"slug":"genmac-compositional-text-to-video-generation","title":"GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration","date":"2024-12-05","arxiv_id":"2412.04440","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-dynamic-object-interactions-in-text","title":"Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback","date":"2024-12-03","arxiv_id":"2412.02617","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpa-camera-pose-awareness-diffusion","title":"CPA: Camera-pose-awareness Diffusion Transformer for Video Generation","date":"2024-12-02","arxiv_id":"2412.01429","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-2-guide-gradient-free-path-integral","title":"Free$^2$Guide: Gradient-Free Path Integral Control for Enhancing Text-to-Video Generation with Large Vision-Language Models","date":"2024-11-26","arxiv_id":"2411.17041","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamrunner-fine-grained-storytelling-video","title":"DreamRunner: Fine-Grained Storytelling Video Generation with Retrieval-Augmented Motion Adaptation","date":"2024-11-25","arxiv_id":"2411.16657","repositories_listed":0,"syntology":null},{"url":null,"slug":"videorepair-improving-text-to-video","title":"VideoRepair: Improving Text-to-Video Generation via Misalignment Evaluation and Localized Refinement","date":"2024-11-22","arxiv_id":"2411.15115","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-emerging-approaches-and-advances","title":"A Survey of Emerging Approaches and Advances in Video Generation","date":"2024-11-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"give-guiding-visual-encoder-to-perceive","title":"GiVE: Guiding Visual Encoder to Perceive Overlooked Information","date":"2024-10-26","arxiv_id":"2410.20109","repositories_listed":0,"syntology":null},{"url":null,"slug":"broadway-boost-your-text-to-video-generation","title":"BroadWay: Boost Your Text-to-Video Generation Model in a Training-free Way","date":"2024-10-08","arxiv_id":"2410.06241","repositories_listed":0,"syntology":null},{"url":null,"slug":"technical-report-competition-solution-for-2","title":"Technical Report: Competition Solution For Modelscope-Sora","date":"2024-09-24","arxiv_id":"2410.07194","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-video-quality-assessment-for-aigc","title":"Advancing Video Quality Assessment for AIGC","date":"2024-09-23","arxiv_id":"2409.14888","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-art-of-storytelling-multi-agent","title":"The Art of Storytelling: Multi-Agent Generative AI for Dynamic Multimodal Narratives","date":"2024-09-17","arxiv_id":"2409.11261","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-3d-aware-video-generation-with","title":"Compositional 3D-aware Video Generation with LLM Director","date":"2024-08-31","arxiv_id":"2409.00558","repositories_listed":0,"syntology":null},{"url":null,"slug":"kubrick-multimodal-agent-collaborations-for","title":"Kubrick: Multimodal Agent Collaborations for Synthetic Video Generation","date":"2024-08-19","arxiv_id":"2408.10453","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02629","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","date":"2024-08-05","arxiv_id":"2408.02629","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlearning-concepts-from-text-to-video","title":"Unlearning Concepts from Text-to-Video Diffusion Models","date":"2024-07-19","arxiv_id":"2407.14209","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-to-audio-generation-with-hidden","title":"Video-to-Audio Generation with Hidden Alignment","date":"2024-07-10","arxiv_id":"2407.07464","repositories_listed":0,"syntology":null},{"url":null,"slug":"vimi-grounding-video-generation-through-multi","title":"VIMI: Grounding Video Generation through Multi-modal Instruction","date":"2024-07-08","arxiv_id":"2407.06304","repositories_listed":0,"syntology":null},{"url":null,"slug":"gvdiff-grounded-text-to-video-generation-with","title":"GVDIFF: Grounded Text-to-Video Generation with Diffusion Models","date":"2024-07-02","arxiv_id":"2407.01921","repositories_listed":0,"syntology":null},{"url":null,"slug":"openvid-1m-a-large-scale-high-quality-dataset","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","date":"2024-07-02","arxiv_id":"2407.02371","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionbooth-motion-aware-customized-text-to","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","date":"2024-06-25","arxiv_id":"2406.17758","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-video-editing-through-adaptive","title":"Zero-Shot Video Editing through Adaptive Sliding Score Distillation","date":"2024-06-07","arxiv_id":"2406.04888","repositories_listed":0,"syntology":null},{"url":null,"slug":"i4vgen-image-as-stepping-stone-for-text-to","title":"I4VGen: Image as Free Stepping Stone for Text-to-Video Generation","date":"2024-06-04","arxiv_id":"2406.02230","repositories_listed":0,"syntology":null},{"url":null,"slug":"disenstudio-customized-multi-subject-text-to","title":"DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control","date":"2024-05-21","arxiv_id":"2405.12796","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-lost-melody-empirical-observations-on","title":"The Lost Melody: Empirical Observations on Text-to-Video Generation From A Storytelling Perspective","date":"2024-05-13","arxiv_id":"2405.08720","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionmaster-training-free-camera-motion","title":"MotionMaster: Training-free Camera Motion Transfer For Video Generation","date":"2024-04-24","arxiv_id":"2404.15789","repositories_listed":0,"syntology":null},{"url":null,"slug":"aniclipart-clipart-animation-with-text-to","title":"AniClipart: Clipart Animation with Text-to-Video Priors","date":"2024-04-18","arxiv_id":"2404.12347","repositories_listed":0,"syntology":null},{"url":"/paper/grid-diffusion-models-for-text-to-video-1","slug":"grid-diffusion-models-for-text-to-video-1","title":"Grid Diffusion Models for Text-to-Video Generation","date":"2024-03-30","arxiv_id":"2404.00234","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-multi-modal-large-language-and","title":"A Review of Multi-Modal Large Language and Vision Models","date":"2024-03-28","arxiv_id":"2404.01322","repositories_listed":0,"syntology":null},{"url":null,"slug":"tutorial-on-diffusion-models-for-imaging-and","title":"Tutorial on Diffusion Models for Imaging and Vision","date":"2024-03-26","arxiv_id":"2403.18103","repositories_listed":0,"syntology":null},{"url":null,"slug":"trip-temporal-residual-learning-with-image","title":"TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models","date":"2024-03-25","arxiv_id":"2403.17005","repositories_listed":0,"syntology":null},{"url":null,"slug":"s2dm-sector-shaped-diffusion-models-for-video","title":"S2DM: Sector-Shaped Diffusion Models for Video Generation","date":"2024-03-20","arxiv_id":"2403.13408","repositories_listed":0,"syntology":null},{"url":null,"slug":"animate-your-motion-turning-still-images-into","title":"Animate Your Motion: Turning Still Images into Dynamic Videos","date":"2024-03-15","arxiv_id":"2403.10179","repositories_listed":0,"syntology":null},{"url":null,"slug":"fastvideoedit-leveraging-consistency-models","title":"FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing","date":"2024-03-10","arxiv_id":"2403.06269","repositories_listed":0,"syntology":null},{"url":null,"slug":"sora-as-an-agi-world-model-a-complete-survey","title":"Sora as an AGI World Model? A Complete Survey on Text-to-Video Generation","date":"2024-03-08","arxiv_id":"2403.05131","repositories_listed":0,"syntology":null},{"url":"/paper/snap-video-scaled-spatiotemporal-transformers","slug":"snap-video-scaled-spatiotemporal-transformers","title":"Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis","date":"2024-02-22","arxiv_id":"2402.14797","repositories_listed":0,"syntology":null},{"url":"/paper/customvideo-customizing-text-to-video","slug":"customvideo-customizing-text-to-video","title":"CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects","date":"2024-01-18","arxiv_id":"2401.09962","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-better-metric-for-text-to-video","title":"Towards A Better Metric for Text-to-Video Generation","date":"2024-01-15","arxiv_id":"2401.07781","repositories_listed":0,"syntology":null},{"url":null,"slug":"flashvideo-a-framework-for-swift-inference-in","title":"FlashVideo: A Framework for Swift Inference in Text-to-Video Generation","date":"2023-12-30","arxiv_id":"2401.00869","repositories_listed":0,"syntology":null},{"url":"/paper/videopoet-a-large-language-model-for-zero","slug":"videopoet-a-large-language-model-for-zero","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","date":"2023-12-21","arxiv_id":"2312.14125","repositories_listed":0,"syntology":null},{"url":"/paper/photorealistic-video-generation-with","slug":"photorealistic-video-generation-with","title":"Photorealistic Video Generation with Diffusion Models","date":"2023-12-11","arxiv_id":"2312.06662","repositories_listed":0,"syntology":null},{"url":null,"slug":"customizing-motion-in-text-to-video-diffusion","title":"NewMove: Customizing text-to-video models with novel motions","date":"2023-12-07","arxiv_id":"2312.04966","repositories_listed":0,"syntology":null},{"url":null,"slug":"gentron-delving-deep-into-diffusion","title":"GenTron: Diffusion Transformers for Image and Video Generation","date":"2023-12-07","arxiv_id":"2312.04557","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-controllable-video-generation","title":"Fine-grained Controllable Video Generation via Object Appearance and Context","date":"2023-12-05","arxiv_id":"2312.02919","repositories_listed":0,"syntology":null},{"url":null,"slug":"livephoto-real-image-animation-with-text","title":"LivePhoto: Real Image Animation with Text-guided Motion Control","date":"2023-12-05","arxiv_id":"2312.02928","repositories_listed":0,"syntology":null},{"url":null,"slug":"art-boldsymbol-cdot-v-auto-regressive-text-to","title":"ART$\\boldsymbol{\\cdot}$V: Auto-Regressive Text-to-Video Generation with Diffusion Models","date":"2023-11-30","arxiv_id":"2311.18834","repositories_listed":0,"syntology":null},{"url":null,"slug":"microcinema-a-divide-and-conquer-approach-for","title":"MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation","date":"2023-11-30","arxiv_id":"2311.18829","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionzero-exploiting-motion-priors-for-zero","title":"MotionZero:Exploiting Motion Priors for Zero-shot Text-to-Video Generation","date":"2023-11-28","arxiv_id":"2311.16635","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt4video-a-unified-multimodal-large-language","title":"GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation","date":"2023-11-25","arxiv_id":"2311.16511","repositories_listed":0,"syntology":null},{"url":null,"slug":"gpt4motion-scripting-physical-motions-in-text","title":"GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning","date":"2023-11-21","arxiv_id":"2311.12631","repositories_listed":0,"syntology":null},{"url":"/paper/make-pixels-dance-high-dynamic-video","slug":"make-pixels-dance-high-dynamic-video","title":"Make Pixels Dance: High-Dynamic Video Generation","date":"2023-11-18","arxiv_id":"2311.10982","repositories_listed":0,"syntology":null},{"url":null,"slug":"emu-video-factorizing-text-to-video","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","date":"2023-11-17","arxiv_id":"2311.10709","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-noise-pursuit-for-augmenting-text-to","title":"POS: A Prompts Optimization Suite for Augmenting Text-to-Video Generation","date":"2023-11-02","arxiv_id":"2311.00949","repositories_listed":0,"syntology":null},{"url":null,"slug":"videodreamer-customized-multi-subject-text-to","title":"VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning","date":"2023-11-02","arxiv_id":"2311.00990","repositories_listed":0,"syntology":null},{"url":null,"slug":"videogen-a-reference-guided-latent-diffusion","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","date":"2023-09-01","arxiv_id":"2309.00398","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-stream-diffusion-net-for-text-to-video","title":"Dual-Stream Diffusion Net for Text-to-Video Generation","date":"2023-08-16","arxiv_id":"2308.08316","repositories_listed":0,"syntology":null},{"url":"/paper/preserve-your-own-correlation-a-noise-prior","slug":"preserve-your-own-correlation-a-noise-prior","title":"Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models","date":"2023-05-17","arxiv_id":"2305.10474","repositories_listed":0,"syntology":null},{"url":"/paper/make-an-animation-large-scale-text","slug":"make-an-animation-large-scale-text","title":"Make-An-Animation: Large-Scale Text-conditional 3D Human Motion Generation","date":"2023-05-16","arxiv_id":"2305.09662","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-shift-latent-diffusion-with-temporal","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","date":"2023-04-17","arxiv_id":"2304.08477","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-and-content-guided-video-synthesis","title":"Structure and Content-Guided Video Synthesis with Diffusion Models","date":"2023-02-06","arxiv_id":"2302.03011","repositories_listed":0,"syntology":null},{"url":"/paper/magicvideo-efficient-video-generation-with","slug":"magicvideo-efficient-video-generation-with","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","date":"2022-11-20","arxiv_id":"2211.11018","repositories_listed":0,"syntology":null},{"url":null,"slug":"flexlip-a-controllable-text-to-lip-system","title":"FlexLip: A Controllable Text-to-Lip System","date":"2022-06-07","arxiv_id":"2206.03206","repositories_listed":0,"syntology":null}],"record_sha256":"39b01b234b19383a7abb3cce2a6325770fde938bcd5ccc5567e0431f5dfde5a9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}