{"url":"/task/text-to-video-generation","name":"Text-to-Video Generation","slug":"text-to-video-generation","description_markdown":"Ma grand-mère m’a raconté que quand elle était étudiante, elle avait un petit-ami. À l’âge de 18 ans, il a dû partir pour le service militaire, elle ne l’a pas attendu et elle a épousé quelqu’un d’autre. Quand ma grand-mère avait 58-59 ans, un homme (son premier amour) lui a envoyé une demande d’amis sur un réseau social, ils ont commencé à parler... En moins de six mois, ils ont décidé de se voir. Le trajet en train a duré deux jours et ils se sont finalement rencontrés. Cela fait maintenant deux ans qu’ils habitent ensemble et qu’ils nous rendent visite de temps en temps. Je réalise maintenant que leur amour l’un envers l’autre n’a jamais cessé.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":201,"papers_with_code":97,"benchmarks":6,"benchmark_tables_in_archive":6,"benchmark_tables_shown":6,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":14,"subtasks":2,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/text-to-video-generation-on-msr-vtt","slug":"text-to-video-generation-on-msr-vtt","dataset":"MSR-VTT","dataset_url":"/dataset/msr-vtt","rows_in_archive":18,"metrics":["FVD","CLIPSIM","CLIP-FID","FID"],"first_row_in_archive_order":{"model":"Snap Video (512x288)","paper_title":"Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis","paper_url":"/paper/snap-video-scaled-spatiotemporal-transformers","paper_date":"2024-02-22","arxiv_id":"2402.14797","code_links":[],"syntology":null}},{"leaderboard":"/sota/text-to-video-generation-on-ucf-101","slug":"text-to-video-generation-on-ucf-101","dataset":"UCF-101","dataset_url":"/dataset/ucf101","rows_in_archive":10,"metrics":["FVD16"],"first_row_in_archive_order":{"model":"Snap Video (Zero-shot, 512x288)","paper_title":"Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis","paper_url":"/paper/snap-video-scaled-spatiotemporal-transformers","paper_date":"2024-02-22","arxiv_id":"2402.14797","code_links":[],"syntology":null}},{"leaderboard":"/sota/text-to-video-generation-on-evalcrafter-text","slug":"text-to-video-generation-on-evalcrafter-text","dataset":"EvalCrafter Text-to-Video (ECTV) Dataset","dataset_url":"/dataset/evalcrafter-text-to-video-ectv-dataset","rows_in_archive":5,"metrics":["Visual Quality","Motion Quality","Temporal Consistency","Text-to-Video Alignment","Total Score"],"first_row_in_archive_order":{"model":"VideoCrafter2","paper_title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","paper_url":"/paper/videocrafter2-overcoming-data-limitations-for","paper_date":"2024-01-17","arxiv_id":"2401.09047","code_links":[{"title":"videocrafter/videocrafter","url":"https://github.com/videocrafter/videocrafter"},{"title":"ailab-cvc/videocrafter","url":"https://github.com/ailab-cvc/videocrafter"}],"syntology":{"n":21,"n_ran":14,"n_unverified":7,"n_pointer_only":21}}},{"leaderboard":"/sota/text-to-video-generation-on-kinetics","slug":"text-to-video-generation-on-kinetics","dataset":"Kinetics","dataset_url":"/dataset/kinetics","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"NUWA (128×128)","paper_title":"NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion","paper_url":"/paper/nuwa-visual-synthesis-pre-training-for-neural","paper_date":"2021-11-24","arxiv_id":"2111.12417","code_links":[{"title":"lucidrains/nuwa-pytorch","url":"https://github.com/lucidrains/nuwa-pytorch"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":2}}},{"leaderboard":"/sota/text-to-video-generation-on-something","slug":"text-to-video-generation-on-something","dataset":"Something-Something V2","dataset_url":"/dataset/something-something-v2","rows_in_archive":1,"metrics":["FVD"],"first_row_in_archive_order":{"model":"MAGVIT","paper_title":"MAGVIT: Masked Generative Video Transformer","paper_url":"/paper/magvit-masked-generative-video-transformer","paper_date":"2022-12-10","arxiv_id":"2212.05199","code_links":[{"title":"google-research/magvit","url":"https://github.com/google-research/magvit"}],"syntology":{"n":10,"n_ran":1,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/text-to-video-generation-on-webvid","slug":"text-to-video-generation-on-webvid","dataset":"WebVid","dataset_url":"/dataset/webvid","rows_in_archive":1,"metrics":["FVD"],"first_row_in_archive_order":{"model":"VideoFactory","paper_title":"Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation","paper_url":"/paper/videofactory-swap-attention-in-spatiotemporal","paper_date":"2023-05-18","arxiv_id":"2305.10874","code_links":[{"title":"daooshee/hd-vg-130m","url":"https://github.com/daooshee/hd-vg-130m"}],"syntology":null}}],"datasets":[{"url":"/dataset/ucf101","name":"UCF101","full_name":"UCF101 Human Actions dataset","num_papers_in_archive":1863},{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/msr-vtt","name":"MSR-VTT","full_name":"","num_papers_in_archive":640},{"url":"/dataset/something-something-v2","name":"Something-Something V2","full_name":"","num_papers_in_archive":290},{"url":"/dataset/webvid","name":"WebVid","full_name":"","num_papers_in_archive":257},{"url":"/dataset/celebv-text","name":"CelebV-Text","full_name":"","num_papers_in_archive":15},{"url":"/dataset/opens2v-eval","name":"OpenS2V-Eval","full_name":"","num_papers_in_archive":8},{"url":"/dataset/evalcrafter-text-to-video-ectv-dataset","name":"EvalCrafter Text-to-Video (ECTV) Dataset","full_name":"","num_papers_in_archive":6},{"url":"/dataset/chronomagic","name":"ChronoMagic","full_name":"","num_papers_in_archive":5},{"url":"/dataset/chronomagic-pro","name":"ChronoMagic-Pro","full_name":"","num_papers_in_archive":2},{"url":"/dataset/chronomagic-proh","name":"ChronoMagic-ProH","full_name":"","num_papers_in_archive":1},{"url":"/dataset/consisid-preview-data","name":"ConsisID-preview-Data","full_name":"","num_papers_in_archive":1},{"url":"/dataset/opens2v-5m","name":"OpenS2V-5M","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vript","name":"Vript","full_name":"🎬 Vript: A Video Is Worth Thousands of Words","num_papers_in_archive":0}],"subtasks":[{"url":"/task/subject-driven-video-generation","name":"Subject-driven Video Generation"},{"url":"/task/text-to-video-editing","name":"Text-to-Video Editing"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":97,"tagged_in_all":201,"items":[{"url":"/paper/modelscope-text-to-video-technical-report","title":"ModelScope Text-to-Video Technical Report","date":"2023-08-12","arxiv_id":"2308.06571","repositories_listed":5,"syntology":{"n":16,"n_ran":11,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/latte-latent-diffusion-transformer-for-video","title":"Latte: Latent Diffusion Transformer for Video Generation","date":"2024-01-05","arxiv_id":"2401.03048","repositories_listed":4,"syntology":{"n":13,"n_ran":10,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/videocomposer-compositional-video-synthesis","title":"VideoComposer: Compositional Video Synthesis with Motion Controllability","date":"2023-06-03","arxiv_id":"2306.02018","repositories_listed":4,"syntology":{"n":21,"n_ran":5,"n_unverified":16,"n_pointer_only":1}},{"url":"/paper/align-your-latents-high-resolution-video","title":"Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models","date":"2023-04-18","arxiv_id":"2304.08818","repositories_listed":4,"syntology":{"n":26,"n_ran":18,"n_unverified":8,"n_pointer_only":1}},{"url":"/paper/stylecrafter-enhancing-stylized-text-to-video","title":"StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter","date":"2023-12-01","arxiv_id":"2312.00330","repositories_listed":3,"syntology":{"n":23,"n_ran":13,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/videocrafter1-open-diffusion-models-for-high","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","date":"2023-10-30","arxiv_id":"2310.19512","repositories_listed":3,"syntology":{"n":12,"n_ran":7,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/tune-a-video-one-shot-tuning-of-image","title":"Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation","date":"2022-12-22","arxiv_id":"2212.11565","repositories_listed":3,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/open-sora-democratizing-efficient-video","title":"Open-Sora: Democratizing Efficient Video Production for All","date":"2024-12-29","arxiv_id":"2412.20404","repositories_listed":2,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/cogvideox-text-to-video-diffusion-models-with","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","date":"2024-08-12","arxiv_id":"2408.06072","repositories_listed":2,"syntology":{"n":7,"n_ran":7,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/chronomagic-bench-a-benchmark-for-metamorphic","title":"ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation","date":"2024-06-26","arxiv_id":"2406.18522","repositories_listed":2,"syntology":{"n":27,"n_ran":24,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/vane-bench-video-anomaly-evaluation-benchmark","title":"VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs","date":"2024-06-14","arxiv_id":"2406.10326","repositories_listed":2,"syntology":null},{"url":"/paper/motionclone-training-free-motion-cloning-for","title":"MotionClone: Training-Free Motion Cloning for Controllable Video Generation","date":"2024-06-08","arxiv_id":"2406.05338","repositories_listed":2,"syntology":{"n":15,"n_ran":6,"n_unverified":9,"n_pointer_only":15}},{"url":"/paper/magictime-time-lapse-video-generation-models","title":"MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators","date":"2024-04-07","arxiv_id":"2404.05014","repositories_listed":2,"syntology":null},{"url":"/paper/videocrafter2-overcoming-data-limitations-for","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","date":"2024-01-17","arxiv_id":"2401.09047","repositories_listed":2,"syntology":{"n":21,"n_ran":14,"n_unverified":7,"n_pointer_only":21}},{"url":"/paper/lavie-high-quality-video-generation-with","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","date":"2023-09-26","arxiv_id":"2309.15103","repositories_listed":2,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/free-bloom-zero-shot-text-to-video-generator","title":"Free-Bloom: Zero-Shot Text-to-Video Generator with LLM Director and LDM Animator","date":"2023-09-25","arxiv_id":"2309.14494","repositories_listed":2,"syntology":{"n":11,"n_ran":5,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/follow-your-pose-pose-guided-text-to-video","title":"Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos","date":"2023-04-03","arxiv_id":"2304.01186","repositories_listed":2,"syntology":{"n":10,"n_ran":2,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/decomposed-diffusion-models-for-high-quality","title":"VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation","date":"2023-03-15","arxiv_id":"2303.08320","repositories_listed":2,"syntology":null},{"url":"/paper/make-a-video-text-to-video-generation-without","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","date":"2022-09-29","arxiv_id":"2209.14792","repositories_listed":2,"syntology":null},{"url":"/paper/mugen-a-playground-for-video-audio-text","title":"MUGEN: A Playground for Video-Audio-Text Multimodal Understanding and GENeration","date":"2022-04-17","arxiv_id":"2204.08058","repositories_listed":2,"syntology":null},{"url":"/paper/vcapsbench-a-large-scale-fine-grained","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","date":"2025-05-29","arxiv_id":"2505.23484","repositories_listed":1,"syntology":null},{"url":"/paper/inflvg-reinforce-inference-time-consistent","title":"InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO","date":"2025-05-23","arxiv_id":"2505.17574","repositories_listed":1,"syntology":null},{"url":"/paper/love-benchmarking-and-evaluating-text-to","title":"LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation","date":"2025-05-17","arxiv_id":"2505.12098","repositories_listed":1,"syntology":null},{"url":"/paper/on-device-sora-enabling-training-free","title":"On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices","date":"2025-03-31","arxiv_id":"2503.23796","repositories_listed":1,"syntology":null},{"url":"/paper/vpo-aligning-text-to-video-generation-models","title":"VPO: Aligning Text-to-Video Generation Models with Prompt Optimization","date":"2025-03-26","arxiv_id":"2503.20491","repositories_listed":1,"syntology":null},{"url":"/paper/rectable-fast-modeling-tabular-data-with","title":"RecTable: Fast Modeling Tabular Data with Rectified Flow","date":"2025-03-26","arxiv_id":"2503.20731","repositories_listed":1,"syntology":null},{"url":"/paper/protecting-your-video-content-disrupting","title":"Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations","date":"2025-03-26","arxiv_id":"2503.21824","repositories_listed":1,"syntology":null},{"url":"/paper/enabling-versatile-controls-for-video","title":"Enabling Versatile Controls for Video Diffusion Models","date":"2025-03-21","arxiv_id":"2503.16983","repositories_listed":1,"syntology":null},{"url":"/paper/videoufo-a-million-scale-user-focused-dataset","title":"VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation","date":"2025-03-03","arxiv_id":"2503.01739","repositories_listed":1,"syntology":null},{"url":"/paper/vidcapbench-a-comprehensive-benchmark-of","title":"VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation","date":"2025-02-18","arxiv_id":"2502.12782","repositories_listed":1,"syntology":null}],"syntology_records":15,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}