{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/photorealistic-video-generation-with","title":"Photorealistic Video Generation with Diffusion Models","arxiv_id":"2312.06662","date":"2023-12-11","proceeding":null,"authors":["Agrim Gupta","Lijun Yu","Kihyuk Sohn","Xiuye Gu","Meera Hahn","Li Fei-Fei","Irfan Essa","Lu Jiang","José Lezama"],"abstract":"We present W.A.L.T, a transformer-based approach for photorealistic video generation via diffusion modeling. Our approach has two key design decisions. First, we use a causal encoder to jointly compress images and videos within a unified latent space, enabling training and generation across modalities. Second, for memory and training efficiency, we use a window attention architecture tailored for joint spatial and spatiotemporal generative modeling. Taken together these design decisions enable us to achieve state-of-the-art performance on established video (UCF-101 and Kinetics-600) and image (ImageNet) generation benchmarks without using classifier free guidance. Finally, we also train a cascade of three models for the task of text-to-video generation consisting of a base latent video diffusion model, and two video super-resolution diffusion models to generate videos of $512 \\times 896$ resolution at $8$ frames per second.","url_abs":"https://arxiv.org/abs/2312.06662v1","url_pdf":"https://arxiv.org/pdf/2312.06662v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"super-resolution","task_name":"Super-Resolution"},{"task_slug":"text-to-video-generation","task_name":"Text-to-Video Generation"},{"task_slug":"video-generation","task_name":"Video Generation"},{"task_slug":"video-super-resolution","task_name":"Video Super-Resolution"}],"methods":[{"method_slug":"base","method_name":"BASE"},{"method_slug":"diffusion","method_name":"Diffusion"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/text-to-video-generation-on-ucf-101","task":"Text-to-Video Generation","dataset":"UCF-101","model":"W.A.L.T 3B","rank_in_archive_order":3,"of":10,"metrics":{"FVD16":"258.1"},"uses_additional_data":false},{"leaderboard":"/sota/video-generation-on-kinetics-600-12-frames","task":"Video Generation","dataset":"Kinetics-600 12 frames, 64x64","model":"W.A.L.T-L","rank_in_archive_order":1,"of":4,"metrics":{"FVD":"3.3±0.0"},"uses_additional_data":false},{"leaderboard":"/sota/video-generation-on-ucf-101","task":"Video Generation","dataset":"UCF-101","model":"W.A.L.T-XL (class-conditional)","rank_in_archive_order":1,"of":48,"metrics":{"FVD16":"36±2"},"uses_additional_data":true},{"leaderboard":"/sota/video-generation-on-ucf-101","task":"Video Generation","dataset":"UCF-101","model":"W.A.L.T 3B (text-conditional)","rank_in_archive_order":18,"of":48,"metrics":{"FVD16":"258.1","Inception Score":"35.1"},"uses_additional_data":false},{"leaderboard":"/sota/video-prediction-on-kinetics-600-12-frames","task":"Video Prediction","dataset":"Kinetics-600 12 frames, 64x64","model":"W.A.L.T.-L","rank_in_archive_order":2,"of":16,"metrics":{"FVD":"3.3"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2312.06662","atlas_url":"https://app.syntology.ai/?focus=2312.06662","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}