{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-generation/papers/7","list_of":"/task/video-generation","task":"Video Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":15,"rows_per_page":100,"rows":[601,700],"of":1466,"counts":{"archive_papers_tagged":1466,"with_a_code_link":609,"where_syntology_ran_a_sample":257,"not_listed_spam_title":0,"listed":1466,"listed_where_code_ran":257,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":221,"every_run_a_failure_of_syntologys_instrument":36,"listed_with_a_run_with_no_instrument_failure":221,"listed_every_run_a_failure_of_syntologys_instrument":36,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-generation","prev":"/task/video-generation/papers/6","next":"/task/video-generation/papers/8","papers":[{"url":"/paper/towards-high-resolution-video-generation-with","slug":"towards-high-resolution-video-generation-with","title":"Towards High Resolution Video Generation with Progressive Growing of Sliced Wasserstein GANs","date":"2018-10-04","arxiv_id":"1810.02419","repositories_listed":1,"syntology":null},{"url":"/paper/recycle-gan-unsupervised-video-retargeting","slug":"recycle-gan-unsupervised-video-retargeting","title":"Recycle-GAN: Unsupervised Video Retargeting","date":"2018-08-15","arxiv_id":"1808.05174","repositories_listed":1,"syntology":null},{"url":"/paper/learning-to-forecast-and-refine-residual","slug":"learning-to-forecast-and-refine-residual","title":"Learning to Forecast and Refine Residual Motion for Image-to-Video Generation","date":"2018-07-26","arxiv_id":"1807.09951","repositories_listed":1,"syntology":{"n":15,"n_ran":12,"n_constructed":0,"n_ran_checked":12,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":12,"n_pointer_only":0,"phrase":"12 ran (of which 0 constructed an object rather than computing a result; 12 with no instrument failure: 0 honoured, 0 violated, 12 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/learning-to-forecast-and-refine-residual#ran","syntology_url":"https://syntology.ai/paper/1807.09951","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1807.09951"}},"official":null}},{"url":"/paper/talking-face-generation-by-conditional","slug":"talking-face-generation-by-conditional","title":"Talking Face Generation by Conditional Recurrent Adversarial Network","date":"2018-04-13","arxiv_id":"1804.04786","repositories_listed":1,"syntology":null},{"url":"/paper/probabilistic-video-generation-using-holistic","slug":"probabilistic-video-generation-using-holistic","title":"Probabilistic Video Generation using Holistic Attribute Control","date":"2018-03-21","arxiv_id":"1803.08085","repositories_listed":1,"syntology":null},{"url":"/paper/improving-video-generation-for-multi","slug":"improving-video-generation-for-multi","title":"Improving Video Generation for Multi-functional Applications","date":"2017-11-30","arxiv_id":"1711.11453","repositories_listed":1,"syntology":null},{"url":"/paper/attentive-semantic-video-generation-using","slug":"attentive-semantic-video-generation-using","title":"Attentive Semantic Video Generation using Captions","date":"2017-08-20","arxiv_id":"1708.05980","repositories_listed":1,"syntology":null},{"url":"/paper/sliced-wasserstein-generative-models","slug":"sliced-wasserstein-generative-models","title":"Sliced Wasserstein Generative Models","date":"2017-06-08","arxiv_id":"1706.02631","repositories_listed":1,"syntology":null},{"url":"/paper/sync-draw-automatic-video-generation-using","slug":"sync-draw-automatic-video-generation-using","title":"Sync-DRAW: Automatic Video Generation using Deep Recurrent Attentive Architectures","date":"2016-11-30","arxiv_id":"1611.10314","repositories_listed":1,"syntology":null},{"url":null,"slug":"leveraging-pre-trained-visual-models-for-ai","title":"Leveraging Pre-Trained Visual Models for AI-Generated Video Detection","date":"2025-07-17","arxiv_id":"2507.13224","repositories_listed":0,"syntology":null},{"url":null,"slug":"lovic-efficient-long-video-generation-with","title":"LoViC: Efficient Long Video Generation with Context Compression","date":"2025-07-17","arxiv_id":"2507.12952","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-diffusion-transformer-for-real-time","title":"Taming Diffusion Transformer for Real-Time Mobile Video Generation","date":"2025-07-17","arxiv_id":"2507.13343","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-model-based-end-to-end-scene-generation","title":"World Model-Based End-to-End Scene Generation for Accident Anticipation in Autonomous Driving","date":"2025-07-17","arxiv_id":"2507.12762","repositories_listed":0,"syntology":null},{"url":null,"slug":"lumos-1-on-autoregressive-video-generation","title":"Lumos-1: On Autoregressive Video Generation from a Unified Model Perspective","date":"2025-07-11","arxiv_id":"2507.08801","repositories_listed":0,"syntology":null},{"url":null,"slug":"martian-world-models-controllable-video","title":"Martian World Models: Controllable Video Synthesis with Physically Accurate 3D Reconstructions","date":"2025-07-10","arxiv_id":"2507.07978","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-long-video-storytelling","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","date":"2025-07-09","arxiv_id":"2507.07202","repositories_listed":0,"syntology":null},{"url":null,"slug":"fifa-unified-faithfulness-evaluation","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","date":"2025-07-09","arxiv_id":"2507.06523","repositories_listed":0,"syntology":null},{"url":null,"slug":"tora2-motion-and-appearance-customized","title":"Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation","date":"2025-07-08","arxiv_id":"2507.05963","repositories_listed":0,"syntology":null},{"url":null,"slug":"anyi2v-animating-any-conditional-image-with","title":"AnyI2V: Animating Any Conditional Image with Motion Control","date":"2025-07-03","arxiv_id":"2507.02857","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-based-realistic-safety-critical-driving","title":"LLM-based Realistic Safety-Critical Driving Video Generation","date":"2025-07-02","arxiv_id":"2507.01264","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometry-aware-4d-video-generation-for-robot","title":"Geometry-aware 4D Video Generation for Robot Manipulation","date":"2025-07-01","arxiv_id":"2507.01099","repositories_listed":0,"syntology":null},{"url":null,"slug":"roboscape-physics-informed-embodied-world","title":"RoboScape: Physics-informed Embodied World Model","date":"2025-06-29","arxiv_id":"2506.23135","repositories_listed":0,"syntology":null},{"url":null,"slug":"consistent-zero-shot-3d-texture-synthesis","title":"Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models","date":"2025-06-26","arxiv_id":"2506.20946","repositories_listed":0,"syntology":null},{"url":null,"slug":"dfvedit-conditional-delta-flow-vector-for","title":"DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing","date":"2025-06-26","arxiv_id":"2506.20967","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierasurg-hierarchy-aware-diffusion-model-for","title":"HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation","date":"2025-06-26","arxiv_id":"2506.21287","repositories_listed":0,"syntology":null},{"url":null,"slug":"shotbench-expert-level-cinematic","title":"ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models","date":"2025-06-26","arxiv_id":"2506.21356","repositories_listed":0,"syntology":null},{"url":null,"slug":"smoothsinger-a-conditional-diffusion-model","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","date":"2025-06-26","arxiv_id":"2506.21478","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-virtual-try-on-with-conditional","title":"Video Virtual Try-on with Conditional Diffusion Transformer Inpainter","date":"2025-06-26","arxiv_id":"2506.21270","repositories_listed":0,"syntology":null},{"url":null,"slug":"brokenvideos-a-benchmark-dataset-for-fine","title":"BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos","date":"2025-06-25","arxiv_id":"2506.20103","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-perception-models-for-3d-scene","title":"Video Perception Models for 3D Scene Synthesis","date":"2025-06-25","arxiv_id":"2506.20601","repositories_listed":0,"syntology":null},{"url":null,"slug":"bulletgen-improving-4d-reconstruction-with","title":"BulletGen: Improving 4D Reconstruction with Bullet-Time Generation","date":"2025-06-23","arxiv_id":"2506.18601","repositories_listed":0,"syntology":null},{"url":null,"slug":"mind-unified-visual-imagination-and-control","title":"MinD: Unified Visual Imagination and Control via Hierarchical World Models","date":"2025-06-23","arxiv_id":"2506.18897","repositories_listed":0,"syntology":null},{"url":null,"slug":"omniavatar-efficient-audio-driven-avatar","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","date":"2025-06-23","arxiv_id":"2506.18866","repositories_listed":0,"syntology":null},{"url":null,"slug":"rdpo-real-data-preference-optimization-for","title":"RDPO: Real Data Preference Optimization for Physics Consistency Video Generation","date":"2025-06-23","arxiv_id":"2506.18655","repositories_listed":0,"syntology":null},{"url":null,"slug":"hunyuan-gamecraft-high-dynamic-interactive","title":"Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition","date":"2025-06-20","arxiv_id":"2506.17201","repositories_listed":0,"syntology":null},{"url":null,"slug":"paroattention-pattern-aware-reordering-for","title":"PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models","date":"2025-06-19","arxiv_id":"2506.16054","repositories_listed":0,"syntology":null},{"url":null,"slug":"sekai-a-video-dataset-towards-world","title":"Sekai: A Video Dataset towards World Exploration","date":"2025-06-18","arxiv_id":"2506.15675","repositories_listed":0,"syntology":null},{"url":null,"slug":"videomar-autoregressive-video-generatio-with","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","date":"2025-06-17","arxiv_id":"2506.14168","repositories_listed":0,"syntology":null},{"url":null,"slug":"stage-a-stream-centric-generative-world-model","title":"STAGE: A Stream-Centric Generative World Model for Long-Horizon Driving-Scene Simulation","date":"2025-06-16","arxiv_id":"2506.13138","repositories_listed":0,"syntology":null},{"url":null,"slug":"ultravideo-high-quality-uhd-video-dataset","title":"UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions","date":"2025-06-16","arxiv_id":"2506.13691","repositories_listed":0,"syntology":null},{"url":null,"slug":"idit-hoi-inpainting-based-hand-object","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","date":"2025-06-15","arxiv_id":"2506.12847","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamactor-h1-high-fidelity-human-product","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","date":"2025-06-12","arxiv_id":"2506.10568","repositories_listed":0,"syntology":null},{"url":null,"slug":"genworld-towards-detecting-ai-generated-real","title":"GenWorld: Towards Detecting AI-generated Real-world Simulation Videos","date":"2025-06-12","arxiv_id":"2506.10975","repositories_listed":0,"syntology":null},{"url":null,"slug":"gigavideo-1-advancing-video-generation-via","title":"GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning","date":"2025-06-12","arxiv_id":"2506.10639","repositories_listed":0,"syntology":null},{"url":null,"slug":"m4v-multi-modal-mamba-for-text-to-video","title":"M4V: Multi-Modal Mamba for Text-to-Video Generation","date":"2025-06-12","arxiv_id":"2506.10915","repositories_listed":0,"syntology":null},{"url":null,"slug":"playerone-egocentric-world-simulator","title":"PlayerOne: Egocentric World Simulator","date":"2025-06-11","arxiv_id":"2506.09995","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-much-to-guide-revisiting-adaptive","title":"How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models","date":"2025-06-10","arxiv_id":"2506.08351","repositories_listed":0,"syntology":null},{"url":null,"slug":"hunyuanvideo-homa-generic-human-object","title":"HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation","date":"2025-06-10","arxiv_id":"2506.08797","repositories_listed":0,"syntology":null},{"url":null,"slug":"audio-sync-video-generation-with-multi-stream","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","date":"2025-06-09","arxiv_id":"2506.08003","repositories_listed":0,"syntology":null},{"url":null,"slug":"polyvivid-vivid-multi-subject-video","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","date":"2025-06-09","arxiv_id":"2506.07848","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-voices-generating-a-roll-video-from","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","date":"2025-06-09","arxiv_id":"2506.08279","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-forcing-bridging-the-train-test-gap-in","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","date":"2025-06-09","arxiv_id":"2506.08009","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-generation-to-generalization-emergent","title":"From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models","date":"2025-06-08","arxiv_id":"2506.07280","repositories_listed":0,"syntology":null},{"url":null,"slug":"astraea-a-gpu-oriented-token-wise","title":"Astraea: A GPU-Oriented Token-wise Acceleration Framework for Video Diffusion Transformers","date":"2025-06-05","arxiv_id":"2506.05096","repositories_listed":0,"syntology":null},{"url":null,"slug":"contentv-efficient-training-of-video","title":"ContentV: Efficient Training of Video Generation Models with Limited Compute","date":"2025-06-05","arxiv_id":"2506.05343","repositories_listed":0,"syntology":null},{"url":null,"slug":"dualx-vsr-dual-axial-spatial-times-temporal","title":"DualX-VSR: Dual Axial Spatial$\\times$Temporal Transformer for Real-World Video Super-Resolution without Motion Compensation","date":"2025-06-05","arxiv_id":"2506.04830","repositories_listed":0,"syntology":null},{"url":null,"slug":"follow-your-creation-empowering-4d-creation","title":"Follow-Your-Creation: Empowering 4D Creation through Video Inpainting","date":"2025-06-05","arxiv_id":"2506.04590","repositories_listed":0,"syntology":null},{"url":null,"slug":"fpsattention-training-aware-fp8-and-sparsity","title":"FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion","date":"2025-06-05","arxiv_id":"2506.04648","repositories_listed":0,"syntology":null},{"url":null,"slug":"fulldit2-efficient-in-context-conditioning","title":"FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers","date":"2025-06-04","arxiv_id":"2506.04213","repositories_listed":0,"syntology":null},{"url":null,"slug":"illumicraft-unified-geometry-and-illumination","title":"IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation","date":"2025-06-03","arxiv_id":"2506.03150","repositories_listed":0,"syntology":null},{"url":null,"slug":"talkingmachines-real-time-audio-driven","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","date":"2025-06-03","arxiv_id":"2506.03099","repositories_listed":0,"syntology":null},{"url":null,"slug":"longdwm-cross-granularity-distillation-for","title":"LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model","date":"2025-06-02","arxiv_id":"2506.01546","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepverse-4d-autoregressive-video-generation","title":"DeepVerse: 4D Autoregressive Video Generation as a World Model","date":"2025-06-01","arxiv_id":"2506.01103","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robot-policies-in-a-world-model","title":"Evaluating Robot Policies in a World Model","date":"2025-05-31","arxiv_id":"2506.00613","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-signature-in-generation-watermarking","title":"Video Signature: In-generation Watermarking for Latent Video Diffusion Models","date":"2025-05-31","arxiv_id":"2506.00652","repositories_listed":0,"syntology":null},{"url":null,"slug":"ctrl-crash-controllable-diffusion-for","title":"Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes","date":"2025-05-30","arxiv_id":"2506.00227","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamdance-animating-character-art-via","title":"DreamDance: Animating Character Art via Inpainting Stable Gaussian Worlds","date":"2025-05-30","arxiv_id":"2505.24733","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-video-generation-via-domain","title":"Interactive Video Generation via Domain Adaptation","date":"2025-05-30","arxiv_id":"2505.24253","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-remover-taming-bad-noise-helps-video","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","date":"2025-05-30","arxiv_id":"2505.24873","repositories_listed":0,"syntology":null},{"url":null,"slug":"unigeo-taming-video-diffusion-for-unified","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","date":"2025-05-30","arxiv_id":"2505.24521","repositories_listed":0,"syntology":null},{"url":null,"slug":"geoman-temporally-consistent-human-geometry","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","date":"2025-05-29","arxiv_id":"2505.23085","repositories_listed":0,"syntology":null},{"url":null,"slug":"movi-training-free-text-conditioned-multi","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","date":"2025-05-29","arxiv_id":"2505.22980","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotransfer-geometry-consistent-video","title":"RoboTransfer: Geometry-Consistent Video Diffusion for Robotic Visual Policy Transfer","date":"2025-05-29","arxiv_id":"2505.23171","repositories_listed":0,"syntology":null},{"url":null,"slug":"ati-any-trajectory-instruction-for","title":"ATI: Any Trajectory Instruction for Controllable Video Generation","date":"2025-05-28","arxiv_id":"2505.22944","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-world-models-for-interactive-video","title":"Learning World Models for Interactive Video Generation","date":"2025-05-28","arxiv_id":"2505.21996","repositories_listed":0,"syntology":null},{"url":null,"slug":"panowan-lifting-diffusion-video-generation","title":"PanoWan: Lifting Diffusion Video Generation Models to 360° with Latitude/Longitude-aware Mechanisms","date":"2025-05-28","arxiv_id":"2505.22016","repositories_listed":0,"syntology":null},{"url":null,"slug":"think-before-you-diffuse-llms-guided-physics","title":"Think Before You Diffuse: LLMs-Guided Physics-Aware Video Generation","date":"2025-05-27","arxiv_id":"2505.21653","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-i2v-exploring-image-to-video","title":"Dynamic-I2V: Exploring Image-to-Video Generaion Models via Multimodal LLM","date":"2025-05-26","arxiv_id":"2505.19901","repositories_listed":0,"syntology":null},{"url":null,"slug":"force-prompting-video-generation-models-can","title":"Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals","date":"2025-05-26","arxiv_id":"2505.19386","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionpro-a-precise-motion-controller-for","title":"MotionPro: A Precise Motion Controller for Image-to-Video Generation","date":"2025-05-26","arxiv_id":"2505.20287","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-role-of-video-generation-in-enhancing","title":"The Role of Video Generation in Enhancing Data-Limited Action Understanding","date":"2025-05-26","arxiv_id":"2505.19495","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-single-images-to-motion-policies-via","title":"From Single Images to Motion Policies via Video-Generation Environment Representations","date":"2025-05-25","arxiv_id":"2505.19306","repositories_listed":0,"syntology":null},{"url":null,"slug":"srdiffusion-accelerate-video-diffusion","title":"SRDiffusion: Accelerate Video Diffusion Inference via Sketching-Rendering Cooperation","date":"2025-05-25","arxiv_id":"2505.19151","repositories_listed":0,"syntology":null},{"url":null,"slug":"worldeval-world-model-as-real-world-robot","title":"WorldEval: World Model as Real-World Robot Policies Evaluator","date":"2025-05-25","arxiv_id":"2505.19017","repositories_listed":0,"syntology":null},{"url":null,"slug":"prophetdwm-a-driving-world-model-for-rolling","title":"ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos","date":"2025-05-24","arxiv_id":"2505.18650","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-videogen2-accelerate-video-generation","title":"Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation","date":"2025-05-24","arxiv_id":"2505.18875","repositories_listed":0,"syntology":null},{"url":null,"slug":"wonderplay-dynamic-3d-scene-generation-from-a","title":"WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions","date":"2025-05-23","arxiv_id":"2505.18151","repositories_listed":0,"syntology":null},{"url":null,"slug":"action2dialogue-generating-character-centric","title":"Action2Dialogue: Generating Character-Centric Narratives from Scene-Level Prompts","date":"2025-05-22","arxiv_id":"2505.16819","repositories_listed":0,"syntology":null},{"url":null,"slug":"magic-motion-aware-generative-inference-via","title":"MAGIC: Motion-Aware Generative Inference via Confidence-Guided LLM","date":"2025-05-22","arxiv_id":"2505.16456","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenger-affordable-adversarial-driving","title":"Challenger: Affordable Adversarial Driving Video Generation","date":"2025-05-21","arxiv_id":"2505.15880","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-ai-for-autonomous-driving-a-review","title":"Generative AI for Autonomous Driving: A Review","date":"2025-05-21","arxiv_id":"2505.15863","repositories_listed":0,"syntology":null},{"url":null,"slug":"interspatial-attention-for-efficient-4d-human","title":"Interspatial Attention for Efficient 4D Human Video Generation","date":"2025-05-21","arxiv_id":"2505.15800","repositories_listed":0,"syntology":null},{"url":null,"slug":"hunyuan-game-industrial-grade-intelligent","title":"Hunyuan-Game: Industrial-grade Intelligent Game Creation Model","date":"2025-05-20","arxiv_id":"2505.14135","repositories_listed":0,"syntology":null},{"url":null,"slug":"lmp-leveraging-motion-prior-in-zero-shot","title":"LMP: Leveraging Motion Prior in Zero-Shot Video Generation with Diffusion Transformer","date":"2025-05-20","arxiv_id":"2505.14167","repositories_listed":0,"syntology":null},{"url":null,"slug":"finephys-fine-grained-human-action-generation","title":"FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance","date":"2025-05-19","arxiv_id":"2505.13437","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-sora-safe-text-to-video-generation-via","title":"Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking","date":"2025-05-19","arxiv_id":"2505.12667","repositories_listed":0,"syntology":null},{"url":null,"slug":"vfrtok-variable-frame-rates-video-tokenizer","title":"VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption","date":"2025-05-17","arxiv_id":"2505.12053","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-11425","title":"Face Consistency Benchmark for GenAI Video","date":"2025-05-16","arxiv_id":"2505.11425","repositories_listed":0,"syntology":null},{"url":null,"slug":"toonifygb-stylegan-based-gaussian-blendshapes","title":"ToonifyGB: StyleGAN-based Gaussian Blendshapes for 3D Stylized Head Avatars","date":"2025-05-15","arxiv_id":"2505.10072","repositories_listed":0,"syntology":null},{"url":null,"slug":"2505-10584","title":"Aquarius: A Family of Industry-Level Video Generation Models for Marketing Scenarios","date":"2025-05-14","arxiv_id":"2505.10584","repositories_listed":0,"syntology":null}],"record_sha256":"19da887222dfae64606e23bff20e92c0795b01280e344ca3df45b22daa7f4465","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}