{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/video-editing/papers/2","list_of":"/task/video-editing","task":"Video Editing","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":4,"rows_per_page":100,"rows":[101,200],"of":346,"counts":{"archive_papers_tagged":346,"with_a_code_link":133,"where_syntology_ran_a_sample":46,"not_listed_spam_title":0,"listed":346,"listed_where_code_ran":46,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":40,"every_run_a_failure_of_syntologys_instrument":6,"listed_with_a_run_with_no_instrument_failure":40,"listed_every_run_a_failure_of_syntologys_instrument":6,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/video-editing","prev":"/task/video-editing","next":"/task/video-editing/papers/3","papers":[{"url":"/paper/control-a-video-controllable-text-to-video","slug":"control-a-video-controllable-text-to-video","title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","date":"2023-05-23","arxiv_id":"2305.13840","repositories_listed":1,"syntology":null},{"url":"/paper/a-dual-level-detection-method-for-video-copy","slug":"a-dual-level-detection-method-for-video-copy","title":"A Dual-level Detection Method for Video Copy Detection","date":"2023-05-21","arxiv_id":"2305.12361","repositories_listed":1,"syntology":null},{"url":"/paper/soundini-sound-guided-diffusion-for-natural","slug":"soundini-sound-guided-diffusion-for-natural","title":"Soundini: Sound-Guided Diffusion for Natural Video Editing","date":"2023-04-13","arxiv_id":"2304.06818","repositories_listed":1,"syntology":null},{"url":"/paper/zero-shot-video-editing-using-off-the-shelf","slug":"zero-shot-video-editing-using-off-the-shelf","title":"Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models","date":"2023-03-30","arxiv_id":"2303.17599","repositories_listed":1,"syntology":null},{"url":"/paper/vive3d-viewpoint-independent-video-editing","slug":"vive3d-viewpoint-independent-video-editing","title":"VIVE3D: Viewpoint-Independent Video Editing using 3D-Aware GANs","date":"2023-03-28","arxiv_id":"2303.15893","repositories_listed":1,"syntology":null},{"url":"/paper/text2video-zero-text-to-image-diffusion","slug":"text2video-zero-text-to-image-diffusion","title":"Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators","date":"2023-03-23","arxiv_id":"2303.13439","repositories_listed":1,"syntology":null},{"url":"/paper/pix2video-video-editing-using-image-diffusion","slug":"pix2video-video-editing-using-image-diffusion","title":"Pix2Video: Video Editing using Image Diffusion","date":"2023-03-22","arxiv_id":"2303.12688","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/pix2video-video-editing-using-image-diffusion#ran","syntology_url":"https://syntology.ai/paper/2303.12688","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.12688"}},"official":{"repos":["duyguceylan/pix2video"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/fatezero-fusing-attentions-for-zero-shot-text","slug":"fatezero-fusing-attentions-for-zero-shot-text","title":"FateZero: Fusing Attentions for Zero-shot Text-based Video Editing","date":"2023-03-16","arxiv_id":"2303.09535","repositories_listed":1,"syntology":{"n":12,"n_ran":8,"n_constructed":0,"n_ran_checked":4,"n_instrument":4,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":5,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 4 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/fatezero-fusing-attentions-for-zero-shot-text#ran","syntology_url":"https://syntology.ai/paper/2303.09535","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.09535"}},"official":{"repos":["chenyangqiqi/fatezero"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":4,"ran_from_kinds":["official"]}}},{"url":"/paper/a-light-weight-model-for-active-speaker","slug":"a-light-weight-model-for-active-speaker","title":"A Light Weight Model for Active Speaker Detection","date":"2023-03-08","arxiv_id":"2303.04439","repositories_listed":1,"syntology":{"n":6,"n_ran":5,"n_constructed":0,"n_ran_checked":5,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/a-light-weight-model-for-active-speaker#ran","syntology_url":"https://syntology.ai/paper/2303.04439","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.04439"}},"official":{"repos":["junhua-liao/light-asd"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/video-p2p-video-editing-with-cross-attention","slug":"video-p2p-video-editing-with-cross-attention","title":"Video-P2P: Video Editing with Cross-attention Control","date":"2023-03-08","arxiv_id":"2303.04761","repositories_listed":1,"syntology":null},{"url":"/paper/video-p2p-video-editing-with-cross-attention-1","slug":"video-p2p-video-editing-with-cross-attention-1","title":"Video-P2P: Video Editing with Cross-attention Control","date":"2023-03-08","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/dpe-disentanglement-of-pose-and-expression","slug":"dpe-disentanglement-of-pose-and-expression","title":"DPE: Disentanglement of Pose and Expression for General Video Portrait Editing","date":"2023-01-16","arxiv_id":"2301.06281","repositories_listed":1,"syntology":{"n":23,"n_ran":15,"n_constructed":9,"n_ran_checked":12,"n_instrument":3,"n_unverified":8,"n_honours":0,"n_violates":1,"n_no_contract":11,"n_pointer_only":1,"phrase":"15 ran (of which 9 constructed an object rather than computing a result; 12 with no instrument failure: 0 honoured, 1 violated, 11 with no contract checked; 3 where Syntology's instrument failed) · 8 unverified","sample_list":"/paper/dpe-disentanglement-of-pose-and-expression#ran","syntology_url":"https://syntology.ai/paper/2301.06281","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2301.06281"}},"official":{"repos":["Carlyx/DPE"],"state":"official (archive's flag): 14 ran","n_ran":14,"n_constructed":9,"n_ran_no_instrument_failure":11,"n_unverified":8,"ran_from_kinds":["official","unlocated"]}}},{"url":"/paper/videoretalking-audio-based-lip","slug":"videoretalking-audio-based-lip","title":"VideoReTalking: Audio-based Lip Synchronization for Talking Head Video Editing In the Wild","date":"2022-11-27","arxiv_id":"2211.14758","repositories_listed":1,"syntology":{"n":9,"n_ran":6,"n_constructed":0,"n_ran_checked":5,"n_instrument":1,"n_unverified":3,"n_honours":0,"n_violates":1,"n_no_contract":4,"n_pointer_only":1,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 1 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/videoretalking-audio-based-lip#ran","syntology_url":"https://syntology.ai/paper/2211.14758","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2211.14758"}},"official":null}},{"url":"/paper/multi-modal-segment-assemblage-network-for-ad","slug":"multi-modal-segment-assemblage-network-for-ad","title":"Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward","date":"2022-09-25","arxiv_id":"2209.12164","repositories_listed":1,"syntology":null},{"url":"/paper/gan-inversion-for-consistent-video","slug":"gan-inversion-for-consistent-video","title":"Modelling Latent Dynamics of StyleGAN using Neural ODEs","date":"2022-08-23","arxiv_id":"2208.11197","repositories_listed":1,"syntology":null},{"url":"/paper/autotransition-learning-to-recommend-video","slug":"autotransition-learning-to-recommend-video","title":"AutoTransition: Learning to Recommend Video Transition Effects","date":"2022-07-27","arxiv_id":"2207.13479","repositories_listed":1,"syntology":null},{"url":"/paper/the-anatomy-of-video-editing-a-dataset-and","slug":"the-anatomy-of-video-editing-a-dataset-and","title":"The Anatomy of Video Editing: A Dataset and Benchmark Suite for AI-Assisted Video Editing","date":"2022-07-20","arxiv_id":"2207.09812","repositories_listed":1,"syntology":null},{"url":"/paper/patch-based-object-centric-transformers-for","slug":"patch-based-object-centric-transformers-for","title":"Patch-based Object-centric Transformers for Efficient Video Generation","date":"2022-06-08","arxiv_id":"2206.04003","repositories_listed":1,"syntology":null},{"url":"/paper/towards-unified-keyframe-propagation-models","slug":"towards-unified-keyframe-propagation-models","title":"Towards Unified Keyframe Propagation Models","date":"2022-05-19","arxiv_id":"2205.09731","repositories_listed":1,"syntology":null},{"url":"/paper/deformable-sprites-for-unsupervised-video","slug":"deformable-sprites-for-unsupervised-video","title":"Deformable Sprites for Unsupervised Video Decomposition","date":"2022-04-14","arxiv_id":"2204.07151","repositories_listed":1,"syntology":{"n":11,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":9,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":11,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 9 unverified","sample_list":"/paper/deformable-sprites-for-unsupervised-video#ran","syntology_url":"https://syntology.ai/paper/2204.07151","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2204.07151"}},"official":null}},{"url":"/paper/text2live-text-driven-layered-image-and-video","slug":"text2live-text-driven-layered-image-and-video","title":"Text2LIVE: Text-Driven Layered Image and Video Editing","date":"2022-04-05","arxiv_id":"2204.02491","repositories_listed":1,"syntology":{"n":5,"n_ran":3,"n_constructed":0,"n_ran_checked":2,"n_instrument":1,"n_unverified":2,"n_honours":1,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 1 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/text2live-text-driven-layered-image-and-video#ran","syntology_url":"https://syntology.ai/paper/2204.02491","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2204.02491"}},"official":{"repos":["omerbt/Text2LIVE"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/effectively-leveraging-multi-modal-features","slug":"effectively-leveraging-multi-modal-features","title":"Movie Genre Classification by Language Augmentation and Shot Sampling","date":"2022-03-24","arxiv_id":"2203.13281","repositories_listed":1,"syntology":null},{"url":"/paper/third-time-s-the-charm-image-and-video","slug":"third-time-s-the-charm-image-and-video","title":"Third Time's the Charm? Image and Video Editing with StyleGAN3","date":"2022-01-31","arxiv_id":"2201.13433","repositories_listed":1,"syntology":null},{"url":"/paper/transcoded-video-restoration-by-temporal","slug":"transcoded-video-restoration-by-temporal","title":"Transcoded Video Restoration by Temporal Spatial Auxiliary Network","date":"2021-12-15","arxiv_id":"2112.07948","repositories_listed":1,"syntology":null},{"url":"/paper/moviecuts-a-new-dataset-and-benchmark-for-cut","slug":"moviecuts-a-new-dataset-and-benchmark-for-cut","title":"MovieCuts: A New Dataset and Benchmark for Cut Type Recognition","date":"2021-09-12","arxiv_id":"2109.05569","repositories_listed":1,"syntology":null},{"url":"/paper/learning-to-cut-by-watching-movies","slug":"learning-to-cut-by-watching-movies","title":"Learning to Cut by Watching Movies","date":"2021-08-09","arxiv_id":"2108.04294","repositories_listed":1,"syntology":null},{"url":"/paper/apes-audiovisual-person-search-in-untrimmed","slug":"apes-audiovisual-person-search-in-untrimmed","title":"APES: Audiovisual Person Search in Untrimmed Video","date":"2021-06-03","arxiv_id":"2106.01667","repositories_listed":1,"syntology":null},{"url":"/paper/openkinoai-an-open-source-framework-for","slug":"openkinoai-an-open-source-framework-for","title":"OpenKinoAI: An Open Source Framework for Intelligent Cinematography and Editing of Live Performances","date":"2020-10-30","arxiv_id":"2011.05203","repositories_listed":1,"syntology":null},{"url":"/paper/detecting-kissing-scenes-in-a-database-of","slug":"detecting-kissing-scenes-in-a-database-of","title":"Detecting Kissing Scenes in a Database of Hollywood Films","date":"2019-06-05","arxiv_id":"1906.01843","repositories_listed":1,"syntology":null},{"url":"/paper/icface-interpretable-and-controllable-face","slug":"icface-interpretable-and-controllable-face","title":"ICface: Interpretable and Controllable Face Reenactment Using GANs","date":"2019-04-03","arxiv_id":"1904.01909","repositories_listed":1,"syntology":null},{"url":"/paper/a-temporally-aware-interpolation-network-for","slug":"a-temporally-aware-interpolation-network-for","title":"A Temporally-Aware Interpolation Network for Video Frame Inpainting","date":"2018-03-20","arxiv_id":"1803.07218","repositories_listed":1,"syntology":null},{"url":"/paper/fast-deep-matting-for-portrait-animation-on","slug":"fast-deep-matting-for-portrait-animation-on","title":"Fast Deep Matting for Portrait Animation on Mobile Phone","date":"2017-07-26","arxiv_id":"1707.08289","repositories_listed":1,"syntology":null},{"url":"/paper/video-acceleration-magnification","slug":"video-acceleration-magnification","title":"Video Acceleration Magnification","date":"2017-04-13","arxiv_id":"1704.04186","repositories_listed":1,"syntology":null},{"url":null,"slug":"dfvedit-conditional-delta-flow-vector-for","title":"DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing","date":"2025-06-26","arxiv_id":"2506.20967","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-your-video-listen-to-your-music","title":"Let Your Video Listen to Your Music!","date":"2025-06-23","arxiv_id":"2506.18881","repositories_listed":0,"syntology":null},{"url":null,"slug":"lora-edit-controllable-first-frame-guided","title":"LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning","date":"2025-06-11","arxiv_id":"2506.10082","repositories_listed":0,"syntology":null},{"url":null,"slug":"roboswap-a-gan-driven-video-diffusion","title":"RoboSwap: A GAN-driven Video Diffusion Framework For Unsupervised Robot Arm Swapping","date":"2025-06-10","arxiv_id":"2506.08632","repositories_listed":0,"syntology":null},{"url":null,"slug":"super-encoding-network-recursive-association","title":"Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding","date":"2025-06-09","arxiv_id":"2506.07576","repositories_listed":0,"syntology":null},{"url":null,"slug":"flowdirector-training-free-flow-steering-for","title":"FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing","date":"2025-06-05","arxiv_id":"2506.05046","repositories_listed":0,"syntology":null},{"url":null,"slug":"fulldit2-efficient-in-context-conditioning","title":"FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers","date":"2025-06-04","arxiv_id":"2506.04213","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-remover-taming-bad-noise-helps-video","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","date":"2025-05-30","arxiv_id":"2505.24873","repositories_listed":0,"syntology":null},{"url":null,"slug":"tdve-assessor-benchmarking-and-evaluating-the","title":"TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs","date":"2025-05-26","arxiv_id":"2505.19535","repositories_listed":0,"syntology":null},{"url":null,"slug":"srdiffusion-accelerate-video-diffusion","title":"SRDiffusion: Accelerate Video Diffusion Inference via Sketching-Rendering Cooperation","date":"2025-05-25","arxiv_id":"2505.19151","repositories_listed":0,"syntology":null},{"url":null,"slug":"regen-multimodal-retrieval-embedded","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","date":"2025-05-24","arxiv_id":"2505.18880","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-shots-to-stories-llm-assisted-video","title":"From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations","date":"2025-05-18","arxiv_id":"2505.12237","repositories_listed":0,"syntology":null},{"url":null,"slug":"dape-dual-stage-parameter-efficient-fine","title":"DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models","date":"2025-05-11","arxiv_id":"2505.07057","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-forgery-detection-for-surveillance","title":"Video Forgery Detection for Surveillance Cameras: A Review","date":"2025-05-04","arxiv_id":"2505.03832","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-rusty-link-in-the-ai-supply-chain-detecting","title":"A Rusty Link in the AI Supply Chain: Detecting Evil Configurations in Model Repositories","date":"2025-05-02","arxiv_id":"2505.01067","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-weather-synthesis-and-removal","title":"Controllable Weather Synthesis and Removal with Video Diffusion Models","date":"2025-05-01","arxiv_id":"2505.00704","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-prompting-for-one-shot-controllable","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","date":"2025-04-19","arxiv_id":"2504.14335","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-attention-mechanism-in-video","title":"Understanding Attention Mechanism in Video Diffusion Models","date":"2025-04-16","arxiv_id":"2504.12027","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-attention-in-video-diffusion","title":"Analysis of Attention in Video Diffusion Transformers","date":"2025-04-14","arxiv_id":"2504.10317","repositories_listed":0,"syntology":null},{"url":null,"slug":"cammimic-zero-shot-image-to-camera-motion","title":"CamMimic: Zero-Shot Image To Camera Motion Personalized Video Generation Using Diffusion Models","date":"2025-04-13","arxiv_id":"2504.09472","repositories_listed":0,"syntology":null},{"url":null,"slug":"videospats-video-spatiotemporal-splines-for","title":"VideoSPatS: Video SPatiotemporal Splines for Disentangled Occlusion, Appearance and Motion Modeling and Editing","date":"2025-04-08","arxiv_id":"2504.07146","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-i-warped-your-noise-a-temporally","title":"How I Warped Your Noise: a Temporally-Correlated Noise Prior for Diffusion Models","date":"2025-04-03","arxiv_id":"2504.03072","repositories_listed":0,"syntology":null},{"url":null,"slug":"sketchvideo-sketch-based-video-generation-and","title":"SketchVideo: Sketch-based Video Generation and Editing","date":"2025-03-30","arxiv_id":"2503.23284","repositories_listed":0,"syntology":null},{"url":null,"slug":"freeinv-free-lunch-for-improving-ddim","title":"FreeInv: Free Lunch for Improving DDIM Inversion","date":"2025-03-29","arxiv_id":"2503.23035","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-audio-visual-editing-via-cross","title":"Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising","date":"2025-03-26","arxiv_id":"2503.20782","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-efficient-motion-control-for-video","title":"Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance","date":"2025-03-24","arxiv_id":"2503.18386","repositories_listed":0,"syntology":null},{"url":null,"slug":"shot-sequence-ordering-for-video-editing","title":"Shot Sequence Ordering for Video Editing: Benchmarks, Metrics, and Cinematology-Inspired Computing Methods","date":"2025-03-23","arxiv_id":"2503.17975","repositories_listed":0,"syntology":null},{"url":null,"slug":"instructvedit-a-holistic-approach-for","title":"InstructVEdit: A Holistic Approach for Instructional Video Editing","date":"2025-03-22","arxiv_id":"2503.17641","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypernvd-accelerating-neural-video","title":"HyperNVD: Accelerating Neural Video Decomposition via Hypernetworks","date":"2025-03-21","arxiv_id":"2503.17276","repositories_listed":0,"syntology":null},{"url":null,"slug":"veggie-instructional-editing-and-reasoning","title":"VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation","date":"2025-03-18","arxiv_id":"2503.14350","repositories_listed":0,"syntology":null},{"url":"/paper/five-a-fine-grained-video-editing-benchmark","slug":"five-a-fine-grained-video-editing-benchmark","title":"FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models","date":"2025-03-17","arxiv_id":"2503.13684","repositories_listed":0,"syntology":null},{"url":null,"slug":"gift-generated-indoor-video-frames-for","title":"GIFT: Generated Indoor video frames for Texture-less point tracking","date":"2025-03-17","arxiv_id":"2503.12944","repositories_listed":0,"syntology":null},{"url":null,"slug":"rasa-replace-anyone-say-anything-a-training","title":"RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing","date":"2025-03-14","arxiv_id":"2503.11571","repositories_listed":0,"syntology":null},{"url":null,"slug":"v2edit-versatile-video-diffusion-editor-for","title":"V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes","date":"2025-03-13","arxiv_id":"2503.10634","repositories_listed":0,"syntology":null},{"url":null,"slug":"get-in-video-add-anything-you-want-to-the","title":"Get In Video: Add Anything You Want to the Video","date":"2025-03-08","arxiv_id":"2503.06268","repositories_listed":0,"syntology":null},{"url":null,"slug":"videohandles-editing-3d-object-compositions","title":"VideoHandles: Editing 3D Object Compositions in Videos Using Video Generative Priors","date":"2025-03-03","arxiv_id":"2503.01107","repositories_listed":0,"syntology":null},{"url":null,"slug":"videograin-modulating-space-time-attention","title":"VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing","date":"2025-02-24","arxiv_id":"2502.17258","repositories_listed":0,"syntology":null},{"url":null,"slug":"senorita-2m-a-high-quality-instruction-based","title":"Señorita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists","date":"2025-02-10","arxiv_id":"2502.06734","repositories_listed":0,"syntology":null},{"url":null,"slug":"motioncanvas-cinematic-shot-design-with","title":"MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation","date":"2025-02-06","arxiv_id":"2502.04299","repositories_listed":0,"syntology":null},{"url":null,"slug":"editiq-automated-cinematic-editing-of-static","title":"EditIQ: Automated Cinematic Editing of Static Wide-Angle Videos via Dialogue Interpretation and Saliency Cues","date":"2025-02-04","arxiv_id":"2502.02172","repositories_listed":0,"syntology":null},{"url":null,"slug":"counteracting-temporal-attacks-in-video-copy","title":"Counteracting temporal attacks in Video Copy Detection","date":"2025-01-19","arxiv_id":"2501.11171","repositories_listed":0,"syntology":null},{"url":null,"slug":"ip-facediff-identity-preserving-facial-video","title":"IP-FaceDiff: Identity-Preserving Facial Video Editing with Diffusion","date":"2025-01-13","arxiv_id":"2501.07530","repositories_listed":0,"syntology":null},{"url":null,"slug":"qffusion-controllable-portrait-video-editing","title":"Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning","date":"2025-01-11","arxiv_id":"2501.06438","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-to-edit-controllable-end-to-end-video-ad","title":"Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs","date":"2025-01-10","arxiv_id":"2501.05884","repositories_listed":0,"syntology":null},{"url":null,"slug":"edit-as-you-see-image-guided-video-editing","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","date":"2025-01-08","arxiv_id":"2501.04325","repositories_listed":0,"syntology":null},{"url":null,"slug":"alias-free-latent-diffusion-models-improving-1","title":"Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"align-a-video-deterministic-reward-tuning-of","title":"Align-A-Video: Deterministic Reward Tuning of Image Diffusion Models for Consistent Video Editing","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"consistent-and-controllable-image-animation","title":"Consistent and Controllable Image Animation with Motion Diffusion Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unity-in-diversity-video-editing-via-gradient","title":"Unity in Diversity: Video Editing via Gradient-Latent Purification","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"veu-bench-towards-comprehensive-understanding","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"makima-tuning-free-multi-attribute-open","title":"MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation","date":"2024-12-28","arxiv_id":"2412.19978","repositories_listed":0,"syntology":null},{"url":null,"slug":"mive-new-design-and-benchmark-for-multi","title":"MIVE: New Design and Benchmark for Multi-Instance Video Editing","date":"2024-12-17","arxiv_id":"2412.12877","repositories_listed":0,"syntology":null},{"url":null,"slug":"motionbridge-dynamic-video-inbetweening-with","title":"MotionBridge: Dynamic Video Inbetweening with Flexible Controls","date":"2024-12-17","arxiv_id":"2412.13190","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-video-multi-grained-integration-for","title":"Text-Video Multi-Grained Integration for Video Moment Montage","date":"2024-12-12","arxiv_id":"2412.09276","repositories_listed":0,"syntology":null},{"url":null,"slug":"movie-mobile-diffusion-for-video-editing","title":"MoViE: Mobile Diffusion for Video Editing","date":"2024-12-09","arxiv_id":"2412.06578","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-decomposition-prior-a-methodology-to","title":"Video Decomposition Prior: A Methodology to Decompose Videos into Layers","date":"2024-12-06","arxiv_id":"2412.04930","repositories_listed":0,"syntology":null},{"url":null,"slug":"dive-taming-dino-for-subject-driven-video","title":"DIVE: Taming DINO for Subject-Driven Video Editing","date":"2024-12-04","arxiv_id":"2412.03347","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-different-large-language-model","title":"Survey of different Large Language Model Architectures: Trends, Benchmarks, and Challenges","date":"2024-12-04","arxiv_id":"2412.03220","repositories_listed":0,"syntology":null},{"url":null,"slug":"omnicreator-self-supervised-unified","title":"OmniCreator: Self-Supervised Unified Generation with Universal Editing","date":"2024-12-03","arxiv_id":"2412.02114","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-attention-for-fine-grained-video","title":"Trajectory Attention for Fine-grained Video Motion Control","date":"2024-11-28","arxiv_id":"2411.19324","repositories_listed":0,"syntology":null},{"url":null,"slug":"videodirector-precise-video-editing-via-text","title":"VideoDirector: Precise Video Editing via Text-to-Video Models","date":"2024-11-26","arxiv_id":"2411.17592","repositories_listed":0,"syntology":null},{"url":null,"slug":"uvcg-leveraging-temporal-consistency-for","title":"UVCG: Leveraging Temporal Consistency for Universal Video Protection","date":"2024-11-25","arxiv_id":"2411.17746","repositories_listed":0,"syntology":null},{"url":null,"slug":"vivid-10m-a-dataset-and-baseline-for","title":"VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing","date":"2024-11-22","arxiv_id":"2411.15260","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-automatic","title":"A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model","date":"2024-11-07","arxiv_id":"2411.04942","repositories_listed":0,"syntology":null},{"url":null,"slug":"shaping-a-stabilized-video-by-mitigating","title":"Shaping a Stabilized Video by Mitigating Unintended Changes for Concept-Augmented Video Editing","date":"2024-10-16","arxiv_id":"2410.12526","repositories_listed":0,"syntology":null},{"url":null,"slug":"rna-video-editing-with-roi-based-neural-atlas","title":"RNA: Video Editing with ROI-based Neural Atlas","date":"2024-10-10","arxiv_id":"2410.07600","repositories_listed":0,"syntology":null},{"url":null,"slug":"freemask-rethinking-the-importance-of","title":"FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing","date":"2024-09-30","arxiv_id":"2409.20500","repositories_listed":0,"syntology":null}],"record_sha256":"943b1c39d3685550c3b75ee81f6823a656179e754ed4714d896ddd09141b89a9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}