Papers › Localizing Moments in Long Video Via Multimodal Guidance
Localizing Moments in Long Video Via Multimodal Guidance
Wayner Barrios, Mattia Soldan, Alberto Mario Ceballos-Arroyo, Fabian Caba Heilbron, Bernard Ghanem
The recent introduction of the large-scale, long-form MAD and Ego4D datasets has enabled researchers to investigate the performance of current state-of-the-art methods for video grounding in the long-form setup, with interesting findings: current grounding methods alone fail at tackling this challenging task and setup due to their inability to process long video sequences. In this paper, we propose a method for improving the performance of natural language grounding in long videos by identifying and pruning out non-describable windows. We design a guided grounding framework consisting of a Guidance Model and a base grounding model. The Guidance Model emphasizes describable windows, while the base grounding model analyzes short temporal windows to determine which segments accurately match a given language query. We offer two designs for the Guidance Model: Query-Agnostic and Query-Dependent, which balance efficiency and accuracy. Experiments demonstrate that our proposed method outperforms state-of-the-art models by 4.1% in MAD and 4.52% in Ego4D (NLQ), respectively. Code, data and MAD's audio features necessary to reproduce our experiments are available at: https://github.com/waybarrios/guidance-based-video-grounding.
In Syntology Open this paper in Syntology's Atlas, the map of the papers in Syntology's graph and their citations.
Code
Repository list and official/mentioned flags are the archive's, frozen 2025-07-28. Reachability, where shown, is from one Syntology probe window (2026-09-16 to 2026-09-18); repositories not probed show nothing. GitHub stars are not tracked.
Code Syntology ran Syntology
Not run by Syntology. Nothing on this page verifies that the listed code works.
Tasks
Results from the paper archive 2025-07-28
| Task | Dataset | Model | Metric | Value | Rank at snapshot | Leaderboard | Report |
|---|---|---|---|---|---|---|---|
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@1,IoU=0.1 | 9.3 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@1,IoU=0.3 | 4.65 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@1,IoU=0.5 | 2.16 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@10,IoU=0.1 | 24.30 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@10,IoU=0.3 | 17.73 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@10,IoU=0.5 | 11.09 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@100,IoU=0.1 | 47.35 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@100,IoU=0.3 | 39.58 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@100,IoU=0.5 | 29.68 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@5,IoU=0.1 | 18.96 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@5,IoU=0.3 | 13.06 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@5,IoU=0.5 | 7.4 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@50,IoU=0.1 | 39.79 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@50,IoU=0.3 | 32.23 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | Zero-Shot CLIP + Guidance Model | R@50,IoU=0.5 | 23.21 | #4 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@1,IoU=0.1 | 5.60 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@1,IoU=0.3 | 4.28 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@1,IoU=0.5 | 2.48 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@10,IoU=0.1 | 23.64 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@10,IoU=0.3 | 19.86 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@10,IoU=0.5 | 13.72 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@100,IoU=0.1 | 55.59 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@100,IoU=0.3 | 49.38 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@100,IoU=0.5 | 39.12 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@5,IoU=0.1 | 16.07 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@5,IoU=0.5 | 8.78 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@50,IoU=0.1 | 45.35 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@50,IoU=0.3 | 39.77 | #6 of 8 | Archive leaderboard | report |
| Natural Language Moment Retrieval | MAD | VLG-Net + Guidance Model | R@50,IoU=0.5 | 30.22 | #6 of 8 | Archive leaderboard | report |
Ranks are positions in the archive's leaderboards as they stood at the 2025-07-28 snapshot. Results published since then are not among these rows, so a rank here is not a current standing.
Methods
Report a problem or propose a change · a person checks every report against the paper or source before anything changes; decisions are listed on /corrections