{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/neuralnetwork-viterbi-a-framework-for-weakly","title":"NeuralNetwork-Viterbi: A Framework for Weakly Supervised Video Learning","arxiv_id":"1805.06875","date":"2018-05-17","proceeding":"CVPR 2018 6","authors":["Alexander Richard","Hilde Kuehne","Ahsan Iqbal","Juergen Gall"],"abstract":"Video learning is an important task in computer vision and has experienced\nincreasing interest over the recent years. Since even a small amount of videos\neasily comprises several million frames, methods that do not rely on a\nframe-level annotation are of special importance. In this work, we propose a\nnovel learning algorithm with a Viterbi-based loss that allows for online and\nincremental learning of weakly annotated video data. We moreover show that\nexplicit context and length modeling leads to huge improvements in video\nsegmentation and labeling tasks andinclude these models into our framework. On\nseveral action segmentation benchmarks, we obtain an improvement of up to 10%\ncompared to current state-of-the-art methods.","url_abs":"http://arxiv.org/abs/1805.06875v1","url_pdf":"http://arxiv.org/pdf/1805.06875v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"action-segmentation","task_name":"Action Segmentation"},{"task_slug":"incremental-learning","task_name":"Incremental Learning"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"video-segmentation","task_name":"Video Segmentation"},{"task_slug":"video-semantic-segmentation","task_name":"Video Semantic Segmentation"},{"task_slug":"weakly-supervised-action-segmentation","task_name":"Weakly Supervised Action Segmentation (Transcript)"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/weakly-supervised-action-segmentation","task":"Weakly Supervised Action Segmentation (Transcript)","dataset":"Breakfast","model":"NNV","rank_in_archive_order":7,"of":7,"metrics":{"Acc":"43"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1805.06875","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}