{"url":"/task/zeroshot-video-question-answer","name":"Zero-Shot Video Question Answer","slug":"zeroshot-video-question-answer","description_markdown":"This task present the results of Zeroshot Question Answer results on TGIF-QA dataset for LLM powered Video Conversational Models.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Miscellaneous","url":"/area/miscellaneous"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"},{"name":"Reasoning","url":"/area/reasoning"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":85,"papers_with_code":73,"benchmarks":17,"benchmark_tables_in_archive":17,"benchmark_tables_shown":17,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":18,"subtasks":0,"parent_tasks":2},"benchmarks":[{"leaderboard":"/sota/zeroshot-video-question-answer-on-msrvtt-qa","slug":"zeroshot-video-question-answer-on-msrvtt-qa","dataset":"MSRVTT-QA","dataset_url":"/dataset/msrvtt-qa","rows_in_archive":30,"metrics":["Accuracy","Confidence Score"],"first_row_in_archive_order":{"model":"Flash-VStream","paper_title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","paper_url":"/paper/flash-vstream-memory-based-real-time","paper_date":"2024-06-12","arxiv_id":"2406.08085","code_links":[{"title":"IVGSZ/Flash-VStream","url":"https://github.com/IVGSZ/Flash-VStream"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-egoschema-1","slug":"zero-shot-video-question-answer-on-egoschema-1","dataset":"EgoSchema (fullset)","dataset_url":"/dataset/egoschema","rows_in_archive":29,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BIMBA-LLaVA-Qwen2-7B","paper_title":"BIMBA: Selective-Scan Compression for Long-Range Video Question Answering","paper_url":"/paper/bimba-selective-scan-compression-for-long","paper_date":"2025-03-12","arxiv_id":"2503.09590","code_links":[{"title":"md-mohaiminul/BIMBA","url":"https://github.com/md-mohaiminul/BIMBA"}],"syntology":null}},{"leaderboard":"/sota/zeroshot-video-question-answer-on-activitynet","slug":"zeroshot-video-question-answer-on-activitynet","dataset":"ActivityNet-QA","dataset_url":"/dataset/activitynet-qa","rows_in_archive":28,"metrics":["Accuracy","Confidence Score"],"first_row_in_archive_order":{"model":"Tarsier (34B)","paper_title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","paper_url":"/paper/tarsier-recipes-for-training-and-evaluating-1","paper_date":"2024-06-30","arxiv_id":"2407.00634","code_links":[{"title":"bytedance/tarsier","url":"https://github.com/bytedance/tarsier"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/zeroshot-video-question-answer-on-msvd-qa","slug":"zeroshot-video-question-answer-on-msvd-qa","dataset":"MSVD-QA","dataset_url":"/dataset/msvd-qa","rows_in_archive":28,"metrics":["Accuracy","Confidence Score"],"first_row_in_archive_order":{"model":"Tarsier (34B)","paper_title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","paper_url":"/paper/tarsier-recipes-for-training-and-evaluating-1","paper_date":"2024-06-30","arxiv_id":"2407.00634","code_links":[{"title":"bytedance/tarsier","url":"https://github.com/bytedance/tarsier"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-next-qa","slug":"zero-shot-video-question-answer-on-next-qa","dataset":"NExT-QA","dataset_url":"/dataset/next-qa","rows_in_archive":27,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VideoMultiAgent (GPT-4o)","paper_title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","paper_url":"/paper/videomultiagents-a-multi-agent-framework-for","paper_date":"2025-04-25","arxiv_id":"2504.20091","code_links":[{"title":"panasonicconnect/videomultiagents","url":"https://github.com/panasonicconnect/videomultiagents"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-egoschema","slug":"zero-shot-video-question-answer-on-egoschema","dataset":"EgoSchema (subset)","dataset_url":"/dataset/egoschema","rows_in_archive":14,"metrics":["Accuracy","Inference Speed (s)"],"first_row_in_archive_order":{"model":"Tarsier (34B)","paper_title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","paper_url":"/paper/tarsier-recipes-for-training-and-evaluating-1","paper_date":"2024-06-30","arxiv_id":"2407.00634","code_links":[{"title":"bytedance/tarsier","url":"https://github.com/bytedance/tarsier"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/zeroshot-video-question-answer-on-tgif-qa","slug":"zeroshot-video-question-answer-on-tgif-qa","dataset":"TGIF-QA","dataset_url":"/dataset/tgif-qa","rows_in_archive":14,"metrics":["Accuracy","Confidence Score"],"first_row_in_archive_order":{"model":"Tarsier (34B)","paper_title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","paper_url":"/paper/tarsier-recipes-for-training-and-evaluating-1","paper_date":"2024-06-30","arxiv_id":"2407.00634","code_links":[{"title":"bytedance/tarsier","url":"https://github.com/bytedance/tarsier"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-intentqa","slug":"zero-shot-video-question-answer-on-intentqa","dataset":"IntentQA","dataset_url":"/dataset/intentqa","rows_in_archive":13,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ENTER","paper_title":"ENTER: Event Based Interpretable Reasoning for VideoQA","paper_url":"/paper/enter-event-based-interpretable-reasoning-for","paper_date":"2025-01-24","arxiv_id":"2501.14194","code_links":[],"syntology":null}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-video-mme-1","slug":"zero-shot-video-question-answer-on-video-mme-1","dataset":"Video-MME","dataset_url":"/dataset/video-mme","rows_in_archive":11,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"Gemini 1.5 Pro","paper_title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","paper_url":"/paper/gemini-1-5-unlocking-multimodal-understanding","paper_date":"2024-03-08","arxiv_id":"2403.05530","code_links":[{"title":"dlvuldet/primevul","url":"https://github.com/dlvuldet/primevul"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-next-gqa","slug":"zero-shot-video-question-answer-on-next-gqa","dataset":"NExT-GQA","dataset_url":"/dataset/next-gqa","rows_in_archive":9,"metrics":["Acc@GQA"],"first_row_in_archive_order":{"model":"DeVi (Gemini 2.0)","paper_title":"Question-Answering Dense Video Events","paper_url":"/paper/question-answering-dense-video-events","paper_date":"2024-09-06","arxiv_id":"2409.04388","code_links":[{"title":"qhuni/deve-qa","url":"https://github.com/qhuni/deve-qa"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-tvqa","slug":"zero-shot-video-question-answer-on-tvqa","dataset":"TVQA","dataset_url":"/dataset/tvqa","rows_in_archive":9,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"FrozenBiLM (with speech)","paper_title":"Zero-Shot Video Question Answering via Frozen Bidirectional Language Models","paper_url":"/paper/zero-shot-video-question-answering-via-frozen","paper_date":"2022-06-16","arxiv_id":"2206.08155","code_links":[{"title":"antoyang/FrozenBiLM","url":"https://github.com/antoyang/FrozenBiLM"},{"title":"klauscc/dam","url":"https://github.com/klauscc/dam"},{"title":"sts-vlcc/sts-vlcc","url":"https://github.com/sts-vlcc/sts-vlcc"}],"syntology":{"n":34,"n_ran":14,"n_unverified":20,"n_pointer_only":1}}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-video-mme","slug":"zero-shot-video-question-answer-on-video-mme","dataset":"Video-MME (w/o subs)","dataset_url":"/dataset/video-mme","rows_in_archive":9,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"Video-RAG (based on LLaVA-Video)","paper_title":"Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension","paper_url":"/paper/video-rag-visually-aligned-retrieval","paper_date":"2024-11-20","arxiv_id":"2411.13093","code_links":[{"title":"leon1207/video-rag-master","url":"https://github.com/leon1207/video-rag-master"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-vnbench","slug":"zero-shot-video-question-answer-on-vnbench","dataset":"VNBench","dataset_url":"/dataset/vnbench","rows_in_archive":9,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"BIMBA-LLaVA-Qwen2-7B","paper_title":"BIMBA: Selective-Scan Compression for Long-Range Video Question Answering","paper_url":"/paper/bimba-selective-scan-compression-for-long","paper_date":"2025-03-12","arxiv_id":"2503.09590","code_links":[{"title":"md-mohaiminul/BIMBA","url":"https://github.com/md-mohaiminul/BIMBA"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-star","slug":"zero-shot-video-question-answer-on-star","dataset":"STAR Benchmark","dataset_url":"/dataset/situated-reasoning-star","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VideoChat2","paper_title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","paper_url":"/paper/mvbench-a-comprehensive-multi-modal-video","paper_date":"2023-11-28","arxiv_id":"2311.17005","code_links":[{"title":"opengvlab/ask-anything","url":"https://github.com/opengvlab/ask-anything"},{"title":"magic-research/PLLaVA","url":"https://github.com/magic-research/PLLaVA"},{"title":"bytedance/tarsier","url":"https://github.com/bytedance/tarsier"}],"syntology":{"n":10,"n_ran":7,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-zero-shot","slug":"zero-shot-video-question-answer-on-zero-shot","dataset":"Zero-shot Video Question Answering on LongVideoBench","dataset_url":"/dataset/zero-shot-video-question-answering-on","rows_in_archive":4,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"Gemini 1.5 Pro","paper_title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","paper_url":"/paper/gemini-1-5-unlocking-multimodal-understanding","paper_date":"2024-03-08","arxiv_id":"2403.05530","code_links":[{"title":"dlvuldet/primevul","url":"https://github.com/dlvuldet/primevul"}],"syntology":null}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-mvbench","slug":"zero-shot-video-question-answer-on-mvbench","dataset":"MVBench","dataset_url":"/dataset/mvbench","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"TS-LLaVA-34B","paper_title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","paper_url":"/paper/ts-llava-constructing-visual-tokens-through","paper_date":"2024-11-17","arxiv_id":"2411.11066","code_links":[{"title":"tingyu215/ts-llava","url":"https://github.com/tingyu215/ts-llava"}],"syntology":{"n":11,"n_ran":5,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/zero-shot-video-question-answer-on-cinepile-a","slug":"zero-shot-video-question-answer-on-cinepile-a","dataset":"CinePile: A Long Video Question Answering Dataset and Benchmark","dataset_url":"/dataset/cinepile","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Human","paper_title":"CinePile: A Long Video Question Answering Dataset and Benchmark","paper_url":"/paper/cinepile-a-long-video-question-answering","paper_date":"2024-05-14","arxiv_id":"2405.08813","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/next-qa","name":"NExT-QA","full_name":"","num_papers_in_archive":174},{"url":"/dataset/video-mme","name":"Video-MME","full_name":"","num_papers_in_archive":152},{"url":"/dataset/activitynet-qa","name":"ActivityNet-QA","full_name":"","num_papers_in_archive":146},{"url":"/dataset/tvqa","name":"TVQA","full_name":"TVQA","num_papers_in_archive":146},{"url":"/dataset/mvbench","name":"MVBench","full_name":"","num_papers_in_archive":139},{"url":"/dataset/egoschema","name":"EgoSchema","full_name":"","num_papers_in_archive":112},{"url":"/dataset/tgif-qa","name":"TGIF-QA","full_name":"TGIF-QA","num_papers_in_archive":92},{"url":"/dataset/msrvtt-qa","name":"MSRVTT-QA","full_name":"","num_papers_in_archive":66},{"url":"/dataset/msvd-qa","name":"MSVD-QA","full_name":"","num_papers_in_archive":61},{"url":"/dataset/tvqa-1","name":"TVQA+","full_name":"","num_papers_in_archive":60},{"url":"/dataset/intentqa","name":"IntentQA","full_name":"","num_papers_in_archive":27},{"url":"/dataset/next-gqa","name":"NExT-GQA","full_name":"","num_papers_in_archive":23},{"url":"/dataset/situated-reasoning-star","name":"STAR Benchmark","full_name":"Situated Reasoning","num_papers_in_archive":17},{"url":"/dataset/neptune","name":"Neptune","full_name":"Neptune Long Video Understanding Benchmark","num_papers_in_archive":12},{"url":"/dataset/vnbench","name":"VNBench","full_name":"","num_papers_in_archive":11},{"url":"/dataset/zero-shot-video-question-answering-on","name":"Zero-shot Video Question Answering on LongVideoBench","full_name":"A Benchmark for Long-context Interleaved Video-Language Understanding","num_papers_in_archive":5},{"url":"/dataset/shot2story20k","name":"Shot2Story20K","full_name":"","num_papers_in_archive":3},{"url":"/dataset/cinepile","name":"CinePile: A Long Video Question Answering Dataset and Benchmark","full_name":"","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[{"url":"/task/question-answering","name":"Question Answering"},{"url":"/task/video-question-answering","name":"Video Question Answering"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":73,"tagged_in_all":85,"items":[{"url":"/paper/qwen2-vl-enhancing-vision-language-model-s","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","date":"2024-09-18","arxiv_id":"2409.12191","repositories_listed":8,"syntology":{"n":12,"n_ran":8,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/video-llava-learning-united-visual-1","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","date":"2023-11-16","arxiv_id":"2311.10122","repositories_listed":6,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/mistral-7b","title":"Mistral 7B","date":"2023-10-10","arxiv_id":"2310.06825","repositories_listed":6,"syntology":{"n":11,"n_ran":9,"n_unverified":2,"n_pointer_only":1}},{"url":"/paper/flamingo-a-visual-language-model-for-few-shot-1","title":"Flamingo: a Visual Language Model for Few-Shot Learning","date":"2022-04-29","arxiv_id":"2204.14198","repositories_listed":5,"syntology":{"n":24,"n_ran":18,"n_unverified":6,"n_pointer_only":7}},{"url":"/paper/chat-univi-unified-visual-representation","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","date":"2023-11-14","arxiv_id":"2311.08046","repositories_listed":4,"syntology":null},{"url":"/paper/video-llama-an-instruction-tuned-audio-visual","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","date":"2023-06-05","arxiv_id":"2306.02858","repositories_listed":4,"syntology":{"n":25,"n_ran":18,"n_unverified":7,"n_pointer_only":9}},{"url":"/paper/llava-next-interleave-tackling-multi-image","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","date":"2024-07-10","arxiv_id":"2407.07895","repositories_listed":3,"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":4}},{"url":"/paper/videollama-2-advancing-spatial-temporal","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","date":"2024-06-11","arxiv_id":"2406.07476","repositories_listed":3,"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/vila-on-pre-training-for-visual-language","title":"VILA: On Pre-training for Visual Language Models","date":"2023-12-12","arxiv_id":"2312.07533","repositories_listed":3,"syntology":null},{"url":"/paper/mvbench-a-comprehensive-multi-modal-video","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","date":"2023-11-28","arxiv_id":"2311.17005","repositories_listed":3,"syntology":{"n":10,"n_ran":7,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/llama-adapter-v2-parameter-efficient-visual","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","date":"2023-04-28","arxiv_id":"2304.15010","repositories_listed":3,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/zero-shot-video-question-answering-via-frozen","title":"Zero-Shot Video Question Answering via Frozen Bidirectional Language Models","date":"2022-06-16","arxiv_id":"2206.08155","repositories_listed":3,"syntology":{"n":34,"n_ran":14,"n_unverified":20,"n_pointer_only":1}},{"url":"/paper/llava-onevision-easy-visual-task-transfer","title":"LLaVA-OneVision: Easy Visual Task Transfer","date":"2024-08-06","arxiv_id":"2408.03326","repositories_listed":2,"syntology":null},{"url":"/paper/2408-01800","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","date":"2024-08-03","arxiv_id":"2408.01800","repositories_listed":2,"syntology":{"n":14,"n_ran":9,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/long-context-transfer-from-language-to-vision","title":"Long Context Transfer from Language to Vision","date":"2024-06-24","arxiv_id":"2406.16852","repositories_listed":2,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":5}},{"url":"/paper/minigpt4-video-advancing-multimodal-llms-for","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","date":"2024-04-04","arxiv_id":"2404.03413","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/internvideo2-scaling-video-foundation-models","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","date":"2024-03-22","arxiv_id":"2403.15377","repositories_listed":2,"syntology":null},{"url":"/paper/videoagent-long-form-video-understanding-with","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","date":"2024-03-15","arxiv_id":"2403.10517","repositories_listed":2,"syntology":null},{"url":"/paper/video-recap-recursive-captioning-of-hour-long","title":"Video ReCap: Recursive Captioning of Hour-Long Videos","date":"2024-02-20","arxiv_id":"2402.13250","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/timechat-a-time-sensitive-multimodal-large","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","date":"2023-12-04","arxiv_id":"2312.02051","repositories_listed":2,"syntology":{"n":11,"n_ran":7,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/llama-vid-an-image-is-worth-2-tokens-in-large","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","date":"2023-11-28","arxiv_id":"2311.17043","repositories_listed":2,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/video-chatgpt-towards-detailed-video","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","date":"2023-06-08","arxiv_id":"2306.05424","repositories_listed":2,"syntology":null},{"url":"/paper/internvideo-general-video-foundation-models","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","date":"2022-12-06","arxiv_id":"2212.03191","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/mvb-a-large-scale-dataset-for-baggage-re","title":"MVB: A Large-Scale Dataset for Baggage Re-Identification and Merged Siamese Networks","date":"2019-07-26","arxiv_id":"1907.11366","repositories_listed":2,"syntology":null},{"url":"/paper/tgif-qa-toward-spatio-temporal-reasoning-in","title":"TGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question Answering","date":"2017-04-14","arxiv_id":"1704.04497","repositories_listed":2,"syntology":null},{"url":"/paper/videomultiagents-a-multi-agent-framework-for","title":"VideoMultiAgents: A Multi-Agent Framework for Video Question Answering","date":"2025-04-25","arxiv_id":"2504.20091","repositories_listed":1,"syntology":null},{"url":"/paper/qwen2-5-omni-technical-report","title":"Qwen2.5-Omni Technical Report","date":"2025-03-26","arxiv_id":"2503.20215","repositories_listed":1,"syntology":null},{"url":"/paper/agentic-keyframe-search-for-video-question","title":"Agentic Keyframe Search for Video Question Answering","date":"2025-03-20","arxiv_id":"2503.16032","repositories_listed":1,"syntology":{"n":8,"n_ran":3,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/videomind-a-chain-of-lora-agent-for-long","title":"VideoMind: A Chain-of-LoRA Agent for Long Video Reasoning","date":"2025-03-17","arxiv_id":"2503.13444","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/bimba-selective-scan-compression-for-long","title":"BIMBA: Selective-Scan Compression for Long-Range Video Question Answering","date":"2025-03-12","arxiv_id":"2503.09590","repositories_listed":1,"syntology":null}],"syntology_records":19,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}