{"url":"/task/video-captioning","name":"Video Captioning","slug":"video-captioning","description_markdown":"**Video Captioning** is a task of automatic captioning a video by understanding the action and event in the video which can help in the retrieval of the video efficiently through text.\r\n\r\n\r\n<span class=\"description-source\">Source: [NITS-VC System for VATEX Video Captioning Challenge 2020 ](https://arxiv.org/abs/2006.04058)</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":473,"papers_with_code":211,"benchmarks":13,"benchmark_tables_in_archive":13,"benchmark_tables_shown":13,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":38,"subtasks":6,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/video-captioning-on-msr-vtt-1","slug":"video-captioning-on-msr-vtt-1","dataset":"MSR-VTT","dataset_url":"/dataset/msr-vtt","rows_in_archive":24,"metrics":["CIDEr","METEOR","ROUGE-L","BLEU-4","GS"],"first_row_in_archive_order":{"model":"mPLUG-2","paper_title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","paper_url":"/paper/mplug-2-a-modularized-multi-modal-foundation","paper_date":"2023-02-01","arxiv_id":"2302.00402","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"x-plug/mplug-owl","url":"https://github.com/x-plug/mplug-owl"},{"title":"alibaba/AliceMind","url":"https://github.com/alibaba/AliceMind"},{"title":"X-PLUG/mPLUG-2","url":"https://github.com/X-PLUG/mPLUG-2"}],"syntology":{"n":19,"n_ran":9,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/video-captioning-on-msvd-1","slug":"video-captioning-on-msvd-1","dataset":"MSVD","dataset_url":"/dataset/msvd","rows_in_archive":16,"metrics":["CIDEr","BLEU-4","METEOR","ROUGE-L","GS"],"first_row_in_archive_order":{"model":"MaMMUT","paper_title":"MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks","paper_url":"/paper/mammut-a-simple-architecture-for-joint","paper_date":"2023-03-29","arxiv_id":"2303.16839","code_links":[{"title":"lucidrains/mammut-pytorch","url":"https://github.com/lucidrains/mammut-pytorch"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/video-captioning-on-youcook2","slug":"video-captioning-on-youcook2","dataset":"YouCook2","dataset_url":"/dataset/youcook2","rows_in_archive":14,"metrics":["BLEU-4","BLEU-3","CIDEr","ROUGE-L","METEOR"],"first_row_in_archive_order":{"model":"VAST","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_url":"/paper/vast-a-vision-audio-subtitle-text-omni-1","paper_date":"2023-05-29","arxiv_id":"2305.18500","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"syntology":{"n":42,"n_ran":15,"n_unverified":27,"n_pointer_only":0}}},{"leaderboard":"/sota/video-captioning-on-vatex-1","slug":"video-captioning-on-vatex-1","dataset":"VATEX","dataset_url":"/dataset/vatex","rows_in_archive":10,"metrics":["BLEU-4","CIDEr","METEOR","ROUGE-L"],"first_row_in_archive_order":{"model":"VALOR","paper_title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","paper_url":"/paper/valor-vision-audio-language-omni-perception","paper_date":"2023-04-17","arxiv_id":"2304.08345","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"}],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-activitynet-captions","slug":"video-captioning-on-activitynet-captions","dataset":"ActivityNet Captions","dataset_url":"/dataset/activitynet-captions","rows_in_archive":5,"metrics":["BLEU4","BLEU-3","CIDEr","ROUGE-L","METEOR"],"first_row_in_archive_order":{"model":"VideoCoCa","paper_title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","paper_url":"/paper/video-text-modeling-with-zero-shot-transfer","paper_date":"2022-12-09","arxiv_id":"2212.04979","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-msrvtt-ctn","slug":"video-captioning-on-msrvtt-ctn","dataset":"MSRVTT-CTN","dataset_url":"/dataset/msrvtt-ctn","rows_in_archive":4,"metrics":["CIDEr","SPICE","ROUGE-L"],"first_row_in_archive_order":{"model":"CEN","paper_title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","paper_url":"/paper/narrativebridge-enhancing-video-captioning","paper_date":"2024-06-10","arxiv_id":"2406.06499","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-msvd-ctn","slug":"video-captioning-on-msvd-ctn","dataset":"MSVD-CTN","dataset_url":"/dataset/msvd-ctn","rows_in_archive":4,"metrics":["CIDEr","ROUGE-L","SPICE"],"first_row_in_archive_order":{"model":"CEN","paper_title":"NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative","paper_url":"/paper/narrativebridge-enhancing-video-captioning","paper_date":"2024-06-10","arxiv_id":"2406.06499","code_links":[],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-hindi-msr-vtt","slug":"video-captioning-on-hindi-msr-vtt","dataset":"Hindi MSR-VTT","dataset_url":"/dataset/hindi-msr-vtt","rows_in_archive":2,"metrics":["BLEU4"],"first_row_in_archive_order":{"model":"SBD_Keyframe","paper_title":"An Efficient Keyframes Selection Based Framework for Video Captioning","paper_url":"/paper/an-efficient-keyframes-selection-based","paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-shot2story20k","slug":"video-captioning-on-shot2story20k","dataset":"Shot2Story20K","dataset_url":"/dataset/shot2story20k","rows_in_archive":2,"metrics":["CIDEr","BLEU-4","METEOR","ROUGE"],"first_row_in_archive_order":{"model":"Shotluck-Holmes (3.1B)","paper_title":"Shotluck Holmes: A Family of Efficient Small-Scale Large Language Vision Models For Video Captioning and Summarization","paper_url":"/paper/shotluck-holmes-a-family-of-efficient-small","paper_date":"2024-05-31","arxiv_id":"2405.20648","code_links":[{"title":"Skyline-9/Shotluck-Holmes","url":"https://github.com/Skyline-9/Shotluck-Holmes"}],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-tvc","slug":"video-captioning-on-tvc","dataset":"TVC","dataset_url":"/dataset/tvc","rows_in_archive":2,"metrics":["BLEU-4","CIDEr"],"first_row_in_archive_order":{"model":"VAST","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_url":"/paper/vast-a-vision-audio-subtitle-text-omni-1","paper_date":"2023-05-29","arxiv_id":"2305.18500","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"syntology":{"n":42,"n_ran":15,"n_unverified":27,"n_pointer_only":0}}},{"leaderboard":"/sota/video-captioning-on-chinaopen-1k-1","slug":"video-captioning-on-chinaopen-1k-1","dataset":"ChinaOpen-1k","dataset_url":"/dataset/chinaopen","rows_in_archive":1,"metrics":["BLEU4","CIDEr","METEOR"],"first_row_in_archive_order":{"model":"GVT","paper_title":"ChinaOpen: A Dataset for Open-world Multimodal Learning","paper_url":"/paper/chinaopen-a-dataset-for-open-world-multimodal-1","paper_date":"2023-05-10","arxiv_id":"2305.05880","code_links":[{"title":"dong03/GenerativeVideo2Text","url":"https://github.com/dong03/GenerativeVideo2Text"}],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-msvd-indonesian","slug":"video-captioning-on-msvd-indonesian","dataset":"MSVD-Indonesian","dataset_url":"/dataset/msvd-indonesian","rows_in_archive":1,"metrics":["BLEU-4","CIDEr","METEOR","ROUGE-L"],"first_row_in_archive_order":{"model":"VNS-GRU (Cross-Lingual)","paper_title":"MSVD-Indonesian: A Benchmark for Multimodal Video-Text Tasks in Indonesian","paper_url":"/paper/msvd-indonesian-a-benchmark-for-multimodal","paper_date":"2023-06-20","arxiv_id":"2306.11341","code_links":[{"title":"willyfh/msvd-indonesian","url":"https://github.com/willyfh/msvd-indonesian"}],"syntology":null}},{"leaderboard":"/sota/video-captioning-on-vidchapters-7m","slug":"video-captioning-on-vidchapters-7m","dataset":"VidChapters-7M","dataset_url":"/dataset/vidchapters-7m","rows_in_archive":1,"metrics":["CIDEr"],"first_row_in_archive_order":{"model":"Vid2Seq","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/msr-vtt","name":"MSR-VTT","full_name":"","num_papers_in_archive":640},{"url":"/dataset/msvd","name":"MSVD","full_name":"Microsoft Research Video Description Corpus","num_papers_in_archive":327},{"url":"/dataset/howto100m","name":"HowTo100M","full_name":"HowTo100M","num_papers_in_archive":286},{"url":"/dataset/webvid","name":"WebVid","full_name":"","num_papers_in_archive":257},{"url":"/dataset/activitynet-captions","name":"ActivityNet Captions","full_name":"","num_papers_in_archive":255},{"url":"/dataset/youcook2","name":"YouCook2","full_name":"","num_papers_in_archive":198},{"url":"/dataset/vatex","name":"VATEX","full_name":"Video And TEXt","num_papers_in_archive":118},{"url":"/dataset/tgif","name":"TGIF","full_name":"Tumblr GIF","num_papers_in_archive":51},{"url":"/dataset/youcook","name":"YouCook","full_name":"","num_papers_in_archive":45},{"url":"/dataset/mtl-aqa","name":"MTL-AQA","full_name":"","num_papers_in_archive":33},{"url":"/dataset/value","name":"VALUE","full_name":"Video-And-Language Understanding Evaluation","num_papers_in_archive":30},{"url":"/dataset/how2qa","name":"How2QA","full_name":"How2QA","num_papers_in_archive":28},{"url":"/dataset/violin","name":"Violin","full_name":"VIdeO-and-Language INference","num_papers_in_archive":18},{"url":"/dataset/tvc","name":"TVC","full_name":"TV show Captions","num_papers_in_archive":16},{"url":"/dataset/mass","name":"MaSS","full_name":"","num_papers_in_archive":15},{"url":"/dataset/vitt","name":"ViTT","full_name":"Video Timeline Tags","num_papers_in_archive":14},{"url":"/dataset/egoexolearn","name":"EgoExoLearn","full_name":"","num_papers_in_archive":12},{"url":"/dataset/2024-ai-city-challenge-mtmc-people-tracking","name":"2024 AI City Challenge","full_name":"","num_papers_in_archive":10},{"url":"/dataset/how2r","name":"How2R","full_name":"How2R","num_papers_in_archive":9},{"url":"/dataset/v2c","name":"V2C","full_name":"Video-to-Commonsense","num_papers_in_archive":6},{"url":"/dataset/skyeye-968k","name":"SkyEye-968k","full_name":"","num_papers_in_archive":5},{"url":"/dataset/vidchapters-7m","name":"VidChapters-7M","full_name":"","num_papers_in_archive":5},{"url":"/dataset/msrvtt-ctn","name":"MSRVTT-CTN","full_name":"MSRVTT Causal-Temporal Narrative","num_papers_in_archive":4},{"url":"/dataset/msvd-ctn","name":"MSVD-CTN","full_name":"MSVD Causal-Temporal Narrative","num_papers_in_archive":4},{"url":"/dataset/youku-mplug","name":"Youku-mPLUG","full_name":"","num_papers_in_archive":4},{"url":"/dataset/m-vad-names","name":"M-VAD Names","full_name":"M-VAD Names Dataset","num_papers_in_archive":3},{"url":"/dataset/shot2story20k","name":"Shot2Story20K","full_name":"","num_papers_in_archive":3},{"url":"/dataset/hindi-msr-vtt","name":"Hindi MSR-VTT","full_name":"Hindi Microsoft reseacrh video to text","num_papers_in_archive":2},{"url":"/dataset/longvale","name":"LongVALE","full_name":"","num_papers_in_archive":2},{"url":"/dataset/mmac-captions","name":"MMAC Captions","full_name":"","num_papers_in_archive":2},{"url":"/dataset/nsva","name":"NSVA","full_name":"NBA dataset for Sports Video Analysis","num_papers_in_archive":2},{"url":"/dataset/chinaopen","name":"ChinaOpen-1k","full_name":"","num_papers_in_archive":1},{"url":"/dataset/kinetic-gebc","name":"Kinetics-GEB+","full_name":"","num_papers_in_archive":1},{"url":"/dataset/lsmdc-context","name":"LSMDC-Context","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/msvd-indonesian","name":"MSVD-Indonesian","full_name":"","num_papers_in_archive":1},{"url":"/dataset/w-oops","name":"W-Oops","full_name":"","num_papers_in_archive":1},{"url":"/dataset/vript","name":"Vript","full_name":"🎬 Vript: A Video Is Worth Thousands of Words","num_papers_in_archive":0}],"subtasks":[{"url":"/task/audio-visual-video-captioning","name":"Audio-Visual Video Captioning"},{"url":"/task/boundary-captioning","name":"Boundary Captioning"},{"url":"/task/dense-video-captioning","name":"Dense Video Captioning"},{"url":"/task/live-video-captioning","name":"Live Video Captioning"},{"url":"/task/video-boundary-captioning","name":"Video Boundary Captioning"},{"url":"/task/visual-text-correction","name":"Visual Text Correction"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":211,"tagged_in_all":473,"items":[{"url":"/paper/eco-efficient-convolutional-network-for","title":"ECO: Efficient Convolutional Network for Online Video Understanding","date":"2018-04-24","arxiv_id":"1804.09066","repositories_listed":6,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/top-down-visual-saliency-guided-by-captions","title":"Top-down Visual Saliency Guided by Captions","date":"2016-12-21","arxiv_id":"1612.07360","repositories_listed":6,"syntology":null},{"url":"/paper/delving-deeper-into-convolutional-networks","title":"Delving Deeper into Convolutional Networks for Learning Video Representations","date":"2015-11-19","arxiv_id":"1511.06432","repositories_listed":6,"syntology":null},{"url":"/paper/frozen-in-time-a-joint-video-and-image","title":"Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval","date":"2021-04-01","arxiv_id":"2104.00650","repositories_listed":5,"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/what-and-how-well-you-performed-a-multitask","title":"What and How Well You Performed? A Multitask Learning Approach to Action Quality Assessment","date":"2019-04-08","arxiv_id":"1904.04346","repositories_listed":5,"syntology":null},{"url":"/paper/mplug-2-a-modularized-multi-modal-foundation","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","date":"2023-02-01","arxiv_id":"2302.00402","repositories_listed":4,"syntology":{"n":19,"n_ran":9,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/cap4video-what-can-auxiliary-captions-do-for","title":"Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?","date":"2022-12-31","arxiv_id":"2301.00184","repositories_listed":4,"syntology":{"n":25,"n_ran":14,"n_unverified":11,"n_pointer_only":0}},{"url":"/paper/expectation-maximization-contrastive-learning","title":"Expectation-Maximization Contrastive Learning for Compact Video-and-Language Representations","date":"2022-11-21","arxiv_id":"2211.11427","repositories_listed":4,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/multi-modal-dense-video-captioning","title":"Multi-modal Dense Video Captioning","date":"2020-03-17","arxiv_id":"2003.07758","repositories_listed":4,"syntology":null},{"url":"/paper/vatex-a-large-scale-high-quality-multilingual","title":"VATEX: A Large-Scale, High-Quality Multilingual Dataset for Video-and-Language Research","date":"2019-04-06","arxiv_id":"1904.03493","repositories_listed":4,"syntology":null},{"url":"/paper/videollama-2-advancing-spatial-temporal","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","date":"2024-06-11","arxiv_id":"2406.07476","repositories_listed":3,"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/vid2seq-large-scale-pretraining-of-a-visual","title":"Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning","date":"2023-02-27","arxiv_id":"2302.14115","repositories_listed":3,"syntology":null},{"url":"/paper/hero-hierarchical-encoder-for-video-language","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","date":"2020-05-01","arxiv_id":"2005.00200","repositories_listed":3,"syntology":{"n":13,"n_ran":5,"n_unverified":8,"n_pointer_only":8}},{"url":"/paper/videobert-a-joint-model-for-video-and","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","date":"2019-04-03","arxiv_id":"1904.01766","repositories_listed":3,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/reconstruction-network-for-video-captioning","title":"Reconstruction Network for Video Captioning","date":"2018-03-30","arxiv_id":"1803.11438","repositories_listed":3,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/cogvideox-text-to-video-diffusion-models-with","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","date":"2024-08-12","arxiv_id":"2408.06072","repositories_listed":2,"syntology":{"n":7,"n_ran":7,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/video-recap-recursive-captioning-of-hour-long","title":"Video ReCap: Recursive Captioning of Hour-Long Videos","date":"2024-02-20","arxiv_id":"2402.13250","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/rtq-rethinking-video-language-understanding","title":"RTQ: Rethinking Video-language Understanding Based on Image-text Model","date":"2023-12-01","arxiv_id":"2312.00347","repositories_listed":2,"syntology":null},{"url":"/paper/soccernet-2023-challenges-results","title":"SoccerNet 2023 Challenges Results","date":"2023-09-12","arxiv_id":"2309.06006","repositories_listed":2,"syntology":null},{"url":"/paper/learning-multi-modal-representations-by","title":"Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures","date":"2023-07-27","arxiv_id":"2307.15220","repositories_listed":2,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/causalvlr-a-toolbox-and-benchmark-for-visual","title":"CausalVLR: A Toolbox and Benchmark for Visual-Linguistic Causal Reasoning","date":"2023-06-30","arxiv_id":"2306.17462","repositories_listed":2,"syntology":null},{"url":"/paper/pali-x-on-scaling-up-a-multilingual-vision","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","date":"2023-05-29","arxiv_id":"2305.18565","repositories_listed":2,"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/vast-a-vision-audio-subtitle-text-omni-1","title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","date":"2023-05-29","arxiv_id":"2305.18500","repositories_listed":2,"syntology":{"n":42,"n_ran":15,"n_unverified":27,"n_pointer_only":0}},{"url":"/paper/soccernet-caption-dense-video-captioning-for","title":"SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries","date":"2023-04-10","arxiv_id":"2304.04565","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/zeronlg-aligning-and-autoencoding-domains-for","title":"ZeroNLG: Aligning and Autoencoding Domains for Zero-Shot Multimodal and Multilingual Natural Language Generation","date":"2023-03-11","arxiv_id":"2303.06458","repositories_listed":2,"syntology":null},{"url":"/paper/mugen-a-playground-for-video-audio-text","title":"MUGEN: A Playground for Video-Audio-Text Multimodal Understanding and GENeration","date":"2022-04-17","arxiv_id":"2204.08058","repositories_listed":2,"syntology":null},{"url":"/paper/x-modaler-a-versatile-and-high-performance","title":"X-modaler: A Versatile and High-performance Codebase for Cross-modal Analytics","date":"2021-08-18","arxiv_id":"2108.08217","repositories_listed":2,"syntology":null},{"url":"/paper/end-to-end-dense-video-captioning-with","title":"End-to-End Dense Video Captioning with Parallel Decoding","date":"2021-08-17","arxiv_id":"2108.07781","repositories_listed":2,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/enriching-video-captions-with-contextual-text","title":"Enriching Video Captions With Contextual Text","date":"2020-07-29","arxiv_id":"2007.14682","repositories_listed":2,"syntology":null},{"url":"/paper/a-better-use-of-audio-visual-cues-dense-video","title":"A Better Use of Audio-Visual Cues: Dense Video Captioning with Bi-modal Transformer","date":"2020-05-17","arxiv_id":"2005.08271","repositories_listed":2,"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}}],"syntology_records":17,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}