{"url":"/task/cross-modal-retrieval","name":"Cross-Modal Retrieval","slug":"cross-modal-retrieval","description_markdown":"**Cross-Modal Retrieval (CMR)** is a task of retrieving items across different modalities, such as image, text, video, and audio. The core challenge of CMR is the *heterogeneity gap*, which arises because data from different modalities have distinct representations, making direct comparison difficult.  To address this, most CMR methods focus on learning a *shared latent embedding space*. In this space, concepts from different modalities are projected, allowing their similarity to be measured using a distance metric.\r\n\r\n\r\n<span class=\"description-source\">[Scene-centric vs. Object-centric Image-Text Cross-modal Retrieval: A Reproducibility Study](https://arxiv.org/abs/2301.05174)</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":522,"papers_with_code":244,"benchmarks":13,"benchmark_tables_in_archive":13,"benchmark_tables_shown":13,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":24,"subtasks":5,"parent_tasks":2},"benchmarks":[{"leaderboard":"/sota/cross-modal-retrieval-on-coco-2014","slug":"cross-modal-retrieval-on-coco-2014","dataset":"COCO 2014","dataset_url":"/dataset/coco","rows_in_archive":36,"metrics":["Text-to-image R@1","Text-to-image R@5","Text-to-image R@10","Image-to-text R@1","Image-to-text R@5","Image-to-text R@10"],"first_row_in_archive_order":{"model":"VAST","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_url":"/paper/vast-a-vision-audio-subtitle-text-omni-1","paper_date":"2023-05-29","arxiv_id":"2305.18500","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"syntology":{"n":42,"n_ran":15,"n_unverified":27,"n_pointer_only":0}}},{"leaderboard":"/sota/cross-modal-retrieval-on-flickr30k","slug":"cross-modal-retrieval-on-flickr30k","dataset":"Flickr30k","dataset_url":"/dataset/flickr30k","rows_in_archive":27,"metrics":["Image-to-text R@1","Image-to-text R@5","Image-to-text R@10","Text-to-image R@1","Text-to-image R@5","Text-to-image R@10"],"first_row_in_archive_order":{"model":"X2-VLM (large)","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","paper_url":"/paper/x-2-vlm-all-in-one-pre-trained-model-for","paper_date":"2022-11-22","arxiv_id":"2211.12402","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"},{"title":"zengyan-97/x2-vlm","url":"https://github.com/zengyan-97/x2-vlm"}],"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":6}}},{"leaderboard":"/sota/cross-modal-retrieval-on-rsicd","slug":"cross-modal-retrieval-on-rsicd","dataset":"RSICD","dataset_url":"/dataset/rsicd","rows_in_archive":10,"metrics":["Mean Recall","Image-to-text R@1","text-to-image R@1"],"first_row_in_archive_order":{"model":"HarMA (w/ GeoRSCLIP)","paper_title":"Efficient Remote Sensing with Harmonized Transfer Learning and Modality Alignment","paper_url":"/paper/efficient-remote-sensing-with-harmonized","paper_date":"2024-04-28","arxiv_id":"2404.18253","code_links":[{"title":"seekerhuang/harma","url":"https://github.com/seekerhuang/harma"}],"syntology":{"n":6,"n_ran":1,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/cross-modal-retrieval-on-rsitmd","slug":"cross-modal-retrieval-on-rsitmd","dataset":"RSITMD","dataset_url":"/dataset/rsitmd","rows_in_archive":10,"metrics":["Image-to-text R@1","Mean Recall","text-to-imageR@1"],"first_row_in_archive_order":{"model":"HarMA (w/ GeoRSCLIP)","paper_title":"Efficient Remote Sensing with Harmonized Transfer Learning and Modality Alignment","paper_url":"/paper/efficient-remote-sensing-with-harmonized","paper_date":"2024-04-28","arxiv_id":"2404.18253","code_links":[{"title":"seekerhuang/harma","url":"https://github.com/seekerhuang/harma"}],"syntology":{"n":6,"n_ran":1,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/cross-modal-retrieval-on-chebi-20","slug":"cross-modal-retrieval-on-chebi-20","dataset":"ChEBI-20","dataset_url":"/dataset/chebi-20","rows_in_archive":9,"metrics":["Hits@1","Hits@10","Mean Rank","Test MRR"],"first_row_in_archive_order":{"model":"CLASS (ORMA)","paper_title":"CLASS: Enhancing Cross-Modal Text-Molecule Retrieval Performance and Training Efficiency","paper_url":"/paper/class-enhancing-cross-modal-text-molecule","paper_date":"2025-02-17","arxiv_id":"2502.11633","code_links":[],"syntology":null}},{"leaderboard":"/sota/cross-modal-retrieval-on-recipe1m","slug":"cross-modal-retrieval-on-recipe1m","dataset":"Recipe1M","dataset_url":"/dataset/recipe1m-1","rows_in_archive":9,"metrics":["Image-to-text R@1","Text-to-image R@1"],"first_row_in_archive_order":{"model":"VLPCook (R1M+)","paper_title":"Vision and Structured-Language Pretraining for Cross-Modal Food Retrieval","paper_url":"/paper/structured-vision-language-pretraining-for","paper_date":"2022-12-08","arxiv_id":"2212.04267","code_links":[{"title":"mshukor/vlpcook","url":"https://github.com/mshukor/vlpcook"}],"syntology":null}},{"leaderboard":"/sota/cross-modal-retrieval-on-mscoco-1k","slug":"cross-modal-retrieval-on-mscoco-1k","dataset":"MSCOCO-1k","dataset_url":"/dataset/coco","rows_in_archive":2,"metrics":["Image-to-text R@1","Text-to-image R@1"],"first_row_in_archive_order":{"model":"NAPReg","paper_title":"NAPReg: Nouns As Proxies Regularization for Semantically Aware Cross-Modal Embeddings","paper_url":"/paper/napreg-nouns-as-proxies-regularization-for","paper_date":"2023-01-07","arxiv_id":null,"code_links":[{"title":"bhavinjawade/NAPReq","url":"https://github.com/bhavinjawade/NAPReq"}],"syntology":null}},{"leaderboard":"/sota/cross-modal-retrieval-on-recipe1m-1","slug":"cross-modal-retrieval-on-recipe1m-1","dataset":"Recipe1M+","dataset_url":"/dataset/recipe1m-1","rows_in_archive":2,"metrics":["Image-to-text R@1","Text-to-image R@1"],"first_row_in_archive_order":{"model":"VLPCook","paper_title":"Vision and Structured-Language Pretraining for Cross-Modal Food Retrieval","paper_url":"/paper/structured-vision-language-pretraining-for","paper_date":"2022-12-08","arxiv_id":"2212.04267","code_links":[{"title":"mshukor/vlpcook","url":"https://github.com/mshukor/vlpcook"}],"syntology":null}},{"leaderboard":"/sota/cross-modal-retrieval-on-soundingearth","slug":"cross-modal-retrieval-on-soundingearth","dataset":"SoundingEarth","dataset_url":"/dataset/soundingearth","rows_in_archive":2,"metrics":["Median Rank","Image-to-sound R@100","Sound-to-image R@100"],"first_row_in_archive_order":{"model":"GeoCLAP","paper_title":"Learning Tri-modal Embeddings for Zero-Shot Soundscape Mapping","paper_url":"/paper/learning-tri-modal-embeddings-for-zero-shot","paper_date":"2023-09-19","arxiv_id":"2309.10667","code_links":[{"title":"mvrl/geoclap","url":"https://github.com/mvrl/geoclap"}],"syntology":{"n":10,"n_ran":5,"n_unverified":5,"n_pointer_only":10}}},{"leaderboard":"/sota/cross-modal-retrieval-on-cuhk-pedes","slug":"cross-modal-retrieval-on-cuhk-pedes","dataset":"CUHK-PEDES","dataset_url":"/dataset/cuhk-pedes","rows_in_archive":1,"metrics":["Text-to-image Medr"],"first_row_in_archive_order":{"model":"Dual Path","paper_title":"Dual-Path Convolutional Image-Text Embeddings with Instance Loss","paper_url":"/paper/dual-path-convolutional-image-text-embedding","paper_date":"2017-11-15","arxiv_id":"1711.05535","code_links":[{"title":"layumi/Image-Text-Embedding","url":"https://github.com/layumi/Image-Text-Embedding"},{"title":"pshroff04/Dual_Path_CNN","url":"https://github.com/pshroff04/Dual_Path_CNN"}],"syntology":null}},{"leaderboard":"/sota/cross-modal-retrieval-on-flickr-8k","slug":"cross-modal-retrieval-on-flickr-8k","dataset":"Flickr-8k","dataset_url":"/dataset/flickr-8k","rows_in_archive":1,"metrics":["Image-to-text R@1","Text-to-image R@1"],"first_row_in_archive_order":{"model":"NAPReg","paper_title":"NAPReg: Nouns As Proxies Regularization for Semantically Aware Cross-Modal Embeddings","paper_url":"/paper/napreg-nouns-as-proxies-regularization-for","paper_date":"2023-01-07","arxiv_id":null,"code_links":[{"title":"bhavinjawade/NAPReq","url":"https://github.com/bhavinjawade/NAPReq"}],"syntology":null}},{"leaderboard":"/sota/cross-modal-retrieval-on-ms-coco-2014-1","slug":"cross-modal-retrieval-on-ms-coco-2014-1","dataset":"MS-COCO-2014","dataset_url":null,"rows_in_archive":1,"metrics":["Text-to-image R@1"],"first_row_in_archive_order":{"model":"NAPReg","paper_title":"NAPReg: Nouns As Proxies Regularization for Semantically Aware Cross-Modal Embeddings","paper_url":"/paper/napreg-nouns-as-proxies-regularization-for","paper_date":"2023-01-07","arxiv_id":null,"code_links":[{"title":"bhavinjawade/NAPReq","url":"https://github.com/bhavinjawade/NAPReq"}],"syntology":null}},{"leaderboard":"/sota/cross-modal-retrieval-on-mscoco","slug":"cross-modal-retrieval-on-mscoco","dataset":"MSCOCO","dataset_url":"/dataset/mscoco","rows_in_archive":1,"metrics":["Image-to-text R@1"],"first_row_in_archive_order":{"model":"3SHNet","paper_title":"3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting","paper_url":"/paper/3shnet-boosting-image-sentence-retrieval-via","paper_date":"2024-04-26","arxiv_id":"2404.17273","code_links":[{"title":"xurige1995/3shnet","url":"https://github.com/xurige1995/3shnet"}],"syntology":{"n":10,"n_ran":10,"n_unverified":0,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/flickr30k","name":"Flickr30k","full_name":"Flickr30k","num_papers_in_archive":880},{"url":"/dataset/nus-wide","name":"NUS-WIDE","full_name":"","num_papers_in_archive":348},{"url":"/dataset/pascal-voc-2007","name":"PASCAL VOC 2007","full_name":"PASCAL VOC 2007","num_papers_in_archive":126},{"url":"/dataset/cuhk-pedes","name":"CUHK-PEDES","full_name":"CUHK-PEDES","num_papers_in_archive":93},{"url":"/dataset/mscoco","name":"MSCOCO","full_name":"","num_papers_in_archive":90},{"url":"/dataset/rsicd","name":"RSICD","full_name":"Remote Sensing Image Captioning Dataset","num_papers_in_archive":70},{"url":"/dataset/recipe1m-1","name":"Recipe1M+","full_name":"Recipe1M+","num_papers_in_archive":68},{"url":"/dataset/chebi-20","name":"ChEBI-20","full_name":"","num_papers_in_archive":43},{"url":"/dataset/rsitmd","name":"RSITMD","full_name":"","num_papers_in_archive":26},{"url":"/dataset/semart","name":"SemArt","full_name":"","num_papers_in_archive":16},{"url":"/dataset/soundingearth","name":"SoundingEarth","full_name":"","num_papers_in_archive":8},{"url":"/dataset/chinesefoodnet","name":"ChineseFoodNet","full_name":"","num_papers_in_archive":6},{"url":"/dataset/flickr-8k","name":"Flickr-8k","full_name":"","num_papers_in_archive":5},{"url":"/dataset/song-describer-dataset","name":"Song Describer Dataset","full_name":"","num_papers_in_archive":5},{"url":"/dataset/twitter100k","name":"Twitter100k","full_name":"","num_papers_in_archive":5},{"url":"/dataset/ctc","name":"CTC","full_name":"COCO-Text Captioned","num_papers_in_archive":3},{"url":"/dataset/posescript","name":"PoseScript","full_name":"","num_papers_in_archive":2},{"url":"/dataset/cinat-birds-2021","name":"CiNAT-Birds-2021","full_name":"Cross-View iNaturalist Birds 2021","num_papers_in_archive":1},{"url":"/dataset/ushasi-chaudhuri","name":"Earth on Canvas","full_name":"","num_papers_in_archive":1},{"url":"/dataset/iapr-tc-12","name":"IAPR TC-12","full_name":"IAPR TC-12 Benchmark","num_papers_in_archive":1},{"url":"/dataset/impact-patent","name":"IMPACT Patent","full_name":"A Large-scale Integrated Multimodal Patent Analysis and Creation Dataset for Design Patents","num_papers_in_archive":1},{"url":"/dataset/musechat-dataset","name":"MuseChat Dataset","full_name":"MuseChat: A Conversational Music Recommendation System for Videos (CVPR 2024 Highlight Paper)","num_papers_in_archive":1},{"url":"/dataset/taxabench-8k","name":"TaxaBench-8k","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/cross-modal-retrieval-on-rsitmd","name":"Cross-Modal Retrieval on RSITMD"},{"url":"/task/cross-modal-retrieval-with-noisy","name":"Cross-modal retrieval with noisy correspondence"},{"url":"/task/image-text-matching","name":"Image-text matching"},{"url":"/task/multilingual-cross-modal-retrieval","name":"multilingual cross-modal retrieval"},{"url":"/task/zero-shot-composed-person-retrieval","name":"Zero-shot Composed Person Retrieval"}],"parent_tasks":[{"url":"/task/cross-modal-information-retrieval","name":"Cross-Modal Information Retrieval"},{"url":"/task/multi-modal","name":"Image Retrieval with Multi-Modal Query"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":244,"tagged_in_all":522,"items":[{"url":"/paper/stacked-capsule-autoencoders","title":"Stacked Capsule Autoencoders","date":"2019-06-17","arxiv_id":"1906.06818","repositories_listed":11,"syntology":{"n":29,"n_ran":2,"n_unverified":27,"n_pointer_only":0}},{"url":"/paper/vse-improving-visual-semantic-embeddings-with","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","date":"2017-07-18","arxiv_id":"1707.05612","repositories_listed":10,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/rescaling-egocentric-vision","title":"Rescaling Egocentric Vision","date":"2020-06-23","arxiv_id":"2006.13256","repositories_listed":7,"syntology":{"n":18,"n_ran":3,"n_unverified":15,"n_pointer_only":0}},{"url":"/paper/align-before-fuse-vision-and-language","title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation","date":"2021-07-16","arxiv_id":"2107.07651","repositories_listed":6,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/vilt-vision-and-language-transformer-without","title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","date":"2021-02-05","arxiv_id":"2102.03334","repositories_listed":6,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/stacked-cross-attention-for-image-text","title":"Stacked Cross Attention for Image-Text Matching","date":"2018-03-21","arxiv_id":"1803.08024","repositories_listed":6,"syntology":{"n":16,"n_ran":7,"n_unverified":9,"n_pointer_only":1}},{"url":"/paper/scaling-up-visual-and-vision-language","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","date":"2021-02-11","arxiv_id":"2102.05918","repositories_listed":5,"syntology":{"n":10,"n_ran":8,"n_unverified":2,"n_pointer_only":9}},{"url":"/paper/a-molecular-multimodal-foundation-model","title":"A Molecular Multimodal Foundation Model Associating Molecule Graphs with Natural Language","date":"2022-09-12","arxiv_id":"2209.05481","repositories_listed":4,"syntology":{"n":8,"n_ran":2,"n_unverified":6,"n_pointer_only":2}},{"url":"/paper/probabilistic-embeddings-for-cross-modal","title":"Probabilistic Embeddings for Cross-Modal Retrieval","date":"2021-01-13","arxiv_id":"2101.05068","repositories_listed":4,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/oscar-object-semantics-aligned-pre-training","title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks","date":"2020-04-13","arxiv_id":"2004.06165","repositories_listed":4,"syntology":{"n":23,"n_ran":11,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/fine-grained-video-text-retrieval-with","title":"Fine-grained Video-Text Retrieval with Hierarchical Graph Reasoning","date":"2020-03-01","arxiv_id":"2003.00392","repositories_listed":4,"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/deep-visual-semantic-alignments-for","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","date":"2014-12-07","arxiv_id":"1412.2306","repositories_listed":4,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/imagebind-one-embedding-space-to-bind-them","title":"ImageBind: One Embedding Space To Bind Them All","date":"2023-05-09","arxiv_id":"2305.05665","repositories_listed":3,"syntology":{"n":34,"n_ran":24,"n_unverified":10,"n_pointer_only":32}},{"url":"/paper/a-channel-mix-method-for-fine-grained-cross","title":"A Channel Mix Method for Fine-Grained Cross-Modal Retrieval","date":"2022-08-26","arxiv_id":null,"repositories_listed":3,"syntology":null},{"url":"/paper/iglue-a-benchmark-for-transfer-learning","title":"IGLUE: A Benchmark for Transfer Learning across Modalities, Tasks, and Languages","date":"2022-01-27","arxiv_id":"2201.11732","repositories_listed":3,"syntology":{"n":21,"n_ran":8,"n_unverified":13,"n_pointer_only":0}},{"url":"/paper/an-empirical-study-of-training-end-to-end","title":"An Empirical Study of Training End-to-End Vision-and-Language Transformers","date":"2021-11-03","arxiv_id":"2111.02387","repositories_listed":3,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/unimo-towards-unified-modal-understanding-and","title":"UNIMO: Towards Unified-Modal Understanding and Generation via Cross-Modal Contrastive Learning","date":"2020-12-31","arxiv_id":"2012.15409","repositories_listed":3,"syntology":null},{"url":"/paper/fashionbert-text-and-image-matching-with","title":"FashionBERT: Text and Image Matching with Adaptive Loss for Cross-modal Retrieval","date":"2020-05-20","arxiv_id":"2005.09801","repositories_listed":3,"syntology":null},{"url":"/paper/derm1m-a-million-scale-vision-language","title":"Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology","date":"2025-03-19","arxiv_id":"2503.14911","repositories_listed":2,"syntology":null},{"url":"/paper/multimodal-whole-slide-foundation-model-for","title":"Multimodal Whole Slide Foundation Model for Pathology","date":"2024-11-29","arxiv_id":"2411.19666","repositories_listed":2,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/procedure-aware-surgical-video-language","title":"Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation","date":"2024-09-30","arxiv_id":"2410.00263","repositories_listed":2,"syntology":{"n":15,"n_ran":9,"n_unverified":6,"n_pointer_only":15}},{"url":"/paper/merlin-a-vision-language-foundation-model-for","title":"Merlin: A Vision Language Foundation Model for 3D Computed Tomography","date":"2024-06-10","arxiv_id":"2406.06512","repositories_listed":2,"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/leanvec-search-your-vectors-faster-by-making","title":"LeanVec: Searching vectors faster by making them fit","date":"2023-12-26","arxiv_id":"2312.16335","repositories_listed":2,"syntology":null},{"url":"/paper/quilt-1m-one-million-image-text-pairs-for-1","title":"Quilt-1M: One Million Image-Text Pairs for Histopathology","date":"2023-06-20","arxiv_id":"2306.11207","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/reducing-semantic-confusion-scene-aware","title":"Reducing Semantic Confusion: Scene-aware Aggregation Network for Remote Sensing Cross-modal Retrieval","date":"2023-06-12","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/molfm-a-multimodal-molecular-foundation-model","title":"MolFM: A Multimodal Molecular Foundation Model","date":"2023-06-06","arxiv_id":"2307.09484","repositories_listed":2,"syntology":null},{"url":"/paper/vast-a-vision-audio-subtitle-text-omni-1","title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","date":"2023-05-29","arxiv_id":"2305.18500","repositories_listed":2,"syntology":{"n":42,"n_ran":15,"n_unverified":27,"n_pointer_only":0}},{"url":"/paper/atomic-an-image-text-retrieval-test","title":"AToMiC: An Image/Text Retrieval Test Collection to Support Multimedia Content Creation","date":"2023-04-04","arxiv_id":"2304.01961","repositories_listed":2,"syntology":null},{"url":"/paper/semantic-conditional-diffusion-networks-for","title":"Semantic-Conditional Diffusion Networks for Image Captioning","date":"2022-12-06","arxiv_id":"2212.03099","repositories_listed":2,"syntology":null},{"url":"/paper/a-differentiable-semantic-metric","title":"A Differentiable Semantic Metric Approximation in Probabilistic Embedding for Cross-Modal Retrieval","date":"2022-12-06","arxiv_id":null,"repositories_listed":2,"syntology":null}],"syntology_records":20,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}