{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/2","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":19,"rows_per_page":100,"rows":[101,200],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning","next":"/task/image-captioning/papers/3","papers":[{"url":"/paper/image-as-a-foreign-language-beit-pretraining","slug":"image-as-a-foreign-language-beit-pretraining","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","date":"2022-08-22","arxiv_id":"2208.10442","repositories_listed":2,"syntology":null},{"url":"/paper/grit-faster-and-better-image-captioning","slug":"grit-faster-and-better-image-captioning","title":"GRIT: Faster and Better Image captioning Transformer Using Dual Visual Features","date":"2022-07-20","arxiv_id":"2207.09666","repositories_listed":2,"syntology":null},{"url":"/paper/all-you-may-need-for-vqa-are-image-captions-1","slug":"all-you-may-need-for-vqa-are-image-captions-1","title":"All You May Need for VQA are Image Captions","date":"2022-05-04","arxiv_id":"2205.01883","repositories_listed":2,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 1 unverified","sample_list":"/paper/all-you-may-need-for-vqa-are-image-captions-1#ran","syntology_url":"https://syntology.ai/paper/2205.01883","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2205.01883"}},"official":{"repos":["google-research-datasets/maverics"],"state":"official: not harvested","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":[]}}},{"url":"/paper/it-is-okay-to-not-be-okay-overcoming","slug":"it-is-okay-to-not-be-okay-overcoming","title":"It is Okay to Not Be Okay: Overcoming Emotional Bias in Affective Image Captioning by Contrastive Data Collection","date":"2022-04-15","arxiv_id":"2204.07660","repositories_listed":2,"syntology":null},{"url":"/paper/end-to-end-transformer-based-model-for-image","slug":"end-to-end-transformer-based-model-for-image","title":"End-to-End Transformer Based Model for Image Captioning","date":"2022-03-29","arxiv_id":"2203.15350","repositories_listed":2,"syntology":{"n":33,"n_ran":17,"n_constructed":9,"n_ran_checked":14,"n_instrument":3,"n_unverified":16,"n_honours":1,"n_violates":2,"n_no_contract":11,"n_pointer_only":15,"phrase":"17 ran (of which 9 constructed an object rather than computing a result; 14 with no instrument failure: 1 honoured, 2 violated, 11 with no contract checked; 3 where Syntology's instrument failed) · 16 unverified","sample_list":"/paper/end-to-end-transformer-based-model-for-image#ran","syntology_url":"https://syntology.ai/paper/2203.15350","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2203.15350"}},"official":{"repos":["232525/PureT"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":2,"n_ran_no_instrument_failure":5,"n_unverified":7,"ran_from_kinds":["listed","official"]}}},{"url":"/paper/on-vision-features-in-multimodal-machine-1","slug":"on-vision-features-in-multimodal-machine-1","title":"On Vision Features in Multimodal Machine Translation","date":"2022-03-17","arxiv_id":"2203.09173","repositories_listed":2,"syntology":{"n":3,"n_ran":2,"n_constructed":1,"n_ran_checked":1,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":0,"phrase":"2 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/on-vision-features-in-multimodal-machine-1#ran","syntology_url":"https://syntology.ai/paper/2203.09173","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2203.09173"}},"official":{"repos":["libeineu/fairseq_mmt"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":1,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/chart-to-text-a-large-scale-benchmark-for","slug":"chart-to-text-a-large-scale-benchmark-for","title":"Chart-to-Text: A Large-Scale Benchmark for Chart Summarization","date":"2022-03-12","arxiv_id":"2203.06486","repositories_listed":2,"syntology":{"n":5,"n_ran":5,"n_constructed":0,"n_ran_checked":0,"n_instrument":5,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":5,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 5 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/chart-to-text-a-large-scale-benchmark-for#ran","syntology_url":"https://syntology.ai/paper/2203.06486","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2203.06486"}},"official":null}},{"url":"/paper/dall-eval-probing-the-reasoning-skills-and","slug":"dall-eval-probing-the-reasoning-skills-and","title":"DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models","date":"2022-02-08","arxiv_id":"2202.04053","repositories_listed":2,"syntology":{"n":10,"n_ran":10,"n_constructed":0,"n_ran_checked":5,"n_instrument":5,"n_unverified":0,"n_honours":0,"n_violates":1,"n_no_contract":4,"n_pointer_only":3,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 1 violated, 4 with no contract checked; 5 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/dall-eval-probing-the-reasoning-skills-and#ran","syntology_url":"https://syntology.ai/paper/2202.04053","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2202.04053"}},"official":{"repos":["j-min/dalleval"],"state":"official (archive's flag): 10 ran","n_ran":10,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/ernie-vilg-unified-generative-pre-training","slug":"ernie-vilg-unified-generative-pre-training","title":"ERNIE-ViLG: Unified Generative Pre-training for Bidirectional Vision-Language Generation","date":"2021-12-31","arxiv_id":"2112.15283","repositories_listed":2,"syntology":null},{"url":"/paper/bidimensional-leaderboards-generate-and","slug":"bidimensional-leaderboards-generate-and","title":"Bidimensional Leaderboards: Generate and Evaluate Language Hand in Hand","date":"2021-12-08","arxiv_id":"2112.04139","repositories_listed":2,"syntology":null},{"url":"/paper/transparent-human-evaluation-for-image","slug":"transparent-human-evaluation-for-image","title":"Transparent Human Evaluation for Image Captioning","date":"2021-11-17","arxiv_id":"2111.08940","repositories_listed":2,"syntology":null},{"url":"/paper/cosmic-a-coherence-aware-generation-metric","slug":"cosmic-a-coherence-aware-generation-metric","title":"COSMic: A Coherence-Aware Generation Metric for Image Descriptions","date":"2021-09-11","arxiv_id":"2109.05281","repositories_listed":2,"syntology":null},{"url":"/paper/automatic-text-evaluation-through-the-lens-of","slug":"automatic-text-evaluation-through-the-lens-of","title":"Automatic Text Evaluation through the Lens of Wasserstein Barycenters","date":"2021-08-27","arxiv_id":"2108.12463","repositories_listed":2,"syntology":null},{"url":"/paper/simvlm-simple-visual-language-model","slug":"simvlm-simple-visual-language-model","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","date":"2021-08-24","arxiv_id":"2108.10904","repositories_listed":2,"syntology":{"n":37,"n_ran":22,"n_constructed":8,"n_ran_checked":16,"n_instrument":6,"n_unverified":15,"n_honours":1,"n_violates":3,"n_no_contract":12,"n_pointer_only":32,"phrase":"22 ran (of which 8 constructed an object rather than computing a result; 16 with no instrument failure: 1 honoured, 3 violated, 12 with no contract checked; 6 where Syntology's instrument failed) · 15 unverified","sample_list":"/paper/simvlm-simple-visual-language-model#ran","syntology_url":"https://syntology.ai/paper/2108.10904","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2108.10904"}},"official":null}},{"url":"/paper/x-modaler-a-versatile-and-high-performance","slug":"x-modaler-a-versatile-and-high-performance","title":"X-modaler: A Versatile and High-performance Codebase for Cross-modal Analytics","date":"2021-08-18","arxiv_id":"2108.08217","repositories_listed":2,"syntology":null},{"url":"/paper/end-to-end-attention-based-image-captioning","slug":"end-to-end-attention-based-image-captioning","title":"End-to-End Attention-based Image Captioning","date":"2021-04-30","arxiv_id":"2104.14721","repositories_listed":2,"syntology":null},{"url":"/paper/pracegover-a-large-dataset-for-image","slug":"pracegover-a-large-dataset-for-image","title":"#PraCegoVer: A Large Dataset for Image Captioning in Portuguese","date":"2021-03-21","arxiv_id":"2103.11474","repositories_listed":2,"syntology":null},{"url":"/paper/wenlan-bridging-vision-and-language-by-large","slug":"wenlan-bridging-vision-and-language-by-large","title":"WenLan: Bridging Vision and Language by Large-Scale Multi-Modal Pre-Training","date":"2021-03-11","arxiv_id":"2103.06561","repositories_listed":2,"syntology":null},{"url":"/paper/unifying-vision-and-language-tasks-via-text","slug":"unifying-vision-and-language-tasks-via-text","title":"Unifying Vision-and-Language Tasks via Text Generation","date":"2021-02-04","arxiv_id":"2102.02779","repositories_listed":2,"syntology":{"n":12,"n_ran":2,"n_constructed":2,"n_ran_checked":2,"n_instrument":0,"n_unverified":10,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 10 unverified; every one of the 2 samples that ran constructed an object rather than computing a result","sample_list":"/paper/unifying-vision-and-language-tasks-via-text#ran","syntology_url":"https://syntology.ai/paper/2102.02779","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2102.02779"}},"official":{"repos":["j-min/VL-T5"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":2,"n_ran_no_instrument_failure":2,"n_unverified":10,"ran_from_kinds":["official"]}}},{"url":"/paper/x-lxmert-paint-caption-and-answer-questions","slug":"x-lxmert-paint-caption-and-answer-questions","title":"X-LXMERT: Paint, Caption and Answer Questions with Multi-Modal Transformers","date":"2020-09-23","arxiv_id":"2009.11278","repositories_listed":2,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/x-lxmert-paint-caption-and-answer-questions#ran","syntology_url":"https://syntology.ai/paper/2009.11278","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2009.11278"}},"official":{"repos":["allenai/x-lxmert"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/fashion-captioning-towards-generating","slug":"fashion-captioning-towards-generating","title":"Fashion Captioning: Towards Generating Accurate Descriptions with Semantic Rewards","date":"2020-08-06","arxiv_id":"2008.02693","repositories_listed":2,"syntology":{"n":8,"n_ran":8,"n_constructed":0,"n_ran_checked":4,"n_instrument":4,"n_unverified":0,"n_honours":1,"n_violates":2,"n_no_contract":1,"n_pointer_only":3,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 1 honoured, 2 violated, 1 with no contract checked; 4 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/fashion-captioning-towards-generating#ran","syntology_url":"https://syntology.ai/paper/2008.02693","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2008.02693"}},"official":{"repos":["xuewyang/Fashion_Captioning"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["listed"]}}},{"url":"/paper/ratt-recurrent-attention-to-transient-tasks","slug":"ratt-recurrent-attention-to-transient-tasks","title":"RATT: Recurrent Attention to Transient Tasks for Continual Image Captioning","date":"2020-07-13","arxiv_id":"2007.06271","repositories_listed":2,"syntology":null},{"url":"/paper/auxiliary-signal-guided-knowledge-encoder","slug":"auxiliary-signal-guided-knowledge-encoder","title":"Auxiliary Signal-Guided Knowledge Encoder-Decoder for Medical Report Generation","date":"2020-06-06","arxiv_id":"2006.03744","repositories_listed":2,"syntology":null},{"url":"/paper/crisscrossed-captions-extended-intramodal-and","slug":"crisscrossed-captions-extended-intramodal-and","title":"Crisscrossed Captions: Extended Intramodal and Intermodal Semantic Similarity Judgments for MS-COCO","date":"2020-04-30","arxiv_id":"2004.15020","repositories_listed":2,"syntology":null},{"url":"/paper/image-captioning-through-image-transformer","slug":"image-captioning-through-image-transformer","title":"Image Captioning through Image Transformer","date":"2020-04-29","arxiv_id":"2004.14231","repositories_listed":2,"syntology":null},{"url":"/paper/x-linear-attention-networks-for-image","slug":"x-linear-attention-networks-for-image","title":"X-Linear Attention Networks for Image Captioning","date":"2020-03-31","arxiv_id":"2003.14080","repositories_listed":2,"syntology":null},{"url":"/paper/egoshots-an-ego-vision-life-logging-dataset","slug":"egoshots-an-ego-vision-life-logging-dataset","title":"Egoshots, an ego-vision life-logging dataset and semantic fidelity metric to evaluate diversity in image captioning models","date":"2020-03-26","arxiv_id":"2003.11743","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/egoshots-an-ego-vision-life-logging-dataset#ran","syntology_url":"https://syntology.ai/paper/2003.11743","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2003.11743"}},"official":{"repos":["NataliaDiaz/Egoshots","Pranav21091996/Semantic_Fidelity-and-Egoshots"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/analysis-of-diversity-accuracy-tradeoff-in","slug":"analysis-of-diversity-accuracy-tradeoff-in","title":"Analysis of diversity-accuracy tradeoff in image captioning","date":"2020-02-27","arxiv_id":"2002.11848","repositories_listed":2,"syntology":null},{"url":"/paper/in-defense-of-grid-features-for-visual","slug":"in-defense-of-grid-features-for-visual","title":"In Defense of Grid Features for Visual Question Answering","date":"2020-01-10","arxiv_id":"2001.03615","repositories_listed":2,"syntology":null},{"url":"/paper/explicit-sparse-transformer-concentrated","slug":"explicit-sparse-transformer-concentrated","title":"Explicit Sparse Transformer: Concentrated Attention Through Explicit Selection","date":"2019-12-25","arxiv_id":"1912.11637","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_constructed":1,"n_ran_checked":0,"n_instrument":3,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":3,"phrase":"3 ran (of which 1 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/explicit-sparse-transformer-concentrated#ran","syntology_url":"https://syntology.ai/paper/1912.11637","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1912.11637"}},"official":{"repos":["lancopku/Explicit-Sparse-Transformer"],"state":"official: no sample here; runs from other or unrecorded repositories","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["unlocated"]}}},{"url":"/paper/m2-meshed-memory-transformer-for-image","slug":"m2-meshed-memory-transformer-for-image","title":"Meshed-Memory Transformer for Image Captioning","date":"2019-12-17","arxiv_id":"1912.08226","repositories_listed":2,"syntology":{"n":8,"n_ran":8,"n_constructed":0,"n_ran_checked":6,"n_instrument":2,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":5,"n_pointer_only":3,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 1 honoured, 0 violated, 5 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/m2-meshed-memory-transformer-for-image#ran","syntology_url":"https://syntology.ai/paper/1912.08226","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1912.08226"}},"official":{"repos":["aimagelab/meshed-memory-transformer"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/191013321","slug":"191013321","title":"Semantic Object Accuracy for Generative Text-to-Image Synthesis","date":"2019-10-29","arxiv_id":"1910.13321","repositories_listed":2,"syntology":{"n":23,"n_ran":18,"n_constructed":0,"n_ran_checked":14,"n_instrument":4,"n_unverified":5,"n_honours":0,"n_violates":0,"n_no_contract":14,"n_pointer_only":1,"phrase":"18 ran (of which 0 constructed an object rather than computing a result; 14 with no instrument failure: 0 honoured, 0 violated, 14 with no contract checked; 4 where Syntology's instrument failed) · 5 unverified","sample_list":"/paper/191013321#ran","syntology_url":"https://syntology.ai/paper/1910.13321","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.13321"}},"official":{"repos":["tohinz/semantic-object-accuracy-for-generative-text-to-image-synthesis"],"state":"official (archive's flag): 9 ran","n_ran":9,"n_constructed":0,"n_ran_no_instrument_failure":9,"n_unverified":4,"ran_from_kinds":["listed","official"]}}},{"url":"/paper/omninet-a-unified-architecture-for-multi","slug":"omninet-a-unified-architecture-for-multi","title":"OmniNet: A unified architecture for multi-modal multi-task learning","date":"2019-07-17","arxiv_id":"1907.07804","repositories_listed":2,"syntology":null},{"url":"/paper/aesthetic-attributes-assessment-of-images","slug":"aesthetic-attributes-assessment-of-images","title":"Aesthetic Attributes Assessment of Images","date":"2019-07-11","arxiv_id":"1907.04983","repositories_listed":2,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/aesthetic-attributes-assessment-of-images#ran","syntology_url":"https://syntology.ai/paper/1907.04983","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1907.04983"}},"official":{"repos":["BestiVictory/DPC-Captions"],"state":"official: not harvested","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":[]}}},{"url":"/paper/190600283","slug":"190600283","title":"Learning to Generate Grounded Visual Captions without Localization Supervision","date":"2019-06-01","arxiv_id":"1906.00283","repositories_listed":2,"syntology":null},{"url":"/paper/190513302","slug":"190513302","title":"A Survey on Biomedical Image Captioning","date":"2019-05-26","arxiv_id":"1905.13302","repositories_listed":2,"syntology":null},{"url":"/paper/comic-towards-a-compact-image-captioning","slug":"comic-towards-a-compact-image-captioning","title":"COMIC: Towards A Compact Image Captioning Model with Attention","date":"2019-03-04","arxiv_id":"1903.01072","repositories_listed":2,"syntology":null},{"url":"/paper/nocaps-novel-object-captioning-at-scale","slug":"nocaps-novel-object-captioning-at-scale","title":"nocaps: novel object captioning at scale","date":"2018-12-20","arxiv_id":"1812.08658","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/nocaps-novel-object-captioning-at-scale#ran","syntology_url":"https://syntology.ai/paper/1812.08658","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1812.08658"}},"official":{"repos":["nocaps-org/updown-baseline"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/auto-encoding-scene-graphs-for-image","slug":"auto-encoding-scene-graphs-for-image","title":"Auto-Encoding Scene Graphs for Image Captioning","date":"2018-12-06","arxiv_id":"1812.02378","repositories_listed":2,"syntology":null},{"url":"/paper/hard-non-monotonic-attention-for-character","slug":"hard-non-monotonic-attention-for-character","title":"Hard Non-Monotonic Attention for Character-Level Transduction","date":"2018-08-29","arxiv_id":"1808.10024","repositories_listed":2,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/hard-non-monotonic-attention-for-character#ran","syntology_url":"https://syntology.ai/paper/1808.10024","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1808.10024"}},"official":{"repos":["shijie-wu/neural-transducer"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/conceptual-captions-a-cleaned-hypernymed","slug":"conceptual-captions-a-cleaned-hypernymed","title":"Conceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image Captioning","date":"2018-07-01","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/alphax-exploring-neural-architectures-with","slug":"alphax-exploring-neural-architectures-with","title":"Neural Architecture Search using Deep Neural Networks and Monte Carlo Tree Search","date":"2018-05-18","arxiv_id":"1805.07440","repositories_listed":2,"syntology":null},{"url":"/paper/no-metrics-are-perfect-adversarial-reward","slug":"no-metrics-are-perfect-adversarial-reward","title":"No Metrics Are Perfect: Adversarial Reward Learning for Visual Storytelling","date":"2018-04-24","arxiv_id":"1804.09160","repositories_listed":2,"syntology":{"n":8,"n_ran":4,"n_constructed":0,"n_ran_checked":3,"n_instrument":1,"n_unverified":4,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":1,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 4 unverified","sample_list":"/paper/no-metrics-are-perfect-adversarial-reward#ran","syntology_url":"https://syntology.ai/paper/1804.09160","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1804.09160"}},"official":{"repos":["littlekobe/AREL"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":4,"ran_from_kinds":["official"]}}},{"url":"/paper/women-also-snowboard-overcoming-bias-in-1","slug":"women-also-snowboard-overcoming-bias-in-1","title":"Women also Snowboard: Overcoming Bias in Captioning Models","date":"2018-03-26","arxiv_id":"1803.09797","repositories_listed":2,"syntology":null},{"url":"/paper/attacking-visual-language-grounding-with","slug":"attacking-visual-language-grounding-with","title":"Attacking Visual Language Grounding with Adversarial Examples: A Case Study on Neural Image Captioning","date":"2017-12-06","arxiv_id":"1712.02051","repositories_listed":2,"syntology":null},{"url":"/paper/attention-based-models-for-text-dependent","slug":"attention-based-models-for-text-dependent","title":"Attention-Based Models for Text-Dependent Speaker Verification","date":"2017-10-28","arxiv_id":"1710.10470","repositories_listed":2,"syntology":null},{"url":"/paper/cnn-fixations-an-unraveling-approach-to","slug":"cnn-fixations-an-unraveling-approach-to","title":"CNN Fixations: An unraveling approach to visualize the discriminative image regions","date":"2017-08-22","arxiv_id":"1708.06670","repositories_listed":2,"syntology":null},{"url":"/paper/paying-attention-to-descriptions-generated-by","slug":"paying-attention-to-descriptions-generated-by","title":"Paying Attention to Descriptions Generated by Image Captioning Models","date":"2017-04-24","arxiv_id":"1704.07434","repositories_listed":2,"syntology":null},{"url":"/paper/attend-to-you-personalized-image-captioning","slug":"attend-to-you-personalized-image-captioning","title":"Attend to You: Personalized Image Captioning with Context Sequence Memory Networks","date":"2017-04-21","arxiv_id":"1704.06485","repositories_listed":2,"syntology":null},{"url":"/paper/neural-extractive-summarization-with-side","slug":"neural-extractive-summarization-with-side","title":"Neural Extractive Summarization with Side Information","date":"2017-04-14","arxiv_id":"1704.04530","repositories_listed":2,"syntology":null},{"url":"/paper/an-empirical-study-of-language-cnn-for-image","slug":"an-empirical-study-of-language-cnn-for-image","title":"An Empirical Study of Language CNN for Image Captioning","date":"2016-12-21","arxiv_id":"1612.07086","repositories_listed":2,"syntology":null},{"url":"/paper/improved-image-captioning-via-policy-gradient","slug":"improved-image-captioning-via-policy-gradient","title":"Improved Image Captioning via Policy Gradient optimization of SPIDEr","date":"2016-12-01","arxiv_id":"1612.00370","repositories_listed":2,"syntology":null},{"url":"/paper/grad-cam-why-did-you-say-that","slug":"grad-cam-why-did-you-say-that","title":"Grad-CAM: Why did you say that?","date":"2016-11-22","arxiv_id":"1611.07450","repositories_listed":2,"syntology":null},{"url":"/paper/sca-cnn-spatial-and-channel-wise-attention-in","slug":"sca-cnn-spatial-and-channel-wise-attention-in","title":"SCA-CNN: Spatial and Channel-wise Attention in Convolutional Networks for Image Captioning","date":"2016-11-17","arxiv_id":"1611.05594","repositories_listed":2,"syntology":null},{"url":"/paper/can-active-memory-replace-attention","slug":"can-active-memory-replace-attention","title":"Can Active Memory Replace Attention?","date":"2016-10-27","arxiv_id":"1610.08613","repositories_listed":2,"syntology":null},{"url":"/paper/generating-natural-questions-about-an-image","slug":"generating-natural-questions-about-an-image","title":"Generating Natural Questions About an Image","date":"2016-03-19","arxiv_id":"1603.06059","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/generating-natural-questions-about-an-image#ran","syntology_url":"https://syntology.ai/paper/1603.06059","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1603.06059"}},"official":null}},{"url":"/paper/video-captioning-with-recurrent-networks","slug":"video-captioning-with-recurrent-networks","title":"Video captioning with recurrent networks based on frame- and video-level features and visual content classification","date":"2015-12-09","arxiv_id":"1512.02949","repositories_listed":2,"syntology":null},{"url":"/paper/order-embeddings-of-images-and-language","slug":"order-embeddings-of-images-and-language","title":"Order-Embeddings of Images and Language","date":"2015-11-19","arxiv_id":"1511.06361","repositories_listed":2,"syntology":null},{"url":"/paper/deep-captioning-with-multimodal-recurrent","slug":"deep-captioning-with-multimodal-recurrent","title":"Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)","date":"2014-12-20","arxiv_id":"1412.6632","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/deep-captioning-with-multimodal-recurrent#ran","syntology_url":"https://syntology.ai/paper/1412.6632","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1412.6632"}},"official":{"repos":["mjhucla/mRNN-CR"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["listed"]}}},{"url":"/paper/vicrit-a-verifiable-reinforcement-learning","slug":"vicrit-a-verifiable-reinforcement-learning","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","date":"2025-06-11","arxiv_id":"2506.10128","repositories_listed":1,"syntology":null},{"url":"/paper/vision-matters-simple-visual-perturbations","slug":"vision-matters-simple-visual-perturbations","title":"Vision Matters: Simple Visual Perturbations Can Boost Multimodal Math Reasoning","date":"2025-06-11","arxiv_id":"2506.09736","repositories_listed":1,"syntology":null},{"url":"/paper/dense-retrievers-can-fail-on-simple-queries","slug":"dense-retrievers-can-fail-on-simple-queries","title":"Dense Retrievers Can Fail on Simple Queries: Revealing The Granularity Dilemma of Embeddings","date":"2025-06-10","arxiv_id":"2506.08592","repositories_listed":1,"syntology":null},{"url":"/paper/discovla-discrepancy-reduction-in-vision-1","slug":"discovla-discrepancy-reduction-in-vision-1","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","date":"2025-06-10","arxiv_id":"2506.08887","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":1,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 1 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/discovla-discrepancy-reduction-in-vision-1#ran","syntology_url":"https://syntology.ai/paper/2506.08887","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2506.08887"}},"official":{"repos":["lunarshen/dsicovla"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":1,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/stepwise-decomposition-and-dual-stream-focus","slug":"stepwise-decomposition-and-dual-stream-focus","title":"Stepwise Decomposition and Dual-stream Focus: A Novel Approach for Training-free Camouflaged Object Segmentation","date":"2025-06-07","arxiv_id":"2506.06818","repositories_listed":1,"syntology":null},{"url":"/paper/cldtracker-a-comprehensive-language","slug":"cldtracker-a-comprehensive-language","title":"CLDTracker: A Comprehensive Language Description for Visual Tracking","date":"2025-05-29","arxiv_id":"2505.23704","repositories_listed":1,"syntology":null},{"url":"/paper/document-level-text-generation-with-minimum","slug":"document-level-text-generation-with-minimum","title":"Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal Transport","date":"2025-05-29","arxiv_id":"2505.23078","repositories_listed":1,"syntology":null},{"url":"/paper/puzzled-by-puzzles-when-vision-language","slug":"puzzled-by-puzzles-when-vision-language","title":"Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint","date":"2025-05-29","arxiv_id":"2505.23759","repositories_listed":1,"syntology":null},{"url":"/paper/correlating-instruction-tuning-in-multimodal","slug":"correlating-instruction-tuning-in-multimodal","title":"Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)","date":"2025-05-26","arxiv_id":"2505.20029","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/correlating-instruction-tuning-in-multimodal#ran","syntology_url":"https://syntology.ai/paper/2505.20029","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.20029"}},"official":{"repos":["subbareddy248/mllm_instruction_brain"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/satori-r1-incentivizing-multimodal-reasoning","slug":"satori-r1-incentivizing-multimodal-reasoning","title":"SATORI-R1: Incentivizing Multimodal Reasoning with Spatial Grounding and Verifiable Rewards","date":"2025-05-25","arxiv_id":"2505.19094","repositories_listed":1,"syntology":null},{"url":"/paper/scaling-up-biomedical-vision-language-models","slug":"scaling-up-biomedical-vision-language-models","title":"Scaling Up Biomedical Vision-Language Models: Fine-Tuning, Instruction Tuning, and Multi-Modal Learning","date":"2025-05-23","arxiv_id":"2505.17436","repositories_listed":1,"syntology":null},{"url":"/paper/scenir-visual-semantic-clarity-through","slug":"scenir-visual-semantic-clarity-through","title":"SCENIR: Visual Semantic Clarity through Unsupervised Scene Graph Retrieval","date":"2025-05-21","arxiv_id":"2505.15867","repositories_listed":1,"syntology":null},{"url":"/paper/ravenea-a-benchmark-for-multimodal-retrieval","slug":"ravenea-a-benchmark-for-multimodal-retrieval","title":"RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding","date":"2025-05-20","arxiv_id":"2505.14462","repositories_listed":1,"syntology":null},{"url":"/paper/2505-11326","slug":"2505-11326","title":"Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models","date":"2025-05-16","arxiv_id":"2505.11326","repositories_listed":1,"syntology":null},{"url":"/paper/micarvlmoe-a-modern-gated-cross-aligned","slug":"micarvlmoe-a-modern-gated-cross-aligned","title":"MicarVLMoE: A Modern Gated Cross-Aligned Vision-Language Mixture of Experts Model for Medical Image Captioning and Report Generation","date":"2025-04-29","arxiv_id":"2504.20343","repositories_listed":1,"syntology":null},{"url":"/paper/are-vision-llms-road-ready-a-comprehensive","slug":"are-vision-llms-road-ready-a-comprehensive","title":"Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding","date":"2025-04-20","arxiv_id":"2504.14526","repositories_listed":1,"syntology":null},{"url":"/paper/silvar-med-a-speech-driven-visual-language","slug":"silvar-med-a-speech-driven-visual-language","title":"SilVar-Med: A Speech-Driven Visual Language Model for Explainable Abnormality Detection in Medical Imaging","date":"2025-04-14","arxiv_id":"2504.10642","repositories_listed":1,"syntology":null},{"url":"/paper/a-survey-on-efficient-vision-language-models","slug":"a-survey-on-efficient-vision-language-models","title":"A Survey on Efficient Vision-Language Models","date":"2025-04-13","arxiv_id":"2504.09724","repositories_listed":1,"syntology":null},{"url":"/paper/omnicaptioner-one-captioner-to-rule-them-all","slug":"omnicaptioner-one-captioner-to-rule-them-all","title":"OmniCaptioner: One Captioner to Rule Them All","date":"2025-04-09","arxiv_id":"2504.07089","repositories_listed":1,"syntology":null},{"url":"/paper/unified-multimodal-discrete-diffusion","slug":"unified-multimodal-discrete-diffusion","title":"Unified Multimodal Discrete Diffusion","date":"2025-03-26","arxiv_id":"2503.20853","repositories_listed":1,"syntology":null},{"url":"/paper/mind-the-gap-benchmarking-spatial-reasoning","slug":"mind-the-gap-benchmarking-spatial-reasoning","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","date":"2025-03-25","arxiv_id":"2503.19707","repositories_listed":1,"syntology":{"n":7,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":0,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/mind-the-gap-benchmarking-spatial-reasoning#ran","syntology_url":"https://syntology.ai/paper/2503.19707","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2503.19707"}},"official":{"repos":["stogiannidis/srbench"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/unicrossadapter-multimodal-adaptation-of-clip","slug":"unicrossadapter-multimodal-adaptation-of-clip","title":"UniCrossAdapter: Multimodal Adaptation of CLIP for Radiology Report Generation","date":"2025-03-20","arxiv_id":"2503.15940","repositories_listed":1,"syntology":null},{"url":"/paper/disentangling-fine-tuning-from-pre-training","slug":"disentangling-fine-tuning-from-pre-training","title":"Disentangling Fine-Tuning from Pre-Training in Visual Captioning with Hybrid Markov Logic","date":"2025-03-18","arxiv_id":"2503.13847","repositories_listed":1,"syntology":null},{"url":"/paper/image-captioning-evaluation-in-the-age-of","slug":"image-captioning-evaluation-in-the-age-of","title":"Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives","date":"2025-03-18","arxiv_id":"2503.14604","repositories_listed":1,"syntology":null},{"url":"/paper/towards-self-improving-systematic-cognition","slug":"towards-self-improving-systematic-cognition","title":"Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition","date":"2025-03-16","arxiv_id":"2503.12303","repositories_listed":1,"syntology":null},{"url":"/paper/falcon-a-remote-sensing-vision-language","slug":"falcon-a-remote-sensing-vision-language","title":"Falcon: A Remote Sensing Vision-Language Foundation Model","date":"2025-03-14","arxiv_id":"2503.11070","repositories_listed":1,"syntology":null},{"url":"/paper/rona-pragmatically-diverse-image-captioning","slug":"rona-pragmatically-diverse-image-captioning","title":"RONA: Pragmatically Diverse Image Captioning with Coherence Relations","date":"2025-03-14","arxiv_id":"2503.10997","repositories_listed":1,"syntology":null},{"url":"/paper/treble-counterfactual-vlms-a-causal-approach","slug":"treble-counterfactual-vlms-a-causal-approach","title":"Treble Counterfactual VLMs: A Causal Approach to Hallucination","date":"2025-03-08","arxiv_id":"2503.06169","repositories_listed":1,"syntology":null},{"url":"/paper/keeping-yourself-is-important-in-downstream","slug":"keeping-yourself-is-important-in-downstream","title":"Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model","date":"2025-03-06","arxiv_id":"2503.04543","repositories_listed":1,"syntology":null},{"url":"/paper/weakly-supervised-video-scene-graph","slug":"weakly-supervised-video-scene-graph","title":"Weakly Supervised Video Scene Graph Generation via Natural Language Supervision","date":"2025-02-21","arxiv_id":"2502.15370","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":1,"n_no_contract":0,"n_pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 1 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/weakly-supervised-video-scene-graph#ran","syntology_url":"https://syntology.ai/paper/2502.15370","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2502.15370"}},"official":{"repos":["rlqja1107/NL-VSGG"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/pretrained-image-text-models-are-secretly","slug":"pretrained-image-text-models-are-secretly","title":"Pretrained Image-Text Models are Secretly Video Captioners","date":"2025-02-19","arxiv_id":"2502.13363","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":5,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/pretrained-image-text-models-are-secretly#ran","syntology_url":"https://syntology.ai/paper/2502.13363","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2502.13363"}},"official":{"repos":["chunhuizng/mllm-video-captioner"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/gaia-a-global-multi-modal-multi-scale-vision","slug":"gaia-a-global-multi-modal-multi-scale-vision","title":"GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis","date":"2025-02-13","arxiv_id":"2502.09598","repositories_listed":1,"syntology":null},{"url":"/paper/evaluation-of-multilingual-image-captioning","slug":"evaluation-of-multilingual-image-captioning","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","date":"2025-02-10","arxiv_id":"2502.06600","repositories_listed":1,"syntology":null},{"url":"/paper/temporal-working-memory-query-guided-segment","slug":"temporal-working-memory-query-guided-segment","title":"Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding","date":"2025-02-09","arxiv_id":"2502.06020","repositories_listed":1,"syntology":null},{"url":"/paper/texlidar-automated-text-understanding-for","slug":"texlidar-automated-text-understanding-for","title":"TexLiDAR: Automated Text Understanding for Panoramic LiDAR Data","date":"2025-02-05","arxiv_id":"2502.04385","repositories_listed":1,"syntology":null},{"url":"/paper/robust-llava-on-the-effectiveness-of-large","slug":"robust-llava-on-the-effectiveness-of-large","title":"Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models","date":"2025-02-03","arxiv_id":"2502.01576","repositories_listed":1,"syntology":null},{"url":"/paper/large-vision-language-models-for-knowledge","slug":"large-vision-language-models-for-knowledge","title":"Large Vision-Language Models for Knowledge-Grounded Data Annotation of Memes","date":"2025-01-23","arxiv_id":"2501.13851","repositories_listed":1,"syntology":null},{"url":"/paper/text-driven-adaptation-of-foundation-models","slug":"text-driven-adaptation-of-foundation-models","title":"Text-driven Adaptation of Foundation Models for Few-shot Surgical Workflow Analysis","date":"2025-01-16","arxiv_id":"2501.09555","repositories_listed":1,"syntology":null},{"url":"/paper/radalign-advancing-radiology-report","slug":"radalign-advancing-radiology-report","title":"RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment","date":"2025-01-13","arxiv_id":"2501.07525","repositories_listed":1,"syntology":null},{"url":"/paper/valley2-exploring-multimodal-models-with","slug":"valley2-exploring-multimodal-models-with","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","date":"2025-01-10","arxiv_id":"2501.05901","repositories_listed":1,"syntology":{"n":8,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":1,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/valley2-exploring-multimodal-models-with#ran","syntology_url":"https://syntology.ai/paper/2501.05901","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2501.05901"}},"official":{"repos":["bytedance/valley"],"state":"official (archive's flag): 7 ran","n_ran":7,"n_constructed":0,"n_ran_no_instrument_failure":7,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/decoding-fmri-data-into-captions-using-prefix","slug":"decoding-fmri-data-into-captions-using-prefix","title":"Decoding fMRI Data into Captions using Prefix Language Modeling","date":"2025-01-05","arxiv_id":"2501.02570","repositories_listed":1,"syntology":null}],"record_sha256":"8eef97e1785204575e203b7a7638cfd2c13ad01ee77de3191500784ac1436ad1","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}