{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/caption-generation/papers/2","list_of":"/task/caption-generation","task":"Caption Generation","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":4,"rows_per_page":100,"rows":[101,200],"of":310,"counts":{"archive_papers_tagged":310,"with_a_code_link":119,"where_syntology_ran_a_sample":33,"not_listed_spam_title":0,"listed":310,"listed_where_code_ran":33,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":29,"every_run_a_failure_of_syntologys_instrument":4,"listed_with_a_run_with_no_instrument_failure":29,"listed_every_run_a_failure_of_syntologys_instrument":4,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/caption-generation","prev":"/task/caption-generation","next":"/task/caption-generation/papers/3","papers":[{"url":"/paper/image-caption-generation-for-news-articles","slug":"image-caption-generation-for-news-articles","title":"Image Caption Generation for News Articles","date":"2020-12-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/efficient-urdu-caption-generation-using","slug":"efficient-urdu-caption-generation-using","title":"Efficient Urdu Caption Generation using Attention based LSTM","date":"2020-08-02","arxiv_id":"2008.01663","repositories_listed":1,"syntology":null},{"url":"/paper/evaluating-and-interpreting-caption","slug":"evaluating-and-interpreting-caption","title":"Evaluating and interpreting caption prediction for histopathology images","date":"2020-07-08","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/improving-image-captioning-with-better-use-of-1","slug":"improving-image-captioning-with-better-use-of-1","title":"Improving Image Captioning with Better Use of Captions","date":"2020-06-21","arxiv_id":"2006.11807","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":2,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/improving-image-captioning-with-better-use-of-1#ran","syntology_url":"https://syntology.ai/paper/2006.11807","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2006.11807"}},"official":{"repos":["Gitsamshi/WeakVRD-Captioning"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/say-as-you-wish-fine-grained-control-of-image","slug":"say-as-you-wish-fine-grained-control-of-image","title":"Say As You Wish: Fine-grained Control of Image Caption Generation with Abstract Scene Graphs","date":"2020-03-01","arxiv_id":"2003.00387","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":0,"n_instrument":3,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/say-as-you-wish-fine-grained-control-of-image#ran","syntology_url":"https://syntology.ai/paper/2003.00387","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2003.00387"}},"official":null}},{"url":"/paper/memeify-a-large-scale-meme-generation-system","slug":"memeify-a-large-scale-meme-generation-system","title":"Memeify: A Large-Scale Meme Generation System","date":"2019-10-27","arxiv_id":"1910.12279","repositories_listed":1,"syntology":null},{"url":"/paper/referring-expression-object-segmentation-with","slug":"referring-expression-object-segmentation-with","title":"Referring Expression Object Segmentation with Caption-Aware Consistency","date":"2019-10-10","arxiv_id":"1910.04748","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/referring-expression-object-segmentation-with#ran","syntology_url":"https://syntology.ai/paper/1910.04748","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1910.04748"}},"official":{"repos":["wenz116/lang2seg"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/compositional-generalization-in-image","slug":"compositional-generalization-in-image","title":"Compositional Generalization in Image Captioning","date":"2019-09-10","arxiv_id":"1909.04402","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":3,"n_instrument":1,"n_unverified":0,"n_honours":3,"n_violates":0,"n_no_contract":0,"n_pointer_only":4,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 3 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/compositional-generalization-in-image#ran","syntology_url":"https://syntology.ai/paper/1909.04402","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1909.04402"}},"official":{"repos":["mitjanikolaus/compositional-image-captioning"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/controllable-video-captioning-with-pos","slug":"controllable-video-captioning-with-pos","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","date":"2019-08-27","arxiv_id":"1908.10072","repositories_listed":1,"syntology":null},{"url":"/paper/bivariate-beta-lstm","slug":"bivariate-beta-lstm","title":"Bivariate Beta-LSTM","date":"2019-05-25","arxiv_id":"1905.10521","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/bivariate-beta-lstm#ran","syntology_url":"https://syntology.ai/paper/1905.10521","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1905.10521"}},"official":{"repos":["gtshs2/BetaLSTM"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/multi-source-weak-supervision-for-saliency","slug":"multi-source-weak-supervision-for-saliency","title":"Multi-source weak supervision for saliency detection","date":"2019-04-01","arxiv_id":"1904.00566","repositories_listed":1,"syntology":null},{"url":"/paper/pre-gen-metrics-predicting-caption-quality","slug":"pre-gen-metrics-predicting-caption-quality","title":"Pre-gen metrics: Predicting caption quality metrics without generating captions","date":"2018-10-12","arxiv_id":"1810.05474","repositories_listed":1,"syntology":null},{"url":"/paper/regularizing-rnns-for-caption-generation-by","slug":"regularizing-rnns-for-caption-generation-by","title":"Regularizing RNNs for Caption Generation by Reconstructing The Past with The Present","date":"2018-03-30","arxiv_id":"1803.11439","repositories_listed":1,"syntology":null},{"url":"/paper/discriminability-objective-for-training","slug":"discriminability-objective-for-training","title":"Discriminability objective for training descriptive captions","date":"2018-03-12","arxiv_id":"1803.04376","repositories_listed":1,"syntology":null},{"url":"/paper/using-artificial-tokens-to-control-languages","slug":"using-artificial-tokens-to-control-languages","title":"Using Artificial Tokens to Control Languages for Multilingual Image Caption Generation","date":"2017-06-20","arxiv_id":"1706.06275","repositories_listed":1,"syntology":null},{"url":"/paper/frame-and-segment-level-features-and","slug":"frame-and-segment-level-features-and","title":"Frame- and Segment-Level Features and Candidate Pool Evaluation for Video Caption Generation","date":"2016-08-17","arxiv_id":"1608.04959","repositories_listed":1,"syntology":null},{"url":"/paper/deepdiary-automatic-caption-generation-for","slug":"deepdiary-automatic-caption-generation-for","title":"DeepDiary: Automatic Caption Generation for Lifelogging Image Streams","date":"2016-08-12","arxiv_id":"1608.03819","repositories_listed":1,"syntology":null},{"url":"/paper/image-captioning-with-deep-bidirectional","slug":"image-captioning-with-deep-bidirectional","title":"Image Captioning with Deep Bidirectional LSTMs","date":"2016-04-04","arxiv_id":"1604.00790","repositories_listed":1,"syntology":null},{"url":"/paper/guiding-long-short-term-memory-for-image","slug":"guiding-long-short-term-memory-for-image","title":"Guiding Long-Short Term Memory for Image Caption Generation","date":"2015-09-16","arxiv_id":"1509.04942","repositories_listed":1,"syntology":null},{"url":null,"slug":"gnn-vitcap-gnn-enhanced-multiple-instance","title":"GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning","date":"2025-07-09","arxiv_id":"2507.07006","repositories_listed":0,"syntology":null},{"url":null,"slug":"editinspector-a-benchmark-for-evaluation-of","title":"EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits","date":"2025-06-11","arxiv_id":"2506.09988","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-transformer-models-for-image","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","date":"2025-06-03","arxiv_id":"2506.05399","repositories_listed":0,"syntology":null},{"url":null,"slug":"next-multi-grained-mixture-of-experts-via","title":"NEXT: Multi-Grained Mixture of Experts via Text-Modulation for Multi-Modal Object Re-ID","date":"2025-05-26","arxiv_id":"2505.20001","repositories_listed":0,"syntology":null},{"url":null,"slug":"gc-kbvqa-a-new-four-stage-framework-for","title":"GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance","date":"2025-05-25","arxiv_id":"2505.19354","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-object-captioning-for-street-scene","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","date":"2025-05-22","arxiv_id":"2505.16594","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-modeling-meets-remote-sensing","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","date":"2025-05-20","arxiv_id":"2505.14361","repositories_listed":0,"syntology":null},{"url":null,"slug":"timesoccer-an-end-to-end-multimodal-large","title":"TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation","date":"2025-04-24","arxiv_id":"2504.17365","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-hallucination-synthetic-captions-for","title":"Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training","date":"2025-04-17","arxiv_id":"2504.13123","repositories_listed":0,"syntology":null},{"url":null,"slug":"group-based-distinctive-image-captioning-with-1","title":"Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention","date":"2025-04-03","arxiv_id":"2504.02496","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-multi-modal-knowledge-neurons-in","title":"Identifying Multi-modal Knowledge Neurons in Pretrained Transformers via Two-stage Filtering","date":"2025-03-29","arxiv_id":"2503.22941","repositories_listed":0,"syntology":null},{"url":null,"slug":"lapig-cross-modal-generation-of-paired","title":"LaPIG: Cross-Modal Generation of Paired Thermal and Visible Facial Images","date":"2025-03-20","arxiv_id":"2503.16376","repositories_listed":0,"syntology":null},{"url":null,"slug":"idea-inverted-text-with-cooperative","title":"IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification","date":"2025-03-13","arxiv_id":"2503.10324","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-frequency-domain-representations","title":"Integrating Frequency-Domain Representations with Low-Rank Adaptation in Vision-Language Models","date":"2025-03-08","arxiv_id":"2503.06003","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-video-captioning-through-scene","title":"Fine-Grained Video Captioning through Scene Graph Consolidation","date":"2025-02-23","arxiv_id":"2502.16427","repositories_listed":0,"syntology":null},{"url":null,"slug":"longcaptioning-unlocking-the-power-of-long","title":"LongCaptioning: Unlocking the Power of Long Caption Generation in Large Multimodal Models","date":"2025-02-21","arxiv_id":"2502.15393","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-chest-x-ray-classification-through","title":"Enhancing Chest X-ray Classification through Knowledge Injection in Cross-Modality Learning","date":"2025-02-19","arxiv_id":"2502.13447","repositories_listed":0,"syntology":null},{"url":null,"slug":"fe-lws-refined-image-text-representations-via","title":"FE-LWS: Refined Image-Text Representations via Decoder Stacking and Fused Encodings for Remote Sensing Image Captioning","date":"2025-02-13","arxiv_id":"2502.09282","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-large-multimodal-models-solve-caption","title":"Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SCICAP Challenge 2023","date":"2025-01-31","arxiv_id":"2501.19353","repositories_listed":0,"syntology":null},{"url":null,"slug":"mams-model-agnostic-module-selection","title":"MAMS: Model-Agnostic Module Selection Framework for Video Captioning","date":"2025-01-30","arxiv_id":"2501.18269","repositories_listed":0,"syntology":null},{"url":null,"slug":"measuring-and-mitigating-hallucinations-in","title":"Measuring and Mitigating Hallucinations in Vision-Language Dataset Generation for Remote Sensing","date":"2025-01-24","arxiv_id":"2501.14905","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-how-paper-writers-use-ai","title":"Understanding How Paper Writers Use AI-Generated Captions in Figure Caption Writing","date":"2025-01-10","arxiv_id":"2501.06317","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-series-language-model-for-descriptive","title":"Time Series Language Model for Descriptive Caption Generation","date":"2025-01-03","arxiv_id":"2501.01832","repositories_listed":0,"syntology":null},{"url":null,"slug":"unleashing-text-to-image-diffusion-prior-for","title":"Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning","date":"2024-12-31","arxiv_id":"2501.00437","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-massive-human-videos-for","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","date":"2024-12-18","arxiv_id":"2412.14172","repositories_listed":0,"syntology":null},{"url":null,"slug":"dir-retrieval-augmented-image-captioning-with","title":"DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding","date":"2024-12-02","arxiv_id":"2412.01115","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-multimodal-models-for-ukrainian","title":"Benchmarking Multimodal Models for Ukrainian Language Understanding Across Academic and Cultural Domains","date":"2024-11-22","arxiv_id":"2411.14647","repositories_listed":0,"syntology":null},{"url":null,"slug":"everything-is-a-video-unifying-modalities","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","date":"2024-11-15","arxiv_id":"2411.10503","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounded-video-caption-generation","title":"Grounded Video Caption Generation","date":"2024-11-12","arxiv_id":"2411.07584","repositories_listed":0,"syntology":null},{"url":null,"slug":"gem-vpc-a-dual-graph-enhanced-multimodal","title":"GEM-VPC: A dual Graph-Enhanced Multimodal integration for Video Paragraph Captioning","date":"2024-10-12","arxiv_id":"2410.09377","repositories_listed":0,"syntology":null},{"url":null,"slug":"ezaudio-enhancing-text-to-audio-generation","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer","date":"2024-09-17","arxiv_id":"2409.10819","repositories_listed":0,"syntology":null},{"url":null,"slug":"covla-comprehensive-vision-language-action","title":"CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving","date":"2024-08-19","arxiv_id":"2408.10845","repositories_listed":0,"syntology":null},{"url":"/paper/see-it-all-contextualized-late-aggregation","slug":"see-it-all-contextualized-late-aggregation","title":"See It All: Contextualized Late Aggregation for 3D Dense Captioning","date":"2024-08-14","arxiv_id":"2408.07648","repositories_listed":0,"syntology":null},{"url":"/paper/bi-directional-contextual-attention-for-3d","slug":"bi-directional-contextual-attention-for-3d","title":"Bi-directional Contextual Attention for 3D Dense Captioning","date":"2024-08-13","arxiv_id":"2408.06662","repositories_listed":0,"syntology":null},{"url":null,"slug":"xmecap-meme-caption-generation-with-sub-image","title":"XMeCap: Meme Caption Generation with Sub-Image Adaptability","date":"2024-07-24","arxiv_id":"2407.17152","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-image-captioning-using-cnn-cnn","title":"Explainable Image Captioning using CNN- CNN architecture and Hierarchical Attention","date":"2024-06-28","arxiv_id":"2407.09556","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-object-grounding-really-reduce","title":"Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?","date":"2024-06-20","arxiv_id":"2406.14492","repositories_listed":0,"syntology":null},{"url":null,"slug":"ds-biomed-at-imageclefmedical-caption-2024","title":"DS@BioMed at ImageCLEFmedical Caption 2024: Enhanced Attention Mechanisms in Medical Caption Generation through Concept Detection Integration","date":"2024-06-01","arxiv_id":"2406.00391","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-generative-embedding-model","title":"Multi-Modal Generative Embedding Model","date":"2024-05-29","arxiv_id":"2405.19333","repositories_listed":0,"syntology":null},{"url":null,"slug":"feedback-aligned-mixed-llms-for-machine","title":"Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation","date":"2024-05-22","arxiv_id":"2405.13984","repositories_listed":0,"syntology":null},{"url":null,"slug":"micap-a-unified-model-for-identity-aware","title":"MICap: A Unified Model for Identity-aware Movie Descriptions","date":"2024-05-19","arxiv_id":"2405.11483","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-fact-checker-enabling-high-fidelity","title":"Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation","date":"2024-04-30","arxiv_id":"2404.19752","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-solution-for-the-iccv-2023-1st-scientific","title":"The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge","date":"2024-03-26","arxiv_id":"2403.17342","repositories_listed":0,"syntology":null},{"url":null,"slug":"luojiahog-a-hierarchy-oriented-geo-aware","title":"LuoJiaHOG: A Hierarchy Oriented Geo-aware Image Caption Dataset for Remote Sensing Image-Text Retrival","date":"2024-03-16","arxiv_id":"2403.10887","repositories_listed":0,"syntology":null},{"url":null,"slug":"pathm3-a-multimodal-multi-task-multiple","title":"PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning","date":"2024-03-13","arxiv_id":"2403.08967","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-image-caption-generation-using","title":"Enhancing Image Caption Generation Using Reinforcement Learning with Human Feedback","date":"2024-03-11","arxiv_id":"2403.06735","repositories_listed":0,"syntology":null},{"url":null,"slug":"llms-in-political-science-heralding-a-new-era","title":"LLMs in Political Science: Heralding a New Era of Visual Analysis","date":"2024-02-29","arxiv_id":"2403.00154","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-large-multi-modal-models-with","title":"Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation","date":"2024-01-18","arxiv_id":"2401.10005","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-media-ready-caption-generation-for","title":"Social Media Ready Caption Generation for Brands","date":"2024-01-03","arxiv_id":"2401.01637","repositories_listed":0,"syntology":null},{"url":null,"slug":"bev-clip-multi-modal-bev-retrieval","title":"BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving","date":"2024-01-02","arxiv_id":"2401.01065","repositories_listed":0,"syntology":null},{"url":null,"slug":"set-prediction-guided-by-semantic-concepts","title":"Set Prediction Guided by Semantic Concepts for Diverse Video Captioning","date":"2023-12-25","arxiv_id":"2312.15720","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-image-captioning-with-neural-models","title":"Enhancing Image Captioning with Neural Models","date":"2023-12-01","arxiv_id":"2312.00435","repositories_listed":0,"syntology":null},{"url":null,"slug":"ig-captioner-information-gain-captioners-are","title":"IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers","date":"2023-11-27","arxiv_id":"2311.17072","repositories_listed":0,"syntology":null},{"url":null,"slug":"decap-towards-generalized-explicit-caption","title":"DECap: Towards Generalized Explicit Caption Editing via Diffusion Mechanism","date":"2023-11-25","arxiv_id":"2311.14920","repositories_listed":0,"syntology":null},{"url":null,"slug":"dense-video-captioning-a-survey-of-techniques","title":"Dense Video Captioning: A Survey of Techniques, Datasets and Evaluation Protocols","date":"2023-11-05","arxiv_id":"2311.02538","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-analytics-for-efficient-image","title":"Visual Analytics for Efficient Image Exploration and User-Guided Image Captioning","date":"2023-11-02","arxiv_id":"2311.01016","repositories_listed":0,"syntology":null},{"url":null,"slug":"lohoravens-a-long-horizon-language","title":"LoHoRavens: A Long-Horizon Language-Conditioned Benchmark for Robotic Tabletop Manipulation","date":"2023-10-18","arxiv_id":"2310.12020","repositories_listed":0,"syntology":null},{"url":null,"slug":"bill-vtg-bridging-large-language-models-and","title":"VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools","date":"2023-10-16","arxiv_id":"2310.10586","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-pre-trained-cnns-and","title":"A Comparative Study of Pre-trained CNNs and GRU-Based Attention for Image Caption Generation","date":"2023-10-11","arxiv_id":"2310.07252","repositories_listed":0,"syntology":null},{"url":null,"slug":"faceatt-enhancing-image-captioning-with","title":"FaceGemma: Enhancing Image Captioning with Facial Attributes for Portrait Images","date":"2023-09-24","arxiv_id":"2309.13601","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-scale-dataset-for-audio-language","title":"Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning","date":"2023-09-20","arxiv_id":"2309.11500","repositories_listed":0,"syntology":null},{"url":null,"slug":"vico-engaging-video-comment-generation-with","title":"ViCo: Engaging Video Comment Generation with Human Preference Rewards","date":"2023-08-22","arxiv_id":"2308.11171","repositories_listed":0,"syntology":null},{"url":null,"slug":"aic-ab-net-a-neural-network-for-image","title":"AIC-AB NET: A Neural Network for Image Captioning with Spatial Attention and Text Attributes","date":"2023-07-14","arxiv_id":"2307.07370","repositories_listed":0,"syntology":null},{"url":"/paper/multi-similarity-contrastive-learning","slug":"multi-similarity-contrastive-learning","title":"Multi-Similarity Contrastive Learning","date":"2023-07-06","arxiv_id":"2307.02712","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-distillation-for-efficient-audio","title":"Knowledge Distillation for Efficient Audio-Visual Video Captioning","date":"2023-06-16","arxiv_id":"2306.09947","repositories_listed":0,"syntology":null},{"url":null,"slug":"captext-large-language-model-based-caption","title":"CapText: Large Language Model-based Caption Generation From Image Context and Description","date":"2023-06-01","arxiv_id":"2306.00301","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-text-to-image-diffusion-models-with","title":"RealignDiff: Boosting Text-to-Image Diffusion Model with Coarse-to-fine Semantic Re-alignment","date":"2023-05-31","arxiv_id":"2305.19599","repositories_listed":0,"syntology":null},{"url":null,"slug":"haav-hierarchical-aggregation-of-augmented-1","title":"HAAV: Hierarchical Aggregation of Augmented Views for Image Captioning","date":"2023-05-25","arxiv_id":"2305.16295","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffcap-exploring-continuous-diffusion-on","title":"DiffCap: Exploring Continuous Diffusion on Image Captioning","date":"2023-05-20","arxiv_id":"2305.12144","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-audio-captioning-transformer-with","title":"Efficient Audio Captioning Transformer with Patchout and Text Guidance","date":"2023-04-06","arxiv_id":"2304.02916","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-encoder-for-zero-fine-tuning-image","title":"Taming Encoder for Zero Fine-tuning Image Customization with Text-to-Image Diffusion Models","date":"2023-04-05","arxiv_id":"2304.02642","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-reward-for-visual-relationships","title":"Multi-modal reward for visual relationships-based image captioning","date":"2023-03-19","arxiv_id":"2303.10766","repositories_listed":0,"syntology":null},{"url":null,"slug":"gnnformer-a-graph-based-framework-for","title":"GNNFormer: A Graph-based Framework for Cytopathology Report Generation","date":"2023-03-17","arxiv_id":"2303.09956","repositories_listed":0,"syntology":null},{"url":null,"slug":"summaries-as-captions-generating-figure","title":"Summaries as Captions: Generating Figure Captions for Scientific Documents with Automated Text Summarization","date":"2023-02-23","arxiv_id":"2302.12324","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-cross-modal-feature-consolidation","title":"Stacked Cross-modal Feature Consolidation Attention Networks for Image Captioning","date":"2023-02-08","arxiv_id":"2302.04676","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-image-captioning","title":"Uncertainty-Aware Image Captioning","date":"2022-11-30","arxiv_id":"2211.16769","repositories_listed":0,"syntology":null},{"url":"/paper/retrieval-augmented-multimodal-language","slug":"retrieval-augmented-multimodal-language","title":"Retrieval-Augmented Multimodal Language Modeling","date":"2022-11-22","arxiv_id":"2211.12561","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-caption-generation-for-low-resource","title":"Image Caption Generation for Low-Resource Assamese Language","date":"2022-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-image-captions-with-external","title":"Generating image captions with external encyclopedic knowledge","date":"2022-10-10","arxiv_id":"2210.04806","repositories_listed":0,"syntology":null},{"url":null,"slug":"rest-retrieve-self-train-for-generative","title":"REST: REtrieve & Self-Train for generative action recognition","date":"2022-09-29","arxiv_id":"2209.15000","repositories_listed":0,"syntology":null},{"url":null,"slug":"medical-image-captioning-via-generative","title":"Medical Image Captioning via Generative Pretrained Transformers","date":"2022-09-28","arxiv_id":"2209.13983","repositories_listed":0,"syntology":null}],"record_sha256":"7ab54f46f20cf30489b04410e6e1519367e39ecc66981b99822440458be3d4bb","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}