{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/image-captioning/papers/12","list_of":"/task/image-captioning","task":"Image Captioning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":12,"pages_in_order":19,"rows_per_page":100,"rows":[1101,1200],"of":1878,"counts":{"archive_papers_tagged":1878,"with_a_code_link":774,"where_syntology_ran_a_sample":243,"not_listed_spam_title":0,"listed":1878,"listed_where_code_ran":243,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":201,"every_run_a_failure_of_syntologys_instrument":42,"listed_with_a_run_with_no_instrument_failure":201,"listed_every_run_a_failure_of_syntologys_instrument":42,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/image-captioning","prev":"/task/image-captioning/papers/11","next":"/task/image-captioning/papers/13","papers":[{"url":null,"slug":"module-wise-adaptive-distillation-for","title":"Module-wise Adaptive Distillation for Multimodality Foundation Models","date":"2023-10-06","arxiv_id":"2310.04550","repositories_listed":0,"syntology":null},{"url":"/paper/icocap-improving-video-captioning-by","slug":"icocap-improving-video-captioning-by","title":"IcoCap: Improving Video Captioning by Compounding Images","date":"2023-10-05","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-performance-of-multimodal-language","title":"On the Performance of Multimodal Language Models","date":"2023-10-04","arxiv_id":"2310.03211","repositories_listed":0,"syntology":null},{"url":null,"slug":"small-visual-language-models-can-also-be-open","title":"Self-Supervised Open-Ended Classification with Small Visual Language Models","date":"2023-09-30","arxiv_id":"2310.00500","repositories_listed":0,"syntology":null},{"url":null,"slug":"targeted-image-data-augmentation-increases","title":"Targeted Image Data Augmentation Increases Basic Skills Captioning Robustness","date":"2023-09-27","arxiv_id":"2309.15991","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-large-multimodal-models-with","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","date":"2023-09-25","arxiv_id":"2309.14525","repositories_listed":0,"syntology":null},{"url":null,"slug":"faceatt-enhancing-image-captioning-with","title":"FaceGemma: Enhancing Image Captioning with Facial Attributes for Portrait Images","date":"2023-09-24","arxiv_id":"2309.13601","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-emotion-estimation-from-image","title":"Contextual Emotion Estimation from Image Captions","date":"2023-09-22","arxiv_id":"2309.13136","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-scale-dataset-for-audio-language","title":"Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning","date":"2023-09-20","arxiv_id":"2309.11500","repositories_listed":0,"syntology":null},{"url":null,"slug":"prefix-diffusion-a-lightweight-diffusion","title":"Prefix-diffusion: A Lightweight Diffusion Model for Diverse Image Captioning","date":"2023-09-10","arxiv_id":"2309.04965","repositories_listed":0,"syntology":null},{"url":null,"slug":"nice-2023-zero-shot-image-captioning","title":"NICE: CVPR 2023 Challenge on Zero-shot Image Captioning","date":"2023-09-05","arxiv_id":"2309.01961","repositories_listed":0,"syntology":null},{"url":null,"slug":"physically-grounded-vision-language-models","title":"Physically Grounded Vision-Language Models for Robotic Manipulation","date":"2023-09-05","arxiv_id":"2309.02561","repositories_listed":0,"syntology":null},{"url":null,"slug":"rsdiff-remote-sensing-image-generation-from","title":"RSDiff: Remote Sensing Image Generation from Text Using Diffusion Model","date":"2023-09-03","arxiv_id":"2309.02455","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-prompt-learning-benefit-radiology-report","title":"Can Prompt Learning Benefit Radiology Report Generation?","date":"2023-08-30","arxiv_id":"2308.16269","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-aware-anatomical-tokens-for-chest-x","title":"Finding-Aware Anatomical Tokens for Chest X-Ray Automated Reporting","date":"2023-08-30","arxiv_id":"2308.15961","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-real-time-egocentric-segment","title":"Towards Real Time Egocentric Segment Captioning for The Blind and Visually Impaired in RGB-D Theatre Images","date":"2023-08-26","arxiv_id":"2308.13892","repositories_listed":0,"syntology":null},{"url":null,"slug":"dlip-distilling-language-image-pre-training","title":"DLIP: Distilling Language-Image Pre-training","date":"2023-08-24","arxiv_id":"2308.12956","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-and-tell-embodied-visual-captioning","title":"Explore and Tell: Embodied Visual Captioning in 3D Environments","date":"2023-08-21","arxiv_id":"2308.10447","repositories_listed":0,"syntology":null},{"url":null,"slug":"generic-attention-model-explainability-by","title":"Generic Attention-model Explainability by Weighted Relevance Accumulation","date":"2023-08-20","arxiv_id":"2308.10240","repositories_listed":0,"syntology":null},{"url":null,"slug":"unibrain-unify-image-reconstruction-and","title":"UniBrain: Unify Image Reconstruction and Captioning All in One Diffusion Model from Human Brain Activity","date":"2023-08-14","arxiv_id":"2308.07428","repositories_listed":0,"syntology":null},{"url":null,"slug":"iiht-medical-report-generation-with-image-to","title":"IIHT: Medical Report Generation with Image-to-Indicator Hierarchical Transformer","date":"2023-08-10","arxiv_id":"2308.05633","repositories_listed":0,"syntology":null},{"url":null,"slug":"informative-scene-graph-generation-via","title":"Informative Scene Graph Generation via Debiasing","date":"2023-08-10","arxiv_id":"2308.05286","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-evolution-of-deep-neural-network","title":"Asynchronous Evolution of Deep Neural Network Architectures","date":"2023-08-08","arxiv_id":"2308.04102","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-safe-and-reliable-ai-systems-for","title":"Building Safe and Reliable AI systems for Safety Critical Tasks with Vision-Language Processing","date":"2023-08-06","arxiv_id":"2308.03176","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comprehensive-analysis-of-real-world-image","title":"A Comprehensive Analysis of Real-World Image Captioning and Scene Identification","date":"2023-08-05","arxiv_id":"2308.02833","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-image-captioning","title":"Improving Generalization of Image Captioning with Unsupervised Prompt Learning","date":"2023-08-05","arxiv_id":"2308.02862","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-neurons-in-pretrained-text-only","title":"Multimodal Neurons in Pretrained Text-Only Transformers","date":"2023-08-03","arxiv_id":"2308.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"guiding-image-captioning-models-toward-more","title":"Guiding Image Captioning Models Toward More Specific Captions","date":"2023-07-31","arxiv_id":"2307.16686","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-captioning-at-will-describing-images","title":"Visual Captioning at Will: Describing Images and Videos Guided by a Few Stylized Sentences","date":"2023-07-31","arxiv_id":"2307.16399","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-reasoning-in-typical-computer-vision","title":"Causal reasoning in typical computer vision tasks","date":"2023-07-26","arxiv_id":"2307.13992","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-image-captioning-with-depth","title":"Enhancing image captioning with depth information using a Transformer-based framework","date":"2023-07-24","arxiv_id":"2308.03767","repositories_listed":0,"syntology":null},{"url":null,"slug":"oxfordtvg-hic-can-machine-make-humorous","title":"OxfordTVG-HIC: Can Machine Make Humorous Captions from Images?","date":"2023-07-21","arxiv_id":"2307.11636","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedded-heterogeneous-attention-transformer","title":"Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning","date":"2023-07-19","arxiv_id":"2307.09915","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-multimodal-datasets-with-image","title":"Improving Multimodal Datasets with Image Captioning","date":"2023-07-19","arxiv_id":"2307.10350","repositories_listed":0,"syntology":null},{"url":null,"slug":"aic-ab-net-a-neural-network-for-image","title":"AIC-AB NET: A Neural Network for Image Captioning with Spatial Attention and Text Attributes","date":"2023-07-14","arxiv_id":"2307.07370","repositories_listed":0,"syntology":null},{"url":null,"slug":"reading-radiology-imaging-like-the","title":"Reading Radiology Imaging Like The Radiologist","date":"2023-07-12","arxiv_id":"2307.05921","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-prompt-learning-for-product-title","title":"Multimodal Prompt Learning for Product Title Generation with Extremely Limited Labels","date":"2023-07-05","arxiv_id":"2307.01969","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-for-less-compact-convolutional","title":"More for Less: Compact Convolutional Transformers Enable Robust Medical Image Classification with Limited Data","date":"2023-07-01","arxiv_id":"2307.00213","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenges-of-zero-shot-recognition-with","title":"Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity","date":"2023-06-28","arxiv_id":"2306.16048","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-image-captioning-with-clip","title":"Self-Supervised Image Captioning with CLIP","date":"2023-06-26","arxiv_id":"2306.15111","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-reference-based-distinctive-image","title":"Improving Reference-based Distinctive Image Captioning with Contrastive Rewards","date":"2023-06-25","arxiv_id":"2306.14259","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-image-captioning-descriptiveness-by","title":"Improving Image Captioning Descriptiveness by Ranking and LLM-based Fusion","date":"2023-06-20","arxiv_id":"2306.11593","repositories_listed":0,"syntology":null},{"url":null,"slug":"generation-of-radiology-findings-in-chest-x","title":"Generation of Radiology Findings in Chest X-Ray by Leveraging Collaborative Knowledge","date":"2023-06-18","arxiv_id":"2306.10448","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-vision-language-pre-training-from","title":"A Survey of Vision-Language Pre-training from the Lens of Multimodal Machine Translation","date":"2023-06-12","arxiv_id":"2306.07198","repositories_listed":0,"syntology":null},{"url":null,"slug":"putting-humans-in-the-image-captioning-loop","title":"Putting Humans in the Image Captioning Loop","date":"2023-06-06","arxiv_id":"2306.03476","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-adaptable-and-interactive-image","title":"Towards Adaptable and Interactive Image Captioning with Data Augmentation and Episodic Memory","date":"2023-06-06","arxiv_id":"2306.03500","repositories_listed":0,"syntology":null},{"url":null,"slug":"cheap-fake-detection-with-llm-using-prompt","title":"Cheap-fake Detection with LLM using Prompt Engineering","date":"2023-06-05","arxiv_id":"2306.02776","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-s-not-quote-out-of-context-unified-vision","title":"\"Let's not Quote out of Context\": Unified Vision-Language Pretraining for Context Assisted Image Captioning","date":"2023-06-01","arxiv_id":"2306.00931","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-only-image-captioning-with-multi-context","title":"Image Captioning with Multi-Context Synthetic Data","date":"2023-05-29","arxiv_id":"2305.18072","repositories_listed":0,"syntology":null},{"url":null,"slug":"green-runner-a-tool-for-efficient-model","title":"Green Runner: A tool for efficient model selection from model repositories","date":"2023-05-26","arxiv_id":"2305.16849","repositories_listed":0,"syntology":null},{"url":null,"slug":"mindstorms-in-natural-language-based","title":"Mindstorms in Natural Language-Based Societies of Mind","date":"2023-05-26","arxiv_id":"2305.17066","repositories_listed":0,"syntology":null},{"url":null,"slug":"haav-hierarchical-aggregation-of-augmented-1","title":"HAAV: Hierarchical Aggregation of Augmented Views for Image Captioning","date":"2023-05-25","arxiv_id":"2305.16295","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodiedgpt-vision-language-pre-training-via","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","date":"2023-05-24","arxiv_id":"2305.15021","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-grounding-issues-in-image","title":"Exploring Affordance and Situated Meaning in Image Captions: A Multimodal Analysis","date":"2023-05-24","arxiv_id":"2305.14616","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-conditional-alt-text-generation-for","title":"Alt-Text with Context: Improving Accessibility for Images on Twitter","date":"2023-05-24","arxiv_id":"2305.14779","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-based-person-search-without-parallel","title":"Text-based Person Search without Parallel Image-Text Data","date":"2023-05-22","arxiv_id":"2305.12964","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross2stra-unpaired-cross-lingual-image","title":"Cross2StrA: Unpaired Cross-lingual Image Captioning with Cross-lingual Cross-modal Structure-pivoted Alignment","date":"2023-05-20","arxiv_id":"2305.12260","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffcap-exploring-continuous-diffusion-on","title":"DiffCap: Exploring Continuous Diffusion on Image Captioning","date":"2023-05-20","arxiv_id":"2305.12144","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-composition-in-visually-grounded","title":"Semantic Composition in Visually Grounded Language Models","date":"2023-05-15","arxiv_id":"2305.16328","repositories_listed":0,"syntology":null},{"url":"/paper/simple-token-level-confidence-improves","slug":"simple-token-level-confidence-improves","title":"Simple Token-Level Confidence Improves Caption Correctness","date":"2023-05-11","arxiv_id":"2305.07021","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-l-system-captioning-for-tree","title":"Towards L-System Captioning for Tree Reconstruction","date":"2023-05-10","arxiv_id":"2305.06483","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-pseudo-image-captions-for","title":"Exploiting Pseudo Image Captions for Multimodal Summarization","date":"2023-05-09","arxiv_id":"2305.05496","repositories_listed":0,"syntology":null},{"url":null,"slug":"uit-openviic-a-novel-benchmark-for-evaluating","title":"UIT-OpenViIC: A Novel Benchmark for Evaluating Image Captioning in Vietnamese","date":"2023-05-07","arxiv_id":"2305.04166","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioners-sometimes-tell-more-than","title":"Image Captioners Sometimes Tell More Than Images They See","date":"2023-05-04","arxiv_id":"2305.02932","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-in-ai-systems-mitigating-gender-bias","title":"Fairness in AI Systems: Mitigating gender bias from language-vision models","date":"2023-05-03","arxiv_id":"2305.01888","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-the-most-of-what-you-have-adapting-pre","title":"Making the Most of What You Have: Adapting Pre-trained Visual Language Models in the Low-data Regime","date":"2023-05-03","arxiv_id":"2305.02297","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-agnostic-image-captioning-to-safely","title":"Quality-agnostic Image Captioning to Safely Assist People with Vision Impairment","date":"2023-04-28","arxiv_id":"2304.14623","repositories_listed":0,"syntology":null},{"url":"/paper/learning-human-human-interactions-in-images","slug":"learning-human-human-interactions-in-images","title":"Learning Human-Human Interactions in Images from Weak Textual Supervision","date":"2023-04-27","arxiv_id":"2304.14104","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cap-anticipation-captioning-with","title":"A-CAP: Anticipation Captioning with Commonsense Knowledge","date":"2023-04-13","arxiv_id":"2304.06602","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-medical-imaging-with-language","title":"Advancing Medical Imaging with Language Models: A Journey from N-grams to ChatGPT","date":"2023-04-11","arxiv_id":"2304.04920","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-cross-task-transferability-of","title":"Boosting Cross-task Transferability of Adversarial Patches with Visual Relations","date":"2023-04-11","arxiv_id":"2304.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"imagecaptioner-2-image-captioner-for-image","title":"ImageCaptioner$^2$: Image Captioner for Image Captioning Bias Amplification Assessment","date":"2023-04-10","arxiv_id":"2304.04874","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-self-explainability-of-deep-neural","title":"Towards Self-Explainability of Deep Neural Networks with Heatmap Captioning and Large-Language Models","date":"2023-04-05","arxiv_id":"2304.02202","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-accurate-self-supervised","title":"Scalable and Accurate Self-supervised Multimodal Representation Learning without Aligned Video and Text Data","date":"2023-04-04","arxiv_id":"2304.02080","repositories_listed":0,"syntology":null},{"url":null,"slug":"mask-free-ovis-open-vocabulary-instance","title":"Mask-free OVIS: Open-Vocabulary Instance Segmentation without Manual Mask Annotations","date":"2023-03-29","arxiv_id":"2303.16891","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-distribution-learning-for","title":"Variational Distribution Learning for Unsupervised Text-to-Image Generation","date":"2023-03-28","arxiv_id":"2303.16105","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-vocabulary-object-detection-using-pseudo","title":"Open-Vocabulary Object Detection using Pseudo Caption Labels","date":"2023-03-23","arxiv_id":"2303.13040","repositories_listed":0,"syntology":null},{"url":null,"slug":"sketch2saliency-learning-to-detect-salient","title":"Sketch2Saliency: Learning to Detect Salient Objects from Human Drawings","date":"2023-03-20","arxiv_id":"2303.11502","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-reward-for-visual-relationships","title":"Multi-modal reward for visual relationships-based image captioning","date":"2023-03-19","arxiv_id":"2303.10766","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-information-matters-for-asr-error","title":"Visual Information Matters for ASR Error Correction","date":"2023-03-16","arxiv_id":"2303.10160","repositories_listed":0,"syntology":null},{"url":null,"slug":"pr-mcs-perturbation-robust-metric-for","title":"PR-MCS: Perturbation Robust Metric for MultiLingual Image Captioning","date":"2023-03-15","arxiv_id":"2303.08389","repositories_listed":0,"syntology":null},{"url":"/paper/breaking-common-sense-whoops-a-vision-and","slug":"breaking-common-sense-whoops-a-vision-and","title":"Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images","date":"2023-03-13","arxiv_id":"2303.07274","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-combinatorial-prompts-for-universal","title":"Learning Combinatorial Prompts for Universal Controllable Image Captioning","date":"2023-03-11","arxiv_id":"2303.06338","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-visual-question-answering","title":"Interpretable Visual Question Answering Referring to Outside Knowledge","date":"2023-03-08","arxiv_id":"2303.04388","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-networks-in-vision-language","title":"Graph Neural Networks in Vision-Language Image Understanding: A Survey","date":"2023-03-07","arxiv_id":"2303.03761","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-study-of-transformer-and-lstm","title":"Comparative study of Transformer and LSTM Network with attention mechanism on Image Captioning","date":"2023-03-05","arxiv_id":"2303.02648","repositories_listed":0,"syntology":null},{"url":null,"slug":"see-your-heart-psychological-states","title":"See Your Heart: Psychological states Interpretation through Visual Creations","date":"2023-02-11","arxiv_id":"2302.10276","repositories_listed":0,"syntology":null},{"url":null,"slug":"nemesis-neural-mean-teacher-learning-based","title":"Nemesis: Neural Mean Teacher Learning-Based Emotion-Centric Speaker","date":"2023-02-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"re-vilm-retrieval-augmented-visual-language","title":"Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning","date":"2023-02-09","arxiv_id":"2302.04858","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-cross-modal-feature-consolidation","title":"Stacked Cross-modal Feature Consolidation Attention Networks for Image Captioning","date":"2023-02-08","arxiv_id":"2302.04676","repositories_listed":0,"syntology":null},{"url":null,"slug":"kengic-keyword-driven-and-n-gram-graph-based","title":"KENGIC: KEyword-driven and N-Gram Graph based Image Captioning","date":"2023-02-07","arxiv_id":"2302.03729","repositories_listed":0,"syntology":null},{"url":null,"slug":"device-depth-and-visual-concepts-aware","title":"DEVICE: DEpth and VIsual ConcEpts Aware Transformer for TextCaps","date":"2023-02-03","arxiv_id":"2302.01540","repositories_listed":0,"syntology":null},{"url":null,"slug":"promptmix-text-to-image-diffusion-models","title":"PromptMix: Text-to-image diffusion models enhance the performance of lightweight networks","date":"2023-01-30","arxiv_id":"2301.12914","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-external-knowledge-for-accurate","title":"Exploring External Knowledge for Accurate modeling of Visual and Language Problems","date":"2023-01-27","arxiv_id":"2302.08901","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-image-captioning-by","title":"Semi-Supervised Image Captioning by Adversarially Propagating Labeled Data","date":"2023-01-26","arxiv_id":"2301.11174","repositories_listed":0,"syntology":null},{"url":null,"slug":"style-aware-contrastive-learning-for-multi","title":"Style-Aware Contrastive Learning for Multi-Style Image Captioning","date":"2023-01-26","arxiv_id":"2301.11367","repositories_listed":0,"syntology":null},{"url":null,"slug":"summarize-the-past-to-predict-the-future","title":"Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction Anticipation","date":"2023-01-22","arxiv_id":"2301.09209","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-models-that-can-see-and-read","title":"Towards Models that Can See and Read","date":"2023-01-18","arxiv_id":"2301.07389","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodied-agents-for-efficient-exploration-and","title":"Embodied Agents for Efficient Exploration and Smart Scene Description","date":"2023-01-17","arxiv_id":"2301.07150","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-image-captioning-algorithm-based-on-the","title":"An Image captioning algorithm based on the Hybrid Deep Learning Technique (CNN+GRU)","date":"2023-01-06","arxiv_id":"2301.02440","repositories_listed":0,"syntology":null}],"record_sha256":"ed414c067679f8ad4d6e028abb9d44fe33bd98e04bc93b60c7b856ec4e2dfb63","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}