{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/visual-question-answering-1/papers/8","list_of":"/task/visual-question-answering-1","task":"Visual Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":8,"pages_in_order":22,"rows_per_page":100,"rows":[701,800],"of":2177,"counts":{"archive_papers_tagged":2177,"with_a_code_link":1042,"where_syntology_ran_a_sample":378,"not_listed_spam_title":0,"listed":2177,"listed_where_code_ran":378,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":308,"every_run_a_failure_of_syntologys_instrument":70,"listed_with_a_run_with_no_instrument_failure":308,"listed_every_run_a_failure_of_syntologys_instrument":70,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/visual-question-answering-1","prev":"/task/visual-question-answering-1/papers/7","next":"/task/visual-question-answering-1/papers/9","papers":[{"url":"/paper/vnhsge-vietnamese-high-school-graduation","slug":"vnhsge-vietnamese-high-school-graduation","title":"VNHSGE: VietNamese High School Graduation Examination Dataset for Large Language Models","date":"2023-05-20","arxiv_id":"2305.12199","repositories_listed":1,"syntology":null},{"url":"/paper/what-makes-for-good-visual-tokenizers-for","slug":"what-makes-for-good-visual-tokenizers-for","title":"What Makes for Good Visual Tokenizers for Large Language Models?","date":"2023-05-20","arxiv_id":"2305.12223","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":1,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/what-makes-for-good-visual-tokenizers-for#ran","syntology_url":"https://syntology.ai/paper/2305.12223","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2305.12223"}},"official":{"repos":["tencentarc/gvt"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/enhancing-vision-language-pre-training-with","slug":"enhancing-vision-language-pre-training-with","title":"Enhancing Vision-Language Pre-Training with Jointly Learned Questioner and Dense Captioner","date":"2023-05-19","arxiv_id":"2305.11769","repositories_listed":1,"syntology":null},{"url":"/paper/medblip-bootstrapping-language-image-pre","slug":"medblip-bootstrapping-language-image-pre","title":"MedBLIP: Bootstrapping Language-Image Pre-training from 3D Medical Images and Texts","date":"2023-05-18","arxiv_id":"2305.10799","repositories_listed":1,"syntology":null},{"url":"/paper/imad-image-augmented-multi-modal-dialogue","slug":"imad-image-augmented-multi-modal-dialogue","title":"IMAD: IMage-Augmented multi-modal Dialogue","date":"2023-05-17","arxiv_id":"2305.10512","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/imad-image-augmented-multi-modal-dialogue#ran","syntology_url":"https://syntology.ai/paper/2305.10512","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2305.10512"}},"official":{"repos":["vityavitalich/imad"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/what-you-see-is-what-you-read-improving-text-1","slug":"what-you-see-is-what-you-read-improving-text-1","title":"What You See is What You Read? Improving Text-Image Alignment Evaluation","date":"2023-05-17","arxiv_id":"2305.10400","repositories_listed":1,"syntology":null},{"url":"/paper/on-the-hidden-mystery-of-ocr-in-large","slug":"on-the-hidden-mystery-of-ocr-in-large","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","date":"2023-05-13","arxiv_id":"2305.07895","repositories_listed":1,"syntology":null},{"url":"/paper/combo-of-thinking-and-observing-for-outside","slug":"combo-of-thinking-and-observing-for-outside","title":"Combo of Thinking and Observing for Outside-Knowledge VQA","date":"2023-05-10","arxiv_id":"2305.06407","repositories_listed":1,"syntology":null},{"url":"/paper/openvivqa-task-dataset-and-multimodal-fusion","slug":"openvivqa-task-dataset-and-multimodal-fusion","title":"OpenViVQA: Task, Dataset, and Multimodal Fusion Models for Visual Question Answering in Vietnamese","date":"2023-05-07","arxiv_id":"2305.04183","repositories_listed":1,"syntology":null},{"url":"/paper/adaptive-loose-optimization-for-robust","slug":"adaptive-loose-optimization-for-robust","title":"Adaptive loose optimization for robust question answering","date":"2023-05-06","arxiv_id":"2305.03971","repositories_listed":1,"syntology":null},{"url":"/paper/otter-a-multi-modal-model-with-in-context","slug":"otter-a-multi-modal-model-with-in-context","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","date":"2023-05-05","arxiv_id":"2305.03726","repositories_listed":1,"syntology":null},{"url":"/paper/a-symmetric-dual-encoding-dense-retrieval","slug":"a-symmetric-dual-encoding-dense-retrieval","title":"A Symmetric Dual Encoding Dense Retrieval Framework for Knowledge-Intensive Visual Question Answering","date":"2023-04-26","arxiv_id":"2304.13649","repositories_listed":1,"syntology":null},{"url":"/paper/towards-medical-artificial-general","slug":"towards-medical-artificial-general","title":"Towards Medical Artificial General Intelligence via Knowledge-Enhanced Multimodal Pretraining","date":"2023-04-26","arxiv_id":"2304.14204","repositories_listed":1,"syntology":null},{"url":"/paper/surgicalgpt-end-to-end-language-vision-gpt","slug":"surgicalgpt-end-to-end-language-vision-gpt","title":"SurgicalGPT: End-to-End Language-Vision GPT for Visual Question Answering in Surgery","date":"2023-04-19","arxiv_id":"2304.09974","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/surgicalgpt-end-to-end-language-vision-gpt#ran","syntology_url":"https://syntology.ai/paper/2304.09974","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2304.09974"}},"official":{"repos":["lalithjets/surgicalgpt"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/learning-situation-hyper-graphs-for-video","slug":"learning-situation-hyper-graphs-for-video","title":"Learning Situation Hyper-Graphs for Video Question Answering","date":"2023-04-18","arxiv_id":"2304.08682","repositories_listed":1,"syntology":{"n":15,"n_ran":8,"n_constructed":5,"n_ran_checked":8,"n_instrument":0,"n_unverified":7,"n_honours":0,"n_violates":0,"n_no_contract":8,"n_pointer_only":15,"phrase":"8 ran (of which 5 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 7 unverified","sample_list":"/paper/learning-situation-hyper-graphs-for-video#ran","syntology_url":"https://syntology.ai/paper/2304.08682","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2304.08682"}},"official":{"repos":["aurooj/shg-vqa"],"state":"official (archive's flag): 8 ran","n_ran":8,"n_constructed":5,"n_ran_no_instrument_failure":8,"n_unverified":7,"ran_from_kinds":["official"]}}},{"url":"/paper/clip-guided-vision-language-pre-training-for","slug":"clip-guided-vision-language-pre-training-for","title":"CLIP-Guided Vision-Language Pre-training for Question Answering in 3D Scenes","date":"2023-04-12","arxiv_id":"2304.06061","repositories_listed":1,"syntology":null},{"url":"/paper/i2i-initializing-adapters-with-improvised","slug":"i2i-initializing-adapters-with-improvised","title":"I2I: Initializing Adapters with Improvised Knowledge","date":"2023-04-04","arxiv_id":"2304.02168","repositories_listed":1,"syntology":null},{"url":"/paper/a-study-of-autoregressive-decoders-for-multi","slug":"a-study-of-autoregressive-decoders-for-multi","title":"A Study of Autoregressive Decoders for Multi-Tasking in Computer Vision","date":"2023-03-30","arxiv_id":"2303.17376","repositories_listed":1,"syntology":null},{"url":"/paper/mammut-a-simple-architecture-for-joint","slug":"mammut-a-simple-architecture-for-joint","title":"MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks","date":"2023-03-29","arxiv_id":"2303.16839","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_constructed":0,"n_ran_checked":3,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":3,"n_no_contract":0,"n_pointer_only":2,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 3 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/mammut-a-simple-architecture-for-joint#ran","syntology_url":"https://syntology.ai/paper/2303.16839","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.16839"}},"official":null}},{"url":"/paper/integrating-image-features-with-convolutional","slug":"integrating-image-features-with-convolutional","title":"Integrating Image Features with Convolutional Sequence-to-sequence Network for Multilingual Visual Question Answering","date":"2023-03-22","arxiv_id":"2303.12671","repositories_listed":1,"syntology":null},{"url":"/paper/tifa-accurate-and-interpretable-text-to-image","slug":"tifa-accurate-and-interpretable-text-to-image","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","date":"2023-03-21","arxiv_id":"2303.11897","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/tifa-accurate-and-interpretable-text-to-image#ran","syntology_url":"https://syntology.ai/paper/2303.11897","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.11897"}},"official":{"repos":["Yushi-Hu/tifa"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/location-free-scene-graph-generation","slug":"location-free-scene-graph-generation","title":"Location-Free Scene Graph Generation","date":"2023-03-20","arxiv_id":"2303.10944","repositories_listed":1,"syntology":null},{"url":"/paper/mm-react-prompting-chatgpt-for-multimodal","slug":"mm-react-prompting-chatgpt-for-multimodal","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","date":"2023-03-20","arxiv_id":"2303.11381","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/mm-react-prompting-chatgpt-for-multimodal#ran","syntology_url":"https://syntology.ai/paper/2303.11381","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.11381"}},"official":{"repos":["microsoft/MM-REACT"],"state":"official (archive's flag): 4 ran","n_ran":4,"n_constructed":0,"n_ran_no_instrument_failure":4,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/logical-implications-for-visual-question","slug":"logical-implications-for-visual-question","title":"Logical Implications for Visual Question Answering Consistency","date":"2023-03-16","arxiv_id":"2303.09427","repositories_listed":1,"syntology":null},{"url":"/paper/open-ended-medical-visual-question-answering","slug":"open-ended-medical-visual-question-answering","title":"Open-Ended Medical Visual Question Answering Through Prefix Tuning of Language Models","date":"2023-03-10","arxiv_id":"2303.05977","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/open-ended-medical-visual-question-answering#ran","syntology_url":"https://syntology.ai/paper/2303.05977","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.05977"}},"official":{"repos":["tjvsonsbeek/open-ended-medical-vqa"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/vtqa-visual-text-question-answering-via","slug":"vtqa-visual-text-question-answering-via","title":"VTQA: Visual Text Question Answering via Entity Alignment and Cross-Media Reasoning","date":"2023-03-05","arxiv_id":"2303.02635","repositories_listed":1,"syntology":null},{"url":"/paper/prompting-large-language-models-with-answer","slug":"prompting-large-language-models-with-answer","title":"Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering","date":"2023-03-03","arxiv_id":"2303.01903","repositories_listed":1,"syntology":{"n":8,"n_ran":6,"n_constructed":0,"n_ran_checked":6,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":6,"n_pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/prompting-large-language-models-with-answer#ran","syntology_url":"https://syntology.ai/paper/2303.01903","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2303.01903"}},"official":{"repos":["milvlg/prophet"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/contextual-net-a-multimodal-vision-language","slug":"contextual-net-a-multimodal-vision-language","title":"ConTEXTual Net: A Multimodal Vision-Language Model for Segmentation of Pneumothorax","date":"2023-03-02","arxiv_id":"2303.01615","repositories_listed":1,"syntology":null},{"url":"/paper/mixphm-redundancy-aware-parameter-efficient","slug":"mixphm-redundancy-aware-parameter-efficient","title":"MixPHM: Redundancy-Aware Parameter-Efficient Tuning for Low-Resource Visual Question Answering","date":"2023-03-02","arxiv_id":"2303.01239","repositories_listed":1,"syntology":null},{"url":"/paper/ramm-retrieval-augmented-biomedical-visual","slug":"ramm-retrieval-augmented-biomedical-visual","title":"RAMM: Retrieval-augmented Biomedical Visual Question Answering with Multi-modal Pre-training","date":"2023-03-01","arxiv_id":"2303.00534","repositories_listed":1,"syntology":null},{"url":"/paper/language-is-not-all-you-need-aligning-1","slug":"language-is-not-all-you-need-aligning-1","title":"Language Is Not All You Need: Aligning Perception with Language Models","date":"2023-02-27","arxiv_id":"2302.14045","repositories_listed":1,"syntology":null},{"url":"/paper/vinvl-l-enriching-visual-representation-with","slug":"vinvl-l-enriching-visual-representation-with","title":"VinVL+L: Enriching Visual Representation with Location Context in VQA","date":"2023-02-22","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-federated-learning-via-contrastive","slug":"multimodal-federated-learning-via-contrastive","title":"Multimodal Federated Learning via Contrastive Representation Ensemble","date":"2023-02-17","arxiv_id":"2302.08888","repositories_listed":1,"syntology":null},{"url":"/paper/towards-unifying-medical-vision-and-language","slug":"towards-unifying-medical-vision-and-language","title":"Towards Unifying Medical Vision-and-Language Pre-training via Soft Prompts","date":"2023-02-17","arxiv_id":"2302.08958","repositories_listed":1,"syntology":null},{"url":"/paper/differentiable-outlier-detection-enable","slug":"differentiable-outlier-detection-enable","title":"Differentiable Outlier Detection Enable Robust Deep Multimodal Analysis","date":"2023-02-11","arxiv_id":"2302.05608","repositories_listed":1,"syntology":null},{"url":"/paper/is-multi-modal-vision-supervision-beneficial","slug":"is-multi-modal-vision-supervision-beneficial","title":"Is Multimodal Vision Supervision Beneficial to Language?","date":"2023-02-10","arxiv_id":"2302.05016","repositories_listed":1,"syntology":null},{"url":"/paper/language-quantized-autoencoders-towards-1","slug":"language-quantized-autoencoders-towards-1","title":"Language Quantized AutoEncoders: Towards Unsupervised Text-Image Alignment","date":"2023-02-02","arxiv_id":"2302.00902","repositories_listed":1,"syntology":null},{"url":"/paper/multimodality-representation-learning-a","slug":"multimodality-representation-learning-a","title":"Multimodality Representation Learning: A Survey on Evolution, Pretraining and Its Applications","date":"2023-02-01","arxiv_id":"2302.00389","repositories_listed":1,"syntology":null},{"url":"/paper/binaryvqa-a-versatile-test-set-to-evaluate","slug":"binaryvqa-a-versatile-test-set-to-evaluate","title":"BinaryVQA: A Versatile Test Set to Evaluate the Out-of-Distribution Generalization of VQA Models","date":"2023-01-28","arxiv_id":"2301.12032","repositories_listed":1,"syntology":null},{"url":"/paper/champion-solution-for-the-wsdm2023-toloka-vqa","slug":"champion-solution-for-the-wsdm2023-toloka-vqa","title":"Champion Solution for the WSDM2023 Toloka VQA Challenge","date":"2023-01-22","arxiv_id":"2301.09045","repositories_listed":1,"syntology":null},{"url":"/paper/slidevqa-a-dataset-for-document-visual","slug":"slidevqa-a-dataset-for-document-visual","title":"SlideVQA: A Dataset for Document Visual Question Answering on Multiple Images","date":"2023-01-12","arxiv_id":"2301.04883","repositories_listed":1,"syntology":null},{"url":"/paper/multimodal-inverse-cloze-task-for-knowledge","slug":"multimodal-inverse-cloze-task-for-knowledge","title":"Multimodal Inverse Cloze Task for Knowledge-based Visual Question Answering","date":"2023-01-11","arxiv_id":"2301.04366","repositories_listed":1,"syntology":null},{"url":"/paper/adaptively-clustering-neighbor-elements-for","slug":"adaptively-clustering-neighbor-elements-for","title":"Adaptively Clustering Neighbor Elements for Image-Text Generation","date":"2023-01-05","arxiv_id":"2301.01955","repositories_listed":1,"syntology":null},{"url":"/paper/exploring-the-effect-of-primitives-for","slug":"exploring-the-effect-of-primitives-for","title":"Exploring the Effect of Primitives for Compositional Generalization in Vision-and-Language","date":"2023-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/toward-multi-granularity-decision-making","slug":"toward-multi-granularity-decision-making","title":"Toward Multi-Granularity Decision-Making: Explicit Visual Reasoning with Hierarchical Knowledge","date":"2023-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/variational-causal-inference-network-for","slug":"variational-causal-inference-network-for","title":"Variational Causal Inference Network for Explanatory Visual Question Answering","date":"2023-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/vqacl-a-novel-visual-question-answering","slug":"vqacl-a-novel-visual-question-answering","title":"VQACL: A Novel Visual Question Answering Continual Learning Setting","date":"2023-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/matcha-enhancing-visual-language-pretraining","slug":"matcha-enhancing-visual-language-pretraining","title":"MatCha: Enhancing Visual Language Pretraining with Math Reasoning and Chart Derendering","date":"2022-12-19","arxiv_id":"2212.09662","repositories_listed":1,"syntology":null},{"url":"/paper/image-and-language-understanding-from-pixels","slug":"image-and-language-understanding-from-pixels","title":"CLIPPO: Image-and-Language Understanding from Pixels Only","date":"2022-12-15","arxiv_id":"2212.08045","repositories_listed":1,"syntology":null},{"url":"/paper/reveal-retrieval-augmented-visual-language","slug":"reveal-retrieval-augmented-visual-language","title":"REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory","date":"2022-12-10","arxiv_id":"2212.05221","repositories_listed":1,"syntology":null},{"url":"/paper/hierarchical-multimodal-transformers-for","slug":"hierarchical-multimodal-transformers-for","title":"Hierarchical multimodal transformers for Multi-Page DocVQA","date":"2022-12-07","arxiv_id":"2212.05935","repositories_listed":1,"syntology":null},{"url":"/paper/visual-question-answering-from-another-1","slug":"visual-question-answering-from-another-1","title":"Visual Question Answering From Another Perspective: CLEVR Mental Rotation Tests","date":"2022-12-03","arxiv_id":"2212.01639","repositories_listed":1,"syntology":null},{"url":"/paper/seeing-what-you-miss-vision-language-pre","slug":"seeing-what-you-miss-vision-language-pre","title":"Seeing What You Miss: Vision-Language Pre-training with Semantic Completion Learning","date":"2022-11-24","arxiv_id":"2211.13437","repositories_listed":1,"syntology":null},{"url":"/paper/cross-modal-contrastive-learning-for-robust","slug":"cross-modal-contrastive-learning-for-robust","title":"Cross-Modal Contrastive Learning for Robust Reasoning in VQA","date":"2022-11-21","arxiv_id":"2211.11190","repositories_listed":1,"syntology":null},{"url":"/paper/visual-programming-compositional-visual","slug":"visual-programming-compositional-visual","title":"Visual Programming: Compositional visual reasoning without training","date":"2022-11-18","arxiv_id":"2211.11559","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/visual-programming-compositional-visual#ran","syntology_url":"https://syntology.ai/paper/2211.11559","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2211.11559"}},"official":null}},{"url":"/paper/i-can-t-believe-there-s-no-images-learning","slug":"i-can-t-believe-there-s-no-images-learning","title":"I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision","date":"2022-11-17","arxiv_id":"2211.09778","repositories_listed":1,"syntology":{"n":6,"n_ran":6,"n_constructed":0,"n_ran_checked":5,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":5,"n_pointer_only":1,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 5 with no instrument failure: 0 honoured, 0 violated, 5 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/i-can-t-believe-there-s-no-images-learning#ran","syntology_url":"https://syntology.ai/paper/2211.09778","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2211.09778"}},"official":{"repos":["allenai/close"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":5,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/mapqa-a-dataset-for-question-answering-on","slug":"mapqa-a-dataset-for-question-answering-on","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","date":"2022-11-15","arxiv_id":"2211.08545","repositories_listed":1,"syntology":null},{"url":"/paper/promptcap-prompt-guided-task-aware-image","slug":"promptcap-prompt-guided-task-aware-image","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","date":"2022-11-15","arxiv_id":"2211.09699","repositories_listed":1,"syntology":null},{"url":"/paper/visually-grounded-vqa-by-lattice-based","slug":"visually-grounded-vqa-by-lattice-based","title":"Visually Grounded VQA by Lattice-based Retrieval","date":"2022-11-15","arxiv_id":"2211.08086","repositories_listed":1,"syntology":null},{"url":"/paper/visual-named-entity-linking-a-new-dataset-and","slug":"visual-named-entity-linking-a-new-dataset-and","title":"Visual Named Entity Linking: A New Dataset and A Baseline","date":"2022-11-09","arxiv_id":"2211.04872","repositories_listed":1,"syntology":null},{"url":"/paper/compressing-and-debiasing-vision-language-pre","slug":"compressing-and-debiasing-vision-language-pre","title":"Compressing And Debiasing Vision-Language Pre-Trained Models for Visual Question Answering","date":"2022-10-26","arxiv_id":"2210.14558","repositories_listed":1,"syntology":null},{"url":"/paper/what-s-different-between-visual-question","slug":"what-s-different-between-visual-question","title":"What's Different between Visual Question Answering for Machine \"Understanding\" Versus for Accessibility?","date":"2022-10-26","arxiv_id":"2210.14966","repositories_listed":1,"syntology":null},{"url":"/paper/vlc-bert-visual-question-answering-with","slug":"vlc-bert-visual-question-answering-with","title":"VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge","date":"2022-10-24","arxiv_id":"2210.13626","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/vlc-bert-visual-question-answering-with#ran","syntology_url":"https://syntology.ai/paper/2210.13626","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.13626"}},"official":{"repos":["aditya10/vlc-bert"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/rsvg-exploring-data-and-models-for-visual","slug":"rsvg-exploring-data-and-models-for-visual","title":"RSVG: Exploring Data and Models for Visual Grounding on Remote Sensing Data","date":"2022-10-23","arxiv_id":"2210.12634","repositories_listed":1,"syntology":null},{"url":"/paper/posescript-3d-human-poses-from-natural","slug":"posescript-3d-human-poses-from-natural","title":"PoseScript: Linking 3D Human Poses and Natural Language","date":"2022-10-21","arxiv_id":"2210.11795","repositories_listed":1,"syntology":null},{"url":"/paper/vision-language-pre-training-basics-recent","slug":"vision-language-pre-training-basics-recent","title":"Vision-Language Pre-training: Basics, Recent Advances, and Future Trends","date":"2022-10-17","arxiv_id":"2210.09263","repositories_listed":1,"syntology":null},{"url":"/paper/mapl-parameter-efficient-adaptation-of","slug":"mapl-parameter-efficient-adaptation-of","title":"MAPL: Parameter-Efficient Adaptation of Unimodal Pre-Trained Models for Vision-Language Few-Shot Prompting","date":"2022-10-13","arxiv_id":"2210.07179","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":1,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/mapl-parameter-efficient-adaptation-of#ran","syntology_url":"https://syntology.ai/paper/2210.07179","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.07179"}},"official":{"repos":["mair-lab/mapl"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/slotformer-unsupervised-visual-dynamics","slug":"slotformer-unsupervised-visual-dynamics","title":"SlotFormer: Unsupervised Visual Dynamics Simulation with Object-Centric Models","date":"2022-10-12","arxiv_id":"2210.05861","repositories_listed":1,"syntology":null},{"url":"/paper/map-modality-agnostic-uncertainty-aware","slug":"map-modality-agnostic-uncertainty-aware","title":"MAP: Multimodal Uncertainty-Aware Vision-Language Pre-training Model","date":"2022-10-11","arxiv_id":"2210.05335","repositories_listed":1,"syntology":null},{"url":"/paper/language-prior-is-not-the-only-shortcut-a","slug":"language-prior-is-not-the-only-shortcut-a","title":"Language Prior Is Not the Only Shortcut: A Benchmark for Shortcut Learning in VQA","date":"2022-10-10","arxiv_id":"2210.04692","repositories_listed":1,"syntology":null},{"url":"/paper/towards-robust-visual-question-answering","slug":"towards-robust-visual-question-answering","title":"Towards Robust Visual Question Answering: Making the Most of Biased Samples via Contrastive Learning","date":"2022-10-10","arxiv_id":"2210.04563","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":1,"n_no_contract":0,"n_pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 1 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/towards-robust-visual-question-answering#ran","syntology_url":"https://syntology.ai/paper/2210.04563","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.04563"}},"official":{"repos":["phoebussi/mmbs"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official","unlocated"]}}},{"url":"/paper/retrieval-augmented-visual-question-answering","slug":"retrieval-augmented-visual-question-answering","title":"Retrieval Augmented Visual Question Answering with Outside Knowledge","date":"2022-10-07","arxiv_id":"2210.03809","repositories_listed":1,"syntology":null},{"url":"/paper/a-dual-attention-learning-network-with-word","slug":"a-dual-attention-learning-network-with-word","title":"A Dual-Attention Learning Network with Word and Sentence Embedding for Medical Visual Question Answering","date":"2022-10-01","arxiv_id":"2210.00220","repositories_listed":1,"syntology":null},{"url":"/paper/task-formulation-matters-when-learning-1","slug":"task-formulation-matters-when-learning-1","title":"Task Formulation Matters When Learning Continually: A Case Study in Visual Question Answering","date":"2022-09-30","arxiv_id":"2210.00044","repositories_listed":1,"syntology":null},{"url":"/paper/towards-explainable-3d-grounded-visual","slug":"towards-explainable-3d-grounded-visual","title":"Towards Explainable 3D Grounded Visual Question Answering: A New Benchmark and Strong Baseline","date":"2022-09-24","arxiv_id":"2209.12028","repositories_listed":1,"syntology":null},{"url":"/paper/continual-vqa-for-disaster-response-systems","slug":"continual-vqa-for-disaster-response-systems","title":"Continual VQA for Disaster Response Systems","date":"2022-09-21","arxiv_id":"2209.10320","repositories_listed":1,"syntology":null},{"url":"/paper/exploring-modulated-detection-transformer-as","slug":"exploring-modulated-detection-transformer-as","title":"Exploring Modulated Detection Transformer as a Tool for Action Recognition in Videos","date":"2022-09-21","arxiv_id":"2209.10126","repositories_listed":1,"syntology":null},{"url":"/paper/overcoming-language-priors-in-visual-question-1","slug":"overcoming-language-priors-in-visual-question-1","title":"Overcoming Language Priors in Visual Question Answering via Distinguishing Superficially Similar Instances","date":"2022-09-18","arxiv_id":"2209.08529","repositories_listed":1,"syntology":null},{"url":"/paper/lavis-a-library-for-language-vision","slug":"lavis-a-library-for-language-vision","title":"LAVIS: A Library for Language-Vision Intelligence","date":"2022-09-15","arxiv_id":"2209.09019","repositories_listed":1,"syntology":null},{"url":"/paper/pali-a-jointly-scaled-multilingual-language","slug":"pali-a-jointly-scaled-multilingual-language","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","date":"2022-09-14","arxiv_id":"2209.06794","repositories_listed":1,"syntology":{"n":4,"n_ran":2,"n_constructed":1,"n_ran_checked":2,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":1,"n_no_contract":1,"n_pointer_only":0,"phrase":"2 ran (of which 1 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 1 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/pali-a-jointly-scaled-multilingual-language#ran","syntology_url":"https://syntology.ai/paper/2209.06794","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2209.06794"}},"official":{"repos":["google-research/big_vision"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":1,"n_ran_no_instrument_failure":2,"n_unverified":2,"ran_from_kinds":["official"]}}},{"url":"/paper/towards-multi-lingual-visual-question","slug":"towards-multi-lingual-visual-question","title":"MaXM: Towards Multilingual Visual Question Answering","date":"2022-09-12","arxiv_id":"2209.05401","repositories_listed":1,"syntology":null},{"url":"/paper/improving-the-cross-lingual-generalisation-in","slug":"improving-the-cross-lingual-generalisation-in","title":"Improving the Cross-Lingual Generalisation in Visual Question Answering","date":"2022-09-07","arxiv_id":"2209.02982","repositories_listed":1,"syntology":null},{"url":"/paper/symbolic-replay-scene-graph-as-prompt-for","slug":"symbolic-replay-scene-graph-as-prompt-for","title":"Symbolic Replay: Scene Graph as Prompt for Continual Learning on VQA Task","date":"2022-08-24","arxiv_id":"2208.12037","repositories_listed":1,"syntology":null},{"url":"/paper/illume-rationalizing-vision-language-models","slug":"illume-rationalizing-vision-language-models","title":"ILLUME: Rationalizing Vision-Language Models through Human Interactions","date":"2022-08-17","arxiv_id":"2208.08241","repositories_listed":1,"syntology":null},{"url":"/paper/understanding-attention-for-vision-and-1","slug":"understanding-attention-for-vision-and-1","title":"Understanding Attention for Vision-and-Language Tasks","date":"2022-08-17","arxiv_id":"2208.08104","repositories_listed":1,"syntology":null},{"url":"/paper/clevr-math-a-dataset-for-compositional","slug":"clevr-math-a-dataset-for-compositional","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","date":"2022-08-10","arxiv_id":"2208.05358","repositories_listed":1,"syntology":null},{"url":"/paper/chiqa-a-large-scale-image-based-real-world","slug":"chiqa-a-large-scale-image-based-real-world","title":"ChiQA: A Large Scale Image-based Real-World Question Answering Dataset for Multi-Modal Understanding","date":"2022-08-05","arxiv_id":"2208.03030","repositories_listed":1,"syntology":null},{"url":"/paper/generative-bias-for-visual-question-answering","slug":"generative-bias-for-visual-question-answering","title":"Generative Bias for Robust Visual Question Answering","date":"2022-08-01","arxiv_id":"2208.00690","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/generative-bias-for-visual-question-answering#ran","syntology_url":"https://syntology.ai/paper/2208.00690","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2208.00690"}},"official":{"repos":["chojw/genb"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/lako-knowledge-driven-visual-question","slug":"lako-knowledge-driven-visual-question","title":"LaKo: Knowledge-driven Visual Question Answering via Late Knowledge-to-Text Injection","date":"2022-07-26","arxiv_id":"2207.12888","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/lako-knowledge-driven-visual-question#ran","syntology_url":"https://syntology.ai/paper/2207.12888","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2207.12888"}},"official":{"repos":["hackerchenzhuo/LaKo"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"url":"/paper/winogavil-gamified-association-benchmark-to","slug":"winogavil-gamified-association-benchmark-to","title":"WinoGAViL: Gamified Association Benchmark to Challenge Vision-and-Language Models","date":"2022-07-25","arxiv_id":"2207.12576","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_constructed":0,"n_ran_checked":0,"n_instrument":1,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/winogavil-gamified-association-benchmark-to#ran","syntology_url":"https://syntology.ai/paper/2207.12576","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2207.12576"}},"official":{"repos":["winogavil/winogavil-experiments"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/rethinking-data-augmentation-for-robust","slug":"rethinking-data-augmentation-for-robust","title":"Rethinking Data Augmentation for Robust Visual Question Answering","date":"2022-07-18","arxiv_id":"2207.08739","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":1,"phrase":"0 ran · 1 unverified","sample_list":"/paper/rethinking-data-augmentation-for-robust#ran","syntology_url":"https://syntology.ai/paper/2207.08739","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2207.08739"}},"official":{"repos":["itemzheng/kddaug"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":[]}}},{"url":"/paper/viquae-a-dataset-for-knowledge-based-visual-1","slug":"viquae-a-dataset-for-knowledge-based-visual-1","title":"ViQuAE, a Dataset for Knowledge-based Visual Question Answering about Named Entities","date":"2022-07-11","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/knowing-earlier-what-right-means-to-you-a","slug":"knowing-earlier-what-right-means-to-you-a","title":"Knowing Earlier what Right Means to You: A Comprehensive VQA Dataset for Grounding Relative Directions via Multi-Task Learning","date":"2022-07-06","arxiv_id":"2207.02624","repositories_listed":1,"syntology":null},{"url":"/paper/weakly-supervised-grounding-for-vqa-in-vision","slug":"weakly-supervised-grounding-for-vqa-in-vision","title":"Weakly Supervised Grounding for VQA in Vision-Language Transformers","date":"2022-07-05","arxiv_id":"2207.02334","repositories_listed":1,"syntology":null},{"url":"/paper/a-unified-end-to-end-retriever-reader","slug":"a-unified-end-to-end-retriever-reader","title":"A Unified End-to-End Retriever-Reader Framework for Knowledge-based VQA","date":"2022-06-30","arxiv_id":"2206.14989","repositories_listed":1,"syntology":null},{"url":"/paper/consistency-preserving-visual-question","slug":"consistency-preserving-visual-question","title":"Consistency-preserving Visual Question Answering in Medical Imaging","date":"2022-06-27","arxiv_id":"2206.13296","repositories_listed":1,"syntology":null},{"url":"/paper/visfis-visual-feature-importance-supervision","slug":"visfis-visual-feature-importance-supervision","title":"VisFIS: Visual Feature Importance Supervision with Right-for-the-Right-Reason Objectives","date":"2022-06-22","arxiv_id":"2206.11212","repositories_listed":1,"syntology":{"n":6,"n_ran":5,"n_constructed":0,"n_ran_checked":2,"n_instrument":3,"n_unverified":1,"n_honours":2,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 2 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/visfis-visual-feature-importance-supervision#ran","syntology_url":"https://syntology.ai/paper/2206.11212","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.11212"}},"official":{"repos":["zfying/visfis"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":2,"n_unverified":1,"ran_from_kinds":["official"]}}},{"url":"/paper/mixgen-a-new-multi-modal-data-augmentation","slug":"mixgen-a-new-multi-modal-data-augmentation","title":"MixGen: A New Multi-Modal Data Augmentation","date":"2022-06-16","arxiv_id":"2206.08358","repositories_listed":1,"syntology":{"n":2,"n_ran":0,"n_constructed":0,"n_ran_checked":0,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":0,"n_pointer_only":0,"phrase":"0 ran · 2 unverified","sample_list":"/paper/mixgen-a-new-multi-modal-data-augmentation#ran","syntology_url":"https://syntology.ai/paper/2206.08358","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.08358"}},"official":{"repos":["amazon-research/mix-generation"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":2,"ran_from_kinds":[]}}},{"url":"/paper/coarse-to-fine-vision-language-pre-training","slug":"coarse-to-fine-vision-language-pre-training","title":"Coarse-to-Fine Vision-Language Pre-training with Fusion in the Backbone","date":"2022-06-15","arxiv_id":"2206.07643","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":1,"n_instrument":1,"n_unverified":1,"n_honours":1,"n_violates":0,"n_no_contract":0,"n_pointer_only":2,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/coarse-to-fine-vision-language-pre-training#ran","syntology_url":"https://syntology.ai/paper/2206.07643","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2206.07643"}},"official":{"repos":["microsoft/fiber"],"state":"official: harvested, nothing ran","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":1,"ran_from_kinds":["unlocated"]}}},{"url":"/paper/cvil-cross-lingual-training-of-vision","slug":"cvil-cross-lingual-training-of-vision","title":"cViL: Cross-Lingual Training of Vision-Language Models using Knowledge Distillation","date":"2022-06-07","arxiv_id":"2206.03354","repositories_listed":1,"syntology":null}],"record_sha256":"28109140c61161b822aab03f6c04a45b500d105cb6b412449f919cd17f167fbc","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}