{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/question-answering/papers/50","list_of":"/task/question-answering","task":"Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":50,"pages_in_order":109,"rows_per_page":100,"rows":[4901,5000],"of":10817,"counts":{"archive_papers_tagged":10817,"with_a_code_link":4171,"where_syntology_ran_a_sample":1274,"not_listed_spam_title":0,"listed":10817,"listed_where_code_ran":1274,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1073,"every_run_a_failure_of_syntologys_instrument":201,"listed_with_a_run_with_no_instrument_failure":1073,"listed_every_run_a_failure_of_syntologys_instrument":201,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/question-answering","prev":"/task/question-answering/papers/49","next":"/task/question-answering/papers/51","papers":[{"url":null,"slug":"clip-up-clip-based-unanswerable-problem","title":"CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering","date":"2025-01-02","arxiv_id":"2501.01371","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacm-2-on-understanding-extremely-long-term-1","title":"AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adadare-gamma-balancing-stability-and","title":"AdaDARE-gamma: Balancing Stability and Plasticity in Multi-modal LLMs through Efficient Adaptation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-mining-and-fusion-representation","title":"Alignment, Mining and Fusion: Representation Alignment with Hard Negative Mining and Selective Knowledge Fusion for Medical Visual Question Answering","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-text-implementing-multimodal-large","title":"Beyond Text: Implementing Multimodal Large Language Model-Powered Multi-Agent Systems Using a No-Code Platform","date":"2025-01-01","arxiv_id":"2501.00750","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-motion-aware-video-mllm","title":"Efficient Motion-Aware Video MLLM","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficientllava-generalizable-auto-pruning-for-1","title":"EfficientLLaVA: Generalizable Auto-Pruning for Large Vision-language Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-video-llm-reasoning-via-agent-of","title":"Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"flexible-frame-selection-for-efficient-video","title":"Flexible Frame Selection for Efficient Video Reasoning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"font-agent-enhancing-font-understanding-with","title":"Font-Agent: Enhancing Font Understanding with Large Language Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarq-task-aware-hierarchical-q-former-for","title":"HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"jtd-uav-mllm-enhanced-joint-tracking-and","title":"JTD-UAV: MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mimo-a-medical-vision-language-model-with","title":"MIMO: A Medical Vision Language Model with Visual Referring Multimodal Input and Pixel Grounding Multimodal Output","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-more-with-less-human-like","title":"Seeing More with Less: Human-like Representations in Vision Models","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"separation-of-powers-on-segregating-knowledge","title":"Separation of Powers: On Segregating Knowledge from Observation in LLM-enabled Knowledge-based Visual Question Answering","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"svlta-benchmarking-vision-language-temporal","title":"SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-3d-question-answering-via-voxel","title":"Zero-shot 3D Question Answering via Voxel-based Dynamic Token Compression","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-faithfulness-metrics-for","title":"A review of faithfulness metrics for hallucination assessment in Large Language Models","date":"2024-12-31","arxiv_id":"2501.00269","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-evaluation-of-large-language","title":"An Empirical Evaluation of Large Language Models on Consumer Health Questions","date":"2024-12-31","arxiv_id":"2501.00208","repositories_listed":0,"syntology":null},{"url":null,"slug":"equator-a-deterministic-framework-for","title":"EQUATOR: A Deterministic Framework for Evaluating LLM Reasoning with Open-Ended Questions. # v1.0.0-beta","date":"2024-12-31","arxiv_id":"2501.00257","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-medqa-enhancing-medical-question","title":"LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models","date":"2024-12-31","arxiv_id":"2501.05464","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-visual-language-priors-in-vlms","title":"Probing Visual Language Priors in VLMs","date":"2024-12-31","arxiv_id":"2501.00569","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-llms-really-not-knowledgable-mining-the","title":"Are LLMs Really Not Knowledgable? Mining the Submerged Knowledge in LLMs' Memory","date":"2024-12-30","arxiv_id":"2412.20846","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-multimodal-rag-llm-for-accurate","title":"Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering","date":"2024-12-30","arxiv_id":"2412.20927","repositories_listed":0,"syntology":null},{"url":null,"slug":"karpa-a-training-free-method-of-adapting","title":"KARPA: A Training-free Method of Adapting Knowledge Graph as References for Large Language Model's Reasoning Path Aggregation","date":"2024-12-30","arxiv_id":"2412.20995","repositories_listed":0,"syntology":null},{"url":null,"slug":"plug-and-play-training-framework-for","title":"Plug-and-Play Training Framework for Preference Optimization","date":"2024-12-30","arxiv_id":"2412.20996","repositories_listed":0,"syntology":null},{"url":null,"slug":"walkvlm-aid-visually-impaired-people-walking","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","date":"2024-12-30","arxiv_id":"2412.20903","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-a-rich-dataset-to-empower-the","title":"Building a Rich Dataset to Empower the Persian Question Answering Systems","date":"2024-12-28","arxiv_id":"2412.20212","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multi-agent-collaboration-with-tool","title":"Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question Answering","date":"2024-12-28","arxiv_id":"2412.20145","repositories_listed":0,"syntology":null},{"url":null,"slug":"ergochat-a-visual-query-system-for-the","title":"ErgoChat: a Visual Query System for the Ergonomic Risk Assessment of Construction Workers","date":"2024-12-27","arxiv_id":"2412.19954","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-training-fine-tuning-and-re-ranking-a","title":"Pre-training, Fine-tuning and Re-ranking: A Three-Stage Framework for Legal Question Answering","date":"2024-12-27","arxiv_id":"2412.19482","repositories_listed":0,"syntology":null},{"url":null,"slug":"targa-targeted-synthetic-data-generation-for","title":"TARGA: Targeted Synthetic Data Generation for Practical Reasoning over Structured Data","date":"2024-12-27","arxiv_id":"2412.19544","repositories_listed":0,"syntology":null},{"url":null,"slug":"text2insight-transform-natural-language-text","title":"Text2Insight: Transform natural language text into insights seamlessly using multi-model architecture","date":"2024-12-27","arxiv_id":"2412.19718","repositories_listed":0,"syntology":null},{"url":null,"slug":"perceive-query-reason-enhancing-video-qa-with","title":"Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries","date":"2024-12-26","arxiv_id":"2412.19304","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generated-and-retrieved-knowledge","title":"Improving Generated and Retrieved Knowledge Combination Through Zero-shot Generation","date":"2024-12-25","arxiv_id":"2412.18800","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-embedding-priors-in-prompt-tuning","title":"Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Control","date":"2024-12-24","arxiv_id":"2412.18582","repositories_listed":0,"syntology":null},{"url":null,"slug":"gear-graph-enhanced-agent-for-retrieval","title":"GeAR: Graph-enhanced Agent for Retrieval-augmented Generation","date":"2024-12-24","arxiv_id":"2412.18431","repositories_listed":0,"syntology":null},{"url":null,"slug":"haur-human-annotation-understanding-and","title":"HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images","date":"2024-12-24","arxiv_id":"2412.18327","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agents-based-on-large-language-models","title":"Multi-Agents Based on Large Language Models for Knowledge-based Visual Question Answering","date":"2024-12-24","arxiv_id":"2412.18351","repositories_listed":0,"syntology":null},{"url":null,"slug":"textmatch-enhancing-image-text-consistency","title":"TextMatch: Enhancing Image-Text Consistency Through Multimodal Optimization","date":"2024-12-24","arxiv_id":"2412.18185","repositories_listed":0,"syntology":null},{"url":null,"slug":"unlocking-the-potential-of-multiple-bert","title":"Unlocking the Potential of Multiple BERT Models for Bangla Question Answering in NCTB Textbooks","date":"2024-12-24","arxiv_id":"2412.18440","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-lingual-text-rich-visual-comprehension","title":"Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective","date":"2024-12-23","arxiv_id":"2412.17787","repositories_listed":0,"syntology":null},{"url":null,"slug":"factuality-or-fiction-benchmarking-modern","title":"Factuality or Fiction? Benchmarking Modern LLMs on Ambiguous QA with Citations","date":"2024-12-23","arxiv_id":"2412.18051","repositories_listed":0,"syntology":null},{"url":null,"slug":"ffa-sora-video-generation-as-fundus","title":"FFA Sora, video generation as fundus fluorescein angiography simulator","date":"2024-12-23","arxiv_id":"2412.17346","repositories_listed":0,"syntology":null},{"url":null,"slug":"ragonite-iterative-retrieval-on-induced","title":"RAGONITE: Iterative Retrieval on Induced Databases and Verbalized RDF for Conversational QA over KGs with RAG","date":"2024-12-23","arxiv_id":"2412.17690","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-large-multimodal-model-datasets","title":"Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy","date":"2024-12-23","arxiv_id":"2412.17759","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompting-large-language-models-with-1","title":"Prompting Large Language Models with Rationale Heuristics for Knowledge-based Visual Question Answering","date":"2024-12-22","arxiv_id":"2412.16936","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-multimodal-large-language","title":"Application of Multimodal Large Language Models in Autonomous Driving","date":"2024-12-21","arxiv_id":"2412.16410","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-cve-analysis-harnessing-machine","title":"Automated CVE Analysis: Harnessing Machine Learning In Designing Question-Answering Models For Cybersecurity Information Extraction","date":"2024-12-21","arxiv_id":"2412.16484","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-retrieval-augmented-generation-without","title":"Speech Retrieval-Augmented Generation without Automatic Speech Recognition","date":"2024-12-21","arxiv_id":"2412.16500","repositories_listed":0,"syntology":null},{"url":null,"slug":"stampsy-towards-spatiotemporal-aware-mixed","title":"STAMPsy: Towards SpatioTemporal-Aware Mixed-Type Dialogues for Psychological Counseling","date":"2024-12-21","arxiv_id":"2412.16674","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybgrag-hybrid-retrieval-augmented-generation","title":"HybGRAG: Hybrid Retrieval-Augmented Generation on Textual and Relational Knowledge Bases","date":"2024-12-20","arxiv_id":"2412.16311","repositories_listed":0,"syntology":null},{"url":null,"slug":"logical-consistency-of-large-language-models","title":"Logical Consistency of Large Language Models in Fact-checking","date":"2024-12-20","arxiv_id":"2412.16100","repositories_listed":0,"syntology":null},{"url":null,"slug":"mrag-a-modular-retrieval-framework-for-time","title":"MRAG: A Modular Retrieval Framework for Time-Sensitive Question Answering","date":"2024-12-20","arxiv_id":"2412.15540","repositories_listed":0,"syntology":null},{"url":null,"slug":"ngqa-a-nutritional-graph-question-answering","title":"NGQA: A Nutritional Graph Question Answering Benchmark for Personalized Health-aware Nutritional Reasoning","date":"2024-12-20","arxiv_id":"2412.15547","repositories_listed":0,"syntology":null},{"url":null,"slug":"polysmart-trecvid-2024-medical-video-question","title":"PolySmart @ TRECVid 2024 Medical Video Question Answering","date":"2024-12-20","arxiv_id":"2412.15514","repositories_listed":0,"syntology":null},{"url":null,"slug":"coderepoqa-a-large-scale-benchmark-for","title":"CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering","date":"2024-12-19","arxiv_id":"2412.14764","repositories_listed":0,"syntology":null},{"url":null,"slug":"earthdial-turning-multi-sensory-earth","title":"EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues","date":"2024-12-19","arxiv_id":"2412.15190","repositories_listed":0,"syntology":null},{"url":null,"slug":"fedpia-permuting-and-integrating-adapters","title":"FedPIA -- Permuting and Integrating Adapters leveraging Wasserstein Barycenters for Finetuning Foundation Models in Multi-Modal Federated Learning","date":"2024-12-19","arxiv_id":"2412.14424","repositories_listed":0,"syntology":null},{"url":null,"slug":"fivl-a-framework-for-improved-vision-language","title":"FiVL: A Framework for Improved Vision-Language Alignment","date":"2024-12-19","arxiv_id":"2412.14672","repositories_listed":0,"syntology":null},{"url":null,"slug":"grapheqa-using-3d-semantic-scene-graphs-for","title":"GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering","date":"2024-12-19","arxiv_id":"2412.14480","repositories_listed":0,"syntology":null},{"url":null,"slug":"query-pipeline-optimization-for-cancer","title":"Query pipeline optimization for cancer patient question answering systems","date":"2024-12-19","arxiv_id":"2412.14751","repositories_listed":0,"syntology":null},{"url":null,"slug":"review-then-refine-a-dynamic-framework-for","title":"Review-Then-Refine: A Dynamic Framework for Multi-Hop Question Answering with Temporal Adaptability","date":"2024-12-19","arxiv_id":"2412.15101","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-we-build-local-large-language-models-an","title":"Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs","date":"2024-12-19","arxiv_id":"2412.14471","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cognitive-ideation-support-framework-using","title":"A Cognitive Ideation Support Framework using IBM Watson Services","date":"2024-12-18","arxiv_id":"2412.14025","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-concept-centric-approach-to-multi-modality","title":"A Concept-Centric Approach to Multi-Modality Learning","date":"2024-12-18","arxiv_id":"2412.13847","repositories_listed":0,"syntology":null},{"url":"/paper/advanced-reasoning-and-transformation-engine","slug":"advanced-reasoning-and-transformation-engine","title":"ARTEMIS-DA: An Advanced Reasoning and Transformation Engine for Multi-Step Insight Synthesis in Data Analytics","date":"2024-12-18","arxiv_id":"2412.14146","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-ophthalingua-a-multilingual-benchmark","title":"Multi-OphthaLingua: A Multilingual Benchmark for Assessing and Debiasing LLM Ophthalmological QA in LMICs","date":"2024-12-18","arxiv_id":"2412.14304","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-learning-in-the-era-of-llms-a-survey","title":"Graph Learning in the Era of LLMs: A Survey from the Perspective of Data, Models, and Tasks","date":"2024-12-17","arxiv_id":"2412.12456","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-graphs-the-future-of-data","title":"Knowledge Graphs: The Future of Data Integration and Insightful Discovery","date":"2024-12-17","arxiv_id":"2502.15689","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-based-discriminative-reasoning-for","title":"LLM-based Discriminative Reasoning for Knowledge Graph Question Answering","date":"2024-12-17","arxiv_id":"2412.12643","repositories_listed":0,"syntology":null},{"url":null,"slug":"modality-inconsistent-continual-learning-of","title":"Modality-Inconsistent Continual Learning of Multimodal Large Language Models","date":"2024-12-17","arxiv_id":"2412.13050","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-how-do-large-language-models-perform","title":"Question: How do Large Language Models perform on the Question Answering tasks? Answer:","date":"2024-12-17","arxiv_id":"2412.12893","repositories_listed":0,"syntology":null},{"url":null,"slug":"rareagents-autonomous-multi-disciplinary-team","title":"RareAgents: Autonomous Multi-disciplinary Team for Rare Disease Diagnosis and Treatment","date":"2024-12-17","arxiv_id":"2412.12475","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-to-speak-when-to-abstain-contrastive","title":"When to Speak, When to Abstain: Contrastive Decoding with Abstention","date":"2024-12-17","arxiv_id":"2412.12527","repositories_listed":0,"syntology":null},{"url":null,"slug":"ace-m-3-automatic-capability-evaluator-for","title":"ACE-$M^3$: Automatic Capability Evaluator for Multimodal Medical Models","date":"2024-12-16","arxiv_id":"2412.11453","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancements-and-challenges-in-bangla","title":"Advancements and Challenges in Bangla Question Answering Models: A Comprehensive Review","date":"2024-12-16","arxiv_id":"2412.11823","repositories_listed":0,"syntology":null},{"url":null,"slug":"cg-bench-clue-grounded-question-answering","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","date":"2024-12-16","arxiv_id":"2412.12075","repositories_listed":0,"syntology":null},{"url":null,"slug":"conceptedit-conceptualization-augmented","title":"ConceptEdit: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning","date":"2024-12-16","arxiv_id":"2412.11418","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-filtering-with-reward-modeling-in","title":"Context Filtering with Reward Modeling in Question Answering","date":"2024-12-16","arxiv_id":"2412.11707","repositories_listed":0,"syntology":null},{"url":null,"slug":"cpath-omni-a-unified-multimodal-foundation","title":"CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology","date":"2024-12-16","arxiv_id":"2412.12077","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-llm-based-table-question","title":"Interpretable LLM-based Table Question Answering","date":"2024-12-16","arxiv_id":"2412.12386","repositories_listed":0,"syntology":null},{"url":null,"slug":"precise-length-control-in-large-language","title":"Precise Length Control in Large Language Models","date":"2024-12-16","arxiv_id":"2412.11937","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentps-agentic-process-supervision-for-multi","title":"AgentPS: Agentic Process Supervision for Multi-modal Content Quality Assurance through Multi-round QA","date":"2024-12-15","arxiv_id":"2412.15251","repositories_listed":0,"syntology":null},{"url":"/paper/cultural-palette-pluralising-culture","slug":"cultural-palette-pluralising-culture","title":"Cultural Palette: Pluralising Culture Alignment via Multi-agent Palette","date":"2024-12-15","arxiv_id":"2412.11167","repositories_listed":0,"syntology":null},{"url":null,"slug":"overview-of-trec-2024-medical-video-question","title":"Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track","date":"2024-12-15","arxiv_id":"2412.11056","repositories_listed":0,"syntology":null},{"url":null,"slug":"damage-assessment-after-natural-disasters","title":"Damage Assessment after Natural Disasters with UAVs: Semantic Feature Extraction using Deep Learning","date":"2024-12-14","arxiv_id":"2412.10756","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisyeqa-benchmarking-embodied-question","title":"NoisyEQA: Benchmarking Embodied Question Answering Against Noisy Queries","date":"2024-12-14","arxiv_id":"2412.10726","repositories_listed":0,"syntology":null},{"url":null,"slug":"patch-level-sounding-object-tracking-for","title":"Patch-level Sounding Object Tracking for Audio-Visual Question Answering","date":"2024-12-14","arxiv_id":"2412.10749","repositories_listed":0,"syntology":null},{"url":null,"slug":"visdom-multi-document-qa-with-visually-rich","title":"VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation","date":"2024-12-14","arxiv_id":"2412.10704","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-table-comprehension-in-the-wild","title":"Benchmarking Table Comprehension In The Wild","date":"2024-12-13","arxiv_id":"2412.09884","repositories_listed":0,"syntology":null},{"url":null,"slug":"evidence-contextualization-and-counterfactual","title":"Evidence Contextualization and Counterfactual Attribution for Conversational QA over Heterogeneous Data with RAG Systems","date":"2024-12-13","arxiv_id":"2412.10571","repositories_listed":0,"syntology":null},{"url":null,"slug":"iqvic-in-context-question-adaptive-vision","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","date":"2024-12-13","arxiv_id":"2412.09907","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-distillation-for-efficient-few-shot","title":"LLM Distillation for Efficient Few-Shot Multiple Choice Question Answering","date":"2024-12-13","arxiv_id":"2412.09807","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlr-bench-multilingual-benchmark-dataset-for","title":"VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation","date":"2024-12-13","arxiv_id":"2412.10151","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-the-robustness-of-retrieval","title":"Assessing the Robustness of Retrieval-Augmented Generation Systems in K-12 Educational Question Answering with Knowledge Discrepancies","date":"2024-12-12","arxiv_id":"2412.08985","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundation-models-and-adaptive-feature","title":"Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering","date":"2024-12-12","arxiv_id":"2412.09230","repositories_listed":0,"syntology":null},{"url":null,"slug":"og-rag-ontology-grounded-retrieval-augmented","title":"OG-RAG: Ontology-Grounded Retrieval-Augmented Generation For Large Language Models","date":"2024-12-12","arxiv_id":"2412.15235","repositories_listed":0,"syntology":null},{"url":null,"slug":"vicas-a-dataset-for-combining-holistic-and","title":"ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation","date":"2024-12-12","arxiv_id":"2412.09754","repositories_listed":0,"syntology":null},{"url":null,"slug":"viunit-visual-unit-tests-for-more-robust","title":"ViUniT: Visual Unit Tests for More Robust Visual Programming","date":"2024-12-12","arxiv_id":"2412.08859","repositories_listed":0,"syntology":null}],"record_sha256":"4f4a4f11cec15e8000a328249fca8b7d71f1df923e497a40696c3f0125c16f25","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}