{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/question-answering/papers/44","list_of":"/task/question-answering","task":"Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":44,"pages_in_order":109,"rows_per_page":100,"rows":[4301,4400],"of":10817,"counts":{"archive_papers_tagged":10817,"with_a_code_link":4171,"where_syntology_ran_a_sample":1274,"not_listed_spam_title":0,"listed":10817,"listed_where_code_ran":1274,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1073,"every_run_a_failure_of_syntologys_instrument":201,"listed_with_a_run_with_no_instrument_failure":1073,"listed_every_run_a_failure_of_syntologys_instrument":201,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/question-answering","prev":"/task/question-answering/papers/43","next":"/task/question-answering/papers/45","papers":[{"url":null,"slug":"dynamicvl-benchmarking-multimodal-large","title":"DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding","date":"2025-05-27","arxiv_id":"2505.21076","repositories_listed":0,"syntology":null},{"url":null,"slug":"music-s-multimodal-complexity-in-avqa-why-we","title":"Music's Multimodal Complexity in AVQA: Why We Need More than General Multimodal LLMs","date":"2025-05-27","arxiv_id":"2505.20638","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-information-synthesis-in","title":"Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective","date":"2025-05-27","arxiv_id":"2505.20816","repositories_listed":0,"syntology":null},{"url":null,"slug":"silence-is-not-consensus-disrupting-agreement","title":"Silence is Not Consensus: Disrupting Agreement Bias in Multi-Agent LLMs via Catfish Agent for Clinical Decision Making","date":"2025-05-27","arxiv_id":"2505.21503","repositories_listed":0,"syntology":null},{"url":null,"slug":"sosbench-benchmarking-safety-alignment-on","title":"SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge","date":"2025-05-27","arxiv_id":"2505.21605","repositories_listed":0,"syntology":null},{"url":null,"slug":"alas-measuring-latent-speech-text-alignment","title":"ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs","date":"2025-05-26","arxiv_id":"2505.19937","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-large-multimodal-models-for","title":"Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat","date":"2025-05-26","arxiv_id":"2505.19624","repositories_listed":0,"syntology":null},{"url":null,"slug":"cp-router-an-uncertainty-aware-router-between","title":"CP-Router: An Uncertainty-Aware Router Between LLM and LRM","date":"2025-05-26","arxiv_id":"2505.19970","repositories_listed":0,"syntology":null},{"url":null,"slug":"dgrag-distributed-graph-based-retrieval","title":"DGRAG: Distributed Graph-based Retrieval-Augmented Generation in Edge-Cloud Systems","date":"2025-05-26","arxiv_id":"2505.19847","repositories_listed":0,"syntology":null},{"url":null,"slug":"interleaved-reasoning-for-large-language","title":"Interleaved Reasoning for Large Language Models via Reinforcement Learning","date":"2025-05-26","arxiv_id":"2505.19640","repositories_listed":0,"syntology":null},{"url":null,"slug":"it-s-high-time-a-survey-of-temporal","title":"It's High Time: A Survey of Temporal Information Retrieval and Question Answering","date":"2025-05-26","arxiv_id":"2505.20243","repositories_listed":0,"syntology":null},{"url":null,"slug":"s2lpp-small-to-large-prompt-prediction-across","title":"S2LPP: Small-to-Large Prompt Prediction across LLMs","date":"2025-05-26","arxiv_id":"2505.20097","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-reflective-planning-with-knowledge","title":"Self-Reflective Planning with Knowledge Graphs: Enhancing LLM Reasoning Reliability for Question Answering","date":"2025-05-26","arxiv_id":"2505.19410","repositories_listed":0,"syntology":null},{"url":null,"slug":"sipdo-closed-loop-prompt-optimization-via","title":"SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback","date":"2025-05-26","arxiv_id":"2505.19514","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-aware-attention-heads-efficient","title":"Uncertainty-Aware Attention Heads: Efficient Unsupervised Uncertainty Quantification for LLMs","date":"2025-05-26","arxiv_id":"2505.20045","repositories_listed":0,"syntology":null},{"url":null,"slug":"activedpo-active-direct-preference","title":"ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment","date":"2025-05-25","arxiv_id":"2505.19241","repositories_listed":0,"syntology":null},{"url":null,"slug":"gc-kbvqa-a-new-four-stage-framework-for","title":"GC-KBVQA: A New Four-Stage Framework for Enhancing Knowledge Based Visual Question Answering Performance","date":"2025-05-25","arxiv_id":"2505.19354","repositories_listed":0,"syntology":null},{"url":null,"slug":"spokennativqa-multilingual-everyday-spoken","title":"SpokenNativQA: Multilingual Everyday Spoken Queries for LLMs","date":"2025-05-25","arxiv_id":"2505.19163","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-line-length-invariant-estimation","title":"UNCERTAINTY-LINE: Length-Invariant Estimation of Uncertainty for Large Language Models","date":"2025-05-25","arxiv_id":"2505.19060","repositories_listed":0,"syntology":null},{"url":null,"slug":"weaver-interweaving-sql-and-llm-for-table","title":"Weaver: Interweaving SQL and LLM for Table Reasoning","date":"2025-05-25","arxiv_id":"2505.18961","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-two-llms-debate-both-think-they-ll-win","title":"When Two LLMs Debate, Both Think They'll Win","date":"2025-05-25","arxiv_id":"2505.19184","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-poisoning-attacks-against","title":"Benchmarking Poisoning Attacks against Retrieval-Augmented Generation","date":"2025-05-24","arxiv_id":"2505.18543","repositories_listed":0,"syntology":null},{"url":null,"slug":"brit-bidirectional-retrieval-over-unified","title":"BRIT: Bidirectional Retrieval over Unified Image-Text Graph","date":"2025-05-24","arxiv_id":"2505.18450","repositories_listed":0,"syntology":null},{"url":null,"slug":"climate-eval-a-comprehensive-benchmark-for","title":"Climate-Eval: A Comprehensive Benchmark for NLP Tasks Related to Climate Change","date":"2025-05-24","arxiv_id":"2505.18653","repositories_listed":0,"syntology":null},{"url":null,"slug":"multilingual-question-answering-in-low","title":"Multilingual Question Answering in Low-Resource Settings: A Dzongkha-English Benchmark for Foundation Models","date":"2025-05-24","arxiv_id":"2505.18638","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-silent-saboteur-imperceptible-adversarial","title":"The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systems","date":"2025-05-24","arxiv_id":"2505.18583","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-mitigation-strategies-for","title":"Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models","date":"2025-05-23","arxiv_id":"2505.17496","repositories_listed":0,"syntology":null},{"url":"/paper/deep-video-discovery-agentic-search-with-tool","slug":"deep-video-discovery-agentic-search-with-tool","title":"Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding","date":"2025-05-23","arxiv_id":"2505.18079","repositories_listed":0,"syntology":{"n":10,"n_ran":10,"n_constructed":0,"n_ran_checked":10,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":10,"n_pointer_only":0,"phrase":"10 ran (of which 0 constructed an object rather than computing a result; 10 with no instrument failure: 0 honoured, 0 violated, 10 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/deep-video-discovery-agentic-search-with-tool#ran","syntology_url":"https://syntology.ai/paper/2505.18079","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.18079"}},"official":null}},{"url":null,"slug":"finragbench-v-a-benchmark-for-multimodal-rag","title":"FinRAGBench-V: A Benchmark for Multimodal RAG with Visual Citation in the Financial Domain","date":"2025-05-23","arxiv_id":"2505.17471","repositories_listed":0,"syntology":null},{"url":null,"slug":"permedcqa-benchmarking-large-language-models","title":"PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language","date":"2025-05-23","arxiv_id":"2505.18331","repositories_listed":0,"syntology":null},{"url":null,"slug":"ppt-a-process-based-preference-learning","title":"PPT: A Process-based Preference Learning Framework for Self Improving Table Question Answering Models","date":"2025-05-23","arxiv_id":"2505.17565","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-specific-pruning-with-llm-sieve-how-many","title":"Task Specific Pruning with LLM-Sieve: How Many Parameters Does Your Task Really Need?","date":"2025-05-23","arxiv_id":"2505.18350","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-causal-approach-to-mitigate-modality","title":"A Causal Approach to Mitigate Modality Preference Bias in Medical Visual Question Answering","date":"2025-05-22","arxiv_id":"2505.16209","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-the-hidden-states-hiding-something","title":"Are the Hidden States Hiding Something? Testing the Limits of Factuality-Encoding Capabilities in LLMs","date":"2025-05-22","arxiv_id":"2505.16520","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-llm-reasoning-with-dynamic-notes","title":"Augmenting LLM Reasoning with Dynamic Notes Writing for Complex QA","date":"2025-05-22","arxiv_id":"2505.16293","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaboration-among-multiple-large-language","title":"Collaboration among Multiple Large Language Models for Medical Question Answering","date":"2025-05-22","arxiv_id":"2505.16648","repositories_listed":0,"syntology":null},{"url":null,"slug":"continually-self-improving-language-models","title":"Continually Self-Improving Language Models for Bariatric Surgery Question--Answering","date":"2025-05-22","arxiv_id":"2505.16102","repositories_listed":0,"syntology":null},{"url":null,"slug":"ct-agent-a-multimodal-llm-agent-for-3d-ct","title":"CT-Agent: A Multimodal-LLM Agent for 3D CT Radiology Question Answering","date":"2025-05-22","arxiv_id":"2505.16229","repositories_listed":0,"syntology":null},{"url":null,"slug":"cub-benchmarking-context-utilisation","title":"CUB: Benchmarking Context Utilisation Techniques for Language Models","date":"2025-05-22","arxiv_id":"2505.16518","repositories_listed":0,"syntology":null},{"url":null,"slug":"earthse-a-benchmark-evaluating-earth","title":"EarthSE: A Benchmark Evaluating Earth Scientific Exploration Capability for Large Language Models","date":"2025-05-22","arxiv_id":"2505.17139","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-large-language-model-with","title":"Evaluating Large Language Model with Knowledge Oriented Language Specific Simple Question Answering","date":"2025-05-22","arxiv_id":"2505.16591","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounding-chest-x-ray-visual-question","title":"Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports","date":"2025-05-22","arxiv_id":"2505.16624","repositories_listed":0,"syntology":null},{"url":null,"slug":"seeing-far-and-clearly-mitigating","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","date":"2025-05-22","arxiv_id":"2505.16652","repositories_listed":0,"syntology":null},{"url":null,"slug":"steering-lvlms-via-sparse-autoencoder-for","title":"Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation","date":"2025-05-22","arxiv_id":"2505.16146","repositories_listed":0,"syntology":null},{"url":null,"slug":"tools-in-the-loop-quantifying-uncertainty-of","title":"Tools in the Loop: Quantifying Uncertainty of LLM Question Answering Systems That Use Tools","date":"2025-05-22","arxiv_id":"2505.16113","repositories_listed":0,"syntology":null},{"url":null,"slug":"uncle-uncertainty-expressions-in-long-form","title":"UNCLE: Uncertainty Expressions in Long-Form Generation","date":"2025-05-22","arxiv_id":"2505.16922","repositories_listed":0,"syntology":null},{"url":null,"slug":"voxrag-a-step-toward-transcription-free-rag","title":"VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering","date":"2025-05-22","arxiv_id":"2505.17326","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-anomaly-detection-in-battery","title":"Zero-Shot Anomaly Detection in Battery Thermal Images Using Visual Question Answering with Prior Knowledge","date":"2025-05-22","arxiv_id":"2505.16674","repositories_listed":0,"syntology":null},{"url":null,"slug":"br-taxqa-r-a-dataset-for-question-answering","title":"BR-TaxQA-R: A Dataset for Question Answering with References for Brazilian Personal Income Tax Law, including case law","date":"2025-05-21","arxiv_id":"2505.15916","repositories_listed":0,"syntology":null},{"url":null,"slug":"craft-training-free-cascaded-retrieval-for","title":"CRAFT: Training-Free Cascaded Retrieval for Tabular QA","date":"2025-05-21","arxiv_id":"2505.14984","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-pathology-rationale-and-token","title":"Discovering Pathology Rationale and Token Allocation for Efficient Multimodal Pathology Reasoning","date":"2025-05-21","arxiv_id":"2505.15687","repositories_listed":0,"syntology":null},{"url":"/paper/exploring-the-visual-feature-space-for","slug":"exploring-the-visual-feature-space-for","title":"Exploring The Visual Feature Space for Multimodal Neural Decoding","date":"2025-05-21","arxiv_id":"2505.15755","repositories_listed":0,"syntology":{"n":4,"n_ran":4,"n_constructed":3,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":0,"phrase":"4 ran (of which 3 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/exploring-the-visual-feature-space-for#ran","syntology_url":"https://syntology.ai/paper/2505.15755","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2505.15755"}},"official":null}},{"url":null,"slug":"human-centered-interactive-learning-via-mllms-1","title":"Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification","date":"2025-05-21","arxiv_id":"2506.11036","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-llm-first-token-predictions-in","title":"Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Prefilling Attack","date":"2025-05-21","arxiv_id":"2505.15323","repositories_listed":0,"syntology":null},{"url":null,"slug":"kaft-knowledge-aware-fine-tuning-for-boosting","title":"KaFT: Knowledge-aware Fine-tuning for Boosting LLMs' Domain-specific Question-Answering Performance","date":"2025-05-21","arxiv_id":"2505.15480","repositories_listed":0,"syntology":null},{"url":null,"slug":"livevlm-efficient-online-video-understanding","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","date":"2025-05-21","arxiv_id":"2505.15269","repositories_listed":0,"syntology":null},{"url":null,"slug":"robo2vlm-visual-question-answering-from-large","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","date":"2025-05-21","arxiv_id":"2505.15517","repositories_listed":0,"syntology":null},{"url":null,"slug":"set-llm-a-permutation-invariant-llm","title":"Set-LLM: A Permutation-Invariant LLM","date":"2025-05-21","arxiv_id":"2505.15433","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-llm-multiple-roles-a-unified-retrieval","title":"Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimization","date":"2025-05-21","arxiv_id":"2505.15444","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-bias-in-popular-question-answering","title":"Social Bias in Popular Question-Answering Benchmarks","date":"2025-05-21","arxiv_id":"2505.15553","repositories_listed":0,"syntology":null},{"url":null,"slug":"stepsearch-igniting-llms-search-ability-via","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","date":"2025-05-21","arxiv_id":"2505.15107","repositories_listed":0,"syntology":null},{"url":null,"slug":"tinydrive-multiscale-visual-question","title":"TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving","date":"2025-05-21","arxiv_id":"2505.15564","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-spoken-mathematical-reasoning","title":"Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems","date":"2025-05-21","arxiv_id":"2505.15000","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-question-answering-on-multiple-remote","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","date":"2025-05-21","arxiv_id":"2505.15401","repositories_listed":0,"syntology":null},{"url":null,"slug":"abacus-a-cost-based-optimizer-for-semantic","title":"Abacus: A Cost-Based Optimizer for Semantic Operator Systems","date":"2025-05-20","arxiv_id":"2505.14661","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-dataset-generation-for-knowledge","title":"Automatic Dataset Generation for Knowledge Intensive Question Answering Tasks","date":"2025-05-20","arxiv_id":"2505.14212","repositories_listed":0,"syntology":null},{"url":null,"slug":"autorev-automatic-peer-review-system-for","title":"AutoRev: Automatic Peer Review System for Academic Research Papers","date":"2025-05-20","arxiv_id":"2505.14376","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-chains-bridging-large-language-models","title":"Beyond Chains: Bridging Large Language Models and Knowledge Bases in Complex Question Answering","date":"2025-05-20","arxiv_id":"2505.14099","repositories_listed":0,"syntology":null},{"url":null,"slug":"debating-for-better-reasoning-an-unsupervised","title":"Debating for Better Reasoning: An Unsupervised Multimodal Approach","date":"2025-05-20","arxiv_id":"2505.14627","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adaptation-of-vlm-for-soccer-video","title":"Domain Adaptation of VLM for Soccer Video Understanding","date":"2025-05-20","arxiv_id":"2505.13860","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-jailbreak-attacks-on-llms-through","title":"Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion","date":"2025-05-20","arxiv_id":"2505.14316","repositories_listed":0,"syntology":null},{"url":null,"slug":"hausanlp-current-status-challenges-and-future","title":"HausaNLP: Current Status, Challenges and Future Directions for Hausa Natural Language Processing","date":"2025-05-20","arxiv_id":"2505.14311","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-traces-unexpected-outcomes","title":"Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation","date":"2025-05-20","arxiv_id":"2505.13792","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-centric-embodied-question-answer","title":"Memory-Centric Embodied Question Answer","date":"2025-05-20","arxiv_id":"2505.13948","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-question-answering-agents-with","title":"Reinforcing Question Answering Agents with Minimalist Policy Gradient Optimization","date":"2025-05-20","arxiv_id":"2505.17086","repositories_listed":0,"syntology":null},{"url":null,"slug":"studying-the-role-of-input-neighbor-overlap","title":"Studying the Role of Input-Neighbor Overlap in Retrieval-Augmented Language Models Training Efficiency","date":"2025-05-20","arxiv_id":"2505.14309","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-hallucination-tax-of-reinforcement","title":"The Hallucination Tax of Reinforcement Finetuning","date":"2025-05-20","arxiv_id":"2505.13988","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-effective-reinforcement-learning-fine","title":"Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models","date":"2025-05-20","arxiv_id":"2505.13973","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-omnidirectional-reasoning-with-360-r1","title":"Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method","date":"2025-05-20","arxiv_id":"2505.14197","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-instruction-bottleneck-tuning","title":"Visual Instruction Bottleneck Tuning","date":"2025-05-20","arxiv_id":"2505.13946","repositories_listed":0,"syntology":null},{"url":null,"slug":"yescieval-robust-llm-as-a-judge-for","title":"YESciEval: Robust LLM-as-a-Judge for Scientific Question Answering","date":"2025-05-20","arxiv_id":"2505.14279","repositories_listed":0,"syntology":null},{"url":null,"slug":"alignment-augmented-speculative-decoding-with","title":"Alignment-Augmented Speculative Decoding with Alignment Sampling and Conditional Verification","date":"2025-05-19","arxiv_id":"2505.13204","repositories_listed":0,"syntology":null},{"url":null,"slug":"amaqa-a-metadata-based-qa-dataset-for-rag","title":"AMAQA: A Metadata-based QA Dataset for RAG Systems","date":"2025-05-19","arxiv_id":"2505.13557","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartmuseum-testing-visual-reasoning","title":"ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models","date":"2025-05-19","arxiv_id":"2505.13444","repositories_listed":0,"syntology":null},{"url":null,"slug":"kit-s-offline-speech-translation-and","title":"KIT's Offline Speech Translation and Instruction Following Submission for IWSLT 2025","date":"2025-05-19","arxiv_id":"2505.13036","repositories_listed":0,"syntology":null},{"url":null,"slug":"orqa-a-benchmark-and-foundation-model-for","title":"ORQA: A Benchmark and Foundation Model for Holistic Operating Room Modeling","date":"2025-05-19","arxiv_id":"2505.12890","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-2-forge-minting-competency-questions-and","title":"Q${}^2$Forge: Minting Competency Questions and SPARQL Queries for Question-Answering Over Knowledge Graphs","date":"2025-05-19","arxiv_id":"2505.13572","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-predictive-modeling-for-llm","title":"Rethinking Predictive Modeling for LLM Routing: When Simple kNN Beats Complex Learned Routers","date":"2025-05-19","arxiv_id":"2505.12601","repositories_listed":0,"syntology":null},{"url":null,"slug":"surveillancevqa-589k-a-benchmark-for","title":"SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models","date":"2025-05-19","arxiv_id":"2505.12589","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-hidden-structure-improving-legal-document","title":"The Hidden Structure -- Improving Legal Document Understanding Through Explicit Text Formatting","date":"2025-05-19","arxiv_id":"2505.12837","repositories_listed":0,"syntology":null},{"url":null,"slug":"tianyi-a-traditional-chinese-medicine-all","title":"Tianyi: A Traditional Chinese Medicine all-rounder language model and its Real-World Clinical Practice","date":"2025-05-19","arxiv_id":"2505.13156","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-complexity-in-videoqa-via","title":"Understanding Complexity in VideoQA via Visual Program Generation","date":"2025-05-19","arxiv_id":"2505.13429","repositories_listed":0,"syntology":null},{"url":null,"slug":"disambiguation-in-conversational-question","title":"Disambiguation in Conversational Question Answering in the Era of LLM: A Survey","date":"2025-05-18","arxiv_id":"2505.12543","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-large-language-models-with-reward","title":"Enhancing Large Language Models with Reward-guided Tree Search for Knowledge Graph Question and Answering","date":"2025-05-18","arxiv_id":"2505.12476","repositories_listed":0,"syntology":null},{"url":null,"slug":"gmsa-enhancing-context-compression-via-group","title":"GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment","date":"2025-05-18","arxiv_id":"2505.12215","repositories_listed":0,"syntology":null},{"url":null,"slug":"ragxplain-from-explainable-evaluation-to","title":"RAGXplain: From Explainable Evaluation to Actionable Guidance of RAG Pipelines","date":"2025-05-18","arxiv_id":"2505.13538","repositories_listed":0,"syntology":null},{"url":null,"slug":"table-r1-region-based-reinforcement-learning","title":"Table-R1: Region-based Reinforcement Learning for Table Understanding","date":"2025-05-18","arxiv_id":"2505.12415","repositories_listed":0,"syntology":null},{"url":null,"slug":"automedeval-harnessing-language-models-for","title":"AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation","date":"2025-05-17","arxiv_id":"2505.11887","repositories_listed":0,"syntology":null},{"url":null,"slug":"belle-a-bi-level-multi-agent-reasoning","title":"BELLE: A Bi-Level Multi-Agent Reasoning Framework for Multi-Hop Question Answering","date":"2025-05-17","arxiv_id":"2505.11811","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-retrieval-joint-supervision-and","title":"Beyond Retrieval: Joint Supervision and Multimodal Document Ranking for Textbook Question Answering","date":"2025-05-17","arxiv_id":"2505.13520","repositories_listed":0,"syntology":null}],"record_sha256":"8cea96c0fadd8525552355d7c01d5f7f303c2d4df1ac92063d23ab7e515dba4c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}