{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/question-answering/papers/43","list_of":"/task/question-answering","task":"Question Answering","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":43,"pages_in_order":109,"rows_per_page":100,"rows":[4201,4300],"of":10817,"counts":{"archive_papers_tagged":10817,"with_a_code_link":4171,"where_syntology_ran_a_sample":1274,"not_listed_spam_title":0,"listed":10817,"listed_where_code_ran":1274,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1073,"every_run_a_failure_of_syntologys_instrument":201,"listed_with_a_run_with_no_instrument_failure":1073,"listed_every_run_a_failure_of_syntologys_instrument":201,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/question-answering","prev":"/task/question-answering/papers/42","next":"/task/question-answering/papers/44","papers":[{"url":null,"slug":"enhancing-biosecurity-in-tamper-resistant","title":"Enhancing Biosecurity in Tamper-Resistant Large Language Models With Quantum Gradient Descent","date":"2025-06-23","arxiv_id":"2506.19086","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-similarity-estimation-for-domain","title":"Semantic similarity estimation for domain specific data using BERT and other techniques","date":"2025-06-23","arxiv_id":"2506.18602","repositories_listed":0,"syntology":null},{"url":null,"slug":"gemex-thinkvg-towards-thinking-with-visual","title":"GEMeX-ThinkVG: Towards Thinking with Visual Grounding in Medical VQA via Reinforcement Learning","date":"2025-06-22","arxiv_id":"2506.17939","repositories_listed":0,"syntology":null},{"url":null,"slug":"mental-health-equity-in-llms-leveraging-multi","title":"Mental Health Equity in LLMs: Leveraging Multi-Hop Question Answering to Detect Amplified and Silenced Perspectives","date":"2025-06-22","arxiv_id":"2506.18116","repositories_listed":0,"syntology":null},{"url":null,"slug":"scene-r1-video-grounded-large-language-models","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","date":"2025-06-21","arxiv_id":"2506.17545","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-purpose-robotic-navigation-via-lvlm","title":"General-Purpose Robotic Navigation via LVLM-Orchestrated Perception, Reasoning, and Acting","date":"2025-06-20","arxiv_id":"2506.17462","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-common-vlms-rival-medical-vlms-evaluation","title":"Can Common VLMs Rival Medical VLMs? Evaluation and Strategic Insights","date":"2025-06-19","arxiv_id":"2506.17337","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-far-can-off-the-shelf-multimodal-large","title":"How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?","date":"2025-06-19","arxiv_id":"2506.16450","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-rag-to-agentic-validating-islamic","title":"From RAG to Agentic: Validating Islamic-Medicine Responses with LLM Agents","date":"2025-06-18","arxiv_id":"2506.15911","repositories_listed":0,"syntology":null},{"url":null,"slug":"megc2025-micro-expression-grand-challenge-on","title":"MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering","date":"2025-06-18","arxiv_id":"2506.15298","repositories_listed":0,"syntology":null},{"url":null,"slug":"wikimixqa-a-multimodal-benchmark-for-question","title":"WikiMixQA: A Multimodal Benchmark for Question Answering over Tables and Charts","date":"2025-06-18","arxiv_id":"2506.15594","repositories_listed":0,"syntology":null},{"url":null,"slug":"capo-reinforcing-consistent-reasoning-in","title":"CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making","date":"2025-06-15","arxiv_id":"2506.12849","repositories_listed":0,"syntology":null},{"url":null,"slug":"antigrounding-lifting-robotic-actions-into","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","date":"2025-06-14","arxiv_id":"2506.12374","repositories_listed":0,"syntology":null},{"url":null,"slug":"mm-r5-multimodal-reasoning-enhanced-reranker","title":"MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval","date":"2025-06-14","arxiv_id":"2506.12364","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-fast-reliable-and-secure-programming","title":"A Fast, Reliable, and Secure Programming Language for LLM Agents with Code Actions","date":"2025-06-13","arxiv_id":"2506.12202","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-multimodal-llms-on-recognition","title":"Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables","date":"2025-06-13","arxiv_id":"2506.11375","repositories_listed":0,"syntology":null},{"url":null,"slug":"instruction-tuning-and-cot-prompting-for","title":"Instruction Tuning and CoT Prompting for Contextual Medical QA with LLMs","date":"2025-06-13","arxiv_id":"2506.12182","repositories_listed":0,"syntology":null},{"url":null,"slug":"mtabvqa-evaluating-multi-tabular-reasoning-of","title":"MTabVQA: Evaluating Multi-Tabular Reasoning of Language Models in Visual Space","date":"2025-06-13","arxiv_id":"2506.11684","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-10312","title":"AC/DC: LLM-based Audio Comprehension via Dialogue Continuation","date":"2025-06-12","arxiv_id":"2506.10312","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-10857","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","date":"2025-06-12","arxiv_id":"2506.10857","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-we-infer-confidential-properties-of","title":"Can We Infer Confidential Properties of Training Data from LLMs?","date":"2025-06-12","arxiv_id":"2506.10364","repositories_listed":0,"syntology":null},{"url":null,"slug":"cogstream-context-guided-streaming-video","title":"CogStream: Context-guided Streaming Video Question Answering","date":"2025-06-12","arxiv_id":"2506.10516","repositories_listed":0,"syntology":null},{"url":null,"slug":"different-questions-different-models-fine","title":"Different Questions, Different Models: Fine-Grained Evaluation of Uncertainty and Calibration in Clinical QA with LLMs","date":"2025-06-12","arxiv_id":"2506.10769","repositories_listed":0,"syntology":null},{"url":null,"slug":"eqa-rm-a-generative-embodied-reward-model","title":"EQA-RM: A Generative Embodied Reward Model with Test-time Scaling","date":"2025-06-12","arxiv_id":"2506.10389","repositories_listed":0,"syntology":null},{"url":null,"slug":"halloc-token-level-localization-of-1","title":"HalLoc: Token-level Localization of Hallucinations for Vision Language Models","date":"2025-06-12","arxiv_id":"2506.10286","repositories_listed":0,"syntology":null},{"url":null,"slug":"medseg-r-reasoning-segmentation-in-medical","title":"MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models","date":"2025-06-12","arxiv_id":"2506.10465","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-at-archehr-qa-2025-agentic-prompt","title":"Neural at ArchEHR-QA 2025: Agentic Prompt Optimization for Evidence-Grounded Clinical Question Answering","date":"2025-06-12","arxiv_id":"2506.10751","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartreasoner-code-driven-modality-bridging","title":"ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering","date":"2025-06-11","arxiv_id":"2506.10116","repositories_listed":0,"syntology":null},{"url":null,"slug":"checkmanual-a-new-challenge-and-benchmark-for-1","title":"CheckManual: A New Challenge and Benchmark for Manual-based Appliance Manipulation","date":"2025-06-11","arxiv_id":"2506.09343","repositories_listed":0,"syntology":null},{"url":null,"slug":"kvasir-vqa-x1-a-multimodal-dataset-for","title":"Kvasir-VQA-x1: A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy","date":"2025-06-11","arxiv_id":"2506.09958","repositories_listed":0,"syntology":null},{"url":null,"slug":"provoking-multi-modal-few-shot-lvlm-via-1","title":"Provoking Multi-modal Few-Shot LVLM via Exploration-Exploitation In-Context Learning","date":"2025-06-11","arxiv_id":"2506.09473","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-08400","title":"mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks","date":"2025-06-10","arxiv_id":"2506.08400","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-08962","title":"WIP: Large Language Model-Enhanced Smart Tutor for Undergraduate Circuit Analysis","date":"2025-06-10","arxiv_id":"2506.08962","repositories_listed":0,"syntology":null},{"url":"/paper/an-open-source-software-toolkit-benchmark","slug":"an-open-source-software-toolkit-benchmark","title":"An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models","date":"2025-06-10","arxiv_id":"2506.09172","repositories_listed":0,"syntology":{"n":10,"n_ran":7,"n_constructed":0,"n_ran_checked":7,"n_instrument":0,"n_unverified":3,"n_honours":0,"n_violates":0,"n_no_contract":7,"n_pointer_only":0,"phrase":"7 ran (of which 0 constructed an object rather than computing a result; 7 with no instrument failure: 0 honoured, 0 violated, 7 with no contract checked; 0 where Syntology's instrument failed) · 3 unverified","sample_list":"/paper/an-open-source-software-toolkit-benchmark#ran","syntology_url":"https://syntology.ai/paper/2506.09172","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2506.09172"}},"official":null}},{"url":null,"slug":"efficient-context-selection-for-long-context","title":"Efficient Context Selection for Long-Context QA: No Tuning, No Iteration, Just Adaptive-$k$","date":"2025-06-10","arxiv_id":"2506.08479","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-llm-agents-for-financial-document","title":"Improved LLM Agents for Financial Document Question Answering","date":"2025-06-10","arxiv_id":"2506.08726","repositories_listed":0,"syntology":null},{"url":null,"slug":"phyblock-a-progressive-benchmark-for-physical","title":"PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly","date":"2025-06-10","arxiv_id":"2506.08708","repositories_listed":0,"syntology":null},{"url":null,"slug":"versavid-r1-a-versatile-video-understanding","title":"VersaVid-R1: A Versatile Video Understanding and Reasoning Model from Question Answering to Captioning Tasks","date":"2025-06-10","arxiv_id":"2506.09079","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-08276","title":"LEANN: A Low-Storage Vector Index","date":"2025-06-09","arxiv_id":"2506.08276","repositories_listed":0,"syntology":null},{"url":null,"slug":"aligning-text-images-and-3d-structure-token","title":"Aligning Text, Images, and 3D Structure Token-by-Token","date":"2025-06-09","arxiv_id":"2506.08002","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-in-context-learning-iterative","title":"Federated In-Context Learning: Iterative Refinement for Improved Answer Quality","date":"2025-06-09","arxiv_id":"2506.07440","repositories_listed":0,"syntology":null},{"url":"/paper/memoir-lifelong-model-editing-with-minimal","slug":"memoir-lifelong-model-editing-with-minimal","title":"MEMOIR: Lifelong Model Editing with Minimal Overwrite and Informed Retention for LLMs","date":"2025-06-09","arxiv_id":"2506.07899","repositories_listed":0,"syntology":{"n":4,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":2,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 2 unverified","sample_list":"/paper/memoir-lifelong-model-editing-with-minimal#ran","syntology_url":"https://syntology.ai/paper/2506.07899","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2506.07899"}},"official":null}},{"url":"/paper/recogdrive-a-reinforced-cognitive-framework","slug":"recogdrive-a-reinforced-cognitive-framework","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","date":"2025-06-09","arxiv_id":"2506.08052","repositories_listed":0,"syntology":null},{"url":null,"slug":"hallucination-at-a-glance-controlled-visual","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","date":"2025-06-08","arxiv_id":"2506.07227","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-clarify-by-reinforcement-learning","title":"Learning to Clarify by Reinforcement Learning Through Reward-Weighted Fine-Tuning","date":"2025-06-08","arxiv_id":"2506.06964","repositories_listed":0,"syntology":null},{"url":null,"slug":"lingshu-a-generalist-foundation-model-for","title":"Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning","date":"2025-06-08","arxiv_id":"2506.07044","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-adaptive-prompt-distillation-for-few","title":"Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering","date":"2025-06-07","arxiv_id":"2506.06905","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-state-of-the-art-in-lifelog-retrieval-a","title":"The State-of-the-Art in Lifelog Retrieval: A Review of Progress at the ACM Lifelog Search Challenge Workshop 2022-24","date":"2025-06-07","arxiv_id":"2506.06743","repositories_listed":0,"syntology":null},{"url":null,"slug":"biomol-mqa-a-multi-modal-question-answering","title":"BioMol-MQA: A Multi-Modal Question Answering Dataset For LLM Reasoning Over Bio-Molecular Interactions","date":"2025-06-06","arxiv_id":"2506.05766","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamicmind-a-tri-mode-thinking-system-for","title":"DynamicMind: A Tri-Mode Thinking System for Large Language Models","date":"2025-06-06","arxiv_id":"2506.05936","repositories_listed":0,"syntology":null},{"url":null,"slug":"maple-multi-agent-adaptive-planning-with-long","title":"MAPLE: Multi-Agent Adaptive Planning with Long-Term Memory for Table Reasoning","date":"2025-06-06","arxiv_id":"2506.05813","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-multi-llm-inference","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","date":"2025-06-06","arxiv_id":"2506.06579","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-04756","title":"Ontology-based knowledge representation for bone disease diagnosis: a foundation for safe and sustainable medical artificial intelligence systems","date":"2025-06-05","arxiv_id":"2506.04756","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-your-3d-encoder-really-work-when","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","date":"2025-06-05","arxiv_id":"2506.05318","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-choice-question-generation-using","title":"Multiple-Choice Question Generation Using Large Language Models: Methodology and Educator Insights","date":"2025-06-05","arxiv_id":"2506.04851","repositories_listed":0,"syntology":null},{"url":null,"slug":"textvidbench-a-benchmark-for-long-video-scene","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","date":"2025-06-05","arxiv_id":"2506.04983","repositories_listed":0,"syntology":null},{"url":null,"slug":"2506-04518","title":"Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model","date":"2025-06-04","arxiv_id":"2506.04518","repositories_listed":0,"syntology":null},{"url":null,"slug":"plugging-schema-graph-into-multi-table-qa-a","title":"Plugging Schema Graph into Multi-Table QA: A Human-Guided Framework for Reducing LLM Reliance","date":"2025-06-04","arxiv_id":"2506.04427","repositories_listed":0,"syntology":null},{"url":null,"slug":"rexvqa-a-large-scale-visual-question","title":"ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding","date":"2025-06-04","arxiv_id":"2506.04353","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-agent-framework-for-mitigating","title":"A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems","date":"2025-06-03","arxiv_id":"2506.02998","repositories_listed":0,"syntology":null},{"url":null,"slug":"expertlongbench-benchmarking-language-models","title":"ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists","date":"2025-06-02","arxiv_id":"2506.01241","repositories_listed":0,"syntology":null},{"url":null,"slug":"hanfu-bench-a-multimodal-benchmark-on-cross","title":"Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation","date":"2025-06-02","arxiv_id":"2506.01565","repositories_listed":0,"syntology":null},{"url":null,"slug":"iquest-an-iterative-question-guided-framework","title":"iQUEST: An Iterative Question-Guided Framework for Knowledge Base Question Answering","date":"2025-06-02","arxiv_id":"2506.01784","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sparsity-for-effective-and-efficient","title":"Learning Sparsity for Effective and Efficient Music Performance Question Answering","date":"2025-06-02","arxiv_id":"2506.01319","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-graph-retrieval-augmented-generation","title":"A Graph-Retrieval-Augmented Generation Framework Enhances Decision-Making in the Circular Economy","date":"2025-06-01","arxiv_id":"2506.04252","repositories_listed":0,"syntology":null},{"url":null,"slug":"anyecg-chat-a-generalist-ecg-mllm-for","title":"anyECG-chat: A Generalist ECG-MLLM for Flexible ECG Input and Multi-Task Understanding","date":"2025-06-01","arxiv_id":"2506.00942","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-or-slow-integrating-fast-intuition-and","title":"Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering","date":"2025-06-01","arxiv_id":"2506.00806","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-linear-patch-revives-layer-pruned","title":"A Simple Linear Patch Revives Layer-Pruned Large Language Models","date":"2025-05-30","arxiv_id":"2505.24680","repositories_listed":0,"syntology":null},{"url":null,"slug":"clinbench-hpb-a-clinical-benchmark-for","title":"ClinBench-HPB: A Clinical Benchmark for Evaluating LLMs in Hepato-Pancreato-Biliary Diseases","date":"2025-05-30","arxiv_id":"2506.00095","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-impact-of-occupational-personas","title":"Exploring the Impact of Occupational Personas on Domain-Specific QA","date":"2025-05-30","arxiv_id":"2505.24448","repositories_listed":0,"syntology":null},{"url":null,"slug":"grid-logat-grid-based-local-and-global-area","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","date":"2025-05-30","arxiv_id":"2505.24371","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-reliability-and-explainability-of","title":"Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs","date":"2025-05-30","arxiv_id":"2505.24830","repositories_listed":0,"syntology":null},{"url":null,"slug":"lamp-qa-a-benchmark-for-personalized-long","title":"LaMP-QA: A Benchmark for Personalized Long-form Question Answering","date":"2025-05-30","arxiv_id":"2506.00137","repositories_listed":0,"syntology":null},{"url":null,"slug":"light-as-deception-gpt-driven-natural","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","date":"2025-05-30","arxiv_id":"2505.24227","repositories_listed":0,"syntology":null},{"url":null,"slug":"medorch-medical-diagnosis-with-tool-augmented","title":"MedOrch: Medical Diagnosis with Tool-Augmented Reasoning Agents for Flexible Extensibility","date":"2025-05-30","arxiv_id":"2506.00235","repositories_listed":0,"syntology":null},{"url":null,"slug":"pangu-deepdiver-adaptive-search-intensity","title":"Pangu DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning","date":"2025-05-30","arxiv_id":"2505.24332","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-llms-are-bad-at-hierarchical-visual","title":"Vision LLMs Are Bad at Hierarchical Visual Understanding, and LLMs Are the Bottleneck","date":"2025-05-30","arxiv_id":"2505.24840","repositories_listed":0,"syntology":null},{"url":null,"slug":"vudg-a-dataset-for-video-understanding-domain","title":"VUDG: A Dataset for Video Understanding Domain Generalization","date":"2025-05-30","arxiv_id":"2505.24346","repositories_listed":0,"syntology":null},{"url":null,"slug":"chartmind-a-comprehensive-benchmark-for","title":"ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering","date":"2025-05-29","arxiv_id":"2505.23242","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-meta-models-for-evaluation-of","title":"Data-efficient Meta-models for Evaluation of Context-based Questions and Answers in LLMs","date":"2025-05-29","arxiv_id":"2505.23299","repositories_listed":0,"syntology":null},{"url":null,"slug":"diagnosing-and-addressing-pitfalls-in-kg-rag","title":"Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking","date":"2025-05-29","arxiv_id":"2505.23495","repositories_listed":0,"syntology":null},{"url":null,"slug":"differential-information-an-information","title":"Differential Information: An Information-Theoretic Perspective on Preference Optimization","date":"2025-05-29","arxiv_id":"2505.23761","repositories_listed":0,"syntology":null},{"url":null,"slug":"fortune-formula-driven-reinforcement-learning","title":"Fortune: Formula-Driven Reinforcement Learning for Symbolic Table Reasoning in Language Models","date":"2025-05-29","arxiv_id":"2505.23667","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-chat-logs-to-collective-insights","title":"From Chat Logs to Collective Insights: Aggregative Question Answering","date":"2025-05-29","arxiv_id":"2505.23765","repositories_listed":0,"syntology":null},{"url":null,"slug":"let-s-reason-formally-natural-formal-hybrid","title":"Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability","date":"2025-05-29","arxiv_id":"2505.23703","repositories_listed":0,"syntology":null},{"url":null,"slug":"medpair-measuring-physicians-and-ai-relevance","title":"MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering","date":"2025-05-29","arxiv_id":"2505.24040","repositories_listed":0,"syntology":null},{"url":null,"slug":"mrag-elucidating-the-design-space-of-multi","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","date":"2025-05-29","arxiv_id":"2505.24073","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-better-verbalized","title":"Reinforcement Learning for Better Verbalized Confidence in Long-Form Generation","date":"2025-05-29","arxiv_id":"2505.23912","repositories_listed":0,"syntology":null},{"url":null,"slug":"spoken-question-answering-for-visual-queries","title":"Spoken question answering for visual queries","date":"2025-05-29","arxiv_id":"2505.23308","repositories_listed":0,"syntology":null},{"url":null,"slug":"tcm-ladder-a-benchmark-for-multimodal","title":"TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine","date":"2025-05-29","arxiv_id":"2505.24063","repositories_listed":0,"syntology":null},{"url":null,"slug":"3dllm-mem-long-term-spatial-temporal-memory","title":"3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model","date":"2025-05-28","arxiv_id":"2505.22657","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-unirag-a-trainable-open-source-llm","title":"Agent-UniRAG: A Trainable Open-Source LLM Agent Framework for Unified Retrieval-Augmented Generation Systems","date":"2025-05-28","arxiv_id":"2505.22571","repositories_listed":0,"syntology":null},{"url":null,"slug":"er-reason-a-benchmark-dataset-for-llm-based","title":"ER-REASON: A Benchmark Dataset for LLM-Based Clinical Reasoning in the Emergency Room","date":"2025-05-28","arxiv_id":"2505.22919","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolvesearch-an-iterative-self-evolving","title":"EvolveSearch: An Iterative Self-Evolving Search Agent","date":"2025-05-28","arxiv_id":"2505.22501","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-qa-efficiency-with-distilbert-fine","title":"Improving QA Efficiency with DistilBERT: Fine-Tuning and Inference on mobile Intel CPUs","date":"2025-05-28","arxiv_id":"2505.22937","repositories_listed":0,"syntology":null},{"url":null,"slug":"negvqa-can-vision-language-models-understand","title":"NegVQA: Can Vision Language Models Understand Negation?","date":"2025-05-28","arxiv_id":"2505.22946","repositories_listed":0,"syntology":null},{"url":null,"slug":"read-your-own-mind-reasoning-helps-surface","title":"Read Your Own Mind: Reasoning Helps Surface Self-Confidence Signals in LLMs","date":"2025-05-28","arxiv_id":"2505.23845","repositories_listed":0,"syntology":null},{"url":null,"slug":"stresstest-can-your-speech-lm-handle-the","title":"StressTest: Can YOUR Speech LM Handle the Stress?","date":"2025-05-28","arxiv_id":"2505.22765","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-memory-mechanisms-for-stable","title":"Structured Memory Mechanisms for Stable Context Representation in Large Language Models","date":"2025-05-28","arxiv_id":"2505.22921","repositories_listed":0,"syntology":null},{"url":null,"slug":"driverx-a-vision-language-reasoning-model-for","title":"DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving","date":"2025-05-27","arxiv_id":"2505.20665","repositories_listed":0,"syntology":null}],"record_sha256":"1783325bfac1536df8349b803b27e97ca465090afc37f71bb2b05933288956c6","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}