{"url":"/task/long-form-question-answering","name":"Long Form Question Answering","slug":"long-form-question-answering","description_markdown":"Long-form question answering is a task requiring elaborate and in-depth answers to open-ended questions.","categories":[{"name":"Miscellaneous","url":"/area/miscellaneous"},{"name":"Natural Language Processing","url":"/area/natural-language-processing"},{"name":"Reasoning","url":"/area/reasoning"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":61,"papers_with_code":32,"benchmarks":0,"benchmark_tables_in_archive":0,"benchmark_tables_shown":0,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":5,"subtasks":0,"parent_tasks":1},"benchmarks":[],"datasets":[{"url":"/dataset/eli5","name":"ELI5","full_name":"ELI5","num_papers_in_archive":158},{"url":"/dataset/quality","name":"QuALITY","full_name":"Question Answering with Long Input Texts, Yes!","num_papers_in_archive":98},{"url":"/dataset/lleqa","name":"LLeQA","full_name":"Long-form Legal Question Answering","num_papers_in_archive":3},{"url":"/dataset/darai","name":"DARai","full_name":"Daily Activity Recordings for AI and ML applications","num_papers_in_archive":1},{"url":"/dataset/mminstruct-gpt4v","name":"MMInstruct-GPT4V","full_name":"MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[{"url":"/task/question-answering","name":"Question Answering"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":32,"tagged_in_all":61,"items":[{"url":"/paper/eli5-long-form-question-answering","title":"ELI5: Long Form Question Answering","date":"2019-07-22","arxiv_id":"1907.09190","repositories_listed":3,"syntology":{"n":11,"n_ran":10,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/semqa-semi-extractive-multi-source-question","title":"SEMQA: Semi-Extractive Multi-Source Question Answering","date":"2023-11-08","arxiv_id":"2311.04886","repositories_listed":2,"syntology":null},{"url":"/paper/beyond-one-preference-for-all-multi-objective","title":"Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization","date":"2023-10-05","arxiv_id":"2310.03708","repositories_listed":2,"syntology":null},{"url":"/paper/longform-optimizing-instruction-tuning-for","title":"LongForm: Effective Instruction Tuning with Reverse Instructions","date":"2023-04-17","arxiv_id":"2304.08460","repositories_listed":2,"syntology":null},{"url":"/paper/hurdles-to-progress-in-long-form-question","title":"Hurdles to Progress in Long-form Question Answering","date":"2021-03-10","arxiv_id":"2103.06332","repositories_listed":2,"syntology":null},{"url":"/paper/generationprograms-fine-grained-attribution","title":"GenerationPrograms: Fine-grained Attribution with Executable Programs","date":"2025-06-17","arxiv_id":"2506.14580","repositories_listed":1,"syntology":null},{"url":"/paper/atomic-consistency-preference-optimization","title":"Atomic Consistency Preference Optimization for Long-Form Question Answering","date":"2025-05-14","arxiv_id":"2505.09039","repositories_listed":1,"syntology":null},{"url":"/paper/an-empirical-study-of-evaluating-long-form","title":"An Empirical Study of Evaluating Long-form Question Answering","date":"2025-04-25","arxiv_id":"2504.18413","repositories_listed":1,"syntology":null},{"url":"/paper/on-the-influence-of-context-size-and-model","title":"On the Influence of Context Size and Model Choice in Retrieval-Augmented Generation Systems","date":"2025-02-20","arxiv_id":"2502.14759","repositories_listed":1,"syntology":null},{"url":"/paper/how-much-do-llms-hallucinate-across-languages","title":"How Much Do LLMs Hallucinate across Languages? On Multilingual Estimation of LLM Hallucination in the Wild","date":"2025-02-18","arxiv_id":"2502.12769","repositories_listed":1,"syntology":null},{"url":"/paper/selfcite-self-supervised-alignment-for","title":"SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models","date":"2025-02-13","arxiv_id":"2502.09604","repositories_listed":1,"syntology":null},{"url":"/paper/a-claim-decomposition-benchmark-for-long-form","title":"A Claim Decomposition Benchmark for Long-form Answer Verification","date":"2024-10-16","arxiv_id":"2410.12558","repositories_listed":1,"syntology":null},{"url":"/paper/ancient-wisdom-modern-tools-exploring","title":"Ancient Wisdom, Modern Tools: Exploring Retrieval-Augmented LLMs for Ancient Indian Philosophy","date":"2024-08-21","arxiv_id":"2408.11903","repositories_listed":1,"syntology":null},{"url":"/paper/putting-people-in-llms-shoes-generating","title":"Putting People in LLMs' Shoes: Generating Better Answers via Question Rewriter","date":"2024-08-20","arxiv_id":"2408.10573","repositories_listed":1,"syntology":null},{"url":"/paper/fine-grained-hallucination-detection-and-1","title":"Localizing and Mitigating Errors in Long-form Question Answering","date":"2024-07-16","arxiv_id":"2407.11930","repositories_listed":1,"syntology":null},{"url":"/paper/anah-v2-scaling-analytical-hallucination","title":"ANAH-v2: Scaling Analytical Hallucination Annotation of Large Language Models","date":"2024-07-05","arxiv_id":"2407.04693","repositories_listed":1,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/calmqa-exploring-culturally-specific-long","title":"CaLMQA: Exploring culturally specific long-form question answering across 23 languages","date":"2024-06-25","arxiv_id":"2406.17761","repositories_listed":1,"syntology":null},{"url":"/paper/olaph-improving-factuality-in-biomedical-long","title":"OLAPH: Improving Factuality in Biomedical Long-form Question Answering","date":"2024-05-21","arxiv_id":"2405.12701","repositories_listed":1,"syntology":null},{"url":"/paper/clapnq-cohesive-long-form-answers-from","title":"CLAPNQ: Cohesive Long-form Answers from Passages in Natural Questions for RAG systems","date":"2024-04-02","arxiv_id":"2404.02103","repositories_listed":1,"syntology":null},{"url":"/paper/attribute-first-then-generate-locally","title":"Attribute First, then Generate: Locally-attributable Grounded Text Generation","date":"2024-03-25","arxiv_id":"2403.17104","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/alarm-align-language-models-via-hierarchical","title":"ALaRM: Align Language Models via Hierarchical Rewards Modeling","date":"2024-03-11","arxiv_id":"2403.06754","repositories_listed":1,"syntology":{"n":14,"n_ran":7,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/kg-rank-enhancing-large-language-models-for","title":"KG-Rank: Enhancing Large Language Models for Medical QA with Knowledge Graphs and Ranking Techniques","date":"2024-03-09","arxiv_id":"2403.05881","repositories_listed":1,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":5}},{"url":"/paper/reinforcement-replaces-supervision-query","title":"Reinforcement Replaces Supervision: Query focused Summarization using Deep Reinforcement Learning","date":"2023-11-29","arxiv_id":"2311.17514","repositories_listed":1,"syntology":null},{"url":"/paper/fine-grained-human-feedback-gives-better","title":"Fine-Grained Human Feedback Gives Better Rewards for Language Model Training","date":"2023-06-02","arxiv_id":"2306.01693","repositories_listed":1,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/concise-answers-to-complex-questions","title":"Concise Answers to Complex Questions: Summarization of Long-form Answers","date":"2023-05-30","arxiv_id":"2305.19271","repositories_listed":1,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":5}},{"url":"/paper/a-critical-evaluation-of-evaluations-for-long","title":"A Critical Evaluation of Evaluations for Long-form Question Answering","date":"2023-05-29","arxiv_id":"2305.18201","repositories_listed":1,"syntology":null},{"url":"/paper/revisiting-sentence-union-generation-as-a","title":"Revisiting Sentence Union Generation as a Testbed for Text Consolidation","date":"2023-05-24","arxiv_id":"2305.15605","repositories_listed":1,"syntology":null},{"url":"/paper/webcpm-interactive-web-search-for-chinese","title":"WebCPM: Interactive Web Search for Chinese Long-form Question Answering","date":"2023-05-11","arxiv_id":"2305.06849","repositories_listed":1,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/search-in-the-chain-towards-the-accurate","title":"Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks","date":"2023-04-28","arxiv_id":"2304.14732","repositories_listed":1,"syntology":null},{"url":"/paper/d2s-document-to-slide-generation-via-query","title":"D2S: Document-to-Slide Generation Via Query-Based Text Summarization","date":"2021-05-08","arxiv_id":"2105.03664","repositories_listed":1,"syntology":null}],"syntology_records":8,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}