{"url":"/task/referring-expression-generation","name":"Referring expression generation","slug":"referring-expression-generation","description_markdown":"Generate referring expressions","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":84,"papers_with_code":26,"benchmarks":2,"benchmark_tables_in_archive":2,"benchmark_tables_shown":2,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":4,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/referring-expression-generation-on-coloninst","slug":"referring-expression-generation-on-coloninst","dataset":"ColonINST-v1 (Seen)","dataset_url":"/dataset/coloninst-v1-seen","rows_in_archive":17,"metrics":["Accuray"],"first_row_in_archive_order":{"model":"ColonGPT (w/ LoRA, w/o extra data)","paper_title":"Frontiers in Intelligent Colonoscopy","paper_url":"/paper/frontiers-in-intelligent-colonoscopy","paper_date":"2024-10-22","arxiv_id":"2410.17241","code_links":[{"title":"ai4colonoscopy/intelliscope","url":"https://github.com/ai4colonoscopy/intelliscope"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/referring-expression-generation-on-coloninst-1","slug":"referring-expression-generation-on-coloninst-1","dataset":"ColonINST-v1 (Unseen)","dataset_url":"/dataset/coloninst-v1-uneen","rows_in_archive":17,"metrics":["Accuray"],"first_row_in_archive_order":{"model":"ColonGPT (w/ LoRA, w/o extra data)","paper_title":"Frontiers in Intelligent Colonoscopy","paper_url":"/paper/frontiers-in-intelligent-colonoscopy","paper_date":"2024-10-22","arxiv_id":"2410.17241","code_links":[{"title":"ai4colonoscopy/intelliscope","url":"https://github.com/ai4colonoscopy/intelliscope"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/coloninst-v1","name":"ColonINST-v1","full_name":"","num_papers_in_archive":8},{"url":"/dataset/coloninst-v1-seen","name":"ColonINST-v1 (Seen)","full_name":"","num_papers_in_archive":8},{"url":"/dataset/coloninst-v1-uneen","name":"ColonINST-v1 (Unseen)","full_name":"","num_papers_in_archive":8},{"url":"/dataset/a-game-of-sorts","name":"A Game Of Sorts","full_name":"","num_papers_in_archive":4}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":26,"of":26,"tagged_in_all":84,"items":[{"url":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","arxiv_id":"2304.08485","repositories_listed":13,"syntology":{"n":51,"n_ran":16,"n_unverified":35,"n_pointer_only":0}},{"url":"/paper/improved-baselines-with-visual-instruction","title":"Improved Baselines with Visual Instruction Tuning","date":"2023-10-05","arxiv_id":"2310.03744","repositories_listed":9,"syntology":{"n":9,"n_ran":6,"n_unverified":3,"n_pointer_only":8}},{"url":"/paper/modeling-context-in-referring-expressions","title":"Modeling Context in Referring Expressions","date":"2016-07-31","arxiv_id":"1608.00272","repositories_listed":4,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/mini-gemini-mining-the-potential-of-multi","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","date":"2024-03-27","arxiv_id":"2403.18814","repositories_listed":2,"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/minigpt-v2-large-language-model-as-a-unified","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","date":"2023-10-14","arxiv_id":"2310.09478","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/kosmos-2-grounding-multimodal-large-language","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","date":"2023-06-26","arxiv_id":"2306.14824","repositories_listed":2,"syntology":null},{"url":"/paper/vision-language-models-are-not-pragmatically","title":"Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation","date":"2025-04-22","arxiv_id":"2504.16060","repositories_listed":1,"syntology":null},{"url":"/paper/frontiers-in-intelligent-colonoscopy","title":"Frontiers in Intelligent Colonoscopy","date":"2024-10-22","arxiv_id":"2410.17241","repositories_listed":1,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/grounding-language-in-multi-perspective","title":"Grounding Language in Multi-Perspective Referential Communication","date":"2024-10-04","arxiv_id":"2410.03959","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/uni-med-a-unified-medical-generalist","title":"Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE","date":"2024-09-26","arxiv_id":"2409.17508","repositories_listed":1,"syntology":null},{"url":"/paper/referring-expression-generation-in-visually","title":"Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding","date":"2024-09-09","arxiv_id":"2409.05721","repositories_listed":1,"syntology":null},{"url":"/paper/resilience-through-scene-context-in-visual","title":"Resilience through Scene Context in Visual Referring Expression Generation","date":"2024-04-18","arxiv_id":"2404.12289","repositories_listed":1,"syntology":null},{"url":"/paper/elysium-exploring-object-level-perception-in","title":"Elysium: Exploring Object-level Perception in Videos via MLLM","date":"2024-03-25","arxiv_id":"2403.16558","repositories_listed":1,"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":8}},{"url":"/paper/multi-modal-instruction-tuned-llms-with-fine","title":"Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception","date":"2024-03-05","arxiv_id":"2403.02969","repositories_listed":1,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/efficient-multimodal-learning-from-data","title":"Efficient Multimodal Learning from Data-centric Perspective","date":"2024-02-18","arxiv_id":"2402.11530","repositories_listed":1,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/mobilevlm-a-fast-reproducible-and-strong","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","date":"2023-12-28","arxiv_id":"2312.16886","repositories_listed":1,"syntology":null},{"url":"/paper/glamm-pixel-grounding-large-multimodal-model","title":"GLaMM: Pixel Grounding Large Multimodal Model","date":"2023-11-06","arxiv_id":"2311.03356","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/collecting-visually-grounded-dialogue-with-a-1","title":"Collecting Visually-Grounded Dialogue with A Game Of Sorts","date":"2023-09-10","arxiv_id":"2309.05162","repositories_listed":1,"syntology":null},{"url":"/paper/whether-you-can-locate-or-not-interactive","title":"Whether you can locate or not? Interactive Referring Expression Generation","date":"2023-08-19","arxiv_id":"2308.09977","repositories_listed":1,"syntology":null},{"url":"/paper/llava-med-training-a-large-language-and","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","date":"2023-06-01","arxiv_id":"2306.00890","repositories_listed":1,"syntology":null},{"url":"/paper/pento-diaref-a-diagnostic-dataset-for","title":"Pento-DIARef: A Diagnostic Dataset for Learning the Incremental Algorithm for Referring Expression Generation from Examples","date":"2023-05-24","arxiv_id":"2305.15087","repositories_listed":1,"syntology":null},{"url":"/paper/enriching-the-e2e-dataset","title":"Enriching the E2E dataset","date":"2021-08-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/190909986","title":"Improving Quality and Efficiency in Plan-based Neural Data-to-Text Generation","date":"2019-09-22","arxiv_id":"1909.09986","repositories_listed":1,"syntology":null},{"url":"/paper/referring-expression-generation-using-entity","title":"Referring Expression Generation Using Entity Profiles","date":"2019-09-04","arxiv_id":"1909.01528","repositories_listed":1,"syntology":null},{"url":"/paper/enriching-the-webnlg-corpus","title":"Enriching the WebNLG corpus","date":"2018-11-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/neuralreg-an-end-to-end-approach-to-referring","title":"NeuralREG: An end-to-end approach to referring expression generation","date":"2018-05-21","arxiv_id":"1805.08093","repositories_listed":1,"syntology":null}],"syntology_records":11,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}