{"url":"/dataset/coloninst-v1-seen","name":"ColonINST-v1 (Seen)","full_name":null,"description_markdown":"ColonINST is a large-scale instruction tuning dataset designed for multimodal analysis in colonoscopy. This dataset comprises 62 categories, 303,001 colonoscopy images, including 128,620 positive and 174,381 negative cases collected from 19 publicly available datasets.  We enhanced 128,620 colonoscopy images with detailed captions using a pipeline that interacts with GPT-4V through custom prompts, enriching the dataset for AI model training.   We finally restructured 450,724 visual dialogues to guide the AI model through four downstream tasks critical for mutlimodal medical AI applications.","description_withheld":null,"homepage":"","introduced_date":null,"introduced_date_note":null,"introduced_by":null,"license":null,"modalities":[],"tasks":[{"name":"Image Classification","url":"/task/image-classification","datasets_with_task":"/datasets/task/image-classification"},{"name":"Referring Expression Comprehension","url":"/task/referring-expression-comprehension","datasets_with_task":"/datasets/task/referring-expression-comprehension"},{"name":"Referring expression generation","url":"/task/referring-expression-generation","datasets_with_task":"/datasets/task/referring-expression-generation"}],"languages":[],"variants":["ColonINST-v1 (Seen)"],"data_loaders":[],"num_papers_in_archive":8,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/image-classification-on-coloninst-v1-seen","task":"Image Classification","dataset_variant":"ColonINST-v1 (Seen)","rows":17,"metrics":["Accuray"],"first_row_in_archive_order":{"model":"ColonGPT (w/ LoRA, w/o extra data)","paper":"/paper/frontiers-in-intelligent-colonoscopy","metrics":{"Accuray":"94.06"},"code_links":[{"title":"ai4colonoscopy/intelliscope","url":"https://github.com/ai4colonoscopy/intelliscope"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/referring-expression-generation-on-coloninst","task":"Referring expression generation","dataset_variant":"ColonINST-v1 (Seen)","rows":17,"metrics":["Accuray"],"first_row_in_archive_order":{"model":"ColonGPT (w/ LoRA, w/o extra data)","paper":"/paper/frontiers-in-intelligent-colonoscopy","metrics":{"Accuray":"99.96"},"code_links":[{"title":"ai4colonoscopy/intelliscope","url":"https://github.com/ai4colonoscopy/intelliscope"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/frontiers-in-intelligent-colonoscopy","title":"Frontiers in Intelligent Colonoscopy","date":"2024-10-22","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":0,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mini-gemini-mining-the-potential-of-multi","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","date":"2024-03-27","rows_on_this_dataset":4,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":7,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/efficient-multimodal-learning-from-data","title":"Efficient Multimodal Learning from Data-centric Perspective","date":"2024-02-18","rows_on_this_dataset":4,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":4,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mobilevlm-a-fast-reproducible-and-strong","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","date":"2023-12-28","rows_on_this_dataset":4,"code_links":1,"syntology":null},{"paper":"/paper/minigpt-v2-large-language-model-as-a-unified","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","date":"2023-10-14","rows_on_this_dataset":4,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/improved-baselines-with-visual-instruction","title":"Improved Baselines with Visual Instruction Tuning","date":"2023-10-05","rows_on_this_dataset":4,"code_links":9,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":6,"samples_unverified":3,"pointer_only_for_licence":8,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/llava-med-training-a-large-language-and","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","date":"2023-06-01","rows_on_this_dataset":8,"code_links":1,"syntology":null},{"paper":"/paper/visual-instruction-tuning-1","title":"Visual Instruction Tuning","date":"2023-04-17","rows_on_this_dataset":4,"code_links":13,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":51,"samples_ran":16,"samples_unverified":35,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":6,"samples_harvested":84,"samples_ran":36,"samples_unverified":48,"pointer_only_for_licence":9,"papers_with_no_sample_that_ran":1,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}