{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/language-integration-in-fine-tuning","title":"Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression","arxiv_id":null,"date":"2025-07-20","proceeding":null,"authors":["Roy H. Jennings","Genady Paikin","Roy Shaul","Evgeny Soloveichik"],"abstract":"Multimodal Large Language Models (MLLMs) show promise for image-based regression tasks, but current approaches face key limitations. Recent methods fine-tune MLLMs using preset output vocabularies and generic task-level prompts (e.g., \"How would you rate this image?\"), assuming this mimics human rating behavior. Our analysis reveals these approaches provide no benefit over image-only training. Models using preset vocabularies and generic prompts perform equivalently to image-only models, failing to leverage semantic understanding from textual input. We propose Regression via Transformer-Based Classification (RvTC), which replaces vocabulary-constrained classification with a flexible bin-based approach. Unlike approaches that address discretization errors through complex distributional modeling, RvTC eliminates manual vocabulary crafting through straightforward bin increase, achieving state-of-the-art performance on four image assessment datasets using only images. More importantly, we demonstrate that data-specific prompts dramatically improve performance. Unlike generic task descriptions, prompts containing semantic information about specific images enable MLLMs to leverage cross-modal understanding. On the AVA dataset, adding challenge titles to prompts improves correlations from 0.83 to 0.90, a new state-of-the-art. We demonstrate through empirical evidence from the AVA and AGIQA-3k datasets that MLLMs benefit from semantic prompt information surpassing mere statistical biases. This underscores the importance of incorporating meaningful textual context in multimodal regression tasks.","url_abs":"https://arxiv.org/abs/2507.14997","url_pdf":"https://arxiv.org/pdf/2507.14997","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"aesthetics-quality-assessment","task_name":"Aesthetics Quality Assessment"},{"task_slug":"no-reference-image-quality-assessment","task_name":"No-Reference Image Quality Assessment"},{"task_slug":"regression-1","task_name":"regression"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/aesthetics-quality-assessment-on-aesthetic","task":"Aesthetics Quality Assessment","dataset":"Aesthetic Visual Analysis","model":"RvTC+","rank_in_archive_order":1,"of":3,"metrics":{"PLCC":"0.901","SRCC":"0.899"},"uses_additional_data":true},{"leaderboard":"/sota/aesthetics-quality-assessment-on-aesthetic","task":"Aesthetics Quality Assessment","dataset":"Aesthetic Visual Analysis","model":"RvTC (image-only)","rank_in_archive_order":2,"of":3,"metrics":{"PLCC":"0.831","SRCC":"0.833"},"uses_additional_data":false},{"leaderboard":"/sota/no-reference-image-quality-assessment-on-1","task":"No-Reference Image Quality Assessment","dataset":"KADID-10k","model":"RvTC (image-only)","rank_in_archive_order":1,"of":9,"metrics":{"PLCC":"0.98","SRCC":"0.98"},"uses_additional_data":false},{"leaderboard":"/sota/no-reference-image-quality-assessment-on-2","task":"No-Reference Image Quality Assessment","dataset":"KonIQ-10k","model":"RvTC (image-only)","rank_in_archive_order":1,"of":1,"metrics":{"PLCC":"0.95","SRCC":"0.94"},"uses_additional_data":false},{"leaderboard":"/sota/no-reference-image-quality-assessment-on-spaq","task":"No-Reference Image Quality Assessment","dataset":"SPAQ","model":"RvTC (image-only)","rank_in_archive_order":1,"of":1,"metrics":{"PLCC":"0.93","SRCC":"0.93"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}