EvoQuality
EvoQuality
摘要
EvoQuality 是一种自进化视觉语言模型(VLM),用于无参考图像质量评估(NR-IQA),由 Wen 等人提出,发表于 ICLR 2026。该模型以 Qwen2.5-VL-7B 为骨干,通过成对多数投票生成伪排序标签,并利用 GRPO 进行强化学习迭代优化,无需人工标注。在 zero-shot 评估中,PLCC 从 0.615 提升至 0.770,SRCC 从 0.570 提升至 0.726,在多个 benchmark 上超越若干有监督方法。
EvoQuality
1. 模型概述
- 模型名称:EvoQuality(用于图像质量评估的自进化视觉语言模型)
- 任务:无参考图像质量评估(NR-IQA),支持单图像质量评分和成对质量比较(排序)
- 核心思想:不依赖任何人工标注的质量分数或失真类型标签,EvoQuality 通过成对多数投票生成伪排序标签,并通过 GRPO 将其转化为可优化的奖励信号,从而迭代式地自进化其质量感知能力
- 论文:Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking(ICLR 2026,arXiv:2509.25787)
2. 模型与框架细节
- 骨干模型(论文设定):
Qwen2.5-VL-7B(用作基线 policy) - 训练范式:两阶段循环,支持多轮迭代(论文中
T=2)- 离线阶段(伪标签):对随机采样的图像对进行
K次比较,然后通过多数投票推导出伪偏好p*(xi, xj) - 在线阶段(强化学习):将伪偏好转化为保真度奖励,并通过 Group Relative Policy Optimization(GRPO) 更新 policy(对 VLM 进行全参数微调)
- 离线阶段(伪标签):对随机采样的图像对进行
3. 提示词
- 离线比较
c_compare:<image><image> You are performing an image quality assessment task. Compare the two images and decide which one has better perceptual quality. Answer strictly with the index of the better image: 0 if the first image is better, or 1 if the second image is better.
- 在线评分
c_score:<image> You are doing the image quality assessment task. Here is the question: What is your overall rating on the quality of this picture? The rating should be a float between 1 and 5, rounded to two decimal places, with 1 representing very poor quality and 5 representing excellent quality.
- 推理后缀(用于自一致性采样):
You FIRST think about the reasoning process as an internal monologue and then provide the final answer. The reasoning process MUST BE enclosed within <think> </think> tags. The final answer MUST BE put in boxed{}.
4. 训练
- 迭代轮数:
T = 1(开源模型权重为第一轮自进化的结果) - 训练数据:在生成发布的权重时,未添加额外的合成失真数据或额外标注标签
- 离线阶段:
- 每对图像采样
K=32次响应,然后通过多数投票推导出伪标签 - 随机交换图像顺序以减轻位置偏差
- 每对图像采样
- 在线阶段(GRPO):
- 每个样本(
c_score)采样K=32次响应 - 优化器:AdamW,初始学习率
3e-7,线性衰减 - KL 系数:
beta = 0.05 - 资源(论文报告):8x NVIDIA A100,每 GPU batch size = 4,约 12 小时/epoch
- 每个样本(
5. 评估指标
- 评估设定:zero-shot(在目标测试集上未进行训练)
- 指标:PLCC、SRCC(与人类主观质量的一致性)
6. 主要结果
- 相比骨干模型(Qwen2.5-VL-7B)的提升:多个 benchmark 的加权平均(WA VG.)
- PLCC:
0.615 -> 0.770(+31.8%) - SRCC:
0.570 -> 0.726(+33.7%)
- PLCC:
- 泛化能力:在多种失真类型和 AI 生成内容上均取得显著提升,在多个 benchmark 上达到或超越若干有监督 VLM-IQA 方法(详细表格见论文)
7. 预期用途与使用指南
- 推荐用途
- 研究与评估:NR-IQA、跨数据集泛化比较、质量排序/筛选、数据清洗的辅助信号
- 预生产评估:作为感知质量代理,但应结合业务数据和人工抽检验证
- 不推荐用途
- 作为高风险决策(内容审核、医学影像诊断结论、法律证据判定等)的唯一质量标准
- 将模型输出视为"绝对客观真值"(IQA 本质上是主观的,且与人群偏好相关)
- 输出说明
- 论文中的提示词要求输出格式为
<think>...</think>加上boxed{score};实际集成时,建议仅解析boxed{}内的数值,并考虑 temperature/采样策略对一致性的影响
- 论文中的提示词要求输出格式为
8. 局限性与已知风险
- 自监督伪标签偏差:伪排序来源于模型自身的投票,可能放大骨干模型的系统性偏好或盲区
- 领域偏移:在特定领域(医学、遥感、工业检测)的图像上可能失效
- 主观性与人群差异:不同的文化/审美偏好和任务目标(美学 vs. 清晰度)会改变"质量"的定义
- 提示词敏感性:提示词变化、采样数量 K 和解码策略会影响自一致性投票和最终性能
9. 引用
@article{wen2025selfevolving,
title={Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking},
author={Wen, Wen and Zhi, Tianwu and Fan, Kanglong and Li, Yang and Peng, Xinge and Zhang, Yabin and Liao, Yiting and Li, Junlin and Zhang, Li},
journal={arXiv preprint arXiv:2509.25787},
year={2025}
}
译自 ByteDance · HF · 字节跳动 · 录于 二〇二六年八月二十六日