火影忍者木叶高手战力怎样提升
2026-07-21 3415035
2026-07-21 0
让大模型给一张图片打“质量分”,它其实经常看走眼。
一张干净的照片,和它偷偷加了噪声、被压过、糊了一点的“退化版”,在你我眼里质量天差地别——但在多模态大模型(MLLM)的“眼睛”里,这两张图几乎长得一模一样。
于是它给出的分数,往往是“凭感觉”估的,而不是“看证据”得出的。

现在,来自西北工业大学与香港科技大学的研究团队提出了一个新框架——IQA-T1,第一次让多模态大模型在评估图像质量时,学会像专业检测员一样:
不再只靠“瞥一眼”的直觉,而是主动调用一套专业分析工具,生成噪声残差图、梯度分布、傅里叶频谱等结构化的“视觉证据”,再一步步基于证据做出判断。
从“凭感觉打分”到“拿证据说话”——在7个图像质量评估基准上,IQA-T1取得了综合最优(SOTA)的成绩,平均PLCC/SRCC达到0.795/0.784,同时给出的评估过程可解释、可追溯。
论文与代码均已开源。

△现有MLLM打分要么是“纯文本推理”(易受语义偏见误导),要么是“区域裁剪推理”(一堆没有解释的图像块);IQA-T1则走向“工具生成视觉证据”的新范式。
图像质量评估(Image Quality Assessment, IQA)的目标,是让机器打出的分数尽可能贴近人的主观感受。它是图像修复、增强、压缩等一系列视觉任务的“裁判”,直接决定了视觉系统在真实开放环境中好不好用、稳不稳。
随着多模态大模型崛起,越来越多工作开始用它们的“推理能力”来做IQA,希望既能给出分数,又能讲清楚“为什么是这个分”。听起来很美好,但研究团队指出了一个共性的根本缺陷:
现有MLLM打分,依赖的是带有语义偏见的内部视觉表征,而不是可验证的底层退化证据。
说人话就是:大模型的视觉编码器天生擅长理解“这是一只猫、这是一片海滩”这类高层语义,却对噪声、模糊、压缩伪影这类底层退化极不敏感。
论文里有一个很直观的刻画:给定一张原图

和它加了噪声的退化版

,人类会打出差异巨大的分数,但两者在大模型里的视觉表征却几乎相等——

表征几乎不变,质量却有明显差异。这就是所谓的语义偏见(Semantic Bias):模型手里根本没有足够的信息去感知退化,自然只能“猜”。
现有方法试图打两个补丁,但都没打到点上:
一句话总结:它们都没能给推理过程提供“证据”。
IQA-T1的解法,可以类比成医生看病的进化:
过去的模型像是只靠“望闻问切”经验下诊断的老中医;而IQA-T1像是学会了主动开CT、验血、拍片的现代医生——先拿到客观的检查结果(证据),再据此下判断。
具体来说,团队为模型准备了一个感知工具库。推理时,模型会自主决定调用其中哪些工具,每个工具专门“显影”一种特定的画质退化,把肉眼(和大模型标准表征)看不见的问题,转成一张张结构化的证据图:
……
这些证据图会被逐步融入推理链,成为模型每一步判断的“物证”。这样一来,IQA就从一个纯靠语义脑补的推理任务,变成了有据可查的证据驱动推理。
工具库的设计也很讲究。团队梳理出IQA中7个关键感知属性——结构、锐度、噪声、伪影、亮度、色彩、自然度,并据此设计了15种视觉证据。所有工具还满足三条工程约束:统一调用接口、输出适度下采样(省token)、结果完全确定性(保证数据构建、SFT、RL三个阶段看到的证据完全一致)。
要让模型真正掌握这套本领,需要两种能力:知道怎么用工具,以及知道什么时候该用。IQA-T1用一条两阶段训练流水线来解决。

△
在自建的Q-Tool数据集上做监督微调,让模型掌握三件事:遵循结构化的推理模板、使用规范的工具调用语法、把视觉证据和质量判断关联起来。注意,模型不需要自己生成证据图(那是工具确定性产出的),训练时对证据图对应的token做了loss masking。
SFT教会了“怎么用”,但没优化“调用策略”。于是团队用GRPO做强化学习,专门打磨模型自适应调用工具的策略。奖励函数由四部分精心组合:

:输出是否符合规范结构(含工具调用标签和最终分数);

:预测分与真值越接近,奖励越高(指数衰减);

:鼓励调用“适量”的工具——太少没证据,太多则惩罚冗余;

:一旦反复调用同一个工具刷存在感,直接扣分。
四项加权求和(

权重最高,给到5),最终让模型学会用尽量少、尽量对的工具,拿到尽量足的证据。
现有IQA数据集里,没有一个支持“视觉证据推理”。团队干脆自己造了一个——Q-Tool,包含11k条高质量多模态推理链,每条都把工具生成的视觉证据和人类对齐的文字分析绑在一起。

△
它通过一条三阶段流水线构建:
即前文的7属性/15证据工具集;
先由人类专家写好 推理模板 (把画质评估拆成“看结构→分析噪声→评估色彩……”等阶段,并规定属性到工具的映射),再让 GPT-4o 在模板约束下生成完整推理链,避免模型放飞自我地“幻觉”;
从 工具是否用对、证据是否真正被引用、结论是否被证据支撑 三个维度逐条审查,不合格的直接删除,边缘case人工精修。
团队在KonIQ上训练,并在覆盖真实失真、合成失真、算法退化、AI生成内容的7个基准上评测跨分布泛化能力,对手包括传统手工方法、深度学习方法、以及最新的一众MLLM方法。
结果是,IQA-T1拿下了7个数据集平均PLCC 0.795/SRCC 0.784的综合第一:
对比只会打分、不会解释的MLLM方法 (如Q-Align、DeQA) ,IQA-T1在保持高精度的同时,还能给出 可解释、有证据 的推理链;
对比同样带推理的方法 (如Q-Insight、VisualQuality-R1、Zoom-IQA) ,它在 合成失真(CSIQ)和算法退化(PIPAL) 这两个硬骨头数据集上刷新了最好成绩,在真实图像和AI生成内容上也极具竞争力。
一个直观的例子最能说明问题:

△
更有意思的是关于“工具怎么调”的消融:

也就是说,工具不是用得越多越好——无关工具反而会引入冗余视觉token和干扰。IQA-T1的动态调用平均每张图只用2.34个工具,却拿到了全场最好的效果,还更省时省显存。这说明模型是真的在“基于证据推理”,而不是简单地“拟合分数”。

△
此外,把框架换到Qwen3-VL-2B、InternVL3.5-4B等不同基座上,性能趋势依旧稳定——证明“工具化视觉证据推理”是一种通用机制,而非某个特定模型的专属技巧。
这项工作由西北工业大学与香港科技大学联合完成。论文第一作者为西北工业大学的Jinjian Wu与香港科技大学的Jiaqi Tang(共同一作),通讯作者为西北工业大学的Wei Wei教授与香港科技大学的Qifeng Chen教授。
团队希望这项工作能启发更多研究:把结构化的视觉证据引入多模态推理系统,让大模型的“感知”变得更可靠、更可解释。
论文:https://arxiv.org/abs/2607.12375v1
代码:https://github.com/zibuyu-02/IQA-T1
模型:https://huggingface.co/zibuyu-02/IQA-T1
数据:https://huggingface.co/datasets/zibuyu-02/Q-Tool
Demo:https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1