DISRQAD: Diffusion Image Super-Resolution Quality Assessment Dataset and Benchmark
Quick Answer
The DISRQAD dataset introduces a benchmark for assessing diffusion-based image super-resolution (SR) quality, featuring 14,000 outputs and revealing a significant performance gap in quality metrics, with the best no-reference baseline achieving only 0.431 SRCC for diffusion outputs.
Quick Take
This dataset enables deeper analysis of quality models sensitive to diffusion-specific artifacts and their performance across different input conditions.
Key Points
- DISRQAD contains mean opinion scores for 14,000 SR outputs from various methods.
- The strongest no-reference metric achieves 0.431 SRCC for diffusion SR outputs.
- Quality assessment for diffusion SR reveals a substantial gap compared to non-diffusion SR.
- The dataset allows analysis of metric behavior across different generator families.
- Findings support the development of quality models sensitive to diffusion artifacts.
Paper Resources
📖 Reader Mode
~2 min readAbstract:Diffusion-based image super-resolution (SR) can create visually plausible detail that is not supported by the low-resolution input. We introduce DISRQAD, a subjective-quality dataset and diagnostic benchmark for this setting. It contains mean opinion scores (MOS) for 14,000 SR outputs from ten diffusion and four non-diffusion methods, spanning four low-resolution degradation conditions and x2/x4 upscaling. We evaluate 51 standard full-reference and no-reference metric configurations and 11 adapted variants. Agreement with MOS is substantially weaker on diffusion outputs: the strongest standard no-reference baseline reaches 0.431 SRCC on diffusion SR versus 0.813 on non-diffusion SR. As a case study in benchmark use, a pruned and distilled Q-ReAlign-mini student reaches 0.496 SRCC on diffusion SR. DISRQAD measures perceived output quality, not faithfulness to the input; it enables analysis of metric behavior across generator families and input conditions. Our findings reveal a substantial gap in the assessment of diffusion-based SR and provide a basis for developing quality models sensitive to diffusion-specific artifacts.
| Subjects: | Computer Vision and Pattern Recognition (cs.CV) |
| Cite as: | arXiv:2610.09077 [cs.CV] |
| (or arXiv:2610.09077v1 [cs.CV] for this version) | |
| https://doi.org/10.48550/arXiv.2610.09077 arXiv-issued DOI via DataCite (pending registration) |
Submission history
From: Evgeney Bogatyrev [view email]
[v1]
Tue, 6 Oct 2026 20:19:15 UTC (4,823 KB)
— Originally published at arxiv.org
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from arXiv cs.CV
See more →ProMoE-FL: Prototype-conditioned Mixture of Experts for Multimodal Federated Learning with Missing Modalities
ProMoE-FL introduces a Prototype-conditioned Mixture-of-Experts framework for multimodal federated learning, effectively addressing missing modalities. It outperforms existing methods on four chest X-ray datasets, demonstrating superior feature synthesis capabilities in both homogeneous and heterogeneous settings.