Конфігурації проміжних шарів для задач подібності зображень: оцінка багаторівневого векторного представлення, отриманого з архітектур CNN і трансформерів
DOI:
https://doi.org/10.17721/1812-5409.2026/1.28Ключові слова:
багаторівнева агрегація ознак, подібність зображень, згорткові нейронні мережі, візуальні трансформери, проміжні представлення, виявлення майже дублікатів, порівняння архітектур, ResNet-50Анотація
Оцінка візуальної подібності зображень потребує векторних представлень, що зберігають інформацію на різних рівнях абстракції. Багаторівнева агрегація ознак із проміжних шарів CNN демонструє високу ефективність у задачах виявлення майже дублікатів, однак систематичний аналіз впливу архітектурних властивостей різних backbone-мереж на якість таких представлень досі не проводився. У пропонованій роботі формалізовано конвеєр багаторівневої агрегації: GAP, конкатенація та L2-нормалізація проміжних активацій з подальшою класифікацією компактним MLP. Проаналізовано шість архітектур – VGG-16, Inception v3, DenseNet-121, MobileNetV2, ResNet-50 та ViT-B/16 – за критеріями чіткості стадій, просторової прогресії, незалежності ознак і залишкового потоку інформації. Кількісну оцінку виконано на наборі даних INRIA Holidays за F1. ResNet-50 із шарами C2 + C3 + C5 досягає F1 = 0,77, перевершуючи всі інші конфігурації. VGG-16 дає F1 = 0,72
за надлишкової кількості параметрів. DenseNet-121 досягає F1 = 0,74 попри надмірність ознак. ViT-B/16 показує F1 = 0,70, обмежений однорідною структурою блоків. Чітка ієрархія стадій із залишковими зв'язками, поступовий перехід від просторових до семантичних ознак і помірна проміжна розмірність є ключовими архітектурними вимогами для ефективної багаторівневої агрегації.
Посилання
Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2021). An image is worth 16×16 words: Transformers for image recognition at scale. In Proceedings of ICLR 2021. arXiv:2010.11929
Gkelios, S., Boutalis, Y., & Chatzichristofis, S. A. (2021). Investigating the vision transformer model for image retrieval tasks. In Proceedings of IEEE MMSP 2021. https://doi.org/10.1109/MMSP53017.2021.9733553
Hariharan, B., Arbeláez, P., Girshick, R., & Malik, J. (2015). Hypercolumns for object localization and fine-grained localization. In Proceedings of CVPR 2015 (pp. 447–456).
He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In Proceedings of CVPR 2016 (pp. 770–778).
Huang, G., Liu, Z., Van Der Maaten, L., & Weinberger, K. Q. (2017). Densely connected convolutional networks. In Proceedings of CVPR 2017 (pp. 4700–4708).
Jégou, H., Douze, M., & Schmid, C. (2008). Hamming embedding and weak geometric consistency for large scale image search. In ECCV 2008 (pp. 304–317). Springer.
Kordopatis-Zilos, G., Papadopoulos, S., Patras, I., & Kompatsiaris, Y. (2017). Near-duplicate video retrieval by aggregating intermediate CNN layers. In Multimedia Modeling. Springer.
Kubytskyi, V., & Panchenko, T. (2023). Enriched image embeddings as a combined outputs from different layers of CNN for various image similarity problems. In Lecture Notes on Data Engineering and Communications Technologies (Vol. 180, pp. 321–333). Springer. https://doi.org/10.1007/978-3-031-36115-9_30
Lin, T.-Y., Dollár, P., Girshick, R., He, K., Hariharan, B., & Belongie, S. (2017). Feature pyramid networks for object detection. In Proceedings of CVPR 2017 (pp. 2117–2125).
Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin Transformer: Hierarchical vision transformer using shifted windows. In Proceedings of ICCV 2021 (pp. 10012–10022).
Panchenko, T., Bozhok, A., & Kubytskyi, V. (2026). Multi-level CNN feature fusion from ResNet50 for near-duplicate image detection in real estate imagery. Informatica, 50(9). https://doi.org/10.31449/inf.v50i9.12111
Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision. In Proceedings of ICML 2021 (Vol. 139, pp. 8748–8763). PMLR.
Razavian, A. S., Azizpour, H., Sullivan, J., & Carlsson, S. (2014). CNN features off-the-shelf: An astounding baseline for recognition. In Proceedings of CVPRW 2014 (pp. 806–813).
Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., & Chen, L.-C. (2018). MobileNetV2: Inverted residuals and linear bottlenecks. In Proceedings of CVPR 2018 (pp. 4510–4520).
Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556.
Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., & Rabinovich, A. (2015). Going deeper with convolutions. In Proceedings of CVPR 2015 (pp. 1–9).
Thyagharajan, K. K., & Kalaiarasi, G. A. (2021). A review on near-duplicate detection of images using computer vision techniques. Archives of Computational Methods in Engineering, 28(3), 897–916. https://doi.org/10.1007/s11831-020-09400-w
Завантаження
Опубліковано
Номер
Розділ
Ліцензія
Авторське право (c) 2026 Volodymyr Kubytskyi, Artem Bozhok

Ця робота ліцензується відповідно до ліцензії Creative Commons Attribution 4.0 International License.
Автори, роботи яких публікуються у цьому журналі, погоджуються з такими умовами:
- Автори зберігають авторські права та надають журналу право на першу публікацію роботи, яка одночасно ліцензується згідно із Creative Commons Attribution License, тобто надається дозвіл іншим ділитися роботою з визнанням авторства роботи та першої публікації в цьому журналі.
- Автори можуть укладати окремі додаткові угоди щодо невиключного розповсюдження опублікованої журналом версії роботи (наприклад, розмістити її у репозитарії наукової установи чи опублікувати у книзі) з підтвердженням її початкової публікації у цьому журналі.
- Дозволяється та заохочується розміщення своїх робіт в мережі Інтернет авторами (наприклад, у репозитаріях наукових установ або на особистих веб-сторінках) до та під час процесу подання, оскільки це може призвести до продуктивного обміну, а також до більш ранніх цитувань опублікованої роботи та їх більшої кількості (див. The Effect of Open Access).
