Конфігурації проміжних шарів для задач подібності зображень: оцінка багаторівневого векторного представлення, отриманого з архітектур CNN і трансформерів

Автор(и)

  • Володимир Кубицький Київський національний університет імені Тараса Шевченка
  • Артем Божок Київський національний університет імені Тараса Шевченка https://orcid.org/0009-0009-9572-6501

DOI:

https://doi.org/10.17721/1812-5409.2026/1.28

Ключові слова:

багаторівнева агрегація ознак, подібність зображень, згорткові нейронні мережі, візуальні трансформери, проміжні представлення, виявлення майже дублікатів, порівняння архітектур, ResNet-50

Анотація

Оцінка візуальної подібності зображень потребує векторних представлень, що зберігають інформацію на різних рівнях абстракції. Багаторівнева агрегація ознак із проміжних шарів CNN демонструє високу ефективність у задачах виявлення майже дублікатів, однак систематичний аналіз впливу архітектурних властивостей різних backbone-мереж на якість таких представлень досі не проводився. У пропонованій роботі формалізовано конвеєр багаторівневої агрегації: GAP, конкатенація та L2-нормалізація проміжних активацій з подальшою класифікацією компактним MLP. Проаналізовано шість архітектур – VGG-16, Inception v3, DenseNet-121, MobileNetV2, ResNet-50 та ViT-B/16 – за критеріями чіткості стадій, просторової прогресії, незалежності ознак і залишкового потоку інформації. Кількісну оцінку виконано на наборі даних INRIA Holidays за F1. ResNet-50 із шарами C2 + C3 + C5 досягає F1 = 0,77, перевершуючи всі інші конфігурації. VGG-16 дає F1 = 0,72

за надлишкової кількості параметрів. DenseNet-121 досягає F1 = 0,74 попри надмірність ознак. ViT-B/16 показує F1 = 0,70, обмежений однорідною структурою блоків. Чітка ієрархія стадій із залишковими зв'язками, поступовий перехід від просторових до семантичних ознак і помірна проміжна розмірність є ключовими архітектурними вимогами для ефективної багаторівневої агрегації.

Біографії авторів

  • Володимир Кубицький, Київський національний університет імені Тараса Шевченка

    аспірант

  • Артем Божок, Київський національний університет імені Тараса Шевченка

    аспірант

Посилання

Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2021). An image is worth 16×16 words: Transformers for image recognition at scale. In Proceedings of ICLR 2021. arXiv:2010.11929

Gkelios, S., Boutalis, Y., & Chatzichristofis, S. A. (2021). Investigating the vision transformer model for image retrieval tasks. In Proceedings of IEEE MMSP 2021. https://doi.org/10.1109/MMSP53017.2021.9733553

Hariharan, B., Arbeláez, P., Girshick, R., & Malik, J. (2015). Hypercolumns for object localization and fine-grained localization. In Proceedings of CVPR 2015 (pp. 447–456).

He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In Proceedings of CVPR 2016 (pp. 770–778).

Huang, G., Liu, Z., Van Der Maaten, L., & Weinberger, K. Q. (2017). Densely connected convolutional networks. In Proceedings of CVPR 2017 (pp. 4700–4708).

Jégou, H., Douze, M., & Schmid, C. (2008). Hamming embedding and weak geometric consistency for large scale image search. In ECCV 2008 (pp. 304–317). Springer.

Kordopatis-Zilos, G., Papadopoulos, S., Patras, I., & Kompatsiaris, Y. (2017). Near-duplicate video retrieval by aggregating intermediate CNN layers. In Multimedia Modeling. Springer.

Kubytskyi, V., & Panchenko, T. (2023). Enriched image embeddings as a combined outputs from different layers of CNN for various image similarity problems. In Lecture Notes on Data Engineering and Communications Technologies (Vol. 180, pp. 321–333). Springer. https://doi.org/10.1007/978-3-031-36115-9_30

Lin, T.-Y., Dollár, P., Girshick, R., He, K., Hariharan, B., & Belongie, S. (2017). Feature pyramid networks for object detection. In Proceedings of CVPR 2017 (pp. 2117–2125).

Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin Transformer: Hierarchical vision transformer using shifted windows. In Proceedings of ICCV 2021 (pp. 10012–10022).

Panchenko, T., Bozhok, A., & Kubytskyi, V. (2026). Multi-level CNN feature fusion from ResNet50 for near-duplicate image detection in real estate imagery. Informatica, 50(9). https://doi.org/10.31449/inf.v50i9.12111

Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision. In Proceedings of ICML 2021 (Vol. 139, pp. 8748–8763). PMLR.

Razavian, A. S., Azizpour, H., Sullivan, J., & Carlsson, S. (2014). CNN features off-the-shelf: An astounding baseline for recognition. In Proceedings of CVPRW 2014 (pp. 806–813).

Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., & Chen, L.-C. (2018). MobileNetV2: Inverted residuals and linear bottlenecks. In Proceedings of CVPR 2018 (pp. 4510–4520).

Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556.

Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., & Rabinovich, A. (2015). Going deeper with convolutions. In Proceedings of CVPR 2015 (pp. 1–9).

Thyagharajan, K. K., & Kalaiarasi, G. A. (2021). A review on near-duplicate detection of images using computer vision techniques. Archives of Computational Methods in Engineering, 28(3), 897–916. https://doi.org/10.1007/s11831-020-09400-w

Завантаження

Опубліковано

05.06.2026

Номер

Розділ

Комп'ютерні науки та інформатика

Як цитувати

Кубицький, В., & Божок, А. (2026). Конфігурації проміжних шарів для задач подібності зображень: оцінка багаторівневого векторного представлення, отриманого з архітектур CNN і трансформерів. Вісник Київського національного університету імені Тараса Шевченка. Фізико-математичні науки, 82(1), 213-217. https://doi.org/10.17721/1812-5409.2026/1.28