Use este identificador para citar ou linkar para este item:
http://repositorio.uem.br:8080/jspui/handle/1/10249| Autor(es): | Silva Junior, Sergio Alvarez da |
| Orientador: | Costa, Yandre Maldonado e Gomes da |
| Título: | CNNs e ViTs em imagens biomédicas : avaliação comparativa aplicada à segmentação de imagens histológicas e de CryoET |
| Banca: | Souza, Rodrigo Clemente Thom de |
| Banca: | Conci, Aura |
| Palavras-chave: | Visão computacional;Segmentação de imagem;Redes neurais convolucionais;Transformadores de visão;Diagnóstico por imagem |
| Data do documento: | 2022 |
| Editor: | Universidade Estadual de Maringá |
| Citação: | SILVA JUNIOR, Sergio Alvarez da. CNNs e ViTs em imagens biomédicas: avaliação comparativa aplicada à segmentação de imagens histológicas e de CryoET. 2022. 89 f. Dissertação (mestrado em Ciência da Computação)-Universidade Estadual de Maringá, 2026., Maringá, PR. |
| Abstract: | RESUMO: A visao computacional passou por transformacoes significativas nas ultimas decadas, inicialmente com o surgimento das Redes Neurais Convolucionais (CNNs) e, mais recentemente, com os Vision Transformers (ViTs). No contexto biomedico, essas arquiteturas tem se mostrado particularmente eficazes, especialmente apos o desenvolvimento da U-Net e suas variantes, que se tornaram referencia para tarefas de segmentacao de imagens medicas. Embora os ViTs tenham alcancado resultados expressivos em dominios de visao natural, sua superioridade em relacao as CNNs permanece inconclusiva no contexto biomedico, evidenciando uma lacuna na literatura que carece de investigacoes empiricas controladas. Este trabalho teve como objetivo avaliar comparativamente arquiteturas de CNNs e transformers aplicadas a segmentacao de imagens biomedicas, considerando diferentes capacidades computacionais e modalidades de dados contrastantes. Foram utilizadas duas bases de dados de elevada complexidade: imagens histologicas bidimensionais de intestino grosso de ratos Wistar (591 imagens) e volumes tridimensionais de tomografia eletronica criogenica (CryoET). As arquiteturas avaliadas incluíram Residual U-Net, Attention U-Net, UNETR, SwinUNETR e o foundation model UNI, testadas em diferentes configuracoes de tamanho (S, M, L) sob restricoes realistas de hardware (24 GB de VRAM). Os resultados demonstraram que, em imagens histologicas, o foundation model UNI alcancou o melhor desempenho (Dice Score = 0,8401), superando as CNNs (Attention U-Net = 0,8309) e os ViTs treinados do zero (SwinUNETR = 0,8175). Em CryoET, as CNNs mantiveram superioridade consistente, com a 3D Attention U-Net M alcancando F?=4 = 0,7377 apos pre-treinamento com dados sinteticos. O uso do modelo UNI para analise morfometrica demonstrou correlacao superior a 0,93 com as anotacoes manuais, validando sua aplicabilidade como ferramenta auxiliar. Conclui-se que, apesar de diversos artigos relatarem a superioridade dos ViTs, a escolha entre CNNs e ViTs em aplicacoes biomedicas deve considerar a disponibilidade de pre-treinamento especifico do dominio ou uma grande quantidade de dados, sendo as CNNs preferiveis quando tal recurso nao esta disponivel. ABSTRACT: Computer vision has undergone significant transformations over the past decades, initially with the emergence of Convolutional Neural Networks (CNNs) and, more recently, with Vision Transformers (ViTs). In the biomedical context, these techniques have proven particularly effective, especially after the development of the U-Net architecture and its variants, which have become the reference for medical image segmentation tasks. Although ViTs have achieved remarkable results in natural vision domains, their superiority over CNNs remains inconclusive in the biomedical context, highlighting a gap in the literature that requires controlled empirical investigations. This work aimed to comparatively evaluate CNN and transformer architectures applied to biomedical image segmentation, considering different computational capabilities and contrasting data modalities. Two highly complex databases were used: two-dimensional histological images of Wistar rat large intestine (591 images) and three-dimensional cryo-electron tomography (CryoET) volumes. The evaluated architectures included Residual U-Net, Attention U-Net, UNETR, SwinUNETR, and the UNI foundation model, tested in different size configurations (S, M, L) under realistic hardware constraints (24 GB VRAM). Results demonstrated that, for histological images, the UNI foundation model achieved the best performance (Dice Score = 0.8401), surpassing CNNs (Attention U-Net = 0.8309) and ViTs trained from Scratch (SwinUNETR = 0.8175). In CryoET, CNNs maintained consistent superiority, with 3D Attention U-Net M achieving F?=4 = 0.7377 after pre-training with synthetic data. The use of the UNI model for morphometric analysis demonstrated correlation above 0.93 with manual annotations, validating its applicability as an auxiliary tool. It is concluded that, despite several studies reporting the superiority of ViTs, the choice between CNNs and ViTs in biomedical applications should consider the availability of domain-specific pre-training or a large amount of data, with CNNs being preferable when such resources are unavailable. |
| Descrição: | Orientador: Prof. Dr. Yandre Maldonado e Gomes da Costa. Dissertação (mestrado em Ciência da Computação)-Universidade Estadual de Maringá, 2026. |
| URI: | http://repositorio.uem.br:8080/jspui/handle/1/10249 |
| Aparece nas coleções: | 2.4 Dissertação - Ciências de Tecnologia (CTC) |
Arquivos associados a este item:
| Arquivo | Tamanho | Formato | |
|---|---|---|---|
| Sergio Alvarez da Silva Junior_2026.pdf | 43,04 MB | Adobe PDF | Visualizar/Abrir |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.
