Pós-Graduação em Ciência da Computação – UFPE
Defesa de Dissertação de Mestrado Nº 2.300
Aluno: Vitória de Araújo Xavier
Orientador: Prof. Tsang Ing Ren
Título: Geração de Legendas de Imagens Radiológicas com Recuperação
Visual-Semântica Utilizando Modelos Fundacionais.
Data: 28/07/2026
Hora/Local: 9h – Virtual – Interessados em assistir entrar em contato com a aluna
Banca Examinadora:
Prof. Cleber Zanchettin(UFPE / CIn)
Prof. Luciano de Andrade Barbosa (UFPE / Centro de Informática)
Prof. Luis Filipe Alves Pereira (UFAPE /Departamento de Computação)
Prof. Tsang Ing Ren (UFPE / Centro de Informática)
RESUMO:
Este trabalho propõe e avalia um framework não paramétrico para captioning
médico em imagens radiológicas baseado em recuperação visual-semântica e síntese
multimodelo. A proposta combina indexação de embeddings visuais em uma base vetorial
FAISS, recuperação de captions semanticamente semelhantes, geração por modelos fundacionais e uma etapa de síntese das descrições produzidas por múltiplos modelos, sem necessidade de fine-tuning.
Além da avaliação da estratégia de recuperação, também foi investigado um módulo de fusão semântica de captions candidatas, funcionando como um ensemble em nível de saída, parasintetizar uma legenda final. Os experimentos foram conduzidos utilizando o conjunto dedados ROCOv2 e envolveram os modelos Gemini 2.5 Pro, GPT-4o, Claude 4.5 Sonnet e modelos da família LLaMA 4. O desempenho foi avaliado por meio de métricas automáticas lexicais e semânticas, incluindo BLEU, ROUGE, METEOR e BERTScore, complementadas por análises qualitativas e de custo computacional. Os resultados mostraram que a estratégia de recuperação visual-semântica produziu melhorias consistentes nessas métricas em comparação com a geração sem recuperação. Entre os modelos avaliados, o LLaMA 4 Maverick associado ao RAG apresentou o melhor equilíbrio entre desempenho nas métricas automáticas e custo de inferência. A estratégia de fusão de legendas proporcionou ganhos adicionais em parte das métricas avaliadas, embora com aumento significativo do custo computacional. Também foram investigadas modificações na etapa de recuperação, incluindo o uso de embeddings biomédicos (MedSigLIP), ampliação da base vetorial e refinamento do prompt. Os resultados indicaram que uma estratégia de recuperação mais especializada manteve desempenho semelhante ao da configuração original, enquanto o refinamento do prompt aumentou a variabilidade das legendas sem produzir ganhos consistentes nas métricas automáticas. De forma geral, os resultados indicam que estratégias não paramétricas baseadas em recuperação visual-semântica constituem uma alternativa promissora para adaptar modelos fundacionais multimodais ao domínio radiológico sem treinamento adicional.
Palavras-chave: Captioning Médico. Retrieval-Augmented Generation. RAG.
Modelos Fundacionais. Vision-Language Models. Large Language Models.
Comentários desativados