Pós-Graduação em Ciência da Computação – UFPE
Defesa de Dissertação de Mestrado Nº  2.300

Aluno: Vitória de Araújo Xavier
Orientador: Prof.  Tsang Ing Ren
Título: Geração de Legendas de Imagens Radiológicas com Recuperação 
Visual-Semântica Utilizando Modelos Fundacionais.
Data: 28/07/2026
Hora/Local: 9h – Virtual – Interessados em assistir entrar em contato com a aluna
Banca Examinadora:
Prof. Cleber Zanchettin(UFPE / CIn)
Prof. Luciano de Andrade  Barbosa  (UFPE / Centro de Informática)

Prof. Luis Filipe Alves Pereira (UFAPE /Departamento de Computação)

Prof. Tsang Ing Ren  (UFPE / Centro de Informática)


RESUMO:

Este trabalho propõe e avalia um framework não paramétrico para captioning 
médico em imagens radiológicas baseado em recuperação visual-semântica e síntese 
multimodelo. A proposta combina indexação de embeddings visuais em uma base vetorial 
FAISS, recuperação de captions semanticamente semelhantes, geração por modelos fundacionais e  uma etapa de síntese das descrições produzidas por múltiplos modelos, sem necessidade de fine-tuning.
Além da avaliação da estratégia de recuperação, também foi investigado um  módulo de fusão semântica de captions candidatas, funcionando como um ensemble em nível de saída, parasintetizar uma legenda final. Os experimentos foram conduzidos utilizando o  conjunto dedados ROCOv2 e envolveram os modelos Gemini 2.5 Pro, GPT-4o, Claude 4.5  Sonnet e modelos da família LLaMA 4. O desempenho foi avaliado por meio de métricas  automáticas lexicais e semânticas, incluindo BLEU, ROUGE, METEOR e BERTScore,  complementadas por análises qualitativas e de custo computacional. Os resultados mostraram que  a estratégia de recuperação visual-semântica produziu melhorias consistentes nessas  métricas em comparação com a geração sem recuperação. Entre os modelos avaliados, o LLaMA 4  Maverick associado ao RAG apresentou o melhor equilíbrio entre desempenho nas métricas  automáticas e custo de inferência. A estratégia de fusão de legendas proporcionou ganhos  adicionais em parte das métricas avaliadas, embora com aumento significativo do custo  computacional. Também foram investigadas modificações na etapa de recuperação, incluindo o uso de  embeddings biomédicos (MedSigLIP), ampliação da base vetorial e refinamento do prompt. Os  resultados indicaram que uma estratégia de recuperação mais especializada manteve desempenho semelhante ao da configuração original, enquanto o refinamento do prompt aumentou a  variabilidade das legendas sem produzir ganhos consistentes nas métricas automáticas. De forma geral, os resultados indicam que estratégias não paramétricas baseadas em recuperação  visual-semântica constituem uma alternativa promissora para adaptar modelos fundacionais  multimodais ao domínio radiológico sem treinamento adicional.

Palavras-chave: Captioning Médico. Retrieval-Augmented Generation. RAG. 
Modelos Fundacionais. Vision-Language Models. Large Language Models.

Comentários desativados

Sobre este site

Portal institucional do Centro de Informática – UFPE

Encontre-nos

Endereço
Av. Jornalista Aníbal Fernandes, s/n – Cidade Universitária.
Recife-PE – Brasil
CEP: 50.740-560

Horário
Segunda–Sexta: 8:00–18:00