Modelos de linguagem baseados em Inteligência Artificial (IA), como o ChatGPT, têm sido amplamente explorados na Medicina, demonstrando desempenho comparável ao de médicos e estudantes em exames nacionais e internacionais (USMLE, PLAB, HKMLE, NMLE e Revalida). Metanálises também indicam que alguns desses sistemas apresentam acurácia média estatisticamente inferior à de especialistas, mas comparável à de médicos não especialistas.1–4Em Dermatologia, modelos de IA têm sido avaliados em diversos contextos, avaliando sua acurácia diagnóstica frente a casos clínicos publicados, em exames de especialidade norte‐americanos e no próprio Exame de Título de Especialista em Dermatologia (TED) aplicado pela Sociedade Brasileira de Dermatologia (SBD).5–7Apesar da crescente produção científica na área, ainda são escassas as comparações sistemáticas entre diferentes plataformas de IA generativa. Diante disso, o presente estudo tem como objetivo avaliar e comparar o desempenho de múltiplas ferramentas de IA generativa na resolução da prova teórica do TED 2025, a fim de contribuir para a discussão sobre seu potencial papel como instrumento complementar na formação médica especializada e no raciocínio clínico dermatológico.
Realizamos um estudo observacional, transversal e retrospectivo, com abordagem quantitativa, realizado para avaliar o desempenho de diferentes modelos de IA generativa na prova teórica do TED 2025, composta por 80 questões de múltipla escolha com quatro alternativas (A, B, C, D) e uma única correta, abrangendo temas diversos da Dermatologia. Foram incluídos oito modelos de IA generativa; suas características estão descritas na tabela 1.
Características dos modelos de IA generativa utilizados no estudo
| Modelo de IA | Empresa desenvolvedora | País | Gratuito (dados de julho 2025) | Upload de imagens |
|---|---|---|---|---|
| GPT‐3.5 | OpenAI | Estados Unidos | Sim | Não |
| Grok 3 | xAI | Estados Unidos | Sim, limitado | Sim |
| Meta Llama 4 | Meta | Estados Unidos | Sim | Sim |
| Gemini 2.5 Flash | Estados Unidos | Sim | Sim | |
| Claude Sonnet 4 | Anthropic | Estados Unidos | Sim | Sim |
| Le Chat Mistral AI | Mistral AI | França | Sim, limitado | Sim |
| DeepSeek V3 | DeepSeek AI | China | Sim | Sim |
| GPT 4.5 | OpenAI | Estados Unidos | Não | Sim |
O prompt inicial foi o mesmo para todos os modelos: “Você está realizando a prova de Título de Especialista em Dermatologia (TED) – primeira fase. Esta é uma questão de múltipla escolha com quatro alternativas (A, B, C ou D). Leia atentamente a pergunta e selecione apenas a alternativa correta. Não explique o motivo da sua resposta. Sua resposta deve conter somente uma letra maiúscula: A, B, C ou D”.
As interações foram realizadas em julho de 2025. Para cada questão, o enunciado completo – incluindo texto, alternativas e, quando aplicável, imagens suplementares (nos modelos que suportavam upload de imagens) – foi fornecido à IA. Apenas uma questão exigia interpretação de imagem. Não foram fornecidas informações adicionais além do conteúdo original da prova. As respostas geradas foram registradas e confrontadas com o gabarito oficial divulgado pela banca. A acurácia foi calculada como a proporção de respostas corretas em relação ao total de questões.
As análises foram realizadas na plataforma Julius AI, utilizando teste de Cochran's Q para comparação global e McNemar com ajuste de Holm para comparações pareadas.
Claude Sonnet 4 liderou com 72/80 acertos, seguido por Gemini 2.5 Flash (71/80) e GPT‐4.5 (69/80). DeepSeek V3, Meta LLaMA 4, GPT‐3.5 e Grok 3 obtiveram entre 63–64 acertos. Le Chat Mistral AI teve o menor desempenho (59/80) (fig. 1).
A diferença entre o modelo mais preciso e o menos preciso foi de 16,25 pontos percentuais, evidenciando heterogeneidade de performance entre as plataformas. Apesar dessa variação, todos os modelos apresentaram taxa de acerto superior a 70%, o que indica capacidade de resolução consistentemente acima do nível esperado pelo acaso.
O teste de Cochran's Q indicou diferença estatisticamente significante entre os oito modelos avaliados (p=0,0119). Entretanto, as comparações pareadas pelo teste de McNemar, com ajuste de Holm para múltiplas comparações, não identificaram diferenças significantes entre pares específicos de modelos. Esses resultados sugerem heterogeneidade no desempenho global, mas sem evidências estatisticamente robustas de superioridade consistente de um modelo sobre outro.
Nosso estudo amplia os achados de Jabour et al. (2024), que avaliaram apenas o ChatGPT‐3.5.6 Ao incluir múltiplos modelos de IA generativa, demonstramos que essas são capazes de apresentar desempenho elevado na resolução de questões do TED 2025, com taxas de acerto superiores a 70% em todos os modelos testados. Notadamente, Claude Sonnet 4 (90%) e Gemini 2.5 Flash (88,75%) apresentaram acurácia comparável à de especialistas, destacando o potencial dessas ferramentas.
Vale destacar, contudo, que o desempenho dos modelos não foi homogêneo. A diferença de até 16,25 pontos percentuais entre os modelos de maior e menor desempenho reforça a necessidade de validação independente antes da incorporação clínica no futuro. Tal heterogeneidade foi igualmente descrita em estudo que observou variações significantes entre o desempenho de diferentes IAs em exames médicos realizados em contextos culturais distintos.2
Observou‐se que 37 das 80 questões não apresentaram variabilidade nas respostas, respondidas de maneira idêntica por todos os modelos. Esse padrão possivelmente se relaciona ao perfil de dificuldade do TED 2025, com 38,8% dos itens considerados fáceis ou muito fáceis e mais de 60% apresentando boa ou muito boa capacidade de discriminação, conforme relatório oficial da SBD.8 Embora esse equilíbrio seja desejável para avaliar candidatos humanos, no presente estudo ele pode ter reduzido a sensibilidade dos testes estatísticos para detectar diferenças pontuais entre modelos de IA, uma vez que questões de fácil resolução tendem a gerar respostas uniformes.
Resultados semelhantes já foram descritos na literatura. No Brasil, estudo relatou que o Chat GPT‐4.0 superou estudantes e médicos não especialistas ao resolver questões do exame nacional de progresso, com taxa de acerto de 87,2%.1 Em um estudo conduzido nos Estados Unidos, demonstrou‐se que modelos de IA superaram médicos residentes em exames de certificação médica oficial.5 Especificamente em Dermatologia, estudo evidenciou que o Chat GPT‐4.0 alcançou desempenho semelhante ao de médicos em formação ao resolver questões simuladas de provas de boards norte‐americanos.3
No Brasil, Jabour et al. (2024) demonstraram que o Chat GPT‐3.5 foi capaz de resolver 69% das questões do TED 2023.6 Já Pacheco e Martini (2025) reforçaram que o desempenho da IA é ainda mais relevante quando complementado por dados clínicos e histopatológicos, contexto em que os modelos apresentaram acurácia superior a 80% ao avaliar casos clínicos reais publicados.7
Portanto, modelos generativos são capazes de aplicar raciocínio clínico, mesmo diante de exames de alta complexidade para especialistas. Esses achados reforçam o promissor potencial das IAs generativas. Estudos futuros devem avaliar seu desempenho em contextos assistenciais reais e integrados a dados multimodais e debate ético e regulatório, contribuindo para embasar a discussão sobre sua incorporação na prática.
ORCID IDMatheus Alves Pacheco: 0000‐0003‐3427‐3536
Suporte financeiroNenhum.
Contribuição dos autoresAthos Paulo Santos Martini: Concepção e o desenho do estudo; redação do artigo ou revisão crítica do conteúdo intelectual importante.
Matheus Alves Pacheco: Redação do artigo ou revisão crítica do conteúdo intelectual importante.
Disponibilidade de dados de pesquisaTodo o conjunto de dados que dá suporte aos resultados deste estudo foi publicado no próprio artigo.
Conflito de interessesNenhum.
EditorHiram Larangeira de Almeida Jr.
Como citar este artigo: Pacheco MA, Martini APS. Performance of generative artificial intelligence models in the theoretical exam for the Dermatology Specialist Title (TED): a comparative study. An Bras Dermatol. 2026;101:501326.
Estudo realizado no Hospital Universitário, Universidade Federal de Santa Catarina, Florianópolis, SC, Brasil.


