Home › Blog ›

Curva ROC na Tese em Saúde: Sensibilidade, Especificidade e o Ponto de Corte (2026)

Curva ROC na Tese em Saúde: Sensibilidade, Especificidade e o Ponto de Corte (2026)

A tese avalia um instrumento de rastreio: uma escala breve de despiste, um biomarcador, um índice construído a partir de três variáveis clínicas. A pergunta não é «há diferença entre grupos?» — é «este instrumento identifica corretamente quem tem a condição?». É uma pergunta diferente, com estatística própria, e o menu do SPSS que a responde está num sítio onde poucos procuram.

Este guia percorre a acurácia diagnóstica pela ordem em que ela se executa numa tese: montar a tabela 2×2, calcular os quatro indicadores, perceber porque dois deles mudam consoante a população, traçar a curva ROC, escolher o ponto de corte e reportar tudo isso de forma replicável.

Resposta rápida: a sensibilidade (proporção de doentes corretamente identificados) e a especificidade (proporção de não doentes corretamente excluídos) são propriedades do teste e não mudam com a prevalência. O valor preditivo positivo muda — e muito: um teste com 90% de sensibilidade e 90% de especificidade tem VPP de apenas 15,5% numa população com 2% de prevalência. A curva ROC traça a sensibilidade contra 1 − especificidade em todos os pontos de corte possíveis, e a AUC resume a capacidade discriminativa (0,5 = nula; ≥ 0,80 = boa). No SPSS: Analisar → Classificar → Curva ROC. O ponto de corte escolhe-se pelo índice de Youden (sensibilidade + especificidade − 1) ou, melhor, pelo custo clínico assimétrico entre falhar um caso e alarmar um saudável.

A tabela 2×2 e os quatro números

Tudo começa com uma tabela de dupla entrada que cruza o resultado do seu teste com o padrão de referência — o exame, diagnóstico clínico ou classificação que, no seu estudo, define a verdade. A qualidade do padrão de referência determina o valor de todo o resto: se ele é imperfeito, os seus indicadores estão enviesados, e isso é matéria obrigatória para a secção de limitações.

Condição presente Condição ausente
Teste positivo Verdadeiro positivo (VP) Falso positivo (FP)
Teste negativo Falso negativo (FN) Verdadeiro negativo (VN)

Desta tabela saem quatro indicadores. Dois lêem-se por colunas — partem de quem tem ou não tem a condição — e dois lêem-se por linhas, partindo do resultado do teste. É esta diferença de direção que explica tudo o que se segue.

  • Sensibilidade = VP / (VP + FN) — dos que têm a condição, quantos o teste apanha.
  • Especificidade = VN / (VN + FP) — dos que não têm, quantos o teste dispensa corretamente.
  • Valor preditivo positivo (VPP) = VP / (VP + FP) — dos que testaram positivo, quantos têm mesmo.
  • Valor preditivo negativo (VPN) = VN / (VN + FN) — dos que testaram negativo, quantos estão mesmo livres.

Note que a tabela 2×2 aqui não serve para um teste de associação: não é um qui-quadrado. A pergunta não é «existe relação?», mas «com que exatidão?».

Balança de pratos antiga sobre uma secretária, com os dois pratos equilibrados
Sensibilidade e especificidade estão nos dois pratos da mesma balança: subir uma baixa a outra.

Sensibilidade e especificidade

São propriedades do teste: mantêm-se aproximadamente constantes quando o instrumento é aplicado a populações com prevalências diferentes. Por isso são as medidas com que se caracteriza um instrumento na literatura.

São também inversamente relacionadas através do ponto de corte. Baixar o limiar a partir do qual um resultado é considerado positivo faz subir a sensibilidade (apanha-se mais) e descer a especificidade (alarma-se mais gente saudável). Subir o limiar faz o contrário. Não existe ponto que maximize as duas: existe a escolha de qual dos dois erros se prefere cometer.

Duas regras mnemónicas usadas na prática clínica ajudam a decidir a direção:

  • Um teste muito sensível, quando dá negativo, exclui a condição com segurança. É o que se quer num rastreio, onde falhar um caso é o erro caro.
  • Um teste muito específico, quando dá positivo, confirma a condição com segurança. É o que se quer antes de uma intervenção com riscos ou custos elevados.

Complementarmente, as razões de verosimilhança combinam os dois indicadores e têm a vantagem de não dependerem da prevalência: LR+ = sensibilidade / (1 − especificidade) e LR− = (1 − sensibilidade) / especificidade. Com sensibilidade e especificidade de 0,90, LR+ = 9 e LR− = 0,11. Valores de LR+ acima de 10 e de LR− abaixo de 0,1 são convencionalmente considerados clinicamente úteis, e são a forma mais transportável de descrever um teste.

VPP e VPN: porque dependem da prevalência

Esta é a secção que o júri usa para separar quem calculou de quem percebeu. Considere um teste com sensibilidade de 90% e especificidade de 90% — números que qualquer tese assinaria — aplicado a 10 000 pessoas.

Cenário Prevalência 2% (rastreio na população) Prevalência 40% (consulta especializada)
Com a condição 200 4 000
Verdadeiros positivos 180 3 600
Falsos positivos 980 600
VPP 15,5% 85,7%
VPN 99,8% 93,1%

O mesmo teste, com os mesmos 90% e 90%, produz um VPP de 15,5% num cenário e de 85,7% no outro. Na população de rastreio, mais de oito em cada dez positivos são falsos alarmes — e não há defeito nenhum no instrumento: há apenas muito mais pessoas saudáveis do que doentes, pelo que os 10% de erro sobre um grupo enorme superam largamente os 90% de acerto sobre um grupo pequeno.

A consequência prática para a sua tese é direta: VPP e VPN só podem ser reportados se a sua amostra tiver a prevalência da população onde o teste vai ser usado. Num desenho caso-controlo, em que se recrutam deliberadamente 50 doentes e 50 saudáveis, a prevalência é artificial e os valores preditivos calculados a partir dela não significam nada. Nesse caso reporte sensibilidade, especificidade e razões de verosimilhança — e, se quiser dar valores preditivos, calcule-os para prevalências plausíveis declaradas como hipóteses.

Detetor de fumo branco no teto com a luz indicadora acesa
Um detetor de fumo dispara quase sempre sem incêndio — e continua a ser um bom detetor.

A curva ROC e a AUC

Quando o resultado do teste é contínuo — uma pontuação de escala, uma concentração, uma probabilidade prevista por um modelo — não há um único par de sensibilidade e especificidade: há um par por cada ponto de corte possível. A curva ROC (receiver operating characteristic) representa todos eles ao mesmo tempo, com a sensibilidade no eixo vertical e 1 − especificidade no horizontal.

A diagonal corresponde a um teste sem qualquer capacidade discriminativa, equivalente a lançar uma moeda. Quanto mais a curva se aproxima do canto superior esquerdo, melhor o instrumento separa os dois grupos.

A área sob a curva (AUC) resume tudo num número com uma interpretação probabilística elegante: é a probabilidade de o teste atribuir uma pontuação mais alta a um doente escolhido ao acaso do que a um não doente escolhido ao acaso.

AUC Leitura convencional
0,50 Sem discriminação — equivalente ao acaso
0,70 – 0,79 Discriminação aceitável
0,80 – 0,89 Discriminação boa
≥ 0,90 Discriminação excelente — verifique se não há sobreajustamento

Estas bandas seguem a convenção estabelecida por Hosmer e Lemeshow em Applied Logistic Regression (3.ª ed., Wiley, 2013). Duas cautelas indispensáveis: a AUC deve vir sempre com o seu intervalo de confiança a 95% e com o teste da hipótese AUC = 0,5; e uma AUC alta obtida no mesmo conjunto de dados que treinou o modelo está inflacionada — se a pontuação vem de uma regressão logística ajustada nesses dados, o valor é otimista e deve ser assumido como tal.

Para comparar duas AUC obtidas nos mesmos indivíduos — o seu índice novo contra o instrumento habitual — o procedimento correto é o teste de DeLong (DeLong, DeLong & Clarke-Pearson, Biometrics, 1988, DOI 10.2307/2531595), que tem em conta a correlação entre as duas curvas. Não está no SPSS; está no pacote pROC do R e no MedCalc.

Escolher o ponto de corte

O critério mais usado é o índice de Youden (J = sensibilidade + especificidade − 1), que identifica o ponto da curva mais distante da diagonal. Calcula-se a partir da tabela de coordenadas da curva: some as duas colunas, subtraia 1, escolha o máximo.

É um critério simétrico — trata um falso negativo e um falso positivo como igualmente maus —, o que raramente corresponde à realidade clínica. Se o custo de falhar um caso é muito superior ao de um falso alarme, o ponto correto está deslocado no sentido de maior sensibilidade, mesmo com um J inferior. Declarar essa assimetria e escolher em função dela é mais defensável do que aplicar Youden mecanicamente, e é o tipo de fundamentação que responde antecipadamente às perguntas do júri sobre metodologia.

Uma advertência importante: um ponto de corte determinado a partir dos mesmos dados em que é avaliado está otimizado para o ruído dessa amostra e terá desempenho pior noutra. É o mesmo problema que afeta a dicotomização de covariáveis em análise de sobrevivência. Se a dimensão o permitir, valide por divisão em amostras de treino e teste, ou por validação cruzada; se não permitir — o caso mais comum numa tese —, apresente o corte como exploratório e recomende validação externa.

Fila de potenciómetros deslizantes numa mesa de mistura, com um deles claramente mais alto
Mover o corte é mover um cursor: ganha-se de um lado exatamente o que se perde do outro.

Como se faz no SPSS

  1. Prepare duas variáveis: a variável de teste (contínua ou ordinal, a pontuação) e a variável de estado (dicotómica, o padrão de referência).
  2. Analisar → Classificar → Curva ROC.
  3. Em Variável de estado, indique também o valor da variável de estado que corresponde à presença da condição (habitualmente 1). Omitir este campo é o erro mais frequente e produz uma curva invertida.
  4. Marque, em Opções de apresentação: Curva ROC, Com linha de referência, Erro padrão e intervalo de confiança e Pontos de coordenadas da curva ROC.
  5. Se pontuações mais baixas indicarem maior probabilidade da condição, mude em Opções a direção do teste para «Menor ou igual».

O output traz a curva, a AUC com erro padrão, significância assintótica e IC 95%, e a tabela de coordenadas — habitualmente longa, com uma linha por ponto de corte. É nessa tabela que se calcula o Youden, copiando as colunas para uma folha de cálculo. As versões recentes do SPSS incluem também Análise ROC, um procedimento mais completo que devolve o corte ótimo e as métricas associadas diretamente.

No R, o pacote pROC faz o mesmo em três linhas e acrescenta o teste de DeLong e os intervalos de confiança por reamostragem. No jamovi existe o módulo ROC. Sobre a escolha entre ambientes, ver o guia de decisão sobre que teste usar.

O que reportar na tese

Uma secção de acurácia diagnóstica completa contém sempre:

  • A tabela 2×2 com as frequências absolutas, no ponto de corte adotado.
  • Sensibilidade, especificidade, VPP, VPN em percentagem, cada um com intervalo de confiança a 95% (as proporções binomiais aceitam-se pelo método de Wilson).
  • A prevalência observada na amostra e uma frase sobre a sua relação com a prevalência esperada no contexto de aplicação.
  • A AUC com IC 95% e o valor-p do teste contra 0,5.
  • O ponto de corte, o critério pelo qual foi escolhido e se foi ou não validado noutro conjunto de dados.
  • A caracterização do padrão de referência e o intervalo de tempo entre os dois exames.

Os estudos de acurácia diagnóstica têm uma norma internacional de reporte própria, a STARD 2015 (Bossuyt et al., BMJ, DOI 10.1136/bmj.h5527), com uma lista de 30 itens e um fluxograma de participantes. Vale a pena segui-la mesmo numa dissertação: está indexada no diretório de guidelines de reporte. A formatação das tabelas e da figura da curva segue as normas APA para tabelas e figuras, e a redação da secção enquadra-se em como escrever o capítulo de resultados.

Escrever a acurácia enquanto os números estão à frente

A secção de acurácia diagnóstica escreve-se mal em diferido: três semanas depois já ninguém se lembra porque adotou aquele corte. O Tesify mantém metodologia, resultados e discussão à vista ao mesmo tempo, para que a decisão e a sua justificação sejam escritas juntas — 100% escrito por si. Comece a sua tese no Tesify →

Perguntas frequentes

Qual a diferença entre sensibilidade e valor preditivo positivo?

A sensibilidade parte de quem tem a condição e pergunta que proporção o teste identifica; o valor preditivo positivo parte de quem testou positivo e pergunta que proporção tem realmente a condição. A sensibilidade é uma propriedade do teste e mantém-se estável entre populações; o valor preditivo positivo depende da prevalência e pode variar de 15% a 86% para o mesmo instrumento.

O que é uma AUC boa numa curva ROC?

Pela convenção de Hosmer e Lemeshow, 0,50 corresponde a ausência de discriminação, valores entre 0,70 e 0,79 são aceitáveis, entre 0,80 e 0,89 são bons e a partir de 0,90 excelentes. Reporte sempre o intervalo de confiança a 95% e o teste contra 0,5. Valores muito altos obtidos no mesmo conjunto de dados usado para ajustar o modelo devem ser interpretados como otimistas.

Como escolher o ponto de corte de uma escala na tese?

O critério mais usado é o índice de Youden, que maximiza a soma da sensibilidade com a especificidade menos um, calculado a partir da tabela de coordenadas da curva. Sendo simétrico, ignora que falhar um caso e gerar um falso alarme raramente custam o mesmo. Quando a assimetria é relevante, escolha o corte em função dela e justifique-o explicitamente na metodologia.

Como fazer uma curva ROC no SPSS?

Vá a Analisar, Classificar, Curva ROC. Indique a variável de teste contínua, a variável de estado dicotómica e, obrigatoriamente, o valor da variável de estado que corresponde à presença da condição. Marque as opções de linha de referência, erro padrão com intervalo de confiança e pontos de coordenadas da curva. Se pontuações mais baixas indicarem a condição, inverta a direção do teste em Opções.

Posso calcular o valor preditivo positivo num estudo caso-controlo?

Não de forma interpretável. Num desenho em que o número de casos e de controlos é fixado pelo investigador, a prevalência da amostra é artificial e os valores preditivos calculados a partir dela não se aplicam a nenhuma população real. Reporte sensibilidade, especificidade e razões de verosimilhança, que não dependem da prevalência, e apresente valores preditivos apenas como cenários para prevalências declaradas.

Como comparar a curva ROC de dois instrumentos?

Quando os dois instrumentos foram aplicados aos mesmos indivíduos, as duas áreas estão correlacionadas e não podem ser comparadas como amostras independentes. O procedimento adequado é o teste de DeLong, de 1988, disponível no pacote pROC do R e no MedCalc, mas não no menu-base do SPSS. Reporte a diferença entre as áreas com o respetivo intervalo de confiança.

Escreve a tua tese ou TCC com IA

Editor inteligente, bibliografia automática (APA e ABNT) e verificação antiplágio num só sítio. Mais de 9.000 estudantes já escrevem em metade do tempo.