Curva ROC na Tese em Saúde: Sensibilidade, Especificidade e o Ponto de Corte (2026)
A tese avalia um instrumento de rastreio: uma escala breve de despiste, um biomarcador, um índice construído a partir de três variáveis clínicas. A pergunta não é «há diferença entre grupos?» — é «este instrumento identifica corretamente quem tem a condição?». É uma pergunta diferente, com estatística própria, e o menu do SPSS que a responde está num sítio onde poucos procuram.
Este guia percorre a acurácia diagnóstica pela ordem em que ela se executa numa tese: montar a tabela 2×2, calcular os quatro indicadores, perceber porque dois deles mudam consoante a população, traçar a curva ROC, escolher o ponto de corte e reportar tudo isso de forma replicável.
A tabela 2×2 e os quatro números
Tudo começa com uma tabela de dupla entrada que cruza o resultado do seu teste com o padrão de referência — o exame, diagnóstico clínico ou classificação que, no seu estudo, define a verdade. A qualidade do padrão de referência determina o valor de todo o resto: se ele é imperfeito, os seus indicadores estão enviesados, e isso é matéria obrigatória para a secção de limitações.
| Condição presente | Condição ausente | |
|---|---|---|
| Teste positivo | Verdadeiro positivo (VP) | Falso positivo (FP) |
| Teste negativo | Falso negativo (FN) | Verdadeiro negativo (VN) |
Desta tabela saem quatro indicadores. Dois lêem-se por colunas — partem de quem tem ou não tem a condição — e dois lêem-se por linhas, partindo do resultado do teste. É esta diferença de direção que explica tudo o que se segue.
- Sensibilidade = VP / (VP + FN) — dos que têm a condição, quantos o teste apanha.
- Especificidade = VN / (VN + FP) — dos que não têm, quantos o teste dispensa corretamente.
- Valor preditivo positivo (VPP) = VP / (VP + FP) — dos que testaram positivo, quantos têm mesmo.
- Valor preditivo negativo (VPN) = VN / (VN + FN) — dos que testaram negativo, quantos estão mesmo livres.
Note que a tabela 2×2 aqui não serve para um teste de associação: não é um qui-quadrado. A pergunta não é «existe relação?», mas «com que exatidão?».

Sensibilidade e especificidade
São propriedades do teste: mantêm-se aproximadamente constantes quando o instrumento é aplicado a populações com prevalências diferentes. Por isso são as medidas com que se caracteriza um instrumento na literatura.
São também inversamente relacionadas através do ponto de corte. Baixar o limiar a partir do qual um resultado é considerado positivo faz subir a sensibilidade (apanha-se mais) e descer a especificidade (alarma-se mais gente saudável). Subir o limiar faz o contrário. Não existe ponto que maximize as duas: existe a escolha de qual dos dois erros se prefere cometer.
Duas regras mnemónicas usadas na prática clínica ajudam a decidir a direção:
- Um teste muito sensível, quando dá negativo, exclui a condição com segurança. É o que se quer num rastreio, onde falhar um caso é o erro caro.
- Um teste muito específico, quando dá positivo, confirma a condição com segurança. É o que se quer antes de uma intervenção com riscos ou custos elevados.
Complementarmente, as razões de verosimilhança combinam os dois indicadores e têm a vantagem de não dependerem da prevalência: LR+ = sensibilidade / (1 − especificidade) e LR− = (1 − sensibilidade) / especificidade. Com sensibilidade e especificidade de 0,90, LR+ = 9 e LR− = 0,11. Valores de LR+ acima de 10 e de LR− abaixo de 0,1 são convencionalmente considerados clinicamente úteis, e são a forma mais transportável de descrever um teste.
VPP e VPN: porque dependem da prevalência
Esta é a secção que o júri usa para separar quem calculou de quem percebeu. Considere um teste com sensibilidade de 90% e especificidade de 90% — números que qualquer tese assinaria — aplicado a 10 000 pessoas.
| Cenário | Prevalência 2% (rastreio na população) | Prevalência 40% (consulta especializada) |
|---|---|---|
| Com a condição | 200 | 4 000 |
| Verdadeiros positivos | 180 | 3 600 |
| Falsos positivos | 980 | 600 |
| VPP | 15,5% | 85,7% |
| VPN | 99,8% | 93,1% |
O mesmo teste, com os mesmos 90% e 90%, produz um VPP de 15,5% num cenário e de 85,7% no outro. Na população de rastreio, mais de oito em cada dez positivos são falsos alarmes — e não há defeito nenhum no instrumento: há apenas muito mais pessoas saudáveis do que doentes, pelo que os 10% de erro sobre um grupo enorme superam largamente os 90% de acerto sobre um grupo pequeno.
A consequência prática para a sua tese é direta: VPP e VPN só podem ser reportados se a sua amostra tiver a prevalência da população onde o teste vai ser usado. Num desenho caso-controlo, em que se recrutam deliberadamente 50 doentes e 50 saudáveis, a prevalência é artificial e os valores preditivos calculados a partir dela não significam nada. Nesse caso reporte sensibilidade, especificidade e razões de verosimilhança — e, se quiser dar valores preditivos, calcule-os para prevalências plausíveis declaradas como hipóteses.

A curva ROC e a AUC
Quando o resultado do teste é contínuo — uma pontuação de escala, uma concentração, uma probabilidade prevista por um modelo — não há um único par de sensibilidade e especificidade: há um par por cada ponto de corte possível. A curva ROC (receiver operating characteristic) representa todos eles ao mesmo tempo, com a sensibilidade no eixo vertical e 1 − especificidade no horizontal.
A diagonal corresponde a um teste sem qualquer capacidade discriminativa, equivalente a lançar uma moeda. Quanto mais a curva se aproxima do canto superior esquerdo, melhor o instrumento separa os dois grupos.
A área sob a curva (AUC) resume tudo num número com uma interpretação probabilística elegante: é a probabilidade de o teste atribuir uma pontuação mais alta a um doente escolhido ao acaso do que a um não doente escolhido ao acaso.
| AUC | Leitura convencional |
|---|---|
| 0,50 | Sem discriminação — equivalente ao acaso |
| 0,70 – 0,79 | Discriminação aceitável |
| 0,80 – 0,89 | Discriminação boa |
| ≥ 0,90 | Discriminação excelente — verifique se não há sobreajustamento |
Estas bandas seguem a convenção estabelecida por Hosmer e Lemeshow em Applied Logistic Regression (3.ª ed., Wiley, 2013). Duas cautelas indispensáveis: a AUC deve vir sempre com o seu intervalo de confiança a 95% e com o teste da hipótese AUC = 0,5; e uma AUC alta obtida no mesmo conjunto de dados que treinou o modelo está inflacionada — se a pontuação vem de uma regressão logística ajustada nesses dados, o valor é otimista e deve ser assumido como tal.
Para comparar duas AUC obtidas nos mesmos indivíduos — o seu índice novo contra o instrumento habitual — o procedimento correto é o teste de DeLong (DeLong, DeLong & Clarke-Pearson, Biometrics, 1988, DOI 10.2307/2531595), que tem em conta a correlação entre as duas curvas. Não está no SPSS; está no pacote pROC do R e no MedCalc.
Escolher o ponto de corte
O critério mais usado é o índice de Youden (J = sensibilidade + especificidade − 1), que identifica o ponto da curva mais distante da diagonal. Calcula-se a partir da tabela de coordenadas da curva: some as duas colunas, subtraia 1, escolha o máximo.
É um critério simétrico — trata um falso negativo e um falso positivo como igualmente maus —, o que raramente corresponde à realidade clínica. Se o custo de falhar um caso é muito superior ao de um falso alarme, o ponto correto está deslocado no sentido de maior sensibilidade, mesmo com um J inferior. Declarar essa assimetria e escolher em função dela é mais defensável do que aplicar Youden mecanicamente, e é o tipo de fundamentação que responde antecipadamente às perguntas do júri sobre metodologia.
Uma advertência importante: um ponto de corte determinado a partir dos mesmos dados em que é avaliado está otimizado para o ruído dessa amostra e terá desempenho pior noutra. É o mesmo problema que afeta a dicotomização de covariáveis em análise de sobrevivência. Se a dimensão o permitir, valide por divisão em amostras de treino e teste, ou por validação cruzada; se não permitir — o caso mais comum numa tese —, apresente o corte como exploratório e recomende validação externa.

Como se faz no SPSS
- Prepare duas variáveis: a variável de teste (contínua ou ordinal, a pontuação) e a variável de estado (dicotómica, o padrão de referência).
- Analisar → Classificar → Curva ROC.
- Em Variável de estado, indique também o valor da variável de estado que corresponde à presença da condição (habitualmente 1). Omitir este campo é o erro mais frequente e produz uma curva invertida.
- Marque, em Opções de apresentação: Curva ROC, Com linha de referência, Erro padrão e intervalo de confiança e Pontos de coordenadas da curva ROC.
- Se pontuações mais baixas indicarem maior probabilidade da condição, mude em Opções a direção do teste para «Menor ou igual».
O output traz a curva, a AUC com erro padrão, significância assintótica e IC 95%, e a tabela de coordenadas — habitualmente longa, com uma linha por ponto de corte. É nessa tabela que se calcula o Youden, copiando as colunas para uma folha de cálculo. As versões recentes do SPSS incluem também Análise ROC, um procedimento mais completo que devolve o corte ótimo e as métricas associadas diretamente.
No R, o pacote pROC faz o mesmo em três linhas e acrescenta o teste de DeLong e os intervalos de confiança por reamostragem. No jamovi existe o módulo ROC. Sobre a escolha entre ambientes, ver o guia de decisão sobre que teste usar.
O que reportar na tese
Uma secção de acurácia diagnóstica completa contém sempre:
- A tabela 2×2 com as frequências absolutas, no ponto de corte adotado.
- Sensibilidade, especificidade, VPP, VPN em percentagem, cada um com intervalo de confiança a 95% (as proporções binomiais aceitam-se pelo método de Wilson).
- A prevalência observada na amostra e uma frase sobre a sua relação com a prevalência esperada no contexto de aplicação.
- A AUC com IC 95% e o valor-p do teste contra 0,5.
- O ponto de corte, o critério pelo qual foi escolhido e se foi ou não validado noutro conjunto de dados.
- A caracterização do padrão de referência e o intervalo de tempo entre os dois exames.
Os estudos de acurácia diagnóstica têm uma norma internacional de reporte própria, a STARD 2015 (Bossuyt et al., BMJ, DOI 10.1136/bmj.h5527), com uma lista de 30 itens e um fluxograma de participantes. Vale a pena segui-la mesmo numa dissertação: está indexada no diretório de guidelines de reporte. A formatação das tabelas e da figura da curva segue as normas APA para tabelas e figuras, e a redação da secção enquadra-se em como escrever o capítulo de resultados.
Escrever a acurácia enquanto os números estão à frente
A secção de acurácia diagnóstica escreve-se mal em diferido: três semanas depois já ninguém se lembra porque adotou aquele corte. O Tesify mantém metodologia, resultados e discussão à vista ao mesmo tempo, para que a decisão e a sua justificação sejam escritas juntas — 100% escrito por si. Comece a sua tese no Tesify →
Perguntas frequentes
Qual a diferença entre sensibilidade e valor preditivo positivo?
A sensibilidade parte de quem tem a condição e pergunta que proporção o teste identifica; o valor preditivo positivo parte de quem testou positivo e pergunta que proporção tem realmente a condição. A sensibilidade é uma propriedade do teste e mantém-se estável entre populações; o valor preditivo positivo depende da prevalência e pode variar de 15% a 86% para o mesmo instrumento.
O que é uma AUC boa numa curva ROC?
Pela convenção de Hosmer e Lemeshow, 0,50 corresponde a ausência de discriminação, valores entre 0,70 e 0,79 são aceitáveis, entre 0,80 e 0,89 são bons e a partir de 0,90 excelentes. Reporte sempre o intervalo de confiança a 95% e o teste contra 0,5. Valores muito altos obtidos no mesmo conjunto de dados usado para ajustar o modelo devem ser interpretados como otimistas.
Como escolher o ponto de corte de uma escala na tese?
O critério mais usado é o índice de Youden, que maximiza a soma da sensibilidade com a especificidade menos um, calculado a partir da tabela de coordenadas da curva. Sendo simétrico, ignora que falhar um caso e gerar um falso alarme raramente custam o mesmo. Quando a assimetria é relevante, escolha o corte em função dela e justifique-o explicitamente na metodologia.
Como fazer uma curva ROC no SPSS?
Vá a Analisar, Classificar, Curva ROC. Indique a variável de teste contínua, a variável de estado dicotómica e, obrigatoriamente, o valor da variável de estado que corresponde à presença da condição. Marque as opções de linha de referência, erro padrão com intervalo de confiança e pontos de coordenadas da curva. Se pontuações mais baixas indicarem a condição, inverta a direção do teste em Opções.
Posso calcular o valor preditivo positivo num estudo caso-controlo?
Não de forma interpretável. Num desenho em que o número de casos e de controlos é fixado pelo investigador, a prevalência da amostra é artificial e os valores preditivos calculados a partir dela não se aplicam a nenhuma população real. Reporte sensibilidade, especificidade e razões de verosimilhança, que não dependem da prevalência, e apresente valores preditivos apenas como cenários para prevalências declaradas.
Como comparar a curva ROC de dois instrumentos?
Quando os dois instrumentos foram aplicados aos mesmos indivíduos, as duas áreas estão correlacionadas e não podem ser comparadas como amostras independentes. O procedimento adequado é o teste de DeLong, de 1988, disponível no pacote pROC do R e no MedCalc, mas não no menu-base do SPSS. Reporte a diferença entre as áreas com o respetivo intervalo de confiança.
Escreve a tua tese ou TCC com IA
Editor inteligente, bibliografia automática (APA e ABNT) e verificação antiplágio num só sítio. Mais de 9.000 estudantes já escrevem em metade do tempo.
