,

Regressão Logística na Tese de Gestão: Exemplo Passo a Passo (2026)

Regressão Logística na Tese de Gestão: Exemplo Passo a Passo (2026)

O orientador disse “isto é uma variável binária, precisa de regressão logística” — e agora? Muitas teses de Gestão medem um resultado que só tem duas categorias: o colaborador saiu ou ficou, o cliente cancelou ou renovou, a empresa obteve o financiamento ou não. Para este tipo de variável dependente, a regressão linear não serve — os pressupostos de normalidade e de variância constante deixam de fazer sentido quando o resultado só pode valer 0 ou 1. Este artigo mostra, com um exemplo fictício de tese de Gestão de Recursos Humanos, como estruturar uma regressão logística binária do início ao fim: a verificação de pressupostos, o ajustamento do modelo, a leitura dos odds ratios e a frase exata para o capítulo de resultados.

Resposta rápida: A regressão logística binária é o modelo certo quando a variável dependente da tese de Gestão tem duas categorias (saiu/ficou, comprou/não comprou, obteve crédito/não obteve). Em vez de coeficientes em unidades da variável, interpreta-se cada preditor como um odds ratio — Exp(B) — e a qualidade do modelo reporta-se com o teste de Hosmer-Lemeshow, o pseudo-R² de Nagelkerke e a tabela de classificação, nunca apenas com um valor de R² como na regressão linear.

1. Quando a tese de Gestão precisa de regressão logística

A regressão logística binária aplica-se sempre que a variável dependente da tese de Gestão distingue apenas dois estados: o colaborador manteve-se ou saiu da empresa, o cliente renovou o contrato ou não, o projeto obteve financiamento ou foi recusado, a PME sobreviveu aos primeiros cinco anos ou encerrou. É um dos desenhos mais comuns em dissertações de Gestão de Recursos Humanos, Marketing (previsão de churn) e Finanças Empresariais (previsão de incumprimento), precisamente porque as decisões de gestão que mais interessam à prática — reter, converter, financiar — são, na sua essência, decisões binárias.

Nota metodológica: se a variável dependente tiver mais de duas categorias não ordenadas (por exemplo, três tipos de saída — despedimento, demissão voluntária, reforma), o modelo correto é a regressão logística multinomial, não a binária; se as categorias forem ordenadas (baixo/médio/alto risco), aplica-se a regressão logística ordinal. Este artigo trata apenas do caso binário, que é o mais frequente em teses de mestrado em Gestão. Para uma visão mais ampla de como organizar dados e modelos econométricos numa dissertação de Gestão ou Economia, veja também o recurso sobre como estruturar dados e modelos numa tese de Gestão e Economia.

Ilustração de colaboradores num escritório, um deles a sair, representando o estudo da saída voluntária numa tese de Gestão de Recursos Humanos
A saída voluntária de colaboradores é um dos exemplos mais comuns de variável binária numa tese de Gestão.

2. Pressupostos e dimensão da amostra

A regressão logística não exige normalidade nem homocedasticidade dos resíduos — ao contrário da regressão linear — mas tem três condições próprias que a tese precisa de verificar e reportar explicitamente:

  • Independência das observações: cada caso (colaborador, cliente, empresa) só pode entrar uma vez na base de dados.
  • Ausência de multicolinearidade severa entre preditores: avaliada com o Fator de Inflação da Variância (VIF); valores de VIF acima de 5 (alguns autores usam o limiar mais conservador de 10) indicam que dois ou mais preditores estão a medir essencialmente a mesma coisa, o que torna os odds ratios instáveis.
  • Dimensão da amostra em função dos eventos, não apenas dos casos totais: a heurística mais citada na literatura metodológica — Peduzzi, Concato, Kemper, Holford e Feinstein (1996) — recomenda pelo menos 10 eventos por preditor (EPV, do inglês events per variable). “Eventos” refere-se à categoria menos frequente da variável dependente: se apenas 30% dos colaboradores da amostra saíram da empresa, é esse subgrupo — não a amostra total — que entra no cálculo do EPV.

Comentário: é aqui que muitas teses de Gestão erram sem perceber — uma amostra de 300 colaboradores parece grande, mas se apenas 20 saíram da empresa no período em estudo, o EPV disponível para 4 preditores é de apenas 5 (20 ÷ 4), bem abaixo do mínimo recomendado. A solução nesse caso não é “usar a amostra na mesma” — é reduzir o número de preditores, alargar o período de recolha de dados ou reconhecer explicitamente a limitação na secção correspondente da tese. Para o cálculo equivalente em regressão linear (baseado no total de casos, não em eventos), veja o artigo sobre quantos casos precisa por variável na regressão da tese.

3. Exemplo passo a passo: prever a saída voluntária de colaboradores

Os dados que se seguem são inteiramente fictícios e ilustrativos, construídos apenas para mostrar a lógica do procedimento — nunca copie estes números para a sua própria tese.

Cenário ilustrativo: uma dissertação de Gestão de Recursos Humanos investiga que fatores estão associados à saída voluntária de colaboradores de uma empresa de serviços portuguesa, com base num levantamento interno de 150 colaboradores, dos quais 45 (30%) saíram voluntariamente nos 12 meses seguintes à recolha de dados.

Variável dependente (ilustrativa): Saída voluntária (0 = permaneceu, 1 = saiu voluntariamente nos 12 meses seguintes).

Preditores (ilustrativos):

  • Satisfação no trabalho (escala de 1 a 5)
  • Perceção de progressão de carreira (escala de 1 a 5)
  • Antiguidade na empresa (anos)
  • Salário relativo à média de mercado para a função (%, 100% = igual à média)

Comentário: com 45 eventos (saídas) e 4 preditores, o EPV ilustrativo deste cenário é de 11,25 (45 ÷ 4) — acima do limiar de 10 recomendado por Peduzzi et al., o que justifica, na secção de metodologia, a afirmação de que a amostra tem dimensão suficiente para os quatro preditores planeados. Este é exatamente o tipo de frase que um júri de Gestão procura na secção de amostra: não basta dizer “a amostra é adequada” — é preciso mostrar o cálculo.

Ecrã de computador com uma tabela de resultados de regressão logística mostrando odds ratios e intervalos de confiança
A saída de um modelo de regressão logística reporta-se sempre com odds ratios e intervalos de confiança, nunca apenas com coeficientes brutos.

Procedimento no SPSS/Jamovi: Regressão → Binária Logística; variável dependente = saída voluntária; método = Enter (introduzir todos os preditores em bloco único, já que o modelo é confirmatório e não exploratório); solicitar o teste de Hosmer-Lemeshow, os intervalos de confiança a 95% para Exp(B) e a tabela de classificação.

4. Avaliar o ajustamento do modelo

Antes de interpretar qualquer coeficiente, a tese tem de mostrar que o modelo, no seu conjunto, ajusta bem os dados. Três indicadores fazem esse trabalho, e os três têm de aparecer juntos no capítulo de resultados:

Indicador O que mostra Valor ilustrativo
Teste de Hosmer-Lemeshow Se o modelo se ajusta bem aos dados (um p não significativo, > 0,05, é o resultado desejado — o oposto da lógica habitual de outros testes) χ²(8) = 5,84; p = 0,67
Pseudo-R² de Nagelkerke A proporção de variação explicada, numa escala aproximável (mas não idêntica) à do R² da regressão linear 0,34
Tabela de classificação A percentagem de casos corretamente classificados pelo modelo, incluindo sensibilidade e especificidade 78% global (117/150); sensibilidade 62% (28/45); especificidade 85% (89/105)

Comentário: repare que a sensibilidade (a capacidade de identificar corretamente quem sai) é mais baixa do que a especificidade (a capacidade de identificar corretamente quem fica) — um padrão comum quando a categoria de interesse (saída) é a minoritária na amostra. Reportar apenas a percentagem global de classificação, sem separar sensibilidade e especificidade, esconde exatamente esta assimetria, e é um dos erros que os júris de Gestão mais assinalam.

5. Interpretar e reportar os odds ratios

O coeficiente B da regressão logística não se lê em unidades da variável dependente — lê-se através do seu exponencial, Exp(B), que é o odds ratio: quanto o rácio de probabilidades do evento (sair da empresa) se multiplica por cada unidade de aumento no preditor, mantendo os restantes preditores constantes.

Preditor Exp(B) ilustrativo Leitura
Satisfação no trabalho 0,62 Cada ponto adicional na escala de satisfação reduz o rácio de probabilidade de saída em cerca de 38%
Progressão de carreira percebida 0,54 O preditor com maior peso relativo no modelo ilustrativo
Antiguidade (anos) 0,93 Efeito pequeno mas na direção esperada
Salário relativo ao mercado 0,97 Não significativo no modelo ilustrativo (IC 95% inclui 1)

Comentário: um Exp(B) abaixo de 1 significa que o preditor reduz a probabilidade do evento; acima de 1, que a aumenta. O sinal a verificar sempre antes de interpretar um resultado como significativo é se o intervalo de confiança a 95% do Exp(B) inclui o valor 1 — se incluir, como no caso ilustrativo do salário relativo, o efeito não é estatisticamente distinguível de ausência de efeito, e a tese não deve tratá-lo como um achado, apenas mencioná-lo como não significativo.

Frase-modelo para o capítulo de resultados: “A satisfação no trabalho associou-se a uma redução de 38% no rácio de probabilidade de saída voluntária (Exp(B) = 0,62; IC 95% [0,44; 0,87]; p = 0,006), controlando para antiguidade, progressão de carreira percebida e salário relativo ao mercado.” Esta frase junta os três elementos que um júri de Gestão espera sempre: o odds ratio, o intervalo de confiança e a referência explícita ao controlo dos restantes preditores.

6. Erros que invalidam a regressão logística na tese

Três erros recorrentes em teses de Gestão com regressão logística: (1) interpretar o Exp(B) como se fosse um coeficiente de regressão linear — dizer “por cada ponto de satisfação, a saída desce 0,62” está errado; o correto é falar em rácio de probabilidades; (2) reportar apenas o pseudo-R² sem o teste de Hosmer-Lemeshow nem a tabela de classificação, escondendo se o modelo realmente se ajusta aos dados; (3) incluir preditores fortemente correlacionados entre si (por exemplo, satisfação no trabalho e satisfação com o superior direto, quando medem construtos quase idênticos) sem verificar o VIF, o que infla artificialmente os erros-padrão e pode tornar um preditor genuinamente relevante estatisticamente não significativo só por colinearidade. Um quarto erro, menos discutido mas igualmente grave, é reportar o modelo final sem indicar o método de introdução dos preditores (Enter, Forward ou Backward); num modelo confirmatório como o deste exemplo, em que a tese parte de hipóteses definidas a priori, o método Enter é o que preserva a lógica confirmatória — usar um método stepwise automático transformaria o estudo em exploratório sem que isso fosse assumido no capítulo de metodologia. Para o desenho da variável dummy quando um dos preditores é categórico com mais de duas categorias (por exemplo, departamento da empresa), veja o artigo sobre variáveis dummy e categoria de referência na regressão, e para o texto completo do projeto de investigação que normalmente antecede este capítulo, o guia sobre como escrever o projeto de investigação de uma tese de Gestão.

Perguntas Frequentes

Regressão logística ou regressão linear: como escolher na tese de Gestão?

A escolha depende inteiramente da natureza da variável dependente: se for contínua (por exemplo, o volume de vendas em euros), usa-se regressão linear; se for binária (saiu/ficou, comprou/não comprou), usa-se regressão logística binária. Nunca se decide pelo tipo de preditores — apenas pelo tipo da variável a explicar.

Quantos casos são necessários para uma regressão logística na tese?

A heurística mais citada (Peduzzi et al., 1996) recomenda pelo menos 10 eventos por preditor, em que “eventos” é a categoria menos frequente da variável dependente, não o total de casos da amostra. Uma amostra de 300 pessoas com apenas 20 eventos oferece um EPV muito mais baixo do que a mesma amostra sugere à primeira vista.

O que significa um Exp(B) igual a 1 na regressão logística?

Um Exp(B) de exatamente 1 significa que o preditor não altera o rácio de probabilidade do evento. Na prática, o que importa reportar é se o intervalo de confiança a 95% do Exp(B) inclui o valor 1 — se incluir, o efeito não é estatisticamente significativo, independentemente de o valor pontual do Exp(B) ser inferior ou superior a 1.

Estruture o capítulo de resultados da sua tese de Gestão com o Tesify

O Tesify ajuda a organizar o capítulo de metodologia e resultados da sua tese de Gestão, com estrutura de tabelas, redação da interpretação estatística e citações automáticas em APA 7.

Começar gratuitamente →

Escreve a tua tese ou TCC com IA

Editor inteligente, bibliografia automática (APA e ABNT) e verificação antiplágio num só sítio. Mais de 9.000 estudantes já escrevem em metade do tempo.