Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

8 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Predição de Bebês com Baixo Peso ao Nascer utilizando Machine Learning

Principais resultados

Resultado Valor
Modelo Final Random Forest
AUC 0,7199
Recall (Threshold 0,40) 84%
Precisão 59%
Gestantes Encaminhadas 70,9%

Problema de Negócio

Identificar gestantes com maior risco de terem bebês com baixo peso ao nascer, permitindo priorização de atendimento e intervenção antecipada por equipes de saúde.

O baixo peso ao nascer está associado a maiores riscos de mortalidade infantil e complicações clínicas, tornando essencial a identificação precoce desses casos.

Objetivo

Desenvolver um modelo preditivo capaz de estimar a probabilidade de risco para cada gestante e apoiar a tomada de decisão sobre encaminhamento médico.

Metodologia

Modelos Avaliados

Modelo Acurácia AUC Precisão Recall
DecisionTree 0.6382 0.6972 0.6348 0.6497
RandomForest 0.6618 0.7199 0.6638 0.6552
XGBoost 0.6593 0.7211 0.6776 0.6071
LogisticLasso 0.6587 0.7165 0.6784 0.6028
LogisticRidge 0.6599 0.7163 0.6797 0.6040
LogisticElasticNet 0.6587 0.7164 0.6784 0.6028
  • O XGBoost alcançou a maior AUC (0,7211), porém a diferença em relação ao Random Forest (0,7199) foi pequena. Na prática, a análise dos thresholds mostrou que o Random Forest identifica um número maior de gestantes em risco ao longo de quase toda a faixa de decisão, mantendo uma Precisão muito próxima à do XGBoost. Como a prioridade deste projeto é reduzir a chance de deixar casos de risco sem encaminhamento, o Random Forest foi selecionado como modelo final.

Tomada de Decisão (Ponto Central do Projeto)

O modelo não foi utilizado apenas para previsão, mas para apoiar uma decisão operacional.

Foi realizada análise de trade-off entre precision, recall e percentual de encaminhamento, resultando na definição de um threshold adequado.

Threshold escolhido: 0.40

model threshold precision recall %Gestantes Encaminhadas Gestantes em risco identificadas(em 1.000) Gestantes em risco não identificadas
RandomForest 0.4 0.59 0.84 70.93 840 160

Com esse corte:

  • ~71% das gestantes seriam encaminhadas

  • ~59% dos casos encaminhados seriam de fato de risco

  • Recall elevado (~84%) → maior cobertura de casos críticos

  • Entre os thresholds avaliados, o valor de 0,40 apresentou o melhor equilíbrio entre capacidade de detecção e viabilidade operacional. Nesse ponto, o modelo consegue identificar aproximadamente 84% das gestantes com risco de terem bebês abaixo do peso, mantendo uma Precisão de 59% e encaminhando cerca de 71% das gestantes para acompanhamento intensificado.

Interpretação de Negócio

O modelo permite:

  • Priorizar gestantes com maior risco
  • Otimizar alocação de recursos médicos
  • Reduzir probabilidade de não identificar casos críticos

Imagine 100 gestantes que realmente apresentam risco de terem bebês abaixo do peso.

O modelo consegue identificar aproximadamente 84 delas, permitindo intervenção precoce durante o pré-natal.

Em contrapartida, entre as gestantes encaminhadas para acompanhamento intensificado, cerca de 59% realmente pertencem ao grupo de risco.

Trade-offs Identificados

  • Threshold baixo → maior cobertura (recall), porém maior custo operacional
  • Threshold alto → menor custo, porém risco de perda de casos relevantes

➡ A escolha do threshold depende da estratégia do sistema de saúde.

Tecnologias Utilizadas

  • Python
  • Pandas
  • NumPy
  • Scikit-Learn
  • Random Forest
  • Matplotlib
  • Seaborn
  • SciPy
  • Statsmodels
  • Jupyter Notebook

Principais Aprendizados

Durante o desenvolvimento deste projeto foram aplicados conceitos de:

  • Engenharia de Atributos
  • Pipeline
  • Avaliação estatística de modelos
  • VIF
  • Linearidade do Logito
  • Curva ROC
  • AUC
  • Precision x Recall
  • Avaliação por múltiplas métricas.
  • Seleção de thresholds considerando impacto operacional.
  • Interpretação de modelos para apoio à tomada de decisão.

Autor

Alexandre Moreira Andréo

About

Projeto de machine learning visando auxiliar uma ação do governo para diminuir a incidência de bebês abaixo do peso (desnutrição). O objetivo é indicar quais são as grávidas que tem probabilidade de passar esse dilema com seus bebês.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages