| Resultado | Valor |
|---|---|
| Modelo Final | Random Forest |
| AUC | 0,7199 |
| Recall (Threshold 0,40) | 84% |
| Precisão | 59% |
| Gestantes Encaminhadas | 70,9% |
Identificar gestantes com maior risco de terem bebês com baixo peso ao nascer, permitindo priorização de atendimento e intervenção antecipada por equipes de saúde.
O baixo peso ao nascer está associado a maiores riscos de mortalidade infantil e complicações clínicas, tornando essencial a identificação precoce desses casos.
Desenvolver um modelo preditivo capaz de estimar a probabilidade de risco para cada gestante e apoiar a tomada de decisão sobre encaminhamento médico.
| Modelo | Acurácia | AUC | Precisão | Recall |
|---|---|---|---|---|
| DecisionTree | 0.6382 | 0.6972 | 0.6348 | 0.6497 |
| RandomForest | 0.6618 | 0.7199 | 0.6638 | 0.6552 |
| XGBoost | 0.6593 | 0.7211 | 0.6776 | 0.6071 |
| LogisticLasso | 0.6587 | 0.7165 | 0.6784 | 0.6028 |
| LogisticRidge | 0.6599 | 0.7163 | 0.6797 | 0.6040 |
| LogisticElasticNet | 0.6587 | 0.7164 | 0.6784 | 0.6028 |
- O XGBoost alcançou a maior AUC (0,7211), porém a diferença em relação ao Random Forest (0,7199) foi pequena. Na prática, a análise dos thresholds mostrou que o Random Forest identifica um número maior de gestantes em risco ao longo de quase toda a faixa de decisão, mantendo uma Precisão muito próxima à do XGBoost. Como a prioridade deste projeto é reduzir a chance de deixar casos de risco sem encaminhamento, o Random Forest foi selecionado como modelo final.
O modelo não foi utilizado apenas para previsão, mas para apoiar uma decisão operacional.
Foi realizada análise de trade-off entre precision, recall e percentual de encaminhamento, resultando na definição de um threshold adequado.
| model | threshold | precision | recall | %Gestantes Encaminhadas | Gestantes em risco identificadas(em 1.000) | Gestantes em risco não identificadas |
|---|---|---|---|---|---|---|
| RandomForest | 0.4 | 0.59 | 0.84 | 70.93 | 840 | 160 |
Com esse corte:
-
~71% das gestantes seriam encaminhadas
-
~59% dos casos encaminhados seriam de fato de risco
-
Recall elevado (~84%) → maior cobertura de casos críticos
-
Entre os thresholds avaliados, o valor de 0,40 apresentou o melhor equilíbrio entre capacidade de detecção e viabilidade operacional. Nesse ponto, o modelo consegue identificar aproximadamente 84% das gestantes com risco de terem bebês abaixo do peso, mantendo uma Precisão de 59% e encaminhando cerca de 71% das gestantes para acompanhamento intensificado.
O modelo permite:
- Priorizar gestantes com maior risco
- Otimizar alocação de recursos médicos
- Reduzir probabilidade de não identificar casos críticos
Imagine 100 gestantes que realmente apresentam risco de terem bebês abaixo do peso.
O modelo consegue identificar aproximadamente 84 delas, permitindo intervenção precoce durante o pré-natal.
Em contrapartida, entre as gestantes encaminhadas para acompanhamento intensificado, cerca de 59% realmente pertencem ao grupo de risco.
- Threshold baixo → maior cobertura (recall), porém maior custo operacional
- Threshold alto → menor custo, porém risco de perda de casos relevantes
➡ A escolha do threshold depende da estratégia do sistema de saúde.
- Python
- Pandas
- NumPy
- Scikit-Learn
- Random Forest
- Matplotlib
- Seaborn
- SciPy
- Statsmodels
- Jupyter Notebook
Durante o desenvolvimento deste projeto foram aplicados conceitos de:
- Engenharia de Atributos
- Pipeline
- Avaliação estatística de modelos
- VIF
- Linearidade do Logito
- Curva ROC
- AUC
- Precision x Recall
- Avaliação por múltiplas métricas.
- Seleção de thresholds considerando impacto operacional.
- Interpretação de modelos para apoio à tomada de decisão.
Alexandre Moreira Andréo


