Skip to content

Latest commit

History

History

Folders and files

NameName
Last commit message
Last commit date

parent directory

..

README.md

馃挧 Predicci贸n de Potabilidad del Agua mediante Modelado Multivariante

Este proyecto presenta un an谩lisis exhaustivo sobre la calidad del agua utilizando un dataset de 3,276 muestras. El reto principal consisti贸 en determinar la potabilidad del agua bas谩ndose en par谩metros qu铆micos est谩ndar, enfrentando un problema donde las reglas simples de la estad铆stica tradicional no son suficientes.

馃搵 Resumen del Problema

驴Es posible predecir si el agua es apta para el consumo humano analizando solo sus componentes qu铆micos? Este estudio demuestra que, aunque no existan indicadores 煤nicos determinantes, la combinaci贸n de variables a trav茅s de Inteligencia Artificial permite alcanzar un alto grado de certeza.

馃攳 An谩lisis Exploratorio y Hallazgos Cr铆ticos

1. El Desaf铆o de la Independencia Lineal

Al generar la Matriz de Correlaci贸n, se descubri贸 que las variables (pH, dureza, sulfatos, cloraminas, etc.) se comportan de forma independiente.

  • Correlaciones cercanas a 0: No hay una dependencia lineal clara; por ejemplo, un aumento en el pH no implica necesariamente un cambio en la dureza.
  • Ausencia de "Variable M谩gica": Ninguna medici贸n individual correlaciona fuertemente con la potabilidad. Ser potable depende de una "receta compleja" de todos los factores.

2. Visualizaci贸n: El Fen贸meno del Solapamiento

A trav茅s de gr谩ficos de dispersi贸n (scatter plots) analizando pH vs. Dureza y Cloraminas, se observ贸 que los puntos de agua potable (naranja) y no potable (azul) est谩n totalmente mezclados.

  • Insight clave: Un agua con pH neutro (7.0) y niveles de cloraminas dentro de la norma puede seguir siendo no potable. La seguridad del agua es un problema multivariante que no se resuelve con umbrales simples.

馃 Modelado con Machine Learning

Debido a que el ojo humano y la estad铆stica descriptiva solo ven una "nube" de puntos solapados, se implementaron algoritmos de aprendizaje supervisado para identificar patrones ocultos.

Comparativa de Rendimiento de Modelos

Los modelos de ensamble fueron los que mejor capturaron la complejidad de los datos:

Algoritmo Precisi贸n (Accuracy) Interpretaci贸n T茅cnica
Random Forest 89% El m谩s robusto. Ideal para manejar relaciones no lineales complejas.
Bagging 89% Proporcion贸 una excelente estabilidad en las predicciones.
KNN 85% Clasifica eficazmente bas谩ndose en la proximidad de muestras similares.
XGBoost 80% Present贸 menor precisi贸n en este caso espec铆fico frente a los ensambles cl谩sicos.

馃挕 Conclusiones y Futuro

El estudio concluye que, si bien la potabilidad es un fen贸meno complejo, el modelo Random Forest permite predecir con un 89% de acierto si el agua es segura para el consumo analizando todas las variables en conjunto.

Este tipo de modelos sienta las bases para el desarrollo de sensores inteligentes que podr铆an monitorear la calidad del agua en tiempo real, automatizando la seguridad h铆drica a gran escala.