Este proyecto presenta un an谩lisis exhaustivo sobre la calidad del agua utilizando un dataset de 3,276 muestras. El reto principal consisti贸 en determinar la potabilidad del agua bas谩ndose en par谩metros qu铆micos est谩ndar, enfrentando un problema donde las reglas simples de la estad铆stica tradicional no son suficientes.
驴Es posible predecir si el agua es apta para el consumo humano analizando solo sus componentes qu铆micos? Este estudio demuestra que, aunque no existan indicadores 煤nicos determinantes, la combinaci贸n de variables a trav茅s de Inteligencia Artificial permite alcanzar un alto grado de certeza.
Al generar la Matriz de Correlaci贸n, se descubri贸 que las variables (pH, dureza, sulfatos, cloraminas, etc.) se comportan de forma independiente.
- Correlaciones cercanas a 0: No hay una dependencia lineal clara; por ejemplo, un aumento en el pH no implica necesariamente un cambio en la dureza.
- Ausencia de "Variable M谩gica": Ninguna medici贸n individual correlaciona fuertemente con la potabilidad. Ser potable depende de una "receta compleja" de todos los factores.
A trav茅s de gr谩ficos de dispersi贸n (scatter plots) analizando pH vs. Dureza y Cloraminas, se observ贸 que los puntos de agua potable (naranja) y no potable (azul) est谩n totalmente mezclados.
- Insight clave: Un agua con pH neutro (7.0) y niveles de cloraminas dentro de la norma puede seguir siendo no potable. La seguridad del agua es un problema multivariante que no se resuelve con umbrales simples.
Debido a que el ojo humano y la estad铆stica descriptiva solo ven una "nube" de puntos solapados, se implementaron algoritmos de aprendizaje supervisado para identificar patrones ocultos.
Los modelos de ensamble fueron los que mejor capturaron la complejidad de los datos:
| Algoritmo | Precisi贸n (Accuracy) | Interpretaci贸n T茅cnica |
|---|---|---|
| Random Forest | 89% | El m谩s robusto. Ideal para manejar relaciones no lineales complejas. |
| Bagging | 89% | Proporcion贸 una excelente estabilidad en las predicciones. |
| KNN | 85% | Clasifica eficazmente bas谩ndose en la proximidad de muestras similares. |
| XGBoost | 80% | Present贸 menor precisi贸n en este caso espec铆fico frente a los ensambles cl谩sicos. |
El estudio concluye que, si bien la potabilidad es un fen贸meno complejo, el modelo Random Forest permite predecir con un 89% de acierto si el agua es segura para el consumo analizando todas las variables en conjunto.
Este tipo de modelos sienta las bases para el desarrollo de sensores inteligentes que podr铆an monitorear la calidad del agua en tiempo real, automatizando la seguridad h铆drica a gran escala.