Ataques de envenenamiento en modelos de scoring crediticio
Cómo los datos contaminados en el entrenamiento desvían las decisiones de riesgo
El envenenamiento de datos no ocurre en la solicitud de crédito ni en la interfaz del modelo. Ocurre mucho antes, cuando se construye el conjunto de entrenamiento. Un porcentaje pequeño de registros manipulados —etiquetas de "buen pagador" asignadas a perfiles que luego incumplen, o muestras sintéticas que refuerzan patrones falsos de solvencia— basta para que el clasificador aprenda una relación que no existe en la realidad. El modelo no falla el día del despliegue: falla cuando aparece el perfil de solicitante que activa ese patrón aprendido.
Por qué el efecto no se ve en la validación
Los trabajos revisados coinciden en un punto incómodo: las métricas globales de validación pueden mantenerse estables mientras el error se concentra en subgrupos concretos. Un AUC que apenas se mueve en el conjunto de prueba oculta que ciertos segmentos —por ejemplo, solicitantes con antigüedad laboral corta y un historial de pagos específico— reciben decisiones sistemáticamente sesgadas. La contaminación no rompe el modelo; lo inclina. Y esa inclinación es difícil de detectar con auditorías agregadas.
Del etiquetado al despliegue
La perspectiva de ciclo de vida ayuda a ordenar el problema. En la fase de etiquetado, el atacante puede tener acceso indirecto a través de intermediarios que introducen solicitudes fraudulentas aprobadas. En la fase de agregación, la mezcla de fuentes con distinta calidad diluye la trazabilidad. En el despliegue, el patrón aprendido se activa solo cuando el perfil objetivo aparece con la frecuencia suficiente. Ninguna de estas etapas es visible por separado; el daño se entiende al reconstruir la cadena completa.
Qué se ha probado para defenderse
El artículo compara tres enfoques con límites prácticos distintos. El filtrado de registros anómalos funciona cuando hay volumen suficiente para distinguir la manipulación del ruido legítimo, pero falla en entornos con datos escasos. El reentrenamiento robusto —con funciones de pérdida que penalizan etiquetas atípicas— reduce el impacto, aunque exige recalibrar el modelo y puede degradar el rendimiento en los segmentos que sí estaban bien representados. La auditoría por segmentos, más costosa operativamente, es la que mejor expone el error concentrado, porque obliga a mirar el rendimiento desagregado en lugar del promedio.
Ninguno de los tres resuelve el problema por sí solo. La conclusión que se repite en la literatura es que la defensa contra el envenenamiento es un proceso continuo de verificación, no una configuración que se aplica una vez. Si el modelo se reentrena con datos que nadie audita, el ataque vuelve a tener superficie.