Skip to content
Datos y Analítica

Datos maestros: llegar a una vista única del cliente

El mismo cliente aparece tres veces porque tres sistemas lo capturaron en tres momentos, sin una regla común sobre qué lo identifica. La vista única no se resuelve limpiando una base: se resuelve decidiendo qué convierte a dos registros en la misma persona.

A continuación: por qué se duplican, qué se automatiza, qué exige criterio y cómo se sostiene en el tiempo.

La consecuencia visible del problema es incómoda: se le ofrece a un cliente algo que ya tiene contratado, se le pide un dato que ya entregó o se le envía dos veces la misma comunicación.

La consecuencia invisible es peor. Cuando el conteo de clientes difiere entre áreas, ninguna cifra derivada de él —participación, retención, valor por cliente— resiste una revisión.

Por qué se duplican

La causa raíz casi nunca es descuido. Es que cada sistema se diseñó para su propio propósito y capturó lo que necesitaba: comercial guardó un contacto, facturación guardó un contribuyente, soporte guardó un usuario.

Cada uno usó un identificador distinto y ninguno estaba obligado a coincidir con los demás, porque en su contexto funcionaba bien.

A eso se suma la captura manual: un nombre escrito de tres formas, un documento con o sin separadores, un correo personal en un registro y el corporativo en otro. Ninguna de esas variantes es un error en sí misma.

Lo que se automatiza bien

La normalización. Estandarizar formatos de documento, teléfono, correo y dirección antes de comparar resuelve una parte importante de las coincidencias que hoy se pierden por diferencias de escritura.

El emparejamiento por reglas. Cuando existe un identificador fiscal válido y coincide, la decisión es determinista. Ese caso suele cubrir la mayoría del universo y no necesita nada sofisticado.

El emparejamiento probabilístico. Para el resto, comparar combinaciones de nombre, fecha, dirección y contacto produce un puntaje de similitud. Lo importante es que el resultado no sea binario sino graduado.

La cola de revisión. Los casos de puntaje intermedio se envían a una persona con la información de ambos registros al lado. Automatizar la preparación de esa decisión es tan valioso como automatizar la decisión misma.

Lo que exige criterio

La regla de identidad es una decisión de negocio. Si dos personas comparten dirección y apellido, ¿son la misma? Si una empresa tiene dos razones sociales, ¿es un cliente o dos? La respuesta correcta depende de para qué se usa la vista única.

El umbral de fusión automática también. Fusionar de más produce un error difícil de deshacer, porque mezcla historiales; fusionar de menos deja el problema intacto. Conviene ser conservador y ampliar la cola de revisión al principio.

Y hay una decisión que suele postergarse: qué sistema manda cuando dos registros discrepan en un campo. Sin esa jerarquía, la vista única hereda el conflicto en lugar de resolverlo.

Qué cambia según el contexto

En operaciones con varios países el identificador fiscal cambia de formato y de significado, así que una regla construida para uno no se traslada al otro sin adaptarla.

Cuando el cliente es una empresa, la identidad tiene además jerarquía: casa matriz, sucursales, unidades que compran por separado. Aplanar esa estructura simplifica el modelo y luego impide responder preguntas legítimas sobre concentración.

Y como la vista única concentra datos personales, las obligaciones de Habeas Data (Ley 1581) en Colombia y de la LFPDPPP en México aplican con más fuerza, no con menos: reunir información dispersa en un solo lugar aumenta tanto el valor como la responsabilidad.

Cómo se sostiene en el tiempo

Una limpieza puntual se degrada en meses, porque las causas siguen operando. Lo que sostiene el resultado es actuar en el punto de captura.

Validar en el momento del alta —formato correcto, búsqueda de coincidencias antes de crear, campos mínimos obligatorios— evita el duplicado en lugar de corregirlo después, y es mucho más barato.

Conviene además medir. Un indicador simple, como el porcentaje de registros con identificador válido y el número de fusiones pendientes en cola, muestra si la calidad mejora o si sólo se limpió una vez.

Qué se necesita antes

Un dueño del dato de cliente con autoridad para decidir la regla de identidad, y un acuerdo sobre qué sistema es la fuente de cada campo. Ambas son decisiones organizativas, no técnicas.

Conviene también acotar el alcance inicial a los clientes activos. Depurar el histórico completo multiplica el esfuerzo y aporta poco a las decisiones que motivaron el proyecto.

El orden que evita rehacer el trabajo

Primero acuerde la regla de identidad y escríbala. Es media hora de conversación que ahorra semanas, porque todo lo que se construya después depende de ella.

Segundo, normalice y mida el punto de partida: cuántos registros tienen identificador válido, cuántos comparten correo o teléfono, cuántos comparten nombre. Esa medición dice de qué tamaño es el problema real, que casi siempre difiere de la percepción.

Tercero, resuelva el tramo determinista completo antes de tocar el probabilístico. Suele cubrir la mayor parte del universo y no genera discusión, así que produce resultado visible mientras se acuerdan los umbrales del resto.

Cuarto, abra la cola de revisión con un volumen que el equipo pueda atender. Una cola de miles de casos no se revisa: se ignora, y el proyecto pierde credibilidad justo cuando empezaba a entregar.

¿Se puede resolver sólo con tecnología?

No. La parte mecánica —normalizar y emparejar— se automatiza bien, pero la regla que define cuándo dos registros son la misma entidad es una decisión de negocio que alguien debe tomar y sostener.

¿Conviene fusionar automáticamente?

Sólo cuando la coincidencia es determinista, típicamente por identificador fiscal válido. Para el resto conviene una cola de revisión, porque una fusión equivocada mezcla historiales y es difícil de deshacer.

¿Hay que depurar todo el histórico?

Normalmente no al principio. Acotar a clientes activos entrega el valor que motivó el proyecto con una fracción del esfuerzo.

¿Cómo se evita volver a duplicar?

Actuando en la captura: validación de formato, búsqueda de coincidencias antes de crear el registro y campos mínimos obligatorios. Sin eso, cualquier limpieza se degrada en meses.

Andrés Lozada
Andrés Lozada
LinkedIn

Explore más de SUMāTO

Inteligencia Artificial Transformación Empresarial Consultoría Estratégica AI Agent AI Contact Center Ciberseguridad