Progreso del curso: 0%
Tema 2.3

Procesamiento y limpieza de datos básicos

2.3 Procesamiento y limpieza de datos básicos

Existe una máxima en análisis de datos: «basura entra, basura sale» (garbage in, garbage out). Por perfecto que sea tu análisis con ChatGPT, si los datos de entrada contienen errores, inconsistencias, o están desorganizados, los resultados serán deficientes o incluso engañosos. Antes de confiar los datos a ChatGPT para análisis, necesitas invertir tiempo en procesamiento y limpieza. Este apartado te enseña técnicas prácticas, accesibles y efectivas para limpiar datos utilizando herramientas simples que ya tienes disponibles: hojas de cálculo y, por supuesto, ChatGPT mismo. No requiere programación avanzada; con estos pasos básicos, transformarás datos caóticos en información confiable.

Problemas comunes en datos sucios

Primero, identifiquemos qué hace que los datos sean «sucios». Valores faltantes: una celda debería contener precio pero está vacía; o un registro de cliente no tiene ciudad. Inconsistencias de formato: las fechas están escritas como «15/06/2024» en algunas filas, «15-6-2024» en otras, y «June 15, 2024» en otras. Valores duplicados: el cliente «Juan García» aparece tres veces con datos ligeramente diferentes. Valores atípicos o imposibles: un cliente dice tener 250 años de edad; un precio es -100 euros. Espacios en blanco o caracteres especiales: « Madrid » (con espacios extras), «Barcelonà» (con acento mal codificado). Datos mezclados: una columna debería contener solo números, pero tiene «50 euros» en algunas filas. Registros incompletos: algunas filas tienen 10 campos, otras solo 5.

Estos problemas comunes hacen que ChatGPT se confunda o produzca análisis sesgados. Un análisis de edad promedio falla si hay un registro con edad 250. Un análisis de ciudad falla si «Madrid» y « Madrid » se tratan como valores diferentes. Un análisis de precio falla si la columna mezcla números con texto.

Paso 1: Inspección inicial

Antes de limpiar, necesitas entender qué tienes. En Google Sheets o Excel, realiza estas inspecciones básicas: revisa el rango de datos (¿cuántas filas, cuántas columnas?); busca celdas visiblemente vacías; usa formato condicional para visualizar valores duplicados; ordena cada columna para ver valores extremos (valores más grandes, más pequeños); busca visualmente inconsistencias de formato. También verifica: ¿qué porcentaje de datos está completo? (si menos del 50% de una columna tiene datos, considera eliminarla); ¿cuál es el rango realista para números? (precios, edades, cantidades).

Paso 2: Eliminación de espacios y estandarización

En Google Sheets, usa función TRIM para eliminar espacios en blanco extras. En Excel, es similar. Selecciona una columna con espacios problemáticos, inserta una columna auxiliar con fórmula =TRIM(A1), luego copia los valores limpiados y reemplaza la columna original. Para casos más complejos como «Barcelonà» vs «Barcelona», usa SUBSTITUTE para reemplazar caracteres problemáticos: =SUBSTITUTE(A1,"à","a").

Estandarización de formato también importa. Si tienes fechas en múltiples formatos, convierte todas a un formato consistente (ISO 8601: AAAA-MM-DD es estándar internacional). Si tienes categorías (ciudades, tipos de cliente), asegúrate que se escriben siempre igual: «Madrid» y no «madrid» o «MADRID». Usa formato consistente para moneda: «€1200» o «1200 EUR», no una mezcla.

Paso 3: Identificación y tratamiento de valores faltantes

Valores faltantes (celdas vacías) son comunes. El tratamiento depende del contexto. Opción 1: Eliminar filas donde faltan datos críticos. Si un cliente no tiene email, podría no ser análisis válido. Opción 2: Llenar con valor por defecto. Si falta la ciudad, podrías asumir «Desconocido» o la ciudad más común. Opción 3: Interpolar. Si falta un número en serie temporal (ventas de cierto mes), calcular promedio de meses adyacentes. Opción 4: Dejar en blanco pero documentar. Si múltiples registros faltan datos, es indicador de problema en recolección de datos que ChatGPT debería conocer.

En Google Sheets, identifica celdas vacías: selecciona rango, Ctrl+H (Buscar y reemplazar), busca ^ $ (expresión regular para celdas vacías), reemplaza con tu valor por defecto. En Excel, es similar pero con opciones de expresiones regulares.

Paso 4: Detección de duplicados

Duplicados suceden frecuentemente. Un cliente se registra dos veces. Un producto se carga duplicado en inventario. Para detectar en Google Sheets, selecciona datos, ve a Formato > Formato condicional > Personalizadas, aplica regla =COUNTIF($A$1:$A,$A1)>1 para resaltar duplicados. Luego, decide: ¿eliminar duplicados completos, o fusionar datos si hay pequeñas diferencias? Si Juan García aparece twice con emails ligeramente distintos, asigna una verdad única (usa email como identificador primario). Si un producto aparece con nombre «Laptop» y «laptop», fusiona a un valor canonical.

Paso 5: Validación de valores numéricos y atípicos

Para columnas numéricas, define rangos esperados. Edad: 15-120. Precio: 0-100,000. Cantidad vendida: 0-1000 por día. Usa Análisis de datos > Validación de datos en Google Sheets para crear restricciones, o simplemente ordena columnas y busca visualmente valores fuera de rango. Si encuentras un cliente con edad 250, investiga: ¿es error de entrada (debería ser 25)? ¿es falta de dato que alguien completó con número grande? ¿es usuario de prueba (edad 999 para tests)? Dependiendo, elimina o corrige el registro.

Para outliers menos obvios (un cliente gastó €50,000 cuando el promedio es €200), documenta pero mantén: puede ser cliente corporativo legítimo, o error, pero merece atención especial en análisis.

Paso 6: Consolidación de datos de múltiples fuentes

Frecuentemente, tus datos provienen de múltiples fuentes: Google Analytics, CRM, hoja de hojas de registro manual. Consolidarlos es crítico para análisis holístico. Pasos: 1) Identifica campo común (email del cliente es mejor que nombre, porque es único). 2) Estandariza este campo en todas las fuentes (lowercase, sin espacios). 3) Usa función VLOOKUP (Excel) o BUSCARV (Sheets) para combinar datos. Por ejemplo, tabla A tiene clientes con ingresos de CRM; tabla B tiene clientes con compras de Google Analytics. Combina ambas usando email como clave.

Paso 7: Documentación del proceso de limpieza

Crítico: documenta qué limpieza realizaste. «Originalmente 5,000 registros, eliminé 127 duplicados y 45 registros con datos incompletos críticos, resultando en 4,828 registros para análisis». «Estandaricé fechas a formato ISO 8601». «Asumí ciudad 'Madrid' para 312 registros sin ciudad». Esta documentación es valiosa para: explicar a ChatGPT si hay sesgos en datos; revisar tu trabajo; comunicar a otros sobre limitaciones del análisis.

Ejemplo completo: Limpieza de lista de clientes

Lista original tiene 1,200 registros de clientes con: nombre, email, ciudad, teléfono, fecha inscripción, última compra. Inspección revela: 89 duplicados (mismo email), 234 registros sin email, 156 ciudades inconsistentes («Madrid», « madrid », «MADRID»), 45 fechas en formatos diferentes, 23 registros sin fecha de inscripción. Proceso: 1) Elimina registros sin email (234 filas) = 966 restantes. 2) Identifica duplicados por email, mantiene el más reciente = 877 restantes. 3) Aplica TRIM a ciudad = estandariza espacios. 4) LOWER(ciudad) para normalizar mayúsculas. 5) Convierte fechas a ISO 8601 usando función DATE. 6) Documento: «Iniciamos con 1,200 registros, finalizamos con 877 únicos, válidos, con email, estandarizados». Resultado: datos limpios listos para análisis con ChatGPT.

Cuándo dejar a ChatGPT la limpieza

Para limpieza muy grande (100,000+ registros) o compleja (múltiples problemas interconectados), puedes delegar en ChatGPT. Exporta datos a CSV, carga en ChatGPT, describe problemas, solicita script Python o proporciona versión limpia. ChatGPT puede escribir código que automatiza limpieza, ahorrándote horas. Por ejemplo: «Estos datos CSV tienen múltiples problemas [describe]. Escribe un script Python que: elimine duplicados por email, estandarice fechas, rellene valores faltantes de ciudad con 'Unknown', guarde resultado en CSV limpio». ChatGPT genera código ejecutable que hace todo automáticamente.

Ideas clave

  • Datos sucios (valores faltantes, inconsistencias, duplicados, atípicos) causan análisis deficiente; la limpieza previa es inversión fundamental
  • Inspecciona datos primero: identifica rango, celdas vacías, duplicados, inconsistencias de formato, valores fuera de rango esperado
  • Estandariza formato: espacios en blanco, mayúsculas, fechas, moneda, categorías; usa funciones como TRIM, LOWER, TEXT
  • Para valores faltantes, decide: eliminar filas, llenar con por defecto, interpolar, o documentar; la decisión depende del contexto
  • Detecta y maneja duplicados identificando campo único (email, ID), luego eliminando o fusionando registros
  • Consolida datos de múltiples fuentes usando campo común estandarizado como clave de fusión
  • Documenta proceso de limpieza realizado: qué eliminaste, qué modificaste, qué asumiste; esto es valioso para contexto de análisis posterior
¿Has terminado este apartado? Tu progreso se guarda en este navegador. Regístrate para conservarlo en tu cuenta.