Tipos de datos - estructurados y no estructurados
1.2 Tipos de datos - estructurados y no estructurados
Entender la naturaleza de los datos que maneja una PYME es fundamental para elegir las herramientas y metodologías de análisis adecuadas. Los datos que genera cualquier negocio—especialmente en el contexto de una consultoría—no son homogéneos. Pueden tomar formas muy diferentes, desde números precisos en una hoja de cálculo hasta comentarios de clientes en redes sociales o contenido de correos electrónicos. Esta variedad exige un conocimiento claro de cómo clasificar y trabajar con diferentes tipos de datos.
Datos estructurados: orden y precisión
Los datos estructurados son aquellos organizados en un formato predefinido, generalmente en forma de tablas con filas y columnas. Cada dato ocupa una posición específica que tiene significado. Una base de datos de clientes, un registro de ventas mensual, un listado de empleados con sus departamentos y salarios, o un histórico de transacciones bancarias son ejemplos de datos estructurados.
La característica principal de los datos estructurados es su predecibilidad y capacidad de procesamiento automático. Un programa informático puede acceder directamente a cualquier campo específico sin ambigüedad. Por ejemplo, si tenemos una tabla de 100.000 transacciones de venta, el sistema puede identificar instantáneamente todas las ventas realizadas en Madrid en enero de 2025, sumando sus importes, calculando el ticket medio, identificando el producto más vendido, etc.
En el contexto de una consultoría, los datos estructurados típicos incluyen: registros de horas trabajadas por proyecto, información de clientes (nombre, ubicación, sector, ingresos estimados), detalles de proyectos completados, facturación mensual, resultados de encuestas con opciones predefinidas, indicadores de rendimiento de procesos, o datos de uso de sistemas corporativos.
Datos no estructurados: complejidad y riqueza
Los datos no estructurados son aquellos que no siguen un formato predefinido ni se organizan en campos y tablas. Incluyen texto libre, imágenes, vídeos, audio, correos electrónicos, mensajes de redes sociales, notas de reuniones o comentarios de clientes. Estos datos contienen información valiosa pero están «distribuidos» de forma que un sistema informático tradicional no puede procesar automáticamente.
La ventaja de los datos no estructurados es que capturan información contextual y matices que los datos estructurados no pueden expresar. Un comentario de un cliente diciendo «el servicio fue rápido pero el precio está muy alto» contiene información de satisfacción, velocidad, y percepción de valor que sería imposible captar en un campo estructurado simple.
Sin embargo, procesar datos no estructurados es más complejo. Requiere técnicas más sofisticadas como procesamiento de lenguaje natural, análisis de sentimientos o visión por computadora. Históricamente, esto exigía especialistas en inteligencia artificial. Este es precisamente uno de los puntos donde ChatGPT revoluciona el análisis de datos para PYMES: permite a profesionales sin formación especializada extraer significado de datos no estructurados de manera sencilla.
Datos semiestructurados: el punto intermedio
Existe una categoría intermedia: los datos semiestructurados. Son aquellos que tienen cierta organización pero no la rigidez completa de una tabla. Ejemplos incluyen archivos JSON, documentos XML, registros de servidor web (logs), o mensajes de correo electrónico con campos como «remitente», «asunto», «fecha» pero contenido libre en el cuerpo.
Los datos semiestructurados combaten características de ambos tipos: tienen suficiente estructura para ser procesables automáticamente, pero contienen elementos no estructurados que requieren análisis más profundo.
Volumen relativo y combinación en PYMES
En la mayoría de PYMES españolas, los datos están desigualmente distribuidos. Típicamente existe un volumen moderado de datos estructurados (CRM, contabilidad, facturación) dispersos en diferentes sistemas sin integración, combinados con enormes volúmenes de datos no estructurados generados de forma incidental (correos de clientes, notas de reuniones, documentos de propuestas antiguas, conversaciones en WhatsApp o Slack).
Este desajuste es problemático porque muchas organizaciones solo analizan los datos estructurados, dejando sin explotar información valiosa en los datos no estructurados. Una consultoría podría tener registros de proyectos completados (datos estructurados) pero los aprendizajes reales y errores cometidos están documentados en correos o en la memoria del equipo (datos no estructurados).
Caso práctico: análisis integrado en consultoría de recursos humanos
Una consultoría de RRHH madrileña realizaba auditorías a empresas clientes. Sus datos estructurados consistían en: número de empleados, rotación anual, costo por contratación, salarios medios por nivel. Sin embargo, los hallazgos reales sobre cultura empresarial, conflictos interpersonales, y causas reales de dimisiones estaban principalmente en notas no estructuradas de entrevistas con directivos y empleados. Al combinar análisis de datos estructurados (identificar áreas con rotación anómala) con análisis de datos no estructurados (procesar notas de entrevistas con ChatGPT para extraer temas recurrentes), pudieron ofrecer diagnósticos significativamente más completos y soluciones personalizadas más efectivas.
Ideas clave
- Los datos estructurados están organizados en campos y tablas predefinidas, permitiendo procesamiento automático directo y análisis estadístico rápido
- Los datos no estructurados (texto, imágenes, audio) contienen información contextual valiosa pero requieren técnicas sofisticadas de análisis tradicional
- Los datos semiestructurados (JSON, XML, logs) ocupan un punto intermedio con suficiente organización como para ser procesables pero conteniendo elementos libres
- Las PYMES típicamente tienen volúmenes moderados de datos estructurados dispersos en múltiples sistemas sin integración, combinados con enormes volúmenes no estructurados sin explotar
- ChatGPT permite a consultores sin especialización en IA extraer significado de datos no estructurados de manera sencilla y escalable
- La máxima utilidad analítica viene de combinar análisis de datos estructurados y no estructurados para obtener perspectivas completas