Progreso del curso: 0%
Tema 5.6

Métodos de análisis estadísticos

5.6 Métodos de análisis estadísticos

Cuando se recopilan datos cuantitativos de evaluaciones de usabilidad —tasas de éxito, tiempos de tarea, puntuaciones de satisfacción, conteos de errores— el análisis estadístico transforma números brutos en conclusiones robustas. Sin análisis apropiado, es fácil extraer conclusiones erróneas de pequeñas diferencias causadas por variación aleatoria, o ignorar diferencias reales por pensar que son insignificantes. Para gestores de calidad de productos editoriales, dominar análisis estadístico básico proporciona credibilidad a hallazgos y permite tomar decisiones de mejora basadas en evidencia sólida.

Estadística Descriptiva Fundamental

El primer paso es siempre describir los datos: ¿cuál es el promedio, mediana y rango de valores observados? Para evaluación de usabilidad, estos estadísticos básicos responden preguntas simples pero críticas. Si el tiempo promedio para completar una tarea fue 3 minutos con algunos usuarios completándola en 45 segundos y otros en 8 minutos, el promedio de 3 minutos oculta esta variabilidad significativa (mejor reportar mediana y rango, o desviación estándar).

Ejemplo práctico: en pruebas de una plataforma educativa con 8 usuarios, los tiempos de inscripción fueron: 2, 2.5, 3, 3.5, 4, 4.5, 5, 12 minutos. El promedio es 4.4 minutos, pero la mediana es 3.75 minutos. Los 7 primeros usuarios se comportan consistentemente (mediana). El octavo usuario tuvo problemas (outlier). Si se reportara solo el promedio sin contexto, se ocultaría que 7 de 8 usuarios completaron rápidamente.

Medidas clave: media (promedio), mediana (valor central), desviación estándar (variabilidad alrededor de la media), rango (valores mínimo y máximo). Para datos de satisfacción, también se reportan frecuencias: "6 de 8 usuarios marcaron usabilidad como 'buena' o superior".

Distribuciones de Datos y Normalidad

Los datos pueden distribuirse de formas diferentes. La distribución normal (en forma de campana) es común en muchas variables naturales. Pero datos de usabilidad frecuentemente no son normales: tiempos de tarea pueden estar sesgados hacia valores bajos (muchos usuarios rápidos, algunos muy lentos), tasas de éxito pueden agruparse en 0% o 100% (o completaron o no la tarea).

Distinguir entre distribuciones es importante porque afecta qué test estadístico usar. Si datos son aproximadamente normales, pueden usarse pruebas paramétricas más potentes. Si no, se usan pruebas no paramétricas más conservadoras pero que no requieren distribución normal.

Herramienta práctica: crear histogramas de los datos. ¿Los valores se agrupan en forma de campana alrededor de un centro (posiblemente normal)? ¿Están sesgados hacia un extremo? ¿Tienen múltiples picos? La forma visual frecuentemente es más informativa que test estadísticos formales.

Comparación de Grupos: Pruebas de Diferencia

Una pregunta común en evaluación: ¿es realmente diferente el rendimiento entre dos grupos? En un test A/B de navegación (menú horizontal vs. vertical), el grupo A completó tareas en promedio 2.5 minutos y el grupo B en 2.7 minutos. ¿Es esta diferencia real o simple variación aleatoria?

Las pruebas de diferencia responden esto. Para dos grupos pequeños independientes (típico en pruebas de usuario), la prueba T de Student es apropiada si datos son aproximadamente normales. Si datos no son normales, la prueba de Mann-Whitney U es equivalente no paramétrica. Para más de dos grupos, se usan ANOVA (paramétrica) o Kruskal-Wallis (no paramétrica).

Ejemplo: compare tres variantes de iconografía con 6 usuarios cada una (18 total). Si el tiempo de localizar la función objetivo fue: Icono A: 8, 9, 7, 10, 8.5, 9 segundos (media 8.6); Icono B: 5, 6, 5.5, 6, 5, 5.5 segundos (media 5.4); Icono C: 15, 12, 14, 13, 14, 13 segundos (media 13.5). La prueba ANOVA revelaría que estas diferencias son estadísticamente significativas (no solo variación), permitiendo concluir que Icono B es genuinamente superior.

Análisis de Correlación

Frecuentemente se quiere saber si dos variables están relacionadas. ¿Usuarios con mayor experiencia completan tareas más rápido? ¿Mayor puntuación de satisfacción predice menor número de errores? Las correlaciones cuantifican estas relaciones.

El coeficiente de correlación de Pearson mide relaciones lineales entre variables continuas (rango -1 a +1; 0 = sin relación, +1 = relación positiva perfecta, -1 = relación negativa perfecta). Para datos no normales o variables ordinales, la correlación de Spearman es equivalente.

Cuidado: correlación no implica causalidad. Si usuarios satisfechos completan tareas rápido, podría ser que usuarios rápidos son más satisfechos (causalidad 1), usuarios satisfechos se esfuerzan más (causalidad 2), o ambas variables son causadas por un tercer factor (p.ej., experiencia previa). Análisis más complejo es necesario para establecer causalidad.

Análisis de Varianza (ANOVA)

Cuando se comparan múltiples grupos o cuando hay variables categóricas (edad: joven/adulto/mayor; experiencia: principiante/intermedio/experto), ANOVA permite identificar si diferencias entre grupos son significativas.

Ejemplo práctico: Una plataforma de eLearning quiere saber si la experiencia previa de usuarios afecta tiempo para completar módulos. 24 usuarios se dividen en tres grupos: 8 principiantes, 8 usuarios intermedios, 8 usuarios avanzados. Los tiempos promedio fueron: principiantes 45 minutos, intermedios 32 minutos, avanzados 28 minutos. ¿Estas diferencias son reales (efecto genuino de experiencia) o variación aleatoria?

ANOVA calcula: variabilidad dentro de cada grupo (¿cuánto varían los principiantes entre sí?) y variabilidad entre grupos (¿cuán grandes son las diferencias entre promedios?). Si entre-grupos es mucho mayor que dentro-grupos, es probable que las diferencias sean reales, no aleatorias. El resultado incluye un p-value que cuantifica la probabilidad de observar estas diferencias si realmente no hay efecto (si p < 0.05, típicamente se concluye el efecto es significativo).

Intervalos de Confianza

Cuando se mide un promedio (p.ej., tiempo promedio de tarea es 3 minutos basado en 8 usuarios), ¿cuál es el verdadero promedio poblacional? Los intervalos de confianza proporcionan un rango: el verdadero promedio probablemente está entre 2.5 y 3.5 minutos (con 95% confianza). Esto es más informativo que un punto simple.

Para muestras pequeñas (como típicas pruebas de usuario con 5-10 participantes), los intervalos de confianza son amplos, reflejando incertidumbre. Para muestras grandes (encuestas con 100+ participantes), los intervalos son estrechos. Esto recuerda gestores de calidad que conclusiones de pequeñas pruebas deben interpretarse cautelosamente.

Tamaño del Efecto

Un resultado puede ser estadísticamente significativo (p < 0.05) pero prácticamente insignificante. Imagine que con muestra enorme (1000 usuarios), una interfaz A fue 2 segundos más rápida que B en promedio. Estadísticamente significativo (p = 0.03), pero ¿realmente importan 2 segundos en una tarea de 5 minutos?

El tamaño del efecto cuantifica la magnitud práctica. Cohen's d mide diferencias entre grupos: d = 0.2 es efecto pequeño, d = 0.5 es medio, d = 0.8 es grande. Si el tamaño del efecto es pequeño (d = 0.1), aunque estadísticamente significativo, los gestores de calidad deben cuestionar si mejora es prácticamente relevante para usuarios.

Análisis Cualitativo: Codificación Temática

Aunque enumeramos análisis estadístico (cuantitativo), los datos cualitativos (notas, comentarios, observaciones de pruebas de usuario) también requieren análisis sistemático. La codificación temática identifica patrones recurrentes en datos textuales.

Ejemplo: en 8 sesiones de prueba de un software editorial, los evaluadores registraron comentarios. Se codifican todos los comentarios en temas: "busca funcionalidad en menú equivocado" aparece 5 veces (tema: arquitectura información), "no entendía si cambios fueron guardados" aparece 4 veces (tema: retroalimentación del sistema), "el ícono de salvar no era reconocible" aparece 3 veces (tema: iconografía). Este análisis temático revela dónde están los problemas principales.

Ideas clave

  • La estadística descriptiva (promedio, mediana, desviación estándar) es el punto de partida esencial antes de análisis más complejos; siempre visualizar datos en histogramas
  • Las pruebas de significancia estadística (T, ANOVA) determinan si diferencias observadas entre grupos son reales o variación aleatoria, crítico para conclusiones confiables
  • El tamaño del efecto mide la magnitud práctica de diferencias; un resultado estadísticamente significativo pero con efecto pequeño puede no justificar cambios costosos
  • Los intervalos de confianza proporcionan rango de valores plausibles para parámetros, especialmente importante con muestras pequeñas típicas en pruebas de usuario
  • La codificación temática de datos cualitativos es tan importante como análisis cuantitativo; proporciona contexto y explicaciones que números solos no revelan
  • Herramientas como Excel, Google Sheets, SPSS, o R pueden ejecutar estos análisis; el entendimiento conceptual importa más que la herramienta específica
¿Has terminado este apartado? Tu progreso se guarda en este navegador. Regístrate para conservarlo en tu cuenta.