Universo y muestra
12.1 Universo y muestra
Hemos completado el análisis de los condicionantes del marketing: cómo funciona el marketing como disciplina, cómo piensan y actúan los consumidores, cómo se estructura la demanda, quién es el comprador, cómo segmentamos mercados, y cómo integramos las variables de marketing-mix. Ahora iniciamos un nuevo módulo dedicado al estudio de mercados, que es la disciplina de investigación sistemática que recopila, analiza e interpreta información sobre clientes, competencia y mercado para informar decisiones estratégicas. El primer paso de cualquier estudio de mercados riguroso es comprender la distinción fundamental entre universo y muestra, porque esta distinción determina la validez y confiabilidad de todo lo que se investigue subsecuentemente.
El universo, también llamado población, es el conjunto total de elementos que poseen la característica que queremos estudiar. Si queremos entender a los consumidores españoles de café, el universo es todos los españoles que compran café. Si queremos entender a los compradores de software empresarial en Madrid, el universo es todas las empresas madrileñas que han comprado software. Definir el universo con claridad es el paso fundamental de cualquier investigación: la imprecisión en esta definición contamina todos los resultados posteriores.
Características del universo
El universo tiene características definitorias. Primero, su tamaño o magnitud: ¿cuántos elementos contiene? Para universos pequeños (empresas farmacéuticas españolas: aproximadamente 400), es posible estudiar prácticamente la totalidad. Para universos grandes (consumidores españoles de bebidas gaseosas: millones), es imposible estudiar a todos y debemos usar muestras.
Segundo, la homogeneidad del universo. ¿Todos los elementos son similares o hay variación importante dentro del universo? El universo de marcas de lujo españolas es bastante homogéneo: todas enfatizan calidad, exclusividad, y márgenes altos. El universo de pequeñas empresas españolas es enormemente heterogéneo: hay esteticistas, importadores de tecnología, constructoras, consultorías. Esta heterogeneidad afecta cómo diseñamos la investigación.
Tercero, la accesibilidad. ¿Podemos identificar y contactar a los elementos del universo? Si queremos investigar a CEOs de grandes corporaciones españolas, la lista es pública y accesible. Si queremos investigar a inmigrantes indocumentados en España, será casi imposible construir una lista completa. La accesibilidad del universo determina qué métodos de muestreo podemos usar.
Cuarto, la variabilidad de la característica que queremos medir. Si queremos medir satisfacción del cliente con un servicio de telecomunicaciones, existe variación considerable: algunos clientes están muy satisfechos, otros insatisfechos. Si queremos medir si todos los teléfonos móviles tienen pantalla, no hay variación: todos la tienen. La variabilidad afecta el tamaño de muestra necesario: características con poca variación requieren muestras menores.
Definición de muestra y su importancia
Una muestra es un subconjunto del universo seleccionado para estudiar. En lugar de investigar a todos los elementos del universo, estudiamos una porción cuidadosamente seleccionada. Los resultados de la muestra se generalizan al universo total. Esto es posible porque, con métodos de muestreo apropiados, una muestra bien diseñada proporciona estimaciones muy precisas de las características del universo total.
¿Por qué usar muestras en lugar de censos (estudios de todo el universo)? Primero, economía: investigar a 1.200 personas cuesta una fracción de investigar a 50.000. Segundo, velocidad: una investigación de muestra toma semanas, un censo toma meses. Tercero, viabilidad: para algunos universos (consumidores españoles que compran ropa deportiva) es imposible práctico hacer censo. Cuarto, precisión: paradójicamente, una muestra bien diseñada puede proporcionar estimaciones más precisas que un censo, porque se puede invertir más recursos por elemento.
Supongamos una empresa de telecomunicaciones quiere entender satisfacción de clientes con servicio de atención al cliente. El universo es 500.000 clientes. Un censo requeriría contactar a todos, lo que es imposible. Una muestra de 1.000 clientes seleccionados aleatoriamente, con cuestionario de 10 minutos, proporciona estimaciones con margen de error de aproximadamente ±3 puntos porcentuales, a fracción del coste.
Tipos de muestreo: probabilístico y no probabilístico
Existen dos categorías fundamentales de métodos de muestreo: muestreo probabilístico y muestreo no probabilístico. Esta distinción es crítica porque determina qué tipo de análisis estadístico se puede hacer y qué conclusiones se pueden obtener.
En muestreo probabilístico, cada elemento del universo tiene una probabilidad conocida y no nula de ser seleccionado en la muestra. Los métodos más comunes incluyen muestreo aleatorio simple (cada combinación de n elementos tiene igual probabilidad de selección), muestreo estratificado (se divide el universo en estratos homogéneos y se muestrea dentro de cada estrato), muestreo sistemático (se selecciona cada k-ésimo elemento de una lista ordenada), y muestreo por conglomerados (se divide el universo en grupos, se selecciona aleatoriamente algunos grupos, y se estudia completamente).
El muestreo probabilístico tiene una ventaja teórica enorme: permite calcular márgenes de error y intervalos de confianza. Si una muestra probabilística de 1.000 consumidores dice que 60% está satisfecho, sabemos que el verdadero porcentaje en la población está probablemente entre 57% y 63%, con 95% de confianza. Esta precisión es imposible con muestreo no probabilístico.
En muestreo no probabilístico, la probabilidad de selección de cada elemento es desconocida. Métodos incluyen muestreo por conveniencia (seleccionar elementos fáciles de contactar: clientes en tienda), muestreo de bola de nieve (cada participante refiere a otro), muestreo de cuota (seleccionar elementos que cumplan características demográficas predefinidas), y muestreo propositivo (seleccionar elementos que el investigador considera representativos).
Muestreo no probabilístico es útil cuando acceso a universo es difícil, cuando presupuesto es limitado, o cuando investigación es exploratoria. Pero no permite calcular márgenes de error confiables: si entrevistamos 50 clientes en tienda y 40 dicen estar satisfechos (80%), no sabemos si esto representa opinión verdadera del universo o si simplemente seleccionamos clientes especialmente satisfechos.
Determinación del tamaño de muestra
¿Qué tan grande debe ser la muestra? Esto depende de varios factores. Primero, el margen de error aceptable: ¿queremos precisión de ±1 punto porcentual o ±5 puntos es suficiente? Márgenes menores requieren muestras más grandes. Segundo, el nivel de confianza deseado: típicamente 95%, aunque a veces 90% o 99% se usa. Tercero, la variabilidad esperada: si la característica medida tiene poca variación en el universo, se requiere muestra menor.
En muestreo aleatorio simple, la fórmula de tamaño de muestra es aproximadamente: n = z² × p × (1-p) / e², donde z es el valor crítico (1,96 para 95% confianza), p es la proporción esperada de la característica (0,5 si es desconocida), y e es margen de error como proporción (0,05 para ±5 puntos).
Por ejemplo: queremos investigar qué porcentaje de consumidores españoles está dispuesto a probar una bebida funcional nueva. Suponemos p = 0,5 (máxima incertidumbre), margen de error e = 0,05 (±5 puntos), confianza 95% (z = 1,96). El tamaño de muestra requerido es: n = (1,96)² × 0,5 × 0,5 / (0,05)² = 3,84 × 0,25 / 0,0025 = 384. Con 384 consumidores bien seleccionados, tenemos ±5 puntos de margen de error.
Una muestra de 400 permite márgenes de error aceptables para muchas aplicaciones empresariales. Pero si requiere mayor precisión (±2 puntos), el tamaño crece a aproximadamente 2.400. Las investigaciones de televisión que reportan porcentaje de audiencia típicamente usan muestras de 3.000-5.000 porque requieren precisión muy alta.
Sesgo de muestra y validez
Aunque hayamos determinado tamaño apropiado, la validez de la muestra depende de cómo se selecciona. Sesgo de muestra ocurre cuando el proceso de selección favorece sistemáticamente ciertos elementos sobre otros. Si investigamos satisfacción de clientes solo a través de tienda (muestreo de conveniencia), seleccionamos desproporcionadamente clientes que van a tienda: puede que clientes que compran exclusivamente online tengan satisfacción diferente.
Casos españoles clásicos de sesgo de muestra: estudios de intención de voto realizados en centros comerciales (sobrerrepresentan mujeres, personas con tiempo libre); estudios de satisfacción de empleados realizados voluntariamente (sobrerrepresentan empleados comprometidos, subestiman descontentos); estudios online (sobrerrepresentan población tech-savvy, subestiman población mayor).
La mejor defensa contra sesgo es documentar cuidadosamente cómo se seleccionó la muestra y, si posible, comparar la composición demográfica de la muestra con la del universo conocido. Si nuestro universo es 55% mujeres y nuestra muestra es 45%, tenemos sesgo de género potencial. Es buena práctica pesar los resultados (dar más peso a mujeres en análisis) para corregir parcialmente este sesgo.
Ideas clave
- El universo es el conjunto total de elementos con la característica que queremos estudiar; definirlo con claridad es primer paso de investigación
- Una muestra bien diseñada proporciona estimaciones precisas del universo a fracción del coste y tiempo de un censo completo
- Muestreo probabilístico permite calcular márgenes de error confiables y generalizar resultados; muestreo no probabilístico es útil pero no permite estos cálculos
- El tamaño de muestra requerido depende del margen de error aceptable, nivel de confianza deseado, y variabilidad esperada
- Sesgo de muestra ocurre cuando la selección favorece sistemáticamente ciertos elementos; requiere atención cuidadosa en diseño e implementación
- La validez de un estudio de mercados depende tanto del tamaño como de la representatividad de la muestra; muestras grandes pero sesgadas generan conclusiones incorrectas