Lectura
Índice completo

PARTE I · Conocer y razonar con evidencia

6

Estadística

de los datos a las conclusiones

Capítulo 6 · 21 capítulos publicados

En este capítulo

Cinco entregas tardan, en promedio, cuatro días, aunque cuatro llegan antes de ese plazo. El promedio es correcto, pero no cuenta toda la historia. La estadística ofrece formas de resumir datos sin perder de vista su distribución, variación ni los límites de generalizar a partir de una muestra.

6.1. Un resumen siempre deja algo fuera#

Cinco entregas tardan 1, 2, 2, 3 y 12 días. Su tiempo medio es de 4 días: la suma, 20, dividida entre cinco. Sin embargo, cuatro de las cinco llegaron antes de ese plazo y ninguna tardó exactamente cuatro días. El promedio es correcto; la imagen mental que produce puede no serlo.

La distribución describe cómo se reparten los valores: cuáles aparecen, con qué frecuencia y con qué dispersión. Resumirla mediante un único número resulta útil cuando la pregunta lo permite. Si interesa el tiempo total ocupado por muchas entregas, la media aporta información. Si interesa una entrega situada en el centro de las observadas, la mediana, aquí dos días, responde mejor. Si importa evitar retrasos excepcionales, ninguna de las dos basta.

La media aritmética utiliza todos los valores y responde a los extremos. La mediana divide los datos ordenados de modo que al menos la mitad queda a cada lado, contando las coincidencias. La moda es un valor o categoría de frecuencia máxima; puede haber varias. Ninguna medida es intrínsecamente más honesta: la elección depende de la pregunta y de la forma de la distribución. NIST/SEMATECH, s. f., «Measures of Location»

Un conjunto de remuneraciones muy desigual y otro bastante uniforme pueden tener la misma media. También dos aulas con igual puntuación media pueden diferir en la proporción de estudiantes que necesita apoyo. La afirmación «el promedio no cambió» no demuestra que ninguna persona haya mejorado o empeorado.

En un ejemplo construido, una sala con cuatro tiempos de espera de 1, 1, 3 y 3 minutos tiene media de dos. Las desviaciones respecto de la media son −1, −1, 1 y 1. Su suma es cero, de modo que promediarlas no mide dispersión: los signos se cancelan. Una solución es elevarlas al cuadrado y promediarlas. Así se obtiene una varianza poblacional de un minuto cuadrado. La raíz cuadrada, la desviación estándar, vuelve a la unidad original: un minuto.

Cuando una muestra se utiliza para estimar la varianza de una población, es habitual dividir la suma de cuadrados entre el tamaño de muestra menos uno, no entre el tamaño completo. La corrección responde al hecho de haber estimado primero la media con los mismos datos. No significa que se haya perdido una observación física. Tampoco autoriza a tratar cualquier población como una campana simétrica. Una desviación estándar no es automáticamente un intervalo que contenga determinada proporción de casos.

6.2. Describir una muestra no es describir toda la población#

La población de interés es el conjunto sobre el que se quiere concluir. La muestra es el conjunto observado. Un parámetro resume una propiedad de la población; un estadístico se calcula a partir de la muestra. La media de los cien usuarios entrevistados es un estadístico. La media de satisfacción de todos los usuarios, según una definición y un periodo, es el parámetro que quizá se pretende estimar.

La dificultad no está solamente en que cien sean pocos. Importa cómo llegaron esas cien personas a la muestra. Un cuestionario disponible exclusivamente en una aplicación no alcanza de igual manera a quienes la usan mucho, la usan poco o no pueden acceder a ella. Aumentar las respuestas de cien a cien mil no incorpora automáticamente a los grupos excluidos.

Conviene separar dos problemas. La variabilidad de muestreo aparece porque muestras distintas pueden producir resultados distintos. El sesgo de selección aparece cuando el procedimiento favorece sistemáticamente ciertos casos respecto de la población que se pretende describir. Una muestra grande puede reducir el primero y conservar intacto el segundo.

El marco muestral es el listado o mecanismo mediante el cual se accede a las unidades. Un censo de viviendas desactualizado, una lista de clientes activos o un registro que omite a quienes abandonaron un servicio definen accesos diferentes. La no respuesta añade otra selección: algunas unidades contactadas no contestan. No puede suponerse que sus respuestas habrían sido iguales a las de quienes sí lo hicieron.

Ponderar una muestra significa asignar distinto peso a las observaciones para representar mejor una estructura conocida. Si se conoce la distribución de edades de la población, puede ajustarse la muestra a ella. Pero la ponderación no reconstruye por sí sola una característica ignorada. Si dentro de cada edad responden preferentemente las personas más satisfechas, igualar las edades no elimina necesariamente ese sesgo.

La pregunta pertinente no es «¿hay muchos datos?», sino «¿qué procedimiento conecta estos datos con la población sobre la que se afirma algo?». El prestigio de una base de datos y el número de filas no sustituyen esa conexión.

6.3. Cuánta incertidumbre añade el muestreo#

Una estimación cambia entre muestras. El error estándar describe la dispersión del estimador bajo un modelo de muestreo; no es la dispersión de las personas o los objetos observados.

Para una proporción estimada mediante observaciones independientes, una aproximación habitual es:

EE(p^)≈p^(1−p^)n.

Aquí p^ es la proporción observada y n el número de observaciones. La fórmula aproxima la incertidumbre de muestreo cuando el diseño y el tamaño permiten emplearla. No incluye automáticamente errores de medición, cobertura, no respuesta ni manipulación de datos.

En un ejemplo construido con muestreo aleatorio simple de una población grande, 500 respuestas afirmativas entre 1 000 observaciones dan p^=0,5. El error estándar aproximado es 0,0158, es decir, 1,58 puntos porcentuales. Multiplicarlo por 1,96 produce un margen cercano a 3,1 puntos para un intervalo normal aproximado del 95 %.

La relación con n contiene una raíz cuadrada. Para reducir aproximadamente a la mitad este componente de incertidumbre hace falta multiplicar por cuatro el tamaño muestral, manteniendo las demás condiciones. Duplicarlo no divide el margen entre dos. Además, observaciones muy relacionadas aportan menos información independiente que el mismo número de observaciones verdaderamente independientes.

Entrevistar a muchas personas de unas pocas aulas, barrios o empresas puede crear esa dependencia. Los métodos deben reconocer el diseño de la muestra. Una fórmula para respuestas independientes aplicada sin corrección a grupos estrechamente relacionados puede producir una precisión aparente demasiado alta.

También importa el tamaño relativo de la muestra. Cuando se observa una fracción considerable de una población finita mediante muestreo sin reemplazo, corresponde una corrección específica. Si se observa toda la población definida, desaparece la incertidumbre debida a seleccionar una parte, pero no los errores de registro ni la duda sobre si esa población representa otra época o lugar.

6.4. Lo que significa un intervalo#

Un intervalo de confianza es el resultado de un procedimiento con una cobertura definida bajo ciertos supuestos. En una interpretación frecuentista, un procedimiento del 95 % produciría, en repeticiones apropiadas del muestreo, intervalos que contendrían el parámetro verdadero aproximadamente el 95 % de las veces. Una vez calculado un intervalo concreto, no se convierte por ello en una probabilidad frecuentista del 95 % de que el parámetro fijo esté dentro. NIST/SEMATECH, s. f., «Confidence Limits for the Mean»

La distinción parece verbal hasta que se cambia la pregunta. Una estimación del tiempo medio de atención puede tener un intervalo estrecho porque se observaron muchísimas atenciones. Aun así, la próxima atención individual puede durar mucho más o mucho menos. La incertidumbre sobre una media no equivale a la variabilidad de un caso nuevo.

Un intervalo de predicción se dirige a ese caso o resultado futuro y debe incorporar su variación. Un intervalo de credibilidad bayesiano resume probabilidad posterior sobre un parámetro, condicionada a los datos, al modelo y a las distribuciones previas adoptadas. Los tres pueden tener apariencias numéricas similares y significados diferentes.

En un ejemplo construido, se estima que una modificación de un procedimiento cambia el tiempo medio en −2 minutos, con un intervalo de −5 a +1. Los números son compatibles, bajo el procedimiento empleado, tanto con una reducción relevante como con un pequeño aumento. Decir «se demostró que no cambia nada» borra esa incertidumbre.

Un intervalo muy estrecho alrededor de cero respondería otra pregunta. Podría excluir efectos suficientemente grandes para importar en una decisión. Para evaluar equivalencia se necesita definir qué diferencias se considerarían prácticamente despreciables y comprobar si la evidencia permite situar el efecto dentro de esos márgenes. No basta con que una prueba convencional no haya rechazado cero.

Los intervalos tampoco son protecciones universales contra un mal diseño. Si el método mide una variable equivocada o la muestra excluye sistemáticamente a cierto grupo, estrechar el intervalo puede afinar una respuesta a la pregunta incorrecta.

6.5. El valor p y el error de invertir la pregunta#

Un contraste estadístico parte de una hipótesis y de un modelo para los datos. La hipótesis nula suele representar una referencia concreta, como ausencia de diferencia, pero no tiene que ser siempre esa. El valor p es la probabilidad, bajo el modelo especificado, de obtener un estadístico tan extremo como el observado o más extremo, según la regla del contraste. No es la probabilidad de que la hipótesis nula sea verdadera ni de que «todo se deba al azar». Wasserstein y Lazar, 2016

La inversión es la misma que se examinó en el capítulo 5: una probabilidad de datos condicionada a una hipótesis no equivale a una probabilidad de la hipótesis condicionada a los datos. El cálculo tampoco comprueba por separado todos los supuestos que lo sostienen.

Un umbral como p<0,05 puede formar parte de una regla previamente definida para controlar cierto tipo de error en repeticiones del procedimiento. No crea una frontera natural entre descubrimiento y ausencia de descubrimiento. Dos resultados con p=0,049 y p=0,051 no pasan, por ese pequeño cambio, de una certeza a su negación.

La magnitud del efecto y su importancia práctica deben evaluarse por separado. Una diferencia pequeña puede producir un valor p pequeño con datos muy precisos; una diferencia estimada grande puede acompañarse de gran incertidumbre. La declaración de la Asociación Estadística Estadounidense de 2016 advierte contra convertir la significación en una medida del tamaño, la importancia o la verdad de un resultado. Wasserstein y Lazar, 2016

Para interpretar una comparación conviene conservar la diferencia en unidades comprensibles: minutos, puntos de una escala cuya interpretación se conozca, proporciones o cantidades por persona. «Significativo» no informa de cuánto cambió algo. Tampoco informa de para quién cambió, cuánto costó o qué otros resultados empeoraron.

La potencia de un contraste es su probabilidad de detectar una desviación concreta de la hipótesis nula, bajo los supuestos y la regla de decisión adoptados. No existe una potencia única para todos los efectos posibles. Un estudio puede distinguir bien cambios grandes y ofrecer poca información sobre cambios pequeños.

6.6. Buscar muchas veces cambia lo que significa encontrar#

Supóngase, como ejemplo matemático, que se realizan veinte contrastes independientes, todas sus hipótesis nulas son verdaderas y cada contraste tiene una probabilidad de 0,05 de rechazarlas erróneamente. La probabilidad de no cometer ninguno de esos rechazos es 0,9520. Por tanto:

P(al menos un rechazo erróneo)=1−0,9520≈0,642.

La probabilidad conjunta ronda el 64 %, no el 5 %. Este cálculo no afirma que el 64 % de cualquier literatura científica sea falso: describe el ejemplo bajo sus condiciones de independencia y nulidad. Su valor consiste en mostrar por qué el procedimiento de búsqueda forma parte de la interpretación.

Probar numerosas variables, periodos, exclusiones o subgrupos y comunicar solamente la combinación más llamativa modifica la selección de lo que llega al público. Incluso sin inventar datos, el informe puede producir una imagen demasiado favorable a una hipótesis.

Hay métodos para controlar errores en familias de contrastes y para estimar o limitar proporciones de descubrimientos falsos. Responden a objetivos distintos y no son intercambiables. La decisión metodológica debe reconocer cuántas preguntas se plantean y qué tipo de error importa. Cambiar de análisis después de mirar los resultados puede ser útil para explorar, pero debe distinguirse de una confirmación planificada.

Una revisión sistemática intenta localizar, seleccionar y evaluar investigaciones mediante criterios explícitos. Un metaanálisis combina cuantitativamente resultados cuando esa combinación tiene sentido. Sumar estudios no elimina automáticamente sus limitaciones: muchos estudios con el mismo sesgo no equivalen a muchas comprobaciones independientes. Tampoco una media de efectos convierte contextos heterogéneos en una ley universal.

El registro previo de preguntas y análisis puede hacer visible la diferencia entre lo previsto y lo explorado. No garantiza que la pregunta sea buena, que el instrumento mida bien o que las decisiones analíticas sean adecuadas. La transparencia facilita la crítica; no la sustituye.

6.7. Agregar puede invertir una comparación#

Dos oficinas, A y B, tramitan expedientes simples y complejos. El siguiente ejemplo construido distingue ambos tipos antes de sumar.

Tabla 6.1 — Una inversión producida por la composición de los grupos
Tipo de expediente Oficina A: resueltos / recibidos Tasa A Oficina B: resueltos / recibidos Tasa B
Simple 9 / 10 90 % 72 / 90 80 %
Complejo 18 / 90 20 % 1 / 10 10 %
Total 27 / 100 27 % 73 / 100 73 %

Datos construidos. Las tasas totales ponderan cada tipo según su frecuencia dentro de cada oficina; no comparan la misma mezcla de expedientes.

A supera a B dentro de los dos tipos, pero B tiene una tasa total muy superior. No hay contradicción aritmética. A recibe principalmente casos complejos, de menor tasa de resolución en ambas oficinas. B recibe principalmente casos simples.

Una comparación estandarizada con una mezcla hipotética de 50 % de cada tipo produciría 55 % para A y 45 % para B. Esa comparación contesta «¿qué tasas resultarían al aplicar las tasas observadas a una mezcla común?». No demuestra todavía qué sucedería al trasladar realmente expedientes entre oficinas: podrían existir diferencias no medidas, restricciones de capacidad o efectos de organización.

Esta clase de inversión suele denominarse paradoja de Simpson. Enseña a preguntar por la composición de un agregado, pero no a dividir siempre los datos hasta encontrar el resultado deseado. La decisión de ajustar o no por una variable requiere saber qué papel desempeña en el proceso causal. El capítulo 7 explica por qué controlar una variable puede corregir una comparación o introducir un error.

6.8. Regresión a la media: seleccionar extremos no congela sus causas#

Un resultado puede combinar una característica relativamente persistente y circunstancias temporales. Si se seleccionan los resultados más altos, parte de lo seleccionado puede proceder de circunstancias excepcionalmente favorables. Cuando esas circunstancias no se repiten, una segunda medición tiende a resultar menos extrema, aun sin intervención.

Considérese un procedimiento construido en el que cada puntuación es una capacidad fija más un componente aleatorio independiente, de media cero. Entre quienes obtienen una puntuación extraordinariamente alta habrá personas de gran capacidad y personas favorecidas por un componente temporal positivo. Al repetir la prueba, ese componente no conserva por necesidad su valor. La expectativa del segundo resultado se acerca más al valor persistente.

La regresión a la media no es una fuerza que castigue a los mejores ni una ley según la cual todo deba empeorar después de un éxito. Depende de la variabilidad, de la relación entre mediciones y de haber seleccionado observaciones extremas. Una mejora estructural puede persistir; una medición sin ruido no genera por sí sola el mismo fenómeno.

El error causal aparece cuando se elige a quienes tuvieron un resultado excepcionalmente malo, se interviene y se atribuye toda mejora posterior a la intervención. Para evaluar esa atribución hace falta una comparación que reconozca cómo habrían evolucionado casos semejantes sin ella.

La estadística permite ordenar esta incertidumbre, no borrarla. Antes de aceptar una conclusión deben poder reconstruirse la población, la medición, el procedimiento de selección, el tamaño del efecto y el paso desde los datos hasta la afirmación.

Pregunta de transferencia 6. Un informe afirma que dos procedimientos son equivalentes porque su diferencia estimada es de 2 minutos y un intervalo del 95 % va de −8 a +12 minutos. La organización considera importantes las diferencias de más de 3 minutos. ¿Permite ese intervalo concluir equivalencia práctica? ¿Qué sí permite decir?

Términos esenciales: distribución, media, mediana, varianza, parámetro, estadístico, muestreo, sesgo de selección, error estándar, intervalo de confianza, intervalo de predicción, valor p, potencia, tamaño del efecto, comparación múltiple, regresión a la media.

Bibliografía de la parte I · Bibliografía general

Última revisión editorial
Cierre de contenidos