PARTE I · Conocer y razonar con evidencia
5
Probabilidad
aprender de lo incierto
En este capítulo
Si una de diez piezas tiene un defecto, ¿qué podemos decir antes de examinar una pieza concreta? Aunque no conocemos el resultado, la frecuencia conocida ya permite hacer predicciones. La probabilidad formaliza ese razonamiento, siempre que se especifique el modelo y la información de partida.
5.1. Incertidumbre no significa ausencia de información#
No saber cuál de diez piezas tiene un defecto no implica desconocerlo todo. Puede saberse que hay exactamente una defectuosa, que todas tienen la misma posibilidad de ser seleccionadas o que un detector identifica ciertos defectos mejor que otros. La probabilidad permite razonar con esa información parcial.
Una probabilidad se expresa entre cero y uno, o entre 0 % y 100 %. En un modelo discreto sencillo, el espacio de resultados enumera posibilidades mutuamente excluyentes y exhaustivas. Sus probabilidades suman uno. Un suceso reúne los resultados que satisfacen una condición. Estas reglas no asignan por sí solas probabilidades a un problema real: hace falta justificar el modelo. Blitzstein y Hwang, 2019.
En una caja con cinco fichas azules y cinco blancas, una extracción que seleccione cada ficha con la misma probabilidad tiene una probabilidad de azul igual a
Este detalle corrige una intuición frecuente: «ocurre o no ocurre» describe dos posibilidades lógicas, no una probabilidad del 50 %. Para asignar pesos a esas posibilidades se necesita información adicional.
5.2. Qué clase de incertidumbre se está representando#
A veces la incertidumbre procede de variación entre repeticiones: no se sabe qué ficha saldrá al mezclar. Otras veces procede de ignorancia acerca de una cantidad que ya está fijada: no se sabe cuántas fichas azules hay. En muchos problemas aparecen ambas cosas.
Se suele llamar aleatoria a la variabilidad representada por el modelo y epistémica a la incertidumbre asociada a información incompleta. La frontera depende del nivel de descripción. Un proceso puede tratarse probabilísticamente porque sería impracticable seguir todas sus condiciones iniciales, sin que ese modelo resuelva por sí mismo su naturaleza física última.
La interpretación frecuentista relaciona las probabilidades con frecuencias en procedimientos repetidos bajo condiciones especificadas. La interpretación bayesiana permite utilizarlas para expresar incertidumbre sobre hipótesis o parámetros condicionada a información. Ambas emplean el cálculo de probabilidades; difieren en qué se considera incierto y en cómo se construyen determinadas inferencias. Blitzstein y Hwang, 2019.
Una probabilidad del 70 % para un acontecimiento no garantiza que ocurra ni queda refutada automáticamente si no ocurre. La evaluación requiere observar cómo se comporta una clase de pronósticos o examinar la justificación del modelo. Un pronóstico probabilístico no debe transformarse silenciosamente en una afirmación categórica.
5.3. Sumar y multiplicar sin perder el significado#
Si dos sucesos no pueden ocurrir a la vez, sus probabilidades se suman para calcular la probabilidad de que ocurra alguno. Si pueden coincidir, hay que restar la intersección para no contarla dos veces:
En un ejemplo construido, el 40 % de quienes visitan una biblioteca consulta libros y el 30 % utiliza ordenadores. Si el 10 % hace ambas cosas, el 60 % hace al menos una. Sumar 40 y 30 sin restar la coincidencia produciría 70 %, contando dos veces al mismo grupo.
La probabilidad condicional
Reorganizar la expresión produce la regla del producto:
En palabras: la proporción del total que cumple ambas condiciones es la proporción que cumple B multiplicada por la proporción de A dentro de ese grupo.
La independencia significa que conocer B no cambia la probabilidad de A, bajo el modelo considerado. Solo entonces se simplifica a
Volviendo a las fichas: si se extrae una azul y no se devuelve, quedan cuatro azules entre nueve. La probabilidad de dos azules seguidas es
5.4. La tasa base: lo que había antes de la señal#
Un detector que encuentra defectos el 90 % de las veces no implica que una pieza señalada tenga un 90 % de probabilidad de estar defectuosa. La primera afirmación se refiere a piezas que ya son defectuosas. La segunda, a piezas señaladas. Los denominadores son distintos.
Considérese un lote ficticio de 10 000 piezas. El 1 % tiene un defecto: 100 piezas. El detector señala el 90 % de las defectuosas y también señala erróneamente el 5 % de las no defectuosas. Para simplificar, esas proporciones se convierten aquí en recuentos exactos del ejemplo.
| Estado de la pieza | Señalada | No señalada | Total |
|---|---|---|---|
| Defectuosa | 90 | 10 | 100 |
| No defectuosa | 495 | 9 405 | 9 900 |
| Total | 585 | 9 415 | 10 000 |
Ejemplo construido. «Señalada» significa que el detector produce una indicación positiva; no significa que se haya confirmado el defecto.
Entre las 585 piezas señaladas, 90 son defectuosas:
La señal aporta información: la proporción de defectuosas sube del 1 % inicial a aproximadamente el 15,4 %. Pero no produce la certeza intuitivamente atribuida al 90 % de detección. Hay muchas más piezas sin defecto y una pequeña proporción de falsos positivos sobre ese conjunto grande genera muchas señales.
La sensibilidad es la probabilidad de señal positiva entre quienes presentan la condición. La especificidad es la probabilidad de señal negativa entre quienes no la presentan. En el ejemplo, sensibilidad 90 % y especificidad 95 %. El valor predictivo positivo responde a otra pregunta: qué proporción de positivos presenta realmente la condición.
Manténgase el mismo detector, pero supóngase ahora un 10 % de piezas defectuosas en 10 000. Se obtendrían 900 verdaderos positivos y 450 falsos positivos. La proporción de defectuosas entre las señaladas sería
Idea fundamental
La calidad de una señal y la frecuencia inicial de lo buscado actúan conjuntamente. Una señal informativa puede aumentar mucho una probabilidad y dejar todavía un margen amplio de error.
5.5. El teorema de Bayes como contabilidad de posibilidades#
El ejemplo anterior puede generalizarse. Para una condición
El numerador cuenta la fracción total que tiene la condición y produce señal. El denominador cuenta todas las señales positivas: las procedentes de la condición y las procedentes de su ausencia. La fórmula resulta de dividir una parte entre su conjunto pertinente; no introduce una regla arbitraria para «confiar en el pasado».
La verosimilitud compara cuánto cabe esperar la señal bajo distintas hipótesis. En el detector, una señal positiva es 18 veces más probable entre piezas defectuosas que entre piezas no defectuosas:
Una inferencia bayesiana no queda validada solo por utilizar esta fórmula. Puede emplear una tasa base inadecuada, un detector mal caracterizado o una lista incompleta de hipótesis. El cálculo es correcto dentro de sus entradas; su aplicación depende de justificar esas entradas.
Tampoco debe contarse dos veces la misma información. Si la probabilidad previa ya incorporó el informe que se está evaluando, volver a tratar ese informe como evidencia independiente exagera el apoyo. Diez noticias derivadas de una sola observación no equivalen a diez observaciones independientes.
5.6. Sucesos raros y repetición#
Si una operación ficticia tiene una probabilidad de fallo del 1 % y se repite cien veces con independencia y la misma probabilidad, la probabilidad de que no falle ninguna es:
Por tanto, la probabilidad de al menos un fallo es aproximadamente el 63,4 %. No es el 100 %, como resultaría de sumar cien veces 1 %, porque esa suma cuenta de forma inadecuada situaciones con más de un fallo.
La fórmula general es:
La independencia es un supuesto decisivo. Si todos los fallos provienen de una condición compartida, la repetición no se comporta como cien oportunidades separadas. Dos copias de un archivo guardadas en el mismo dispositivo no ofrecen la misma protección que copias expuestas a fallos distintos. El capítulo 8 conecta esta idea con resiliencia y riesgos comunes.
Una racha tampoco obliga a una compensación inmediata. Bajo un modelo de selecciones independientes con probabilidades constantes, lo ocurrido antes no altera la siguiente selección. A largo plazo puede estabilizarse una proporción sin que el proceso «recuerde» y corrija cada racha.
5.7. Valor esperado: promedio ponderado, no promesa#
Una variable aleatoria asigna una cantidad a los posibles resultados. Su valor esperado es un promedio ponderado por sus probabilidades:
Supóngase que una entrega ficticia tarda un día con probabilidad 0,5 y tres días con probabilidad 0,5. Su duración esperada es dos días. Ninguna entrega necesita durar exactamente dos días para que ese promedio sea correcto. El valor esperado no describe necesariamente el caso más frecuente ni un resultado realizable.
Si se comparan servicios, un promedio tampoco agota la decisión. Un servicio que siempre tarda dos días y otro que tarda uno o tres pueden tener el mismo valor esperado y diferir respecto a un plazo imprescindible. La dispersión y las consecuencias de los extremos importan; véase el capítulo 9.
La expectativa es aditiva: el número esperado de incidencias en varios grupos es la suma de sus números esperados, incluso sin independencia, siempre que esas expectativas estén bien definidas. Pero la variabilidad total sí depende de cómo se relacionen los grupos. Sumar promedios es una operación más sencilla que describir el riesgo conjunto.
5.8. Calibración y resolución#
Un conjunto de pronósticos está bien calibrado si, entre los casos a los que se asigna una probabilidad determinada, la frecuencia observada se aproxima a ella, considerando suficiente información y una comparación pertinente. Entre muchos casos pronosticados al 70 %, debería ocurrir aproximadamente el 70 %.
La calibración no basta para producir pronósticos útiles. Un sistema que siempre anuncia la frecuencia general puede estar calibrado y no distinguir situaciones fáciles de difíciles. La resolución o capacidad discriminativa describe su habilidad para separar casos con probabilidades realmente diferentes.
En un ejemplo construido, dos servicios pueden tener una frecuencia general de retrasos del 20 %. Uno siempre pronostica 20 %. Otro distingue jornadas con riesgo bajo y alto, manteniendo calibración en ambos grupos. El segundo puede informar mejor una planificación, aunque ambos reproduzcan el promedio global.
Para evaluar una predicción debe conservarse lo que se dijo antes del resultado, no una interpretación posterior. «Era bastante probable» no permite comprobar si se anunció 55 % o 95 %. La cuantificación no elimina el juicio, pero hace más visible si la confianza se ajusta a la experiencia.
5.9. Lo que la probabilidad no decide#
El cálculo probabilístico establece relaciones entre supuestos y conclusiones. No determina por sí mismo qué hipótesis deben considerarse, qué modelo describe un proceso o cuánto daño resulta aceptable. Tampoco convierte cualquier número subjetivo en una estimación defendible.
Su contribución consiste en impedir errores de coherencia y hacer explícito cómo cambia la incertidumbre con la información. Aprender de una señal requiere conocer su mecanismo, su tasa de error, la frecuencia inicial de lo buscado y la independencia de las fuentes. Decidir qué hacer con esa probabilidad añade otro conjunto de preguntas.
Pregunta de transferencia 5. En un archivo ficticio de 1 000 registros, 20 contienen un error. Un filtro identifica 18 de esos 20 y marca equivocadamente 49 de los 980 restantes. ¿Qué proporción de los registros marcados contiene un error? ¿Por qué esa proporción no es el 90 %?
Términos esenciales: suceso, probabilidad condicional, independencia, tasa base, sensibilidad, especificidad, falso positivo, verosimilitud, probabilidad previa, probabilidad posterior, valor esperado, calibración.