Lectura
Índice completo

PARTE I · Conocer y razonar con evidencia

5

Probabilidad

aprender de lo incierto

Capítulo 5 · 21 capítulos publicados

En este capítulo

Si una de diez piezas tiene un defecto, ¿qué podemos decir antes de examinar una pieza concreta? Aunque no conocemos el resultado, la frecuencia conocida ya permite hacer predicciones. La probabilidad formaliza ese razonamiento, siempre que se especifique el modelo y la información de partida.

5.1. Incertidumbre no significa ausencia de información#

No saber cuál de diez piezas tiene un defecto no implica desconocerlo todo. Puede saberse que hay exactamente una defectuosa, que todas tienen la misma posibilidad de ser seleccionadas o que un detector identifica ciertos defectos mejor que otros. La probabilidad permite razonar con esa información parcial.

Una probabilidad se expresa entre cero y uno, o entre 0 % y 100 %. En un modelo discreto sencillo, el espacio de resultados enumera posibilidades mutuamente excluyentes y exhaustivas. Sus probabilidades suman uno. Un suceso reúne los resultados que satisfacen una condición. Estas reglas no asignan por sí solas probabilidades a un problema real: hace falta justificar el modelo. Blitzstein y Hwang, 2019.

En una caja con cinco fichas azules y cinco blancas, una extracción que seleccione cada ficha con la misma probabilidad tiene una probabilidad de azul igual a 5/10. La igualdad no procede de que existan dos colores, sino de las cantidades y del procedimiento de selección. Si hubiera nueve azules y una blanca, seguirían existiendo dos colores y sus probabilidades no serían iguales.

Este detalle corrige una intuición frecuente: «ocurre o no ocurre» describe dos posibilidades lógicas, no una probabilidad del 50 %. Para asignar pesos a esas posibilidades se necesita información adicional.

5.2. Qué clase de incertidumbre se está representando#

A veces la incertidumbre procede de variación entre repeticiones: no se sabe qué ficha saldrá al mezclar. Otras veces procede de ignorancia acerca de una cantidad que ya está fijada: no se sabe cuántas fichas azules hay. En muchos problemas aparecen ambas cosas.

Se suele llamar aleatoria a la variabilidad representada por el modelo y epistémica a la incertidumbre asociada a información incompleta. La frontera depende del nivel de descripción. Un proceso puede tratarse probabilísticamente porque sería impracticable seguir todas sus condiciones iniciales, sin que ese modelo resuelva por sí mismo su naturaleza física última.

La interpretación frecuentista relaciona las probabilidades con frecuencias en procedimientos repetidos bajo condiciones especificadas. La interpretación bayesiana permite utilizarlas para expresar incertidumbre sobre hipótesis o parámetros condicionada a información. Ambas emplean el cálculo de probabilidades; difieren en qué se considera incierto y en cómo se construyen determinadas inferencias. Blitzstein y Hwang, 2019.

Una probabilidad del 70 % para un acontecimiento no garantiza que ocurra ni queda refutada automáticamente si no ocurre. La evaluación requiere observar cómo se comporta una clase de pronósticos o examinar la justificación del modelo. Un pronóstico probabilístico no debe transformarse silenciosamente en una afirmación categórica.

5.3. Sumar y multiplicar sin perder el significado#

Si dos sucesos no pueden ocurrir a la vez, sus probabilidades se suman para calcular la probabilidad de que ocurra alguno. Si pueden coincidir, hay que restar la intersección para no contarla dos veces:

P(A∪B)=P(A)+P(B)−P(A∩B).

A∪B significa «A o B, incluidos ambos»; A∩B significa «A y B». La regla puede demostrarse observando que las unidades de la intersección aparecen una vez en cada sumando.

En un ejemplo construido, el 40 % de quienes visitan una biblioteca consulta libros y el 30 % utiliza ordenadores. Si el 10 % hace ambas cosas, el 60 % hace al menos una. Sumar 40 y 30 sin restar la coincidencia produciría 70 %, contando dos veces al mismo grupo.

La probabilidad condicional P(A∣B) se lee «probabilidad de A dado B». Cambia el conjunto de referencia: ahora se consideran solo los casos en que B ocurre. Por definición, cuando P(B)>0:

P(A∣B)=P(A∩B)P(B).

Reorganizar la expresión produce la regla del producto:

P(A∩B)=P(B)P(A∣B).

En palabras: la proporción del total que cumple ambas condiciones es la proporción que cumple B multiplicada por la proporción de A dentro de ese grupo.

La independencia significa que conocer B no cambia la probabilidad de A, bajo el modelo considerado. Solo entonces se simplifica a P(A∩B)=P(A)P(B). Que dos sucesos parezcan diferentes no demuestra independencia.

Volviendo a las fichas: si se extrae una azul y no se devuelve, quedan cuatro azules entre nueve. La probabilidad de dos azules seguidas es (5/10)(4/9)=2/9, no 1/4. Si la primera ficha se devuelve y se restablece el mismo mecanismo de selección, el modelo puede justificar 1/2×1/2=1/4. El procedimiento cambia la probabilidad.

5.4. La tasa base: lo que había antes de la señal#

Un detector que encuentra defectos el 90 % de las veces no implica que una pieza señalada tenga un 90 % de probabilidad de estar defectuosa. La primera afirmación se refiere a piezas que ya son defectuosas. La segunda, a piezas señaladas. Los denominadores son distintos.

Considérese un lote ficticio de 10 000 piezas. El 1 % tiene un defecto: 100 piezas. El detector señala el 90 % de las defectuosas y también señala erróneamente el 5 % de las no defectuosas. Para simplificar, esas proporciones se convierten aquí en recuentos exactos del ejemplo.

Tabla 5.1 — Una señal no es la condición que intenta detectar
Estado de la pieza Señalada No señalada Total
Defectuosa 90 10 100
No defectuosa 495 9 405 9 900
Total 585 9 415 10 000

Ejemplo construido. «Señalada» significa que el detector produce una indicación positiva; no significa que se haya confirmado el defecto.

Entre las 585 piezas señaladas, 90 son defectuosas:

P(defecto∣señal)=90585≈15,4%.

La señal aporta información: la proporción de defectuosas sube del 1 % inicial a aproximadamente el 15,4 %. Pero no produce la certeza intuitivamente atribuida al 90 % de detección. Hay muchas más piezas sin defecto y una pequeña proporción de falsos positivos sobre ese conjunto grande genera muchas señales.

La sensibilidad es la probabilidad de señal positiva entre quienes presentan la condición. La especificidad es la probabilidad de señal negativa entre quienes no la presentan. En el ejemplo, sensibilidad 90 % y especificidad 95 %. El valor predictivo positivo responde a otra pregunta: qué proporción de positivos presenta realmente la condición.

Manténgase el mismo detector, pero supóngase ahora un 10 % de piezas defectuosas en 10 000. Se obtendrían 900 verdaderos positivos y 450 falsos positivos. La proporción de defectuosas entre las señaladas sería 900/1350, aproximadamente el 66,7 %. Cambió la tasa base; cambió el significado de la misma señal.

Idea fundamental
La calidad de una señal y la frecuencia inicial de lo buscado actúan conjuntamente. Una señal informativa puede aumentar mucho una probabilidad y dejar todavía un margen amplio de error.

5.5. El teorema de Bayes como contabilidad de posibilidades#

El ejemplo anterior puede generalizarse. Para una condición D y una señal positiva +:

P(D∣+)=P(+∣D)P(D)P(+∣D)P(D)+P(+∣¬D)P(¬D).

El numerador cuenta la fracción total que tiene la condición y produce señal. El denominador cuenta todas las señales positivas: las procedentes de la condición y las procedentes de su ausencia. La fórmula resulta de dividir una parte entre su conjunto pertinente; no introduce una regla arbitraria para «confiar en el pasado».

P(D) es la probabilidad previa, o a priori, respecto a la señal que se está evaluando. P(D∣+) es la probabilidad posterior. La probabilidad previa puede proceder de mediciones anteriores, de un modelo o de supuestos que deben declararse. No tiene por qué ser una intuición personal sin apoyo.

La verosimilitud compara cuánto cabe esperar la señal bajo distintas hipótesis. En el detector, una señal positiva es 18 veces más probable entre piezas defectuosas que entre piezas no defectuosas: 0,90/0,05=18. Eso es información favorable al defecto, pero no equivale a una probabilidad posterior del 95 %, del 99 % ni de 18 veces un porcentaje sin ajuste.

Una inferencia bayesiana no queda validada solo por utilizar esta fórmula. Puede emplear una tasa base inadecuada, un detector mal caracterizado o una lista incompleta de hipótesis. El cálculo es correcto dentro de sus entradas; su aplicación depende de justificar esas entradas.

Tampoco debe contarse dos veces la misma información. Si la probabilidad previa ya incorporó el informe que se está evaluando, volver a tratar ese informe como evidencia independiente exagera el apoyo. Diez noticias derivadas de una sola observación no equivalen a diez observaciones independientes.

5.6. Sucesos raros y repetición#

Si una operación ficticia tiene una probabilidad de fallo del 1 % y se repite cien veces con independencia y la misma probabilidad, la probabilidad de que no falle ninguna es:

(1−0,01)100=0,99100≈0,366.

Por tanto, la probabilidad de al menos un fallo es aproximadamente el 63,4 %. No es el 100 %, como resultaría de sumar cien veces 1 %, porque esa suma cuenta de forma inadecuada situaciones con más de un fallo.

La fórmula general es:

P(al menos un suceso)=1−(1−p)n.

p representa una probabilidad constante por repetición y n el número de repeticiones independientes. Cuando p es pequeño y np también lo es, np puede aproximar esa probabilidad. Cuando las repeticiones son muchas, la aproximación deja de ser adecuada.

La independencia es un supuesto decisivo. Si todos los fallos provienen de una condición compartida, la repetición no se comporta como cien oportunidades separadas. Dos copias de un archivo guardadas en el mismo dispositivo no ofrecen la misma protección que copias expuestas a fallos distintos. El capítulo 8 conecta esta idea con resiliencia y riesgos comunes.

Una racha tampoco obliga a una compensación inmediata. Bajo un modelo de selecciones independientes con probabilidades constantes, lo ocurrido antes no altera la siguiente selección. A largo plazo puede estabilizarse una proporción sin que el proceso «recuerde» y corrija cada racha.

5.7. Valor esperado: promedio ponderado, no promesa#

Una variable aleatoria asigna una cantidad a los posibles resultados. Su valor esperado es un promedio ponderado por sus probabilidades:

E[X]=∑ipixi.

xi es un resultado posible y pi su probabilidad. El símbolo de suma indica que se agregan las contribuciones de todos los resultados considerados.

Supóngase que una entrega ficticia tarda un día con probabilidad 0,5 y tres días con probabilidad 0,5. Su duración esperada es dos días. Ninguna entrega necesita durar exactamente dos días para que ese promedio sea correcto. El valor esperado no describe necesariamente el caso más frecuente ni un resultado realizable.

Si se comparan servicios, un promedio tampoco agota la decisión. Un servicio que siempre tarda dos días y otro que tarda uno o tres pueden tener el mismo valor esperado y diferir respecto a un plazo imprescindible. La dispersión y las consecuencias de los extremos importan; véase el capítulo 9.

La expectativa es aditiva: el número esperado de incidencias en varios grupos es la suma de sus números esperados, incluso sin independencia, siempre que esas expectativas estén bien definidas. Pero la variabilidad total sí depende de cómo se relacionen los grupos. Sumar promedios es una operación más sencilla que describir el riesgo conjunto.

5.8. Calibración y resolución#

Un conjunto de pronósticos está bien calibrado si, entre los casos a los que se asigna una probabilidad determinada, la frecuencia observada se aproxima a ella, considerando suficiente información y una comparación pertinente. Entre muchos casos pronosticados al 70 %, debería ocurrir aproximadamente el 70 %.

La calibración no basta para producir pronósticos útiles. Un sistema que siempre anuncia la frecuencia general puede estar calibrado y no distinguir situaciones fáciles de difíciles. La resolución o capacidad discriminativa describe su habilidad para separar casos con probabilidades realmente diferentes.

En un ejemplo construido, dos servicios pueden tener una frecuencia general de retrasos del 20 %. Uno siempre pronostica 20 %. Otro distingue jornadas con riesgo bajo y alto, manteniendo calibración en ambos grupos. El segundo puede informar mejor una planificación, aunque ambos reproduzcan el promedio global.

Para evaluar una predicción debe conservarse lo que se dijo antes del resultado, no una interpretación posterior. «Era bastante probable» no permite comprobar si se anunció 55 % o 95 %. La cuantificación no elimina el juicio, pero hace más visible si la confianza se ajusta a la experiencia.

5.9. Lo que la probabilidad no decide#

El cálculo probabilístico establece relaciones entre supuestos y conclusiones. No determina por sí mismo qué hipótesis deben considerarse, qué modelo describe un proceso o cuánto daño resulta aceptable. Tampoco convierte cualquier número subjetivo en una estimación defendible.

Su contribución consiste en impedir errores de coherencia y hacer explícito cómo cambia la incertidumbre con la información. Aprender de una señal requiere conocer su mecanismo, su tasa de error, la frecuencia inicial de lo buscado y la independencia de las fuentes. Decidir qué hacer con esa probabilidad añade otro conjunto de preguntas.

Pregunta de transferencia 5. En un archivo ficticio de 1 000 registros, 20 contienen un error. Un filtro identifica 18 de esos 20 y marca equivocadamente 49 de los 980 restantes. ¿Qué proporción de los registros marcados contiene un error? ¿Por qué esa proporción no es el 90 %?

Términos esenciales: suceso, probabilidad condicional, independencia, tasa base, sensibilidad, especificidad, falso positivo, verosimilitud, probabilidad previa, probabilidad posterior, valor esperado, calibración.

Bibliografía de la parte I · Bibliografía general

Última revisión editorial
Cierre de contenidos