Lectura
Índice completo

PARTE XII · Matemáticas: estructuras, cambio e incertidumbre

127

Probabilidad: incertidumbre y procesos aleatorios

Asignar posibilidades y revisar lo que se sabe al recibir información

Capítulo 127 · 165 capítulos publicados

En este capítulo

Una señal puede ser frecuente cuando hay un defecto y, aun así, no indicar con mucha certeza que una pieza señalada tenga ese defecto. Para interpretar la señal importa tanto su comportamiento como la frecuencia previa del problema. La pregunta «qué ocurre si hay defecto» y la pregunta «qué defecto hay si ocurre la señal» usan información parecida, pero no tienen la misma respuesta.

La probabilidad permite organizar esas relaciones sin exigir conocer el resultado de cada caso. Combina una descripción de posibilidades con pesos que deben ser coherentes entre sí. Sus conclusiones son exactas respecto del modelo adoptado; asignar ese modelo a un proceso observado es una tarea adicional. La incertidumbre puede reflejar variación entre realizaciones, información incompleta o ambas cosas.

127.1. Espacios de resultados y eventos#

Para calcular una probabilidad hay que fijar qué se observa y qué resultados se distinguen. Si se registran dos señales binarias sucesivas, las posibilidades ordenadas son 00, 01, 10 y 11. Si sólo se registra cuántas señales positivas hubo, los valores son cero, uno y dos. Las tres cantidades no son necesariamente igual de probables: dos secuencias distintas producen un único resultado positivo.

El espacio de resultados, o espacio muestral, contiene las realizaciones admitidas por el modelo; se denota Ω. Un evento reúne resultados que cumplen una condición. En el ejemplo, «exactamente una señal positiva» corresponde a {01,10} y «la primera señal es positiva» a {10,11}. Se pueden unir eventos, intersectarlos y tomar complementos como en los conjuntos del capítulo anterior. (OpenStax, resultados y eventos).

Una ley de probabilidad asigna a cada evento admitido A un número P(A). La asignación es no negativa, el espacio completo tiene probabilidad uno y las probabilidades de eventos disjuntos se suman. Para una colección numerable de eventos mutuamente disjuntos se conserva esa aditividad. En espacios continuos debe especificarse una colección de eventos admisibles; no se necesita tratar aquí los problemas de conjuntos que carecen de una medida apropiada. (MIT, modelos y axiomas de probabilidad).

Como el evento A y su complemento Ac son disjuntos y cubren el espacio, P(Ac)=1−P(A). Si A⊆B, entonces P(A)≤P(B): los resultados adicionales de B no pueden aportar probabilidad negativa. Los números no tienen unidades físicas. Una probabilidad de 0,2 equivale a un veinte por ciento, pero no especifica por sí sola veinte casos observados de cada cien.

En un espacio finito con todos los resultados elementales igualmente probables, P(A)=|A|/|Ω|. La igualdad de pesos es un supuesto, no una consecuencia de haber escrito una lista. Para dos señales independientes con probabilidad positiva 1/2, cada secuencia tiene peso 1/4 y exactamente una positiva tiene probabilidad 1/2. Si cada señal positiva tiene probabilidad 0,9, la secuencia 11 adquiere mucho más peso que 00; contar secuencias sin ponderar daría una respuesta incorrecta.

Un registro de frecuencias puede ayudar a asignar o comprobar esos pesos cuando describe repeticiones comparables. También se emplean probabilidades para representar incertidumbre sobre un estado ya existente pero desconocido. En ambos usos, los cálculos deben especificar información y supuestos. Una pieza no cambia de estado al recibir nueva información sobre ella, aunque la probabilidad asignada a su defecto sí cambie.

Para dos eventos, la regla de suma es

P(A∪B)=P(A)+P(B)−P(A∩B).

La intersección se resta porque sus resultados quedaron incluidos dos veces. La misma lógica de inclusión y exclusión del conteo se aplica a pesos desiguales. Si los eventos son disjuntos, la intersección está vacía y basta sumarlos. (OpenStax, reglas básicas).

127.2. Probabilidad condicional e independencia#

Recibir información puede restringir el conjunto de posibilidades y exigir recalcular sus pesos relativos. La probabilidad condicional de A dado B, para P(B)>0, es

P(A∣B)=P(A∩B)P(B).

El denominador fija el evento al que se limita la evaluación, y el numerador conserva la parte que también cumple A. La barra vertical significa «dado», no una división adicional ni una relación causal. Condicionar no requiere que B ocurra antes que A; puede ser información sobre otro aspecto del mismo caso. (Pishro-Nik, probabilidad condicional).

Ejemplo construido. Un modelo de inspección fija una proporción de piezas defectuosas del uno por ciento. La señal es positiva en el noventa por ciento de las piezas defectuosas y en el cinco por ciento de las no defectuosas. Se elige una pieza según esa población de referencia, sin otra información. Se supone que las tres probabilidades describen el mismo tipo de pieza y las mismas condiciones de inspección.

En diez mil selecciones comparables, las frecuencias esperadas son cien piezas defectuosas y 9.900 sin defecto. Se esperan noventa señales positivas del primer grupo y 495 del segundo. Hay 585 positivas en total; noventa corresponden al defecto. Por tanto, para una pieza con señal positiva, la probabilidad de defecto es 90/585=2/13, aproximadamente 15,4%. Esos conteos expresan las proporciones del modelo, no garantizan resultados exactos en un lote real de diez mil.

La frecuencia de señales positivas entre piezas defectuosas era noventa por ciento; la proporción de piezas defectuosas entre señales positivas es aproximadamente quince por ciento. La diferencia aparece porque las piezas sin defecto son mucho más numerosas. Un cinco por ciento de ese grupo produce más señales que un noventa por ciento del grupo raro.

Sean D el evento «defecto» y + el evento «señal positiva». Se obtiene primero

P(+)=P(+∣D)P(D)+P(+∣Dc)P(Dc)=0,9⋅0,01+0,05⋅0,99=0,0585.

Los dos términos pertenecen a casos excluyentes y exhaustivos. Al dividir la probabilidad conjunta de defecto y señal por la probabilidad de señal,

P(D∣+)=P(+∣D)P(D)P(+)=0,0090,0585.

Esta inversión del condicionamiento es la regla de Bayes. Procede de que P(D∩+) puede escribirse tanto P(+∣D)P(D) como P(D∣+)P(+). Exige denominadores positivos y probabilidades pertinentes para la población evaluada. Cambiar la proporción previa de defectos cambia el resultado aunque la respuesta de la prueba dentro de cada grupo permanezca igual. (Pishro-Nik, regla de Bayes).

Figura 127.1 — Una señal positiva reúne dos orígenes distintos

Por cada diez mil selecciones se esperan noventa positivas con defecto y 495 positivas sin defecto. Entre las 585 positivas, noventa corresponden al defecto

Las probabilidades de cada rama se aplican a su grupo de origen. Condicionar a señal positiva reúne las dos ramas positivas y usa ese total como denominador; las cantidades son esperadas

Dos eventos son independientes si P(A∩B)=P(A)P(B). Cuando ambos tienen probabilidad positiva, conocer uno no cambia la probabilidad del otro. La definición por producto también cubre eventos de probabilidad cero, para los que la división condicional elemental no está definida. Independencia es una propiedad del modelo conjunto; no equivale a que los eventos ocurran lejos, en tiempos distintos o por mecanismos aparentemente diferentes. (OpenStax, independencia y exclusión mutua).

Dos eventos mutuamente excluyentes de probabilidad positiva no son independientes. Su intersección tiene probabilidad cero, mientras que el producto de sus probabilidades es positivo. Saber que ocurrió uno descarta el otro. En una extracción sin reposición, conocer el primer resultado cambia la composición para la segunda; la independencia necesitaría justificarse de otra manera. Tampoco comprobar independencia de cada par garantiza independencia conjunta de una colección mayor.

Esto último puede verse con dos señales binarias independientes y equiprobables. Sean A «la primera vale uno», B «la segunda vale uno» y C «son diferentes». Cada evento tiene probabilidad 1/2, y cada intersección de dos tiene probabilidad 1/4: los pares son independientes. Pero los tres no pueden ocurrir juntos, porque si las dos señales valen uno no son diferentes. Su intersección triple tiene probabilidad cero, en vez del producto 1/8 que exigiría la independencia conjunta. La estructura compartida puede quedar oculta al examinar sólo pares.

127.3. Variables aleatorias y distribuciones#

Puede interesar una cantidad asociada al resultado en vez de toda su descripción. Una variable aleatoria es una función que asigna un valor numérico a cada resultado del espacio, con las condiciones necesarias para que sus eventos tengan probabilidades definidas. «Aleatoria» no significa que cada número admisible sea igual de probable ni que la función cambie arbitrariamente.

Su distribución indica cómo se reparte la probabilidad entre valores o intervalos. Para una variable discreta X, la función de masa asigna P(X=x) a cada valor posible x; las masas son no negativas y suman uno. Un resultado que pueda aparecer de varias formas reúne las probabilidades de todas esas realizaciones.

Si X cuenta resultados positivos en n ensayos independientes, cada uno con la misma probabilidad p, tiene distribución binomial:

P(X=k)=(nk)pk(1−p)n−k,k=0,1,…,n.

n es un entero no negativo, k el conteo y 0≤p≤1. Para 0<p<1, cada secuencia con k positivos tiene el mismo peso pk(1−p)n−k, y (nk) cuenta esas secuencias. En los extremos p=0 o p=1 se entiende la distribución concentrada en cero o en n, respectivamente. La expresión exige probabilidad constante e independencia; no describe automáticamente defectos agrupados por lote. (OpenStax, distribución binomial).

Para una variable con distribución continua descrita por una densidad, la probabilidad de un intervalo se obtiene integrando esa densidad. Si f es la densidad y a<b,

P(a<X<b)=∫abf(x)dx.

La densidad es no negativa y su integral total vale uno. Su altura no es una probabilidad puntual y puede superar uno. Si X mide tiempo en minutos, f tiene unidades de minuto inverso; el producto de densidad y ancho temporal da una probabilidad sin unidades. (OpenStax, funciones de probabilidad continua).

Ejemplo construido. Un modelo de tiempo T reparte probabilidad uniformemente entre cero y diez minutos. Su densidad es 1/(10 min) dentro del intervalo y cero fuera. La probabilidad entre dos y cinco minutos es (3 min)/(10 min)=0,3. La probabilidad de un valor exacto, como tres minutos, es cero: un punto no tiene ancho.

Esto no convierte tres minutos en un valor lógicamente prohibido. Cada realización continua toma un valor, aunque cada punto por separado tenga probabilidad cero. Un registro redondeado a «3,0 minutos» representa un intervalo de resolución y puede tener probabilidad positiva. Tampoco es posible sumar sin condiciones las probabilidades de una colección no numerable de puntos como si fuera una lista finita.

La función de distribución acumulada, FX(x)=P(X≤x), sirve tanto para variables discretas como continuas y mixtas. No disminuye cuando aumenta x, porque los eventos se incluyen unos en otros. Para a<b, P(a<X≤b)=FX(b)−FX(a). En una variable discreta importan los extremos incluidos; en una distribución con densidad, los puntos individuales no añaden masa. (Pishro-Nik, distribución acumulada).

127.4. Esperanza, varianza y leyes de los grandes números#

Un promedio probabilístico pondera los valores por sus probabilidades. Para una variable discreta con esperanza bien definida,

μ=E[X]=∑xxP(X=x).

La suma recorre los valores posibles. En una distribución continua con densidad se usa la integral de xf(x). Para evitar ambigüedades de convergencia en valores positivos y negativos, se exige integrabilidad absoluta cuando se habla de una esperanza finita general: el promedio de |X| debe ser finito, sin obtener una falsa cancelación entre aportes infinitos de signos opuestos. La esperanza tiene las mismas unidades que X, pero no tiene que ser un valor que pueda observarse. (OpenStax, esperanza y dispersión).

Ejemplo construido. Un retraso X vale cero minutos con probabilidad 0,9 y veinte minutos con probabilidad 0,1. Su esperanza es dos minutos. Ninguna realización del modelo dura dos minutos de retraso: ese número resume el promedio ponderado. Otro modelo con retraso fijo de dos minutos tiene la misma esperanza y un comportamiento completamente distinto.

La varianza mide el promedio de desviaciones cuadráticas respecto de la esperanza: Var(X)=E[(X−μ)2], cuando es finita. El cuadrado evita que desviaciones positivas y negativas se cancelen. En el retraso construido,

Var(X)=0,9(0−2)2+0,1(20−2)2=36 min2.

La desviación estándar es la raíz cuadrada de la varianza, seis minutos. No afirma que todos los retrasos se encuentren a seis minutos o menos de la media.

La esperanza de una suma es la suma de las esperanzas, sin exigir independencia, si las cantidades son integrables. La varianza de una suma necesita considerar dependencia. Para variables de magnitudes compatibles y con segundo momento finito,

Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y),

donde Cov(X,Y)=E[(X−E[X])(Y−E[Y])] es la covarianza. Si son independientes, la covarianza es cero. La implicación recíproca no es general: covarianza cero no garantiza independencia. Al repetir una misma variable n veces, la suma es nX y su varianza es n2Var(X), no nVar(X). (Pishro-Nik, covarianza y varianza de sumas).

Una versión de la ley de los grandes números considera variables X1,…,Xn independientes y con la misma distribución, esperanza μ y varianza finita σ2. Para su media X―n=(X1+⋯+Xn)/n, la esperanza sigue siendo μ y la varianza es σ2/n. La desigualdad de Chebyshev permite acotar, para cualquier tolerancia ε>0,

P(|X―n−μ|≥ε)≤σ2nε2.

La tolerancia tiene las unidades de X, por lo que la cota no tiene unidades. Al crecer n, el lado derecho tiende a cero. Esa es la convergencia en probabilidad de la media a la esperanza: para cualquier tolerancia fija, se vuelve pequeña la probabilidad de una desviación mayor. Esta prueba usa varianza finita; existen versiones más generales con otras condiciones. (Sheffield, ley débil de los grandes números).

La ley no promete que la media se acerque en cada paso ni que corrija un sesgo de observación. Para ensayos independientes de probabilidad p, las variables indicadoras, uno si ocurre el evento y cero si no, tienen esperanza p. Su promedio es la frecuencia relativa. Repeticiones comparables permiten así estimar una probabilidad mediante frecuencias, con variación finita y condiciones explícitas.

Una racha tampoco obliga a compensarse. Si los ensayos siguen siendo independientes con probabilidad p, los resultados anteriores no alteran el siguiente. La proporción acumulada puede acercarse a p porque nuevos ensayos reducen el peso relativo de la racha inicial, sin que exista una fuerza que exija el resultado contrario. Si la probabilidad cambia por desgaste, aprendizaje o condiciones compartidas, se trata de otro modelo.

127.5. Procesos aleatorios, dependencia y simulación#

Un proceso aleatorio reúne variables indexadas por tiempo u otro parámetro. Una distribución por instante no basta para describirlo: también se necesita cómo se relacionan los instantes. Dos procesos pueden tener igual probabilidad de interrupción en cada momento y presentar duraciones o agrupaciones de interrupciones diferentes.

Una cadena de Markov modela la transición entre estados bajo el supuesto de que, conocido el estado actual, el pasado no aporta información adicional para el siguiente. No exige que estados sucesivos sean independientes. Una versión homogénea mantiene las mismas probabilidades de transición en cada paso. (Pishro-Nik, cadenas de Markov).

Ejemplo construido. Un modelo de servicio usa pasos de una hora y dos estados: disponible e interrumpido. Si está disponible, la probabilidad de interrupción en el paso siguiente es 0,1; si está interrumpido, la probabilidad de seguir así es 0,6. No se modelan causas concretas, duración dentro de la hora ni diferencias entre tipos de avería. Las transiciones son supuestos del ejemplo, no tasas observadas.

Partiendo del estado disponible, la interrupción en el primer paso tiene probabilidad 0,1. En el segundo puede proceder de dos rutas: haber permanecido disponible y luego interrumpirse, con probabilidad 0,9⋅0,1, o haberse interrumpido y continuar, con probabilidad 0,1⋅0,6. El total es 0,15. No basta repetir el número 0,1 como si fuera la probabilidad incondicional a toda hora.

Si rn es la probabilidad de interrupción en el paso n, la regla da rn+1=0,1(1−rn)+0,6rn=0,1+0,5rn. La probabilidad fija satisface r=0,1+0,5r, de donde r=0,2. Para este modelo, la diferencia respecto de 0,2 se reduce a la mitad en cada paso. Es una conclusión del cálculo que usa la distribución y la transición iniciales; la fracción observada en una trayectoria necesita considerar su dependencia. (Sheffield, transiciones y distribución estacionaria).

La simulación genera realizaciones de un modelo para estudiar resultados difíciles de calcular directamente. Para el servicio, se puede generar en cada paso un nuevo número uniforme U entre cero y uno, independiente de los anteriores, y comparar con la probabilidad correspondiente al estado actual. Desde disponible, U<0,1 produce interrupción; desde interrumpido, U<0,6 conserva la interrupción. La regla reproduce las transiciones si los números empleados tienen las propiedades requeridas y el programa se implementa correctamente.

Un generador seudoaleatorio produce una secuencia mediante un procedimiento determinista. Registrar su semilla, versión y configuración permite reproducir un cálculo bajo condiciones compatibles. La documentación de Python, por ejemplo, distingue reproducibilidad de semillas y posibles cambios de algoritmos entre versiones. Repetir una secuencia reproduce la simulación, no demuestra independencia empírica ni validez del modelo del servicio. (Python, generación seudoaleatoria y reproducibilidad).

Hay que distinguir el error de simulación de la incertidumbre del modelo. Aumentar el número de realizaciones puede reducir la variación del promedio calculado, pero no corrige probabilidades de transición equivocadas, estados insuficientes o relaciones omitidas. Para un suceso raro, una simulación corta puede no observarlo aunque tenga probabilidad positiva. Cero apariciones no equivale a una demostración de imposibilidad.

La probabilidad hace explícito qué se condiciona, qué varía y qué depende de qué. La estadística añade otra pregunta: cómo aprender esos pesos y relaciones a partir de datos que también tienen un proceso de selección y medición. Un cálculo coherente es necesario, pero necesita evidencia para convertirse en una descripción defendible de un sistema.

Preguntas de transferencia#

¿La misma prueba conserva la misma interpretación en otra población?#

Ejemplo construido. La proporción de defectos sube al diez por ciento y permanecen las probabilidades de señal del ejemplo: 0,9 con defecto y 0,05 sin él. ¿Cuál es la probabilidad de defecto dada una señal positiva?

Mostrar respuesta razonada

El cálculo es

0,9⋅0,10,9⋅0,1+0,05⋅0,9=0,090,135=23.

Aumenta desde aproximadamente quince por ciento a aproximadamente sesenta y siete por ciento. La prueba conserva sus probabilidades dentro de cada estado; cambia la mezcla de estados que produce las señales.

¿Dos sucesos excluyentes pueden ser independientes?#

Dos eventos tienen probabilidades 0,3 y 0,4 y no pueden ocurrir juntos. ¿Son independientes?

Mostrar respuesta razonada

No. Su intersección tiene probabilidad cero y el producto es 0,12. Si se conoce que uno ocurrió, la probabilidad del otro pasa a cero. Exclusión e independencia expresan relaciones distintas. La salvedad de eventos de probabilidad cero no se aplica aquí.

¿Un valor con probabilidad cero está prohibido?#

En el tiempo uniforme entre cero y diez minutos, P(T=3)=0. ¿Eso demuestra que nunca puede registrarse «3,0 minutos»?

Mostrar respuesta razonada

No. El valor exacto tiene probabilidad cero en un modelo continuo, pero un registro redondeado representa un intervalo. Con redondeo al décimo más cercano, «3,0» corresponde aproximadamente a 2,95≤T<3,05, de ancho 0,1 minuto y probabilidad 0,01. La resolución del registro cambia el evento que se evalúa.

¿Mil copias de una observación equivalen a mil repeticiones?#

Se observa una variable X y se guarda ese mismo valor mil veces. ¿La media de los registros tiene varianza Var(X)/1000?

Mostrar respuesta razonada

No. Todos los registros son la misma variable, por lo que su media es exactamente X y conserva su varianza. La reducción por mil requiere repeticiones con las condiciones de independencia usadas en esa fórmula. Multiplicar el tamaño de una tabla no multiplica la información independiente.

Fuentes y lecturas del capítulo#

Barbara Illowsky y Susan Dean. Introductory Statistics 2e, OpenStax (2023), secciones Terminology, Independent and Mutually Exclusive Events y Two Basic Rules of Probability. Consultadas para eventos y reglas de suma y producto, preservando las condiciones de independencia y los denominadores del condicionamiento. (Terminología; independencia; reglas).

Barbara Illowsky y Susan Dean. Misma obra, Mean or Expected Value and Standard Deviation, Binomial Distribution y Continuous Probability Functions. Consultadas para promedios ponderados, condiciones binomiales y probabilidades como integrales de densidad. (Esperanza; binomial; densidades).

MIT OpenCourseWare, John Tsitsiklis y Patrick Jaillet. Introduction to Probability, lección 1, Probability Models and Axioms (2018). Diapositivas consultadas para distinguir resultados, eventos y las reglas que debe satisfacer una asignación de probabilidades. (Documento).

Hossein Pishro-Nik. Introduction to Probability, Statistics, and Random Processes (2014), versión web, secciones Conditional Probability, Bayes' Rule, Cumulative Distribution Function, Covariance and Correlation e introducción a cadenas de Markov. Se consultaron sus definiciones y relaciones; los ejemplos numéricos del capítulo son construidos. (Condicionamiento; Bayes; distribución acumulada; covarianza; Markov).

Scott Sheffield. 18.440: Lecture 30 — Weak law of large numbers y Lecture 33 — Markov Chains, MIT (2014). Diapositivas consultadas para convergencia en probabilidad, la prueba con varianza finita y distribuciones de transición y estacionarias. (Grandes números; cadenas).

Python Software Foundation. random — Generate pseudo-random numbers, documentación consultada el 29 de septiembre de 2026. Fuente para las condiciones de reproducción de secuencias seudoaleatorias; no se usa como garantía de validez de una simulación científica. (Documentación).

Bibliografía de la parte XII · Bibliografía general

Última revisión editorial
Cierre de contenidos