Lectura
Índice completo

PARTE XII · Matemáticas: estructuras, cambio e incertidumbre

124

Álgebra lineal: vectores, matrices y transformaciones

Descomponer una relación en contribuciones independientes

Capítulo 124 · 165 capítulos publicados

En este capítulo

Dos coordenadas pueden describir un desplazamiento, dos registros pueden representar las cantidades de un inventario y miles de componentes pueden codificar una imagen. En cada caso interesa algo más que guardar números: interesa combinar estados, saber qué información distingue unos de otros y entender cómo una regla transforma el conjunto.

Una regla especialmente útil permite calcular el efecto de una combinación sumando los efectos de sus partes. Esa propiedad de superposición hace posible representar relaciones extensas mediante un número finito de respuestas elementales. El álgebra lineal estudia dicha estructura. Las matrices permiten calcular con ella; las bases permiten elegir cómo describirla. Cambiar la descripción puede descubrir comportamientos que estaban mezclados en las coordenadas iniciales.

124.1. Vectores, bases y dimensión#

Un desplazamiento de cuatro unidades hacia el este y dos hacia el norte puede representarse mediante el par (4,2). Sumarle (1,−3) produce (5,−1): se suman por separado las contribuciones en cada dirección. Multiplicar el desplazamiento por dos produce (8,4); multiplicarlo por menos uno invierte su sentido. Esas operaciones permiten construir desplazamientos nuevos a partir de otros.

Un vector no tiene que ser una flecha dibujada en el espacio físico. Puede ser una lista de cantidades o una función, siempre que estén definidas operaciones de suma y multiplicación por escalares que satisfagan las reglas de un espacio vectorial. Aquí los escalares serán números reales y se trabajará principalmente con espacios de dimensión finita. En Rn, un vector tiene n componentes reales, la suma se hace componente a componente y un escalar multiplica cada componente.

La interpretación física exige más cuidado que la operación abstracta. Dos listas sólo deben sumarse si sus entradas representan magnitudes compatibles en el mismo orden. Una lista con masa y temperatura puede servir como registro de un estado; sumarla con otra no adquiere automáticamente el significado de juntar dos objetos. El significado de una operación pertenece al modelo que emplea el vector.

Una combinación lineal multiplica vectores por escalares y suma los resultados. Si u y w son vectores y a,b números reales, au+bw es una combinación lineal de ambos. Todas las combinaciones de (1,0) y (0,1) cubren el plano: (x,y)=x(1,0)+y(0,1). En cambio, (1,1) y (2,2) sólo generan una recta, porque el segundo vector es dos veces el primero. Tener dos vectores escritos no garantiza disponer de dos contribuciones independientes.

Un conjunto de vectores es linealmente independiente cuando ninguna combinación que use algún coeficiente distinto de cero da el vector cero. Para dos vectores no nulos esto equivale a que uno no sea múltiplo del otro. En conjuntos mayores, comprobar los pares no basta: (1,0), (0,1) y (1,1) son dependientes aunque ningún par sea paralelo, porque el tercero es la suma de los dos primeros.

Una base combina dos propiedades: genera todo el espacio y es independiente. La primera permite representar cualquier vector; la segunda hace única la representación. Si hubiera dos representaciones diferentes, restarlas daría una combinación no trivial igual a cero. Las coordenadas son los coeficientes de esa representación, respecto de una base ordenada. Todas las bases de un mismo espacio vectorial de dimensión finita tienen igual número de elementos; ese número es su dimensión. (MIT OpenCourseWare, independencia, base y dimensión).

El plano admite bases que no son horizontal y vertical. Con b1=(1,1) y b2=(1,−1),

(4,2)=3b1+b2.

Las coordenadas son (4,2) en la base habitual y (3,1) en la base ordenada (b1,b2). El vector no ha cambiado. También importa el tamaño de los vectores de la base: ambos diagonales tienen longitud 2, y una base de diagonales unitarias daría otros coeficientes. Una coordenada no es una distancia física por sí sola.

Figura 124.1 — Un vector, dos bases

Un vector termina en (4,2). En un panel se obtiene con cuatro pasos horizontales y dos verticales; en el otro, con tres pasos (1,1) y uno (1,-1)

El extremo geométrico se conserva. Las coordenadas cambian porque cambian las contribuciones elegidas para construir el vector

La dimensión cuenta libertades lineales, no ejes visibles. Una recta que pasa por el origen es un subespacio del plano de dimensión uno. Sus vectores pueden escribirse con dos componentes, pero una relación entre ellas deja sólo un coeficiente libre. Una recta que no pasa por el origen no es un subespacio vectorial: no contiene el cero y sus puntos no permanecen en ella bajo todas las combinaciones lineales.

También los polinomios reales de grado a lo sumo dos forman un espacio vectorial. Cada uno se escribe de manera única como a+bx+cx2, por lo que 1,x,x2 constituyen una base de dimensión tres. La palabra «vector» reúne esas situaciones por sus operaciones, sin afirmar que un polinomio sea una flecha espacial.

124.2. Matrices y sistemas lineales#

Un sistema de ecuaciones puede leerse como varias restricciones sobre una misma lista de incógnitas. Para

2x+y=8,x+2y=7,

la primera restricción y la segunda son rectas del plano de pares (x,y). Su intersección es (3,2). El cálculo por eliminación resta a la segunda ecuación la mitad de la primera, obtiene 3y/2=3 y luego recupera x. Cada operación es reversible y conserva las soluciones.

Una matriz reúne los coeficientes sin repetir las incógnitas:

A=(2112),z=(xy),b=(87),Az=b.

Multiplicar una matriz por un vector no significa multiplicar entradas que ocupan la misma posición. Cada componente del resultado es la suma de productos de una fila de la matriz por las entradas del vector. Si la matriz tiene m filas y n columnas, recibe n componentes y produce m. En Az=b, z pertenece a Rn y b a Rm.

La misma multiplicación admite otra lectura:

Az=x(21)+y(12).

Resolver el sistema consiste en expresar b como combinación de las columnas de A. El espacio columna es el conjunto de todas esas combinaciones. Si b queda fuera, no existe solución. Si queda dentro, existe al menos una. La geometría de las columnas explica así la compatibilidad de las restricciones que se leen por filas. (MIT OpenCourseWare, espacio columna y espacio nulo).

Para saber si la solución es única interesa qué cambios de entrada quedan invisibles. El núcleo, o espacio nulo, reúne los vectores h que satisfacen Ah=0. Si z0 resuelve Az=b, también lo hace z0+h. Recíprocamente, la diferencia entre dos soluciones siempre está en el núcleo. Por tanto, un sistema compatible tiene una solución única exactamente cuando su núcleo sólo contiene el cero.

El rango es la dimensión del espacio columna. Para una matriz con n columnas, la dimensión del núcleo es n−r, donde r es el rango. En términos de información, r libertades de entrada producen efectos independientes y n−r pueden variar sin alterar el resultado. Esta interpretación no supone que todas las entradas tengan igual importancia física. (Strang, espacios fundamentales).

Por ejemplo, dos restricciones x+y=5 y 2x+2y=10 repiten información. Hay infinitas soluciones reales, (x,y)=(t,5−t) para cualquier real t. El cambio (1,−1) pertenece al núcleo. Si el segundo término independiente fuera once, las restricciones serían incompatibles. Ni el número de ecuaciones ni su aspecto bastan para determinar la solución.

Una matriz cuadrada de rango completo tiene una inversa A−1 que deshace la transformación: A−1A=AA−1=I, donde I es la matriz identidad. En tal caso, cada b tiene una única entrada z=A−1b. Una matriz rectangular no posee una inversa bilateral entre ambos espacios, aunque puede recuperar entradas de su imagen si no pierde información. Para resolver sistemas grandes se emplean factorizaciones y métodos numéricos; escribir una inversa es una caracterización matemática, no una obligación de calcularla explícitamente.

Existencia y precisión son problemas diferentes. En el sistema

x+y=2,x+1,001y=2,001,

la solución es (1,1). Cambiar el segundo resultado de 2,001 a 2,002, manteniendo los coeficientes exactos, produce (0,2). Una diferencia de una milésima altera las incógnitas en una unidad. Las rectas se cruzan, pero casi son paralelas. El problema está mal condicionado: pequeñas perturbaciones pueden amplificarse. Un algoritmo que cometa poco error de cálculo no elimina esa sensibilidad de los datos. El análisis numérico distingue el condicionamiento del problema y la estabilidad del método. (LAPACK Users' Guide, análisis del error).

124.3. Transformaciones lineales y cambio de base#

Una regla que transforma vectores es lineal si conserva las combinaciones: transformar una suma da la suma de las transformaciones, y transformar un múltiplo da el mismo múltiplo del resultado. Si T es la regla, u,w vectores y c un real,

T(u+w)=T(u)+T(w),T(cu)=cT(u).

Estas condiciones deben cumplirse para todas las entradas y escalares del espacio, no sólo para unos casos ensayados. Implican T(0)=0. Toda multiplicación por una matriz cumple ambas condiciones. A la inversa, una transformación lineal entre espacios de dimensión finita se representa por una matriz una vez elegidas bases de entrada y salida. (MIT, transformaciones lineales y sus matrices).

En el plano, conocer las imágenes de los dos vectores de una base permite calcular cualquier imagen. Si v=au+bw, entonces T(v)=aT(u)+bT(w). Las columnas de la matriz son precisamente las coordenadas de esas imágenes elementales. En la matriz A de la sección anterior, la primera columna describe qué sucede a (1,0) y la segunda qué sucede a (0,1).

Rotar alrededor del origen, reflejar sobre una recta que pasa por él y proyectar ortogonalmente sobre esa recta son transformaciones lineales del plano. Trasladar todos los puntos mediante un desplazamiento fijo no nulo no lo es: mueve el cero. La regla v↦Av+d, con d fijo, es afín; es lineal sólo si d=0. La terminología «recta» de una gráfica afín no debe confundirse con la propiedad de superposición.

Aplicar dos reglas sucesivas introduce el producto de matrices. Si primero se aplica B y luego A, el resultado es A(Bv)=(AB)v. La matriz situada a la derecha actúa primero sobre un vector columna. El orden puede alterar el resultado. Escalar horizontalmente por dos y después girar noventa grados lleva (1,0) a (0,2). Girar primero y escalar después lo lleva a (0,1). Por eso AB y BA no son intercambiables en general.

El cambio de base requiere distinguir transformar un vector de cambiar sus coordenadas. Sea

P=(111−1),

cuyas columnas son b1=(1,1) y b2=(1,−1) escritos en la base habitual. Si c contiene las coordenadas nuevas y z las habituales, z=Pc. Como las columnas constituyen una base, P es invertible y c=P−1z. Para z=(4,2) resulta c=(3,1). La conversión reconstruye el mismo vector mediante distintas contribuciones. (MIT, cambio de base).

Si A transforma el plano en sí mismo y se usa la misma base nueva para entrada y salida, la matriz nueva es

Anueva=P−1AP.

El orden tiene una razón: P pasa la entrada a coordenadas habituales, A actúa y P−1 convierte la salida a coordenadas nuevas. Las matrices relacionadas de este modo se llaman semejantes. La fórmula no se aplica sin cambios a espacios distintos con bases de entrada y salida diferentes.

Para A=(2112), el cálculo da

P−1AP=(3001).

En las coordenadas originales las componentes se mezclan: (4,2) pasa a (10,8). En las nuevas, (3,1) pasa a (9,1). Convertir otra vez da 9b1+b2=(10,8). La operación física o geométrica no se ha modificado; la base ha separado dos comportamientos independientes.

124.4. Autovalores, autovectores y modos#

Hay vectores cuyo resultado bajo una transformación es un múltiplo de ellos mismos. Para el ejemplo anterior, Ab1=3b1 y Ab2=b2. El primero se amplía por tres; el segundo permanece igual. No son las componentes horizontal y vertical las que se comportan independientemente, sino estas dos contribuciones diagonales.

Un vector no nulo v es un autovector de una matriz cuadrada A si

Av=λv,

donde el escalar λ es el autovalor asociado. Se excluye el vector cero porque satisface la igualdad para cualquier λ y no identifica un comportamiento particular. Si λ es positivo, en un espacio geométrico real el resultado conserva el sentido; si es negativo, lo invierte; si es cero, la contribución desaparece. La expresión «misma dirección» debe entenderse con esas salvedades. (MIT OpenCourseWare, autovalores y autovectores).

La ecuación equivale a (A−λI)v=0. Para que exista un v no nulo, esa matriz debe tener núcleo no trivial. En una matriz cuadrada esto sucede cuando su determinante es cero. Para el ejemplo de dos componentes,

det(A−λI)=(2−λ)2−1=0,

de donde λ=3 o λ=1. El determinante de (abcd) es ad−bc; aquí se usa como criterio de singularidad, no como receta suficiente para un cálculo numérico fiable.

Si hay una base de autovectores, expresar una entrada en ella convierte la matriz en diagonal. Repetir la transformación equivale entonces a multiplicar cada contribución por potencias de su autovalor. Para v=3b1+b2, Akv=33kb1+b2, con k un entero no negativo y A0=I. Así se predice la repetición sin recalcular todas las mezclas.

No toda matriz real tiene autovectores reales. Un giro de noventa grados en el plano lleva cada vector no nulo a uno perpendicular. Ninguno puede convertirse en un múltiplo real de sí mismo. Su matriz R=(0−110) satisface R2=−I; un autovalor real exigiría λ2=−1, imposible en los reales. En los complejos aparecen i y −i.

Tampoco disponer de autovalores garantiza una base de autovectores. La matriz J=(1101) tiene sólo el autovalor uno; resolver (J−I)v=0 obliga a que la segunda componente sea cero. Sus autovectores generan una recta y no una base del plano. Cada aplicación añade la segunda componente a la primera: incluso con autovalor uno puede crecer una componente al repetir la regla. La descripción por modos independientes debe demostrar que la base existe.

Una familia importante sí ofrece esa garantía: las matrices reales simétricas, cuyas entradas cumplen aij=aji, tienen autovalores reales y admiten una base ortonormal de autovectores. Los subíndices i,j indican fila y columna: reflejar la matriz sobre su diagonal no cambia las entradas. Ortonormal significa que sus vectores son perpendiculares entre sí y de longitud uno, usando el producto escalar euclidiano. Es una afirmación general del teorema espectral, más fuerte que la comprobación de nuestro ejemplo particular. (MIT, matrices simétricas).

En coordenadas cartesianas ortonormales, el producto escalar de dos vectores reales se calcula sumando los productos de componentes correspondientes: u⋅w=∑i=1nuiwi. Dos vectores no nulos son perpendiculares cuando esa suma es cero. La longitud euclidiana, o norma, es ‖u‖=u⋅u. Estas fórmulas permiten medir la geometría de las coordenadas; si se usa una base oblicua o cuyos vectores no son unitarios, la misma geometría necesita incorporar los tamaños y ángulos de esa base.

Figura 124.2 — Descomponer una mezcla en modos

Una matriz amplía por tres la contribución (1,1) y conserva (1,-1). Su combinación (4,2) pasa a (10,8)

La transformación afecta por separado a los modos, aunque ambas componentes cartesianas del vector compuesto cambien

124.5. Aplicaciones en datos, física e ingeniería#

Cuando las ecuaciones proceden de mediciones, pueden resultar incompatibles sin que haya un error algebraico. Varias observaciones de una relación ideal no suelen caer exactamente sobre la misma regla. En lugar de exigir Az=b, puede buscarse la entrada cuya salida esté lo más cerca posible de b según una medida explícita de discrepancia.

Los mínimos cuadrados minimizan ‖Az−b‖2: la suma de los cuadrados de las componentes del residuo. En la geometría euclidiana, la salida ajustada es la proyección ortogonal de b sobre el espacio columna. El residuo es perpendicular a todas las columnas, porque cualquier componente paralela permitiría acercar más el ajuste. Si las columnas de A son independientes, el ajuste de los coeficientes es único. (MIT, proyecciones y mínimos cuadrados).

La medida de cercanía necesita interpretación. Sumar un error en metros al cuadrado y otro en segundos al cuadrado no proporciona por sí solo un criterio físico adecuado. Incluso con unidades comunes puede convenir ponderar observaciones según su incertidumbre. El ajuste tampoco demuestra causalidad ni garantiza predicciones fuera del rango observado. La estadística examina esas condiciones en el capítulo 128; la operación lineal aporta la geometría del cálculo.

Un ajuste constante a los valores cuatro, cinco y nueve ilustra esa geometría sin exigir una regresión completa. La salida permitida tiene forma (c,c,c). Con c=6, el residuo observado menos ajustado es (−2,−1,3) y sus componentes suman cero: es perpendicular a (1,1,1), la dirección de las salidas permitidas. Cambiar el ajuste a c=6+t eleva la suma de cuadrados de 14 a 14+3t2. Se comprueba así que seis es el mínimo único. Es una propiedad de ese criterio de ajuste, no una afirmación de que seis sea la verdadera cantidad que originó las observaciones.

Ejemplo construido. Dos depósitos ideales intercambian cantidades durante pasos discretos. En cada paso, cada uno conserva dos tercios de su contenido y recibe un tercio del otro. Las cantidades q1,q2, medidas en la misma unidad de volumen, se actualizan mediante qnuevo=Mq, con

M=13(2112).

Es una regla de redistribución definida para este ejemplo, sin evaporación ni aportes externos. Sus columnas suman uno, por lo que conserva q1+q2; sus entradas no negativas conservan cantidades no negativas. Partiendo de seis y tres litros, el siguiente estado es cinco y cuatro. La suma continúa en nueve litros y la diferencia pasa de tres a uno.

Los modos explican ambas propiedades. El modo común (1,1) tiene autovalor uno, mientras que (1,−1) tiene autovalor 1/3. Después de k pasos, la diferencia inicial se ha multiplicado por (1/3)k, y cada depósito se aproxima a 4,5 litros. No hace falta suponer que todas las magnitudes se reducen: permanece el total y se atenúa el desequilibrio. El resultado depende de la regla adoptada y no representa automáticamente el flujo real entre depósitos conectados.

En un modelo físico lineal, separar modos puede distinguir respuestas que evolucionan con diferentes tasas o frecuencias. Sin embargo, la superposición tiene un dominio: una respuesta que es proporcional a pequeñas perturbaciones puede dejar de serlo a deformaciones grandes, saturación o cambios de régimen. La matriz describe las relaciones conservadas por una aproximación; su exactitud algebraica no demuestra la validez física de esa aproximación.

En datos, elegir nuevas direcciones también puede concentrar variación en pocos componentes. El análisis de componentes principales usa direcciones de una matriz de covarianza para ordenar contribuciones según su variación. Conservar sólo algunas permite reducir dimensiones, pero descarta información. Una dirección de gran variación no identifica por sí sola una causa, una categoría natural ni la variable más útil para cualquier predicción. La descripción por ejes depende de qué se midió, cómo se centró y cómo se escogieron las escalas. (Strang, reducción de rango y componentes principales).

Cambiar de base sin eliminar componentes conserva la información. Proyectar sobre un subespacio o descartar modos puede perderla. Esta diferencia separa tres decisiones: cómo representar un estado, qué transformación aplicarle y qué información aceptar perder. Vectores, matrices y modos permiten formularlas de manera que las consecuencias puedan comprobarse.

Preguntas de transferencia#

¿Dos componentes implican dos libertades?#

Un registro tiene siempre la forma (t,2t), con t real. ¿Su conjunto de valores tiene dimensión dos?

Mostrar respuesta razonada

No. Todos los registros son múltiplos de (1,2) y forman una recta por el origen, de dimensión uno. Las dos entradas almacenan una sola libertad lineal. Si se permitiera un desplazamiento fijo, por ejemplo (t,2t+1), el conjunto sería una recta afín y no un subespacio vectorial.

¿Una salida determina las entradas?#

La regla T(x,y)=(x+y,2x+2y) produce (8,16). ¿Puede recuperarse una entrada única?

Mostrar respuesta razonada

No. La salida sólo informa de que x+y=8. Todas las entradas (t,8−t) producen el mismo resultado. El núcleo contiene (h,−h) para cualquier real h, y el rango es uno. Añadir una segunda componente de salida proporcional a la primera no añade información independiente.

¿Conservar autovalores iguales a uno garantiza conservar cada estado?#

Para J=(1101), el único autovalor es uno. ¿Qué ocurre al aplicar la regla k veces a (0,2)?

Mostrar respuesta razonada

Se obtiene (2k,2). La segunda componente permanece en dos y cada paso añade dos a la primera. No hay una base de autovectores; el autovalor aislado no describe toda la interacción entre componentes. La identidad y esta matriz tienen los mismos autovalores pero transformaciones diferentes.

¿Una conservación basta para validar un modelo?#

Ejemplo construido. Un cálculo de redistribución conserva nueve litros entre dos depósitos, pero predice once en uno y menos dos en el otro. ¿La conservación demuestra que el resultado es físicamente aceptable?

Mostrar respuesta razonada

No. La conservación del total es una condición, pero el estado viola la no negatividad de los volúmenes. Puede haber una regla inadecuada, un paso numérico excesivo o un uso fuera del dominio del modelo. La matriz M del ejemplo sí conserva la no negatividad porque todas sus entradas son no negativas. Deben comprobarse ambas propiedades y las condiciones físicas que justifican la actualización.

Fuentes y lecturas del capítulo#

MIT OpenCourseWare, curso 18.06SC. Independence, Basis and Dimension y Column Space and Nullspace (2011). Presentaciones de las nociones que conectan independencia, coordenadas y compatibilidad de sistemas. (Base y dimensión; espacios columna y nulo).

Gilbert Strang. ZoomNotes for Linear Algebra (2021). Notas consultadas sobre rango, espacios fundamentales, reducción de rango y componentes principales. El tratamiento permite pasar de sistemas concretos a la estructura de una transformación. (Documento).

MIT OpenCourseWare, curso 18.06SC. Linear transformations and their matrices y Change of basis; image compression (2011). Resúmenes escritos consultados para las condiciones de linealidad, las columnas como imágenes de una base y la conversión de coordenadas. (Transformaciones; cambio de base).

MIT OpenCourseWare, curso 18.06SC. Eigenvalues and Eigenvectors y Symmetric matrices and positive definiteness (2011). Introducción a contribuciones invariantes y fuente del resultado general para matrices reales simétricas. (Autovalores; matrices simétricas).

MIT OpenCourseWare, curso 18.06SC. Projection matrices and least squares (2011). Resumen consultado para la relación entre residuos, proyección y ajuste, distinguiendo el espacio de observaciones de la gráfica de una recta ajustada. (Documento).

LAPACK Users' Guide. Standard Error Analysis (1999). Documentación del proyecto de álgebra numérica que distingue perturbaciones de entrada, estabilidad del algoritmo y sensibilidad del problema. (Sección).

Bibliografía de la parte XII · Bibliografía general

Última revisión editorial
Cierre de contenidos