PARTE I · Conocer y razonar con evidencia
3
Investigar
preguntas, mediciones y pruebas
En este capítulo
Si afirmamos que una reforma «funciona mejor», ¿qué tendríamos que observar para comprobarlo? Una impresión no basta. La investigación empieza al precisar la pregunta y decidir qué medida y qué comparación podrían respaldar una conclusión.
3.1. Transformar una intuición en una pregunta investigable#
«Las nuevas salas de lectura funcionan mejor» puede expresar una impresión razonable, pero todavía no determina qué se debe investigar. Mejor puede significar menor ruido, más ocupación, mayor comodidad, mejor accesibilidad o más aprendizaje. Esos resultados pueden cambiar en direcciones distintas.
La investigación comienza al especificar la afirmación. En un ejemplo construido, la pregunta podría ser: «¿Las mesas con separadores reducen las interrupciones observables por hora durante una tarea de lectura en comparación con las mesas abiertas?». Ahora aparecen una población, una intervención, una comparación, un resultado y un periodo.
La precisión de la pregunta tiene un coste: deja de contestar todo a la vez. Un resultado favorable respecto a interrupciones no demuestra mayor comprensión, y un resultado obtenido en una tarea breve no describe necesariamente una tarde completa. No se ha debilitado la investigación; se ha delimitado lo que puede concluirse.
Una definición operacional indica cómo se observará o medirá una propiedad. «Interrupción» podría registrarse como abandonar la tarea durante un intervalo previamente definido. Ese indicador no es idéntico a la atención: alguien puede mirar la página sin comprenderla o apartar la vista para razonar. La operación vuelve posible una comparación, pero no elimina la necesidad de justificar que representa el concepto.
La distinción entre concepto e indicador es especialmente importante en educación y ciencias sociales. Un examen mide respuestas a determinadas tareas bajo condiciones concretas. Inferir de él una competencia más amplia exige un argumento sobre su representatividad. Un número no adquiere validez solo por haber sido calculado de forma uniforme.
3.2. Medir es comparar bajo reglas#
Una medición relaciona una magnitud con una unidad mediante un procedimiento. Decir que una mesa mide 1,20 metros implica una referencia de longitud, un instrumento, puntos entre los que se mide y condiciones que permiten interpretar el resultado.
La metrología estudia las mediciones. En su vocabulario, el mensurando es la magnitud concreta que se pretende medir. La incertidumbre de medición expresa la dispersión de valores que pueden atribuirse razonablemente a esa magnitud según la información disponible. No es sinónimo de equivocación ni una cantidad que se añada para admitir descuido. JCGM, 2008.
Dos personas pueden obtener resultados distintos sin que una haya trabajado mal. Quizá una midió la longitud exterior y otra la superficie útil. Definir el mensurando antecede a juzgar la diferencia. Cuando sí midieron lo mismo, todavía deben considerarse resolución, calibración, condiciones ambientales y procedimiento.
La resolución es la separación mínima entre indicaciones que un sistema permite distinguir. Que una pantalla muestre muchos decimales no demuestra que esos decimales correspondan a información fiable. Una balanza puede indicar 1,0000 kilogramos y estar desplazada sistemáticamente respecto a una referencia.
La precisión se refiere a la cercanía entre mediciones repetidas bajo condiciones especificadas. La exactitud expresa cercanía al valor verdadero; no debe confundirse con una incertidumbre numérica ni con la mera repetibilidad. Las correcciones de efectos sistemáticos también conservan incertidumbre: calibrar mejora una relación de medición, no produce una referencia omnisciente. Taylor y Kuyatt, 1994.
En un ejemplo construido, una regla deformada puede producir diez lecturas casi idénticas y todas desplazadas. Repetir reduce la inestabilidad aleatoria de un promedio bajo determinados supuestos, pero no elimina el mismo desplazamiento repetido diez veces. La repetición es útil cuando ataca el error que realmente existe.
3.3. Una medición con incertidumbre#
Supóngase que, tras definir el procedimiento y evaluar sus limitaciones, se comunica una longitud como:
La tolerancia es una exigencia sobre lo aceptable, no una descripción del conocimiento de la medición. Un diseño puede permitir longitudes entre 119 y 121 cm; un instrumento puede medir con incertidumbre de 0,4 cm. Son dos intervalos con funciones distintas: uno establece un requisito y el otro describe una limitación informativa.
En este ejemplo, presentar el resultado como 120,000000 cm sería una apariencia injustificada de detalle. Redondear no consiste en esconder información, sino en evitar que la escritura prometa una resolución que el procedimiento no respalda.
La incertidumbre también se transmite. Si se calcula el área de un rectángulo multiplicando dos longitudes, la incertidumbre de ambas afecta al área. Para cambios pequeños, la variación relativa del producto depende de las variaciones relativas de los factores; su combinación probabilística requiere además conocer si los errores están relacionados. No puede suponerse independencia porque facilite el cálculo.
Este problema reaparece en estimaciones de población, costes y energía. Un resultado derivado hereda límites de sus entradas y del modelo que las combina. El cálculo puede ser exacto y la respuesta seguir siendo incierta.
3.4. Contrastar una explicación#
Una prueba empírica compara lo que se esperaba bajo una explicación con lo observado. Para que esa comparación informe, hay que identificar qué resultado sería difícil de conciliar con la explicación y qué otras hipótesis podrían producirlo.
En el estudio imaginario de las mesas, los separadores podrían reducir distracciones visuales, pero también dificultar una tarea colaborativa. La hipótesis necesita distinguir tipos de actividad. Formular «mejoran el rendimiento» sin precisar para qué personas, tareas y duración permite reorganizar la interpretación después de cualquier resultado.
La falsabilidad de una hipótesis empírica significa, en términos prácticos, que existen observaciones posibles que contarían contra ella. No significa que deba ser falsa ni que una observación aislada derrumbe automáticamente una teoría. La predicción depende también de instrumentos, condiciones iniciales y supuestos auxiliares. Un resultado inesperado puede exigir revisar cualquiera de esos componentes.
Supóngase que una hipótesis predice menor ruido y el medidor registra más. Puede haber fallado la hipótesis; puede haber cambiado el número de ocupantes; puede estar mal situado el instrumento. La respuesta rigurosa no es proteger indefinidamente la hipótesis con excusas, pero tampoco escoger de inmediato la explicación más dramática. Debe examinarse qué comprobación distingue entre las alternativas.
Una investigación gana fuerza cuando integra pruebas con diferentes vulnerabilidades. Dos instrumentos calibrados mediante el mismo patrón defectuoso no ofrecen independencia plena. Dos métodos que dependen de supuestos distintos pueden aportar una comprobación más informativa. El número de confirmaciones importa menos si todas repiten la misma fuente de error.
3.5. No hay una única secuencia científica#
Algunas investigaciones comienzan con una teoría y deducen predicciones. Otras identifican un patrón inesperado, desarrollan un instrumento o reconstruyen un proceso a partir de huellas. La exigencia común no es una lista rígida de pasos, sino la posibilidad de examinar críticamente la relación entre pregunta, método, evidencia e inferencia.
Un experimento modifica condiciones de forma deliberada. Una observación registra condiciones que no fueron asignadas por quien investiga. Una simulación calcula consecuencias de un modelo. Un análisis documental reconstruye afirmaciones y acciones a partir de registros. Ninguna etiqueta garantiza calidad ni responde por sí sola a todas las preguntas.
La astronomía no necesita reorganizar galaxias para evaluar predicciones acerca de ellas. La historia no necesita repetir un imperio para contrastar cronologías o documentos. La falta de manipulación directa no elimina la posibilidad de inferencia; modifica las comparaciones disponibles y los supuestos que deben defenderse.
Una simulación, por su parte, puede demostrar qué se sigue de unas reglas sin demostrar que el mundo siga esas reglas. Si un modelo produce colas largas cuando se satura un servicio, el resultado informa sobre el modelo. Su aplicación a una oficina requiere comparar tiempos, tasas y comportamiento reales. Esa diferencia entre demostración interna y validación externa es decisiva en ingeniería y ciencias sociales.
3.6. Replicar, reproducir y generalizar#
Las National Academies distinguen estas operaciones (2019). Reproducir un resultado computacional es volver a obtenerlo con los mismos datos y procedimientos. Replicar supone investigar de nuevo la pregunta con datos nuevos y obtener resultados compatibles. La terminología varía entre disciplinas, así que conviene declarar cuál se emplea. NASEM, 2019, cap. 3.
Rehacer una hoja de cálculo con los mismos datos puede revelar un error de programación. Repetir el estudio puede revelar que el resultado dependía de una muestra peculiar. Estudiar otra población examina además la generalización. Son problemas diferentes: un cálculo perfectamente reproducible puede representar una asociación que no aparece fuera de la población original.
Tampoco se exige que cada repetición arroje exactamente el mismo número. Si hay variabilidad, la compatibilidad debe juzgarse considerando magnitud y precisión. Dos estimaciones cercanas pueden recibir etiquetas distintas de significación estadística sin contradecirse. El capítulo 6 explica por qué un umbral no debe reemplazar esa comparación.
Una discrepancia puede tener valor informativo. Quizá cambió el contexto, quizá el instrumento responde de otra manera o quizá el efecto original fue sobreestimado. El objetivo no es convertir cada desacuerdo en un escándalo ni cada resultado en una confirmación, sino identificar qué condiciones explican la variación.
3.7. Cómo una investigación puede engañar sin inventar datos#
Imagínese un equipo que compara varias disposiciones de mobiliario, prueba muchos indicadores y publica solo aquel que cambió más. Cada dato podría ser auténtico y, aun así, el relato final exagerar la evidencia. El problema es la selección: no se muestra el conjunto de intentos del que se extrajo el resultado.
Distinguir análisis exploratorios y confirmatorios ayuda a interpretar ese proceso. Explorar busca patrones e hipótesis. Confirmar pone a prueba una hipótesis suficientemente especificada antes de conocer el resultado relevante. La exploración no es un defecto; presentarla como si hubiera sido una predicción independiente sí altera el significado de la prueba.
Un prerregistro deja constancia previa de preguntas y decisiones de análisis. Puede ayudar a distinguir lo previsto de lo encontrado después. No garantiza un buen diseño ni vuelve verdadera una conclusión. Del mismo modo, compartir datos facilita auditoría solo cuando se documenta su significado y se respetan las obligaciones de privacidad.
La transparencia necesita decisiones completas: criterios de inclusión, exclusiones, resultados medidos y cambios de procedimiento. Si solo se conoce la cifra final, no puede reconstruirse el proceso que la produjo. Los efectos de esa selección se desarrollan matemáticamente en el capítulo 6.
La revisión por especialistas puede detectar errores, pedir aclaraciones y evaluar la pertinencia de un trabajo. No es una certificación de verdad. Un artículo debe juzgarse por sus métodos y por su relación con el resto de la evidencia, no solo por haber atravesado una puerta editorial.
3.8. Investigar también requiere límites éticos#
El hecho de que una pregunta pueda responderse no demuestra que cualquier procedimiento para responderla sea admisible. Una comparación podría ser metodológicamente informativa y vulnerar privacidad, consentimiento o derechos. La evaluación ética no es un añadido decorativo después del diseño; forma parte de las restricciones bajo las que se investiga.
En el ejemplo de la biblioteca, sería posible registrar trayectorias individuales con mucho detalle. Antes de hacerlo habría que justificar para qué se necesita esa información, quién podría acceder a ella y si la pregunta puede contestarse con datos menos identificables. No toda información útil debe conservarse de forma indefinida.
Estas consideraciones son normativas. Se apoyan en una elección acerca de la protección debida a las personas, no se deducen de una ecuación estadística. Pero influyen también en la calidad del conocimiento: una población que desconfía del procedimiento puede participar de manera selectiva, modificando qué observaciones llegan a reunirse.
La investigación responsable distingue, por tanto, lo que se pretende conocer, lo que el método permite inferir y lo que resulta legítimo hacer para obtenerlo. Confundir esas tres evaluaciones perjudica tanto a las personas como al conocimiento.
3.9. Leer un resultado científico#
La unidad pertinente no es solo el titular ni, en muchos casos, un artículo aislado. Conviene reconstruir qué se preguntó, qué se observó, contra qué se comparó y cuánto depende la conclusión de decisiones discutibles.
En términos operativos: una población definida, una medición interpretable, una comparación adecuada y una incertidumbre honesta permiten una conclusión acotada. Su fuerza aumenta si resiste comprobaciones independientes y disminuye si depende de supuestos frágiles que no se reconocen.
La ciencia no es fiable porque quienes la practican sean inmunes a los errores. Lo es en la medida en que sus prácticas hacen detectables y corregibles esos errores. Esa es una aspiración metodológica que debe evaluarse en cada caso, no una garantía automática que acompañe a la palabra «científico».
Pregunta de transferencia 3. Dos sensores producen lecturas casi idénticas y ambos indican una longitud equivocada. ¿Por qué no basta su acuerdo? Un tercer sensor tiene mayor dispersión, pero carece del desplazamiento sistemático de los otros. ¿Qué diferencias deben comunicarse entre precisión, incertidumbre y corrección?
Términos esenciales: operacionalización, indicador, mensurando, metrología, resolución, precisión, exactitud, incertidumbre, calibración, tolerancia, falsabilidad, replicación, reproducibilidad, prerregistro.