En la investigación social solemos usar “reproducible”, “replicable” y “robusto” como si fueran sinónimos. No lo son. Y la diferencia importa cuando un estudio pretende orientar una política pública, una decisión presupuestaria o una reforma administrativa.
Volver a calcular no equivale a volver a encontrar
La reproducibilidad computacional pregunta si otra persona puede obtener los resultados publicados usando los mismos datos, código y decisiones analíticas. La replicabilidad pregunta si una afirmación se sostiene ante evidencia independiente, obtenida con nuevos datos o en otro contexto. La robustez examina si la conclusión cambia cuando se adoptan decisiones analíticas alternativas que también son defendibles.
Un estudio de 2026 en Nature evaluó la reproducibilidad de una muestra de artículos de ciencias sociales y del comportamiento. Entre los conjuntos de datos disponibles que pudieron evaluar, poco más de la mitad fue reproducible con precisión y cerca de tres cuartas partes al menos aproximadamente reproducible. La disponibilidad de datos y código se asoció con mejores posibilidades de verificación. Eso no demuestra que los estudios sean válidos: permite comprobar con mayor claridad cómo se obtuvieron sus resultados. (Miske et al., 2026).
En otro proyecto, equipos independientes intentaron replicar 274 afirmaciones de 164 artículos cuantitativos. El 55.1% volvió a obtener un resultado significativo en la dirección original; al ponderar por artículo, la estimación fue 49.3%. Los criterios de éxito produjeron resultados distintos, de modo que la tasa no debe convertirse en un veredicto automático sobre “ciencia verdadera” o “ciencia falsa”. La muestra, además, cubre publicaciones de 2009 a 2018 y no representa por sí sola toda la investigación ni específicamente la administración pública. (Tyner et al., 2026).
La ruta analítica también forma parte del resultado
Un análisis de 100 estudios en el que varios equipos reexaminaron los mismos datos encontró que solo el 34% de los reanálisis quedó dentro de una tolerancia estrecha respecto del efecto original; con una tolerancia más amplia, el indicador subió a 57%. Aun así, 74% llegó a una conclusión general semejante, 24% fue inconcluso o no detectó efecto y 2% obtuvo una conclusión opuesta. La lectura cuidadosa no es que “los investigadores pueden demostrar cualquier cosa”, sino que una única ruta analítica puede ocultar incertidumbre. (Aczel et al., 2026).
Para una evaluación municipal, esto exige conservar bases, código, criterios de exclusión, transformaciones y versiones de los datos. Si hay más de una decisión razonable —por ejemplo, cómo medir capacidad institucional o qué municipios comparar—, conviene explicitarla y mostrar si modifica la conclusión.
Qué hacer con esta evidencia
En clase, vale la pena pedir que el alumnado distinga las tres pruebas y reproduzca un resultado sencillo con datos y código. En tutoría, la pregunta clave no es solo “¿es significativo?”, sino “¿qué decisiones producen este resultado y qué otras decisiones eran plausibles?”. En artículos, un paquete reproducible mejora la auditabilidad; no reemplaza el razonamiento teórico, la validez de medición ni el diseño causal.
La credibilidad no se consigue escondiendo las decisiones analíticas bajo una tabla limpia. Se construye permitiendo que otras personas vean cómo se pasó de los datos a la afirmación.
Sobre el autor
Dr. Luis Enrique Sánchez Díaz es profesor-investigador de la Facultad de Administración de la Benemérita Universidad Autónoma de Puebla (BUAP). Doctor en Administración, trabaja temas de administración pública, gobernanza, metodología de la investigación, políticas públicas, pensamiento crítico e inteligencia artificial.
Conversemos: sigue el análisis en @luisenriquesan en X y en mis redes sociales. Si este tema es útil para tu investigación o institución, escríbeme.
Descubre más desde Doctor Luis Enrique Sánchez Diaz
Suscríbete y recibe las últimas entradas en tu correo electrónico.