Validez y generalización: cuándo un resultado local sirve para decidir

Un programa puede mostrar resultados positivos en una ciudad y fracasar cuando se replica en otra. A veces se culpa a la “falta de voluntad política”; otras, se concluye que la evaluación inicial estaba equivocada. Entre ambas explicaciones suele faltar una pregunta metodológica: ¿qué parte del resultado podía generalizarse y bajo qué condiciones?

Tres preguntas de validez

La validez de medición pregunta si los indicadores representan el concepto que se quiere estudiar. “Calidad del servicio”, por ejemplo, no queda medida necesariamente por el número de trámites procesados si se ignoran tiempos de espera, accesibilidad o satisfacción.

La validez interna pregunta si el diseño permite atribuir el cambio observado a la intervención y no a selección, tendencias previas u otros factores. La validez externa o generalización pregunta si el resultado puede sostenerse en otras poblaciones, periodos o instituciones. Son preguntas conectadas, pero ninguna responde automáticamente las otras.

La generalización también es inferencia

La discusión reciente sobre evaluación de programas plantea que generalizar un efecto es extender una inferencia causal más allá de las circunstancias particulares del estudio inicial. Para hacerlo con rigor hay que especificar qué se transporta: el efecto promedio, un mecanismo, una relación entre variables o una hipótesis sobre la implementación. (Evaluation Review, número especial sobre validez externa y generalización).

En administración pública, las diferencias relevantes pueden incluir capacidades de personal, reglas de operación, presupuesto, infraestructura, composición de usuarios, coordinación con otras dependencias y calidad de los registros. Un resultado promedio puede ocultar que la política funciona para algunos municipios y no para otros.

Cómo argumentar el alcance de una conclusión

Primero, define el concepto y justifica los indicadores. Después, describe la población y las condiciones de implementación. Luego, identifica qué características del caso podrían modificar el mecanismo causal. Por último, limita la conclusión a lo que permiten los datos: “el programa mejoró este resultado en estas condiciones” es más útil y honesto que “el programa funciona”.

Una matriz de validez puede ayudar a tesistas y equipos de evaluación: constructo e indicador; población y periodo; diseño y contrafactual; mecanismos plausibles; contextos de transferencia; evidencia faltante. Esta tabla no es burocracia metodológica: obliga a distinguir lo observado de lo supuesto.

Para clase, tutoría y decisión pública

En clase, compara dos municipios con capacidades distintas y pide anticipar qué condiciones podrían alterar el efecto de la misma política. En tutoría, pregunta siempre “¿a quiénes alcanza tu conclusión?”. En el trabajo académico, informa qué datos permitirían probar la transferibilidad, en lugar de convertir una limitación en una nota al pie.

La utilidad de una evaluación no depende de que prometa una ley universal. Depende de que indique con claridad dónde se encontró un efecto, por qué pudo ocurrir y qué habría que comprobar antes de trasladarlo a otro lugar.

Sobre el autor

Dr. Luis Enrique Sánchez Díaz es profesor-investigador de la Facultad de Administración de la Benemérita Universidad Autónoma de Puebla (BUAP). Doctor en Administración, trabaja temas de administración pública, gobernanza, metodología de la investigación, políticas públicas, pensamiento crítico e inteligencia artificial.

Conversemos: sigue el análisis en @luisenriquesan en X y en mis redes sociales. Si este tema es útil para tu investigación o institución, escríbeme.


Descubre más desde Doctor Luis Enrique Sánchez Diaz

Suscríbete y recibe las últimas entradas en tu correo electrónico.

Deja un comentario

Descubre más desde Doctor Luis Enrique Sánchez Diaz

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo