Cuando una política se implementa en algunos municipios antes que en otros, la tentación es estimar una regresión, incluir efectos fijos y llamar “impacto” al coeficiente. El problema es que diferencias en diferencias (DiD) no es una etiqueta causal: es un diseño que depende de supuestos y de una pregunta bien definida.
¿Qué comparación sostiene la inferencia?
La intuición clásica compara el cambio del resultado en unidades tratadas con el cambio en un grupo de comparación. El supuesto central es que, sin la intervención, ambos grupos habrían seguido trayectorias paralelas en promedio. No significa que sus niveles deban ser iguales; significa que la diferencia entre sus trayectorias habría permanecido estable en el contrafactual.
Una revisión reciente de métodos DiD para política sanitaria y evaluación de programas resume cuatro tareas: examinar los supuestos causales, decidir cómo tratar covariables, atender la adopción escalonada y usar inferencia apropiada cuando los errores estándar agrupados convencionales no sirven. Aunque el artículo se dirige a salud, estos problemas aparecen en políticas adoptadas en distintos momentos por estados, municipios o dependencias. (Feng et al., 2025, revisión de métodos DiD).
La adopción escalonada cambia la interpretación
Si los municipios adoptan un programa en años distintos y el efecto varía entre cohortes o a lo largo del tiempo, los estimadores tradicionales de efectos fijos de dos vías pueden combinar comparaciones que no responden a la pregunta sustantiva. Una unidad ya tratada puede terminar funcionando como control de otra recién tratada. El coeficiente resultante puede ponderar efectos de manera difícil de interpretar, incluso con tendencias previas visualmente parecidas.
Por eso, antes de elegir un estimador, conviene precisar el estimando: ¿interesa el efecto promedio para quienes recibieron el programa?, ¿el efecto por cohorte?, ¿el cambio a uno, dos o tres años? Después se define quién puede servir como comparación en cada periodo y qué evidencia respalda el supuesto contrafactual.
Pruebas que ayudan, pero no certifican
Las gráficas de tendencias previas, los estudios de evento y las pruebas placebo permiten detectar incompatibilidades con el diseño. Un resultado “no significativo” en una prueba de pre-tendencias no demuestra que el supuesto sea cierto: con pocas unidades o poca potencia, la prueba puede no detectar diferencias relevantes. También hay que justificar el nivel de agrupamiento de errores y reconocer que pocos municipios tratados complican la inferencia.
En evaluación pública, la secuencia debe ser: cronología de implementación; pregunta y estimando; grupo de comparación; supuestos; estimador; sensibilidad. Empezar por el software suele invertir el orden lógico y esconder la pregunta debajo de la técnica.
Una tarea útil para el aula
Propón al grupo una política hipotética que llega a distintos municipios en años diferentes. Antes de mostrar cualquier resultado, pide que dibujen la cronología, identifiquen las comparaciones posibles y expliquen qué efecto quieren conocer. Después pueden estimar alternativas y observar cuánto cambia la respuesta. El objetivo es que aprendan que la sofisticación estadística no repara un contrafactual mal construido.
Sobre el autor
Dr. Luis Enrique Sánchez Díaz es profesor-investigador de la Facultad de Administración de la Benemérita Universidad Autónoma de Puebla (BUAP). Doctor en Administración, trabaja temas de administración pública, gobernanza, metodología de la investigación, políticas públicas, pensamiento crítico e inteligencia artificial.
Conversemos: sigue el análisis en @luisenriquesan en X y en mis redes sociales. Si este tema es útil para tu investigación o institución, escríbeme.
Descubre más desde Doctor Luis Enrique Sánchez Diaz
Suscríbete y recibe las últimas entradas en tu correo electrónico.