Florencia pregunta sobre el estimador de diferencias en diferencias para estimar el impacto del programa: "..Hice unos cálculos con el método diff-in -diff de acuerdo a los textos que vos pasaste y otros, pero tengo una pregunta puntual -muy básica- al respecto (por el momento).
El método diff in diff consiste simplemente en sacar diferencias (restas), primero en dos momentos distintos para cada individuo y luego entre el promedio del grupo tratamiento y el del grupo control?? O incluye alguna regresión econométrica?
Si incluye alguna regresión quería pedirte algún trabajo dónde pueda ver cómo hacer esto operativo o alguna indicación de cómo hacerlo, ya que no he encontrado nada."
Va una respuesta sobre cómo usar el estimador:
El estimador de Dif en Dif puede realizarse como un test estándar de diferencia de medias entre dos grupos de observaciones que son a su vez diferencias. Pero a su vez este test puede implementarese a través de una regresión econométrica.
En el primer caso, lo que haces es calcular para todas las firmas que tienes la diferencia en el tiempo de tu indicador de interés. Por ejemplo supongamos que sea un indicador de productividad como por ejemplo: ventas/numero de trabajadores, le llamemos V/N. Y supongamos que tienes dos períodos de tiempo, por ejemplo 2004 y 2006. Entonces primero para cada firma calculas la diferencia en el ratio ventas/numero de trabajadores. Sería: Dj=V06j/N06j-V04j/N04j , donde a todo le puse una "j" indicando que tienes una observacion para cada firma. Lo que obtuviste para cada firma es una medida de la variación en la productividad, con la idea de que nos permitirá saber quienes incrementaron (o redujeron) y en qué medida su productividad.
El siguiente paso es tomar dos grupos: un grupo con las firmas que fueron FONTAR en ese período (el tratamiento) y aquellas que no (el grupo de control). Con los dos grupos haces una diferencia de medias. En STATA podés hacer el test usando el menu desplegable:
Statistics>summaries tests..>classical tests>two group mean comparison test
Esto tiene su correlato en la estimación de un modelo de regresion. Van dos alternativas:
La primera consiste en estimar un modelo en base a observaciones que son las diferencias (en el tiempo) - por ejemplo las diferencias en productividad que ya mencioné. Por ejemplo:
Dj= a+b*Grupoj
donde Dj es la diferencia como la definimos antes y Grupo es una dummy que toma el valor 1 para el tratamiento y 0 para el control.
La otra forma es usando una variable de interacción. Pero corrés el modelo sobre la variable de productividad en vez de sobre la diferencia. De esta forma:
Vj/Nj=a+b*Tj+c*Grupoj+d*Interaccion
donde Tj es una dummy para el año (en este caso ponele que haces una dummy 2006=1 y 2004 queda con 0; pero podría generalizarse para tantas dummys como períodos distintos tengas- siempre una dummy menos que la cantidad de periodos porque un período es el punto de comparacion)
Grupoj es la misma que antes y por ultimo:
Interaccion=Tj*Grupoj;
El coeficiente que obtengas para la variable interaccion (la estimacion de "d") va a ser el coeficiente de dif-en-dif; si la variable te da significativa es que hay efectivamente una diferencia en productividad que es atribuible al programa (al haber controlado ya por el tiempo y el grupo estas buscando si aquellos que estaban en el grupo tratamiento les fue mejor).
El último paper que leí donde el autor estima usando diferencias en diferencias es el "Urbanization Quality and Property Rights" de Marco Gonzalez Navarro. Él busca evaluar el impacto de un programa de otorgamiento de títulos (privados) de propiedad en México. Para ello compara grupos de parcelas de propiedad comunal (Ejidos) que fueron gradualmente accediendo al programa de otorgamiento de títulos. Puesto que cuenta con datos del Censo de 1990 y 2000, y un grupo de Ejidos que entraron al programa antes de 2000 y posteriormente a 2000, puede comparar aquellos que se habrían beneficiado de la titularización (grupo tratamiento) contra los otros (grupo control) como estrategia para evaluar el efecto del programa. A continuación muestro una tabla de ese paper pues su organizacion permite ver la diferencia en diferencia de una forma bastante intuitiva

La tabla muestra distintos indicadores que utiliza para evaluar el impacto del programa. En esta tabla muestra indicadores de acceso a servicios básicos, por ejemplo, la conexión agua corriente, cloacas y electricidad. Recordemos que la base de datos de Navarro contiene una observación de los indicadores mencionados por cada Ejido y por cada censo.
Notar que en las filas reporta la variación de los indicadores en el tiempo. Como es esperable, en el transcurso de una década, la mayoría de los indicadores de conexión resultó con un inremento significativo. A su vez, las columnas reportan la diferencia entre los grupos de tratamiento (early titled) y control (late titled). Como ejemplo, observar que los grupos de tratamiento y control no difieren significativamente en términos de conexion a agua o cloacas ni en el año 90 ni en el 2000. En cambio el grupo tratamiento posee mayor conexión a electricidad en ambos períodos. ¿Es esta evidencia de conexión a electricidad a favor de los efectos del programa de titularización? No necesariamente. El test ubicado en la esquina inferior derecha es el test correspondiente a la dif en dif. La intuición del test es evaluar si los incrementos en la tasa de conexión fueron superiores para el grupo tratamiento que el control. Notar que en el caso de electricidad la diferencia no es significativa. En otras palabras, si bien el grupo tratamiento presenta mayor conexión, no se observa un incremento en dicha tasa que sea superior al incremento del grupo control. Podrán observar también que la población y la proporción de hogares con pisos firmes creció más en el grupo control (late titled).
Por último aquí tambien hay un modulo de Stata para correr el estimador (no lo probé): http://ideas.repec.org/c/boc/bocode/s457083.html
Donde cada observación en la base de datos es una empresa, la base incluye las empresas de distintas ciudades, y a cada empresa le asigno el valor del capital humano agregado de la ciudad a la que pertenece.

Donde cada observación es un trabajador. Las dummys son variables que toman el valor 0 ó 1 si el máximo nivel de educación del trabajador es haber completado el secundario ó el universitario respectivamente. Aquí deberían usarse los niveles nominales de salarios.