viernes, 15 de enero de 2010

Estimador de Diferencias en Diferencias

Florencia se encuentra evaluando el Impacto de los programa FONTAR sobre la performance de las firmas que accedieron a ese programa, utilizando un grupo de empresas de características similares (en base a características observables) como grupo de control, y una base de datos de panel que contiene para varios años indicadores de las empresas y el dato de en qué años esas empresas fueron financiadas por FONTAR.

Florencia pregunta sobre el estimador de diferencias en diferencias para estimar el impacto del programa: "..Hice unos cálculos con el método diff-in -diff de acuerdo a los textos que vos pasaste y otros, pero tengo una pregunta puntual -muy básica- al respecto (por el momento).

El método diff in diff consiste simplemente en sacar diferencias (restas), primero en dos momentos distintos para cada individuo y luego entre el promedio del grupo tratamiento y el del grupo control?? O incluye alguna regresión econométrica?
Si incluye alguna regresión quería pedirte algún trabajo dónde pueda ver cómo hacer esto operativo o alguna indicación de cómo hacerlo, ya que no he encontrado nada."


Va una respuesta sobre cómo usar el estimador:

El estimador de Dif en Dif puede realizarse como un test estándar de diferencia de medias entre dos grupos de observaciones que son a su vez diferencias. Pero a su vez este test puede implementarese a través de una regresión econométrica.

En el primer caso, lo que haces es calcular para todas las firmas que tienes la diferencia en el tiempo de tu indicador de interés. Por ejemplo supongamos que sea un indicador de productividad como por ejemplo: ventas/numero de trabajadores, le llamemos V/N. Y supongamos que tienes dos períodos de tiempo, por ejemplo 2004 y 2006. Entonces primero para cada firma calculas la diferencia en el ratio ventas/numero de trabajadores. Sería: Dj=V06j/N06j-V04j/N04j , donde a todo le puse una "j" indicando que tienes una observacion para cada firma. Lo que obtuviste para cada firma es una medida de la variación en la productividad, con la idea de que nos permitirá saber quienes incrementaron (o redujeron) y en qué medida su productividad.

El siguiente paso es tomar dos grupos: un grupo con las firmas que fueron FONTAR en ese período (el tratamiento) y aquellas que no (el grupo de control). Con los dos grupos haces una diferencia de medias. En STATA podés hacer el test usando el menu desplegable:

Statistics>summaries tests..>classical tests>two group mean comparison test

Esto tiene su correlato en la estimación de un modelo de regresion. Van dos alternativas:

La primera consiste en estimar un modelo en base a observaciones que son las diferencias (en el tiempo) - por ejemplo las diferencias en productividad que ya mencioné. Por ejemplo:

Dj= a+b*Grupoj

donde Dj es la diferencia como la definimos antes y Grupo es una dummy que toma el valor 1 para el tratamiento y 0 para el control.

La otra forma es usando una variable de interacción. Pero corrés el modelo sobre la variable de productividad en vez de sobre la diferencia. De esta forma:

Vj/Nj=a+b*Tj+c*Grupoj+d*Interaccion

donde Tj es una dummy para el año (en este caso ponele que haces una dummy 2006=1 y 2004 queda con 0; pero podría generalizarse para tantas dummys como períodos distintos tengas- siempre una dummy menos que la cantidad de periodos porque un período es el punto de comparacion)
Grupoj es la misma que antes y por ultimo:

Interaccion=Tj*Grupoj;

El coeficiente que obtengas para la variable interaccion (la estimacion de "d") va a ser el coeficiente de dif-en-dif; si la variable te da significativa es que hay efectivamente una diferencia en productividad que es atribuible al programa (al haber controlado ya por el tiempo y el grupo estas buscando si aquellos que estaban en el grupo tratamiento les fue mejor).

El último paper que leí donde el autor estima usando diferencias en diferencias es el "Urbanization Quality and Property Rights" de Marco Gonzalez Navarro. Él busca evaluar el impacto de un programa de otorgamiento de títulos (privados) de propiedad en México. Para ello compara grupos de parcelas de propiedad comunal (Ejidos) que fueron gradualmente accediendo al programa de otorgamiento de títulos. Puesto que cuenta con datos del Censo de 1990 y 2000, y un grupo de Ejidos que entraron al programa antes de 2000 y posteriormente a 2000, puede comparar aquellos que se habrían beneficiado de la titularización (grupo tratamiento) contra los otros (grupo control) como estrategia para evaluar el efecto del programa. A continuación muestro una tabla de ese paper pues su organizacion permite ver la diferencia en diferencia de una forma bastante intuitiva



La tabla muestra distintos indicadores que utiliza para evaluar el impacto del programa. En esta tabla muestra indicadores de acceso a servicios básicos, por ejemplo, la conexión agua corriente, cloacas y electricidad. Recordemos que la base de datos de Navarro contiene una observación de los indicadores mencionados por cada Ejido y por cada censo.

Notar que en las filas reporta la variación de los indicadores en el tiempo. Como es esperable, en el transcurso de una década, la mayoría de los indicadores de conexión resultó con un inremento significativo. A su vez, las columnas reportan la diferencia entre los grupos de tratamiento (early titled) y control (late titled). Como ejemplo, observar que los grupos de tratamiento y control no difieren significativamente en términos de conexion a agua o cloacas ni en el año 90 ni en el 2000. En cambio el grupo tratamiento posee mayor conexión a electricidad en ambos períodos. ¿Es esta evidencia de conexión a electricidad a favor de los efectos del programa de titularización? No necesariamente. El test ubicado en la esquina inferior derecha es el test correspondiente a la dif en dif. La intuición del test es evaluar si los incrementos en la tasa de conexión fueron superiores para el grupo tratamiento que el control. Notar que en el caso de electricidad la diferencia no es significativa. En otras palabras, si bien el grupo tratamiento presenta mayor conexión, no se observa un incremento en dicha tasa que sea superior al incremento del grupo control. Podrán observar también que la población y la proporción de hogares con pisos firmes creció más en el grupo control (late titled).

Por último aquí tambien hay un modulo de Stata para correr el estimador (no lo probé): http://ideas.repec.org/c/boc/bocode/s457083.html

martes, 15 de septiembre de 2009

Horarios Reuniones Individuales 16 de Septiembre

Reuniones Miércoles 16 de Septiembre

Olmos, Carlos 18:30
Fagalde, Mariano 18:50
Arqueros, Soledad 19:10
Zorraquín, Esteban 19:50
Lucchini, Gabriela 20:10
Nebuloni, Nicolás 20:30
Basile, Vicente 20:50
Dengra, Cristina 21:10


Si alguno en la lista tiene algún inconveniente para asistir, por favor le pido que me escriba.

Recuerden que las reuniones son de 20 minutos, un tiempo más corto de lo que me gustaría, asi que nuevamente les sugiero que intenten preparar la reunión anotando sus inquietudes y dudas, de manera que aprovechemos el tiempo.

lunes, 27 de julio de 2009

Preguntas y Respuestas Práctico de STATA II

PREGUNTA: ¿La base cómo te la entregamos? ¿te la mandamos por
mail con copia a Stella? Luego, yo trabajé todo el práctico en SPSS y
excepto las regresiones que las hice en STATA porque es más sencilla
la salida. Las syntaxis las copié todas en un word así que no hay
problemas, y las tablas las pasé a un excel así que tampoco hay
problema. Lo que quería saber es si vos tenés SPSS para que te mande
la base en .sav o si la paso a excel u otra cosa.

RESPUESTA: No es necesario que me mandes la base. Puedes mandarme el word con las sintaxis, y los resultados que pasaste al excel también por favor te pido que las incluyas en el mismo word. Gracias.

PREGUNTA: Me falta la pregunta V referida a las tablas con las características por barrio.La única forma que encontré de hacerlo es casi artesanal: por cada variable hago [by barrio, sort : table jardíndummy, c(freq)] una tabla ordenada por barrio que me da las fecuencias de las variables dummys (1 y 0) después tendría que sumar cada variable a mano y sacar el porcentaje.

RESPUESTA: No es necesario que utilices el comando by para el punto V (para el punto VI si va a ser necesario). Como bien señalas, el comando table te permite separar las observaciones de acuerdo a alguna variable, en este caso barrio, y lo unico que necesitarias es poder calcular el porcentaje. Pero aqui viene lo que no te estás dando cuenta: simplemente tienes que tomar el promedio de la respectiva variables dummy, ya que cada variable toma valores 0 o 1 y al promediarla lo que vas a estar haciendo es precisamente sumar el número de1s y dividir el resultado en la cantidad de observaciones, es decir, vas a estar calculando el porcentaje.


PREGUNTA: Respecto a las regresiones, tomé las variables dummy y con las variables de calidadnotabarrio las puse directamente como están.

RESPUESTA: Hiciste bien.

PREGUNTA: Por último, dado mi nula experiencia en este tipo de trabajos, necesitaría que me precises como se entrega el trabajo. Los resultados finales se pueden grabar en archivo dta, pero las tablas y regresiones?? Te paso las lineas de comando en Word con las conclusiones en los casos en que se piden??


RESPUESTA: Para entregar el trabajo armas un documento word con el siguiente contenido. Para cada punto del práctico vas a incluir: i) el comando que utilizaste, ii) lo que surgió como salida del programa (en el caso de una tabla o regresion), iii) una explicacion o interpretación de los resultados.



PREGUNTA: Consigna VI: Una vez generada la variable clasificatoria, ¿qué hago con las observaciones que en alq tenían missing values? Yo considero que lo más adecuado sería dejarlas missing, ya que si en alq no dicen nada, no puedo clasificar las viviendas como baratas, medianas o caras. Y ya que por defecto me aparecen clasificadas como caras (no sé por qué, pero eso me ocurre después de haber hecho todos los replace), le agregué esto:


replace tipocasa = . if alq == .


RESPUESTA: Me parece bien que arregles ese error usando ese comando (dejando a los missing como missing). Que aparezcan por defecto como caras tiene que ver con la forma en que definiste quienes son caras. No se como lo hiciste, pero esta bien corregir ese tema asi.


PREGUNTA:Consigna VII: Para el modelo de regresión, ¿la variable propietario es la original que refleja condición de propiedad (condprop) o la dummy que yo generé diciendo si el respondente era propietario? Entiendo que es la primera, suena más lógico.


RESPUESTA: Tienes que usar la dummy propietario. Esto va a diferenciar un efecto para los propietarios distinto de todos los demás. Podría tener algun sentido utilizar la otra variable si esperas ver un signo negativo en el resultado del coeficiente (un mayor valor en la variable condprop se relaciona con un menor alquiler, pero esto implicaría suponer una relacion lineal entre el alquiler y pasar de 1 a 2 a 3 etc en las categorias de propietario que no tiene mucho sentido suponer)


PREGUNTA: A veces me ocurre que cuando pongo Save para guardarle los cambios a mi archivo .dta, pierdo variables. Para recuperarlas hago un joinby con la base original calidad.dta. ¿Qué puede estar ocurriendo? ¿Puede que mi versión de Stata esté fallada?

RESPUESTA: No deberías perder variables cuando haces el save. Lo unico que se me ocurre es que el programa no este correctamente registrado y que no estes grabando los cambios realmente. Lo mejor para ese caso es guardar todos los comandos que corriste en un do-file (no es mas que un archivo de texto, ver el icono para crear un do-file en la barra de herramientas), trabajar siempre con la base original, y al principio correr todos los comandos juntos (seleccionas todos y con el boton derecho puedes correrlos, tambien en la barra de herramientas de la ventana del do.file hay una opcion para correrlos todos juntos) que lleva solo un segundo y te asegura de que si cometiste algun error lo curas rapidamente.

jueves, 16 de julio de 2009

Preguntas y Respuestas de Ayuda Práctico de Stata

Pregunta: Debemos generar variables dummies por i) Jardin, ii) cochera, iii) casa, iv) propietario.
El tema es que cuando en cada caso se generan tantas dummies como respuestas posible hay en la columna (en función de la codificación numérica con la que están ingresadas las respuestas)
La consulta es si dejamos esto así, o nos enfocamos en la pirmer dummy que es la que agrupa la mayoría de las respuestas, para cada caso. O, si existe algún comando, que no estoy en el help que contemple esta diversidad de respuestas en una sola columan.
Todavía no avancé con los puntos posteriores y no sé como puede influir esto.
Se entiende?

Respuesta: La dummy en cada caso tiene que estar definida como:

Dummy jardín:
1 si tiene jardín
0 si no tiene jardín


Dummy cochera:
1 si tiene cochera
0 si no tiene cochera

Dummy casa:
1 si el hogar encuestado es casa
0 si el hogar enucestado no es una casa

Dummy propietario:
1 si el jefe de hogar declara ser propietario
0 si no lo es



Pregunta: En la primera consigna del trabajo se pide generar una nueva variable que reuna los valores de "valalq" y "propalq", pero cuando ejecuto el comando
gen alq = valalq + propalq
Me genera una nueva variable con casi todos los valores de tipo "missing values". Sólo tres de sus celdas tienen números, son aquellas en las cuales en valalq y propalq había números. Para las demás, al sumar un campo vacío de valalq + uno lleno de propalq (o al revés) me arroja resultado vacío.
¿Qué hago?

Respuesta: Descubriste que sumar missing values devuelve missing values.
Tienes que definir la variable utilizando el condicional if. Si se cumple la condición de ser propietario entonces le asignas el valor propalq a la variable alq, si se cumple la condición de ser inquilino, entonces le asignas el valor de valalq.
Espero te sirva la ayuda. Avisame cualquier otro problema
saludos
Ricardo




Pregunta: Hola Ricardo, me encuentro haciendo el práctico de stata pero me surgio una duda cuando pides que genere la regresion, utilizó las variables dummys que genere para jardin, cochera o debo de usar las iniciales. Y bueno lo que si no `puedo resolver aun es cuando pides que califiquemos por barato, mediano y caro. Estaba viendo como generar otra variable no sé si este ejemplo sirva generate crisis="antes" if time <=tq(2001q4) no recuerdo que es el tq. Bueno sólo esas son mis dudas. Saludos

Respuesta:
Van algunas ayudas:

* Para la regresión, debes usas las variables dummies que generaste (toma valores 1 o 0). No las variables originales (toma valores 1, 2 o 99).

* Para la clasificación de barato mediano y caro, lo primero que tienes que hacer es generar una variable que contenga el percentil 33 para cada barrio. Para ello tienes que utilizar uno de los comandos para generar variables (de los dos que vimos), y combinarla con otro comando que te permita trabajar con subgrupos de observaciones (en este caso el barrio). Así en cada subgrupo de observaciones calcularás el percentil 33. Esa es la ayuda por ahora...

* El ejemplo que pusiste (utilizando el condicional if) no te va a servir o te va a complicar mucho el cálculo.

* De paso te recuerdo que tq() servía para definir que lo que escribes está en un formato de fecha determinado, para no tener que escribir el número de serie de la fecha.

martes, 16 de diciembre de 2008

Reuniones Individuales 17 de Diciembre

Estimados,

Este próximo miércoles 17 tendré reuniones individuales para discutir el avance de sus proyectos. Me reuniré con aquellos que me escriban para hacerlo, desde las 19hs.

Les recuerdo que los requisitos formales de aprobación del taller son: 1) Haber completado la tarea de revisión de la literatura y avances relacionados en su blog personal, 2) Presentar una propuesta metodológica (o aquello que les haya indicado hacer en las reuniones individuales), 3)Presentar el TP de Stata.

Voy a pasarles por mail una primera lista de quienes están aprobados a fines de la semana que viene. Para los que no completaron los requisitos para entonces, tendrán tiempo de completar los requisitos durante el verano, pues pasaré la lista de notas a principios de Marzo.

Voy a estar disponible durante el verano para seguir el avance de sus proyectos de investigación. Puedo demorar algo en responder mails, pero van a tener respuesta. En caso de que nos encontremos en la Ciudad de Buenos Aires, pueden escribirme para reunirnos en un café. Sino también podemos reunirnos por videoconferencia utilizando skype.

De acuerdo al reglamento de tesis, aquellos que aprueben el taller de tesis quedarán en espera de un tutor de tesis. Les recuerdo que ustedes pueden proponer a uno (incluyendolo en la propuesta o mandandome un mail).

Si alguno tiene alguna duda, no dude en escribirme.

Saludos
Ricardo

lunes, 1 de diciembre de 2008

Proxima reunion del taller de tesis: reuniones individuales

Estimados,
En general están haciendo muy buen trabajo con sus blogs. He visto articulos muy buenos y me ha servido para hacerle comentarios a varios de ustedes. El plan para este próximo Miércoles 3 de Diciembre es tener reuniones individuales para discutir el avance en sus proyectos.
Los horarios asignados son los siguientes:

Horarios para reuniones individuales próximo Miércoles 3 de Diciembre

Número- Apellido y Nombre- Horario Comienzo -Horario Finalización

1 BrizuelaMaría Paula 18:30 18:50
2 Kismer Raquel 18:50 19:10
3 Lescano Patricia Nazarena 19:10 19:30
4 Perez Moreno Micaela 19:50 20:10
5 RubiniAlicia 20:10 20:30
6 FragugliaMaría Cristina 20:30 20:50
7 DelettieresJosé Luis 20:50 21:10
8 WeibelMatias 21:10 21:30


Les pido que me confirmen su asistencia, caso contrario dispondré de ese horario para otra persona. Si alguno tiene un problema de horario por favor me avisa y trato de reubicarlo, sino le escribiré para acordar otro momento durante la semana que viene (seguramente el miercoles).
Sigue abierta la vía por mail y/o blog.
Aquellos que no están en la lista y que no hayan recibido un mail mio por favor me contactan

jueves, 23 de octubre de 2008

Medición de derrames de capital humano

Estoy leyendo el artículo Human Capital Externalities in Cities, de Enrico Moretti, Handbook of Regional and Urban Economics, Volume 4. Extraigo de aquí una discusión sobre la estimación de derrames (spillovers) de productividad que suceden en las ciudades debido al nivel de capital humano agregado de una población. Les dejo una copia en la fotocopiadora si les interesa. La lectura podría ser útil para muchos de los proyectos de investigación. En especial para aquellos interesados en mirar los determinantes de la competitividad urbana, la estructura del empleo industrial, etc. Quizás también sea interesante para pensar en otras cuestiones relacionadas a los determinantes de la migración de población (y el vaciamiento de zonas de la ciudad).

La idea simplificada sería esta: Sí existen derrames de capital humano, entonces ciudades con mayor capital humano agregado deberían tener mayores salarios (reflejando la mayor productividad) y también un mayor valor del suelo.
Este es un resultado que surge de las desiciones (económicas) de trabajadores que deciden la ciudad en donde vivir (en base a las amenidades ofrecidas por la ciudad, el salario, y el costo de la propiedad) y empresas que deciden donde localizarse (tambien en base al salario, el costo de la propiedad y la productividad de los trabajadores en cada lugar). Podemos mirar las intuiciones de este resultado en clase. Pero ahora paso a enfocarme en la cuestión empírica. El resultado teórico es una hipótesis que se intenta testear en los datos disponibles.

Veamos las distintas alternativas metodológicas que propone Moretti para identificar los derrames:

Estrategia 1
Una estrategia sería comparar costos unitarios de empresas en ciudades con alto y bajo nivel de capital humano agregado respectivamente. La comparación debería tener en cuenta empresas cuyos precios que pagan por sus factores sean lo más parecidos posibles, en particular, los salarios y el valor del suelo. Si los precios de los factores fuesen similares entonces una ciudad que presente un mayor derrame de capital humano implicaría una mayor productividad y por lo tanto una disminución del costo unitario.
Este ejercicio puede ser difícil de realizar debido a la escasez de datos de factores de producción a nivel de firmas.
En términos de un modelo econométrico, la comparación (teniendo en cuenta los atributos mencionados) equivaldría a estimar los parámetros de la siguiente ecuación:

Donde cada observación en la base de datos es una empresa, la base incluye las empresas de distintas ciudades, y a cada empresa le asigno el valor del capital humano agregado de la ciudad a la que pertenece.
capitalhumanoagregadoenciudad es la variable cuyo coeficiente indicaría la presencia de derrame. Esta variable podría ser, por ejemplo, el porcentaje de la población con secundario completo, o con universitario completo, etc. Si encontrara un coeficiente significativo (espero un signo negativo) para esta variable, este indicaría el efecto adicional que tiene el capital humano sobre el costo unitario de la empresa (i.e., vía una mayor productividad que reduce el ratio costo total/número de unidades producidas), cuando ya se tuvo en cuenta que costo unitario también varía por el salario y el alquiler que se paga.

Datos necesarios en este caso
Un número importante de datos de empresas o locales productivos, en distintas ciudades. Para cada empresa, datos sobre los precios de sus factores (salarios, alquiler del local)
Datos de capital humano agregado de la población de cada ciudad.

Estrategia 2

Otra estrategia entonces podría ser comparar el nivel de producción de firmas entre ciudades. Para ello deberíamos comparar firmas que utilicen insumos similares. Simplifiquemos el análisis pensando que la producción de una firma depende del número de trabajadores, de su capital instalado, y de su productividad. Si comparamos firmas con número de trabajadores similares y con un capital instalado similar, entonces si se observa una diferencia de productividad entre ciudades, esta podría ser atribuible a la diferencia en el capital humano agregado.

Nuevamente, en términos de un modelo econométrico, la comparación equivaldría a estimar los parámetros de la siguiente ecuación:

Datos necesarios en este caso
A diferencia del caso anterior, para cada empresa, datos sobre la producción, número de trabajadores, alguna medida del stock de capital instalado.

Estrategia 3


Comparar el precio de la tierra. La hipótesis es que las ciudades con mayor capital humano agregado tendrían un mayor precio de la tierra.
Debido a que la información sobre valor de la tierra suele ser más difícil de encontrar que la información sobre valor de viviendas, entonces se podría usar la segunda opción, incorporando las características de las viviendas como controles.

En términos de un modelo econométrico:


Donde cada observación i es el valor de una propiedad.

Datos necesarios en este caso
Características de precios en distintas ciudades: Precios de ventas, m2 construidos, datos sobre las características de las viviendas, podrían incluir: factores del lugar como cercanía a un lago, a un parque, vista desde el departamento, etc. tamaño habitable, estilo del diseño, áreas secundarias (sótanos, altillos, patios), otros como presencia de piletas, aire acondicionado, chimeneas, etc, factores de calidad de construcción, antigüedad.

Estrategia 4

Comparar salarios. La estrategia aquí consiste en comparar salarios de trabajadores con niveles similares de calificación (por ejemplo, grupos de trabajadores con universitario completo, secundario completo, etc.) o un promedio ponderado de salarios usando el número de trabajadores de cada tipo.
Donde cada observación es un trabajador. Las dummys son variables que toman el valor 0 ó 1 si el máximo nivel de educación del trabajador es haber completado el secundario ó el universitario respectivamente. Aquí deberían usarse los niveles nominales de salarios.
Una cuestión interesante de este último caso surge al tener en cuenta que de observar un efecto relacionado al capital humano agregado, este no sería completamente atribuible al derrame de capital humano, sino que también podría deberse a la sustitución imperfecta que existe entre trabajadores más capacitados y menos capacitados. Con esto se refiere a que en una ciudad donde hay una proporción mayor de trabajadores capacitados, el salario de los no-capacitados tiende a ser relativamente mayor, debido a que a la hora de negociar el salario los empleadores no observan perfectamente las capacidades de los individuos, y en promedio los no capacitados recibirán un salario mayor porque la expectativa de que sus habilidades sean más altas es mayor (i.e. en promedio los trabajadores de esa ciudad están más capacitados).