Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

W22 · 식별 — 데이터가 대답할 수 있는 질문의 범위

0. 이번 회차의 식

E[YD=1]E[YD=0]=E[Y1Y0D=1]ATT+E[Y0D=1]E[Y0D=0]selection bias\mathbb{E}[Y\mid D{=}1]-\mathbb{E}[Y\mid D{=}0] =\underbrace{\mathbb{E}[Y_1-Y_0\mid D{=}1]}_{\text{ATT}} +\underbrace{\mathbb{E}[Y_0\mid D{=}1]-\mathbb{E}[Y_0\mid D{=}0]}_{\text{selection bias}}
E[g(w,θ0)]=0,g:W×ΘRq,θ0ΘRp\mathbb{E}\bigl[g(w,\theta_0)\bigr]=0,\qquad g:\mathcal{W}\times\Theta\to\mathbb{R}^{q},\quad \theta_0\in\Theta\subseteq\mathbb{R}^{p}

지금 읽히지 않아도 된다. 7절에서 같은 식을 다시 본다.

1. 도입

추정량은 배웠다. 그런데 이 모수가 애초에 데이터에서 결정되기는 하는가. 표본을 무한히 늘려도 답이 정해지지 않는 질문이 있다. 어느 질문이 그런지 식만 보고 가려낼 수 있는가.

LaLonde (1986)의 표 앞에서 멈춘다. 같은 직업훈련 프로그램의 임금 효과가 한 표에 두 방식으로 적혀 있다. 한 행은 무작위로 배정된 대조집단과 견준 실험 추정치다. 나머지 행들은 인구조사와 패널 자료에서 고른 비교집단과 견준 비실험 추정치다. 실험 행은 양수 몇백 달러다. 비실험 행들은 비교집단을 어떻게 고르느냐에 따라 큰 음수에서 양수까지 흩어진다. 같은 프로그램, 같은 참가자, 같은 임금 자료인데 행마다 답이 다르다. 학부 읽기는 각 열이 어떤 추정량 — 평균 차이, 회귀, 선택 보정 — 으로 계산됐는지는 안다. 행마다 표본 크기가 다르다는 것도 안다. 표준오차를 읽고 유의성을 판정하는 것까지도 한다. 그런데 표본이 아무리 커도 행들이 한 값으로 모이지 않으리라는 것, 행마다 다른 것을 재고 있다는 것은 말하지 못한다. 유의성은 행 안의 물음이고, 행 사이의 물음은 다른 종류다.

그 답이 (1)의 둘째 항이다. 비교집단을 바꾸는 것은 E[YD=0]\mathbb{E}[Y\mid D{=}0]을 바꾸는 일이고, 그때 우변의 첫째 항은 한 자리도 움직이지 않는다. 움직이는 것은 둘째 항, 곧 처치가 없었더라도 두 집단이 달랐을 만큼이다. 비실험 행들이 흩어진 폭은 추정 오차의 폭이 아니라 둘째 항의 폭이다. 두 폭은 성질이 다르다. 앞의 것은 표본이 커지면 줄고, 뒤의 것은 표본이 커져도 그대로다.

같은 결핍이 다른 자리에서 나타난다. Hansen & Singleton (1982)의 결과 표에는 추정치 옆에 χ2\chi^{2} 통계량과 그 확률값 — 과대식별 제약의 검정 — 이 적혀 있다. 무엇이 과대인가. 모멘트 조건이 모수보다 몇 개 많은지, 남는 개수가 어디에 쓰이는지를 세어 본 적이 없으면 그 숫자는 읽히지 않는다. (2)qqpp가 그 개수다.

추정 이전에 "이 양이 관측 분포의 함수인가"를 묻는 단계가 빠져 있다. 그 단계의 이름이 식별(identification)이다. 그 단계가 없으면 표본이 아무리 커도 좁혀지지 않는 오차와 표본이 커지면 사라지는 오차를 구별하지 못한다. 그 구별은 표본이 아니라 식에서 읽힌다 — 어느 오차가 어느 것인지 식만 보고 가려내는 일이다.

2. 기호 대장

기호종류형상차원·단위한국어 이름
Y0, Y1Y_0,\ Y_1확률변수ΩR\Omega\to\R; A2’에서 [yL,yU][y_L,y_U][화폐] (예제에서 만원/월)잠재결과(potential outcome) — 처치 없을 때·있을 때의 결과
DD확률변수(지표)Ω{0,1}\Omega\to\{0,1\}무차원처치 지표 — W21의 Domar 가중치 DiD_i도 W03의 수정 듀레이션 DD도 아니다
YY확률변수Y=DY1+(1D)Y0Y=DY_1+(1-D)Y_0[화폐]관측 결과
π\pi파라미터(0,1)(0,1)무차원처치 확률 Pr(D=1)\Pr(D{=}1)
Δ\Delta스칼라(관측 분포의 범함수)R\R[화폐]관측 차이
τATT, τATE, τATU\tau_{\mathrm{ATT}},\ \tau_{\mathrm{ATE}},\ \tau_{\mathrm{ATU}}스칼라(잠재 분포의 범함수)R\R[화폐]처치집단 평균처치효과(average treatment effect on the treated, ATT), 평균처치효과(ATE), 비처치집단 평균처치효과(ATU)
δ0, δ1\delta_0,\ \delta_1스칼라(잠재 분포의 범함수)δd=E[YdD=1]E[YdD=0]\delta_d=\E[Y_d\mid D{=}1]-\E[Y_d\mid D{=}0][화폐]선택편의(selection bias), 효과 이질성의 재료
β0, β1\beta_0,\ \beta_1스칼라R\R[화폐]더미 회귀의 모집단 계수
P, P, Pobs, ϕ\mathcal{P},\ P,\ P_{\mathrm{obs}},\ \phi집합, 확률측도, 확률측도, 함수PPP\in\mathcal{P}(Y0,Y1,D)(Y_0,Y_1,D)의 분포; ϕ(P)=P(Y,D)\phi(P)=P_{(Y,D)}; Pobsϕ(P)P_{\mathrm{obs}}\in\phi(\mathcal{P})허용 분포족, 잠재 분포, 관측 분포, 관측 사상
ΘI\Theta_I집합Rp\subseteq\R^{p}[θ][\theta]식별집합(identified set)
w, θ, θ0, Θw,\ \theta,\ \theta_0,\ \Theta확률변수(벡터), 벡터, 벡터, 집합wWRdw\in\mathcal{W}\subseteq\R^{d}, θΘRp\theta\in\Theta\subseteq\R^{p}성분마다 다름관측 벡터, 모수, 참값, 모수 공간
g, gˉ, gˉn, Gg,\ \bar g,\ \bar g_n,\ G함수, 함수, 함수, 행렬W×ΘRq\mathcal{W}\times\Theta\to\R^{q}; ΘRq\Theta\to\R^{q}; ΘRq\Theta\to\R^{q}; q×pq\times p성분마다 다름; [Gjk]=[gj]/[θk][G_{jk}]=[g_j]/[\theta_k]모멘트 함수, 모집단 모멘트, 표본 모멘트, 모멘트의 야코비안
q, pq,\ p지표(정수)무차원모멘트 조건 수, 모수 수
W, MGW,\ M_G행렬q×qq\times q[Wjk]=1/([gj][gk])[W_{jk}]=1/([g_j][g_k]); [(MG)jn]=[gj]/[gn][(M_G)_{jn}]=[g_j]/[g_n]가중행렬(weighting matrix), 소멸행렬(W07의 MM과 같은 대수)
A, μ, η, cA,\ \mu,\ \eta,\ c행렬, 벡터, 벡터, 벡터2×32\times3, R3\R^{3}, R2\R^{2}, R3\R^{3}—, [화폐], [화폐], 무차원선형 관측 사상, 잠재 칸 평균 μdd=E[YdD=d]\mu_{dd'}=\E[Y_d\mid D{=}d'], 관측 칸 평균, 관심 범함수의 계수

같은 E\E, 다른 정보. (1) 좌변의 E[YD=1]\E[Y\mid D{=}1]은 관측 분포 PobsP_{\mathrm{obs}}만으로 계산되는 숫자다. 우변의 E[Y0D=1]\E[Y_0\mid D{=}1]은 같은 기호로 적히지만 잠재 분포 PP가 있어야 정의된다. 처치받은 사람의 “받지 않았더라면” — 반사실(counterfactual) — 은 어떤 표본에도 없다. 기호는 이 차이를 숨기고, 표의 “종류” 칸 — 관측 분포의 범함수인가 잠재 분포의 범함수인가 — 이 그것을 드러낸다. 범함수(functional)는 분포를 넣으면 숫자를 돌려주는 함수다. Δ\DeltaPobsP_{\mathrm{obs}}를 넣으면 숫자가 나오고, τATT\tau_{\mathrm{ATT}}PP를 넣어야 숫자가 나온다. 하나 더 갈라 둔다. E[YD=1]\E[Y\mid D{=}1]은 숫자이고 A4에 나오는 E[Y0D]\E[Y_0\mid D]는 확률변수다 — DD의 값에 따라 두 값을 취하는 σ(D)\sigma(D)-가측 함수이며, W14 2절이 학부의 숫자와 대학원의 함수를 갈라 둔 구분 그대로다.

변수와 파라미터, 첨자. τATT\tau_{\mathrm{ATT}}·δ0\delta_0·θ0\theta_0은 모집단의 고정된 숫자이고 추정치가 아니다. 모자가 없다. 이 회차는 (15) 전까지 표본을 다루지 않는다 — 식별은 모집단의 성질이고, 그 앞에서 표본 크기 nn은 "그것과 무관하다"는 자리에만 나온다. YdY_d의 아래첨자 d{0,1}d\in\{0,1\}은 시간이 아니라 처치 상태다. W09 이후의 tt가 시점을 가리키던 자리에 여기서는 "어느 세계인가"가 온다. μdd\mu_{dd'}의 첫 첨자는 잠재결과의 종류, 둘째 첨자는 실제 처치 집단이다 — μ01\mu_{01}은 처치받은 집단이 처치 없는 세계에서 받았을 임금이고, 표본에 없는 칸이다. qqpp는 개수이지 확률이 아니다. ss는 예제의 선택 강도 Pr(D=1H)\Pr(D{=}1\mid H)이며 W10·W11의 저축률 ss가 아니다. ν\nu(9)에서 반사실의 후보 분포이며 W02의 동차 차수·W19의 상사 지수와 다른 뜻이다.

같은 글자, 다른 이름. β1\beta_1은 회귀계수(W07)이고 4절 (17)β\beta는 할인인자(W13)다. 한 회차에 둘 다 나오므로 첨자 유무로 구별한다. γ\gamma(17)에서 상대적 위험회피도(W13)이며 W17 이후의 꼬리지수가 아니다. δ0\delta_0·δ1\delta_1은 선택편의이며 W10·W11의 감가상각률, W19·W20의 퇴출률과 다른 뜻이다. Δ\Delta는 관측 차이이며 W09·W13의 기간 길이, W03의 변화분 접두어와 다른 뜻이다. π\pi는 처치 확률이며 원주율도, W06의 이윤 π(K;r)\pi(K;r)도, W21의 비중 벡터도 아니다. PP는 확률측도(W14·W15)이지 W07의 사영행렬이 아니다. 사영은 W14를 따라 Π\Pi로 쓴다 — Πσ(D)\Pi_{\sigma(D)}L2(σ(D))L^2(\sigma(D)) 위 직교사영, ΠA\Pi_{A'}C(A)\mathcal{C}(A') 위 직교사영이다. 직전 회차와의 충돌을 한 줄씩 적는다. WW(가중행렬)는 W21의 투입산출 몫 행렬 WW·W14의 시험 방향 WL2(F)W\in L^2(\Fc)와 다른 글자다. ww(관측 벡터)는 W21의 wijw_{ij}·W04의 소득과 다른 글자다. MGM_G는 W07의 소멸행렬 MM과 같은 대수를 가진다. gg는 모멘트 함수이며 W13이 소비성장 배수에 쓴 gg와 다른 글자다. η\eta는 관측 칸 평균이며 W20의 진입률 η\eta와 다른 글자다. AA2×32\times3 관측 사상이며 W02·W10의 생산성 수준 AA·W20의 단위당 연결률 AA와 다른 글자다. 표본 크기 nn은 W07과 같은 글자이고 W18·W21의 몬테카를로 NN과 같은 역할이다. 회차 안에서도 겹치는 글자가 있다. μdd\mu_{dd'}(칸 평균)와 4절의 μc,μR\mu_c,\mu_R(로그정규 평균), σ(D)\sigma(D)(σ\sigma-대수)와 σc,σR,σcR\sigma_c,\sigma_R,\sigma_{cR}(표준편차·공분산)는 첨자와 괄호로 구별한다.

3. 유도

관측 가능한 차이를 처치효과와 선택편의로 분해한다. 모멘트 조건의 개수와 모수의 개수로 식별·과대식별을 판정한다. W14의 사영이 여기서 세 번째로 쓰인다. W07에서는 행렬 PP였고 W14에서는 연산자 ΠF\Pi_{\Fc}였던 것이 여기서는 세 얼굴로 나온다 — 더미 회귀의 계수, 식별 가정의 문장, "질문의 계수 벡터가 관측 사상의 행공간 위에 있는가"라는 판정.

가정을 번호 붙여 둔다.

A1–A3은 대상이 무엇인지 정한다 — 무엇이 존재하고 무엇이 보이는가. A4만이 잠재결과와 처치 사이의 관계를 말하고, 그 관계는 A1이 보여 주지 않는 칸에 관한 것이다. 실험은 A4’를 설계로 참이 되게 하는 장치이고, 관측 자료에서는 A4를 자료 밖에서 들여와야 한다. A5·A6은 둘째 식 (2)의 것이며, 거기서도 같은 질문 — 자료가 주는 식이 몇 개이고 미지수가 몇 개인가 — 이 반복된다.

번역. 처치집단과 대조집단의 평균 차이는, 처치가 처치집단에 준 효과와 처치가 없었더라도 두 집단이 달랐을 만큼의 합이다. 데이터는 그 합만 보여 주고, 두 조각을 나누는 것은 자료 밖에서 들여온 가정이다. 모멘트 조건은 모수보다 적으면 답을 정하지 못하고, 같으면 답만 정하며, 많으면 답과 함께 모형을 시험할 잣대를 남긴다.

수치 확인 1 — 두 유형 직업훈련 모형. 유형 HH·LL이 각 절반이고, 잠재 임금(만원/월)은 y0H=300y_0^{H}=300, y1H=330y_1^{H}=330, y0L=200y_0^{L}=200, y1L=250y_1^{L}=250이다. 처치효과는 유형별로 τH=30\tau^{H}=30, τL=50\tau^{L}=50 — 불리한 유형에게 더 크다. 선택 강도 s=Pr(D=1H)=1Pr(D=1L)=0.8s=\Pr(D{=}1\mid H)=1-\Pr(D{=}1\mid L)=0.8이면 π=12\pi=\tfrac12, Pr(HD=1)=0.8\Pr(H\mid D{=}1)=0.8, Pr(HD=0)=0.2\Pr(H\mid D{=}0)=0.2다. 관측: E[YD=1]=0.8330+0.2250=314\E[Y\mid D{=}1]=0.8\cdot330+0.2\cdot250=314, E[YD=0]=0.2300+0.8200=220\E[Y\mid D{=}0]=0.2\cdot300+0.8\cdot200=220, Δ=94\Delta=94; Cov(Y,D)=23.5\Cov(Y,D)=23.5, Var(D)=0.25\Var(D)=0.25, β1=94\beta_1=94, β0=220\beta_0=220. 잠재: E[Y0D=1]=280\E[Y_0\mid D{=}1]=280, E[Y1D=0]=266\E[Y_1\mid D{=}0]=266, τATT=34\tau_{\mathrm{ATT}}=34, δ0=60\delta_0=60, τATE=40\tau_{\mathrm{ATE}}=40, τATU=46\tau_{\mathrm{ATU}}=46, δ1=48\delta_1=48. 검산 34+60=9434+60=94, 3440=0.5×(4860)=634-40=0.5\times(48-60)=-6. 관측 차이 94는 처치집단 효과 34의 2.8배다.

세계E[Y0D=1]\E[Y_0\mid D{=}1]δ0\delta_0τATT\tau_{\mathrm{ATT}}Δ\Delta관측 분포
T (진짜, s=0.8s=0.8)280603494같음
A (선택 없음, ν=PYD=0\nu=P_{Y\mid D=0})22009494같음
B (효과 없음, ν=PYD=1\nu=P_{Y\mid D=1})31494094같음
식별집합, [yL,yU]=[150,400][y_L,y_U]=[150,400][150,400][150,400][70,180][-70,180][86,164][-86,164]{94}\{94\}같음

세 세계의 (Y,D)(Y,D) 분포는 글자 하나까지 같다 — D=1D=1이면 330(확률 0.8)·250(0.2), D=0D=0이면 300(0.2)·200(0.8). 표본이 아무리 커도 세 세계를 가를 통계량은 없다. 식별집합의 폭 250은 nn이 얼마든 그대로다. 단조 선택 δ00\delta_0\ge0 — 처치받은 쪽이 처치 없이도 더 나았다 — 을 더하면 [86,94][-86,94]가 되고, A4를 더하면 {94}\{94\}가 된다. 그런데 진짜 값은 34다. 가정이 틀리면 점식별된 답은 확실하게 틀린다.

같은 표를 (11)의 글자로 읽는다. 진짜 세계의 칸 평균은 μ=(314,280,220)\mu^{*}=(314,280,220)'이고 관측 칸은 η=(314,220)\eta=(314,220)'이다. Aμ=ηA\mu=\eta의 해집합은 (314,μ01,220)(314,\mu_{01},220)', μ01\mu_{01}은 자유 — 세 세계 A·T·B는 이 직선 위의 세 점 μ01=220,280,314\mu_{01}=220,280,314이고 A2’는 직선을 μ01[150,400]\mu_{01}\in[150,400]로 자른다. cΔμ=314220=94c_{\Delta}'\mu=314-220=94는 직선 위 어디서나 같고, cATTμ=314μ01c_{\mathrm{ATT}}'\mu=314-\mu_{01}은 점마다 다르다. (12)ΠAcATT=(1,0,0)\Pi_{A'}c_{\mathrm{ATT}}=(1,0,0)'은 "처치집단의 관측 평균 314"라는 데이터가 답하는 부분이고, (IΠA)cATT=(0,1,0)(I-\Pi_{A'})c_{\mathrm{ATT}}=(0,-1,0)'은 "그 집단의 반사실 평균"이라는 데이터가 못 보는 부분이다. 질문 하나가 두 조각으로 갈리고, 자료는 앞 조각만 돌려준다. Figure 1이 세 세계를 한 축에 놓는다.

세 세계 A·T·B에서 관측 평균 두 점과 관측되지 않는 반사실 평균, 선택편의와 ATT 선분

Figure 1:관측되는 것은 두 점 314·220뿐이다. 그 차 94를 처치효과(파랑)와 선택편의(빨강)로 나누는 방식은 세 세계에서 다르고, 데이터는 셋을 구별하지 못한다.

수치 확인 2 — 모멘트 둘, 모수 하나. p=1p=1, q=2q=2, W=IW=I, a:=E[zx]=(2,1)a:=\E[zx]=(2,1)'로 둔다. (가) b:=E[zy]=(3,1.5)b:=\E[zy]=(3,1.5)': 두 비 3/2=1.5/13/2=1.5/1이 같고, θ0=1.5\theta_0=1.5, 잔차 0 — 과대식별 제약이 충족된다. (나) b=(3,1.8)b=(3,1.8)': 비 1.51.81.5\ne1.8, 어떤 θ\theta도 두 식을 동시에 풀지 못한다. 최소점 θ^=ab/aa=7.8/5=1.56\hat\theta=a'b/a'a=7.8/5=1.56, 잔차 baθ^=(0.12,0.24)b-a\hat\theta=(-0.12,\,0.24)', aa와의 내적 0, 제곱길이 0.072. MG=Iaa/5=(0.20.40.40.8)M_G=I-aa'/5=\begin{pmatrix}0.2&-0.4\\-0.4&0.8\end{pmatrix}, tr=1=qp\operatorname{tr}=1=q-p, MG2=MGM_G^{2}=M_G. (다) z2z_2를 버려 q=1q=1로 하면 θ=b1/a1\theta=b_1/a_1, 잔차는 항등적으로 0 — (나)의 불일치가 보이지 않게 된다. Figure 2가 이 셈을 평면에 놓는다 — 모형이 허용하는 모멘트 벡터는 원점을 지나는 직선 {aθ}\{a\theta\}뿐이다.

원점을 지나는 직선 위의 점과 직선 밖의 점, 그 사영과 잔차 선분

Figure 2:직선 위의 점만 어떤 θ\theta의 모형 모멘트다. 직선 밖의 점은 사영되고, 남는 잔차 MGbM_Gb가 과대식별 검정의 재료다. 모멘트가 하나뿐이면 직선이 평면 전체가 되어 잔차가 생길 수 없다.

4. 읽기

Q1 · 기호

2절 표가 답이다. 두 줄만 덧붙인다. (1)의 다섯 기댓값 가운데 잠재 분포가 있어야 값이 정해지는 것은 E[Y0D=1]\E[Y_0\mid D{=}1] 하나다 — E[Y1D=1]\E[Y_1\mid D{=}1]E[Y0D=0]\E[Y_0\mid D{=}0](3)으로 좌변의 관측 평균과 같은 숫자다. (2)θ0\theta_0은 "gˉ\bar g의 영점"이고, qq·ppgg의 형상이다. 등호도 종류가 다르다. (1)의 등호는 항등식 — 어떤 잠재 분포에서도 성립한다 — 이고, (2)의 등호는 모형의 주장 — 참 모수에서만 성립한다 — 이다.

Q2 · 번역

(1): “처치받은 집단과 받지 않은 집단의 평균 차이는, 처치가 받은 집단에 준 효과에, 처치가 없었더라도 두 집단이 달랐을 만큼을 더한 것이다.” (2): “모형이 맞다면 어떤 관측 가능한 양들의 평균이 참 모수에서 정확히 0이 된다 — 모수란 그 평균들을 0으로 만드는 값이다.”

두 문장은 한 문장으로 이어진다. 첫째 식은 등식이 하나뿐인데 미지수가 둘이라는 문장이고, 둘째 식은 등식이 qq개인데 미지수가 pp개라는 문장이다. 부족한 등식을 채우는 것은 첫째에서 A4, 둘째에서 도구이며, 채운 등식이 검정되는 것은 채우고도 남을 때뿐이다.

Q3 · 차원

(1): 다섯 항 모두 [화폐]이고, DD·π\pi는 무차원이다. 단위를 YdκYd+κ0Y_d\to\kappa Y_d+\kappa_0으로 바꾸면 — κ\kappa는 배율, κ0\kappa_0은 이동이며 이 문장 안에서만 쓰는 글자다 — 모든 항이 κ\kappa배가 되고 κ0\kappa_0은 차에서 소거된다. 분해는 아핀 변환에 공변한다. 식별집합의 폭 yUyLy_U-y_Lκ\kappa배다. 무차원군은 δ0/Δ\delta_0/\Delta — 관측 차이 가운데 선택이 차지하는 비율 — 이며 예제에서 60/94=0.6460/94=0.64, 나머지 τATT/Δ=0.36\tau_{\mathrm{ATT}}/\Delta=0.36이다.

(2): [gj]=[zj][y][g_j]=[z_j][y]처럼 성분마다 단위가 다르다. 목적함수 gˉWgˉ\bar g'W\bar g가 무차원이려면 [Wjk]=1/([gj][gk])[W_{jk}]=1/([g_j][g_k])이어야 하고, 차원이 강제하는 것은 여기까지다 — S1S^{-1}(S=Var(g)S=\Var(g))도 diag(1/Vargj)\operatorname{diag}(1/\Var g_j)도 이 조건을 만족하고, 그 가운데 S1S^{-1}을 고르는 이유는 효율성이다. 식별은 WW와 무관하다 — gˉ(θ0)=0\bar g(\theta_0)=0이면 어떤 WW에서도 θ0\theta_0이 최소점이므로, 가중은 추정의 문제이고 식별은 모집단의 문제다. JnJ_n은 무차원이고 극한분포 χqp2\chi^{2}_{q-p}의 평균이 정수 qpq-p다 — W02의 차원 읽기로 정수는 단위가 없고, MGM_G의 대각 성분만 무차원인 것(2절 표)과 정합한다.

Q8 · 파라미터 극단

두 유형 모형을 선택 강도 ss로 파라미터화한다.

π=12,δ0=(2s1)(y0Hy0L),τATT=sτH+(1s)τL,Δ=τATT+δ0\pi=\tfrac12,\qquad \delta_0=(2s-1)\,(y_0^{H}-y_0^{L}),\qquad \tau_{\mathrm{ATT}}=s\,\tau^{H}+(1-s)\,\tau^{L},\qquad \Delta=\tau_{\mathrm{ATT}}+\delta_0

근거Pr(D=1H)=s\Pr(D{=}1\mid H)=s, Pr(D=1L)=1s\Pr(D{=}1\mid L)=1-s, 유형 각 12\tfrac12이므로 베이즈로 Pr(HD=1)=s\Pr(H\mid D{=}1)=s, Pr(HD=0)=1s\Pr(H\mid D{=}0)=1-s. (4)·(5)에 대입한다. τH=30\tau^{H}=30, τL=50\tau^{L}=50. 수치: Δ=180s50\Delta=180s-50, τATT=5020s\tau_{\mathrm{ATT}}=50-20s, δ0=200s100\delta_0=200s-100. Figure 3이 세 직선과 식별집합의 띠를 그린다.

이 가정은 모형의 것인가 데이터의 것인가. ss는 데이터에 없다 — 유형 HH·LL은 관측되지 않는다. s=12s=\tfrac12이라는 주장은 설계(무작위 배정)이거나 가정이며, 어느 쪽이든 (Y,D)(Y,D)가 확인해 주지 않는다. 반면 π\piΔ\Delta는 데이터의 것이다. yLy_L·yUy_U는 중간이다 — 임금이 음수일 수 없다는 것은 자료 밖의 지식이지만, 관측된 YY의 최솟값과 최댓값이 그 안에 있어야 한다는 것은 자료가 확인한다. 자료 밖에서 온 것만이 식별집합을 좁힌다.

선택 강도 s에 따른 관측 차이·ATT·선택편의 직선과 식별집합의 회색 띠

Figure 3:선택이 강할수록 관측 차이는 처치효과에서 멀어진다. 회색 띠는 자료만으로 허용되는 처치효과의 범위이며, 어느 ss에서도 폭 250이다. s<0.5s<0.5면 관측 차이가 처치효과보다 작아지고, s<5/180.28s<5/18\approx0.28이면 효과는 양수인데 관측 차이는 음수가 된다.

Q11 · 한계 원리

어느 양과 어느 양이 균등해지는가. (1)에서 A4 아래 균등해지는 것은 관측되지 않는 처치집단의 반사실 평균과 관측되는 대조집단의 평균이다 — E[Y0D=1]=E[YD=0]\E[Y_0\mid D{=}1]=\E[Y\mid D{=}0]. 상충은 가정의 세기와 식별집합의 폭 사이에 있다. 아무 가정 없이 [86,164][-86,164], 단조 선택으로 [86,94][-86,94], 평균독립으로 {94}\{94\}다. (2)·(15)에서 균등해지는 것은 1계 조건 GWgˉn(θ^)=0G'W\bar g_n(\hat\theta)=0qq개 표본 모멘트의 pp개 가중 결합이 정확히 0이 되고, q>pq>p면 전부를 0으로 만들 수 없어 나머지 qpq-p개 방향에 잔차가 남는다.

W13 고리로 마무리한다. 오일러 방정식은 모멘트 조건이다.

E[β(ct+1ct)γRf]=1    lnβ=lnRf+γμc12γ2σc2,E[β(ct+1ct)γRt+1]=1    lnβ=μR+γμc12(γ2σc2+σR22γσcR),γ=μR+12σR2lnRfσcR\begin{aligned} \E\Bigl[\beta\,\bigl(\tfrac{c_{t+1}}{c_t}\bigr)^{-\gamma}R_f\Bigr]=1&\;\Longleftrightarrow\;\ln\beta=-\ln R_f+\gamma\mu_c-\tfrac12\gamma^{2}\sigma_c^{2},\\ \E\Bigl[\beta\,\bigl(\tfrac{c_{t+1}}{c_t}\bigr)^{-\gamma}R_{t+1}\Bigr]=1&\;\Longleftrightarrow\;\ln\beta=-\mu_R+\gamma\mu_c-\tfrac12\bigl(\gamma^{2}\sigma_c^{2}+\sigma_R^{2}-2\gamma\sigma_{cR}\bigr), \qquad \gamma=\frac{\mu_R+\tfrac12\sigma_R^{2}-\ln R_f}{\sigma_{cR}} \end{aligned}

근거 — W13 (2)에 CRRA mt+1=β(ct+1/ct)γm_{t+1}=\beta\,(c_{t+1}/c_t)^{-\gamma}를 넣은 것이다. W13은 소비성장 배수를 gg로 썼지만 이 회차에서 gg는 모멘트 함수이므로 비를 그대로 적는다. (ln(ct+1/ct),lnRt+1)(\ln(c_{t+1}/c_t),\ln R_{t+1})은 결합정규, ln(ct+1/ct)N(μc,σc2)\ln(c_{t+1}/c_t)\sim N(\mu_c,\sigma_c^{2}), lnRt+1N(μR,σR2)\ln R_{t+1}\sim N(\mu_R,\sigma_R^{2}), Cov(ln(ct+1/ct),lnRt+1)=σcR\Cov(\ln(c_{t+1}/c_t),\ln R_{t+1})=\sigma_{cR}. 로그정규 모멘트 E[eaZ]=eaμ+a2σ2/2\E[e^{aZ}]=e^{a\mu+a^{2}\sigma^{2}/2} — W13 (18)과 같은 계산이며, 거기의 RfR^f가 이 책의 표준 표기로 RfR_f다. 여기서 β\beta는 할인인자, γ\gamma는 상대적 위험회피도(W13)다 — 3절의 β1\beta_1·3부의 꼬리지수와 다른 뜻이다. 두 식을 빼면 γ\gamma의 1차식이 되므로 σcR0\sigma_{cR}\ne0이면 유일해이고, 그 뒤 β\beta가 정해진다. 수치: β=0.98\beta=0.98, γ=2\gamma=2, μc=σc=0.02\mu_c=\sigma_c=0.02, σR=0.16\sigma_R=0.16, 상관 0.5이면 σcR=0.0016\sigma_{cR}=0.0016, lnRf=0.0594\ln R_f=0.0594(W13의 값), μR=0.0498\mu_R=0.0498, 로그 프리미엄 μR+12σR2lnRf=0.0032=γσcR\mu_R+\tfrac12\sigma_R^{2}-\ln R_f=0.0032=\gamma\sigma_{cR}, γ=2\gamma=2.

읽기. 모멘트 하나(q=1q=1, 무위험 자산만)면 (γ,lnβ)(\gamma,\ln\beta) 평면의 포물선 하나가 식별집합이다 — W13 (18)(β,γ)(\beta,\gamma)에서 RfR_f를 주던 식이 거꾸로 읽히면 RfR_f에서 곡선을 준다. 둘(q=p=2q=p=2)이면 점이다. 그러나 σcR=0\sigma_{cR}=0이면 두 포물선이 평행해 그 차가 상수 lnRfμR12σR2\ln R_f-\mu_R-\tfrac12\sigma_R^{2}가 된다. 그 상수가 0이 아니면(예시값 -0.0032) 두 식을 함께 푸는 θ\theta가 없다 — A5의 θ0\theta_0이 없고 모형이 기각된다. 0이면 두 곡선이 겹쳐 둘째 모멘트가 γ\gamma에 대해 아무것도 더하지 않는다. 어느 쪽이든 개수 조건은 맞고 계수 조건이 깨진다 — Lemma 2GG의 둘째 열이 첫째 열의 상수배다. 위험 프리미엄을 소비와의 공분산으로 나눈 것이 γ\gamma를 식별한다. W13 4절 Q8에서 큰 γ\gamma가 필요했던 계산이 여기서는 "식별된 γ\gamma가 크다"로 읽힌다 — 다만 그 회차의 샤프비율 0.4와 이 회차의 로그 프리미엄 0.32%는 다른 설정이다. Figure 4가 두 곡선과 평행한 경우를 나란히 놓는다.

왼쪽은 (감마, 베타) 평면의 무위험·주식 오일러 곡선과 교점, 오른쪽은 두 곡선의 차

Figure 4:모멘트 하나는 (γ,β)(\gamma,\beta)의 곡선 하나만 남긴다. 둘째 모멘트가 곡선을 점으로 자르는 것은 수익률이 소비와 공변할 때뿐이다 — 개수 조건은 같은데 계수 조건이 갈린다.

5. 학부와 대학원의 간극

멈추는 줄은 LaLonde (1986)의 표 — 실험 대조집단 행과 여러 비교집단 행들 — 이다. 학부 읽기는 각 행의 추정량이 β1\beta_1에 일치추정량이라는 것까지 안다. 그런데 행마다 다른 β1\beta_1을 향해 일치하고 있고, 그중 어느 것이 τATT\tau_{\mathrm{ATT}}인지는 표본이 알려 주지 않는다. 학부 읽기는 "추정량이 일치한다"에서 멈추고 "무엇에 일치하는가"를 묻지 않는다. 표의 각 행을 (1)로 읽으면 비교집단을 바꾸는 것은 E[YD=0]\E[Y\mid D{=}0]을 바꾸는 일이고, 첫째 항은 고정된 채 둘째 항만 행마다 달라진다 — 실험 행은 둘째 항이 설계로 0인 행이다. 같은 자리에서 Hansen & Singleton (1982)χ2\chi^{2} 통계량 — 과대식별 제약의 검정 — 도 읽히지 않는다. 몇 개가 남는지 세어 본 적이 없기 때문이다. Heckman (1979)이 선택을 명시적 모형으로 다루는 길을 연 것은 이 둘째 항을 0으로 가정하는 대신 그 항 자체를 모형화하는 길이고, 그 모형 역시 자료 밖에서 들여온 가정 위에 선다.

대학원 읽기는 추정 이전에 두 번 센다. 관측 분포가 주는 식이 몇 개, 질문이 걸린 미지수가 몇 개. (11)에서 2<32<3이면 가정 하나가 필요하고, 그 가정이 채우는 식은 검정되지 않는다는 것까지 (12)ΠAcc\Pi_{A'}c\ne c 한 줄로 본다. 식별집합 [86,164][-86,164]가 정직한 답이고, {94}\{94\}는 가정 A4의 값이며, 둘 중 어느 쪽도 진짜 34를 집어 주지 않는다는 것을 3절의 표에서 읽는다 — 구간은 34를 담지만 가리키지 못하고, 점으로 좁힌 94는 34가 아니다 — Manski (2003)이 신뢰성 감소의 법칙(law of decreasing credibility)이라 부른 상충이다. 강한 가정일수록 결론은 좁고 믿기 어렵다. 어느 가정을 들여올지는 통계가 아니라 경제학이 정하며, 그 가정의 값이 어디까지 검정되는지는 개수가 정한다.

구조 모형과 축약형의 다툼이 여기서 보인다. 양쪽은 ϕ(P)\phi(\mathcal{P}) — 데이터가 보이는 것 — 에 대해서는 다투지 않는다. 다투는 것은 P\mathcal{P}다. 구조 모형은 허용 분포를 좁혀 ΘI\Theta_I를 점으로 만들고 qpq-p개의 검정 가능한 제약을 얻지만, 그 좁힘이 틀리면 점이 틀린다. 축약형은 사영 계수 β1\beta_1처럼 언제나 식별되는 양에 머물지만, 그 양이 정책 아래 불변이라는 보장이 없다. Lucas (1976)의 비판은 4절 (16)이 보인 것 — 사영 계수 β1=180s50\beta_1=180s-50은 누가 처치받는가(ss)가 바뀌면 바뀌지만 τH\tau^{H}·τL\tau^{L}·ydHy_d^{H}·ydLy_d^{L}은 바뀌지 않는다 — 을 정책 개입 일반에 대해 말한 것이고, Sims (1980)의 "믿기 어려운 식별 제약"은 계수 조건을 채우기 위해 들여온 0들이 어디서 왔느냐는 물음이며, Koopmans (1949)의 계수 조건이 그 둘 사이의 원점이다. 이 회차가 갈라놓는 것은 "추정이 잘 됐는가"와 "질문이 자료에 있는가"이고, 후자는 자료를 더 모아도 바뀌지 않는다.

6. 훈련

Solution to Exercise 1 #

채점 기준 — 각 줄 옆의 근거를 본다.

  1. 관측식 Y=DY1+(1D)Y0Y=DY_1+(1-D)Y_0 옆에 "A1 일관성 — {D=1}\{D{=}1\} 위에서 Y=Y1Y=Y_1"과 "A3 0<π<10<\pi<1"이 적혀 있는가.

  2. 더하고 빼는 줄 (5) 옆에 "E[Y0D=1]\E[Y_0\mid D{=}1] — 관측되지 않지만 존재(A2·A3)"가 적혀 있고, 어느 항이 ATT이고 어느 항이 선택편의인지 이름이 붙어 있는가.

  3. β1=Δ\beta_1=\Delta 줄 옆에 "정규방정식(W07 (8)) · D2=DD^{2}=D · Var(D)=π(1π)>0\Var(D)=\pi(1-\pi)>0"과 "이항 DD이므로 선형사영 == 조건부 기댓값(W14 (10))"이 적혀 있는가.

  4. 비식별 줄에 같은 관측 분포를 주는 두 잠재 분포(선택 없음·효과 없음)가 명시적으로 구성돼 있고, 식별집합의 폭이 표본 크기와 무관하다는 한 마디가 있는가.

  5. 식별 가정 줄 옆에 "Πσ(D)Y0=E[Y0]\Pi_{\sigma(D)}Y_0=\E[Y_0]"와 "검정 불가 — 관측 사상의 값이 같음"이 적혀 있는가. 무작위 배정(A4’)과 평균독립(A4)이 구별돼 있는가.

  6. 개수 세기 줄에 Aμ=ηA\mu=\etaq=2q=2, p=3p=3, kerA\ker A의 방향, "cATTc_{\mathrm{ATT}}는 행공간 밖"이 적혀 있고, A4가 행 하나를 더해 q=pq=p가 되는 것이 적혀 있는가.

  7. 모멘트 조건 줄에 계수 조건 rankG=p\operatorname{rank}G=p 옆 "역함수 정리(W06의 야코비안 비특이)"와 개수 조건 qpq\ge p 옆 "필요조건일 뿐"이 적혀 있고, MGM_Gtr=qp\operatorname{tr}=q-p 계산이 있는가.

  8. 번역 문장이 있는가 — 분해와 개수 각각 한 문장.

냉시동 인출(40분) — 1주 전 · 3주 전 · 8주 전 각 1항목. 자료 없이 백지에서 재구성한다. 막힌 항목은 다음 주 “1주 전” 자리에 다시 올린다.

노트북(40분)w22-lab.ipynb. 코드를 쓰기 전에 다음 셋에 답한다. 답은 3절의 표와 (15)에서 전부 읽어 낼 수 있어야 한다.

  1. 두 유형 모형(s=0.8s=0.8)에서 n=102,103,104,105n=10^{2},10^{3},10^{4},10^{5}로 늘릴 때 표본 평균 차이 Δ^\hat\Delta는 34로 가는가 94로 가는가. 정규방정식으로 직접 푼 더미 회귀 기울기 β^1\hat\beta_1Δ^\hat\Delta와 모든 표본에서 정확히 같은가. — 예측: 94로 간다; 소수점 끝자리까지 같다 — 대수 항등식이며 W07 (18)이다.

  2. 시뮬레이션의 잠재 Y0Y_0을 신의 시점에서 써서 잰 τ^ATT\hat\tau_{\mathrm{ATT}}는 34로 가는가. [150,400][150,400]으로 계산한 표본 Manski 경계의 폭은 nn에 따라 줄어드는가. — 예측: 34로 간다; 폭은 250에서 움직이지 않고 양끝만 -86·164로 수렴한다.

  3. 선형 IV p=1p=1, q=2q=2, n=500n=500, 2,000회 반복, 2단계 GMM. 바른 모형에서 Jn>3.84J_n>3.84인 비율과 JnJ_n의 평균은 얼마인가. 잘못된 모형(uu0.3z20.3z_2를 섞음)에서 그 비율은, nn을 4배로 하면 JnJ_n 평균은 몇 배가 되는가. z2z_2를 버려 q=p=1q=p=1로 하면 JnJ_n은 얼마인가. — 예측: 약 0.05와 약 1 — 극한분포 χ12\chi^{2}_{1}의 평균 qpq-p이며 시뮬레이션 관찰값으로만 확인한다; 1.00과 약 4배 — JnJ_nnn에 비례한다; 항등적으로 0.

계산은 패키지 호출 없이 한다. 유형을 반반으로 뽑고 DDPr(D=1u)\Pr(D{=}1\mid u)로, (Y0,Y1)(Y_0,Y_1)을 유형별 상수로 만들어 Y=DY1+(1D)Y0Y=DY_1+(1-D)Y_0을 직접 쌓는다. β^1\hat\beta_1X=[1  D]X=[\mathbf 1\;D]XXX'X, XyX'y를 만들어 푼다. 선형 IV는 z1,z2,v,ez_1,z_2,v,e를 표준정규로 뽑아 x=z1+0.5z2+vx=z_1+0.5z_2+v, u=0.5v+eu=0.5v+e(바른 모형) 또는 u=0.5v+0.3z2+eu=0.5v+0.3z_2+e(틀린 모형), y=1.5x+uy=1.5x+u로 두고, 1단계 W=IW=I, 2단계 W=S^1W=\hat S^{-1}θ^\hat\thetaJnJ_n을 식 그대로 계산한다. 틀린 모형의 W=IW=I 유사참값은 a=(1,0.5)a=(1,0.5)', b=(1.5,1.05)b=(1.5,1.05)'에서 ab/aa=1.62a'b/a'a=1.62이고 두 비는 1.5·2.1이다. 대조 표는 예측 | 결과 | 어긋남 | 원인 4열이다.

7. 마치며…

0절의 식을 다시 본다.

E[YD=1]E[YD=0]=E[Y1Y0D=1]ATT+E[Y0D=1]E[Y0D=0]selection bias\mathbb{E}[Y\mid D{=}1]-\mathbb{E}[Y\mid D{=}0] =\underbrace{\mathbb{E}[Y_1-Y_0\mid D{=}1]}_{\text{ATT}} +\underbrace{\mathbb{E}[Y_0\mid D{=}1]-\mathbb{E}[Y_0\mid D{=}0]}_{\text{selection bias}}

지금은 이렇게 읽힌다. 좌변의 두 기댓값은 관측 분포의 숫자이고, 우변의 E[Y0D=1]\mathbb{E}[Y_0\mid D{=}1]은 어떤 표본에도 없는 잠재 분포의 숫자다 — 같은 E\mathbb{E}가 두 종류다. 다섯 항은 모두 [화폐]이고 분해는 단위에 공변하며, 관측 차이 가운데 선택의 몫 δ0/Δ\delta_0/\Delta가 무차원 지표다. 좌변은 더미의 회귀계수, 곧 사영 계수이므로 언제나 식별되고, 우변의 두 항은 관측 사상의 핵 방향으로 서로 상쇄되는 성분을 가져 합만 식별된다. 그 핵을 메우는 것이 "반사실을 처치 정보에 사영하면 상수"라는 가정 A4이고, 그 가정은 식을 하나 채우되 남기지 않으므로 검정되지 않는다. 모멘트가 모수보다 많을 때만 남는 것이 생기고, 남는 개수 qpq-p가 검정 통계량 극한분포의 평균이다. 예제의 94는 34와 60으로 갈리지만, 자료가 보는 것은 94 하나이고 띠의 폭 250은 표본이 커져도 줄지 않는다.

더하고 빼기가 왜 식별을 바꾸지 못하는지 보이지 않으면 3절의 (9)로, 개수가 안 세어지면 (11)로 돌아간다.

다음 회차 W23 · 모형을 캐리커처로 읽기는 식별 가정을 데이터의 결함이 아니라 저자가 분리하려 한 인과 채널의 선택으로 읽고, 그 선택을 직접 한 번 한다.


이어지는 자료 — 식별 문헌 · 이 회차는 4년 계획의 실증 축으로 가는 분기점이다 · Manski, Identification Problems in the Social Sciences 1–2장 Manski, 1995 · Angrist & Pischke, Mostly Harmless Econometrics 2장 — 선택편의와 효과 이질성의 분해 Angrist & Pischke, 2009 · Lewbel, The Identification Zoo — 식별이라는 낱말의 여러 뜻 Lewbel, 2019 · Imbens & Angrist — 도구가 있을 때 무엇의 효과가 식별되는가(이 회차 밖) Imbens & Angrist, 1994

References
  1. LaLonde, R. J. (1986). Evaluating the Econometric Evaluations of Training Programs with Experimental Data. The American Economic Review, 76(4), 604–620.
  2. Hansen, L. P., & Singleton, K. J. (1982). Generalized Instrumental Variables Estimation of Nonlinear Rational Expectations Models. Econometrica, 50(5), 1269–1286. 10.2307/1911873
  3. Rubin, D. B. (1974). Estimating Causal Effects of Treatments in Randomized and Nonrandomized Studies. Journal of Educational Psychology, 66(5), 688–701. 10.1037/h0037350
  4. Koopmans, T. C. (1949). Identification Problems in Economic Model Construction. Econometrica, 17(2), 125–144. 10.2307/1905689
  5. Holland, P. W. (1986). Statistics and Causal Inference. Journal of the American Statistical Association, 81(396), 945–960. 10.1080/01621459.1986.10478354
  6. Manski, C. F. (1995). Identification Problems in the Social Sciences. Harvard University Press.
  7. Manski, C. F. (2003). Partial Identification of Probability Distributions. Springer.
  8. Manski, C. F. (1990). Nonparametric Bounds on Treatment Effects. The American Economic Review, 80(2), 319–323.
  9. Rothenberg, T. J. (1971). Identification in Parametric Models. Econometrica, 39(3), 577–591.
  10. Hansen, L. P. (1982). Large Sample Properties of Generalized Method of Moments Estimators. Econometrica, 50(4), 1029–1054. 10.2307/1912775
  11. Newey, W. K., & McFadden, D. (1994). Large Sample Estimation and Hypothesis Testing. In Handbook of Econometrics (Vol. 4, pp. 2111–2245). Elsevier.
  12. Heckman, J. J. (1979). Sample Selection Bias as a Specification Error. Econometrica, 47(1), 153–161. 10.2307/1912352
  13. Lucas, R. E., Jr. (1976). Econometric Policy Evaluation: A Critique. Carnegie-Rochester Conference Series on Public Policy, 1, 19–46. 10.1016/S0167-2231(76)80003-6
  14. Sims, C. A. (1980). Macroeconomics and Reality. Econometrica, 48(1), 1–48. 10.2307/1912017
  15. Angrist, J. D., & Pischke, J.-S. (2009). Mostly Harmless Econometrics: An Empiricist’s Companion. Princeton University Press.