E6 · 패널과 고정효과: 평균을 지우는 일과 식별되는 차이#

1. 지역 차이를 빼고 투자 효과를 읽기#

두 지역에서 세 시점의 투자 \(x\)와 생산 \(y\)를 관측했다고 하자. 단위는 각각 기준 투자량과 기준 생산량입니다. 지역마다 측정하지 못한 고정 생산성이 있지만 투자 한 단위의 효과 \(\beta\)는 같다는 모형을 세웁니다.

아래 최소제곱 계산 자체는 자료의 대수적 요약입니다. 이를 불편한 기울기 추정으로 해석할 때에는 전체 시점의 설명변수와 지역효과를 조건으로 \(E[u\mid X,\alpha]=0\)인 엄격 외생성을 가정합니다. 과거 오차가 미래 투자 선택에 영향을 주면 이 조건이 깨질 수 있습니다.

\[y_{it}=\alpha_i+\beta x_{it}+u_{it},\quad x=(0,1,2,\ 2,3,4)^T,\quad y=(1,2,4,\ 2,4,5)^T.\]

지역 A 평균은 \(\bar x_A=1\), \(\bar y_A=7/3\)이고 B 평균은 \(3,11/3\)입니다. 지역 안에서 평균을 빼면

\[x_w=(-1,0,1,\ -1,0,1)^T,\]
\[y_w=(-4,-1,5,\ -5,1,4)^T/3.\]

평균을 빼는 이유는 \(\alpha_i\)가 그 지역의 모든 관측에 똑같이 들어가기 때문입니다. 차감 후 \(\alpha_i-\alpha_i=0\)입니다. 두 벡터의 내적은 \((4+5+5+4)/3=6\), \(x_w^Tx_w=4\)이므로 \(\widehat\beta_{FE}=3/2\)입니다. 절편을 복원하면

\[\widehat\alpha_A=7/3-3/2=5/6,\qquad \widehat\alpha_B=11/3-9/2=-5/6.\]

따라서 적합 잔차는 \((1,-2,1,-1,2,-1)^T/6\), 제곱합은 \(12/36=1/3\)입니다. 자유도는 관측 6에서 지역 절편 2와 기울기 1을 빼서 3입니다. 잔차 회귀가 6개 행을 사용한다고 자유도를 \(6-1\)로 세면 안 됩니다.

두 지역의 원자료와 지역평균을 제거한 자료에서 공통 기울기 1.5를 비교

그림 146 위는 지역별 절편과 공통 기울기, 아래는 지역 내 편차다. 점과 적합선을 같은 색 및 서로 다른 표식으로 연결한다. 단위는 원래 투자·생산 단위를 유지한다.#

2. within, between, 랜덤효과#

지역 더미 행렬을 \(D=I_2\otimes\mathbf1_3\)라 놓겠습니다. \(P=D(D^TD)^{-1}D^T=I_2\otimes J_3/3\)는 지역 평균으로 바꾸며 \(Q=I-P\)는 평균을 뺍니다. \(P^2=P\), \(Q^2=Q\), \(PQ=0\)이므로 모든 관측은 평균 부분과 편차 부분으로 직교 분해됩니다. \(\operatorname{rank}P=2\), \(\operatorname{rank}Q=4\)입니다.

고정효과 추정이 within 회귀인 이유는 임의 \(\beta\)에서 최적 지역효과의 관측별 적합값이 \(P(y-X\beta)\)이기 때문입니다. 이를 뺀 목적함수는 \(\|Q(y-X\beta)\|^2\)이고 정규방정식은 \(X^TQX\beta=X^TQy\)입니다. 이는 정리 3. FWL의 두 증명과 분산을 지역 더미에 적용한 것입니다.

랜덤효과 모형은 더 강한 가정을 둡니다. \(X\)를 조건으로 \(E[\alpha\mid X]=0\), \(\operatorname{Cov}(\alpha\mid X)=\sigma_\alpha^2I_N\), \(\operatorname{Cov}(\alpha,u\mid X)=0\)이라 하고 \(u\)의 조건부 공분산은 \(\sigma_e^2I\)라 합니다. 그러면 관측별 합성오차 \(D\alpha+u\)의 조건부 공분산은

\[\Omega=\sigma_e^2Q+(\sigma_e^2+T\sigma_\alpha^2)P.\]

두 공간의 분산이 다릅니다. \(\sigma_e^2>0\)에서

\[\Omega^{-1/2}=\sigma_e^{-1}(Q+\theta P),\quad \theta=\frac{\sigma_e}{\sqrt{\sigma_e^2+T\sigma_\alpha^2}}.\]

따라서 변환 자료는 \(y_{it}-(1-\theta)\bar y_i\)입니다. 일부 문헌은 \(1-\theta\)를 준차분 계수라고 부릅니다. 어느 기호를 쓰는지 먼저 확인해야 합니다.

이 절의 작은 수치 비교에서는 공통 절편을 0으로 고정한 랜덤효과 작업모형을 사용합니다. 고정효과 추정은 그대로지만 between 회귀는 원점을 지나는 두 집단 평균의 회귀입니다. \(x^TPx=3(1^2+3^2)=30\), \(x^TPy=3(1\cdot7/3+3\cdot11/3)=40\)이어서 between 기울기는 \(4/3\)입니다. \(\sigma_e^2=\sigma_\alpha^2=1\)이면 \(\theta=1/2\)이고

\[\widehat\beta_{RE}=\frac{6+(1/4)40}{4+(1/4)30}=\frac{32}{23}.\]

이는 \(3/2\)\(4/3\)의 정보가중 평균입니다. 공통 절편을 추가하려면 그 열도 같이 준차분해야 하며 위 숫자를 그대로 쓸 수 없습니다.

여러 설명변수에서는 \(A=X^TQX\), \(B=X^TPX\)에 대해

\[\widehat\beta_{RE}=(A+\theta^2B)^{-1}(A\widehat\beta_W+\theta^2B\widehat\beta_B)\]

입니다. 각 추정량을 쓰려면 해당 Gram이 가역이어야 합니다. 가중은 행렬이므로 각 계수가 두 추정량 사이에 들어온다는 스칼라 결론은 일반적으로 거짓입니다. \(A\)가 특이한 시간불변 변수의 within 계수는 애초에 식별되지 않습니다.

3. Hausman 차이의 분산은 왜 빼기인가#

랜덤효과 가정이 옳고 \(\Omega\)를 안다고 하자. 공통 계수에 대해 선형 불편 FE를 \(C_Fy\), GLS를 \(C_Ry\)로 쓰면 \(C_FX=C_RX=I\)입니다. GLS에서는 \(\Omega C_R^T=X(X^T\Omega^{-1}X)^{-1}\)입니다. 따라서

\[\operatorname{Cov}((C_F-C_R)y,C_Ry)=(C_F-C_R)X(X^T\Omega^{-1}X)^{-1}=0.\]

차이와 효율적 추정량은 무상관입니다. \(C_Fy=C_Ry+(C_F-C_R)y\)의 분산을 취하면 \(V_F=V_R+\operatorname{Var}(\widehat\beta_F-\widehat\beta_R)\)입니다. 그래서 차이의 분산이 \(V_F-V_R\)입니다. 서로 독립이라서가 아닙니다.

예제에서는 \(\Omega=I+3P\), \(V_F=1/4\), \(V_R=1/(4+30/4)=2/23\)이고 차이는 \(15/92\)입니다. 귀무가설 아래 분산 성분을 일관되게 추정하면 같은 점근 논리를 사용할 수 있습니다. 서로 다른 강건 공분산을 아무렇게나 빼서 PSD가 된다고 주장할 수는 없습니다. 특이한 차이에서는 유효 계수와 지지공간을 확인하고 E2의 유사역 이차형식을 사용합니다.

4. 노동자와 기업: 무엇이 연결되어 있는가#

이제 한 관측이 노동자 \(i\)와 기업 \(j\)의 조합이라고 합시다. 임금의 두 효과 모형은 \(y_e=\alpha_i+\psi_j+\beta x_e+u_e\)입니다. 관측 조합을 이분 그래프의 변으로 그립니다. 관측이 있는 노동자 1,2와 기업 A,B에 변 \((1,A),(1,B),(2,B)\)가 있으면 하나의 연결성분입니다.

더미 설계 \(D=[D_w,D_f]\)의 영벡터 조건은 모든 변에서 \(a_i+b_j=0\)입니다. \((1,A)\)\(b_A=-a_1\), \((1,B)\)\(b_B=-a_1\), \((2,B)\)\(a_2=a_1\)을 줍니다. 모든 노동자 효과에 같은 \(c\)를 더하고 기업 효과에 \(-c\)를 더해도 적합값은 같습니다. 노동자 3과 기업 C의 변만 따로 추가하면 그 성분에는 독립적인 상수 이동이 하나 더 생깁니다.

노동자 1과 2 및 기업 A와 B가 연결된 성분과 노동자 3 기업 C의 별도 성분

그림 147 변은 실제 관측된 조합이다. 좌표는 배치용이며 거리에는 경제적 단위가 없다. 두 연결성분은 각각 하나의 정규화를 필요로 한다.#

관측에 등장하는 노동자 수 \(N\), 기업 수 \(J\), 연결성분 수 \(C\)이면 더미의 계수는 \(N+J-C\)입니다. 이후 공변량을 흡수한 \(M_DX\)의 계수를 \(r\)이라 하면 잔차 자유도는 \(n-(N+J-C)-r\)입니다. 반복 관측은 변의 수를 늘리지만 연결성분의 영공간 규칙은 바꾸지 않습니다.

같은 종류 효과의 차이는 같은 성분 안에서 식별됩니다. 한 변의 합 \(\alpha_i+\psi_j\)도 식별됩니다. 따라서 ‘효과 차이만 추정가능하다’는 표현은 너무 좁습니다. 일반 선형함수는 영공간의 모든 상수 이동을 소거할 때에만 추정가능합니다. 성분 간 개별 효과 평균·상관은 정규화에 의존할 수 있습니다. 이것과 유한 표본에서 이동이 적어 생기는 분산·편향 문제는 서로 다른 문제입니다.

5. 평균을 번갈아 빼면 왜 수렴하는가#

\(P_w,P_f\)는 노동자·기업 평균 사영, \(M_w=I-P_w\), \(M_f=I-P_f\)라 합시다. 한 번씩만 빼면 \(M_fM_wy\)입니다. 일반 불균형 패널에서 둘은 교환하지 않아, 나중 차감이 앞서 맞춘 평균 0을 깨뜨립니다. 목표는

\[K=\ker D_w^T\cap\ker D_f^T=\operatorname{col}(D)^\perp\]

로의 사영 \(P_Ky\)입니다. \((M_fM_w)^ky\)를 반복하면 이 값에 수렴합니다.

먼저 평면의 두 직선을 보겠습니다. \(S=\operatorname{span}e_1\), \(T=\operatorname{span}(c,s)^T\), \(c=\cos\theta\), \(s=\sin\theta\)라 하면

\[\begin{split}P_SP_T=\begin{pmatrix}c^2&cs\\0&0\end{pmatrix},\quad (P_SP_T)^k=c^{2k-2}\begin{pmatrix}c^2&cs\\0&0\end{pmatrix}.\end{split}\]

따라서 \(k\ge1\)에서 작용소 노름은 \(c^{2k-1}\)입니다. \(S\) 안에서 시작한 벡터는 한 왕복마다 \(c^2\)가 곱해져 \(c^{2k}\)가 됩니다. 두 지수는 서로 다른 질문의 답입니다.

각도 15도 45도 75도에서 두 직선 교대사영 오차가 기하급수적으로 감소하는 로그 그래프

그림 148 시작 벡터는 첫 직선의 단위벡터다. 가로축은 왕복 횟수, 세로축은 로그 오차이며 정확한 값은 \(\cos^{2k}\theta\)다. 임의 입력에 대한 작용소 노름은 \(\cos^{2k-1}\theta\)다.#

일반 유한차원 두 공간에서는 공통부분을 뺀 주각 중 가장 작은 각인 Friedrichs 각을 사용합니다. 각이 작으면 한 번 차감할 때 없애는 오차가 적습니다. 세 공간 이상도 유한차원에서는 공통부분 직교여공간에서 한 순환의 노름이 1보다 작아 기하 수렴합니다. 다만 두 공간의 단일 주각 공식은 그대로 쓰지 못합니다. 무한차원에서는 그 노름이 1인 경우가 있어 유한차원의 균일 속도를 자동 확장하지 않습니다.

6. 희소 풀이, 공선성, 음의 처치 가중치#

더미 전체를 조밀하게 만들지 않아도 \(Dv\)는 관측별 두 효과의 합, \(D^Tr\)는 그룹별 잔차 합으로 계산됩니다. 이 곱을 제공하면 LSMR로 \(\min_a\|y-Da\|\)를 풀 수 있습니다. 더미의 해는 정규화 없이 유일하지 않아도 적합값과 잔차는 유일합니다. CG를 정규방정식에 적용할 때는 영공간을 제거한 SPD 문제나 적절한 부분공간을 써야 합니다. 비대칭 \(M_fM_w\)에 SPD용 CG를 바로 넣으면 안 됩니다. Anderson 가속도 잔차 감소를 확인하고 불안정한 작은 최소제곱을 제어해야 하며 무조건 가속을 보장하지 않습니다.

흡수한 설계 \(\widetilde X=U\Sigma V^T\)에서 등분산 계수 공분산은 \(\sigma^2V\Sigma^{-2}V^T\)입니다. \(i\)번째 계수 분산은 \(\sigma^2\sum_jv_{ij}^2/\sigma_j^2\)로 분해됩니다. 조건지수 \(\sigma_1/\sigma_j\)와 이 분산 기여를 함께 보면 어떤 변수 조합이 약한지 알 수 있습니다. 변수의 단위를 먼저 정해야 하며, 열 정규화는 그 자체로 분석 선택입니다.

처치 \(d\)와 두 고정효과를 넣은 회귀에서는 \(\widehat\tau=\widetilde d^Ty/(\widetilde d^T\widetilde d)\)입니다. 처치효과만 \(y_{it}=d_{it}\tau_{it}\)로 남는 이상적 상황이면 가중치는 \(w_{it}=\widetilde d_{it}d_{it}/(\widetilde d^T\widetilde d)\), 합은 1이지만 음수도 가능합니다. 두 집단 세 시점의

\[\begin{split}d=\begin{pmatrix}0&1&1\\0&0&1\end{pmatrix}\end{split}\]

에서 이중 평균 제거는 \(\widetilde d=\begin{pmatrix}-1/6&1/3&-1/6\\1/6&-1/3&1/6\end{pmatrix}\)입니다. 분모는 \(1/3\)이고 처치 관측 가중치는 첫 집단의 두 시점에 \(1,-1/2\), 둘째 집단 마지막에 \(1/2\)입니다. 이질적 효과가 \((1,4,1)\)이면 회귀계수는 \(1-2+1/2=-1/2\)입니다. 모든 처치효과가 양수여도 계수는 음수일 수 있습니다. 관측 결과에는 미처치 추세도 있으므로 인과 해석에는 별도의 평행추세 가정이 필요합니다.

7. 계산으로 확인하기#

import numpy as np
import scipy.linalg as la
from scipy.sparse.linalg import lsmr
x=np.array([0.,1.,2.,2.,3.,4.]); y=np.array([1.,2.,4.,2.,4.,5.])
D=np.kron(np.eye(2),np.ones((3,1)))
P=D@la.lstsq(D,np.eye(6))[0]; Q=np.eye(6)-P
b=(x@Q@y)/(x@Q@x); alpha=la.lstsq(D,y-x*b)[0]
Omega=np.eye(6)+3*P; L=la.cholesky(Omega,lower=True)
br=la.lstsq(la.solve_triangular(L,x[:,None],lower=True),la.solve_triangular(L,y,lower=True))[0][0]
assert np.allclose([b,br],[1.5,32/23])
assert np.allclose(alpha,[5/6,-5/6])
d=np.array([[0.,1.,1.],[0.,0.,1.]])
dt=d-d.mean(axis=1,keepdims=True)-d.mean(axis=0,keepdims=True)+d.mean()
w=dt*d/np.sum(dt**2)
assert np.allclose(w[d==1],[1.,-.5,.5])
print('FE, RE, treated weights:',b,br,w[d==1])
FE, RE, treated weights: 1.5000000000000004 1.391304347826087 [ 1.  -0.5  0.5]
workers=np.array([0,0,1,1,2,2,0]); firms=np.array([0,1,1,2,0,2,2])
Dw=np.eye(3)[workers]; Df=np.eye(3)[firms]; DD=np.column_stack([Dw,Df])
Pw=Dw@la.lstsq(Dw,np.eye(len(workers)))[0]
Pf=Df@la.lstsq(Df,np.eye(len(workers)))[0]
v=np.array([1.,3.,2.,0.,4.,2.,-1.]); target=v-DD@la.lstsq(DD,v)[0]
r=v.copy(); history=[]
for k in range(80):
    r=(np.eye(7)-Pf)@((np.eye(7)-Pw)@r)
    history.append(la.norm(r-target))
r_sparse=v-DD@lsmr(DD,v,atol=1e-13,btol=1e-13)[0]
assert np.allclose(r,target,atol=1e-12)
assert np.allclose(r_sparse,target,atol=1e-12)
print('dummy rank, residual error:',np.linalg.matrix_rank(DD),history[-1])
dummy rank, residual error: 5 2.2543610929150276e-15

8. 연습과 전체 풀이#

문제 1 — 행렬. \(N=2,T=3\)\(P,Q\)를 써라.

풀이. \(P=\operatorname{diag}(J_3,J_3)/3\), \(Q=\operatorname{diag}(3I_3-J_3,3I_3-J_3)/3\)입니다. \(J_3^2=3J_3\)이므로 \(P^2=P\), \(Q^2=Q\), \(PQ=0\). 각 \(Q\) 블록은 합이 0인 평면에 대한 사영이라 계수 2, 전체 계수 4입니다.

문제 2 — 극한. RE가 FE로 가는 조건을 설명하라.

풀이. \(\sigma_\alpha^2\to\infty\)이면 \(\theta\to0\)입니다. \(X^TQX\)가 가역이면 역행렬 연속성으로 RE가 FE로 갑니다. \(X\)가 시간불변 열을 가지면 \(QX\)의 그 열은 0이므로 이 전체 계수 극한을 같은 식으로 주장할 수 없습니다. 반대로 \(\sigma_\alpha^2=0\)이면 \(\theta=1\)이라 \(Q+P=I\), OLS가 됩니다.

문제 3 — 그래프. 두 연결성분에서 기업 A와 C의 차이는 식별되는가?

풀이. 첫 성분 노동자에 \(c_1\), 기업에 \(-c_1\), 둘째 성분에는 \(c_2,-c_2\)를 더하면 모든 관측 적합값은 불변입니다. \(\psi_A-\psi_C\)\(-c_1+c_2\)만큼 변하므로 식별되지 않습니다. 같은 성분의 A와 B 차이는 공통 이동이 소거되어 식별됩니다.

문제 4 — 수렴률. 각도 \(60\)도의 두 직선에서 임의 입력에 대한 \(k\)회 오차 노름은?

풀이. \(c=1/2\)이므로 \(c^{2k-1}=2\cdot4^{-k}\). 첫 직선에서 출발한 단위벡터라면 \(4^{-k}\)입니다. 전자를 후자로 대체하면 첫 반복부터 상한이 틀립니다.

문제 5 — Hausman. 예제의 차이 분산을 계산하라.

풀이. \(Q\Omega Q=Q\)이므로 FE 분산은 \((x^TQx)^{-1}=1/4\). GLS 정보는 \(4+30/4=23/2\)여서 분산은 \(2/23\). 공분산 직교성에 의해 차이 분산은 \(1/4-2/23=15/92\). 독립이라고 가정하여 두 분산을 더하면 틀립니다.

문제 6 — 음의 가중. 6절의 가중치 합과 음의 계수를 확인하라.

풀이. \(1-1/2+1/2=1\). 모든 효과가 같은 \(a\)이면 결과는 \(a\)지만 \((1,4,1)\)이면 \(-1/2\)입니다. 따라서 계수는 비음 가중 평균이 아니며 단순 평균 처치효과로 읽을 수 없습니다.

9. 지금까지의 내용을 수학의 언어로 정리해 봅시다#

평균 차감은 직교사영이고, 식별 실패는 더미 사상의 핵이며, 반복 속도는 부분공간 각도입니다. 각각의 일반 명제를 증명합니다.

정리 1. 패널 분해와 랜덤효과#

균형 패널에서 \(P=I_N\otimes J_T/T\), \(Q=I-P\)는 서로 직교하는 사영입니다. \(\sigma_e^2>0\)일 때 2절의 공분산 제곱근과 RE 공식이 성립합니다.

증명. \(J_T^2=TJ_T\)와 대칭성으로 \(P=P^T=P^2\).

따라서 \(Q^2=I-2P+P^2=Q\), \(PQ=P-P^2=0\)입니다. 지역별 상수 공간의 차원은 \(N\), 그 직교여공간은 \(N(T-1)\)입니다. \(\Omega=\sigma_e^2Q+(\sigma_e^2+T\sigma_\alpha^2)P\)는 각 공간에서 해당 스칼라배입니다. 양의 스칼라 제곱근을 취하면 제시한 \(\Omega^{-1/2}\)를 얻습니다. GLS 정규방정식에 \(\Omega^{-1}=\sigma_e^{-2}(Q+\theta^2P)\)를 넣으면 공통 배율이 소거되어 RE 식이 나옵니다. 임의 \(\beta\)에서 더미 최소제곱 잔차가 \(Q(y-X\beta)\)인 것은 상·직교여공간의 피타고라스 분해로 따르므로 within=FWL도 증명됩니다. ∎

정리 2. 이분 그래프의 계수와 추정가능함수#

관측된 정점만 포함한 이분 그래프에 \(C\)개 성분이 있으면 \(\operatorname{rank}[D_w,D_f]=N+J-C\)입니다. 선형함수 \(l^Ta\)는 설계의 핵에 직교할 때에만 추정가능합니다.

증명. 핵 조건은 변마다 \(a_i+b_j=0\)입니다. 연결된 경로를 따라 번갈아 대입하면 한 성분의 노동자 값은 모두 같은 \(c\), 기업 값은 모두 \(-c\)입니다. 반대로 이런 값은 모든 변의 합을 0으로 만듭니다. 각 성분마다 독립 상수 하나이므로 핵 차원은 정확히 \(C\). 계수-차원 정리로 결론을 얻습니다. 두 해의 차이는 핵에 속합니다. 따라서 \(l\)이 핵에 직교하면 값이 같습니다. 직교하지 않으면 어떤 핵 벡터 \(v\)\(l^Tv\ne0\)이고, 해 \(a+tv\)는 적합값을 유지하면서 함수값을 바꾸므로 추정가능하지 않습니다. ∎

정리 3. 유한차원의 교대사영#

\(S,T\)의 공통부분을 \(K\)라 하고 공통부분 밖 최대 주각 코사인을 \(c<1\)이라 합시다. 비자명한 주각 블록이 있으면 \(\|(P_SP_T)^k-P_K\|=c^{2k-1}\), \(k\ge1\)입니다. 모든 주각이 직각이면 첫 반복부터 오차는 0입니다.

증명. 먼저 공통부분은 두 사영 모두 항등이고 그 직교여공간을 보존합니다. 공통부분 밖 \(S,T\)의 정규직교 기저 행렬을 \(U,V\)라 합시다. \(U^TV\)의 SVD로 기저를 바꾸면 \(\langle u_i,v_j\rangle=c_i\delta_{ij}\)입니다. \(0<c_i<1\)에서 \(w_i=(v_i-c_iu_i)/\sqrt{1-c_i^2}\)를 만듭니다. 직접 내적하면 \(w_i\)\(S\)에 수직이고 서로 정규직교합니다. 각 평면 \((u_i,w_i)\)에서 사영은 5절의 두 직선 행렬과 같습니다. 직각 방향과 한쪽 공간에만 있는 방향에서는 곱이 0입니다. 남은 양쪽 직교여공간에서도 곱은 0입니다.

따라서 직교 블록별 \(k\)제곱의 최대 노름은 \(\max_i c_i^{2k-1}\)입니다. \(c_i=1\)인 방향은 처음에 제거한 공통부분이므로 남은 유한 집합의 최댓값은 1보다 작습니다. ∎

정리 4. 여러 공간의 순환과 Hausman 직교성#

유한차원 공간 \(S_1,\ldots,S_m\)의 직교사영을 한 순환 곱한 \(T=P_m\cdots P_1\)은 공통부분 \(K\)로 기하 수렴합니다. 3절 조건 아래 Hausman 분산 차이 공식도 성립합니다.

증명. 각 사영은 \(K^\perp\)를 보존하고 노름을 늘리지 않습니다. \(K^\perp\)의 단위벡터 \(v\)\(\|Tv\|=1\)이라면 각 단계가 노름을 유지해야 합니다. 직교사영은 입력이 그 공간에 속할 때에만 길이를 유지하므로 첫 단계부터 입력이 바뀌지 않고 모든 공간에 속합니다. 이는 \(v\in K^\perp\)와 모순입니다. 단위구 콤팩트성으로 \(q=\|T|_{K^\perp}\|<1\)이며 \(\|T^k-P_K\|\le q^k\). 두 공간의 명시적 주각 공식보다 거친 상한입니다.

Hausman의 경우 \(D=C_F-C_R\)\(DX=0\), \(\Omega C_R^T=XV_R\)이므로 \(D\Omega C_R^T=0\). \(C_F=C_R+D\)의 공분산을 전개하면 \(V_F=V_R+D\Omega D^T\). 이것이 차이의 공분산이며 PSD입니다. ∎

정리 5. SVD 분산과 잔차화 처치 가중치#

완전 열계수 \(\widetilde X=U\Sigma V^T\)에서 등분산 계수 공분산은 \(\sigma^2V\Sigma^{-2}V^T\)입니다. 이원 고정효과를 제거한 단일 처치에는 6절의 가중치 식이 성립합니다.

증명. 잔차화 오차의 공분산은 \(\sigma^2M_D\)이며 \(M_D\widetilde X=\widetilde X\)입니다. 따라서 계수 공분산은 \(\sigma^2(\widetilde X^T\widetilde X)^{-1}=\sigma^2V\Sigma^{-2}V^T\). 대각 성분을 전개하면 분산 기여식입니다. 단일 처치의 FWL 정규방정식은 \(\widetilde d^T\widetilde d\widehat\tau=\widetilde d^Ty\). \(y=d\tau\)를 성분별 대입하면 가중치 식이고, \(\widetilde d^Td=d^TM_Dd=\|\widetilde d\|^2\)이므로 합은 1입니다. 각 성분의 부호까지 제한하는 성질은 없습니다. ∎

고정효과를 제거하는 사영은 불필요한 수준 차이를 없애지만, 식별에 쓸 변동도 함께 줄입니다. 다음 장에서는 많은 변수의 공통 변동을 저차원 요인으로 요약하는 문제를 다룹니다. E7로 이어 읽기.