E0 · 모집단의 예측과 표본의 회귀는 무엇이 다른가#
1. 활동량을 알면 산출량을 얼마나 잘 예측할 수 있을까#
활동 수준 \(X\)가 \(-1,0,1\)을 각각 확률 \(1/3\)로 갖는 작은 모집단을 생각합니다. \(X\)는 기준 활동량에서의 편차를 표준 단위로 나눈 수치입니다. 산출량 \(Y\)도 기준 산출 단위로 기록하며, 다음 교육용 관계를 가정합니다.
\(X\)와 \(\varepsilon\)는 독립입니다. 따라서 여섯 상태 \((X,\varepsilon)\)의 확률은 모두 \(1/6\)입니다. 이는 실제 자료에서 추정한 생산함수가 아니라 예측의 의미를 비교하기 위해 정한 모형입니다.
\(X\) |
가능한 \(Y\) 두 값 |
\(X\)를 알 때의 평균 \(m(X)\) |
|---|---|---|
\(-1\) |
\(3/2,5/2\) |
\(2\) |
\(0\) |
\(3/2,5/2\) |
\(2\) |
\(1\) |
\(7/2,9/2\) |
\(4\) |
각 행에서 두 값을 평균하면 \(m(X)=2+X+X^2\)입니다. \(X\)를 관측한 뒤 하나의 수를 예측하려면 왜 이 평균을 쓰는 것이 좋을까요? 예를 들어 \(X=1\)에서 예측값을 \(a\)라고 하면 조건부 평균제곱오차는
첫 항은 어떤 \(a\)를 골라도 남고, 둘째 항은 \(a=4\)에서만 0입니다. 다른 두 행에서도 같은 계산으로 최적 예측값 2를 얻습니다. 조건부 평균은 관측된 정보마다 제곱오차를 최소화한 예측입니다.
2. 예측식을 직선으로 제한하면 답이 바뀐다#
이번에는 모든 행에 같은 직선 \(a+bX\)를 써야 한다고 합시다. 필요한 평균은
마지막 항은 독립성과 \(E\varepsilon=0\) 때문에 0입니다. 잔차가 상수와 \(X\) 모두에 직교하도록 하면
최적선형예측은 \(\ell(X)=8/3+X\)입니다. 세 입력에서 \((5/3,8/3,11/3)\)이므로 조건부 평균 \((2,2,4)\)와 다릅니다. 차이는 \(m(X)-\ell(X)=X^2-2/3\)입니다.
조건부 평균의 오차는 \(E\varepsilon^2=1/4\)이고 직선의 오차는
교차항 \(E[\varepsilon(X^2-2/3)]\)이 0이어서 두 오차가 더해집니다. 자료가 아무리 많아도 직선만 허용하면 이 추가 오차 \(2/9\)가 사라지지 않습니다. 반대로 설명변수에 \(X^2\)를 추가하면 이 모형에서는 조건부 평균을 정확히 표현할 수 있습니다.
그림 128 점은 여섯 상태이며 각 점의 확률은 1/6이다. 모집단의 입력은 세 점뿐이고, 점 사이 연결선은 예측식의 비교를 돕기 위한 표시이다. 곡선의 중간 입력에 확률질량이 있다고 가정하지 않는다.#
3. 사영이 일어나는 공간에는 무엇이 들어 있는가#
여섯 상태에서 값을 갖는 확률변수는 길이 6의 목록으로 적을 수 있습니다. 그러나 모집단 내적은 단순한 합이 아니라 확률로 가중한 합입니다.
\(X\)만 보고 만든 예측은 같은 \(X\)를 가진 두 상태에서 같은 값을 내야 합니다. 이 조건을 만족하는 목록들의 공간은 차원 3입니다. 그 안에서 \(a+bX\) 꼴의 목록은 차원 2인 더 작은 공간입니다. 전체 6차원 공간에서 먼저 3차원 공간으로 사영하면 \(m\), 2차원 공간으로 사영하면 \(\ell\)입니다. 표본공간의 여섯 상태 자체를 사영하는 것이 아니라, 그 위에서 정의된 확률변수를 사영합니다.
일반 확률공간에서는 \(E[U^2]<\infty\)인 확률변수들을 모아 \(L^2\)라 쓰고, 확률 1로 같은 변수는 같은 원소로 봅니다. 이 동일시가 있어야 \(\|U\|_2=0\)에서 \(U=0\)이라는 내적공간의 조건이 성립합니다. \(\sigma(X)\)는 \(X\)를 관측하여 구별할 수 있는 사건들의 모음이며 \(L^2(\sigma(X))\)는 그 정보로 결정되는 제곱적분가능 예측의 공간입니다.
여기서는 기댓값·독립·표준정규·적분의 기본 성질을 확률론의 전제로 사용합니다. 일반 \(L^2\)의 완비성, \(L^2(\mathcal G)\)의 닫힘 및 닫힌 부분공간 사영의 존재는 I2에서 다룰 결과로 명시하여 빌립니다. 여섯 상태의 모든 계산은 유한차원 사영만으로 완결됩니다. 뒤의 증명에서는 일반 경우도 이 존재 전제 아래 직교성과 최적성·타워 성질을 직접 유도합니다.
정보 \(\mathcal G\subseteq\mathcal H\)가 중첩되면 작은 공간으로 다시 사영한 결과는 처음부터 작은 공간으로 사영한 것과 같습니다.
이를 타워 성질이라 부릅니다. 임의의 두 정보집합에서는 사영 순서를 교환할 수 없습니다. 특히 모집단 FWL의 부분화는 무조건적인 조건부기댓값의 교환법칙이 아닙니다.
4. 공분산은 중심화된 변수들의 내적표다#
\(U=(U_1,\ldots,U_d)^T\), \(\mu=E[U]\)이면
따라서 \(a^T\Sigma a=E[(a^T(U-\mu))^2]\ge0\)입니다. 공분산은 양의 준정부호이며, 각 성분을 중심화한 \(L^2\) 벡터의 Gram 행렬입니다. 처음 예에서
\(Y\)의 분산은 \(2/3+2/9+1/4=41/36\)입니다. 상관계수는 중심화한 두 벡터가 이루는 각의 코사인이므로
중심화를 빼면 이 값이 아닙니다. 분산이 0인 변수에는 각과 상관계수가 정의되지 않습니다.
선형 기록 \(AU+c\)의 공분산은 \(A\Sigma A^T\)입니다. 단위 변환도 이 공식에 포함됩니다. 이는 상사가 아닌 합동변환이며 고윳값을 보존하지 않습니다. 예컨대 \(\Sigma=\operatorname{diag}(1,4)\)에 \(A=\begin{pmatrix}1&1\\0&1\end{pmatrix}\)를 적용하면 \(\begin{pmatrix}5&4\\4&4\end{pmatrix}\)이고 고윳값은 \((9\pm\sqrt{65})/2\)입니다.
공분산의 계수는 확률 1로 변수가 놓이는 최소 아핀부분공간의 차원입니다. 곡선 모양 지지집합의 기하학적 차원과는 다릅니다. \(U=(X,X^2)\)는 세 점에서만 값을 가지지만 공분산은 \(\operatorname{diag}(2/3,2/9)\)로 계수 2입니다.
5. 특이한 정규분포와 조건부 예측#
서로 독립인 표준정규 \(Z_1,Z_2\)로
를 만듭니다. 항상 \(U_2=U_3\)이므로 분포가 한 평면에 놓입니다. 고윳값은 \(2+\sqrt2,2-\sqrt2,0\)입니다. 3차원 전체에 대한 밀도는 없지만 분포와 조건부 예측은 잘 정의됩니다.
일반적으로 \(U=\mu+AZ\), \(Z\sim N(0,I)\), \(AA^T=\Sigma\)이면 \(N(\mu,\Sigma)\)라 정의합니다. 같은 \(\Sigma\)를 만드는 다른 인수를 써도 같은 분포라는 사실은 마지막 절에서 증명합니다. 양의 고윳값만 사용하면 지지 평면 위의 밀도도 얻습니다. 위 예의 유사행렬식은 2이고 \(u=(1,1/2,1/2)\)에서는 \(u^T\Sigma^+u=1/2\)이므로 로그밀도는 \(-\log(2\pi)-\frac12\log2-\frac14\)입니다. 이는 평면의 2차원 부피 기준이며 3차원 밀도가 아닙니다.
그림 129 왼쪽은 평면의 3차원 표시, 오른쪽은 \((U_2,U_1)\) 좌표이다. 오른쪽의 직선은 조건부 평균 \(U_2\)이고 세로방향 오차분산은 1이다. 표본 산포는 분포를 설명하며 평면 지지의 증명은 \(U_2-U_3=0\)이라는 식이다.#
\(V=(U_2,U_3)^T\)를 관측하면 \(Z_2\)를 이미 압니다. 따라서 \(E[U_1\mid V]=U_2\), 조건부분산은 1입니다. 블록 공분산으로도 같은 답을 얻습니다.
평균 공식은 \((V_1+V_2)/2\), 분산 공식은 \(2-(1,1)\Sigma_{VV}^+(1,1)^T=1\)입니다. 일반화역 \(G=\operatorname{diag}(1,0)\)도 \(\Sigma_{VV}G\Sigma_{VV}=\Sigma_{VV}\)를 만족하며 평균 \(V_1\)을 줍니다. 두 식은 지지 \(V_1=V_2\) 위에서 같습니다. 불가능한 관측 \((0,1)\)에서는 두 연장식이 달라도 모순이 아닙니다.
import numpy as np
import scipy.linalg as la
A=np.array([[1.,1.],[0.,1.],[0.,1.]])
Sigma=A@A.T
S=Sigma[1:,1:];c=Sigma[:1,1:]
G1=la.pinv(S);G2=np.diag([1.,0.])
v=np.array([.5,.5])
assert np.allclose(S@G2@S,S)
assert np.allclose(c@G1@v,c@G2@v)
assert np.allclose(2-c@G1@c.T,[[1.]])
u=np.array([1.,.5,.5])
expected=-np.log(2*np.pi)-.5*np.log(2)-.25
ev=la.eigvalsh(Sigma);positive=ev[ev>1e-12]
assert np.allclose(Sigma@la.pinv(Sigma)@u,u)
log_density=-len(positive)/2*np.log(2*np.pi)-.5*np.log(positive).sum()-.5*u@la.pinv(Sigma)@u
assert np.isclose(log_density,expected)
print('지지 위 조건부 평균·분산·로그밀도:',float((c@G1@v)[0]),1.,expected)
지지 위 조건부 평균·분산·로그밀도: 0.4999999999999999 1.0 -2.434450656689318
이 Schur 보원 해석은 결합정규에 의존합니다. 주변분포만 정규라고 충분하지 않습니다. \(Z\sim N(0,1)\), 독립 부호 \(S=\pm1\)로 \((Z,SZ)\)를 만들면 각각은 표준정규이고 공분산은 0이지만 절댓값이 항상 같아 종속입니다.
6. 다른 설명변수를 먼저 제거하는 모집단 FWL#
제곱적분가능 설명변수 묶음을 \(W,V\)라 하고 \(W\)의 선형생성공간에 대한 사영을 \(P_W\)라 합시다. 상수가 필요하면 \(W\)에 1을 포함합니다. \(\widetilde Y=Y-P_WY\), \(\widetilde V=V-P_WV\)를 만들면 \(W\)가 설명하는 선형 성분을 제거한 것입니다.
왼쪽 행렬이 양의 정부호이면 이 식의 유일해가 전체 선형예측에서 \(V\)에 붙는 계수입니다. \(W=1,V=X\)인 처음 예에서는 중심화만 하면 되어 \(b=(2/3)/(2/3)=1\)입니다. \(W\)가 설명변수 전체를 이미 생성하면 잔차 Gram이 0이어서 별도 계수를 식별할 수 없습니다.
이 절의 제거는 \(W\)의 유한 선형생성공간에 대한 것입니다. \(P_WY\)를 항상 \(E[Y\mid W]\)로 바꾸면 다른 추정대상을 만들 수 있습니다. 비선형 조건부 평균과 선형예측을 구별해야 하는 이유가 여기서도 나타납니다.
7. 표본 OLS는 어느 대상으로 가까워지는가#
모집단에서 독립적으로 \(n\)개를 뽑아 \(D_i=(1,X_i)^T\)라 쓰면 표본 OLS는 \(\sum(Y_i-D_i^Tb)^2/n\)을 최소화합니다. 표본마다 \(X_i,Y_i\)가 바뀌므로 계수도 바뀝니다. 모집단 Gram \(Q=E[DD^T]\succ0\)이고 이차적률이 유한하면 대수법칙으로
극한은 최적선형예측 계수입니다. 조건부 평균이 선형이거나 그 함수를 설명변수 공간에 포함시킨 경우에만 조건부 평균도 회복합니다. 이 수렴에 평균독립 오차의 선형모형을 억지로 가정할 필요는 없습니다.
rng=np.random.default_rng(20260917)
x=np.repeat([-1.,0.,1.],2);eps=np.tile([-.5,.5],3)
y=2+x+x*x+eps;D=np.column_stack([np.ones(6),x])
b=la.lstsq(D,y)[0]
assert np.allclose(b,[8/3,1.])
assert np.isclose(np.mean((y-D@b)**2),17/36)
print('여섯 상태의 정확 모집단 선형예측:',b)
N=10000
xs=rng.choice([-1.,0.,1.],N);es=rng.choice([-.5,.5],N)
ys=2+xs+xs*xs+es
for n in [100,1000,N]:
Ds=np.column_stack([np.ones(n),xs[:n]])
bs=la.lstsq(Ds,ys[:n])[0]
print(n,bs,'모집단 계수와의 거리',la.norm(bs-b))
여섯 상태의 정확 모집단 선형예측: [2.66666667 1. ]
100 [2.79240807 0.95255042] 모집단 계수와의 거리 0.13439628980563453
1000 [2.65185461 0.97922948] 모집단 계수와의 거리 0.02551100858725587
10000 [2.66638684 0.99624064] 모집단 계수와의 거리 0.003769763811348379
한 실현의 오차가 \(n\)에 따라 매번 감소한다는 주장은 하지 않습니다. 확률수렴은 임의의 고정 허용오차를 넘을 확률이 0으로 간다는 뜻입니다.
그림 130 왼쪽은 각 크기에서 200개 독립 표본의 계수 거리 중앙값과 10~90백분위 범위이며 두 축이 로그이다. 오른쪽은 모집단에서 직접 계산한 제곱오차의 분해이다. 표본 오차 감소와 직선 모형의 근사오차 2/9는 다른 양이다.#
\(R_n=o_p(a_n)\)은 \(R_n/a_n\to_p0\), \(R_n=O_p(a_n)\)은 \(R_n/a_n\)이 확률적으로 유계라는 뜻입니다. 후자는 모든 \(\epsilon>0\)에 충분히 큰 \(M,N\)을 골라 \(n\ge N\)에서 \(P(\|R_n/a_n\|>M)<\epsilon\)이 되게 할 수 있다는 조건입니다. 고정 차원에서 \(O_p(a)O_p(b)=O_p(ab)\), \(o_p(a)O_p(b)=o_p(ab)\)를 사용할 수 있습니다. \(R_n=O_p(1)\)만으로 역수도 \(O_p(1)\)이라 할 수는 없습니다. \(R_n=1/n\)이 반례입니다.
독립 동일분포와 유한 이차적률의 대수법칙, 유한 공분산 벡터의 중심극한정리, 연속사상·Slutsky 정리는 확률론의 외부 전제입니다. 예컨대 \(\sqrt nT_n\Rightarrow Z\), \(A_n\to_pA\)이면 \(A_n\sqrt nT_n\Rightarrow AZ\)입니다. O3의 수요에 등장한 Slutsky 행렬과는 별개의 결과입니다. 회귀의 점근정규성에는 점수 \(D(Y-D^Tb)\)의 유한 공분산 등 추가 조건이 필요합니다.
8. 연습과 전체 풀이#
1. 처음 모형에서 \(X\)를 전혀 보지 못하면 최적 예측과 평균제곱오차는 무엇인가요?
풀이. 상수 예측은 \(E[Y]=8/3\)이고 오차는 \(\operatorname{Var}Y=41/36\)입니다. \(X\)를 선형으로 사용하면 \(2/3\)만큼 줄어 \(17/36\), 모든 함수를 허용하면 추가 \(2/9\)가 줄어 \(1/4\)입니다.
2. \(Y=X^2\), \(X=-1,0,1\) 등확률이면 무상관이 독립을 뜻하나요?
풀이. \(E[X]=E[X^3]=0\)이므로 공분산은 0입니다. 그러나 \(X=0\)이면 \(Y=0\)이고 \(X=1\)이면 \(Y=1\)이므로 종속입니다. 직교는 모든 비선형 관계를 제거하지 않습니다.
3. \(\Sigma=\begin{pmatrix}4&2&0\\2&3&1\\0&1&2\end{pmatrix}\), \(A=\begin{pmatrix}1&-1&0\\0&1&-1\end{pmatrix}\)의 변환 공분산을 구하세요.
풀이. \(A\Sigma=\begin{pmatrix}2&-1&-1\\2&2&-1\end{pmatrix}\)이고 오른쪽에 \(A^T\)를 곱하면 \(\operatorname{diag}(3,3)\)입니다. 원래 행렬의 선행 주소행렬식은 \(4,8,12\)로 양수여서 영공간이 없습니다. 차원이 3에서 2로 줄어든 이유는 \(A\)의 핵이며, 원래 공분산의 영방향을 제거한 사례가 아닙니다.
4. 특이 정규 예에서 불가능한 관측 \(V=(0,1)\)에 두 일반화역 공식을 대입하세요.
풀이. 유사역은 \(1/2\), \(\operatorname{diag}(1,0)\)은 0을 줍니다. 조건부 평균은 관측 분포에 대해 거의 확실하게 유일하므로 지지 밖의 차이는 정리와 충돌하지 않습니다.
5. 처음 모형의 \(\operatorname{Var}(E[Y\mid X])\)를 구하세요.
풀이. \(X\)와 \(X^2\)의 공분산은 0이므로 \(2/3+2/9=8/9\). 여기에 조건부분산 평균 \(1/4\)를 더하면 \(41/36\)입니다.
6. 표본 상관계수를 내적으로 계산할 때 왜 상수벡터를 제거하나요?
풀이. \(x_c=x-\bar x\mathbf1\), \(y_c=y-\bar y\mathbf1\)에 \(x_c^Ty_c/(\|x_c\|\|y_c\|)\)를 계산해야 공분산의 정의와 같습니다. 원래 벡터를 쓰면 평균 수준의 공통 성분까지 내적에 포함합니다. 어느 중심화 벡터가 0이면 상관계수는 정의되지 않습니다.
7. 임금의 선형예측에서 교육 계수가 양수이면 교육의 인과효과도 양수인가요?
풀이. 선형예측 계수는 관측된 결합분포의 제곱오차 최소화 대상입니다. 조건부 평균의 교육 편미분은 비선형일 수 있고, 교육을 외생적으로 바꾸는 개입의 효과는 잠재 교란·선택에 대한 추가 가정을 요구합니다. 사영 대수만으로 세 대상을 같게 만들 수 없습니다.
9. 지금까지의 내용을 수학의 언어로 정리해 봅시다#
앞의 계산을 정의와 증명으로 옮깁니다. 일반 \(L^2\)의 완비성과 닫힌 부분공간 사영의 존재, 기본 확률 적분은 앞서 명시한 전제입니다.
정리 1. 공분산의 합동성과 최소 아핀공간#
유한 이차적률의 \(U\)에서 \(\Sigma\succeq0\), \(\operatorname{Var}(AU+c)=A\Sigma A^T\)입니다. 확률 1로 \(U\)를 포함하는 최소 아핀공간은 \(\mu+\operatorname{ran}\Sigma\)입니다. 역으로 모든 PSD 행렬은 어떤 확률벡터의 공분산입니다.
증명. \(a^T\Sigma a=E[(a^T(U-\mu))^2]\ge0\)이고 중심화된 변환이 \(A(U-\mu)\)이므로 기댓값의 선형성으로 합동식을 얻습니다. \(a\in\ker\Sigma\)일 필요충분조건은 이 제곱의 기댓값이 0, 곧 \(a^T(U-\mu)=0\) a.s.인 것입니다. 핵의 유한 기저에 대한 확률 1 사건을 교차하면 \(U-\mu\in(\ker\Sigma)^\perp=\operatorname{ran}\Sigma\) a.s.입니다. 다른 아핀공간 \(a+S\)가 \(U\)를 포함하면 평균도 그 공간에 있어 \(U-\mu\in S\) a.s.이고, \(S^\perp\subseteq\ker\Sigma\)여서 \(\operatorname{ran}\Sigma\subseteq S\)입니다.
따라서 최소입니다. PSD \(\Sigma\)에는 제곱근이 있고 표준정규 \(Z\)에 \(U=\Sigma^{1/2}Z\)를 대입하면 공분산이 \(\Sigma\)입니다. ∎
정리 2. 조건부 평균의 직교성·최적성·타워 성질#
\(Y\in L^2\)에 대해 \(m=E[Y\mid\mathcal G]\)는 \(L^2(\mathcal G)\)의 유일한 직교사영입니다. 모든 \(h\in L^2(\mathcal G)\)에
또한 사영은 노름을 증가시키지 않고, 정보가 중첩되면 타워 성질이 성립합니다. 조건부분산을 \(E[(Y-m)^2\mid\mathcal G]\)로 정의하면 전체 분산분해도 성립합니다.
증명. 닫힌 부분공간 사영의 존재 전제로 \(m\in L^2(\mathcal G)\)와 \(Y-m\perp L^2(\mathcal G)\)를 얻습니다. 사건 \(B\in\mathcal G\)의 지시함수도 그 공간에 있으므로 \(E[(Y-m)1_B]=0\)입니다. 이것이 조건부기댓값의 적분 특성입니다. 역으로 그 특성을 갖는 \(m\)이면 단순함수에 직교하고, 임의 \(h\in L^2(\mathcal G)\)의 절단·단순함수 근사에 Cauchy–Schwarz를 적용하여 \(E[(Y-m)h]=0\)을 얻습니다. 두 후보의 차이는 공간 안에 있으면서 그 공간에 직교하여 노름 0입니다.
\(Y-h=(Y-m)+(m-h)\)의 교차항이 0이므로 제곱노름 항등식이 성립합니다. \(h=0\)이면 축소성입니다. \(\mathcal G\subseteq\mathcal H\)일 때 \(Y-P_{\mathcal H}Y\)는 더 작은 공간에도 직교합니다. 따라서 \(P_{\mathcal G}P_{\mathcal H}Y=P_{\mathcal G}Y\)입니다. 상수도 공간 안에 있으므로 \(Em=EY\). 중심화한 분해 \(Y-EY=(m-EY)+(Y-m)\)에 피타고라스를 적용하고 조건부 적분의 전체 평균을 취하면 분산분해를 얻습니다. ∎
정리 3. Gaussian 아핀 정의와 특이 조건부 공식#
\(AA^T=BB^T\)이면 표준정규벡터의 아핀상 \(\mu+AZ\), \(\mu+BW\)는 같은 분포입니다. 결합정규 \((U,V)\)의 공분산을 블록으로 쓰고 \(S=\Sigma_{VV}\)라 하면 임의의 \(SGS=S\)인 일반화역에
평균은 지지 위에서, 분산은 행렬로서 일반화역 선택과 무관합니다.
증명. 영 열을 붙여 \(A,B\)의 열 수를 같게 합니다. \(A^Tv\mapsto B^Tv\)는 노름과 내적을 보존하며, \(A^Tv=0\)이면 \(\|B^Tv\|^2=v^TBB^Tv=0\)이므로 잘 정의됩니다. 정규직교 기저를 보충해 전체 직교사상으로 확장하면 \(B=AQ\)인 직교 \(Q\)가 존재합니다. 표준정규의 밀도는 \(\exp(-\|z\|^2/2)\)에 비례하며 직교변환의 Jacobian 절댓값은 1이므로 \(QZ\)와 \(Z\)의 분포가 같습니다. 따라서 정의는 인수에 무관합니다. 이 사실로 블록대각 공분산의 결합정규는 독립 표준정규 블록의 별도 변환으로 나타나므로 두 블록이 독립입니다.
전체 공분산을 \(CC^T\), 행 블록을 \(C_U,C_V\)로 쓰면 \(\operatorname{ran}\Sigma_{VU}\subseteq\operatorname{ran}C_V=\operatorname{ran}S\)입니다.
따라서 어떤 \(K\)에 \(\Sigma_{UV}=KS\)입니다. \(SGS=S\)에서 \(\Sigma_{UV}GS=\Sigma_{UV}\)를 얻습니다. 중심화한 잔차 \(R=U-\mu_U-\Sigma_{UV}G(V-\mu_V)\)는 \(V\)와 공분산이 0이고 결합정규라 독립입니다. 전개하면 \(\operatorname{Var}R=\Sigma_{UU}-\Sigma_{UV}G\Sigma_{VU}\)입니다.
특히 \(KSGSK^T=KSK^T\)를 써서 마지막 양이 대칭이며 \(G\)에 무관함도 확인합니다. \(V-\mu_V=Sw\) a.s.이므로 \(KSG(V-\mu_V)=KSGSw=KSw\)도 \(G\)에 무관합니다. \(R\)의 평균 0과 독립성으로 두 조건부 공식을 얻습니다. ∎
정리 4. 모집단 FWL과 표본의 일치성#
6절에서 \(E[\widetilde V\widetilde V^T]\succ0\)이면 부분화 계수는 전체 선형예측의 \(V\) 계수입니다. 7절의 iid·유한 이차적률·\(Q\succ0\) 조건이면 OLS는 모집단 선형예측 계수로 확률수렴합니다.
증명. \(V=P_WV+\widetilde V\)이고 잔차 성분 각각은 \(W\) 공간에 직교합니다. 따라서 전체 설명공간은 \(\operatorname{span}W\oplus\operatorname{span}\widetilde V\)의 직교직합입니다. \(Y\)의 두 번째 성분을 예측할 때 최소화하는 제곱노름은 \(E[(\widetilde Y-\widetilde V^Tb)^2]\)이고, 전개한 이차식의 정규방정식이 6절의 식입니다. Gram의 PD로 해가 유일합니다. 원래 \(V\)로 표현해도 \(P_WV\) 부분만 첫 공간에 흡수되므로 \(b\)는 같습니다.
표본에서 대수법칙으로 \(Q_n\to_pQ\), \(c_n\to_pc\)입니다. \(\|Q_n-Q\|<\lambda_{\min}(Q)/2\)이면 \(Q_n\succ0\)이고 \(\|Q_n^{-1}\|\le2/\lambda_{\min}(Q)\). 이 사건의 확률은 1로 갑니다. 항등식 \(Q_n^{-1}-Q^{-1}=Q_n^{-1}(Q-Q_n)Q^{-1}\)로 역행렬도 수렴합니다. 따라서 \(Q_n^{-1}c_n\to_pQ^{-1}c\). 표본 계수결핍 사건에서 정한 최소노름 해는 그 사건 확률이 0으로 가므로 결론에 영향을 주지 않습니다. ∎
보조정리 5. 확률차수의 곱 규칙#
증명. \(U_n=O_p(1),V_n=O_p(1)\)이면 각각을 \(M_1,M_2\)로 제한하는 사건 밖의 확률을 \(\epsilon/2\)씩 만들 수 있습니다. 그 교집합에서 \(\|U_nV_n\|\le M_1M_2\)이므로 곱도 확률적으로 유계입니다. \(U_n=o_p(1)\)이면 먼저 \(V_n\)의 한계 \(M\)을 고르고 \(P(\|U_nV_n\|>\eta)\le P(\|V_n\|>M)+P(\|U_n\|>\eta/M)\)를 씁니다. 첫 항을 임의로 작게 만든 뒤 둘째 항을 0으로 보내면 곱이 \(o_p(1)\)입니다. 일반 \(a_n,b_n>0\)는 나눈 변수에 적용합니다. ∎
앞에서 한 계산 |
수학적 대상 |
|---|---|
같은 관측을 가진 상태끼리 평균 |
\(L^2(\sigma(X))\) 위 사영 |
하나의 직선으로 전체를 예측 |
\(\operatorname{span}\{1,X\}\) 위 사영 |
관측한 표본의 제곱오차 최소화 |
경험적 내적에서의 표본 사영 |
선형식 때문에 남는 추가 오차 |
중첩 사영 사이의 제곱거리 |
확률 1로 같은 관측량 |
\(L^2\)에서 같은 원소 |
모집단의 최적 선형예측과 한 표본의 최소제곱은 같은 사영 구조를 다른 내적에서 사용합니다. 다음 장에서는 고정된 자료의 회귀를 사영으로 계산하고, 변수나 관측을 제거했을 때의 변화를 추적합니다. E1로 이어 읽기.