I2 · 완비성이 예측을 존재하게 한다#
정보가 늘어나면 무엇을 더 정확하게 예측하는가#
다음 분기의 수요 \(Y\)가 네 경제상태에서 각각 \(1,3,2,6\)백만 단위가 된다고 하자. 상태의 확률은 모두 \(1/4\)입니다. 처음에는 아무 정보가 없어서 상수 \(a\)로 예측합니다. 제곱오차를 최소화하면
이제 조사보고서가 첫 두 상태인지 뒤 두 상태인지를 알려 줍니다. 이 정보를 \(\mathcal G\)라 쓰겠습니다. 보고서만으로 가능한 예측은 \((a,a,b,b)\) 형태입니다. 앞쪽 두 상태의 오차합을 완전제곱하면
뒤쪽은 \((2-b)^2+(6-b)^2=2(b-4)^2+8\)입니다. 최적 예측은 \(Z=(2,2,4,4)\)이고 잔차 \(Y-Z=(-1,1,-2,2)\)입니다. 각 정보집단에서 잔차 평균은 0입니다. 전체 분산은
따라서 \(7/2=1+5/2\)로 나뉩니다. 이 계산이 조건부기댓값과 직교사영입니다. 상태가 무한히 많아져도 이런 최적 예측이 존재하는지 묻는 것이 이번 장의 출발점입니다.
그림 164 각 상태는 확률 \(1/4\)다. 가로축은 연속 시간이나 수요 순서가 아닌 상태 번호다. 세로축은 수요이며 같은 정보집단에서는 같은 예측을 사용한다. 정보집단 안에서 위아래 잔차가 상쇄된다.#
\(L^2(\Omega,\mathcal F,P)\)는 \(E|Y|^2<\infty\)인 확률변수를 거의 확실히 같은 것끼리 묶은 공간입니다. 영확률집합에서 다른 두 함수는 같은 원소입니다. 복소수까지 허용하면 내적은 \(\langle X,Y\rangle=E[X\overline Y]\)로 첫 인수 선형입니다. \(\mathcal G\)-가측인 원소들의 공간 \(L^2(\mathcal G)\)는 닫힌 부분공간입니다. 뒤에서 완비성, 닫힘, 사영의 존재를 각각 증명하여 E0에서 전제로 사용한 존재성을 채웁니다.
최근접점은 왜 극한 안에 남는가#
닫힌 볼록집합 \(C\)에서 \(x\)에 가장 가까운 점을 찾자. \(d=\inf_{c\in C}\|x-c\|\)에 접근하는 \(c_n\)을 고릅니다. 중점이 \(C\)에 있으므로 평행사변형 항등식이
를 줍니다. 오른쪽이 0으로 가므로 최소화열은 Cauchy입니다. 여기서 완비성을 사용하여 극한을 얻고, 닫힘을 사용하여 그 극한이 \(C\)에 있음을 얻습니다. 두 가정이 서로 다른 일을 합니다.
부분공간 \(M\)에서는 최소점 \(p\)에서 임의의 방향 \(h\in M\)으로 움직일 수 있습니다. \(\|x-p-th\|^2\)의 \(t=0\) 미분이 0이어야 하므로 \(x-p\perp M\). 복소 공간에서는 \(h\)와 \(ih\)를 모두 사용하여 실수부와 허수부를 없앱니다. 결과는 \(x=P_Mx+(I-P_M)x\)라는 직교분해입니다.
완비성을 빼면 닫힌 볼록집합도 최소점을 잃습니다. \(C[0,1]\)에 \(L^2\) 노름을 주고 \(s(t)=1\) for \(t<1/2\), \(s(t)=-1\) for \(t>1/2\)라 두겠습니다. 집합
은 이 공간에서 닫히고 볼록합니다. Cauchy–Schwarz로 \(\|f\|_2\ge1\). \(s\)를 연속 직선 경사로 근사한 \(g_n\)을 \(\int g_ns\)로 나누면 \(C\)에 속하고 노름은 1로 갑니다. 하지만 등호는 \(f=s\) 거의 모든 곳을 요구하므로 연속함수 안에서는 달성되지 않습니다. 거리의 하한 1은 존재하지만 최근접점은 없습니다.
사영에서 조건부기댓값으로, 다시 적분가능 변수로#
\(Z=P_{L^2(\mathcal G)}Y\)이면 모든 \(A\in\mathcal G\)에 대해 \(1_A\in L^2(\mathcal G)\)이므로
이 적분 항등식과 \(\mathcal G\)-가측성이 조건부기댓값의 정의입니다. 반대로 두 적분가능 \(\mathcal G\)-가측 변수 \(Z,Z'\)가 이 항등식을 만족하면 \(A=\{Z>Z'\}\)와 그 반대 집합을 대입하여 같음을 얻습니다. 유일성은 거의 확실한 의미입니다.
\(\mathcal H\subset\mathcal G\)이면 \(E[E(Y\mid\mathcal G)\mid\mathcal H]=E(Y\mid\mathcal H)\)입니다. 네 상태 예에서 집단별 평균 \((2,2,4,4)\)를 다시 전체 평균 내면 3으로 돌아갑니다. 정보가 늘어날 때 오차제곱은 감소하며, 감소한 양은 두 예측 사이 거리의 제곱입니다.
조건부기댓값은 \(L^1\)에서도 존재하지만 제곱거리 최소화로 정의할 수 없는 경우가 있습니다. \(Y\ge0\)일 때 사영 \(Z\)가 음수인 집합 \(A=\{Z<0\}\)을 대입하면 \(E[Z1_A]=E[Y1_A]\ge0\)이므로 그 집합은 영확률입니다. 따라서 사영은 양성을 보존합니다. \(-|Y|\le Y\le|Y|\)에서
\(Y\in L^1\)을 \(Y_n=\max(-n,\min(Y,n))\in L^2\)로 절단합니다. \(Y_n\to Y\) in \(L^1\)이고 위 축소성 때문에 조건부 평균도 \(L^1\) Cauchy입니다. \(L^1\) 완비성으로 극한을 얻으며, 적분 항등식을 넘기면 \(E(Y\mid\mathcal G)\)가 됩니다. \(L^1\) 완비성은 뒤의 \(L^2\) 증명에서 노름과 적분의 지수를 1로 바꾸면 같은 절대합 논증으로 성립합니다. 이는 유계선형사상의 조밀부분공간 연장, 즉 BLT 원리의 구체적 사용입니다.
적분측도 \(A\mapsto E[Y1_A]\)를 \(\mathcal G\) 위에 제한하면 그 Radon–Nikodym 밀도가 같은 조건부기댓값입니다. Radon–Nikodym 정리 자체는 측도론의 외부 전제로 소개하며, 여기서의 존재 증명은 이미 절단과 완비성으로 끝났습니다. 유한 실수값 볼록함수 \(\varphi\)와 적분가능한 \(\varphi(Y)\)에 대해 조건부 Jensen 부등식 \(\varphi(E[Y\mid\mathcal G])\le E[\varphi(Y)\mid\mathcal G]\)도 성립합니다. 지지직선 \(aY+b\le\varphi(Y)\)에 양성·선형성을 적용하고 유리수 위치에서 잡은 가산 지지직선의 supremum을 취하면 됩니다. 유한 볼록함수의 연속성과 양쪽 도함수 사이 지지기울기로 이 가산 supremum이 원함수를 복원합니다.
\(Y=XW\)에서 \(X=\pm1\)은 독립이고 \(W=R-ER\), \(P(R>t)=t^{-3/2}\) for \(t\ge1\)라 합시다. \(E|Y|<\infty\)지만 \(EY^2=\infty\), \(E[Y\mid X]=0\)입니다. 임의의 유한 계수 \(b\)에 \(E(Y-bX)^2=E(W-b)^2=\infty\)라서 유한한 제곱손실 문제는 없습니다. 그렇다고 표본 OLS가 반드시 불일치하는 것은 아닙니다. 절편 없는 OLS는 \(\widehat b=n^{-1}\sum W_i\)이고 \(EW=0\), \(E|W|<\infty\)이므로 외부 전제인 대수의 법칙 아래 0으로 수렴합니다. 유한분산 가정의 실패와 일치성의 실패를 구분해야 합니다.
정보집합의 극한과 무한 과거#
증가하는 닫힌 부분공간 \(M_n\)의 사영 \(P_nx\)를 생각해 봅시다. \(m\ge n\)일 때
오른쪽 노름제곱은 \(\|x\|^2\) 아래에서 증가하므로 사영열은 Cauchy입니다. 극한은 \(\overline{\bigcup M_n}\) 위 사영입니다. 감소하는 부분공간에서도 같은 차분 항등식의 순서를 바꾸면 \(P_nx\to P_{\cap M_n}x\)를 얻습니다. 이는 뒤의 Wold 분해에서 무한히 먼 과거를 떼어내는 핵심입니다.
\(\mathcal G_n\uparrow\mathcal G_\infty=\sigma(\bigcup\mathcal G_n)\)이면 \(E[Y\mid\mathcal G_n]\to E[Y\mid\mathcal G_\infty]\) in \(L^2\) for \(Y\in L^2\). 필요한 닫힌 합집합이 \(L^2(\mathcal G_\infty)\)인 이유는 다음과 같습니다. 그 안에 들어가는 지시함수들의 사건은 단조수렴에 닫혀 있고 \(\bigcup\mathcal G_n\)이라는 대수를 포함합니다. 측도론의 단조류 정리로 모든 \(\mathcal G_\infty\) 사건의 지시함수를 포함합니다.
단순함수의 조밀성으로 결론이 따릅니다. 고정된 \(Y\in L^1\)에서도 절단과 \(L^1\) 축소성으로 같은 \(L^1\) 수렴을 얻습니다. 일반 임의의 마팅게일에 대한 수렴과 구별해 봅시다. 후자에 필요한 균등적분가능성을 모든 조건부기댓값 열에 새로 요구하는 것은 아닙니다.
정상 시계열을 혁신으로 분해하기#
평균 0, 유한분산의 실수 공분산 정상 시계열 \(x_t\), \(t\in\mathbb Z\)를 다룹니다. \(H_t=\overline{\operatorname{span}\{x_s:s\le t\}}\)는 과거의 선형 정보공간입니다. 모든 과거의 가측함수 공간과 같다고 가정하지 않습니다. 혁신은
입니다. 따라서 \(\epsilon_t\)는 과거 \(H_{t-1}\)에 직교하고, 서로 다른 시점의 혁신은 무상관입니다. Gaussian 가정이 없으면 독립일 필요는 없습니다.
구체적으로 \(x_t=\frac12x_{t-1}+\epsilon_t\), \(E\epsilon_t^2=1\)인 인과적 정상 AR(1)은
꼬리의 분산은 \(\sum_{j>N}4^{-j}\to0\)이므로 급수는 \(L^2\) 수렴합니다. 현재 예측오차는 \(\epsilon_t\)이고 \(\operatorname{Var}(x_t)=\sum4^{-j}=4/3\)입니다. \(x_t\)에 독립 평균 0 영구성분 \(a\)를 더하면 매기 새로운 충격만으로는 전체를 설명하지 못합니다. 영구성분은 모든 먼 과거에 이미 들어 있습니다. 이것이 Wold 분해의 결정론적 성분입니다. 여기서 결정론적이라는 말은 값이 비확률적이라는 뜻이 아니라 무한 과거로 선형 예측가능하다는 뜻입니다.
그림 165 위는 AR(1)의 \(\psi_j=2^{-j}\), 아래는 \(x_t=\eta_t-\eta_{t-1}\)의 \(p\)개 과거를 사용한 예측오차 분산 \((p+2)/(p+1)\)이다. 아래의 극한은 1이며, 느린 감소를 폭발이나 지수적 조건수 증가로 해석하지 않는다.#
Wold 정리는 \(\sigma_\epsilon^2>0\)일 때
를 줍니다. \(d_t\)는 모든 혁신에 직교합니다. \(H_{-\infty}=\{0\}\)이면 순수 비결정론적입니다. 혁신분산이 0이면 \(H_t=H_{t-1}\)이고 전체 과정이 결정론적 성분이므로 \(\psi_0=1\)로 정규화한 양의 혁신 표현을 주장하지 않습니다.
주파수, 장기분산, 그리고 조건수#
자기공분산을 \(\gamma(h)=E[x_{t+h}x_t]\)로 둡니다. \(\sum_h|\gamma(h)|<\infty\)이면
따라서 장기분산은 \(\sum_h\gamma(h)=2\pi f(0)\)입니다. 실제로 \(S_n=\sum_{t=1}^nx_t\)에 대해
이며 절대합가능성이 지배수렴을 정당화합니다. 이 계산만으로 중심극한정리가 따라오는 것은 아닙니다. AR(1)에서는 \(f(\omega)=[2\pi|1-e^{-i\omega}/2|^2]^{-1}\), 장기분산은 4입니다. 반면 \(x_t=\eta_t-\eta_{t-1}\)이면 \(\gamma(0)=2\), \(\gamma(1)=\gamma(-1)=-1\), 나머지는 0이어서 장기분산은 0입니다. \(S_n=\eta_n-\eta_0\)가 망원합으로 줄어드는 것과 일치합니다.
그림 166 세로축은 \(2\pi f(\omega)\)여서 가로축 0에서 읽는 값이 장기분산이다. AR(1)은 4, 차분 백색잡음은 0이다. 두 과정의 혁신분산은 모두 1이므로 현재의 새 충격 크기와 장기 평균의 변동은 다르다.#
\(p\)개 연속 관측의 Toeplitz 공분산 \(\Gamma_p\)에 대해
\(0<c\le f\le C\)이면 Parseval로 고윳값이 \([2\pi c,2\pi C]\)에 있으므로 \(\kappa(\Gamma_p)\le C/c\)입니다. 고정된 안정·가역 ARMA에서 과거 길이를 늘린다는 이유만으로 조건수가 지수적으로 발산하지 않습니다. 차분 백색잡음의 \(\Gamma_p\)는 대각 2, 옆 대각 \(-1\)이며 고윳값은 \(2-2\cos(k\pi/(p+1))\). 따라서 조건수는 \(\cot^2(\pi/[2(p+1)])\), 즉 \(O(p^2)\)입니다.
일반 정상과정의 Herglotz 스펙트럼 측도 존재와 Kolmogorov–Szegő 예측공식은 외부 시계열 이론으로 소개합니다. 후자는 위 주파수 정규화에서 절대연속 부분의 밀도 \(f\)에 대해 \(\sigma_\epsilon^2=2\pi\exp\{(2\pi)^{-1}\int\log f\}\)입니다. 적분이 \(-\infty\)이면 혁신분산은 0입니다. 로그 적분이 유한하다고 순수 비결정론성이 자동으로 따라오지는 않습니다. 특이 스펙트럼 성분이 남을 수 있습니다. 또한 주파수 곱셈작용소의 스펙트럼은 점별 값의 집합이 아니라 본질적 치역입니다. 영측도 한 점의 밀도값을 바꾸어도 작용소는 같기 때문입니다.
Bartlett HAC도 주파수 0을 추정하지만 표본 제곱합 구조를 갖습니다. 분모 \(n\)의 표본 자기공분산과 Bartlett 가중치를 쓴 표준식은 E3의 창 제곱합으로 비음수입니다. 진동하는 자료라고 이 추정량이 음수가 된다고 주장할 수 없습니다. 다른 가중치나 서로 다른 분모를 쓰면 그 보장이 사라질 수 있습니다.
import numpy as np
from scipy.linalg import toeplitz
Y=np.array([1.,3,2,6]); Z=np.array([2.,2,4,4])
assert np.allclose(np.mean((Y-3)**2),3.5)
assert np.allclose(np.mean((Y-Z)**2)+np.mean((Z-3)**2),3.5)
for p in [2,8,32]:
G=toeplitz(np.r_[2.,-1.,np.zeros(p-2)])
g=np.r_[-1.,np.zeros(p-1)]
predvar=2-g@np.linalg.solve(G,g)
assert np.allclose(predvar,(p+2)/(p+1))
assert np.allclose(np.linalg.cond(G),1/np.tan(np.pi/(2*(p+1)))**2)
print('p, forecast variance, condition:',p,predvar,np.linalg.cond(G))
p, forecast variance, condition: 2 1.3333333333333335 2.999999999999999
p, forecast variance, condition: 8 1.1111111111111112 32.16343747752639
p, forecast variance, condition: 32 1.0303030303030305 440.68856038364817
rng=np.random.default_rng(422)
x=rng.normal(size=120); x=x-x.mean(); n=len(x); bandwidth=9
cov=np.array([x[h:]@x[:n-h]/n for h in range(bandwidth+1)])
hac=cov[0]+2*np.sum((1-np.arange(1,bandwidth+1)/(bandwidth+1))*cov[1:])
windows=np.convolve(x,np.ones(bandwidth+1),mode='full')
assert np.allclose(hac,windows@windows/(n*(bandwidth+1)))
assert hac>=0
print('Bartlett HAC:',hac)
Bartlett HAC: 0.48654394470733225
연습문제와 전체 풀이#
1. 사영의 직교성. 네 상태 예에서 모든 \(W=(a,a,b,b)\)에 잔차가 직교함을 보이고, \(E[Y\mid\mathcal G]\)와 전체 평균의 tower 성질을 검산하라.
풀이. \(E[(Y-Z)W]=(-a+a-2b+2b)/4=0\). \(EZ=(2+2+4+4)/4=3=EY\). 임의의 \(W\)에 \(E(Y-W)^2=E(Y-Z)^2+E(Z-W)^2\)이므로 최소예측이 유일합니다.
2. 계단함수와 닫힌집합. 위 \(C\subset C[0,1]\)의 거리 하한이 1이고 달성되지 않음을 자세히 확인하라.
풀이. \(\|s\|_2=1\)이고 \(1\le\langle f,s\rangle\le\|f\|_2\). \(s\)에 \(L^2\) 수렴하는 연속 \(g_n\)은 \(a_n=\langle g_n,s\rangle\to1\)이므로 충분히 큰 \(n\)에 \(f_n=g_n/a_n\in C\)이며 \(\|f_n\|_2\to1\). 노름 1의 해는 Cauchy–Schwarz 등호조건과 양의 내적으로 \(f=s\) a.e.여야 합니다. 연속 \(f\)는 왼쪽 열린 구간에서 1, 오른쪽에서 \(-1\)이어야 하므로 \(1/2\)에서 연속일 수 없습니다.
3. 서로 다른 두 분산. \(x_t=\eta_t-\eta_{t-1}\)의 한 시점 분산, 무한 과거 예측오차 분산, 장기분산을 구하라.
풀이. 한 시점 분산은 2입니다. \(p\)개 과거 공분산의 역행렬 첫 대각은 \(p/(p+1)\)이므로 예측오차 분산은 \(2-p/(p+1)\to1\). 역대각 값은 삼중대각 행렬의 행렬식 재귀 \(D_p=2D_{p-1}-D_{p-2}\), \(D_0=1,D_1=2\)에서 \(D_p=p+1\)을 얻고 여인수 \(D_{p-1}/D_p\)로 계산합니다. 장기분산은 \(2-1-1=0\). 세 값은 서로 다른 질문의 답입니다.
4. Beveridge–Nelson 분해의 가정. \(x_t=\sum_{j\ge0}\psi_j\epsilon_{t-j}\)이고 \(\sum j|\psi_j|<\infty\)라 합시다. 영구 반응과 일시 성분을 분리하라.
풀이. \(b_j=-\sum_{k>j}\psi_k\)라 두면 \(\sum|b_j|\le\sum k|\psi_k|<\infty\). \(b_0=\psi_0-\psi(1)\), \(b_j-b_{j-1}=\psi_j\)이므로 \(\psi(L)=\psi(1)+(1-L)b(L)\). \(z_t=\sum b_j\epsilon_{t-j}\)는 안정적인 \(L^2\) 과정이고 \(x_t=\psi(1)\epsilon_t+z_t-z_{t-1}\). 누적하면 \(\sum_{t=1}^nx_t=\psi(1)\sum_{t=1}^n\epsilon_t+z_n-z_0\). Wold의 제곱합가능성만으로 \(\psi(1)\)이나 \(\sum|b_j|\)의 유한성을 결론내릴 수 없습니다.
5. 정보를 늘리는 순서. \(\mathcal H\subset\mathcal G\)와 \(Y\in L^2\)에 예측오차 감소량을 구하라.
풀이. \(Y-E[Y\mid\mathcal H]=(Y-E[Y\mid\mathcal G])+(E[Y\mid\mathcal G]-E[Y\mid\mathcal H])\). 두 번째 항은 \(\mathcal G\)-가측이므로 첫 항과 직교합니다. 제곱노름을 취하면 감소량은 \(\|E[Y\mid\mathcal G]-E[Y\mid\mathcal H]\|_2^2\). 감소량 0이면 두 예측이 a.s. 같습니다. 정보집합의 엄격한 포함만으로 모든 \(Y\)의 오차가 엄격히 감소하는 것은 아닙니다.
6. 영구성분을 찾아내기. \(x_t=a+u_t\)에서 \(u_t\)는 평균 0 분산 1의 백색잡음이고 \(a\)는 평균 0 분산 \(\tau^2\)이며 모든 \(u_t\)에 직교한다고 하자.
풀이. \(N^{-1}\sum_{j=1}^Nx_{t-j}=a+N^{-1}\sum u_{t-j}\)이고 두 번째 항의 분산이 \(1/N\)이므로 \(a\in H_{t-1}\) for all \(t\). 따라서 \(u_s=x_s-a\)도 해당 과거공간에 있습니다. \(u_t\perp H_{t-1}\)라서 혁신은 \(u_t\), \(d_t=a\), \(\psi_0=1\), 나머지는 0입니다. 먼 과거 교집합에는 \(a\)만 남습니다. 실제로 \(\{a,u_s\}\)의 직교분해에서 각 유한 시점 \(u_s\)는 충분히 먼 과거와 직교이므로 교집합 원소의 그 계수는 모두 0입니다.
지금까지의 내용을 수학의 언어로 정리해 봅시다#
이 장의 핵심은 최적 예측의 식을 외우는 데 있지 않습니다. 극한을 담는 완비성, 정보를 나타내는 닫힌 부분공간, 직교성을 통해 존재와 유일성을 차례대로 얻습니다. 측도론의 Fatou·단조수렴·Fubini·단조류 정리와 단순함수의 조밀성은 명시한 출발 전제로 사용합니다.
정리 1 · \(L^2\) 완비성과 정보공간의 닫힘. \(L^2(\mathcal F)\)는 Hilbert 공간이고 \(L^2(\mathcal G)\)는 닫힌 부분공간입니다.
증명. Cauchy 열 \(X_n\)에서 \(\|X_{n_{j+1}}-X_{n_j}\|_2\le2^{-j}\)인 부분열을 뽑습니다. \(D_j=X_{n_{j+1}}-X_{n_j}\)라 합시다. 유한합의 삼각부등식과 Fatou로 \(E(\sum_j|D_j|)^2\le(\sum2^{-j})^2<\infty\). 따라서 절대급수가 거의 확실히 수렴하고 \(X=X_{n_1}+\sum D_j\)가 정의됩니다. 같은 논증을 꼬리에 적용하면 \(\|X-X_{n_k}\|_2\le\sum_{j\ge k}2^{-j}\to0\). Cauchy 성질과 삼각부등식으로 원래 전체 열도 \(X\)에 수렴합니다. 내적의 양정치성은 a.s. 동치류를 취했기 때문에 성립합니다.
모든 \(X_n\)이 \(\mathcal G\)-가측이면 위 부분열의 수렴집합은 \(\mathcal G\)에 속합니다. 그 집합에서 점별극한, 나머지에서 0으로 정의한 버전은 \(\mathcal G\)-가측입니다. 따라서 \(L^2\) 극한이 \(L^2(\mathcal G)\)에 남아 닫힙니다. \(\square\)
정리 2 · 사영과 Riesz 표현. Hilbert 공간의 비어 있지 않은 닫힌 볼록집합에는 각 점의 최근접점이 유일하게 존재합니다. 닫힌 부분공간 \(M\)에는 \(H=M\oplus M^\perp\). 모든 유계 선형범함수는 유일한 \(v\in H\)에 대해 \(f(x)=\langle x,v\rangle\)이며 \(\|f\|=\|v\|\)입니다.
증명. 본문의 평행사변형 계산으로 최소화열이 Cauchy입니다. 완비성과 닫힘으로 극한 \(p\in C\)가 있고 노름의 연속성으로 거리 \(d\)를 달성합니다. 두 최소점 \(p,q\)를 같은 식에 대입하면 \(\|p-q\|^2\le0\)이므로 유일합니다. 부분공간에서는 \(p+th\in M\) for all real \(t\). 이차식 최소의 일차항이 0이므로 \(\operatorname{Re}\langle x-p,h\rangle=0\). 복소수의 경우 \(ih\)도 넣어 완전한 직교성을 얻습니다. 역으로 직교한 \(x-p\)이면 피타고라스로 모든 \(m\in M\)에 \(\|x-m\|^2=\|x-p\|^2+\|p-m\|^2\)입니다.
\(f\ne0\)이면 닫힌 \(M=\ker f\)를 잡고 \(z\notin M\)의 분해 \(z=m+u\)를 구합니다. \(u\ne0\), \(f(u)\ne0\)이며 모든 \(x\)에 \(x-f(x)u/f(u)\in M\). 따라서 \(\langle x,u\rangle=f(x)\|u\|^2/f(u)\)이고 \(v=\overline{f(u)}u/\|u\|^2\)이면 첫 인수 선형 규약에서 \(\langle x,v\rangle=f(x)\). 영범함수는 \(v=0\). 두 표현벡터의 차이 \(w\)에 \(\langle x,w\rangle=0\) for all \(x\)를 적용하면 \(x=w\)에서 \(w=0\). Cauchy–Schwarz로 \(\|f\|\le\|v\|\), \(x=v/\|v\|\)로 등호입니다. \(\square\)
정리 3 · 조건부기댓값의 존재, 유일성, tower. 실수 \(Y\in L^1\)에는 유일한 a.s. \(\mathcal G\)-가측 \(Z\in L^1\)가 있어 모든 \(A\in\mathcal G\)에 \(E[Z1_A]=E[Y1_A]\)입니다. \(Y\in L^2\)이면 \(Z\)는 직교사영입니다.
증명. 정리 1·2가 \(L^2\) 사영을 줍니다. 지시함수와의 직교성으로 적분 항등식이 따릅니다. 양성과 \(L^1\) 축소성은 본문에서 음수집합과 \(\pm|Y|\)를 사용하여 증명했습니다. 절단 \(Y_n\)의 사영은 \(L^1\)에서 Cauchy이고 그 극한 \(Z\)는 부분열의 a.s. 극한으로 \(\mathcal G\)-가측 버전을 갖습니다. \(|E[(Z-Z_n)1_A]|\le\|Z-Z_n\|_1\)와 \(Y_n\)의 \(L^1\) 수렴으로 항등식을 넘깁니다. 두 후보의 차이 \(D\)는 모든 \(\mathcal G\) 사건에 적분이 0입니다. \(\{D>0\}\)에 적분하면 양의 부분이 0, \(\{D<0\}\)에서 음의 부분도 0이라 유일합니다.
\(\mathcal H\subset\mathcal G\)이면 \(A\in\mathcal H\)에 \(E[E[Z\mid\mathcal H]1_A]=E[Z1_A]=E[Y1_A]\). 유일성으로 tower가 성립합니다. 일반 복소변수는 실수부·허수부를 각각 처리합니다. \(\square\)
정리 4 · 단조 부분공간의 사영극한. 증가하는 닫힌 \(M_n\)에서는 \(P_{M_n}x\to P_{\overline{\cup M_n}}x\), 감소하는 경우에는 \(P_{M_n}x\to P_{\cap M_n}x\)입니다.
증명. 증가하는 경우 본문의 직교 차분 항등식으로 Cauchy이고 극한 \(p\)는 닫힌 합집합에 있습니다. 각 \(h\in M_j\)에 대해 \(n\ge j\)에서 \(\langle x-P_{M_n}x,h\rangle=0\). 극한과 조밀성으로 \(x-p\)는 닫힌 합집합 전체에 직교합니다. 정리 2로 원하는 사영입니다. 감소하는 경우 \(m\ge n\)이면 \(P_{M_m}P_{M_n}=P_{M_m}\)이고 \(\|P_{M_n}x-P_{M_m}x\|^2=\|P_{M_n}x\|^2-\|P_{M_m}x\|^2\). 노름제곱이 감소하여 수렴하므로 Cauchy입니다. 극한은 모든 닫힌 \(M_j\)에 있고 \(x-p\)는 교집합에 직교하므로 그 사영입니다. \(\square\)
정리 5 · Wold 분해. 평균 0의 실수 공분산 정상 양방향 시계열은 위 혁신·결정론적 분해를 가집니다. 양의 혁신분산일 때 계수는 \(\psi_j=E[x_t\epsilon_{t-j}]/\sigma_\epsilon^2\), \(\psi_0=1\)이며 제곱합가능합니다.
증명. 유한 선형결합을 한 시점 이동시키는 \(U(\sum a_jx_j)=\sum a_jx_{j+1}\)는 정상성으로 내적을 보존합니다. 영노름 표현도 영노름으로 보내므로 잘 정의되고, 전체 닫힌 span에 등거리로 연장됩니다. 역방향 이동도 존재하므로 unitary입니다. \(UH_t=H_{t+1}\)이고 사영은 이 등거리와 교환합니다. 따라서 \(U\epsilon_t=\epsilon_{t+1}\)이고 혁신분산과 표시한 계수는 시점에 무관합니다.
\(H_t=H_{t-1}\oplus\operatorname{span}(\epsilon_t)\)입니다. 오른쪽이 닫힌 이유는 직교하는 닫힌 공간과 유한차원 공간의 합이기 때문입니다. 이를 \(N+1\)회 반복하면
직교성으로 \(\sigma_\epsilon^2\sum_{j=0}^N\psi_j^2\le E x_t^2\). 정리 4의 감소형을 쓰면 첫 항은 \(P_{H_{-\infty}}x_t\)에 수렴하고 혁신급수는 \(L^2\) 수렴합니다. \(x_t=P_{H_{t-1}}x_t+\epsilon_t\)에서 \(E[x_t\epsilon_t]=\sigma_\epsilon^2\)라서 \(\psi_0=1\). 먼 과거 교집합은 모든 \(H_{s-1}\)에 포함되므로 모든 \(\epsilon_s\)에 직교합니다.
또한 \(U\)가 교집합을 보존하므로 결정론적 성분도 정상입니다. \(\sigma_\epsilon^2=0\)이면 모든 \(H_t=H_{t-1}\)이므로 \(x_t\in H_{-\infty}\)입니다. 정규화된 혁신 계수의 유일성은 각 직교 성분과 내적을 취해서, 결정론적 성분의 유일성은 사영에서 따릅니다. \(\square\)
Hilbert 공간의 사영은 조건부기댓값과 시계열의 혁신 분해를 같은 구조로 설명합니다. 다음 장에서는 관측 연산자를 거꾸로 풀 때 작은 특이방향 때문에 생기는 불안정성과 정칙화를 다룹니다. I3로 이어 읽기.