I2 · 완비성이 예측을 존재하게 한다#

정보가 늘어나면 무엇을 더 정확하게 예측하는가#

다음 분기의 수요 \(Y\)가 네 경제상태에서 각각 \(1,3,2,6\)백만 단위가 된다고 하자. 상태의 확률은 모두 \(1/4\)입니다. 처음에는 아무 정보가 없어서 상수 \(a\)로 예측합니다. 제곱오차를 최소화하면

\[ E(Y-a)^2=\frac14\{(1-a)^2+(3-a)^2+(2-a)^2+(6-a)^2\}, \qquad a=EY=3. \]

이제 조사보고서가 첫 두 상태인지 뒤 두 상태인지를 알려 줍니다. 이 정보를 \(\mathcal G\)라 쓰겠습니다. 보고서만으로 가능한 예측은 \((a,a,b,b)\) 형태입니다. 앞쪽 두 상태의 오차합을 완전제곱하면

\[ (1-a)^2+(3-a)^2=2(a-2)^2+2, \]

뒤쪽은 \((2-b)^2+(6-b)^2=2(b-4)^2+8\)입니다. 최적 예측은 \(Z=(2,2,4,4)\)이고 잔차 \(Y-Z=(-1,1,-2,2)\)입니다. 각 정보집단에서 잔차 평균은 0입니다. 전체 분산은

\[ E(Y-3)^2=\frac{4+0+1+9}{4}=\frac72, \quad E(Z-3)^2=1,\quad E(Y-Z)^2=\frac52, \]

따라서 \(7/2=1+5/2\)로 나뉩니다. 이 계산이 조건부기댓값과 직교사영입니다. 상태가 무한히 많아져도 이런 최적 예측이 존재하는지 묻는 것이 이번 장의 출발점입니다.

네 상태의 실제 수요 1 3 2 6과 정보집단별 예측 2 2 4 4, 무정보 예측 3을 비교한 그림

그림 164 각 상태는 확률 \(1/4\)다. 가로축은 연속 시간이나 수요 순서가 아닌 상태 번호다. 세로축은 수요이며 같은 정보집단에서는 같은 예측을 사용한다. 정보집단 안에서 위아래 잔차가 상쇄된다.#

\(L^2(\Omega,\mathcal F,P)\)\(E|Y|^2<\infty\)인 확률변수를 거의 확실히 같은 것끼리 묶은 공간입니다. 영확률집합에서 다른 두 함수는 같은 원소입니다. 복소수까지 허용하면 내적은 \(\langle X,Y\rangle=E[X\overline Y]\)첫 인수 선형입니다. \(\mathcal G\)-가측인 원소들의 공간 \(L^2(\mathcal G)\)는 닫힌 부분공간입니다. 뒤에서 완비성, 닫힘, 사영의 존재를 각각 증명하여 E0에서 전제로 사용한 존재성을 채웁니다.

최근접점은 왜 극한 안에 남는가#

닫힌 볼록집합 \(C\)에서 \(x\)에 가장 가까운 점을 찾자. \(d=\inf_{c\in C}\|x-c\|\)에 접근하는 \(c_n\)을 고릅니다. 중점이 \(C\)에 있으므로 평행사변형 항등식이

\[ \|c_n-c_m\|^2 =2\|x-c_n\|^2+2\|x-c_m\|^2 -4\left\|x-\frac{c_n+c_m}{2}\right\|^2 \le2\|x-c_n\|^2+2\|x-c_m\|^2-4d^2 \]

를 줍니다. 오른쪽이 0으로 가므로 최소화열은 Cauchy입니다. 여기서 완비성을 사용하여 극한을 얻고, 닫힘을 사용하여 그 극한이 \(C\)에 있음을 얻습니다. 두 가정이 서로 다른 일을 합니다.

부분공간 \(M\)에서는 최소점 \(p\)에서 임의의 방향 \(h\in M\)으로 움직일 수 있습니다. \(\|x-p-th\|^2\)\(t=0\) 미분이 0이어야 하므로 \(x-p\perp M\). 복소 공간에서는 \(h\)\(ih\)를 모두 사용하여 실수부와 허수부를 없앱니다. 결과는 \(x=P_Mx+(I-P_M)x\)라는 직교분해입니다.

완비성을 빼면 닫힌 볼록집합도 최소점을 잃습니다. \(C[0,1]\)\(L^2\) 노름을 주고 \(s(t)=1\) for \(t<1/2\), \(s(t)=-1\) for \(t>1/2\)라 두겠습니다. 집합

\[ C=\left\{f\in C[0,1]:\int_0^1 f(t)s(t)\,dt\ge1\right\} \]

은 이 공간에서 닫히고 볼록합니다. Cauchy–Schwarz로 \(\|f\|_2\ge1\). \(s\)를 연속 직선 경사로 근사한 \(g_n\)\(\int g_ns\)로 나누면 \(C\)에 속하고 노름은 1로 갑니다. 하지만 등호는 \(f=s\) 거의 모든 곳을 요구하므로 연속함수 안에서는 달성되지 않습니다. 거리의 하한 1은 존재하지만 최근접점은 없습니다.

사영에서 조건부기댓값으로, 다시 적분가능 변수로#

\(Z=P_{L^2(\mathcal G)}Y\)이면 모든 \(A\in\mathcal G\)에 대해 \(1_A\in L^2(\mathcal G)\)이므로

\[ E[(Y-Z)1_A]=0. \]

이 적분 항등식과 \(\mathcal G\)-가측성이 조건부기댓값의 정의입니다. 반대로 두 적분가능 \(\mathcal G\)-가측 변수 \(Z,Z'\)가 이 항등식을 만족하면 \(A=\{Z>Z'\}\)와 그 반대 집합을 대입하여 같음을 얻습니다. 유일성은 거의 확실한 의미입니다.

\(\mathcal H\subset\mathcal G\)이면 \(E[E(Y\mid\mathcal G)\mid\mathcal H]=E(Y\mid\mathcal H)\)입니다. 네 상태 예에서 집단별 평균 \((2,2,4,4)\)를 다시 전체 평균 내면 3으로 돌아갑니다. 정보가 늘어날 때 오차제곱은 감소하며, 감소한 양은 두 예측 사이 거리의 제곱입니다.

조건부기댓값은 \(L^1\)에서도 존재하지만 제곱거리 최소화로 정의할 수 없는 경우가 있습니다. \(Y\ge0\)일 때 사영 \(Z\)가 음수인 집합 \(A=\{Z<0\}\)을 대입하면 \(E[Z1_A]=E[Y1_A]\ge0\)이므로 그 집합은 영확률입니다. 따라서 사영은 양성을 보존합니다. \(-|Y|\le Y\le|Y|\)에서

\[ |E(Y\mid\mathcal G)|\le E(|Y|\mid\mathcal G),\qquad \|E(Y\mid\mathcal G)\|_1\le\|Y\|_1. \]

\(Y\in L^1\)\(Y_n=\max(-n,\min(Y,n))\in L^2\)로 절단합니다. \(Y_n\to Y\) in \(L^1\)이고 위 축소성 때문에 조건부 평균도 \(L^1\) Cauchy입니다. \(L^1\) 완비성으로 극한을 얻으며, 적분 항등식을 넘기면 \(E(Y\mid\mathcal G)\)가 됩니다. \(L^1\) 완비성은 뒤의 \(L^2\) 증명에서 노름과 적분의 지수를 1로 바꾸면 같은 절대합 논증으로 성립합니다. 이는 유계선형사상의 조밀부분공간 연장, 즉 BLT 원리의 구체적 사용입니다.

적분측도 \(A\mapsto E[Y1_A]\)\(\mathcal G\) 위에 제한하면 그 Radon–Nikodym 밀도가 같은 조건부기댓값입니다. Radon–Nikodym 정리 자체는 측도론의 외부 전제로 소개하며, 여기서의 존재 증명은 이미 절단과 완비성으로 끝났습니다. 유한 실수값 볼록함수 \(\varphi\)와 적분가능한 \(\varphi(Y)\)에 대해 조건부 Jensen 부등식 \(\varphi(E[Y\mid\mathcal G])\le E[\varphi(Y)\mid\mathcal G]\)도 성립합니다. 지지직선 \(aY+b\le\varphi(Y)\)에 양성·선형성을 적용하고 유리수 위치에서 잡은 가산 지지직선의 supremum을 취하면 됩니다. 유한 볼록함수의 연속성과 양쪽 도함수 사이 지지기울기로 이 가산 supremum이 원함수를 복원합니다.

\(Y=XW\)에서 \(X=\pm1\)은 독립이고 \(W=R-ER\), \(P(R>t)=t^{-3/2}\) for \(t\ge1\)라 합시다. \(E|Y|<\infty\)지만 \(EY^2=\infty\), \(E[Y\mid X]=0\)입니다. 임의의 유한 계수 \(b\)\(E(Y-bX)^2=E(W-b)^2=\infty\)라서 유한한 제곱손실 문제는 없습니다. 그렇다고 표본 OLS가 반드시 불일치하는 것은 아닙니다. 절편 없는 OLS는 \(\widehat b=n^{-1}\sum W_i\)이고 \(EW=0\), \(E|W|<\infty\)이므로 외부 전제인 대수의 법칙 아래 0으로 수렴합니다. 유한분산 가정의 실패와 일치성의 실패를 구분해야 합니다.

정보집합의 극한과 무한 과거#

증가하는 닫힌 부분공간 \(M_n\)의 사영 \(P_nx\)를 생각해 봅시다. \(m\ge n\)일 때

\[ \|P_mx-P_nx\|^2=\|P_mx\|^2-\|P_nx\|^2. \]

오른쪽 노름제곱은 \(\|x\|^2\) 아래에서 증가하므로 사영열은 Cauchy입니다. 극한은 \(\overline{\bigcup M_n}\) 위 사영입니다. 감소하는 부분공간에서도 같은 차분 항등식의 순서를 바꾸면 \(P_nx\to P_{\cap M_n}x\)를 얻습니다. 이는 뒤의 Wold 분해에서 무한히 먼 과거를 떼어내는 핵심입니다.

\(\mathcal G_n\uparrow\mathcal G_\infty=\sigma(\bigcup\mathcal G_n)\)이면 \(E[Y\mid\mathcal G_n]\to E[Y\mid\mathcal G_\infty]\) in \(L^2\) for \(Y\in L^2\). 필요한 닫힌 합집합이 \(L^2(\mathcal G_\infty)\)인 이유는 다음과 같습니다. 그 안에 들어가는 지시함수들의 사건은 단조수렴에 닫혀 있고 \(\bigcup\mathcal G_n\)이라는 대수를 포함합니다. 측도론의 단조류 정리로 모든 \(\mathcal G_\infty\) 사건의 지시함수를 포함합니다.

단순함수의 조밀성으로 결론이 따릅니다. 고정된 \(Y\in L^1\)에서도 절단과 \(L^1\) 축소성으로 같은 \(L^1\) 수렴을 얻습니다. 일반 임의의 마팅게일에 대한 수렴과 구별해 봅시다. 후자에 필요한 균등적분가능성을 모든 조건부기댓값 열에 새로 요구하는 것은 아닙니다.

정상 시계열을 혁신으로 분해하기#

평균 0, 유한분산의 실수 공분산 정상 시계열 \(x_t\), \(t\in\mathbb Z\)를 다룹니다. \(H_t=\overline{\operatorname{span}\{x_s:s\le t\}}\)는 과거의 선형 정보공간입니다. 모든 과거의 가측함수 공간과 같다고 가정하지 않습니다. 혁신은

\[ \epsilon_t=x_t-P_{H_{t-1}}x_t \]

입니다. 따라서 \(\epsilon_t\)는 과거 \(H_{t-1}\)에 직교하고, 서로 다른 시점의 혁신은 무상관입니다. Gaussian 가정이 없으면 독립일 필요는 없습니다.

구체적으로 \(x_t=\frac12x_{t-1}+\epsilon_t\), \(E\epsilon_t^2=1\)인 인과적 정상 AR(1)은

\[ x_t=\epsilon_t+\tfrac12\epsilon_{t-1}+\tfrac14\epsilon_{t-2}+\cdots. \]

꼬리의 분산은 \(\sum_{j>N}4^{-j}\to0\)이므로 급수는 \(L^2\) 수렴합니다. 현재 예측오차는 \(\epsilon_t\)이고 \(\operatorname{Var}(x_t)=\sum4^{-j}=4/3\)입니다. \(x_t\)에 독립 평균 0 영구성분 \(a\)를 더하면 매기 새로운 충격만으로는 전체를 설명하지 못합니다. 영구성분은 모든 먼 과거에 이미 들어 있습니다. 이것이 Wold 분해의 결정론적 성분입니다. 여기서 결정론적이라는 말은 값이 비확률적이라는 뜻이 아니라 무한 과거로 선형 예측가능하다는 뜻입니다.

AR1의 기하급수 충격계수와 차분 백색잡음의 유한 과거 예측오차 분산을 각각 그린 두 패널

그림 165 위는 AR(1)의 \(\psi_j=2^{-j}\), 아래는 \(x_t=\eta_t-\eta_{t-1}\)\(p\)개 과거를 사용한 예측오차 분산 \((p+2)/(p+1)\)이다. 아래의 극한은 1이며, 느린 감소를 폭발이나 지수적 조건수 증가로 해석하지 않는다.#

Wold 정리는 \(\sigma_\epsilon^2>0\)일 때

\[ x_t=d_t+\sum_{j=0}^\infty\psi_j\epsilon_{t-j},\quad \psi_0=1,\quad\sum\psi_j^2<\infty, \quad d_t=P_{H_{-\infty}}x_t, \quad H_{-\infty}=\bigcap_{s\in\mathbb Z}H_s \]

를 줍니다. \(d_t\)는 모든 혁신에 직교합니다. \(H_{-\infty}=\{0\}\)이면 순수 비결정론적입니다. 혁신분산이 0이면 \(H_t=H_{t-1}\)이고 전체 과정이 결정론적 성분이므로 \(\psi_0=1\)로 정규화한 양의 혁신 표현을 주장하지 않습니다.

주파수, 장기분산, 그리고 조건수#

자기공분산을 \(\gamma(h)=E[x_{t+h}x_t]\)로 둡니다. \(\sum_h|\gamma(h)|<\infty\)이면

\[ f(\omega)=\frac1{2\pi}\sum_{h\in\mathbb Z}\gamma(h)e^{-ih\omega},\quad \gamma(h)=\int_{-\pi}^{\pi}e^{ih\omega}f(\omega)\,d\omega. \]

따라서 장기분산은 \(\sum_h\gamma(h)=2\pi f(0)\)입니다. 실제로 \(S_n=\sum_{t=1}^nx_t\)에 대해

\[ \frac{\operatorname{Var}(S_n)}n =\sum_{|h|<n}(1-|h|/n)\gamma(h)\longrightarrow\sum_h\gamma(h) \]

이며 절대합가능성이 지배수렴을 정당화합니다. 이 계산만으로 중심극한정리가 따라오는 것은 아닙니다. AR(1)에서는 \(f(\omega)=[2\pi|1-e^{-i\omega}/2|^2]^{-1}\), 장기분산은 4입니다. 반면 \(x_t=\eta_t-\eta_{t-1}\)이면 \(\gamma(0)=2\), \(\gamma(1)=\gamma(-1)=-1\), 나머지는 0이어서 장기분산은 0입니다. \(S_n=\eta_n-\eta_0\)가 망원합으로 줄어드는 것과 일치합니다.

주파수 0에서 높은 AR1 스펙트럼과 0이 되는 차분 백색잡음 스펙트럼 비교

그림 166 세로축은 \(2\pi f(\omega)\)여서 가로축 0에서 읽는 값이 장기분산이다. AR(1)은 4, 차분 백색잡음은 0이다. 두 과정의 혁신분산은 모두 1이므로 현재의 새 충격 크기와 장기 평균의 변동은 다르다.#

\(p\)개 연속 관측의 Toeplitz 공분산 \(\Gamma_p\)에 대해

\[ a^T\Gamma_pa=\int_{-\pi}^{\pi}f(\omega)\left|\sum_{j=1}^pa_je^{ij\omega}\right|^2d\omega. \]

\(0<c\le f\le C\)이면 Parseval로 고윳값이 \([2\pi c,2\pi C]\)에 있으므로 \(\kappa(\Gamma_p)\le C/c\)입니다. 고정된 안정·가역 ARMA에서 과거 길이를 늘린다는 이유만으로 조건수가 지수적으로 발산하지 않습니다. 차분 백색잡음의 \(\Gamma_p\)는 대각 2, 옆 대각 \(-1\)이며 고윳값은 \(2-2\cos(k\pi/(p+1))\). 따라서 조건수는 \(\cot^2(\pi/[2(p+1)])\), 즉 \(O(p^2)\)입니다.

일반 정상과정의 Herglotz 스펙트럼 측도 존재와 Kolmogorov–Szegő 예측공식은 외부 시계열 이론으로 소개합니다. 후자는 위 주파수 정규화에서 절대연속 부분의 밀도 \(f\)에 대해 \(\sigma_\epsilon^2=2\pi\exp\{(2\pi)^{-1}\int\log f\}\)입니다. 적분이 \(-\infty\)이면 혁신분산은 0입니다. 로그 적분이 유한하다고 순수 비결정론성이 자동으로 따라오지는 않습니다. 특이 스펙트럼 성분이 남을 수 있습니다. 또한 주파수 곱셈작용소의 스펙트럼은 점별 값의 집합이 아니라 본질적 치역입니다. 영측도 한 점의 밀도값을 바꾸어도 작용소는 같기 때문입니다.

Bartlett HAC도 주파수 0을 추정하지만 표본 제곱합 구조를 갖습니다. 분모 \(n\)의 표본 자기공분산과 Bartlett 가중치를 쓴 표준식은 E3의 창 제곱합으로 비음수입니다. 진동하는 자료라고 이 추정량이 음수가 된다고 주장할 수 없습니다. 다른 가중치나 서로 다른 분모를 쓰면 그 보장이 사라질 수 있습니다.

import numpy as np
from scipy.linalg import toeplitz
Y=np.array([1.,3,2,6]); Z=np.array([2.,2,4,4])
assert np.allclose(np.mean((Y-3)**2),3.5)
assert np.allclose(np.mean((Y-Z)**2)+np.mean((Z-3)**2),3.5)
for p in [2,8,32]:
    G=toeplitz(np.r_[2.,-1.,np.zeros(p-2)])
    g=np.r_[-1.,np.zeros(p-1)]
    predvar=2-g@np.linalg.solve(G,g)
    assert np.allclose(predvar,(p+2)/(p+1))
    assert np.allclose(np.linalg.cond(G),1/np.tan(np.pi/(2*(p+1)))**2)
    print('p, forecast variance, condition:',p,predvar,np.linalg.cond(G))
p, forecast variance, condition: 2 1.3333333333333335 2.999999999999999
p, forecast variance, condition: 8 1.1111111111111112 32.16343747752639
p, forecast variance, condition: 32 1.0303030303030305 440.68856038364817
rng=np.random.default_rng(422)
x=rng.normal(size=120); x=x-x.mean(); n=len(x); bandwidth=9
cov=np.array([x[h:]@x[:n-h]/n for h in range(bandwidth+1)])
hac=cov[0]+2*np.sum((1-np.arange(1,bandwidth+1)/(bandwidth+1))*cov[1:])
windows=np.convolve(x,np.ones(bandwidth+1),mode='full')
assert np.allclose(hac,windows@windows/(n*(bandwidth+1)))
assert hac>=0
print('Bartlett HAC:',hac)
Bartlett HAC: 0.48654394470733225

연습문제와 전체 풀이#

1. 사영의 직교성. 네 상태 예에서 모든 \(W=(a,a,b,b)\)에 잔차가 직교함을 보이고, \(E[Y\mid\mathcal G]\)와 전체 평균의 tower 성질을 검산하라.

풀이. \(E[(Y-Z)W]=(-a+a-2b+2b)/4=0\). \(EZ=(2+2+4+4)/4=3=EY\). 임의의 \(W\)\(E(Y-W)^2=E(Y-Z)^2+E(Z-W)^2\)이므로 최소예측이 유일합니다.

2. 계단함수와 닫힌집합.\(C\subset C[0,1]\)의 거리 하한이 1이고 달성되지 않음을 자세히 확인하라.

풀이. \(\|s\|_2=1\)이고 \(1\le\langle f,s\rangle\le\|f\|_2\). \(s\)\(L^2\) 수렴하는 연속 \(g_n\)\(a_n=\langle g_n,s\rangle\to1\)이므로 충분히 큰 \(n\)\(f_n=g_n/a_n\in C\)이며 \(\|f_n\|_2\to1\). 노름 1의 해는 Cauchy–Schwarz 등호조건과 양의 내적으로 \(f=s\) a.e.여야 합니다. 연속 \(f\)는 왼쪽 열린 구간에서 1, 오른쪽에서 \(-1\)이어야 하므로 \(1/2\)에서 연속일 수 없습니다.

3. 서로 다른 두 분산. \(x_t=\eta_t-\eta_{t-1}\)의 한 시점 분산, 무한 과거 예측오차 분산, 장기분산을 구하라.

풀이. 한 시점 분산은 2입니다. \(p\)개 과거 공분산의 역행렬 첫 대각은 \(p/(p+1)\)이므로 예측오차 분산은 \(2-p/(p+1)\to1\). 역대각 값은 삼중대각 행렬의 행렬식 재귀 \(D_p=2D_{p-1}-D_{p-2}\), \(D_0=1,D_1=2\)에서 \(D_p=p+1\)을 얻고 여인수 \(D_{p-1}/D_p\)로 계산합니다. 장기분산은 \(2-1-1=0\). 세 값은 서로 다른 질문의 답입니다.

4. Beveridge–Nelson 분해의 가정. \(x_t=\sum_{j\ge0}\psi_j\epsilon_{t-j}\)이고 \(\sum j|\psi_j|<\infty\)라 합시다. 영구 반응과 일시 성분을 분리하라.

풀이. \(b_j=-\sum_{k>j}\psi_k\)라 두면 \(\sum|b_j|\le\sum k|\psi_k|<\infty\). \(b_0=\psi_0-\psi(1)\), \(b_j-b_{j-1}=\psi_j\)이므로 \(\psi(L)=\psi(1)+(1-L)b(L)\). \(z_t=\sum b_j\epsilon_{t-j}\)는 안정적인 \(L^2\) 과정이고 \(x_t=\psi(1)\epsilon_t+z_t-z_{t-1}\). 누적하면 \(\sum_{t=1}^nx_t=\psi(1)\sum_{t=1}^n\epsilon_t+z_n-z_0\). Wold의 제곱합가능성만으로 \(\psi(1)\)이나 \(\sum|b_j|\)의 유한성을 결론내릴 수 없습니다.

5. 정보를 늘리는 순서. \(\mathcal H\subset\mathcal G\)\(Y\in L^2\)에 예측오차 감소량을 구하라.

풀이. \(Y-E[Y\mid\mathcal H]=(Y-E[Y\mid\mathcal G])+(E[Y\mid\mathcal G]-E[Y\mid\mathcal H])\). 두 번째 항은 \(\mathcal G\)-가측이므로 첫 항과 직교합니다. 제곱노름을 취하면 감소량은 \(\|E[Y\mid\mathcal G]-E[Y\mid\mathcal H]\|_2^2\). 감소량 0이면 두 예측이 a.s. 같습니다. 정보집합의 엄격한 포함만으로 모든 \(Y\)의 오차가 엄격히 감소하는 것은 아닙니다.

6. 영구성분을 찾아내기. \(x_t=a+u_t\)에서 \(u_t\)는 평균 0 분산 1의 백색잡음이고 \(a\)는 평균 0 분산 \(\tau^2\)이며 모든 \(u_t\)에 직교한다고 하자.

풀이. \(N^{-1}\sum_{j=1}^Nx_{t-j}=a+N^{-1}\sum u_{t-j}\)이고 두 번째 항의 분산이 \(1/N\)이므로 \(a\in H_{t-1}\) for all \(t\). 따라서 \(u_s=x_s-a\)도 해당 과거공간에 있습니다. \(u_t\perp H_{t-1}\)라서 혁신은 \(u_t\), \(d_t=a\), \(\psi_0=1\), 나머지는 0입니다. 먼 과거 교집합에는 \(a\)만 남습니다. 실제로 \(\{a,u_s\}\)의 직교분해에서 각 유한 시점 \(u_s\)는 충분히 먼 과거와 직교이므로 교집합 원소의 그 계수는 모두 0입니다.

지금까지의 내용을 수학의 언어로 정리해 봅시다#

이 장의 핵심은 최적 예측의 식을 외우는 데 있지 않습니다. 극한을 담는 완비성, 정보를 나타내는 닫힌 부분공간, 직교성을 통해 존재와 유일성을 차례대로 얻습니다. 측도론의 Fatou·단조수렴·Fubini·단조류 정리와 단순함수의 조밀성은 명시한 출발 전제로 사용합니다.

정리 1 · \(L^2\) 완비성과 정보공간의 닫힘. \(L^2(\mathcal F)\)는 Hilbert 공간이고 \(L^2(\mathcal G)\)는 닫힌 부분공간입니다.

증명. Cauchy 열 \(X_n\)에서 \(\|X_{n_{j+1}}-X_{n_j}\|_2\le2^{-j}\)인 부분열을 뽑습니다. \(D_j=X_{n_{j+1}}-X_{n_j}\)라 합시다. 유한합의 삼각부등식과 Fatou로 \(E(\sum_j|D_j|)^2\le(\sum2^{-j})^2<\infty\). 따라서 절대급수가 거의 확실히 수렴하고 \(X=X_{n_1}+\sum D_j\)가 정의됩니다. 같은 논증을 꼬리에 적용하면 \(\|X-X_{n_k}\|_2\le\sum_{j\ge k}2^{-j}\to0\). Cauchy 성질과 삼각부등식으로 원래 전체 열도 \(X\)에 수렴합니다. 내적의 양정치성은 a.s. 동치류를 취했기 때문에 성립합니다.

모든 \(X_n\)\(\mathcal G\)-가측이면 위 부분열의 수렴집합은 \(\mathcal G\)에 속합니다. 그 집합에서 점별극한, 나머지에서 0으로 정의한 버전은 \(\mathcal G\)-가측입니다. 따라서 \(L^2\) 극한이 \(L^2(\mathcal G)\)에 남아 닫힙니다. \(\square\)

정리 2 · 사영과 Riesz 표현. Hilbert 공간의 비어 있지 않은 닫힌 볼록집합에는 각 점의 최근접점이 유일하게 존재합니다. 닫힌 부분공간 \(M\)에는 \(H=M\oplus M^\perp\). 모든 유계 선형범함수는 유일한 \(v\in H\)에 대해 \(f(x)=\langle x,v\rangle\)이며 \(\|f\|=\|v\|\)입니다.

증명. 본문의 평행사변형 계산으로 최소화열이 Cauchy입니다. 완비성과 닫힘으로 극한 \(p\in C\)가 있고 노름의 연속성으로 거리 \(d\)를 달성합니다. 두 최소점 \(p,q\)를 같은 식에 대입하면 \(\|p-q\|^2\le0\)이므로 유일합니다. 부분공간에서는 \(p+th\in M\) for all real \(t\). 이차식 최소의 일차항이 0이므로 \(\operatorname{Re}\langle x-p,h\rangle=0\). 복소수의 경우 \(ih\)도 넣어 완전한 직교성을 얻습니다. 역으로 직교한 \(x-p\)이면 피타고라스로 모든 \(m\in M\)\(\|x-m\|^2=\|x-p\|^2+\|p-m\|^2\)입니다.

\(f\ne0\)이면 닫힌 \(M=\ker f\)를 잡고 \(z\notin M\)의 분해 \(z=m+u\)를 구합니다. \(u\ne0\), \(f(u)\ne0\)이며 모든 \(x\)\(x-f(x)u/f(u)\in M\). 따라서 \(\langle x,u\rangle=f(x)\|u\|^2/f(u)\)이고 \(v=\overline{f(u)}u/\|u\|^2\)이면 첫 인수 선형 규약에서 \(\langle x,v\rangle=f(x)\). 영범함수는 \(v=0\). 두 표현벡터의 차이 \(w\)\(\langle x,w\rangle=0\) for all \(x\)를 적용하면 \(x=w\)에서 \(w=0\). Cauchy–Schwarz로 \(\|f\|\le\|v\|\), \(x=v/\|v\|\)로 등호입니다. \(\square\)

정리 3 · 조건부기댓값의 존재, 유일성, tower. 실수 \(Y\in L^1\)에는 유일한 a.s. \(\mathcal G\)-가측 \(Z\in L^1\)가 있어 모든 \(A\in\mathcal G\)\(E[Z1_A]=E[Y1_A]\)입니다. \(Y\in L^2\)이면 \(Z\)는 직교사영입니다.

증명. 정리 1·2가 \(L^2\) 사영을 줍니다. 지시함수와의 직교성으로 적분 항등식이 따릅니다. 양성과 \(L^1\) 축소성은 본문에서 음수집합과 \(\pm|Y|\)를 사용하여 증명했습니다. 절단 \(Y_n\)의 사영은 \(L^1\)에서 Cauchy이고 그 극한 \(Z\)는 부분열의 a.s. 극한으로 \(\mathcal G\)-가측 버전을 갖습니다. \(|E[(Z-Z_n)1_A]|\le\|Z-Z_n\|_1\)\(Y_n\)\(L^1\) 수렴으로 항등식을 넘깁니다. 두 후보의 차이 \(D\)는 모든 \(\mathcal G\) 사건에 적분이 0입니다. \(\{D>0\}\)에 적분하면 양의 부분이 0, \(\{D<0\}\)에서 음의 부분도 0이라 유일합니다.

\(\mathcal H\subset\mathcal G\)이면 \(A\in\mathcal H\)\(E[E[Z\mid\mathcal H]1_A]=E[Z1_A]=E[Y1_A]\). 유일성으로 tower가 성립합니다. 일반 복소변수는 실수부·허수부를 각각 처리합니다. \(\square\)

정리 4 · 단조 부분공간의 사영극한. 증가하는 닫힌 \(M_n\)에서는 \(P_{M_n}x\to P_{\overline{\cup M_n}}x\), 감소하는 경우에는 \(P_{M_n}x\to P_{\cap M_n}x\)입니다.

증명. 증가하는 경우 본문의 직교 차분 항등식으로 Cauchy이고 극한 \(p\)는 닫힌 합집합에 있습니다. 각 \(h\in M_j\)에 대해 \(n\ge j\)에서 \(\langle x-P_{M_n}x,h\rangle=0\). 극한과 조밀성으로 \(x-p\)는 닫힌 합집합 전체에 직교합니다. 정리 2로 원하는 사영입니다. 감소하는 경우 \(m\ge n\)이면 \(P_{M_m}P_{M_n}=P_{M_m}\)이고 \(\|P_{M_n}x-P_{M_m}x\|^2=\|P_{M_n}x\|^2-\|P_{M_m}x\|^2\). 노름제곱이 감소하여 수렴하므로 Cauchy입니다. 극한은 모든 닫힌 \(M_j\)에 있고 \(x-p\)는 교집합에 직교하므로 그 사영입니다. \(\square\)

정리 5 · Wold 분해. 평균 0의 실수 공분산 정상 양방향 시계열은 위 혁신·결정론적 분해를 가집니다. 양의 혁신분산일 때 계수는 \(\psi_j=E[x_t\epsilon_{t-j}]/\sigma_\epsilon^2\), \(\psi_0=1\)이며 제곱합가능합니다.

증명. 유한 선형결합을 한 시점 이동시키는 \(U(\sum a_jx_j)=\sum a_jx_{j+1}\)는 정상성으로 내적을 보존합니다. 영노름 표현도 영노름으로 보내므로 잘 정의되고, 전체 닫힌 span에 등거리로 연장됩니다. 역방향 이동도 존재하므로 unitary입니다. \(UH_t=H_{t+1}\)이고 사영은 이 등거리와 교환합니다. 따라서 \(U\epsilon_t=\epsilon_{t+1}\)이고 혁신분산과 표시한 계수는 시점에 무관합니다.

\(H_t=H_{t-1}\oplus\operatorname{span}(\epsilon_t)\)입니다. 오른쪽이 닫힌 이유는 직교하는 닫힌 공간과 유한차원 공간의 합이기 때문입니다. 이를 \(N+1\)회 반복하면

\[ x_t=P_{H_{t-N-1}}x_t+\sum_{j=0}^N \frac{E[x_t\epsilon_{t-j}]}{\sigma_\epsilon^2}\epsilon_{t-j}. \]

직교성으로 \(\sigma_\epsilon^2\sum_{j=0}^N\psi_j^2\le E x_t^2\). 정리 4의 감소형을 쓰면 첫 항은 \(P_{H_{-\infty}}x_t\)에 수렴하고 혁신급수는 \(L^2\) 수렴합니다. \(x_t=P_{H_{t-1}}x_t+\epsilon_t\)에서 \(E[x_t\epsilon_t]=\sigma_\epsilon^2\)라서 \(\psi_0=1\). 먼 과거 교집합은 모든 \(H_{s-1}\)에 포함되므로 모든 \(\epsilon_s\)에 직교합니다.

또한 \(U\)가 교집합을 보존하므로 결정론적 성분도 정상입니다. \(\sigma_\epsilon^2=0\)이면 모든 \(H_t=H_{t-1}\)이므로 \(x_t\in H_{-\infty}\)입니다. 정규화된 혁신 계수의 유일성은 각 직교 성분과 내적을 취해서, 결정론적 성분의 유일성은 사영에서 따릅니다. \(\square\)

Hilbert 공간의 사영은 조건부기댓값과 시계열의 혁신 분해를 같은 구조로 설명합니다. 다음 장에서는 관측 연산자를 거꾸로 풀 때 작은 특이방향 때문에 생기는 불안정성과 정칙화를 다룹니다. I3로 이어 읽기.