Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

0. 이번 회차의 식

E[YF]=argminZL2(F)E[(YZ)2]\mathbb{E}[Y\mid\mathcal{F}] = \arg\min_{Z\in L^2(\mathcal{F})} \mathbb{E}\bigl[(Y-Z)^2\bigr]
E[E[YFt+1]Ft]=E[YFt]\mathbb{E}\bigl[\mathbb{E}[Y\mid\mathcal{F}_{t+1}]\,\bigm|\,\mathcal{F}_t\bigr] = \mathbb{E}[Y\mid\mathcal{F}_t]

지금 읽히지 않아도 된다. 7절에서 같은 식을 다시 본다.

1. 도입

Et[]\mathbb{E}_t[\cdot]의 아래첨자 tt는 정확히 무엇인가. 논문은 답하지 않고 다음 줄에서 첨자를 지운다. 반복기댓값의 법칙은 왜 성립하는가.

Cochrane (2005) 1장의 장면이다. 기본 가격식 pt=Et[mt+1xt+1]p_t=\mathbb{E}_t[m_{t+1}x_{t+1}]을 적은 뒤 바로 다음 줄에서 첨자를 떼고 무조건부 1=E[mR]1=\mathbb{E}[mR]로 넘어간다. W13이 같은 자리를 지났다. (2)1=Et[mt+1Rt+1]1=\mathbb{E}_t[m_{t+1}R_{t+1}]은 조건부였고, (3)Cov(m,R)\operatorname{Cov}(m,R)은 무조건부다. 조건부 위험 프리미엄 (14)에서 (3)으로 가는 사이에 빈 줄이 하나 있다. 그 빈 줄에서 일어나는 조작은 "첨자 tt를 지운다"이다. W13은 그 자리에서 상수 RfR^f라는 가정은 따로 적었고, 첨자를 지우는 조작 자체의 근거는 반복기댓값의 법칙이라는 이름으로만 불렀다. 이름은 근거가 아니다.

학부 확률로 이 빈 줄을 메우려 하면 막힌다. 학부의 조건부 기댓값은 E[YA]=E[Y1A]/P(A)\mathbb{E}[Y\mid A]=\mathbb{E}[Y\mathbf{1}_A]/P(A), 사건 AA 하나에 숫자 하나를 돌려주는 공식이다. 논문의 Ft\mathcal{F}_t는 사건 하나가 아니라 "tt까지 관측된 모든 변수의 모든 역사"다. 가격·소비·금리의 과거 경로 전부를 조건으로 거는데, 연속 변수에서 그 조건 사건의 확률은 0이다. 분모가 0이고 분자도 0이다. 공식을 적용할 대상이 없는 자리에서 학부 읽기는 멈춘다.

같은 결핍이 다른 얼굴로 나타난다. Hall (1978)의 따름정리 — “tt기에 알려진 어떤 변수도 ct+1c_{t+1}의 예측에 ctc_t 이상의 정보를 주지 못한다” — 는 검정 가능한 명제다. 논문은 이것을 ct+1c_{t+1}ctc_t의 1차식에 예측오차 εt+1\varepsilon_{t+1}을 더한 것, Et[εt+1]=0\mathbb{E}_t[\varepsilon_{t+1}]=0으로 적고, 다음 줄에서 "εt+1\varepsilon_{t+1}tt기의 모든 변수와 직교(orthogonal)한다"고 말한 뒤, 소득·주가·과거 소비를 우변에 추가해 계수가 0인지 본다. 세 줄이 각각 다른 조작이다. 첫 줄은 Et\mathbb{E}_t를 잔차로 바꾸고, 둘째 줄은 "조건부 평균 0"을 "모든 것과 직교"로 바꾸며, 셋째 줄은 그 “모든 것” 가운데 몇 개를 골라 표본으로 재는 일이다. 무엇이 무엇과 직교한다는 뜻인지 모르면 둘째 줄을 읽을 수 없고, 둘째 줄을 읽지 못하면 셋째 줄의 회귀식을 세울 수 없다. 어느 변수를 우변에 넣어야 하는가. 왜 어느 변수를 넣어도 되는가. "정보집합에 속한 변수"라는 답은 정보집합이 무엇의 이름인지 알 때만 답이 된다. Muth (1961) 이후 경제학의 "기대"는 정보집합 조건부 기댓값이라는 규약으로 고정됐고, 그 규약의 수학은 확률 공식이 아니라 함수 공간의 기하다.

조건부 기댓값을 "계산 절차"가 아니라 "정보로 만든 함수 공간 위의 직교사영(orthogonal projection)"으로 읽지 않으면, 첨자를 붙이고 떼는 논문의 한 줄 한 줄에 근거를 댈 수 없다. 그 빈 줄의 근거가 이 회차가 메우는 결핍이다.

2. 기호 대장

기호종류형상차원·단위한국어 이름
Ω\Omega, ω\omega집합, 원소ωΩ\omega\in\Omega; 예제에서 Ω={uu,ud,du,dd}\Omega=\{uu,ud,du,dd\}상태공간, 상태
G\mathcal{G}σ\sigma-대수Ω\Omega의 부분집합족전체 사건족
F\mathcal{F}, Ft\mathcal{F}_tσ\sigma-대수FtFt+1G\mathcal{F}_t\subseteq\mathcal{F}_{t+1}\subseteq\mathcal{G}정보집합, 여과(filtration)
PP함수(측도)G[0,1]\mathcal{G}\to[0,1]무차원확률측도 — W07의 사영행렬 PP와 다른 뜻
YY확률변수ΩR\Omega\to\mathbb{R}, E[Y2]<\mathbb{E}[Y^2]<\infty예제에서 [화폐]예측 대상
ZZ, WW확률변수L2(F)L^2(\mathcal{F})의 원소[Y][Y]정보 F\mathcal{F}로 만들 수 있는 후보 예측, 시험 방향
L2(F)L^2(\mathcal{F})집합(닫힌 선형부분공간)L2(Ω,F,P)L^2(\Omega,\mathcal{F},P)의 약기; F\mathcal{F}-가측이고 E[Z2]<\mathbb{E}[Z^2]<\inftyZZ의 모임, L2(G)\subseteq L^2(\mathcal{G})제곱적분가능 F\mathcal{F}-가측 확률변수 공간
E[]\mathbb{E}[\cdot]연산자L1(G)RL^1(\mathcal{G})\to\mathbb{R}인수의 차원 보존기댓값
E[F]\mathbb{E}[\cdot\mid\mathcal{F}], ΠF\Pi_{\mathcal{F}}, Et[]\mathbb{E}_t[\cdot]연산자L2(G)L2(F)L^2(\mathcal{G})\to L^2(\mathcal{F}); Et:=E[Ft]\mathbb{E}_t:=\mathbb{E}[\cdot\mid\mathcal{F}_t]인수의 차원 보존조건부 기댓값 = L2(F)L^2(\mathcal{F}) 위 직교사영
argminZL2(F)\arg\min_{Z\in L^2(\mathcal{F})}연산자L2(F)RL^2(\mathcal{F})\to\mathbb{R}인 목적함수를 받아 L2(F)L^2(\mathcal{F})의 원소를 돌려준다인수 ZZ의 차원최소점 — 함수를 돌려주는 최소화
X,Z\langle X,Z\rangle, X\lVert X\rVert함수(내적, 노름)X,Z=E[XZ]\langle X,Z\rangle=\mathbb{E}[XZ], X=E[X2]\lVert X\rVert=\sqrt{\mathbb{E}[X^2]}[X][Z][X][Z], [X][X]내적, 제곱평균 노름
1A\mathbf{1}_A확률변수(지표)Ω{0,1}\Omega\to\{0,1\}, AFA\in\mathcal{F}무차원지표함수
Y^\hat Y, ε\varepsilon확률변수Y^=ΠFYL2(F)\hat Y=\Pi_{\mathcal{F}}Y\in L^2(\mathcal{F}), ε=YY^L2(F)\varepsilon=Y-\hat Y\perp L^2(\mathcal{F})[Y][Y]최적 예측, 예측오차
Y^t\hat Y_t확률과정tE[YFt]L2(Ft)t\mapsto\mathbb{E}[Y\mid\mathcal{F}_t]\in L^2(\mathcal{F}_t)[Y][Y]예측의 경로
StS_t, uu, dd, pp확률과정, 파라미터St+1=Stξt+1S_{t+1}=S_t\xi_{t+1}, ξt+1{u,d}\xi_{t+1}\in\{u,d\}, P(ξt+1=u)=pP(\xi_{t+1}=u)=p[화폐], 무차원이항나무 주가, 상승·하락 배수, 상승확률

집합의 집합과 함수의 공간. F\mathcal{F}는 사건들의 모임이고 L2(F)L^2(\mathcal{F})는 그 사건들로 만들 수 있는 함수들의 공간이다. 둘은 종류가 다르다. σ\sigma-대수는 Ω\Omega의 부분집합족 가운데 Ω\Omega를 담고 여집합과 가산 합집합에 닫힌 것이다 — 판별할 수 있는 사건의 여집합도, 판별할 수 있는 사건들의 합집합도 판별할 수 있다는 뜻이다. 2기 이항나무 S0=100S_0=100, u=1.2u=1.2, d=0.9d=0.9, p=0.6p=0.6에서 세어 본다. 1기 정보 F1={,{uu,ud},{du,dd},Ω}\mathcal{F}_1=\{\emptyset,\{uu,ud\},\{du,dd\},\Omega\}는 원소가 4개인 집합족이고, {uu,ud}\{uu,ud\}{du,dd}\{du,dd\}가 서로 여집합이며 그 합집합이 Ω\Omega이므로 위 조건을 만족한다. 그 위의 L2(F1)L^2(\mathcal{F}_1)cu1up+cd1downc_u\mathbf{1}_{\mathrm{up}}+c_d\mathbf{1}_{\mathrm{down}} 꼴 전부, 곧 2차원 벡터공간이다. F0={,Ω}\mathcal{F}_0=\{\emptyset,\Omega\} 위의 L2(F0)L^2(\mathcal{F}_0)은 상수뿐이므로 1차원이고, F2=2Ω\mathcal{F}_2=2^{\Omega} 위의 L2(F2)L^2(\mathcal{F}_2)는 4차원이다. "정보가 많다"는 "부분공간이 크다"로 읽는다. 사건을 하나 더 구별할 수 있으면 함수를 하나 더 만들 수 있다.

확률변수와 숫자. 학부의 E[YA]=E[Y1A]/P(A)\mathbb{E}[Y\mid A]=\mathbb{E}[Y\mathbf{1}_A]/P(A)는 숫자다. E[YF]\mathbb{E}[Y\mid\mathcal{F}]ω\omega마다 값이 다른 함수, 곧 확률변수다. 분할이 유한할 때 이 함수는 각 칸 위에서 그 칸의 E[YAj]\mathbb{E}[Y\mid A_j]를 취한다 — 3절의 (10)이 그 등식이다. 논문의 약기 둘을 풀어 둔다. E[YX]\mathbb{E}[Y\mid X]E[Yσ(X)]\mathbb{E}[Y\mid\sigma(X)], 즉 XX가 만드는 사건족을 조건으로 건 것이다. σ(X)\sigma(X)XX의 값으로 판별할 수 있는 사건 전부의 모임이고, 예제에서는 σ(S1)=F1\sigma(S_1)=\mathcal{F}_1이다 — S1S_1이 120인지 90인지로 갈라지는 사건이 up·down 둘뿐이기 때문이다. Et[]\mathbb{E}_t[\cdot]E[Ft]\mathbb{E}[\cdot\mid\mathcal{F}_t]의 약기이며 W13이 이 약기로 오일러 방정식을 적었다. 도입의 질문 "아래첨자 tt는 무엇인가"의 답은 여기 있다. tt는 시점이 아니라 σ\sigma-대수 Ft\mathcal{F}_t의 이름표이고, 그 σ\sigma-대수가 부분공간 L2(Ft)L^2(\mathcal{F}_t)를 정한다.

형상 칸을 W01의 정의역→공역으로 읽는다. E[F]\mathbb{E}[\cdot\mid\mathcal{F}]의 입력은 L2(G)L^2(\mathcal{G})의 어떤 확률변수이고 출력은 L2(F)L^2(\mathcal{F})의 원소다. 출력이 입력보다 거친 함수다 — 큰 사건족으로 판별되던 차이가 작은 사건족에서는 판별되지 않으므로 뭉개진다. 나무에서 S2S_2는 네 값을 갖지만 E[S2F1]\mathbb{E}[S_2\mid\mathcal{F}_1]은 두 값, E[S2F0]\mathbb{E}[S_2\mid\mathcal{F}_0]은 한 값을 갖는다. 뭉개지는 방식이 평균이라는 것, 그 평균이 제곱오차의 최소점이라는 것이 Theorem 1의 내용이다. Y^t\hat Y_t의 아래첨자도 시점이 아니라 어느 부분공간에 내렸는가의 표시이며, Y^\hat Y 위의 모자는 W07의 β^\hat\beta·y^\hat y와 같은 뜻 — 사영해서 얻은 값 — 이다. ε\varepsilon에는 분포 가정이 없다. W07이 오차항 없이 대수만으로 사영을 다뤘듯, 여기서도 ε=YY^\varepsilon=Y-\hat Y는 정의이지 가정이 아니다.

같은 글자, 다른 이름. PP는 W07에서 사영행렬 X(XX)1XX(X'X)^{-1}X'이었고 이 회차에서는 확률측도다. 그래서 이 회차의 사영 연산자는 ΠF\Pi_{\mathcal{F}}로 쓴다. MM은 W07의 소멸행렬 IPI-P다. 교과서가 마팅게일(martingale)에 쓰는 MtM_t는 이 회차에서 Y^t\hat Y_t로 적는다. ee는 W07의 잔차 MyMy였고, 여기의 ε=YY^\varepsilon=Y-\hat Y는 같은 기하 — 부분공간에 수직인 성분 — 의 다른 이름이다. uu·dd는 상승·하락 배수이며 W01의 효용함수 uu와 다른 글자다. WW는 시험 방향이며 W09의 위너 과정 WtW_t, W13의 부 WtW_t와 다른 대상이다. pp는 상승확률이며 W01의 가격 벡터 pp가 아니고, 1절·5절에 나오는 W13의 가격 pt=Et[mt+1xt+1]p_t=\mathbb{E}_t[m_{t+1}x_{t+1}]과는 첨자 유무로 갈린다. ϵ\epsilon은 3절 (7)의 섭동 크기 — 실수 — 이고, ε=YY^\varepsilon=Y-\hat Y는 예측오차 — 확률변수 — 다. 분할의 칸 수는 nn, 몬테카를로의 관측 수는 NN이다. 이 회차의 tt는 시간 첨자로만 쓴다.

3. 유도

조건부 기댓값이 L2L^2에서의 직교사영임을 보이고, 반복기댓값의 법칙을 사영의 타워 성질로 유도한다. W07의 PP와 같은 구조다. 유한차원에서 P2=PP^2=P, P=PP'=P였던 것이 함수 공간에서 Π2=Π\Pi^2=\Pi, 자기수반(self-adjoint)으로 다시 나온다.

가정을 번호 붙여 둔다.

A3이 사는 곳을 짚어 둔다. 유한차원에서는 A3이 필요 없다. 나무의 L2(F1)L^2(\mathcal{F}_1)R2\mathbb{R}^2이고, R2\mathbb{R}^2 위의 강볼록 2차함수(양정치 2차형식)는 최소점을 반드시 갖는다 — W07이 XXX'X의 양정치성으로 정규방정식의 해를 얻은 것과 같은 이유다. 무한차원에서는 "가장 가까운 점"이 있다는 것 자체가 정리다. 부분공간이 닫혀 있지 않으면 거리의 하한에 다가가는 점열은 있어도 그 하한을 달성하는 점은 없을 수 있다. L2(F)L^2(\mathcal{F})가 닫힌 부분공간이라는 것과 L2(G)L^2(\mathcal{G})의 완비성이 그 점열의 극한을 공간 안에 붙잡아 준다. 이 회차는 그 붙잡는 일을 빌리고, 붙잡힌 점이 무엇인지 — 직교조건, Kolmogorov 등식, 타워 — 를 증명한다. A1의 L2L^2 한정도 같은 자리에서 온다. 조건부 기댓값은 EY<\mathbb{E}\lvert Y\rvert<\infty만으로 정의되지만, 그때는 내적이 없으므로 "직교"라는 말을 할 수 없다. 사영으로 읽는 것은 L2L^2의 특권이다.

번역. 정보로 만들 수 있는 모든 예측 가운데 제곱오차가 가장 작은 것이 조건부 기댓값이고, 그때 남는 오차는 그 정보로 만든 어떤 양과도 상관이 없다. 정보를 줄여 가며 예측을 거듭해도 결과는 가장 적은 정보로 한 번에 예측한 것과 같다. 예측의 경로는 마팅게일이고, 예측의 수정은 어제의 정보로 예측되지 않으며, 예측의 분산은 정보가 쌓일수록 커진다.

세 얼굴이 한 대상이다. 최소점(8)은 최적화의 얼굴, 직교조건(7)은 기하의 얼굴, Kolmogorov 등식(4)은 측도론의 얼굴이다. 논문이 어느 얼굴로 적든 같은 것을 가리키며, 어느 얼굴에서 다른 얼굴로 옮겨 가는 데 필요한 조작은 시험 방향 WW를 고르는 일뿐이다. W=Y^ZW=\hat Y-Z를 고르면 최소가 나오고, W=1AW=\mathbf{1}_A를 고르면 조건부 확률이 나오며, WL2(Ft)W\in L^2(\mathcal{F}_t)로 제한하면 타워가 나온다.

수치 확인. 2기 이항나무 S0=100S_0=100, u=1.2u=1.2, d=0.9d=0.9, p=0.6p=0.6에서 전부 손으로 계산된다. 상태 Ω={uu,ud,du,dd}\Omega=\{uu,ud,du,dd\}, 확률 (0.36,0.24,0.24,0.16)(0.36,0.24,0.24,0.16), S2{144,108,108,81}S_2\in\{144,108,108,81\}, S1{120,90}S_1\in\{120,90\}. Y=S2Y=S_2, F1=σ(S1)\mathcal{F}_1=\sigma(S_1)로 둔다. (10)으로 칸별 평균을 구하면 cu=(0.36144+0.24108)/0.6=129.6c_u=(0.36\cdot144+0.24\cdot108)/0.6=129.6, cd=(0.24108+0.1681)/0.4=97.2c_d=(0.24\cdot108+0.16\cdot81)/0.4=97.2이고, 둘 다 1.08S11.08\,S_1이다. 타워: E[Y^1]=0.6129.6+0.497.2=116.64=E[S2]\mathbb{E}[\hat Y_1]=0.6\cdot129.6+0.4\cdot97.2=116.64=\mathbb{E}[S_2]. 직교: E[(S2Y^1)1up]=0.3614.40.2421.6=0\mathbb{E}[(S_2-\hat Y_1)\mathbf{1}_{\mathrm{up}}]=0.36\cdot14.4-0.24\cdot21.6=0. up 칸 안에서 양의 오차 14.4와 음의 오차 -21.6이 확률 0.36과 0.24로 정확히 상쇄된다 — 칸별 평균이라는 말의 뜻이 이것이다. 피타고라스: Var(S2)=508.550\operatorname{Var}(S_2)=508.550, Var(Y^1)=251.942\operatorname{Var}(\hat Y_1)=251.942, E[(S2Y^1)2]=256.608\mathbb{E}[(S_2-\hat Y_1)^2]=256.608, 합 251.942+256.608=508.550251.942+256.608=508.550. 조건부 분산은 up 칸 311.04, down 칸 174.96, 확률가중평균 256.608이다. up 칸의 조건부 분산이 큰 것은 주가가 높을수록 같은 배수가 더 큰 금액을 움직이기 때문이고, 두 칸의 비 311.04/174.96=(120/90)2311.04/174.96=(120/90)^2이 그 이유를 숫자로 적는다. 모든 숫자는 정확한 유리수다. 후보 예측을 공간별로 늘어놓으면 최소점이 어디 있는지가 보인다.

후보 ZZ속하는 공간E[(S2Z)2]\mathbb{E}[(S_2-Z)^2]
E[S2]=116.64\mathbb{E}[S_2]=116.64L2(F0)L^2(\mathcal{F}_0)508.550
S1S_1L2(F1)L^2(\mathcal{F}_1)332.640
1.08S1=E[S2F1]1.08\,S_1=\mathbb{E}[S_2\mid\mathcal{F}_1]L2(F1)L^2(\mathcal{F}_1)256.608
S2S_2L2(F2)L^2(\mathcal{F}_2) — 후보 아님0

표의 네 줄은 중첩된 네 공간이다. 첫 줄의 상수는 1차원 공간 L2(F0)L^2(\mathcal{F}_0)의 최소점이고, 셋째 줄은 그것을 품는 2차원 공간 L2(F1)L^2(\mathcal{F}_1)의 최소점이며, 넷째 줄은 4차원 전체 공간의 최소점 — YY 자신 — 이다. 공간이 커질수록 최소 오차는 508.55, 256.608, 0으로 줄어든다. 줄어드는 폭 508.550256.608=251.942508.550-256.608=251.942가 바로 Var(Y^1)\operatorname{Var}(\hat Y_1)이다. 정보 F1\mathcal{F}_1이 사들이는 것은 예측의 분산만큼의 오차 감소이고, (13)이 그 회계다. S1S_1 그대로를 예측으로 쓰면 L2(F1)L^2(\mathcal{F}_1) 안에 있으면서도 최소점이 아니다. 오차 332.64와 256.608의 차 76.03Y^1S12=0.082E[S12]=0.006411880\lVert\hat Y_1-S_1\rVert^2=0.08^2\,\mathbb{E}[S_1^2]=0.0064\cdot11880과 같다 — (6)의 둘째 항이며, 최소점에서 벗어난 거리의 제곱이 오차에 그대로 더해진다. 세 변의 길이 256.608=16.02\sqrt{256.608}=16.02, 251.942=15.87\sqrt{251.942}=15.87, 508.550=22.55\sqrt{508.550}=22.55를 축척대로 놓으면 Figure 1이 된다.

평면 위의 직선, 평면 밖의 점 Y, 두 직각과 세 변

Figure 1:YY를 큰 부분공간 L2(F1)L^2(\mathcal{F}_1)에 내린 발을 다시 작은 부분공간 L2(F0)L^2(\mathcal{F}_0)에 내리면 처음부터 작은 부분공간에 내린 발과 같다. 세 변은 피타고라스를 만족한다 — 251.942+256.608=508.550251.942+256.608=508.550.

(14)를 같은 나무에서 본다. Y^0=116.64\hat Y_0=116.64, Y^1{129.6,97.2}\hat Y_1\in\{129.6,97.2\}, Y^2=S2\hat Y_2=S_2. 각 마디의 값은 자식 값의 확률가중평균이다. 뿌리에서의 수정 +12.96(확률 0.6)과 -19.44(확률 0.4)는 가중평균이 0이고, up 마디의 +14.4·-21.6, down 마디의 +10.8·-16.2도 같다. 분산은 0251.9508.60\to251.9\to508.6으로 커진다. Figure 2가 이것을 그린다. 마팅게일인 것은 예측의 경로 Y^t\hat Y_t이지 주가 StS_t가 아니다. 이 나무에서 E[St+1Ft]=1.08StSt\mathbb{E}[S_{t+1}\mid\mathcal{F}_t]=1.08\,S_t\ne S_t이므로 주가는 마팅게일이 아니고, 그럼에도 "S2S_2에 대한 예측"의 경로는 어떤 (u,d,p)(u,d,p)에서도 마팅게일이다. 예측 대상이 무엇이든 (14)는 사영의 성질만으로 성립한다.

왼쪽은 예측값이 적힌 2기 나무, 오른쪽은 마디별 예측 수정의 막대

Figure 2:예측은 정보가 쌓일수록 흩어지지만, 수정의 방향은 직전 정보로 예측되지 않는다. 각 마디에서 수정폭의 확률가중평균은 0이다.

(10)의 W07 고리를 몬테카를로로 본다. N=2000N=2000 경로를 만들고 S1S_1 마디 지표 두 열을 XX로 두면 XX=diag(Nup,Ndown)X'X=\operatorname{diag}(N_{\mathrm{up}},N_{\mathrm{down}})이고, P=X(XX)1XP=X(X'X)^{-1}X'는 각 관측을 그 칸의 표본평균으로 바꾼다. 씨앗 0에서 그 값은 130.2와 97.3이며, Figure 3에서 모집단값 129.6·97.2 옆에 붙어 있다. 차이는 표본오차다 — up 칸의 조건부 표준편차 311.04=17.6\sqrt{311.04}=17.6을 칸의 관측 수 약 1200의 제곱근으로 나눈 0.5 안팎이다. P2=PP^2=P, P=PP'=P가 프로베니우스 노름 10-12 아래로 맞고, P0=11/NP_0=\mathbf{1}\mathbf{1}'/N에 대해 P0P=P0P_0P=P_0이 같은 정밀도로 맞는다 — 전체 평균으로 보내는 사영과 칸별 평균으로 보내는 사영의 합성이 전체 평균으로 보내는 사영이라는 것, 곧 타워의 행렬 판이다. 상수항 열은 두 지표 열의 합이므로 C(1)C(X)\mathcal{C}(\mathbf{1})\subset\mathcal{C}(X)이고, 포함 관계가 있는 열공간의 사영은 W07 (1)의 대수만으로 합성된다.

S1 마디별 S2 산점과 더미 회귀 적합값, 모집단 조건부 기댓값

Figure 3:유한 분할 위의 사영은 더미 회귀다. PyPy(파랑)는 칸별 표본평균이고, 모집단 조건부 기댓값(점선)에 붙는다. W07의 PP가 이 회차의 ΠF1\Pi_{\mathcal{F}_1}의 표본 판이다.

4. 읽기

Q1 · 기호

2절 표가 답이다. 한 줄만 덧붙인다. (1)argmin\arg\min은 숫자를 돌려주는 최소화가 아니라 함수를 돌려주는 최소화다. 변수가 ZZ 하나로 보이지만 ZZL2(F)L^2(\mathcal{F})의 원소이고, 예제에서는 (cu,cd)R2(c_u,c_d)\in\mathbb{R}^2다. 우변의 E[]\mathbb{E}[\cdot]는 무조건부 기댓값 — L1(G)RL^1(\mathcal{G})\to\mathbb{R} — 이고, 좌변의 E[F]\mathbb{E}[\cdot\mid\mathcal{F}]L2(G)L2(F)L^2(\mathcal{G})\to L^2(\mathcal{F})다. 같은 글자 E\mathbb{E}가 한 식 안에서 두 형상으로 나온다. 등호도 A4의 등호다 — 좌변과 우변은 확률 1로 같은 함수이며, 확률 0인 상태에서 값이 달라도 같은 것으로 본다.

Q2 · 번역

(1): “정보 F\mathcal{F}만으로 만들 수 있는 예측 가운데 제곱오차를 가장 작게 하는 것이 조건부 기댓값이다.” (2): “먼 미래를 내일의 정보로 먼저 예측하고 그 예측을 다시 오늘의 정보로 예측하면, 처음부터 오늘의 정보로 예측한 것과 같다 — 작은 정보가 이긴다.” 순서를 바꿔 오늘의 예측을 내일의 정보로 다시 예측해도 답은 오늘의 예측이다. 오늘의 예측은 이미 내일의 공간 안에 있기 때문이다.

같은 식을 다른 얼굴로 번역하면 문장이 바뀐다. 직교조건의 얼굴: “최선의 예측이 남긴 오차는 그 정보로 만든 어떤 양과 곱해 평균해도 0이다.” Kolmogorov의 얼굴: “정보로 판별할 수 있는 어떤 사건 위에서도 예측의 평균과 실제의 평균이 같다.” 세 문장은 같은 대상의 세 이름 — 최소화·직교·Kolmogorov — 이고, 논문은 셋 가운데 편한 것을 골라 적는다. 자산가격 논문의 모멘트 조건은 직교의 얼굴이고, 계량 교과서의 조건부 기댓값 함수는 최소화의 얼굴이며, 확률론 교과서의 정의는 Kolmogorov의 얼굴이다.

Q3 · 차원

(1) 좌변은 [Y][Y]다. 우변의 목적함수 E[(YZ)2]\mathbb{E}[(Y-Z)^2][Y]2[Y]^2이지만 argmin\arg\minZZ를 돌려주므로 [Y][Y]다. 양변이 맞는다. (2)는 양변 [Y][Y]. F\mathcal{F}·PP·1A\mathbf{1}_A는 무차원이다 — 정보에는 단위가 없다. 화폐 단위를 바꿔 YcY+bY\to cY+b로 놓으면 (8)의 선형성과 "상수 L2(F)\in L^2(\mathcal{F})"로 ΠF(cY+b)=cΠFY+b\Pi_{\mathcal{F}}(cY+b)=c\,\Pi_{\mathcal{F}}Y+b이므로 사영은 단위 변경에 공변한다. 원화로 예측하고 달러로 바꾸나 달러로 바꾸고 예측하나 같다. 직교조건의 "0"은 [Y][W][Y][W] 단위를 가진 0이다. 연산자 ΠF\Pi_{\mathcal{F}} 자체는 무차원이다 — W07의 PP가 무차원 행렬이었던 것과 같은 이유로, 입력의 단위를 그대로 출력에 넘긴다.

무차원군은 하나다: Var(E[YF])/Var(Y)\operatorname{Var}(\mathbb{E}[Y\mid\mathcal{F}])/\operatorname{Var}(Y) — 정보의 설명력, 모집단 R2R^2. 예제에서 251.942/508.550=0.495251.942/508.550=0.495이고, F1\mathcal{F}_1S2S_2 분산의 49.5%를 설명한다. (13)에 의해 이 비율은 항상 [0,1][0,1] 안에 있다. "제곱"은 무고하지 않다. 절대오차 EYZ\mathbb{E}\lvert Y-Z\rvert를 최소화하면 조건부 중앙값이 나오는데, 그것은 선형 연산자가 아니므로 사영이 아니고 타워도 성립하지 않는다. 제곱을 골랐기 때문에 내적이 생기고, 내적이 있기 때문에 직각이 있다.

Q8 · 파라미터 극단

이 회차의 파라미터는 정보 F\mathcal{F} 자체와 나무의 (u,d,p)(u,d,p)다. 정보를 극단으로 보낸다.

정보가 커지는 방향은 단조다. FtFt+1\mathcal{F}_t\subseteq\mathcal{F}_{t+1}이면 (6)F=Ft+1\mathcal{F}=\mathcal{F}_{t+1}, Z=Y^tZ=\hat Y_t — A2로 L2(Ft+1)L^2(\mathcal{F}_{t+1})에 속한다 — 에 적용해 E[(YY^t)2]=E[(YY^t+1)2]+E[(Y^t+1Y^t)2]E[(YY^t+1)2]\mathbb{E}[(Y-\hat Y_t)^2]=\mathbb{E}[(Y-\hat Y_{t+1})^2]+\mathbb{E}[(\hat Y_{t+1}-\hat Y_t)^2]\ge\mathbb{E}[(Y-\hat Y_{t+1})^2]이다. 정보를 더하면 최소 오차는 줄거나 같다 — 예제에서 508.55에서 256.608로, 다시 0으로. 정보를 더했는데 오차가 늘어나는 일은 없다. 그것이 무관한 정보이면 사영이 그것을 쓰지 않을 뿐이다.

나무의 파라미터를 극단으로 보낸다. u=du=d이면 S2S_2F0\mathcal{F}_0-가측이고 오차는 0이다. p1p\to1 또는 p0p\to0이면 확률이 한 경로에 몰려 Var(S2)0\operatorname{Var}(S_2)\to0이고 사영은 자명하다. p=0.5p=0.5, u=1/du=1/d이면 E[S2F1]=12(u+d)S1>S1\mathbb{E}[S_2\mid\mathcal{F}_1]=\tfrac12(u+d)S_1>S_1 — 배수가 대칭이어도 산술평균이 1을 넘으므로 예측은 위로 치우친다. 같은 나무에서 pu+(1p)d=1pu+(1-p)d=1이 되도록 pp를 고르면 — p=(1d)/(ud)=1/3p=(1-d)/(u-d)=1/3 — 예측은 S1S_1 자신이 되고 주가의 경로가 마팅게일이 된다. 이 모든 경우가 한 식의 pu+(1p)dpu+(1-p)d를 움직여 읽힌다.

St+1=Stξt+1,ξt+1{u,d},    P(ξt+1=u)=p        E[S2F1]=(pu+(1p)d)S1=1.08S1S_{t+1}=S_t\,\xi_{t+1},\quad \xi_{t+1}\in\{u,d\},\;\;P(\xi_{t+1}=u)=p\;\;\Longrightarrow\;\;\mathbb{E}[S_2\mid\mathcal{F}_1]=\bigl(pu+(1-p)d\bigr)S_1=1.08\,S_1

근거(10)을 분할 {up,down}\{\mathrm{up},\mathrm{down}\}에 적용한 칸별 평균. ξ2\xi_2F1\mathcal{F}_1과 독립인 것은 나무의 구성이다.

Q11 · 한계 원리

어느 양과 어느 양이 균등해지는가. 최적점에서 E[Y^W]=E[YW]\mathbb{E}[\hat Y\,W]=\mathbb{E}[Y\,W], 모든 WL2(F)W\in L^2(\mathcal{F}). 예측값과 실제값은 정보로 만든 어떤 양과도 같은 내적을 갖는다. 한계 원리로 읽으면, Y^\hat YϵW\epsilon W를 더해 얻는 제곱오차의 한계 감소가 모든 방향 WW에서 0이다 — 남은 오차에 정보로 짜낼 것이 없다. 경제 번역이 둘 있다.

(1) 제곱오차 곡면과 정규방정식. S1S_1이 두 값이므로 {a+bS1}=L2(F1)\{a+bS_1\}=L^2(\mathcal{F}_1)이다(2차원 = 2차원). 아래의 최소점이 곧 조건부 기댓값인 것은 그 때문이다. 이 우연은 S1S_1이 이진이라서 생긴다. 일반적으로 span{1,X}\operatorname{span}\{1,X\} 위 사영(최선 선형예측)은 L2(σ(X))L^2(\sigma(X)) 위 사영보다 작은 공간의 사영이고 둘은 다르다 — 같은 기하, 다른 부분공간.

g(a,b):=E[(S2abS1)2],E[S2abS1]=0,    E[(S2abS1)S1]=0        (a,b)=(0,  1.08)g(a,b):=\mathbb{E}\bigl[(S_2-a-bS_1)^2\bigr],\qquad \mathbb{E}[S_2-a-bS_1]=0,\;\;\mathbb{E}\bigl[(S_2-a-bS_1)\,S_1\bigr]=0\;\;\Longrightarrow\;\;(a^{*},b^{*})=(0,\;1.08)

근거(7)W=1W=1, W=S1W=S_1. 수치: E[S1]=108\mathbb{E}[S_1]=108, E[S12]=11880\mathbb{E}[S_1^2]=11880, E[S1S2]=12830.4\mathbb{E}[S_1S_2]=12830.4, E[S22]=14113.44\mathbb{E}[S_2^2]=14113.44. b=Cov(S1,S2)/Var(S1)=233.28/216=1.08b^{*}=\operatorname{Cov}(S_1,S_2)/\operatorname{Var}(S_1)=233.28/216=1.08, a=116.641.08108=0a^{*}=116.64-1.08\cdot108=0. g(0,1.08)=256.608g(0,1.08)=256.608, g(0,1)=332.64g(0,1)=332.64, g(116.64,0)=508.550g(116.64,0)=508.550. E[S1S2]=1.08E[S12]\mathbb{E}[S_1S_2]=1.08\,\mathbb{E}[S_1^2] 자체가 (7)W=S1W=S_1을 넣은 직교조건 S2Y^1,S1=0\langle S_2-\hat Y_1,S_1\rangle=0F1\mathcal{F}_1-가측 인수를 E1\mathbb{E}_1 안으로 넣는 조작 — 의 사용이다. Figure 4가 곡면의 등고선과 세 점을 보인다.

(a,b) 평면 위 제곱오차 g의 등고선과 세 후보점

Figure 4:g(a,b)=E[(S2abS1)2]g(a,b)=\mathbb{E}[(S_2-a-bS_1)^2]의 등고선. 상수 예측(검정) 508.6, S1S_1 그대로(주황) 332.6, 최소점 (0,1.08)(0,1.08)(파랑) 256.6. S1S_1이 두 값이므로 이 평면이 L2(F1)L^2(\mathcal{F}_1) 전체다.

(2) W13 고리. (2)Et\mathbb{E}_tΠFt\Pi_{\mathcal{F}_t}다. 첨자를 지우는 줄과 Hall의 직교 검정이 한 식에서 나온다.

1=E[mt+1Rt+1Ft]    1=E[E[mt+1Rt+1Ft]]=E[mt+1Rt+1],E[(mt+1Rt+11)W]=0    WL2(Ft)1=\mathbb{E}\bigl[m_{t+1}R_{t+1}\,\bigm|\,\mathcal{F}_t\bigr]\;\Longrightarrow\;1=\mathbb{E}\bigl[\mathbb{E}[m_{t+1}R_{t+1}\mid\mathcal{F}_t]\bigr]=\mathbb{E}[m_{t+1}R_{t+1}],\qquad \mathbb{E}\bigl[(m_{t+1}R_{t+1}-1)\,W\bigr]=0\;\;\forall W\in L^2(\mathcal{F}_t)

근거 — 첫째: (2)F0={,Ω}\mathcal{F}_0=\{\emptyset,\Omega\} — 타워, 작은 정보가 이긴다. (2)에서 무조건부 1=E[mR]1=\mathbb{E}[mR]로 가는 줄이 이것이다 — (14)에서 (3)으로 가는 빈 줄에는 상수 RfR^f가 하나 더 겹쳐 있고, 5절에서 가른다. 둘째: (7), 상수 1은 Ft\mathcal{F}_t-가측. mt+1Rt+1L2(G)m_{t+1}R_{t+1}\in L^2(\mathcal{G})는 여기서 추가로 가정한다 — W13 A5(모든 조건부 2차 모멘트 유한)는 조건부만 말하고, a.s. 유한한 조건부 2차 모멘트의 기댓값은 무한할 수 있으므로 이 회차의 A1이 이 자리에서 다시 필요하다. WWtt기 소득·과거 소비 등 어떤 관측치를 넣어도 0 — Hall (1978)이 검정한 명제이고, 시험 방향 WW를 도구변수로 골라 표본 내적을 0에 맞추는 것이 Hansen & Singleton (1982)의 추정이다.

둘째 식의 경제 번역은 이렇다. 균등해지는 두 양은 E[mt+1Rt+1W]\mathbb{E}[m_{t+1}R_{t+1}W]E[W]\mathbb{E}[W]이다. WWtt기 소득이면, 소득이 높은 시기에 할인된 수익률이 체계적으로 높거나 낮지 않다는 뜻이고, WW가 과거 소비면 소비의 관성이 할인된 수익률을 예측하지 않는다는 뜻이다. 어느 WL2(Ft)W\in L^2(\mathcal{F}_t)에서 표본 내적이 0에서 멀면 mm의 지정이 기각된다. 반대로 Ft\mathcal{F}_t 밖의 WW — 이를테면 t+1t+1기의 변수 — 에서 내적이 0이 아닌 것은 기각이 아니다. 직교는 정보집합 안에서만 약속된 것이기 때문이다. 첫째 식의 F0\mathcal{F}_0W=1W=1 하나만 시험하는 가장 약한 검정이고, 둘째 식은 시험 방향을 L2(Ft)L^2(\mathcal{F}_t) 전체로 넓힌 가장 강한 형태다. 타워는 그 사이의 모든 중간 정보에서 같은 식이 성립함을 보장한다.

5. 학부와 대학원의 간극

학부 읽기는 E[YX=x]=yyP(Y=yX=x)\mathbb{E}[Y\mid X=x]=\sum_y y\,P(Y=y\mid X=x)에서 멈춘다. 이 공식이 작동하려면 조건 사건의 확률이 양수여야 하고 조건이 되는 변수가 유한 개여야 한다. 연속 변수 하나라면 학부도 조건부 밀도 f(yx)=f(x,y)/fX(x)f(y\mid x)=f(x,y)/f_X(x)로 넘어가지만, 조건이 변수 하나가 아니라 “tt까지의 모든 역사” — σ\sigma-대수 Ft\mathcal{F}_t — 일 때는 조건부 밀도조차 세울 수 없다. 공식을 적용할 대상이 없는 자리에서 학부 읽기는 멈춘다. 대학원 읽기는 공식을 버리고 (4)의 등식 — 모든 AFA\in\mathcal{F}에서 E[Y^1A]=E[Y1A]\mathbb{E}[\hat Y\mathbf{1}_A]=\mathbb{E}[Y\mathbf{1}_A] — 을 정의로 삼는다. 이 등식은 분모가 없으므로 확률 0인 사건에서도 무너지지 않고, 3절이 보였듯 그 정의는 사영의 직교조건과 같은 것이다.

구체 장면 하나. Cochrane (2005) 1장, pt=Et[mt+1xt+1]p_t=\mathbb{E}_t[m_{t+1}x_{t+1}] 바로 아래에서 첨자를 떼고 무조건부 모멘트로 넘어가는 한 줄. 대학원 읽기는 이 줄에서 ΠF0ΠFt=ΠF0\Pi_{\mathcal{F}_0}\Pi_{\mathcal{F}_t}=\Pi_{\mathcal{F}_0}를 본다. 한 걸음 더 본다. 타워가 지우는 것은 Et\mathbb{E}_t 하나뿐이다. (14)의 우변 Rt+1fCovt(m,R)-R^f_{t+1}\operatorname{Cov}_t(m,R)에서 첨자를 떼려면 Rt+1fR^f_{t+1}이 상수라는 별도의 가정이 필요하고, W13은 그 가정을 적어 두었다. RfR^f가 움직이면 E[Rt+1fCovt()]\mathbb{E}[R^f_{t+1}\operatorname{Cov}_t(\cdot)]이 인수분해되지 않고, Rt+1fR^f_{t+1}이 상수 RfR_f이면 Et[m]=1/Rf\mathbb{E}_t[m]=1/R_f도 상수라서 Cov(Etm,EtR)=0\operatorname{Cov}(\mathbb{E}_t m,\mathbb{E}_t R)=0, 곧 E[Covt(m,R)]=Cov(m,R)\mathbb{E}[\operatorname{Cov}_t(m,R)]=\operatorname{Cov}(m,R)이 되어 W13이 무조건부 공분산 분해로 얻은 (3)과 같은 식이 나온다. 첨자를 떼는 한 줄에 타워 하나와 상수성 하나, 두 근거가 겹쳐 있다는 것을 사영으로 읽는 눈이 가려낸다. 같은 눈으로 Hall (1978)의 따름정리 — “tt기의 어떤 정보도 ct+1c_{t+1} 예측에 보탬이 되지 않는다” — 를 읽으면, 그것은 E[(u(ct+1)u(ct)/(βR))W]=0\mathbb{E}[(u'(c_{t+1})-u'(c_t)/(\beta R))\,W]=0이라는 직교조건이고, 검정은 WW를 골라 표본 내적이 0인지 보는 일이다. 어느 WW를 넣어도 된다는 것이 "모든 WL2(Ft)W\in L^2(\mathcal{F}_t)"의 뜻이다. 소득을 넣으면 소득이 소비를 예측하는지 묻는 것이고, 과거 소비를 넣으면 관성을 묻는 것이다. 모두 같은 직교조건의 다른 시험 방향이다.

대학원 읽기가 추가로 보는 것은 셋이다. (a) E[F]\mathbb{E}[\cdot\mid\mathcal{F}]는 확률변수를 돌려주는 선형 연산자다. (b) 그 연산자의 고정점 집합은 L2(F)L^2(\mathcal{F}) 전체다 — W12의 압축사상은 고정점이 하나였고 (1)의 벨만 연산자 TT는 그 하나로 수렴했다. 사영은 고정점이 부분공간 전체이고, 한 번 적용하면 그 자리에 머문다(Π2=Π\Pi^2=\Pi). "연산자로 읽는다"는 눈은 같고, 고정점의 모양이 다르다. TTmax\max 때문에 비선형이었고 Π\Pi는 선형이다 — 선형이기 때문에 고정점의 집합이 부분공간이 된다. (c) "마팅게일"은 새 개념이 아니라 Y^t=ΠFtY\hat Y_t=\Pi_{\mathcal{F}_t}Y의 경로에 붙은 이름이다. (14)의 첫째 식이 정의이고, 나머지 두 식이 그 정의에서 따라 나오는 성질이다.

6. 훈련

Solution to Exercise 1 #

채점 기준 — 각 줄 옆의 근거를 본다.

  1. 내적 정의 (3) 옆에 "A1: E[Y2]<\mathbb{E}[Y^2]<\infty"와 "코시–슈바르츠로 유한"이 적혀 있는가.

  2. 전개식 (5) 옆에 "쌍선형·대칭"이 적혀 있는가.

  3. 직교 ⇒ 최소 (6) 옆에 "Y^ZL2(F)\hat Y-Z\in L^2(\mathcal{F}) — 부분공간"이, 유일성 옆에 "a.s. 동일시(A4)"가 적혀 있는가.

  4. 최소 ⇒ 직교 (7) 옆에 섭동 Y^+ϵW\hat Y+\epsilon W와 "ϵ\epsilon 양·음 양쪽 극한"이 적혀 있는가. W07 정규방정식과 같은 구조라는 한 마디가 있는가.

  5. 존재 (8) 옆에 "A3 사영 정리 — 빌린다(증명 없음)"가 명시돼 있는가. 존재를 증명한 척하면 감점.

  6. W=1AW=\mathbf{1}_A를 대입해 Kolmogorov 정의 (4)를 얻는 줄 (9)이 있는가.

  7. 타워 (11) 옆에 "L2(Ft)L2(Ft+1)L^2(\mathcal{F}_t)\subseteq L^2(\mathcal{F}_{t+1})"와 "유일성으로 동일시"가 적혀 있는가. 방향(작은 정보가 이긴다)이 맞는가. (12) 옆에 Π2=Π\Pi^2=\Pi·자기수반이 W07의 P2=PP^2=P, P=PP'=P와 같은 것이라는 한 마디가 있는가.

  8. 번역 문장이 있는가.

냉시동 인출(40분) — 1주 전 · 3주 전 · 8주 전 각 1항목. 자료 없이 백지에서 재구성한다. 막힌 항목은 다음 주 “1주 전” 자리에 다시 올린다.

노트북(40분)w14-lab.ipynb. 코드를 쓰기 전에 다음 셋에 답한다. 답은 3절의 표에서 전부 읽어 낼 수 있어야 하며, 읽어 내지 못하는 항목이 있으면 그 자리가 이번 주의 구멍이다.

  1. 이항나무(S0=100S_0=100, u=1.2u=1.2, d=0.9d=0.9, p=0.6p=0.6)에서 Z=a+bS1Z=a+bS_1S2S_2를 예측할 때 제곱오차를 최소로 하는 (a,b)(a,b)는 무엇인가. 최소값은 Var(S2)\operatorname{Var}(S_2)의 몇 %인가. — 예측: (0,1.08)(0,1.08), 256.6/508.6=50.5%256.6/508.6=50.5\%.

  2. 정보를 F1\mathcal{F}_1에서 F0\mathcal{F}_0로 줄이면 최소 제곱오차는 몇 배가 되는가. Var(Y^1)\operatorname{Var}(\hat Y_1)과 최소 오차 가운데 어느 것이 큰가. — 예측: 508.6/256.6=1.98508.6/256.6=1.98배; 오차 256.6이 251.9보다 근소하게 크다.

  3. 시뮬레이션 잔차 S21.08S1S_2-1.08S_1S1S_1, S12S_1^2, 1{S1=120}\mathbf{1}\{S_1=120\}의 표본 공분산은 0에 가까운가. 잔차와 S2S_2의 공분산은 얼마인가. 더미 회귀의 PyPy는 129.6·97.2에 수렴하는가. P0PP_0PP0P_0의 차는 0인가. — 예측: 앞 셋은 0, Cov(ε,S2)=256.6\operatorname{Cov}(\varepsilon,S_2)=256.6, 수렴한다, 0이다.

계산은 패키지 호출 없이 한다. 상태 4개와 확률 벡터를 배열로 쌓아 모든 기댓값을 가중합으로 구하고, (a,b)(a,b) 격자에서 gg를 계산해 격자탐색 최소점과 정규방정식 2×22\times2의 해를 대조하며, N=100,000N=100{,}000 경로를 시뮬레이션해 표본 공분산을 직접 계산한다. 더미 행렬 XXP=X(XX)1XP=X(X'X)^{-1}X'N=2000N=2000 부분표본에서만 만들어 P2=PP^2=P, P=PP'=P, P0P=P0P_0P=P_0을 프로베니우스 노름으로 확인한다. 대조 표는 예측 | 결과 | 어긋남 | 원인 4열이다.

7. 마치며…

0절의 식을 다시 본다.

E[YF]=argminZL2(F)E[(YZ)2]\mathbb{E}[Y\mid\mathcal{F}] = \arg\min_{Z\in L^2(\mathcal{F})} \mathbb{E}\bigl[(Y-Z)^2\bigr]

지금은 이렇게 읽힌다. F\mathcal{F}는 집합의 집합이 아니라 부분공간 L2(F)L^2(\mathcal{F})의 이름으로 읽힌다. 정보가 많으면 부분공간이 크고, 아래첨자 tt는 그 부분공간의 이름표다. 나무에서 그 공간은 1차원·2차원·4차원이었다. argmin\arg\min은 숫자가 아니라 함수를 돌려주고, 그 함수의 차원은 YY의 차원이며, 정보 자체에는 단위가 없다. 화폐 단위를 바꿔도 사영은 따라 움직일 뿐 모양이 변하지 않는다. 최소화의 1계 조건이 직교조건이고, 직교조건에 지표함수를 넣으면 학부의 조건부 확률 공식이 나온다 — 학부 공식은 틀린 것이 아니라 유한 분할이라는 특수경우다. 첨자 tt를 떼는 조작은 ΠF0ΠFt=ΠF0\Pi_{\mathcal{F}_0}\Pi_{\mathcal{F}_t}=\Pi_{\mathcal{F}_0}이며, W07의 P2=PP^2=P, P=PP'=P가 함수 공간에서 Π2=Π\Pi^2=\Pi, 자기수반으로 다시 나온다. 남은 오차는 정보로 만든 어떤 양과도 내적이 0이고, 그것이 Hall의 검정이 묻는 전부다. 예측의 경로에 붙은 마팅게일이라는 이름은 이 직교의 시간축 판이다. 세 변의 제곱 251.942+256.608=508.550251.942+256.608=508.550이 그 모든 문장의 숫자 판이다.

최소 ⇒ 직교가 안 되면 3절의 (7)로, 타워가 안 되면 (11)로 돌아간다.

다음 회차 W15 · 측도를 바꾼다는 것은 내적의 가중치인 확률 PP 자체를 다른 확률 QQ로 바꾸면 어느 사영이 보존되는지를 묻는다.


이어지는 자료 — MIT OCW 6.262(Gallager) 강의노트 1·7장 — 단행본에서는 1·9장 Gallager, 2013 · Durrett(가정 확인용) Durrett, 2019 · Williams, Probability with Martingales 9장 — 조건부 기댓값을 사영으로 정의하는 방식 그대로 Williams, 1991 · Luenberger, Optimization by Vector Space Methods 3장 — 사영 정리 Luenberger, 1969

References
  1. Cochrane, J. H. (2005). Asset Pricing (Revised). Princeton University Press.
  2. Hall, R. E. (1978). Stochastic Implications of the Life Cycle-Permanent Income Hypothesis: Theory and Evidence. Journal of Political Economy, 86(6), 971–987. 10.1086/260724
  3. Muth, J. F. (1961). Rational Expectations and the Theory of Price Movements. Econometrica, 29(3), 315–335.
  4. Luenberger, D. G. (1969). Optimization by Vector Space Methods. Wiley.
  5. Durrett, R. (2019). Probability: Theory and Examples (5th ed.). Cambridge University Press.
  6. Boyd, S., & Vandenberghe, L. (2018). Introduction to Applied Linear Algebra: Vectors, Matrices, and Least Squares. Cambridge University Press.
  7. Hansen, L. P., & Singleton, K. J. (1982). Generalized Instrumental Variables Estimation of Nonlinear Rational Expectations Models. Econometrica, 50(5), 1269–1286. 10.2307/1911873
  8. Gallager, R. G. (2013). Stochastic Processes: Theory for Applications. Cambridge University Press.
  9. Williams, D. (1991). Probability with Martingales. Cambridge University Press.