I1 · 유한차원에서 당연했던 결론의 가정#
미래를 더 길게 넣으면 같은 문제가 되는가#
매년 한 단위의 편익을 주는 설비의 현재가치를 생각해 봅시다. 편익의 단위는 만 원, 할인인자은 \(\beta=1/2\)이며, 무한기간 가치는 \(v=1+\beta v\)를 만족해야 합니다. 0에서 시작하여 기간을 하나씩 늘리면
각 유한 문제의 해가 존재한다는 것만으로 무한 문제의 해를 얻는 것은 아닙니다. 극한을 담을 공간, 그 공간의 거리, 방정식을 극한으로 넘기는 연속성이 필요합니다. 실수에서는 세 조건이 익숙해서 드러나지 않았을 뿐입니다.
이번 장의 또 다른 모형은 미래의 충격계수 \(x=(x_1,x_2,\ldots)\)입니다. 서로 직교하는 단위분산 충격의 가중합을 제곱평균으로 평가하면 자연스러운 허용조건은 \(\sum_k|x_k|^2<\infty\)입니다. 이 공간을 \(\ell^2\), 노름을 \(\|x\|_2=(\sum|x_k|^2)^{1/2}\)라고 합니다. 계수는 표준화한 산출 단위로 측정합니다. 유한개 충격만 허용하는 부분공간 \(c_{00}\)에서는
가 Cauchy 열입니다. \(M>N\)이면
그 극한 \(x=(1/k)_{k\ge1}\)은 \(\ell^2\)에 있지만 \(c_{00}\)에는 없습니다. 허용한 모형의 밖으로 빠져나간 것입니다. 모든 Cauchy 열의 극한을 자기 안에 갖는 노름공간을 완비라고 하고, 완비 노름공간을 Banach 공간이라 합니다.
\(\ell^p\)는 \(1\le p<\infty\)에서 완비입니다. 실제로 Cauchy 열의 각 좌표는 Cauchy이므로 좌표극한 \(x_k\)가 존재합니다. \(\|x^{(n)}-x^{(m)}\|_p\le\varepsilon\)인 \(n,m\ge N\)에 대해 먼저 유한 \(K\)개 좌표의 합을 취하고 \(m\to\infty\)를 보내면 \(\sum_{k\le K}|x_k^{(n)}-x_k|^p\le\varepsilon^p\). \(K\to\infty\)로 보내면 노름수렴이 나옵니다. \(x\)의 유한 노름은 \(x=x^{(N)}+(x-x^{(N)})\)와 삼각부등식에서 따릅니다. \(\ell^\infty\)의 경우에는 모든 좌표에 공통인 sup 경계가 같은 역할을 합니다.
\(C[0,1]\)은 sup 노름에서는 완비입니다. Cauchy 열의 점별극한에 균등한 Cauchy 경계를 넘기면 균등수렴이고, 균등극한은 연속입니다. 반면 적분노름 \(\|f\|_2\)에서는 불완비합니다. \(1\{t>1/2\}\)의 점프를 폭 \(2/N\)의 직선으로 연결한 연속함수 \(f_N\)은 그 계단함수에 \(L^2\) 수렴합니다. 오차제곱은 최대 \(2/N\)이지만 계단함수와 거의 모든 곳에서 같은 연속함수는 존재하지 않습니다. \(L^p\)의 완비성에는 적분의 극한 정리가 필요하며, 다음 장에서 \(L^2\)를 직접 증명합니다.
차원이 고정되어야 하는 노름 동치#
유한차원에서는 노름을 바꾸어도 수렴 여부가 바뀌지 않습니다. 하지만 상수까지 차원에 독립인 것은 아닙니다.
오른쪽 상수 \(\sqrt n\)은 \(x=(1,\ldots,1)\)에서 실제로 달성됩니다. 임의의 무작위 벡터 몇 개를 생성하여 이 최대값을 증명할 수는 없습니다. \(c_{00}\)에서 길이 \(n\)인 벡터 \(x^{(n)}=(1/n,\ldots,1/n,0,\ldots)\)는 \(\|x^{(n)}\|_1=1\), \(\|x^{(n)}\|_2=1/\sqrt n\to0\)이므로 모든 차원에 공통인 동치상수는 없습니다.
유한차원의 또 다른 특권은 닫힌 유계집합의 컴팩트성입니다. \(\ell^2\)의 단위벡터 \(e_n\)은 모두 단위구에 있지만 \(\|e_n-e_m\|_2=\sqrt2\)여서 수렴 부분열이 없습니다. 뒤의 Riesz 보조정리는 이런 분리된 열을 모든 무한차원 노름공간에서 구성합니다. 완비성만으로 컴팩트성이 생기는 것은 아닙니다.
작은 관측오차와 폭발하는 복원값#
관측장치가 \(k\)번째 충격계수를 \(1/k\)만큼 약화시킨다고 하자.
\(\|Dx\|_2\le\|x\|_2\)이고 \(De_1=e_1\)이므로 \(\|D\|=1\)입니다. \(Dx=0\)이면 모든 \(x_k=0\)이므로 단사입니다. 그럼에도 \(y=(1/k)\)를 정확히 관측했다고 해 보겠습니다. 해는 모든 좌표가 1이어야 하므로 \(\ell^2\)에 속하지 않습니다. \(y\)는 상에 없습니다.
절단 \(y^{(N)}=(1/k)_{k\le N}\)은 상에 있고 대응하는 해는 \(x^{(N)}=(1,\ldots,1,0,\ldots)\)입니다. 관측은 \(y\)에 수렴하는데 해의 노름은 \(\sqrt N\)으로 발산합니다. 더 직접적으로 \(\|De_N\|=1/N\)인 반면 \(\|e_N\|=1\)이므로 상 위 역작용소는 유계가 아닙니다.
그림 161 절단 관측의 오차 상한 \(N^{-1/2}\)과 해의 노름 \(N^{1/2}\)이다. 둘 다 같은 무차원 노름이며 양축은 로그다. 파선은 오차 자체가 아니라 적분 비교로 얻은 상한이다. 상의 폐포에 접근하는 것과 해의 존재가 다름을 보여 준다.#
선형이라는 사실도 연속성을 보장하지 않습니다. \(c_{00}\)에서 \(f(x)=\sum kx_k\)는 모든 입력마다 유한합이라 잘 정의됩니다. \(x^{(N)}=e_N/N\)은 노름이 0으로 가지만 \(f(x^{(N)})=1\)입니다. 이를 \(\ell^2\) 전체의 같은 무한급수로 정의하면 발산하는 입력이 생깁니다. 대신 선택공리의 한 형태인 Zorn 보조정리를 전제로 \(\{e_n\}\)을 Hamel 기저로 확장하고, \(f(e_n)=n\), 다른 기저벡터에서는 0으로 정한 후 유한 선형결합으로 연장하면 전체 \(\ell^2\) 위 불연속 선형범함수가 됩니다.
표준 단위벡터는 \(\ell^2\)의 Schauder 기저입니다. \(x=\lim_N\sum_{k\le N}x_ke_k\)가 노름으로 수렴합니다. 무한합을 허용하지 않는 Hamel 기저는 아닙니다. 두 종류의 기저를 혼동하면 모든 선형범함수를 내적으로 표현할 수 있다는 잘못된 결론을 냅니다. Hilbert 공간의 Riesz 표현은 유계 범함수에 관한 정리입니다.
그림 162 \(f_N(x)=\sum_{k=1}^N kx_k\)의 노름은 \(\sqrt{N(N+1)(2N+1)/6}\)이다. 양축은 로그이며 파선은 점근 비교 \(N^{3/2}/\sqrt3\)이다. 각 절단이 연속이라는 사실은 무한차원에서 공통인 유계성을 주지 않는다.#
유한차원의 rank–nullity는 대수적으로 무한차원에서도 기수 차원의 등식으로 성립합니다. 실패하는 것은 \(\infty\)를 빼서 단사와 전사를 연결하는 추론입니다. 오른쪽 이동 \(S(x_1,x_2,\ldots)=(0,x_1,x_2,\ldots)\)는 단사이고 상은 닫혔지만 첫 좌표를 만들 수 없습니다. 왼쪽 이동은 전사지만 핵이 \(\operatorname{span}(e_1)\)입니다. 핵과 상의 여차원이 유한이고 상이 닫힌 유계작용소를 Fredholm이라 하며
로 정의합니다. 오른쪽 이동의 지표는 \(-1\), 왼쪽은 \(1\). 유한차원 \(T:\mathbb R^n\to\mathbb R^m\)에서는 \((n-r)-(m-r)=n-m\)입니다. 컴팩트 섭동 아래 지표 불변은 외부 Fredholm 이론의 정리로만 소개합니다. 이 장의 고정점 증명에는 사용하지 않습니다.
두 상태의 설비를 운용하는 동적계획#
상태 1은 정상, 상태 2는 고장입니다. 매기 편익 단위는 만 원, 할인은 \(\beta=1/2\). 정상에서는 편익 1을 받고 그대로 남습니다. 고장에서는 두 행동을 고릅니다. 기다리면 편익 0과 고장 상태, 수리하면 현재 편익 \(-1/2\)와 다음 기간 정상 상태를 얻습니다. Bellman 식은
정상 가치 \(v_1^*=2\)이므로 고장에서 수리 가치 \(1/2\)를 얻습니다. 기다리기 가치는 \(1/4\)라서 \(v^*=(2,1/2)\)가 유일한 해입니다. 값반복은
가 됩니다. 두 번째 반복에는 두 행동이 동률이고, 세 번째부터 수리가 선택됩니다. sup 오차는 이 예에서 \(2^{1-k}\)입니다. 일반 할인 Bellman에서 증명되는 것은 \(\|v_k-v^*\|_\infty\le\beta^k\|v_0-v^*\|_\infty\)라는 상한입니다. 모든 초기값의 실제 비율이 정확히 \(\beta\)일 필요는 없습니다.
정책을 고정하면 값은 선형계로 구합니다. 기다리기 정책은 \(P=I,r=(1,0)\)이므로 \(v=(2,0)\). 여기서 greedy 개선은 수리를 고릅니다. 수리 정책은
이며 해는 바로 \((2,1/2)\)입니다. 큰 상태공간에서는 이 선형계를 희소 직접법이나 N8의 Krylov 방법으로 풀 수 있습니다. 부정확한 정책평가는 정확한 정책반복의 단조성 증명과 별도로 잔차를 통제해야 합니다.
그림 163 값반복은 한 단계마다 오차가 절반이 된다. 정책평가는 기다리기·수리 정책의 선형계 두 개를 풀어 정확한 최적값에 도달한다. 세로축은 선형이므로 정책반복의 0 오차도 표시한다. 두 방법의 단계당 비용은 다르다.#
유한 행동에서 \(T\)는 조각별 affine입니다. 활성 정책이 \(\sigma\)인 조각에서 \(F(v)=v-Tv\)에 Newton을 적용하면 \(v_{\rm new}=(I-\beta P_\sigma)^{-1}r_\sigma\)입니다. 하지만 조각 경계에서는 보통 미분가능하지 않습니다. 따라서 이를 근거로 모든 정책반복에 보편적 2차 수렴이나 3–5회 종료를 붙이지 않습니다. 유한 정책에서는 동률 때 기존 행동을 유지하는 규칙 아래 유한 종료를 증명할 수 있고, 최적 행동의 엄격한 간극이 있으면 그 근방에서는 올바른 조각을 골라 한 번에 끝납니다.
import numpy as np
beta=.5
star=np.array([2.,.5])
def bellman(v):
return np.array([1+.5*v[0],max(.5*v[1],-.5+.5*v[0])])
v=np.zeros(2); errors=[]
for k in range(12):
errors.append(np.max(abs(v-star))); v=bellman(v)
assert np.allclose(errors,2.*.5**np.arange(12))
Pwait=np.eye(2); Prepair=np.array([[1.,0],[1,0]])
vwait=np.linalg.solve(np.eye(2)-beta*Pwait,[1,0])
vp=np.linalg.solve(np.eye(2)-beta*Prepair,[1,-.5])
assert np.allclose(vwait,[2,0]) and np.allclose(vp,star)
print('VFI errors:',np.round(errors[:7],6),'policy values:',vwait,vp)
VFI errors: [2. 1. 0.5 0.25 0.125 0.0625 0.03125] policy values: [2. 0.] [2. 0.5]
모든 연속 관측값이 수렴한다는 뜻#
노름수렴보다 약한 수렴도 쓸 수 있습니다. 모든 유계 선형범함수 \(f\)에 대해 \(f(x_n)\to f(x)\)이면 \(x_n\)이 \(x\)로 약수렴한다고 합니다. 쌍대공간 \(X^*\)에서는 모든 \(x\in X\)에 대해 \(f_n(x)\to f(x)\)일 때 약수렴이라 합니다. 약수렴은 \((X^*)^*\)의 모든 관측을 쓰고, 약수렴은 원래 \(X\)가 주는 관측만 쓴다는 차이가 있습니다.
\(\ell^2\)에서 \(e_n\)은 0으로 약수렴하지만 노름수렴하지 않습니다. 다음 장에서 증명할 Riesz 표현에 의해 유계 관측은 \(f_y(x)=\langle x,y\rangle\)이고, \(f_y(e_n)=\overline{y_n}\to0\)이기 때문입니다. Hahn–Banach 분리 원리는 연속 관측으로 노름과 닫힌 볼록집합을 구별할 수 있게 합니다. Banach–Alaoglu 정리는 쌍대공간의 닫힌 단위구가 약*컴팩트하다는 외부 전제로 인용합니다. 이는 일반적으로 모든 수열에 수렴 부분열이 있다는 말과 같지 않으며, 원공간의 분리가능성 같은 조건이 있어야 단위구 위에서 거리화할 수 있습니다.
약컴팩트한 비어 있지 않은 집합 \(K\)와 약하반연속 실함수 \(J\)가 있고 \(a=\inf_K J\)가 유한하면 최소화자는 존재합니다. 각 \(K_n=\{x\in K:J(x)\le a+1/n\}\)은 비어 있지 않은 닫힌집합이고 유한 교차가 비지 않습니다. 컴팩트성으로 \(\bigcap K_n\ne\varnothing\), 그 점에서 \(J=a\)입니다. 수열의 부분열을 무조건 뽑지 않고 닫힌집합의 교차를 쓴 이유가 여기에 있습니다. 함수공간의 경제모형에서도 허용집합의 컴팩트성과 목적함수의 하반연속성을 각각 확인해야 합니다.
N=np.array([10,100,1000])
norm_f=np.sqrt(N*(N+1)*(2*N+1)/6)
for n in N:
k=np.arange(1,n+1,dtype=float)
x=k/np.linalg.norm(k)
assert np.allclose(k@x,np.sqrt(n*(n+1)*(2*n+1)/6))
assert np.allclose(np.linalg.norm(np.ones(n)),np.sqrt(n))
print('N, norm(f_N), norm(D^-1 y_N):')
print(np.column_stack([N,norm_f,np.sqrt(N)]))
N, norm(f_N), norm(D^-1 y_N):
[[1.00000000e+01 1.96214169e+01 3.16227766e+00]
[1.00000000e+02 5.81678605e+02 1.00000000e+01]
[1.00000000e+03 1.82711111e+04 3.16227766e+01]]
연습문제와 전체 풀이#
1. 닫힘과 완비성. \(c_{00}\)가 \(\ell^2\)에서 조밀하지만 닫히지 않음을 증명하라.
풀이. 임의의 \(x\in\ell^2\)에 대해 앞 \(N\)개 좌표만 남긴 \(x^{(N)}\)는 \(c_{00}\)에 있고 \(\|x-x^{(N)}\|^2=\sum_{k>N}|x_k|^2\to0\). 따라서 조밀합니다. 그러나 \((1/k)\)는 그 안에 없으므로 진부분공간입니다. 조밀한 닫힌 부분공간은 전체와 같아야 하므로 닫히지 않습니다.
2. 연속함수 위의 관측. \(C[0,1]\)의 sup 노름에서 \(f\mapsto f(1/2)\), \(f\mapsto\int_0^1f\)의 노름을 구하고, 미분값 관측과 비교하라.
풀이. 두 값의 절댓값은 모두 \(\|f\|_\infty\) 이하이며 상수함수 1에서 등호라서 노름은 1입니다. \(f'(1/2)\)는 \(C[0,1]\) 전체에서 정의되지 않습니다. 정의역을 \(C^1[0,1]\)로 좁혀도 sup 노름에서는 유계가 아닙니다. \(f_n(t)=\sin(n(t-1/2))\)는 sup 노름이 1 이하인데 \(f_n'(1/2)=n\). \(C^1\) 노름 \(\|f\|_\infty+\|f'\|_\infty\)를 쓰면 미분값 관측은 유계입니다. 정의역과 노름을 모두 말해야 합니다.
3. 실제 할인비율과 상한. \(T(v)=r+\beta Pv\)의 오차가 항상 정확히 \(\beta\) 비율로 줄어드는지 판정하라.
풀이. \(P=\frac12\left(\begin{smallmatrix}1&1\\1&1\end{smallmatrix}\right)\)와 초기오차 \((1,-1)\)이면 \(P(1,-1)^T=0\)이라 한 단계 뒤 오차가 0입니다. 반면 상수오차 \(c\mathbf1\)은 \(P\mathbf1=\mathbf1\) 때문에 정확히 \(\beta\)배가 됩니다. \(\beta\)는 모든 입력에 공통인 최악 상한이며 각 경로의 필수 비율은 아닙니다.
4. McCall 모형의 예약임금. 임금 \(w\)는 유한 집합에서 독립 추출되고 취업하면 영구히 \(w\)를 받습니다. 실업 편익은 \(b\), 할인 \(0<\beta<1\)입니다. 실업가치 \(U\)의 존재·유일성과 수락 조건을 구하라.
풀이. \(G(U)=b+\beta E\max\{w/(1-\beta),U\}\)는 실수에서 \(\beta\)-축약입니다. 따라서 유일한 \(U^*\)가 있습니다. 일자리 제안을 받으면 \(w/(1-\beta)\ge U^*\)일 때 수락할 수 있으므로 예약 기준은 \(w\ge(1-\beta)U^*\). 등호에서는 무차별입니다. \(b\)를 높이면 \(G\)가 점별로 증가합니다. 기존 고정점에서 새 \(G\)를 반복하면 단조 증가하여 새 고정점에 도달하므로 기준도 약하게 증가합니다. 유한 임금격자에서 실제 수락집합이 매번 엄격히 바뀌는 것은 아닙니다.
5. 작은 잔차로 인증하기. \(\|Tv-v\|_\infty\le\epsilon\)일 때 최적값 오차를 구하라.
풀이. \(\|v-v^*\|\le\|v-Tv\|+\|Tv-Tv^*\|\le\epsilon+\beta\|v-v^*\|\). 이항하면 \(\|v-v^*\|\le\epsilon/(1-\beta)\). \(\beta=.99\)이면 잔차 \(10^{-4}\)만으로 보장되는 오차는 \(10^{-2}\)입니다. 할인인자이 1에 가까우면 같은 종료허용오차를 더 엄격하게 설정해야 합니다.
6. 단사·전사와 지표. \(D=\operatorname{diag}(1/k)\)가 Fredholm인지 판정하라.
풀이. 핵은 0이지만 상이 닫히지 않으므로 Fredholm이 아닙니다. \(\overline{\operatorname{ran}D}=\ell^2\)라는 사실을 상 자체의 여차원 0과 혼동해서 지표 0을 부여할 수 없습니다. 오른쪽 이동은 상이 첫 좌표 0인 닫힌 초평면이어서 지표 \(-1\)입니다. 두 작용소는 모두 단사지만 실패하는 조건이 서로 다릅니다.
지금까지의 내용을 수학의 언어로 정리해 봅시다#
미래 기간을 늘리는 일, 관측을 역으로 푸는 일, 정책가치를 반복하는 일에서 필요한 조건을 분리했습니다. 이제 유한차원의 특권과 완비성으로 복구되는 결론을 각각 증명합니다. 실수의 완비성, 유클리드 공간의 Heine–Borel 정리, 적분의 기본 극한 정리, Zorn 보조정리는 출발 전제입니다.
정리 1 · 유한차원 노름 동치와 세 결과. 유한차원 공간의 두 노름은 동치입니다. 따라서 유한차원 노름공간은 완비이고, 임의의 노름공간 안의 유한차원 부분공간은 닫히며, 유한차원 정의역의 모든 선형사상은 연속입니다.
증명. 기저 \(b_1,\ldots,b_n\)에 대해 \(F(a)=\sum a_ib_i\)라 놓습니다. 임의의 노름 \(N\)에서 \(N(F(a))\le\sum|a_i|N(b_i)\le C\|a\|_2\). 역삼각부등식으로 \(|N(F(a))-N(F(c))|\le C\|a-c\|_2\)이므로 좌표에서 연속입니다. 유클리드 단위구면은 컴팩트하고 \(F\)는 단사이므로 그 위 최소값 \(c\)가 양수입니다. 동차성으로 \(c\|a\|_2\le N(F(a))\le C\|a\|_2\). 두 노름을 각각 좌표노름과 비교하면 동치입니다.
Cauchy 열의 좌표는 \(\mathbb R^n\) 또는 \(\mathbb C^n\)에서 Cauchy이므로 좌표극한이 있고, 위 상한으로 원공간에서도 수렴합니다. 부분공간 \(M\)의 열이 큰 공간에서 \(x\)로 수렴하면 Cauchy이고, \(M\)의 완비성으로 어떤 \(m\in M\)에도 수렴합니다. 거리공간 극한의 유일성으로 \(x=m\). 마지막으로 선형 \(A\)에 대해 \(\|AF(a)\|\le\sum|a_i|\|Ab_i\|\le C_A\|a\|_2\le(C_A/c)\|F(a)\|\)이므로 유계이고 연속입니다. \(\square\)
정리 2 · Riesz 보조정리와 단위구. 닫힌 진부분공간 \(M\subset X\)와 \(0<\theta<1\)에 대해 \(\|x\|=1\), \(\operatorname{dist}(x,M)>\theta\)인 \(x\)가 있습니다. 닫힌 단위구가 컴팩트일 필요충분조건은 유한차원입니다.
증명. \(y\notin M\)을 고르고 \(d=\inf_{m\in M}\|y-m\|>0\)라 합시다. \(\|y-m_0\|<d/\theta\)인 \(m_0\in M\)이 존재합니다. \(x=(y-m_0)/\|y-m_0\|\)이면 임의의 \(m\in M\)에 대해
무한차원이라면 이미 선택한 유한개의 단위벡터의 span은 정리 1에 의해 닫힌 진부분공간입니다. \(\theta=1/2\)로 보조정리를 반복하면 서로 거리가 \(1/2\)보다 큰 무한열을 만듭니다. 수렴 부분열이 없으므로 단위구는 컴팩트하지 않습니다. 유한차원에서는 정리 1과 Heine–Borel로 닫힌 단위구가 컴팩트합니다. \(\square\)
정리 3 · 범함수의 연속성. 선형범함수 \(f:X\to\mathbb F\)에 대해 연속, \(|f(x)|\le C\|x\|\), 핵의 닫힘은 동치입니다.
증명. 0에서 연속이면 어떤 \(\delta>0\)에 대해 \(\|x\|<\delta\)일 때 \(|f(x)|<1\). \(x\ne0\)에 \(\delta x/(2\|x\|)\)를 대입하면 \(|f(x)|\le2\|x\|/\delta\). 유계이면 \(|f(x)-f(y)|\le C\|x-y\|\)라서 연속입니다. 연속이면 \(\ker f=f^{-1}(\{0\})\)가 닫힙니다.
역으로 \(f\ne0\)이고 핵이 닫혔다면 \(f(z)=1\)인 \(z\)와 \(d=\operatorname{dist}(z,\ker f)>0\)를 잡습니다. \(f(x)\ne0\)일 때 \(z-x/f(x)\in\ker f\)이므로 \(d\le\|x\|/|f(x)|\). \(f(x)=0\)인 경우도 포함하여 \(|f(x)|\le\|x\|/d\). 영범함수의 경우 세 조건은 모두 성립합니다. \(\square\)
정리 4 · 축약과 Neumann 급수. 비어 있지 않은 완비 거리공간의 \(\beta\)-축약 \(T\), \(0\le\beta<1\)은 유일한 고정점 \(x^*\)를 가지며
Banach 공간 위 유계선형 \(A\)가 \(\|A\|<1\)이면 \((I-A)^{-1}=\sum_{j\ge0}A^j\)입니다.
증명. \(x_{k+1}=Tx_k\)라 하면 \(d(x_{k+1},x_k)\le\beta^kd(x_1,x_0)\). \(m>k\)에 삼각부등식을 적용해 \(d(x_m,x_k)\le\beta^kd(x_1,x_0)/(1-\beta)\)를 얻습니다. Cauchy 열이므로 \(x_k\to x^*\). 축약은 연속이므로 \(Tx^*=\lim Tx_k=x^*\). 두 고정점의 거리는 자기 자신의 \(\beta\)배 이하이므로 0입니다. \(m\to\infty\)로 보내면 표시한 오차 경계가 나옵니다.
Neumann 급수는 각 \(x\)에 대해 \(\sum\|A^jx\|\le\|x\|/(1-\|A\|)\)라서 수렴합니다. 그 합 \(Bx\)는 선형이고 유계입니다. 유한합에 \((I-A)\)를 왼쪽·오른쪽으로 곱하면 \(I-A^{N+1}\)이며 나머지의 노름이 0으로 갑니다. 따라서 \((I-A)B=B(I-A)=I\). \(\square\)
정리 5 · Blackwell 조건과 정책반복. 유계함수 공간에서 \(T\)가 단조이고 \(T(v+c\mathbf1)=Tv+\beta c\mathbf1\)이면 sup 노름의 \(\beta\)-축약입니다. 유한 상태·유한 행동 할인 MDP의 정확한 정책반복은 동률에서 기존 행동을 유지하면 유한 종료합니다.
증명. \(a=\|v-w\|_\infty\)라 하면 \(w-a\mathbf1\le v\le w+a\mathbf1\). 단조성과 할인성을 적용하여 \(Tw-\beta a\mathbf1\le Tv\le Tw+\beta a\mathbf1\)을 얻습니다. 유계함수 공간은 균등극한으로 완비이므로 정리 4를 적용합니다. Bellman의 유한 최대는 단조성과 할인성을 모두 만족합니다.
정책 \(\sigma\)의 전이행렬은 확률행렬이므로 \(\|P_\sigma\|_\infty=1\). Neumann 급수로 \((I-\beta P_\sigma)^{-1}\ge0\)입니다. 현재 정책값 \(v_\sigma\)에서 greedy 정책 \(\tau\)를 택하면 \(g=T_\tau v_\sigma-v_\sigma=Tv_\sigma-v_\sigma\ge0\). 따라서
행동이 바뀌면 동률 유지 규칙상 적어도 한 좌표에서 \(g>0\)이고 역행렬 급수의 첫 항이 \(I\)이므로 그 좌표의 가치가 엄격히 증가합니다. 이미 방문한 정책으로 돌아갈 수 없고 정책 수가 유한하므로 종료합니다. 종료 시 \(Tv_\sigma=v_\sigma\)이며 고정점 유일성으로 최적값입니다. 최적 정책이 각 상태에서 엄격한 행동 간극을 갖는다면 유한개의 연속 affine 함수 사이 간극은 충분히 작은 근방에서도 유지됩니다. 그 근방의 한 정책평가는 정확한 최적값을 줍니다. \(\square\)
정리 6 · 실수 Hahn–Banach 연장. 실수 벡터공간 \(X\)의 부분공간 \(M\)에서 선형 \(f\)가 준선형 함수 \(p\)에 대해 \(f\le p\)이면 전체 \(X\)에 같은 지배를 유지하는 선형 연장이 있습니다. 여기서 준선형은 양의 동차성과 준가법성을 뜻합니다.
증명. \(z\notin M\)을 하나 더 넣을 때 \(\widetilde f(m+tz)=f(m)+ta\)로 정의하려 합니다. 가능한 \(a\)의 조건은
왼쪽의 임의 항과 오른쪽의 임의 항 사이 부등식은 \(f(m+n)\le p(m+n)\le p(m-z)+p(n+z)\)에서 나옵니다. 양쪽에는 유한한 상·하한이 있으므로 사이의 실수 \(a\)를 선택할 수 있습니다. \(t>0\)과 \(t<0\)에 각각 위 경계를 적용하고 동차성을 쓰면 \(\widetilde f\le p\), \(t=0\)에는 원래 조건이 됩니다. 지배된 모든 연장을 정의역 포함으로 순서화합니다. 사슬의 합집합은 값이 모순되지 않는 지배된 연장입니다. Zorn 보조정리로 극대 연장이 존재하고, 정의역이 전체가 아니면 한 차원 연장이 가능하여 모순입니다.
특히 \(p(x)=\|f\|\|x\|\)로 놓으면 \(f\)의 노름을 유지하는 연장을 얻습니다. \(x\ne0\)의 span에서 \(f(tx)=t\|x\|\)를 연장하면 노름 1인 관측이 \(x\)의 노름을 정확히 읽습니다. 닫힌 부분공간 \(M\)과 \(x\notin M\)은 몫공간의 노름 \(\|x+M\|=\operatorname{dist}(x,M)>0\)에 이 결과를 적용하여 분리할 수 있습니다. 복소 범함수는 실수부를 연장한 \(g\)에서 \(F(x)=g(x)-ig(ix)\)로 복원합니다. \(|F(x)|\)를 실수 양수로 만드는 위상회전을 적용하면 \(|F(x)|\le\|f\|\|x\|\)도 유지됩니다. \(\square\)
무한차원에서는 완비성·닫힘·유계성을 각각 확인해야 합니다. 다음 장에서는 완비 내적공간에서 사영을 복원하고, 정보가 늘어날 때 조건부 예측이 어떻게 수렴하는지 살펴봅니다. I2로 이어 읽기.