I3 · 역문제의 해가 유일해도 계산이 불안정한 이유#
평균으로 관측한 반응함수를 되찾기#
가격 \(X\)가 수요에 주는 반응 \(h(X)\)를 알고 싶지만 가격은 수요충격과 함께 결정됩니다. 도구변수 \(Z\)를 조건으로 \(E[Y-h(X)\mid Z]=0\)을 가정하면 관측되는 함수 \(g(z)=E[Y\mid Z=z]\)와 구조함수 사이 식은
입니다. \(h\)와 \(g\)의 단위는 수요 단위이며 \(T\)는 조건부 평균을 취하는 무차원 작용소입니다. \(L^2(P_X)\)와 \(L^2(P_Z)\)를 쓰면 조건부 Jensen으로 \(\|Th\|_2\le\|h\|_2\)입니다. 관측을 평균 내면서 일부 방향이 약해집니다. \(T\)의 단사성은 모멘트모형 안에서 식별을 뜻하지만, \(T^{-1}\)의 안정성까지 주지는 않습니다.
I1의 대각 예를 작은 행렬로 보겠습니다. 세 직교 방향에서
세 번째 관측에 \(\delta\)가 더해지면 역해는 \((1,1,1+3\delta)\)입니다. \(N\)번째 방향까지 늘리면 그 방향의 잡음은 \(N\delta\)로 증폭됩니다. 모든 유한 절단은 가역이지만 공통인 역노름 상한은 없습니다. 이것이 무한차원의 컴팩트 역문제가 만드는 현상입니다.
수반과 네 부분공간에서 필요한 폐포#
유계선형 \(T:H_1\to H_2\)의 작용소노름은 \(\|T\|=\sup_{\|x\|\le1}\|Tx\|\)입니다. I2의 Riesz 표현에 의해 \(\langle Tx,y\rangle=\langle x,T^*y\rangle\)를 만족하는 수반이 존재합니다. 첫 인수 선형 규약을 계속 씁니다. 유한차원의 전치·켤레전치가 이 정의의 좌표표현이었습니다.
\(x\perp\operatorname{ran}T^*\)일 필요충분조건은 모든 \(y\)에 \(\langle Tx,y\rangle=0\), 즉 \(Tx=0\)입니다. 그래서
두 번째 식에서 폐포를 지울 수 없습니다. \(D=\operatorname{diag}(1/k)\)는 자기수반이고 핵이 0이어서 오른쪽은 \(\ell^2\) 전체입니다. 하지만 \((1/k)\)는 \(D\)의 상에 없습니다. 닫힌 상일 때에만 유한차원과 같은 정확한 직교분해가 복구됩니다.
컴팩트하다는 말의 계산적 의미#
작용소가 유계집합을 상대컴팩트한 집합으로 보내면 컴팩트라고 합니다. 동치로 모든 유계열 \(x_n\)에서 \(Tx_n\)의 수렴 부분열을 뽑을 수 있습니다. 유한랭크 유계작용소는 컴팩트하고, 컴팩트 작용소의 작용소노름 극한도 컴팩트합니다. 후자의 이유는 다음과 같습니다. \(K_j\to K\)이고 \(\|x_n\|\le B\)일 때 각 \(j\)에 대해 부분열을 차례로 뽑아 대각 부분열을 만듭니다. 그 열에서 \(K_jx_n\)은 고정 \(j\)마다 Cauchy입니다. \(\|Kx_n-Kx_m\|\le2B\|K-K_j\|+\|K_jx_n-K_jx_m\|\)로 먼저 \(j\), 다음 \(n,m\)을 고르면 \(Kx_n\)도 Cauchy입니다.
\(I1\)의 \(D\)는 앞 \(N\)개 대각만 남긴 \(D_N\)과 \(\|D-D_N\|=1/(N+1)\)만큼 다르므로 컴팩트입니다. 또한 \(k\in L^2([0,1]^2)\)인 적분핵
은 \(\|T\|\le\|k\|_{L^2}\)이고 컴팩트입니다. 직사각형 단순함수 또는 곱함수의 유한합으로 핵을 \(L^2\) 근사하면 그 적분작용소는 유한랭크이며 같은 노름 경계로 수렴하기 때문입니다. 이런 작용소를 Hilbert–Schmidt라 합니다. 모든 조건부기댓값 작용소가 자동으로 이 종류인 것은 아닙니다. 조건부 밀도비가 해당 곱측도에서 제곱적분가능한지 같은 추가 조건을 확인해야 합니다.
컴팩트 \(T\)는 특이값 \(\sigma_j\downarrow0\)와 직교 방향 \(v_j,u_j\)로
라고 쓸 수 있습니다. 이는 무한차원 SVD입니다. 영공간 성분은 별도로 남습니다. 첫 \(N\)개 항 절단의 작용소노름 오차는 \(\sigma_{N+1}\)이며 어떤 rank \(N\) 근사도 그보다 작게 만들지 못합니다. 하지만 역을 취하면 \(1/\sigma_j\)가 나타납니다. 작용소를 잘 근사하는 일과 역을 잘 근사하는 일은 다릅니다.
그림 167 가로축은 직교 방향 번호, 세로축은 관측의 감쇠율로 로그 눈금이다. 실선 \(1/j\)와 파선 \(e^{-j/5}\)는 서로 다른 교육용 대각작용소다. 역계산은 이 값을 나누므로 작은 특이값의 방향에서 더 많은 정보를 잃는다.#
해의 존재를 검사하는 Picard 조건#
\(g=\sum g_ju_j+g_\perp\)라면 \(Tf=g\)가 풀리려면 먼저 \(g_\perp=0\)이어야 합니다. 그다음 형식적 계수 \(f_j=g_j/\sigma_j\)가 실제로 제곱합가능해야 합니다.
해가 존재하면 이 계수급수가 최소노름 해이고 모든 다른 해는 \(\ker T\)의 원소를 더한 것입니다. \(D\)에서 \(g_j=1/j\), \(\sigma_j=1/j\)이면 합이 \(\sum1\)이라 발산합니다. \(g_j=1/j^2\)이면 \(\sum1/j^2\)라 수렴하며 해는 \((1/j)\)입니다. 폐포에 속하는 것과 상에 속하는 것 사이를 이 조건이 구분합니다.
무한랭크 컴팩트 작용소의 상은 닫힐 수 없습니다. 닫힌 상에서는 핵에 직교하는 방향에 \(\|Tx\|\ge c\|x\|\)인 \(c>0\)가 있어야 하는데, 특이벡터 \(v_j\)에서 \(\|Tv_j\|=\sigma_j\to0\)이므로 모순입니다. 따라서 식별된 무한차원 해가 있어도 일반적인 미세한 관측오차에는 안정적이지 않을 수 있습니다.
나누기 전에 벌점을 넣기#
\(g^\delta\)에 \(\|g^\delta-g\|\le\delta\)인 오차가 있다고 하자. Tikhonov 정칙화는 \(\alpha>0\)에서
를 풉니다. 특이방향마다 \((\sigma_j f_j-g_j^\delta)^2+\alpha f_j^2\)를 최소화하므로
정확한 역해의 각 좌표를 \(q_\alpha\)만큼 줄인 셈입니다. \(\sigma\ll\sqrt\alpha\)인 방향은 강하게 줄어듭니다. 잡음 증폭은
로 유한해집니다. 분모의 완전제곱 \((\sigma-\sqrt\alpha)^2\ge0\)을 쓰면 이 최대값을 바로 얻습니다.
그림 168 가로축은 특이값의 로그 눈금, 세로축은 원래 해를 보존하는 비율이다. \(\alpha\)가 커지면 더 많은 방향을 줄인다. 세 곡선은 같은 축을 사용하므로 분산 감소와 편향 증가를 비교할 수 있다.#
세 방향 예에서 \(\alpha=1/9\)이고 잡음이 없으면 \(f_\alpha=(9/10,9/13,1/2)^T\)입니다. 작은 특이값일수록 더 줄어듭니다. 원래 역해 \((1,1,1)\)와의 차이는 계산 실수가 아니라 의도한 편향입니다.
매끄러움도 어떤 좌표에서 측정하는지 말해야 합니다. \(f^\dagger=(T^*T)^\nu w\), \(\|w\|\le R\), \(0<\nu\le1\)이면
편향 계수는 \(\alpha t^\nu/(t+\alpha)\le\alpha^\nu\)이기 때문입니다. \(\alpha\asymp(\delta/R)^{2/(2\nu+1)}\)로 균형을 맞추면 오차는 \(O(R^{1/(2\nu+1)}\delta^{2\nu/(2\nu+1)})\). 이 직접적인 bound는 \(\nu\le1\)까지입니다. \(\nu>1\)에서는 \(t^\nu/(t+\alpha)\le\|T\|^{2\nu-2}\)를 써서 편향 \(O(\alpha)\), 최악잡음에 대한 표준 보장 \(O(\delta^{2/3})\)에서 포화됩니다. 임의로 \(\nu\to\infty\)를 넣을 수 없습니다.
다항 감쇠와 지수 감쇠의 차이는 같은 함수 매끄러움 척도를 고정해야 비교할 수 있습니다. 예를 들어 \(\sum j^{2s}|f_j|^2\le R^2\)와 결정론적 \(\ell^2\) 잡음한계 \(\delta\)를 쓰고 \(N\)개에서 절단하면 편향 \(\le RN^{-s}\), 잡음 \(\le\delta/\sigma_N\)입니다.
특이값 |
잡음 증폭 |
균형과 복원오차의 차수 |
|---|---|---|
\(\sigma_j\asymp j^{-a}\) |
\(O(\delta N^a)\) |
\(N\asymp(R/\delta)^{1/(s+a)}\), 오차 \(O(R^{a/(s+a)}\delta^{s/(s+a)})\) |
\(\sigma_j\asymp e^{-cj}\) |
\(O(\delta e^{cN})\) |
\(cN+s\log N\asymp\log(R/\delta)\), 오차 \(O(R[\log(R/\delta)]^{-s})\) |
반면 \(f=(T^*T)^\nu w\)라는 조건을 고정하면 특이값 감쇠를 바꿀 때 허용 함수군도 함께 바뀝니다. 그 경우 위 Tikhonov의 \(\delta\) 지수 자체가 다항에서 로그로 바뀐다고 말할 수 없습니다. 통계적 백색잡음 모형은 무한차원 \(\ell^2\) 잡음과도 다르므로 분산항을 새로 계산해야 합니다.
그림 169 본문과 동일한 60차원 절단, 고정 시드, 노름 \(10^{-3}\) 잡음에서 정칙화 크기를 바꾼 실제 복원오차다. 양축은 로그다. 이 곡선의 최소점은 참함수를 알고 구한 진단이며, 실제 자료에서 사용할 수 있는 파라미터 선택법이라고 제시하지 않는다.#
import numpy as np
rng=np.random.default_rng(430)
j=np.arange(1,61,dtype=float); s=np.exp(-j/8)
truth=1/j**2; noise=rng.normal(size=len(j)); noise*=1e-3/np.linalg.norm(noise)
g=s*truth+noise; alpha=1e-5; T=np.diag(s)
f1=np.linalg.solve(T.T@T+alpha*np.eye(len(j)),T.T@g)
f2=s*g/(s*s+alpha)
f3=np.linalg.lstsq(np.vstack([T,np.sqrt(alpha)*np.eye(len(j))]),np.r_[g,np.zeros(len(j))],rcond=None)[0]
assert np.allclose(f1,f2,rtol=1e-10,atol=1e-12)
assert np.allclose(f2,f3,rtol=1e-10,atol=1e-12)
assert np.linalg.norm(f2-truth)<np.linalg.norm(g/s-truth)
print('inverse error:',np.linalg.norm(g/s-truth),'regularized error:',np.linalg.norm(f2-truth))
inverse error: 0.3591786539706033 regularized error: 0.07849425942335292
고윳값으로 보이지 않는 스펙트럼#
\(L^2[0,1]\)에서 \((Mf)(t)=tf(t)\)를 생각해 봅시다. \(M=M^*\)이고 \(\|M\|=1\)이지만 고윳값이 없습니다. \(Mf=\lambda f\)이면 \((t-\lambda)f(t)=0\) a.e.이고, \(\{t=\lambda\}\)는 영측도이므로 \(f=0\)입니다. 그럼에도 스펙트럼은 \([0,1]\) 전체입니다. 스펙트럼은 단순히 고윳값의 집합이 아니라 \(M-\lambda I\)가 유계 역을 갖지 못하는 \(\lambda\)의 집합이기 때문입니다.
\(\lambda\notin[0,1]\)이면 \(1/(t-\lambda)\)가 유계여서 역곱셈이 존재합니다. \(\lambda\in[0,1]\)에서는 길이가 줄어드는 \(\lambda\) 주변 구간의 정규화된 지시함수 \(f_n\)을 잡으면 \(\|f_n\|=1\), \(\|(M-\lambda I)f_n\|\to0\). 유계 역이 있으면 불가능합니다. 자기수반이라는 조건만으로 고유벡터들의 가산 대각화가 나오는 것은 아니며 컴팩트성이 중요한 추가 가정입니다.
함수의 내일과 분포의 내일#
두 소득상태의 전이확률을
라 합시다. 함수 \(f=(0,1)^T\)가 높은 소득상태의 지시함수이면 \(Pf=(.3,.8)^T\)는 각 현재 상태에서 내일 높은 소득일 확률입니다. 현재 확률질량 \(\mu=(1,0)^T\)의 내일 분포는 \(P^T\mu=(.7,.3)^T\). 함수에는 \(P\), 열벡터 분포에는 \(P^T\)가 작용합니다.
일반 Markov 핵에서는 \((Tf)(x)=\int f(y)P(x,dy)\), \((T'\mu)(A)=\int P(x,A)\mu(dx)\)이며 적분의 순서를 바꾸면 \(\int Tf\,d\mu=\int f\,d(T'\mu)\)입니다. 이 측도 쌍대 \(T'\)를 Hilbert 수반 \(T^*\)와 무조건 동일시하지 않습니다. 불변분포 \(\pi\)로 가중한 유한상태 \(L^2(\pi)\)에서는 Hilbert 수반이 \(D_\pi^{-1}P^TD_\pi\)입니다. 이 예의 \(\pi=(.4,.6)\)는 상세균형을 만족하므로 그 수반은 \(P\) 자체입니다.
Doeblin 조건 \(P(x,\cdot)\ge\epsilon\nu(\cdot)\), \(0<\epsilon\le1\)이면 \(P=\epsilon\mathbf1\nu+(1-\epsilon)R\)로 분해됩니다. 총질량 0인 두 확률분포의 차이에는 첫 항이 사라지고, 전변동 거리 \(\sup_A|\mu(A)-\eta(A)|\)가 적어도 \(1-\epsilon\)의 비율 상한으로 줄어듭니다. 확률측도의 공간은 전변동 거리에서 완비이므로 I1의 축약정리가 유일한 불변분포와 기하수렴을 줍니다.
\(\epsilon=1\)이면 한 번에 \(\nu\)로 갑니다. 유한행렬의 실제 장기 감쇠에는 고유방향과 Jordan 인자가 작용하므로 Doeblin 상한을 언제나 정확한 \(|\lambda_2|\)와 같다고 쓰지 않습니다. 격자를 조밀하게 한다고 \(|\lambda_2|\to1\)이 필연적인 것도 아닙니다.
P=np.array([[.7,.3],[.2,.8]]); pi=np.array([.4,.6])
f=np.array([0.,1.]); mu=np.array([1.,0.])
assert np.allclose((P@f)@mu,f@(P.T@mu))
assert np.allclose(P.T@pi,pi)
adj=np.linalg.solve(np.diag(pi),P.T@np.diag(pi))
assert np.allclose(adj,P)
for k in range(8):
muk=np.linalg.matrix_power(P.T,k)@mu
assert np.allclose(.5*np.abs(muk-pi).sum(),.6*.5**k)
print('invariant distribution:',pi,'L2(pi) adjoint:',adj)
invariant distribution: [0.4 0.6] L2(pi) adjoint: [[0.7 0.3]
[0.2 0.8]]
연습문제와 전체 풀이#
1. Volterra의 수반과 경계조건. \((Vf)(x)=\int_0^xf(t)dt\)의 특이계를 구하라.
풀이. Fubini로 \(\langle Vf,g\rangle=\int f(t)\overline{\int_t^1g(x)dx}\,dt\), 따라서 \(V^*g(t)=\int_t^1g(x)dx\). \(w=V^*Vv\)는 \(w'(x)=-\int_0^xv(t)dt\), \(w''=-v\), \(w'(0)=0,w(1)=0\). 고유방정식 \(w=\lambda v\)는 \(-v''=v/\lambda\), \(v'(0)=0,v(1)=0\)를 줍니다. \(\omega_j=(j-1/2)\pi\), \(v_j=\sqrt2\cos(\omega_jx)\), \(u_j=\sqrt2\sin(\omega_jx)\), \(\sigma_j=1/\omega_j\)입니다.
\(VV^*\)의 경계조건은 \(u(0)=0,u'(1)=0\)이므로 둘을 바꾸지 않습니다. \(\sum\sigma_j^2=\iint1\{t<x\}dt\,dx=1/2\). \(g(x)=x\)는 \(V1\)이므로 Picard 조건을 만족합니다. 계단함수 \(1\{x>1/2\}\)는 \(L^2\) 함수의 적분이 갖는 절대연속 버전이 없으므로 상에 없습니다.
2. 최소노름 해와 식별. \(T=\operatorname{diag}(1,1/2,0)\), \(g=(1,1,0)\)의 해와 Tikhonov 극한을 구하라.
풀이. 모든 해는 \((1,2,c)\)이고 최소노름 해는 \((1,2,0)\). 정칙화 해는 \((1/(1+\alpha),(1/2)/(1/4+\alpha),0)\)이므로 그 최소노름 해로 수렴합니다. 정칙화가 유일한 출력을 준다고 원래 모형이 세 번째 계수를 식별한 것은 아닙니다. \(g\)의 마지막 좌표가 0이 아니면 원래 식에는 해가 없습니다.
3. source condition의 포화. \(\nu=2\)라고 무조건 \(O(\delta^{4/5})\)를 주장할 수 있는지 설명하라.
풀이. 편향의 multiplier는 \(\alpha t^2/(t+\alpha)\). 고정 \(t>0\)에서는 \(\alpha\to0\)일 때 \(\alpha t\) 정도여서 \(O(\alpha^2)\)가 아닙니다. 따라서 보편적 \(R\alpha^\nu\) 단계가 실패합니다. 표준 Tikhonov의 qualification은 1이고 일반적인 결정론적 잡음 경계와 균형시키면 \(\alpha+\delta/\sqrt\alpha\)로부터 \(\delta^{2/3}\) 보장을 얻습니다. 특별한 잡음이나 특별한 해에서 더 빠른 실제 오차가 나오는 가능성까지 배제하는 말은 아닙니다.
4. NPIV의 유한 격자. \(X\)의 \(J\)개, \(Z\)의 \(K\)개 셀이 모두 양의 확률을 가지면 어떤 rank를 검사해야 하는가?
풀이. \(T_{kj}=P(X=j\mid Z=k)\)이고 \(g=Th\). 모든 구조함수의 식별은 \(\ker T=0\), 즉 \(\operatorname{rank}T=J\)와 동치이며 \(K\ge J\)가 필요합니다. 확률가중 \(L^2\) 특이값은 \(D_Z^{1/2}TD_X^{-1/2}\)에서 계산해야 합니다. 단순한 유클리드 특이값은 셀확률 변화까지 섞습니다. 특정 유한 격자의 rank 검증은 모든 무한차원 방향의 완비성을 검증하지 못합니다. 하지만 이것만으로 아무 가정 없는 보편적 통계적 검정불가능 정리가 증명되었다고 말할 수는 없습니다.
5. 유한랭크 근사오차. \(D=\operatorname{diag}(1/j)\)의 rank \(N\) 최적 작용소노름 오차와 Hilbert–Schmidt 오차를 구하라.
풀이. 각각 \(1/(N+1)\)와 \((\sum_{j>N}j^{-2})^{1/2}\). 적분 비교로 \(1/\sqrt{N+1}\le(\sum_{j>N}j^{-2})^{1/2}\le1/\sqrt N\). 두 노름의 오차율이 다르므로 어느 노름에서의 좋은 근사인지 명시해야 합니다.
6. 쌍대의 좌표. 균일하지 않은 \(\pi\)에서 \(P^T\)가 \(L^2(\pi)\) 수반인지 확인하라.
풀이. 내적 \(\langle f,g\rangle=g^TD_\pi f\)에 \(\langle Pf,g\rangle=g^TD_\pi Pf=(D_\pi^{-1}P^TD_\pi g)^TD_\pi f\). 따라서 수반은 \(D_\pi^{-1}P^TD_\pi\)입니다. 반면 측도의 질량벡터는 여전히 \(P^T\mu\)로 이동합니다. 분포의 \(\pi\)에 대한 밀도 \(r=D_\pi^{-1}\mu\)를 쓰면 \(r\)의 이동이 바로 Hilbert 수반으로 표현됩니다.
지금까지의 내용을 수학의 언어로 정리해 봅시다#
이제 유한차원에서 배운 수반·SVD·능형회귀를 어떤 조건 아래 옮길 수 있는지 증명합니다. Hilbert 사영과 Riesz 표현은 I2 정리 2, 유한차원 스펙트럼 정리는 H3을 사용합니다. Banach 공간의 유계 전단사 역이 유계라는 열린사상정리의 따름정리는 외부 전제로 명시합니다.
정리 1 · 작용소 공간, 수반, 닫힌 상. \(B(H_1,H_2)\)는 완비이고 수반은 존재·유일하며 \(\|T^*\|=\|T\|\), \(\|T^*T\|=\|T\|^2\)입니다. 위 네 부분공간 항등식이 성립하고, \(\operatorname{ran}T\)가 닫힐 필요충분조건은 \(\ker T\)의 직교여공간에서 \(T\)가 아래로 유계인 것입니다. 이는 \(\operatorname{ran}T^*\)의 닫힘과도 동치입니다.
증명. 작용소노름 Cauchy 열 \(T_n\)에 각 \(x\)의 극한 \(Tx=\lim T_nx\)를 정의합니다. 극한은 선형이고 \(\sup_n\|T_n\|<\infty\)로 유계입니다. \(\|T_nx-T_mx\|\le\epsilon\|x\|\)를 \(m\to\infty\)로 보내고 단위구 supremum을 취하면 노름수렴입니다. 같은 공간의 곱은 \(\|ST\|\le\|S\|\|T\|\)이므로 \(B(H)\)는 Banach 대수입니다.
고정 \(y\)에 \(x\mapsto\langle Tx,y\rangle\)는 노름 \(\le\|T\|\|y\|\)의 유계범함수입니다. Riesz로 유일한 \(T^*y\)가 생깁니다. 둘째 인수의 켤레선형성과 표현의 유일성이 \(y\)에 대한 선형성을 줍니다. \(\|T^*\|\le\|T\|\), 그리고 \(\|Tx\|=\sup_{\|y\|=1}|\langle x,T^*y\rangle|\)로 반대 부등식입니다. \(\|Tx\|^2=\langle x,T^*Tx\rangle\le\|T^*T\|\|x\|^2\)와 곱의 노름 부등식으로 두 번째 등식입니다. 핵과 상의 항등식은 본문처럼 내적의 0 조건을 옮긴 후 \(M^{\perp\perp}=\overline M\)를 적용합니다.
닫힌 상이면 \(T:(\ker T)^\perp\to\operatorname{ran}T\)는 Banach 공간 사이 전단사입니다. 명시한 유계역 정리로 \(\|Tx\|\ge c\|x\|\).
역으로 이 부등식이 있으면 수렴하는 \(Tx_n\)마다 핵직교 대표 \(x_n\)이 Cauchy이고 그 극한의 상이 주어진 극한이므로 상은 닫힙니다.
또한 \(x\in(\ker T)^\perp\)에 대해 \(Tu\mapsto\langle u,x\rangle\)는 \(|\langle u,x\rangle|\le c^{-1}\|x\|\|Tu\|\)인 잘 정의된 유계범함수입니다. 상에서 Riesz로 \(z\in\operatorname{ran}T\)를 얻어 \(\langle Tu,z\rangle=\langle u,x\rangle\), 즉 \(T^*z=x\).
따라서 \(\operatorname{ran}T^*=(\ker T)^\perp\)가 닫힙니다. \(T\)와 \(T^*\)를 바꾸면 역방향도 따릅니다. \(\square\)
정리 2 · 컴팩트 스펙트럼과 Schmidt 분해. 컴팩트 자기수반 \(K\)의 영공간 직교여공간에는 실수 비영 고윳값의 정규직교기저가 있으며, 무한개이면 고윳값은 0으로 갑니다. 컴팩트 \(T\)에는 본문의 SVD와 두 노름에서의 최적 절단이 존재합니다.
증명. 자기수반에서 \(M=\sup_{\|x\|=1}|\langle Kx,x\rangle|\)라 합시다. 단위 \(x,y\)에 위상회전으로 \(\langle Kx,y\rangle\)를 실수로 만든 뒤 실수부 편극 항등식을 쓰면
따라서 \(\|K\|\le M\)이고 반대 부등식은 Cauchy–Schwarz입니다. \(K\ne0\)에서 단위열 \(x_n\)의 Rayleigh 값이 \(\lambda=\|K\|\) 또는 \(-\|K\|\)로 가는 부분열을 고릅니다. 그러면
컴팩트성으로 \(Kx_n\)의 수렴 부분열이 있고 \(\lambda\ne0\)이므로 \(x_n\)도 단위벡터 \(x\)로 수렴하여 \(Kx=\lambda x\). 부호를 버리고 항상 첫 고윳값이 \(+\|K\|\)라고 쓰지 않습니다.
직교여공간은 자기수반성으로 불변입니다. 그곳에서 같은 절차를 반복합니다. 비영 고윳값의 고유공간은 유한차원입니다. 아니면 그 안의 직교열의 상들이 일정 거리로 분리되어 컴팩트성에 모순입니다. 무한히 선택한 \(\lambda_j\)도 0으로 가야 합니다. \(|\lambda_j|\ge\epsilon\)인 무한 부분열이 있으면 \(Ke_j=\lambda_je_j\)가 수렴 부분열을 갖지 못합니다. 단계별 남은 노름이 다음 \(|\lambda_j|\)이므로 선택한 벡터 전부에 직교하는 공간에서 \(K=0\). 이것이 완전성과 급수표현을 증명합니다.
\(T^*T\)는 컴팩트 양의 자기수반입니다. 양의 고윳값을 \(\sigma_j^2\), 벡터를 \(v_j\)라 하고 \(u_j=Tv_j/\sigma_j\)라 하면 \(\langle u_i,u_j\rangle=\delta_{ij}\). \(\ker(T^*T)=\ker T\)와 앞의 완전성으로 SVD가 나옵니다. 절단 오차는 직교성으로 \(\sigma_{N+1}\). rank \(N\) 이하 \(A\)는 \(\operatorname{span}(v_1,\ldots,v_{N+1})\) 안에 단위 핵벡터 \(v\)를 가지므로 \(\|(T-A)v\|=\|Tv\|\ge\sigma_{N+1}\).
Hilbert–Schmidt 경우 \(Q\)를 \(A\)의 상 위 사영이라 하면 \(\|T-A\|_{HS}^2\ge\|(I-Q)T\|_{HS}^2=\sum\sigma_j^2-\sum\sigma_j^2\|Qu_j\|^2\). \(0\le\|Qu_j\|^2\le1\), \(\sum\|Qu_j\|^2\le N\)이므로 두 번째 합은 최대 \(\sum_{j\le N}\sigma_j^2\). 절단이 등호를 달성합니다. 적분핵의 HS 노름 등식은 정의역 정규직교기저에 Parseval을 적용하고 비음수 합과 적분을 교환하여 \(\sum\|Te_j\|^2=\iint|k|^2\)에서 얻습니다. \(\square\)
정리 3 · 컴팩트 Fredholm 대안. 컴팩트 \(K:H\to H\)에 대해 \(I-K\)는 닫힌 상을 가지며 \(\dim\ker(I-K)=\dim\ker(I-K^*)<\infty\). 따라서 단사와 전사가 동치입니다.
증명. 컴팩트한 단위구 상의 폐포에 유한 \(\epsilon\)-망을 잡고 그 중심의 span 위 사영 \(P\)를 취하면 \(\|(I-P)K\|\le\epsilon\).
따라서 \(F=PK\)는 유한랭크이고 \(\|K-F\|<1\)로 고를 수 있습니다. 유한차원 \(E=\operatorname{ran}F+\operatorname{ran}F^*\)로 분해합니다. \(E^\perp\) 위 \(K_{22}\)는 \(F\)의 해당 블록이 0이므로 노름이 1보다 작습니다. \(D=I-K_{22}\)는 Neumann 급수로 가역입니다. 블록 \(I-K=\left(\begin{smallmatrix}A&B\\C&D\end{smallmatrix}\right)\)에 유계 가역 삼각 블록 소거를 왼쪽·오른쪽으로 적용하면 \(\operatorname{diag}(A-BD^{-1}C,D)\)가 됩니다. 첫 블록은 \(E\) 위 유한 정방행렬입니다. 그 상은 닫히고 핵 차원과 상의 여차원이 같습니다. 가역변환은 이 성질을 보존하므로 \(I-K\)에도 성립합니다. 상의 직교여공간은 정리 1에 의해 \(\ker(I-K^*)\)이므로 결론입니다.
특히 비영 \(\lambda\)에 \(I-K/\lambda\)를 적용하면 스펙트럼 점은 고윳값이며 고유공간은 유한차원입니다. 서로 다른 비영 고윳값이 0 이외에 집적할 수도 없습니다. 만약 \(|\lambda_n|\ge\epsilon\)인 무한열이 있다면 대응 고유벡터들의 증가하는 span \(E_n\)에서 \(x_n\in E_n\cap E_{n-1}^\perp\)인 단위벡터를 잡습니다.
\((K-\lambda_n I)x_n\in E_{n-1}\)이고 \(Kx_m\in E_{n-1}\) for \(m<n\)이므로 \(\|Kx_n-Kx_m\|\ge|\lambda_n|\ge\epsilon\), 컴팩트성에 모순입니다. 무한차원에서 0은 항상 스펙트럼에 있습니다. 가역 컴팩트 \(K\)가 있으면 \(I=K^{-1}K\)도 컴팩트하여 I1의 단위구 정리에 모순입니다. \(\square\)
정리 4 · Picard와 Tikhonov. 컴팩트 \(T\)에 대한 해의 존재는 본문의 Picard 조건과 동치입니다. \(\alpha>0\)에서 정칙화 해는 유일하며
증명. \(Tf=g\)이면 SVD 내적으로 \(\langle f,v_j\rangle=g_j/\sigma_j\), \(g\perp\ker T^*\)이고 Bessel로 Picard 합이 유한합니다. 역으로 그 합이 유한하면 \(f^\dagger=\sum(g_j/\sigma_j)v_j\)가 수렴합니다. 유계 \(T\)를 급수에 통과시키면 \(Tf^\dagger=g\). 핵 성분은 상에 영향을 주지 않고 노름제곱을 더하므로 최소노름 해가 유일합니다.
\(A=T^*T+\alpha I\)는 \(\langle Ax,x\rangle\ge\alpha\|x\|^2\)라서 아래로 유계이고 핵이 0입니다. 정리 1로 상이 닫혔으며 \(A=A^*\)의 핵이 0이므로 상의 폐포는 전체입니다. 따라서 가역입니다. \(Af_\alpha=T^*g\)에 대해 목적함수의 차이를 전개하면
교차항은 정규방정식으로 사라집니다. 이 값은 \(h\ne0\)에서 양수라서 존재와 유일성을 모두 줍니다. 각 특이방향과 핵에서 \(A^{-1}T^*g\)를 읽으면 표시한 필터입니다. 잡음항은 \(\delta/(2\sqrt\alpha)\), source 편향은 본문의 multiplier 경계로 \(R\alpha^\nu\)입니다. 일반 최소노름 해에서도 잡음 없이 \(q_\alpha(\sigma_j)\to1\), \(0\le q_\alpha\le1\)과 제곱합의 지배수렴으로 \(f_\alpha\to f^\dagger\). 잡음이 있으면 \(\alpha\to0\), \(\delta/\sqrt\alpha\to0\)을 함께 요구합니다. \(\square\)
단사성은 식별을 보장할 수 있지만 역문제의 안정성까지 보장하지는 않습니다. 다음 장에서는 차원이 표본 크기와 함께 커질 때, 관측된 공분산과 무작위 근사의 오차가 어떻게 달라지는지 살펴봅니다. I4로 이어 읽기.