H1 · 관측을 가장 가깝게 설명하는 상태는 무엇일까?#
선형모형이 모든 관측을 정확히 설명하지 못할 때가 있습니다. 이때 해가 없다고 계산을 끝내는 대신, 가능한 예측 중 관측과 가장 가까운 것을 찾습니다. H0에서는 오차의 크기를 재는 여러 방법을 구분했습니다. 이번에는 내적에서 나온 제곱 크기를 사용할 때 최근접점이 왜 존재하고 유일한지, 그 오차가 어떤 방향과 직교하는지 살펴보겠습니다.
벡터의 좌표만이 아니라 다항식과 유한 확률공간에서도 같은 계산을 수행합니다. 마지막에는 기저와 행렬을 쓰지 않는 최적근사 증명으로 정리합니다. 모든 공간이 무한차원에서도 자동으로 같은 결론을 갖는다고 주장하지는 않습니다. 부분공간의 유한차원 조건을 어디에 쓰는지 확인하겠습니다.
1. 세 관측을 두 계수로 설명하기#
관측 시점은 중심을 0으로 맞춘 \(t=-1,0,1\)이고, 관측량은 기준 단위로 나눈 수치
라고 합시다. 확률모형을 먼저 가정하지 않고 이 세 수치를 기술하는 직선 \(\beta_0+\beta_1t\)를 찾겠습니다. \(\beta_0\)는 중심 시점의 수준, \(\beta_1\)은 한 시점 간격당 변화량입니다.
세 식을 정확히 맞출 수는 없습니다. 둘째 식에서 \(\beta_0=1\), 첫째 식에서 \(\beta_1=0\)인데 셋째 값이 1이 되어 관측 4와 다릅니다. 따라서
를 최소화하겠습니다. 세 관측의 오차를 같은 중요도로 센다는 선택입니다.
도함수를 전개하면
정상점은 \(\widehat\beta_0=2\), \(\widehat\beta_1=3/2\)입니다. 예측과 잔차는
아직 도함수가 0이라는 사실만으로 최소라고 결론내리지 않겠습니다. 다음 절의 정확한 제곱합 분해가 전역 최소성과 유일성을 동시에 보여 줍니다.
그림 61 이 그림은 시간·관측량 좌표입니다. 표시한 선분은 관측의 세로 오차이며, 뒤에서 말하는 \(\mathbb R^3\) 예측공간에 대한 직교를 이 2차원 산점도의 기하와 혼동하지 않습니다.#
2. 잔차가 두 열과 직교한다는 것은 어떤 계산인가?#
두 열을 \(u_0=(1,1,1)^{\mathsf T}\), \(u_1=(-1,0,1)^{\mathsf T}\)라 쓰면
어떤 계수 변화 \(h=(h_0,h_1)^{\mathsf T}\)도 예측을 \(Xh=h_0u_0+h_1u_1\)만큼 바꿉니다. 따라서 \(r^{\mathsf T}Xh=0\)입니다. 가능한 모든 예측 변화와 잔차의 내적이 0이라는 뜻입니다.
임의 \(\beta=\widehat\beta+h\)에 대해 잔차는 \(r-Xh\)이고
가운데 항은 0입니다. \(u_0^{\mathsf T}u_1=0\), \(u_0^{\mathsf T}u_0=3\), \(u_1^{\mathsf T}u_1=2\)이므로
\(\frac32\)보다 작아질 수 없고, 같아지려면 \(h_0=h_1=0\)이어야 합니다. 최소성과 유일성이 모두 나왔습니다. 핵심은 역행렬 공식보다 오차 제곱이 직교한 두 성분의 제곱합으로 나뉜다는 사실입니다.
3. 내적은 어떤 규칙을 갖는가?#
이 단원의 복소 내적은 첫째 인수에 선형, 둘째 인수에 켤레선형입니다.
예를 들어 \(\langle ix,y\rangle=i\langle x,y\rangle\)이고 \(\langle x,iy\rangle=-i\langle x,y\rangle\). 실수에서는 켤레가 없어져 보통 점곱이 됩니다.
내적은 \(\langle x,y\rangle=\overline{\langle y,x\rangle}\)이고 \(\langle x,x\rangle>0\)가 \(x\ne0\)에 성립합니다. \(\|x\|=\sqrt{\langle x,x\rangle}\)를 그 내적의 크기라고 부릅니다. 이것이 실제 노름인 이유는 마지막 절에서 Cauchy–Schwarz와 함께 증명합니다.
같은 규칙의 예를 더 봅시다.
양의 가중치 \(w_i>0\)이면 \(\langle x,y\rangle_w=\sum_iw_ix_i\overline{y_i}\)입니다. 양정치성은 \(\sum_iw_i|x_i|^2\)에서 적어도 하나의 양의 항이 남는 것으로 확인합니다.
연속함수에는 \(\langle f,g\rangle=\int_0^1f(t)\overline{g(t)}\,dt\)입니다. \(f\ne0\)이면 연속성 때문에 \(|f|^2\)가 양의 구간에서 양수여서 적분도 양수입니다. 여기서는 연속함수와 보통 적분만 사용합니다.
행렬에는 \(\langle A,B\rangle_F=\operatorname{tr}(B^{\mathsf H}A)=\sum_{ij}a_{ij}\overline{b_{ij}}\)입니다. H0의 Frobenius 노름이 여기서 나옵니다.
확률이 모두 양수인 유한 상태에는 \(\langle U,V\rangle=\sum_\omega p_\omega U(\omega)\overline{V(\omega)}\)입니다. 확률 0인 상태가 있다면 그 상태에서만 다른 값을 같은 원소로 취급해야 양정치성이 성립합니다.
가중치가 음수라면 내적이 아닐 수 있습니다. \(\langle x,y\rangle=x_1\bar y_1-x_2\bar y_2\)에서는 \(\langle(0,1),(0,1)\rangle=-1\)입니다. 물리학에서 이런 부호의 쌍선형식을 쓰더라도, 이번의 양정치 내적 정리를 그대로 적용하지 않습니다.
4. 한 방향의 성분을 빼면 무엇이 남는가?#
0 아닌 \(u\) 방향으로 \(v\)를 근사하려면 \(v-cu\)가 \(u\)와 직교하도록 잡습니다.
분모는 양수입니다. \(w=v-cu\)라고 하면
교차항은 \(\langle cu,w\rangle+\langle w,cu\rangle=0\)이라 사라집니다. 따라서
등호는 \(\|w\|=0\), 즉 \(v=cu\)일 때입니다. 이것이 Cauchy–Schwarz 부등식과 등호 조건입니다.
이 계산에서 \(c\)를 \(\langle u,v\rangle/\langle u,u\rangle\)로 쓰면 복소수에서는 잘못될 수 있습니다. \(v=i\), \(u=1\)이면 올바른 \(c=i\)이고 순서를 바꾼 식은 \(-i\)입니다. 내적의 인수 순서를 계산마다 유지해야 합니다.
5. 두 방향을 서로 직교하도록 바꾸기#
함수 \(1,t\)는 \(\int_0^1 1\cdot t\,dt=1/2\)이므로 직교하지 않습니다. 먼저 \(q_0(t)=1\)은 제곱노름이 1입니다. \(t\)에서 \(q_0\) 방향의 성분을 빼면
제곱노름을 전개하면
따라서 \(q_1(t)=\sqrt{12}(t-1/2)\)는 길이 1이고 \(q_0\)와 직교합니다.
이 과정이 Gram–Schmidt입니다. 새 벡터에서 이미 정한 정규직교 방향의 성분들을 빼고, 남은 벡터의 크기로 나눕니다. 원래 목록이 독립이면 남은 벡터가 0일 수 없습니다. 0이라면 새 벡터가 앞 벡터들의 선형결합이 되어 독립성과 모순이기 때문입니다.
1절의 회귀 열은 이미 직교하므로 길이만 나누면
계수는 \(\langle y,q_0\rangle=6/\sqrt3=2\sqrt3\), \(\langle y,q_1\rangle=3/\sqrt2\)이고,
로 같은 예측을 얻습니다.
6. 함수도 같은 방식으로 근사할 수 있다#
\(f(t)=t^2\)를 \(a+bt\)로 근사하겠습니다. \(t\in[0,1]\)은 정규화한 공간 위치 또는 시간이고, 함수값도 기준량으로 나눈 수치입니다. 오차 기준은 \(\int_0^1|f-a-bt|^2dt\)입니다. 구간을 같은 중요도로 센 선택입니다.
오차가 \(1,t\)와 직교해야 하므로
첫 식에서 \(a=1/3-b/2\). 둘째 식에 넣으면
따라서 \(b=1\), \(a=-1/6\)입니다. 잔차는 \(r(t)=t^2-t+1/6\)입니다.
잔차 제곱을 전개하면
적분은
앞의 직교 계산으로 임의의 다른 일차식 \(p\)에
이므로 \(t-1/6\)이 유일한 최적근사입니다. 특정 점에서 반드시 함수값이 맞아야 한다는 보간 조건과는 다른 문제입니다.
그림 62 잔차는 점마다 0이 아니라, \(1\)과 \(t\)로 가중한 두 적분이 0입니다. 그림의 양·음 부분은 그 소거를 읽는 보조 자료이며 두 적분의 증명은 위 계산입니다.#
이 다항식 예는 무한차원 함수공간 안의 유한차원 부분공간으로 사영한 것입니다. 무한 Fourier 급수가 수렴한다는 정리까지 필요하지 않습니다. 뒤에서 무한합을 다룰 때는 완비성과 닫힘을 별도로 확인해야 합니다.
7. 확률과 통계물리에서도 무엇을 사영하는가?#
네 미시상태의 확률을 각각 \(1/4\)로 고정합시다. 에너지 관측 \(E\)는 앞 두 상태에서 0, 뒤 두 상태에서 1이고, 다른 무차원 관측량은 \(Y=(0,2,1,5)\)입니다. 확률을 에너지로부터 유도하는 열평형 모형은 가정하지 않습니다. 주어진 유한 확률표에서 계산하는 문제입니다.
에너지만 알 때 가능한 예측은 \((a,a,b,b)\)입니다. 오차 제곱의 기댓값은
각 쌍의 평균을 사용하면 \(\widehat Y=(1,1,3,3)\)이고 잔차는 \(r=(-1,1,-2,2)\)입니다. 각 에너지 집단의 지시함수와의 내적은
따라서 에너지의 모든 함수와 직교합니다. 유한 상태에서 이것이 조건부기댓값 \(\mathbb E[Y\mid E]\)입니다. 제곱오차는 \((1+1+4+4)/4=5/2\)입니다.
일반 유한 분할에서도 집단 \(G\)의 확률 \(p(G)>0\)에
로 두면 \(\sum_{\omega\in G}p_\omega(Y(\omega)-m_G)=0\)입니다. 각 집단의 지시함수가 예측공간의 기저이므로 직교성과 최적성이 따라옵니다. 이것은 확률표 안에서 증명한 결과입니다. 연속 확률공간에서 조건부기댓값의 존재를 여기서 전제 없이 얻었다고 말하지 않습니다.
8. 사영이라고 모두 가장 가까운 것은 아니다#
는 \(P_a^2=P_a\)이고 상은 가로축입니다. 그러나 \(v=(0,1)\)을 \((a,0)\)으로 보냅니다. 표준 내적에서 가로축의 가장 가까운 점은 \((0,0)\)이고 거리는 1입니다. \(P_av\)까지의 거리는 \(\sqrt{a^2+1}\)이므로 \(a\ne0\)일 때 더 멉니다.
핵은 \(x+ay=0\)인 직선입니다. \(a\ne0\)이면 상과 핵이 수직이 아닙니다. 이런 사영은 분해를 제공하지만 직교사영은 아닙니다.
이고 \((x,y)\)를 \((1,a)\) 방향으로 잡으면 등호이므로 \(\|P_a\|_2=\sqrt{1+a^2}\). 직교사영은 길이를 늘리지 않지만 이 사영은 늘릴 수 있습니다.
그림 63 \(a=2\)입니다. 두 사영의 상은 같지만 핵이 달라 결과가 다릅니다. 점선 방향이 원래 벡터에서 사영된 점으로 가는 오차 방향입니다.#
9. Gram 행렬은 무엇을 기록하는가?#
벡터 \(u_1,\ldots,u_k\)의 Gram 행렬을
로 정의하겠습니다. 첫째 인수가 선형인 규약에서 좌표 \(c\)의 제곱노름이 \(c^{\mathsf H}Gc\)가 되도록 잡은 순서입니다.
따라서 \(G\)는 Hermitian 양의 준정부호이고, 벡터들이 독립이면 \(c\ne0\)에서 값이 양수입니다. 종속이면 0 아닌 계수 \(c\)로 합을 0으로 만들 수 있으므로 양의 정부호가 아닙니다.
다항식 \(1,t\)의 Gram 행렬은
이는 5절에서 두 번째 직교 잔차의 제곱길이 \(1/12\)와 같습니다. 일반적으로 Gram–Schmidt의 직교 잔차 길이를 곱한 값이 부피이고 Gram 행렬식은 그 제곱입니다. 마지막 절에서 행렬식의 곱셈법칙으로 증명합니다.
정규방정식은
입니다. 각 \(i\)에 \(\langle y-\sum_j\widehat c_ju_j,u_i\rangle=0\)을 쓴 식입니다. \(G\)가 가역일 때만 \(\widehat c=G^{-1}b\)라고 쓸 수 있습니다. 열이 종속이면 최적 예측은 여전히 유일하지만 그것을 나타내는 계수는 여러 개일 수 있습니다.
10. 정확한 존재 정리와 부동소수점 구현#
Gram–Schmidt에서 정확산술로 같은 두 식도 반올림 후에는 다른 결과를 줄 수 있습니다. 원래 벡터에 대한 내적들을 한꺼번에 빼는 고전 방식과, 한 성분을 뺀 갱신 벡터로 다음 내적을 구하는 수정 방식이 그렇습니다.
세 열
를 보겠습니다. \(\varepsilon=10^{-8}\)이면 이진 배정밀도에서 \(1+\varepsilon^2\)가 1로 반올림될 수 있습니다. 첫 계산 벡터를 \((1,\varepsilon,0,0)\)로 취급하면 둘째 잔차는 \((0,-\varepsilon,\varepsilon,0)\)이고, 정규화한 둘째 벡터는 \((0,-1,1,0)/\sqrt2\)입니다.
고전 방식으로 셋째 원래 열과 둘째 벡터의 내적을 구하면 0입니다. 그래서 셋째 잔차가 \((0,-\varepsilon,0,\varepsilon)\)가 되어 정규화 후 둘째와 내적이 \(1/2\) 남습니다. 수정 방식은 첫 성분을 뺀 \((0,-\varepsilon,0,\varepsilon)\)와 둘째 벡터의 내적 \(\varepsilon/\sqrt2\)를 구해 다시 뺍니다. 이렇게 서로 다른 정보가 사용됩니다.
아래 코드는 그 현상을 실제로 확인합니다. 모든 행렬에서 오차가 정확히 같은 기울기나 상수를 갖는다는 보편적 수치정리는 주장하지 않습니다. 수치 안정성의 정량적 분석은 N3에서 다룹니다.
import sympy as s
import numpy as np
X=s.Matrix([[1,-1],[1,0],[1,1]]); y=s.Matrix([1,1,4])
beta=(X.T*X).inv()*X.T*y
r=y-X*beta
assert beta==s.Matrix([2,s.Rational(3,2)])
assert X.T*r==s.zeros(2,1) and (r.T*r)[0]==s.Rational(3,2)
t=s.symbols("t")
res=t*t-t+s.Rational(1,6)
assert s.integrate(res,(t,0,1))==0
assert s.integrate(t*res,(t,0,1))==0
assert s.integrate(res**2,(t,0,1))==s.Rational(1,180)
def gs(A,modified):
Q=np.zeros_like(A,dtype=float)
for j in range(A.shape[1]):
v=A[:,j].copy()
for i in range(j):
coefficient=Q[:,i]@(v if modified else A[:,j])
v=v-coefficient*Q[:,i]
Q[:,j]=v/np.linalg.norm(v)
return Q
A=np.vstack([np.ones(3),1e-8*np.eye(3)])
errors=[]
for modified in [False,True]:
Q=gs(A,modified)
errors.append(np.linalg.norm(Q.T@Q-np.eye(3)))
assert errors[0]>.1 and errors[1]<1e-6
print("회귀·다항식 사영 검산 통과; CGS/MGS 직교성 오차:",errors)
회귀·다항식 사영 검산 통과; CGS/MGS 직교성 오차: [np.float64(0.7071067811865476), np.float64(1.1547005383792518e-08)]
11. 직접 써 보는 문제와 전체 풀이#
문제 1 · 같은 사영을 두 좌표로#
\(\mathbb R^4\)에서 \(u=(1,1,0,0)\), \(w=(0,1,1,0)\), \(v=(1,2,3,4)\)를 쓰세요. \(v\)를 \(\operatorname{span}(u,w)\)에 사영하세요.
풀이. \(G=\left[\begin{smallmatrix}2&1\\1&2\end{smallmatrix}\right]\), \(b=(3,5)^{\mathsf T}\)이므로 계수는 \(G^{-1}b=\frac13\left[\begin{smallmatrix}2&-1\\-1&2\end{smallmatrix}\right](3,5)^{\mathsf T}=(1/3,7/3)^{\mathsf T}\). 예측은 \((1/3,8/3,7/3,0)\), 잔차는 \((2/3,-2/3,2/3,4)\)입니다. 잔차와 \(u,w\)의 내적은 각각 0입니다.
Gram–Schmidt에서는 \(q_1=u/\sqrt2\), \(w-\langle w,q_1\rangle q_1=(-1/2,1/2,1,0)\), \(q_2=(-1,1,2,0)/\sqrt6\)입니다. \(\langle v,q_1\rangle=3/\sqrt2\), \(\langle v,q_2\rangle=7/\sqrt6\). 두 성분을 더하면 \(3u/2+7(-1,1,2,0)/6=(1/3,8/3,7/3,0)\)으로 같습니다. Gram 행렬식은 3이므로 두 벡터가 만드는 평행사변형 넓이는 \(\sqrt3\)입니다.
문제 2 · Parseval의 등호는 무엇을 뜻하는가?#
\(\mathbb R^3\)에서 정규직교집합 \(e_1,e_2\)와 \(v=e_1\)을 생각하세요. 계수 제곱합이 \(\|v\|^2\)와 같으니 이 집합은 전체 공간의 기저일까요?
풀이. 합은 \(1^2+0^2=1\)로 같지만 \(e_3\)를 생성하지 못합니다. 이 \(v\)에 대한 등호는 \(v\)가 그 두 벡터의 생성공간에 있다는 뜻입니다. 모든 \(v\)에 등호가 성립할 때만 전체 공간의 정규직교기저라고 결론낼 수 있습니다.
문제 3 · 같은 예측, 다른 계수#
\(X=\left[\begin{smallmatrix}1&1\\1&1\end{smallmatrix}\right]\), \(y=(1,3)^{\mathsf T}\)의 최적 예측과 계수를 구하세요.
풀이. 예측은 \((c,c)\)이고 \((1-c)^2+(3-c)^2=2(c-2)^2+2\)이므로 \(c=2\). 예측 \((2,2)\)는 유일하지만 \(\beta_1+\beta_2=2\)인 모든 계수가 같은 예측을 만듭니다. \(X^{\mathsf T}X\)는 가역이 아닙니다.
문제 4 · 무한차원에서 최근접점이 없을 수 있는가?#
제곱합이 유한한 수열의 공간 \(\ell^2\)에서 유한 개 성분만 0이 아닌 수열들의 부분공간 \(U\)와 \(v=(2^{-j})_{j\ge1}\)을 보세요.
풀이. 앞 \(m\)개 성분만 남긴 \(v^{(m)}\in U\)에 \(\|v-v^{(m)}\|_2^2=\sum_{j=m+1}^\infty4^{-j}=4^{-m}/3\to0\). 따라서 거리의 하한은 0입니다. 그 거리에 도달하려면 \(u=v\)여야 하지만 \(v\)는 유한지지가 아니므로 \(U\)에 없습니다. \(U\)가 닫히지 않았고 유한차원도 아니라 이 단원의 존재 증명을 적용할 수 없습니다.
문제 5 · 한 관측을 더 믿는다면?#
상수 예측 \((c,c)\)로 \(y=(0,3)\)을 근사하되 제곱오차를 \((0-c)^2+2(3-c)^2\)로 세세요.
풀이. 전개하면 \(3c^2-12c+18=3(c-2)^2+6\)이므로 \(c=2\). 잔차 \((-2,1)\)은 가중내적에서 \((1,1)\)과 내적 \(-2+2=0\)입니다. 표준내적에서는 내적이 \(-1\)이므로 직교하지 않습니다. 어떤 내적의 최근접점을 말하는지 반드시 지정해야 합니다.
12. 지금까지의 내용을 수학의 언어로 정리해 봅시다#
앞의 회귀·함수·유한 확률표 계산은 모두 하나의 직교분해를 사용했습니다. 이제 그 존재, 유일성, 최소성을 정의와 증명으로 정리합니다. 첫째 인수 선형 규약을 끝까지 유지합니다.
12.1 내적과 Cauchy–Schwarz의 세 확인#
정의 21 (내적)
\(\mathbb F=\mathbb R\) 또는 \(\mathbb C\) 위의 내적은 첫째 인수 선형, 켤레대칭이며 \(\langle x,x\rangle>0\)가 \(x\ne0\)에서 성립하는 함수입니다. \(x\perp y\)는 \(\langle x,y\rangle=0\)을 뜻합니다.
첫 증명은 4절의 한 방향 사영입니다. \(u\ne0\)에 \(v=cu+w\), \(w\perp u\)를 직접 구성하고 피타고라스로 부등식을 얻었습니다. \(u=0\)이면 양변은 0입니다. 등호는 두 벡터가 선형종속일 때이고 그 역도 대입으로 성립합니다.
둘째로 \(z=\langle v,u\rangle\), \(a=\|u\|^2>0\)라 쓰면 모든 복소 \(t\)에
\(t=z/a\)에서 왼쪽이 음수가 아니므로 같은 부등식을 얻습니다. 실수에서는 이 이차식이 모든 \(t\)에서 음수가 아니어서 판별식이 0 이하라는 증명과 같습니다. 판별식을 복소수 \(t\)에 그대로 적용하는 것이 아니라 위 절댓값 제곱을 사용하는 이유입니다.
셋째로 두 벡터의 Gram 행렬
는 \((c,d)^{\mathsf H}G(c,d)=\|cu+dv\|^2\ge0\)입니다. \(a>0\)에서 \((c,d)=(-z/a,1)\)을 넣으면 \(b-|z|^2/a\ge0\), 따라서 \(\det G=ab-|z|^2\ge0\). 이 역시 원하는 식입니다. \(a=0\)이면 \(u=0\)이므로 \(z=0\)입니다. Gram 행렬의 양의 준정부호성이 행렬식 부호를 준다는 일반 스펙트럼 정리를 빌리지 않고 직접 확인했습니다.
이제 \(\|x+y\|^2=\|x\|^2+2\operatorname{Re}\langle x,y\rangle+\|y\|^2\le(\|x\|+\|y\|)^2\). 양변이 음수가 아니므로 제곱근을 취해 삼각부등식을 얻습니다. 양정치성과 절대동차성도 내적 공리에서 따라와 \(\sqrt{\langle x,x\rangle}\)는 노름입니다.
12.2 Gram–Schmidt와 직교분해#
유한차원 부분공간의 닫힘과 노름 수렴은 H0의 정리 66 뒤에서 증명했습니다. 아래에서는 그보다 구체적인 직교분해를 유한한 합으로 직접 구성합니다.
정리 67 (정규직교화)
독립인 유한 목록 \(u_1,\ldots,u_k\)에는 각 \(j\)까지의 생성공간이 같은 정규직교 목록 \(q_1,\ldots,q_k\)가 존재합니다.
증명. \(q_1=u_1/\|u_1\|\)로 시작합니다. 앞의 \(q_i\)를 구성했다면
각 \(\ell<j\)에 \(\langle w_j,q_\ell\rangle=\langle u_j,q_\ell\rangle-\sum_{i<j}\langle u_j,q_i\rangle\delta_{i\ell}=0\). \(w_j=0\)이면 \(u_j\)가 앞 벡터들의 생성공간에 들어가 모순입니다. \(q_j=w_j/\|w_j\|\)로 두면 길이가 1이고 앞 목록과 직교합니다. \(w_j\)가 \(u_1,\ldots,u_j\)의 결합이고, 역으로 \(u_j=w_j+\sum_{i<j}\langle u_j,q_i\rangle q_i\)이므로 양쪽 생성공간도 같습니다. 귀납이 완료됩니다.
유한차원 공간의 기저에 적용하면 정규직교기저가 존재합니다. 기존 정규직교집합을 보존하면서 확장하려면 그 목록을 선형 기저로 먼저 확장한 뒤 같은 과정을 적용하면 됩니다.
정리 68 (유한차원 부분공간으로의 직교분해)
내적공간 \(V\)의 유한차원 부분공간 \(U\)에 대해 모든 \(v\)는 유일하게 \(v=p+r\), \(p\in U\), \(r\in U^\perp\)로 표현됩니다.
증명. \(U\)의 정규직교기저 \(q_1,\ldots,q_k\)를 고르고 \(p=\sum_i\langle v,q_i\rangle q_i\)라 두면 \(r=v-p\)는 각 \(q_i\)와 직교합니다. 임의 \(u=\sum_i a_iq_i\)에도 \(\langle r,u\rangle=\sum_i\bar a_i\langle r,q_i\rangle=0\)이므로 \(r\in U^\perp\)입니다.
두 분해 \(p+r=p'+r'\)가 있으면 \(p-p'=r'-r\in U\cap U^\perp\). 그 벡터를 자신과 내적하면 0이므로 벡터가 0입니다. 따라서 두 성분이 각각 같고 분해는 유일합니다. \(U=0\)일 때에는 빈 합을 0으로 두면 같은 결론입니다. \(P_Uv=p\)라고 정의하며 이 유일성 때문에 기저 선택에 의존하지 않습니다.
또한 \(U\subseteq(U^\perp)^\perp\)이고, 역으로 \(v=p+r\in(U^\perp)^\perp\)이면 \(r\in U^\perp\)이므로 \(0=\langle v,r\rangle=\|r\|^2\), 따라서 \(v=p\in U\). 유한차원 \(V\)에서는 직합의 기저를 합쳐 \(\dim U+\dim U^\perp=\dim V\)도 얻습니다.
12.3 최적근사와 직교사영의 특성화#
\(v=p+r\)의 직교분해에서 임의 \(u\in U\)에 \(r\perp(p-u)\)이므로
둘째 항은 음수가 아니고 0일 필요충분조건이 \(u=p\)입니다. 이것으로 \(p\)가 유일한 최근접점임을 증명했습니다. 이 증명 자체에는 좌표가 필요 없습니다. 유한차원 조건은 앞의 분해 존재를 확보하는 데 사용했습니다.
역으로 \(u\)가 최근접점이면 모든 \(h\in U\)와 실수 \(t\)에
\(t\)의 양·음 작은 값을 택하면 실수 부분이 0이어야 합니다. 복소공간에서는 \(h\) 대신 \(ih\)를 넣어 허수 부분도 0임을 얻습니다. 따라서 잔차는 \(U^\perp\)입니다.
사영 \(P^2=P\)의 직교성은
와 동치입니다. 직교분해의 성분을 쓰면 양변이 \(\langle Px,Py\rangle\)로 같아 한쪽을 얻습니다. 역으로 \(u=Px\), \(z\in\ker P\)이면 \(\langle u,z\rangle=\langle x,Pz\rangle=0\)이므로 상과 핵이 직교합니다. \(v=Pv+(I-P)v\)는 상·핵 분해이므로 직교사영입니다. H2에서 이 내적 항등식을 \(P=P^*\)라고 부릅니다.
또한 \(P\)가 직교사영이면 \(\|Pv\|^2\le\|v\|^2\)입니다. 역으로 \(P^2=P\), \(\|Pv\|\le\|v\|\)라면 \(u\in\operatorname{im}P\), \(z\in\ker P\)에서
입니다. 실수 \(t\)와 이어 \(iz\) 방향을 사용한 앞의 이차식 논증으로 \(\langle u,z\rangle=0\)을 얻습니다. 따라서 직교사영입니다. \(P=0\)의 노름은 0이고 0 아닌 직교사영은 상의 단위벡터에서 등호에 도달하므로 노름이 1입니다.
12.4 Bessel·Parseval과 좌표 안정성#
정규직교집합 \(q_1,\ldots,q_k\)에서
사영과 잔차의 피타고라스로
따라서 Bessel 부등식을 얻고, 이 \(v\)에서의 등호는 \(v\in U\)와 동치입니다. 모든 \(v\)에서 등호이면 모든 \(v\in U\)이므로 \(U=V\), 즉 목록이 기저입니다. 이것이 유한차원 Parseval입니다.
기저이면 \(v,w\)를 그 기저로 전개하여
또한 입력 변화 \(\delta v\)의 계수 변화 제곱합은 Bessel에 의해 \(\sum_i|\langle\delta v,q_i\rangle|^2\le\|\delta v\|^2\). 정확한 좌표 사상은 오차를 늘리지 않습니다. 이미 반올림으로 직교성을 잃은 계산 기저에 이 정리를 무조건 적용하는 것은 별개의 오류입니다.
12.5 Gram 행렬·부피·정규방정식#
9절의 \(G_{ij}=\langle u_j,u_i\rangle\)는 켤레대칭이며 \(c^{\mathsf H}Gc=\|\sum_jc_ju_j\|^2\)입니다. 독립이면 양의 정부호이고 \(Gc=0\)에서 \(c=0\)이므로 가역입니다. 종속이면 합이 0인 \(c\ne0\)를 택해 \((Gc)_i=\langle\sum_jc_ju_j,u_i\rangle=0\)이므로 특이입니다. 따라서 독립성·양의 정부호성·가역성이 동치입니다.
독립 목록을 Gram–Schmidt로 쓰면 \(u_j=\sum_{i\le j}r_{ij}q_i\), \(r_{jj}=\|w_j\|>0\)입니다. \(R=(r_{ij})\)에 \(G=R^{\mathsf H}R\)이므로 C5의 곱셈법칙으로
실수 내적공간의 정규직교 좌표에서 C5의 부피는 \(|\det R|=\prod_j\|w_j\|\)입니다. 다른 정규직교 좌표변환 \(Q\)는 \(Q^{\mathsf T}Q=I\)여서 \(|\det Q|=1\)이므로 부피가 유지됩니다. 복소공간에서는 이 식이 Hermitian Gram 불변량을 주며 실수 \(2k\)차원 부피와 같은 숫자라고 무조건 동일시하지 않습니다.
일반 행렬 \(X\)의 열들이 생성하는 \(U\)는 유한차원이므로 \(P_Uy\)가 존재하고 유일합니다. 어떤 계수 \(\widehat\beta\)로 \(X\widehat\beta=P_Uy\)라 쓸 수 있고 잔차의 열별 직교조건은 \(X^{\mathsf H}X\widehat\beta=X^{\mathsf H}y\)입니다. 역으로 이 식을 만족하면 잔차가 열공간과 직교하므로 최적 예측입니다. 독립일 때만 역행렬 공식이 나오며, 종속일 때는 같은 예측을 주는 계수들이 \(\widehat\beta+\ker X\)를 이룹니다.
직교분해는 최적 예측과 잔차를 구별하며, 피타고라스 식으로 최적성을 증명합니다. 다음 장에서는 내적을 이용해 선형 관측을 벡터로 표현하고 사상의 수반을 정의합니다. H2로 이어 읽기.