H6 · 스펙트럼 섭동: 추정한 고유구조를 얼마나 믿을 것인가#
H5에서는 정확히 주어진 행렬에서 가장 좋은 방향을 골랐습니다. 실제로는 행렬 자체를 관측이나 계산으로 얻으므로, 입력이 조금 바뀌면 그 방향도 달라집니다.
이번 장에서는 참 행렬과 관측 행렬을 구별하고, 고윳값의 오차와 고유방향의 오차를 각각 계산합니다. 같은 크기의 섭동도 고유간극과 정규성에 따라 다른 영향을 줄 수 있습니다.
1. 표본공분산에서 시작하는 질문#
서로 다른 세 지표를 정한 기준단위로 나누어 무차원 변수로 만들고, 각 평균을 뺐다고 하겠습니다. 공분산의 수치는 이 무차원 변수의 곱의 평균입니다. 아래 행렬은 실제 추정 자료가 아니라 계산을 확인하기 위한 교육용 모형입니다. 모집단 공분산이
라고 하겠습니다. 표본에서 얻은 행렬에는 측정오차가 들어가
가 되었다고 합시다. \(E\)는 대칭이고 \(\|E\|_2=0.05\)입니다.
첫째 좌표는 다른 좌표와 결합하지 않아 고윳값 4와 고유벡터 \(e_1\)이 그대로입니다. 나머지 블록을 \(C\)라 쓰면 고유방정식은
0이 아닌 해가 있으려면 두 식이 종속이어야 하므로
따라서 둘째·셋째 좌표 블록의 고윳값은
입니다. 따라서
가장 큰 이동은 약 \(0.020711\)로 섭동 노름 \(0.05\)보다 작습니다. 하지만 둘째 고유벡터는 \(e_2\)에서
만큼 회전합니다. 이 식은 \(u=(\cos\theta,\sin\theta)\)와 \(w=(-\sin\theta,\cos\theta)\) 사이의 교차항을 0으로 두어 얻습니다.
\(0<\theta<\pi/4\)인 큰 고윳값 방향을 고르면 \(\cos2\theta=\sin2\theta\)이므로 \(\theta=\pi/8\)입니다. 큰 고윳값의 방향은 \((0,\cos\theta,\sin\theta)\)이고, 작은 고윳값 방향은 \((0,-\sin\theta,\cos\theta)\)입니다. 같은 오차가 고윳값과 방향에 전혀 다른 영향을 줍니다. 이 장의 질문은 “행렬이 조금 바뀌면 무엇이 얼마나 바뀌는가?”입니다.
여기서 \(A\)는 이상적 모집단 값, \(\widehat A\)는 표본·센서·수치 알고리즘이 내놓은 값, \(E\)는 그 차이입니다. \(E\)의 원인을 특정 확률분포로 가정하지 않고 결정론적 노름으로 먼저 제한합니다.
그림 76 세로축은 고윳값 자체가 아니라 원래 값에서의 이동량입니다. 원 표시는 이동 전의 0, 가위 표시는 실제 이동, 세로 막대는 Weyl 상한이 허용하는 \([-0.05,0.05]\)입니다. 첫 방향은 변하지 않고 나머지 두 값은 약 \(\pm0.020711\) 이동합니다.#
2. Weyl 부등식: 자기수반 고윳값의 이동을 제한한다#
\(A,B\)가 자기수반이고 고윳값을 내림차순으로 정렬했다고 합시다. 단위벡터 \(x\)에 대해
입니다. \(k\)차원 부분공간 \(S\)에서 최소를 취하면
양변에서 \(\dim S=k\)인 공간에 대해 최댓값을 취하고 H5의 Courant–Fischer를 사용하면
\(A\)와 \(B\)를 바꾸면 반대 부등식도 얻어
예를 들어 \(B=A+0.1I\)이면 모든 고윳값이 정확히 \(0.1\)씩 이동하고 \(\|B-A\|_2=0.1\)입니다. 상한이 실제로 달성되므로 자기수반 고윳값 함수의 절대조건수는 1입니다. 비대칭 행렬에서는 이 결론이 거짓입니다.
이면 \(A+E\)의 고윳값은 \(\pm10^{-3}\)입니다. 섭동 크기는 \(10^{-6}\)인데 고윳값은 \(10^{-3}\) 움직였습니다.
3. 전체 고윳값의 거리: Hoffman–Wielandt#
Weyl은 한 고윳값씩 묶습니다. 전체 벡터를 한꺼번에 보면 자기수반 \(A,B\)에 대해
가 성립합니다. 이를 확인하기 위해 \(A=U\Lambda U^*\), \(B=V M V^*\), \(W=U^*V\)라 두면
성분을 전개하면
\(S=(|w_{ij}|^2)\)는 각 행과 열의 제곱합이 1인 이중확률행렬입니다. \(\lambda,\mu\)가 내림차순이면 Abel 합 논증으로
입니다. 오른쪽을 대입하면 원하는 부등식이 나옵니다. 정렬을 하지 않으면 같은 고윳값 집합을 불필요하게 멀리 비교하게 되므로, 순서가 정리의 일부입니다.
4. 특이값은 비대칭에서도 안정적이다#
직사각형 \(A\)의 특이값은 H4에서 \(|A|=(A^*A)^{1/2}\)의 고윳값으로 정의했습니다. 더 직접적인 증명을 위해 Hermitian dilation을 사용합니다.
\(A=U\Sigma V^*\)의 특이쌍 \((u_i,v_i)\)에 대해
따라서 \(r=\min(m,n)\)일 때 \(\mathcal H(A)\)의 내림차순 고윳값 목록의 앞 \(r\)개가 \(A\)의 특이값입니다. 0인 특이값도 포함하며, 나머지 목록은 추가 영값과 음의 특이값으로 이루어집니다. 또한
Weyl을 적용하면
입니다. 고윳값이 비정규성 때문에 크게 흔들린 §1의 반례에서도 특이값은 이 상한을 지킵니다.
5. 고유벡터에는 고유간극이 분모로 들어간다#
\(A(t)=A+tE\)이고 \(A\)의 단순 고윳값 \(\lambda_i\)와 단위 고유벡터 \(u_i\)가 있다고 합시다.
를 미분하면
왼쪽에 \(u_i^*\)를 곱하면 자기수반성으로 \(u_i^*A=\lambda_i u_i^*\)이므로
이번에는 \(u_j^*\) (\(j\ne i\))를 곱합니다.
따라서
정규화 조건에서 \(u_i^*\dot u_i=0\)인 위상을 택하면
고유간극 \(\operatorname{gap}_i=\min_{j\ne i}|\lambda_i-\lambda_j|\)로 묶으면
\(A=\operatorname{diag}(1.2,1)\), \(E=\begin{pmatrix}0&1\\1&0\end{pmatrix}\)이면 \(\dot\lambda_1=0\), \(\dot u_1=5e_2\)입니다. 정확한 회전각은
이고 \(t=0.01\)에서 선형 예측 \(0.05\) rad와 정확값 \(0.04992\) rad가 거의 같습니다. 간극을 0으로 보내면 같은 크기의 오차가 방향을 크게 돌립니다.
그림 77 섭동 크기를 고정하고 간극을 줄이면 1차 근사는 \(0.01/\operatorname{gap}\)으로 증가하지만, 실제 각도 \(\frac12\arctan(0.02/\operatorname{gap})\)는 \(\pi/4\) 이하입니다. 양쪽 축은 로그 눈금이며 작은 간극에서 선형 근사가 무너지는 모습을 비교합니다.#
6. 주각과 Davis–Kahan의 의미#
고유벡터 하나의 부호나 복소 위상은 임의입니다. \(u\)와 \(-u\)는 같은 직선을 나타내므로 두 벡터의 차이를 그대로 오차로 쓰면 안 됩니다. 단위벡터 사이의 주각을 \(0\le\theta\le\pi/2\)에서
로 정합니다. 두 번째 등식은 \(\widehat u\)의 직교분해와 피타고라스로 얻습니다.
차원이 같은 두 부분공간의 정규직교 기저를 \(U,\widehat U\in\mathbb C^{n\times k}\)라 합시다. \(U^*\widehat U\)의 특이값을 \(\cos\theta_1,\ldots,\cos\theta_k\)로 정의합니다. 모두 0과 1 사이인데, \(\|U^*\widehat Ux\|\le\|x\|\)이기 때문입니다. 기저를 바꾸면 이 행렬의 양쪽에 유니터리 행렬만 곱해져 특이값은 유지됩니다. 따라서 주각은 기저가 아니라 부분공간 사이의 양입니다.
관심 공간이 \(A\)의 상위 \(k\)개 방향이라고 합시다. \(a=\lambda_{k+1}(A)\), \(b=\widehat\lambda_k\)로 놓고 \(b>a\)를 확인하면 다음 잔차 상한이 성립합니다.
분모는 원래 행렬의 제외한 스펙트럼과 관측 행렬의 선택한 스펙트럼 사이의 거리입니다. 원래 간극 \(g=\lambda_k(A)-\lambda_{k+1}(A)>0\)만 알고 있다면 Weyl로 \(\widehat\lambda_k\ge\lambda_k(A)-\|E\|_2\)입니다. 따라서 \(\|E\|_2<g/2\)에서는
\(\|E\|_2\ge g/2\)에서는 마지막 우변이 1 이상이고 \(\|\sin\Theta\|_2\le1\)이므로, 상수 2가 붙은 원래 간극 상한은 모든 섭동 크기에서 유지됩니다. 간극의 종류와 상수를 바꿔 쓰지 않아야 합니다. 원래 간극을 이용하는 통계적 변형의 배경은 Yu–Wang–Samworth의 논문에서 볼 수 있습니다. 여기서는 상위 공간 판본의 증명을 마지막 절에서 직접 완성합니다.
첫 공분산 예에서 상위 두 방향의 원래 간극은 \(1.1-1=0.1\), 혼합 간극은 \(1.120711-1\approx0.120711\)입니다. 잔차 상한은 \(0.05/0.120711\approx0.414214\)이고 실제 사인 오차는 \(\sin(\pi/8)\approx0.382683\)입니다. 반면 하위 두 방향을 묶은 평면은 섭동 전후 모두 \(\operatorname{span}(e_2,e_3)\)여서 오차가 0입니다. 개별 방향과 그 방향들이 만드는 공간을 구별하면 중복 고윳값 근처에서도 무엇이 식별되는지 알 수 있습니다.
일반적인 내부 군집에서도 잔차식의 각 성분을 나누면 Frobenius 상한을 얻습니다. 그러나 양쪽으로 떨어진 스펙트럼 집합에 대해 성분별 분모를 나누었다는 이유만으로 스펙트럼노름 상수 1을 주장할 수는 없습니다. 이 장의 스펙트럼노름 증명에는 한쪽 분리 조건을 명시합니다.
직사각형 자료의 방향: Wedin 형태의 잔차 계산#
\(\widehat A\widehat V=\widehat U\widehat\Sigma\), \(\widehat A^*\widehat U=\widehat V\widehat\Sigma\)라 합시다. \(R=A\widehat V-\widehat U\widehat\Sigma=-E\widehat V\), \(S=A^*\widehat U-\widehat V\widehat\Sigma=-E^*\widehat U\)는 두 고유방정식의 잔차에 해당합니다. 제외한 특이쌍 \((u_j,v_j,\sigma_j)\)과 선택한 특이쌍의 값 \(\widehat\sigma_i\)에 대해
미지수 두 개의 계수행렬은 대각이 \(-\widehat\sigma_i\), 비대각이 \(\sigma_j\)입니다. 그 고윳값은 \(-\widehat\sigma_i\pm\sigma_j\)이므로, \(|\widehat\sigma_i-\sigma_j|\ge\delta>0\)이면 역행렬 노름은 \(1/\delta\) 이하입니다. 이를 모든 제외 방향에 대해 제곱하여 합하면
직사각형의 짝 없는 영공간 방향에서는 식이 \(-\widehat\sigma_i c=r\) 한 개로 줄어듭니다. 그런 방향이 있으면 추가로 \(\widehat\sigma_i\ge\delta\)를 요구합니다. 이 계산은 좌·우 공간을 함께 제한하는 Wedin 형태의 Frobenius 잔차 정리입니다. 모든 단위 불변 노름에 대한 일반 판본을 이미 증명했다는 뜻은 아닙니다.
7. Bauer–Fike와 비정규 행렬#
비정규 \(A=V\Lambda V^{-1}\)의 섭동 \(\widehat A=A+E\)에 대해 \(\widehat A\)의 고윳값 \(\widehat\lambda\)는
를 만족합니다. 실제로 \(\widehat A x=\widehat\lambda x\)에서
이고, \(\widehat\lambda\)가 모든 \(\lambda_i\)에서 멀다면 좌변 대각행렬의 역노름과 \(\|V^{-1}EV\|_2\)를 비교합니다. 정확한 상쇄 단계는 마지막 증명 절에 씁니다.
\(A=\begin{pmatrix}1&10\\0&2\end{pmatrix}\), \(E=\eta e_2e_1^\top\)이면 특성다항식은
이고 큰 고윳값은 \(1.5+\sqrt{0.25+10\eta}\). \(\eta=10^{-4}\)에서 이동량은 약 \(0.001\), 즉 \(\|E\|\)의 열 배입니다. 비정규성의 위험은 단순히 대칭이 아닌 데 있지 않고, 고유벡터 행렬 \(V\)가 나쁜 조건수를 갖는 데 있습니다.
왼쪽 고유벡터도 이 민감도를 설명합니다. 방금 사용한 \(A\)에서 \(Ax=x\)인 \(x=e_1\)과 \(y^*A=y^*\)인 단위벡터 \(y=(1,-10)^T/\sqrt{101}\)를 잡으면 \(y^*x=1/\sqrt{101}\)입니다. 오른쪽 고유벡터는 상태 방향, 왼쪽 고유벡터는 고유방정식에서 다른 성분을 소거하는 선형 관측을 줍니다. 미분 가능한 단순 고유쌍에서는
따라서 단위 노름 섭동의 도함수 상한은 \(\sqrt{101}\)이고, \(E=e_2e_1^T\)일 때 실제 값은 \(-10\)입니다. 작은 근 \(1.5-\sqrt{0.25+10t}\)의 도함수와 일치합니다. 자기수반 행렬에서는 \(x=y\)로 택할 수 있어 이 분모 문제가 없습니다. 결함 고윳값에는 미분 가능한 단순 경로라는 가정이 적용되지 않습니다. §2의 Jordan 반례에서 움직임은 \(t\)가 아니라 \(\sqrt t\) 크기였으며, 마지막 절에서는 길이 \(m\)의 사슬에 대해 \(t^{1/m}\)을 직접 유도합니다.
8. 유사스펙트럼: 집합으로 후퇴해야 할 때#
\(\varepsilon\)-유사스펙트럼을
로 정의하고, 역행렬이 없는 \(z\)도 포함하도록
로 쓸 수 있습니다. 두 정의가 같은 이유는
이기 때문입니다. 또한
입니다. 단위 오른쪽 최소특이벡터 \(v\)와 \(r=(zI-A)v\)를 잡아 \(E=rv^*\)로 두면 \(Ev=r\), 따라서 \((A+E)v=zv\)입니다. 역방향은 \((zI-A)v=Ev\)에서 노름을 비교합니다. 특히 여기서 섭동의 부호는 양수입니다. 마지막 절에서 열린 부등식까지 포함해 양방향을 증명합니다.
정규행렬에서는 유사스펙트럼이 고윳값 주위의 \(\varepsilon\) 원들의 합집합과 같지만, 비정규 행렬에서는 훨씬 크게 부풀 수 있습니다. 고윳값은 정확한 행렬의 점근적 거동에 대한 정보이고, 유사스펙트럼은 행렬 오차 아래 고윳값의 이동 가능 영역입니다. 거듭제곱의 일시적 증폭과의 관계는 H8에서 이어 다룹니다.
그림 78 같은 고윳값을 가진 두 행렬이라도 비정규 행렬의 유사스펙트럼은 훨씬 넓게 퍼질 수 있습니다.#
9. 계산 코드와 조건 변경#
다음 코드는 대칭 고윳값, 특이값, 고유벡터 회전의 핵심 수치를 재현합니다.
import numpy as np
A = np.diag([1.2, 1.0])
E = np.array([[0., 1.], [1., 0.]])
eps = 0.01
lam, V = np.linalg.eigh(A + eps*E)
theta = np.arctan2(abs(V[1, 1]), abs(V[0, 1]))
expected_lam = np.sort([1.1 - np.sqrt(0.1**2 + eps**2),
1.1 + np.sqrt(0.1**2 + eps**2)])
expected_theta = .5*np.arctan2(2*eps, 0.2)
assert np.allclose(lam, expected_lam, atol=1e-12)
assert abs(theta - expected_theta) < 1e-12
B = np.array([[1., 10.], [0., 2.]])
F = B + 1e-4*np.array([[0., 0.], [1., 0.]])
eta = 1e-4
expected_F = np.sort([1.5 - np.sqrt(.25 + 10*eta),
1.5 + np.sqrt(.25 + 10*eta)])
assert np.allclose(np.sort(np.linalg.eigvals(F)), expected_F, atol=1e-12)
J = np.array([[0., 1.], [0., 0.]])
K = J + 1e-6*np.array([[0., 0.], [1., 0.]])
assert np.allclose(np.sort(np.linalg.eigvals(K)), [-1e-3, 1e-3])
print("H6 섭동 검산 완료")
H6 섭동 검산 완료
10. 직접 풀어 보는 연습과 전체 풀이#
연습 1. Weyl 상한#
\(A=\operatorname{diag}(3,1)\), \(E=0.2I\)의 고윳값 이동과 \(\|E\|_2\)를 비교하세요.
풀이. \(A+E=\operatorname{diag}(3.2,1.2)\)이므로 두 이동은 각각 0.2입니다. \(\|E\|_2=0.2\)이므로 Weyl 상한을 정확히 달성합니다.
연습 2. 고유간극#
\(A=\operatorname{diag}(2,1)\), \(E=\begin{pmatrix}0&0.1\\0.1&0\end{pmatrix}\)에서 상위 고유벡터의 1차 회전량을 구하세요.
풀이. 간극은 1이고 \(e_2^\top Ee_1=0.1\)이므로 \(\dot u_1=0.1e_2\)입니다. 작은 \(t\)에서 회전각은 \(0.1t\) rad입니다.
연습 3. 특이값 안정성#
\(A=\operatorname{diag}(2,1)\), \(E=\begin{pmatrix}0&1\\0&0\end{pmatrix}\)에 대해 특이값 이동의 상한을 쓰세요.
풀이. \(\|E\|_2=1\)이므로 각 특이값은 원래 값에서 1보다 많이 이동할 수 없습니다. 이 상한은 대칭성이나 정규성을 요구하지 않습니다.
연습 4. 비정규 고윳값#
\(B=\begin{pmatrix}1&10\\0&2\end{pmatrix}\)에 \(\eta e_2e_1^\top\)를 더했을 때 큰 고윳값의 1차 이동계수를 구하세요.
풀이. 큰 고윳값은 \(1.5+\sqrt{0.25+10\eta}\)입니다. 미분하면 \(5/\sqrt{0.25+10\eta}\)이고 \(\eta=0\)에서 10입니다. 따라서 작은 섭동도 약 10배 증폭됩니다.
연습 5. 유사스펙트럼#
\(J=\begin{pmatrix}0&1\\0&0\end{pmatrix}\)에서 \(z=\varepsilon\)가 \(\varepsilon\)-유사스펙트럼에 들어가는지 판단하세요.
풀이. \(\varepsilon>0\)라 합시다. 단위벡터 \(v=(1,\varepsilon)^T/\sqrt{1+\varepsilon^2}\)를 고르면
따라서 최소특이값도 \(\varepsilon\)보다 작아 열린 유사스펙트럼에 들어갑니다. 실제 섭동은 \(E=((\varepsilon I-J)v)v^T\)로 구성하면 됩니다. \(e_1\)을 대입했을 때의 잔차는 \(\varepsilon\)이므로 그것만으로 엄격 부등식을 증명할 수 없습니다. 또한 \(J+\varepsilon e_2e_1^T\)의 고윳값은 \(\pm\sqrt\varepsilon\)이므로 이 행렬을 근거로 \(\pm\varepsilon\)라고 쓰면 안 됩니다.
10.5. 한 행렬을 끝까지 추적하는 종합 예시#
앞의 정리들을 따로 외우지 않도록 같은 2×2 행렬을 처음부터 끝까지 추적해 봅시다. 관측 오차가
이고 기준 행렬이 \(A=\operatorname{diag}(1.2,1)\)라고 하겠습니다. 먼저 \(E\)의 두 고윳값은 \(0.02,-0.02\)이므로 \(\|E\|_2=0.02\)입니다. 따라서 Weyl 부등식은 두 고윳값 각각의 이동량이 0.02 이하라고 예측합니다.
실제로 특성다항식을 성분별로 전개하면
곱을 전개하고 근의 공식을 적용하면
즉 \(\lambda_+=1.2019804\), \(\lambda_-=0.9980196\)입니다. 기준 고윳값 \((1.2,1)\)에서 각각 약 \(0.00198\)만 움직였으므로 Weyl 상한은 보수적이지만 정확히 지켜집니다.
이번에는 고유벡터를 봅니다. 회전각은
관측 후 고윳값 간격은 약 \(0.20396\)이고 원래 간극은 \(0.2\)입니다. 원래 간극을 쓰는 1차 민감도식 \(\|\dot u_i\|\le\|E\|/\operatorname{gap}\)은 \(0.02/0.2=0.1\) 정도의 방향 변화만 예상합니다. 실제 각도 \(0.0987\)은 이 예측과 같은 규모입니다. 여기서 학생이 확인할 것은 ‘고윳값은 안정적인데 고유벡터는 상대적으로 더 움직일 수 있다’는 차이입니다.
마지막으로 비정규 행렬에 작은 오차를 넣었을 때를 비교합니다. \(B=\begin{pmatrix}1&10\\0&2\end{pmatrix}\)에 \(F=10^{-4}e_2e_1^\top\)를 더하면 특성다항식은
이고, 근은 \(0.9990010\), \(2.0009990\)입니다. 고윳값 이동 자체는 작지만, \(B\)의 고유벡터 행렬 조건수는 크므로 Bauer–Fike의 원판은 Weyl의 길이보다 훨씬 넓어질 수 있습니다. 이 한 예시가 대칭 자료행렬의 PCA와 비정규 동적 행렬의 안정성 분석을 분리해서 다뤄야 하는 이유를 보여 줍니다.
11. 지금까지의 내용을 수학의 언어로 정리해 봅시다#
지금까지 계산하고 설명한 내용을 수학에서는 다음과 같이 정의하고 정리합니다. 또한 왜 참인지 증명합니다. 앞의 공분산 예는 자기수반 정리의 적용이고, 전단행렬 예는 그 가정을 제거했을 때의 반례입니다. 모든 공간은 유한차원이며 복소 내적은 \(\langle x,y\rangle=y^*x\)로 첫째 인수에 선형입니다. 여기서 \(*\)는 표준 정규직교 좌표의 켤레전치입니다.
정리 1. Weyl과 절대조건수#
자기수반 \(A,B\in\mathbb C^{n\times n}\)의 고윳값을 내림차순으로 정렬하면 \(|\lambda_k(A)-\lambda_k(B)|\le\|A-B\|_2\)입니다. 자기수반 섭동만 허용하는 함수 \(A\mapsto\lambda_k(A)\)의 절대조건수
는 정확히 1입니다.
증명. \(d=\|A-B\|_2\)라 합시다. Cauchy–Schwarz와 유도노름의 정의로 단위 \(x\)에 대해 \(|x^*(A-B)x|\le\|x\|\|(A-B)x\|\le d\)입니다. 고정한 \(k\)차원 공간 \(L\)에서 \(B\)의 Rayleigh 몫을 최소화하는 단위벡터 \(x_B\)를 고릅니다. 존재성은 유한차원 단위구의 컴팩트성과 연속성에 따릅니다. 그러면
모든 \(L\)에 대해 최대를 취하면 H5의 Courant–Fischer에 따라 \(\lambda_k(A)\le\lambda_k(B)+d\)입니다. \(A,B\)를 교환해 반대 부등식을 얻습니다. 조건수의 상한은 1이고, \(E=tI\), \(t>0\)에서 몫이 정확히 1이므로 하한도 1입니다. ∎
일반형 \(\lambda_{i+j-1}(A+B)\le\lambda_i(A)+\lambda_j(B)\)도 증명할 수 있습니다. \(r=i+j-1\le n\)이라 합시다. \(A\)의 \(i\)번째 이하 고유공간의 합을 \(L\), \(B\)의 \(j\)번째 이하를 \(M\), \(A+B\)의 상위 \(r\)개 공간을 \(N\)이라 합니다. 차원 공식으로 \(\dim(L\cap M)\ge n-i-j+2=n-r+1\)이고 \(\dim((L\cap M)\cap N)\ge1\)입니다. 그 안의 단위벡터에서 \(\lambda_r(A+B)\le x^*(A+B)x\le\lambda_i(A)+\lambda_j(B)\)를 얻습니다. ∎
보조정리와 정리 2. Hoffman–Wielandt#
내림차순 실수열 \(\lambda,\mu\)와 이중확률행렬 \(S=(s_{ij})\)에 대해 \(\sum_{ij}\lambda_i s_{ij}\mu_j\le\sum_i\lambda_i\mu_i\)입니다.
증명. \(y_i=\sum_j s_{ij}\mu_j\)라 합시다. \(a_j=\sum_{i=1}^k s_{ij}\)는 \(0\le a_j\le1\), \(\sum_j a_j=k\)를 만족합니다. \(d=\sum_{j\le k}(1-a_j)=\sum_{j>k}a_j\)라 놓으면
따라서 \(D_k=\sum_{i\le k}(\mu_i-y_i)\ge0\)이며 \(D_n=0\)입니다. \(D_0=0\)으로 두고 합을 전개하면
음의 고윳값이 있어도 차이 계수만 사용하므로 증명은 유지됩니다. ∎
자기수반 \(A,B\)에 대해 \(\sum_i(\lambda_i(A)-\lambda_i(B))^2\le\|A-B\|_F^2\)입니다.
증명. 스펙트럼 정리로 \(A=U\Lambda U^*\), \(B=VMV^*\)라 쓰겠습니다. \(W=U^*V\)는 유니터리여서 \(\sum_j|w_{ij}|^2=\sum_i|w_{ij}|^2=1\)입니다. Frobenius 불변성과 자취의 성분 합을 이용하면
마지막 부등식은 방금 증명한 보조정리입니다. 정렬의 필요성은 \(A=B=\operatorname{diag}(1,0)\)에서 \(B\)의 목록만 \((0,1)\)로 뒤집으면 좌변 2, 우변 0이 되는 것으로 확인됩니다. ∎
정리 3. 직사각형 특이값의 두 거리#
같은 크기 \(m\times n\) 행렬 \(A,B\)와 \(r=\min(m,n)\)에 대해
증명. 본문의 Hermitian dilation은 크기 \(m+n\)이고 자기수반입니다. SVD의 모든 열을 사용하면 그 고윳값 목록은 \(\sigma_1,\ldots,\sigma_r\), \(|m-n|\)개의 0, \(-\sigma_r,\ldots,-\sigma_1\)입니다. 특이값 0도 이 목록에서 제외하지 않습니다. 특히 내림차순 목록의 앞 \(r\)개는 항상 \(\sigma_1,\ldots,\sigma_r\)입니다. \(D=A-B\)에 대해
최대 오른쪽 특이벡터 \(v\)에 \((x,y)=(0,v)\)를 넣으면 등호이므로 \(\|\mathcal H(D)\|_2=\|D\|_2\)입니다. 성분 제곱합으로는 \(\|\mathcal H(D)\|_F^2=2\|D\|_F^2\)입니다. 첫 부등식은 정리 1을, 둘째는 정리 2를 적용하고 좌우의 2를 나누면 얻습니다. ∎
정리 4. 미분 가능한 고유쌍과 간극#
\(A(t)=A+tE\)가 자기수반이고 \(\lambda_i(0)\)가 단순하다고 하자. \(t=0\) 근처의 미분 가능한 정규화 고유쌍 경로를 전제로 하고, \(u_i^*\dot u_i=0\)인 위상을 선택하면 본문의 두 미분 공식과 \(\|\dot u_i\|\le\|E\|_2/\operatorname{gap}_i\)가 성립합니다. 실수 경로의 존재에는 C6의 고유쌍 미분을 사용합니다. 복소 경로에 대한 존재 정리를 여기서 별도로 주장하지 않습니다.
증명. 정규화식을 미분하면 \(2\operatorname{Re}(u_i^*\dot u_i)=0\)입니다. 복소수인 경우 그 순허수 성분은 \(u_i(t)\)에 \(e^{\mathrm i\phi(t)}\)를 곱하고 적절한 실수 \(\phi'(0)\)를 택해 0으로 만듭니다. 고유방정식의 미분에 각 \(u_j^*\)를 곱하면 §5의 두 계수식이 나옵니다. 정규직교 기저의 전개가 유일하므로 그 계수를 합한 식이 \(\dot u_i\)입니다. Parseval로
이것은 도함수의 상한입니다. 유한한 \(t\)에 그대로 곱한 값이 엄밀한 유한 오차 상한이라는 결론은 따로 증명해야 합니다. ∎
정리 5. 한쪽으로 분리된 공간의 잔차 상한#
\(A=A^*\)의 상위 \(k<n\)개 고유벡터를 \(U\), 나머지를 \(U_\perp\)라 합시다. 정규직교 열을 갖는 \(\widehat U\)와 자기수반 \(\widehat\Lambda\)에 대해 \(R=A\widehat U-\widehat U\widehat\Lambda\)라 놓습니다. \(\lambda_{\max}(U_\perp^*AU_\perp)\le a<b\le\lambda_{\min}(\widehat\Lambda)\)이면
증명. \(C=U_\perp^*AU_\perp\), \(X=U_\perp^*\widehat U\), \(F=U_\perp^*R\)라 하면 \(CX-X\widehat\Lambda=F\)입니다. 자기수반 행렬의 지수는 여기서는 고유기저에서 실수 지수를 적용한 것으로 정의합니다. 대각화하여 미분하면
좌변 괄호의 노름은 \(e^{-(b-a)t}\|X\|_2\) 이하로 0에 수렴합니다. 따라서 성분별 적분의 미적분학 기본정리로
유한차원 노름의 연속성과 삼각부등식이 적분 부등식을 정당화합니다. \(U_\perp\)는 등거리이므로 \(\|X\|_2=\|(I-UU^*)\widehat U\|_2\)입니다. 또한 \(X^*X=I-\widehat U^*UU^*\widehat U\)의 고윳값은 \(1-\cos^2\theta_j\)이므로 이 노름은 최대 주각의 사인입니다. 관측 고유공간이면 \(R=-E\widehat U\)입니다. 본문에서 Weyl과 결합한 원래 간극 상한도 이제 정당화됩니다. ∎
일반 내부 군집에서는 \(C,\widehat\Lambda\)를 각각 대각화해 \((c_j-\widehat\lambda_i)X_{ji}=F_{ji}\)를 얻습니다. 모든 \(|c_j-\widehat\lambda_i|\ge\delta\)이면 성분 제곱합으로 \(\|X\|_F\le\|F\|_F/\delta\)입니다. 이 증명은 한쪽 분리를 요구하지 않지만 결론의 노름은 Frobenius입니다. ∎
정리 6. Bauer–Fike와 비정규 고윳값의 도함수#
\(A=V\Lambda V^{-1}\)가 복소수에서 대각화 가능하면 \(A+E\)의 모든 고윳값 \(z\)에 대해 \(\min_i|z-\lambda_i|\le\kappa_2(V)\|E\|_2\)입니다.
증명. \(z\)가 원래 고윳값이면 좌변이 0입니다. 아니면 \(zI-\Lambda\)가 가역입니다. \((A+E)x=zx\), \(x\ne0\)에서 \(y=V^{-1}x\ne0\)라 두면 \((zI-\Lambda)y=V^{-1}EVy\)입니다. 따라서
양수 \(\|y\|_2\)로 나누고 정리합니다. 이는 각 관측 고윳값에 어떤 원래 고윳값이 가깝다는 말이며, 순서를 보존하는 일대일 대응을 보장하지 않습니다. ∎
미분 가능한 단순 고유쌍에 대해 \(Ax=\lambda x\), \(y^*A=\lambda y^*\)이면
실제로 미분한 식에 \(y^*\)를 곱하면 \(y^*Ex+\lambda y^*\dot x=\dot\lambda y^*x+\lambda y^*\dot x\)이고, 공통항이 소거됩니다. 단순 고윳값에서는 \(y^*x\ne0\)입니다. 0이라면 \(x\in(\ker(A^*-\overline\lambda I))^\perp=\operatorname{range}(A-\lambda I)\)여서 \((A-\lambda I)w=x\)인 길이 2의 Jordan 사슬이 생겨 단순성과 모순입니다.
\(\|x\|=\|y\|=1\)이면 도함수의 최대 크기는 \(1/|y^*x|\)입니다. 상한은 Cauchy–Schwarz, 달성은 \(E=yx^*\)에서 나옵니다. 이 달성은 제한 없는 복소 섭동에 대한 것이며 구조를 보존하는 섭동의 조건수와 구별합니다.
결함 고윳값에서는 선형 상한 자체가 없을 수 있습니다. 위 대각선이 1인 \(m\ge2\)차 Jordan 블록 \(J_m(0)\)에 \(\eta e_me_1^T\)를 더하면 고유방정식의 첫 \(m-1\)개 식은 \(x_{j+1}=\lambda x_j\), 마지막 식은 \(\eta x_1=\lambda x_m\)입니다. \(x_1=0\)이면 모든 성분이 0이므로 \(x_1\ne0\)이고 \(\lambda^m=\eta\)입니다. \(\eta>0\)일 때 각 근의 크기는 \(\eta^{1/m}\), 섭동 노름은 \(\eta\)입니다. 비율 \(\eta^{1/m-1}\)은 발산합니다.
정리 7. 열린 유사스펙트럼의 세 표현#
\(\varepsilon>0\)이고 \(A\)가 복소 정방행렬일 때 다음 집합은 같습니다.
증명. 최소특이값은 단위구에서 잔차 노름의 최솟값이며 H4의 SVD로 달성됩니다. 첫 집합의 \(z\)에 대해 단위 최소화 벡터 \(v\), \(r=(zI-A)v\), \(E=rv^*\)라 합시다. \(Ev=r\)이고 \((A+E)v=zv\)입니다. \(\|Ew\|=\|r\||v^*w|\le\|r\|\|w\|\)이며 \(w=v\)에서 등호이므로 \(\|E\|_2=\|r\|<\varepsilon\).
따라서 둘째 집합에 속합니다.
역으로 단위 고유벡터 \(v\)에서 \((zI-A)v=Ev\)이므로 \(\sigma_{\min}(zI-A)\le\|Ev\|\le\|E\|<\varepsilon\)입니다. 가역인 경우 SVD를 뒤집으면 역행렬의 최대특이값은 원행렬의 최소특이값의 역수입니다. 비가역이면 최소특이값이 0입니다. 이로써 셋째 표현도 같습니다. ∎
정규 \(A=U\Lambda U^*\)에서는 \(zI-A=U(zI-\Lambda)U^*\)이므로 최소특이값은 \(\min_i|z-\lambda_i|\)입니다. 따라서 열린 반지름 \(\varepsilon\) 원판들의 합집합이 정확한 유사스펙트럼입니다. 비정규행렬에 대해서는 이 마지막 등식을 사용할 수 없습니다.
고윳값의 오차가 작아도 고유방향의 오차는 간극에 따라 커질 수 있습니다. 다음 장에서는 이차형식과 제약을 함께 다루며, 좌표변환 뒤에도 유지되는 부호와 행렬 펜슬의 구조를 확인합니다. H7로 이어 읽기.