H6 · 스펙트럼 섭동: 추정한 고유구조를 얼마나 믿을 것인가#

H5에서는 정확히 주어진 행렬에서 가장 좋은 방향을 골랐습니다. 실제로는 행렬 자체를 관측이나 계산으로 얻으므로, 입력이 조금 바뀌면 그 방향도 달라집니다.

이번 장에서는 참 행렬과 관측 행렬을 구별하고, 고윳값의 오차와 고유방향의 오차를 각각 계산합니다. 같은 크기의 섭동도 고유간극과 정규성에 따라 다른 영향을 줄 수 있습니다.

1. 표본공분산에서 시작하는 질문#

서로 다른 세 지표를 정한 기준단위로 나누어 무차원 변수로 만들고, 각 평균을 뺐다고 하겠습니다. 공분산의 수치는 이 무차원 변수의 곱의 평균입니다. 아래 행렬은 실제 추정 자료가 아니라 계산을 확인하기 위한 교육용 모형입니다. 모집단 공분산이

\[\begin{split}\Sigma=\begin{pmatrix}4&0&0\\0&1.1&0\\0&0&1\end{pmatrix}\end{split}\]

라고 하겠습니다. 표본에서 얻은 행렬에는 측정오차가 들어가

\[\begin{split}\widehat\Sigma=\Sigma+E,\qquad E=\begin{pmatrix}0&0&0\\0&0&0.05\\0&0.05&0\end{pmatrix}\end{split}\]

가 되었다고 합시다. \(E\)는 대칭이고 \(\|E\|_2=0.05\)입니다.

첫째 좌표는 다른 좌표와 결합하지 않아 고윳값 4와 고유벡터 \(e_1\)이 그대로입니다. 나머지 블록을 \(C\)라 쓰면 고유방정식은

\[(11/10-\lambda)v_2+(1/20)v_3=0,\qquad (1/20)v_2+(1-\lambda)v_3=0.\]

0이 아닌 해가 있으려면 두 식이 종속이어야 하므로

\[\det(C-\lambda I)=(11/10-\lambda)(1-\lambda)-1/400 =(21/20-\lambda)^2-1/200=0.\]

따라서 둘째·셋째 좌표 블록의 고윳값은

\[1.05\pm\sqrt{0.05^2+0.05^2} =1.05\pm0.070711\]

입니다. 따라서

\[\lambda(\widehat\Sigma)=(4,1.120711,0.979289).\]

가장 큰 이동은 약 \(0.020711\)로 섭동 노름 \(0.05\)보다 작습니다. 하지만 둘째 고유벡터는 \(e_2\)에서

\[\tan(2\theta)=\frac{2(0.05)}{1.1-1}=1,\qquad\theta=22.5^\circ\]

만큼 회전합니다. 이 식은 \(u=(\cos\theta,\sin\theta)\)\(w=(-\sin\theta,\cos\theta)\) 사이의 교차항을 0으로 두어 얻습니다.

\[w^TCu=(1/20)(\cos^2\theta-\sin^2\theta) -(1/10)\sin\theta\cos\theta=0.\]

\(0<\theta<\pi/4\)인 큰 고윳값 방향을 고르면 \(\cos2\theta=\sin2\theta\)이므로 \(\theta=\pi/8\)입니다. 큰 고윳값의 방향은 \((0,\cos\theta,\sin\theta)\)이고, 작은 고윳값 방향은 \((0,-\sin\theta,\cos\theta)\)입니다. 같은 오차가 고윳값과 방향에 전혀 다른 영향을 줍니다. 이 장의 질문은 “행렬이 조금 바뀌면 무엇이 얼마나 바뀌는가?”입니다.

여기서 \(A\)는 이상적 모집단 값, \(\widehat A\)는 표본·센서·수치 알고리즘이 내놓은 값, \(E\)는 그 차이입니다. \(E\)의 원인을 특정 확률분포로 가정하지 않고 결정론적 노름으로 먼저 제한합니다.

원래 공분산 행렬과 섭동된 공분산 행렬의 고윳값 이동

그림 76 세로축은 고윳값 자체가 아니라 원래 값에서의 이동량입니다. 원 표시는 이동 전의 0, 가위 표시는 실제 이동, 세로 막대는 Weyl 상한이 허용하는 \([-0.05,0.05]\)입니다. 첫 방향은 변하지 않고 나머지 두 값은 약 \(\pm0.020711\) 이동합니다.#

2. Weyl 부등식: 자기수반 고윳값의 이동을 제한한다#

\(A,B\)가 자기수반이고 고윳값을 내림차순으로 정렬했다고 합시다. 단위벡터 \(x\)에 대해

\[x^*Ax=x^*Bx+x^*(A-B)x \le x^*Bx+\|A-B\|_2\]

입니다. \(k\)차원 부분공간 \(S\)에서 최소를 취하면

\[\min_{x\in S,\|x\|=1}x^*Ax \le\min_{x\in S,\|x\|=1}x^*Bx+\|A-B\|_2.\]

양변에서 \(\dim S=k\)인 공간에 대해 최댓값을 취하고 H5의 Courant–Fischer를 사용하면

\[\lambda_k(A)\le\lambda_k(B)+\|A-B\|_2.\]

\(A\)\(B\)를 바꾸면 반대 부등식도 얻어

\[|\lambda_k(A)-\lambda_k(B)|\le\|A-B\|_2.\]

예를 들어 \(B=A+0.1I\)이면 모든 고윳값이 정확히 \(0.1\)씩 이동하고 \(\|B-A\|_2=0.1\)입니다. 상한이 실제로 달성되므로 자기수반 고윳값 함수의 절대조건수는 1입니다. 비대칭 행렬에서는 이 결론이 거짓입니다.

\[\begin{split}A=\begin{pmatrix}0&1\\0&0\end{pmatrix},\quad E=\begin{pmatrix}0&0\\10^{-6}&0\end{pmatrix}\end{split}\]

이면 \(A+E\)의 고윳값은 \(\pm10^{-3}\)입니다. 섭동 크기는 \(10^{-6}\)인데 고윳값은 \(10^{-3}\) 움직였습니다.

3. 전체 고윳값의 거리: Hoffman–Wielandt#

Weyl은 한 고윳값씩 묶습니다. 전체 벡터를 한꺼번에 보면 자기수반 \(A,B\)에 대해

\[\sum_{i=1}^n(\lambda_i(A)-\lambda_i(B))^2 \le\|A-B\|_F^2\]

가 성립합니다. 이를 확인하기 위해 \(A=U\Lambda U^*\), \(B=V M V^*\), \(W=U^*V\)라 두면

\[\|A-B\|_F^2 =\|\Lambda-WMW^*\|_F^2.\]

성분을 전개하면

\[\sum_i\lambda_i^2+\sum_j\mu_j^2 -2\sum_{i,j}|w_{ij}|^2\lambda_i\mu_j.\]

\(S=(|w_{ij}|^2)\)는 각 행과 열의 제곱합이 1인 이중확률행렬입니다. \(\lambda,\mu\)가 내림차순이면 Abel 합 논증으로

\[\sum_{i,j}s_{ij}\lambda_i\mu_j\le\sum_i\lambda_i\mu_i\]

입니다. 오른쪽을 대입하면 원하는 부등식이 나옵니다. 정렬을 하지 않으면 같은 고윳값 집합을 불필요하게 멀리 비교하게 되므로, 순서가 정리의 일부입니다.

4. 특이값은 비대칭에서도 안정적이다#

직사각형 \(A\)의 특이값은 H4에서 \(|A|=(A^*A)^{1/2}\)의 고윳값으로 정의했습니다. 더 직접적인 증명을 위해 Hermitian dilation을 사용합니다.

\[\begin{split}\mathcal H(A)=\begin{pmatrix}0&A\\A^*&0\end{pmatrix}.\end{split}\]

\(A=U\Sigma V^*\)의 특이쌍 \((u_i,v_i)\)에 대해

\[\begin{split}\mathcal H(A)\begin{pmatrix}u_i\\v_i\end{pmatrix} =\sigma_i\begin{pmatrix}u_i\\v_i\end{pmatrix},\qquad \mathcal H(A)\begin{pmatrix}u_i\\-v_i\end{pmatrix} =-\sigma_i\begin{pmatrix}u_i\\-v_i\end{pmatrix}.\end{split}\]

따라서 \(r=\min(m,n)\)일 때 \(\mathcal H(A)\)의 내림차순 고윳값 목록의 앞 \(r\)개가 \(A\)의 특이값입니다. 0인 특이값도 포함하며, 나머지 목록은 추가 영값과 음의 특이값으로 이루어집니다. 또한

\[\mathcal H(A)-\mathcal H(B)=\mathcal H(A-B),\qquad \|\mathcal H(A-B)\|_2=\|A-B\|_2.\]

Weyl을 적용하면

\[|\sigma_i(A)-\sigma_i(B)|\le\|A-B\|_2\]

입니다. 고윳값이 비정규성 때문에 크게 흔들린 §1의 반례에서도 특이값은 이 상한을 지킵니다.

5. 고유벡터에는 고유간극이 분모로 들어간다#

\(A(t)=A+tE\)이고 \(A\)의 단순 고윳값 \(\lambda_i\)와 단위 고유벡터 \(u_i\)가 있다고 합시다.

\[A(t)u_i(t)=\lambda_i(t)u_i(t)\]

를 미분하면

\[Eu_i+A\dot u_i=\dot\lambda_i u_i+\lambda_i\dot u_i.\]

왼쪽에 \(u_i^*\)를 곱하면 자기수반성으로 \(u_i^*A=\lambda_i u_i^*\)이므로

\[\dot\lambda_i=u_i^*Eu_i.\]

이번에는 \(u_j^*\) (\(j\ne i\))를 곱합니다.

\[u_j^*Eu_i+\lambda_j u_j^*\dot u_i =\lambda_i u_j^*\dot u_i.\]

따라서

\[u_j^*\dot u_i=\frac{u_j^*Eu_i}{\lambda_i-\lambda_j}.\]

정규화 조건에서 \(u_i^*\dot u_i=0\)인 위상을 택하면

\[\dot u_i=\sum_{j\ne i} \frac{u_j^*Eu_i}{\lambda_i-\lambda_j}u_j.\]

고유간극 \(\operatorname{gap}_i=\min_{j\ne i}|\lambda_i-\lambda_j|\)로 묶으면

\[\|\dot u_i\|_2\le\frac{\|E\|_2}{\operatorname{gap}_i}.\]

\(A=\operatorname{diag}(1.2,1)\), \(E=\begin{pmatrix}0&1\\1&0\end{pmatrix}\)이면 \(\dot\lambda_1=0\), \(\dot u_1=5e_2\)입니다. 정확한 회전각은

\[\theta(t)=\frac12\arctan(10t)\]

이고 \(t=0.01\)에서 선형 예측 \(0.05\) rad와 정확값 \(0.04992\) rad가 거의 같습니다. 간극을 0으로 보내면 같은 크기의 오차가 방향을 크게 돌립니다.

고유간극이 작아질수록 같은 섭동에서 고유벡터 회전량이 커지는 그래프

그림 77 섭동 크기를 고정하고 간극을 줄이면 1차 근사는 \(0.01/\operatorname{gap}\)으로 증가하지만, 실제 각도 \(\frac12\arctan(0.02/\operatorname{gap})\)\(\pi/4\) 이하입니다. 양쪽 축은 로그 눈금이며 작은 간극에서 선형 근사가 무너지는 모습을 비교합니다.#

6. 주각과 Davis–Kahan의 의미#

고유벡터 하나의 부호나 복소 위상은 임의입니다. \(u\)\(-u\)는 같은 직선을 나타내므로 두 벡터의 차이를 그대로 오차로 쓰면 안 됩니다. 단위벡터 사이의 주각을 \(0\le\theta\le\pi/2\)에서

\[\cos\theta=|u^*\widehat u|,\qquad \sin\theta=\|(I-uu^*)\widehat u\|_2\]

로 정합니다. 두 번째 등식은 \(\widehat u\)의 직교분해와 피타고라스로 얻습니다.

차원이 같은 두 부분공간의 정규직교 기저를 \(U,\widehat U\in\mathbb C^{n\times k}\)라 합시다. \(U^*\widehat U\)의 특이값을 \(\cos\theta_1,\ldots,\cos\theta_k\)로 정의합니다. 모두 0과 1 사이인데, \(\|U^*\widehat Ux\|\le\|x\|\)이기 때문입니다. 기저를 바꾸면 이 행렬의 양쪽에 유니터리 행렬만 곱해져 특이값은 유지됩니다. 따라서 주각은 기저가 아니라 부분공간 사이의 양입니다.

관심 공간이 \(A\)의 상위 \(k\)개 방향이라고 합시다. \(a=\lambda_{k+1}(A)\), \(b=\widehat\lambda_k\)로 놓고 \(b>a\)를 확인하면 다음 잔차 상한이 성립합니다.

\[\|\sin\Theta\|_2:=\|(I-UU^*)\widehat U\|_2 \le\frac{\|E\widehat U\|_2}{\widehat\lambda_k-\lambda_{k+1}(A)} \le\frac{\|E\|_2}{\widehat\lambda_k-\lambda_{k+1}(A)}.\]

분모는 원래 행렬의 제외한 스펙트럼과 관측 행렬의 선택한 스펙트럼 사이의 거리입니다. 원래 간극 \(g=\lambda_k(A)-\lambda_{k+1}(A)>0\)만 알고 있다면 Weyl로 \(\widehat\lambda_k\ge\lambda_k(A)-\|E\|_2\)입니다. 따라서 \(\|E\|_2<g/2\)에서는

\[\|\sin\Theta\|_2\le\frac{\|E\|_2}{g-\|E\|_2} \le\frac{2\|E\|_2}{g}.\]

\(\|E\|_2\ge g/2\)에서는 마지막 우변이 1 이상이고 \(\|\sin\Theta\|_2\le1\)이므로, 상수 2가 붙은 원래 간극 상한은 모든 섭동 크기에서 유지됩니다. 간극의 종류와 상수를 바꿔 쓰지 않아야 합니다. 원래 간극을 이용하는 통계적 변형의 배경은 Yu–Wang–Samworth의 논문에서 볼 수 있습니다. 여기서는 상위 공간 판본의 증명을 마지막 절에서 직접 완성합니다.

첫 공분산 예에서 상위 두 방향의 원래 간극은 \(1.1-1=0.1\), 혼합 간극은 \(1.120711-1\approx0.120711\)입니다. 잔차 상한은 \(0.05/0.120711\approx0.414214\)이고 실제 사인 오차는 \(\sin(\pi/8)\approx0.382683\)입니다. 반면 하위 두 방향을 묶은 평면은 섭동 전후 모두 \(\operatorname{span}(e_2,e_3)\)여서 오차가 0입니다. 개별 방향과 그 방향들이 만드는 공간을 구별하면 중복 고윳값 근처에서도 무엇이 식별되는지 알 수 있습니다.

일반적인 내부 군집에서도 잔차식의 각 성분을 나누면 Frobenius 상한을 얻습니다. 그러나 양쪽으로 떨어진 스펙트럼 집합에 대해 성분별 분모를 나누었다는 이유만으로 스펙트럼노름 상수 1을 주장할 수는 없습니다. 이 장의 스펙트럼노름 증명에는 한쪽 분리 조건을 명시합니다.

직사각형 자료의 방향: Wedin 형태의 잔차 계산#

\(\widehat A\widehat V=\widehat U\widehat\Sigma\), \(\widehat A^*\widehat U=\widehat V\widehat\Sigma\)라 합시다. \(R=A\widehat V-\widehat U\widehat\Sigma=-E\widehat V\), \(S=A^*\widehat U-\widehat V\widehat\Sigma=-E^*\widehat U\)는 두 고유방정식의 잔차에 해당합니다. 제외한 특이쌍 \((u_j,v_j,\sigma_j)\)과 선택한 특이쌍의 값 \(\widehat\sigma_i\)에 대해

\[\sigma_j(v_j^*\widehat v_i)-\widehat\sigma_i(u_j^*\widehat u_i)=u_j^*R_i, \qquad \sigma_j(u_j^*\widehat u_i)-\widehat\sigma_i(v_j^*\widehat v_i)=v_j^*S_i.\]

미지수 두 개의 계수행렬은 대각이 \(-\widehat\sigma_i\), 비대각이 \(\sigma_j\)입니다. 그 고윳값은 \(-\widehat\sigma_i\pm\sigma_j\)이므로, \(|\widehat\sigma_i-\sigma_j|\ge\delta>0\)이면 역행렬 노름은 \(1/\delta\) 이하입니다. 이를 모든 제외 방향에 대해 제곱하여 합하면

\[\|\sin\Theta_U\|_F^2+\|\sin\Theta_V\|_F^2 \le\frac{\|R\|_F^2+\|S\|_F^2}{\delta^2}.\]

직사각형의 짝 없는 영공간 방향에서는 식이 \(-\widehat\sigma_i c=r\) 한 개로 줄어듭니다. 그런 방향이 있으면 추가로 \(\widehat\sigma_i\ge\delta\)를 요구합니다. 이 계산은 좌·우 공간을 함께 제한하는 Wedin 형태의 Frobenius 잔차 정리입니다. 모든 단위 불변 노름에 대한 일반 판본을 이미 증명했다는 뜻은 아닙니다.

7. Bauer–Fike와 비정규 행렬#

비정규 \(A=V\Lambda V^{-1}\)의 섭동 \(\widehat A=A+E\)에 대해 \(\widehat A\)의 고윳값 \(\widehat\lambda\)

\[\min_i|\widehat\lambda-\lambda_i(A)| \le\kappa_2(V)\|E\|_2\]

를 만족합니다. 실제로 \(\widehat A x=\widehat\lambda x\)에서

\[(\widehat\lambda I-\Lambda)V^{-1}x=V^{-1}Ex\]

이고, \(\widehat\lambda\)가 모든 \(\lambda_i\)에서 멀다면 좌변 대각행렬의 역노름과 \(\|V^{-1}EV\|_2\)를 비교합니다. 정확한 상쇄 단계는 마지막 증명 절에 씁니다.

\(A=\begin{pmatrix}1&10\\0&2\end{pmatrix}\), \(E=\eta e_2e_1^\top\)이면 특성다항식은

\[\lambda^2-3\lambda+2-10\eta\]

이고 큰 고윳값은 \(1.5+\sqrt{0.25+10\eta}\). \(\eta=10^{-4}\)에서 이동량은 약 \(0.001\), 즉 \(\|E\|\)의 열 배입니다. 비정규성의 위험은 단순히 대칭이 아닌 데 있지 않고, 고유벡터 행렬 \(V\)가 나쁜 조건수를 갖는 데 있습니다.

왼쪽 고유벡터도 이 민감도를 설명합니다. 방금 사용한 \(A\)에서 \(Ax=x\)\(x=e_1\)\(y^*A=y^*\)인 단위벡터 \(y=(1,-10)^T/\sqrt{101}\)를 잡으면 \(y^*x=1/\sqrt{101}\)입니다. 오른쪽 고유벡터는 상태 방향, 왼쪽 고유벡터는 고유방정식에서 다른 성분을 소거하는 선형 관측을 줍니다. 미분 가능한 단순 고유쌍에서는

\[ \dot\lambda=\frac{y^*Ex}{y^*x}. \]

따라서 단위 노름 섭동의 도함수 상한은 \(\sqrt{101}\)이고, \(E=e_2e_1^T\)일 때 실제 값은 \(-10\)입니다. 작은 근 \(1.5-\sqrt{0.25+10t}\)의 도함수와 일치합니다. 자기수반 행렬에서는 \(x=y\)로 택할 수 있어 이 분모 문제가 없습니다. 결함 고윳값에는 미분 가능한 단순 경로라는 가정이 적용되지 않습니다. §2의 Jordan 반례에서 움직임은 \(t\)가 아니라 \(\sqrt t\) 크기였으며, 마지막 절에서는 길이 \(m\)의 사슬에 대해 \(t^{1/m}\)을 직접 유도합니다.

8. 유사스펙트럼: 집합으로 후퇴해야 할 때#

\(\varepsilon\)-유사스펙트럼을

\[\Lambda_\varepsilon(A)= \{z:\|(zI-A)^{-1}\|_2>\varepsilon^{-1}\}\]

로 정의하고, 역행렬이 없는 \(z\)도 포함하도록

\[\Lambda_\varepsilon(A)= \{z:\sigma_{\min}(zI-A)<\varepsilon\}\]

로 쓸 수 있습니다. 두 정의가 같은 이유는

\[\|(zI-A)^{-1}\|_2 =\frac1{\sigma_{\min}(zI-A)}\]

이기 때문입니다. 또한

\[z\in\Lambda_\varepsilon(A) \Longleftrightarrow z\in\sigma(A+E)\text{인 }E,\ \|E\|_2<\varepsilon\text{가 존재}\]

입니다. 단위 오른쪽 최소특이벡터 \(v\)\(r=(zI-A)v\)를 잡아 \(E=rv^*\)로 두면 \(Ev=r\), 따라서 \((A+E)v=zv\)입니다. 역방향은 \((zI-A)v=Ev\)에서 노름을 비교합니다. 특히 여기서 섭동의 부호는 양수입니다. 마지막 절에서 열린 부등식까지 포함해 양방향을 증명합니다.

정규행렬에서는 유사스펙트럼이 고윳값 주위의 \(\varepsilon\) 원들의 합집합과 같지만, 비정규 행렬에서는 훨씬 크게 부풀 수 있습니다. 고윳값은 정확한 행렬의 점근적 거동에 대한 정보이고, 유사스펙트럼은 행렬 오차 아래 고윳값의 이동 가능 영역입니다. 거듭제곱의 일시적 증폭과의 관계는 H8에서 이어 다룹니다.

정규 행렬과 비정규 전단행렬의 유사스펙트럼 등고선 비교

그림 78 같은 고윳값을 가진 두 행렬이라도 비정규 행렬의 유사스펙트럼은 훨씬 넓게 퍼질 수 있습니다.#

9. 계산 코드와 조건 변경#

다음 코드는 대칭 고윳값, 특이값, 고유벡터 회전의 핵심 수치를 재현합니다.

import numpy as np
A = np.diag([1.2, 1.0])
E = np.array([[0., 1.], [1., 0.]])
eps = 0.01
lam, V = np.linalg.eigh(A + eps*E)
theta = np.arctan2(abs(V[1, 1]), abs(V[0, 1]))
expected_lam = np.sort([1.1 - np.sqrt(0.1**2 + eps**2),
                        1.1 + np.sqrt(0.1**2 + eps**2)])
expected_theta = .5*np.arctan2(2*eps, 0.2)
assert np.allclose(lam, expected_lam, atol=1e-12)
assert abs(theta - expected_theta) < 1e-12
B = np.array([[1., 10.], [0., 2.]])
F = B + 1e-4*np.array([[0., 0.], [1., 0.]])
eta = 1e-4
expected_F = np.sort([1.5 - np.sqrt(.25 + 10*eta),
                      1.5 + np.sqrt(.25 + 10*eta)])
assert np.allclose(np.sort(np.linalg.eigvals(F)), expected_F, atol=1e-12)
J = np.array([[0., 1.], [0., 0.]])
K = J + 1e-6*np.array([[0., 0.], [1., 0.]])
assert np.allclose(np.sort(np.linalg.eigvals(K)), [-1e-3, 1e-3])
print("H6 섭동 검산 완료")
H6 섭동 검산 완료

10. 직접 풀어 보는 연습과 전체 풀이#

연습 1. Weyl 상한#

\(A=\operatorname{diag}(3,1)\), \(E=0.2I\)의 고윳값 이동과 \(\|E\|_2\)를 비교하세요.

풀이. \(A+E=\operatorname{diag}(3.2,1.2)\)이므로 두 이동은 각각 0.2입니다. \(\|E\|_2=0.2\)이므로 Weyl 상한을 정확히 달성합니다.

연습 2. 고유간극#

\(A=\operatorname{diag}(2,1)\), \(E=\begin{pmatrix}0&0.1\\0.1&0\end{pmatrix}\)에서 상위 고유벡터의 1차 회전량을 구하세요.

풀이. 간극은 1이고 \(e_2^\top Ee_1=0.1\)이므로 \(\dot u_1=0.1e_2\)입니다. 작은 \(t\)에서 회전각은 \(0.1t\) rad입니다.

연습 3. 특이값 안정성#

\(A=\operatorname{diag}(2,1)\), \(E=\begin{pmatrix}0&1\\0&0\end{pmatrix}\)에 대해 특이값 이동의 상한을 쓰세요.

풀이. \(\|E\|_2=1\)이므로 각 특이값은 원래 값에서 1보다 많이 이동할 수 없습니다. 이 상한은 대칭성이나 정규성을 요구하지 않습니다.

연습 4. 비정규 고윳값#

\(B=\begin{pmatrix}1&10\\0&2\end{pmatrix}\)\(\eta e_2e_1^\top\)를 더했을 때 큰 고윳값의 1차 이동계수를 구하세요.

풀이. 큰 고윳값은 \(1.5+\sqrt{0.25+10\eta}\)입니다. 미분하면 \(5/\sqrt{0.25+10\eta}\)이고 \(\eta=0\)에서 10입니다. 따라서 작은 섭동도 약 10배 증폭됩니다.

연습 5. 유사스펙트럼#

\(J=\begin{pmatrix}0&1\\0&0\end{pmatrix}\)에서 \(z=\varepsilon\)\(\varepsilon\)-유사스펙트럼에 들어가는지 판단하세요.

풀이. \(\varepsilon>0\)라 합시다. 단위벡터 \(v=(1,\varepsilon)^T/\sqrt{1+\varepsilon^2}\)를 고르면

\[(\varepsilon I-J)v=(0,\varepsilon^2)^T/\sqrt{1+\varepsilon^2},\qquad \|(\varepsilon I-J)v\|_2=\frac{\varepsilon^2}{\sqrt{1+\varepsilon^2}}<\varepsilon.\]

따라서 최소특이값도 \(\varepsilon\)보다 작아 열린 유사스펙트럼에 들어갑니다. 실제 섭동은 \(E=((\varepsilon I-J)v)v^T\)로 구성하면 됩니다. \(e_1\)을 대입했을 때의 잔차는 \(\varepsilon\)이므로 그것만으로 엄격 부등식을 증명할 수 없습니다. 또한 \(J+\varepsilon e_2e_1^T\)의 고윳값은 \(\pm\sqrt\varepsilon\)이므로 이 행렬을 근거로 \(\pm\varepsilon\)라고 쓰면 안 됩니다.

10.5. 한 행렬을 끝까지 추적하는 종합 예시#

앞의 정리들을 따로 외우지 않도록 같은 2×2 행렬을 처음부터 끝까지 추적해 봅시다. 관측 오차가

\[\begin{split}E=\begin{pmatrix}0&0.02\\0.02&0\end{pmatrix}\end{split}\]

이고 기준 행렬이 \(A=\operatorname{diag}(1.2,1)\)라고 하겠습니다. 먼저 \(E\)의 두 고윳값은 \(0.02,-0.02\)이므로 \(\|E\|_2=0.02\)입니다. 따라서 Weyl 부등식은 두 고윳값 각각의 이동량이 0.02 이하라고 예측합니다.

실제로 특성다항식을 성분별로 전개하면

\[\det(A+E-\lambda I) =(1.2-\lambda)(1-\lambda)-0.02^2.\]

곱을 전개하고 근의 공식을 적용하면

\[\lambda_{\pm}=1.1\pm\sqrt{0.1^2+0.02^2} =1.1\pm0.1019804,\]

\(\lambda_+=1.2019804\), \(\lambda_-=0.9980196\)입니다. 기준 고윳값 \((1.2,1)\)에서 각각 약 \(0.00198\)만 움직였으므로 Weyl 상한은 보수적이지만 정확히 지켜집니다.

이번에는 고유벡터를 봅니다. 회전각은

\[\tan(2\theta)=\frac{2(0.02)}{1.2-1}=0.2, \qquad \theta=\tfrac12\arctan(0.2)\approx0.0987\text{ rad}.\]

관측 후 고윳값 간격은 약 \(0.20396\)이고 원래 간극은 \(0.2\)입니다. 원래 간극을 쓰는 1차 민감도식 \(\|\dot u_i\|\le\|E\|/\operatorname{gap}\)\(0.02/0.2=0.1\) 정도의 방향 변화만 예상합니다. 실제 각도 \(0.0987\)은 이 예측과 같은 규모입니다. 여기서 학생이 확인할 것은 ‘고윳값은 안정적인데 고유벡터는 상대적으로 더 움직일 수 있다’는 차이입니다.

마지막으로 비정규 행렬에 작은 오차를 넣었을 때를 비교합니다. \(B=\begin{pmatrix}1&10\\0&2\end{pmatrix}\)\(F=10^{-4}e_2e_1^\top\)를 더하면 특성다항식은

\[\lambda^2-3\lambda+2-10^{-3}\]

이고, 근은 \(0.9990010\), \(2.0009990\)입니다. 고윳값 이동 자체는 작지만, \(B\)의 고유벡터 행렬 조건수는 크므로 Bauer–Fike의 원판은 Weyl의 길이보다 훨씬 넓어질 수 있습니다. 이 한 예시가 대칭 자료행렬의 PCA와 비정규 동적 행렬의 안정성 분석을 분리해서 다뤄야 하는 이유를 보여 줍니다.

11. 지금까지의 내용을 수학의 언어로 정리해 봅시다#

지금까지 계산하고 설명한 내용을 수학에서는 다음과 같이 정의하고 정리합니다. 또한 왜 참인지 증명합니다. 앞의 공분산 예는 자기수반 정리의 적용이고, 전단행렬 예는 그 가정을 제거했을 때의 반례입니다. 모든 공간은 유한차원이며 복소 내적은 \(\langle x,y\rangle=y^*x\)로 첫째 인수에 선형입니다. 여기서 \(*\)는 표준 정규직교 좌표의 켤레전치입니다.

정리 1. Weyl과 절대조건수#

자기수반 \(A,B\in\mathbb C^{n\times n}\)의 고윳값을 내림차순으로 정렬하면 \(|\lambda_k(A)-\lambda_k(B)|\le\|A-B\|_2\)입니다. 자기수반 섭동만 허용하는 함수 \(A\mapsto\lambda_k(A)\)의 절대조건수

\[\begin{split}\limsup_{\substack{E=E^*,\ E\ne0\\\|E\|_2\to0}} \frac{|\lambda_k(A+E)-\lambda_k(A)|}{\|E\|_2}\end{split}\]

는 정확히 1입니다.

증명. \(d=\|A-B\|_2\)라 합시다. Cauchy–Schwarz와 유도노름의 정의로 단위 \(x\)에 대해 \(|x^*(A-B)x|\le\|x\|\|(A-B)x\|\le d\)입니다. 고정한 \(k\)차원 공간 \(L\)에서 \(B\)의 Rayleigh 몫을 최소화하는 단위벡터 \(x_B\)를 고릅니다. 존재성은 유한차원 단위구의 컴팩트성과 연속성에 따릅니다. 그러면

\[\min_{x\in L,\|x\|=1}x^*Ax\le x_B^*Ax_B \le x_B^*Bx_B+d=\min_{x\in L,\|x\|=1}x^*Bx+d.\]

모든 \(L\)에 대해 최대를 취하면 H5의 Courant–Fischer에 따라 \(\lambda_k(A)\le\lambda_k(B)+d\)입니다. \(A,B\)를 교환해 반대 부등식을 얻습니다. 조건수의 상한은 1이고, \(E=tI\), \(t>0\)에서 몫이 정확히 1이므로 하한도 1입니다. ∎

일반형 \(\lambda_{i+j-1}(A+B)\le\lambda_i(A)+\lambda_j(B)\)도 증명할 수 있습니다. \(r=i+j-1\le n\)이라 합시다. \(A\)\(i\)번째 이하 고유공간의 합을 \(L\), \(B\)\(j\)번째 이하를 \(M\), \(A+B\)의 상위 \(r\)개 공간을 \(N\)이라 합니다. 차원 공식으로 \(\dim(L\cap M)\ge n-i-j+2=n-r+1\)이고 \(\dim((L\cap M)\cap N)\ge1\)입니다. 그 안의 단위벡터에서 \(\lambda_r(A+B)\le x^*(A+B)x\le\lambda_i(A)+\lambda_j(B)\)를 얻습니다. ∎

보조정리와 정리 2. Hoffman–Wielandt#

내림차순 실수열 \(\lambda,\mu\)와 이중확률행렬 \(S=(s_{ij})\)에 대해 \(\sum_{ij}\lambda_i s_{ij}\mu_j\le\sum_i\lambda_i\mu_i\)입니다.

증명. \(y_i=\sum_j s_{ij}\mu_j\)라 합시다. \(a_j=\sum_{i=1}^k s_{ij}\)\(0\le a_j\le1\), \(\sum_j a_j=k\)를 만족합니다. \(d=\sum_{j\le k}(1-a_j)=\sum_{j>k}a_j\)라 놓으면

\[\sum_{j\le k}\mu_j-\sum_j a_j\mu_j =\sum_{j\le k}(1-a_j)\mu_j-\sum_{j>k}a_j\mu_j \ge d\mu_k-d\mu_k=0.\]

따라서 \(D_k=\sum_{i\le k}(\mu_i-y_i)\ge0\)이며 \(D_n=0\)입니다. \(D_0=0\)으로 두고 합을 전개하면

\[\sum_i\lambda_i(\mu_i-y_i) =\sum_i\lambda_i(D_i-D_{i-1}) =\sum_{k=1}^{n-1}(\lambda_k-\lambda_{k+1})D_k+\lambda_nD_n\ge0.\]

음의 고윳값이 있어도 차이 계수만 사용하므로 증명은 유지됩니다. ∎

자기수반 \(A,B\)에 대해 \(\sum_i(\lambda_i(A)-\lambda_i(B))^2\le\|A-B\|_F^2\)입니다.

증명. 스펙트럼 정리로 \(A=U\Lambda U^*\), \(B=VMV^*\)라 쓰겠습니다. \(W=U^*V\)는 유니터리여서 \(\sum_j|w_{ij}|^2=\sum_i|w_{ij}|^2=1\)입니다. Frobenius 불변성과 자취의 성분 합을 이용하면

\[\|A-B\|_F^2=\sum_i\lambda_i^2+\sum_j\mu_j^2 -2\sum_{ij}\lambda_i|w_{ij}|^2\mu_j \ge\sum_i(\lambda_i-\mu_i)^2.\]

마지막 부등식은 방금 증명한 보조정리입니다. 정렬의 필요성은 \(A=B=\operatorname{diag}(1,0)\)에서 \(B\)의 목록만 \((0,1)\)로 뒤집으면 좌변 2, 우변 0이 되는 것으로 확인됩니다. ∎

정리 3. 직사각형 특이값의 두 거리#

같은 크기 \(m\times n\) 행렬 \(A,B\)\(r=\min(m,n)\)에 대해

\[|\sigma_i(A)-\sigma_i(B)|\le\|A-B\|_2,\qquad \sum_{i=1}^r(\sigma_i(A)-\sigma_i(B))^2\le\|A-B\|_F^2.\]

증명. 본문의 Hermitian dilation은 크기 \(m+n\)이고 자기수반입니다. SVD의 모든 열을 사용하면 그 고윳값 목록은 \(\sigma_1,\ldots,\sigma_r\), \(|m-n|\)개의 0, \(-\sigma_r,\ldots,-\sigma_1\)입니다. 특이값 0도 이 목록에서 제외하지 않습니다. 특히 내림차순 목록의 앞 \(r\)개는 항상 \(\sigma_1,\ldots,\sigma_r\)입니다. \(D=A-B\)에 대해

\[\|\mathcal H(D)(x,y)\|^2=\|Dy\|^2+\|D^*x\|^2 \le\|D\|_2^2(\|x\|^2+\|y\|^2).\]

최대 오른쪽 특이벡터 \(v\)\((x,y)=(0,v)\)를 넣으면 등호이므로 \(\|\mathcal H(D)\|_2=\|D\|_2\)입니다. 성분 제곱합으로는 \(\|\mathcal H(D)\|_F^2=2\|D\|_F^2\)입니다. 첫 부등식은 정리 1을, 둘째는 정리 2를 적용하고 좌우의 2를 나누면 얻습니다. ∎

정리 4. 미분 가능한 고유쌍과 간극#

\(A(t)=A+tE\)가 자기수반이고 \(\lambda_i(0)\)가 단순하다고 하자. \(t=0\) 근처의 미분 가능한 정규화 고유쌍 경로를 전제로 하고, \(u_i^*\dot u_i=0\)인 위상을 선택하면 본문의 두 미분 공식과 \(\|\dot u_i\|\le\|E\|_2/\operatorname{gap}_i\)가 성립합니다. 실수 경로의 존재에는 C6의 고유쌍 미분을 사용합니다. 복소 경로에 대한 존재 정리를 여기서 별도로 주장하지 않습니다.

증명. 정규화식을 미분하면 \(2\operatorname{Re}(u_i^*\dot u_i)=0\)입니다. 복소수인 경우 그 순허수 성분은 \(u_i(t)\)\(e^{\mathrm i\phi(t)}\)를 곱하고 적절한 실수 \(\phi'(0)\)를 택해 0으로 만듭니다. 고유방정식의 미분에 각 \(u_j^*\)를 곱하면 §5의 두 계수식이 나옵니다. 정규직교 기저의 전개가 유일하므로 그 계수를 합한 식이 \(\dot u_i\)입니다. Parseval로

\[\|\dot u_i\|^2=\sum_{j\ne i}\frac{|u_j^*Eu_i|^2}{|\lambda_i-\lambda_j|^2} \le\frac{\sum_j|u_j^*Eu_i|^2}{\operatorname{gap}_i^2} =\frac{\|Eu_i\|^2}{\operatorname{gap}_i^2}\le\frac{\|E\|_2^2}{\operatorname{gap}_i^2}.\]

이것은 도함수의 상한입니다. 유한한 \(t\)에 그대로 곱한 값이 엄밀한 유한 오차 상한이라는 결론은 따로 증명해야 합니다. ∎

정리 5. 한쪽으로 분리된 공간의 잔차 상한#

\(A=A^*\)의 상위 \(k<n\)개 고유벡터를 \(U\), 나머지를 \(U_\perp\)라 합시다. 정규직교 열을 갖는 \(\widehat U\)와 자기수반 \(\widehat\Lambda\)에 대해 \(R=A\widehat U-\widehat U\widehat\Lambda\)라 놓습니다. \(\lambda_{\max}(U_\perp^*AU_\perp)\le a<b\le\lambda_{\min}(\widehat\Lambda)\)이면

\[\|(I-UU^*)\widehat U\|_2\le\frac{\|R\|_2}{b-a}.\]

증명. \(C=U_\perp^*AU_\perp\), \(X=U_\perp^*\widehat U\), \(F=U_\perp^*R\)라 하면 \(CX-X\widehat\Lambda=F\)입니다. 자기수반 행렬의 지수는 여기서는 고유기저에서 실수 지수를 적용한 것으로 정의합니다. 대각화하여 미분하면

\[\frac{d}{dt}\bigl(e^{tC}Xe^{-t\widehat\Lambda}\bigr) =e^{tC}Fe^{-t\widehat\Lambda}.\]

좌변 괄호의 노름은 \(e^{-(b-a)t}\|X\|_2\) 이하로 0에 수렴합니다. 따라서 성분별 적분의 미적분학 기본정리로

\[-X=\int_0^\infty e^{tC}Fe^{-t\widehat\Lambda}\,dt,\qquad \|X\|_2\le\int_0^\infty e^{-(b-a)t}\|F\|_2\,dt =\frac{\|F\|_2}{b-a}\le\frac{\|R\|_2}{b-a}.\]

유한차원 노름의 연속성과 삼각부등식이 적분 부등식을 정당화합니다. \(U_\perp\)는 등거리이므로 \(\|X\|_2=\|(I-UU^*)\widehat U\|_2\)입니다. 또한 \(X^*X=I-\widehat U^*UU^*\widehat U\)의 고윳값은 \(1-\cos^2\theta_j\)이므로 이 노름은 최대 주각의 사인입니다. 관측 고유공간이면 \(R=-E\widehat U\)입니다. 본문에서 Weyl과 결합한 원래 간극 상한도 이제 정당화됩니다. ∎

일반 내부 군집에서는 \(C,\widehat\Lambda\)를 각각 대각화해 \((c_j-\widehat\lambda_i)X_{ji}=F_{ji}\)를 얻습니다. 모든 \(|c_j-\widehat\lambda_i|\ge\delta\)이면 성분 제곱합으로 \(\|X\|_F\le\|F\|_F/\delta\)입니다. 이 증명은 한쪽 분리를 요구하지 않지만 결론의 노름은 Frobenius입니다. ∎

정리 6. Bauer–Fike와 비정규 고윳값의 도함수#

\(A=V\Lambda V^{-1}\)가 복소수에서 대각화 가능하면 \(A+E\)의 모든 고윳값 \(z\)에 대해 \(\min_i|z-\lambda_i|\le\kappa_2(V)\|E\|_2\)입니다.

증명. \(z\)가 원래 고윳값이면 좌변이 0입니다. 아니면 \(zI-\Lambda\)가 가역입니다. \((A+E)x=zx\), \(x\ne0\)에서 \(y=V^{-1}x\ne0\)라 두면 \((zI-\Lambda)y=V^{-1}EVy\)입니다. 따라서

\[\|y\|_2\le\|(zI-\Lambda)^{-1}\|_2\|V^{-1}\|_2\|E\|_2\|V\|_2\|y\|_2 =\frac{\kappa_2(V)\|E\|_2}{\min_i|z-\lambda_i|}\|y\|_2.\]

양수 \(\|y\|_2\)로 나누고 정리합니다. 이는 각 관측 고윳값에 어떤 원래 고윳값이 가깝다는 말이며, 순서를 보존하는 일대일 대응을 보장하지 않습니다. ∎

미분 가능한 단순 고유쌍에 대해 \(Ax=\lambda x\), \(y^*A=\lambda y^*\)이면

\[\dot\lambda=\frac{y^*Ex}{y^*x}.\]

실제로 미분한 식에 \(y^*\)를 곱하면 \(y^*Ex+\lambda y^*\dot x=\dot\lambda y^*x+\lambda y^*\dot x\)이고, 공통항이 소거됩니다. 단순 고윳값에서는 \(y^*x\ne0\)입니다. 0이라면 \(x\in(\ker(A^*-\overline\lambda I))^\perp=\operatorname{range}(A-\lambda I)\)여서 \((A-\lambda I)w=x\)인 길이 2의 Jordan 사슬이 생겨 단순성과 모순입니다.

\(\|x\|=\|y\|=1\)이면 도함수의 최대 크기는 \(1/|y^*x|\)입니다. 상한은 Cauchy–Schwarz, 달성은 \(E=yx^*\)에서 나옵니다. 이 달성은 제한 없는 복소 섭동에 대한 것이며 구조를 보존하는 섭동의 조건수와 구별합니다.

결함 고윳값에서는 선형 상한 자체가 없을 수 있습니다. 위 대각선이 1인 \(m\ge2\)차 Jordan 블록 \(J_m(0)\)\(\eta e_me_1^T\)를 더하면 고유방정식의 첫 \(m-1\)개 식은 \(x_{j+1}=\lambda x_j\), 마지막 식은 \(\eta x_1=\lambda x_m\)입니다. \(x_1=0\)이면 모든 성분이 0이므로 \(x_1\ne0\)이고 \(\lambda^m=\eta\)입니다. \(\eta>0\)일 때 각 근의 크기는 \(\eta^{1/m}\), 섭동 노름은 \(\eta\)입니다. 비율 \(\eta^{1/m-1}\)은 발산합니다.

정리 7. 열린 유사스펙트럼의 세 표현#

\(\varepsilon>0\)이고 \(A\)가 복소 정방행렬일 때 다음 집합은 같습니다.

\[\{z:\sigma_{\min}(zI-A)<\varepsilon\},\qquad \bigcup_{\|E\|_2<\varepsilon}\sigma(A+E),\qquad \sigma(A)\cup\{z\notin\sigma(A):\|(zI-A)^{-1}\|_2>1/\varepsilon\}.\]

증명. 최소특이값은 단위구에서 잔차 노름의 최솟값이며 H4의 SVD로 달성됩니다. 첫 집합의 \(z\)에 대해 단위 최소화 벡터 \(v\), \(r=(zI-A)v\), \(E=rv^*\)라 합시다. \(Ev=r\)이고 \((A+E)v=zv\)입니다. \(\|Ew\|=\|r\||v^*w|\le\|r\|\|w\|\)이며 \(w=v\)에서 등호이므로 \(\|E\|_2=\|r\|<\varepsilon\).

따라서 둘째 집합에 속합니다.

역으로 단위 고유벡터 \(v\)에서 \((zI-A)v=Ev\)이므로 \(\sigma_{\min}(zI-A)\le\|Ev\|\le\|E\|<\varepsilon\)입니다. 가역인 경우 SVD를 뒤집으면 역행렬의 최대특이값은 원행렬의 최소특이값의 역수입니다. 비가역이면 최소특이값이 0입니다. 이로써 셋째 표현도 같습니다. ∎

정규 \(A=U\Lambda U^*\)에서는 \(zI-A=U(zI-\Lambda)U^*\)이므로 최소특이값은 \(\min_i|z-\lambda_i|\)입니다. 따라서 열린 반지름 \(\varepsilon\) 원판들의 합집합이 정확한 유사스펙트럼입니다. 비정규행렬에 대해서는 이 마지막 등식을 사용할 수 없습니다.

고윳값의 오차가 작아도 고유방향의 오차는 간극에 따라 커질 수 있습니다. 다음 장에서는 이차형식과 제약을 함께 다루며, 좌표변환 뒤에도 유지되는 부호와 행렬 펜슬의 구조를 확인합니다. H7로 이어 읽기.