C6 · 행렬을 조금 바꾸면 결과는 얼마나 달라질까?#
생산기술이 조금 바뀌면 필요한 생산량은 얼마나 바뀔까요? 공분산의 비대각 성분을 바꿀 때에는 왜 같은 숫자를 두 곳에 넣어야 할까요? 이번 단원에서는 ‘행렬로 미분한다’는 말을 작은 변화에 대한 계산으로 바꾸어 보겠습니다. 미분의 결과는 숫자 하나가 아니라 입력 변화에서 출력 변화로 가는 선형사상입니다.
실수의 극한, 일변수 미분·Taylor 정리, 유한 개 실변수에 대한 연속성과 적분, 연속 이계 편미분의 교환을 출발 전제로 사용합니다. 고윳값 경로의 존재를 다루는 곳에서는 실수 암묵함수정리를 별도로 명시합니다. 그 정리 자체의 해석학적 증명은 이 단원의 범위가 아닙니다. 행렬에 필요한 나머지 추정은 여기서 증명하므로 아직 읽지 않은 H0의 일반 노름 이론을 전제하지 않습니다.
1. 기술계수 하나를 바꾸고 생산량을 다시 구하기#
C5의 두 산업 모형을 재사용합니다. 생산량과 최종수요는 정한 생산 단위에서의 수치이며, 기술계수는 산출 한 단위당 중간재 투입 비율입니다. 시간에 따른 동학이 아니라 한 시점의 수급 균형입니다.
균형식은 \(x=Bx+d\), 즉 \(Mx=d\)입니다. C5에서 계산한 역행렬로
를 얻습니다. 산업 2가 산업 1의 재화를 더 사용하도록 \(B_{12}\)만 \(t\)만큼 늘리겠습니다. \(E_{12}\)는 \((1,2)\) 성분만 1인 행렬입니다.
분모부터 직접 계산하면
따라서
\(|t|<1/10\)으로 제한하면 기술계수는 음수가 아니고 분모와 두 생산량도 양수입니다. 이 범위는 도함수 계산과 실제 허용 범위를 함께 관리하기 위한 선택입니다. 모든 실수 \(t\)가 경제적으로 허용된다는 뜻은 아닙니다.
\(x(0)=(2,2)^{\mathsf T}\)를 빼 보겠습니다.
작은 \(t\)에서는 각각 \(3t\), \(4t/3\)이 일차 변화입니다. 예측을 뺀 나머지도 정확히 알 수 있습니다.
오차가 \(t^2\)를 인수로 갖습니다. \(t\)를 10분의 1로 줄이면 일차 변화는 약 10분의 1, 나머지는 약 100분의 1로 줄어듭니다. 미분은 변화가 작다는 말만 하지 않고, 버린 부분이 일차 변화보다 더 빨리 작아진다고 말합니다.
그림 52 실선은 분수식으로 계산한 생산량이고 점선은 \(x(0)+t(3,4/3)^{\mathsf T}\)입니다. 이 그림의 \(t\)는 시간도 생산량도 아니라 기술계수의 무차원 변화입니다.#
2. ‘작다’를 성분으로 정하고, 선형 부분을 찾기#
\(m\times n\) 행렬 \(H\)에 대해 이번 단원에서는
를 사용합니다. 행렬이 0으로 간다는 것은 이 최댓값이 0으로 간다는 뜻입니다. 성분이 유한 개이므로 모든 성분이 0으로 가는 것과 같습니다. \(m\times n\) 행렬 \(A\)와 \(n\times p\) 행렬 \(B\)에는
이므로 \(|AB|_{\max}\le n|A|_{\max}|B|_{\max}\)입니다. 이 계수 \(n\)을 빼먹으면 최대 성분값을 유도노름처럼 잘못 사용하게 됩니다.
\(F(X)=X^2\)를 전개하면
\(L_X(H)=XH+HX\)는 \(H\)에 선형이고 \(|H^2|_{\max}\le n|H|_{\max}^2\)입니다. 따라서
이것이 \(DF(X)[H]=XH+HX\)라고 쓰는 이유입니다. \(2XH\)로 바꿀 수는 없습니다. 예를 들어
이면
따라서
\(H=E_{21}\)일 때 답은 \(\left[\begin{smallmatrix}1&0\\3&1\end{smallmatrix}\right]\)입니다. \(2XH\)는 \(\left[\begin{smallmatrix}2&0\\4&0\end{smallmatrix}\right]\)여서 다릅니다.
3. 야코비행렬은 이 선형사상의 좌표다#
C3처럼 열을 쌓으면 \(\operatorname{vec}H=(a,c,b,d)^{\mathsf T}\)입니다. 바로 앞의 성분을 같은 순서로 놓습니다.
\(J_X\)의 첫 열은 \(H=E_{11}\)일 때의 출력이고 둘째 열은 \(H=E_{21}\)일 때의 출력입니다. 네 기본 방향에서 값을 알면 모든 \(H\)에서의 값이 결정됩니다. 이것이 미분을 계산한 다음 야코비행렬을 읽는 방법입니다.
일반적으로 C3의 vec 공식으로
두 표기는 다른 미분이 아닙니다. 하나는 사상이고 하나는 고른 좌표에서의 행렬입니다. 출력 성분을 행에, 입력 성분을 열에 두는 규약을 이 단원 전체에서 유지합니다.
4. 역행렬 미분에서 곱의 순서를 지키기#
\(Y=X^{-1}\)라고 하면 \(XY=I\)입니다. \(X\)가 \(H\)만큼 변할 때 일차 부분은
왼쪽에서 \(X^{-1}\)을 곱하면
양쪽의 \(X^{-1}\) 사이에 \(H\)가 있습니다. 이것을 \(-X^{-2}H\)로 옮기는 것은 일반적으로 허용되지 않습니다. 이 계산은 미분이 존재한다면 그 값은 무엇인가를 먼저 찾은 것입니다. 실제 나머지 추정으로 존재까지 확인하는 증명은 마지막 절에 있습니다.
1절에서는 \(M'(t)=-E_{12}\)이므로 두 음수가 상쇄됩니다.
기술계수가 커져 필요한 중간재가 늘고, 그 수요를 맞추기 위한 두 산업의 생산량이 함께 늘어납니다. 도함수 공식이 1절의 분수 계산과 같은 값을 줍니다.
5. 행렬 출력과 숫자 출력의 미분표를 구분하기#
고정 행렬 \(A,B\)와 가변 행렬 \(X\)에 대해
첫 식은 행렬을 출력하고 둘째 식은 숫자를 출력합니다. \(A\)와 \(X\)는 \(\operatorname{tr}(AX)\)가 정의되는 크기입니다. 두 식 모두 원래 식에 \(X+H\)를 넣어 뺄 때 나머지가 정확히 0입니다.
\(X\)가 직사각행렬이어도
이므로 \(D(X^{\mathsf T}X)[H]=H^{\mathsf T}X+X^{\mathsf T}H\)입니다. 곱의 각 인수를 한 번씩 변화시키되 순서는 그대로 유지합니다.
C5의 Jacobi 공식은 가역 실수행렬에서
를 줍니다. \(f\)가 숫자를 출력할 때 gradient 행렬 \(G\)는
로 정의하겠습니다. 그러면 \(\log|\det X|\)의 gradient는 \(X^{-\mathsf T}\)입니다. 미분식에 \(X^{-1}\)이 있다고 gradient도 \(X^{-1}\)이라고 읽으면 전치를 잃습니다.
실수행렬 함수 \(f(X)=\log\det(I+X^{\mathsf T}X)\)에서는 \(Z=I+X^{\mathsf T}X\)라 두면
\(Z\)는 가역입니다. 실제로 \(Zv=0\)이면 \(0=v^{\mathsf T}Zv=\sum_i v_i^2+\sum_j(Xv)_j^2\)여서 \(v=0\)입니다. 또한 대칭 양의 정부호 행렬의 행렬식이 양수라는 사실은 H1에서 일반화할 수 있지만, 여기서는 \(I+sX^{\mathsf T}X\)가 \(0\le s\le1\)에서 모두 가역이고 행렬식은 연속이며 \(s=0\)에서 1이라는 사실로 충분합니다.
\(Z^{-1}\)도 대칭이므로 두 trace를 각각 성분 합 또는 C5의 순환법칙으로 정리하면
따라서 \(G=2XZ^{-1}\)입니다.
6. 공분산의 비대각 성분은 두 자리를 함께 바꾼다#
C5의
를 다시 씁니다. 두 관측량은 미리 기준 단위로 나누어 무차원화했다고 합시다. 세 자유 좌표는 \(s=(\sigma_{11},\sigma_{21},\sigma_{22})^{\mathsf T}\)입니다. \(\delta=(a,b,c)^{\mathsf T}\)에 해당하는 변화는
미분을 성분별로 쓰면
따라서 세 좌표의 gradient는 \((3/8,-1/2,1/2)^{\mathsf T}\)입니다. 단순히 \(\Sigma^{-1}\)의 아래 삼각 성분을 고르면 \((3/8,-1/4,1/2)^{\mathsf T}\)가 되어 가운데가 틀립니다.
하지만 네 성분 gradient를 올바르게 사용하는 것은 틀리지 않습니다.
두 예측은 정확히 같습니다. 오류는 네 좌표 공식을 썼다는 데 있지 않고, 서로 같은 두 비대각 변화 중 하나를 누락했다는 데 있습니다. 실제 \(b\) 방향에서는
따라서 \(\log(8-4t-t^2)\)의 \(t=0\) 미분도 \(-4/8=-1/2\)입니다.
그림 53 점선 \(-t/2\)는 두 성분을 모두 센 예측입니다. 파선 \(-t/4\)는 아래 삼각 성분 하나만 읽은 잘못된 예측입니다. 실제 곡선은 \(\log(8-4t-t^2)-\log8\)입니다.#
7. 이차 변화와 제약 방향을 함께 읽기#
\(f(X)=\log|\det X|\)의 미분에 역행렬 미분을 한 번 더 적용하면
trace를 순환시키면 \(H,K\)의 순서를 바꿔도 같습니다. 같은 방향에서는 \(-\operatorname{tr}(X^{-1}HX^{-1}H)\)입니다. 행렬 원소를 자유 좌표로 보느냐, 대칭 좌표로 보느냐에 따라 이 쌍선형사상의 표현행렬이 달라집니다. \(\operatorname{vec}H=D\delta\)라면 자유 좌표 헤시안 \(Q\)는 대칭 좌표에서 \(D^{\mathsf T}QD\)가 됩니다.
일반적으로 \(q(x)=x^{\mathsf T}Qx\)에는 \(Q\)의 대칭 부분만 나타납니다. 왜냐하면 스칼라를 전치하여 \(x^{\mathsf T}Qx=x^{\mathsf T}Q^{\mathsf T}x\)이고, 두 식의 평균이 \(x^{\mathsf T}(Q+Q^{\mathsf T})x/2\)이기 때문입니다. ‘이차식의 계수행렬이 유일하다’는 말에는 대칭행렬로 제한한다는 조건이 필요합니다.
경제학 예로
를 최대화해 봅시다. \(x,b\)는 기준량으로 나눈 활동량, \(f\)는 기준 화폐량으로 나눈 순편익입니다. 우선 부호 제한 없는 등식제약 모형이며, 생산량으로 해석할 때는 구한 \(x\)가 양수인 매개변수 근방만 사용합니다.
\(L=f+\lambda(b-x_1-x_2)\)이면
두 식을 더해 \(\lambda=(\theta_1+\theta_2-b)/2\)를 얻고
가능한 변화는 \((s,-s)\)입니다. 이 방향의 이차 변화는 \(-s^2-(-s)^2=-2s^2<0\)이므로 해는 유일한 최대점입니다. 실제 임의의 가능한 \(x=x^*+(s,-s)\)를 대입하면 일차항이 사라져 \(f(x)-f(x^*)=-s^2\)가 됩니다.
경계 헤시안은 이 문제에서
이지만, 그 전체 행렬이 음의 정부호인지 검사하는 문제가 아닙니다. 제약의 접방향에서 \(-I\)를 제한해 검사한 것입니다. 일반 비선형 제약의 관성 판정은 H7·O3의 대상이며 여기서 증명한 결과와 혼동하지 않습니다.
최적값 \(v(\theta,b)=f(x^*(\theta,b),\theta)\)를 미분하면
괄호 둘은 모두 \(\lambda\)이고 \(dx_1^*+dx_2^*=db\)이므로
최적 선택의 도함수를 직접 계산하지 않고도 최적값의 미분을 읽을 수 있습니다. 이 소거가 봉투정리의 내용입니다.
8. 고윳값은 언제 미분할 수 있는가?#
의 고윳값은 \(t\)와 무관하게 1,2입니다. 반면
의 특성다항식은 \(z^2-t\)이므로 \(t>0\)에서 고윳값은 \(\pm\sqrt t\)입니다. \(t=0\) 오른쪽에서 \(\sqrt t\)의 변화율은 \(1/(2\sqrt t)\)로 발산합니다. 행렬 성분의 매끄러움이 개별 고윳값의 미분가능성을 자동으로 보장하지 않습니다.
미분 가능한 고유쌍 경로가 있고 \(Ax=\lambda x\), \(y^{\mathsf T}A=\lambda y^{\mathsf T}\)라면
왼쪽에서 \(y^{\mathsf T}\)를 곱하고 \(y^{\mathsf T}Ax'=\lambda y^{\mathsf T}x'\)를 소거하면
분모가 0이 아니어야 합니다. 단순 실수 고윳값에서는 마지막 절에서 이를 보이고, 명시한 암묵함수정리를 이용해 경로의 존재도 확인합니다. 임의 정규화 상태에서 \(1/|y^{\mathsf T}x|\)만을 조건수라고 부르면 안 됩니다. 분자의 벡터 크기도 함께 변하기 때문입니다.
제곱근도 같은 주의가 필요합니다. 미분 가능한 행렬 경로 \(Y(t)^2=X(t)\)가 이미 존재한다면
입니다. \(Y=\operatorname{diag}(2,3)\)에서는 \((Y')_{ij}=(X')_{ij}/(y_i+y_j)\)로 각 성분을 4,5,5,6으로 나눕니다. \(Y=\operatorname{diag}(1,-1)\)이면 비대각 합이 0이므로 이 방식의 유일성이 사라집니다. 양의 정부호 제곱근의 존재·매끄러움과 특이값 미분은 H3~H6에서 다룹니다. 이곳의 조건부 식만으로 그 존재를 주장하지 않습니다.
9. JVP와 VJP는 무엇을 계산하는가?#
3절의 \(J_X\)에서 \(v=(1,0,0,0)^{\mathsf T}\)를 넣으면
이것은 입력의 첫 성분 변화가 네 출력에 주는 일차 변화입니다. 출력의 가중 합을 \(w=(0,0,1,0)^{\mathsf T}\)로 읽는다면
이 벡터는 세 번째 출력에 영향을 주는 네 입력의 계수입니다. 성분 합으로
입니다. 자동미분에서 JVP는 \(Jv\), VJP는 이 출력 범함수의 되당김을 계산합니다. 아직 내적에 의존하는 일반 수반을 쓰는 것이 아니라 A3의 전치사상을 쓰고 있습니다.
연쇄 \(x\mapsto F(x)\mapsto G(F(x))\)에서는 앞으로 \(DF\) 다음 \(DG\)를 적용합니다. 출력 범함수를 뒤로 가져올 때는 \(DG\)의 전치 다음 \(DF\)의 전치 순입니다. 별도의 신비한 계산 규칙이 아니라 합성의 전치 순서가 뒤집히는 것입니다.
10. 수치 미분은 왜 아주 작은 간격에서도 틀리는가?#
전진차분 \(\{f(x+h)-f(x)\}/h\)의 절단오차는 \(|f''|\le M\)인 근방에서 \(Mh/2\) 이하입니다. 두 함수값의 계산오차가 각각 \(\eta\) 이하라면 뺄셈 후 나누는 과정에서 최대 \(2\eta/h\)가 추가됩니다. 이 단순 모형의 총 상계는
\(M,\eta>0\)일 때 \(E'(h)=M/2-2\eta/h^2=0\)으로부터 \(h=2\sqrt{\eta/M}\)입니다. 흔히 말하는 \(\sqrt u\)는 함수 크기와 곡률이 적당하고 \(\eta\)가 단위 반올림오차 \(u\) 정도일 때의 규모이지 모든 함수의 절대 간격은 아닙니다.
실축에서 실숫값인 해석함수는 복소 Taylor 전개로
이므로 \(\operatorname{Im}f(x+ih)/h=f'(x)+O(h^2)\)입니다. 실수 두 개를 빼는 상쇄를 피할 수 있습니다. 그러나 \(\operatorname{abs}\)는 허수 정보를 없앱니다. \(x=1\)에서 \(|x|\)의 실수 미분은 1인데 \(|1+ih|\)는 실수이므로 이 방법은 0을 반환합니다. 해석적인 확장과 그것을 보존하는 구현이 필요합니다.
그림 54 \(f(x)=e^x\), \(x=1\)의 실측입니다. 0으로 계산된 오차는 로그 축에 표시하지 않습니다. 특정 함수의 관찰을 모든 프로그램의 정확도 보장으로 확대하지 않습니다.#
11. 직접 계산해 보는 코드#
아래 검산은 미분의 일반 증명이 아니라 앞에서 다룬 방향의 정확한 대조입니다. 별도 자동미분 패키지 없이도 JVP·VJP의 대수적 의미를 확인할 수 있습니다.
import sympy as s
t=s.symbols("t", real=True)
M=s.Matrix([[s.Rational(4,5),-s.Rational(3,10)],
[-s.Rational(2,5),s.Rational(9,10)]])
E=s.Matrix([[0,1],[0,0]])
d=s.ones(2,1)
x=(M-t*E).inv()*d
assert x.diff(t).subs(t,0)==s.Matrix([3,s.Rational(4,3)])
S=s.Matrix([[4,2],[2,3]])
H=s.Matrix([[0,1],[1,0]])
assert s.diff(s.log((S+t*H).det()),t).subs(t,0)==-s.Rational(1,2)
assert s.trace(S.inv()*H)==-s.Rational(1,2)
J=s.Matrix([[2,1,0,0],[0,3,0,0],[1,0,3,1],[0,1,0,4]])
v=s.Matrix([1,2,3,4]); w=s.Matrix([4,3,2,1])
assert (w.T*J*v)[0]==((J.T*w).T*v)[0]
R=(M+t*H).inv()
assert R.diff(t).subs(t,0)==-M.inv()*H*M.inv()
print("생산량·대칭 방향·역행렬 미분·JVP/VJP 검산 통과")
생산량·대칭 방향·역행렬 미분·JVP/VJP 검산 통과
12. 직접 써 보는 문제와 전체 풀이#
문제 1 · 순서를 바꿔도 되는가?#
\(F(X)=X^3\)의 미분을 구하세요.
풀이. 세 인수에 \(X+H\)를 넣으면 \(H\)가 없는 항은 \(X^3\), \(H\)가 하나인 항은 \(HX^2,XHX,X^2H\)입니다. 나머지는 \(H^2X,HXH,XH^2,H^3\)이고 고정 \(X\) 근방에서 최대 성분값이 \(O(|H|_{\max}^2)\)입니다. 따라서 \(DF(X)[H]=HX^2+XHX+X^2H\)입니다. \(XH=HX\)를 추가로 가정할 때만 \(3X^2H\)가 됩니다.
문제 2 · 이차 trace의 gradient#
\(X\in\mathbb R^{m\times n}\), \(A\in\mathbb R^{m\times m}\), \(B\in\mathbb R^{n\times n}\)에서 \(f(X)=\operatorname{tr}(AXB X^{\mathsf T})\)를 미분하세요.
풀이. 일차항은 \(\operatorname{tr}(AHBX^{\mathsf T})+\operatorname{tr}(AXBH^{\mathsf T})\)입니다. 첫 항은 \(\operatorname{tr}(BX^{\mathsf T}AH)=\operatorname{tr}((A^{\mathsf T}XB^{\mathsf T})^{\mathsf T}H)\), 둘째 항은 \(\operatorname{tr}((AXB)^{\mathsf T}H)\)입니다. 따라서 \(G=A^{\mathsf T}XB^{\mathsf T}+AXB\). \(A=I_m,B=I_n\)이면 \(2X\)입니다.
문제 3 · 공분산 우도의 방향 미분#
대칭 양의 정부호 \(\Sigma,S\)에 대해 \(\ell(\Sigma)=-\{\log\det\Sigma+\operatorname{tr}(\Sigma^{-1}S)\}/2\)의 미분을 구하세요. 여기서 \(\ell\)은 상수를 제외한 가우스 우도 형태의 함수이며 확률적 점근 결과는 묻지 않습니다.
풀이. 역행렬 미분을 넣으면
순환시켜 \(G=\tfrac12(\Sigma^{-1}S\Sigma^{-1}-\Sigma^{-1})\)를 얻습니다. 이 \(G\)는 대칭입니다. 대칭 모든 \(H\)에서 미분이 0이면 \(H=G\)를 넣어 \(\sum_{ij}G_{ij}^2=0\)이므로 \(G=0\)입니다. 양쪽에 \(\Sigma\)를 곱하면 \(S=\Sigma\)입니다. 대칭 좌표 gradient는 \(D^{\mathsf T}\operatorname{vec}G\)입니다. \(S\)가 양의 정부호라는 가정이 후보의 허용성을 보장합니다. 여기서는 정상점만 구했으며 전체 최대성은 별도의 부등식이 필요합니다.
문제 4 · 제곱근의 조건부 미분#
\(Y=\operatorname{diag}(2,3)\), \(H=\left[\begin{smallmatrix}4&5\\5&6\end{smallmatrix}\right]\)에서 \(YK+KY=H\)를 푸세요.
풀이. \((YK+KY)_{ij}=(y_i+y_j)K_{ij}\)이므로 \(4K_{11}=4\), \(5K_{12}=5\), \(5K_{21}=5\), \(6K_{22}=6\)입니다. 따라서 \(K\)의 네 성분은 모두 1입니다. 이 계산은 주어진 \(Y\)에서 선형 방정식의 유일해를 찾았으며 제곱근 경로의 존재 자체를 증명하지 않습니다.
문제 5 · 방향 미분만으로 충분한가?#
\(f(x,y)=x^3/(x^2+y^2)\)를 원점 밖에서, \(f(0,0)=0\)으로 정하세요. 원점에서 미분 가능할까요?
풀이. 방향 \((a,b)\ne0\)에서 \(f(ta,tb)/t=a^3/(a^2+b^2)\)입니다. 모든 방향 미분이 존재하지만 \((1,0),(0,1)\)에서 값은 1,0이고 \((1,1)\)에서는 \(1/2\)입니다. 선형사상이라면 마지막 값이 1이어야 하므로 Fréchet 미분은 존재하지 않습니다. 방향별 극한의 존재와 하나의 선형근사 존재는 다릅니다.
13. 지금까지의 내용을 수학의 언어로 정리해 봅시다#
지금까지 계산한 작은 변화들을 수학에서는 다음과 같이 정의하고 정리합니다. 표현은 조금 딱딱해지지만, 각 증명이 앞의 어느 계산을 일반화하는지 살펴봅시다. 공간은 유한차원 실수 행렬공간이고 크기는 2절의 최대 성분값입니다.
13.1 미분의 정의·유일성과 식별#
정의 19 (Fréchet 미분)
열린 집합에서 정의된 \(F\)에 대해 선형사상 \(L\)이
을 만족하면 \(F\)는 \(X\)에서 미분 가능하며 \(DF(X)=L\)이라 씁니다.
유일성 증명. \(L_1,L_2\)가 모두 조건을 만족하면 \((L_1-L_2)(H)=R_2(H)-R_1(H)\)입니다. 고정 \(K\ne0\)와 실수 \(t\ne0\)에 \(H=tK\)를 대입하여 크기를 \(|t|\)로 나누면
왼쪽은 \(t\)와 무관하므로 0입니다. \(K=0\)에서도 선형성으로 같아 \(L_1=L_2\)입니다.
식별 증명. 입력 기본행렬 \(E_{ij}\)에 대한 \(\operatorname{vec}(L(E_{ij}))\)를 열 쌓기 순서로 나열한 행렬을 \(J\)라고 둡니다. \(H=\sum h_{ij}E_{ij}\)와 선형성으로 \(\operatorname{vec}L(H)=J\operatorname{vec}H\)입니다. 다른 행렬도 같은 식을 만족하면 각 \(\operatorname{vec}E_{ij}\)를 대입하여 열마다 같음을 얻습니다. 단, 형식적인 \(dF\) 계산만으로는 충분하지 않고 위 나머지 조건을 확인해야 합니다.
13.2 연쇄법칙과 곱셈법칙#
유한차원 선형사상 \(L\)에는 상수 \(C\)가 있어 \(|L(H)|_{\max}\le C|H|_{\max}\)입니다. 실제로 기본행렬 전개에서 \(C=\sum_{ij}|L(E_{ij})|_{\max}\)로 잡으면 됩니다.
정리 64 (연쇄법칙)
\(F\)가 \(X\)에서, \(G\)가 \(Y=F(X)\)에서 미분 가능하면 \(D(G\circ F)(X)=DG(Y)\circ DF(X)\)입니다.
증명. \(F(X+H)-Y=L(H)+r(H)=K\)라 두면 선형사상의 상계와 \(r=o(|H|_{\max})\)로 \(|K|_{\max}=O(|H|_{\max})\)입니다. 이제
첫 나머지는 \(|M(r(H))|_{\max}\le C_M|r(H)|_{\max}=o(|H|_{\max})\)입니다. 둘째도 \(K\ne0\)일 때
이고 \(K=0\)이면 \(s(0)=0\)입니다. 따라서 원하는 미분을 얻습니다.
곱셈에서는 \((A+K)(B+L)-AB=KB+AL+KL\)이며 2절의 곱 상계로 \(KL\)은 이차 나머지입니다. 이 결과와 연쇄법칙이 4~7절의 곱 미분을 정당화합니다.
13.3 역행렬의 존재 근방과 나머지#
행렬식의 정의와 가역성의 연결은 C5의 정의 18 이후 15.1~15.3절에 있습니다. 이곳에서는 그 여인수 공식을 성분별 연속성과 함께 사용합니다.
\(\det X\ne0\)이면 행렬식이 성분의 다항식이므로 충분히 작은 \(H\)에 \(\det(X+H)\ne0\)이고 \(|\det(X+H)|\ge|\det X|/2\)입니다. C5의 여인수 공식에서 분자도 다항식이므로 \((X+H)^{-1}\)의 성분은 그 근방에서 유계입니다.
\(Y=X+H\)라 쓰면 정확한 항등식은
실제로 오른쪽은 \(X^{-1}(X-Y)Y^{-1}=Y^{-1}-X^{-1}\)입니다. 여기에 한 번 더 같은 식을 넣어
마지막 항에는 \(H\)가 두 번 있고 다른 인수는 유계이므로 \(O(|H|_{\max}^2)\)입니다. 이것으로 역행렬 미분의 존재와 공식을 동시에 증명했습니다.
13.4 로그 행렬식과 이차 미분#
C5의 여인수 전개에서 \(\det(X+H)\)는 성분 다항식입니다. \(H\)가 하나인 항들의 합은 \(\operatorname{tr}(\operatorname{adj}(X)H)\), 나머지는 둘 이상인 항들의 유한 합이므로 \(O(|H|_{\max}^2)\)입니다. 가역 \(X\) 근방에서 부호가 바뀌지 않아 일변수 \(\log|s|\)의 미분과 연쇄법칙으로
이 미분에 13.3을 적용하면 7절의 \(D^2f[H,K]\)를 얻습니다.
별도의 확인으로 \(\det(X+H)=\det X\det(I+X^{-1}H)\)이고 C5의 일차 계수 공식은 \(\det(I+K)=1+\operatorname{tr}K+O(|K|_{\max}^2)\)입니다. \(\log(1+s)=s+O(s^2)\)를 넣어 같은 결과를 얻습니다. 행렬 로그의 존재나 급수에 의존하는 ‘세 번째 증명’을 아직 마련하지 않은 전제로 사용하지 않습니다.
일반 \(C^2\) 함수의 이차 Taylor 전개는 경로 \(g(t)=f(x+th)\)에 일변수 적분형 Taylor 공식을 적용하여
로 얻습니다. \(D^2f\)의 연속성으로 마지막은 \(\tfrac12D^2f(x)[h,h]+o(|h|_{\max}^2)\)입니다. 헤시안의 대칭성에는 명시한 연속 이계 편미분 교환 정리를 사용합니다.
선형 제약 \(Cx=b\)와 가능한 정상점 \(x^*\)에서 \(Df(x^*)\)가 \(\ker C\)를 소거하고, \(D^2f(x^*)[h,h]<0\)가 모든 \(0\ne h\in\ker C\)에 성립하면 엄격한 국소 최대점입니다. \(\ker C\)의 유클리드 단위구는 유한차원에서 콤팩트하므로 연속 이차식의 최댓값이 \(-\alpha<0\)입니다. 모든 가능한 작은 \(h\)에 Taylor 식의 이차항은 \(-\alpha\|h\|_2^2/2\) 이하이고 나머지는 그것보다 작은 차수여서 결과가 음수입니다. 여기서는 유한차원 Heine–Borel 정리를 해석학 전제로 썼습니다.
13.5 미분 가능한 최적해 경로의 봉투정리#
\(g(x,\theta)=0\), \(L=f+\lambda^{\mathsf T}g\)라고 하고, 미분 가능한 경로 \(x^*(\theta),\lambda^*(\theta)\)가 제약과 \(D_xL=0\)을 만족한다고 가정합니다. 최적값이라 부를 때에는 이 경로가 실제 최적해라는 가정도 필요합니다.
\(v(\theta)=f(x^*(\theta),\theta)\)에는
정상조건에서 \(D_xf=-\lambda^{\mathsf T}D_xg\)이고 제약의 미분에서 \(D_xg\,dx^*=-D_\theta g\,d\theta\)입니다. 따라서
이 증명은 최적해 경로가 미분 가능하다는 가정을 사용합니다. 경계에서 해가 바뀌는 경우나 미분 불가능한 값함수까지 같은 식을 무조건 적용하지 않습니다.
13.6 단순 실수 고윳값의 경로와 도함수#
여기서 쓰는 행·열 계수의 일치와 해 존재 판정은 A3의 정리 38, 정리 39입니다. 고윳값 중복도는 C5의 정리 63과 그 뒤의 C2 연결에서 이어받습니다.
실수 \(C^1\) 행렬 경로 \(A(t)\)의 \(t=0\) 고윳값 \(\lambda_0\)가 특성다항식의 단순근이라고 합시다. C1·C2와 C5의 중복도 연결에 의해 우고유공간은 1차원입니다. \(B=A(0)-\lambda_0I\)라 쓰면 \(\operatorname{rank}B=n-1\)입니다. A3의 전치 계수 정리로 좌고유공간도 1차원입니다.
우·좌 고유벡터 \(x,y\)에 \(y^{\mathsf T}x=0\)이라고 가정하면 A3의 해 존재 조건으로 \(x\in\operatorname{im}B\)입니다. 따라서 \(Bz=x\ne0\), \(Bx=0\)인 길이 2의 사슬이 생겨 대수적 중복도가 적어도 2가 됩니다. 모순이므로 \(y^{\mathsf T}x\ne0\)입니다.
\(y^{\mathsf T}x=1\)로 정규화하고
를 봅니다. \((z,\lambda)\)에 대한 미분의 핵 조건은 \(Bu-sx=0\), \(y^{\mathsf T}u=0\)입니다. 첫 식에 \(y^{\mathsf T}\)를 곱하면 \(s=0\)이고, 이어 \(u=cx\)와 둘째 식에서 \(c=0\)입니다. 정사각 선형사상이 단사이므로 가역입니다. 명시한 암묵함수정리를 적용하면 국소 \(C^1\) 고유쌍 경로가 존재합니다. 이 경로를 미분하는 8절의 소거로
를 얻습니다. 중복근에는 위 가역성 논증을 적용할 수 없습니다.
도함수는 작은 입력 변화의 일차 효과를 모으며, 나머지 추정은 그 근사가 유효한 범위를 정합니다. 다음 장에서는 특성다항식으로 돌아가, 행렬의 거듭제곱을 줄이는 관계를 세 가지 논증으로 확인합니다. C7로 이어 읽기.