B4 · 기준을 바꾸면 계수는 어떻게 바뀔까?#

같은 반응 곡선을 설명해도 설명변수의 기준점을 바꾸면 회귀계수가 달라집니다. 같은 확률 전이도 어떤 좌표로 기록하는지에 따라 복잡한 행렬이 되거나 각 성분에 수 하나를 곱하는 계산이 됩니다.

이번 단원에서는 대상은 그대로 두고 기록하는 계수만 바꾸는 과정을 직접 계산합니다. B2의 기저와 B3의 선형사상·차원정리를 사용합니다. 기저변환 공식을 먼저 외우지 않고, 어느 좌표에서 어느 좌표로 이동하는지 적은 뒤 공식을 유도하겠습니다.

1. 기준점 0과 기준점 1에서 같은 반응을 적기#

무차원 설명변수 \(t\)에 대한 교육용 반응 모형을

\[ p(t)=2+3t+t^2 \]

라고 합시다. 계수는 실제 자료의 추정값이 아닙니다. \(t=0\)의 반응은 2이며 \(p'(0)=3\)입니다. 이번에는 \(t=1\)에서 얼마나 떨어져 있는지를 \(u=t-1\)로 기록하겠습니다. \(t=u+1\)을 빠짐없이 대입하면

\[\begin{split} \begin{aligned} p(t)&=2+3(u+1)+(u+1)^2\\ &=2+3u+3+u^2+2u+1\\ &=(2+3+1)+(3+2)u+u^2\\ &=6+5u+u^2. \end{aligned} \end{split}\]

따라서

\[ p(t)=6+5(t-1)+(t-1)^2. \]

계수 \((2,3,1)\)\((6,5,1)\)로 변했지만 함수값은 변하지 않았습니다. \(t=2\)에서 첫 식은 \(2+6+4=12\), 둘째 식은 \(6+5+1=12\)입니다.

경제학의 다항식 회귀에서 설명변수를 중심화하면 절편과 1차항의 계수가 달라지는 이유가 여기 있습니다. 새 절편 6은 \(t=1\)의 반응, 새 1차항 5는 \(p'(1)=3+2=5\)입니다. 계수의 변화만 보고 예측 곡선이 변했다고 판단하면 안 됩니다.

이번에는 \(t\)라는 변수 자체를 없애지 않고 함수들의 기저를 바꾸었다고 읽겠습니다.

\[ B=(1,t,t^2),\qquad C=(1,t-1,(t-1)^2). \]

같은 \(p\)의 두 좌표가

\[ [p]_B=(2,3,1)^\top,\qquad [p]_C=(6,5,1)^\top \]

입니다. 대괄호 아래의 기저 이름은 생략하면 안 되는 정보입니다.

한 반응 곡선 p(t)에 기준점 0과 1에서의 함수값 2와 6, 접선 기울기 3과 5를 표시

그림 13 곡선은 하나입니다. 기준점을 바꾸면 절편과 그 기준점의 변화율이 달라집니다. 두 좌표표현은 같은 \(t\)에서 항상 같은 반응값을 줍니다.#

2. 새 기저의 각 원소를 옛 기저로 쓰기#

먼저 \(C\)가 정말 기저인지 확인해야 합니다. 생성과 독립을 검증하지 않은 세 함수를 ‘새 좌표계’라고 부르면 안 됩니다. 각 원소를 \(B\)로 적으면

\[\begin{split} \begin{aligned} 1&=1\cdot1+0t+0t^2,\\ t-1&=-1\cdot1+1t+0t^2,\\ (t-1)^2&=1\cdot1-2t+1t^2. \end{aligned} \end{split}\]

이 세 계수열을 순서대로 열에 넣어

\[\begin{split} P= \begin{pmatrix} 1&-1&1\\ 0&1&-2\\ 0&0&1 \end{pmatrix} \end{split}\]

를 만듭니다. 새 좌표를 \((a,b,c)\)라고 하면

\[ \begin{aligned} a+b(t-1)+c(t-1)^2 &=(a-b+c)+(b-2c)t+ct^2. \end{aligned} \]

따라서

\[\begin{split} [p]_B=P[p]_C =\begin{pmatrix}a-b+c\\b-2c\\c\end{pmatrix}. \end{split}\]

이 식을 새 좌표에 대해 풀어 보겠습니다. 옛 좌표를 \((r,s,q)\)라고 하면

\[ c=q,\qquad b-2c=s\Rightarrow b=s+2q, \]

이고

\[ a-b+c=r\Rightarrow a=r+b-c=r+s+q. \]

즉,

\[\begin{split} [p]_C= \begin{pmatrix} 1&1&1\\ 0&1&2\\ 0&0&1 \end{pmatrix}[p]_B. \end{split}\]

모든 옛 좌표에서 새 좌표가 존재하고 유일하므로 \(C\)는 기저입니다. 두 행렬은 서로 역행렬입니다. 실제 곱의 첫 행은 \((1,\ 1-1,\ 1-2+1)=(1,0,0)\), 둘째 행은 \((0,1,2-2)=(0,1,0)\), 셋째 행은 \((0,0,1)\)입니다.

\(P\)는 새 좌표에서 옛 좌표로 갑니다. \(P^{-1}\)은 옛 좌표에서 새 좌표로 갑니다. ‘기저변환행렬’이라는 이름만 기억하면 방향을 혼동하기 쉬우므로, 항상 \([p]_B=P[p]_C\)를 함께 적으세요.

3. 함수의 좌표와 관측값은 다른 기록이다#

다항식의 좌표를 관측값과 혼동하지 않도록, \(E(p)=(p(0),p(1),p(2))\)라는 관측 규칙을 생각합시다. \(p=r+st+qt^2\)이면

\[ p(0)=r,\quad p(1)=r+s+q,\quad p(2)=r+2s+4q. \]

따라서 표준 좌표의 관측벡터는

\[\begin{split} E(p)= \begin{pmatrix} 1&0&0\\ 1&1&1\\ 1&2&4 \end{pmatrix}[p]_B. \end{split}\]

\(p=2+3t+t^2\)에서는 \((p(0),p(1),p(2))=(2,6,12)\)입니다. 이것은 \([p]_B=(2,3,1)\)이나 \([p]_C=(6,5,1)\)과 다릅니다.

왜 행렬의 첫 열이 \((1,1,1)\)인가요? 첫 기저함수 1을 세 점에서 평가했기 때문입니다. 둘째 열은 \(t\)의 평가 \((0,1,2)\), 셋째 열은 \(t^2\)의 평가 \((0,1,4)\)입니다. 행렬의 열은 입력 기저 하나를 실제 규칙에 통과시킨 출력의 좌표입니다.

이제 \(C\)로 입력을 기록하면 새 관측행렬의 열은

\[ E(1)=(1,1,1),\quad E(t-1)=(-1,0,1),\quad E((t-1)^2)=(1,0,1). \]

따라서 새 행렬은

\[\begin{split} \begin{pmatrix} 1&-1&1\\ 1&0&0\\ 1&1&1 \end{pmatrix}. \end{split}\]

이에 \((6,5,1)\)을 곱하면 \((6-5+1,6,6+5+1)=(2,6,12)\)로 같은 관측값을 얻습니다.

4. 행렬이 정사각형일 필요가 없는 이유#

미분 \(D:P_2(\mathbb R)\to P_1(\mathbb R)\)을 생각합시다. 입력 기저는 \(B=(1,t,t^2)\), 출력 기저는 \(G=(1,t)\)입니다.

\[ D(1)=0,\quad D(t)=1,\quad D(t^2)=2t. \]

출력 좌표는 각각 \((0,0),(1,0),(0,2)\)이므로

\[\begin{split} [D]_{G\leftarrow B}= \begin{pmatrix}0&1&0\\0&0&2\end{pmatrix}. \end{split}\]

출력 좌표가 두 개여서 행이 두 개이고, 입력 기저가 세 개여서 열이 세 개입니다. 실제로

\[\begin{split} [D]_{G\leftarrow B} \begin{pmatrix}2\\3\\1\end{pmatrix} = \begin{pmatrix}3\\2\end{pmatrix}, \end{split}\]

\(Dp=3+2t\)입니다. 숫자 \((3,2)\)를 함수 \(3+2t\)로 읽으려면 출력 기저 \(G\)가 필요합니다.

입력을 \(C\)로 바꾸고 출력은 \(G\)로 유지하면

\[ D(1)=0,\quad D(t-1)=1,\quad D((t-1)^2)=2t-2. \]

따라서

\[\begin{split} [D]_{G\leftarrow C} =\begin{pmatrix}0&1&-2\\0&0&2\end{pmatrix}. \end{split}\]

\((6,5,1)\)을 곱하면 \((5-2,2)=(3,2)\)입니다. 출력 기저까지 바꾸었다면 이 뒤에 출력 좌표변환을 한 번 더 해야 합니다.

5. 두 규칙을 잇는 것이 왜 행렬곱이 되는가?#

미분한 다음 두 점에서 변화율을 관측합시다. \(F:P_1(\mathbb R)\to\mathbb R^2\)\(F(q)=(q(0),q(1))\)로 정합니다. \(q=a+bt\)이면 \(F(q)=(a,a+b)\)이므로

\[\begin{split} [F]=\begin{pmatrix}1&0\\1&1\end{pmatrix}. \end{split}\]

앞의 미분행렬에 이어 적용하면

\[\begin{split} [F][D] = \begin{pmatrix}1&0\\1&1\end{pmatrix} \begin{pmatrix}0&1&0\\0&0&2\end{pmatrix} = \begin{pmatrix}0&1&0\\0&1&2\end{pmatrix}. \end{split}\]

첫 행의 세 성분은 \(1\cdot0+0\cdot0=0\), \(1\cdot1+0\cdot0=1\), \(1\cdot0+0\cdot2=0\)입니다. 둘째 행은 \(1\cdot0+1\cdot0=0\), \(1\cdot1+1\cdot0=1\), \(1\cdot0+1\cdot2=2\)입니다.

따라서

\[\begin{split} [F][D]\begin{pmatrix}r\\s\\q\end{pmatrix} =\begin{pmatrix}s\\s+2q\end{pmatrix} =\begin{pmatrix}p'(0)\\p'(1)\end{pmatrix}. \end{split}\]

행렬곱의 가운데 인덱스는 첫 규칙의 출력 좌표와 둘째 규칙의 입력 좌표를 합산하는 자리입니다. 단순히 크기가 맞는다는 것만으로 충분하지 않습니다. 중간 공간을 서로 다른 기저로 기록했다면 그 사이의 좌표변환도 넣어야 합니다.

세 다항식 계수에서 두 미분 계수로, 다시 두 점의 변화율로 가는 순서와 행렬 크기 2x3 및 2x2 표시

그림 14 오른쪽 행렬부터 입력에 작용합니다. 합성 \(F\circ D\)의 행렬은 \([F][D]\)입니다. 가운데 두 좌표는 모두 기저 \((1,t)\)로 기록되어 있어 바로 연결할 수 있습니다.#

6. 같은 입력·출력 공간에서 좌표를 함께 바꾸기#

이번에는 \(T:P_2(\mathbb R)\to P_2(\mathbb R)\)\((Tp)(t)=p(2t)\)로 정합시다. 원래 반응을 두 배의 입력 위치에서 평가하는 새 함수입니다. 이것은 단순한 표기 변경이 아니라 실제 함수에 작용하는 규칙입니다. 이후 이 규칙을 어떤 좌표로 기록할지가 별도 문제입니다.

기저 \(B\)에서는

\[ T(1)=1,\quad T(t)=2t,\quad T(t^2)=4t^2 \]

이므로 표현행렬은 \(A=\operatorname{diag}(1,2,4)\)입니다. 입력과 출력을 모두 \(C\)로 기록하려면 다음 순서를 따릅니다.

  1. 입력 새 좌표 \([p]_C\)\(P[p]_C=[p]_B\)로 바꿉니다.

  2. 옛 좌표에서 작용시켜 \(A[p]_B=[Tp]_B\)를 구합니다.

  3. 출력 옛 좌표를 \(P^{-1}[Tp]_B=[Tp]_C\)로 바꿉니다.

따라서 새 행렬은 \(P^{-1}AP\)입니다. 중간 곱부터 적으면

\[\begin{split} AP= \begin{pmatrix} 1&-1&1\\ 0&2&-4\\ 0&0&4 \end{pmatrix}, \end{split}\]

이고

\[\begin{split} P^{-1}AP= \begin{pmatrix} 1&1&1\\ 0&2&4\\ 0&0&4 \end{pmatrix}. \end{split}\]

첫 행은 \(AP\)의 세 행을 더한 것이므로 \((1,-1+2,1-4+4)=(1,1,1)\)입니다. 둘째 행은 둘째 행에 셋째 행의 두 배를 더하여 \((0,2,-4+8)=(0,2,4)\)입니다. 셋째 행은 그대로입니다.

함수에 직접 적용해서도 확인할 수 있습니다.

\[ T(t-1)=2t-1=1+2(t-1), \]
\[ T((t-1)^2)=(2t-1)^2 =(2(t-1)+1)^2 =1+4(t-1)+4(t-1)^2. \]

새 행렬의 둘째·셋째 열이 이 계수와 같습니다. 원래 행렬은 대각행렬인데 새 행렬에는 대각선 밖의 성분이 생겼습니다. 같은 규칙이므로 대각선 밖의 성분이 생겼다는 이유로 새로운 작용이라고 판단할 수 없습니다.

이 관계를 상사라고 합니다. 입력과 출력에 같은 공간의 같은 기저변환을 사용했기 때문에 \(P\)\(P^{-1}\)이 짝을 이룹니다.

7. 확률 전이에서 개별 확률 대신 합과 차이를 기록하기#

세 에너지 상태 사이의 이동을 나타내는 다음 교육용 전이행렬을 사용합시다.

\[\begin{split} M= \begin{pmatrix} 3/4&1/4&0\\ 1/4&1/2&1/4\\ 0&1/4&3/4 \end{pmatrix},\qquad p_{n+1}=Mp_n. \end{split}\]

확률은 열벡터입니다. 각 열의 합이 1이고 성분이 비음수이므로 확률분포를 확률분포로 보냅니다. 이산 시간의 교육용 확률 전이이며, 특정 물리계의 열평형 법칙에서 유도한 행렬은 아닙니다.

다음 세 벡터를 골라 보겠습니다.

\[ u=(1,1,1)^\top,\quad v=(1,0,-1)^\top,\quad h=(1,-2,1)^\top. \]

\(au+bv+ch=0\)이면 성분별로

\[ a+b+c=0,\quad a-2c=0,\quad a-b+c=0. \]

첫 식에서 셋째 식을 빼면 \(2b=0\), 따라서 \(b=0\)입니다. 둘째 식은 \(a=2c\)이고 첫 식은 \(3c=0\)이므로 \(c=a=0\)입니다. 세 벡터는 독립이며 \(\mathbb R^3\)의 기저입니다.

각 벡터에 \(M\)을 적용합시다.

\[ Mu=(3/4+1/4,\ 1/4+1/2+1/4,\ 1/4+3/4)^\top=u, \]
\[ Mv=(3/4,\ 1/4-1/4,\ -3/4)^\top=\frac34v, \]
\[ Mh=(3/4-2/4,\ 1/4-1+1/4,\ -2/4+3/4)^\top =(1/4,-1/2,1/4)^\top=\frac14h. \]

각 벡터는 방향을 바꾸지 않고 정해진 수만큼 배율이 바뀝니다. 이런 0 아닌 벡터를 고유벡터, 배율을 고윳값이라고 부릅니다. 일반적인 존재 정리는 여기서 사용하지 않습니다. 선택한 세 벡터에 대한 곱을 직접 확인했습니다.

\(K=(u\ v\ h)\)를 열로 하는 행렬을 사용하면

\[\begin{split} K^{-1}MK= \begin{pmatrix}1&0&0\\0&3/4&0\\0&0&1/4\end{pmatrix}. \end{split}\]

역행렬을 계산하기 전에 좌표를 직접 풀어도 됩니다. \(p=au+bv+ch\)이면

\[ p_0=a+b+c,\quad p_1=a-2c,\quad p_2=a-b+c. \]

세 식을 더하면 \(a=(p_0+p_1+p_2)/3\)입니다. 첫 식에서 셋째 식을 빼면 \(b=(p_0-p_2)/2\)입니다. 첫 식과 셋째 식의 합에서 둘째 식의 두 배를 빼면 \(6c=p_0-2p_1+p_2\)입니다. 따라서

\[ a=\frac{p_0+p_1+p_2}{3},\quad b=\frac{p_0-p_2}{2},\quad c=\frac{p_0-2p_1+p_2}{6}. \]

확률분포라면 \(a=1/3\)으로 고정됩니다. 나머지 두 좌표는 다음 시점에 각각 \(3/4\), \(1/4\)배가 됩니다. 개별 확률 세 개를 계속 섞어서 계산하던 문제가 두 차이 좌표의 반복 곱셈으로 바뀌었습니다.

8. 새 좌표에서도 확률 제약은 잊지 않는다#

\(p=au+bv+ch\)의 좌표 \((a,b,c)\) 자체가 확률분포는 아닙니다. 예를 들어 \(p=(1,0,0)\)이면

\[ (a,b,c)=\left(\frac13,\frac12,\frac16\right) \]

이고, 좌표의 합은 1이지만 이것은 우연입니다. \(p=(0,1,0)\)의 좌표는 \((1/3,0,-1/3)\)이라 음의 좌표도 있습니다. 음의 \(c\)가 음의 확률이라는 뜻은 아닙니다.

정규화된 분포에서 원래 확률의 비음수 조건을 새 좌표로 쓰면

\[ \frac13+b+c\ge0,\qquad \frac13-2c\ge0,\qquad \frac13-b+c\ge0. \]

따라서 새 좌표의 가능한 영역은 \(b,c\) 평면의 삼각형입니다. 그 꼭짓점은 순수 상태의 좌표로부터

\[ (b,c)=\left(\frac12,\frac16\right),\ \left(0,-\frac13\right),\ \left(-\frac12,\frac16\right) \]

입니다.

확률분포의 새 좌표 b,c가 이루는 삼각형과 초기분포 1,0,0에서 원점으로 수축하는 이산 궤적

그림 15 \(a=1/3\)을 고정한 좌표 단면입니다. 전이는 \((b,c)\mapsto(3b/4,c/4)\)입니다. 원점은 영확률벡터가 아니라 균등분포 \((1/3,1/3,1/3)\)입니다. 점 사이 선분은 이산 시점의 순서를 보여 줍니다.#

\(p^{(0)}=(1,0,0)\)에서 시작하면 \(n\)번 뒤에는

\[ p^{(n)}=\frac13u+\frac12\left(\frac34\right)^n v +\frac16\left(\frac14\right)^n h. \]

\(n=1\)을 넣어 성분별로 확인하면

\[ p_0^{(1)}=\frac13+\frac38+\frac1{24}=\frac34,\quad p_1^{(1)}=\frac13-\frac1{12}=\frac14,\quad p_2^{(1)}=\frac13-\frac38+\frac1{24}=0. \]

이는 \(M(1,0,0)^\top\)의 첫 열과 같습니다. \(n\)이 커질 때 두 거듭제곱은 0으로 가므로 균등분포에 수렴합니다. 여기서 사용한 실수의 기초 극한 사실은 \(0<r<1\)이면 \(r^n\to0\)이라는 것입니다.

에너지가 \(0,\varepsilon,2\varepsilon\)이면 평균 에너지는

\[ \varepsilon p_1+2\varepsilon p_2 =\varepsilon\bigl((a-2c)+2(a-b+c)\bigr) =\varepsilon(3a-2b). \]

정규화 후에는 \(\varepsilon(1-2b)\)입니다. \(b\)는 전이에서 \(3/4\)배가 되므로 평균 에너지가 일반적으로 보존되는 것은 아닙니다. 평균 \(\varepsilon\)이 유지되는 경우는 \(b=0\)인 대칭분포에서 시작했을 때입니다. 좌표변환 덕분에 그 조건이 명확해졌습니다.

9. 상사·동치·합동을 구분하는 실제 계산#

입력 공간과 출력 공간이 다르고, 옛 좌표와 새 좌표가 각각

\[ [x]_{\rm old}=P[x]_{\rm new},\qquad [y]_{\rm old}=Q[y]_{\rm new} \]

로 연결되어 있다고 합시다. 옛 행렬이 \(A\)이면

\[ Q[y]_{\rm new}=AP[x]_{\rm new}, \]

따라서 새 행렬은 \(Q^{-1}AP\)입니다. 입력과 출력 기저를 독립적으로 고르는 관계를 행렬의 동치라고 합니다. 같은 공간에서 같은 기저를 사용한 특별한 경우에 \(Q=P\)가 되어 상사를 얻습니다.

한편 실수 스칼라 값인 비용 \(q(x)=x^\top Hx\)\(x=Py\)로 다시 쓰면

\[ q(Py)=(Py)^\top H(Py)=y^\top(P^\top HP)y. \]

이때 나타나는 것은 \(P^{-1}HP\)가 아니라 \(P^\top HP\)입니다. 이런 관계를 합동이라고 합니다. 두 입력 자리에 같은 \(P\)를 넣었기 때문입니다.

\(H=I\), \(P=\operatorname{diag}(2,1)\)로 확인해 봅시다. 원래 비용 \(x_1^2+x_2^2\)는 새 좌표에서 \(4y_1^2+y_2^2\)입니다. 합동행렬은 \(\operatorname{diag}(4,1)\)입니다. 반면 상사 계산 \(P^{-1}IP=I\)는 항등사상을 새 좌표로 기록한 결과이며, 비용식을 변환한 것이 아닙니다.

이 단원에서는 합동의 완전한 분류나 직교·유니터리 상사 이론을 사용하지 않습니다. 공식이 어떤 종류의 대상을 변환하는지 구별하는 데까지 직접 계산했습니다.

10. 계산을 재현하기#

from sympy import Matrix, Rational, diag, symbols, expand, eye
t = symbols("t")
P = Matrix([[1,-1,1],[0,1,-2],[0,0,1]])
Pinv = Matrix([[1,1,1],[0,1,2],[0,0,1]])
assert P*Pinv == Pinv*P == eye(3)
assert P*Matrix([6,5,1]) == Matrix([2,3,1])
assert expand(6+5*(t-1)+(t-1)**2) == 2+3*t+t*t
A = diag(1,2,4)
assert Pinv*A*P == Matrix([[1,1,1],[0,2,4],[0,0,4]])
M = Matrix([[3,1,0],[1,2,1],[0,1,3]])/4
K = Matrix([[1,1,1],[1,0,-2],[1,-1,1]])
D = diag(1,Rational(3,4),Rational(1,4))
assert M*K == K*D
for n in range(7):
    direct = M**n * Matrix([1,0,0])
    modes = K * D**n * Matrix([Rational(1,3),Rational(1,2),Rational(1,6)])
    assert direct == modes
print("기저변환, 합성에 사용할 좌표, 0~6시점의 확률 계산 일치")
기저변환, 합성에 사용할 좌표, 0~6시점의 확률 계산 일치

11. 직접 써 보는 문제와 전체 풀이#

문제 1 · 중심화한 계수#

\(p(t)=1-2t+3t^2\)\(C=(1,t-1,(t-1)^2)\) 좌표를 구하세요.

풀이. \(u=t-1\), \(t=u+1\)을 넣으면

\[ 1-2(u+1)+3(u+1)^2 =1-2u-2+3u^2+6u+3 =2+4u+3u^2. \]

답은 \((2,4,3)\)입니다. 행렬로도 \(P^{-1}(1,-2,3)^\top=(1-2+3,-2+6,3)^\top=(2,4,3)^\top\)입니다.

문제 2 · 행렬의 열을 직접 구하기#

\(J:P_1(\mathbb R)\to P_2(\mathbb R)\)\((Jq)(t)=tq(t)\)로 정합니다. 표준 단항식 기저에서 행렬을 구하고, 미분 \(D\)와 합성 \(DJ\)를 계산하세요.

풀이. \(J(1)=t\), \(J(t)=t^2\)이므로

\[\begin{split} [J]=\begin{pmatrix}0&0\\1&0\\0&1\end{pmatrix}. \end{split}\]

\(D\)의 행렬을 곱하면

\[\begin{split} [D][J] =\begin{pmatrix}0&1&0\\0&0&2\end{pmatrix} \begin{pmatrix}0&0\\1&0\\0&1\end{pmatrix} =\begin{pmatrix}1&0\\0&2\end{pmatrix}. \end{split}\]

함수로 확인하면 \(q=a+bt\)에서 \(Jq=at+bt^2\), \(D(Jq)=a+2bt\)입니다. 합성은 항등사상이 아닙니다.

문제 3 · 음의 새 좌표#

초기확률 \(p=(0,1,0)\)\((u,v,h)\) 좌표와 다음 시점 확률을 구하세요.

풀이. 좌표 공식에서 \(a=1/3\), \(b=0\), \(c=-1/3\)입니다. 전이 후 좌표는 \((1/3,0,-1/12)\)입니다. 원래 성분으로 돌아가면

\[ p'=\frac13(1,1,1)-\frac1{12}(1,-2,1) =\left(\frac14,\frac12,\frac14\right). \]

음의 \(c\)가 있어도 실제 확률은 모두 비음수이며 합은 1입니다.

문제 4 · 변환 방향의 오류#

\([x]_{\rm old}=P[x]_{\rm new}\)인데 새 행렬을 \(PAP^{-1}\)로 쓴 풀이의 오류를 설명하세요.

풀이. 새 입력에 가장 먼저 적용할 것은 새 좌표를 옛 좌표로 바꾸는 \(P\)입니다. 합성에서 먼저 작용하는 행렬은 오른쪽에 와야 하므로 오른쪽 끝은 \(P\)여야 합니다. 마지막에 옛 출력을 새 출력으로 바꾸는 것은 \(P^{-1}\)이므로 왼쪽 끝은 \(P^{-1}\)입니다. 따라서 이 방향의 정의에서는 \(P^{-1}AP\)입니다. \(P\)를 반대 방향으로 정의한 문헌의 공식과 혼합하지 않아야 합니다.

12. 지금까지의 내용을 수학의 언어로 정리해 봅시다#

이제 대상, 좌표, 작용의 세 가지를 기호로 분리합니다. 앞에서 한 중심화와 확률 계산을 떠올리면서 각 정의가 어느 줄을 정리하는지 살펴봅시다.

12.1 좌표사상#

정의 4 (좌표사상)

순서기저 \(B=(v_1,\ldots,v_n)\)에 대해 \(v=\sum_i c_iv_i\)의 유일한 계수열을 \([v]_B\)라 합니다. \(\Phi_B(v)=[v]_B\)를 좌표사상이라 합니다.

정리 16 (좌표사상은 선형동형이다)

\(\Phi_B:V\to F^n\)은 선형이고 전단사입니다.

증명. \(u=\sum_i a_iv_i\), \(v=\sum_i b_iv_i\)이면 \(\alpha u+\beta v=\sum_i(\alpha a_i+\beta b_i)v_i\)입니다. 계수의 유일성으로

\[ \Phi_B(\alpha u+\beta v)=\alpha\Phi_B(u)+\beta\Phi_B(v). \]

좌표가 같으면 기저 결합이 같아 원래 벡터도 같으므로 단사입니다. 임의의 \((c_1,\ldots,c_n)\in F^n\)에 대해 \(\sum_i c_iv_i\)를 고르면 그 좌표가 주어진 계수열이므로 전사입니다. 역은 계수열을 그 선형결합으로 보내는 사상입니다. \(\square\)

기저를 고르면 \(V\cong F^n\)이라고 말할 수 있습니다. 그러나 \(p\)의 두 좌표처럼 어떤 동형을 쓰는지는 선택에 의존합니다. 좌표 계산이 잘못이라는 뜻이 아니라, 좌표 선택을 명시해야 한다는 뜻입니다.

12.2 표현행렬의 존재와 유일성#

정의 5 (표현행렬)

\(T:V\to W\)가 선형이고 입력 기저가 \(B=(v_j)_{j=1}^n\), 출력 기저가 \(C=(w_i)_{i=1}^m\)일 때, \(j\)번째 열이 \([T(v_j)]_C\)인 행렬을 \([T]_{C\leftarrow B}\)라 합니다.

정리 17 (행렬 표현의 항등식과 유일성)

모든 \(v\in V\)에 대해 \([Tv]_C=[T]_{C\leftarrow B}[v]_B\)입니다. 이 항등식을 만족하는 행렬은 유일합니다.

증명. \(T(v_j)=\sum_i a_{ij}w_i\), \(v=\sum_j c_jv_j\)라 쓰면

\[ T(v)=\sum_j c_jT(v_j) =\sum_jc_j\sum_i a_{ij}w_i =\sum_i\left(\sum_j a_{ij}c_j\right)w_i. \]

합이 유한하므로 순서를 바꿀 수 있습니다. 따라서 출력의 \(i\)번째 좌표는 \(\sum_j a_{ij}c_j\)이며 이것이 행렬곱의 정의와 같습니다. 존재가 증명되었습니다.

같은 항등식을 만족하는 다른 행렬 \(N\)이 있다면 \(v=v_j\)를 넣습니다. \([v_j]_B=e_j\)이므로 \(Ne_j=[T(v_j)]_C\)입니다. \(Ne_j\)\(N\)\(j\)번째 열이므로 모든 열이 위 행렬과 같습니다. 따라서 유일합니다. \(\square\)

12.3 합성과 행렬곱#

정리 18 (합성의 표현행렬)

\(T:V\to W\), \(S:W\to Z\)가 선형이고 세 공간의 기저가 각각 \(B,C,G\)이면 \([S\circ T]_{G\leftarrow B}=[S]_{G\leftarrow C}[T]_{C\leftarrow B}\)입니다.

증명. \(T(v_j)=\sum_i a_{ij}w_i\), \(S(w_i)=\sum_k b_{ki}z_k\)라 쓰면

\[ S(T(v_j))=\sum_i a_{ij}\sum_k b_{ki}z_k =\sum_k\left(\sum_i b_{ki}a_{ij}\right)z_k. \]

따라서 합성행렬의 \((k,j)\) 성분은 \(\sum_i b_{ki}a_{ij}\)이며 이것이 곱 \(BA\)의 성분입니다. \(\square\)

함수 합성의 결합법칙은 각 입력에서 \(R(S(T(v)))\)라는 같은 값이 나온다는 뜻입니다. 표현행렬의 유일성을 적용하면 \((CB)A=C(BA)\)도 얻습니다. 반면 교환법칙은 일반적으로 성립하지 않습니다. 11절의 \(DJ\)\(JD\)는 정의역부터 서로 다릅니다.

12.4 기저변환 공식#

정리 19 (서로 다른 입력·출력 기저의 변환)

옛 좌표와 새 좌표가 \([v]_{\rm old}=P[v]_{\rm new}\), \([w]_{\rm old}=Q[w]_{\rm new}\)로 연결되면 새 표현행렬은 \(Q^{-1}AP\)입니다. 한 공간의 자기 사상에서 같은 기저변환을 사용하면 \(P^{-1}AP\)입니다.

증명. 기저 좌표사상은 전단사이므로 \(P,Q\)는 가역입니다. 모든 입력에 대해

\[ [Tv]_{\rm new} =Q^{-1}[Tv]_{\rm old} =Q^{-1}A[v]_{\rm old} =Q^{-1}AP[v]_{\rm new}. \]

표현행렬의 유일성으로 결론을 얻습니다. 자기 사상에 같은 기저를 쓰면 \(Q=P\)를 대입합니다. \(\square\)

12.5 기저가 바뀌어도 유지되는 성질#

정리 20 (상사에서 보존되는 세 가지 양)

\(B=P^{-1}AP\)이면 \(A,B\)의 계수와 대각합이 같고, 모든 양의 정수 \(k\)에 대해 \(B^k=P^{-1}A^kP\)입니다. 따라서 0이 되는 최소 거듭제곱의 지수도 같습니다.

증명. \(P\)가 전사이므로 \(\operatorname{im}(AP)=\operatorname{im}A\)입니다. \(P^{-1}\)은 이 상을 동형으로 보내므로 차원을 보존합니다. 동형이 기저를 기저로 보낸다는 것은, 생성은 역상으로 되돌려 표현하고 독립은 동형의 단사성을 적용하여 확인할 수 있습니다. 따라서 \(\operatorname{rank}B=\operatorname{rank}A\)입니다.

대각합은 \(\operatorname{tr}X=\sum_i x_{ii}\)입니다. 크기가 맞는 두 행렬에 대해

\[ \operatorname{tr}(XY) =\sum_i\sum_j x_{ij}y_{ji} =\sum_j\sum_i y_{ji}x_{ij} =\operatorname{tr}(YX). \]

여기에 \(X=P^{-1}A\), \(Y=P\)를 넣으면 \(\operatorname{tr}(P^{-1}AP)=\operatorname{tr}(PP^{-1}A)=\operatorname{tr}A\)입니다.

거듭제곱은 \(k=1\)에서 성립합니다. \(B^k=P^{-1}A^kP\)라고 가정하면

\[ B^{k+1}=B^kB =P^{-1}A^kPP^{-1}AP =P^{-1}A^{k+1}P. \]

귀납법으로 모든 \(k\)에서 성립합니다. 양쪽에 \(P,P^{-1}\)을 곱할 수 있으므로 \(B^k=0\)\(A^k=0\)은 동치입니다. \(\square\)

성분의 값, 대각행렬인지 여부, 0인 성분의 개수는 위 정리의 대상이 아닙니다. 6절에서 대각행렬과 대각선 밖 성분을 가진 행렬이 실제로 상사임을 확인했습니다.

12.6 계수만 남기는 입력·출력 기저#

\(T:V\to W\)의 계수가 \(r\)이라고 합시다. B3의 차원정리 증명처럼 핵의 기저를 입력 기저로 확장하면, 핵 밖에서 추가한 \(v_1,\ldots,v_r\)의 상이 \(\operatorname{im}T\)의 기저입니다. 입력 순서를 \((v_1,\ldots,v_r,u_1,\ldots,u_k)\)로 고르고, 출력 기저는 \((T(v_1),\ldots,T(v_r))\)\(W\)의 기저로 확장해 고릅니다.

\(v_j\)는 출력의 \(j\)번째 기저로, 각 \(u_i\)는 0으로 가므로 행렬은 직사각형 블록 모양

\[\begin{split} \begin{pmatrix}I_r&0\\0&0\end{pmatrix} \end{split}\]

입니다. 존재를 위해 사용한 것은 기저 확장과 열의 정의뿐입니다. 따라서 크기가 같은 두 행렬은 계수가 같으면 독립적인 입력·출력 기저변환으로 이 같은 모양에 도달합니다. 역으로 가역 좌표변환은 상의 차원을 바꾸지 않으므로 동치인 두 행렬의 계수는 같습니다.

하지만 이 결과를 상사 분류에 적용할 수는 없습니다. 예를 들어 \(I\)\(2I\)는 실수에서 모두 가역이어서 같은 계수를 갖지만 \(P^{-1}IP=I\)이므로 서로 상사가 아닙니다. 입력과 출력 기저를 독립적으로 고르는 것과 같은 기저로 고르는 것은 다른 조건입니다.

일상적인 설명

정확한 기록

같은 다항식을 다른 계수로 적는다

\([p]_B=P[p]_C\)

기저함수 하나씩 관측한다

표현행렬의 각 열

미분한 다음 관측한다

합성행렬 \([F][D]\)

같은 작용의 입력·출력 기저를 함께 바꾼다

상사 \(P^{-1}AP\)

서로 다른 공간의 좌표를 각각 바꾼다

동치 \(Q^{-1}AP\)

비용식의 두 입력에 같은 변환을 넣는다

합동 \(P^\top HP\)

입력과 출력의 좌표변환 방향을 구별하면 같은 대상의 여러 행렬을 비교할 수 있습니다. 다음 장에서는 이처럼 조건을 명확히 적는 습관을 이용해, 맞아 보이는 주장에 숨은 오류를 찾습니다. B5로 이어 읽기.