E4 · 우도의 곡률은 어떤 모수 조합을 알려 주는가#
1. 같은 회귀를 확률모형의 우도로 읽기#
활동량 \(t=(0,1,2,3)^T\)에서 관측한 산출량 \(y=(1,2,2,5)^T\)를 다시 사용합니다. 설명변수는 \(X=[\mathbf1,t]\)이고 산출량·활동량의 단위는 앞 단원과 같습니다. 먼저 독립 정규 오차의 분산을 1로 알고 있다고 합시다.
로그우도를 계수 방향으로 미분하면
\(s\)를 점수벡터, \(J=-H\)를 관측정보행렬이라 부릅니다. 최대화 문제이므로 최대점 근처 로그우도의 헤시안은 음의 정부호여야 하며, 음의 헤시안이 양의 정부호입니다. 부호부터 정해야 수치 진단도 맞습니다.
이 모형의 기대정보는 \(I=E[ss^T]=X^TX\)입니다. 실제로 \(s=X^Tu\)이므로 공분산은 \(X^TIX=X^TX\)입니다. 정보의 고윳값은 \(9\pm\sqrt{61}\)로 양수입니다. 역행렬은
이것은 OLS 계수의 정확한 공분산입니다. 기울기 추정의 분산은 \(1/5\)입니다. 이후에는 이 관계가 언제 일반화되고 언제 실패하는지 살펴봅니다.
그림 140 왼쪽은 추정점에서의 계수 편차에 대한 음의 로그우도 증가이다. 오른쪽은 절편 고정 시 곡률 14와 절편을 함께 조정한 프로파일 곡률 5를 같은 기울기 편차 축으로 비교한다. 정보가 줄었다는 말은 두 번째 계산에서 절편도 미지수로 취급했다는 뜻이다.#
2. 점수의 공분산과 평균 곡률이 같은 조건#
모수 \(\theta\in\mathbb R^k\)의 밀도 \(f(y;\theta)\)에서 점수는 \(s=\nabla_\theta\log f\), 기대정보는 \(I(\theta)=E_\theta[ss^T]\)입니다. 정보등식
에는 조건이 필요합니다. 이 장에서는 열린 모수영역, 모수에 의존하지 않는 공통 지지, 거의 모든 \(y\)에서 양수인 두 번 미분가능 밀도, 적분과 미분을 두 번 교환할 수 있는 지배함수, 유한 점수 이차적률을 가정합니다. 실제 모형마다 이 조건을 확인해야 합니다.
하나의 \(Y\sim N(\mu,v)\), \(v>0\)에서
교차항은 중심 정규의 홀수 적률이 0이어서 사라집니다. \(n\)개 독립 관측의 정보는 \(nI_1\)입니다. 정보가 대각이라는 것은 점수 방향이 직교한다는 뜻이며 임의의 두 추정량이 독립이라는 뜻은 아닙니다.
지지가 움직이면 계산이 바뀝니다. \(Y\sim\operatorname{Uniform}(0,\theta)\)의 지지 내부에서 로그밀도를 미분하면 \(s=-1/\theta\)여서 평균이 0이 아닙니다. \(\int_0^\theta f=1\)을 미분할 때 움직이는 경계항을 빠뜨렸기 때문입니다. 이 모형에 위 정규 정보등식과 Cramér–Rao 식을 그대로 적용할 수 없습니다.
매끄러운 가역 재모수화 \(\theta=h(\eta)\)의 Jacobian을 \(D\)라 쓰면 \(s_\eta=D^Ts_\theta\), \(I_\eta=D^TI_\theta D\)입니다. 합동변환이지 상사가 아니므로 정보 고윳값의 숫자는 단위에 따라 변합니다. 예컨대 \(v=e^{2\tau}\), \(\tau=\log\sigma\)이면 \(dv/d\tau=2v\)이므로 한 관측의 \(\tau\) 정보는 \((2v)^2/(2v^2)=2\)입니다.
3. 추정량의 분산 하한을 Schur 보원으로 구한다#
자료로 계산하는 벡터 \(T\)의 평균을 \(\psi(\theta)=E_\theta T\), Jacobian을 \(G=\partial\psi/\partial\theta^T\)라 합시다. \(T\) 자체는 미지 모수를 입력받지 않는 통계량입니다. 적분 교환 조건 아래
따라서 결합 공분산
의 Schur 보원으로 \(V\succeq GI^{-1}G^T\)를 얻습니다. \(T\)가 \(\theta\)의 불편추정량이면 \(\psi(\theta)=\theta\), \(G=I_k\)라 \(V\succeq I(\theta)^{-1}\). 이것이 이 장의 Cramér–Rao 하한입니다. 오른쪽 \(I(\theta)\)는 정보행렬, \(I_k\)는 항등행렬입니다.
처음 선형 정규모형에서는 \(\widehat\beta-\beta=(X^TX)^{-1}s\)여서 이 하한을 정확히 달성합니다. 일반 모형의 모든 최대우도추정량이 유한표본에서 불편이거나 하한을 달성하는 것은 아닙니다. 편향 있는 \(T\)에는 \(\psi=\theta+b(\theta)\)이므로 \(G=I_k+Db(\theta)\)를 사용합니다. 분산 하한에 편향제곱을 더해야 평균제곱오차와 비교할 수 있습니다.
평균과 분산이 모두 미지인 정규표본의 불편 표본분산 \(S^2\)는 \(\operatorname{Var}(S^2)=2v^2/(n-1)\)입니다. 정보역의 해당 대각 \(2v^2/n\)보다 큽니다. 평균을 추정하며 쓴 자유도 하나가 남아 있기 때문입니다. 정규성에서 이 분산식은 E2의 \(\chi_{n-1}^2\) 분포로 얻습니다.
4. 정보가 0인 방향과 식별되지 않는 방향은 항상 같은가#
식별은 서로 다른 모수가 서로 다른 자료 분포를 만드는지의 문제입니다. 국소식별은 현재 모수의 충분히 작은 근방에서 이를 묻습니다. 정보는 일차 변화의 크기를 측정합니다.
\(Y\sim N(a+b,1)\)이면 점수 두 성분이 같고
\(a\)를 늘리고 \(b\)를 같은 만큼 줄이면 분포가 정확히 같으므로 여기서는 비식별입니다. \(b=0\)처럼 각 동등류를 한 번씩 고르는 정규화를 하면 합을 추정할 수 있습니다. 그러나 이것은 원래의 \(a,b\) 둘 다를 자료가 알려 주었다는 뜻이 아닙니다.
반대로 \(Y\sim N(\theta^3,1)\)이면 \(\theta\mapsto\theta^3\)가 일대일이므로 0에서도 식별되지만 \(I(\theta)=9\theta^4\), \(I(0)=0\)입니다. 일차 미분이 0이어도 고차 변화가 모수를 구별합니다. 따라서 국소식별이면 정보 비특이라는 무조건적인 역방향은 거짓입니다. 이차 곡률이 사라진 모형에 정규 근사와 \(\sqrt n\) 속도를 자동 적용하지 않습니다.
정칙모형에서는 정보 비특이가 국소식별의 충분조건이 됩니다. 일반적인 필요충분 정리에는 추가 정칙점·계수 일정 조건이 필요하며 여기서는 그 범위를 확대하지 않습니다. 마지막 절에서는 현재 계산에 필요한 Gaussian 평균모형의 충분조건과 점수 적률을 통한 충분조건을 명시적으로 증명합니다.
5. 작은 고윳값을 해석할 때 모수 단위도 본다#
네 관측의 설명변수를 \(X_\epsilon=[\mathbf1,\mathbf1+\epsilon v]\), \(v=(-3/2,-1/2,1/2,3/2)^T\)로 바꾸어 봅시다. \(\epsilon>0\)이면 열독립이지만 작을수록 두 계수의 효과를 구별하기 어렵습니다.
최소 고윳값은 \(\epsilon\to0\)에서 \((5/2)\epsilon^2\)에 가깝고, 둘째 계수의 분산은 정확히 \(1/(5\epsilon^2)\)입니다. 표준오차는 \(1/(\sqrt5\epsilon)\)이므로 \(\epsilon\)을 10분의 1로 줄이면 10배 커집니다. 조건수 자체에 표준오차가 항상 정비례한다는 법칙은 아닙니다.
이 모형은 고정된 작은 \(\epsilon\)에서의 약한 민감도를 보여 줍니다. 표본크기와 함께 식별 강도가 변하는 약한 도구 등의 비표준 점근이론까지 증명한 것은 아닙니다. 또한 변수 하나를 단순히 \(10^6\)배 확대해도 조건수는 커질 수 있으므로, 단위에 따른 수치 문제와 자료에 실제로 구별 정보가 없는 문제를 나누어 보아야 합니다.
그림 141 왼쪽 두 양은 로그 눈금으로 각각의 단위를 표시한다. 오른쪽 \(\theta^3\)는 원점에서 기울기가 0이지만 여전히 일대일이다. 작은 일차 민감도와 정확한 비식별을 같은 결론으로 읽지 않는다.#
6. 방해모수를 함께 추정하면 정보가 줄어든다#
관심 모수를 \(\alpha\), 방해모수를 \(\gamma\)로 나누고 점수와 정보를 블록으로 씁니다. \(I_{\gamma\gamma}\succ0\)이면 관심 점수에서 방해 점수로 예측되는 성분을 제거하여
이것도 FWL과 같은 부분화이지만 관측벡터 대신 점수 확률변수의 공간에서 합니다. 뺀 행렬이 PSD라 \(I_{eff}\preceq I_{\alpha\alpha}\)입니다. 방해모수가 알려졌을 때의 정보보다 커지지 않습니다.
처음 회귀에서 관심 모수는 기울기, 방해모수는 절편입니다. 절편이 알려졌다면 기울기 정보는 14이지만 절편도 추정하면 \(14-6^2/4=5\)입니다. 따라서 기울기 분산 하한이 \(1/14\)에서 \(1/5\)로 커집니다. \(t\)를 중심화하면 교차정보가 0인 좌표가 되지만 실제로 확보한 기울기 정보 5가 14로 늘어나는 것은 아닙니다.
관측 로그우도를 \(\gamma\)에 대해 최대화한 프로파일 \(\ell_p(\alpha)=\ell(\alpha,\widehat\gamma(\alpha))\)의 관측 음의 헤시안도 Schur 보원입니다. 다만 이 관측행렬의 기대가 언제나 기대정보의 Schur 보원과 같은 것은 아닙니다. 예를 들어 \(J=\begin{pmatrix}2&B\\B&2\end{pmatrix}\), \(B=\pm1\) 등확률이면 각 Schur 보원은 \(3/2\)지만 \(EJ=2I\)의 Schur 보원은 2입니다. 역행렬과 기대 연산은 일반적으로 교환되지 않습니다. 정칙 큰 표본에서 정규화한 관측정보가 기대정보로 수렴할 때에만 대응하는 점근 관계를 얻습니다.
7. 대칭 공분산의 독립 성분만 기록하기#
두 산출 충격의 공분산을 \(\Sigma=\begin{pmatrix}a&b\\b&c\end{pmatrix}\)라 합시다. 열을 차례로 쌓는 규약으로 \(\operatorname{vec}\Sigma=(a,b,b,c)^T\), 아래삼각 성분을 열 순서로 모으면 \(\operatorname{vech}\Sigma=(a,b,c)^T\)입니다. 중복 성분을 복원하는 행렬은
\(D^+D=I_3\)이고 \(DD^+\)는 두 비대각 성분을 평균합니다. 전치를 구현하는 교환행렬 \(K\)에는 \(K\operatorname{vec}A=\operatorname{vec}(A^T)\)가 성립하며 \(DD^+=(I+K)/2\)입니다. 아래삼각을 단순 선택하는 제거행렬 \(L\)은 \(L\operatorname{vec}\Sigma=\operatorname{vech}\Sigma\)를 만족하지만 비대칭 입력에는 \(L\)과 \(D^+\)의 결과가 다릅니다. \(D^+\)는 비대각을 평균하고 \(L\)은 한쪽만 선택합니다.
라 두면 평균 0을 알고 있는 공분산 추정량의 정확한 분산은
예를 들어 가운데 대각은 \(\operatorname{Var}(u_1u_2)=\sigma_{11}\sigma_{22}+\sigma_{12}^2=2\cdot1+1=3\)이고, 첫·셋째 공분산은 \(\operatorname{Cov}(u_1^2,u_2^2)=2\sigma_{12}^2=2\)입니다. 이 식에서 표본크기 \(1/n\)을 빼먹으면 추정량의 분산이 아니라 \(\sqrt n\) 극한의 공분산을 보고한 것입니다.
일반 차원에서는
평균을 표본에서 추정한 불편 공분산 \(S=(n-1)^{-1}\sum(u_i-\bar u)(u_i-\bar u)^T\)는 정규모형에서 정확히 분모 \(n-1\)을 사용합니다. \(1/n\) 정규화 표본공분산과 유한표본 분산이 같지는 않지만 \(\sqrt n\) 극한 공분산은 같습니다.
import numpy as np
import scipy.linalg as la
def symmetric_maps(p):
pairs=[(i,j) for j in range(p) for i in range(j,p)]
D=np.zeros((p*p,len(pairs)));L=np.zeros((len(pairs),p*p))
for k,(i,j) in enumerate(pairs):
D[i+j*p,k]=1;D[j+i*p,k]=1;L[k,i+j*p]=1
K=np.zeros((p*p,p*p))
for i in range(p):
for j in range(p):K[j+i*p,i+j*p]=1
Dp=la.solve(D.T@D,D.T,assume_a='pos')
return D,Dp,L,K,pairs
D,Dp,L,K,pairs=symmetric_maps(2)
Sigma=np.array([[2.,1.],[1.,1.]])
V=2*Dp@np.kron(Sigma,Sigma)@Dp.T
assert np.allclose(Dp@D,np.eye(3)) and np.allclose(D@Dp,(np.eye(4)+K)/2)
assert np.allclose(V,[[8,4,2],[4,3,2],[2,2,2]])
g=np.array([.25,.5,.25])
assert np.isclose(g@V@g,25/8)
print('sqrt(n) 공분산과 동일가중 합성충격의 분산:',V,g@V@g)
sqrt(n) 공분산과 동일가중 합성충격의 분산: [[8. 4. 2.]
[4. 3. 2.]
[2. 2. 2.]] 3.1249999999999996
그림 142 두 패널 모두 \(\sqrt n(\operatorname{vech}\widehat\Sigma_0-\operatorname{vech}\Sigma)\)의 공분산을 표시하며 같은 색 범위를 쓴다. 오른쪽은 고정 시드 10,000회 모의실험이라 이론 숫자와 정확히 같을 필요는 없다. 모의실험은 아래의 네 번째 적률 증명을 대신하지 않는다.#
8. 미분의 계수가 떨어지면 델타메소드도 달라진다#
\(\sqrt n(\widehat\theta-\theta)\Rightarrow Z\sim N(0,V)\)이고 \(g\)의 Jacobian이 \(G\)이면 일차 전개에서 극한 공분산은 \(GVG^T\)입니다. 이 행렬의 계수가 작으면 극한은 더 낮은 차원에 놓입니다. \(G=0\)이라고 추정 오차가 없는 것은 아닙니다.
예를 들어 \(Y_i\sim N(\mu,1)\), \(g(\mu)=\mu^2\)이면 \(g'(\mu)=2\mu\)입니다. \(\mu=0\)에서 일차 델타메소드는 0으로 퇴화하지만
입니다. 올바른 비퇴화 속도는 \(\sqrt n\)이 아니라 \(n\)입니다. 일반 스칼라 \(C^2\) 함수에서 \(G=0\)이면 이차 전개로 \(n(g(\widehat\theta)-g(\theta))\Rightarrow Z^TH_gZ/2\)를 얻습니다.
공분산 예에서 동일가중 합성충격의 분산은 \(g(\Sigma)=(a+2b+c)/4\), Jacobian \((1/4,1/2,1/4)\)입니다. 위 \(V\)에 곱하면 \(GVG^T=25/8=2(5/4)^2\). 합성충격 자체가 분산 \(5/4\)인 정규라는 직접 계산과 같습니다.
9. 모형이 틀리면 점수 외적과 평균 곡률이 달라진다#
실제 분포에 대해 \(A=-E[H(\theta_*)]\), \(B=E[s(\theta_*)s(\theta_*)^T]\)라 쓰면, 정칙하고 일치적인 내부 해의 점수 전개는 점근 공분산 \(A^{-1}BA^{-T}\)를 줍니다. \(\theta_*\)는 가정한 로그우도의 기대를 최대화하는 의사참값입니다. 참분포가 모형에 속할 때의 정보등식 \(A=B\)를 오설정에서도 적용하지 않습니다.
구체적으로 실제 오차를 \(U=SZ\), \(Z\sim N(0,1)\), \(S^2=1/2,3/2\) 등확률이며 독립인 혼합정규로 정합니다. 평균은 0, 분산은 1이지만
정규 \(N(\mu,v)\)를 작업모형으로 쓰면 의사참값은 \((0,1)\)입니다. 그 점의 점수는 \((U,(U^2-1)/2)^T\)이므로
순진한 정보역은 \(\operatorname{diag}(1,2)\)라 분산모수의 불확실성을 작게 계산합니다. 실제 표본분산의 극한 분산은 \(E[U^4]-(E[U^2])^2=11/4\)와 일치합니다. 샌드위치도 표본크기, 일치성, 유한 점수 분산, Hessian의 균일 수렴 같은 조건 없이 보편적으로 맞지는 않습니다.
t=np.arange(4.);X=np.column_stack([np.ones(4),t])
I=X.T@X;cov=la.solve(I,np.eye(2),assume_a='pos')
assert np.allclose(cov,[[.7,-.3],[-.3,.2]])
assert np.isclose(I[1,1]-I[1,0]**2/I[0,0],5.)
v=np.array([-1.5,-.5,.5,1.5])
for eps in [1.,.1,.01]:
Xe=np.column_stack([np.ones(4),np.ones(4)+eps*v])
Q,R=la.qr(Xe,mode='economic')
Ri=la.solve_triangular(R,np.eye(2))
assert np.isclose((Ri@Ri.T)[1,1],1/(5*eps*eps),rtol=1e-11)
Am=np.diag([1.,.5]);Bm=np.diag([1.,11/16])
Ai=la.solve(Am,np.eye(2),assume_a='pos')
assert np.allclose(Ai@Bm@Ai.T,np.diag([1.,11/4]))
print('회귀 정보·유효정보·약한 방향·오설정 샌드위치 검산')
회귀 정보·유효정보·약한 방향·오설정 샌드위치 검산
10. 헤시안 경고를 받았을 때 확인할 대상#
보이는 현상 |
먼저 확인할 계산 |
해석의 범위 |
|---|---|---|
최대점의 Hessian이 음수 |
목적이 로그우도 최대화인지 확인 |
음의 Hessian을 정보로 사용 |
같은 평균을 만드는 모수 조합 |
Jacobian의 핵과 재모수화 |
중복 모수의 정확한 비식별 |
작은 최소 고윳값 |
변수 단위, Jacobian 특이값, 점수 크기 |
작은 민감도와 단위 불균형 구분 |
경계 분산 또는 완전분리 |
허용영역·목적값·계수 경로 |
내부 정칙 최대점이 없을 수 있음 |
작은 음의 수치 고윳값 |
미분 보폭 변화, 대칭화, 해석 미분 비교 |
반올림·절단오차 여부 확인 |
큰 점수인데 역 Hessian 출력 |
정상식 잔차와 보폭·수렴 이력 |
최적화 미완료 가능성 |
OPG와 평균 음의 Hessian 불일치 |
동일한 모수·정규화·표본을 사용했는지 확인 |
표본변동 또는 모형 오설정 |
OPG는 관측별 점수의 외적합입니다. 올바른 모형에서도 유한표본 OPG와 관측정보가 정확히 같은 것은 아닙니다. 고윳값을 강제로 양수로 자르는 조작이나 유사역은 수치 출력을 만들 수 있지만 식별·정칙성을 새로 만들어 주지 않습니다.
11. 연습과 전체 풀이#
1. \(N(\mu,v)\) 한 관측에서 \(\tau=\log\sigma\)의 정보를 구하세요.
풀이. \(v=e^{2\tau}\), \(dv/d\tau=2v\)이므로 정보의 합동변환으로 \(I_{\tau\tau}=(2v)^2/(2v^2)=2\). 교차정보는 0입니다. \(n\)개면 \(2n\)입니다.
2. 회귀 예에서 절편이 알려졌을 때와 미지일 때 기울기 분산 하한을 비교하세요.
풀이. 알려졌으면 정보 14라 \(1/14\). 미지이면 유효정보 \(14-36/4=5\)라 \(1/5\). 절편 방향과 함께 설명될 수 있는 기울기 변화는 별도의 정보로 사용할 수 없습니다.
3. \(N(\theta^3,1)\)에서 정보 0은 무엇을 의미하나요?
풀이. 점수는 \(3\theta^2(Y-\theta^3)\)라 0에서 점수 자체가 0입니다. 이는 일차적으로 분포를 변화시키지 않는다는 뜻입니다. 세제곱 평균은 일대일이어서 정확한 비식별은 아닙니다.
4. 비대칭 \(A=\begin{pmatrix}1&4\\2&3\end{pmatrix}\)에 \(L\)과 \(D^+\)를 비교하세요.
풀이. 열 순서 vec는 \((1,2,4,3)^T\). 아래삼각 선택은 \((1,2,3)^T\), 대칭 평균은 \((1,3,3)^T\)입니다. 대칭 입력에서만 둘이 같습니다.
5. 두 충격 공분산 예에서 \(\widehat\sigma_{12}\)의 정확 분산을 구하세요.
풀이. 평균 0을 알고 \(1/n\) 외적평균을 쓰면 \(3/n\). 표본평균을 제거한 불편 공분산이면 Gaussian에서 \(3/(n-1)\)입니다. 추정량의 정의를 먼저 정해야 합니다.
6. 합성충격 \((U_1+U_2)/2\)의 분산 추정에 대한 극한 분산을 두 방법으로 확인하세요.
풀이. \(w^T\Sigma w=(2+2+1)/4=5/4\)이므로 정규 제곱의 분산은 \(2(5/4)^2=25/8\). 또는 \(G=(1/4,1/2,1/4)\)에 \(VG^T=(9/2,3,2)^T\)를 곱해 \(9/8+3/2+1/2=25/8\)입니다.
7. 혼합정규 오설정 예에서 분산모수의 순진한 표준오차는 어떤 비율로 작은가요?
풀이. 올바른 점근 표준오차는 \(\sqrt{(11/4)/n}\), 순진한 것은 \(\sqrt{2/n}\). 올바른 값은 순진한 값의 \(\sqrt{11/8}\)배입니다. 평균모수의 분산은 이 예에서 둘 다 \(1/n\)입니다.
8. \(\mu=0\)에서 \(\bar Y^2\)의 오차가 일차 델타메소드로 0이면 정확히 0인가요?
풀이. 아닙니다. \(\sqrt n\bar Y^2\to_p0\)이지만 \(n\bar Y^2\sim\chi_1^2\). 더 빠른 축척에서 비퇴화 오차가 드러납니다.
12. 지금까지의 내용을 수학의 언어로 정리해 봅시다#
미분·적분 교환과 극한정리의 적용 조건은 각 정리의 가정입니다. 정규 선형모형의 정확한 계산과 일반 정칙모형의 점근 결론을 구별합니다.
정리 1. 정보등식과 재모수화#
2절의 정칙조건에서 \(Es=0\), \(I=E[ss^T]=-EH\)이며 가역 매끄러운 재모수화에 \(I_\eta=D^TI_\theta D\)입니다.
증명. \(\partial_j f=f s_j\)이므로 \(\partial_j\int f=0\)에서 \(E s_j=0\). 다시 \(\partial_i\partial_j f=f(H_{ij}+s_is_j)\)이므로 두 번의 미분·적분 교환으로 \(E H_{ij}+E s_is_j=0\). 모든 성분에 적용하면 정보등식입니다. 연쇄법칙 \(d\ell=s_\theta^Td\theta=s_\theta^TDd\eta\)로 \(s_\eta=D^Ts_\theta\). 외적 평균을 취하면 합동변환입니다. 독립 표본의 점수는 합이고 각 점수 평균이 0이라 교차 공분산은 0이므로 정보도 더해집니다. ∎
정리 2. Cramér–Rao 하한과 등호#
3절의 적분 교환·유한 공분산 조건 및 \(I\succ0\)에서 \(V\succeq GI^{-1}G^T\). 행렬 등호일 필요충분조건은 \(T-ET=GI^{-1}s\) a.s.입니다.
증명. 모수에 의존하지 않는 \(T\)를 적분 안에 두고 미분하면 \(\partial E T/\partial\theta^T=E[Ts^T]\). \(Es=0\)이므로 이는 \(G=\operatorname{Cov}(T,s)\). 임의 계수로 \(T,s\)를 선형결합한 분산은 비음수라 결합 공분산은 PSD입니다. 직접 잔차 \(R=T-ET-GI^{-1}s\)의 공분산을 계산하면 \(V-GI^{-1}G^T\)이므로 PSD 하한을 얻습니다. 이 행렬이 0이면 각 \(R_i\)의 제곱평균이 0이라 \(R=0\) a.s.이고 역도 같습니다. \(\psi(\theta)=\theta+b(\theta)\)를 대입하면 편향 보정 판본을 얻습니다. ∎
정리 3. 정보 비특이의 국소식별 충분조건#
고정 공분산 Gaussian 평균모형 \(N(m(\theta),\Sigma)\), \(\Sigma\succ0\), \(m\)이 \(C^1\)이면 \(I=Dm^T\Sigma^{-1}Dm\)입니다. \(Dm(\theta_0)\)가 완전 열계수면 \(\theta_0\) 근방에서 모수는 식별됩니다. 일반 정칙모형에서도 \(F(\theta)=E_\theta[s(Y;\theta_0)]\)가 \(C^1\)이고 미분·적분 교환이 가능하며 \(I(\theta_0)\succ0\)이면 같은 충분조건이 성립합니다.
증명. Gaussian 점수는 \(Dm^T\Sigma^{-1}(Y-m)\)여서 공분산을 계산하면 정보식입니다. 완전 열계수 Jacobian에는 가역인 정사각 행 부분행렬이 있습니다. 해당 평균 성분들만 선택한 사상에 역함수정리를 적용하면 근방에서 일대일입니다. 분포가 같으면 그 평균 성분도 같으므로 모수가 같습니다.
일반 경우 \(\theta_0\)에서 점수를 고정한 \(F\)를 미분하면 \(DF(\theta_0)=E_{\theta_0}[s(Y;\theta_0)s(Y;\theta_0)^T]=I(\theta_0)\). 역함수정리로 \(F\)는 근방에서 일대일이고, 같은 분포는 같은 \(F\)를 주므로 식별됩니다. 역방향은 \(m(\theta)=\theta^3\)의 반례로 부정됩니다. ∎
정리 4. 유효정보와 관측 프로파일 곡률#
6절의 점수 부분화는 정보의 Schur 보원을 줍니다. 또한 \(\ell\)이 \(C^2\), \(\ell_\gamma(\alpha,\widehat\gamma(\alpha))=0\), \(J_{\gamma\gamma}=-\ell_{\gamma\gamma}\succ0\)인 매끄러운 내부 최적 가지에서
증명. \(s_{eff}\)와 \(s_\gamma\)의 공분산은 \(I_{\alpha\gamma}-I_{\alpha\gamma}I_{\gamma\gamma}^{-1}I_{\gamma\gamma}=0\). 외적을 전개하면 남는 공분산이 Schur 보원입니다. 뺀 항은 \(I_{\alpha\gamma}I_{\gamma\gamma}^{-1/2}\)의 곱 \(AA^T\)라 PSD입니다.
관측 정상식을 미분하면 \(\ell_{\gamma\alpha}+\ell_{\gamma\gamma}D\widehat\gamma=0\), 따라서 \(D\widehat\gamma=-J_{\gamma\gamma}^{-1}J_{\gamma\alpha}\). 프로파일의 첫 미분은 \(\ell_\alpha\)입니다. 둘째 미분은 \(\ell_{\alpha\alpha}+\ell_{\alpha\gamma}D\widehat\gamma\)여서 음수를 취하면 제시한 식입니다. 모든 블록은 같은 관측 자료와 같은 프로파일 점에서 평가합니다. 기대정보에 대한 동일 식은 점수 공분산 계산으로 따로 얻은 것이므로 기대와 역행렬을 교환한 증명이 아닙니다. ∎
정리 5. Gaussian 외적의 공분산과 대칭 좌표#
독립 \(u_i\sim N(0,\Sigma)\)에 \(\widehat\Sigma_0=n^{-1}\sum u_iu_i^T\)이면
따라서 7절의 vech 분산식이 성립합니다.
증명. 표준정규 독립 좌표에 홀수 적률은 0, \(EZ_i^2=1\), \(EZ_i^4=3\)입니다. 마지막 값은 \(\varphi'(z)=-z\varphi(z)\)와 부분적분으로 \(EZ^4=3EZ^2=3\)을 얻습니다. 따라서 네 표준정규 좌표의 곱 평균은 세 짝짓기의 합 \(\delta_{ab}\delta_{cd}+\delta_{ac}\delta_{bd}+\delta_{ad}\delta_{bc}\)입니다. \(u=AZ\)를 성분별로 전개하고 \(AA^T=\Sigma\)를 대입하면
외적 성분의 평균 곱 \(\sigma_{ij}\sigma_{kl}\)를 빼면 공분산입니다. 독립 표본의 평균이므로 \(1/n\)이 붙습니다. 열 순서 vec로 적으면 \((I+K)(\Sigma\otimes\Sigma)/n\). 양쪽에 \(D^+,(D^+)^T\)를 곱하고 \(D^+K=D^+\)를 사용하면 \(2D^+(\Sigma\otimes\Sigma)(D^+)^T/n\)입니다. \(D\)의 열은 대각 위치 또는 대칭인 두 위치의 지시벡터여서 서로 직교하며 \(D^+=(D^TD)^{-1}D^T\). 따라서 \(DD^+\)는 정확히 대칭화 \((I+K)/2\)이고 이 성질은 일반 차원에서도 성립합니다.
평균을 추정하는 경우 표본 인덱스 방향에서 첫 축을 \(\mathbf1/\sqrt n\)로 잡은 직교변환을 합니다. Gaussian 회전불변성으로 나머지 \(n-1\)개의 충격벡터는 서로 독립이며 각각 \(N(0,\Sigma)\)입니다. 중심화 외적합은 그 \(n-1\)개 외적의 합이므로 불편 공분산의 분산 분모는 \(n-1\)입니다.
비정규 iid에서는 네 번째 적률이 유한할 때 \(V_{vec}=E[\operatorname{vec}(uu^T)\operatorname{vec}(uu^T)^T]-\operatorname{vec}\Sigma\operatorname{vec}\Sigma^T\)를 그대로 사용합니다. 중심극한정리를 외부 전제로 적용하면 \(\sqrt n\) 외적평균의 극한 공분산이 \(V_{vec}\)입니다. 표본평균 제거항은 \(\bar u\bar u^T=O_p(n^{-1})\)라 같은 일차 극한을 가지며, Gaussian 짝짓기 식으로 단순화할 수 있는지는 별도 조건입니다. ∎
정리 6. 델타메소드와 점수 방정식의 샌드위치#
증명. \(\widehat\theta-\theta=O_p(n^{-1/2})\)이고 Fréchet 미분가능성이 주는 나머지는 \(o_p(n^{-1/2})\)입니다. 따라서 \(\sqrt n(g(\widehat\theta)-g(\theta))=G\sqrt n(\widehat\theta-\theta)+o_p(1)\)이고 Slutsky로 극한 \(GZ\)를 얻습니다. \(G=0\), \(g\in C^2\)이면 이차 전개와 확률적 유계성을 사용하여 \(n(g(\widehat\theta)-g(\theta))=\frac12[\sqrt n(\widehat\theta-\theta)]^TH_g[\sqrt n(\widehat\theta-\theta)]+o_p(1)\)입니다.
샌드위치에는 추가로 내부 점수해의 일치성, \(Es_i(\theta_*)=0\), 유한 \(B\), 평균 Hessian의 근방 균일 수렴과 가역 \(A\)를 가정합니다. 적분형 Taylor 전개를 쓰면 \(0=n^{-1}\sum s_i(\theta_*)-A_n(\widehat\theta-\theta_*)\)이고 \(A_n\to_pA\). 따라서 \(\sqrt n(\widehat\theta-\theta_*)=A_n^{-1}n^{-1/2}\sum s_i(\theta_*)\). iid 벡터 중심극한정리와 Slutsky로 공분산 \(A^{-1}BA^{-T}\)를 얻습니다. 이 계산은 전제한 일치성·균일 수렴을 대신 증명하지 않습니다. ∎
우도 계산에서 본 현상 |
선형대수의 의미 |
|---|---|
점수가 구별하지 못하는 일차 방향 |
정보행렬의 핵 |
불편추정량의 최소 분산 하한 |
결합 공분산의 Schur 보원 |
방해모수를 제거한 관심 정보 |
점수공간의 직교 잔차 |
대칭 모수의 중복 성분 |
복제행렬과 대칭화 사영 |
일차 델타메소드의 퇴화 |
Jacobian의 계수 감소와 이차형식 |
정보행렬과 Schur 보원으로 식별과 추정의 국소 정확도를 읽었습니다. 다음 장에서는 완전한 우도 대신 적률 조건을 사용하고, 서로 맞지 않는 표본 적률을 어떤 가중치로 결합할지 살펴봅니다. E5로 이어 읽기.