P=X(X′X)−1X′은 무엇을 하는 물건인가. "다른 변수를 통제한다"는 말은 기하적으로 무엇인가.
같은 자료, 같은 종속변수인데 시장수익률의 계수가 1.50에서 1.38로 내려간다. 그 사이에서 일어난 일은 "통제했다"는 한 단어뿐이다. 요인회귀 표를 놓고 보면 이렇다. 어떤 주식의 초과수익률 y를 시장 초과수익률 x1에 회귀한 것이 (1)열이고, 규모 요인 x2(SMB)를 더한 것이 (2)열이다. (1)열의 시장 기울기는 1.50, (2)열은 1.38이다. 본문은 "규모 요인을 통제하면"이라고만 적고 다음 문단으로 넘어간다.
학부 읽기는 두 열이 모두 (X′X)−1X′y의 출력이라는 것을 안다. 열을 하나 더 붙여 같은 공식을 다시 돌리면 (2)열이 나온다. 거기까지다. 왜 계수가 움직였는지 말하지 못한다. 얼마나 움직이는지가 무엇으로 결정되는지 말하지 못한다. "통제"가 자료에 가한 연산이 무엇인지 말하지 못한다. 세 질문의 답은 모두 (2) 한 줄에 있다. 그 한 줄이 읽히지 않으면 회귀표의 열과 열 사이는 빈칸으로 남는다.
코드에서는 한 줄 차이다. 회귀 함수에 열 이름 하나를 더 넘기면 (2)열이 나온다. 함수가 자료에 무엇을 했는지 묻는 사람은 드물다. 그런데 표를 읽는 쪽에서는 그 한 줄이 계수를 0.12만큼 옮겼고, 어떤 자료에서는 부호를 뒤집는다. 부호가 뒤집힐 수 있는 조건이 무엇인지, 그 조건이 자료의 어느 숫자에 들어 있는지를 말하려면 공식이 아니라 사상이 필요하다. 공식은 출력을 주고, 사상은 출력이 입력의 어느 부분에서 왔는지를 준다.
같은 일이 다른 옷을 입고 나타난다. “기업 고정효과를 포함한다”, “계절 더미로 계절조정한 자료를 쓴다”, “추세를 제거한 뒤 회귀한다”. 세 문장은 서로 다른 절차처럼 보이지만 자료에 가하는 연산은 하나다. 그 연산의 이름이 M2이고, M2가 무엇을 하는지는 P가 무엇을 하는지에서 나온다. P는 곱셈이 가능한 숫자표가 아니라 Rn의 벡터를 받아 Rn의 벡터를 돌려주는 사상(map)이다. 사상으로 읽으면 "통제"는 절차가 아니라 한 번의 곱셈이다. 고정효과를 넣는 것도, 더미로 계절조정하는 것도, 추세를 빼는 것도 같은 곱셈이고, 다른 것은 곱하는 행렬을 만드는 재료뿐이다.
회귀계수 공식은 외웠지만, 그 공식이 자료에 무엇을 하는지를 말하지 못한다 — 이 회차는 P를 공식이 아니라 사상으로 읽게 한다.
같은 글자, 다른 이름. P는 W03에서 채권가격이었다 — 수익률을 받아 가격을 내는 함수였다. 여기서는 n×n 행렬이다. β는 W02에서 노동탄력성이었다 — 모형이 주는 파라미터였다. 여기서는 회귀계수 벡터이고, 모자를 쓴 β^는 자료에서 계산되는 양이다. y도 W03의 만기수익률과 같은 글자다 — 거기서는 스칼라 수익률, 여기서는 관측 벡터다. e는 잔차 벡터 e=My이며 자연로그의 밑이 아니다. 요인회귀 논문은 절편을 α라 부르지만 이 책의 α는 자본분배율(W02)이므로 절편은 β0, 곧 상수항 열 1의 계수로 적는다. 4절에서 한 번 쓰는 Γ^는 보조회귀의 계수 행렬로 이 회차 전용 글자다.
변수와 파라미터의 구분이 뒤집힌다. 앞 회차들에서 x는 움직이는 변수였고 p·w는 주어진 파라미터였다. 이 회차에서 주어진 것은 X와 y — 숫자 배열이다. 움직이는 것은 계수 후보 b∈Rk다. 답 β^는 파라미터가 아니라 y의 함수다. β^=(X′X)−1X′y는 y에 선형이다 — y를 두 배 하면 β^도 두 배가 되고, 두 관측 벡터를 더한 것의 계수는 각각의 계수를 더한 것이다. 이 선형성이 4절 Q1의 가중치 읽기와 Q3의 단위 변환을 떠받친다. 세 글자를 갈라 둔다. b는 아직 정해지지 않은 후보, β는 모형이 있다면 그 안의 계수, β^는 자료가 정한 값이다. 이 회차에는 모형이 없으므로 β는 이름으로만 있고 계산에 나오는 것은 b와 β^뿐이다.
첨자와 장식. 아래첨자 1·2는 시점이 아니라 블록이다 — X1은 관심 변수의 열들, X2는 통제 변수의 열들이다. 물결 X~1은 "X2로 설명되는 부분을 뺀 뒤"를 뜻하고, 모자 β^는 자료에서 계산한 값을 뜻한다. 전치는 프라임 X′ 하나로 통일한다. X′X는 k×k이고 XX′는 n×n이다 — 같은 두 글자를 순서만 바꾼 것이 전혀 다른 크기의 대상이 된다.
W01 고리. (1)에서 u:R+L→R을 정의역→공역으로 읽었다. 같은 눈으로 P:Rn→Rn을 읽는다. 형상 n×n은 시작에 불과하다. 사상으로서의 형상은 정의역 Rn, 치역 C(X)(k차원), 핵 C(X)⊥(n−k차원)이다. 행렬 곱셈이 가능하다는 것(서문 자가진단 5번)과 행렬이 무엇을 하는지는 다른 문제다 — 행렬을 선형사상으로 읽는 연습은 Hubbard & Hubbard (2015)의 앞 장들이 자세하다. (X′X)−1이 존재하는가도 형상의 문제다. n≥k이고 열이 선형독립일 때만 k×k 행렬 X′X가 뒤집힌다.
FWL(Frisch–Waugh–Lovell) 정리를 백지에서 유도한다. P가 멱등(idempotent)이고 대칭임을 확인하고 그 두 성질이 사영의 정의임을 보인다. 회귀의 기하를 한 장 전체에 할애한 교재로는 Davidson & MacKinnon (2004)의 2장이 있고, 최소제곱을 사영으로 처음 배우는 자리로는 Boyd & Vandenberghe (2018)가 있다.
A2. X와 y는 고정된 실수 배열이다. 확률·오차항·분포 가정은 두지 않는다. 내적은 표준 유클리드 내적 u′v, 노름은 ∥v∥2=v′v다.
A3. 분할 X=[X1X2], k1+k2=k, k1,k2≥1. A1에서 X1, X2 각각도 열 선형독립이다. X~1의 열 선형독립은 A1에서 따로 증명한다((16)).
A2가 이 회차의 울타리다. 오차항이 없으니 확률 언어가 나올 자리가 없다. 모든 명제는 대수와 기하다. W03의 등식이 나머지항을 버린 근사였던 것과 달리((1)), 이 회차의 등식은 전부 항등식이다 — 어느 줄에도 ≈가 없다.
Figure 1:직선 S 위로 y=(1,2)′를 떨어뜨리는 두 방법. 직교사영 Py=(1.6,0.8)′는 나머지가 S에 수직이고 거리가 1.342로 가장 짧다. 빗사영 Qy=(1,0.5)′는 Q2=Q이지만 Q=Q′이며 거리는 1.500이다.
멱등만으로는 부족하다. Figure 1의 Q=xz′/(z′x), x=(1,0.5)′, z=(1,0)′는 Q2=Q를 채운다 — 한 번 떨어뜨린 점을 다시 떨어뜨려도 제자리다. 그러나 Q=Q′이고, 나머지 y−Qy는 z에 수직이지 x에 수직이 아니다. 거리는 1.500으로 직교사영의 1.342보다 길다. 대칭이 직각을 주고, 직각이 최소거리를 준다. 가중최소제곱의 적합값은 유클리드 내적으로 보면 이런 빗사영이다(다른 내적으로 보면 직교사영이다). 사영행렬을 이 두 성질로 정의하는 것은 Strang (2016)의 사영 절이 출발점으로 삼는 방식이다.
Figure 2:n=3, k=2에서의 (a). 평면 C(X) 위로 y=(1,3,0)′를 떨어뜨린 그림자가 Py=Xβ^이고, 나머지 My는 평면에 수직이다. (Py)′(My)=0이며 ∥y∥2=∥Py∥2+∥My∥2이다.
Figure 2이 (a)의 전부다. X의 두 열이 평면을 펼치고 y는 그 평면 밖에 있다. Py는 평면 위에서 y에 가장 가까운 점이고, y에서 Py로 가는 선분 My는 평면과 직각을 이룬다. 회귀를 "돌린다"는 것은 이 그림자를 계산하는 일이고, 계수 β^는 그림자를 두 열의 조합으로 적을 때의 계수다. 관측이 천 개라도 그림은 같다 — 평면이 k차원 부분공간이 될 뿐이다. (12)의 세 등식은 이 그림의 세 문장이다. 잔차는 모든 열에 수직이고, 그림자와 나머지는 서로 수직이며, 빗변의 제곱은 두 변의 제곱의 합이다.
P와 M은 Rn을 서로 수직인 두 조각으로 나누는 한 쌍이고, P+M=I가 그 나눔에 남는 것이 없다는 문장이다. M의 치역이 C(X)⊥라는 것은 (12)의 근거에서 보인 두 포함이고, 이름이 소멸행렬(annihilator)인 이유는 MX=0 — 열공간의 원소를 0으로 지우기 때문이다.
근거 — 1′1=n이므로 P2=n111′ — 각 원소를 평균으로 바꾸는 사상이다. 같은 이유로 y~=y−yˉ1. (2)에 대입하면 분모가 x~1′x~1, 분자가 x~1′y~다.
학부에서 외운 단순회귀 공식이 "상수항을 통제한 FWL"이다. 평균을 빼는 절차가 곧 M2를 곱하는 일이고, 상수항 열 하나짜리 통제 블록이 그 사상을 만든다. 통제 블록이 더미 변수 여러 개면 M2는 그룹별 평균을 빼는 사상이 되고, 통제 블록이 시간의 다항식이면 추세를 빼는 사상이 된다. 사상은 하나이고 통제 블록만 다르다. 논문이 "기업 고정효과"라 적는 것은 이 통제 블록이 기업 더미들이라는 뜻이고, 그 M2는 각 기업의 관측에서 그 기업의 평균을 뺀다. 그때 계수는 기업 안에서의 변동만으로 만들어지고, 기업 사이의 수준 차이는 계수에 들어오지 못한다.
번역. (a) 최소제곱 적합값은 관측 벡터를 설명변수들이 펼치는 평면에 수직으로 떨어뜨린 그림자이고, 잔차는 그 평면에 수직인 나머지다. (b) 다른 변수를 통제한 계수란, 결과와 관심 변수 양쪽에서 통제 변수가 설명하는 부분을 먼저 씻어 내고 남은 것끼리 회귀한 기울기이며, 그렇게 얻은 잔차는 한꺼번에 회귀한 잔차와 같다. 두 문장은 하나다 — (b)는 (a)를 두 번 쓴 것이다. 먼저 통제 변수가 펼치는 평면에 수직으로 떨어뜨려 그림자를 지우고, 남은 것끼리 다시 떨어뜨린다. 두 번 떨어뜨린 결과가 한 번에 떨어뜨린 결과와 같다는 것이 정리의 내용이다.
수치로 확인한다. 6개월 초과수익률(%/월) 가상 자료다.
i
1
2
3
4
5
6
x1 시장 초과수익률
2
−1
3
0
−2
4
x2 규모 요인(SMB)
1
0
2
−1
−1
3
y 주식 초과수익률
3
−1
5
0
−3
6
X=[1x1x2]이고 X′X의 세 행은 (6,6,4), (6,34,22), (4,22,16), 행렬식은 296이다. 분수는 정확한 값이고 소수는 4자리다.
도입의 "1.50에서 1.38로"가 둘째 행과 첫째 행이다. 다섯째 행이 그 1.38을 통제 후 잔차끼리의 기울기로 다시 만든다 — 분자 5.1과 분모 3.7은 여섯 개의 통제 후 잔차만으로 계산된 수이고, 전체 회귀의 3×3 역행렬은 어디에도 쓰이지 않았다. 마지막 행은 y~를 씻지 않아도 계수는 같다는 (17) 아래의 주석을 숫자로 보인 것이다 — 잔차제곱합이 0.27에서 72.97로 뛴다. 분할은 질문에 따라 고른다. FWL 행에서는 X1=x1, X2=[1x2]로 나눴고, 도입의 (1)열을 다룰 때는 X1=[1x1], X2=x2로 나눈다 — 정리는 어느 분할에나 성립한다.
행렬식 296이 0이 아니라는 것이 A1이다. 세 열이 선형독립이므로 X′X가 뒤집히고 β^가 하나로 정해진다. 잔차 행의 ∑iei=0은 X′e=0의 첫 성분 — 상수항 열과의 내적 — 이고, 나머지 두 성분 x1′e=0, x2′e=0도 같은 분수로 확인된다. 피타고라스 행의 79.7297+0.2703=80은 Figure 2의 직각을 여섯 달 자료에서 다시 그린 것이다. P 행의 대각 원소는 4절 Q1에서 레버리지로 읽는다.
2절 표가 답이다. 덧붙일 것은 행렬을 사상으로 읽는 네 칸이다 — 정의역 Rn, 공역 Rn, 치역 C(X)(k차원), 핵 C(X)⊥(n−k차원). M은 치역과 핵이 뒤바뀐다. 원소로 읽으면 y^i=∑jPijyj다 — Pij는 관측 j가 적합값 i에 기여하는 가중치다. 상수항이 있으면 P1=1이므로 각 행의 합이 1이고, 적합값은 관측값들의 가중평균이다. 가중치는 음수일 수도 있다. 대각 원소 Pii는 관측 i가 자기 적합값에 미치는 힘(레버리지, leverage)이고 ∑iPii=trP=k다. 수치 예에서 관측 4의 59/74가 가장 크다 — 그 달의 (x1,x2)=(0,−1)이 여섯 점이 만드는 직선 관계에서 가장 멀리 벗어나 있다. 레버리지가 1에 가까우면 그 관측의 적합값은 그 관측 자신이다 — 회귀가 그 점을 따라간 것이다.
(1): “P는 어떤 벡터에서 X의 열들로 설명되는 부분만 남기고 나머지를 버리는 기계이고, M은 그 나머지만 남기는 기계다.” (2): “다른 변수를 통제한 계수란, 결과와 관심 변수 양쪽에서 통제 변수가 설명하는 부분을 먼저 씻어 내고 남은 것끼리 회귀한 기울기다.”
등가 재작성. β^1=(X~1′X~1)−1X~1′y — 값은 같고 드러나는 구조가 다르다. "y는 씻지 않아도 계수는 같다"가 이 형태에서 보인다. 계수를 만드는 것은 X~1이고 y~는 잔차를 맞추기 위해 있다. 또 하나의 등가 재작성은 β^1=(X1′M2X1)−1X1′M2y다 — 물결 없이 원자료와 M2만으로 적은 형태다. 세 형태가 같은 수를 준다는 것이 (16)의 내용이다.
덩어리 짓기. (X′X)−1X′ 전체가 “y를 계수로 바꾸는 사상” 하나다 — k×n 행렬이고, y에 이 하나를 곱하면 β^가 나온다. M2 전체가 “통제” 하나다 — n×n 행렬이고, 어느 벡터에 곱하든 X2로 설명되는 부분을 지운다. 두 덩어리로 (2)를 다시 읽으면 "통제한 뒤 계수로 바꾼다"는 두 단어가 된다.
[X′X]jl=[xj][xl]이고 [(X′X)−1]jl=[xj]−1[xl]−1이다. 그러므로 Pim=∑j,lxij[(X′X)−1]jlxml의 단위는 [xj][xj]−1[xl]−1[xl], 곧 무차원이다. M=I−P도 무차원이고, M2가 무차원이므로 [X~1]=[X1]이다 — 잔차화는 단위를 바꾸지 않는다. 계수는 [β^j]=[y]/[xj]다. W02의 탄력성 (2)가 무차원이었던 것과 대조된다 — 회귀계수는 탄력성이 아니라 단위를 가진 기울기이고, y를 %에서 소수로 바꾸면 계수는 100분의 1이 된다. 수치 예에서 x1을 소수로 바꾸면(100으로 나누면) β^1은 51/37에서 5100/37이 되지만 적합값 y^와 잔차 e는 그대로다.
무차원군은 P 자체다. 더 강한 진술이 있다. 가역인 A∈Rk×k에 대해 PXA=XA(A′X′XA)−1A′X′=XAA−1(X′X)−1(A′)−1A′X′=PX다 — P는 X가 아니라 열공간 C(X)에만 의존한다. 경제적 뜻은 이렇다. 설명변수 쪽의 수익률(시장·규모 요인)을 %에서 소수로 바꾸거나, 통제변수를 서로 더하고 빼서 다시 정의하거나, 규모 요인 대신 "규모 요인 더하기 시장 요인"을 넣어도 적합값과 잔차는 한 자리도 안 바뀐다. 계수만 단위를 따라 움직인다. y의 단위를 바꾸면 y^·e는 같은 배율로 따라 움직이되 P는 그대로다. 잔차제곱합을 총제곱합으로 나눈 비도 무차원이다 — 다만 평균을 뺀 분해(총제곱합 = 설명제곱합 + 잔차제곱합)는 교차항 −2yˉ∑iei가 0이어야 성립하므로 1∈C(X)이면 보장되고 상수항이 없으면 보장되지 않는다. 그때 남는 것은 (12)의 비중심 분해다.
이 회차의 파라미터는 형상이다 — n, k, X1과 X2의 관계. 각각을 극단으로 보낸다.
k=n. X는 정방 가역이고 P=XX−1(X′)−1X′=I, M=0이다. 잔차가 0이고 적합이 완전하다. 자료가 무엇이든 설명되므로 아무것도 설명하지 않는 세계다. Figure 3가 k를 0에서 n=30까지 올리며 이것을 보인다. 30개월의 수익률을 요인 30개에 회귀해 잔차 0을 얻었다면 그것은 설명이 아니라 좌표 변환이다 — y를 다른 기저로 다시 적은 것뿐이다.
Figure 3:n=30인 임의의 y를 무작위 열 k개에 회귀한 잔차제곱합. 열을 더할 때마다 줄기만 하고(C(Xk)⊂C(Xk+1)) k=n에서 0이 된다.
X=1만. P=n111′이고 적합값은 모든 관측에서 평균 yˉ다. 설명변수가 하나도 없어 자료를 요약하는 수가 평균 하나뿐인, 회귀가 없는 세계다.
X1′X2=0(직교 설계). P2X1=0이므로 M2X1=X1이고 β^1=(X1′X1)−1X1′y다. 통제변수를 넣든 빼든 계수가 같다 — 처치가 통제변수와 균형 잡힌 실험의 세계다. 이 극단과 일반 경우를 잇는 항등식이 있다.
근거 — y=X1β^1+X2β^2+e이고 X1′e=0((12)). 양변에 (X1′X1)−1X1′을 곱한다. Γ^는 X2의 각 열을 X1에 회귀한 계수(k1×k2)다. 순수 대수 항등식이며 확률 진술이 아니다.
직교 설계에서는 Γ^=0이고 b^1=β^1이다. 그 반대편 극단이 C(X1)⊂C(X2)(완전 공선성)이다. X~1=0이고 β^1은 정의되지 않는다 — "통제하고 남는 변동"이 없으니 질문 자체가 자료에 없다. 그 근방에서는 분모가 작다. k1=1이면 y의 교란 Δy가 계수를 x~1′Δy/∥x~1∥2만큼 — 크기로는 ∥Δy∥/∥x~1∥까지 — 흔든다.
n→∞, k 고정. trP/n=k/n→0이다. 평균 레버리지가 사라진다 — 평균적으로 한 관측이 적합값을 좌우하지 못하는 세계다. 평균이 사라져도 외딴 관측의 레버리지까지 사라지는 것은 아니다. 수치 예에서는 k/n=1/2이라 평균적으로 관측 하나가 자기 적합값의 절반을 스스로 만든다. 여섯 달로 세 계수를 구하는 회귀는 자료를 설명하는 쪽보다 자료를 따라가는 쪽에 가깝다.
균등해지는 두 양은 X′y^와 X′y다 — 적합값은 모든 설명변수와의 교차모멘트를 원자료와 정확히 같게 맞춘다. 같은 말로, 잔차는 모든 열과 내적이 0이다(X′e=0). 상수항이 있으면 잔차의 합이 0이고 각 열과의 표본공분산이 0이다. FWL에서는 X~1′(y~−X~1β^1)=0 — 통제 후 잔차끼리도 같은 직각이 선다. W04의 1계 조건이 한계효용과 가격에 승수를 곱한 것을 균등하게 만들었다면, 여기의 1계 조건은 잔차에 남은 것 가운데 X로 읽을 수 있는 부분이 하나도 없게 만든다.
상충은 이렇다. 열을 하나 더 넣으면 열공간이 커지므로 ∥My∥2는 줄기만 한다 — C(X2)⊂C(X)이므로 ∥My∥2≤∥M2y∥2이다. 대신 자유도 n−k가 하나 준다. 설명을 얻고 남는 방향을 잃는다.
표의 (1)열에서 (2)열로 가는 이동량은 (19)의 Γ^β^2다. 통제변수가 관심변수와 상관되고(Γ^=0) 동시에y를 설명할 때(β^2=0)만 계수가 움직이며, 이동량은 둘의 곱이다. 수치 예에서 X1=[1x1], X2=x2로 나누면 Γ^의 x1 성분은 9/14=0.6429, β^2=7/37=0.1892, 곱 0.1216=1.5000−1.3784다. 둘 중 하나가 0이면 통제는 계수를 건드리지 못한다. 부호가 뒤집히는 것은 Γ^β^2가 β^1과 반대 부호이고 절댓값이 더 클 때이며, 그 조건은 회귀표의 (2)열과 보조회귀 Γ^ 하나로 읽힌다.
Figure 4:합성 자료 n=60. 왼쪽은 y를 x1에 그대로 회귀한 것으로 기울기가 약 2.62다. 오른쪽은 y~=M2y를 x~1=M2x1에 회귀한 것으로 기울기가 약 1.10이며, 이 값은 [1x1x2] 전체 회귀의 β^1과 같다.
Figure 4의 왼쪽 기울기 약 2.62는 x1 자신의 효과에 "x1과 함께 움직이는 x2의 효과"가 얹힌 것이다. 오른쪽은 양쪽에서 x2를 씻어 낸 뒤의 산점이고, 그 기울기 약 1.10이 통제된 계수다. 오른쪽 그림이 원점을 지나는 것은 x~1과 y~가 모두 1에 수직이기 때문이다.
멈추는 줄은 실증 논문의 회귀표 각주다. “기업·연도 고정효과 포함”, “규모·장부가/시가 통제”, “부록 그림은 added-variable plot”. 학부 읽기는 (X′X)−1X′y를 열마다 다시 계산한 것으로 알지만, 세 문장이 모두 하나의 연산 M2를 가리킨다는 것을 보지 못한다. 고정효과 더미 500개를 넣는 것과 각 기업의 평균을 빼는 것(within 변환)이 같은 계수를 주는 이유가 정확히 (2)다 — X2가 더미 행렬이면 M2는 그룹 내 편차를 취하는 사상이다. Frisch & Waugh (1933)은 추세를 먼저 제거하고 회귀하는 것과 추세를 변수로 넣는 것이 같음을 보였고, Lovell (1963)은 계절 더미에 회귀해 조정한 자료를 쓰는 것과 더미를 변수로 넣는 것이 같음을 보였다 — 조정 연산자가 대칭·멱등인 사영일 때의 이야기이고, 공식 통계의 계절조정 절차는 대개 그런 연산자가 아니다. 논문 각주의 "통제했다"는 90년 된 정리 하나다.
대학원 읽기가 더 보는 것은 계수를 만드는 변동이다. k1=1이면 β^1=∑iwiy~i, wi=x~i1/∑jx~j12다 — 관심 변수 가운데 통제변수가 설명하지 못한 변동만이 계수를 만든다. 통제변수로 잘 설명되는 관측은 x~i1이 0에 가까워 가중치도 0에 가깝다. "어느 관측이 이 계수를 만드는가"라는 질문이 X~1 하나로 답해진다. Angrist & Pischke (2009)가 회귀 해부(regression anatomy)라 부르는 공식이 이것이다. 부록의 added-variable plot(Figure 4 오른쪽)은 장식이 아니라 다변량 계수의 정확한 2차원 그림이다.
구체 장면 하나. 요인회귀 표의 (1)열 1.50, (2)열 1.38. 학부 읽기는 "SMB를 넣으니 시장 계수가 줄었다"에서 끝난다. 대학원 읽기는 세 수를 본다. 시장 초과수익률 1단위당 규모 요인이 9/14만큼 함께 움직이고(Γ^의 x1 성분), 규모 요인 1단위가 수익률을 7/37만큼 설명하므로(β^2), 그 곱 0.12가 (1)열의 기울기에 얹혀 있었다. 두 열의 잔차도 다르다 — 잔차제곱합 1/3과 10/37. (1)열은 규모 요인이 설명할 몫을 시장 계수와 잔차에 나누어 떠넘긴 회귀다. 그리고 그 1.38을 만든 달은 따로 있다. 가중치 wi=x~i1/3.7은 (0.149,−0.297,0.054,0.338,−0.203,−0.041)이고, β^1=∑iwiy~i에서 넷째 달이 0.59, 둘째 달이 0.39를 낸다 — 두 달이 계수의 7할이다. 넷째 달은 시장이 0인데 규모 요인이 −1이었던 달, 둘째 달은 시장이 −1인데 규모 요인이 0이었던 달이다. 시장과 규모 요인이 같은 비율로 함께 움직인 달들(셋째·여섯째)은 통제 후 잔차가 0.2와 −0.15로 작아 계수에 거의 기여하지 못한다. 통제된 계수는 두 변수가 따로 움직인 달들이 만든다 — 이것이 "통제"의 대가이며, 회귀표는 이것을 적지 않는다.
목적함수 ∥y−Xb∥2의 전개 줄 옆에 "(Xb)′=b′X′, 스칼라 전치"가, 기울기 줄 옆에 "∇b(b′Ab)=2Ab(A 대칭)"가 적혀 있는가.
(X′X)−1이 존재한다는 줄 옆에 "열 선형독립 ⇒ b′X′Xb=∥Xb∥2>0 (A1)"이 적혀 있는가.
P′=P 줄 옆에 "전치는 곱의 순서를 뒤집는다 · (A−1)′=(A′)−1 · X′X 대칭"이 적혀 있는가.
P2=P 줄 옆에 "(X′X)−1X′X=Ik"가 적혀 있고, 그로부터 MX=0, PM=0이 도출되어 있는가.
“멱등·대칭 ⇔ 직교사영” 줄에서 두 방향의 근거가 따로 적혀 있는가 — ⇒ 옆에 “S의 원소는 자기 자신으로 사영된다, 잔차는 S에 수직”; ⇐ 옆에 “s=Pw에 대해 s′(v−Pv)=w′(P−P2)v=0”.
분할 정규방정식에서 β^2를 소거하는 줄 옆에 "X2′X2 가역(A1의 부분)"이 적혀 있고, 대입 뒤 I−P2=M2로 묶는 줄이 있는가.
X1′M2X1이 가역이라는 줄 옆에 "M2 대칭·멱등 ⇒ X~1′X~1; X~1b=0⇒X1b∈C(X2)⇒b=0 (A1)"이 적혀 있는가.
번역 문장이 있는가 — (a)와 (b) 각각 한 문장.
냉시동 인출(40분) — 1주 전 · 3주 전 · 8주 전 각 1항목.
1주 전 · W06 · 1계 조건 전미분 → 비교정학 부호 — 1계 조건계를 파라미터로 전미분해 해의 이동 방향을 야코비안의 부호에서 읽는다.
3주 전 · W04 · λ=∂v/∂w 유도 + 상보여유 번역 — 하한과 상한의 샌드위치로 승수가 가치함수의 소득 도함수임을 보이고, 상보여유를 한 문장으로 옮긴다.
8주 전 · 없음
노트북(40분) — w07-lab.ipynb. 코드를 쓰기 전에 아래 셋에 답한다.
3절의 6개월 표에서 상수만 넣은 단순회귀 기울기 b^1과 x2까지 통제한 β^1 가운데 어느 쪽이 큰가. 그 차이의 부호는 Γ^β^2의 부호와 같은가. 답의 근거는 (19)와 x1·x2가 같은 방향으로 움직인다는 표의 관찰이다. 예측: b^1>β^1 — 1.500 대 1.378, 차이 0.122이고 Γ^β^2>0과 같은 부호다.
P를 자기 자신에 10번 곱하면 원소가 바뀌는가. trP와 고유값은 무엇인가. 답의 근거는 (11)과 "사영의 고유값은 1 아니면 0"이라는 멱등성의 귀결이다. 예측: 한 원소도 바뀌지 않고, trP=3, 고유값은 1 셋과 0 셋이다.
y~ 대신 원자료 y를 X~1에 회귀하면 계수와 잔차제곱합은 각각 어떻게 되는가. 답의 근거는 (17) 아래의 주석이다 — 무엇이 같고 무엇이 P2y만큼 다른지. 예측: 계수는 51/37 그대로이고 잔차제곱합은 ∥P2y∥2만큼 커져 0.27에서 72.97이 된다.
계산은 직접 쌓는다. np.column_stack으로 X를 만들고 X′X, X′y를 @로 계산한 뒤 정규방정식을 np.linalg.solve로 푼다 — lstsq와 회귀 패키지는 쓰지 않는다. P를 명시적으로 만들어 P@P-P, P.T-P, np.trace(P), np.linalg.eigvalsh(P)를 본다. M2를 만들어 x~1, y~를 계산하고 (2)의 분자·분모를 스칼라로 찍는다. Figure 4의 합성 자료(seed 7)로 added-variable plot을 재현한다. 여유가 있으면 Figure 3의 k→n 실험을 반복한다. 대조 표는 예측 · 결과 · 어긋남 · 원인 4열이다.
지금은 이렇게 읽힌다. P는 n×n 무차원 행렬이자 Rn을 k차원 열공간 위로 떨어뜨리는 사상이고, 핵은 그 열공간에 수직인 n−k차원 조각이다. 열의 단위를 바꿔도, 열들을 서로 섞어 다시 정의해도 변하지 않는다. Rn을 열공간 안으로 보내면서 잔차를 모든 설명변수에 수직으로 만드는 유일한 선형사상이고, 그 수직이 최소거리의 다른 이름이다. M2를 곱하는 것이 "통제"의 전부이고, 계수는 통제되고 남은 변동끼리의 기울기다. 고정효과·계절 더미·추세 제거는 그 M2를 만드는 재료가 다를 뿐이다. 회귀표의 두 열 사이의 이동량은 Γ^β^2 — 통제변수가 관심변수와 함께 움직이는 정도와 통제변수가 결과를 설명하는 정도의 곱이다. 어느 하나가 0이면 열은 움직이지 않고, 그 곱이 β^1과 반대 부호이면서 절댓값이 더 클 때 부호가 뒤집힌다. 도입의 세 질문 — 왜 움직였는가, 얼마나, 무엇을 했는가 — 의 답이 각각 Γ^=0과 β^2=0, Γ^β^2=0.12, y와 X1 양쪽에 곱한 M2이며, 세 답이 나온 사상은 곱셈이 가능한 숫자표가 아니라 Rn을 두 수직인 조각으로 가르는 기계다.
이어지는 자료 — 3Blue1Brown Essence of Linear Algebra · Boyd & Vandenberghe, VMLS · Davidson & MacKinnon, Econometric Theory and Methods 2장 · Frisch & Waugh (1933), Econometrica
Hubbard, J. H., & Hubbard, B. B. (2015). Vector Calculus, Linear Algebra, and Differential Forms: A Unified Approach (5th ed.). Matrix Editions.
Davidson, R., & MacKinnon, J. G. (2004). Econometric Theory and Methods. Oxford University Press.
Boyd, S., & Vandenberghe, L. (2018). Introduction to Applied Linear Algebra: Vectors, Matrices, and Least Squares. Cambridge University Press.
Strang, G. (2016). Introduction to Linear Algebra (5th ed.). Wellesley-Cambridge Press.
Frisch, R., & Waugh, F. V. (1933). Partial Time Regressions as Compared with Individual Trends. Econometrica, 1(4), 387–401. 10.2307/1907330
Lovell, M. C. (1963). Seasonal Adjustment of Economic Time Series and Multiple Regression Analysis. Journal of the American Statistical Association, 58(304), 993–1010. 10.1080/01621459.1963.10480682
Angrist, J. D., & Pischke, J.-S. (2009). Mostly Harmless Econometrics: An Empiricist’s Companion. Princeton University Press.