한 팀이 고객 유지율이 낮아진 이유를 찾고 있다. 분석가는 가입월별 코호트를 제안하고, 개발자는 안내 화면을 실험하자고 한다. 사업 담당자는 신규 유입과 해지를 연결한 성장 모형을 가져왔다. 세 사람이 서로 다른 말을 하지만 모두 필요한 질문을 다룰 수 있다. 코호트는 변화가 어느 집단에서 나타났는지, 실험은 개입이 무엇을 바꾸는지, 누적·환류 모형은 변화가 전체 기반에 어떻게 쌓이는지 살핀다.
이 장은 세 방법의 개념과 문헌상의 기준점을 설명한다. 어느 방법이 다른 두 방법의 상위 단계라는 순위를 만들지 않는다. 교육용 H06의 관찰표·실험 비교·누적 모형은 서로 독립된 자료다. 학습 후에는 하나의 제품 문제에 세 가지 질문을 배치한 분석 계획을 작성한다.
시간에 관한 서로 다른 질문
코호트는 같은 시작 사건이나 공통 조건으로 묶은 집단이다. 가입월 코호트는 가입 시점이 비슷한 사람을, 계약 시작 코호트는 계약을 비슷한 시기에 시작한 조직을 묶는다. 이후 경과 시간을 맞추어 결과를 보면 신규 고객과 오래된 고객을 같은 상태처럼 비교하는 일을 줄일 수 있다. 코호트를 만들었다는 사실만으로 집단 간 차이의 원인이 식별되지는 않는다.
실험은 정한 개입을 적용한 조건과 비교 조건의 결과를 대조하도록 설계한다. 무작위 배정은 개입 여부가 기존 특성에 의해 선택되는 문제를 줄이기 위한 장치다. 배정 단위·노출·결과·관찰 기간을 정의하고, 배정 이후 이탈이나 집단 간 간섭을 확인해야 한다. 이름을 A/B로 붙이는 것보다 비교가 성립하는 조건이 중요하다.
저량·유량 모형은 시점의 누적 상태와 기간 중 들어오고 나가는 변화를 연결한다. 환류는 어떤 결과가 이후 행동과 입력에 다시 영향을 주는 구조다. 여기에 지연이 있으면 원인 후보가 발생한 시점과 관찰 지표가 움직이는 시점이 달라질 수 있다. 모형은 이런 가정이 함께 작동할 때 어떤 경로가 나오는지 검토한다.

세 전통의 문헌상 기준점
Kaplan과 Meier의 1958년 논문은 불완전 관찰에서의 추정을 다룬 통계 연구 기록이다. Ryder의 1965년 논문은 사회 변화 연구에서 코호트 개념을 다룬 기록이다. 이 두 서지만으로 생명표나 코호트의 모든 역사적 출발을 지정할 수 없다. 이 책은 ‘누가 처음 만들었는가’보다 당시 어떤 분석 문제를 명시했는지에 범위를 둔다. Kaplan–Meier 서지 · Ryder 서지 · S36 · S37.
Fisher의 1935년 『The Design of Experiments』는 실험설계의 역사적 원전 가운데 하나다. 이번 교재에서 확인한 범위는 서지·목차이며 모든 대조 실험을 Fisher의 발명으로 귀속하지 않는다. 방법의 설명에는 무작위 블록 설계의 공개 공식 문서를 사용하고, 온라인 적용에는 Microsoft 연구진의 2009년 논문 초록을 연결한다. Fisher 서지 · Microsoft 연구 · S31 · S13.
Forrester의 『Industrial Dynamics』는 1961년 출판 기록을 확인할 수 있다. MIT의 연구자 교육 자료는 시스템 다이내믹스의 모형·환류·시간적 행동을 학습하는 문헌을 안내한다. 따라서 환류를 1990년대나 최근 성장 루프 글에서 처음 생긴 원리처럼 설명할 수는 없다. 이 선행 기록이 특정 실무 저자의 직접 차용을 입증하는 것은 아니다. MIT의 출판 기록 설명 · Sterman의 교육 안내 · S70.
| 문헌 기록 | 그 기록을 사용하는 범위 | 이 장에서 하지 않는 주장 |
|---|---|---|
| Fisher, 1935 | 실험설계 원전의 존재 | 모든 비교 실험의 단독 발명 |
| Kaplan–Meier, 1958 | 불완전 관찰 추정 연구 | 모든 복귀율이 같은 추정량이라는 주장 |
| Forrester, 1961 | 산업의 동적 모형에 관한 선행 문헌 | 현대 Growth Loops의 직접 인용 관계 |
| Ryder, 1965 | 사회 변화와 코호트의 연구 | 코호트 개념의 최초 탄생 |
| Microsoft 연구진, 2009 | 온라인 실험의 기술·조직적 적용 | 웹 A/B 명칭의 최초 사용 |
경과 시간을 맞추어 비교하기
H06-C는 가입 코호트별 고정 구간 복귀의 교육용 집계다. 각 코호트의 가입자는 100명이다. 오래된 코호트는 D7·D14·D28 관찰이 모두 끝났고 복귀자는 40·30·20명이다. 최근 코호트는 D7·D14만 끝났고 복귀자는 50·35명이며 D28은 아직 관찰할 수 없다. 여기서 D7 등은 각 장의 실제 서비스 정의를 대신하는 이름이 아니라, 미리 정한 서로 다른 복귀 구간의 표제다.
같은 경과 구간에서 비교할 수 있는가
D7: 50% − 40% = 10%p
고정된 서로 다른 복귀 구간이다. 행을 연속 생존 곡선으로 연결하지 않는다. 코호트 간 차이는 개입의 효과를 뜻하지 않는다.
원본 정적 그림 보기

D14에서는 오래된 코호트 30%, 최근 코호트 35%를 비교할 수 있다. D28에서는 최근 코호트의 결과가 없으므로 20%와 0%의 비교를 만들 수 없다. D7·D14·D28의 복귀자는 동일 인물의 연속 생존 집합으로 정의하지 않았으며, D7에 돌아오지 않은 사람이 D14에 돌아올 수도 있다.
경과 시간을 맞춘 후에도 모집 채널·계절·요금제·이용 목적이 다를 수 있다. 최근 고객에게 새 안내를 적용했다는 사실만으로 5%포인트 차이를 안내의 효과로 확정할 수 없다. 코호트 표는 차이가 나타난 위치와 다음 질문을 좁혀 준다. 개입 효과를 판단하려면 비교 설계를 추가해야 한다.
생존과 반복 복귀는 다른 결과 변수다
생존분석은 정의한 사건까지 걸린 시간을 다룬다. 계약 종료를 사건으로 정했다면 아직 종료를 관찰하지 못한 고객은 관찰 끝 시점까지의 정보를 제공한다. 연구가 끝나거나 고객을 더 이상 추적하지 못해 사건 시각을 모르는 경우를 검열로 다룰 수 있다. 사건 발생과 관찰 종료를 같은 실패 값으로 바꾸지 않는 이유다.
Kaplan–Meier 방식은 사건 시점별 위험집합, 즉 그 직전까지 사건 없이 관찰 중인 대상을 바탕으로 조건부 생존을 연결한다. 검열의 정보가 부족한 상황을 마법처럼 해결하는 방법은 아니다. 관찰이 끝나는 과정과 사건 발생 가능성의 관계에 관한 가정이 필요하다. 실제 계산과 위험집합은 16장과 NIST 설명을 참조한다. S38.
계약 종료는 정의에 따라 최초 사건으로 다룰 수 있지만, 앱 방문은 여러 번 중단하고 재개될 수 있다. D7 미방문을 ‘사망’처럼 영구 종료로 처리하면 D14 복귀를 설명하지 못한다. 반대로 계약 해지 뒤 새로운 계약을 시작한 상황에서는 새 관계로 볼지 재활성으로 볼지 먼저 정해야 한다. 용어의 유사성보다 결과 변수와 상태 전이의 정의가 우선한다.
고객 유지 연구가 생존분석을 명시적으로 이용한 문헌은 S35에서 확인한다. 이것은 구체적인 방법 연결(M)을 보여준다. 현재 제품 분석 도구의 모든 리텐션 정의가 그 연구에서 직접 계승되었다는 역사적 영향(H)을 뜻하지 않는다.
비교 가능한 개입을 만드는 실험설계
무작위 배정, 실험의 반복, 블록화는 서로 다른 역할을 한다. 무작위 배정은 처치의 배정 과정을 설계한다. 실험의 반복(replication)은 같은 처치 조건을 여러 실험 단위에 적용하여 단위 사이의 변동을 평가할 자료를 확보하는 일이다. 같은 계정에서 로그를 여러 번 읽거나 같은 대상을 반복 측정하는 일과 구별한다. 반복 측정값을 독립 계정이 늘어난 것처럼 세어서는 안 된다. 블록화는 중요한 조건이 비슷한 대상을 묶은 뒤 각 묶음 안에서 처치를 비교하도록 설계하는 방식이다. 예를 들어 초보·숙련 사용자가 과업 결과에 큰 영향을 준다면 이 조건을 설계에 반영할 수 있다.
NIST의 무작위 블록 설계 설명은 관심 요인과 방해 요인을 나누고 블록 안에서 비교하는 원리를 다룬다. 이 장은 제조 예제의 수치를 제품에 옮기지 않고 설계 원리만 참고한다. NIST의 완전 무작위 설계 · 블록 설계 · S69. 사후에 결과가 잘 나온 고객만 골라 비교하는 것은 이런 사전 배정과 다르다.
독립 자료 H06-E에서는 정한 자격의 계정 800개를 두 조건에 400개씩 무작위 배정하고, 배정 후 7일 동안 같은 과업의 성공을 관찰했다고 가정한다. 비교 조건은 120개, 새 안내 조건은 144개가 성공했다. 배정 계정 기준 성공률은 30%와 36%, 차이는 6%포인트다. 실제 실험을 수행한 결과가 아닌 계산 예다.
이 표만으로 출시 결정을 마칠 수는 없다. 표본 변동, 누락, 실제 노출, 오류·불만·장기 결과를 검토해야 한다. 같은 사람에게 속한 여러 계정을 독립 대상으로 배정하면 조건이 섞일 수 있다. 추천이나 협업처럼 다른 사람의 처치가 내 결과에 영향을 미치면 간섭도 고려해야 한다. 18장은 이 조건과 불확실성을 실제 계획서로 확장한다.
저량·유량·환류를 성장 모형으로 옮기기
H06-S는 주간 고객기반의 기대 경로를 보는 독립 모형이다. 시작 고객기반은 1,000, 매주 기존 고객의 80%가 다음 주에도 남고 외부에서 100명이 들어온다고 가정한다. 복귀·중복·합병 등 다른 변화는 없다. 추천이 없다면 다음 주 기반 = 0.8 × 현재 기반 + 100이고 1~4주 말의 값은 900·820·756·704.8이다. 소수는 실제 사람을 나눈 값이 아니라 기대 규모다.
이제 기존 기반 한 명당 다음 주 신규 고객 0.15명이 추천으로 추가된다고 가정한다. 외부 유입과 겹치지 않는 순신규이며 유지·추천 모두 직전 주 기반을 사용한다. 이 경우 다음 주 기반 = (0.8+0.15) × 현재 기반 + 100이다. 1~4주 말의 기대 기반은 1,050·1,097.5·1,142.625·1,185.49375다.
매주 같은 가정도 누적 경로를 바꾼다.
시작 고객기반 1,000에서 유지·추천·외부 유입을 바꾼다. 추천이 없는 경우를 같은 축에서 비교한다.
교재의 4주 값을 확인한 뒤 관찰 길이를 늘려 보자. 유지와 추천의 합이 1보다 작을 때와 클 때 경로는 어떻게 달라지는가?
고정한 조건H06-S의 독립 모형. 직전 주 기반에서 유지와 추천을 각각 계산한다. 중복 유입·복귀·포화는 없다.
기대 고객기반 · 실선: 선택한 추천 가정 / 점선: 추천 0 · 나머지 입력은 동일. 세로축은 두 경로의 범위에 맞춰 조정된다.
1,142.63 × (0.8 + 0.15) + 100 = 1,185.49
유지 914.1 + 추천 171.39 + 외부 유입 100소수는 기대 규모다. 반올림 전 값으로 다음 주를 계산한다. 외부 유입과 추천은 순신규이며 겹치지 않는다. 포화·지원 부담·복귀는 모형에 없고 H06-E의 과업 성공 차이를 유지율에 넣지 않는다.
원본 정적 그림 보기

추천이 있다고 무한한 폭발 성장이 생기지는 않는다. 이 단순 모형에서 유지와 추천의 합은 0.95다. 다른 조건이 영구히 같으면 S=0.95S+100을 만족하는 2,000에 접근한다. 추천이 없는 모형의 같은 조건부 균형은 500이다. 이는 검증된 예측값이 아니라 입력 가정의 산술적 결과다.
현실에서는 고객기반이 커질수록 추천 대상이 겹치고, 지원 부담이 늘어 유지가 낮아질 수도 있다. 긍정적 환류는 증가가 다음 증가를 돕는 구조이고, 억제하는 환류는 그 증가를 제한하는 구조다. 두 구조의 작동 속도와 지연이 다르면 단기 상승 뒤에 문제가 드러날 수 있다. 이 장의 선형 수식에는 그 제한을 넣지 않았으므로 장기 사업 전망으로 사용하지 않는다.

세 방법을 하나의 조사 계획에 배치하기
먼저 코호트·집단·정의를 대조하여 변화가 어디서 보이는지 확인한다. 다음에는 개선 후보 중 비교 가능한 개입을 설계한다. 효과와 비용에 관한 근거가 생기면 고객기반의 누적 모형에 범위와 불확실성을 반영한다. 순서는 업무에 따라 오갈 수 있지만, 각 결과가 다른 종류의 근거라는 구분은 유지한다.
| 업무 문서 | 필요한 질문 | 다른 문서에서 받아야 할 정보 |
|---|---|---|
| 관찰표 | 어떤 집단·경과 시간에 차이가 있는가 | 정의·수집·관찰 종료 |
| 실험 계획 | 어떤 변경을 누구에게 비교할 것인가 | 문제 후보·배정·결과·가드레일 |
| 누적 모형 | 그 변화가 비용과 기반에 어떻게 쌓이는가 | 효과 범위·유지·지연·중복·포화 |
실험의 6%포인트를 고객기반의 주간 유지율에 바로 더하는 것은 잘못이다. H06-E는 7일 과업 성공이고 H06-S는 주간 유지이며 자료도 독립이다. 서로 다른 결과를 연결하려면 과업 성공이 유지에 어떤 관계를 갖는지 추가 근거가 필요하다. 같은 퍼센트라는 형식 때문에 결과 변수를 바꾸지 않는다.
모형을 운영할 때는 입력의 출처를 관찰값·효과 추정·가정으로 표시한다. 현황 설명에는 관찰값을, 정책 비교에는 효과의 범위를, 알려지지 않은 미래에는 시나리오를 사용한다. 다음 관찰에서 경로가 달라지면 오차가 발생한 입력과 누락한 구조를 점검한다.
연습문제
- 코호트·실험·저량/유량 모형이 각각 답하는 질문을 쓰라.
- 문헌의 출판 연도와 방법의 최초 발명 연도를 구분해야 하는 이유를 설명하라.
- H06-C에서 D14를 비교하고 최근 코호트 D28을 0으로 채울 수 없는 이유를 쓰라.
- 한 주 미방문과 계약 최초 종료가 다른 결과 변수인 이유를 설명하라.
- H06-E의 성공률 차이를 계산하고 출시 판단에 빠진 자료를 적으라.
- 추천이 없는 H06-S의 1~4주 기반과 조건부 균형을 계산하라.
- 추천 계수 0.15인 모형의 1~4주 기반과 균형을 계산하고 예측의 한계를 쓰라.
- 한 제품 문제에 관찰표·실험·누적 모형을 배치하고 서로 전달하면 안 되는 값을 적으라.
근거와 다음 장
초기 생명표의 최초성이나 모든 실험의 발명을 다루는 완전한 학설사는 이 장의 범위가 아니다. 서지 기록·확인한 방법 문서·현대 적용의 문제를 분리했다. H06의 세 자료도 합치지 않는다. 07장은 측정한 결과에 조직이 목표·집중·보상이라는 역할을 부여하는 체계를 비교한다.