Follow the Metrics for PMWEB EDITION / 01

제5부 · 비교와 인과 추론

평균·코호트·세그먼트로 변화의 내용을 확인하기

평균·구성·시간·검열을 나누어 비교가 무엇을 설명하는지 확인한다.

16장교육용 자료 CMP·C·계약 6개연습문제 해설 ↗

개념 먼저 보기: 평균과 분포 · 세그먼트 · 코호트 · RFM · 생존분석

주간회고의 온보딩 개편 뒤 D7 완료율이 35%에서 55%로 올랐다. 보고서를 받은 PM은 개편을 전체 사용자에게 유지할지 결정해야 한다. 그런데 같은 기간 광고 타기팅도 바뀌었다. 이전부터 회고를 하던 사람이 신규 가입자에서 차지하는 비중이 크게 늘었다면, 이번 수치에는 온보딩 경험과 고객 구성의 변화가 함께 들어 있다. 전체 비율만으로 두 변화의 기여를 구분하기는 어렵다.

앞선 단원에서는 지표의 정의와 계산을 정했다. 이 장에서는 정의가 같은 두 숫자를 비교할 때에도 확인해야 하는 조건을 다룬다. 평균과 분포는 결과가 사람들 사이에 어떻게 퍼져 있는지 보여 준다. 세그먼트와 코호트는 어떤 집단과 시간에서 변화가 나타났는지 보여 준다. 이 방법들을 사용하면 개선 원인의 후보를 좁힐 수 있지만, 관찰 자료만으로 제품 변경의 효과가 자동으로 식별되는 것은 아니다.

이 장의 산출물은 비교 조건표와 원인 후보를 포함한 분석 메모다. 구성비 예제는 13장 자료 C를 그대로 다시 사용한다. 소요 시간·월별 코호트·RFM·계약 종료 자료는 각각 독립된 교육용 자료다. 서로 같은 사용자라고 연결하거나 업계의 적정 수준으로 사용하지 않는다.

01

평균과 분포는 무엇을 설명하는가

1.1 평균의 의미와 관찰 단위

산술평균은 관찰값의 합을 관찰 단위 수로 나눈 값이다. 사용자별 과업 소요 시간의 평균이 6분이라면, 측정한 시간을 사용자 수로 나누었을 때 6분이라는 뜻이다. 대부분의 사용자가 6분쯤 걸렸다는 설명까지 포함하지는 않는다. 극단적으로 긴 시간이 일부 존재하면 평균은 그 영향을 받는다.

평균을 계산하기 전에 한 행이 무엇을 나타내는지 정해야 한다. 사용자가 여러 번 시도한 모든 과업을 행으로 만들면 과업을 많이 수행한 사람이 평균에 더 크게 기여한다. 사용자별 평균을 먼저 구한 뒤 그 평균을 다시 평균하면 각 사용자의 가중치는 같아진다. 어느 쪽이 적절한지는 ‘처리한 과업 하나의 비용’을 알고 싶은지, ‘사용자 한 명의 경험’을 알고 싶은지에 달려 있다. 같은 원기록에서도 이 두 값은 달라질 수 있다.

1.2 같은 평균을 가진 두 화면

독립된 사용자 10명씩이 같은 과업을 한 번 완료했다고 가정한다. A와 B의 소요 시간은 다음과 같다. 이 예제는 화면의 인과 효과를 추정한 실험이 아니라 요약 통계의 의미를 비교하는 자료다.

화면 완료자의 소요 시간, 분 평균 중앙값 P90 최댓값
A 4, 4, 5, 5, 5, 5, 6, 6, 10, 10 6 5 10 10
B 2, 2, 3, 3, 3, 3, 4, 4, 6, 30 6 3 6 30

중앙값은 정렬했을 때 가운데 위치한 값이다. 짝수 개 자료에서는 가운데 두 값의 평균을 사용했다. P90은 관찰값의 90% 이상이 그 값 이하가 되는 경계로, 이 장에서는 정렬한 n개 중 올림(0.9 × n)번째 값을 사용한다. 보간법을 사용하는 도구와 결과가 다를 수 있으므로 정의서에 계산 방식을 적는다.

자료의 관계를 읽기

평균 6분 뒤의 서로 다른 분포

CMP · 각 10개 관측 · 가로축 분 · 점은 개별 관측값

05102030AB
A평균 6분
B평균 6분

개별 관측을 동일 인물의 전후 변화로 연결하지 않는다. P90은 오름차순 9번째 값이다. B의 최댓값 30분도 함께 확인한다.

01 / 03

두 집단의 평균은 모두 6분이다.

CMP의 각 집단은 열 관측값이다. 평균만으로는 어느 집단의 보통 경험이 더 빠른지, 오래 걸린 사례가 어디에 있는지 알 수 없다.

CMP · 각 10개 관측 · 가로축 분 · 점은 개별 관측값

05102030AA · 4분A · 4분A · 5분A · 5분A · 5분A · 5분A · 6분A · 6분A · 10분A · 10분BB · 2분B · 2분B · 3분B · 3분B · 3분B · 3분B · 4분B · 4분B · 6분B · 30분
A평균 6분
B평균 6분

개별 관측을 동일 인물의 전후 변화로 연결하지 않는다. P90은 오름차순 9번째 값이다. B의 최댓값 30분도 함께 확인한다.

02 / 03

개별 값을 놓으면 모양이 달라진다.

같은 위치의 점은 위로 쌓았다. B는 2~6분에 아홉 값이 모여 있고 한 값은 30분이다. A의 범위는 4~10분이다.

CMP · 각 10개 관측 · 가로축 분 · 점은 개별 관측값

05102030AA · 4분A · 4분A · 5분A · 5분A · 5분A · 5분A · 6분A · 6분A · 10분A · 10분중앙값 5BB · 2분B · 2분B · 3분B · 3분B · 3분B · 3분B · 4분B · 4분B · 6분B · 30분중앙값 3
A중앙값 5 · P90 10분
B중앙값 3 · P90 6분

개별 관측을 동일 인물의 전후 변화로 연결하지 않는다. P90은 오름차순 9번째 값이다. B의 최댓값 30분도 함께 확인한다.

03 / 03

질문에 맞는 요약을 더한다.

A와 B의 중앙값은 5분과 3분, nearest-rank P90은 10분과 6분이다. B의 30분 사례도 사라지지 않는다. 원인과 과업 성공 여부는 이 자료에 없다.

원본 정적 그림 보기

16-1. 평균 6분이 같은 두 집단의 개별 소요 시간과 중앙값

B의 중앙값과 P90은 A보다 낮지만, B의 한 사람은 30분이 걸렸다. 두 집단은 서로 다른 사람이므로 같은 개인의 시간이 단축되었다는 뜻은 아니다. 평균만 보고 변화가 없다고 쓰면 다수 사용자의 차이를 놓친다. 중앙값만 보고 모두에게 쉬워졌다고 쓰면 긴 지연을 겪은 사용자를 놓친다. PM은 긴 시간의 기록을 오류로 삭제하기 전에 실제 재작업인지, 화면을 켜 둔 휴식인지, 시간 수집 오류인지 확인해야 한다. 분포를 살피는 이유는 유리한 대표값을 고르기 위해서가 아니라 개선할 경험의 위치를 찾기 위해서다.

1.3 완료한 사람의 시간과 전체 과업의 성공

위 표에는 완료한 사람만 있다. 실제 운영에서 실패하거나 중단한 사람이 많아졌다면 완료자 평균이 줄어도 사용자 경험이 좋아졌다고 보기 어렵다. 어려운 사용자들이 완료 표본에서 빠져 평균이 짧아졌을 수 있기 때문이다. 따라서 소요 시간과 함께 시작자 수, 완료자 수, 중단·실패 수를 보고해야 한다.

이때 미완료를 임의로 0분이나 최대 시간으로 대체하지 않는다. 제한 시간 내 성공률과 성공자의 소요 시간을 분리하거나, 첫 완료까지의 시간을 다루는 별도 분석을 설계한다. 분석 대상의 선정 규칙은 결과 자체의 일부다. 이 원리는 광고를 본 사람만 비교하거나 실험 뒤 기능을 쓴 사람만 비교할 때에도 적용된다.

02

세그먼트와 코호트의 차이

세그먼트는 정한 특성에 따라 나눈 집단이다. 가입 당시 기기, 이용 목적, 계약 규모, 유입 경로 등이 분류 기준이 될 수 있다. 코호트는 공통의 시작 사건이나 시기에 따라 묶고 경과 시간을 추적하는 집단이다. 8월 가입 코호트를 가입 당시 기기별 세그먼트로 나누는 것처럼 두 방법은 함께 사용할 수 있다.

구분 정하는 기준 주로 확인하는 문제 먼저 점검할 조건
세그먼트 어떤 속성으로 구분하는가 누구에게 문제가 집중되는가 속성 측정 시점, 누락, 분류의 변경
코호트 어떤 사건부터 시간을 세는가 시작 뒤 결과가 어떻게 변하는가 시작 사건, 경과 시간, 관찰 완료
달력 기간 언제 일어난 사건을 합치는가 이번 달 전체 업무량이 얼마인가 영업일, 계절성, 포함된 코호트 구성

세그먼트는 반드시 전체를 겹침 없이 나누는 것은 아니다. ‘모바일 이용자’와 ‘유료 이용자’는 중복될 수 있다. 집단별 수치를 더해 전체를 만들려면 서로 배타적이고 전체를 빠짐없이 덮는 분류가 필요하다. 속성 누락자를 제외했다면 그 수와 비중도 남긴다. 누락의 증가가 집단 구성의 변화로 보일 수 있다.

개선 효과를 비교할 때는 분류에 사용한 속성이 변경 전에 정해졌는지도 확인한다. ‘개편 후 세 번 이상 작성한 사용자’는 개편 자체의 영향을 받아 집단에 들어왔을 수 있다. 이 집단과 그렇지 않은 집단의 결과 차이를 그대로 개편 효과로 쓰기 어렵다. 반면 가입 전에 기록한 회고 습관은 비교의 출발 조건을 설명하는 데 사용할 수 있다. 이것만으로 모든 차이가 조정되는 것은 아니지만 분류와 결과의 시간 순서는 분명해진다.

03

전체 비율과 집단별 비율이 다른 방향으로 움직일 때

13장의 자료 C는 개편 전후 각각 관찰을 마친 가입자 200명으로 구성된다. D7 완료는 같은 정의를 사용하고, 회고 습관은 가입 당시 응답으로 고정했다.

가입 당시 회고 습관 이전 가입자 이전 완료자 이전 완료율 이후 가입자 이후 완료자 이후 완료율
있음 50 40 80% 150 105 70%
없음 150 30 20% 50 5 10%
전체 200 70 35% 200 110 55%

전체 완료율은 집단별 완료율의 단순 평균이 아니다. 각 집단이 전체에서 차지하는 비중을 가중치로 사용한 가중평균이다. 이전에는 습관이 있던 사람이 25%, 이후에는 75%였다. 완료율이 상대적으로 높은 집단의 비중이 늘어난 결과, 각 집단의 완료율이 10%포인트씩 떨어졌어도 전체는 높아졌다.

이전 전체 = 0.25 × 0.80 + 0.75 × 0.20 = 0.35
이후 전체 = 0.75 × 0.70 + 0.25 × 0.10 = 0.55

집계 수준을 바꿀 때 비교 방향이 뒤집히는 현상을 심프슨 역설이라 부른다. 서로 모순되는 계산이 생겼다는 뜻은 아니다. 전체와 집단별 비교가 서로 다른 가중치를 포함하고 있음을 보여 준다. 실무 보고에서는 전체 비율과 집단별 비율 중 하나를 폐기하기보다 각각이 답하는 질문을 밝혀야 한다.

전체 55%는 실제 이후 가입자 중 완료한 비중이다. 운영 인력이나 서버 사용량을 예상할 때에는 이 집단의 실제 크기와 결과가 필요하다. 반면 같은 성향의 사용자에게 경험이 좋아졌는지 살필 때는 집단 구성과 집단 내부의 변화가 함께 제시되어야 한다. 획득 전략이 적합한 사용자를 더 데려온 것이라면 구성 변화도 의미 있는 성과일 수 있다. 그 성과를 온보딩 변경의 효과와 구분해 평가하는 것이 PM의 업무다.

04

표준화로 비교 조건을 맞추기

4.1 고정된 구성비의 뜻

표준화는 집단별 결과에 공통된 가중치를 적용하여 비교하는 방법이다. 여기서는 이전 구성비 25%와 75%를 기준으로 고정한다. 이후 집단별 완료율을 이 비중으로 가중하면 0.25 × 70% + 0.75 × 10% = 25%다. 이전의 35%와 비교할 때 표준화된 변화는 −10%포인트다.

표준화된 25%는 실제 이후 가입자 200명 중 50명이 완료했다는 관측값이 아니다. 이후의 집단별 완료율을 선택한 기준 구성에 적용한 비교용 값이다. 이 수치를 실제 완료자 수로 보고서에 넣지 않도록 ‘이전 구성 기준 표준화율’처럼 표시한다. 기준을 이후 구성이나 두 기간의 합친 구성으로 바꿀 수도 있지만, 보고 전에 목적에 맞는 기준을 정하고 이력을 남긴다.

자료의 관계를 읽기

전체 변화 사이에 비교용 기준을 놓는다

13장의 C와 같은 집계 예다. 실제 이전 35%와 이후 55% 사이에 산술 비교용 중간값을 둔다.

공통 축 0~100%

이전 전체
35%
비교용 중간값
25%
이후 전체
55%
이전 구성 고정 · 비율 변경−10%p
+
이후 비율 고정 · 구성 변경+30%p
=
관찰된 전체 변화+20%p

중간값 25% = 25%×70% + 75%×10%. 이전 구성에서 이후 비율을 계산했다.

중간값은 비교를 위한 계산이며 실제 가입자의 관측 완료율이 아니다. 분해 순서는 일반적으로 결과를 바꿀 수 있다. 이 자료의 두 집단 하락 폭이 같아 두 경로의 항이 같을 뿐, 인과 기여를 나눈 것은 아니다.

원본 정적 그림 보기

16-2. 전체 변화 20%포인트를 이전 구성 기준의 집단 내부 변화와 구성 변화로 분해

4.2 변화의 산술 분해

위 계산의 중간 값 25%를 사용하면 전체 변화 +20%포인트를 두 단계로 나눌 수 있다. 이전 구성에서 집단별 비율을 바꿨을 때 35%에서 25%로 10%포인트 하락한다. 그다음 이후 구성으로 가중치를 바꾸면 25%에서 55%로 30%포인트 상승한다. 합은 −10 + 30 = +20%포인트다.

이 분해는 어느 값을 먼저 고정하느냐에 따라 일반적으로 달라질 수 있다. 분석자는 기준을 명시해야 하며 ‘온보딩 효과 −10, 광고 효과 +30’처럼 인과적인 이름을 바로 붙여서는 안 된다. 동일한 습관 응답 집단 안에서도 연령, 업무 부담, 유입 동기, 계절이 달라졌을 수 있다. 여기서 확인한 것은 선택한 분류에 따른 산술적 기여다.

4.3 표준화가 곤란한 집단

새로운 국가에 출시하여 이전 기간에는 해당 집단이 없었다면 이전 집단별 결과와 대칭적으로 비교할 수 없다. 표본이 매우 적어 비율이 불안정한 집단도 있다. 이런 경우에는 무리하게 하나의 표준화 수치로 합치지 않고 비교 가능한 범위와 신규 범위를 나눈다. 기준 모집단을 바꾸었다면 변경 전 보고서와 직접 연결할 수 있는지도 설명해야 한다.

PM이 분석 담당자에게 요청할 것은 단순히 “보정해 주세요”가 아니다. 평가하려는 모집단, 고정하고 싶은 특성, 새로 들어온 집단의 처리, 작은 집단의 표시 기준을 함께 정해야 한다. 가중치가 어떤 경영 질문에 대응하는지가 분석 명세에 들어가야 한다.

05

달력 시간과 코호트 경과 시간을 함께 보기

코호트 분석에서는 시작 이후 같은 시간을 비교한다. 다음은 월초에 시작한 가상 계약 코호트 100명씩을 8월 말에 집계한 예다. 열은 각 코호트의 경과 월이며, 값은 최초 집단 중 해당 월말에 계약이 남아 있는 인원이다.

시작 코호트 시작 인원 1개월 말 2개월 말
6월 100 60 50
7월 100 70 아직 관찰하지 않음
8월 100 아직 관찰하지 않음 아직 관찰하지 않음

이 표에서는 ‘1개월 말’을 시작일에서 한 달이 경과한 시점으로 정한다. 6월 1일 시작 코호트는 7월 1일과 8월 1일 결과를, 7월 1일 시작 코호트는 8월 1일 결과를 관찰했다. 8월 말 종료 시점에는 9월 1일 결과가 아직 없다. 월 이름과 경과 월의 차이를 드러내기 위해 이 기준을 명시했다.

자료의 관계를 읽기

달력의 세로줄과 경과 시간의 대각선

각 시작 집단은 100명이다. 빈칸은 아직 관찰하지 못한 값이며 0이 아니다.

관찰 종료: 8월 말 · 9월 칸은 미래의 관찰 대기

시작 집단6월 달력7월 달력8월 달력9월 달력
6월 · 100명100%경과 0개월60%경과 1개월50%경과 2개월관찰 대기경과 3개월
7월 · 100명시작 전100%경과 0개월70%경과 1개월관찰 대기경과 2개월
8월 · 100명시작 전시작 전100%경과 0개월관찰 대기경과 1개월
가입 다음 달의 관찰 완료 집단6월 60% · 7월 70%

9월의 8월 시작 집단 경과 1개월, 7월 집단 경과 2개월은 아직 미래다. 이 달력 표의 시작 전 칸과 구별한다. 시작 월 100%는 기준 집단이며 장기 유지 성과가 아니다.

원본 정적 그림 보기

16-3. 같은 달에 관찰된 결과와 같은 경과 시점의 결과를 구별하는 코호트 표

6월 코호트의 2개월 결과 50%와 7월 코호트의 1개월 결과 70%를 비교하여 유지가 20%포인트 개선되었다고 쓸 수 없다. 같은 경과 시점인 1개월 말의 60%와 70%를 먼저 비교한다. 그 차이도 서로 다른 달에 시작한 집단의 관찰 차이다. 동시에 바뀐 가격 정책이나 휴가철의 영향을 배제하지 못한다.

달력 효과를 보려면 같은 주에 여러 코호트에서 문제가 함께 나타났는지 확인할 수 있다. 특정 주에 오래된 사용자와 신규 사용자가 모두 줄었다면 장애나 휴일 같은 공통 요인이 후보가 된다. 신규 코호트에서만 첫 주 결과가 악화되었다면 획득 구성이나 온보딩이 후보가 된다. 이러한 관찰은 조사 순서를 정하는 데 유용하지만, 달력 시점·경과 시간·시작 코호트는 서로 연결되어 있어 표 하나로 세 효과를 완전히 분리할 수는 없다.

06

남아 있는 사람만 보면 무엇이 빠지는가

선택 편향은 비교에 들어오는 과정이 결과와 관련되어 있어 관찰된 차이가 평가하려는 전체 집단의 차이를 잘 나타내지 못하는 문제다. 생존자 편향은 그중 남아 있거나 성공한 대상만 보게 되는 경우다. 예를 들어 가입 3개월 뒤 현재 활동 중인 사람에게만 만족도를 물으면 이미 떠난 사용자의 경험이 빠진다.

응답자의 만족 점수가 올라도 불만족한 사람이 먼저 떠나 응답 표본에서 사라졌을 가능성이 있다. 이를 확인하려면 설문 대상 자격을 고정하고 발송자·도달자·응답자의 수를 함께 기록한다. 응답률과 응답자 구성이 기간마다 어떻게 달라졌는지 확인하고, 이탈한 사용자의 경험은 별도의 조사로 보완한다. 연락이 닿지 않는 사람들의 의견까지 알아냈다고 해석하지 않는다.

로그 분석도 같은 문제를 가진다. 신기능을 사용한 사람에게만 결과를 집계하면 신기능까지 도달하지 못한 사용자를 제외한다. 수정된 화면 때문에 중단한 사람이 많아졌다면 제외 자체가 개선안의 영향을 받는다. 운영상 사용자의 상세 행동을 기술하는 표는 만들 수 있지만 전체 배정 집단의 성과표와 구분해야 한다. 18장에서는 이 문제를 실험의 배정과 결과 분석에 연결한다.

07

RFM으로 거래 이력을 요약하기

7.1 세 항목이 나타내는 개념

RFM은 고객의 과거 거래를 최근성(Recency), 빈도(Frequency), 구매액(Monetary)으로 요약하는 방법이다. 최근성은 기준일에서 마지막 인정 거래까지 지난 시간, 빈도는 정한 기간에 발생한 인정 거래 수, 구매액은 그 거래 금액의 합이다. 거래를 요약하는 세 축이지 고객의 심리나 미래 가치를 직접 측정하는 세 요소는 아니다. IBM의 RFM 정의

최근성의 원래 값은 작을수록 최근 거래다. 점수로 바꿀 때는 최근 거래에 높은 점수를 주기도 하므로 ‘R이 높다’가 원자료 일수를 뜻하는지 점수를 뜻하는지 구분해야 한다. 빈도 역시 주문 수인지 주문한 날짜 수인지에 따라 달라진다. 하루에 주문을 나누는 행동이 많은 서비스에서는 주문 수만으로 관계의 깊이를 판단하기 어렵다.

7.2 기준일과 거래 범위

가상 상점은 2026년 9월 1일 00시 KST를 기준으로 최근 92일인 [6월 1일, 9월 1일)의 거래를 요약한다. 이 예제는 결제 완료 후 전액 환불되지 않은 주문을 한 건으로 세고, 부분 환불을 차감한 금액을 구매액으로 사용한다. 최근성은 마지막 인정 주문일과 기준일의 달력 날짜 차이다. 아래 값은 정의를 이해하기 위한 고객별 집계 입력이다.

고객 최근성, 일 빈도, 주문 구매액, 원 이번 표에서 확인할 수 있는 내용
A 2 3 150,000 최근에 여러 번 구매
B 1 1 30,000 최근 거래 한 건
C 40 8 400,000 기간 중 구매는 많지만 최근 거래 간격이 김
D 70 1 200,000 단일 고액 주문 후 긴 간격

C는 연락할 후보가 될 수 있지만 40일이 서비스의 정상 재구매 주기보다 긴지 먼저 확인해야 한다. D가 1년에 한 번 구매하는 내구재 고객이라면 단 한 번 샀다는 이유로 충성도가 낮다고 분류할 수 없다. B가 신규 고객인지 오랫동안 이용하다 최근 한 번만 구매했는지는 가입 이력이 있어야 구분된다.

7.3 점수화와 캠페인 적용

고객을 각 항목의 분위수로 나누어 1~5점을 부여할 수 있다. 그러나 거래가 한 번뿐인 사람이 많으면 같은 빈도 값이 대량으로 묶여 다섯 집단의 크기를 동일하게 나누기 어렵다. 동점 처리, 거래 없는 고객, 신규 가입자의 짧은 관찰 기간을 명시해야 한다. 매월 상대 점수를 다시 매기면 개인의 원래 거래가 같아도 다른 고객의 변화 때문에 점수가 달라질 수 있다.

RFM 집단은 메시지 기획과 조사 대상을 정하는 데 사용할 수 있다. “최근 거래가 뜸해진 반복 구매자”라는 설명은 담당자가 이해하고 운영하기 쉽다. 그렇지만 쿠폰을 보내면 구매가 늘어날 사람인지, 쿠폰 없이도 구매할 사람인지는 이 세 값으로 판정되지 않는다. 캠페인의 증분효과는 17장의 비교 설계로 확인한다. 이 구분은 과거 거래가 많은 사람에게 할인 비용을 집중하는 일을 예방하는 데 도움이 된다.

08

생존분석과 검열의 기초

8.1 첫 종료까지의 시간

생존분석은 정한 시작점부터 특정 사건이 처음 일어날 때까지의 시간을 다루는 방법이다. 계약 시작부터 첫 해지까지, 가입부터 첫 과업 완료까지처럼 사건을 정의할 수 있다. 생존함수 S(t)는 그 사건이 t보다 늦게 일어날 확률이다. 사건을 첫 해지로 정하면 오래 유지되는 것이 높은 생존으로 나타나지만, 첫 성공으로 정하면 높은 생존은 아직 성공하지 못한 상태를 뜻한다. 같은 수학을 사용해도 제품에서의 좋은 방향은 사건 정의에 따라 달라진다.

우측 검열은 관찰이 끝날 때까지 사건이 발생하지 않아 정확한 사건 시점을 모르는 경우다. 마지막 관찰 시점까지 사건이 없었다는 정보는 남아 있다. 이를 사건 발생으로 바꾸거나 전체 분석에서 삭제하면 이용할 수 있는 정보를 잘못 처리한다. 13장에서 관찰이 끝나지 않은 D7 결과를 판정 대기로 두었던 문제와 관련되지만, Kaplan–Meier로 계산한 생존확률과 특정 날짜의 복귀 비율은 서로 다른 결과다.

8.2 위험집합과 Kaplan–Meier 계산

가상 계약 6개를 각각 시작부터 추적했다. 종료는 첫 해지이며, 재계약은 이 관찰 안에 없다. B·D·F는 데이터 마감으로 관찰이 끝났다고 가정한다. 시작일이 달라 경과 일 기준의 관찰 길이가 다르다. 위험집합은 해당 시점 직전까지 아직 사건이 없고 관찰 중인 계약들이다.

계약 마지막 관찰 경과 일 상태 사건 직전 또는 검열 직전 관찰 중인 수
A 2 해지 6
B 3 검열 5
C 4 해지 4
D 5 검열 3
E 6 해지 2
F 8 검열 1

Kaplan–Meier 추정은 사건 시점마다 (1 − 사건 수 / 위험집합 수)를 계산해 누적 곱한다. 검열 시점에는 곡선이 내려가지 않으며 그 대상은 이후 위험집합에서 빠진다. 이 예에서는 2일에 5/6, 4일에 (5/6) × (3/4) = 5/8, 6일에 (5/8) × (1/2) = 5/16이 된다. NIST의 계산 설명

직접 계산 실습 / 원자료와 조건을 대조하기

검열 시점에는 생존 곡선이 내려가지 않는다

계약 여섯 개의 해지·검열 기록을 시간 순서대로 계산한다.

3개월과 4개월을 비교하자. 검열된 B가 빠진 뒤 다음 해지의 위험집단은 몇 개인가?

고정한 조건계약 해지를 사건으로 정의한 독립 교육 자료. 비정보성 검열을 가정한다. 앱 재방문 비율과 같지 않으며 8개월 이후는 추정하지 않는다.

위: 계약별 관찰 · ● 해지 / × 검열 아래: Kaplan–Meier 생존 추정

0개월2개월4개월6개월8개월ABCDEF
0%50%100%02468
선택 시점의 생존 추정31.25%
그 시점 직후 계속 관찰1개 계약

6개월: 직전 생존 × (1 − 1/2)

위험집단과 계산 항 보기
시간직전 위험집단해지검열생존 추정
2개월61083.33%
3개월50183.33%
4개월41062.5%
5개월30162.5%
6개월21031.25%
8개월10131.25%

검열은 이후 상태를 모른다는 뜻이다. 검열 직전까지 위험집단에 포함하고 이후에서 뺀다. 마지막 관찰이 끝난 뒤에도 곡선을 계속 연장하지 않는다.

원본 정적 그림 보기

16-4. 계약별 해지·검열 시점과 Kaplan–Meier 계단 곡선

6일의 추정치는 31.25%다. 마지막 관찰자 수를 최초 6명으로 나눈 비율이나 주간 재방문율과 같지 않다. 뒤쪽의 위험집합은 두 개뿐이므로 한 사건이 추정치를 크게 바꾼다. 표본이 작아 설명용으로 계산했으며 신뢰구간이나 미래 계약 유지 예측까지 제시한 결과는 아니다.

8.3 검열 과정도 확인한다

위 계산을 해석하려면 분석 조건 안에서 검열 시점이 숨은 사건 위험에 대한 정보를 추가로 담지 않는다는 가정 등을 검토해야 한다. 행정적인 데이터 마감이라고 해도 최근 가입자의 성향이나 달력 효과가 달라졌다면 검토가 필요하다. 불만족한 사용자가 기록 수집을 먼저 중단하는 상황을 단순한 마감과 같게 처리할 수 없다.

제품에서 ‘30일 미접속’을 해지 사건처럼 정의하는 것도 별도 설계가 필요하다. 31일 뒤 복귀할 수 있는 관계와 계약이 종료된 관계는 다르다. 반복 복귀, 재활성화, 여러 종료 원인이 중요하다면 상태 전이나 반복 사건을 다루는 방법을 검토한다. 여기서는 첫 사건과 우측 검열의 계산까지만 익힌다. 이 예제를 그대로 모든 서비스의 이탈 모델로 사용하지 않는다.

09

탐색 결과를 검증 질문으로 바꾸기

세그먼트를 많이 나누면 개선 과제의 위치를 찾기 쉬워진다. 동시에 우연한 차이도 많이 발견한다. 기기, 국가, 연령, 가입일을 계속 조합하여 유리한 집단만 골랐다면 그 차이는 탐색 결과다. 처음부터 검증하려던 집단과 같은 강도로 보고하지 않는다. 온라인 실험에서도 결과에 영향을 받은 분류와 다수의 하위 집단 비교가 해석 문제를 만든다는 연구가 있다. Dmitriev 외, 2017, §5.8

분석 메모에는 처음 질문, 확인한 분류, 결과를 본 뒤 추가한 분류를 나누어 남긴다. 발견한 패턴을 설명할 수 있는 사용자 상황을 조사하고, 이후 코호트에서 같은 정의로 반복되는지 확인한다. 별도 자료에서 관계가 재현되어도 여전히 관찰 관계일 수 있다. 제품 변경의 원인 효과가 필요한 질문은 17·18장의 비교 설계로 옮긴다.

변화가 크다는 이유만으로 즉시 인과 실험을 시작할 필요는 없다. 이벤트가 특정 버전에서 빠졌다는 증거가 있으면 우선 계측을 복구해야 한다. 어떤 이유로 변했는지 판단할 수 없는 상태에서 실험을 추가하면 또 다른 해석 문제를 만든다. 원인 후보에 따라 먼저 필요한 작업이 달라진다.

10

PM의 비교 보고서 작성

자료 C를 보고하는 메모는 다음과 같이 작성할 수 있다. 교육용 작성 예이며 실제 서비스의 회의 기록이 아니다.

개편 전후 관찰 완료 가입자 각 200명의 D7 회고 완료율은 35%에서 55%로 상승했다. 같은 기간 가입 전 회고 습관이 있던 사용자의 비중은 25%에서 75%로 늘었고, 습관 유무 각 집단의 완료율은 10%포인트씩 하락했다. 이전 구성비로 표준화한 이후 완료율은 25%다. 현재 자료로는 온보딩 개편의 원인 효과를 확정할 수 없다. 획득 담당자는 타기팅·채널 변경 내역을, 분석 담당자는 동일 이벤트 정의와 응답 누락을 확인한다. 기획 담당자는 두 집단에서 첫 작성 실패 구간을 비교하고 사용자 조사 대상을 정한다. 확인 후 동시 무작위 비교가 필요한지 결정한다.

이 메모에는 관찰 사실, 계산 기준, 미확인 원인, 담당 작업이 함께 있다. “리텐션이 개선되었다”보다 문장이 길지만 이후 담당자가 무엇을 검토해야 하는지 분명하다. 보고 화면에는 다음 항목을 남기는 편이 좋다.

항목 남길 내용 빠졌을 때 생기는 문제
비교 질문 운영 규모·경험 개선·개입 효과 중 목적 동일 수치를 다른 결정에 사용
집단과 시간 분류 시점, 분모, 관찰 완료 다른 대상을 같은 집단처럼 비교
결과의 분포 평균·중앙값·꼬리·실패 특정 사용자의 악화를 놓침
구성 집단 크기와 누락자 비율의 변화 원인을 혼동
확인 범위 기술·탐색·모형·인과 중 상태 탐색 패턴을 정책 근거로 확정
후속 업무 담당자, 필요한 자료, 재검토 조건 분석이 보고로 끝남

역사적으로 코호트, 거래 요약, 생존분석은 서로 다른 문제를 다루며 발전했다. 이 장은 방법을 현재 제품의 비교 질문에 연결했다. RFM이 생존분석이나 CLV로 순차적으로 진화했다는 계보를 제시하지 않는다. 방법 사이의 공통점과 각각이 요구하는 관찰 조건을 이해하는 것이 적용의 출발점이다.

11

연습문제

  1. A와 B 소요 시간의 평균·중앙값·P90을 다시 계산하라. “B가 모든 사용자에게 더 빠르다”는 문장에서 확인되지 않은 부분을 적어라.
  2. 자료 C의 전체 완료율을 집단별 비율의 단순 평균으로 구하면 각각 얼마인가? 실제 전체 비율과 다른 이유를 설명하라.
  3. 이전 구성비로 이후 완료율을 표준화하고 전체 변화 +20%포인트를 두 단계로 분해하라. 각 단계에 ‘개편 효과’라는 이름을 붙일 수 있는가?
  4. 코호트 표에서 6월의 2개월 결과와 7월의 1개월 결과를 비교하려는 보고서를 수정하라. 8월 코호트의 빈칸을 0으로 두면 어떤 문제가 생기는가?
  5. 개편 후 ‘3회 이상 작성자’만 대상으로 만족도를 비교했다. 이 분석이 기술할 수 있는 대상과 개편의 효과를 평가하려면 필요한 대상을 구분하라.
  6. RFM의 C와 D 중 누구에게 재구매 쿠폰을 먼저 보내야 하는지 이 표만으로 정할 수 있는가? 추가로 필요한 정보 세 가지를 제시하라.
  7. 생존 예제의 4일과 6일 추정치를 계산하라. 3일 검열 시점에 곡선을 내리지 않는 이유를 설명하라.
  8. 불만족한 계약자가 로그 수집에서 먼저 사라진다면 생존 추정에 어떤 문제가 생기는가? 단순한 행정 마감과 구별하라.
  9. 담당 서비스의 수치 변화 하나를 선택해 비교 조건표와 원인 후보 세 가지를 작성하라. 각 후보를 구분하기 위해 필요한 자료·담당자·재검토 조건을 적어라.

해설과 작성 예시

12

참고 문헌과 확인 범위

출처 이 장에서 사용한 범위 확인과 한계
S14 · Dmitriev 외 실험 후 분류와 세그먼트 해석 2017 논문 §5.8·5.9의 해당 본문. 자체 숫자와 구분
S37 · Ryder 코호트의 연구 배경 기존 서지·제한적 초기 본문 확인. 최초 창안 주장 없음
S38 · NIST 검열·위험집합·Kaplan–Meier 공개 방법 절. 이번에는 6개 계약의 교육용 추정을 추가
S51 · IBM RFM의 세 축 공식 검색으로 확인한 정의. 특정 점수 규칙은 교재의 운영 예
S54 · Hernán·Robins 관찰 비교와 인과 질문의 구분 공개 교재 초반 관련 절. 제품 적용과 예제는 자체 작성

다음 장: 광고에 귀속된 매출과 광고가 만든 매출

다음 장 · 17광고에 귀속된 매출과 광고가 만든 매출