Follow the Metrics for PMWEB EDITION / 01

Follow the Metrics for PM · 참고 자료

13장 연습문제 해설과 평가 기준

Follow the Metrics for PM · 웹 교재 v1.0 · 2026-09-21

본문으로 돌아가기 · 원자료와 재현 안내 · 계산 결과표

연습문제 10개. 모든 수치는 교육용 생성 자료에 대한 계산이다. 계산의 정확성, 측정 기준의 적용, 결과 해석과 후속 업무의 적절성을 기준으로 검토한다.

1. 사용자 수와 사건 수

정답은 2/8 = 25%다. D7 창에서 회고를 완료한 사용자는 u01과 u05다. u05의 두 번 완료는 같은 사용자의 반복 행동이므로 사용자 수에서는 한 명으로 센다.

3/8 = 37.5%라는 값은 완료 건수를 사용자 수로 나눈 것이다. 이 자료에서는 사용자당 평균 완료 0.375건이라고 해석할 수 있지만, 사용자의 37.5%가 완료했다는 뜻은 아니다. 다른 자료에서는 사용자당 여러 건이 발생해 이 값이 1을 넘을 수도 있다. 단위가 다른 것을 사용자 비율로 부르면 안 된다.

u02의 정확히 8일째 완료는 D7 창 [7, 8)의 끝에 있으므로 제외한다. 둘째 주 [7, 14)에는 포함한다.

검토 항목: 25%를 맞추는 것에 더해 사용자/건수 구분, 중복 제거, 끝 경계 제외를 모두 설명해야 한다.

2. 측정 기간의 변경

예를 들어 다음과 같이 고칠 수 있다.

같은 여덟 명을 관찰했을 때, 가입 후 D7에 회고를 완료한 비율은 25%, 둘째 주 중 한 번 이상 완료한 비율은 62.5%였다. 두 값은 관찰 창이 다르며 시간에 따른 제품 개선을 나타내지 않는다.

주간 회고는 정확히 가입 후 168~192시간 안에 일어날 필요가 없을 수 있다. 사용자가 다음 주의 적절한 날에 회고하는지를 보려면 넓은 주간 창이 사용 목적에 더 맞을 수 있다. 하지만 62.5%가 학습 개선이나 회고의 유용성을 입증하지는 않는다.

‘37.5%p 올랐다’는 뺄셈 자체는 가능하다. 다만 이 차이는 같은 자료에서 정의를 바꿔 생겼으므로 성과 개선이라고 표현하면 잘못이다. 새 정의를 도입하면 두 정의를 같은 기간에 계산해 비교 가능성부터 확보한다.

검토 항목: 정의 차이와 성과 변화의 구분, 사용 주기에 대한 이유, 사용자 결과의 미확인을 포함한다. 지표 선택의 근거를 서비스의 이용 목적과 연결한다.

3. 관찰 기간과 집계 대상

질문 답
창이 끝난 사용자의 D7 3/4 = 75%
미관찰 인원 b05·b06, 2명
모두의 창이 끝나는 시각 2026-09-15 10:00, 한국 표준시
전체 최종 결과의 최솟값 두 명 모두 D7 미완료: 3/6 = 50%
전체 최종 결과의 최댓값 두 명 모두 D7 완료: 5/6 ≈ 83.3%

마지막 가입자 b06은 9월 7일 10시에 가입했다. D7은 9월 14일 10시에 시작해 9월 15일 10시에 끝난다. D7이 시작되는 시각과 창을 끝까지 관찰할 수 있는 시각은 하루 차이가 난다.

50~83.3%는 기존 네 명의 관측값이 고정되었을 때 남은 두 결과에 따라 가능한 최소·최대다. 표본추출 또는 확률 모형에 따른 추정 오차의 범위를 계산한 것이 아니므로 신뢰구간이라고 부르지 않는다. 가능한 비율은 실제로 3/6, 4/6, 5/6의 세 가지다.

75% 역시 이 네 명의 관찰값이다. 신규 고객 일반의 장기 성과나 이후 가입한 두 명의 결과를 보장하지 않는다.

검토 항목: 미관찰을 0으로 만들지 않고, 분모 4의 이유와 창 종료를 정확히 설명한다. ‘생존분석을 쓰면 6명 모두의 D7을 알 수 있다’는 답은 추정 대상과 가정을 생략한다.

4. 사용자 구성비의 표준화

변경 전 구성비는 습관 있음 25%, 없음 75%다. 여기에 변경 후 각 집단의 비율을 적용하면 다음과 같다.

(0.25 × 0.70) + (0.75 × 0.10) = 0.25 = 25%

전체 집계는 35% → 55%, 전의 구성비로 표준화한 비교는 35% → 25%다. 전자는 실제 관찰된 각 전체 집단을 기술하고, 후자는 특정 구성비를 같게 두었을 때의 기술적 비교를 제공한다.

변경 후 전체 비율 110/200은 실제 가입 집단에서 관찰된 결과다. 이 비율에는 사용자의 구성 변화도 반영되어 있으므로, 개편의 효과를 검토할 때는 집단별 비율과 구성비를 함께 제시해야 한다.

표준화 결과의 10%p 하락은 이전 구성비를 적용한 기술적 비교다. 가입 전 습관을 같게 두어도 유입 의도, 시기, 사용자 특성 등의 차이가 남을 수 있다. 개편의 원인 효과를 판단하려면 이러한 차이를 검토하고 적절한 비교 설계를 마련해야 한다.

선택 심화: 전체 차이를 산술적으로 분해하기

전체 변화 +20%p는 아래 두 성분의 합으로 쓸 수 있다. 여기서는 비율 변화에 이전 가중치를, 구성 변화에 이후 비율을 사용한다.

집단 내 비율 변화 성분
= 0.25 × (0.70 − 0.80) + 0.75 × (0.10 − 0.20)
= −0.10 → −10%p

구성 변화 성분
= (0.75 − 0.25) × 0.70 + (0.25 − 0.75) × 0.10
= +0.30 → +30%p

전체 변화 = −10%p + 30%p = +20%p

이것은 가중평균을 다시 쓴 산술 분해다. ‘구성이 30%p의 인과 효과를 냈다’는 뜻은 아니다. 일반적으로 어느 시점의 비율과 가중치를 기준으로 놓느냐에 따라 성분별 값이 달라질 수 있다.

검토 항목: 계산 25%, 기준 구성비 명시, 전체값의 진실성과 인과 결론의 한계를 함께 설명한다.

5. 계약 유지와 행동 복귀

이는 첫 계약 종료를 사건으로 정하고 재가입을 별도 관계로 취급한 예제다. 1개월 80%와 2개월째 조건부 90%를 곱하면 처음부터 2개월 말까지 계약이 남은 비율 72%가 된다.

D6 미방문 뒤 D7 방문은 서로 다른 날의 행동이다. D6에 오지 않은 사람도 D7에 올 수 있다. ‘직전까지 계약이 지속된 사람만 다음 구간의 위험집합에 남는다’는 구조를 그대로 적용할 수 없다. D7 미복귀율을 계약 해지율이라고 부르는 것도 부정확하다.

검토 항목: 분모 80과 100을 구별하고, 행동의 반복·재개와 첫 종료 사건의 차이를 설명한다.

6. 분석 대상과 기준 시각의 변경

가입 후 첫 24시간에 회고를 완료한 사용자는 u01·u02·u03·u04·u06·u07, 6명이다. 가입 시각 기준 D7 완료자는 이 집단에서 u01 한 명이므로 1/6 ≈ 16.7%다.

가입자 전체의 25%보다 낮지만 ‘활성화가 리텐션을 해친다’고 결론 내릴 수 없다. 집단을 선택하는 조건이 달라졌고 무작위 개입을 비교한 자료도 아니다. u05는 가입 당일에는 완료하지 않았으나 D7에는 완료했기 때문에, 이 제한된 집단에서 빠진다.

‘첫 회고 이후 반복 사용’을 묻고 싶다면 기준 시각을 최초 회고 완료로 옮기고, 그 기준에서 이후의 관찰 창을 다시 계산해야 한다. 첫 회고까지 오지 못한 사람은 이 지표의 대상이 아니므로 가입→첫 회고 도달도 따로 보고해야 한다. 기준 시각을 옮기면 창 종료 시각도 달라지므로 관찰 자격 역시 다시 계산한다.

검토 항목: 16.7%뿐 아니라 집단 선택과 시간 기준의 변화까지 설명한다. 분석 대상에서 제외된 사용자가 누구인지 명시한다.

7. 분석 결과에 따른 후속 업무

관찰로 말할 수 있는 것은 앱 열기 비율이 상승했고, 회고 완료는 그대로이며, 알림 해제가 늘었다는 것이다. 아직 모르는 것은 알림 강화가 이 변화의 원인인지, 또는 회고의 실질적 유용성이 달라졌는지 등이다.

후속 조사의 한 예는 이벤트·대상·기간이 같은지 확인한 뒤 알림을 해제한 사람과 유지한 사람을 함께 조사하는 것이다. 알림이 부담을 만들었다는 가설을 점검하고, 필요하면 알림 빈도·시점을 비교하는 실험을 설계한다. 관찰된 부담이 이미 심각하다면 영향 범위와 되돌릴 수 있는 조치를 우선 확인할 수도 있다.

후속 업무에는 회고 완료가 늘지 않은 원인과 알림 해제가 증가한 이유를 확인하는 과정이 포함되어야 한다. 알림의 확대 여부는 그 결과와 추가 비교를 바탕으로 검토한다. 조사나 실험 중 무엇을 먼저 수행할지는 현재 확보한 정보와 영향 범위에 따라 정할 수 있다.

검토 항목: 관찰과 인과 가설을 구분하고, 완료가 늘지 않았다는 점과 알림 해제라는 부작용을 후속 행동에 반영한다.

8. 분석 보고서 작성

가능한 답안은 다음과 같다.

동일한 D7 정의와 완료된 관찰 창에서 변경 전후 각 200명의 회고 완료 비율이 35%에서 55%로 상승했다. 그러나 가입 전 회고 습관으로 나눈 두 집단 모두 10%p 하락했고, 이전 구성비를 적용한 변경 후 비율은 25%다. 사용자 구성과 집단 내부의 다른 차이가 남아 있으므로 이 자료만으로 개편의 이익이나 손해를 인과적으로 확정하지 않는다. 우선 계측·유입 구성과 완료 과정의 어려움을 확인하고, 그 결과로 개입 가설과 비교 설계를 정한다. 비교에서 사전에 정한 주간 행동과 사용자 결과가 개선되고 부작용 기준을 만족하면 확대를 검토하며, 집계 오류나 해로운 결과가 확인되면 수치와 결정을 수정한다.

9. 코호트별 비율의 집계

D2에는 9월 1일 가입자 4명 중 0명, 9월 6일 가입자 1명 중 1명, 9월 7일 가입자 1명 중 1명이 완료했다. 전체는 2/6 ≈ 33.3%다.

세 행의 비율을 단순 평균하면 (0% + 100% + 100%)/3 ≈ 66.7%가 된다. 이 값은 각 코호트에 같은 무게를 둔 평균으로, 사용자 전체의 완료 비율과 다른 질문에 답한다. 이 예제에서 한 명짜리 코호트 두 개가 네 명짜리 코호트보다 과도한 무게를 갖게 된다.

D2는 여섯 명 모두의 창이 끝났고, D7은 네 명만의 창이 끝났다. 두 집계값을 잇는 선은 같은 여섯 명을 계속 추적한 선이 아니다. 같은 집단의 경과를 보고 싶다면 집단을 고정하고 필요한 기간의 관찰을 확보해야 한다. 네 명으로 고정한 비교는 또 다른 대상 집단에 관한 설명임을 밝혀야 한다.

검토 항목: 분자·분모를 합산하고, 코호트 평균과 사용자 평균을 구분하며, 경과일마다 분모 자격이 달라지는 이유를 설명한다.

10. 주차별 이용의 지속성

셋째 주 [14,21)에 완료한 사용자는 정확히 14일째의 u04 한 명이다. 따라서 1/8 = 12.5%다. 21일 경계는 포함하지 않으며, 이 자료에는 그 창의 다른 완료가 없다.

“여섯 명이 매주 회고했다”는 문장을 “가입자 여덟 명 중 여섯 명이 D7~D20 사이에 적어도 한 번 회고를 완료했다. 둘째 주에는 다섯 명, 셋째 주에는 한 명이 완료했으므로 이것만으로 매주 반복한 습관을 확인했다고 말할 수 없다”로 고칠 수 있다.

그림 13-3에서는 u04의 14일째 점이 마지막 긴 창 안에만 들어가는 것을 확인한다. D7~D20 복귀는 기간 전체의 합집합을 세므로, 셋째 주에만 돌아온 사람과 둘째 주에만 돌아온 사람을 모두 포함한다. 한 기간에 한 번 있는 것과 여러 기간에 계속 있는 것은 다르다.

검토 항목: 12.5%를 맞추고, 합집합의 복귀와 기간별 지속성을 구분한다. 낮은 셋째 주 값만으로 제품의 장기 실패를 확정하지 않는다.

공통 평가표

각 항목은 0~2점으로 검토한다. 0점은 누락 또는 모순, 1점은 언급했으나 대상·조건이 불분명함, 2점은 현재 자료와 연결하여 분명히 설명함을 뜻한다. 총점은 학습 피드백용이며 직무 역량을 검증한 척도가 아니다.

항목 확인할 내용
정의 사용자·행동·시간 창·분모를 말했는가?
계산 전체와 세그먼트, 표준화 수치를 일관되게 사용했는가?
해석 기술적 관찰과 인과 주장을 분리했는가?
행동 계측·구성·사용자 결과의 불확실성을 줄일 조치를 골랐는가?
갱신 어떤 증거가 들어오면 결론을 바꿀지 적었는가?

계산 결과가 다를 때는 분자·분모, 측정 행동, 시간 구간, 대상 집단의 순서로 적용 기준을 대조한다. 계산이 일치하더라도 개편 효과의 해석이나 후속 업무가 적절한지는 별도로 검토한다.

← 전체 차례