Follow the Metrics for PMWEB EDITION / 01

Follow the Metrics for PM · 참고 자료

18장 연습문제 해설

Follow the Metrics for PM · 웹 교재 v1.0 · 2026-09-21

본문 · 계산 결과

이 해설은 고정된 분석 시점, 독립 계정의 이진 결과, 큰 표본 정규근사라는 본문의 조건을 따른다. 실제 실험에는 배정·결과 수집의 검수와 자료 구조에 맞는 분석이 필요하다.

1. 개입과 가설

개입은 수정 가능한 예시 문장 제공, 예상 과정은 첫 작성의 어려움 감소, 결과는 7일 내 유효 회고 완료율 상승이다. 유효 회고의 로그 정의가 내용의 유용함 전체를 관찰하는 것은 아니므로 과업 평가로 보완한다.

문구와 저장 로직을 동시에 변경하면 두 변경을 묶은 정책의 효과를 추정한다. 문구만으로 성공했다고 주장하려면 둘을 구분하는 추가 설계가 필요하다. 다른 변경이 함께 배포되었다면 기획·개발 명세에 남기고 추정 대상의 표현을 수정한다.

2. 협업 서비스의 배정

같은 조직 구성원이 다른 버전을 쓰면 공유 문서나 작업 순서가 서로 영향을 받을 수 있다. 한 사람의 결과가 다른 사람의 배정과 무관하다는 단순 가정이 깨질 수 있다. 조직 단위 배정이 타당한지 검토한다.

조직별 배정에서도 결과는 구성원별로 수집할 수 있다. 다만 분석에는 조직 안의 상관과 조직 규모를 반영해야 한다. 조직 수, 규모 분포, 어떤 조직에 일반화할지 전달하고 군집에 맞는 표본 계획·표준오차를 협의한다. 이 장의 개인별 두 비율 공식을 구성원 수에 그대로 적용하지 않는다.

3. 효과와 구간

절대 차이는 0.33−0.30=0.03, 즉 +3%포인트다. 상대 변화는 0.03/0.30=10%다. 비풀링 표준오차는 √(0.30×0.70/10000+0.33×0.67/10000)≈0.006566이다.

95% 큰 표본 구간은 0.03±1.96×0.006566, 약 0.01713~0.04287이다. 백분율 차이 단위로는 +1.71~+4.29%포인트다. 하한은 업무 기준 +2%포인트보다 낮으므로 같은 신뢰 수준으로 그 기준을 넘는다고 확정할 수 없다. 점추정이 기준보다 크다는 관찰과 구분한다.

신뢰구간의 조건에는 독립성·수집 품질·고정 분석 시점이 있다. 많은 계정이 같은 조직에 속하거나 반복 시도를 독립 행으로 세었다면 다시 검토해야 한다.

4. p값의 문장 수정

수정 예는 “두 집단의 완료 비율이 같고 분석 가정이 성립한다고 할 때, 현재처럼 또는 더 극단적인 양측 검정통계량이 관찰될 확률은 약 0.00000495다”다. 이를 제품 성공 확률로 바꾸지 않는다.

p값은 비용 회수, 장기 효과, 사용자 피해의 허용 가능성을 직접 평가하지 않는다. 보고에는 효과 +3%포인트, 구간, 품질 결과와 적용 범위를 함께 제시한다. 기준 0.05보다 얼마나 더 작은지만으로 출시 우선순위를 정하지 않는다.

5. SRM 진단

기대 인원은 각 5,000명이다. 카이제곱은 200²/5000+(-200)²/5000=16이고 자유도 1 근사 p값은 약 0.000063이다. 진단 예제는 EXP의 각 10,000명 결과와 독립이다.

확인할 단계에는 적격 계정 선정, 무작위 배정·식별자 유지, 화면 전달, 로그 수집, 데이터 조인, 봇·내부 계정 제외 등이 있다. 양쪽에 공통으로 쓰인 조건이 변경의 영향을 받았는지도 본다. 한쪽 인원을 버려 수를 맞추면 선택 원인을 고치지 못한다. 원인을 확인하고 데이터 복구 또는 새 실험의 필요성을 결정한다.

6. 표본과 MDE

본문 계획식에서 30%→32%는 각 8,394명, 30%→31%는 각 33,275명이다. 필요한 표본은 약 3.96배다. 차이의 제곱이 식의 분모에 들어가므로 더 작은 차이를 보려면 많은 표본이 필요하다. 정확한 배율은 계획 비율과 방법에 따라 달라진다.

최소 가치 있는 효과는 업무상 얻어야 하는 개선 폭이고, MDE는 측정 설계의 탐지 능력과 관련된 기준이다. 어떤 실험이 +2%포인트 효과를 80% 검정력으로 탐지하도록 설계되었다는 말은, 결과가 나온 뒤 효과가 반드시 2%포인트를 넘는다는 뜻이 아니다. 모집 가능 인원과 업무의 필요를 함께 맞추어야 한다.

7. 모집과 결과 성숙

결과 정의가 배정 이후 168시간이라면 마지막 모집일까지 그 시간이 지나지 않은 계정은 판정 대기다. 모집 종료가 8월 15일 00시라면 그 직전 계정의 창은 8월 22일 00시 직전까지 이어진다. 그 이후 수집 지연까지 확인한 뒤 결과를 확정한다.

중간 보고가 필요하면 관찰 완료 집단과 대기 집단을 분리하고 중간 결과임을 표시한다. 결과가 좋은 계정만 일찍 포함하고 나머지는 미완료로 확정하는 식의 비대칭 처리를 하지 않는다. 사전에 정한 모집·분석 규칙을 유지한다.

8. 다중 비교와 중간 확인

독립인 20개 검정의 귀무가설이 모두 참이면 하나도 잘못 기각하지 않을 확률은 0.95²⁰≈35.85%다. 하나 이상 잘못 기각할 확률은 약 64.15%다. 실제 제품의 서로 관련된 지표나 같은 누적 자료를 매일 보는 상황에는 독립 가정이 성립하지 않아 이 수치를 그대로 쓰지 않는다.

핵심은 반복 선택이 원래 검정 절차를 바꾼다는 점이다. 주요 가설과 종료 방식을 사전에 정하고 목적에 맞는 다중성·순차 분석 방법을 선택한다. 탐색 결과는 탐색으로 표시하고 새로운 검증 질문으로 남긴다.

9. 출시 판단

작성 예는 다음과 같다.

완료율은 +3%포인트이고 신뢰구간은 +1.71~+4.29%포인트다. 양의 개선은 관찰되었지만 업무 기준 +2%포인트를 구간 전체가 넘지는 않는다. 오류 경험은 +2%포인트, 구간 +1.34~+2.66%포인트로 허용 증가 +1%포인트를 넘었다. 현재 버전의 전체 출시를 보류하고 저장 오류 원인을 수정한다. 변경된 버전은 새로운 가설과 검수·관찰 계획으로 평가한다. 장기 유지와 사용자 결과는 별도 미확인 항목으로 남긴다.

유의하지 않은 경우에는 구간이 어느 범위를 포함하는지 확인한다. 큰 이익과 큰 손상을 모두 포함하면 자료 부족에 가깝다. 효과가 업무상 작은 범위 안에 있다는 주장은 사전에 정한 동등성 한계와 적절한 절차가 필요하다. p값이 큰 것만으로 효과 없음이나 안전성을 입증하지 않는다.

← 전체 차례