PM은 다음 분기에 온보딩을 개선할지, 유입을 늘릴지, 유료 기능을 확장할지 제안해야 한다. 세 팀이 각자 좋은 숫자를 가져온다. 마케팅팀은 가입 단가를, 제품팀은 저장 전환율을, 사업팀은 구독 매출을 강조한다. 숫자의 우열을 정하기 전에 현재 사용자 문제, 비교 조건, 얻고자 하는 결과와 투자 범위를 하나의 문서로 연결해야 한다.
이 장은 지표를 새로 소개하기보다 지금까지의 정의와 판단 방법을 사용해 제품 측정 문서·지표 사전·검증 계획·한 페이지 의사결정 기록을 작성하는 종합 과제다. 가상 개인용 서비스 ‘주간회고’를 사용한다. 아래 C23 자료는 앞선 장과 독립된 교육용 집계이며 실제 실험이나 인터뷰를 수행한 자료가 아니다. 일부 칸은 의도적으로 비워 두었다. 알 수 없는 결과를 근거 없이 채우지 않는 것도 과제에 포함된다.
과제의 조건과 제출물
주간회고는 사용자가 한 주의 일을 정리하고 다음 행동을 작성하는 개인용 서비스다. 이번 검토의 대상은 처음 가입한 개인 계정이며 조직용 이용은 제외한다. 팀은 온보딩 변경을 검토할 개발 여력이 있고, 전면 개발에 앞서 제한된 검증을 할 수 있다고 가정한다. 실제 개발 일정이나 시장 규모를 추정하는 과제는 아니다.
현재 제안은 두 가지다. A안은 작성 첫 화면에 예시 문장을 제공하여 시작 부담을 줄이는 안이고, B안은 추가 유입 캠페인이다. 제공 자료로 먼저 A안의 검증 여부를 판단하고, B안은 어느 자료가 부족한지 정리한다. 예산 수치가 없는데 두 안의 ROI를 계산하거나 확정 순위를 만들 필요는 없다.
| 제출물 | 반드시 포함할 내용 | 참조 단원 |
|---|---|---|
| 제품 측정 문서 | 사용자 문제·대상·경험 경로·가치 가설 | 08·10·21장 |
| 지표 사전 | 사건·단위·기간·분모·제외·버전 | 03·09장 |
| 검증 계획 | 경쟁 설명·조사·실험·판단 기준 | 12·16·17·18장 |
| 결정 기록 | 실행 범위·보류 이유·책임·재검토 조건 | 20·21장 |

네 문서는 같은 질문과 지표 정의를 사용해야 한다. 측정 문서에서는 ‘계획 활용’을 목표로 삼고 실험 문서에서는 단순 페이지 열람만 성공으로 판정하면 연결이 끊긴다. 관찰 가능한 대리지표를 쓸 수 있지만 어떤 결과를 아직 확인하지 못했는지 함께 적는다.
사용자 문제와 경험 지도를 작성하기
제품 문제는 해결책의 부재로 쓰지 않는다. ‘예시 문장이 없다’는 기능 상태이며 사용자가 어떤 어려움을 겪는지 직접 말해주지 않는다. C23에서는 ‘신규 사용자가 첫 회고를 작성하려고 할 때 무엇을 어느 정도 적어야 할지 정하기 어려울 수 있다’를 조사할 가설로 둔다. 이를 확인된 사용자 발언처럼 따옴표 안에 넣지 않는다.
경험 지도에는 가입 전 기대, 첫 화면, 작성, 저장, 다음 주 계획 활용을 표시한다. 각 단계에서 로그로 볼 수 있는 행동과 직접 물어보거나 관찰해야 하는 경험을 구분한다. 작성 화면에서 머문 시간이 길다고 어려움을 확정하지 않는다. 집중해서 작성했거나 다른 업무를 병행했을 수도 있다.
| 단계 | 관찰 가능한 기록 | 추가 확인할 경험 | 연결할 업무 |
|---|---|---|---|
| 가입·첫 진입 | 가입 시각, 진입 경로 | 가입 목적, 예상한 결과 | 안내 내용 대조 |
| 작성 | 시작·수정·중단 | 무엇을 적을지 판단하는 과정 | 과업 관찰 |
| 저장 | 서버 성공·실패·재시도 | 완료한 내용에 대한 판단 | 오류·내용 검수 |
| 계획 활용 | 후속 확인·수정 기록 | 실제 실행에 도움이 되었는가 | 후속 조사 |
| 다음 주 | 정의한 기간의 재작성 | 필요 발생·반복 이용 이유 | 성숙 코호트 분석 |
가치 가설은 경험 변화와 결과의 연결을 설명한다. ‘수정 가능한 예시가 작성 시작의 부담을 줄이면 첫 회고 완성이 늘고 이후 계획 활용에 도움이 될 수 있다’고 쓴다. 앞부분의 완료와 뒷부분의 활용은 별도로 검증한다. 완성된 글이 늘었는데 내용이 획일적이고 실제 계획으로 쓰이지 않는 경우도 경쟁 설명에 포함한다.
기준선을 읽고 자료의 경계를 정하기
C23의 기준선에는 신규 적격 계정 1,000개가 있다. 가입 후 168시간의 관찰을 모두 마쳤다. 작성 시작 600개, 서버 저장 완료 400개, 유효 기준을 만족한 완료 300개다. 유효 기준은 21장처럼 사용자가 확인하거나 수정한 행동 항목을 포함한 저장이며 실질적 활용을 보증하지 않는다. 세 집단은 차례로 포함된다.
| 결과 | 계정 수 | 신규 적격 1,000개 기준 | 앞 단계 기준 |
|---|---|---|---|
| 작성 시작 | 600 | 60% | 60% |
| 서버 저장 완료 | 400 | 40% | 400/600≈66.7% |
| 유효 완료 | 300 | 30% | 300/400=75% |
| 주2 유효 재작성 | 180 | 18% | 첫 주 유효 완료자 기준 60% |
주2 재작성 180개는 첫 주 유효 완료 300개 안에서 관찰한 부분집합이다. 모든 기준선 계정의 가입 후 336시간이 지났으며, 주2 창은 가입 후 168시간 이상 336시간 미만으로 둔다. 교육 자료는 첫 주 유효 완료자 이외에서의 주2 재작성을 제공하지 않는다. 따라서 180/1,000=18%는 첫 주 유효 완료와 주2 재작성을 모두 만족한 계정 비율이다. 모든 신규 계정의 주2 리텐션이라고 바꾸어 부르지 않는다.
같은 180개 계정, 서로 다른 질문
원본 정적 그림 보기

기준선의 지표 차이는 과정의 어느 부분에서 추가 조사가 필요한지 알려준다. 작성자 중 저장하지 않은 200개에는 작성 중단, 저장 실패, 나중에 저장하려는 의도가 섞일 수 있다. 집계만으로 원인을 정하지 말고 오류 로그와 과업 관찰을 붙인다. 분모가 큰 구간부터 자동으로 투자하는 것도 충분한 판단 근거가 아니다. 해결 가능성과 사용자 영향, 변경 비용이 필요하다.
지표 사전을 검증 가능한 수준으로 작성하기
주 지표는 ‘배정 후 168시간 내 첫 유효 완료 계정 비율’로 정한다. 기준선은 가입을 시작점으로 사용했지만 실험에서는 배정이 시작점이다. 과제에서는 가입 직후 첫 화면 진입 전에 배정한다고 가정해 간격을 최소화한다. 실제로 배정이 늦어진다면 기준선과 실험의 시작점 차이를 명시하고 직접 비교를 조심해야 한다.
| 정의 항목 | C23의 실험 계획 |
|---|---|
| 적격성 | 신규 개인 계정, 사전에 식별한 테스트·조직 계정 제외 |
| 배정 단위 | 개인 계정, 한 계정의 버전 유지 |
| 결과 사건 | 서버 저장 성공 및 사용자 확인·수정 행동 항목 보유 |
| 시간 | 배정 이상, 배정 후 168시간 미만 |
| 분자 | 관찰 창 안에 결과 사건을 한 번 이상 충족한 계정 |
| 분모 | 배정된 모든 적격 계정, 미이용자 포함 |
| 중복 | 계정별 한 번, 계획 수를 계정 수로 대체하지 않음 |
| 오류 지표 | 같은 창 안에 저장 오류를 한 번 이상 겪은 계정/전체 배정 계정 |
| 관찰 완료 | 마지막 배정 계정의 168시간 및 수집 지연 대조 종료 |
오류와 유효 완료는 동시에 발생할 수 있다. 사용자가 실패 후 재시도해 성공하면 두 분자에 모두 들어간다. 두 비율을 더해 100%로 맞추려고 하면 사용자의 실제 경험이 사라진다. 계측 명세에는 배정 기록과 서버 저장 결과, 오류 사건을 계정으로 연결하는 방법을 적는다.
수집 누락은 사용자 실패와 구분한다. 서버 결과가 누락되어 완료 여부를 모르는 경우를 자동 실패로 처리하면 버전별 수집 차이가 효과로 보일 수 있다. 누락의 원인과 범위를 확인하고, 결과를 복구하거나 분석 한계를 남긴다. 운영 정의의 상세 인수 기준은 09장을 적용한다.
경쟁 설명과 확인 방법
경쟁 설명은 동일한 관찰을 설명하는 다른 가능한 원인이다. 예시 문장 이용자의 리텐션이 높다는 사실에는 원래 의욕이 높은 사용자가 예시를 더 많이 썼다는 설명도 들어갈 수 있다. 그런 이용자와 비이용자를 단순 비교하여 기능의 효과를 확정하지 않는다.
| 가설 | 추가로 볼 자료 | 이 자료로도 남는 한계 |
|---|---|---|
| 작성 부담이 줄어 완료 증가 | 신규 사용자 과업 관찰, 중단 이유 | 소규모 조사로 전체 효과 크기 추정 어려움 |
| 유입 의도가 달라 완료 증가 | 채널·가입 목적별 기준선 | 관찰하지 못한 의욕 차이 |
| 자동 저장이 숫자만 증가 | 배포 이력·정의별 병행 집계 | 구조적 완성만으로 유용성 확인 불가 |
| 오류로 완료 감소 | 서버 원장·오류·재시도 대조 | 오류 수정의 전체 효과는 별도 비교 |
| 예시가 실제로 완료를 도움 | 사전 계획한 무작위 배정 | 후속 활용·장기 유지의 관찰은 별도 |
조사와 실험은 서로 대체되는 단계가 아니다. 조사는 변경의 작동 과정을 이해하고 잘못된 구현을 찾는 데 도움이 된다. 실험은 정한 변경의 평균 효과를 비교하는 데 적합하다. 작은 과업 관찰을 먼저 수행할 수 있지만, 조사에서 모두 좋아했다는 이유로 결과 효과가 확정되었다고 쓰지 않는다.
사전 실험 계획과 제공 결과
C23은 개인용 기능이어서 계정 단위 배정이 가능하고 계정 사이 간섭이 없다고 가정한다. 기존 화면 A와 예시 제공 B를 같은 기간에 비교한다. 주 지표는 유효 완료율, 가드레일은 오류 경험률이다. 학습용 판단 기준은 완료율 +2%포인트를 업무상 관심 있는 개선으로, 오류 경험 증가 +1%포인트를 별도 검토가 필요한 손상 경계로 둔다. 이는 업계 합격선이 아니다.
기준선 30%, 양측 유의수준 5%, 검정력 80%, +2%포인트 차이의 정규근사 표본 계획은 18장의 집단별 8,394개를 참조한다. 가드레일과 운영 주기는 별도로 고려해야 한다. 이 과제는 집단별 10,000개를 관찰 완료한 교육용 결과를 제공한다. 미리 기간·제외·검정을 정했다고 가정하지만 실제 배정을 수행한 것은 아니다.
| 관찰 결과 | A · 기존 | B · 예시 |
|---|---|---|
| 배정·관찰 완료 계정 | 10,000 | 10,000 |
| 유효 완료 계정 | 3,000 | 3,300 |
| 오류 경험 계정 | 500 | 550 |
| 같은 관찰 창의 총 제공 비용 | 100만 원 | 160만 원 |
완료율은 30%와 33%, 차이는 +3%포인트다. 독립 이진 결과의 큰 표본 Wald 근사로 계산한 명목 95% 신뢰구간은 약 +1.71~+4.29%포인트다. 0보다 큰 방향은 비교적 분명하지만 구간 하한이 업무 기준 +2%포인트보다 낮다. 평균 효과가 최소 2%포인트 이상이라고 확정하는 결론과는 구분한다.
오류 경험률은 5%와 5.5%, 차이는 +0.5%포인트이며 같은 근사 구간은 약 −0.12~+1.12%포인트다. 점추정이 경계 +1%포인트보다 낮아도 그 이상의 증가가 자료와 양립한다. ‘유의하지 않으므로 안전’이라고 결론 내리지 않는다. 두 구간은 각각의 명목 구간이며 동시에 95% 보장을 제공하는 구간으로 표현하지 않는다.
작은 오류 증가가 안전의 증거인가
비율 차이 · %p · 점: 추정값 / 선: 명목 95% 구간
유효 완료 증가
오류 증가
18장의 EXP와 독립된 C23 자료다. 특히 B 오류가 700명이 아니라 550명이다. 각 지표의 큰 표본 Wald 명목 95% 구간이며 두 구간의 동시 보장이 아니다.
완료 개선과 가치 기준을 대조한다.
C23의 완료 차이는 +3%p, 명목 95% 구간은 +1.71~+4.29%p다. 최소 가치 기준 +2%p를 구간 전체가 넘지는 않는다.
비율 차이 · %p · 점: 추정값 / 선: 명목 95% 구간
유효 완료 증가
오류 증가
18장의 EXP와 독립된 C23 자료다. 특히 B 오류가 700명이 아니라 550명이다. 각 지표의 큰 표본 Wald 명목 95% 구간이며 두 구간의 동시 보장이 아니다.
오류의 불확실성은 아직 남는다.
오류 차이 +0.5%p의 구간은 −0.12~+1.12%p다. 0도 포함하지만 허용 경계 +1%p도 넘는다. 유의하지 않다는 사실이 안전을 입증하지 않는다.
원본 정적 그림 보기

가드레일의 비열등성을 확정하려면 사전에 경계와 검정·구간 방법을 정해야 한다. 이 과제의 양측 명목 구간은 판단을 연습하기 위한 계산이다. 결과를 보고 임의의 다른 구간을 골라 통과시키지 않는다. 추가 표본을 얻는다면 연장 규칙 또는 새 실험 계획을 명시한다.
비용과 아직 관찰하지 못한 결과
B와 A의 총 제공 비용 차이는 60만 원이다. 같은 10,000개 계정 규모의 완료 증가 점추정은 300개이므로 추가 완료당 추가 제공 비용은 600,000/300=2,000원이다. 분모는 B의 전체 완료 3,300개가 아니다. 이 값은 개발·유지 고정비를 제외한 교육용 비교이며 효과의 불확실성을 그대로 갖고 있다.
참고로 총 제공 비용을 각 버전의 완료 계정 수로 나누면 A는 약 333원, B는 약 485원이다. 이는 평균 완료당 제공 비용이며 추가 완료당 추가 비용과 다른 질문에 답한다. 평균 비용이 낮은 버전과 더 많은 완료를 만드는 버전 사이에서 어떤 선택을 할지는 추가 결과의 가치와 허용 비용에 달려 있다.
과제에는 완료 한 건의 금전 가치, 장기 유료 유지, 고객당 미래 공헌이 없다. 따라서 2,000원이 수익성 있는 비용인지, B안의 광고보다 좋은지 확정할 수 없다. 결정을 위해 필요한 정보를 구체적으로 적는다. 장기 가치를 가정하여 시나리오를 만들 수는 있지만 관측된 LTV라고 표시하면 안 된다.
최종 판단 문서의 작성 예
판단 문서는 결론을 앞에 쓰고 적용 범위와 이유를 연결한다. C23의 한 가지 타당한 결론은 전면 출시를 보류하고 오류 원인과 가드레일의 불확실성을 먼저 해소하는 것이다. 기준과 조직의 허용 위험에 따라 제한 적용을 검토할 여지도 있지만, 그 경우 대상·중단 조건·모니터링을 구체화해야 한다. 단순한 낙관과 비관 중 하나를 고르는 과제가 아니다.
| 항목 | 작성 예 |
|---|---|
| 결정 | 예시 화면의 전면 출시는 보류. 오류 경로 수정·확인 후 새 계획으로 재평가 |
| 근거 | 완료 +3%p, 구간 +1.71~+4.29%p. 오류 +0.5%p이나 허용 증가 초과 가능성 미해소 |
| 경제성 | 추가 완료당 추가 제공 비용 점추정 2,000원. 장기 가치·고정비는 미확인 |
| 후속 업무 | 오류 코드·재시도·내용 복원 검수, 수정 버전의 비교 계획 |
| 유지할 자료 | 이번 배정·정의·버전·결과 기록. 수정 후 결과와 임의 합산하지 않음 |
| 판단 변경 조건 | 오류 손상이 정한 범위 이내이며 사용자 활용과 비용 조건을 충족하는 증거 |
| B안 처리 | 캠페인 증분 효과·고객 질·제공 비용 자료를 확보한 뒤 별도 비교 |
결론에 필요한 근거와 다음 업무
원본 정적 그림 보기

회의가 끝난 뒤에는 누가 어떤 자료를 언제 준비할지 과제로 연결한다. 문제를 발견했다는 사실을 실패로만 평가하면 불리한 결과가 문서에서 빠질 수 있다. 20장의 평가 원칙을 적용해 조기 발견과 기록의 기여를 함께 검토한다.
제출 전 점검과 채점 기준
이 과제는 지표가 상승했는지보다 정의·증거·가정·결정이 일관되는지 평가한다. 아래는 교육용 100점 평가표다. 실제 기업의 인사 평가에 사용하도록 만든 점수표는 아니다. 결측 자료를 정직하게 남기고 필요한 검증을 설계한 답안은 확정 결론이 없어도 충분히 좋은 평가를 받을 수 있다.
| 평가 영역 | 배점 | 충분한 답안의 조건 |
|---|---|---|
| 문제와 경험 | 20 | 해결책을 사용자 문제로 바꾸지 않고 가설임을 표시 |
| 지표 정의 | 25 | 단위·시간·분모·중복·오류·관찰 완료 일관 |
| 비교와 불확실성 | 25 | 경쟁 설명·배정·효과 크기·구간·손상 구분 |
| 결정과 운영 | 20 | 실행 범위·담당·판단 변경 조건 명시 |
| 근거와 재현 | 10 | 출처 범위·교육용 자료·계산 재현 가능 |
하나의 항목이 다른 항목의 공백을 가릴 수 없도록 정의와 분모의 중대한 오류는 별도로 표시한다. 공식이 맞더라도 다른 집단의 분모를 사용했다면 그 이후의 판단을 다시 작성해야 한다. 반대로 정성 자료가 없다는 한계를 밝혔다는 이유로 감점하지 않고, 필요한 조사 설계가 구체적인지 본다.
연습문제와 제출 과제
- ‘예시 문장이 없다’를 사용자 문제와 검증할 가설로 바꾸라.
- 기준선의 네 결과를 계산하고 18%를 일반적인 주2 리텐션이라고 부를 수 없는 이유를 쓰라.
- 실험의 유효 완료 지표 정의서를 완성하라.
- 관찰상 예시 이용자의 완료율이 높은 상황에 경쟁 설명 두 가지를 제시하라.
- 제공 결과의 주 지표·가드레일 차이와 구간을 해석하라.
- 평균 완료당 제공 비용과 추가 완료당 추가 비용을 계산하라.
- 전면 출시·제한 검증·보류 중 하나를 선택하고 부족한 자료와 변경 조건을 적으라.
- 담당 제품으로 네 제출물을 작성하고 위 평가표로 자기 검토하라.