16·17·18장의 독립된 교육용 입력·계산 자료다. 실제 실험을 실행하거나 실제 고객의 인과 효과를 입증한 자료가 아니다.
입력의 단위와 범위
| 입력 | 단위와 정의 | 연결 |
|---|---|---|
| composition | 13장 자료 C와 동일. 이전·이후 각 200명, 가입 당시 습관과 D7 완료 | 16장 3~4절 |
| duration | A·B 각 10명의 완료 과업, 분. 중앙값과 최근접 순위 P90 | 16장 1절 |
| cohort | 월초 시작 계약 100개씩. 시작 한 달·두 달 뒤 결과, 종료 8월 31일 | 16장 5절 |
| rfm | 고객 4명의 집계. 9월 1일 기준 최근성, [6월 1일,9월 1일) 거래 | 16장 7절 |
| survival | 계약 6개의 첫 해지 또는 행정 관찰 종료 경과 개월. 동률 없음 | 16장 8절 |
| ad | 사전 적격 20,000계정, 배정 각 10,000. 14일 창, 최대 구매 1건·5만 원 | 17장 |
| did | 두 집단 두 시점 지수 4개. 산술 차이만 계산 | 17장 7절 |
| experiment | 각 10,000계정의 배정 후 7일 완료·오류 이진 결과 | 18장 |
| srm | 별도 진단 예제. 예상 50:50, 관찰 5,200/4,800 | 18장 4절 |
| multiplicity | 독립인 참 귀무가설 20개의 이론적 오류 확률 | 18장 8절 |
구성비 자료 외에는 다른 장의 사용자와 연결되지 않는다. 입력은 설명용 집계 또는 작은 개별 기록이며 무작위화를 실제 실행한 로그가 아니다. AD는 8월 1일 00시부터 8월 15일 00시 미만 KST를 관찰한다. 취소·환불·추가 주문·고정비는 생략하고 매출과 광고비·공헌 비용을 구분한다. EXP는 [8월 1일,8월 15일) 모집, 계정마다 [0,168)시간의 결과를 관찰하고 8월 22일 이후 지연 수집 확인 뒤 확정한다. 완료와 오류는 동시에 발생할 수 있다.
계산의 가정
두 비율 차이 구간은 비풀링 Wald 정규근사이며 검정은 귀무가설 아래 풀링 분산의 양측 z검정이다. 표본 계획은 양측 α 5%·검정력 80%·동수 배정, 연속성 보정 없이 먼 쪽 꼬리를 생략하는 근사다. 두 비율의 독립성과 충분한 성공·실패 수를 가정한다. 군집·반복 관찰·희귀 사건에는 그대로 적용하지 않는다. 생존 추정은 첫 사건과 독립 검열 가정을 설명하는 작은 계산이며 신뢰구간·외삽을 제공하지 않는다.