Follow the Metrics for PMWEB EDITION / 01

제5부 · 비교와 인과 추론

실험 설계에서 출시 판단까지

배정과 계측을 점검하고 효과의 크기·불확실성·손상을 함께 판단한다.

18장교육용 자료 EXP·독립 진단 예연습문제 해설 ↗

개념 먼저 보기: A/B 테스트 · 불확실성과 신뢰구간 · 검정력과 표본 규모 · 가드레일

주간회고 팀은 첫 작성 화면에 예시 문장을 넣으면 사용자가 회고를 더 쉽게 완성할 것이라고 예상했다. 무작위 비교에서 7일 안의 완료율은 기존 화면 30%, 새 화면 33%였다. 통계 검정에서도 두 비율이 같다는 가설과 잘 맞지 않는 결과가 나왔다. 그러나 같은 실험에서 저장 오류를 경험한 계정의 비율은 5%에서 7%로 올랐다. PM은 완료율 상승의 의미와 오류 증가의 손상을 함께 검토해야 했다.

실험은 정한 개입을 비교 가능한 집단에 배정하여 결과의 차이를 추정하는 절차다. A/B 테스트는 보통 두 버전의 비교를 가리키며, 화면 디자인뿐 아니라 가격 제시, 알림 정책, 추천 방식 등에도 적용한다. 실험을 실행했다고 모든 판단이 끝나는 것은 아니다. 측정할 결과, 독립적인 배정 단위, 관찰 기간, 통계적 불확실성, 업무상 허용 가능한 손상을 함께 정해야 한다.

이 장의 EXP는 독립 계정 20,000명의 이진 결과를 가정한 교육용 집계다. 실제 서비스에서 수집하거나 무작위 배정을 실행한 자료는 아니다. 큰 표본의 두 비율 비교 공식을 적용하여 판단 과정을 익힌다. 17장의 광고 표본과도 독립적이다. 이 장을 마치면 사전 실험 계획서와 종료 후 판단서를 작성할 수 있어야 한다.

01

가설과 판단 기준을 먼저 정하기

1.1 변경 사항을 결과와 연결하기

실험 가설은 바꿀 요소, 그 요소가 작용할 과정, 관찰할 결과를 연결한다. EXP의 가설은 “첫 작성 화면에 수정 가능한 예시 문장을 제공하면 작성 시작의 어려움이 줄어 신규 계정의 7일 내 첫 회고 완료율이 높아질 것”이다. 예시 문장을 눌렀다는 사실과 사용자가 유용한 회고를 완성했다는 사실은 다르므로 결과 이벤트의 조건을 함께 정한다.

개입의 범위도 고정해야 한다. 예시 문구와 저장 동작을 동시에 바꾸었다면 실험은 그 묶음의 효과를 추정한다. 결과가 좋더라도 문구만의 효과라고 분리할 수 없다. 구현 차이를 실험 명세에 기록하고, 배포 중 수정했다면 그 시점과 버전을 남긴다. 수정이 비교의 의미를 바꾸면 같은 실험 번호의 결과로 단순 합치지 않는다.

1.2 업무상 의미 있는 효과와 탐지할 효과

최소 가치 있는 효과는 비용과 사용자 결과를 고려할 때 조직이 얻고자 하는 최소 개선 폭이다. EXP에서는 초기 검토 기준을 완료율 +2%포인트로 두었다. 이 수치는 업계 기준이 아니라 교육 예제의 의사결정 조건이다. 개발·유지 비용, 대상 규모, 완료의 실제 가치가 다르면 기준도 달라진다.

최소 탐지 효과(MDE)는 정한 표본과 검정 절차가 어느 크기의 차이를 정한 검정력으로 찾아낼 수 있도록 설계되었는지를 나타낸다. 가치 기준은 업무상의 선택이고 MDE는 측정 능력의 계획이다. 두 값을 가깝게 설계할 수는 있지만 같은 개념은 아니다. 필요한 가치 기준이 +0.2%포인트인데 확보한 표본으로 +2%포인트만 겨우 탐지할 수 있다면, 유의하지 않은 결과가 나와도 필요한 질문은 해결되지 않을 수 있다.

“효과가 0보다 큰가”와 “효과가 2%포인트보다 큰가”도 서로 다른 검정 질문이다. 기준 2%포인트를 대립가설의 효과 크기로 넣어 검정력을 계산했다고 해서, 실험 종료 후 2%포인트 이상임을 입증하게 되는 것은 아니다. 어느 결정을 위해 어떤 불확실성을 감수할지 계획서에 적는다.

02

배정 단위·노출·분석 단위

2.1 무엇을 무작위로 나누는가

배정 단위는 버전을 정하는 대상이다. 계정, 조직, 기기, 지역 등이 될 수 있다. 결과가 여러 사람의 협업으로 만들어지는 서비스에서 개인을 따로 배정하면 같은 조직의 구성원이 서로 다른 경험을 공유할 수 있다. 이때 한 사람의 결과가 다른 사람의 배정에 영향을 받는 간섭이 생긴다.

EXP는 개인용 회고 기능이며 같은 사람이 계정 하나로만 사용하고 다른 사용자에게 실험 경험이 전파되지 않는다고 가정한다. 첫 적격 방문 전에 계정 단위로 A 또는 B를 배정하고 이후 방문에서도 유지한다. 실제 제품에서는 중복 계정, 로그인 전 기기와 로그인 후 계정의 연결, 조직 초대 경로를 확인해야 한다.

조직별로 배정했다면 결과를 구성원별로 수집하더라도 분석에서 조직 안의 상관을 반영해야 한다. 구성원 1만 명을 독립적으로 나눈 것처럼 표준오차를 계산하면 불확실성을 과소평가할 수 있다. 17장의 지역 실험과 같은 문제다. PM은 표본 수를 요청할 때 분석 대상 숫자와 독립적인 배정 단위 숫자를 함께 전달해야 한다.

2.2 배정과 실제 이용을 구분하기

A/B 실험에서는 배정되었지만 화면을 열지 않은 계정이 있을 수 있다. EXP의 주 분석은 배정된 적격 계정 전체를 대상으로 한다. 정책이 실제 운영에 도입되었을 때 사용하지 않는 사람까지 포함한 결과를 평가하려는 목적이다. 이런 배정 기준 분석을 intention-to-treat, ITT 관점이라고 부른다.

반대로 새 기능을 사용한 계정만 고르면 사용까지 도달하게 한 조건이 결과와 연결될 수 있다. 버튼을 누른 사람과 누르지 않은 사람의 차이를 실험 효과로 쓰지 않는다. 이용 여부는 전달 과정과 장애를 진단하는 보조 지표로 남긴다. 적절한 조건에서 노출 직전의 공통 자격을 기준으로 분석 대상을 제한할 수는 있지만, 조건이 양쪽에서 동일하게 관찰되고 변경 자체에 영향받지 않았는지 검토해야 한다.

자료의 관계를 읽기

실험의 결과 전에 기록의 연결을 확인한다

배정 원장부터 분석까지 확인한다. SRM 수치는 EXP 본 실험과 독립된 진단 예다.

01

적격성과 배정

변경 전에 공통 조건으로 대상과 정책을 정한다.

02

화면 전달

미전달과 미이용도 배정 원장에 남긴다.

03

결과 연결

한 계정에 같은 시간 창의 완료·오류를 연결한다.

04

분석 집단

양쪽의 제외·누락·버전을 대조한다.

제공된 자료에는 중간 단계별 인원 수가 없다. 화면을 이용한 사람만 선택하면 배정 기준 분석이 달라진다.

원본 정적 그림 보기

18-1. 적격성·배정·화면 전달·결과 수집을 분리한 실험 기록

2.3 결과를 한 계정당 한 값으로 만들기

EXP의 완료 지표는 배정 후 [0,168)시간에 유효한 회고를 한 번 이상 저장했으면 1, 그렇지 않으면 0이다. 유효성은 내용이 있는 회고가 서버에 저장된 것으로 정의한다. 내용의 실질적 유용함은 이 사건만으로 확정되지 않으며 별도 과업 평가가 필요하다. 계정이 세 번 완료해도 주 지표에서는 1이다.

이렇게 정의하면 분모는 적격 계정, 분자는 조건을 만족한 계정이다. 모든 세션의 저장 시도 수를 분모로 바꾸면 질문이 달라진다. 새 화면 때문에 시도 횟수가 늘었을 때 계정별 완료율과 시도별 성공률이 서로 다른 방향으로 움직일 수 있다. 둘 다 보고할 수 있지만 주 판단 지표의 정의를 결과를 본 뒤 교체하지 않는다.

03

주 지표·가드레일·진단 지표

주 지표는 실험의 핵심 목표를 평가하는 결과다. 가드레일은 목표를 개선하는 과정에서 허용 범위를 넘는 악화가 없어야 하는 결과다. 진단 지표는 개입이 어떤 과정을 통해 작동했는지와 구현 상태를 이해하는 데 사용한다. 같은 지표가 다른 실험에서는 다른 역할을 가질 수 있다.

역할 EXP의 정의 판단에 사용하는 방식
주 지표 배정 후 7일 내 유효 회고 완료 계정 비율 완료 가능성의 개선 크기와 불확실성
가드레일 같은 7일에 저장 오류를 한 번 이상 경험한 계정 비율 증가를 1%포인트 이내로 제한한다는 예제 기준
진단 화면 전달률·예시 선택률·저장 시도 수 미노출·과도한 재시도·개입 경로 확인
추가 결과 후속 주 회고·사용자 과업 평가 단기 완료의 지속성과 가치 검토

오류의 정의는 10장의 사건별 오류율과 다르다. EXP는 오류를 경험한 계정의 비중을 사용한다. 한 계정이 오류를 다섯 번 겪어도 여기서는 한 명으로 센다. 반복 피해의 강도는 오류 사건 수 분포로 보완할 수 있다. 완성과 오류는 동시에 발생할 수 있으므로 두 분자를 더해 전체 사용자 수로 해석하지 않는다.

가드레일 한계는 결과를 보고 정하지 않는다. 사용자 손상, 서비스 약속, 복구 비용을 고려해 미리 협의한다. 또한 주 지표가 통계적으로 유의하면 가드레일을 무시한다는 규칙은 적절하지 않다. 각 지표의 역할과 허용 기준을 함께 충족하는지 판단해야 한다. 심각한 데이터 손상이나 결제 오류는 통계적 유의성과 관계없이 즉시 대응할 운영 사건으로 정할 수 있다.

04

결과 해석 전에 실험 품질 확인하기

4.1 배정 비율 불일치

Sample Ratio Mismatch(SRM)는 의도한 배정 비율과 분석에 들어온 집단 비율의 차이가 우연한 변동으로 보기 어려운 상태를 뜻한다. 단순히 두 집단의 수가 정확히 같지 않다는 뜻은 아니다. 예상 배정 확률과 표본 규모를 함께 반영한 점검이 필요하다.

독립된 진단 예제로 50:50 배정을 계획했는데 분석 자료에 A 5,200명, B 4,800명이 남았다고 하자. 총 10,000명에서 기대 빈도는 각각 5,000명이다. 카이제곱 통계량은 (5200−5000)²/5000 + (4800−5000)²/5000 = 16이다. 자유도 1의 근사 p값은 약 0.000063이다. 이 수치는 배정·수집·필터링 경로를 조사할 강한 신호지만 어떤 단계가 원인인지 직접 알려주지는 않는다.

Microsoft의 공개 사례는 필터링이나 조건부 분석에서도 SRM이 발생할 수 있음을 설명한다. 이 장은 해당 기업의 경보 기준을 모든 팀의 표준값으로 사용하지 않는다. Microsoft ExP의 SRM 설명

4.2 수를 맞추는 것과 원인을 고치는 것

A에서 임의로 400명을 버려 4,800명씩 맞추는 방식은 누락 원인을 해결하지 못한다. B에서 특정 기기의 실패 계정이 빠졌다면 남아 있는 B 집단의 결과는 이미 선택되어 있다. 배정 원장부터 화면 전달, 이벤트 수집, 주문·계정 연결, 제외 필터 순으로 수를 대조한다. 어느 단계부터 차이가 발생했는지 확인한 뒤 복구 가능성과 실험 재실행 필요성을 판단한다.

SRM이 없다는 사실도 모든 품질 문제가 없음을 보증하지 않는다. 양쪽에서 같은 수가 누락되었더라도 결과와 관련된 누락 방식이 다를 수 있다. 이벤트 의미의 불일치, 시각 처리, 기기별 전달 실패, 버전 섞임을 함께 검수한다. A/A 테스트는 같은 경험을 두 집단으로 나누어 배정·집계 체계를 점검하는 수단이지만, 미래의 모든 개입에서 계측이 정확할 것이라는 인증은 아니다.

EXP의 본 계산은 각 10,000명의 결과가 모두 수집되었고 이 품질 조건을 충족했다고 가정한다. 앞의 5,200/4,800 진단 예제와 같은 실험이 아니다. 실제 업무에서는 가정을 확인한 검수 기록이 있어야 한다.

05

효과 크기·표준오차·신뢰구간·p값

5.1 먼저 효과의 단위를 읽는다

EXP에서 A는 10,000명 중 3,000명, B는 10,000명 중 3,300명이 완료했다. 완료율은 30%와 33%, 차이는 +3%포인트다. 상대 변화는 3 / 30 = 10%다. ‘완료율 10% 상승’만 적으면 +10%포인트인지 상대 10%인지 혼동할 수 있으므로 둘을 구분한다.

표본의 차이는 모집단 효과에 대한 점추정치다. 다른 적격 계정들로 같은 설계를 반복하면 관찰된 차이는 달라질 수 있다. 표준오차는 추정치가 그러한 반복 표집에서 얼마나 흔들리는지 나타내는 크기다. 사용자별 결과의 표준편차와 평균 차이 추정의 표준오차는 구분해야 한다.

5.2 두 비율 차이의 계산 예

독립 계정의 이진 결과, 충분한 성공·실패 수, 고정된 분석 시점을 가정한다. pA와 pB는 각 집단의 관찰 비율, nA와 nB는 집단 크기다. 이 예제는 설명을 위해 비풀링 표준오차를 사용하는 큰 표본 Wald 구간을 계산한다.

차이 d = pB − pA
SE(d) = √{pA(1−pA)/nA + pB(1−pB)/nB}
근사 95% 신뢰구간 = d ± 1.96 × SE(d)

EXP: d = 0.03
SE(d) ≈ 0.006566, 즉 0.657%포인트
구간 ≈ [0.01713, 0.04287], 즉 [1.71, 4.29]%포인트

표본이 작거나 비율이 0·1에 가깝다면 이 근사의 실제 포함률이 부정확해질 수 있다. NIST 문서는 조정된 구간 등 대안을 함께 설명한다. 비율 외에 주문 금액, 반복 방문, 조직 단위 결과를 분석할 때도 이 공식을 그대로 적용하지 않는다. 자료 구조와 배정에 맞는 방법을 선택한다. NIST의 두 비율 차이 신뢰구간

5.3 신뢰구간을 무엇으로 해석하는가

빈도주의 95% 신뢰구간은 가정이 충족된 상태에서 같은 절차를 반복했을 때 만들어진 구간들의 약 95%가 참값을 포함하도록 구성한 절차다. 이미 계산된 한 구간에 참값이 들어갈 확률이 95%라는 식으로 직접 바꾸지 않는다. 실무에서는 효과의 크기가 어느 범위까지 자료와 양립하는지, 그 범위가 판단 기준을 얼마나 가로지르는지 검토하는 데 사용한다.

EXP의 구간은 0보다 위에 있어 완료율이 같다는 가설과는 잘 맞지 않는 결과다. 그러나 하한 1.71%포인트는 업무 기준 2%포인트보다 낮다. 점추정 3%포인트가 기준을 넘었다고 해서 참효과도 2%포인트를 넘는다고 같은 신뢰 수준으로 확정할 수는 없다. 목표 크기와 불확실성을 함께 적어야 하는 이유다.

자료의 관계를 읽기

효과의 구간을 두 판단 기준에 대조한다

비율 차이 · %p · 점: 추정값 / 선: 명목 95% 구간

완료 증가

-20246기준 0%p+1.71 ~ +4.29%p

오류 증가

-20246기준 +1%p+1.34 ~ +2.66%p
완료율 차이+3%p
현재 비교할 기준효과 0

독립 계정·큰 표본 Wald의 각 지표별 명목 95% 구간. 동시 95% 보장이나 손상과 효용을 합친 종합 점수가 아니다.

01 / 03

완료의 차이는 0보다 크다.

EXP의 완료율은 30%와 33%다. 차이의 명목 95% 구간은 +1.71~+4.29%p이며 0보다 위에 있다.

비율 차이 · %p · 점: 추정값 / 선: 명목 95% 구간

완료 증가

-20246기준 +2%p+1.71 ~ +4.29%p

오류 증가

-20246기준 +1%p+1.34 ~ +2.66%p
완료율 차이+3%p
현재 비교할 기준최소 가치 +2%p

독립 계정·큰 표본 Wald의 각 지표별 명목 95% 구간. 동시 95% 보장이나 손상과 효용을 합친 종합 점수가 아니다.

02 / 03

가치 기준 +2%p도 함께 본다.

점추정 +3%p는 기준을 넘지만 구간 하한은 +2%p보다 낮다. 0과의 차이와 최소 가치 이상의 효과는 다른 질문이다.

비율 차이 · %p · 점: 추정값 / 선: 명목 95% 구간

완료 증가

-20246기준 +2%p+1.71 ~ +4.29%p

오류 증가

-20246기준 +1%p+1.34 ~ +2.66%p
오류 경험률 차이+2%p
현재 비교할 기준허용 손상 +1%p

독립 계정·큰 표본 Wald의 각 지표별 명목 95% 구간. 동시 95% 보장이나 손상과 효용을 합친 종합 점수가 아니다.

03 / 03

오류 손상은 별도로 검토한다.

오류 증가 구간 +1.34~+2.66%p는 허용 경계 +1%p보다 위다. 완료 개선이 이 손상을 상쇄한다고 합산하지 않는다.

원본 정적 그림 보기

18-2. 주 지표의 개선과 가드레일 악화의 신뢰구간을 각각의 기준과 비교

5.4 p값과 통계적 유의성

p값은 귀무가설과 분석 모형을 가정했을 때 현재 관찰한 것만큼 또는 그보다 더 극단적인 검정통계량을 얻을 확률이다. 귀무가설이 참일 확률, 실험의 성공 확률, 결과가 우연일 확률로 해석하지 않는다. ASA는 p값 하나가 효과 크기나 의사결정의 중요성을 대신하지 못함을 명시한다. ASA 공식 발표문

이 예제에서 귀무가설은 두 집단의 완료 비율이 같다는 것이다. 성공 수를 합쳐 구한 비율 0.315를 사용하는 풀링 표준오차로 z통계량을 계산하면 약 4.567이고, 양측 p값은 약 0.00000495다. 신뢰구간 계산에서는 각 집단의 관찰 비율을 사용했고, 이 검정에서는 같은 비율이라는 귀무가설 아래 풀링 값을 사용했다. 두 계산의 표준오차가 약간 다른 이유다. NIST의 두 비율 검정

이 작은 p값이 저장 오류 증가를 상쇄하지는 않는다. 표본이 매우 크면 업무상 중요하지 않은 작은 효과도 작은 p값을 가질 수 있고, 표본이 작으면 중요한 손상을 배제하지 못한 채 유의하지 않게 나올 수 있다. 통계적 유의성과 출시 판단은 서로 다른 단계다.

06

검정력과 표본 규모를 정하기

6.1 오류 수준과 탐지 능력

유의수준 α는 귀무가설이 참일 때 정한 검정 절차가 이를 잘못 기각하는 장기 비율의 기준이다. 검정력은 정한 대립 효과가 실제로 있을 때 그 절차가 귀무가설을 기각할 확률이다. 1−β로 표시하며 예를 들어 80% 검정력은 지정한 효과와 가정 아래 반복 실험의 약 80%에서 탐지한다는 의미다. 실험이 성공할 확률이나 제품 출시가 성공할 확률은 아니다.

계획에는 기준 비율, 탐지할 절대 차이, 유의수준, 단측·양측 여부, 목표 검정력, 배정 비율이 필요하다. 연속 금액이면 변동성도 필요하고 조직 배정이면 조직 간·내 변동도 필요하다. 평균 방문자 수만 전달하여 표본 규모를 정해 달라고 할 수는 없다.

6.2 두 비율 예제의 계획값

EXP는 기준 30%와 대립값 32%를 비교하고, 양측 유의수준 5%, 검정력 80%, 동수 배정을 계획한다. 독립 이진 결과의 정규근사이며 연속성 보정은 하지 않는다. 양측 검정에서 효과 반대편의 먼 꼬리 확률을 생략하는 계획 근사다. 공식 방법 설명 p̄는 두 계획 비율의 평균, z는 표준정규분포의 분위수다.

집단별 필요 n ≈
{z0.975 × √[2p̄(1−p̄)] + z0.8 × √[p0(1−p0)+p1(1−p1)]}²
────────────────────────────────────────────────────────
                         (p1−p0)²

p0=0.30, p1=0.32 → 집단별 8,394명, 합계 16,788명
p0=0.30, p1=0.31 → 집단별 33,275명, 합계 66,550명

탐지하려는 차이를 절반으로 줄이면 필요한 표본은 이 예에서 약 네 배로 늘어난다. 식의 분모에 효과 차이의 제곱이 들어가며 분자의 비율도 조금 바뀌기 때문이다. 이 계산은 계획 근사값이지 모든 도구가 같은 정수로 반환해야 하는 보편 표준은 아니다. 선택한 검정법, 보정, 배정 비율에 따라 달라질 수 있다.

직접 계산 실습 / 원자료와 조건을 대조하기

더 작은 차이를 알아보려면 얼마나 필요한가

기준선 30%에서 더 작은 차이를 탐지하도록 계획하면 집단별 필요 표본이 어떻게 달라지는지 계산한다.

MDE를 2%p에서 1%p로 줄이면 표본은 두 배가 되는가?

고정한 조건양측 α=5%, 검정력 80%, 동일 크기 두 집단, 독립 이진 결과의 정규근사. 가드레일 표본·모집 기간·반복 검정은 별도 계획이다. 효과가 MDE 이상임을 입증하는 계산이 아니다.

공통 축 0~140,000계정 / 군

MDE 2%p · 기준
8,394 / 군
MDE 2%p · 선택
8,394 / 군
선택 조건의 집단별 표본8,394개
두 집단 총 표본16,788개
현재 제공된 결과 표본10,000개 / 군

p₀=0.30, p₁=0.32
n = ceil{ [1.960√(2p̄(1−p̄)) + 0.842√(p₀(1−p₀)+p₁(1−p₁))]² / (p₁−p₀)² }

표시는 반올림했지만 계산에는 정규분포의 정밀한 분위수를 사용한다. 표본 수를 확보해도 마지막 배정 계정의 결과 창과 수집 지연까지 기다려야 한다. 유의한 결과가 나올 때까지 연장하는 계획이 아니다.

원본 정적 그림 보기

18-3. 2%포인트와 1%포인트 차이를 탐지하기 위한 집단별 계획 표본

계획 시 기준 30%가 부정확할 수 있으므로 최근의 비교 가능한 자료로 확인하고 민감도를 검토한다. 주 지표뿐 아니라 가드레일의 정밀도도 필요한 수준인지 확인한다. 주 지표만 충분히 볼 수 있는 표본으로 미세한 품질 손상이 없다고 결론 내리지 않는다. 이번 예제의 10,000명씩이라는 수는 모든 서비스의 권장 실험 규모가 아니다.

표본을 모집할 수 없으면 탐지 범위를 명시하고 개발 범위·노출 대상·평가 방법을 조정한다. 표본 부족을 감추기 위해 결과를 본 뒤 단측 검정으로 바꾸거나 유의수준을 높이지 않는다. 사용성 조사나 계측 검수는 다른 질문을 보완할 수 있지만, 작은 인과 효과의 정밀한 추정을 대체했다고 설명하지 않는다.

07

모집 기간과 결과 관찰 기간

EXP의 모집은 [8월 1일 00시, 8월 15일 00시) KST에 이루어졌다고 가정한다. 각 계정은 배정 시점부터 168시간을 관찰한다. 마지막 모집 계정의 결과 창까지 끝나고 로그 지연이 해소된 뒤인 8월 22일 이후에 결과를 확정한다. 모집 마지막 날 바로 분석하면 늦게 들어온 계정은 실패로 판정될 기회가 더 크다.

기간에는 표본 확보 외의 조건도 있다. 업무용 제품이라면 요일별 업무가 다를 수 있고, 급여일이나 프로모션이 결과에 영향을 줄 수 있다. 예상 표본을 빨리 모았다고 필요한 업무 주기를 생략하지 않는다. 반대로 달력으로 2주를 채웠다고 충분한 검정력이 자동으로 생기지도 않는다. 계획서에는 최소 모집·관찰 조건과 최대 기간에 도달했을 때의 처리 규칙을 함께 둔다.

새 기능의 첫날 반응이 이후에도 유지되는지 검토할 수 있지만, 매일의 결과 중 가장 좋은 날만 골라 최종 효과로 쓰지 않는다. 초기 학습이나 신기함이 중요한 경우에는 시점별 결과를 사전에 보조 분석으로 정한다. 긴 기간의 효과가 필요한 제품은 장기 비교나 별도 추적을 설계한다. 짧은 실험의 값을 연간 효과로 단순 곱할 때는 지속성 가정을 밝혀야 한다.

08

반복 확인과 다중 비교

8.1 매일 보다가 유의해지면 멈추는 경우

고정된 분석 시점용 검정에서 매일 p값을 확인하고 0.05 아래로 내려간 날 종료하면, 계획한 검정 절차와 다른 선택을 하게 된다. 중간 결과는 서로 상관되어 있으므로 20번 봤다는 이유만으로 독립 검정 20개의 공식에 넣을 수도 없다. 반복 확인의 구조를 반영한 순차 검정이나 알파 지출 같은 방법을 사전에 선택해야 한다. 이 장의 계산은 고정 분석 시점 방식이다.

운영 장애를 감시하는 것과 유리한 통계 결과를 기다리며 멈추는 것은 목적이 다르다. 중간에는 노출 실패·심각한 오류·데이터 손상을 감시하고, 정한 중단 조건이 발생하면 보호 조치를 할 수 있다. 다만 조기 종료한 결과를 처음 계획한 고정 표본 검정의 최종 성과처럼 보고하지 않는다. 종료 사유와 이후 분석의 지위를 함께 기록한다.

8.2 많은 지표와 집단을 동시에 확인하는 경우

모든 귀무가설이 참이고 서로 독립인 20개 검정을 각각 5% 기준으로 판단한다면, 하나 이상 잘못 기각할 확률은 1 − 0.95²⁰ ≈ 64.2%다. 이는 다중 비교의 원리를 설명하는 계산이다. 실제 제품 지표들은 서로 관련되므로 그대로 실제 오류율이라고 적용하지 않는다.

분석을 시작하기 전에 주 지표와 주요 비교를 좁히고, 동시에 판단할 가설 묶음에 맞는 조정 절차를 선택한다. 예를 들어 Bonferroni 방식은 묶음의 α를 검정 수로 나누는 간단한 방법이며 독립성을 요구하지 않지만 보수적일 수 있다. 어떤 가설을 묶었는지와 검정 목적에 따라 적합한 방식은 달라진다.

결과를 본 뒤 발견한 특정 기기의 큰 상승은 원인 조사에 유용할 수 있다. 다만 이를 전체 실험의 확정 성과처럼 선택해 보고하지 않는다. 해당 패턴이 계측 오류인지 제품 작동 차이인지 먼저 확인하고, 의미 있는 가설이라면 후속 실험이나 독립된 자료로 검증한다. 탐색을 금지하는 것이 아니라 탐색이 어떤 증거를 제공하는지 정확히 표시하는 것이다.

09

유의한 개선을 얻어도 출시하지 않을 수 있다

EXP의 오류 경험 계정은 A 500명, B 700명이다. 오류율은 5%와 7%로 +2%포인트 증가했다. 같은 큰 표본 근사로 구한 95% 신뢰구간은 약 +1.34~+2.66%포인트다. 사전 허용 증가 한계 +1%포인트를 구간 전체가 넘는다. 주 지표는 개선되었지만 품질 가드레일을 충족하지 못한 결과다.

검토 항목 결과 판단에 남길 내용
완료율 +3%p, 95% 구간 +1.71~+4.29%p 양의 변화, 업무 기준 +2%p 초과는 같은 수준으로 확정 못 함
오류 경험 +2%p, 95% 구간 +1.34~+2.66%p 예제의 허용 증가 +1%p를 넘는 손상
계측·배정 예제에서는 적합하다고 가정 실제 업무에는 검수 기록이 필요
장기 결과 아직 제공하지 않음 단기 완료로 유지 개선을 확정하지 않음
결정 현재 버전의 전체 출시 보류 저장 오류 원인 수정 후 새 계획으로 재평가

이 구간들은 각각의 지표에 대한 명목 95% 구간이며 두 지표를 동시에 덮는 95% 구간이 아니다. 실무에서 여러 가드레일을 정식 판정에 사용한다면 다중성 처리까지 계획해야 한다. 이 장은 주 지표의 유의성이 관찰된 품질 손상을 면제하지 않는다는 결정을 설명한다.

18-4. 실험 품질·효과 크기·부작용·적용 범위를 거치는 출시 검토

유의하지 않은 결과에도 여러 경우가 있다. 구간이 큰 손상과 큰 이익을 모두 포함하면 자료가 부족한 것이다. 구간 전체가 업무상 무시할 범위 안에 있는지는 별도의 동등성 기준과 절차로 검토할 수 있다. p값이 0.05보다 크다는 이유만으로 효과 없음이나 동등함을 입증했다고 쓰지 않는다. 반대로 점추정이 좋아 보인다는 이유로 불확실성의 범위를 감추지도 않는다.

실험의 적용 범위도 남겨야 한다. 신규 개인 계정의 첫 주 효과를 기존 유료 조직의 장기 이용으로 일반화하려면 추가 근거가 필요하다. 전체 출시 후 트래픽 규모와 운영 부하가 달라질 수 있으므로 단계적 확대와 모니터링을 운영 계획에 연결한다. 실험은 판단 근거를 제공하고, 출시는 그 근거와 비용·품질·적용 범위를 함께 검토하는 결정이다.

10

사전 계획서와 종료 보고서

10.1 사전 계획의 작성 예

항목 EXP의 교육용 계획
업무 문제 첫 회고를 어떻게 시작해야 할지 몰라 중단하는 신규 사용자
개입 수정 가능한 예시 문장을 제공하는 화면 B와 기존 A
모집단·배정 사전 적격 신규 개인 계정, 계정 단위 50:50, 배정 유지
주 결과 배정 후 168시간 미만 유효 회고 완료 계정 비율
가치 기준 +2%p를 업무 검토 기준으로 설정
분석 배정 전체, 양측 두 비율 비교, 고정 종료, 효과와 구간 보고
표본 계획 30→32%, α 5%, 검정력 80%, 최소 8,394명씩; 계획 목표 10,000명씩
품질 기준 오류 경험 증가 +1%p 이내, 별도 진단과 운영 중단 조건
시간 14일 모집과 각 계정 7일 관찰, 수집 지연 확인 후 확정
예외 처리 배정·계측 장애는 원인 기록 후 분석 보류, 임의 표본 삭제 금지
탐색 기기별 결과는 탐색으로 표시, 추가 확정 주장은 후속 검증
결정 책임 PM·개발·분석·운영이 효과·품질·확대 조건을 함께 검토

10.2 종료 후 판단의 작성 예

사전 정의에 따라 관찰을 마친 계정은 각 10,000명이다. 유효 회고 완료율 차이는 +3%포인트이며 95% 큰 표본 근사 구간은 +1.71~+4.29%포인트다. 양의 효과를 지지하지만 업무 기준 +2%포인트 초과를 같은 신뢰 수준으로 확정하지는 못한다. 오류 경험은 +2%포인트, 구간 +1.34~+2.66%포인트로 사전 허용 증가를 넘는다. 현재 버전의 전체 출시를 보류하고 저장 동작을 점검한다. 수정 사항을 명세에 반영한 뒤 새로운 실험 계획으로 평가한다. 최초 실험의 결과와 수정 버전의 결과를 하나의 성공 수치로 합치지 않는다.

실험 문서에는 유리한 결과뿐 아니라 잘못된 계측, 불확실한 결과, 수정 뒤 반복되지 않은 가설도 남긴다. 다음 PM이 같은 제안을 다시 검토할 때 무엇을 배웠고 어떤 조건이 달랐는지 알 수 있어야 하기 때문이다. 실험 수나 성공 비율만으로 조직의 학습을 평가하면 작은 변경을 많이 만들거나 유리한 결과만 남기는 유인이 생길 수 있다. 이후 지표 운영 단원에서는 이러한 조직적 사용을 다룬다.

역사적으로 온라인 A/B는 무작위 비교와 통계적 추론을 제품 운영에 적용하면서 식별자, 빠른 배포, 반복 노출, 계측 손실 같은 문제를 추가로 다루게 된 형태다. 이 장에서는 방법의 공유와 실무 구현을 구분한다. 특정 도구가 새 용어로 제공한다는 사실만으로 가정과 해석이 달라지는 것은 아니다.

11

연습문제

  1. EXP의 가설을 개입·작동 과정·결과로 나누어 작성하라. 예시 문구와 저장 로직을 동시에 바꾸면 추정 대상은 어떻게 달라지는가?
  2. 조직 내 협업 결과를 개인별 무작위 배정으로 평가하려는 계획의 문제를 설명하라. 배정 단위와 분석 단위를 어떻게 협의해야 하는가?
  3. A 3,000/10,000, B 3,300/10,000으로 절대·상대 차이와 신뢰구간을 계산하라. 구간 하한과 업무 기준 +2%p를 비교하라.
  4. p값 0.00000495를 “제품 성공 확률이 99.9995%”라고 설명한 보고서를 수정하라.
  5. 50:50 배정인데 분석 집단이 5,200명과 4,800명이었다. SRM 통계량을 계산하고 확인할 처리 단계 세 가지를 적어라. 인원을 강제로 맞추면 해결되는가?
  6. 2%p 대신 1%p를 탐지하려면 필요한 표본이 어떻게 달라지는가? MDE와 최소 가치 있는 효과가 다른 이유를 설명하라.
  7. 마지막 모집일에 새로 배정된 계정을 미완료로 확정하고 실험을 종료했다. 무엇이 잘못되었으며 언제 결과를 확정해야 하는가?
  8. 독립인 참 귀무가설 20개를 각각 5%로 검정할 때 하나 이상 잘못 기각할 확률을 구하라. 매일 같은 누적 자료를 본 경우에 이 공식을 그대로 쓸 수 있는가?
  9. 주 지표와 오류 가드레일 결과를 사용하여 출시 판단서를 작성하라. 결과가 유의하지 않은 경우 ‘효과 없음’과 ‘자료 부족’을 어떻게 구분해 검토할지도 적어라.

해설과 작성 예시

12

참고 문헌과 확인 범위

출처 사용 범위 확인과 한계
S13 · Kohavi 외 온라인 실험의 조직 적용 배경 기존 초록·서지. 최초 명명 시점은 확정하지 않음
S14 · Dmitriev 외 세그먼트·반복 확인·지표 해석 논문 관련 절 재확인. 기업 효과 크기는 인용하지 않음
S52 · NIST 신뢰구간·표본 계획의 개념 기존 방법 절. 단일 평균 공식을 이진 실험에 전용하지 않음
S53 · ASA p값의 의미와 해석 한계 공식 발표문 3쪽. 학술지 논평 전체 확인은 아님
S56 · Microsoft ExP SRM의 정의와 원인 조사 공개 연구팀 설명. 경보 기준의 보편화 없음
S57 · NIST 두 비율 검정·신뢰구간 공개 산식과 조건. 교육용 집계에서 계산
S58 · statsmodels 두 비율 계획 표본의 정규근사 구조 공식 문서의 계획식. 코드 실행 결과로 가장하지 않음

이전 장: 광고 증분효과

다음 장 · 19사례는 어떻게 만능 프레임워크가 되는가