Follow the Metrics for PMWEB EDITION / 01

제1부 · 측정의 출발점

숫자가 좋아졌는데 제품은 좋아졌는가

사용량, 사용자 결과, 사업 성과. 숫자를 해석하기 전에 구별해야 할 세 가지.

01장교육용 자료 I1연습문제 해설 ↗

문서 작성 서비스의 이용 시간이 지난달보다 50% 늘었다. 보고서에는 참여도가 높아졌다고 적혀 있다. 다음 회의에서 PM은 이 결과를 근거로 새 편집 화면의 적용 범위를 넓혀야 한다. 그런데 고객지원팀에는 문서를 제출하는 방법을 찾기 어렵다는 문의가 들어와 있다. 이용 시간의 증가는 더 깊은 작업과 늘어난 불편 모두에서 나타날 수 있다. 평균 시간 하나로는 어느 설명이 맞는지 결정하기 어렵다.

제품 지표를 다루는 일은 이런 상황에서 시작한다. 숫자를 계산하기 전에 사용자가 이루려던 일, 회사가 판단하려는 일, 실제로 관찰한 것을 구분해야 한다. 이 책에서 지표(metric)는 정한 대상과 규칙에 따라 상태·행동·결과를 수량으로 나타낸 값이다. 지표가 커졌다는 사실과 제품이 좋아졌다는 판단 사이에는 설명하고 검토해야 할 관계가 있다.

이 장은 가상 문서 서비스의 교육용 자료 I1을 사용한다. 실제 사용성 조사나 제품 실험을 수행한 자료가 아니다. 독자는 사용량·사용자 결과·사업 성과를 구별하고, 지표를 선택하기 전에 작성할 의사결정 질문과 측정 계획의 초안을 만들게 된다. 구체적인 집계는 03장, 경험 평가는 08~10장, 원인 비교는 16~18장에서 확장한다.

01

사용자 목적과 화면 안의 행동

사용자 목적은 서비스를 이용해 얻으려는 결과다. 문서 서비스에서는 다른 사람이 검토할 수 있는 문서를 정해진 시점에 제출하는 일이 목적일 수 있다. 과업은 그 결과를 위해 수행하는 활동이다. 자료 찾기, 내용 정리, 문서 작성, 권한 설정, 전달이 이에 해당한다. 화면 클릭과 저장 요청은 그 과업 과정에서 발생하는 행동이다.

세 수준을 구분하면 측정의 범위도 달라진다. 사용자가 ‘공유’를 눌렀다는 로그는 공유 기능과 상호작용했다는 기록이다. 수신자가 실제로 열람 권한을 얻었는지, 올바른 문서가 전달되었는지, 제출 기한을 지켰는지까지 직접 알려주지는 않는다. PM이 어느 결과를 개선할 것인지 정하지 않으면, 구현하기 쉬운 이벤트가 사용자 목적을 대신하는 목표로 굳어질 수 있다.

수준 문서 서비스의 예 확인할 자료
목적 검토자가 필요한 내용을 제때 받는다 제출·수신·후속 검토의 결과
과업 작성·검수·권한 설정·전달 과업 관찰과 단계별 사건
행동 편집 화면 열기·저장·공유 누르기 이벤트 로그
경험 수신 여부를 알 수 없어 불안하다 사용자 진술과 실제 상황 대조

서비스의 화면 경계와 사용자 과업의 경계가 일치하는 것도 아니다. 작성 전에 외부 자료를 찾거나 공유 후 메신저로 수신 여부를 확인할 수 있다. GOV.UK의 서비스 설계 지침은 개별 서비스가 사용자의 전체 문제 안에서 어떤 부분을 담당하는지 파악하도록 설명한다. 이 책은 그 관점을 제품의 경험 범위에 적용한다. 전체 사용자 문제를 이해하는 지침 · S41 확인 범위.

PM은 모든 외부 행동을 수집할 필요가 없다. 현재 결정을 바꿀 가능성이 있는 구간을 먼저 정하고, 로그로 알 수 있는 부분과 조사로 보완할 부분을 나눈다. 제출 여부만 확인하면 되는 상황에서 문서 내용 전체를 분석 데이터로 가져오는 것은 목적에 비해 과도한 계측일 수 있다. 무엇을 모으지 않아도 되는지 정하는 일도 측정 설계에 포함된다.

02

사용량·사용자 결과·사업 성과

사용량은 서비스와 상호작용한 규모를 나타낸다. 활성 계정 수, 방문 횟수, 작성 시간, 저장 건수 등이 여기에 속한다. 사용자 결과는 사용자가 이루려던 과업이나 얻으려던 효용과 관련된 상태다. 올바른 문서 제출, 불필요한 재작업 감소, 필요한 정보의 이해 등이 예다. 사업 성과는 회사가 서비스를 계속 제공하는 데 관련된 수익·비용·유지·현금 등의 결과다.

이 세 범주는 연결될 수 있지만 같은 개념은 아니다. 사용량이 늘면 더 많은 고객이 결과를 얻을 수도 있고, 같은 결과를 얻기 위해 더 많은 노력을 쓴 것일 수도 있다. 사용자 결과가 좋아져도 가격·비용·계약 구조 때문에 회사의 공헌은 줄 수 있다. 사업 성과가 좋아졌다고 모든 사용자 집단의 경험이 함께 개선되었다고 할 수도 없다.

사용량·사용자 결과·사업 성과를 별도 관찰로 연결한다

예를 들어 자동화 기능은 문서 작성에 필요한 클릭 수와 체류시간을 줄일 수 있다. 같은 사람이 더 적은 노력으로 같은 품질의 문서를 완성한다면 사용량 감소는 목표에 맞는 변화다. 반면 긴 글을 읽고 이해하는 학습 서비스에서는 시간이 늘어난 이유를 콘텐츠의 난도·완료·이해 결과와 함께 봐야 한다. 지표가 어느 방향으로 움직여야 좋은지는 과업에서 정한다.

HEART 연구는 사용자 중심 목표를 관찰 신호와 지표에 연결하는 틀을 제시한다. 이 책은 이 연결 관점을 참고하되 모든 제품에 같은 항목을 강제하지 않는다. Rodden·Hutchinson·Fu의 연구 · S15. 아래 예제의 결과 판정과 표본은 교재가 직접 정한 것이다.

03

같은 시간 증가를 다시 읽는 작은 자료

I1의 A와 B는 같은 종류의 문서 제출 과업을 수행한 서로 다른 교육용 참여자 집단이다. 각 집단은 10명이고 한 사람당 한 과업을 시도한다. 과업 시작부터 제출 또는 포기까지의 종료 시간을 모든 참여자에게 기록했다고 가정한다. 최대 관찰 시간은 15분이며 모두 그 전에 종료했다. 이 값은 분석 도구의 자동 세션 시간이 아니다.

과업 성공은 필요한 내용이 있는 문서를 저장하고, 지정된 수신자가 열람할 권한으로 전달한 경우다. 성공 여부는 정한 검사 기준으로 확인했다고 가정한다. 오류 경험은 과업 중 저장 또는 전달 오류를 한 번 이상 겪었는지 나타낸다. 오류 후 재시도하여 성공할 수 있으므로 오류와 성공은 겹칠 수 있다.

집단 참여자별 종료 시간 · 분 성공자 시간 합 실패자 시간 합 성공 오류 경험
A 성공 8명: 2·3·4·5·5·6·7·8 / 실패 2명: 4·6 40분 10분 8/10 2/10
B 성공 6명: 4·5·6·7·9·11 / 실패 4명: 6·8·9·10 42분 33분 6/10 5/10

A의 전체 종료 시간은 50분, B는 75분이다. 참여자당 평균은 5분에서 7.5분으로 2.5분, 상대적으로 50% 늘었다. 과업 성공률은 80%에서 60%로 20%포인트 낮아졌다. 오류 경험률은 20%에서 50%로 높아졌다. 성공자만의 평균 시간도 5분에서 7분으로 늘었다.

자료의 관계를 읽기

평균에서 개인의 결과까지

종료 시간 · 분 / 두 집단 공통 축 0~12분

036912A평균 5B평균 7.5
01 / 03

평균의 위치를 먼저 본다.

A의 평균 종료 시간은 5분, B는 7.5분이다. 두 집단은 서로 다른 참여자 각 10명으로 구성된다.

종료 시간 · 분 / 두 집단 공통 축 0~12분

036912A평균 5A · 2분A · 3분A · 4분A · 5분A · 5분A · 6분A · 7분A · 8분A · 4분A · 6분B평균 7.5B · 4분B · 5분B · 6분B · 7분B · 9분B · 11분B · 6분B · 8분B · 9분B · 10분
02 / 03

같은 평균 뒤에 있는 개인을 펼친다.

점 하나는 한 사람의 종료 시간이다. 같은 시간에 끝난 사람은 세로로 쌓았다. 이 위치 변화는 자료를 펼쳐 보는 과정이다.

종료 시간 · 분 / 두 집단 공통 축 0~12분

036912A평균 5A · 2분 · 성공A · 3분 · 성공A · 4분 · 성공A · 5분 · 성공A · 5분 · 성공A · 6분 · 성공A · 7분 · 성공A · 8분 · 성공A · 4분 · 실패A · 6분 · 실패B평균 7.5B · 4분 · 성공B · 5분 · 성공B · 6분 · 성공B · 7분 · 성공B · 9분 · 성공B · 11분 · 성공B · 6분 · 실패B · 8분 · 실패B · 9분 · 실패B · 10분 · 실패
● 성공: A 8/10 · B 6/10× 실패: A 2/10 · B 4/10
03 / 03

끝난 시간에 과업 결과를 더한다.

원은 성공, ×는 실패다. 오래 머물렀다는 관찰만으로 성공이나 가치 경험을 판단할 수 없다.

원본 정적 그림 보기

이용 시간 증가와 성공률·오류 경험의 변화를 함께 읽는다

처음 보고한 시간 증가만으로 참여도가 좋아졌다고 쓰기에는 다른 결과와 충돌한다. I1에서는 B의 더 긴 시간과 낮은 성공률·높은 오류 경험을 함께 확인했다. 다만 집단을 무작위로 배정한 자료는 아니므로 새 편집 화면이 악화를 일으켰다고 확정할 수도 없다. 참여자의 경험, 과업 난도, 기기·네트워크 등 다른 조건을 확인해야 한다.

전체 종료 시간에는 실패자의 시간이 들어 있다. 이 시간을 모두 생산적인 문서 작성 시간으로 부르면 실패 과정의 부담이 성과처럼 해석된다. 반대로 성공자 평균만 보고하면 끝내지 못한 사람의 경험이 사라진다. PM은 완료율과 시간의 대상 집단을 함께 보고, 어떤 사람이 평균에서 빠지는지 확인한다. 10장은 이런 평가에서 분포와 중단을 더 자세히 다룬다.

04

관찰을 설명하는 경쟁 가설

경쟁 가설은 같은 관찰을 설명할 수 있는 서로 다른 설명이다. 시간 증가에는 사용자가 더 복잡한 문서를 만들었다는 설명, 조작과 복구가 어려워졌다는 설명, 기록 방식이 바뀌었다는 설명이 있을 수 있다. 어느 설명이 맞는지 확인하기 전에 수치를 하나의 이야기로 묶지 않는다.

가설 예상되는 다른 관찰 확인할 업무
가치 있는 작업이 늘었다 더 복잡한 결과물, 목표 달성·활용 증가 과업 난도·결과물·후속 활용 대조
이용 부담이 늘었다 오류·반복 탐색·실패·지원 요청 증가 과업 관찰, 오류 경로·중단 사유 확인
사용자 구성이 달라졌다 경험·기기·목적별 이용 차이 같은 집단 안의 변화와 구성비 비교
측정 방식이 바뀌었다 배포 시점의 시간·사건 정의 변화 이벤트 명세·버전·원장 대조

이 표의 행은 서로 배타적이지 않다. 새로운 고객이 늘면서 과업 난도와 이용 부담이 함께 변할 수 있다. 조사는 하나의 원인을 빨리 지목하는 과정이라기보다, 지금 가진 자료가 어떤 설명을 지지하거나 배제하는지 좁히는 과정이다. 큰 지표 변동일수록 먼저 정의와 수집을 확인하면 잘못된 행동 해석에 시간을 쓰는 일을 줄일 수 있다.

정성 자료도 같은 원칙을 적용한다. 한 고객이 ‘이전보다 복잡하다’고 말했다면 중요한 문제 후보가 생긴 것이다. 그 발언 하나가 전체 고객의 경험을 대표하지는 않는다. 발언자의 과업·기기·경험과 실제 행동을 함께 기록하고 다른 집단에서도 나타나는지 확인한다. 로그는 규모와 경로를 보여주고, 관찰·인터뷰는 맥락과 이유의 단서를 제공한다. 어느 자료도 다른 자료의 빈칸을 자동으로 채우지는 않는다.

05

규모와 비율을 함께 보아야 하는 이유

사용량을 무시하자는 결론도 적절하지 않다. 동일한 완료율에서 더 많은 적격 고객이 들어왔다면 결과를 얻는 고객 수도 늘 수 있다. 인력과 인프라를 준비하려면 절대 규모가 필요하다. 한편 전환율이 높아져도 들어오는 대상이 극히 적다면 사업 규모는 작을 수 있다. 규모와 비율은 다른 질문에 답한다.

I1과 독립된 단순 시나리오를 보자. 한 주의 적격 고객이 100명이고 80명이 과업을 마쳤다면 완료율은 80%다. 다른 주에 적격 고객이 200명으로 늘고 120명이 마쳤다면 완료율은 60%로 낮아졌지만 완료 고객 수는 40명 늘었다. 이때 ‘성과가 좋아졌다’는 표현만으로는 무엇이 개선되었는지 불분명하다.

PM은 결과를 얻은 규모, 결과를 얻을 기회가 있었던 사람 중 성공한 비율, 실패한 사람의 부담을 함께 적는다. 두 번째 주의 실패 고객은 80명으로 첫 주의 20명보다 많다. 확대된 유입이 어떤 지원 부담과 비용을 만들었는지 검토해야 한다. 두 집단의 의도·난도가 다르다면 완료율 차이의 원인도 추가 확인한다.

누적 가입자 수 같은 지표도 목적에 따라 유용할 수 있다. 계정 보관 규모나 이전 대상 수를 파악하는 업무에는 직접적인 의미가 있다. 제품 개선 효과를 평가하면서 최근 이용과 사용자 결과를 대신하는 숫자로 사용하면 해석 범위를 벗어난다. 이 책은 숫자 이름만으로 ‘좋은 지표’와 ‘쓸모없는 지표’를 고정하지 않고 사용 목적과 판단 관계를 검토한다.

직접 바꿔 보기 / 독립된 가정 시나리오

완료율이 낮아져도,
완료한 사람은 늘 수 있다.

첫 주는 적격 고객 100명, 완료율 80%로 고정한다.
다음 주의 규모와 비율을 바꿔 두 결과를 비교한다.

다음 주 완료율을 60%로 둔 채 고객 수를 줄여 보자. 완료 고객이 첫 주보다 많아지는 조건은 무엇인가? 미완료 고객 수도 함께 비교한다.

고정한 조건첫 주 적격 고객 100명, 완료 80명, 미완료 20명. 다음 주의 두 입력은 독립적으로 바꾼다.

완료 고객120명첫 주보다 40명 증가
미완료 고객80명첫 주보다 60명 증가
완료미완료동일한 축 · 0~500명
계산과 해석

200명 × 60% = 120명 완료. 완료율은 낮아졌지만 완료 고객 수는 늘었다.

입력한 비율을 인원에 적용하는 가정 계산이다. 실제 고객의 행동이나 정책의 인과 효과를 예측하는 모형은 아니다.

06

사용자 결과와 사업 조건의 긴장

사업 성과를 함께 보는 이유는 서비스를 계속 제공할 조건을 이해하기 위해서다. 가격을 낮추거나 사람의 지원을 많이 투입하면 일부 사용자 결과가 좋아질 수 있지만 비용 구조는 달라진다. 반대로 지원을 줄여 단기 비용을 절감하면 재작업·실패·해지가 늘 수 있다. 이 관계는 회사와 사용자의 이해가 항상 일치한다는 가정으로 정리할 수 없다.

여기서는 I1과 독립된 예산 시나리오를 사용한다. 완결된 과업 100건씩을 제공하는 A·B 정책의 비교라고 가정한다. 각 정책의 제공 매출은 100만 원, A의 변동 제공비는 40만 원, B는 70만 원이다. 개발 고정비와 세금 등은 제외한다. 이 범위의 공헌은 A 60만 원, B 30만 원이다. B에서 고객 결과가 더 좋을 가능성이 있어도, 이 표에는 그 크기와 장기 효과가 없다.

같은 매출에서도 제공 비용에 따라 공헌이 달라진다

B의 공헌이 낮다는 사실만으로 B를 폐기할 수는 없다. 더 나은 결과가 장기 유지·가격·지원 비용에 어떤 영향을 주는지, 고객에게 어떤 손상을 줄였는지 확인할 필요가 있다. 반대로 ‘장기적으로 좋아질 것’이라는 말로 비용 증가를 무기한 정당화해서도 안 된다. 검토할 결과, 기간, 허용 비용을 명시해야 한다. 자세한 공헌·현금·고객가치의 구분은 14장에서 설명한다.

사용자 집단 사이의 상충도 있다. 초보자를 위한 상세 안내가 숙련자의 작업 속도를 낮출 수 있고, 수요자를 빨리 연결하는 정책이 공급자의 불필요한 응답을 늘릴 수 있다. 평균 개선만으로 모든 집단에 같은 정책을 적용하지 않는다. 어떤 결과를 우선하고 어떤 손상을 허용할지 결정할 책임은 지표 밖의 제품 판단에 남는다. 지표는 그 선택을 드러내고 검토하게 한다.

07

개선 전에 작성하는 의사결정 질문

질문은 대상·변경·기대 결과·보호할 결과·평가 기간을 포함하도록 작성한다. ‘사용 시간을 늘리자’는 표현에는 사용자 목적과 적용 범위가 없다. I1의 상황에서는 ‘신규 개인 사용자가 문서를 정확히 전달하도록 공유 절차를 수정할지 판단한다’고 먼저 적을 수 있다. 그다음 성공 기준과 시간·오류를 어떻게 관찰할지 정한다.

문서 항목 문서 서비스의 작성 예
현재 결정 공유 절차 수정의 검증을 진행할 것인가
대상·과업 신규 개인 사용자, 지정 수신자에게 문서 제출
확인한 사실 교육용 B에서 평균 종료 시간 7.5분·성공률 60%·오류 경험 50%
설명 후보 절차 부담, 집단·과업 차이, 수집 변화
원하는 결과 정확한 전달과 불필요한 재작업 감소
필요한 관찰 권한·수신 확인, 오류·재시도, 중단 과정
보호할 결과 내용 손실·오발송·과도한 지원 비용
다음 업무 정의·수집 대조 후 같은 조건의 과업 관찰과 비교 계획
판단을 바꿀 자료 차이가 수집 오류·구성 변화로 설명되면 개선 가설 재설정

문제·관찰·해석·검증을 거쳐 결정 범위를 정한다

이 문서는 대시보드가 완성된 뒤에 쓰는 보고서만이 아니다. 계측 전에 작성하면 어떤 사건과 속성이 필요한지 개발 담당자와 협의할 수 있다. 현재 결정에 연결되지 않는 지표를 수집 목록에 넣는 이유도 확인할 수 있다. 측정 비용, 해석 비용, 유지 비용을 포함하여 필요한 범위부터 시작한다.

확실하지 않다는 이유로 모든 결정을 미루는 것도 적절하지 않다. 피해가 크고 되돌리기 어려운 변경과, 제한된 범위에서 쉽게 수정할 수 있는 변경은 필요한 증거의 수준이 다르다. 현재 아는 내용과 모르는 내용을 기록하고, 실행·추가 조사·보류 중 하나의 범위를 정한다. 이후 결과가 예상과 다르면 당시 판단을 숨기지 않고 가설과 정의를 수정한다.

08

이 책을 읽는 순서

지표의 역사와 학술적 연결은 04장~07장, 지식의 전파와 재인용은 19장에서 다룬다. 직접 영향이 확인된 관계와 방법의 공유, 교육적인 비교를 구분해 읽는다.

모든 장의 공식을 먼저 외울 필요는 없다. 사용자의 과업을 하나 고르고 01장의 질문서, 03장의 정의서, 08장의 경험 지도, 09장의 수집 계획을 연결해 읽는다. 현재 문제가 리텐션·수익·광고 효과라면 대응표에서 관련 장을 찾아 구체적인 계산으로 이동할 수 있다. 지표 이름을 처음 접했다면 지표·측정방법 요약집을 함께 사용한다.

이 책의 예제는 같은 서비스 이름을 공유하더라도 대부분 독립된 표본이다. 01장의 문서 과업과 이후 주간회고 자료를 하나의 기업 성과처럼 이어 붙이지 않는다. 용어·자료 안내에 장별 자료의 경계와 반복 개념의 위치를 정리했다. 숫자를 따라가는 일과 그 숫자가 만들어진 조건을 거슬러 확인하는 일을 함께 연습한다.

09

연습문제

  1. 문서 제출의 목적·과업·행동·경험을 각각 한 가지씩 정의하라.
  2. 사용 시간이 늘어나는 세 가지 설명과 설명별 추가 관찰을 적으라.
  3. I1의 전체 평균 종료 시간, 성공자 평균 시간, 성공률, 오류 경험률을 계산하라.
  4. I1에서 새 화면이 악화를 일으켰다고 확정할 수 없는 이유와 필요한 비교 조건을 쓰라.
  5. 적격 100명·완료 80명과 적격 200명·완료 120명의 변화에서 규모·비율·실패 규모를 비교하라.
  6. 같은 매출의 A·B 제공 정책에서 공헌을 계산하고 아직 판단할 수 없는 결과를 적으라.
  7. 누적 가입자 수가 유용한 결정과 해석 범위를 벗어나는 결정을 하나씩 제시하라.
  8. 담당 서비스의 의사결정 질문서를 작성하고 어떤 자료가 결론을 바꿀지 적으라.

해설과 평가 기준

10

근거와 다음 장

사용자 목표와 측정의 연결은 S15, 사용자의 전체 문제는 S41을 참고했다. 사용 시간·과업·경제성의 수치와 문서 양식은 교육용으로 제작했으며 해당 문헌의 실증을 재현한 것이 아니다. 02장에서는 한 관찰이 지표·모형·처방으로 바뀔 때 필요한 증거를 구분한다.

다음 장 · 02사실·지표·모형·처방의 경계