Follow the Metrics for PM · 웹 교재 v1.0 · 2026-09-21
1. 결과의 단계와 판정
두 안 모두 서버 저장은 7/8 = 87.5%, 도움 포함 과업 완료는 6/8 = 75%, 독립 완료는 5/8 = 62.5%다. 저장 이후 계획을 다시 찾지 못한 한 과업이 있고, 완료자 중 한 명은 안내를 받았다.
서버 저장은 보존 결과, 도움 포함 완료는 저장과 재발견 결과, 독립 완료는 그 결과를 안내 없이 달성했는지를 나타낸다. 이 값들을 서로 대체하지 않는다.
2. 시간 계산과 기술
A의 평균은 (40+50+60+70+80+300)/6 = 100초, 중앙값은 (60+70)/2 = 65초다. B의 평균은 (55+60+65+70+75+95)/6 = 70초, 중앙값은 (65+70)/2 = 67.5초다.
보고 예: ‘이 교육용 자료에서 완료자 여섯 명의 평균 시간은 A 100초, B 70초로 B가 30% 짧다. 중앙값은 각각 65초와 67.5초다. A의 300초 사례가 평균에 큰 영향을 주며, 이 비교로 개편의 인과 효과를 판단하지 않는다.’
평균만 말하거나 중앙값을 유일한 정답으로 제시하지 않고, 각 요약값이 분포의 어떤 특징을 나타내는지 설명한다.
3. 완료자 시간의 범위
완료자만의 평균에는 완료자 수와 전체 과업 수, 도움 포함 여부, 미완료·중단의 수와 사유, 시간의 시작·종료 규칙을 함께 제시한다. 오래 걸려서 중단한 사람이 제외되면 완료자 평균만으로 전체 경험을 평가하기 어렵다.
모든 종료 시간을 합치면 A는 (600+120+180)/8 = 112.5초, B는 (420+90+150)/8 = 82.5초다. 이는 완료 또는 중단까지 관찰된 경과 시간의 평균이다. 미완료자가 완료하는 데 필요했을 시간을 추정한 값이 아니며, 포기가 빨라져도 낮아질 수 있다.
4. 오류 건수와 경험 범위
A의 과업당 오류는 11/8 = 1.375건, 오류 경험 과업 비율은 5/8 = 62.5%다. B는 5/8 = 0.625건과 4/8 = 50%다. 오류 건수의 평균은 확률이 아니므로 1을 넘을 수 있다.
총건수만으로는 오류가 몇 과업에 집중되었는지 알기 어렵고, 경험 비율만으로는 한 과업에서 얼마나 반복되었는지 알기 어렵다. 두 값 모두 오류의 심각도나 복구 부담을 직접 나타내지는 않는다. 원인 검토에는 개별 관찰 자료가 필요하다.
5. 설문과 미응답
응답률은 4/8 = 50%, 응답자 긍정 비율은 3/4 = 75%다. 미응답 네 명이 모두 비긍정이면 전체 긍정은 3/8 = 37.5%, 모두 긍정이면 7/8 = 87.5%다.
이 범위는 미응답에 관한 극단 가정이다. 표본을 다시 추출할 때 추정치가 어떻게 달라지는지 다루는 신뢰구간과 목적이 다르다. 여덟 참여자 바깥의 전체 사용자 만족도를 추정하는 구간으로도 사용할 수 없다. 미응답을 자동으로 0점이나 부정 응답으로 대체하지 않는다.
6. 차이와 개편 효과
과업과 성공 판정, 모집 집단의 경험·숙련도, 안의 배정 방식, 기기·네트워크 환경, 도움 제공 규칙, 반복 참여 시 순서·학습 효과 등을 정해야 한다. 필요한 표본 규모와 불확실성 보고 방식도 평가 목적에 따라 검토한다.
무작위 배정을 고려할 수 있지만 그것만으로 모든 문제가 해결되지는 않는다. 수행 조건이 다르거나 결과가 누락되면 비교가 왜곡될 수 있다. 작은 사용성 조사를 문제 발견에 쓰는지, 평균 효과를 추정하는 데 쓰는지 먼저 명시해야 한다.
7. 평가 계획서 검토
계획서에서 목적·과업·대상·환경·성공·시간·지원·오류·설문·비교·판단 기준이 연결되어 있는지 본다. 사용자가 실제로 무엇을 할 수 있어야 하는지 관찰 가능한 결과로 작성되어야 한다.
예를 들어 도움말 조회가 늘어난 상황은 관심 증가일 수도 있고 인터페이스 이해가 어려워진 결과일 수도 있다. 과업 완료율, 도움 없이 수행한 비율, 조회 전후의 진행, 사용자 관찰을 함께 확인할 수 있다. 조회 수 증가를 곧바로 품질 개선으로 해석하지 않는 평가 설계가 필요하다.
일률적인 성공률 기준을 정답으로 요구하지 않는다. 해당 서비스의 과업 위험, 현재 수준, 조사 목적, 표본과 자원에 맞춰 기준을 설명하고 결과를 보기 전에 정했는지가 중요하다.
계획서 검토에서는 과업 문구가 해결 경로를 미리 알려주지 않는지도 확인한다. 탐색 가능성을 평가하면서 클릭할 메뉴를 지정했다면 결과를 스스로 발견하는 과정이 빠진다. 시작 상태, 준비 자료, 안내 범위, 종료 조건을 맞추고 예외가 생겼을 때의 기록 방법을 마련한다. 평가 목적이 문제 발견인지 효과 비교인지에 따라 결과 문장의 범위를 다르게 정해야 한다.
8. 판정 기준과 평가자 일치
저장했지만 다른 주의 계획을 제시한 경우에는 서버 저장만 인정하고 전체 과업의 도움 포함 완료와 독립 완료는 인정하지 않는다. 안내를 받아 올바른 계획을 제시했다면 도움 포함 완료는 인정하고 독립 완료는 인정하지 않는다. 각각의 근거로 제시한 계획, 도움의 내용과 시점, 완료 상태를 남긴다.
평가자 간에는 올바른 계획의 판별 기준, ‘제시했다’고 인정할 증거, 도움에 해당하는 개입을 맞춘다. 참여자가 ‘찾았다’고 말한 사실만으로 충분한지, 내용이나 문서가 일치해야 하는지 명시한다. 예외 사례를 공동으로 판정하고 의견이 갈리는 규칙을 수정한다.
과업 중 안내를 잘못 제공했다면 그것을 기록하고 사전에 정한 처리 원칙을 적용한다. 해당 참여자의 결과가 좋다는 이유로 독립 완료에 포함하거나, 나쁘다는 이유로 표본에서 제거하는 방식은 적절하지 않다.
9. 평가 메모 작성
작성 예: ‘A·B 모두 독립 완료는 5/8, 도움 포함 완료는 6/8이었다. 완료자의 평균 시간은 A 100초, B 70초이며 중앙값은 65초와 67.5초다. 오류 총건수는 A 11건, B 5건이었다. B에서 관찰된 평균 시간과 오류 건수는 작지만, 두 집단은 교육용 자료이므로 개편의 인과 효과로 해석하지 않는다.’
남은 조건도 이어 쓴다. ‘A의 300초 사례와 두 안의 미완료 과업에서 어떤 경로 문제가 있었는지 현재 자료에는 기록되어 있지 않다. 해당 수행 기록을 확보해 원인별 수정 후보를 정한다. 만족 설문은 A에서만 수집되었고 응답도 4/8이므로 안 간 만족도 비교를 하지 않는다.’
후속 업무는 관찰 메모 확보, 오류 종류와 복구 과정 분류, 비교 조건 정리, 수정 후 재평가로 연결할 수 있다. ‘B를 전면 적용한다’는 결정이 이 자료에서 자동으로 도출되는 것은 아니다. 조직이 추가 조건을 고려해 결정한다면 어떤 근거와 미확인 범위를 감수했는지 별도로 남긴다.
평가에서는 결과의 존재, 크기, 원인, 일반화 범위를 구분하여 서술한다. 후속 업무가 ‘데이터를 더 모은다’로 끝나지 않고 어떤 불확실성을 줄여야 하는지까지 적혀 있는 답이 충분하다.