개념 먼저 보기: 과업 성공률 · Task Success Rate · 과업 소요 시간·응답 지연 · 오류율·재시도·재작업 · 고객 만족도 · CSAT · 고객 노력 점수 · CES · HEART·Goals–Signals–Metrics · 단원 대응표
회고 저장 기능을 정상적으로 계측하면 누가 언제 내용을 보존했는지 확인할 수 있다. 그러나 저장 이후에 사용자가 원하는 계획을 찾을 수 있는지, 그 과정에서 어느 정도의 도움과 시간이 필요한지는 별도의 평가 대상이다. 서비스 기획의 결과를 검토할 때에는 시스템 처리 결과와 사용자가 수행하려던 과업의 결과를 연결해야 한다.
이 장에서는 ‘회고를 저장한 뒤 목록으로 돌아가, 방금 작성한 다음 주 계획을 다시 찾아 제시한다’는 과업을 평가한다. 자료 U는 A안과 B안에 여덟 명씩 참여한 상황을 가정하여 만든 교육 자료다. 실제 사용성 조사나 무작위 실험의 결과가 아니며, 두 안의 차이로 개편의 인과 효과를 주장하지 않는다. 계산과 해석을 통해 평가 계획서, 결과표, 개선 검토 기록을 작성하는 방법을 익힌다.
사용성 평가와 제품 지표의 연결
과업을 평가할 때에는 사용자가 목적을 달성했는지, 어떤 자원을 사용했는지, 그 경험을 어떻게 평가하는지 살펴본다. 이때 같은 기능이라도 이용자, 과업, 기기, 환경, 도움의 허용 범위에 따라 결과가 달라질 수 있다. 사무실의 큰 화면에서 익숙한 사용자가 수행한 결과를 이동 중인 신규 사용자의 경험과 같은 것으로 볼 수는 없다.
사용성에 관한 ISO 9241-11:2018의 공식 소개는 사용성을 이용의 결과로 다루며, 개념을 이해하고 적용하기 위한 틀을 제공한다고 설명한다. 구체적인 평가 절차를 하나로 지정하는 표준은 아니다. 이 장은 공개 소개의 범위를 참고하고, 아래 과업·시간·도움 기준은 주간회고를 위한 자체 평가 설계로 제시한다. 유료 표준 전문은 열람하지 않았다. 공식 소개 · S43
제품의 대규모 이용 기록과 사용자 중심 평가를 연결한 문헌으로는 Rodden·Hutchinson·Fu의 CHI 2010 논문이 있다. 논문은 HEART의 다섯 범주인 Happiness, Engagement, Adoption, Retention, Task success와 목표에서 신호·지표로 구체화하는 과정을 제안한다. 모든 범주를 반드시 채우는 방식은 아니다. 논문 정보 및 저자 원고 · S15
이 교재에서는 이 틀을 평가 항목의 빠짐을 검토하는 참고로 사용한다. 주간회고의 이번 개편에서는 과업 완료와 시간·오류, 주관적 이용 평가를 우선 살펴본다. 반복 이용은 별도 관찰 기간이 필요한 항목으로 13장과 연결한다. 평가 목적을 먼저 정한 뒤 필요한 항목을 고르면, 프레임워크의 칸을 채우기 위해 관련성이 낮은 지표를 늘리는 일을 줄일 수 있다.
평가 목적에 따라 달라지는 조사 설계
서비스 평가에는 문제의 발견, 현재 수준의 기술, 변경 효과의 비교라는 서로 다른 목적이 있다. 문제를 찾는 평가에서는 사용자가 막히는 지점과 그 과정을 자세히 관찰한다. 현재 수준을 설명하려면 누구를 어떤 조건에서 관찰했는지 밝히고, 성공·시간·오류의 분포를 정리한다. 변경의 효과를 비교하려면 안의 배정과 수행 조건을 맞추고, 차이의 불확실성까지 검토해야 한다.
한 번의 조사에서 여러 목적을 다룰 수는 있지만 각 결론에 필요한 조건이 같다며 생략해서는 안 된다. 계획을 찾지 못하는 구체적인 사례를 발견하면 해당 경로를 수정할 이유를 얻을 수 있다. 그 사례만으로 전체 사용자의 몇 퍼센트가 같은 문제를 겪는지 알 수는 없다. 반대로 전체 완료율이 낮다는 자료가 있어도 어느 문구나 화면을 고쳐야 하는지는 추가 관찰이 필요하다.
| 평가 질문 | 우선 확보할 자료 | 결과 문장의 범위 |
|---|---|---|
| 어디서 어려움을 겪는가 | 수행 관찰·상태·당사자 설명 | 관찰된 문제와 발생 조건 |
| 이 조건에서 얼마나 완료하는가 | 명확한 대상·과업·판정·분모 | 해당 평가 표본의 완료 수준 |
| 변경 때문에 좋아졌는가 | 비교 가능한 집단·배정·조건·결과 | 설계가 뒷받침하는 효과와 불확실성 |
주간회고의 이번 자료는 계산과 판정 방법을 익히기 위한 예제다. 실제 프로젝트에 적용할 때는 위 질문 중 무엇이 우선인지 먼저 정한다. 이에 따라 참여자 모집, 과업 수, 필요한 기록, 결과 보고의 형식이 달라진다. 표본 수를 늘리는 일도 질문을 정한 뒤에 검토해야 한다. 조건이 불명확한 자료를 더 많이 모은다고 해석이 자동으로 명확해지지는 않는다.
과업과 성공 판정 기준
평가에 사용할 과업은 참여자가 실제로 하려는 일을 반영해야 하며, 성공을 관찰할 수 있을 만큼 구체적이어야 한다. ‘서비스를 써 보세요’라는 요청은 이용 범위가 참여자마다 달라 비교가 어렵다. 반면 ‘저장 버튼을 누르세요’는 인터페이스가 안내하는 행동에 지나치게 제한되어 계획을 다시 찾는 문제를 드러내지 못한다.
자료 U에서는 다음과 같이 과업과 판정 조건을 정한다. 교육용으로 시간과 지원 규칙을 고정한 것이며, 실제 서비스에서는 과업의 난이도와 이용 맥락에 맞춰 사전에 조정한다.
| 항목 | 평가 기준 |
|---|---|
| 과업 | 제공된 학습 상황을 바탕으로 회고·다음 주 계획을 저장하고, 목록으로 돌아가 해당 계획을 다시 찾아 제시 |
| 시작 | 과업 안내를 이해한 뒤 수행을 시작한 시점 |
| 완료 | 올바른 회고가 저장되고, 해당 계획을 다시 찾아 확인 가능하게 제시 |
| 독립 완료 | 진행자의 위치·조작 안내 없이 완료 |
| 도움 포함 완료 | 안내를 받은 경우도 포함한 완료. 도움 여부는 별도 기록 |
| 종료 | 완료, 참여자의 중단 의사, 또는 360초 상한 도달 |
| 시간 | 시작부터 완료 또는 중단까지의 경과 초. 시간 분석에서 종료 상태를 구분 |
| 오류 | 과업 진행을 방해한 잘못된 조작·상태를 사전 분류 기준에 따라 기록 |
도움을 언제 제공하는지도 정해야 한다. 요청이 있을 때 어디까지 안내하는지, 진행자가 먼저 개입할 수 있는 상황은 무엇인지 통일한다. 한 안에서 더 적극적으로 도와주면 완료율과 시간이 달라질 수 있다. 참여자별 지원 내용은 판정 근거로 남겨야 한다.
자료 U에서는 각 안의 여덟 과업 중 일곱 과업에서 서버 저장이 이루어진다. 그중 하나는 원하는 계획을 다시 찾지 못한다. 과업 완료는 여섯이고, 완료자 중 한 명은 안내를 받았다. 따라서 독립 완료는 다섯이다. 서버 저장 비율 87.5%, 도움 포함 완료율 75%, 독립 완료율 62.5%는 같은 경험의 서로 다른 결과를 나타낸다.
같은 여덟 과업, 세 가지 결과
자료 U · 각 안에서 배정·시작한 과업 8개가 공통 분모
서버 저장: 7 / 8 = 87.5%
서버 저장: 7 / 8 = 87.5%
A7·B7은 저장했지만 목표 계획을 다시 제시하지 못했다.
서버 저장은 첫 번째 결과다.
각 안의 여덟 과업 중 일곱 과업에서 저장이 확인되었다. 이후 목표 계획을 다시 찾는 과업까지 완료했는지는 아직 다르다.
자료 U · 각 안에서 배정·시작한 과업 8개가 공통 분모
도움 포함 완료: 6 / 8 = 75%
도움 포함 완료: 6 / 8 = 75%
A6·B6은 도움을 받아 완료했다. 도움 여부는 따로 기록한다.
계획을 다시 제시했는지 확인한다.
도움을 받은 경우까지 포함하면 각 안의 완료는 여섯이다. 저장한 A7·B7은 목표 계획을 다시 제시하지 못했다.
자료 U · 각 안에서 배정·시작한 과업 8개가 공통 분모
독립 완료: 5 / 8 = 62.5%
독립 완료: 5 / 8 = 62.5%
미완료·중단 과업을 분모에서 빼지 않는다. A·B는 서로 다른 교육용 집단이다.
도움 없이 완료한 범위를 나눈다.
A6·B6은 안내를 받은 완료자다. 독립 완료는 다섯이며 배정·시작한 여덟 과업을 계속 분모로 사용한다.
원본 정적 그림 보기

성공률의 분모에는 배정되어 시작한 여덟 과업을 사용한다. 실패·중단한 두 과업을 제외하고 여섯 명 중 여섯 명이 완료했다고 보고하면 평가 대상이 바뀐다. 연구 장비 문제처럼 제품과 무관한 사유로 자료를 제외해야 한다면 사전에 정한 기준에 따라 제외 수와 이유를 보고한다. 참여자 한 명이 여러 과업을 수행하는 조사에서는 사람 수와 과업 수를 따로 표시한다.
과업 안내가 결과에 미치는 영향
과업 안내는 사용자가 얻어야 할 결과를 설명하되 해결 경로를 미리 알려주지 않는 방식으로 작성한다. ‘목록 상단의 이번 주 버튼을 누르라’고 안내하면 그 버튼을 스스로 발견할 수 있는지 평가하기 어렵다. 계획 찾기를 검토한다면 ‘앞서 작성한 다음 학습 계획을 다시 찾아 내용을 보여 달라’처럼 목적을 제시하고 실제 경로를 관찰할 수 있다.
평가의 시작 상태도 맞춘다. 한 참여자는 로그인과 기본 설정이 완료되어 있고 다른 참여자는 처음부터 설정해야 한다면 같은 과업 시간으로 비교하기 어렵다. 이번 과업에서 로그인을 포함할지, 미리 준비할지 정한 뒤 모든 참여자에게 같은 기준을 적용한다. 기존 사용자에게는 이미 자신의 회고가 존재하고 신규 사용자에게는 없을 수 있으므로, 자료가 준비된 방식과 그에 따른 익숙함도 기록한다.
성공 판정은 한 문장으로 적은 뒤 구체적인 증거로 나눈다. 이 장의 완료에는 유효한 저장과 올바른 계획 재발견이 모두 포함된다. 저장만 되었거나 다른 주의 계획을 열었다면 전체 과업은 완료되지 않은 것으로 처리한다. 결과 상태를 기록하면 실패 지점을 다시 분석할 수 있다.
| 관찰 결과 | 도움 포함 완료 | 독립 완료 | 남길 기록 |
|---|---|---|---|
| 저장 후 올바른 계획을 안내 없이 제시 | 인정 | 인정 | 완료 시각과 결과 확인 |
| 저장 후 안내를 받아 올바른 계획 제시 | 인정 | 미인정 | 안내 내용·시점·요청 여부 |
| 저장했지만 다른 계획을 제시 | 미인정 | 미인정 | 선택한 대상과 혼동 과정 |
| 저장 전 중단 | 미인정 | 미인정 | 중단 시각·상태·확인된 사유 |
도움을 받은 완료를 실패와 완전히 같은 정보로 처리할 필요는 없다. 독립 완료율에서는 성공에 포함하지 않더라도, 어디에서 도움을 받으면 과업을 이어갈 수 있었는지는 설계에 유용하다. 다만 진행자가 경로를 대신 알려준 뒤 성공한 결과를 독립 수행으로 보고하지 않도록 분류를 분명히 한다.
평가자가 여러 명이면 경계 사례를 함께 판정해 본다. ‘계획을 찾았다’고 말했지만 내용을 제시하지 못한 경우, 화면에 보였으나 다른 항목을 가리킨 경우에 어떻게 판정할지 맞춘다. 의견이 갈렸다면 참여자별 결과를 임의로 평균내기보다 판정 기준을 보완하고 동일 기준으로 다시 확인할 수 있는 자료가 있는지 검토한다. 결과표에는 애매한 판정을 어떻게 처리했는지도 남긴다.
시간의 평균과 분포
시간은 줄어드는 방향이 항상 좋은 지표는 아니다. 계획을 정리하는 데 필요한 숙고까지 짧아지면 결과의 질이 낮아질 수도 있다. 이번 평가의 목적은 내용의 깊이를 재는 것이 아니라 정해진 작성·찾기 과업을 수행하는 데 드는 부담을 검토하는 것이다. 시간의 해석도 그 범위에 둔다.
자료 U의 완료자 여섯 명에 대한 소요 시간은 다음과 같다. 두 안 모두 도움을 받은 완료자 한 명을 포함한다. 전체 과업 결과와 함께 제시하고, 필요하면 도움 여부로도 나누어 검토한다.
| 안 | 완료자 소요 시간, 초 | 평균 | 중앙값 |
|---|---|---|---|
| A | 40, 50, 60, 70, 80, 300 | 100초 | 65초 |
| B | 55, 60, 65, 70, 75, 95 | 70초 | 67.5초 |
A안의 평균은 합계 600초를 여섯으로 나눈 100초다. B안은 420초를 여섯으로 나누어 70초다. 평균만 보면 30% 짧다. 그러나 중앙값은 A안 65초, B안 67.5초로 B안이 2.5초 길다. A안의 300초가 평균에 큰 영향을 주었기 때문이다.
평균 뒤의 과업을 다시 확인한다.
시간 집계 대상을 선택하고 A6의 시간만 가정으로 바꾼다. 개별 점과 평균·중앙값이 함께 바뀐다.
A6를 300초에서 90초로 바꾸면 평균과 중앙값은 얼마나 달라지는가? 완료자만 볼 때와 모든 종료를 볼 때 지표의 이름도 같은가?
고정한 조건A·B 각 여덟 과업. 완료·도움·중단 판정은 고정한다. A6의 원자료는 300초, 안내를 받은 완료다.
시간: 초 · 공통 축 0~360 · 도움 포함 완료자의 완료 시간 · ○ 독립 완료 / ◆ 도움 완료 / × 미완료 종료
실선 기준: 평균 · 점선 기준: 중앙값. 가까운 점은 세로로 벌려 표시한다.
평균 100초
중앙값 65초
독립 완료 5/8 · 도움 포함 완료 6/8평균 70초
중앙값 67.5초
독립 완료 5/8 · 도움 포함 완료 6/8교재 원자료를 표시 중이다. 표본이 서로 다르므로 개편 효과로 단정하지 않는다.
미완료 과업의 시간을 0초로 넣거나 완료자의 시간과 섞지 않았다. 긴 관측값을 임의로 삭제하는 실습이 아니다.
계산에 포함한 개별 과업 확인
| 과업 | 시간 | 결과 | 도움 | 시간 집계 |
|---|---|---|---|---|
| A1 | 40초 | 완료 | 없음 | 포함 |
| A2 | 50초 | 완료 | 없음 | 포함 |
| A3 | 60초 | 완료 | 없음 | 포함 |
| A4 | 70초 | 완료 | 없음 | 포함 |
| A5 | 80초 | 완료 | 없음 | 포함 |
| A6 | 300초 | 완료 | 있음 | 포함 |
| A7 | 120초 | 미완료 종료 | 없음 | 제외 |
| A8 | 180초 | 미완료 종료 | 없음 | 제외 |
| B1 | 55초 | 완료 | 없음 | 포함 |
| B2 | 60초 | 완료 | 없음 | 포함 |
| B3 | 65초 | 완료 | 없음 | 포함 |
| B4 | 70초 | 완료 | 없음 | 포함 |
| B5 | 75초 | 완료 | 없음 | 포함 |
| B6 | 95초 | 완료 | 있음 | 포함 |
| B7 | 90초 | 미완료 종료 | 없음 | 제외 |
| B8 | 150초 | 미완료 종료 | 없음 | 제외 |
원본 정적 그림 보기

평균은 관찰된 완료 과업에 소요된 총시간을 과업 수로 나눈 값이고, 중앙값은 정렬된 분포의 중간 위치를 나타낸다. 둘 중 하나를 자동으로 우선할 필요는 없다. 운영 자원의 총부담을 검토할 때는 평균이 유용할 수 있고, 일반적인 완료자의 위치를 설명할 때는 중앙값이 도움이 될 수 있다. 오래 걸린 사례의 어려움을 찾으려면 개별 시간과 관찰 메모를 확인해야 한다.
여섯 관측치에서 높은 백분위수를 정밀한 성능 지표처럼 제시하는 것은 적절하지 않다. 계산 규칙에 따라 값이 달라질 수 있고, 몇 개의 관측치가 결과를 좌우한다. 이 자료에서는 개별 점을 모두 보여주는 편이 정보 손실이 적다. 실제 운영 자료가 충분하면 적절한 백분위수와 표본 수를 함께 제시할 수 있다.
또한 위 표는 완료자에 한정한 시간이다. A안의 미완료 과업 두 개는 120초와 180초에, B안은 90초와 150초에 중단되었다. 이 시간을 완료 시간과 합쳐 ‘완료에 걸린 평균 시간’으로 부를 수 없다. 모든 시도의 종료까지 걸린 시간을 따로 계산할 수는 있지만, 그 값은 완료와 포기의 시간을 함께 나타낸다. 빨리 포기한 사람이 늘면 그 평균이 낮아질 수도 있다.
두 안의 완료율이 같다는 사실만으로 시간 비교의 조건이 충분히 맞춰진 것도 아니다. 완료한 사람의 숙련도나 도움을 받은 이유가 다를 수 있다. 본 자료는 서로 다른 교육용 집단이므로 ‘B안에서 관찰된 완료자 평균이 더 짧다’고 기술한다. 개편으로 시간이 단축되었다는 판단은 과업·모집·배정·환경·학습 효과를 통제한 별도 설계가 필요하다.
경과 시간과 실제 작업 시간
시간을 측정할 때에는 사용자가 경험한 경과 시간과 분석자가 분류한 실제 작업 시간을 구분한다. 저장 대기는 사용자가 아무 입력을 하지 않아도 과업 완료를 기다린 시간이다. 이를 제외하면 시스템 처리의 부담이 결과에서 사라질 수 있다. 반면 연구자가 질문을 하느라 과업을 중단한 시간은 서비스의 이용 부담과 성격이 다르다. 어느 시간을 포함하고 제외했는지 정한 뒤 기록해야 한다.
주간회고의 기본 결과표는 시작부터 종료까지의 경과 시간을 사용한다. 지연 원인을 찾을 때에는 작성·탐색·시스템 대기·조사 개입 등의 구간을 보조적으로 구분할 수 있다. 구간을 나눌 근거가 없다면 총시간을 임의로 쪼개지 않는다. 화면에 입력이 없었다고 해서 사용자가 아무 일도 하지 않은 것은 아니며, 다음 계획을 생각하고 있었을 수 있다.
시간을 비교할 때는 측정 방법도 맞춘다. 한 조사에서는 말로 생각을 설명하게 하고 다른 조사에서는 조용히 수행하게 했다면 수행 조건이 달라진다. 진행자가 중간에 질문한 경우도 기록해야 한다. 실제 서비스 이용과 조사 상황의 차이가 무엇인지 보고서에 밝히면, 수치가 어떤 조건의 경험을 설명하는지 이해하기 쉽다.
완료 여부에 따른 분리 보고
이 장의 A안에서 완료자 시간 합계는 600초이고, 중단자의 시간 합계는 300초다. 모든 시도의 종료까지 걸린 시간은 900초이며 여덟 시도로 나누면 112.5초다. B안은 완료자 420초와 중단자 240초를 더한 660초, 평균 82.5초다. 이 계산도 가능하지만 이름을 ‘모든 시도의 종료까지 걸린 평균 시간’으로 분명하게 표시한다.
이 평균이 줄었다는 사실에는 완료가 빨라진 경우와 포기가 빨라진 경우가 함께 반영될 수 있다. 따라서 완료자 시간, 완료율, 중단자의 종료 상태를 함께 제시한다. 실패한 과업의 시간을 0초로 넣으면 실패가 많은 안이 더 빠른 것처럼 나타날 수 있고, 실패자에게 임의의 큰 시간을 부여하면 다른 평가 규칙이 추가된다. 어느 방식을 쓰더라도 그 의미와 선정 이유를 설명해야 하며, 이 교재의 기본 표는 상태를 나누어 보여주는 방식을 사용한다.
원자료를 유지하는 이유도 여기에 있다. 평균 하나만 보존하면 나중에 도움 여부나 종료 상태에 따라 다시 분석할 수 없다. 개별 과업의 시작·종료·상태와 측정 조건을 남겨두면 새로운 질문이 생겼을 때 계산의 범위를 바꾸어 확인할 수 있다.
오류와 재작업의 단위
오류를 집계할 때에는 건수와 경험 범위를 구분한다. 한 참여자가 네 번의 오류를 겪은 경우와 네 참여자가 한 번씩 겪은 경우는 총건수가 같지만 서비스에 미치는 의미가 다르다. 오류가 집중된 경로가 있는지, 여러 이용자에게 넓게 나타나는지에 따라 개선 범위가 달라진다.
자료 U의 A안에서는 오류 11건이 다섯 과업에서 발생했고, B안에서는 오류 5건이 네 과업에서 발생했다. 분모를 여덟 과업으로 두면 A안의 과업당 오류는 1.375건, 오류 경험 과업 비율은 62.5%다. B안은 0.625건과 50%다. 과업당 오류 건수는 1을 넘을 수 있으며 확률로 해석하지 않는다.
오류의 건수와 경험 범위
작은 점 하나 = 오류 1건 · 한 과업에 여러 오류가 있을 수 있다.
A안
오류 11건 / 8과업 = 1.375건/과업
B안
오류 5건 / 8과업 = 0.625건/과업
자료 U의 개별 과업에 기록된 오류만 사용했다. 오류의 심각도·원인·복구 가능성은 이 건수만으로 알 수 없다.
원본 정적 그림 보기

오류의 심각도와 복구 여부도 남긴다. 잘못된 메뉴를 눌렀다가 바로 돌아온 경우와 작성 내용이 사라져 다시 입력한 경우를 동일한 한 건으로만 처리하면 개선의 중요도를 판단하기 어렵다. 관찰표에는 발생 지점, 방해받은 과업, 복구 방법, 추가 시간, 도움 여부를 기록한다. 오류 발생 원인을 확정할 수 없으면 관찰된 현상과 추정 원인을 구분한다.
서비스의 장애율은 별도의 모집단과 단위를 사용할 수 있다. 요청 성공률은 서버 요청을, 저장 성공률은 작성 시도를, 독립 과업 완료율은 평가에 참여한 과업을 분모로 삼을 수 있다. 한 과업에서 요청이 여러 번 발생할 수 있으므로 이 비율들을 같은 이름의 성공률로 합치지 않는다. 운영 품질과 이용 품질을 연결하려면 어느 요청 실패가 어떤 과업을 방해했는지 추적할 수 있어야 한다.
재작업 역시 맥락을 보고 분류한다. 다음 주 계획을 더 구체적으로 고치는 수정은 정상적인 사고 과정일 수 있다. 오류 때문에 입력을 반복하는 것은 불필요한 부담이다. 수정 횟수 감소를 목표로 삼기 전에 어떤 수정을 줄이려는지 명시해야 한다. 사용자의 판단을 돕는 과정을 단순히 조작 수를 줄이는 문제로 환원하지 않는다.
오류 분류표를 작성하는 방법
오류 분류는 관찰자가 알아볼 수 있는 현상부터 시작한다. ‘사용자 이해력 부족’과 같이 원인을 단정하는 표현보다 ‘저장하지 않은 상태에서 완료했다고 설명함’, ‘다른 주의 계획을 선택함’, ‘실패 안내 이후 같은 내용을 다시 입력함’처럼 행동과 상태를 적는다. 원인을 설명할 자료가 확보되면 그다음에 별도의 해석을 연결한다.
같은 오류를 여러 건으로 셀지 한 번의 연속 사건으로 셀지도 정한다. 실패 안내가 없는 동안 사용자가 저장 버튼을 연속해서 누른 경우 클릭마다 하나로 세면 건수가 커진다. 과업을 방해한 하나의 연속 상황으로 기록하고 그 안의 클릭 수를 별도 속성으로 남기는 방법도 있다. 무엇을 개선하려는지에 따라 오류 단위를 선택하되 비교하는 모든 안에 같은 규칙을 적용한다.
| 분류 항목 | 작성 예 | 개선 논의에 필요한 이유 |
|---|---|---|
| 관찰 현상 | 다른 주의 계획을 열어 제시 | 정확성의 실패를 구체화 |
| 발생 지점 | 회고 목록에서 상세로 이동 | 수정할 경로와 연결 |
| 영향 | 과업 미완료 또는 추가 탐색 | 결과와 부담을 구분 |
| 복구 | 스스로 돌아옴 / 안내 후 복구 / 복구 못함 | 지원 필요와 회복 가능성 확인 |
| 원인 상태 | 날짜 표시의 혼동이라는 가설 | 관찰과 추정을 분리 |
심각도가 다른 오류를 가중합으로 만들려면 각 가중치가 어떤 판단을 나타내는지 설명해야 한다. 자료가 적은 평가에서는 임의의 점수 하나보다 오류 종류와 영향을 보여주는 표가 의사결정에 더 직접적일 수 있다. 예를 들어 자잘한 이동 실수는 줄었지만 작성 내용 손실이 새로 발생했다면 총건수 감소만으로 품질 개선을 판단하기 어렵다.
주관적 평가와 미응답
과업의 성공 여부는 관찰할 수 있지만, 사용자가 과정에 얼마나 만족했는지 또는 부담을 느꼈는지는 당사자의 평가가 필요하다. 이번 예제에서는 과업 직후 ‘이번 과업을 수행하는 과정에 얼마나 만족했는가’를 1점 매우 불만족부터 5점 매우 만족까지 묻는 자체 문항을 사용한다. 이는 검증된 표준 척도라고 가정하지 않는다. 실제 평가에서는 조사 목적에 맞는 문항·척도의 근거와 사용 조건을 확인한다.
A안의 여덟 참여자 중 네 명만 응답했고 점수는 5·4·4·3점이다. 4~5점을 긍정으로 사전에 정의하면 응답자 긍정 비율은 3/4 = 75%이고, 응답률은 4/8 = 50%다. 보고서에는 두 값을 함께 표시한다. ‘이용자 75%가 만족했다’라고 쓰면 응답하지 않은 네 명까지 대표하는 표현이 된다.
응답한 사람과 아직 모르는 사람
A안 8명 · 긍정 기준 4~5점 · B안은 설문 미수집
점선 칸은 실제 응답이 아니다. 37.5%–87.5%는 미응답의 극단 가정 범위이며 신뢰구간도 전체 사용자 만족도 추정치도 아니다.
원본 정적 그림 보기

미응답 네 명이 모두 비긍정이라면 전체의 긍정 비율은 3/8 = 37.5%이고, 모두 긍정이라면 7/8 = 87.5%다. 이 범위는 표본오차에 대한 신뢰구간이 아니다. 여덟 명 안에서 미응답을 극단적으로 가정한 결과이며, 어느 가정이 더 그럴듯한지도 이 자료만으로 결정할 수 없다. 전체 사용자의 만족도를 추정하는 문제는 모집 방식과 표본의 대표성을 추가로 검토해야 한다.
설문을 성공 직후에만 보여주면 실패·중단한 사용자의 경험이 빠질 수 있다. 응답 위치와 시점, 문구, 선택지 순서가 바뀌면 응답 조건도 달라진다. 추세를 비교하려면 문항뿐 아니라 설문을 제시한 대상과 응답률을 함께 기록한다. 무응답을 0점으로 채우거나 부정 응답으로 자동 분류하지 않는다.
주관적 노력과 만족도도 다른 개념이다. 어려운 일을 성취하여 만족할 수 있고, 쉽게 끝났어도 결과가 유용하지 않아 불만족할 수 있다. 둘 다 필요한 프로젝트라면 문항을 분리하되 조사 부담을 고려한다. 추천 의향 역시 실제 추천 발생과 같지 않다. 태도 응답과 행동 결과를 연결하려면 각각의 측정과 관계 검토가 필요하다.
문항의 범위와 응답 조건
설문 문항에는 평가 대상과 기준 시점을 포함한다. ‘만족하는가’만 물으면 서비스 전체, 방금 수행한 과업, 제품 디자인 중 무엇에 대한 응답인지 분명하지 않을 수 있다. 이번 예제는 방금 수행한 과업의 과정에 대한 만족을 묻는다. 따라서 그 응답으로 장기적인 학습 도움이나 전체 서비스 충성도를 설명하지 않는다.
응답 범주도 해석에 영향을 준다. 4~5점을 긍정으로 정의하면 3점은 비긍정 집단에 들어가지만, 이를 곧바로 불만족이라고 부를 수는 없다. 3점의 문항상 의미가 중립이라면 중립과 부정을 구분하여 보고할 수 있다. 여러 범주를 하나로 합치는 경우에는 편의를 위해 어떤 정보를 줄였는지 설명한다.
자체 문항을 사용하면 지금의 질문에 맞게 표현할 수 있지만, 그 점수의 해석 근거도 팀이 확인해야 한다. 응답자들이 같은 표현을 비슷하게 이해하는지, 질문이 두 가지 내용을 한꺼번에 묻고 있지 않은지, 선택지가 판단을 담기에 충분한지 검토한다. 표준화된 척도를 선택하더라도 대상과 목적에 맞는지, 문항과 채점 방식을 임의로 바꾸지 않았는지 확인해야 한다. 이름이 알려진 척도라는 이유만으로 모든 평가에 적합한 것은 아니다.
응답 편향을 검토하려면 설문이 제시된 사람, 응답을 시작한 사람, 완료한 사람의 범위를 알 수 있어야 한다. 실패한 사용자가 설문을 보지 못했다면 완료자 중심의 평가가 된다. 미응답자가 왜 응답하지 않았는지는 기록만으로 알 수 없을 수 있으므로, 원인을 추정한 문장과 확인된 노출·응답 수를 구별한다.
자료 U에서는 A안에만 설문이 있으므로 만족의 안 간 비교는 하지 않는다. 시간과 오류가 B안에서 더 작다는 사실로 만족도도 높을 것이라고 채워 넣지 않는다. 각 자료가 지원하는 판단을 분리하면 불완전한 평가에서도 확인한 결과와 남은 질문을 분명하게 전달할 수 있다.
CSAT와 CES를 실제 설문으로 정의하기
고객 만족도(CSAT)는 정한 경험에 대한 만족의 주관적 평가다. 무엇에 만족하는지를 문항에 넣고 경험 직후인지 일정 기간 이용 후인지 정한다. 이 교재의 독립 설문 예에서는 5점 척도의 4·5점을 긍정으로 정의한다. 적격 20명 중 응답자 10명, 긍정 7명이면 응답자 기준 CSAT는 70%, 응답률은 50%다. 5점 척도와 상위 두 점수의 결합은 여기서 정한 규칙이며 모든 CSAT의 단일 표준이 아니다. 평균 점수를 쓰는 보고와 비교할 때 집계 방식을 맞춰야 한다.
고객 노력 점수(CES)는 특정 일을 처리하는 데 느낀 어려움·노력을 묻는다. ‘문서 전달을 완료하기 쉬웠다’와 ‘많은 노력이 필요했다’는 문항은 높은 점수의 방향이 반대다. 문항·척도 끝점·긍정 방향·평균 또는 비율 방식을 정의서에 보관한다. 평균 CES를 보고한다면 유효 응답 점수 합을 유효 응답 수로 나누며, 미응답을 최저점이나 0점으로 채우지 않는다. Qualtrics의 CES 문항 설명 · S50.
CSAT는 만족, CES는 인지한 노력에 관한 질문이다. 둘 다 실제 성공 여부나 시간 로그를 자동으로 대체하지 않는다. 실패했지만 친절한 도움에 만족할 수도 있고 성공했지만 과도한 노력을 들였을 수도 있다. PM은 과업 결과와 설문을 함께 보고, 응답 대상·미응답·조사 시점이 달라진 점수의 비교를 제한한다. 위 예는 U 자료와 독립이다.
평가 결과를 개선 판단으로 정리하기
결과표는 판단에 필요한 조건을 함께 보여주어야 한다. 이 장의 자료에서 A·B 모두 독립 완료 5/8, 도움 포함 완료 6/8이다. B의 완료자 평균 시간과 오류 건수는 더 작지만, 중앙값은 약간 크다. 현재의 설명은 관찰된 사례의 차이에 한정된다.
| 판단에 필요한 항목 | A | B | 현재 해석 |
|---|---|---|---|
| 독립 완료 / 배정 과업 | 5/8 | 5/8 | 독립 완료의 차이는 나타나지 않음 |
| 도움 포함 완료 / 배정 과업 | 6/8 | 6/8 | 완료 판정 기준을 동일하게 적용한 기술 결과 |
| 완료자 평균·중앙값 | 100초·65초 | 70초·67.5초 | 긴 사례의 영향과 집단 조건을 추가 검토 |
| 오류 건수·경험 과업 수 | 11건·5개 | 5건·4개 | 오류 종류·심각도·복구 과정을 대조 |
| 설문 | 4명 응답, 3명 긍정 | 수집하지 않음 | 안 사이의 만족도 비교 불가 |
개선 검토 기록에는 수치, 관찰된 문제, 가능한 설명, 후속 업무를 이어 적는다. 예를 들어 A안의 300초 사례에서 찾기 경로의 반복 탐색이 확인되었다면 그 경로를 수정할 근거가 된다. 현재 데이터에는 세부 관찰 메모가 없으므로 이 원인을 사실로 쓸 수 없다. 이 단계에서는 ‘오래 걸린 사례의 진행 기록을 확보하여 지연 구간을 확인한다’는 후속 업무가 적절하다.
출시 판단 기준은 결과를 본 뒤 유리한 항목을 골라 정하지 않는다. 독립 완료, 중요한 오류, 시간, 추가 조사 범위를 사전에 정하고, 어느 조건에서 수정·보완 조사·확대를 선택할지 합의한다. 작은 조사에서 특정 문제를 발견했다는 것과 전체 사용자에서 그 문제가 얼마나 줄었는지를 입증했다는 것은 다른 수준의 판단이다. 평가 목적에 맞는 근거를 사용한다.
결과표에서 판단 메모로 이어지는 예
평가 보고서는 계산값을 다시 나열하는 데 그치지 않고, 현재의 결정에 어느 정도의 근거가 있는지 설명해야 한다. 자료 U로 쓸 수 있는 기술은 독립 완료와 도움 포함 완료가 두 안에서 같았고, B안의 완료자 평균 시간과 오류 총건수가 작았다는 것이다. B안의 우월성이나 실제 서비스 전체에서의 개선 효과는 이 자료가 뒷받침하지 않는다.
판단 메모의 예는 다음과 같다. ‘두 안 모두 독립 완료는 여덟 과업 중 다섯이었다. B안에서 완료자의 평균 시간과 오류 건수가 더 작게 나타났으나, 독립 완료의 차이는 관찰되지 않았다. A안의 긴 사례와 두 안의 미완료 과업에서 발생한 문제를 확인한 뒤 수정 범위를 정한다. 만족 응답은 A안에서만 수집되어 안 간 비교에 사용하지 않는다.’ 이 문장은 수치, 적용 범위, 후속 업무를 연결한다.
후속 업무를 구체화할 때는 무엇을 더 알면 판단이 바뀔지 적는다. 미완료 과업이 모두 같은 탐색 문제에서 발생했다면 해당 경로를 우선 수정할 수 있다. 서로 다른 원인이라면 여러 수정 후보가 필요하다. 이미 알려진 저장 장애가 원인이라면 탐색 구조를 크게 바꾸기 전에 장애를 해결해야 한다. 현재 예제에는 원인별 관찰 메모가 없으므로 어느 경우인지 단정하지 않는다.
| 확인 결과의 유형 | 검토할 결정 | 추가 근거 |
|---|---|---|
| 같은 경로에서 반복되는 과업 실패 | 해당 경로 수정 | 실패 상태·이동·판정 근거 |
| 한 사례의 긴 시간에 평균이 크게 영향받음 | 원인 확인 후 수정 범위 결정 | 개별 수행 기록·도움·대기 구간 |
| 수집·판정 조건이 안마다 다름 | 비교 결론 유보, 조건 정리 | 평가 절차와 누락 범위 |
| 주요 과업은 개선되지만 중요한 오류 발생 | 확대 전에 오류 처리 | 오류 영향·복구 가능성 |
일정이 촉박하더라도 무엇을 확인하지 못한 채 결정했는지 기록할 수 있다. 제한된 범위에 먼저 적용하고 추가 관찰을 계획하는 방식도 가능하다. 다만 결정 당시 확보하지 못한 자료를 이후 보고서에서 이미 확인한 것처럼 표현하지 않는다. 평가의 역할은 모든 불확실성을 제거하는 데 있지 않고, 결정의 근거와 남은 조건을 설명하는 데 있다.
과업 평가 계획서
평가 계획서는 프로젝트의 목적을 관찰 가능한 기준으로 번역한다. 다음 양식은 주간회고의 개편 검토를 위한 초안이다. 실제 실행 전에는 모집과 비교 설계를 구체화해야 한다.
| 항목 | 계획에 기록할 내용 |
|---|---|
| 평가 목적 | 저장 후 계획 재발견과 독립 수행의 어려움 확인 |
| 대상 | 신규·기존 이용 경험, 이용 기기, 관련 숙련도. 모집 경로와 제외 기준 |
| 과업·자료 | 동일한 학습 상황과 판정 가능한 결과. 안마다 과업 난이도 대조 |
| 성공 기준 | 올바른 계획을 재발견하여 제시. 독립 완료와 도움 포함 완료 구분 |
| 시간·중단 | 시작·종료 시점, 상한, 참여자의 중단, 기술적 중단 기록 |
| 지원 규칙 | 요청 시 제공할 안내 범위와 개입 기록 |
| 관찰 자료 | 시간·오류·되돌아감·도움·종료 사유, 필요한 최소 기록 |
| 설문 | 문항·척도·제시 시점·대상·응답과 미응답 표시 |
| 비교 조건 | 집단 구성, 배정 방법, 기기·환경, 반복 참여의 학습 효과 관리 |
| 해석 범위 | 문제 발견 또는 차이 추정 등 목적 명시. 인과 판단 가능 여부 |
| 후속 업무 | 문제별 담당, 수정 범위, 재평가할 조건과 시점 |
결과물에는 평가 계획, 실제 수행에서 달라진 조건, 계산 결과, 개별 문제의 근거를 함께 남긴다. 이 자료는 이후 개편에서 비교 가능한 범위를 정하는 기준이 된다. 서비스가 널리 사용되면 운영 로그로 발견 범위를 넓힐 수 있지만, 로그로 직접 확인되지 않는 과업 의도와 결과는 관찰·면담 등으로 계속 보완한다.
평가 실행과 인계의 순서
실행 전에는 과업 문구와 준비 자료를 실제 환경에서 확인한다. 요청한 계획이 존재하는지, 시작 화면이 동일하게 준비되는지, 저장과 재열람 결과를 판정할 수 있는지 점검한다. 과업 자체가 불가능하거나 안내가 모호하면 제품의 문제와 평가 절차의 문제가 섞인다. 이 점검에서 절차를 바꾸었다면 변경 후 기준을 본 평가에 일관되게 적용한다.
평가 중에는 결과뿐 아니라 예외를 기록한다. 진행자가 실수로 경로를 알려준 경우, 기기가 중단된 경우, 준비된 자료에 오류가 있었던 경우에는 사후에 결과를 유리한 방향으로 분류하지 않고 사전에 정한 처리 원칙을 확인한다. 제외한 관측치가 있다면 제외 사유와 수를 보고하고, 남은 자료가 어떤 범위를 대표하는지 다시 설명한다.
평가 이후에는 문제 목록을 개발 업무와 연결한다. 각 문제에 영향을 받은 과업, 관찰 근거, 제안하는 변경, 완료 기준, 재평가 방법을 붙인다. 개편된 화면이 구현되었다는 사실과 해당 문제를 겪던 경로가 나아졌다는 사실은 다른 완료 근거이므로 둘 다 확인한다. 다음 조사에서 같은 과업을 다시 사용할 때에는 버전·조건·판정 규칙의 변경 여부를 대조한다.
네 장의 문서를 함께 검토하면 연결이 끊긴 곳을 찾을 수 있다. 경험 지도에서 중요하다고 표시한 계획 재사용이 지표 정의서에는 없을 수 있다. 정의서의 저장 성공이 이벤트에서는 클릭으로 수집되고 있을 수 있다. 이벤트가 정확해도 과업 평가가 저장까지만 확인하여 재발견의 어려움을 놓칠 수 있다. 이러한 불일치를 정리하는 작업이 개별 지표를 더 많이 수집하는 일에 앞선다.
연습문제와 적용 과제
- 자료 U의 서버 저장 비율, 도움 포함 완료율, 독립 완료율을 구하고 각각의 판정 기준을 설명하라.
- A·B의 완료자 시간 평균과 중앙값을 계산하라. 평균이 30% 작다는 사실을 사용한 보고 문구를 작성하되 인과 효과로 표현하지 말라.
- 실패·중단 과업의 시간을 제외한 평균을 보고할 때 함께 제시해야 할 정보는 무엇인가. 모든 종료 시간을 합친 평균은 무엇을 뜻하는가.
- A·B의 과업당 오류 건수와 오류 경험 과업 비율을 구하라. 한 수치로 통합할 때 잃는 정보를 설명하라.
- A안의 설문 응답률과 응답자 긍정 비율을 계산하라. 미응답의 극단 가정 범위를 구하고 신뢰구간과 구별하라.
- B안의 시간이 더 짧다는 결과를 개편 효과로 해석하기 위해 추가로 정해야 할 비교 조건을 세 가지 이상 작성하라.
- 담당 서비스의 과업 평가 계획서를 작성하라. 이용량이 늘어도 과업 결과가 나빠질 수 있는 상황을 하나 포함하고 확인할 자료를 정하라.
- 저장은 되었지만 다른 주의 계획을 제시한 경우, 안내를 받고 올바른 계획을 찾은 경우를 각각 판정하라. 평가자 간 해석을 맞출 자료도 작성하라.
- 자료 U를 바탕으로 현재 확인된 결과·판단할 수 없는 내용·후속 업무를 포함한 평가 메모를 작성하라. 미수집 설문과 긴 시간 사례를 다루는 방식을 포함하라.
연습문제 해설과 계산 결과를 대조할 수 있다. 이번 네 장의 산출물을 합치면 사용자 경험의 범위, 지표 정의, 이벤트 명세, 과업 평가 계획이 연결된다. 반복 이용을 설명하는 13장에서도 동일한 구분을 유지하여 행동 기록과 사용자 결과를 검토한다.
참고 문헌과 자료 범위
- S15. Rodden, K., Hutchinson, H., & Fu, X. (2010). Measuring the User Experience on a Large Scale: User-Centered Metrics for Web Applications. CHI 2010. Google Research, 공식 페이지가 연결한 저자 원고. HEART와 Goals–Signals–Metrics 절 확인. 본문의 주간회고 과업·표·그림은 자체 설계다.
- S43. ISO 9241-11:2018. Usability: Definitions and concepts. 공식 서지·소개. 공개 초록·서지만 확인했으며 표준 전문의 평가 절차를 옮긴 것이 아니다.
- 자료 U는 교육용 생성 자료다. 차이의 유의성, 일반 사용자에 대한 추정, 개편의 인과 효과를 검정하지 않았다. 원자료와 재현, 출처 확인 범위를 참조할 수 있다.