Follow the Metrics for PMWEB EDITION / 01

제6부 · 지표의 운영과 제품 판단

다음 유행을 만났을 때: GEO·합성 사용자·AI 비용

새로운 명칭의 정의·근거·비용을 확인하고 제한된 검증을 설계한다.

24장교육용 자료 E-GEO·E-AI연습문제 해설 ↗

제안서에 새로운 약어가 등장한다. AI 답변에 브랜드가 얼마나 나오는지 보여주고, 가상 사용자로 출시 전에 반응을 예측하며, 생성 비용까지 자동으로 최적화한다는 설명이다. PM이 결정해야 할 것은 그 이름이 새롭거나 오래되었는지가 아니다. 지금의 문제를 해결하는 데 어떤 관찰과 기능이 추가되며, 제안된 증거가 어디까지 뒷받침하는지를 검토해야 한다.

이 장은 2026-09-17에 확인한 공개 자료와 교육용 사례 E를 사용한다. 미래의 유행 연도, 국내 도입률, 업체별 우열은 예측하지 않는다. 특정 제품의 구매를 추천하는 장도 아니다. 학습 산출물은 새 주장 검토서와 제한 검증 계획이다. 구현·가격·논문은 바뀔 수 있으므로 문서의 버전과 확인일을 남긴다.

01

새로운 명칭을 검토 가능한 주장으로 바꾸기

하나의 제안 안에는 정의, 관찰 결과, 예측, 인과 주장, 권고가 함께 들어갈 수 있다. ‘AI 답변에서 우리 브랜드가 30% 언급되었다’는 관찰이고, ‘언급을 늘리면 매출이 증가한다’는 인과 가설이다. ‘따라서 이 도구를 구매해야 한다’는 비용과 대안까지 고려해야 하는 권고다. 앞 문장의 자료만으로 뒤 문장을 정당화할 수 있는지 검토한다.

주장 종류 예 확인할 근거
정의 응답 중 브랜드 언급 비율을 측정한다 분모·표본·판정 규칙
관찰 정한 질문 집합에서 30%였다 실행 기록·모델·시점
예측 다음 달 실제 구매가 늘 것이다 미래 표본의 예측 검증
인과 이 변경이 구매를 늘린다 비교 설계와 대안 설명
권고 이 솔루션을 전사 도입한다 효과·비용·대안·운영 부담

새 기여도 나누어 평가한다. 관찰 대상이 새로 생겼을 수 있고, 기존 원리를 구현하기 쉬워졌을 수 있으며, 조직 간 데이터를 연결하는 비용을 줄였을 수도 있다. 수학적 공식이 익숙하다는 이유로 구현상의 기여를 지우지 않는다. 반대로 새로운 약어가 붙었다고 예측·인과 검증까지 해결된 것으로 받아들이지 않는다.

자료의 관계를 읽기

주장의 수준이 바뀌면 증거도 달라진다

같은 설명도 정의·관찰·예측·인과·도입 권고 중 어디에 해당하는지에 따라 근거가 달라진다.

정의

어떤 단위·분모·시간을 무엇이라 부르는가

계산 명세와 예외 처리

관찰

어떤 자료에서 어떤 결과가 나왔는가

표본·기간·원자료·수집 범위

예측

다른 대상이나 미래에도 맞는가

분리된 평가 자료·오차·보정

인과

정한 변경이 결과를 바꾸었는가

비교 설계·교란·간섭·불확실성

도입 권고

우리 환경에서 실행할 가치가 있는가

효과·비용·손상·운영·철회 조건

수준이 높아질수록 저절로 증거가 쌓이는 순서가 아니다. 앞의 주장을 지지하는 자료가 뒤의 주장을 함께 지지하는지 다시 검토한다.

원본 정적 그림 보기

정의·관찰·예측·인과·도입 권고에 각각 필요한 증거

이 장의 관계 표기는 기존 목차의 H/M/A/U 원칙을 따른다. 동일한 비용 계산 원리를 사용하는 것은 방법 공유(M)로 설명할 수 있지만, 누가 어느 저자를 직접 계승했다는 역사적 영향(H)은 별도 문헌이 필요하다. 비슷하다는 사실과 이름을 바꾸어 속였다는 동기 추정도 구분한다.

02

GEO: 생성 응답 안의 가시성

GEO(Generative Engine Optimization)는 생성형 검색 응답에서 콘텐츠의 가시성을 높이는 문제를 다루는 명칭이다. Aggarwal 등의 논문은 2023년에 처음 제출되었고, 이 장은 2024-06-28의 v3를 참조한다. 연구는 응답에서 출처가 차지하는 분량·위치 등을 반영한 가시성 측정과 평가 환경을 제안했다. 논문 v3 방법·실험·한계 · S26.

그 연구의 가시성 개선 결과를 모든 현재 검색 서비스의 효과나 구매 증가로 옮길 수는 없다. 논문도 엔진과 질문의 변화에 따른 방법 조정 필요성을 설명한다. 따라서 도입 검토에서는 연구 당시의 환경과 지금 측정할 서비스를 따로 기록한다. ‘SEO가 완전히 끝났다’는 결론도 이 연구의 측정 결과와 같은 주장이 아니다.

Google Search의 AI 기능 안내는 AI Overviews·AI Mode에 기존 SEO 기본 원칙이 여전히 적용되며 별도의 특수 마크업이나 새 파일이 필수는 아니라고 설명한다. 또한 해당 노출·클릭은 Search Console의 전체 웹 검색 성과에 포함된다고 안내한다. 이 설명은 Google의 해당 기능에 한정하여 사용한다. 다른 엔진의 측정·노출 규칙까지 같다고 일반화하지 않는다. Google 공식 안내 · S60.

언급률과 인용 점유율의 분모

교육용 측정에서는 다음 두 값을 구분한다. 응답 기준 브랜드 언급률은 수집한 유효 응답 중 목표 브랜드가 한 번 이상 나타난 응답의 비율이다. 인용 점유율은 정한 인용 단위 전체 중 목표 도메인의 인용 단위가 차지하는 비율이다. 업계 전체가 합의한 단일 표준이라고 부르지 않고 이 실습의 정의로 사용한다.

E-GEO는 미리 고른 질문 20개를 같은 설정으로 5회씩 실행한 100개 응답이다. 이 자료에서는 실행 실패가 없다고 가정한다. 30개 응답에 브랜드가 언급되고, 그중 20개에 목표 도메인 링크가 있다. 응답별 같은 URL은 한 번으로 세어 전체 인용 단위 250개 중 목표 도메인 인용은 40개다.

  • 응답 기준 브랜드 언급률: 30/100=30%.
  • 응답 기준 목표 도메인 인용률: 20/100=20%.
  • 인용 단위 기준 점유율: 40/250=16%.
자료의 관계를 읽기

응답과 인용 단위의 분모를 구분한다

E-GEO의 고정 질문 20개 × 5회 = 응답 100개. 실행 실패가 없다는 교육용 자료다.

언급 응답30응답
÷
전체 응답100응답
=
이 실습의 정의30%
세는 단위확인한 범위
질문20개 고정 질문을 5회 반복. 인간 100명의 독립 표본이 아님.
응답100개 중 브랜드 언급 30개, 목표 링크 포함 20개.
인용응답별 같은 URL 중복 제거 후 250단위 중 목표 도메인 40단위.

20개 응답에서 서로 다른 목표 URL이 여러 개 인용될 수 있다. 이 비율은 인지도·시장 점유율·구매 전환율이 아니며 실제 구매 로그와 분모 없이 곱하지 않는다.

원본 정적 그림 보기

응답 분모와 인용 단위 분모에서 나오는 서로 다른 비율

동일한 응답에서 목표 도메인의 서로 다른 URL이 여러 개 인용될 수 있어 20개 응답과 40개 인용 단위가 양립한다. 30%를 사용자 30%의 인지도나 시장 점유율로 보고해서는 안 된다. 표본은 사람이 아니라 선정한 질문과 그 반복 응답이다. 같은 질문의 반복은 독립적인 신규 고객 100명을 조사한 것과 다르다.

03

가시성에서 사업 성과까지의 검증

질문 표본에는 선택 편향이 생길 수 있다. 브랜드 이름을 직접 포함한 질문만 고르면 높은 언급률이 나오기 쉽다. 구매 검토·문제 탐색·사용법처럼 목적을 나누고, 브랜드 포함 여부, 언어, 지역, 계정 상태, 엔진과 모델, 실행 날짜, 답변과 링크를 기록한다. 질문 집합을 바꾸었으면 이전 평균과 직접 비교하기 전에 구성 차이를 검토한다.

같은 설정에서도 응답은 달라질 수 있다. 반복 실행은 변동을 확인하는 자료가 되지만 변화의 원인이 콘텐츠 수정인지 엔진 업데이트인지 자동으로 분리해주지는 않는다. 페이지 개선을 검토할 때에는 바뀐 내용, 비교할 페이지·질문, 평가 기간을 정한다. 가능하다면 단계적 적용이나 비교 집합을 사용하되 검색 노출의 간섭과 시간 변화를 설명해야 한다.

가시성, 방문, 과업, 구매는 각각 다른 결과다. E-GEO의 100개 실험 응답에 붙은 브랜드 언급과 실제 웹사이트의 구매 로그는 같은 모집단이 아닐 수 있다. 둘을 곱해 매출을 추정하지 않는다. 연결할 수 있는 실제 유입은 별도 경로로 추적하고, 관찰되지 않는 대화·외부 앱 전환은 누락 범위로 남긴다. 도구가 보여주는 ‘프롬프트별 전환율’에는 실제 질문 노출 분모를 어떻게 확보했는지 확인해야 한다.

지표가 부정확한 답변을 더 많이 퍼뜨리는 결과를 보상하지 않도록 정확성도 검토한다. 잘못된 가격이나 제공하지 않는 기능으로 언급되면 가시성은 늘어도 고객의 기대와 실제 경험 사이 간극이 커진다. 언급 내용의 정확성, 인용이 주장 내용을 뒷받침하는지, 유입 후 혼란이 생기는지를 표본 검토에 포함한다.

04

합성 사용자는 무엇을 관찰하는가

합성 사용자는 사람의 속성·기록·설명 등을 입력하여 모델이 사용자처럼 응답하거나 행동하도록 구성한 모의 대상이다. 단순 페르소나 문장, 실제 인터뷰에 근거한 에이전트, UI를 조작하는 에이전트는 서로 다른 구현이다. ‘사용자’라는 이름만으로 실제 사람의 욕구·기회·환경을 같은 정도로 재현한다고 보지 않는다.

Park 등의 2024년 v1 연구는 실제 참여자 인터뷰에 근거한 에이전트를 사람의 응답·행동 자료와 비교했다. 해당 기록은 인간 자료를 활용한 모의 응답의 검증 사례다. 이 장은 그 초록·서지 범위를 사용하며, 제품을 출시하지 않고 장기 리텐션을 검증했다는 결과로 인용하지 않는다. v1 고정 링크 · S27.

같은 arXiv 번호의 현행 v3는 2026년에 제목과 내용이 바뀌었다. 제안서를 읽을 때 논문 번호뿐 아니라 버전·평가 과업·대상·결과 지표를 함께 기록해야 한다. 서로 다른 버전의 제목과 효과 크기를 섞어 하나의 결과처럼 설명하지 않는다. 현행 서지와 버전 이력.

합성 검토는 화면 설명의 모호한 부분을 찾거나 조사 질문의 후보를 넓히는 데 시험적으로 쓸 수 있다. 이것은 이 교재의 제한 사용 제안이며 효용을 독립적으로 입증한 성과 보고가 아니다. 실제 사용자에게 중요한 문제가 맞는지, 어떤 집단의 반응을 놓치는지는 사람의 자료로 대조해야 한다. 모델이 자신 있게 답했다는 사실은 검증 결과가 아니다.

05

합성 응답의 검증 계획

검증할 결과를 구체적으로 정한다. 문구 이해, 과업 성공, 선호, 구매, 30일 유지에는 각각 다른 자료가 필요하다. 설문 응답 일치도가 높다는 결과를 몇 주 뒤의 실제 제품 이용에 그대로 적용하지 않는다. 리텐션은 시간에 걸친 이용 기회·필요·경쟁 제품·비용의 영향을 받는다. 짧은 응답 생성에는 그 과정이 관찰되지 않는다.

합성 예측을 먼저 만들고 나중에 확보한 별도의 인간 자료에 대조하는 방식을 계획할 수 있다. 모델에 입력한 인터뷰나 설문 답을 다시 정답으로 평가하면 정보 누출이 생긴다. 모델·프롬프트·입력·생성 날짜를 고정하고, 평가에 사용할 사람·문항·기간의 분리 방식을 명시한다. 같은 모델에서 반복 생성한 응답 수를 독립적인 인간 표본 수로 세지 않는다.

자료의 관계를 읽기

입력 자료와 검증 자료 사이에 경계를 둔다

합성 결과를 평가하는 자료의 출처를 선택한다. 수치 성능은 제공하지 않았으며 검증 설계를 비교한다.

01

입력과 버전 고정

인터뷰·설명·모델·프롬프트·생성 날짜를 남긴다.

02

합성 예측 저장

사람의 결과를 보기 전에 예측을 기록한다.

03

분리해 둔 실제 사용자 결과

모델·프롬프트·입력을 고정하고 평가 사람·문항·기간의 중복을 확인한다.

평가 과업의 일치

같은 결과를 대조

문구 이해·과업 성공·구매·30일 유지에 필요한 자료는 다르다.

본문의 보정 예 · 별도 가정

70% 예측 → 실제 40/100

해당 집단에서 −30%p 차이. 이 한 집계로 전체 모형 성능을 확정하지 않는다.

도식은 검증 계획이며 합성 사용자의 성능을 새로 입증한 결과가 아니다. 실제 사용자의 과업 결과와 대조해야 예측의 타당성을 판단할 수 있다.

원본 정적 그림 보기

합성 출력과 분리된 인간 자료를 대조하는 검증 경로

평균 일치만 보면 특정 집단의 오류가 숨을 수 있다. 사용 경험, 언어, 접근성 조건 등 제품에 중요한 차이로 결과를 살피되 작은 집단의 불안정성도 남긴다. 비교 기준으로 단순한 전체 평균 예측이나 이전 기간 기준선을 둔다. 복잡한 에이전트가 아주 단순한 예측보다 얼마나 나은지 알아야 운영 비용을 판단할 수 있다.

미래 유지 확률을 예측한다면 확률이 맞는지 보는 보정과 이용자를 상대적으로 구분하는 능력을 구별한다. 예를 들어 70%라고 예측한 독립 평가 대상 100명 가운데 40명만 유지했다면, 그 집단에서 예측 확률과 실제 비율의 차이는 −30%포인트다. 이 한 집계로 모형 전체 성능을 확정할 수는 없지만 해당 예측 수준의 오차를 확인할 수 있다. 높은 점수 집단의 유지가 상대적으로 높아도 확률은 과대 추정될 수 있다.

06

AI 제공 비용의 단위와 결과

AI 비용은 토큰·호출·실행 시간 같은 기술 사용량에 연결될 수 있다. 기술 단위당 비용은 인프라 효율을 파악하는 데 유용하다. 그러나 사용자가 원하는 과업 하나에 여러 호출·재시도·사람의 검수가 필요하면 호출 단가만으로 경제성을 판단하기 어렵다.

FinOps Foundation의 단위 경제성 설명은 사용량 단위와 사업 결과를 연결하며, 생성형 AI에서도 토큰 비용에서 결과 단위의 비용으로 확장하는 관점을 제시한다. 공식 단위 경제성 설명 · S61. 이 교재는 이를 성공 과업당 제공 비용의 교육 예제로 옮긴다. 특정 사업의 회계상 원가 분류를 결정하는 지침은 아니다.

E-AI는 같은 종류의 접수 과업 100건에 대한 두 버전의 독립된 교육용 집계다. A는 100회 호출로 70건을 성공 처리했고 B는 재시도를 포함해 200회 호출로 90건을 성공 처리했다. 호출당 단가는 각각 100원과 70원으로 가정한다. 현재 업체의 실가격이 아니다.

비용·결과 A B
접수 과업 100건 100건
모델 호출·재시도 합계 100회 200회
호출당 교육용 단가 100원 70원
모델 사용 비용 10,000원 14,000원
사람 검수·기타 변동 제공비 10,000원 18,000원
총 변동 제공비 20,000원 32,000원
검증 기준 통과 과업 70건 90건
성공 과업당 총 변동 제공비 약 286원 약 356원
직접 계산 실습 / 원자료와 조건을 대조하기

호출 단가에서 성공 과업당 비용으로

E-AI의 A는 고정한다. B의 호출·재시도, 단가, 기타 비용과 성공 과업 수를 바꾸어 비용의 단위를 비교한다.

호출 단가가 내려가도 성공 과업당 비용은 오를 수 있다. 실패 비용까지 포함하면 어떤 판단이 남는가?

고정한 조건같은 종류의 접수 과업 100건. 실제 업체 가격이 아닌 교육용 단가. 성공은 별도 기준으로 검증했다고 가정한다. 추가 비용/추가 성공은 무작위 실험의 증분 효과가 아니다.

총 변동 제공비 · 원 · 두 안에 공통 범위 0~32,000원, 입력에 따라 축 조정

A

모델 10,000 + 검수·기타 10,000 = 20,000원

B

모델 14,000 + 검수·기타 18,000 = 32,000원

비용의 단위A · 고정B · 선택
호출당 단가100원70원
접수 과업당 총 비용200원320원
성공 과업당 총 비용285.71원355.56원
추가 성공당 추가 비용600원
B 검증 성공률90 / 100 = 90%

모든 실패·재시도 비용이 분자에 남는다. 성공 수를 바꾸어도 호출 수를 자동 예측하지 않는 독립 입력 시나리오다. 성공 기준·대기 시간·잘못된 성공 판정의 피해는 별도 검토한다.

원본 정적 그림 보기

호출 단가와 성공 과업당 비용이 다르게 움직이는 예

성공 과업당 비용의 분자에는 실패한 호출과 재시도 비용도 포함했다. 성공한 과업에 직접 연결된 호출만 세면 실패 비용이 사라진다. 접수 과업당 총 비용은 200원과 320원이고 성공 과업당 비용은 약 286원과 356원이다. 어떤 단위를 썼는지 명칭에 남긴다.

B는 더 많은 과업을 처리했지만 성공 과업당 비용도 높다. 추가 성공 20건에 대한 추가 변동비는 12,000원이므로 추가 성공당 600원이다. 이 값만으로 B를 거절하거나 채택하지 않는다. 추가 성공의 가치, 잘못된 성공 판정의 피해, 대기 시간, 운영 한계와 비교한다. 이 예제는 교육용 비교이며 무작위 실험에 근거한 증분 효과라고 주장하지 않는다.

07

획득비·제공비·고정비의 경계

CAC는 정한 고객을 획득하는 데 사용한 비용을 해당 신규 고객 수로 나눈 값이다. 가입 이후 계속 서비스를 제공하기 위한 추론비를 전부 CAC에 더하면 획득과 제공의 질문이 섞인다. 무료 체험 중 사용 비용처럼 획득 과정과 제공 과정의 경계에 있는 항목은 관리 목적에 맞는 분류 규칙을 명시하고, 공헌·CLV에서 다시 중복 차감하지 않도록 한다.

제공 비용에는 모델 사용 외에도 검색·저장·도구 호출·재시도·검수·지원이 포함될 수 있다. 공유 인프라 비용을 과업에 배분할 때에는 배분 기준을 정한다. 원래 발생하는 고정비를 더 많은 과업으로 나누면 평균 비용이 낮아져도 실제 현금 지출이 줄지는 않을 수 있다. 반대로 사용량 증가가 용량 증설을 유발하면 한계 비용이 일정하지 않을 수 있다.

새로운 이름의 ‘True-LTV’나 ‘CAC-I’를 보았다면 우선 분자·분모·기간·비용 범위를 요청한다. 여기서는 이 약어들을 공인 표준 지표로 채택하지 않는다. 기존 고객가치·공헌·비용 회수의 원리로 해석 가능한 부분과 새로운 비용 자료가 필요한 부분을 나눈다. 정의되지 않은 약어를 공식처럼 외울 필요는 없다.

08

채택·시험·보류·거절의 판단서

새 도구의 결론은 네 가지로 나눌 수 있다. 채택은 현재 문제·효과·운영 조건이 충분히 확인된 범위에서 도입하는 것이다. 시험은 가설과 제한된 범위를 정해 추가 자료를 얻는 것이다. 보류는 핵심 정보가 부족해 현재 결정을 미루는 것이고, 거절은 현재 요구 조건과 맞지 않거나 제안된 검증이 주장을 뒷받침하지 못한다는 판단이다. 어느 결론도 영구적인 진리로 기록하지 않는다.

검토 항목 합성 사용자 제안의 작성 예
제안된 문제 출시 전 온보딩의 이해 문제를 줄이고 싶다
실제 기능 지정한 설명을 읽은 모델의 반응 생성
주장과 증거 문구 검토 가능성은 시험 대상, 장기 유지 대체 주장은 근거 부족
허용 범위 조사 질문·예외 시나리오 후보 생성에 제한 시험
인간 검증 분리된 실제 신규 사용자 과업 관찰과 비교
비용 준비·실행·검수 시간 및 제공비 기록
성공·중단 조건 실제 조사에 유용한 문제 발견 여부, 반복 오류·편향이면 수정 또는 중단
판단 변경 조건 목표 과업의 독립 평가 자료가 쌓이면 범위 재검토

GEO는 표본 질문에서 가시성을 측정하는 시험부터 시작할 수 있고, AI 비용은 기존 원장에 결과 단위를 연결하는 검수부터 시작할 수 있다. 제한 시험의 종료일과 책임자가 없으면 시험이 관성적으로 구독·운영 비용으로 남는다. 도입 결과뿐 아니라 사용하지 않기로 한 이유도 남겨 두면 같은 주장이 다시 등장했을 때 검토를 재사용할 수 있다.

09

연습문제

  1. ‘AI 언급률이 높으므로 이 도구를 도입하면 매출이 는다’에 섞인 주장 종류를 구분하라.
  2. E-GEO의 세 비율을 계산하고 시장 점유율과 다른 이유를 쓰라.
  3. 질문 20개를 5회 반복한 자료를 인간 100명의 독립 표본처럼 해석할 수 있는지 설명하라.
  4. GEO의 가시성과 구매 사이에 추가로 필요한 관찰·비교를 설계하라.
  5. 합성 응답 검증에서 입력 자료와 평가 자료를 분리하는 이유를 쓰라.
  6. E-AI의 호출 단가, 접수당 비용, 성공당 비용, 추가 성공당 추가 비용을 비교하라.
  7. 가입 이후 추론비를 전부 CAC에 넣을 때 생기는 해석 문제와 중복 차감 위험을 설명하라.
  8. 새로운 약어 또는 도구 하나의 주장 검토서를 작성하고 결론 변경 조건을 적으라.

해설

10

근거와 기록 범위

GEO는 S26의 v3 방법·실험 설정·한계 절, 합성 에이전트는 S27의 고정 버전 초록·서지와 현행 버전 이력을 사용했다. Google의 현행 안내는 S60, FinOps의 비용 단위 설명은 S61에 기록했다. 연구의 구현이나 성과를 재현한 것이 아니며 E의 수치·검증 계획은 교재가 만들었다. 이 장에서 제안하는 제한 시험의 효과도 직접 검토해야 한다.

새로운 지표는 새로운 관찰을 가능하게 할 수 있다. 그 관찰이 사용자 결과와 사업 판단에 어떻게 연결되는지 확인하고, 맞지 않는 연결은 수정하는 일이 PM의 측정 업무다. 그 과정은 이 교재의 다른 지표에도 같은 기준으로 적용한다.

24장까지 읽었습니다두 보고서를 비교하고 마무리하기