제안서에 새로운 약어가 등장한다. AI 답변에 브랜드가 얼마나 나오는지 보여주고, 가상 사용자로 출시 전에 반응을 예측하며, 생성 비용까지 자동으로 최적화한다는 설명이다. PM이 결정해야 할 것은 그 이름이 새롭거나 오래되었는지가 아니다. 지금의 문제를 해결하는 데 어떤 관찰과 기능이 추가되며, 제안된 증거가 어디까지 뒷받침하는지를 검토해야 한다.
이 장은 2026-09-17에 확인한 공개 자료와 교육용 사례 E를 사용한다. 미래의 유행 연도, 국내 도입률, 업체별 우열은 예측하지 않는다. 특정 제품의 구매를 추천하는 장도 아니다. 학습 산출물은 새 주장 검토서와 제한 검증 계획이다. 구현·가격·논문은 바뀔 수 있으므로 문서의 버전과 확인일을 남긴다.
새로운 명칭을 검토 가능한 주장으로 바꾸기
하나의 제안 안에는 정의, 관찰 결과, 예측, 인과 주장, 권고가 함께 들어갈 수 있다. ‘AI 답변에서 우리 브랜드가 30% 언급되었다’는 관찰이고, ‘언급을 늘리면 매출이 증가한다’는 인과 가설이다. ‘따라서 이 도구를 구매해야 한다’는 비용과 대안까지 고려해야 하는 권고다. 앞 문장의 자료만으로 뒤 문장을 정당화할 수 있는지 검토한다.
| 주장 종류 | 예 | 확인할 근거 |
|---|---|---|
| 정의 | 응답 중 브랜드 언급 비율을 측정한다 | 분모·표본·판정 규칙 |
| 관찰 | 정한 질문 집합에서 30%였다 | 실행 기록·모델·시점 |
| 예측 | 다음 달 실제 구매가 늘 것이다 | 미래 표본의 예측 검증 |
| 인과 | 이 변경이 구매를 늘린다 | 비교 설계와 대안 설명 |
| 권고 | 이 솔루션을 전사 도입한다 | 효과·비용·대안·운영 부담 |
새 기여도 나누어 평가한다. 관찰 대상이 새로 생겼을 수 있고, 기존 원리를 구현하기 쉬워졌을 수 있으며, 조직 간 데이터를 연결하는 비용을 줄였을 수도 있다. 수학적 공식이 익숙하다는 이유로 구현상의 기여를 지우지 않는다. 반대로 새로운 약어가 붙었다고 예측·인과 검증까지 해결된 것으로 받아들이지 않는다.
주장의 수준이 바뀌면 증거도 달라진다
원본 정적 그림 보기

이 장의 관계 표기는 기존 목차의 H/M/A/U 원칙을 따른다. 동일한 비용 계산 원리를 사용하는 것은 방법 공유(M)로 설명할 수 있지만, 누가 어느 저자를 직접 계승했다는 역사적 영향(H)은 별도 문헌이 필요하다. 비슷하다는 사실과 이름을 바꾸어 속였다는 동기 추정도 구분한다.
GEO: 생성 응답 안의 가시성
GEO(Generative Engine Optimization)는 생성형 검색 응답에서 콘텐츠의 가시성을 높이는 문제를 다루는 명칭이다. Aggarwal 등의 논문은 2023년에 처음 제출되었고, 이 장은 2024-06-28의 v3를 참조한다. 연구는 응답에서 출처가 차지하는 분량·위치 등을 반영한 가시성 측정과 평가 환경을 제안했다. 논문 v3 방법·실험·한계 · S26.
그 연구의 가시성 개선 결과를 모든 현재 검색 서비스의 효과나 구매 증가로 옮길 수는 없다. 논문도 엔진과 질문의 변화에 따른 방법 조정 필요성을 설명한다. 따라서 도입 검토에서는 연구 당시의 환경과 지금 측정할 서비스를 따로 기록한다. ‘SEO가 완전히 끝났다’는 결론도 이 연구의 측정 결과와 같은 주장이 아니다.
Google Search의 AI 기능 안내는 AI Overviews·AI Mode에 기존 SEO 기본 원칙이 여전히 적용되며 별도의 특수 마크업이나 새 파일이 필수는 아니라고 설명한다. 또한 해당 노출·클릭은 Search Console의 전체 웹 검색 성과에 포함된다고 안내한다. 이 설명은 Google의 해당 기능에 한정하여 사용한다. 다른 엔진의 측정·노출 규칙까지 같다고 일반화하지 않는다. Google 공식 안내 · S60.
언급률과 인용 점유율의 분모
교육용 측정에서는 다음 두 값을 구분한다. 응답 기준 브랜드 언급률은 수집한 유효 응답 중 목표 브랜드가 한 번 이상 나타난 응답의 비율이다. 인용 점유율은 정한 인용 단위 전체 중 목표 도메인의 인용 단위가 차지하는 비율이다. 업계 전체가 합의한 단일 표준이라고 부르지 않고 이 실습의 정의로 사용한다.
E-GEO는 미리 고른 질문 20개를 같은 설정으로 5회씩 실행한 100개 응답이다. 이 자료에서는 실행 실패가 없다고 가정한다. 30개 응답에 브랜드가 언급되고, 그중 20개에 목표 도메인 링크가 있다. 응답별 같은 URL은 한 번으로 세어 전체 인용 단위 250개 중 목표 도메인 인용은 40개다.
- 응답 기준 브랜드 언급률:
30/100=30%. - 응답 기준 목표 도메인 인용률:
20/100=20%. - 인용 단위 기준 점유율:
40/250=16%.
응답과 인용 단위의 분모를 구분한다
원본 정적 그림 보기

동일한 응답에서 목표 도메인의 서로 다른 URL이 여러 개 인용될 수 있어 20개 응답과 40개 인용 단위가 양립한다. 30%를 사용자 30%의 인지도나 시장 점유율로 보고해서는 안 된다. 표본은 사람이 아니라 선정한 질문과 그 반복 응답이다. 같은 질문의 반복은 독립적인 신규 고객 100명을 조사한 것과 다르다.
가시성에서 사업 성과까지의 검증
질문 표본에는 선택 편향이 생길 수 있다. 브랜드 이름을 직접 포함한 질문만 고르면 높은 언급률이 나오기 쉽다. 구매 검토·문제 탐색·사용법처럼 목적을 나누고, 브랜드 포함 여부, 언어, 지역, 계정 상태, 엔진과 모델, 실행 날짜, 답변과 링크를 기록한다. 질문 집합을 바꾸었으면 이전 평균과 직접 비교하기 전에 구성 차이를 검토한다.
같은 설정에서도 응답은 달라질 수 있다. 반복 실행은 변동을 확인하는 자료가 되지만 변화의 원인이 콘텐츠 수정인지 엔진 업데이트인지 자동으로 분리해주지는 않는다. 페이지 개선을 검토할 때에는 바뀐 내용, 비교할 페이지·질문, 평가 기간을 정한다. 가능하다면 단계적 적용이나 비교 집합을 사용하되 검색 노출의 간섭과 시간 변화를 설명해야 한다.
가시성, 방문, 과업, 구매는 각각 다른 결과다. E-GEO의 100개 실험 응답에 붙은 브랜드 언급과 실제 웹사이트의 구매 로그는 같은 모집단이 아닐 수 있다. 둘을 곱해 매출을 추정하지 않는다. 연결할 수 있는 실제 유입은 별도 경로로 추적하고, 관찰되지 않는 대화·외부 앱 전환은 누락 범위로 남긴다. 도구가 보여주는 ‘프롬프트별 전환율’에는 실제 질문 노출 분모를 어떻게 확보했는지 확인해야 한다.
지표가 부정확한 답변을 더 많이 퍼뜨리는 결과를 보상하지 않도록 정확성도 검토한다. 잘못된 가격이나 제공하지 않는 기능으로 언급되면 가시성은 늘어도 고객의 기대와 실제 경험 사이 간극이 커진다. 언급 내용의 정확성, 인용이 주장 내용을 뒷받침하는지, 유입 후 혼란이 생기는지를 표본 검토에 포함한다.
합성 사용자는 무엇을 관찰하는가
합성 사용자는 사람의 속성·기록·설명 등을 입력하여 모델이 사용자처럼 응답하거나 행동하도록 구성한 모의 대상이다. 단순 페르소나 문장, 실제 인터뷰에 근거한 에이전트, UI를 조작하는 에이전트는 서로 다른 구현이다. ‘사용자’라는 이름만으로 실제 사람의 욕구·기회·환경을 같은 정도로 재현한다고 보지 않는다.
Park 등의 2024년 v1 연구는 실제 참여자 인터뷰에 근거한 에이전트를 사람의 응답·행동 자료와 비교했다. 해당 기록은 인간 자료를 활용한 모의 응답의 검증 사례다. 이 장은 그 초록·서지 범위를 사용하며, 제품을 출시하지 않고 장기 리텐션을 검증했다는 결과로 인용하지 않는다. v1 고정 링크 · S27.
같은 arXiv 번호의 현행 v3는 2026년에 제목과 내용이 바뀌었다. 제안서를 읽을 때 논문 번호뿐 아니라 버전·평가 과업·대상·결과 지표를 함께 기록해야 한다. 서로 다른 버전의 제목과 효과 크기를 섞어 하나의 결과처럼 설명하지 않는다. 현행 서지와 버전 이력.
합성 검토는 화면 설명의 모호한 부분을 찾거나 조사 질문의 후보를 넓히는 데 시험적으로 쓸 수 있다. 이것은 이 교재의 제한 사용 제안이며 효용을 독립적으로 입증한 성과 보고가 아니다. 실제 사용자에게 중요한 문제가 맞는지, 어떤 집단의 반응을 놓치는지는 사람의 자료로 대조해야 한다. 모델이 자신 있게 답했다는 사실은 검증 결과가 아니다.
합성 응답의 검증 계획
검증할 결과를 구체적으로 정한다. 문구 이해, 과업 성공, 선호, 구매, 30일 유지에는 각각 다른 자료가 필요하다. 설문 응답 일치도가 높다는 결과를 몇 주 뒤의 실제 제품 이용에 그대로 적용하지 않는다. 리텐션은 시간에 걸친 이용 기회·필요·경쟁 제품·비용의 영향을 받는다. 짧은 응답 생성에는 그 과정이 관찰되지 않는다.
합성 예측을 먼저 만들고 나중에 확보한 별도의 인간 자료에 대조하는 방식을 계획할 수 있다. 모델에 입력한 인터뷰나 설문 답을 다시 정답으로 평가하면 정보 누출이 생긴다. 모델·프롬프트·입력·생성 날짜를 고정하고, 평가에 사용할 사람·문항·기간의 분리 방식을 명시한다. 같은 모델에서 반복 생성한 응답 수를 독립적인 인간 표본 수로 세지 않는다.
입력 자료와 검증 자료 사이에 경계를 둔다
원본 정적 그림 보기

평균 일치만 보면 특정 집단의 오류가 숨을 수 있다. 사용 경험, 언어, 접근성 조건 등 제품에 중요한 차이로 결과를 살피되 작은 집단의 불안정성도 남긴다. 비교 기준으로 단순한 전체 평균 예측이나 이전 기간 기준선을 둔다. 복잡한 에이전트가 아주 단순한 예측보다 얼마나 나은지 알아야 운영 비용을 판단할 수 있다.
미래 유지 확률을 예측한다면 확률이 맞는지 보는 보정과 이용자를 상대적으로 구분하는 능력을 구별한다. 예를 들어 70%라고 예측한 독립 평가 대상 100명 가운데 40명만 유지했다면, 그 집단에서 예측 확률과 실제 비율의 차이는 −30%포인트다. 이 한 집계로 모형 전체 성능을 확정할 수는 없지만 해당 예측 수준의 오차를 확인할 수 있다. 높은 점수 집단의 유지가 상대적으로 높아도 확률은 과대 추정될 수 있다.
AI 제공 비용의 단위와 결과
AI 비용은 토큰·호출·실행 시간 같은 기술 사용량에 연결될 수 있다. 기술 단위당 비용은 인프라 효율을 파악하는 데 유용하다. 그러나 사용자가 원하는 과업 하나에 여러 호출·재시도·사람의 검수가 필요하면 호출 단가만으로 경제성을 판단하기 어렵다.
FinOps Foundation의 단위 경제성 설명은 사용량 단위와 사업 결과를 연결하며, 생성형 AI에서도 토큰 비용에서 결과 단위의 비용으로 확장하는 관점을 제시한다. 공식 단위 경제성 설명 · S61. 이 교재는 이를 성공 과업당 제공 비용의 교육 예제로 옮긴다. 특정 사업의 회계상 원가 분류를 결정하는 지침은 아니다.
E-AI는 같은 종류의 접수 과업 100건에 대한 두 버전의 독립된 교육용 집계다. A는 100회 호출로 70건을 성공 처리했고 B는 재시도를 포함해 200회 호출로 90건을 성공 처리했다. 호출당 단가는 각각 100원과 70원으로 가정한다. 현재 업체의 실가격이 아니다.
| 비용·결과 | A | B |
|---|---|---|
| 접수 과업 | 100건 | 100건 |
| 모델 호출·재시도 합계 | 100회 | 200회 |
| 호출당 교육용 단가 | 100원 | 70원 |
| 모델 사용 비용 | 10,000원 | 14,000원 |
| 사람 검수·기타 변동 제공비 | 10,000원 | 18,000원 |
| 총 변동 제공비 | 20,000원 | 32,000원 |
| 검증 기준 통과 과업 | 70건 | 90건 |
| 성공 과업당 총 변동 제공비 | 약 286원 | 약 356원 |
원본 정적 그림 보기

성공 과업당 비용의 분자에는 실패한 호출과 재시도 비용도 포함했다. 성공한 과업에 직접 연결된 호출만 세면 실패 비용이 사라진다. 접수 과업당 총 비용은 200원과 320원이고 성공 과업당 비용은 약 286원과 356원이다. 어떤 단위를 썼는지 명칭에 남긴다.
B는 더 많은 과업을 처리했지만 성공 과업당 비용도 높다. 추가 성공 20건에 대한 추가 변동비는 12,000원이므로 추가 성공당 600원이다. 이 값만으로 B를 거절하거나 채택하지 않는다. 추가 성공의 가치, 잘못된 성공 판정의 피해, 대기 시간, 운영 한계와 비교한다. 이 예제는 교육용 비교이며 무작위 실험에 근거한 증분 효과라고 주장하지 않는다.
획득비·제공비·고정비의 경계
CAC는 정한 고객을 획득하는 데 사용한 비용을 해당 신규 고객 수로 나눈 값이다. 가입 이후 계속 서비스를 제공하기 위한 추론비를 전부 CAC에 더하면 획득과 제공의 질문이 섞인다. 무료 체험 중 사용 비용처럼 획득 과정과 제공 과정의 경계에 있는 항목은 관리 목적에 맞는 분류 규칙을 명시하고, 공헌·CLV에서 다시 중복 차감하지 않도록 한다.
제공 비용에는 모델 사용 외에도 검색·저장·도구 호출·재시도·검수·지원이 포함될 수 있다. 공유 인프라 비용을 과업에 배분할 때에는 배분 기준을 정한다. 원래 발생하는 고정비를 더 많은 과업으로 나누면 평균 비용이 낮아져도 실제 현금 지출이 줄지는 않을 수 있다. 반대로 사용량 증가가 용량 증설을 유발하면 한계 비용이 일정하지 않을 수 있다.
새로운 이름의 ‘True-LTV’나 ‘CAC-I’를 보았다면 우선 분자·분모·기간·비용 범위를 요청한다. 여기서는 이 약어들을 공인 표준 지표로 채택하지 않는다. 기존 고객가치·공헌·비용 회수의 원리로 해석 가능한 부분과 새로운 비용 자료가 필요한 부분을 나눈다. 정의되지 않은 약어를 공식처럼 외울 필요는 없다.
채택·시험·보류·거절의 판단서
새 도구의 결론은 네 가지로 나눌 수 있다. 채택은 현재 문제·효과·운영 조건이 충분히 확인된 범위에서 도입하는 것이다. 시험은 가설과 제한된 범위를 정해 추가 자료를 얻는 것이다. 보류는 핵심 정보가 부족해 현재 결정을 미루는 것이고, 거절은 현재 요구 조건과 맞지 않거나 제안된 검증이 주장을 뒷받침하지 못한다는 판단이다. 어느 결론도 영구적인 진리로 기록하지 않는다.
| 검토 항목 | 합성 사용자 제안의 작성 예 |
|---|---|
| 제안된 문제 | 출시 전 온보딩의 이해 문제를 줄이고 싶다 |
| 실제 기능 | 지정한 설명을 읽은 모델의 반응 생성 |
| 주장과 증거 | 문구 검토 가능성은 시험 대상, 장기 유지 대체 주장은 근거 부족 |
| 허용 범위 | 조사 질문·예외 시나리오 후보 생성에 제한 시험 |
| 인간 검증 | 분리된 실제 신규 사용자 과업 관찰과 비교 |
| 비용 | 준비·실행·검수 시간 및 제공비 기록 |
| 성공·중단 조건 | 실제 조사에 유용한 문제 발견 여부, 반복 오류·편향이면 수정 또는 중단 |
| 판단 변경 조건 | 목표 과업의 독립 평가 자료가 쌓이면 범위 재검토 |
GEO는 표본 질문에서 가시성을 측정하는 시험부터 시작할 수 있고, AI 비용은 기존 원장에 결과 단위를 연결하는 검수부터 시작할 수 있다. 제한 시험의 종료일과 책임자가 없으면 시험이 관성적으로 구독·운영 비용으로 남는다. 도입 결과뿐 아니라 사용하지 않기로 한 이유도 남겨 두면 같은 주장이 다시 등장했을 때 검토를 재사용할 수 있다.
연습문제
- ‘AI 언급률이 높으므로 이 도구를 도입하면 매출이 는다’에 섞인 주장 종류를 구분하라.
- E-GEO의 세 비율을 계산하고 시장 점유율과 다른 이유를 쓰라.
- 질문 20개를 5회 반복한 자료를 인간 100명의 독립 표본처럼 해석할 수 있는지 설명하라.
- GEO의 가시성과 구매 사이에 추가로 필요한 관찰·비교를 설계하라.
- 합성 응답 검증에서 입력 자료와 평가 자료를 분리하는 이유를 쓰라.
- E-AI의 호출 단가, 접수당 비용, 성공당 비용, 추가 성공당 추가 비용을 비교하라.
- 가입 이후 추론비를 전부 CAC에 넣을 때 생기는 해석 문제와 중복 차감 위험을 설명하라.
- 새로운 약어 또는 도구 하나의 주장 검토서를 작성하고 결론 변경 조건을 적으라.
근거와 기록 범위
GEO는 S26의 v3 방법·실험 설정·한계 절, 합성 에이전트는 S27의 고정 버전 초록·서지와 현행 버전 이력을 사용했다. Google의 현행 안내는 S60, FinOps의 비용 단위 설명은 S61에 기록했다. 연구의 구현이나 성과를 재현한 것이 아니며 E의 수치·검증 계획은 교재가 만들었다. 이 장에서 제안하는 제한 시험의 효과도 직접 검토해야 한다.
새로운 지표는 새로운 관찰을 가능하게 할 수 있다. 그 관찰이 사용자 결과와 사업 판단에 어떻게 연결되는지 확인하고, 맞지 않는 연결은 수정하는 일이 PM의 측정 업무다. 그 과정은 이 교재의 다른 지표에도 같은 기준으로 적용한다.