/GEO 배우기/신뢰할 수 있는 지표
AI 가시성 측정 · 지표 품질

어떤 GEO 지표가 신뢰할 만하고, 어떤 것이 무너지나요?

이 범주의 모든 지표에는 저마다의 실패 유형이 있고, 그것을 아는 것이 행동으로 옮길 수 있는 숫자와 변명해야 하는 숫자를 갈라놓습니다. 크로스 엔진으로 섞은 점수는 대시보드의 기본 출력값이면서, 자신이 받치는 유일한 판단을 스스로 무너뜨립니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

신뢰할 수 있는 GEO 지표는 넷입니다. 엔진별로 구간을 붙여 보고하는 언급률과 인용률, 여러분이 이름을 붙이고 얼려 둔 경쟁사 세트에 대한 점유율, 그리고 사람이 표본을 읽고 판정하는 서술 정확도입니다. 무너지는 것도 넷입니다. 하나로 섞은 크로스 엔진 점수, 프롬프트별 주간 증감 화살표, 인용에서 끌어낸 트래픽이나 매출 수치, 그리고 감성 점수입니다. 그중 섞은 점수가 가장 크게 무너집니다. 쿼리 11,500건을 다룬 SIGIR 2026 연구가 Google 자연 검색결과와 AI Overviews와 Gemini가 리트리벌하는 출처들 사이의 Jaccard 유사도를 0.11에서 0.18로 측정했기 때문입니다.1

핵심 요약
  • 지표가 신뢰할 만한 것은 그것이 움직였을 때 누군가의 다음 행동이 바뀔 때뿐입니다.
  • 엔진별로 보고하고 구간을 함께 찍으십시오. 엔진을 가로지른 평균은 실제로 움직인 두 엔진을 가립니다.
  • 인용을 트래픽이나 매출로 환산하지 마십시오. Pew Research Center는 사용자가 AI 요약 안의 출처를 클릭한 방문이 약 1%였다고 밝혔습니다.8
판정

어떤 지표가 검증을 견디고, 어떤 것이 무너지는가?

지표가 검증을 견디는 것은 그것이 움직였을 때 누군가의 다음 행동이 바뀔 때입니다. 아래 여덟 개 가운데 넷은 그 기준을 넘고, 넷은 넘지 못합니다.

쓸모 있는 것은 마지막 열입니다. 어떤 관측이 특정 판독을 틀린 것으로 만드는지 그 열이 이름 붙여 둡니다.

지표판정이 판독을 틀리게 만드는 조건
엔진별 언급률, 구간 포함신뢰할 수 있음구간이 지난 기간의 구간과 겹치거나, 두 기간 사이에 패널 버전이 바뀌었을 때
엔진별 인용률, 구간 포함신뢰할 수 있음언급률과 반대 방향으로 움직였는데 둘 중 하나만 보고했을 때
점유율, 고정된 경쟁사 세트신뢰할 수 있음비교 구간 안에서 세는 세트에 브랜드가 들어오거나 빠졌을 때
서술 정확도, 사람이 읽은 표본신뢰할 수 있음같은 평가 기준을 적용한 두 독자가 답변의 5분의 1 넘게 엇갈릴 때
답변 내 위치신중하게 사용답변 하나만 놓고 읽거나, 인용 출처 수가 다른 엔진끼리 비교할 때
하나로 섞은 크로스 엔진 가시성 점수신뢰할 수 없음언제나 그렇습니다: 구성 요소가 각자 움직이므로 그 평균은 가리키는 대상이 없습니다
주간 증감 화살표가 붙은 프롬프트별 점수신뢰할 수 없음그 변동이 프롬프트 하나를 몇 번 돌렸을 때의 구간보다 작을 때
인용에서 끌어낸 트래픽이나 매출신뢰할 수 없음언제나 그렇습니다: 둘을 잇는 계수는 한 번도 측정된 적이 없습니다

판정 열은 지표를 정밀도나 비용으로 줄 세우지 않습니다. 신뢰할 수 있는 넷 가운데 몇몇은 비싸고 시끄럽습니다. 이 열이 줄 세우는 기준은 움직임이 행동을 함의하느냐입니다. 한 엔진에서 언급률이 떨어지면 그 엔진의 인용 목록을 보러 가게 되지만, 섞은 점수가 떨어지면 특별히 어디로도 가게 되지 않습니다. 밑에 깔린 여섯 가지 양은 자매 글 여섯 가지 가시성에서 정의합니다.

기본값의 실패

크로스 엔진으로 섞은 점수는 왜 자기 판단을 무너뜨리는가?

섞은 점수가 자기 판단을 무너뜨리는 까닭은, 가시성 지표가 받칠 수 있는 행동이 “다음에는 이 엔진을 손보자”뿐인데, 엔진을 가로질러 평균 내는 순간 바로 그 정보가 지워지기 때문입니다. 그런데도 이 범주의 거의 모든 대시보드가 그것을 기본 출력값으로 내놓습니다.

엔진들이 서로 얼마나 적게 공유하는지부터 보십시오. 쿼리 11,500건을 다룬 SIGIR 2026 연구는 Google 자연 검색결과와 AI Overviews와 Gemini 사이의 URL 수준 Jaccard 유사도를 0.11–0.18로 측정했습니다.1 구체적으로 읽어 보십시오. 두 서피스가 한 질문에 각각 열 개의 URL을 인용한다면, Jaccard 0.15는 두 목록에 함께 오르는 것이 약 세 개라는 뜻입니다. 게다가 그 세 서피스는 한 회사가, 하나의 색인 위에서, 하나의 제품군 안에서 만든 것입니다. 서로 무관한 두 어시스턴트라면 겹침은 더 작습니다. 2026년 비판적 서베이는 그대로 인용할 만한 한 문장으로 결론을 냅니다. 이 결과는 “글로벌 GEO 순위라는 개념을 부정한다. 가시성은 엔진과 서피스별로 색인된다”는 것입니다.2

이제 평균이 실제 한 주에 무슨 일을 하는지 보십시오. 언급률이 한 엔진에서 8포인트 오르고, 다른 엔진에서 6포인트 내리고, 나머지 셋에서 평평했다고 합시다. 섞은 점수는 약 0.5포인트 움직이고 보고서에는 “안정”이라고 적히는데, 그사이 두 엔진은 들여다볼 만한 일을 방금 벌였습니다. 여기서의 실패는 부정확함이 아닙니다. 같은 것을 재고 있지 않은 양들을 얌전하게 평균 낸 값이라는 점입니다. 이 불일치의 메커니즘은 엔진들이 일치할까 글에서 끝까지 따져 두었습니다.

엔진을 가로지른 집계에도 정당한 쓰임이 하나 있는데, 그것은 점수가 아닙니다. 임계치를 넘긴 엔진의 개수를 세십시오. “다섯 엔진 중 셋에서 답변의 4분의 1 이상에 이름이 올랐다”는 방어할 수 있는 요약 문장입니다. 통약할 수 없는 양들의 평균이 아니라, 각각 따로 방어할 수 있는 사실의 개수이기 때문입니다.

충실도

서술 정확도는 왜 아무도 사지 않는 지표인가?

서술 정확도가 아무도 사지 않는 지표인 까닭은 자동화할 수 없고 보고서를 더 나빠 보이게 만들기 때문이고, 모두에게 필요한 지표인 까닭은 다른 모든 숫자가 자신 있게 틀린 제품 설명을 승리로 계산하기 때문입니다. 여덟 개 가운데 독립적으로 확립된 기저 발생률을 가진 유일한 지표이기도 한데, 그 기저 발생률이 나쁩니다.

독립적인 세 측정, 서로 다른 세 방법, 같은 방향입니다. 2025년 3월 6일 공개된 Tow Center for Digital Journalism의 감사는 쿼리 1,600건(발행사 20곳, 각 10편의 기사, 엔진 8개)을 돌려 60%가 넘게 틀린 답을 내놓았고, 가장 성적이 좋은 엔진도 37%는 틀렸다는 것을 발견했습니다.3 같은 센터의 2024년 11월 연구는 인용문 200건을 조사해 153건의 응답이 부분적으로 또는 전부 틀렸고, 불확실성을 표시한 것은 일곱 번이었다고 보고했습니다.4 별개의 독립 연구는 답변 문장의 51.5%가 첨부된 인용에 의해 완전히 뒷받침된다는 것을 발견했고,5 2026년 프리프린트는 원자적 주장 98,020건 가운데 약 11%를 뒷받침이 불충분한 것으로 분류했습니다.6 마지막 수치가 낮은 것은 응답이 아니라 주장을 세기 때문이고, 응답은 그 안의 주장 하나라도 틀리면 틀린 것이 됩니다. 어느 쪽을 인용해도 좋지만, 단위를 함께 붙이십시오.

자기 제품에서 이것을 재는 일은 저 연구들이 들리게 하는 것보다 쌉니다. 한 달에 답변 스무 건을 표본으로 뽑되, 오류가 거래를 날리는 유형에 가중치를 두십시오. 비교형과 반론형 프롬프트입니다. 사실 축 몇 개를 담은 고정된 평가 기준에 대고 하나씩 채점하십시오. 요금제, 제품이 하는 일, 하지 않는 일, 연동, 그리고 안전이나 규정 준수에 관한 주장입니다. 감성이 아니라 축마다 이진값으로 기록하고, 틀린 문장은 그대로 남겨 그것을 만들어 낸 페이지의 담당자에게 보여 줄 수 있게 하십시오. 두 독자는 다섯 건 중 네 건에서 일치해야 합니다. 그렇지 않다면 엔진이 변덕스러운 것이 아니라 평가 기준이 너무 모호한 것입니다.

산출물은 슬라이드에 넣을 백분율이 아니라, 구체적으로 틀린 문장들의 목록과 그것을 만들어 냈을 가능성이 가장 큰 페이지들의 목록입니다. 그 목록으로 무엇을 할지는 인용 정확도 글에서 다룹니다.

취약성

점유율은 무엇 때문에 취약한가?

점유율이 취약한 까닭은, 살아남은 지표 가운데 분모가 판단으로 정해지는 유일한 지표이기 때문입니다. 그래서 세상에서 아무 일이 일어나지 않아도 몇 포인트씩 움직일 수 있습니다. 세는 세트에 사소한 경쟁사 둘을 더하면 내 몫이 내려가고, 조용히 빼면 올라갑니다. 해법은 통계적인 것이 아닙니다. 경쟁사 세트에 이름을 붙이고, 분기 동안 얼려 두고, 버전을 매기고, 그 버전을 수치 옆에 찍으십시오.

두 번째 취약성은 구조적이어서 규율로는 고칠 수 없고 공개할 수만 있습니다. 인용 기반 점유율은 분모가 엔진에 따라 달라집니다. 엔진마다 한 답변에 붙이는 출처의 개수가 크게 다르기 때문입니다. 2026년 1월부터 4월 사이에 수집한 미국 AI 검색 프롬프트 1억 2,600만 건 위에 구축되어 2026년 6월 26일 공개된 벤더 인덱스는, 한 어시스턴트가 응답당 평균 약 15개의 출처를 인용한 반면 다른 어시스턴트는 약 3개였다고 보고했습니다.7 방향은 응답당 인용 수에 대한 학술적 측정으로도 뒷받침되므로, 비율은 실재하는 것으로 다루고 정확한 평균값은 참고치로 다루십시오. 인용된 세 출처 중 하나인 것과 열다섯 중 하나인 것은 서로 다른 사건입니다. 그래서 인용 기반 점유율은 엔진 사이에서 비교할 수 없고, 언급 기반 점유율이 더 안전한 기본값입니다.

페이지 밖

어떤 숫자는 아예 대시보드에 올라오면 안 되는가?

대시보드에 절대 올라오면 안 되는 숫자가 넷이고, 각각은 부정확해서가 아니라 저마다의 이유로 실패합니다. 첫째는 인용에서 끌어낸 트래픽이나 매출 수치입니다. 그 환산을 허락해 줄 계수는 한 번도 측정된 적이 없습니다. 이 분야 자신의 2026년 서베이는 인용 점수가 클릭, 전환, 매출을 예측한다는 주장을 확신도 매우 낮음으로 평가하고,2 Pew Research Center의 2025년 7월 브라우징 연구는 사용자가 AI 요약 안의 출처를 클릭한 방문이 약 1%였다고 밝혔습니다.8 인용 횟수에 지어낸 클릭률을 곱해서 나오는 것은 오차항을 알 수 없는데 소수점만 달린 숫자이지, 추정치가 아닙니다.

둘째는 주간 증감 화살표가 붙은 프롬프트별 점수입니다. 프롬프트 하나를 몇 번 돌린 결과는 보고할 가치가 있는 어떤 변동보다도 훨씬 넓은 구간을 달고 다니므로, 화살표는 잡음 위에 그어집니다. 그 산수는 자매 글 통계적 검정력에 있습니다. 셋째는 감성 점수인데, 필요한 신호를 뭉개 버립니다. 답변이 어조는 따뜻하면서 요금제를 틀리게 말할 수 있고, 거래를 날리는 것은 바로 그 오류입니다.

넷째는 공식을 옆에 찍어 두지 않은 복합 지수입니다. 어떤 숫자가 등장 여부와 위치와 두드러짐을 가중해 섞은 값이라면, 발견에 해당하는 것은 가중치 쪽입니다. 가중치를 볼 수 없는 독자는 지난 분기 수치가 같은 방식으로 계산되었는지 확인할 수 없습니다. 공식이 공개된 지수는 지표이고, 공개되지 않은 지수는 주장입니다.

검증

새 지표를 추가할 가치가 있는지 어떻게 판단하는가?

후보 지표를 네 가지 질문에 통과시키고, 넷 모두에 답할 수 있을 때만 추가하십시오. 여러분이 통제할 수 있고 말로 밝힐 수 있는 분모가 있습니까? 분모가 엔진의 트래픽, 프롬프트 물량, 사용자 규모라면 여러분은 그것을 밝힐 수 없고, 그 지표는 퍼센트 기호를 단 추측입니다. 그 주위에 구간을 계산할 수 있습니까? 관측이 셀 수 있는 실행 집합 위에서 셀 수 있는 사건이 아니라면 구간도 없고, 변화와 요동을 가려낼 방법도 없습니다.

그것이 움직일 때 어떤 결정이 바뀝니까? 무엇이든 수집하기 전에, 표준오차 두 배의 움직임이 촉발할 구체적인 행동을 적어 두십시오. 하나도 대지 못한다면 그 지표는 주의력이 유한한 페이지 위의 장식입니다. 반증할 수 있습니까? 어떤 판독이 틀렸음을 보여 줄 관측에 이름을 붙이십시오. 위 표의 마지막 열은 바로 이것을 강제하려고 있습니다. 반증할 관측이 없는 지표는 무언가를 측정하는 것이 아니라 기분을 서술합니다.

지금 쓰는 대시보드도 같은 네 질문에 통과시켜 보십시오. 대부분의 프로그램에서는 세 번째 질문 하나만으로 패널 두세 개가 떨어집니다.

이 글의 정직한 한계

이 페이지의 판정은 논증이지 측정이 아닙니다. 이 여덟 지표를 예측 타당도로 정면 비교한 연구는 없습니다. 비교하려면 예측할 결과가 있어야 하는데, 모두가 원하는 결과인 매출이야말로 이 분야 자신의 서베이가 확신도 매우 낮음으로 평가한 대상이기 때문입니다. 그래서 여기서 “신뢰할 수 있다”는 “밝힐 수 있는 분모와 계산할 수 있는 구간과 붙어 있는 결정이 있다”는 뜻이지, “매출로 이어진다고 입증되었다”는 뜻이 아닙니다. 서술 정확도는 살아남은 넷 가운데 정의가 가장 약합니다. 표준 평가 기준이 없고, 이 과제에 대해 발표된 평가자 간 일치도도 없으며, 위에 인용한 기저 발생률은 제품이 아니라 뉴스 발행사를 대상으로 한 연구에서 나온 것입니다.

제품이 쓸모 있는 자리와 그렇지 않은 자리

위의 모든 것은 스프레드시트로 할 수 있습니다. 패널을 고정해 돌리고, 본문에서 이름이 불린 경우와 URL이 붙은 경우를 엔진별로 따로 세고, 각각에 이항 구간을 계산하고, 직접 쓴 평가 기준에 대고 한 달에 답변 스무 건을 읽으면 됩니다. Bavior는 고정된 프롬프트 패널을 다섯 개 엔진에 정해진 일정으로 돌리고, 섞은 점수가 아니라 엔진별로 보고하며, 여러분의 것이 아닌 URL까지 포함해 인용된 URL을 모두 기록합니다. 하지 않는 일은 인용으로 트래픽이나 매출을 예측하는 것입니다. 그 계수가 존재하지 않기 때문입니다. 서술 정확도도 채점하지 않습니다. 제품에 대한 문장이 사실인지 판단하는 일은 여러분의 평가 기준에 대고 답변을 읽는 사람이 하는 일이지, 분류기가 하는 일이 아니기 때문입니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 29일 기준).

출처, 모두 2026년 8월 29일 확인
  1. Grossman 외, SIGIR 2026. 쿼리 11,500건, Google 자연 검색결과와 AI Overviews와 Gemini 사이의 URL 수준 Jaccard 0.11–0.18: arxiv.org/abs/2604.27790
  2. “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035. 확신도 표, 그리고 “이 결과는 글로벌 GEO 순위라는 개념을 부정한다. 가시성은 엔진과 서피스별로 색인된다”(서베이 프리프린트): arxiv.org/abs/2607.14035
  3. Jaźwińska & Chandrasekar, Tow Center for Digital Journalism, “AI Search Has a Citation Problem”, 2025년 3월 6일. 쿼리 1,600건, 발행사 20곳, 엔진 8개, 60% 넘게 오답: cjr.org
  4. Tow Center for Digital Journalism, “How ChatGPT Search (Mis)represents Publisher Content”, 2024년 11월. 발행사 20곳에서 뽑은 인용문 200건, 응답 200건 중 153건이 부분적으로 또는 전부 오류: cjr.org
  5. Liu, Zhang, Liang, “Evaluating Verifiability in Generative Search Engines”, 2023. 문장의 51.5%가 인용에 의해 완전히 뒷받침됨: arxiv.org/abs/2304.09848
  6. Xu, Iqbal & Montgomery, 2026. 원자적 주장 98,020건 가운데 약 11%를 뒷받침이 불충분한 것으로 분류(프리프린트): arxiv.org/abs/2605.14021
  7. AI 가시성 인덱스, 2026년 6월 26일 공개. 2026년 1월부터 4월 사이에 수집한 미국 AI 검색 프롬프트 1억 2,600만 건. 한 어시스턴트는 응답당 평균 약 15개 출처를 인용한 반면 다른 어시스턴트는 약 3개. 다룬 모든 플랫폼에서 보인 브랜드는 36개. 벤더 공개 자료이므로 이 커리큘럼의 출처 규칙에 따라 서술만 하고 링크하지 않습니다.
  8. Pew Research Center, 2025년 7월 22일. 사용자가 AI 요약 안의 출처를 클릭한 방문은 약 1%: pewresearch.org
FAQ

자주 묻는 질문입니다.

목표로 삼아야 할 AI 가시성 점수 벤치마크가 있나요?

없습니다. 벤치마크라며 제시되는 수치는 모두 비교할 수 없는 패널끼리 비교한 것입니다. 여러분의 비율은 여러분이 고른 프롬프트의 함수입니다. 퍼널 하단의 좁은 질문을 재는 팀은 같은 제품을 두고 넓은 범주 질문을 재는 팀보다 낮은 숫자가 나오고, 두 숫자는 서로에 대해 아무것도 말해 주지 않습니다. 의미 있는 비교는 둘입니다. 버전을 고정한 내 패널을 그 자신과 비교하는 것, 그리고 같은 날 같은 패널 안에서 이름을 붙인 경쟁사 세트에 대해 점유율을 보는 것입니다. 둘 다 내부의 것이고, 바로 그래서 방어할 수 있습니다.

제 대시보드에는 AI 가시성 점수가 하나 뜹니다. 쓸모없는 건가요?

경보선으로는 쓸모가 있고 진단으로는 쓸모가 없습니다. 이 구분을 붙들고 있을 가치가 있습니다. 하나로 섞은 숫자는 무언가가 들여다볼 만큼 움직였다는 것은 알려 줍니다. 어느 엔진이 움직였는지는 알려 주지 못하고, SIGIR 2026 연구가 한 회사가 만든 세 서피스 사이의 URL 수준 Jaccard를 0.11–0.18로 측정한 이상 구성 요소들은 거의 독립에 가깝습니다. 이미 페이지에 있다면 섞은 점수는 그대로 두되, 그 밑에 엔진별 분해를 찍고, 누가 취하는 행동이든 섞은 점수가 아니라 그 분해에서 촉발되도록 하십시오.

사람을 뽑지 않고 서술 정확도를 재려면 어떻게 하나요?

고정된 평가 기준에 대고 한 달에 답변 스무 건을 읽고, 사실 축마다 이진값으로 채점하십시오. 거래를 날리는 축을 고르십시오. 요금제, 제품이 하는 일, 하지 않는 일, 연동, 그리고 규정 준수나 안전에 관한 주장입니다. 점수가 아니라 틀린 문장을 그대로 기록하십시오. 행동할 수 있는 것은 문장 쪽이기 때문입니다. 표본은 오류가 가장 비싸게 먹히는 비교형과 반론형 프롬프트에 가중치를 두십시오. 두 독자는 적어도 다섯 건 중 네 건에서 일치해야 하고, 그렇지 않다면 엔진이 변덕스러운 것이 아니라 평가 기준이 너무 모호한 것입니다.

인용을 추정 트래픽 수치로 왜 바꿀 수 없나요?

곱해야 할 계수가 한 번도 측정된 적이 없고, 관련된 유일한 공개 수치는 그것이 0에 가깝다고 말하기 때문입니다. Pew Research Center의 2025년 7월 브라우징 연구는 사용자가 AI 요약 안의 출처를 클릭한 방문이 약 1%였다고 밝혔고, 이 분야 자신의 2026년 서베이는 인용 점수가 클릭, 전환, 매출을 예측한다는 주장을 확신도 매우 낮음으로 평가합니다. 모델링 가정을 소리 내어 말할 수는 있습니다. “독자의 1%가 클릭하고 이 프롬프트가 N번 질문된다면”처럼 쓰되, N을 모르는 가정으로 제시해야지 측정으로 제시하면 안 됩니다. 차트로 등장하는 순간 그것은 측정으로 인용됩니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

검증을 견디는 지표는 넷.
그 넷을 엔진별로 보고하십시오.

무료 체험 시작