AI 검색의 작동 방식 · 1단계

AI 검색의 첫 단계인 쿼리 해석에서는 무슨 일이 일어납니까?

1단계는 파이프라인에서 당신의 웹사이트가 손댈 수 없는 유일한 단계입니다. 그래도 이해할 가치가 있습니다. 신뢰할 수 없는 AI 가시성 테스트 대부분은 더 아래가 아니라 바로 여기에서 무너지기 때문입니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

쿼리 해석은 AI 엔진이 대화 메시지를 기계가 읽을 수 있는 의도로 바꾸는 단계입니다. 어떤 종류의 질문인지, 어떤 엔티티를 가리키는지, 지역과 최신성 같은 어떤 제약이 적용되는지, 그리고 애초에 검색을 실행할지를 정합니다. 이 일은 어떤 문서에도 손대기 전에 일어나므로 입력은 사용자의 말, 지금까지의 대화, 엔진 자신의 사전 지식뿐입니다. 그래서 당신의 웹사이트에 있는 것은 아무것도 여기에 닿지 못하고, 당신이 통제하는 유일한 1단계 입력은 측정할 때 고르는 프롬프트입니다. Google 트렌드 쿼리 55,393개를 다룬 2026년 측정 연구는 전체의 13.7%에서 AI Overview를 기록했고, 질문 형태 쿼리에서는 64.7%까지 올라갔으며 비질문 쿼리에서는 9.5%였습니다.2

핵심 요약
  • 1단계는 세 가지 입력으로 돌아가고 그중 당신 것은 하나도 없습니다. 사용자의 말, 대화 기록, 그리고 엔진이 학습한 사전 지식입니다. 여기서는 어떤 페이지도, schema 블록도, 잘 알려진 경로의 파일도 읽지 않습니다.
  • AI 답변이 나오는지 마는지는 표현 방식이 정합니다. 질문 형태 쿼리는 비질문 쿼리보다 몇 배 자주 AI 답변을 촉발하며, 서로 다른 세 가지 방법을 쓴 세 건의 연구가 모두 그렇게 나왔습니다.
  • 모호한 브랜드명은 검색이 실행되기 전에 하나의 엔티티로 해석됩니다. 그 해석이 다른 쪽으로 가면 2단계부터 5단계까지는 애초에 당신과 무관했던 질문을 흠잡을 데 없이 처리합니다.
  • 후속 질문은 검색되기 전에 대화에 비추어 다시 쓰이므로, 같은 프롬프트라도 새 세션에서와 긴 스레드에서는 서로 다른 두 실험입니다.
정의

쿼리 해석 단계에서는 무슨 일이 일어납니까?

쿼리 해석은 사람의 메시지를, 파이프라인의 나머지가 실행 근거로 삼을 수 있는 기계적 의도로 바꾸는 일입니다. 여기서 네 가지가 나옵니다. 의도 유형, 해석된 엔티티 집합, 제약 집합, 그리고 애초에 리트리벌을 할지 말지에 대한 라우팅 결정입니다. 중요한 구분은 당신의 프롬프트가 쿼리가 아니라는 점입니다. “두 명짜리 팀에 이게 값어치가 있을까?”는 대화의 한 차례입니다. 2단계가 받는 것은 구조화된 의도이고, 3단계가 받는 것은 당신이 입력한 말과 겹치는 단어가 거의 없을 수도 있는 검색 문자열 묶음입니다.

Google은 바로 다음 단계를 자사 문서에서 설명합니다. AI Overviews와 AI Mode는 “‘쿼리 팬아웃’ 기법을 사용할 수 있다”고 하며, 답변을 만들기 위해 “하위 주제와 데이터 소스에 걸쳐 여러 건의 관련 검색”을 실행합니다.1 팬아웃이 펼쳐 내는 하위 주제는 글자 그대로의 문자열이 아니라 해석에서 나옵니다. 어휘가 하나도 겹치지 않는 질문에 어떤 페이지가 리트리벌되는 이유도, 완벽하게 답하는 것처럼 보이는 페이지가 그 질문을 놓치는 이유도 모두 여기에 있습니다.

라우팅 결정

모든 질문이 AI 답변을 촉발합니까?

아닙니다. Google에서는 AI Overview가 나타나는지 여부 자체가 이 단계에서 결정되고, 그 비율은 쿼리를 어떻게 표현했는지에 크게 좌우됩니다. 40일 동안 트렌드 쿼리 55,393개를 추적한 2026년 프리프린트는 AI Overview 발동률을 질문 형태 쿼리에서 64.7%, 비질문 쿼리에서 9.5%로 측정했습니다. 6.8배 차이입니다. 전체 쿼리 기준 비율은 13.7%이지만 이 숫자에는 질문형이 이미 포함되어 있으므로, 질문형 대 비질문형의 대비가 더 날카롭습니다.2 SIGIR 2026에서 발표된 쿼리 11,500개 연구는 트렌드가 아니라 대표성 있는 표본을 사용해 쿼리의 51.5%에서 AI Overview가 나타났다고 밝혔습니다.3 두 숫자는 서로 충돌하지 않습니다. 표본으로 삼은 모집단이 다를 뿐이고, 그 사실 자체가 이런 문헌을 읽는 법을 알려 줍니다.

검색 결과 페이지 1억 4,600만 건을 바탕으로 2026년 1월에 공개된 대규모 벤더 연구는 세 번째 방법으로 같은 방향을 보고합니다. AI Overviews는 질문형 쿼리의 57.9%에 나타났고 비질문 결과 페이지에서는 15.5%였으며, 이를 촉발한 키워드의 99.9%가 정보형이었습니다.6 독립적인 세 가지 방법, 하나의 방향입니다. 이 분야 전체에서 가장 견고한 구조적 발견이고, 동시에 1단계의 발견입니다. 쿼리의 모양에 관한 이야기이지, 당신 페이지를 어떻게 쓰는지에 관한 이야기가 아닙니다.

여기서 나오는 결론은 측정에 관한 것입니다. 테스트 프롬프트가 AI 답변을 촉발하지 못했다면, 당신이 알게 된 것은 그 프롬프트에 관한 사실이지 가시성에 관한 사실이 아닙니다. 발동률과 인용률을 따로 기록하십시오. 그러지 않으면 애초에 다른 값이 될 기회조차 없던 0들을 계속 평균에 넣게 됩니다.

모호성

엔진은 당신이 말한 엔티티를 어떻게 정합니까?

엔진은 모호한 이름마다 하나의 읽기를 고르고, 파이프라인의 나머지 전부가 그 선택을 이어받습니다. 이의를 제기할 수 없고, 선택이 있었다는 눈에 보이는 신호도 대개 없습니다. 일반 명사이기도 한 제품명, 다른 업종의 더 큰 회사와 이름이 같은 회사, 인접 업종에서 세 가지 뜻을 가진 약어. 이 모두가 1단계에서 해석을 강제하고, 해석이 반대쪽으로 가면 2단계부터 5단계까지는 잘못된 엔티티를 두고 흠잡을 데 없이 돌아갑니다. 당신의 페이지는 거부당한 것이 아닙니다. 애초에 후보에 오르지도 않았습니다. 엔진이 실제로 검색한 질문은 다른 것에 관한 질문이었기 때문입니다.

여기서 증거는 바닥납니다. 그 점은 분명히 밝혀 두는 편이 좋습니다. 엔티티 해석 방식을 공개하는 엔진은 없고, AI 검색이 브랜드명을 얼마나 자주 잘못 해석하는지 측정한 공개 벤치마크도 없습니다. 이어지는 내용은 리트리벌이 작동하는 방식에서 끌어낸 추론이지 측정된 레버가 아닙니다. 제품 이름은 어디서나 하나로 통일하십시오. 카테고리는 암시하지 말고 자기 페이지에 평이한 문장으로 밝히십시오. 당신을 설명하는 서드파티 페이지들이 같은 이름과 같은 카테고리 단어를 쓰는지 확인하십시오. 코퍼스가 어떤 이름과 어떤 카테고리를 일관되게 연결해 두면 해석이 쓸 재료가 늘어납니다. 이것은 그럴듯한 메커니즘이지 입증된 메커니즘이 아닙니다. “엔티티 최적화”에 퍼센트를 붙여 파는 사람은 아무도 측정한 적 없는 숫자를 파는 것입니다.

맥락 이어받기

대화 기록은 쿼리를 어떻게 바꿉니까?

후속 질문은 검색되기 전에 대화에 비추어 다시 쓰이므로, 실제로 실행된 쿼리는 당신이 입력한 쿼리가 아닙니다.

아래 두 열은 2026년 비판적 서베이가 제시한 최소 연구 체크리스트입니다. 실행 전에 기록할 것과, 실행을 조용히 무효로 만드는 것입니다.4

테스트를 실행할 때마다 먼저 기록할 것

  • 정확한 제품과 모드: 채팅, 검색 모드, 또는 AI Mode
  • 인터페이스에 표시되는 경우 모델 버전
  • 날짜, 시각, 지역
  • 그 차례에 검색이 켜져 있었는지 여부
  • 저장된 기억이 없는, 새로 시작한 로그아웃 상태의 세션
  • 글자 그대로의 프롬프트, 실행 사이에 바꾸지 않은 것

실행을 조용히 무효로 만드는 것

  • 지난번과 같은 스레드에서 다음 테스트를 묻는 것
  • 계정 기억이나 기록이 답변을 개인화하도록 두는 것
  • 실행 사이에 프롬프트 표현을 조금 바꾸는 것
  • 엔진마다 한 번씩만 실행하고 그것을 순위로 읽는 것
  • 여러 엔진을 평균 내어 하나의 가시성 점수로 만드는 것
  • “AI 답변이 나오지 않았다”를 “우리는 보이지 않는다”로 읽는 것

제품 세 개에 관한 질문 뒤에 “가격은 어떻습니까?”라고 물으면, 엔진은 대명사와 주어와 비교 대상 집합을 대화에서 해석한 뒤 당신이 쓴 여섯 단어가 아니라 그 다시 쓰인 버전을 검색합니다. 사용자에게는 도움이 되지만 테스트에는 치명적입니다. 두 사람이 두 개의 스레드에서 같은 스크립트를 돌렸다면 서로 다른 두 실험을 돌린 것입니다. 같은 프롬프트라도 새 세션과 긴 스레드에서 공통 출처가 거의 없는 답변이 나올 수 있는 이유도 이것입니다.

여기에 확률적 변동이 겹칩니다. 2026년 비판적 서베이는 상용 엔진에서 같은 쿼리를 반복 실행했을 때 Jaccard 겹침이 0.34~0.42이고, 온도를 제어할 수 있는 환경에서 반복 판단의 변화가 9~28%라고 보고합니다.4 여러 엔진을 9일 동안 매일, 그리고 10분 간격으로도 표본 추출한 2026년의 통계적 연구는 인용 분포가 변동이 큰 멱법칙을 따르며 “도메인 사이의 겉보기 차이 상당수가 측정 과정의 잡음 바닥 안에 들어간다”고 결론지었습니다.5 먼저 세션을 통제하고, 그다음 실행을 반복하고, 마지막에 분포로 보고하십시오.

레버가 없다

왜 당신이 가진 것은 1단계에 영향을 주지 못합니까?

1단계에는 정확히 세 가지 입력이 있고 그중 당신 것은 하나도 없기 때문입니다. 사용자의 말, 대화 기록, 그리고 언어와 엔티티에 대해 엔진이 스스로 학습한 사전 지식입니다. 이 시점에는 어떤 문서도 아직 가져오지 않았습니다. 이 단계에는 페이지나 schema 블록, robots 지시문, 잘 알려진 경로의 파일을 읽을 자리가 없습니다. 파일에 관해서는 Google 자체 문서가 아니라고 못 박습니다. “이 기능들에 나타나기 위해 새로운 기계 판독 파일이나 AI 텍스트 파일, 마크업을 만들 필요는 없습니다.”1

이것은 계속 지니고 다닐 만한 진단법입니다. GEO 주장을 만나면 그것이 어느 단계에 작용하는지 물으십시오. 정직한 답이 1단계라면, 즉 검색하기 전에 엔진이 “당신의 브랜드를 이해하게” 만든다는 식의 말이라면, 그 주장은 뒷 단계의 작업을 잘못 설명한 것이거나 뒤에 아무 메커니즘도 없는 것입니다. 파이프라인에는 거기에 문이 없습니다.

적용

1단계에 대해 실제로 무엇을 할 수 있습니까?

측정할 프롬프트는 키워드를 고르듯 신중하게 고르십시오. 프롬프트는 당신 손에 있는 유일한 1단계 입력이기 때문입니다. 구매자가 실제로 입력하는 방식대로, 완전한 문장으로 쓰십시오. 질문 형태 쿼리는 비질문 쿼리보다 대략 네 배에서 일곱 배 높은 비율로 AI 답변을 촉발하기 때문입니다. 브랜드 질문만이 아니라 의사결정 전체를 덮으십시오. 카테고리가 무엇인지, 선택지가 무엇인지, 비용이 얼마인지, 무엇이 잘못되는지. “최고의 X 도구” 같은 쿼리로만 만든 프롬프트 묶음은 구매 대화의 좁은 한 조각만 측정합니다.

그다음에는 촉발 여부를 잡음이 아니라 데이터로 다루십시오. AI 답변이 나왔는지를, 당신이 인용되었는지와 따로, 그리고 정확하게 설명되었는지와 또 따로 기록하십시오. 이것은 세 가지 다른 실패이고 고치는 방법도 세 가지로 다릅니다. 서베이 자신의 권고도 “리트리벌, 인용, 충실도를 따로 측정하라”는 것입니다.4 AI 검색의 작동 방식의 나머지는 모두 이 단계 이후의 단계, 즉 당신에게 실제로 입력이 있는 단계에 관한 것입니다.

이 글의 정직한 한계

1단계는 파이프라인에서 문서가 가장 적은 단계이고, 이 글도 그만큼 이 묶음에서 추론의 비중이 가장 큽니다. 자사의 쿼리 이해를 공개하는 엔진은 없습니다. AI 검색이 브랜드명을 얼마나 자주 잘못된 엔티티로 해석하는지에 대한 공개 벤치마크도 없습니다. 엔티티 절의 이름 짓기 조언은 그럴듯한 메커니즘일 뿐, 뒷받침하는 측정된 효과 크기가 없습니다. 여기서 근거가 단단한 부분은 좁습니다. 질문 형태 쿼리의 발동률, 그리고 실행 간 변동 수치입니다. 나머지는 작업용 모델입니다. 누군가 1단계에 대해 자신 있는 숫자를 내놓는다면, 그것은 아무도 측정한 적 없는 것에 대한 주장으로 받아들이십시오.

제품이 쓸모 있는 자리와 그렇지 않은 자리

여기 나온 방법은 전부 무료이고 수작업입니다. 구매자가 실제로 입력할 법한 프롬프트 20개를 쓰고, 엔진마다 새로 시작한 로그아웃 상태의 세션을 열고, 그대로 붙여 넣은 다음 세 개의 열을 기록하십시오. AI 답변이 나왔는지, 인용되었는지, 정확하게 설명되었는지. 한 번의 실행은 표본 하나이므로 서로 다른 사흘에 걸쳐 반복하십시오. 스프레드시트로도 충분합니다. 무너지는 것은 매주 이 일을 계속하려는 의지뿐입니다. Bavior는 그 반복을 자동화해, 정해진 프롬프트 묶음을 다섯 개 엔진에 정기적으로 돌리고 실행마다 인용된 출처를 기록해서 스크린샷이 아니라 분포를 보게 합니다. 인용된 출처가 진행 중인 토론 스레드일 때는 여러분이 관리하는 계정으로 답글 초안을 쓰고, 무엇이든 게시되기 전에 여러분이 승인합니다. 1단계에는 영향을 줄 수 없습니다. 무엇도 그럴 수 없기 때문입니다. 엔진이 질문을 어떻게 해석하는지, 당신의 브랜드명을 어떻게 해석하는지, 검색할지 말지를 어떻게 정하는지는 바꾸지 못합니다. 무료 AI 가시성 체크무료 GEO 점검은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 29일 기준).

출처, 모두 2026년 8월 29일 확인
  1. Google Search Central, “AI features and your website” (쿼리 팬아웃, 특별한 파일이나 마크업 불필요, 1차 자료): developers.google.com/search/docs/appearance/ai-features
  2. Xu, Iqbal & Montgomery, 2026. 40일 동안 트렌드 쿼리 55,393개, 2026년 3월 13일부터 4월 21일까지 수집. AI Overview 발동률은 질문 형태 쿼리 64.7%, 비질문 쿼리 9.5%, 논문이 밝힌 차이는 6.8배. 전체 쿼리 기준 13.7% (프리프린트): arxiv.org/abs/2605.14021
  3. Grossman 외, SIGIR 2026. 쿼리 11,500개, 대표성 있는 표본의 51.5%에서 AI Overview 표시: arxiv.org/abs/2604.27790
  4. “Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035 (서베이 프리프린트): arxiv.org/abs/2607.14035
  5. Sielinski, “Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement”, 2026년 3월, arXiv:2603.08924 (프리프린트): arxiv.org/abs/2603.08924
  6. AI Overview 발동 연구, 2026년 1월: 검색 결과 페이지 1억 4,600만 건, AI Overviews 7,670만 건. 질문형 쿼리 57.9% 대 비질문 결과 페이지 15.5%, 발동 키워드의 99.9%가 정보형. 벤더가 발행한 자료로, 이 커리큘럼의 출처 규칙에 따라 링크하지 않고 설명만 합니다.
  7. Aggarwal 외, “GEO: Generative Engine Optimization”, KDD 2024, arXiv:2311.09735 (이 파이프라인 모델의 출발점인 리트리벌 더하기 종합 프레이밍): arxiv.org/abs/2311.09735
FAQ

자주 묻는 질문입니다.

AI 엔진이 내가 물은 것과 완전히 다른 질문에 답한 이유는 무엇입니까?

1단계가 당신의 질문을 하나의 의도로 해석했는데 그 해석이 의도하지 않은 곳으로 갔기 때문입니다. 모호한 제품명, 업종을 넘나들며 공유되는 약어, 스레드 앞부분에서 이어받은 대명사는 모두 어떤 문서를 가져오기도 전인 해석 시점에 정해지고, 이후의 모든 단계가 선택이 있었다는 신호도 없이 그 결정을 이어받습니다. 그래서 답변은 잘못된 질문에 대해 정확하게 만들어집니다. 해석 실패와 리트리벌 실패를 구분하는 가장 빠른 방법은, 엔티티를 모호하지 않게 지목한 채 새 세션에서 그 프롬프트를 다시 실행해 보는 것입니다.

질문 형태의 프롬프트가 정말로 AI 답변을 더 자주 촉발합니까?

그렇습니다. 그리고 이것은 세 가지 독립적인 방법으로 뒷받침된, 이 분야에서 가장 잘 입증된 구조적 발견입니다. 40일 동안 트렌드 쿼리 55,393개를 추적한 2026년 프리프린트는 Google AI Overview 발동률을 질문 형태 쿼리에서 64.7%, 비질문 쿼리에서 9.5%로 측정했습니다. 6.8배 차이입니다. 대표성 있는 표본을 쓴 SIGIR 2026의 쿼리 11,500개 연구에서는 쿼리의 51.5%에서 AI Overviews가 나타났습니다. 검색 결과 페이지 1억 4,600만 건을 다룬 2026년 1월 벤더 연구는 질문형 쿼리 57.9%, 비질문 페이지 15.5%로 보고했습니다. 표본은 다르지만 방향은 다르지 않습니다.

AI 엔진이 검색하기 전에 내 브랜드를 이해하게 만들 수 있습니까?

그럴 수 있는 메커니즘은 문서화된 바가 없습니다. 1단계는 당신의 사이트에서 입력을 받지 않기 때문입니다. 해석은 어떤 문서를 가져오기 전에 사용자의 말, 대화 기록, 엔진이 스스로 학습한 사전 지식 위에서 돌아가며, 페이지나 schema 블록이나 잘 알려진 경로의 파일을 읽는 자리는 없습니다. Google 문서도 자사 AI 기능에 나타나기 위해 새로운 기계 판독 파일이나 마크업이 필요하지 않다고 직접 밝힙니다. 웹 전반에서 이름을 일관되게 쓰면 해석에 도움이 될 법하지만 그 효과 크기를 발표한 사람은 없으므로, 그 주장에 붙은 퍼센트는 측정되지 않은 것으로 보십시오.

같은 프롬프트인데 새 대화와 오래된 스레드에서 출처가 다른 이유는 무엇입니까?

후속 질문은 검색되기 전에 대화에 비추어 다시 쓰이므로, 실제로 실행된 쿼리가 당신이 입력한 쿼리가 아니기 때문입니다. 대명사, 비교 대상 집합, 생략된 주어는 모두 1단계에서 대화 기록으로부터 해석됩니다. 여기에 엔진 자체의 실행 간 변동이 더해집니다. 2026년 비판적 서베이는 상용 엔진에서 같은 쿼리를 반복 실행했을 때 Jaccard 겹침이 0.34~0.42라고 보고합니다. 그래서 두 스레드는 서로 다른 두 실험이 됩니다. 기억을 끄고 새로 시작한 로그아웃 상태의 세션에서 테스트하고, 결과에서 무언가를 읽어 내기 전에 각 프롬프트를 여러 번 반복하십시오.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

1단계는 당신의 손을 벗어나 있습니다.
나머지 넷은 그렇지 않습니다.

무료 체험 시작