/GEO 배우기/첫 90일
GEO 프로그램 · 운영

GEO 프로그램의 첫 90일은 어떤 모습이어야 할까?

기꺼이 실패시킬 게이트를 갖춘 순서입니다. 순서는 측정이 실제로 무엇을 뒷받침할 수 있는지가 정합니다. 첫 달에 사는 것은 계측기이지 결과가 아닙니다.

이 페이지 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

첫 달은 거의 계측기를 만드는 데에만 쓰십시오. 계측기 자체의 흔들림이 당신이 감지하려는 변화보다 크기 때문입니다. 그다음에는 각 단계가 다음 단계에 필요한 입력을 만들어내는 순서로 진행하고, 단계 사이에 기꺼이 실패시킬 게이트를 두십시오. temperature를 0으로 두고 실행을 반복해도 판정의 9~28%가 바뀌고, 네 개 엔진에 걸친 일별 출처 수준 Jaccard는 0.34에서 0.42 사이입니다. 그래서 한 분기는 그 잡음을 특성화하기에 겨우 충분한 시간이며, 그것을 이기기에는 부족합니다.1

핵심 요약
  • 90일째에 측정된 개선을 약속하는 계획은 계측기가 줄 수 없는 것을 약속하는 것입니다. 한 분기가 주는 것은 베이스라인, 깨끗한 기술 계층, 날짜가 붙은 변경 로그, 그리고 정직한 재측정 한 번입니다.
  • 1~4주차는 계측기 설치입니다. 프롬프트, 실행 횟수, 기록된 실행 메타데이터, 고정된 패널 버전, 그리고 아무도 건드리지 않는 홀드아웃.
  • 게이트는 넷이고, 각각 실패했을 때의 행동이 명시돼 있습니다. 기술 통과, 패널 고정, 손대지 않은 홀드아웃, 조건을 맞춘 재측정입니다.
  • 콘텐츠는 5주차까지 기다립니다. 공개된 콘텐츠 쪽 효과는 작고 그중 몇은 음수이며, 그렇게 작은 효과는 계측기 뒤에 놓여야 하기 때문입니다.
측정

왜 첫 달에 사는 것은 결과가 아니라 계측기인가?

이유는 프로젝트 관리 관행이 아닙니다. 당신이 아무것도 건드리지 않을 때 측정이 어떻게 움직이는지가 이유입니다. 2026년 비판적 서베이가 재현성 근거를 한곳에 모아 놓았습니다. 4,706건 쿼리 감사가 동료 심사를 거친 Kirsten 등은, temperature를 0으로 두고 실행을 반복하면 판정의 9~28%가 바뀐다는 것을 발견했습니다.2 Schulte 등은 작은 스위스 쿼리 집합에 대해 네 개 엔진을 45일간 관찰해, 일별 출처 수준 Jaccard가 0.34에서 0.42 사이임을 기록했습니다.1

둘을 같이 읽으십시오. 어느 날이든 엔진이 당신의 프롬프트 집합에 대해 인용하는 출처의 상당 부분은 어제와 다릅니다. 당신 쪽에서는 아무것도 바뀌지 않았는데도 그렇습니다. 개입이 이겨야 하는 것이 바로 이것이고, 베이스라인이 한 번의 판독이 아니라 분포인 이유도 이것입니다. 프롬프트 하나를 한 번 실행한 결과는 엔진에 대해서는 거의 말해주지 않고, 그것을 실행한 그 1분에 대해서는 많이 말해줍니다.

쓸 만한 구간을 얻으려면 프롬프트와 실행이 얼마나 필요한지는 패널 규모에서, 어떤 패널 규모가 무엇을 감지할 수 있고 없는지는 통계적 검정력에서 다룹니다. 여기서는 반복하지 않습니다. 이 글은 결론만 가져옵니다. 보고 단위는 패널이고, 개별 프롬프트는 결코 보고 단위가 아닙니다.

일정에 대한 결과는 마감을 정한 사람에게 소리 내어 말할 가치가 있습니다. 90일 안에 신뢰할 만한 베이스라인을 세우고, 수정을 배포하고, 패널을 한 번 다시 읽을 수 있습니다. 하지만 특정 콘텐츠 변경이 특정 움직임을 일으켰다는 것까지 증명할 수는 없습니다. 표류하는 계측기를 상대로 한 번의 전후 비교는 그 무게를 감당하지 못하기 때문입니다. 그 말을 하기에는 12주차보다 1주차가 훨씬 나은 시점입니다.

게이트

각 단계는 어떤 게이트를 통과해야 하나?

게이트는 기꺼이 실패시킬 조건입니다. 실패해도 아무 일이 일어나지 않는다면 그것은 마일스톤이고, 마일스톤은 아무것도 지키지 못합니다.

게이트시점통과 조건통과하지 못하면
검색 가능성4주차범위 안의 페이지가 평범한 페치에 답변 본문을 돌려주고, 색인되어 스니펫 노출 자격이 있으며, 의존하는 크롤러 토큰 중 차단된 것이 하나도 없음멈추십시오. 엔진이 가져올 수 없는 페이지는 다른 무엇도 측정할 수 없습니다
패널 고정4주차프롬프트 목록, 엔진별 실행 횟수, 기록된 실행 메타데이터에 버전이 매겨졌고 12주차 전에는 바뀌지 않음베이스라인을 다시 잡으십시오. 분기 중간에 커진 패널은 분모가 분자와 함께 움직였습니다
홀드아웃4주차프롬프트 10~15개가 절대 손대지 않는 것으로 표시돼 있고, 작업하는 사람 모두가 어느 것인지 알고 있음진행해도 됩니다. 다만 움직임은 당신의 작업이 일으킨 것이 아니라 작업과 동시에 일어난 것으로 보고하십시오
재측정12주차12주차 실행이 제품, 모드, 모델, 로케일, 계정, 검색 활성화 여부에서 4주차 실행과 일치함그 차이를 측정되지 않음으로 보고하십시오. 측정되지 않음은 0이 아닙니다

첫 번째 게이트는 기술 통과입니다. 그 항목들은 이 글의 소관이 아닙니다. 기술 체크리스트가 실행 비용이 가장 적은 순서로 항목을 나열합니다. 여기서 다룰 것은 그것이 왜 맨 앞에 오는가입니다. Google 문서는 보조 링크 자격을 얻으려면 페이지가 “색인되어 있고 스니펫과 함께 Google 검색에 표시될 자격이 있어야 한다”고 밝히고7, 생성형 기능은 “우리의 핵심 검색 순위 및 품질 시스템에 뿌리를 두고 있다”고 밝힙니다.6 이 조건을 통과하지 못한 페이지는 약한 측정값을 내놓는 것이 아닙니다. 아예 아무것도 내놓지 않습니다. 그리고 그 페이지를 포함한 이후의 모든 비교는 부재를 결과로 읽게 됩니다.

네 번째 게이트는 물리기 전까지는 지나치게 깐깐해 보입니다. 서베이의 재현성 지침은 두 번째 실행과 비교 가능하려면 한 번의 실행이 무엇을 기록해야 하는지 열거합니다. “제품, 모드, 모델, 날짜, 로케일, 계정, 검색 활성화”입니다.1 4주차와 12주차 사이에 그중 하나라도 바꾸면, 당신이 보고하는 차이에는 그것이 조용히 포함됩니다. 1주차에 적어두는 데는 비용이 들지 않지만, 12주차에 복원하는 것은 불가능합니다.

일정

각 주차 구간은 무엇을 만들어내나?

각 단계가 다음 단계에 필요한 입력을 만들어내도록 배열했습니다. 진짜 명세는 산출물이고, 활동은 거기에 도달하는 방법일 뿐입니다.

01

1–2주차 · 계측기

프롬프트는 키워드 도구가 아니라 실제 통화, 티켓, 실주 메모에서 써내고, 일정에 맞춰 실행하십시오. 산출물: 엔진별로 구간이 붙은 베이스라인, 그리고 그 엔진들이 인용한 URL.

02

2주차 · 진단

기술 체크리스트는 베이스라인 뒤가 아니라 나란히 돌리십시오. 읽기 전용이라 아래에서 진행 중인 측정을 흔들지 않습니다. 산출물: 수정 목록, 대부분은 스프린트 하나 분량.

03

3–4주차 · 수정과 고정

기술 수정을 배포한 다음 패널에 버전을 매기고 홀드아웃을 지정하십시오. 산출물: 검색 가능한 사이트, 그리고 당신이 일으킨 어떤 이유로도 더는 움직이지 않는 계측기.

04

5–8주차 · 사이트 내

의도가 가장 강한 페이지들을 문단 단위로 다시 쓰십시오. 질문형 제목, 첫 두 문장 안의 답, 분모가 붙은 숫자. 산출물: 리트리벌뿐 아니라 선택 단계에서도 후보가 되는 페이지.

05

7–12주차 · 사이트 외

제3자 페이지의 틀린 사실을 바로잡고, 엔티티 설명을 일관되게 하고, 엔진이 이미 인용하는 스레드에 답하십시오. 산출물: 어떤 URL이 인용되는지의 변화, 누구의 바람보다도 늦게 도착합니다.

06

12주차 · 재측정

고정한 패널을 다시 실행하고, 손댄 프롬프트를 홀드아웃 옆에 놓고, 결과가 어느 쪽으로 갔든 적으십시오. 산출물: 방어 가능한 전후 비교, 또는 정직한 무효과 결론.

콘텐츠가 5주차에 오는 데에는 베이스라인이 없다는 것 말고 두 번째 이유가 있습니다. 공개된 콘텐츠 쪽 개입의 효과 크기는 작고, 그중 몇은 음수입니다. 열 가지 방법을 다룬 NeurIPS 2025 벤치마크 C-SEO Bench는 그 대부분이 “대체로 효과가 없을 뿐 아니라 문서 순위에 부정적 영향을 주는 경우도 잦다”고 보고하며, 54개 사례 중 통계적으로 유의한 순위 개선을 보인 것은 3개뿐이었다고 밝힙니다.4 KDD 2026의 SAGEO Arena는 모델에 고정된 맥락을 건네는 대신 리트리벌과 재순위화를 되살렸고, 본문만 최적화했을 때 대표 평균 세 개가 0.58, 1.00, 0.50에서 0.53, 0.84, 0.47로 내려가는 것을 발견했습니다. 각각 9%, 16%, 6%씩 반대 방향입니다.5 그렇게 작은 효과는 계측기 뒤에 놓여야 합니다.

약속

90일째에 정직하게 약속할 수 있는 것은 무엇인가?

산출물 네 가지, 그중 어느 것도 올라간 숫자가 아닙니다. 엔진별 베이스라인과 구간이 붙은, 버전이 매겨진 프롬프트 패널. 페치 수준 감사를 통과하는 기술 계층. 다음 분기가 추측이 아니라 귀속을 할 수 있도록 날짜가 붙은 모든 변경 로그. 그리고 홀드아웃을 옆에 둔 패널 재측정 한 번. 이 목록은 회의적인 사람들이 모인 방에서도 버티며, 한 분기가 정직하게 사는 것이 바로 이것입니다.

약속할 수 없는 것은 정작 요구받게 될 것들입니다. 순위, 특정 답변에 포함되는 것, 또는 매출. 서베이의 확신도 표는 인용 점수가 클릭, 전환, 매출을 예측한다는 주장을 매우 낮음으로 평가합니다.1 트래픽 쪽도 약합니다. Pew는 2025년 3월 미국 성인 900명의 Google 검색 68,879건을 추적해, AI 요약 안의 출처를 클릭하는 일이 “전체 방문의 1%에서만” 일어났다고 밝혔습니다.8 트래픽 프로그램으로 팔린 가시성 프로그램은, 한 번도 측정한 적 없는 지표로 심판받습니다.

한 가지 한계는 판단이 아니라 산수입니다. 당신의 패널이 분해할 수 있는 변화가 대략 10포인트인데 배포한 변경의 값이 3포인트라면, 12주차 재측정에는 아무것도 나타나지 않습니다. 그것은 계측기의 성질이지 이 작업에 대한 증거가 아닙니다. 어느 정도 크기의 움직임이라야 의사결정이 바뀌는지를 1주차에 정하고, 통계적 검정력과 대조해 보십시오. 패널이 그만큼 작은 것을 볼 수 없다면, 더 큰 패널을 사거나 그것을 감지하겠다는 약속을 그만두십시오.

실패 유형

어떤 순서 실수가 분기를 날려버리나?

분기를 거꾸로 진행한 팀이 이 실패를 구체적으로 보여줍니다. 그들은 6주짜리 콘텐츠 스프린트로 시작했습니다. 콘텐츠는 모두가 할 줄 아는 부분이었기 때문입니다. 측정은 7주차에 시작했고, 12주차에는 방어할 수 없는 상승 곡선을 손에 쥐고 있었습니다. 엔진이 무엇을 봤는지 누군가 기록하기 전에 페이지가 바뀌었으므로 “이전”은 기억일 뿐이었습니다. 패널은 프롬프트 22개에서 60개로 커졌으므로 분모가 분자와 함께 움직였습니다. 홀드아웃이 없었으므로, 모든 것을 끌어올린 플랫폼 쪽 변경은 스프린트가 먹힌 것과 똑같아 보였습니다. 작업 자체는 어느 것도 나쁘지 않았습니다. 순서가 그것을 무효로 만들었습니다.

리뷰를 견디는 순서

  • 범위 안의 어떤 페이지도 바뀌기 전에 베이스라인을 잡는다
  • 분기당 패널 버전은 하나, 보고서에 이름을 적는다
  • 아무도 건드리지 않는 프롬프트 10~15개의 홀드아웃
  • 한 구간에 변수 하나: 기술, 사이트 내, 사이트 외
  • 엔진별 숫자, 각각 자기 구간을 함께

결과를 무효로 만드는 순서

  • 1~4주차의 콘텐츠 스프린트
  • 생각날 때마다 패널에 프롬프트를 추가하기
  • 기술 수정과 콘텐츠 편집을 같은 주에 배포하기
  • 엔진들을 평균 낸 하나의 혼합 점수
  • 한 번의 실행을 사실로 읽기

혼합 점수 항목이 이 목록에 오른 것은 취향이 아니라 측정 때문입니다. 대표 쿼리 11,500건을 다룬 SIGIR 2026 연구는 Google 자연 검색 결과, AI Overviews, Gemini 사이의 URL 수준 Jaccard 유사도를 0.11에서 0.18로 측정했습니다.3 Jaccard는 교집합을 합집합으로 나눈 값이지 인용된 URL의 비중이 아니며, 그 수준이면 세 면은 거의 겹치지 않습니다. 그것들을 평균한 값은 누구도 방문할 수 없는 엔진을 기술합니다.

인수인계

91일째에는 무슨 일이 일어나나?

계획이 끝나고 리듬이 시작되며, 둘은 서로 다른 모양입니다. 90일이 존재하는 이유는, 그 뒤로는 적은 주의력만으로 무기한 돌아가는 무언가를 만들기 위해서입니다. 일정에 따라 도는 패널, 열이 바뀌지 않는 월간 보고서, 결코 비지 않는 사이트 외 대기열. 반복되는 리듬은 주간 워크플로가, 보고서의 모양과 홀드아웃 비교는 방어 가능한 보고서가, 상시 청구서는 운영 비용이 다룹니다. 이 글은 인수인계 지점에서 멈춥니다.

그 경계를 넘는 것이 하나 있습니다. 게이트는 90일째에 은퇴하지 않습니다. 이후 모든 비교에 걸리는 상시 조건이 됩니다. 베이스라인을 다시 잡거나, 패널을 키우거나, 홀드아웃을 잃은 분기는 달력이 무엇이라 하든 이 계획의 1주차에서 다시 시작한 것입니다.

이 글의 정직한 한계

이 순서 논증은 불안정성에 대한 근거에 기대고 있지, 이 순서가 다른 순서보다 낫다는 근거에 기대고 있지 않습니다. 그 실험을 한 사람은 없고, 어떻게 할 수 있을지도 잘 보이지 않습니다. 대조 조건에는 같은 사이트의 두 번째 사본이 필요합니다. 두 불안정성 수치는 모두 좁은 표본에서 나왔습니다. 45일간의 작은 스위스 쿼리 집합, 그리고 4,706건 쿼리 감사입니다. 게다가 둘 다 독립적인 재현이 아니라 서베이를 거쳐 당신에게 도달합니다. 이들이 확립하는 것은 측정이 스스로 상당히 움직인다는 것이고, 그래서 한 분기 안에 측정된 개선을 약속하는 일은 배제됩니다. 이 주차 경계가 최적이라는 것을 확립하지는 않습니다. 방어 가능한 기본값으로 삼되, 당신 자신의 베이스라인이 다른 말을 하면 옮기십시오.

제품이 도움이 되는 지점, 되지 않는 지점

이 계획의 대부분은 달력 규율이고, 그것을 파는 사람은 없습니다. 프롬프트는 당신의 통화와 티켓에서 나오고, 기술 수정은 당신 엔지니어의 일이며, 고정과 홀드아웃은 누군가 결정하고 지켜야 하는 판단입니다. 어떤 도구도 그것을 강제하지 못합니다. 도구가 할 수 있는 것은 반복적인 중간 부분입니다. Bavior는 고정된 프롬프트 패널을 다섯 개 엔진에 일정대로 실행하고, 각 답변이 어떤 출처를 인용했는지 기록하며, 12주차를 4주차와 비교 가능하게 만드는 실행 메타데이터를 보관합니다. 인용된 출처가 진행 중인 토론 스레드일 때는 당신이 관리하는 계정으로 답글 초안을 작성하고, 게시되기 전에 당신이 승인합니다. 패널을 대신 써주지 않고, 언제 고정할지 대신 정해주지 않으며, 가져올 수 없는 페이지를 검색 가능하게 만들지 못하고, 90일을 줄이지도 못합니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 실행됩니다. 유료 플랜은 월 결제 시 월 $99부터, 연 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. “A Critical Survey of Generative Engine Optimization (2023–2026)”, 2026년 7월 15일, arXiv:2607.14035. 반복 판정 변화 9–28%(Kirsten 등), 일별 출처 수준 Jaccard 0.34–0.42(Schulte 등, 네 개 엔진, 45일, 작은 스위스 쿼리 집합), 재현성 필드와 표 5(프리프린트): arxiv.org/abs/2607.14035
  2. Kirsten 등, “Characterizing Web Search in The Age of Generative AI”, Findings of ACL 2026. 쿼리 4,706건, 미국과 독일, 2025년 9월: aclanthology.org/2026.findings-acl.526
  3. Grossman 등, SIGIR 2026. 대표 쿼리 11,500건. URL 수준 Jaccard 0.11–0.18: arxiv.org/abs/2604.27790
  4. Puerto, Gubri, Green, Oh, Yun, “C-SEO Bench: Does Conversational SEO Work?”, NeurIPS 2025 Datasets & Benchmarks Track, arXiv:2506.11097: arxiv.org/abs/2506.11097
  5. “SAGEO Arena”, KDD 2026, arXiv:2602.12187v2. 표 2, 본문만 최적화한 평균과 베이스라인 비교: arxiv.org/abs/2602.12187
  6. Google Search Central, “Google’s Guide to Optimizing for Generative AI Features on Google Search”, 최종 업데이트 2026년 7월 10일(“뿌리를 두고 있다” 문장, 1차 자료): developers.google.com/search/docs/fundamentals/ai-optimization-guide
  7. Google Search Central, “AI features and your website”, 최종 업데이트 2025년 12월 10일(색인 및 스니펫 노출 자격, 1차 자료): developers.google.com/search/docs/appearance/ai-features
  8. Pew Research Center, “Google users are less likely to click on links when an AI summary appears in the results”, 2025년 7월 22일. 미국 성인 900명, 검색 68,879건, 2025년 3월: pewresearch.org
FAQ

자주 묻는 질문입니다.

GEO 프로그램이 90일 안에 측정된 개선을 증명할 수 있나요?

드뭅니다. 그리고 그것을 약속하는 계획은 계측기를 과대평가해 파는 것입니다. temperature를 0으로 두고 실행을 반복해도 판정의 9~28%가 바뀌고, 네 개 엔진에 걸친 일별 출처 수준 Jaccard는 0.34에서 0.42입니다. 그래서 한 분기는 그 표류를 특성화하고 패널을 한 번 읽는 데 걸리는 시간 정도입니다. 대신 신뢰할 만한 베이스라인, 깨끗한 기술 계층, 정직한 재측정을 약속하십시오.

왜 첫 달에는 콘텐츠 작업이 없나요?

베이스라인을 잡기 전에 바뀐 페이지는 이후의 모든 비교를 파괴하기 때문입니다. 그러면 “이전”은 기억으로만 남습니다. 두 번째 이유도 있습니다. 공개된 콘텐츠 쪽 효과는 작고 자주 음수이며, C-SEO Bench는 54개 사례 중 3개에서만 유의한 순위 개선을 찾았습니다. 그렇게 작은 효과는 계측기가 이미 돌고 있지 않으면 읽어낼 수 없습니다.

왜 프롬프트 패널을 12주차까지 고정해야 하나요?

분기 도중에 커진 패널은 분모가 분자와 함께 움직였고, 그러면 12주차 계열은 4주차 계열과 비교할 수 없기 때문입니다. 4주차가 끝날 때 프롬프트 목록, 엔진별 실행 횟수, 기록된 실행 조건을 고정하고 버전을 매기십시오. 그리고 새 질문은 이번 분기가 아니라 다음 분기 패널에 넣으십시오.

90일째에 아무것도 움직이지 않았다면 무엇을 보고하나요?

그 무효과를 패널 버전, 관측 수, 구간과 함께 보고하고, 이 패널이 어느 정도 크기의 움직임을 감지할 수 있었는지 밝히십시오. 10포인트를 분해하는 계측기에서 나온 평평한 선은 3포인트 변화가 실패했다는 증거가 아닙니다. 패널이 그것을 볼 수 없었다는 증거입니다. 그 구분이 보고서와 이야기의 차이입니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

첫 달에 사는 것은 계측기입니다.
고치기 시작하기 전에 그것부터 돌리십시오.

무료 체험 시작