/GEO 배우기/페이월과 차단
테크니컬 GEO · 접근 제어

페이월과 크롤러 차단이 여러분을 AI 답변에서 막아 줄까요?

직관으로 내는 답은 양쪽 방향 모두 틀립니다. 크롤러를 차단해도 답변에서 확실히 빠지지는 않고, 활짝 열어 두어도 답변에 확실히 들어가지는 않습니다.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

robots.txt의 disallow는 요청입니다. 문서화된 크롤러는 그 요청을 지키고, 사용자가 촉발한 가져오기는 흔히 지키지 않습니다. 그래서 이것이 정하는 것은 누가 여러분을 가져갈 수 있는지이지, 여러분에 관해 쓰일 수 있는지가 아닙니다. 따라서 접근 제어는 무엇을 내주고 무엇을 얻는지에 관한 사업상의 결정이지, 어느 방향으로든 결과를 보장하는 스위치가 아닙니다. Tow Center가 여덟 개 생성형 검색 도구를 상대로 1,600건의 쿼리로 진행한 테스트에서, 한 유료 어시스턴트는 원래 접근할 수 없어야 했던 기사에서 뽑은 발췌 90건 가운데 3분의 1에 가까운 수를 정확히 식별했습니다.1

핵심 요약
  • 두 업체는 사용자가 촉발한 페처가 robots.txt를 무시할 수 있다고 문서에 밝힙니다. 세 번째 업체는 자사 봇이 모두 지킨다고 밝힙니다. 지시문 하나에 의미가 셋입니다.
  • 차단해도 요약되는 것은 멈추지 않습니다. 전재된 사본, 제3자 보도, 그리고 평범한 Chrome 세션을 조종하는 에이전트가 그 옆으로 돌아갑니다.
  • 그렇다고 차단이 아무것도 아닌 것도 아닙니다. 옵트아웃하면 자사 검색 답변에서 빠진다고 업체들이 문서에 밝히고 있고, 차단된 뒤의 답변은 사라진 것이 아니라 모호해진 것으로 관측되었습니다.
  • 어떤 차단은 여러분이 남겨 두고 싶었던 것과 묶여 있습니다. 검색 색인, 여러분의 스니펫, 또는 여러분의 의사를 담은 파일을 업체가 읽는 능력입니다.
  • 차단이 인용에서 얼마를 치르게 하는지에 대해 이 커리큘럼의 출처 기준을 통과하는 공개 측정은 없습니다. 그래서 이 거래의 크기는 알려져 있지 않습니다.
정의

robots.txt disallow는 실제로 무엇을 하나

그것은 페처에게 어떤 경로를 요청하지 말아 달라고 부탁합니다. 문서화되어 있고 예의 바른 크롤러는 그 요청을 지키며, 이 파일은 한 번도 접근 제어였던 적이 없습니다. 파일은 공개되어 있고, 집행은 전적으로 상대편에서 일어납니다. 가장 널리 배포된 관리형 버전의 그 파일을 제공하는 인프라 사업자도 자사의 더 새로운 신호 체계에 대해 똑같이 말합니다. 콘텐츠 신호는 “선호를 표현할 뿐, 스크래핑에 대한 기술적 대응책이 아닙니다. 어떤 회사는 그냥 무시할 수도 있습니다.”4

대부분의 결과를 가르는 경계는 학습과 검색의 구분이 아닙니다. 그쪽은 리트리벌 단계가 다룹니다. 경계는 예정된 크롤링과, 누군가 무언가를 요청했기 때문에 일어난 가져오기 사이에 있고, 바로 그 경계에서 업체들은 자사 문서 안에서 서로 어긋납니다. 아래의 모든 인용문은 2026년 8월 30일에 업체의 실제 페이지와 대조해 확인했습니다.

사람이 촉발한 가져오기토큰robots.txt에 대해 업체가 문서에 밝힌 내용
OpenAIChatGPT-User“이 동작은 사용자가 시작한 것이므로 robots.txt 규칙이 적용되지 않을 수 있습니다”5
PerplexityPerplexity-User“사용자가 가져오기를 요청했으므로 이 페처는 일반적으로 robots.txt 규칙을 무시합니다”7
AnthropicClaude-User자사 봇은 “robots.txt의 업계 표준 지시문을 준수함으로써 ‘크롤링하지 말라’는 신호를 존중합니다”6
Google별도 토큰 없음Googlebot 대상 지시문이 AI 기능을 포함한 검색에 대해 명시된 제어 수단8
에이전트형 브라우저없음크롤러가 아닙니다. 이 에이전트는 “표준 Chrome 브라우저를 쓰는 사람과 구별되지 않습니다”2

마지막 줄은 두 번 읽으십시오. 에이전트형 브라우저는 예의 바른 user agent를 단 크롤러가 아니라 사람이 조종하는 브라우저입니다. 그것을 겨냥한 지시문은 없고, 그 트래픽 패턴을 차단한다는 것은 Chrome을 차단한다는 뜻입니다.

근거

차단한 발행사가 왜 여전히 인용되나

그 답변에 여러분의 페이지가 필요하지 않기 때문입니다. 2025년 3월 Tow Center는 여덟 개 생성형 검색 도구에 걸쳐 1,600건의 쿼리를 돌렸고, 발췌문을 붙여 넣은 뒤 기사 제목, 발행사, 날짜, URL을 대라고 요구했습니다. “플랫폼들은 의도적으로 크롤러를 차단한 발행사에서 정보를 가져왔다”는 소제목 아래, 한 어시스턴트의 무료 등급은 페이월 뒤에 있는 National Geographic 기사에서 뽑은 발췌 열 건을 모두 정확히 식별했습니다. 이 발행사는 해당 크롤러를 disallow해 두었고 그 회사와 아무런 관계도 없었습니다.1

차단을 우회하는 경로는 세 가지이고, 다툼이 있는 것은 세 번째뿐입니다. 첫째는 전재입니다. USA Today는 어떤 어시스턴트의 크롤러를 차단하는데, 그 어시스턴트는 Yahoo News가 다시 실은 같은 기사의 판본을 인용했습니다. 둘째는 제3자 보도로, 어떤 에이전트가 발행사를 직접 건드리지 않으려 할 때 쓴 대안이었습니다. “그 기사에 관한 트윗, 전재본, 다른 매체의 인용, 웹 전반의 관련 보도를 끌어모은 합성 요약”이었습니다.2 셋째는 불준수입니다. 2025년 8월 4일 Cloudflare는 robots.txt로 모든 것을 disallow한, 새로 등록해 색인된 적 없는 도메인을 등록했다고 보고하면서, 그럼에도 한 어시스턴트가 그 업체가 공개한 주소 범위 밖의 일반 Chrome user agent에서 그 도메인들에 관한 상세한 내용을 반환했다고 밝혔습니다. Cloudflare는 그 업체를 검증된 봇 목록에서 제외했고, 업체는 다음 날 은밀한 크롤링을 부인했으며, 이 분쟁은 아직 해결되지 않았습니다.3

그 요약이 기억해 둘 만한 한 문장입니다. “검색 결과에서 노출을 원하던 발행사는 그것을 얻지 못했고, 옵트아웃을 원하던 쪽의 콘텐츠는 그들의 뜻에 반해 계속 보였다.”1 파일 하나는 두 실패 중 어느 쪽도 깔끔하게 통제하지 못합니다.

페이월

페이월은 막는가, 들여보내는가

여러분이 만든 것이 어느 쪽인지에 달렸고, 많은 발행사가 만든 것은 기계를 막지 못하는 쪽이었습니다. 클라이언트 측 오버레이는 기사 전문을 브라우저로 보낸 다음 구독 안내로 가립니다. Tow Center는 MIT Technology Review, National Geographic, Philadelphia Inquirer가 이 방식을 쓴다고 지목하면서 “이 콘텐츠는 사람에게는 보이지 않지만 Atlas와 Comet 같은 AI 에이전트는 여전히 읽을 수 있다”고 관찰했습니다. Tow Center가 Wall Street Journal과 Bloomberg의 방식으로 본 서버 측 페이월은, 자격 증명이 확인되기 전에는 어떤 본문도 보내지 않습니다.2 둘 다 구독 중인 독자가 그 페이지에 에이전트를 겨누는 것은 막지 못합니다.

2025년 10월의 그 시연은 두 방향의 실패가 맞부딪히는 장면을 담은, 공개된 사례 가운데 가장 깔끔한 것입니다. MIT Technology Review의 9,000단어짜리 구독자 전용 기사 전문을 요구하자 에이전트형 브라우저 두 개가 그것을 내놓았습니다. 같은 두 회사의 표준 채팅 인터페이스에서 같은 프롬프트를 넣자 거절당했습니다. 해당 매체가 두 회사의 크롤러를 차단해 두었기 때문입니다. 차단은 크롤러에는 통했고 브라우저와는 무관했습니다.

색인 쪽에는 아무도 속이지 않는 문서화된 답이 있습니다. 구독 및 페이월 콘텐츠에 대한 Google의 구조화 데이터 지침이 존재하는 이유는, Google 자신의 말로 하면 그 마크업이 “스팸 정책을 위반하는 클로킹 관행과 페이월 콘텐츠를 Google이 구분하도록 돕기” 때문입니다. 그리고 지침은 첫머리에서 적용 범위를 좁힙니다. “이 가이드는 크롤링되고 색인되기를 원하는 콘텐츠에만 적용됩니다.”9 유료 구역을 isAccessibleForFree와 hasPart로 표시하는 것이, 계속 요금을 받으면서도 페이지가 자격을 유지하는 방법입니다. 그 마크업 없이 독자에게 숨긴 본문을 크롤러에 내주는 것이 이 정책이 말하는 클로킹이며, 이 커리큘럼은 그것을 여러분 손에 쥐여 주지 않습니다.

거래

차단은 실제로 무엇을 사는가

실재하는 무언가를 삽니다. 그리고 논쟁의 어느 쪽 주장보다도 적습니다. 준수하는 경로에서는 차단이 말한 그대로 작동합니다. OpenAI는 “OAI-SearchBot에서 옵트아웃한 사이트는 ChatGPT 검색 답변에 표시되지 않지만, 내비게이션 링크로는 나타날 수 있다”고 문서에 밝힙니다.5 Anthropic은 Claude-SearchBot을 비활성화하면 “저희 시스템이 검색 최적화를 위해 여러분의 콘텐츠를 색인하는 것을 막으며, 그 결과 사용자 검색 결과에서 사이트의 가시성과 정확성이 낮아질 수 있습니다”라고 밝힙니다.6 두 번째 문장을 자세히 읽으십시오. 여러분이 떠나고 나면 여러분에 대한 자사의 정확성이 떨어질 수 있다고 업체가 말하는 것입니다.

준수하지 않는 경로에서는, 실제로 통한 차단이 무엇을 바꾸는지에 대한 공개 관측이 한 건 있습니다. Cloudflare는 은밀한 크롤러를 차단한 뒤 그 어시스턴트가 다른 웹사이트를 포함한 다른 데이터 출처로 물러섰고 “그 답변들은 덜 구체적이었고 원본 콘텐츠의 세부를 담지 못했다”고 보고했습니다.3 이것이 이 거래의 정직한 모양입니다. 차단은 여러분에 관해 말해지는 것을 멈추기보다, 말해지는 내용의 질을 떨어뜨리는 쪽에 가깝습니다.

접근을 계약과 맞바꾼다고 해서 정확성을 사는 것도 아닙니다. Tow Center는 조사 결과 가운데 “뉴스 출처와의 콘텐츠 라이선스 계약은 챗봇 응답에서 정확한 인용을 전혀 보장하지 못했다”를 꼽았습니다. 그 예는 OpenAI의 검색 크롤러를 허용하고 그 회사와의 파트너십 안에 있는 발행사였는데, 그 발췌를 어시스턴트가 정확히 식별한 것은 열 번에 한 번이었습니다.1 접근은 정확한 귀속의 전제 조건이지, 그 원인이 아닙니다.

부작용

의도보다 비싼 차단은 어느 것인가

세 가지 결합이 좁은 의도를 넓은 손실로 바꿉니다. Google에는 AI만을 겨냥한 지시문이 없습니다. “AI는 검색에 내장되어 있고 검색이 작동하는 방식과 뗄 수 없으며, 그래서 Googlebot에 대한 robots.txt 지시문이 사이트 소유자가 자기 사이트가 검색을 위해 어떻게 크롤링되는지를 관리하는 제어 수단입니다.” 여기서 이름을 든 더 세밀한 제어인 nosnippet, data-nosnippet, max-snippet, noindex는 모두 여러분의 일반 검색 결과까지 잘라 냅니다. 그리고 Google-Extended가 관장하는 것은 Google의 다른 시스템에서의 학습과 그라운딩이지, 검색이 아닙니다.8 Tow Center 표본에서 공개 크롤러를 가진 도구 가운데 스무 개 발행사 중 어디에서도 차단되지 않은 것이 하나 있었고, 연구진은 그 이유를 그 도구가 일반 검색 엔진과 크롤러를 공유한다는 데서 찾았습니다. 그것을 차단한다는 것은 그 색인에서 빠진다는 뜻이었기 때문입니다.1

세 번째는 여러분이 원한 효과를 뒤집습니다. Anthropic은 “Anthropic 봇이 작동하는 IP 주소를 차단하는 것과 같은 대체 방법은 올바르게 작동하지 않을 수 있고 옵트아웃을 지속적으로 보장하지도 못합니다. 그렇게 하면 저희가 여러분의 robots.txt 파일을 읽는 능력이 방해받기 때문입니다”라고 문서에 밝힙니다.6 크롤러를 겨눈 방화벽 규칙은 가져가기는 당하면서 의사는 전달되지 않는 상태를 남길 수 있습니다. 여러분의 의사를 담은 그 파일이 바로 여러분이 차단한 것이기 때문입니다.

시차는 대부분의 전후 비교 판독을 조용히 망칩니다. OpenAI는 “사이트의 robots.txt 업데이트로부터 저희 시스템이 조정되기까지 약 24시간이 걸릴 수 있습니다”라고 말합니다. Perplexity는 변경 반영에 최대 24시간이 걸릴 수 있다고 합니다. Google은 미리보기 제어가 “며칠에서 몇 달까지 걸릴 수 있다”고 말합니다.578 차단은 스위치가 아니고, 차단 해제도 스위치가 아닙니다.

결정

어떻게 결정하고 무엇을 적어 두나

파일을 건드리기 전에, 여러분이 사려는 결과의 이름을 부르십시오. 팀이 흔히 떠올리는 네 가지 결과 가운데 둘은 얻을 수 있고, 하나는 절반만 얻으며, 하나는 메뉴에 없습니다.

크롤 부하를 줄이는 것은 얻을 수 있고 여러분의 로그로 잴 수 있습니다. 협상 지위도 얻을 수 있으며, 이는 기술 판단이 아니라 상업 판단입니다. 귀속 없는 요약을 줄이는 것은 절반만 얻습니다. 위의 근거가 말하는 것은 요약이 멈추는 것이 아니라 질이 떨어진다는 것이기 때문입니다. 답변이 여러분에 관해 무엇을 말할지 통제하는 것은 메뉴에 없고, 위의 모든 내용이 그 이유입니다. 어떤 페이지를 정말로 읽히면 안 된다면, 지시문이 아니라 인증을 주십시오.

허용이냐 거부냐보다 더 세밀한 것을 원한다면 이제 어휘가 있습니다. Content Signals Policy는 robots.txt에 search, ai-input, ai-train을 추가하고 search를 “검색 색인을 구축하고 검색 결과를 제공하는 것”으로 정의하면서 “search는 AI가 생성한 검색 요약을 제공하는 것을 포함하지 않는다”고 밝힙니다.4 작성자 자신의 말에 따르면 이것은 선호를 표현할 뿐 강제하지는 않습니다. 그다음 네 가지를 적어 두십시오. 여러분이 고른 결과, 건드린 모든 토큰, 날짜, 그리고 각 업체가 문서에 밝힌 지연입니다. 뒤의 두 가지가 없으면 크롤 지연을 효과로 읽게 됩니다.

이 글이 알려 줄 수 없는 것

차단이 인용에서 실제로 얼마를 치르게 하는지에 대한 깔끔한 측정을 아무도 공개하지 않았습니다. 2026년에 차단한 발행사도 인용의 대부분을 지킨다고 주장하는 업체 분석이 나왔지만, 그 대표 백분율들은 서로 어긋나고, 짝지은 설계를 밝힌 것이 하나도 없으며, 이 커리큘럼의 출처 기준을 통과하는 것도 없습니다. 그래서 거기서 나온 숫자는 여기에 하나도 싣지 않았습니다. 기준을 통과하는 연구는 이 질문을 위해 설계된 것이 아닙니다. Tow Center가 스무 개 발행사를 고른 기준은 AI 접근에 대한 태도가 서로 달랐다는 점이었고, 측정한 것은 인용량이 아니라 인용 정확도였으며, 짝지은 대조군도 전후 비교도 없습니다. 차단된 뒤의 답변이 “덜 구체적”이 되었다는 Cloudflare의 기록은 보안 조사 안의 정성적 관찰이고, 그 중심에 있는 주장은 다툼 중입니다. 두 가지가 더 알려져 있지 않습니다. 여기서 말한 에이전트형 브라우저의 동작이 매주 출시되는 제품 속에서도 유지되는지, 그리고 여러분이 차단하기 전에 이미 삼킨 콘텐츠를 엔진이 어떻게 다루는지입니다. 이 거래의 방향은 근거가 충분하다고 보고, 그 크기는 측정되지 않았다고 다루십시오(2026년 8월 30일 확인).

제품이 도움이 되는 지점, 되지 않는 지점

이 결정에는 소프트웨어가 하나도 필요 없습니다. 각 업체가 문서에 밝힌 토큰과 대조해 여러분의 robots.txt를 읽는 데는 20분, 서버가 실제로 무엇을 반환하는지 확인하는 데는 토큰당 한 번의 가져오기가 들고, 크롤러 로그 읽기가 실제로 누가 왔는지 알려 줍니다. 무엇을 내줄 의향이 있는지는 매출을 쥔 사람과 나눌 대화입니다. Bavior는 여러분의 robots.txt를 편집하지 않고, 페이월을 관리하지 않으며, 차단된 페이지를 가져올 수 있게 만들지도 못하고, 차단이 무엇을 앗아갔는지도 알려 줄 수 없습니다. 그 반사실은 누구의 데이터에도 없기 때문입니다. 도구가 할 수 있는 것은 측정 쪽입니다. Bavior는 정해진 프롬프트 묶음을 다섯 개 엔진에 정기적으로 돌리고 각 답변이 어떤 출처를 인용했는지 기록합니다. 파일을 바꾼 뒤 같은 프롬프트가 여러분 대신 리셀러 목록을 인용하기 시작한 것을 알아채는 방법이 그것입니다. 인용된 출처가 진행 중인 토론 스레드일 때는 여러분이 관리하는 계정으로 답글 초안을 씁니다. 게시되기 전에 여러분이 승인합니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Jaźwińska, Chandrasekar, Tow Center, “AI Search Has a Citation Problem”, 2025년 3월 6일(도구 8개, 발행사 20곳, 쿼리 1,600건): cjr.org/tow_center
  2. Chandrasekar, Jaźwińska, Tow Center, “How AI Browsers Sneak Past Blockers and Paywalls”, 2025년 10월 30일(에이전트형 브라우저와 페이월 유형): cjr.org/analysis
  3. Corral, Singhal, Mitchell, Tatoris, Cloudflare, “Perplexity is using stealth, undeclared crawlers to evade website no-crawl directives”, 2025년 8월 4일(해당 업체의 2025년 8월 5일 부인은 링크하지 않음): blog.cloudflare.com
  4. Allen, Cloudflare, “Giving users choice with Cloudflare’s new Content Signals Policy”, 2025년 9월 24일: blog.cloudflare.com/content-signals-policy
  5. OpenAI, “Overview of OpenAI Crawlers”(OAI-SearchBot, ChatGPT-User, 약 24시간의 반영 시간, 1차 출처): developers.openai.com/api/docs/bots
  6. Anthropic, “Does Anthropic crawl data from the web, and how can site owners block the crawler?”, 2026년 4월 7일 업데이트(Claude-User, Claude-SearchBot, IP 차단, 1차 출처): support.claude.com/en/articles/8896518
  7. Perplexity, “Perplexity Crawlers”(Perplexity-User, 24시간의 반영 시간, 1차 출처): docs.perplexity.ai/guides/bots
  8. Google Search Central, “AI features and your website”, 2025년 12월 10일 최종 업데이트(Googlebot 제어 서술, 스니펫 제어, 재크롤 지연): developers.google.com/search/docs/appearance/ai-features
  9. Google Search Central, “Structured data for subscription and paywalled content (CreativeWork)”, 2025년 12월 10일 최종 업데이트(isAccessibleForFree, hasPart, 클로킹과의 구분): developers.google.com/search/docs/appearance/structured-data/paywalled-content
FAQ

자주 묻는 질문입니다.

AI 크롤러를 전부 차단하면 AI 답변에서 사라지나요?

아닙니다. 준수하는 경로에서는 실제로 빠집니다. OpenAI는 OAI-SearchBot에서 옵트아웃한 사이트가 ChatGPT 검색 답변에 표시되지 않는다고 문서에 밝힙니다. 남는 것은 여러분의 페이지가 필요 없는 모든 것이고, Tow Center는 그것을 실제로 봤습니다. USA Today에 차단당한 도구가 대신 Yahoo News가 다시 실은 같은 기사를 인용했습니다. 잃는 것은 귀속이 붙은 노출이고, 남는 것은 귀속 없는 요약입니다.

페이월이 AI 시스템의 기사 읽기를 막아 주나요?

서버 측일 때만 그렇고, 그마저도 로그인한 독자의 에이전트 앞에서는 막지 못합니다. 클라이언트 측 오버레이는 본문을 브라우저로 보낸 뒤 시각적으로만 가리므로, Tow Center는 같은 두 회사의 채팅 인터페이스가 거절한 9,000단어짜리 구독자 전용 기사를 에이전트형 브라우저가 읽을 수 있음을 확인했습니다. 어떤 페이지를 정말로 읽히면 안 된다면, 필요한 것은 지시문이나 오버레이가 아니라 인증입니다.

콘텐츠 라이선스 계약을 맺으면 브랜드가 정확히 인용되나요?

공개된 단 하나의 테스트가 내놓은 답은 아니라는 것입니다. Tow Center는 조사 결과 가운데 “뉴스 출처와의 콘텐츠 라이선스 계약은 챗봇 응답에서 정확한 인용을 전혀 보장하지 못했다”를 꼽았고, 그 예는 검색 크롤러를 허용하고 그 회사와의 파트너십 안에 있는 발행사였는데, 그 발췌는 열 번의 시도에서 한 번만 정확히 식별되었습니다. 접근은 정확한 귀속을 가능하게 하지만, 정확한 귀속을 만들어 내지는 않습니다.

robots.txt 대신 방화벽에서 AI 크롤러를 차단해야 하나요?

그러기 전에 한 업체의 문서를 읽으십시오. Anthropic은 자사 봇이 작동하는 IP 주소를 차단하는 것이 “올바르게 작동하지 않을 수 있고 옵트아웃을 지속적으로 보장하지도 못합니다. 그렇게 하면 저희가 여러분의 robots.txt 파일을 읽는 능력이 방해받기 때문입니다”라고 밝힙니다. 따라서 네트워크 차단은 가져가기는 당하면서 의사는 전달되지 않는 상태를 남길 수 있습니다. 여러분의 의사를 담은 그 파일이 바로 그 규칙이 업체가 읽지 못하게 만든 것이기 때문입니다.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

차단은 스위치가 아니라 거래입니다.
무엇을 내주는지 아십시오.

무료 체험 시작