세 번째 열을 결정으로 읽으십시오. 종류가 다른 것은 그 열뿐이기 때문입니다. 검색 쪽 행은 모두 벤더가 분명히 밝히는 손실을 적고 있고, 학습 쪽 행은 모두 벤더가 존재하지 않는다고 말하는 손실을 적고 있습니다. 검색으로 그라운딩된 답변은 색인에서 조립되고, 그 색인은 검색 쪽 크롤러가 만듭니다. 그러니 색인에 없는 사이트는 다른 무엇을 허용했든 답변에도 없습니다. 유일한 예외가 Google-Extended이고, 너무 최근이라 대부분의 조언은 여전히 이를 “차단해도 공짜”로 분류합니다.
어떤 크롤러 토큰이 중요하고, 차단하면 안 되는 것은 무엇입니까?
토큰은 저마다 별개의 줄이고 대가도 따로입니다. 게다가 두 가지 실수는 정반대 방향을 가리킵니다. 엉뚱한 쪽을 차단하면 답변에서 사라지고, 의도한 쪽을 차단하면 눈에 보이는 변화는 하나도 없습니다.
이 페이지의 내용
엔진이 여러분을 인용할 수 있는지를 결정하는 토큰은 그 엔진의 검색 쪽 크롤러이고, 모두 다섯 개입니다. OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot, Googlebot입니다. 학습 쪽 토큰은 저마다 별개의 규칙이고 효과도 별개여서, GPTBot이나 ClaudeBot, Applebot-Extended를 금지해도 검색으로 그라운딩된 답변에서 사라지는 것은 없습니다. Google 한 곳만 해도 두 페이지에 걸쳐 일반 크롤러 토큰 열한 개와 사용자 트리거형 페처 아홉 개를 문서화했고, 그중 하나를 검색 안 AI 기능의 통제 수단으로 지목합니다. Googlebot에 보내는 지시문입니다.567
핵심 요약- 그러지 않을 이유가 없다면 검색 쪽 토큰 다섯 개는 허용하십시오. 파일의 나머지 줄은 저마다 값이 다른 별개의 결정으로 다루십시오.
- 더 이상 공짜가 아닌 학습 토큰이 하나 있습니다. Google-Extended는 이제 학습뿐 아니라 그라운딩도 통제하므로, 금지하면 Gemini Apps에서 빠지고 AI Overviews와 AI Mode는 그대로 남습니다.
- 비싼 차단은 거의 선택된 적이 없습니다. 와일드카드 금지 규칙, Applebot도 따른다고 Apple이 문서화한 Googlebot 규칙, 그리고 robots.txt를 아예 읽지 않는 방화벽 규칙입니다.
- 사용자 트리거형 페처 넷 중 셋은 설계상 robots.txt를 무시합니다. 끌 수 있는 것은 Anthropic의 Claude-User 하나이고, 끄면 누군가 묻는 바로 그 순간의 리트리벌을 잃습니다.
인용될 수 있는지를 결정하는 토큰은 무엇입니까?
아래 표에서 결정에 해당하는 것은 한 열뿐입니다. 나머지는 다른 이유로 설정하고 싶을 수 있는 규칙이며, 어느 것도 답변이 여러분을 인용할 수 있는지를 바꾸지 않습니다.
| 토큰 | 벤더 문서가 밝힌 통제 범위 | 금지했을 때 잃는 것 |
|---|---|---|
| OAI-SearchBot | ChatGPT 안의 검색 | 옵트아웃한 사이트는 “ChatGPT 검색 답변에 표시되지 않습니다”. 다만 내비게이션 링크로는 나타날 수 있습니다1 |
| GPTBot | 크롤링한 콘텐츠를 기반 모델 학습에 쓰는 것 | 검색에서는 잃는 것이 없습니다. 문서 자체가 OAI-SearchBot은 허용하고 이쪽은 금지하는 방법을 설명합니다1 |
| Claude-SearchBot | Claude의 검색을 위해 콘텐츠를 색인하는 것 | “사용자 검색 결과에서 사이트의 가시성과 정확성을 떨어뜨릴 수 있습니다”2 |
| ClaudeBot | 모델 학습용 웹 콘텐츠 수집 | 검색에서는 잃는 것이 없습니다. 앞으로의 자료가 학습 데이터셋에서 제외됩니다2 |
| PerplexityBot | Perplexity 결과에 사이트를 노출하고 링크하는 것 | 그 결과에서 빠집니다. Perplexity는 학습용 크롤러를 문서화하지 않습니다3 |
| Applebot | Spotlight, Siri, Safari를 아우르는 검색 | 셋을 한꺼번에 잃습니다4 |
| Applebot-Extended | Applebot이 이미 크롤링한 데이터의 사용 방식 | 잃는 것이 없습니다. 이것은 “웹페이지를 크롤링하지 않으며”, 이를 금지한 페이지도 “검색 결과에 포함될 수 있습니다”4 |
| Googlebot | Google 검색과 그 안의 모든 AI 기능 | 전부입니다. AI Overviews와 AI Mode를 포함합니다7 |
| Google-Extended | Gemini 학습과 Gemini 그라운딩 | Gemini Apps와 Vertex AI에서의 그라운딩입니다. Google 검색 등록이나 순위가 아닙니다5 |
각 토큰을 차단하면 실제로 무엇을 잃습니까?
Google-Extended는 두 번 읽을 값어치가 있는 행입니다. Google 문서는 이를, 크롤링한 콘텐츠를 “미래 세대 Gemini 모델의 학습에” 쓸 수 있는지, 그리고 “Gemini Apps와 Vertex AI의 Grounding with Google Search에서 그라운딩(사실성과 관련성을 높이기 위해 프롬프트 시점에 Google 검색 색인의 콘텐츠를 모델에 제공하는 것)에” 쓸 수 있는지를 관리하는 토큰으로 설명합니다. 같은 항목은 Google-Extended가 “사이트의 Google 검색 등록에 영향을 주지 않으며 Google 검색의 순위 신호로도 쓰이지 않는다”고도 밝힙니다.5 두 절반은 동시에 성립하고, 합치면 대부분의 글이 놓치는 선이 그어집니다. Google-Extended를 금지하는 것은 Gemini 어시스턴트에서 내려오겠다는 결정이지, AI Overviews에 대한 결정이 아닙니다.
AI Overviews와 AI Mode는 그 선의 반대편에 있습니다. 그것들이 곧 검색이기 때문입니다. Google은 통제 수단을 직접 지목합니다. “AI는 검색에 내장되어 있고 검색이 작동하는 방식에 필수적이며, 그래서 사이트 소유자가 접근을 관리하는 수단은 Googlebot을 대상으로 한 robots.txt 지시문입니다.” 페이지의 어디까지 보여도 되는지를 정하는 레버는 nosnippet, data-nosnippet, max-snippet, noindex입니다.7 Google-Extended는 바로 다음 문장에서 “Google의 다른 일부 시스템에서의 AI 학습과 그라운딩”용으로 제시됩니다.
나머지 행도 똑같이 문자 그대로 읽을 값어치가 있습니다. OpenAI의 표현은 흔한 요약보다 좁습니다. OAI-SearchBot을 옵트아웃한 사이트는 “ChatGPT 검색 답변에는 표시되지 않지만, 내비게이션 링크로는 나타날 수 있습니다”.1 Apple의 Applebot-Extended는 애초에 크롤러가 아닙니다. 문서가 “웹페이지를 크롤링하지 않는다”고 밝히고, 오직 “Applebot이라는 user agent가 크롤링한 데이터를 어떻게 쓸지 정하기” 위해서만 존재하기 때문입니다.4
차단하면 안 되는 토큰은 무엇이고, 어쩌다 사고로 막힙니까?
대부분은 세 가지 모양으로 설명되고, 그중 어느 것도 누군가 AI 크롤러를 차단하기로 결정한 경우가 아닙니다.
첫 번째 모양은 와일드카드입니다. 넓은 Disallow를 담은 User-agent: * 그룹은 검색 쪽 토큰을 한꺼번에 없앱니다. 그리고 이것은 선택된 것이 아니라 물려받은 것인 경우가 거의 전부입니다. 어떤 팀은 스테이징용 robots.txt를 프로덕션에 올렸다가 사이트 전체의 검색 쪽 페치를 잃었고, 그 사실을 2주 뒤 접근 로그에서 알았습니다. 페치되지 않은 페이지는 빠질 노출 자체를 만들지 않기 때문입니다.
두 번째 모양은 문서에 적힌 상속입니다. Apple은 “robots 지시문이 Applebot을 언급하지 않고 Googlebot을 언급하면, Apple 로봇은 Googlebot 지시를 따른다”고 밝힙니다.4 몇 년 전에 패싯 검색 디렉터리에서 Googlebot을 막으려고 쓴 규칙은 그래서 Applebot 규칙이기도 하고, Applebot은 Spotlight와 Siri, Safari 뒤에 있는 토큰입니다. 같은 페이지는 Applebot이 crawl-delay를 무시한다고도 적고 있어서, 그런 식으로 쓴 속도 제한 역시 아무 효과가 없습니다.
세 번째 모양은 아예 robots.txt가 아닙니다. 웹 애플리케이션 방화벽, 봇 관리, 또는 지나치게 공격적인 속도 제한은 어떤 지시문이 읽히기도 전에 먼저 응답합니다. 403은 크롤러가 거절할 수 있는 요청이 아닙니다. Perplexity 자신의 문서에는 자사 봇을 허용하기 위한 Cloudflare와 AWS 방화벽 설정이 단계별로 실려 있는데,3 실제로 발목을 잡는 제약이 파일 안이 아니라 파일 위에 있는 경우가 얼마나 잦은지를 잘 보여 줍니다. 범위는 조용한 네 번째입니다. robots.txt는 호스트 단위라서, 마케팅 사이트의 규칙은 문서 서브도메인에 대해 아무 말도 하지 않습니다. Anthropic은 발행자에게 “옵트아웃하려는 모든 서브도메인에서” 같은 변경을 반복하라고 요구합니다.2
사용자 트리거형 페처는 robots.txt를 지키기는 합니까?
대체로 지키지 않고, 각 벤더가 그렇게 밝힙니다. OpenAI는 ChatGPT-User가 사람이 물었을 때 페이지를 방문한다는 것, “이 동작은 사용자가 시작한 것이므로 robots.txt 규칙이 적용되지 않을 수 있다”는 것, 그리고 그것이 “콘텐츠가 검색에 나타나도 되는지를 판단하는 데 쓰이지 않는다”는 것을 문서화합니다.1 Perplexity도 Perplexity-User를 같은 방식으로 문서화합니다. “사용자가 페치를 요청했으므로 이 페처는 일반적으로 robots.txt 규칙을 무시합니다.”3 Google은 이 규칙을 부류 전체에 적용해 “페치가 사용자의 요청으로 이루어졌으므로 이 페처들은 일반적으로 robots.txt 규칙을 무시합니다”라고 씁니다. 이 부류에는 이제 Google-Agent가 포함되는데, Google 인프라 위의 에이전트가 사용자의 요청에 따라 탐색하고 행동하는 데 씁니다.6
Anthropic이 예외이고, 쓸모 있는 쪽의 예외입니다. Claude-User는 ClaudeBot, Claude-SearchBot과 같은 표에 발행자가 접근 권한을 정하는 로봇으로 들어 있습니다. 이를 비활성화하면 “사용자 쿼리에 응답해 저희 시스템이 콘텐츠를 리트리벌하는 것을 막고, 사용자가 주도하는 웹 검색에서 사이트의 가시성을 떨어뜨릴 수 있습니다”.2
결정은 취향이 아니라 그 비대칭에서 나옵니다. 넷 중 셋은 결정할 것이 없습니다. 네 번째는 답이 거의 언제나 허용을 유지하는 쪽입니다. 사용자 트리거 페치는 지금 이 순간 누군가 한 사람이 여러분에 대해 묻고 있다는 뜻이기 때문입니다. 어떤 페이지를 정말로 읽히면 안 된다면, robots.txt는 애초에 그 수단이 아니었습니다. 인증이 그 수단입니다.
오후 반나절에 토큰별로 어떻게 결정합니까?
저장소를 읽지 말고 파일을 가져오십시오
소유한 모든 호스트에 대해 공개 인터넷으로 robots.txt를 요청하십시오. CDN 규칙, 리다이렉트, 오래된 배포 때문에 실제로 제공되는 파일이 저장소와 달라지는 일은 생각보다 자주 일어납니다.
토큰을 이름 하나씩 평가하십시오
그룹화와 우선순위 때문에 robots.txt는 눈으로 봐서는 믿고 판단하기 어렵습니다. 자기가 쓴 기억이 나는 규칙을 훑지 말고, 토큰을 하나씩 처리하십시오.
파일 위의 층을 확인하십시오
방화벽 규칙, 봇 관리, 속도 제한, 국가 차단은 지시문이 읽히기 전에 먼저 응답합니다. 403을 받은 크롤러는 여러분의 Allow 줄까지 가지 못합니다.
사이트가 아니라 호스트 단위로 반복하십시오
robots.txt의 범위는 호스트 하나입니다. Anthropic은 발행자에게 포함하려는 모든 서브도메인에서 변경을 반복하라고 요구하는데, 이는 허용하는 방향에도 똑같이 적용됩니다.2
판단하기 전에 하루 기다리십시오
OpenAI는 robots.txt 업데이트가 자사 시스템에 닿기까지 대략 24시간이 걸린다고 말합니다. Perplexity도 최대 24시간이라고 문서화합니다.13
자기 로그에서 확인하십시오
결정은 텍스트 파일 안에서 내려집니다. 그것이 반영되었다는 증거는 접근 로그에 남은 성공한 검색 쪽 페치이고, 이는 함정이 다른 별개의 작업입니다.
기본 자세는 한 줄이면 됩니다. 그러지 않을 이유가 없다면 검색 쪽 토큰 다섯 개를 모두 허용하고, 학습 쪽 토큰은 검색 대가가 없는 사업적 결정으로 다루되 Google-Extended는 예외로 둡니다. 이 중 어느 것도 저절로 바로잡히지 않습니다. 차단은 여러분이 보는 어떤 대시보드에서도 하락으로 드러나지 않기 때문입니다. 파일이 맞고 나면 질문은 실제로 무엇이 도착했는지로 옮겨 가고, 그것은 로그의 질문입니다. 크롤러 로그 읽기에서 어떤 토큰을 따로 세어야 하는지, 어느 정도의 오류율을 예상해야 하는지, 크롤러가 자기가 말한 그 상대였는지를 어떻게 확인하는지를 다룹니다.
토큰 목록은 왜 낡고, 무엇을 해야 합니까?
올해 이 목록들이, 그것도 결정에 닿는 방식으로 움직였기 때문입니다. OpenAI는 이제 네 번째 토큰 OAI-AdsBot을 문서화합니다. 이것은 “광고로 제출된 페이지만 방문하며” 그 데이터는 “생성형 AI 기반 모델 학습에 쓰이지 않습니다”.1 Google은 크롤러 문서를 Search Central 밖으로 옮겼습니다. /search/docs/crawling-indexing/ 아래의 옛 경로는 이제 별도의 크롤링 섹션으로 리다이렉트됩니다. 2026년 8월 30일 확인했습니다.56 그리고 Google-NotebookLM은 그곳에 2026년 8월까지 지원되던 예전 에이전트로만 남아 있고 Google-GeminiNotebook으로 대체되었으니, 그 창은 이번 달에 닫힙니다.6
Google의 페처 문서는 agent.bot.goog라는 신원으로 진행하는 Web Bot Auth 프로토콜 실험도 언급합니다.6 이는 크롤러의 신원을 스스로 신고하는 헤더 문자열에서 서명된 무언가로 옮기게 됩니다. 그것이 보통이 되면, 텍스트 파일 속 이름은 더 이상 결정의 단위가 아닙니다.
Google의 두 페이지 모두 목록이 “전부는 아니다”라고 밝히고 있고, 세 번째 페이지가 특수한 경우의 크롤러를 다룹니다. 그러니 위 토큰들은 전수 조사가 아니라 하한으로 다루십시오. 그다음은 화려하지 않습니다. 캘린더에 반복 알림을 넣고, 벤더 다섯 곳의 페이지를 다시 읽고, 여러분 파일이 전제하는 내용과 대조하십시오. 한 번 써 놓은 robots.txt는 여러분을 대신해 계속 결정을 내리고, 그것이 만드는 실패는 소리가 없습니다.
여기 있는 모든 주장은 벤더의 자기 설명입니다. 강한 근거이지만 그래도 측정은 아닙니다. 문서는 토큰이 무엇을 위한 것인지 말할 뿐, 그 뒤의 크롤러가 실제로 무엇을 하는지는 말하지 않습니다. 특정 사이트의 robots.txt 변경과 그 사이트 인용률의 측정된 변화를 연결한 공개 연구도 없어서, 검색 토큰을 허용하는 일에서 인용되는 일로 가는 단계는 입증된 것이 아니라 가정된 것입니다. 페이지들이 낡는 속도도 제각각입니다. Anthropic 문서는 2026년 4월 7일, Perplexity 문서는 2026년 1월 29일, Google의 AI 기능 페이지는 2025년 12월 10일, 생성형 AI 가이드는 2026년 7월 10일이고, OpenAI 문서에는 날짜가 없습니다. 그리고 robots.txt는 접근 통제가 아니라 요청이므로, 신원을 밝히지 않는 페처에 대해서는 아무것도 설명하지 못합니다.
여기 있는 결정은 모두 무료이고 반나절이면 됩니다. 호스트마다 실제로 제공되는 robots.txt를 가져오고, 토큰을 이름 하나씩 평가하고, 그 위의 방화벽 층을 확인하고, 서브도메인마다 반복한 다음, 하루 기다리십시오. 이 판단을 대신 내려 줄 도구는 없습니다. 내 콘텐츠가 남의 모델을 학습시켜야 하는지는 기술 문제가 아니라 사업 문제입니다. Bavior는 그 관문 너머에서 일합니다. 고정된 프롬프트 패널을 다섯 개 엔진에 정해진 일정으로 돌리고 각 답변이 어떤 출처를 인용했는지 기록하므로, 토큰을 바꾼 뒤 등장하는 얼굴이 달라졌는지 볼 수 있습니다. 여러분의 robots.txt를 고치지 않고, 서버 로그를 읽지 않으며, 방화벽이 거절하는 페이지를 열어 주지도 못하고, 새로 얻은 인용이 여러분이 바꾼 그 토큰에서 왔다고 말해 주지도 못합니다. 무료 AI 가시성 체커와 무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 30일 기준).
- OpenAI, “Overview of OpenAI Crawlers”(OAI-SearchBot, OAI-AdsBot, GPTBot, ChatGPT-User. 하나는 허용하고 다른 하나는 금지하는 예. 날짜 없음): developers.openai.com/api/docs/bots
- Anthropic, “Does Anthropic crawl data from the web?”, 2026년 4월 7일 표기(ClaudeBot, Claude-SearchBot, Claude-User. 각각을 비활성화했을 때의 결과. 서브도메인별): support.claude.com/en/articles/8896518
- Perplexity, “Perplexity Crawlers”, 2026년 1월 29일 표기(PerplexityBot. Perplexity-User는 “일반적으로 robots.txt 규칙을 무시”. 방화벽 설정 단계): docs.perplexity.ai/docs/resources/perplexity-crawlers
- Apple, “About Applebot”(Applebot과 Applebot-Extended. Googlebot 지시를 따르는 폴백. crawl-delay 미지원): support.apple.com/en-us/119829
- Google, “List of Google’s common crawlers”(토큰 열한 개. Google-Extended의 학습, 그라운딩, 검색에 영향 없음이라는 표현): developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- Google, “List of Google user-triggered fetchers”(페처 아홉 개. Google-Agent. Google-NotebookLM은 Google-GeminiNotebook으로 대체. Web Bot Auth): developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
- Google Search Central, “AI features and your website”, 2025년 12월 10일 업데이트(검색 안 AI 기능의 통제 수단인 Googlebot. 스니펫 제어): developers.google.com/search/docs/appearance/ai-features
- Google Search Central, “Google’s Guide to Optimizing for Generative AI Features on Google Search”, 2026년 7월 10일 업데이트(생성형 기능은 “핵심 검색 순위와 품질 시스템에 뿌리를 두고 있다”): developers.google.com/search/docs/fundamentals/ai-optimization-guide
자주 묻는 질문입니다.
Google-Extended 차단은 여전히 공짜입니까?
완전히 그렇지는 않고, 그 점이 바뀌었습니다. Google의 크롤러 문서는 이제 Google-Extended가 학습뿐 아니라 그라운딩도 통제한다고 설명합니다. 즉 Gemini Apps와 Vertex AI에서 프롬프트 시점에 모델에 제공되는 검색 색인 콘텐츠를 뜻합니다. 같은 항목은 그것이 Google 검색 등록에 영향을 주지 않고 거기서 순위 신호로 작동하지도 않는다고 여전히 밝힙니다. 금지하면 Gemini 어시스턴트를 잃고, AI Overviews와 AI Mode는 그대로 남습니다.
사용자가 물을 때 AI 어시스턴트가 내 페이지를 가져가는 것을 막을 수 있습니까?
robots.txt로는 대개 안 됩니다. OpenAI는 동작이 사용자에게서 시작되므로 ChatGPT-User 규칙이 적용되지 않을 수 있다고 쓰고, Perplexity는 Perplexity-User가 일반적으로 robots.txt를 무시한다고 쓰며, Google은 Google-Agent를 포함한 사용자 트리거형 페처 부류 전체에 대해 같은 말을 합니다. Anthropic이 예외입니다. Claude-User는 여러분이 접근 권한을 정하는 로봇이고, 비활성화하면 사용자 쿼리에 응답한 리트리벌이 멈춥니다. 그보다 강한 것을 원한다면 지시문이 아니라 인증이 필요합니다.
robots.txt에서 딱 한 줄만 확인한다면 어느 줄이어야 합니까?
와일드카드 그룹입니다. User-agent 별표 아래의 넓은 금지 규칙은 검색 쪽 크롤러를 한꺼번에 없애고, 대개 선택된 것이 아니라 스테이징 파일이나 플랫폼 기본값에서 물려받은 것입니다. 이름이 붙은 토큰을 보기 전에 이것부터 확인하고, 그다음 검색 쪽 토큰 다섯 개가 주 마케팅 도메인만이 아니라 소유한 모든 호스트에서 허용되어 있는지 확인하십시오. robots.txt는 호스트 단위 범위이므로 서브도메인에는 자기 파일이 필요합니다.
robots.txt가 내 콘텐츠를 AI 답변에서 빼 줍니까?
규칙을 지키는 크롤러를 막아 줄 뿐이고, 그것은 같은 일이 아닙니다. 지시문은 접근 통제가 아니라 요청이고, 사용자 트리거형 페처는 설계상 대체로 이를 무시하며, 여러분 파일의 어떤 내용도 남의 페이지가 여러분에 대해 무엇이라고 쓰는지는 관장하지 못합니다. 엔진은 전혀 다른 곳에서 가져온 리뷰나 포럼 스레드, 동종 제품 비교만으로도 여러분의 제품을 정확히 설명할 수 있습니다.
Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.
수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com