/GEO 배우기/AI 크롤 트래픽
테크니컬 GEO · 규모

실제 AI 크롤 트래픽은 어떤 모습입니까?

로그를 읽는 법이 아니라, 그 안에 담긴 트래픽 자체가 무엇인지 다룹니다. 전통적인 검색 크롤과 비교해 얼마나 되는지, 어느 부분이 늘었는지, 무엇을 페치하는지, 그리고 어떤 용량 결정을 뒷받침하는지.

이 페이지의 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

보도가 시사하는 것보다 작고, 늘어나는 쪽은 어떤 답변도 바꾸지 않는 부분입니다. 2025년 한 대형 네트워크에서 검색 엔진 크롤러는 검증된 봇 트래픽의 40%를 차지했고, AI 크롤러는 그 절반인 20%, 검색 엔진 최적화 봇은 13%가 넘었습니다.1 유용한 조치는 AI 크롤을 한 줄로 읽기를 그만두고, 서로 다른 세 방향으로 간 세 개의 계열로 읽기 시작하는 것입니다.

핵심 요약
  • 모델 학습을 위한 크롤이 물량을 지배해 정점에서는 검색 크롤의 7배에서 8배에 달했습니다. 반면 인용을 실제로 뒷받침하는 검색 쪽 크롤은 2025년을 연초보다 10%에 조금 못 미치게 낮은 수준으로 마쳤습니다.
  • 그 전부가 여러분의 HTML은 아닙니다. 한 측정 사이트에서 어떤 어시스턴트의 페치는 57.70%가 HTML이었고, 다른 어시스턴트는 35.17%가 이미지였습니다. 대역폭 불만은 벤더마다 다른 불만이라는 뜻입니다.
  • 네트워크 평균은 여러분 사이트에 대한 약한 사전 정보입니다. 2025년 10월에 소매와 컴퓨터 소프트웨어 두 업종만으로 AI 크롤러 활동의 40%를 조금 넘게 끌어갔습니다.
  • 집계 점유율 자체가 1년 안에 2.4%에서 6.4%까지 흔들렸습니다. 그러므로 여러분의 로그에서 그만한 폭의 변동이 보여도, 그것은 여러분이 배포한 무언가가 아니라 시장이 움직인 것일 수 있습니다.
절대 규모

전통적인 검색 크롤과 비교해 AI 크롤은 얼마나 큽니까?

비교를 공개할 만큼 큰 유일한 네트워크에서는 대략 절반 규모이고, 넓게 퍼져 있기보다 소수의 user-agent에 집중되어 있습니다.

Cloudflare의 2025년 연간 리뷰는 2025년 1월 1일부터 12월 2일까지 네트워크 전체를 대상으로 합니다. 여기서 검색 엔진 크롤러는 그해 검증된 봇 트래픽의 40%, AI 크롤러는 그 절반인 20%로 집계되었습니다.1 이 범주들 안에서 분포는 롱테일이 아니라 극단적으로 집중되어 있습니다. Googlebot 하나가 검증된 봇 트래픽의 28%를 넘겼고, OpenAI의 GPTBot이 약 7.5%, Microsoft의 Bingbot이 6%입니다.1 크롤러 군단이라고 묘사되는 것의 대부분은 user-agent 네 개가 떠받치고 있습니다.

실제 콘텐츠를 실어 나르는 트래픽인 HTML로만 범위를 좁히면 그림은 한 번 더 조여집니다. 2025년 내내 Googlebot을 제외한 AI 봇은 그 네트워크 HTML 요청의 평균 4.2%였고, Googlebot 혼자서 4.5%를 차지했습니다. 12월 2일 기준으로 사람이 HTML 요청의 47%를, AI가 아닌 봇이 44%를 만들었습니다.1 HTML 요청 열 건 가운데 아홉 건이 넘게는 AI 크롤러와 아무 상관이 없었습니다. 어느 호스팅 플랫폼의 2024년 말 한 달치 자체 로그도 다른 경로로 같은 형태에 도달했습니다. 가장 큰 AI 크롤러 둘을 합쳐 같은 기간 Googlebot 페치 물량의 약 20%였습니다.3

여기의 모든 숫자에는 단서 하나가 따라붙습니다. Googlebot과 Bingbot은 검색 색인을 위한 크롤과 AI 학습을 위한 크롤을 동시에 수행하므로, 이들을 검색 통에 넣을지 AI 통에 넣을지는 패킷에 관한 사실이 아니라 분류 표기의 결정입니다. Cloudflare는 Googlebot을 양쪽에 모두 넣으며, 그래서 이 회사의 AI 크롤러 개요 맨 앞에는 대부분의 사람이 AI 크롤러라고 부르지 않을 봇이 놓입니다.1

성장

AI 크롤에서 실제로 늘어난 부분은 무엇입니까?

Cloudflare는 선언된 목적으로 AI 크롤을 분류합니다. 학습은 모델을 만들기 위해 콘텐츠를 모으는 것입니다. 검색은 답변이 그라운딩되는 색인을 만드는 것이고, 리트리벌 증강 생성을 포함할 수 있습니다. 사용자 행동은 누군가 방금 어시스턴트에게 무언가를 물었기 때문에 발생하는 것입니다. 네 번째 통에는 목적이 선언되지 않았거나 불분명한 크롤러가 들어갑니다.1 선언된 세 부류는 2025년에 서로 다른 세 방향으로 움직였고, 그 갈라짐이 발견의 전부입니다.

학습이 물량을 지배해 정점에서는 검색 크롤의 7배에서 8배, 사용자 행동 크롤의 32배에 달했습니다.1 가장 빠르게 늘어난 것은 사용자 행동 크롤입니다. 연초에는 셋 중 가장 작았지만 1월과 2월에 두 배 넘게 늘었고, 3월 초에 다시 두 배가 되었으며 계속 올라갔습니다. Cloudflare가 그 계열에 붙인 제목은 2025년에 15배 넘게 증가했다고 말하고, 그 아래 문단은 1월부터 12월 초까지 21배 넘게 늘었다고 말합니다.1 그 글은 두 수치를 맞춰 놓지 않았으므로, 인용할 가치가 있는 것은 보수적인 쪽 숫자이고 그 차이 자체도 알아 둘 만합니다.

검색 크롤은 아무도 제목으로 뽑지 않는 계열이고, 인용이 의존하는 것은 바로 이 계열입니다. 3월 중순까지 가장 강했다가 약 40% 떨어졌고, 서서히 회복해 조사 기간이 끝날 때는 연초보다 10%에 조금 못 미치게 낮은 수준으로 마쳤습니다.1 개별 크롤러의 갈라짐도 그만큼 날카로웠습니다. OAI-SearchBot은 10월 말에 1월 물량의 약 5배까지 치솟았고, PerplexityBot은 약 3.5배 높은 수준으로 마쳤으며, ClaudeBot은 상반기에 사실상 두 배가 되었다가 연초보다 10% 정도 높은 수준으로 되돌아왔고, GPTBot은 6월에 정점을 찍고 11월에는 연초보다 아주 조금 높은 수준으로 끝났습니다.1 어떤 토큰이 어떤 목적에 속하는지는 각 벤더가 문서로 밝히고 있으며, 크롤러 로그 읽기 글에 표로 정리되어 있습니다.456

구성

AI 크롤러 트래픽 가운데 여러분의 HTML은 얼마나 됩니까?

전부는 아니며, 벤더 사이의 차이가 충분히 커서 그중 하나를 차단했을 때 무엇이 절약되는지가 달라집니다. Vercel과 MERJ는 nextjs.org에서 AI 크롤러가 페치한 콘텐츠 유형을 측정했고, ChatGPT의 페치는 57.70%가 HTML, Claude는 35.17%가 이미지였습니다. 둘 다 실행하지도 않는 JavaScript 파일에 각각 11.50%와 23.84%를 더 썼습니다.3 Gemini와 검색을 아우르는 Googlebot의 페치는 또 다르게 퍼져 있었습니다. HTML 31.00%, JSON 29.34%, 일반 텍스트 20.77%, JavaScript 15.25%입니다.3

용량 측면에서 두 가지가 따라 나옵니다. AI 크롤러가 대역폭을 먹고 있다는 불만은 벤더마다 다른 문장입니다. 한쪽은 주로 여러분의 오리진에서 문서를 끌어가고 다른 한쪽은 주로 이미지를 끌어가며, 이 둘은 청구서의 서로 다른 줄에 찍히기 때문입니다. 그리고 자기가 실행하지도 않는 스크립트 번들을 페치하는 크롤러는 읽을 수 없는 바이트를 사고 있습니다. 그 부분은 콘텐츠 문제가 아니라 애셋과 캐싱 문제입니다. 그들이 애초에 JavaScript를 실행하는지는 JavaScript는 실행되나라는 별개의 질문입니다.

표본은 분명히 말해 두어야 합니다. 콘텐츠 유형 구성은 딱 옮겨 다니기에 취약한 종류의 통계이기 때문입니다. 그 백분율은 2024년 말 한 달, 하나의 프레임워크 위에 있는 문서 중심의 한 사이트에서 나온 것이고, 그 뒤 20개월 동안 재현 결과는 발표되지 않았습니다. 이미지가 많은 미디어 사이트나 상품 목록이 큰 상점은 그런 분포를 보지 못합니다. 남의 분포를 기준으로 계획하기 전에 여러분 자신의 엣지 로그에서 같은 분해를 뽑아 보십시오.

비용

이 트래픽은 실제로 얼마나 비쌉니까?

그것을 둘러싼 논쟁이 대개 가정하는 것보다 적고, 회의보다 쿼리 한 번이 더 빨리 결론을 냅니다. 네트워크 평균으로 Googlebot을 제외한 AI 봇은 HTML 요청 스물네 건 중 한 건쯤입니다.1 한 달에 HTML 요청 10만 건을 처리하는 사이트라면 대략 4,000건의 페치이고, 이는 현대의 어떤 스택에서도 용량 사건이 아닙니다. 차단할지 저울질하는 팀이라면 먼저 한 달치 엣지 로그를 user-agent 부류, 상태 코드, 전송 바이트로 묶어 보는 편이 낫습니다. 그 숫자가 나머지 논의를 정당화할 만큼 큰지 아닌지, 둘 중 하나이기 때문입니다.

비용이 실제로 무는 곳은 트래픽이라는 단어가 시사하는 것보다 좁습니다. 캐시를 놓치고 애플리케이션까지 닿는 HTML, 주로 이미지를 원하는 크롤러가 만드는 이미지 송신 트래픽, 그리고 엣지에서 돌려주지 않고 프레임워크가 동적으로 렌더링하는 오류 페이지에 몰립니다. 이 셋은 모두 캐싱과 애셋 결정이고, 모두 사람 방문자에게도 도움이 되며, 모두 정책 싸움보다 쌉니다.

네트워크 평균은 특정 사이트에 대해서도 빈약한 사전 정보입니다. 2025년 10월 소매와 컴퓨터 소프트웨어를 합쳐 전체 AI 크롤러 활동의 40%를 조금 넘게, 상위 10개 업종이 70%에 조금 못 미치게 끌어갔습니다.1 지역별로는 Cloudflare가 측정한 모든 지역에서 Googlebot이 크롤러 트래픽의 35%에서 55%를 가져갔고, GPTBot이나 Bingbot이 13%에서 14%로 2위였습니다.1 소프트웨어 문서 사이트와 지역 서비스 사이트는 같은 분포에서 뽑힌 것이 아니며, 둘 중 어느 것도 평균이 아닙니다.

베이스라인

여러분의 크롤 트래픽은 언제 정말로 바뀐 것입니까?

차트가 시사하는 것보다 드뭅니다. 베이스라인 자체가 움직이기 때문입니다. 수백만 사이트로 이루어진 네트워크 전체에서 HTML 요청 중 AI의 합계 점유율은 같은 해 안에 4월 초 2.4%에서 6월 말 6.4%까지 움직였습니다. 두 배 반이 넘는 진폭이고, 어떤 사이트도 아무것도 하지 않았습니다.1 그러므로 여러분의 크롤 계열이 한 분기에 두 배가 된 것은 시장이 발밑에서 움직였다는 설명과 어긋나지 않습니다. 그것을 여러분이 배포한 무언가에 귀속시키려면 계열만이 아니라 비교가 필요합니다. 그 리뷰가 근거로 삼은 Radar 실시간 계열은 공개되어 있으므로 비교에는 비용이 들지 않습니다.2

흔하지만 피하기 쉬운 읽기 오류가 둘 더 있습니다. AI 봇을 한 줄로 집계한 선은 위에서 본 갈라짐을 감춥니다. 이름이 붙은 크롤러 셋은 같은 해를 각각 약 3.5배, 1.1배, 그리고 제자리로 마쳤습니다. 그리고 이중 목적의 Googlebot을 포함한 집계와 제외한 집계는 서로 다른 계열이며, 그 차이는 대략 Googlebot 자신의 크기만큼입니다. 서로 어긋나는 두 차트는 단지 다른 모집단을 세고 있을 뿐일 수 있습니다.1

여러분의 계수에서 나타난 움직임이 그 물량에서 진짜인지는 별도의 답을 가진 별도의 통계 문제이고, 크롤러 로그 읽기 글에서 풀어 두었습니다. 여기서의 질문은 그보다 앞에 있습니다. 어떤 변화는 여러분의 사이트에서 완전히 진짜이면서도 여러분의 사이트에 관한 것이 아닐 수 있습니다.

결정

이 데이터는 무엇을 바꿔야 하고 무엇을 바꾸지 말아야 합니까?

이 데이터로 나아지는 결정이 셋, 나빠지는 결정이 하나 있습니다. 먼저 예산을 짜는 방식을 바꿔야 합니다. HTML을 엣지에서 캐싱하고, 크기가 맞는 이미지를 제공하고, 오류를 애플리케이션이 아니라 엣지에서 돌려주십시오. 그러면 크롤은 흡수되고 누구도 robots.txt 파일을 건드릴 필요가 없습니다. 다음으로 자사의 토큰 정책을 읽는 눈이 날카로워져야 합니다. 학습을 위한 크롤은 바이트를 쓰고 답변 쪽에는 아무것도 돌려주지 않지만, 검색 쪽 크롤은 인용이 의존하는 쪽이기 때문입니다. 그리고 기대치를 재설정해야 합니다. 크롤 급증은 입력이지 결과가 아닙니다.

바꾸지 말아야 할 것은 가시성에 대해 여러분이 주장하는 내용입니다. 사이트별 크롤 물량과 사이트별 인용률을 연결한 공표된 연구는 없고, 두 데이터셋은 공통 식별자를 공유하지 않습니다. 따라서 크롤 증가는 하류에서 무언가가 개선되었다는 근거가 아닙니다. 이 트래픽에 관문을 두거나 차단할지는 별도의 근거에 서 있는 별도의 결정이며, 페이월과 차단 글에서 다룹니다.

이 글의 정직한 한계

여기 거의 모든 수치는 자기 네트워크를 보고한 두 벤더에서 나왔습니다. 하나는 콘텐츠 전송 네트워크, 다른 하나는 호스팅 플랫폼이며, 어느 표본도 웹 전체가 아닙니다. 콘텐츠 유형 백분율은 2024년 말 단일 사이트의 것이고 재현된 적이 없습니다. 2025년 점유율은 2025년 12월 2일에서 멈추며, 크롤러 구성은 그 뒤로 움직였습니다. 어느 것도 인용 결과와 대조해 검증되지 않았습니다. 사이트별 크롤 행동과 사이트별 인용률을 잇는 공표된 연구가 없기 때문입니다. 전부를 그럴듯한 범위로 읽고, 측정은 여러분 자신의 엣지 로그로 하십시오.

제품이 쓸모 있는 자리와 그렇지 않은 자리

이 페이지의 모든 내용은 이미 여러분의 것인 로그에 대한 쿼리 한 번입니다. 한 달치 엣지 요청을 user-agent 부류, 상태 코드, 전송 바이트로 묶으면 아무것도 사지 않고 여러분의 AI 크롤 트래픽 모양을 얻습니다. Bavior는 대신 답변 쪽에서 일합니다. 고정된 프롬프트 패널을 다섯 개 엔진에 정해진 일정으로 돌리고, 각 답변이 어떤 출처를 인용했는지 기록합니다. Bavior가 하지 않는 일은 접근 로그를 읽는 것, 크롤러 바이트를 세는 것, 캐시 용량을 잡는 것, 그리고 크롤 증가가 인용을 만들었다고 말해 주는 것입니다. 마지막 것은 누구도 할 수 없습니다. 크롤 쪽과 답변 쪽에 공통 식별자가 없기 때문입니다. 무료 AI 가시성 체커무료 GEO 진단은 유료 플랜 없이 이용할 수 있습니다. 유료 플랜은 월간 결제 시 월 $99부터, 연간 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Cloudflare Radar 2025년 연간 리뷰, 데이터 기간 2025년 1월 1일부터 12월 2일까지. 검증된 봇의 범주별 점유율, 봇별 점유율, 목적 부류와 그 추세, HTML 요청 점유율, robots.txt 지정 현황, 2025년 10월 지역별·업종별 크롤: blog.cloudflare.com/radar-2025-year-in-review
  2. Cloudflare Radar, AI Insights(연간 리뷰 뒤에 있는 실시간 계열. 봇 모범 사례와 robots.txt에서 발견된 AI user-agent 포함): radar.cloudflare.com/ai-insights
  3. Zecchini, Moore, Ubl, Siddle, “The rise of the AI crawler”, Vercel과 MERJ, 2024년 12월 17일. 표본이 된 달의 nextjs.org와 Vercel 네트워크 1차 로그 데이터. 크롤러별 콘텐츠 유형 비율과 상대 페치 물량: vercel.com/blog/the-rise-of-the-ai-crawler
  4. OpenAI, 크롤러 및 봇 문서(학습용 GPTBot, 검색용 OAI-SearchBot, 사용자 트리거 페치용 ChatGPT-User. 1차 자료): developers.openai.com/api/docs/bots
  5. Anthropic, “Does Anthropic crawl data from the web?”(ClaudeBot, Claude-SearchBot, Claude-User. 1차 자료): support.claude.com/en/articles/8896518
  6. Google 검색 센터, “Google user-triggered fetchers”(사용자 트리거형 페처를 문서화된 독립 범주로 다룸. 1차 자료): developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
  7. Perplexity, 봇 문서(PerplexityBot과 Perplexity-User. 1차 자료): docs.perplexity.ai/guides/bots
FAQ

자주 묻는 질문입니다.

AI 크롤러 트래픽은 이미 Googlebot 트래픽보다 큽니까?

아닙니다. 적어도 비교를 공개할 만큼 큰 유일한 네트워크에서는 그렇지 않습니다. 2025년 내내 Cloudflare는 검색 엔진 크롤러를 검증된 봇 트래픽의 40%로, AI 크롤러를 그 절반인 20%로 집계했습니다. HTML 요청만 세면 Googlebot을 제외한 AI 봇은 평균 4.2%였고 Googlebot 혼자 4.5%를 차지했습니다. AI 크롤은 실재하고 늘고 있지만, 그 규모는 Googlebot의 몇 배가 아니라 대체로 Googlebot과 비슷합니다.

2025년에 늘어난 AI 크롤은 어느 종류입니까?

늘어난 것은 학습과 사용자 행동 크롤이고, 검색 크롤은 늘지 않았습니다. Cloudflare는 학습이 AI 크롤러 물량의 압도적 다수를 차지해 정점에서 검색 크롤의 7배에서 8배에 달했고, 사용자 행동 크롤은 한 해 동안 15배 넘게 늘었다고 보고했습니다. 답변이 그라운딩되는 색인을 만드는 부류인 검색 크롤은 조사 기간이 끝날 때 연초보다 10%에 조금 못 미치게 낮은 수준으로 마쳤습니다. 제목이 되는 성장은 인용을 만들어 내는 부류에 있지 않습니다.

AI 크롤러는 HTML 페이지만 페치합니까?

아닙니다. 게다가 구성은 벤더마다 크게 다릅니다. 한 측정 사이트에서 ChatGPT의 페치는 57.70%가 HTML이었고 Claude는 35.17%가 이미지였으며, 둘은 실행하지도 않는 JavaScript 파일에 각각 11.50%와 23.84%를 더 썼습니다. Gemini와 검색을 아우르는 Googlebot의 페치는 더 고르게 퍼져 HTML 31.00%, JSON 29.34%, 일반 텍스트 20.77%, JavaScript 15.25%였습니다. 따라서 대역폭 불만은 크롤러마다 다른 것을 뜻합니다.

AI 크롤 트래픽은 차단을 정당화할 만큼 비쌉니까?

물량만 놓고 보면 대개 아닙니다. 확인은 쿼리 한 번입니다. 네트워크 평균으로 Googlebot을 제외한 AI 봇은 HTML 요청 스물네 건 중 한 건쯤이므로, 한 달에 HTML 요청 10만 건을 처리하는 사이트는 대략 4,000건의 AI 페치를 받습니다. 결정하기 전에 여러분의 한 달치 엣지 로그를 user-agent 부류와 전송 바이트로 묶어 보십시오. 캐싱, 크기가 맞는 이미지, 엣지에서 돌려주는 오류가 대개 이 문제를 정리합니다.

이번 분기에 AI 크롤 물량이 두 배가 되었습니다. 제 사이트에서 무언가 바뀐 것입니까?

아닐 수 있습니다. 베이스라인이 스스로 움직이기 때문입니다. 수백만 사이트로 이루어진 네트워크 전체에서 HTML 요청 중 AI의 합계 점유율은 한 해 안에 2.4%에서 6.4%까지 움직였고, 두 배 반이 넘는 이 진폭은 어떤 개별 사이트가 만든 것이 아닙니다. 변화를 여러분이 배포한 무언가에 귀속시키기 전에 여러분의 계열을 공개된 네트워크 계열과 비교하고, 집계된 한 줄을 읽는 대신 크롤러별로 나누어 보십시오.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

트래픽은 그것을 둘러싼 논쟁보다 작습니다.
무엇이든 결정하기 전에 먼저 측정하십시오.

무료 체험 시작