/GEO 배우기/길이, schema, llms.txt
주제 · AI 인용을 위한 콘텐츠

길이, schema, llms.txt: 근거는 실제로 무엇을 말합니까?

창업자가 가장 많이 묻는 세 가지 전술이자, 뒷받침하는 근거가 가장 약한 세 가지입니다. 이 페이지는 각각에 대해 실시된 연구를 모두 이름으로 밝히고, 누가 했는지, 그 표본이 무엇을 볼 수 없었는지 적습니다.

이 페이지 내용
이 글 공유하기
X에 공유 LinkedIn에 공유
짧은 답

셋 중 1차 출처의 답이 있는 것은 하나뿐이고, 그 하나가 셋을 모두 부정합니다. Google의 생성형 AI 기능 안내 문서는 “이상적인 페이지 길이는 없다”, “추가해야 하는 특별한 schema.org 마크업은 없다”, 그리고 Search가 무시하므로 LLMS.txt 파일은 “해가 되지도 도움이 되지도 않는다”고 명시합니다.1 나머지는 전부 관찰 데이터이고, 사람들이 그것에 던지는 질문에 답하도록 설계된 것은 하나도 없습니다. 그래서 세 가지 통설은 반증된 것이 아니라 뒷받침이 없는 상태입니다. 대조군을 둔 단 하나의 전후 테스트, JSON-LD를 추가한 1,885개 페이지와 짝지은 4,000개 대조 페이지는 AI Overview 인용이 −4.6% 움직였고 나머지 두 서피스은 0과 구별되지 않는다고 측정했습니다.8

핵심 요약
  • 셋을 모두 다루는 유일한 1차 문서가 셋을 모두 부정합니다. 그것도 “무시해도 되는 것들”이라는 같은 짧은 목록 안에서이고, 최종 업데이트는 2026년 7월 10일입니다.
  • 큰 길이 데이터셋 두 개가 반대를 가리키는 이유는 서로 다른 결과를 측정하기 때문입니다. 그리고 어느 쪽에도 비교 대상이 될 인용되지 않은 페이지가 단 한 건도 없습니다.
  • 구조화 데이터에는 짝지은 전후 테스트가 정확히 한 건 있습니다. AI Overviews에서 작은 음의 값, 나머지는 아무것도 없습니다. 이 전술을 퍼뜨린 것은 약 3대 1의 원시 상관관계였습니다.
  • llms.txt를 읽는다고 문서화한 엔진은 없습니다. AI 벤더 네 곳이 자사 개발자 문서용으로 공개하지만 소비한다고 문서화한 곳은 하나도 없고, 서버 로그를 보면 요청은 SEO 감사 도구에서 옵니다.
점수판

셋 각각의 근거 상태는 어떻습니까?

각 행은 현존하는 가장 강한 테스트와, 그 설계 때문에 볼 수 없었던 것을 적습니다.

레버실시된 가장 강한 테스트그 테스트가 볼 수 없었던 것
페이지 길이관찰 데이터셋 두 건: 인용된 174,048개 페이지, 그리고 영향도를 채점한 18,151개 수집 페이지인용되지 않은 비교군이 없어 어느 쪽도 특정 단어 수에서의 인용 확률을 추정하지 못함
schema 마크업짝지은 이중차분 테스트 한 건: JSON-LD를 추가한 1,885개 페이지 대 대조군 4,000개측정한 세 곳 밖의 엔진에서, 또는 더 긴 기간에서 schema 마크업이 AI 인용을 높이는지 여부
llms.txt이미 인용된 37,894개 도메인의 횡단 조사 한 건, 그리고 누가 이 파일을 요청하는지 본 서버 로그 연구 두 건인용이 전혀 없는 사이트에 llms.txt가 도움이 되는지 여부. 그런 사이트는 어느 표본에도 없었음

셋 다 답이 숫자인 것처럼 질문받습니다. 그리고 셋 다 정직한 답은 연구 설계에 대한 설명입니다. 모양은 매번 반복됩니다. 큰 원시 상관관계가 공유되고, 원인과 상관을 분리하려고 설계된 단 하나의 테스트는 훨씬 작은 결과를 내놓고, 엔진 자신의 문서는 그것이 레버였던 적이 없다고 적습니다. 인용되는 콘텐츠는 그 선 반대편의 전술을 다룹니다.

길이

페이지 길이가 인용 여부를 바꿉니까?

그 질문에 답할 연구를 실시한 사람은 아무도 없고, Google의 입장은 질문 자체가 잘못 세워졌다는 것입니다. 생성형 AI 기능 안내 문서는 2026년 7월 10일 최종 업데이트에서 콘텐츠 길이를 무시해도 되는 것들 쪽에 넣습니다. “AI가 더 잘 이해하도록 콘텐츠를 잘게 쪼갤 필요는 없습니다… 이상적인 페이지 길이는 없으며, 결국 생성형 AI 검색만을 위해서가 아니라 독자를 위해 페이지를 만드십시오.”1

대신 돌아다니는 숫자는 서술적인 것입니다. 2025년 12월의 업계 분석은 AI Overviews 560,346건과 인용 URL 1,677,876건을 대상으로 본문을 추출할 수 있는 174,048개 페이지로 좁혀, 인용된 페이지 평균 1,282단어, 자연 검색 상위 페이지 1,188단어로 보고했습니다. 1,000단어 미만이 53.4%, 1,000에서 2,000단어가 30.6%, 2,000단어 초과가 16%입니다.9 벤더가 발표한 것이라 링크하지 않고 설명만 합니다.

중앙값보다 표본을 먼저 읽으십시오. 그 안의 모든 페이지는 이미 인용된 페이지였고, 인용되지 않은 페이지 집단은 옆에 놓여 있지 않습니다. 비교군이 없는 데이터셋은 인용된 페이지가 어떤 모습인지는 말할 수 있어도, 2,400단어 페이지가 700단어 페이지보다 얼마나 더 인용되기 쉬운지는 말하지 못합니다. 그 중앙값을 콘텐츠 지침으로 바꾸는 것은 인구조사를 처방전으로 바꾸는 일입니다.

이 분석이 보고하는 관계형 수치는 하나뿐입니다. 단어 수와 인용 위치 사이의 Spearman 상관 0.04이며, 1위에서 3위까지 평균 길이는 거의 평평했습니다.

다른 데이터셋

학술 데이터셋은 왜 반대를 가리킵니까?

다른 표본에서 다른 결과를 측정하기 때문이고, 나란히 놓으면 둘은 충돌하지 않습니다. Zhang, He, Yao의 2026년 프레임워크는 인용 선택(엔진이 당신을 고르는 것)과 인용 흡수(당신의 표현이 답변에 닿는 것)를 나눕니다. 통제된 프롬프트 602건과 성공적으로 수집된 18,151개 페이지에서, 영향도 상위 사분위는 평균 1,943.30단어, 하위 사분위는 169.82단어로 비율은 11.44배였습니다. 단어 수 구간은 3,000단어가 넘는 페이지까지 꾸준히 올라가고, 301에서 1,000단어 부근에 평평한 구간이 있습니다.3

비율보다 하위 사분위를 먼저 보십시오. 평균 169.82단어는 스텁입니다. 태그 페이지, 얇은 지원 메모, 제품 소개문. 11.44배의 대비는 진짜 글과 조각의 대비이고, 1,200단어 글을 3,000단어로 늘려야 하는지에 대해서는 아무것도 말하지 않습니다.

저자들이 직접 그렇게 씁니다. 단어 수는 “단독으로는 불완전한 대리 지표”이고, 그들이 보고한 가장 강한 단일 상관은 길이가 아니라 LLM 관련성 점수 r = 0.4322로, 답변과 인용의 임베딩 유사도 0.3561보다 앞섭니다. 요약 문장은 담백합니다. “페이지 단어 수와 구조적 표지는 작동하지만, 의미적 적합성이 단순한 길이 신호보다 강하다.”3 쓸모 있는 것은 저자들의 근거 컨테이너라는 독법입니다. 늘어난 분량이 더 많은 소제목, 서로 다른 주장, 뽑아낼 수 있는 근거를 사 온다면 길이는 값을 하고, 상투구를 사 온다면 아무 일도 일어나지 않습니다.

구조화 데이터

schema 마크업이 AI 인용을 움직입니까?

여기가 누군가 실험을 제대로 실시한 유일한 사례이고, 상관과 실험의 차이는 그 주장의 크기 전체와 같습니다.

이 전술을 퍼뜨린 상관관계부터 봅니다. 같은 벤더의 데이터에서 AI에 인용된 페이지가 JSON-LD를 달고 있을 확률은 인용되지 않은 페이지의 거의 세 배였습니다. 그다음 같은 팀이 화살표의 방향을 찾으러 갔습니다.

2026년 5월 공개. 2025년 8월부터 2026년 3월 사이에 JSON-LD를 도입한 1,885개 페이지를 대조군 4,000개와 짝짓고, 플랫폼 전체 추세가 상쇄되도록 이중차분으로 분석했습니다. Google AI Overviews는 −4.6% 움직였고, 짝지은 대조군 대비 작지만 통계적으로 유의하다고 설명됩니다. Google AI Mode는 +2.4%, ChatGPT는 +2.2%로 둘 다 통계적으로 0과 구별되지 않습니다.8 “schema 마크업이 AI 인용률을 높인다”는 홍보 문구는 그 테스트의 지지를 받지 못합니다. 그리고 그것이 같은 종류로는 유일하게 존재하는 테스트입니다.

이 음의 값도 과하게 읽으면 안 됩니다. 두 집단 모두 이미 내려가고 있었고, 처치 집단이 조금 더 빨리 떨어졌을 뿐입니다. 소수의 극단적 이상치가 그 평균을 끌어내렸고, 그것들을 빼면 두 집단은 대체로 같아 보입니다. 마크업 추가는 해를 끼친 것이 아니라, 측정할 수 있는 효과를 아무것도 내지 못한 것입니다.

1차 문서도 같은 말을 하고, 두 페이지는 각각 인용할 값어치가 있습니다. 문구가 다르고 날짜 하나로 둘을 덮을 수 없기 때문입니다. AI 기능 페이지는 최종 업데이트가 2025년 12월 10일이고 “추가해야 하는 특별한 schema.org 구조화 데이터도 없습니다”라고 쓰면서, 기존 마크업은 “페이지에 보이는 텍스트와 일치”할 것을 요구합니다.2 일곱 달 뒤의 최적화 가이드는 이것을 “구조화 데이터에 과도하게 집중하기”로 분류하면서도, 실제로 넣어야 할 진짜 이유는 남겨 둡니다. “Google 검색의 리치 결과 대상이 되는 데 도움이 됩니다.”1 schema에는 여전히 할 일이 있습니다. 다만 그것은 팔릴 때 내세워지는 일이 아닙니다.

llms.txt

실제로 당신의 llms.txt를 읽는 것이 있습니까?

문서화된 것 중에 읽는 것은 없고, 이 파일의 저자 본인도 읽힐 것이라고 말한 적이 없습니다. 제안서는 2024년 9월 3일자이고 2026년 8월 10일에 2판으로 개정되었는데, 파일의 용도를 에이전트가 무언가를 필요로 하는 바로 그 순간에 사이트를 가져오는 장면으로 한정합니다. llms.txt의 정보는 “대신 온디맨드로, 에이전트가 사용자를 돕는 도중에 어떤 주제의 정보가 필요할 때 사용”되며, 기대된 유용성은 “주로… 훈련이 아니라 추론을 위한 것”이었습니다.5 검색으로 그라운딩된 답변에 인용되는 일은 이 문서가 담고 있는 사용 사례가 아닙니다.

“llms.txt 파일이 페이지가 인용되는 데 도움이 된다”는 주장은 어떤 1차 문서에도 지지받지 못하고, 지금까지 공개된 모든 서버 로그에 반박되며, 실시된 유일한 대규모 횡단 조사에서도 기각됩니다. Google은 이 파일을 직접 지목합니다. 만들어 유지해도 “Google 검색은 그것들을 무시하므로 사이트의 가시성이나 순위에 해가 되지도 도움이 되지도 않습니다”.1

헷갈리는 대목은 AI 회사들이 이 파일을 직접 공개한다는 점입니다. Anthropic, OpenAI, Perplexity, Cloudflare 모두 자사 개발자 문서용으로 llms.txt를 제공하고, 2026년 8월 30일에 확인했을 때 네 곳 모두 내용을 반환했습니다.6 코딩 에이전트를 위한 지도를 공개하는 일과 검색 답변을 그라운딩하면서 지도를 소비하는 일은 다른 행위이고, 네 곳 중 뒤쪽을 한다고 문서화한 곳은 없습니다.

측정은 두 종류가 있습니다. 2026년 3월의 횡단 조사는 브랜드 스냅숏 882건과 337,000건이 넘는 인용에서, AI 답변에 최소 두 번 인용된 도메인 37,894개를 뽑아 그중 13.3%가 이 파일을 갖고 있다고 보고했습니다. 도입한 쪽은 평균 인용 6.8건, 그렇지 않은 쪽은 6.7건, 중앙값은 둘 다 3.0, Mann-Whitney U의 p = 0.85였습니다.7 결정적인 것은 이 조사 자신의 각주입니다. 같은 비교가 전수 규모에서는 유의해지고 효과 크기는 r = −0.065가 됩니다. 하나의 연구가 정반대 두 방향으로 인용되는 것은 이런 사정 때문입니다.

서버 로그는 누가 이 파일을 요청하는가라는, 더 거칠고 더 깨끗한 질문을 던집니다. 어느 운영자의 한 달치 로그에는 /llms.txt 요청이 52건 기록되었고 전부 SEO 감사 도구에서 왔으며 AI 크롤러에서 온 것은 하나도 없었습니다. 더 넓은 호스팅 전체로는 4억 건 요청 중 약 5,000건입니다. 별도의 90일 연구는 AI 봇 방문 62,100건 중 84건이 그곳으로 갔고, 그 사이트의 평균 콘텐츠 페이지는 약 265건이었다고 기록했습니다.10

방법

진짜 테스트와 상관관계를 어떻게 구분합니까?

네 가지 질문이면 앞으로 보게 될 GEO 주장은 거의 다 정리됩니다. 넷 다 연구 자신의 설명에서 답할 수 있습니다. 무언가를 바꾼 것인가, 아니면 원래 달랐던 페이지들을 비교한 것뿐인가. 대조군이 있었는가, 그래서 플랫폼 전체의 추세를 당신의 효과로 착각하지 않을 수 있는가. 누가 제외되었고, 그 제외된 집단이 당신이 속한 집단인가. 그리고 어떤 결과를 측정했는가. 목록에서의 위치, 표현에 미친 영향, 인용될 확률은 각각 따로 움직이는 세 변수이기 때문입니다.

2026년의 비판적 서베이는 같은 지점을 프로토콜 요건으로 적습니다. “콘텐츠 수정, 내부 링크, 구조화 데이터, 도메인 평판, 크롤러 접근성은 분리되어야 한다.”4 그 신뢰도 표는 인용 점수가 클릭이나 전환, 매출을 예측한다는 주장을 매우 낮음으로 평가합니다. 대시보드가 움직이는 숫자 하나만 내밀 때 기억해 둘 만합니다. SEO에서 이어지는 것은 그 검증을 통과한 레버들에 같은 검증을 적용합니다.

이 페이지의 정직한 한계

여기 나오는 연구 중 네 건은 벤더가 발표한 것이라 그 회사 밖에서는 다시 실행할 수 없습니다. 데이터는 공개되지 않았고, 표본 추출 틀은 방법 절이 아니라 한 문단으로 적혀 있으며, 벤더는 그 결론에서 이득을 보는 무언가를 팔고 있습니다. 인용하는 이유는 그것이 현존하는 유일한 테스트이기 때문이지, 강하기 때문이 아닙니다. 학술 출처는 프롬프트 602건으로 작업한 프리프린트입니다. 그리고 이런 모양의 표본에서 나온 널 결과는 어디에도 효과가 없다는 증명이 아닙니다. 이 엔진들에서, 이 기간들에서, 이 설계가 감지할 수 있는 크기에서는 아직 아무도 찾지 못했다는 뜻입니다.

제품이 도움이 되는 지점, 되지 않는 지점

여기 있는 세 가지 질문은 어떤 도구가 끼어들기 전에 이미 결론이 납니다. 단어 수가 아니라 질문에 대고 쓸 것. 구조화 데이터는 그것이 실제로 벌어 오는 리치 결과를 위해 남겨 둘 것. llms.txt에 쓸 한 시간을 리트리벌 수정에 쓸 것. 마크업이나 텍스트 파일이 도움이 되었을지는 Bavior도 말해 줄 수 없고, 어떤 측정 제품도 말해 줄 수 없습니다. 나중에 답변을 표집하는 방식으로는 당신의 변경과 그 주에 함께 움직인 다른 모든 것을 분리할 수 없기 때문입니다. Bavior가 하는 일은 더 좁습니다. 고정된 프롬프트 묶음을 다섯 개 엔진에 일정에 맞춰 보내고, 각 답변이 어떤 출처를 인용했는지 기록합니다. 그러면 진짜 테스트에 필요한 전후 계열은 생기지만, 대조군은 여전히 없습니다. 무료 GEO 진단무료 AI 가시성 체커는 유료 플랜 없이 쓸 수 있습니다. 유료 플랜은 월 결제 시 월 $99부터, 연 결제 시 월 $79.17입니다(2026년 8월 30일 기준).

출처, 모두 2026년 8월 30일 확인
  1. Google Search Central, “Google’s Guide to Optimizing for Generative AI Features on Google Search”, 최종 업데이트 2026년 7월 10일(1차 출처. 페이지 길이, LLMS.txt, 구조화 데이터): developers.google.com/search/docs/fundamentals/ai-optimization-guide
  2. Google Search Central, “AI features and your website”, 최종 업데이트 2025년 12월 10일(1차 출처. 문구가 다른 별도 페이지: “추가해야 하는 특별한 schema.org 구조화 데이터는 없다”): developers.google.com/search/docs/appearance/ai-features
  3. Zhang Kai, He Xinyue, Yao Jingang, “From Citation Selection to Citation Absorption”, arXiv:2604.25707v2, 2026년 4월 29일(프리프린트). 프롬프트 602건, 인용 21,143건, 수집 페이지 18,151건. §§8.1과 8.2: arxiv.org/abs/2604.25707
  4. “Optimizing Visibility in Generative Engines: A Critical Survey”, 2026년 7월 15일, arXiv:2607.14035(프리프린트). 교란 요인 분리 프로토콜. 표 5는 인용에서 매출로 가는 예측을 매우 낮음으로 평가: arxiv.org/abs/2607.14035
  5. Jeremy Howard, “The /llms.txt file, v2”, 2024년 9월 3일자, 2026년 8월 10일 수정(제안서 자체, 1차 출처): github.com/AnswerDotAI/llms-txt
  6. 자사 개발자 문서용으로 llms.txt를 공개한 네 곳. 2026년 8월 30일에 가져왔을 때 모두 내용을 반환: docs.anthropic.com/llms.txt, developers.openai.com/llms.txt, docs.perplexity.ai/llms.txt, developers.cloudflare.com/llms.txt
  7. llms.txt 횡단 조사, 2026년 3월 19일. 최소 두 번 인용된 도메인 37,894개, 브랜드 스냅숏 882건에서 추출. 도입률 13.3%. 평균 인용 6.8 대 6.7, 중앙값 3.0, Mann-Whitney U p = 0.85, 전수 규모에서 r = −0.065. 벤더 발표. 링크 없이 설명만.
  8. schema 이중차분 테스트, 2026년 5월 11일. 2025년 8월부터 2026년 3월 사이 JSON-LD를 추가한 1,885개 페이지 대 짝지은 대조군 4,000개. AI Overviews −4.6%, AI Mode +2.4%, ChatGPT +2.2%. 벤더 발표. 링크 없이 설명만.
  9. 콘텐츠 길이 분석, 2025년 12월 3일. AI Overviews 560,346건, 인용 URL 1,677,876건, 본문 추출 가능 페이지 174,048개. 평균 1,282단어, 자연 검색은 1,188단어. 인용 위치와의 Spearman 상관 0.04. 벤더 발표. 링크 없이 설명만.
  10. 누가 /llms.txt를 요청하는지 본 서버 로그 연구 두 건. 어느 운영자의 한 달치 로그에서 요청 52건이 모두 SEO 감사 도구에서 왔고 호스팅 전체로는 4억 건 중 약 5,000건, 2026년 3월 5일. 그리고 AI 봇 방문 62,100건 중 84건을 기록한 90일 연구, 2026년 2월 5일. 링크 없이 설명만.
FAQ

자주 묻는 질문입니다.

AI 검색에 인용되려면 페이지가 얼마나 길어야 합니까?

근거에 뒷받침된 숫자는 없고, Google 자신의 가이드도 이상적인 페이지 길이는 없다고 적습니다. 가장 많이 인용되는 수치인 인용된 페이지 174,048개의 평균 1,282단어는 이미 인용된 페이지의 모습을 서술한 것이지 길이 덕분에 선택된 페이지를 가리키지 않습니다. 그중 53.4%는 1,000단어 미만입니다. 질문에 답을 마쳤으면 거기서 멈추십시오.

AI에 인용되려고 schema 마크업을 추가해야 합니까?

리치 결과를 위해 추가하십시오. 그것이 실제로 돌아오는 이득입니다. 짝지은 유일한 전후 테스트, JSON-LD를 추가한 1,885개 페이지 대 대조군 4,000개는 AI Overview 인용이 4.6% 내려갔고 나머지 서피스은 0과 구별되지 않는다고 보여 주었습니다. Google도 AI 기능을 위해 추가해야 하는 특별한 schema.org 마크업은 없다고 적습니다. 그대로 두되, 그 이상의 공은 돌리지 마십시오.

내 사이트에 llms.txt 파일이 필요합니까?

문서화된 검색 엔진 중 그것을 읽는 것은 없습니다. Google은 Search가 무시하므로 이 파일은 해가 되지도 도움이 되지도 않는다고 적고, 제안서 저자 본인도 용도를 에이전트의 온디맨드 수집으로 한정했지 검색 인용으로 두지 않았습니다. 서버 로그 연구 두 건에서 요청은 거의 전부 SEO 감사 도구에서 왔습니다. 에이전트 연동이 원한다면 공개해도 되지만, 가시성에는 하나도 계산하지 마십시오.

왜 그렇게 많은 GEO 가이드가 아직도 셋을 다 권합니까?

각각의 뒤에 큰 원시 상관관계가 있고, 상관관계는 만들기 싸기 때문입니다. 인용된 페이지가 JSON-LD를 달고 있을 확률은 실제로 약 세 배이고, 인용된 페이지의 평균 단어 수가 스텁보다 많은 것도 사실입니다. 빠진 한 걸음이 대조군이고, 누군가 대조군을 더한 유일한 경우에는 효과가 사라졌습니다. 그 연구가 무엇을 바꾸었고 무엇과 비교했는지를 물으십시오.

Bavior 편집팀

Reddit 마케팅과 AI 검색 가시성에 관한 Bavior의 콘텐츠를 조사하고 관리하는 팀입니다. 본문의 모든 수치에는 출처와 확인 날짜를 명시했으며, 제휴 링크는 사용하지 않습니다.

수치에 오류를 발견하셨나요? 알려주시면 다시 확인하겠습니다: support@bavior.com

전술 셋, 대조군은 하나뿐.
실제로 움직인 것을 측정하십시오.

무료 체험 시작