발표된 GEO 실험은 거의 전부 어려운 부분이 이미 해결된 뒤에 시작하므로, 그 결과는 발견이 아니라 영향력을 서술합니다. 답변 엔진은 세 단계를 순서대로 돌립니다. 후보를 리트리벌하고, 그중 일부를 컨텍스트 윈도우에 조립하고, 그 컨텍스트에서 문장을 생성합니다. 고정된 문서 집합을 모델에 넘겨주는 벤치마크는 단계 1과 단계 2를 조용히 대신 끝내 놓은 것입니다.
방법 절까지 읽어 보면 그 창시 논문은 자기 실험 장치에 대해 솔직합니다. 2024년 KDD 논문은 2단계 합성 엔진을 만들었습니다. 어떤 쿼리에 대해 Google 상위 다섯 건을 가져오고, 그 다섯 출처에 그라운딩한 답변을 gpt-3.5-turbo가 쓰게 하는 방식이어서, 최적화된 페이지는 구조상 이미 다섯 문서 컨텍스트 안에 있었습니다.3 NeurIPS 2025에서 발표된 C-SEO Bench도 과제 2개, 도메인 6개, 쿼리 1.9k건 이상과 문서 16k건에 걸쳐 마찬가지로 후보 집합을 주고 그 안에서 무슨 일이 벌어지는지를 측정합니다.2 둘 다 좋은 실험입니다. 그러나 어느 쪽도 최적화된 페이지가 발견되는지는 시험하지 않았습니다.
2026년 KDD 논문 하나가 빠진 단계들을 되돌려 놓았습니다. SAGEO Arena는 문서 171,003건과 쿼리 2,700건에서 리트리벌과 재순위화를 복원했고, 문서 본문만 최적화하면 상위 20위 안 평균 등장이 약 9%, 재순위화 후 상위 10위 안 등장이 16%, 최종 인용이 약 6% 줄어든다는 것을 발견했습니다.4 이 결과에 대한 서베이의 독해가 기억할 문장입니다. “따라서 재작성은 일단 주입되고 나면 좋은 성과를 낼 수 있지만, 그러면서 문서를 상류에서 덜 리트리벌되게 하거나 덜 경쟁력 있게 만들 수 있다.”1 주된 기법이 단계 3에서 얻는 것보다 단계 1에서 더 많이 잃을 수 있는 분야는, 단계 1과 무관하게 실천할 수 없습니다.