선택과 재순위화는 여러 개의 후보 목록을, 정해진 컨텍스트 예산 안에 들어가는 짧고 순서 있는 증거 목록 하나로 바꿉니다. 네 가지 작업이 차례로 일어납니다. 팬아웃된 각 하위 쿼리가 돌려준 후보 집합이 합쳐집니다. 거의 같은 것과 전재된 사본은 접혀서, 같은 주장이 세 자리를 차지하지 않게 합니다. 남은 것은 도메인이 얼마나 권위 있는지가 아니라 각 구절이 그 구체적인 질문에 얼마나 잘 답하는지를 모델이 채점해 다시 정렬합니다. 그리고 증거가 들어갈 때까지 꼬리가 잘립니다. Google도 1차 자료의 언어로 같은 모양을 설명합니다. 그라운딩은 “핵심 검색 순위 시스템에 의존해” 페이지를 가져오고, 그 뒤 “우리 시스템은 가져온 페이지의 구체적인 정보를 검토해 더 신뢰할 수 있고 도움이 되는 응답을 생성합니다”.9 그 검토가 4단계입니다.
링크 그래프를 채점하는 공식이 아니라 모델이 구절을 읽는다는 것은 닫힌 시스템에 대한 추측이 아닙니다. 그것은 공개된 기법입니다. EMNLP 2023 연구는 적절히 지시받은 언어 모델이 재순위 에이전트로서 “널리 쓰이는 IR 벤치마크에서 최신 지도 학습 방법과 대등하거나 오히려 더 나은 결과를 낼 수 있다”고 밝혔습니다.10 재순위화 장치는 독자이고, 읽는 것은 청크입니다.
사람들이 과소평가하는 것은 절단입니다. 위쪽에서 만들어진 후보는 수백에서 수천 개이고, 작성 단계에 도달하는 것은 한 줌입니다. 2026년 4월에 공개된 602개 프롬프트 학술 표본에서 완성된 답변에 달린 인용 수의 평균은 ChatGPT가 6.88개, Google의 AI 표면이 12.06개, Perplexity가 16.35개였습니다.3 후보 풀의 거의 전부가 여기서 버려졌고, 버려진 것은 아래쪽에서 글을 더 잘 써도 되살릴 수 없습니다. 이 단계가 전체 파이프라인 어디에 있는지는 AI 검색의 작동 방식이 보여 줍니다.