C-SEO Bench 是一個用來檢驗「為了討好生成式引擎而改寫文件到底有沒有用」的基準,而它的答案基本上是沒有。它發表於 NeurIPS 2025 資料集與基準賽道,涵蓋問答與商品推薦兩項任務、六個領域,程式碼與資料公開。1 它也是GEO 與 SEO 這個階段整體圍繞著建立起來的那個結果。
摘要毫不含糊地陳述了這個結果:「當前多數 C-SEO 方法不僅在很大程度上無效,而且經常對文件排名產生負面影響,這與預期相反。相反地,傳統 SEO 策略,也就是那些旨在提升來源在 LLM 上下文中排序的策略,顯著更有效。」論文自己的總結是:把目標文件放到上下文視窗的第一位,「在 LLM 回答中帶來的引用排名增益,遠大於任何 C-SEO 方法」。
有兩個細節,讓這件事比一次普通的單一實驗更難被打發掉。第一是廣度。論文報告了 54 個「方法與領域」案例,多到零星的勝出也會顯形,而它的發現是「在 54 個案例中,我們只找出三處排名提升具有統計顯著性」,在問答任務上則沒有任何方法有效。第二是失敗的方向。好幾種變換不只是沒幫上忙,而是拉低了文件的排序:加入統計數字在被測量的 24 種設定裡,有 19 種讓排名下降。1 一個中性的手法只是便宜;一個負向的手法,則是你為讀錯一篇部落格文章而繳的稅。