首頁/學習 GEO/反模式
prompt 調研 · 反模式

為什麼你的功能清單是錯誤的 prompt 面板來源?

因為用你自己詞彙寫出的面板,測的是引擎會不會複述你的行銷文案,而它們通常會。它產出的數字會隨著你發得更多而上漲,而且可能在你真實能見度下滑的同一個季度裡上漲。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

一條用你自身定位話術寫出的 prompt,就是一條自指 prompt:它的措辭大多只出現在你擁有的頁面上,因此幾乎不存在競爭語料,檢索回傳你的頁面,答案點你的名。這樣建起來的面板,會報出一個接近區間上沿、而且你每發布一次就往上走的出現率,它測的是你自己的內容庫存,而不是一個陌生人眼中的你。這個領域唯一一份受控基準發現,54 個案例中只有 3 個取得統計顯著的排名提升;而在零售領域,把一個來源移到上下文第一位值 2.77 個排名位次,最佳內容改寫只有 0.36。3

關鍵要點
  • 「自指」指的是措辭來自你的行銷而不是買家:一個你造的詞、一個只有你站點在用的功能名,或一種因為你寫了它才存在的問題表述。
  • 這個比率會自己往上走:官方頁面本來就是被引用最多的類別,持續發布會不斷增加只有你在用的詞彙,而面板是靠添加而不是靠替換來增長的。
  • 兩項機械檢查能了結大多數爭議:拿掉品牌名再跑一遍 prompt,然後把這段措辭原樣搜一下,看回來的是誰的頁面。
  • 把有實證的條目與自指條目當作兩個比率分別回報,絕不合成一個頭條數字;品牌類 prompt 控制在四條左右,並按準確性而不是按是否出現來評分。
機制

用自家定位話術寫出的面板,問題出在哪?

用自家定位話術寫出的面板,問的是只有你自己的頁面能回答的問題,然後把「你自己的頁面回答了它們」這件事,記錄成能見度的證據。那是一個掛著百分比的同義反覆。所謂自指 prompt,就是措辭取自你的產品行銷、而不是取自任何買家說過的話:裡面有一個你造的詞、一個只有你站點在用的功能名,或者一種因為你寫了它才存在的問題表述。這類問題的競爭語料幾乎為空,所以檢索也幾乎無處可去。

它之所以如此可靠地奏效,是有文件依據的,而不是理論推測。Google 表示,其搜尋裡的生成式功能「根植於我們核心搜尋的排序與品質系統」,8 而且一個頁面要有資格出現,「必須已被收錄,且有資格帶著摘要出現在 Google 搜尋裡」。1 因此,是普通的排序在決定哪些頁面成為候選,而你在自己的詞彙上幾乎按定義就排第一。2026 年那篇批判性綜述把查詢與文件的相關性、以及在上下文中的位置,評為決定什麼會被採用的主要因素,置信度為高。2 一條由你自己的詞造出來的 prompt,恰好把這種相關性推到最大,而受益的只有一份文件,正好是你的。

它為什麼會往上漂

這個數字為什麼會自己往上走?

有三種機制會讓一個自指面板隨時間上行,而其中沒有一種是「你的能見度變好了」。

01

官方頁面本來就是被引用最多的類別

在一項 602 條受控 prompt、產出 21,143 條搜尋層引用的研究裡,被它歸為官方的來源是最大的單一類別:在 ChatGPT 上占 34.22%,在 Google 上占 46.35%。引擎很樂意去拿那個官方頁面。

02

發得越多,你自己的措辭覆蓋得越全

每一個新頁面都會帶來只有你在用的詞彙,也就帶來一批只要有人把它寫成 prompt 你就必贏的問題。這個比率跟著你的發布行事曆走,而不是跟著買家找到你的方式走。

03

面板是靠添加而不是替換來增長的

自指 prompt 最好寫,所以面板擴容時被加進來的就是它們。分母的組成在無聲地變化,而頭條數字在沒有任何一條答案改變的情況下上漲。

讓第一種機制從「有幫助」變成「決定性」的,是在受控測試裡位置對其餘一切的壓倒性優勢。2026 年那篇批判性綜述概括了為這個問題而建的唯一一份基準:在兩類任務、六個領域、約 1,900 條查詢與 16,360 份文件上,54 個方法與領域的組合中只有 3 個顯著為正。2 基準本身,也就是 NeurIPS 2025 的 C-SEO Bench,測試了十種方法;在它的零售領域裡,把一個來源移到上下文第一位平均值 2.77 個排名位次,而所測最佳內容改寫只有 0.36。3 把它當作一句關於自指 prompt 的話來讀,結論毫不含糊:在你自己的詞彙上,你本來就占著第一位,所以這條 prompt 測的是一個你丟不掉的槓桿,而不是一個你能撥動的槓桿。

算術

被污染的數字長什麼樣?

一個被污染的面板數字長這樣:頭條出現率從 41% 爬到 45%,然後在真實能見度掉了四分之一的情況下停在 42%。下面用虛構但貼近現實的輸入算給你看,這是示範算術,不是資料。

面板版本真實 prompt自指 prompt頭條出現率
v1,40 條 prompt28 條,20%12 條,90%41%
v2,又加了四條28 條,20%(未變)16 條,90%45%,什麼都沒變好
v3,一個季度之後28 條,15%(下滑)16 條,90%42%,仍高於起點
你本來想要的那個面板40 條,20%沒有20%,而且現實一動它就動

值得多坐一會兒的是 v3 那一行:真實 prompt 的出現率掉了四分之一,頭條數字卻仍然高於起點。這張表裡沒有任何一處需要惡意:每一版都是某個人加進了看起來合理的 prompt,而其中每一個單獨的數字都是對的。污染完全發生在分母的組成上,這也是prompt 從哪裡來那一篇堅持任何單一來源不超過面板約 40%、並堅持組成一變就升版本號的原因。

防線是算術,不是警覺。把有實證的那一半與自指的那一半當作兩個比率分別回報,而不是合成一個數字,這個效應就消失了:一個從不動的切片和一個會動的切片並排看很有資訊量,平均之後則會誤導人。2026 年一篇關於 AI 能見度測量的統計學處理講的是這件事的一般形式,它提醒:引用分布服從冪律,而許多表面上的差異都落在測量過程的噪聲基底之內。4 一個混合出來的頭條數字,會把這兩個問題一次藏起來。

檢驗

怎樣把自指 prompt 和真實 prompt 分開?

對措辭問三個問題,再跑兩項機械檢查,每條 prompt 大約十五秒就能分類完。裡面有你造的詞嗎?一個功能名、一個方法論名、一個你為定位簡報發明的品類標籤。一個從沒聽說過你的買家會敲它嗎?把自己當成買家念出來;如果它只有讀過你首頁的人才看得懂,那就是自指的。你能指出一個說過類似話的真人嗎?這就是給其餘每個來源排序時用的那條實證檢驗,也是能了結爭論的那一條。

兩項機械檢查能抓住判斷力漏掉的東西。拿掉你的品牌名再跑一遍:如果名字不在時這條 prompt 依然能把你檢索出來,說明這個問題真的是關於品類的;如果它塌成一個點了另外五家公司名字的通用回答,那你測的是自己的品牌,而不是自己的主題。把這段措辭原樣搜一下,看回來的是誰的頁面:如果每條結果都是你擁有的頁面,說明不存在競爭語料,這條面板條目只能告訴你自己的站點有沒有被收錄。兩項檢查各花一分鐘,都不需要工具。

檢查解決不了的是那個常見的邊界情形:一個由你帶紅、而買家確實採用了的說法。請把採用與否當成經驗問題,而不是一件讓人得意的事。如果這個說法出自買家之口、出現在你的通話逐字稿裡,它就是有實證的;如果它只活在你的行銷材料和連到你的頁面上,那就還沒有被採用。

補救

一個已經被污染的面板,該怎麼重建?

在你改動任何東西之前,先把面板凍結並給它一個版本號,因為條目一旦在沒有版本號的情況下變化,你就徹底失去了跨季度比較的能力。接著用上面那兩項檢查給每一條條目分類,並把判定結果存進面板本身,讓分類是可審計的,而不是靠記憶。然後按新的拆分方式重述歷史,而不是重述那個混合值:把有實證比率回填到此前每一次執行上,讓自指比率作為第二條序列並排放著,永遠不併入平均。

在有人宣布修正後的數字動了之前,還有一句提醒。跨三個生成式搜尋平台的重複採樣發現,引用分布服從冪律,而許多網域之間表面上的差異都落在測量的噪聲基底之內。4 一個乾淨的面板,仍然需要跑好幾輪,一次變化才算得上變化。

例外

面板裡該不該有品牌類 prompt?

該有,一個小的、固定的、獨立回報的桶,因為品牌類 prompt 回答了一個別的類別都回答不了的問題:當引擎描述你時,描述準確嗎?證據說不要預設它準確。Tow 中心對八個引擎、一千六百條查詢的審計發現,其中超過 60% 返回了錯誤答案;更早那次兩百條引文的測試中,153 條回答部分或完全錯誤,而表達不確定只有 7 次。5 那些研究測的是新聞歸因而不是產品描述,所以請把它們當作該去核查的理由,而不是對你自身錯誤率的估計。

這個桶的規則很嚴,因為它的出現率按構造就沒有資訊量。把它控制在四條左右,按準確性而不是按是否出現來評分,用流失與輸單 prompt那篇裡的三值結果,並且絕不讓它們進入頭條數字。一項針對某助手 2025 年 9 月引用最多的前 1,000 個頁面的廠商分析,把首頁與到達頁定在 23.8%,並發現被引用最多的頁面裡,只有約三分之一落在一家企業能夠實際參與競爭的類別中。6 你自己的頁面很容易被引用;那是關於引擎的一個事實,不是給你的一個分數。

這一切背後的一般原則值得直說,因為它的適用範圍遠不止 prompt 面板:一個由你控制輸入的指標不是測量。當你可以靠多寫幾篇自家文案把一個數字抬上去時,這個數字就已經不再描述外部世界了;而 2026 年那篇批判性綜述裡置信度最低的那一行,提醒了這道缺口能有多大:它把引用分數能預測點擊、轉換或收入評為極低置信度。2

本文的誠實邊界

沒有人測量過真實的 prompt 面板被污染到什麼程度,因為面板是私有的,也不存在關於它們的資料集。這裡論證的機制,是從兩件被測量過的事情推出來的:官方頁面是被引用來源中最大的單一類別,以及相關性與上下文位置主導著什麼會被採用,再加上出現率這個定義本身。那項研究的類別是它自己定義的,而且它提醒自身的分類法含有噪聲值,所以請把 34% 到 46% 讀作一個邊界偏軟的區間。那段示範算術用的是虛構但貼近現實的輸入;其中的 20% 與 90% 都是示意性的,你自己的數字會不一樣。

產品在哪裡派得上用場,在哪裡派不上

這裡的整套防線都是免費的,一個下午就夠:把每條 prompt 標上有實證或自指,把拿不準的那些拿掉品牌名再跑一遍,把兩個切片分別回報,並把品牌桶控制在四條左右。這就是表格裡的一欄加一條規則,而它決定了本階段裡其餘每個數字有沒有意義。Bavior 沒辦法替你做這件事。它不替你寫 prompt,無法知道你的買家實際使用哪些說法,而且你給它什麼面板它就跑什麼面板,包括一個糟糕的面板。它做的是執行:一份固定面板按排程跨五個引擎執行,記錄每一個被引用的 URL,這是事後找出自指條目最快的辦法;當被引用的來源是一則活著的討論串時,它會用你掌控的帳號起草回覆,在任何內容送出之前由你審核。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案按月計費 $99/月起,按年計費折合 $79.17/月(截至 2026 年 8 月 30 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. Google Search Central,《AI features and your website》,更新於 2025 年 12 月 10 日(頁面必須已被收錄且有資格帶摘要顯示;第一方文件):developers.google.com/search/docs/appearance/ai-features
  2. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(相關性與上下文位置為高置信度;引用分數預測點擊、轉換或收入為極低;把 C-SEO Bench 轉述為約 1 900 條查詢與 16 360 份文件):arxiv.org/abs/2607.14035
  3. Puerto、Gubri、Green、Oh & Yun,《C-SEO Bench: Does Conversational SEO Work?》,NeurIPS 2025,arXiv:2506.11097;十種方法,「超過 1.9k 條查詢與 16k 份文件」;54 個案例中 3 個顯著;表 3,GPT-4o-mini,零售:最佳 SEO 2.77 對 0.36:arxiv.org/abs/2506.11097
  4. Sielinski,《Quantifying Uncertainty in AI Visibility》,2026 年 3 月,arXiv:2603.08924(預印本;三個平台上的冪律型引用分布與噪聲基底):arxiv.org/abs/2603.08924
  5. 哥倫比亞大學 Tow 中心:Jaźwińska & Chandrasekar,《AI Search Has a Citation Problem》,2025 年 3 月 6 日,一千六百條查詢,八個引擎,超過 60% 錯誤:cjr.org;以及《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月,兩百條引文,153 條錯誤,七次表達不確定:cjr.org
  6. 最常被引用頁面研究,2025 年 10 月:某助手在當年 9 月引用最多的前 1,000 個頁面;首頁與到達頁占 23.8%,約三分之一落在一家企業能夠實際參與競爭的類別中。廠商發布;按本課程的出處規則,只描述不連結。
  7. Zhang、He & Yao,《From Citation Selection to Citation Absorption》,2026 年 4 月,arXiv:2604.25707;602 條 prompt,21,143 條搜尋層引用;官方來源在 ChatGPT 上 34.22%、Google 上 46.35%、Perplexity 上 44.07%(預印本):arxiv.org/abs/2604.25707
  8. Google Search Central,《Google’s guide to optimizing for generative AI features on Google Search》,更新於 2026 年 7 月 10 日(「根植於我們核心搜尋的排序與品質系統」這句話的出處;第一方文件):developers.google.com/search/docs/fundamentals/ai-optimization-guide
常見問題

你想知道的,都在這裡。

到底什麼樣的 prompt 算自指?

它的措辭來自你的行銷而不是買家,所以能匹配它的頁面只有你自己的頁面。三個標記能抓住其中絕大多數:一個你造的詞、一個只有你站點在用的功能名,或一種因為你寫了它才存在的問題表述。最快的確認方式是機械的:把這段措辭原樣搜一下,看回來的是誰的頁面。如果每一條結果都是你的,這條 prompt 就沒有競爭語料,而測量你在答案裡的出現,只不過確認了你自己的站點已被收錄。

在 prompt 面板裡追蹤自己的品牌名,是不是不對?

不算錯,前提是品牌類 prompt 只占一個獨立的小桶、按準確性而不是按是否出現來評分,而且絕不併入頭條數字。品牌類 prompt 回答的是一個真實問題:引擎描述你時描述得對不對。而 Tow 中心那項覆蓋八個引擎、一千六百條查詢、發現其中超過 60% 返回錯誤答案的審計,已經足以構成去核查的理由。它們無法告訴你的是:一個陌生人能不能找到你。因為在一個含有你自己名字的問題上,你幾乎總是會出現在答案裡。

我們的 AI 能見度分數一直在漲。怎麼判斷它是不是真的?

把面板拆開,分別看兩個比率,大約要一小時,而且能把問題定死。把措辭來自買家的條目算成一個數字,把措辭來自你自身定位話術的條目算成另一個。如果前者持平或在下降,而混合後的頭條數字在上漲,那麼這個變化來自組成而不是能見度:一個你總是能贏的切片,在分母裡的占比變大了。另外還要檢查是不是有 prompt 在沒有升版本號的情況下被加了進來,因為一個靠添加而增長的面板,會自己往上漂。

面板裡可以用我自己的產品詞彙嗎?

在買家確實採用了它的地方可以用,而且要去檢驗採用與否,不要假設。一個由你帶紅、如今在通話逐字稿裡出自買家之口的說法,是有實證的詞彙,和其他任何買家措辭一樣可以進面板。一個只出現在你的行銷材料和連到你的頁面上的說法,就是還沒有被採用,無論你多得意。證據就在你的逐字稿裡,所以檢驗方式和本階段裡管著每個來源的那一條一樣:指出一個說過它的真人。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

一個靠自己多寫幾篇就能拉高的數字,
不是測量。

免費試用