首頁/學習 GEO/六類 prompt
prompt 調研 · 分類法

哪六類 prompt 應該分開追蹤?

一個只報單一綜合數字的面板,等於把六個群體平均掉:它們的基準率不同,「贏」的定義不同,修復動作所在的位置也不同。構成一變,這個數字就跟著變。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

值得拆開的 prompt 有六類:品類定義、候選清單、對比、適配、異議、操作指南。它們在三件事上不同:你被點名的頻率、什麼才算贏,以及引擎會檢索哪些來源。所以一個綜合出現率的變動,往往來自面板類別構成的改變,而不是你的能見度真的動了。對比類和異議類的風險最高,因為在這兩類上,一次掛著錯誤描述的引用比根本沒被提到更糟:Tow 中心對八個引擎、1,600 條查詢的審計發現,超過 60% 返回了錯誤答案。3

關鍵要點
  • 品類定義類和操作指南類可以由你自己的頁面回答,候選清單類和異議類不行,對比類和適配類介於兩者之間:正是這個劃分決定了哪個團隊動得了手。
  • 「贏」隨類別而不同:候選清單類是出現在名單的任何位置,對比類是被準確描述,異議類是得到誠實的回答。單一的出現標記,只對六類中的兩類問對了問題。
  • 往一個 40 條的面板裡加五條容易贏的品類定義類 prompt,其他什麼都不動,綜合數字就從 37.4% 變成 41.0%,所以類別構成必須凍結,並且印在數字旁邊。
構成效應

為什麼把六類平均起來會摧毀訊號?

取平均會摧毀訊號,因為這幾類的基準率差距很大,於是綜合數字既是你能見度的屬性,也同樣是面板構成的屬性。拿一個 40 條的面板來算:12 條品類定義類,你被點名的比例是 70%;10 條候選清單類,15%;8 條對比類,30%;4 條適配類,25%;3 條異議類,10%;3 條操作指南類,45%。綜合數字是 37.4%。再加五條你本來就贏的品類定義類 prompt,其他什麼都不動,同一個面板報出來就是 41.0%:這 3.6 個百分點的上升,是一個編輯決定製造出來的。

第二個理由是,「贏」在每一類裡並不是同一件事。在候選清單類 prompt 上,出現在名單的任何位置就是全部結果;在對比類 prompt 上,如果你名字旁邊那句話是錯的,出現本身一文不值;在品類定義類 prompt 上,贏是被歸進正確的品類,而不是相鄰的那一個。單一的出現率,對兩類問對了問題,對另外四類問錯了問題。

第三個理由是,這幾類是從不同的來源群體裡被回答的,因此它們回應的是不同的工作:品類定義類和操作指南類的答案倚賴一家公司寫得出來的頁面,候選清單類和異議類的答案倚賴它寫不出來的頁面。一個數字只會告訴你有東西動了,卻不會告訴你哪個團隊本來動得了它。prompt 調研階段負責把面板建起來,本文講的是面板每一行上貼的那個標籤。

分類法

這六類分別是什麼,各自什麼算贏?

六類各自帶著一套「贏」的定義:被點到名、出現在名單裡、被準確描述、對上你真實的適用邊界、被誠實回答,以及你的方法被當作那個方法引用。

類別買家會敲進去什麼什麼算贏修復動作通常在哪裡
品類定義「X 是什麼?」 · 「做 Y 的是什麼工具?」被點到名,並歸入正確的品類你自己的頁面與百科類條目
候選清單「做 Y 最好的 X」 · 「Z 的頂尖工具」出現在名單裡,位置不限你控制不了的第三方合集
對比「X 對比 Y」 · 「X 的替代品」被準確描述,而不只是出現各半:你的頁面加上第三方文章
適配「X 適合五人團隊嗎?」你真實的適用邊界被正確陳述你自己的頁面,前提是邊界有寫下來
異議「X 安全嗎?」 · 「用 X 會被封嗎?」誠實的答案,且出處來自可信的一方論壇與社群討論串
操作指南「我該怎麼做 Z?」你的方法被當作那個方法引用你自己的文件與教學

六類裡有兩類,特別有機會從你自己的網域答得上來。目前唯一發表過的 AI 引用學術分類研究,用 602 條受控 prompt 在三個助手上產生了 21,143 條搜尋層引用,發現官方來源在它測過的每個平台上都是最大的一類,分別佔引用的 34.22%、46.35% 和 44.07%。8 這就是品類定義類或操作指南類 prompt 的上限所在:這些正是你自己的文件有可能回答的問題,也是官方來源佔比最高的地方。

每條 prompt 只打上一個類別標籤,橫跨兩類的問題要拆開:「對小團隊來說 X 和 Y 哪個更安全」同時是對比、異議和適配,回答它們的來源群體不一樣,一條合併的 prompt 會污染兩個類別的比率。同一份研究也量到,一條答案究竟掛了多少來源,各引擎之間差距很大:三個助手每則回答的平均引用數分別是 6.88、12.06 和 16.35。8 一條候選清單類 prompt 在某個引擎上的位置數是另一個引擎的兩倍以上,所以類別比率一律按引擎分開回報,絕不合併。

被錯誤呈現

為什麼對比類和異議類的風險最高?

因為在這兩類上,一次掛著錯誤描述的引用,代價比根本沒有引用還大,而錯誤描述是常態。Tow 中心在 2025 年 3 月對八個引擎跑了 1,600 條查詢,發現超過 60% 返回了錯誤答案;最差的引擎有 94% 的時候是錯的,在它的 200 條 prompt 中產生了 154 條指向錯誤頁面的引用,就連最好的那個也有 37% 是錯的。3 它更早一次針對 200 條引文的測試發現,153 則回答部分或完全錯誤,而表達不確定的只有 7 次。2

有兩項測量把同一個問題放到了句子這一層。較早的研究發現,生成式搜尋答案中只有 51.5% 的句子被掛在它們上面的引用完全支撐,4 而 2026 年一項研究把 98,020 條原子主張中約 11% 歸類為支撐不足。5 一個把你的品類說對、卻把你的價格級別說錯的引擎,產出的仍然是一則會丟單的答案,而出現標記會把它記成一次贏。

由此有三條便宜的操作後果。在對比類和異議類 prompt 上,記錄完整的答案正文,而不只是出現標記:你需要讀的是那句話,不是那個布林值。這兩類要用更高的執行次數來跑,因為你是從同一批執行裡估兩個比率,而第二個比率,也就是描述對不對,需要人工抽讀樣本。還有,在異議類 prompt 上,修復動作通常落在你的網域之外,落在那條被檢索到的誠實答案所在的社群討論串裡,那是站外 GEO 階段的地盤。

那條平線

為什麼候選清單類幾乎不回應站內的工作?

因為在「最好的 X」這種問題上,引擎引用的大多是別人的頁面,這把槓桿放到了你的網域和發版節奏之外。兩份廠商資料指向同一個方向。其中一份檢視了某個主流助手在 2025 年 9 月引用最多的 1,000 個頁面,報告說其中只有大約三分之一落在企業有辦法參與競爭的類別裡。11 另一份在 2026 年 3 月到 6 月間追蹤了四個品牌的 7,683 個頁面與 47,097 條引用,得出一個品牌自己的頁面大約只佔關於它的引用的 2%。12 兩份都沒有經過同儕審查,那個四品牌的數字只是舉例,不是常數。

把它和上面那份學術分類研究擺在一起,那裡官方來源佔引用的 34–46%,兩者看起來互相矛盾。其實不矛盾:官方來源佔比是 prompt 類別的屬性,不是整個網路的屬性。一個定義性問題會拉來官方頁面,一個「最好的某某工具」問題會拉來合集。目前沒有人發表過按 prompt 類別拆分的官方來源佔比,所以請把這個落差當成「必須把類別拆開」的論據,而不是一個已經定案的數字。

由此得到的是一個診斷,而不是一個手法。如果你的面板大多是候選清單類 prompt,而曲線是平的,那條平線告訴你的是答案從哪裡取來源,而不是你的內容不好:自己發一份合集,是在少數那一塊份額裡競爭;讓別人的合集準確地寫上你,是在多數那一塊裡競爭。

噪聲基底

為什麼你什麼都沒變,某一類的比率卻動了?

因為一個類別比率所依賴的三件事裡,有兩件屬於引擎而不屬於你。第一件是究竟會不會出現 AI 答案:一項涵蓋 55,393 條查詢的 Google AI Overviews 研究測到整體觸發率是 13.7%,在問句形式的查詢上升到 64.7%。5 這幾類的措辭並不一樣:品類定義類、適配類和異議類 prompt 天生是問句,候選清單類 prompt 通常是名詞短語。一個類別看起來平,可能只是因為它的 prompt 很少觸發答案,所以日誌要把有沒有出現答案和答案裡有沒有你分開記錄。

第二件是,一個類別背後的來源群體既不是那份排序清單,也不是一個穩定的集合。Google 的文件寫明,AI Overviews 與 AI Mode 可能把一條 prompt 扇出成好幾條涵蓋子話題的搜尋,10 而同一份審計發現,被引用的網域裡有將近 30% 從未出現在第一頁結果中。5 一份 11,500 條查詢的基準測試回報,Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 相似度是 0.11 到 0.18,而重複執行之間的一致性更低。6 跨三個引擎的重複採樣則發現,網域之間許多看起來的差異其實落在噪聲基底之內。9 在把一次類別變動算到你自己的工作頭上之前,先拿它對照那條基底。

操作規則

怎麼打標籤、分類回報,又不把面板灌水?

在把一條 prompt 加進來的時候就給它打上剛好一個類別標籤,並在這條 prompt 的整個生命週期裡凍結這個標籤,然後按引擎、按類別公布比率,旁邊附上樣本數。凍結很要緊:在季度中途重新打標籤,會同時悄悄改掉兩個類別的分母,而兩邊隨之出現的變動都是假象,你會花一週時間去解釋它。

分類別回報要花掉樣本量。十條 prompt 各跑五次是 50 次觀測,在 50% 的比率下對應約 ±14 個百分點的 95% 區間,寬到讓 30% 和 44% 兩個類別比率其實是同一個測量結果。同一批執行在面板層級得到的數字要緊實得多,所以面板留作頭條指標,類別拆分留作診斷。規模的算術在面板規模那一篇裡。

另外三條規則能讓這個標籤保持誠實。在兩個週期之間,把各類別的條數大致維持不變,並記進面板版本裡,好讓讀者看見數字背後的構成。絕不要在一個你同時宣稱有改善的週期裡重新平衡構成,因為本頁開頭那套算術會替你生出一個改善。還有,把類別留在日誌裡,而不是事後從 prompt 文字反推:這是一次判斷,由當初知道這條 prompt 為什麼被加進來的人做出的。

本文的誠實邊界

這個六分法是一個可用的約定,不是一件經過驗證的量表。沒有任何已發表的研究以這種方式把 AI 答案的 prompt 分層,因此也沒有外部估計能說明各類別的基準率究竟差多少。上面 37.4% 到 41.0% 那個例子是用合理輸入算出來的,不是測量結果。兩個都很講理的團隊,可能一個分成五類,一個分成八類。不可省略的是:必須存在某種拆分,而且你公布的任何數字都要帶著它的類別構成,因為一個把構成藏起來的綜合比率,可以靠改面板而不是靠贏得什麼來被推高。

產品在哪裡派得上用場,在哪裡派不上

分類本身是免費的:在你的 prompt 表裡加一欄類別,每一行打一次標籤,然後按引擎回報六個比率而不是一個。沒有軟體能替你打這個標籤,因為一條 prompt 屬於哪一類,取決於它當初為什麼被加進來,而這件事只存在於那個親耳聽到買家這麼問的人腦子裡。Bavior 按排程把一組固定的 prompt 打到五個引擎上,並記錄每則答案引用了哪些來源,這讓每個類別的來源群體變成看得見的,而不是猜出來的;當被引用的來源是一條活躍的討論串時,它會用你掌控的帳號起草回覆,發出之前由你審核。它不替你決定分類法,不會讀你的銷售通話,也無法告訴你描述你產品的那句話準不準:那需要人工抽樣閱讀。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案就能跑;付費方案按月支付每月 $99 起,按年支付每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 29 日
  1. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(綜述預印本):arxiv.org/abs/2607.14035
  2. 哥倫比亞大學 Tow 數位新聞中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月;來自 20 家出版機構的 200 條引文,153 則回答部分或完全錯誤:cjr.org
  3. Jaźwińska 與 Chandrasekar,《AI Search Has a Citation Problem》,Tow 中心,2025 年 3 月 6 日;八個引擎、1,600 條查詢,超過 60% 錯誤:cjr.org
  4. Liu 等,2023;生成式搜尋答案中只有 51.5% 的句子被其所掛引用完全支撐(見出處 1 的綜述轉述)
  5. Xu、Iqbal 與 Montgomery,2026(預印本);55,393 條趨勢查詢,2026 年 3 月 13 日至 4 月 21 日;AI Overviews 整體觸發率 13.7%,問句形式查詢 64.7%;98,020 條原子主張中約 11% 支撐不足:arxiv.org/abs/2605.14021
  6. Grossman 等,SIGIR 2026;11,500 條查詢的代表性樣本;Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 為 0.11–0.18:arxiv.org/abs/2604.27790
  7. Kirsten 等,Findings of ACL 2026;把 Google AI Overviews 與自然搜尋及五個生成式系統對照的審計:aclanthology.org/2026.findings-acl.526
  8. Zhang、He 與 Yao,《From Citation Selection to Citation Absorption》,arXiv:2604.25707(預印本,描述性);602 條受控 prompt 與 21,143 條搜尋層引用:arxiv.org/abs/2604.25707
  9. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(預印本):arxiv.org/abs/2603.08924
  10. Google Search Central,《AI features and your website》,更新於 2025 年 12 月 10 日(查詢扇出、資格條件;第一方):developers.google.com/search/docs/appearance/ai-features
  11. 某廠商研究:某個主流助手在 2025 年 9 月引用最多的 1,000 個頁面,其中約三分之一落在企業有辦法參與競爭的類別裡。廠商發布,不外連。
  12. 某廠商研究:7,683 個頁面與 47,097 條引用,2026 年 3 月至 6 月,涵蓋四個品牌;一個品牌自己的頁面大約只佔關於它的引用的 2%。廠商發布,不外連。
常見問題

你想知道的,都在這裡。

如果我同時公布分類別拆分,還可以回報一個綜合的 AI 能見度數字嗎?

兩個一起公布沒有問題,前提是那個綜合數字帶著它的類別構成,以及產出它的面板版本。真正的失效模式不是平均本身,而是一個構成在兩個週期之間變過的平均:往一個四十條的面板裡加五條容易贏的品類定義類 prompt,就能把綜合比率抬高好幾個百分點,而你的能見度一點都沒變。如果構成被凍結並且印出來,這個綜合值是一份正當的摘要;如果構成可以隨意移動,它就是一個披著指標外衣的編輯決定。

小團隊應該從哪一類開始?

從異議類和對比類開始,因為這兩類一旦答錯就是丟一筆生意,而且你最不可能從別的管道知道。「X 安全嗎」或「X 和 Y 比起來如何」被答錯,會在買家聯絡你之前就把他勸退,而你的分析後台不會記下任何東西。品類定義類和操作指南類是你自己的頁面推得動的,所以適合排第二。候選清單類對小團隊來說放最後,不是因為它不重要,而是因為那份工作在站外,而且很慢。

每一類需要多少條 prompt?

十條 prompt 各跑五次是實務上的下限,在 50% 的比率下換來約 ±14 個百分點的 95% 區間,足以看出類別層級的大幅變動,不足以看出小幅的。十二條跑十次可以收到約 ±9。低於十條時,一個類別比率描述的是那幾條特定的 prompt,而不是那個類別。同一批執行在面板層級的數字要緊實得多,所以面板留作頭條指標,類別拆分留作診斷,而不是 KPI。

一條同時屬於兩個類別的 prompt 該怎麼辦?

把它拆成兩條,每類一條,並且各自照買家單獨問出口的方式來寫。像「對小團隊來說 X 和 Y 哪個更安全」這樣的問題,同時是對比、異議和適配,而引擎為這三種意圖檢索的來源並不一樣,所以一條合併的 prompt 會產生一個你無法歸給任何類別的答案,還會污染其中兩個類別的比率。拆開的代價是面板裡多一行、每個週期多跑一次,這是整套方法裡最便宜的一個修正。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

六個類別,六個比率。
一個數字什麼都告訴不了你。

免費試用