哪些 prompt 來源值得拿來搭建面板?
有五個地方能產出真實買家說過的句子。它們品質不等,失效的方向也各不相同,而面板怎麼組配,決定了你的能見度數字究竟能誠實地代表什麼。
本頁內容
真實的 prompt 來自五個地方,這裡按訊號品質排序:錄音的通話與客服工單、你自己那些問句型的搜尋查詢、頭部詞的扇出擴展、你品類裡的社群討論串,以及流失與輸單原因。給來源排序看三條屬性:可追證,也就是有真人問過它的記錄;可歸屬,知道是誰、在什麼時候問的;以及獨立性,措辭不來自你自己的行銷用語。優先收集問句型的那些不是文體偏好:在 2026 年一項涵蓋 55,393 條熱門查詢、歷時 40 天的測量裡,問句式查詢有 64.7% 讓 Google 產生了 AI Overview,其餘查詢只有 9.5%。6
關鍵要點- 可追證是你製造不出來的屬性,所以通話與客服工單排在那三個沒有任何人留下記錄的來源前面。
- 要刻意組配:一份 40 條的面板裡,通話與工單 12 條、你自己的查詢 8 條、扇出 10 條、社群討論串 6 條、輸單 4 條,任何來源都不超過 40%。
- 沒有人公布一條 prompt 被問過多少次,所以面板是你自己宣告的抽樣框,而不是某個已知母體裡的一份佔比。
- 要按引擎分開報告:Google 自然結果、AI Overviews 與 Gemini 之間,URL 層級的重合只有 0.11 到 0.18 的 Jaccard,把五個引擎平均掉就會抹掉差異。2
是什麼讓一個 prompt 來源優於另一個?
三條屬性,一個來源占得越多就越好:可追證、可歸屬,以及與你自己詞彙的獨立性。
可追證
有真人留下了問過這句話的記錄。錄音的通話完全具備這一點;你靠展開頭部詞寫出來的子問題則完全不具備,而這道落差是 prompt 調研裡最大的品質差異。
可歸屬
你知道是誰問的、什麼時候問的。這讓你能說出這個問題來自上一季你這一類客戶,而不是網路上某個人在某個時候,也正是它讓面板日後修剪得動。
獨立性
措辭不是來自你。用你自家功能用語寫出來的問題,測的是引擎會不會複誦你的行銷文案,而那正是唯一一種會產出一個不斷上升、卻毫無資訊量的數字的失效方式。
這五個來源依序分別是什麼?
按訊號品質由高到低排列,其中前兩個的價值超過後三個加起來。
| 來源 | 它能佐證什麼 | 典型產出量 | 它怎樣失效 |
|---|---|---|---|
| 通話與客服工單 | 某個具名的人在某個日期用自己的話問過 | 每通通話 1–3 個不同的問題;首週的工單能給得更多 | 只涵蓋聯絡過你的人;沉默的大多數看不見 |
| 你自己的問句型查詢 | 有人打了這句話並抵達你的頁面 | 數十條,而且已經歸屬到具體 URL | 只有 Google 的需求,而且稀有查詢的長尾被扣住 |
| 扇出擴展 | 沒有人,這些是重建出來的子問題 | 每個頭部詞 4–6 條,原則上沒有上限 | 看似合理卻沒人問的問題;這種失效看不見 |
| 社群討論串 | 某個買家寫在公開場合,寫給其他買家 | 量大,而且偏向已經有排名的內容 | 倖存者偏差,以及被測量過的最不穩定的引用序列 |
| 流失與輸單原因 | 某個買家在離開時說出來的話 | 很少,常常不到十條,而且條條都是高風險 | 事後合理化的理由;樣本小,後果重 |
排序的第一依據是可追證,第二依據是獨立性,這也是扇出雖然最好上手卻排在第三的原因。本頁只停在排序,每個來源各有自己的文章:通話與客服工單講逐字紀錄的紀律,問句型查詢講 Search Console 的篩選方式與被截斷的長尾,扇出擴展講那條讓擴展不會變成臆造的規則,社群討論串講它們為什麼有雙重用處,流失與輸單 prompt講那些你永遠不會聽說的輸單。
有一條屬性橫跨全部五個來源,而且很容易被忽略:面板是按引擎存在的,不是全域的。SIGIR 2026 一項 11,500 條查詢的研究,測得 Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 相似度為 0.11 到 0.18;另一項對 1,008 條生成式搜尋回答的審計則發現,355 個網域中只有 26% 同時被 Bing Chat 與 Perplexity 引用。23 2026 年那篇批判性綜述用一句話說完:「能見度是按引擎和介面索引的。」4
每一條 prompt 究竟被問過多少次?
沒有人公布。沒有任何生成式引擎會報告有多少人問過某個問題,所以 prompt 面板沒辦法像關鍵字清單那樣按需求加權。
這種缺失是結構性的,不是暫時的。2026 年那篇批判性綜述描述了內容產出者實際所處的位置:他們通常看不到被檢索出來的集合、重排分數,或生成器的內部狀態,這使得它成為「資訊不完全下的黑箱優化問題」。4 兩項規模最大的獨立測量都必須自己建構查詢樣本:一項用了 11,500 條查詢的公開基準集,另一項在 40 天裡蒐集了 55,393 條熱門查詢。26
你送出的那條 prompt,甚至不是真正被拿去檢索的單位。Google 的文件寫明 AI Overviews 與 AI Mode 會使用一種「查詢扇出」技術,「跨子主題與資料來源發出多條相關搜尋」。7 一條面板條目會變成好幾條你看不見的搜尋,所以就算給你那個句子掛上一個量級數字,它描述的也不是真正跑起來的那些查詢。
改用後果來替 prompt 排序,也就是引擎把某一條答壞時你要付出什麼代價,並且把抽樣框和數字一起公布。綜述對已公布的比率也講了同一件事:兩個 AI Overview 觸發率數字,64.7% 與 51.5%,並不互相矛盾,因為查詢分布不同,而且「一個沒有描述樣本的比率,可遷移性有限」。4 沒有提示詞搜尋量那一篇把這套論證完整拆開講了一遍。
每個來源該貢獻多少條 prompt?
一份 40 條 prompt 的面板,站得住腳的起始組配是:通話與工單 12 條、你自己的問句型查詢 8 條、扇出擴展 10 條、社群討論串 6 條、流失與輸單 4 條。這些數字是一種約定,不是一項測量,背後的推理才是值得留下的部分:兩個可追證的來源占掉一半,因為可追證製造不出來;扇出拿到四分之一,因為只有它能觸及還沒有人問過你的問題;最後兩項配額小,是因為社群討論串會過度代表已經有排名的內容,而輸單原因確實稀少。
有兩條上限比確切的配比更重要。任何單一來源都不超過面板的約 40%,因為過了那個點,面板測的就是那個來源的偏差,而不是你的買家。一份 80% 來自扇出的面板測的是你自己的想像力,一份 80% 來自社群討論串的面板追蹤的是某一個引擎對論壇的檢索策略。每一個 prompt 類別都要有代表,按 prompt 調研這一單元列出的分類法來,因為一份缺了異議類別的面板看起來會很穩,而那些讓你輸掉案子的問題從頭到尾沒被測過。
組配還必須經得起被更動。當你增補或汰除 prompt 時,把面板版本號往上加,並讓舊的組配與新的並行再跑一個週期,這樣那道斷層就是一個你說得出口的數字,而不是序列上一次看不見的汙染。
為什麼這是一項有定量產出的定性研究?
因為蒐集這一步是定性抽樣,只有測量這一步是定量的,這就把最終數字的效力放在抽樣框上,而不是樣本數上。你在一個無法窮舉的母體裡,用你自己挑的來源蒐集話語,然後在蒐集到的東西上量一個比例。所以,一項好的定性研究的每一條屬性都適用:寫清楚你怎麼抽樣、說明誰被排除在外、把抽樣框和估計值一起報出來。一份沒有寫明抽樣框的 prompt 面板,就是一份沒有方法章節的問卷調查。
測量那一半有自己的紀律,2026 年那篇批判性綜述給 GEO 研究列的最低清單就是這麼寫的:記錄產品、模式、模型、日期、地區設定、帳號,以及搜尋有沒有開啟;在多個時間窗內做間隔很近的重複執行;把檢索、重排、脈絡與生成分開;並且把零結果保留在分母裡。4 最後那一條正是團隊會悄悄作弊的地方,因為把什麼都沒發生的那些執行刪掉,就能在每一個單獨數字技術上都為真的前提下,把面板變成一份精華集錦。2026 年一篇統計學論文補上了它為什麼重要:引用分布服從冪律,而網域之間許多表面上的差異,都落在量測過程的噪聲基底之內。5
把由此得出的結論寫進你自己的報告裡。同一個品類裡的兩個團隊,各自誠實地抽樣,會建出不同的面板、公布不同的能見度數字,而且兩邊都不算錯。你的面板測的是你買家的問題,不是這個品類的問題,這既是把你自己的面板公開出來的好理由,也是不要相信全市場排行榜的更好理由。
一條做好的面板條目長什麼樣?
七個欄位。前兩個正是團隊會跳過、事後又希望自己有留的:逐字原句,以及它從哪裡來。
逐字原句與正規化文本
兩個都留。逐字原句是證據,正規化過的那條才是你實際拿去跑的。只存正規化版本,會讓你日後再也無法檢查自己有沒有改掉意思。
來源、日期與說話者類型
五個來源裡的哪一個、什麼時候蒐集的、說這句話的是哪一類買家。正是這些讓你能汰除一個措辭已經過時的問題。
類別、面板版本與變體
每條 prompt 一個類別標籤、它進入面板時的版本,以及你併進來的那些近似表述及其計數。變體清單會告訴你哪一種說法比較常見。
去重是面板悄悄弄丟抽樣框的地方,所以在開始合併之前,先把規則寫明白。當一位稱職的業務會對兩條給出同一個回答時,它們就是同一條 prompt;只要回答有任何差別,它們就是不同的 prompt。按最常見的表述合併,保留帶計數的變體,而且絕不跨類別合併:「安全嗎?」和「我要怎麼安全地把它裝起來?」看起來相鄰,承擔的風險卻不同。
本頁上的排序是推理出來的,不是測出來的。沒有人拿不同來源建出的面板,去比對買家真正會問引擎什麼的基準真值,因為那個基準真值正是上一節說的、沒有人公布的東西。這三條標準站得住腳,排序也由它們推得,但一個銷售通話並不具代表性的團隊,完全有理由把前兩名對調。那些組配數字是一種帶著推理的約定,不是一項發現;請用你自己漏斗裡的證據去調整。
本頁上的每一個來源,要嘛就在你自己公司裡,要嘛免費可讀,而整套方法就是一張七欄的表格,加上一週讀通話逐字稿的時間。請先做這件事:手工建起來的面板,才是讓日後任何測量有意義的東西。Bavior 沒辦法替你建它。它拿不到你的通話錄音、你的工單或你的輸單筆記,它不替你挑 prompt,也沒辦法告訴你你的抽樣框有沒有代表性。它做的是重複的那部分:一份固定的面板按排程跨五個引擎執行,每一個被引用的 URL 都記錄下來,於是你看得到缺口是在你的頁面上,還是在別人的討論串裡;當被引用的來源是一則活著的討論串時,它會在你掌控的帳號上起草一則回覆,任何內容送出之前都由你審核。免費 AI 能見度檢測和免費 GEO 健檢不需要付費方案;付費方案按月計費 $99/月起,按年計費折合 $79.17/月(截至 2026 年 8 月 29 日)。
- Zhang、He 與 Yao,《From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms》,2026 年 4 月,arXiv:2604.25707;602 條受控 prompt,21,143 條有效的搜尋層引用;官方來源從 ChatGPT 的 34.22% 到 Google 的 46.35%(預印本,僅描述性統計):arxiv.org/abs/2604.25707
- Grossman 等,SIGIR 2026;11,500 條使用者查詢的公開基準集;Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 為 0.11–0.18;51.5% 的查詢出現 AI Overviews:arxiv.org/abs/2604.27790
- Li 與 Sinnamon,2024;對 1,008 條生成式搜尋回答的審計;辨識出 355 個不同網域,其中 26% 同時被 Bing Chat 與 Perplexity 引用(學術研究,見出處 4 綜述中的轉述)
- 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(GEO 研究的最低清單;資訊不完全下的黑箱優化;能見度按引擎與介面索引):arxiv.org/abs/2607.14035
- Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(預印本):arxiv.org/abs/2603.08924
- Xu、Iqbal 與 Montgomery,2026;55,393 條熱門查詢,蒐集於 2026 年 3 月 13 日至 4 月 21 日;AI Overview 整體觸發率 13.7%,問句型查詢 64.7%,非問句型查詢 9.5%(預印本):arxiv.org/abs/2605.14021
- Google Search Central,《AI features and your website》,更新於 2025 年 12 月 10 日(「查詢扇出」技術,跨子主題與資料來源發出多條相關搜尋;第一方文件):developers.google.com/search/docs/appearance/ai-features
- 社群討論串引用研究,2025 年 11 月:217,000 條 prompt 裡出現 248,000 個不重複的被引用 Reddit URL;被引用的討論串平均約 900 天前發布、約 80 個字,其中 80% 的讚數不到 20。廠商發布;按本課程的出處規則,只描述不連結。
- 最常被引用頁面研究,2025 年 10 月:某助手在 2025 年 9 月引用最多的前 1,000 個頁面裡,28.3% 完全沒有自然關鍵字能見度。廠商發布;按本課程的出處規則,只描述不連結。
你想知道的,都在這裡。
我可以只用一個來源建面板嗎?
可以,而那樣一來,面板測的就是那個來源的偏差,而不是你買家的問題。每個來源失效的方向都不同:通話只觸及聯絡過你的人;Search Console 只看得見 Google 的需求,而且稀有查詢的長尾被扣住;扇出擴展什麼都佐證不了,因為是你自己寫的;社群討論串會過度代表本來就有排名的內容;而輸單原因既稀少又是事後合理化的。把任何單一來源壓在面板的約 40% 以下,就是在阻止其中某一種失效方式變成整個測量。
我怎麼知道 prompt 已經蒐集夠了?
當新的蒐集不再產出新的、不同的問題時,就停止增加來源;當信賴區間窄到可以據此行動時,就停止擴大面板。這是兩條各自獨立的停止規則,而且兩條都重要:前者是定性研究的飽和檢驗,你可以把每一批通話新增的不同問題數畫成圖來看;後者是算術,40 條 prompt 在每個引擎上各跑 5 次,在 50% 的出現率附近大約是正負 7 個百分點的區間。一份面板可以在統計上足夠,卻仍然漏掉你買家真正會問的問題,所以飽和要排在前面。
用 AI 模型來生成 prompt 點子算作弊嗎?
用模型去擴展一份你已經用真實通話打底的清單是合理的;用它從零生成清單則不合理,而且這種失效是系統性的,不是隨機的。你要語言模型給出範例問題時,它是在對自己的訓練分布抽樣,而那個分布被你這個品類已經被公開書寫的方式主導,所以它會回傳那些被充分覆蓋的問題的中位表述,並且恰恰少產出那些還沒有人寫過的問題,而後者正是你隱形的地方。判準沒有變:如果你指不出一個說過類似句子的真人,這一條就該歸進扇出那一桶,並標註為重建而來。
同一份面板要在每個引擎上都跑嗎?
同一批 prompt 在每個引擎上都跑,結果分開報告,絕不合併。合併會摧毀資訊,這一點有直接證據:SIGIR 2026 一項 11,500 條查詢的研究測得 Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 相似度為 0.11 到 0.18;另一項 1,008 條回答的審計發現,Bing Chat 與 Perplexity 之間只有 26% 的網域是共有的。一個混在一起的「AI 能見度」百分比,是在把五個檢索行為各異的系統平均掉,而它的變動你無法歸因到自己做過的任何事情上。
負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。
發現數字有誤?告訴我們,我們會重新查證:support@bavior.com