首頁/學習 GEO/面板規模
prompt 調研 · 樣本量

prompt 面板該建多大,每條又該跑幾次?

在答案裡出現,是一次偏差未知的擲硬幣,所以整個問題就是普通的比例算術。把它寫出來之後,它對這個領域慣常的數字彙報方式,說了兩句不太好聽的話。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

每個引擎、每個週期約 40 條 prompt、每條跑 5 次,是能產出一個值得公布的數字的最小面板:200 次觀測,在 50% 出現率下對應約 ±7 個百分點的 95% Wilson 區間。一條 prompt 跑一次的區間是 ±45 個百分點,跑五次約為 ±33,所以彙報單位是面板,永遠不是單條 prompt。這個領域自己的批判性綜述記錄到,在採樣可控的介面上,重複執行會改變 9% 到 28% 的判定,而這正是跑一次所掩蓋的變異。2

關鍵要點
  • 數的是觀測,不是 prompt 條數。一次觀測,就是一條 prompt 在一個引擎上跑一次,所以 n 等於條數乘以執行次數,而且要按每個引擎分開計。
  • 執行次數是便宜的那筆採購,買到每條約五次為止,之後才買 prompt 條數。超過每個引擎、每個週期約 600 次觀測之後,多買到的精度會被引擎自身的漂移抹掉。
  • 本頁每一個區間都是下限,因為同一條 prompt 的多次執行會叢集,而沒有人公布過可用來校正它的相關係數。公布面板出現率時,請把 n、引擎和日期一併附上。
公式

出現率背後的算術是什麼?

出現率是一個樣本比例:每一次執行,要嘛點了你的名,要嘛沒有。每次執行都是一次伯努利抽樣,其機率 p 觀察不到,而且只屬於「某條 prompt、在某個引擎上、在某一週」;你看到的,是點了你名字的那部分執行所佔的比例。本頁所有區間都是 95% Wilson 分數區間,也就是 Brown、Cai 與 DasGupta 建議拿來取代教科書常態近似的那一種。11 在 50% 出現率下,它的半寬是 1.96 除以「(n + 3.84) 的平方根的兩倍」,其中 n 是這個數字背後的觀測次數。

有兩個約定,讓它在你還沒有任何資料之前就能用。取 p = 0.5 來算,因為 p(1−p) 在那裡最大,按最壞情況規劃,意味著你承諾過的區間絕不會比你實際拿到的更窄。另外,數的是觀測而不是 prompt 條數:n 等於條數乘以執行次數,並且按每個引擎分開算。

把它反過來用,就能直接算出面板該多大。要達到半寬 w,你需要 n = 0.96/w² − 3.84 次觀測:±10 個百分點約需 92 次,±7 需 192 次,±5 需 380 次。本頁每一個 n 都是這筆算術的結果,而不是研究發現,所以沒有一個標注到論文;下面的出處,是給「算術在哪裡失效」和「引擎在底下移動了多少」用的。

區間

各個樣本量下,區間有多寬?

下表每一行都是同一個公式在不同 n 上的取值,對應一個引擎、一個週期。

該數字背後的觀測n50% 出現率下的 95% Wilson 區間你可以誠實地說什麼
1 條 prompt 跑 1 次1±45 個百分點什麼都不能說。這是軼事
1 條 prompt 跑 5 次5±33 個百分點關於那條 prompt 本身,什麼都不能說
1 條 prompt 跑 30 次30±17 個百分點只能說單條上的大幅變動
40 條 prompt × 1 次40±15 個百分點一條粗略的初始基線
40 條 prompt × 5 次200±7 個百分點面板出現率,按引擎、按週期
80 條 prompt × 5 次400±5 個百分點面板出現率,區間更緊
60 條 prompt × 10 次600±4 個百分點面板出現率,外加分類別拆分
60 條 prompt × 20 次1,200±2.8 個百分點引擎不會為你穩定到這個精度

前四行請當成對儀表板的警告來讀。「單條 prompt 分數加週環比箭頭」是多數能見度報表的預設輸出,而在跑五次的情況下,那個箭頭是畫在 ±33 個百分點的區間裡:底下什麼都沒變,它也可以指向任何一邊;就算把那一條 prompt 跑上三十次,也還剩 ±17。

最後一行請當成預算天花板來讀。從 600 次觀測翻倍到 1,200 次,只買到 1.2 個百分點的半寬,比這些系統自己在一週與下一週之間的移動幅度還小。這個領域自己的批判性綜述,把逐日的來源重疊放在 Jaccard 0.34 到 0.42 之間,24 小時內的重複執行也是相近水準,並且把結論說得很白:能見度是一個分布,而「點估計不是一個穩定的指標」。2

彙報單位

為什麼彙報單位是面板,而永遠不是單條 prompt?

面板之所以是彙報單位,是因為它是這套設計裡背後觀測數足以撐起一個可用區間的最小對象。單條 prompt 在現實的執行次數下,其區間比任何人想偵測的效應寬上好幾倍,所以單條 prompt 的數字不是一次小的測量,它根本不是測量。該公布的那句話長這樣:在面板的 34% 答案中被點名,±7,基於一個引擎上 40 條 prompt 各跑 5 次,8 月 24 日那一週,面板版本 3。

單條 prompt 依然有它的位置,但那是展品,不是指標。單條 prompt 上的答案正文,是唯一能說出面板出現率為什麼是這個數的東西;每個週期人工讀上一小把,正是抓到錯誤呈現的方式:Tow 中心對八個引擎、1,600 條查詢做的審計發現,這些工具在超過 60% 的查詢上答錯了,而這在出現標記上會被記成一次勝利。7

引擎同樣絕不合併。SIGIR 2026 上一項 11,500 條查詢的研究測得,同一家公司的三個答案介面之間,URL 層級的 Jaccard 相似度只有 0.11 到 0.18,3 而更早一項對 672 條分階段回答的審計發現,355 個獨立網域中只有 26% 被受測的兩個系統同時引用。4 一個混合起來的跨引擎出現率,是在給幾乎不相交的母體取平均,也回答不了這個指標存在的唯一問題:接下來該在哪個引擎上使勁。面板也不是搜尋排名的代理:在 2025 年 9 月那份 4,706 條查詢的 AI Overviews 審計裡,被查閱的網域有 53% 不在自然結果前 10 名,5 而在 2026 年春季一項 55,393 條查詢的研究裡,有 29.8% 的被引用網域不出現在整個第一頁上。6

資源分配

該多買 prompt,還是多買執行次數?

先買執行次數,買到每條約五次為止,接著買 prompt 條數,然後在每個引擎、每個週期約 600 次觀測處停手。在總量固定的前提下,兩種買法得到的區間完全一樣,因為 n 就是條數乘以執行次數,所以問題在於每一筆錢除了區間之外還買到了什麼。執行次數買的是你已經決定要問的那些問題上的精度;prompt 條數買的是你可能選錯了的那些問題上的覆蓋度,後者在早期是比較大的風險,到後期是比較小的。

執行次數排在前面,是因為最開始那幾次異常便宜。把一個 40 條的面板從跑 1 次提到跑 5 次,區間就從 ±15 收到 ±7,代價是多 160 次採集。而在同樣跑 5 次的前提下把 40 條加到 80 條,只從 ±7 收到 ±5,代價是 200 次。超過五次之後曲線就平了,而繼續加 prompt 的理由,會變成去測量你目前完全看不到的意圖,那屬於六類 prompt那一篇。

天花板是引擎定的,不是算術定的。一份涵蓋 230,000 條 prompt、超過 1 億條引用、時間跨度為 2025 年 7 月 14 日至 10 月 12 日的廠商時間序列記錄到,某個大型論壇網域在某個助手上的引用率,在 8 月初到 9 月中之間,從約 60% 的回答掉到約 10%。9 這是廠商發布而非同儕審查的資料,但綜述把「各商業引擎彼此不同,且隨時間變化」評為高置信度。2

把成本說具體:40 條 prompt、跑 5 次、橫跨 5 個引擎,就是一週 1,000 次採集;60 條跑 10 次則是 3,000 次。讀它們的成本也不平均:目前唯一一份學術引用分類研究測得,三個助手每條 prompt 的平均被引用來源數分別是 6.88、12.06 和 16.35。8

文獻

公開研究有建議過執行次數嗎?

有,而且唯一一個公開的建議值高於五次。2026 年那篇批判性綜述記錄了一個建議:把每條 prompt 重複七到八次當起點;它在同一口氣裡就給這個數字加了限制:這個數字「不是一個通用標準」,因為它出自一小批瑞士查詢、最多十次重複。2

它真正推薦的做法是序貫精度分析:不斷重複測量,直到你在意的那個量的區間,窄到足以支撐你眼前這個決定為止。這就是把上面那張表反過來用。40 條各跑五次,回答的是「面板有沒有移動超過 7 個百分點」;同樣 40 條各跑八次是 320 次觀測、±5.4 的區間,而在採集成本負擔得起的地方,它是兩者中出處支撐比較強的那一個。

注意事項

這套算術在哪裡開始不成立?

它在三個地方不再成立,其中兩個一定會落到你頭上。第一個是極端的出現率。Wilson 區間會待在 0 與 1 之內,教科書常態近似不會,這正是本頁採用它的理由。它不再成立的是對稱性:在 200 次觀測、2% 出現率下,它是從 0.8% 到 5.0%,所以請把兩端都寫出來,而不是給一個半寬。當執行叢集、或者計數很小的時候,bootstrap 是比較穩妥的工具,2026 年那篇關於 AI 能見度的統計處理也是這樣建議的:它發現引用分布呈冪律形態,而且網域之間許多表面上的差異,落在測量的噪聲基底之內。1

第二個是:同一條 prompt 的多次執行不是相互獨立的抽樣。它們共用一條查詢、一條檢索路徑,往往還共用快取,所以會叢集;而叢集的觀測,攜帶的資訊比同樣數量的獨立觀測少。標準的修正叫設計效應:1 + (m − 1) × 組內相關係數,其中 m 是每條 prompt 的執行次數。在跑 5 次、相關係數 0.5 的情況下,這個係數是 3,200 次觀測的表現等同 67 次,區間約為 ±12,而不是 ±7。目前沒有任何公開研究估計過 AI 答案出現率上的這個相關係數,所以請把執行分散到不同日子,而不是一批打完,並且把本頁每一個區間都讀成下限。

第三個是:這個公式假設你抽樣期間 p 是不動的。在一週的尺度上,這大致站得住;在一季的尺度上就不行了,而跨越很長間隔比較的面板出現率,是把你的工作和引擎的變化混在一起測,而且沒辦法分開。上面這一切也都是圍繞單一數字的週期內區間;兩個週期之間的變化是不是真的,那是一個雙比例計算,要求高得多,它屬於測量 AI 能見度這個階段

本文誠實的邊界

本頁每一個數字,都是把算術套在一個只是近似成立的假設上。把「出現」當成機率穩定、可交換的伯努利抽樣,是這個公式能運作的前提;而 prompt 內部的叢集、一週之內的漂移,以及不同 prompt 之間的差異,都在以一個沒人量過的幅度違反它。所以這些區間是最好情況下的寬度。另外也沒有任何外部驗證顯示,用這種方式定規模的面板出現率能追蹤到任何商業結果:這個領域自己的綜述,把「引用分數能預測點擊、轉換或營收」評為極低置信度。2

產品派得上用場的地方,和派不上的地方

這些都不需要軟體。區間就是一個試算表儲存格:1.96 除以「(n + 3.84) 的平方根的兩倍」。真正擴展不了的是採集:40 條 prompt、5 次執行、5 個引擎,就是一週一千條答案;到那個量,人工蒐集不再只是繁瑣,而是變得不可靠,因為無聊的人會跳過執行,而跳過的執行,正好是這套算術看不見的那種失敗。Bavior 按排程把一組固定的 prompt 打到五個引擎上,並記錄每條答案引用了哪些來源,讓分母保持完整。它沒辦法讓一個小樣本變得比它本身更有意義,而 7 個百分點區間裡的 4 個百分點變動算不算一個結果,這個判斷依然是你的。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 30 日)。

出處,全部核查於 2026 年 8 月 30 日
  1. Sielinski,《Quantifying Uncertainty in AI Visibility》,2026 年 3 月,arXiv:2603.08924(預印本);引用分布呈冪律形態,差異落在噪聲基底之內:arxiv.org/abs/2603.08924
  2. 《A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;逐日來源層級 Jaccard 0.34–0.42,9–28% 的重複判定改變,七到八次重複的建議,以及置信度表:arxiv.org/abs/2607.14035
  3. Grossman 等,SIGIR 2026;11,500 條查詢;Google 自然結果、AI Overviews 與 Gemini 之間 URL 層級的 Jaccard 為 0.11–0.18:arxiv.org/abs/2604.27790
  4. Li 與 Sinnamon,2024;審計了 1,008 條回答,其中 672 條做分階段分析,355 個獨立網域中有 26% 被兩個系統同時引用
  5. Kirsten 等,Findings of ACL 2026;對 Google AI Overviews 的 4,706 條查詢審計,查詢發出於 2025 年 9 月;被查閱的網域有 53% 不在自然結果前 10 名:aclanthology.org/2026.findings-acl.526
  6. Xu、Iqbal 與 Montgomery,2026(預印本);55,393 條趨勢查詢,2026 年 3 月 13 日至 4 月 21 日;29.8% 的被引用網域不出現在第一頁:arxiv.org/abs/2605.14021
  7. Jaźwińska 與 Chandrasekar,《AI Search Has a Citation Problem》,哥倫比亞大學 Tow 中心,2025 年 3 月 6 日;八個引擎,1,600 條查詢,其中超過 60% 得到錯誤答案:cjr.org
  8. Zhang、He 與 Yao,《From Citation Selection to Citation Absorption》,arXiv:2604.25707(預印本);602 條受控 prompt,21,143 條搜尋層引用;每條 prompt 的平均被引用來源數為 6.88 / 12.06 / 16.35:arxiv.org/abs/2604.25707
  9. 一份涵蓋 230,000 條 prompt、超過 1 億條引用的廠商研究,2025 年 7 月 14 日至 10 月 12 日,三個助手;某個大型論壇網域在某個助手上的引用率,在 2025 年 8 月初到 9 月中之間,從約 60% 的回答降到約 10%。廠商發布,所以只轉述不外連。
  10. 一份涵蓋 1.26 億條美國 AI 搜尋 prompt 的廠商指數,2026 年 1 月至 4 月;一個助手每條回答平均引用 15 個來源,另一個是 3 個,而有 36 個品牌在所測的每個平台上都保住了能見度。廠商發布,所以只轉述不外連。
  11. Brown、Cai 與 DasGupta,《Interval Estimation for a Binomial Proportion》,Statistical Science 16(2),2001;常態近似在接近 0 與 1 處的覆蓋率很不穩定:doi.org/10.1214/ss/1009213286
常見問題

你想知道的,都在這裡。

40 條 prompt 是硬規則,還是一個湊整的數字?

它是最接近那筆算術的整數。在 50% 出現率下要拿到 ±7 個百分點的 Wilson 區間,需要 192 次觀測,而 40 條 prompt 各跑 5 次是 200 次,所以這個 40 來自你想要的區間和你付得起的執行次數,跟 prompt 本身沒有關係。20 條 prompt 各跑 10 次同樣是 200 次觀測、同樣的區間,只是對購買意圖的覆蓋更窄。要怎麼拆,看你有多確信自己選對了問題;總量要多少,看你願意公布多寬的區間。

為什麼是跑五次,不是三次?

五次是便宜的精度用完的地方,不是一個有證據支撐的門檻。在 40 條的面板上,跑 1 次是 ±15 個百分點的區間,跑 3 次約 ±9,跑 5 次約 ±7;第六次買到 0.6 個百分點,之後每一次都買不到半個百分點。如果採集很貴,跑三次是站得住腳的節省,而且應該寫進報告而不是藏起來,因為 ±9 的區間會改變哪些變動可以被稱作結果。比這個確切數字更重要的,是它在各週期之間保持不變。

我可以把所有採集都放在同一個上午跑完嗎?

把它們批量跑,會在不改善估計的情況下讓你的區間看起來更窄,所以請把執行分散到不同日子。相隔幾分鐘發出的執行,共用同一套檢索狀態、往往還共用快取,這讓它們比兩次真正獨立的抽樣更相像;於是觀測被叢集了,而叢集的觀測所攜帶的資訊,少於它們的次數所暗示的。這個修正有個名字,叫設計效應,而目前沒有任何公開研究提供了在 AI 答案上算出它所需的相關係數。把執行分散開,是繞開它的便宜辦法。

這和判斷一次變化是不是真的,差別在哪裡?

本頁算的是圍繞單一數字的區間;而檢驗前後差異是一個雙比例比較,需要的觀測數要多上好幾倍。以 30% 為基線,要偵測 20 個百分點的變動,每個週期約需 91 次觀測,10 個百分點約需 353 次,5 個百分點約需 1,372 次,所以一個每週 200 次觀測的面板,誠實地說偵測不出任何小於大幅變動的東西。那些數字,是雙比例公式在「測量 AI 能見度」裡就測量 AI 能見度算出來的結果,而在你向任何人承諾月度趨勢線之前,那是最值得先讀的一份東西。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

兩百次觀測,或者閉嘴。
沒有第三個選項。

免費試用