首頁/學習 GEO/AI 答案為何變化
AI 搜尋如何運作 · 專題

同一個問題執行兩次,AI 的答案為什麼會不一樣。

一小時後在同一個引擎上重複同一條 prompt,你會拿到一組不同的來源。這不是故障,而是這套系統被實測出來的行為,而且它決定了什麼才算得上是關於你自身能見度的證據。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

AI 答案在完全相同的兩次執行之間會變化,是因為管線裡有好幾個階段是取樣出來的,而不是算出來的,而且它們腳下的索引一直在移動。temperature 只管那些階段裡的最後一個,所以把它設成零並不會讓系統變得可重現。在四個引擎上連續 45 天,Schulte 等人測得同一條查詢返回的來源,其每日來源層級的 Jaccard 為 0.34–0.42;另一項覆蓋 4,706 條查詢的同儕審查審計發現,在 temperature 為零時重複執行,仍有 9–28% 的決策會改變。兩項結果都轉述自 2026 年的批判性綜述。1

關鍵要點
  • 兩次執行之間有四樣東西在變:查詢扇出、一個即時索引、上下文截斷線附近的重排,以及生成。temperature 只碰得到最後一樣。
  • Jaccard 是交集除以並集,不是被引用的 URL 裡延續下來的那個佔比。在實測的 0.34–0.42 上,重複執行一次就會穩定地帶回第一次從未出現過的來源。
  • 一張截圖只是一次抽樣。請按引擎分別報告比例,並在旁邊寫上執行次數,因為哪怕在同一家公司內部,各引擎彼此之間的一致性也只有 Jaccard 0.11–0.18。
機制

AI 答案引擎內部到底哪些環節是隨機的?

同一條 prompt 的兩次執行之間,至少有四樣各自獨立的東西在變,而其中只有一樣是語言模型的取樣 temperature。沿著AI 搜尋如何運作這個階段描述的管線走:第一樣是查詢展開。Google 的文件寫明,AI Overviews 與 AI Mode「可能會使用一種『查詢扇出』技術……來生成回答」,也就是跨子話題與資料來源發起多次相關搜尋。3 這些子查詢是生成出來的,不是查表查到的,所以在任何排序發生之前,不同的子查詢集合就已經產生了不同的候選池。

第二樣是檢索本身。每一條生成出來的子查詢打到的,是一個持續重新抓取、跨機器分片、並受新鮮度與個人化邏輯影響的即時索引。第三樣是選擇:候選被合併、去重、重排,並裁剪到上下文預算之內,而卡在截斷線附近的近似並列,每次執行的解法都不一樣。第四樣是生成,模型在這裡決定把選中的來源裡的哪一個掛到哪一句上:一個來源可以被檢索到、被讀取,然後不被引用。

這四樣裡有兩樣位在你能控制的一切之上游,這就是為什麼把 temperature 調到零並不會讓系統變成確定性的。2026 年的批判性綜述把話說得很直白:報告出來的 temperature 為零,「既固定不了索引,也固定不了檢索,更固定不了外部服務的版本。」1

幅度

完全相同的兩次執行,用數字說差別有多大?

今天的來源與明天的來源之間,重合度落在 Jaccard 0.34–0.42,由 Schulte 等人在四個引擎上、連續 45 天、基於一個規模不大的瑞士查詢集測得。

Jaccard 相似度是兩個集合的交集除以它們的並集:來源集合完全相同得 1.0,毫無交集得 0。它不是重複出現的來源所佔的比例。

0.34–0.42

重複執行之間的重合度

商用引擎上同一條查詢返回的來源,其每日來源層級的 Jaccard 重合度,跨四個引擎、連續 45 天測得,見於 2026 年的批判性綜述。

9–28%

重複決策的變化率

在一項覆蓋 4,706 條查詢的同儕審查審計中,temperature 為零時重複決策發生翻轉的比例。生成步驟的確定性,換不來答案的確定性。

power law

引用分布的形狀

跨網域的引用次數服從冪律,且波動很大。少數網域被持續引用;很長的一條尾巴則被不可預測地引用。

用一個例子更容易體會 Jaccard 0.38 是什麼感覺。如果某個引擎每條答案引用八個來源,兩次執行的重合度是 0.38,那麼兩次合起來的並集大約是十一個不同的來源,八個裡大約有五個重複出現。跑第三次,你還會遇到還沒見過的來源。你的頁面什麼都沒變,變的是樣本。

2026 年 3 月那篇統計框架補上了大多數人跳過的發現:高頻被引集合內部的排名是不穩定的,不只是頂部,而是整體,而且「網域之間許多表面上的差異,落在測量過程的噪聲基底之內。」2 這就是為什麼那麼多 AI 能見度報告錯得很有自信:一個只測過一次、不帶區間的真實數字,無法與測量自身的抖動區分開來。

噪聲基底

為什麼大多數品牌是在噪聲裡,而不是在噪聲之上?

因為冪律分布把幾乎所有人都放進了那條平坦的尾巴,而在尾巴裡,執行之間的變異大於相鄰者之間的差距。如果某個網域在一批 prompt 的 6% 的答案裡出現,競品出現在 9%,那三個百分點的差距,小於你換一個下午重跑同一批 prompt 會看到的離散程度。2026 年 3 月那些自助法區間在真實網域上顯示的正是這件事:這種量級的差距落在噪聲基底之內。2

為什麼會這樣,其算術沒有爭議,也不需要任何研究背書。對於在 n 次獨立執行上測得的一個比例,當它的取值接近 50% 時,95% Wilson 區間的半寬大約是 1.96 除以「n 加 3.84 之後開平方,再乘以 2」。5 次執行大約給出 ±33 個百分點,10 次約 ±26,30 次約 ±17,100 次約 ±9.6。要比較兩個這樣的測量值,這個月對上個月,或者你對競品,需要兩個區間互不重疊,這大約還要再多付 40% 的樣本量。這是二項分布的算術,不是任何論文的發現,它也解釋了為什麼五次執行的抽查偵測不到任何小於「巨大」的變化。

由此得到一個「在真實預算下什麼偵測得到」的層級。「我們在有些答案裡出現,有些裡沒有」,幾次執行就夠;「我們從幾乎不出現變成經常出現」,要幾十次;「我們對競品拉開了三個百分點的份額」,在小團隊真會跑的任何樣本量下都偵測不到。

漂移

答案變化是不是也因為網頁本身變了?

是的,而且這種漂移與執行之間的隨機性是兩回事:它更大、更慢,因此很容易被誤當成一項結果。你做的任何一次測量底下,都跑著三個不同的時鐘。索引在變,因為頁面在被發布、更新與移除。引擎在變,因為模型與檢索堆疊會被更換,通常不會有公告。抓取層也在變:Cloudflare 的 2025 年度回顧報告,全年 AI 機器人佔 HTML 請求的 4.2%,其中使用者觸發的抓取成長超過十五倍,某個助手的使用者觸發代理峰值達到年初量的十六倍。4

關於引擎漂移,已發表的最鋒利例證來自一項為期三個月、涵蓋 230,000 條 prompt 與超過 1 億條引用的商業研究,執行區間是 2025 年 7 月中到 10 月中。它記錄到某個助手對某一個大型討論平台的引用率,在大約六週內從大約 60% 的回答掉到大約 10%,同一個窗口裡某個百科來源也出現了同一量級的下跌。5 沒有任何出版方做過什麼導致這件事。一個剛好跨著那個窗口做前後對比的團隊,會測出一個來自自家內容工作的巨大效應,而在原因上完全弄錯。

第四個、也更安靜的變化來源是來源可用性:2026 年一篇預印本(經批判性綜述轉述)發現,AI 答案中已被引用的 URL 有 27.1% 抓不下來,因為它們無法存取、已被移除,或不是文字。6 一個來源在你兩次執行之間躲到登入牆後面,答案就少了它,而你這邊什麼都沒動。

本文的誠實邊界

0.34–0.42 與 9–28% 這兩組數字,是經由一篇跨引擎、跨時間段彙總多項研究的綜述傳到你這裡的,不是針對你實際在用的那些產品所做的單一受控實驗,而且 Jaccard 這個區間來自一個規模不大的瑞士查詢集。沒有任何引擎公布自己的執行間變異。那套「正負 1 除以根號 n」的算術假設各次抽樣互相獨立,而同一段對話裡的重複執行並不獨立:會話狀態與快取會讓它們相關,所以用同一段會話裡的執行算出來的區間偏樂觀。27.1% 這個數字測的是第三方研究者能不能取回一個被引用的 URL,不是引用它的那個引擎能不能。請把這裡的每個數字都當成量級,而不是常數。

證據品質

為什麼一張 AI 答案的截圖不算證據?

一張截圖是從某個分布裡抽出的單一樣本,而那個分布的離散程度,比內容團隊想偵測的幾乎任何效應都要寬。它在三件很窄的事情上仍然有用:證明某種形狀的答案是可能出現的、捕捉一處具體的事實錯誤以便提出更正請求,以及讓相關方看看那個介面長什麼樣。它撐不起任何關於頻率、關於排名、關於隨時間變化,或關於競品的主張。

還有第二種失效方式被截圖藏了起來。引擎之間彼此的差異,大過它們與自己的差異:SIGIR 2026 上發表的那項 11,500 條查詢的研究報告,Google 自然結果、AI Overviews 與 Gemini 所返回的來源之間,平均 Jaccard 相似度低於 0.2,兩兩之間的數字落在 0.11 到 0.18,而這是同一家公司的三個介面。7 一個介面的截圖對其他介面什麼都說明不了,所以「我們查過了,我們不在裡面」通常是一句關於某一個下午、某一個介面的陳述。用的是哪個介面、哪個模式、哪個地區,以及有沒有開啟搜尋,都會改變答案,而這些在圖片裡一個都看不見。

方法

要執行多少次,一個數字才開始有意義?

2026 年那篇綜述自己的起點是每條 prompt 重複 7 到 8 次,並一直重複到估計值周圍的區間窄到足以支撐手頭這個決策為止。1 執行一次是一個樣本量為一的樣本,而它抽自一個比你想看見的大多數效應都更寬的分布。

下面這套流程,一張試算表就能跑。

在你看到任何一條答案之前,先把 prompt 集合書面固定下來

20 到 50 條真實買家會打出來的 prompt,寫下來並凍結。看到一條好答案之後再補一條 prompt,就是測量變成行銷素材的路徑。那些完全沒提到你的 prompt 要留著:它們是分母。

每一次都記錄條件

產品、模式、模型版本、日期、地區,以及有沒有開啟搜尋。2026 年那篇綜述把這幾項列為這個領域任何一項研究都必須報告的最低要求,因為缺了這些欄位的結果,無法跟任何東西比較,包括你自己更早的那次執行。

把執行攤到幾天裡,而不是幾個分頁裡

一小時內執行 30 次,多半是在對同一個索引狀態重複取樣。三週裡執行 30 次,取的才是你真正在乎的東西。條件允許的話,每次執行都用一個全新的會話,讓抽樣更接近獨立。

按引擎分別報告一個帶區間的比例

「在某個引擎的 40 次執行裡被引用了 11 次」是一句你辯護得了的話。跨引擎混出來的單一能見度分數不是,因為哪怕在同一家公司內部,各引擎的一致性也只有 Jaccard 0.11–0.18。

記錄被引用的來源,而不只是你有沒有出現

一條答案引用了哪些 URL,這份清單比正文更穩定,也更可操作,它會告訴你實際上在跟哪些第三方頁面競爭。其中大部分不會是你的。

一次只改一樣,然後等得比你覺得合理的時間更久

重新抓取與重新收錄的延遲,意味著一次頁面改動和它的效果之間隔著好幾週,而這幾週裡引擎側的漂移可能比你的改動更大。同一週裡上線的兩處改動,事後分不開。

產出是一個區間,它不如一個排名讓人滿意,但有用得多。測量 AI 能見度這個階段會把它變成一份完整的測量計畫。今天就值得養成的習慣更小:每當你寫下一個 AI 能見度數字,就在旁邊寫下它來自幾次執行。沒有 n 的數字不是測量。

產品派得上用場的地方,和派不上的地方

上面這一整套,用一張試算表、一個日曆提醒,加上把同一批 prompt 跑滿一個月的耐心就能做到。Bavior 在這個具體問題上做的,是把耐心這項要求拿掉:它按排程把一組固定的 prompt 跑遍五個引擎,並記錄每一條答案引用了哪些來源,所以你讀到的是跨許多次執行的分布,而不是某個下午的一張截圖。它不會降低變異,無法解釋某一條答案為什麼變了,也永遠不會在樣本說那是噪聲的時候,告訴你三個百分點的移動是真的。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費追蹤為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處:全部核查於 2026 年 8 月 29 日
  1. Martinez,《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035(綜述預印本)。§6.2:Schulte 等人的每日 Jaccard 0.34–0.42(四個引擎、45 天、規模不大的瑞士查詢集);Kirsten 等人的同儕審查審計,4,706 條查詢,temperature 為零時重複決策變化 9–28%:arxiv.org/abs/2607.14035
  2. Sielinski,《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》,2026 年 3 月,arXiv:2603.08924(預印本;三個平台,九次每日採集加十分鐘間隔採樣):arxiv.org/abs/2603.08924
  3. Google Search Central,《AI features and your website》(查詢扇出;第一方文件,最後更新於 2025 年 12 月 10 日):developers.google.com/search/docs/appearance/ai-features
  4. Cloudflare,《Radar 2025 Year in Review》(資料區間 2025 年 1 月 1 日至 12 月 2 日;AI 機器人佔 HTML 請求的 4.2%,使用者行為觸發的抓取成長超過 15×,某個代理峰值達 16×):blog.cloudflare.com/radar-2025-year-in-review
  5. 為期三個月的引用時間序列,涵蓋三個助手、230,000 條 prompt 與超過 1 億條引用,2025 年 7 月 14 日至 10 月 12 日;即上文描述的那次討論平台崩塌。廠商發布;依本課程的出處規則,只描述不連結。
  6. Allaham 與 Diakopoulos,2026 預印本(見 arXiv:2607.14035 §8.3 轉引):AI 答案中已被引用的 URL 有 27.1% 無法被研究者抓取,因為它們無法存取、已被移除,或不是文字
  7. Grossman 等,SIGIR 2026,11,500 條查詢;摘要中的平均 Jaccard 低於 0.2,貢獻列表中的兩兩數字為 0.11–0.18,涵蓋 Google 自然結果、AI Overviews 與 Gemini:arxiv.org/abs/2604.27790
常見問題

你想知道的,都在這裡。

把 temperature 設成 0 能讓 AI 答案可重現嗎?

不能。temperature 只控制生成步驟內部的取樣,而生成是至少四個會變動的階段裡的最後一個。查詢扇出每次生成的子查詢集合都不同,檢索打到的是持續變化的即時索引,重排對近似並列的解法每次執行也不一樣。一項覆蓋 4,706 條查詢的同儕審查審計(轉述自 2026 年的批判性綜述)發現,恰恰是在 temperature 可以固定的那些介面上,temperature 為零時重複執行仍有 9–28% 的決策會改變。

要執行多少次,才能看出我的內容工作真的推動了指標?

比大多數團隊實際執行的次數多,而誠實的答案取決於效應有多大。對於一個在 50% 附近測得的比例,95% Wilson 區間的半寬大約是 1.96 除以「執行次數加 3.84 之後開平方,再乘以 2」:執行 10 次大約給出 ±26 個百分點,30 次是 ±17,100 次是 ±9.6。要比較改動前與改動後,需要兩個區間互相錯開,這大約還要再多付 40% 的樣本量。這是普通的二項分布算術,不是研究發現,它意味著五次執行的抽查只能偵測到那些不測也明顯看得出來的變化。

如果每次答案都不一樣,測量 AI 能見度還值得做嗎?

值得,但要當成一個分布,而不是一個排名。「八月在這個引擎的 40 次執行裡被引用了 11 次」是一句站得住、能支撐決策的話;「我們在 ChatGPT 裡排第三」則不是一件存在的事。採樣計畫真正有用的產出是:分引擎統計你出現的執行佔比、那份反覆被引用而不是你的第三方來源清單,以及這兩者在一個季度裡有沒有移動。這三樣都扛得住變異;單一的排名主張扛不住。

我什麼都沒改,為什麼 AI 能見度掉了?

最可能是引擎變了,而不是你變了。一項為期三個月、涵蓋 230,000 條 prompt 的商業研究記錄到,2025 年某個助手對某一個大型討論平台的引用率,在大約六週內從大約 60% 的回答崩到大約 10%,期間沒有任何相關出版方做過任何動作。來源可用性也在變:2026 年一篇預印本(經批判性綜述轉述)發現,AI 答案中已被引用的 URL 有 27.1% 抓不下來,而這個數字測的是第三方研究者能不能取回它們,不是引用它們的那個引擎能不能。在診斷自己的內容之前,先看看那批 prompt 的整體來源組成是不是移動了。

每個 AI 引擎的變異程度都一樣嗎?

不一樣,而且各引擎彼此之間的分歧,遠大於它們與自己的分歧。SIGIR 2026 上發表的一項 11,500 條查詢的研究報告,Google 自然結果、AI Overviews 與 Gemini 之間的平均 Jaccard 相似度低於 0.2,兩兩之間為 0.11 到 0.18;而在同一個介面內,天與天之間的重合度是 0.34–0.42。跨引擎分歧才是更大的那個效應,所以結果必須按引擎、按介面分別報告,而不是平均成一個數字。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

一張截圖只是一次抽樣。
改成去讀那個分布。

免費試用