首頁/學習 GEO/十個欄位
提示詞研究 · 記錄

你的 prompt 日誌裡該有哪十個欄位?

你日後能算出來的每一個指標,都是採集當下寫下的那些欄位的函數。日誌結構才是實驗本身;儀表板只是它的一個檢視。

本頁內容
分享本文
分享到 X 分享到 LinkedIn
簡短回答

每次執行都記錄十個欄位:prompt ID 與版本、prompt 類別、引擎、介面或模式、模型名稱(若有揭露)、是否啟用了網頁搜尋、時間戳、地區設定與國家、答案正文有沒有點出你的品牌名,以及被引用 URL 的完整列表,包括所有別人的。什麼都沒發生的那些執行也要寫一列,因為一個出現率的可信程度,就是它底下那個分母的可信程度。2026 年那篇批判性綜述給出的「GEO 研究最低清單」要求每一次觀測都記下七項配置值:產品、模式、模型、日期、地區設定、帳號與搜尋狀態;並要求保留分母與空結果。1

關鍵要點
  • 配置類欄位在採集當下什麼都不像,卻是唯一能在日後告訴你「是引擎變了還是你變了」的那幾欄。
  • 提及和引用是兩欄,永遠不是一欄:有連結卻沒有品牌名是內容問題,有品牌名卻沒有連結是模型先驗問題。
  • 失敗的採集要留下來,用一個狀態欄位標記:200 次執行裡丟掉 25 次超時,會把 30.0% 的出現率變成 34.3%。
日誌結構就是實驗

為什麼日誌結構決定了你能得出什麼結論?

因為沒有任何分析救得回一個從來沒被寫下來的欄位,而團隊漏掉的永遠是同樣那幾個。2026 年這個領域的批判性綜述公布了一份「GEO 研究最低清單」,具體得不尋常:記錄產品、模式、模型、日期、地區設定、帳號與搜尋狀態;在多個時間窗內做間隔很近的重複執行;保留分母與空結果;並把管線各階段分開看,而不是把一次性的分數讀成穩定排名。它一貫的建議是把檢索、引用與保真度分開來測。1 這裡面大部分講的是日誌,不是分析。

注意第一行是由什麼構成的。那七項是配置而不是結果,在你採集的當下沒有一項像資料,這正是它們被丟掉的原因。它們的價值要幾個月後才顯現:某個比率往下掉了十五個百分點,而唯一重要的問題是引擎變了還是你變了。一份沒有那幾欄的日誌回答不了。

日誌結構也是讓面板版本有意義的東西。提示詞研究這個階段把面板當成一件帶版本號的儀器;日誌就是把那個版本號蓋在每一次觀測上的地方,好讓版本 2 的數字永遠不會被悄悄拿去和版本 3 的比。

結構

每一列裡該有哪十個欄位?

每次執行一列,在任何人去看答案之前就先寫好,帶上下面這十個欄位。

第三欄就是少記一個欄位日後要付的代價。

欄位取值範例沒有它會壞掉什麼
1. prompt ID 與版本P-014 v2改過措辭的 prompt 會變成頂著同一個名字的另一個問題
2. prompt 類別異議沒有類別拆分,混合出現率就藏起了自己的組成
3. 引擎引擎 A合併會把重疊度只有 Jaccard 0.11–0.18 的介面平均掉7
4. 介面或模式開啟網頁搜尋的對話兩列看起來一模一樣的記錄,其實是兩個不同的實驗
5. 模型名稱,若有揭露介面上顯示的名稱廠商換模型會被歸因到你的內容改動上
6. 是否啟用搜尋是 / 否 / 未知以檢索接地的答案,會和來自模型先驗的答案混在一起
7. 帶時區的時間戳2026-08-24 09:12 UTC批次執行不會被發現,而批次執行之間是相關的
8. 地區設定與國家en-GB / 英國混了地區設定的面板無法和自己比較
9. 正文是否點出品牌是 / 否根本算不出提及率
10. 全部被引用的 URL完整列表,不只是你的算不出引用率,也沒有一張誰擁有這個答案的地圖

清單隱含但沒有點名的一個欄位,應該擺在那十個旁邊:執行狀態。記錄這次採集是完成了、被限流了、超時了,還是被拒絕了,因為一次根本沒發生的執行,和一次發生了但沒點你名的執行,在表裡是同一個空格,事實卻正好相反。沒有它,你就沒有分母。

另有三個衍生欄位由這十個推導而來,應該算出來而不是手打進去。提及來自第 9 欄。引用來自第 10 欄,做法是檢查有沒有任何被引用的 URL 落在你的網域上。保真度兩者都給不了:它是由人去讀關於你的那句話,在抽樣上評為準確、不完整、有誤導或錯誤。三欄,三種失效模式,三種不同的修法。1

分母

為什麼空結果必須留在分母裡?

因為出現率是一個分數,而一個悄悄丟掉「什麼都沒發生」那些執行的分數,就不是比率了。明顯的那個版本,200 次執行只留下點了你名的 60 次然後報 100%,沒有人會故意這麼做。

真正會發生的版本,講的是失敗的採集,而不是缺席的品牌。假設那 200 次執行裡有 25 次報錯,而管線把它們丟掉了,因為一列失敗的記錄沒有可解析的答案正文。出現率現在是 175 次裡的 60 次,也就是 34.3%,而不是 200 次裡的 60 次,也就是 30.0%。這 4.3 個百分點的落差是一個資料處理決定,而且超過一個 200 次觀測的面板所帶的信賴區間寬度的一半。更糟的是,失敗很少是隨機的:長答案更常超時,某些地區設定限流更兇,而某個引擎會拒絕另一個引擎會回答的問題,於是偏差有了一個不是你選的方向。

三條規則可以永久修好它。每一次嘗試過的執行都寫一列,包括失敗的那些,帶上前一節那個狀態欄位。分母規則只決定一次,並寫進報告裡:「按完成的執行計算出現率,200 次嘗試中的 175 次」就是一次完整揭露,只花九個詞。並且把完成率本身當成一個品質指標來盯,因為一條從 95% 悄悄退化到 80% 完成率的管線,會在世界上什麼都沒發生的情況下推動你的頭條數字。這是團隊最常違反的一條清單條目,也是唯一一條會同時汙染它下游每一個指標的。1

兩欄

為什麼提及和引用必須分成兩欄?

因為兩者差距很大,在不同引擎上差距的方向還相反,而且各自指向不同團隊的不同工作。提及是你的品牌名出現在正文裡;引用是你的某個 URL 被掛上去,不管正文有沒有點你的名。把它們併成一個「我們出現了」的旗標,會毀掉那個告訴你下一步該做什麼的區分。

這個落差有多大,記錄得最清楚的是廠商研究,應該當成方向性的證據來讀。2026 年 6 月一項研究用 115 條 prompt,在四個平台、十四個國家產生了 3,981 次網域出現,報告其中 62% 是答案正文從未點名品牌的連結,而且這個模式在不同引擎之間會反轉:一個助理大約 84% 提及對 21% 引用,另一個大約 21% 提及對 87% 引用。11 樣本很小,而且是廠商發布的;請把百分比當成未經核實,把反轉本身當成那個發現。

這兩種失效有不同的修法。有連結卻沒有名字,意味著檢索成功了而識別失敗了,通常是因為被引用的段落有用,卻從沒說出是誰在說;內容團隊靠寫出把主體點名的句子來修好它。有名字卻沒有連結,意味著模型靠的是它已經知道的東西,而不是它剛檢索到的東西,站內工作不會很快推動它;診斷方法是把搜尋關掉再跑一次那條 prompt。這兩欄都沒有說到那段描述是不是真的。Tow 中心對八個生成式搜尋工具、一千六百條查詢的審計發現超過 60% 的答案不正確,3 更早一次 Tow 對兩百條引文的測試在 153 次得到部分或完全不正確的回應,而只有七次表達了不確定,2 獨立研究發現生成式答案中 51.5% 的句子被它們的引用完全支撐,4 而 2026 年一項研究把 98,020 條原子主張中的 11.0% 歸類為未被所引頁面支撐。5 保真度那一欄就是為此而設的。

第十一欄

答案原文要不要也存下來?

要,因為它才讓這段歷史還能被重新分析。提及是拿名字去比對正文,而那個比對器在第一天一定會在邊緣出錯:它漏掉所有格和拼錯,在和你的產品共用一個詞的競品上誤觸發,也分不出推薦和警告。存了答案原文,你就能把修正過的比對器重跑一遍整段歷史。沒有它,修正過的序列只能從今天開始,那不叫序列。

保真度那一欄有同樣的依賴:沒有人會在採集當下即時評分,所以存下來的原文才是讓審讀者這個月去讀上個月那些執行的東西。被引用的內容也要原樣留著,因為一份在寫入時就被壓成裸網域的清單,之後再也說不出是哪一頁被引用了。

有一條界線讓這件事保持誠實:沒有人會回頭讀的存量,是只有成本沒有效益的。要刻意設一個保留期,並把它寫進報告,因為它就是一條重算出來的序列最多能回溯多遠的上限。

結構的邊界

哪些欄位其實採不可靠?

這十個裡有三個經常拿不到,正確的反應是把缺失記錄下來,而不是去猜。模型名稱最糟:多數消費端介面揭露的是一個行銷標籤而不是建置識別碼,而且它可以在一次會推動你數字的變更中保持不變。搜尋狀態排第二:有些介面會逐條查詢決定要不要檢索,而且從不說出來,所以誠實的填法是一個代理值,也就是答案裡到底有沒有帶任何引用,並且標明它是代理值。地區設定排第三:你請求的和引擎推斷出來的可能不同,所以兩個都存。

還有一整類東西是答案側的日誌看不見的。一個引擎查閱了某個來源卻沒有引用它,就不會在你的日誌裡留下痕跡,而這個區分不是學術問題:Findings of ACL 2026 那份 4,706 條查詢的審計,測的是 AI Overviews 查閱過的網域,根據 2025 年 9 月採集的資料報告其中 53% 不在自然結果前十名裡;而一項 2026 年 3 月 13 日至 4 月 21 日採集的 55,393 條查詢研究,測的是被引述的網域,報告其中 29.8% 不在第一頁上。85 不同的動詞、不同的分母、不同的日期,落差大到把其中任何一個當成點估計來引用都會是錯的。你的日誌永遠只看得到被引用的那一半。

你的伺服器日誌是它的互補:它記錄的是抓取而不是答案,所以它抓得到你的面板看不見的檢索失敗。那屬於測量 AI 能見度這個階段,連同這些指標裡哪些站得住;面板規模屬於姊妹篇

本文誠實的邊界

這套結構是從一篇綜述的清單加上營運經驗拼出來的約定,不是標準。沒有人驗證過這十個欄位是充分的,也沒有人驗證過其中任何一個是必要的,而且不存在一種共享格式,能讓兩個團隊直接比較彼此的日誌。保真度那一欄是最弱的部分:沒有任何已發表的工作報告過兩個讀者為這項任務給同一條答案評分有多一致,所以請把保真度當成一條內部預警線,而不是拿去公布的數字。

產品派得上用場的地方,和派不上的地方

一張帶著這些欄位的試算表就是一套完整的實作,即使你日後會買東西也值得先做出來:思考在結構裡,採集只是勞力。工具改變的是那些無聊的欄位在一週一千次執行的規模下有沒有被填上。狀態、時間戳、地區設定和完整的被引用 URL 列表,正是一個趕時間的人會停止記錄的欄位,也正是讓分母站得住腳的那些。Bavior 按排程把一組固定的 prompt 打到五個引擎上,並記錄每一條答案引用了哪些來源,把空的執行留在記錄裡。它無法揭露一個引擎不公布的模型識別碼,無法告訴你關於你產品的那句話是不是真的,也不會替你決定分母規則。免費 AI 能見度檢測免費 GEO 健檢不需要付費方案;付費方案為按月付費每月 $99 起,或按年付費每月 $79.17(截至 2026 年 8 月 29 日)。

出處,全部核查於 2026 年 8 月 29 日
  1. 《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》,2026 年 7 月 15 日,arXiv:2607.14035;表 6(GEO 研究最低清單)與 §7.5:arxiv.org/abs/2607.14035
  2. 哥倫比亞大學 Tow 數位新聞中心,《How ChatGPT Search (Mis)represents Publisher Content》,2024 年 11 月;兩百條引文,153 次不正確的回應,七次表達不確定:cjr.org
  3. Jaźwińska & Chandrasekar,《AI Search Has a Citation Problem》,Tow 中心,2025 年 3 月 6 日;一千六百條查詢,八個生成式搜尋工具;原文為「incorrect answers to more than 60 percent of queries」:cjr.org
  4. Liu 等,2023;生成式搜尋答案中 51.5% 的句子被它們的引用完全支撐(由出處 1 的批判性綜述轉述)
  5. Xu、Iqbal & Montgomery,2026;55,393 條熱門查詢,2026 年 3 月 13 日至 4 月 21 日;98,020 條原子主張中有 11.0% 未被所引頁面支撐;原文為「29.8% of AIO-cited domains do not appear in those first-page results」(預印本):arxiv.org/abs/2605.14021
  6. Vykopal 等,2026;依助理與主題不同,可信來源佔比為 71.4–86.3%(由出處 1 的批判性綜述轉述)
  7. Grossman 等,SIGIR 2026;11,500 條查詢;原文為「Jaccard similarities between 0.11 and 0.18」,比較對象為 Google 自然結果、AI Overviews 與 Gemini:arxiv.org/abs/2604.27790
  8. Kirsten 等,Findings of ACL 2026;4,706 條查詢的審計,資料採集於 2025 年 9 月;原文為「on average 53% (27%) of domains that AIO consults are not contained in top-10 (top-100) Organic search results」:aclanthology.org/2026.findings-acl.526
  9. Sielinski,《Quantifying Uncertainty in AI Visibility》,2026 年 3 月(預印本):arxiv.org/abs/2603.08924
  10. Google Search Central,《AI features and your website》,更新於 2025 年 12 月 10 日(介面、資格條件;第一方):developers.google.com/search/docs/appearance/ai-features
  11. 廠商研究,2026 年 6 月;115 條 prompt,3,981 次網域出現,四個平台,十四個國家;其中 62% 的出現是答案正文從未點名品牌的連結,而提及與引用之比在不同助理之間反轉。廠商發布;依本課程的出處規則,只描述不連結。
常見問題

你想知道的,都在這裡。

我沒出現的那些執行,真的也要記錄嗎?

要,而且它們是日誌裡更重要的那一半。出現率是一個分數,它的分母是你嘗試過的每一次執行,所以一次缺席就是資料,而一次被刪掉的缺席就是一個被汙染的指標。真正會咬到團隊的失誤比刪掉未出現的記錄更隱蔽:是丟掉報錯的那些執行。如果 200 次採集裡有 25 次超時而管線把它們丟棄,30.0% 的出現率會變成 34.3%,而世界上什麼都沒變,而且這個偏移比面板所帶的信賴區間的一半還大。

提及和引用有什麼差別?

提及是你的品牌名出現在答案正文裡;引用是你的某個 URL 被掛在它上面,不管正文有沒有點你的名。兩者差距很大,含義也不同。有連結卻沒有名字,意味著檢索成功了而識別失敗了,通常是因為被引用的段落有用,卻沒說出是誰在說,這是一個內容層面的修法。有名字卻沒有連結,意味著模型靠的是它已經知道的東西,而不是它剛檢索到的東西,站內工作不會很快推動它。兩者都要按引擎分別回報。

競品被引用的 URL 也要記錄嗎?

把答案裡每一個被引用的 URL 都記下來,不只是你的,因為那份清單是面板產出的最有行動價值的成果。你自己的出現只告訴你有沒有在答案裡;完整清單告訴你誰在裡面,這把一個能見度數字變成一張地圖,標出真正擁有你這個品類那些問題的頁面。在商業類問題上,那份清單有很大一部分會是第三方文章和社群討論串,而不是任何廠商自己的頁面,而這正是決定修法屬於你的內容團隊還是站外工作的那個發現。

引擎不肯告訴我是哪個模型回答的,那我記什麼?

記下介面顯示的內容,標明它是一個標籤而不是建置識別碼,並把它的任何變化當成假設而不是事實。多數消費端介面揭露的是一個行銷名稱,它可以在底層變更時保持不變,所以這個欄位在兩個方向上都是弱證據:穩定的標籤不能證明穩定,變了的標籤也不能證明那個變化造成了你觀察到的東西。仍然記錄它的價值在於,當某個比率跳動超過你的信賴區間時,你有一個可以先去查的東西。

Bavior 編輯部

負責研究與維護 Bavior 關於 Reddit 行銷和 AI 搜尋可見度的所有內容。文中每一個數字都註明了來源出處與查證日期,所有外部連結均非聯盟推廣連結。

發現數字有誤?告訴我們,我們會重新查證:support@bavior.com

十個欄位,每次都填滿。
其餘一切只是它們的一個檢視。

免費試用