GEO 品牌能見度監測系統
當使用者開始直接問 AI「哪個牌子好」,我想知道的不只是品牌有沒有被提到,還有 AI 到底怎麼理解它、產品資訊講得對不對。這些問題在團隊裡原本只能靠零星抽查回答。於是我為一個台灣保健品牌從零建立監測系統,把分散的 AI 回答,轉成可以持續追蹤、比較與採取行動的指標。
問題:沒有人量得出「AI 怎麼講我們」
在現有 SEO 工具,我們可以固定追蹤關鍵字、排名與流量;到了 AI 回答,團隊看到的卻常是偶然出現的一張截圖。每個人問的問題不同、使用的模型不同,今天被推薦一次,也無法判斷這是穩定的品牌能見度,還是單次結果,更無法和下一期比較。
而且,「被提到」不等於「被理解正確」。對保健品牌來說,AI 有沒有講對成分、檢驗與產品差異,會直接影響使用者怎麼認識品牌。我的背景是 SEO 與內容,所以我先定義哪些資訊值得量、怎麼量才不會失真,再用 AI 補上開發能力,把這套量測方法做成能持續運行的系統。
做了什麼:兩層量測+每晚自動跑的管線
一個部署在 Cloud Run 上的正式系統,核心是兩層互補的量測,以及餵養它們的自動化管線:
系統架構:從題庫到兩層指標,每晚自動跑一輪。
- M1・能見度層追蹤三個指標:品牌出現在多少回答中(提及率)、和競品相比佔了多少聲量(聲量佔比)、AI 有多少次引用品牌官網作為來源(網域引用率)。這些數字可以依購買旅程、產品線與 AI 引擎分開查看,找出品牌究竟在哪一段、哪個品類、哪個模型裡沒有被看見。
- M2・敘事正確性層先把品牌希望被正確理解的重點,拆成一條條可以檢查的項目,例如成分、檢驗與產品差異。當 AI 提到品牌時,系統會逐項判斷:哪些講對了、哪些講錯了、哪些重要資訊完全沒提到。
- 自動化管線系統每晚從 700 多題的題庫中依規則抽樣,分別向 ChatGPT、Gemini 與 Claude 提問;完整回答寫入 BigQuery,再由多模型評分系統自動標註。不同類型的問題採用不同監測頻率,並設定預算上限,讓系統能長期運行,而不是只做一次性的研究。
系統跑起來之後:這些數字真的回答了問題嗎?
- 不同模型分開看ChatGPT、Gemini 與 Claude 的檢索和回答方式不同。把三者平均後,數字反而不對應任何一個使用者實際接觸到的環境,因此系統會分別呈現各個引擎的結果。
- 讓分母和問題對得上一開始,我用全部題目作為分母,後來發現不同購買旅程階段的題型混在一起,會讓個別階段的變化被稀釋。改成在各階段內分別計算後,才能看出品牌是在認知、考慮,還是決策階段失去能見度。
- 從既有內容反推使用者問題把既有文章的段落反推成使用者會問 AI 的問題,題庫可複製到任何新產品線,不用每次手刻。
- 先被看見,才談有沒有被講對如果一則回答完全沒有提到品牌,就無法判斷它是否正確描述了品牌。因此,系統把「品牌有沒有出現」和「出現後有沒有被講對」分成兩層計算,避免把沒有提及誤算成敘事錯誤。
第一次比較兩期結果時,品牌提及率看起來成長了一倍。但進一步對照聲量佔比後,我發現變化主要來自兩期題庫組成不同,不代表品牌真的更常被推薦。這次經驗讓我重新調整趨勢指標,也開始規劃固定基準題組與有對照組的內容實驗,讓之後的變化更容易被正確解讀。
——工具把數字算出來,不代表數字已經回答了原本的問題。洞察:需求越大的品類,品牌越隱形
把 27 條產品線的「需求熱度」對上「AI 能見度」,出現一條清楚的負相關:小眾利基品類(特殊成分、競品少)早就被 AI 看見;需求最大的幾個主流品類反而幾乎隱形——需求前 11 大的品類裡,10 個能見度低於平均。內容資源該優先投在右下角。
需求 × 能見度象限(單期監測數據,泡泡大小=該品類的網域引用率)。品牌與產品線均已匿名,以代號表示(編號=需求排名)。
另一個關鍵發現:引用率的引擎差距超過 4 倍——同一份內容,在某個引擎有八成回答會引用品牌網域,在另一個引擎不到兩成。手動抽查後找到方向:那個引擎的 web search 偏好英文來源,而品牌內容全是繁中。「AI 能見度」不只是內容結構問題,還有檢索語言的維度——這決定了下一步內容策略的打法。
下一步:從觀測走到實驗
- 固定基準題組鎖定題庫組成的跨期可比版本,讓趨勢指標不再被題庫變動綁架。
- 差異中的差異(diff-in-diff)內容實驗從高需求低能見度象限選介入組與對照組,補結構化內容後重測——對照組吸收環境變動,剩下的才是內容的真實效果。
- 檢索語言驗證量化各引擎引用來源的中英文占比,決定要不要為關鍵品類產英文權威內容。