ylsseo monitor https://www.ylsseo.com/zh-hant/screaming-frog-visualisations/

← Change history

Screaming Frog Visualisations:向量視覺化分析 – 鸭老师SEO

https://www.ylsseo.com/zh-hant/screaming-frog-visualisations/ · latest captured snapshot · 194 words

Screaming Frog 在接入 AI API 之後,Visualisations 模組的能力發生了質變:它不再只是把抓取資料畫成樹狀圖,而是可以基於頁面 embedding 做內容聚類,把站點的主題結構、內部連結結構、錨文字分佈全部轉換為可直接觀察的圖形。本文逐個分析 Visualisations 下各項功能的原理、讀法和 SEO 用途,並給出一組行業頭部站點的對比資料。

一、Content Cluster Diagram:基於向量的主題聚類

這是整個模組裡價值最高的功能。Screaming Frog 在爬取時通過 API 為每個頁面的正文生成 embedding,然後將高維向量降維對映到 2D 座標上並自動聚類。每個點是一個頁面,點與點的距離近似語義距離,同色的點屬於同一個簇。整站的主題結構第一次變成了可以直接看的東西:內容是緻密的一團,還是鬆散的幾坨,有多少頁面懸在主體之外,一圖可見。

讀圖時有一個常見誤判需要避開:聚類圖的畫布會自動縮放以鋪滿檢視,第一眼看上去鬆散的點雲未必真的發散。判斷聚合程度不能憑視覺印象,要看座標的實際數值範圍——若 X、Y 軸上的座標差值很小,說明頁面在向量空間中實際非常緊密,只是被畫布放大了間距。這也是為什麼跨站點對比時,依據必須是用座標計算出的站點半徑,而不是把兩張圖放在一起比形狀——不同站點的圖各自縮放,形狀不可直接比較。

如下,A圖實際座標差值小,更緊密,而B圖更分散,特別是紅標的幾個點把整站的座標跨度強行拉大。

為什麼向量聚類和關鍵字聚類是兩回事

行業裡主流的主題規劃方法是關鍵字聚類:按詞根、按字面相似度把詞分組。這個方法的前提有問題——關鍵字聚類反映的是人對主題的理解方式,而 Google 理解頁面主題的方式是 embedding。

向量編碼的不是詞典釋義,而是詞語在真實語料中的使用上下文:什麼樣的內容裡出現它、圍繞它討論什麼、對應什麼搜尋任務。由此產生一個反直覺但重要的現象:字面上的同義關鍵字,在向量投射下可能偏差非常遠。 兩個詞看起來近義,但上下文分佈不同、背後的任務不同,向量就會把它們放到相距很遠的位置。按字面把它們聚成一類塞進同一個頁面,頁面的主題訊號在 Google 的幾何裡是分裂的。反過來,兩篇標題毫無字面重疊的文章,向量距離可能非常近——它們在競爭同一個語義位置,這是關鍵字工具查不出來的蠶食形態。

行業頭部站點對比:聚合程度、權威度與流量效率

為了驗證點雲形態與流量表現的關係,我們選定了一個 B2B 製造服務行業,對自然搜尋表現靠前的頭部站點逐一爬取、生成向量聚類圖,並以各站點雲座標計算站點半徑(全部頁面到站點質心的平均距離,作為聚合程度的量化指標),同時拉取各站的 Ahrefs 資料,計算流量效率 = 月自然流量 ÷ 頁面數。部分資料如下(站點已匿名,按半徑升序):

第一眼看上去相關性並不單調——半徑最大的站點 F 流量效率反而最高。但把 DR 這一列納入視野,結構立刻清晰:

在權威度相近的站點之間,聚合程度幾乎決定了流量效率。 站點 A 與站點 C 的 DR 接近(33 vs 42),半徑相差 8 倍(0.72 vs 5.93),流量效率相差 55 倍(38.6 vs 0.7)。站點 C 擁有更高的權威度和 8 倍於 A 的頁面體量,產出卻不足 A 的零頭——差距無法用權威或內容量解釋,只能用點雲形態解釋:它的內容散落在多條服務線和大量低質歸檔頁上,站點在向量空間裡沒有形成清晰的主題實體。

高權威站點可以用權威補償發散的半徑。 站點 D、E、F 的半徑都不小,但 DR 70+ 的連結資產托住了大體量內容的排名,半徑的代價被權威吸收了。

兩條放在一起,結論是有條件的,也因此更有用:權威度是發散的赦免狀;沒有這張赦免狀的站點,流量效率幾乎完全由聚合度決定。 對絕大多數中小站點而言,可控變數只有半徑——把點雲收緊,是低權威條件下唯一不依賴外部資源的效率槓桿。

這與 Google API 文件洩露中的 siteFocusScore(站點主題專注度)和 siteRadius(頁面 embedding 偏離站點整體 embedding 的程度)相互印證:Google 在站點層面度量內容點雲的緊湊程度,而權威訊號與主題訊號在排名中相乘而非相加——任何一項接近零,另一項再大也救不回來。

離質心遠的點:偏題頁面的直接識別

聚類圖最實用的一個讀法,是找離群點。站點的全部頁面向量存在一個質心,絕大多數頁面圍繞質心分佈;那些遠離質心、懸在點雲邊緣甚至獨立成簇的點,就是偏離站點主題的頁面——在 siteRadius 的語義下,它們是拉高整站離散度的元凶。

在圖上鎖定這些離群點之後,逐個核對它們的流量資料,處置路徑就清晰了:

離群且無流量的頁面,是最優先的修剪物件——它們對主題訊號是純負貢獻;離群但有流量的頁面,需要業務判斷:要麼是值得保留的例外,要麼說明這塊內容應當獨立成站或獨立目錄;離群且成片聚集的頁面(一個遊離的小簇),則指向一個結構性問題:站點實際上在同時做兩個主題,向量圖能把這種”雙質心”形態直接畫出來,並量化兩團點雲的距離,為拆分還是聚焦的決策提供依據。

二、Force-Directed Crawl Diagram 與 Crawl Tree Graph:內部連結結構

這兩個圖基於同一份資料(抓取路徑與連結關係),呈現方式不同:力導向圖適合看整體結構與孤島,樹狀圖適合看層級路徑。節點可按抓取深度、unique inlinks、GSC 點選等維度著色和縮放,內部連結結構的健康狀況一圖可見。

讀圖時重點看三類形態:

深度分佈——任何重要頁面距首頁不應超過三次點選,樹狀圖直接呈現每一層有多少頁面、哪些頁面被擠到了深層;

連結權重的傳遞路徑——力導向圖中節點的大小可對映 unique inlinks,核心頁面是否獲得了與其重要性匹配的內部連結支援,對比節點大小即可判斷;

懸掛點與孤島——只有一兩條內部連結的節點、依附在某個葉子頁面下的孤立分支,在表格裡容易被忽略,在圖上是一眼可見的異常形態。紅色節點(非 200 狀態)混在結構裡時尤其顯眼,殘留的重定向連結、錯誤連結的位置和來源直接暴露。

值得專門指出的是向量圖與連結圖的交叉驗證:當 Content Cluster Diagram 裡的離群頁面,同時也是 Crawl Diagram 裡深度最深、內部連結最少的邊緣節點時,兩個獨立資料來源的證據發生收斂,修剪或整合的決策置信度遠高於單一證據。語義上偏題、結構上邊緣化的頁面,幾乎不存在誤判空間。

三、Force-Directed Directory Tree Diagram:目錄結構視角

與 Crawl Diagram 的區別在於資料來源:Crawl Diagram 反映”Googlebot 如何通過連結發現頁面”,Directory Tree 反映”URL 路徑如何組織”。兩者對照看有專門用途——URL 結構很淺但抓取深度很深的頁面,說明它在路徑上屬於核心目錄、卻沒有獲得相應的內部連結支援;反之,則說明內部連結在補償目錄結構的缺陷。單看任何一張圖都得不出這個結論。

四、詞雲:錨文字與正文的快速診斷

Inlink Anchor Text Word Cloud 統計指向某個頁面的全部內部連結錨文字詞頻。它回答的問題是:一個頁面獲得的錨文字訊號,是模板連結堆出來的單一重複,還是來自正文的多樣化語境。典型的問題形態是某個錨文字以數十倍量級壓倒其餘所有錨文字——那基本來自全站導航或頁尾,真正攜帶語義資訊的正文上下文錨文字只有個位數。錨文字多樣性的優化空間在圖上直接暴露。

Body Text Word Cloud 統計單個頁面正文的詞頻,用於快速自檢頁面的主題詞分佈是否與目標一致。需要說明:Screaming Frog 對中文沒有分詞能力,整句會被當作單個詞條統計,中文站點的正文詞雲只能做粗粒度參考;錨文字詞雲因錨文字本身較短,受影響較小。

五、使用要點

正文區域配置先行。 Embedding 和詞雲的品質完全取決於喂進去的文字。爬取前在 Config > Content > Area 中框定正文區域、排除導航頁尾側邊欄,否則全站頁面會因共享模板文字而被強行拉近,聚類結果失真。

API 接入。 在 API Access 中連線模型後開啟 content embeddings,向量隨爬取生成,可整列匯出用於自定義分析;Content 標籤下的 Semantically Similar 過濾器基於同一份向量資料,可直接輸出語義相近頁面對的清單,作為聚類圖的表格化補充。

視覺化均可匯出為獨立 HTML,離線互動檢視,適合放進審計報告交付,客戶不需要安裝 Screaming Frog 也能自己點開看。

結論

Visualisations 模組的本質,是把三類原本只存在於表格中的結構——語義結構(向量聚類)、連結結構(抓取圖)、訊號結構(錨文字分佈)——轉換為可直接觀察的圖形。其中向量聚類的意義最大:它提供了一個比關鍵字更接近 Google 實際工作方式的主題分析單位,讓”哪些頁面在偏題、站點該不該開新內容線、兩篇內容是否在互相蠶食”這些原來靠經驗回答的問題,變成了可以測量的幾何問題。關鍵字序列屬於向量序列,主題規劃的依據應當從”這些詞長得像不像”轉向”這些內容在向量空間裡落在哪”。

獨立Google SEO專家,ylsseo.com創始人,基於Google專利、IR與API Leak解讀排名機制,中文SEO啟蒙第一人。