ylsseo monitor https://www.ylsseo.com/zh-hant/google-algo-leak/

← Change history

Google 演算法洩露深度分析 – 鸭老师SEO

https://www.ylsseo.com/zh-hant/google-algo-leak/ · latest captured snapshot · 913 words

⚠ 閱讀前四個重要宣告

1. 資訊時效性: Mike King 的分析基於 2024 年 3 月洩露的文件,現在是 2026 年,相關演算法大概率已迭代。本文機制應作為 “Google 可能這樣工作” 的參考,不是 “Google 現在這樣工作” 的定論。

2. King 原文的不確定性: King 本人在原文多次使用 “I suspect”、”probably”、”likely”——他自己都承認這是推測。

3. 欄位存在 ≠ 排名因素: Google 2024 年 5 月官方迴應原話:”不要根據 out-of-context、outdated、incomplete 資訊做推斷”。Content Warehouse API 裡有 14,014 個欄位,絕大部分欄位真實存在,但欄位具體是否用於排名、權重多少、觸發條件,Google 從未公開。

4. 本文僅作認知補充,不是執行清單。 任何 SEO 決策都應該基於資料 + 多維度診斷。

一、事件背景

時間線

- 2024 年 3 月 13 日: Google 內部自動化機器人 yoshi-code-bot 在 GitHub 上公開推送 Content Warehouse API 內部文件(因 Apache 2.0 開源協議)

- 2024 年 3 月 27 日: 相關程式碼被 commit(洩露視窗開始)

- 2024 年 5 月 5 日: SEO 從業者 Erfan Azimi 發現並轉給 Rand Fishkin

- 2024 年 5 月 7 日: Google 發現並刪除倉庫

- 2024 年 5 月 27 日: Rand Fishkin 和 Mike King 公開發表分析

- 2024 年 5 月 29 日: Google 官方迴應——不否認,但聲稱 “out-of-context, outdated, or incomplete”

- 2024 年 10 月(DOJ 庭審): Pandu Nayak 證詞確認 NavBoost、13 個月視窗、點選訊號用於排名

規模

2596 個模組,14014 個屬性——不是 “200 個排名因素”,是幾千個資料儲存點。

重要邊界

King 反覆強調:洩露的是 Google 存什麼資料,不是怎麼加權打分。我們知道 Google 在看什麼,但不知道這些資料在最終排名裡權重多少。

二、三個 Google 官方說法被當場揭穿

1. Google 沒有 “Domain Authority”

Google 公開說過的:

- Gary Illyes(2016):”we don’t really have ‘overall domain authority'”

- John Mueller:”we don’t have website authority score”

洩露文件:

siteAuthority: integer

converted from quality_nsr.SiteAuthority, applied in Qstar

Google 確實有整站權威度指標,在 Q* 排名系統裡使用。DOJ 庭審 Pandu Nayak 也直接提到 Q*。

注意: siteAuthority ≠ Moz DA 或 Ahrefs DR。King 表態:”We do not know specifically how this measure is computed or used in the downstream scoring functions.”

2. Google 不用點選做排名

Google 公開說過的:

- Gary Illyes:”using clicks directly in rankings would be a mistake”

- Illyes 曾公開嘲諷 Rand Fishkin:”dwell time、CTR 都是 made up crap”

洩露文件 + DOJ 庭審:

存在 NavBoost 系統——專門用點選訊號做 re-ranking。

NavBoost 裡的點選指標:

- badClicks(壞點選)

- goodClicks(有效點選)

- lastLongestClicks(最長停留的點選)

- unsquashedClicks(未歸一化的原始點選)

- impressions(展示次數)

- unicornClicks

DOJ 庭審 Pandu Nayak 證詞確認:

- NavBoost 從 2005 年 就在用

- 曾經用 18 個月滾動點選資料,2017 年後改為 13 個月

- 按 subdomain / root domain / URL 三個層級分別打分

- 按國家和裝置分別儲存

⚠ 注意: NavBoost 是 re-ranking 層,不是初始排名。Pandu Nayak 原話:”Remember, you get Navboost only after they’re retrieved in the first place.” 先有傳統訊號把你選進候選池,NavBoost 再重新排序。

3. Google 不用 Chrome 資料

Google 公開說過的:

- Matt Cutts:Google 不用 Chrome 資料做排名

- John Mueller 多次重申

洩露文件:

- chromeInTotal——整站級別的 Chrome 訪問量

- Sitelinks 生成模組裡也有 Chrome 相關屬性

- 2016 年 Google 內部 RealTime Boost 系統的 PPT 明確提到 “Chrome Visits (soon)”

三、Google Search 的真實架構

核心認知:不是一個演算法,是 100+ 個微服務疊加

概念上我們說 “Google 演算法”——實際上是幾十個微服務各自處理特定訊號,在 SuperRoot(大腦)統籌下組成最終 SERP。

關鍵系統清單

關鍵概念:Twiddlers(改手系統)

Twiddler 是 Ascorer 主演算法跑完後的 re-ranking 函式。

類比:像 WordPress 的 filter hook——主演算法先排基礎序,然後各種 Twiddler 依次微調。

所有 -Boost 結尾的系統都是 Twiddler。

四、Panda 演算法:King 的推導

King 基於 Google 專利 US8682892B1 和洩露文件推匯出:

M = IL / RQ

M = Panda 修正因子

IL = Independent Links(獨立外部連結域名數)

RQ = Reference Queries(參考查詢數 = NavBoost 的點選查詢)

學術爭議: 專利名字是 “Ranking Search Results”,不是 “Panda”。Navneet Panda 是發明人之一不代表這是 Panda 演算法。

- King + Bill Slawski 派:認為這是 Panda 的底層機制

- Roger Montti(Search Engine Journal)反對派:認為 Panda 是基於 classifier 的內容分類演算法,這個專利與 Panda 無關

真相: 這是 SEO 圈內的觀點分歧,不是確定事實。

Panda 可作用層級

專利文字顯示 Panda 修正因子可在域名、子域名、子目錄三個層級應用。

Baby Panda

洩露文件裡出現 “baby panda” 和 “babyPandaV2Demotion” 欄位。King 推測是 Panda 的早期/簡化版本。

五、Demotion 機制——欄位存在但解讀需要謹慎

⚠ 重要說明: Google 官方從未把以下機制明確定義為 “demotion”。”Demotion” 這個標籤大多是 SEO 部落格對欄位的解讀。欄位真實,但”被 demote”的具體條件和影響程度都是推測。

1. Anchor Mismatch(錨文字不匹配)

欄位 anchorMismatchDemotion

真實存在。King 的解讀:外部連結錨文字和目標頁面主題不匹配時連結被 demote。

2. SERP Demotion(搜尋結果行為降級)

欄位 serpDemotion

真實,applied in Qstar。機制與 NavBoost 的 goodClicks/badClicks/lastLongestClicks 相關聯。

3. Nav Demotion(導航降級)

欄位真實。機制:針對糟糕的網站導航和 UX。具體識別指標未公開。

4. Link Demotions

相關欄位全部真實:

phraseAnchorSpamDays

droppedLocalAnchorCount

LINK_SPAM_PHRASE_SPIKE

⚠ 注意事項:

- “Penguin 機制”是過時類比 — Penguin 2016 年已整合進 Core Algorithm,不再獨立執行

- 欄位具體觸發條件、影響權重,Google 從未公開

- SEO 部落格的具體機制解讀(如”短期大量相似錨文字湧入→降級”)是推測

六、連結相關的發現

1. 索引層級決定連結價值(sourceType)

Google 的索引分三層,由 Gary Illyes 在 Search Off The Record 播客親口確認:

- Flash 儲存(top tier)——最重要、頻繁更新的內容

- SSD(middle tier)——次要內容

- 普通硬碟(bottom tier / supplemental)——很少更新的內容

- TYPE_FRESHDOCS——新鮮內容特殊層

sourceType 欄位標記連結源的 tier:TYPE_HIGH_QUALITY / TYPE_MEDIUM_QUALITY / TYPE_LOW_QUALITY。

2. Google 只看最近 20 次頁面修改

urlHistory: 保留所有修改歷史

但分析連結時只考慮最後 20 個版本

3. Homepage PageRank 影響每個頁面

每個文件都關聯著它首頁的 PageRank(homepagePagerankNs)——新頁面可能用首頁 PageRank 作代理,直到自己積累起 PageRank。

4. Homepage Trust 有四級

homePageInfo 列舉值:

- NOT_HOMEPAGE

- NOT_TRUSTED

- PARTIALLY_TRUSTED

- FULLY_TRUSTED

5. Font Size 和加粗文字被追蹤

- avgTermWeight——正文裡關鍵字的平均加權字號

- 錨文字有 fontsize 欄位

6. Disavow 資料不在核心 ranking system 裡

搜尋整個 API 文件——沒有任何 “disavow” 相關欄位。

King 的推測:Disavow 可能是”眾包 spam 分類器訓練資料”——但 King 自己承認這是 “my long-term assumption“——是推測,不是 confirmed。

7. 連結兩端都查 relevance

Google 在判斷連結價值時,同時看源頁面和目標頁面的主題相關性。

8. 文件會被截斷(numTokens)

Mustang 系統有最大 token 限制。

原文:”we drop some tokens in mustang and also truncate docs at a max cap”

9. PageRank 依然重要

文件裡有 pagerankNs(Nearest Seed PageRank)等多個變體。

2024 年 SEO 圈盛傳”連結不重要了”——這是錯的。連結依然是核心訊號。

七、內容品質相關發現

1. OriginalContentScore

OriginalContentScore: 0-127(儲存為 7-bit)

實際範圍 0-512(經壓縮編碼)

Only pages with little content have this field

只有”少內容”頁面才會被打 OriginalContentScore。長內容走另一條路徑。

2. Keyword Stuffing Score 存在

有對應的關鍵字堆砌扣分機制。

3. titlematchScore——標題匹配查詢度

titlematchScore: Titlematch score of the site,

a signal that tells how well titles are matching user queries.

4. 沒有字元數限制指標

Gary Illyes 曾說 “SEOs 發明了最優字元數”——洩露文件證實了這點。

唯一的字元計數字段是 snippetPrefixCharCount(用於決定片段字首)。

5. 日期訊號有三個維度

- bylineDate:頁面明確標註的釋出日期

- syntacticDate:從 URL 或標題裡提取的日期

- semanticDate:從正文內容、錨文字、相關文件推斷的日期

6. 域名註冊資訊 Google 存著

RegistrationInfo {

createdDate: 首次註冊日期(相對 1995-01-01 的天數)

expiredDate: 最後過期日期

}

7. Video Focused Site 特殊處理

isVideoFocusedSite: true if > 50% of URLs have watch pages

8. YMYL 在 chunk 級別打分

- ymylHealthScore

- ymylNewsScore

- encodedChardXlqYmylPrediction

YMYL 是在內容 chunk(段落/塊)級別打分的——Google 用 embeddings 把內容切塊,每塊單獨判斷。

9. Gold Standard Documents

golden: boolean

Flag for indicating that the document is a gold-standard document.

某些文件被人工標記為”金標準”——在訓練中獲得額外權重。King 推測可能與 Quality Raters 有關,但沒有直接證據連線兩者。

八、其他機制

Whitelist 機制

Google 對特定敏感話題有白名單:

- 選舉內容(isElectionAuthority)

- COVID-19(isCovidLocalAuthority)

- 旅遊(有專門標記)

Sandbox 的真實情況

hostAge: "used to sandbox fresh spam in serving time"

欄位描述原文是 “sandbox fresh spam“——不是 “sandbox all new sites”。

Google 官方說”沒有 sandbox”不完全是謊言——確實沒有”所有新站的 sandbox”。hostAge 是針對 fresh spam 的 sandbox 機制。

smallPersonalSite

smallPersonalSite: Score of small personal site promotion

go/promoting-personal-blogs-v1

注意:欄位描述裡出現的是 “promotion”(提升),不是 “demotion”(降級)。 欄位真實,但具體用途未公開,多家 SEO 分析表示 “Unclear what this is used for”。

九、Mike King 的文末三條建議

1. 不要盲信 Google 官方發言

“Google spokespeople are well-meaning, but can we trust them? The quick answer is not when you get too close to the secret sauce.”

2. 真正的排名是多層疊加,不是單一演算法

Ascorer(主演算法)+ 多層 Twiddlers(Panda、NavBoost、QualityBoost…)疊加的結果。

3. 重新評估你的外部連結策略

“It is a very good time to reconsider your link building programs based on everything you’ve just read.”

更多整理的一手資訊來源:2026Googleseo排名

獨立Google SEO專家,ylsseo.com創始人,基於Google專利、IR與API Leak解讀排名機制,中文SEO啟蒙第一人。