Google 演算法洩露深度分析 – 鸭老师SEO
https://www.ylsseo.com/zh-hant/google-algo-leak/ · latest captured snapshot · 913 words
⚠ 閱讀前四個重要宣告
1. 資訊時效性: Mike King 的分析基於 2024 年 3 月洩露的文件,現在是 2026 年,相關演算法大概率已迭代。本文機制應作為 “Google 可能這樣工作” 的參考,不是 “Google 現在這樣工作” 的定論。
2. King 原文的不確定性: King 本人在原文多次使用 “I suspect”、”probably”、”likely”——他自己都承認這是推測。
3. 欄位存在 ≠ 排名因素: Google 2024 年 5 月官方迴應原話:”不要根據 out-of-context、outdated、incomplete 資訊做推斷”。Content Warehouse API 裡有 14,014 個欄位,絕大部分欄位真實存在,但欄位具體是否用於排名、權重多少、觸發條件,Google 從未公開。
4. 本文僅作認知補充,不是執行清單。 任何 SEO 決策都應該基於資料 + 多維度診斷。
一、事件背景
時間線
- 2024 年 3 月 13 日: Google 內部自動化機器人 yoshi-code-bot 在 GitHub 上公開推送 Content Warehouse API 內部文件(因 Apache 2.0 開源協議)
- 2024 年 3 月 27 日: 相關程式碼被 commit(洩露視窗開始)
- 2024 年 5 月 5 日: SEO 從業者 Erfan Azimi 發現並轉給 Rand Fishkin
- 2024 年 5 月 7 日: Google 發現並刪除倉庫
- 2024 年 5 月 27 日: Rand Fishkin 和 Mike King 公開發表分析
- 2024 年 5 月 29 日: Google 官方迴應——不否認,但聲稱 “out-of-context, outdated, or incomplete”
- 2024 年 10 月(DOJ 庭審): Pandu Nayak 證詞確認 NavBoost、13 個月視窗、點選訊號用於排名
規模
2596 個模組,14014 個屬性——不是 “200 個排名因素”,是幾千個資料儲存點。
重要邊界
King 反覆強調:洩露的是 Google 存什麼資料,不是怎麼加權打分。我們知道 Google 在看什麼,但不知道這些資料在最終排名裡權重多少。
二、三個 Google 官方說法被當場揭穿
1. Google 沒有 “Domain Authority”
Google 公開說過的:
- Gary Illyes(2016):”we don’t really have ‘overall domain authority'”
- John Mueller:”we don’t have website authority score”
洩露文件:
siteAuthority: integer
converted from quality_nsr.SiteAuthority, applied in Qstar
Google 確實有整站權威度指標,在 Q* 排名系統裡使用。DOJ 庭審 Pandu Nayak 也直接提到 Q*。
注意: siteAuthority ≠ Moz DA 或 Ahrefs DR。King 表態:”We do not know specifically how this measure is computed or used in the downstream scoring functions.”
2. Google 不用點選做排名
Google 公開說過的:
- Gary Illyes:”using clicks directly in rankings would be a mistake”
- Illyes 曾公開嘲諷 Rand Fishkin:”dwell time、CTR 都是 made up crap”
洩露文件 + DOJ 庭審:
存在 NavBoost 系統——專門用點選訊號做 re-ranking。
NavBoost 裡的點選指標:
- badClicks(壞點選)
- goodClicks(有效點選)
- lastLongestClicks(最長停留的點選)
- unsquashedClicks(未歸一化的原始點選)
- impressions(展示次數)
- unicornClicks
DOJ 庭審 Pandu Nayak 證詞確認:
- NavBoost 從 2005 年 就在用
- 曾經用 18 個月滾動點選資料,2017 年後改為 13 個月
- 按 subdomain / root domain / URL 三個層級分別打分
- 按國家和裝置分別儲存
⚠ 注意: NavBoost 是 re-ranking 層,不是初始排名。Pandu Nayak 原話:”Remember, you get Navboost only after they’re retrieved in the first place.” 先有傳統訊號把你選進候選池,NavBoost 再重新排序。
3. Google 不用 Chrome 資料
Google 公開說過的:
- Matt Cutts:Google 不用 Chrome 資料做排名
- John Mueller 多次重申
洩露文件:
- chromeInTotal——整站級別的 Chrome 訪問量
- Sitelinks 生成模組裡也有 Chrome 相關屬性
- 2016 年 Google 內部 RealTime Boost 系統的 PPT 明確提到 “Chrome Visits (soon)”
三、Google Search 的真實架構
核心認知:不是一個演算法,是 100+ 個微服務疊加
概念上我們說 “Google 演算法”——實際上是幾十個微服務各自處理特定訊號,在 SuperRoot(大腦)統籌下組成最終 SERP。
關鍵系統清單
關鍵概念:Twiddlers(改手系統)
Twiddler 是 Ascorer 主演算法跑完後的 re-ranking 函式。
類比:像 WordPress 的 filter hook——主演算法先排基礎序,然後各種 Twiddler 依次微調。
所有 -Boost 結尾的系統都是 Twiddler。
四、Panda 演算法:King 的推導
King 基於 Google 專利 US8682892B1 和洩露文件推匯出:
M = IL / RQ
M = Panda 修正因子
IL = Independent Links(獨立外部連結域名數)
RQ = Reference Queries(參考查詢數 = NavBoost 的點選查詢)
學術爭議: 專利名字是 “Ranking Search Results”,不是 “Panda”。Navneet Panda 是發明人之一不代表這是 Panda 演算法。
- King + Bill Slawski 派:認為這是 Panda 的底層機制
- Roger Montti(Search Engine Journal)反對派:認為 Panda 是基於 classifier 的內容分類演算法,這個專利與 Panda 無關
真相: 這是 SEO 圈內的觀點分歧,不是確定事實。
Panda 可作用層級
專利文字顯示 Panda 修正因子可在域名、子域名、子目錄三個層級應用。
Baby Panda
洩露文件裡出現 “baby panda” 和 “babyPandaV2Demotion” 欄位。King 推測是 Panda 的早期/簡化版本。
五、Demotion 機制——欄位存在但解讀需要謹慎
⚠ 重要說明: Google 官方從未把以下機制明確定義為 “demotion”。”Demotion” 這個標籤大多是 SEO 部落格對欄位的解讀。欄位真實,但”被 demote”的具體條件和影響程度都是推測。
1. Anchor Mismatch(錨文字不匹配)
欄位 anchorMismatchDemotion
真實存在。King 的解讀:外部連結錨文字和目標頁面主題不匹配時連結被 demote。
2. SERP Demotion(搜尋結果行為降級)
欄位 serpDemotion
真實,applied in Qstar。機制與 NavBoost 的 goodClicks/badClicks/lastLongestClicks 相關聯。
3. Nav Demotion(導航降級)
欄位真實。機制:針對糟糕的網站導航和 UX。具體識別指標未公開。
4. Link Demotions
相關欄位全部真實:
phraseAnchorSpamDays
droppedLocalAnchorCount
LINK_SPAM_PHRASE_SPIKE
⚠ 注意事項:
- “Penguin 機制”是過時類比 — Penguin 2016 年已整合進 Core Algorithm,不再獨立執行
- 欄位具體觸發條件、影響權重,Google 從未公開
- SEO 部落格的具體機制解讀(如”短期大量相似錨文字湧入→降級”)是推測
六、連結相關的發現
1. 索引層級決定連結價值(sourceType)
Google 的索引分三層,由 Gary Illyes 在 Search Off The Record 播客親口確認:
- Flash 儲存(top tier)——最重要、頻繁更新的內容
- SSD(middle tier)——次要內容
- 普通硬碟(bottom tier / supplemental)——很少更新的內容
- TYPE_FRESHDOCS——新鮮內容特殊層
sourceType 欄位標記連結源的 tier:TYPE_HIGH_QUALITY / TYPE_MEDIUM_QUALITY / TYPE_LOW_QUALITY。
2. Google 只看最近 20 次頁面修改
urlHistory: 保留所有修改歷史
但分析連結時只考慮最後 20 個版本
3. Homepage PageRank 影響每個頁面
每個文件都關聯著它首頁的 PageRank(homepagePagerankNs)——新頁面可能用首頁 PageRank 作代理,直到自己積累起 PageRank。
4. Homepage Trust 有四級
homePageInfo 列舉值:
- NOT_HOMEPAGE
- NOT_TRUSTED
- PARTIALLY_TRUSTED
- FULLY_TRUSTED
5. Font Size 和加粗文字被追蹤
- avgTermWeight——正文裡關鍵字的平均加權字號
- 錨文字有 fontsize 欄位
6. Disavow 資料不在核心 ranking system 裡
搜尋整個 API 文件——沒有任何 “disavow” 相關欄位。
King 的推測:Disavow 可能是”眾包 spam 分類器訓練資料”——但 King 自己承認這是 “my long-term assumption“——是推測,不是 confirmed。
7. 連結兩端都查 relevance
Google 在判斷連結價值時,同時看源頁面和目標頁面的主題相關性。
8. 文件會被截斷(numTokens)
Mustang 系統有最大 token 限制。
原文:”we drop some tokens in mustang and also truncate docs at a max cap”
9. PageRank 依然重要
文件裡有 pagerankNs(Nearest Seed PageRank)等多個變體。
2024 年 SEO 圈盛傳”連結不重要了”——這是錯的。連結依然是核心訊號。
七、內容品質相關發現
1. OriginalContentScore
OriginalContentScore: 0-127(儲存為 7-bit)
實際範圍 0-512(經壓縮編碼)
Only pages with little content have this field
只有”少內容”頁面才會被打 OriginalContentScore。長內容走另一條路徑。
2. Keyword Stuffing Score 存在
有對應的關鍵字堆砌扣分機制。
3. titlematchScore——標題匹配查詢度
titlematchScore: Titlematch score of the site,
a signal that tells how well titles are matching user queries.
4. 沒有字元數限制指標
Gary Illyes 曾說 “SEOs 發明了最優字元數”——洩露文件證實了這點。
唯一的字元計數字段是 snippetPrefixCharCount(用於決定片段字首)。
5. 日期訊號有三個維度
- bylineDate:頁面明確標註的釋出日期
- syntacticDate:從 URL 或標題裡提取的日期
- semanticDate:從正文內容、錨文字、相關文件推斷的日期
6. 域名註冊資訊 Google 存著
RegistrationInfo {
createdDate: 首次註冊日期(相對 1995-01-01 的天數)
expiredDate: 最後過期日期
}
7. Video Focused Site 特殊處理
isVideoFocusedSite: true if > 50% of URLs have watch pages
8. YMYL 在 chunk 級別打分
- ymylHealthScore
- ymylNewsScore
- encodedChardXlqYmylPrediction
YMYL 是在內容 chunk(段落/塊)級別打分的——Google 用 embeddings 把內容切塊,每塊單獨判斷。
9. Gold Standard Documents
golden: boolean
Flag for indicating that the document is a gold-standard document.
某些文件被人工標記為”金標準”——在訓練中獲得額外權重。King 推測可能與 Quality Raters 有關,但沒有直接證據連線兩者。
八、其他機制
Whitelist 機制
Google 對特定敏感話題有白名單:
- 選舉內容(isElectionAuthority)
- COVID-19(isCovidLocalAuthority)
- 旅遊(有專門標記)
Sandbox 的真實情況
hostAge: "used to sandbox fresh spam in serving time"
欄位描述原文是 “sandbox fresh spam“——不是 “sandbox all new sites”。
Google 官方說”沒有 sandbox”不完全是謊言——確實沒有”所有新站的 sandbox”。hostAge 是針對 fresh spam 的 sandbox 機制。
smallPersonalSite
smallPersonalSite: Score of small personal site promotion
go/promoting-personal-blogs-v1
注意:欄位描述裡出現的是 “promotion”(提升),不是 “demotion”(降級)。 欄位真實,但具體用途未公開,多家 SEO 分析表示 “Unclear what this is used for”。
九、Mike King 的文末三條建議
1. 不要盲信 Google 官方發言
“Google spokespeople are well-meaning, but can we trust them? The quick answer is not when you get too close to the secret sauce.”
2. 真正的排名是多層疊加,不是單一演算法
Ascorer(主演算法)+ 多層 Twiddlers(Panda、NavBoost、QualityBoost…)疊加的結果。
3. 重新評估你的外部連結策略
“It is a very good time to reconsider your link building programs based on everything you’ve just read.”
更多整理的一手資訊來源:2026Googleseo排名
獨立Google SEO專家,ylsseo.com創始人,基於Google專利、IR與API Leak解讀排名機制,中文SEO啟蒙第一人。