Fetch real-time data from 100+ websites,No development or maintenance required.
Over 100 million real residential IPs from genuine users across 190+ countries.
SCRAPING SOLUTIONS
Get accurate and in real-time results sourced from Google, Bing, and more.
With 120+ prebuilt and custom scrapers ready for any use case.
No blocks, no CAPTCHAs—unlock websites seamlessly at scale.
Execute scripts in stealth browsers with full rendering and automation
PROXY INFRASTRUCTURE
Over 100 million real residential IPs from genuine users across 190+ countries.
Reliable mobile data extraction, powered by real 4G/5G mobile IPs.
For time-sensitive tasks, utilize residential IPs with unlimited bandwidth.
Fast and cost-efficient IPs optimized for large-scale scraping.
SCRAPING SOLUTIONS
PROXY INFRASTRUCTURE
DATA FEEDS
Full details on all features, parameters, and integrations, with code samples in every major language.
LEARNING HUB
ALL LOCATIONS Proxy Locations
TOOLS
RESELLER
Get up to 50%
Contact sales:partner@thordata.com
Products $/GB
Fetch real-time data from 100+ websites,No development or maintenance required.
Get real-time results from search engines. Only pay for successful responses.
Execute scripts in stealth browsers with full rendering and automation.
Bid farewell to CAPTCHAs and anti-scraping, scrape public sites effortlessly.
Dataset Marketplace Pre-collected data from 100+ domains.
Over 100 million real residential IPs from genuine users across 190+ countries.
Reliable mobile data extraction, powered by real 4G/5G mobile IPs.
For time-sensitive tasks, utilize residential IPs with unlimited bandwidth.
Fast and cost-efficient IPs optimized for large-scale scraping.
Data for AI $/GB
Pricing $0/GB
Docs $/GB
Full details on all features, parameters, and integrations, with code samples in every major language.
Resource $/GB
EN $/GB
产品 $/GB
AI数据 $/GB
定价 $0/GB
产品文档 $/GB
资源 $/GB
简体中文 $/GB

一個品牌保護團隊的監控平台,在整個區域的仿冒品浪潮持續九天未被偵測的期間,始終回報 95% 以上的採集成功率。根根因沒有什麼高深之處:資料中心 IP 拿到的是錯誤的區域型錄、成功指標量的是請求而非覆蓋、警報跑在把資料缺口「插值」到看不見的管線上。本文是事故始末、替換後的架構,以及防止它再度發生的季度檢查問題清單。
事故复盘通常寫的是系統掛掉。這一篇寫的是「沉默」——九天裡,一個為了抓仿冒品而建的平台,每天回報一切正常。
背景:一家中型消費品牌、品牌保護團隊,以及每晚對六個歷史上仿冒品最常出現的電商平台執行的巡檢爬蟲。事故期間每一晚,這套爬蟲都回報 95% 以上的成功率。
| 天數 | 實際發生的事 | 儀表板顯示 |
|---|---|---|
| 0 | 仿冒賣家以近似品牌名上架 40 個 SKU,瞄準品牌第二大市場區域 | 「爬取完成,成功率 96%」 |
| 1–2 | 每晚爬蟲以資料中心 IP 訪問平台;平台對這類流量提供縮減、鎖區的型錄 | 「爬取完成,成功率 95%」 |
| 3–4 | 受影響區域的品類頁悄悄出現資料缺口;儀表板的插值邏輯用前一天的清單補上空格 | 「未偵測到新仿冒商品」 |
| 5 | 當地經銷夥伴寄信通報明顯假貨;人工調查展開 | 「未偵測到新仿冒商品」 |
| 6–8 | 下架申請準備與送出;監控依然失明,因為採集仍然打到錯的型錄 | 「爬取完成,成功率 94%」 |
| 9 | 工程師手動把採集釘選到正確區域;仿冒商品立刻出現在資料裡 | 「偵測到 41 筆仿冒商品——首次出現於 9 天前」 |
九天的仿冒銷售、一次由夥伴而非平台觸發的發現,以及一個比事故本身更難消化的信任問題。最貴的部分不是那些假貨——而是發現儀表板原來一直悄悄地錯著。
根因一:採集對地理是盲的。 爬蟲跑在不帶地理定位的資料中心 IP 上。大型電商平台按地區提供不同型錄——也給不同的流量待遇。一個「成功」回應若拿到的是錯誤區域的型錄,比失敗的請求更糟,因為它看起來像資料。區域性仿冒活動,恰恰就是躲在你沒被服務到的那份型錄裡的訊號。
根因二:成功指標量的是請求,不是覆蓋。 95% 的請求成功率,與「仿冒浪潮所在區域覆蓋率 0%」完全相容。團隊裡沒有人問過「昨晚我們實際看到了 X 區域多少比例的活躍商品?」——因為工具不回答這個問題,儀表板也不問。
根因三:插值把缺口變成隱形。 當某頁資料缺漏,管線會沿用前一晚的商品清單。缺口消失了;從未被採集到的仿冒商品,也就永遠沒有機會觸發警報。插值是展示層的便利功能,但一旦餵進警報邏輯,它就變成監控完整性上的 bug。
重建工作用三個不同的層,各自對付一個根因。
第一層——採集骨幹的地理保真度。 採集改走釘選到監控區域的住宅 IP,支援國家、州、城市與 ASN 層級定位。Thordata 的住宅網路擁有 1 億以上 IP、涵蓋 190 多個國家,支援最長 90 分鐘的黏性連線(登入牆後的賣場區域需要),價格採公開滑桿:1 GB 時 $2.00/GB,5,000 GB 時降至 $0.65/GB——區域掃描的成本線性成長,不必再為「先監控哪個區域」做預算分配。地理定位不額外收費,新增一個監控區域是改設定,不是走採購。
第二層——大型平台用按結果計費的現成爬蟲。 對主要平台,團隊改用現成爬蟲(Thordata 目錄超過 120 個目標,涵蓋主要電商平台),驗證碼破解與 JavaScript 渲染全部內建,按交付結果計費:入門量約 每 1,000 筆 $1.00,量價約 $0.50。頁面失敗時一毛不收——「失敗嘗試燒預算」這個失效模式被整個退役。
第三層——覆蓋率成為主要指標。 儀表板改為追蹤「每區域、每品類、每晚實際看到的商品數」,而不是請求成功率。商品可見數下降會觸發警報,即使每個請求都「成功」——這正是當初藏住仿冒浪潮的那個失效模式。
一段釘選地理的掃描程式:
import requests
# 端點字串由控制台的端點產生器生成,釘選到監控區域
REGION_PROXIES = {
"region-a": "http://USER-geo-de-berlin:PASS@res.thordata.com:18000",
"region-b": "http://USER-geo-sg-singapore:PASS@res.thordata.com:18000",
}
def sweep_region(region: str, category_urls: list[str]):
seen = []
for url in category_urls:
r = requests.get(
url,
proxies={"http": REGION_PROXIES[region]},
timeout=30,
)
seen.extend(parse_listings(r.text)) # 採集該區域實際供應的內容
coverage_log(region, seen) # 餵給覆蓋率指標,而非只有「成功」
return seen
與舊爬蟲的差別是一行程式碼的意圖:掃描記錄的是「看到了什麼」,而不只是「回應了什麼」。
第四層——搜尋側的監控。 仿冒品不只存在於賣場頁面;假店與付費廣告也會出現在搜尋結果裡。團隊加入 SERP 監控解決方案,跨目標區域監看品牌關鍵字——自然結果、廣告、購物版位——量價約 每 1,000 次結構化回應 $0.70。一個競標品牌詞的山寨網域,現在與賣場商品清單出現在同一個儀表板裡,補上了事故暴露的破口:仿冒商品早在賣場上架前幾天就出現在搜尋廣告裡了,而當時沒有任何人在看那個頻道。
團隊的季度審查現在跑一份固定的問題清單,而這些問題可以推廣到任何地理敏感的監控工作負載:
我們怎麼知道自己看到的是正確的型錄? 區域釘選加上抽查:每個監控區域每季由人工確認一次,採集到的型錄與當地使用者看到的一致。自動化則靠覆蓋率指標在兩次審查之間抓漂移。
昨晚實際看到多少比例的活躍商品? 每區域每品類每晚的覆蓋率,做成趨勢。任何一夜跌幅超過門檻就觸發調查,與請求成功率無關。
插值在哪裡碰到了警報邏輯? 依規範:哪裡都不行。沿用資料可以畫在歷史圖表上,但警報只評估新採集的紀錄。光是這一條規則,就能讓原本的事故在第 2 天而不是第 9 天爆開。
誰在看搜尋層? 品牌關鍵字與仿冒高風險產品詞,透過持續 SERP 資料爬取服務按排程追蹤,結構化結果流入與賣場資料相同的警報體系。已知惡意網域出現廣告投放,與仿冒商品清單同級告警。
整套監控姿態要花多少錢? 比那次事故便宜。一個覆蓋六個平台、四個區域、外加搜尋側監控的方案,按公開費率算每月落在數千美元等級——住宅流量走滑桿、平台資料按交付結果、SERP 資料按結構化筆數透過 SERP 監控管線。那次九天事故,光下架法務工作就不止這個錢。
這個平台從未大聲故障。它安靜地、成功地採集著錯誤的資料。如果你的監控量的是請求成功率而不是區域覆蓋率、用插值把缺口抹成隱形、並透過地理盲的基礎設施採集——你的 95% 儀表板,此刻可能正藏著一次九天的仿冒浪潮。先修指標,再修基礎設施,最後補上搜尋頻道——而 Thordata 爬蟲與 SERP API 的免費試用額度,讓你可以在下個季度審查之前,把三層全部驗證一遍。
Looking for
Top-Tier Residential Proxies?
您在寻找顶级高质量的住宅代理吗?
Proxy Rotation Strategy for Web Scraping: When to Rotate IPs and When to Keep a Session
Build a practical proxy rotati ...
Jenny Avery
2026-09-24
How to Scrape Amazon Product Data for Price and Availability Monitoring
Learn how to build an Amazon p ...
Jenny Avery
2026-09-24
Residential Proxy vs Datacenter Proxy: Key Differences Explained
Learn the differences between ...
flora
2026-09-23
同一份工作負載,三種公司規模:Decodo 與 Thordata 的分階段計價
「哪個抓取平台更便宜」是錯的問題,因為答案隨成長而變。
Xyla Huxley
2026-09-22
行動 IP 是另一種產品:4G/5G、住宅與資料中心的訊號報告
買代理的人把「住宅」與「行動」當成同一種東西的兩個價格帶。
Xyla Huxley
2026-09-22
直接抄走這份設計文件:不會過時的影片推薦訓練資料
多數影片推薦系統的衰退,不是模型錯了,而是訓練資料凍住了—— ...
Xyla Huxley
2026-09-22
為什麼你的商品 Feed 永遠對不上供應商的:一份現場診斷
目錄錯配——同一個商品以三筆不同紀錄存在於你的 Feed、供 ...
Xyla Huxley
2026-09-22
90 秒完售:搶購監控團隊在倒數開始前就做錯的事
限量發售——球鞋、主機補貨、演唱會門票——是電商裡最惡劣的資 ...
Xyla Huxley
2026-09-22
Same Workload, Three Sizes of Company: Decodo and Thordata Priced at Every Stage
"Which scraping platform is ch ...
Xyla Huxley
2026-09-21