資料知識地圖 · 2. 資料來源

爬蟲 / Log

網頁爬蟲與日誌收集

在互動地圖中開啟 回資料知識地圖

觀念教學

資料庫裡沒有的,就自己去收:對外用爬蟲抓網頁,對內收系統日誌。兩條「野生資料」補給線,量大、髒,但常常藏著金礦。

核心觀念

網頁爬蟲(Web Crawler)用程式自動抓取網頁,把 HTML 解析成可分析的欄位;日誌(Log)是系統自動記錄的事件流——點擊、API 呼叫、錯誤訊息,是使用者行為分析與除錯的第一手資料。共同課題:法律與倫理規範必須先過,再談技術。

白話理解

電商監控競品:爬蟲每天抓對手商品頁,解析品名與售價入庫;自家網站的點擊 Log 記錄「誰在哪頁停留多久」。兩路合流,就能分析「對手降價時,我的流量與轉換怎麼變」。

實務要點

  • 爬蟲合規:尊重 robots.txt、控制請求頻率、不繞過登入與付費牆;抓到個資同樣受個資法管
  • 爬取成功率要監控:網站改版、反爬機制都會讓爬蟲悄悄失效
  • Log 格式先標準化:事件欄位定義好,省下事後解析的痛苦
  • 日誌覆蓋率:關鍵行為沒被記到,就是分析的盲區
  • 保留策略:Log 量大,要規劃保留週期與儲存成本
🎯 口訣:爬蟲抓外面、Log 記裡面;先問合不合法,再問抓不抓得到。

iPAS 考點

考「以爬蟲收集資料應注意什麼」——答案方向是法律與倫理(著作權、個資、網站使用條款),不是抓取速度。行為分析題:「分析使用者操作行為最適合的資料來源」——系統日誌/點擊流。陷阱:「公開網頁資料可任意商用」——公開不等於授權。

應用場景

網頁爬蟲日誌解析事件追蹤

評估指標

爬取成功率日誌覆蓋率

相關節點