資料知識地圖 · 2. 資料來源
爬蟲 / Log
網頁爬蟲與日誌收集
觀念教學
資料庫裡沒有的,就自己去收:對外用爬蟲抓網頁,對內收系統日誌。兩條「野生資料」補給線,量大、髒,但常常藏著金礦。
核心觀念
網頁爬蟲(Web Crawler)用程式自動抓取網頁,把 HTML 解析成可分析的欄位;日誌(Log)是系統自動記錄的事件流——點擊、API 呼叫、錯誤訊息,是使用者行為分析與除錯的第一手資料。共同課題:法律與倫理規範必須先過,再談技術。
白話理解
電商監控競品:爬蟲每天抓對手商品頁,解析品名與售價入庫;自家網站的點擊 Log 記錄「誰在哪頁停留多久」。兩路合流,就能分析「對手降價時,我的流量與轉換怎麼變」。
實務要點
- 爬蟲合規:尊重 robots.txt、控制請求頻率、不繞過登入與付費牆;抓到個資同樣受個資法管
- 爬取成功率要監控:網站改版、反爬機制都會讓爬蟲悄悄失效
- Log 格式先標準化:事件欄位定義好,省下事後解析的痛苦
- 日誌覆蓋率:關鍵行為沒被記到,就是分析的盲區
- 保留策略:Log 量大,要規劃保留週期與儲存成本
🎯 口訣:爬蟲抓外面、Log 記裡面;先問合不合法,再問抓不抓得到。
iPAS 考點
考「以爬蟲收集資料應注意什麼」——答案方向是法律與倫理(著作權、個資、網站使用條款),不是抓取速度。行為分析題:「分析使用者操作行為最適合的資料來源」——系統日誌/點擊流。陷阱:「公開網頁資料可任意商用」——公開不等於授權。