[筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 為什麼抓不到動態資料

章節連結

斷斷續續地在網路和書籍上學習有關 Python 的爬蟲技術,但隨著反爬蟲的技術也是越來越精進,所以想說藉由 「超新手也能用 Python 爬蟲打造貨比千家的比價網站」這門課來看看能否解決相關的疑惑。這篇講述動態資料的問題。
python


課程相關資訊

[連結]:https://hiskio.com/courses/527/lectures/27141

本篇範圍:Chapter 3 ( 由前端 JavaScript 產生的資料,動態網站爬蟲實現 )

請注意:本系列文章為個人對應課程的消化吸收後,所整理出來的內容。換言之,並不一定會包含全部的課程內容,也有可能會添加其他資源來說明。


筆記

1. 動態網頁是指瀏覽器取得 HTML 後,才透過 JavaScript 去取得一些動態更新的資料。( Client-Side Rendering )
2. 跟靜態網頁不同的是「網頁上的資料產生的時間點」
3. 瀏覽器收到內容後,會先產生一個相對空白的頁面,這也是利用 Python 攔截到的 Response 的畫面。不能算是準確地爬到資料
4. 如何判斷是否為動態網頁?藉由開發者工具→齒輪圖示→關閉 JavaScript→重新整理畫面,如果你發現畫面上的資料有所差異,那就有機會是使用動態網頁技術
5. 從模擬瀏覽器→模擬使用者開啟瀏覽器;利用 Python 模擬 JavaScript 拉資料的流程


系列文章

  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 資料科學與網頁爬蟲
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 資料清理與整理
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 觀察 API 並透過 Python 取得資料 – Pchome 24H 購物為例
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 觀察 API 並透過 Python 取得資料
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 網頁爬蟲的起源和處理策略
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 爬取動態的電商網站 ( 蝦皮購物 )
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 把全部的資料爬回來 ( 2 )
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 把全部的資料爬回來 ( 1 )
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 從網頁溝通架構到爬蟲運作原理
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 將資料存成外部 csv xlsx 檔案
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 將資料存到資料庫系統中
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 存到 MySQL 資料庫實作
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 在靜態網站中獲取資訊 2
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 在靜態網站中獲取資訊
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 友善與惡意爬蟲
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 利用 Requests 模擬請求和攔截回應
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 利用 Pandas 實現資料前處理
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 利用 BeautifulSoup 來解析網頁原始碼
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – 儲存到 Google Spreadsheet
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – Selenium 的簡介
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – Selenium 套件和環境設置
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – Python 與爬蟲環境準備
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – Python 的基本語法
  • [筆記] 超新手也能用 Python 爬蟲打造貨比千家的比價網站 – Pandas 操作範例
  • 按讚加入粉絲團

    延伸閱讀