第二、三天:编写第一个爬虫脚本(京东)。
他先尝试抓取单页数据。代码大致如下:
import requests
from bs4 import BeautifulSoup
import pandas as pd
import time
headers = {'User-Agent': 'Mozil/5.0...'} # 模拟浏览器请求头
url = 'https://search.jd.com/...初中数学 教辅...' # 搜索URL
response = requests.get(url, headers=headers)
soup = BeautifulSoup(response.text, 'html.parser')
books = []
for item in soup.find_all('div', css_='gl-i-wrap'): # 根据实际css调整
try:
title = item.find('div', css_='p-name').em.get_text(strip=True)
price = item.find('div', css_='p-price').strong.i.get_text()
shop = item.find('div', css_='p-shop').span.get_text(strip=True) if item.find('div', css_='p-shop') else '未知'
# 评价数有时在另一个标签里,需要更复杂的查找
commit = item.find('div', css_='p-commit').strong.get_text(strip=True) if item.find('div', css_='p-commit') else '0'
books.append([title, price, shop, commit])
except AttributeEr