字体
关灯
   存书签 书架管理 返回目录
格,他逐渐锁定了数据所在的标签类别和css名称。这是一个需要耐心和细心的“侦探”工作。
    第二、三天:编写第一个爬虫脚本(京东)。
    他先尝试抓取单页数据。代码大致如下:
    import requests
    from bs4 import BeautifulSoup
    import pandas as pd
    import time
    headers = {'User-Agent': 'Mozil/5.0...'} # 模拟浏览器请求头
    url = 'https://search.jd.com/...初中数学 教辅...' # 搜索URL
    response = requests.get(url, headers=headers)
    soup = BeautifulSoup(response.text, 'html.parser')
    books = []
    for item in soup.find_all('div', css_='gl-i-wrap'): # 根据实际css调整
    try:
    title = item.find('div', css_='p-name').em.get_text(strip=True)
    price = item.find('div', css_='p-price').strong.i.get_text()
    shop = item.find('div', css_='p-shop').span.get_text(strip=True) if item.find('div', css_='p-shop') else '未知'
    # 评价数有时在另一个标签里,需要更复杂的查找
    commit = item.find('div', css_='p-commit').strong.get_text(strip=True) if item.find('div', css_='p-commit') else '0'
    books.append([title, price, shop, commit])
    except AttributeEr

关闭+畅/阅读=模式,看最新完整内容。本章未完,请点击下一页继续阅读》》
上一页 目录 下一页