Python网络爬虫，我目前只能获取单个文件，为啥？-技术圈

点击上方“Python爬虫与数据挖掘”，进行关注

回复“书籍”即可获赠Python从入门到进阶共10本电子书

今

日

鸡

汤

归来池苑皆依旧，太液芙蓉未央柳。

大家好，我是皮皮。

一、前言

前几天在Python钻石交流群【Jethro Shen】问了一个Python网络爬虫的问题，这里拿出来给大家分享下。

他想获取全部文件，但是实际上，只能获取单个文件。

二、实现过程

这里【甯同学】给了一个解决思路，如下图所示：

后来【瑜亮老师】也提供了一种方法。

直接一步到位。

下面是具体的代码：

import requests
import time
from lxml import html
from lxml import etree

headers = {
    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/109.0.0.0 '
                  'Safari/537.36'}

def get_href_links(url):
    response = requests.get(url, headers=headers)
    page_content = response.content
    dom_tree = html.fromstring(page_content)
    href_links = dom_tree.xpath('//a/@href')
    return href_links

url = "https://mp.weixin.qq.com/s/BANHI5apQzlpeTTdLZAIvg"
urls = set(get_href_links(url)[1:-5])
mp3_d_url = 'https://res.wx.qq.com/voice/getvoice?mediaid={}'
for url in urls:
    response = requests.get(url, headers=headers)
    html = response.text
    selector = etree.HTML(html)
    voice_encode_fileid = selector.xpath('//mpvoice/@voice_encode_fileid')[0]
    name = selector.xpath('//mpvoice/@name')[0]
    d_url = mp3_d_url.format(voice_encode_fileid)
    response = requests.get(d_url)
    if response.status_code == 200:
        with open(name, 'wb') as f:
            f.write(response.content)
        print('{} 下载成功！'.format(name))
    else:
        print('{} 下载失败！'.format(name))
    time.sleep(1)  # 设置请求间隔时间为1秒，避免被封IP