Scrapy爬取速度慢(每分钟60页)pythonhttpscrapyweb-crawler88我使用Scrapy爬取网站速度较慢(约1页/秒)。我正在从AWS服务器上爬取一家大型网站,所以我不认为这是网络问题。 CPU利用率远未达到100%,如果我启动多个Scrapy进程,则爬行速度会更快。
Scrapy似乎会爬行一堆页面,然后停滞几秒钟,然后重复。
我尝试了调整以下参数:
CONCURRENT_REQUESTS = CONCURRENT_REQUESTS_PER_DOMAIN = 500
但是这似乎不能将速度提高到20页以上。
- somewire2哪个Scrapy版本?有使用非默认的扩展/中间件吗?暂停可能是某些阻塞代码,你是否在反应器线程中执行一些阻塞Scrapy操作(例如写入数据到数据库、上传到S3等)? - Shane Evans@somewire 可以通过仅使用scrapping而不解析lxml页面来检查CPU|HDD|网络利用率。设置 LOG_LEVEL = 'DEBUG'。 - b1_1个回答22您确定可以以高速爬取目标网站吗?许多网站实施下载阈值,并在一段时间后开始响应缓慢。
- gvtech1如果请求返回503并且前端服务器是nginx http://nginx.org/en/docs/http/ngx_http_limit_conn_module.html,那么你是正确的。 - b1_回答链接网页内容由stack overflow 提供, 点击上面的可以查看英文原文,