程序开发 · 2024年6月10日

Scrapy CrawlSpider 中 deny 设置为何无效？

Scrapy CrawlSpider 中 deny 设置为何无效？

大家好，今天本人给大家带来文章，文中内容主要涉及到，如果你对文章方面的知识点感兴趣，那就请各位朋友继续看下去吧~希望能真正帮到你们，谢谢！

scrapy crawlspider 中的 deny 设置为何无效

问题中提到的 deny 设置无效是因为 deny 参数的值没有采用正则表达式。

在 scrapy 的 crawlspider 中，deny 参数用于指定不应被爬取的 url 模式。如果 deny 参数没有使用正则表达式，那么它只能够匹配完全相等的 url。

因此，如果希望 deny 参数能够匹配包含特定字符串的 url，就需要使用正则表达式。例如，如果要拒绝包含 “guba” 字符串的 url，可以将 deny 参数设置为以下正则表达式：

deny=(r'.*guba.*',)

本篇关于《Scrapy CrawlSpider 中 deny 设置为何无效？》的介绍就到此结束啦，但是学无止境，想要了解学习更多关于文章的相关知识，请关注公众号！

标签： 100Gbps服务器 24/7支持 CDN服务 EPYC处理器 IP传输 NVMe存储 VPS服务器专用服务器全球服务器即时部署数据中心托管数据隐私服务器折扣灵活支付高速带宽

您可能还喜欢...