程序开发 · 2024年6月10日

Scrapy CrawlSpider 中 deny 设置为何无效?

Scrapy CrawlSpider 中 deny 设置为何无效?

大家好,今天本人给大家带来文章,文中内容主要涉及到,如果你对文章方面的知识点感兴趣,那就请各位朋友继续看下去吧~希望能真正帮到你们,谢谢!

scrapy crawlspider 中的 deny 设置为何无效

问题中提到的 deny 设置无效是因为 deny 参数的值没有采用正则表达式。

在 scrapy 的 crawlspider 中,deny 参数用于指定不应被爬取的 url 模式。如果 deny 参数没有使用正则表达式,那么它只能够匹配完全相等的 url。

因此,如果希望 deny 参数能够匹配包含特定字符串的 url,就需要使用正则表达式。例如,如果要拒绝包含 “guba” 字符串的 url,可以将 deny 参数设置为以下正则表达式:

deny=(r'.*guba.*',)

本篇关于《Scrapy CrawlSpider 中 deny 设置为何无效?》的介绍就到此结束啦,但是学无止境,想要了解学习更多关于文章的相关知识,请关注公众号!