大家好,我有个问题想问问,我在爬https://tousu.sina.com.cn/index/search/?keywords=%E5%AE%89%E5%85%A8&t=1,先定义了第一级,爬取一千多一点就中断了,还有很多重复的,请问这个怎么解决。
举报 使用道具
| 回复

共 2 个关于本帖的回复 最后回复于 昨天 15:47

沙发
Fuller 管理员 发表于 昨天 15:45 | 只看该作者
你定义的采集任务名字是什么?发出来我可以从后台看一下。

这个网页是瀑布流的,往下滚动就会加载更多内容。这样网页会越来越大。旗舰版用户可以打开清除老数据功能,这样网页就不会越来越大。重复就会少很多。

这个网页使用的清除老数据的xpath是://*[@class='blackcat-con']


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有帐号?立即注册

x
举报 使用道具
板凳
Fuller 管理员 发表于 昨天 15:47 | 只看该作者
这个网址有几万条数据,对于瀑布流网页来说,太容易中断了,一般无法全部采集下来。另外,采集这样的网页的时候,爬虫窗口上面不要覆盖别的窗口,不能把窗口切换走。一切换走,很可能就不加载数据了
举报 使用道具
您需要登录后才可以回帖 登录 | 立即注册

精彩推荐

  • 为BERTopic安装需要的预训练SBERT模型
  • 在什么情况下使用弹窗模式和回退功能?
  • 爬网址做层级采集——以当当商品爬虫为例
  • 网络爬虫采集列表数据
  • UMAP的min_dist参数有什么作用?

热门用户

GMT+8, 2026-8-3 05:36