快捷导航
004.jpg
003.jpg
设置了连续点击,每个回复下面的回复,每个回复都产生了一个XML只有最后一个XML是最终完整的,请问这个可以避免吗?或者怎么设置?
举报 使用道具
| 回复

共 1 个关于本帖的回复 最后回复于 2018-2-12 15:58

Fuller 管理员 发表于 2018-2-12 15:58:02 | 显示全部楼层
这个避免不了。

通常情况下,一个网页生成一个结果文件。

但是,如果有连续动作,没做一轮循环,就会产生一个结果文件。如果在动作过程中,网页内容越来越多,那么生成的结果文件就会越来越大。必须导入到数据库以后进行过滤。

对于旗舰版用户,在点击动作和滚屏动作中有个高级选项:清除老数据,参看《抓取瀑布流网站是清除老数据》,但是不能使用你这个情况,你是点击展开所有回复,如果清除老数据,那么有些还没有被点开的内容就被清除了
举报 使用道具
您需要登录后才可以回帖 登录 | 立即注册

精彩推荐

  • 集搜客网络爬虫使用proxy切换IP防封锁
  • 用网络爬虫软件自动下载网页上的文件
  • 怎样用爬虫爬取亚马逊商品评论?
  • 新版集搜客网络爬虫图片下载功能
  • windows高清屏幕显示模糊的解决方法

热门用户

集搜客GooSeeker网络爬虫 ( 粤ICP备11065265号-2 )

GMT+8, 2019-2-20 11:20