004.jpg
003.jpg
设置了连续点击,每个回复下面的回复,每个回复都产生了一个XML只有最后一个XML是最终完整的,请问这个可以避免吗?或者怎么设置?
举报 使用道具
| 回复

共 1 个关于本帖的回复 最后回复于 2018-2-12 15:58

Fuller 管理员 发表于 2018-2-12 15:58:02 | 显示全部楼层
这个避免不了。

通常情况下,一个网页生成一个结果文件。

但是,如果有连续动作,没做一轮循环,就会产生一个结果文件。如果在动作过程中,网页内容越来越多,那么生成的结果文件就会越来越大。必须导入到数据库以后进行过滤。

对于旗舰版用户,在点击动作和滚屏动作中有个高级选项:清除老数据,参看《抓取瀑布流网站是清除老数据》,但是不能使用你这个情况,你是点击展开所有回复,如果清除老数据,那么有些还没有被点开的内容就被清除了
举报 使用道具
您需要登录后才可以回帖 登录 | 立即注册

精彩推荐

  • Gephi社会网络分析-马蜂窝游记文本分词并同
  • Gephi社会网络分析-基于马蜂窝游记文本以词
  • 知乎话题文本根据词语间距筛选后生成共词矩
  • 马蜂窝游记文本分词后以词语间距为筛选条件
  • 学习使用apriori算法挖掘关联关系

热门用户

GMT+8, 2024-3-29 23:42