设置了连续点击,每个回复下面的回复,每个回复都产生了一个XML只有最后一个XML是最终完整的,请问这个可以避免吗?或者怎么设置?

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有帐号?立即注册

x
举报 使用道具
| 回复

共 1 个关于本帖的回复 最后回复于 2018-2-12 15:58

沙发
Fuller 管理员 发表于 2018-2-12 15:58:02 | 只看该作者
这个避免不了。

通常情况下,一个网页生成一个结果文件。

但是,如果有连续动作,没做一轮循环,就会产生一个结果文件。如果在动作过程中,网页内容越来越多,那么生成的结果文件就会越来越大。必须导入到数据库以后进行过滤。

对于旗舰版用户,在点击动作和滚屏动作中有个高级选项:清除老数据,参看《抓取瀑布流网站是清除老数据》,但是不能使用你这个情况,你是点击展开所有回复,如果清除老数据,那么有些还没有被点开的内容就被清除了
举报 使用道具
您需要登录后才可以回帖 登录 | 立即注册

精彩推荐

  • 怎样让GooSeeker分词工具使用宋体画词云图
  • 使用BERTopic时遇到的c-TF-IDF是什么?
  • gooseeker分词工具的命名实体识别和词形还
  • 怎样设置LDA模型的超参数alpha(α)和beta(
  • LDA主题分析模型到底是什么?

热门用户

GMT+8, 2026-5-31 08:03