主题“文学评论文艺作品中国第二级“
为什么换了一个网页感觉做了所有的还是不断抓取出错呢?是我还是有什么地方没做到位吗?

举报 使用道具
| 回复

共 1 个关于本帖的回复 最后回复于 2018-6-12 11:24

沙发
bowieD 金牌会员 发表于 2018-6-12 11:24:16 | 只看该作者
应该是网页间的结构不一样,用规则加载采集失败的网页,看是哪个抓取内容失效了,再分析网页间的结构是哪里不同,从而修改规则。

另外不要给所有的抓取内容都勾上关键内容,这样遇到没有关键内容的网页就会匹配失败,给一个最常出现的字段勾上关键内容就可以了,比如书名
举报 使用道具
您需要登录后才可以回帖 登录 | 立即注册

精彩推荐

  • 360或火绒等杀毒软件导致GooSeeker爬虫软件
  • 话题分析(NMF模型和LDA模型)软件的安装和
  • 运行Apple无法验证的程序的方法
  • 文本聚类分析软件的安装和使用方法
  • 利用AI阅读和分析文本:扣子COZE记录用户反

热门用户

GMT+8, 2025-5-14 10:35