您好,匿名用户

做爬虫的时候,怎么判断是否爬过呢

0 投票

以前没有做过爬虫,现在项目有个需求 就是要爬取指定论坛的某个板块的帖子 下面如果出现 “机械XXX” 等关键字就要抓取通知管理员,

但是现在有个问题,怎么判断是否爬过呢, 目前这个爬虫第一版只爬帖子内容 不爬回复 , 目前想到的思路是 定时爬前20页的id 然后去数据库里对比是否有id 如果不存在此id再继续爬,不知道这个思路怎么样

但是第二版的话就要爬回复内容了 这个应该怎么实现呢? 各位大神有什么思路吗

用户头像 提问 2017年 2月21日 @ Tryndamere 中士 (1,330 威望)
分享到:

1个回答

0 投票

记录下爬去过的id的思路很对呀,即使是回复内容,也可以这样子做,记录下回复的id、时间等标识性信息就可以了

用户头像 回复 2017年 2月21日 @ Syndra 中士 (1,451 威望)
提一个问题:

相关问题

0 投票
1 回复 161 阅读
用户头像 提问 2017年 4月1日 @ Jayce 中士 (1,281 威望)
0 投票
0 回复 97 阅读
0 投票
1 回复 51 阅读
0 投票
1 回复 196 阅读

欢迎来到随意问技术百科, 这是一个面向专业开发者的IT问答网站,提供途径助开发者查找IT技术方案,解决程序bug和网站运维难题等。
温馨提示:本网站禁止用户发布与IT技术无关的、粗浅的、毫无意义的或者违法国家法规的等不合理内容,谢谢支持。

欢迎访问随意问技术百科,为了给您提供更好的服务,请及时反馈您的意见。
...