HeyBlogBot 爬虫与网站检测协议
- 创建时间
本页内容
适用范围
本协议说明 HeyBlogBot 和 HeyBlog 使用的其他自动化程序如何发现、访问和检测公开博客站点。
爬虫取得的数据仅用于博客目录的发现、核验、展示和维护。数据字段、权利边界和下架流程见 数据使用、公开目录与下架声明,检测结果的含义见 站点发现与检测说明。
公开访问范围
HeyBlogBot 可能从已收录博客主动公开的友情链接中发现候选站点,并访问:
- 候选站点主页。
- 公开的 RSS、Atom、JSON Feed 等订阅入口。
- 公开的站点地图。
- 公开的友情链接页面。
- 完成跳转确认和可访问性检查所需的公开地址。
爬虫仅访问无需登录或额外授权即可取得的内容,不访问管理后台、私密页面或其他非公开区域。
可能取得的信息
自动访问可能取得:
- 站点名称、网址、域名和公开简介。
- 订阅源、站点地图和友链入口。
- 公开显示的分类、标签、站点标识和技术信息。
- HTTP 状态、内容类型、重定向、响应时间和检测时间。
- 判断博客类型及公开更新时间所需的最少页面信息。
程序可能临时解析页面或订阅内容以识别上述字段,但不以长期保存、建立镜像或重新发布完整文章为目的。
爬虫不会从非公开渠道补充信息,不推断站长的真实身份或年龄,也不主动提取身份证号、详细住址、私人联系方式等与目录维护无关的信息。
Robots Exclusion Protocol
HeyBlog 将 RFC 9309 Robots Exclusion Protocol 及站点针对 HeyBlogBot 提供的适用规则作为自动访问控制信号。
- 存在专门针对
HeyBlogBot的规则时,优先适用该规则。 - 没有专门规则时,按照协议解释适用的通用规则。
robots.txt无法取得、格式错误或含义不明确时,采用保守访问范围并限制重试。- 页面或响应中存在适用的索引限制信号时,项目会在目录展示和缓存范围内评估处理。
- 站点运营者通过邮箱提出可核验的更严格限制时,以该限制为准。
允许自动访问仅表示站点给出的技术访问偏好,不代表授予复制、重新发布或处理无关信息的许可。
访问控制
HeyBlogBot 遵循以下边界:
- 控制同一站点的请求频率和并发,使用缓存、退避和失败重试上限。
- 尊重
401、403、429、Retry-After及其他明确限制信号。 - 原则上仅使用完成发现和检测所需的
GET、HEAD等读取请求。 - 不提交表单,不发表评论,不创建账号,不修改来源站点状态。
- 不绕过登录、验证码、访问控制、反爬措施或其他技术限制。
- 不进行端口扫描、漏洞利用、口令尝试、压力测试或其他侵入式检测。
- 对响应体大小、请求时长和重定向次数设置合理上限。
爬虫实际实现、调度和代理配置应与本协议保持一致。
网站检测边界
网站检测仅用于辅助判断:
- 站点及公开入口能否访问。
- 地址是否发生重定向、迁移或长期失效。
- 订阅源、站点地图和友链页面是否存在及格式是否可识别。
- 公开信息是否与目录记录存在明显差异。
- 与目录维护直接相关的更新时间和技术状态。
检测不是安全审计、漏洞扫描、内容审查、质量认证或持续可用性保证。网络波动、地域限制、站点策略和临时故障均可能导致误判。
记录与保存
为去重、排错和维护目录,项目可能记录站点地址、发现来源、检测时间、请求结果、重定向目标、公开元数据、状态变化和必要错误日志。
记录仅保存至候选审核、目录维护、故障排查和执行停止抓取所需期间。为防止重复访问而保留的限制记录仅包含站点地址、限制状态、时间和必要依据。
停止抓取与纠错
站点运营者可以:
- 在
robots.txt中为HeyBlogBot设置规则。 - 使用适用的页面级或响应级索引限制信号。
- 发送邮件至 contact@mail.heyblog.net 提出停止抓取、调整访问、纠正检测结果或移除目录资料。
邮件建议使用 [停止抓取],并说明站点地址和处理诉求。项目可以通过域名邮箱、站点验证信息、DNS 记录或其他低风险方式确认控制权,一般不要求身份证件。
收到明确且可核验的请求后,项目会停止或调整抓取,并按请求和适用规则处理现有目录资料。紧急风险可以先行停止访问。
协议更新
爬虫标识、访问范围、频率控制、检测方式或退出机制发生实质变化时,项目会更新本协议。页面顶部的 update_time 表示最近一次实质修订日期。