HeyBlogBot 爬虫与网站检测协议

创建时间
本页内容

适用范围

本协议说明 HeyBlogBot 和 HeyBlog 使用的其他自动化程序如何发现、访问和检测公开博客站点。

爬虫取得的数据仅用于博客目录的发现、核验、展示和维护。数据字段、权利边界和下架流程见 数据使用、公开目录与下架声明,检测结果的含义见 站点发现与检测说明

公开访问范围

HeyBlogBot 可能从已收录博客主动公开的友情链接中发现候选站点,并访问:

  • 候选站点主页。
  • 公开的 RSS、Atom、JSON Feed 等订阅入口。
  • 公开的站点地图。
  • 公开的友情链接页面。
  • 完成跳转确认和可访问性检查所需的公开地址。

爬虫仅访问无需登录或额外授权即可取得的内容,不访问管理后台、私密页面或其他非公开区域。

可能取得的信息

自动访问可能取得:

  • 站点名称、网址、域名和公开简介。
  • 订阅源、站点地图和友链入口。
  • 公开显示的分类、标签、站点标识和技术信息。
  • HTTP 状态、内容类型、重定向、响应时间和检测时间。
  • 判断博客类型及公开更新时间所需的最少页面信息。

程序可能临时解析页面或订阅内容以识别上述字段,但不以长期保存、建立镜像或重新发布完整文章为目的。

爬虫不会从非公开渠道补充信息,不推断站长的真实身份或年龄,也不主动提取身份证号、详细住址、私人联系方式等与目录维护无关的信息。

Robots Exclusion Protocol

HeyBlog 将 RFC 9309 Robots Exclusion Protocol 及站点针对 HeyBlogBot 提供的适用规则作为自动访问控制信号。

  • 存在专门针对 HeyBlogBot 的规则时,优先适用该规则。
  • 没有专门规则时,按照协议解释适用的通用规则。
  • robots.txt 无法取得、格式错误或含义不明确时,采用保守访问范围并限制重试。
  • 页面或响应中存在适用的索引限制信号时,项目会在目录展示和缓存范围内评估处理。
  • 站点运营者通过邮箱提出可核验的更严格限制时,以该限制为准。

允许自动访问仅表示站点给出的技术访问偏好,不代表授予复制、重新发布或处理无关信息的许可。

访问控制

HeyBlogBot 遵循以下边界:

  • 控制同一站点的请求频率和并发,使用缓存、退避和失败重试上限。
  • 尊重 401403429Retry-After 及其他明确限制信号。
  • 原则上仅使用完成发现和检测所需的 GETHEAD 等读取请求。
  • 不提交表单,不发表评论,不创建账号,不修改来源站点状态。
  • 不绕过登录、验证码、访问控制、反爬措施或其他技术限制。
  • 不进行端口扫描、漏洞利用、口令尝试、压力测试或其他侵入式检测。
  • 对响应体大小、请求时长和重定向次数设置合理上限。

爬虫实际实现、调度和代理配置应与本协议保持一致。

网站检测边界

网站检测仅用于辅助判断:

  • 站点及公开入口能否访问。
  • 地址是否发生重定向、迁移或长期失效。
  • 订阅源、站点地图和友链页面是否存在及格式是否可识别。
  • 公开信息是否与目录记录存在明显差异。
  • 与目录维护直接相关的更新时间和技术状态。

检测不是安全审计、漏洞扫描、内容审查、质量认证或持续可用性保证。网络波动、地域限制、站点策略和临时故障均可能导致误判。

记录与保存

为去重、排错和维护目录,项目可能记录站点地址、发现来源、检测时间、请求结果、重定向目标、公开元数据、状态变化和必要错误日志。

记录仅保存至候选审核、目录维护、故障排查和执行停止抓取所需期间。为防止重复访问而保留的限制记录仅包含站点地址、限制状态、时间和必要依据。

停止抓取与纠错

站点运营者可以:

  • robots.txt 中为 HeyBlogBot 设置规则。
  • 使用适用的页面级或响应级索引限制信号。
  • 发送邮件至 contact@mail.heyblog.net 提出停止抓取、调整访问、纠正检测结果或移除目录资料。

邮件建议使用 [停止抓取],并说明站点地址和处理诉求。项目可以通过域名邮箱、站点验证信息、DNS 记录或其他低风险方式确认控制权,一般不要求身份证件。

收到明确且可核验的请求后,项目会停止或调整抓取,并按请求和适用规则处理现有目录资料。紧急风险可以先行停止访问。

协议更新

爬虫标识、访问范围、频率控制、检测方式或退出机制发生实质变化时,项目会更新本协议。页面顶部的 update_time 表示最近一次实质修订日期。