跳到主要内容

Cloudflare出新设置 允许拒AI爬虫不拦搜索引擎爬取保排名

19 0
AI摘要

Cloudflare推出“Disallow AI Training”设置,允许搜索引擎爬虫抓取内容但拒绝用于AI训练。苹果、谷歌、微软承诺遵守。该设置拦截非“Accountable”AI训练爬虫,可能影响网站搜索排名。多数客户无需更改,此前选择“Block”的网站自动迁移。谷歌将推出URL层级透明度工具,苹果、微软也计划推出类似功能。

网站管理员终于拿到了能够独立控制是否拒绝人工智能训练用的爬虫来抓取内容的开关, 但是官方方面同时也进行了警告, 说拦截这种类型的爬虫可能会产生拖累自己网站在搜索排名中的后果, 所以在到底想要保护自身内容的版权或者完整性, 还是想要继续保住现有的流量规模这个问题上, 广大网站的管理人员们正面临着一个新的需要做出选择的课题。

新设置正式开放

本次更新在对后台的管理环节中, 关于爬虫访问控制的那个板块里, 加进了“AI”这个选项, 它同原来的“允许”和“屏蔽”摆放在一起。

当你把这个功能打开的时候, 搜索引擎进行的正常爬取请求是不会受到干扰的, 网站里的内容依然会被收录以及索引, 只是针对AI大模型进行训练的那个专用爬虫请求, 会被直截了当地拒之门外。苹果公司、谷歌公司以及微软公司这三家, 都已经公开地做出了承诺, 表示它们旗下的那一些人工智能产品会尊重这一设置决定, 同时不会再对那些已经被标记为拒绝访问的站点内容, 去开展抓取工作的。

混合爬虫走问责通道

并不是说所有的和人工智能有关的爬虫程序都会受到那种不分青红皂白的全面拦截处理。
相关的管理部门其实还是允许那些混合着搜索功能和人工智能训练用途的爬虫程序继续去抓取数据的, 不过呢, 有个前提条件就是这些爬虫程序必须要在自己发送的请求标题里面老老实实地表明自己的身份是什么, 还要遵循那个叫做可以追责的原则, 也就是要白纸黑字地把数据是用来做什么的以及保存多长时间都公开说出来告诉大家。
没有通过这样一个标明身份的验证检查的人工智能训练用的爬虫程序, 就会被看作是违反规定的那些请求, 然后对方服务器就会返回403或者401这样的状态码来拒绝它。

搜索排名或受波及

官方在更新说明里面给了明确的提示, 说是在拦截了那些用来进行AI训练的爬虫之后, 搜索引擎那边负责分配流量的模型可能会重新来进行计算, 这样会导致部分网站的搜索排名出现短期下降的风险, 这个情况意味着站长在对那个拒绝按钮进行点击操作之前, 是需要去认真评估网站自身对搜索流量依赖程度的, 对于那些对SEO依赖程度非常高的网站来说, 可能需要在观察几周的后台数据之后再去做最后的决定。

存量客户零操作迁移

对于在此前于爬虫设置里选中过“Block”或者“Block on pages with ads”的站点, 系统将会自动地执行迁移行动, 把此类站点转移进入新的“AI”档位这个区间之中, 整个过程不需要管理员进行任何手动操作的介入。

有关官方表示出来的信息来看, 在执行完这种迁移行为之后, 其功能逻辑方面依然是保持完全一致的状态的, 也就是说, 那一些原先设定好的拦截规则还是会继续发挥效用的, 唯一发生变化的地方在于权限的颗粒度变得更为精细化了, 因此对于站长来说, 他们在随后任何时候都拥有着在后台界面上随意切换操作的权利, 既可以将其调整为“Allow”状态, 也能够将其调整为“Block”状态。

三大巨头各自推进透明度工具

谷歌官方发布消息, 明确表示在随后的几个星期之内将正式推出关于URL层级透明度方面的实用工具, 这一举措的主要目的是为了帮助网站管理者们能够以逐页查看的具体方式, 清晰地了解究竟有哪些人工智能相关的网络爬虫程序访问了哪些具体的网页页面。

登录后参与评论

评论仅开放给已登录并完成邮箱绑定的用户。

评论 0

暂无评论。