Google Search Appliance 对“robots.txt”文件的访问权

3 sec read

如果网络服务器配置为要求对所有 HTTP 或 HTTPS 请求进行身份验证,请确保创建格式与“/robots.txt”文件匹配的身份验证规则。

为了遵循“漫游器排除协议”,抓取工具将会检索 /robots.txt。如果结果是获得 HTTP 401(需要身份验证)响应代码,抓取工具将无法抓取网站上其他任何网址。如果访问 /robots.txt 的结果是 HTTP 200(成功)或 HTTP 404(未找到)响应代码,就可以对那个 HTTP 或 HTTPS 网站的内容继续进行抓取。 

如果网站需要对所有请求进行身份验证,并且不存在与 /robots.txt 匹配的身份验证规则,抓取工具将会收到 HTTP 401 响应代码并且无法抓取网站上其他网址。

打赏作者
微信支付标点符 wechat qrcode
支付宝标点符 alipay qrcode

Windows、Manjaro双系统的安装

最近把家里的电脑重新进行了安装,一开始只安装了Manjaro,原本计划彻底放弃Windows,但是发现纯粹用L
11 sec read

Ubuntu重新使用记录

最近在自己的工作电脑上安装了Linux子系统,由于Microsoft Store没有ArchLinux或Man
1 min read

Windows Linux子系统与Anaconda

公司平时的办公环境是Windows,最近在使用Anaconda遇到的问题是一些Python包无法在Window
22 sec read

发表评论

电子邮件地址不会被公开。 必填项已用*标注