Robots.txt是搜索引擎爬虫访问网站时第一个查看的文件,它直接决定了爬虫能抓取哪些目录。配置错误会导致全站拒抓,配置正确则能引导爬虫优先抓取核心内容。
操作位置:网站根目录下创建名为 robots.txt 的文件,确保通过 http://你的域名/robots.txt 能够直接访问。
标准配置代码:
User-agent:
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /temp/
Disallow: /config/
Sitemap: http://你的域名/sitemap.xml
参数详解:
Sitemap是网站内容的导航表,通过XML格式列出所有需要收录的URL。对于百度和Google,Sitemap是提升新页面发现速度的核心工具。
你需要生成一个符合XML标准的文件。如果是动态网站,建议使用脚本自动生成。以下是一个标准的Sitemap.xml结构示例:
http://你的域名/
2023-10-25
daily
1.0
http://你的域名/article/1.html
2023-10-24
weekly
0.8
关键标签说明:
仅仅制作Sitemap是不够的,必须主动推送给百度。百度提供了普通收录接口,支持API推送。
接口地址:http://data.zz.baidu.com/urls?site=https://你的域名&token=你的准入密钥
获取Token:登录百度搜索资源平台(https://ziyuan.baidu.com/),进入【普通收录】获取准入密钥。
Linux/Curl推送命令:
curl -H 'Content-Type:text/plain' --data-binary @urls.txt "http://data.zz.baidu.com/urls?site=https://你的域名&token=你的准入密钥"
操作细节:
在服务器上创建一个 urls.txt 文件,每行放一个待推送的URL,不要超过1000行。执行上述命令后,百度会返回JSON格式的结果,例如 {"remain":499,"success":1},表示成功推送1条,今日剩余配额499条。
Google的提交相对简单。登录 Google Search Console(https://search.google.com/search-console),选择你的站点资源。
路径:左侧菜单 -> 站点地图 -> 在输入框填入 sitemap.xml -> 点击提交。

Google会立即进行抓取验证,并在页面显示处理状态(成功、无法找到、有错误)。如果出现错误,通常是因为XML格式错误或包含的URL无法访问。
结构化数据是帮助搜索引擎理解页面内容的“注释”。对于文章页,部署 Article 或 NewsArticle 结构化数据能显著提升收录率和展现效果。目前推荐使用 JSON-LD 格式,因为它不干扰HTML结构,加载速度快。
部署位置:将该代码块放置在 HTML 页面的
或 标签内即可,通常建议放在 底部。
参数实操说明:
验证工具:代码部署后,必须使用 Google 富媒体结果测试工具(https://search.google.com/test/rich-results)输入页面URL进行检测,确保无错误。
服务器响应速度直接影响爬虫的抓取效率。如果抓取超时,爬虫会直接放弃收录。以下是基于 Nginx 的优化配置,确保爬虫能高效获取内容。
配置文件位置:/etc/nginx/nginx.conf 或对应的站点配置文件。
server {
listen 80;
server_name 你的域名;
开启Gzip压缩,减少传输体积
gzip on;
gzip_vary on;
gzip_min_length 1k;
gzip_comp_level 6;
gzip_types text/plain text/css application/json application/javascript text/xml application/xml application/xml+rss text/javascript;
location / {
针对爬虫UA设置较长的缓存时间,减少重复请求压力
if ($http_user_agent ~ "Baiduspider|Googlebot|Sogou web spider") {
expires 1h;
}
确保返回正确的HTTP头
add_header X-Content-Type-Options nosniff;
反向代理或静态文件根目录
root /var/www/html;
index index.html index.php;
}
}
配置详解:
配置完成后,最后一步是模拟搜索引擎进行抓取诊断,确保所有环节畅通。不要只看浏览器显示,要用命令行查看HTTP响应头。
检测工具:使用 Linux 或 macOS 终端下的 curl 命令。
1. 检测首页状态码:
curl -I https://你的域名/
预期结果:必须返回 HTTP/1.1 200 OK。如果是 301 或 302,确保跳转链路正常。如果是 404 或 500,说明服务器配置错误,必须立即修复,否则无法收录。
2. 检测Robots.txt是否可访问:
curl -I https://你的域名/robots.txt
预期结果:返回 200 OK,且 Content-Type 为 text/plain。如果返回 404,请检查文件名是否正确或是否放置在根目录。
3. 检测Sitemap.xml内容:
curl -I https://你的域名/sitemap.xml
预期结果:返回 200 OK,Content-Type 应为 application/xml 或 text/xml。如果返回 403 Forbidden,请检查 Nginx 或 Apache 的权限配置,确保允许公开读取 XML 文件。
易频IT社区是综合性互联网IT技术门户网站,专注分享网络技术、服务器运维、网络安全、编程开发、系统架构、云计算、大数据等行业干货,实时更新IT行业资讯、零基础教程、实战案例,为IT从业者、技术爱好者提供专业的学习交流平台。
Copyright © 2021-2026 易频IT社区. All Rights Reserved. 备案号:闽ICP备2023013482号 网站地图