谷歌搜索引擎优化 (SEO)创建并提交 robots.txt 文件_谷歌搜索引擎优化,SEO创建并提交,robots.txt,文件

您可以使用 robots.txt 文件控制抓取工具可以访问您网站上的哪些文件。robots.txt 文件应位于网站的根目录下。因此，对于网站 www.example.com，robots.txt 文件的路径应为 www.example.com/robots.txt。robots.txt 是一种遵循漫游器排除标准的纯文本文件，由一条或多条规则组成。每条规则可禁止或允许特定抓取工具抓取相应网站的指定文件路径下的文件。除非您在 robots.txt 文件中另行指定，否则所有文件均隐式允许抓取。

下面是一个包含两条规则的简单 robots.txt 文件：

User-agent: Googlebot

Disallow: /nogooglebot/

User-agent: *

Allow: /

Sitemap: http://www.example.com/sitemap.xml

以下是该 robots.txt 文件的含义：

1、名为 Googlebot 的用户代理不能抓取任何以 http://example.com/nogooglebot/ 开头的网址。

2、其他所有用户代理均可抓取整个网站。不指定这条规则也无妨，结果是一样的；默认行为是用户代理可以抓取整个网站。

3、该网站的站点地图文件路径为 http://www.example.com/sitemap.xml。

如需查看更多示例，请参阅语法部分。

创建 robots.txt 文件的基本准则

要创建 robots.txt 文件并使其在一般情况下具备可访问性和实用性，需要完成 4 个步骤：

1、创建一个名为 robots.txt 的文件。

2、向 robots.txt 文件添加规则。

3、将 robots.txt 文件上传到您的网站。

4、测试 robots.txt 文件。

创建 robots.txt 文件

您几乎可以使用任意文本编辑器创建 robots.txt 文件。例如，Notepad、TextEdit、vi 和 emacs 可用来创建有效的 robots.txt 文件。请勿使用文字处理软件，因为此类软件通常会将文件保存为专有格式，且可能会向文件中添加非预期的字符（如弯引号），这样可能会给抓取工具带来问题。如果保存文件时出现相应系统提示，请务必使用 UTF-8 编码保存文件。

格式和位置规则：

● 文件必须命名为 robots.txt。

● 网站只能有 1 个 robots.txt 文件。

● robots.txt 文件必须位于其要应用到的网站主机的根目录下。例如，若要控制对 https://www.example.com/ 下所有网址的抓取，就必须将 robots.txt 文件放在 https://www.example.com/robots.txt 下，一定不能将其放在子目录中（例如 https://example.com/pages/robots.txt 下）。如果您不确定如何访问自己的网站根目录，或者需要相应权限才能访问，请与网站托管服务提供商联系。如果您无法访问网站根目录，请改用其他屏蔽方法（例如元标记）。

● robots.txt 文件可应用到子网域（例如 https://website.example.com/robots.txt）或非标准端口（例如 http://example.com:8181/robots.txt）。

● robots.txt 文件必须是采用 UTF-8 编码（包括 ASCII）的文本文件。Google 可能会忽略不属于 UTF-8 范围的字符，从而可能会导致 robots.txt 规则无效。

向 robots.txt 文件添加规则

规则是关于抓取工具可以抓取网站哪些部分的说明。向 robots.txt 文件中添加规则时，请遵循以下准则：

● robots.txt 文件包含一个或多个组。

● 每个组由多条规则或指令（命令）组成，每条指令各占一行。每个组都以 User-agent 行开头，该行指定了组适用的目标。

● 每个组包含以下信息：

* 组的适用对象（用户代理）

* 代理可以访问的目录或文件。

* 代理无法访问的目录或文件。

● 抓取工具会按从上到下的顺序处理组。一个用户代理只能匹配 1 个规则集（即与相应用户代理匹配的比较早的最具体组）。

● 系统的默认假设是：用户代理可以抓取所有未被 disallow 规则屏蔽的网页或目录。

● 规则区分大小写。例如，disallow: /file.asp 适用于 https://www.example.com/file.asp，但不适用于 https://www.example.com/FILE.asp。

● # 字符表示注释的开始处。

Google 的抓取工具支持 robots.txt 文件中的以下指令：

● user-agent: [必需，每个组需含一个或多个 User-agent 条目] 该指令指定了规则适用的自动客户端（即搜索引擎抓取工具）的名称。这是每个规则组的首行内容。Google 用户代理列表中列出了 Google 用户代理名称。使用星号 (*) 会匹配除各种 AdsBot 抓取工具之外的所有抓取工具，AdsBot 抓取工具必须明确指定。例如：

# Example 1: Block only Googlebot

User-agent: Googlebot

Disallow: /

# Example 2: Block Googlebot and Ad***ot

User-agent: Googlebot

User-agent: AdsBot-Google

Disallow: /

# Example 3: Block all but AdsBot crawlers

User-agent: *

Disallow: /

● disallow: [每条规则需含至少一个或多个 disallow 或 allow 条目] 您不希望用户代理抓取的目录或网页（相对于根网域而言）。如果规则引用了某个网页，则必须提供浏览器中显示的完整网页名称。它必须以 / 字符开头；如果它引用了某个目录，则必须以 / 标记结尾。

● allow: [每条规则需含至少一个或多个 disallow 或 allow 条目] 上文中提到的用户代理可以抓取的目录或网页（相对于根网域而言）。此指令用于替换 disallow 指令，从而允许抓取已禁止访问的目录中的子目录或网页。对于单个网页，请指定浏览器中显示的完整网页名称。对于目录，请用 / 标记结束规则。

● sitemap: [可选，每个文件可含零个或多个 sitemap 条目] 相应网站的站点地图的位置。站点地图网址必须是完全限定的网址；Google 不会假定存在或检查是否存在 http、https、www、非 www 网址变体。站点地图是一种用于指示 Google 应抓取哪些内容的理想方式，但并不用于指示 Google 可以抓取或不能抓取哪些内容。详细了解站点地图。示例：

Sitemap: https://example.com/sitemap.xml

Sitemap: http://www.example.com/sitemap.xml

除 sitemap 之外的所有指令都支持使用通配符 * 表示路径前缀、后缀或整个字符串。

与这些指令均不匹配的行将被忽略。

如需有关每个指令的完整说明，请参阅 Google 对 robots.txt 规范的解释页面。

上传 robots.txt 文件

将 robots.txt 文件保存到计算机后，您便可以将其提供给搜索引擎抓取工具。没有一个统一工具可以帮助您完成这项工作，因为如何将 robots.txt 文件上传到网站取决于您的网站和服务器架构。请与您的托管公司联系，或在托管公司的文档中进行搜索；例如，搜索"上传文件 infomaniak"。

上传 robots.txt 文件后，请测试该文件是否可公开访问，以及 Google 能否解析该文件。

测试 robots.txt 标记

要测试新上传的 robots.txt 文件是否可公开访问，请在浏览器中打开无痕浏览窗口（或等效窗口），然后转到 robots.txt 文件的位置。例如：https://example.com/robots.txt。如果您看到 robots.txt 文件的内容，就可准备测试标记了。

Google 提供了两种测试 robots.txt 标记的方式：

1、Search Console 中的 robots.txt 测试工具。您只能针对您网站上可供访问的 robots.txt 文件使用此工具。

2、如果您是开发者，请了解并构建 Google 的开源 robots.txt 库，该库也用在 Google 搜索中。您可以使用此工具在计算机上本地测试 robots.txt 文件。

向 Google 提交 robots.txt 文件

在您上传并测试 robots.txt 文件后，Google 的抓取工具会自动找到并开始使用您的 robots.txt 文件。您无需采取任何操作。如果您更新了 robots.txt 文件，并需要尽快刷新 Google 的缓存副本，请了解如何提交更新后的 robots.txt 文件。

实用的 robots.txt 规则

下面是一些常见的实用 robots.txt 规则：

实用规则禁止抓取整个网站请注意，在某些情况下，Google 即使未抓取网站的网址，仍可能将其编入索引。
注意：这不适用于各种 AdsBot 抓取工具，此类抓取工具必须明确指定。
User-agent: *
Disallow: /禁止抓取某一目录及其内容在目录名后添加一道正斜线，即可禁止抓取整个目录。禁止抓取的目录字符串可以出现在路径中的任何位置，因此 Disallow: /junk/ 与 https://example.com/junk/ 和 https://example.com/for-sale/other/junk/ 均匹配。
注意：请勿使用 robots.txt 禁止访问私密内容；请改用正确的身份验证机制。对于 robots.txt 文件所禁止抓取的网址，Google 仍可能会在不进行抓取的情况下将其编入索引；另外，由于 robots.txt 文件可供任何人随意查看，因此可能会泄露您的私密内容的位置。

User-agent: *
Disallow: /calendar/
Disallow: /junk/
Disallow: /books/fiction/contemporary/
仅允许某一抓取工具访问网站内容只有 googlebot-news 可以抓取整个网站。
User-agent: Googlebot-news
Allow: /
User-agent: *
Disallow: /允许除某一抓取工具以外的其他所有抓取工具访问网站内容Unnecessarybot 不能抓取相应网站，所有其他漫游器都可以。
User-agent: Unnecessarybot
Disallow: /
User-agent: *
Allow: /禁止抓取某一网页例如，禁止抓取 useless_file.Html 网页。
User-agent: *
Disallow: /useless_file.html禁止 Google 图片访问某一特定图片例如，禁止访问 dogs.jpg 图片。
User-agent: Googlebot-Image
Disallow: /images/dogs.jpg禁止 Google 图片访问您网站上的所有图片如果无法抓取图片和视频，则 Google 无法将其编入索引。
User-agent: Googlebot-Image
Disallow: /
禁止抓取某一特定文件类型的文件例如，禁止抓取所有 .gif 文件。
User-agent: Googlebot
Disallow: /*.gif$禁止抓取整个网站，但允许 Mediapartners-Google 访问内容实施此规则会阻止您的网页显示在搜索结果中，但 Mediapartners-Google 网页抓取工具仍能分析这些网页，以确定要向访问您网站的用户显示哪些广告。
User-agent: *
Disallow: /
User-agent: Mediapartners-Google
Allow: /使用 $ 匹配以特定字符串结尾的网址例如，禁止抓取所有 .xls 文件。
User-agent: Googlebot
Disallow: /*.xls$

TAG：谷歌搜索引擎怎么优化

标签： AI SEO SEO诊断人工智能内容营销

上一篇文章：谷歌搜索引擎优化 (SEO)拆分较大的站点地图详解

下一篇文章： Google(谷歌) 如何解读 robots.txt 规范

开耳 - 云优化创始人

资深SEO专家 | 20年行业经验

AI将彻底重构SEO的底层逻辑，搜索不再是 "关键词匹配" 的算法，而是 "用户意图理解" 的竞争。以 Google MUM、百度文心一言为代表的大模型，正在让搜索引擎具备跨模态、跨领域的深度语义分析能力。这意味着，AISEO的核心将从 "优化页面" 转向 "构建能被AI识别的价值生态"。

小高 - 云优化合伙人

AI模型专家 | 23年行业经验

AI不会取代SEOer，但 "不会用 AI的SEOer"会被取代。未来的 AI SEO 从业者，核心能力将从 "执行优化" 转向 "AI策略指挥"。用AI数据分析工具快速定位用户搜索痛点；判断哪些领域适合AI批量布局，哪些领域需要人工深耕建立壁垒，本质上是通过AI的策略能力，而非被AI工具牵着走。

寻觅 - 云优化创始人

AI运营专家 | 18年行业经验

AI应用的趋势是："通用大模型+行业知识库+场景调优"成标配。工业实现全流程优化，医疗升级个性化方案，零售打通全链路经营。同时人机协同深化，AI解放重复劳动，人类聚焦策略创意，成为企业降本增效、创造增量价值的核心引擎。

海龙 - 云优化创始人

资深SEO专家 | 20年行业经验

未来三年，AI 将彻底重构 SEO 的底层逻辑，搜索不再是 "关键词匹配" 的游戏，而是 "用户意图理解" 的竞争。以 Google MUM、百度文心一言为代表的大模型，正在让搜索引擎具备跨模态、跨领域的深度语义分析能力。这意味着，AI SEO 的核心将从 "优化页面" 转向 "构建能被 AI 识别的价值生态"—— 内容生产会更依赖 AI 辅助的 "用户需求预判"，外链和权威度的评估标准也将融入 AI 对内容关联性的动态分析，传统 SEO 的 "技巧红利" 将逐渐消失，"价值红利" 成为唯一通行证。

2023年最佳AI内容创作工具对比：功能、价格与适用场景

2025-10-28

如何应对搜索引擎算法更新：AI驱动的适应性策略

2025-10-30

评论列表

用户1

2024/11/19 1:04:56

微信推广是指什么？微信推广的特点、优点、渠道及作用

来自SEO专员的回复：

2026/6/23 7:16:14

感谢您的留言：一、百度快照是什么百度快照是百度在抓取网站数据时，对收录页面进行下载并存储形成的数据副本，目的是用户不能访问搜索结果页面时，通过百度快百度快照是干什么的

用户2

2024/11/19 1:04:56

百度快速收录是指什么？详解百度快速收录入口、权限开通及资源提交

来自SEO专员的回复：

2026/6/23 6:56:14

感谢您的留言：一、白帽SEO是什么意思白帽SEO又称为白帽SEO技术（英文：white hat seo），是一种公正的手法，是使用符合主流搜索引擎发白帽seo新手怎么做

用户3

2024/11/19 1:04:57

关键词堆砌是什么？详解网站关键词堆砌的形式、影响及避免方法

来自SEO专员的回复：

2026/6/23 6:36:14

感谢您的留言：一、网站关键词是什么意思网站关键词又简称为关键词（英文：Keywords），是指在网站页面设定的以便用户通过搜索引擎能搜索到本网站的词汇。网站关键词代表了网站网站关键词有哪些

用户4

2024/11/19 1:04:57

目标关键词是什么？详解网站目标关键词的挖掘途径、分析方法及优化技巧

来自SEO专员的回复：

2026/6/23 6:16:14

感谢您的留言：一、搜索引擎营销(SEM)是什么意思搜索引擎营销（英文：Search Engine Marketing，英文缩写：SEM）一般简称为搜索营销，简单来说，搜索引

用户5

2024/11/19 1:04:57

什么是页面优化？详解网站优化之网页优化技巧及注意事项

管理员

2026/6/23 5:56:14

感谢您的留言，我们会尽快回复。

预约咨询

谷歌搜索引擎优化 (SEO)创建并提交 robots.txt 文件

创建 robots.txt 文件的基本准则

创建 robots.txt 文件

向 robots.txt 文件添加规则

上传 robots.txt 文件

测试 robots.txt 标记

向 Google 提交 robots.txt 文件

实用的 robots.txt 规则

开耳 - 云优化创始人

小高 - 云优化合伙人

寻觅 - 云优化创始人

海龙 - 云优化创始人

相关文章

2023年最佳AI内容创作工具对比：功能、价格与适用场景

如何应对搜索引擎算法更新：AI驱动的适应性策略

评论 (48)

评论列表

用户1

来自SEO专员的回复：

用户2

来自SEO专员的回复：

用户3

来自SEO专员的回复：

用户4

来自SEO专员的回复：

用户5

管理员

图文文章

SEO是通过优化网站内容、标签代码等元素，让网站在搜索引擎（如Google、百度、搜狗、必应）中排名更靠前，从而获取免费精准流量的技术和方法。

外贸SEO是通过优化外贸网站内容、结构等核心要素，让网站在Google等海外搜索引擎中排名靠前，获取海外精准流量、最终促成外贸订单的技术与方法。

AISEO系统借助AI技术赋能SEO优化，通过智能优化网站内容、结构并适配搜索引擎规则，助力网站快速提升排名，从而高效获取精准流量转化的智能工具。

热门文章

上海网站seo公司

重庆网站优化常识

苏州网站优化排名

聊城网站优化公司

关键词在线优化平台

SEO岗位

seo提高关键词排名怎么做

合肥关键词搜索排名

推荐文章

常见问题

AI运营

传统运营

立即获取免费AI营销方案

联系我们

关于云无限AI营销公司

联系方式

电话微信同号

北京公司地址

热门标签