Gerador de robots.txt

Processado neste navegador

Limite de texto: 2000000 caracteres

Esta ferramenta não envia sua entrada.

O staging entrou no Google e o time quer um Disallow até o go-live. Esta aba monta o arquivo. Publicar na raiz e o Search Console são outras etapas.

O homolog ficou aberto, o Google indexou /staging e o comercial mandou o print. O trabalho desta página é montar o texto do robots.txt nesta abaUser-agent, Allow, Disallow, opcionalmente Sitemap e alguns bots de IA.

Não é o Search Console. Não inspeciona URL. Não pede recrawl. A documentação do Google em português é explícita: o arquivo não substitui noindex nem senha.

Rastrear não é indexar

Disallow: /admin pede para o Googlebot não buscar aquele caminho. Se outro site linkar a URL, ela ainda pode aparecer nos resultados, sem descrição. noindex no HTML só funciona se o robô entrar na página. Bloquear no robots e esperar o noindex é o erro que a própria Central descreve.

User-agent: *
Allow: /
Disallow: /carrinho/
Disallow: /checkout/
Sitemap: https://seusite.com.br/sitemap.xml

Disallow: / no ar de produção some o site da busca — e o time só percebe no mês seguinte. Confira o host.

Como gerar e o que fazer depois

  1. Escolha caminhos. Allow e Disallow são prefixos, não regex de Java.
  2. Copie o arquivo para a raiz do domínio (não /blog/robots.txt se o host for o site todo).
  3. No Search Console, você testa e envia o sitemap. Esta aba não abre a propriedade.

Title e OG da home: gerador de meta. Nada do texto sobe daqui.

Limites que o arquivo não tem

  • Não autentica staging.
  • Não esconde PDF se outra página permitida aponta para ele.
  • Sintaxe varia entre robôs; Googlebot é o recorte que a Central documenta.

Crawler rude ignora. Senha no diretório continua sendo o bloqueio de verdade.

Perguntas frequentes

Isso publica o arquivo ou avisa o Search Console?

Não. Você baixa o texto e coloca em https://seusite.com.br/robots.txt. Sitemap se submete no Search Console à parte. Esta aba não tem login Google.

Disallow tira a página do Google?

Não é garantia. A Central da Pesquisa diz: robots.txt gerencia rastreamento, não é o jeito de esconder a página. URL ainda pode aparecer (sem descrição) se houver link. Para sair do índice: noindex ou senha — e o Google precisa *conseguir rastrear* para ler o noindex.

Posso escrever noindex dentro do robots.txt?

O Google não aceita noindex nesse arquivo. Use meta no HTML ou X-Robots-Tag. Gerador de meta ajuda no <head>; noindex você acrescenta à mão.

Staging: Disallow: / ou noindex?

Os dois se atropelam se você bloquear o rastreamento e esperar que o Google leia o noindex. Homologação de verdade usa senha ou noindex *com* a página rastreável. Disallow: / colado em produção por engano é o acidente clássico.

A linha Sitemap gera o XML?

Não. Cole a URL absoluta do sitemap se a interface tiver campo. O XML você gera no CMS ou no build.

Crawler de IA some da lista?

A aba pode incluir blocos para alguns user-agents de treino. É pedido educado. Bot malicioso ignora robots.txt.

Ferramentas relacionadas