Erro na organização do robots.txt faz Google ignorar bloqueio e indexar páginas de spam

28 Julho, 2026

John Mueller revelou por que o Google pode ignorar bloqueios do robots.txt e indexar páginas de spam. Entenda o erro e evite o mesmo problema.

Redação EducaSEO
Por: Redação EducaSEO
Erro na organização do robots.txt faz Google ignorar bloqueio e indexar páginas de spam

Um profissional de SEO postou no Reddit, no fim de julho de 2026, um caso que ilustra bem um detalhe técnico do robots.txt que costuma passar despercebido. A loja Shopify de um cliente estava recebendo spam na busca interna do site, com termos de nicho suspeito sendo injetados na URL de pesquisa, e mesmo depois de adicionar uma regra de disallow bloqueando o diretório /search, o Google seguia indexando essas páginas geradas pelos spammers.

John Mueller, do Google, entrou na conversa e identificou um detalhe que pode passar despercebido em auditorias técnicas: o robots.txt do site tinha uma seção separada só para user-agent: Googlebot, além da seção genérica user-agent: *. E, quando isso acontece, o Googlebot ignora completamente a seção geral. 

Se a regra de bloqueio da busca interna só existia lá, ela nunca chegou a valer para o rastreador do Google. Vale conferir se o seu próprio robots.txt não está com esse mesmo problema entre os blocos.

O caso do robots.txt investigado por John Mueller no Reddit

A pergunta original, feita por quem cuidava da conta Shopify, nem era sobre o problema real. A pessoa queria saber se devia trocar o redirecionamento das URLs de spam por uma página 404, sem perceber que o problema de fundo era outro: aquelas páginas continuavam aparecendo no Google mesmo com o disallow: /search configurado.

Mueller foi além da pergunta feita e revisou o arquivo robots.txt do domínio. Encontrou uma seção com comentários indicando um bloco de “regras customizadas” endereçado especificamente a user-agent: Googlebot, separada de um bloco maior de regras genéricas em user-agent: *, logo mais abaixo no arquivo. Foi aí que identificou a causa raiz do problema de indexação.

Por que o Google ignorou a regra geral do robots.txt

A explicação de Mueller reforça algo que já está documentado oficialmente no Google Search Central, mas que continua pegando gente de surpresa em auditorias técnicas mesmo depois de anos de robots.txt sendo, digamos, um arquivo relativamente simples de se configurar.

A regra de especificidade que decide qual bloco o Google obedece

Segundo Mueller, “com robots.txt, as regras mais específicas vencem, então se você tem uma seção user-agent: Googlebot, ela vai usar essa seção. Se você quer aplicar todas as regras da seção user-agent: *, precisa copiá-las.” Ou seja, o Googlebot não soma as duas seções, ele escolhe uma e ignora a outra por completo.

A própria documentação oficial do Google confirma esse comportamento: o rastreador identifica, entre todos os grupos do arquivo, aquele com o user-agent mais específico que corresponde a ele, e segue só as regras desse grupo. Os demais grupos, incluindo o genérico, são simplesmente descartados para aquele rastreador específico.

Na prática, isso significa que ter uma seção nomeada Googlebot no meio de um robots.txt cheio de plugins e customizações herdadas de temas ou apps de terceiro aumenta o risco desse tipo de configuração equivocada, sobretudo quando ninguém revisita esse bloco depois que ele foi criado.

Vale separar as duas camadas do problema nesse caso específico. A primeira é que a regra de bloqueio simplesmente não chegava a valer para o Googlebot, por estar isolada na seção genérica. A segunda, ainda mais importante para quem generaliza esse aprendizado para outros sites, é que mesmo se a regra estivesse na seção certa, um disallow sozinho não garante que a URL saia do índice, porque ele controla rastreamento, não indexação. 

Como corrigir e evitar esse erro no seu próprio robots.txt

Mueller já deixou uma solução pronta na própria resposta: se o objetivo é aplicar as mesmas regras para vários rastreadores, o caminho mais direto é listar todos os user-agents relevantes dentro do mesmo grupo, em vez de espalhá-los em blocos separados.

Vale registrar que essa é a sugestão de Mueller pra esse caso específico, não a única forma tecnicamente correta: a especificação do Google também aceita manter grupos separados por user-agent, desde que as mesmas regras sejam repetidas em cada um deles. O problema nunca foi ter seções separadas, foi esperar que uma seção “herdasse” regras de outra, o que a especificação nunca previu. Algo como:

user-agent: googlebot

user-agent: otherbot

disallow: /search

disallow: /orange-cats

Isso elimina o risco de uma regra genérica ficar esquecida numa seção que o Googlebot nunca vai ler. Na revisão técnica de qualquer site, principalmente os que rodam sobre CMS ou plataforma de e-commerce com módulos de terceiro mexendo no robots.txt (Shopify, WordPress, Wix), vale abrir o arquivo e procurar, literalmente, quantas vezes a palavra “Googlebot” aparece separada da seção com asterisco.

Outro ponto que ajuda bastante aqui é apostar em rastreabilidade técnica sólida desde a estrutura do site, para que esse tipo de bloco de regras não precise crescer de forma improvisada conforme surgem novos problemas de spam ou rastreamento indesejado.

O robots.txt controla rastreamento, não indexação

Esse é o outro ponto que Mueller reforçou no mesmo fio, e que também apareceu na cobertura do Search Engine Journal sobre o caso: o robots.txt nunca foi feito para impedir indexação, só rastreamento. Bloquear uma URL com disallow impede o Googlebot de visitar aquela página, mas se outras páginas linkam pra ela com texto âncora descritivo, o Google ainda pode indexar a URL sem nunca ter aberto o conteúdo, só sem gerar um snippet de descrição na SERP.

Pra quem quer de fato impedir que uma página apareça nos resultados de busca, a diretiva correta é o noindex, seja via meta tag ou via header HTTP, e não o disallow no robots.txt. O próprio Shopify tem um tutorial oficial ensinando a inserir esse noindex direto no arquivo theme.liquid da loja, cobrindo justamente o template de busca interna. No WordPress, quem já usa Yoast, Rank Math ou AIOSEO nem precisa se preocupar com isso, porque essas ferramentas já colocam a página de busca interna em noindex por padrão.

Vale lembrar que confiar cegamente numa diretiva que parece controlar um comportamento, mas na prática não tem o efeito esperado, não é exclusividade do robots.txt. Já vimos aqui como uma diretiva parecida, o Content Signals da Cloudflare, também não gera o efeito que boa parte do mercado assumia que ela teria sobre o rastreamento de bots de IA.

Como esse caso de robots.txt muda a rotina de auditoria técnica de SEO

Esse erro passa despercebido justamente porque o disallow parece certo no papel. Ninguém questiona se aquela regra está mesmo valendo pro rastreador certo, até o spam continuar aparecendo na SERP.

A lição prática tem duas partes. Primeiro, todo robots.txt com seção nomeada por user-agent precisa ser lido bloco por bloco, nunca como um conjunto único de regras.

Segundo, disallow e noindex resolvem problemas diferentes. Tratar um como substituto do outro foi exatamente o que gerou o caso investigado por Mueller.

A documentação oficial do Google já explica esse comportamento há anos, de graça, mas configurações reais continuam ignorando esse detalhe. Falta reler a especificação de um arquivo que parece simples demais pra dar errado.

Manter essa checagem em dia evita repetir o mesmo erro na próxima vez que alguém mexer no robots.txt, seja por um plugin novo ou uma troca de tema.

É esse tipo de detalhe que a EducaSEO ajuda você a enxergar antes que vire problema. A gente acompanha de perto casos reais como esse, semana a semana, com leitura aplicada sobre rastreamento, indexação e visibilidade em busca, inclusive na era da IA generativa. Vem com a gente.

Referências

PUBLICADO EM: GEO GOOGLE SEO

Todas as notícias

28 JULHO
CRM Inteligência artificial Marketing

HubSpot lança Agent Hub e Agent Builder para criar agentes de IA direto no CRM

28 JULHO
GEO GOOGLE Inteligência artificial Marketing SEO

Alphabet tem lucro recorde no 2º trimestre de 2026, impulsionado por Google Cloud e Gemini na busca

28 JULHO
GEO GOOGLE SEO

Erro na organização do robots.txt faz Google ignorar bloqueio e indexar páginas de spam

27 JULHO
ChatGPT GEO SEO

Estudo da Semrush revela que só 15,2% das categorias têm marca dona no ChatGPT

27 JULHO
GEO GOOGLE Inteligência artificial SEO

Google Imagens ganha galeria estilo Pinterest e passa a criar imagens dentro da resposta de IA

27 JULHO
GEO GOOGLE Marketing SEO

Google terá que mudar resultados de busca na Europa após multa de €890 milhões da UE

24 JULHO
CRM CRO GEO Inteligência artificial Marketing SEO

Crystal Carter, da Wix, é confirmada no SEOcamp remoto 2026 para falar sobre as novas regras da IA na busca

23 JULHO
CRM CRO GEO Inteligência artificial Marketing SEO

SEOcamp remoto 2026 abre inscrições e revela os primeiros palestrantes confirmados

21 JULHO
CRM GEO Inteligência artificial Marketing SEO

HubSpot compra Warmly e leva inteligência de intenção de compra para dentro do CRM

21 JULHO
ChatGPT GEO GOOGLE Inteligência artificial SEO

Estudo da Bocconi University mostra que o ChatGPT já reduz a busca tradicional em até 17%

20 JULHO
GEO GOOGLE SEO

Google confirma: tela de verificação “você é um robô” pode tirar sua página do índice

20 JULHO
ChatGPT GEO Inteligência artificial SEO

OpenAI lança o ChatGPT Work e cria uma nova frente de disputa por visibilidade em respostas de IA

17 JULHO
CRO GEO Inteligência artificial SEO

Comércio agêntico tira o checkout do centro do CRO e coloca o dado de produto no comando

16 JULHO
AI-Mode Bing ChatGPT Claude CRM CRO Gemini GEO GOOGLE Grok Inteligência artificial Marketing SEO

EducaSEO lança o primeiro MBA em SEO e GEO do Brasil, com nota máxima do MEC

16 JULHO
GEO GOOGLE Inteligência artificial SEO

Google confirma que schema especial para IA não existe, mas schema tradicional continua valendo a pena

15 JULHO
GEO Inteligência artificial SEO

Cloudflare vai bloquear bots de IA por categoria a partir de setembro de 2026

14 JULHO
CRO GEO Inteligência artificial SEO

Lei de IA da União Europeia muda de fase em agosto de 2026, mas adia exigência de alto risco que miraria personalização de CRO

13 JULHO
CRM GEO Inteligência artificial SEO

HubSpot vira Revenue Hub e libera IA de prospecção para toda a base paga

12 JULHO
Bing ChatGPT GEO SEO

Bing IndexNow se consolida como porta de entrada para respostas de IA e citações no ChatGPT

11 JULHO
GEO GOOGLE Inteligência artificial SEO

Google confirma: diretiva Content Signals da Cloudflare, usada por milhões de sites, não tem efeito nenhum

07 JULHO
GEO GOOGLE SEO

Google Search Console ganha platform properties e passa a medir o desempenho de redes sociais na busca

07 JULHO
GEO Inteligência artificial Marketing SEO

SEOcamp remoto 2026: a quarta edição do maior evento de SEO do Brasil sai de São Paulo e chega a todas as telas

07 JULHO
CRM CRO GEO SEO

Abandono de carrinho passa de 78% no Brasil, e checkout segue como a maior oportunidade de conversão do e-commerce

06 JULHO
GEO GOOGLE Inteligência artificial Marketing SEO

Google leva o Search Central Deep Dive para a Europa: Barcelona sedia o evento em setembro

06 JULHO
Claude GEO Inteligência artificial SEO

Claude Sonnet 5 chega e reacende o debate sobre rebaseline de citações em IA

06 JULHO
GEO GOOGLE SEO

DMCA fraudulento vira arma de SEO negativo e apaga páginas legítimas do Google

03 JULHO
AI-Mode ChatGPT Claude Gemini GOOGLE Inteligência artificial SEO

Anúncios dentro da resposta de IA dividem Google, OpenAI, Perplexity e Anthropic

02 JULHO
AI-Mode Gemini GEO GOOGLE Inteligência artificial SEO

Search generative AI control: o botão de exclusão do Google que veio com pressão internacional

01 JULHO
GEO GOOGLE SEO

Google Trends agora compara períodos direto no gráfico: veja o que muda na prática

01 JULHO
CRO Inteligência artificial Marketing

CRO com IA: como o cruzamento de dados está elevando a conversão no e-commerce

01 JULHO
AI-Mode ChatGPT Claude Gemini GEO GOOGLE Inteligência artificial SEO

Estratégia GEO multiplataforma: como preparar seu conteúdo para ser citado por ChatGPT, Gemini, Claude e Perplexity

30 JUNHO
Gemini GEO GOOGLE Inteligência artificial SEO

Menções pagas em GEO: quando a corrida por visibilidade nas IAs vira manipulação

30 JUNHO
GEO GOOGLE Inteligência artificial SEO

Google lança sistema de classificadores para identificar e punir conteúdo de IA produzido em escala

29 JUNHO
GEO GOOGLE Inteligência artificial Marketing SEO

Produção de conteúdo SEO: o que realmente sustenta um ranking

26 JUNHO
AI-Mode Gemini GEO GOOGLE Inteligência artificial SEO

O Google quer ditar as regras da própria IA nos Estados Unidos, mas Reino Unido e Brasil seguem outro caminho

26 JUNHO
GEO GOOGLE SEO

Google encerra o FAQ rich result na Busca, mas o schema FAQPage continua valendo a pena (inclusive para a IA)

25 JUNHO
AI-Mode ChatGPT Claude Gemini GEO GOOGLE Inteligência artificial SEO

Estudo da Ahrefs mostra que tráfego de IA generativa dispara e Google cai abaixo de 27%

24 JUNHO
GOOGLE SEO

As novidades do spam update do Google e os reflexos para quem trabalha com SEO

23 JUNHO
Gemini GEO GOOGLE Inteligência artificial Marketing SEO

Como o Google transforma autores e publishers em entidades de busca

23 JUNHO
AI-Mode Gemini GEO GOOGLE Inteligência artificial SEO

O Google terá que abrir a caixa-preta: Reino Unido exige critérios de ranqueamento claros e objetivos

23 JUNHO
Bing GEO Inteligência artificial SEO

O Bing avança nas métricas de GEO com novos relatórios de inteligência artificial

23 JUNHO
AI-Mode GOOGLE Inteligência artificial SEO

O novo guia oficial do Google reconfigura as prioridades técnicas após o Google Marketing Live 2026

23 JUNHO
AI-Mode Gemini GOOGLE Inteligência artificial SEO

Como fazer sua empresa ser recomendada pelo Google Gemini

22 JUNHO
Bing ChatGPT Claude GEO GOOGLE Grok Inteligência artificial SEO

Como os modelos de linguagem (LLMs) leem e indexam o conteúdo da web?

19 JUNHO
GEO SEO

EducaSEO abre inscrições para programa ao vivo de GEO com especialistas de peso

19 JUNHO
GOOGLE

O Google Lighthouse agora audita seu site para agentes de IA: o que muda na prática

18 JUNHO
SEO

Copywriter SEO: escreva para ranquear, engajar e converter

18 JUNHO
Inteligência artificial SEO

Na contramão do Google: DuckDuckGo lança versão que rejeita respostas por IA

16 JUNHO
ChatGPT

O avanço do ChatGPT para 900 milhões de usuários semanais e a nova era da busca fragmentada

16 JUNHO
GOOGLE

O Google vai punir domínios que manipulam o botão voltar: saiba como proteger seu site

16 JUNHO
Claude Inteligência artificial SEO

Claude cresce 750% no Brasil: avanço global de 386% reforça fragmentação nas buscas por inteligência artificial

16 JUNHO
GOOGLE

O impacto da nova ofensiva do Google contra o conteúdo automatizado no tráfego orgânico

15 JUNHO
AI-Mode ChatGPT Claude Gemini Grok Inteligência artificial

Corrida das IAs no Brasil: ChatGPT ainda reina, mas Gemini dispara e Claude cresce 750%

09 JUNHO
Marketing

Instagram Plus: conheça o novo plano premium da rede

09 JUNHO
AI-Mode

Google testa AI Mode no Chrome: o que muda no SEO

09 JUNHO

Novas ferramentas da Semrush medem visibilidade em IA

09 JUNHO
GOOGLE

Google Search Profiles: Guia para construir autoridade na Busca

09 JUNHO
Bing

Busca de imagens com IA no Bing: o que muda para SEO e GEO?

05 JUNHO
SEO

JavaScript e SEO: como funciona?

03 JUNHO
AI-Mode GOOGLE Inteligência artificial SEO

Search Console expande o relatório de IA generativa e adiciona controle de exclusão

01 JUNHO
SEO

Qual a importância do relacionamento em um negócio?

01 JUNHO
SEO

Rastreabilidade Avançada SEO

01 JUNHO
SEO

Google Search Console: principais funções e como usar na sua estratégia de SEO

Perguntas frequentes

Por que o Google pode ignorar uma regra do robots.txt mesmo com o disallow configurado?

Isso acontece quando o robots.txt tem uma seção específica para user-agent: Googlebot separada da seção genérica user-agent: *. Nesse caso, o Googlebot segue apenas as regras do bloco específico dele e ignora completamente as regras genéricas, mesmo que elas contenham o disallow desejado.

Qual a diferença entre robots.txt e noindex para bloquear páginas no Google?

O robots.txt controla apenas o rastreamento, ou seja, impede o Googlebot de acessar uma URL, mas não impede necessariamente a indexação dela caso outras páginas apontem para ela. Já a diretiva noindex, aplicada via meta tag ou header HTTP, impede diretamente que a página apareça nos resultados de busca.

Como evitar que uma regra geral do robots.txt seja ignorada pelo Googlebot?

Uma forma simples é manter todos os user-agents que compartilham as mesmas regras dentro do mesmo grupo, em vez de espalhá-los em blocos separados. Também é possível manter grupos separados por user-agent, desde que as mesmas regras sejam repetidas explicitamente em cada um deles, já que o Google não faz herança de regras entre seções diferentes.

Como resolver spam na busca interna de uma loja Shopify?

O Shopify recomenda adicionar uma diretiva noindex diretamente no arquivo theme.liquid da loja, direcionada ao template de busca, em vez de depender apenas do bloqueio via robots.txt. É importante não bloquear essas páginas via robots.txt para que a diretiva noindex consiga ser lida corretamente pelo rastreador.