Como aparecer para as IAS com apenas uma configuração
Veja como configurar robots.txt para permitir GPTBot, ClaudeBot e PerplexityBot sem bloquear sua marca nas respostas de IA. Tutorial prático para leigos.


O problema começa com uma linha que você provavelmente nem sabe que está lá
O arquivo robots.txt do seu site decide, neste momento, se GPTBot, ClaudeBot, PerplexityBot e Google-Extended conseguem ler o seu conteúdo. Se esses crawlers estiverem bloqueados, sua marca simplesmente não existe para o ChatGPT, o Gemini ou o Claude quando alguém faz uma pergunta sobre o seu mercado.
robots.txt para crawlers de IA é diferente de configurar para o Google. Bloquear GPTBot e ClaudeBot não afeta seu SEO clássico, mas corta sua visibilidade nas respostas de LLMs. Este tutorial mostra o que verificar, o que mudar e como testar em menos de 30 minutos.
O que é robots.txt e por que ele importa para IA
O robots.txt é um arquivo de texto simples que fica na raiz do seu domínio, no endereço https://seusite.com/robots.txt. Qualquer pessoa pode abrir no navegador agora mesmo. Ele lista quais robôs têm permissão para rastrear quais partes do site, usando uma sintaxe direta: User-agent identifica o robô, Allow libera um caminho, Disallow bloqueia.
Durante anos, as únicas preocupações práticas eram o Googlebot e, ocasionalmente, o Bingbot. Os grandes modelos de linguagem mudaram isso. Hoje, OpenAI, Anthropic, Google e Perplexity operam crawlers próprios que leem sites para alimentar respostas em tempo real e treinar modelos. Esses crawlers têm nomes próprios, respeitam o robots.txt por política declarada e, se não encontrarem permissão explícita, seguem as regras genéricas do arquivo, o que frequentemente significa acesso bloqueado por acidente.
Entender como o robots.txt afeta a visibilidade para IA deixou de ser assunto de desenvolvedor. Virou decisão de negócio.
A diferença entre bloquear o Google e bloquear LLMs
Googlebot e os bots de IA são crawlers distintos com propósitos distintos. Bloquear GPTBot ou ClaudeBot no robots.txt não penaliza o ranking no Google Search, porque o Googlebot continua funcionando normalmente. O tráfego orgânico clássico não é afetado.
A consequência fica do outro lado: a visibilidade nas respostas de LLMs cai. Quando alguém pergunta ao ChatGPT qual empresa de contabilidade atende PMEs em São Paulo, ou qual consultoria de RH tem metodologia ágil, o modelo responde com base no que seus crawlers conseguiram ler. Se o seu site bloqueou o GPTBot, o ChatGPT não cita você, independentemente de quantas páginas você tenha publicado.
O Google-Extended merece atenção especial aqui. Ele é o crawler da Google responsável por coletar conteúdo para recursos de IA generativa como o Gemini, e seu acesso é controlado de forma independente das regras aplicadas ao Googlebot de busca tradicional. Bloquear o Googlebot não bloqueia o Google-Extended, e vice-versa.
Os crawlers de IA que existem e o que cada um faz
Existem dois grupos funcionalmente diferentes, e confundi-los leva a decisões erradas.
O primeiro grupo é o de crawlers de treinamento: leem seu conteúdo para que o modelo aprenda com ele em ciclos futuros. GPTBot (OpenAI), ClaudeBot (Anthropic) e Google-Extended operam principalmente nessa lógica.
O segundo grupo é o de crawlers de retrieval, também chamados de busca ou RAG. Esses são acionados em tempo real quando um usuário faz uma pergunta e o sistema busca fontes para embasar a resposta. OAI-SearchBot, ChatGPT-User e PerplexityBot funcionam assim. Bloquear o segundo grupo impede citações nas respostas; bloquear o primeiro impede que o modelo "aprenda" o conteúdo.
A distinção prática: se você bloqueia OAI-SearchBot e PerplexityBot, sua marca pode aparecer muito raramente, mesmo que o GPTBot tenha lido tudo antes. Para a maioria das marcas que querem ser citadas, liberar os crawlers de retrieval tem efeito mais imediato.
Os principais nomes que você vai encontrar, e que precisam de atenção no seu robots.txt:
- GPTBot — treinamento OpenAI
- OAI-SearchBot — busca em tempo real OpenAI
- ChatGPT-User — acionado quando usuário pede para IA "abrir" uma URL específica
- ClaudeBot — treinamento e retrieval Anthropic
- PerplexityBot — busca em tempo real Perplexity
- Google-Extended — IA generativa Google (Gemini)
O erro mais comum: o Disallow que silencia tudo
O erro responsável por grande parte dos casos em que marcas ficam invisíveis para LLMs não é intencional. É herança de configuração antiga, gerada por plugin ou por template de servidor, que ninguém revisou desde que os crawlers de IA passaram a existir.
Parece com isso:
User-agent: *
Disallow: /
Essas duas linhas bloqueiam todos os robôs sem exceção, incluindo GPTBot, ClaudeBot, PerplexityBot e Google-Extended. O time de conteúdo muitas vezes não sabe que está impedindo a citação da marca em respostas de IA porque a decisão técnica foi tomada sem esse contexto.
Outra variação frequente: o arquivo usa Disallow: / em User-agent: * para uma seção de staging, mas a regra genérica sobrescreve qualquer permissão específica que deveria vir depois. A ordem dos blocos no arquivo importa. Para garantir que configurações específicas para crawlers de IA prevaleçam, os blocos de user-agent de IA devem vir no topo do arquivo, antes de qualquer regra com coringa.
Um detalhe que poucos percebem: se o seu site não tem um arquivo robots.txt e retorna erro 404 nessa URL, todos os crawlers estão tecnicamente liberados por padrão. A ausência do arquivo não protege nada; ela apenas remove qualquer controle que você teria.
Como fica uma configuração correta
Uma configuração que equilibra visibilidade para LLMs e proteção de áreas sensíveis segue esta estrutura: blocos específicos para cada crawler de IA no topo, regras genéricas depois, linha de sitemap no final.
Para sites que querem ser citados nas respostas de IA sem restrição de conteúdo:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-login.php
Disallow: /admin/
Disallow: /checkout/
Disallow: /account/
Sitemap: https://seusite.com/sitemap.xml
Atenção ao detalhe que derruba configurações inteiras: os nomes dos user-agents são case-sensitive. GPTBot e gptbot são tratados como entidades diferentes. Use sempre a grafia exata que cada provedor declara em sua documentação oficial.
Para marcas que aceitam ser citadas mas preferem que o conteúdo não seja usado para treinar novos modelos, a abordagem é liberar os crawlers de retrieval e bloquear especificamente os de treinamento mais agressivos, como CCBot e Bytespider, com Disallow: / em blocos separados.
Este modelo de configuração é documentado como prática recomendada por guias técnicos especializados em crawlability para IA, que listam os seis bots de retrieval principais e a lógica de construção por blocos.
Onde editar o robots.txt no seu site
O arquivo precisa estar na raiz do domínio. Não em /blog/robots.txt, não em /wp-content/robots.txt. O endereço correto é sempre https://seudominio.com/robots.txt. Qualquer outra localização e os crawlers simplesmente ignoram o arquivo.
Para sites em WordPress, a forma mais segura de editar sem acesso por FTP é via plugin. Rank Math oferece esse editor em "Geral > Edit robots.txt". Yoast SEO está em "SEO > Ferramentas > Editor de arquivos > robots.txt". Os dois permitem editar e salvar diretamente pelo painel, sem risco de sobrescrever o arquivo por engano em uma atualização do servidor.
Fora do WordPress, o acesso mais direto é via FTP ou painel do servidor (cPanel, Plesk). O arquivo é texto simples e pode ser editado com qualquer editor. Se não existir ainda, crie um arquivo chamado exatamente robots.txt e faça upload na pasta raiz do domínio.
O que realmente merece um Disallow
Área administrativa, páginas de checkout, perfis de conta de usuário, APIs internas, rotas de staging e qualquer URL que exponha dados sensíveis ou gere crawl traps com parâmetros infinitos. Essas seções merecem Disallow para todos os crawlers, incluindo os de IA.
O que não merece bloquear: todo o conteúdo público de valor, incluindo posts de blog, páginas de produto, páginas institucionais, cases e qualquer material que você publicou com intenção de ser lido. Bloquear esse conteúdo para crawlers de IA e esperar aparecer nas respostas do ChatGPT é contradição operacional.
Entender como as IAs decidem o que citar nas respostas ajuda a calibrar esse equilíbrio. O critério não é só acesso técnico. É acesso técnico somado a qualidade e profundidade do conteúdo disponível.
Como testar se a configuração está funcionando
O Google Search Console tem um testador de robots.txt que permite selecionar um user-agent específico, inserir uma URL e ver qual regra foi aplicada. Funciona bem para Googlebot e Google-Extended. Para os demais crawlers, a opção mais acessível é o Screaming Frog, que simula diferentes user-agents sobre URLs específicas e retorna se o acesso está permitido ou bloqueado.
Existe também uma rota mais direta para quem não quer instalar ferramentas: scanners gratuitos específicos para crawlers de IA permitem selecionar políticas pré-configuradas, marcar quais bots incluir e gerar automaticamente os blocos de regras prontos para copiar e colar no arquivo.
O processo de verificação manual para leigos tem três passos. Abra https://seusite.com/robots.txt no navegador. Procure por Disallow: / em User-agent: *. Se encontrar, verifique se existe antes dessa regra um bloco explícito com Allow: / para cada crawler de IA que você quer liberar. Se não existir, sua marca está bloqueada.
Um dado que contextualiza a urgência: mais de 60% dos proprietários de sites brasileiros ainda não configuraram regras específicas para crawlers de IA, deixando GPTBot, ClaudeBot e outros em um limbo de acesso dependente apenas das regras genéricas do arquivo.
A armadilha do Cloudflare que desfaz tudo
Existe uma camada que fica antes do robots.txt e que pode tornar toda a configuração irrelevante. O Cloudflare tem uma opção chamada "Block AI Scrapers" que, quando ativada, bloqueia automaticamente GPTBot, PerplexityBot e outros, independentemente do que está declarado no arquivo.
Sites com essa configuração ativa relataram queda abrupta em citações no Perplexity e no ChatGPT, recuperando visibilidade apenas após liberar especificamente OAI-SearchBot e PerplexityBot nas regras do WAF, além de ajustar o robots.txt. O mesmo vale para qualquer WAF ou CDN com regras de bloqueio de bots: essas configurações de servidor têm precedência sobre o arquivo de texto.
A verificação prática: se você configurou o robots.txt corretamente mas ainda não aparece nas respostas de IA, olhe para as configurações do Cloudflare ou do firewall de aplicação do seu servidor antes de suspeitar de qualquer outro problema.
Combinar robots.txt com metatags meta name="robots" e proteções de servidor é a abordagem recomendada para quem quer controle granular sem sacrificar visibilidade. Para a maioria dos sites, configurar corretamente o robots.txt e revisar as regras do WAF já resolve o problema central.
O quanto essa visibilidade técnica se converte em citações reais depende, em última conta, da qualidade do conteúdo que os crawlers vão encontrar. Como Claude e Gemini decidem citar fontes corporativas envolve critérios editoriais que vão além do acesso técnico, mas o acesso técnico é a condição mínima para que qualquer um desses critérios entre em jogo.
Perguntas frequentes
Bloquear GPTBot prejudica meu ranking no Google?
Não. Googlebot e GPTBot são crawlers distintos com funções distintas. Bloquear GPTBot, ClaudeBot ou qualquer outro bot de IA no robots.txt não afeta o rastreamento do Google Search nem o posicionamento orgânico clássico. O efeito fica restrito à visibilidade nas respostas de LLMs como ChatGPT e Claude.
Se meu site não tem robots.txt, os crawlers de IA podem entrar?
Tecnicamente sim. A ausência de um arquivo robots.txt, quando o servidor retorna 404 nessa URL, significa que não há restrições declaradas. Todos os crawlers, incluindo os de IA, estão liberados por padrão. Isso não é proteção; é ausência de controle. O recomendado é criar o arquivo e declarar explicitamente o que está permitido e o que está bloqueado.
Preciso de um desenvolvedor para editar o robots.txt?
Em sites WordPress, não. Plugins como Rank Math e Yoast SEO oferecem editores de robots.txt diretamente no painel administrativo, sem necessidade de acesso por FTP ou linha de comando. Em outros ambientes, o arquivo pode ser editado via painel de hospedagem (cPanel ou Plesk) com um editor de texto simples. O arquivo em si é texto puro, sem sintaxe complexa.
Qual a diferença entre GPTBot e OAI-SearchBot?
GPTBot rastreia conteúdo para treinamento de modelos da OpenAI em ciclos futuros. OAI-SearchBot é acionado em tempo real quando o ChatGPT busca fontes para embasar uma resposta ao usuário. Para aparecer citado nas respostas do ChatGPT agora, liberar OAI-SearchBot e ChatGPT-User tem efeito mais imediato do que liberar apenas GPTBot.
O Google-Extended é o mesmo que o Googlebot?
Não. São crawlers separados com finalidades diferentes. Googlebot rastreia para o Google Search tradicional. Google-Extended coleta conteúdo para uso em recursos de IA generativa da Google, como o Gemini. As regras de um não afetam o outro no robots.txt. É possível, por exemplo, bloquear Google-Extended sem impactar o rastreamento do Googlebot para SEO clássico.
Artigos relacionados

Empresa invisível para IA: 7 sinais de alerta no ChatGPT e Gemini
22 de ago. de 2026

Findable vs agência de conteúdo: 5 diferenças que importam
08 de ago. de 2026

Regulamentação de IA e compliance de conteúdo: o que muda para marcas
03 de ago. de 2026
