Estudo: como os sites de Campinas tratam os robôs de IA (2026)

Resposta direta

Um levantamento em 59 sites de empresas de Campinas, feito em agosto de 2026, mostra que apenas 1 deles (2%) declara explicitamente permissão para os robôs de inteligência artificial lerem seu conteúdo. Outros 4 bloqueiam esses robôs ativamente — dois deles são agências de marketing digital. Os demais 44 não trataram do assunto: seguem legíveis por omissão, não por decisão.

Por que isso importa

Assistentes como ChatGPT, Google Gemini, Perplexity e Claude respondem perguntas que antes iam para a busca — inclusive perguntas comerciais com recorte local, do tipo "melhor clínica em Campinas" ou "empresa de contabilidade em Campinas".

Para citar uma empresa, esses sistemas precisam conseguir ler o site dela. Quem autoriza ou nega essa leitura é um arquivo de texto na raiz do site: o robots.txt. Uma linha ali decide se a empresa pode ou não aparecer nessas respostas.

Metodologia

  • Amostra: 59 sites de empresas de Campinas e região, distribuídos em 7 setores, identificados por busca pública em agosto de 2026.
  • Procedimento: requisição do arquivo /robots.txt de cada domínio, com análise das diretivas por agente.
  • Agentes verificados: GPTBot (OpenAI), Google-Extended (Google), PerplexityBot, ClaudeBot e anthropic-ai (Anthropic), CCBot (Common Crawl), Applebot-Extended (Apple) e Bytespider (ByteDance).
  • Critério: considerou-se "bloqueio" a diretiva Disallow: / associada ao agente, ou bloqueio geral para todos os agentes.
  • Data da coleta: 6 de agosto de 2026.

O levantamento usa apenas informação pública, acessível a qualquer pessoa. Os resultados são agregados por setor: não divulgamos nomes de empresas.

Resultados

SetorSitesSem robots.txtSem decisão sobre IABloqueiamLiberam
Agências de marketing e criação de sites1621121
Clínicas médicas81610
Clínicas odontológicas82600
Escritórios de advocacia80710
Imobiliárias82600
Contabilidade61500
Academias e estúdios52300
Total59104441

O que os números dizem — e o que não dizem

Apenas 1 site dos 59 analisados (2%) declara explicitamente permissão para crawlers de IA. Nos demais, a ausência de menção significa que o acesso está tecnicamente liberado por padrão — mas por omissão, não por decisão.

Essa distinção é importante e costuma ser distorcida: não mencionar não é o mesmo que bloquear. A maioria dos sites da amostra pode ser lida pelos assistentes. O que praticamente ninguém fez foi tratar o assunto de forma deliberada.

Há, porém, 4 sites que bloqueiam ativamente os robôs de IA. Nesses casos o efeito é concreto: por melhor que seja o conteúdo, esses assistentes não conseguem lê-lo e não vão citá-lo.

Um achado que merece nota: 2 dos 4 bloqueios estão em agências de marketing digital — empresas contratadas justamente para dar visibilidade a terceiros. É um indício de que o bloqueio raramente é escolha estratégica: costuma vir de configuração padrão de plugin ou tema, instalada e nunca revisada.

Os 10 sites sem robots.txt

Cerca de 17% da amostra não tem o arquivo. Isso não impede a leitura — sem robots.txt, o padrão é permitir. Mas indica ausência de controle sobre um ponto que hoje define presença em busca e em IA.

Como verificar o seu site em 30 segundos

  1. Abra o arquivo Digite no navegador o endereço do seu site seguido de /robots.txt. Exemplo: suaempresa.com.br/robots.txt
  2. Procure os agentes de IA Use Ctrl+F e busque por GPTBot, Google-Extended, PerplexityBot e ClaudeBot.
  3. Leia a linha seguinte Se aparecer Disallow: /, aquele assistente está proibido de ler o site. Se aparecer Allow: /, está autorizado.
  4. Verifique o bloqueio geral Um User-agent: * seguido de Disallow: / bloqueia todos os robôs, inclusive os de busca.

Limitações do estudo

  • A amostra é não probabilística: os sites vieram de busca pública e representam empresas com presença digital, não o universo de empresas da cidade.
  • É uma fotografia de uma data, não um monitoramento. Arquivos mudam.
  • O robots.txt é uma convenção, não uma barreira técnica: robôs podem ignorá-lo, ainda que os principais o respeitem.
  • Permissão de leitura não garante citação. É condição necessária, não suficiente — a citação depende também de conteúdo, autoridade e estrutura de dados.

Conclusão

A maioria das empresas de Campinas com presença digital ainda não tomou nenhuma decisão sobre como quer ser tratada pelos assistentes de IA. Isso não é, por si só, um problema — mas significa que o resultado é fruto do acaso e não de estratégia.

Para quem quer ser encontrado nessas respostas, liberar o acesso é apenas o primeiro passo, e o mais barato. O trabalho seguinte é o de sempre: ter conteúdo que valha ser citado.

Perguntas frequentes

O que é o robots.txt?

É um arquivo de texto na raiz do site que informa aos robôs automatizados quais partes eles podem acessar. Fica sempre no mesmo endereço: seudominio.com.br/robots.txt. É uma convenção respeitada pelos principais buscadores e assistentes de IA.

Quais são os robôs de IA que devo conhecer?

Os principais são GPTBot, da OpenAI, que alimenta o ChatGPT; Google-Extended, do Google, ligado ao Gemini e aos AI Overviews; PerplexityBot, da Perplexity; e ClaudeBot e anthropic-ai, da Anthropic. Há também CCBot, do Common Crawl, usado por vários modelos.

Se meu site não menciona esses robôs, ele está bloqueado?

Não. Sem menção, o padrão é permitir o acesso. A ausência de declaração significa apenas que não houve decisão sobre o assunto — o site continua legível pelos assistentes.

Bloquear os robôs de IA é sempre ruim?

Não necessariamente. Sites que vivem de conteúdo pago ou exclusivo podem ter razões legítimas para bloquear. O problema é bloquear sem saber, o que é o caso mais comum quando a configuração vem de um plugin.

Liberar o acesso garante que a IA vai citar minha empresa?

Não. É condição necessária, não suficiente. A citação depende também de ter conteúdo útil, dados estruturados e autoridade reconhecida. Liberar o acesso apenas garante que existe a chance.

Como faço para liberar os crawlers de IA no meu site?

Adicionando ao robots.txt um bloco para cada agente com a diretiva de permissão. Se houver um Disallow existente para esses agentes, ele precisa ser removido. Em sites feitos em WordPress, a origem costuma ser um plugin de SEO ou de privacidade.

Este estudo pode ser replicado?

Sim, e é o objetivo. Todos os dados vêm de arquivos públicos, acessíveis por qualquer navegador. A metodologia está descrita nesta página e pode ser repetida por qualquer pessoa em qualquer cidade.

Por que os nomes das empresas não são divulgados?

Porque o objetivo é medir um comportamento de mercado, não expor empresas individuais. Os resultados agregados por setor sustentam a mesma conclusão sem gerar constrangimento a terceiros.

Quer saber como seu site está?

Faço a verificação gratuita do seu robots.txt e da sua estrutura de dados, e mostro o que está impedindo sua empresa de aparecer nas respostas dos assistentes de IA.

Quero a verificação gratuita →

Leia também sobre IA e GEO

Falar no WhatsApp