Estudo: como os sites de Campinas tratam os robôs de IA (2026)
Um levantamento em 59 sites de empresas de Campinas, feito em agosto de 2026, mostra que apenas 1 deles (2%) declara explicitamente permissão para os robôs de inteligência artificial lerem seu conteúdo. Outros 4 bloqueiam esses robôs ativamente — dois deles são agências de marketing digital. Os demais 44 não trataram do assunto: seguem legíveis por omissão, não por decisão.
Por que isso importa
Assistentes como ChatGPT, Google Gemini, Perplexity e Claude respondem perguntas que antes iam para a busca — inclusive perguntas comerciais com recorte local, do tipo "melhor clínica em Campinas" ou "empresa de contabilidade em Campinas".
Para citar uma empresa, esses sistemas precisam conseguir ler o site dela. Quem autoriza ou nega
essa leitura é um arquivo de texto na raiz do site: o robots.txt. Uma linha ali decide
se a empresa pode ou não aparecer nessas respostas.
Metodologia
- Amostra: 59 sites de empresas de Campinas e região, distribuídos em 7 setores, identificados por busca pública em agosto de 2026.
- Procedimento: requisição do arquivo
/robots.txtde cada domínio, com análise das diretivas por agente. - Agentes verificados: GPTBot (OpenAI), Google-Extended (Google), PerplexityBot, ClaudeBot e anthropic-ai (Anthropic), CCBot (Common Crawl), Applebot-Extended (Apple) e Bytespider (ByteDance).
- Critério: considerou-se "bloqueio" a diretiva
Disallow: /associada ao agente, ou bloqueio geral para todos os agentes. - Data da coleta: 6 de agosto de 2026.
O levantamento usa apenas informação pública, acessível a qualquer pessoa. Os resultados são agregados por setor: não divulgamos nomes de empresas.
Resultados
| Setor | Sites | Sem robots.txt | Sem decisão sobre IA | Bloqueiam | Liberam |
|---|---|---|---|---|---|
| Agências de marketing e criação de sites | 16 | 2 | 11 | 2 | 1 |
| Clínicas médicas | 8 | 1 | 6 | 1 | 0 |
| Clínicas odontológicas | 8 | 2 | 6 | 0 | 0 |
| Escritórios de advocacia | 8 | 0 | 7 | 1 | 0 |
| Imobiliárias | 8 | 2 | 6 | 0 | 0 |
| Contabilidade | 6 | 1 | 5 | 0 | 0 |
| Academias e estúdios | 5 | 2 | 3 | 0 | 0 |
| Total | 59 | 10 | 44 | 4 | 1 |
O que os números dizem — e o que não dizem
Apenas 1 site dos 59 analisados (2%) declara explicitamente permissão para crawlers de IA. Nos demais, a ausência de menção significa que o acesso está tecnicamente liberado por padrão — mas por omissão, não por decisão.
Essa distinção é importante e costuma ser distorcida: não mencionar não é o mesmo que bloquear. A maioria dos sites da amostra pode ser lida pelos assistentes. O que praticamente ninguém fez foi tratar o assunto de forma deliberada.
Há, porém, 4 sites que bloqueiam ativamente os robôs de IA. Nesses casos o efeito é concreto: por melhor que seja o conteúdo, esses assistentes não conseguem lê-lo e não vão citá-lo.
Um achado que merece nota: 2 dos 4 bloqueios estão em agências de marketing digital — empresas contratadas justamente para dar visibilidade a terceiros. É um indício de que o bloqueio raramente é escolha estratégica: costuma vir de configuração padrão de plugin ou tema, instalada e nunca revisada.
Os 10 sites sem robots.txt
Cerca de 17% da amostra não tem o arquivo. Isso não impede a leitura — sem
robots.txt, o padrão é permitir. Mas indica ausência de controle sobre um ponto que hoje
define presença em busca e em IA.
Como verificar o seu site em 30 segundos
- Abra o arquivo
Digite no navegador o endereço do seu site seguido de
/robots.txt. Exemplo:suaempresa.com.br/robots.txt - Procure os agentes de IA Use Ctrl+F e busque por GPTBot, Google-Extended, PerplexityBot e ClaudeBot.
- Leia a linha seguinte
Se aparecer
Disallow: /, aquele assistente está proibido de ler o site. Se aparecerAllow: /, está autorizado. - Verifique o bloqueio geral
Um
User-agent: *seguido deDisallow: /bloqueia todos os robôs, inclusive os de busca.
Limitações do estudo
- A amostra é não probabilística: os sites vieram de busca pública e representam empresas com presença digital, não o universo de empresas da cidade.
- É uma fotografia de uma data, não um monitoramento. Arquivos mudam.
- O
robots.txté uma convenção, não uma barreira técnica: robôs podem ignorá-lo, ainda que os principais o respeitem. - Permissão de leitura não garante citação. É condição necessária, não suficiente — a citação depende também de conteúdo, autoridade e estrutura de dados.
Conclusão
A maioria das empresas de Campinas com presença digital ainda não tomou nenhuma decisão sobre como quer ser tratada pelos assistentes de IA. Isso não é, por si só, um problema — mas significa que o resultado é fruto do acaso e não de estratégia.
Para quem quer ser encontrado nessas respostas, liberar o acesso é apenas o primeiro passo, e o mais barato. O trabalho seguinte é o de sempre: ter conteúdo que valha ser citado.
Perguntas frequentes
O que é o robots.txt?
É um arquivo de texto na raiz do site que informa aos robôs automatizados quais partes eles podem acessar. Fica sempre no mesmo endereço: seudominio.com.br/robots.txt. É uma convenção respeitada pelos principais buscadores e assistentes de IA.
Quais são os robôs de IA que devo conhecer?
Os principais são GPTBot, da OpenAI, que alimenta o ChatGPT; Google-Extended, do Google, ligado ao Gemini e aos AI Overviews; PerplexityBot, da Perplexity; e ClaudeBot e anthropic-ai, da Anthropic. Há também CCBot, do Common Crawl, usado por vários modelos.
Se meu site não menciona esses robôs, ele está bloqueado?
Não. Sem menção, o padrão é permitir o acesso. A ausência de declaração significa apenas que não houve decisão sobre o assunto — o site continua legível pelos assistentes.
Bloquear os robôs de IA é sempre ruim?
Não necessariamente. Sites que vivem de conteúdo pago ou exclusivo podem ter razões legítimas para bloquear. O problema é bloquear sem saber, o que é o caso mais comum quando a configuração vem de um plugin.
Liberar o acesso garante que a IA vai citar minha empresa?
Não. É condição necessária, não suficiente. A citação depende também de ter conteúdo útil, dados estruturados e autoridade reconhecida. Liberar o acesso apenas garante que existe a chance.
Como faço para liberar os crawlers de IA no meu site?
Adicionando ao robots.txt um bloco para cada agente com a diretiva de permissão. Se houver um Disallow existente para esses agentes, ele precisa ser removido. Em sites feitos em WordPress, a origem costuma ser um plugin de SEO ou de privacidade.
Este estudo pode ser replicado?
Sim, e é o objetivo. Todos os dados vêm de arquivos públicos, acessíveis por qualquer navegador. A metodologia está descrita nesta página e pode ser repetida por qualquer pessoa em qualquer cidade.
Por que os nomes das empresas não são divulgados?
Porque o objetivo é medir um comportamento de mercado, não expor empresas individuais. Os resultados agregados por setor sustentam a mesma conclusão sem gerar constrangimento a terceiros.
Quer saber como seu site está?
Faço a verificação gratuita do seu robots.txt e da sua estrutura de dados, e mostro o que está impedindo sua empresa de aparecer nas respostas dos assistentes de IA.
Quero a verificação gratuita →