Solicitar avaliação estratégica
Search Intelligence para empresas
← Biblioteca AUDITSEO
AUDITORIA TÉCNICA

OAI-SearchBot vs GPTBot: como auditar crawlers de IA sem confundir busca e treinamento

Entenda a diferença entre OAI-SearchBot e GPTBot, como revisar robots.txt, CDN/WAF e logs e por que permitir busca não significa autorizar treinamento nem garantir citação no ChatGPT.

Por Sidney Santos Publicado em 07 de setembro de 2026 14 min
RESPOSTA DIRETA

OAI-SearchBot e GPTBot não devem ser tratados como o mesmo crawler. A documentação atual da OpenAI orienta permitir OAI-SearchBot quando o site deseja ser elegível para descoberta e inclusão em resultados da Busca do ChatGPT. Para excluir páginas de possível uso em treinamento, a OpenAI orienta bloquear GPTBot. Essas decisões podem coexistir. Permitir OAI-SearchBot melhora a elegibilidade técnica para busca, mas não garante que uma página será citada, recomendada ou posicionada em uma resposta.

EM RESUMO
  • OAI-SearchBot está ligado à descoberta para a Busca do ChatGPT; GPTBot é um controle separado relacionado a possível treinamento.
  • Uma empresa pode permitir OAI-SearchBot e bloquear GPTBot quando essa combinação corresponde à sua política.
  • robots.txt declara uma política por user-agent; CDN, WAF e respostas HTTP ainda podem bloquear acesso na prática.
  • A OpenAI informa que posicionamento na Busca do ChatGPT não é garantido mesmo quando o site é elegível.
  • A auditoria precisa registrar objetivo, regra, infraestrutura, páginas testadas, evidência em logs e data da documentação consultada.

O erro que mais causa confusão: 'bot da OpenAI' não é uma única finalidade

Políticas de crawler precisam começar pela finalidade. Se a empresa deseja presença na busca, a decisão é diferente de autorizar ou não possível uso para treinamento. Colocar todos os user-agents em uma mesma regra pode produzir exatamente o efeito contrário ao desejado.

OAI-SearchBot: descoberta para a Busca do ChatGPT

A OpenAI orienta publishers que desejam que conteúdo possa ser encontrado, exibido, citado e vinculado na Busca do ChatGPT a não bloquear o OAI-SearchBot. A página de ajuda sobre Busca do ChatGPT também diz que, para elegibilidade, o host ou CDN precisa permitir tráfego dos endereços IP publicados do robô de busca.

GPTBot: um controle separado para possível treinamento

Na FAQ atual para publishers, a OpenAI orienta bloquear o user-agent GPTBot nos sites e páginas que o publisher deseja excluir de possível treinamento. Isso mostra que busca e treinamento possuem controles distintos e não devem ser tratados como a mesma permissão.

Portanto, uma política pode permitir OAI-SearchBot e bloquear GPTBot. A escolha depende da política de dados da organização, não de uma suposta pontuação de SEO.

Uma matriz simples para decidir

  • quero elegibilidade para Busca do ChatGPT → revisar acesso do OAI-SearchBot
  • não quero permitir possível uso para treinamento → revisar regra do GPTBot
  • quero bloquear completamente descoberta pelo meu domínio → avaliar robots.txt e noindex conforme o efeito desejado e a documentação atual
  • quero saber se o bot realmente chega às páginas → validar CDN/WAF e logs, não apenas o arquivo robots.txt

robots.txt não conta a história inteira

Uma regra Allow pode estar correta enquanto a infraestrutura devolve 403, 429 ou desafio de bot. Por isso a auditoria precisa testar o caminho completo entre crawler e conteúdo.

  • robots.txt no host e protocolo corretos
  • firewall e bot management
  • CDN e allowlist de IP quando documentada
  • status HTTP das URLs prioritárias
  • autenticação, CAPTCHA e desafios JavaScript
  • conteúdo principal disponível no HTML recebido
  • logs de edge ou servidor quando disponíveis

Por que noindex e robots.txt não são equivalentes

A FAQ da OpenAI observa que, para um crawler ler uma meta tag noindex, ele precisa ter permissão para rastrear a página. Isso é um lembrete importante: bloquear crawl e pedir ao crawler que leia uma diretiva dentro da página são ações diferentes.

A documentação atual também observa que, em certos cenários, um URL bloqueado conhecido por outra fonte pode ter apenas link e título apresentados. A política deve ser desenhada a partir do efeito desejado, não de uma regra copiada de outro site.

O que testar além da homepage

  • home e páginas institucionais que definem a entidade
  • páginas de serviço e produto
  • artigos e documentos que podem funcionar como fonte
  • páginas de autores e especialistas
  • estudos, metodologia, cases e documentos de prova
  • subdomínios relevantes quando possuem robots.txt próprio

Como usar logs sem extrapolar o que eles provam

Logs podem demonstrar requests diretos ao seu domínio: user-agent, URL, status, timestamp e frequência. Eles são ótimos para confirmar bloqueios operacionais. A ausência de request, porém, não prova que a plataforma desconhece a informação, porque respostas podem usar outros mecanismos e fontes.

Não transforme crawler policy em 'GEO score'

Permitir um bot adequado é uma condição técnica que pode ser necessária ao objetivo. Não existe base para transformar a presença de uma regra Allow em um percentual de autoridade, prontidão de IA ou probabilidade de citação. A etapa seguinte continua sendo conteúdo, intenção, entidade, confiança e citabilidade.

Checklist de auditoria

  • definir objetivo de busca e política de treinamento separadamente
  • confirmar user-agent e finalidade em documentação oficial atual
  • registrar a regra efetiva do robots.txt
  • testar CDN/WAF e status HTTP das páginas estratégicas
  • validar conteúdo recebido e meta robots quando aplicável
  • consultar logs quando disponíveis
  • documentar data, evidência, responsável e próxima revisão
AUTORIA

Sidney Santos

Especialista em SEO e Search Intelligence e fundador da AUDITSEO. O conteúdo editorial é produzido para documentar método, evidências, limites e aprendizados sobre busca — não para fabricar volume de páginas.

Ver perfil e metodologia do autor