OAI-SearchBot vs GPTBot: como auditar crawlers de IA sem confundir busca e treinamento
Entenda a diferença entre OAI-SearchBot e GPTBot, como revisar robots.txt, CDN/WAF e logs e por que permitir busca não significa autorizar treinamento nem garantir citação no ChatGPT.
OAI-SearchBot e GPTBot não devem ser tratados como o mesmo crawler. A documentação atual da OpenAI orienta permitir OAI-SearchBot quando o site deseja ser elegível para descoberta e inclusão em resultados da Busca do ChatGPT. Para excluir páginas de possível uso em treinamento, a OpenAI orienta bloquear GPTBot. Essas decisões podem coexistir. Permitir OAI-SearchBot melhora a elegibilidade técnica para busca, mas não garante que uma página será citada, recomendada ou posicionada em uma resposta.
- OAI-SearchBot está ligado à descoberta para a Busca do ChatGPT; GPTBot é um controle separado relacionado a possível treinamento.
- Uma empresa pode permitir OAI-SearchBot e bloquear GPTBot quando essa combinação corresponde à sua política.
- robots.txt declara uma política por user-agent; CDN, WAF e respostas HTTP ainda podem bloquear acesso na prática.
- A OpenAI informa que posicionamento na Busca do ChatGPT não é garantido mesmo quando o site é elegível.
- A auditoria precisa registrar objetivo, regra, infraestrutura, páginas testadas, evidência em logs e data da documentação consultada.
O erro que mais causa confusão: 'bot da OpenAI' não é uma única finalidade
Políticas de crawler precisam começar pela finalidade. Se a empresa deseja presença na busca, a decisão é diferente de autorizar ou não possível uso para treinamento. Colocar todos os user-agents em uma mesma regra pode produzir exatamente o efeito contrário ao desejado.
OAI-SearchBot: descoberta para a Busca do ChatGPT
A OpenAI orienta publishers que desejam que conteúdo possa ser encontrado, exibido, citado e vinculado na Busca do ChatGPT a não bloquear o OAI-SearchBot. A página de ajuda sobre Busca do ChatGPT também diz que, para elegibilidade, o host ou CDN precisa permitir tráfego dos endereços IP publicados do robô de busca.
GPTBot: um controle separado para possível treinamento
Na FAQ atual para publishers, a OpenAI orienta bloquear o user-agent GPTBot nos sites e páginas que o publisher deseja excluir de possível treinamento. Isso mostra que busca e treinamento possuem controles distintos e não devem ser tratados como a mesma permissão.
Portanto, uma política pode permitir OAI-SearchBot e bloquear GPTBot. A escolha depende da política de dados da organização, não de uma suposta pontuação de SEO.
Uma matriz simples para decidir
- quero elegibilidade para Busca do ChatGPT → revisar acesso do OAI-SearchBot
- não quero permitir possível uso para treinamento → revisar regra do GPTBot
- quero bloquear completamente descoberta pelo meu domínio → avaliar robots.txt e noindex conforme o efeito desejado e a documentação atual
- quero saber se o bot realmente chega às páginas → validar CDN/WAF e logs, não apenas o arquivo robots.txt
robots.txt não conta a história inteira
Uma regra Allow pode estar correta enquanto a infraestrutura devolve 403, 429 ou desafio de bot. Por isso a auditoria precisa testar o caminho completo entre crawler e conteúdo.
- robots.txt no host e protocolo corretos
- firewall e bot management
- CDN e allowlist de IP quando documentada
- status HTTP das URLs prioritárias
- autenticação, CAPTCHA e desafios JavaScript
- conteúdo principal disponível no HTML recebido
- logs de edge ou servidor quando disponíveis
Por que noindex e robots.txt não são equivalentes
A FAQ da OpenAI observa que, para um crawler ler uma meta tag noindex, ele precisa ter permissão para rastrear a página. Isso é um lembrete importante: bloquear crawl e pedir ao crawler que leia uma diretiva dentro da página são ações diferentes.
A documentação atual também observa que, em certos cenários, um URL bloqueado conhecido por outra fonte pode ter apenas link e título apresentados. A política deve ser desenhada a partir do efeito desejado, não de uma regra copiada de outro site.
O que testar além da homepage
- home e páginas institucionais que definem a entidade
- páginas de serviço e produto
- artigos e documentos que podem funcionar como fonte
- páginas de autores e especialistas
- estudos, metodologia, cases e documentos de prova
- subdomínios relevantes quando possuem robots.txt próprio
Como usar logs sem extrapolar o que eles provam
Logs podem demonstrar requests diretos ao seu domínio: user-agent, URL, status, timestamp e frequência. Eles são ótimos para confirmar bloqueios operacionais. A ausência de request, porém, não prova que a plataforma desconhece a informação, porque respostas podem usar outros mecanismos e fontes.
Não transforme crawler policy em 'GEO score'
Permitir um bot adequado é uma condição técnica que pode ser necessária ao objetivo. Não existe base para transformar a presença de uma regra Allow em um percentual de autoridade, prontidão de IA ou probabilidade de citação. A etapa seguinte continua sendo conteúdo, intenção, entidade, confiança e citabilidade.
Checklist de auditoria
- definir objetivo de busca e política de treinamento separadamente
- confirmar user-agent e finalidade em documentação oficial atual
- registrar a regra efetiva do robots.txt
- testar CDN/WAF e status HTTP das páginas estratégicas
- validar conteúdo recebido e meta robots quando aplicável
- consultar logs quando disponíveis
- documentar data, evidência, responsável e próxima revisão
O que sustenta as afirmações externas deste artigo
Priorizamos documentação primária para afirmações sobre plataformas. Conceitos e frameworks proprietários da AUDITSEO são identificados como tal no texto.
OpenAI — Editores e desenvolvedores — FAQ
Fonte oficial atual para distinção entre OAI-SearchBot, descoberta na busca e GPTBot como controle relacionado a possível treinamento.
OpenAI — Como pesquisar na web com o ChatGPT
Fonte oficial sobre elegibilidade via OAI-SearchBot, IPs publicados e ausência de garantia de posicionamento.
Google Crawling Infrastructure — robots.txt specification
Referência técnica pública sobre interpretação do robots.txt e regras por user-agent.
Fontes consultadas e verificadas em 07 de setembro de 2026.
Sidney Santos
Especialista em SEO e Search Intelligence e fundador da AUDITSEO. O conteúdo editorial é produzido para documentar método, evidências, limites e aprendizados sobre busca — não para fabricar volume de páginas.
Ver perfil e metodologia do autor