Guia prático: como configurar o Content-Signal no robots.txt para separar busca, treino e IA

Resposta rápida: O Content-Signal é uma diretiva de robots.txt, popularizada pela Cloudflare, que permite declarar separadamente três preferências de uso do conteúdo: search (aparecer em resultados de busca), ai-train (ser usado para treinar modelos de IA) e ai-input (ser usado como insumo em respostas geradas por IA, como AI Overviews e chatbots). A sintaxe básica é Content-Signal: search=yes, ai-train=no, ai-input=yes, podendo ser aplicada ao site todo ou por caminho específico. Importante: essa diretiva não substitui Allow/Disallow — ela declara uma preferência adicional sobre o uso do conteúdo, e nem todo sistema automatizado respeita robots.txt.

Depois de explicarmos por que a Cloudflare separou crawlers de treinamento, busca e agentes de IA em sua nova política, este guia mostra como configurar, na prática, o Content-Signal do seu próprio robots.txt — a peça que permite comunicar essa distinção diretamente aos sistemas que leem o arquivo.

Indice
  1. Os três sinais do Content-Signal
  2. Sintaxe básica: aplicando ao site inteiro
  3. Aplicando por caminho: regras diferentes por seção do site
  4. Como validar a configuração
  5. O que lembrar antes de publicar
  6. Perguntas frequentes
  7. Leia também

Os três sinais do Content-Signal

Três interruptores glowing representando os sinais de busca, treinamento e uso como insumo de IA
Cada sinal do Content-Signal controla um uso diferente do conteúdo: busca, treinamento de modelos e resposta gerada por IA.

São três os parâmetros: search (construção de índice de busca e exibição em resultados), ai-train (uso do conteúdo para treinar ou ajustar modelos de IA) e ai-input (uso do conteúdo como insumo para respostas geradas por IA, como AI Overviews e respostas de chatbots). Cada um aceita yes ou no. Se você omitir um sinal, não está concedendo nem restringindo nada por esse mecanismo para aquele uso específico — o campo simplesmente fica indefinido.

Sintaxe básica: aplicando ao site inteiro

A forma mais simples é declarar o Content-Signal para todos os user-agents, sem especificar caminho:

User-Agent: *
Content-Signal: search=yes, ai-train=no, ai-input=yes

Essa configuração permite indexação em busca tradicional e uso do conteúdo em respostas geradas por IA, mas recusa o uso do site para treinar novos modelos.

Aplicando por caminho: regras diferentes por seção do site

Estrutura de pastas com diferentes ícones de permissão de acesso em cada ramo
O Content-Signal pode ter valores diferentes por caminho, permitindo políticas distintas para blog, sobre e áreas restritas do site.

O Content-Signal também pode ser declarado por caminho, permitindo políticas diferentes em áreas distintas do site:

User-Agent: *
Content-Signal: /blog search=yes, ai-train=no, ai-input=yes
Content-Signal: /about search=yes
Content-Signal: /projects search=yes, ai-train=no, ai-input=no
Allow: /
Disallow: /projects

Nesse exemplo, o blog aceita citação em IA mas recusa treinamento; a página "sobre" só declara preferência de busca; e a seção de projetos recusa tanto treinamento quanto uso como insumo de IA — mesmo estando acessível via Allow. Note que o Content-Signal e as diretivas tradicionais (Allow/Disallow) operam em paralelo: uma controla acesso de rastreamento, a outra declara preferência de uso posterior do conteúdo já coletado.

Como validar a configuração

Checklist com marcações de verificação ao lado de uma ferramenta de validação
Ferramentas de teste de robots.txt ajudam a confirmar que a sintaxe do Content-Signal está correta antes de publicar.

Depois de editar o robots.txt, use uma ferramenta de teste (como o validador do Search Console ou ferramentas de terceiros compatíveis com Content-Signal) para confirmar que não há erros de sintaxe. Um erro comum é misturar o Content-Signal com as regras clássicas de forma inconsistente — por exemplo, declarar ai-input=yes em um caminho bloqueado por Disallow, o que na prática impede o rastreamento antes mesmo de o sinal ser lido.

O que lembrar antes de publicar

O Content-Signal não substitui Allow/Disallow; ele adiciona uma camada declarativa sobre como o conteúdo já acessível pode ser usado depois. E, como qualquer diretiva de robots.txt, sua eficácia depende de o sistema automatizado respeitar o arquivo — nem todo crawler ou agente de IA obedece essas regras. Ainda assim, os principais provedores (incluindo a própria Cloudflare) já sinalizam suporte crescente ao padrão, o que torna a configuração um investimento razoável para quem quer declarar preferências de forma explícita.

Perguntas frequentes

Quais são os três sinais do Content-Signal?

search (indexação em busca), ai-train (uso para treinar modelos de IA) e ai-input (uso como insumo em respostas geradas por IA), cada um aceitando yes ou no.

O Content-Signal substitui o Allow/Disallow do robots.txt?

Não. Ele é uma camada adicional que declara preferência de uso do conteúdo, enquanto Allow/Disallow controla o acesso de rastreamento em si.

Todo crawler de IA respeita o Content-Signal?

Não necessariamente. Como qualquer diretiva de robots.txt, depende de o sistema automatizado optar por seguir o padrão — nem todos respeitam.

Fonte: Better Robots.txt — Content-Signal in robots.txt: search, ai-input, and ai-train.

📱
Versão Web Story disponívelVisual, rápido e otimizado para Google Discover.

Ver Story ›

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Go up