Resposta rápida: O Content-Signal é uma diretiva de robots.txt, popularizada pela Cloudflare, que permite declarar separadamente três preferências de uso do conteúdo: search (aparecer em resultados de busca), ai-train (ser usado para treinar modelos de IA) e ai-input (ser usado como insumo em respostas geradas por IA, como AI Overviews e chatbots). A sintaxe básica é Content-Signal: search=yes, ai-train=no, ai-input=yes, podendo ser aplicada ao site todo ou por caminho específico. Importante: essa diretiva não substitui Allow/Disallow — ela declara uma preferência adicional sobre o uso do conteúdo, e nem todo sistema automatizado respeita robots.txt.
Depois de explicarmos por que a Cloudflare separou crawlers de treinamento, busca e agentes de IA em sua nova política, este guia mostra como configurar, na prática, o Content-Signal do seu próprio robots.txt — a peça que permite comunicar essa distinção diretamente aos sistemas que leem o arquivo.
Os três sinais do Content-Signal

São três os parâmetros: search (construção de índice de busca e exibição em resultados), ai-train (uso do conteúdo para treinar ou ajustar modelos de IA) e ai-input (uso do conteúdo como insumo para respostas geradas por IA, como AI Overviews e respostas de chatbots). Cada um aceita yes ou no. Se você omitir um sinal, não está concedendo nem restringindo nada por esse mecanismo para aquele uso específico — o campo simplesmente fica indefinido.
Sintaxe básica: aplicando ao site inteiro
A forma mais simples é declarar o Content-Signal para todos os user-agents, sem especificar caminho:
User-Agent: *
Content-Signal: search=yes, ai-train=no, ai-input=yes
Essa configuração permite indexação em busca tradicional e uso do conteúdo em respostas geradas por IA, mas recusa o uso do site para treinar novos modelos.
Aplicando por caminho: regras diferentes por seção do site

O Content-Signal também pode ser declarado por caminho, permitindo políticas diferentes em áreas distintas do site:
User-Agent: *
Content-Signal: /blog search=yes, ai-train=no, ai-input=yes
Content-Signal: /about search=yes
Content-Signal: /projects search=yes, ai-train=no, ai-input=no
Allow: /
Disallow: /projects
Nesse exemplo, o blog aceita citação em IA mas recusa treinamento; a página "sobre" só declara preferência de busca; e a seção de projetos recusa tanto treinamento quanto uso como insumo de IA — mesmo estando acessível via Allow. Note que o Content-Signal e as diretivas tradicionais (Allow/Disallow) operam em paralelo: uma controla acesso de rastreamento, a outra declara preferência de uso posterior do conteúdo já coletado.
Como validar a configuração

Depois de editar o robots.txt, use uma ferramenta de teste (como o validador do Search Console ou ferramentas de terceiros compatíveis com Content-Signal) para confirmar que não há erros de sintaxe. Um erro comum é misturar o Content-Signal com as regras clássicas de forma inconsistente — por exemplo, declarar ai-input=yes em um caminho bloqueado por Disallow, o que na prática impede o rastreamento antes mesmo de o sinal ser lido.
O que lembrar antes de publicar
O Content-Signal não substitui Allow/Disallow; ele adiciona uma camada declarativa sobre como o conteúdo já acessível pode ser usado depois. E, como qualquer diretiva de robots.txt, sua eficácia depende de o sistema automatizado respeitar o arquivo — nem todo crawler ou agente de IA obedece essas regras. Ainda assim, os principais provedores (incluindo a própria Cloudflare) já sinalizam suporte crescente ao padrão, o que torna a configuração um investimento razoável para quem quer declarar preferências de forma explícita.
Perguntas frequentes
Quais são os três sinais do Content-Signal?
search (indexação em busca), ai-train (uso para treinar modelos de IA) e ai-input (uso como insumo em respostas geradas por IA), cada um aceitando yes ou no.
O Content-Signal substitui o Allow/Disallow do robots.txt?
Não. Ele é uma camada adicional que declara preferência de uso do conteúdo, enquanto Allow/Disallow controla o acesso de rastreamento em si.
Todo crawler de IA respeita o Content-Signal?
Não necessariamente. Como qualquer diretiva de robots.txt, depende de o sistema automatizado optar por seguir o padrão — nem todos respeitam.
Leia também

Fonte: Better Robots.txt — Content-Signal in robots.txt: search, ai-input, and ai-train.
Deixe um comentário