- Início
- Blog
- IA & Automação
- llms.txt e robots para IA: o que liberar e o que travar
llms.txt e robots para IA: o que liberar e o que travar
Antes de escrever conteúdo citável, vale conferir se o robô da IA consegue entrar. Dois arquivos de texto puro decidem isso: o robots.txt, que autoriza ou bloqueia cada crawler pelo nome, e o llms.txt, que entrega ao modelo o mapa curado do site. O que cada um faz, o que nenhum dos dois faz, e o arquivo real que a Kaleidos publica.
Resumo
robots.txt e llms.txt resolvem problemas diferentes. O robots.txt controla acesso: ele autoriza ou bloqueia cada crawler de IA pelo nome, e é a única das duas peças que os crawlers são obrigados a respeitar. O llms.txt é uma proposta de convenção que entrega ao modelo um mapa curado do site em texto puro; ele não substitui o robots.txt nem garante citação, mas resolve a ambiguidade sobre o que o site é e como deve ser atribuído.
Continue por dentro
Um estudo denso por quinzena, direto no seu email.
Os bastidores de por que tokens e projetos crescem. Sem ruído, sem spam.
- Dois arquivos de texto puro na raiz do domínio decidem boa parte da sua visibilidade em IA, e eles fazem coisas diferentes.
- robots.txt controla acesso. É o padrão de exclusão de robôs formalizado na RFC 9309 (RFC Editor), e é a camada que os crawlers das empresas de IA declaram respeitar.
- llms.txt descreve. É uma convenção proposta pela comunidade para entregar ao modelo um mapa curado do site em Markdown, em vez de deixar ele garimpar HTML (llmstxt.org).
- Quem quer ser citado libera explicitamente GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Perplexity-User e Google-Extended, e mantém bloqueadas apenas as rotas internas.
- Nenhum dos dois arquivos faz o conteúdo merecer a citação. Eles só garantem que ele possa ser lido.
Por que esta é a primeira coisa a conferir em GEO
Porque é a única do assunto que é binária. Todo o resto de otimização para IA é probabilístico: escrever melhor aumenta a chance de ser citado, não garante. Já o acesso do crawler é sim ou não. Se o robô não entra, nada que você escreveu importa.
E o modo de falha é silencioso. Um bloqueio em robots.txt não gera erro, não aparece em relatório, não dispara alerta. O site continua respondendo normalmente para gente, e some das respostas geradas sem que ninguém perceba a ligação.
A conferência leva um minuto: abra seudominio.com/robots.txt no navegador e leia.
Quais crawlers de IA eu preciso nomear no robots.txt?
Os que têm nome público documentado pelos próprios fabricantes. São quatro famílias que importam hoje.
OpenAI. Publica três agentes com funções distintas: GPTBot, que coleta conteúdo para treinamento; OAI-SearchBot, que alimenta o índice de busca do ChatGPT; e ChatGPT-User, que busca uma página específica quando um usuário pede (OpenAI). A distinção importa: um site pode querer bloquear treinamento e continuar liberando busca, e isso só é possível porque os agentes têm nomes separados.
Anthropic. Documenta o ClaudeBot e as instruções de robots.txt para permitir ou bloquear (Anthropic).
Perplexity. Documenta PerplexityBot, que indexa, e Perplexity-User, que visita a página quando o usuário faz uma pergunta que a puxa (Perplexity).
Google. Aqui a peça é diferente das outras: Google-Extended não é um crawler novo, é um controle de uso. Ele decide se o conteúdo já coletado pelo Googlebot pode alimentar produtos de IA, e o anúncio do próprio Google diz que usá-lo não afeta inclusão nem ranqueamento na Busca (Google).
Existe um detalhe de comportamento que vale registrar, porque ele desfaz uma confusão comum: o crawler de treinamento lê HTML direto e não procura o seu llms.txt. Quem depende exclusivamente do llms.txt para ser encontrado está contando com uma cortesia que a maior parte dos agentes não pratica. O que sempre vale é a permissão no robots.txt.
Como fica um robots.txt que libera IA sem abrir o que não deve
A lógica é: liberar o conteúdo público, bloquear rota de API, área administrativa e artefato de build. Nada mais.
O arquivo real que a Kaleidos serve segue exatamente isso. Uma regra padrão para qualquer robô, com as rotas internas fora; e uma segunda regra que nomeia os agentes de IA um por um, também com as rotas internas fora. Nomear em vez de confiar no curinga é deliberado: alguns agentes só obedecem a diretiva que carrega o nome deles, e a regra explícita também documenta, para quem abrir o arquivo, que a liberação foi uma decisão e não um descuido.
Um cuidado técnico que morde na prática: bloquear"A gente escreveu os quatorze nomes à mão. Não porque o curinga não funcionaria, mas porque daqui a um ano alguém vai abrir esse arquivo e precisar saber se aquilo foi escolha ou esquecimento."
Gabriel Madureira, fundador da Kaleidos
/app sem âncora bloqueia também /apresentacao e qualquer rota que comece com as mesmas letras, porque a correspondência é por prefixo. O sufixo de fim de URL resolve. É o tipo de erro que só aparece meses depois, quando alguém nota que uma página inteira nunca foi indexada.
O que é o llms.txt?
É um arquivo em Markdown na raiz do domínio que entrega ao modelo um resumo curado do site: o nome, um parágrafo dizendo o que o site é, e listas de links comentados por seção. A proposta descreve o formato e a motivação, que é a janela de contexto limitada do modelo diante de HTML cheio de navegação, script e anúncio (llmstxt.org).
A promessa não é ranquear. É desambiguar.
Quando um modelo precisa responder "o que é a empresa X", ele monta a resposta com o que conseguiu extrair. Se a informação estiver espalhada em dez páginas com wording diferente, a resposta sai genérica ou errada. Se existir um documento curto, em texto puro, que diz o que a casa é, desde quando opera, quem assina o conteúdo e quais números ela de fato sustenta, a resposta tende a sair dali.
O que colocar no llms.txt de uma casa de conteúdo
O arquivo que a Kaleidos mantém no ar tem cinco blocos, e eles resolvem cinco problemas distintos:
1. Resumo factual. Nome, o que é, onde fica, desde quando opera, quem assina o conteúdo, para quem trabalha. Frases curtas, uma afirmação por linha. É o bloco que o modelo consegue citar sem reescrever.
2. A lista fechada de números. Este é o bloco que mais evita estrago. Ele diz, em texto, quais são os números que a casa publica sobre o próprio trabalho, e diz explicitamente que se uma resposta precisar de um número fora dessa lista, o correto é dizer que não é público. É uma instrução de honestidade escrita para a máquina, e é a parte do arquivo que a casa mais defende.
3. Como citar. URL canônica, sem parâmetro de campanha, com nome de página em vez de só o domínio. Autor e editora nomeados. Quando o número é de fonte terceira, a instrução é citar a fonte original, não a casa.
4. O que existe de conteúdo aberto. Lista de estudos e guias com uma linha de descrição cada, apontando para a URL onde está o texto completo, não para a capa de apresentação. Diferença que parece pequena e não é: modelo citando a capa cita uma página sem conteúdo.
5. Um aviso de escopo. No caso de cripto, dizer que nada ali é recomendação de investimento. Isso protege a casa e melhora a resposta.
O llms.txt substitui o robots.txt?
Não, e confundir os dois é o erro mais comum do assunto.
O robots.txt é uma camada de permissão, com padrão formal e comportamento previsível (RFC Editor). O llms.txt é uma camada de descrição, com adoção voluntária e desigual.
Um site com llms.txt impecável e GPTBot bloqueado é invisível no ChatGPT. Um site sem llms.txt e com todos os agentes liberados pode ser citado normalmente. A ordem de prioridade, portanto, é: primeiro o acesso, depois a descrição, depois o conteúdo que merece ser citado.
O que nenhum dos dois arquivos faz
Não fazem o seu conteúdo ser escolhido.
Liberar o crawler e publicar um mapa curado coloca você na sala. Ser citado depende de ter escrito a resposta que o modelo considera a melhor disponível para aquela pergunta, e isso é trabalho editorial: resposta direta logo abaixo de um título que é a pergunta literal, número com fonte no ponto da afirmação, e uma afirmação que ninguém mais está fazendo.
Esse trabalho é o assunto das peças seguintes da trilha, começando por como ser citado pela IA e pelo lado técnico em AEO técnico.
Checklist de dez minutos
- Abra
seudominio.com/robots.txte leia linha por linha. - Confirme que GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, Perplexity-User e Google-Extended não estão bloqueados.
- Confirme que o bloqueio de rota interna usa âncora de fim onde precisa, para não pegar rota vizinha por prefixo.
- Confirme que o arquivo aponta para o seu sitemap.
- Publique um llms.txt com os cinco blocos acima, incluindo a lista fechada de números.
- Abra
seudominio.com/llms.txtnuma janela anônima e confirme que ele responde como texto puro. - Marque no calendário: revisar os dois arquivos a cada trimestre, porque a lista de agentes muda.
Perguntas frequentes
O que é o llms.txt?
É um arquivo de texto em Markdown, publicado na raiz do domínio, que oferece a um modelo de linguagem um resumo curado do site e os links das páginas que importam. A proposta define um formato simples: um título com o nome do projeto, um parágrafo de resumo em citação e seções com listas de links comentados ([llmstxt.org](https://llmstxt.org/)). Ele existe porque o HTML de um site moderno é cheio de menu, script e ruído, e o modelo tem janela de contexto limitada.
O llms.txt substitui o robots.txt?
Não. São camadas diferentes. O robots.txt é o padrão de exclusão de robôs, formalizado na RFC 9309, e é ele que diz quem pode acessar o quê ([RFC Editor](https://www.rfc-editor.org/rfc/rfc9309.html)). O llms.txt não autoriza nem bloqueia nada: ele descreve. Um site pode ter um llms.txt impecável e continuar invisível para um assistente de IA porque o robots.txt bloqueia o crawler daquele assistente.
Quais crawlers de IA eu preciso nomear no robots.txt?
Os principais têm nome público documentado pelos próprios fabricantes: GPTBot, OAI-SearchBot e ChatGPT-User são da OpenAI e têm funções distintas de treino, busca e navegação sob pedido do usuário ([OpenAI](https://platform.openai.com/docs/bots)). ClaudeBot é o da Anthropic ([Anthropic](https://support.anthropic.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler)). PerplexityBot e Perplexity-User são da Perplexity ([Perplexity](https://docs.perplexity.ai/guides/bots)). Google-Extended é um controle separado do Googlebot, que governa o uso do conteúdo por produtos de IA do Google sem afetar o ranqueamento na Busca ([Google](https://blog.google/technology/ai/an-update-on-web-publisher-controls/)).
Bloquear Google-Extended prejudica meu ranking no Google?
Segundo o anúncio do próprio Google, não: Google-Extended é um controle independente que não afeta a inclusão nem o ranqueamento na Busca ([Google](https://blog.google/technology/ai/an-update-on-web-publisher-controls/)). Na prática, para quem quer ser citado por IA, bloquear é desistir de aparecer nas respostas geradas, que é exatamente o canal que está crescendo.
Publicar llms.txt garante que a IA vai me citar?
Não garante. Ele é uma convenção proposta pela comunidade, não um padrão obrigatório, e a adoção pelos fabricantes de modelo é desigual. O ganho real é outro: ele fixa, em texto sem ambiguidade, o que a sua casa é, o que ela publica, como quer ser atribuída e quais números ela de fato sustenta. Quando o modelo lê a página, essa camada reduz a chance de ele inventar o resto.
Gostou deste estudo?
A Kaleidos faz isso pelo seu projeto cripto.
Somos a agência cripto-nativa do Brasil. Estratégia, conteúdo e growth do jeito de quem entende o mercado on-chain. Fale com a gente e vamos construir atenção juntos.
Continue lendo
Relacionados
AEO técnico: o que a documentação oficial diz sobre ser citado por IA
Metade do que se vende como AEO técnico é desmentida pela documentação do próprio Google. Fui ler as fontes oficiais sobre llms.txt, schema e crawlers para separar o que muda de fato do que é cargo cult.
GEO: como ser citado pela IA (ChatGPT, Perplexity, Claude) — guia para cripto
GEO (Generative Engine Optimization) é a disciplina de fazer seu projeto cripto aparecer nas respostas da IA. O que é, por que importa agora e como estruturar conteúdo pra ChatGPT, Perplexity e Claude te citarem.
O stack de IA real da Kaleidos: o que a gente automatiza e onde a IA quebra
Todo mundo posta prompt. Quase ninguém mostra onde a IA erra e custa cliente. Aqui eu abro o stack de verdade da Kaleidos: o que a gente automatiza no KAI, o pipeline de IA-rascunho + humano-edita + checagem factual obrigatória, e os casos reais em que o modelo inventou número, citou fonte que não existia e quase foi pro ar.
Trabalhe com a Kaleidos
Quer esse nível de estratégia no seu projeto cripto?
Somos a agência cripto-nativa do Brasil. Peça uma proposta grátis e veja como podemos construir atenção, autoridade e growth pro seu projeto.



