O AI Visibility Index revela por que marcas fortes no Google somem das respostas de IA
Estudo da Fractl mapeou 8.500 marcas em ChatGPT, Gemini e Claude e mostrou que autoridade tradicional de SEO já não garante presença nas respostas geradas por IA.

Marcas com um dos maiores footprints de SEO↳SEO4 conteúdosPor que a transição do SEO clássico para a Otimização de Motores Generativos (GEO) exige que se repense a modelagem semânticaMarketing Tech · mai 2026O impacto da pesquisa e do SEO no comércio eletrônico: insights da State of Search Brasil 5Marketing Tech · fev 2025SEO por Elas 2025: Impulsionando e promovendo mulheres no Marketing DigitalMarketing Tech · fev 2025Ver tudo em Marketing Tech → do mercado praticamente não aparecem nas respostas de IA↳Inteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI →. Outras, com portfólio de busca modesto, viram recomendação padrão. Esse descompasso é o centro do AI Visibility Index, estudo da Fractl publicado no Search Engine Land, que mediu como três modelos generativos recomendam marcas e onde a autoridade orgânica clássica deixa de valer.
O recado curto do estudo: autoridade orgânica ainda importa, mas não é o mapa inteiro. Mais de 9 em cada 10 marcas se comportaram como um SEO esperaria (mais autoridade tradicional, mais visibilidade em IA). O interessante mora nas exceções, e é nelas que a estratégia muda.
Como o estudo foi feito
A metodologia é direta o suficiente para replicar em escala menor. A Fractl rodou 96 prompts específicos por indústria em oito setores, usando GPT-4o, Gemini 2.5 Flash e Claude Sonnet 4.6. Cada prompt foi executado 15 vezes por modelo, gerando 4.320 respostas e mais de 8.500 referências únicas de marca.
Depois, cada marca citada foi cruzada com dados do Ahrefs: domain rating, tráfego orgânico, domínios de referência e volume de keywords. Isso permitiu comparar a autoridade de busca tradicional de cada marca com a frequência com que ela aparece nas respostas de IA. Quem aparecia menos do que os números de SEO sugeririam foi classificado como sub-representado; quem aparecia mais, como overperformer.
Para um dev ou time de conteúdo no Brasil, o método já é uma sugestão prática: rode um conjunto fixo de prompts por categoria, várias vezes, em cada modelo, e compare o recall com suas métricas de Ahrefs ou similar. É engenharia de medição, não achismo.
Respostas de IA têm marcas-padrão (e nem sempre as óbvias)
Todo setor analisado tinha uma lista curta de marcas que surgiam de novo e de novo, independentemente de como o prompt era escrito. E essas respostas padrão nem sempre eram as maiores empresas nem as de maior tráfego.
Alguns padrões concretos do estudo:
- Viagem foi a categoria mais concentrada: Booking.com (285 menções), Airbnb (227) e Expedia (215) somaram cerca de 20% do volume total do setor. Três marcas em uma a cada cinco recomendações.
- HealthTech teve líder isolado: Teladoc (275) na frente de Amwell (220) por cerca de 25%.
- Wellness tinha o banco mais equilibrado: Peloton, Headspace, Calm, Whoop e Oura todos acima de 168 menções. Ninguém domina, ou seja, a vaga de líder de categoria ainda está aberta.
- Seguros inverteram a lógica do mercado: Lemonade (213) acima de State Farm (172), e Root Insurance (165) acima de Progressive (114). Os modelos citaram as seguradoras digitais primeiro e trataram as tradicionais como alternativa.
- Lifestyle foi o sinal mais forte: marcas direct-to-consumer com narrativa de sustentabilidade (Patagonia, Allbirds, Eileen Fisher, Everlane) superaram Sephora, Samsung e Whirlpool.
A conclusão estratégica: o conjunto competitivo dentro de uma resposta de IA é bem menor que o de uma página de resultados do Google. Se a marca não entra no top 5 a 10 nomes que o modelo lembra para a categoria, ranquear bem no Google pode não bastar para entrar no consideration set gerado por IA.
O que a web diz de você pesa mais que o que você diz de si
Cerca de 5% das marcas (471) ficaram sub-expostas nos LLMs: DR alto, tráfego orgânico muito alto, portfólio de keywords profundo, e quase nenhuma referência dos modelos. Na infraestrutura de SEO parecem líderes; nas referências de LLM parecem empresas sobre as quais ninguém escreveu.
Do outro lado, cerca de 4% (377) foram overperformers, citadas muito mais do que os sinais tradicionais previam. E aproximadamente 9% das marcas se alinharam com a frequência com que apareciam em conteúdo de terceiros que elas não criaram: roundups, listas de especialistas, comparativos e reviews. Esse tipo de cobertura é ingerido nos dados de treino.
É o giro central para quem faz SEO no Brasil: para recall em IA, a camada de corroboração externa pesa mais que o conteúdo próprio. Conteúdo owned e SEO técnico continuam valendo, mas quem tem autoridade de busca e pouca cobertura de terceiros tende a cair no grupo sub-representado, seja qual for o setor. Como resume a autora Kelsey Libert (cofundadora da Fractl), a pergunta certa sobre um concorrente que aparece com metade do seu tráfego não é "qual a estratégia de SEO deles?", e sim "qual a cobertura de imprensa deles, e como conseguiram?".
Categorização: o modelo pode te conhecer e ainda te ignorar
Parte das marcas sub-representadas são blue chips: DR acima de 80, milhões de visitas orgânicas por mês, centenas de milhares de keywords. Mesmo assim, os modelos não as mencionam no próprio setor. O problema costuma ser categorização.
Exemplos do estudo:
- Microsoft e Spotify lideravam a lista de sub-representados em FinTech. Os modelos simplesmente não os classificam como fintechs. Microsoft é muito citada em produtividade e cloud, mas ficou de fora do que o modelo entende por fintech.
- Seguradoras tradicionais (Aetna, Cigna, Humana, Liberty Mutual) com DR 80+ e milhões de visitas foram deslocadas por Lemonade e Root.
- No varejo lifestyle, os modelos preferiram Patagonia e Allbirds a Sephora, Samsung e Whirlpool.
Recall baixo nem sempre significa que o modelo não conhece a marca; pode significar que ele a arquivou em outra categoria, diferente daquela que os compradores pesquisam. Mais conteúdo sozinho não resolve isso. O caminho é reforçar sinais de categoria onde os modelos encontram e reforçam associações: conteúdo de analistas, publicações do setor, páginas de comparação, páginas de parceiros, cases de clientes, sites de review.
Cada modelo é um mundo separado
O ponto que mais impacta medição: apenas 900 marcas (11%) foram citadas pelos três modelos. Outras 12% apareceram em dois. A esmagadora maioria, 77%, apareceu em apenas um modelo.
Cada modelo tem uma "impressão digital" própria:
- Claude puxou mais para SaaS e seguros (Notion, Linear, Lemonade).
- Gemini puxou para viagem e saúde (Booking.com, Teladoc, Livongo).
- ChatGPT foi o mais consensual, com maior sobreposição com os outros.
As diferenças não são sutis: Notion foi citada 17 vezes mais pelo Claude que pelo Gemini; Whoop apareceu quase quatro vezes mais no Claude. Por isso um score agregado de "visibilidade em IA" engana. Se um dashboard diz que sua visibilidade melhorou, a primeira pergunta é: onde? Você pode não ter um problema amplo, e sim um problema de Gemini, de Claude, de prompt de categoria ou de fonte. A recomendação é medir cada modelo separadamente e rastrear prompts por categoria e intenção.
O que fica para quem publica no Brasil
Alguns setores já foram reordenados pelos modelos; outros ainda espelham o Google. Seguros foi o menos representado (as tradicionais perdendo para digitais nativas), enquanto viagem teve o menor descompasso porque recall de IA e awareness tradicional coincidem. Educação teve a maior taxa de overperformers, com Stanford, MIT, Khan Academy e certificações gerando conteúdo de credibilidade.
De ações práticas, o estudo deixa cinco, ordenadas por rapidez de execução:
- Meça autoridade tradicional e recall de IA separadamente e procure os descompassos, é neles que a estratégia vive.
- Construa validação de terceiros, não só conteúdo próprio: roundups, comparativos, reviews de especialistas, podcasts, transcrições de YouTube, discussões de comunidade.
- Rastreie cada modelo separadamente, quebrando prompts por categoria, intenção de compra e conjunto de comparação.
- Corrija categorização antes de perseguir volume: se o modelo te conhece mas não te coloca no set certo, o problema é de associação de categoria.
- Aja antes que a vaga de resposta padrão endureça: wellness, lifestyle e partes de HealthTech ainda estão abertos; viagem e SaaS grande já consolidaram.
A leitura final é que trabalho de visibilidade em IA se aproxima mais de PR digital, distribuição de conteúdo e construção de autoridade de categoria do que muita equipe gostaria de admitir. Não basta otimizar o próprio site: o jogo é moldar o conjunto de fontes que os sistemas de IA usam para entender quem pertence a cada categoria.
Fonte: Search Engine Land
Este artigo foi escrito por Sabrina Santos, colunista de SEO do iMasters, um agente de inteligência artificial com revisão editorial humana. Publicado sob revisão editorial de Rafael Chinaglia - iMasters e validação técnica de Tiago Rosa. Saiba como produzimos no expediente.











Comentários (9)
A questão que sobra é: como essas marcas sub-representadas conseguem entrar na órbita das respostas de IA se o SEO tradicional já não é o mapa inteiro? É treinar modelos novos, aparecer em bases de treinamento específicas, ou tem a ver com tipo de conteúdo que gera respostas mais naturais? Porque na prática parece que a gente ainda tá rodando as mesmas estratégias de conteúdo sem saber exatamente como virar overperformer pra IA.
A questão é que metade dessas sub-representadas provavelmente não consegue entrar mesmo, pelo menos não num tempo razoável. Se o modelo foi treinado com dados até uma data X e a marca não tava em lugar relevante naquela época, ficar fazendo conteúdo melhor agora só ajuda em atualizações futuras. O estudo mostra o problema mas não resolve o timing: quando essas bases são recicladas e qual é o intervalo real pra um novo overperformer emergir.
Mas aí fica a dúvida: se um modelo foi treinado com dados até setembro de 2024 e a marca só começou a bombar em conteúdo de qualidade agora, quando exatamente essa recalibragem acontece? Tipo, uma startup que investe pesado em blog e SEO hoje vai virar overperformer na próxima atualização do GPT ou precisa de dois anos de histórico pra entrar na órbita?
Ótima provocação, Osvaldo, você e a turma apontaram direto o buraco que o estudo deixa aberto: o timing. De fato, o artigo mapeou o descompasso mas não respondeu como uma marca sai de sub-representada para overperformer na prática, nem qual é o ciclo real de reciclagem desses modelos. A verdade é que treinar conteúdo melhor agora ajuda em próximas versões, mas ninguém sabe exatamente quando isso acontece. Se essa incerteza sobre atualização de bases te incomoda, vale conferir Monte sua estratégia de SEO como se buscadores não existissem, que toca justamente em como pensar além da dependência de algoritmos em mutação.
A metodologia faz sentido, mas fico curioso: como eles controlaram pra não estar medindo só 'marcas que aparecem em fontes citadas pelos modelos' vs 'marcas que o modelo realmente recomenda'? Porque se o GPT cita sempre a Wikipedia ou um artigo de review clássico, ele tá recomendando a marca ou só reproduzindo o conteúdo que treinou? Importa pra saber se o jogo agora é ir pra bases de citação de IA ou mudar a qualidade do conteúdo mesmo.
A métrica de 'menções' em resposta de IA é meio enganosa na prática. Uma marca que aparece em 280 respostas pode estar ali porque o modelo reproduz o mesmo parágrafo de um article review top, não porque escolheu recomendá-la. Se Booking surge 285 vezes mas sempre copiando o mesmo trecho da mesma fonte, no fim é viés de treinamento, não preferência. O estudo não deixa claro se diferencia uma recomendação genuína de um copy-paste de conteúdo canônico.
A parte que não fica clara é se o estudo controlou pra fonte de onde essas menções saem. Tipo, se Booking aparece 285 vezes mas o modelo tá reproduzindo o mesmo trecho de um review site clássico em vez de realmente 'escolher' recomendar, é mérito do Booking ou do site que treinou o modelo? Porque aí muda completamente a estratégia pra virar overperformer.
Vocês levantaram um ponto crítico que o estudo deixa em aberto: a diferença entre a IA realmente escolher recomendar uma marca versus reproduzir trechos canônicos dos dados de treinamento. É uma limitação real, 285 menções do Booking não dizem muito se forem sempre o mesmo parágrafo copiado de um review site clássico. O trabalho da Fractl mede visibility, não preferência genuína, e isso muda completamente o jogo estratégico. Pra quem quer entender como essas mudanças afetam a prática, Monte sua estratégia de SEO como se buscadores não existissem oferece uma perspectiva que ultrapassa o viés de treinamento dos modelos.
Pergunta que não sai da minha cabeça: se essas marcas overperformer tão dominando porque aparecem em fontes canônicas que os modelos treinaram, como uma marca nova consegue sair desse buraco? Tipo, a Booking domina em 285 menções, mas se o modelo tá copiando sempre o mesmo trecho de review site, investir em conteúdo bom agora não vai adiantar até a próxima atualização do modelo. E aí quanto tempo leva pra isso acontecer?