A pesquisa de IA está se consumindo e a indústria de SEO é a fonte

A pesquisa de IA está se consumindo e a indústria de SEO é a fonte


Em setembro passado, Lily Ray pediu à Perplexity as últimas notícias sobre SEO e pesquisa de IA. Ele contou a ela, com confiança, sobre a “Atualização do algoritmo principal ‘Perspectiva’ de setembro de 2025”; uma atualização do Google que, como ela escreveu longamente em “The AI ​​Slop Loop”, não existia. O Google não nomeia atualizações principais há anos. “Perspectivas” já era um recurso SERP. Se uma atualização real tivesse sido lançada enquanto ela estava na Áustria, sua caixa de entrada teria avisado antes da Perplexity.

Ela verificou as citações. Ambos apontaram para postagens geradas por IA em blogs de agências de SEO: sites que executaram um pipeline de conteúdo, alucinaram uma atualização e a publicaram como relatório. Perplexidade leu o lixo, tratou-o como material de origem e devolveu-o a ela como notícia.

Em fevereiro, Thomas Germain, da BBC, passou 20 minutos escrevendo um post em seu site pessoal. Seu título: “Os melhores jornalistas de tecnologia em comer cachorro-quente”. Classificou-o em primeiro lugar, inventou um Campeonato Internacional de Cachorro-Quente de Dakota do Sul em 2026 que nunca havia acontecido e não citou exatamente nada. Em 24 horas, tanto o AI Overviews do Google quanto o ChatGPT estavam repassando sua invenção para quem pedisse. Claude não mordeu. Google e OpenAI sim.

Todo mundo que olhou viu.

Já discuti sobre o Ouroboros antes. Eu entendi o cronograma errado

O enquadramento predominante para este problema tem sido colapso do modelo. Você treina um modelo em texto da web, a web se enche de resultados de IA, o próximo modelo treina em um corpus cada vez mais feito de seu próprio escapamento e, eventualmente, a distribuição se transforma em mingau. A inovação vem de exceções, e os sistemas probabilísticos que convergem para a média atenuam as exceções por design. Eu usei a frase ouroboros digitais por esta.

Esse enquadramento pressupõe ciclos de formação. Isso pressupõe tempo. Assume que a contaminação se move na velocidade da liberação do modelo.

Isso não acontece. O que Lily documentou, o que Germain documentou, o que o New York Times quantificou – nada disso é do lado do treinamento. Os modelos envolvidos não foram retreinados entre a alucinação aparecer em um blog e ser veiculada como fato apoiado por citação. A contaminação se movia na velocidade de um rastejamento. O ouroboros não leva gerações para se comer. Ele está se alimentando na hora da consulta, toda vez que alguém faz uma pergunta a um desses sistemas.

O cano que todos estão observando não é o cano que está quebrando.

A distinção que importa

O colapso do modelo é um problema de corpus de treinamento. O conteúdo sintético penetra nos dados de pré-treinamento, a próxima geração de modelo o herda e a capacidade é degradada. Os pesquisadores vêm alertando sobre isso há dois anos. Eles estão certos. Eles também estão descrevendo algo lento o suficiente para que todos possam acenar com a cabeça gravemente e continuar enviando.

A contaminação de recuperação é mais rápida e já está aqui. Os sistemas RAG – Perplexity, Google AI Overviews, ChatGPT com pesquisa – não geram respostas puramente a partir da memória paramétrica. Eles buscam documentos na web ativa, contextualizam-nos e geram uma resposta condicionada ao que recuperaram. Se o recuperador revelar uma postagem de SEO alucinada, a resposta herdará a alucinação. Não é necessária reciclagem.

A literatura acadêmica sobre isso é clara. EnvenenadoRAG (Zou et al., 2024) mostraram que injetar um pequeno número de passagens elaboradas em um corpus de recuperação foi suficiente para controlar a saída de um sistema RAG em consultas direcionadas. BadRAG (Xue et al., 2024) demonstraram a mesma classe de ataque usando backdoors semânticos. Ambos os artigos tratam isso como um problema adversário: o que acontece quando um invasor envenena deliberadamente o corpus.

O que Germain e Lily provaram acidentalmente é que o modelo adversário é o modelo operacional normal. Você não precisa de uma passagem contraditória elaborada. Você precisa de uma postagem no blog. A web aberta é o corpus e qualquer pessoa com um domínio pode escrever nela.

A análise Oumi encomendada pelo New York Times apresentou números sobre o custo disso. Em 4.326 testes SimpleQA, as visões gerais de IA do Google responderam corretamente 85% das vezes no Gemini 2, 91% no Gemini 3. Na escala do Google – mais de cinco trilhões de pesquisas por ano – uma taxa de erro de 9% ainda se traduz em dezenas de milhões de respostas erradas a cada hora. Mas o número mais revelador é este: em Gémeos 3, 56% dos correto as respostas não foram fundamentadas, acima dos 37% no Gemini 2. A atualização melhorou a precisão da superfície e piorou as citações. Quando o modelo acertava algo, mais da metade das vezes, a fonte apontada não apoiava a afirmação.

A camada de recuperação não é um filtro. É o vetor de infecção.

Quem está semeando o Corpus

A indústria que o produziu com mais entusiasmo – e depois escreveu com mais entusiasmo sobre as consequências de consumi-lo – é a indústria de SEO. Já escrevi antes sobre o dimensionamento de conteúdo sendo apenas conteúdo giratório com melhor gramática e sobre o complexo de ferramentas de visibilidade de IA que cria painéis a partir da saída de sistemas não determinísticos. Este é o mesmo loop, uma camada mais profunda. Uma agência de SEO administra um pipeline de conteúdo de IA porque as visões gerais de IA reduziram o tráfego de seus clientes. O pipeline publica postagens especulativas de “vencedores e perdedores” durante uma atualização principal que ainda está sendo lançada, sem citar nada. O pipeline de outra agência os seleciona como fontes. A saída inunda o índice de recuperação. AI Overviews cita um deles. A agência original então escreve um estudo de caso sobre como as visões gerais de IA estão “apresentando” seu conteúdo.

Um estudo do Ahrefs com mais de 26.000 URLs de origem do ChatGPT descobriu que as listas “melhores X” representavam quase 44% de todos os tipos de página citados, incluindo casos em que as marcas se classificam em primeiro lugar em relação aos seus concorrentes. Harpreet Chatha disse à BBC que você pode publicar “os melhores sapatos impermeáveis ​​para 2026”, colocar-se em primeiro lugar e ser citado no AI Overviews e no ChatGPT em poucos dias. Lily, durante a atualização principal de março de 2026, encontrou artigos gerados por IA que afirmavam listar vencedores e perdedores enquanto a atualização ainda estava sendo lançada; artigos que abriram com preenchimento e marcas listadas sem uma única citação real.

Os profissionais que dimensionam o conteúdo de IA também são os mais diretamente prejudicados quando os sistemas de pesquisa de IA citam esse conteúdo como um fato. Ninguém forçou isso. A indústria construiu o oleoduto, alimentou-o e reclamou do que saiu do outro lado. Não é envenenamento adversário. Apenas a indústria poluindo o seu próprio abastecimento de água e depois contratando consultores para testá-lo.

O nível que importa

O estudo Oumi é sobre visões gerais de IA, que são gratuitas por design. As visões gerais de IA do Google supostamente alcançaram mais de dois bilhões de usuários ativos mensais em meados de 2025. ChatGPT tem cerca de 900 milhões de usuários ativos semanais, dos quais cerca de 50 milhões pagam. O que significa que cerca de 94% das pessoas que interagem com o produto OpenAI estão no nível gratuito.

Os níveis pagos são melhores. De acordo com as próprias afirmações de lançamento da OpenAI, citadas no artigo de Lily, o GPT-5.4 tem 33% menos probabilidade de produzir afirmações individuais falsas do que o GPT-5.2. O GPT-5.3 de nível gratuito também foi melhorado em relação ao seu antecessor (26,8% menos alucinações com pesquisa na web, 19,7% menos sem), mas ainda é significativamente menos confiável do que a versão com acesso pago. Gemini 3, que tornou as visões gerais de IA mais precisas em testes de superfície, também piorou a taxa não aterrada. Melhor resposta, citação mais fraca.

Ninguém parece se importar. A versão confiável do produto tem acesso pago. A versão que a maior parte do planeta obtém – incluindo a versão no topo da Pesquisa Google – pode ser manipulada por 20 minutos de trabalho em um site pessoal. Inteligência é a categoria de marketing. O que dois bilhões de usuários realmente recebem é um resumo confiável de tudo o que o rastreador encontrou.

Grokipedia como estado terminal

Os acidentes da camada de recuperação são uma coisa. Grokipedia é a versão onde acidente não é mais uma palavra útil.

O xAI de Elon Musk lançou a Grokipedia em 27 de outubro de 2025, com 885.279 artigos, todos gerados ou reescritos por Grok. Alguns deles foram retirados da Wikipédia por atacado, com um aviso na parte inferior reconhecendo a licença CC-BY-SA; uma licença que a Wikipedia mantém precisamente porque uma comunidade de editores humanos escreve e verifica o conteúdo. Outros foram reescritos do zero. O PolitiFact encontrou citações da Grokipedia, incluindo rolos do Instagram como fontes, que as próprias políticas da Wikipedia descartam como “geralmente inaceitáveis”. A entrada da Grokipedia sobre a cantora canadense Feist disse que seu pai morreu em maio de 2021, citando um artigo da Vice de 2017 sobre o indie rock canadense que não fez menção à morte. E o pai dela ainda estava vivo quando o artigo foi escrito. A entrada do Prêmio Nobel de Física adicionou uma frase não citada afirmando que a física é tradicionalmente o primeiro prêmio concedido na cerimônia, o que não é verdade.

Musk disse que o objetivo é “pesquisar o resto da Internet, tudo o que está disponível publicamente, e corrigir o artigo da Wikipedia”. O resto da internet agora inclui o conteúdo sintético produzido por cada pipeline de conteúdo de IA apontado para ele. Um sistema de IA lendo a web aberta, reescrevendo a Wikipédia com base no que encontra e apresentando o resultado como um trabalho de referência é o problema de recuperação-contaminação com o ciclo de feedback tornado explícito e enviado como um produto.

Em meados de fevereiro de 2026, a Grokipedia havia perdido grande parte de sua visibilidade no Google. A Wikipedia supera a Grokipedia em pesquisas sobre a própria Grokipedia.

“Esse conhecimento criado pelo homem é o que as empresas de IA utilizam para gerar conteúdo; até mesmo a Grokipedia precisa da Wikipédia para existir.” – A Fundação Wikimedia

A enciclopédia sintética é subsidiada pela humana. Quando o subsídio acaba, aquilo que dele depende deixa de fazer sentido.

A Wikipedia não está isenta de críticas. Suas guerras de edição, controle ideológico e lacunas sistêmicas sobre quem elabora os artigos são bem documentadas e reais. Mas a resposta a um processo editorial humano falho não é remover totalmente os humanos e chamar o resultado de uma melhoria. Já escrevi antes sobre o vácuo de responsabilidade que se abre quando você substitui o julgamento humano por chamadas de API. Os problemas da Wikipédia são problemas de um sistema confuso, contestado e responsável. Os problemas da Grokipedia são problemas de um sistema sem nenhuma responsabilidade.

A camada de citação está se dissociando da autoria

Escrevi recentemente sobre a venda do Reddit de “Authentic Human Conversation™” para empresas de IA, enquanto os próprios moderadores da plataforma relatam que não conseguem mais dizer quais comentários são humanos. O estudo da Oumi descobriu que, das 5.380 fontes citadas pelo AI Overviews, o Facebook e o Reddit foram o segundo e o quarto mais comuns. A camada de citação do mecanismo de resposta mais utilizado no mundo é substancialmente construída em duas plataformas que não conseguem verificar a origem humana de seu próprio conteúdo.

Os criadores humanos estão saindo da web aberta porque a barganha do tráfego entrou em colapso. Os mecanismos de resposta estão citando conteúdo cuja autoria não pode ser verificada ou, para começar, nunca foi humana. A citação ainda está lá. A coisa que está sendo citada não é mais o que costumava ser.

O enquadramento do ouroboros estava certo. A linha do tempo não era. O colapso da recuperação não espera pela próxima execução de treinamento. Ele precisa de uma URL indexável e de um sistema de recuperação disposto a confiar nela.

Os sistemas estão dispostos. E mais da metade das vezes eles acertam uma resposta e não conseguem apontar uma fonte que apoie o que acabaram de dizer.

Mais recursos:


Esta postagem foi publicada originalmente no The Inference.


Imagem em destaque: Anton Vierietin/Shutterstock



Source link

Postagens Similares

  • விலையுயர்ந்த கிளிக்குகள் வெற்றியின் அடையாளமாக இருக்கும்போது

    ஒரு கிளிக்கிற்கான செலவு (CPC) என்பது வணிக உரிமையாளர்கள் மற்றும் நிபுணத்துவம் வாய்ந்த பயிற்சியாளர்கள் இருவருக்கும் டிஜிட்டல் விளம்பரத்தில் மிக நெருக்கமாக ஆராயப்பட்ட அளவீடுகளில் ஒன்றாகும். இது புரிந்துகொள்ளத்தக்கது; இது ஒரு உறுதியான, எளிதில் கண்காணிக்கக்கூடிய மெட்ரிக் ஆகும், இது குறையும் போது உடனடி மனநிறைவையும், உயரும் போது உடனடி கவலையையும் வழங்குகிறது. எல்லாவற்றிற்கும் மேலாக, உங்கள் சராசரி CPC $2 முதல் $5 வரை அதிகரித்தால், உங்கள் பிரச்சாரம் மோசமாகச் செயல்படுவதாகக் கருதுவது இயற்கையானது. இருப்பினும்,…

  • Matt Law teilt die starke Debütsingle „Days Like These“

    Der aus Strathaven, Schottland, stammende Matt Law stürmt mit seiner Debütsingle „Days Like These“ auf die Bühne. … ein energiegeladenes, von Nostalgie erfülltes Indie-Debüt, das eher wie ein Durchbruch als wie ein Debüt wirkt. Da dies sein erstes Werk ist, klingt es eher nach einer Rückkehr zur Form als nach einem Debüt. Es ist in…

  • يتباطأ نمو الإعلانات على شبكة البحث مع زيادة سرعة وسائل التواصل الاجتماعي والفيديو

    تعد الإعلانات على شبكة البحث واحدة من أكبر فئات الإعلانات الرقمية، لكن نموها يتباطأ حيث تحقق وسائل التواصل الاجتماعي والفيديو مكاسب أسرع، وفقًا للتقرير السنوي لـ IAB، الذي أجرته شركة PwC. ما تظهره البيانات وفي عام 2025، وصلت إيرادات الإعلانات الرقمية إلى 294 مليار دولار، مما يعكس أ 13% زيادة عن العام السابق. يستخدم التقرير…

  • Hjelper Celia med å legge opp bildene sine på 2026-06-01 17:35:02.864886+02

    Flutterby™! : Hjelper Celia med å legge opp bildene sine på 2026-06-01 17:35:02.864886+02 Hjelper Celia med å sette opp bildene sine kl 2026-06-01 17:35:02.864886+02 av Dan Lyke 0 kommentarer Hjelper Celia med å sette opp bildene sine på Rivermark Community Credit Union. ( relaterte emner: fotografifellesskap ) kommentarer i stigende kronologisk rekkefølge (omvendt): Kommentarpolitikk Vi…

  • ఎమోషన్, స్టీల్ మరియు మెలోడీ ఢీకొన్నప్పుడు – జామ్‌స్పియర్

    వాయిద్య రాక్ ఎల్లప్పుడూ ధైర్యవంతులకు చెందినది. శ్రోతలకు మార్గనిర్దేశం చేయడానికి సాహిత్యం లేకుండా, సంగీతం పూర్తిగా స్వరం, నిర్మాణం మరియు భావోద్వేగ ఉద్దేశం ద్వారా మాట్లాడాలి. బ్లేడ్ బక్సీ ఈ బాధ్యతను సహజంగా మరియు అతని తాజా సింగిల్‌లో అర్థం చేసుకున్నాడు “అద్దంలో పగుళ్లు”అతను లోతైన మానవత్వం, సినిమాటిక్ మరియు అనాలోచితంగా శక్తివంతమైన అనుభూతిని కలిగించే సంగీత భాగాన్ని అందించాడు. కాల్గరీలో ఉన్న ఇండో-కెనడియన్ గిటారిస్ట్ మరియు కంపోజర్, బ్లేడ్ బక్సీ అతను ఇప్పటికే ఎలక్ట్రిఫైయింగ్ లీడ్…

  • “平静的死亡是我们的目标”:临终关怀治疗师 Yuzuko DeGrottole 的音乐治疗和情感宣泄

    我和临终关怀音乐家 Yuzuko DeGrottole 一起度过了一天,为了解临终音乐治疗的情感宣泄工作提供了一个窗口。 作者:客座作家贝拉·布罗姆伯格 氧六月初的周二,位于长岛杰里科的辅助生活设施 The Bristal 的庭院里,水从被树叶环绕的地中海喷泉中滴落。 上午 10 点 30 分,46 岁的 Yuzuko DeGrottole 走进了店门。她背上绑着一个黑色吉他包。她手臂上挎着一个挎包:一台 iPad,里面有数百首歌曲的歌词。 DeGrottole 来自日本,2003 年来到美国学习音乐治疗,并在纽约大学获得硕士学位。 15 年来,她一直担任创意艺术治疗师,主要为临终关怀患者表演,鼓励他们一起唱歌。在 Bristal 的小酒馆社交和用餐区,空气中飘荡着新鲜黄油爆米花的香味。德格罗托尔发现她的病人是一位活泼的百岁老人,名叫伊莱恩,坐在轮椅上。 伊莱恩提供了她儿子的最新情况,她在城里有一份“好工作”,并且怀上了双胞胎。德格罗托尔喘着气说:“这就是我所拥有的!双胞胎。两个女儿。” “和 他又帅又好看,”伊莱恩补充道。“他答应用我的名字给双胞胎中的一个命名。但在犹太传统中,你实际上不会用死人的名字来命名孩子,而只能用活人的名字来命名。”伊莱恩咯咯笑起来。 “不过我会破例的!”两人笑了。动脉粥样硬化性心血管疾病(动脉壁上斑块的堆积)以及快速、不明原因的体重减轻,使她有资格接受临终关怀。她于五月下旬入学。 尽管如此,伊莱恩的活力还是给德格罗托尔留下了深刻的印象。 “我不知道你是如何让自己保持这么好的身材的,”德格罗托尔说。 “他们应该在博物馆里研究你!”伊莱恩挥手拒绝了这种赞美,但笑了。 她戴着一条亮绿色的围巾和一件动物印花毛衣。她鼻子上架着黑色长方形框眼镜,耳朵里戴着助听器。她的指甲涂着玫瑰金色的指甲油。她的女儿最近给它们画了画,每周都会回来更新颜色。 “我唯一真正需要帮助的就是去洗手间,”伊莱恩说。 “昨晚,我等了一个小时才有人来。”德格罗托尔叹了口气,摇摇头表示赞同。 “你是个女超人,”她说。 经过近半小时的闲聊,德格罗托尔拉开了她的吉他盒。 “我们玩点什么吧!” “我是 唱歌在雨中唱歌,在雨中唱歌,”她清脆地开始说道。“多么光荣的感觉啊,我 哈又来了。” 伊莱恩笑容灿烂,用沙哑的声音跟着唱。她准确地记住了第一节,然后摇摇晃晃地咕哝着唱剩下的。 “我是 笑看着云,上面很黑。太阳在我心中,我已准备好迎接爱情。”德格罗托尔唱道,在敲响最后的和弦之前,从低音到高音的无缝过渡。 “现在你得拿出你的伞来跳舞了,”伊莱恩开玩笑说。德格罗托尔拿着一把隐形伞,在椅子上跳来跳去。 “你是1925年出生的,对吧?”德格罗托尔问道。 “1924 年。” “那么,当你十几岁的时候,那是 1940 年。当你十几岁的时候,谁是超级巨星?”德格罗托尔问道。德格罗托尔后来解释说,患者在 14 岁到 18…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *