Quando se fala em futuro da busca, a conversa costuma girar em torno de AI Overviews, respostas generativas e novas formas de interação com o usuário. Mas existe uma camada menos visível, porém igualmente decisiva, que também está sendo repensada: a própria forma como um sistema de busca decide quais documentos colocar no topo da lista.
Pesquisadores do Google DeepMind, em parceria com a Universidade de Massachusetts Amherst e a Universidade do Texas em Austin, publicaram um paper propondo uma mudança significativa nessa arquitetura. O modelo se chama Autoregressive Ranking (ARR) e a proposta é substituir o sistema tradicional de ranqueamento em dois estágios por um único modelo de linguagem treinado pra gerar listas classificadas de documentos diretamente.
Como funciona o ranqueamento tradicional que o ARR pretende substituir
Pra entender a proposta, vale recapitular como a maioria dos sistemas de busca opera hoje. A arquitetura padrão utiliza dois estágios separados, cada um com uma função específica.
O primeiro estágio é o Dual Encoder. Ele converte a consulta do usuário em um vetor numérico e faz o mesmo com cada documento disponível no índice. Em seguida, compara esses vetores pra identificar rapidamente quais documentos são candidatos mais prováveis. Essa etapa é rápida e computacionalmente barata, o que permite processar milhões de documentos em milissegundos.
O segundo estágio é o Cross Encoder. Ele recebe os documentos candidatos selecionados pelo Dual Encoder e os analisa com mais profundidade, avaliando a relação entre a consulta e cada documento de forma conjunta. Essa análise é muito mais precisa, mas também muito mais cara. Por isso, só é aplicada ao grupo reduzido de candidatos que passou pelo primeiro filtro.
O resumo da arquitetura atual:
- Dual Encoder: rápido e barato, funciona como funil inicial que seleciona candidatos.
- Cross Encoder: preciso e caro, funciona como juiz que reordena os candidatos selecionados.
- Limitação herdada: se o Dual Encoder deixa de recuperar um documento relevante na primeira etapa, o Cross Encoder nunca terá a chance de avaliá-lo.
Essa divisão existe porque fazer a análise profunda em todo o índice seria proibitivamente custosa. O problema é que as limitações de cada estágio acabam sendo herdadas pelo sistema inteiro.
O Autoregressive Ranking substitui as duas etapas por um único modelo de linguagem
A proposta do ARR é eliminar essa divisão. Em vez de dois modelos com funções distintas, os pesquisadores treinaram um único modelo de linguagem capaz de gerar, token por token, uma lista classificada de identificadores de documentos diretamente a partir da consulta.
Na prática, o modelo recebe uma consulta e produz uma sequência de identificadores que representam os documentos mais relevantes, já ordenados. Ele não precisa converter consultas e documentos em vetores separados como o Dual Encoder, nem processar cada par consulta-documento individualmente como o Cross Encoder. A classificação emerge diretamente do processo de geração de texto.
Os pesquisadores provaram matematicamente que a capacidade expressiva do ARR é estritamente superior à do Dual Encoder. Enquanto um Dual Encoder precisa de uma dimensão de embedding que cresce linearmente com o tamanho do corpus pra produzir ranqueamentos arbitrários, o ARR consegue resolver a mesma tarefa com uma dimensão fixa. É uma diferença estrutural, não apenas uma melhoria incremental.
Esse tipo de avanço na infraestrutura de busca se conecta com algo que a EducaSEO vem cobrindo ao longo do ano: a forma como os sistemas de IA selecionam conteúdo está mudando em múltiplas camadas ao mesmo tempo. Ferramentas como o AEO Visibility Dashboard da Cloudflare tentam medir o resultado final desse processo, mas o ARR mexe justamente na etapa que vem antes: como o sistema decide quais documentos entram na disputa.
O treinamento utiliza um método chamado SToICaL para ensinar o modelo a ranquear
Um dos desafios de usar um modelo de linguagem pra ranqueamento é que o treinamento padrão, baseado em previsão do próximo token, não é naturalmente orientado a ordenação. O modelo aprende a gerar sequências corretas, mas não necessariamente a posicionar documentos mais relevantes antes dos menos relevantes.
Pra resolver isso, os pesquisadores desenvolveram o SToICaL (Simple Token-Item Calibrated Loss), uma função de perda projetada pra ensinar o modelo a considerar a relevância relativa dos documentos durante a geração. O SToICaL funciona em duas frentes:
- Documentos que devem ranquear mais alto recebem mais peso durante o treinamento, e os menos relevantes recebem menos.
- A ordenação de referência é usada pra direcionar a probabilidade do modelo em direção aos tokens que levam a documentos melhor classificados.
Segundo os pesquisadores, esse treinamento orientado por ranking melhorou significativamente as métricas de classificação pra além da recuperação do primeiro resultado.
Os resultados foram promissores, mas não uniformes
Os testes foram conduzidos em dois conjuntos de dados: WordNet, um banco de dados léxico estruturado, e ESCI, um dataset de consultas de compras com avaliações graduais de relevância por produto. Os resultados variaram conforme o dataset:
- No WordNet, o ARR apresentou desempenho comparável ao Cross Encoder e consideravelmente superior ao Dual Encoder. Um único modelo, operando de forma autorregressiva, conseguiu rivalizar com a etapa mais sofisticada e cara da arquitetura tradicional.
- No ESCI, os resultados foram mais matizados. Uma variante do modelo apresentou desempenho inferior ao esperado na tarefa de ranquear corretamente o primeiro resultado, o que indica limitações em cenários com títulos de produto longos e complexos.
Os próprios pesquisadores reconhecem essas limitações e destacam que ainda são necessários estudos adicionais pra entender como o ARR se comportaria em sistemas de busca reais, com bilhões de documentos e consultas em tempo real.
O que isso significa para o futuro da busca?
A proposta do ARR aponta pra uma possível mudança de paradigma na infraestrutura dos sistemas de busca. Se um único modelo de linguagem consegue substituir a arquitetura de dois estágios com desempenho comparável ou superior, isso abre caminho pra sistemas mais unificados, mais simples de manter e potencialmente mais capazes de capturar nuances semânticas na relação entre consultas e documentos.
Contudo, é fundamental não confundir pesquisa com produto. O paper não diz que o Google Search utiliza ou pretende utilizar o ARR. Não há cronograma de implementação, e os próprios autores apontam que a escalabilidade pra corpus do tamanho da web real ainda precisa ser validada.
O que a pesquisa sinaliza é a direção em que o pensamento técnico dentro do Google está se movendo. E essa direção é consistente com uma tendência mais ampla: a busca por IA não está apenas mudando a forma como os resultados são apresentados ao usuário. Ela está mudando a própria mecânica de como os resultados são selecionados e classificados. O Search Central Deep Dive da Europa, em Barcelona, com foco em crawling, indexação e IA, é mais um sinal de que o Google está disposto a abrir a caixa preta do próprio funcionamento, principalmente onde IA e busca tradicional se cruzam.
O que muda na prática para quem trabalha com SEO?
Neste momento, nada muda operacionalmente. O ARR é uma proposta de pesquisa e não altera o funcionamento atual do Google Search. Porém, pra quem acompanha o mercado de SEO e GEO, o estudo oferece reflexões importantes:
- Os sinais que um modelo de linguagem utiliza pra classificar documentos podem ser diferentes dos sinais da arquitetura tradicional. Se a busca migrar pra sistemas generativos, relevância semântica, clareza da informação e capacidade do conteúdo de ser interpretado corretamente por um modelo de linguagem podem ganhar ainda mais peso.
- A distinção entre “ser encontrado” e “ser ranqueado” pode se tornar ainda mais tênue. Num sistema de dois estágios, existem duas oportunidades separadas pra um documento aparecer. Num sistema unificado como o ARR, essas duas etapas acontecem ao mesmo tempo.
- A velocidade de evolução da infraestrutura de busca está acelerando. Pesquisas como o ARR, o benchmark Q2D-Web da Perplexity e as discussões sobre métricas de visibilidade em IA no Search Console fazem parte de um movimento maior: os sistemas de busca estão sendo reconstruídos de dentro pra fora.
Os dados de tráfego de IA no Brasil mostram que a migração de usuários pra assistentes como ChatGPT, Gemini e Claude já é realidade. Quanto mais a busca acontecer dentro desses sistemas, mais relevante fica entender como eles escolhem o que mostrar. Quem entender essas mudanças estruturais, em vez de simplesmente reagir às atualizações de algoritmo visíveis, estará melhor posicionado pra tomar decisões mais fundamentadas. A EducaSEO continuará acompanhando o desdobramento dessa pesquisa e de outras iniciativas que mostram como a arquitetura da busca está sendo transformada pela inteligência artificial.
Referências
- Search Engine Journal. Google DeepMind Develops New AI Search Ranking Model. Disponível em: https://www.searchenginejournal.com/google-deepmind-develops-new-ai-search-ranking-model/589062/
- Relevant Audience. DeepMind Autoregressive Ranking: one LLM ranks search. Disponível em: https://www.relevantaudience.com/ai/google-deepmind-autoregressive-ranking-llm-search-ranking-paper/
- arXiv. Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders. Disponível em: https://arxiv.org/abs/2601.05588