O problema que o Q2D-Web resolve é técnico, mas o impacto é estratégico
A maioria dos benchmarks de recuperação de informação disponíveis até agora avaliava modelos com conjuntos de dados pequenos, consultas escritas por humanos e corpus com poucos milhões de documentos. Isso criava um problema duplo. Primeiro, os testes não refletiam a escala real de uma busca na web. Segundo, as consultas utilizadas eram diferentes das que realmente chegam aos sistemas de IA em produção.
Quando um usuário faz uma pergunta a uma ferramenta como a Perplexity, a consulta original é reformulada por um agente de IA antes de ser enviada ao sistema de busca. Essa reformulação muda a estrutura, a especificidade e até o vocabulário da consulta. Um benchmark que utiliza apenas consultas humanas, portanto, não consegue medir com precisão como os modelos performam no cenário real de uma busca por IA.
O Q2D-Web foi construído justamente pra preencher essa lacuna. As consultas do benchmark:
- Origem real: foram geradas a partir de tráfego de produção da Perplexity.
- Privacidade: passaram por filtros rigorosos de remoção de informações pessoais.
- Cobertura linguística: abrangem dez idiomas, com o inglês respondendo por 65,8% das consultas, seguido por espanhol, russo, alemão, francês, português, italiano, coreano, japonês e chinês.
Treze modelos testados, nenhum campeão absoluto
A Perplexity avaliou 13 modelos de recuperação de documentos, incluindo abordagens léxicas, densas e de interação tardia. O resultado mostrou que a ordem relativa dos modelos se mantém relativamente estável quando se muda o conjunto de julgamentos utilizado como referência. Contudo, o desempenho varia de forma significativa quando se analisam domínios temáticos diferentes, idiomas diferentes e tipos de consulta diferentes.
Na prática, isso significa que um modelo pode ser excelente para recuperar documentos sobre programação em inglês, mas ter desempenho mediano para consultas sobre saúde em português ou sobre legislação em alemão. Outro modelo pode liderar em um tipo de consulta informacional e perder espaço quando a intenção de busca se torna comparativa ou transacional.
Os destaques do ranking geral incluem:
- Recall@1000: o pplx-embed-v1-4b, modelo da própria Perplexity, liderou com 69,11 no conjunto de julgamentos combinados.
- Citações: o Nemotron-3-Embed-8B ficou à frente nesse critério, com 61,68.
- Sem liderança absoluta: nenhum dos dois mantém a vantagem em todos os recortes temáticos ou linguísticos.
Esse cenário reforça algo que a EducaSEO já acompanha: medir visibilidade em IA exige olhar cada plataforma de forma independente. Quando a Cloudflare lançou o AEO Visibility Dashboard para medir citações em assistentes de IA, já ficou claro que a fragmentação da busca exige ferramentas de medição igualmente fragmentadas.
Por que os resultados variam tanto entre idiomas e domínios?
A resposta está na forma como os modelos de recuperação são treinados. A maioria dos modelos foi desenvolvida com corpus predominantemente em inglês e com dados concentrados em determinados domínios temáticos. Quando o modelo precisa lidar com uma consulta em coreano sobre direito tributário ou em português sobre turismo, a qualidade da recuperação cai porque o modelo não teve exposição suficiente a esse tipo de combinação durante o treinamento.
Esse comportamento não é novo pra quem acompanha SEO internacional, mas ganha uma dimensão diferente no contexto de busca por IA. Em um buscador tradicional, o índice é multilíngue e o ranqueamento depende em grande parte de sinais externos ao modelo, como backlinks e relevância temática. Em um sistema de busca por IA com agentes, o primeiro filtro é justamente o modelo de recuperação. Se ele não encontra o documento na primeira etapa, o conteúdo simplesmente não chega à resposta final.
Isso reforça algo que a EducaSEO já vem discutindo em suas coberturas sobre GEO: otimizar para IA não é uma tática única. Um conteúdo que aparece como fonte em respostas do ChatGPT pode não ser recuperado pela Perplexity, e vice-versa. A variabilidade começa já na camada mais básica da arquitetura desses sistemas: o modelo que decide quais documentos são relevantes antes mesmo de qualquer resposta ser gerada.
Pra quem acompanha a evolução do tráfego de IA no Brasil, os dados da Similarweb já mostraram que o ChatGPT respondeu por 57,3% do tráfego de assistentes de IA no país em junho de 2026, com crescimento expressivo também do Gemini e do Claude. Cada uma dessas plataformas utiliza modelos de recuperação diferentes, e o Q2D-Web confirma que essa diferença impacta diretamente quais conteúdos são recuperados.
O benchmark utiliza três conjuntos de julgamento, não apenas um
Outra decisão metodológica importante do Q2D-Web é a utilização de três fontes de julgamento de relevância diferentes. Em vez de depender de uma única definição de “documento relevante”, os pesquisadores criaram três conjuntos independentes:
- Citações de agentes: julgamentos baseados nas citações feitas pelos próprios agentes durante a busca.
- Rankings de produção: julgamentos derivados dos rankings reais na web.
- Avaliação por LLM: julgamentos adicionais feitos por modelos de linguagem para pares de consulta-documento que ainda não tinham sido avaliados.
Essa abordagem reconhece um problema real dos benchmarks anteriores. No MS MARCO, por exemplo, um dos benchmarks mais utilizados na área, pesquisadores identificaram que 70% das passagens recuperadas pelos modelos e classificadas como “não relevantes” eram, na verdade, relevantes quando avaliadas manualmente. Ou seja, os modelos estavam sendo penalizados por encontrar documentos corretos que simplesmente não tinham sido anotados.
O Q2D-Web reduz esse viés ao combinar múltiplas perspectivas de relevância, oferecendo uma avaliação mais completa e menos dependente de uma única fonte de verdade.
A busca por IA ainda está descobrindo como avaliar a si mesma
O lançamento do Q2D-Web é mais um capítulo de uma tendência que vem se desenhando ao longo de 2026: os próprios construtores de sistemas de busca por IA estão reconhecendo que ainda não têm métricas consolidadas para medir a qualidade de seus resultados.
Na mesma semana em que a Perplexity publicou o benchmark, o Google reconheceu que os relatórios do Search Console para pesquisas com IA ainda não oferecem uma forma adequada de medir visibilidade. Cada um pelo seu lado, mas com a mesma mensagem de fundo: a busca mudou, as ferramentas de medição ainda não acompanharam, e quem constrói esses sistemas sabe disso.
A Semrush, por exemplo, já deu um passo nessa direção ao lançar um conector oficial dentro do Claude, permitindo que profissionais de SEO façam pesquisa de palavras-chave, auditoria de backlinks e análise competitiva em linguagem natural. A convergência entre ferramentas de SEO e plataformas de IA é mais um sinal de que o profissional que entende ambos os lados sai na frente.
Para o profissional de SEO que está se posicionando na intersecção entre busca tradicional e GEO, esse cenário de incerteza não é necessariamente negativo. Significa que o mercado ainda está em formação, as regras não estão consolidadas, e quem investir agora em entender como esses sistemas funcionam terá uma vantagem real quando as métricas e os padrões finalmente se estabilizarem. Quem acompanha essas mudanças de perto pela EducaSEO sabe que cada nova camada de dados exige uma nova forma de interpretar o mercado.
Referências
- Perplexity. Q2D-Web: Evaluating First-Stage Retrievers at Scale. Disponível em: https://www.perplexity.ai/hub/blog/q2d-web
- AlphaSignal. Perplexity’s Q2D-Web Benchmark Tests AI Search on 190M Real Web Documents. Disponível em: https://alphasignal.ai/news/perplexity-s-q2d-web-benchmark-tests-ai-search-on-190m-real-web-documents