O Google publicou recentemente um artigo de pesquisa sobre o treinamento de um LLM para substituir as atuais arquiteturas de classificação de back-end para busca. Os pesquisadores propõem usar a Classificação Autoregressiva como um substituto para os atuais sistemas de classificação em duas etapas.
Codificadores Duais e Codificadores Cruzados
De uma maneira muito geral e em linguagem simples, os sistemas tradicionais de classificação de busca geralmente têm uma arquitetura em duas etapas com um Codificador Dual e um Codificador Cruzado.
- O Codificador Dual (DE) converte consultas e documentos em vetores e os utiliza para recuperar rapidamente documentos prováveis. Os Codificadores Duais são relativamente baratos em termos computacionais e rápidos. Esses documentos candidatos são posteriormente enviados ao Codificador Cruzado (CE).
- O Codificador Cruzado (CE) revisa e classifica as páginas candidatas que o Codificador Dual (DE) havia selecionado.
Os Codificadores Duais são eficientes e rápidos, mas são limitados em quão precisamente podem classificar documentos. É por isso que os sistemas de classificação usam Codificadores Cruzados, que são mais poderosos. Mas os Codificadores Cruzados são muito caros em termos computacionais para recuperação em larga escala, razão pela qual são usados na segunda etapa para classificar os documentos candidatos.
O que os pesquisadores estão propondo é substituir o back-end de recuperação de busca em duas etapas por um novo sistema chamado Classificação Autoregressiva (ARR). O artigo de pesquisa é intitulado Classificação Autoregressiva: Abridging the Gap Between Dual and Cross Encoders. Os pesquisadores são do Google DeepMind, da Universidade de Massachusetts Amherst e da Universidade do Texas em Austin.
É uma mudança bastante radical substituir o sistema padrão de classificação em duas etapas por um único LLM que produz a lista classificada de documentos. Se algo assim for utilizado, as implicações para SEO/AEO seriam profundas.
Treinando um Modelo de Classificação: SToICaL
A primeira etapa para criar o modelo de classificação é treiná-lo. Os pesquisadores desenvolveram um método chamado SToICaL (Simple Token-Item Calibrated Loss) para ensinar um LLM a classificar documentos.
O treinamento ensina ao LLM quais documentos devem ser classificados mais alto e mais baixo de duas maneiras:
- Primeiro, documentos que devem ser classificados mais alto recebem mais peso e aqueles que devem ser classificados mais baixo recebem menos.
- Segundo, a classificação fornecida pelos dados de treinamento é usada para dar mais probabilidade às escolhas de tokens que levam a documentos classificados mais altos.
O resultado é um LLM que aprende quais documentos são relevantes e é capaz de suprimir a classificação de documentos irrelevantes.
Os pesquisadores explicam:
“Então, propomos o SToICaL (Simple Token-Item Calibrated Loss), uma perda de treinamento consciente de classificação generalizada para o ajuste fino de LLM. Ao usar reponderação em nível de item e marginalização de árvore prefixada, distribuímos a massa de probabilidade sobre tokens docID válidos com base em sua relevância real.”
Resultados dos Testes
Os pesquisadores testaram seu novo sistema para avaliar se realmente melhora o desempenho de classificação em comparação com a previsão do próximo token comum, usando dois conjuntos de dados, WordNet e ESCI Shopping Queries. Eles também o compararam com Codificadores Duais e Codificadores Cruzados padrão em um teste separado usando WordNet.
Os resultados dos testes mostraram que a Classificação Autoregressiva (ARR) teve um desempenho forte, mas não em todas as métricas.
Eles compartilharam:
- O SToICaL melhorou a capacidade de classificação do ARR. Os pesquisadores escreveram que seu treinamento consciente de classificação “melhora significativamente as métricas de classificação além da recuperação top-1.”
- O método de treinamento SToICaL ajudou o ARR a classificar documentos irrelevantes abaixo dos relevantes. Nos experimentos com WordNet, os pesquisadores afirmam que seus métodos conscientes de classificação “reduzem drasticamente” esse tipo de erro de classificação.
- Na comparação com WordNet, o ARR teve desempenho semelhante ao Codificador Cruzado (o caro em termos computacionais) e significativamente melhor que o Codificador Dual.
Uma área que precisa de mais pesquisa é que, no teste de busca de compras, uma versão do método piorou na classificação do resultado mais relevante primeiro, embora tenha melhorado a classificação geral dos resultados.
Conclusões
Os pesquisadores concluem que os Codificadores Duais (DEs) se tornam limitados à medida que o número de documentos a serem classificados cresce, porque, para representar cada possível classificação, o tamanho do vetor deve crescer proporcionalmente. Eles mostram que o ARR não tem essa limitação e, em teoria, pode classificar um número arbitrário de documentos.
Eles explicam:
“Fornecemos uma base teórica para a capacidade expressiva superior do ARR em relação aos DEs. Uma análise rigorosa da geometria de incorporação necessária para classificação mostra que, para um DE alcançar qualquer ordenação de 𝑘 documentos, sua dimensão de incorporação deve crescer linearmente com 𝑘.
Em contraste, provamos que um modelo ARR com dimensão oculta constante é teoricamente suficiente para classificar um número arbitrário de documentos. Isso oferece uma explicação formal para as vantagens do ARR.”
No entanto, este é um resultado teórico, o que significa que não estabelece necessariamente que o ARR funcionará dessa maneira em sistemas de busca do mundo real. No entanto, os pesquisadores também afirmam que seus experimentos mostraram que a abordagem melhorou o desempenho de classificação e se tornou melhor em manter documentos irrelevantes abaixo dos relevantes.
Eles escrevem (PDF):
“Neste artigo, estabelecemos uma base teórica para a Classificação Autoregressiva, provando que, enquanto os DEs exigem que as dimensões de incorporação cresçam com o tamanho do corpus, os modelos ARR que geram docIDs de múltiplos tokens podem resolver tarefas de classificação completas com uma dimensão oculta constante, dada uma condição leve sobre a classificação da matriz de incorporação para os tokens docID.
Propusemos uma perda de treinamento consciente de classificação generalizada para (pontual) classificação autoregressiva que se baseia na reponderação em nível de item e na marginalização de árvore prefixada para distribuir a massa de probabilidade sobre tokens docID válidos com base em sua relevância real. Experimentos em WordNet e ESCI mostram que essa abordagem suprime com sucesso gerações inválidas de docID e melhora em métricas de classificação chave.”
Principais Conclusões
- Alguns SEOs tendem a dizer que a busca mudou por causa da IA. Mas este artigo deixa claro que, para a parte de classificação, os Codificadores Duais e Cruzados ainda desempenham um papel.
- Outra conclusão é que ainda não chegamos ao ponto em que “tudo mudou”, mas este artigo de pesquisa mostra que o Google pode estar se aproximando de um dia em que a busca realmente mudará de maneira profunda.
Imagem em destaque por Shutterstock/Samuel Boivin

