Em 2017, uma equipa da Google publicou um artigo intitulado "Attention Is All You Need" (Atenção é tudo o que precisa), e a arquitetura nele descrita alimenta agora quase todos os principais modelos de linguagem. O Transformer substituiu a recorrência pela autoatenção: cada token de uma sequência pode observar diretamente todos os outros tokens, avaliando a importância de cada um para a previsão atual.
Esta busca paralela é a chave. As redes recorrentes mais antigas processavam as palavras uma de cada vez, o que dificultava a aprendizagem de dependências de longo alcance e tornava o treino lento. Um Transformer processa toda a sequência de uma só vez, pelo que um pronome no final de um parágrafo pode referir-se ao seu antecedente no início sem perder o fio condutor.
Componentes principais
- Camadas de auto-atenção que calculam as relações entre todos os pares de tokens.
- Atenção multi-cabeças que executa diversas operações de atenção em paralelo.
- Codificações posicionais que inserem informação sobre a ordem das palavras
- Blocos de feedforward e ligações residuais que estabilizam pilhas profundas
O custo é quadrático: duplicar o comprimento da sequência quadruplica o cálculo da atenção. É por isso que as janelas de contexto são dispendiosas e que os investigadores continuam a propor variantes eficientes, como a atenção esparsa e a atenção linear.
Comments (3)
Leave a comment