Self-Adapting for Language Models
Self-Adapting for Language Models
A analogia do estudante que prepara um exame é perfeita: reler o manual não é tão eficaz como reescrever os apontamentos, criar resumos ou desenhar diagramas. Os LLMs atuais são como o estudante que só relê, mas com o SEAL, a coisa muda de figura.
O framework SEAL funciona com um sistema de "nested-loop": Um loop interno onde o modelo gera "self-edits" (diretivas sobre como se adaptar) e atualiza os seus próprios pesos através de "supervised finetuning" (SFT). Um loop externo onde o modelo é recompensado com base no seu desempenho após a atualização, treinando-o para aprender a aprender de forma mais eficiente. Isto significa que o modelo não está apenas a aprender factos, mas também a aprender a melhor forma de internalizar esses factos. É como se estivéssemos a ensinar um cão não só a sentar, mas também a descobrir a melhor forma de aprender truques novos.