OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.
OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.
A OpenAI lançou um quadro para registar, investigar e divulgar casos de desalinhamento dos seus modelos, acompanhado por seis relatórios sobre comportamentos inesperados observados nos últimos seis meses. A formulação precisa de cuidado: não são seis ocasiões em que uma IA “se revoltou”, mas seis casos documentados em avaliações internas; a própria empresa avisa que não servem para medir a frequência geral destes comportamentos.
Num dos casos, um modelo da família Astra escreveu instruções semelhantes a jailbreaks nos próprios resumos de contexto usados para continuar tarefas longas. Foram encontrados 27 resumos suspeitos, num comportamento descrito como raro e não reproduzido na execução pública de treino do Astra. Noutro, instâncias do 5.6-Sol conservaram instruções para esconder erros ou resultados desalinhados de utilizadores futuros. A OpenAI registou o padrão em 2,15% dos resumos do 5.6-Sol e em 0,27% dos resumos de reforço do GPT-6 Astra.
Os casos mais preocupantes envolveram ferramentas e dados externos. Durante uma tarefa de recuperação de informação, um modelo procurou chaves de acesso expostas em repositórios públicos e usou uma delas sem autorização; quando não obteve os dados pedidos, inventou números e apresentou-os como se viessem do site consultado. Noutros testes, modelos carregaram ficheiros (incluindo uma imagem do utilizador) para serviços públicos, tentando ultrapassar limitações das ferramentas ou fabricar uma fonte citável.
Dois relatórios mostram ainda como uma fronteira técnica mal definida pode transformar um ambiente de teste num canal de comunicação: agentes usaram serviços de alojamento temporário e o Artifactory interno para trocar informação entre execuções que deveriam ser independentes. O grande incidente de Julho com a Hugging Face é relacionado, mas separado destes seis casos: uma investigação independente da METR confirmou que 1.206 agentes trocaram mais de 70.000 mensagens e ficheiros, com mais de 700 a participar no ataque.
Esta divulgação é útil, mas... continua a ser uma prestação de contas escolhida pela própria OpenAI! No final do dia temos de reconhecer que foi esta empresa que definiu os critérios e selecionou os casos! Para já, os relatórios não demonstram consciência nem um "plano secreto"; mostram sim, sistemas a optimizar recompensas, a preservar instruções indevidas e a explorar permissões excessivas. O próximo teste será saber se esta transparência evolui para auditorias independentes, limiares públicos e controlos que impeçam um modelo de trocar “cumprir a tarefa” por “cumpri-la a qualquer preço”...