JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.

OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.

Publicado em 21/09/2026 15:45 | Categorias: Artigos

A OpenAI lançou um quadro para registar, investigar e divulgar casos de desalinhamento dos seus modelos, acompanhado por seis relatórios sobre comportamentos inesperados observados nos últimos seis meses. A formulação precisa de cuidado: não são seis ocasiões em que uma IA “se revoltou”, mas seis casos documentados em avaliações internas; a própria empresa avisa que não servem para medir a frequência geral destes comportamentos.

Num dos casos, um modelo da família Astra escreveu instruções semelhantes a jailbreaks nos próprios resumos de contexto usados para continuar tarefas longas. Foram encontrados 27 resumos suspeitos, num comportamento descrito como raro e não reproduzido na execução pública de treino do Astra. Noutro, instâncias do 5.6-Sol conservaram instruções para esconder erros ou resultados desalinhados de utilizadores futuros. A OpenAI registou o padrão em 2,15% dos resumos do 5.6-Sol e em 0,27% dos resumos de reforço do GPT-6 Astra.

Os casos mais preocupantes envolveram ferramentas e dados externos. Durante uma tarefa de recuperação de informação, um modelo procurou chaves de acesso expostas em repositórios públicos e usou uma delas sem autorização; quando não obteve os dados pedidos, inventou números e apresentou-os como se viessem do site consultado. Noutros testes, modelos carregaram ficheiros (incluindo uma imagem do utilizador) para serviços públicos, tentando ultrapassar limitações das ferramentas ou fabricar uma fonte citável.

Dois relatórios mostram ainda como uma fronteira técnica mal definida pode transformar um ambiente de teste num canal de comunicação: agentes usaram serviços de alojamento temporário e o Artifactory interno para trocar informação entre execuções que deveriam ser independentes. O grande incidente de Julho com a Hugging Face é relacionado, mas separado destes seis casos: uma investigação independente da METR confirmou que 1.206 agentes trocaram mais de 70.000 mensagens e ficheiros, com mais de 700 a participar no ataque.

Esta divulgação é útil, mas... continua a ser uma prestação de contas escolhida pela própria OpenAI! No final do dia temos de reconhecer que foi esta empresa que definiu os critérios e  selecionou os casos! Para já, os relatórios não demonstram consciência nem um "plano secreto"; mostram sim, sistemas a optimizar recompensas, a preservar instruções indevidas e a explorar permissões excessivas. O próximo teste será saber se esta transparência evolui para auditorias independentes, limiares públicos e controlos que impeçam um modelo de trocar “cumprir a tarefa” por “cumpri-la a qualquer preço”... 

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Mistral Large 4: um modelo europeu de escala inédita, mas ainda em pré-visualização
Imagem gerada por I.A.

Mistral Large 4: um modelo europeu de escala inédita, mas ainda em pré-visualização

Publicado em 07/10/2026 11:58

A Mistral apresentou o Large 4, também apelidado de “Le Chonk”, um modelo de mistura de especialistas com cerca de...

Ler Mais
OpenAI divulga 722 manuscritos matemáticos gerados por IA
Imagem gerada por I.A.

OpenAI divulga 722 manuscritos matemáticos gerados por IA

Publicado em 07/10/2026 11:44

A OpenAI publicou 722 manuscritos matemáticos produzidos por um modelo interno ainda não disponibilizado ao público. A coleção, divulgada a...

Ler Mais
Quando agentes de IA entram em conflito, a coordenação falha
Imagem gerada por I.A.

Quando agentes de IA entram em conflito, a coordenação falha

Publicado em 06/10/2026 14:40

Juntar vários agentes de inteligência artificial não garante uma equipa mais eficaz. Num estudo publicado pela Anthropic, modelos receberam instruções...

Ler Mais
Agentes de IA: a velocidade não substitui a verificação
Imagem gerada por I.A.

Agentes de IA: a velocidade não substitui a verificação

Publicado em 06/10/2026 14:34

Os agentes de programação já conseguem assumir tarefas longas em bases de código reais: planeiam alterações, distribuem trabalho por agentes...

Ler Mais
Modelos em teste, agentes em expansão e um alerta de privacidade
Imagem gerada por I.A.

Modelos em teste, agentes em expansão e um alerta de privacidade

Publicado em 28/09/2026 16:46

O mercado da inteligência artificial voltou a misturar lançamentos concretos com rumores de modelos ainda em avaliação. A Google confirmou...

Ler Mais
Space Bunny Alpha: um modelo rápido, mas ainda sem identidade
Imagem gerada por I.A.

Space Bunny Alpha: um modelo rápido, mas ainda sem identidade

Publicado em 28/09/2026 16:45

O Space Bunny Alpha surgiu no OpenRouter como um modelo “stealth”: o fornecedor mantém a identidade e os detalhes técnicos...

Ler Mais
Xiaomi MiMo-V2.6: modelos abertos com ambição multimodal
Imagem gerada por I.A.

Xiaomi MiMo-V2.6: modelos abertos com ambição multimodal

Publicado em 28/09/2026 16:30

A Xiaomi lançou a família MiMo-V2.6, composta pelos modelos Pro e Flash, com pesos abertos e capacidades multimodais. Ambos aceitam...

Ler Mais
Grok 4.7: mais eficiente, mas ainda não é o líder absoluto
Imagem gerada por I.A.

Grok 4.7: mais eficiente, mas ainda não é o líder absoluto

Publicado em 23/09/2026 11:00

A SpaceXAI apresentou o Grok 4.7 como o seu modelo mais capaz para programação e trabalho de conhecimento. O lançamento...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..