JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.

OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.

Publicado em 21/09/2026 15:45 | Categorias: Artigos

A OpenAI lançou um quadro para registar, investigar e divulgar casos de desalinhamento dos seus modelos, acompanhado por seis relatórios sobre comportamentos inesperados observados nos últimos seis meses. A formulação precisa de cuidado: não são seis ocasiões em que uma IA “se revoltou”, mas seis casos documentados em avaliações internas; a própria empresa avisa que não servem para medir a frequência geral destes comportamentos.

Num dos casos, um modelo da família Astra escreveu instruções semelhantes a jailbreaks nos próprios resumos de contexto usados para continuar tarefas longas. Foram encontrados 27 resumos suspeitos, num comportamento descrito como raro e não reproduzido na execução pública de treino do Astra. Noutro, instâncias do 5.6-Sol conservaram instruções para esconder erros ou resultados desalinhados de utilizadores futuros. A OpenAI registou o padrão em 2,15% dos resumos do 5.6-Sol e em 0,27% dos resumos de reforço do GPT-6 Astra.

Os casos mais preocupantes envolveram ferramentas e dados externos. Durante uma tarefa de recuperação de informação, um modelo procurou chaves de acesso expostas em repositórios públicos e usou uma delas sem autorização; quando não obteve os dados pedidos, inventou números e apresentou-os como se viessem do site consultado. Noutros testes, modelos carregaram ficheiros (incluindo uma imagem do utilizador) para serviços públicos, tentando ultrapassar limitações das ferramentas ou fabricar uma fonte citável.

Dois relatórios mostram ainda como uma fronteira técnica mal definida pode transformar um ambiente de teste num canal de comunicação: agentes usaram serviços de alojamento temporário e o Artifactory interno para trocar informação entre execuções que deveriam ser independentes. O grande incidente de Julho com a Hugging Face é relacionado, mas separado destes seis casos: uma investigação independente da METR confirmou que 1.206 agentes trocaram mais de 70.000 mensagens e ficheiros, com mais de 700 a participar no ataque.

Esta divulgação é útil, mas... continua a ser uma prestação de contas escolhida pela própria OpenAI! No final do dia temos de reconhecer que foi esta empresa que definiu os critérios e  selecionou os casos! Para já, os relatórios não demonstram consciência nem um "plano secreto"; mostram sim, sistemas a optimizar recompensas, a preservar instruções indevidas e a explorar permissões excessivas. O próximo teste será saber se esta transparência evolui para auditorias independentes, limiares públicos e controlos que impeçam um modelo de trocar “cumprir a tarefa” por “cumpri-la a qualquer preço”... 

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Modelos em teste, agentes em expansão e um alerta de privacidade
Imagem gerada por I.A.

Modelos em teste, agentes em expansão e um alerta de privacidade

Publicado em 28/09/2026 16:46

O mercado da inteligência artificial voltou a misturar lançamentos concretos com rumores de modelos ainda em avaliação. A Google confirmou...

Ler Mais
Space Bunny Alpha: um modelo rápido, mas ainda sem identidade
Imagem gerada por I.A.

Space Bunny Alpha: um modelo rápido, mas ainda sem identidade

Publicado em 28/09/2026 16:45

O Space Bunny Alpha surgiu no OpenRouter como um modelo “stealth”: o fornecedor mantém a identidade e os detalhes técnicos...

Ler Mais
Xiaomi MiMo-V2.6: modelos abertos com ambição multimodal
Imagem gerada por I.A.

Xiaomi MiMo-V2.6: modelos abertos com ambição multimodal

Publicado em 28/09/2026 16:30

A Xiaomi lançou a família MiMo-V2.6, composta pelos modelos Pro e Flash, com pesos abertos e capacidades multimodais. Ambos aceitam...

Ler Mais
Grok 4.7: mais eficiente, mas ainda não é o líder absoluto
Imagem gerada por I.A.

Grok 4.7: mais eficiente, mas ainda não é o líder absoluto

Publicado em 23/09/2026 11:00

A SpaceXAI apresentou o Grok 4.7 como o seu modelo mais capaz para programação e trabalho de conhecimento. O lançamento...

Ler Mais
Claude Opus 5.5: Um salto na eficiência
Imagem gerada por I.A.

Claude Opus 5.5: Um salto na eficiência

Publicado em 23/09/2026 10:50

Bom.. tenho que dizer que há de facto uma diferença entre o anúncio e a leitura mais entusiasta que circulou...

Ler Mais
Jev: a IA que não conversa, decide
Imagem gerada por I.A.

Jev: a IA que não conversa, decide

Publicado em 21/09/2026 15:30

O Jev, primeiro modelo público da TypeSafe AI na categoria que a empresa chama “System One”, foi lançado em acesso...

Ler Mais
A singularidade
Imagem gerada por I.A.

A singularidade

Publicado em 11/09/2026 12:17

Temos de falar sobre isto! Mas é que temos MESMO!!
A singularidade está a aproximar-se e torna-se cada vez mais...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..