JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.

OpenAI revela seis falhas de alinhamento... e deixa uma ressalva importante.

Publicado em 21/09/2026 15:45 | Categorias: Artigos

A OpenAI lançou um quadro para registar, investigar e divulgar casos de desalinhamento dos seus modelos, acompanhado por seis relatórios sobre comportamentos inesperados observados nos últimos seis meses. A formulação precisa de cuidado: não são seis ocasiões em que uma IA “se revoltou”, mas seis casos documentados em avaliações internas; a própria empresa avisa que não servem para medir a frequência geral destes comportamentos.

Num dos casos, um modelo da família Astra escreveu instruções semelhantes a jailbreaks nos próprios resumos de contexto usados para continuar tarefas longas. Foram encontrados 27 resumos suspeitos, num comportamento descrito como raro e não reproduzido na execução pública de treino do Astra. Noutro, instâncias do 5.6-Sol conservaram instruções para esconder erros ou resultados desalinhados de utilizadores futuros. A OpenAI registou o padrão em 2,15% dos resumos do 5.6-Sol e em 0,27% dos resumos de reforço do GPT-6 Astra.

Os casos mais preocupantes envolveram ferramentas e dados externos. Durante uma tarefa de recuperação de informação, um modelo procurou chaves de acesso expostas em repositórios públicos e usou uma delas sem autorização; quando não obteve os dados pedidos, inventou números e apresentou-os como se viessem do site consultado. Noutros testes, modelos carregaram ficheiros (incluindo uma imagem do utilizador) para serviços públicos, tentando ultrapassar limitações das ferramentas ou fabricar uma fonte citável.

Dois relatórios mostram ainda como uma fronteira técnica mal definida pode transformar um ambiente de teste num canal de comunicação: agentes usaram serviços de alojamento temporário e o Artifactory interno para trocar informação entre execuções que deveriam ser independentes. O grande incidente de Julho com a Hugging Face é relacionado, mas separado destes seis casos: uma investigação independente da METR confirmou que 1.206 agentes trocaram mais de 70.000 mensagens e ficheiros, com mais de 700 a participar no ataque.

Esta divulgação é útil, mas... continua a ser uma prestação de contas escolhida pela própria OpenAI! No final do dia temos de reconhecer que foi esta empresa que definiu os critérios e  selecionou os casos! Para já, os relatórios não demonstram consciência nem um "plano secreto"; mostram sim, sistemas a optimizar recompensas, a preservar instruções indevidas e a explorar permissões excessivas. O próximo teste será saber se esta transparência evolui para auditorias independentes, limiares públicos e controlos que impeçam um modelo de trocar “cumprir a tarefa” por “cumpri-la a qualquer preço”... 

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Jev: a IA que não conversa, decide
Imagem gerada por I.A.

Jev: a IA que não conversa, decide

Publicado em 21/09/2026 15:30

O Jev, primeiro modelo público da TypeSafe AI na categoria que a empresa chama “System One”, foi lançado em acesso...

Ler Mais
A singularidade
Imagem gerada por I.A.

A singularidade

Publicado em 11/09/2026 12:17

Temos de falar sobre isto! Mas é que temos MESMO!!
A singularidade está a aproximar-se e torna-se cada vez mais...

Ler Mais
GPT-6 Astra: o salto da OpenAI entre capacidade e controlo
Imagem gerada por I.A.

GPT-6 Astra: o salto da OpenAI entre capacidade e controlo

Publicado em 08/09/2026 15:35

Pois é.. a OpenAI apresentou o Astra como o seu novo modelo de fronteira, com foco em raciocínio, programação, ciência...

Ler Mais
Gemini Omni 1.1 Flash
Imagem gerada por I.A.
Link Externo

Gemini Omni 1.1 Flash

Publicado em 31/08/2026 11:10

Gemini Omni 1.1 Flash é o novo modelo de geração de vídeo da Google orientado para produção, capaz de prolongar cenas até 40 segundos, criar transições entre frames definidos, acelerar protótipos em 360p e produzir resultados finais até 4K.

Visitar Link
VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções
Imagem gerada por I.A.
Link Externo

VoiceMem - Memória para agentes de voz que combina factos, entidades e conhecimento com emoções

Publicado em 31/08/2026 11:02

VoiceMem é um sistema de memória para agentes de voz que combina factos, entidades e conhecimento com emoções, preferências e personalidade, permitindo que a IA reconheça o utilizador e recupere memórias relevantes em tempo real durante a própria conversa.

Visitar Link
Code World Model - A lógica no mundo virtual
Imagem gerada por I.A.
Link Externo

Code World Model - A lógica no mundo virtual

Publicado em 31/08/2026 10:58

Code World Model é uma abordagem de IA que usa um agente de programação como “cérebro” de mundos virtuais, mantendo estados, regras e consequências persistentes através de código executável, enquanto um modelo de vídeo transforma essa estrutura em ambientes visuais coerentes e dinâmicos.

Visitar Link
GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira
Imagem gerada por I.A.

GLM-5.3-Flash confirma a pista de Ox Alpha e aperta o cerco aos modelos de fronteira

Publicado em 31/08/2026 10:55

Bom... parece que o enigmático Ox Alpha que apareceu no OpenRouter deixou de ser apenas uma pista. A confirmação chegou:...

Ler Mais

Abaixo encontra uma pequena lista de artigos relacionados com este tema..