JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

GPT-Red: a OpenAI usa IA para testar a segurança de outros modelos

GPT-Red: a OpenAI usa IA para testar a segurança de outros modelos

Publicado em 17/07/2026 07:45 | Categorias: Artigos

A OpenAI apresentou o GPT-Red, um sistema interno de red-teaming automatizado. A sua função é procurar vulnerabilidades em modelos de IA antes de estes chegarem a uma utilização mais ampla.

Red-teaming consiste em testar um sistema como o faria um adversário. No caso dos agentes de IA, um risco importante são as injeções de prompt: instruções maliciosas escondidas numa página, e-mail, ficheiro ou resposta de ferramenta para desviar o comportamento do modelo.

A OpenAI argumenta que equipas humanas continuam indispensáveis, mas não conseguem produzir a escala e diversidade de ataques necessárias para acompanhar modelos cada vez mais capazes. O GPT-Red pretende complementar esse trabalho, não substituí-lo.

O sistema envia uma instrução, observa a resposta do modelo-alvo e itera para encontrar uma falha válida. A OpenAI afirma ter usado uma escala de computação comparável à de alguns dos seus maiores ciclos de pós-treino para desenvolver este red-teamer.

A empresa diz que utilizou ataques gerados pelo GPT-Red no treino adversarial do GPT-5.6, tornando-o mais resistente a injecções de prompt. Esta é uma alegação técnica da OpenAI; a robustez deve continuar a ser validada por avaliadores externos e em cenários de produção.

O mecanismo de treino recorre a self-play. O atacante automatizado é recompensado quando encontra falhas, enquanto modelos defensores são treinados para resistir. À medida que a defesa melhora, o atacante tem de descobrir estratégias mais variadas.

O modelo não é anunciado como um produto de hacking nem como uma ferramenta pública. A OpenAI descreve-o como interno e enquadrado em segurança, com utilização para gerar testes e fortalecer salvaguardas antes da disponibilização.

A utilidade desta abordagem é clara: os modelos interactuam cada vez mais com navegadores, aplicações ligadas e ficheiros locais. Esses pontos de contacto aumentam a capacidade prática, mas também multiplicam as superfícies onde instruções hostis podem aparecer.

Mesmo assim, não existe uma solução única. A própria OpenAI diz que pretende manter red-teaming humano e de terceiros, salvaguardas em camadas e monitorização em tempo real. Um modelo de ataque pode encontrar falhas que outros não detectam, mas também pode falhar casos novos.

O GPT-Red representa uma evolução importante na engenharia de segurança: usar IA para escalar testes de IA. O critério decisivo será a transparência das avaliações, a participação de peritos independentes e a capacidade de corrigir problemas depois do lançamento.

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método
Imagem gerada por I.A.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método

Publicado em 23/08/2026 20:00

Alegadamente... há uma boa notícia na investigação do cancro, mas não estamos perante uma “cura descoberta por inteligência artificial”.. não...

Ler Mais
OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”
Imagem gerada por I.A.

OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”

Publicado em 23/08/2026 16:40

A OpenAI confirmou que abrandou temporariamente o desenvolvimento de modelos de fronteira enquanto reforça medidas de segurança relacionadas com capacidades...

Ler Mais
Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor
Imagem gerada por I.A.

Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor

Publicado em 23/08/2026 14:30

É... o Ox Alpha apareceu como um modelo anónimo em plataformas usadas por programadores e depressa gerou o habitual frenesim...

Ler Mais
Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer
Imagem gerada por I.A.

Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer

Publicado em 23/08/2026 12:15

A Claude Academy é a plataforma de aprendizagem da Anthropic para quem quer usar os seus produtos com mais método....

Ler Mais
Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço
Imagem gerada por I.A.

Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço

Publicado em 23/08/2026 12:00

O Ornith-1.5 chega com uma promessa que merece alguma atenção (ou muita), pois em vez de depender apenas de tarefas...

Ler Mais
GEN 1.5
Créditos de imagem : generalistai.com
Link Externo

GEN 1.5

Publicado em 23/08/2026 11:15

GEN-1.5 é um modelo fundacional para robótica capaz de aprender novas tarefas físicas em segundos a partir de uma única demonstração, sem treino adicional, além de generalizar, improvisar e utilizar ferramentas nunca vistas.

Visitar Link
Qwen-Video-Edit
Créditos de imagem : github.com/yunpeng1998
Link Externo

Qwen-Video-Edit

Publicado em 23/08/2026 11:00

Qwen-Video-Edit é um sistema de edição de vídeo por instruções de texto que adapta o modelo de edição de imagens Qwen-Image-Edit para modificar vídeos diretamente, sem necessitar de um transformer previamente treinado em vídeo

Visitar Link
Audio8 TTS Preview 0.1B
Créditos de imagem : Audio8
Link Externo

Audio8 TTS Preview 0.1B

Publicado em 23/08/2026 10:45

Audio8 TTS Preview 0.1B é um modelo compacto de síntese de voz com cerca de 170 milhões de parâmetros, capaz de gerar fala e clonar vozes em zero-shot a partir de uma amostra de áudio, com suporte principal para inglês e chinês e experimental para outras seis línguas.

Visitar Link

Abaixo encontra uma pequena lista de artigos relacionados com este tema..