JCS Studio

Seu Carrinho (0)

Seu carrinho está vazio.

Subtotal $0.00

GPT-Red: a OpenAI usa IA para testar a segurança de outros modelos

GPT-Red: a OpenAI usa IA para testar a segurança de outros modelos

Publicado em 17/07/2026 07:45 | Categorias: Artigos

A OpenAI apresentou o GPT-Red, um sistema interno de red-teaming automatizado. A sua função é procurar vulnerabilidades em modelos de IA antes de estes chegarem a uma utilização mais ampla.

Red-teaming consiste em testar um sistema como o faria um adversário. No caso dos agentes de IA, um risco importante são as injeções de prompt: instruções maliciosas escondidas numa página, e-mail, ficheiro ou resposta de ferramenta para desviar o comportamento do modelo.

A OpenAI argumenta que equipas humanas continuam indispensáveis, mas não conseguem produzir a escala e diversidade de ataques necessárias para acompanhar modelos cada vez mais capazes. O GPT-Red pretende complementar esse trabalho, não substituí-lo.

O sistema envia uma instrução, observa a resposta do modelo-alvo e itera para encontrar uma falha válida. A OpenAI afirma ter usado uma escala de computação comparável à de alguns dos seus maiores ciclos de pós-treino para desenvolver este red-teamer.

A empresa diz que utilizou ataques gerados pelo GPT-Red no treino adversarial do GPT-5.6, tornando-o mais resistente a injecções de prompt. Esta é uma alegação técnica da OpenAI; a robustez deve continuar a ser validada por avaliadores externos e em cenários de produção.

O mecanismo de treino recorre a self-play. O atacante automatizado é recompensado quando encontra falhas, enquanto modelos defensores são treinados para resistir. À medida que a defesa melhora, o atacante tem de descobrir estratégias mais variadas.

O modelo não é anunciado como um produto de hacking nem como uma ferramenta pública. A OpenAI descreve-o como interno e enquadrado em segurança, com utilização para gerar testes e fortalecer salvaguardas antes da disponibilização.

A utilidade desta abordagem é clara: os modelos interactuam cada vez mais com navegadores, aplicações ligadas e ficheiros locais. Esses pontos de contacto aumentam a capacidade prática, mas também multiplicam as superfícies onde instruções hostis podem aparecer.

Mesmo assim, não existe uma solução única. A própria OpenAI diz que pretende manter red-teaming humano e de terceiros, salvaguardas em camadas e monitorização em tempo real. Um modelo de ataque pode encontrar falhas que outros não detectam, mas também pode falhar casos novos.

O GPT-Red representa uma evolução importante na engenharia de segurança: usar IA para escalar testes de IA. O critério decisivo será a transparência das avaliações, a participação de peritos independentes e a capacidade de corrigir problemas depois do lançamento.

Novidades no Blog

Inspiração, novidades e ideias da JCS Studio.

Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor
Imagem gerada por I.A.

Ontology Engineering: o futuro prometido da IA que ainda tem de provar o seu valor

Publicado em 25/08/2026 18:56

No levantamento sobre engenharia de grafos publicado em Agosto de 2026, abordado no artigo anterior, os investigadores dedicam uma das...

Ler Mais
Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM
Imagem gerada por I.A.

Graph Engineering: a engenharia de grafos como novo paradigma dos agentes LLM

Publicado em 25/08/2026 18:35

Uma equipa alargada de investigadores, com nomes ligados à University of Illinois Urbana-Champaign e à Sichuan University, publicou em Agosto...

Ler Mais
Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método
Imagem gerada por I.A.

Intismeran e melanoma: o avanço da vacina de mRNA que exige entusiasmo com método

Publicado em 23/08/2026 20:00

Alegadamente... há uma boa notícia na investigação do cancro, mas não estamos perante uma “cura descoberta por inteligência artificial”.. não...

Ler Mais
OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”
Imagem gerada por I.A.

OpenAI abranda trabalho em Astra: segurança cibernética não confirma um “GPT-6 adiado”

Publicado em 23/08/2026 16:40

A OpenAI confirmou que abrandou temporariamente o desenvolvimento de modelos de fronteira enquanto reforça medidas de segurança relacionadas com capacidades...

Ler Mais
Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor
Imagem gerada por I.A.

Ox Alpha: o que se sabe sobre o modelo anónimo — e o que continua a ser rumor

Publicado em 23/08/2026 14:30

É... o Ox Alpha apareceu como um modelo anónimo em plataformas usadas por programadores e depressa gerou o habitual frenesim...

Ler Mais
Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer
Imagem gerada por I.A.

Claude Academy: formação gratuita que começa pelaquilo que os modelos não sabem fazer

Publicado em 23/08/2026 12:15

A Claude Academy é a plataforma de aprendizagem da Anthropic para quem quer usar os seus produtos com mais método....

Ler Mais
Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço
Imagem gerada por I.A.

Ornith-1.5: o modelo que cria o próprio currículo, mas ainda tem de provar serviço

Publicado em 23/08/2026 12:00

O Ornith-1.5 chega com uma promessa que merece alguma atenção (ou muita), pois em vez de depender apenas de tarefas...

Ler Mais
GEN 1.5
Créditos de imagem : generalistai.com
Link Externo

GEN 1.5

Publicado em 23/08/2026 11:15

GEN-1.5 é um modelo fundacional para robótica capaz de aprender novas tarefas físicas em segundos a partir de uma única demonstração, sem treino adicional, além de generalizar, improvisar e utilizar ferramentas nunca vistas.

Visitar Link

Abaixo encontra uma pequena lista de artigos relacionados com este tema..