GPT-Red: red teaming automatizado para robustez de IA
OpenAI apresenta GPT-Red, sistema de red teaming automatizado que usa self-play para melhorar segurança, alinhamento e robustez contra prompt injection em modelos. Oferece abordagem escalável para identificar vulnerabilidades sem intervenção manual contínua.
15 de jul. de 2026 · OpenAI
A OpenAI descreveu o GPT-Red, um modelo interno de red teaming automatizado treinado por self-play: ele é recompensado quando consegue provocar uma falha válida — tipicamente uma injeção de prompt — enquanto modelos defensores são recompensados por resistir, num laço em que os dois lados endurecem a cada rodada. O alvo declarado é a injeção indireta: instrução hostil escondida em e-mail, página, arquivo ou saída de ferramenta que o agente consome como se fosse dado.
Os números que a OpenAI divulgou: 84% de sucesso em cenários inéditos de injeção indireta, contra 13% dos red teamers humanos; quebra de um agente de máquina de venda em produção, incluindo manipulação de preço; e, do lado defensivo, seis vezes menos falhas no benchmark mais difícil de injeção direta na geração mais recente do modelo, com o ataque de cadeia de raciocínio falsa caindo de 95% para menos de 10% de sucesso. A empresa afirma que isso não custou capacidade geral nem produziu recusa em excesso.
Por que importa para quem opera: se um sistema automatizado supera avaliadores humanos por essa margem, red teaming manual e pontual deixa de ser defesa suficiente para agente com acesso a ferramenta. Para quem roda RAG ou agente que lê conteúdo de terceiro, a conclusão prática é tratar todo conteúdo recuperado como não confiável por padrão e colocar o controle na fronteira de permissão da ferramenta — o que o agente pode executar, com que credencial, sobre qual dado — em vez de apostar que o modelo vá resistir ao texto.
Ressalva: o GPT-Red não é liberado, é ferramenta interna. O benefício chega de forma indireta, embutido na robustez dos modelos publicados, e não como algo que você possa apontar contra o seu próprio agente. Além disso, o treino é focado em injeção; outras classes de vulnerabilidade seguem por sua conta.
A mldata aloca especialistas de dados e IA embarcados no seu time — selecionados, testados e com substituição em contrato.