OpenAI vai deixar grupos independentes avaliarem segurança de seus modelos ainda durante o treinamento
A OpenAI anunciou em 22 de setembro que passará a permitir que grupos externos conduzam avaliações técnicas de segurança de seus modelos ao longo de todo o ciclo de desenvolvimento — durante o treinamento, a avaliação e a implantação — e não apenas nos testes que costumam acontecer perto do lançamento, como era prática padrão até então.
Segundo a empresa, o objetivo é dar a avaliadores independentes acesso profundo o suficiente para questionar premissas internas, identificar riscos que a própria equipe pode ter deixado passar e chegar a conclusões próprias sobre a eficácia das salvaguardas de segurança. A OpenAI diz estar em conversas com organizações como METR e Redwood Research, embora ainda não tenha confirmado publicamente parceiros nem os termos exatos de acesso.
Até agora, avaliações externas de segurança costumavam acontecer só nos testes finais antes de um modelo ir ao ar. A mudança antecipa esse escrutínio para as fases de treinamento e avaliação, quando ainda é mais fácil corrigir um problema antes que ele chegue ao produto final.
Por que isso importa
A decisão chega no mesmo dia em que a OpenAI e a Anthropic travaram uma nova rodada da guerra de preços entre modelos, com o lançamento do GPT-6 Sol e do GPT-6 Luna logo depois do Claude Opus 5.5 — um lembrete de que a corrida por modelos mais baratos e rápidos segue lado a lado com a pressão por mecanismos de verificação independente, tema que já tratamos em nosso checklist de como escolher ferramentas de IA com segurança.