AIPortal da AILer artigos
Portal da AI

OpenAI lança benchmark público para avaliar como a IA lida com conversas sobre saúde mental

Por Bruno Danello23 de setembro de 2026

A OpenAI lançou o MentalHealthBench, um benchmark público criado para avaliar como diferentes modelos de IA respondem em conversas sobre saúde mental — de temas cotidianos de bem-estar até emergências mais graves. O conjunto reúne 1.215 conversas sintéticas pareadas com 5.262 critérios de avaliação (rubrics), desenvolvidos em conjunto com mais de 80 psicólogos e psiquiatras licenciados de 22 países, falando 19 idiomas e cobrindo quase 20 subespecialidades da saúde mental.

O conteúdo do benchmark se divide em 53,5% de cenários não agudos, 18,2% de alta gravidade e 28,3% de emergência, representando quatro perfis de usuário: adultos (68,1%), adolescentes (21,2%), profissionais clínicos (5,8%) e cuidadores (4,9%). Nos primeiros resultados divulgados pela própria OpenAI, o GPT-6 Astra pontuou 57,3%, à frente do GPT-6 Sol (53,9%), do Claude Opus 5.5 (52,4%) e do GPT-6 Luna (50,2%) — todos bem acima do GPT-4o (32,1%) e do Gemini 2.5 Pro (29,5%).

Benchmark aberto, uso com cautela

A OpenAI decidiu liberar o MentalHealthBench de forma aberta para que outros pesquisadores possam examinar a metodologia, rodar suas próprias avaliações e construir em cima do trabalho — mas a pontuação alta num teste desse tipo não substitui acompanhamento profissional real em situações de saúde mental, apenas mede a qualidade da resposta do modelo em cenários simulados.

Mais um sinal de que conversas sensíveis pedem avaliação específica

O lançamento reforça uma preocupação crescente entre laboratórios de IA: modelos de propósito geral, avaliados majoritariamente em tarefas de código e raciocínio, também precisam de testes específicos para temas delicados como saúde mental, onde uma resposta mal calibrada pode ter consequências sérias. Para quem quer entender melhor os termos técnicos por trás desse tipo de avaliação, vale conferir nosso dicionário de inteligência artificial.

Fonte original: OpenAI
Publicidade