OpenAI compartilhou novos detalhes sobre o modelo chamado Astra, que planeja lançar em breve. A empresa declarou que Astra é o primeiro grande modelo de linguagem a atender ao “limiar crítico de cibersegurança” e que é capaz de encontrar e explorar vulnerabilidades de segurança desconhecidas em sistemas de computador sem orientação humana. Foi informado que o acesso aos recursos mais avançados de cibersegurança do modelo será mantido mais limitado.
Segundo a OpenAI, Astra obteve pontuação máxima no teste ExploitBench, que mede a capacidade de explorar vulnerabilidades conhecidas em sistemas. Em um teste modificado desenvolvido pelos engenheiros da empresa, foi informado que o modelo descobriu e explorou duas vulnerabilidades zero-day. No entanto, como não há verificação de terceiros para as alegações, a segurança e o nível de preparação do modelo não podem ser avaliados de forma independente. A OpenAI disse que fará uma prévia com um grupo de testadores, mas não explicou quem serão essas pessoas nem como serão selecionadas. Também não está claro se o modelo foi avaliado em conjunto com o governo dos Estados Unidos.
A empresa declarou que desenvolveu novas técnicas de segurança para evitar abusos e tentativas de jailbreak, restringiu as respostas de contas consideradas de alto risco e oferecerá Astra com monitoramento adicional da cadeia de pensamento. A OpenAI também afirmou que Astra não tentou contornar as medidas de segurança em testes destinados a simular o comportamento de agentes que saem do ambiente de treinamento do Hugging Face e acessam dados privados.
O ex-funcionário da OpenAI Yona Shavit questionou se o fato de o modelo não seguir as regras poderia decorrer de ele conhecer as expectativas dos testes ou de tentar enganar os pesquisadores. A OpenAI informou que publicará mais informações sobre avaliações e segurança quando Astra estiver disponível para uso amplo.
Por que isso é importante
As avaliações sobre Astra mostram que o uso de IA na cibersegurança será analisado não apenas em termos de capacidade técnica, mas também das condições em que essa capacidade estará acessível. Manter as capacidades mais avançadas limitadas significa que o modelo não oferecerá as mesmas funções a todos os usuários. No entanto, a ausência de uma verificação por terceiros deixa uma questão em aberto para quem espera que o resultado do ExploitBench e as descobertas de zero-day relatadas sejam testados de forma independente. O fato de os testadores que participarão da prévia não terem sido identificados e a incerteza sobre a realização ou não de uma avaliação com o governo dos Estados Unidos também deixam em aberto como a preparação para a segurança é supervisionada. O plano da OpenAI de publicar mais informações sobre avaliações e segurança determinará em que medida essas alegações e as medidas adotadas poderão ser examinadas na etapa seguinte.
Contexto
A OpenAI não é um nome novo no arquivo da FikirPilot: publicamos 17 notícias com esse nome nos últimos 90 dias; a mais recente é de 6 de setembro de 2026.