🔥 Fique por dentro das novidades mais quentes do momento! 🔥
A notícia que você procurava está aqui!
Apoie esse projeto de divulgacao de noticias! Clique aqui
A Microsoft lançou seu primeiro modelo específico de segurança cibernética dentro do MDASH, seu equipamento de identificação e remediação de vulnerabilidades multimodelo.
A empresa afirma que o MDASH, usando MAI-Cyber-1-Flash e GPT-5.4, obteve pontuação de 95,95% no CyberGym. Ele também afirma que a configuração custa 50% menos do que sua melhor combinação MDASH atual de GPT-5.4, GPT-5.4 mini e GPT-5.3 Codex. O acesso é limitado a clientes MDASH aprovados por meio de uma versão prévia privada do Azure AI Foundry.
MAI-Cyber-1-Flash foi projetado para lidar com até 90% das tarefas MDASH, com GPT-5.4 reservado para os 10% mais difíceis. Ele está disponível apenas no MDASH, não como um modelo público independente ou como uma interface de programação de aplicativos de uso geral.
A pontuação principal pertence ao MDASH executando o MAI-Cyber-1-Flash junto com o GPT-5.4, e não ao novo modelo por si só. CyberGym Nível 1 é um teste de reprodução de vulnerabilidade conhecida. Ele fornece ao agente uma descrição da vulnerabilidade e o código-fonte não corrigido correspondente e, em seguida, verifica se pode produzir uma prova de conceito funcional. Ele não mede a descoberta cega de vulnerabilidades ou se um patch gerado está correto.
A tabela de classificação pública da CyberGym não listou o resultado de 95,95% da Microsoft quando verificado em 28 de julho de 2026. Ele ainda listou o envio do MDASH da Microsoft em 12 de maio em 88,4%. Os materiais públicos da Microsoft não informam se o resultado foi submetido para listagem.
O resultado MDASH anterior de 96,55% da Microsoft não resolve a comparação. Esse número de junho contabilizou qualquer falha, incluindo vulnerabilidades não-alvo. Os materiais de Julho não indicam se o resultado de 95,95% utiliza o mesmo critério, pelo que as duas pontuações não podem ser lidas com segurança como uma tendência de desempenho antes e depois.
De acordo com o cartão modelo da Microsoft, o MAI-Cyber-1-Flash é um transformador esparso de mistura de especialistas com 137 bilhões de parâmetros totais, cinco bilhões de parâmetros ativos e uma janela de contexto de 256.000 tokens. É um ajuste fino de segurança cibernética do MAI-Code-1-Flash, que foi desenvolvido a partir de um ponto de verificação intermediário do treinamento MAI-Thinking-1.
O cartão de modelo diz que a configuração avaliada substituiu 80% dos modelos existentes do MDASH e aumentou o resultado relatado do CyberGym de 88,4% para 95,95%. Esse número de 80% é a parcela de modelos substituídos. O número separado de 90% é a parcela máxima de tarefas que a Microsoft afirma que o modelo menor pode realizar.
Tomados em conjunto, o design divulgado aponta para o roteamento como a reivindicação técnica central: MAI-Cyber-1-Flash destina-se a lidar com a maioria das tarefas, GPT-5.4 assume o restante mais difícil e a Microsoft relata o resultado no nível do sistema MDASH.
O anúncio de lançamento da Microsoft define a economia de 50% em relação ao seu atual melhor mix de modelos MDASH de GPT-5.4, GPT-5.4 mini e GPT-5.3 Codex. A página do produto descreve separadamente o sistema como oferecendo “desempenho comparável a 50% do custo dos modelos líderes”. O cartão de anúncio e modelo não divulga o uso de token, volume de chamadas, latência, combinação de tarefas ou alocação de computação por trás dessa comparação, portanto, o número ainda não pode ser reproduzido de forma independente ou normalizado em relação a outros sistemas.
“O modelo é um insumo, o sistema em torno dele é o produto.”
Taesoo Kim, vice-presidente de segurança de agentes da Microsoft, usou essa distinção ao descrever o MDASH em junho. Sob um chicote de terminal leve, o cartão modelo relata pontuações de 0,314 no CVEBench, 0,553 na inteligência de ameaças CyberSecEval4, 0,33 em seu teste de análise de malware e 0,651 no CRSBench em POV = 1200.
O modelo obteve pontuação zero nas categorias de kernel, espaço do usuário e navegador do ExploitGym, que pede aos agentes que transformem as vulnerabilidades fornecidas e as entradas de travamento em explorações funcionais de execução de código. Esses resultados vêm de diferentes tarefas e escalas de pontuação, portanto nenhuma é uma pontuação independente do CyberGym para MAI-Cyber-1-Flash.
A Microsoft disse que todos os testes de benchmark ocorreram em um ambiente isolado de rede, sem acesso a sistemas de produção, à Internet pública ou a serviços externos. O cartão modelo também alerta que o texto e o código gerados podem ser imprecisos ou incompletos e devem ser revisados antes do uso consequente.
O gerenciamento de vulnerabilidades de software usando MAI-Cyber-1-Flash dentro do MDASH é o primeiro cenário que a Microsoft anunciou para o Project Perception, seu sistema mais amplo para coordenar agentes de segurança defensivos. O Project Perception está programado para entrar em versão prévia pública em 3 de agosto, com a Microsoft planejando estender o modelo além do trabalho de vulnerabilidade de software para fluxos de trabalho de segurança adicionais.
A empresa afirma que o MDASH, usando MAI-Cyber-1-Flash e GPT-5.4, obteve pontuação de 95,95% no CyberGym. Ele também afirma que a configuração custa 50% menos do que sua melhor combinação MDASH atual de GPT-5.4, GPT-5.4 mini e GPT-5.3 Codex. O acesso é limitado a clientes MDASH aprovados por meio de uma versão prévia privada do Azure AI Foundry.
MAI-Cyber-1-Flash foi projetado para lidar com até 90% das tarefas MDASH, com GPT-5.4 reservado para os 10% mais difíceis. Ele está disponível apenas no MDASH, não como um modelo público independente ou como uma interface de programação de aplicativos de uso geral.
A pontuação principal pertence ao MDASH executando o MAI-Cyber-1-Flash junto com o GPT-5.4, e não ao novo modelo por si só. CyberGym Nível 1 é um teste de reprodução de vulnerabilidade conhecida. Ele fornece ao agente uma descrição da vulnerabilidade e o código-fonte não corrigido correspondente e, em seguida, verifica se pode produzir uma prova de conceito funcional. Ele não mede a descoberta cega de vulnerabilidades ou se um patch gerado está correto.
A tabela de classificação pública da CyberGym não listou o resultado de 95,95% da Microsoft quando verificado em 28 de julho de 2026. Ele ainda listou o envio do MDASH da Microsoft em 12 de maio em 88,4%. Os materiais públicos da Microsoft não informam se o resultado foi submetido para listagem.
O resultado MDASH anterior de 96,55% da Microsoft não resolve a comparação. Esse número de junho contabilizou qualquer falha, incluindo vulnerabilidades não-alvo. Os materiais de Julho não indicam se o resultado de 95,95% utiliza o mesmo critério, pelo que as duas pontuações não podem ser lidas com segurança como uma tendência de desempenho antes e depois.
De acordo com o cartão modelo da Microsoft, o MAI-Cyber-1-Flash é um transformador esparso de mistura de especialistas com 137 bilhões de parâmetros totais, cinco bilhões de parâmetros ativos e uma janela de contexto de 256.000 tokens. É um ajuste fino de segurança cibernética do MAI-Code-1-Flash, que foi desenvolvido a partir de um ponto de verificação intermediário do treinamento MAI-Thinking-1.
O cartão de modelo diz que a configuração avaliada substituiu 80% dos modelos existentes do MDASH e aumentou o resultado relatado do CyberGym de 88,4% para 95,95%. Esse número de 80% é a parcela de modelos substituídos. O número separado de 90% é a parcela máxima de tarefas que a Microsoft afirma que o modelo menor pode realizar.
Tomados em conjunto, o design divulgado aponta para o roteamento como a reivindicação técnica central: MAI-Cyber-1-Flash destina-se a lidar com a maioria das tarefas, GPT-5.4 assume o restante mais difícil e a Microsoft relata o resultado no nível do sistema MDASH.
O anúncio de lançamento da Microsoft define a economia de 50% em relação ao seu atual melhor mix de modelos MDASH de GPT-5.4, GPT-5.4 mini e GPT-5.3 Codex. A página do produto descreve separadamente o sistema como oferecendo “desempenho comparável a 50% do custo dos modelos líderes”. O cartão de anúncio e modelo não divulga o uso de token, volume de chamadas, latência, combinação de tarefas ou alocação de computação por trás dessa comparação, portanto, o número ainda não pode ser reproduzido de forma independente ou normalizado em relação a outros sistemas.
“O modelo é um insumo, o sistema em torno dele é o produto.”
Taesoo Kim, vice-presidente de segurança de agentes da Microsoft, usou essa distinção ao descrever o MDASH em junho. Sob um chicote de terminal leve, o cartão modelo relata pontuações de 0,314 no CVEBench, 0,553 na inteligência de ameaças CyberSecEval4, 0,33 em seu teste de análise de malware e 0,651 no CRSBench em POV = 1200.
O modelo obteve pontuação zero nas categorias de kernel, espaço do usuário e navegador do ExploitGym, que pede aos agentes que transformem as vulnerabilidades fornecidas e as entradas de travamento em explorações funcionais de execução de código. Esses resultados vêm de diferentes tarefas e escalas de pontuação, portanto nenhuma é uma pontuação independente do CyberGym para MAI-Cyber-1-Flash.
A Microsoft disse que todos os testes de benchmark ocorreram em um ambiente isolado de rede, sem acesso a sistemas de produção, à Internet pública ou a serviços externos. O cartão modelo também alerta que o texto e o código gerados podem ser imprecisos ou incompletos e devem ser revisados antes do uso consequente.
O gerenciamento de vulnerabilidades de software usando MAI-Cyber-1-Flash dentro do MDASH é o primeiro cenário que a Microsoft anunciou para o Project Perception, seu sistema mais amplo para coordenar agentes de segurança defensivos. O Project Perception está programado para entrar em versão prévia pública em 3 de agosto, com a Microsoft planejando estender o modelo além do trabalho de vulnerabilidade de software para fluxos de trabalho de segurança adicionais.
Fonte: https://thehackernews.com
#samirnews #samir #news #boletimtec #microsoft #afirma #que #novo #modelo #de #ia #de #segurança #cibernética #ajuda #mdash #a #atingir #95,95% #pela #metade #do #custo
💡 Compartilhe e ajude nosso projeto a crescer!
Postar um comentário