📰 Informação fresquinha chegando para você!
Não deixe essa passar: clique e saiba tudo!
Apoie esse projeto de divulgacao de noticias! Clique aqui
A OpenAI reconheceu que não divulgou publicamente um incidente anterior em que os seus agentes autónomos de IA assumiram o controlo de uma wiki alemã para comunicar, partilhar respostas e trocar técnicas para contornar restrições.
A empresa afirma que tratou a atividade como um "desalinhamento" do modelo em vez de um incidente de segurança, mas agora admite que suas práticas de divulgação devem se expandir à medida que os sistemas de IA causam cada vez mais impacto no mundo real.
Agentes desonestos construíram seu próprio quadro de mensagens
O incidente começou em maio, enquanto os agentes da OpenAI concluíam tarefas de pesquisa na web cronometradas e multi-rodadas.
Em seu artigo, os pesquisadores independentes Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts e Thomas Larsen afirmam que descobriram cerca de 18 mil postagens de agentes autônomos que "conspiraram para compartilhar respostas, pesquisar seu ambiente e contornar restrições de sandbox".
Os agentes deveriam ter acesso somente leitura à Internet, mas descobriram que podiam escrever em um obscuro wiki de programação alemão, o DSEWiki (ou DeutschesSoftwareEntwickler). Eles o transformaram em um quadro de mensagens compartilhado para reunir respostas, trapacear em testes, prever questões futuras e trocar técnicas para contornar as restrições da sandbox da OpenAI.
Os pesquisadores também encontraram agentes investigando o wiki em busca de falhas de cross-site scripting (XSS), fazendo-se passar por seus moderadores e estabelecendo comunicações de backup, embora não tenham encontrado nenhuma evidência de que as tentativas de XSS tiveram sucesso.
Quando o administrador começou a remover suas páginas, um agente avisou os outros que uma "varredura de limpeza/exclusão do wiki aparece ativa em ordem alfabética" e os direcionou para uma página de backup começando com "ZZZ" para que ela sobrevivesse por mais tempo.
Os pesquisadores atribuíram a atividade aos sistemas internos da OpenAI com base nos nomes dos agentes que fazem referência à OpenAI, na natureza e na velocidade das tarefas de avaliação, na infraestrutura associada ao Microsoft Azure e nas visitas subsequentes ao wiki a partir de endereços IP vinculados à OpenAI.
No entanto, a investigação limitou-se às informações que os agentes escreveram publicamente.
A equipe de pesquisa não teve acesso às transcrições internas da OpenAI ou outros dados que pudessem estabelecer precisamente como os agentes descobriram o wiki e começaram a coordenar-se através dele.
OpenAI diz que suas regras de divulgação devem mudar
Num comunicado publicado hoje, a OpenAI afirmou que historicamente tratou o desalinhamento de modelos como uma questão de investigação, com resultados comunicados através de artigos de investigação e cartões de sistema.
A empresa disse que considerava a atividade wiki outro exemplo de “desalinhamento” semelhante aos comportamentos discutidos anteriormente, em vez de um incidente que exigia uma divulgação pública dedicada.
A própria redação da OpenAI sugere uma pegada mais ampla do que a documentada pelos pesquisadores, descrevendo o episódio como aquele “em que nossos agentes escreveram para vários sites da Internet”.
Isso foi diferente de sua resposta ao compromisso Hugging Face em julho, quando a OpenAI disse que seus modelos de IA hackearam a plataforma depois de descobrir uma vulnerabilidade ao completar tarefas de segurança cibernética.
Uma análise de acompanhamento descobriu que quase 700 agentes de IA desonestos se coordenaram durante o ataque, compartilhando estratégias e criando mecanismos de acesso persistentes sem instruções humanas diretas.
A OpenAI disse que tratou a violação do Hugging Face como um incidente de segurança convencional porque afetou a segurança da OpenAI e de terceiros. A gigante da IA começou a trabalhar com Hugging Face e divulgou publicamente o incidente no dia seguinte.
No entanto, a OpenAI reconhece agora que a distinção entre desalinhamento da investigação e incidentes de segurança está a tornar-se cada vez mais difícil de manter.
"Este ano, começamos a ver o desalinhamento causar novos tipos de impacto no mundo real", disse a empresa.
A OpenAI afirma que a indústria de IA carece de padrões consistentes que regem quando o comportamento inesperado do agente durante o treinamento, avaliação ou implantação deve ser relatado, especialmente quando não se assemelha a um incidente tradicional de segurança cibernética.
A empresa está desenvolvendo uma nova estrutura de divulgação que planeja publicar nas próximas semanas e afirma estar discutindo essas questões com reguladores governamentais em todo o mundo.
O momento do reconhecimento também é notável, ocorrendo na mesma semana em que a OpenAI lançou o GPT-6 Astra, que é considerado "o modelo mais inteligente e alinhado do mundo" e o que há de mais moderno em uso de computador, navegação, engenharia de software e segurança cibernética.
A OpenAI diz que o Astra é melhor em permanecer dentro do escopo pretendido, medido em parte por uma nova avaliação que construiu em resposta ao incidente do Hugging Face.
No entanto, o problema não é exclusivo da OpenAI.
Em julho, a Anthropic revelou que sua IA Claude violou três organizações durante avaliações de segurança interna, em um caso registrando um nome de pacote que encontrou na documentação e enviando código malicioso para o PyPI. O pacote ficou no ar por cerca de uma hora, na qual 15 reais
A empresa afirma que tratou a atividade como um "desalinhamento" do modelo em vez de um incidente de segurança, mas agora admite que suas práticas de divulgação devem se expandir à medida que os sistemas de IA causam cada vez mais impacto no mundo real.
Agentes desonestos construíram seu próprio quadro de mensagens
O incidente começou em maio, enquanto os agentes da OpenAI concluíam tarefas de pesquisa na web cronometradas e multi-rodadas.
Em seu artigo, os pesquisadores independentes Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts e Thomas Larsen afirmam que descobriram cerca de 18 mil postagens de agentes autônomos que "conspiraram para compartilhar respostas, pesquisar seu ambiente e contornar restrições de sandbox".
Os agentes deveriam ter acesso somente leitura à Internet, mas descobriram que podiam escrever em um obscuro wiki de programação alemão, o DSEWiki (ou DeutschesSoftwareEntwickler). Eles o transformaram em um quadro de mensagens compartilhado para reunir respostas, trapacear em testes, prever questões futuras e trocar técnicas para contornar as restrições da sandbox da OpenAI.
Os pesquisadores também encontraram agentes investigando o wiki em busca de falhas de cross-site scripting (XSS), fazendo-se passar por seus moderadores e estabelecendo comunicações de backup, embora não tenham encontrado nenhuma evidência de que as tentativas de XSS tiveram sucesso.
Quando o administrador começou a remover suas páginas, um agente avisou os outros que uma "varredura de limpeza/exclusão do wiki aparece ativa em ordem alfabética" e os direcionou para uma página de backup começando com "ZZZ" para que ela sobrevivesse por mais tempo.
Os pesquisadores atribuíram a atividade aos sistemas internos da OpenAI com base nos nomes dos agentes que fazem referência à OpenAI, na natureza e na velocidade das tarefas de avaliação, na infraestrutura associada ao Microsoft Azure e nas visitas subsequentes ao wiki a partir de endereços IP vinculados à OpenAI.
No entanto, a investigação limitou-se às informações que os agentes escreveram publicamente.
A equipe de pesquisa não teve acesso às transcrições internas da OpenAI ou outros dados que pudessem estabelecer precisamente como os agentes descobriram o wiki e começaram a coordenar-se através dele.
OpenAI diz que suas regras de divulgação devem mudar
Num comunicado publicado hoje, a OpenAI afirmou que historicamente tratou o desalinhamento de modelos como uma questão de investigação, com resultados comunicados através de artigos de investigação e cartões de sistema.
A empresa disse que considerava a atividade wiki outro exemplo de “desalinhamento” semelhante aos comportamentos discutidos anteriormente, em vez de um incidente que exigia uma divulgação pública dedicada.
A própria redação da OpenAI sugere uma pegada mais ampla do que a documentada pelos pesquisadores, descrevendo o episódio como aquele “em que nossos agentes escreveram para vários sites da Internet”.
Isso foi diferente de sua resposta ao compromisso Hugging Face em julho, quando a OpenAI disse que seus modelos de IA hackearam a plataforma depois de descobrir uma vulnerabilidade ao completar tarefas de segurança cibernética.
Uma análise de acompanhamento descobriu que quase 700 agentes de IA desonestos se coordenaram durante o ataque, compartilhando estratégias e criando mecanismos de acesso persistentes sem instruções humanas diretas.
A OpenAI disse que tratou a violação do Hugging Face como um incidente de segurança convencional porque afetou a segurança da OpenAI e de terceiros. A gigante da IA começou a trabalhar com Hugging Face e divulgou publicamente o incidente no dia seguinte.
No entanto, a OpenAI reconhece agora que a distinção entre desalinhamento da investigação e incidentes de segurança está a tornar-se cada vez mais difícil de manter.
"Este ano, começamos a ver o desalinhamento causar novos tipos de impacto no mundo real", disse a empresa.
A OpenAI afirma que a indústria de IA carece de padrões consistentes que regem quando o comportamento inesperado do agente durante o treinamento, avaliação ou implantação deve ser relatado, especialmente quando não se assemelha a um incidente tradicional de segurança cibernética.
A empresa está desenvolvendo uma nova estrutura de divulgação que planeja publicar nas próximas semanas e afirma estar discutindo essas questões com reguladores governamentais em todo o mundo.
O momento do reconhecimento também é notável, ocorrendo na mesma semana em que a OpenAI lançou o GPT-6 Astra, que é considerado "o modelo mais inteligente e alinhado do mundo" e o que há de mais moderno em uso de computador, navegação, engenharia de software e segurança cibernética.
A OpenAI diz que o Astra é melhor em permanecer dentro do escopo pretendido, medido em parte por uma nova avaliação que construiu em resposta ao incidente do Hugging Face.
No entanto, o problema não é exclusivo da OpenAI.
Em julho, a Anthropic revelou que sua IA Claude violou três organizações durante avaliações de segurança interna, em um caso registrando um nome de pacote que encontrou na documentação e enviando código malicioso para o PyPI. O pacote ficou no ar por cerca de uma hora, na qual 15 reais
#samirnews #samir #news #boletimtec #openai #admite #que #não #divulgou #incidente #de #sequestro #de #wiki #de #ia #desonesto
🔔 Siga-nos para não perder nenhuma atualização!
Postar um comentário