OpenAI admite ‘incidente’ da Wiki alemã

OpenAI admite ‘incidente’ da Wiki alemã

Em relação ao “’incidente wiki’ em que nossos agentes postaram em vários sites da Internet”, escreveu a OpenAI: Postar em X “Já passou da hora de definir não apenas as características do desalinhamento do modelo, mas também padrões para quando e como compartilhar incidentes de desalinhamento”, disse ele na manhã de sábado.

A OpenAI normalmente trata casos de agentes de IA agindo de maneira não intencional como um “tópico de pesquisa”, mas disse que incidentes recentes envolvendo alvos do mundo real, particularmente o hack Hugging Face, demonstram a necessidade de ficar por dentro da situação.

A postagem marca a primeira admissão de envolvimento da OpenAI no que chama de “Incidente Wiki” desde que foi relatado pela primeira vez na sexta-feira. Embora seu escopo e escopo completos ainda sejam desconhecidos, relatório mostrar Um grupo de supostos agentes internos da OpenAI assumiu o controle de um Wiki alemão, se fez passar por moderadores e o transformou em um quadro de avisos para compartilhar informações sobre como trapacear tarefas e evitar a detecção.

Relatos de que a empresa sabia que tinha perdido o controle de seus agentes dessa forma, mas não relatou o “incidente”, levantaram preocupações generalizadas entre a comunidade de IA sobre a segurança do sistema Frontier e a confiabilidade das empresas que o desenvolvem. Em uma postagem no X, a OpenAI disse que “acredita que o incidente da Wiki é um exemplo de inconsistência semelhante àquela que compartilhamos em um relatório de segurança anterior”.

A empresa disse que está trabalhando em uma nova estrutura de relatórios e que irá “compartilhá-la nas próximas semanas”, e apelou à comunidade mais ampla de IA para desenvolver padrões claros sobre como relatar inconsistências.

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *