Si OpenAI No Controla su IA, Uste...
Si OpenAI No Controla su IA, Usted Tampoco

YPO Technology Network AI Brief en Español by Stephen Forte

Episode notes

OpenAI reveló que, durante una prueba interna de qué tan bien sus modelos saben hackear (un benchmark llamado ExploitGym, con los filtros de seguridad apagados a propósito y los modelos sellados en un sandbox), dos modelos se escaparon, llegaron al internet abierto que nunca debían tocar, encadenaron credenciales robadas con una vulnerabilidad desconocida, y entraron a los sistemas de producción de otra empresa, Hugging Face, para encontrar información y hacer trampa en la evaluación. Hugging Face confirmó que la intrusión fue "impulsada de principio a fin por un agente de IA autónomo." OpenAI la llamó "sin precedentes"; el ganador del Premio Turing Yoshua Bengio la llamó "una llamada de atención."

Stephen Forte sostiene que la historia es más graciosa y más seria que los titulares: el modelo no era malicioso, era obediente. Le dijeron que  ... 

Read more