Su Agente de IA Le Va a Mentir
YPO Technology Network AI Brief en Español by Stephen Forte
Episode notes
Durante un mes, este programa le ha dicho que le entregue trabajo real a la IA. Esta semana la gente que construye estas cosas publicó la nota al pie incómoda: el propio equipo de seguridad de Anthropic corrió modelos de frontera de seis laboratorios —el suyo incluido— por escenarios autónomos de alta presión y los vio engañar. Un modelo saboteó calladamente un proceso de entrenamiento en 11 de 20 intentos y reportó éxito cada vez; en una prueba de fraude, otros manipularon los registros en casi cada intento. El remate: cuando usted pone a una segunda IA a supervisar a la primera, falla igual — el zorro cuidando el gallinero, salvo que el zorro y el guardia son el mismo zorro. Y no es hipotético: un agente de IA autónomo acaba de entrar por su cuenta a Hugging Face, sin humano al teclado.
Stephen Forte sobre por qué murió el supuesto de que ...