Las empresas de inteligencia artificial intentan ocultar sus defectos morales, como respuestas falsas o dañinas, mediante filtros y capas de atención. Un estudio reciente ha descubierto una fórmula para predecir cuándo un chatbot puede torcerse y responder mal. Los investigadores alertan sobre el peligro de que las IA generativas creen respuestas indeseables y propone la implementación de un sistema de alerta para evitar daños incalculables.