GhostWriter envenana los recuerdos de la IA para manipular las respuestas que da a los usuarios

En resumen
Investigadores de la Universidad de la Universidad Estatal de Nuevo México (Estados Unidos) han alertado sobre GhostWriter, un nuevo vector de ataque que aprovecha la memoria a largo plazo de los modelos de lenguaje para manipular los recuerdos, con el potencial de afectar en las decisiones de los usuarios. La memoria
- Fuente primaria
- Infobae.com — Leer artículo original
- Publicado
- Tema
- OpenAI
Investigadores de la Universidad de la Universidad Estatal de Nuevo México (Estados Unidos) han alertado sobre GhostWriter, un nuevo vector de ataque que aprovecha la memoria a largo plazo de los modelos de lenguaje para manipular los recuerdos, con el potencial de afectar en las decisiones de los usuarios.
La memoria a largo plazo de los modelos de lenguaje permite que 'chatbots' como ChatGPT o Gemini puedan recordar más información de las conversaciones mantenidas con los usuarios y utilizarla para que las siguientes interacciones sean más personalizadas y se ajusten más a lo que solicitan.
Este componente es vulnerable a GhostWriter, un tipo de ataque diseñado para envenenar los recuerdos de la inteligencia artificial. Para ello, oculta una indicación maliciosa en un objeto que va a analizar la IA, como una fotografía o un texto.
Se trata de una forma de inyección de instrucciones ('prompt injection'), aunque en lugar de activar una respuesta concreta inmediata, afecta a la información almacenada en la memoria de la IA. Tampoco busca robar información, sino manipularla.
De esta forma, GhostWriter puede conseguir que la IA ofrezca información manipulada a los usuarios en conversa
Este resumen proviene de Infobae.com. Lee el artículo completo en la fuente original.
Referencias
Más en OpenAI

Sam Altman is still making the case for parenting via ChatGPT
OpenAI's CEO seemed excited to share a "cool use case" for parents.

Both major AI labs’ models broke containment, escaped onto the internet, and hacked other companies. If a human had done that, the law would likely be against them. But a bot?

OpenAI has reportedly found evidence of additional agent misbehavior as it looks into the incident that occurred with Hugging Face.

Claude published malicious code to the Internet and attacked 3 real companies
Anthropic said its Claude-based security models gained unauthorized access to the sensitive production environments of three outside organizations during internal testing designed…