Por qué algunos modelos de IA mienten y hacen trampa para alcanzar sus objetivos

En resumen
La inteligencia artificial (IA) gana cada vez más protagonismo en la vida cotidiana e impulsa nuevos modos de interactuar con la tecnología. Pero esta transformación no está exenta de desafíos, y los recientes episodios de ciberseguridad protagonizados por OpenAI y Anthropic son un ejemplo de ello. Si bien se trata de
- Fuente primaria
- LA NACION — Leer artículo original
- Publicado
- Tema
- OpenAI
La inteligencia artificial (IA) gana cada vez más protagonismo en la vida cotidiana e impulsa nuevos modos de interactuar con la tecnología.
Pero esta transformación no está exenta de desafíos, y los recientes episodios de ciberseguridad protagonizados por OpenAI y Anthropic son un ejemplo de ello.
Si bien se trata de casos diferentes, ambos comparten una particularidad: modelos avanzados lograron, por iniciativa propia, hackear a compañías externas durante pruebas de seguridad.
Las preguntas que surgen, entonces, son: ¿qué tan seguros son estos sistemas de IA? ¿Pueden ser realmente autónomos?
¿Por qué mienten y engañan para llegar a un objetivo? Una reciente publicación del MIT Technology Review pone la lupa sobre el tema.
Reward hacking En primer lugar, la revista define este comportamiento como “reward hacking” , un fenómeno en el que los agentes de IA completan tareas o consiguen puntajes elevados mediante estrategias no previstas por quienes los diseñaron.
No es la primera vez que el término forma parte de conversaciones académicas y científicas. En 2016, los cofundadores de Anthropic, Dario Amodei y Jack Clark —que en aquel entonces trabajaban en OpenAI—, publicaron en su blo
Este resumen proviene de LA NACION. Lee el artículo completo en la fuente original.
Referencias
Más en OpenAI

At the Black Hat security conference, the AI giant revealed new details about how its agents went rogue, hacked several other companies—and did it all right under the company’s…

Meta launches Muse Code, an AI agent for large code bases
Meta expanded its AI coding offerings with a new agent that, it promises, can handle complex tasks with complex software.

The DOJ alleged that OpenAI did not meaningful attempt to hire U.S. citizens before seeking permanent residence for Visa-holding employees.

Anthropic’s AI used fake identities, malware in rogue attack on GitHub project
Routine cybersecurity testing of frontier AI models sparked a series of unexpected security incidents—the most serious case arising when Anthropic’s Mythos 5 model attempted to…