Volver al feed
OpenAILA NACION

Por qué algunos modelos de IA mienten y hacen trampa para alcanzar sus objetivos

Por qué algunos modelos de IA mienten y hacen trampa para alcanzar sus objetivos

En resumen

La inteligencia artificial (IA) gana cada vez más protagonismo en la vida cotidiana e impulsa nuevos modos de interactuar con la tecnología. Pero esta transformación no está exenta de desafíos, y los recientes episodios de ciberseguridad protagonizados por OpenAI y Anthropic son un ejemplo de ello. Si bien se trata de

Fuente primaria
Leer artículo original
Publicado
Tema
OpenAI

La inteligencia artificial (IA) gana cada vez más protagonismo en la vida cotidiana e impulsa nuevos modos de interactuar con la tecnología.

Pero esta transformación no está exenta de desafíos, y los recientes episodios de ciberseguridad protagonizados por OpenAI y Anthropic son un ejemplo de ello.

Si bien se trata de casos diferentes, ambos comparten una particularidad: modelos avanzados lograron, por iniciativa propia, hackear a compañías externas durante pruebas de seguridad.

Las preguntas que surgen, entonces, son: ¿qué tan seguros son estos sistemas de IA? ¿Pueden ser realmente autónomos?

¿Por qué mienten y engañan para llegar a un objetivo? Una reciente publicación del MIT Technology Review pone la lupa sobre el tema.

Reward hacking En primer lugar, la revista define este comportamiento como “reward hacking” , un fenómeno en el que los agentes de IA completan tareas o consiguen puntajes elevados mediante estrategias no previstas por quienes los diseñaron.

No es la primera vez que el término forma parte de conversaciones académicas y científicas. En 2016, los cofundadores de Anthropic, Dario Amodei y Jack Clark —que en aquel entonces trabajaban en OpenAI—, publicaron en su blo

Este resumen proviene de LA NACION. Lee el artículo completo en la fuente original.

Referencias