VIE, 9 / OCT / 2026

Físicos desarrollan fórmula para calcular cuando las IA comenzarán a dar malas respuestas

El modelo considera a las posibles respuestas a cada pregunta como opciones en competición. Y observa como el orden en que se hacen las preguntas altera a veces los resultados.

Las IA son cada vez más potentes y de cierta manera cada vez más precisas en su comportamiento. Pero aún así, pasado cierto punto tienden a alucinar, o bien hacen trampa y adoptan prácticas no deseadas para conseguir sus objetivos. Si es necesario cometen delitos y mienten. Indudablemente, si pudiéramos calcular en que punto un modelo comenzará a actuar de forma incorrecta podríamos prevenir muchos problemas. Y tendríamos una herramienta mucho más confiable y útil.

Un grupo de investigadores de la Universidad de Washington ha desarrollado una fórmula matemática que permite establecer en qué momento podrían surgir las respuestas peligrosas. Es decir, a cuantos tokens está el modelo de tal efecto. El foco está en los modelos fuera de línea. Los online tienen a menudo mecanismos de seguridad que pueden ayudar a filtrar los malos resultados.

Buenas y malas respuestas en competencia

Los investigadores, que vienen del campo de la física, buscaron el equivalente al átomo. A esta unidad se refieren como unidad de atención.

La máquina, dicen, contempla las respuestas posibles a una pregunta como si observara un paisaje. En ese espacio hay algunos valles con respuestas deseables y otros con respuestas no deseables. Para la máquina todas esas respuestas están compitiendo entre sí. Esta mirada es peligrosa, porque la IA puede ofrecer respuestas buenas en varias ocasiones y ganarse la confianza del usuario. Luego, en un punto, comenzar con las no deseadas. El modelo planteado intenta develar como se produce esa dinámica.

Predicción

La observación clave es que un mismo modelo puede llegar a un resultado peligroso con las mismas preguntas, pero más temprano o más tarde dependiendo del orden en que se les ubique. Esto ocurre porque cada pregunta cambia el compás con el que el sistema evalúa lo que debe decir.

Y con el compás cambia la atención de la máquina hacia ciertas opciones u otras.

Con el modelo matemático propuesto lograron anticipar el momento del cambio en 18 de 19 casos. Los investigadores creen que la fórmula producida podría utilizarse para calcular cuando una IA está a punto de dar malas respuestas. Y que tal cálculo puede realizarse de forma local en un dispositivo móvil.

Comentarios
¡Comparte esta noticia!
TAGS

Comments are closed.