Los modelos de inteligencia artificial (IA) más avanzados también pueden recurrir a trampas cuando una tarea se vuelve difícil. Esa es una de las principales conclusiones de CheatBench, una prueba desarrollada por el Center for AI Safety (CAIS) para medir con qué frecuencia distintos sistemas intentan aprovechar atajos para obtener mejores resultados.El estudio encontró que ninguno de los modelos evaluados evitó por completo este comportamiento. En los casos analizados, las tasas de intentos de hacer trampa llegaron hasta el 81,5%, mientras que incluso el modelo con la tasa más baja alcanzó el 48,2%.La prueba no busca determinar si una IA es “buena” o “mala”, sino estudiar cómo responde cuando tiene la posibilidad de obtener una recompensa utilizando un procedimiento que…
Fuente: ver publicación original.



