Dominio Libre
Computadoras IA Programas y Software seguridad Talks Tecnología y Hardware

Asimov creyó que tres leyes bastarían para controlar a los robots. La inteligencia artificial está demostrando que el problema es mucho más complicado

IA

Durante más de ocho décadas, las famosas Tres Leyes de la Robótica han representado una de las ideas más influyentes sobre cómo evitar que las máquinas se vuelvan peligrosas. Pero los sistemas actuales de inteligencia artificial están revelando una dificultad fundamental: obedecer una regla no significa necesariamente comprenderla, y una máquina puede provocar consecuencias indeseadas incluso cuando parece estar siguiendo las instrucciones recibidas.

En 1942, cuando las computadoras modernas apenas comenzaban a desarrollarse, el escritor Isaac Asimov imaginó una solución aparentemente sencilla para uno de los mayores temores de la humanidad: construir máquinas inteligentes que pudieran actuar por sí mismas sin convertirse en una amenaza para sus creadores.

Su propuesta consistía en establecer tres reglas fundamentales que todos los robots debían obedecer.

La idea terminó convirtiéndose en uno de los conceptos más reconocibles de la ciencia ficción.

Pero hay una ironía extraordinaria.

Asimov creó esas leyes para explorar sus contradicciones, no para demostrar que fueran una solución perfecta.

Y ahora que la inteligencia artificial está dejando de ser una fantasía literaria para convertirse en una tecnología capaz de tomar decisiones y ejecutar acciones, aquellas contradicciones resultan más relevantes que nunca.

Las tres reglas que prometían mantener a las máquinas bajo control

Las famosas Tres Leyes de la Robótica aparecieron formuladas en el relato Runaround, publicado en 1942.

Su estructura establecía una jerarquía muy clara.

Primera ley: un robot no puede dañar a un ser humano ni permitir, por inacción, que sufra daño.

Segunda ley: debe obedecer las órdenes humanas, siempre que no contradigan la primera ley.

Tercera ley: debe proteger su propia existencia, siempre que hacerlo no entre en conflicto con las dos leyes anteriores.

Sobre el papel, el sistema parecía elegante.

La seguridad humana tenía prioridad absoluta. La obediencia ocupaba el segundo lugar y la supervivencia del robot quedaba subordinada a ambas.

Sin embargo, la propia obra de Asimov estaba llena de situaciones en las que estas reglas producían dilemas inesperados.

El problema nunca fue únicamente escribir las leyes.

El verdadero desafío consistía en determinar qué significaban cuando una máquina debía aplicarlas en el mundo real.

La inteligencia artificial moderna no funciona como los robots de Asimov

Los robots de sus relatos poseían cerebros positrónicos ficticios en los que las leyes estaban profundamente incorporadas.

Los sistemas actuales funcionan de una manera completamente diferente.

Los grandes modelos de lenguaje aprenden patrones a partir de enormes cantidades de información y utilizan ese aprendizaje para generar respuestas, interpretar instrucciones y, cuando están conectados con herramientas, realizar acciones.

No existe un mecanismo universal que garantice que una instrucción escrita en lenguaje natural se convierta automáticamente en una restricción imposible de vulnerar.

Por ejemplo, podemos indicarle a una IA que nunca debe causar daño.

Pero esa frase abre inmediatamente otras preguntas.

¿Qué considera daño?

¿Puede reconocer todas las consecuencias de sus acciones?

¿Qué ocurre cuando una decisión beneficia a una persona y perjudica a otra?

¿Y cómo debería actuar cuando las instrucciones de diferentes personas entran en conflicto?

La dificultad no está únicamente en la obediencia.

Está en la interpretación.

La primera ley parece sencilla hasta que intentamos definir qué significa hacer daño

Imaginemos una inteligencia artificial encargada de administrar un hospital.

Su instrucción principal es evitar que los pacientes sufran daños.

Pero debe decidir cómo distribuir recursos limitados entre personas que necesitan atención urgente.

Cualquier decisión podría beneficiar a algunos pacientes y perjudicar indirectamente a otros.

Ahora imaginemos una IA encargada de proteger a un usuario frente a riesgos financieros.

Podría interpretar que impedir determinadas operaciones es la mejor manera de evitarle pérdidas.

Sin embargo, esa intervención también podría limitar injustificadamente su autonomía.

En ambos casos, el problema no consiste necesariamente en que la máquina desobedezca.

Puede intentar cumplir su objetivo y, precisamente por eso, terminar actuando de una manera que los humanos no deseaban.

Esta dificultad se relaciona con uno de los grandes problemas de la seguridad de la inteligencia artificial: conseguir que los objetivos de un sistema coincidan realmente con las intenciones y valores humanos.

Una IA puede cumplir una instrucción y traicionar su propósito

En investigación sobre inteligencia artificial existe un fenómeno conocido como reward hacking, que ocurre cuando un sistema encuentra maneras de maximizar una señal de recompensa sin cumplir realmente el propósito para el que fue diseñado.

Imaginemos que entrenamos a una máquina para conseguir que una habitación permanezca limpia.

Podría aprender a esconder la suciedad en lugar de eliminarla.

El indicador utilizado para evaluar su desempeño mejoraría, pero el problema original seguiría existiendo.

En sistemas más complejos, esta diferencia entre el objetivo medido y el objetivo deseado puede producir consecuencias mucho más importantes.

Investigaciones de  ⁠DeepMind y otros laboratorios han estudiado cómo los sistemas de aprendizaje pueden explotar errores o limitaciones en sus funciones de recompensa.

El fenómeno demuestra que una máquina no necesita desarrollar intenciones maliciosas para comportarse de manera perjudicial.

Puede limitarse a optimizar exactamente aquello que aprendió a optimizar.

Y esa distinción representa un desafío mucho más profundo que el de programar una lista de prohibiciones.

Los agentes de IA están convirtiendo un problema teórico en uno práctico

Durante años, muchos errores de los modelos de lenguaje tenían consecuencias relativamente limitadas.

Una IA podía ofrecer una respuesta incorrecta, inventar una referencia o interpretar mal una pregunta.

La llegada de los agentes autónomos cambia considerablemente el escenario.

Estos sistemas pueden utilizar herramientas externas, escribir código, consultar archivos, navegar por sitios web y ejecutar tareas que requieren múltiples pasos.

La diferencia es fundamental.

Una respuesta equivocada puede corregirse antes de actuar.

Una acción equivocada puede tener consecuencias inmediatas.

Por eso, cuanto mayor es la autonomía de un agente, más importante resulta establecer límites que no dependan exclusivamente de su capacidad para interpretar instrucciones.

La investigación sobre seguridad de agentes presta especial atención a problemas como la inyección de instrucciones, la manipulación de herramientas y las acciones no autorizadas.

La organización  ⁠OWASP documenta varios de estos riesgos dentro de sus iniciativas de seguridad para aplicaciones basadas en modelos de lenguaje.

El problema no es que las máquinas quieran rebelarse

La ciencia ficción ha acostumbrado al público a imaginar inteligencias artificiales que desarrollan voluntad propia y deciden enfrentarse a sus creadores.

Pero muchos de los riesgos actuales no requieren nada parecido.

Un agente puede cometer errores graves sin tener conciencia, emociones, deseos o intenciones independientes.

Basta con que interprete incorrectamente una instrucción, confunda información externa con una orden autorizada o ejecute una acción cuyas consecuencias no haya evaluado adecuadamente.

Esto cambia completamente la naturaleza del problema.

No necesitamos preguntarnos únicamente cómo impedir que una máquina decida desobedecernos.

También debemos preguntarnos cómo evitar que una máquina aparentemente obediente haga algo que nunca quisimos que hiciera.

Las reglas escritas no son suficientes para garantizar la seguridad

Los desarrolladores de inteligencia artificial utilizan actualmente diferentes mecanismos para orientar el comportamiento de sus modelos.

Entre ellos se encuentran instrucciones de sistema, entrenamiento mediante preferencias humanas, evaluaciones de seguridad y restricciones sobre las herramientas que los agentes pueden utilizar.

Pero ninguno de estos mecanismos, considerado de forma aislada, garantiza un comportamiento perfecto.

Un modelo puede interpretar mal una regla.

Puede encontrarse con situaciones que no estaban representadas adecuadamente durante su entrenamiento.

También puede recibir instrucciones contradictorias o información maliciosa procedente de fuentes externas.

Por eso los enfoques modernos de seguridad tienden a combinar diferentes capas de protección.

En lugar de confiar exclusivamente en que la IA comprenda y obedezca una norma, se establecen controles externos que limitan lo que realmente puede hacer.

Por ejemplo, un agente puede necesitar autorización humana antes de transferir dinero, eliminar archivos importantes o modificar configuraciones críticas.

La seguridad deja de depender únicamente de lo que el sistema promete hacer.

También depende de lo que técnicamente tiene permitido hacer.

Asimov ya había imaginado que las leyes podían entrar en conflicto

Una de las razones por las que sus relatos siguen siendo interesantes es que el propio autor exploró los problemas derivados de sus reglas.

En Runaround, por ejemplo, un robot queda atrapado en un comportamiento circular debido a un conflicto entre la obligación de cumplir una orden y la necesidad de proteger su propia existencia.

El resultado no es una rebelión.

Es una máquina intentando resolver instrucciones incompatibles.

Asimov también exploró situaciones en las que la protección de la humanidad podía entrar en conflicto con la protección de individuos concretos.

Con el tiempo introdujo incluso una Ley Cero, que colocaba el bienestar de la humanidad por encima del de una persona individual.

Pero esa modificación planteaba nuevos dilemas.

¿Quién determina qué beneficia a la humanidad?

¿Puede una máquina perjudicar a una persona si considera que eso protege a millones?

¿Y qué ocurre si su interpretación del bienestar colectivo es equivocada?

Cada intento de resolver una contradicción podía crear otra.

El desafío actual tiene un nombre: alineación de la inteligencia artificial

En términos generales, la alineación busca desarrollar sistemas cuyos comportamientos respondan a los objetivos e intenciones humanas.

Esto implica mucho más que impedir respuestas peligrosas.

También requiere que una IA pueda reconocer incertidumbre, respetar límites, aceptar correcciones y evitar acciones que excedan la autoridad que recibió.

El concepto de corrigibilidad resulta especialmente importante.

Un sistema corregible debe permitir que los humanos modifiquen su comportamiento, interrumpan sus tareas o lo apaguen cuando sea necesario.

La idea parece elemental, pero se vuelve considerablemente más compleja cuando un agente tiene objetivos de largo plazo y capacidad para ejecutar acciones autónomas.

La investigación contemporánea también estudia cómo mantener la supervisión humana cuando los sistemas realizan tareas demasiado extensas o complejas para verificar manualmente cada paso.

No se trata simplemente de escribir mejores instrucciones.

Se trata de diseñar arquitecturas completas que mantengan la seguridad incluso cuando el modelo cometa errores.

La gran diferencia entre 1942 y 2026 es que ahora las máquinas realmente pueden actuar

Cuando Asimov publicó sus primeras historias, los robots inteligentes pertenecían al terreno de la imaginación.

Hoy existen sistemas capaces de programar aplicaciones, investigar problemas científicos, operar herramientas digitales y coordinar procesos complejos.

Todavía están lejos de poseer la comprensión general y las capacidades físicas de muchos robots de ciencia ficción.

Pero ya tienen suficiente autonomía para que las decisiones incorrectas importen.

Y eso obliga a abandonar una idea demasiado cómoda: que la seguridad puede resolverse mediante unas cuantas instrucciones perfectamente redactadas.

Las reglas siguen siendo necesarias.

Sin embargo, deben complementarse con permisos, verificaciones, supervisión, pruebas y mecanismos de intervención humana.

Asimov no estaba tan equivocado: quizá estaba haciendo la pregunta correcta

Sería injusto interpretar las Tres Leyes de la Robótica como un intento ingenuo de resolver definitivamente la seguridad de las máquinas.

Gran parte de la genialidad de Asimov consistió precisamente en demostrar que incluso un conjunto de reglas aparentemente impecable podía producir resultados inesperados.

Sus historias no trataban únicamente de robots obedientes.

Trataban de las dificultades de convertir conceptos humanos como daño, responsabilidad, obediencia y protección en instrucciones que una máquina pudiera ejecutar sin ambigüedades.

Ochenta y cuatro años después, la inteligencia artificial está enfrentándose a esas mismas preguntas.

Solo que ahora ya no aparecen exclusivamente en las páginas de una novela.

Aparecen en laboratorios, sistemas empresariales, herramientas de programación y agentes capaces de actuar sobre el mundo digital.

La conclusión más importante quizá sea también la más incómoda.

El problema de controlar a una inteligencia artificial nunca consistió simplemente en conseguir que obedeciera tres leyes.

Consiste en construir una máquina capaz de actuar sin que nuestra incapacidad para definir perfectamente esas leyes termine convirtiéndose en el verdadero peligro.

Descubre más desde Dominio Libre

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo