Ataraxos, un modelo de Inteligencia Artificial (IA) desarrollado por investigadores del MIT y las universidades de Carnegie Mellon, Nueva York y Stanford, se ha convertido en el primero en derrotar a los campeones humanos del juego de guerra de mesa Stratego. Para conseguir la victoria, que obtuvo por un amplio margen, el modelo utilizó nuevas técnicas diseñadas para la toma de decisiones en entornos con información oculta. Según el equipo, esta capacidad podría saltar del tablero a la vida real y ayudar en situaciones complicadas con muchas opciones en las que no se sabe qué hará el contrario, como negociaciones comerciales, ciberseguridad o maniobras militares. En el Stratego, un juego que se asemeja al ajedrez militar, los jugadores colocan 40 piezas en su lado del tablero y luego las mueven para capturar la bandera del oponente. Pero la identidad de todas las piezas, desde sargentos o mariscales a mineros que desactivan bombas, permanece en secreto hasta que chocan, y entonces se elimina la pieza de menor rango.El número de configuraciones posibles de piezas supera las 10 elevado a la 66ª potencia —un uno seguido de 66 ceros, una cifra exponencialmente mayor que en el ajedrez—, lo que hace que el Stratego sea extremadamente difícil de jugar bien para un sistema de IA. En 2022, un modelo de DeepMind llamado DeepNash consiguió jugar al Stratego a nivel experto por primera vez. Pero la IA de Google, como otros intentos anteriores, se basaba en operaciones sofisticadas costosas que requerían mucha capacidad de cálculo. Incluso con millones de dólares invertidos en entrenamiento, estos modelos no eran lo suficientemente fuertes como para vencer a los campeones humanos. «Con Stratego, existe una explosión de universos posibles con los que uno podría tener que lidiar. Las técnicas de IA que se desarrollaron para juegos como el póker definitivamente no podrían aplicarse a este entorno», dice Grabriele Farina, profesor en el MIT y autor principal del estudio dado a conocer este miércoles en la revista ‘Nature’. AutoaprendizajePara entrenar a Ataraxos (una palabra griega que se usa para describir a alguien que no se inquieta o está libre de ansiedad), los investigadores utilizaron una técnica llamada aprendizaje por refuerzo mediante autoaprendizaje. El modelo juega contra sí mismo muchas veces para aprender una estrategia sólida que le permita sobresalir en el tablero.El equipo diseñó algoritmos especialmente eficientes que permitieron a Ataraxos aprender mucho más rápido que con los métodos anteriores, evitando al mismo tiempo que se bloqueara intentando predecir todos los movimientos posibles. Esto reduce los costes de entrenamiento y mejora el rendimiento. «Nuestro sistema alcanza un nivel de juego estrictamente superior al de DeepNash utilizando menos de una centésima parte de los ejemplos de entrenamiento y menos de una trigésima parte de los juegos de autoaprendizaje, lo que indica una mejora masiva en la eficiencia», asegura Farina.Calcula el riesgo de una manera imposible para los humanos: no entra en pánico si su pieza más valiosa queda expuesta, no revela sus secretosDurante una partida, Ataraxos ajusta sus opciones sobre la marcha mediante una técnica llamada planificación en tiempo de decisión. El sistema no adivina a ciegas, sino que utiliza probabilidades para estimar las posibles identidades de las piezas ocultas del oponente, y luego evalúa las opciones futuras antes de seleccionar el siguiente movimiento. Según los investigadores, esta fue la pieza clave que le permitió alcanzar un rendimiento sobrehumano.Ataraxos venció al jugador de Stratego más fuerte del mundo por un margen récord de 15-1-4 y logró un récord de 39-2 contra los mejores jugadores humanos en el campeonato mundial. Según el profesor del MIT, «Ataraxos calcula el riesgo de una manera que los humanos no. Un humano podría entrar en pánico si su pieza más valiosa queda expuesta, pero el bot puede ser sorprendentemente sereno. No reacciona de forma exagerada ni revela sus secretos».Rendimiento sobrehumanoLos investigadores también adaptaron Ataraxos para otros juegos de información imperfecta, como Barrage Stratego (una variante más rápida con menos piezas), Hanabi (un juego de cartas cooperativo con muchos jugadores) y Dou dizhu (un juego en el que dos jugadores cooperan contra un tercero). El sistema logró un rendimiento sobrehumano en todos los casos.Este tablero es muy diferente al ajedrez. El elevado número de configuraciones había impedido, hasta ahora, que una inteligencia artificial jugara bienSegún sus desarrolladores, esta IA podría adaptarse para ayudar a los humanos a abordar muchos problemas que involucran información oculta. Por ejemplo, los operadores en los mercados financieros pueden no conocer la lógica detrás de las transacciones de otros, mientras que las fuerzas militares probablemente no tengan pleno conocimiento de las posiciones enemigas. «En muchas tareas de la vida real no podemos darnos el lujo de enumerar todas las posibilidades. Simplemente hay demasiadas. Contar con algoritmos que puedan realizar esta tarea tan compleja con tanta eficacia supone un gran avance», afirma Farina.La capacidad de decidir en entornos con información oculta podría ayudar en negociaciones comerciales o maniobras militares en la vida realCon información oculta, resulta extremadamente difícil determinar los mejores pasos a seguir. «Cuanto más faroleas, más lo espera tu oponente y menos vale cada farol. No es obvio cómo razonar sobre eso», explica Samuel Sokota, investigador en Carnegie Mellon. «Es muy diferente a un juego como el ajedrez, donde la mejor jugada sigue siendo la mejor jugada sin importar cuántas veces la hayas jugado».MÁS INFORMACIÓN noticia Si Estas son las aves con el canto más fuerte del mundo: peor aún que una motosierra o un martillo neumático noticia Si El consorcio del TMT se centrará en Hawái pese a la apuesta «sólida» de EspañaEn el futuro, los investigadores quieren mejorar Ataraxos para que pueda explicar su proceso de toma de decisiones de una manera que un ser humano pueda comprender. Porque en un tablero puede pasar cualquier cosa, pero si se empieza a recurrir a la IA para tomar decisiones en ámbitos tan complejos como el militar, resultaría más que conveniente que alguien con piel y corazón tenga la «última palabra».
Powered by WPeMatico