HardFlow, el método del MIT que le pone límites a la inteligencia artificial sin necesidad de reentrenarla
Un brazo robótico esquivó obstáculos en un entorno controlado gracias a un algoritmo capaz de fijar condiciones obligatorias durante la generación de respuestas. El sistema también sorteó laberintos y editó imágenes bajo instrucciones de texto, con resultados de mayor calidad que los métodos previos.
Hay una prueba que resume bien lo que busca HardFlow. Un brazo robótico recibió como encargo llegar hasta un objeto sin chocar con lo que encontrara en el camino. La mayoría de los métodos comparados o bien se llevaba puesto los obstáculos o elegía rutas bastante más largas de lo necesario. HardFlow cumplió las dos exigencias: esquivó todo lo que tenía que esquivar y eligió el recorrido más corto entre los válidos. Para un equipo santiagueño que imagine el mismo problema, es la diferencia entre llegar a la plaza por la calle más rápida o terminar dando tres vueltas extra por el centro.
El trabajo lo presentó un grupo del Instituto de Tecnología de Massachusetts, conocido como MIT por sus siglas en inglés. La propuesta apunta a un punto sensible de la inteligencia artificial generativa: cómo obligar a un modelo a respetar ciertas reglas sin tener que volver a entrenarlo desde cero. Entrenar un modelo grande consume tiempo y dinero, así que cualquier herramienta que funcione sobre un modelo ya entrenado y le agregue restricciones gana atractivo en la industria y en la academia.
Una restricción se evalúa al final, no en cada paso
La técnica que se usaba hasta ahora como referencia se llama muestreo basado en proyección. En cada etapa de la generación va empujando al modelo para que cumpla las condiciones. Ese ida y vuelta constante achica el menú de opciones que el sistema puede explorar y, en la práctica, termina dificultando que encuentre una salida de mayor calidad.
HardFlow toma un camino distinto. Durante los pasos internos deja al modelo trabajar con más libertad y reserva el cumplimiento estricto de las reglas para el resultado final. Las etapas intermedias se descartan. Para orientar la generación hacia una respuesta válida, el equipo usó herramientas matemáticas de control óptimo, un área que estudia cómo llevar un sistema de un estado a otro de la forma más eficiente. El ajuste se hace mediante correcciones graduales, como pequeños retoques graduales que empujan el resultado hacia donde tiene que llegar.
Cómo lo probaron y qué obtuvieron
- Manipulación con robots: un brazo robótico debió alcanzar un objetivo evitando obstáculos. HardFlow sorteó todos los objetos y eligió el camino más corto entre los permitidos.
- Recorridos por laberintos: el sistema trazó el camino más corto entre un punto de partida y una salida, sin atravesar etapas marcadas.
- Edición de imágenes por instrucción escrita: el modelo modificó fotos a partir de órdenes de texto respetando condiciones puntuales, como sumar o quitar objetos, y lo hizo cumpliendo todas las restricciones.
- Comparación de tiempos: el procesamiento fue similar o menor al de la mayoría de los métodos usados como referencia.
Los autores reportaron que las restricciones se cumplieron en todos los casos examinados y que la calidad de las soluciones superó de forma consistente a las alternativas anteriores. El paper, presentado en la International Conference on Machine Learning de Vancouver, Canadá, en julio de este año, lleva como autores principales a Quan Xiao y a Tianrong Guan, junto con los profesores Michael Everett y Mingyu Gao.
Lo que todavía falta
El algoritmo es una prueba de concepto que funciona en escala de laboratorio. Quedan dos frentes abiertos: probar el método en modelos más grandes y verificar si la diferencia de calidad se mantiene cuando los sistemas se enfrentan a restricciones más complejas o a múltiples condiciones superpuestas. La pregunta de fondo sigue siendo si este enfoque podrá aplicarse de forma estable en sistemas que ya están en producción.
