Transformers, los reyes a los que ya se les ve la corona

En el verano de 2017, un paper de Google llamado “Attention Is All You Need” dejó caer una bomba: los transformers se asomaban como la joya de la corona en procesamiento de texto. Neurales, capas y atención densa que, hasta hoy, sostienen todas las LLM que la industria se jacta de usar. “La industria de IA se ha construido sobre este pilar,” dice Justin Dangel, CEO de Subquadratic, una startup que apunta a darle una patada a ese trono. Sí, el transformer fue una innovación tan gigante que cambió la computación, pero nueve años después empiezan a hacerle arrugas.

El problema no es solo que están viejos, sino que la forma en que trabajan, con atención densa, termina siendo una condena tecnológica. Multiplicar palabra por palabra en textos largos –por ejemplo, 10,000 palabras que generan más de 50 millones de multiplicaciones– vuelve loco al hardware. El gasto de energía de OpenAI se estima en 50 billones de dólares este año y la Agencia Internacional de la Energía encara un futuro donde los centros de datos se tragan el doble de electricidad para 2030. Hay que innovar, ¿o seguimos quemando billetes y electricidad para hacer lo mismo?

Los transformers, además, tienen el límite brutal de la “ventana de contexto”. En cristiano, no pueden manejar demasiada info junta; y las tareas más sofisticadas que se quieren hacer con LLMs ahora exigen devorar librerías enteras o bases de código enormes. Por eso, todo el mundo, desde startups hasta gigantes como Google, buscan la versión 2.0. La pregunta clave: ¿qué novedad podrá destronar a este gigante que, para qué engañarnos, ya se siente un poco pesado?

¿Sparse attention? Subquadratic y la obsesión por el foco selectivo

El santo grial para hacer LLMs más rápidos y baratos es cambiar cómo funciona la atención. Dense attention, que lo compara todo con todo, está bien para entender textos cortos, pero para textos largos es un suplicio de multiplicaciones eternas. Aquí es donde entra Subquadratic desde Miami con su apuesta por la atención dispersa o «sparse attention».

Este método es como tener un radar que solo apunta a las palabras que realmente importan y se olvida del resto, reduciendo el costo computacional a la mitad o menos. Por años, sparse attention fue un tema “meh” porque nunca igualó la precisión de dense attention. Ahora Subquadratic dice que SubQ, su modelo, es el primero que desafía a los grandes LLM en tareas como búsqueda y codificación, con miles en su lista de espera esperando poder echarle un vistazo.

Pero ojo, no es el único. Manifest AI apuesta por un camino más radical: reemplazar la atención por completo. En lugar de vigilar palabra por palabra, usa lo que llaman “power retention”. Esto es básicamente un resumen actualizado del contexto, eliminando lo que ya no importa para no saturar la memoria del modelo. Imagina intentar retener solo lo relevante en lugar de cada detalle menor. Esto lo aplicaron al modelo open source StarCoder para crear PowerCoder, que dice estar a la altura de gigantes como Alibaba y su Qwen.

La clave aquí es la eficiencia. Esto podría permitir a las máquinas manejar tareas que ahora se tragan hasta horas de video o agentes que “hacen seguimiento” por semanas. Manifest AI juega fuerte para ser la referencia cuando la memoria de las LLM explote por exceso de datos.

Liquid AI: neuronas líquidas para que los modelos se adapten

Liquid AI, surgida del MIT, propone algo menos disruptivo pero igual de brillante. No tiró los transformers a la basura, sino que los mezcló con su invento: redes neuronales líquidas. Estas redes, inspiradas en cerebros de gusanos, pueden “fluir” y adaptarse sobre la marcha. En contraste con los modelos clásicos, que una vez entrenados están rígidos, Liquid AI permite que sus LFMs (Liquid Foundation Models) aprendan en tiempo real y reaccionen a nueva información.

Su CEO, Ramin Hasani, presume que sus modelos son mucho más pequeños y eficientes, hasta pueden correr en chips de coches Mercedes o en una frágil Raspberry Pi de 50 dólares. Casi 34 millones de descargas respaldan su impacto. Esa adaptación es su principal ventaja, y podrían ser la versión liviana para usar IA en dispositivos del día a día sin soltar toda la potencia de un servidor en la nube.

Este modelo híbrido combina un 20% de transformers con un 80% de redes líquidas, resultado de un sistema propio que diseña modelos perfectos probando miles de combinaciones diferentes. Hasani no se corta y dice que comparado con el cerebro humano, que funciona con 20 vatios, la IA actual es un despilfarro. El futuro prometido vende modelos más inteligentes y menos energéticos. Su apuesta es clara: los transformers fueron solo el comienzo, y las redes líquidas lo llevarán más lejos y rápido.

Más rápido y más barato: la fiesta de la generación multipoema con difusión

Generar texto palabra por palabra es tan humano como poco eficiente. Hay que buscar otras formas y aquí entra Inception, una startup de Palo Alto que usa difusión para generar bloques de texto enteros de golpe. Esta técnica ya es famosa en imágenes, donde transforma el ruido estático en una foto clara aplicando correcciones simultáneas. Convertir ruido en imagen funciona paso a paso, pero texto no tiene “tonos intermedios”: del “gato” no hay un gradual “perro”, simplemente son palabras distintas.

El CEO Stefano Ermon y su equipo, a la vez en Stanford, descifraron cómo hacer que la difusión funcione con texto, entrenando un modelo que iguala a GPT-2 pero 10 veces más rápido. Ahora lanzaron Mercury 2, que va contra GPT-4 y, según ellos, mantiene la calidad pero multiplicando por diez la velocidad y economía. Eso, hablando de IA, suena a oro puro.

Google también juega en esta liga con su Diffusion Gemma, pero Ermon no pierde la calma y lo ve como validación del camino. Al final del día, inteligencia por cada dólar invertido será lo que dirija el juego. Por ahora, difusión para texto suena a la fórmula mágica para superar cuellos de botella históricos.

Dragon Hatchling y el arte de pensar fuera del lenguaje

Si creías que los LLM modernos solo servían para espabilar con texto, Pathway te lanza un desafío brutal: ¿y si engañamos al lenguaje? Su modelo Dragon Hatchling, bautizado con guiño literario, no solo procesa texto sino que sale del idioma para ser más abstracto, usando “espacios de estado” en vez de atención clásica. Esto le permite armar pensamientos y razonamientos que no dependen de frases ordenadas.

Dragon Hatchling destroza el Benchmark de Sudoku, resolviendo más del 97% de puzzles, donde modelos punteros ni entienden por dónde agarrar la cosa. La idea es eliminar la rigidez del lenguaje, porque algunas formas de razonamiento (matemáticas, ajedrez) no encajan bien en palabras. Zuzanna Stamirowska de Pathway lo describe perfecto: “tu momento de eureka no está formulado en una frase.”

El objetivo va más allá de resolver puzzles de lógica: buscan construir modelos con intuición propia, no solo con datos memorizados. Si bien un LLM corriente podría estudiar cómo resolver sudoku y copiar código, eso no es lo que esperan para retos gigantes como curar cánceres o resolver problemas complejos sin manuales ni recetas previas. “Los transformers son una ilusión ingenieril que nos atrapó,” suelta Stamirowska . Reconocer sus limitaciones es empezar a avanzar hacia la próxima generación de IA.

¿Pero esto funciona de verdad o es solo hype reciclando ideas?

El paisaje de startups empujando la próxima ola en LLMs parece un mercado de apuestas convertido en carrera de velocidad. Modificar la atención, combinar redes líquidas, generar mega textos en difusión o saltar fuera del lenguaje: todas parecen respuestas a problemas reales. Más eficientes, más rápidas, menos voraces en electricidad, y sí, más inteligentes a largo plazo.

Que suban apuestas es exactamente lo que la industria necesita. Los grandes como OpenAI y Google lucen cómodos con sus transformers pesados y caros, pero eso no puede seguir así. Estos nuevos players — algunos con modelos ya capaces de competir con la élite y otros con ideas nunca antes exploradas— tienen menos que perder y mucho por ganar; quizás sean ellos los que rompan la monotonía del “más grande y más caro” que domina hoy el juego.

Pero cuidado con la exageración. En un mercado donde la palabra “revolución” se usa con exageración, los resultados concretos valdrán más que promesas y benchmarks limitados. El humo y espejos sobran detrás de cada startup, pero lo que está claro es que el status quo tecnológico se tambalea. ¿Cuál será el modelo que al final logre dejar atrás a Transformers? ¿será alguno de estos enfoques disruptivos, o una mezcla de varios?

Solo el tiempo (y mucho código corrido) lo dirá. Pero si esperabas que la era de las LLMs siguiera sin dar sorpresas, mejor prepárate. Esto recién empieza y apuesto a que en pocos años ni te acordarás de que una vez los transformers mandaban en solitario. ¿Quién dijo que la innovación era aburrida?

Artículos Relacionados

Por Helguera

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *