Lokutor: 5 millones de parámetros para competir con ElevenLabs (y por qué no suena igual)

Lokutor se llama el modelo de voz de 5 millones de parámetros que dos ingenieros españoles han entrenado desde cero en el MareNostrum 5 para competir con gigantes como ElevenLabs. No suena igual de bien —y no pasa nada—, pero corre en CPU, habla catalán, euskera y gallego, y se ejecuta en local sin necesidad de internet. Esta es su historia, contada sin vendernos la moto.

Porque no. No suena igual. Y está bien decirlo.

Qué han hecho (y por qué impresiona)

Lokutor no es un clon barato de ElevenLabs. Es un enfoque radicalmente distinto: en vez de construir un modelo mastodóntico que necesita GPUs en la nube, han creado un modelo pequeño que corre en CPU. Sin acelerador gráfico. En un ARM64. En un chip de 5 dólares.

Lo entrenaron desde cero en el MareNostrum 5, el superordenador del Barcelona Supercomputing Center, a través del programa AI Factory. «Muchas horas de risas, errores, probar mil cosas, consultar dos mil a la IA y escribir a profesores de las mejores universidades de EE.UU.», cuentan. El resultado es Versa 2.0, un modelo de síntesis de voz que no usa Transformers, sino Flow Matching — una arquitectura más eficiente, menos secuencial y que permite generar audio con menos recursos.

Su pipeline completo —supresión de ruido, detección de turno, transcripción, TTS— corre entero en CPU con una latencia de 385 a 442 milisegundos al primer audio. Y cuesta 4-5 céntimos por minuto, todo incluido.

Lo que NO hace (y por qué es importante saberlo)

Aquí va lo que no te cuentan en los titulares: Lokutor no soporta SSML. No puedes ajustar el tono, el ritmo, las pausas, el énfasis ni la pronunciación mediante etiquetas. El modelo corre a 4 pasos de inferencia fijos. Ni siquiera el parámetro de velocidad hace nada — lo ignoran. Y el resultado se nota: la voz suena sintética, con ese característico tono metálico que delata que no hay una red neuronal enorme detrás generando matices.

Los propios creadores lo reconocen implícitamente: su mercado objetivo son call centers, donde la compresión del audio telefónico enmascara las imperfecciones. No es casualidad. Versa 2.0 no está diseñado para narrar audiolibros, doblar películas o generar la voz de un asistente conversacional con el que quieras encariñarte. Está diseñado para frases cortas, respuestas automáticas y entornos donde lo que importa es que se entienda, no que emocione.

También hay que decir que su fundación está en proceso: buscan 1 millón de euros en esta ronda, y aspiran a 8 millones en la siguiente. La API se lanza el 13 de octubre. La proyección es llegar a 100.000 usuarios en los primeros cuatro meses. Son dos chavales compitiendo contra un oligopolio — y eso tiene mérito, pero también riesgos.

La parte que nos interesa: eficiencia, local, soberanía

Dicho todo lo anterior, Lokutor representa algo que en sintonterIA.es defendemos: no todo necesita ser el modelo más grande.

El artículo de El Mundo lo resume con una metáfora que nos encanta: el «síndrome del conductor de 50 años». Todo el mundo se compra un Hyundai Ioniq 9 (el modelo mastodóntico) cuando igual con un Honda Civic (el modelo pequeño y eficiente) basta para el 90% de los usos. Lokutor es ese Civic: no corre las 500 millas por hora del Ioniq, pero llega igual, gasta menos y aparca en cualquier sitio.

Su modelo corre en local, sin conexión a internet. Se despliega en tus propios servidores (ARM64, x86), en un dispositivo o dentro del producto mismo. Los datos de audio nunca salen de tu perímetro. Y habla 9 idiomas, incluidos catalán, euskera y gallego — lenguas que los gigantes suelen tratar como ciudadanas de segunda.

Para un autónomo o una pequeña empresa que quiere montar un asistente de voz para atención al cliente sin pagar una suscripción mensual a una API americana, esto es relevante. Para alguien que necesita voz sintética en un contexto regulado (sanidad, banca) donde los datos no pueden salir de la UE, también.

Para producir el audio de tu pódcast o la voz de tu corto, no. Ahí necesitas algo que suene natural, y Lokutor no llega.

La conclusión honesta

Lokutor es una historia de eficiencia, no de realismo. Dos ingenieros españoles han demostrado que se puede construir un modelo de voz competitivo desde Madrid, con 5 millones de parámetros, corriendo en CPU y entrenado en el superordenador de Barcelona. Es un hito de ingeniería y una demostración de que el «pequeño contra gigantes» no es solo un eslogan.

Pero no es un sustituto de ElevenLabs. Ni quiere serlo. Ellos lo saben, y nosotros también.

Lo importante no es que suene peor que la competencia. Lo importante es que ha abierto una vía que no existía: la de la IA de voz eficiente, local, multilingüe y hecha en Europa. Y eso, con todas sus limitaciones, merece contarse.

Fuente: El Mundo — Dos chavales y un pequeño modelo de IA contra las voces sintéticas de ElevenLabs · Documentación de Lokutor · Web de Lokutor

Deja un comentario