Stability AI, la empresa detrás de Stable Diffusion, acaba de lanzar una nueva familia de modelos de inteligencia artificial capaz de componer música de hasta seis minutos con estructura coherente. Se llama Stable Audio 3.0 y ya está disponible para descarga gratuita en varias de sus versiones.
Qué es Stable Audio 3.0
Si alguna vez quisiste crear música pero no sabías por dónde empezar, esto puede cambiarlo todo. Stable Audio 3.0 es una familia de modelos de IA diseñada para generar audio musical completo a partir de descripciones en texto. Lo más llamativo: sus composiciones pueden durar más de seis minutos, el doble que su versión anterior de 2024.
Todo el sistema fue entrenado con datos totalmente licenciados, lo que lo separa de otros modelos de IA que han enfrentado demandas legales por uso no autorizado de material protegido. Stability AI ya tiene acuerdos con Warner Music Group y Universal Music Group, lo que respalda ese compromiso con la legalidad.
Los cuatro modelos que componen la familia
Stable Audio 3.0 no es un solo modelo, sino cuatro, cada uno pensado para un uso distinto:
Small SFX
El más ligero de todos. Está optimizado para efectos de sonido y puede ejecutarse directamente en un teléfono móvil o laptop convencional. Ideal para creadores de contenido que necesitan sonidos rápidos sin equipos costosos.
Small
También con 459 millones de parámetros, este modelo está orientado a composición musical completa y funciona igualmente en dispositivo, sin necesidad de servidores externos.
Medium
Sube a 1.400 millones de parámetros y es donde la cosa se pone interesante: genera pistas de hasta seis minutos y veinte segundos con coherencia melódica de principio a fin.
Large
El más potente, con 2.700 millones de parámetros. Está pensado para plataformas que necesitan generación masiva de audio con baja latencia. Solo disponible vía API de pago.
Lo que puedes hacer con esta herramienta
Más allá de generar canciones desde cero, Stable Audio 3.0 incluye funciones que lo hacen especialmente versátil:
- Duración variable con precisión de segundos: gracias a su autocodificador semántico-acústico, ya no tienes que ajustarte a tiempos fijos. Pides exactamente lo que necesitas.
- Soporte para LoRA: una técnica que te permite personalizar el modelo con tu propia biblioteca de sonidos o un estilo musical específico. Stability AI publicó la documentación para que cualquiera pueda hacerlo.
- Inpainting de audio: la IA puede restaurar o rellenar segmentos faltantes en una pista, retocar secciones específicas o extender una composición más allá de su punto final original.
¿Es gratuito? ¿Dónde se descarga?
Tres de los cuatro modelos —Small SFX, Small y Medium— están disponibles con pesos abiertos en Hugging Face, lo que significa que cualquiera puede descargarlos, modificarlos y usarlos sin costo. La licencia comunitaria de Stability AI permite incluso distribuir y comercializar lo que generes con ellos.
La única excepción es el modelo Large, que solo se puede usar a través de una API de pago o servicios de autoalojamiento.
Importante para organizaciones: quienes facturen más de un millón de dólares anuales necesitan adquirir una licencia empresarial para uso comercial.
Stability AI también anunció que trabaja en una suite de herramientas para músicos profesionales, aunque sin revelar detalles aún.
Para muchos cristianos que usan la música como ministerio en iglesias, grupos de alabanza, podcasts devocionales o contenido en redes acceder a herramientas de producción de calidad siempre ha sido una barrera económica real. Modelos como Stable Audio 3.0, disponibles de forma gratuita y con licencia comercial, abren una puerta que antes requería estudios, software costoso y años de formación técnica.
No se trata de reemplazar el talento ni la expresión espiritual detrás de la música. Se trata de tener más recursos para contar historias, crear ambientes y llevar mensajes más lejos. La creatividad sigue siendo tuya.