Black Forest Labs presentó FLUX 3 el 23 de julio como un único modelo para imagen, vídeo, audio y acciones de robots, y abrió FLUX 3 Video detrás de una puerta con solicitud, sin acceso a la API el primer día. Esa puerta ya no existe. La página del modelo ahora indica que FLUX 3 Video está disponible a través de su panel y de su API en modalidad de pago por uso, con una lista de precios pública, que es el momento en que un lanzamiento de investigación se convierte en un producto que cualquier desarrollador puede poner en una cadena de trabajo.

El modelo de vídeo genera clips de hasta 20 segundos en una sola pasada, en HD (hasta un megapíxel por fotograma) o FHD (hasta dos megapíxeles por fotograma), con audio nativo: diálogo multilingüe, voz sincronizada con la imagen, efectos de sonido y ambiente, incluidos sin coste adicional. La API ofrece cuatro entradas. Texto a vídeo e imagen a vídeo son las dos evidentes. El modo por fotogramas clave toma hasta diez imágenes fijas y anima las transiciones entre ellas, así es como un guion gráfico se convierte en una secuencia. La continuación de vídeo prolonga un clip existente entre cinco y quince segundos por pasada, de modo que las piezas largas se construyen encadenando. Un modo borrador genera una vista previa HD más rápida y barata que puede mejorarse a FHD completo una vez aprobado el plano, algo más cercano a cómo trabaja de verdad un estudio que al bucle de generar y rezar de las herramientas anteriores.

Los precios son por segundo de salida. Texto e imagen a vídeo cuestan 0,06 dólares por segundo en borrador HD, 0,17 en HD estándar y 0,29 en FHD estándar. Continuar un vídeo cuesta más, 0,12, 0,41 y 0,53 dólares por segundo en los mismos tres niveles. El propio ejemplo de Black Forest Labs sitúa un clip HD estándar de cinco segundos a partir de texto en 0,85 dólares. Como comparación, el tope de 20 segundos en FHD sale por algo menos de seis dólares antes de cualquier reintento.

El argumento del lanzamiento fue que un modelo que solo aprende de imágenes solo puede hacer imágenes. "No se puede engañar a la realidad", dijo el consejero delegado Robin Rombach a VentureBeat en julio, y la empresa alimenta la misma arquitectura en una variante robótica, FLUX-mimic, que según Audi funciona en sus líneas de producción para manipular objetos blandos. El resto de la familia sigue escalonado: FLUX 3 Image, FLUX 3 Action y la arquitectura de pesos abiertos FLUX 3 Dev figuran como partes separadas del despliegue, y el modelo de imagen no ha llegado a la API pública. Canva, Burda, Magnific, Krea y Picsart fueron nombrados socios de prueba en el lanzamiento.

Zubnet añadió hoy FLUX 3 Video a su plataforma, con los mismos tres niveles por segundo, el modo borrador, los fotogramas clave y la continuación, cobrado por la duración real del clip devuelto y no por la duración solicitada.