Replicate
Por qué importa
En profundidad
Replicate fue fundada en 2019 por Ben Firshman y Andreas Jansson sobre una apuesta sencilla: la parte difícil de usar aprendizaje automático rara vez es el modelo en sí, sino todo lo que lo rodea. La plataforma funciona así. Eliges un modelo de un catálogo público — desde generadores de imágenes Stable Diffusion hasta transcripción de voz con Whisper y grandes LLM abiertos — y llamas a una API REST o a una de las bibliotecas cliente oficiales con tus entradas: un prompt, una imagen, un archivo de audio. Replicate ejecuta el modelo en hardware GPU en la nube y devuelve la salida, ya sea manteniendo abierta la conexión para trabajos rápidos o llamando a tu webhook cuando termina un trabajo lento. Se te factura por segundo, medido según el nivel de hardware que ocupa el modelo, así que una imagen barata en una tarjeta de gama media cuesta una fracción de centavo, mientras que un modelo de video grande en una GPU de gama alta cuesta notablemente más. En 2025, Cloudflare adquirió la empresa.
Cómo se ejecuta una predicción
Cada modelo en Replicate expone un endpoint de predicción versionado: envías tus entradas por POST, la plataforma programa el trabajo en el hardware adecuado y luego consultas periódicamente el resultado, bloqueas sobre una llamada síncrona o proporcionas la URL de un webhook que recibe una notificación cuando el trabajo tiene éxito o falla. Para los modelos de lenguaje, la salida puede transmitirse token por token, de modo que una interfaz de chat se siente inmediata incluso con un modelo grande. El detalle operativo que más importa es el arranque en frío. Los modelos públicos populares permanecen calientes y responden en uno o dos segundos; un modelo privado poco utilizado o recién subido puede necesitar decenas de segundos mientras sus pesos se cargan en la VRAM. Esto sitúa claramente a Replicate en la categoría de Servicio de Modelos, y las preocupaciones habituales al servir — Latencia, rendimiento, colas bajo carga — se aplican exactamente igual que sobre infraestructura propia.
Cog: la capa de empaquetado
Cog es la respuesta de código abierto de Replicate al problema de "funciona en mi máquina". Describes el entorno en un pequeño archivo YAML — versión de Python, versión de CUDA, paquetes del sistema, dependencias de pip — y escribes una función de predicción con entradas y salidas tipadas. Cog lo convierte en un contenedor Docker estándar que se comporta de manera idéntica en tu laptop y en producción, y eso hace posible el flujo de trabajo de "sube un modelo, recibe una API": subir el contenedor crea un despliegue nuevo y versionado con su propio endpoint. Como el empaquetado se basa en contenedores y no está ligado a un solo framework, puede distribuirse cualquier cosa que se ejecute en Linux, ya sea un modelo PyTorch, un pipeline de ffmpeg o una base de código de investigación que solo entiendan por completo sus autores. Los modelos personalizados pasan entonces por la misma maquinaria de predicción que el catálogo público, con el mismo control de versiones, webhooks y facturación por segundo.
Ajuste fino como llamada a una API
Replicate expone el entrenamiento como una llamada a una API, no solo la inferencia. El uso más conocido es el Ajuste fino mediante LoRA de modelos de imágenes: subes un dataset pequeño — una docena de fotos de una persona, un producto o un estilo artístico —, inicias un trabajo de entrenamiento y recibes una nueva versión del modelo que se comporta como el modelo base, pero lleva incorporado tu sujeto. El mismo patrón se aplica a modelos de lenguaje abiertos, donde un ajuste fino sobre unos cientos de ejemplos puede cambiar el tono, el formato o el comportamiento en un dominio. La salida entrenada se convierte en un modelo de primera clase que puedes llamar, mantener privado o compartir como cualquier otro elemento de la plataforma. Esto transformó el ajuste fino — antes un trabajo para alguien con una estación de trabajo con GPU y un fin de semana libre — en algo que un desarrollador puede integrar en un producto en una tarde.
No es solo para demostraciones
Una idea equivocada común es que Replicate es un entorno de pruebas: sirve para probar un modelo durante cinco minutos, pero lo superas en cuanto un producto consigue usuarios reales. Muchas aplicaciones de producción ejecutan su inferencia allí de forma permanente porque la facturación por segundo supera al alquiler de una GPU que permanece inactiva entre solicitudes, y la plataforma absorbe el trabajo operativo que, de otro modo, asumiría un equipo pequeño. Sin embargo, a escala la contrapartida real apunta en la otra dirección. Con tráfico sostenido y predecible, servir de forma dedicada — tu propio despliegue de vLLM o un proveedor orientado al rendimiento como Together AI o Fireworks AI — suele ser más barato por token y ofrece un control más estricto sobre la latencia y el hardware. La decisión real depende de la forma del tráfico: las cargas con picos e impredecibles favorecen la facturación por segundo; las cargas planas e intensas favorecen la capacidad reservada.
La adquisición por Cloudflare
La adquisición de Replicate por Cloudflare en 2025 encaja en un patrón más amplio de consolidación de la infraestructura de IA: los modelos abiertos son cada vez más una función de una plataforma de nube mayor y no un negocio independiente. Para una empresa de redes, el atractivo es directo — la inferencia de modelos es cómputo que los clientes quieren cerca de sus usuarios, y un catálogo de modelos listos para ejecutar es la forma más rápida de ofrecerlo. Para los desarrolladores que ya estaban en Replicate, el efecto práctico ha sido la continuidad: la API, el catálogo de modelos y el flujo de trabajo con Cog siguen como antes. La tendencia más profunda que señala el acuerdo es que ejecutar modelos de pesos abiertos se está convirtiendo en infraestructura estándar de la nube, junto al almacenamiento, las colas y las funciones serverless, en vez de ser un servicio especializado que hay que buscar.