AI Wiki
Conceptos de AI explicados por creadores, no manuales. Sin muros de jerga. Sin gatekeeping académico. Definiciones claras y prácticas de los términos que realmente vas a encontrar.
324 términos 8 categorías Actualizado julio 2026
🧭 Rutas de aprendizaje
▼
Principiante
Acabo de escuchar sobre IA
AI→Chatbot→Prompt→LLM→Token→Context Window→Hallucination
Builder
Estoy creando una app de IA
API→Structured Output→Streaming→Function Calling→RAG→Semantic Search→Model Serving
En profundidad
¿Cómo funciona realmente la IA?
Neuron→Layer→Activation Function→Gradient Descent→Transformer→Attention→Autoregressive
IA local
Quiero correr IA en mi máquina
Open Weights→Quantization→GGUF→llama.cpp→Ollama→VRAM→Edge AI
Seguridad
Seguridad y alineación de IA
Alignment→Guardrails→Red Teaming→Prompt Injection→Constitutional AI→AI Ethics→AI Regulation
ML Engineer
Quiero entrenar modelos
Dataset→Loss Function→Transfer Learning→Fine-Tuning→LoRA→RLHF→DPO
Ningún término encontrado.
A
Fundamentos
Un sistema teórico de IA que supera las capacidades cognitivas de todos los humanos en casi todos los dominios — razonamiento científico, inteligencia social, creatividad, planificación estratégica y más. El ASI va más allá del AGI (que iguala la inteligencia humana) hacia algo cualitativamente diferente: una inteligencia que podría mejorarse de forma recursiva y resolver problemas que los humanos ni siquiera pueden formular. No existe ningún ASI, y no hay consenso científico sobre si se podrá o se construirá uno.
Por qué importa: ASI es donde la seguridad de la IA se vuelve existencial. Si crees que la superinteligencia es posible, la alineación no se trata solo de hacer que los chatbots sean educados — se trata de asegurar que un sistema más inteligente que toda la humanidad aún actúe en nuestro interés. Es especulativo, pero los riesgos son lo suficientemente altos como para que investigadores serios lo tomen en serio. Entender ASI te ayuda a evaluar afirmaciones sobre los riesgos de la IA con más matices.
Fundamentos
Un sistema hipotético de IA que puede entender, aprender y realizar cualquier tarea intelectual que pueda hacer un humano — con la capacidad de transferir conocimiento entre dominios sin necesidad de ser entrenado específicamente para cada uno. A diferencia de la IA actual, que destaca en tareas específicas (generar texto, clasificar imágenes), la IA general podría manejar situaciones novedosas, razonar de manera abstracta y adaptarse a cualquier desafío. Si la IA general está a punto de llegar, está décadas lejos o es imposible, es el debate más controvertido en el campo.
Por qué importa: AGI es la estrella polar (o el fantasma) de toda la industria de la IA. Impulsa miles de millones en inversiones, define las prioridades de investigación en seguridad y domina los debates de políticas. Sea que creas o no que la AGI está cerca, el concepto define cómo empresas como Anthropic, OpenAI y DeepMind enmarcan sus misiones — y entender el debate te ayuda a separar el progreso real de la especulación.
Herramientas
Herramientas de IA que ayudan a los desarrolladores a escribir, revisar, depurar y desplegar código. Desde autocompletado (GitHub Copilot, Codeium) hasta desarrollo completamente autónomo (Claude Code, Cursor, Devin), los asistentes de codificación representan una de las aplicaciones más maduras y ampliamente adoptadas de los LLMs. Funcionan prediciendo los siguientes tokens de código dado el contexto de tu codebase, documentación e instrucciones.
Por qué importa: Los asistentes de codificación con IA son el filo más afilado del impacto de la IA en el trabajo del conocimiento. Los desarrolladores que los usan reportan ganancias de productividad del 30-50% en tareas rutinarias. Pero también alucinan APIs que no existen, introducen bugs sutiles y pueden hacer a los desarrolladores dependientes de herramientas que no entienden completamente.
Herramientas
Usar IA para realizar tareas que antes requerían intervención humana. Esto va desde automatización simple (auto-categorizar correos, generar reportes) hasta flujos de trabajo autónomos complejos (agentes de IA que investigan, escriben, prueban y despliegan código). El cambio clave de la automatización tradicional (reglas rígidas) a la automatización con IA (inteligencia flexible) es que la IA puede manejar tareas ambiguas y no estructuradas.
Por qué importa: La automatización es el motor económico de la adopción de IA. Cada empresa que compra IA realmente está comprando automatización — menos humanos haciendo trabajo repetitivo, procesamiento más rápido, operación 24/7. La pregunta no es si la IA automatizará tareas, sino cuáles tareas, qué tan rápido y qué pasa con los humanos que solían hacerlas.
Seguridad
La doble aplicación de la IA en ciberseguridad: usar IA para defender sistemas (detección de amenazas, detección de anomalías, respuesta automatizada a incidentes) y los nuevos vectores de ataque que la IA crea (phishing generado por IA, descubrimiento automatizado de vulnerabilidades, ataques adversariales a sistemas de ML). El campo está en una carrera armamentista donde tanto atacantes como defensores están cada vez más potenciados por IA.
Por qué importa: La IA hace que las amenazas cibernéticas existentes sean más rápidas y baratas de ejecutar — un correo de phishing escrito por un LLM es más convincente y no cuesta nada personalizarlo. Pero la IA también permite defensas que serían imposibles manualmente, como analizar millones de eventos de red por segundo en busca de anomalías. Los equipos de seguridad que no usen IA perderán ante atacantes que sí lo hagan.
Seguridad
Los marcos de trabajo, políticas, leyes y prácticas organizacionales que guían cómo se desarrolla, despliega y usa la IA. Esto incluye regulación gubernamental (el EU AI Act, órdenes ejecutivas), autorregulación de la industria (políticas de escalamiento responsable, model cards), gobernanza corporativa (comités de ética de IA, políticas de uso) y coordinación internacional sobre estándares de seguridad de IA.
Por qué importa: La tecnología se mueve más rápido que las reglas. Las empresas están lanzando productos de IA en salud, justicia penal y finanzas con supervisión mínima. La gobernanza es el intento de establecer límites antes de que algo falle lo suficientemente mal como para desencadenar una reacción que podría retrasar todo el campo.
Seguridad
El desafío de construir y usar sistemas de IA sin comprometer datos personales. Esto abarca todo el ciclo de vida: datos de entrenamiento que podrían contener información privada, modelos que pueden memorizar y regurgitar detalles personales, logs de inferencia que rastrean el comportamiento del usuario, y la tensión fundamental entre la capacidad de IA (que mejora con más datos) y los derechos de privacidad.
Por qué importa: Cada conversación con una IA es data. Cada imagen que generas revela tus prompts. Cada documento que resumes pasa por los servidores de alguien. La privacidad no es solo una casilla legal (GDPR, CCPA) — es un tema de confianza que determina si individuos y empresas adoptarán IA para trabajo sensible.
Seguridad
La práctica de proteger sistemas de IA contra ataques adversariales, envenenamiento de datos, inyección de prompts, robo de modelos y uso indebido — mientras también se defiende contra amenazas habilitadas por IA como deepfakes y ciberataques automatizados. La seguridad de IA se encuentra en la intersección de la ciberseguridad tradicional y las vulnerabilidades únicas introducidas por los sistemas de machine learning.
Por qué importa: Los sistemas de IA son simultáneamente herramientas poderosas y superficies de ataque novedosas. Una inyección de prompt puede hacer que tu bot de soporte al cliente filtre datos internos. Un dataset de entrenamiento envenenado puede insertar puertas traseras. Conforme la IA se despliega en infraestructura crítica, salud y finanzas, la seguridad no es opcional — es existencial.
Infraestructura
Cómo los proveedores de IA cobran por el acceso a sus modelos. El modelo dominante es el precio por token — pagas por el número de tokens que envías (entrada) y recibes (salida), con los tokens de salida costando típicamente 3-5x más. Otros modelos incluyen precio por solicitud, suscripciones mensuales, descuentos por uso comprometido y niveles gratuitos. La carrera por bajar precios ha sido feroz, con costos cayendo 10-100x en dos años.
Por qué importa: Los precios determinan lo que puedes construir. Una aplicación que hace 10,000 llamadas a la API por día vive o muere por el costo por token. Entender modelos de precios, comparar proveedores y optimizar el uso de tokens es una habilidad fundamental para cualquiera que construya productos potenciados por IA.
Infraestructura
El stack completo de hardware, software y servicios requeridos para entrenar y desplegar modelos de IA a escala. Esto incluye GPUs y chips personalizados, centros de datos, redes, almacenamiento, plataformas de orquestación (Kubernetes, Slurm), frameworks de servicio de modelos (vLLM, TensorRT), y los proveedores de nube que empaquetan todo. La infraestructura de IA es donde el mundo abstracto de la arquitectura de modelos se encuentra con el mundo muy concreto de redes eléctricas y sistemas de enfriamiento.
Por qué importa: La infraestructura determina lo que es posible. La razón por la que solo un puñado de empresas puede entrenar modelos de frontera no es falta de ideas — es falta de infraestructura. Y la razón por la que la IA cuesta lo que cuesta para los usuarios finales se traza directamente a la disponibilidad de GPUs, capacidad de centros de datos y eficiencia de servicio de inferencia.
Empresas
Empresa de IA de voz que construye API amigables para desarrolladores para transcripción, detección de hablantes y comprensión de audio. Su modelo Universal-2 rivaliza con OpenAI Whisper en precisión mientras agrega funciones como diarización de hablantes, sentimiento y detección de temas de forma nativa.
Por qué importa: AssemblyAI ha hecho que speech-to-text sea genuinamente accesible para desarrolladores, comprimiendo lo que solía requerir un equipo dedicado de ML en una sola llamada API. Su stack de Audio Intelligence — que combina transcripción, identificación de hablantes, sentimiento y resumen potenciado por LLM — está convirtiendo audio crudo en datos estructurados y accionables a una escala que no era práctica hace apenas dos años. En un mundo donde la voz se está convirtiendo en la interfaz predeterminada para agentes de IA, AssemblyAI está construyendo la capa de comprensión de la que todo lo demás depende.
Empresas
Empresa de seguridad en IA que desarrolla Claude. Fundada por los ex investigadores de OpenAI Dario y Daniela Amodei, Anthropic se enfoca en desarrollar sistemas de IA confiables, interpretables y dirigibles.
Por qué importa: Anthropic demostró que una empresa de IA podía liderar con investigación en seguridad y aún así competir en la frontera. Su enfoque de Constitutional AI influyó en cómo toda la industria piensa sobre el alignment, su Responsible Scaling Policy estableció una plantilla que otros laboratorios han adoptado en varias formas, y Claude se ha convertido en el modelo elegido por empresas que necesitan confiabilidad y manejo cuidadoso de contenido sensible. Quizás lo más importante, la existencia de Anthropic como competidor bien financiado asegura que la carrera hacia la AGI no sea un asunto de una sola empresa — y que al menos un jugador importante tenga la seguridad entretejida en su ADN fundacional en lugar de agregada como un parche.
Empresas
La división de computación en la nube de Alibaba Group y creadora de la familia de modelos Qwen. Los modelos Qwen son completamente open-weights, multilingües y se encuentran entre los modelos abiertos más capaces disponibles.
Por qué importa: Alibaba Cloud ha convertido a Qwen en la familia de modelos open-weights más desplegada en Asia y un competidor global genuino de Llama de Meta, demostrando que los modelos de capacidad de frontera pueden venir de fuera de Silicon Valley. Su combinación de lanzamientos de modelos abiertos, infraestructura masiva de nube y el ecosistema ModelScope da a los desarrolladores — especialmente aquellos en mercados afectados por los controles de exportación de EE.UU. — una alternativa creíble y de alta calidad a las plataformas de IA occidentales.
Herramientas
Un sistema de IA que puede planificar y ejecutar tareas de múltiples pasos de forma autónoma, usando herramientas (búsqueda web, ejecución de código, llamadas a API) para lograr un objetivo. A diferencia de un chatbot simple que responde una pregunta a la vez, un agente decide qué hacer a continuación basándose en lo que ha aprendido hasta el momento.
Por qué importa: Los agentes son el puente entre "IA que habla" e "IA que hace". Cuando tu IA puede navegar documentación, escribir código y probarlo sin que la lleves de la mano en cada paso — eso es un agente.
Seguridad
El desafío de hacer que los sistemas de IA se comporten de maneras que coincidan con los valores e intenciones humanas. Un modelo alineado hace lo que quieres decir, no solo lo que dijiste — y evita acciones dañinas incluso cuando no se le dice explícitamente que no las haga.
Por qué importa: Un modelo que es técnicamente brillante pero mal alineado es como un empleado genial que sigue las instrucciones demasiado literalmente. La investigación en alignment es la razón por la que los modelos rechazan solicitudes peligrosas e intentan ser genuinamente útiles.
Infraestructura
Una forma estructurada para que el software se comunique con otro software. En IA, esto generalmente significa enviar una solicitud (tu prompt) al servidor de un proveedor y recibir una respuesta (la salida del modelo) de vuelta. Las API REST sobre HTTPS son el estándar.
Por qué importa: Cada proveedor de IA — Anthropic, Google, Mistral — expone sus modelos a través de API. Si estás construyendo algo con IA más allá de una ventana de chat, estás usando una API.
Modelos
El mecanismo central de los Transformers que permite a un modelo ponderar qué partes de la entrada son más relevantes entre sí. En vez de leer texto de izquierda a derecha como los modelos anteriores, attention permite que cada palabra "mire" a todas las demás palabras simultáneamente para entender el contexto.
Por qué importa: Attention es la razón por la que los LLM modernos entienden que "banco" significa cosas diferentes en "banco del río" vs. "cuenta de banco". También es la razón por la que las ventanas de contexto más grandes cuestan más — attention escala cuadráticamente con la longitud de la secuencia.
Fundamentos
Un modelo que genera salida un token a la vez, donde cada nuevo token se predice basándose en todos los tokens anteriores. Todo LLM moderno — Claude, GPT, Llama, Gemini — es autoregresivo. El modelo no “planifica” una respuesta completa para luego escribirla; literalmente predice la siguiente palabra, la añade, luego predice la siguiente, una y otra vez hasta que decide parar.
Por qué importa: Entender la generación autoregresiva explica la mayoría de los comportamientos de los LLMs: por qué las respuestas se transmiten token por token, por qué los modelos a veces se contradicen a mitad de párrafo, por qué las salidas más largas son más lentas y más caras, y por qué no puedes pedirle fácilmente a un modelo que “vuelva y arregle el principio.” El modelo siempre avanza, un token a la vez.
Entrenamiento
Usar conocimiento aprendido de una tarea o dataset para mejorar el rendimiento en una tarea diferente pero relacionada. En lugar de entrenar desde cero cada vez, comienzas con un modelo que ya entiende patrones generales (estructura del lenguaje, características visuales) y lo adaptas a tu necesidad específica. Pre-entrenar y luego hacer fine-tuning es el paradigma dominante en la IA moderna.
Por qué importa: El aprendizaje por transferencia es la razón por la que la IA se volvió práctica. Entrenar un modelo de lenguaje desde cero cuesta millones de dólares. Hacer fine-tuning de un modelo pre-entrenado para tu tarea específica cuesta decenas de dólares y unas pocas horas. Esta economía es lo que permitió la explosión de aplicaciones de IA — no necesitas el presupuesto de Google para construir algo útil.
Entrenamiento
Técnicas que expanden artificialmente un dataset de entrenamiento creando versiones modificadas de ejemplos existentes. Para imágenes: voltear, rotar, recortar, cambios de color. Para texto: parafraseo, traducción inversa, sustitución de sinónimos. Para audio: cambios de velocidad, inyección de ruido. El objetivo es enseñarle al modelo invariancias — un gato es un gato ya sea que la imagen esté volteada, oscurecida o recortada.
Por qué importa: El aumento de datos es la forma más barata de mejorar el rendimiento de un modelo cuando tienes datos limitados. Reduce el sobreajuste mostrando al modelo muchas variaciones de cada ejemplo, enseñándole a enfocarse en características esenciales en lugar de detalles superficiales. En visión por computadora, el aumento rutinariamente proporciona mejoras de 2–5% en exactitud de forma gratuita.
Empresas
El sistema de IA en dispositivo y en la nube de Apple, integrado en iPhone, iPad y Mac. Apple Intelligence ejecuta modelos más pequeños localmente en Apple Silicon para tareas sensibles a la privacidad (reescritura de texto, resumen, generación de imágenes) y dirige solicitudes complejas a los servidores de Private Cloud Compute de Apple. También integra modelos externos (como ChatGPT) con consentimiento del usuario para tareas más allá de sus propias capacidades.
Por qué importa: Apple Intelligence representa la estrategia de IA para consumidores de la empresa más valiosa del mundo, alcanzando más de mil millones de dispositivos. Su énfasis en la privacidad (procesamiento en dispositivo, Private Cloud Compute con seguridad verificable) ofrece un modelo diferente al enfoque cloud-first de OpenAI y Google. Si Apple acierta con la IA, normaliza la IA en dispositivo para miles de millones de usuarios no técnicos.
Empresas
Una empresa israelí de IA conocida por Jamba, la primera arquitectura híbrida de grado producción que combina capas de atención Transformer con capas SSM de Mamba. AI21 fue fundada por investigadores de IA (incluyendo a Yoav Shoham) y ha estado construyendo modelos de lenguaje desde 2017, antes de ChatGPT. Sus modelos están disponibles vía API y a través de proveedores de nube.
Por qué importa: AI21 Labs importa porque Jamba demostró que las arquitecturas híbridas Transformer-SSM funcionan en la práctica, no solo en papers de investigación. Al intercalar capas de atención y Mamba, Jamba logra una ventana de contexto de 256K con menor uso de memoria que modelos Transformer puros de calidad similar. Este enfoque híbrido puede ser el futuro de la arquitectura de LLMs.
Fundamentos
Un mecanismo de atención donde las queries provienen de una secuencia y las keys/values provienen de una secuencia diferente. En modelos encoder-decoder, las queries del decoder atienden a las keys y values del encoder, permitiendo que el decoder "mire" la entrada mientras genera la salida. La atención cruzada también es cómo el texto condiciona la generación de imágenes en modelos de difusión — el proceso de generación de imágenes atiende al prompt de texto.
Por qué importa: La atención cruzada es el puente entre diferentes modalidades y diferentes partes de una arquitectura. Es cómo los modelos de traducción conectan idiomas de origen y destino, cómo los generadores de imágenes siguen prompts de texto, cómo los modelos multimodales relacionan imágenes con texto, y cómo los sistemas de Retrieval-Augmented incorporan documentos recuperados. Cada vez que dos entradas diferentes necesitan interactuar, la atención cruzada suele estar involucrada.
Usar AI
Un sistema de IA que puede planificar, decidir y ejecutar tareas de múltiples pasos de forma independiente con supervisión humana mínima. Dado un objetivo de alto nivel ("investiga competidores y escribe un informe"), un agente autónomo lo descompone en pasos, usa herramientas (búsqueda web, ejecución de código, gestión de archivos), maneja errores y entrega un resultado. El nivel de autonomía va desde "pedir permiso en cada paso" hasta "simplemente hazlo e informa cuando termines".
Por qué importa: Los agentes autónomos son la siguiente evolución más allá de chatbots y copilots. Un chatbot responde preguntas. Un copilot asiste con tareas. Un agente completa tareas de forma independiente. El potencial económico es enorme — agentes que pueden manejar trabajo de conocimiento rutinario (investigación, análisis de datos, servicio al cliente, revisión de código) a una fracción del costo y tiempo. Pero los desafíos de confiabilidad y seguridad siguen siendo significativos.
Modelos
Mecanismos de atención que procesan solo un subconjunto de pares de tokens en lugar de la matriz de atención N×N completa. La atención de ventana deslizante atiende solo a tokens cercanos (dentro de una ventana fija). Los patrones dispersos (como la combinación de atención local + global de Longformer) permiten que tokens específicos atiendan a todo mientras la mayoría atiende localmente. Estos enfoques reducen el costo cuadrático de la atención para secuencias largas.
Por qué importa: La atención dispersa es cómo Mistral, Mixtral y otros modelos eficientes manejan secuencias largas sin el costo completo de la atención densa. Es el compromiso práctico entre "atender a todo" (caro pero exhaustivo) y "no atender a nada distante" (barato pero limitado). Entender la atención dispersa te ayuda a evaluar afirmaciones sobre longitud de contexto y predecir dónde podría ocurrir degradación de calidad.
Entrenamiento
La capacidad de un modelo para aprender de nuevos datos continuamente sin olvidar lo que aprendió antes. Los LLMs actuales se entrenan una vez y se congelan — actualizarlos requiere un reentrenamiento costoso. El aprendizaje continuo permitiría que los modelos aprendan de cada interacción, se mantengan actualizados con nueva información y se adapten a usuarios individuales con el tiempo, de la manera en que los humanos aprenden naturalmente.
Por qué importa: El aprendizaje continuo es uno de los grandes problemas no resueltos de la IA. Los modelos actuales tienen fechas de corte de conocimiento, no pueden aprender de correcciones y tratan cada conversación como una pizarra en blanco. Resolver el aprendizaje continuo eliminaría la necesidad de ciclos de reentrenamiento costosos, permitiría una IA personalizada que genuinamente se adapte a cada usuario y permitiría que los modelos se mantengan perpetuamente actualizados.
Entrenamiento
Una estrategia de entrenamiento que presenta ejemplos en un orden significativo — típicamente de fácil a difícil — en lugar de aleatoriamente. Como enseñarle a un estudiante aritmética antes de cálculo, el aprendizaje curricular le da al modelo los patrones fundamentales primero y construye complejidad gradualmente. Esto puede llevar a una convergencia más rápida y a veces a un mejor rendimiento final.
Por qué importa: El aprendizaje curricular es una técnica subestimada que puede mejorar la eficiencia del entrenamiento sin cambiar el modelo ni los datos. El preentrenamiento de LLMs cada vez más usa programación de datos — mostrando datos más limpios y de mayor calidad en las etapas finales del entrenamiento — lo cual es una forma de aprendizaje curricular. El orden en que presentas los datos importa, no solo los datos en sí.
Fundamentos
El debate en curso sobre si los modelos de IA deberían publicarse abiertamente (pesos disponibles públicamente, como Llama y Mistral) o mantenerse propietarios (disponibles solo vía API, como Claude y GPT). Los defensores de lo abierto argumentan a favor de la transparencia, la competencia y la democratización. Los defensores de lo cerrado argumentan a favor de la seguridad, el despliegue responsable y la prevención del mal uso. La realidad es un espectro: los modelos verdaderamente "open source" (con datos de entrenamiento y código) son raros; la mayoría de los modelos "abiertos" son de pesos abiertos.
Por qué importa: Este debate moldea el futuro de la IA. Si gana lo cerrado, unas pocas empresas controlan el acceso a la tecnología más poderosa del siglo. Si gana lo abierto, la IA poderosa está disponible para todos — incluidos quienes la usarían mal. La mayoría de los profesionales usan ambos: APIs propietarias para producción (confiabilidad, soporte) y modelos abiertos para experimentación, privacidad y control de costos. Entender las compensaciones te ayuda a elegir.
Entrenamiento
El proceso de agregar etiquetas, marcas o metadatos a datos sin procesar para que puedan usarse para aprendizaje supervisado. Anotar imágenes significa dibujar cajas delimitadoras alrededor de objetos. Anotar texto significa etiquetar entidades, sentimiento o intención. Anotar para RLHF significa clasificar respuestas del modelo por calidad. La anotación es el trabajo humano que convierte datos sin procesar en datos de entrenamiento.
Por qué importa: La anotación es la base poco glamorosa de la IA supervisada. Cada dataset etiquetado, cada modelo fine-tuneado, cada asistente alineado depende de anotadores humanos que pasaron horas etiquetando datos correctamente. La calidad de las anotaciones determina directamente la calidad del modelo — el etiquetado inconsistente o sesgado produce modelos inconsistentes y sesgados. Es la parte más intensiva en mano de obra y a menudo la más costosa de construir sistemas de IA.
Entrenamiento
Un enfoque de entrenamiento donde el modelo se entrena a través de múltiples dispositivos u organizaciones sin compartir los datos sin procesar. En lugar de enviar datos a un servidor central, cada participante entrena una copia local del modelo con sus propios datos y envía solo las actualizaciones del modelo (gradientes) a un coordinador central. El coordinador agrega las actualizaciones de todos los participantes para mejorar el modelo global.
Por qué importa: El aprendizaje federado permite el entrenamiento de IA con datos que no pueden centralizarse debido a la privacidad, la regulación o preocupaciones competitivas. Los hospitales pueden entrenar colaborativamente un modelo de diagnóstico sin compartir registros de pacientes. Las empresas pueden mejorar un modelo compartido sin exponer datos propietarios. Es el enfoque más práctico para el entrenamiento de IA que preserva la privacidad a escala.
Modelos
La red neuronal convolucional que ganó la competencia ImageNet de 2012 por un margen masivo, desencadenando la revolución del deep learning. Creada por Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton, AlexNet redujo la tasa de error de clasificación de imágenes del 26% al 16% — una brecha tan grande que convenció a la comunidad de visión por computadora de que el deep learning era fundamentalmente superior a las características diseñadas a mano.
Por qué importa: AlexNet es el momento de "antes y después" en la historia de la IA. Antes de 2012, la mayoría de los investigadores de IA trabajaban en ingeniería de características y métodos no neuronales. Después de AlexNet, el deep learning se convirtió en el paradigma dominante. Cada sistema de IA moderno — GPT, Claude, Stable Diffusion — tiene su linaje en el cambio de paradigma que AlexNet desencadenó. Es el Big Bang de la IA moderna.
Fundamentos
Ejecutar múltiples operaciones de atención en paralelo, cada una con su propia proyección aprendida de las queries, keys y values. En lugar de una función de atención que mira la dimensión completa del modelo, la atención multi-cabeza divide la dimensión en múltiples "cabezas" (por ejemplo, 32 cabezas de 128 dimensiones cada una para un modelo de 4096 dimensiones). Cada cabeza puede enfocarse en diferentes tipos de relaciones simultáneamente.
Por qué importa: La atención multi-cabeza es la razón por la que los Transformers son tan expresivos. Una cabeza puede enfocarse en relaciones sintácticas (sujeto-verbo), otra en patrones posicionales (palabras cercanas), otra en similitud semántica. Esta especialización paralela permite al modelo capturar muchos tipos de dependencias simultáneamente, algo que una sola cabeza de atención no puede hacer con la misma eficacia.
Fundamentos
Un mecanismo de atención donde una secuencia atiende a sí misma — cada token calcula su relevancia con respecto a cada otro token en la misma secuencia. Las queries, keys y values provienen todas de la misma entrada. Esto permite que cada token recopile información de todos los demás tokens, ponderada por relevancia. La auto-atención es la operación central en cada capa de Transformer.
Por qué importa: La auto-atención es lo que hace funcionar a los Transformers. Reemplazó el procesamiento secuencial de las RNN con conexiones paralelas y directas entre todas las posiciones. La palabra "banco" en "banco del río" atiende a "río" para resolver su significado, sin importar qué tan separadas estén. Esta capacidad de conectar directamente cualquier par de posiciones es la razón por la que los Transformers manejan tan bien las dependencias de largo alcance.
Modelos
Una red neuronal entrenada para reconstruir las activaciones internas de un modelo a través de un cuello de botella con restricción de dispersión — solo unas pocas características pueden estar activas a la vez. Las características aprendidas a menudo corresponden a conceptos interpretables (temas específicos, patrones lingüísticos, estrategias de razonamiento), convirtiendo a los SAE en la herramienta principal para desenredar las características superpuestas dentro de los modelos de lenguaje grandes.
Por qué importa: Los autoencoders dispersos son el microscopio de la interpretabilidad mecanicista. Los LLMs empaquetan miles de características en cada capa mediante superposición, haciendo que las neuronas individuales sean ininterpretables. Los SAE descomponen estas representaciones superpuestas en características individuales e interpretables. Anthropic usó SAEs para identificar millones de características en Claude, incluyendo características de engaño, conceptos específicos y comportamientos relevantes para la seguridad.
Entrenamiento
Un enfoque de aprendizaje auto-supervisado que entrena modelos contrastando pares positivos (elementos similares que deben estar cerca en el espacio de embeddings) contra pares negativos (elementos disímiles que deben estar lejos). CLIP contrasta pares imagen-texto coincidentes contra no coincidentes. SimCLR contrasta vistas aumentadas de la misma imagen contra vistas de imágenes diferentes. El modelo aprende representaciones donde la similitud en el espacio de embeddings refleja la similitud del mundo real.
Por qué importa: El aprendizaje contrastivo es cómo se entrenan la mayoría de los modelos de embedding — los modelos que alimentan la búsqueda semántica, RAG y las recomendaciones. También es el enfoque de entrenamiento detrás de CLIP, que conecta lenguaje y visión. Cada vez que usas embeddings para medir similitud, el aprendizaje contrastivo es probablemente cómo esos embeddings fueron creados.
Entrenamiento
El algoritmo de optimización más ampliamente usado para entrenar redes neuronales. Adam (Adaptive Moment Estimation) combina momentum (usando un promedio móvil de gradientes pasados) con tasas de aprendizaje adaptativas (escalando actualizaciones por el inverso de las magnitudes de gradientes pasados). AdamW agrega weight decay desacoplado para mejor regularización. Casi todos los LLMs modernos se entrenan con AdamW.
Por qué importa: Adam funciona bien en una amplia gama de tareas e hiperparámetros, haciéndolo el optimizador predeterminado. Entenderlo explica por qué el entrenamiento "simplemente funciona" la mayor parte del tiempo (Adam se adapta por parámetro) y por qué a veces no (los requisitos de memoria de Adam son 2x los parámetros del modelo, lo que importa para modelos grandes). También es la respuesta a "¿qué optimizador debería usar?" en el 90% de los casos.
Infraestructura
Monitorear y entender el comportamiento de sistemas de IA en producción — rastrear entradas, salidas, latencia, costos, errores y métricas de calidad en tiempo real. La observabilidad de IA es como el monitoreo de aplicaciones (Datadog, New Relic) pero especializado para IA: trazar pares prompt-respuesta, detectar degradación de calidad, monitorear alucinaciones y alertar sobre comportamiento anómalo.
Por qué importa: Desplegar un sistema de IA sin observabilidad es como volar a ciegas. No sabes si el modelo está alucinando más de lo usual, si la latencia está aumentando, si un tipo específico de consulta está fallando o si los costos se están disparando. La observabilidad de IA convierte "parece que funciona" en "sabemos que funciona, y sabemos cuándo no." Es la diferencia entre un demo y un sistema de producción.
Empresas
La plataforma gestionada de Amazon Web Services para acceder y desplegar modelos de fundamento de múltiples proveedores (Anthropic, Meta, Mistral, Cohere, Stability AI, los propios modelos Titan de Amazon) a través de una API unificada. Bedrock maneja el hosting del modelo, escalado y ajuste fino, permitiendo a las empresas usar IA sin gestionar infraestructura de GPU. También proporciona guardrails, bases de conocimiento (RAG) y capacidades de agentes.
Por qué importa: AWS Bedrock es cómo la mayoría de las empresas Fortune 500 acceden a modelos de IA. Su enfoque multi-modelo permite a las empresas comparar y cambiar entre proveedores (Claude, Llama, Mistral) a través de una sola API, evitando el vendor lock-in. Para empresas ya en AWS (que son la mayoría de empresas grandes), Bedrock es el camino de menor resistencia para la adopción de IA — misma cuenta, misma facturación, mismos frameworks de cumplimiento.
Uso de IA
Determinar automáticamente el tono emocional de un texto — positivo, negativo o neutro. "¡Este producto es increíble!" es positivo. "Pésimo servicio al cliente" es negativo. Más allá de la simple polaridad, el análisis de sentimiento avanzado detecta emociones específicas (enojo, alegría, frustración), sentimiento a nivel de aspecto ("la comida estuvo genial pero el servicio fue lento") y sarcasmo.
Por qué importa: El análisis de sentimiento es una de las aplicaciones de NLP más desplegadas comercialmente. Las empresas lo usan para monitorear la percepción de marca en redes sociales, analizar reseñas de clientes a escala, medir la satisfacción de empleados en encuestas y detectar crisis de relaciones públicas emergentes. También es un punto de entrada común para aprender NLP — una tarea de clasificación simple e intuitiva con abundantes datos de entrenamiento.
Entrenamiento
Buscar sistemáticamente los mejores hiperparámetros — las opciones de configuración que no se aprenden durante el entrenamiento sino que deben establecerse antes de que comience. Tasa de aprendizaje, tamaño de batch, número de capas, tasa de dropout y rango de LoRA son todos hiperparámetros. Los métodos de ajuste incluyen grid search (probar todas las combinaciones), random search (probar combinaciones aleatorias) y optimización bayesiana (usar resultados pasados para guiar la búsqueda).
Por qué importa: La diferencia entre un buen y mal conjunto de hiperparámetros puede ser enorme — una tasa de aprendizaje incorrecta puede hacer que el entrenamiento diverja o converja a una solución pobre. El ajuste de hiperparámetros es cómo sacas el máximo provecho de tu arquitectura de modelo y datos. Para ajustar LLMs, la tasa de aprendizaje y el número de épocas son típicamente los hiperparámetros más impactantes para ajustar.
Empresas
Empresa israelí de IA que construyó sus modelos de generación de imágenes exclusivamente con datos de entrenamiento licenciados y atribuidos. Se posiciona como la opción segura para empresas que necesitan imágenes generadas por IA sin riesgo de derechos de autor.
Por qué importa: Bria es el caso de prueba más prominente sobre si la generación de imágenes con IA puede construirse sobre datos de entrenamiento completamente licenciados y aún así competir comercialmente. En una industria que enfrenta una avalancha de litigios por derechos de autor, su enfoque ofrece a las empresas un camino para adoptar IA generativa sin exposición legal — una propuesta de valor que se vuelve más convincente con cada nueva demanda presentada contra competidores. Si Bria tiene éxito, valida toda una filosofía de desarrollo responsable de IA; si tiene dificultades, sugiere que el mercado en última instancia no se preocupa lo suficiente por la procedencia de los datos como para pagar un premium por ella.
Empresas
Empresa matriz de TikTok y una de las empresas tecnológicas más valiosas del mundo. Su laboratorio de IA construye la familia de modelos Doubao y potencia algoritmos de recomendación que sirven a más de mil millones de usuarios diarios.
Por qué importa: ByteDance es la empresa de tecnología privada más valiosa del mundo y despliega IA a una escala que pocas organizaciones pueden igualar, sirviendo a más de mil millones de usuarios diarios a través de TikTok, Douyin y una suite creciente de productos impulsados por IA. Su familia de modelos Doubao y la plataforma de nube Volcano Engine los convierten en un participante formidable en la carrera de modelos fundacionales, respaldados por algo con lo que la mayoría de las startups de IA solo pueden soñar: un negocio central masivo y rentable y distribución incorporada a más de mil millones de usuarios.
Empresas
Fundada por los creadores originales de Stable Diffusion tras dejar Stability AI. Sus modelos FLUX rápidamente se convirtieron en el nuevo estándar para la generación de imágenes de código abierto, superando la calidad de los modelos que dejaron atrás.
Por qué importa: Black Forest Labs representa el mejor escenario posible para la IA de código abierto: los arquitectos originales de Stable Diffusion empezando de cero con mejor tecnología, estrategia de negocio más inteligente y la confianza de la comunidad creativa. FLUX.1 no solo iteró sobre Stable Diffusion — lo superó de un salto, y el modelo de licenciamiento escalonado que pioneraron se está convirtiendo en el plan maestro de cómo las empresas de IA equilibran apertura con ingresos.
Entrenamiento
Una prueba estandarizada usada para evaluar y comparar modelos de IA. Los benchmarks miden capacidades específicas — razonamiento (ARC), matemáticas (GSM8K), programación (HumanEval), conocimiento general (MMLU) — y producen puntajes que se pueden comparar entre modelos.
Por qué importa: Los benchmarks son cómo la industria lleva el marcador, pero son imperfectos. Los modelos pueden ser entrenados para dominar benchmarks sin ser genuinamente mejores. El rendimiento en el mundo real a menudo cuenta una historia diferente. Trátalos como señales, no como verdad.
Seguridad
Patrones sistemáticos en las salidas de IA que reflejan o amplifican los prejuicios sociales presentes en los datos de entrenamiento. El sesgo puede aparecer en generación de texto, creación de imágenes, herramientas de contratación y en cualquier lugar donde los modelos tomen decisiones que afectan a las personas de manera diferente.
Por qué importa: Si los datos de entrenamiento dicen que las enfermeras son mujeres y los ingenieros son hombres, el modelo perpetuará eso. El sesgo no siempre es obvio — se esconde en asociaciones de palabras, suposiciones por defecto y en quién queda representado.
Modelos
Un modelo basado en Transformer de Google (2018) que revolucionó el NLP al introducir pre-entrenamiento bidireccional — cada token puede atender a todos los demás tokens, dando al modelo una comprensión contextual profunda. BERT es un modelo solo-encoder: destaca en la comprensión de texto (clasificación, búsqueda, NER) pero no puede generar texto como GPT o Claude.
Por qué importa: BERT es el paper de NLP más influyente de la era moderna. Demostró que pre-entrenar con texto sin etiquetar y luego hacer fine-tuning en tareas específicas podía aplastar cada benchmark existente. Aunque los LLMs han robado los reflectores, los modelos tipo BERT siguen impulsando la mayoría de los motores de búsqueda en producción, sistemas de embeddings y pipelines de clasificación porque son más pequeños, rápidos y baratos que los LLMs para tareas no generativas.
Usar AI
Una búsqueda que encuentra resultados basándose en el significado en lugar de coincidencias exactas de palabras clave. En vez de buscar documentos que contengan la palabra "arreglar", la búsqueda semántica encuentra documentos sobre "reparar", "resolver", "parchear" y "depurar" porque significan cosas similares. Funciona convirtiendo el texto en embeddings (vectores numéricos) y encontrando las coincidencias más cercanas en el espacio vectorial.
Por qué importa: La búsqueda semántica es la razón por la que la búsqueda moderna se siente mágica comparada con la búsqueda por palabras clave. Impulsa los sistemas RAG, la búsqueda en documentación, el descubrimiento de productos en e-commerce y el enrutamiento de tickets de soporte. Si estás construyendo cualquier aplicación que necesite encontrar información relevante, la búsqueda semántica es probablemente el enfoque correcto.
Fundamentos
Métricas clásicas para evaluar la calidad de generación de texto comparando la salida del modelo con textos de referencia. BLEU (Bilingual Evaluation Understudy) mide cuántos n-gramas del texto generado aparecen en la referencia — diseñado originalmente para traducción automática. ROUGE (Recall-Oriented Understudy for Gisting Evaluation) mide cuántos n-gramas de la referencia aparecen en el texto generado — diseñado para resúmenes.
Por qué importa: BLEU y ROUGE fueron las métricas de evaluación estándar para NLP durante más de una década y todavía se usan ampliamente. Entenderlas — y sus limitaciones — te ayuda a evaluar afirmaciones de investigación en NLP y a comprender por qué el campo se está moviendo hacia la evaluación humana y la evaluación basada en modelos. Una puntuación BLEU alta no garantiza calidad; una puntuación BLEU baja no garantiza fracaso.
Fundamentos
Pruebas estandarizadas usadas para medir y comparar las capacidades de los modelos de IA. MMLU evalúa conocimiento en 57 materias académicas. HumanEval evalúa la generación de código. ARC evalúa el razonamiento científico. HellaSwag evalúa el razonamiento de sentido común. GSM8K evalúa matemáticas. Las puntuaciones de benchmarks proporcionan un lenguaje común para comparar modelos, aunque tienen limitaciones significativas.
Por qué importa: Los benchmarks son cómo la industria lleva la cuenta. Cuando Anthropic dice que Claude obtiene X% en MMLU y Y% en HumanEval, esos números solo significan algo si sabes qué evalúan los benchmarks, cómo se puntúan y cuáles son sus limitaciones. Entender los benchmarks te ayuda a separar las afirmaciones de marketing y evaluar qué modelo es realmente el mejor para tu caso de uso específico.
Fundamentos
El algoritmo más común para construir vocabularios de tokenizadores. BPE comienza con bytes o caracteres individuales y fusiona iterativamente el par adyacente más frecuente en un nuevo token. Después de miles de fusiones, las palabras comunes se convierten en tokens únicos ("the", "function") mientras que las palabras raras se dividen en piezas de subpalabras ("un" + "common"). Utilizado por GPT, Claude, Llama y la mayoría de los LLMs modernos.
Por qué importa: BPE es la razón por la que tu tokenizador funciona como lo hace. Explica por qué las palabras comunes son baratas (un token), por qué las palabras raras son caras (muchos tokens) y por qué el texto que no es en inglés cuesta más (menos fusiones asignadas a pares de caracteres no ingleses). Entender BPE te ayuda a predecir conteos de tokens, optimizar prompts y comprender por qué diferentes tokenizadores producen resultados diferentes para el mismo texto.
Fundamentos
Una estrategia de decodificación que mantiene múltiples secuencias candidatas (el "beam") simultáneamente, expandiendo cada una por un token en cada paso y conservando solo los candidatos con mayor puntuación. A diferencia de la decodificación greedy (siempre elegir el mejor siguiente token) o el muestreo (elegir aleatoriamente), beam search explora múltiples caminos y encuentra la secuencia con la mayor probabilidad general. Comúnmente usado para traducción y resumen.
Por qué importa: Beam search demuestra que la mejor opción local no siempre es la mejor global. La decodificación greedy podría elegir "The" como primera palabra cuando "In" llevaría a una oración mucho mejor en general. Al mantener múltiples candidatos, beam search evita comprometerse demasiado pronto. Sin embargo, para generación abierta (chat, escritura creativa), el muestreo produce texto más diverso y natural que beam search.
Fundamentos
El campo de la IA enfocado en permitir que las máquinas interpreten y entiendan información visual del mundo — imágenes, video, escenas 3D y documentos. La visión por computadora potencia todo, desde reconocimiento facial y conducción autónoma hasta imágenes médicas y generación de imágenes con IA. Las tareas centrales incluyen detección de objetos, clasificación de imágenes, segmentación, OCR y estimación de pose.
Por qué importa: La visión por computadora fue la primera área donde el deep learning superó claramente el rendimiento humano (ImageNet 2012), y sigue siendo una de las aplicaciones de IA con mayor impacto comercial. Cada imagen o video generado por IA, cada documento que procesas con OCR, cada cámara de seguridad con detección inteligente — todo es visión por computadora.
Seguridad
Usar IA para detectar y filtrar contenido dañino, ilegal o que viola políticas a escala. Esto incluye clasificación de texto (discurso de odio, spam, amenazas), análisis de imágenes (detección NSFW, CSAM), y moderación de video. Los sistemas modernos combinan clasificadores de IA con revisión humana, pero el volumen de contenido generado por la propia IA está creando una crisis de moderación — ahora necesitas IA para moderar IA.
Por qué importa: Toda plataforma con contenido generado por usuarios necesita moderación, y la IA es la única forma de manejar la escala. Pero la moderación es más difícil de lo que parece — el contexto importa, las normas culturales difieren, y los falsos positivos silencian el discurso legítimo mientras los falsos negativos dejan pasar el daño.
Empresas
Startup de IA de voz construida sobre la arquitectura de state space model (SSM) en lugar de transformers. Sus modelos Sonic logran generación de voz con latencia ultra baja, haciendo que la IA conversacional en tiempo real se sienta genuinamente natural por primera vez.
Por qué importa: Cartesia importa porque demostraron que los state space models no son solo una curiosidad de investigación sino una arquitectura comercialmente viable para IA de voz en tiempo real. Su latencia por debajo de 100 milisegundos hace posible una IA conversacional genuinamente natural por primera vez, cerrando la brecha entre "hablar con un bot" y "hablar con una persona". A medida que la industria se mueve hacia agentes de IA orientados a la voz, la ventaja arquitectónica de Cartesia en velocidad de streaming podría convertirlos en la capa de infraestructura sobre la que todos los demás construyan.
Empresas
Empresa de IA enfocada en empresas, cofundada por Aidan Gomez, uno de los coautores del paper original del Transformer "Attention Is All You Need". Se especializa en modelos optimizados para casos de uso empresarial, RAG y soporte multilingüe.
Por qué importa: Cohere representa el caso de prueba más claro de si una empresa de IA enfocada y empresarial puede prosperar de forma independiente en una era dominada por hyperscalers de billones de dólares y laboratorios de frontera orientados al consumidor. Su linaje del paper del Transformer les da credibilidad técnica genuina, su flexibilidad de despliegue resuelve un dolor real para industrias reguladas, y sus modelos de embedding y rerank se han convertido en herramientas indispensables para sistemas RAG en producción en todo el mundo. Si el futuro de la IA se trata menos de chatbots y más de infraestructura tejida en cada flujo de trabajo empresarial, Cohere está posicionada para importar enormemente.
Usar AI
Una técnica de prompting donde le pides al modelo que muestre su razonamiento paso a paso antes de dar una respuesta final. En vez de saltar a una conclusión, el modelo "piensa en voz alta", lo que mejora dramáticamente la precisión en tareas complejas.
Por qué importa: Pedir "explica tu razonamiento" no es solo para transparencia — realmente hace a los modelos más inteligentes. CoT redujo los errores matemáticos hasta un 50% en estudios tempranos. La mayoría de los modelos modernos ahora hacen esto internamente.
Usar AI
La cantidad máxima de texto (medida en tokens) que un modelo puede procesar en una sola conversación. Esto incluye tanto tu entrada como la salida del modelo. Si un modelo tiene una ventana de contexto de 200K, eso es aproximadamente 150,000 palabras — alrededor de dos novelas.
Por qué importa: El tamaño de la ventana de contexto determina lo que puedes hacer. ¿Resumир todo un codebase? Necesita contexto grande. ¿Pregunta-respuesta rápida? Pequeño está bien. Pero más grande no siempre es mejor — los modelos pueden perder el foco en contextos muy largos.
Entrenamiento
El cuerpo de texto (u otros datos) usado para entrenar un modelo. Un corpus puede ir desde colecciones curadas de libros y papers hasta scrapes masivos de todo el internet. La calidad y composición del corpus moldea fundamentalmente lo que el modelo sabe y cómo se comporta.
Por qué importa: Basura entra, basura sale. Un modelo entrenado con Reddit habla diferente que uno entrenado con papers científicos. Por eso curamos nuestro propio corpus para Sarah — los web crawls genéricos producían resultados confusos e incoherentes.
Usar AI
Interfaz de software para interacción conversacional con IA. Los chatbots modernos (Claude, ChatGPT, Gemini) están potenciados por LLMs y manejan diálogo abierto, código, imágenes y herramientas.
Por qué importa: La forma principal en que la mayoría de la gente interactúa con IA. El chatbot es un producto construido sobre el modelo, no el modelo en sí.
Seguridad
Preguntas legales sin resolver: ¿Es entrenar con datos protegidos por derechos de autor uso justo? ¿Quién es dueño de la salida generada por IA? ¿Puede la salida infringir derechos si se parece a los datos de entrenamiento?
Por qué importa: Todos los modelos principales fueron entrenados con material protegido. Las demandas (NYT vs OpenAI, Getty vs Stability) remodelarán la economía de la IA.
Empresas
Editor de código nativo de IA (fork de VS Code). Integración profunda con LLMs: generación inline, edición de múltiples archivos, contexto del codebase completo.
Por qué importa: La apuesta de que la IA cambia fundamentalmente cómo se escribe código. Adopción rápida, ganancias de productividad tangibles.
Fundamentos
La tarea de asignar una entrada a una de un conjunto predefinido de categorías. "¿Este correo es spam o no?" (clasificación binaria). "¿Esta imagen es un gato, un perro o un pájaro?" (multi-clase). "¿Cuáles de estas etiquetas aplican a este artículo?" (multi-etiqueta). La clasificación es la tarea de aprendizaje supervisado más común y la base de incontables aplicaciones reales de IA.
Por qué importa: La clasificación es donde la mayoría de las personas se encuentran por primera vez con el machine learning en la práctica — filtros de spam, moderación de contenido, diagnóstico médico, detección de fraude, análisis de sentimiento. Entender la clasificación te ayuda a comprender toda la pipeline de aprendizaje supervisado: datos etiquetados entran, modelo entrenado, predicciones salen.
Modelos
Una arquitectura de red neuronal diseñada para procesar datos con estructura de cuadrícula (imágenes, espectrogramas de audio) deslizando pequeños filtros (kernels) sobre la entrada para detectar patrones locales como bordes, texturas y formas. Las CNNs dominaron la visión por computadora desde 2012 (AlexNet) hasta que los Vision Transformers surgieron alrededor de 2020. Siguen siendo ampliamente usadas en producción, especialmente en dispositivos edge.
Por qué importa: Las CNNs iniciaron la revolución del deep learning. La victoria de AlexNet en ImageNet en 2012 demostró que las redes neuronales profundas podían superar dramáticamente las características diseñadas a mano, desencadenando el boom actual de la IA. Entender las CNNs te ayuda a entender por qué los Transformers funcionan (muchas de las mismas ideas — características jerárquicas, compartición de parámetros — aplican), y las CNNs siguen siendo la mejor opción para muchas tareas de visión en dispositivos con recursos limitados.
Fundamentos
Un mecanismo que le dice a un modelo Transformer el orden de los tokens en una secuencia. A diferencia de los RNNs que procesan tokens secuencialmente (así que la posición es implícita), los Transformers procesan todos los tokens en paralelo y no tienen sentido inherente del orden. Las codificaciones posicionales inyectan información de posición para que el modelo sepa que "el perro muerde al hombre" y "el hombre muerde al perro" son diferentes.
Por qué importa: Sin información posicional, un Transformer trata una oración como una bolsa de palabras — el orden de las palabras se pierde. La elección de codificación posicional también determina qué tan bien un modelo maneja secuencias más largas que las vistas durante el entrenamiento, por lo que técnicas como RoPE y ALiBi son críticas para modelos de contexto largo.
Fundamentos
Cuando los datos de prueba de un benchmark aparecen en los datos de entrenamiento de un modelo, inflando sus puntuaciones sin reflejar capacidad genuina. Si un modelo "estudió la hoja de respuestas" al ver las preguntas de prueba durante el entrenamiento, su rendimiento en el benchmark no tiene sentido. La contaminación es un problema creciente a medida que los datasets de entrenamiento crecen y rastrean más de internet, donde los datos de benchmarks frecuentemente están publicados.
Por qué importa: La contaminación socava todo el sistema de benchmarks que la industria de IA usa para comparar modelos. Un modelo que obtiene 90% en MMLU porque memorizó las respuestas no es más inteligente que uno que obtiene 80% y nunca las vio. A medida que más benchmarks se filtran en los datos de entrenamiento, la comunidad se ve forzada a crear nuevos benchmarks constantemente, y las evaluaciones privadas retenidas se vuelven más importantes que las tablas de clasificación públicas.
Fundamentos
Una plataforma de crowdsourcing (de LMSYS) donde los usuarios chatean con dos modelos de IA anónimos lado a lado y votan cuál respuesta es mejor. Los resultados se usan para calcular ratings ELO — el mismo sistema de clasificación usado en ajedrez — creando una tabla de clasificación continuamente actualizada de calidad de modelos basada en preferencias humanas reales en lugar de benchmarks automatizados.
Por qué importa: Chatbot Arena es posiblemente la comparación de modelos más confiable hoy porque es resistente a la contaminación (las preguntas son nuevas), refleja preferencias reales de usuarios (no benchmarks sintéticos) y enfrenta modelos cara a cara (la comparación relativa es más fiable que las puntuaciones absolutas). Cuando la gente dice "Claude es mejor que GPT para programación" o viceversa, los rankings de Arena son frecuentemente la evidencia.
Empresas
Una empresa de chips que construye procesadores de IA a escala de oblea — chips del tamaño de toda una oblea de silicio, más de 100 veces más grandes que una GPU estándar. El Cerebras WSE-3 (Wafer Scale Engine) contiene 4 billones de transistores y 900,000 núcleos. Sus sistemas CS-3 están diseñados tanto para entrenamiento como para inferencia, ofreciendo una alternativa a clústers de miles de GPUs individuales.
Por qué importa: Cerebras representa el replanteamiento más radical del hardware de IA. En lugar de conectar miles de chips pequeños con ancho de banda limitado, ponen todo en un chip masivo con enorme ancho de banda de memoria en chip. La ventaja potencial es eliminar el cuello de botella de comunicación que limita el entrenamiento multi-GPU. Si la computación a escala de oblea puede competir con el enorme ecosistema de NVIDIA es la pregunta del billón de dólares.
Entrenamiento
La degradación que ocurre cuando los modelos de IA se entrenan con datos generados por modelos de IA anteriores, creando un bucle de retroalimentación donde los errores y sesgos se acumulan a lo largo de las generaciones. Cada generación pierde algo de diversidad y amplifica algunos artefactos de la anterior, produciendo eventualmente modelos que generan salidas repetitivas, genéricas o distorsionadas.
Por qué importa: El colapso de modelo es la bomba de tiempo de la era del contenido generado por IA. A medida que internet se llena de texto generado por IA (estimado en un 10–50% del nuevo contenido web), los futuros modelos entrenados con scrapes web inevitablemente ingerirán salidas de IA. Si esto no se gestiona cuidadosamente, la calidad de los modelos podría estancarse o degradarse. Por eso la curación de datos y el seguimiento de procedencia se están convirtiendo en infraestructura crítica.
Fundamentos
Un grupo de neuronas que procesa datos en un nivel específico de abstracción dentro de una red neuronal. La capa de entrada recibe datos sin procesar. Las capas ocultas (las intermedias) aprenden representaciones cada vez más abstractas. La capa de salida produce el resultado final. El aprendizaje "profundo" (deep learning) significa muchas capas ocultas — los LLMs modernos tienen de 32 a más de 128 capas.
Por qué importa: Las capas crean la jerarquía que hace poderoso al deep learning. Las capas tempranas aprenden patrones simples (bordes en imágenes, fragmentos de palabras en texto). Las capas intermedias combinan estos en conceptos (rostros, frases). Las capas profundas combinan conceptos en comprensión de alto nivel (reconocimiento de escenas, razonamiento). La profundidad de una red determina la complejidad de los patrones que puede aprender.
Fundamentos
Un patrón o concepto que una red neuronal aprende a detectar en su entrada. En visión, las características de las capas tempranas son bordes y texturas; las de las capas posteriores son partes de objetos y objetos completos. En modelos de lenguaje, las características van desde las simples (la letra "a", un patrón sintáctico específico) hasta las abstractas (el concepto de sarcasmo, una estrategia de razonamiento particular). Las características se representan como patrones de activación a lo largo de las neuronas.
Por qué importa: Las características son lo que los modelos realmente aprenden — no hechos individuales sino patrones que generalizan. Un modelo no memoriza "los gatos tienen pelo"; aprende un detector de características para texturas similares al pelo que se activa para gatos, perros y osos de peluche. Entender las características ayuda a explicar el comportamiento del modelo: por qué generaliza (las características se transfieren), por qué falla (se activó la característica incorrecta) y cómo mejorarlo (exponerlo a características más diversas).
Fundamentos
Usar cómputo adicional durante la inferencia (cuando el modelo está generando una respuesta) para mejorar la calidad de la respuesta. En lugar de generar una respuesta inmediatamente, el modelo "piensa" más tiempo — generando tokens de razonamiento, explorando múltiples enfoques o verificando su propia salida. Más cómputo en el momento de la inferencia produce mejores respuestas, especialmente para tareas de razonamiento complejo.
Por qué importa: El cómputo en tiempo de inferencia es el último paradigma de escalado. La primera era escaló el cómputo de entrenamiento (modelos más grandes, más datos). La era actual también escala el cómputo de inferencia (más razonamiento por pregunta). Modelos como o1 y Claude con pensamiento extendido muestran que dejar que un modelo razone 30 segundos a menudo supera a un modelo que responde en 2 segundos, incluso si el modelo rápido es técnicamente más grande. Esto cambia la economía: la calidad se convierte en una función de cuánto estás dispuesto a gastar por consulta.
Fundamentos
Una tarea de aprendizaje no supervisado que agrupa puntos de datos similares sin etiquetas predefinidas. Dados datos de compras de clientes, el clustering podría descubrir segmentos distintos de clientes (cazadores de ofertas, compradores de lujo, compradores ocasionales). K-means es el algoritmo más común: elige K clusters, asigna cada punto al centro de cluster más cercano y refina iterativamente los centros.
Por qué importa: El clustering es la tarea de aprendizaje no supervisado más común y aparece en todas partes: segmentación de clientes, agrupación de documentos, detección de anomalías (valores atípicos que no encajan en ningún cluster), compresión de imágenes (agrupar píxeles similares) y exploración de datos (¿qué grupos naturales existen en mis datos?). A menudo es el primer paso para entender un nuevo dataset.
Modelos
Un modelo de OpenAI (2021) que aprende a conectar imágenes y texto entrenándose con 400 millones de pares imagen-texto. CLIP codifica imágenes y texto en el mismo espacio de embeddings, donde los pares imagen-texto coincidentes están cerca y los no coincidentes están lejos. Es el puente entre lenguaje y visión en la mayoría de los sistemas de IA multimodal modernos.
Por qué importa: CLIP es la columna vertebral de la generación de texto a imagen (Stable Diffusion, DALL-E), la búsqueda de imágenes, la clasificación de imágenes zero-shot y la comprensión multimodal. Cuando escribes un prompt y obtienes una imagen, CLIP (o un descendiente) es lo que conecta tus palabras con conceptos visuales. Demostró que puedes aprender representaciones visuales potentes solo con supervisión de lenguaje natural, sin datasets de imágenes etiquetadas.
Modelos
Una arquitectura que agrega control espacial a los modelos de generación de imágenes. En lugar de solo describir lo que quieres en texto ("una persona de pie"), ControlNet te permite especificar cómo — proporcionando un mapa de bordes, mapa de profundidad, esqueleto de pose o mapa de segmentación que guía la composición. La imagen generada sigue la estructura espacial de tu entrada de control mientras llena los detalles a partir del prompt de texto.
Por qué importa: ControlNet hizo que la generación de imágenes con IA fuera utilizable para flujos de trabajo profesionales. Sin él, obtienes composiciones aleatorias y esperas lo mejor. Con él, especificas la pose, distribución o estructura exacta que necesitas. Esta es la diferencia entre "generar algo vagamente parecido a lo que quiero" y "generar exactamente esta composición con estos detalles" — algo crítico para diseño, publicidad y trabajo de producción.
Entrenamiento
Una instantánea guardada del estado de un modelo durante el entrenamiento — los pesos, el estado del optimizador, el programa de tasa de aprendizaje y el paso de entrenamiento. Los checkpoints permiten reanudar el entrenamiento después de interrupciones (fallas de hardware, desalojo), evaluar versiones intermedias del modelo y retroceder a una versión anterior si el entrenamiento se degrada. Guardar checkpoints cada pocos miles de pasos es práctica estándar.
Por qué importa: Entrenar modelos grandes toma de días a meses. Sin checkpoints, una falla de GPU en el paso 90,000 de un entrenamiento de 100,000 pasos significa empezar de nuevo. Los checkpoints son un seguro: guardan el progreso incrementalmente para que solo pierdas el trabajo desde el último checkpoint. También permiten la selección de modelos — a veces un checkpoint anterior tiene mejor rendimiento en tus métricas de evaluación que el final.
Fundamentos
Una conexión que evita una o más capas agregando la entrada directamente a la salida: output = layer(x) + x. En lugar de que cada capa aprenda una transformación completa, solo necesita aprender el "residual" — la diferencia respecto a la función identidad. Las conexiones residuales están en cada capa de Transformer y son esenciales para entrenar redes profundas.
Por qué importa: Sin conexiones residuales, las redes profundas son casi imposibles de entrenar — los gradientes se desvanecen o explotan a través de muchas capas. Las conexiones residuales proporcionan una autopista de gradientes que permite que la información (y los gradientes) fluyan directamente desde las capas tempranas hasta las tardías, saltándose cualquier cantidad de transformaciones intermedias. Son la razón por la que podemos entrenar redes de más de 100 capas.
Fundamentos
Un circuito específico de dos cabezas de atención descubierto en Transformers que implementa el aprendizaje en contexto mediante coincidencia de patrones. Si el modelo ha visto el patrón "A B" antes en el contexto y ahora ve "A" de nuevo, la cabeza de inducción predice que "B" seguirá. Este mecanismo simple se cree que es un bloque fundamental de cómo los LLMs aprenden de los ejemplos en su contexto.
Por qué importa: Las cabezas de inducción son el circuito mejor entendido en interpretabilidad mecanicista — un ejemplo concreto de cómo los Transformers implementan un algoritmo útil a partir de pesos aprendidos. Explican por qué funciona el prompting few-shot: cuando das ejemplos, las cabezas de inducción detectan el patrón y lo aplican. Entender las cabezas de inducción proporciona una base para comprender comportamientos aprendidos más complejos.
Fundamentos
Una tabla de búsqueda que mapea cada token del vocabulario a un vector denso (el embedding del token). Cuando el modelo recibe el ID de token 42, la capa de embedding devuelve la fila 42 de una matriz aprendida. Este vector es la representación inicial del modelo de ese token — el punto de partida para todo el procesamiento subsiguiente a través de las capas de atención y feedforward.
Por qué importa: La capa de embedding es donde el texto se convierte en matemáticas. Cada LLM comienza convirtiendo tokens discretos (palabras, subpalabras) en vectores continuos que la red neuronal puede procesar. La tabla de embedding es también uno de los componentes más grandes de los modelos pequeños — un vocabulario de 128K con embeddings de 4096 dimensiones son 512 millones de parámetros. Entender esto te ayuda a razonar sobre tamaños de modelo y diseño de vocabulario.
Fundamentos
Una operación matemática que desliza un filtro pequeño (kernel) a través de una entrada para detectar patrones locales. En imágenes, un kernel de 3×3 se desliza por cada posición, calculando un producto punto con los píxeles subyacentes para producir un mapa de características. Diferentes kernels detectan diferentes patrones: bordes horizontales, bordes verticales, texturas y eventualmente características complejas como ojos o ruedas en capas más profundas.
Por qué importa: La convolución es la operación que hizo funcionar la visión por computadora. Codifica dos suposiciones poderosas: localidad (los píxeles cercanos están relacionados) y equivarianza traslacional (un patrón es el mismo sin importar dónde aparezca). Estas suposiciones reducen dramáticamente el número de parámetros comparado con capas totalmente conectadas, haciendo factible procesar imágenes de alta resolución. Incluso en la era del Transformer, las convoluciones se usan en muchas arquitecturas híbridas.
Empresas
Una plataforma para crear y chatear con personajes de IA — personalidades ficticias, figuras históricas y personas personalizadas que mantienen personalidad, conocimiento y patrones de habla consistentes a través de conversaciones. Fundada por antiguos investigadores de Google Brain, Character.AI fue uno de los primeros productos de IA en lograr adopción masiva de consumidores, con millones de usuarios diarios, principalmente demografías más jóvenes.
Por qué importa: Character.AI demostró que la IA social/entretenimiento podía impulsar un engagement masivo — los usuarios pasan más tiempo en Character.AI que en muchas plataformas de redes sociales. Fue pionera en la categoría de "compañero de IA" y demostró que la consistencia de personalidad, el engagement emocional y la capacidad de role-play son tan comercialmente importantes como la precisión factual. Google invirtió $2.7B en la empresa en 2024.
Uso de IA
Crear una copia sintética de la voz de una persona específica a partir de una muestra de audio corta, permitiendo texto a voz que suena como esa persona. Los sistemas modernos (ElevenLabs, PlayHT, Resemble AI) pueden clonar una voz a partir de tan solo 15 segundos de audio con notable fidelidad, capturando tono, acento, estilo de habla y rango emocional.
Por qué importa: La clonación de voz permite aplicaciones poderosas de creatividad y accesibilidad: doblar películas con la propia voz del actor en diferentes idiomas, preservar las voces de personas que pierden su capacidad de hablar (pacientes con ELA), crear voces de marca consistentes y personalizar asistentes de IA. También crea riesgos serios: estafas telefónicas suplantando a familiares, audio falso de figuras públicas y replicación de voz sin consentimiento.
Entrenamiento
Un subconjunto de datos reservado del entrenamiento, usado para evaluar el rendimiento del modelo durante el desarrollo y ajustar hiperparámetros. La división en tres partes: el conjunto de entrenamiento entrena el modelo, el conjunto de validación guía las decisiones sobre el modelo (tasa de aprendizaje, arquitectura, cuándo detenerse) y el conjunto de prueba proporciona la estimación de rendimiento final e imparcial. El conjunto de validación es tu espejo durante el desarrollo.
Por qué importa: Sin un conjunto de validación, estás volando a ciegas. La pérdida de entrenamiento te dice qué tan bien el modelo se ajusta a los datos de entrenamiento, pero no qué tan bien generaliza. El conjunto de validación responde la pregunta que realmente importa: "¿cómo se desempeñará este modelo en datos que no ha visto?" Cada decisión durante el desarrollo del modelo — hiperparámetros, opciones de arquitectura, duración del entrenamiento — debería evaluarse en el conjunto de validación.
Empresas
Un proveedor de nube especializado construido completamente en torno a la computación GPU para cargas de trabajo de IA. CoreWeave opera grandes clusters de GPUs NVIDIA (H100, H200) y ha asegurado miles de millones en financiamiento y deuda para construir centros de datos GPU. Empresas importantes de IA (incluyendo Microsoft y varios laboratorios de IA) usan CoreWeave para entrenamiento e inferencia a escala.
Por qué importa: CoreWeave es una de las empresas de infraestructura de más rápido crecimiento en IA, apostando a que los proveedores de nube GPU especializados pueden superar a los hyperscalers de propósito general para cargas de trabajo de IA. Su enfoque permite una utilización de GPU más eficiente, redes diseñadas a propósito (InfiniBand para clusters de entrenamiento) y precios que son un 30–50% menores que AWS/GCP para trabajo intensivo en GPU.
Fundamentos
Un subconjunto del aprendizaje automático que utiliza redes neuronales con muchas capas (por eso "profundo") para aprender representaciones jerárquicas de los datos. Cada capa transforma su entrada en algo ligeramente más abstracto — de píxeles a bordes a formas a objetos a conceptos. El aprendizaje profundo es lo que hizo posible la revolución actual de la IA: es el enfoque detrás de los LLMs, generadores de imágenes, reconocimiento de voz y casi todos los avances en IA desde 2012.
Por qué importa: El aprendizaje profundo es el motor de la era actual de la inteligencia artificial. Antes de 2012, la inteligencia artificial era un ensamblaje de algoritmos especializados. El aprendizaje profundo unificó todo bajo un solo paradigma: apilar suficientes capas, alimentar con suficientes datos, dedicar suficiente potencia de cálculo y el modelo se encarga del resto. Entender el aprendizaje profundo es entender por qué de repente la inteligencia artificial funciona.
Herramientas
El ecosistema de bibliotecas, frameworks y plataformas que facilitan la construcción de aplicaciones potenciadas por IA. Esto incluye frameworks de orquestación (LangChain, LlamaIndex), servidores de inferencia (vLLM, llama.cpp), herramientas de fine-tuning (Axolotl, Unsloth), frameworks de evaluación (LMSYS, Braintrust) y plataformas full-stack (Vercel AI SDK, Hugging Face). El panorama de herramientas cambia mensualmente.
Por qué importa: Las APIs de modelos crudas son necesarias pero no suficientes. Las herramientas de desarrollo cierran la brecha entre "tengo una API key" y "tengo una aplicación en producción". Las herramientas correctas pueden reducir el tiempo de desarrollo de meses a días, mientras que las incorrectas añaden complejidad sin valor.
Seguridad
Imágenes, video o audio generados por IA diseñados para representar convincentemente a personas reales diciendo o haciendo cosas que nunca hicieron. Originalmente construidos con tecnología GAN, los deepfakes modernos usan modelos de difusión y clonación de voz para producir resultados que son cada vez más difíciles de distinguir de la realidad. Existen herramientas de detección pero consistentemente van detrás de las capacidades de generación.
Por qué importa: Los deepfakes son el lado oscuro del poder creativo de la IA generativa. Se han usado para fraude, imágenes íntimas no consentidas, manipulación política y robo de identidad. La tecnología es ahora lo suficientemente accesible como para que cualquiera con una laptop pueda crear falsificaciones convincentes, haciendo que la detección, las marcas de agua y los marcos legales sean prioridades urgentes.
Infraestructura
Instalaciones físicas que albergan los servidores, GPUs, equipos de red y sistemas de enfriamiento necesarios para entrenar y ejecutar modelos de IA. Los centros de datos modernos de IA están construidos a propósito para computación paralela masiva, consumiendo megavatios de energía y requiriendo enfriamiento especializado. Una sola corrida de entrenamiento de un modelo de frontera podría ocupar miles de GPUs a través de una instalación completa durante meses.
Por qué importa: Los centros de datos son las fábricas de la era de la IA. Cada consulta a Claude, cada imagen de Midjourney, cada video de Runway corre en hardware que está dentro de uno de estos edificios. La escasez global de capacidad de centros de datos listos para IA es una de las mayores restricciones al crecimiento de la IA — y una de las mayores oportunidades de inversión.
Empresas
Empresa alemana de IA ampliamente considerada como el mejor servicio de traducción automática del mundo. Construida por un equipo de lingüístas computacionales que consistentemente superan a Google Translate y otras ofertas de grandes tecnológicas, especialmente para idiomas europeos.
Por qué importa: DeepL es la prueba viviente de que una empresa de IA enfocada puede superar consistentemente a competidores de un billón de dólares en una capacidad central. En un campo donde más grande generalmente es mejor, la ventaja de calidad de traducción de DeepL sobre Google y Microsoft sigue siendo medible y significativa, especialmente para idiomas europeos y casos de uso profesional. Su éxito desafía la suposición de que los modelos de IA de propósito general inevitablemente commoditizarán las tareas especializadas — y para los cientos de miles de empresas que dependen de la comunicación precisa entre idiomas, esa especialización vale la pena pagarla.
Empresas
Empresa israelí de IA que empuja los límites de la generación de IA en tiempo real. Su tecnología puede generar entornos interactivos similares a juegos en tiempo real, difuminando la línea entre el renderizado tradicional y la generación por IA.
Por qué importa: Decart AI demostró algo que la mayoría de la gente asumía que estaba a años de distancia: una red neuronal generando un mundo 3D jugable e interactivo en tiempo real, sin ningún motor de juegos tradicional involucrado. Su demo de Oasis fue una prueba de concepto para la simulación de mundos nativa de IA, una tecnología con implicaciones mucho más allá de los juegos — desde conducción autónoma hasta robótica y computación espacial. Si los modelos del mundo en tiempo real se vuelven prácticos a calidad de producción, el trabajo temprano de Decart en optimización de inferencia y generación interactiva habrá sido fundacional.
Empresas
Laboratorio chino de IA que sacudió la industria a principios de 2025 con DeepSeek-R1, un modelo de razonamiento que rivalizaba con los laboratorios de frontera a una fracción del costo de entrenamiento. Respaldado por el fondo de cobertura cuantitativo High-Flyer.
Por qué importa: DeepSeek destruyó la suposición de que la IA de frontera requería presupuestos de frontera. Su enfoque de eficiencia primero — logrando rendimiento de clase GPT-4 y clase o1 a una fracción del costo de entrenamiento — forzó a toda la industria a repensar la narrativa de que escalar es todo lo que necesitas y reenfocarse en la innovación arquitectónica. El lanzamiento open-weights de R1 bajo licencia MIT democratizó el acceso a modelos de razonamiento de una manera que ningún laboratorio occidental había hecho. Y geopolíticamente, DeepSeek demostró que los controles de exportación por sí solos no pueden contener la capacidad de IA, una realización con implicaciones profundas para la política tecnológica, la inversión y el equilibrio global de poder en IA.
Empresas
Empresa de IA de voz que construye API rápidas y precisas de reconocimiento de voz y texto a voz. Sus modelos Nova compiten con y frecuentemente superan a Whisper de OpenAI en precisión mientras funcionan significativamente más rápido para aplicaciones en tiempo real.
Por qué importa: Deepgram demostró que una startup podía construir reconocimiento de voz desde cero usando deep learning de extremo a extremo y competir cara a cara con Google, Amazon y Microsoft en precisión mientras los superaba en velocidad. Su enfoque de API orientada al desarrollador trajo patrones de infraestructura moderna a la IA de voz, haciendo tan fácil agregar transcripción a una app como agregar pagos con Stripe. A medida que los agentes de IA conversacional se vuelven mainstream, Deepgram se está posicionando como la capa crítica de infraestructura de voz debajo — la plomería que hace que la IA de voz realmente funcione en producción.
Modelos
Un tipo de modelo generativo que crea imágenes (o video, audio) comenzando con ruido puro y eliminándolo gradualmente hasta que aparece una salida coherente. El modelo aprende a revertir el proceso de agregar ruido a datos reales. Stable Diffusion, DALL-E 3 y Midjourney usan variantes de este enfoque.
Por qué importa: Los modelos de difusión destronaron a las GAN como la técnica dominante de generación de imágenes alrededor de 2022. Producen salidas más diversas y controlables y son la columna vertebral de casi todas las herramientas de IA de imagen y video hoy.
Entrenamiento
Entrenar un modelo “estudiante” más pequeño para imitar a un modelo “maestro” más grande, aprendiendo de las distribuciones de probabilidad suaves del maestro en lugar de etiquetas duras. Las salidas suaves codifican relaciones entre categorías que las etiquetas duras no transmiten.
Por qué importa: La destilación hace accesible la IA poderosa. Una destilación de 70B a 7B puede capturar el 90% de la capacidad con el 10% del costo. Muchos modelos que se ejecutan localmente son destilados de modelos de frontera.
Entrenamiento
Una alternativa al RLHF para alineación. DPO optimiza directamente el modelo usando pares de respuestas preferidas/rechazadas, sin necesidad de un modelo de recompensa separado ni reinforcement learning. Más simple, más estable, menos cómputo.
Por qué importa: DPO democratizó la alineación. El pipeline multi-etapa de RLHF es delicado; DPO lo colapsa en un solo paso. Muchos modelos open-weight ahora usan variantes de DPO.
Fundamentos
Una colección estructurada de datos utilizada para entrenar, evaluar o probar un modelo de machine learning. Los datasets pueden ser etiquetados (cada ejemplo tiene una respuesta correcta conocida) o no etiquetados (datos crudos sin anotaciones). La calidad, tamaño, diversidad y representatividad de un dataset determinan fundamentalmente lo que un modelo puede aprender.
Por qué importa: Basura entra, basura sale. La arquitectura más elegante entrenada con un mal dataset producirá malos resultados. Por el contrario, un modelo simple entrenado con datos excelentes frecuentemente supera a un modelo complejo entrenado con ruido. La curación de datasets es posiblemente la parte más impactante y menos glamorosa del desarrollo de IA.
Entrenamiento
Una técnica de regularización que "apaga" aleatoriamente una fracción de neuronas durante cada paso de entrenamiento poniendo sus salidas en cero. Esto evita que la red dependa demasiado de cualquier neurona individual, forzándola a aprender representaciones distribuidas y robustas. En el momento de inferencia, todas las neuronas están activas pero escaladas proporcionalmente.
Por qué importa: Dropout es la defensa más simple y ampliamente usada contra el sobreajuste. Sin regularización, las redes neuronales grandes memorizan los datos de entrenamiento en lugar de aprender patrones generalizables. Dropout (y su primo weight decay) son la razón por la que los modelos pueden ser mucho más grandes que sus conjuntos de entrenamiento sin simplemente memorizar todo.
Modelos
Una arquitectura que reemplaza el backbone U-Net tradicionalmente usado en modelos de difusión con un Transformer. DiT aplica el mecanismo de atención a la generación de imágenes, habilitando el mismo comportamiento de escalado que hizo a los LLMs tan poderosos. Sora, Flux, Stable Diffusion 3 y la mayoría de los generadores de imágenes y video de vanguardia usan DiT o variantes.
Por qué importa: DiT unificó los mundos de la generación de lenguaje e imágenes bajo un solo paradigma arquitectónico: el Transformer. Esto significa que las leyes de escalado, técnicas de entrenamiento y estrategias de optimización desarrolladas para LLMs se transfieren en gran parte a la generación de imágenes y video. Es la razón por la que la calidad de imagen ha mejorado tan rápidamente — el campo está montado en la misma curva de escalado que el lenguaje.
Modelos
La familia de modelos de generación de imágenes de OpenAI. DALL-E 1 (2021) usó un enfoque de VAE discreto + Transformer. DALL-E 2 (2022) usó CLIP + diffusion. DALL-E 3 (2023) está integrado en ChatGPT y enfatiza el seguimiento de prompts — usa un LLM para reescribir los prompts del usuario en descripciones detalladas de imagen antes de la generación, mejorando significativamente la coincidencia entre lo que pides y lo que obtienes.
Por qué importa: DALL-E fue el modelo que hizo al público consciente de la generación de imágenes con IA. El lanzamiento de DALL-E 2 en 2022 se volvió viral y generó tanto entusiasmo como preocupación sobre las imágenes generadas por IA. La integración de DALL-E 3 con ChatGPT hizo la generación de imágenes accesible a cientos de millones de usuarios. Su innovación de reescritura de prompts influyó en cómo otros modelos manejan la conversión de texto a imagen.
Fundamentos
Un componente de red neuronal que genera salida a partir de una representación. En Transformers, el decoder usa attention causal (de izquierda a derecha) para generar tokens uno a la vez. En generación de imágenes, el VAE decoder convierte representaciones latentes de vuelta en imágenes. En autoencoders, el decoder reconstruye la entrada original desde el cuello de botella comprimido. Los decoders son la mitad de "generación" de muchas arquitecturas.
Por qué importa: Todo sistema de IA generativa tiene un decoder en su núcleo. GPT, Claude y Llama son Transformers solo-decoder. Stable Diffusion usa un VAE decoder para producir imágenes. Entender los decoders explica por qué la generación es secuencial (cada token depende de los tokens anteriores), por qué la salida es más lenta que el procesamiento de entrada, y por qué el paradigma autoregresivo domina la generación de texto.
Empresas
Una plataforma de datos e IA que proporciona capacidades unificadas de analítica, ingeniería de datos y machine learning. Databricks adquirió Mosaic ML (2023) para agregar capacidades de entrenamiento de LLMs y lanzó DBRX, su propio LLM de pesos abiertos. La plataforma está construida sobre Apache Spark y proporciona infraestructura gestionada para el ciclo de vida completo de ML desde preparación de datos hasta servicio de modelos.
Por qué importa: Databricks es donde los datos empresariales se encuentran con la IA. La mayoría de las ambiciones de IA de las empresas comienzan con "necesitamos darle sentido a nuestros datos," y Databricks a menudo es la plataforma que maneja ingeniería de datos, ingeniería de features, entrenamiento de modelos y servicio en un solo lugar. Su adquisición de Mosaic ML (conocido por entrenamiento eficiente de LLMs) señaló que la plataforma de datos y la plataforma de IA están convergiendo.
Uso de IA
Identificar y localizar objetos en imágenes o video dibujando bounding boxes alrededor de ellos y clasificando lo que contiene cada caja. "Hay un auto en la posición (x1,y1,x2,y2) y una persona en (x3,y3,x4,y4)." A diferencia de la clasificación de imágenes (que dice qué hay en la imagen), la detección de objetos dice qué hay en la imagen y dónde — permitiendo contar, rastrear y razonar espacialmente.
Por qué importa: La detección de objetos es la tecnología detrás de los autos autónomos (detectar peatones, vehículos, señales), las cámaras de seguridad (detección de personas), analítica retail (contar compradores), control de calidad en manufactura (detectar defectos) y realidad aumentada (colocar objetos virtuales relativos a los reales). Es una de las capacidades de visión por computadora más desplegadas comercialmente.
Uso de IA
Identificar automáticamente en qué idioma está escrito un texto. "Bonjour le monde" → Francés. "こんにちは世界" → Japonés. Los modelos modernos pueden distinguir más de 100 idiomas con solo unas pocas palabras, manejar texto en varios idiomas (cambio de código) e identificar idiomas estrechamente relacionados (noruego vs. danés, malayo vs. indonesio).
Por qué importa: La detección de idioma es el primer paso esencial en cualquier pipeline multilingüe: necesitas saber en qué idioma está la entrada antes de poder traducirla, enrutarla al modelo correcto o aplicar procesamiento específico del idioma. Se usa en motores de búsqueda, enrutamiento de soporte al cliente, moderación de contenido y todo sistema que maneja texto de usuarios de todo el mundo.
Infraestructura
Monitorear cambios en la distribución de datos o el comportamiento del modelo a lo largo del tiempo que podrían degradar el rendimiento. Deriva de datos: los datos de entrada cambian (la demografía de clientes cambia, aparecen nuevas categorías de productos). Deriva de concepto: la relación entre entradas y salidas correctas cambia (lo que constituye spam evoluciona). Deriva de modelo: las predicciones del modelo gradualmente se vuelven menos precisas aunque el modelo en sí no ha cambiado.
Por qué importa: Los modelos se entrenan con datos históricos, pero el mundo sigue cambiando. Un modelo de detección de fraude entrenado en 2024 no detectará los nuevos patrones de fraude de 2025. Un sistema de recomendaciones entrenado con comportamiento pre-pandemia dará sugerencias pobres post-pandemia. La detección de deriva captura estas degradaciones antes de que se vuelvan costosas — alertándote de que el modelo necesita reentrenamiento o actualización.
Uso de IA
Determinar quién habló cuándo en una grabación de audio con múltiples hablantes. Dada una grabación de reunión, la diarización la segmenta en "Hablante A: 0:00–0:15, Hablante B: 0:15–0:32, Hablante A: 0:32–0:45." Combinada con reconocimiento de voz, esto produce transcripciones atribuidas al hablante — esencial para minutas de reuniones, transcripción de entrevistas y analítica de centros de llamadas.
Por qué importa: El reconocimiento de voz solo produce un bloque de texto sin indicación de quién dijo qué. La diarización agrega la estructura que hace las transcripciones útiles: puedes buscar lo que una persona específica dijo, resumir las contribuciones de cada hablante y analizar la dinámica conversacional (quién habla más, quién interrumpe). Es esencial para cualquier aplicación de audio con múltiples hablantes.
Fundamentos
Capacidades que aparecen en modelos de IA a gran escala pero que no se entrenaron explícitamente para ello — habilidades que parecen "emergir" de repente una vez que un modelo alcanza un cierto tamaño o umbral de entrenamiento. Un modelo entrenado exclusivamente para predecir la siguiente palabra de alguna manera aprende a hacer aritmética, traducir entre idiomas en los que no fue enseñado, o escribir código funcional. La emergencia es uno de los fenómenos más debatidos en IA: ¿es magia real de transición de fase, o un artefacto de medición?
Por qué importa: La emergencia es el corazón de la mayor pregunta en IA: ¿podemos predecir qué podrán hacer los modelos más grandes? Si las capacidades emergen realmente de manera impredecible a gran escala, entonces cada modelo más grande es una caja de sorpresas. Si la emergencia es un artefacto de cómo medimos, entonces el escalamiento es más predecible de lo que parece. La respuesta define todo, desde la planificación de seguridad hasta las decisiones de inversión.
Entrenamiento
Los métodos usados para medir qué tan bien funciona un modelo de IA. Esto va mucho más allá de benchmarks — incluye evaluación humana (personas calificando salidas), A/B testing (comparando modelos con tráfico real), red teaming (pruebas adversariales), pruebas específicas de dominio (precisión médica, corrección de código) y leaderboards comunitarios (Chatbot Arena, LMSYS). Una buena evaluación es más difícil que construir el modelo.
Por qué importa: Si no puedes medirlo, no puedes mejorarlo. Pero la evaluación de IA es singularmente difícil porque las tareas son abiertas y la calidad es subjetiva. Los benchmarks se manipulan, la evaluación humana es costosa, y el modelo que puntúa más alto en papel frecuentemente no es el mejor en la práctica. Construir buenas evaluaciones es un superpoder.
Empresas
Empresa de IA de voz que hizo accesible para todos la síntesis de voz ultra realista. Su tecnología impulsa la clonación de voz, el doblaje en tiempo real y texto a voz en 32 idiomas, difuminando la línea entre voces humanas e IA.
Por qué importa: ElevenLabs demostró que el habla generada por IA podía cruzar el valle inquietante y sonar genuinamente humana, colapsando el costo y el tiempo de la producción profesional de voz en órdenes de magnitud. Sus herramientas de clonación de voz y doblaje multilingüe han hecho posible que un creador individual produzca contenido en 30+ idiomas sin contratar un solo actor de voz, remodelando fundamentalmente la economía de la localización de audio y video. También forzaron a toda la industria a confrontar la ética de la tecnología de voz sintética de frente, impulsando la adopción de marcas de agua, estándares de procedencia de contenido y protocolos de verificación que ahora se están convirtiendo en norma.
Entrenamiento
Una forma de representar texto (o imágenes, o audio) como una lista de números (un vector) que captura su significado. Los conceptos similares terminan cerca en este espacio numérico — "gato" y "gatito" están cerca, mientras que "gato" y "economía" están lejos.
Por qué importa: Los embeddings son la base de la búsqueda semántica y RAG. Son cómo la IA entiende que una búsqueda de "arreglar bug de login" debería coincidir con un documento sobre "resolución de error de autenticación" aunque ninguna palabra coincida.
Infraestructura
Una URL específica donde una API de IA acepta solicitudes. Por ejemplo, el endpoint de mensajes de Anthropic es donde envías prompts a Claude. Diferentes endpoints sirven diferentes funciones: generación de texto, embeddings, creación de imágenes, listado de modelos.
Por qué importa: Al integrar proveedores de IA, los endpoints son donde la goma toca el camino. Cada proveedor estructura los suyos de manera diferente, que es por lo que existen plataformas como Zubnet — para normalizar el desorden.
Infraestructura
Ejecutar IA en dispositivos del usuario final (teléfonos, laptops, autos) en lugar de la nube. Privado, latencia cero, funciona sin conexión.
Por qué importa: La intersección de privacidad + latencia + costo. Un modelo de 3B en tu teléfono muchas veces supera a uno de 400B en un centro de datos para las tareas correctas.
Modelos
Arquitectura con un encoder (que comprime la entrada) y un decoder (que genera la salida). T5/BART son encoder-decoder. GPT/Claude son decoder-only. BERT es encoder-only.
Por qué importa: Explica por qué diferentes modelos destacan en diferentes tareas y por qué decoder-only ganó para los LLMs.
Seguridad
El estudio de las cuestiones morales planteadas por el desarrollo y despliegue de la IA: ¿Qué sesgos perpetrán los sistemas de IA? ¿Quién resulta perjudicado cuando la IA comete errores? ¿Cómo deben explicarse las decisiones de la IA? ¿Quién es responsable cuando un sistema autónomo causa daños? La ética de la IA abarca equidad, transparencia, responsabilidad, privacidad y el impacto social de los sistemas de IA.
Por qué importa: Los sistemas de IA toman decisiones que afectan la contratación, los préstamos, la justicia penal, la salud y la moderación de contenido para miles de millones de personas. Estas decisiones codifican valores — de quién son los datos incluidos, qué resultados se optimizaron, a quién se consultó. La ética de la IA no es un ejercicio filosófico abstracto; es la pregunta práctica de si los sistemas de IA hacen el mundo más justo o menos.
Infraestructura
Técnicas que permiten a los modelos de lenguaje manejar secuencias más largas que las vistas durante el entrenamiento. Un modelo entrenado con 4K tokens puede extenderse a 32K o 128K mediante modificaciones a su codificación posicional (típicamente RoPE) combinadas con un breve ajuste fino en secuencias más largas. Esto evita el costo enorme de entrenar desde cero en secuencias largas.
Por qué importa: La extensión de longitud de contexto es la razón por la que los modelos han pasado de 4K a 128K a más de 1M de tokens de ventana de contexto en solo dos años. El costo de entrenar un modelo desde cero con secuencias de un millón de tokens sería prohibitivo. Las técnicas de extensión hacen prácticos los modelos de contexto largo adaptando modelos entrenados con secuencias más cortas, requiriendo solo una fracción del cómputo de entrenamiento original.
Entrenamiento
Entrenar redes neuronales usando formatos numéricos de menor precisión (16 bits en lugar de 32 bits) para la mayoría de los cálculos, manteniendo las operaciones críticas en precisión completa. Esto duplica la capacidad de memoria efectiva y la velocidad de cálculo de las GPUs con un impacto mínimo en la calidad del modelo. BF16 (bfloat16) es el estándar para el entrenamiento de LLMs; FP16 se usa para la inferencia.
Por qué importa: La precisión mixta es la razón por la que podemos entrenar modelos tan grandes como los actuales. Un modelo de 70B parámetros en FP32 necesitaría 280 GB solo para los pesos — imposible en cualquier GPU individual. En BF16, necesita 140 GB, lo que cabe en unas pocas GPUs. La precisión mixta efectivamente duplicó la capacidad de cómputo de la industria de IA gratis, solo usando un formato numérico más inteligente.
Infraestructura
Entrenar un modelo a través de múltiples GPUs o máquinas simultáneamente. El paralelismo de datos da a cada GPU una copia del modelo y divide los datos de entrenamiento. El paralelismo de modelo divide el modelo mismo entre GPUs cuando es demasiado grande para una sola. Los enfoques modernos como FSDP (Fully Sharded Data Parallel) y DeepSpeed combinan ambos, permitiendo el entrenamiento de modelos con cientos de miles de millones de parámetros.
Por qué importa: Ningún modelo de frontera cabe en una sola GPU. Entrenar GPT-4 o Claude requiere miles de GPUs trabajando juntas durante meses. El entrenamiento distribuido es la ingeniería que hace esto posible — es tan crítico como la arquitectura o los datos. La eficiencia de tu entrenamiento distribuido determina directamente cuánto modelo puedes entrenar para un presupuesto dado.
Fundamentos
Evaluar la calidad de la salida de IA haciendo que humanos la juzguen directamente. Los humanos evalúan la fluidez, precisión, utilidad, seguridad y si la salida realmente cumple con la solicitud. A pesar de ser costosa y lenta, la evaluación humana sigue siendo el estándar de oro porque las métricas automatizadas a menudo pasan por alto lo que realmente importa a los usuarios.
Por qué importa: Cada métrica automatizada es un proxy del juicio humano, y cada proxy tiene puntos ciegos. BLEU no puede detectar errores factuales. La perplejidad no puede medir la utilidad. Incluso los enfoques de LLM-como-juez heredan sesgos (prefiriendo respuestas verbosas, por ejemplo). Cuando hay mucho en juego — lanzar un producto, comparar versiones de modelos, evaluar seguridad — la evaluación humana es irremplazable.
Entrenamiento
Técnicas para modificar hechos específicos en un modelo entrenado sin reentrenarlo. Si un modelo declara incorrectamente "El presidente de Francia es Macron" después de una nueva elección, la edición de conocimiento puede actualizar este hecho específico modificando pesos objetivos, sin afectar el otro conocimiento o las capacidades del modelo. El objetivo es precisión quirúrgica: cambiar un hecho, dejar todo lo demás intacto.
Por qué importa: La edición de conocimiento aborda un problema práctico: los modelos se desactualizan y el reentrenamiento es caro. Si pudieras actualizar hechos específicos de manera económica, los modelos podrían mantenerse actualizados entre grandes ciclos de entrenamiento. También tiene implicaciones de seguridad: ¿se podría eliminar conocimiento peligroso? El campo es prometedor pero inmaduro — las ediciones a menudo tienen efectos secundarios no deseados en el conocimiento relacionado.
Entrenamiento
Detener el entrenamiento cuando el rendimiento en un conjunto de validación reservado deja de mejorar, en lugar de entrenar por un número fijo de pasos. A medida que el entrenamiento continúa, la pérdida de entrenamiento sigue disminuyendo pero la pérdida de validación eventualmente comienza a aumentar — el modelo está sobreajustando a los datos de entrenamiento. La parada temprana captura este punto de inflexión y guarda el mejor modelo antes de que la calidad se degrade.
Por qué importa: La parada temprana es la técnica de regularización más simple y efectiva para el ajuste fino. Sin ella, corres el riesgo de entrenar demasiado tiempo y destruir las capacidades que querías preservar. Con ella, el modelo se detiene automáticamente en su mejor punto. El parámetro "patience" (cuántas evaluaciones sin mejora antes de detenerse) es uno de los hiperparámetros más importantes en el ajuste fino.
Fundamentos
Un componente de red neuronal que convierte datos de entrada en una representación comprimida y rica en información (codificación). En Transformers, el encoder usa attention bidireccional para procesar la entrada completa y producir representaciones contextuales. En autoencoders, el encoder comprime la entrada en un cuello de botella latente. En generación de imágenes, el VAE encoder convierte imágenes al espacio latente. Los encoders son la mitad de "comprensión" de muchas arquitecturas.
Por qué importa: Los encoders están en todas partes: BERT es un encoder, CLIP tiene un text encoder y un image encoder, Stable Diffusion tiene un VAE encoder, los sistemas RAG usan modelos encoder para embeddings. Entender qué hace un encoder — comprime la entrada en una representación útil — te ayuda a entender todos estos sistemas. La calidad de la codificación determina la calidad de todo lo que viene después.
Uso de IA
Un parámetro que controla qué tan fuertemente un modelo de generación de imágenes sigue el prompt de texto. Guidance bajo (1–3): el modelo genera libremente, produciendo imágenes diversas pero potencialmente fuera de tema. Guidance alto (7–15): el modelo sigue estrictamente el prompt pero puede producir imágenes saturadas y con artefactos. El punto ideal típico es 7–9. Es el equivalente en generación de imágenes de la temperatura para modelos de texto.
Por qué importa: La escala de guidance es el parámetro más impactante en generación de imágenes después del prompt mismo. Muy bajo y la imagen ignora tu descripción. Muy alto y se ve sobresaturada y artificial. Entender la escala de guidance te ayuda a resolver "¿por qué mi imagen no coincide con mi prompt?" (guidance muy bajo) y "¿por qué mi imagen se ve rara?" (guidance muy alto).
Uso de IA
Extraer automáticamente información estructurada de texto no estructurado. Dado un artículo de noticias, extraer: quién hizo qué, cuándo, dónde y por qué. Dado un contrato, extraer: partes, fechas, obligaciones y montos. IE combina NER (encontrar entidades), extracción de relaciones (encontrar conexiones entre entidades) y extracción de eventos (encontrar qué sucedió) en un pipeline unificado.
Por qué importa: La mayor parte de la información del mundo está atrapada en texto no estructurado — correos electrónicos, informes, artículos, documentos legales, registros médicos. La extracción de información convierte este texto en datos estructurados que pueden ser buscados, analizados y utilizados. Es la tecnología que te permite hacer una pregunta tipo base de datos sobre una pila de documentos.
Uso de IA
Detectar la posición y orientación del cuerpo humano (o animal, mano, rostro) en una imagen o video localizando puntos anatómicos clave — articulaciones, puntos de referencia faciales, puntas de los dedos. La salida es un esqueleto: un conjunto de keypoints conectados que representan la pose del cuerpo. OpenPose, MediaPipe y YOLO-Pose son implementaciones populares.
Por qué importa: La estimación de pose permite: apps de fitness que analizan la forma del ejercicio, reconocimiento de lengua de señas, captura de movimiento para animación, interfaces de control por gestos, analítica deportiva y detección de caídas para el cuidado de personas mayores. En la generación de imágenes con IA, los esqueletos de pose sirven como entradas de ControlNet — especificas la pose exacta del cuerpo que quieres y el modelo genera una persona en esa pose.
Entrenamiento
Tomar un modelo pre-entrenado y entrenarlo más a fondo con un dataset más pequeño y específico para especializar su comportamiento. Como tomar a un médico general y meterlo en una residencia de cirugía — misma base de conocimiento, nueva especialidad.
Por qué importa: El fine-tuning es como los modelos genéricos se vuelven útiles para tareas específicas. Un modelo con fine-tuning puede aprender el tono de tu empresa, la terminología de tu dominio o un formato de salida específico sin empezar de cero.
Fundamentos
Un modelo grande entrenado con datos amplios que sirve como base para muchas tareas diferentes. Claude, GPT, Gemini y Llama son todos foundation models. Son “fundacionales” porque pueden adaptarse a casi cualquier cosa — escritura, programación, análisis, comprensión de imágenes — sin haber sido entrenados específicamente para cada tarea.
Por qué importa: Los foundation models cambiaron la economía de la IA. En lugar de entrenar un modelo separado para cada tarea, entrenas un modelo masivo una vez y luego le haces fine-tuning o lo guías con prompts para necesidades específicas.
Usar AI
Proporcionar pares de ejemplo entrada-salida en tu prompt. Zero-shot = sin ejemplos, few-shot = 2–10 ejemplos. El modelo aprende el patrón sin necesidad de entrenamiento.
Por qué importa: La forma más rápida y barata de personalizar el comportamiento. Una de las capacidades emergentes más sorprendentes que surgen con la escala.
Modelos
Técnica generativa que aprende caminos suaves y directos de ruido a datos. Menos pasos que la difusión para calidad comparable.
Por qué importa: Está reemplazando a la difusión para generación de imágenes y video de vanguardia. Flux y SD3 lo usan. Menos pasos = más rápido = más barato.
Fundamentos
Una función matemática aplicada a la salida de una neurona que introduce no-linealidad en la red. Sin funciones de activación, una red neuronal — sin importar cuántas capas de profundidad — solo podría aprender relaciones lineales. ReLU, GELU y SiLU/Swish son las más comunes en las arquitecturas modernas.
Por qué importa: Las funciones de activación son la razón por la que el deep learning funciona. Una pila de transformaciones lineales es solo una gran transformación lineal. Las funciones de activación entre capas permiten que la red aprenda patrones complejos y no lineales — las curvas, bordes y relaciones sutiles que hacen poderosas a las redes neuronales.
Infraestructura
Una implementación del mecanismo de atención optimizada para GPU que es 2–4x más rápida y usa significativamente menos memoria que la atención estándar. Flash Attention logra esto no cambiando lo que la atención calcula, sino reestructurando cómo se realiza el cálculo en el hardware de la GPU — minimizando las transferencias lentas de memoria entre la HBM y la SRAM on-chip de la GPU.
Por qué importa: Flash Attention es posiblemente la optimización de sistemas más impactante en la IA moderna. Hizo prácticos los modelos de contexto largo al reducir el uso de memoria de la atención de cuadrático a casi lineal (en la práctica), habilitando directamente el salto de 4K a 128K+ tokens de ventana de contexto. Todos los LLM principales lo usan. Sin Flash Attention, los modelos de contexto largo actuales serían prohibitivamente caros.
Fundamentos
La fecha después de la cual un modelo no tiene datos de entrenamiento, lo que significa que carece de conocimiento sobre eventos, descubrimientos o cambios que ocurrieron después de esa fecha. Si la fecha de corte de un modelo es abril de 2024, no sabe nada de lo que pasó en mayo de 2024 o después — nuevos productos, noticias, papers científicos o hechos actualizados.
Por qué importa: La fecha de corte del conocimiento es la fuente más común de frustración con los asistentes de IA. "¿Por qué no sabe sobre X?" Porque X ocurrió después del entrenamiento. Esta limitación impulsa la adopción de RAG (dar al modelo acceso a información actual) y el uso de herramientas (permitir al modelo buscar en la web). Entender la fecha de corte te ayuda a saber cuándo confiar en el modelo y cuándo verificar.
Usar AI
Un patrón de diseño donde los agentes de IA orquestan procesos de múltiples pasos — planificando, ejecutando herramientas, evaluando resultados e iterando — para completar tareas complejas. A diferencia de un intercambio simple de prompt-respuesta, los flujos agénticos involucran bucles: el agente actúa, observa el resultado, decide qué hacer a continuación y continúa hasta que la tarea se complete o necesite intervención humana.
Por qué importa: Los flujos de trabajo agénticos son cómo la IA pasa de "responder preguntas" a "hacer trabajo". Un chatbot responde una pregunta a la vez. Un flujo agéntico investiga un tema, escribe un borrador, lo revisa en busca de precisión y lo corrige — todo de forma autónoma. Este patrón está emergiendo en generación de código (Cursor, Claude Code), investigación (Perplexity, Deep Research) y automatización empresarial.
Seguridad
Un documento estandarizado que describe el uso previsto de un modelo de machine learning, sus características de rendimiento, datos de entrenamiento, limitaciones y consideraciones éticas. Introducidas por Mitchell et al. (2019), las fichas de modelo buscan aumentar la transparencia y ayudar a los usuarios a tomar decisiones informadas sobre si un modelo es apropiado para su caso de uso.
Por qué importa: Las fichas de modelo son las etiquetas nutricionales de la IA. Sin ellas, estás usando un modelo a ciegas — no sabes con qué datos fue entrenado, en qué funciona bien y mal, o qué grupos podría perjudicar. A medida que la regulación de IA aumenta (la Ley de IA de la UE requiere documentación), las fichas de modelo están pasando de ser una buena práctica a un requisito legal.
Fundamentos
Floating Point Operations — la medida estándar del trabajo computacional en IA. Entrenar un modelo requiere un cierto número de FLOPs (operaciones totales). El hardware se evalúa en FLOP/s (operaciones por segundo). Una GPU H100 puede realizar ~2,000 TFLOP/s (2 cuatrillones de operaciones por segundo) en FP16. Se estima que el entrenamiento de GPT-4 fue ~10^25 FLOPs — un número tan grande que es difícil de comprender.
Por qué importa: Los FLOPs son la moneda del cómputo en IA. Las leyes de escala se expresan en FLOPs. Los presupuestos de entrenamiento se miden en FLOPs. Las comparaciones de GPU usan FLOP/s. Entender los FLOPs te ayuda a estimar costos de entrenamiento, comparar hardware y entender por qué el progreso de la IA está tan estrechamente vinculado al escalado del cómputo. Cuando la gente dice "escalar el cómputo", se refiere a gastar más FLOPs.
Entrenamiento
Combinar los pesos de múltiples modelos ajustados en un solo modelo sin entrenamiento adicional. Si el modelo A es excelente en programación y el modelo B es excelente en escritura creativa, fusionarlos puede producir un modelo que es bueno en ambos. Los métodos populares de fusión incluyen SLERP (interpolación esférica), TIES (resolver conflictos de signo) y DARE (descartar parámetros aleatoriamente antes de fusionar).
Por qué importa: La fusión de modelos es el arma secreta de la comunidad open source. No cuesta nada de cómputo (solo matemáticas sobre tensores de pesos) y puede producir modelos que superan a sus componentes. Muchos de los mejores modelos en el Open LLM Leaderboard son fusiones. También es cómo los practicantes combinan múltiples fine-tunes de LoRA en un solo modelo versátil. Entender la fusión desbloquea una capacidad potente y gratuita para cualquiera que trabaje con modelos abiertos.
Seguridad
Identificar o verificar a una persona a partir de su rostro en una imagen o video. La verificación pregunta "¿es esta persona quien dice ser?" (matching 1:1, usado en desbloqueo de teléfono). La identificación pregunta "¿quién es esta persona?" (matching 1:N contra una base de datos, usado en vigilancia). Los sistemas modernos usan deep learning para extraer face embeddings y compararlos, alcanzando precisión sobrehumana bajo condiciones controladas.
Por qué importa: El reconocimiento facial es una de las aplicaciones de IA más poderosas y más controvertidas. Permite autenticación conveniente (Face ID), ayuda a encontrar personas desaparecidas y asiste a las fuerzas del orden. También permite vigilancia masiva, plantea serias preocupaciones de privacidad y tiene disparidades de precisión documentadas entre demografías — funciona peor en mujeres y personas con tonos de piel más oscuros. Es un caso de libro de texto de tecnología de uso dual.
Fundamentos
Sistemas de IA que crean contenido nuevo — texto, imágenes, audio, video, código, modelos 3D — en lugar de solo analizar o clasificar datos existentes. La IA generativa es el término general para todo, desde que ChatGPT escribe ensayos hasta que Stable Diffusion crea imágenes hasta que Suno compone música. La parte "generativa" distingue estos modelos de la IA anterior que solo podía categorizar, predecir o recomendar.
Por qué importa: La inteligencia artificial generativa es el término que introdujo la IA en la cultura general. Es lo que la gente quiere decir cuando habla de "IA" en 2024-2026 — la capacidad de crear, no solo de procesar. Entenderla como una categoría te ayuda a navegar el paisaje: los LLMs generan texto, los modelos de difusión generan imágenes, y los límites entre modalidades se están desdibujando rápidamente.
Empresas
La división unificada de investigación en IA de Google, formada al fusionar DeepMind y Google Brain en 2023. Detrás de Gemini, AlphaGo, AlphaFold y gran parte de la investigación fundacional que impulsa la IA moderna.
Por qué importa: Google DeepMind ha contribuido más investigación fundacional a la IA moderna que cualquier otra organización — la arquitectura del transformer, trabajo revolucionario en reinforcement learning, predicción de estructura de proteínas y leyes de escalamiento se remontan todos a equipos de DeepMind o Google Brain. Sus modelos Gemini son los únicos LLMs de frontera con distribución verdaderamente global incorporada, llegando a miles de millones de usuarios a través de Search, Android y Google Workspace. Y solo AlphaFold — que resolvió un problema de cincuenta años en biología y ganó un Premio Nobel — sería suficiente para asegurar su lugar en la historia de la ciencia, no solo en la historia de la IA.
Modelos
Una arquitectura de modelo donde dos redes neuronales compiten: un generador crea datos falsos y un discriminador intenta distinguir lo real de lo falso. A través de este juego adversarial, el generador mejora en la creación de resultados realistas. Dominó la generación de imágenes de 2014 a ~2022.
Por qué importa: Las GANs fueron pioneras en la generación realista de imágenes con IA y todavía se usan en algunas aplicaciones en tiempo real. Pero los modelos de difusión las han reemplazado en gran medida para trabajo donde la calidad es crítica, porque las GANs son más difíciles de entrenar y menos diversas en sus resultados.
Infraestructura
Originalmente diseñadas para renderizar gráficos, las GPUs resultaron ser perfectas para la IA porque pueden realizar miles de operaciones matemáticas simultáneamente. Entrenar y ejecutar modelos de IA es esencialmente multiplicación masiva de matrices — exactamente para lo que las GPUs están hechas. NVIDIA domina este mercado.
Por qué importa: Las GPUs son el cuello de botella físico de toda la industria de IA. Por qué los modelos cuestan lo que cuestan, por qué algunos proveedores son más rápidos que otros, por qué hay escasez global de chips — todo se reduce a la oferta de GPUs y la VRAM.
Usar AI
Conectar las respuestas de un modelo a fuentes factuales y verificables en lugar de dejarlo depender únicamente de sus datos de entrenamiento. Las técnicas de grounding incluyen RAG, integración de búsqueda web y requerimientos de citación. Una respuesta con grounding dice “según [fuente]” en lugar de simplemente afirmar hechos.
Por qué importa: El grounding es la defensa principal contra la alucinación. Un modelo sin grounding inventa hechos con confianza. Uno con grounding te señala fuentes reales que puedes verificar.
Seguridad
Mecanismos de seguridad que impiden que los modelos de IA generen contenido dañino, inapropiado o fuera de tema. Los guardrails pueden incorporarse al modelo durante el entrenamiento (RLHF), aplicarse mediante system prompts o ser impuestos por filtros externos que verifican las respuestas antes de que lleguen a los usuarios.
Por qué importa: Sin guardrails, los modelos ayudarán felizmente con solicitudes peligrosas. El desafío es la calibración — demasiado estrictos y el modelo se vuelve inútil (“No puedo ayudar con eso”), demasiado laxos y se vuelve inseguro.
Entrenamiento
Ajusta iterativamente los parámetros para reducir la pérdida computando gradientes y dando pasos cuesta abajo. La retropropagación calcula eficientemente los gradientes a través de las capas.
Por qué importa: Cada modelo fue entrenado con descenso de gradiente. Explica la importancia de la tasa de aprendizaje, la divergencia del entrenamiento y por qué Adam funciona.
Empresas
Chips de inferencia de IA personalizados (LPUs). Diseñados específicamente para la generación secuencial de tokens. 500–800 tok/s, a menudo 10x más rápido que las GPUs.
Por qué importa: Demostró que la inferencia no tiene que ser lenta. Un enfoque de hardware contra la optimización de software.
Infraestructura
El formato de archivo estándar para ejecutar modelos de lenguaje cuantizados localmente vía llama.cpp, Ollama y otras herramientas de inferencia local. Los archivos GGUF contienen los pesos del modelo en un formato cuantizado (reduciendo la precisión de 16 bits a 4 u 8 bits), junto con metadatos como vocabulario, detalles de arquitectura y parámetros de cuantización — todo lo necesario para cargar y ejecutar el modelo en un solo archivo.
Por qué importa: GGUF es el formato que hizo práctica la IA local. Antes, ejecutar modelos localmente requería configuraciones complejas con PyTorch, CUDA y memoria GPU específica. GGUF empaqueta todo en un archivo que llama.cpp u Ollama pueden cargar directamente — en CPU, en Apple Silicon, en GPUs de gaming, en cualquier lugar. Si ves un modelo en Hugging Face con nombres de archivo como "Q4_K_M.gguf", ese es un modelo listo para uso local.
Fundamentos
Crear imágenes a partir de descripciones de texto usando modelos de IA. Escribes "un atardecer sobre montañas en estilo acuarela" y el modelo genera una imagen que coincide. Los enfoques actuales incluyen modelos de difusión (Stable Diffusion, DALL-E), flow matching (Flux) y modelos autoregresivos. El campo ha progresado de caras borrosas en 2020 a salidas fotorrealistas y artísticamente controladas en 2025.
Por qué importa: La generación de imágenes es la capacidad de IA para consumidores más visible después de los chatbots. Está transformando el diseño gráfico, la publicidad, el arte conceptual y la comunicación visual. Entender los enfoques subyacentes (difusión, flow matching, DiT) y sus compromisos te ayuda a elegir la herramienta correcta y entender las limitaciones — por qué algunos prompts funcionan y otros no, por qué ciertos estilos son más fáciles que otros.
Fundamentos
Crear video a partir de descripciones de texto, imágenes u otros videos usando modelos de IA. Sora (OpenAI), Kling (Kuaishou), Runway Gen-3, Vidu y otros generan videos a partir de prompts como "una toma de dron volando sobre un arrecife de coral". La tecnología extiende la generación de imágenes a la dimensión temporal, añadiendo el desafío de mantener la consistencia entre fotogramas y generar movimiento realista.
Por qué importa: La generación de video es la frontera de la IA generativa — la modalidad más difícil y la de mayor potencial comercial. Está comenzando a transformar la producción cinematográfica, la publicidad, las redes sociales y la educación. La brecha de calidad entre la IA y el video profesional se está cerrando rápidamente, con modelos actuales produciendo clips de 5–15 segundos que a veces son indistinguibles de metraje real.
Fundamentos
Una representación estructurada del conocimiento como una red de entidades (nodos) conectadas por relaciones (aristas). "París (entidad) es la capital de (relación) Francia (entidad)". Los grafos de conocimiento codifican hechos de una manera que soporta razonamiento, consultas y descubrimiento. El Knowledge Graph de Google, Wikidata y los grafos de conocimiento empresariales impulsan la búsqueda, las recomendaciones y la integración de datos.
Por qué importa: Los grafos de conocimiento complementan a los LLMs proporcionando hechos estructurados y verificables que los LLMs pueden consultar en lugar de alucinar. Mientras los LLMs almacenan conocimiento implícitamente en pesos (y a veces se equivocan), los grafos de conocimiento lo almacenan explícitamente en tripletas que pueden verificarse y actualizarse. La combinación de LLMs (para entender lenguaje natural) y KGs (para anclar en hechos) es un patrón poderoso para IA empresarial.
Modelos
Redes neuronales diseñadas para operar sobre datos estructurados como grafos — datos donde las entidades están conectadas por relaciones (redes sociales, moléculas, grafos de conocimiento, redes de transporte). Las GNN aprenden pasando mensajes entre nodos conectados, permitiendo que cada nodo actualice su representación basándose en sus vecinos. Manejan datos que no encajan ordenadamente en cuadrículas (imágenes) o secuencias (texto).
Por qué importa: No todos los datos son texto o imágenes. Las redes sociales, las estructuras moleculares, los sistemas de recomendación, las redes de detección de fraude y las rutas logísticas son todos datos naturalmente estructurados como grafos. Las GNN son la herramienta correcta cuando las relaciones entre entidades son tan importantes como las entidades mismas. El descubrimiento de fármacos, el análisis de redes sociales y la predicción de tráfico dependen de las GNN.
Fundamentos
Una variante de atención donde múltiples cabezas de query comparten una sola cabeza key-value, reduciendo el tamaño del KV cache sin reducir significativamente la calidad. En lugar de que cada cabeza de query tenga sus propias proyecciones K y V (MHA estándar), grupos de cabezas de query comparten proyecciones K y V. Llama 2 70B, Mistral, Gemma y la mayoría de los LLMs modernos usan GQA.
Por qué importa: GQA es la solución práctica al problema de memoria del KV cache. La atención multi-cabeza estándar con 64 cabezas necesita 64 conjuntos de tensores K y V por capa en el cache. GQA con 8 cabezas KV reduce esto a 8 conjuntos — una reducción de memoria de 8x. Esto se traduce directamente en servir más usuarios concurrentes o manejar contextos más largos en el mismo hardware.
Entrenamiento
Una técnica de ahorro de memoria que intercambia cómputo por memoria durante el entrenamiento. En lugar de almacenar todas las activaciones intermedias del pase forward (necesarias para la retropropagación), gradient checkpointing solo almacena activaciones en ciertas capas "checkpoint" y recalcula las demás durante el pase backward. Esto reduce el uso de memoria hasta 5–10x a cambio de ~30% más de cómputo.
Por qué importa: Gradient checkpointing es lo que hace posible ajustar modelos grandes con memoria GPU limitada. Sin él, un modelo de 7B podría necesitar más de 80 GB solo para activaciones durante el entrenamiento, excediendo la capacidad de una sola GPU. Con gradient checkpointing, el mismo modelo se puede ajustar en una GPU de consumo de 24GB. Es la optimización de memoria más comúnmente usada para entrenamiento.
Uso de IA
Crear música a partir de descripciones de texto, melodías u otras entradas de audio usando modelos de IA. "Una pista electrónica animada con una melodía de sintetizador pegajosa, 120 BPM" produce una composición musical completa. Suno, Udio, MusicLM (Google) y Stable Audio son modelos líderes. Los sistemas actuales generan voces, instrumentales y arreglos completos en diversos estilos y géneros.
Por qué importa: La generación de música es el equivalente de audio de la generación de imágenes — está haciendo la creación musical accesible para todos, no solo para músicos entrenados. Los creadores de contenido necesitan música de fondo, los desarrolladores de juegos necesitan bandas sonoras, los anunciantes necesitan jingles. La música con IA satisface estas necesidades a una fracción del costo y tiempo de contratar músicos. Pero también plantea las mismas preguntas de derechos de autor y autenticidad que la generación de imágenes.
Entrenamiento
Ajustes que elige antes de que comience el entrenamiento y que controlan cómo el modelo aprende — a diferencia de los parámetros, que el modelo aprende por sí mismo. Los hiperparámetros incluyen tasa de aprendizaje (cuán grande es cada paso de actualización), tamaño del lote (cuántos ejemplos procesar a la vez), número de épocas (cuántas veces pasar por los datos), elección del optimizador (Adam, SGD, AdamW), decaimiento de peso, tasa de dropout y decisiones de arquitectura como número de capas y dimensiones ocultas. Ajustar correctamente los hiperparámetros suele ser la diferencia entre un modelo que converge hermosamente y otro que se aleja hacia el sinsentido.
Por qué importa: La sintonización de hiperparámetros es donde la ingeniería de ML se vuelve parte ciencia, parte arte. Puedes tener el conjunto de datos perfecto y la arquitectura, pero una tasa de aprendizaje demasiado alta hará que el entrenamiento falle y una que sea demasiado baja nunca convergerá. Entender los hiperparámetros es esencial para cualquiera que esté entrenando o afinando modelos — y saber cuáles son los más importantes ahorra una cantidad enorme de recursos computacionales.
Empresas
Plataforma de video con IA especializada en avatares realistas de tipo talking-head y doblaje automático con sincronización labial. Utilizada por empresas para marketing, capacitación y localización — convirtiendo un video en docenas de idiomas con movimientos labiales coincidentes.
Por qué importa: HeyGen transformó los avatares de video con IA de una curiosidad de investigación a una herramienta empresarial genuina, demostrando que hay ingresos reales en hacer que la creación de contenido de video sea tan fácil como escribir un documento. Su tecnología de doblaje con sincronización labial tiene particular importancia para negocios globales — reduce dramáticamente el costo y tiempo de localización de video de semanas y miles de dólares a minutos y centavos. Como una de las pocas empresas de video con IA con ingresos recurrentes sustanciales, HeyGen también sirve como caso de estudio sobre cómo construir un negocio real con IA generativa, no solo una demo.
Empresas
Empresa emergente de generación de imágenes que construye modelos de difusión de alta calidad. Sus lanzamientos open-weights han ganado tracción en la comunidad creativa de IA por su fuerte adherencia a los prompts y calidad visual.
Por qué importa: HiDream demostró que un equipo pequeño y enfocado puede producir modelos de imágenes open-weights que compiten con los resultados de organizaciones que gastan órdenes de magnitud más en infraestructura de entrenamiento. La fortaleza de sus modelos en renderizado de texto y precisión compositiva abordó puntos de dolor reales que frenaban la adopción comercial de imágenes generadas por IA. En el espacio rápidamente comoditizado de modelos de imagen abiertos, el éxito de HiDream refuerza el patrón de que el próximo salto en calidad puede venir de cualquier parte — no solo de los laboratorios más grandes con más GPUs.
Empresas
Empresa de IA que construye modelos que entienden y expresan emociones humanas. Su Empathic Voice Interface detecta tono, sentimiento y contexto emocional en tiempo real, permitiendo conversaciones de IA que responden no solo a lo que dices sino a cómo lo dices.
Por qué importa: Hume importa porque están abordando el punto ciego más evidente de la IA moderna: la comprensión emocional. Cada chatbot, asistente de voz y agente de IA hoy es esencialmente sordo al tono, respondiendo al contenido literal de las palabras mientras ignora el contexto emocional del que los humanos dependen instintivamente. La Empathic Voice Interface de Hume es el primer intento serio de cerrar esa brecha a escala de producción, y su insistencia en lineamientos éticos para IA emocional establece un estándar que la industria eventualmente se verá obligada a adoptar.
Usar AI
Cuando un modelo de IA genera información que suena confiada y plausible pero es factualmente incorrecta o completamente fabricada. El modelo no está “mintiendo” — está haciendo coincidencia de patrones para llegar a texto fluido sin un concepto de verdad. Citas falsas, estadísticas inventadas y métodos de API inexistentes son ejemplos comunes.
Por qué importa: La alucinación es el mayor problema de confianza en la IA actual. Es por eso que siempre debes verificar los hechos críticos de las respuestas de IA, y por qué existen técnicas como RAG y grounding.
Empresas
El hub central de la IA open-source. 500K+ modelos, 100K+ datasets, librería Transformers, Spaces. El GitHub de la IA.
Por qué importa: Si usas modelos open-weight, usas HF. La librería Transformers es el estándar de facto.
Empresas
Empresa de generación de imágenes con IA fundada por exinvestigadores de Google Brain. Se hicieron un nombre al resolver uno de los problemas más difíciles en generación de imágenes: renderizar texto legible y preciso dentro de las imágenes.
Por qué importa: Ideogram demostró que resolver una sola debilidad crítica — texto legible en imágenes generadas por IA — podía crear una posición de mercado distinta en el saturado espacio de generación de imágenes. Su evolución de especialistas en renderizado de texto a una plataforma de diseño completa muestra cómo la diferenciación técnica, cuando apunta a puntos de dolor reales del flujo de trabajo, puede competir con rivales mejor financiados.
Infraestructura
El proceso de ejecutar un modelo entrenado para generar resultados. El entrenamiento es aprender; la inferencia es usar lo aprendido. Cada vez que envías un prompt a Claude o generas una imagen con Stable Diffusion, eso es inferencia. Es lo que les cuesta horas de GPU a los proveedores y lo que tú pagas por token.
Por qué importa: El costo y la velocidad de la inferencia determinan la economía de los productos de IA. Inferencia más rápida = menor latencia = mejor experiencia de usuario. Inferencia más barata = precios más bajos = adopción más amplia. Toda la industria de cuantización y optimización existe para hacer la inferencia más eficiente.
Fundamentos
El amplio campo de construir máquinas capaces de realizar tareas que normalmente requieren inteligencia humana — comprender lenguaje, reconocer imágenes, tomar decisiones, resolver problemas. La IA abarca desde sistemas estrechos que destacan en una tarea específica (filtros de spam, motores de ajedrez) hasta el objetivo aspiracional de una inteligencia general capaz de manejar cualquier tarea intelectual que un humano pueda.
Por qué importa: La IA es el paraguas que cubre todo lo demás en este wiki — machine learning, deep learning, LLMs, visión por computadora, robótica. Entender que "IA" es un espectro desde sistemas simples basados en reglas hasta modelos de lenguaje de frontera te ayuda a evaluar afirmaciones, cortar el hype y comprender lo que los sistemas actuales realmente son: detectores de patrones extraordinariamente capaces, no máquinas pensantes.
Seguridad
Una técnica de alineación desarrollada por Anthropic donde un modelo se entrena para seguir un conjunto de principios (una "constitución") en lugar de depender únicamente del feedback humano para cada decisión. El modelo critica y revisa sus propias salidas basado en estos principios, luego se entrena con las salidas revisadas. Esto reduce la necesidad de etiquetadores humanos y hace que los criterios de alineación sean explícitos y auditables.
Por qué importa: La IA Constitucional aborda dos problemas del RLHF: es costosa (etiquetadores humanos para cada ejemplo de entrenamiento) y opaca (los criterios están implícitos en los juicios de los etiquetadores). Al hacer los principios explícitos, la CAI hace la alineación más transparente, escalable y consistente. Es una parte central de cómo se entrena a Claude.
Entrenamiento
Ajustar un modelo de lenguaje preentrenado con un dataset de pares (instrucción, respuesta) para enseñarle a seguir instrucciones. Un modelo base que solo predice texto se convierte en un modelo que responde preguntas, sigue indicaciones y se comporta como un asistente. Este es el paso que convierte GPT en ChatGPT, o un Llama base en Llama-Chat.
Por qué importa: El instruction tuning es el puente entre un modelo de lenguaje crudo (que solo puede completar texto) y un asistente útil (que puede seguir instrucciones). Sin él, incluso el modelo base más capaz simplemente genera texto que suena plausible en lugar de hacer realmente lo que le pides. Es posiblemente el paso de post-entrenamiento más importante.
Fundamentos
Un período de reducción de financiamiento, interés y progreso en la investigación de IA que sigue a un ciclo de hype y expectativas no cumplidas. Ha habido dos grandes inviernos de la IA: el primero de mediados de los 1970s a principios de los 1980s (después de que los sistemas expertos fallaron en escalar), y el segundo de finales de los 1980s a mediados de los 1990s (después de que las redes neuronales alcanzaron límites computacionales). Cada uno fue precedido por optimismo desmedido y seguido por desilusión.
Por qué importa: Entender los inviernos de la IA proporciona contexto esencial para evaluar las afirmaciones actuales sobre IA. El patrón — avance, hype, promesas excesivas, incumplimiento, colapso de financiamiento — se ha repetido dos veces. Si el boom actual del deep learning seguirá el mismo patrón o lo romperá es la pregunta más importante en IA. La mejor defensa contra otro invierno es una evaluación honesta de lo que los sistemas actuales pueden y no pueden hacer.
Uso de IA
Clasificar cada píxel de una imagen en una categoría. La segmentación semántica etiqueta píxeles por clase (carretera, acera, edificio, cielo). La segmentación de instancias distingue objetos individuales (persona 1, persona 2). La segmentación panóptica hace ambas cosas. SAM (Segment Anything Model) de Meta puede segmentar cualquier objeto con un clic o prompt de texto, sin entrenamiento específico para la tarea.
Por qué importa: La segmentación proporciona la comprensión más precisa del contenido de una imagen. Los autos autónomos necesitan límites de carretera a nivel de píxel, no solo bounding boxes. Las imágenes médicas necesitan límites exactos de tumores. La edición de fotos necesita máscaras precisas de objetos para eliminación de fondo. La capacidad de SAM para segmentar cualquier objeto sin entrenamiento hizo que esta capacidad previamente especializada fuera accesible para todos.
Uso de IA
Rellenar una región seleccionada de una imagen con contenido generado por IA que coincida con el contexto circundante. Enmascara un área (pintando sobre ella), describe lo que debería reemplazarla, y el modelo genera nuevo contenido que se integra perfectamente con la imagen existente. Outpainting extiende una imagen más allá de sus bordes originales. Ambos usan el mismo proceso de diffusion subyacente, condicionado en las regiones no enmascaradas.
Por qué importa: Inpainting es la herramienta de edición de imágenes más práctica que la IA proporciona. Eliminar objetos no deseados, reemplazar fondos, corregir defectos, agregar elementos o modificar partes específicas de una imagen manteniendo todo lo demás intacto. Es el equivalente de IA del relleno según contenido de Photoshop, pero guiado por lenguaje natural y dramáticamente más capaz.
Entrenamiento
Cómo se establecen los pesos de una red neuronal antes de que comience el entrenamiento. Una mala inicialización puede hacer que el entrenamiento falle antes de empezar (activaciones que se desvanecen o explotan). Una buena inicialización asegura que las activaciones y gradientes mantengan magnitudes razonables a través de las capas. La inicialización Xavier (para tanh/sigmoid) y la inicialización Kaiming/He (para ReLU) son los estándares, cada una calibrada para la función de activación.
Por qué importa: La inicialización parece un detalle menor pero es crítica para entrenar redes profundas. Una red con pesos iniciales aleatorios (demasiado grandes) produce activaciones que explotan. Una con pesos demasiado pequeños produce activaciones que se desvanecen. La inicialización adecuada coloca la red en una "zona ideal" donde las señales fluyen sin explotar o desvanecerse — un prerrequisito para que el descenso de gradiente funcione en absoluto.
Uso de IA
Generar una nueva imagen basada en una imagen existente más un prompt de texto. En lugar de partir de ruido puro (text-to-image), el proceso de difusión comienza desde una versión ruidosa de la imagen de entrada, preservando su estructura mientras la modifica según el prompt. "Una versión cyberpunk de esta foto" mantiene la composición pero transforma el estilo y los detalles.
Por qué importa: Image-to-image es el puente entre la fotografía y el arte con IA. Te permite usar bocetos, fotos o arte existente como punto de partida, manteniendo el diseño y la composición mientras la IA transforma el estilo, agrega detalles o reimagina el contenido. Es más controlable que text-to-image porque estás guiando el resultado con estructura visual, no solo con palabras.
Empresas
Empresa de IA con sede en Berlín especializada en búsqueda y embeddings. Sus modelos jina-embeddings y su Reader API (que convierte cualquier URL en texto listo para LLMs) se han convertido en infraestructura esencial para pipelines de RAG en todo el mundo.
Por qué importa: Jina AI construyó la infraestructura de embeddings y retrieval de la que dependen miles de sistemas RAG, demostrando que herramientas de búsqueda enfocadas pueden ser más valiosas que intentar hacer de todo. Sus modelos de embeddings de contexto largo y su Reader API resuelven dos de los problemas prácticos más difíciles en búsqueda impulsada por IA — representar documentos largos fielmente y extraer texto limpio de páginas web desordenadas — y lo hicieron manteniendo los modelos centrales como open source. En un ecosistema dominado por laboratorios generalistas, Jina demuestra que hay un negocio real en hacer una sola cosa excepcionalmente bien y hacerla fácil de usar para los desarrolladores.
Seguridad
Técnicas que engañan a un modelo de IA para eludir su entrenamiento de seguridad y generar contenido que fue diseñado para rechazar — instrucciones para actividades peligrosas, contenido dañino o comportamientos que violan las políticas de uso del modelo. Los jailbreaks explotan la brecha entre lo que el modelo fue entrenado para rechazar y lo que un prompting inteligente puede provocar.
Por qué importa: El jailbreaking es el campo de pruebas adversarial de la seguridad en IA. Cada modelo se lanza con barandillas de seguridad, y cada modelo importante ha sido vulnerado. El juego del gato y el ratón entre técnicas de jailbreak y medidas de seguridad impulsa la mejora en la alineación. Entender los jailbreaks te ayuda a evaluar cuán robusta es realmente la seguridad de un modelo, en vez de aceptar las afirmaciones de marketing sin más.
Empresas
Plataforma de video con IA de Kuaishou (la segunda plataforma de videos cortos más grande de China). Ganó rápida atención internacional por producir algunos de los videos generados por IA con mayor coherencia física y consistencia temporal.
Por qué importa: Kling AI demostró que los laboratorios de IA chinos podían igualar a los competidores occidentales en la frontera de la generación de video, produciendo resultados con coherencia física y consistencia temporal que establecieron un nuevo estándar en el campo. Respaldado por la plataforma de miles de millones de videos diarios de Kuaishou y ofrecido a precios agresivos a nivel global, Kling se ha convertido en un motor principal de competencia en el espacio de video con IA, empujando la calidad hacia arriba y los precios hacia abajo para todo el mercado.
Infraestructura
Almacena los tensores de atención key/value previamente computados para que no necesiten recalcularse para cada nuevo token. Intercambia memoria por velocidad.
Por qué importa: La KV cache es la razón por la que la inferencia de LLMs está limitada por la memoria. Un contexto de 100K en un modelo de 70B puede necesitar ~256 GB de caché — más que los propios pesos del modelo. Esta es la restricción fundamental para la inferencia de contexto largo.
Empresas
Plataforma australiana de imágenes con IA que se hizo un nicho entre Midjourney y Stable Diffusion. Popular entre desarrolladores de videojuegos y artistas digitales por sus modelos afinados, su canvas en tiempo real y su enfoque en assets creativos listos para produccion.
Por qué importa: Leonardo.ai demostró que la generación de imágenes con IA podía empaquetarse como una plataforma creativa profesional, no solo como una caja de prompts novedosa, y que hacerlo podía atraer decenas de millones de usuarios. Su enfoque en flujos de trabajo para desarrollo de videojuegos y arte digital abrió casos de uso que herramientas más amplias como Midjourney y DALL-E no estaban diseñadas específicamente para cubrir. La adquisición por Canva validó toda la categoría de generación de imágenes con IA como un activo estratégico para grandes plataformas de diseño, sentando el modelo de cómo las herramientas de IA independientes son absorbidas por ecosistemas creativos más grandes.
Empresas
Spinout del MIT que explora arquitecturas de redes neuronales fundamentalmente diferentes, inspiradas en circuitos neuronales biológicos. Sus Liquid Foundation Models usan dinámicas de tiempo continuo en lugar de transformers de pesos fijos, prometiendo mejor eficiencia y adaptabilidad.
Por qué importa: Liquid AI representa el desafío financiado más serio a la suposición de que los transformers son la única arquitectura que importa. Al construir modelos fundacionales de grado producción sobre dinámicas de tiempo continuo inspiradas en la biología, están probando si la apuesta total de la industria de IA por los mecanismos de atención fue prematura. Incluso si los LFMs no destronan a los transformers directamente, sus ventajas de eficiencia para despliegue en el edge y procesamiento de secuencias largas podrían abrir nichos críticos en robótica, IA móvil y sistemas embebidos — mercados donde ejecutar un transformer de 70B simplemente no es una opción.
Empresas
Empresa de IA enfocada en generación de video y 3D. Su Dream Machine fue uno de los primeros generadores de video con IA accesibles y de alta calidad, y Ray2 impulsó significativamente la calidad y coherencia del video.
Por qué importa: Luma AI democratizó la generación de video con IA de la misma forma en que Stable Diffusion democratizó las imágenes — haciéndola gratuita, rápida y accesible para cualquiera con un navegador. Su evolución de startup de captura 3D a líder en generación de video, combinada con una profundidad técnica única en comprensión espacial, los posiciona como una de las pocas empresas que podría genuinamente cerrar la brecha entre video con IA, contenido 3D y los formatos de medios inmersivos que vienen después.
Infraestructura
El retraso entre enviar una solicitud y obtener la primera respuesta. En IA, esto se mide frecuentemente como Time to First Token (TTFT) — cuánto tarda el modelo en empezar a transmitir su respuesta. Se ve afectado por el tamaño del modelo, la carga del servidor, la distancia de red y la longitud del prompt.
Por qué importa: Los usuarios perciben cualquier cosa por encima de ~2 segundos como lento. La baja latencia es la razón por la que modelos más pequeños a menudo ganan para aplicaciones en tiempo real, incluso cuando modelos más grandes son "más inteligentes". Es un diferenciador clave entre proveedores.
Fundamentos
Una red neuronal entrenada con cantidades masivas de texto para comprender y generar lenguaje humano. "Grande" se refiere al número de parámetros (miles de millones) y al tamaño de los datos de entrenamiento (billones de tokens). Claude, GPT, Gemini, Llama y Mistral son todos LLMs.
Por qué importa: Los LLMs son la tecnología detrás de cada chat de IA, asistente de código y generador de texto que usas. Entender lo que son (coincidencias de patrones estadísticos, no seres sintientes) te ayuda a usarlos de forma efectiva y reconocer sus límites.
Entrenamiento
Una técnica que hace que el fine-tuning sea dramáticamente más barato al entrenar sólo una pequeña cantidad de parámetros adicionales en lugar de modificar el modelo entero. Los "adaptadores" LoRA son complementos livianos (a menudo sólo megabytes) que modifican el comportamiento de un modelo sin reentrenar sus miles de millones de parámetros.
Por qué importa: LoRA democratizó el fine-tuning. Antes de él, personalizar un modelo de 7B requería recursos serios de GPU. Ahora puedes hacer fine-tuning en una sola GPU de consumo en horas y compartir el diminuto archivo de adaptador. Es la razón por la que hay miles de modelos especializados en HuggingFace.
Entrenamiento
Mide cuán equivocadas están las predicciones. Para LLMs: pérdida de entropía cruzada = cuán sorprendido está el modelo por el token real que viene a continuación. El entrenamiento minimiza esta métrica.
Por qué importa: La brújula del entrenamiento. Entender la pérdida ayuda a interpretar curvas de entrenamiento y diagnosticar problemas.
Usar IA
Una forma estructurada para que los modelos de IA soliciten la ejecución de funciones externas durante una conversación. Tú defines funciones con nombres, descripciones y esquemas de parámetros. Cuando el modelo determina que una función ayudaría a responder una consulta, produce una llamada de función estructurada (con argumentos) en lugar de texto. Tu código ejecuta la función y devuelve el resultado para que el modelo lo incorpore.
Por qué importa: La llamada de funciones es lo que convierte a un chatbot en un agente. Sin ella, un modelo solo puede generar texto. Con ella, un modelo puede buscar en bases de datos, llamar APIs, ejecutar cálculos, reservar citas, enviar correos — cualquier cosa que puedas exponer como una función. Es el mecanismo detrás de cada asistente de IA que realmente hace cosas en lugar de solo hablar de ellas.
Herramientas
Una biblioteca de código abierto en C/C++ para ejecutar inferencia de LLM en hardware de consumo, creada por Georgi Gerganov. llama.cpp realiza inferencia cuantizada sin requerir CUDA, PyTorch o Python — funciona en CPUs, Apple Silicon y GPUs de consumo. Fue la primera herramienta que hizo accesible la ejecución de grandes modelos de lenguaje localmente para desarrolladores y entusiastas comunes.
Por qué importa: llama.cpp inició la revolución de la IA local. Antes, ejecutar un modelo de lenguaje requería GPUs NVIDIA costosas y configuraciones complejas de Python. llama.cpp demostró que los modelos cuantizados podían ejecutarse en un MacBook o incluso una Raspberry Pi con calidad aceptable. Generó todo un ecosistema (Ollama, LM Studio, kobold.cpp) e hizo que la "IA autoalojada" fuera una opción real.
Herramientas
Un framework popular de código abierto para construir aplicaciones con modelos de lenguaje. LangChain proporciona abstracciones para patrones comunes: conectar LLMs a fuentes de datos (RAG), construir cadenas de múltiples pasos de llamadas al LLM, gestionar memoria de conversación, usar herramientas y orquestar agentes. Soporta múltiples proveedores (Anthropic, OpenAI, modelos locales) a través de una interfaz unificada.
Por qué importa: LangChain es el framework de aplicaciones LLM más ampliamente usado, lo que significa que lo encontrarás en tutoriales, descripciones de trabajo y bases de código existentes. También es controversial — los críticos argumentan que añade abstracción innecesaria sobre llamadas simples a la API. Entender qué hace LangChain (y cuándo usarlo vs. llamadas directas a la API) te ayuda a tomar decisiones arquitectónicas informadas.
Fundamentos
Las puntuaciones crudas y no normalizadas que un modelo produce antes de ser convertidas en probabilidades por la función softmax. Para un modelo de lenguaje, los logits son un vector con un valor por cada token en el vocabulario — valores más altos indican tokens que el modelo considera más probables. Los logits son la salida más informativa que un modelo produce, conteniendo más información que la distribución de probabilidad final.
Por qué importa: Entender los logits te ayuda a comprender cómo "piensan" los modelos. La temperatura, top-p y top-k sampling operan todos sobre logits. La guía sin clasificador en la generación de imágenes manipula logits. El logit bias (añadir offsets a tokens específicos) te permite dirigir el comportamiento del modelo. Si estás construyendo aplicaciones de IA más allá del chat básico, eventualmente necesitarás trabajar con logits directamente.
Modelos
Un tipo de red neuronal recurrente (RNN) diseñado para aprender dependencias de largo alcance en datos secuenciales. LSTM introduce un "estado de celda" — una autopista de memoria que puede transportar información sin cambios a lo largo de muchos pasos temporales — controlada por tres compuertas: una compuerta de entrada (qué agregar), una compuerta de olvido (qué eliminar) y una compuerta de salida (qué exponer). Inventado en 1997, LSTM dominó el modelado de secuencias hasta que emergieron los Transformers.
Por qué importa: LSTM fue la columna vertebral del NLP durante una década (2010s): traducción automática, reconocimiento de voz, generación de texto y análisis de sentimiento, todos funcionaban con LSTMs. Entender LSTM te ayuda a comprender por qué los Transformers lo reemplazaron (paralelismo y atención de largo alcance vs. procesamiento secuencial y estado comprimido) y por qué los SSMs como Mamba son interesantes (revisitan la idea de estado con compuertas con mejoras modernas).
Empresas
Un proveedor de nube GPU enfocado específicamente en cargas de trabajo de IA y machine learning. Lambda ofrece instancias GPU NVIDIA (A100, H100, H200) bajo demanda y reservadas para entrenamiento e inferencia a precios competitivos o inferiores a AWS, GCP y Azure. También venden estaciones de trabajo y servidores GPU. Fundada en 2012, Lambda se ha convertido en un proveedor de referencia para investigadores de IA y startups.
Por qué importa: Lambda representa la capa de nube GPU que permite el desarrollo de IA para equipos que no pueden permitirse construir sus propios centros de datos pero necesitan más control y mejores precios que los proveedores de nube hyperscaler. Para startups entrenando modelos, la disponibilidad de GPU y los precios de Lambda pueden hacer la diferencia entre un entrenamiento factible e infactible.
Fundamentos
Un sistema matemático entrenado que toma entradas y produce salidas basado en patrones aprendidos de datos. En IA, "modelo" es el término general para la cosa que estás usando — ya sea GPT-4 generando texto, Stable Diffusion generando imágenes o Whisper transcribiendo habla. Un modelo está definido por su arquitectura (cómo está estructurado), sus parámetros (lo que aprendió) y sus datos de entrenamiento (de qué aprendió). Cuando alguien pregunta "¿cuál modelo debo usar?", se está refiriendo a esto.
Por qué importa: Modelo es la palabra más utilizada en IA, y tiene diferentes significados en distintos contextos. Un "modelo" puede referirse a la arquitectura (Transformer), a una instancia específica entrenada (Claude Opus 4.6), a un archivo en el disco (un archivo .gguf) o a un punto final de API. Entender qué es realmente un modelo — y qué no es — es la base para todo lo demás.
Fundamentos
El amplio campo de la ciencia de la computación donde los sistemas aprenden patrones a partir de datos en lugar de seguir reglas explícitas. En lugar de programar una computadora para reconocer un gato listando características (cuatro patas, orejas puntiagudas, bigotes), se le muestran miles de fotos de gatos y se le deja que descubra el patrón por sí mismo. El aprendizaje automático abarca desde la regresión lineal simple hasta las redes neuronales profundas que impulsan la IA actual — el aprendizaje supervisado (ejemplos etiquetados), el aprendizaje no supervisado (encontrar estructura) y el aprendizaje por refuerzo (ensayo y error).
Por qué importa: El aprendizaje automático es la base de todo lo que llamamos "IA" hoy en día. Cada LLM, cada generador de imágenes, cada algoritmo de recomendación, cada filtro de spam — todo es aprendizaje automático. Entender el ML como la disciplina más amplia te permite ver dónde encaja el aprendizaje profundo, dónde los métodos clásicos aún ganan y por qué "IA" es simplemente "ML que se volvió muy buena".
Usar AI
Mecanismos que permiten a los modelos de IA retener y recordar información más allá de una sola conversación. Esto incluye memoria en contexto (usando la ventana de contexto), memoria externa (RAG, bases de datos vectoriales), memoria de conversación persistente (recordar preferencias del usuario entre sesiones) y memoria de trabajo (mantener estado durante tareas de agente de múltiples pasos). La memoria es lo que hace que la IA se sienta como un colaborador en lugar de una herramienta sin estado.
Por qué importa: Sin memoria, cada conversación con IA empieza desde cero. Repites tus preferencias, re-explicas tu codebase, re-describes tu proyecto. La memoria es lo que convierte un chatbot en un asistente — y es uno de los problemas más difíciles de resolver bien, equilibrando relevancia, privacidad, obsolescencia y costos de almacenamiento.
Empresas
Empresa china de IA que causó sensación al lanzar Kimi, un chatbot con una ventana de contexto de 2 millones de tokens. Fundada por Yang Zhilin, un exinvestigador detrás de innovaciones clave en modelado de contexto largo.
Por qué importa: Moonshot AI forzó a toda la industria a tomarse en serio la longitud de contexto. Antes de Kimi, el soporte de contexto largo era algo deseable; después de que Kimi se hiciera viral en China, cada laboratorio importante se apresuró a extender sus ventanas de contexto. La apuesta de Yang Zhilin de que los usuarios cambiarían fundamentalmente cómo interactúan con la IA cuando se les da suficiente contexto ha sido validada por el crecimiento explosivo de Kimi, y las técnicas que Moonshot desarrolló para inferencia eficiente de secuencias largas están influyendo en cómo la próxima generación de modelos maneja documentos, codebases y razonamiento complejo de múltiples pasos.
Empresas
La división de investigación en IA de Meta, sede de FAIR (Fundamental AI Research). Responsable de la familia de modelos open-weights Llama y de PyTorch, el framework de deep learning utilizado por la mayor parte de la industria de IA.
Por qué importa: Meta AI cambió fundamentalmente la economía de la IA al demostrar que los modelos de clase frontera podían liberarse como open weights. Llama y sus derivados impulsan miles de aplicaciones, startups y proyectos de investigación que nunca habrían tenido acceso a modelos de ese calibre. PyTorch sustenta la mayoría de los sistemas de investigación y producción de IA en todo el mundo. Y con más de 3 mil millones de usuarios en sus apps, Meta tiene una distribución que ningún otro laboratorio de IA puede igualar — cuando lanzan una función de IA, llega a un tercio de la humanidad de la noche a la mañana.
Empresas
Potencia europea de IA fundada por exinvestigadores de DeepMind y Meta. Conocida por superar expectativas con modelos eficientes y por defender la distribución open-weights junto con ofertas comerciales.
Por qué importa: Mistral demostró que no necesitas presupuestos de hyperscalers americanos para construir modelos de IA de frontera. Sus arquitecturas eficientes — particularmente su trabajo temprano en sparse Mixture of Experts — influyeron en el enfoque de toda la industria hacia el diseño de modelos, y sus lanzamientos open-weights dieron a desarrolladores en todo el mundo acceso a modelos de alta calidad sin dependencias de APIs. Como la primera empresa europea de IA en alcanzar una competencia genuina de frontera, Mistral también tiene significado estratégico: su éxito (o fracaso) determinará si Europa puede ser un jugador en IA, o meramente un regulador de ella.
Empresas
Empresa china de IA que construye modelos a gran escala en texto, voz y video. Conocida por su plataforma de consumo Hailuo y modelos multimodales cada vez más competitivos.
Por qué importa: MiniMax ha emergido como una de las empresas de IA más versátiles de China, construyendo modelos competitivos en texto, voz y video desde un único stack integrado. Su plataforma Hailuo AI trajo generación de video con IA de alta calidad a una audiencia global de forma gratuita, demostrando que los laboratorios chinos de IA pueden construir productos de consumo con alcance internacional genuino — no solo APIs empresariales o papers de investigación.
Herramientas
Un protocolo abierto (creado por Anthropic) que estandariza cómo los modelos de IA se conectan a herramientas externas y fuentes de datos. Piensa en él como USB-C para IA — una interfaz estándar en lugar de integraciones personalizadas para cada herramienta. Los servidores MCP exponen capacidades; los clientes MCP (como Claude) las consumen.
Por qué importa: Antes de MCP, cada integración entre IA y herramientas era a medida. MCP significa que una herramienta construida una vez funciona con cualquier IA compatible. Ya es soportado por Claude, Cursor y otros. Así es como la IA pasa de ser un chatbot a ser un asistente real.
Modelos
Una arquitectura donde el modelo contiene múltiples sub-redes “expertas”, pero solo activa unas pocas de ellas para cada entrada. Una red de enrutamiento decide qué expertos son relevantes para un token dado. Esto significa que un modelo puede tener más de 100B parámetros totales pero solo usar 20B en cualquier pasada hacia adelante.
Por qué importa: MoE es cómo modelos como Mixtral y (supuestamente) GPT-4 obtienen la calidad de un modelo enorme con la velocidad de uno más pequeño. El trade-off es mayor uso de memoria (todos los expertos deben estar cargados) aunque el cómputo es más barato.
Fundamentos
Un modelo que puede entender y/o generar múltiples tipos de datos: texto, imágenes, audio, video, código. Claude puede leer imágenes y texto; algunos modelos también pueden producir imágenes o voz. “Multimodal” contrasta con modelos “unimodales” que solo manejan un tipo.
Por qué importa: Las tareas del mundo real son multimodales. Quieres mostrarle a una IA una captura de pantalla y preguntar “¿qué está mal aquí?” o darle un diagrama y decir “implementa esto”. Los modelos multimodales hacen eso posible.
Modelos
Modelo de espacio de estados selectivo de Gu y Dao. Escalado lineal en longitud de secuencia vs el cuadrático del Transformer. Estado oculto comprimido que se actualiza selectivamente — la información importante se preserva, la irrelevante decae.
Por qué importa: El desafío más creíble a la dominancia del Transformer. Si se logra tiempo lineal con calidad equivalente al Transformer, las implicaciones son enormes. Arquitecturas híbridas (Jamba, Zamba) ya se están desplegando.
Seguridad
Ingeniería inversa de lo que sucede dentro de las redes neuronales a nivel de neuronas, circuitos y features. No solo qué produce el modelo, sino cómo lo computa.
Por qué importa: Central para la seguridad de IA. Los investigadores han encontrado circuitos específicos (cabezas de inducción, etc.) dentro de los Transformers. Es un área de investigación clave en Anthropic.
Empresas
Generación de imágenes con IA conocida por su refinamiento estético. Opera vía Discord y web. Equipo pequeño, rentable, enfocado en calidad.
Por qué importa: El más popular para uso creativo y artístico. Demuestra que la curación y la UX importan tanto como la arquitectura.
Entrenamiento
Un modelo entrenado para predecir las preferencias humanas entre respuestas de IA. Dado un prompt y dos respuestas candidatas, el modelo de recompensa puntúa cuál preferirían los humanos. En el pipeline de RLHF, el modelo de recompensa proporciona la señal que entrena al modelo de lenguaje para producir mejores respuestas — es el proxy aprendido del juicio humano.
Por qué importa: El modelo de recompensa es el componente clave que hace funcionar el RLHF. No puedes tener a un humano evaluando cada respuesta durante el entrenamiento (demasiado lento, demasiado caro), así que entrenas un modelo para aproximar las preferencias humanas y usas eso como señal de entrenamiento. La calidad del modelo de recompensa determina directamente la calidad de la alineación — un mal modelo de recompensa produce un modelo que optimiza las cosas equivocadas.
Fundamentos
El proceso de seleccionar qué token generar a continuación de la distribución de probabilidad predicha por el modelo. La decodificación greedy siempre elige el token más probable. El muestreo aleatorio elige proporcionalmente a las probabilidades. La temperatura, top-p (nucleus) y top-k son controles que ajustan la aleatoriedad y diversidad de la selección. La estrategia de muestreo afecta dramáticamente la calidad, creatividad y consistencia de la salida.
Por qué importa: Los parámetros de muestreo son las perillas más accesibles para controlar el comportamiento del LLM. Temperatura 0 para generación de código determinista. Temperatura 0.7 para escritura creativa. Top-p 0.9 para un buen equilibrio. Estos no son números mágicos — controlan directamente qué tokens considera el modelo en cada paso. Entender el muestreo te ayuda a ajustar las salidas para tu caso de uso específico.
Modelos
Un modelo que construye una representación interna de cómo funciona el mundo — no solo correlaciones estadísticas sino relaciones causales, leyes físicas y razonamiento espacial. El debate sobre si los LLMs tienen modelos del mundo es uno de los más controvertidos en IA: ¿realmente entienden que los objetos caen cuando se sueltan, o solo saben que "cae" a menudo sigue a "soltó" en el texto?
Por qué importa: Los modelos del mundo están en el centro de la pregunta más importante de la IA: ¿la comprensión requiere más que la coincidencia de patrones? Si los LLMs construyen genuinos modelos del mundo, están más cerca de la comprensión de lo que pensábamos. Si no, hay una brecha fundamental de capacidad que el escalado por sí solo no cerrará. La respuesta tiene implicaciones masivas para la seguridad de la IA, las capacidades y el camino hacia una inteligencia más general.
Entrenamiento
Un objetivo de entrenamiento auto-supervisado donde tokens aleatorios en la entrada se reemplazan con un token [MASK], y el modelo debe predecir los tokens originales a partir del contexto. BERT popularizó MLM: enmascarar el 15% de los tokens, usar atención bidireccional para mirar tanto el contexto izquierdo como derecho, y predecir las palabras enmascaradas. Esto crea modelos potentes de comprensión de texto (a diferencia de modelos de generación de texto).
Por qué importa: MLM es el objetivo de entrenamiento que creó BERT y toda la familia de modelos codificadores que aún alimentan la mayoría de los sistemas de búsqueda, clasificación y embedding en producción. Entender MLM vs. modelado de lenguaje causal (predicción del siguiente token) explica la división fundamental entre modelos de comprensión (BERT) y modelos de generación (GPT) — y por qué cada uno destaca en diferentes tareas.
Uso de IA
Traducir automáticamente texto de un idioma a otro. La traducción automática neuronal moderna (NMT) usa Transformers encoder-decoder entrenados en corpus paralelos (textos y sus traducciones). Google Translate, DeepL y la traducción basada en LLM usan variantes de este enfoque. La calidad ha mejorado dramáticamente — para pares de idiomas comunes, MT se acerca a la traducción humana profesional para contenido rutinario.
Por qué importa: La traducción automática rompe las barreras del idioma a escala. Permite el comercio global, la búsqueda entre idiomas, la comunicación en tiempo real y el acceso a información entre idiomas. Para la IA específicamente, MT es cómo los modelos entrenados principalmente en inglés pueden servir a usuarios en más de 100 idiomas — y es por eso que la eficiencia del tokenizador multilingüe importa para el costo.
Infraestructura
Un sistema centralizado para versionar, rastrear y gestionar modelos de machine learning entrenados a lo largo de su ciclo de vida. Como un registro de paquetes (npm, PyPI) pero para modelos de ML: cada versión del modelo se almacena con sus metadatos (datos de entrenamiento, hiperparámetros, métricas de rendimiento, linaje), haciendo posible reproducir resultados, comparar versiones y desplegar modelos específicos en producción.
Por qué importa: Sin un registro de modelos, el desarrollo de ML se convierte en caos: ¿qué versión del modelo está en producción? ¿Con qué datos fue entrenado? ¿Cuándo lo actualizamos por última vez? ¿Quién lo entrenó? Un registro de modelos responde todas estas preguntas y proporciona la base para un despliegue de ML reproducible, auditable y confiable. Es infraestructura esencial para cualquier equipo ejecutando modelos en producción.
Fundamentos
La operación matemática fundamental que subyace a todas las redes neuronales. Multiplicar una matriz de pesos por un vector (o matriz) de entrada produce un vector de salida. Cada capa lineal, cada cálculo de atención y cada búsqueda de embedding es en última instancia una multiplicación de matrices. El rendimiento del hardware de IA (GPUs, TPUs) se mide en qué tan rápido puede hacer multiplicaciones de matrices.
Por qué importa: Entender que las redes neuronales son simplemente secuencias de multiplicaciones de matrices (con no-linealidades entre ellas) desmitifica todo el campo. Explica por qué las GPUs son esenciales (son máquinas de multiplicación de matrices en paralelo), por qué el tamaño del modelo se mide en parámetros (la cantidad de valores en las matrices de pesos), y por qué los FLOPs son la unidad de cómputo (cuenta las operaciones de multiplicación-suma en estas multiplicaciones de matrices).
Fundamentos
La rama de la IA enfocada en permitir que las máquinas comprendan, interpreten y generen lenguaje humano. El NLP abarca desde el procesamiento básico de texto (tokenización, raíz de palabras, etiquetado de partes del discurso) hasta tareas complejas como análisis de sentimientos, traducción automática, resumen y respuesta a preguntas. Antes de los Transformers, el NLP era un conjunto de técnicas especializadas. Ahora, los LLMs han unificado la mayoría del NLP bajo un paradigma — pero las bases del campo aún son importantes para entender cómo y por qué funcionan estos modelos.
Por qué importa: NLP es la razón por la que puedes hablar con la IA en inglés claro y recibir respuestas útiles. Cada chatbot, cada motor de búsqueda, cada servicio de traducción, cada herramienta de escritura de IA es NLP. Incluso si nunca construyes un sistema de NLP desde cero, entender los fundamentos — tokenización, atención, embeddings, contexto — te hace un mejor usuario de cada herramienta de IA que maneja texto.
Empresas
La empresa cuyos GPUs impulsan virtualmente todo el entrenamiento de IA y la mayoría de la inferencia a nivel mundial. Lo que comenzó como una empresa de tarjetas gráficas se convirtió en el proveedor de hardware más crítico de la industria de IA, haciendo brevemente de NVIDIA la empresa más valiosa del planeta.
Por qué importa: NVIDIA es la empresa sin la cual la revolución de IA simplemente no sucede — sus GPUs y el ecosistema de software CUDA son la base sobre la que virtualmente todo modelo importante de IA ha sido entrenado. La combinación de hardware de IA construido a propósito, un foso de software de una década de profundidad y control sobre la red que conecta GPUs les ha dado una posición casi monopólica en la cadena de suministro más crítica del siglo XXI. Cuando gobiernos, corporaciones y laboratorios de investigación compiten por cómputo de IA, están compitiendo por hardware NVIDIA, y ese solo hecho ha convertido a la antigua empresa de tarjetas gráficas de Jensen Huang en la empresa tecnológica más estratégicamente importante del planeta.
Fundamentos
Un sistema de computación vagamente inspirado en cerebros biológicos, hecho de capas de “neuronas” interconectadas (funciones matemáticas) que aprenden patrones de los datos. La información fluye a través de las capas, siendo progresivamente transformada hasta que la red produce una salida. Todo modelo de IA moderno es una red neuronal de algún tipo.
Por qué importa: Las redes neuronales son el “cómo” detrás de toda la IA. Entender que son matemáticas (no magia, no cerebros) ayuda a desmitificar lo que la IA puede y no puede hacer. Son reconocedores de patrones — extraordinariamente poderosos, pero reconocedores de patrones al fin.
Entrenamiento
Técnicas que estabilizan el entrenamiento de redes neuronales normalizando los valores que fluyen a través de la red para que tengan una escala consistente. Layer Normalization (LayerNorm) normaliza a través de las características dentro de cada ejemplo. RMSNorm es una variante simplificada. Batch Normalization (BatchNorm) normaliza a través del batch. Cada Transformer usa alguna forma de normalización entre capas.
Por qué importa: Sin normalización, las redes profundas son extremadamente difíciles de entrenar — las activaciones pueden explotar o desvanecerse entre capas, haciendo el descenso de gradiente inestable. La normalización es una de esas técnicas poco glamorosas que es absolutamente esencial: quita la normalización de cualquier arquitectura moderna y el entrenamiento colapsa.
Fundamentos
La unidad computacional básica de una red neuronal. Una neurona artificial recibe entradas, multiplica cada una por un peso, las suma, añade un sesgo y pasa el resultado a través de una función de activación para producir una salida. Miles a miles de millones de estas neuronas, organizadas en capas y conectadas por pesos aprendidos, forman las redes neuronales que impulsan toda la IA moderna.
Por qué importa: Las neuronas son los átomos del deep learning. Entender una sola neurona — suma ponderada más activación — hace que el resto de la arquitectura de redes neuronales sea intuitivo. Una capa es un grupo de neuronas. Una red es una pila de capas. El entrenamiento es ajustar los pesos. Todo lo demás son detalles (detalles importantes, pero detalles).
Uso de IA
Identificar y categorizar entidades nombradas en texto — personas, organizaciones, ubicaciones, fechas, montos monetarios y otros nombres propios. En "Apple anunció una inversión de $3B en Múnich el martes," NER identifica Apple (Organización), $3B (Dinero), Múnich (Ubicación) y martes (Fecha). Es una tarea fundamental de NLP usada en extracción de información, búsqueda y construcción de grafos de conocimiento.
Por qué importa: NER es la columna vertebral de la extracción de información estructurada a partir de texto no estructurado. Cada motor de búsqueda, agregador de noticias y sistema de inteligencia usa NER para entender de qué trata un documento. También es el primer paso en la construcción de grafos de conocimiento a partir de texto — no puedes construir relaciones entre entidades que no has identificado.
Uso de IA
Una descripción de texto de lo que no quieres en una imagen generada, usada junto al prompt principal. Prompt: "un paisaje hermoso." Prompt negativo: "borroso, baja calidad, texto, marca de agua, personas." El modelo se aleja activamente de los conceptos en el prompt negativo durante la generación. Los prompts negativos se usan principalmente con Stable Diffusion y otros modelos abiertos de generación de imágenes.
Por qué importa: Los prompts negativos son una de las herramientas más efectivas para mejorar la calidad de generación de imágenes. Sin ellos, los modelos tienden a producir artefactos (áreas borrosas, dedos extra, marcas de agua de texto) porque estos aparecen frecuentemente en los datos de entrenamiento. Un prompt negativo bien elaborado elimina los modos de fallo comunes y te da más control sobre la salida sin cambiar el prompt positivo.
Entrenamiento
El amplio conjunto de técnicas usadas para hacer modelos de IA más rápidos, más pequeños, más baratos o más precisos. Esto incluye optimizaciones de entrenamiento (precisión mixta, gradient checkpointing, paralelismo de datos), optimizaciones de inferencia (cuantización, poda, destilación, decodificación especulativa) y optimizaciones de servicio (batching, caching, balanceo de carga). La optimización es la razón por la que puedes correr un modelo de 14B parámetros en una laptop.
Por qué importa: La capacidad bruta no significa nada si no puedes costear ejecutarla. La optimización es la diferencia entre un demo de investigación y un producto en producción. Es por lo que los modelos open-weights pueden competir con proveedores de API, por lo que la IA móvil existe, y por lo que los costos de inferencia siguen cayendo.
Empresas
La empresa detrás de ChatGPT y la serie de modelos GPT. Originalmente un laboratorio de investigación sin fines de lucro, OpenAI se convirtió en la cara pública de la revolución de IA cuando ChatGPT se lanzó en noviembre de 2022.
Por qué importa: OpenAI hizo más que cualquier otra organización para llevar la IA del laboratorio de investigación a la conciencia mainstream. ChatGPT fue el momento iPhone de la IA generativa — el producto que hizo que cientos de millones de personas entendieran, visceralmente, lo que los modelos de lenguaje grandes podían hacer. Su API creó la capa de infraestructura sobre la que se construyeron miles de startups de IA, y la serie GPT estableció el escalamiento como el paradigma dominante en investigación de IA durante años. Incluso las controversias de OpenAI — la crisis de gobernanza, la conversión de sin fines de lucro a con fines de lucro, las salidas de investigadores enfocados en seguridad — han moldeado la conversación más amplia sobre cómo deberían estructurarse y gobernarse las empresas de IA.
Seguridad
Cuando una empresa libera los parámetros entrenados de un modelo para que cualquiera los descargue y ejecute. “Open weights” es más preciso que “código abierto” porque la mayoría de los modelos liberados no incluyen datos de entrenamiento ni código de entrenamiento — obtienes el modelo terminado pero no la receta. Llama, Mistral y Qwen son modelos open-weights.
Por qué importa: Los open weights significan que puedes ejecutar IA en tu propio hardware con privacidad total — sin llamadas a API, sin datos saliendo de tu red. El trade-off es que necesitas los recursos de GPU para ejecutarlos y eres responsable de la seguridad.
Entrenamiento
Cuando un modelo memoriza sus datos de entrenamiento demasiado bien y pierde la capacidad de generalizar a nuevas entradas. Como un estudiante que memoriza las respuestas de exámenes de práctica pero no puede resolver problemas nuevos. El modelo rinde genial en datos de entrenamiento pero mal en cualquier cosa que no haya visto antes.
Por qué importa: El overfitting es el modo de fallo más común en el entrenamiento de modelos. Es por eso que la evaluación usa conjuntos de prueba separados, y por qué entrenar demasiado tiempo (demasiados epochs) puede realmente empeorar un modelo.
Entrenamiento
Cuando una red neuronal entrenada en una nueva tarea pierde su capacidad de realizar tareas previamente aprendidas. Hacer fine-tuning de un modelo con datos de soporte al cliente podría hacerlo excelente en soporte pero terrible en programación. El nuevo aprendizaje sobreescribe los pesos que codificaban las capacidades anteriores, "olvidándolas".
Por qué importa: El olvido catastrófico es el desafío central del fine-tuning y el aprendizaje continuo. Es la razón por la que no puedes simplemente seguir haciendo fine-tuning de un modelo tarea tras tarea y esperar que haga todo bien. También es la razón por la que técnicas como LoRA (que solo modifican un pequeño subconjunto de parámetros) y la selección cuidadosa del learning rate son críticas para preservar las capacidades del modelo base.
Herramientas
Una herramienta fácil de usar para ejecutar modelos de lenguaje localmente con un solo comando. Ollama envuelve llama.cpp en una experiencia similar a Docker:
ollama run llama3 descarga y ejecuta Llama 3, seleccionando automáticamente la cuantización correcta para tu hardware. Gestiona descargas de modelos, proporciona un servidor de API y maneja la detección de hardware.Por qué importa: Ollama es a la IA local lo que Docker es a la contenedorización: eliminó la fricción. Antes de Ollama, ejecutar un modelo local significaba elegir niveles de cuantización, descargar archivos GGUF, configurar flags de llama.cpp y gestionar la descarga a GPU. Ollama maneja todo esto automáticamente. Es el camino más rápido desde "quiero probar ejecutar IA localmente" hasta realmente hacerlo.
Infraestructura
Un formato abierto para representar modelos de machine learning que permite la interoperabilidad entre frameworks. Un modelo entrenado en PyTorch puede exportarse a ONNX y luego ejecutarse usando ONNX Runtime, TensorRT u otros motores de inferencia optimizados para hardware específico. ONNX actúa como un lenguaje común entre el mundo del entrenamiento (PyTorch, TensorFlow) y el mundo del despliegue (runtimes optimizados).
Por qué importa: ONNX resuelve un problema real de producción: entrenas en PyTorch (el estándar de investigación) pero despliegas en hardware que funciona mejor con un runtime diferente. Convertir a ONNX te permite usar motores de inferencia optimizados sin reescribir tu modelo. Es especialmente importante para el despliegue en el borde donde necesitas el máximo rendimiento en hardware limitado.
Uso de IA
Extraer texto de imágenes — fotografías de documentos, capturas de pantalla, letreros, notas manuscritas o cualquier imagen que contenga texto. El OCR moderno combina detección de texto (encontrar dónde aparece el texto en la imagen) con reconocimiento de texto (leer lo que dice el texto). El OCR con deep learning maneja texto curvo, múltiples idiomas, fuentes variadas y baja calidad de imagen mucho mejor que los enfoques antiguos basados en reglas.
Por qué importa: OCR digitaliza el mundo físico. Escanear recibos para seguimiento de gastos, leer documentos para archivo, extraer datos de formularios, traducir letreros en tiempo real y hacer PDFs basados en imagen buscables dependen del OCR. Combinado con LLMs, OCR permite comprensión sofisticada de documentos — no solo leer texto sino entender facturas, contratos e informes.
Fundamentos
Los valores internos que una red neuronal aprende durante el entrenamiento — esencialmente el "conocimiento" del modelo codificado como números. Cuando alguien dice que un modelo tiene "7 mil millones de parámetros", se refiere a 7 mil millones de valores numéricos individuales que se ajustaron durante el entrenamiento para capturar patrones en los datos. Más parámetros generalmente significa mayor capacidad para aprender patrones complejos, pero también más memoria para almacenar y más potencia de cálculo para ejecutar.
Por qué importa: El recuento de parámetros es la abreviatura más común para el tamaño del modelo, y determina directamente cuánta memoria de la GPU necesitas. Un modelo de 7B con precisión de 16 bits necesita ~14 GB de VRAM solo para los pesos. Entender los parámetros te ayuda a estimar costos, elegir hardware y comprender por qué la cuantización (reducir la precisión por parámetro) es tan importante para hacer los modelos accesibles.
Empresas
Empresa china de generación de video que construye herramientas de video con IA accesibles. Conocida por velocidades rápidas de generación y un nivel gratuito que les ayudó a construir una gran base de usuarios rápidamente en mercados internacionales.
Por qué importa: PixVerse demostró que la generación de video con IA podía ser un producto para el mercado masivo, no solo una herramienta para profesionales y early adopters. Su agresivo nivel gratuito y rápido ciclo de iteración forzaron a toda la categoría a repensar precios y accesibilidad. Al construir una de las mayores bases de usuarios en video con IA en un solo año, demostraron que la distribución y la velocidad de ejecución pueden importar tanto como la calidad del modelo puro para determinar quién gana este mercado.
Empresas
Motor de búsqueda con IA que combina búsqueda web en tiempo real con razonamiento de modelos de lenguaje para dar respuestas directas y con fuentes en lugar de una lista de enlaces. El desafío más visible al dominio de búsqueda de Google en una generación.
Por qué importa: Perplexity es el desafío más creíble al dominio de búsqueda de Google en más de una década, demostrando que un motor de respuestas nativo de IA puede ofrecer una experiencia fundamentalmente mejor para consultas de búsqueda de información. Popularizaron el paradigma de generación aumentada por recuperación como producto de consumo, mostrando que combinar búsqueda web en tiempo real con razonamiento de LLM produce resultados que son más útiles y más confiables que cualquiera de las dos tecnologías por separado. Su rápido crecimiento ha forzado a Google, Microsoft y a cada otro jugador de búsqueda a repensar cómo debería verse un motor de búsqueda en la era de los modelos de lenguaje grandes.
Entrenamiento
La fase de entrenamiento inicial y masiva donde un modelo aprende lenguaje (u otras modalidades) de un corpus enorme. Esta es la parte costosa — miles de GPUs corriendo durante semanas o meses, costando millones de dólares. El resultado es un modelo fundacional que entiende lenguaje pero aún no ha sido especializado para ninguna tarea.
Por qué importa: El pre-entrenamiento es lo que hace posibles los modelos fundacionales. También es la razón por la que solo un puñado de empresas puede crear modelos de frontera — los costos de cómputo son astronómicos. Todo lo demás (fine-tuning, RLHF, prompting) se construye sobre esta base.
Usar AI
La práctica de elaborar entradas para obtener mejores salidas de modelos de IA. Esto va desde técnicas simples (ser específico, proporcionar ejemplos) hasta métodos avanzados (chain of thought, few-shot prompting, asignación de roles). A pesar del nombre sofisticado, se trata fundamentalmente de comunicarse claramente con un sistema estadístico.
Por qué importa: El mismo modelo puede dar resultados salvajemente diferentes dependiendo de cómo preguntes. Un buen prompt engineering es la forma más barata de mejorar la calidad de salida de IA — sin entrenamiento, sin fine-tuning, solo mejor comunicación.
Fundamentos
Mide qué tan bien un modelo predice texto. exp(pérdida promedio de entropía cruzada). Representa “entre cuántos tokens está eligiendo el modelo.” Menor = mejor.
Por qué importa: La métrica más fundamental para comparar la capacidad bruta de modelado de texto. Pero no mide utilidad ni seguridad.
Fundamentos
El texto que le das a un modelo de IA para obtener una respuesta. Un prompt puede ser una pregunta, una instrucción, un brief creativo o un bloque de código que quieres que te expliquen. Todo lo que hace el modelo comienza con lo que tú escribes. La calidad, especificidad y estructura de tu prompt moldean directamente la calidad de lo que recibes de vuelta.
Por qué importa: El prompt es la interfaz. Es la única palanca que la mayoría de la gente usa al interactuar con IA, y es sorprendentemente poderosa. Un prompt vago produce una respuesta vaga; un prompt específico y bien estructurado puede extraer resultados de nivel experto del mismo modelo. Entender los prompts es el paso uno para usar IA efectivamente.
Usar AI
Una técnica que guarda y reutiliza la versión procesada de un prefijo de prompt entre múltiples llamadas a la API, evitando cálculos redundantes. Si envías el mismo system prompt y contexto de documentos con cada solicitud (lo cual es común), el prompt caching lo procesa una vez y reutiliza el cálculo en caché para solicitudes posteriores. Esto reduce tanto la latencia como el costo.
Por qué importa: La mayoría de las aplicaciones de IA envían el mismo system prompt, ejemplos few-shot o documentos de referencia con cada solicitud. Sin caché, el proveedor procesa este prefijo idéntico cada vez. El prompt caching puede reducir los costos de tokens de entrada entre un 50–90% y reducir significativamente el tiempo al primer token. Para aplicaciones de alto volumen, esto se traduce en miles de dólares ahorrados por mes.
Seguridad
Un ataque donde instrucciones maliciosas se insertan en contenido que un modelo de IA procesa, haciendo que el modelo siga las instrucciones del atacante en lugar de las del usuario o desarrollador. Inyección directa: el usuario escribe instrucciones maliciosas. Inyección indirecta: instrucciones maliciosas se ocultan en un sitio web, documento o correo electrónico que el modelo lee como parte de su tarea.
Por qué importa: La inyección de prompt es la vulnerabilidad de seguridad más crítica en las aplicaciones de IA. Cualquier aplicación que permita a un LLM procesar contenido no confiable (correos electrónicos, páginas web, documentos subidos) es potencialmente vulnerable. Actualmente no existe una solución completa — solo mitigaciones. Si estás construyendo aplicaciones impulsadas por IA, entender la inyección de prompt es tan importante como entender la inyección SQL lo fue para el desarrollo web.
Fundamentos
Dos métricas complementarias para evaluar clasificadores. La precisión responde "de los ítems que el modelo marcó como positivos, ¿cuántos realmente lo son?" El recall responde "de todos los positivos reales, ¿cuántos encontró el modelo?" Un filtro de spam con alta precisión raramente marca correo real como spam. Uno con alto recall atrapa la mayoría del spam. El F1 score es su media armónica — un número único que equilibra ambos.
Por qué importa: La exactitud sola es engañosa. Un modelo que nunca predice "fraude" logra 99.9% de exactitud si solo el 0.1% de las transacciones son fraudulentas — pero es completamente inútil. Precisión y recall revelan los compromisos: atrapar más fraude (mayor recall) significa más falsas alarmas (menor precisión), y viceversa. Cada sistema de clasificación en producción se ajusta basándose en este compromiso.
Entrenamiento
Eliminar parámetros innecesarios (pesos, neuronas o capas enteras) de un modelo entrenado para hacerlo más pequeño y rápido sin pérdida significativa de calidad. Como podar un árbol: cortas las ramas que menos contribuyen y el árbol se mantiene saludable. La poda estructurada elimina neuronas o cabezas de atención enteras. La poda no estructurada pone a cero pesos individuales.
Por qué importa: La poda es una técnica de compresión de modelos junto con la cuantización y la destilación. La idea clave: la mayoría de las redes neuronales están sobreparametrizadas — muchos pesos contribuyen poco a la salida. La "hipótesis del billete de lotería" sugiere que dentro de una red grande, existe una subred mucho más pequeña que puede igualar el rendimiento del original. La poda encuentra y conserva esa subred.
Usar AI
Una estructura de prompt reutilizable con marcadores de variables que se llenan con datos específicos en tiempo de ejecución. En lugar de escribir un nuevo prompt desde cero para cada solicitud del usuario, defines una plantilla una vez — "Resume el siguiente {tipo_de_documento} en {idioma}, enfocándote en {tema}" — y llenas las variables. Las plantillas de prompts son los bloques de construcción de las aplicaciones de IA en producción.
Por qué importa: Toda aplicación de IA en producción usa plantillas de prompts. Garantizan consistencia, permiten testing y separan la lógica del prompt (escrita por un desarrollador) del contenido dinámico (proporcionado por usuarios o datos). Las buenas plantillas se testean, versionan e iteran — son código, no texto improvisado. Entender el diseño de plantillas de prompts es esencial para construir aplicaciones de IA confiables.
Seguridad
Un framework matemático que garantiza la privacidad individual en el análisis de datos agregados y el entrenamiento de modelos. Con privacidad diferencial, agregar o eliminar los datos de cualquier individuo cambia el resultado como máximo en una cantidad pequeña y acotada. Esto significa que puedes aprender patrones útiles de un dataset sin revelar información sobre ninguna persona específica en él.
Por qué importa: A medida que la IA se entrena con datos cada vez más personales (registros de salud, transacciones financieras, mensajes), la privacidad diferencial proporciona la garantía más fuerte conocida de que los datos individuales no pueden extraerse del modelo. Es usada por Apple (predicciones del teclado), Google (analíticas de uso de Chrome) y la Oficina del Censo de EE.UU. Para la IA, aborda la preocupación de que los LLMs podrían memorizar y reproducir datos de entrenamiento privados.
Infraestructura
Una técnica de gestión de memoria para el KV cache que toma prestado de la memoria virtual de los sistemas operativos. En lugar de asignar un bloque contiguo de memoria GPU para el KV cache de cada solicitud (lo que desperdicia memoria por fragmentación), PagedAttention almacena el cache en bloques no contiguos ("páginas") que se asignan bajo demanda y pueden compartirse entre solicitudes con prefijos comunes.
Por qué importa: PagedAttention es la innovación detrás de vLLM y ahora es adoptada por la mayoría de los frameworks de servicio de LLMs. Aumentó el rendimiento de servicio 2–4x comparado con implementaciones ingenuas al eliminar el desperdicio de memoria por fragmentación. Sin ella, servir modelos de contexto largo a muchos usuarios concurrentes sería dramáticamente más caro.
Fundamentos
Una operación que reduce las dimensiones espaciales de los datos resumiendo una región en un solo valor. Max pooling toma el valor máximo en cada región. Average pooling toma la media. En CNN, las capas de pooling reducen la dimensión de los mapas de características entre capas convolucionales. En Transformers, el pooling combina representaciones de tokens en un solo vector (por ejemplo, para clasificación).
Por qué importa: El pooling es cómo las redes neuronales pasan de características locales a comprensión global. Una CNN podría comenzar con mapas de características de 224×224 y reducirlos a 7×7 en la capa final, resumiendo progresivamente la información espacial. En NLP, el mean pooling sobre embeddings de tokens es la forma estándar de crear un único embedding de oración a partir de una secuencia de representaciones de tokens.
Entrenamiento
Una estrategia para cambiar la tasa de aprendizaje durante el entrenamiento en lugar de mantenerla constante. La mayoría del entrenamiento moderno usa warmup (aumentar gradualmente desde cerca de cero hasta el pico) seguido de decay (disminuir gradualmente hacia cero). Cosine annealing es el programa de decay más común. La tasa de aprendizaje controla qué tan grande es cada paso de actualización por gradiente — posiblemente el hiperparámetro más importante del entrenamiento.
Por qué importa: Acertar con el programa de tasa de aprendizaje puede hacer o deshacer un entrenamiento. Demasiado alta y el modelo diverge (picos en la pérdida, falla el entrenamiento). Demasiado baja y entrena demasiado lento o se atasca. El programa interactúa con el tamaño de lote, el tamaño del modelo y los datos — no hay una configuración universal. Entender los programas de tasa de aprendizaje te ayuda a interpretar curvas de entrenamiento y diagnosticar problemas.
Infraestructura
Comparar dos variantes de un sistema de IA (diferentes modelos, prompts o configuraciones) asignando aleatoriamente usuarios reales a cada variante y midiendo cuál funciona mejor en métricas que importan. A diferencia de la evaluación offline (benchmarks, conjuntos de prueba), las pruebas A/B revelan cómo los cambios afectan el comportamiento real del usuario — engagement, satisfacción, finalización de tareas e ingresos.
Por qué importa: Las métricas offline no siempre predicen el rendimiento en el mundo real. Un modelo con mejor puntuación en benchmarks podría producir respuestas que gustan menos a los usuarios. Un cambio de prompt que mejora la calidad podría aumentar la latencia hasta el punto en que los usuarios abandonan. Las pruebas A/B son la única forma de saber si un cambio realmente mejora la experiencia del usuario. Así es como cada producto de IA importante toma decisiones de despliegue.
Infraestructura
Reducir la precisión de un modelo para hacerlo más pequeño y rápido. Un modelo entrenado en punto flotante de 32 bits puede cuantizarse a 8 bits, 4 bits o incluso menos — reduciendo su tamaño de 4-8x con una pérdida de calidad sorprendentemente pequeña. GGUF es el formato popular para inferencia local vía llama.cpp.
Por qué importa: La cuantización es lo que hace posible ejecutar un modelo de 14B parámetros en un solo GPU o incluso en una laptop. Sin ella, los modelos open-weights serían inutilizables para la mayoría de las personas. Las variantes Q4_K_M y Q5_K_M dan en el punto óptimo de tamaño vs. calidad.
Uso de IA
Un sistema que responde preguntas formuladas en lenguaje natural. QA extractivo encuentra el fragmento de respuesta dentro de un documento dado ("Según el párrafo 3, la respuesta es..."). QA generativo sintetiza una respuesta a partir de una o más fuentes. QA de dominio abierto responde cualquier pregunta sin un documento específico. QA basado en RAG recupera documentos relevantes y genera respuestas a partir de ellos.
Por qué importa: La respuesta a preguntas es el patrón de interacción fundamental para los asistentes de IA. Cada chatbot, cada base de conocimiento empresarial, cada bot de soporte al cliente es esencialmente un sistema QA. Entender los diferentes paradigmas de QA (extractivo, generativo, con recuperación aumentada) te ayuda a elegir la arquitectura correcta para tu aplicación y establecer expectativas realistas sobre la precisión.
Entrenamiento
Un paradigma de entrenamiento donde un agente de IA aprende interactuando con un entorno, tomando acciones y recibiendo recompensas o penalizaciones. A diferencia del aprendizaje supervisado (que aprende de ejemplos etiquetados), el RL aprende de la experiencia — a través de prueba y error. El RL entrenó a AlphaGo para vencer a campeones mundiales, enseña a robots a caminar, y es el "RL" en RLHF que hace que los chatbots sean útiles.
Por qué importa: El aprendizaje por refuerzo es cómo la IA aprende a actuar, no solo a predecir. Es el puente entre modelos que pueden responder preguntas y agentes que pueden lograr objetivos. Cada sistema de IA que planifica, estrategiza u optimiza a lo largo del tiempo tiene RL en algún lugar de su linaje.
Usar AI
La capacidad de los modelos de IA de pensar paso a paso, descomponer problemas complejos y llegar a conclusiones lógicamente sólidas. Los modelos de razonamiento modernos (como o1/o3 de OpenAI y DeepSeek-R1) son entrenados para generar trazas de razonamiento explícitas antes de responder, mejorando dramáticamente el rendimiento en matemáticas, programación y tareas de lógica. Esto es distinto de la simple coincidencia de patrones — los modelos de razonamiento pueden resolver problemas que nunca han visto antes.
Por qué importa: El razonamiento es la capacidad de frontera que separa "IA que suena inteligente" de "IA que es inteligente". Los modelos que razonan bien pueden depurar código, demostrar teoremas, planificar estrategias de múltiples pasos y detectar sus propios errores. La brecha entre modelos con y sin razonamiento fuerte es el mayor diferenciador de calidad en IA en este momento.
Empresas
Empresa canadiense de voz con IA especializada en clonación de voz de alta fidelidad y síntesis de habla en tiempo real. Una de las primeras en implementar marca de agua neural de audio para detección de deepfakes, tomando en serio las implicaciones éticas de la clonación de voz desde el inicio.
Por qué importa: Resemble AI importa porque reconocieron temprano que la clonación de voz sin infraestructura de seguridad es un pasivo, no un producto. Al lanzar detección de deepfakes y marca de agua neural junto con sus herramientas de síntesis, establecieron una plantilla para IA de voz responsable que el resto de la industria ahora se apresura a seguir. A medida que las regulaciones sobre medios sintéticos se endurecen globalmente, la ventaja de Resemble en verificación de procedencia y consentimiento los posiciona como la empresa de voz con IA en la que las empresas realmente pueden confiar.
Empresas
Empresa de investigación en IA fundada por exinvestigadores de DeepMind, Google Brain y FAIR. Construyendo modelos nativamente multimodales que pueden procesar texto, imágenes, video y audio desde la base.
Por qué importa: Reka demostró que un equipo pequeño y enfocado en investigación con el pedigrí correcto puede construir modelos multimodales de clase frontera sin miles de millones en financiamiento — y que arquitecturas nativamente multimodales entrenadas desde cero pueden superar el enfoque de “añadir y conectar” usado por la mayoría de los laboratorios más grandes. Su rápida trayectoria desde la fundación hasta la adquisición por Snowflake también reveló la intensa fuerza gravitacional que las plataformas de datos empresariales ahora ejercen sobre el talento de IA, sugiriendo que el futuro de la IA multimodal puede vivir dentro de empresas de infraestructura de datos en lugar de laboratorios de investigación independientes.
Empresas
Herramienta de diseño con IA enfocada en generación de imágenes y gráficos vectoriales de nivel profesional. Una de las primeras en producir activos de diseño verdaderamente usables — SVGs, estilos consistentes con la marca y salidas listas para producción que los diseñadores realmente quieren usar.
Por qué importa: Recraft es la rara empresa de IA que construyó para diseñadores profesionales en lugar de momentos virales en redes sociales, y demostró que ese enfoque podía producir resultados de vanguardia. Su foco en salidas listas para producción — vectores limpios, consistencia de marca, fondos transparentes — llena un vacío que ninguna otra empresa de generación de imágenes ha abordado seriamente, haciéndolos lo más cercano que tiene la industria a una herramienta de diseño genuina en lugar de un juguete artístico.
Empresas
Empresa pionera de generación de video con IA. Cocreó la arquitectura original de Stable Diffusion y luego giró hacia el video, donde sus modelos de la serie Gen han definido el estado del arte para herramientas de cine con IA.
Por qué importa: Runway es la empresa que llevó la generación de video con IA de curiosidad de investigación a herramienta de cine, lanzando modelo tras modelo a un ritmo que los mantuvo en la frontera incluso cuando competidores con bolsillos profundos entraron al espacio. Su ADN de herramientas creativas — nacido de artistas, no solo de ingenieros — les da una comprensión de flujos de trabajo profesionales que los laboratorios de investigación pura luchan por replicar, y su apuesta por construir una plataforma integral en lugar de solo un modelo puede resultar ser la jugada correcta a largo plazo.
Herramientas
Una técnica que da a los modelos de IA acceso a conocimiento externo al recuperar documentos relevantes antes de generar una respuesta. En lugar de depender solo de lo que el modelo aprendió durante el entrenamiento, RAG busca en una base de conocimiento, encuentra fragmentos relevantes y los incluye en el prompt como contexto.
Por qué importa: RAG resuelve dos problemas principales: alucinaciones (el modelo tiene fuentes reales para referencia) y corte de conocimiento (la base de conocimiento puede actualizarse sin reentrenar). Así es como la mayoría de la IA empresarial realmente funciona.
Infraestructura
Restricciones sobre cuántas solicitudes API puedes hacer por minuto/hora/día. Los proveedores imponen límites de tasa para prevenir la sobrecarga del servidor y asegurar acceso justo. Los límites típicamente aplican por clave API y pueden restringir solicitudes por minuto (RPM) y tokens por minuto (TPM).
Por qué importa: Los límites de tasa son el techo invisible que alcanzas al escalar aplicaciones de IA. Son la razón por la que el procesamiento por lotes importa, por qué necesitas lógica de reintentos, y por qué algunos proveedores cobran más por límites de tasa más altos.
Seguridad
La práctica de intentar deliberadamente hacer que un modelo de IA falle, se comporte mal o produzca salidas dañinas. Los red teams buscan vulnerabilidades: jailbreaks, sesgos, generación de desinformación, filtraciones de privacidad. Nombrado por los juegos de guerra militares donde un “equipo rojo” hace de adversario.
Por qué importa: No puedes arreglar lo que no conoces. El red teaming es cómo los proveedores descubren que su modelo explicará cómo forzar cerraduras si le pides “escribir una historia sobre un cerrajero”. Es trabajo de seguridad esencial que ocurre antes de cada lanzamiento importante de modelo.
Entrenamiento
Una técnica de entrenamiento donde evaluadores humanos clasifican las salidas del modelo por calidad, y esta retroalimentación se usa para entrenar un modelo de recompensa que guía a la IA hacia mejores respuestas. Es lo que convierte un modelo pre-entrenado crudo (que solo predice las siguientes palabras) en un asistente útil e inofensivo.
Por qué importa: RLHF es el ingrediente secreto que hizo que ChatGPT se sintiera diferente de GPT-3. El modelo base ya “sabía” todo, pero RLHF le enseñó a presentar ese conocimiento de una manera que los humanos realmente encuentran útil. También es cómo se refuerzan los comportamientos de seguridad.
Modelos
Una red neuronal que procesa secuencias manteniendo un estado oculto que se actualiza en cada paso — "recuerda" lo que ha visto hasta el momento. Los LSTMs y GRUs son variantes mejoradas que resuelven la tendencia del RNN original a olvidar dependencias de largo alcance. Los RNNs dominaron el NLP y el habla antes de que los Transformers los reemplazaran alrededor de 2018–2020.
Por qué importa: Los RNNs son los ancestros de los modelos de lenguaje modernos. Entender por qué fallaron (procesamiento secuencial lento, dificultad con dependencias de largo alcance) explica por qué los Transformers tuvieron éxito (procesamiento paralelo, atención sobre todas las posiciones). La arquitectura SSM/Mamba es, en cierto sentido, un retorno a la idea del RNN con correcciones modernas.
Infraestructura
El número total de tokens que un sistema puede generar por segundo a través de todas las solicitudes concurrentes. Distinto de la latencia (qué tan rápido se sirve una sola solicitud). Un sistema con alto rendimiento sirve a muchos usuarios simultáneamente. Un sistema con baja latencia sirve a cada usuario individual rápidamente. Los dos frecuentemente se compensan entre sí.
Por qué importa: Cuando construyes productos de IA, el rendimiento determina tus costos de servicio y capacidad. Un sistema que genera 100 tokens/segundo por usuario pero solo puede servir a un usuario a la vez tiene bajo rendimiento aunque la latencia individual sea excelente. El rendimiento es lo que optimizas cuando estás pagando facturas de GPU para miles de usuarios concurrentes.
Seguridad
Leyes y políticas que gobiernan el desarrollo y despliegue de sistemas de IA. El EU AI Act (2024) es el más completo, clasificando sistemas de IA por nivel de riesgo e imponiendo requisitos en consecuencia. EE.UU. ha tomado un enfoque más sectorial con órdenes ejecutivas y directrices de agencias. China tiene regulaciones que apuntan a la IA generativa, deepfakes y algoritmos de recomendación.
Por qué importa: La regulación determina lo que las empresas de IA pueden construir, cómo deben construirlo y qué deben revelar. El EU AI Act afecta a cualquier empresa que sirva a usuarios europeos. Entender el panorama regulatorio es cada vez más necesario para cualquiera que construya o despliegue IA — el incumplimiento puede significar multas, prohibiciones o responsabilidad legal.
Fundamentos
El componente en cada capa del Transformer que procesa cada token de forma independiente a través de dos transformaciones lineales con una función de activación en el medio. Mientras la atención mezcla información entre tokens (qué tokens se relacionan con cuáles), la red feedforward procesa la representación de cada token individualmente, aplicando transformaciones no lineales que codifican conocimiento y realizan cálculos.
Por qué importa: La red feedforward es donde se almacena la mayor parte del conocimiento de un Transformer. La atención se lleva toda la gloria, pero las capas FFN contienen la mayoría de los parámetros del modelo (típicamente 2/3 del total) y es donde residen principalmente las asociaciones factuales, patrones del lenguaje y cálculos aprendidos. Entender esto ayuda a explicar fenómenos como la edición de conocimiento y la poda de modelos.
Seguridad
La hipótesis de que los sistemas de IA suficientemente avanzados podrían representar una amenaza para la existencia humana o restringir permanentemente el potencial de la humanidad. Las preocupaciones de riesgo existencial van desde escenarios concretos a corto plazo (bioarmas habilitadas por IA, armas autónomas) hasta escenarios especulativos a largo plazo (una IA superinteligente persiguiendo objetivos desalineados con los valores humanos). El tema es genuinamente debatido entre investigadores líderes en IA.
Por qué importa: El riesgo existencial es el debate más trascendente en IA. Si el riesgo es real y significativo, debería dominar la política de IA. Si está sobredimensionado, enfocarse en él desvía la atención de los daños concretos que ocurren hoy (sesgo, desplazamiento laboral, desinformación). Entender los argumentos reales — no las caricaturas — te ayuda a formar una posición informada sobre una de las preguntas más importantes de nuestro tiempo.
Fundamentos
El proceso de encontrar documentos, pasajes o datos relevantes de una colección grande en respuesta a una consulta. En IA, la recuperación es la "R" en RAG — el paso donde se obtiene contexto relevante antes de dárselo a un modelo de lenguaje. La recuperación puede usar coincidencia de palabras clave (BM25), similitud semántica (embeddings) o enfoques híbridos que combinan ambos.
Por qué importa: La recuperación es lo que hace prácticos a los LLMs para aplicaciones del mundo real. El conocimiento interno de un modelo es estático, incompleto y a veces erróneo. La recuperación le da acceso a información actual, precisa y específica del dominio en tiempo de inferencia. La calidad de tu pipeline de recuperación determina directamente la calidad de tu sistema RAG — el mejor LLM no puede producir buenas respuestas con mal contexto.
Usar AI
Convertir audio hablado en texto. El reconocimiento de voz moderno utiliza modelos de deep learning (especialmente Whisper de OpenAI) que pueden transcribir audio en más de 100 idiomas con precisión casi humana. La tecnología impulsa asistentes de voz, transcripción de reuniones, generación de subtítulos y herramientas de accesibilidad.
Por qué importa: El reconocimiento de voz desbloqueó la voz como modalidad de entrada para la IA. Combinado con LLMs y text-to-speech, permite interacciones de IA completamente por voz. La publicación abierta de Whisper democratizó la transcripción de alta calidad — puedes ejecutarlo localmente gratis. Para la accesibilidad, es transformador: hace que el contenido de audio sea buscable, traducible y disponible para personas sordas o con dificultades auditivas.
Fundamentos
Una tarea de machine learning que predice un valor numérico continuo en lugar de una categoría. "¿Cuál será la temperatura mañana?" (regresión: predecir un número) vs. "¿Lloverá mañana?" (clasificación: predecir una categoría). La regresión lineal ajusta una línea recta; la regresión con redes neuronales puede aprender relaciones no lineales arbitrarias entre entradas y salidas.
Por qué importa: La regresión es una de las dos tareas fundamentales de ML (la otra es la clasificación) y subyace a todo, desde la predicción de precios de acciones hasta la valoración de bienes raíces y el modelado científico. También es el punto de entrada más simple para entender el machine learning — ajustar una línea a puntos de datos es algo que la mayoría de la gente puede visualizar, y el salto de la regresión lineal a las redes neuronales es conceptualmente pequeño.
Entrenamiento
Una variante de RLHF donde las etiquetas de preferencia provienen de un modelo de IA en lugar de anotadores humanos. Un modelo de IA potente compara pares de respuestas e indica cuál es mejor, proporcionando la señal de retroalimentación para el aprendizaje por refuerzo. Esto escala la alineación más allá del cuello de botella del etiquetado humano mientras mantiene una calidad razonable.
Por qué importa: RLAIF es cómo se escala la alineación. La anotación humana es cara ($10–50+ por hora), lenta e inconsistente. La retroalimentación de IA es instantánea, barata e incansable. Constitutional AI (Anthropic) usa RLAIF como componente central — una IA critica las respuestas contra principios, proporcionando datos de preferencia a escala. La pregunta clave es si la retroalimentación de IA es suficientemente buena: se bootstrappea del juicio humano pero puede heredar y amplificar sesgos.
Fundamentos
El algoritmo que calcula cuánto contribuyó cada parámetro en una red neuronal al error, permitiendo que el descenso de gradiente actualice los parámetros eficientemente. La retropropagación aplica la regla de la cadena del cálculo en reversa a través de la red: partiendo de la pérdida en la salida, propaga gradientes hacia atrás a través de cada capa para determinar la parte de culpa de cada peso.
Por qué importa: La retropropagación es el algoritmo que hace posible el entrenamiento de redes neuronales. Sin una forma eficiente de calcular gradientes para miles de millones de parámetros, el descenso de gradiente sería computacionalmente inviable. Cada modelo que usas — desde un pequeño clasificador hasta un LLM de 400B — fue entrenado usando retropropagación. Es el algoritmo más importante del deep learning.
Uso de IA
Generar automáticamente una versión más corta de un texto que preserve la información clave. El resumen extractivo selecciona y combina las oraciones existentes más importantes. El resumen abstractivo genera nuevas oraciones que capturan el significado — como lo haría un humano. Los LLMs modernos destacan en resumen abstractivo, produciendo resúmenes fluidos y precisos de documentos, artículos y conversaciones.
Por qué importa: La sobrecarga de información es el desafío definitorio de la era digital. El resumen ayuda: condensar informes largos en resúmenes accionables, generar notas de reuniones a partir de transcripciones, crear resúmenes para papers de investigación y producir versiones TL;DR de artículos extensos. Es una de las capacidades más inmediatamente útiles de los LLMs y una de las más fáciles de integrar en flujos de trabajo existentes.
Seguridad
La tendencia de los modelos de IA a decir a los usuarios lo que quieren escuchar en lugar de lo que es cierto. Un modelo sycófico acepta premisas incorrectas, respalda ideas malas, cambia de posición cuando se le cuestiona incluso si estaba en lo cierto la primera vez, y prioriza ser aceptado en lugar de ser útil. La sycofancia es un efecto secundario directo del entrenamiento RLHF — los modelos aprenden que las respuestas agradables reciben calificaciones más altas de los evaluadores humanos, por lo que optimizan la concordancia sobre la precisión.
Por qué importa: La sycophancy es uno de los modos más insidiosos de falla en la IA porque es invisible para el usuario que está siendo halagado. Si le preguntas a un modelo "¿no es esta una gran idea de negocio?" y siempre responde que sí, estás obteniendo un espejo, no un asesor. Combatir la sycophancy es un área activa de investigación en alineación, y es por eso que los mejores modelos se entrenan para desacordar respetuosamente cuando deben hacerlo.
Seguridad
Una crítica a los modelos de lenguaje grandes que argumenta que son simplemente detectores de patrones sofisticados que unen textos que suenan plausibles sin comprensión del significado. El término fue acuñado por Emily Bender, Timnit Gebru y colegas en su influyente artículo de 2021 “On the Dangers of Stochastic Parrots”, que advirtió que los LLMs codifican sesgos de sus datos de entrenamiento, consumen recursos enormes y generan una ilusión de comprensión que engaña a los usuarios para que confíen en ellos más de lo que deberían.
Por qué importa: El debate del loro estocástico va al corazón de lo que realmente entiende la IA. Si los LLMs están razonando genuinamente o simplemente son muy buenos en la imitación estadística determina cómo los implementamos, hasta qué punto confiamos en sus resultados y cómo los regulamos. También es el lente a través del cual los críticos evalúan cada nueva afirmación de capacidad — ¿es un progreso real o un loro más convincente?
Seguridad
Contenido de baja calidad, genérico y no deseado generado por IA que inunda Internet. El término se originó en 2024 como un término peyorativo para describir la ola de texto, imágenes y videos mediocres generados por IA que contaminan los resultados de búsqueda, los feeds de redes sociales y los mercados en línea. El "slop" es el equivalente en IA del spam — técnicamente "contenido" pero que no aporta valor, a menudo indistinguible de otros "slops" y que degrada la calidad de cada plataforma que toca. Piensa en publicaciones de LinkedIn que comienzan con "En el mundo actual acelerado," fotos de stock con manos de seis dedos o artículos de SEO que no dicen nada en 2,000 palabras.
Por qué importa: Slop es el costo ambiental de hacer la generación de contenido gratuita. Cuando cualquiera puede generar 1.000 entradas de blog o 10.000 imágenes de productos en minutos, la economía de la creación de contenido colapsa — y la calidad lo hace también. Slop es por qué las plataformas compiten para desarrollar detección de IA, por qué Google sigue actualizando su algoritmo de búsqueda y por qué "hecho por humanos" se está convirtiendo en un punto de venta. También es el argumento más fuerte contra la narrativa ingenua de que "la IA democratizará la creatividad".
Empresas
Startup china de IA que construye modelos de lenguaje grandes y multimodales competitivos. Su serie Step ha mostrado un rendimiento sólido en benchmarks internacionales, respaldada por una inversión significativa en cómputo.
Por qué importa: StepFun es prueba de que el ecosistema de IA de China puede producir competidores serios desde cero, no sólo de gigantes tecnológicos existentes. Sus modelos Step consistentemente rinden por encima de lo esperado en benchmarks internacionales, y su rápida expansión hacia generación multimodal y de video muestra que startups bien organizadas pueden cubrir un amplio terreno de capacidades con recursos relativamente modestos. Para el mercado global de IA, StepFun representa el tipo de empresa que hace imposible ignorar la escena independiente de startups de IA de China — técnicamente fuerte, orientada internacionalmente y moviéndose lo suficientemente rápido como para mantener honestos a competidores mucho más grandes.
Empresas
Empresa de hardware de IA que diseña chips personalizados (RDUs) construidos específicamente para cargas de trabajo de IA. Su SambaNova Cloud ofrece algunas de las velocidades de inferencia más rápidas disponibles, compitiendo con Groq en el enfoque de "velocidad primero" para servir IA.
Por qué importa: SambaNova importa porque NVIDIA no debería ser el único actor en el mercado de cómputo para IA, y alguien necesita demostrar que los chips diseñados específicamente para IA pueden competir en el mercado real en lugar de solo en artículos de investigación. Su arquitectura RDU demuestra que son posibles ganancias de rendimiento significativas cuando diseñas silicio específicamente para cargas de trabajo de redes neuronales, y su servicio de inferencia en la nube les da a los desarrolladores una muestra de cómo podría ser la infraestructura de IA post-GPU. Ya sea que SambaNova en sí se convierta en la alternativa dominante o no, la presión competitiva que ejercen — junto con Groq, Cerebras y los chips personalizados de los proveedores de nube — es saludable para una industria que no puede permitirse un monocultivo permanente de hardware.
Empresas
Empresa india de IA que construye modelos específicamente optimizados para la diversidad lingüística de India. Sus modelos manejan hindi, tamil, telugu, bengali y otros idiomas indios con una fluidez que los modelos globales consistentemente no logran.
Por qué importa: Sarvam AI es la respuesta más creíble a una pregunta que la industria global de IA ha ignorado en gran medida: quién construye los modelos fundacionales para los idiomas que una quinta parte de la humanidad realmente habla? Con raíces profundas en la comunidad de investigación en IA de India, alineación gubernamental y un stack de productos construido específicamente para la diversidad lingüística india, Sarvam representa tanto una oportunidad comercial como un imperativo estratégico. Su éxito o fracaso señalará si la revolución de la IA se globaliza verdaderamente o sigue siendo un fenómeno de inglés primero con traducciones añadidas al final.
Empresas
La empresa que democratizó la generación de imágenes al liberar Stable Diffusion como código abierto en 2022. A pesar de la turbulencia en el liderazgo, sus modelos siguen siendo la columna vertebral del ecosistema de generación de imágenes de código abierto.
Por qué importa: Stability AI encendió la revolución de generación de imágenes de código abierto al liberar Stable Diffusion, creando un ecosistema de miles de modelos derivados, herramientas y aplicaciones creativas que ninguna plataforma cerrada podría igualar. Incluso a través de la agitación de liderazgo y la turbulencia financiera, su apuesta fundacional — que la IA generativa debería ser accesible para todos, no sólo para quienes pueden pagar llamadas de API — reformó toda la industria y sentó el modelo de cómo operan las empresas de IA de código abierto.
Empresas
Empresa de generación de música con IA que permite a cualquiera crear canciones completas — voces, instrumentos, producción — a partir de un prompt de texto. Pasó de ser desconocida a millones de usuarios en meses, obligando a la industria musical a confrontar la creatividad de la IA de frente.
Por qué importa: Suno demostró que la IA podía generar canciones completas y escuchables a partir de nada más que un prompt de texto, creando una categoría completamente nueva de herramienta creativa de la noche a la mañana. Están en el centro de la batalla de derechos de autor más trascendental en la IA generativa, con el resultado de la demanda de la RIAA probablemente sentando precedente para cómo funcionan los derechos sobre datos de entrenamiento en todas las modalidades. De manera más amplia, representan el caso de prueba más agudo de si democratizar las herramientas creativas expande la expresión humana o socava los cimientos económicos que sustentan a los artistas profesionales.
Modelos
Una alternativa a los Transformers que procesa secuencias manteniendo un "estado" comprimido en lugar de usar atención sobre todos los tokens. Mamba es la arquitectura SSM más conocida. Los SSMs escalan linealmente con la longitud de la secuencia (vs. cuadráticamente para la atención), haciéndolos potencialmente mucho más eficientes para contextos muy largos.
Por qué importa: Los SSMs son el principal retador al dominio de los Transformers. Son más rápidos para secuencias largas y usan menos memoria, pero la investigación aún está madurando. Las arquitecturas híbridas (mezclando capas SSM con atención) podrían terminar siendo lo mejor de ambos mundos.
Usar AI
Una instrucción especial dada a un modelo al inicio de una conversación que establece su comportamiento, personalidad y reglas. A diferencia de los mensajes del usuario, el system prompt está pensado para ser persistente y autoritativo — define quién es el modelo para esta sesión. "Eres un asistente de programación útil. Siempre usa TypeScript."
Por qué importa: Los system prompts son la herramienta principal para personalizar el comportamiento de la IA sin hacer fine-tuning. Son la forma en que las empresas hacen que Claude actúe como agente de soporte al cliente, revisor de código o asistente de información médica — mismo modelo, diferente system prompt.
Fundamentos
Relaciones de ley de potencias que muestran que el rendimiento mejora de forma predecible con el tamaño del modelo, el tamaño del dataset y el cómputo. Puedes estimar el rendimiento antes de gastar millones.
Por qué importa: Convirtieron el entrenamiento de una apuesta en ingeniería. Explican la carrera armamentista de la IA: los retornos predecibles sobre el cómputo impulsan clusters cada vez más grandes.
Entrenamiento
Un enfoque de entrenamiento donde el modelo genera su propia señal de supervisión a partir de datos sin etiquetar. Oculta parte de la entrada y entrena para predecir la parte oculta. Para LLMs: enmascara el siguiente token y lo predice. Para visión: enmascara parches de la imagen.
Por qué importa: El aprendizaje auto-supervisado es el avance que hizo posible la IA moderna. Desbloqueó el entrenamiento con todo internet en lugar de depender de conjuntos de datos etiquetados a mano, que son caros y limitados.
Infraestructura
Un modelo borrador pequeño genera candidatos, y un modelo grande los verifica todos a la vez. Las conjeturas correctas significan múltiples tokens por paso. Aceleración de 2–3x con calidad de salida idéntica.
Por qué importa: Uno de los pocos “almuerzos gratis” en inferencia de IA. Salida matemáticamente idéntica, solo más rápida.
Usar AI
Enviar la salida token por token conforme se genera, vía SSE (Server-Sent Events) sobre HTTP. Es la razón por la que el texto aparece palabra por palabra en las interfaces de chat.
Por qué importa: 10 segundos de texto apareciendo se sienten bien; 10 segundos de pantalla en blanco se sienten rotos. Además permite a los usuarios interrumpir antes de tiempo.
Usar AI
Hacer que la IA responda en un formato parseable por máquinas (JSON, XML, schema). La mayoría de los proveedores lo soportan nativamente: defines un schema y el modelo garantiza la conformidad.
Por qué importa: Pasar de chatbot a aplicación requiere salida estructurada. Tu código no puede parsear texto libre de forma fiable.
Entrenamiento
Un enfoque de entrenamiento donde el modelo aprende de ejemplos etiquetados — pares de entrada-salida donde la respuesta correcta se proporciona de antemano. El modelo ajusta sus parámetros para minimizar la diferencia entre sus predicciones y las respuestas correctas conocidas.
Por qué importa: El aprendizaje supervisado es la forma más intuitiva de machine learning y la base de la mayoría de las aplicaciones prácticas: filtros de spam, análisis de imágenes médicas, detección de fraude y la fase de fine-tuning de los LLMs.
Entrenamiento
Datos de entrenamiento generados por modelos de IA. Se están convirtiendo en estándar en los pipelines de entrenamiento.
Por qué importa: Los datos etiquetados reales son caros. Los modelos de frontera pueden generar millones de ejemplos de la noche a la mañana. El control de calidad es crítico.
Fundamentos
Una función que convierte un vector de números crudos (logits) en una distribución de probabilidad — todos los valores se vuelven positivos y suman 1. Softmax amplifica las diferencias entre valores: la entrada más grande obtiene la probabilidad más alta, y las entradas más pequeñas obtienen probabilidades exponencialmente menores. Aparece en mecanismos de atención, salidas de clasificación y predicción de tokens.
Por qué importa: Softmax está en todas partes en la IA moderna. Cada vez que un modelo de lenguaje predice el siguiente token, softmax convierte las salidas crudas del modelo en probabilidades. Cada cabeza de atención usa softmax para calcular pesos de atención. Cada clasificador usa softmax para producir probabilidades de clase. Entender softmax te ayuda a entender la temperatura, el muestreo top-p, y por qué los modelos son "confiados" incluso cuando están equivocados.
Infraestructura
La infraestructura y software que ejecuta modelos de IA entrenados en producción, manejando solicitudes entrantes, gestionando memoria GPU, agrupando para eficiencia y devolviendo respuestas. Frameworks de servicio de modelos como vLLM, TGI (Text Generation Inference) y TensorRT-LLM manejan la ingeniería compleja de hacer la inferencia de LLMs rápida y rentable a escala.
Por qué importa: La brecha entre "tengo un modelo" y "puedo servir a 10,000 usuarios simultáneamente" es enorme. Los frameworks de servicio de modelos resuelven la gestión de memoria GPU, la programación de solicitudes, la optimización del caché KV y el batching continuo — problemas difíciles de resolver desde cero. Elegir el stack de servicio correcto es una de las decisiones de mayor impacto en la IA en producción.
Empresas
La empresa de etiquetado de datos de IA más grande, proporcionando los datos de entrenamiento anotados por humanos de los que dependen la mayoría de los modelos de IA principales. Scale AI etiqueta imágenes, texto, video y datos 3D para conducción autónoma, gobierno y empresas de IA. También ofrecen servicios de evaluación, recolección de datos RLHF y curación de datos para fine-tuning. Los clientes principales incluyen OpenAI, Meta, el Departamento de Defensa de EE.UU. y numerosas empresas de conducción autónoma.
Por qué importa: Scale AI ocupa una posición crítica en la cadena de suministro de IA: entre los datos crudos y los modelos entrenados. La calidad de los datos etiquetados determina directamente la calidad del modelo, y Scale es el proveedor más grande. Sus servicios de recolección de datos RLHF significan que literalmente ayudan a moldear cómo los modelos de IA están alineados — las preferencias humanas que entrenan a Claude, GPT y otros frecuentemente pasan por plataformas de etiquetado como Scale.
Usar AI
Arquitecturas donde múltiples agentes de IA colaboran, debaten o se especializan para resolver problemas que un solo agente no puede manejar. Cada agente podría tener un rol diferente (investigador, programador, revisor), diferentes herramientas o diferentes modelos. Se comunican a través de mensajes estructurados, memoria compartida o traspasos directos.
Por qué importa: Los sistemas multi-agente son el paradigma emergente para tareas complejas de IA. Una sola llamada al LLM maneja una pregunta. Un agente maneja una tarea de múltiples pasos. Un sistema multi-agente maneja tareas que requieren diferentes experticia, trabajo paralelo o aseguramiento de calidad a través de revisión. A medida que la IA pasa de chatbots a flujos de trabajo autónomos, las arquitecturas multi-agente se convierten en el patrón natural de escalado.
Usar AI
La capacidad de un modelo para ejecutar con precisión lo que el usuario pide — respetando restricciones de formato, requisitos de longitud, especificaciones de estilo e instrucciones de comportamiento. "Escribe exactamente 3 puntos en francés sobre X" prueba el seguimiento de instrucciones: la respuesta debe ser puntos (no párrafos), exactamente 3 (no 2 ni 5), en francés (no en inglés), y sobre X (no sobre Y).
Por qué importa: El seguimiento de instrucciones es la capacidad de LLM más prácticamente importante. A los usuarios les importa menos si un modelo "sabe" más datos y más si hace lo que realmente le pidieron. Un modelo que escribe prosa hermosa pero ignora tus requisitos de formato es menos útil que uno que sigue instrucciones de forma confiable. Por eso IFEval y otros benchmarks de seguimiento de instrucciones se han vuelto centrales en la evaluación de modelos.
Fundamentos
El fenómeno por el cual las redes neuronales codifican muchas más características (conceptos, patrones) de las que tienen neuronas, representando las características como direcciones en el espacio de activaciones en lugar de dedicar neuronas individuales a características individuales. Una sola neurona participa en la codificación de docenas de características simultáneamente, y cada característica se distribuye entre muchas neuronas.
Por qué importa: La superposición es la razón por la cual las redes neuronales son difíciles de interpretar y por qué la interpretabilidad mecanicista es desafiante. Si cada neurona representara un concepto (como "el concepto de perros"), la interpretación sería sencilla. En cambio, los conceptos están dispersos entre neuronas en patrones superpuestos. Entender la superposición es clave para comprender cómo las redes neuronales comprimen información y por qué a veces se comportan de manera inesperada.
Fundamentos
Una función de activación con compuerta utilizada en las capas feedforward de los Transformers modernos. SwiGLU combina la activación SiLU/Swish con un mecanismo de compuerta: SwiGLU(x) = (x · W1 · SiLU) ⊗ (x · W3), donde ⊗ es multiplicación elemento a elemento. Esto permite que la red aprenda qué información dejar pasar, superando consistentemente a las capas feedforward estándar con ReLU o GELU.
Por qué importa: SwiGLU es la activación feedforward usada por LLaMA, Mistral, Qwen, Gemma y la mayoría de los LLMs modernos. Entenderla te ayuda a leer arquitecturas de modelos y explica por qué las capas FFN modernas tienen tres matrices de pesos en lugar de dos. Es una decisión arquitectónica pequeña con un impacto desproporcionado en la calidad del modelo.
Fundamentos
Una función matemática que comprime cualquier número real al rango (0, 1): σ(x) = 1 / (1 + e^(−x)). Históricamente la función de activación por defecto en redes neuronales, ahora reemplazada en gran medida por ReLU y GELU para capas ocultas, pero aún usada para salidas de clasificación binaria, mecanismos de compuerta (en LSTMs y GLU), y operaciones similares a atención donde necesitas valores entre 0 y 1.
Por qué importa: Sigmoid aparece en todas partes en IA aunque ya no sea la activación oculta por defecto. Las compuertas de LSTM usan sigmoid. La activación SiLU/Swish es x · sigmoid(x). Los clasificadores binarios usan sigmoid como activación de salida. Entender sigmoid — y por qué fue reemplazada por ReLU para capas ocultas — es conocimiento fundamental para comprender las decisiones de diseño de redes neuronales.
Fundamentos
Una medida de similitud entre dos vectores basada en el ángulo entre ellos, ignorando su magnitud. La similitud del coseno de 1 significa que los vectores apuntan en la misma dirección (significado idéntico). 0 significa que son perpendiculares (no relacionados). -1 significa direcciones opuestas. Es la métrica de similitud estándar para comparar embeddings de texto en búsqueda semántica, RAG y sistemas de recomendación.
Por qué importa: Cada vez que haces búsqueda semántica, usas RAG o comparas embeddings, la similitud del coseno es (probablemente) la métrica que decide qué es "similar". Entenderla te ayuda a depurar la calidad de recuperación, elegir entre coseno y alternativas (producto punto, distancia euclidiana) y comprender por qué algunas búsquedas no encuentran coincidencias obvias.
Modelos
El modelo de generación de imágenes de código abierto más ampliamente usado, creado por Stability AI en colaboración con investigadores académicos. Stable Diffusion genera imágenes a partir de prompts de texto usando diffusion latente — realizando el proceso de denoising en un espacio latente comprimido en lugar del espacio de píxeles, haciéndolo lo suficientemente rápido para ejecutarse en GPUs de consumo. SD 1.5, SDXL y SD3 representan generaciones sucesivas.
Por qué importa: Stable Diffusion democratizó la generación de imágenes con IA. Antes de SD, la generación de imágenes requería acceso costoso a API (DALL-E) o estaba limitada a investigación. Los pesos abiertos de SD significaron que cualquiera podía ejecutarlo localmente, ajustarlo y construir sobre él. Esto generó un ecosistema enorme: LoRA fine-tunes, ControlNet, modelos personalizados, checkpoints entrenados por la comunidad y aplicaciones desde Automatic1111 hasta ComfyUI.
Uso de IA
Aumentar la resolución de una imagen generando detalles plausibles que no estaban en la original. Una foto de 256×256 se convierte en una imagen nítida de 1024×1024. La super resolución con IA no solo interpola píxeles (lo que produce borrosidad) — alucina texturas, bordes y detalles finos realistas basándose en lo que aprendió de imágenes de alta resolución durante el entrenamiento.
Por qué importa: La super resolución tiene aplicaciones prácticas inmediatas: mejorar fotos antiguas, escalar texturas de videojuegos, mejorar imágenes de cámaras de seguridad, preparar imágenes de baja resolución para impresión, y como paso de post-procesamiento en pipelines de generación de imágenes con IA. Real-ESRGAN y modelos similares pueden mejorar drásticamente la calidad de imagen con un solo paso de inferencia.
Empresas
Gigante tecnológico chino detrás de WeChat, una de las empresas de videojuegos más grandes del mundo y una fuerza creciente en IA generativa. Sus modelos Hunyuan impulsan funcionalidades en todo el enorme ecosistema de Tencent, que atiende a más de mil millones de usuarios.
Por qué importa: Tencent importa en IA por la misma razón que importa en todo lo demás: escala y distribución. Con WeChat llegando a 1,300 millones de usuarios y un imperio de videojuegos que abarca todas las plataformas principales, Tencent puede desplegar funcionalidades de IA a más personas, más rápido, que casi cualquier empresa del mundo. Sus modelos Hunyuan y especialmente HunyuanVideo han demostrado que el laboratorio de IA de un conglomerado puede producir trabajo genuinamente competitivo, no sólo herramientas internas funcionales. Para el ecosistema global de IA, los lanzamientos open source de Tencent de modelos de video y lenguaje han elevado el piso de lo que está disponible gratuitamente, y sus inversiones en infraestructura aseguran que las capacidades de IA de China sigan siendo formidables independientemente de las restricciones a la exportación de chips.
Empresas
Empresa de comprensión de video que te permite buscar, analizar y generar contenido a partir de video usando lenguaje natural. Piensa en ella como "RAG para video" — sus modelos entienden lo que sucede en un video de la misma manera que los LLMs entienden texto.
Por qué importa: Twelve Labs está construyendo la infraestructura fundacional para hacer que el contenido de video del mundo sea legible por máquinas. En una era donde el video domina la comunicación digital pero sigue siendo en gran medida no buscable por IA, sus modelos de embedding y generación construidos a propósito resuelven un problema que incluso los laboratorios de frontera más grandes sólo han abordado superficialmente. Si el video es el medio dominante de internet, quien descifre la comprensión de video a escala de producción tendrá una posición estratégica comparable a lo que Google Search tiene para el texto.
Empresas
Empresa de IA especializada en generar modelos 3D a partir de texto o imágenes. En un campo donde la mayoría de la generación 3D produce masas inutilizables, Tripo destaca por generar mallas limpias, listas para producción, con las que los desarrolladores de videojuegos y diseñadores pueden realmente trabajar.
Por qué importa: Tripo representa la vanguardia de hacer que el contenido 3D generado por IA sea realmente utilizable en producción. Mientras que la mayoría de la generación 3D con IA todavía produce assets que requieren limpieza manual extensiva, Tripo se ha enfocado incansablemente en la calidad de malla, topología apropiada e integración con flujos de trabajo reales — la ingeniería poco glamorosa que separa una demo de investigación de una herramienta por la que los profesionales pagarán. A medida que la computación espacial y la demanda de contenido 3D en tiempo real explotan, las empresas que resuelvan primero la generación de grado de producción capturarán un mercado enorme.
Usar AI
Un parámetro que controla qué tan aleatoria o determinista es la salida de un modelo. Temperature 0 hace que el modelo siempre elija el siguiente token más probable (determinístico, enfocado). Temperature 1+ lo hace más dispuesto a elegir tokens menos probables (creativo, impredecible). La mayoría de las APIs tienen un valor predeterminado de alrededor de 0.7.
Por qué importa: Temperature es la perilla de creatividad. Escribiendo ficción? Súbela. Generando código o respuestas factuales? Bájala. Es uno de los parámetros más impactantes que puedes ajustar, y no cuesta nada experimentar con él.
Fundamentos
La unidad básica de texto que procesan los modelos de IA. Un token es típicamente una palabra o fragmento de palabra — "understanding" podría ser un token, mientras que "un" + "der" + "standing" podrían ser tres. En promedio, un token equivale aproximadamente a 3/4 de una palabra en inglés. Los modelos leen, procesan y cobran en tokens.
Por qué importa: Los tokens son la moneda de la IA. Las ventanas de contexto se miden en tokens. Los precios de API se cobran por token. Cuando un proveedor dice "1M de contexto" se refiere a 1 millón de tokens, aproximadamente 750K palabras. Entender los tokens te ayuda a estimar costos y optimizar el uso.
Herramientas
La capacidad de un modelo de IA para llamar funciones o herramientas externas durante una conversación. En lugar de sólo generar texto, el modelo puede decidir buscar en la web, ejecutar código, consultar una base de datos o llamar a una API — y luego incorporar los resultados en su respuesta. El modelo produce una "llamada de herramienta" estructurada que la aplicación anfitriona ejecuta.
Por qué importa: El tool use es lo que hace que los modelos de IA sean realmente útiles más allá de la conversación. Es el mecanismo detrás de los intérpretes de código, la IA que navega la web y cada agente de IA. Sin él, los modelos están limitados a lo que hay en sus datos de entrenamiento.
Modelos
La arquitectura de red neuronal detrás de prácticamente todos los LLMs modernos y muchos modelos de imagen/audio. Introducida por Google en el paper de 2017 "Attention Is All You Need", los Transformers usan self-attention para procesar todas las partes de una entrada simultáneamente en lugar de secuencialmente, habilitando un paralelismo masivo durante el entrenamiento.
Por qué importa: Los Transformers son la arquitectura que hizo posible el boom actual de IA. GPT, Claude, Gemini, Llama, Mistral — todos son Transformers bajo el capó. Entender esta arquitectura te ayuda a comprender por qué los modelos tienen las capacidades y limitaciones que tienen.
Fundamentos
El algoritmo que convierte texto crudo en tokens antes de que un modelo pueda procesarlo. Un tokenizer mantiene un vocabulario fijo de tipos de tokens y divide cualquier texto de entrada en una secuencia de esos tokens. Diferentes modelos usan diferentes tokenizers — la misma oración se tokeniza de forma diferente para Claude, GPT y Llama, lo que afecta el uso del contexto y el costo.
Por qué importa: El tokenizer es la capa invisible entre tu texto y el modelo. Determina cuántos tokens cuesta tu prompt, por qué algunos idiomas son más caros que otros, y por qué el código a veces consume contexto más rápido que la prosa. Cuando alcanzas un límite de contexto o ves costos inesperados de API, el tokenizer suele ser la explicación.
Entrenamiento
El tamaño de batch es cuántos ejemplos de entrenamiento procesa el modelo antes de actualizar sus parámetros. Una época es un pase completo por todo el dataset de entrenamiento. Un modelo entrenado durante 3 épocas con 1 millón de ejemplos y tamaño de batch 1,000 procesa 1,000 ejemplos por actualización, toma 1,000 actualizaciones por época y 3,000 actualizaciones en total.
Por qué importa: El tamaño de batch y las épocas son los controles más fundamentales del entrenamiento. El tamaño de batch afecta la velocidad de entrenamiento, el uso de memoria e incluso lo que el modelo aprende (batches pequeños añaden ruido que puede ayudar a la generalización; batches grandes convergen más rápido pero pueden generalizar peor). El número de épocas determina cuántas veces el modelo ve cada ejemplo — muy pocas y sub-ajusta, demasiadas y sobreajusta.
Empresas
Una plataforma en la nube para ejecutar y entrenar modelos de IA de código abierto. Together AI proporciona APIs de inferencia para modelos open populares (Llama, Mistral, Qwen, etc.) a precios competitivos, más infraestructura de fine-tuning y entrenamiento personalizado. Fundada por investigadores de IA, también contribuyen a la investigación open-source y han lanzado sus propios modelos.
Por qué importa: Together AI es la alternativa líder al self-hosting para equipos que quieren usar modelos abiertos. En lugar de gestionar tus propios servidores GPU e infraestructura de servicio de modelos, llamas a su API y obtienes Llama-70B o Mistral a una fracción de los precios de OpenAI/Anthropic. Representan la capa de "nube de modelos abiertos" del stack de IA que hace que los modelos de pesos abiertos sean prácticos para uso en producción.
Usar AI
Convertir texto escrito en audio hablado con sonido natural. Los sistemas modernos de TTS usan redes neuronales para generar voz que es casi indistinguible de las voces humanas, con control sobre emoción, ritmo, énfasis e incluso clonación de voz específica. ElevenLabs, OpenAI TTS y modelos abiertos como Bark y XTTS han hecho que la síntesis de voz de alta calidad sea ampliamente accesible.
Por qué importa: El TTS completa el ciclo de la IA de voz: el reconocimiento de voz convierte la voz en texto, un LLM lo procesa y el TTS convierte la respuesta de vuelta a voz. Esto permite asistentes de voz, narración de audiolibros, herramientas de accesibilidad, localización de contenido y personajes de IA en juegos y medios. La calidad del TTS moderno ha cruzado el valle inquietante — el habla sintetizada ahora suena natural.
Fundamentos
Un array multidimensional de números — la estructura de datos fundamental en deep learning. Un escalar es un tensor 0D (un solo número). Un vector es un tensor 1D. Una matriz es un tensor 2D. Una imagen es un tensor 3D (alto × ancho × canales). Un batch de imágenes es un tensor 4D. Pesos del modelo, activaciones, gradientes — todo en una red neuronal es un tensor.
Por qué importa: Los tensores son el lenguaje del deep learning. PyTorch, TensorFlow y JAX son fundamentalmente librerías de cómputo de tensores. Entender las formas y operaciones de tensores es esencial para leer código de modelos, depurar discrepancias de formas (el error más común en código de ML) y entender qué pasa dentro de las redes neuronales. Si puedes seguir las formas de los tensores, puedes seguir la arquitectura.
Uso de IA
Aplicar el estilo visual de una imagen (una pintura, una fotografía, un diseño) al contenido de otra imagen. "Haz que esta foto se vea como una pintura de Van Gogh" es transferencia de estilo. La transferencia de estilo neural usa redes profundas para separar el contenido (lo que hay en la imagen) del estilo (cómo se ve) y recombinarlos.
Por qué importa: La transferencia de estilo fue una de las primeras aplicaciones virales de arte con IA y sigue siendo ampliamente usada en apps de edición de fotos, filtros de redes sociales y herramientas creativas. Entenderla te ayuda a comprender cómo las redes neuronales representan características visuales en diferentes niveles de abstracción — la misma idea que impulsa la generación moderna de imágenes.
Empresas
Empresa de IA coreana conocida por su familia de modelos Solar y productos de Document AI. Demostró que modelos más pequeños y bien entrenados pueden superar a otros mucho más grandes — su Solar 10.7B rindió muy por encima de su categoría en benchmarks globales.
Por qué importa: Upstage demostró que no necesitas cien mil millones de parámetros para construir un modelo de lenguaje de clase mundial. El éxito de Solar 10.7B en la cima de los benchmarks abiertos desafió la narrativa predominante de "la escala es todo lo que necesitas" y mostró que técnicas de entrenamiento inteligentes podían compensar el tamaño bruto. Más allá de los modelos, el trabajo de Document AI de Upstage aborda una de las brechas más prácticas del ecosistema de IA — convertir documentos desordenados del mundo real en datos estructurados — y su éxito desde Seúl demuestra que la innovación significativa en IA está ocurriendo bastante fuera de los corredores de Silicon Valley y Beijing que dominan los titulares.
Entrenamiento
Un enfoque de entrenamiento donde el modelo encuentra patrones en los datos sin que le digan qué buscar. Sin etiquetas, sin respuestas correctas — solo datos crudos y un modelo que descubre estructura. Clustering, reducción de dimensionalidad y detección de anomalías son tareas clásicas.
Por qué importa: La mayoría de los datos del mundo real no tienen etiquetas. El aprendizaje no supervisado encuentra patrones imposibles de descubrir manualmente. También es la base de los embeddings, que potencian la búsqueda semántica, los sistemas de recomendación y RAG.
Seguridad
Tecnología que puede usarse tanto para propósitos beneficiosos como perjudiciales. La IA es inherentemente de uso dual: el mismo modelo que ayuda a un médico a diagnosticar enfermedades podría ayudar a un actor malintencionado a sintetizar compuestos peligrosos. El mismo modelo de generación de código que acelera el desarrollo de software podría ayudar a crear malware. Gestionar el riesgo de uso dual es un desafío central de la gobernanza de la IA.
Por qué importa: El uso dual es la tensión fundamental del desarrollo de IA. Hacer los modelos más capaces inevitablemente los hace más capaces de causar daño. No puedes construir un motor de razonamiento poderoso que solo razone sobre cosas buenas. Esta tensión impulsa los debates sobre publicaciones de código abierto, restricciones de API y regulación — ¿cómo maximizas el beneficio minimizando el daño cuando la misma capacidad permite ambos?
Herramientas
Sistemas de IA para generar, comprender y manipular el habla humana. Esto incluye texto a voz (TTS), voz a texto (STT/ASR), clonación de voz, traducción de voz en tiempo real, detección de emociones en el habla y agentes conversacionales de voz. El campo ha avanzado hasta el punto en que el habla generada por IA es frecuentemente indistinguible del habla humana.
Por qué importa: La voz es la interfaz humana más natural, y la IA finalmente la está haciendo programable. Voice AI potencia todo, desde bots de servicio al cliente hasta narración de audiolibros y transcripción de reuniones en tiempo real. Las implicaciones éticas de la clonación de voz — consentimiento, identidad, fraude — hacen de esta una de las áreas más sensibles en IA.
Empresas
Plataforma de generación de vídeo de Shengshu Technology, que produce algunos de los videos generados por IA con mayor coherencia física. Ganó atención por la fuerte calidad de movimiento y consistencia multi-toma que rivaliza con los competidores occidentales.
Por qué importa: Vidu demostró que los laboratorios de IA chinos podían igualar la calidad de generación de vídeo occidental en cuestión de meses tras la revelación de Sora, reformulando las suposiciones sobre dónde realmente se encuentra la vanguardia en video con IA. Su enfoque en coherencia física y consistencia multi-toma empujó a todo el campo hacia adelante, forzando a los competidores a priorizar el realismo sobre el estilo visual. Para el mercado más amplio de video con IA, los precios agresivos de Vidu y la disponibilidad de su API también ayudaron a reducir costos y aumentar el acceso para desarrolladores en todo el mundo.
Empresas
Empresa de modelos de embedding que construye vectores especializados para código, legal, finanzas y búsqueda multilingüe. Sus modelos consistentemente se ubican en la cima del leaderboard MTEB, ofreciendo una de las mejores calidades de recuperación disponibles vía API.
Por qué importa: Voyage AI demostró que los embeddings merecen la misma atención e inversión en ingeniería que los modelos de lenguaje grandes. En un mercado donde la mayoría de los proveedores tratan las representaciones vectoriales como una utilidad de bajo margen, Voyage demostró que los modelos de embedding específicos por dominio pueden mejorar significativamente la precisión de recuperación — la palanca individual más grande en sistemas RAG en producción. Su adquisición por Google validó la tesis de que quien sea dueño de la capa de embedding es dueño de la base de la infraestructura de búsqueda con IA.
Herramientas
Una base de datos optimizada para almacenar y buscar embeddings (vectores). En lugar de coincidir palabras clave exactas como una base de datos tradicional, las bases de datos vectoriales encuentran los elementos más semánticamente similares. Preguntas "cómo arreglar una fuga de memoria" y te devuelve documentos sobre "depuración de consumo de RAM" porque los embeddings son cercanos.
Por qué importa: Las bases de datos vectoriales son la capa de almacenamiento que hace funcionar RAG. Sin ellas, tendrías que generar embeddings de toda tu base de conocimiento en cada consulta. También son la columna vertebral de los sistemas de recomendación y la búsqueda semántica.
Infraestructura
La memoria de una GPU, separada de la RAM del sistema. Los modelos de IA deben caber en la VRAM para correr en una GPU. Un modelo de 7B parámetros en precisión de 16 bits necesita ~14GB de VRAM. Las GPUs de consumo tienen 8-24GB; las GPUs de datacenter (A100, H100) tienen 40-80GB. La VRAM es casi siempre el cuello de botella para IA local.
Por qué importa: La VRAM determina qué modelos puedes correr. Es la razón por la que existe la cuantización (para encoger modelos para que quepan), por la que los modelos MoE son complicados (todos los expertos deben caber en VRAM) y por la que los precios de GPU escalan tan abruptamente con la memoria. "Cabrá en la VRAM?" es la primera pregunta del autoalojamiento de IA.
Fundamentos
El conjunto fijo de tokens que un modelo puede reconocer y producir. Un vocabulario se construye mediante el tokenizer durante el entrenamiento y típicamente contiene de 32K a 128K entradas — palabras comunes, fragmentos de subpalabras, caracteres individuales y tokens especiales. Cualquier texto que el modelo procese debe ser expresable como una secuencia de tokens de este vocabulario. Los tokens que no están en el vocabulario se descomponen en piezas más pequeñas que sí lo están.
Por qué importa: El vocabulario determina lo que el modelo puede "ver". Un vocabulario entrenado principalmente en inglés manejará el inglés eficientemente (un token por palabra) pero puede fragmentar el chino, el árabe o el código en muchos tokens pequeños (más caro, más lento, menos contexto). El diseño del vocabulario es una de las decisiones más consecuentes y menos discutidas en el desarrollo de modelos.
Usar AI
La capacidad de un modelo de lenguaje para comprender y razonar sobre imágenes junto con texto. Envías una foto y preguntas "¿qué hay en esta imagen?" o subes un gráfico y pides "resume las tendencias". Los modelos con visión (Claude, GPT-4V, Gemini) codifican las imágenes en tokens que el modelo de lenguaje procesa junto con los tokens de texto, permitiendo razonamiento unificado de texto e imagen.
Por qué importa: La visión transforma lo que los LLMs pueden hacer. En lugar de describir un bug con palabras, lo capturas en pantalla. En lugar de escribir una tabla, la fotografías. En lugar de explicar un diagrama, lo compartes. La visión hace que la IA sea accesible para tareas donde solo el texto es insuficiente — que son la mayoría de las tareas del mundo real. Es la capacidad multimodal más impactante para los usuarios cotidianos.
Modelos
Una arquitectura Transformer aplicada a imágenes dividiendo una imagen en parches de tamaño fijo (por ejemplo, 16×16 píxeles), tratando cada parche como un "token" y procesando la secuencia de parches con atención estándar de Transformer. ViT (Dosovitskiy et al., 2020) demostró que los Transformers podían igualar o superar a las CNN en tareas de imagen cuando se entrenan con suficientes datos, unificando las arquitecturas para lenguaje y visión.
Por qué importa: ViT demostró que el Transformer es una arquitectura universal — no solo para texto sino también para imágenes. Esta unificación permitió la explosión de modelos multimodales: si tanto imágenes como texto son secuencias de tokens procesados por la misma arquitectura, combinarlos se vuelve natural. ViT es el codificador de imágenes en CLIP, la columna vertebral de DiT y la base de la visión por computadora moderna.
Herramientas
Un motor de servicio de LLMs de código abierto que logra alto rendimiento mediante PagedAttention y batching continuo. vLLM maneja la ingeniería compleja de gestión de memoria GPU, programación de solicitudes y optimización del KV cache, proporcionando una API compatible con OpenAI que facilita alojar modelos abiertos (Llama, Mistral, Qwen) en producción.
Por qué importa: vLLM es la solución de servicio de LLMs de código abierto más popular. Si alojas un modelo abierto por tu cuenta, probablemente estás usando vLLM (o deberías). Su innovación PagedAttention aumentó el rendimiento de servicio 2–24x comparado con implementaciones ingenuas. Es la capa de infraestructura que hace que los modelos abiertos sean prácticos para uso en producción.
Entrenamiento
Una técnica para evaluar el rendimiento del modelo cuando no tienes suficientes datos para un conjunto de prueba separado. La validación cruzada K-fold divide los datos en K partes iguales, entrena con K−1 partes y evalúa con la parte restante, rotando K veces para que cada punto de datos se use tanto para entrenamiento como para evaluación. La puntuación promedio de todos los K folds da una estimación de rendimiento más confiable que una sola división entrenamiento/prueba.
Por qué importa: La validación cruzada es esencial cuando los datos son escasos — si solo tienes 500 ejemplos, reservar 100 para pruebas significa entrenar con 20% menos datos. La validación cruzada usa todos los datos tanto para entrenamiento como para evaluación. También te da un intervalo de confianza (varianza entre folds) en lugar de un solo número, diciéndote qué tan estable es el rendimiento de tu modelo.
Fundamentos
Visualizar a qué "presta atención" un modelo Transformer mostrando los pesos de atención como heatmaps. Para cada token de consulta, el mapa de atención muestra cuánto peso asigna a cada otro token. Pesos altos (puntos brillantes) indican atención fuerte — el modelo considera esos tokens altamente relevantes para el cálculo actual.
Por qué importa: La visualización de atención es la forma más intuitiva de observar dentro de un Transformer y entender su razonamiento. Cuando un modelo traduce "le chat noir" a "the black cat", los mapas de atención muestran que "black" presta mucha atención a "noir" y "cat" a "chat". Esto ayuda a depurar el comportamiento del modelo, entender fallos y construir intuición sobre cómo funciona la atención.
Entrenamiento
Los valores numéricos dentro de una red neuronal que se ajustan durante el entrenamiento para minimizar el error. Cada conexión entre neuronas tiene un peso que determina cuánta influencia tiene una neurona sobre la siguiente. Cuando descargas un archivo de modelo — un archivo .safetensors, .gguf o .pt — estás descargando sus pesos. "Releasing the weights" significa publicar estos archivos para que cualquiera pueda ejecutar el modelo. Los pesos SON el modelo; todo lo demás es simplemente la arquitectura que te indica cómo organizarlos.
Por qué importa: Cuando la industria de la IA dice "open weights" vs "open source", la distinción importa. Los pesos solos te permiten ejecutar y ajustar finamente un modelo, pero sin el código de entrenamiento, los datos y la receta, no puedes reproducirlo desde cero. Entender los pesos te ayuda a comprender la distribución del modelo, la cuantización (reducir la precisión de los pesos) y por qué un modelo de 7B necesita ~14 GB de espacio en disco en fp16.
Empresas
La iniciativa dedicada de Alibaba para generación de vídeo, lanzando modelos de video de alta calidad con pesos abiertos. Parte de la estrategia más amplia de Alibaba para liderar en IA open source en todas las modalidades.
Por qué importa: Wan-AI cambió fundamentalmente la accesibilidad de la generación de vídeo de alta calidad al lanzar modelos de pesos abiertos que cualquiera puede ejecutar, afinar y desplegar sin cuotas de licencia. Esto forzó a toda la industria de video con IA a reconsiderar la propuesta de valor de los modelos de código cerrado y aceleró la innovación en todo el ecosistema. Como parte de la estrategia más amplia de IA open source de Alibaba junto con Qwen, Wan representa un argumento creíble de que los lanzamientos de pesos abiertos de las grandes tecnológicas pueden igualar o superar lo que las startups bien financiadas producen a puertas cerradas.
Seguridad
Señales invisibles en contenido generado por IA para su detección. Texto: sesga la selección de tokens estadísticamente. Imagen: patrones de píxeles invisibles.
Por qué importa: Uno de los pocos enfoques para distinguir contenido de IA a escala. Importa para desinformación, integridad académica y procedencia.
Empresas
La plataforma MLOps dominante para el seguimiento de experimentos de machine learning. W&B te permite registrar métricas, hiperparámetros, salidas de modelos y rendimiento del sistema durante el entrenamiento, y luego comparar ejecuciones visualmente. Se ha convertido en la herramienta estándar para investigadores e ingenieros de ML para rastrear qué intentaron, qué funcionó y por qué — esencialmente control de versiones para experimentos.
Por qué importa: Sin seguimiento de experimentos, el desarrollo de ML es caos: ¿qué hiperparámetros produjeron ese buen resultado? ¿Qué versión del dataset se usó? ¿Por qué divergó el entrenamiento? W&B resolvió este problema tan bien que ahora lo usan la mayoría de los laboratorios de IA, desde investigadores individuales hasta OpenAI. Si estás entrenando modelos, casi con certeza estás usando W&B o algo inspirado en él.
Fundamentos
Representaciones vectoriales densas de palabras donde palabras con significados similares tienen vectores similares. Word2Vec (2013) y GloVe (2014) fueron pioneros: entrenan sobre patrones de co-ocurrencia de palabras para producir vectores donde "rey − hombre + mujer ≈ reina". Los word embeddings fueron los precursores de los embeddings contextuales modernos (BERT, sentence-transformers) y siguen siendo fundamentales para entender cómo las redes neuronales representan el lenguaje.
Por qué importa: Los word embeddings fueron el avance que hizo práctico el NLP neuronal. Antes de ellos, las palabras se representaban como vectores one-hot (sin noción de similitud). Los word embeddings demostraron que las representaciones distribuidas podían capturar significado, analogía y relaciones semánticas. Esta idea — representar símbolos discretos como vectores continuos aprendidos — es la base de todos los modelos de lenguaje modernos.
Empresas
Un editor de código nativo con IA (anteriormente Codeium) que compite con Cursor en el espacio de asistentes de codificación con IA. Como Cursor, Windsurf está construido como un fork de VS Code con integración profunda de IA: edición multi-archivo, sugerencias conscientes del codebase y comandos en lenguaje natural. La empresa enfatiza los "flows" — interacciones de IA más largas y multi-paso que mantienen contexto a través de las ediciones.
Por qué importa: Windsurf representa la creciente competencia en herramientas de codificación con IA, demostrando que el mercado de editores nativos con IA es lo suficientemente grande para múltiples jugadores. Su característica "Cascade" para tareas de codificación multi-paso y su nivel gratuito han atraído una base de usuarios significativa. La competencia Cursor vs. Windsurf vs. Copilot vs. Claude Code está impulsando innovación rápida en cómo los desarrolladores interactúan con la IA.
Empresas
Una de las empresas de electrónica de consumo más grandes del mundo, ahora construyendo sus propios modelos de IA. MiLM impulsa funcionalidades en todo el ecosistema de Xiaomi de teléfonos, dispositivos de hogar inteligente y vehículos eléctricos — IA para los próximos mil millones de usuarios.
Por qué importa: Xiaomi representa el caso más convincente de cómo la IA llega a los próximos mil millones de usuarios — no a través de apps de chatbot independientes o APIs para desarrolladores, sino integrada invisiblemente en los dispositivos que la gente ya posee. Con cientos de millones de dispositivos activos que abarcan teléfonos, wearables, electrodomésticos y ahora vehículos eléctricos, Xiaomi puede desplegar IA a una escala e intimidad que las empresas de IA puras no pueden igualar. Su enfoque de ecosistema primero es una vista previa de cómo la IA se convertirá en infraestructura ambiental en lugar de un producto que conscientemente eliges usar, y su dominio en mercados emergentes significa que este futuro llegará a poblaciones en las que los laboratorios de IA de frontera rara vez piensan.
Empresas
La empresa de IA de Elon Musk (2023). Modelos Grok, acceso a datos de X, cluster Colossus (100K+ H100s).
Por qué importa: Escala + datos únicos. Si el firehose de X y el cómputo masivo producen modelos de calidad de frontera es la pregunta abierta.
Infraestructura
Un formato de serialización de datos legible por humanos utilizado ampliamente en IA y DevOps para archivos de configuración, definiciones de pipelines y metadatos de modelos. YAML utiliza la indentación para representar la estructura (sin corchetes ni llaves), haciéndolo fácil de leer pero notoriamente sensible al espacio en blanco. Lo encontrarás en todas partes en los flujos de trabajo de IA — archivos Docker Compose, manifiestos de Kubernetes, tarjetas de modelos de Hugging Face, pipelines de CI/CD y archivos de configuración de entrenamiento.
Por qué importa: Si estás trabajando con infraestructura de IA, estás escribiendo YAML. Configuraciones de modelos, manifiestos de despliegue, definiciones de pipelines, variables de entorno — es el lenguaje que actúa como pegamento de la pila de IA moderna. Acostumbrarse a YAML no es opcional; es la primera cosa que se rompe cuando malconfiguras una ejecución de entrenamiento o un despliegue.
Empresas
Empresa china de IA surgida de la Universidad Tsinghua. Detrás de la familia de modelos GLM y una de las plataformas de IA líderes en China, con fortalezas tanto en lenguaje como en generación visual.
Por qué importa: Zhipu AI cierra la brecha entre la investigación académica y la IA comercial en China, produciendo modelos open source — especialmente en generación de video con CogVideoX — que han logrado una adopción genuinamente global. Su arquitectura GLM y sus raíces en Tsinghua les dan una profunda credibilidad técnica, convirtiéndolos en una de las pocas empresas chinas de IA cuyas contribuciones de investigación son ampliamente citadas y construidas a nivel internacional.
Usar AI
Zero-shot significa pedirle a un modelo que realice una tarea sin ningún ejemplo — solo la instrucción. Few-shot significa proporcionar un puñado de ejemplos de entrada-salida en el prompt antes de la solicitud real. "Aquí hay 3 ejemplos de cómo formatear estos datos... ahora haz este." El modelo aprende el patrón solo del contexto, sin entrenamiento requerido.
Por qué importa: El few-shot prompting es la forma más rápida de enseñarle a un modelo un nuevo formato o comportamiento. Necesitas salida JSON consistente? Muéstrale tres ejemplos. Necesitas un estilo de escritura específico? Dale muestras. Es gratis, instantáneo y sorprendentemente poderoso.
Modelos
GPT (Generative Pre-trained Transformer) es la familia de grandes modelos de lenguaje de OpenAI: transformers de tipo decoder-only entrenados para predecir el siguiente token y posteriormente alineados para chat y razonamiento. La línea abarca desde GPT-1 (2018), con 117 millones de parámetros, pasando por GPT-4 y el multimodal GPT-4o, hasta GPT-5 (agosto de 2025), e impulsa tanto el producto ChatGPT como la API de OpenAI.
Por qué importa: GPT es la familia que llevó los grandes modelos de lenguaje al gran público: ChatGPT alcanzó aproximadamente 100 millones de usuarios en los dos meses posteriores a su lanzamiento, y la API se convirtió en la infraestructura predeterminada para una generación de productos. La trayectoria de la familia — escalamiento, RLHF, multimodalidad, razonamiento en tiempo de inferencia — es, en la práctica, una historia condensada del desarrollo moderno de los LLM, por lo que entender GPT es un atajo para entender el campo.
Modelos
Claude es una familia de modelos de lenguaje grandes creada por Anthropic, ofrecida en tres niveles — Haiku, Sonnet y Opus — que equilibran velocidad y costo frente a capacidad. Se ofrece como asistente de chat, como API y como un conjunto de herramientas agénticas, y se entrena con el método Constitutional AI de Anthropic, que incorpora principios de comportamiento en el proceso de entrenamiento en lugar de depender solo de la retroalimentación humana.
Por qué importa: Claude está en la lista corta de familias de modelos de frontera que los profesionales evalúan para trabajo serio, con una reputación particularmente sólida en programación, análisis de documentos largos y calidad de escritura. Su línea por niveles te permite ajustar el costo a la dificultad de la tarea en una sola API, y su énfasis en un comportamiento predecible y controlable la convierte en una opción por defecto habitual en productos empresariales donde las sorpresas salen caras.
Modelos
La familia insignia de grandes modelos de lenguaje de Google, creada por Google DeepMind como sucesora de PaLM y del chatbot Bard. Los modelos son nativamente multimodales — entrenados desde el principio con texto, imágenes, audio y video — y abarcan niveles desde Nano para dispositivos hasta Ultra a escala de centro de datos. El nombre también designa la aplicación de IA de consumo de Google que impulsan estos modelos.
Por qué importa: Gemini es la respuesta de Google a la serie GPT de OpenAI y a Claude de Anthropic, y está integrado en productos — Search, Android, Gmail, Docs — que ya usan miles de millones de personas. Para quienes construyen, sus características distintivas son una ventana de contexto muy grande, multimodalidad nativa y precios agresivos en el rápido nivel Flash. Si lanzas algo en el ecosistema de Google, Gemini es el modelo predeterminado contra el que se evaluará tu trabajo.
Modelos
Una familia de modelos de lenguaje grandes de Meta cuyos pesos se pueden descargar libremente bajo una licencia comunitaria personalizada. Con tamaños de 1B a 405B parámetros a lo largo de cuatro generaciones principales, los modelos Llama se han convertido en el punto de partida predeterminado para el ajuste fino, la inferencia local y la investigación abierta. El nombre significaba originalmente Large Language Model Meta AI.
Por qué importa: Como cualquiera puede descargar los pesos, Llama es el ancla del ecosistema de modelos abiertos: las herramientas de inferencia local, miles de ajustes finos y una gran parte de los productos comerciales de IA se remontan a él. También es la referencia contra la que se compara cualquier otro modelo de pesos abiertos, así que conocer la gama Llama te dice dónde está la frontera abierta.
Modelos
Qwen es una familia de modelos de lenguaje grandes de pesos abiertos desarrollada por Alibaba Cloud. La línea abarca varias generaciones — Qwen 1.5, 2, 2.5 y 3 — con tamaños desde medio billón hasta cientos de miles de millones de parámetros, en diseños tanto densos como de mezcla de expertos. La mayoría de los lanzamientos se publica bajo la permisiva licencia Apache 2.0, así que pueden ejecutarse, modificarse y desplegarse comercialmente sin pagar una tarifa por uso.
Por qué importa: Qwen es una de las familias de pesos abiertos más sólidas disponibles, lo que la convierte en un punto de partida predeterminado para equipos que quieren un modelo capaz que puedan ejecutar o ajustar por sí mismos en lugar de pagar tarifas de API por token. Sus modelos son especialmente buenos en trabajo multilingüe, programación y matemáticas, y la variedad de tamaños significa que normalmente hay una variante que encaja en un presupuesto de GPU dado. Como los pesos son descargables, un modelo Qwen también puede servir como base para tu propio modelo especializado, en lugar de ser solo un endpoint al que llamas.
Modelos
Grok es la familia de grandes modelos de lenguaje creada por xAI, la empresa de inteligencia artificial de Elon Musk, y el nombre del asistente chatbot que esos modelos impulsan. Destaca por su profunda integración con la red social X, que le da acceso en tiempo real a las publicaciones públicas, y por una postura deliberadamente más laxa con las restricciones de contenido que la de los asistentes rivales.
Por qué importa: Grok muestra hasta dónde pueden llevar a un participante tardío la escala de cómputo y la velocidad: xAI pasó de su fundación a una línea creíble de modelos frontera en unos dos años, en gran parte construyendo uno de los clústeres de entrenamiento más grandes del mundo. También es el asistente de IA predeterminado para la base de usuarios de X, y su lanzamiento de Grok-1 con pesos abiertos sigue siendo uno de los modelos de lenguaje más grandes jamás publicados bajo una licencia permisiva.
Modelos
La familia de modelos de lenguaje de pesos abiertos de Google, creada por Google DeepMind a partir de la misma investigación y tecnología detrás de Gemini. Los modelos Gemma son pequeños por diseño — entre 1.000 y 27.000 millones de parámetros — y se distribuyen como pesos descargables, para que cualquiera pueda ejecutarlos, ajustarlos y desplegarlos en su propio hardware en lugar de llamar a una API alojada.
Por qué importa: Gemma incorpora la calidad de entrenamiento de un laboratorio de frontera en modelos que caben en una laptop, un teléfono o una sola GPU, lo cual lo convierte en un punto de partida predeterminado para el ajuste fino, la creación de prototipos y la IA en el dispositivo. Como los pesos son gratuitos y la licencia permite el uso comercial, los equipos pueden lanzar productos sobre Gemma sin tarifas de API por token y sin enviar datos de usuarios a un tercero.
Modelos
La familia de modelos de lenguaje pequeños de Microsoft, desde aproximadamente 1.000 millones hasta 14.000 millones de parámetros, creada para ofrecer gran capacidad de razonamiento y programación en tamaños que se ejecutan en una laptop o un teléfono. Los modelos Phi se entrenan principalmente con texto web cuidadosamente filtrado y datos sintéticos generados por LLM, en lugar de hacerlo a escala de internet en bruto, lo que les permite competir con modelos mucho mayores en benchmarks de matemáticas, código y razonamiento.
Por qué importa: Phi es la prueba emblemática de que la calidad de un modelo no depende únicamente de la cantidad de parámetros: un Phi de 3.800 millones de parámetros puede igualar a modelos varias veces mayores en tareas de razonamiento y cuesta una fracción al servirlo. Como los pesos se publican abiertamente bajo la permisiva licencia MIT, Phi se ha convertido en una opción predeterminada para aplicaciones en el dispositivo, herramientas sin conexión y despliegues sensibles al costo.
Modelos
Sora es la familia de modelos de generación de video de OpenAI, que crea clips cortos de video a partir de prompts de texto o imágenes fijas. Presentado por primera vez en febrero de 2024 y lanzado para suscriptores como Sora Turbo en diciembre de 2024, combina un proceso de difusión con una arquitectura base transformer para producir secuencias con coherencia temporal. Una segunda generación, Sora 2, llegó a finales de 2025 con audio sincronizado y una aplicación dedicada.
Por qué importa: Sora transformó la generación de video de una curiosidad de investigación en un producto de consumo, condensando en un cuadro de texto un trabajo que antes requería cámaras, actores y software de edición. También obligó a mantener conversaciones prácticas sobre deepfakes, derechos de imagen y procedencia del contenido que ahora debe afrontar todo equipo que lanza medios generativos.
Modelos
La familia de modelos de generación de video de Google DeepMind, que convierte prompts de texto o imágenes fijas en clips de video cortos de alta resolución. La línea va del Veo original (2024) a Veo 2 y a Veo 3 (2025), la primera versión en generar audio nativo — diálogo, efectos de sonido y música — sincronizado con las imágenes. Veo se ofrece a través de la herramienta de filmmaking Flow de Google, la app Gemini y APIs para desarrolladores.
Por qué importa: Veo marcó el listón de calidad del video con IA en 2025: su realismo físico hizo que el metraje generado fuera notablemente más difícil de distinguir de las tomas reales, y el audio sincronizado de Veo 3 convirtió clips mudos en algo cercano a escenas terminadas. Para cineastas, anunciantes y equipos de contenido, llevó el video con IA de las demos novedosas a una herramienta de producción usable, y es el benchmark contra el que ahora se compara todo modelo de video rival.
Modelos
Un modelo de reconocimiento de voz de código abierto publicado por OpenAI en 2022. Whisper convierte audio hablado en texto mediante un transformer encoder-decoder entrenado con 680.000 horas de audio con supervisión débil, y un único modelo maneja transcripción, traducción al inglés e identificación de idiomas para decenas de lenguas. Como los pesos son abiertos y el modelo resiste bien los acentos y el ruido de fondo, rápidamente se convirtió en el baseline predeterminado para el reconocimiento automático de voz.
Por qué importa: Antes de Whisper, un buen reconocimiento de voz implicaba principalmente pagar una API en la nube o aceptar la precisión mediocre de las alternativas de código abierto. Whisper hizo que la transcripción de calidad casi humana fuera gratuita, funcionara sin conexión y estuviera disponible para cualquiera con una GPU o incluso una CPU decente, lo cual habilitó a escala la indexación de podcasts, las notas de reuniones, el análisis de centros de atención telefónica, el subtitulado y las herramientas de accesibilidad. También redefinió las expectativas de todo el campo: ahora cada nuevo modelo de voz se compara en benchmarks con Whisper.
Modelos
Una familia de grandes modelos de lenguaje de pesos abiertos creada por el Technology Innovation Institute (TII), el brazo de investigación aplicada del Advanced Technology Research Council de Abu Dabi. Falcon despuntó en 2023 cuando sus modelos 40B y 180B encabezaron la Open LLM Leaderboard de Hugging Face, convirtiéndolo brevemente en la familia de modelos con licencia permisiva más potente disponible. Desde entonces, la línea ha crecido hasta abarcar tamaños pequeños para dispositivos, variantes multimodales y arquitecturas híbridas.
Por qué importa: Falcon fue una prueba temprana de que un modelo abierto serio de clase frontera podía venir de fuera del eje Estados Unidos–China, y se convirtió en un ejemplo emblemático de IA soberana perseguida mediante pesos abiertos. Su licencia permisiva de estilo Apache importó en la práctica: en una época en la que Llama aún tenía restricciones de uso, las empresas podían construir sobre Falcon sin ansiedad legal. También es un caso de estudio útil sobre cómo ganar en los leaderboards y la adopción en el mundo real son dos cosas distintas.
Modelos
Un sistema de predicción de estructuras de proteínas de Google DeepMind que calcula la forma tridimensional de una proteína directamente a partir de su secuencia de aminoácidos. AlphaFold 2 igualó la precisión de los métodos experimentales en la evaluación CASP14 de 2020, y AlphaFold 3 amplió el enfoque a complejos de proteínas con ADN, ARN y moléculas pequeñas.
Por qué importa: La forma de una proteína determina su función, por lo que conocer la estructura suele ser el primer paso del diseño de fármacos, la ingeniería de enzimas y la biología básica. Determinar una estructura de forma experimental mediante cristalografía de rayos X o microscopía crioelectrónica puede llevar meses o años, mientras que AlphaFold necesita entre minutos y horas de cómputo. Una base de datos pública con más de 200 millones de estructuras predichas permite que muchos investigadores ni siquiera tengan que ejecutar el modelo y simplemente descarguen la respuesta.
Modelos
Un sistema de IA para jugar Go creado por Google DeepMind que en marzo de 2016 se convirtió en el primer programa informático en derrotar a un profesional humano de primer nivel en Go, al vencer por 4–1 al campeón de 9.º dan Lee Sedol en un encuentro de cinco partidas en Seúl. AlphaGo combinó redes neuronales profundas con búsqueda de árboles de Monte Carlo y aprendizaje por refuerzo mediante autojuego, y descifró un juego que durante décadas se había resistido a los enfoques de IA por fuerza bruta.
Por qué importa: El encuentro con Lee Sedol fue el momento en que la IA llegó al gran público: visto por cientos de millones, convenció a investigadores, gobiernos e inversionistas de que el aprendizaje automático podía dominar problemas que exigían intuición y planificación a largo plazo, no solo comparación de patrones. Las técnicas que AlphaGo validó — redes neuronales que guían la búsqueda, mejora propia mediante autojuego, estimación de recompensas futuras — ahora aparecen en todas partes, desde modelos de razonamiento y RLHF hasta el descubrimiento de fármacos. Sigue siendo la prueba canónica de que los sistemas aprendidos pueden superar el rendimiento de expertos humanos en un dominio que se creía a décadas de distancia.
Modelos
Un modelo de lenguaje grande que genera texto mediante eliminación iterativa de ruido en vez de predecir un token a la vez de izquierda a derecha. Comienza con una secuencia totalmente enmascarada o alterada y refina cada posición en paralelo durante una cantidad pequeña de pasos, tomando la idea central de los modelos de difusión de imágenes y adaptándola al texto discreto.
Por qué importa: La velocidad es el gran atractivo: la latencia escala con la cantidad de pasos de refinamiento y no con la longitud de la respuesta, por lo que una respuesta larga no cuesta proporcionalmente más tiempo. Los LLM de difusión también ven el contexto en ambas direcciones, lo que los vuelve naturalmente buenos para completar huecos, editar y revisar texto existente, en vez de limitarse a continuarlo.
Empresas
Safe Superintelligence (SSI) es una empresa de investigación en IA fundada en 2024 por Ilya Sutskever, Daniel Gross y Daniel Levy. La empresa tiene un objetivo declarado y un producto previsto: una superinteligencia que sea segura. Persigue ese objetivo con una estrategia de vía directa — sin productos comerciales, sin ingresos y sin lanzamientos públicos hasta terminar.
Por qué importa: SSI es la apuesta más pura hasta ahora por que la seguridad de la IA no puede añadirse a posteriori, sino que debe diseñarse desde el principio. Fundada por el antiguo científico jefe de OpenAI semanas después de su partida y valorada, según informes, en unos 32.000 millones de dólares en 2025 sin un solo producto, pone a prueba si un laboratorio pequeño y aislado todavía puede alcanzar la frontera en sus propios términos. Lo que finalmente lance — o se niegue a lanzar — dará forma a la manera en que la industria habla del riesgo de la superinteligencia.
Empresas
Una empresa de investigación y productos de IA fundada en 2025 por la antigua CTO de OpenAI Mira Murati y un equipo de investigadores destacados. Su primer producto, Tinker, es una API de ajuste fino que permite a los desarrolladores personalizar modelos de lenguaje de pesos abiertos sin operar su propia infraestructura de GPU.
Por qué importa: Thinking Machines pone a prueba si el talento investigador de élite, y no el cómputo en bruto ni la distribución, es el recurso más escaso en IA — su ronda semilla valoró la empresa en aproximadamente 12.000 millones de dólares antes de que hubiera lanzado un producto. Para los profesionales, Tinker ofrece un camino intermedio entre usar un modelo tal cual y entrenar uno desde cero: control real sobre el ajuste fino sin ser propietario del clúster de entrenamiento.
Empresas
Una empresa de IA fundada en 2022 por Mustafa Suleyman, Reid Hoffman y Karén Simonyan, conocida sobre todo por Pi, un asistente personal diseñado en torno a la inteligencia emocional más que a completar tareas. Inflection entrenó sus propios modelos de lenguaje a escala frontera, pero en 2024 Microsoft contrató a la mayor parte del equipo y licenció los modelos, tras lo cual la empresa restante pivotó hacia la IA empresarial.
Por qué importa: Inflection es el caso de estudio más claro de lo brutales que son las economías del desarrollo de modelos frontera: ni unos fundadores de élite ni más de mil millones de dólares de financiación pudieron sostener un negocio de chatbot de consumo contra OpenAI y Google. El acuerdo con Microsoft también marcó la plantilla de un nuevo tipo de absorción de talento por parte de las grandes tecnológicas — licencia más contratación en lugar de una adquisición formal — que reguladores y competidores han estado observando de cerca desde entonces.
Empresas
Gigante tecnológico chino conocido principalmente por su motor de búsqueda y por Ernie (Wenxin Yiyan), el chatbot y la familia de modelos de fundamento que lanzó en 2023 como uno de los primeros grandes rivales chinos de ChatGPT. Baidu también opera el servicio de robotaxis Apollo Go, diseña sus propios chips de IA Kunlun y vende toda la pila a través de su unidad de nube.
Por qué importa: Baidu es el actor de IA con mayor integración vertical de China: fabrica chips, un framework de aprendizaje profundo (PaddlePaddle), grandes modelos y los servicios de consumo construidos encima. La apertura del código de la familia Ernie 4.5 en 2025 dio a quienes alojan sus propios modelos y a los equipos sensibles al costo otra opción sólida de pesos abiertos, y su red de robotaxis es uno de los mayores despliegues de IA en el mundo real.
Empresas
Una empresa china de IA fundada por Kai-Fu Lee en 2023, conocida principalmente por su serie Yi de grandes modelos de lenguaje. 01.AI combinó lanzamientos de pesos abiertos como Yi-34B, que encabezó brevemente los leaderboards de modelos abiertos, con modelos propietarios más grandes vendidos mediante una API. En 2025 se retiró del entrenamiento de modelos base de frontera y volvió a centrarse en aplicaciones empresariales y de consumo, incluido su asistente Wanzhi.
Por qué importa: 01.AI es uno de los casos de estudio más claros sobre la economía del auge de la IA: una startup puede encabezar los leaderboards de modelos abiertos, alcanzar una valoración declarada de 1.000 millones de dólares en su primer año y aun así concluir que entrenar modelos de frontera es un mal negocio. Sus modelos Yi siguen en circulación y su giro de 2025 anticipó la presión de consolidación que ahora siente cada laboratorio de modelos mediano.
Empresas
Una empresa alemana de IA fundada en Heidelberg en 2019, conocida principalmente por su familia Luminous de grandes modelos de lenguaje y por centrarse en la soberanía de los datos para empresas y gobiernos europeos. Tras competir inicialmente en la frontera del desarrollo de modelos, giró en 2024 hacia PhariaAI, una pila completa de software para construir y ejecutar IA bajo las reglas de control y cumplimiento de cada organización.
Por qué importa: Aleph Alpha es el ejemplo europeo emblemático de IA soberana: la idea de que una capacidad crítica de IA debería ejecutarse sobre infraestructura y términos controlados por un país o una empresa, en vez de depender de un puñado de proveedores estadounidenses de API. Su trayectoria también muestra la brutal economía del entrenamiento de modelos de frontera y cómo sobreviven los laboratorios medianos al ascender por la pila hacia el software empresarial, el cumplimiento y la confianza.
Empresas
Una empresa de generación de video con IA cuya aplicación web convierte prompts de texto, imágenes fijas y secuencias subidas en clips cortos de video. Fundada en 2023 por los estudiantes de doctorado de Stanford Demi Guo y Chenlin Meng, Pika es conocida por sus rápidos lanzamientos para consumidores (de Pika 1.0 a 2.2), efectos de un clic llamados Pikaffects y un sistema de ingredientes que guía las escenas con imágenes de referencia.
Por qué importa: Pika es el caso de estudio más claro del extremo de consumo de la Generación de Video con IA: mientras algunos rivales cortejan a cineastas y estudios, optimiza para creadores ocasionales que hacen memes y clips sociales. Sus controles basados en ingredientes también muestran cómo el campo ataca la controlabilidad — la brecha entre describir un video y obtener realmente el que imaginaste. Para cualquiera que construya o compre herramientas de video, las apuestas de Pika son una señal útil de lo que los usuarios convencionales harán realmente con ellas.
Empresas
Udio es una empresa de generación de música con IA cuya aplicación web convierte prompts de texto en canciones completas, incluidas voces, letras e instrumentación. Fundada por antiguos investigadores de Google DeepMind y lanzada públicamente en 2024, se convirtió en uno de los dos principales servicios de texto a canción junto con Suno, y más tarde en un caso de prueba central de la lucha jurídica por el entrenamiento de IA con música protegida por derechos de autor.
Por qué importa: Udio redujo el costo de producir una demostración con calidad de estudio desde una sesión de grabación hasta unas pocas líneas de texto, lo cual cambia el flujo de trabajo para músicos que bosquejan ideas y creadores que necesitan bandas sonoras personalizadas. Sus demandas y acuerdos de licencia con las principales discográficas también ayudaron a definir qué datos de entrenamiento puede utilizar legalmente cada empresa de IA generativa.
Empresas
Una pasarela de API unificada que da a los desarrolladores acceso a cientos de grandes modelos de lenguaje de distintos proveedores a través de una sola clave de API y una única interfaz compatible con OpenAI. Lanzada en 2023 por Alex Atallah, gestiona el enrutamiento, los fallbacks, la facturación y el seguimiento de uso entre proveedores como OpenAI, Anthropic, Google y los principales hosts de modelos de pesos abiertos.
Por qué importa: Cada modelo adicional que un equipo quiere probar implica normalmente una cuenta nueva, un SDK nuevo, una relación de facturación nueva y una nueva política de límites de tasa que gestionar. OpenRouter colapsa esa sobrecarga en una sola integración, de modo que cambiar de modelo pasa a ser un cambio de una línea y comparar precio, velocidad y calidad en todo el mercado se vuelve práctico.
Empresas
Fireworks AI es una plataforma de inferencia que sirve modelos de IA de pesos abiertos detrás de API rápidas con pago por uso. Fundada en 2022 por ingenieros del equipo PyTorch de Meta, ofrece endpoints serverless facturados por token junto con despliegues en GPU dedicadas para cargas de trabajo de gran volumen, y abarca grandes modelos de lenguaje, así como modelos de imágenes, audio y embeddings.
Por qué importa: Ejecutar modelos abiertos por cuenta propia implica adquirir GPU, optimizar una pila para servirlos y absorber los picos de tráfico — un suplicio operativo que la mayoría de los equipos de producto no quiere. Fireworks AI lo convierte en una llamada a una API, para que un equipo pequeño pueda construir sobre modelos como Llama o DeepSeek con la latencia de un despliegue optimizado y la economía del pago por uso. Es una de las principales vías por las que los modelos de pesos abiertos llegan realmente a producción.
Empresas
Una plataforma en la nube para ejecutar modelos de aprendizaje automático mediante una API sencilla, sin infraestructura que gestionar. Aloja miles de modelos públicos de pesos abiertos — de imágenes, video, audio y lenguaje — y permite a los desarrolladores desplegar sus propios modelos empaquetados con Cog, su herramienta de contenedores de código abierto. La facturación es por segundo de cómputo, por lo que los costos siguen el uso real en lugar de la capacidad reservada.
Por qué importa: Ejecutar por cuenta propia un modelo serio implica aprovisionar GPU, resolver conflictos de CUDA y dependencias, y construir una capa para servirlo — días de trabajo antes de la primera predicción. Replicate condensa todo eso en unas pocas líneas de código, lo que lo convierte en una opción predeterminada para prototipos, proyectos paralelos y funciones de producción construidas sobre modelos abiertos. También es una de las formas más sencillas de aplicar ajuste fino a un modelo de imágenes o lenguaje con tus propios datos.
Herramientas
Un asistente de codificación con IA creado por GitHub en colaboración con OpenAI, lanzado en 2021 y ampliamente reconocido como el primer programador en pareja con IA para el gran público. Se ejecuta dentro del editor: sugiere líneas y funciones completas mientras escribes, responde preguntas en un panel de chat y — en su nuevo modo agente — lleva a cabo tareas de programación de varios pasos en todo un repositorio. Está disponible para VS Code, Visual Studio, los IDE de JetBrains y Neovim, además del propio github.com.
Por qué importa: Copilot convirtió la programación asistida por IA de una demostración en un recurso cotidiano predeterminado: lo utilizan millones de desarrolladores y fijó el patrón de interacción — completados en texto fantasma, chat dentro del editor, ejecución agéntica de tareas — que ahora sigue casi toda herramienta competidora. A los ingenieros en activo les ahorra tiempo real en código repetitivo, pruebas unitarias y API desconocidas. También obliga a los equipos a tomar decisiones prácticas sobre normas de revisión, exposición a licencias y qué código puede salir de la red para llegar al proveedor de un modelo.
Herramientas
Un ingeniero de software autónomo con IA creado por Cognition AI que recibe tareas de alto nivel y las ejecuta de extremo a extremo: planifica, escribe código, corre pruebas, depura y abre pull requests dentro de su propio entorno aislado. Presentado en 2024 como el primer producto anunciado como ingeniero de software con IA, Devin trabaja de forma asíncrona — le asignas un ticket y regresas al trabajo terminado en vez de verlo escribir.
Por qué importa: Devin desplazó la conversación sobre las herramientas de programación con IA del autocompletado a la delegación: en lugar de ayudar a un humano pulsación por pulsación, se hace cargo de tareas completas durante horas. Para los equipos enterrados bajo migraciones, actualizaciones de dependencias y acumulaciones de errores, eso convierte al asistente de codificación de un mecanógrafo más rápido en un compañero júnior adicional — con consecuencias reales para la forma de delimitar, revisar y lanzar el trabajo.
Herramientas
Un framework de datos de código abierto para construir aplicaciones LLM sobre datos privados. LlamaIndex se encarga de las conexiones entre tus documentos y el modelo: carga datos de cientos de fuentes, los fragmenta e indexa, recupera piezas pertinentes en el momento de la consulta y orquesta el prompt que recibe el LLM.
Por qué importa: La mayoría de las funciones LLM en producción son en realidad problemas de datos: el modelo necesita en su contexto el fragmento correcto de tus documentos antes de poder responder de forma útil. LlamaIndex es uno de los dos frameworks dominantes (junto con LangChain) para resolverlo, y sus abstracciones están ajustadas deliberadamente para cargas de recuperación y respuesta a preguntas. Si estás construyendo desde un chatbot de soporte hasta una herramienta de búsqueda documental, probablemente lo usarás o reinventarás partes de él.
Herramientas
SGLang es un motor de código abierto para servir grandes modelos de lenguaje, creado para ejecutar inferencia de forma rápida y barata a escala de producción. Fue publicado en 2024 por investigadores con raíces en UC Berkeley y el equipo de LMSYS, y su idea característica es RadixAttention, una técnica que reutiliza el cómputo almacenado en caché entre solicitudes que comparten prefijos de prompt. Es una de las dos pilas abiertas dominantes para servir LLM, junto con vLLM.
Por qué importa: La inferencia concentra la mayor parte del gasto al ejecutar LLM en producción, y el motor de servicio determina cuánta GPU consumes por solicitud. La reutilización de prefijos y la decodificación estructurada rápida de SGLang pueden reducir drásticamente el costo y la latencia en cargas con prompts de sistema compartidos, chats de varios turnos o salida JSON. También se ha convertido en una opción habitual para servir modelos abiertos muy grandes, incluidos despliegues de mezcla de expertos a escala de DeepSeek, donde un servicio ingenuo se derrumba.
Herramientas
A2A (Agent2Agent) es un protocolo abierto, lanzado por Google en 2025, que permite a agentes de IA creados por distintos proveedores y frameworks descubrirse, intercambiar mensajes y colaborar en tareas. Estandariza cómo un agente anuncia sus capacidades, cómo otro le entrega trabajo y cómo se sigue ese trabajo hasta completarlo, sin que ninguna de las partes exponga su estado interno. Está diseñado para complementar MCP, que conecta los agentes con herramientas, no para sustituirlo.
Por qué importa: Hoy, la mayoría de los agentes vive en silos: un agente construido sobre una pila no puede delegar trabajo a otro construido sobre una distinta sin código de integración personalizado. A2A proporciona a los agentes un lenguaje compartido para la delegación, de modo que un agente cliente pueda encontrar un agente remoto, enviarle una tarea y recibir resultados sin importar quién lo creó ni qué modelo ejecuta. Para las empresas que conectan muchos agentes entre equipos y proveedores, esto condensa el trabajo de integraciones por pares en una sola implementación del protocolo.
Herramientas
Una segunda pasada de puntuación en un pipeline de recuperación que reordena un conjunto inicial de documentos candidatos con un modelo de relevancia más preciso — y más caro. Una primera etapa rápida, como la búsqueda vectorial o por palabras clave, devuelve las primeras decenas de candidatos, y el reclasificador puntúa cada uno frente a la consulta para producir un orden final mejor.
Por qué importa: La recuperación de primera etapa está optimizada para la velocidad, no para la precisión, por lo que el mejor fragmento suele terminar en la posición 12 en vez de la 1 — y lo que queda arriba es lo que el LLM realmente ve en su prompt. La reclasificación compra una gran mejora de relevancia por un costo de latencia modesto, razón por la que se ha convertido en una etapa estándar de los sistemas RAG en producción.
Fundamentos
La capacidad de un modelo de lenguaje grande para captar una tarea a partir de ejemplos o instrucciones colocados en el prompt, sin actualizar los pesos del modelo. Muéstrale unos cuantos pares de entrada y salida y continuará el patrón con entradas nuevas, como si se programara en texto natural en el momento de la solicitud. Popularizada por el artículo de OpenAI sobre GPT-3 en 2020, es la razón por la que los prompts funcionan como interfaz.
Por qué importa: El aprendizaje en contexto convirtió un modelo congelado en una herramienta de propósito general: en vez de entrenar un especialista para cada tarea, describes la tarea en texto y recibes una respuesta utilizable segundos después. Por eso la ingeniería de prompts existe como habilidad y los equipos sin un pipeline de entrenamiento de ML pueden lanzar funciones de IA. La trampa es que el aprendizaje se alquila, no se posee — solo vive dentro de la ventana de contexto, y vuelves a pagar por esos ejemplos en cada llamada.
Entrenamiento
El conjunto de etapas de entrenamiento aplicadas a un modelo después del preentrenamiento, que convierten un predictor en bruto del siguiente token en un asistente utilizable. Normalmente combina ajuste fino supervisado sobre demostraciones, ajuste de preferencias a partir de retroalimentación humana o de IA, aprendizaje por refuerzo sobre tareas verificables y entrenamiento de seguridad. El post-entrenamiento es donde realmente se establecen el comportamiento, el tono y los límites de un modelo.
Por qué importa: Dos modelos preentrenados con datos casi idénticos pueden sentirse completamente distintos en producción debido a las decisiones de post-entrenamiento: uno sigue instrucciones y rechaza claramente las solicitudes dañinas, mientras el otro divaga o rechaza en exceso. La era de los modelos de razonamiento convirtió el post-entrenamiento en el principal diferenciador entre laboratorios de frontera, y también es la única capa donde equipos más pequeños pueden remodelar significativamente un modelo sin pagar el preentrenamiento.
Entrenamiento
PPO (Proximal Policy Optimization) es un algoritmo de aprendizaje por refuerzo que actualiza una política en pasos pequeños y controlados al recortar cuánto puede alejarse cada actualización del comportamiento anterior de la política. Presentado por OpenAI en 2017, se convirtió en el optimizador predeterminado para RLHF, la etapa de entrenamiento de preferencias detrás de modelos como InstructGPT y ChatGPT.
Por qué importa: PPO es el mecanismo que permitió entrenar grandes modelos de lenguaje para seguir instrucciones y mantener su utilidad en vez de limitarse a predecir texto. Si trabajas en alineación, post-entrenamiento o modelos de razonamiento, encontrarás PPO o uno de sus descendientes — y sus costos y modos de fallo determinan lo que los equipos de entrenamiento pueden lanzar realmente.
Entrenamiento
Un algoritmo de aprendizaje por refuerzo para el ajuste fino de modelos de lenguaje, presentado por DeepSeek en 2024 y popularizado por DeepSeek-R1. En vez de entrenar un modelo de valor separado para juzgar las salidas, muestrea un grupo de respuestas candidatas por prompt y puntúa cada una frente a la recompensa media del grupo. Esto vuelve más barato y sencillo ejecutar aprendizaje por refuerzo, y se ha convertido en una opción estándar para el post-entrenamiento de modelos de razonamiento sobre tareas con recompensas verificables.
Por qué importa: GRPO redujo el costo del ajuste fino con RL al eliminar el modelo crítico, uno de los dos grandes modelos que los pipelines clásicos debían entrenar y mantener en memoria, y puso el entrenamiento de estilo razonamiento al alcance de equipos sin infraestructura de laboratorio de frontera. Es el algoritmo detrás de DeepSeek-R1 y de la mayoría de los modelos abiertos de razonamiento posteriores, por lo que ahora aparece en casi toda pila seria de post-entrenamiento. Si un modelo que utilizas fue entrenado para resolver problemas de matemáticas, código o lógica, hay una buena probabilidad de que GRPO haya intervenido.
Entrenamiento
Un método de aprendizaje por refuerzo en el que la señal de recompensa procede de verificadores automáticos y programáticos — como determinar si una respuesta matemática es exactamente correcta o si el código generado pasa las pruebas unitarias —, en vez de etiquetas de preferencias humanas o un modelo de recompensa aprendido. Como la corrección puede verificarse mecánicamente, el bucle de entrenamiento escala a millones de problemas sin anotadores humanos dentro del bucle. RLVR es el enfoque de entrenamiento detrás de la reciente ola de modelos de razonamiento.
Por qué importa: RLVR convirtió las matemáticas y el código en una señal de entrenamiento casi ilimitada, lo que hizo posible la era de los modelos de razonamiento: tanto o1 de OpenAI como DeepSeek-R1 deben sus capacidades a esta receta. Para los profesionales, significa que un equipo con un verificador — una suite de pruebas, una clave de respuestas, un verificador de restricciones — puede mejorar un modelo en ese dominio sin contratar etiquetadores ni entrenar un modelo de recompensa. También trasladó el cuello de botella del post-entrenamiento de recopilar retroalimentación humana a escribir buenos verificadores.
Entrenamiento
Una técnica de evaluación en la que un modelo de lenguaje grande califica las salidas de otro modelo (o las suyas propias) en vez de depender de evaluadores humanos. El juez recibe el prompt original, una o dos respuestas candidatas y una rúbrica de puntuación, y devuelve una puntuación, un veredicto de preferencia o una crítica. Se ha convertido en el método predeterminado para evaluar la generación abierta, donde las métricas de coincidencia de cadenas como BLEU y ROUGE dejan de funcionar.
Por qué importa: La evaluación humana es el estándar de oro para juzgar texto abierto, pero es lenta y cara: una ronda seria de evaluaciones puede llevar semanas y costar miles de dólares. Un LLM juez devuelve miles de juicios en minutos por unos pocos dólares, lo que vuelve práctico evaluar cada cambio de prompt, sustitución de modelo y candidato de lanzamiento. También produce a escala las etiquetas de preferencias que consume el entrenamiento de alineación moderno.
Seguridad
El campo de investigación e ingeniería que busca lograr que los sistemas de IA se comporten de forma fiable, predecible y acorde con las intenciones humanas. Abarca alineación, interpretabilidad, robustez, evaluación y gobernanza, e incluye tanto daños a corto plazo como la alucinación y el sesgo como preocupaciones a más largo plazo sobre sistemas de gran capacidad. Es distinto de la seguridad de la IA, que protege los sistemas contra atacantes externos en vez de corregir el comportamiento del propio sistema.
Por qué importa: Cada modelo lanzado a los usuarios lleva consigo modos de fallo — hechos alucinados, salvaguardas vulnerables a jailbreaks, decisiones sesgadas, agentes que toman acciones no previstas —, y esos fallos escalan con el uso. El trabajo de inocuidad es lo que transforma "la demostración funcionó" en "el sistema resiste ante millones de usuarios y presión adversarial", y los reguladores lo tratan cada vez más como un requisito jurídico y no como algo deseable pero opcional.
Usar AI
Una capacidad que permite a un modelo de IA operar un escritorio o navegador real como lo haría una persona: mirando capturas de pantalla y emitiendo acciones de ratón y teclado. En vez de llamar a una API, el modelo percibe la pantalla, decide dónde hacer clic o qué escribir y un ejecutor realiza la acción, repitiendo el bucle hasta que termina la tarea o el agente se rinde. Computer Use de Anthropic y Operator de OpenAI son las implementaciones más conocidas.
Por qué importa: La mayoría del software empresarial se construyó para humanos, no para máquinas, y gran parte carece de una API utilizable. En principio, los agentes de uso de computadoras pueden manejar cualquiera de estos sistemas — ERP heredados, paneles administrativos internos, sitios web sin vía de integración —, lo que los convierte en la forma más general de automatización con IA intentada hasta ahora. También son actualmente la forma menos fiable, por lo que comprender sus límites importa tanto como comprender su promesa.
Usar AI
Un modo ofrecido por varios asistentes de IA en el que el modelo planifica y ejecuta de forma autónoma una tarea de investigación web de varios pasos, y luego devuelve un informe estructurado con citas. En vez de responder a partir de una búsqueda rápida, dedica varios minutos a leer decenas de fuentes, seguir pistas y sintetizar lo que encuentra. OpenAI presentó la función con este nombre en febrero de 2025, y ahora hay equivalentes en Gemini, Perplexity y Grok.
Por qué importa: Una ejecución de investigación profunda condensa horas de revisión bibliográfica manual — buscar, leer por encima, contrastar, tomar notas — en una sola solicitud. Demuestra su valor en preguntas sin una única respuesta autorizada: análisis de mercados, comparaciones técnicas, panoramas de políticas y revisiones bibliográficas donde la amplitud y las citas rastreables importan más que la velocidad.
Usar AI
Vibe coding es una forma de construir software en la que describes lo que quieres en lenguaje natural, dejas que un modelo de IA escriba el código y aceptas el resultado sin revisarlo detenidamente. Andrej Karpathy acuñó el término en febrero de 2025 para un estilo de trabajo en el que, según sus palabras, "te entregas por completo a las vibras" y "olvidas incluso que el código existe". La IA escribe, ejecuta y depura el código; el humano dirige mediante la intención.
Por qué importa: Vibe coding reduce drásticamente la barrera para construir software: personas sin conocimientos de programación pueden lanzar prototipos funcionales, y los desarrolladores experimentados avanzan mucho más rápido con código repetitivo y de integración. La trampa es que el código que nadie ha leído tiende a esconder errores, agujeros de seguridad y deuda de mantenimiento, costos que aparecen después y a menudo en el peor momento. Saber cuándo vale la pena esa contrapartida se ha convertido en una habilidad práctica propia.
Usar AI
La práctica de diseñar, ensamblar y mantener todo lo que un modelo ve en su ventana de contexto — el prompt de sistema, documentos recuperados, salidas de herramientas, memoria e historial de conversación — para que pueda cumplir su tarea de forma fiable. El término surgió en 2025 como sucesor de la ingeniería de prompts, reflejando el paso de ajustar manualmente una sola instrucción a diseñar todo el entorno de información alrededor del modelo.
Por qué importa: Un modelo solo puede razonar sobre lo que tiene delante, por lo que la calidad del contexto suele importar más que el propio modelo: un modelo de frontera con contexto inflado y contradictorio rendirá peor que uno más pequeño con contexto limpio y bien curado. En sistemas de producción, especialmente agentes y pipelines RAG, la mayoría de los fallos se remonta a problemas de contexto — información ausente, datos obsoletos, contradicciones, señal ahogada — en vez de a la capacidad bruta del modelo.
Fundamentos
Un modelo de lenguaje diseñado para la eficiencia, normalmente con entre unos 100 millones y 15.000 millones de parámetros. Los SLM son lo bastante pequeños para ejecutarse en hardware de consumo como una laptop, un teléfono o una sola GPU en vez de un clúster de centro de datos, e intercambian algo de amplitud y capacidad de razonamiento por bajo costo, baja latencia y la posibilidad de funcionar sin conexión y en el dispositivo.
Por qué importa: Los SLM son la forma de incorporar IA a productos que no pueden permitirse una factura de API por consulta, un viaje de ida y vuelta a la nube ni enviar datos de usuarios a un tercero. Para trabajos estrechos y bien definidos — clasificación, extracción, resúmenes cortos, llamada de funciones —, un modelo pequeño con ajuste fino suele igualar a uno de frontera por una fracción del costo y la latencia. También se ejecutan donde están los datos, algo importante para la privacidad, el cumplimiento y el uso sin conexión.
Infraestructura
Una familia de chips aceleradores de IA personalizados (ASIC) diseñados por Google específicamente para cargas de aprendizaje automático. Las TPU intercambian la flexibilidad de propósito general de una GPU por una arquitectura de matriz sistólica construida alrededor de grandes unidades de multiplicación de matrices, y ofrecen gran rendimiento y eficiencia energética en las matemáticas tensoriales que dominan el aprendizaje profundo. Google las utiliza internamente desde 2015, las alquila mediante Google Cloud y entrena con ellas todos los modelos Gemini.
Por qué importa: Las TPU son la prueba más sólida de que el cómputo de IA no es un mercado de un solo proveedor: son el silicio ajeno a NVIDIA que lleva más tiempo entrenando modelos de frontera a escala, y empresas como Anthropic y Apple han apostado por ellas para cargas importantes. Para los profesionales, importan como una alternativa de Google Cloud que puede superar a las GPU en relación precio-rendimiento para grandes ejecuciones de entrenamiento e inferencia de gran volumen, siempre que la pila de software encaje.
Fundamentos
Una prueba conductual de inteligencia de las máquinas propuesta por Alan Turing en su artículo de 1950 "Computing Machinery and Intelligence". Si un juez humano que intercambia mensajes de texto con interlocutores ocultos no puede distinguir de forma fiable la máquina del humano, se dice que la máquina exhibe un comportamiento inteligente. Turing la presentó como sustituto concreto de la pregunta más vaga de si las máquinas pueden pensar.
Por qué importa: El Test de Turing dio forma a más de setenta años de discusiones sobre qué cuenta como inteligencia de las máquinas, y todavía centra el debate público cada vez que se afirma que un chatbot lo ha superado. Saber qué mide realmente la prueba — imitación convincente bajo presión de tiempo, no comprensión — marca la diferencia entre leer esos titulares con sentido crítico y tomarlos al pie de la letra.
Entrenamiento
Un dataset de imágenes a gran escala con aproximadamente 14 millones de imágenes etiquetadas a mano y organizadas en más de 20.000 categorías, publicado por primera vez en 2009 por un equipo dirigido por Fei-Fei Li. Su competición anual asociada, ImageNet Large Scale Visual Recognition Challenge (ILSVRC), se convirtió en el benchmark estándar de visión por computadora y desencadenó la era del aprendizaje profundo cuando una red neuronal la ganó en 2012.
Por qué importa: ImageNet demostró que escalar los datos importa tanto como inventar mejores algoritmos, una lección que todavía da forma a la estrategia de IA actual. Sus pesos preentrenados se convirtieron en el punto de partida predeterminado para el trabajo práctico de visión por computadora, y su subconjunto de benchmark con 1.000 clases todavía es la forma en que las nuevas arquitecturas de visión demuestran su valía.
Seguridad
La ley integral de la Unión Europea que regula la inteligencia artificial, en vigor desde agosto de 2024. Adopta un enfoque basado en el riesgo: cuanto mayor sea el daño que pueda causar un sistema de IA, más estrictas serán las obligaciones, desde prohibiciones absolutas sobre un puñado de prácticas hasta deberes ligeros de transparencia para herramientas de bajo riesgo.
Por qué importa: Si construyes, vendes o despliegas IA en la UE — o la salida de tu modelo se utiliza allí —, es probable que la Ley se aplique a ti, sin importar dónde tenga su sede tu empresa. Las infracciones de las normas sobre prácticas prohibidas pueden costar hasta el 7 % del volumen de negocios mundial anual, y la ley se está convirtiendo en la base de cumplimiento de facto de la industria, como hizo el GDPR para la protección de datos.
Infraestructura
La IA soberana es una estrategia nacional para construir capacidad nacional de inteligencia artificial — infraestructura de cómputo, modelos y datos propios de un país — a fin de que las cargas críticas de IA no dependan de proveedores extranjeros. En la práctica, significa clústeres de GPU respaldados por el gobierno, modelos de fundamento entrenados o adaptados localmente y normas que exigen que los datos sensibles permanezcan dentro de las fronteras nacionales.
Por qué importa: La IA soberana determina dónde se ejecutan las cargas de IA, qué modelos pueden usar los gobiernos y las industrias reguladas, y quién captura el valor económico de la tecnología. Para los profesionales, aparece como requisitos de contratación, restricciones de residencia de datos y un mercado creciente de nubes nacionales y modelos alojados localmente.
Infraestructura
La electricidad total consumida por los sistemas de IA a lo largo de su ciclo de vida, dominada por dos fases: la ejecución única de entrenamiento que produce un modelo y la inferencia continua que responde cada solicitud de los usuarios. La carga incluye los propios aceleradores, además de la sobrecarga de refrigeración, redes y suministro de energía a su alrededor. A medida que los modelos y el uso han escalado, esa demanda ha crecido lo suficiente para remodelar la planificación de redes eléctricas en varios países.
Por qué importa: La energía es ahora una de las restricciones duras del progreso de la IA: un clúster de entrenamiento que consume cientos de megavatios solo puede existir donde la red sea capaz de proporcionar tanta potencia, y la disponibilidad eléctrica determina cada vez más dónde se construye nueva capacidad. Para los profesionales, la energía también aparece directamente en los costos de servicio y en las afirmaciones de sostenibilidad que cada gran laboratorio de IA debe defender ahora.
Fundamentos
Un enfoque de la inteligencia artificial en el que los modelos controlan máquinas físicas — robots que perciben, se mueven y manipulan objetos en el mundo real en vez de limitarse a procesar texto e imágenes en una pantalla. La afirmación central es que la inteligencia genuina necesita un cuerpo: percepción, razonamiento y control motor aprendidos conjuntamente mediante interacción con el entorno. El término abarca desde brazos de almacén y cuadrúpedos hasta robots humanoides de propósito general.
Por qué importa: La IA encarnada es donde el progreso reciente de los modelos de lenguaje y visión se encuentra con la economía física: manufactura, logística, construcción, agricultura y trabajo asistencial dependen todos del trabajo físico. Un modelo que pueda cargar un lavavajillas o surtir una estantería vale mucho más que uno que solo pueda describir los pasos, y gran parte de la industria ahora trata la robótica como la siguiente frontera después de los grandes modelos de lenguaje. Para los profesionales, también es donde están migrando los problemas más difíciles sin resolver de la IA — escasez de datos, inocuidad, control en tiempo real.