Phi
Por qué importa
En profundidad
Phi es la familia interna de modelos de lenguaje pequeños de Microsoft, y existe para probar una hipótesis concreta: un modelo entrenado con datos excepcionalmente limpios y orientados a la enseñanza puede razonar tan bien como un modelo mucho mayor entrenado con texto web en bruto. La serie comenzó en 2023 con Phi-1, un modelo de código de 1.300 millones de parámetros, y ha crecido a través de Phi-2, Phi-3 y Phi-4 hasta formar una línea que abarca aproximadamente entre 1.000 y 14.000 millones de parámetros, incluidas variantes multimodales y de mezcla de expertos. Todos los lanzamientos recientes distribuyen pesos abiertos bajo la licencia MIT, por lo que pueden descargarse, ajustarse y desplegarse comercialmente sin pagar tarifas. Dentro de la industria, Phi se ha convertido en el punto de referencia de la categoría SLM — la prueba de que "pequeño" es una decisión de diseño, no un techo de capacidad. También es un argumento permanente de que los próximos avances en IA podrían provenir de una mejor curación de datos en vez de limitarse a escalar.
Los libros de texto son todo lo que necesitas
El artículo fundador de la serie tomó su título de su tesis: los libros de texto son todo lo que necesitas. En lugar de entrenar con internet sin filtrar, el equipo de Phi reúne dos tipos de datos: páginas web filtradas algorítmicamente para ofrecer "calidad de libro de texto" — escritura densa, correcta y explicativa — y Datos sintéticos completos escritos por un gran modelo profesor, como ejercicios, explicaciones y ejemplos resueltos con el estilo de un libro de texto. La apuesta rindió frutos de inmediato: Phi-1, con 1.300 millones de parámetros entrenados sobre apenas unos 7.000 millones de tokens, obtuvo resultados competitivos con modelos muchas veces mayores en el benchmark de programación HumanEval. Cada generación posterior mantuvo la receta y aumentó la cantidad — aproximadamente 1,4 billones de tokens para Phi-2, 3,3 billones para Phi-3-mini y poco menos de 10 billones para Phi-4 — con una proporción sintética cada vez mayor.
Este enfoque está emparentado con la destilación, pero no es exactamente lo mismo: en vez de copiar token por token las salidas de un profesor, el profesor crea material didáctico nuevo, que luego se filtra, se descontamina respecto de los conjuntos de prueba de benchmarks y se mezcla con texto humano curado. Esa curación importa porque entrenar un modelo con salidas de modelos sin editar es un camino conocido hacia el Colapso de Modelo, donde la calidad se degrada a medida que los errores se acumulan de una generación a otra. La respuesta de Phi es una selección agresiva — Microsoft dice conservar solo una pequeña fracción de las páginas web y muestras generadas candidatas. La filosofía invierte la lectura habitual de las Leyes de escala: si la calidad de los datos es suficientemente alta, la frontera óptima de cómputo se desplaza y los modelos pequeños dejan de ser versiones privadas de recursos de los grandes.
La familia, de Phi-1 a Phi-4
Es más fácil orientarse en la línea por generaciones que por modelos individuales. Phi-1 y Phi-1.5, ambos de 2023, fueron pruebas de concepto de 1.300 millones de parámetros — el primero para código y el segundo para razonamiento de sentido común. Phi-2, publicado a finales de 2023 con 2.700 millones de parámetros, fue el primero en afirmar paridad con modelos varias veces mayores en benchmarks estándar. Phi-3 llegó en 2024 como una familia propiamente dicha: un mini de 3.800 millones con variantes de contexto de 4K y 128K, un small de 7.000 millones, un medium de 14.000 millones y un modelo de visión, todos bajo la licencia MIT. La actualización Phi-3.5 añadió una variante de Mezcla de expertos con unos 6.600 millones de parámetros activos, lo cual mejoró la calidad por unidad de cómputo.
Phi-4, anunciado a finales de 2024 y publicado abiertamente a principios de 2025, aumentó a 14.000 millones de parámetros y apostó más que nunca por los datos sintéticos, con resultados especialmente sólidos en matemáticas de competición. Después llegaron Phi-4-mini, con 3.800 millones de parámetros, y un conjunto de variantes ajustadas para el Razonamiento que producen largas cadenas de pensamiento antes de responder — una aplicación directa del Cómputo en tiempo de inferencia a una base pequeña. En la práctica, los nombres indican la contrapartida buscada: mini para teléfonos y laptops, la clase de 14.000 millones para servidores con una sola GPU, y las variantes de razonamiento cuando la precisión en matemáticas y lógica importa más que la latencia.
Pequeño no significa tonto
La interpretación perezosa es que un modelo de 4.000 millones de parámetros es un juguete. En tareas intensivas en razonamiento — matemáticas escolares y de competición, completado de código, acertijos lógicos — los modelos Phi igualan o superan con frecuencia a modelos de propósito general entre dos y cinco veces mayores, porque el razonamiento es una habilidad que los datos didácticos limpios y densos transmiten bien. El límite real es el conocimiento: el recuerdo factual escala con la cantidad de parámetros, así que un modelo pequeño sencillamente almacena menos datos triviales. Es más propenso a la Alucinación sobre hechos, fechas y citas poco conocidos, y es más débil en idiomas con pocos recursos. La consecuencia práctica es que Phi brilla en cargas de trabajo donde los hechos pertinentes se proporcionan durante la ejecución — prompts con RAG, uso de herramientas, procesamiento de documentos — y es una mala opción como enciclopedia de consulta libre. Los equipos que lo despliegan con éxito lo tratan como un motor de razonamiento rápido, no como una base de conocimiento.
Ejecutar Phi en la práctica
Como tiene Pesos abiertos, Phi aparece en todas partes donde se ejecutan modelos pequeños. Mediante la Cuantización a 4 bits, los modelos mini ocupan apenas un par de gigabytes, por lo que se ejecutan cómodamente en la CPU de una laptop, un teléfono o una sola GPU de consumo a través de herramientas como Ollama y llama.cpp, y Microsoft distribuye builds ONNX orientadas a escenarios en el dispositivo y de IA en el borde. El ajuste fino es barato: un adaptador LoRA para un modelo mini se entrena en una sola GPU en cuestión de horas, lo cual hace de Phi una base común para clasificadores, extractores y copilotos sin conexión especializados. Las cifras de costos son el verdadero atractivo — servir un modelo de 4.000 millones de parámetros cuesta un orden de magnitud menos que servir un LLM de frontera, y en tareas de gran volumen y sensibles a la latencia esa diferencia decide si una función llega a lanzarse. Phi se ubica sistemáticamente entre las familias de modelos más descargadas de Hugging Face, lo que facilita encontrar herramientas, cuantizaciones y ajustes finos de la comunidad.