Llama
Por que isso importa
Em profundidade
Llama não é um modelo, mas uma linhagem de lançamentos da Meta AI, e entender a família exige acompanhar dois fios ao mesmo tempo: a linha técnica que vai do Llama 1 ao Llama 4 e a linha de licenciamento que transformou um artefato de pesquisa no substrato compartilhado da indústria. Cada lançamento vem com pesos para download, um tokenizer e código de referência, portanto qualquer pessoa com memória de GPU suficiente — ou, nos tamanhos menores, um laptop comum — pode executar o modelo localmente, aplicar ajuste fino, quantizá-lo ou incorporá-lo a um produto. Essa combinação de qualidade convincente e controle local total foi o que tornou Llama o ponto de referência do ecossistema de Pesos abertos: quando aparece um novo modelo da Mistral, Qwen ou DeepSeek, a primeira pergunta dos profissionais é como ele se compara ao Llama de tamanho equivalente.
De Vazamento de Pesquisa a Família de Produtos
O LLaMA original, lançado em fevereiro de 2023, era assunto apenas de pesquisa: tamanhos de 7B a 65B parâmetros, acesso controlado por formulário de inscrição e licença para uso não comercial. Os pesos completos vazaram em poucos dias, demonstrando por acidente o tamanho da demanda por um modelo capaz que as pessoas pudessem executar por conta própria. A Meta abraçou essa demanda com o Llama 2 em julho de 2023, lançando tamanhos de 7B, 13B e 70B sob uma licença que permitia a maior parte dos usos comerciais, além de variantes de chat ajustadas com RLHF. A geração Llama 3, em 2024, elevou novamente o nível, treinada em cerca de 15 trilhões de tokens: primeiro os tamanhos 8B e 70B, depois o carro-chefe de 405B no Llama 3.1, modelos pequenos de texto de 1B e 3B mais versões de 11B e 90B com visão no 3.2, e um 70B centrado em eficiência no 3.3. O Llama 4 chegou em 2025 com uma arquitetura de Mistura de especialistas: Scout e Maverick como modelos lançados, com o Behemoth, muito maior, descrito como um modelo professor ainda em treinamento.
A Arquitetura que Virou Padrão
Arquiteturalmente, Llama é um Transformer apenas com decoder, e cada geração é evolutiva, não radical: pré-normalização com RMSNorm, embeddings posicionais rotativos, camadas feed-forward SwiGLU e, a partir do Llama 2 de 70B, GQA para reduzir o cache KV no momento da inferência. Nenhuma dessas escolhas foi inventada na Meta, mas a popularidade do Llama as transformou na receita de fato, e hoje as pessoas descrevem casualmente outros modelos como tendo arquitetura Llama quando seguem o mesmo molde. Essa padronização tem valor prático real: pilhas de inferência como vLLM, SGLang e llama.cpp são otimizadas primeiro e com mais intensidade para modelos no formato Llama, e alguns laboratórios mantêm deliberadamente seus lançamentos compatíveis com Llama para que as ferramentas simplesmente funcionem. O vocabulário de 128 mil tokens do Llama 3 e a janela de contexto de 128 mil tokens introduzida no 3.1 também viraram pontos de referência contra os quais outros modelos abertos são medidos.
Pesos Abertos Não São Código Aberto
Um equívoco persistente é achar que Llama é open source. Não é, ao menos pela definição da Open Source Initiative: a Llama Community License da Meta concede direitos amplos para usar, modificar e redistribuir os modelos, mas impõe restrições de campo de uso que os critérios da OSI não permitem. Empresas com mais de 700 milhões de usuários ativos mensais precisam de uma licença separada da Meta, a Acceptable Use Policy restringe certas aplicações e modelos derivados devem incluir Llama no nome e exibir a atribuição Built with Llama. Alguns lançamentos acrescentam peculiaridades regionais — os modelos multimodais Llama 3.2, por exemplo, não são licenciados para empresas domiciliadas na UE. Para um desenvolvedor individual ou uma startup pequena, nada disso costuma importar na prática, mas é exatamente o tipo de detalhe que interessa às equipes jurídicas e a ilustração mais nítida do espectro Aberto vs. Fechado: pesos para download não são a mesma coisa que uma licença Apache 2.0 ou MIT.
O Ecossistema ao Redor dos Pesos
Os pesos em si são apenas metade da história; as ferramentas e os derivados construídos ao redor deles são, possivelmente, a maior contribuição do Llama. Poucas semanas após o vazamento do Llama 1, projetos como Alpaca e Vicuna mostraram que uma rodada barata de ajuste por instruções em dados sintéticos podia transformar o modelo base em um chatbot utilizável, dando início à onda moderna de Ajuste fino. O llama.cpp de Georgi Gerganov tornou possível executar modelos Llama quantizados em CPUs de consumo e laptops, dando origem ao formato GGUF e a toda uma pilha de inferência local que inclui o Ollama, enquanto o Hugging Face hoje hospeda dezenas de milhares de ajustes finos, fusões e quantizações do Llama. Graças à destilação e à fusão de modelos, muitos modelos abertos supostamente novos são, por baixo do capô, derivados do Llama. Esse efeito de rede se reforça sozinho: como todos constroem primeiro para Llama, escolhê-lo significa obter o melhor suporte de ferramentas, o que por sua vez o mantém como padrão mesmo quando um concorrente publica números de benchmark ligeiramente melhores.