Ir para o conteúdo principal
Zubnet AIAprenderWiki › Gemma
Modelos

Gemma

Também conhecido como: Google Gemma, Gemma 3
A família de modelos de linguagem de pesos abertos do Google, criada pelo Google DeepMind a partir da mesma pesquisa e tecnologia por trás do Gemini. Os modelos Gemma são pequenos por projeto — de 1 a 27 bilhões de parâmetros — e são distribuídos como pesos para download, para que qualquer pessoa possa executá-los, ajustá-los e implantá-los em seu próprio hardware em vez de chamar uma API hospedada.

Por que isso importa

Gemma coloca a qualidade de treinamento de um laboratório de fronteira em modelos que cabem em um laptop, um celular ou uma única GPU, tornando-se um ponto de partida padrão para ajuste fino, prototipagem e IA no dispositivo. Como os pesos são gratuitos e a licença permite uso comercial, equipes podem lançar produtos sobre Gemma sem taxas de API por token e sem enviar dados dos usuários a terceiros.

Em profundidade

Gemma chegou em 2024 como a entrada do Google na corrida de modelos de pesos abertos que o Llama da Meta havia iniciado um ano antes. Criada pelo Google DeepMind a partir da mesma pesquisa e tecnologia usadas para criar os modelos Gemini, ela passou por três gerações: a Gemma original (2B e 7B parâmetros), Gemma 2 (9B e 27B) e Gemma 3 (1B, 4B, 12B e 27B), que acrescentou compreensão de imagens, uma janela de contexto de 128 mil tokens e suporte a mais de 140 idiomas. Todos os modelos Gemma são transformers apenas com decoder treinados nas TPUs do Google, e todos são lançados como pesos para download sob uma licença própria que permite uso comercial. A proposta é simples: pegar a qualidade do pipeline de treinamento de um laboratório de fronteira e encolhê-la até algo que você realmente possa executar por conta própria.

Escolhendo um Tamanho

O número no nome informa a contagem de parâmetros, e cada nível mira uma máquina diferente. O modelo 1B roda confortavelmente em celulares e até em navegadores, o 4B se encaixa bem em laptops e pequenos dispositivos de edge, o 12B é uma base popular para ajuste fino em uma única GPU de consumo, e o carro-chefe de 27B pede uma GPU de workstation ou um servidor pequeno, mas entrega qualidade próxima à de modelos proprietários muitas vezes maiores. Como todos os tamanhos de uma geração compartilham a mesma arquitetura, o mesmo tokenizer e a mesma receita de treinamento, subir ou descer essa escada depois é uma mudança de configuração, não uma reconstrução. A decisão real é a qualidade por solicitação diante do orçamento de hardware — e, para uso no dispositivo, bateria e memória.

Pequeno o Bastante para Rodar em Qualquer Lugar

A maior parte do uso do Gemma acontece fora de centros de dados. Com Quantização para 4 bits, o modelo 4B encolhe para poucos gigabytes, o que significa que roda em um laptop moderno ou um celular topo de linha em velocidades confortáveis de leitura, e as ferramentas da comunidade fazem o trabalho pesado: llama.cpp e Ollama oferecem builds GGUF prontos para executar em todos os tamanhos Gemma. Essa é a tese dos SLM concretizada — um modelo sob seu controle, que funciona offline, mantém os dados do usuário no dispositivo e não custa nada por solicitação. Para aplicativos sensíveis à privacidade, ferramentas offline e assistentes embarcados, essa combinação muitas vezes importa mais do que os últimos pontos de qualidade em benchmarks. O Google reforça a proposta com seu próprio suporte de runtime para celulares e navegadores, excepcionalmente polido em comparação com outras famílias de pesos abertos.

O Ajuste Fino é o Evento Principal

Como os pesos podem ser baixados, Gemma se tornou uma das famílias de modelos com mais ajustes finos no ecossistema. Métodos eficientes em parâmetros como LoRA permitem que um profissional adapte uma Gemma 4B ou 12B a um trabalho de nicho — a voz de um bot de suporte, um sumarizador jurídico, um classificador especializado — em uma única GPU e em poucas horas, e o Hugging Face hospeda milhares de ajustes finos da comunidade dos quais partir. O Google também lança seus próprios derivados: CodeGemma para código, PaliGemma para tarefas de visão e linguagem e ShieldGemma para classificação de segurança. Parte da força dos modelos base também vem da Destilação, em que as saídas de um professor maior ajudam a treinar o modelo menor — uma razão pela qual Gemma constantemente supera o que sua contagem de parâmetros sugeriria.

Pesos Abertos Não Significam Código Aberto

Um equívoco comum é achar que Gemma é open source. Ela oferece Pesos abertos, o que é outra coisa: o Google publica os arquivos sob os Termos de Uso da Gemma, uma licença própria que permite uso comercial, modificação e redistribuição, mas inclui uma política de usos proibidos e reserva o direito de restringir usos que a violem. Na prática cotidiana, isso raramente bloqueia alguém — muitas startups lançam produtos comerciais sobre Gemma sem pedir permissão —, mas não é a liberdade da Apache 2.0, licença usada pelo Qwen na maioria de seus modelos, e a distinção importa se sua equipe jurídica se preocupa com pureza de licença. A mesma nuance vale para a licença Llama da Meta: pesos abertos descrevem o que você pode baixar, não os termos vinculados. Quando alguém diz "modelo aberto", vale perguntar a qual dessas duas coisas se refere.

Onde Gemma se Encaixa

Gemma compete em uma faixa concorrida com os modelos Llama menores, Qwen e Phi da Microsoft, e o resumo honesto é que essas famílias ultrapassam umas às outras a cada lançamento. Os pontos fortes que distinguem Gemma são seu pedigree de treinamento — poucos modelos pequenos saem do pipeline completo de um laboratório de fronteira — e o suporte de primeira parte para implantação no dispositivo. Seus limites são o outro lado de seu tamanho: nada na família desafia modelos de fronteira nos problemas de raciocínio mais difíceis e, como qualquer modelo pequeno, ela retém menos conhecimento de mundo e alucina com mais facilidade que seus parentes maiores. As equipes normalmente recorrem a Gemma quando querem um modelo base capaz e barato de executar que possam controlar de ponta a ponta, e a um modelo de API hospedada quando a tarefa precisa de tudo o que um sistema de fronteira oferece.

← Todos os termos
ESC