O número que importa é 10 trilhões: a contagem de parâmetros do modelo que a ByteDance está pré-treinando agora, segundo três pessoas próximas do projeto falando com o Financial Times. Se a cifra aguentar até o fim do treinamento, será o maior modelo já tentado na China, o triplo do Kimi K3 da Moonshot, lançado semana passada com 2,8 trilhões e atualmente o maior modelo chinês publicado. Também o colocaria perto da estimativa não confirmada do setor para o Mythos 5 da Anthropic, em torno de 8 trilhões de parâmetros, número que a Anthropic nunca publicou nem confirma. 'Reportado pela FT' é a frase que carrega o peso deste parágrafo, e ela fica colada a tudo o que segue.
Os detalhes dados pelos informantes: o modelo está em pré-treinamento, fase que normalmente leva de três a seis meses, dentro da equipe Seed da ByteDance, uma unidade de 2.000 pessoas a quem o fundador Zhang Yiming pediu internamente mirar capacidade de modelo líder mundial em longo prazo. Uma pessoa acrescentou que a ByteDance passa há mais de um ano sem destilação, a prática de treinar um modelo sobre as saídas de outro laboratório, o que se lê como resposta direta às acusações de destilação que os laboratórios chineses e americanos trocaram nesta primavera. A reportagem da FT também nota que a xAI está treinando variantes do Grok de seis e dez trilhões de parâmetros no seu cluster Colossus 2, segundo Elon Musk, então a corrida pelo tamanho voltou a correr em pelo menos dois clusters em dois continentes.
A leitura honesta exige duas ressalvas, uma técnica e uma editorial. Técnica: parâmetros fixam capacidade, não desempenho; qualidade dos dados, método de treinamento e pós-treinamento decidem o que o modelo sabe fazer, e um modelo pequeno bem treinado vence um gigante malfeito toda semana do ano. Editorial: a ByteDance não anunciou nada, e tudo o que se sabe são três informantes anônimos mais o histórico da FT, que é bom mas não é um anúncio. O que faz disso mais que rumor é a direção do movimento: o Kimi K3 de 2,8 trilhões saiu aberto semana passada, e se a ByteDance seguir seu padrão com os modelos Seed, a vantagem dos laboratórios fechados em tamanho bruto continua encolhendo.
Para quem constrói, os pontos de vigilância são práticos. Se o modelo sai um dia, pré-treinamentos são cancelados em silêncio; se sai aberto, que é a única forma do tamanho da ByteDance chegar até você; e se chega perto do Mythos 5 em capacidade, caso em que o teto dos pesos abertos se move de novo. A única coisa a não fazer com esta história é o que todos vão fazer: ler '10 trilhões' como uma alegação de capacidade. É uma alegação de orçamento.
