… Muse Glimmer! A Meta Superintelligence Labs apresentou o Muse Glimmer, um novo modelo de linguagem com 30 bilhões de parâmetros, projetado para fluxos de trabalho de agentes locais e sempre ativos, sob os termos da licença Apache 2.0. Segundo a empresa, o modelo é pequeno o suficiente para rodar em um Mac ou PC com uma única GPU de consumo, viabilizando casos de uso como agentes locais, chamadas de função, programação local e avaliação do tipo “LLM como juiz”, com desempenho competitivo frente a modelos líderes de tamanho semelhante.
“Today, we’re introducing Muse Glimmer, the next model from Meta Superintelligence Labs, and open sourcing the model weights under a permissive Apache 2.0 license. Muse Glimmer is a 30-billion-parameter model optimized for always-on local agent workflows. It’s small enough to run on a Mac or PC with a single consumer GPU, enabling use cases that range from local agents and function calling, to local coding, and LLM-as-a-judge evaluation. Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category.”
— by Meta AI Research (blog).
A motivação por trás do lançamento é reduzir a dependência de infraestrutura em nuvem. A Meta argumenta que rodar modelos localmente permite usar IA em qualquer lugar, a qualquer momento, com ou sem conexão à internet, algo cada vez mais viável à medida que a comunidade de código aberto demonstra que modelos menores, quando bem treinados, podem se aproximar do desempenho de modelos de ponta em tarefas específicas. O novo modelo foi disponibilizado no Hugging Face, junto com documentação para desenvolvedores e integrações otimizadas com a biblioteca llama.cpp, frameworks MLX e ExecuTorch, devem chegar em breve.
No treinamento, a Meta descreve um processo em três fases: pré-treinamento usando destilação de logits a partir das saídas do modelo Muse Spark; treinamento intermediário com dados de contexto mais longo e mais voltados a agentes, com traços de raciocínio mais ricos; e pós-treinamento combinando ajuste fino supervisionado com destilação on-policy e aprendizado por reforço em domínios gerais, de raciocínio, código e agentes. O modelo também foi avaliado conforme o framework interno de escalonamento de IA avançada da empresa.
O Muse Glimmer foi treinado e avaliado em oito frentes principais: conclusão de tarefas de ponta a ponta em benchmarks como DeepSearch QA, MCP-Atlas, τ-Bench e SWE-Bench; uso confiável de ferramentas; raciocínio em múltiplas etapas; recuperação de falhas ao lidar com erros de chamadas de ferramentas; entrada e raciocínio multimodal através de um codificador de percepção dedicado; compatibilidade com diferentes estruturas de orquestração de agentes; esforço controlável para equilibrar qualidade e velocidade; e suporte multilíngue, com treinamento em dados de mais de 100 idiomas. Nos benchmarks, Muse Glimmer supera concorrentes de mesma categoria, como o Gemma4-31B e o Qwen3.6-27B.
Duas otimizações centrais tornam o modelo viável, em hardware doméstico. Primeiro, a quantização: em precisão total, um modelo de 30 bilhões de parâmetros exigiria mais de 55 GB de memória, mas a compressão dos pesos para cerca de 4 bits reduz o modelo de linguagem para menos de 20 GB, deixando espaço para cache de memória, o codificador de percepção e o decodificador especulativo dentro de um envelope de 24 a 32 GB. Segundo, a decodificação especulativa: o modelo vem com um “rascunhador” leve baseado em DFlash que propõe blocos de tokens de uma vez, verificados em paralelo pelo modelo principal, acelerando a geração sem perda de qualidade e com ganhos de até 3,1 vezes em uma RTX 5090, 1,8 vezes em um M5 Max e 1,5 vezes em um M4 Max.
Por fim, a Meta anuncia disponibilidade imediata do modelo, com suporte planejado de parceiros como Ollama, LM Studio, Unsloth, vLLM, SGLang, Together AI, Fireworks AI e OpenRouter, além de colaborações com fabricantes de hardware como AMD, ARM, Dell, Intel e NVIDIA, para otimizar o desempenho em diferentes dispositivos. A empresa enquadra o lançamento como uma continuidade de sua tradição de pesquisa aberta em IA, agora estendida a capacidades agentivas locais.
Em tempo: na próxima troca de equipamento, terei a minha própria LLM! &;-D