Muse Glimmer coloca um agente local em um envelope de 24 GB
A Meta liberou pesos Apache-2.0 do Muse Glimmer, um modelo de 30B para fluxos de agentes locais. A Meta informa que a quantização próxima de 4 bits reduz o modelo de linguagem para menos de 20 GB, deixando espaço em um envelope de 24 GB ou 32 GB para cache KV, encoder de visão e um drafter de decodificação especulativa. Por que importa: A restrição de implantação fica visível: o uso local depende de memória, latência e do runtime ao redor, não só da contagem de parâmetros. As alegações de desempenho da Meta ainda precisam ser verificadas no hardware e na carga de trabalho desejados.
Para testar: Rode uma tarefa repetível localmente, registre uso de memória, latência e taxa de conclusão e compare a mesma tarefa com um modelo remoto antes de mover contexto sensível.