LFM2.5 abre uma faixa limitada para agentes locais
O LFM2.5-2.6B, da Liquid AI, é um modelo de 2,6 bilhões de parâmetros voltado a chamadas de ferramentas e fluxos de várias etapas no dispositivo, com janela de contexto de 128K e suporte a llama.cpp, MLX, vLLM, SGLang e ONNX. A própria avaliação da Liquid diz que modelos maiores ainda levam vantagem clara em código. Por que importa: Inferência local serve quando a tarefa é estreita o suficiente para medir: classificar notas, extrair campos ou encaminhar documentos sem enviá-los a um modelo hospedado. Ela vira um mau padrão quando o time toma uso de ferramentas por um modelo pequeno como prova de que ele consegue lidar com trabalho de repositório.
Para testar: Rode a mesma tarefa fixa de extração ou classificação localmente com o LFM2.5 e uma vez com o modelo hospedado que você já usa. Compare qualidade da conclusão, falhas nas chamadas de ferramenta, latência, uso de memória e o trabalho de revisão que cada versão deixa.