← Voltar à edição1 / 9 · Semana de 17 de ago de 2026

ALTK-Evolve testa quanta memória de agente cada modelo consegue usar

O ALTK-Evolve, da IBM Research, avalia agentes que destilam orientações reutilizáveis de suas próprias trajetórias passadas e as inserem na inferência sem atualizar pesos nem usar anotação humana. A avaliação compara ausência de memória, conjunto completo de orientações e recuperação curada em oito modelos nas tarefas AppWorld. Por que importa: A avaliação relata que a dose útil de memória varia por modelo. Para gpt-oss-120b, a recuperação curada melhorou mais a conclusão de tarefas do que o conjunto completo de orientações e adicionou menos tokens. Mais contexto não torna uma configuração de agente melhor automaticamente.

Para testar: Execute 20 tarefas representativas em três modos: sem orientação retida, regras compactas com lições recuperadas e o conjunto completo de orientações. Compare conclusão, erros de fonte ou citação, latência e tokens.

Fonte
Hugging Face / IBM Research — ALTK-Evolve
conteúdo em inglês
Ver fonte →

Receba o field brief toda semana.

Um sinal principal, três sinais rápidos, uma coisa para testar, um conceito decodificado - e o resto da semana na linha. Para quem quer saber o que importa e o que fazer a seguir.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser