ALTK-Evolve testa quanta memória de agente cada modelo consegue usar
O ALTK-Evolve, da IBM Research, avalia agentes que destilam orientações reutilizáveis de suas próprias trajetórias passadas e as inserem na inferência sem atualizar pesos nem usar anotação humana. A avaliação compara ausência de memória, conjunto completo de orientações e recuperação curada em oito modelos nas tarefas AppWorld. Por que importa: A avaliação relata que a dose útil de memória varia por modelo. Para gpt-oss-120b, a recuperação curada melhorou mais a conclusão de tarefas do que o conjunto completo de orientações e adicionou menos tokens. Mais contexto não torna uma configuração de agente melhor automaticamente.
Para testar: Execute 20 tarefas representativas em três modos: sem orientação retida, regras compactas com lições recuperadas e o conjunto completo de orientações. Compare conclusão, erros de fonte ou citação, latência e tokens.