Compressão de prompts consciente de cache
Cache-Aware Prompt Compression argumenta que comprimir prompts sem considerar o cache de prefixo dos provedores pode eliminar economias em cargas repetidas de contexto longo. Por que importa: Equipes que usam agentes, RAG ou assistentes para codebase frequentemente reutilizam grandes prefixos estáveis de instruções e esquemas. A compressão deve preservar a estrutura cacheável, em vez de otimizar apenas por menos tokens em uma única chamada.
Para testar: Para uma tarefa repetida de contexto longo, compare três execuções: prefixo bruto em cache, compressão sensível à consulta e compressão que preserva o cache; depois escolha por custo total e qualidade da saída.