Loop de avaliação de prompts com DSPy para agentes SQL
Simon Willison usou DSPy para avaliar prompts SQL do Datasette Agent e descobriu que uma instrução criada para economizar contexto levou o agente a adivinhar nomes de colunas e repetir SQL com falha. Por que importa: Mudanças em prompts de agentes podem introduzir regressões ocultas. Tratar prompts como unidades testáveis ajuda equipes a otimizar o uso de contexto sem degradar a qualidade das respostas.
Para testar: Antes de encurtar um prompt de sistema, capture alguns casos realistas de falha, defina o comportamento esperado de uso de ferramentas e compare variantes de prompt com um harness de avaliação.