A Microsoft apresentou o run-assert-eval, divulgado em sua central de notícias de 25 de setembro, para integrar descoberta de riscos, avaliação de comportamento e aplicação de políticas em agentes de IA. O fluxo conecta Clarity, ASSERT e ACS. A ideia é partir de uma descrição do agente, identificar possíveis falhas, transformar riscos selecionados em avaliações e testar novamente o sistema após uma intervenção. A documentação destaca a manutenção dos mesmos casos e critérios entre as medições.
Essa comparação é o ponto mais relevante para equipes de tecnologia. Se o teste muda junto com o controle de segurança, uma melhora pode refletir apenas uma avaliação mais fácil. Preservar a base de comparação ajuda a investigar se a política corrigiu o comportamento observado e qual foi seu custo para a utilidade do agente. O exemplo publicado envolve suporte de cobrança e limites de acesso entre contas, mas continua sendo uma demonstração do fornecedor. A ferramenta não certifica ausência de falhas: depende de cenários representativos, escopo bem definido e revisão dos resultados. Seu valor proposto está em tornar a avaliação reproduzível dentro do ciclo de desenvolvimento.