Measured, not guessed
Evaluations
Test tool choice, outcomes, guardrails, approval compliance, and step limits against explicit pass criteria.
Sales Qualification
Deterministic policy and trace checks. No OpenAI request.
Not runRefund Policy
Deterministic policy and trace checks. No OpenAI request.
Not runGuardrail Defense
Deterministic policy and trace checks. No OpenAI request.
Not runAgent tests
Live evaluation mode
Live agent evaluations require an explicit click because they use OpenAI API requests. They are never included in the default unit test command.