适用场景
Agent 上线前的任务达成与回归验证
工具、插件与函数调用链路的正确性评估
多轮对话与长上下文场景下的稳定性验证
测试交付
- 覆盖场景与任务清单说明
- 问题记录:失败任务、错误调用与复现步骤
- 幻觉、越权与护栏有效性的评估结果
实际范围、环境、周期与交付格式以双方确认的测试方案为准。
常见问题
Agent 测试和传统功能测试有什么区别?
Agent 行为具有不确定性,测试更关注任务达成率、调用合理性与边界安全,而非固定输入输出断言。
需要提供哪些资料?
通常需要 Agent 的角色设定与 Prompt、可用工具清单、典型业务场景和已知风险,测试范围共同确认。