🎯
意图识别准确率
评估智能体是否正确理解用户真实意图,包括模糊表达、多意图、隐含需求等复杂场景。
- 明确意图识别准确率
- 模糊意图澄清能力
- 多意图拆解能力
- 隐含需求挖掘能力
🔧
工具调用正确率
评估智能体是否选择正确的工具、传入正确的参数、按正确的顺序调用。
- 工具选择正确率
- 参数格式准确率
- 调用顺序合理性
- 不必要调用识别
📊
多步任务完成率
评估涉及多个步骤、多个工具的复杂任务,智能体能否从头至尾完整执行并交付正确结果。
- 3步以内任务完成率
- 5步以上任务完成率
- 跨工具协作完成率
- 长时任务稳定性
⚠️
异常处理能力
评估智能体在遇到工具失败、API超时、数据异常、权限不足等情况时的处理能力。
- 暂时性错误重试策略
- 永久性错误识别能力
- 降级方案触发能力
- 人工介入请求时机
🚫
越权操作拦截率
评估智能体在面对超出权限范围的请求时,是否能够正确识别并拒绝,而不是尝试执行。
- 权限范围识别准确率
- 越权请求拒绝率
- 敏感操作确认触发率
- 权限边界模糊处理
💬
输出质量评分
评估智能体最终输出的质量,包括准确性、完整性、相关性、格式规范性、用户满意度等维度。
- 事实准确性评分
- 内容完整性评分
- 格式规范性评分
- 用户满意度调研
第一步:收集"让你不舒服的输入"
评估集最该收集的不是理想的请求样本,而是真实流量里那些脏话、碎句、错别字、一句话带三代人关系的问题。这些才是生产环境真正会遇到的挑战。
第二步:每个案例写清"什么叫对"
Agent不是函数,不能用"输入A必须返回B"来断言。它是一连串自主决策,正确的最终答案可能建立在完全错误的推理链上。所以每个案例都要写清:什么叫做对、什么叫做错、边界情况怎么算。
第三步:评估完整轨迹,不只是最终输出
调错了工具,检索到无关文档,最后靠运气给出了合理答案——你把这个当成能力上线了,下次遇到同类问题,它大概率会失手。所以评估集要评的是完整轨迹:选对工具了吗?顺序对吗?参数对吗?
第四步:随业务一起演进,定期回归
评估集会随时间漂移。PoC阶段建的测试集不再反映真实输入分布,分数虚高而生产在退化。真正让你心里有数的不是那个好看的分数,是你隔段时间就拿新数据回去测一遍的动作。