一、背景
团队已有多个智能体产品在实际使用,但效果一直不稳定:改动一处之后不知道整体是变好还是变差,缺少客观统一的衡量标准;评测要么干脆不做,要么各团队各评各的,口径不一、结论互相矛盾,没法支撑产品迭代决策;优化方向靠"感觉不够好",优化完了也没法证明真的变好了。
二、目标
建立一套覆盖全链路的智能体评测规范:评什么、为什么这么评、结论需要什么证据支撑,让每一次智能体变更都能跑出可对比的量化结论;把迭代从拍脑袋推进变成按证据推进,把优化方向从猜测变成定位,让团队敢改、改了能验证。
一、实现
规范已经定稿并投入实际使用:覆盖设计质量、测试质量、运行质量三个层次,评测集自动构建、多维加权评分、版本回归对比、按执行轨迹做根因定位,直接输出优化建议。
二、成果
已用该体系完成多个智能体系统的迭代验证与效果归因:每次变更后先跑评测,用数据说话再决定上线;评测结论直接指导优化方向。该规范按通用方式设计,可适配不同类型的智能体产品,可按团队现状落地。
三、可交付
评测规范与评分标准、评测集构建方法、评测报告模板,并提供评测执行与根因定位服务,帮团队跑通从评测到优化的完整闭环。