所有评估指标严格分层,不同层级指标对应不同可信度、不同适用场景,禁止混用、合并为单一综合星级:
1.Layer1 机械可验证(最高可信度,审计可用)
全部通过代码规则自动化校验,零主观偏差、结果 100% 可复现。覆盖指标:输出 Schema 格式、延迟 P50/P95、Token 消耗、工具参数类型、敏感信息泄露扫描、调用状态码。
落地优先级:凡是能代码校验的指标,绝不交给 LLM 评判器,降低成本、消除主观偏差。
2.Layer2 半客观评判(需人工校准)
依靠固定配置的 LLM-as-a-Judge 模型打分,适配语义、逻辑类无法代码量化的维度:事实忠实度、推理连贯性、工具选择合理性、边界场景拒答恰当性。
硬性约束:评判模型、提示词、温度参数必须固定,搭配人工标注黄金集校准,缓解位置偏见、冗长偏见、权威幻觉等评判缺陷;大规模评测采用多模型陪审团(PoLL)降低单一模型系统性偏差。
3.Layer3 主观维度(默认拒评,不做自动化打分)
无统一客观标准的维度,例如创意、个性化主观偏好,自动化评分无参考价值,仅保留人工专家裁量通道,不纳入量化指标看板。
三类打分器分层协作落地规范
1.代码规则打分器:负责所有 Layer1 机械可验证指标,优先执行;
2.校准 LLM-as-a-Judge:负责 Layer2 半客观语义指标,批量处理大规模样本;
3.人工专家评审:作为金标准,标注黄金评估集、校准 LLM 评判器、复核多智能体涌现风险、高风险业务终审。
企业智能体八大必测测量维度
结合金融、客服、办公、零售等企业通用场景,白皮书梳理所有生产级 Agent 必须覆盖的评估维度,企业可根据自身业务删减适配:
1.任务 / 目标完成率:用户诉求是否完整达成;
2.工具与动作正确性:工具选型、参数填写是否合规准确;
3.安全 / PII 信息防护:是否泄露隐私、涉密数据;
4.成本与延迟:单次会话 Token 消耗、响应分位延迟;
5.事实忠实性:回答是否匹配知识库、无编造幻觉;
6.业务策略合规:对齐行业监管、内部业务规则;
7.品牌语调风格:交互话术统一企业标准;
8.边界场景升级处理:超出能力范围时,是否正确转人工 / 拒绝回答。
高阶评测方案:Agent-based Evaluation(智能体评测智能体)
传统单轮 LLM 评判仅能读取最终输出,完全丢失中间推理、工具调用全过程,无法完成根因分析;人工逐条审阅全量 Trace 成本极高,无法规模化落地。
Agent-based Evaluation 专为多步骤、多工具、多智能体复杂场景设计,评测器本身是具备工具调用能力的独立 Agent:
1.完整读取被评测智能体全流程 Trace、中间产物;
2.自带三类专用工具:代码执行验算、外部事实检索、评分规则自动拆解;
3.输出过程级逐步骤判定、故障根因分析(RCA)、可落地优化建议,而非单一分数。
适用场景:开发阶段深度回归测试、多智能体协作系统评测;局限是算力成本更高、延迟更大,不适合线上全量实时评估,仅用于批量离线深度审计。