仅供项目展示:本站为个人技术作品,非商用、不提供任何金融服务,页面内全部数据、产品与结论均为模拟示例,不构成任何形式的建议。

04 / Evaluation

评测集

每条用例都写明「凭什么算通过」,运行时真实调用一次 Agent,再逐项断言:分支是否正确、越级产品是否被剔除、 话术里的数字能否在 Tool 输出中溯源。合规判定分三段——客户诉求是否违规、Agent 回复是否违规、该回复能否发送—— 因此「客户要求保本、Agent 引用原话并拒绝」会被判为正确拒答,而不是缺陷。

0条用例
/

尚未运行。汇总只统计本轮真实跑过的用例,不展示历史缓存结果。

正在加载…

全量批次与版本对比

批次会记录当次的护栏版本指纹(合规词库、风险提示模板、适当性矩阵、产品风险等级、用例期望值)。 对比两个批次时,若通过率上升的同时护栏被放宽,会直接判为「指标可能注水」并列出放宽项—— 因为删掉一条禁用词也能让通过率变好看。用例集、评测器或模型不一致时,则拒绝给出改善结论。

至少两个批次才能对比
正在加载…