智问Advisory Agent Runtime

本站为个人技术 Demo,仅用于演示 Agent 编排与合规风控的工程实现,非商业用途。所有产品、行情与持仓均为虚构测试数据,页面内容不构成任何投资建议或要约。

04 / Evaluation

评测集

每条用例都写明「凭什么算通过」,运行时真实调用一次 Agent,再逐项断言:分支是否正确、越级产品是否被剔除、 话术里的数字能否在 Tool 输出中溯源。合规判定分三段——客户诉求是否违规、Agent 回复是否违规、该回复能否发送—— 因此「客户要求保本、Agent 引用原话并拒绝」会被判为正确拒答,而不是缺陷。

0条用例
/

尚未运行。汇总只统计本轮真实跑过的用例,不展示历史缓存结果。

正在加载…

全量批次与版本对比

批次会记录当次的护栏版本指纹(合规词库、风险提示模板、适当性矩阵、产品风险等级、用例期望值)。 对比两个批次时,若通过率上升的同时护栏被放宽,会直接判为「指标可能注水」并列出放宽项—— 因为删掉一条禁用词也能让通过率变好看。用例集、评测器或模型不一致时,则拒绝给出改善结论。

至少两个批次才能对比
正在加载…