哪些主张有证据,哪个质量维度迫使答案转人工?
页面先自动运行基准样本;也可以在下方编辑完整输入或执行项目专属压力场景。状态、指标、视觉和回执都来自当前 API 输出。
高风险答案转人审
- 综合质量
- 校验中
- 有据性
- 校验中
- 证据覆盖
- 校验中
- 引用覆盖
- 校验中
六维评测
output.evaluation.dimensions.composite关键词证据注册表
output.evaluation.dimensions.groundedness当前主要短板
output.evaluation.dimensions.coverage逐主张映射
output.evaluation.dimensions.claimCitationCoverage主张—证据质量图
- 01校验中综合质量executed output / evidence 01
- 02校验中有据性executed output / evidence 02
- 03校验中证据覆盖executed output / evidence 03
- 04校验中引用覆盖executed output / evidence 04
业务决策、执行健康与发布回执
执行检查通过,只表示输出有效、未超预算且可以重放;是否发布仍由业务状态和发布检查决定。
换一组输入,重新运行项目引擎
基准输入和压力输入都提交给同一版本 API。压力输入用于触发项目特定的拒绝、降级或复核规则,结果可以重复运行。
编辑完整 JSON 输入
下一步不是一个按钮
- P0EXECUTED高风险答案转人审
不自动批准;保留评测原因并等待合规复核。
负责人 / 模型风险评审员
- P1CONTROLRAG-Q01
拒绝不可复现 run
负责人 / RAG 评测数据负责人
- P1DRILL评测器偏置
禁用受影响自动门
负责人 / 平台 SRE / 安全
公开预览与本次运行分轨
- SOURCE 01disconnected preview
BEIR Information Retrieval Benchmark
rageval.beir_item.raw.v1 - SOURCE 02disconnected preview
Natural Questions
rageval.nq_item.raw.v1 - VALUES RETURNED BY THE ENGINE
有引用的合规回答
本次计算只使用上方标明的数据版本;公开来源目前仅提供预览,尚未接入引擎。
故障必须有检测和恢复路径
- 症状
- 特定主题系统性低分
- 检测
- 分层校准和 reviewer 分歧
- 隔离
- 禁用受影响自动门
- 恢复
- 重标 golden set 并重训阈值

