用户提交/修改候选 JSON,与确定性评测器交互。
RAG 评测与人审工作台技术执行说明
候选模型输出的证据与安全评测器
它评测模型候选,不生成答案;当前评分器与 evidence registry 都是确定性合成夹具。
不生成答案,也不调用 LLM-as-Judge;当前评测器和证据注册表是确定性合成夹具。
高风险样本必须人审,复核后才能把错误模式写回记忆。
运行拓扑:用户如何抵达结果
页面负责收集与组装输入;合同、引擎和回执负责把边界变成可检查的执行链。
- 01
页面交互
评测工作台与审核面板,不是面向终端用户的 Chatbot。
当前执行 - 02
RagCandidate + ErrorMemory
第一步输入已经是候选答案 JSON,而不是文档或用户问题。
当前执行 - 03
分阶段引擎
候选规范化 → 引用解析 → 逐主张 grounding → 安全/隐私扫描 → 六维评分 → 风险 gate → 审核后记忆
当前执行 - 04
EvaluationResult
输出是逐维 scorecard、拒绝原因、版本和可选审核后记忆。
当前执行
candidate 字段直接校验;不会再包成 User Prompt。
模型、算法与工具逐项列账
模型名、规则引擎、检索器、评测器和控制层分开陈述;相似名称不等于真实调用。
six-dimension evaluator
当前执行逐主张计算 grounding/citation,并叠加安全、延迟和风险 gate。
由页面 Demo 或 POST /api/labs/:slug 同步调用;无外部推理请求。
Evidence registry
citation ID 映射到可匹配证据词。
Claim-citation mapping
逐主张计算 groundedness 和 citation coverage。
Policy safety scanner
危险确定性、注入语句和敏感数据触发 reason。
Weighted evaluator
六维质量指标合成 composite。
Risk-aware release gate
风险等级决定是否允许 auto-approve。
Bounded error memory
人工拒绝结果进入有限 citation/pattern 记忆。
Evaluator versioning
响应携带 evaluator 与 evidence registry 版本。
HITL adjudication
高风险输出保持 human-review。
输入合同、分步执行与结构化输出
证据错误、安全错误和性能错误必须能分别定位,不能只返回一个 LLM Judge 总分。
RagCandidate + ErrorMemory
不上传来源 PDF、音视频或图片;引用 ID 必须在固定 evidence registry 中解析。
candidate.answercandidate.claimscandidate.citationscandidate.claimCitationscandidate.riskClasscandidate.latencyMsmemoryreview
候选规范化 → 引用解析 → 逐主张 grounding → 安全/隐私扫描 → 六维评分 → 风险 gate → 审核后记忆
- 01
读取候选回答、主张、引用映射、风险等级和延迟。
RagCandidate → candidate envelope
- 02
将 claimCitation 映射到版本化证据注册表。
claims + citations → grounded claim map
- 03
计算 grounding、citation、coverage、safety 和 latency。
grounded claim map → dimensions + composite
- 04
按风险等级与指标执行 approve/review/reject 门。
dimensions → decision + reasons
- 05
输出维度 scorecard、原因和治理元数据。
decision → EvaluationResult
- 06
人工复核后有界更新 citation misses 和 rejected patterns。
review result → ErrorMemory
EvaluationResult
一个候选回答及其 claim-citation 映射。
dimensionscompositedecisionreasonsgovernanceupdatedMemory
Prompt 与 Schema 的四层装配
System、Few-shot、用户运行输入与输出格式分别标注;没有 Prompt 的项目不会假装存在 Prompt。
- 01
系统约束
没有 System Prompt;evidence registry、六维权重、安全规则和风险 gate承担系统约束。
合同不接受 - 02
少样本
不注入 Few-shot。baseline / stress 只用于可复现测试,不进入模型上下文。
合同不接受 - 03
运行时输入
候选文本被标记为不可信数据,只进入规则评测,不进入模型对话。
当前执行 - 04
输出合同
输出形状由 Zod + EvaluationResult 与 TypeScript 返回契约决定,不靠 One-shot 示例暗示。
当前执行
多模态准入矩阵:每一项都有明确状态
图片、音频、视频和数字人不会用空字段含混带过;未接入就明确写出未接入。
文本
当前执行answer、claims 和审核 note 是被评内容。
表格 / JSON
当前执行claim-citation 映射、维度分数和错误记忆为结构化记录。
图片
合同不接受严格 JSON 合同不接收图片;未知字段会被拒绝,不会保留空占位。
音频
合同不接受没有音频上传、ASR 或声学特征管道。
视频
合同不接受没有视频上传、解码、分镜或帧级推理入口。
数字人
合同不接受没有数字人资产、驱动参数或渲染合同。
人工输入 / 复核
当前执行高风险始终 human-review;只有审批过的纠错进入记忆。
用户在页面上操作,样本用于验证边界
预设不是替用户做决定,也不是偷偷注入 Few-shot;它让同一合同在基线与压力条件下可复现。
交互表面
评测工作台与审核面板,不是面向终端用户的 Chatbot。
选择样本的目的
grounded 样本证明通过链;无引用高延迟样本验证质量门拒绝。
主张失去引用
STRESS TEST保留回答和主张,但移除引用映射并制造高延迟。
质量门拒绝运行产物
当前项目不建立外部聊天会话;页面输入进入严格合同,由规则、算法或确定性 Harness 执行。

