返回全部项目
RESUME RECONSTRUCTION/ 2025

RAG 评测与人审工作台

模型初审 → 逐项评分 → 人工复核;被拒样本进入下一轮回归测试

RESULT / FIXED SAMPLE / 2026-07-17
高风险答案转人审

有引用的合规回答

回答综合质量 94.88%,主张引用覆盖 100%;但证据广度仅 60%,且风险等级高,必须人工复核。

建议决策

不自动批准;保留评测原因并等待合规复核。

综合质量
94.88%

五维加权

主张引用
100%

每个主张都有来源

证据覆盖
60%

当前主要短板

回答质量剖面得分
有据性100%
引用精度100%
证据覆盖60%
政策安全100%
时延88.84%

结果边界合成合规答案与公开风格证据 ID;不含银行数据。

LIVE RUN / COMPLETE FLOWRUN / baselineDOES NOT WRITE TO EXTERNAL SYSTEMS

哪些主张有证据,哪个质量维度迫使答案转人工?

页面先自动运行基准样本;也可以在下方编辑完整输入或执行项目专属压力场景。状态、指标、视觉和回执都来自当前 API 输出。

当前引擎状态

高风险答案转人审

loadinghigh riskrate/
综合质量
校验中

六维评测

output.evaluation.dimensions.composite
有据性
校验中

关键词证据注册表

output.evaluation.dimensions.groundedness
证据覆盖
校验中

当前主要短板

output.evaluation.dimensions.coverage
引用覆盖
校验中

逐主张映射

output.evaluation.dimensions.claimCitationCoverage
RESULT VISUAL

主张—证据质量图

verified fixed sample / evidence
  1. 01
    综合质量
    executed output / evidence 01
    校验中
  2. 02
    有据性
    executed output / evidence 02
    校验中
  3. 03
    证据覆盖
    executed output / evidence 03
    校验中
  4. 04
    引用覆盖
    executed output / evidence 04
    校验中
LATEST RUN

业务决策、执行健康与发布回执

执行检查通过,只表示输出有效、未超预算且可以重放;是否发布仍由业务状态和发布检查决定。

正在加载合同并执行固定样本;超时会自动取消且不会产生外部副作用。
EDIT INPUT / RUN AGAIN

换一组输入,重新运行项目引擎

基准输入和压力输入都提交给同一版本 API。压力输入用于触发项目特定的拒绝、降级或复核规则,结果可以重复运行。

编辑完整 JSON 输入
REVIEW QUEUE / READ ONLY

下一步不是一个按钮

  1. P0
    EXECUTED
    高风险答案转人审

    不自动批准;保留评测原因并等待合规复核。

    负责人 / 模型风险评审员

  2. P1
    CONTROL
    RAG-Q01

    拒绝不可复现 run

    负责人 / RAG 评测数据负责人

  3. P1
    DRILL
    评测器偏置

    禁用受影响自动门

    负责人 / 平台 SRE / 安全

DATA SOURCES / THIS RUN

公开预览与本次运行分轨

  1. SOURCE 01disconnected preview

    BEIR Information Retrieval Benchmark

    rageval.beir_item.raw.v1
  2. SOURCE 02disconnected preview

    Natural Questions

    rageval.nq_item.raw.v1
  3. VALUES RETURNED BY THE ENGINE

    有引用的合规回答

    本次计算只使用上方标明的数据版本;公开来源目前仅提供预览,尚未接入引擎。

FAILURE TEST / DESIGN ONLY

故障必须有检测和恢复路径

症状
特定主题系统性低分
检测
分层校准和 reviewer 分歧
隔离
禁用受影响自动门
恢复
重标 golden set 并重训阈值
SYSTEM / FROM INPUT TO DECISION

信息从哪里来、怎样处理、何时调用工具,以及谁负责最后确认。

对候选 RAG 输出执行证据、政策和延迟评测。

AI 能力边界
不生成答案,也不调用 LLM-as-Judge;当前评测器和证据注册表是确定性合成夹具。
人工责任
高风险样本必须人审,复核后才能把错误模式写回记忆。
01 / EXECUTED TRACE

信息处理顺序

source → context → intelligence → harness → decision → feedback
  1. 01
    信息进入

    读取候选回答、主张、引用映射、风险等级和延迟。

    输入
    RagCandidate
    输出
    candidate envelope
    • typed candidate
    • risk class
    转换控制

    模型输出明确标记为不可信。

  2. 02
    上下文构造

    将 claimCitation 映射到版本化证据注册表。

    输入
    claims + citations
    输出
    grounded claim map
    • evidence registry
    • claim mapping
    转换控制

    未知引用不计为有效证据。

  3. 03
    模型处理

    计算 grounding、citation、coverage、safety 和 latency。

    输入
    grounded claim map
    输出
    dimensions + composite
    • deterministic evaluator
    • weighted composite
    转换控制

    敏感数据和绝对化模式单独扫描。

  4. 04
    运行约束

    按风险等级与指标执行 approve/review/reject 门。

    输入
    dimensions
    输出
    decision + reasons
    • risk gate
    • policy gate
    转换控制

    高风险永不自动批准。

  5. 05
    决策产物

    输出维度 scorecard、原因和治理元数据。

    输入
    decision
    输出
    EvaluationResult
    • scorecard
    • governance card
    转换控制

    低引用精度、敏感数据或不安全模式直接 reject。

  6. 06
    反馈回路

    人工复核后有界更新 citation misses 和 rejected patterns。

    输入
    review result
    输出
    ErrorMemory
    • HITL feedback
    • bounded memory
    转换控制

    只保留最近/前 100 项以限制记忆增长。

IMPLEMENTATION DETAILS / OPTIONAL

展开 8 个运行步骤、API 边界与实现状态

02 / RUNTIME CHECKS

运行时怎样限制模型和工具

运行图同时列出状态、预算、权限、失败处理、评测和人工审批。

编排H01
resolve evidence → score dimensions → gate → optional learn。
可检查证据evaluateCandidate + learnFromReview
状态与记忆H02
ErrorMemory 保存引用遗漏、拒绝模式和 reviewed 计数。
可检查证据ErrorMemory
预算H03
反馈记忆最多 100 个引用键和 100 个拒绝模式。
可检查证据slice(0,100) + slice(-100)
权限H04
评测器只读取候选并返回分数;不能发布回答。
可检查证据modelOutputsTrusted=false
护栏H05
风险等级、PII 正则、危险措辞和引用精度联动。
可检查证据governance + reasons
失败与恢复H06
reject 与 human-review 都带结构化 reasons。
可检查证据EvaluationResult.reasons
评测H07
六维分数与 composite 使用显式权重。
可检查证据EvaluationDimensions
最终权限H08
只有低风险完整证据样本可自动批准;其余由评审者决定。
可检查证据governance.canAutoApprove
03 / API EXECUTION ENVELOPE

所有项目共享的运行边界

POST /api/labs/rag-eval-workbench

这里说明 API 当前做到哪一步。页面演示可以观察底层函数,但不等同于已接入真实业务数据或外部写入。

运行姿态
DETERMINISTIC SANDBOX

18 个 API 引擎只读取请求并返回结果,不写入外部系统。当前未接入登录、审计数据库或线上业务数据。

入口契约
STRICT ZOD + 32KB

API 输入先经过严格 schema/default 标准化;HTTP JSON 请求上限 32KB。

执行预算
100–150MS / 256KB

每个项目单独设置耗时预算和 256KB 输出上限;超时会标记降级,非有限数和超大输出会被阻断。

回执与重放
CONTENT-ADDRESSED

回执包含输入/输出/idempotency hash、耗时和质量;尚无持久幂等存储或重复请求短路。

流量与身份
100/MIN / NO AUTH

当前使用进程内 IP 限流和公开 CORS;尚无登录、租户、角色或复核人身份。

页面与 API
TWO EXECUTION SURFACES

站内 Demo 多为底层引擎的直接交互;/api/labs 才增加完整输入校验、通用质量门与执行回执。

公开数据
LIVE PREVIEW / DISCONNECTED

页面可以预览官方端点的数据,但这些数据尚未保存、统一字段或通过质量校验,也不会送入项目引擎。

上线阻塞
OWNER + AUDIT + DATA + OPS

上线前还需要负责人签字、持久审计、全局限流、代表性数据验证、值班安排和回滚演练。

04 / IMPLEMENTATION STATUS

用了什么、解决什么、现在能否运行

每一项都写明它在当前引擎中的作用,以及属于实际执行、固定样本还是待实现设计。

当前项目技术证据矩阵
技术系统作用当前证据姿态
Evidence registryRetrieval把请求绑定到可检查的证据。citation ID 映射到可匹配证据词。明确夹具
Claim-citation mappingEvaluation量化质量、稳定性或统计可信度。逐主张计算 groundedness 和 citation coverage。当前执行
Policy safety scannerControl限制权限、风险、发布或人工责任。危险确定性、注入语句和敏感数据触发 reason。当前执行
Weighted evaluatorEvaluation量化质量、稳定性或统计可信度。六维质量指标合成 composite。当前执行
Risk-aware release gateAgent / Harness编排步骤、工具、状态和退出条件。风险等级决定是否允许 auto-approve。当前执行
Bounded error memoryAgent / Harness编排步骤、工具、状态和退出条件。人工拒绝结果进入有限 citation/pattern 记忆。当前执行
Evaluator versioningObservability暴露版本、轨迹、原因和可复现证据。响应携带 evaluator 与 evidence registry 版本。当前执行
HITL adjudicationControl限制权限、风险、发布或人工责任。高风险输出保持 human-review。当前执行
DIRECT ENGINE / OPTIONAL

检查底层函数,而不是重复主控制台。

完整 API 工作台已在上方;这里保留直接函数交互用于调试。

RUN THE ENGINE

直接观察项目的本地引擎。

页面 Demo 侧重底层函数交互;完整 /api/labs 包装另含严格输入校验、通用质量门和执行回执。

这是站内运行的工程沙箱:使用公开或合成样本执行真实算法;存在公开仓库时可继续查看源码。

RUNrag-eval-workbenchAPI ↗

公开作品集重建:浏览器内运行真实算法与合成数据,不包含雇主代码、模型权重或客户数据。

高风险客户需要核验受益所有人和资金来源,并执行加强尽调;结论需要由合规复核。
groundedness100.0%
citationPrecision100.0%
coverage60.0%
claimCitationCoverage100.0%
policySafety100.0%
latencyScore88.8%
composite94.9%
CASE DETAILS / OPTIONAL

继续查看项目背景、架构和交付记录。

详细案例仍完整保留,但不再与运行结果争夺注意力。

职责
AI 产品 + 评测工程重建
年份
2025
交付方式
独立实现
运行定位
独立设计 / 可运行沙箱
CASE / 01

项目概述

把 Natixis 经历中的模型初审、人类复核和错误样本回流重建为五维 RAG 评测工作台;每个候选答案都经过证据、引用、安全与 SLA 门禁。

CASE / 02

问题

P01

只看答案是否流畅无法判断是否有证据、是否引用正确。

P02

人审意见如果不进入错误记忆,同类问题会重复发生。

CASE / 03

架构与流程

architecture.diagram
STEP 01
候选答案

答案、claims、citations、SLA

STEP 02
五维评测

证据 / 引用 / 覆盖 / 安全 / 时延

STEP 03
决策门禁

自动通过 / 人审 / 拒绝

STEP 04
人工复核

接受或拒绝并写原因

STEP 05
错误记忆

回流引用缺失和危险模式

CASE / 04

核心功能

VIEW 01

评测雷达

逐维展示候选答案质量。

VIEW 02

硬拒绝规则

危险确定性或无效引用直接拒绝。

VIEW 03

人审动作

接受/拒绝直接写入反馈记忆。

VIEW 04

可解释原因

门禁失败原因逐条输出。

CASE / 05

沙箱验证证据

5
评测维度

不再用单一主观总分。

3-way
发布决策

通过 / 人审 / 拒绝。

Loop
错误样本回流

复核结果影响后续评测。

CASE / 06

使用的技术

TypeScriptRAG EvaluationCitation AuditHITLError MemoryReact
IMPLEMENTATION DETAILS / OPTIONAL

展开数据、管道与生产控制。

SLO、权限、灰度、数据来源与故障恢复作为工程附录保留。

IMPLEMENTATION DETAILS

数据、管道与生产控制。

以下保留数据来源、运行限制和工程实现,不占用项目首屏。

DELIVERY / RESPONSIBILITIES·HIGH RISK

RAG 质量与风险评审平台

把回答拆成主张、证据和风险,让高风险 RAG 结果在发布前可挑战。

RESPONSIBLE ROLE

模型风险评审员

PIPELINE
5 STAGES
CONTRACTS
5 SPECS
QUALITY
4 RULES
PUBLIC DATA
2 FEEDS
架构和运行目标;容量与 SLO 是设计指标,不是线上实绩
候选回答
TARGET
1M/day

分层抽检

golden 样本
TARGET
250k

裁决与版本

评审证据
TARGET
3 years

不可变反馈

沙箱评测
MEASURED
5 axes

主张、引用、安全、质量、延迟

WORKFLOW

从接入到签署的责任链

  1. 01

    风险分层

    接入策略

    用途和影响标签

  2. 02

    主张抽取

    评测服务

    逐主张证据映射

  3. 03

    独立评测

    评测器

    避免同源模型自评

  4. 04

    人工裁决

    风险评审

    高风险默认人工

  5. 05

    错误回流

    质量平台主管

    审核、限量、可撤回

TOPOLOGY

可替换服务与控制边界

EDGE
evaluation-api

版本、风险与配额

SERVICE
claim-mapper

主张与引用对齐

SERVICE
evaluator-suite

独立多轴评测

CONTROL
review-queue

身份、SLA 和裁决

STORE
error-memory

经审核失败模式

下一个项目

财务 RAG 分析链