返回全部项目
RESUME RECONSTRUCTION/ 2026

视频生成评测与 MCP 路由

多维 Benchmark、LLM-as-Judge 校准、MCP 工具路由与 LoRA 低秩更新实验

RESULT / FIXED SAMPLE / 2026-07-17
暂缓发布

四维视频评分样本

综合分 81.16%,Judge 与人评分仅差 0.82pp,但主体一致性仅 74%,综合门禁只达到 review。

建议决策

保留人工复核;在版本化媒体基准和多评审校准完成前不晋级。

综合分
81.16%

门禁未通过

人机评分差
0.82pp

低于 12pp 上限

工具预算
5/6

预算内完成

生成质量四维评分得分
时序82%
主体74%
运动79%
提示对齐88%

结果边界合成指标与矩阵;不含私有模型权重或内部 Benchmark。

LIVE RUN / COMPLETE FLOWRUN / baselineDOES NOT WRITE TO EXTERNAL SYSTEMS

质量短板、Judge 偏差和工具预算在哪一层阻止晋级?

页面先自动运行基准样本;也可以在下方编辑完整输入或执行项目专属压力场景。状态、指标、视觉和回执都来自当前 API 输出。

当前引擎状态

暂缓发布

loadingmoderate riskrate/
加权质量
校验中

四维指标

output.evaluation.weightedScore
人机差异
校验中

上限 12pp

output.evaluation.humanGap
稳定性
校验中

合成校准

output.evaluation.stability
工具使用
校验中

预算上限 6

output.routing.toolsUsed
RESULT VISUAL

评测路由矩阵

verified fixed sample / matrix
CELL 01
校验中
加权质量
CELL 02
校验中
人机差异
CELL 03
校验中
稳定性
CELL 04
校验中
工具使用
LATEST RUN

业务决策、执行健康与发布回执

执行检查通过,只表示输出有效、未超预算且可以重放;是否发布仍由业务状态和发布检查决定。

正在加载合同并执行固定样本;超时会自动取消且不会产生外部副作用。
EDIT INPUT / RUN AGAIN

换一组输入,重新运行项目引擎

基准输入和压力输入都提交给同一版本 API。压力输入用于触发项目特定的拒绝、降级或复核规则,结果可以重复运行。

编辑完整 JSON 输入
REVIEW QUEUE / READ ONLY

下一步不是一个按钮

  1. P0
    EXECUTED
    暂缓发布

    保留人工复核;在版本化媒体基准和多评审校准完成前不晋级。

    负责人 / 视频模型评测工程师

  2. P1
    CONTROL
    VID-Q01

    隔离并重生资产

    负责人 / 多模态评测平台主管

  3. P1
    DRILL
    评测器回归

    冻结模型晋级并回滚评测器

    负责人 / 平台 SRE / 安全

DATA SOURCES / THIS RUN

公开预览与本次运行分轨

  1. SOURCE 01disconnected preview

    YouTube-8M

    videoeval.youtube8m_item.raw.v1
  2. SOURCE 02disconnected preview

    Ego4D benchmark data

    videoeval.ego4d_item.raw.v1
  3. VALUES RETURNED BY THE ENGINE

    四维视频评分样本

    本次计算只使用上方标明的数据版本;公开来源目前仅提供预览,尚未接入引擎。

FAILURE TEST / DESIGN ONLY

故障必须有检测和恢复路径

症状
新版本系统性抬高分数
检测
golden set 与人评 gap
隔离
冻结模型晋级并回滚评测器
恢复
重算受影响 benchmark
SYSTEM / FROM INPUT TO DECISION

信息从哪里来、怎样处理、何时调用工具,以及谁负责最后确认。

确定性多维视频评测、工具路由和 4×4 LoRA 数学实验。

AI 能力边界
没有处理真实视频、调用真实 MCP 或训练媒体模型;Judge 和 LoRA 都是明确标注的夹具。
人工责任
多评审校准和真实适配器验证完成前,人工保留发布决定。
01 / EXECUTED TRACE

信息处理顺序

source → context → intelligence → harness → decision → feedback
  1. 01
    信息进入

    读取 prompt、四维指标、Judge/人工分数和 LoRA 参数。

    输入
    VideoEvalRouterInput
    输出
    normalized metrics
    • typed benchmark input
    • untrusted prompt
    转换控制

    prompt 先做注入扫描。

  2. 02
    上下文构造

    按 prompt 与弱项选择评测工具集合。

    输入
    prompt + metrics
    输出
    evaluation.routedTools
    • tool router
    • metric thresholds
    转换控制

    工具集合受 toolBudget 限制。

  3. 03
    模型处理

    融合加权 benchmark、线性 Judge 校准和人工差距。

    输入
    metrics + scores
    输出
    evaluation.verdict
    • weighted score
    • judge calibration
    转换控制

    pass 需综合分和 humanGap 同时达标。

  4. 04
    运行约束

    运行无副作用工具权限、预算和 release checks。

    输入
    verdict + routedTools
    输出
    routing + releaseGate
    • permission trace
    • multi-check gate
    转换控制

    攻击输入或任一检查失败即 hold。

  5. 05
    决策产物

    给出 shadow-evaluation 资格而非生产发布。

    输入
    releaseGate.checks
    输出
    releaseGate.decision
    • shadow gate
    • blocker list
    转换控制

    productionPromotionBlocked 始终为 true。

  6. 06
    反馈回路

    暴露评测轨迹、版本、矩阵增量和阻塞项。

    输入
    decision
    输出
    trace + lora + blockers
    • evaluation trace
    • model card evidence
    转换控制

    夹具身份和真实训练缺口明确显示。

IMPLEMENTATION DETAILS / OPTIONAL

展开 8 个运行步骤、API 边界与实现状态

02 / RUNTIME CHECKS

运行时怎样限制模型和工具

运行图同时列出状态、预算、权限、失败处理、评测和人工审批。

编排H01
route → benchmark → calibrate → LoRA math → gate。
可检查证据runVideoEvalRouter
状态与记忆H02
所有评测器版本、阈值和参数随响应返回。
可检查证据evaluation.evaluatorVersions + lora
预算H03
toolBudget 限制路由工具总数。
可检查证据routing.maximumTools
权限H04
每个工具只有 synthetic-evaluation:execute 且无副作用。
可检查证据routing.permissions
护栏H05
注入、Judge gap、适配器稳定性和参数效率同时检查。
可检查证据releaseGate.checks
失败与恢复H06
hold-evaluation 返回具体 blocker,不会替代为默认 pass。
可检查证据releaseGate.blockers
评测H07
四维加权、稳定性、Judge-human gap 和 verdict 全部可检查。
可检查证据evaluation.trace
最终权限H08
人工与真实 holdout 评测负责生产推广。
可检查证据productionPromotionBlocked=true
03 / API EXECUTION ENVELOPE

所有项目共享的运行边界

POST /api/labs/video-eval-router

这里说明 API 当前做到哪一步。页面演示可以观察底层函数,但不等同于已接入真实业务数据或外部写入。

运行姿态
DETERMINISTIC SANDBOX

18 个 API 引擎只读取请求并返回结果,不写入外部系统。当前未接入登录、审计数据库或线上业务数据。

入口契约
STRICT ZOD + 32KB

API 输入先经过严格 schema/default 标准化;HTTP JSON 请求上限 32KB。

执行预算
100–150MS / 256KB

每个项目单独设置耗时预算和 256KB 输出上限;超时会标记降级,非有限数和超大输出会被阻断。

回执与重放
CONTENT-ADDRESSED

回执包含输入/输出/idempotency hash、耗时和质量;尚无持久幂等存储或重复请求短路。

流量与身份
100/MIN / NO AUTH

当前使用进程内 IP 限流和公开 CORS;尚无登录、租户、角色或复核人身份。

页面与 API
TWO EXECUTION SURFACES

站内 Demo 多为底层引擎的直接交互;/api/labs 才增加完整输入校验、通用质量门与执行回执。

公开数据
LIVE PREVIEW / DISCONNECTED

页面可以预览官方端点的数据,但这些数据尚未保存、统一字段或通过质量校验,也不会送入项目引擎。

上线阻塞
OWNER + AUDIT + DATA + OPS

上线前还需要负责人签字、持久审计、全局限流、代表性数据验证、值班安排和回滚演练。

04 / IMPLEMENTATION STATUS

用了什么、解决什么、现在能否运行

每一项都写明它在当前引擎中的作用,以及属于实际执行、固定样本还是待实现设计。

当前项目技术证据矩阵
技术系统作用当前证据姿态
Metric-weighted benchmarkEvaluation量化质量、稳定性或统计可信度。temporal/subject/motion/prompt 以显式权重融合。当前执行
Tool routerAgent / Harness编排步骤、工具、状态和退出条件。prompt 和低分维度决定工具集合。当前执行
Linear judge calibrationAI / ML执行评分、分类、传播或模型近似计算。0.88×score+0.035 的合成校准。明确夹具
Judge-human gapEvaluation量化质量、稳定性或统计可信度。校准分与调用方人工分形成发布约束。明确夹具
LoRA matrix updateAI / ML执行评分、分类、传播或模型近似计算。真实计算 ΔW=(alpha/r)BA,但矩阵仅 4×4。明确夹具
Least-privilege tool traceControl限制权限、风险、发布或人工责任。工具权限和副作用逐项返回。当前执行
Prompt-injection scanControl限制权限、风险、发布或人工责任。可执行命令或绕过指令会阻断资格。当前执行
Shadow release gateAgent / Harness编排步骤、工具、状态和退出条件。只允许进入 shadow evaluation,生产推广固定阻塞。当前执行
DIRECT ENGINE / OPTIONAL

检查底层函数,而不是重复主控制台。

完整 API 工作台已在上方;这里保留直接函数交互用于调试。

RUN THE ENGINE

直接观察项目的本地引擎。

页面 Demo 侧重底层函数交互;完整 /api/labs 包装另含严格输入校验、通用质量门和执行回执。

这是站内运行的工程沙箱:使用公开或合成样本执行真实算法;存在公开仓库时可继续查看源码。

RUNvideo-eval-routerAPI ↗

公开作品集重建:浏览器内运行真实算法与合成数据,不包含雇主代码、模型权重或客户数据。

评测门禁

REVIEW
route(frame-sampler → vbench-core → identity-checker → motion-analyzer → llm-judge)
benchmark=0.812
judge.calibrated=0.792
human_gap=0.008
gate=review

LoRA ΔW

真实执行 ΔW = (α/r)·B·A 的低秩矩阵更新;这是算法实验,不宣称在浏览器训练完整视频模型。

-0.1420.090-0.0050.118-0.1870.0100.143-0.0290.224-0.047-0.123-0.0250.179-0.1270.025-0.172
adapter parameters
16
delta Frobenius norm
0.4947
full / adapter ratio
1.00×
MCP tools
frame-sampler → vbench-core → identity-checker → motion-analyzer → llm-judge
CASE DETAILS / OPTIONAL

继续查看项目背景、架构和交付记录。

详细案例仍完整保留,但不再与运行结果争夺注意力。

职责
评测产品 + Agent 工程重建
年份
2026
交付方式
独立实现
运行定位
独立设计 / 可运行沙箱
CASE / 01

项目概述

将视频生成 Benchmark、LLM-as-Judge、人类校准、MCP 工具路由和 LoRA 低秩更新拆成可验证模块;页面运行真实矩阵更新,但不冒充浏览器内训练完整视频模型。

CASE / 02

问题

P01

单一总分掩盖主体一致性、时序稳定与动作质量之间的差异。

P02

LLM Judge 未经人类校准时容易系统性偏高,不能直接作为发布门禁。

CASE / 03

架构与流程

architecture.diagram
STEP 01
指标采样

时序 / 主体 / 运动 / 对齐

STEP 02
MCP 路由

按 Prompt 与薄弱指标选择工具

STEP 03
Judge 校准

用人审样本修正系统偏差

STEP 04
发布门禁

通过 / 复核 / 失败

STEP 05
LoRA 实验

执行 ΔW=(α/r)BA

CASE / 04

核心功能

VIEW 01

可调指标

拖动四个指标即时重算门禁。

VIEW 02

路由 Trace

展示每个评测工具为何被调用。

VIEW 03

校准误差

显式显示 Judge 与人评分差异。

VIEW 04

低秩矩阵

查看不同 rank 的 ΔW 与参数量。

CASE / 05

沙箱验证证据

4
核心指标

独立可调、组合门禁。

5
路由工具

按需调用而非固定流水线。

ΔW
真实 LoRA 数学

浏览器内复现低秩更新。

CASE / 06

使用的技术

TypeScriptVBench-style MetricsLLM-as-JudgeMCP RoutingLoRAReact
IMPLEMENTATION DETAILS / OPTIONAL

展开数据、管道与生产控制。

SLO、权限、灰度、数据来源与故障恢复作为工程附录保留。

IMPLEMENTATION DETAILS

数据、管道与生产控制。

以下保留数据来源、运行限制和工程实现,不占用项目首屏。

DELIVERY / RESPONSIBILITIES·MODERATE RISK

多模态模型评测与路由平台

用可复现 benchmark、人工校准和工具预算决定模型是否可晋级。

RESPONSIBLE ROLE

视频模型评测工程师

PIPELINE
5 STAGES
CONTRACTS
5 SPECS
QUALITY
4 RULES
PUBLIC DATA
2 FEEDS
架构和运行目标;容量与 SLO 是设计指标,不是线上实绩
视频评测
TARGET
100k/day

异步 GPU 队列

媒体冷存储
TARGET
12 PB

内容寻址与生命周期

模型版本
TARGET
200

同一 golden set 比较

沙箱维度
MEASURED
6 dims

含 judge-human gap

WORKFLOW

从接入到签署的责任链

  1. 01

    样本登记

    数据运营

    版权、内容与去重

  2. 02

    工具路由

    MCP 路由器

    能力与成本预算

  3. 03

    多维评测

    评测集群

    评测器版本固定

  4. 04

    人工校准

    标注团队

    盲评与一致性

  5. 05

    模型晋级

    模型委员会

    shadow 与回滚

TOPOLOGY

可替换服务与控制边界

STORE
media-registry

媒体哈希、许可与切片

CONTROL
mcp-router

工具权限、预算与追踪

SERVICE
evaluator-pool

版本化指标执行

CONTROL
human-calibration

盲评和 judge gap

STORE
benchmark-ledger

样本、模型与结论版本

下一个项目

狼人杀 Agent Loop