TECHNICAL WALKTHROUGH / CHECKED

视频生成评测与 MCP 路由技术执行说明

视频评测路由与校准 Harness

CURRENT IMPLEMENTATION

名称涉及视频,但当前第一步输入不是视频文件:它接收 Prompt、四维指标、Judge/人工分数和 LoRA 参数。没有真实分镜识别或逐镜文案生成。

AI 边界

没有处理真实视频、调用真实 MCP 或训练媒体模型;Judge 和 LoRA 都是明确标注的夹具。

人工权限

多评审校准和真实适配器验证完成前,人工保留发布决定。

运行拓扑:用户如何抵达结果

页面负责收集与组装输入;合同、引擎和回执负责把边界变成可检查的执行链。

  1. 01

    页面交互

    指标工作台;用户调 Prompt、分数、rank 和 alpha 后查看路由与 gate,不播放或标注视频。

    当前执行
  2. 02

    VideoEvalRouterInput

    prompt 描述待评视频内容;metrics 和分数已由调用方提供。引擎不从像素自行计算它们。

    当前执行
  3. 03

    分阶段引擎

    输入/注入扫描 → 指标弱项路由 → 加权评分 → Judge 校准/人机差距 → LoRA 数学实验 → shadow gate

    当前执行
  4. 04

    Video evaluation receipt

    输出是运行级 JSON,不含 shots[]、timecode、逐镜文案、音频或数字人字段。

    当前执行
MODEL INPUT AND OUTPUT合同不接受

没有直接模型交互,也没有 Chatbot。

EXECUTION ORDER

prompt 是被评内容的描述字段,不是发送给生成模型的 User Prompt。

模型、算法与工具逐项列账

模型名、规则引擎、检索器、评测器和控制层分开陈述;相似名称不等于真实调用。

metric-weighted evaluator

当前执行

temporal / subject / motion / prompt 四维分数按固定权重融合并路由工具。

由页面 Demo 或 POST /api/labs/:slug 同步调用;无外部推理请求。

linear judge calibration

测试夹具

用 0.88×score+0.035 演示 Judge 校准和人机差距门。

调用方直接提供 judgeScore 和 humanScore;没有 LLM-as-Judge 请求。

4×4 LoRA matrix lab

测试夹具

真实计算 ΔW=(alpha/r)BA,但不是媒体模型训练。

在内存中对确定性 4×4 矩阵运行。

raw-video evaluator stack

已设计 / 未接入

工程附录设计了视频资产、帧/光流/嵌入和版本化指标容器;尚未连接当前 API。

当前不执行;需要对象存储、解码器、分镜/帧合同和真实评测 worker。

Evaluation

Metric-weighted benchmark

当前执行

temporal/subject/motion/prompt 以显式权重融合。

Agent / Harness

Tool router

当前执行

prompt 和低分维度决定工具集合。

AI / ML

Linear judge calibration

测试夹具

0.88×score+0.035 的合成校准。

Evaluation

Judge-human gap

测试夹具

校准分与调用方人工分形成发布约束。

AI / ML

LoRA matrix update

测试夹具

真实计算 ΔW=(alpha/r)BA,但矩阵仅 4×4。

Control

Least-privilege tool trace

当前执行

工具权限和副作用逐项返回。

Control

Prompt-injection scan

当前执行

可执行命令或绕过指令会阻断资格。

Agent / Harness

Shadow release gate

当前执行

只允许进入 shadow evaluation,生产推广固定阻塞。

输入合同、分步执行与结构化输出

评测、校准、适配器稳定性和发布资格分开,任何一项失败都不能被总分掩盖。真实视频管道还需在这些步骤之前增加解码与分镜。

INPUT

VideoEvalRouterInput

当前 strict schema 会拒绝 video/file/frames/shots 等未知字段;字段不是留空,而是根本不在合同里。

  • prompt
  • metrics.temporal
  • metrics.subject
  • metrics.motion
  • metrics.prompt
  • judgeScore
  • humanScore
  • rank
  • alpha
  • toolBudget
  • maximumJudgeGap
STAGED EXECUTION

输入/注入扫描 → 指标弱项路由 → 加权评分 → Judge 校准/人机差距 → LoRA 数学实验 → shadow gate

  1. 01

    读取 prompt、四维指标、Judge/人工分数和 LoRA 参数。

    VideoEvalRouterInputnormalized metrics

  2. 02

    按 prompt 与弱项选择评测工具集合。

    prompt + metricsevaluation.routedTools

  3. 03

    融合加权 benchmark、线性 Judge 校准和人工差距。

    metrics + scoresevaluation.verdict

  4. 04

    运行无副作用工具权限、预算和 release checks。

    verdict + routedToolsrouting + releaseGate

  5. 05

    给出 shadow-evaluation 资格而非生产发布。

    releaseGate.checksreleaseGate.decision

  6. 06

    暴露评测轨迹、版本、矩阵增量和阻塞项。

    decisiontrace + lora + blockers

OUTPUT

Video evaluation receipt

一个已经量化的视频评测 run,而不是一段原始视频或一个分镜。

  • evaluation
  • lora
  • routing
  • security
  • releaseGate

Prompt 与 Schema 的四层装配

System、Few-shot、用户运行输入与输出格式分别标注;没有 Prompt 的项目不会假装存在 Prompt。

  1. 01

    系统约束

    没有 System Prompt;显式权重、工具阈值、校准公式和发布 gate承担系统约束。

    合同不接受
  2. 02

    少样本

    不注入 Few-shot。baseline / stress 只用于可复现测试,不进入模型上下文。

    合同不接受
  3. 03

    运行时输入

    prompt 字段作为路由特征和注入扫描对象,不进入模型消息数组。

    当前执行
  4. 04

    输出合同

    输出形状由 Zod + VideoEvalRouter result 与 TypeScript 返回契约决定,不靠 One-shot 示例暗示。

    当前执行

多模态准入矩阵:每一项都有明确状态

图片、音频、视频和数字人不会用空字段含混带过;未接入就明确写出未接入。

文本

当前执行

prompt 只描述内容并参与路由。

表格 / JSON

当前执行

四维指标、Judge/人工分数和 LoRA 参数以数值表进入。

图片

已设计 / 未接入

目标架构需要帧采样与嵌入;当前 API 不接收图片或帧。

音频

合同不接受

没有音频上传、ASR 或声学特征管道。

视频

已设计 / 未接入

生产设计有 video asset / metric result 合同;当前没有上传、解码、镜头边界检测或时间戳 UI。

数字人

合同不接受

没有数字人资产、驱动参数或渲染合同。

人工输入 / 复核

当前执行

humanScore 由调用方提供;多评审校准尚未实现。

用户在页面上操作,样本用于验证边界

预设不是替用户做决定,也不是偷偷注入 Few-shot;它让同一合同在基线与压力条件下可复现。

交互表面

指标工作台;用户调 Prompt、分数、rank 和 alpha 后查看路由与 gate,不播放或标注视频。

选择样本的目的

基线展示评分链;Judge 漂移样本扩大人机差并收紧工具预算,验证晋级会冻结。

评测器偏差

STRESS TEST

降低主体一致性并扩大 Judge 与人工评分差。

冻结评测晋级

当前项目不建立外部聊天会话;页面输入进入严格合同,由规则、算法或确定性 Harness 执行。