没有直接模型交互,也没有 Chatbot。
视频生成评测与 MCP 路由技术执行说明
视频评测路由与校准 Harness
名称涉及视频,但当前第一步输入不是视频文件:它接收 Prompt、四维指标、Judge/人工分数和 LoRA 参数。没有真实分镜识别或逐镜文案生成。
没有处理真实视频、调用真实 MCP 或训练媒体模型;Judge 和 LoRA 都是明确标注的夹具。
多评审校准和真实适配器验证完成前,人工保留发布决定。
运行拓扑:用户如何抵达结果
页面负责收集与组装输入;合同、引擎和回执负责把边界变成可检查的执行链。
- 01
页面交互
指标工作台;用户调 Prompt、分数、rank 和 alpha 后查看路由与 gate,不播放或标注视频。
当前执行 - 02
VideoEvalRouterInput
prompt 描述待评视频内容;metrics 和分数已由调用方提供。引擎不从像素自行计算它们。
当前执行 - 03
分阶段引擎
输入/注入扫描 → 指标弱项路由 → 加权评分 → Judge 校准/人机差距 → LoRA 数学实验 → shadow gate
当前执行 - 04
Video evaluation receipt
输出是运行级 JSON,不含 shots[]、timecode、逐镜文案、音频或数字人字段。
当前执行
prompt 是被评内容的描述字段,不是发送给生成模型的 User Prompt。
模型、算法与工具逐项列账
模型名、规则引擎、检索器、评测器和控制层分开陈述;相似名称不等于真实调用。
metric-weighted evaluator
当前执行temporal / subject / motion / prompt 四维分数按固定权重融合并路由工具。
由页面 Demo 或 POST /api/labs/:slug 同步调用;无外部推理请求。
linear judge calibration
测试夹具用 0.88×score+0.035 演示 Judge 校准和人机差距门。
调用方直接提供 judgeScore 和 humanScore;没有 LLM-as-Judge 请求。
4×4 LoRA matrix lab
测试夹具真实计算 ΔW=(alpha/r)BA,但不是媒体模型训练。
在内存中对确定性 4×4 矩阵运行。
raw-video evaluator stack
已设计 / 未接入工程附录设计了视频资产、帧/光流/嵌入和版本化指标容器;尚未连接当前 API。
当前不执行;需要对象存储、解码器、分镜/帧合同和真实评测 worker。
Metric-weighted benchmark
temporal/subject/motion/prompt 以显式权重融合。
Tool router
prompt 和低分维度决定工具集合。
Linear judge calibration
0.88×score+0.035 的合成校准。
Judge-human gap
校准分与调用方人工分形成发布约束。
LoRA matrix update
真实计算 ΔW=(alpha/r)BA,但矩阵仅 4×4。
Least-privilege tool trace
工具权限和副作用逐项返回。
Prompt-injection scan
可执行命令或绕过指令会阻断资格。
Shadow release gate
只允许进入 shadow evaluation,生产推广固定阻塞。
输入合同、分步执行与结构化输出
评测、校准、适配器稳定性和发布资格分开,任何一项失败都不能被总分掩盖。真实视频管道还需在这些步骤之前增加解码与分镜。
VideoEvalRouterInput
当前 strict schema 会拒绝 video/file/frames/shots 等未知字段;字段不是留空,而是根本不在合同里。
promptmetrics.temporalmetrics.subjectmetrics.motionmetrics.promptjudgeScorehumanScorerankalphatoolBudgetmaximumJudgeGap
输入/注入扫描 → 指标弱项路由 → 加权评分 → Judge 校准/人机差距 → LoRA 数学实验 → shadow gate
- 01
读取 prompt、四维指标、Judge/人工分数和 LoRA 参数。
VideoEvalRouterInput → normalized metrics
- 02
按 prompt 与弱项选择评测工具集合。
prompt + metrics → evaluation.routedTools
- 03
融合加权 benchmark、线性 Judge 校准和人工差距。
metrics + scores → evaluation.verdict
- 04
运行无副作用工具权限、预算和 release checks。
verdict + routedTools → routing + releaseGate
- 05
给出 shadow-evaluation 资格而非生产发布。
releaseGate.checks → releaseGate.decision
- 06
暴露评测轨迹、版本、矩阵增量和阻塞项。
decision → trace + lora + blockers
Video evaluation receipt
一个已经量化的视频评测 run,而不是一段原始视频或一个分镜。
evaluationloraroutingsecurityreleaseGate
Prompt 与 Schema 的四层装配
System、Few-shot、用户运行输入与输出格式分别标注;没有 Prompt 的项目不会假装存在 Prompt。
- 01
系统约束
没有 System Prompt;显式权重、工具阈值、校准公式和发布 gate承担系统约束。
合同不接受 - 02
少样本
不注入 Few-shot。baseline / stress 只用于可复现测试,不进入模型上下文。
合同不接受 - 03
运行时输入
prompt 字段作为路由特征和注入扫描对象,不进入模型消息数组。
当前执行 - 04
输出合同
输出形状由 Zod + VideoEvalRouter result 与 TypeScript 返回契约决定,不靠 One-shot 示例暗示。
当前执行
多模态准入矩阵:每一项都有明确状态
图片、音频、视频和数字人不会用空字段含混带过;未接入就明确写出未接入。
文本
当前执行prompt 只描述内容并参与路由。
表格 / JSON
当前执行四维指标、Judge/人工分数和 LoRA 参数以数值表进入。
图片
已设计 / 未接入目标架构需要帧采样与嵌入;当前 API 不接收图片或帧。
音频
合同不接受没有音频上传、ASR 或声学特征管道。
视频
已设计 / 未接入生产设计有 video asset / metric result 合同;当前没有上传、解码、镜头边界检测或时间戳 UI。
数字人
合同不接受没有数字人资产、驱动参数或渲染合同。
人工输入 / 复核
当前执行humanScore 由调用方提供;多评审校准尚未实现。
用户在页面上操作,样本用于验证边界
预设不是替用户做决定,也不是偷偷注入 Few-shot;它让同一合同在基线与压力条件下可复现。
交互表面
指标工作台;用户调 Prompt、分数、rank 和 alpha 后查看路由与 gate,不播放或标注视频。
选择样本的目的
基线展示评分链;Judge 漂移样本扩大人机差并收紧工具预算,验证晋级会冻结。
评测器偏差
STRESS TEST降低主体一致性并扩大 Judge 与人工评分差。
冻结评测晋级
当前项目不建立外部聊天会话;页面输入进入严格合同,由规则、算法或确定性 Harness 执行。

