返回全部项目
INDEPENDENT BUILD/ 2024

运营 A/B 分析看板

配置对照组与实验组,计算区间和显著性,并保存采用或停止的理由

RESULT / FIXED SAMPLE / 2026-07-17
样本支持实验组

A=4,820 / B=4,790

实验组转化率 13.82%,比对照高 2.62pp;p=0.000105,95% 区间为 +1.29pp 至 +3.94pp。

建议决策

统计和实际提升门均通过;在补充业务护栏后可发布实验组。

绝对提升
+2.62pp

+23.36% 相对提升

p-value
0.000105

显著低于 0.05

置信度
99.99%

样本量充足

两组转化率转化率
对照 A11.20%
实验 B13.82%

结果边界有界访问量与转化数汇总;不含事件级用户记录。

LIVE RUN / COMPLETE FLOWRUN / baselineDOES NOT WRITE TO EXTERNAL SYSTEMS

实验是否同时通过随机化、统计、实际提升和样本量检查?

页面先自动运行基准样本;也可以在下方编辑完整输入或执行项目专属压力场景。状态、指标、视觉和回执都来自当前 API 输出。

当前引擎状态

样本支持实验组

loadinghigh riskrate/
绝对提升
校验中

B − A

output.result.absLift
p 值
校验中

双比例检验

output.result.pValue
SRM p 值
校验中

随机化健康

output.diagnostics.sampleRatio.pValue
80% power
校验中

每组需求

output.diagnostics.requiredPerGroup80Power
RESULT VISUAL

实验决策漏斗

verified fixed sample / funnel
  1. 绝对提升校验中
  2. p 值校验中
  3. SRM p 值校验中
  4. 80% power校验中
LATEST RUN

业务决策、执行健康与发布回执

执行检查通过,只表示输出有效、未超预算且可以重放;是否发布仍由业务状态和发布检查决定。

正在加载合同并执行固定样本;超时会自动取消且不会产生外部副作用。
EDIT INPUT / RUN AGAIN

换一组输入,重新运行项目引擎

基准输入和压力输入都提交给同一版本 API。压力输入用于触发项目特定的拒绝、降级或复核规则,结果可以重复运行。

编辑完整 JSON 输入
REVIEW QUEUE / READ ONLY

下一步不是一个按钮

  1. P0
    EXECUTED
    样本支持实验组

    统计和实际提升门均通过;在补充业务护栏后可发布实验组。

    负责人 / 实验平台主管 / 产品分析师

  2. P1
    CONTROL
    AB-Q01

    隐藏效果并诊断

    负责人 / 因果实验数据负责人

  3. P1
    DRILL
    分桶服务缺陷

    停止实验并回基线

    负责人 / 平台 SRE / 安全

DATA SOURCES / THIS RUN

公开预览与本次运行分轨

  1. SOURCE 01disconnected preview

    Criteo Uplift Prediction Dataset v2.1

    experiment.criteo_assignment.raw.v1
  2. SOURCE 02disconnected preview

    KuaiRand randomized recommendation logs

    experiment.kuairand_outcome.raw.v1
  3. VALUES RETURNED BY THE ENGINE

    A=4,820 / B=4,790

    本次计算只使用上方标明的数据版本;公开来源目前仅提供预览,尚未接入引擎。

FAILURE TEST / DESIGN ONLY

故障必须有检测和恢复路径

症状
实验组比例或用户稳定性异常
检测
SRM 和跨日 assignment hash
隔离
停止实验并回基线
恢复
修复后新建实验,不复用污染数据
SYSTEM / FROM INPUT TO DECISION

信息从哪里来、怎样处理、何时调用工具,以及谁负责最后确认。

聚合计数上的可复现 A/B 统计与发布决策。

AI 能力边界
没有 AI 模型,也不接收事件级随机化或护栏数据。
人工责任
实验负责人负责预注册、序贯分析和业务限制确认。
01 / EXECUTED TRACE

信息处理顺序

source → context → intelligence → harness → decision → feedback
  1. 01
    信息进入

    读取 A/B 访客、转化、alpha、分配和最小 lift。

    输入
    AbDashboardInput
    输出
    aggregate experiment
    • typed aggregate contract
    • valid counts
    转换控制

    conversions 不得超过 visitors。

  2. 02
    上下文构造

    计算组内转化率与期望样本分配。

    输入
    aggregate experiment
    输出
    rate + allocation context
    • rate normalization
    • expected ratio
    转换控制

    聚合数据不假装具有用户级 lineage。

  3. 03
    模型处理

    执行两比例 z 检验、区间、SRM 和 power。

    输入
    rate context
    输出
    statistical diagnostics
    • z-test
    • confidence interval
    • SRM
    • power
    转换控制

    alpha 和多次查看风险显式进入判断。

  4. 04
    运行约束

    按随机化、样本、peeking 和实际显著性顺序门控。

    输入
    diagnostics
    输出
    release.decision
    • ordered decision policy
    • peeking guard
    转换控制

    护栏指标未提供时不宣称已验证。

  5. 05
    决策产物

    输出 invalid/collect/hold/ship/keep-control。

    输入
    release diagnostics
    输出
    release decision
    • release state
    • practical lift
    转换控制

    只有 ship-treatment 解除 releaseBlocked。

  6. 06
    反馈回路

    暴露 SRM、power 缺口、peeking 和未提供护栏。

    输入
    decision
    输出
    diagnostics + limitations
    • experiment telemetry
    • gap registry
    转换控制

    不写回实验平台。

IMPLEMENTATION DETAILS / OPTIONAL

展开 8 个运行步骤、API 边界与实现状态

02 / RUNTIME CHECKS

运行时怎样限制模型和工具

运行图同时列出状态、预算、权限、失败处理、评测和人工审批。

编排H01
validate → test → SRM → power → peeking → practical gate。
可检查证据runAbDashboard
状态与记忆H02
分析次数、alpha 和预期分配固定当前分析快照。
可检查证据AbDashboardInput
预算H03
只处理两组聚合;analysisCount 暴露重复查看。
可检查证据analysisCount
权限H04
只给决策建议,不写入分流或发布系统。
可检查证据sideEffects=none
护栏H05
SRM、power、peeking、实际 lift 和缺失业务护栏共同显示。
可检查证据diagnostics
失败与恢复H06
随机化异常优先 invalid,样本不足 collect-more-data。
可检查证据release.decision
评测H07
z、p、CI、lift、SRM p 和所需样本可复算。
可检查证据result + diagnostics
最终权限H08
实验负责人在业务限制和序贯计划都通过后批准发布。
可检查证据guardrails=not-supplied
03 / API EXECUTION ENVELOPE

所有项目共享的运行边界

POST /api/labs/ab-dashboard

这里说明 API 当前做到哪一步。页面演示可以观察底层函数,但不等同于已接入真实业务数据或外部写入。

运行姿态
DETERMINISTIC SANDBOX

18 个 API 引擎只读取请求并返回结果,不写入外部系统。当前未接入登录、审计数据库或线上业务数据。

入口契约
STRICT ZOD + 32KB

API 输入先经过严格 schema/default 标准化;HTTP JSON 请求上限 32KB。

执行预算
100–150MS / 256KB

每个项目单独设置耗时预算和 256KB 输出上限;超时会标记降级,非有限数和超大输出会被阻断。

回执与重放
CONTENT-ADDRESSED

回执包含输入/输出/idempotency hash、耗时和质量;尚无持久幂等存储或重复请求短路。

流量与身份
100/MIN / NO AUTH

当前使用进程内 IP 限流和公开 CORS;尚无登录、租户、角色或复核人身份。

页面与 API
TWO EXECUTION SURFACES

站内 Demo 多为底层引擎的直接交互;/api/labs 才增加完整输入校验、通用质量门与执行回执。

公开数据
LIVE PREVIEW / DISCONNECTED

页面可以预览官方端点的数据,但这些数据尚未保存、统一字段或通过质量校验,也不会送入项目引擎。

上线阻塞
OWNER + AUDIT + DATA + OPS

上线前还需要负责人签字、持久审计、全局限流、代表性数据验证、值班安排和回滚演练。

04 / IMPLEMENTATION STATUS

用了什么、解决什么、现在能否运行

每一项都写明它在当前引擎中的作用,以及属于实际执行、固定样本还是待实现设计。

当前项目技术证据矩阵
技术系统作用当前证据姿态
Two-proportion z-testEvaluation量化质量、稳定性或统计可信度。聚合转化计数计算 z 与 p-value。当前执行
Confidence intervalEvaluation量化质量、稳定性或统计可信度。返回可配置 alpha 下的 lift 区间。当前执行
Sample-ratio mismatchEvaluation量化质量、稳定性或统计可信度。期望分配与实际样本量生成 SRM 检查。当前执行
Power calculationEvaluation量化质量、稳定性或统计可信度。估算 80% power 所需每组样本。当前执行
Sequential-peeking detectionControl限制权限、风险、发布或人工责任。analysisCount>1 标记重复查看风险。当前执行
Practical significanceControl限制权限、风险、发布或人工责任。实际 lift 需超过 minimumPracticalLift。当前执行
Ordered release policyAgent / Harness编排步骤、工具、状态和退出条件。固定优先级避免有利指标掩盖随机化失败。当前执行
Missing-guardrail disclosureObservability暴露版本、轨迹、原因和可复现证据。业务护栏明确显示 not-supplied。当前执行
DIRECT ENGINE / OPTIONAL

检查底层函数,而不是重复主控制台。

完整 API 工作台已在上方;这里保留直接函数交互用于调试。

RUN THE ENGINE

直接观察项目的本地引擎。

页面 Demo 侧重底层函数交互;完整 /api/labs 包装另含严格输入校验、通用质量门和执行回执。

这是站内运行的工程沙箱:使用公开或合成样本执行真实算法;存在公开仓库时可继续查看源码。

RUNab-dashboard · 双比例 z 检验(可编辑)
对照组 A
11.20%
实验组 B
13.82%
结果显著 α=0.05
相对提升
+23.4%
p 值
0.0001
z
3.878
95% CI(差)
[1.3%, 3.9%]
CASE DETAILS / OPTIONAL

继续查看项目背景、架构和交付记录。

详细案例仍完整保留,但不再与运行结果争夺注意力。

职责
数据 + 运营
年份
2024
交付方式
独立实现
运行定位
独立设计 / 可运行沙箱
CASE / 01

项目概述

看板保存实验假设、对照组、实验组和停止条件,并计算置信区间、相对提升与显著性。负责人必须记录采用、继续观察或停止实验的理由。

CASE / 02

问题

P01

实验结果靠肉眼对比,缺乏统计显著性,容易做出错误结论。

P02

决策过程无记录,事后难以复盘与归因。

CASE / 03

架构与流程

architecture.diagram
STEP 01
实验设置

样本量与分组

STEP 02
指标对比

对照 vs 实验组

STEP 03
置信度仪表

半环可视化置信度

STEP 04
显著性决策

p 值 + 决策记录

CASE / 04

核心功能

VIEW 01

置信度仪表盘

每个实验的半环置信度可视化。

VIEW 02

相对提升卡片

对照与实验组指标对比。

VIEW 03

显著性标识

p 值驱动的显著/不显著标签。

VIEW 04

决策记录

实验结论与上线决定可追溯。

CASE / 05

沙箱验证证据

3
实验

结账 / 个性化 / 推送时机。

95-99%
置信度

可视化置信水平。

p-value
显著性

统计显著性判断。

CASE / 06

使用的技术

Statisticsp-valueEChartsReact
IMPLEMENTATION DETAILS / OPTIONAL

展开数据、管道与生产控制。

SLO、权限、灰度、数据来源与故障恢复作为工程附录保留。

IMPLEMENTATION DETAILS

数据、管道与生产控制。

以下保留数据来源、运行限制和工程实现,不占用项目首屏。

DELIVERY / RESPONSIBILITIES·HIGH RISK

受控在线实验与决策记录平台

在样本比例、停止规则和业务护栏可信时才允许实验进入发布决策。

RESPONSIBLE ROLE

实验平台主管 / 产品分析师

PIPELINE
5 STAGES
CONTRACTS
5 SPECS
QUALITY
4 RULES
PUBLIC DATA
2 FEEDS
架构和运行目标;容量与 SLO 是设计指标,不是线上实绩
曝光事件
TARGET
1B/day

去重和归因

并行实验
TARGET
1k

互斥和优先级

决策记录
TARGET
2 years

假设到结论

沙箱实验
MEASURED
2 arms

SRM + CI + practical lift

WORKFLOW

从接入到签署的责任链

  1. 01

    预注册

    实验 owner

    假设、主指标和停止规则

  2. 02

    随机分配

    实验平台

    单位、互斥和稳定性

  3. 03

    曝光归因

    数据平台

    先曝光后结果

  4. 04

    统计分析

    统计服务

    SRM、CI 和多重检验

  5. 05

    发布决策

    实验委员会

    业务护栏和回滚

TOPOLOGY

可替换服务与控制边界

STORE
experiment-registry

假设、指标和 owner

EDGE
assignment-edge

稳定低延迟分配

SERVICE
exposure-pipeline

去重、迟到和归因

SERVICE
stats-engine

SRM、区间和功效

CONTROL
decision-log

结论、理由和 follow-up

下一个项目

金融数据管道