返回全部项目
RESUME RECONSTRUCTION/ 2026

狼人杀 Agent Loop

状态机、长期记忆、角色假设、置信度决策与指标驱动的策略迭代

RESULT / FIXED SAMPLE / 2026-07-17
证据优先策略胜出

4 轮确定性对局

激进策略平均目标分高 2.54pp,但波动也高 3.32pp;系统因此选择更稳定的证据优先策略。

建议决策

完成模拟,不授权任何外部行动;所有置信度均未触发人审阈值。

策略波动
−3.32pp

证据优先更稳定

过度自信事件
0

阈值 75%

可回放轮次
4

确定性状态迁移

策略目标分与波动百分比
证据优先目标41.65%
激进目标44.19%
证据优先波动15.54%
激进波动18.86%

结果边界确定性合成对局记录;不含私有比赛提示词或轨迹。

LIVE RUN / COMPLETE FLOWRUN / baselineDOES NOT WRITE TO EXTERNAL SYSTEMS

Agent 如何更新记忆、选择行动,并在哪个恢复边界停止?

页面先自动运行基准样本;也可以在下方编辑完整输入或执行项目专属压力场景。状态、指标、视觉和回执都来自当前 API 输出。

当前引擎状态

证据优先策略胜出

loadingmoderate riskrate/
执行轮次
校验中

确定性脚本

output.steps.length
最高假设
校验中

P5 当前置信度

output.memory.hypotheses.P5.confidence
策略目标
校验中

证据优先

output.comparison.0.averageObjective
策略波动
校验中

越低越稳定

output.comparison.0.volatility
RESULT VISUAL

回合记忆循环

verified fixed sample / timeline
  1. 01执行轮次校验中
  2. 02最高假设校验中
  3. 03策略目标校验中
  4. 04策略波动校验中
LATEST RUN

业务决策、执行健康与发布回执

执行检查通过,只表示输出有效、未超预算且可以重放;是否发布仍由业务状态和发布检查决定。

正在加载合同并执行固定样本;超时会自动取消且不会产生外部副作用。
EDIT INPUT / RUN AGAIN

换一组输入,重新运行项目引擎

基准输入和压力输入都提交给同一版本 API。压力输入用于触发项目特定的拒绝、降级或复核规则,结果可以重复运行。

编辑完整 JSON 输入
REVIEW QUEUE / READ ONLY

下一步不是一个按钮

  1. P0
    EXECUTED
    证据优先策略胜出

    完成模拟,不授权任何外部行动;所有置信度均未触发人审阈值。

    负责人 / Agent 研究工程师

  2. P1
    CONTROL
    GAME-Q01

    废弃对局并冻结投影器

    负责人 / Agent 评测负责人

  3. P1
    DRILL
    检查点丢失

    冻结会话并保留事件日志

    负责人 / 平台 SRE / 安全

DATA SOURCES / THIS RUN

公开预览与本次运行分轨

  1. SOURCE 01disconnected preview

    Agent Arena Werewolf Gameplay

    werewolf.agent_arena_event.raw.v1
  2. SOURCE 02disconnected preview

    Avalon-NLU human game dataset

    werewolf.human_gold_event.raw.v1
  3. VALUES RETURNED BY THE ENGINE

    4 轮确定性对局

    本次计算只使用上方标明的数据版本;公开来源目前仅提供预览,尚未接入引擎。

FAILURE TEST / DESIGN ONLY

故障必须有检测和恢复路径

症状
对局无法从指定回合恢复
检测
checkpoint digest 与事件序列
隔离
冻结会话并保留事件日志
恢复
从最近一致快照重放
SYSTEM / FROM INPUT TO DECISION

信息从哪里来、怎样处理、何时调用工具,以及谁负责最后确认。

可复现状态机、长期记忆和策略对比的游戏 Agent 回路。

AI 能力边界
没有调用语言模型;发言和角色更新来自确定性脚本与证据权重。
人工责任
跨过高置信评测阈值的游戏动作交给人工观察;系统无外部行动能力。
01 / EXECUTED TRACE

信息处理顺序

source → context → intelligence → harness → decision → feedback
  1. 01
    信息进入

    接收轮数、prompt variant、重放起点和人审阈值。

    输入
    WerewolfAgentInput
    输出
    validated loop config
    • typed loop config
    • replay parameters
    转换控制

    rounds 和 resumeFromRound 由 API schema 约束。

  2. 02
    上下文构造

    从历史发言提取证据可靠性并更新角色假设。

    输入
    AgentMemory
    输出
    evidence + hypotheses
    • durable memory
    • role beliefs
    转换控制

    公开状态与私有假设分开保存。

  3. 03
    模型处理

    依据策略变体选择声明、目标和置信度。

    输入
    evidence + hypotheses
    输出
    LoopStep.action
    • policy function
    • confidence decision
    转换控制

    低证据时不升级确定性。

  4. 04
    运行约束

    逐轮推进状态机并生成内容摘要 checkpoint 标签。

    输入
    LoopStep
    输出
    checkpoint + trace
    • state machine
    • state digest
    转换控制

    轮数预算阻止无限循环;恢复实际从第 0 轮确定性重算。

  5. 05
    决策产物

    输出游戏内动作或 human-review。

    输入
    confidence
    输出
    decision + rationale
    • confidence gate
    • no-side-effect action
    转换控制

    系统不连接真实游戏或外部工具。

  6. 06
    反馈回路

    比较 evidence-first 与 aggressive 的目标值和波动。

    输入
    variant runs
    输出
    comparison + metrics
    • policy evaluation
    • replay trace
    转换控制

    相同输入可完整重放。

IMPLEMENTATION DETAILS / OPTIONAL

展开 8 个运行步骤、API 边界与实现状态

02 / RUNTIME CHECKS

运行时怎样限制模型和工具

运行图同时列出状态、预算、权限、失败处理、评测和人工审批。

编排H01
memory → step → checkpoint → repeat → compare。
可检查证据runWerewolfAgentSystem
状态与记忆H02
AgentMemory 保存 round、history、hypotheses 和 promptVariant;没有持久 checkpoint 库。
可检查证据AgentMemory + persistentCheckpointStore=false
预算H03
rounds 限制循环步数。
可检查证据WerewolfAgentInput.rounds
权限H04
所有 action 都是本地模拟,无外部副作用。
可检查证据externalActions=false
护栏H05
轮数 schema、置信阈值和证据可靠性约束评测。
可检查证据contracts + humanReviewThreshold
失败与恢复H06
没有持久恢复失败路径;resumeFromRound 通过从零重放实现。
可检查证据durability.replayedSteps
评测H07
平均 objective 与 volatility 对比两种策略。
可检查证据comparePromptVariants
最终权限H08
高置信游戏动作被标记供人工观察;引擎只建议游戏内动作。
可检查证据evaluation.actionsRequiringReview
03 / API EXECUTION ENVELOPE

所有项目共享的运行边界

POST /api/labs/werewolf-agent-loop

这里说明 API 当前做到哪一步。页面演示可以观察底层函数,但不等同于已接入真实业务数据或外部写入。

运行姿态
DETERMINISTIC SANDBOX

18 个 API 引擎只读取请求并返回结果,不写入外部系统。当前未接入登录、审计数据库或线上业务数据。

入口契约
STRICT ZOD + 32KB

API 输入先经过严格 schema/default 标准化;HTTP JSON 请求上限 32KB。

执行预算
100–150MS / 256KB

每个项目单独设置耗时预算和 256KB 输出上限;超时会标记降级,非有限数和超大输出会被阻断。

回执与重放
CONTENT-ADDRESSED

回执包含输入/输出/idempotency hash、耗时和质量;尚无持久幂等存储或重复请求短路。

流量与身份
100/MIN / NO AUTH

当前使用进程内 IP 限流和公开 CORS;尚无登录、租户、角色或复核人身份。

页面与 API
TWO EXECUTION SURFACES

站内 Demo 多为底层引擎的直接交互;/api/labs 才增加完整输入校验、通用质量门与执行回执。

公开数据
LIVE PREVIEW / DISCONNECTED

页面可以预览官方端点的数据,但这些数据尚未保存、统一字段或通过质量校验,也不会送入项目引擎。

上线阻塞
OWNER + AUDIT + DATA + OPS

上线前还需要负责人签字、持久审计、全局限流、代表性数据验证、值班安排和回滚演练。

04 / IMPLEMENTATION STATUS

用了什么、解决什么、现在能否运行

每一项都写明它在当前引擎中的作用,以及属于实际执行、固定样本还是待实现设计。

当前项目技术证据矩阵
技术系统作用当前证据姿态
Agent state machineAgent / Harness编排步骤、工具、状态和退出条件。stepAgent 逐轮推进确定性状态。当前执行
Durable memoryAgent / Harness编排步骤、工具、状态和退出条件。历史、假设和策略版本保存在 AgentMemory。当前执行
Checkpoint digestObservability暴露版本、轨迹、原因和可复现证据。状态摘要用于标记重放产物,不是持久恢复校验器。当前执行
Evidence reliabilityAI / ML执行评分、分类、传播或模型近似计算。事件证据以可靠度更新角色判断。当前执行
Role hypothesesAI / ML执行评分、分类、传播或模型近似计算。每名玩家保留可解释角色分布。当前执行
Policy comparisonEvaluation量化质量、稳定性或统计可信度。两个 prompt variant 运行相同回合脚本。当前执行
Objective / volatility metricsEvaluation量化质量、稳定性或统计可信度。策略表现同时衡量收益和波动。当前执行
Confidence review gateControl限制权限、风险、发布或人工责任。达到或超过阈值的高置信动作标记人工观察。当前执行
DIRECT ENGINE / OPTIONAL

检查底层函数,而不是重复主控制台。

完整 API 工作台已在上方;这里保留直接函数交互用于调试。

RUN THE ENGINE

直接观察项目的本地引擎。

页面 Demo 侧重底层函数交互;完整 /api/labs 包装另含严格输入校验、通用质量门和执行回执。

这是站内运行的工程沙箱:使用公开或合成样本执行真实算法;存在公开仓库时可继续查看源码。

RUNwerewolf-agent-loopAPI ↗

公开作品集重建:浏览器内运行真实算法与合成数据,不包含雇主代码、模型权重或客户数据。

round 0
OBSERVE → DECIDE

等待第一轮观察

P220.0%

prior

P320.0%

prior

P420.0%

prior

P520.0%

prior

P620.0%

prior

CASE DETAILS / OPTIONAL

继续查看项目背景、架构和交付记录。

详细案例仍完整保留,但不再与运行结果争夺注意力。

职责
独立 Agent 系统重建
年份
2026
交付方式
独立实现
运行定位
独立设计 / 可运行沙箱
CASE / 01

项目概述

把狼人杀 Agent 从一句 Prompt 拆为状态、观察、记忆、假设、行动和评测的显式循环,并用 objective 与 volatility 对策略模板做 A/B,而不是凭感觉换 Prompt。

CASE / 02

问题

P01

长对局中单轮上下文会覆盖早期证据,角色判断容易漂移。

P02

没有客观函数时,Prompt 迭代只能靠主观观感,无法复现。

CASE / 03

架构与流程

architecture.diagram
STEP 01
状态

轮次与玩家公开状态

STEP 02
记忆

事实、可靠度与行动历史

STEP 03
假设

角色概率与支持依据

STEP 04
行动

目标、置信度与理由

STEP 05
Loop Eval

objective + volatility

CASE / 04

核心功能

VIEW 01

逐轮执行

每次只推进一轮,状态变化可检查。

VIEW 02

长期记忆

保留发言、可靠度和历史行动。

VIEW 03

假设更新

新证据只更新相关角色概率。

VIEW 04

策略 A/B

证据优先与激进策略并行评估。

CASE / 05

沙箱验证证据

6-step
Agent 循环

从读取状态到记录评测,共六步。

2
策略变体

同一脚本下可复现对比。

100%
决策可解释

每个行动携带理由与置信度。

CASE / 06

使用的技术

TypeScriptState MachineAgent MemoryHypothesis TrackingA/B TestingReact
IMPLEMENTATION DETAILS / OPTIONAL

展开数据、管道与生产控制。

SLO、权限、灰度、数据来源与故障恢复作为工程附录保留。

IMPLEMENTATION DETAILS

数据、管道与生产控制。

以下保留数据来源、运行限制和工程实现,不占用项目首屏。

DELIVERY / RESPONSIBILITIES·MODERATE RISK

多智能体策略仿真与评测平台

用可回放状态、检查点和策略对照实验研究 Agent 行为,而不是展示一次聊天。

RESPONSIBLE ROLE

Agent 研究工程师

PIPELINE
5 STAGES
CONTRACTS
5 SPECS
QUALITY
4 RULES
PUBLIC DATA
2 FEEDS
架构和运行目标;容量与 SLO 是设计指标,不是线上实绩
并发对局
TARGET
10k

会话隔离

Agent 回合
TARGET
1M/day

事件溯源

热回放
TARGET
30 days

之后转冷存储

沙箱策略
MEASURED
2 policies

evidence-first / aggressive

WORKFLOW

从接入到签署的责任链

  1. 01

    创建对局

    仿真调度

    种子、版本和角色

  2. 02

    状态推进

    Agent runtime

    步骤预算和权限

  3. 03

    检查点

    状态存储

    摘要、幂等与恢复

  4. 04

    策略评测

    评测平台

    胜率、校准与过度自信

  5. 05

    研究复核

    评测负责人

    禁止用于真人操纵

TOPOLOGY

可替换服务与控制边界

EDGE
match-scheduler

配额、种子和并发

SERVICE
agent-runtime

角色工具和步骤预算

STORE
event-store

状态事件和检查点

SERVICE
policy-evaluator

A/B、校准和回归

CONTROL
safety-policy

用途限制和审查

下一个项目

RAG 评测与人审工作台