Agent 如何更新记忆、选择行动,并在哪个恢复边界停止?
页面先自动运行基准样本;也可以在下方编辑完整输入或执行项目专属压力场景。状态、指标、视觉和回执都来自当前 API 输出。
证据优先策略胜出
- 执行轮次
- 校验中
- 最高假设
- 校验中
- 策略目标
- 校验中
- 策略波动
- 校验中
确定性脚本
output.steps.lengthP5 当前置信度
output.memory.hypotheses.P5.confidence证据优先
output.comparison.0.averageObjective越低越稳定
output.comparison.0.volatility回合记忆循环
- 01执行轮次校验中
- 02最高假设校验中
- 03策略目标校验中
- 04策略波动校验中
业务决策、执行健康与发布回执
执行检查通过,只表示输出有效、未超预算且可以重放;是否发布仍由业务状态和发布检查决定。
换一组输入,重新运行项目引擎
基准输入和压力输入都提交给同一版本 API。压力输入用于触发项目特定的拒绝、降级或复核规则,结果可以重复运行。
编辑完整 JSON 输入
下一步不是一个按钮
- P0EXECUTED证据优先策略胜出
完成模拟,不授权任何外部行动;所有置信度均未触发人审阈值。
负责人 / Agent 研究工程师
- P1CONTROLGAME-Q01
废弃对局并冻结投影器
负责人 / Agent 评测负责人
- P1DRILL检查点丢失
冻结会话并保留事件日志
负责人 / 平台 SRE / 安全
公开预览与本次运行分轨
- SOURCE 01disconnected preview
Agent Arena Werewolf Gameplay
werewolf.agent_arena_event.raw.v1 - SOURCE 02disconnected preview
Avalon-NLU human game dataset
werewolf.human_gold_event.raw.v1 - VALUES RETURNED BY THE ENGINE
4 轮确定性对局
本次计算只使用上方标明的数据版本;公开来源目前仅提供预览,尚未接入引擎。
故障必须有检测和恢复路径
- 症状
- 对局无法从指定回合恢复
- 检测
- checkpoint digest 与事件序列
- 隔离
- 冻结会话并保留事件日志
- 恢复
- 从最近一致快照重放

