TECHNICAL WALKTHROUGH / CHECKED

ComplianceIQ技术执行说明

检索优先、生成可选的法规证据管道

CURRENT IMPLEMENTATION

核心 API 是 CJK BM25 + 结构化证据组合;直接 Demo 可在检索完成后调用 DeepSeek 做受约束改写。

AI 边界

没有生成式模型;答案由检索命中组合,不构成法律意见。

人工权限

合规责任人必须核对法律依据和时效性。

运行拓扑:用户如何抵达结果

页面负责收集与组装输入;合同、引擎和回执负责把边界变成可检查的执行链。

  1. 01

    页面交互

    项目页是问题表单与证据面板,不是持续对话 Chatbot。

    当前执行
  2. 02

    ComplianceIqInput

    模型第一步收到的不是文档文件,而是查询和检索政策。

    当前执行
  3. 03

    分阶段引擎

    注入扫描 → CJK 分词/BM25 → 类型与一手来源门 → 结构化答案 → 可选 DeepSeek 综合

    当前执行
  4. 04

    StructuredAnswer + governance gate

    核心结果是结构化 JSON;可选模型结果是单独的纯文本流,不能覆盖来源与 gate。

    当前执行
MODEL INPUT AND OUTPUT条件调用

用户先运行本地检索,再主动点击可选的 AI 综合;不会直接向模型自由对话。

EXECUTION ORDER

User Prompt 由页面自动拼接“原问题 + 已检索要点 + 不得补造”的约束。

模型、算法与工具逐项列账

模型名、规则引擎、检索器、评测器和控制层分开陈述;相似名称不等于真实调用。

CJK BM25 retrieval

当前执行

中文字符与 bigram 检索本地法规/案例语料并执行一手来源门。

由页面 Demo 或 POST /api/labs/:slug 同步调用;无外部推理请求。

deepseek-chat

条件调用

只把已检索结论和五段式要点综合成一段文本;不生成检索分数或法律依据。

直接 Demo 点击“AI 综合”后由服务端流式调用;生产环境已配置密钥。/api/labs 不调用它。

Retrieval

CJK tokenizer

当前执行

tokenize(query) 支持中文字符和 bigram 检索。

Retrieval

BM25

当前执行

本地索引返回可排序的文档分数。

Retrieval

Primary-source boost

当前执行

带官方链接的 regulation 命中获得显式乘数。

Control

Typed corpus filter

当前执行

includeTypes 在打分后、组合前限制证据类型。

Agent / Harness

Structured answer composer

当前执行

compose 输出结论、五段式 sections 和 evidence。

Evaluation

Citation coverage gate

当前执行

主来源数/法规命中数形成可检查覆盖率。

Control

Prompt-injection scan

当前执行

命中攻击模式时跳过检索并 blocked-input。

Observability

Corpus lineage

当前执行

版本、核验日与更新政策随响应返回。

输入合同、分步执行与结构化输出

检索与生成分两次执行,才能在模型调用前冻结证据,并在模型失败时保留确定性结果。

INPUT

ComplianceIqInput

当前不上传 PDF/网页;本地版本化语料已预先进入索引。

  • query
  • topK
  • includeTypes
  • minimumPrimarySources
  • primarySourceBoost
STAGED EXECUTION

注入扫描 → CJK 分词/BM25 → 类型与一手来源门 → 结构化答案 → 可选 DeepSeek 综合

  1. 01

    接收问题、Top-K、类型过滤和主来源门槛。

    ComplianceIqInputquery + retrieval policy

  2. 02

    用 CJK-aware 分词建立 BM25 查询上下文。

    queryretrieval.tokens + hits

  3. 03

    按主来源加权并组合五段式回答。

    hitsanswer.sections + answer.evidence

  4. 04

    计算引用覆盖并执行发布门。

    answer.evidencegate.decision

  5. 05

    输出带来源链接的回答或转人工。

    gate.decisionanswer + governance.officialSourceLinks

  6. 06

    暴露语料版本、核验日期和更新策略。

    answercorpus + retrieval metrics

OUTPUT

StructuredAnswer + governance gate

一个问题、一个检索批次和一份证据包。

  • answer.conclusion
  • answer.sections
  • answer.evidence
  • gate.decision
  • governance.officialSourceLinks

Prompt 与 Schema 的四层装配

System、Few-shot、用户运行输入与输出格式分别标注;没有 Prompt 的项目不会假装存在 Prompt。

  1. 01

    系统约束

    可选综合层使用固定服务端指令:仅依据给定要点、不得补造法规或事实、不确定时明确说明;客户端不能看到密钥。

    条件调用
  2. 02

    少样本

    没有 Few-shot;预设问题只是页面快捷输入,不进入 System Prompt。

    合同不接受
  3. 03

    运行时输入

    页面自动注入原问题与检索结论/sections;用户只输入问题。

    条件调用
  4. 04

    输出合同

    ComplianceIq structured result 仍返回结构化 JSON;可选 DeepSeek 层只流式返回受证据约束的纯文本解释。

    当前执行

多模态准入矩阵:每一项都有明确状态

图片、音频、视频和数字人不会用空字段含混带过;未接入就明确写出未接入。

文本

当前执行

查询、检索命中和可选生成文本均受长度与证据边界约束。

表格 / JSON

当前执行

语料条目、BM25 分数、类型和官方链接以结构化记录返回。

图片

合同不接受

严格 JSON 合同不接收图片;未知字段会被拒绝,不会保留空占位。

音频

合同不接受

没有音频上传、ASR 或声学特征管道。

视频

合同不接受

没有视频上传、解码、分镜或帧级推理入口。

数字人

合同不接受

没有数字人资产、驱动参数或渲染合同。

人工输入 / 复核

当前执行

ownerReviewStillRequired 始终为 true。

用户在页面上操作,样本用于验证边界

预设不是替用户做决定,也不是偷偷注入 Few-shot;它让同一合同在基线与压力条件下可复现。

交互表面

项目页是问题表单与证据面板,不是持续对话 Chatbot。

选择样本的目的

五个预设问题用于覆盖牌照、STR、跨境数据、贸易背景和备付金,不是 Few-shot。

缺少一手法规

STRESS TEST

只检索合成案例,同时要求 3 条一手法规。

转人工确认法律依据

只把已检索结论和五段式要点综合成一段文本;不生成检索分数或法律依据。