Background
Deep Research 的报告产出需要做到 claim-level 可审计:报告中的事实、归纳结论以及根因/因果结论,都应能逐条回到实际来源证据,并能从原始证据反查哪些摘要/结论引用了它。
这里的“一对一校验”指 每个 atomic claim 都必须独立完成证据校验,而不是把数据模型强制设计成数据库层面的 1:1。实际关系需要支持 many-to-many:一个结论可能需要多个 evidence span 才能支撑,同一段事实也可能支撑多个结论。
Requirements
- 在研究报告 synthesis 阶段,为每个可验证的事实性、因果性、根因性结论生成稳定的
claim_id。
- Evidence 必须定位到原始 source 的具体 passage/span,而不是只保存 URL 或文档级引用;至少保留足以恢复原文位置的 source/document identity、excerpt 和 location metadata。
- 对每个 claim 单独执行 evidence verification,至少输出:
supported
contradicted
insufficient_evidence
- 持久化双向关系:
claim -> evidence_refs
evidence_ref -> claim_ids
- 上述映射需要跨越 streaming、report assembly、持久化、重新加载以及导出过程,不能只存在于单次 Agent runtime 内存中。
- 报告 UI / 输出支持:
- 点击摘要、结论或 citation,可跳转到对应原始引用 passage,并高亮对应证据;
- 在原始 evidence passage 处可以反查引用它的摘要/结论。
unsupported / contradicted 的 claim 不允许无提示地作为“已证实结论”进入最终报告;需要明确实现标记、降级或阻断策略。
- verification 结果需要提供 machine-readable 结构,供后续 Gold Case / Langfuse evaluation 使用。
Acceptance Criteria
Notes / Non-goals
- 不要求强制 1:1 relational schema;重点是“每个 claim 必须被独立校验”。
- Verifier 自己生成的解释不能替代 source evidence。
- 不要只做 citation UI;后端必须存在稳定、可持久化、可供评测消费的 claim/evidence 数据关系。
Background
Deep Research 的报告产出需要做到 claim-level 可审计:报告中的事实、归纳结论以及根因/因果结论,都应能逐条回到实际来源证据,并能从原始证据反查哪些摘要/结论引用了它。
这里的“一对一校验”指 每个 atomic claim 都必须独立完成证据校验,而不是把数据模型强制设计成数据库层面的 1:1。实际关系需要支持 many-to-many:一个结论可能需要多个 evidence span 才能支撑,同一段事实也可能支撑多个结论。
Requirements
claim_id。supportedcontradictedinsufficient_evidenceclaim -> evidence_refsevidence_ref -> claim_idsunsupported/contradicted的 claim 不允许无提示地作为“已证实结论”进入最终报告;需要明确实现标记、降级或阻断策略。Acceptance Criteria
unsupported/contradicted。insufficient_evidence或contradicted,不能自动放行。Notes / Non-goals