§1 · 何为「Citation-bound」
在传统历史研究中,「引用」 (citation) 是文章末段的 bibliography 一栏,通常以作者-年份-页码的形式呈现;读者若需核证,需自行查阅原书。然而,在数字时代,当原书以 hosted scan + OCR + ID 形式存在时,「引用」的本质悄然改变:它不再是「指向某本书」的指针,而是「指向某次扫描的特定位置」的固定字符串。
本方法论所称的「Citation-bound」,正是强调这一转变:每一个 factual claim 必须显式地、可机读地绑定到一个具体的 citation_id。这一绑定不是「建议」或「推荐」,而是「必要条件」 — 没有绑定的 claim 必须标记为 Limitation,且不允许进入文章的「主结论」部分。
📋 Citation-bound 三原则
- 绑定原则 (Binding Principle): 每一 claim 必须绑定至少一个 citation_id (来自已冻结证据集)。
- 标识原则 (Identification Principle): Citation ID 是固定字符串 (例如
SHUGE:p168491:68),不随时间/平台变化。 - 限制原则 (Limitation Principle): 无 citation 的事实陈述必须显式标记 Limitation,且不构成文章核心论据。
§2 · 数据来源与角色区分
本方法论严格区分「数据来源」 (source)、「托管平台」 (hosting platform)、「原初作者/机构」 (original creator) 三类角色,避免混用 — 尤其是「平台」与「出版机构」的概念,二者截然不同。
📋 三角色区分表
| 角色 | 含义 | v1.0 实例 | 常见误标 |
|---|---|---|---|
| Source Platform | 提供 hosted scan + OCR queue + public ID 的数字平台 | 书格 (shuge.org) | ❌ 误标为 publisher |
| Original Holder | 提供物理扫描原件的档案馆 / 图书馆 | 国立公文書館 (日本) | ❌ 误标为 publisher |
| Original Creator | 古籍原初作者 / 编撰机构 | 郦道元 (北魏) / 宋应星 (明) / 清代工部 | ❌ 误标为 publisher |
v1.0 §7 明确指出:「书格 = source platform, NOT publisher」。任何 v1.0 文章必须显式区分此三角色,否则视为方法论错误。
详细审计记录于 data/institution_roles_v1.0.json。
§3 · Reliability Tier 标准
本方法论引入四档 reliability tier,用于量化 citation 的可信度:
📋 Reliability Tier 标准
| Tier | 判定标准 | 本证据集实例 |
|---|---|---|
| HIGH | 完整 OCR + 人工 review + 多 citation 互证 | (本 v1.0 文章不采用此 tier) |
| MEDIUM | OCR queue 存在但 qa_status=NOT_CHECKED;citation count > 1 | 本 v1.0 文章 6 个 citation 全部此 tier |
| LOW | 仅 OCR + single citation | (本 v1.0 文章未采用) |
| UNVERIFIED | 不在 OCR queue;或方法论级陈述 | 本 v1.0 文章 §6 方法局限引用 |
关键观察:本证据集中所有 OCR 状态的 qa_status 均为 NOT_CHECKED,因此没有任何 citation 可以达到 HIGH tier。这是一个保守的、可审计的结论 — 它不否认书格 OCR 的潜在 quality,而是强调:在 QA 未完成之前,任何引用都是 MEDIUM,需以「互证」(同一 claim 多 citation) 弥补单点风险。
§4 · Citation-required-per-claim 工作流
Citation-bound Historical Research 的实际工作流可分为五个步骤:
📋 五步工作流
- 步骤 1 · claim 起草: 在已冻结证据集 (v0.5-v0.9) 内寻找可支撑的事实,起草 claim;若证据集不支撑,起草 limitation。
- 步骤 2 · citation 绑定: 每一 claim 绑定至少一个
citation_id;无 citation 的 claim 进入 Limitation 行。 - 步骤 3 · reliability 评级: 对每一 citation 评 HIGH/MEDIUM/LOW/UNVERIFIED tier,并在 Evidence Appendix 列出。
- 步骤 4 · role 澄清: 显式区分 source platform / original holder / original creator 三角色,避免把书格错当 publisher。
- 步骤 5 · provenance 不变: 校验所有 v0.5-v0.9 已冻结数据文件未变 (byte-equal);只 ADD 新文件,不 MODIFY 旧文件。
这一工作流与传统的「写文章 → 找引用」模式不同:它是「先看证据 → 再写文章」 — 严格说,是「claim 来自证据,非证据来自 claim」。这一倒置的逻辑,是 citation-bound 方法论的核心。
§5 · Limitation 标记的必要性
在传统学术写作中,「Limitation」通常只在「方法局限」一节简述。然而,在 citation-bound 方法论下,Limitation 必须出现在每一处 claim旁边 — 因为每一个 claim 都面临「未被证据集覆盖」的具体风险,而非一个抽象的「方法局限」。
这一做法借鉴了「provenance per claim」的元数据原则:每一处陈述都附有「出处」与「可信度」,而非仅在文末列出 bibliography。它让读者能在句子级 (sentence-level) 评估可信度,而不是在文章级 (article-level)。
📋 Limitation 标记示例
| claim 类别 | 典型 limitation 标记 |
|---|---|
| 物理历史链条 (竹简 → 抄本 → 扫描) | [ |
| 数字统计 (137 条河 / 1252 条支流) | [ |
| 名称等同 (河水=黄河) | [ |
| 单次田野观测 | [ |
| DH 研究空白判断 | [ |
| 方法论层级陈述 | [ |
§6 · 与传统学术写作的差异
📋 传统 vs Citation-bound
| 维度 | 传统学术写作 | Citation-bound |
|---|---|---|
| 引用位置 | 文末 bibliography | 每一 claim 旁 |
| 引用形式 | 作者-年份 (Author-Year) | 固定 ID 字符串 (例如 SHUGE:p168491:68) |
| Limitation | 文末「方法局限」一节 | 每一 claim 旁的 inline limitation 标记 |
| 可信度评估 | 文章级 (article-level) | 句子级 (sentence-level) |
| 来源平台 vs 出版机构 | 通常合并标注 | 严格区分 (source platform / original holder / original creator) |
| 数据采集 | 自由获取原书 / 数据库 / 实地 | 严格 ID-only,无新下载 / 无新 OCR |
| Embeddings / 向量数据库 | (常使用) | 明确禁止 (per v1.0 invariant) |
| 自动 PUBLISHED | (期刊流程) | 明确禁止 (per v1.0 invariant inv-pub-v1.0-8) |
§7 · 局限与边界
Citation-bound Historical Research 并非适用于所有研究语境。其明确不适用范围包括:
- 需要外部 independent verification 的研究 — 本方法严格 ID-only,无法引入外部独立核证。
- 需要完整 full-text retrieval 的研究 — 本证据集
full_text_unavailable=true,无法支持「全文本检索」式研究。 - 需要从非书格渠道获取材料的研究 — 本方法严格 ID-only,不下载新资源,不抓取。
- 需要 embeddings / 向量数据库的研究 — 本方法明确禁止 embeddings。
- 需要自动 PUBLISHED 的研究 — 本方法明确禁止自动 PUBLISHED,REVIEW 状态需用户明确批准。
这些边界不是「缺陷」,而是「设计选择」:它确保研究的可审计性 (auditability)、可追溯性 (traceability)、可重现性 (reproducibility)。
§8 · 与 SHUGE DH Research Platform 的关系
Citation-bound Historical Research 是 SHUGE DH Research Platform v1.0 的方法论配套。平台的 v0.5-v0.9 数据层提供了 citation_id、works、institutions、field_notes、research_questions、evidence_paragraphs 等结构化数据,而本方法论提供「如何使用这些数据写出可审计文章」的规则集。
具体而言:本方法论的 Citation-required-per-claim 政策,直接对应平台的 v0.7 evidence_paragraphs.json 中的 binding_state 五级 (ANNOTATED / CLAIMS_BOUND / EVIDENCE_BOUND / FIELD_NOTE_BOUND / METADATA_ONLY) — 一个 paragraph 的 binding_state 即表征其 citation 完整度。
本方法论的 source platform vs publisher 区分,直接对应平台的 v1.0 新增 data/institution_roles_v1.0.json 审计文件。
本方法论的 Reliability Tier,与 v0.4 data/evidence_cards_v3.json 中的 support_count / evidence_count 字段相对应 — 互证越多,reliability 越高。
§9 · 引用本方法论
若要在自己的研究中引用本方法论,建议使用以下格式:
Conan Xin (2026). Citation-bound Historical Research: A Methods Note for ID-only Scholarly Writing. SHUGE DH Research Platform v1.0 Candidate. URL: /methods/citation-bound-historical-research/. Status: REVIEW.
方法论本体在 v1.0 Candidate 状态下,本身处于 REVIEW — 与本平台的所有文章一致,需用户明确批准方可升级。