跳到正文
SHUGE 数字人文展览
v1.0 Methods Note · REVIEW · SIMULATED PEER REVIEW · NO AUTO-PUBLISH · 书格 = source platform (NOT publisher)
SHUGE 研究首页 / 数字展览 / 研究方法

研究方法

以证据为基础的历史研究

关于引文定位、资料来源、文本可靠性与解释边界的数字人文研究方法。

查看方法适用范围与旧版说明

§1 · 何为「Citation-bound」

在传统历史研究中,「引用」 (citation) 是文章末段的 bibliography 一栏,通常以作者-年份-页码的形式呈现;读者若需核证,需自行查阅原书。然而,在数字时代,当原书以 hosted scan + OCR + ID 形式存在时,「引用」的本质悄然改变:它不再是「指向某本书」的指针,而是「指向某次扫描的特定位置」的固定字符串。

本方法论所称的「Citation-bound」,正是强调这一转变:每一个 factual claim 必须显式地、可机读地绑定到一个具体的 citation_id。这一绑定不是「建议」或「推荐」,而是「必要条件」 — 没有绑定的 claim 必须标记为 Limitation,且不允许进入文章的「主结论」部分。

📋 Citation-bound 三原则

  1. 绑定原则 (Binding Principle): 每一 claim 必须绑定至少一个 citation_id (来自已冻结证据集)。
  2. 标识原则 (Identification Principle): Citation ID 是固定字符串 (例如 SHUGE:p168491:68),不随时间/平台变化。
  3. 限制原则 (Limitation Principle): 无 citation 的事实陈述必须显式标记 Limitation,且不构成文章核心论据。

§2 · 数据来源与角色区分

本方法论严格区分「数据来源」 (source)、「托管平台」 (hosting platform)、「原初作者/机构」 (original creator) 三类角色,避免混用 — 尤其是「平台」与「出版机构」的概念,二者截然不同。

📋 三角色区分表

角色含义v1.0 实例常见误标
Source Platform 提供 hosted scan + OCR queue + public ID 的数字平台 书格 (shuge.org) ❌ 误标为 publisher
Original Holder 提供物理扫描原件的档案馆 / 图书馆 国立公文書館 (日本) ❌ 误标为 publisher
Original Creator 古籍原初作者 / 编撰机构 郦道元 (北魏) / 宋应星 (明) / 清代工部 ❌ 误标为 publisher

v1.0 §7 明确指出:「书格 = source platform, NOT publisher」。任何 v1.0 文章必须显式区分此三角色,否则视为方法论错误。

详细审计记录于 data/institution_roles_v1.0.json。

§3 · Reliability Tier 标准

本方法论引入四档 reliability tier,用于量化 citation 的可信度:

📋 Reliability Tier 标准

Tier判定标准本证据集实例
HIGH 完整 OCR + 人工 review + 多 citation 互证 (本 v1.0 文章不采用此 tier)
MEDIUM OCR queue 存在但 qa_status=NOT_CHECKED;citation count > 1 本 v1.0 文章 6 个 citation 全部此 tier
LOW 仅 OCR + single citation (本 v1.0 文章未采用)
UNVERIFIED 不在 OCR queue;或方法论级陈述 本 v1.0 文章 §6 方法局限引用

关键观察:本证据集中所有 OCR 状态的 qa_status 均为 NOT_CHECKED,因此没有任何 citation 可以达到 HIGH tier。这是一个保守的、可审计的结论 — 它不否认书格 OCR 的潜在 quality,而是强调:在 QA 未完成之前,任何引用都是 MEDIUM,需以「互证」(同一 claim 多 citation) 弥补单点风险。

§4 · Citation-required-per-claim 工作流

Citation-bound Historical Research 的实际工作流可分为五个步骤:

📋 五步工作流

  1. 步骤 1 · claim 起草: 在已冻结证据集 (v0.5-v0.9) 内寻找可支撑的事实,起草 claim;若证据集不支撑,起草 limitation。
  2. 步骤 2 · citation 绑定: 每一 claim 绑定至少一个 citation_id;无 citation 的 claim 进入 Limitation 行。
  3. 步骤 3 · reliability 评级: 对每一 citation 评 HIGH/MEDIUM/LOW/UNVERIFIED tier,并在 Evidence Appendix 列出。
  4. 步骤 4 · role 澄清: 显式区分 source platform / original holder / original creator 三角色,避免把书格错当 publisher。
  5. 步骤 5 · provenance 不变: 校验所有 v0.5-v0.9 已冻结数据文件未变 (byte-equal);只 ADD 新文件,不 MODIFY 旧文件。

这一工作流与传统的「写文章 → 找引用」模式不同:它是「先看证据 → 再写文章」 — 严格说,是「claim 来自证据,非证据来自 claim」。这一倒置的逻辑,是 citation-bound 方法论的核心。

§5 · Limitation 标记的必要性

在传统学术写作中,「Limitation」通常只在「方法局限」一节简述。然而,在 citation-bound 方法论下,Limitation 必须出现在每一处 claim旁边 — 因为每一个 claim 都面临「未被证据集覆盖」的具体风险,而非一个抽象的「方法局限」。

这一做法借鉴了「provenance per claim」的元数据原则:每一处陈述都附有「出处」与「可信度」,而非仅在文末列出 bibliography。它让读者能在句子级 (sentence-level) 评估可信度,而不是在文章级 (article-level)。

📋 Limitation 标记示例

claim 类别典型 limitation 标记
物理历史链条 (竹简 → 抄本 → 扫描)[]
数字统计 (137 条河 / 1252 条支流)[]
名称等同 (河水=黄河)[]
单次田野观测[]
DH 研究空白判断[]
方法论层级陈述[]

§6 · 与传统学术写作的差异

📋 传统 vs Citation-bound

维度传统学术写作Citation-bound
引用位置 文末 bibliography 每一 claim 旁
引用形式 作者-年份 (Author-Year) 固定 ID 字符串 (例如 SHUGE:p168491:68)
Limitation 文末「方法局限」一节 每一 claim 旁的 inline limitation 标记
可信度评估 文章级 (article-level) 句子级 (sentence-level)
来源平台 vs 出版机构 通常合并标注 严格区分 (source platform / original holder / original creator)
数据采集 自由获取原书 / 数据库 / 实地 严格 ID-only,无新下载 / 无新 OCR
Embeddings / 向量数据库 (常使用) 明确禁止 (per v1.0 invariant)
自动 PUBLISHED (期刊流程) 明确禁止 (per v1.0 invariant inv-pub-v1.0-8)

§7 · 局限与边界

Citation-bound Historical Research 并非适用于所有研究语境。其明确不适用范围包括:

  • 需要外部 independent verification 的研究 — 本方法严格 ID-only,无法引入外部独立核证。
  • 需要完整 full-text retrieval 的研究 — 本证据集 full_text_unavailable=true,无法支持「全文本检索」式研究。
  • 需要从非书格渠道获取材料的研究 — 本方法严格 ID-only,不下载新资源,不抓取。
  • 需要 embeddings / 向量数据库的研究 — 本方法明确禁止 embeddings。
  • 需要自动 PUBLISHED 的研究 — 本方法明确禁止自动 PUBLISHED,REVIEW 状态需用户明确批准。

这些边界不是「缺陷」,而是「设计选择」:它确保研究的可审计性 (auditability)、可追溯性 (traceability)、可重现性 (reproducibility)。

§8 · 与 SHUGE DH Research Platform 的关系

Citation-bound Historical Research 是 SHUGE DH Research Platform v1.0 的方法论配套。平台的 v0.5-v0.9 数据层提供了 citation_id、works、institutions、field_notes、research_questions、evidence_paragraphs 等结构化数据,而本方法论提供「如何使用这些数据写出可审计文章」的规则集。

具体而言:本方法论的 Citation-required-per-claim 政策,直接对应平台的 v0.7 evidence_paragraphs.json 中的 binding_state 五级 (ANNOTATED / CLAIMS_BOUND / EVIDENCE_BOUND / FIELD_NOTE_BOUND / METADATA_ONLY) — 一个 paragraph 的 binding_state 即表征其 citation 完整度。

本方法论的 source platform vs publisher 区分,直接对应平台的 v1.0 新增 data/institution_roles_v1.0.json 审计文件。

本方法论的 Reliability Tier,与 v0.4 data/evidence_cards_v3.json 中的 support_count / evidence_count 字段相对应 — 互证越多,reliability 越高。

§9 · 引用本方法论

若要在自己的研究中引用本方法论,建议使用以下格式:

Conan Xin (2026). Citation-bound Historical Research: A Methods Note for ID-only Scholarly Writing. SHUGE DH Research Platform v1.0 Candidate. URL: /methods/citation-bound-historical-research/. Status: REVIEW.

方法论本体在 v1.0 Candidate 状态下,本身处于 REVIEW — 与本平台的所有文章一致,需用户明确批准方可升级。