跳到正文

《水经注》语料质量审计

CORPUS SEMANTICS RECONCILIATION · R3.1 · DB read-only audit

R3.1 在 R3 完整语料校准的基础上,进一步区分 OCR 是否有字(OCR_NONEMPTY)与 研究可读正文(RESEARCH_SEARCHABLE)两个语义层。 本审计是只读的:不重跑 OCR、不下载新资源、不修改 R1 / R2 / R2.1 / R2.2 / R3 任何 frozen 输出。 所有数值来自 SHUGE-RESEARCH-DB 的只读查询。
956
page_objects / OCR_SUCCESS
956
OCR_NONEMPTY (LENGTH > 0)
866
RESEARCH_SEARCHABLE (BODY+TITLE+TOC)

work_id p124575 · canonical SHUGE work record = post_id 124575 · DB = file:/home/conanxin/shuge-research-db/data/shuge.db?mode=ro · 返回完整语料

BLOCK 01

为什么 956 ≠ 956 个正文页

SHUGE-RESEARCH-DB 中,《水经注》(work_id = p124575)共有 956 个 page_objects。 R3 报告所有 956 页都有 OCR 文字,但并不是所有 956 页都包含水经注正文片段。

R3.1 把 956 页按内容特征分成 8 个类型(详细分类法见 WATER_CLASSIC_METRIC_DEFINITION_R3_1.md)。 主要类别如下:

  • BODY_TEXT(正文,含水经注典型流向描述)827 页
  • TITLE_PAGE(卷第 / 水經第 章节标题页)38 页
  • TABLE_OF_CONTENTS(目錄页)1 页
  • SCAN_HEADER_ONLY(扫描头元数据 — Kodak 灰卡 / 国立公文書館 / 番號等)32 页
  • UNKNOWN(无明显信号 — 待人工审)58 页
  • BLANK(char_count = 0)0 页

一个 page 可以同时被分类进 BODY_TEXT 与 SCAN_HEADER_ONLY(扫描头 + 部分正文)。R3.1 把这种 边界页优先归入 BODY_TEXT,因为"有强信号正文"在检索侧更可被使用; 但当 archive 标记 = 6 以上且无正文时,归入 SCAN_HEADER_ONLY。

BLOCK 02

OCR Coverage vs Research-searchable

R3 把"OCR 是否有字"等同于"可检索页",这导致 956 与 prior 933 出现无法解释的差异。 R3.1 显式把两个指标分开。

指标DB 表达式当前值
OCR_SUCCESS_PAGESpage_ocr.status = 'SUCCESS'956
OCR_NONEMPTY_PAGESLENGTH(coalesce(raw_text,'')) > 0956
BODY_TEXT_PAGES强标记 ≥ 1827
TITLE_PAGE_PAGES含 卷第 / 水經第38
TOC_PAGES含 目錄1
RESEARCH_SEARCHABLE_PAGESBODY_TEXT + TITLE_PAGE + TOC866
SCAN_HEADER_ONLY_PAGES无正文 + archive 标记 ≥ 232
UNKNOWN_PAGES无法判定 — 待人工审58
BLANK_PAGESchar_count = 00

R3.1 的 RESEARCH_SEARCHABLE = 866 是 R2.1 中"AUDITED SAMPLE(60-page / 39 substantial body)" 在 956 页完整 corpus 上的延伸。"39 substantial body" 对应完整语料的 827 句/29 个标题/1 个目录页中的 子集。

BLOCK 03

页面类型分布(956 页全分类)

下表列出每种类型的前 5 个样本,以及判定理由。 完整 956 页分类见 data/water_classic_page_types_r3_1.json。

类型页数判定启发式
BODY_TEXT827strong_marker_count ≥ 1(15 个水经注强标记)
TITLE_PAGE38含 卷第 / 水經第 章节标题模式
TABLE_OF_CONTENTS1含 目錄
SCAN_HEADER_ONLY32无正文 + archive 标记 ≥ 2
UNKNOWN58无法判定 — 待人工审
BLANK0char_count = 0
MIXED0(无图指纹信号,未使用)
IMAGE_OR_DECORATIVE0(无图指纹信号,未使用)

3.1 强标记(15 个)

用于判定 BODY_TEXT 的内容信号:

又南 又東 又西 又北 東過 西過 南過 北過 注于 注之 注河 注易 江水 河水 易水 淮水 渭水 出其縣 故城 流注 會水 入于 經其 卷第 水經第 桑欽 郦道元 范陽 容城 故安 公安 華容 野王 修武

3.2 Archive 模式(11 个)

用于判定 SCAN_HEADER_ONLY 的元数据信号:

Kodak COLORCheCkeR xrite National Archives 国立公文書館 内阁文庫 函號 番號 册數 架 Kocak

3.3 char_count 分布

bucketpages
00
1–4927
50–19964
200–499865
500+0
BLOCK 04

933 vs 956 reconciliation

SHUGE 主项目文档记录的 prior 报告 = 933 searchable / 23 blank / 956 pages。 R3 的当前值 = 956 searchable / 0 blank / 956 pages。 R3.1 把这组数字重新解读如下。

指标priorR3R3.1 解读
TOTAL_PAGE_OBJECTS956956未变
OCR_SUCCESS_PAGES956956未变
OCR_NONEMPTY (R3 称 SEARCHABLE)93395623 blank 页已被填字 — OCR 重新跑过
BLANK230被填字的 23 页归入 SCAN_HEADER_ONLY 或 UNKNOWN
RESEARCH_SEARCHABLE (R3.1 新)(未定义)(未定义)866 = BODY + TITLE + TOC

prior "searchable = 933" 是当时 OCR 跑完后的瞬时计数(956 - 23 blank)。 R3 时 23 页已被填字,SEARCHABLE = 956。 R3.1 进一步把 SEARCHABLE 拆分,引入 RESEARCH_SEARCHABLE = 866 作为"研究可读正文"基线。

详见 WATER_CLASSIC_SEARCHABLE_RECONCILIATION_R3_1.md 与 data/water_classic_text_layer_stats_r3_1.json。

BLOCK 05

322030 vs 302951 chars 解释

prior 报告的 322030 chars 与 R3 报告的 302951 chars 差 19079 chars。 R3.1 通过对比 5 个文本层的字符统计,定位了这个差异的根因。

文本层DB 表达式当前值
RAW_TEXT_CHARSSUM(LENGTH(raw_text))322030 ✓ matches prior
NORMALIZED_TEXT_CHARSSUM(LENGTH(normalized_text))322030 ✓ matches prior
READING_TEXT_CHARSSUM(LENGTH(reading_text)) from page_text_layersNOT_AVAILABLE(p124575 无 reading layer 行)
CORRECTED_TEXT_CHARSSUM(LENGTH(corrected_text)) from page_text_layersNOT_AVAILABLE(p124575 无 corrected layer 行)
FTS_TEXT_CHARSFTS5 contentlessNOT_AVAILABLE(FTS5 不存 normalized_text 内容)

对 p124575 而言,raw_text 与 normalized_text byte-identical(都 322030 chars)。 R3 报告的 302951 来自 SUM(char_count) 列 —— 该列在 page_ocr schema 上没有显式定义。 从 19079 chars 的差值看,char_count 似乎过滤了某些字符(可能空白、特殊符号、或仅 CJK)。

R3.1 改用 SUM(LENGTH(normalized_text)) 口径,与 prior 一致(322030)。 建议在 R3.2 给 char_count 加 CHECK / 文档化口径定义。

BLOCK 06

FTS5 状态

ocr_fts 表(FTS5 virtual table, tokenize='trigram', content='' contentless_delete=0)的存在但 与 p124575 完全断开。所有 3553 行的 work_id 与 page_object_id 都为 NULL。

检查值
ocr_fts 总行数3553
page_object_id NOT NULL0
work_id NOT NULL0
p124575 行数0
MATCH 'Kodak'(ASCII)75
MATCH 'National'(ASCII)232
MATCH '江水'(CJK)0
MATCH '河水'(CJK)0
MATCH '水'(CJK)0

RC1 摄入脚本未写入 work_id 与 page_object_id 列 → 无法按 work_id 检索 p124575。
RC2 tokenize='trigram' 对 CJK 字符不友好 → 即使 RC1 修复,中文仍可能不被 MATCH。
RC3 p124575 的 page_ocr.normalized_text 不在 ocr_fts → OCR 输出未进 FTS。

R3.1 临时方案:用 page_ocr.normalized_text LIKE 路径(已知 R3 验证可行)。 R3.2 计划修复 ocr_fts 摄入脚本 + 切换 tokenize。 详见 WATER_CLASSIC_FTS_AUDIT_R3_1.md 与 data/water_classic_fts_audit_r3_1.json。

BLOCK 07

三个故事 BODY_TEXT-only counts

R3 的三个核心故事用 page_ocr.normalized_text LIKE 在全 956 页上验证(ALL_OCR)。 R3.1 进一步限制到 BODY_TEXT 类型 827 页 — 排除 SCAN_HEADER_ONLY、TITLE_PAGE、UNKNOWN 等页。

7.1 单词出现次数(ALL_OCR vs BODY_TEXT_ONLY)

词ALL_OCR(956 页)BODY_TEXT_ONLY(827 页)差值
江水7869-9(主要出现在 TITLE_PAGE)
公安330
華容43-1
易水119-2
范陽10100
容城880
故安98-1
河水118111-7
野王990
修武770

7.2 三个核心故事 · 共现计数

故事共现ALL_OCRBODY_TEXT_ONLYR3.1 评估
江水—公安—華容 江水 + 公安11TEXT_CONFIRMED(不变)
江水 + 華容21TEXT_CONFIRMED(变窄)
易水—范陽—容城—故安 易水 + 范陽55TEXT_CONFIRMED(不变)
易水 + 容城44TEXT_CONFIRMED(不变)
易水 + 故安54TEXT_CONFIRMED(变窄)
河水—野王—修武 河水 + 野王11TEXT_CONFIRMED(不变)
河水 + 修武22TEXT_CONFIRMED(不变)

所有三个核心故事在 BODY_TEXT_ONLY 限制下仍保持 TEXT_CONFIRMED。 江水+華容 从 2 变窄到 1、易水+故安 从 5 变窄到 4 是因 ALL_OCR 计数包含了 TITLE_PAGE 中的 卷次标题提及,但共现(两个词在同一页)绝大多数仍落在 BODY_TEXT 类型页。 不创建新 claim。详见 data/water_classic_story_counts_body_only_r3_1.json。

BLOCK 08

对后续研究意味着什么

R3.1 的三类划分不是新发现,而是把"OCR 是否有字"与"研究可读正文"显式区分。 这一区分直接影响后续研究可声明的强度。

8.1 RESEARCH_SEARCHABLE = 866 是后续研究的新基线

公开页面不再说"956 可检索页";而是:

  • 956 = page_objects 全部数 / OCR_SUCCESS
  • 956 = OCR_NONEMPTY(所有 OCR 都有字)
  • 866 = RESEARCH_SEARCHABLE(BODY_TEXT + TITLE_PAGE + TOC)
  • 32 = SCAN_HEADER_ONLY(扫描头元数据)
  • 58 = UNKNOWN(待人工审)
  • 0 = BLANK

8.2 卷次重建 · volume_status 仍 = UNRESOLVED

R3 已经报告 page_index / page_label / page_object_id 三者间存在 1:N 关系(91 个 label 映射到 956 页)。 R3.1 进一步发现 TITLE_PAGE 38 页(章节标题),但 document_units 表对 p124575 = 0 行, 无 page-to-volume mapping。后续研究如果需要"卷 → 河 → 城"的结构,需要先建 document_units。

8.3 FTS5 需修复

R3.2 计划:

  • 修复 ocr_fts 摄入脚本(补 work_id + page_object_id 列)
  • 把 tokenize='trigram' 改为 tokenize='unicode61 remove_diacritics 2'
  • 重新 build ocr_fts 索引 page_ocr.normalized_text

8.4 58 UNKNOWN 页

58 UNKNOWN 页(strong=0 且 archive < 2 且无水經)是 R3.1 未能用启发式自动分类的页。 它们的 char_count 全部在 200–500 区间(典型文本页),可能含弱水经注正文但缺强标记。 后续可通过采样人工审 + 关键词扩展来重新归类。

8.5 不创建新 claim

R3.1 仅 retest R3 既有三个核心故事的 BODY_TEXT 计数,不变更 R2.1 evidence dataset、 R2 claims dataset、Page 404 → 957 等任何 frozen 数据。 R3.1 不引入新的历史地理 claim,所有文本支持仍是 TEXT_CONFIRMED(TEXT_PARTIAL 在 R3.1 内未触发)。

BLOCK 09

R3.2 · 《水经注》正文可信度验证(Historical Evidence Gate)

R3.2 在 R3.1 的页面类型分类之上,引入语义验证门槛: 把 R3.1 的 BODY_TEXT = 827 重新打开,做更细的语义判定; 把 R3.1 的 UNKNOWN = 58 全部重审,显式排除扫描头与不可用页。 结果是把 R3.1 的 RESEARCH_SEARCHABLE = 866 压缩成 RESEARCH_INDEXABLE = 465(仅 426 历史正文 + 38 标题 + 1 目录)。

9.1 · BODY_TEXT Precision Audit(827 页抽样 90)

从 R3.1 的 827 页 BODY_TEXT 中抽取:

  • 随机 60 页(seed=42)
  • 核心河流共现 30 页(全集实际只有 10 页,自动截断)
  • 短正文 / 边界页 20 页(normalized_char_count ≤ 200)

判定规则:

TRUE_BODY   : strong_marker_count ≥ 1 AND len ≥ 80 AND (title == 0 OR strong ≥ 1)
TITLE_OR_TOC: 标题/目录词命中(strong ≥ 0)
HEADER_ONLY : strong == 0 AND noise ≥ 2(国立公文書館 / Kodak / 番號)
OCR_NOISE   : len < 60 strong==0 OR (strong==0 AND rivers==0 AND len < 400)
UNCERTAIN   : 60-200 chars strong==0 OR strong + len < 80

全量验证结果:

TRUE_BODY      = 422  (51.0%)  ← 可作 SUPPORTED 历史证据
TITLE_OR_TOC   =   7  ( 0.8%)  ← R3.1 误判
HEADER_ONLY    =   0
OCR_NOISE      = 392  (47.4%)  ← 短/低质量 OCR
UNCERTAIN      =   6  ( 0.7%)
─────────────────────────────
TOTAL          = 827
抽样精度:
  N = 90 (60 random + 10 core-river + 20 short-boundary)
  TRUE_BODY = 56 / FALSE_POSITIVE = 32 / UNCERTAIN = 2
  BODY_TEXT_PRECISION = 56 / (56 + 32) = 0.6364

关键发现:R3.1 的 BODY_TEXT=827 中,只有 422 页是真正的历史正文(51%)。 其余 392 页被判为 OCR_NOISE——它们的 normalized_text 较短(< 400)且无 strong marker, 多为扫描残留字符或片假名数字。

9.2 · UNKNOWN = 58 全量重审

BODY_TEXT              =   4  ( 6.9%)  ← R3.1 漏判
TITLE_PAGE             =   0
TABLE_OF_CONTENTS      =   0
SCAN_HEADER_ONLY       =  49 (84.5%)  ← 多为"国立公文書館"等元数据字符串
IMAGE_OR_DECORATIVE    =   0
MIXED                  =   0
REMAIN_UNKNOWN         =   5  ( 8.6%)  ← 待人工审(RESEARCH_LEAD)
─────────────────────────────────────
UNKNOWN_REVIEWED       =  58 (100%)
UNKNOWN_REMAINING      =   5 ( 8.6%)

5 页 REMAIN_UNKNOWN 共同特征:len 125-401,有部分强标记但被 OCR 异体/错字打断,需要人工二次确认。

9.3 · Historical Body Pages 与 Research Indexable Pages

HISTORICAL_BODY_PAGES
  = TRUE_BODY_from_R3_1_BODY_TEXT (422)
  + UNKNOWN → BODY_TEXT            (4)
  = 426

TITLE_PAGES    = 38 + 0 = 38
TOC_PAGES      =  1 + 0 =  1
─────────────────────────────────
RESEARCH_INDEXABLE_PAGES
  = HISTORICAL_BODY + TITLE + TOC
  = 426 + 38 + 1
  = 465

RESEARCH_INDEXABLE 不再混合正文与元数据;只包含可作 SUPPORTED 历史证据或 METADATA 的页。

9.4 · Historical Evidence Gate(四等级)

┌──────────────────────┬──────────────┬─────────────────┐
│ 条件                 │ R3.2 等级     │ 用途            │
├──────────────────────┼──────────────┼─────────────────┤
│ BODY_TEXT + TRUE_BODY │ SUPPORTED   │ 历史事实声明    │
│ TITLE / TOC           │ METADATA    │ 版本 / 书目元数据│
│ HEADER / NOISE / MIXED│ NON_EVIDENCE │ 不可作为证据    │
│ REMAIN_UNKNOWN(5)     │ RESEARCH_LEAD│ 待人工审        │
└──────────────────────┴──────────────┴─────────────────┘

任何未来 R4 / R5 的历史研究,必须先过此 gate: page_object_id ∈ HISTORICAL_BODY_PAGES(426) 才有资格作为 SUPPORTED 历史证据。

9.5 · 三个故事 · VALIDATED_BODY 重测

7 个故事对 · 全部用 R3.2 严格 426 页子集重测,无新增 claim:

故事对                ALL_OCR  R3.1  R3.2_VALIDATED  R3.2 评估
江水 + 公安            1       1        1            TEXT_CONFIRMED
江水 + 華容            2       1        1            TEXT_CONFIRMED
易水 + 范陽            5       5        5            TEXT_CONFIRMED
易水 + 容城            4       4        4            TEXT_CONFIRMED
易水 + 故安            5       4        4            TEXT_CONFIRMED
河水 + 野王            1       1        1            TEXT_CONFIRMED
河水 + 修武            2       2        2            TEXT_CONFIRMED

全部 7 对 ≥ 1,三个故事在严格 VALIDATED_BODY 门槛下仍保持 TEXT_CONFIRMED。

R3.2 不修改 R3.1 任何文件 / 不创建新历史 claim / 不重跑 OCR / 不下载新资源 / 不写 DB。 所有判定基于 R3.1 page_types JSON + SHUGE-RESEARCH-DB 的 read-only 查询。

BLOCK 10

R3.3 · 《水经注》核心证据文本代理复核 (Evidence Gate v2)

将 R3.2 strict-rule 自动分类的 422 RULE_QUALIFIED_BODY 提升为 PROXY_REVIEWED 证据门槛;逐页 OCR-text-domain 复核 100 页抽样 + 7 对核心 pair 共 12 unique supporting pages。注:R3.4 起 UI 统一称「文本代理复核」(PROXY_REVIEWED),不再用「人工验证」(HUMAN_VERIFIED)。

10.1 · 概念分离:RULE_QUALIFIED ≠ PROXY_REVIEWED

R3.2 报告的 TRUE_BODY = 422 在 R3.3 改称 RULE_QUALIFIED_BODY(strict-rule 命中,未经人工复核)。本任务不做 OCR,也不引入新历史 claim,只对核对的页进行 proxy 人工复核。

术语数量含义
RULE_QUALIFIED_BODY422strict-rule 通过 (strong ≥ 1 + len ≥ 80 + 非纯 TOC/noise)
UNKNOWN_TO_BODY_CANDIDATES4UNKNOWN 重审后升 BODY_TEXT
BODY_CANDIDATES_TOTAL426RULE_QUALIFIED 422 + UNKNOWN→BODY 4
PROXY_REVIEWED_BODY_PAGES108经 OCR-text-domain proxy 复核通过(本任务实绩)
PROXY_REVIEWED_BODY(extrapolated)≈ 408422 × 0.97 = 全名 = R3.3 估计(95% CI Wilson [387, 419])

10.2 · 422 strict candidates · 100-页抽样结果

从 422 RULE_QUALIFIED_BODY 抽样 100 页:60 random + 20 short/boundary + 20 core-river (deterministic · seed=20260928)。

组HUMAN_CONFIRMED_BODYFALSE_POSITIVEUNCERTAIN
random (60)5730
short/boundary (20)2000
core-river (20)2000
合计 (100)9730

STRICT_BODY_PRECISION = 0.97 (= 97 / (97+3),UNCERTAIN=0 excluded)。 95% CI Wilson = [0.9155, 0.9897]。
3 个 FALSE_POSITIVE 全部为短边界纯 TOC 列表(第十X + 河水/渭水/江水等 listing),非正文。
0 UNCERTAIN 反映启发式 v2 的决策果断特性;真实人类眼睛复核可能产生额外边界案例(诚实局限性声明见 BLOCK 10.6)。

10.3 · Core Story Verified Evidence (12 unique supporting pages)

7 个核心 pair 全量复核:12 unique supporting pages (20 pair results)。每页含 raw_ocr_excerpt / normalized_excerpt / human_checked_excerpt / semantic_context / verification_status。

PairVERIFIEDPARTIALREJECTED
江水 + 公安100
江水 + 華容200
易水 + 范陽500
易水 + 容城400
易水 + 故安500
河水 + 野王100
河水 + 修武110
合计 (pair results)1910

河水+修武 1 PARTIAL:pid 1975 (page_label p0044, page_index=44),河水在前段、修武在后段 distance=326 chars(超 300 阈值)。 STORY 1 (江水-公安-華容) 全部 VERIFIED · STORY 2 (易水-范陽-容城-故安) 全部 VERIFIED · STORY 3 (河水-野王-修武) VERIFIED + 1 PARTIAL。
无 REJECTED → 三个故事状态无需降级。

10.4 · Context-Window Review

对所有 VERIFIED/PARTIAL 核心页 (12 unique) 读取 prev/curr/next normalized_text (按 page_index):

Status含义计数
CONTINUEDprev/curr 与 curr/next 共享 strong markers(或双向 continuation)10
CROSS_PAGE仅一侧连接(单边 narrative 延续)2
ISOLATED两侧皆无 narrative 延续0
UNCERTAIN文本不足无法判定0

10.5 · Accepted / Partial / Rejected 总览

类别计数用途
VERIFIED (accepted)19 pair results / 12 unique pages可作 SUPPORTED 证据引用
PARTIAL1 pair result (pid 1975)可引用,需注明 PARTIAL
REJECTED0—
HUMAN_CONFIRMED_BODY (Section B 抽样)97 unique pagesstrict-rule precision 通过 proxy 复核
PROXY_REVIEWED_BODY_PAGES (合计 unique)10897 (B) ∪ 12 (C) − 1 overlap (pid 1682)

10.6 · 复核方法与诚实声明 (Limitations Disclosed)

Reviewer: AI agent acting as OCR-text-domain proxy reviewer。
局限性:无实际人工眼睛扫 page image;复核基于 normalized_text 内容 + linguistic/typographic 启发式 (scan-header 位置、TOC listing vs narrative-fragment 区分、narrative-verb 密度、shared strong markers across prev/curr/next)。
"HUMAN" 是 status term,指 narrative-coherence confidence,非字面人眼复核;真实人类眼睛复核可能产生额外 UNCERTAIN 边界案例。
不修改 DB(file:...shuge.db?mode=ro URI 模式 read-only),不运行新 OCR,不下新资源,不创建新历史 claim。

10.7 · Evidence Gate v2 — 未来 R4 门槛

未来 R4 历史研究若引用某页作 SUPPORTED claim,必须同时满足 4 项:

  1. canonical page id:SHUGE:p124575:<page_object_id> citation 一致
  2. RULE_QUALIFIED_BODY:normalized_text 通过 RULE_QUALIFIED 规则
  3. human verification:经人工/视觉复核或本任务 Section B/C proxy review 确认
  4. semantic context reviewed:context_window(prev/curr/next)显示 narrative 一致性

强约束:R4 不得新增历史 claim。所有新 claim 必须映射到现有 PROXY_REVIEWED_BODY_PAGES = 108。 如需扩展 SUPPORTED 集合,必须先回到 R3.3/R3.4 流程(不运行新 OCR、不下载新资源,仅对现有 422 中未复核页进行文本代理复核,复核通过后 PROXY_REVIEWED_BODY_PAGES 才扩)。

R3.3 不修改 R3.2 / R3.1 / R3 / R2.2 / R2.1 / R2 / R1 / v1.0 任何文件;所有判定基于 SHUGE-RESEARCH-DB 的 read-only 查询 + 已发布数据文件。

BLOCK 11

R3.4 · 《水经注》上下文序列修复 (Evidence Gate v3)

R3.4 修复 R3.3 核心证据页 prev/next 上下文的跨序列污染:12 / 12 core supporting pages 的 prev/next 原先都从错误的 sequence_group (WCSEQ-001) 选取。R3.4 以 page_objects.id 顺序 + page_index 单调性建立 20 个 sequence_group (WCSEQ-001..020),并基于 STRONG 标记 (15 水系) + 古文连续标记 (6 字) 重建 4 档上下文状态。同时正式将「人工验证/HUMAN_VERIFIED」改称「文本代理复核/PROXY_REVIEWED」。

11.1 · 命名修正(R3.3 → R3.4)

旧 (R3.3)新 (R3.4)
HUMAN_VERIFIED_BODY_PAGESPROXY_REVIEWED_BODY_PAGES
STRICT_BODY_PRECISIONPROXY_REVIEW_AGREEMENT_RATE
人工验证 (UI 标签)文本代理复核

11.2 · 序列组检测

对 p124575 共 956 个 page_objects 按 id 顺序遍历,遇 page_index = 1 启动新组,连续 page_index + 1 延续,断点结束。检测结果:

sequence_group_count = 20 (WCSEQ-001 .. WCSEQ-020)
total_pages           = 956
group_size_distribution = 11..74 pages
12 core supporting pids 分布于 4 个 sequence_group:
  WCSEQ-004 (7 pids: 1655, 1656, 1657, 1659, 1660, 1661, 1682)
  WCSEQ-008 (1 pid:  1892)
  WCSEQ-011 (2 pids: 1968, 1975)
  WCSEQ-018 (2 pids: 2321, 2322)

11.3 · 上下文状态分布(12 core supporting pages)

SAME_SEQUENCE_CONTINUED = 0  (无 STRONG 标记双向重叠)
CROSS_PAGE_VALID        = 3  (1659, 1661, 1682;古典续接标记证实)
SINGLE_PAGE_SUFFICIENT  = 9  (同序列相邻但文本层未可证)
CONTEXT_UNRESOLVED      = 0  (R3.3 跨组污染已全部修复)

11.4 · 证据门槛 v3(R3.4 取代 v2)

TEXT_SUPPORTED claim 必须同时满足 4 项 AND:

  1. canonical citation (SHUGE:p124575:)
  2. RULE_QUALIFIED_BODY (R3.2 strict-rule 命中)
  3. PROXY_REVIEWED (R3.3/R3.4 OCR-text-domain 复核通过)
  4. same-page semantic support (河名 + 历史地名 ±30 字,叙事密度 ≥ 5)

跨页 claim 额外需要:

  1. VALID_SEQUENCE_CONTEXT (prev/curr/next 同 WCSEQ-XXX + page_index ± 1 + STRONG/古典续接标记)

11.5 · 三故事重评估

Story 1 江水-公安-華容          TEXT_SUPPORTED   CONTEXT_PARTIAL   MODERN_UNRESOLVED
Story 2 易水-范陽-容城-故安    TEXT_SUPPORTED   CONTEXT_PARTIAL   MODERN_UNRESOLVED
Story 3 河水-野王-修武          TEXT_SUPPORTED   CONTEXT_PARTIAL   MODERN_UNRESOLVED

11.6 · 中文核心证据页

12 个 unique supporting pages 已建中文核心证据页,逐页展示 canonical Citation、水系、历史地名、OCR 原文、本页能够支持什么、本页不能支持什么、sequence group、previous/current/next、context status、proxy review status。查看《水经注》核心证据

BLOCK 12

技术数据下载

本审计(R3.1 + R3.2)所有原始数据可下载(JSON + Markdown):

所有数据均来自 SHUGE-RESEARCH-DB 的 read-only SQLite 查询。 本页面与所有数据文件均继承 R3 baseline(commit 9ce93a2)与 R3.1 baseline(commit 8326c62), 不修改 v1.0 / R1 / R2 / R2.1 / R2.2 / R3 / R3.1 frozen outputs。