LEXCN · ARTICLE
古籍OCR怎样核对:把识别疑字、断句和原书异文分开
古籍影像转成可检索文字后,查找术语更方便,但识别文字不等于已经校勘。异体字、竖排、多栏、夹注和图表都可能让识别结果偏离版面。检索命中能帮助找到位置,最终引用仍应回到相应书影。不能因为文字已经可以复制,就把每一个字都视…
OCR的用途与限度
古籍影像转成可检索文字后,查找术语更方便,但识别文字不等于已经校勘。异体字、竖排、多栏、夹注和图表都可能让识别结果偏离版面。检索命中能帮助找到位置,最终引用仍应回到相应书影。不能因为文字已经可以复制,就把每一个字都视作古籍原貌。
先判断错误发生在哪层
页面漏了一整列,属于版面顺序问题;形近字识错,属于字符识别问题;两个版本同一位置确有不同字,才可能进入异文比较。还有一种情况是原书字相同、现代标点不同,导致语意分段改变。把这些层次混写为“古籍版本不同”,会夸大实际发现。
一个不冒充史料的练习
下表以“己、已、巳”作为形近字训练材料,不指称某部书实际存在这些错字。遇到疑字时,先看笔画开口和相邻字,再读整句语法,最后与同页同字形比较。上下文可以提出候选,但不能在图像模糊时替代图像证据,直接宣布唯一答案。
核对日志怎样写
保留识别原文、图像位置、候选改字、理由及核对状态。确定修正时记录谁在何时核对了哪一页;只有自动识别或上下文推测时,就按实际状态说明。发布本站文章时可使用已经核清的片段,其余部分不必为了凑齐全文而擅自修补。
断句和注释另行署名
古书可能没有现代标点,编辑加入逗号和句号会影响理解。原句引用与本站断句说明应分别表示;夹注若被识别成正文,更要恢复层次。解释者可以提出自己的读法,但不能把现代推断塞回原文,并让读者以为这是古书已有的明确表述。
怎样接入知识库
本站专题只使用与论点直接相关、能够定位的短段落,再附原创解释、表格或演算。来源页记录核对范围,读者可先在本站理解,再去原始影像复核。这样既利用OCR的检索效率,也让疑字和未核部分保持可见,不以“全本已收录”代替真正的文字质量。
形近字核对练习记录
形近字是训练材料,并不指称某部古籍发生了这些具体错字。
| 对象 | 先检查 | 再检查 | 未看清时 |
|---|---|---|---|
| 己/已/巳 | 开口、收笔及同页字形 | 上下文语义 | 保留疑字 |
| 夹注 | 字号、行列及版面位置 | 是否误并正文 | 标注层次待核 |
| 标点 | 原书是否有断句标记 | 不同断句对语义的影响 | 写明整理选择 |
核对范围与修订记录
2026-09-19 · 新增完整专题、演算或来源导读。原创正文、所列资料与确定性教学表核对;非古籍全本校勘或现实预测验证。
参考来源
- 古籍目录与数字资源:查版本的工作方法
本站导读列明所用资料、原始出处和核对范围;具体演算与文字解释分开。
乐测命理整理 · 发布于 2026-09-19 · 更新于 2026-09-19
继续阅读与在线工具
古籍、规则与案例:不同证据能支持什么结论 · 怎样给古籍建立可找回的位置:书名、版本、卷叶与影像页 · 正文、古注、评注与本站解读:同一页里的四种声音怎样辨认 · 十个网页为何可能只有一个来源:转录链与独立见证核对 · 古籍目录与数字资源:查版本的工作方法 · 古籍研读 · 知识库