乐测命理

LEXCN · ARTICLE

古籍OCR怎样核对:把识别疑字、断句和原书异文分开

古籍影像转成可检索文字后,查找术语更方便,但识别文字不等于已经校勘。异体字、竖排、多栏、夹注和图表都可能让识别结果偏离版面。检索命中能帮助找到位置,最终引用仍应回到相应书影。不能因为文字已经可以复制,就把每一个字都视…

OCR的用途与限度

古籍影像转成可检索文字后,查找术语更方便,但识别文字不等于已经校勘。异体字、竖排、多栏、夹注和图表都可能让识别结果偏离版面。检索命中能帮助找到位置,最终引用仍应回到相应书影。不能因为文字已经可以复制,就把每一个字都视作古籍原貌。

先判断错误发生在哪层

页面漏了一整列,属于版面顺序问题;形近字识错,属于字符识别问题;两个版本同一位置确有不同字,才可能进入异文比较。还有一种情况是原书字相同、现代标点不同,导致语意分段改变。把这些层次混写为“古籍版本不同”,会夸大实际发现。

一个不冒充史料的练习

下表以“己、已、巳”作为形近字训练材料,不指称某部书实际存在这些错字。遇到疑字时,先看笔画开口和相邻字,再读整句语法,最后与同页同字形比较。上下文可以提出候选,但不能在图像模糊时替代图像证据,直接宣布唯一答案。

核对日志怎样写

保留识别原文、图像位置、候选改字、理由及核对状态。确定修正时记录谁在何时核对了哪一页;只有自动识别或上下文推测时,就按实际状态说明。发布本站文章时可使用已经核清的片段,其余部分不必为了凑齐全文而擅自修补。

断句和注释另行署名

古书可能没有现代标点,编辑加入逗号和句号会影响理解。原句引用与本站断句说明应分别表示;夹注若被识别成正文,更要恢复层次。解释者可以提出自己的读法,但不能把现代推断塞回原文,并让读者以为这是古书已有的明确表述。

怎样接入知识库

本站专题只使用与论点直接相关、能够定位的短段落,再附原创解释、表格或演算。来源页记录核对范围,读者可先在本站理解,再去原始影像复核。这样既利用OCR的检索效率,也让疑字和未核部分保持可见,不以“全本已收录”代替真正的文字质量。

形近字核对练习记录

形近字是训练材料,并不指称某部古籍发生了这些具体错字。

对象先检查再检查未看清时
己/已/巳开口、收笔及同页字形上下文语义保留疑字
夹注字号、行列及版面位置是否误并正文标注层次待核
标点原书是否有断句标记不同断句对语义的影响写明整理选择

核对范围与修订记录

2026-09-19 · 新增完整专题、演算或来源导读。原创正文、所列资料与确定性教学表核对;非古籍全本校勘或现实预测验证。

参考来源

乐测命理整理 · 发布于 2026-09-19 · 更新于 2026-09-19

继续阅读与在线工具

古籍、规则与案例:不同证据能支持什么结论 · 怎样给古籍建立可找回的位置:书名、版本、卷叶与影像页 · 正文、古注、评注与本站解读:同一页里的四种声音怎样辨认 · 十个网页为何可能只有一个来源:转录链与独立见证核对 · 古籍目录与数字资源:查版本的工作方法 · 古籍研读 · 知识库