关键词:古籍云,OCR。
古籍云 OCR 是专为中文古籍书影设计的识别与图文校勘工具。版面以 竖排右起为默认,支持双行小字夹注、版心中缝、天头眉批; 识别引擎内置 RapidOCR(PP-OCRv6 中文模型),完全离线、开箱即用。 软件坚持原文零改动原则:默认不做简繁转换、不做自动纠错,任何改字都必须由人工确认。
一、界面总览
· 顶部导航:文件 / 图像 / 版面 / 识别 / 校对 / 显示 / 输出 / 帮助,点一级标签切换下方按钮组。
· 左栏「文件管理」:待处理页列表;可 Ctrl 多选、Shift 范围选、Ctrl+A 全选;底部有「OCR 当前页 / OCR 全部」快捷按钮与页数统计。
· 中栏:图像视图(默认)与分列校对视图(可切换)。
· 右栏「识别结果」:可编辑的识别文本,配合「确定修改」把修改保存进识别结果;单击文字可在图像中定位,反之点图像字格会在文本中高亮。
· 底部状态栏:显示光标坐标、识别进度、统计与操作提示。
二、文件
· 加入图像/PDF…(Ctrl+O,或左栏「+」):支持 JPG/PNG/BMP/TIF 与多页 PDF,可一次多选批量加入;PDF 会逐页拆成独立页面,同一 PDF 的多页归为同一组。
· 打开工程…:载入之前保存的工程文件,恢复页面清单、版面框(含手工画栏)、识别结果,随时接着做。
· 保存工程(Ctrl+S)/ 工程另存为…:把当前进度存成工程文件。建议每完成一批识别就保存一次。
· 复制到剪贴板(Ctrl+Shift+C):把右侧识别结果全文复制走,便于粘贴到别的软件排版。
· 退出(Ctrl+Q):关闭软件;有未保存的改动会先询问。
· 关于:版本信息,以及本软件与通用 OCR(汉王、ABBYY 等)在古籍场景下的差异说明。
三、图像处理
· 左转 90° / 右转 90°(Ctrl+L / Ctrl+R):整页旋转,只影响版面分析与识别方向判断,不改变输出文字。
· 图像反白(Ctrl+I):用于黑底白字件、胶卷负片。
· 恢复原图(Ctrl+B):撤销旋转与反白,回到刚加入时的原图。
· 图像预处理…(Ctrl+P):右侧带实时预览,可逐步查看每一中间结果后再确认。共六组参数:
① 基本——自动判别黑白极性(反白件/胶卷)、灰度通道(自动取对比度最高 / RGB 加权 / 蓝通道(黄纸最佳)/ 绿 / 红 / 三通道取最暗)、裁去扫描黑边。
② 底色 / 光照 / 透背——去底色匀光(黄褐纸必备)与背景核大小、背面透字(关 / 轻度 / 强力)、局部对比度增强 CLAHE 与增强强度(墨淡件)。
③ 噪声 / 印章——去噪(关 / 轻 / 强)、去朱红印章与朱笔(注意会连朱笔批校一起去掉,古籍慎用)与红色阈值。
④ 二值化——方法可选 Sauvola 局部自适应(古籍首选)/ Wolf(极淡旧刻本)/ Niblack / Otsu 全局 / OpenCV 自适应;还有灵敏度 k、局部窗口、固定阈值(0=自动)。
⑤ 版面清理——去版框/界行/鱼尾线、去中缝(版心)与中缝宽度%、去孤立噪点与虫蛀碎屑(最小连通域)、断笔修补(笔画细淡断裂时)。
⑥ 几何——自动倾斜校正与搜索范围(±度)。
· 样式入库(已下线):其能力已整合进「版面学习」系统——手工画栏自动入库 + 相似版面自动套用 + 按书经验先验,无需再单独训练样式。
四、版面分析
· 版面学习:两层自动学习,无需手工干预——
① 守卫式经验(始终生效):每次手工画栏后识别(F8/F9),本页的版面几何就沉淀进软件目录集中管理的 layout_memory.json(按书记录、互不混淆,旧版存图片目录的数据会自动迁入);以后这本书的自动识别会参考这些经验(正文列宽、注文大小、版心位置先验),越用越准,且经验随软件集中积累、跨书适用。
② 模板式套框(开关控制):每次手工画栏(画注/画列)都自动记入模板库(软件目录的 layout_templates.json,exe 同级);以后按 F5 分析相似版式的页时,自动把你画过的框套用进来(状态栏会提示模板来源),可在画栏(F2)中微调后重新分析。绝不覆盖你已画过的框。「清空版面学习库…」可一键删除全部模板。
· 版面分析(F5):自动切分本页版面(列、天头、版心、地脚)。默认走列级细分:整页按列切成一条条细列,便于逐列校对;被切碎的笔画会自动合并。
· 版面分析设置…:
— 版面方向:竖排(右起,古籍默认)/ 横排。
— 版面后端:自动(智能 fallback,推荐)/ 投影几何 / 行线感知(画线页)/ 族谱(世系图 · 世寶錄族人记载)/ 混合:投影定列 + YOLO 逐字定夹注(推荐双行夹注书)/ 纯 YOLO 重建(实验性)。
· 族谱:专治「谱系图」与「族人记载」两类页面。谱系图 = 竖排短名 + 圆圈节点 + 父子吊线 + 兄弟横线,投影法会把吊线/界行/版框当成列,一页切出几十条细条、名字一个都框不住;族人记载(世寶錄)= 一列一位族人(小字父系注 + 大字名 + 生卒葬娶正文)。
做法:先抹掉版框 / 吊线 / 界行与圆圈节点,再按竖直投影找「名柱」(同一列的字并成一条),柱内按行投影分段——名字之间隔着吊线长度,各自成段;记载页字距紧,整列合成一段(← 一位族人)。阅读顺序仍是「同代横向、自上而下」,与族谱读法一致。
深墨粗笔的彩色扫描件会自动“去底色 / 对比度增强”两项(否则笔画横画会被当成背景抹掉,整页认不出字),无需手动改预处理。
需要手动选(程序不会自动切换后端):一本族谱只需选一次,设置会随工程保存;批量识别整本书时同样是这个设置。
首次对这类扫描页按 F5 时,状态栏会提示一次「本页是深墨粗笔彩色扫描件……」提醒你切换——因为同一本书里的序文页、题名页用常规投影法反而读得更好,不宜一律自动切换。
口诀:族谱页先切「族谱」后端跑 F5 看框得住不;框不住就调「断列空隙」,或直接画栏手画。序文/题名页若读得不好,切回「自动」或「投影几何」。
— 断列空隙 / 断栏空隙 / 断带空隙(×字号):列切不开就调小,切太碎就调大。最小字号(px)过滤噪点小块。
— 识别双行小字夹注 + 夹注/正文高度比 + 双行中缝(×列宽);分离版心(中缝:书名/卷次/页码)+ 中缝带宽%;合并被切碎的笔画。
— 启用人工标注夹注:读取图旁同名 .anno.json(用标注器画的框),就地注入本列并加(),专治投影法检不到的窄缝小注。
— 自动检注(学习模型·跨书):对没有人工标注的页,用 CPU 分类器自动检出双行夹注;有多个样式时按页自动路由到最匹配的版式。
调参口诀:竖排古籍列间距大,断列空隙 0.4~0.7 即可;夹注识别不出来把「夹注/正文高度比」调到 0.85;版心混进正文就勾「分离版心」、带宽 10%~14%;实在切不好直接用「画栏」手画,人工框优先级最高。
· 画栏(F2):打开手工版面模式——画什么是什么,框内即版面,不再叠加自动分析;本页没画过框时 F5 仍走自动版面。画栏开启后画面为黄绿对照:黄色 = 自动识别框、绿色 = 手工画框(退出画栏后绿色框仍保留,表示人工裁决)。画栏内可切换五种画法:
① 自动吸附列:画的是正文大行,程序自动按列距把大框拆成若干细列,边界自动贴合文字(最常用)。
② 纯手工画列:框画多大列就多大,绝不自动吸附改边界,适合需要精确控制列范围的场合。
③ 画注文:画双行夹注,画完自动分左右两半,可拖动橙色中缝线调整分界;按 R 循环切换读序(右行先读 → 左行先读 → 整框单行)。
④ 画眉批(天头)⑤ 画版心(中缝)。
画栏快捷键:C 切正文列画法、N 切注文画法、R 循环读序(焦点在图像区时生效)。
· 吸附列单独删除:右键自动吸附生成的那一列 → 「删除此列(吸附生成)」,只删这一列、其它列不动;空缺处再画一个新框即可补上,不会重复。手画的原框右键则是「删除此栏(手画)」。
· 清除版面识别(Ctrl+Del):清空当前页的手工与自动版面,可重新分析。文件管理里右键可对多页批量清除。
· 应用版面到全部页:同版式书籍的批量利器。先在样张页画好版面,再在文件管理右键选「将当前页版面应用到全部页」,程序会把该页手工版面套用到所有页并重跑版面切分;完成后按 F9 批量识别即可。版面逐页完全一致时用搬框最准。
· 版面学习模式:右键选「版面学习模式:按当前页经验识别全部页」——不搬框,把当前页手工版面沉淀为该书经验后,全部页改走「自动版面 + 经验先验」并直接识别。列数 / 版心位置页间有差异的书用学习模式更稳:自动版面按每页实际墨迹自适应,经验只调守卫,绝不错位。
· 图像区右键菜单:命中栏框 → 改类型、切竖排/横排、取消此列(丢弃该列的自动识别、重算不再填回)、删除此栏;命中注框 → 调读序、删除;命中空白 → 清除版面识别。
· 文件管理右键菜单:移除本页(多选时批量移除)、清除版面、将当前页版面应用到选中页 / 全部页、版面学习模式(按当前页经验识别全部页)、清空列表、列出全部误识与错误信息。
五、识别
· OCR 单页(F8):识别当前页;建议先用单页确认版面与效果,满意后再批量。
· OCR 全部(F9):批量识别所有页,带进度对话框,可随时取消。
· 暂停 OCR(F6):暂停/继续正在进行的批处理,行粒度生效,可随时续跑。
· 识别引擎…:
— 引擎:RapidOCR(内置离线 PP-OCRv6,默认首选)/ Tesseract(竖排繁体 chi_tra_vert,需自行安装)/ PaddleOCR / CathayOCR ncnn Vulkan(有显卡则 GPU 加速)/ 仅切分(只做版面,不识别,用于人工录入)。
— Tesseract 语言包与路径:竖排模型(_vert)必须保持竖直输入,勾上「竖排模型保持竖直输入」准确率差别很大。
— 低置信度阈值:低于该值的字会被标红,供校对时优先复核。
— 送检补白(px):竖排整列旋转后是极扁长条,四周留白(默认 16)能明显提高识别率;过大则会吞进邻列。
— 送检放大:把送检小图放大后再识别,小字书影有效。
— PSM:Tesseract 版面模式;竖排整块用 5,横排单行用 7。
— INT8 量化模型:模型体积减半、内存更省,实测精度不变。
— 识别前增强(超分):仅当送检列的字太小(<40px)时触发,经典 2x+锐化零依赖;行草书可能反伤,默认关。
— 并行识别线程:整页多列并行,多核机器提速明显(0=自动,1=关闭)。注意每线程各加载一份模型,内存紧张时调小。
— 低置信重试阈值:整列置信低于该值时自动换放大倍数重识别一次,只重试低置信列,高置信列零开销。
— 检测框阈值 / 识别结果阈值:淡墨、磨损书影整列检不出框时把检测框阈值降到 0.4;识别结果阈值降到 0.35 可救回部分淡墨字(宁多勿漏,错字交给人工校对)。
— det 限幅缩放:选「不放大(推荐)」。引擎默认会把窄列条放大 10 倍导致笔画糊化、框位漂移,是漏检与叠字的系统性来源。
— 坐标对齐 + 漏字定向回填:用检测框真实坐标把字落到字格上(替代按字数均分),并只对「连续 ≥2 个空格」的区段定向补字——连续空格才算漏检,散点空格是字格切分过细,补了就是造幻字。
— 送检图像增强:照度归一化,压平纵向黄斑/透墨/阴影;泛黄件可一试。
— AI 辅助转写(可选·联网):把低置信或含 □ 的夹注半行发给视觉大模型转写,利用文言先验修正古籍知识(年号、籍贯、科第等)。默认关闭,关闭时完全离线;原文保留在工程中可对照。
六、校对
· 异体字标记:用橙框标出已知异体字,只提示不改字,供人工复核。
· 低置信红框:用红框标出低置信字,一眼看出哪里需要重点核对。
· 字符查询:输入一个字或多个字,把本页全部命中位置用品红框标出,便于逐一核对(清空输入即取消标注)。
· 校对字库:打开 9.8 万字表,生僻字、扩展区字可翻找查证,并标记该字是否在识别 keys 内(keys 外的字识别难度高,需重点看)。
· 分列校对视图:把每一大行切成竖条卡片,逐列「看图 + 改字 + 写回本列」,最贴近原书阅读方式;点卡片可在图像视图中定位该列。
· 确定修改:把右侧文本框里的改动正式保存到识别结果。多字少字都能保存:字数与字格一致时逐格落字,不一致时按格铺字(少字留空格、多字并格),绝不重复落字;请不要增删空行(行与列是对应的)。改完即生效,随工程一起保存。
· 图文联动:单击右侧文字 → 图像中定位并高亮对应字格;单击图像中的字 → 右侧文本高亮对应内容。两边随时互相对照。
七、显示
· 放大(+)/ 缩小(−):图像区滚轮也可以光标为锚缩放,无需按住 Ctrl。
· 适应窗口(Ctrl+0)/ 适应宽度(Ctrl+9)。
· 显示二值图(Ctrl+2):查看版面算法的输入(黑白二值图),调试用;正常看图请用原图。
· 显示行框 / 显示字框:叠加显示行框、单字字框,便于核对切分是否准确。
· 列序号:按阅读序(右起)给每列标序号,便于核对列序。
· 图像区左键拖动可平移;中缝橙色线可拖动调整双行分界。
八、输出
· 输出设置…:
— 夹注处理:加括号(正文【夹注】)/ 另起一行 / 直接串在正文中 / 不输出夹注;左右括号符号可自定义。
— 输出天头眉批 / 输出版心(书名·卷次·页码)/ 输出地脚:三项独立开关,关掉的内容不识别也不输出。
— 去掉 OCR 插入的多余空格:只清理识别结果里的空格堆积,不影响定位用的全角空格。
— 一列一行:竖排每列单独成行(推荐),方便与原书逐列对校。
— 字格留空补全角空格:某列前空几格、列中跳几格都用全角空格补齐,使文本行位与原书字格一一对应;纯文本连排时取消勾选。
— 页分隔:分页标记,可用 {n} 表示页码,例如「—— 第 {n} 叶 ——」;留空则不加。
— 文本编码:UTF-8(推荐)/ UTF-8 BOM(记事本友好)/ GB18030(老软件兼容);换行符:CRLF / LF。
— 启用用户替换表(会改动字符,慎用)、标记低置信度字(用 ◇ 圈出可疑字)。
· 用户替换表…:录入「原字 → 替换为」的对照规则(如「己→已」「曰→日」)。只有在输出设置里勾选「启用用户替换表」后才生效,建议只录入反复出现且确认无疑的误识。
· 保存当前页 TXT(Ctrl+Shift+S):仅导出当前页。
· 全部导出 TXT:每页各存一个 TXT 文件。
· 合并导出为一个 TXT:所有页按顺序合并成单个 TXT。
· 保存当前页为可搜索 PDF(Ctrl+Shift+P):生成双层 PDF——底层原始书影图 + 顶层不可见文字层,可以搜索、复制、选中,也便于无障碍阅读。
· 合并导出可搜索PDF文件:把全部页面合并成单个双层 PDF(不是每页一个文件)
· 保存当前页 XML(Ctrl+Shift+X):导出 XML 文件,包含每个字的定位坐标(区域/行/字的 x、y、宽、高),可用于图文对照、外部程序二次加工。
· 全部导出 XML:每页各存一个 XML(同样含每字定位信息)。
· 所有导出都在后台线程执行并显示进度条,可中途取消,不会卡住界面。
九、快捷键总表
Ctrl+O 加入图像/PDF | Ctrl+S 保存工程 | Ctrl+Q 退出
Ctrl+L / Ctrl+R 左转/右转 90° | Ctrl+I 图像反白 | Ctrl+B 恢复原图 | Ctrl+P 图像预处理
F2 画栏 | F5 版面分析 | Ctrl+Del 清除版面识别
F8 OCR 单页 | F9 OCR 全部 | F6 暂停/继续
+ / − 放大缩小 | Ctrl+0 适应窗口 | Ctrl+9 适应宽度 | Ctrl+2 显示二值图
Ctrl+Shift+S 保存当前页 TXT | Ctrl+Shift+P 保存当前页 PDF | Ctrl+Shift+X 保存当前页 XML | Ctrl+Shift+C 复制识别结果
F1 帮助 | 画栏内:C 正文列 / N 注文 / R 循环读序(焦点在图像区)
十、典型工作流
1. 加入图像或 PDF(可整本一次加入);
2. 若是黄纸、透背、淡墨件,先做 图像预处理(开去底色匀光、去透背,用预览确认为准);
3. 按 F5 版面分析;结果不理想就用 F2 画栏手工框定(同版式的书只需画一页,再「应用版面到全部页」);
4. F8 先试一页,确认版面与识别效果,满意后 F9 批量识别;
5. 校对:开低置信红框与异体字标记,用字符查询定位,必要时开分列校对视图逐列核对,改完点「确定修改」;
6. 输出:按需要导出 TXT、合并 TXT、或可搜索 PDF;建议先保存工程再导出。
十一、常见问题速查
· 列切不开 → 调小「断列空隙」;切得太碎 → 调大。
· 夹注没检出 → 调大「夹注/正文高度比」,或画栏里用「画注文」手工框定。
· 版心(中缝)混进正文 → 勾选「分离版心」,带宽 10%~14%。
· 淡墨字漏识 → 检测框阈值降到 0.4,识别结果阈值降到 0.35。
· 同一段文字重复出现 → 多为自动吸附列删改后的残留,右键「清除版面识别」后重做版面再识别。
· 识别慢 / 卡顿 → 调小并行识别线程数,或关闭「识别前增强」。
· 导出的 PDF 不能搜索 → 确认用的是「保存当前页为可搜索 PDF / 合并导出可搜索PDF文件」,普通导出不含文字层。
十二、相关链接
· 古籍云官网(软件发布与更新):http://gujiyun.cn
· 古籍云数据库(检索原文出处):http://vip.gujiyun.cn/books
· 在右侧识别结果文本框里选中文字右键,可「查询原文出处」——自动复制并跳转到古籍云数据库检索。