正字校书 Donkey Scribe,新鲜出炉。
一个古籍拉磨工具,唐人所谓“正字校书,咏诗骑驴”,logo的意思就是穷鬼拉磨,所以工具核心也是拉磨。
它不试图提供直接可用的OCR结果(后续更新也不),只是尽可能便于人工校对:
使用时,左边查看原始书页,右边是按原图位置排列的 OCR 文字块。可以直接改字、补字、删除误识别内容,也可以拖动文字块调整阅读顺序;双行小字可以手动组成“小字组”,复制时自动用括号标出。校完以后,可以一键复制当前页,也可以批量复制全部已校页面。
目前已经支持:
* 导入图片文件夹或多页 PDF
* 手动框选版心,并分别继承单双页版心位置
* 分批后台 OCR,识别时仍可继续翻页和调整后续页面
* 可视化修改、移动、新增、删除文字块
* 双行小字分组
* 当前页及全部已校页面复制
* 保存项目,下次继续校录
* 全程本地处理,不会覆盖原始图片或 PDF
第一版 Mac端和Win端可用,不需要另外安装 Python。
具体说明参见 README 里。
项目已开源,欢迎试用、反馈:
http://t.cn/AX9v6z11
@微博科技 #微博vibelab##vibework##vibecoding#
发布于 江苏
