《大话文渊慧典》:二

发布时间:2026/7/26 8:13:49
《大话文渊慧典》:二 《文渊慧典》开发手记之二市场同类商业版调研——大胖老师“小菜你花过最冤枉的钱是啥”——小菜“给前女友买的口红结果她跟卖口红的跑了。”——大胖老师“……那我比你强点我花两万八买了套OCR结果它连‘己’和‘已’都分不清。”一、调研从一次“血泪购物”开始2022年春天大胖老师所在的高校图书馆获批了一笔古籍数字化专项经费不多不少正好三十万。馆长拍着他肩膀说“老胖啊这笔钱交给你买套最牛的OCR系统把咱们那批明清契约全扫了。”大胖老师当时胸脯拍得震天响“您放一百个心市面上那么多成熟产品挑个最好的分分钟搞定。”然后他就带着小菜开启了一段堪比“双十一凑满减”的魔幻选型之旅。两个月后钱花了一半系统换了三套古籍一页没扫成。大胖老师在办公室对着天花板长叹“我当年追你师母都没这么费劲。”这就是“文渊慧典”立项前最重要的一课——市场调研不是看广告是看疗效。以下就是那些年我们踩过的坑和花过的冤枉钱。为了保护友商隐私以下产品名称一律用“某”代替请勿对号入座。如果硬要对号那……说的就是你。二、第一类选手国际大厂的“洋套餐”代表产品某国际知名PDF编辑器带OCR功能年费订阅制基础版1999美元/年起。大胖老师一开始的想法很朴素大厂嘛技术肯定过硬。于是果断下单下载安装界面确实高大上英文菜单、深色主题一股硅谷精英范儿扑面而来。小菜兴奋地把一页光绪年间的契约扫描件拖进去点击“识别文本”——进度条转啊转像极了爱情最后弹出结果。一看大胖老师的血压就上来了。原图竖排写着“立賣契人張大發因手頭拮据情愿將祖遺房產一處……”。识别结果“立青契人弓大因手头吉据情愿将祖遣房一……”。繁体“賣”成了“青”“張”成了“弓”“拮据”成了“吉据”“遺”成了“遣”。错字率高达40%而且所有文字全堆在一段竖排顺序彻底乱掉连标点都没有。大胖老师不死心又试了一页民国报纸上面有横排标题、竖排正文还带广告插图。结果系统直接报错“检测到多方向文本建议旋转页面后重试。”小菜气得直笑“它让我把每段文字都转成横向那我不是得先手工PS一遍我要这OCR有何用”更绝的是客服回复“尊敬的用户我们的中文OCR目前仅支持横排简体中文。竖排繁体中文属于小众需求暂未纳入开发路线图。”大胖老师当时就想把“小众”俩字打印出来贴满全国3000多家图书馆的大门。小菜总结教训“洋枪洋炮打不了中国功夫。这些国际大厂的产品底层训练数据99%是拉丁字母和横排英文中文支持就是个添头更别说竖排繁体。买它等于花两万块买了个只会说‘Hello’的翻译机你却指望它给你翻译《红楼梦》。”三、第二类选手国内AI云服务的“算费套餐”代表产品某国内大厂云OCR按调用量计费每千次识别8元版面分析另加5元表格识别再加10元。有了第一次的教训大胖老师把目光转向国内云服务商。心想着BAT出品总该懂中文吧于是又注册账号、充值、领新人优惠券一通操作猛如虎上传测试。这回竖排繁体倒是认出来了不少准确率大概在85%左右。但新问题来了钱。不是一次性买断是按调用次数收费。大胖老师拿出计算器一摁倒吸一口凉气。他们馆藏那批契约文书大约15万页。单页识别1次就是0.008元看起来不贵但注意古籍不是拍一张就完事的通常需要多角度补拍、局部放大、不同预处理下的多次识别择优。平均下来一页要调用3-5次才能拿到理想结果。再加上版面分析、表格识别、印章检测……每页综合成本轻松突破0.1元。15万页 × 0.1元 1.5万元。这只是单次处理。如果后续发现有漏扫、重扫或者需要调整参数重新识别每一次调用都在烧钱。大胖老师算了一下五年下来的总成本吓得保温杯都端不稳了“够给全系研究生发一年补助了”更要命的是数据安全问题。很多古籍是孤本版权归图书馆所有甚至涉密。把扫描件上传到商业云平台等于把自己的家底儿交给别人保管。大胖老师去咨询法务对方明确表示上传即授权出了数据泄露云服务商只赔你代金券。代金券小菜吐槽道“这跟火锅店吃出蟑螂赔张优惠券有啥区别”小总结“云OCR有技术但商业模式对图书馆不友好。计费方式像极了早年的手机流量——不用心疼一用就超超了就限速限速了更干不成活。而且古籍不是快消品它需要反复打磨不是一锤子买卖。按次计费就是钝刀子割肉疼得你不敢放手做。”四、第三类选手开源软件的“毛坯房套餐”代表产品Tesseract OCR OpenCV 自定义开发被商业软件伤透心后大胖老师决定回归极客本色“咱自己搞Tesseract是开源OCR鼻祖OpenCV是图像处理神器两个加一起齐活儿”小菜当时听了热血沸腾仿佛已经看到自己站上开发者大会的领奖台。接下来两个月才是噩梦的真正开始。首先Tesseract的官方中文模型是基于简体的繁体竖排需要自己训练。训练就要找数据集可公开的古籍标注数据凤毛麟角。他们东拼西凑了几千张图训练了三天三夜得到的新模型准确率不到70%比不打折的商业版还差。而且Tesseract对文本行检测很弱遇到竖排加双行夹注经常把两行当成一行或者干脆漏掉注文。其次版面分析得自己手写。大胖老师用OpenCV写了一套规则先用投影法找栏再用连通域找字块最后通过位置关系判断是正文还是注释。这套规则在测试集上表现不错可一上真实古籍瞬间被教做人——有的书页受潮卷边文字歪斜有的刻本字距不一投影法切得七零八落还有的稿本字迹潦草连通域算法直接把连笔字当成一块墨疙瘩。小菜一个月改了几百行if-else每次调整规则都像在打地鼠按住一处另一处又冒出来。最后他们终于搞出一个勉强能用的版本但速度奇慢一页要跑两三分钟而且换一本不同年代的书就得重新调参。大胖老师看着满屏的OpenCV代码自我解嘲“人家是‘代码即文档’咱们这是‘代码即玄学’。”沉痛教训“开源不是万能药。Tesseract OpenCV听起来像极客搭积木实际上相当于给你一堆水泥钢筋让你自己盖别墅。对于没有专业团队和大量训练数据的普通图书馆来说这条路的结局多半是烂尾。”五、第四类选手古籍专业公司的“高端定制”代表产品某古籍数字化公司全套解决方案软硬件一体报价80万起。走投无路之下大胖老师联系了业内一家专做古籍数字化的公司。对方非常专业派了三个售前工程师西装革履地来馆里演示。系统确实强大专用书稿扫描仪不拆卷、冷光源、自动翻页后台是定制OCR引擎支持异体字识别、印章提取、甚至句读。处理效果几近完美准确率95%以上。大胖老师心动了然后看到了报价单扫描仪48万软件授权30万年维护费5万总计首年83万。这还不包括驻场人员培训费和后期升级。馆长看了直接摆手“咱们全馆一年的购书经费才60万你这是要我们全体馆员喝西北风啊。”更麻烦的是这套系统是个黑箱模型不开源数据全走他们自己的服务器。相当于你花大价钱买了个“租界”——所有权归你但命脉在人家手里。以后想迁移数据想对接其他系统都得看对方脸色。万一这家公司倒闭或被收购巨资买的设备就是一堆废铁。小菜嘀咕道“这哪是买软件分明是请了个祖宗回家供着。”总结“高端定制效果惊艳价格也惊艳。对于国图、上图这样的顶级大馆或许合适但对于99%的市县图书馆这是另一个世界的童话。数字化的初衷是让古籍‘飞入寻常百姓家’如果门槛高到连图书馆都迈不进去那数字化本身就成了一种新的壁垒。”六、理想方案的雏形我们需要什么样的OCR经历了从洋到中、从商到开、从低端到高端的全链条打击后大胖老师和小菜精疲力尽地坐在实验室地板上周围散落着各种宣传册和测试报告。大胖老师忽然笑了起来“小菜你说咱是不是太矫情了又要马儿跑又要马儿不吃草。”小菜想了想认真地回答“不老师我们要的不是不吃草的马而是一匹适合自家草场的马。别人的马再壮吃的是精饲料咱喂不起。咱需要一匹能啃干草、走山路、还不挑食的土马。”“说得好”大胖老师一拍大腿“那咱们就捋一捋这匹‘土马’到底该长什么样。”两人在小白板上写下了“文渊慧典”最初的需求清单成本极低硬件用普通PC不依赖GPU软件用开源框架零授权费。总拥有成本控制在电费和网费以内。精度够高针对中文古籍尤其是竖排繁体、异体字、双行夹注准确率不低于90%且支持上下文自动纠错。部署简单一条命令安装一个网页界面操作不懂技术的馆员也能用。数据全部本地存储不外传。持续进化模型可随使用反馈不断优化社区可以贡献标注数据形成良性循环。尊重标准输出格式符合国际文献数字化标准如METS/ALTO方便未来对接其他系统。大胖老师盯着清单看了半天突然把笔一摔“这要求不就是让我们自己造吗”小菜点点头“准确说是站在巨人的肩膀上组装。2019年PaddleOCR发布2021年PPStructure加入版面分析2023年模型已经支持竖排繁体。这些开源组件就像现成的发动机、变速箱、轮胎。我们要做的就是针对古籍这个特殊路况调校悬挂、加装导航最后造一辆‘古籍越野车’。”“行就这么干省下的钱正好够给你们买枸杞的。”大胖老师端起保温杯眼中有光。七、调研结论不是天下无马而是需要识马的人回顾这段折腾大胖老师最后总结了几句扎心的话“市面上不是没有好技术而是这些技术要么被封装在昂贵的商业套餐里要么零散在开源社区需要高超的组装能力。图书馆缺的不是钱是‘信息差’——不知道什么工具适合自己不知道如何用低成本获得高精度。我们开发‘文渊慧典’本质上是填平这道鸿沟。让技术的归技术让文化的归文化中间那座桥我们来搭。”小菜把这句话写在了项目立项书的第一页。本文为注水技术版您看看即可不必当真写此文字就是图一乐-