《大话文渊慧典》:外三篇-欧洲用AI重建古罗马,我们还在为竖排发愁:差距与底气都在哪里?

——小菜:“大胖老师,我昨天刷到一个新闻,说欧洲用AI把整个古罗马城都重建出来了,连哪条街上有几家面包房都一清二楚。再看看咱们,还在纠结一页古籍能不能认全。这差距是不是有点大?”

——二黑推了推眼镜,从手机里翻出一篇论文摘要:“你说的是‘欧洲时间机器’项目。他们用深度学习分析古罗马的建筑遗迹、铭文、地图,重建了公元四世纪罗马城的三维模型。预算两亿欧元,干了快十年。”

——大胖老师端起保温杯,吹了吹热气:“两亿欧元,十年。咱们的预算呢?零。干了多久?三年。团队呢?仨人加一群贴膏药的研究生。你拿这个跟人家比,就好比拿三轮车比高铁——不是不能比,是比的维度不对。” ——小菜不服气:“但人家确实牛啊。咱们就不能也搞点高大上的?”

——二黑合上手机:“高大上的背后是什么?是人家花了二十年把古籍OCR的基础问题先解决了,才有余力去搞三维重建、知识图谱。我们呢?连竖排都还没搞利索。这不是谁聪明谁笨的问题,是发展阶段不同。但要说底气,我们也有——而且是欧洲人羡慕不来的那种。”

一、欧洲的“天花板”:标准、联盟与千年古城

大胖老师在白板上贴了一张欧洲地图,上面标注了“Europeana”“时间机器”“大英图书馆”等项目的位置。

“欧洲在古籍数字化上,强在三个字:标准化。他们搞了一套元数据规范——Dublin Core、METS、ALTO——精细到每一页、每一行、每一个字的坐标都能结构化存储。全欧洲几千家图书馆和文化机构用同一套标准描述数字资源,跨库检索丝般顺滑。这是他们最厉害的地方。”

“时间机器项目更是雄心勃勃,”二黑调出一段项目介绍,“不仅扫描古籍,还用AI把古地图和历史文献里的地名、建筑、人物关系自动抽取出来,构建一个跨越千年的欧洲历史地理信息系统。他们现在能在数字世界里重建古罗马城、中世纪威尼斯、文艺复兴时期的佛罗伦萨。点一下某个建筑,能跳出所有相关文献记载。这种知识图谱级别的东西,我们的确还做不到。”

小菜听得眼睛发直:“这不就是咱们的终极梦想吗?”

大胖老师点头:“是。但你要看清楚他们为什么能做到。第一,拉丁字母的OCR技术已经成熟了几十年,他们不用为‘竖排横排’‘己和已’这种问题发愁。第二,欧洲各国的古籍数字化起步比我们早了至少二十年,数据积累雄厚。第三,他们有欧盟层面的持续资金支持——不是一次性项目经费,而是列入长期预算的基础设施投资。”

“但我们也有他们眼红的东西。”二黑话锋一转,“我去年在一个国际会议上,听一位德国教授抱怨:他们想训练一个中世纪拉丁文手稿的OCR模型,但公开的标注数据只有几千页,而且分散在十几个国家,版权和隐私限制让数据整合几乎不可能。他听说我们有五千页金标古籍数据、而且愿意全部开源时,眼珠子都快瞪出来了。他说了一句话我至今记得:‘你们中国人,是真的愿意把好东西拿出来共享。’”

二、我们的差距:不是技术,是“时间债”

大胖老师在白板上画了一条时间轴,从2000年延伸到2026年。

“说回差距。欧洲和美国大规模启动古籍数字化是在2000年左右。谷歌图书计划2004年开始,哈佛燕京从2000年就批量扫描馆藏。我们呢?国图大规模扫描是2012年以后的事。这中间的十几二十年,人家不仅积累了海量的扫描数据,更重要的是积累了一整套工作流——怎么扫描、怎么元数据著录、怎么质量检查、怎么上网发布。我们到2020年还在争论‘要不要做OCR’,人家已经在做知识图谱了。”

“这就是‘时间债’。”二黑补充,“就像两个人跑步,人家提前跑了二十分钟,你后面跑得再快,也不可能马上追上。而且时间债不仅是时间差,还包括:人才培养滞后——既懂古籍又懂深度学习的人,全中国可能不超过三位数;标准建设滞后——我们直到近几年才推出古籍数字化元数据国家标准;经费结构失衡——钱大多花在扫描硬件上,投给OCR技术研发的很少。”

小菜有点沮丧:“那咱们岂不是永远追不上?”

大胖老师摇头:“追不上,不代表不能另辟蹊径。移动支付我们没走信用卡阶段,直接跳到扫码支付,现在全球领先。古籍OCR,我们也有机会走一条不同的路——不是砸钱,不是封闭,不是手工作坊,而是用开源协作的方式,用最轻量的技术栈,覆盖最广大的基层需求。”

三、我们的底气:数据、场景、开源社区

二黑站起来,在白板的另一侧写下了三个词:数据、场景、社区。

“先说数据。”他打开一张图表,“中国大陆现存古籍约三千万册。这是什么概念?哈佛燕京号称北美最大的东亚图书馆,中文古籍也就六十万册。整个欧洲的中文古籍加起来,可能还不如我们一个省馆。我们的数据资源是全世界任何国家都比不了的。虽然目前标注数据还不多,但数据源天然是我们的。只要标注工具和激励机制跟上来,我们在数据规模上碾压全球只是时间问题。”

“再说场景。”大胖老师接过话,“从国图到县馆,从学者到民间爱好者,中国对古籍数字化的需求是全世界最旺盛、最多元的。欧洲一个数字人文项目可能只需要满足几百个学者的学术需求,我们要满足的是几千万普通读者、几十万研究者、几千家图书馆。这种海量场景的驱动,会倒逼我们做出更实用、更普惠的技术。”

“第三个是社区。”二黑打开GitHub页面,“PaddleOCR在GitHub上的Star数已经超过了绝大多数国际OCR开源项目,中文模型的能力全球领先。虽然针对古籍的优化还有待提升,但基础模型的迭代速度是全世界最快的。更重要的是,中国的开源社区有一种独特的活力——民间开发者愿意为‘没用但有趣’的事情花时间。那个用PaddleOCR做家谱识别的深圳程序员,那个用Tesseract硬怼竖排的大学新生,那些在‘吾与点’平台上义务校对的大爷大妈——这种自下而上的热情,是比算力和经费更宝贵的资源。”

四、一张表说清楚:差距与底气

大胖老师画了一张对比表,投在屏幕上:

维度欧洲/美国中国我们的底气
起步时间2000年左右2012年左右后发优势,可以直接用最新技术
数据存量有限(中文古籍少)海量(三千万册)全球最大的中文古籍数据源
标准化程度极高正在追赶后发可以直接对标最新国际标准
资金投入持续且充裕断层且不均轻量化方案降低了对资金的依赖
人才储备图情+AI复合人才较多极度稀缺开源社区降低了技术门槛
核心痛点多语种、手写体竖排、繁体、异体我们的痛点最痛,解决后的收益也最大
技术路线封闭+商业为主开源+社区协作社区活力全球领先
需求规模学术驱动,相对小众全民需求,海量长尾场景倒逼技术迭代

“看懂了没?”大胖老师敲着表格,“表面上看我们落后一大截,但换个角度看,我们的优势全在‘规模’二字——数据规模、需求规模、社区规模。这些规模优势一旦被激活,产生的加速度是任何先发国家都比不了的。”

五、殊途同归:欧洲重建古罗马,我们重建古中国

二黑忽然想起什么,调出一张图片——那是“时间机器”项目的三维重建截图,古罗马斗兽场和元老院的数字模型栩栩如生。

“其实欧洲重建古罗马,和我们用OCR识别古籍,本质上是同一件事——把散落在故纸堆里的文明碎片,拼回原来的样子。只是他们拼的是建筑和街道,我们拼的是文字和句子。他们用三维建模和知识图谱,我们用版面分析和文字识别。工具不同,目标一致。”

大胖老师点头:“而且,他们的古罗马重建之所以能做得那么漂亮,前提是把拉丁文古籍的OCR问题先解决了。没有准确的文本识别,那些古地图上的地名、建筑名、历史事件就提取不出来。我们也是——不把竖排繁体搞定,后面的知识图谱、三维重建就无从谈起。我们现在做的事,是铺路。路铺好了,以后的‘数字重建古长安’‘数字复原宋代苏州’,就是水到渠成。”

小菜若有所思:“所以,我们不是在为竖排发愁,而是在为以后的‘数字复原中华文明’打地基?”

“对。”二黑推了推眼镜,“而且我们的地基,必须比欧洲的更宽、更厚、更能承重。因为中华文明的时间跨度和空间广度,比古罗马大得多。他们重建一个城邦,我们要重建一个天下。这不是自卑的理由,这是终极的野心。”

六、尾声:差距是刻度,不是判决书

文章快结束时,大胖老师分享了一件最近的事。

“上周我接待了一个从法国来的访问学者。她研究的是敦煌文献,特别羡慕我们能直接到敦煌去看原件。她说,你们有那么多的古籍,那么完整的文明记录,简直是数字人文研究者的天堂。我当时就想,对,我们有全世界最丰富的历史文献遗产,这不是我们的负担,是我们的矿藏。现在矿藏还埋在地下,但已经有人在打井了。”

他在白板上写了最后一句话:

“差距不是判决书,是刻度。它告诉你现在站在哪里,不是决定你最终能走到哪里。”

二黑补充:“欧洲用AI重建古罗马,我们还在为竖排发愁。但没关系。他们用了二十年,我们可以用十年。他们花了两亿欧元,我们可以用开源社区的力量做到同等量级。他们的优势是早,我们的优势是多。多到如果我们做成了,将是对全世界文明的贡献。”

窗外,夕阳正好。小菜在笔记本上写道:“欧洲有重建罗马的雄心,我们有重现汉唐的底气。差距不是墙,是路。我们在路上。”他给这篇笔记配了一个标题,就叫《差距与底气》。

大胖老师的保温杯里,今天泡的是王姐刚寄来的新茶。他喝了一口,忽然说:“二黑,下一期,咱们聊聊那些年我们花过的冤枉钱吧。踩过的坑,不给后来人看清楚,等于白踩了。”

二黑从抽屉里掏出那本《文渊慧典填坑日志》:“已经整理好了,随时可以讲。”

窗外,图书馆的灯次第亮起。实验室的白板上,那张对比表旁边,又多了一张“全球古籍数字化起步时间图”。小菜在图下写了一行小字:早行的有早行的风景,晚到的有晚到的从容。只要在路上,就永远不晚。

本文为注水技术版,您看看即可,不必当真,写此文字就是图一乐:-)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值