今天发现北京大学-字节跳动数字人文开放实验室 共同搭建的平台 识典古籍
可以自己创建古籍整理项目
不知和书格是什么关系
在说哪个网站?
何以见得和书格有关系?也许用了从书格下载的古籍?那不见得就有关系。
书格,www.shuge.com这是个非营利性宣扬中华传统文化的网站
供参考。
数字化,让古籍触手可及
人民日报,10-1-2024
(略)
自2022年10月上线以来,“识典古籍”平台已陆续汇集经、史、子、集等2200余部古籍,面向海内外读者免费开放。该平台由北京大学与抖音合作共建,致力于为用户提供免费、公开、稳定、快速、方便的检索和阅读古籍服务。
(略)
一本古籍,如何从纸页“搬”到网页?
进入“识典古籍”平台,平台设计者、北京大学人工智能研究院副研究员杨浩开始演示:“古籍的数字化分为两步。一是图像化,我们与海内外古籍收藏单位合作,广泛收集古籍数字化图像资料。二是文本化,利用人工智能技术对古籍文字进行识别、排序、校对、结构整理、标点、实体识别等,对内容作精细化处理。”
杨浩上传了一页古籍图像,不一会儿,文字自动识别处理完成。古籍图像上显现出不同颜色的小方框,“每个方框对应一个文字,先切分再调整顺序。红色方框是提醒此处需要人工介入,来进一步判断和处理。”
与此同时,古籍图像旁已自动识别出一段文字,并可比照原图像进行修改调整。杨浩继续解释:“这个过程中,主要使用了文字识别、自动标点和命名实体识别等人工智能技术。文字识别技术,是对古籍数字图像中的文字进行单个切分,再进行文字识别和顺序读出;自动标点技术,是通过序列标注的方式对古籍自动进行现代标点;命名实体识别技术,则是通过序列标注方法识别出文本中的人名、地名、书名、时间、官职等信息。”同时,在机器自动识别后,会有专人复查结果,进一步提升准确率。
据悉,“识典古籍”平台文字识别的准确率达到96%以上,自动句读的准确率达到94%,命名实体识别在中古史料上的准确率接近98%。
(略)
集纳展示古籍数字版本,不是“识典古籍”平台的全部。团队有着更大的设想——在一个平台实现古籍智能整理的全部环节。
“‘识典古籍’平台由两部分组成,前端是阅读平台,后端是古籍整理平台。”王军作了一个比喻,“就像是餐厅的前厅和后厨。”
目前,作为“后厨”的古籍整理平台,已经设定了团队管理员、书目管理员、审订员、整理员等各种用户角色。下一步,将吸引各行各业的古籍爱好者、研究者,以众包校对、协同审核等形式,推进古籍整理项目和数据库建设,打造“古籍图像上传—文本校对整理—高质量标记—文本输出”的全流程系统。
(略)
哈尔滨师范大学历史文化学院学生刘钰昕,提前体验了一回“整理员”角色。
“希望能为损毁严重的古籍做点力所能及的事情。”2022年4月,看到北大数字人文研究中心的招募信息,刘钰昕第一时间报名,成为“识典古籍”平台的一名志愿者。
“我参与了《春秋左传注》《史记》《汉书》等古籍的校对工作。”谈及志愿工作,刘钰昕的热爱之情溢于言表,“印象最深的就是,为了制定魏晋南北朝官职标注规则,我查阅了大量的文献,还详细翻阅了《文献通考》的‘职官考’二十一考。”
(略)