标签

AI技术有望激活少数民族古籍中的文化基因

发布时间:2026-08-09 14:10阅读:1

图① 云南丽江白沙古镇古建群围墙上的东巴文壁画。

图② 中央民族大学民族博物馆展出的东巴文手抄本。

图③ 中国文字博物馆展厅内展示的丽江东巴文化学校教材及纳西象形文字。视觉中国供图

现在,让你画一个小人,你脑海中浮现的第一个形象是不是"火柴人"?一个圆代表脑袋,一条竖线代表身躯,四条斜线代表四肢……恭喜你,你写出了纳西族东巴文里的"人"字。

东巴文形体多变、语法自由,被赞誉为探究人类文字诞生与书写体系发展的"活化石"。然而当下,由于精通者稀少、典籍存量巨大、部分字符已退出日常使用,大量东巴文、古彝文、水书、回鹘文等民族文字典籍陷入无人通晓的窘境,海内外众多古籍文献长期无人问津。

今年7月,《中华人民共和国民族团结进步促进法》正式落地施行,清晰指出要推进少数民族语言文字的规范化、标准化与信息化建设,助力少数民族古籍的保护、梳理、研究与开发。面对我国多姿多彩的多民族语言文字保护难题,如何挖掘民族古籍中各民族交往交流交融的历史痕迹?人工智能技术或许能开辟全新的解决路径。

大量少数民族文字难以直接翻译

假设摊开一卷无人破译的东巴文古籍,我们能否像解读汉字古籍那样将其内容完整释读出来?

答案是否定的。"很多民族文字无法逐字直译。文字搭配规则、上下文省略现象、非线性排列方式,都会显著加大整体语义的理解门槛。通俗地讲,即便认识单个字符,也难以把握整句乃至整段的意思。"中央民族大学信息工程学院教授、民族语言智能分析与安全治理教育部重点实验室主任毕晓君解释道。

文化消逝并非转瞬之间,但它当下确实在发生。全球现存东巴文古籍超过3万卷,其中至少有1.4万卷封存在海外图书馆,无人问津;水书是水族独有的文字,主要在贵州省黔南州流通,当地保存的水书典籍原件共1.9万余册,可到了2022年,建档在册能读懂水书的人只剩466位;在被称为彝族毕摩之乡的四川省美姑县,能读懂古彝文的人不到2000人,其中高水平研究者不足20人……

"假如我们无力解读这些民族古籍文献,未来本属于我们自己的文化话语权,就只能拱手相让。"在人工智能领域深耕近二十年的毕晓君,期待自己的团队能借助人工智能技术推动少数民族文字古籍的辨识、修复、释读与翻译工作。

"语言学家精于文本研读与文化考据,而我们作为技术研发人员,可通过与语言学专家的深入协作,获取优质的语言数据来训练AI模型。如此一来,机器就能读懂、识别民族文字。"毕晓君对科技日报记者表示,在民族文字保护利用中,人文研究贡献了问题意识、文献支撑与阐释体系,而人工智能则贡献了图像修复、文字识别与机器翻译等技术工具。两者互为补充,深度交织。

突破低资源语言处理技术瓶颈

要读懂古籍,首先得读懂文字。要让人工智能识字,高品质、标准化的数据集不可或缺。尽管预训练技术在汉语、英语等主流语言领域已相当成熟,但全球现存的7000余种语言中,超过6500种语言与东巴文类似,普遍面临可用数据稀缺、标注语料不足、专用处理工具空白等困境。这类语言被归为低资源语言,其智能处理技术长期停滞不前。

"从零起步搭建数据集,遭遇文字形态高度雷同与文本保存状况不佳的双重难题。"课题组成员、山西电子科技学院信息与通信工程学院讲师骆彦龙表示。

一方面,民族古籍中包含众多字形高度相近的字符。如何构建具备强大局部特征提取能力的网络模型,同时完整保留全局语义信息,提高文字整体识别准确率,是一项共性技术挑战。另一方面,诸多古籍年代久远,部分书写载体为树皮纸、树叶纸,普遍存在文字残缺、画面模糊、页面破损等状况,亟需修复优化。

对此,课题组结合东巴文别具一格的书写特点,组织学生仿写标准化东巴文字典,搭建了大规模单字数据集,同时借助图像预处理技术提升数据质量,使东巴文单字识别精度大幅提高。在古籍图像修复方面,课题组先对残缺文字实施初步粗修复,再从自建的标准字库中匹配候选字符,结合上下文语义交叉核验,明显改善了修复结果的准确度与可信度。

2023年,课题组面向社会公开发布手写东巴文单字数据集DB1404。该数据集涵盖44.5万张东巴文单字图像,覆盖2546个东巴基础单字。依托该数据集,课题组搭建了东巴文智能分析管理系统。目前,该系统的文字识别准确率达到99.34%,已有35家高校、科研单位申请使用。

单字识别解决了,人工智能如何理解句子?民族古籍智能分析不能止步于"认字"层面,必须进一步攻克语义理解和机器翻译难关。

东巴文长期被视为一种语法松散、语义模糊的文字体系,没有标点符号,缺乏清晰的句式、句型和词组,甚至没有固定的阅读顺序,句子中常常出现指代和省略现象。"比如,你去那边,找那位,拿那个,这些代称可能分散在上下文的不同句子里,单看一句话是读不懂的。"中央民族大学博士生孙梓玮说。

破解之道依旧是数据先行。围绕语义理解,课题组成员、清华大学计算机系博士后李硕等人搭建了多民族古籍平行语料库。团队通过数据标注获取18.9万条东巴古籍平行句对,包含东巴单字146.9万字,完成段落级、句子级和单字级的多层标注,构建起可支撑机器翻译和内容挖掘的语料资源。

数据体系搭建完毕后,如何让人工智能输出通顺、精准的汉语译文,成为新的技术难关。随着人工智能自然语言处理技术的快速演进,2025年12月,李硕等人依托多模态大模型,通过引入段落级语义增强、智能句子组合策略、自定义文本分隔符设计,使东巴文智能分析管理系统对东巴文的翻译效果大幅改善。

这一研究思路也为其他低资源语言或古文字材料的研究提供了可参照的方法路径。目前,古彝文、水书、满文、回鹘文等多民族文字古籍的智能分析研究均在有序推进。中央民族大学博士韩璐牵头搭建的大型水书单字数据集S_842已面向社会公开发布。

为民族文化研究搭建技术平台

人工智能不仅能守护民族古籍,更为民族文化研究带来了全新手段。

国际学界对东巴文究竟属于单纯符号体系还是成熟文字系统长期争论不休。课题组在研究中提出一个新视角:东巴文到底是本身不存在固定词组体系,还是传统人工研究未能发掘出对应的词组规律?

"我们通过数据挖掘,从东巴文古籍中筛选出一批稳定出现、语义一致的词组。比如,'日'和'桶'稳定表示'东方'的含义,'绿松石'和'月'稳定表示'灵魂'的含义,这些由两个或多个字组成的词组在东巴文古籍中反复现身,其语义并非两个单字意义的简单拼合。"中央民族大学信息工程学院讲师乔伟征介绍道,这意味着早在千年前,纳西先民就已通过象形符号的组合,建立起文字与语言系统规范、稳定的对应关系,能够借助字符组合表达复杂抽象概念。

该研究结论为界定东巴文的成熟文字系统属性提供了关键实证,有力回应了国际学界的长期争论,为人类文字起源和书写演化研究补充了新的证据。

我国民族众多、语言多样、文字丰富。千百年来,各民族一体同心,共同铸就了辉煌的中华文化。55个少数民族中,除回族、满族通用汉语外,其余53个民族共使用28种文字和72种语言,其中22个民族拥有自己的文字。

各民族运用本民族的语言文字,留下了浩如烟海的古籍文献。中华民族多元一体的发展历程,不仅镌刻在"二十四史"等汉文古籍中,也记载于《西南彝志》等少数民族古籍里。国务院公布的六批《国家珍贵古籍名录》中,共收录少数民族古籍1133部。

这些珍贵古籍承载着各民族对自然、宇宙、人文社会的古老认知,记录着各民族共同开拓辽阔疆域、交往交流交融的发展轨迹,是构筑中华民族共有精神家园的重要文化资源。

随着数据集和语料库的持续完善,相关研究正在从文字识别和机器翻译进一步迈向内容理解、知识挖掘与文明探究,大量尘封在海内外馆藏机构、长期未被释读的民族古籍,重新进入学术研究视野。同时,这套低资源语言处理策略,已逐步推广至缅甸语、泰语等南亚东南亚语言研究,为跨境经贸合作、人文交流互通、跨国文化研究架起技术桥梁。

"开展多民族古籍文献智能分析与机器翻译研究,不仅是AI技术在低资源语言场景中的应用探索,让沉睡的民族古籍可读、可研、可用,更是数智时代守护、激活和阐释中华民族文化遗产,铸牢中华民族共同体意识的关键路径。"毕晓君如此表示。(记者 陈可轩)