标签

汉字与信息技术、人工智能的百年交织

发布时间:2026-08-13 10:03阅读:3

曾想动笔却未成文的,是想评点一下某公号文章《西方专家:中国又打破"不可能",让汉字进入电脑他们用了100年》,可惜原文已被作者删除,原因不明;幸而通过百度检索得以寻获,见文末"原文链接"。文章主要阐述的是汉字计算机输入法的演进历程。【王选借助数学公式将汉字压缩五百倍,王永民使键盘能够"吐出"每分钟一百三十余字——这不仅是技术的凯旋,更是文明的反攻】,并将历史追溯至百年前五四先驱所喊出的口号"不废汉字,必亡其种",在【被"机械文明"放逐的一个世纪】这一标题下还谈及中文与西方打字机的渊源。由此可见,汉字与所谓"现代化"之间经历了百年的纠葛历程。当然文章核心仍聚焦于王选、王码等人物与成果,即汉字与计算机之间的复杂关系。末尾还论及当下炙手可热的AI大语言模型。

今日又偶遇公号佳作【经典回顾】中文分词兴衰录:从NLP首要难题到大模型的降维出击,阐述的恰是中文与人工智能之间的交织历程。此前也接触过一些关于中文在AI大语言模型中具备"优势"的论调,其中不少言过其实,而这篇公号文章则展开了系统性的历史梳理,撷取若干要点如下:

"引子"部分援引一位外籍人士之语:"为何中文不像英文那般在词语之间留有空格?"

一、古典时期:规则之困(1980s-1990s):英文等拼音文字的单词之间本就有空格分隔,中文则付之阙如,如何"切分词语"让计算机识别成为一大难题,何况1980s前后将中文输入计算机本身就困难重重。

二、统计时期:概率之刃(2000s-2010s):计算机自然语言处理技术迅猛发展,并从"规则驱动"过渡到"数据驱动",【中文分词的精确率一举跨越97%的门槛。机器不再"揣测"结构,而是"推算"出最贴近人类认知的路径】

三、深度学习时期:表征之革(2015-2020):【2013年Word2Vec的诞生,拉开了NLP深度学习时代的大幕】,思路从"分词"转向"表征",【传统分词是把文本切碎为离散的单元,而深度学习则将每个字投射至高维空间的稠密向量(Embedding)】【模型能够从正反两个方向同时捕获上下文语义,精确率进一步攀升至98%以上。】继而,【NLP研究者开始叩问一个根本性的命题:分词果真是不可或缺的吗?】

四、大模型时期:边界消弭(2020至今):【GPT、BERT等预训练语言模型的惊艳登场,彻底颠覆了既有格局】【Transformer架构最核心的自注意力机制(Self-Attention),使模型中的每个字都能直接"感知"所有其他字。】Tokenizer仍被称作"分词器",然而【Token仅仅是计算单元,并非语言单元】或者说并非语法、语义单元,对自然语言的识别已彻底通过"运算"来完成:【分词不再是不可或缺的预处理步骤。它从NLP流水线的"首道工序"中隐退,化作模型内部隐式运算的有机部分。】

五、中文的反攻:高密度语言的"大模型馈赠"【在大模型时代,中文这种"以适度精确度换取更高信息密度"的语言体系……反而更具优势】

六、尾声:退场的工序,演进中的智慧,勾勒出中文分词四十年的演变脉络【1.规则时期:人类试图教导机器"语法"→ 受挫;2.统计时期:人类令机器"算概率"→ 逼近人类;3.深度时期:模型自主"学表征"→ 超越人类规则;4.大模型时期:分词"功成身退",融入模型血脉。】

【有外籍人士不禁喟叹:"中文读者品读的并非单字,而是上下文。这种能力实属奢侈。"如今,大模型凭借千亿参数与万亿级语料,也习得了这种"奢侈"的本领。】

结论是:【中文分词作为一个独立技术领域正在"淡出",然而这种淡出本身,恰恰是NLP迈向真正"理解"的里程碑】——中文之于AI的意义,自然不止于其作为一种民族自然语言的独特性!

以上主要是从"分词"视角梳理了中文与计算机、AI四十年的交织历程。作为一名曾经的中国古代文学研究者,我个人在"分词"之外还联想到标点符号,当年为了搜集原始典籍,我涉猎了不少没有标点符号即古人所谓"句读"的古代文献,起初颇感艰涩,但读多了,"句读"的本领便自然而然地精进了——我个人大脑的这一训练历程,恰如今日AI大语言模型的"预训练"过程。

万事万物皆蕴含某种"道",语言符号与AI机器概莫能外。而"道"绝非某种终极的"顶点",即AI研究中所谓的"奇点","道"乃是一个历史展开的过程,人对"道"的领悟也随之在历史中展开而具备"历史性"——中文与所谓现代化的百年纠葛、中文与计算机、AI约四十年的纠葛,同样鲜明地昭示了此理!对AI、对中文的判断,对世间万物的判断,一旦脱离历史性,就必然滑向反科学的泥潭……