学术动态

《中国社会科学报》刊发王云老师的理论文章

来源:语智学院 作者:编辑:郑周璇、杨沁儿时间:2026-06-10

6月5日,《中国社会科学报》语言学5版刊发了我校语智学院王云老师的理论文章《语言治理如何嵌入算法》。现将全文转载如下:

语言治理如何嵌入算法

王云

2025年12月27日,第十四届全国人民代表大会常务委员会第十九次会议通过新修订的《中华人民共和国国家通用语言文字法》,自2026年1月1日起施行。该法首次明确要求人工智能、语音合成、智能交互等信息技术产品使用国家通用语言文字必须符合规范。2026年3月,教育部、国家语委发布《机器合成普通话水平测评等级标准及测评大纲》和《人工智能 语料库 基础术语》两项规范,与新法协同推进语言文字的信息化、数字化、智能化建设。随着生成式人工智能和智能语音交互深度融入语言生活,一个关键问题愈发紧迫:作为抽象社会规范的法律条文,如何真正嵌入由数据与概率驱动的算法?这需要系统性转化才能实现。本文聚焦这一转化的技术路径与社会应用,探讨语言治理从被动纠偏转向主动塑造的实践逻辑。

技术内嵌:规范转化的三层架构。新法及配套规范将治理要求指向上游,但要使规范内化为算法的运行逻辑,需要完成从法律语言到技术语言的转化,将“应当如何”的规范性要求转化为数据规则、模型约束与应用功能,这一转化可以沿数据层、模型层和应用层逐级落地。一是数据层,将使用规范转化为可执行的数据筛选规则。大模型的语言能力取决于训练数据的质量,如果语料库中错漏频出,模型生成的语言必然失范。对此,需要在数据处理环节嵌入技术规则。可行的做法是引入“规范标注”,将文本分为“完全规范”“基本规范”“不规范”“待审核”四类,在训练时按类别设置不同权重,优先学习规范样本,对不规范样本进行降权或剔除。二是模型层,建立“语言学指标—技术参数”的双向映射,将语言学专家的质性判断转化为算法可优化的量化目标。以普通话为例,“声韵调准确度”可拆解为音素级声学特征阈值,“语流自然度”可细化为韵律参数范围,“用语规范性”可转化为词法、句法的合规率。在此基础上,可设计“规范评测模块”作为模型训练的反向约束。三是应用层,将规范引导转化为可感知的交互设计。智能终端、语音助手、公共服务平台等场景,需要嵌入“规范引导”机制。系统可以在用户输入不规范时实时提示并给出修改建议,对不同群体设置差异化的敏感度和提示频率,并通过积分、徽章等方式正向激励规范使用。当用户发音不准时,系统可即时显示波形图对比并播放标准音,将规范要求转化为直观可感知的参照。这样,数据层的规范标注、模型层的指标映射、应用层的交互引导,共同构成从输入到处理再到输出的完整转化链条。法律规范在链条各个环节找到技术落脚点,“文本条文”便可以动态转变为内化于系统的“算法逻辑”。

社会应用:从“被动纠偏”到“动态校准”的实践路径。传统语言治理往往依赖事后纠偏,如审查、监测、纠正,但这一模式在海量人工智能生成内容和即时人机交互面前已难以为继。从“被动纠偏”转向“事中塑造”进而走向“动态校准”,不仅是技术调整,更是治理范式的根本变革。规范落地的最终指向,是语言沟通的无障碍与公共服务的提质增效。在语言教学领域,已经有智能语音评测系统融入语文课堂的实践。学生跟读课文时,系统会实时分析发音准确度与语法规范性,将典型偏误以可视化方式呈现,并同步播放标准示范。这种即时反馈不仅将语言规范内化于学习过程,更在每一次交互中形成对规范边界的持续确认与细化。学生在完成日常学习任务的过程中自然接受规范训练,无需专门的语言纠正课,语言规范在无感中内化。数据反哺则构成语言治理的动态闭环。在政务服务领域,智能语音导航系统可以在提供政策咨询时嵌入规范引导模块:识别到用户表达中的高频不规范用语时,系统就会以友好方式提示并给出规范示例,同时脱敏记录这些交互数据。相关数据持续反馈至语料库和模型优化环节,形成“服务—纠偏—数据反馈—模型提升”的正向循环。这一闭环意味着,算法并非一次性接收规范指令,而是可以在使用反馈中不断重新校准何为规范。技术由此从静态的指令接受者转变为动态的语言治理共建者。

走向协同治理:多元主体的责任与边界意识。由于规范转化存在难以消除的损耗与盲区,语言治理嵌入算法需要政府、行业与公众协同发力,形成持续的外部校准机制。政府在制定国家标准的同时,可以建立分类评测、认证与退出机制。针对语音识别、机器翻译、智能写作等多样化的应用场景,应形成更加精细化的测评标准与动态认证体系。这些机制是对转化效果的制度化检视,以确保技术实现与规范本意不产生严重偏离。行业组织在贯彻国家标准的同时,可以在教育、医疗、金融等领域制定场景化标准,推动形成行业自律公约,开展技术交流,将语言规范切实内化为算法设计的刚性约束。高校和科研机构应推进交叉研究,培养复合型人才,建设更为开放规范的语料库,为行业提供核心支撑与人才储备。公众的每一次输入、每一次反馈,都在潜移默化地影响算法的学习方向。主动践行规范用语,对不规范内容进行标记纠错,积极传播规范用法,便是在为算法的规范转化提供鲜活、持续的校准信号。政府、行业、公众三位一体,从顶层设计到技术落地,再到公众践行与反馈,三者相辅相成,缺一不可。

综上所述,法律规范嵌入算法,并非条文与代码的简单对接,而是一个通过转化实现的动态过程。新法及配套规范奠定了数字时代语言治理的法治根基,而“嵌入算法”正是将此转化为技术实践的关键路径。法律规范的可操作部分内嵌为数据规则、模型约束与应用逻辑,并持续通过反馈回路进行校准,国家通用语言文字便真正成为优化沟通、提升社会运行效能的基础力量。算法在同法律与社会的持续对话中,成为承载语言规范、促进无障碍沟通的纽带。


中国社会科学网:

https://www.cssn.cn/skgz/bwyc/202606/t20260605_6016438.shtml