随着毕业季的到来,高校正面临毕业生论文中“AI 味”过浓的新挑战。除了传统的查重、盲审和答辩,今年的毕业生在提交论文时,还需通过一道新的审核环节——AIGC 检测,即人工智能生成内容检测。
例如,一名毕业生发现其论文的 AI 生成内容比例为 62%,远超学校设定的 15% 的警戒线。在尝试使用大模型输入“请帮我修改这篇论文,使其更像人类撰写”后,再次检测发现 AI 率竟飙升至 94%。这种现象并非孤例,近期已有不少毕业生遭遇类似情况。
央视新闻近期就论文 AI 率的检测原理进行了介绍。首都师范大学教育学院副院长蔡海龙解释道,传统的查重是通过将论文语句与语料库进行比对,以确定语句的重复性并作出确定性判断。而 AI 检测则是利用 AI 系统来识别人类文本,考察其在语意和表达风格上是否与 AI 写作存在重叠,其本质上是一种基于概率的分类,而非基于证据的确定性判断。
当前 AI 检测技术面临的核心瓶颈在于,我们正“用 AI 来检测 AI”,这使得区分文本是由人类作者还是 AI 生成变得困难,也无法提供明确的解释或说明,这构成了技术上最关键的障碍。
此外,中文语言表达的另一特点是语意和语句表达方式极其丰富,这给人工智能系统在检测人类作者所撰写的语句时带来了诸多歧义,增加了难度和降低了准确率,进而成为导致误判的重要原因。
鉴于 AI 率检测目前尚无法做到十分精确,教育界人士建议,在论文审核过程中,应建立透明且可追溯的 AI 使用标注制度,而非简单地设定 AI 率的“红线”。在判定机制上,应确立以人工评审为主、AI 检测为辅的“人机共判”模式。
目前,许多高校在学生论文中设置了“AI 率”检测的警戒线,但不少学生反映,学校的论文 AI 率检查依赖于指定的检测平台和算法模型分析。
通常情况下,主流高校多采用知网、维普、万方等系统的 AIGC 检测模块。央视记者就“AI 大模型如何检测一篇文章有多少内容由 AI 生成”这一问题咨询了多个大模型,总结其回答,核心是通过“困惑度与突发性”等特征进行判断。AI 生成的文本往往“更平滑”,而人类文本的波动性更大。
大模型解释称,困惑度是指文本的“可预测性”,越是充满人类特有的、出人意料的、打破常规的表达,就越像人类。突发性则指文本节奏的波动——人类写作如同心电图般起伏,而 AI 输出则趋于平稳,像一条直线。那么,这样的判断是否准确?
对此,专家指出,除了困惑度、突发性等指标,AI 文本生成是基于预测下一个最有可能出现的词的概率来逐步生成的,这可以理解为一种概率统计。因此,目前对 AI 生成内容的检测准确性无法达到 100%,误判的情况也时有发生。
