AI 发展方兴未艾,对 AI 的滥用亦如是。
AI 检测技术应运而生,对 AI 检测技术的滥用亦如是。
当 AI 出现在诸多其不应当出现之处, 人们试图通过各样手段来「侦测」AI 的不当使用, 这是刚需,也属正当。 但本文将要探讨的是这其中最广泛的, 甚至可能是我们每天正下意识使用的, 某些基于统计学规律的手段, 对人类,以及人类社群的优良生态所造成的伤害。
最近,我听到一位先生说:
你看,这份作业里中文和英文中间都有空格,我知道 AI 就喜欢这么加。这作业恐怕是直接从网页里复制来一个字都没改的。
我心想:好嘛,那我写了这么多年盘古之白,我成 AI 了呗。
但这显然也不能怪那位先生,盘古之白并非强制标准,他大概率并不知道这么一回事, 只是被用 AI 应付了事的学生们弄入了绝望境地。
稍加反思,其实这样的现象也很容易解释,AI 的语料库中包含大量技术社区的优秀文档, 而这些文档全部遵循开源社区的良好规范——盘古之白。 于是 AI 有样学样,越学越好,这本来是好事;没承想成了「区分 AI」用的抓手。
与之类似的还有所谓的「AI 味」,与饱受诟病的「AIGC 检测」。 由于 AI 的训练库中有太多的论文,尝试降低 AIGC 率的学生们最终陷入 「越像论文,越像 AI」的怪圈。
这样的事例越来越多,以致于我们不得不思考这样一件事: AI 的训练集本就包含了最高质量的人类写作内容,而且其被鼓励生成高质量的文章。 那么高质量文章的标准为何?
- 是遵循 W3C 规范使用盘古之白给文字增加呼吸感
- 是使用专业、正式的语言保持学术活动严肃性
- 是广泛使用 Markdown 格式增强文本可读性
但当这些良好习惯被 AI 习得,又反过来被人们用作区分 AI 的「特征」, 这只会最终驱逐真正优秀的文本,而这恰与我们识别 AI 的初衷背道而驰。
我由此呼吁,停止滥用统计学特征进行 AI 识别,无论使用算法或肉眼。 我们不能因为 AI 生成的东西「好」,就把「好东西」全部当成是 AI。 识别 AI 固然是刚需,但一竿子打翻一船人,对于倡导高质量文本无疑贻害更重!