大家好,我是言川
这两天摸鱼,在Threads上刷到一篇帖子,挺荒诞的。
去年有网友把一段高校通知丢进 AI detector 里测,结果显示:
100% AI GPT。
互联网段子照进现实了。一个学校发的通知,被检测器判成 100% AI。
但我笑完以后,又觉得这事有点刺眼。
如果连一段高校通知都能被判成 100% AI。
那一篇学生论文呢?
一份求职简历呢?
一篇公众号文章呢?
一个人认真写出来的东西,被一个工具甩出一个红色百分比,然后他要反过来解释:
这真的是我写的。
这个画面,才是这件事真正离谱的地方。
更有意思的是,这不是外网才有的段子。
国内这两年,毕业季也冒出一个很新的焦虑:论文 AI 率。
以前大家焦虑查重。
查重这个东西虽然也烦,但至少它还算有迹可循。哪句话和哪篇文章重复了,系统会给你指出来。你该补引用补引用,该改表述改表述,该删就删。
现在多了一种更玄的东西。
AI 率。
我看国内讨论,大家过审查各凭本事。
有人明明自己写的论文,被检测成 AI 生成。
AI写的没标红,纯手搓被标红了。
还有网友论文 AI 率 62%,于是找 AI 帮忙改得更像人写的,再测,直接冲到 100%。
看到100%的时候,真的有点绷不住。
你为了证明自己不是 AI,去找 AI 帮你降 AI 味。
结果 AI 告诉你:
恭喜,你更像 AI 了......
这事儿听起来像段子,但它已经变成了一套很现实的流程。
先检测。
再降 AI 率。
再检测。
再修改。
再检测。
学生夹在中间,越来越不知道自己到底在改论文,还是在揣摩机器脾气。
所以很多人最后只能走向一种很荒诞的写作训练:
把一篇自己写的东西,改得更不像自己写的。
太离谱了。
但其实很多朋友可能不知道,OpenAI 自己也做过 AI 文本检测器。
2023 年 1 月,OpenAI 发布过一个 AI Text Classifier,用来判断文本是不是 AI 写的。
听起来很权威,对吧。
但半年后,它下线了。
OpenAI 在页面上写得很直接:截至 2023 年 7 月 20 日,这个分类器因为准确率低,已经不可用了。
更尴尬的是,它当时公布过一组测试数据。
在一组英文测试文本里,这个分类器只能把 26% 的 AI 文本正确识别为可能由 AI 写成,同时会把 9% 的真人文本误判为 AI 写成。
OpenAI 自己也提醒过,这类工具不应该成为主要决策依据。
你看,连做模型的人都知道,这玩意不能拿来一锤定音。
但到了学校、平台、公司,它很容易就变成判官。
到了咱们市场上,甚至有了一门生意。
更关键的是,这种误判并不是平均落到每个人头上。
斯坦福等研究者在 Cell Patterns 上发过一篇文章,题目叫 GPT detectors are biased against non-native English writers。
他们测试了 7 个常用 GPT 检测器,样本里有 91 篇来自中文论坛的 TOEFL 作文,还有 88 篇美国八年级学生作文。
结果很刺眼。
非英语母语者写的 TOEFL 作文,平均误判率 61.3%。
有 19.78% 的真人 TOEFL 作文,被所有检测器一致判成 AI 写的。
更夸张的是,97.80% 的 TOEFL 作文,至少被一个检测器判成 AI。
一个学生很认真地写了一篇英文作文。因为他的表达更规整,词汇变化没那么花,句子更像考试训练出来的标准答案,检测器就更容易觉得:
这像 AI。
但这恰恰是大量非母语写作者的正常写法。
他们只是写的更像一个努力学过考试作文的人。
这个点特别刺眼。
因为它惩罚的可能不是作弊。
它惩罚的是一种普通人的写作状态。
不够文学,不够跳脱,不够松弛,只是努力把话讲清楚。
AI 检测器到底在检测什么?
它看不到你写作时查了哪些资料。
看不到你改了几版。
它能看到的,主要是最后那段文本。
然后根据文本特征去猜。
比如困惑度。
这个词听着很学术,但可以粗暴理解成:这段话让模型感到意外吗?
如果一句话非常常见、非常顺、非常容易预测,困惑度就低。
一些检测器看到低困惑度文本,就可能觉得它更像模型生成。
但问题在于,人类当然也会写低困惑度文本。
法律文本、公文、论文、考试作文、新闻稿、说明书,本来就追求稳定、清楚、规整。
你总不能要求一个毕业论文作者,为了证明自己是真人,写得像在朋友圈发疯。
Ars Technica 有篇文章讲过一个很有意思的例子。
有人把美国宪法放进 AI 检测器,工具可能会说它像 AI 写的。
当然,除非麦迪逊穿越到了 ChatGPT 时代,不然这个判断显然不成立。
为什么会这样?
因为美国宪法这种文本被无数次引用、学习、训练,它的语言模式太常见。
检测器看到这种高度熟悉的表达,就容易把它归到 AI 那边。
这件事讽刺就讽刺在这里。
经典文本,因为太经典,被判成 AI。
标准表达,因为太标准,被判成 AI。
认真写作,因为太认真,被判成 AI。
当然,我不是说学校、平台、公司完全不该管 AI 滥用。
这事儿确实要管。
如果一个学生整篇论文都让模型代写,自己不读、不查、不改、不理解,那当然有问题。
如果一个内容平台被批量生成的垃圾信息灌满,用户也会受不了。
如果一个员工拿 AI 糊弄工作,出了错以后没人负责,那也是麻烦。
我非常理解这种焦虑。
AI 让写作成本突然下降以后,很多旧规则都会失效。
过去写一篇像样的文章,需要阅读、训练、组织、修改。
现在一个 prompt 下去,几秒钟就能吐出一段看起来还不错的文字。
管理者当然会想找一个更快的工具。
用 AI 查 AI,听起来很合理。
但合理的需求,不代表现在的工具足够可靠。
Turnitin 自己在官方文章里也提醒过,false positive 指的是把完全由人写的文本误判成 AI 生成。
它们说自己努力把误判率控制在很低水平,但也承认误判风险不是零。
更关键的是,Turnitin 说自己不判定学术不端,它提供的是数据。教师还需要结合政策、学生情况和具体作业背景做专业判断。
所以这件事最后要落到哪里?
我觉得,不是简单骂 AI 检测器烂。
这太容易了。
真正该讨论的是:AI 时代的写作诚信,到底该怎么判断。
过去这个问题看起来比较简单。
这篇文章是不是你写的?
有没有抄?
有没有代写?
有没有引用不规范?
但以后会复杂很多。
你查资料用了 AI 吗?
你让 AI 帮你翻译了吗?
你让它润色了吗?
你有没有把 AI 给你的句子,当成自己的观点?
最终文本里的事实,你有没有重新核过?
别人追问你的判断时,你能不能讲清楚?
这些问题,检测器都回答不了。
它只能回答一个很粗糙的问题:
这段文本像不像它见过的 AI 文本。
但写作不是最后那一页纸。
写作是一串过程。
阅读、理解、判断、取舍、组织、表达、修改,这些东西加起来,才是一个人真正参与过的痕迹。
如果只盯着最后的 AI 率,其实就是把写作压扁。
压成一个数字。
然后用这个数字去怀疑一个人。
那普通人该怎么办?
我的建议很朴素。
第一,别把全部精力花在降 AI 率上。
如果一篇东西确实是你写的,最重要的不是把它改得更口语,或者故意加几个病句。那是在迎合机器。
你真正要保留的,是自己参与过的证据。
第二,写东西的时候,顺手留下过程。
写论文,就留下文献笔记、提纲、草稿、版本记录。
写报告,就留下数据来源、调研过程、修改痕迹。
写公众号,就留下选题来源、资料链接、自己的判断过程。
这些东西看起来麻烦。
但它们以后可能比一个漂亮的最终版本更重要。
第三,如果你用了 AI,尽量把边界讲清楚。
它帮你做了什么?
翻译?
润色?
整理资料?
生成初稿?
哪些内容你重新核过,哪些观点是你自己判断的?
这些边界越清楚,你越不需要把自己伪装成一个从来没碰过工具的人。
第四,尽量训练自己能解释。
别人问你这句话为什么这么写,你能说出来。
别人问你这个判断从哪里来,你能说出来。
别人问你为什么不用另一个结论,你也能说出来。
学校和公司也一样。
如果真的要用 AI 检测,我觉得至少要有几个底线。
提前讲清楚规则。
什么能用 AI,什么不能用,使用后要不要声明。
检测结果只能触发复核,不能直接定性。
必须允许申诉。
必须看过程材料。
必须让人解释自己的观点。
因为一个好规则,不应该逼所有认真写作的人,先跪到一个不透明的检测器面前,证明自己不是机器。
它应该鼓励人更诚实地使用工具,更完整地保留过程,更认真地对最终文本负责。
这才是 AI 时代写作诚信真正该走的方向。
如果以后我们真的要和 AI 一起写作,那我希望留下来的,不只是更会检测的系统。
还有更愿意追问、更愿意复核、更愿意相信过程的人。
不然到最后,被训练得最像机器的,可能不是文章。
是我们自己......










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。