去掉 AI 味,
别把作者也删了
写作 Skill 有用吗?AI 进 AI 出会不会退化?
王佩 · 写作者与写作教师
开场先把三个问题摆出来:Skill 能清掉什么,AI 改 AI 会不会退化,学生该不该先自己改。今天先不讨论检测器能不能抓出一篇文章,我更关心稿子里还有多少决定是作者自己做的。
先看一句很顺的话
在快速变化的时代,我们需要重新思考写作的意义。
这篇文章到底要说清哪一件事?
第二句没有替作者回答,只把需要作者做的决定指出来。
这两句是构造示例,没有摘自某篇文章。第一句语法没错,也没有明显禁词;问题是它没有告诉我作者正在写什么。第二句只把写作任务落到一件可回答的事上,仍然要由作者补材料。
这里可以问听众:第一句少了什么?可以看题目、对象和判断,这些信息会把句子带到具体任务上。
AI 味是一组语言习惯
它常出现在文章已经说完以后,
又把同一个意思说了一遍。
也可能是顺滑的过渡、空泛的细节,或替读者解释刚发生的事。
“AI 味”是读者对一组语言习惯的称呼。常见感受包括:每段都收得很完整,事实后面又跟一遍总结,情绪被作者直接命名,细节看起来像真的却没有出处。
人写的文章也会有这些习惯。它们适合做稿件检查线索,无法单独识别作者或文本。
闻到味,先别急着擦
把气味当提示灯,不当作者鉴定器。
一个重要视角是:把 AI 味当作写作诊断信号。遇到空泛判断、可替换的细节或套话,先问自己有没有想清材料和意思,再决定是否改句子。
这只是提醒,不是定论。作者可能早已想清楚,只是用了常见说法;“AI 味”和“还没做决定”之间的关系目前没有被直接测量。
四层问题,分开看
把“去 AI 味”分层,很多争论会变简单。词句可以按明确规则清理;结构要看安排是否合适;材料需要核实;取舍和判断由作者负责。清理词句,不会让材料更真,也不会自动让结构更好。
规则越明确,越容易检查
能核对的要求
删掉重复总结;保留原有事实;不替作者补经历。
需要作者再说明
写得有人味;更有灵气;像我,但又不像 AI。
把“去 AI 味”改写成三个具体问题:哪句多余?哪里缺证据?哪个判断还没决定?
清单能稳定执行的,通常是边界明确的动作:删指定套话、找重复、保留原句、不能新增事实。要求“自然一点”缺少共同尺度,模型容易把它理解成再采样一种常见风格。
更好的 Skill 会要求模型先指出问题位置和原因,再让作者确认要不要改。它还应清楚写出哪些材料不能碰。
禁掉一个词,其他词还会冒出来
被点名的一些模型常用词后来减少;相似的写作习惯没有因此消失。
词频变化研究 · 研究没有确定变化原因,也没有证明禁词提示导致变化。
Geng 与 Trotta 分析英语文本中的词频变化,也测试过明确的禁词提示。指定词可以减少,整种写法是否消失还要看全文。研究者对词频变化原因的解释带有推测成分;研究没有检验去味 Skill 的因果效果。
把某个词列进黑名单有用,稿件仍要整段检查,确认空话没有换个说法留下来。
清单能喊停,判断仍要练
症状清单
点名一个套话,能压低它;没点名的写法还会变化。
事实护栏
不添事实,保留必要限定;句子确实需要时,允许破例。
规则可以提醒,范本、练习和作者的耳朵教人判断。
历史视角提醒我们,反套路的规条需要一条安全阀。胡适的《文学改良刍议》提出具体主张;奥威尔在六条写作规则之后,又提醒读者:宁可打破规则,也不要写出糟糕的句子。
这段历史是帮助我们思考清单边界的类比,不能证明所有清单都会失效,也不能预言模型一定会把清单变成新套话。清楚的事实护栏仍然有用。
51.2% 测的是什么?
那项 1,276 人的盲测研究测试图像、音频和视频识别;没有测试读者识别 AI 文章。
原材料把 51.2% 用作“读者辨认 AI 文字接近随机”的证据。回到原论文,参与者看的其实是图像、音频、视频和视听材料,并没有测试文字。因此这个数字不能支持文章识别率。
这是很适合演讲现场的例子:数字看起来具体,不等于它回答了眼前的问题。读论文先看样本做了什么,不只看摘要里的醒目数字。
辨认、评价、信任是三回事
普通读者
对风格是否相似没有明显偏好;在部分盲评中更喜欢 AI 文本的质量。
专业写作者
对提示生成的仿作更挑剔;模型经过作者作品微调后,评价又发生变化。
辨认 AI、评价文章、信任作者,分别需要证据。
这篇预印本让专业读者和普通读者盲评英语仿名家短文。两组读者对风格相似、文本质量的判断不同;模型微调以后,结果也会变化。它不能代表中文非虚构写作,也没有直接回答作者身份披露后读者是否信任这类问题。
报告中关于披露后信任变化的转引来源没有核实;读者跳读、取关是否由“AI 味”造成,也没有证据。本页把三种问题分开,不把一种结果推到另外两种。
一次自动编辑,可以有帮助
| 版本 | 盲评中的平均排序 |
|---|---|
| 专业作者修改 | 排在前面 |
| 自动编辑 | 高于原稿 |
| 原稿 | 作为比较基准 |
LAMP 研究:英语段落、专业写作者与自动编辑;不能当作中文长文 Skill 的保证。
LAMP 的英语段落实验中,盲评平均排序是专业作者编辑、自动编辑、原稿。自动编辑相对原稿有显著改善;研究没有明确报告专业编辑和自动编辑之间直接比较的显著性。
这提供了“自动修订确实能帮忙”的有限证据。样本、语言、篇幅和任务都跟一场中文演讲稿或你的长篇文章不同,结论要停在实验做过的范围内。
后编辑能拉回风格,也会留下痕迹
靠近作者
81 人在线预注册研究中,后编辑让风格更接近参与者独立写作。
仍有差距
后编辑稿整体仍更接近 AI 文本,风格多样性也低于独立写作。
英语写作预印本,2026;不能直接推到中文长稿或本地 Skill。
Baumler 等人的预注册在线研究有 81 名参与者。他们修改 LLM 草稿后,文本在风格指标上更接近本人独立写作,但仍比独立写作更像 LLM 输出,群体风格多样性也较低。研究还发现读者感到的风格真实性与模型测出的相似度并不完全一致。
另一篇预印本分析 300 篇个人叙事、三种模型和三类修订提示,观察到第一人称代词、缩约形式等指标减少,语体趋于正式;保留声音的提示能减小变化,却没有消除变化。两篇都不等于“中文稿跑一次 Skill 必然失去声音”,也没有测试这套演讲里提到的规则。
个体变好,群体可能更像
给个人:AI 点子能提高部分短篇故事的评分。
看群体:获得 AI 点子的故事彼此更相似。
实验讨论的是短篇故事创意辅助,结论只适用于这类任务。
Doshi 与 Hauser 让参与者写短篇故事,并给一部分参与者 AI 提供的创意。AI 点子提高了部分作品的个人评分,同时使作品之间的相似度增加。
研究范围是短篇故事创意辅助。教师和作者可以把个人收益与群体差异分开观察,再判断其他写作任务。
模型坍缩说的是跨代训练
模型坍缩研究
模型生成的数据进入下一代模型训练,逐代影响训练资料。
一篇稿子的修订
同一篇文章被提示、改写或润色,属于另一种过程。
反复改写仍可能磨掉细节和个人声音;要研究这件事,直接比较改稿结果。
Nature 这篇模型坍缩研究讨论模型代际训练:模型输出污染后续训练数据的过程。它没有研究一篇文章被同一个模型改写一次。
反复自动改写可能让文本趋向模型偏好的常见表达。这是值得检验的风险,现有模型坍缩研究没有证明这种单篇改稿效应。
词句之外,结构也可能显出模式
StoryScope 用人物选择等结构特征,对限定的英语小说语料做分类。
预印本 · 小说语料;未测试提示词能否改进结构,也不代表中文非虚构。
StoryScope 使用一组大规模的英语小说配对语料,比较人类作者与五种模型生成的作品。研究者提取叙事层面的特征,不依赖常见词或文风,在这项语料分类任务中得到 93.2% macro-F1。
结果来自特定的小说语料和分类任务。它没有测试写作 Skill 能否修正这些结构特征,也不能直接推到中文非虚构。它支持的谨慎结论是:检查文字时,词句之外还可以看人物选择、情节推进和时间安排。
这句话里的决定,
是谁做的?
Ted Chiang 在谈 AI 与艺术时,把写作看成一连串选择。这是帮助我们想象创作过程的类比,文章没有实测模型内部的选择过程。
稿件可以追问:这段话里哪些细节是我知道的,哪些是工具替我补的?删去工具生成的顺滑句,作者自己的观察还在不在?
课堂上,先让学生听见问题
学生自己写出一段,不先让工具改。
圈出自己不相信、说不清的句子。
指出缺的是事实、判断还是声音。
最后才看 AI 提供的改法。
54 人短期写作实验研究的是借助模型写短文,没有测 Skill 改稿或长期学习。
MIT Media Lab 的一项 54 人短期实验让参与者借助搜索、聊天模型或不用工具写短文。模型组回忆自己刚写过的句子更困难。研究测的是短期从头写作,未检验 Skill 长期使用,也未测试 Skill 改稿。
课堂目标是让学生听见一句话为什么虚、为什么不像自己。先写、先解释,再用工具比较,能把判断步骤留在练习里。
先决定,再清理
事实、原话、观察和想说的问题。
标出重复、空泛和未决处,说明理由。
补证据、删掉不信的判断,决定保留什么。
只处理明确规则,再由作者朗读核对。
一次只用一个 Skill;换工具前,先对照规则和改动。
这套流程把技能放在适合的位置:先指出问题,接着作者决定,最后处理可以清楚核对的句子。三份规则包之间确有句长、拆句等指令冲突,这是对这几份文件的观察,不代表所有 Skill 都会冲突。
每次保留原稿和改稿,换工具前先核对新旧规则与改动差异。口述稿、非虚构文章和课堂练习需要不同;材料和判断已经清楚时,也可以直接做一次有范围的编辑,不必机械完成每一步。
给自己的 Skill 做一次对照
原稿、Skill 一次修改、作者最后修改。
请读者盲读,别先告诉他们哪版由谁改。
事实、具体性、判断、声音还在不在?
看它删了什么、补了什么、作者改回什么。
先用自己的稿件做判断,别拿检测器分数代替读者意见。
这张检验表是建议方案,还没有实验结果。每次保留原稿、Skill 版本和作者版本,找几位读者盲评,并记录他们具体指出的句子。
最重要的是比对变化:工具有没有添造事实?作者为什么改回某一句?哪一处清理让意思更清楚?积累一批结果,才能知道规则包在自己的文章里有没有用。
句子可以交给工具改,
判断要留在作者手里。
先想清楚要说什么,再清理已经写下来的句子。
结论落在工作顺序:材料和判断先由作者把关;Skill 可以清理可定位的表达问题;作者最后朗读,决定哪句话留下。
一次自动编辑可能改善表达,现有证据不能推出“AI 进、AI 出必然退化”。长期练习被代劳、声音趋同和规则迁移都值得直接比较;这些风险也不能只靠模型坍缩研究来证明。
文字研究与编辑实验
- Geng & Trotta · 词汇变化研究,2025观察词频与禁词提示;词频变化原因尚未确定。
- Cooke 等 · 多媒体 AI 识别盲测,2024测试图像、音频、视频;未包含 AI 文字识别。
- Chakrabarty 等 · 仿写盲评,STLR 2026英语仿名家片段,读者类型影响评价。
- LAMP · 英语段落编辑盲评,CHI 2025实验中自动编辑优于原稿;中文长文仍需单独检验。
这些研究分别涉及英语词汇、跨媒体识别、仿写判断和段落编辑。各自的样本与任务不同,引用时要看清它们实际测了什么。
创作多样性与学习边界
- Doshi & Hauser · AI 点子与故事多样性,2024短篇故事实验;不等于所有写作任务。
- Shumailov 等 · 模型坍缩,Nature 2024研究多代训练数据污染;未测单篇文章编辑。
- Kosmyna 等 · 短期写作实验,202554 人预印本;未测试去味 Skill。
- Krishna 等 · 改写与文本检测,NeurIPS 2023检测器可被改写规避;不证明质量不变。
短篇故事、模型训练、短期写作和文本检测属于不同问题。它们能提示我们继续追问,不能直接替中文长文与具体 Skill 下结论。
作者声音与叙事结构
- Baumler 等 · 个人风格后编辑研究,202681 人预注册在线研究;后编辑提高风格接近度,未完全回到独立写作。
- van Nuenen · 个人叙事修订研究,2026300 篇叙事、三种模型;英语预印本。
- Russell 等 · StoryScope,2026英语小说语料的叙事结构研究;不是普适检测结果。
三项研究都需要按各自范围理解:风格相似度、个人叙事修订和小说叙事结构是不同测量。它们没有评估本页提到的中文 Skill。
清单的边界与破例空间
- 胡适 ·《文学改良刍议》,1917原文收录于《新青年》第二卷。
- George Orwell · “Politics and the English Language”,1946六条规则的末尾保留破例空间。
这两篇原文帮助讨论写作规则的作用和边界。它们是历史参照,不是关于 AI 写作效果的实验。