大数跨境

AI 写作的 13000 个口头禅:破折号删掉了,痕迹没删掉

AI 写作的 13000 个口头禅:破折号删掉了,痕迹没删掉 AI造万物
2026-10-07
9
导读:一份研究拿1万篇ChatGPT之前的人类文章做对照,数出了13000个在AI文本里出现频率至少两倍的短语。破折号被清掉了99%,但痕迹总量没减少——只是换了地方。

AI 写作的 13000 个口头禅:破折号删掉了,痕迹没删掉

素材说明:本文基于 2026 年 10 月初 Graphite 发布的写作特征研究,以及 TechCrunch、The Beat、
Linxi News、Euronews Horn 等对该研究的报道整理。研究由一家营销公司完成,目前公开的是
媒体转述而非完整论文,文中已标明其方法边界与未经独立验证之处。

有一段时间,判断一篇文章是不是 AI 写的,靠一个标点就够了:破折号。

它太好用了。人类写东西很少用,模型偏偏爱用。只要在一篇稿子里看到连续几个"——",基本就能下判断。

现在这个信号失效了。

据 Graphite 的统计,Claude Opus 5.5 使用该标点的频率比上一代降低了 99%,OpenAI 的 Astra 比人类样本低 88%,谷歌 Gemini 3.1 Pro 基本把它从行文里清除了。

那么问题来了:换成什么了?


一、13000 个痕迹

Graphite 做了一件事:把 10,000 篇发布于 ChatGPT 问世之前的人类文章作为对照组——那个年代不可能有 AI 代笔,这是干净的人类基线。

然后,它没有让模型"就这个题目写一篇文章",而是先给这些文章做摘要,再让不同的模型根据摘要去重写。

这一步是整个研究里最聪明的地方。如果让模型自由发挥,题材不同、来源不同,比较出来的词频差异可能是题材造成的,不是写作习惯造成的。用"同一批素材、同样的改写任务"来对齐,剩下的差异就主要来自表达习惯本身。

结果是:13,000 个短语,在 AI 生成文本中的出现频率至少是人类样本的两倍。

Graphite 把达到这条线的都称作"痕迹"(tell)。

13000 这个数字本身比任何单个词都更有信息量。它说明一件事:模型写作的印记不是表层的一两个怪癖,而是深到句式层面的东西。


二、两个模型,两种口音

更有意思的是,不同模型的口音不一样,而且差别大到几乎可以靠词汇就分辨出来。

Claude Opus 5.5 的习惯:喜欢替自己强调重要性。

  • "这很重要"(this matters)出现频率是人类样本的 116 倍
  • "为什么 X 重要"(why X matters)是 92 倍
  • 单词 "dependable"(可靠)用了 23 倍

它已经基本改掉了那个被点名批评的"不是 X,而是 Y"句式,但转头用上了它的近亲:"不只是 X,更是 Y"。

如果你曾经觉得某个 AI 特别喜欢主动向你声明它接下来说的东西有多重要,那不是错觉,这是有数据支撑的。

OpenAI Astra 的习惯:喜欢纠正一个不存在的人。

  • 被 Graphite 称为"纠正式框架"的句式——"不仅仅是 X"、"而不是依赖 X"——出现频率是人类的 100 倍以上
  • 喜欢引入话题的"另一个维度"
  • 喜欢给好处加一层缓冲:某个做法"可能带来""可以提供"某种收益

这两种口音的气质完全不同:一个在向你担保它说的话很重要,另一个则永远在修正一个假想的错误说法。

同样的任务、同样的素材,写出来是两种人。


三、最反直觉的一条

按常理推测,模型一代代迭代,痕迹应该越来越少。

数据不支持这个推测。

Graphite 首席 AI 官 Greg Druck 的原话是:"痕迹并没有减少。他们确实成功去掉了最有名的那几个,但新的会冒出来,而且每一个模型版本都有自己的一套。"

这句话值得多读一遍。

它描述的是一场打地鼠:你按住破折号,"这很重要"就冒出来;你按住"这很重要",下一个版本会掏出别的。

原因也不神秘。Druck 的解释是:实验室对这类细节的控制力,比外界想象的要弱——这些是拥有数十亿参数的巨型模型,能跑的测试数量有限,总会有些东西漏过去。

换句话说,不是他们不想改干净,是改不干净。


四、两条正在分开的曲线

研究里还有一个更长期的观察:

Claude 系列逐代在向人类的词频分布靠近;GPT 系列则在远离。

两家实验室都在宣称自己写得更自然了。Anthropic 在 Opus 5.5 的发布说明里说它"比前代表达更自然",早期用户觉得文字更清晰易读;OpenAI 在 GPT-6 版本的 Sol 与 Luna 上也给出过几乎相同的承诺——更清晰、更少 jargon、更少别扭的措辞。

这些话大概在某个狭窄的意义上都是真的。但半年之后,13000 个痕迹的清单依然摆在那里。

两条曲线分开这件事,说明的不是谁好谁坏,而是:不同的训练路径,会产生风格上真实而持续的分叉,不是同一种漂移的不同口味。


五、这份研究不能说明什么

说清楚边界,比说清楚结论更重要。

第一,它测的是"改写"这一种任务。 让模型根据摘要重写一篇文章,和让它从零构思、写小说、写代码注释、写一封邮件,语言特征未必相同。这份结论不能自动外推到所有 AI 写作。

第二,目前公开的是媒体转述,不是完整论文。 已有报道明确指出,未见完整研究文本与独立验证。研究方本身是一家营销公司,不是学术机构。

第三,"出现频率是人类的两倍以上"是统计差异,不是指纹。 它告诉你某个词在机器文本中更常见,不能反过来证明"用了这个词的就是机器"。人类作者照样会写"这很重要"。

第四,它测的是英文。 中文语境下的 AI 腔是另一套东西,这份数据不能直接搬。

所以正确的读法是:这是一份有价值的提示,不是一张可以照着抓人的清单。


六、对写东西的人,有四条实在的

第一,别再用破折号判 AI 了。

这个信号已经死了。任何还在教人"看到破折号就是 AI"的说法,都停留在两个版本之前。

第二,任何号称"永久有效"的检测器都别信。

检测器依赖的是特征库,而特征库每出一个模型版本就要重训一次。Druck 那句话的潜台词是:这是一场永远追不上的比赛,不是一次可以结案的工程。

第三,真正的判别依据正在从文本特征转向过程证据。

写作过程的留痕——版本历史、初稿、修改记录、写作时间戳——比任何词频都可靠。这也是为什么越来越多的学校、媒体和平台开始要求过程性材料,而不是拿一段成品去做检测。文本特征会被训练掉,过程不会。

第四,如果你自己用 AI 辅助写作,要改的不是破折号。

对照这份清单,最该手动删掉的是那类元叙述——模型主动跳出来评价自己内容重要性的句子("这一点至关重要""为什么这件事重要"),以及永远在纠正一个假想对手的句式("不仅仅是……而是……")。

这两类句子在人类写作里出现得最少,却最容易被当成"有见地"。它们不是深度,是口音。

删掉它们,文章的机器味会立刻淡一半。


结语

破折号消失之后,人们以为识别 AI 会变难。

这份研究给出的答案稍有不同:识别并没有变难,只是识别的对象变了。

从标点,到词汇;从词汇,到句式;从句式,到那种"急于向你担保自己重要"的语气。

而在这条链路的最末端,留下的是一样删不掉的东西——一个模型在数十亿次训练之后,对"一段得体的文字应该长什么样"形成的统计偏好。

它会换词、换句式、换语气,但偏好本身还在。

补充一句:这篇文章本身也有 AI 参与写作。上面提到的每一条痕迹,你都可以拿它来检验我——尤其是那些"这很重要"式的句子。如果它读起来还很机器,那说明这份研究说得对:口音是藏在语气里的,不是藏在标点里的。

【声明】内容源于网络
0
0
AI造万物
科技改变生活。
内容 29
粉丝 0
AI造万物 科技改变生活。
总阅读3.8k
粉丝0
内容29