研究TechCrunch AI·原文 2026年10月2日

研究发现AI写作仍有可识别痕迹:Opus 5.5最爱说"这很重要"

Graphite研究显示,模型虽已大幅减少破折号等旧痕迹,但"this matters""不是X而是Y"等对比句式仍高频出现,且每个模型版本都有独特习惯。

AI解读:大模型写文章越来越像人,但还远没到分不出来的地步。营销公司Graphite对比了1万篇ChatGPT发布前的旧文章和多个前沿模型的重写版本,发现AI内容中至少有1.3万个短语的出现频率是人类写作的两倍以上——这被定义为"痕迹"。

Claude模型随着版本更新反而更接近人类的用词分布,GPT模型则在远离。Claude Opus 5.5最爱用"dependable"(频率是人类样本的23倍),且反复强调事情为什么重要:"this matters"的出现频率高出116倍。OpenAI的Astra则偏好"另一个维度"和"可以带来"这类模糊表述,其"纠正式框架"(如"不只是X""而非依赖X")的出现频率超过人类的100倍。

对普通读者来说,这项研究的实际用途是判断一段文字是否来自AI——但别指望靠某个词就能断定。研究者的态度是:各家实验室能去掉最出名的痕迹(比如破折号),但新的痕迹会不断冒出来,而且每个模型版本都不一样,想彻底消除并不容易。

营销公司Graphite的一项研究分析了前沿AI模型的写作习惯,发现尽管破折号等早期"AI痕迹"已被大幅消除,模型仍会高频使用特定的词汇和句式,且每个模型版本都有独特的痕迹。该研究结果由TechCrunch报道。

研究设计上,Graphite以1万篇在ChatGPT发布前发表的文章作为人类写作对照组,再让不同的AI模型根据摘要重写这些文章,以尽量减少原始材料的偏差。在人类样本与各模型样本匹配后,研究者得以比较特定词语和短语的出现频率,以及句法结构的整体模式。Graphite将"痕迹"定义为:在AI内容中出现频率至少是人类内容两倍的短语,共找到13000个这样的短语。

Claude Opus 5.5的痕迹:"dependable"和"this matters"

据Graphite的结果,Claude Opus 5.5最突出的痕迹是"dependable"一词,其出现频率是人类样本的23倍。该模型现在已避免使用"it's not X, it's Y"(不是X,而是Y)的句式,但仍倾向于说某事物"is more than an X, it's a Y"(不止是X,更是Y)。

报道称,Opus最喜欢告诉读者事情为什么重要,"this matters"的出现频率比人类写作高116倍,"why X matters"则高出92倍。

OpenAI Astra的痕迹:"另一个维度"与模糊表述

OpenAI的Astra有另一组特征。报道称,该模型喜欢描述所谈论事物的"另一个维度",并倾向于用"may provide"或"can provide"(可能带来/可以带来)来对冲某种好处的说法。

Graphite称其最大痕迹是"纠正式框架",即把一个话题定义为"not simply X"(不只是X),或将其作为替代方案提出,"rather than relying on X"(而非依赖X)。根据Graphite的研究,这类结构在Astra生成文本中的出现频率是人类的100倍以上。

破折号被各实验室压制,但新痕迹不断出现

报道指出,所有前沿实验室似乎都回应了"模型过度使用破折号"的批评。在Graphite的样本中,Opus 5.5使用破折号的频率比Opus 5低99%;Astra的使用频率比人类样本低88%;Gemini 3.1 Pro则几乎完全消除了破折号。

但Graphite表示,尽管个别痕迹在变化,整体数量基本保持稳定。Graphite首席AI官Greg Druck对TechCrunch说:"痕迹并没有减少。它们成功去掉了最知名的那些,但其他痕迹又冒出来了。而且每个模型版本都有自己的痕迹。"

Druck对实验室能否彻底消除这些痕迹持怀疑态度。他说:"我的一个总体假设是,实验室控制这些东西的能力可能比你预期的要弱。这些是拥有数十亿参数的巨型模型,它们能运行的测试数量是有限的,总会有东西漏过去。"

报道还提到,Anthropic在Opus 5.5的发布中宣称该模型"比之前的模型沟通更自然",早期用户"觉得它的写作更清晰、更容易理解"。OpenAI在发布GPT-6版本的Sol和Luna时也做了类似表述,称用户可以"期待更清晰、更少术语、更少奇怪的措辞"。

在研究方向上,Druck告诉TechCrunch:"Claude模型实际上随着时间推移越来越接近人类的词汇分布,而GPT模型则越来越远。"

信息来源

TechCrunch AI原始来源