研究The Verge AI·原文 2026年9月10日本站收录 2026年9月11日

数学家Andreas Thom要求OpenAI证明其未使用自己的未发表研究

Thom称OpenAI对其询问的答复只说明对话未被直接访问,未说明是否进入训练数据;他称这是“不诚实”。这是继Tristan Buckmaster之后第二位公开质疑OpenAI训练数据来源的数学家。

AI解读:第二位数学家公开质疑OpenAI的训练数据来源。Andreas Thom说,他此前与ChatGPT的交流可能帮助了OpenAI在非sofic群问题上的结果,而OpenAI承认其成果大量建立在Thom和Gábor Kun此前的工作之上。

争议的核心不是“有没有直接读取聊天记录”,而是用户数据去标识化后是否仍被用于训练模型。Thom说,去标识化“去掉的只是姓名,去不掉数学思想的知识内容”。

对数学研究者来说,这意味着他们与AI的日常对话可能以自己无法核查的方式变成训练材料。研究者无法反向拆解OpenAI的训练管线,只有OpenAI掌握能证明或否认这一点的数据。

实际影响集中在学术竞争:如果未经同意、披露或署名,用户提供的未公开研究被用来改进模型,再让模型与同一批用户竞争发表,Thom认为这在伦理上站不住脚。

这起事件也说明,即便OpenAI的数学成果本身足够亮眼,训练数据透明度争议仍可能让数学家更倾向保密,避免自己的阶段性想法成为资源雄厚公司的竞赛燃料。

数学家Andreas Thom公开质疑OpenAI的训练数据来源,要求其证明他与ChatGPT的交流没有被用于改进模型。这是继纽约大学数学教授Tristan Buckmaster之后,又一位就未发表作品是否被OpenAI使用提出质疑的研究者。

Thom在Mastodon上连续发帖称,OpenAI上月高调公布的10项数学结果中,有一项涉及他的专业领域“非sofic群”(non-sofic groups),OpenAI也承认该结果大量建立在Thom和数学家Gábor Kun此前工作的基础上。

Thom说,他注意到OpenAI“对我们技术的详细掌握”,而这些技术在当时既不是最显而易见、也不是最有希望的解法路径。他因此向OpenAI研究员Sébastien Bubeck和哈佛统计学家Mark Sellke发邮件,询问自己与ChatGPT的互动是否“属于训练数据,或可被推理过程访问”,从而可能对结果有所贡献。

Thom对答复并不满意。他说,对方只回答了对话能否被直接访问,没有说明这些对话是否进入OpenAI用于改进模型的海量训练数据。“没有给出这样的限定、解释或证据,”他写道,“至少可以说,我认为这是不诚实。”

OpenAI未立即回应The Verge的置评请求。The Verge的报道称,OpenAI在公布Navier-Stokes解时曾明确否认使用任何特定用户数据:“我们(研究人员和智能体)在他们公开发布之前,没有通过任何方式看到他们的工作——尤其是,没有为了求解这个问题而访问任何特定用户数据。”但OpenAI同时表示,不能完全排除间接影响:“虽然可能性不大,但我们不能排除从其产品使用中衍生的去标识化数据帮助改进了我们的模型。”

Thom说,这和他收到的沟通是同一种模糊区分。“去标识化可以去掉一个名字,但去不掉数学思想的知识内容,”他说。他还表示,回顾来看,Sellke当时斩钉截铁的回答“至少是不合理的宽泛,且具有实质性误导;现在看是完全不诚实的”。

Thom的质疑指向去标识化数据,而不只是直接访问

Thom说,研究人员没有能力反向拆解OpenAI的训练管线,来判断自己的成果是否被使用。“只有OpenAI有相关数据。”如果公司要否认这样做,他认为责任在OpenAI,应披露所有必要数据集,并说明各种设置和条款,讲清它如何使用数据。

这一争议与Buckmaster的遭遇相呼应。Buckmaster当时以个人身份与Anthropic研究员Levent Alpöge合作研究相关问题。The Verge报道称,OpenAI在公开信息以及与Buckmaster的沟通中,都没有明确排除用户数据带来的间接影响。

Thom称,如果用户提供的非公开研究帮助改进了模型,而公司随后用这些模型与同一批用户竞赛发表,且没有同意、适当披露或署名,“在伦理上是站不住脚的”。

数学家担心泄密式竞赛让领域更封闭

The Verge报道称,这起持续发酵的事件让数学界感到不快。多名研究人员对该媒体表示,他们担心这种行为会把领域推向更保密的状态:如果数学家知道,哪怕只是自己接近重大突破的传言,都可能引发与资源雄厚科技巨头的竞赛,他们就会更不愿分享进展。

OpenAI宣布解决了一个数学界传奇的千禧年大奖难题,若获验证,很少有人会否认这是一项非凡成就。但The Verge指出,OpenAI称其最初追求该问题的原因不寻常:它在网上听到其他研究者取得重大进展的传言,于是也想试试。

信息来源

The Verge AI原始来源