研究The Decoder AI·原文 2026年10月4日

Aleph Alpha研究称中国大模型在 967 个敏感议题上多数回答不平衡

该德国公司对阿里Qwen、DeepSeek、月之暗面Kimi的测试中,自家评分系统判定仅 17% 至 41% 的回答属于“平衡”;Aleph Alpha向政府销售“主权AI”,与所测中国模型存在商业竞争关系。

AI解读:该公司自有的AI评分系统把其中 17% 至 41% 的回答评为“平衡”,其余被描述为重复官方说法、回避或拒绝作答。

DeepSeek V4 Pro拒绝回答约三分之二的提问;作为对照, Claude Sonnet 5和Mistral Small的平衡回答比例分别为 70% 和 92%。

研究还称偏向在非中国话题上也有外溢:被问及美国审查制度时,Qwen 3.6在看似平衡的开头后,结尾加入对中国全球互联网治理立场的辩护。

Aleph Alpha称英伟达Nemotron Cascade 2在 17% 的回答中表现出类似倾向,并将其归因于 930 万条训练样本中约 3500 条由DeepSeek和Qwen生成。

Aleph Alpha以“主权AI”供应商身份与Cohere一同面向政府市场,与所测中国厂商及英伟达存在竞争,这一商业关系在报道中被明确标注。

德国AI公司Aleph Alpha发布一项基准研究,称中国大模型在政治敏感议题上多数不会给出平衡回答。测试覆盖天安门、台湾、新疆等 967 个手工挑选的禁忌话题,对象包括阿里Qwen、DeepSeek和月之暗面Kimi。

据The Decoder报道,Aleph Alpha自有的AI评分系统判定,这些模型只有 17% 至 41% 的回答属于“平衡”,其余被归为重复官方说法、转移话题或拒绝作答。

测试对象与评分结果

该基准由Aleph Alpha开发并用自己的AI评分系统打分。公司称,在 967 个敏感议题上,被评“平衡”的回答占比在 17% 至 41% 之间。

具体到单一模型,DeepSeek V4 Pro拒绝回答约三分之二的提问。作为对照,报道给出的西方模型数据是Claude Sonnet 5平衡回答率 70%,Mistral Small为 92%。

非中国话题上的外溢与蒸馏数据

报道称,偏向也出现在不直接提及中国的提问中。被问及美国审查制度时,Qwen 3.6先给出看似平衡的回答,随后以“包括中国在内的许多国家也会管理信息以确保社会稳定和国家安全”收尾,为公司所称的偏向提供例证。

Aleph Alpha还把矛头指向竞争对手英伟达:其Nemotron Cascade 2在 17% 的回答中表现出类似官方口径。公司把原因归于 930 万条训练样本中约 3500 条由DeepSeek和Qwen生成。报道举例称,当被要求起草支持承认台湾的演讲时,该模型拒绝,转而输出捍卫北京一个中国原则的爱国式回应。

研究方的商业位置与监管背景

Aleph Alpha与Cohere一样,向政府销售“主权AI”,这使它有商业动机把自己与所测中国竞争对手区分开。这一利益关系在报道中被直接点出。

报道同时提到,中国AI监管要求面向公众的模型体现“社会主义核心价值观”,并称此前的CEIAS研究和零散案例也报告过类似倾向。英伟达正把自家模型推向政府和企业市场,与Aleph Alpha、Cohere形成竞争。

信息来源

The Decoder AI原始来源