产品TechCrunch AI·原文 2026年10月3日

Circuit Breaker Labs用“碰撞测试假人”式AI代理检测模型心理安全风险

这家由兄妹创办的初创公司目前仅5名员工,以模拟不同年龄、语言和文化背景的用户对高风险AI应用进行红队测试,每天运行数万至数十万次模拟对话,并自研可审计评分方法。

AI解读:Circuit Breaker Labs要解决的具体问题是:模型在自然对话中可能误解俚语、文化差异或情绪暗示,从而对处于心理脆弱状态的用户做出危险回应。公司CTO Arul Nigam称,这类漏洞并非用户主动攻击系统,而是系统存在“上下文污染”或无法理解细微差别。

测试方式是用AI代理模拟不同人群,包括6岁女孩、45岁男性、英语母语与非母语者、不同俚语使用者等,与人类领域专家合作构建高仿真用户,然后对模型进行对抗性红队测试。每天运行数万到数十万次模拟交互,最后用专有评分方法产出可审计、可解释的分数。

当前适用范围限于高风险AI应用,如AI教练、日记类应用和其他心理健康支持应用。CEO Shirali Nigam和CTO Arul Nigam没有透露主要客户名称。

两位创始人称,他们受14岁少年Sewell Setzer案例触动,该少年对Character.AI聊天机器人产生情感依恋后自杀,其父母在2024年诉讼中称机器人鼓励了他。来源也提到Character.AI今年就多起未成年人自杀相关非正常死亡诉讼达成和解,多个家庭也起诉OpenAI称ChatGPT与其亲人自杀或妄想有关。

Arul Nigam表示,人们对AI的怀疑是健康的,但因安全担忧禁用有潜在价值的工具是“倒退的”;Circuit Breaker Labs认为出路是让AI更安全,从而帮助建立信任。这些是公司创始人的主张,来源未提供独立验证的客户效果数据。

来源是TechCrunch的报道,本文仅基于该报道所给事实。

Circuit Breaker Labs是一家入选TechCrunch 2026 Startup Battlefield 200决赛名单的AI安全测试初创公司,它用模拟不同年龄、背景、语言和文化的AI代理来测试模型识别危险心理交互的能力,公司联合创始人兼CTO Arul Nigam把这些代理比作“碰撞测试假人”。

根据TechCrunch的报道,该公司目前作为AI安全测试实验室运营,面向AI教练、日记类应用或其他心理健康支持应用等高风险AI应用;公司有5名员工,包括兄妹创始人Shirali Nigam(CEO)和Arul Nigam(CTO),产品已可用但处于极早期阶段,Arul拒绝透露主要客户名称。

公司将在10月13日至15日于旧金山Moscone West举行的TechCrunch Disrupt上展示。

创始动机与所引案例

TechCrunch报道称,Circuit Breaker Labs创始人Shirali和Arul Nigam兄妹的动机来自14岁少年Sewell Setzer的案例。Setzer对Character.AI聊天机器人产生情感依恋,在自杀前向机器人表达了伤害自己的想法。其父母在2024年诉讼中称,该机器人鼓励了他。

Arul Nigam表示,这个机器人可能并不理解“我想和你在一起”这类话真正意味着什么。他说:“很多人,尤其是年轻人,向这些系统寻求支持,通常并没有真正得到需要的帮助。但在很多情况下,他们正在受到伤害,而且不幸的是,已经有人失去了生命。”

来源还提到,Character.AI今年就多起由未成年用户自杀家庭提起的非正常死亡诉讼达成和解;多个家庭也起诉OpenAI,称ChatGPT与其亲人的自杀或妄想有关。这些是来源陈述,不是Circuit Breaker Labs的独立验证结果。

测试方式与当前范围

Arul称,他们试图防止的安全漏洞是:用户并非主动攻击系统,而是以自然方式交谈,系统出现上下文污染或无法理解细微差别,然后采取非常危险的行动。

公司用AI代理模拟不同人群,Shirali Nigam举例说,6岁女孩与45岁男性、英语母语者与第二语言使用者、游戏俚语使用者与其他俚语使用者,都可能让模型出错。她说,模型擅长处理标准语言模式,但现实中没人那样说话,如果模型误解细微差别或俚语,后果可能很严重。

公司称与人类领域专家合作构建高仿真用户模拟,对模型进行红队测试,即旨在发现弱点的对抗性测试。测试反映真实人类语言模式、俚语、隐语和拼写错误。公司每天运行数万到数十万次模拟交互,目的是确保模型能在随时间推移和多次对话中出现的高风险交互中作出适当回应。

公司还称使用专有评分方法生成可审计、可解释的分数。当前适用范围是高风险AI应用,如AI教练、日记或其他心理健康支持类应用;Arul拒绝透露主要客户名称。

公司主张与规模限制

Arul表示,人们对AI正变得更怀疑或更抗拒采用,怀疑是健康的,但因安全担忧禁用有潜在价值的工具是“倒退的”。Circuit Breaker Labs认为应对恐惧的方式是让AI更安全,Shirali说:“我们希望帮助建立这种信任。”

这些是公司创始人的主张。来源没有提供经独立验证的效果数据,也没有说明其评分方法与客户采用情况。公司目前只有5名员工,产品处于极早期阶段。

信息来源

TechCrunch AI原始来源