Vals获a16z领投 4000 万美元A轮,用不公开题库给AI模型做行业实测
这家 2024 年成立的旧金山初创公司称,其评测不公开具体题目,按法律、金融、编程等行业任务衡量模型能否产出与人类同等质量的工作成果;公司称收入已达去年的 8 倍,团队从年初 8 人扩至 25 人,并已推出面向联邦机构的模型评估项目。
AI解读:Vals想解决的问题很具体:现在很多基准测试题目公开,模型公司可以拿这些题去训练,等于考前漏题;而老牌学术基准又跟不上新模型的迭代速度。它的做法是不公开题库,并按法律、金融、编程等具体行业任务来测,看模型能不能做出和人类同等质量的工作,而不只是考它知不知道某个知识点。
这套评测对模型公司的实际用处是排错和改进,所以公司会付钱来测。Vals把这比作学生交钱考SAT;同时评测结果正被买模型的企业当作选型参考。需要留意的是,这些说法来自公司创始人,Vals并未公开评测方法细节或效果数据,外部无法独立验证其“金标准”成色。
最直接受影响的是要选模型的企业和要给模型做背书的AI公司。评测如果真能成为公开可信的参照,采购和融资叙事都会更依赖它;但评测机构本身也是商业公司,付费模式和独立性如何并存,目前没有公开答案。普通读者暂时不需要做什么,等有可复核的评测结果再参考也不迟。
Vals是一家 2024 年成立的AI基准测试初创公司,正在争取成为AI评测领域更中立、可信的参照。TechCrunch报道称,该公司上月完成 4000 万美元A轮融资,由Andreessen Horowitz领投;此前它还拿过一轮由 8VC和Bloomberg Beta领投的种子轮。
Vals联合创始人Rayan Krishnan现年 25 岁,曾在Palantir实习,在斯坦福读本科期间为微软和该校人工智能实验室工作。他说,创办Vals源于自己的观察:一批能力很强的新模型快速上市,而学术基准没有跟上前沿进展。
评测方式:不公开题库,按行业任务测
Krishnan对TechCrunch表示,历史上的评测往往以很抽象的方式衡量智能,比如模型是否掌握足够信息去应付律师资格考试。Vals想走另一条路:许多基准测试的题目是公开的,公司可能拿这些题训练模型,相当于在考试中作弊;Vals不公开具体的测试材料。
Vals不只测模型的通用知识,还评估它们完成法律、金融、编程等特定行业复杂任务的能力。Krishnan的说法是,他们看的是模型的真实影响——在每个领域里,模型能否做出与人类同等质量的工作成果;同时不只看正面结果,也看负面结果,希望分析“如果这些模型在世界上不受约束地运行,会有什么负面后果”。
Vals测量的能力范围还在扩大。Krishnan称,公司有一个关于递归自我改进的基准,还在心理健康、网络安全、生物安全,甚至武装冲突法方向做工作,测试模型如何应用《日内瓦公约》。
商业模式:公司付费测自己的模型
企业付钱给Vals测试自己的模型,这听起来有些反直觉:为什么要花钱知道自己模型表现不好?报道给出的解释是,有效的度量能帮助企业排查问题并持续改进。Krishnan把这种收入模式比作学生付费给College Board参加SAT考试。
这些评测也正成为企业采购新AI模型时的关键决策因素。Vals最近披露,其当前收入是去年的 8 倍。
团队规模也在扩张:Vals今年年初只有 8 人,如今已增至 25 人,翻了三倍。Krishnan说,随着公司成长,计划搬到明显更大的办公室,并再招 10 到 15 人。公司最近还启动了一个面向联邦机构提供模型评估的项目。
Krishnan对评测前景的判断
Krishnan认为,Vals的基准测试体系会是AI公司思考业务增长和建立公众信任的未来方式。他说,AI公司开始上市,SpaceX已经上市,Anthropic预计在今年晚些时候,他猜OpenAI很快也会上市;随着AI模型成为经济的核心部分并更广泛扩散,Vals所做的这类基准和评测将驱动模型的使用,并成为这些公司提交公开文件或谈论计划中的AI投资时的核心部分。