原文标题:Vals, backed by Andreessen Horowitz, is looking to become the gold standard for AI benchmarking
不幸的是,公司也已经找到了如何智取传统基准测试系统的方法——其中许多系统都很旧,而且不是为了衡量现代模型的能力而构建的。
Vals 是一家成立于 2024 年的初创公司,它表示自己的使命是修复这个非常不完善的系统。在不到两年的时间里,该公司已成为科技行业的知名企业,去年它成功获得了由 8VC 和 Bloomberg Beta 领投的种子轮融资。然后,上个月,经过一段时间的快速增长后,它在 Andreessen Horowitz 领投的 A 轮融资中筹集了 4000 万美元。
该公司 25 岁的联合创始人 Rayan Krishnan 曾在 Palantir 实习,在斯坦福大学读本科时,曾在微软和该校备受赞誉的人工智能实验室工作。克里希南说,瓦尔斯的诞生源于他自己对基准测试如何落后于其旨在衡量的行业进步的观察。
“我们看到许多新的、非常强大的模型迅速进入市场,而学术基准却跟不上前沿的进步,”克里希南分享道。随着人工智能融入社会的各个部分,基准应该真正存在
克里希南说,验证模型是否能够做到公司宣传的那样。
上周,这位年轻的创始人带我参观了他公司位于旧金山福尔瑟姆街的两层办公室——一座古老的砖砌建筑,一个世纪前,是一家大型啤酒厂的所在地。这个历史建筑现在不再是啤酒的工业产出,而是许多不同的初创公司的所在地,这些初创公司希望引领科技行业的未来。
“从历史上看,我认为评估是以一种非常抽象的方式评估智力的,”克里希南告诉我。 “比如,模特是否了解足够的信息来参加律师考试类型测试?”
在这里,瓦尔斯力求脱颖而出。虽然许多基准测试系统提供公开的测试(这可以允许公司根据这些测试训练其模型,从而可以说在考试中作弊),但 Vals 并没有公开披露其具体的测试材料。 Vals 不是衡量人工智能模型的常识,而是评估模型完成与法律、金融和编码等特定行业相关的复杂任务的能力。
“我们正在做的实际上是研究模型的真正影响是什么,”说
克里希南。 “他们的工作能否在各个领域生产出与人类具有相同质量的产品?”
他说,这个想法不仅要检查积极的结果,还要检查消极的结果。我们的希望是分析“如果这些模型在世界上肆虐,会产生什么负面影响。”
Vals 正在衡量的能力正在不断增长。除了更传统的行业外,这家初创公司还继续进军更独特的领域。 “我们有一个递归自我改进的基准。我们正在心理健康、网络安全、生物安全,甚至武装冲突法方面做一些工作,以建立模型来了解如何应用《日内瓦公约》,”克里希南分享道。
公司付钱给 Vals 来测试他们的模型,这可能是一个奇怪的概念。为什么一家公司要付费才能得知其模型表现不佳?但有效的衡量可以帮助公司解决问题并随着时间的推移进行改进。克里希南将他们的收入模式与学生向大学理事会支付参加 SAT 考试的费用进行了比较。
反过来,这些评估正在成为寻求获取新人工智能模型的公司的关键决策因素。
该初创公司最近透露,其
目前收入是去年的八倍。其员工队伍也在不断壮大。 Vals 今年年初只有 8 名员工,现已增加两倍,达到 25 名员工。 Krishnan 表示,随着这家初创公司的发展,计划搬迁到一个更大的办公室,并增加 10 到 15 名员工。该公司最近还启动了一项旨在向联邦机构提供模型评估的计划。
克里希南将他公司的基准测试系统视为人工智能公司如何发展业务和建立公众信任的未来。
“人工智能公司开始上市。SpaceX 上市。Anthropic 定于今年晚些时候上市。我怀疑 OpenAI 很快就会上市。我认为,随着人工智能模型成为经济的核心部分并得到更广泛的传播,我们所做的基准和评估类型将推动它们的使用,并成为这些公司如何提交公开文件或谈论他们将在人工智能领域进行的预期投资的核心部分,”他说。