ChatGPT发明者新模型Jev发布:不输出文本只给概率,API一度被挤爆
Diogo Almeida离开OpenAI后创办的TypeSafe AI发布Jev,一个基于Transformer但非大语言模型的系统,输出“校准后的决策”概率而非文本,据称吞吐量以十亿计、输出token免费,开发者需求一度导致API服务中断。
AI解读:Jev想解决的是一个具体问题:大语言模型擅长说人话,但计算机自动化需要的是明确的判断和概率,而不是一段听起来合理的文字。Almeida的说法是,优化人类语言四年,对自动化并不实用,因为电脑讲的是另一种语言。
这款模型的实际卖点是便宜、快、不会幻觉——因为输出由用户预先定义,模型只回传概率。它不替代所有LLM,而是接管分类、审核、路由这类原本要调用大模型的小任务。Vercel用它替换OpenAI的Luna 5.6做命令安全分类,速度提升5到18倍且更准;另一名开发者对比Gemini做商务邮件分类,Gemini略准但贵10到20倍。
真正受影响的可能不只是模型厂商,还有那些用量大、被大模型账单压着的工程团队。输入token按十亿计费、输出不收费,意味着过去因为成本而被砍掉的自动化环节可能重新变得划算——但前提是任务能被写成概率判断。
限制也很明确。用户必须自己设定阈值,50%的概率等于抛硬币,95%才敢用;模型架构未公开,外界怀疑基于开源权重LLM;合成数据训练的效果也只有TypeSafe自己的说法。Ronacher预计竞争者会跟进,但Jev目前仍是孤例。
Diogo Almeida曾是OpenAI研究员,参与构建ChatGPT并参与发明了RLHF——这一训练技术被认为很大程度上塑造了当前这波AI。但他对成果并不满意。“我们手里握着闪电,可它并不实用,”Almeida对TechCrunch说。他的结论是:问题在于“我们在为人类语言做优化……我们擅长人类语言已经四年了,但这对自动化不实用,因为计算机说的是另一种语言。”
两年前Almeida离开OpenAI创办TypeSafe AI。本周该公司发布了一个基于Transformer的新模型Jev,它不是大语言模型(LLM),不输出文本,而是产生概率,公司称之为“校准后的决策”。因为不碰语言,模型据称极其便宜和快;由于用户提前定义输出,它不会产生幻觉。其输出token免费,输入token按十亿而非百万计量。
开发者对这款产品兴趣浓厚,公司API一度因需求过高而短暂无法服务用户。Jev目前看起来最适用于软件自动化。
Vercel替换OpenAI Luna后速度提升5至18倍
软件工程师们把Jev看作在代码中引入智能的更便宜、更稳健的方式。
Vercel的软件工程师Pranit Sharma表示,他的公司曾用OpenAI的ChatGPT Luna 5.6运行一个分类器来审查命令安全性。Vercel用Jev替换OpenAI的Luna后,结果快了5到18倍,而且更准确。
商务邮件分类测试中Gemini略准但贵10至20倍
另一位开发者、Bryo AI的CTO Nikhil Mudholkar将Jev与Gemini对比做商务邮件分类。在他的测试中,Gemini略微更准确,但成本高出10到20倍。
更让Mudholkar感兴趣的是Jev的置信度分数。他说:“它是唯一一个返回真实概率的,这让它非常适合自动化工作流!!”
用Jev监控LLM智能体,把幻觉问题交给用户
除了在特定场景中替换LLM,Jev也能增强LLM,充当对不当行为的智能检查。用智能体监控智能体很容易变得昂贵,但Almeida认为用Jev来做是合理的。他设想用户部署Jev来跟踪LLM智能体的轨迹并防止越狱。
Earendil的CTO Armin Ronacher表示:“最终,这在一定程度上把幻觉问题委托给了用户。用户必须说,好吧,如果返回的只有50%概率,也许这是抛硬币,我就不理它;但如果是95%,那好,我可以用它做点什么。”
Ronacher还提到Jev的另一个潜在用途是模型路由。预测某个工作负载是否需要特定模型会很有用,但用LLM来做这件事太贵。Jev的低成本和高速度让这种实时分拣成为可能。
模型以杰文斯命名,Almeida称不把自己当前沿实验室
Jev的名字来自19世纪经济学家威廉·斯坦利·杰文斯,其同名悖论描述的是商品成本下降如何导致它被越来越多地使用。Almeida的期望是智能成本下降推动其广泛部署。“我们认为到处都会出现智能软件,以一种涌现和分布式的方式……更像早期互联网,而不是现在人们试图构建的超级应用,”他说。
Almeida对模型架构守口如瓶,外部观察者怀疑它构建在一个开源权重LLM之上。公司称Jev为“系统一模型”,聚焦直觉而非推理,并专注于正确的任务。Almeida说Jev完全用合成数据训练,技术名为“从校准决策中进行强化学习”。他告诉TechCrunch:“我们很早就押注所有数据都由自己制造,这是我一生中最好的押注之一——在我看来比我们的发布更好,比RLHF更好。公司一半是个实验室,基本上拥有这个统计上理解透彻的合成数据子领域,现在这是我的生活乐趣。”
目前Jev是这类模型中的孤例,但Ronacher预计竞争者会随之涌现。“我们在很多方面本该更早看到这一点,但大概因为LLM太便宜、有补贴,你往往还不需要有创造力,”他说。TypeSafe自身将构建更多版本、覆盖新模态的模型。
被问及TypeSafe是否是前沿实验室时,Almeida说:“前沿实验室的主要产品是恐惧或炒作。我希望我们的主要产品是智能……(但我们)不是那种意义上的实验室,比如押注无限财富、宗教,或者在数据中心里造神,或者今天流行的什么东西。”