产品Simon Willison·原文 2026年9月22日

TypeSafe AI发布Jev:只输出浮点数、只对输入收费的决策模型

Jev接受文本或半结构化输入,返回概率、选项分布和评分,输出不收费,输入价格 0.042 美元/百万token,低于GPT-5 Nano的 0.05 美元。

AI解读:Jev把大模型的输出从一段文字压缩成一个数字或一组概率。TypeSafe AI把它叫作“System One模型”,也有人(包括Simon Willison引述的Maggie Appleton)更愿意叫“决策模型”,因为它不生成文本,只做判断。

它的直接好处是把分类、打标签、排序这类任务变成一次API调用:输入一篇文章或一条客户记录,同时问很多问题,一次拿回每个问题的置信度。问题并行评估,问十个和问一个的耗时差不多。

成本结构也变了。普通LLM按输入和输出token分别计价,输出通常更贵;Jev只收输入费,输出免费,首个模型输入价 0.042 美元/百万token。这让跑几百上千次实验只需几分钱,但代价是结果不可解释。

这种不可解释性是Willison明确点出的顾虑。输入全是文本,回来的只有一个浮点数,无法说明是哪些内容触发了判断,因此偏见可能被数字掩盖。他举了自己用Jev给旧金山湾区城市是否“好城市”打分的例子,结果库比蒂诺最高、东帕洛阿尔托最低。

社区已经在试各种用法:用Jev逐字符生成回复做成聊天模型、用选项查询实现left-pad、让它玩 2048,还有人基于Qwen 3.5做了 0.8B、4B、9B的开源复刻,并出现了对比这类模型的JevBench基准。

2026 年 9 月 21 日,Simon Willison报道称,TypeSafe AI上周发布了Jev,这是他们所称“System One模型”这一新类别模型的第一个实例。Willison表示自己与Maggie Appleton观点一致,认为“决策模型”(decision models)是更合适的名字。

Jev保留了文本输入,但不返回文本:输出是与类别、是/否问题、评分对应的浮点数以及相关置信度。TypeSafe对Jev的描述是:“把Jev看作一次前沿智能函数调用:输入非结构化状态,输出带类型的概率性决策。”它同时速度很快、价格很便宜。

定价上,普通LLM按输入和输出token计费,输出通常高得多;Jev只对输入收费,输出免费,其首个模型的输入价格为每百万token 0.042美元,比OpenAI的GPT-5 Nano(每百万 0.05 美元)还低。

使用方式是:构造一个 “state” 对象,内容可以是一个字符串、字符串数组或一组名称-值对,用来描述一篇文章、一个客户或任何记录;把state和一个或多个问题发给API,每个问题返回一个结果。

Jev支持三类问题:一是Yes/No问题,Jev称之为 “Noul” 问题,其CEO在Hacker News上确认这是Bernoulli(伯努利分布)的缩写,给出一个 0 到 1 之间的浮点数表示模型认为该陈述为真的置信度;二是选择题,从给定选项中选一个,实际返回一个置信度加上所有选项上的概率分布;三是评分题,提供一组带描述的数值档位,返回落在该范围内的浮点分数。

Jev API可以接受单个文档(state)以及尽可能多的、能塞进上下文窗口的问题。问题并行评估,因此发送很多问题与只发送一个的耗时相近。

Willison认为适用场景是分类与重排序,但黑箱问题更严重

Willison认为“决策模型”这个定位有助于判断在哪里使用Jev:适合任何能表达为分类任务的事情,例如垃圾邮件检测、标签推荐、优先级排序和排名。他还尝试用它做搜索重排序——先用BM25这类低成本算法取出 100 个可能匹配项,再让Jev针对原始查询给这 100 个候选打分。

他同时表示,Jev让他有些不舒服的地方是它进一步退向黑箱机器学习系统。LLM本身已是黑箱,你可以要它解释理由,但无法保证解释有用或准确;Jev连这一点都没有:输入所有文本,拿回来的只有一个浮点数。如果Jev把某内容标为垃圾邮件,是哪些内容信号触发的?

这也意味着偏见问题会更突出。Willison说他真心希望没人用Jev来给求职者排名——那个浮点数可能掩盖模型中各种看不见的偏见,而通过实验拆解这种偏见会很棘手。他自己做过一个实验,让Jev对旧金山湾区每个城市回答是否“好城市”,结果库比蒂诺排最高,东帕洛阿尔托排最低。

已有开源复刻与社区实验出现

Willison称,过去几天社区提出了不少潜在用例。他列举了几个:Kyle Pena的jevchat把Jev变成一个(糟糕的)聊天模型,每一步只问Jev一个问题:“给定用户的问题和目前已写出的回复,下一个符号是什么?”Hacker News用户ericpruitt评论说,这相当于“Morty对着死亡水晶说话的数字版”。

Fatih Kadir Akın的jev-leftpad用提示“value前面需要多少个空格才能达到targetLength?”和从“需要 0 个空格”到“需要 10 个空格”的选项查询来实现left-pad。Andy Gayton的jev-2048则用Jev来玩 2048 滑动拼图。

此外还涌现出一批用开放权重模型复刻Jev的项目。Kev是其中一个例子,基于Qwen 3.5产出 0.8B、4B和 9B模型。相应的Hacker News讨论串中有人贴出了已经出现的JevBench基准,用来比较“Jev类决策模型”。Willison表示,Jev发布还不到一周,围绕它的活动量令人印象深刻。

信息来源

Simon Willison原始来源