模型The Decoder AI·原文 2026年9月16日本站收录 2026年9月17日

前OpenAI研究员创办TypeSafe AI,推出只做判断不写文本的模型Jev

TypeSafe AI发布模型Jev,开发者在软件中预设问题和可选答案,模型只返回标签和概率,不生成文本;官方称响应时间70至500毫秒,输入每百万token收费0.042美元,输出免费,开发者需通过等待名单申请接入。

AI解读:Jev把大模型的用法反过来:不让它写回复,而是让开发者在代码里预先定好问题和候选答案,模型只负责给每个选项打分。它输出的是“这是付款问题”“客户想要退款”这类标签和概率,之后由商城软件自己按规则分流。

这么做的卖点很直接:快和便宜。TypeSafe称Jev能在70到500毫秒内返回结果,多个输出并行计算,同一次调用里增加更多问题几乎不增加耗时,输入价格是每百万token 0.042美元,输出不收费。对需要在每条客服消息、每段AI回复前做一次小判断的场景,成本可能比调用通用大模型低不少。

但别把“不幻觉”理解成“不出错”。TypeSafe所说的保证,只是模型不会给出预设选项之外的答案;如果它在一堆固定标签里选错了那个,错误照样发生。而且公布的性能测试由TypeSafe自己搭建的四个工作流,参照答案是其他AI模型的输出,并非独立核验过的正确答案,评测里也没有GPT-6 Astra。

真正受影响的是要把这类判断接进业务系统的开发者:它适合分类、识别购买意图、判断何时转人工等窄任务,不适合替你做最终事实核查,比如是否真的重复扣款仍需查交易记录。接入还得先上等待名单,值不值得用,需要企业拿自己的任务去测准确率。

前OpenAI研究员、InstructGPT论文作者之一Diogo Almeida联合创办的TypeSafe AI,发布了一款名为Jev的AI模型。与生成式聊天机器人不同,Jev不写邮件、不写代码、不生成聊天回复,而是被设计用来在软件内部给出窄范围的判断和概率。

Jev的工作方式由开发者定义问题和可能的答案,模型负责给这些选项打分。TypeSafe文档给出的例子是:一家网店收到客户消息,称订单被重复扣款并要求退还第二笔付款。在有人处理前,这条消息需要先被分类——它是关于付款、配送还是退货?客户是想要退款还是只想要解释?开发者把商城软件接到Jev,并定义这些问题和允许的答案。每条新消息进来时,软件把客户文本交给Jev,拿回来的不是一封回信,而可能是“付款问题”这个标签,以及客户想要退款的一个概率值。

Jev在网店场景中怎么用

拿到Jev返回的标签和概率后,商城软件可以套用固定规则:付款问题转给财务,退款请求被标记,标签不明确时由人工审核。Jev只提供评估,下一步做什么由软件按预设规则决定。

TypeSafe指出,这不等于钱已经退回去了。是否真的存在重复扣款,仍需之后对照实际交易记录核实。告知客户已确认状态可以由另一个聊天机器人完成,但仅就分类这件事而言,不需要聊天机器人。

速度、价格与“不幻觉”的边界

TypeSafe称Jev的响应时间为70至500毫秒,比当前最快的语言模型还快很多倍。为达到这一速度,模型跳过了逐步生成文本的过程,公司称它会并行计算多个输出。在同一次调用中增加更多问题,响应时间几乎不增加。

这种速度让一种用法变得可行:在AI助手的每次回复前都做一次检查——草稿是否与之前的对话矛盾?它是否声称了一笔客户账户里没有记录的退款?TypeSafe在其示例工作流中描述了这类检查。公司还列出销售和客服领域的更多潜在用途,包括识别购买意图、按主题分类请求,以及判断何时该转人工。

价格方面,TypeSafe列出输入为每百万token 0.042美元,并称输出不收费。公司把Jev宣传为一款“不会产生幻觉”的模型,但这一保证只覆盖允许的输出结构:模型不会给出预设选项之外的答案,但在这些选项之内做出事实上错误的选择仍然可能发生。

与现有的结构化输出方案相比的未知数

常规语言模型同样可以输出预设类别和数据结构,OpenAI就为此提供了Structured Outputs功能。仅凭结构化响应格式,并不能把Jev与竞争对手区分开。要胜出,该模型必须不仅在速度或成本上更优,而且质量足够好。

TypeSafe公布的性能测试存在局限:它比较的是自己搭建的四个工作流,参照答案是其他AI模型的响应,而不是经过独立核验的正确解法;GPT-6 Astra也没有出现在评测中。Jev的定位是让软件在后台以更经济的方式做大量小型判断,这些判断是否足够可靠,企业需要针对自己的任务进行测试。开发者目前需要通过等待名单获得访问权限。

信息来源

The Decoder AI原始来源