产品LangChain Blog·原文 2026年9月21日本站收录 2026年9月22日

Jev作为评估器接入LangSmith Evals,TypeSafe称分类任务成本可低至LLM的约 1/450

LangChain博客介绍,Jev以“System One模型”形式在LangSmith中充当评审,答案为类型化输出;官方测试中平均每次调用 0.44 秒,完整测试花费 0.34 美元,但该结果仅来自单个智能体的一次测试。

AI解读:LangSmith里现在可以拿Jev当评审模型用了。它不生成文字,而是直接返回是/否概率、选项或分数这三种类型化答案,用来判断智能体轨迹有没有泄露PII、用户意图是什么、用户有多不满这类问题。

它想解决的是评估成本。按TypeSafe AI的说法,Jev在分类任务上比同类LLM便宜约 450 倍、快约 200 倍;LangChain的意思是,便宜到可以让团队评估每一条轨迹,而不是只抽样一部分。

官方对比测试里,Jev和GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6一起比准确率、一致性、速度和成本。Jev每次调用平均 0.44 秒,完整判断集花 0.34 美元;作为对照,Claude Sonnet 4.6那次花了 28.17 美元。

不过这只是在一个智能体上做的一次测试,LangChain自己也是这么说的。而且TypeSafe目前不提供零数据保留,送去评估的提示和输出可能会被保留——要用在生产流量上的团队得先看清这条。

LangChain博客称,Jev现已作为评审模型(judge)在LangSmith的评估功能中可用。Jev由TypeSafe AI团队开发,被其称为“System One模型”:不生成文本,而是对给定状态返回类型化答案和概率。在评估场景中,这个状态可以是一条智能体轨迹、单条消息或任何待评估的上下文。

Jev能回答三类问题:noul返回是/否概率;choice从一组选项中选一个;score在有序量表上打分。LangChain举的例子是PII泄露(noul)、用户意图(choice)和用户挫败感(score),每个问题会成为一个反馈键(feedback key)。

LangChain表示,Jev可在同一请求中并行评估多个问题,因此针对一条轨迹增加第二个或第三个问题,响应时间和成本只是略微增加;而LLM评审要么每个标准一次单独调用,要么在一次提示中顺序推理,输出token随标准数量增长。

TypeSafe AI称,Jev在分类任务上比同类LLM便宜最多约 450 倍、快最多约 200 倍。LangChain强调这来自TypeSafe AI的说法。

接入方式:在LangSmith设置中先把TypeSafe添加为模型提供商并填入TYPESAFE_API_KEY;然后在tracing项目的Evaluators标签页新建LLM-as-a-Judge Evaluator,模型选TypeSafe提供商的jev-latest。与普通LLM评审不同的是,Jev评审定义的是“状态”加一组类型化问题,评级说明不放在状态里,而是写进问题。

官方测试数据:0.44 秒、0.34 美元,对比Claude Sonnet 4.6的 28.17 美元

LangChain在《Jev-as-a-Judge for Agent Evals》中将Jev与GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6在准确率、一致性、速度和成本上做了对比。LangChain称,Jev更准确、一致性“显著更高”,并且比这些LLM评审更快、更便宜。

具体数字是:Jev在每一项判断上都与人类评审一致,方差比LLM评审低 92 至 913 倍;平均每次调用 0.44 秒,而LLM评审为 2.16 至 2.83 秒。成本方面,Jev每次调用 0.00035 美元,跑完整套判断花 0.34 美元;GPT-5.6 Luna为 0.39 美元,GPT-5.6 Terra为 2.90 美元,Claude Sonnet 4.6为 28.17 美元。

LangChain明确说明,这只是在一个智能体上做的一次测试,结果是“有希望的早期迹象”,表明Jev-as-a-judge是继代码评估和LLM-as-a-judge之后的第三类智能体评估方式。

  • 平均每次调用:Jev 0.44秒,LLM评审 2.16–2.83 秒
  • 完整判断集成本:Jev 0.34美元,GPT-5.6 Luna 0.39美元,GPT-5.6 Terra 2.90美元,Claude Sonnet 4.6 28.17美元
  • 每次调用成本:Jev 0.00035美元
  • 一致性:Jev方差比LLM评审低 92–913 倍
  • 测试规模:单个智能体、一次测试

不替代LLM评审:适用条件是窄而类型化的高频判断

LangChain表示,Jev不会让LLM评审过时。经过微调的模型和开放模型也能以远低于前沿模型的成本充当有效评审;如果标准是开放式的、需要在给出结论之外还附上书面推理,LLM评审仍是更合适的工具。

按LangChain的说法,Jev适合的场景是:需要的判断窄且类型化,并且要在高量级下反复做。博客还提到,速度对在线评估尤其重要,因为评审要实时给线上流量打分;对PII泄露、提示注入、毒性这类安全风险反馈键,可以在反馈键上设置告警、触发webhook自动响应,评审越快,从出问题到采取行动的时间窗口越小。

需要注意的限制:LangChain在设置步骤中写明,TypeSafe目前不提供零数据保留(zero data retention),送去评估的提示和输出可能会被该提供商保留。

Jev-as-a-judge目前在LangSmith中已可用。LangChain称,后续还将于 9 月 22 日(周二)与TypeSafe AI团队举办直播,讨论如何在评估之外把Jev用于模型路由和工具风险闸门等环节。

  • TypeSafe目前不提供零数据保留,评估用的提示和输出可能被保留
  • 适合窄且类型化、高频的决策;开放式带书面推理的标准仍适合LLM评审
  • 可在反馈键上设置告警与webhook自动化响应
  • 9 月 22 日有关于Jev用于模型路由、工具风险闸门的直播

信息来源

LangChain Blog原始来源