产品LangChain Blog·原文 2026年9月20日

LangChain测试Jev评估模型:准确率超GPT-5.6,单次调用成本0.00035美元

TypeSafe AI的"System One"模型Jev在LangChain实验中500次二元判定全部匹配人类标注,单位方差比Claude Sonnet 4.6低92倍,但实验仅覆盖5个天气请求样本,团队承认结论尚未在生产工作流中验证。

AI解读:做AI智能体的人都会遇到同一个麻烦:怎么判断智能体跑得好不好。用代码写死规则便宜但只能测固定场景,让大模型当裁判灵活却又慢又贵还不稳定。LangChain这次试了第三条路——不是语言模型,而是一个专门做判断的模型。

Jev不生成文本,它只做选择题、打分和分类,直接返回带概率的结构化答案。根据TypeSafe AI的说法,推理速度最高比同类LLM快200倍,分类任务成本低400倍。快和便宜的直接后果是评测可以跑得更频繁、覆盖更多生产流量。

准确率数据看起来很强:500次通过/不通过判定,Jev与人类标注完全一致,GPT-5.6 Terra为99.8%,Luna 96.4%,Claude Sonnet 4.6为80.0%。但这个比较的样本只有5条天气请求的固定回放,不能推及所有智能体任务。

更值得注意的是稳定性:Jev的每案例方差均值为0.0000149,Claude是它的92倍,Terra是913倍。方差低不等于绝对正确,但准确且方差低才意味着评测结果在生产中可信。

每天产生1万条追踪的生产智能体,如果单次裁判成本只有0.00035美元,团队就能对更大比例的流量做在线评测并更早发现质量退化。不过LangChain也提醒,低价会放大错误——一个持续判错的廉价裁判同样能以规模化速度产生错误反馈。

LangChain发布博客,测试了TypeSafe AI的Jev模型能否充当智能体评测器。Jev不是生成文本的大语言模型,TypeSafe AI将其定义为"System One"模型:对状态进行快速、结构化判断,直接向软件返回带类型的答案和概率。

根据TypeSafe AI的说法,Jev在分类任务上比同类LLM推理速度快最多200倍,成本低400倍。

实验在LangSmith数据集上用Deep Agents构建的天气智能体回放场景,对比Jev与GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6。

在二元通过/不通过判定上,Jev在500次重复决策中与人类标注100%一致;Terra为99.8%,Luna为96.4%,Claude为80.0%。

Jev的每案例方差均值为0.0000149,Luna高出433倍,Terra高出913倍,Claude高出92倍。实验单次Jev判断成本为0.00035美元。

Jev支持的三种问题类型

LangChain介绍,Jev支持三类问题:Choice选择一个选项并返回概率与置信度,例如"最终答案是否基于检索到的证据",返回0.0到1.0的浮点数;Score按有序评分标准打分并返回概率与置信度,例如"答案有多大帮助",返回1到5的评分;Noul返回一个是/否判断为真的概率,例如"哪种搜索结果最能描述这次运行",返回searched_appropriately、searched_unnecessarily或failed_to_search之一。同一个状态可以并行评估多个原子问题。

实验设计与对比基准

LangChain用其开源智能体框架Deep Agents构建目标智能体,将测试集定义为LangSmith数据集,包含5条天气请求。每条样例捕获智能体响应并存为固定样例,每个裁判对5次捕获运行评估两个信号:quality(连续分数)和does_pass(二元决策)。

人类评审按同一评分标准对固定响应打标签,作为基准分数。准确率衡量与人类基准的一致程度,方差衡量裁判在相同智能体行为上是否给出相同判断。团队在100次重复中计算每个案例的方差,并统计与人类基准的一致率。

成本、延迟与在线评测

博客写道,当评测调用昂贵时,团队不得不在覆盖面和预算之间取舍。Jev在这个实验中每次调用0.00035美元,团队可以承担更多重复判断和更频繁的回归检查。对于在线评测,更低单价允许让更多裁判覆盖更大比例的生产追踪,产生更密集的反馈信号。

LangChain定义"信号价值"为二元基准一致率乘以二元可重复性。可重复性指同一追踪上两次独立调用返回相同判决的概率。高质量的廉价裁判可以让生产智能体每天1万条追踪的评测覆盖更广、更早发现质量变化并设置警报。

未解问题与限制

LangChain明确表示,实验无法解释Jev分数方差更小的原因。一个假设是模型针对不同输出类型做了优化:TypeSafe将Jev描述为训练来返回校准概率和类型化答案的决策模型,而自回归LLM裁判先生成文本再由评估器映射为分数。博客称这是观察性结果,不是训练目标导致低方差的证据。

团队还表示,仍需验证实验结果能否延续到其他智能体和生产工作流。此外,低成本会放大错误——一个持续判错的评估器可以大规模产生错误反馈。工程师仍需将人工审查和裁判对齐纳入工作流程。

可复现环境

实验通过LangSmith Gateway运行LLM裁判:GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6。Jev通过langchain-typesafe==0.0.1a2访问。运行时使用Deep Agents 0.7.15、LangChain OpenAI 1.6.2、LangSmith 0.12.6、Tavily Python 0.8.3。LLM裁判未设置temperature、top-p、seed或max tokens,使用各提供商默认值。Jev服务版本未出现在实验元数据中。GitHub仓库已公开。

后续活动

LangChain将于9月22日星期二与TypeSafe AI团队举办直播,主题是使用Jev构建智能体。

信息来源

LangChain Blog原始来源