产品LangChain Blog·原文 2026年9月25日本站收录 2026年9月26日

LangChain发文:用Jev决策模型与LangGraph编排构建生产级AI系统

TypeSafe AI发布不生成文本、只输出带概率结构化判断的决策模型Jev,LangChain撰文演示如何用LangGraph把它编排进文档审查与浏览器自动化等生产流程。

AI解读:TypeSafe AI上周发布Jev,一种不生成文本、直接返回代码可执行判断的决策模型。它的定位是只做"有界且需要语义判断"的分类或路由决策,官方基准称在路由、分类等窄任务上比主流大模型快至 200 倍、便宜至 400 倍。

过去三年智能体习惯把任何带模糊输入的任务都交给一个前沿大模型,代价是每次调用都为通用能力付费。Jev把这部分"判断"拆出来做成廉价原语,按TypeSafe的说法是"代码掌握工作流,AI处理窄而结构化的决策",即build prod, not god。

真正受影响的是一线做智能体落地的团队:LangGraph负责编排多个廉价决策、在置信度不足时升级到LLM或人工,并靠持久化执行、人工介入、LangSmith追踪保证可靠性。文档审查demo中Jev在分类环节比Sonnet快 5–6 倍,Stagehand的act() 中位延迟从 1.97 秒降到 0.46 秒。

需要看清限制:Jev不生成文本,多数场景下不能替代LLM,只接住有界选择,其余交给LLM。上述性能数字来自TypeSafe基准和早期测试,不是通用生产环境结论,且文中未给出成本节省比例或取代岗位等数据。

TypeSafe AI上周发布Jev,一种与主流LLM不同的模型:它不生成文本,而是输出代码可直接据此分支的结构化判断。LangChain在博客中撰文,说明如何用LangGraph编排Jev来构建生产级AI系统。

TypeSafe把自家哲学概括为"build prod, not god"(造生产工具,不造神)。它认为随着前沿LLM能力变强,开发者开始把所有带模糊输入的任务都交给它们,包括文本生成、文档抽取、搜索、排序、研究和分类,但"神很贵、也很慢"——即使只需要一个是或否的答案,每次调用仍要为通用能力买单。

Jev属于TypeSafe所称的"系统一模型",更常见的叫法是决策模型。用法是给它状态和一组问题,它返回带概率的类型化答案。TypeSafe官方基准称,在路由和分类这类许多智能体围绕搭建的窄决策任务上,Jev比领先LLM快至 200 倍、便宜至 400 倍。

Jev:返回概率的类型化判断,而非文本

TypeSafe文档把软件构建方式分为三类:传统软件由显式逻辑构成,每个分支都手写、可审计,但僵硬;智能体走向另一极,一个模型在每一步同时处理所有决策,控制流从代码移到提示词中;AI驱动的软件走中间路线——代码保留结构、负责精确计算,模型只出现在需要语义判断的分支上。

LangChain列出Jev适合作为生产系统组件的几个特性:结构化,答案以带概率的类型化结果返回,代码可以据此可预期地分支;并行,可以对同一状态一次性提出多个问题;快速,决策足够便宜,单次运行可以做很多次;自洽,系统一模型被设计为在重复评估中返回稳定答案。

LangChain特别提到,Jev的一致性是对LLM非确定性的改善。同样的输入,LLM多次运行可能给出不同答案,而Jev被设计为返回相同答案。在一项早期的Jev作为评判者(Jev-as-a-judge)实验中,其分数在 100 次重复运行中几乎没有变化,波动远小于测试过的任何LLM评判者。

LangGraph的来源与设计:状态即上下文

LangChain称,多年来帮助团队围绕LLM构建系统时,几乎每个人都会遇到两个问题:一是上下文管理很难,模型要做对决策,上下文窗口需要"恰好是下一步所需的信息",而这些信息模糊且随应用运行而变;二是模型驱动的系统仍要可靠,必须能承受失败、支持人工介入,并让每一步可观测。LangChain认为已有框架只解决了部分问题,且往往限制开发方式,于是自己构建了LangGraph。目前LangGraph每月下载量超过 6000 万次,被许多财富 50 强公司用于AI构建。

LangGraph应用由三部分组成:节点是工作单元,可以是普通代码、模型调用、工具调用或整个子图;状态是节点读取和更新的信息;边决定下一个运行哪个节点,可以是固定路径,也可以根据当前状态动态决定。任何图都可以成为更大图中的节点,小的、经过测试的部件可以组合成更大的系统。

随着图运行,每一步结果累积到状态中。状态成为后续每一步的上下文,同时决定接下来运行哪些节点。LangChain称,与其把领域知识塞进提示词,不如把它编码进图的拓扑结构:做哪些决策、按什么顺序、每个决策能看到什么状态。判断来自模型,但流程留在可检查和可测试的代码中。

可靠运行时:持久执行、人工介入与追踪

LangChain援引TypeSafe宣言称,只有组件可靠时才让它无人值守运行,只有能检查、测试和约束它时才在其上构建。LangGraph在运行时层面处理这些:持久化执行针对模型驱动步骤的非确定性——同一输入可能让模型走向不同调用和不同路径,失败后从头重跑可能不会重走同一路径,而检查点会在每一步持久化状态,让失败的运行带着已做出的决策恢复;人工介入通过中断(interrupt)在系统行动前暂停、批准、再继续;可观测性方面,模型驱动步骤每次行为不同,需要在LangSmith中查看追踪,了解做了什么决策以及为什么。

LangChain强调,这些并非LLM专属。Jev同样接收非结构化文本上下文并返回判断,因此需要同样的保证,而图会自动为每个节点提供这些保证。

文档审查示例:Jev分类,图按置信度升级

在诉讼场景中,公司必须在向对方提交(produce)文件前审查每一页,单个案件可能涉及数十万页。LangChain称其中大部分审查是同一种有界判断反复进行,因此适合Jev。

对每一页,Jev在一次请求中回答三个问题,每个答案对应图中的一条路线:这一页是否对请求有响应(responsive)?如果不是,就放到一边;是否包含个人信息?如果是,交由LLM做PII脱敏;是否可能享有特权(privileged)?如果是,进入attorney_review,暂停图等待人工介入。剩下的页面即可提交。

LangChain表示,他们用同一张图分别让Jev和Sonnet做分类,多次试验中Jev在分类步骤上快 5–6 倍。两次运行都在LangSmith中留有追踪,可以打开任意一页查看它走了哪条路线以及背后的概率。LangSmith还有针对Jev这类决策模型的专门视图,展示每次决策的输入和校准后的输出。实际使用中页面是并行处理的。

智能的"大解绑":廉价模型做默认,前沿模型做例外

LangChain引用Jaya Gupta所称的"智能的大解绑"(the Great Unbundling of Intelligence):过去三年大多数智能体把所有事都通过一个前沿LLM路由,接下来这些能力会被拆开,各自交给能处理它的最便宜模型。Jev抽出的是判断,返回结构化决策而非生成文本。部件拆开后,需要有东西通过路由每一步、决定何时升级,把它们重新缝合起来,这就是运行时的职责。

浏览器自动化是一个实例。浏览器智能体读取页面并决定下一步做什么:点击按钮、填写字段、滚动。这听起来很开放,但在任意时刻,页面提供的可交互元素是有限的,所以下一步其实是从列表中选择。Browserbase围绕这个思路重写了Stagehand的act():Stagehand标记页面上的可交互元素,Jev选择动作类型和最佳候选元素,任何低于 0.7 置信度阈值的情况都回退到LLM。早期测试中,act() 的中位延迟从 1.97 秒降到 0.46 秒,约快 4.3 倍。

LangChain明确表示,在大多数用例中Jev并不完全替代LLM。它处理自己有把握的有界选择,其余交给LLM。这正是Gupta描述的方向转变:从"默认用前沿模型、之后再优化"变为"默认用便宜模型、例外时用前沿模型"。LangChain预计会看到更多这种模式:在动作空间受限的地方用决策模型做快速、廉价的调用,把LLM留给开放式推理和较小模型不确定的情况。文章提到一名开发者本周的话:"我基本上正在把我们现有的每个智能体都改造成由Jev驱动的工作流。"

上手入口

LangChain在文末列出几个资源:用LangGraph决策模型技能优化现有智能体,把有界决策的LLM调用换成Jev(灵感来自jevify技能);了解LangGraph运行时的工作原理,见"3 years of graph engineering with LangGraph";了解Jev如何嵌入智能体框架(包括模型路由和自动模式分类器),见"Building a harness with Jev";用LangSmith监控和评估智能体。

信息来源

LangChain Blog原始来源