产品LangChain Blog·原文 2026年9月25日本站收录 2026年9月26日

LangSmith发布Engine v2、托管深度智能体 0.8 与微调功能

LangChain在Interrupt NYC公布多项LangSmith更新:Engine v2用红队测试提前发现问题并自动验证修复,托管深度智能体 0.8 增加用户级记忆与内置网络搜索,还推出轨迹查看、微调CLI和自定义应用。

AI解读:LangChain在Interrupt NYC活动上发布了LangSmith的一系列更新,核心思路是把智能体从开发到上线的运行时、可观测性、评估和微调环节串成一条流水线。对正在把领域智能体推进生产的团队来说,变化集中在少写胶水代码、提前发现问题、降低调试和微调门槛。

Engine v2负责自动找问题、验证修复:新增红队测试,用生产轨迹和代码仓库生成假设并验证未暴露的失败;还能识别性能趋势和重复工具调用等低效行为。对跑在LangSmith Deployment上的智能体,Engine会先用出问题的输入复现,再在一组评估集上测试候选修复,找到能解决的那一个后让用户一键开PR。

托管深度智能体 0.8 解决的是生产运行的具体麻烦:用户级记忆把每个认证调用者的上下文和共享记忆隔开,运行时不复制内容,可在各层设访问策略;外部连接支持智能体和用户自有凭证;Slack支持文件传输,新增HTTP通道可接任何发JSON webhook的服务,还内置了由Parallel驱动的网络搜索,团队不用单独开账号或配API key。

轨迹视图把一次智能体会话中人类、AI和工具的消息按时间顺序聚合,主智能体和子智能体都包含在内,方便定位行为变化,也方便不写代码的领域专家打分标注。微调方面,LangSmith Fine-Tuning让团队做监督微调,CLI工具smithtune负责从轨迹构建数据集、用Baseten或Fireworks训练、用LangSmith评估并部署模型。

自定义应用则允许团队基于LangSmith API构建界面并发布到工作区,用于标注、实验对比和轨迹审查等重复流程。

LangChain在Interrupt NYC活动上公布了LangSmith的多项更新,覆盖智能体开发生命周期中的运行时、可观测性与评估环节。公司称,这一批发布围绕两个支柱:让智能体在生产环境中有记忆、通道、工具和安全执行环境,以及通过可观测性和评估理解行为、衡量质量。

自 5 月上线以来,LangSmith Engine已帮助工程师分析超过 6000 万条轨迹,诊断了数万个问题。此次Engine v2的重点是问题检测、测试和验证。

Managed Deep Agents将Deep Agents harness与托管基础设施结合,最新版本 0.8 处理生产运行中的四类问题:智能体记忆、认证、通道和工具管理。

LangChain同时发布了LangSmith Trajectories、LangSmith Fine-Tuning和Custom Apps,分别面向会话调试、开源模型后训练和自定义界面。所有发布均以公司博客内容为依据。

Engine v2:红队测试、发现低效、自动验证修复

Engine是LangSmith平台内的智能体,用于自动化智能体开发生命周期各步骤的工作。Engine v2引入红队测试能力,使用生产轨迹和代码仓库生成关于潜在问题的假设,测试这些假设,并把确认的失败提交审查,目标是在问题出现在生产环境之前发现它们。

在问题类型上,Engine现在除了错误和未满足的用户请求,还能识别错误率、延迟和成本方面的性能趋势,以及重复工具调用、不必要的长轨迹等低效智能体工作。

对于运行在LangSmith Deployment上的智能体,Engine可以在人工审查和部署之前验证建议的修复。流程是:先用出问题的输入对智能体运行以确认问题,再在更广泛的评估集上测试候选修复,直到找到能解决该问题的一个;随后把修复呈现给最终用户,用户可以点击打开PR快速部署。

公司称,下一版自托管LangSmith将支持Engine的BYOK(自带密钥)。

  • Engine自 5 月上线以来已分析超 6000 万条轨迹,诊断数万个问题。
  • 红队测试用生产轨迹和仓库生成问题假设并验证失败。
  • 检测范围扩展到错误率、延迟、成本趋势及重复工具调用等低效行为。
  • 自动修复验证目前适用于跑在LangSmith Deployment上的智能体,找到修复后一键开PR。

托管深度智能体 0.8:用户级记忆与内置网络搜索

Managed Deep Agents此前已支持持久化智能体记忆,0.8 新增用户级记忆,让智能体可以存储按每个认证用户划分的上下文。这一层用于存放调用者特定的上下文,并与共享的智能体级记忆分开。公司说明,运行时不会在层与层之间复制内容,访问策略可以在每一层定义,以防止用户级信息泄漏到对话中。

外部连接方面,Managed Deep Agents现在同时支持智能体自有凭证和用户自有凭证,例如GitHub和Notion。

通道方面,Slack支持扩展到文件传输,用户可以把日志、表格、合同、截图等文件直接发给智能体。新增的HTTP通道支持团队把智能体连接到任何能发送JSON webhook的服务,公司称这对分布在多个通道上面向客户的智能体尤其有用。

0.8 还把网络搜索作为预构建工具内置,由Parallel提供支持,智能体可以获取当前信息,团队无需单独设置供应商账号、API key或自定义工具。

  • 用户级记忆与智能体级共享记忆分离,运行时不跨层复制内容,各层可设访问策略。
  • 外部连接支持智能体和用户自有凭证。
  • Slack新增文件传输;HTTP通道可接任何发送JSON webhook的服务。
  • 内置网络搜索由Parallel提供,无需单独账号或API key。

轨迹视图:把智能体会话按时间顺序摊开

LangSmith Trajectories提供智能体会话的对话式视图。一次轨迹聚合主智能体和所有子智能体中来自人类、AI和工具的消息,并按时间顺序显示,公司称这样能更快调试,因为团队可以快速看到行为在哪里发生变化或出错。

轨迹也让审查流程更容易。领域专家审查对智能体准确性很关键,但这些审查者往往不是构建智能体的人。轨迹给他们一个可读的会话视图,可以直接打分、标记和标注,而不必解析执行元数据和其他细节。

LangSmith的在线评估器可以对轨迹打分,为判断智能体在整个会话中的行为提供更好的输入。公司称轨迹是改进循环的重要组成部分。

  • 轨迹聚合人类、AI和工具消息,按时间顺序展示主智能体和子智能体。
  • 面向不构建智能体的领域专家,可直接打分、标记、标注。
  • LangSmith在线评估器可对轨迹打分。

微调与自定义应用:从轨迹到训练数据,从数据到界面

LangSmith Fine-Tuning的目标是让团队不用手工搭建微调流水线,就能用上微调后的开源模型。公司称,用自有数据和智能训练的模型在特定任务上往往可以做到与通用前沿模型一样好甚至更好,同时成本和延迟低得多。

LangSmith Fine-Tuning支持监督微调(SFT),用高质量任务示例训练开源模型。CLI工具smithtune负责把轨迹转成有用的训练数据,覆盖整个微调过程:从轨迹构建和准备数据集,用Baseten或Fireworks训练模型,用LangSmith评估结果,以及部署微调后的模型并连接到应用。公司称内部对SmithTune做了基准测试以评估工作流质量,并表示对结果感到兴奋,完整分析另有文章。

Custom Apps允许团队在LangSmith数据之上构建、发布和运行自定义界面。LangSmith已为轨迹审查、实验对比、标注和评估分析等常见工作流提供默认界面,但公司称客户希望有更符合自身工作流和质量标准的定制方式。团队可以使用模板、应用内聊天或编码智能体指引,基于LangSmith API构建,并把应用发布到自己的LangSmith工作区;发布后,该应用成为重复工作流的共享界面。

公司称这些更新最终服务于让每家公司拥有自己的智能,即构建定制化、领域特定的智能体和应用来解决自己关心的问题。

  • Fine-Tuning支持监督微调,smithtune CLI覆盖数据集准备、Baseten或Fireworks训练、LangSmith评估、部署服务。
  • 公司称微调开源模型在特定任务上可比通用前沿模型更省成本和延迟。
  • Custom Apps允许基于LangSmith API构建界面并发布到工作区,用于标注、实验对比、轨迹审查等重复流程。

信息来源

LangChain Blog原始来源