产品LangChain Blog·原文 2026年9月24日本站收录 2026年9月25日

LangSmith推出Custom Apps:在平台内自建并共享智能体数据界面

LangChain发布LangSmith Custom Apps,允许团队用聊天提示或代码为LangSmith数据构建自定义UI,并直接在LangSmith工作区内发布、运行和共享,免去托管、认证与权限维护。

LangChain在其官方博客发布LangSmith Custom Apps,允许用户在LangSmith数据和运行之上构建、发布并运行自定义UI,并直接在LangSmith内部使用。

LangSmith已有面向调试、评估和改进智能体的默认界面,包括延迟、成本和错误率预置仪表盘,以及用于突出实验间回归的对比视图。但LangChain表示,团队常需要按自己的质量标准与评审流程与数据交互。

部分团队此前的做法是围绕LangSmith数据自建前端,借助编码智能体、LangSmith API和内部工具生成自己的界面。这类应用同样需要持续维护,包括托管、认证、权限和共享。

Custom Apps让用户用LangSmith数据构建想要的界面,发布到工作区,并跳过托管、认证和权限工作。

在Plus和Enterprise方案中,用户可以向LangSmith Chat描述想查看的数据和可视化方式,由Chat生成可运行的应用;也可以从提供的模板入手,用编码智能体基于LangSmith API自行构建。

应用发布后成为工作区内的共享界面,可用于周期性工作流并分享给队友,无需导出数据或临时重建同一静态视图。

Custom Apps的三种常见用法

LangChain列举了重复评审流程中较典型的场景:为标注人员提供合适上下文、自定义实验比较方式,以及让trace审查更聚焦。

人工反馈是改进AI系统的重要输入。自动评估能帮助发现模式,但仍需人工评审输出、判断行为并说明什么算好。评审所需信息因角色而异:工程师可能需要包含工具调用、元数据和中间步骤的完整trace,领域专家可能只需要用户请求、模型响应、相关上下文和清晰的评分标准。Custom Apps可创建匹配评审者工作流的标注界面,提供所需上下文、隐藏不需要的细节,并引导收集特定反馈。

实验用于评估智能体改动是否达到预期结果。发布改动前,通常需要查看对应用重要的单个结果、分段或失败模式,例如比较不同提示版本的输出、检查模型替换是否引入回归,或按客户细分、失败类别、模型提供商、内部评估标准切分结果。Custom Apps可围绕这些决策创建实验评审界面,突出最重要的切片、展示代表性示例、并排比较输出,或把结果打包成发布评审时使用的格式。当实验评审是周期性流程时,这能避免每次重建同一静态图表或自定义分析,而是复用一个持续连接LangSmith数据的共享应用。

trace审查流程通常随智能体类型变化。客服智能体可能关注语气和问题是否解决,只能通过阅读对话判断;研究智能体则可能依据来源和所需工具调用次数来评判。当审查按计划进行时,Custom Apps可围绕最常问的问题构建更聚焦的UI,例如行为在哪里改变、哪一步导致失败,或应用是否遵循预期流程。

可用方案与定价

Custom Apps面向Plus和Enterprise方案提供。Plus方案每个组织包含一个Custom App和聊天体验;Enterprise方案包含不限数量的Custom Apps以及聊天体验。

LangChain表示,通用使用和计费信息可参见其定价页面。用户可通过登录或注册LangSmith试用Custom Apps,详细说明见其文档。

信息来源

LangChain Blog原始来源