产品LangChain Blog·原文 2026年9月24日

LangChain发布smithtune:把智能体轨迹直接变成微调数据集

LangChain推出LangSmith Fine-Tuning与配套CLI smithtune,从LangSmith轨迹抽取数据、在Fireworks或Baseten上训练、回LangSmith评估并部署,目前处于公开测试阶段。

AI解读:LangChain这次发布的不是又一个训练框架,而是一条从“智能体跑过的记录”到“能上线的小模型”的流水线。smithtune把LangSmith里的轨迹拉出来、过滤成数据集、交给Fireworks或Baseten做LoRA训练,再用LangSmith做对比评估,最后直接部署。目标用户是那些已经把智能体跑在生产里、但懒得手搓数据管道的团队。

它主打的是监督微调(SFT),思路很直白:给模型看到“正确做法”的输入输出,让它模仿。LangChain强调轨迹格式记录了每一轮模型看到的真实上下文,包括工具定义和延迟加载等细节,避免朴素导出丢掉信息。这是个具体优势,但也只对能用好轨迹的人成立。

LangChain自己给了两组实测:在内部IssueBench子集上,Kimi K3微调后得分 96.0,高于基座 90.0 和GPT-5.6 Sol的 87.0;代码审查任务里Qwen-3.8-27B的F1从 48.9% 升到 53.7%,同时模型调用减少 29.8%、工具请求减少 29.4%。数字出自LangChain内部评测,不是第三方复现。

还有个反面案例值得注意:一次选择性较差的训练集反而让SFT后F1下降,团队回头加强了数据筛选才恢复。这等于承认微调能不能涨分,主要取决于数据挑得好不好,而不是工具本身。

对普通读者来说不用急着动手,这仍是公开测试版,需要LangSmith账号、Fireworks或Baseten的API key。真正该评估的是已经在生产里积累了大量智能体轨迹、且反复出现同类错误的团队:如果更好的提示词和编排已经压不出提升,SFT才是下一步。

LangChain发布LangSmith Fine-Tuning及其配套命令行工具smithtune,用于把LangSmith中的智能体轨迹(trajectory)转换成自定义微调模型。该工具目前处于公开测试(Public Beta)阶段。

smithtune覆盖从数据集构建到部署的完整流程:从LangSmith轨迹抽取和准备数据、在Fireworks或Baseten上训练、在LangSmith中评估。官方称可以直接运行smithtune,也可以让编码智能体执行命令并检查结果。

它支持什么,以及轨迹为什么重要

smithtune面向后训练(post-training),目前支持监督微调(SFT),即用“好行为”的示例训练模型:给出输入输出,模型通过更新权重来模仿这些行为。LangChain表示其轨迹数据在设计上就是为支持SFT准备的。

一条轨迹是按顺序排列的消息、工具调用和工具结果,展示智能体如何完成任务。LangSmith从trace或thread中组装该序列,把支持的消息格式统一表示、保留工具定义、去除重复历史。

LangChain特别强调,SFT需要让学生模型拿到教师模型产出成功结果时的精确上下文。在长时间运行的复杂智能体中,工具可用性上下文常会变化(例如延迟加载工具),简单导出最终消息列表会丢掉这些细节;LangSmith的轨迹格式记录模型每一轮实际看到的内容,smithtune因此能把每个动作与其真实上下文配对。

三步流程:造数据集、训练、评估部署

构建数据集阶段,smithtune从LangSmith追踪项目把轨迹拉取到本地目录DIR,可加过滤器;随后与人类及其智能体协作识别“好”轨迹的特征、生成评估量规(rubric),并派出一组智能体审查和筛选适合SFT的轨迹;最后把确定的黄金轨迹上传到LangSmith数据集,供训练和评估使用。过程中它还处理序列长度过滤、以及按训练/验证/测试切分等细节。

训练前可运行smithtune plan让人类检查所选模型、训练样本数量和超参数(学习率、批大小、轮数)。运行smithtune train后,任务提交给Fireworks托管的SFT或Baseten Loops,两者都支持在准备好的轨迹上做LoRA训练,不需要用户自行准备GPU或管理训练基础设施。训练期间smithtune会检查验证集表现,并选择验证损失最低的检查点。

训练结束后运行smithtune evaluate,用内置的回放评估对比所选检查点与基座模型:模型需要完成黄金轨迹中的动作,由裁判根据真实记录评分。CLI返回LangSmith对比链接,可比较分数、检查单条回复和工具选择,看微调在哪里有帮助或引入了退化。满意则用smithtune deploy部署模型并接入应用;不满意则调整数据集或训练设置后重来。

LangChain自测的两个案例与数字

LangChain用两个自家常用智能体验证该流程。Engine分析智能体轨迹以发现失败并归类问题,团队用其精简版本测试SFT能否提升识别和组织问题的能力。他们筛选出好的轨迹微调Kimi K3,结果在内部IssueBench问题检测与归类的子集上,微调模型得分 96.0,高于基座Kimi K3的 90.0 和GPT-5.6 Sol的 87.0。官方称基座Kimi已经很强,通过编排工程(harness engineering)已无法继续提升。

OpenSWE Review用于审查真实代码仓库中的改动,团队在内部真实PR评测集上测试Qwen-3.8-27B:SFT把F1从 48.9% 提升到 53.7%,同时每次评审的模型调用减少 29.8%(55.9 次降至 39.2 次),工具请求减少 29.4%(65.8 次降至 46.5 次)。精确率从 62.9% 升至 81.5%,召回率保持 40.0%。

LangChain也披露了一个失败案例:较早、选择性较差的训练集在SFT后反而降低了F1分数。团队随后回到数据整理流程,为每条轨迹增加审查环节,刻意多采样那些智能体认为确实存在潜在问题的轨迹。

官方给出的适用条件与前置要求

LangChain建议:如果应用执行重复任务,并且你有它应如何表现的示例,SFT尤其有用;应寻找希望模型学会的一致模式,例如遵循工作流、依据工具结果决定下一步、验证自身工作。

官方还建议团队先做编排工程(harness engineering),看更好的编排能否带来满意表现;如果智能体在任务上仍反复犯错,且你有展示正确做法的轨迹,SFT才是合适的候选。LangChain称最成功的后训练运行往往来自在数据选择上的投入,并认为领域专家与智能体一起审查轨迹能提高后训练成功概率。

使用LangSmith Fine-Tuning需要:一个有智能体轨迹的LangSmith账号、Fireworks或Baseten的API key,以及smithtune CLI。工具已发布在GitHub,可通过安装仓库中的smithtune skill让编码智能体端到端驱动微调流程。

信息来源

LangChain Blog原始来源