蚂蚁集团发布金融专用模型Ling-3.0-flash-Fin,智能指数 23 分
该模型基于Ling-3.0-flash构建,124B总参数、5.1B激活参数,MIT许可,通过OpenRouter提供API,包括限速免费端点。
AI解读:蚂蚁集团发布Ling-3.0-flash-Fin,一个面向金融场景的开源权重推理模型,跑在 124B总参数、每token激活 5.1B的MoE架构上,MIT许可。它对需要查证来源、搭估值表格、写报告的人最直接有用——这些正是蚂蚁说它联合金融机构和行业专家开发时要支持的任务。
衡量它实际能力的几个数字并不一致。Artificial Analysis智能指数 23 分,金融与会计指数 24 分,和同门多模态模型Ling-3.0-flash-VL的金融分持平;专业文档任务GDPval-AA v2得 1171 Elo,比VL的 1225 低约 50 分,AA-Briefcase 967对 986 也略低。
更值得注意的是效率与错误率的取舍。它以约一半激活参数追平MiniMax-M2.7的智能指数 23 分,但每道任务平均输出约 6.7 万token,比VL多约 34%,是MiniMax-M2.7的 3.2 倍;商业知识准确率高于VL(17% 对 11%),但幻觉率也更高(非幻觉率 67% 对 81%)。
它仍受限于复杂代理任务。AutomationBench-AA仅 7%(VL为 16%),两个模型在Terminal-Bench v4.0上都是 0%。想用它做跨业务应用工作流或终端操作的话,公开数据还撑不起这个期待。以上结论基于Artificial Analysis公布的评测摘要,不涉及蚂蚁未披露的信息。
蚂蚁集团发布金融场景的开放权重推理模型Ling-3.0-flash-Fin,基于此前的Ling-3.0-flash构建。据蚂蚁集团公告,该模型由公司与金融机构及行业专家共同开发,用于支持金融研究,包括核查来源、搭建估值表格和撰写报告。
Artificial Analysis的评测结果显示,Ling-3.0-flash-Fin在Artificial Analysis智能指数上得 23 分,在金融与会计指数上得 24 分,处于智能指数与激活参数构成的帕累托前沿上。
模型规格:124B总参数,每token激活 5.1B(MoE);上下文窗口 256K token;仅文本输入输出;MIT许可;通过OpenRouter提供API,包括一个限速免费端点。其上一款支持图像和视频输入的Ling-3.0-flash-VL在智能指数上得 25 分。
效率与输出长度的取舍
Ling-3.0-flash-Fin以约一半的激活参数追平MiniMax-M2.7的智能指数分数:两者均为 23 分,Flash-Fin每token激活 5.1B参数,MiniMax-M2.7为 10B。
但输出更长。Ling-3.0-flash-Fin在智能指数每项任务上平均输出约 6.7 万token,比Ling-3.0-flash-VL的约 5 万token多约 34%,是MiniMax-M2.7(约 2.1 万)的 3.2 倍。
从总参数维度看,两者均为 124B总参数,而Qwen3.8 27B(xhigh)以 27B总参数得 34 分,两款Ling模型都位于总参数前沿之下。
金融与专业任务得分
在Artificial Analysis金融与会计指数上,Ling-3.0-flash-Fin得 24 分,与Ling-3.0-flash-VL持平。该指数综合商业知识、推理、代理工作、长上下文分析和非幻觉表现。
分项上,Fin的商业知识准确率高于VL(17% 对 11%),但商业知识幻觉也更严重,非幻觉率为 67%,VL为 81%。
专业工作方面,Fin在GDPval-AA v2上得 1171 Elo,测试代理完成专业工作任务的能力,比VL的 1225 低约 50 分,但高于MiniMax-M2.7的 1087 分。AA-Briefcase上Fin得 967 Elo,略低于VL的 986;该基准用大量源文件生成表格、演示文稿和备忘录。
对比VL,Fin通过的评分项更少(23.5% 对 24.9%),分析质量Elo更低(866 对 907),但呈现Elo略高(1095 对 1076)。Artificial Analysis指出这有些意外,因为Fin不具备VL的图像输入能力。
代理任务仍是弱项
在测试跨业务应用工作流并需遵守护栏的AutomationBench-AA上,Ling-3.0-flash-Fin得 7%,Ling-3.0-flash-VL为 16%。在测试高难度终端操作的Terminal-Bench v4.0上,两款模型均为 0%。
以上为Ling-3.0-flash-Fin在Artificial Analysis智能指数v4.3的 10 项评测中的结果。