Artificial Analysis发布能力指数v1.1,为六大职业领域调整评测权重
该版本将AutomationBench-AA的智能体工具使用能力加入六个职业指数,用AA-Briefcase替换或补充原有智能体知识工作评测,并在长上下文评测中为金融与运营、战略与运营、法律领域新增GDP.pdf。
AI解读:Artificial Analysis更新了Capability Indices到v1.1,核心变化是让每个职业领域的评测权重更贴近该领域实际工作。它把Intelligence Index v4.3的评测按领域切片,再与专业评测组合,而不是所有领域共用同一套权重。
对金融与会计、战略与运营、法律、医疗健康、工程、经济六个领域,v1.1新增了来自AutomationBench-AA的智能体工具使用评测,并去掉或替换了部分旧评测。金融、战略运营、法律三个领域还加入了GDP.pdf长上下文评测,医疗健康新增MLCR-AA长上下文推理。
真正使用这些指数选型的人需要注意:权重变了,不同模型在领域榜上的相对位置可能变化,但这反映的是评测与职业任务的匹配度调整,而不是模型本身能力发生了突变。
Artificial Analysis发布了Capability Indices v1.1,用更强的领域调优重新调整六个职业领域的评测组合和权重。
该机构称,v1.1把核心Intelligence Index v4.3的评测按领域切片,再与专业评测结合,让每个指数更贴近其覆盖的工作。
六个领域新增智能体工具使用,权重从 0% 上调
金融与会计、战略与运营、法律、医疗健康、工程、经济六个领域的能力指数都新增了Agentic Tool Use评测,来源为AutomationBench-AA。其中金融与会计取自AutomationBench-AA的Finance切片;战略与运营、法律、医疗健康取自Operations或Operations and Support切片。
各领域Agentic Tool Use权重变化:金融与会计从 0% 升至 10%;战略与运营从 0% 升至 30%;法律从 0% 升至 5%;医疗健康从 0% 升至 10%;工程从 0% 升至 15%(以Terminal-Bench v4.0形式)。经济未列出该评测。
AA-Briefcase进入智能体知识工作评测,替换部分旧基准
六个领域都将AA-Briefcase加入Agentic Knowledge Work评测,与GDPval-AA v2并列。金融与会计、战略与运营、法律、医疗健康、工程、经济的智能体知识工作权重分别为 30%、35%、25%、25%、20%、25%。
此前用于该维度的Agentic Customer Interaction(𝜏³-Banking)在金融与会计、战略与运营、法律、医疗健康四个领域被移除。
长上下文评测分领域调整:金融、战略运营、法律新增GDP.pdf
金融与会计、战略与运营、法律三个领域在Long-Context评测中新增GDP.pdf,与LCR并列,权重保持 5%、5% 和 10% 不变。
医疗健康领域新增Long-Context Reasoning评测MLCR-AA,权重从 0% 升至 15%,该评测用于评估在冗长临床记录中的推理能力。经济领域Long-Context Reasoning权重从 15% 降至 5%。
各领域评测权重明细
金融与会计:Business Knowledge 30%、Agentic Knowledge Work 30%、Reasoning 20%、Agentic Tool Use 10%、Long-Context 5%、Non-Hallucination 5%。
战略与运营:Agentic Knowledge Work 35%、Business Knowledge 30%、Agentic Tool Use 30%、Long-Context 5%。
法律:Legal Knowledge 35%、Agentic Knowledge Work 25%、Reasoning 15%、Long-Context 10%、Non-Hallucination 10%、Agentic Tool Use 5%。
医疗健康:Medical & Health Knowledge 30%、Agentic Knowledge Work 25%、Long-Context Reasoning 15%、Non-Hallucination 10%、Reasoning 10%、Agentic Tool Use 10%。
工程:Engineering Knowledge 35%、Reasoning 30%(HLE与CritPt)、Agentic Knowledge Work 20%、Agentic Terminal Use 15%(Terminal-Bench v4.0);GPQA Diamond从Reasoning中移除。
经济:Economics Knowledge 35%、Reasoning 35%、Agentic Knowledge Work 25%、Long-Context Reasoning 5%。