B站上线AI无限竞技场:百大模型由UP主实测,GPT-6 Astra首期登顶
B站9月16日上线「AI无限竞技场」,汇集UP主对上百个大模型的实测并公布首期榜单;GPT-6 Astra在10位UP主测评中居首,前五名中国产模型占三席。
B站9月16日正式上线「AI无限竞技场」,首期大模型测评榜单同步公布。据B站方面信息,GPT-6 Astra在10个UP主测评中拿下榜首,打败GLM-5.3获得榜首次数冠军;前五名中,国产大模型占据三席。
「AI无限竞技场」被定义为汇集B站UP主大模型测评的竞技广场,由各领域UP主对上百个大模型进行真实场景实测,涵盖代码、推理、协作、知识等多种测评主题。B站称,它不设主题或测评维度限制,UP主以真实工作流、专业应用、趣味脑洞等自主命题,在同题PK中呈现各模型的实际表现差异。
首期榜单已涵盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型的对比测评。竞技场排名将实时更新,并持续面向全站UP主开放报名。
UP主自主命题,榜单实时更新
B站将「AI无限竞技场」与传统的跑分评测区分开,强调其不设主题或测评维度限制:来自各个分区的UP主以真实工作流、专业应用、趣味脑洞等自主命题,在同题PK中比较模型表现。
榜单并非一次性发布。B站表示,竞技场排名会实时更新,并持续面向全站UP主开放报名;随着更多测评案例加入,来自真实场景的样本测试会让模型能力得到更充分检验,也为用户了解AI能力边界提供更全面的内容视角。
上述关于平台机制和目标的表述来自B站提供的信息。
首期榜单:GPT-6 Astra登顶,前五国产占三席
首期榜单中,GPT-6 Astra在10个UP主测评中拿下榜首,并打败GLM-5.3获得榜首次数冠军。B站称前五名中国产大模型占据三席。
首期榜单覆盖的模型包括DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型。B站未在所提供的材料中披露各模型的具体得分、评分方法或完整名次。
B站称AI知识内容月均观看用户超1.9亿
B站给出的背景数据是:过去一年AI知识内容消费时长同比增长72%,月均观看AI内容的用户超过1.9亿。B站称,直播、视频、弹幕天然适配AI科技爱好者的信息获取和交流需求,大模型测评也在社区沉淀,涌现出大量各个领域、维度、主题的测评内容,「AI无限竞技场」这一测评集合广场顺势而生。
这些数字和因果描述均来自B站方面。材料未披露统计口径或时间区间。