以后想挑 AI 模型,可能不用再看厂商自己发的跑分榜了。9 月 16 日,B站正式上线「AI无限竞技场」——据官方介绍,这是一个把全站 UP主 的大模型实测汇总到一起的「竞技广场」,首期测评榜单也同步公布。 谁来打分?是真实用过的 UP主据了解,这份榜单不是实验室跑分,而是由各个领域的 UP主 拿上百个大模型做「真实场景实测」攒出来的,主题覆盖写代码、逻辑推理、协作、知识问答等。用大白话说:谁更适合干哪类活,是照着真实使用结果排的,而不是照着厂商给的参数排的。 和传统评测最大的不同是,竞技场不限定主题、也不限定测评维度。UP主 们可以自己出题——真实工作流、专业应用、甚至趣味脑洞都行,让不同模型做同一道题,谁强谁弱一眼就能看出来。首期榜单已经涵盖 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等主流模型。 首期谁排前面?据公布结果,GPT-6 Astra 在 10 位 UP主 的测评中拿下榜首,也是获得「榜首次数」最多的模型;GLM-5.3 紧随其后。更值得留意的是,前五名里国产大模型占了三席——这一轮国产模型的实测口碑,比很多人预期的要好。 为什么 B站 要搞这个据介绍,过去一年 B站 的 AI 生态增长很快:AI 知识内容的消费时长同比增长 72%,平均每月看 AI 内容的用户超过 1.9 亿。从模型发布、到大家讨论、测评、上手用到互相求助,这些需求天然适合视频和弹幕来承载。测评内容在社区里越积越多,官方干脆做了个「集合广场」把它们收拢起来。 按官方说法,竞技场的排名会实时更新,并持续向全站 UP主 开放报名。也就是说,这份榜单不会停在首发那一天——随着更多真实案例进来,模型的能力边界也会被检验得更清楚。 对普通用户来说,多了一个说人话的参考:想换 AI 工具时,直接看同题实测的结果,比看参数表省心。 来源:量子位《B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首》(哔哩哔哩提供,量子位获授权转载) 原文链接:https://www.qbitai.com/2026/09/490396.html |