扬声·CNDoor.Vip 首页 资讯 AI生活 查看内容

B站「AI无限竞技场」上线:百大AI模型同台PK,前五国产占三席 ...

2026-9-17 07:01| 发布者: 糖糊碌| 查看: 18| 评论: 0

摘要: 以后想挑 AI 模型,可能不用再看厂商自己发的跑分榜了。9 月 16 日,B站正式上线「AI无限竞技场」——据官方介绍,这是一个把全站 UP主 的大模型实测汇总到一起的「竞技广场」,首期测评榜单也同步公布。 谁来打分? ...

B站AI无限竞技场上线

以后想挑 AI 模型,可能不用再看厂商自己发的跑分榜了。9 月 16 日,B站正式上线「AI无限竞技场」——据官方介绍,这是一个把全站 UP主 的大模型实测汇总到一起的「竞技广场」,首期测评榜单也同步公布。

谁来打分?是真实用过的 UP主

据了解,这份榜单不是实验室跑分,而是由各个领域的 UP主 拿上百个大模型做「真实场景实测」攒出来的,主题覆盖写代码、逻辑推理、协作、知识问答等。用大白话说:谁更适合干哪类活,是照着真实使用结果排的,而不是照着厂商给的参数排的。

和传统评测最大的不同是,竞技场不限定主题、也不限定测评维度。UP主 们可以自己出题——真实工作流、专业应用、甚至趣味脑洞都行,让不同模型做同一道题,谁强谁弱一眼就能看出来。首期榜单已经涵盖 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等主流模型。

首期谁排前面?

据公布结果,GPT-6 Astra 在 10 位 UP主 的测评中拿下榜首,也是获得「榜首次数」最多的模型;GLM-5.3 紧随其后。更值得留意的是,前五名里国产大模型占了三席——这一轮国产模型的实测口碑,比很多人预期的要好。

为什么 B站 要搞这个

据介绍,过去一年 B站 的 AI 生态增长很快:AI 知识内容的消费时长同比增长 72%,平均每月看 AI 内容的用户超过 1.9 亿。从模型发布、到大家讨论、测评、上手用到互相求助,这些需求天然适合视频和弹幕来承载。测评内容在社区里越积越多,官方干脆做了个「集合广场」把它们收拢起来。

按官方说法,竞技场的排名会实时更新,并持续向全站 UP主 开放报名。也就是说,这份榜单不会停在首发那一天——随着更多真实案例进来,模型的能力边界也会被检验得更清楚。

对普通用户来说,多了一个说人话的参考:想换 AI 工具时,直接看同题实测的结果,比看参数表省心。

来源:量子位《B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首》(哔哩哔哩提供,量子位获授权转载)

原文链接:https://www.qbitai.com/2026/09/490396.html


鲜花

握手

雷人

路过

鸡蛋
扬声 · CNDoor.Vip 汇聚 AI 资讯、办公效率、写作、图鉴等实用内容,为新手提供从入门到上手的 AI 指南。我们相信:AI 不该只是技术圈的事——把复杂的事说人话,让每个人都用得上。
  • 手机博客
  • 手机扬声
Copyright © 2014-2026 扬声 · 菜鸟门 版权所有 All Rights Reserved. 冀ICP备2025120842号
关灯 返回顶部
返回顶部