推荐Lovart 中文版 - 一站式 AI 设计平台推荐一人企业Vibe Coding社区!热门AI设计工具新品免费AI编程工具 Trae - 智能编码助手Seedance2.5已上线新用户注册即领免费算力
UIED.CN今天偷学哪一招,朋友

B站把 AI 测评做成“电竞榜”了:100+ 模型同场,GPT-6 Astra 暂居第一

image.png

B站终于把:

AI 模型测评

做成排行榜了。

这个新东西叫:

AI 无限竞技场。

玩法非常 B 站。

不是给所有模型发一套固定卷子。

也不是只看:

MMLU;

SWE-bench;

数学;

推理

这些标准 Benchmark。

而是直接把不同领域 UP 主平时那些:

奇奇怪怪但又特别真实的 AI 实测

全部汇总起来。

让:

GPT;

Claude;

DeepSeek;

GLM;

Kimi;

千问;

豆包;

混元;

MiniMax;

Gemini

等模型一起:

上擂台。

然后看谁拿第一最多。

目前暂时坐在头把交椅的是:

GPT-6 Astra。




一、现在已经不只是“十几个模型比一下”

B站刚公布首期榜单时:

主要来自 10 项 UP 主测评。

但整个竞技场本身是:

持续更新的。

截至目前,官方页面已经收录:

43+ 测评主题。

参战:

100+ 大模型版本。

相关测评累计观看:

1687 万+。

所以这里并不是一张:

发布以后就不变的排行榜。

UP 主继续投稿。

新模型继续上线。

榜单也会:

实时变化。

有点像 AI 模型自己的:

联赛积分榜。




二、GPT-6 Astra目前拿了12次第一

按照当前实时榜单:

第1名

GPT-6 Astra

参测:

22 次

拿下榜首:

12 次

榜首率:

54.55%。

第2名

Claude Fable 5.1

参测:

12 次

榜首:

6 次

榜首率:

50%。

第3名

目前包括:

GLM-5.3

以及:

GPT-5.6 Sol

两款模型都拿到:

3 次榜首。

所以现阶段:

GPT-6 Astra 的领先优势还是比较明显。

不过需要注意:

这是动态榜单。

过几天新测评继续加入:

排名完全可能继续变化。




三、这个榜单不是看“总分”,而是看你拿过多少次第一

AI 无限竞技场有一个特别重要的规则:

按照模型在各测评主题中获得榜首的次数排名。

比如:

一个模型参加 20 个测评。

其中 8 个第一。

那它的:

榜首次数就是 8。

另一款模型只参加 5 个测评。

即使赢了 4 次:

最终排名依然可能在前者后面。

所以这个榜单并不是传统意义上的:

统一综合能力分数。

而更像:

冠军数量排行榜。

官方同时还会展示:

参测次数;

榜首次数;

榜首率。

这三个数据放在一起看:

才更有参考价值。




四、最有意思的是:UP主自己出题

传统 Benchmark 最大的问题之一就是:

题越来越固定。

模型厂商知道大家都在测:

代码;

数学;

推理;

知识。

甚至某些 Benchmark 本身可能已经进入训练数据。

B站这套玩法则完全不一样。

它没有规定:

必须测什么。

UP 主根据自己的专业方向:

自己出题。

所以现在竞技场里面已经出现很多:

非常“不标准”的 Benchmark。




五、有人直接拿祖传屎山代码拷打模型

比如编程区。

现在已经有:

屎山论剑·模型擂台战

祖传BUG挑战赛

程序员上岗实测

GTA5 19.8亿次 if 循环修复

AI复刻游戏

各种测试。

有 UP 主甚至直接拿:

真实项目;

历史 BUG;

复杂代码仓库

让多个模型一起修。

最终不是看:

模型说得多专业。

而是:

代码到底能不能跑。

这类测试其实很符合现在 Coding Agent 的真实用法。

毕竟用户真正关心的是:

我把仓库交给你,你到底能不能把 Bug 修掉?

标签

评论 0

最新评论

登录后发布评论并参与互动。

暂无评论,欢迎抢沙发。

推荐阅读

查看更多