排名怎么算
综合多家公开评测,了解排名背后的证据与方法。
0—100
共同的证据,清楚的顺序。
综合多家公开评测,在完整排名中尽量减少与已知成绩的冲突。综合榜和四类榜单都最多展示前 30 名。
共识指数把支持原排名的证据差异换算为 0—100,方便比较,不是正确率或能力差距的百分比。支持接近时可以同分,名次仍由完整证据决定。
- 01
先确认,是同一个模型
统一各家榜单的名称和版本。同一模型的不同推理档位只选一个代表配置,选择规则预先确定,不挑最高分。匿名测试代号和混用其他模型完成任务的成绩排除;已正式公开的 Preview 版本可以参加。
- 02
让真正测过的模型相互比较
只比较同一评测中的真实成绩。双方都有公开误差时,误差范围内的微小差异更接近平局,不当成确定胜负。没有测到,就没有这一场比较。
- 03
先定票权,再汇总共同意见
每项评测使用预先确定的预算。综合榜至少要求三家评测机构、三个证据家族与三个专项覆盖;同一来源重复抓取或展示切片,不会凭空增加票权。
- 04
寻找冲突最少的完整排名
不同评测的意见可能冲突。我们选择违背共同证据净票权最少的一条顺序,再单独计算展示指数。缺测不补零分,也不猜测未公开的成绩。
综合测试、真人盲选、专项评测,一起看。
综合评测占 30%,真人盲选占 10%,各项专项评测合计占 60%。新增评测先核对公开说明中的重叠关系,再从对应份额中分配;缺失份额不转给其他评测。
- 综合评测30%AA Index
- 真人盲选10%Arena Text · Arena 创作盲选
- 编程与设计12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · 编程综合
- 写作与表达9%LiveBench · 语言与指令 · Creative Writing v3 · Longform Writing
- 数学与推理12%LiveBench · 推理与数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
- 知识与事实6%SimpleQA Verified · GPQA Diamond
- 视觉理解6%Arena Vision
- 工具与办公6%APEX-Agents 1.1 · τ³-Banking
- 中文与多语言6%AA 中文/多语言
- 行业专业任务3%Vals Finance Agent
编程、推理、知识、专业办公分别寻找真实评测,分类分独立计算。视觉理解与多语言证据继续保留在综合榜;调整分类名称不会增加同一份成绩的投票权。综合分不等于分类分的算术平均。分类通常至少有两项有效评测、五个可比较型号才展示。知识目前由 Epoch 的两套评测支持,并明确说明同机构的局限。创作偏好、网页开发等证据继续用于综合榜,首版不单设审美和写作榜。
你可能还想知道
为什么有的模型证据较少,也能上榜?
“证据敏感”是什么意思?
前面的模型一定在两两比较中获胜吗?
为什么排名可能和我的体验不同?
新模型什么时候会出现?
某家榜单暂时打不开,会怎样?
综合指数会和专项评测重复计分吗?
价格或速度会影响排名吗?
查看计算细节与当前版本
方法版本:2026.09-public-consensus-v15。采用加权不完整 Kemeny 排序。每对共同参评模型汇总净支持 M;目标是最小化所有被排反的净支持之和。整数优化返回最优状态和目标上下界,只有完整通过验证的结果才用于正式发布。
双方有明确标准误时,净支持取 2Φ(分差 / 合成标准误) − 1,默认零协方差;其他比较只取原始领先方向。未知误差并非零误差,小分差按序数处理仍是局限。票权针对潜在模型对,覆盖型号多的来源会使用更多比较位置,不能把名义预算解读为最终名次的精确贡献率。
展示指数保留原排序:逐对反转相邻模型的先后,允许其余模型重排,计算最少增加的逆向净支持。沿原排名累加这些非负支持差,再相对固定参照组用 sigmoid 映射到 0—100。替代顺序同样最优时保留零间距,显示保留一位小数,不人为设置最低分差。指数不参与反向排序;入榜集合、参照型号与证据变化仍会影响指数,分差不等于真实能力距离。同代价求解固定型号 ID 次序;整数优化使用 HiGHS 求解器(highs 1.15.3),误差换算的正态分布函数与 SciPy norm.cdf 采用同一算法;来源、协议、参评资格和每轮计算输入均保存版本。未连接到共同证据网络时不发布跨分量的假精确顺序。
固定参照型号:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。参照组用于指数尺度,不指定任何厂商应排第几;不同分类的指数不直接比较。