-->
全世界引用最多的 AI 排名,叫 Arena Text——779 万人投票,391 个模型。它排的是「跟谁聊天更舒服」。而在你真正会纠结的那十几个顶级模型里,这个排名和「能不能真把活干完」几乎没有关系。同一家机构的另一个榜看得见,只是没人引用它。
在真实的软件任务测试里,deepseek-v4-pro 完成 63% 的任务,每个任务花 $0.24。claude-sonnet-5 完成 54%,每个任务花 $26.40。
又便宜 110 倍,又多做对 9 个百分点。而按聊天排名看,两者差不多。
| 模型 | 聊天名次 | 干活名次 | 差 | 实际是什么情况 |
|---|---|---|---|---|
| gemini-3.1-pro | 8 | 23 | −15 | 聊天排第 8,干活 12%,23 个里垫底 |
| muse-spark-1.2 | 2 | 13 | −11 | 聊天亚军,干活中游 |
| gpt-5.6-luna | 22 | 7 | +15 | 聊天倒数第二,干活 67%,每任务 $0.61 |
| gpt-5.6-terra | 18 | 4 | +14 | 干活 70%,每任务 $3.96 |
| grok-4.6 | 19 | 6 | +13 | 干活 67% |
| deepseek-v4-pro | 21 | 10 | +11 | 干活 63%,每任务 $0.24 |
同一家机构 Arena 还有一个 Agent 榜——统计 179 万次真实使用中,用户有没有确认"这活干完了"、模型被回怼时能不能改对。它和三个不同的实测榜都强相关。
| 用它去预测… | 写代码 | 读懂代码 | 终端操作 | 结论 |
|---|---|---|---|---|
| Arena Text(聊天) | 0.18 | 0.12 | 0.16 | 三个全看不见 |
| Arena Agent(实际使用) | 0.66 | 0.64 | 0.60 | 三个全看得见 |
这个数字怎么读:它叫相关系数,范围 −1 到 1。1 = 两个榜排得一模一样;0 = 完全没关系,等于抛硬币;0.6 以上 = 关系很强。0.18 基本等于没关系。
如果只是数据噪声,两个榜应该一起变差。但它们用的是同一批模型、同一个分数区间——一个全盲,一个全见。差别在于测什么,不在于测得准不准。
把弱模型也放进来一起比(从 llama-4 到 opus-4.6,跨度是前面那批的 2.5 倍),聊天排名和写代码能力的相关是 +0.83——很强。
所以准确的说法是:聊天排名能告诉你"这个模型是不是垃圾",但没法告诉你"这几个好模型里该挑哪个"。而后者才是你实际要做的决定——没人会在 llama-2 和 opus-5 之间纠结。
下面几条是这份分析自己的短板。放在这里是因为不放才叫不诚实。
| Text Elo | Agent | DeepSWE 写 | QnA 读 | Terminal | SWE-BP | |
|---|---|---|---|---|---|---|
| Arena Text Elo | — | +0.39 20 | +0.18 23 | +0.12 14 | +0.16 10 | +0.83 22 |
| Arena Agent | +0.39 20 | — | +0.66 21 | +0.64 10 | +0.60 8 | n=2 |
| DeepSWE(写) | +0.18 23 | +0.66 21 | — | +0.50 11 | +0.61 9 | n=3 |
| SWE-Atlas QnA(读) | +0.12 14 | +0.64 10 | +0.50 11 | — | +0.37 6 | +0.94 6 |
| Terminal-Bench 2.1 | +0.16 10 | +0.60 8 | +0.61 9 | +0.37 6 | — | n=3 |
| SWE-Bench Pro | +0.83 22 | n=2 | n=3 | +0.94 6 | n=3 | — |
ρ 后面的小字是 n,即该格建立在几个模型上。灰色格 n<10,仅为透明起见列出,不用于任何论断。
专测「读懂代码」的 SWE-Atlas QnA 与专测「写代码」的 DeepSWE 只相关 +0.50(n=11)——远不是同一个因子。干净的双向分离:deepseek-v4-pro 读 27.1% / 写 63%;glm-5.2 读 48.1% / 写 44%。控住「写」之后,「读」对 Agent 榜仍有 +0.60 的解释力(p=0.09,n=10)。这可能解释了为什么 Agent 榜看得见而 Text 榜看不见——它把读和写都装进去了。事前已声明为探索性,样本量不足。