研 究 追 踪 · LEADERBOARD MIRROR

大模型榜单镜像

主流公开评测榜单快照 · 按能力维度分类
本页镜像第三方公开榜单,按「综合 / 代码 / Agent / 推理 / 多模态 / 视频 / 机器人」七类组织,每个榜标注它测什么能力维度。数据为快照,实时以各榜单官网为准。仅作研究参考,不构成投资建议。
数据截至 2026.08.24 · 更新节奏:周度更新(机器人为季度) · 厂商以品牌色标识,归属标签 /

综合 · Overall

一个数看模型总体强弱:聚合指数与真人盲测。

AA 综合智能指数

Artificial Analysis
官网 ↗
Intelligence Index v4.1(0–85,越高越强)2026-08-24 快照

聚合 GPQA / HLE / LiveCodeBench / τ²-bench 等十项基准的综合智能分,兼顾价格与速度。华尔街与产业界最广引用的「一个数看模型强弱」综合指标。

#模型分数价格 / 备注
1/169 Claude Opus 5 (max)Anthropic 63 $2.34/task · 1M ctx · 居首
2/169 Claude Opus 5 (xhigh)Anthropic 63 $1.80/task · 1M ctx
3/169 Claude Fable 5 (with fallback)Anthropic 62 $3.14/task · 1M ctx
4/169 Claude Opus 5 (high)Anthropic 61 $1.23/task · 1M ctx
5/169 GPT-5.6 Sol (max)OpenAI 61 $1.23/task · 1M ctx · 74 t/s
6/169 Grok 4.6 (high)xAI 61 $0.84/task · 500k ctx · 61 t/s
7/169 Grok 4.6 (xhigh)xAI 60 $1.04/task · 500k ctx · 新进
8/169 Kimi K3 (max)月之暗面 Kimi 60 $0.84/task · 1.05M ctx · 国产最高·开源第一
9/169 GLM-5.3 (max)智谱 Z.ai 60 $0.68/task · 1M ctx · 新模型跃升
10/169 GPT-5.6 Sol (xhigh)OpenAI 59 $0.81/task · 1M ctx
11/169 Grok 4.6 (medium)xAI 59 $0.67/task · 500k ctx
12/169 Claude Opus 5 (medium)Anthropic 59 $0.72/task · 1M ctx
13/169 Qwen3.8 Max阿里 Alibaba 58 $1.13/task · 1M ctx · 47 t/s
14/169 Qwen3.8 2.4T A95B阿里 Alibaba 58 $1.09/task · 984k ctx · 开源第二
15/169 GPT-5.6 Sol (high)OpenAI 57 $0.55/task · 1M ctx
16/169 DeepSeek V4 Pro 0813 (max)DeepSeek 53 $0.25/task · 1M ctx · 71 t/s · 开源第三
数据源 artificialanalysis.ai。开源第一:Kimi K3 (max) 60(榜第8·国产最高)· 开源第二:Qwen3.8 2.4T A95B 58 · 开源第三:DeepSeek V4 Pro 0813 53。本周 GLM-5.3 发布跃居 60(智谱),Grok 4.6 xhigh 新进 60。

LMArena 文本竞技场

LMArena (原 Chatbot Arena)
官网 ↗
Arena Elo(数百万真实用户盲测偏好)2026-08-24 快照(stealthy 渲染实抓真实模型名·非推断)

UC Berkeley LMSYS 发起,数百万真实用户对两个模型的回答盲选投票,按 Elo 排名。最贴近真实使用偏好、公信力最高的综合榜。

#模型Elo票数
1/390 Claude Fable 5Anthropic 1508 24.3k 票 · 续居首
2/390 Claude Opus 4.6 (high)Anthropic 1504 72.4k 票
3/390 Claude Opus 4.7 (high)Anthropic 1502 60.2k 票
4/390 Muse Spark 1.2 (xHigh)Meta 1498 3.3k 票 · 初步
5/390 Claude Opus 4.6Anthropic 1497 76.4k 票
6/390 Claude Opus 5 (high)Anthropic 1493 27.6k 票
7/390 Muse Spark 1.1Meta 1491 20.2k 票
8/390 Gemini 3.7 Flash (high)Google 1490 5.7k 票 · 初步
9/390 Kimi K3 (max)月之暗面 Kimi 1489 15.1k 票 · 国产最高·开源第一
10/390 Claude Opus 5 (max)Anthropic 1487 13.4k 票
11/390 GLM-5.3 (max)智谱 Z.ai 1487 3.8k 票 · 开源第二·新模型跃升
12/390 Gemini 3.1 Pro PreviewGoogle 1486 99.2k 票 · 票数最高
13/390 Gemini 3 ProGoogle 1485 41.5k 票
14/390 GPT-5.6 Sol (xhigh)OpenAI 1482 19.5k 票
15/390 GPT-5.5 (high)OpenAI 1482 59.5k 票 · 大众主力
16/390 Qwen3.8 Max阿里 Alibaba 1481 10.0k 票 · 国产第三
数据源 lmarena.ai(经 scrapling 渲染 arena.ai 实抓真实 slug)。本周模型名实抓非推断,榜首 Claude Fable 5 1508(+2 续居首)。GLM-5.3 (max) 发布以 1487 取代 GLM-5.2 成开源最高(与 AA 榜交叉印证),Kimi K3 (max) 1489 国产最高。名次按 Elo 序展示,全榜约 390 模型。

代码 · Coding

编程 Agent 能力——从真实 repo 修 bug 到终端里干活,当前厂商发布必争之地。

SWE-bench Verified

SWE-bench Verified
官网 ↗
Resolve Rate(真实 GitHub issue 修复率)2026-08-24 快照

从真实开源仓库取 500 个已人工验证的 issue,模型要读懂代码库、定位 bug、提交能通过测试的补丁。业界公认的「编程 Agent 能力」第一硬榜,几乎所有厂商发布时必刷。

#模型分数备注
1/111 Claude Fable 5Anthropic 95.0%
2/111 Claude Mythos PreviewAnthropic 93.9%
3/111 Claude Opus 4.8Anthropic 88.6%
4/111 Claude Opus 4.7Anthropic 87.6%
5/111 Claude Sonnet 5Anthropic 85.2%
6/111 Claude Opus 4.5Anthropic 80.9%
7/111 Claude Opus 4.6Anthropic 80.8%
8/111 Gemini 3.1 ProGoogle 80.6%
8/111 DeepSeek-V4-Pro-MaxDeepSeek 80.6% 开源
10/111 MiniMax M3MiniMax 80.5% 开源
11/111 Qwen3.7 Max阿里 Alibaba 80.4%
12/111 Kimi K2.6月之暗面 Kimi 80.2% 开源
18/111 MiMo-V2.5-Pro小米 Xiaomi 78.9% 开源
21/111 Hy3腾讯 Tencent 78.0% 开源
24/111 GLM-5智谱 Z.ai 77.8% 开源
30/111 Seed 2.0 Pro字节 ByteDance 76.5%
数据源 llm-stats.com(标准化协议)。全榜 111 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

Terminal-Bench 2.0

Terminal-Bench 2.0
官网 ↗
任务完成率(终端环境)2026-08-24 快照

在真实终端里完成软件工程、系统管理、数据处理任务——模型要自己敲命令、读报错、迭代。2025 下半年崛起最快的 agentic 编程新战场,头部三家争 SOTA 的焦点。

#模型分数备注
1/51 GPT-5.5OpenAI 82.7%
2/51 Claude Mythos PreviewAnthropic 82.0%
3/51 Claude Sonnet 5Anthropic 80.4%
4/51 GPT-5.3 CodexOpenAI 77.3%
5/51 Gemini 3.5 FlashGoogle 76.2%
6/51 GPT-5.4OpenAI 75.1%
7/51 Claude Opus 4.8Anthropic 74.6%
8/51 Qwen3.7-Plus阿里 Alibaba 70.3%
9/51 Qwen3.7 Max阿里 Alibaba 69.7%
10/51 Claude Opus 4.7Anthropic 69.4%
11/51 GLM-5.1智谱 Z.ai 69.0% 开源
13/51 MiMo-V2.5-Pro小米 Xiaomi 68.4% 开源
14/51 DeepSeek-V4-Pro-MaxDeepSeek 67.9% 开源
15/51 Kimi K2.6月之暗面 Kimi 66.7% 开源
26/51 MiniMax M2.7MiniMax 57.0% 开源
35/51 Step-3.5-Flash阶跃 StepFun 51.0% 开源
数据源 llm-stats.com(标准化协议)。全榜 51 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

LiveCodeBench

LiveCodeBench
官网 ↗
Pass Rate(防污染竞赛编程)2026-08-24 快照

持续从 LeetCode / AtCoder / CodeForces 抓最新竞赛题,按发布日期滚动切窗——只考模型没见过的新题,从机制上防止「背题」污染。考的是纯算法编程能力。

#模型分数备注
1/75 DeepSeek-V4-Pro-MaxDeepSeek 93.5% 开源
2/75 DeepSeek-V4-Flash-MaxDeepSeek 91.6% 开源
3/75 DeepSeek-V4-Flash-0423DeepSeek 88.4% 开源
4/75 Solar Pro 4Upstage 87.8%
5/75 DeepSeek-V3.2 (Thinking)DeepSeek 83.3% 开源
5/75 DeepSeek-V3.2DeepSeek 83.3% 开源
7/75 MiniMax M2MiniMax 83.0% 开源
8/75 LongCat-Flash-Thinking-2601美团 Meituan 82.8% 开源
9/75 Nemotron 3 Super (120B A12B)NVIDIA 81.2% 开源
10/75 Grok-3 MinixAI 80.4%
20/75 GLM-4.5智谱 Z.ai 72.9% 开源
23/75 Qwen3 235B A22B阿里 Alibaba 70.7% 开源
42/75 Kimi K2-Instruct-0905月之暗面 Kimi 53.7% 开源
数据源 llm-stats.com(标准化协议)。全榜 75 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

Agent · 工具调用

调用外部工具、多步编排、联网调查——Agent 时代最贴近生产的能力。

MCP Atlas

MCP Atlas
官网 ↗
任务成功率(MCP 工具编排)2026-08-24 快照

考模型通过 MCP(Model Context Protocol,Anthropic 提出的工具调用标准协议)调用外部工具、多步编排完成任务的能力。Agent 时代最贴近真实生产的工具调用榜。

#模型分数备注
1/33 Muse Spark 1.1Meta 88.1%
2/33 Kimi K3月之暗面 Kimi 84.2% 开源
3/33 Seed 2.1 Pro字节 ByteDance 83.8%
4/33 Gemini 3.5 FlashGoogle 83.6%
5/33 Claude Opus 4.8Anthropic 82.2%
6/33 Seed 2.1 Turbo字节 ByteDance 80.3%
7/33 Inkling-SmallThinking Machines Lab 79.6% 开源
8/33 Hy3腾讯 Tencent 79.1% 开源
9/33 Claude Opus 4.7Anthropic 77.3%
10/33 GLM-5.2智谱 Z.ai 76.8% 开源
11/33 Qwen3.7 Max阿里 Alibaba 76.4%
15/33 MiniMax M3MiniMax 74.2% 开源
17/33 DeepSeek-V4-Pro-MaxDeepSeek 73.6% 开源
数据源 llm-stats.com(标准化协议)。全榜 33 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

BrowseComp

BrowseComp
官网 ↗
准确率(浏览器搜索 Agent)2026-08-24 快照

OpenAI 出的浏览器智能体榜:模型要自己上网、多轮检索、交叉验证,回答需要深度联网调查才能查到的刁钻问题。考的是「搜索型 Agent」的信息获取与推理。

#模型分数备注
1/62 Kimi K3月之暗面 Kimi 91.2% 开源
2/62 Claude Opus 5Anthropic 90.8%
3/62 GPT-5.6 SolOpenAI 90.4%
4/62 GPT-5.5 ProOpenAI 90.1%
5/62 GPT-5.6 TerraOpenAI 87.5%
6/62 Claude Mythos PreviewAnthropic 86.9%
7/62 Kimi K2.6月之暗面 Kimi 86.3% 开源
8/62 Seed 2.1 Pro字节 ByteDance 86.2%
9/62 Gemini 3.1 ProGoogle 85.9%
10/62 Seed 2.1 Turbo字节 ByteDance 84.9%
14/62 Hy3腾讯 Tencent 84.2% 开源
16/62 MiniMax M3MiniMax 83.5% 开源
17/62 DeepSeek-V4-Pro-MaxDeepSeek 83.4% 开源
20/62 GLM-5.1智谱 Z.ai 79.3% 开源
30/62 Step-3.5-Flash阶跃 StepFun 69.0% 开源
30/62 Qwen3.5-397B-A17B阿里 Alibaba 69.0% 开源
数据源 llm-stats.com(标准化协议)。全榜 62 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

Toolathlon

Toolathlon
官网 ↗
任务成功率(长程多工具)2026-08-24 快照

香港科大出的「工具全能赛」:跨多个真实应用、长链条地调用几十种工具完成复杂任务,比单步工具调用难得多。考 Agent 的长程规划与工具协同。

#模型分数备注
1/37 Muse Spark 1.1Meta 75.6%
2/37 DeepSeek-V4-Pro-0813DeepSeek 74.1% 开源
3/37 Kimi K3月之暗面 Kimi 73.2% 开源
4/37 GLM-5.3智谱 Z.ai 73.0% 开源
5/37 Qwen3.8 Max阿里 Alibaba 72.5% 开源
6/37 DeepSeek-V4-Flash-0731DeepSeek 70.3% 开源
7/37 Claude Opus 4.8Anthropic 59.9%
8/37 GPT-5.6 SolOpenAI 58.0%
9/37 Gemini 3.5 FlashGoogle 56.5%
10/37 GPT-5.5OpenAI 55.6%
17/37 Seed 2.1 Pro字节 ByteDance 50.6%
22/37 Hy3腾讯 Tencent 48.5% 开源
25/37 MiniMax M2.7MiniMax 46.3% 开源
数据源 llm-stats.com(标准化协议)。全榜 37 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

推理 · Reasoning

博士级科学、最难知识、奥赛数学——智力天花板的硬指标。

GPQA Diamond

GPQA Diamond
官网 ↗
准确率(博士级科学问答)2026-08-24 快照

生物/物理/化学的博士级难题,博士专家也只能答对 65%、能联网的非专家仅 34%——从设计上就杜绝「搜得到」。海外六家发布时 100% 引用的智力硬指标。

#模型分数备注
1/239 Claude Mythos PreviewAnthropic 94.6%
1/239 GPT-5.6 SolOpenAI 94.6%
3/239 Gemini 3.1 ProGoogle 94.3%
4/239 Claude Opus 4.7Anthropic 94.2%
5/239 Claude Opus 4.8Anthropic 93.6%
5/239 GPT-5.5OpenAI 93.6%
7/239 Kimi K3月之暗面 Kimi 93.5% 开源
8/239 GPT-5.2 ProOpenAI 93.2%
9/239 Grok 4.5xAI 93.0%
10/239 GPT-5.6 TerraOpenAI 92.9%
12/239 Qwen3.8 Max阿里 Alibaba 92.6% 开源
18/239 GLM-5.2智谱 Z.ai 91.2% 开源
20/239 Hy3腾讯 Tencent 90.4% 开源
24/239 DeepSeek-V4-Pro-MaxDeepSeek 90.1% 开源
30/239 Seed 2.0 Pro字节 ByteDance 88.9%
58/239 ERNIE 5.0百度 Baidu 85.0%
数据源 llm-stats.com(标准化协议)。全榜 239 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

人类最后考试 HLE

Humanity's Last Exam
官网 ↗
准确率(最难知识 · 含私有题防作弊)2026-08-24 快照

2500 道数学/科学/人文领域专家把关的顶尖难题,号称「人类知识最后一道闭卷考」,并保留私有 holdout 题集防刷分。当前最抗污染的知识天花板榜。

#模型分数备注
1/99 Claude Opus 5Anthropic 64.7%
1/99 Claude Mythos PreviewAnthropic 64.7%
3/99 Claude Fable 5Anthropic 64.5%
4/99 GLM-5.3智谱 Z.ai 62.5% 开源
5/99 Muse Spark 1.1Meta 62.1%
6/99 DeepSeek-V4-Pro-0813DeepSeek 60.0% 开源
7/99 Muse SparkMeta 58.4%
8/99 Claude Opus 4.8Anthropic 57.9%
9/99 Claude Sonnet 5Anthropic 57.4%
10/99 GPT-5.5 ProOpenAI 57.2%
11/99 Kimi K3月之暗面 Kimi 56.0% 开源
12/99 Seed 2.1 Pro字节 ByteDance 55.7%
24/99 Qwen3.5-27B阿里 Alibaba 48.5% 开源
39/99 ERNIE 5.0百度 Baidu 39.0%
45/99 MiMo-V2.5-Pro小米 Xiaomi 34.0% 开源
53/99 LongCat-Flash-Thinking-2601美团 Meituan 25.2% 开源
数据源 llm-stats.com(标准化协议)。全榜 99 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

HMMT 数学竞赛 2025

HMMT 2025
官网 ↗
准确率(哈佛-MIT 数学竞赛)2026-08-24 快照

哈佛-MIT 数学锦标赛真题,奥赛级难度。相比已被刷爆到多家并列满分的 AIME,HMMT 仍有区分度,是当前数学推理最能拉开差距的榜。

#模型分数备注
1/33 GPT-5.2 ProOpenAI 100.0%
2/33 GPT-5.2OpenAI 99.4%
3/33 DeepSeek-V3.2-SpecialeDeepSeek 99.2% 开源
4/33 Kimi K2-Thinking-0905月之暗面 Kimi 97.5% 开源
5/33 Qwen3.6 Plus阿里 Alibaba 96.7%
6/33 Kimi K2.5月之暗面 Kimi 95.4% 开源
7/33 Qwen3.5-397B-A17B阿里 Alibaba 94.8% 开源
8/33 Nemotron 3 Super (120B A12B)NVIDIA 94.7% 开源
9/33 GLM-5.2智谱 Z.ai 94.4% 开源
10/33 GLM-5.1智谱 Z.ai 94.0% 开源
22/33 MiMo-V2-Flash小米 Xiaomi 84.4% 开源
数据源 llm-stats.com(标准化协议)。全榜 33 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

多模态 · Multimodal

看懂图文混合与科学图表的能力。

MMMU-Pro

MMMU-Pro
官网 ↗
准确率(跨学科图文理解)2026-08-24 快照

增强版 MMMU:30 个学科的大学级图文混合题,堵死了「不看图靠蒙」的捷径。考多模态大模型真正的看图理解与跨学科推理,是多模态第一综合榜。

#模型分数备注
1/68 Gemini 3.5 FlashGoogle 83.6%
2/68 GPT-5.5OpenAI 83.2%
3/68 GPT-5.6 SolOpenAI 83.0%
4/68 Seed 2.1 Pro字节 ByteDance 82.7%
5/68 Qwen3.8 Max阿里 Alibaba 82.3% 开源
6/68 Seed 2.1 Turbo字节 ByteDance 82.2%
7/68 Kimi K3月之暗面 Kimi 81.6% 开源
8/68 GPT-5.4OpenAI 81.2%
8/68 Gemini 3 FlashGoogle 81.2%
10/68 Gemini 3 ProGoogle 81.0%
21/68 MiniMax M3MiniMax 78.1% 开源
22/68 MiMo-V2.5小米 Xiaomi 77.9% 开源
数据源 llm-stats.com(标准化协议)。全榜 68 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

CharXiv 图表推理

CharXiv-Reasoning
官网 ↗
准确率(科学图表推理)2026-08-24 快照

取自 arXiv 论文的真实科学图表,问需要读懂坐标轴、趋势、数据关系才能答的推理题。考的是模型对复杂图表的深度理解——投研看图场景高度相关。

#模型分数备注
1/51 Claude Mythos PreviewAnthropic 93.2%
2/51 Kimi K3月之暗面 Kimi 91.3% 开源
3/51 Claude Opus 4.7Anthropic 91.0%
4/51 Qwen3.8-27B阿里 Alibaba 90.2% 开源
5/51 Claude Opus 4.8Anthropic 89.9%
6/51 Gemini 3.6 FlashGoogle 89.4%
7/51 Gemini 3.7 FlashGoogle 88.7%
8/51 Muse Spark 1.1Meta 88.4%
9/51 Claude Sonnet 5Anthropic 88.3%
10/51 Kimi K2.6月之暗面 Kimi 86.7% 开源
11/51 Seed 2.1 Pro字节 ByteDance 86.4%
21/51 MiMo-V2.5小米 Xiaomi 81.0% 开源
数据源 llm-stats.com(标准化协议)。全榜 51 个模型,此处取 Top 10 + 国产代表。分数为官方/自报,实时以官网为准。

视频生成 · Video

文生/图生视频的真人盲测偏好,国产厂商在此领跑全球。

AA 文生视频竞技场

AA Video Arena · Text-to-Video
官网 ↗
Arena Elo(真人盲测偏好,含音频档)2026-08-24 快照

文生视频:真人对同一提示词生成的两段视频盲选,按 Bradley-Terry 算 Elo。考画面质量、运动合理性、指令还原度。国产厂商(字节/快手/阿里)在此领跑全球。

#模型Elo票数 · 发布 · 定价
1/24 Wan 3.0阿里 Alibaba 1244 5679 票 · Aug 2026 · Coming soon
2/24 Gemini Omni FlashGoogle 1238 16181 票 · May 2026 · $6.00 /min
4/24 Dreamina Seedance 2.0 720p字节 ByteDance 1221 22864 票 · Mar 2026 · $9.07 /min
5/24 Wan2.7-260612阿里 Alibaba 1156 17231 票 · Jun 2026 · $9.00 /min
6/24 HappyHorse-1.1阿里 Alibaba 1145 17334 票 · Jun 2026 · $9.90 /min
7/24 HappyHorse-1.0阿里 Alibaba 1121 9311 票 · Apr 2026 · $13.20 /min
8/24 Wan 2.7阿里 Alibaba 1107 5749 票 · Apr 2026 · $9.00 /min
9/24 Kling 3.0 1080p (Pro)快手 Kling 1106 20666 票 · Feb 2026 · $20.16 /min
10/24 SkyReels V4昆仑万维 Skywork 1101 6231 票 · Mar 2026 · $21.00 /min
11/24 Kling 3.0 720p (Standard)快手 Kling 1098 19830 票 · Feb 2026 · $15.12 /min
12/24 Veo 3.1 LiteGoogle 1090 8609 票 · Mar 2026 · $4.80 /min
13/24 Veo 3.1Google 1089 9165 票 · Jan 2026 · $24.00 /min
17/24 Vidu Q3 Pro生数 Vidu 1075 18521 票 · Jan 2026 · $9.60 /min
18/24 PixVerse V6爱诗 PixVerse 1072 10361 票 · Mar 2026 · $6.90 /min
数据源 Artificial Analysis Video Arena。含音频档 Elo,共 24 个模型取 Top 12。

AA 图生视频竞技场

AA Video Arena · Image-to-Video
官网 ↗
Arena Elo(真人盲测偏好,含音频档)2026-08-24 快照

图生视频:真人对同一提示词生成的两段视频盲选,按 Bradley-Terry 算 Elo。考画面质量、运动合理性、指令还原度。国产厂商(字节/快手/阿里)在此领跑全球。

#模型Elo票数 · 发布 · 定价
1/23 Dreamina Seedance 2.0 720p字节 ByteDance 1191 14990 票 · Mar 2026 · $9.07 /min
3/23 Gemini Omni FlashGoogle 1182 9625 票 · May 2026 · $6.00 /min
4/23 grok-imagine-video-1.5xAI 1111 5832 票 · May 2026 · $8.40 /min
5/23 HappyHorse-1.1阿里 Alibaba 1106 10942 票 · Jun 2026 · $9.90 /min
7/23 Wan 2.7阿里 Alibaba 1085 5113 票 · Apr 2026 · $9.00 /min
8/23 SkyReels V4昆仑万维 Skywork 1084 5359 票 · Mar 2026 · $21.00 /min
9/23 HappyHorse-1.0阿里 Alibaba 1084 8343 票 · Apr 2026 · $13.20 /min
10/23 Veo 3.1Google 1084 8426 票 · Jan 2026 · $24.00 /min
11/23 grok-imagine-videoxAI 1076 15180 票 · Jan 2026 · $4.20 /min
12/23 Veo 3.1 FastGoogle 1073 14146 票 · Jan 2026 · $9.00 /min
13/23 Kling 3.0 1080p (Pro)快手 Kling 1072 14761 票 · Feb 2026 · $20.16 /min
14/23 Veo 3.1 LiteGoogle 1067 7727 票 · Mar 2026 · $4.80 /min
16/23 PixVerse V6爱诗 PixVerse 1065 9732 票 · Mar 2026 · $6.90 /min
17/23 Vidu Q3 Pro生数 Vidu 1060 15066 票 · Jan 2026 · $9.60 /min
数据源 Artificial Analysis Video Arena。含音频档 Elo,共 23 个模型取 Top 12。

机器人 · Robotics

具身智能 VLA 模型的真机操作能力(早期、季度手工维护)。

机器人真机操作榜

RoboChallenge · Table 30
官网 ↗
真机任务成功率(Table 30 桌面操作,共 30 项)2026-08-24(季度手工更新)

具身智能领域唯一「真机实测 + 覆盖商业玩家 + 中美同台」的公开榜,由 Dexmal 原力灵机联合 Hugging Face 发起。VLA(视觉-语言-动作)模型要在真实机械臂上完成 30 项桌面操作,按成功率排名。上榜以国产队伍为主,近期引发刷榜争议,本身即投研信号。

#模型成功率综合分 / 说明
1/5 Era0星动纪元 Robotera 64.33% 综合分 76.34 · 真机第一
2/5 DM0Dexmal 原力灵机 62.00% 综合分 72.25 · 榜方自研
3/5 GigaBrain-0.1GigaBrain 51.67% 综合分 68.34
4/5 Spirit-v1.5千寻智能 Spirit 51.00% 综合分 67.19 · 商业化 VLA
5/5 Lira (generalist)Atlas 具身 45.00% 综合分 59.83
数据源 robochallenge.ai 官方主榜(Models Rank),季度手工维护。VLA=Vision-Language-Action,机器人领域的「大模型」。海外 π0/GR00T 等标杆未在此榜正式提交,故不列。