聚合 GPQA / HLE / LiveCodeBench / τ²-bench 等十项基准的综合智能分,兼顾价格与速度。华尔街与产业界最广引用的「一个数看模型强弱」综合指标。
| # | 模型 | 分数 | 价格 / 备注 |
|---|---|---|---|
| 1/169 | ✳Claude Opus 5 (max)Anthropic美 | 63 | $2.34/task · 1M ctx · 居首 |
| 2/169 | ✳Claude Opus 5 (xhigh)Anthropic美 | 63 | $1.80/task · 1M ctx |
| 3/169 | ✳Claude Fable 5 (with fallback)Anthropic美 | 62 | $3.14/task · 1M ctx |
| 4/169 | ✳Claude Opus 5 (high)Anthropic美 | 61 | $1.23/task · 1M ctx |
| 5/169 | ◉GPT-5.6 Sol (max)OpenAI美 | 61 | $1.23/task · 1M ctx · 74 t/s |
| 6/169 | ✕Grok 4.6 (high)xAI美 | 61 | $0.84/task · 500k ctx · 61 t/s |
| 7/169 | ✕Grok 4.6 (xhigh)xAI美 | 60 | $1.04/task · 500k ctx · 新进 |
| 8/169 | KKimi K3 (max)月之暗面 Kimi中 | 60 | $0.84/task · 1.05M ctx · 国产最高·开源第一 |
| 9/169 | 智GLM-5.3 (max)智谱 Z.ai中 | 60 | $0.68/task · 1M ctx · 新模型跃升 |
| 10/169 | ◉GPT-5.6 Sol (xhigh)OpenAI美 | 59 | $0.81/task · 1M ctx |
| 11/169 | ✕Grok 4.6 (medium)xAI美 | 59 | $0.67/task · 500k ctx |
| 12/169 | ✳Claude Opus 5 (medium)Anthropic美 | 59 | $0.72/task · 1M ctx |
| 13/169 | 通Qwen3.8 Max阿里 Alibaba中 | 58 | $1.13/task · 1M ctx · 47 t/s |
| 14/169 | 通Qwen3.8 2.4T A95B阿里 Alibaba中 | 58 | $1.09/task · 984k ctx · 开源第二 |
| 15/169 | ◉GPT-5.6 Sol (high)OpenAI美 | 57 | $0.55/task · 1M ctx |
| 16/169 | 深DeepSeek V4 Pro 0813 (max)DeepSeek中 | 53 | $0.25/task · 1M ctx · 71 t/s · 开源第三 |
UC Berkeley LMSYS 发起,数百万真实用户对两个模型的回答盲选投票,按 Elo 排名。最贴近真实使用偏好、公信力最高的综合榜。
| # | 模型 | Elo | 票数 |
|---|---|---|---|
| 1/390 | ✳Claude Fable 5Anthropic美 | 1508 | 24.3k 票 · 续居首 |
| 2/390 | ✳Claude Opus 4.6 (high)Anthropic美 | 1504 | 72.4k 票 |
| 3/390 | ✳Claude Opus 4.7 (high)Anthropic美 | 1502 | 60.2k 票 |
| 4/390 | MMuse Spark 1.2 (xHigh)Meta美 | 1498 | 3.3k 票 · 初步 |
| 5/390 | ✳Claude Opus 4.6Anthropic美 | 1497 | 76.4k 票 |
| 6/390 | ✳Claude Opus 5 (high)Anthropic美 | 1493 | 27.6k 票 |
| 7/390 | MMuse Spark 1.1Meta美 | 1491 | 20.2k 票 |
| 8/390 | ◆Gemini 3.7 Flash (high)Google美 | 1490 | 5.7k 票 · 初步 |
| 9/390 | KKimi K3 (max)月之暗面 Kimi中 | 1489 | 15.1k 票 · 国产最高·开源第一 |
| 10/390 | ✳Claude Opus 5 (max)Anthropic美 | 1487 | 13.4k 票 |
| 11/390 | 智GLM-5.3 (max)智谱 Z.ai中 | 1487 | 3.8k 票 · 开源第二·新模型跃升 |
| 12/390 | ◆Gemini 3.1 Pro PreviewGoogle美 | 1486 | 99.2k 票 · 票数最高 |
| 13/390 | ◆Gemini 3 ProGoogle美 | 1485 | 41.5k 票 |
| 14/390 | ◉GPT-5.6 Sol (xhigh)OpenAI美 | 1482 | 19.5k 票 |
| 15/390 | ◉GPT-5.5 (high)OpenAI美 | 1482 | 59.5k 票 · 大众主力 |
| 16/390 | 通Qwen3.8 Max阿里 Alibaba中 | 1481 | 10.0k 票 · 国产第三 |
从真实开源仓库取 500 个已人工验证的 issue,模型要读懂代码库、定位 bug、提交能通过测试的补丁。业界公认的「编程 Agent 能力」第一硬榜,几乎所有厂商发布时必刷。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/111 | ✳Claude Fable 5Anthropic美 | 95.0% | |
| 2/111 | ✳Claude Mythos PreviewAnthropic美 | 93.9% | |
| 3/111 | ✳Claude Opus 4.8Anthropic美 | 88.6% | |
| 4/111 | ✳Claude Opus 4.7Anthropic美 | 87.6% | |
| 5/111 | ✳Claude Sonnet 5Anthropic美 | 85.2% | |
| 6/111 | ✳Claude Opus 4.5Anthropic美 | 80.9% | |
| 7/111 | ✳Claude Opus 4.6Anthropic美 | 80.8% | |
| 8/111 | ◆Gemini 3.1 ProGoogle美 | 80.6% | |
| 8/111 | 深DeepSeek-V4-Pro-MaxDeepSeek中 | 80.6% | 开源 |
| 10/111 | MMiniMax M3MiniMax中 | 80.5% | 开源 |
| 11/111 | 通Qwen3.7 Max阿里 Alibaba中 | 80.4% | |
| 12/111 | KKimi K2.6月之暗面 Kimi中 | 80.2% | 开源 |
| 18/111 | 米MiMo-V2.5-Pro小米 Xiaomi中 | 78.9% | 开源 |
| 21/111 | 混Hy3腾讯 Tencent中 | 78.0% | 开源 |
| 24/111 | 智GLM-5智谱 Z.ai中 | 77.8% | 开源 |
| 30/111 | 豆Seed 2.0 Pro字节 ByteDance中 | 76.5% |
在真实终端里完成软件工程、系统管理、数据处理任务——模型要自己敲命令、读报错、迭代。2025 下半年崛起最快的 agentic 编程新战场,头部三家争 SOTA 的焦点。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/51 | ◉GPT-5.5OpenAI美 | 82.7% | |
| 2/51 | ✳Claude Mythos PreviewAnthropic美 | 82.0% | |
| 3/51 | ✳Claude Sonnet 5Anthropic美 | 80.4% | |
| 4/51 | ◉GPT-5.3 CodexOpenAI美 | 77.3% | |
| 5/51 | ◆Gemini 3.5 FlashGoogle美 | 76.2% | |
| 6/51 | ◉GPT-5.4OpenAI美 | 75.1% | |
| 7/51 | ✳Claude Opus 4.8Anthropic美 | 74.6% | |
| 8/51 | 通Qwen3.7-Plus阿里 Alibaba中 | 70.3% | |
| 9/51 | 通Qwen3.7 Max阿里 Alibaba中 | 69.7% | |
| 10/51 | ✳Claude Opus 4.7Anthropic美 | 69.4% | |
| 11/51 | 智GLM-5.1智谱 Z.ai中 | 69.0% | 开源 |
| 13/51 | 米MiMo-V2.5-Pro小米 Xiaomi中 | 68.4% | 开源 |
| 14/51 | 深DeepSeek-V4-Pro-MaxDeepSeek中 | 67.9% | 开源 |
| 15/51 | KKimi K2.6月之暗面 Kimi中 | 66.7% | 开源 |
| 26/51 | MMiniMax M2.7MiniMax中 | 57.0% | 开源 |
| 35/51 | 阶Step-3.5-Flash阶跃 StepFun中 | 51.0% | 开源 |
持续从 LeetCode / AtCoder / CodeForces 抓最新竞赛题,按发布日期滚动切窗——只考模型没见过的新题,从机制上防止「背题」污染。考的是纯算法编程能力。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/75 | 深DeepSeek-V4-Pro-MaxDeepSeek中 | 93.5% | 开源 |
| 2/75 | 深DeepSeek-V4-Flash-MaxDeepSeek中 | 91.6% | 开源 |
| 3/75 | 深DeepSeek-V4-Flash-0423DeepSeek中 | 88.4% | 开源 |
| 4/75 | ·Solar Pro 4Upstage | 87.8% | |
| 5/75 | 深DeepSeek-V3.2 (Thinking)DeepSeek中 | 83.3% | 开源 |
| 5/75 | 深DeepSeek-V3.2DeepSeek中 | 83.3% | 开源 |
| 7/75 | MMiniMax M2MiniMax中 | 83.0% | 开源 |
| 8/75 | 美LongCat-Flash-Thinking-2601美团 Meituan中 | 82.8% | 开源 |
| 9/75 | NNemotron 3 Super (120B A12B)NVIDIA美 | 81.2% | 开源 |
| 10/75 | ✕Grok-3 MinixAI美 | 80.4% | |
| 20/75 | 智GLM-4.5智谱 Z.ai中 | 72.9% | 开源 |
| 23/75 | 通Qwen3 235B A22B阿里 Alibaba中 | 70.7% | 开源 |
| 42/75 | KKimi K2-Instruct-0905月之暗面 Kimi中 | 53.7% | 开源 |
考模型通过 MCP(Model Context Protocol,Anthropic 提出的工具调用标准协议)调用外部工具、多步编排完成任务的能力。Agent 时代最贴近真实生产的工具调用榜。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/33 | MMuse Spark 1.1Meta美 | 88.1% | |
| 2/33 | KKimi K3月之暗面 Kimi中 | 84.2% | 开源 |
| 3/33 | 豆Seed 2.1 Pro字节 ByteDance中 | 83.8% | |
| 4/33 | ◆Gemini 3.5 FlashGoogle美 | 83.6% | |
| 5/33 | ✳Claude Opus 4.8Anthropic美 | 82.2% | |
| 6/33 | 豆Seed 2.1 Turbo字节 ByteDance中 | 80.3% | |
| 7/33 | ·Inkling-SmallThinking Machines Lab | 79.6% | 开源 |
| 8/33 | 混Hy3腾讯 Tencent中 | 79.1% | 开源 |
| 9/33 | ✳Claude Opus 4.7Anthropic美 | 77.3% | |
| 10/33 | 智GLM-5.2智谱 Z.ai中 | 76.8% | 开源 |
| 11/33 | 通Qwen3.7 Max阿里 Alibaba中 | 76.4% | |
| 15/33 | MMiniMax M3MiniMax中 | 74.2% | 开源 |
| 17/33 | 深DeepSeek-V4-Pro-MaxDeepSeek中 | 73.6% | 开源 |
OpenAI 出的浏览器智能体榜:模型要自己上网、多轮检索、交叉验证,回答需要深度联网调查才能查到的刁钻问题。考的是「搜索型 Agent」的信息获取与推理。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/62 | KKimi K3月之暗面 Kimi中 | 91.2% | 开源 |
| 2/62 | ✳Claude Opus 5Anthropic美 | 90.8% | |
| 3/62 | ◉GPT-5.6 SolOpenAI美 | 90.4% | |
| 4/62 | ◉GPT-5.5 ProOpenAI美 | 90.1% | |
| 5/62 | ◉GPT-5.6 TerraOpenAI美 | 87.5% | |
| 6/62 | ✳Claude Mythos PreviewAnthropic美 | 86.9% | |
| 7/62 | KKimi K2.6月之暗面 Kimi中 | 86.3% | 开源 |
| 8/62 | 豆Seed 2.1 Pro字节 ByteDance中 | 86.2% | |
| 9/62 | ◆Gemini 3.1 ProGoogle美 | 85.9% | |
| 10/62 | 豆Seed 2.1 Turbo字节 ByteDance中 | 84.9% | |
| 14/62 | 混Hy3腾讯 Tencent中 | 84.2% | 开源 |
| 16/62 | MMiniMax M3MiniMax中 | 83.5% | 开源 |
| 17/62 | 深DeepSeek-V4-Pro-MaxDeepSeek中 | 83.4% | 开源 |
| 20/62 | 智GLM-5.1智谱 Z.ai中 | 79.3% | 开源 |
| 30/62 | 阶Step-3.5-Flash阶跃 StepFun中 | 69.0% | 开源 |
| 30/62 | 通Qwen3.5-397B-A17B阿里 Alibaba中 | 69.0% | 开源 |
香港科大出的「工具全能赛」:跨多个真实应用、长链条地调用几十种工具完成复杂任务,比单步工具调用难得多。考 Agent 的长程规划与工具协同。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/37 | MMuse Spark 1.1Meta美 | 75.6% | |
| 2/37 | 深DeepSeek-V4-Pro-0813DeepSeek中 | 74.1% | 开源 |
| 3/37 | KKimi K3月之暗面 Kimi中 | 73.2% | 开源 |
| 4/37 | 智GLM-5.3智谱 Z.ai中 | 73.0% | 开源 |
| 5/37 | 通Qwen3.8 Max阿里 Alibaba中 | 72.5% | 开源 |
| 6/37 | 深DeepSeek-V4-Flash-0731DeepSeek中 | 70.3% | 开源 |
| 7/37 | ✳Claude Opus 4.8Anthropic美 | 59.9% | |
| 8/37 | ◉GPT-5.6 SolOpenAI美 | 58.0% | |
| 9/37 | ◆Gemini 3.5 FlashGoogle美 | 56.5% | |
| 10/37 | ◉GPT-5.5OpenAI美 | 55.6% | |
| 17/37 | 豆Seed 2.1 Pro字节 ByteDance中 | 50.6% | |
| 22/37 | 混Hy3腾讯 Tencent中 | 48.5% | 开源 |
| 25/37 | MMiniMax M2.7MiniMax中 | 46.3% | 开源 |
生物/物理/化学的博士级难题,博士专家也只能答对 65%、能联网的非专家仅 34%——从设计上就杜绝「搜得到」。海外六家发布时 100% 引用的智力硬指标。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/239 | ✳Claude Mythos PreviewAnthropic美 | 94.6% | |
| 1/239 | ◉GPT-5.6 SolOpenAI美 | 94.6% | |
| 3/239 | ◆Gemini 3.1 ProGoogle美 | 94.3% | |
| 4/239 | ✳Claude Opus 4.7Anthropic美 | 94.2% | |
| 5/239 | ✳Claude Opus 4.8Anthropic美 | 93.6% | |
| 5/239 | ◉GPT-5.5OpenAI美 | 93.6% | |
| 7/239 | KKimi K3月之暗面 Kimi中 | 93.5% | 开源 |
| 8/239 | ◉GPT-5.2 ProOpenAI美 | 93.2% | |
| 9/239 | ✕Grok 4.5xAI美 | 93.0% | |
| 10/239 | ◉GPT-5.6 TerraOpenAI美 | 92.9% | |
| 12/239 | 通Qwen3.8 Max阿里 Alibaba中 | 92.6% | 开源 |
| 18/239 | 智GLM-5.2智谱 Z.ai中 | 91.2% | 开源 |
| 20/239 | 混Hy3腾讯 Tencent中 | 90.4% | 开源 |
| 24/239 | 深DeepSeek-V4-Pro-MaxDeepSeek中 | 90.1% | 开源 |
| 30/239 | 豆Seed 2.0 Pro字节 ByteDance中 | 88.9% | |
| 58/239 | 度ERNIE 5.0百度 Baidu中 | 85.0% |
2500 道数学/科学/人文领域专家把关的顶尖难题,号称「人类知识最后一道闭卷考」,并保留私有 holdout 题集防刷分。当前最抗污染的知识天花板榜。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/99 | ✳Claude Opus 5Anthropic美 | 64.7% | |
| 1/99 | ✳Claude Mythos PreviewAnthropic美 | 64.7% | |
| 3/99 | ✳Claude Fable 5Anthropic美 | 64.5% | |
| 4/99 | 智GLM-5.3智谱 Z.ai中 | 62.5% | 开源 |
| 5/99 | MMuse Spark 1.1Meta美 | 62.1% | |
| 6/99 | 深DeepSeek-V4-Pro-0813DeepSeek中 | 60.0% | 开源 |
| 7/99 | MMuse SparkMeta美 | 58.4% | |
| 8/99 | ✳Claude Opus 4.8Anthropic美 | 57.9% | |
| 9/99 | ✳Claude Sonnet 5Anthropic美 | 57.4% | |
| 10/99 | ◉GPT-5.5 ProOpenAI美 | 57.2% | |
| 11/99 | KKimi K3月之暗面 Kimi中 | 56.0% | 开源 |
| 12/99 | 豆Seed 2.1 Pro字节 ByteDance中 | 55.7% | |
| 24/99 | 通Qwen3.5-27B阿里 Alibaba中 | 48.5% | 开源 |
| 39/99 | 度ERNIE 5.0百度 Baidu中 | 39.0% | |
| 45/99 | 米MiMo-V2.5-Pro小米 Xiaomi中 | 34.0% | 开源 |
| 53/99 | 美LongCat-Flash-Thinking-2601美团 Meituan中 | 25.2% | 开源 |
哈佛-MIT 数学锦标赛真题,奥赛级难度。相比已被刷爆到多家并列满分的 AIME,HMMT 仍有区分度,是当前数学推理最能拉开差距的榜。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/33 | ◉GPT-5.2 ProOpenAI美 | 100.0% | |
| 2/33 | ◉GPT-5.2OpenAI美 | 99.4% | |
| 3/33 | 深DeepSeek-V3.2-SpecialeDeepSeek中 | 99.2% | 开源 |
| 4/33 | KKimi K2-Thinking-0905月之暗面 Kimi中 | 97.5% | 开源 |
| 5/33 | 通Qwen3.6 Plus阿里 Alibaba中 | 96.7% | |
| 6/33 | KKimi K2.5月之暗面 Kimi中 | 95.4% | 开源 |
| 7/33 | 通Qwen3.5-397B-A17B阿里 Alibaba中 | 94.8% | 开源 |
| 8/33 | NNemotron 3 Super (120B A12B)NVIDIA美 | 94.7% | 开源 |
| 9/33 | 智GLM-5.2智谱 Z.ai中 | 94.4% | 开源 |
| 10/33 | 智GLM-5.1智谱 Z.ai中 | 94.0% | 开源 |
| 22/33 | 米MiMo-V2-Flash小米 Xiaomi中 | 84.4% | 开源 |
增强版 MMMU:30 个学科的大学级图文混合题,堵死了「不看图靠蒙」的捷径。考多模态大模型真正的看图理解与跨学科推理,是多模态第一综合榜。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/68 | ◆Gemini 3.5 FlashGoogle美 | 83.6% | |
| 2/68 | ◉GPT-5.5OpenAI美 | 83.2% | |
| 3/68 | ◉GPT-5.6 SolOpenAI美 | 83.0% | |
| 4/68 | 豆Seed 2.1 Pro字节 ByteDance中 | 82.7% | |
| 5/68 | 通Qwen3.8 Max阿里 Alibaba中 | 82.3% | 开源 |
| 6/68 | 豆Seed 2.1 Turbo字节 ByteDance中 | 82.2% | |
| 7/68 | KKimi K3月之暗面 Kimi中 | 81.6% | 开源 |
| 8/68 | ◉GPT-5.4OpenAI美 | 81.2% | |
| 8/68 | ◆Gemini 3 FlashGoogle美 | 81.2% | |
| 10/68 | ◆Gemini 3 ProGoogle美 | 81.0% | |
| 21/68 | MMiniMax M3MiniMax中 | 78.1% | 开源 |
| 22/68 | 米MiMo-V2.5小米 Xiaomi中 | 77.9% | 开源 |
取自 arXiv 论文的真实科学图表,问需要读懂坐标轴、趋势、数据关系才能答的推理题。考的是模型对复杂图表的深度理解——投研看图场景高度相关。
| # | 模型 | 分数 | 备注 |
|---|---|---|---|
| 1/51 | ✳Claude Mythos PreviewAnthropic美 | 93.2% | |
| 2/51 | KKimi K3月之暗面 Kimi中 | 91.3% | 开源 |
| 3/51 | ✳Claude Opus 4.7Anthropic美 | 91.0% | |
| 4/51 | 通Qwen3.8-27B阿里 Alibaba中 | 90.2% | 开源 |
| 5/51 | ✳Claude Opus 4.8Anthropic美 | 89.9% | |
| 6/51 | ◆Gemini 3.6 FlashGoogle美 | 89.4% | |
| 7/51 | ◆Gemini 3.7 FlashGoogle美 | 88.7% | |
| 8/51 | MMuse Spark 1.1Meta美 | 88.4% | |
| 9/51 | ✳Claude Sonnet 5Anthropic美 | 88.3% | |
| 10/51 | KKimi K2.6月之暗面 Kimi中 | 86.7% | 开源 |
| 11/51 | 豆Seed 2.1 Pro字节 ByteDance中 | 86.4% | |
| 21/51 | 米MiMo-V2.5小米 Xiaomi中 | 81.0% | 开源 |
文生视频:真人对同一提示词生成的两段视频盲选,按 Bradley-Terry 算 Elo。考画面质量、运动合理性、指令还原度。国产厂商(字节/快手/阿里)在此领跑全球。
| # | 模型 | Elo | 票数 · 发布 · 定价 |
|---|---|---|---|
| 1/24 | 通Wan 3.0阿里 Alibaba中 | 1244 | 5679 票 · Aug 2026 · Coming soon |
| 2/24 | ◆Gemini Omni FlashGoogle美 | 1238 | 16181 票 · May 2026 · $6.00 /min |
| 4/24 | 豆Dreamina Seedance 2.0 720p字节 ByteDance中 | 1221 | 22864 票 · Mar 2026 · $9.07 /min |
| 5/24 | 通Wan2.7-260612阿里 Alibaba中 | 1156 | 17231 票 · Jun 2026 · $9.00 /min |
| 6/24 | 通HappyHorse-1.1阿里 Alibaba中 | 1145 | 17334 票 · Jun 2026 · $9.90 /min |
| 7/24 | 通HappyHorse-1.0阿里 Alibaba中 | 1121 | 9311 票 · Apr 2026 · $13.20 /min |
| 8/24 | 通Wan 2.7阿里 Alibaba中 | 1107 | 5749 票 · Apr 2026 · $9.00 /min |
| 9/24 | 可Kling 3.0 1080p (Pro)快手 Kling中 | 1106 | 20666 票 · Feb 2026 · $20.16 /min |
| 10/24 | 昆SkyReels V4昆仑万维 Skywork中 | 1101 | 6231 票 · Mar 2026 · $21.00 /min |
| 11/24 | 可Kling 3.0 720p (Standard)快手 Kling中 | 1098 | 19830 票 · Feb 2026 · $15.12 /min |
| 12/24 | ◆Veo 3.1 LiteGoogle美 | 1090 | 8609 票 · Mar 2026 · $4.80 /min |
| 13/24 | ◆Veo 3.1Google美 | 1089 | 9165 票 · Jan 2026 · $24.00 /min |
| 17/24 | VVidu Q3 Pro生数 Vidu中 | 1075 | 18521 票 · Jan 2026 · $9.60 /min |
| 18/24 | PPixVerse V6爱诗 PixVerse中 | 1072 | 10361 票 · Mar 2026 · $6.90 /min |
图生视频:真人对同一提示词生成的两段视频盲选,按 Bradley-Terry 算 Elo。考画面质量、运动合理性、指令还原度。国产厂商(字节/快手/阿里)在此领跑全球。
| # | 模型 | Elo | 票数 · 发布 · 定价 |
|---|---|---|---|
| 1/23 | 豆Dreamina Seedance 2.0 720p字节 ByteDance中 | 1191 | 14990 票 · Mar 2026 · $9.07 /min |
| 3/23 | ◆Gemini Omni FlashGoogle美 | 1182 | 9625 票 · May 2026 · $6.00 /min |
| 4/23 | ✕grok-imagine-video-1.5xAI美 | 1111 | 5832 票 · May 2026 · $8.40 /min |
| 5/23 | 通HappyHorse-1.1阿里 Alibaba中 | 1106 | 10942 票 · Jun 2026 · $9.90 /min |
| 7/23 | 通Wan 2.7阿里 Alibaba中 | 1085 | 5113 票 · Apr 2026 · $9.00 /min |
| 8/23 | 昆SkyReels V4昆仑万维 Skywork中 | 1084 | 5359 票 · Mar 2026 · $21.00 /min |
| 9/23 | 通HappyHorse-1.0阿里 Alibaba中 | 1084 | 8343 票 · Apr 2026 · $13.20 /min |
| 10/23 | ◆Veo 3.1Google美 | 1084 | 8426 票 · Jan 2026 · $24.00 /min |
| 11/23 | ✕grok-imagine-videoxAI美 | 1076 | 15180 票 · Jan 2026 · $4.20 /min |
| 12/23 | ◆Veo 3.1 FastGoogle美 | 1073 | 14146 票 · Jan 2026 · $9.00 /min |
| 13/23 | 可Kling 3.0 1080p (Pro)快手 Kling中 | 1072 | 14761 票 · Feb 2026 · $20.16 /min |
| 14/23 | ◆Veo 3.1 LiteGoogle美 | 1067 | 7727 票 · Mar 2026 · $4.80 /min |
| 16/23 | PPixVerse V6爱诗 PixVerse中 | 1065 | 9732 票 · Mar 2026 · $6.90 /min |
| 17/23 | VVidu Q3 Pro生数 Vidu中 | 1060 | 15066 票 · Jan 2026 · $9.60 /min |
具身智能领域唯一「真机实测 + 覆盖商业玩家 + 中美同台」的公开榜,由 Dexmal 原力灵机联合 Hugging Face 发起。VLA(视觉-语言-动作)模型要在真实机械臂上完成 30 项桌面操作,按成功率排名。上榜以国产队伍为主,近期引发刷榜争议,本身即投研信号。
| # | 模型 | 成功率 | 综合分 / 说明 |
|---|---|---|---|
| 1/5 | 星Era0星动纪元 Robotera中 | 64.33% | 综合分 76.34 · 真机第一 |
| 2/5 | 力DM0Dexmal 原力灵机中 | 62.00% | 综合分 72.25 · 榜方自研 |
| 3/5 | GGigaBrain-0.1GigaBrain中 | 51.67% | 综合分 68.34 |
| 4/5 | 寻Spirit-v1.5千寻智能 Spirit中 | 51.00% | 综合分 67.19 · 商业化 VLA |
| 5/5 | ALira (generalist)Atlas 具身中 | 45.00% | 综合分 59.83 |