返回工具列表

Open LLM 排行榜

开源大模型的公开评测榜单,帮助开发者与研究者快速对比模型基准分数。

工具分类
开发者工具模型
工具链接

工具简介

采用判断:Open LLM Leaderboard 适合初筛开源模型在英文基准上的性能表现,但不建议作为选型的唯一依据。

实际作用:榜单基于 lm-evaluation-harness 自动运行 6 项主流基准(MMLU、HellaSwag、ARC 等),展示各开源模型的得分与排名,方便横向对比。

门槛与成本:完全免费,无需注册或 API 密钥,直接在 Hugging Face 页面查看。榜单由社区维护,定期更新。

适合人群与讨论质量:适合 AI 研发人员、技术选型者追踪模型进展;不适合主要评测中文或业务指标的用户,因为基准侧重英文且可能存在刷榜。从现有证据看,知乎上大部分讨论用它论证国产模型领先(热度证明),少数文章解析了 v2 机制或实测模型(好用证明),整体讨论质量中等。

它不是模型评测框架,也不是模型服务平台,更像是 AI 模型性能天梯图。

社媒关联内容

Open LLM 排行榜 是什么?工具简介、社媒讨论与使用场景 | Tuleo