ツール一覧に戻る

Open LLM リーダーボード

開発者や研究者がオープンソース LLM のベンチマークスコアを素早く比較できる公開リーダーボード。

ツールカテゴリ
開発者ツールモデル
ツールリンク

ツール概要

採用判断:Open LLM Leaderboard は英語ベンチマークでの初期スクリーニングに有用だが、唯一の選定基準とすべきではない。

実際の機能:lm-evaluation-harness を基に、MMLU、HellaSwag、ARC など 6 つの主要ベンチマークを自動実行し、モデルのスコアとランキングを表示する。

コスト・敷居:完全無料で登録不要。Hugging Face ページから直接閲覧可能。コミュニティにより維持・更新される。

適性と議論の質:AI 開発者や技術選定者がモデルの進歩を追跡するのに適するが、中国語の性能や実際の業務指標の評価には不向き(英語重心で、ランキング操作の可能性もある)。証拠となる知乎の議論は、国産モデルの優位性を示す引用(人気の証明)が多く、一部は v2 の仕組みや実測分析(有用性の証明)だが、全体的には中程度の質。

モデル評価フレームワークやサービスプラットフォームではなく、AI モデルの性能天気図に近い。

関連ソーシャルコンテンツ