ツール一覧に戻る

CMMLU

CMMLU は、67 科目から成り、中国語と中国文化に特化した大規模言語モデルの総合評価ベンチマークで、中国語の知識と推論能力を測定するのに役立ちます。

ツールカテゴリ
開発者ツール教育
ツールリンク

ツール概要

中国語環境における大規模言語モデルの言語習得と知識保持を深く評価する必要がある研究チームにとって、CMMLU は参考となるベンチマークです。しかし、コミュニティでの実践的なテストケースが乏しいため、その包括性と有効性は今後さらに検証される必要があり、他の評価スイートと併用することを推奨します。

CMMLU は、中国語と中国文化に特化した総合的な LLM 評価ベンチマークで、67 科目 11,528 問の多肢選択問題からなります。人文科学、社会科学、STEM、中国固有の文化領域をカバーし、問題は訓練データ漏洩のリスクを減らすために非公開の教育資料から収集されました。これにより、研究者は中国語文脈での知識想起、理解、推論を客観的に測定し、ローカライズ知識の不足を発見できます。

データセットはオープンかつ無料で、GitHub からダウンロードして使用できます。使用のハードルは、ゼロショット/ファイショット推論や評価指標の計算といった基礎的な NLP 評価知識の有無です。大学の研究室、AI 開発チーム、モデル評価機関に適しており、一般ユーザーやプラグ&プレイの対話サービスを期待する開発者は誤解しやすいですが、実際にはテスト問題とスコアリングスクリプトの集合です。データセット構築時のアノテーションコストは約 1.25 万人民元(知乎の記事による時給 50 元、総作業時間 250 時間に基づく推定)ですが、ユーザーには関係ありません。

CMMLU に関するソーシャルメディアでの議論は非常に限られており、8 票の知乎紹介記事が 1 件あるのみでコメントはなく、ツールディレクトリサイトでも簡単な言及があるだけです。詳細な実践分析や長文の検証は存在しません。つまり、このベンチマークには十分な「有用性の証明」が蓄積しておらず、コミュニティでも比較評価の合意が形成されていません。「人気の証明」も同様に弱い状況です。そのため、CMMLU は中国語 LLM 評価分野において初期の認知段階にあり、信頼性を高めるにはより多くの組織による公開結果の積み重ねが必要です。

関連ソーシャルコンテンツ