ツール一覧に戻る

2026-CSAT

2026-CSAT は、韓国CSATでのLLMパフォーマンスを追跡するオープンソースのベンチマークで、モデルごとのスコア・正答率・コスト分析を可視化します。

ツールカテゴリ
開発者ツールモデル
ツールリンク

ツール概要

GitHub で 124 スターと 3 フォークを獲得し、一定の注目を集めていますが、証拠はリポジトリの自己説明とスター数に限られ、第三者による実測やチュートリアル、詳細な分析は存在しません。コミュニティの議論は話題性に偏っており、有用性の証明は不十分です。 このプロジェクトの主な役割は、韓国の実際の大学入試問題に基づく標準化された評価セットを提供し、国語・数学全科目・英語・韓国史および複数の探究科目にわたってLLMの学力をダッシュボードで比較できるようにすることです。付属のコスト分析はモデル選定の参考になります。 導入のハードルとコスト:プロジェクト自体はオープンソースで無料ですが、評価の実行には各LLM API を呼び出す必要があり、コストはプロバイダーの公式価格に依存します。ダッシュボードの「コスト分析」はコミュニティによる参考値であり、安定的な価格保証ではありません。技術的な難易度は中程度で、Python 環境と API 連携の知識が求められます。 このベンチマークは、韓国語LLMの性能を研究したい研究者や韓国の教育テクノロジー開発者に適しています。一方、MMLU のような汎用マルチリンガルベンチマークを求めるチームには不向きで、AI 教材として誤解されるべきではありません。本プロジェクトは「韓国CSAT版LLMリーダーボード」と捉えるのが正確で、総合的なモデル評価フレームワークとは一線を画します。

関連ソーシャルコンテンツ