返回工具列表
2026-CSAT
2026-CSAT 是一个开源的韩语 LLM 评测基准,集中展示各模型在韩国高考 CSAT 中的得分、正确率和成本分析。
工具简介
该项目在 GitHub 获得 124 颗星和 3 个 fork,反映出一定程度的社区关注,但证据主要来自仓库自身的说明与星标,缺少第三方实测报告、教程或深度长文,讨论质量以热度转发为主,尚未形成充分的好用证明。 项目核心作用是提供一个基于真实国家考试题、覆盖国语、数学全科目、英语、韩国史及多个探究科目的标准化评测数据集与仪表盘。研究人员可据此快速横向对比不同 LLM 在韩语学科能力上的表现,并结合仪表盘内的成本分析辅助模型选型。 门槛与成本:项目代码本身开源免费,但实际运行评测需要自行调用模型 API,成本取决于所选模型的官方定价;仪表盘中的“成本分析”是作者整理的参考值,并非厂商定价承诺,实际费用可能随 API 调整而波动。技术门槛中等,需要 Python 环境和基本的 API 集成能力。 适合研究韩语 LLM 性能的研究者、韩国教育技术开发者,以及希望了解 LLM 在东亚语言高考中表现的评测团队。不适合需要通用多语言基准(如 MMLU)或英语为主场景的团队,也不能作为 AI 辅导工具直接用于教学。该项目更准确的类比是“韩语高考大模型排行榜”,而非通用的模型能力评测框架。