返回工具列表
C-Eval
一个包含1.4万道选择题、覆盖52个学科的中文大模型评测基准,帮助研究者定量对比模型的中文知识水平。
工具简介
采用判断:C-Eval 是一个权威但并非全能的中文模型评测套件,常被用于炒作“超越 GPT-4”,但其评估范围仅限于选择题式的学科知识。实际作用:它通过13,948道多学科多选题,提供52个领域的细项得分,帮助开发者发现模型在文史、理工等科类的薄弱点,指导继续预训练和指令微调,同时作为社区公认的基准用于论文对比。门槛与成本:数据集与评估脚本完全开源(GitHub: SJTU-LIT/ceval),下载零费用,只需具备 Python 基础的运行能力;对于大规模模型评测,推理所需的 GPU 成本不可忽视,保守推断一次全量评估可能需要数百至上千元云 GPU 费用。适合人群:适合有自研模型的语言模型团队、高校研究者和追求透明对标的企业研发部门;不适合直接根据总分排名筛选商业模型的非技术决策者,也不适合用于测试模型安全性、多轮对话或代码能力。社媒共识与讨论质量:C-Eval 在2023年因 ChatGLM2 声称超越 GPT-4 而在社交平台爆红(X 帖单条53万浏览,知乎多篇相关文章获上百赞同),但社区同时展开了对评测严谨性的审视,如指出用 GPT-4 生成答案并蒸馏会虚增分数、质疑不同参数量模型不公平比较等,这些讨论提升了透明度。证据源共10条,以知乎媒体文章和排行榜解读为主,兼有实测部署指南和技术批评,整体热度大于深度,但参考价值仍较高。C-Eval 并非模型服务或产品,而是学术基准,任何排名均需上下文解读,不应误解为某一模型全面领先。