返回工具列表
AgentEval
面向 MAF 的 .NET AI 代理评估工具包,通过工具使用验证、RAG 指标和模型对比,为 .NET 开发者输出可验证的代理评分。
工具简介
基于 GitHub 仓库仅 124 星和一条个人开发者推文,AgentEval 目前仍处于早期实验阶段,尚无社区广泛采用或深度验证,不宜将其视为成熟的评估基础设施。 它相当于 Python 生态中 RAGAS、DeepEval 在 .NET 世界的对应物,专为 Microsoft Agent Framework 和 Microsoft.Extensions.AI 设计,可在构建代理时自动检查工具调用是否正确、评估检索增强生成质量、执行随机化评估以及比较不同模型的表现。在推文中展示的商业代理场景中,它能连接 OpenClaw 代理并针对真实购物任务返回一个可验证的分数。 成本和定价信息未在代码仓库或社媒中明确。从项目性质推测,AgentEval 本身应是开源且免费使用的,但部署和运行需依赖 .NET 环境与 MAF,对非 .NET 技术栈的团队存在天然门槛。适合使用 MAF 构建代理、需要快速建立内部评估流水线的 .NET 开发者;不适合 Python 技术栈或要求评估多模态、长周期代理行为的团队。 目前仅有的社媒证据是一条来自项目作者的宣传推文,共获得 20 个赞和约 1857 次查看,无用户评测、教程或冲突性讨论。讨论质量极低,缺少“好用证明”所需的多角度实测与第三方长期经验,所有结论必须保守看待。