返回工具列表

MirrorCode

MirrorCode 是面向 AI Agent 研究者与评测团队的长时程软件工程基准,要求模型在无源码、无网络的沙箱中重建软件并以测试通过率产出可比较的排行榜结果。

工具分类
开发者工具

工具简介

采用判断:建议将 MirrorCode 视为高关注、但仍需谨慎解读的长时程 AI 软件工程评测基准,而不是可以直接采购使用的开发产品。现有材料足以说明它的评测设计有价值,但不足以证明排行榜分数等同于真实生产力,或代表模型在所有工程场景中都稳定可靠。

实际作用:MirrorCode 把目标软件当作黑盒,限制 AI Agent 访问原始源码和互联网,只允许其观察程序行为、执行环境与测试反馈,再从零重建软件;最终需要通过可见及隐藏测试,形成可横向比较的 solve rate。Epoch AI Research 与项目作者的 X 帖说明了沙箱、防作弊和长时间自主编码的设计。材料中的榜单显示 Claude Fable 5 成功率为 64%,GPT-5.6 Sol 为 20%;这些是特定评测结果,不应直接外推为通用编程能力。

门槛与成本:它不是开箱即用的代码工具,使用者需要理解基准规则,准备模型调用、隔离沙箱、测试和结果记录流程。证据没有给出官方订阅费、API 价格或稳定的单次运行成本。知乎文章称某次 Claude Opus 4.7 重建 gotree 用时 14 小时、花费 251 美元,这属于社区演示,可能随模型、任务和重试次数变化,不能当作官方报价;其余成本只能保守推断为需要较多推理与计算资源。

适合研究 AI Agent、比较模型长程软件工程能力、设计评测流程的团队;不适合想直接获得代码补全、项目脚手架、部署托管或日常 IDE 辅助的开发者。它不是代码编辑器、通用编程助手、API 服务或生产软件,更准确的类比是受控的黑盒软件重建评测框架加排行榜。社媒热度很高:排名材料报告 17 条社媒提及、15 条 X 证据和约 59.7 万次浏览,但热度主要来自官方公告、榜单转发和短评;给出的 10 条材料中,实测长文仅少量,未见教程型复现,X 与知乎评论也很少,且有人质疑“3 倍优势”及 solve threshold 的统计口径,因此讨论质量有限并存在测量争议。

社媒关联内容

暂无关联内容

这个工具还没有可展示的社媒关联内容。

MirrorCode 是什么?开源项目简介、社媒讨论与使用场景 | Tuleo