← Projects / AI 质量门禁

EvalForge

把零散的模型评测结果,变成能进入 CI、可以复查的发布依据。

Stack
Python · MIT
Status
持续维护
Case record

问题

AI 系统上线前往往做了不少测试,但结果散落在脚本和日志里,团队很难回答“这次改动到底能不能发”。

判断

不再造一套封闭指标,而是把任意评测分数接入统一门禁:与阈值或历史基线比较,再输出 CI 能读懂、开发者能追溯的报告。

实现

  • 支持阈值判断与 baseline 回归比较。
  • 输出 JSON、JUnit XML 与 SARIF,接入不同 CI 工作流。
  • 提供无需模型密钥的 RAG 参考评测器,便于本地复现。
Evidence / 可验证记录
Tests
39 passed
Coverage
87.68%
GitHub
40+ stars
Reports
JSON / JUnit / SARIF

测试、覆盖率与公开仓库共同构成这项工作的可验证记录。

想看实现细节、安装方式和最新进展?