项目详情
LM Evaluation Harness
开源模型评测基准框架。
打开 GitHub 原始仓库 ↗适合什么时候使用
要标准化评测基座模型能力
不适合什么时候使用
只评业务 RAG 流水线(看 ragas)
筛选信息
- 领域
- 人工智能与智能体
- 语言
- Python
- 许可证
- 未标注
- 状态
- active
- 核验
- unverified
相关、替代与配套项目
- alternative_toDeepEval
项目详情
开源模型评测基准框架。
打开 GitHub 原始仓库 ↗要标准化评测基座模型能力
只评业务 RAG 流水线(看 ragas)