开源大梳理
← 人工智能与智能体

项目详情

LM Evaluation Harness

开源模型评测基准框架。

打开 GitHub 原始仓库 ↗

适合什么时候使用

要标准化评测基座模型能力

不适合什么时候使用

只评业务 RAG 流水线(看 ragas)

筛选信息

领域
人工智能与智能体
语言
Python
许可证
未标注
状态
active
核验
unverified
eval

相关、替代与配套项目