A reproducible local LLM benchmarking platform with versioned datasets, deterministic scoring, and a
A reproducible local LLM benchmarking platform with versioned datasets, deterministic scoring, and auditable reports.
有部分测试的设计存在缺陷
结构化输出的判断是不是有问题?
使用过程中遇到的一些问题
评测时候工具cli都是0
部分题目判定是不是不太对
暂无评论,来聊聊你的看法吧