Agent skill · zechenzhangagi
evaluating-llms-harness
Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, repor
Reference it in any coding agent with:
@skills zechenzhangagi/evaluating-llms-harness