Agent skill · zechenzhangagi

evaluating-llms-harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, repor

Reference it in any coding agent with:

@skills zechenzhangagi/evaluating-llms-harness

Browse the @skills marketplace