Agent skill · davila7
evaluating-llms-harness
Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, repor
Reference it in any coding agent with:
@skills davila7/evaluating-llms-harness