Agent skill · davila7

evaluating-llms-harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, repor

Reference it in any coding agent with:

@skills davila7/evaluating-llms-harness

Browse the @skills marketplace