Agent skill · shipshitdev

advanced-evaluation

Design and operate LLM-as-a-Judge evaluation systems using direct scoring, pairwise comparison, rubric calibration, evaluator bias mitigation, confidence s

Reference it in any coding agent with:

@skills shipshitdev/advanced-evaluation

Browse the @skills marketplace